跳到正文

全部动态

今日 0 条
9月29日周二
  1. Hugging Face Blog36

    ProvenanceGuard:面向 MCP 智能体的来源感知事实性验证

    Hugging Face 发布论文 ProvenanceGuard,一种面向 MCP 智能体的生成后验证层,可区分"事实有据"与"来源归属正确",专门检测把某来源的事实错误归到另一来源的跨来源混淆。在 281 条医疗智能体真实 trace 上,专家判定应拦截的 139 条声明中它拦下 138 条,来源识别准确率约 86%,并在与四种支持性检查器的对比中取得最高分。

9月25日周五
9月24日周四
  1. Microsoft Research62

    微软研究:将物理 AI 推理卸载到边缘或云端可提升机器人性能与续航

    微软研究院对移动机器人操作负载的系统性测量显示,把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 可提升任务表现并延长续航。

    推荐理由:微软对机器人推理负载的系统性测量显示,把推理从机载 GPU 卸载到边缘或云端可提升任务成功率与续航,并给出可复用的 Kubernetes 工具链。

9月23日周三
9月21日周一
9月19日周六
9月18日周五
9月16日周三
9月11日周五
9月7日周一
9月4日周五
  1. Google Research66

    Google 与 HHMI Janelia 等发布完整雄性果蝇脑图谱

    Google 与 HHMI Janelia、剑桥大学等合作在 Cell 发表论文,发布完整雄性果蝇大脑与中枢神经系统连接组图谱,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计算最大的脑图谱。

    推荐理由:Google 与 HHMI Janelia 等合作发布迄今神经元数量最多的脑图谱,读者可了解 AI 在连接组学中的具体作用。

9月2日周三
8月26日周三
8月25日周二
8月24日周一
  1. Import AI22

    Import AI 470:机器不应享有权利;用 SPADE 自动生成环境;用 Hawkeye 构建更好的 GPU kernel

    Import AI 470 关注三项研究:METR 分析显示 AI 对网络安全漏洞发现加速最明显,对数学研究贡献较小,对 AI 研究本身尚无显著加速。SPADE 通过自博弈让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上游戏环境套件均分达 58.3,较基线提升 8.1。Hawkeye 则用于构建更好的 GPU kernel。

8月21日周五
8月19日周三
8月17日周一
8月13日周四
  1. Microsoft Research42

    MindTopo:微软研究院推出评估多模态模型拓扑推理能力的新基准

    微软研究院推出 MindTopo 基准,用于评估多模态大语言模型在连通性、封闭、顺序、分离和绳结五类拓扑关系上的推理与规划能力。测试显示,当前模型在静态图像识别上表现明显优于交互式规划任务,失败多发生在规划阶段而非感知阶段,图像与视频生成工具也难以在动作序列中稳定保持拓扑关系。

8月12日周三
8月11日周二
8月10日周一
7月29日周三
7月26日周日
  1. Berkeley AI Research36

    Berkeley AI Research 提出 ABBEL:用信念状态监督 LLM 长程交互中的摘要更新

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要以自然语言"信念状态"形式隔离并监督其信息内容,通过受自编码器启发的信念评分(belief grading)奖励能重建最新观测的信念。在协作编程基准 CollabBench 上,ABBEL-rec-BG 将全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 数也低于全上下文设置。

7月23日周四
  1. Google Research62

    Google Research 发布 SymptomAI 论文:万人规模研究评估对话式症状评估智能体

    Google Research 发布论文 SymptomAI,介绍一项 n=13,917 的随机全美研究,参与者向五种不同问诊策略的 Gemini Flash 2.0 SymptomAI 智能体描述症状并获得鉴别诊断(DDx)。

    推荐理由:研究给出了万人规模真实问诊对照与可穿戴数据交叉验证方法,可参考其评估设计思路。

  2. Google Research74

    Google Research 在 Nature 发表强化学习控制量子纠错研究

    Google Research 与 Google DeepMind 合作在 Nature 发表论文,提出用强化学习智能体从量子纠错检测事件中学习,在计算过程中持续调控数千个控制参数以对抗硬件漂移。

    推荐理由:原文给出了强化学习在 Willow 上的具体增益数字和扩展性结论,可据此评估该范式对量子纠错实用化的意义。

7月16日周四
7月15日周三
7月9日周四
  1. Google Research62

    Google Research 发布 SensorFM 可穿戴健康数据基础模型

    Google Research 发布大型传感器基础模型 SensorFM,用 500 万名同意参与者、超过 1 万亿分钟的多模态传感器信号做自监督预训练,学习可迁移到心血管、代谢、睡眠和心理健康的通用生理表征。

    推荐理由:原文给出了预训练规模与下游任务收益的对应关系,读者可据此判断通用表征在可穿戴健康场景的迁移空间。

7月8日周三
7月1日周三
6月30日周二
6月25日周四
6月13日周六
  1. Google Research54

    Google Research 发布AI辅助皮肤状况理解研究

    Google Research 分享了关于消费者如何用AI理解皮肤问题的两项研究。其中发表于 JAMA Dermatology 的大规模调查纳入 2,345 名参与者,使用AI工具时参与者尝试命名病症的比例超过 62%(对照组为 41%),命名准确率达 23%,约为对照组 8% 的三倍;但下一步就医决策的准确率在标准AI组未见统计显著提升。