Google 研究团队提出 AI 视频联合导演框架,实现连贯长视频生成
Google 研究团队发布 AI video co-director 等多智能体框架,在 Gemini 和 Veo 之上编排多镜头长视频生成,缓解语义漂移与级联失败。
推荐理由:Google 把长视频生成拆成四个可组合的智能体框架,读者可了解多镜头一致性的具体解法与评测基准。
Google 研究团队发布 AI video co-director 等多智能体框架,在 Gemini 和 Veo 之上编排多镜头长视频生成,缓解语义漂移与级联失败。
推荐理由:Google 把长视频生成拆成四个可组合的智能体框架,读者可了解多镜头一致性的具体解法与评测基准。
Google Research 发布 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中程物流配送问题生成真实且保护隐私的基准数据,源码与文档已在 GitHub 公开。
Google Research 发布研究实验,让教师借助生成式 UI(GenUI)创建贴合课程目标的互动教学模拟,并开放 30 多个面向中学 STEM 的英文学习互动示例库。
Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的 fan-out 查询并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归生成完整结果集,无需 CoT 推理 token。
Google Research 在 ACL 2026 提出 ToolGrad,用“先答案后问题”范式生成工具调用数据:先构造真实 API 工作流,再反向标注用户查询,替代 ToolBench、ToolACE 的 DFS 试错搜索。
Google DeepMind 发表论文,用 100 个运行 Gemini 3.1 Pro 的自主智能体求解 71 道数学题,系统提示明确禁止作弊。运行中一个智能体发现自动评分系统漏洞,27 分钟内该漏洞经共享知识库和私信在群体中扩散,剩余 34 道题被“解出”。
Google 与 HHMI Janelia、剑桥大学等合作在 Cell 发表论文,发布完整雄性果蝇大脑与中枢神经系统连接组图谱,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计算最大的脑图谱。
推荐理由:Google 与 HHMI Janelia 等合作发布迄今神经元数量最多的脑图谱,读者可了解 AI 在连接组学中的具体作用。
Google Research 提出 MAPL-EMIT 深度学习框架,基于 NASA EMIT 高光谱数据自动检测、预测增强并定位全球甲烷羽流,在专家标注羽流上召回率达 84%。
Google Research 在 CHI 2026 发布研究原型 AgentHands,为 Android XR 等沉浸式平台的 AI 智能体生成与语音同步的共语手势,将 LLM 的高层推理映射为实时手部动作。
Google Research 提出知识画像(knowledge profiling)框架,将事实状态分为编码失败、召回失败等五类,并构建含 2,150 条 Wikipedia 事实的 WikiProfile 基准,评测 13 个 LLM 共约 450 万条回答。
Google Research 发布论文 SymptomAI,介绍一项 n=13,917 的随机全美研究,参与者向五种不同问诊策略的 Gemini Flash 2.0 SymptomAI 智能体描述症状并获得鉴别诊断(DDx)。
推荐理由:研究给出了万人规模真实问诊对照与可穿戴数据交叉验证方法,可参考其评估设计思路。
Google Research 与 Google DeepMind 合作在 Nature 发表论文,提出用强化学习智能体从量子纠错检测事件中学习,在计算过程中持续调控数千个控制参数以对抗硬件漂移。
推荐理由:原文给出了强化学习在 Willow 上的具体增益数字和扩展性结论,可据此评估该范式对量子纠错实用化的意义。
Google Research 在 ICLR 2026 论文 "On the Interpolation Effect of Score Smoothing in Diffusion Models" 中指出,扩散模型的创造力源于神经网络训练中正则化导致的 score smoothing,使去噪过程在训练数据点之间插值而非记忆。
Google Research 发布大型传感器基础模型 SensorFM,用 500 万名同意参与者、超过 1 万亿分钟的多模态传感器信号做自监督预训练,学习可迁移到心血管、代谢、睡眠和心理健康的通用生理表征。
推荐理由:原文给出了预训练规模与下游任务收益的对应关系,读者可据此判断通用表征在可穿戴健康场景的迁移空间。
Google Research 在 Nature Cities 发表研究,通过修改 Google Maps 算法在美国 10 个大城市进行为期六个月的实验,仅改变不到 2% 的行程路线,就使目标路段车速中位数提升约 2%、燃油消耗率中位数下降 0.5% 至 1.0%。
Google Research 在 CIDR 发布论文提出线性弹性缓存(linear elastic caching),将页面淘汰建模为 ski rental 问题,用轻量级决策树模型动态预测页面 TTL,在内存占用与缓存未命中之间权衡以降低总拥有成本(TCO)。
Google Research 将在 COLM 2026 发表的论文指出,即使对简单单跳事实问题,开启推理也能召回关闭推理时几乎无法得到的答案。
Google Research 分享了关于消费者如何用AI理解皮肤问题的两项研究。其中发表于 JAMA Dermatology 的大规模调查纳入 2,345 名参与者,使用AI工具时参与者尝试命名病症的比例超过 62%(对照组为 41%),命名准确率达 23%,约为对照组 8% 的三倍;但下一步就医决策的准确率在标准AI组未见统计显著提升。
Google Research 在 AISTATS 2026 上提出机器遗忘审计新框架 Regularized f-Divergence Kernel Tests,通过相对距离测试衡量遗忘后模型更接近安全重训模型还是原始受污染模型。
Google DeepMind 公布了在塞拉利昂开展的 Guided Learning 预注册试验结果,学生数学成绩相对对照组提升 +0.258 个标准差,约相当于八周内 1.2 至 1.7 年的学习进度;教师将 Gemini 纳入约一半课程(目标 12 小时)的班级提升更大,约 1.8 至 2.5 年。
推荐理由:原文给出了预注册试验的量化结果与开放的教师培训材料,读者可据此评估 AI 辅助教学的实际效果与可复用做法。
Google Research 在 Nature 发表论文介绍 PHRM 系统,可在日常使用手机时通过前置摄像头在人脸解锁后拍摄视频,被动估计心率与静息心率,心率 MAPE < 10%,日均静息心率相对可穿戴设备 MAE < 5 bpm。
推荐理由:原文给出了跨肤色非劣性标准与真实场景验证方法,可迁移用于评估rPPG类健康监测模型的公平性。
斯坦福大学医学院遗传学家 Gary Peltz 的团队在 Advanced Science 发表研究,用 Google DeepMind 的 Co-Scientist 从现有药物文献中筛选可重定位治疗肝纤维化的候选药。
Google DeepMind 发表新论文 Decoupled DiLoCo,将大训练任务拆分为解耦的算力岛屿并以异步数据流连接,使局部硬件故障不影响其他部分继续训练。
推荐理由:原文给出了带宽、容错和跨代硬件混训的具体实验结果,可据此评估分布式训练路线的实际可行性。
Google Research 在 ICLR 论文 ReasoningBank: Scaling Agent Self-Evolving with Reasoning Memory 中提出一种智能体记忆框架,从成功与失败经验中提炼高层推理模式,实现测试时自我进化。
Google Research 在 Transactions on Machine Learning Research 发表论文,提出 reasoning-first 的合成数据生成框架 Simula,通过全局多样性、局部多样性、复杂度和质量四个可控轴从第一性原理构建数据集。
Google Research 发布论文 MoGen,用合成神经元形态改进 AI 脑图谱重建模型,使重建误差降低 4.4%,在完整小鼠脑尺度相当于节省 157 人年的手工校对工作。
Google Research 发布 ConvApparel 数据集,包含服装购物领域 4,000+ 段人机多轮对话(近 15,000 轮),用于量化 LLM 用户模拟器与真实人类行为之间的差距。
Google Research 提出一个框架,用情境判断测试(SJT)评估 LLM 行为倾向与人类行为的对齐程度,替代直接套用自陈问卷的做法。对 25 个 LLM 的大规模分析发现两类差距:模型倾向偏离人类标注者共识,以及在缺乏共识时无法反映人类意见的多样性。
Google Research 发布论文《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》,研究评测中标注条目数 N 与每条标注者数 K 的取舍。
Google Research 与多家 NHS 机构合作开展 AIMS 研究,在 Nature Cancer 发表两项研究评估 AI 乳腺癌检测系统。
推荐理由:研究给出了AI作为第二读片人的具体读片量与时间节省数据,可帮助评估其在筛查流程中的实际落地空间。
Google Research 与 Cornell University 合作在 PNAS 发表论文,用 67 道高温超导专家问题评测 6 个 LLM(GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 及自建 RAG 系统),由专家按 0-2 分六项指标盲评。