Google DeepMind 发布 Gemini Omni Flash 视频生成模型
Google DeepMind 发布 Omni 家族首个模型 Gemini Omni Flash,可将图像、音频、视频和文本组合作为输入,生成基于 Gemini 真实世界知识的高质量视频,并支持通过自然语言对话编辑视频,每次指令在上一次基础上延续,保持角色一致和场景记忆。
推荐理由:原文说明了 Omni 与 Gemini 推理能力的结合方式和开放入口,读者可据此判断它会怎样改变视频创作工作流。
Google DeepMind 发布 Omni 家族首个模型 Gemini Omni Flash,可将图像、音频、视频和文本组合作为输入,生成基于 Gemini 真实世界知识的高质量视频,并支持通过自然语言对话编辑视频,每次指令在上一次基础上延续,保持角色一致和场景记忆。
推荐理由:原文说明了 Omni 与 Gemini 推理能力的结合方式和开放入口,读者可据此判断它会怎样改变视频创作工作流。
Google DeepMind 推出 Gemini for Science,包含 Google Antigravity 中的 Science Skills 以及 Google Labs 上三个实验工具。
推荐理由:原文列出了三个实验工具的具体能力与开放入口,读者可据此判断它会怎样嵌入现有科研工作流。
Google DeepMind 宣布在 Search、Gemini、Chrome、Pixel 和 Cloud 扩展内容透明与验证工具:SynthID 已为超过 100 billion 张图片视频和 60,000 年音频加水印,Gemini app 的 SynthID 验证已被使用 50 million 次,现扩展到 Search 并将在数周内进入 Chrome。
推荐理由:原文列出了 SynthID 与 C2PA 在多产品线的落地节奏和采用规模,可据此判断内容溯源工具的普及路径。
Google DeepMind 作为 Google 与新加坡政府新国家 AI 合作的关键一环,在当地推出多项新计划,覆盖医疗、教育、科研与可持续发展。
Google DeepMind 介绍剑桥大学 Clare Bryant 教授使用 Co-Scientist 寻找病原体跨物种传播引发重症的分子开关。Bryant 先后输入课题摘要与完整基金申请书,工具生成并排序假设,最终锁定她此前未关注的蛋白并细化到具体氨基酸,团队正构建含相应突变的细胞系验证。她表示原本需两到三年的实验工作如今有望在六个月内完成。
Google DeepMind 介绍 Calico Life Sciences 的 AI/ML 负责人 Matt Onsum 和首席科学家 Katherine Labbé 使用 Co-Scientist 连接衰老生物学中分散的研究发现并生成值得测试的假设。
Google DeepMind 的 Co-Scientist 帮助爱丁堡大学生物工程师 Filippo Menolascina 团队缩小 MASH 联合疗法的搜索空间,并针对 resmetirom 只对少数合格患者起效的问题提出假设,将 NLRP3 inflammasome 指认为连接炎症与代谢的分子桥梁,该假设随后经实验验证,有望为靶向双联疗法铺路。
MIT 的 Ritu Raman 借助 Google DeepMind 的 Co-Scientist,将原本需数月梳理的 ALS 文献压缩为可快速验证的假设,并按可行性与风险回报排序研究方向。
斯坦福大学医学院遗传学家 Gary Peltz 的团队在 Advanced Science 发表研究,用 Google DeepMind 的 Co-Scientist 从现有药物文献中筛选可重定位治疗肝纤维化的候选药。
Google DeepMind 复盘其 AI 气象模型 WeatherNext 如何帮助美国国家飓风中心(NHC)提前五天以 80% 置信度预测飓风 Melissa 将以 Category 5 强度登陆牙买加,三天前该置信度升至接近 100%,这是首次从 Category 1 风速起报成功预测风暴达到 Category 5 强度。
推荐理由:原文回顾了 WeatherNext 在一次真实飓风中的预测表现与协作过程,读者可据此理解 AI 气象模型如何进入官方预报流程。
Google DeepMind 发布 Gemini 3.5 系列的首款模型 Gemini 3.5 Flash,称其为目前最强的智能体与编码模型,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)、MCP Atlas(83.6%)等基准上超过 Gemini 3.1 Pro,输出速度是其他前沿模型的 4 倍,成本常低于其一半。
推荐理由:原文给出多项基准分数与速度成本数据,读者可据此判断它在智能体与编码场景中的定位。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,并推出基于 Gemini 的多智能体系统 Hypothesis Generation,面向个人研究者开放注册,将在未来几周内逐步推出。
推荐理由:原文给出了多智能体分工、验证算力占比和多个已落地案例,读者可据此判断它如何嵌入真实科研流程。
伯克利 AI 研究团队梳理了并行推理领域进展,指出当前方法多由外部预设并行结构,模型无法自行决定何时分解任务、开启多少线程。文章重点讨论自适应并行推理,并提及 ThreadWeaver、ParaThinker、GroupThink、Hogwild! Inference 等方法。
Google DeepMind 发布 AlphaEvolve 一周年影响综述,这一 Gemini 驱动的编码智能体已在多领域落地:基因组学中使 DeepConsensus 变异检测错误降低 30%,电网 AC Optimal Power Flow 可行解求解率从 14% 提升至 88% 以上,自然灾害风险预测准确率提升 5%。
推荐理由:原文按领域梳理了 AlphaEvolve 一年来的落地成果与量化数据,便于读者判断这类算法发现型智能体的实际影响范围。
Google Research 公布其开放科学生态成果,过去十年发布的开源工具与开放数据集已服务全球超过 250,000 名研究者和开发者。基因组学工具 DeepVariant、DeepConsensus、DeepPolisher 已助力处理 250 万人的外显子组和全基因组数据;神经科学数据集 H01 达 1.4 petabyte,被访问超 20 万次。
Google DeepMind 宣布推出 AI co-clinician 研究计划,探索在医生临床监督下由 AI 智能体辅助患者的三方诊疗模式。在 98 个真实初级医疗查询的盲测中,该系统在 97 例里零关键错误,医生在对照评估中更偏好其回答;在 OpenFDA RxQA 药物问答基准上,开放式提问场景表现超过其他前沿模型。
推荐理由:原文给出了评测方法与具体结果,读者可据此判断该系统当前能力边界与适用场景。
Google Research 介绍了科学家使用 Empirical Research Assistance (ERA) 的四个真实场景:在公共卫生领域,ERA 生成的美国流感。
推荐理由:四个真实场景展示了ERA从预测到机制发现的可迁移用法,便于评估AI辅助科研的实际边界。
Mistral AI 宣布 Workflows 进入公开预览,作为企业 AI 的编排层,提供持久执行、可观测性和容错能力,帮助组织把 AI 流程从概念验证推进到生产。
推荐理由:原文拆解了企业 AI 落地的典型失败模式并给出对应机制,可迁移判断生产化编排层该具备什么。
Google DeepMind 与韩国科学技术信息通信部(MSIT)宣布建立新合作,将在首尔办公室设立 AI Campus,与首尔大学(SNU)、KAIST 及三个 AI Bio Innovation Hubs 等机构协作。
Google Research 宣布该方法已作为 Auto frame 功能的一部分在 Google Photos 上线,可用生成式 AI 在拍照后自动改变相机视角重新构图。
推荐理由:原文拆解了3D估计与生成补全两阶段流程,读者可理解视角重合成如何在保留原内容的同时补出隐藏区域。
Google DeepMind 发表新论文 Decoupled DiLoCo,将大训练任务拆分为解耦的算力岛屿并以异步数据流连接,使局部硬件故障不影响其他部分继续训练。
推荐理由:原文给出了带宽、容错和跨代硬件混训的具体实验结果,可据此评估分布式训练路线的实际可行性。
Google Research 在 ICLR 论文 ReasoningBank: Scaling Agent Self-Evolving with Reasoning Memory 中提出一种智能体记忆框架,从成功与失败经验中提炼高层推理模式,实现测试时自我进化。
Google DeepMind 宣布与 Accenture、Bain & Company、BCG、Deloitte、McKinsey 合作,推动前沿 AI 在全球企业落地。
伯克利 AI 研究团队提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而让基于学习动力学(世界模型)的长时程规划变得实用。该方法针对长时程 rollout 中梯度爆炸/消失、非贪心结构导致的局部极小值以及高维视觉模型梯度脆弱等问题。
Google Research 在 Transactions on Machine Learning Research 发表论文,提出 reasoning-first 的合成数据生成框架 Simula,通过全局多样性、局部多样性、复杂度和质量四个可控轴从第一性原理构建数据集。
Google Research 发布论文 MoGen,用合成神经元形态改进 AI 脑图谱重建模型,使重建误差降低 4.4%,在完整小鼠脑尺度相当于节省 157 人年的手工校对工作。
Google DeepMind 发布 Gemini 3.1 Flash TTS 文本转语音模型,通过在文本中嵌入自然语言 audio tags 实现对语音风格、语速和表达的细粒度控制。
推荐理由:原文给出了基准分数和开放入口,读者可据此判断其在语音生成上的定位与可用性。
Google Research 与纽约大学合作推出 Vantage,一个面向高中和大学学生的研究实验,通过生成式 AI 在模拟环境中评估批判性思维、协作、创造性思维等未来技能,现已在 Google Labs 提供英文版注册。
Google DeepMind 发布 Gemini Robotics-ER 1.6,作为机器人高层推理模型,可通过 Gemini API 和 Google AI Studio 调用,并原生调用 Google Search、VLA 及第三方函数。
推荐理由:原文说明了仪器读数能力的实现路径,读者可了解具身推理如何结合代码执行解决真实巡检问题。
Google Research 发布 ConvApparel 数据集,包含服装购物领域 4,000+ 段人机多轮对话(近 15,000 轮),用于量化 LLM 用户模拟器与真实人类行为之间的差距。
Google Research 发布两个面向学术工作流的智能体框架:PaperVizAgent(原名 PaperBanana)用于绘制学术图表,ScholarPeer 用于自动同行评审。
Google Research 提出一个框架,用情境判断测试(SJT)评估 LLM 行为倾向与人类行为的对齐程度,替代直接套用自陈问卷的做法。对 25 个 LLM 的大规模分析发现两类差距:模型倾向偏离人类标注者共识,以及在缺乏共识时无法反映人类意见的多样性。
Google DeepMind 发布 Gemma 4 开源模型系列,采用 Apache 2.0 许可,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,主打推理与智能体工作流。
推荐理由:原文给出了各尺寸的硬件适配与开源许可细节,读者可据此判断本地部署和微调的可行路径。
Google Research 发布论文《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》,研究评测中标注条目数 N 与每条标注者数 K 的取舍。
Mistral AI 发布 CLI 工具 Spaces,用三条命令即可从零跑起带热重载、数据库和 Dockerfile 的多服务项目。
Google Research 发布白皮书,更新了用 Shor 算法破解 ECDLP-256 所需的量子资源估算:两套量子电路分别只需少于 1,200 逻辑量子比特和 90 million Toffoli 门。
推荐理由:原文给出的资源估算降幅和零知识证明披露方式,可帮助读者理解量子威胁的紧迫程度与负责任披露的可行做法。
Google DeepMind 发布由 Gemini 驱动的实验性 AI 指针,提出四条交互原则:保持工作流不被打断、指哪看哪捕捉视觉与语义上下文、用“这个/那个”等自然简写替代冗长提示词、把像素转化为可交互的结构化实体。
Google Research 宣布推出 Vibe Coding XR 工作流,结合 Gemini 与开源的 XR Blocks 框架,把自然语言直接转化为具备物理感知的 Android XR 应用,60 秒内即可完成。
Google Research 推出压缩算法 TurboQuant(将在 ICLR 2026 发布),通过 PolarQuant 与 QJL 两项技术在零精度损失下大幅压缩模型体积,消除传统向量量化的内存开销。
Google Research 在 Google Earth AI 计划下推出自监督框架 S2Vec,通过 S2 Geometry 分区将建成环境栅格化为多层图像,再用 masked autoencoding(MAE)学习通用嵌入向量,无需人工标注即可预测人口密度、中位收入等指标。