Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型
Google DeepMind 发布面向机器人的具身推理模型 Gemini Robotics ER 2,可作为机器人的高层大脑进行对话、理解物理世界并规划多步任务,再将运动执行交给下层 VLA 模型。
推荐理由:原文给出进度分类与关键时刻定位的具体指标,读者可据此理解视频理解如何转化为机器人任务编排能力。
Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。
Google DeepMind 发布面向机器人的具身推理模型 Gemini Robotics ER 2,可作为机器人的高层大脑进行对话、理解物理世界并规划多步任务,再将运动执行交给下层 VLA 模型。
推荐理由:原文给出进度分类与关键时刻定位的具体指标,读者可据此理解视频理解如何转化为机器人任务编排能力。
Google DeepMind 发布 Gemini Robotics 2,包含三个模型:Gemini Robotics 2 视觉-语言-动作(VLA)模型可控制整个人形机器人从脚到指尖的全身动作并实现双手灵巧操作。
推荐理由:原文拆解了三个模型的分工与开放入口,读者可据此判断机器人智能如何从上半身扩展到全身控制。
Google Research 发布论文 SymptomAI,介绍一项 n=13,917 的随机全美研究,参与者向五种不同问诊策略的 Gemini Flash 2.0 SymptomAI 智能体描述症状并获得鉴别诊断(DDx)。
推荐理由:研究给出了万人规模真实问诊对照与可穿戴数据交叉验证方法,可参考其评估设计思路。
Google Research 与 Google DeepMind 合作在 Nature 发表论文,提出用强化学习智能体从量子纠错检测事件中学习,在计算过程中持续调控数千个控制参数以对抗硬件漂移。
推荐理由:原文给出了强化学习在 Willow 上的具体增益数字和扩展性结论,可据此评估该范式对量子纠错实用化的意义。
Google DeepMind 发布三款 Gemini 新模型:Gemini 3.6 Flash 主打编码、知识工作与多模态,按 Artificial Analysis Index 输出 token 消耗比 3.5 Flash 少 17%。
推荐理由:原文给出三款模型的定价与基准对比,可据此评估其在智能体工作流中的成本与能力取舍。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,一款基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,通过 CodeMender 以限量试点方式先向政府和可信伙伴开放。
推荐理由:原文说明了轻量模型在代码安全场景相对大模型的成本与调用优势,以及受限开放策略的考量。
Google Research 发布大型传感器基础模型 SensorFM,用 500 万名同意参与者、超过 1 万亿分钟的多模态传感器信号做自监督预训练,学习可迁移到心血管、代谢、睡眠和心理健康的通用生理表征。
推荐理由:原文给出了预训练规模与下游任务收益的对应关系,读者可据此判断通用表征在可穿戴健康场景的迁移空间。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)图像模型与 Gemini Omni Flash(gemini-omni-flash-preview)视频生成与对话式编辑模型。
推荐理由:原文给出了两款模型的定位分工与串联用法,读者可据此判断如何组合图像与视频生成搭建工作流。
Google Research 发布面向表格数据分类与回归的基础模型 TabFM,将表格预测建模为上下文学习问题,无需手动训练、超参调优和特征工程,单次前向传播即可在未见过的表格上生成预测。
推荐理由:原文说明了混合注意力架构与合成数据训练如何替代传统特征工程和调参流程,便于评估其对现有工作流的替代空间。
Google DeepMind 宣布 computer use 现已成为 Gemini 3.5 Flash 的内置工具,此前该能力仅作为独立的 Gemini 2.5 computer use 模型提供,如今原生集成进主 Gemini Flash 模型。
推荐理由:原文说明了 computer use 从独立模型变为内置工具的路径变化,以及配套的两项企业防护机制,便于评估其在自动化任务中的落地方式。
Google DeepMind 发布 AI Control Roadmap,一套用于构建和管理 Google 内部部署的先进 AI 的纵深防御框架,即使模型对齐不完美也能提供系统级安全保障。
推荐理由:原文给出了威胁建模、监督机制和分级响应的具体设计,可迁移为部署内部智能体时的安全参考框架。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式一次并行生成整段文本,在专用 GPU 上文本生成速度最高提升 4 倍,单张 NVIDIA H100 可达 1000+ tokens per second,NVIDIA GeForce RTX 5090 可达 700+ tokens per second。
推荐理由:原文给出了速度、显存与质量取舍的具体数据,读者可据此判断它是否适合本地交互场景。
Google DeepMind 发布最新音频模型 Gemini 3.5 Live Translate,支持 70+ 语言近实时语音到语音翻译,可自动检测语言并保留说话者的语调、节奏和音高,持续生成语音且仅比说话者落后几秒。
推荐理由:原文说明了从五种语言到 70+ 语言的跨度变化,读者可据此判断它对会议翻译场景的实际影响。
Google DeepMind 发布 Gemma 4 12B,定位为可在 16GB RAM 消费级笔记本本地运行的智能体多模态模型,是该系列首个支持原生音频输入的中等规模模型。
推荐理由:原文说明了无编码器架构如何省下延迟与显存,读者可据此判断本地多模态部署的可行性。
Google DeepMind 公布了在塞拉利昂开展的 Guided Learning 预注册试验结果,学生数学成绩相对对照组提升 +0.258 个标准差,约相当于八周内 1.2 至 1.7 年的学习进度;教师将 Gemini 纳入约一半课程(目标 12 小时)的班级提升更大,约 1.8 至 2.5 年。
推荐理由:原文给出了预注册试验的量化结果与开放的教师培训材料,读者可据此评估 AI 辅助教学的实际效果与可复用做法。
Google Research 在 Nature 发表论文介绍 PHRM 系统,可在日常使用手机时通过前置摄像头在人脸解锁后拍摄视频,被动估计心率与静息心率,心率 MAPE < 10%,日均静息心率相对可穿戴设备 MAE < 5 bpm。
推荐理由:原文给出了跨肤色非劣性标准与真实场景验证方法,可迁移用于评估rPPG类健康监测模型的公平性。
Google Research 发布 I/O 2026 综述,介绍其在科学发现、健康、边缘计算、天气预测、Gemini 核心能力、开发者生产力、隐私保护和量子计算等方向的研究与产品进展。
推荐理由:官方长文系统梳理了研究到产品的转化路径,读者可据此理解其各条线的布局重点。
Google 发布基于 Gemini 的科研工具 ERA,其论文今日刊于 Nature,同时开始通过 Gemini for Science 更广泛开放由 AlphaEvolve 和 ERA 构建的实验工具 Computational Discovery。
推荐理由:原文列出 ERA 在多个学科基准和五个开放科学问题上的具体结果,读者可据此判断这类工具当前能覆盖的研究范围。
Google DeepMind 介绍生物学家 Omar Abudayyeh 和 Jonathan Gootenberg 的实验室如何用 Co-Scientist 加速衰老研究。Co-Scientist 扫描数万篇论文后提出 20 多个新颖的候选遗传因子,其中部分假设经实验室验证,能成功推动细胞进入更年轻状态。它还把原本最长需耗时六个月的筛选数据与文献对照分析工作压缩到几天。
推荐理由:原文给出 Co-Scientist 在真实实验室中把文献分析从数月压缩到数天的具体用法,可迁移至其他科研数据解读场景。
Google DeepMind 发布 Omni 家族首个模型 Gemini Omni Flash,可将图像、音频、视频和文本组合作为输入,生成基于 Gemini 真实世界知识的高质量视频,并支持通过自然语言对话编辑视频,每次指令在上一次基础上延续,保持角色一致和场景记忆。
推荐理由:原文说明了 Omni 与 Gemini 推理能力的结合方式和开放入口,读者可据此判断它会怎样改变视频创作工作流。