Mistral AI 发布 8B 具身导航模型 Robostral Navigate
Mistral AI 发布首个面向具身导航的 8B 模型 Robostral Navigate,仅用单个普通 RGB 相机(无深度传感器或 LiDAR)即可让机器人自主导航,在 R2R-CE validation unseen 上取得 76.6% 成功率,validation seen 为 79.4%,比最佳单相机方案高 9.7 点、比使用深度或多相机的最佳系统高 4.5 点。
Mistral AI 发布首个面向具身导航的 8B 模型 Robostral Navigate,仅用单个普通 RGB 相机(无深度传感器或 LiDAR)即可让机器人自主导航,在 R2R-CE validation unseen 上取得 76.6% 成功率,validation seen 为 79.4%,比最佳单相机方案高 9.7 点、比使用深度或多相机的最佳系统高 4.5 点。
Google Research 在 Nature Cities 发表研究,通过修改 Google Maps 算法在美国 10 个大城市进行为期六个月的实验,仅改变不到 2% 的行程路线,就使目标路段车速中位数提升约 2%、燃油消耗率中位数下降 0.5% 至 1.0%。
Google DeepMind 与 A24 宣布建立首个研究合作伙伴关系,双方将围绕多个项目展开长期深度研发合作,帮助创作者开发新的工作流与技术。Google 同时对 A24 进行了投资。合作初期聚焦于弥合前沿技术与下一代娱乐的差距,具体目标与技术产出将随时间演进。
Google Research 发布覆盖 50+ 全球城市、9 个国家的建筑级屋顶反照率数据集,并上线高分辨率 Heat Resilience Earth Engine App 供公众使用。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)图像模型与 Gemini Omni Flash(gemini-omni-flash-preview)视频生成与对话式编辑模型。
推荐理由:原文给出了两款模型的定位分工与串联用法,读者可据此判断如何组合图像与视频生成搭建工作流。
Hugging Face 推出 DiScoFormer(Density and Score Transformer),单次前向即可从数据点同时估计分布的密度与 score,无需针对新分布重训。
Mistral 发布 Mistral OCR 4 文档解析模型,除提取文本外还返回 bounding boxes、块类型分类和逐页逐词置信度分数,支持 170 种语言、10 个语系,可单容器自托管部署。
推荐理由:原文给出基准分数与已知评分缺陷的对照,读者可据此判断该模型在真实文档场景中的可用边界。
Google DeepMind 与英国政府、Google Cloud、Faculty 及 Barnet、Dorset、Camden 三地规划部门合作,推出基于 Gemini 的 AI 规划审批原型,目标把房主规划申请的决策时间缩短 50%。
Google Research 联合牛津大学发布英国全境树篱、石墙与小片林地的矢量数据集,将此前的 Farmscapes 2020 像素级地图转化为可用于景观修复与碳核算的可操作清单。
Google Research 分享了关于消费者如何用AI理解皮肤问题的两项研究。其中发表于 JAMA Dermatology 的大规模调查纳入 2,345 名参与者,使用AI工具时参与者尝试命名病症的比例超过 62%(对照组为 41%),命名准确率达 23%,约为对照组 8% 的三倍;但下一步就医决策的准确率在标准AI组未见统计显著提升。
Google DeepMind 发布最新音频模型 Gemini 3.5 Live Translate,支持 70+ 语言近实时语音到语音翻译,可自动检测语言并保留说话者的语调、节奏和音高,持续生成语音且仅比说话者落后几秒。
推荐理由:原文说明了从五种语言到 70+ 语言的跨度变化,读者可据此判断它对会议翻译场景的实际影响。
Google DeepMind 发布 Gemma 4 12B,定位为可在 16GB RAM 消费级笔记本本地运行的智能体多模态模型,是该系列首个支持原生音频输入的中等规模模型。
推荐理由:原文说明了无编码器架构如何省下延迟与显存,读者可据此判断本地多模态部署的可行性。
Google Research 在 Nature 发表论文介绍 PHRM 系统,可在日常使用手机时通过前置摄像头在人脸解锁后拍摄视频,被动估计心率与静息心率,心率 MAPE < 10%,日均静息心率相对可穿戴设备 MAE < 5 bpm。
推荐理由:原文给出了跨肤色非劣性标准与真实场景验证方法,可迁移用于评估rPPG类健康监测模型的公平性。
Google Research 发布 I/O 2026 综述,介绍其在科学发现、健康、边缘计算、天气预测、Gemini 核心能力、开发者生产力、隐私保护和量子计算等方向的研究与产品进展。
推荐理由:官方长文系统梳理了研究到产品的转化路径,读者可据此理解其各条线的布局重点。
Mistral AI 通过收购 Emmi AI 加码 Physics AI,面向航空航天、汽车、半导体和能源等行业构建基础模型。其已发表成果包括 AB-UPT(可在单 GPU 上处理 9M surface 和 140M volume cells 的气动 CFD 模型)、UPT、NeuralDEM、GyroSwin 5D 等,覆盖 CFD、等离子体湍流与工业多物理过程的神经代理模型。
Google DeepMind 在 Project Genie 中推出由 Street View 支撑的新能力,可将生成世界的起点锚定在真实地点影像上,并向全球符合条件的 Google AI Ultra $200 订阅者(18+)逐步开放。
Google DeepMind 发布 Omni 家族首个模型 Gemini Omni Flash,可将图像、音频、视频和文本组合作为输入,生成基于 Gemini 真实世界知识的高质量视频,并支持通过自然语言对话编辑视频,每次指令在上一次基础上延续,保持角色一致和场景记忆。
推荐理由:原文说明了 Omni 与 Gemini 推理能力的结合方式和开放入口,读者可据此判断它会怎样改变视频创作工作流。
Google DeepMind 推出 Gemini for Science,包含 Google Antigravity 中的 Science Skills 以及 Google Labs 上三个实验工具。
推荐理由:原文列出了三个实验工具的具体能力与开放入口,读者可据此判断它会怎样嵌入现有科研工作流。
Google DeepMind 宣布在 Search、Gemini、Chrome、Pixel 和 Cloud 扩展内容透明与验证工具:SynthID 已为超过 100 billion 张图片视频和 60,000 年音频加水印,Gemini app 的 SynthID 验证已被使用 50 million 次,现扩展到 Search 并将在数周内进入 Chrome。
推荐理由:原文列出了 SynthID 与 C2PA 在多产品线的落地节奏和采用规模,可据此判断内容溯源工具的普及路径。
Google DeepMind 作为 Google 与新加坡政府新国家 AI 合作的关键一环,在当地推出多项新计划,覆盖医疗、教育、科研与可持续发展。
Google DeepMind 介绍剑桥大学 Clare Bryant 教授使用 Co-Scientist 寻找病原体跨物种传播引发重症的分子开关。Bryant 先后输入课题摘要与完整基金申请书,工具生成并排序假设,最终锁定她此前未关注的蛋白并细化到具体氨基酸,团队正构建含相应突变的细胞系验证。她表示原本需两到三年的实验工作如今有望在六个月内完成。
Google DeepMind 复盘其 AI 气象模型 WeatherNext 如何帮助美国国家飓风中心(NHC)提前五天以 80% 置信度预测飓风 Melissa 将以 Category 5 强度登陆牙买加,三天前该置信度升至接近 100%,这是首次从 Category 1 风速起报成功预测风暴达到 Category 5 强度。
推荐理由:原文回顾了 WeatherNext 在一次真实飓风中的预测表现与协作过程,读者可据此理解 AI 气象模型如何进入官方预报流程。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,并推出基于 Gemini 的多智能体系统 Hypothesis Generation,面向个人研究者开放注册,将在未来几周内逐步推出。
推荐理由:原文给出了多智能体分工、验证算力占比和多个已落地案例,读者可据此判断它如何嵌入真实科研流程。
Google DeepMind 宣布推出 AI co-clinician 研究计划,探索在医生临床监督下由 AI 智能体辅助患者的三方诊疗模式。在 98 个真实初级医疗查询的盲测中,该系统在 97 例里零关键错误,医生在对照评估中更偏好其回答;在 OpenFDA RxQA 药物问答基准上,开放式提问场景表现超过其他前沿模型。
推荐理由:原文给出了评测方法与具体结果,读者可据此判断该系统当前能力边界与适用场景。
Google Research 介绍了科学家使用 Empirical Research Assistance (ERA) 的四个真实场景:在公共卫生领域,ERA 生成的美国流感。
推荐理由:四个真实场景展示了ERA从预测到机制发现的可迁移用法,便于评估AI辅助科研的实际边界。
Google DeepMind 与韩国科学技术信息通信部(MSIT)宣布建立新合作,将在首尔办公室设立 AI Campus,与首尔大学(SNU)、KAIST 及三个 AI Bio Innovation Hubs 等机构协作。
Google Research 宣布该方法已作为 Auto frame 功能的一部分在 Google Photos 上线,可用生成式 AI 在拍照后自动改变相机视角重新构图。
推荐理由:原文拆解了3D估计与生成补全两阶段流程,读者可理解视角重合成如何在保留原内容的同时补出隐藏区域。
Google Research 发布论文 MoGen,用合成神经元形态改进 AI 脑图谱重建模型,使重建误差降低 4.4%,在完整小鼠脑尺度相当于节省 157 人年的手工校对工作。
Google DeepMind 发布 Gemini 3.1 Flash TTS 文本转语音模型,通过在文本中嵌入自然语言 audio tags 实现对语音风格、语速和表达的细粒度控制。
推荐理由:原文给出了基准分数和开放入口,读者可据此判断其在语音生成上的定位与可用性。
Google Research 与纽约大学合作推出 Vantage,一个面向高中和大学学生的研究实验,通过生成式 AI 在模拟环境中评估批判性思维、协作、创造性思维等未来技能,现已在 Google Labs 提供英文版注册。
Google DeepMind 发布 Gemini Robotics-ER 1.6,作为机器人高层推理模型,可通过 Gemini API 和 Google AI Studio 调用,并原生调用 Google Search、VLA 及第三方函数。
推荐理由:原文说明了仪器读数能力的实现路径,读者可了解具身推理如何结合代码执行解决真实巡检问题。
Google Research 发布两个面向学术工作流的智能体框架:PaperVizAgent(原名 PaperBanana)用于绘制学术图表,ScholarPeer 用于自动同行评审。
Google DeepMind 发布 Gemma 4 开源模型系列,采用 Apache 2.0 许可,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,主打推理与智能体工作流。
推荐理由:原文给出了各尺寸的硬件适配与开源许可细节,读者可据此判断本地部署和微调的可行路径。
Google DeepMind 发布由 Gemini 驱动的实验性 AI 指针,提出四条交互原则:保持工作流不被打断、指哪看哪捕捉视觉与语义上下文、用“这个/那个”等自然简写替代冗长提示词、把像素转化为可交互的结构化实体。
Google Research 宣布推出 Vibe Coding XR 工作流,结合 Gemini 与开源的 XR Blocks 框架,把自然语言直接转化为具备物理感知的 Android XR 应用,60 秒内即可完成。
Google Research 在 Google Earth AI 计划下推出自监督框架 S2Vec,通过 S2 Geometry 分区将建成环境栅格化为多层图像,再用 masked autoencoding(MAE)学习通用嵌入向量,无需人工标注即可预测人口密度、中位收入等指标。
Google Research 在 The Check Up 活动上介绍了其医疗 AI 最新进展,涵盖个性化健康、临床协作、开发者生态、公共卫生与生物医学发现多个方向。
Google Research 与多家 NHS 机构合作开展 AIMS 研究,在 Nature Cancer 发表两项研究评估 AI 乳腺癌检测系统。
推荐理由:研究给出了AI作为第二读片人的具体读片量与时间节省数据,可帮助评估其在筛查流程中的实际落地空间。
Mistral AI 宣布发布 Mistral Small 4,这是首个将 Magistral 推理、Pixtral 多模态与 Devstral 智能体编码能力统一到单一模型中的 Mistral 模型,采用 Apache 2.0 许可开源。
推荐理由:原文给出了架构参数与延迟吞吐数据,读者可据此评估其替代多模型组合的可行性。
Google Research 宣布在 Flood Hub 上线城市山洪(Urban Flash Flood)预报,可提前最多 24 小时预测城市地区山洪风险。
推荐理由:原文说明了山洪预警缺乏历史数据的难点及用新闻报道构造训练集的做法,可迁移借鉴。