跳到正文

Google / Gemini

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

最新精选

第 21–40 条 · 共 57 条
7月30日周四
  1. Google DeepMind70

    Google DeepMind 发布 Gemini Robotics ER 2 具身推理模型

    Google DeepMind 发布面向机器人的具身推理模型 Gemini Robotics ER 2,可作为机器人的高层大脑进行对话、理解物理世界并规划多步任务,再将运动执行交给下层 VLA 模型。

    推荐理由:原文给出进度分类与关键时刻定位的具体指标,读者可据此理解视频理解如何转化为机器人任务编排能力。

7月28日周二
  1. Google DeepMind74

    Google DeepMind 发布 Gemini Robotics 2,实现机器人全身智能控制

    Google DeepMind 发布 Gemini Robotics 2,包含三个模型:Gemini Robotics 2 视觉-语言-动作(VLA)模型可控制整个人形机器人从脚到指尖的全身动作并实现双手灵巧操作。

    推荐理由:原文拆解了三个模型的分工与开放入口,读者可据此判断机器人智能如何从上半身扩展到全身控制。

7月23日周四
  1. Google Research62

    Google Research 发布 SymptomAI 论文:万人规模研究评估对话式症状评估智能体

    Google Research 发布论文 SymptomAI,介绍一项 n=13,917 的随机全美研究,参与者向五种不同问诊策略的 Gemini Flash 2.0 SymptomAI 智能体描述症状并获得鉴别诊断(DDx)。

    推荐理由:研究给出了万人规模真实问诊对照与可穿戴数据交叉验证方法,可参考其评估设计思路。

  2. Google Research74

    Google Research 在 Nature 发表强化学习控制量子纠错研究

    Google Research 与 Google DeepMind 合作在 Nature 发表论文,提出用强化学习智能体从量子纠错检测事件中学习,在计算过程中持续调控数千个控制参数以对抗硬件漂移。

    推荐理由:原文给出了强化学习在 Willow 上的具体增益数字和扩展性结论,可据此评估该范式对量子纠错实用化的意义。

7月21日周二
7月17日周五
  1. Google DeepMind70

    Google DeepMind 发布 Gemini 3.5 Flash Cyber 网络安全模型

    Google DeepMind 发布 Gemini 3.5 Flash Cyber,一款基于 3.5 Flash 微调的轻量网络安全模型,用于快速发现、验证和修补漏洞,通过 CodeMender 以限量试点方式先向政府和可信伙伴开放。

    推荐理由:原文说明了轻量模型在代码安全场景相对大模型的成本与调用优势,以及受限开放策略的考量。

7月9日周四
  1. Google Research62

    Google Research 发布 SensorFM 可穿戴健康数据基础模型

    Google Research 发布大型传感器基础模型 SensorFM,用 500 万名同意参与者、超过 1 万亿分钟的多模态传感器信号做自监督预训练,学习可迁移到心血管、代谢、睡眠和心理健康的通用生理表征。

    推荐理由:原文给出了预训练规模与下游任务收益的对应关系,读者可据此判断通用表征在可穿戴健康场景的迁移空间。

7月1日周三
6月30日周二
  1. Google Research67

    Google Research 发布表格数据零样本基础模型 TabFM

    Google Research 发布面向表格数据分类与回归的基础模型 TabFM,将表格预测建模为上下文学习问题,无需手动训练、超参调优和特征工程,单次前向传播即可在未见过的表格上生成预测。

    推荐理由:原文说明了混合注意力架构与合成数据训练如何替代传统特征工程和调参流程,便于评估其对现有工作流的替代空间。

6月25日周四
  1. Google DeepMind74

    Gemini 3.5 Flash 内置 computer use 工具

    Google DeepMind 宣布 computer use 现已成为 Gemini 3.5 Flash 的内置工具,此前该能力仅作为独立的 Gemini 2.5 computer use 模型提供,如今原生集成进主 Gemini Flash 模型。

    推荐理由:原文说明了 computer use 从独立模型变为内置工具的路径变化,以及配套的两项企业防护机制,便于评估其在自动化任务中的落地方式。

6月16日周二
6月11日周四
  1. Google DeepMind74

    Google DeepMind 开源实验性扩散文本模型 DiffusionGemma,推理提速最高 4 倍

    Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式一次并行生成整段文本,在专用 GPU 上文本生成速度最高提升 4 倍,单张 NVIDIA H100 可达 1000+ tokens per second,NVIDIA GeForce RTX 5090 可达 700+ tokens per second。

    推荐理由:原文给出了速度、显存与质量取舍的具体数据,读者可据此判断它是否适合本地交互场景。

6月9日周二
  1. Google DeepMind76

    Google DeepMind 发布 Gemini 3.5 Live Translate 语音翻译模型

    Google DeepMind 发布最新音频模型 Gemini 3.5 Live Translate,支持 70+ 语言近实时语音到语音翻译,可自动检测语言并保留说话者的语调、节奏和音高,持续生成语音且仅比说话者落后几秒。

    推荐理由:原文说明了从五种语言到 70+ 语言的跨度变化,读者可据此判断它对会议翻译场景的实际影响。

6月8日周一
  1. Google DeepMind64

    Google DeepMind 公布塞拉利昂 AI 辅助数学学习预注册试验结果

    Google DeepMind 公布了在塞拉利昂开展的 Guided Learning 预注册试验结果,学生数学成绩相对对照组提升 +0.258 个标准差,约相当于八周内 1.2 至 1.7 年的学习进度;教师将 Gemini 纳入约一半课程(目标 12 小时)的班级提升更大,约 1.8 至 2.5 年。

    推荐理由:原文给出了预注册试验的量化结果与开放的教师培训材料,读者可据此评估 AI 辅助教学的实际效果与可复用做法。

6月5日周五
  1. Google Research70

    Google Research 发表 Nature 论文:用智能手机前置摄像头被动监测心率

    Google Research 在 Nature 发表论文介绍 PHRM 系统,可在日常使用手机时通过前置摄像头在人脸解锁后拍摄视频,被动估计心率与静息心率,心率 MAPE < 10%,日均静息心率相对可穿戴设备 MAE < 5 bpm。

    推荐理由:原文给出了跨肤色非劣性标准与真实场景验证方法,可迁移用于评估rPPG类健康监测模型的公平性。

5月29日周五
  1. Google Research67

    Google Research 发布 I/O 2026 研究成果综述

    Google Research 发布 I/O 2026 综述,介绍其在科学发现、健康、边缘计算、天气预测、Gemini 核心能力、开发者生产力、隐私保护和量子计算等方向的研究与产品进展。

    推荐理由:官方长文系统梳理了研究到产品的转化路径,读者可据此理解其各条线的布局重点。

5月20日周三
  1. Google Research74

    Google 开源 ERA 科研工具并发布 Nature 论文,推出 Computational Discovery

    Google 发布基于 Gemini 的科研工具 ERA,其论文今日刊于 Nature,同时开始通过 Gemini for Science 更广泛开放由 AlphaEvolve 和 ERA 构建的实验工具 Computational Discovery。

    推荐理由:原文列出 ERA 在多个学科基准和五个开放科学问题上的具体结果,读者可据此判断这类工具当前能覆盖的研究范围。

5月19日周二
  1. Google DeepMind61

    Google DeepMind:Co-Scientist 帮助生物学家加速筛选逆转细胞衰老的遗传线索

    Google DeepMind 介绍生物学家 Omar Abudayyeh 和 Jonathan Gootenberg 的实验室如何用 Co-Scientist 加速衰老研究。Co-Scientist 扫描数万篇论文后提出 20 多个新颖的候选遗传因子,其中部分假设经实验室验证,能成功推动细胞进入更年轻状态。它还把原本最长需耗时六个月的筛选数据与文献对照分析工作压缩到几天。

    推荐理由:原文给出 Co-Scientist 在真实实验室中把文献分析从数月压缩到数天的具体用法,可迁移至其他科研数据解读场景。

5月18日周一
  1. Google DeepMind84

    Google DeepMind 发布 Gemini Omni Flash 视频生成模型

    Google DeepMind 发布 Omni 家族首个模型 Gemini Omni Flash,可将图像、音频、视频和文本组合作为输入,生成基于 Gemini 真实世界知识的高质量视频,并支持通过自然语言对话编辑视频,每次指令在上一次基础上延续,保持角色一致和场景记忆。

    推荐理由:原文说明了 Omni 与 Gemini 推理能力的结合方式和开放入口,读者可据此判断它会怎样改变视频创作工作流。