Import AI 461:对齐进展、FrontierCode 与科研智能体评测
本期 Import AI 报道英国 AI Security Institute 对齐团队与 Timaeus 研究者成立非营利机构 Sequent,目标两年内达 40-80 名全职员工、初期募资 $100–150M,聚焦可扩展启发式论证等对齐方向。
本期 Import AI 报道英国 AI Security Institute 对齐团队与 Timaeus 研究者成立非营利机构 Sequent,目标两年内达 40-80 名全职员工、初期募资 $100–150M,聚焦可扩展启发式论证等对齐方向。
Google Research 分享了关于消费者如何用AI理解皮肤问题的两项研究。其中发表于 JAMA Dermatology 的大规模调查纳入 2,345 名参与者,使用AI工具时参与者尝试命名病症的比例超过 62%(对照组为 41%),命名准确率达 23%,约为对照组 8% 的三倍;但下一步就医决策的准确率在标准AI组未见统计显著提升。
Google Research 与 University of California San Diego 合作探索 phone cluster computing,把退役智能手机的主板取出组集群,作为通用计算平台复用。
Google Research 在 AISTATS 2026 上提出机器遗忘审计新框架 Regularized f-Divergence Kernel Tests,通过相对距离测试衡量遗忘后模型更接近安全重训模型还是原始受污染模型。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散方式一次并行生成整段文本,在专用 GPU 上文本生成速度最高提升 4 倍,单张 NVIDIA H100 可达 1000+ tokens per second,NVIDIA GeForce RTX 5090 可达 700+ tokens per second。
推荐理由:原文给出了速度、显存与质量取舍的具体数据,读者可据此判断它是否适合本地交互场景。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 并获 Google.org 支持,宣布面向全球研究者、最高 $10M 的多智能体 AI 安全研究资助。
Google DeepMind 发布最新音频模型 Gemini 3.5 Live Translate,支持 70+ 语言近实时语音到语音翻译,可自动检测语言并保留说话者的语调、节奏和音高,持续生成语音且仅比说话者落后几秒。
推荐理由:原文说明了从五种语言到 70+ 语言的跨度变化,读者可据此判断它对会议翻译场景的实际影响。
Google DeepMind 发布 Gemma 4 12B,定位为可在 16GB RAM 消费级笔记本本地运行的智能体多模态模型,是该系列首个支持原生音频输入的中等规模模型。
推荐理由:原文说明了无编码器架构如何省下延迟与显存,读者可据此判断本地多模态部署的可行性。
Google DeepMind Accelerator: Robotics 项目本周在伦敦启动,从欧洲遴选 15 家早期机器人初创公司加入为期 3 个月的计划,入选者可使用 Google DeepMind 的 AI 技术栈、技术专家支持和 Gemini robotics 模型。
Google DeepMind 公布了在塞拉利昂开展的 Guided Learning 预注册试验结果,学生数学成绩相对对照组提升 +0.258 个标准差,约相当于八周内 1.2 至 1.7 年的学习进度;教师将 Gemini 纳入约一半课程(目标 12 小时)的班级提升更大,约 1.8 至 2.5 年。
推荐理由:原文给出了预注册试验的量化结果与开放的教师培训材料,读者可据此评估 AI 辅助教学的实际效果与可复用做法。
Import AI 460 本期汇总三项研究:Kings College London、复旦大学与The Alan Turing Institute推出SocioHack基准。
Google 宣布 Gemini Enterprise Agent Platform 托管版 Cross-Corpus Retrieval(由 Agentic RAG 驱动)进入公开预览,通过规划、改写、路由等多智能体协作处理多源多跳查询。
Google Research 在 Nature 发表论文介绍 PHRM 系统,可在日常使用手机时通过前置摄像头在人脸解锁后拍摄视频,被动估计心率与静息心率,心率 MAPE < 10%,日均静息心率相对可穿戴设备 MAE < 5 bpm。
推荐理由:原文给出了跨肤色非劣性标准与真实场景验证方法,可迁移用于评估rPPG类健康监测模型的公平性。
Google Research 在 GitHub 上以 Apache 2.0 许可开源其水文建模框架,让各国气象水文部门把 AI 洪水预测接入自有工作流。
Import AI 459 本期聚焦三大议题:弗吉尼亚大学、Anthropic 与加拿大央行的论文估算美国 AI 经济 2025 年名义 GDP 约 $250 billion。
Google Research 发布 I/O 2026 综述,介绍其在科学发现、健康、边缘计算、天气预测、Gemini 核心能力、开发者生产力、隐私保护和量子计算等方向的研究与产品进展。
推荐理由:官方长文系统梳理了研究到产品的转化路径,读者可据此理解其各条线的布局重点。
Mistral AI 在 AI Now Summit 2026 发布面向工业工程的一体化 AI 堆栈,与 Airbus、BMW、ASML 合作优化设计、仿真与生产流程,同时保障数据安全与知识产权控制。
Mistral AI 宣布 Le Chat 升级为 Vibe,一个统一覆盖工作与编码的 AI 智能体,对话、设置与套餐全部迁移。
推荐理由:原文详细列出 Work Mode 与 Code Mode 的具体能力和接入面,读者可据此判断它如何嵌入现有工作流。
Mistral AI 宣布以公开预览形式发布开源框架 Search Toolkit,把数据摄取、检索和评测整合进统一接口,覆盖云端、本地和边缘部署。其内置 BM25 稀疏检索、稠密向量检索与混合配置,以及 recall、precision、MRR、NDCG 等评测指标;Agent 可通过 MCP Connectors 从 CRM、代码仓库等源系统拉取实时数据。
Google Research 推出基于零信任聚合的私有分析服务,结合新的格基密码聚合协议与 TEE,实现设备单次消息提交即可完成聚合,无需多轮在线交互。该方案已集成到 Google 机密联邦分析系统,用于改进 Android SafetyCore 分类器准确率,同时保证用户内容仅保留在设备端。
Mistral AI 宣布将 Emmi AI 并入公司,推出面向 AI 原生工业工程的 physics AI 能力,作为企业解决方案的新基础模块,与现有模型、agentic 工作流工具和安全部署能力共同构成覆盖工程全生命周期的技术栈。
Mistral AI 通过收购 Emmi AI 加码 Physics AI,面向航空航天、汽车、半导体和能源等行业构建基础模型。其已发表成果包括 AB-UPT(可在单 GPU 上处理 9M surface 和 140M volume cells 的气动 CFD 模型)、UPT、NeuralDEM、GyroSwin 5D 等,覆盖 CFD、等离子体湍流与工业多物理过程的神经代理模型。
Jack Clark 在牛津大学 HAI Lab 的 2026 Cosmos 讲座演讲整理成文,提出面对 AI 快速进步,人们面临探索未来或退回现在的选择。他回顾 AI 进展曲线与个人使用 AI 的经历,称已把十年 newsletter 积累做成可复用的 skill,让 AI 在几分钟内完成原本需数周的图表分析工作。
Mistral AI 本周签署最终协议,收购 Physics AI 公司 Emmi AI,以强化其作为工业企业 AI 转型伙伴的地位。Emm i AI 成立于奥地利,其团队开发大型工程模型,可将多天计算替换为实时仿真并构建数字孪生;其联合创始人及 30 多名研究人员和工程师将于 5 月加入 Mistral AI 的 Science 和 Applied AI 团队。
Mistral 发布 Mistral Medium 3.5,一个 128B 稠密、256k 上下文窗口的旗舰模型,以修改版 MIT 协议开放权重,SWE-Bench Verified 得分 77.6%,τ³-Telecom 得分 91.4,最少四张 GPU 即可自托管。
推荐理由:原文给出了模型规模、价格与自托管门槛,读者可据此评估其在编码智能体场景的可用性。
Mistral AI 在 Studio 发布 Connectors,内置连接器与自定义 MCP 现已通过 API/SDK 用于所有模型和 Agent 调用,并支持直接工具调用与 human-in-the-loop 审批流。
Google DeepMind 启动首届亚太 Accelerator 项目,聚焦 "AI for the Planet",面向该地区的初创公司、研究团队和非营利组织,用前沿 AI 解决自然、气候、农业、能源等领域的环境问题。
Google 发布基于 Gemini 的科研工具 ERA,其论文今日刊于 Nature,同时开始通过 Gemini for Science 更广泛开放由 AlphaEvolve 和 ERA 构建的实验工具 Computational Discovery。
推荐理由:原文列出 ERA 在多个学科基准和五个开放科学问题上的具体结果,读者可据此判断这类工具当前能覆盖的研究范围。
Google DeepMind 介绍生物学家 Omar Abudayyeh 和 Jonathan Gootenberg 的实验室如何用 Co-Scientist 加速衰老研究。Co-Scientist 扫描数万篇论文后提出 20 多个新颖的候选遗传因子,其中部分假设经实验室验证,能成功推动细胞进入更年轻状态。它还把原本最长需耗时六个月的筛选数据与文献对照分析工作压缩到几天。
推荐理由:原文给出 Co-Scientist 在真实实验室中把文献分析从数月压缩到数天的具体用法,可迁移至其他科研数据解读场景。
Jack Clark 的 Import AI 457 期周刊汇总四条内容:SentinelOne 拆解约 20 年前的 fast16.sys 病毒,其针对 LS-DYNA 970。
Google DeepMind 在 Project Genie 中推出由 Street View 支撑的新能力,可将生成世界的起点锚定在真实地点影像上,并向全球符合条件的 Google AI Ultra $200 订阅者(18+)逐步开放。
Google DeepMind 发布 Omni 家族首个模型 Gemini Omni Flash,可将图像、音频、视频和文本组合作为输入,生成基于 Gemini 真实世界知识的高质量视频,并支持通过自然语言对话编辑视频,每次指令在上一次基础上延续,保持角色一致和场景记忆。
推荐理由:原文说明了 Omni 与 Gemini 推理能力的结合方式和开放入口,读者可据此判断它会怎样改变视频创作工作流。
Google DeepMind 推出 Gemini for Science,包含 Google Antigravity 中的 Science Skills 以及 Google Labs 上三个实验工具。
推荐理由:原文列出了三个实验工具的具体能力与开放入口,读者可据此判断它会怎样嵌入现有科研工作流。
Google DeepMind 宣布在 Search、Gemini、Chrome、Pixel 和 Cloud 扩展内容透明与验证工具:SynthID 已为超过 100 billion 张图片视频和 60,000 年音频加水印,Gemini app 的 SynthID 验证已被使用 50 million 次,现扩展到 Search 并将在数周内进入 Chrome。
推荐理由:原文列出了 SynthID 与 C2PA 在多产品线的落地节奏和采用规模,可据此判断内容溯源工具的普及路径。
Google DeepMind 作为 Google 与新加坡政府新国家 AI 合作的关键一环,在当地推出多项新计划,覆盖医疗、教育、科研与可持续发展。
Google DeepMind 介绍剑桥大学 Clare Bryant 教授使用 Co-Scientist 寻找病原体跨物种传播引发重症的分子开关。Bryant 先后输入课题摘要与完整基金申请书,工具生成并排序假设,最终锁定她此前未关注的蛋白并细化到具体氨基酸,团队正构建含相应突变的细胞系验证。她表示原本需两到三年的实验工作如今有望在六个月内完成。
Google DeepMind 介绍 Calico Life Sciences 的 AI/ML 负责人 Matt Onsum 和首席科学家 Katherine Labbé 使用 Co-Scientist 连接衰老生物学中分散的研究发现并生成值得测试的假设。
Google DeepMind 的 Co-Scientist 帮助爱丁堡大学生物工程师 Filippo Menolascina 团队缩小 MASH 联合疗法的搜索空间,并针对 resmetirom 只对少数合格患者起效的问题提出假设,将 NLRP3 inflammasome 指认为连接炎症与代谢的分子桥梁,该假设随后经实验验证,有望为靶向双联疗法铺路。
MIT 的 Ritu Raman 借助 Google DeepMind 的 Co-Scientist,将原本需数月梳理的 ALS 文献压缩为可快速验证的假设,并按可行性与风险回报排序研究方向。
斯坦福大学医学院遗传学家 Gary Peltz 的团队在 Advanced Science 发表研究,用 Google DeepMind 的 Co-Scientist 从现有药物文献中筛选可重定位治疗肝纤维化的候选药。