Google Research 提出机器遗忘审计新框架 Regularized f-Divergence Kernel Tests
Google Research 在 AISTATS 2026 上提出机器遗忘审计新框架 Regularized f-Divergence Kernel Tests,通过相对距离测试衡量遗忘后模型更接近安全重训模型还是原始受污染模型。
Google Research 在 AISTATS 2026 上提出机器遗忘审计新框架 Regularized f-Divergence Kernel Tests,通过相对距离测试衡量遗忘后模型更接近安全重训模型还是原始受污染模型。
Google DeepMind 公布了在塞拉利昂开展的 Guided Learning 预注册试验结果,学生数学成绩相对对照组提升 +0.258 个标准差,约相当于八周内 1.2 至 1.7 年的学习进度;教师将 Gemini 纳入约一半课程(目标 12 小时)的班级提升更大,约 1.8 至 2.5 年。
推荐理由:原文给出了预注册试验的量化结果与开放的教师培训材料,读者可据此评估 AI 辅助教学的实际效果与可复用做法。
Google Research 在 Nature 发表论文介绍 PHRM 系统,可在日常使用手机时通过前置摄像头在人脸解锁后拍摄视频,被动估计心率与静息心率,心率 MAPE < 10%,日均静息心率相对可穿戴设备 MAE < 5 bpm。
推荐理由:原文给出了跨肤色非劣性标准与真实场景验证方法,可迁移用于评估rPPG类健康监测模型的公平性。
Mistral AI 通过收购 Emmi AI 加码 Physics AI,面向航空航天、汽车、半导体和能源等行业构建基础模型。其已发表成果包括 AB-UPT(可在单 GPU 上处理 9M surface 和 140M volume cells 的气动 CFD 模型)、UPT、NeuralDEM、GyroSwin 5D 等,覆盖 CFD、等离子体湍流与工业多物理过程的神经代理模型。
斯坦福大学医学院遗传学家 Gary Peltz 的团队在 Advanced Science 发表研究,用 Google DeepMind 的 Co-Scientist 从现有药物文献中筛选可重定位治疗肝纤维化的候选药。
Google DeepMind 发表新论文 Decoupled DiLoCo,将大训练任务拆分为解耦的算力岛屿并以异步数据流连接,使局部硬件故障不影响其他部分继续训练。
推荐理由:原文给出了带宽、容错和跨代硬件混训的具体实验结果,可据此评估分布式训练路线的实际可行性。
Google Research 在 ICLR 论文 ReasoningBank: Scaling Agent Self-Evolving with Reasoning Memory 中提出一种智能体记忆框架,从成功与失败经验中提炼高层推理模式,实现测试时自我进化。
伯克利 AI 研究团队提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而让基于学习动力学(世界模型)的长时程规划变得实用。该方法针对长时程 rollout 中梯度爆炸/消失、非贪心结构导致的局部极小值以及高维视觉模型梯度脆弱等问题。
Google Research 在 Transactions on Machine Learning Research 发表论文,提出 reasoning-first 的合成数据生成框架 Simula,通过全局多样性、局部多样性、复杂度和质量四个可控轴从第一性原理构建数据集。
Google Research 发布论文 MoGen,用合成神经元形态改进 AI 脑图谱重建模型,使重建误差降低 4.4%,在完整小鼠脑尺度相当于节省 157 人年的手工校对工作。
Google Research 发布 ConvApparel 数据集,包含服装购物领域 4,000+ 段人机多轮对话(近 15,000 轮),用于量化 LLM 用户模拟器与真实人类行为之间的差距。
Google Research 提出一个框架,用情境判断测试(SJT)评估 LLM 行为倾向与人类行为的对齐程度,替代直接套用自陈问卷的做法。对 25 个 LLM 的大规模分析发现两类差距:模型倾向偏离人类标注者共识,以及在缺乏共识时无法反映人类意见的多样性。
Google Research 发布论文《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》,研究评测中标注条目数 N 与每条标注者数 K 的取舍。
Google Research 与多家 NHS 机构合作开展 AIMS 研究,在 Nature Cancer 发表两项研究评估 AI 乳腺癌检测系统。
推荐理由:研究给出了AI作为第二读片人的具体读片量与时间节省数据,可帮助评估其在筛查流程中的实际落地空间。
Google Research 与 Cornell University 合作在 PNAS 发表论文,用 67 道高温超导专家问题评测 6 个 LLM(GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 及自建 RAG 系统),由专家按 0-2 分六项指标盲评。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,可在特征、数据与模型组件归因中大规模识别驱动 LLM 输出的关键交互。SPEX 利用稀疏性与低阶性把交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层级结构,以约 10 倍更少的消融达到 SPEX 的性能。
伯克利 AI 研究团队提出一套基于互信息的成像系统评估与优化框架,可直接从含噪测量中估计信息量,并在彩色摄影、射电天文、无透镜成像和显微成像四个领域验证其能预测解码器性能。该方法优化出的设计达到端到端 SOTA 方法水平,同时占用更少内存和算力,且无需任务专用解码器设计。
Berkeley AI Research 的新论文为 word2vec 的学习过程给出了定量且可预测的理论:在合理近似下,其学习问题可化简为无权最小二乘矩阵分解,梯度流动力学有闭式解,最终学到的表示等价于对目标矩阵 M* 做 PCA。