微软开源逆合成模型 RetroChimera,成果登上 Nature
微软研究院在 Nature 发表逆合成模型 RetroChimera,并开源其实现与权重。该模型融合 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc,通过学习式集成对两者预测重排序,在盲测中化学家更偏好其单步反应预测。
微软研究院在 Nature 发表逆合成模型 RetroChimera,并开源其实现与权重。该模型融合 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc,通过学习式集成对两者预测重排序,在盲测中化学家更偏好其单步反应预测。
Google Research 发布 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中程物流配送问题生成真实且保护隐私的基准数据,源码与文档已在 GitHub 公开。
Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的 fan-out 查询并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归生成完整结果集,无需 CoT 推理 token。
Google Research 在 ACL 2026 提出 ToolGrad,用“先答案后问题”范式生成工具调用数据:先构造真实 API 工作流,再反向标注用户查询,替代 ToolBench、ToolACE 的 DFS 试错搜索。
Google 与 HHMI Janelia、剑桥大学等合作在 Cell 发表论文,发布完整雄性果蝇大脑与中枢神经系统连接组图谱,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今按神经元数量计算最大的脑图谱。
推荐理由:Google 与 HHMI Janelia 等合作发布迄今神经元数量最多的脑图谱,读者可了解 AI 在连接组学中的具体作用。
Google Research 提出 MAPL-EMIT 深度学习框架,基于 NASA EMIT 高光谱数据自动检测、预测增强并定位全球甲烷羽流,在专家标注羽流上召回率达 84%。
Hugging Face 提出 Quantization-Aware Healing(QAH),将 GPT-OSS 120B 结构压缩至 60B 参数并量化为 MXFP4 后,在 9 项 benchmark 中有 7 项反超其 bfloat16 全精度版本,包括 AA-LCR +7.4、AIME 2025 +5.6。
Import AI 470 关注三项研究:METR 分析显示 AI 对网络安全漏洞发现加速最明显,对数学研究贡献较小,对 AI 研究本身尚无显著加速。SPADE 通过自博弈让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上游戏环境套件均分达 58.3,较基线提升 8.1。Hawkeye 则用于构建更好的 GPU kernel。
Google Research 提出知识画像(knowledge profiling)框架,将事实状态分为编码失败、召回失败等五类,并构建含 2,150 条 Wikipedia 事实的 WikiProfile 基准,评测 13 个 LLM 共约 450 万条回答。
微软研究院发布研究模型 CARE-X,一个统一胸部 X 光视觉语言模型,同时支持报告生成与结构化预测,并用强化学习(DAPO)在多任务设置下奖励临床正确性。该模型在印度 Narayana Health 的真实临床数据上验证,覆盖罕见 ICU 病理与 CT 确认的增大类病变。
Multiverse Computing 发布论文 Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss,提出两项系统改动:一次性缓存教师 top-100 logits 使教师无需驻留显存,以及不生成完整词表×序列矩阵的分块 KL 损失。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要以自然语言"信念状态"形式隔离并监督其信息内容,通过受自编码器启发的信念评分(belief grading)奖励能重建最新观测的信念。在协作编程基准 CollabBench 上,ABBEL-rec-BG 将全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 数也低于全上下文设置。
Google Research 发布大型传感器基础模型 SensorFM,用 500 万名同意参与者、超过 1 万亿分钟的多模态传感器信号做自监督预训练,学习可迁移到心血管、代谢、睡眠和心理健康的通用生理表征。
推荐理由:原文给出了预训练规模与下游任务收益的对应关系,读者可据此判断通用表征在可穿戴健康场景的迁移空间。
Google Research 在 CIDR 发布论文提出线性弹性缓存(linear elastic caching),将页面淘汰建模为 ski rental 问题,用轻量级决策树模型动态预测页面 TTL,在内存占用与缓存未命中之间权衡以降低总拥有成本(TCO)。
Google Research 在 AISTATS 2026 上提出机器遗忘审计新框架 Regularized f-Divergence Kernel Tests,通过相对距离测试衡量遗忘后模型更接近安全重训模型还是原始受污染模型。
Google Research 在 Nature 发表论文介绍 PHRM 系统,可在日常使用手机时通过前置摄像头在人脸解锁后拍摄视频,被动估计心率与静息心率,心率 MAPE < 10%,日均静息心率相对可穿戴设备 MAE < 5 bpm。
推荐理由:原文给出了跨肤色非劣性标准与真实场景验证方法,可迁移用于评估rPPG类健康监测模型的公平性。
Google DeepMind 发表新论文 Decoupled DiLoCo,将大训练任务拆分为解耦的算力岛屿并以异步数据流连接,使局部硬件故障不影响其他部分继续训练。
推荐理由:原文给出了带宽、容错和跨代硬件混训的具体实验结果,可据此评估分布式训练路线的实际可行性。
伯克利 AI 研究团队提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而让基于学习动力学(世界模型)的长时程规划变得实用。该方法针对长时程 rollout 中梯度爆炸/消失、非贪心结构导致的局部极小值以及高维视觉模型梯度脆弱等问题。
Google Research 在 Transactions on Machine Learning Research 发表论文,提出 reasoning-first 的合成数据生成框架 Simula,通过全局多样性、局部多样性、复杂度和质量四个可控轴从第一性原理构建数据集。
Google Research 发布 ConvApparel 数据集,包含服装购物领域 4,000+ 段人机多轮对话(近 15,000 轮),用于量化 LLM 用户模拟器与真实人类行为之间的差距。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,可在特征、数据与模型组件归因中大规模识别驱动 LLM 输出的关键交互。SPEX 利用稀疏性与低阶性把交互搜索转化为稀疏恢复问题,ProxySPEX 进一步借助层级结构,以约 10 倍更少的消融达到 SPEX 的性能。
伯克利 AI 研究团队提出一套基于互信息的成像系统评估与优化框架,可直接从含噪测量中估计信息量,并在彩色摄影、射电天文、无透镜成像和显微成像四个领域验证其能预测解码器性能。该方法优化出的设计达到端到端 SOTA 方法水平,同时占用更少内存和算力,且无需任务专用解码器设计。