微软研究:将物理 AI 推理卸载到边缘或云端可提升机器人性能与续航
微软研究院对移动机器人操作负载的系统性测量显示,把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 可提升任务表现并延长续航。
推荐理由:微软对机器人推理负载的系统性测量显示,把推理从机载 GPU 卸载到边缘或云端可提升任务成功率与续航,并给出可复用的 Kubernetes 工具链。
微软研究院对移动机器人操作负载的系统性测量显示,把物理 AI 推理从机载 GPU 卸载到边缘或云端 GPU 可提升任务表现并延长续航。
推荐理由:微软对机器人推理负载的系统性测量显示,把推理从机载 GPU 卸载到边缘或云端可提升任务成功率与续航,并给出可复用的 Kubernetes 工具链。
Hugging Face 提出 Quantization-Aware Healing(QAH),将 GPT-OSS 120B 结构压缩至 60B 参数并量化为 MXFP4 后,在 9 项 benchmark 中有 7 项反超其 bfloat16 全精度版本,包括 AA-LCR +7.4、AIME 2025 +5.6。
Import AI 470 关注三项研究:METR 分析显示 AI 对网络安全漏洞发现加速最明显,对数学研究贡献较小,对 AI 研究本身尚无显著加速。SPADE 通过自博弈让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上游戏环境套件均分达 58.3,较基线提升 8.1。Hawkeye 则用于构建更好的 GPU kernel。
Multiverse Computing 发布论文 Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss,提出两项系统改动:一次性缓存教师 top-100 logits 使教师无需驻留显存,以及不生成完整词表×序列矩阵的分块 KL 损失。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 的摘要以自然语言"信念状态"形式隔离并监督其信息内容,通过受自编码器启发的信念评分(belief grading)奖励能重建最新观测的信念。在协作编程基准 CollabBench 上,ABBEL-rec-BG 将全上下文模型的性能差距缩小约 50%,训练步数从 100 降至 50,峰值 token 数也低于全上下文设置。
Google Research 在 CIDR 发布论文提出线性弹性缓存(linear elastic caching),将页面淘汰建模为 ski rental 问题,用轻量级决策树模型动态预测页面 TTL,在内存占用与缓存未命中之间权衡以降低总拥有成本(TCO)。
伯克利 AI 研究团队提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、向状态迭代直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而让基于学习动力学(世界模型)的长时程规划变得实用。该方法针对长时程 rollout 中梯度爆炸/消失、非贪心结构导致的局部极小值以及高维视觉模型梯度脆弱等问题。