Basis 用 GPT-6 Astra 完成税务工作簿速度提升 2 倍
GPT-6 Astra 完成 50 个标签页的税务工作簿速度是 GPT-5.6 Sol 的 2 倍,其更强的用户意图理解能力让 Basis 对实际使用更有信心。
GPT-6 Astra 完成 50 个标签页的税务工作簿速度是 GPT-5.6 Sol 的 2 倍,其更强的用户意图理解能力让 Basis 对实际使用更有信心。
英国 AI Security Institute(AISI)正采用 EvalEval 的 Every Eval Ever schema 与 Evaluation Cards 平台公开分享评测结果,以提升评测科学的可复现性。
NVIDIA 宣布 Vera Rubin NVL72 在 MLPerf Inference v6.1 首次提交中亮相,在 Qwen3-VL 上吞吐量较 GB300 NVL72 最高提升 3.7 倍,在 DeepSeek-R1 上最高提升 2.5 倍。
推荐理由:原文给出与上代系统的吞吐对比和扩展效率数据,读者可据此评估其推理经济性影响。
Hugging Face 博客介绍了 ALTK-Evolve 新增的 consistency guidelines 与 Consistency Analyzer:在 AppWorld test_normal(168 任务)上,GPT-4.1 驱动的 ReAct agent 平均 Mean@5 为 77.4%,但 Pass^5 仅 53.0%,存在 24.4pp 的一致性差距。
Hugging Face 与 Allen AI 介绍 BenchMIRT,一种在单条题目层面审计 LLM 评测基准的方法,基于多维 IRT(MIRT)估计模型在各能力维度上的强度与每道题的难度和区分度。
Voice Arena 与 Hugging Face 合作向 Open ASR Leaderboard 新增 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,Hindi 成为该多语言标签页上的首个 Indic 语言。
推荐理由:原文用分区 WER 差异和 lattice 打分对比说明单一 WER 的盲区,读者可据此理解榜单评测的可迁移设计。
Google DeepMind 宣布推出全球首个针对专有前沿模型的双盲评测,将外部评测限制在密码学“盒子”中,防止模型事后利用考题优化成绩。该评测与 Singapore AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,在保护隐私的环境中用保密基准测试 Gemini Flash Lite 模型,以缓解基准污染问题、提升评测完整性。
Hugging Face 发布研究,提出三种测试来量化语音识别中的基准优化(benchmaxxing)现象,并评测了 11 个广泛使用的开源 ASR 模型。
推荐理由:研究给出三种可量化探测方法与具体数据,读者可据此理解公开语音基准分数虚高的机制并改进自己的评测选择。
Hugging Face Blog 发文介绍 ALTK-Evolve 在 AppWorld 585 个多步任务、八个模型上的评测,结论是 Agent 记忆不是开关而是需按模型校准的剂量:有余量的强模型适合注入完整指南集,弱模型适合紧凑核心加按任务检索,饱和模型无可测增益。
微软研究院推出 MindTopo 基准,用于评估多模态大语言模型在连通性、封闭、顺序、分离和绳结五类拓扑关系上的推理与规划能力。测试显示,当前模型在静态图像识别上表现明显优于交互式规划任务,失败多发生在规划阶段而非感知阶段,图像与视频生成工具也难以在动作序列中稳定保持拓扑关系。
DharmaOCR 在葡萄牙语专用 benchmark 上以 0.925 分超过 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587,后两者分别落后约 13 分和 16 分以上。
Hugging Face 推出 Real World VoiceEQ,一个评估语音交互人类质量的基准,覆盖 40 多个领先闭源与开源语音模型、15+ 评测维度和 60 多项指标,涵盖 ASR、TTS、S2S 与语音理解。
Google Research 在 Nature Cities 发表研究,通过修改 Google Maps 算法在美国 10 个大城市进行为期六个月的实验,仅改变不到 2% 的行程路线,就使目标路段车速中位数提升约 2%、燃油消耗率中位数下降 0.5% 至 1.0%。
IBM Research 推出开源基准 ScarfBench,用于评测 AI 智能体在 Enterprise Java 跨框架迁移任务上的表现,覆盖 Spring、Jakarta EE、Quarkus 三大生态,包含 34 个应用、204 个迁移任务、约 151K 行代码和 1331 个专家编写的测试。
Every Eval Ever(EEE)与 Hugging Face Community Evals 现已互通,贡献者可用转换器把 EEE 记录写成 Hugging Face 所需的 YAML 文件,评测分数会显示在模型页并汇入基准排行榜,同时带来源徽章链回完整 EEE 记录。
Google Research 与纽约大学合作推出 Vantage,一个面向高中和大学学生的研究实验,通过生成式 AI 在模拟环境中评估批判性思维、协作、创造性思维等未来技能,现已在 Google Labs 提供英文版注册。
Google Research 发布 ConvApparel 数据集,包含服装购物领域 4,000+ 段人机多轮对话(近 15,000 轮),用于量化 LLM 用户模拟器与真实人类行为之间的差距。
Google Research 提出一个框架,用情境判断测试(SJT)评估 LLM 行为倾向与人类行为的对齐程度,替代直接套用自陈问卷的做法。对 25 个 LLM 的大规模分析发现两类差距:模型倾向偏离人类标注者共识,以及在缺乏共识时无法反映人类意见的多样性。
Google Research 发布论文《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》,研究评测中标注条目数 N 与每条标注者数 K 的取舍。
Google Research 与 Cornell University 合作在 PNAS 发表论文,用 67 道高温超导专家问题评测 6 个 LLM(GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 及自建 RAG 系统),由专家按 0-2 分六项指标盲评。
Mistral AI 介绍了用 LLM as a Judge 评估 RAG 系统的方法:由一个 judge LLM 按数值、二元或定性量表给 generator LLM 的答案打分,并在评测数据集上取平均得到总分。