Hugging Face 博客介绍 ALTK-Evolve 的一致性指南功能
Hugging Face 博客介绍了 ALTK-Evolve 新增的 consistency guidelines 与 Consistency Analyzer:在 AppWorld test_normal(168 任务)上,GPT-4.1 驱动的 ReAct agent 平均 Mean@5 为 77.4%,但 Pass^5 仅 53.0%,存在 24.4pp 的一致性差距。
Hugging Face 博客介绍了 ALTK-Evolve 新增的 consistency guidelines 与 Consistency Analyzer:在 AppWorld test_normal(168 任务)上,GPT-4.1 驱动的 ReAct agent 平均 Mean@5 为 77.4%,但 Pass^5 仅 53.0%,存在 24.4pp 的一致性差距。
Hugging Face 与 Allen AI 介绍 BenchMIRT,一种在单条题目层面审计 LLM 评测基准的方法,基于多维 IRT(MIRT)估计模型在各能力维度上的强度与每道题的难度和区分度。
Hugging Face 发布研究,提出三种测试来量化语音识别中的基准优化(benchmaxxing)现象,并评测了 11 个广泛使用的开源 ASR 模型。
推荐理由:研究给出三种可量化探测方法与具体数据,读者可据此理解公开语音基准分数虚高的机制并改进自己的评测选择。
Hugging Face Blog 发文介绍 ALTK-Evolve 在 AppWorld 585 个多步任务、八个模型上的评测,结论是 Agent 记忆不是开关而是需按模型校准的剂量:有余量的强模型适合注入完整指南集,弱模型适合紧凑核心加按任务检索,饱和模型无可测增益。
Import AI 第 469 期介绍了新基准 DiG-bench(Discovery in Games),包含 70 款规则与目标均隐藏、需靠交互探索发现的游戏,其中 21 款已公开。
微软研究院推出 MindTopo 基准,用于评估多模态大语言模型在连通性、封闭、顺序、分离和绳结五类拓扑关系上的推理与规划能力。测试显示,当前模型在静态图像识别上表现明显优于交互式规划任务,失败多发生在规划阶段而非感知阶段,图像与视频生成工具也难以在动作序列中稳定保持拓扑关系。
Hugging Face 推出 Real World VoiceEQ,一个评估语音交互人类质量的基准,覆盖 40 多个领先闭源与开源语音模型、15+ 评测维度和 60 多项指标,涵盖 ASR、TTS、S2S 与语音理解。
Google Research 在 Nature Cities 发表研究,通过修改 Google Maps 算法在美国 10 个大城市进行为期六个月的实验,仅改变不到 2% 的行程路线,就使目标路段车速中位数提升约 2%、燃油消耗率中位数下降 0.5% 至 1.0%。
IBM Research 推出开源基准 ScarfBench,用于评测 AI 智能体在 Enterprise Java 跨框架迁移任务上的表现,覆盖 Spring、Jakarta EE、Quarkus 三大生态,包含 34 个应用、204 个迁移任务、约 151K 行代码和 1331 个专家编写的测试。
Google Research 发布 ConvApparel 数据集,包含服装购物领域 4,000+ 段人机多轮对话(近 15,000 轮),用于量化 LLM 用户模拟器与真实人类行为之间的差距。
Google Research 提出一个框架,用情境判断测试(SJT)评估 LLM 行为倾向与人类行为的对齐程度,替代直接套用自陈问卷的做法。对 25 个 LLM 的大规模分析发现两类差距:模型倾向偏离人类标注者共识,以及在缺乏共识时无法反映人类意见的多样性。
Google Research 发布论文《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》,研究评测中标注条目数 N 与每条标注者数 K 的取舍。
Google Research 与 Cornell University 合作在 PNAS 发表论文,用 67 道高温超导专家问题评测 6 个 LLM(GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 及自建 RAG 系统),由专家按 0-2 分六项指标盲评。