Hugging Face Blog·· 28 天前AI 评分56
BenchMIRT:审计 LLM 评测基准在题目层面究竟测量什么
BenchMIRT: What are LLM benchmarks actually measuring?
AI 导读
Hugging Face 与 Allen AI 介绍 BenchMIRT,一种在单条题目层面审计 LLM 评测基准的方法,基于多维 IRT(MIRT)估计模型在各能力维度上的强度与每道题的难度和区分度。
来源:Hugging Face Blog · huggingface.co