跳到正文
原文
Hugging Face Blog·· 28 天前AI 评分56

BenchMIRT:审计 LLM 评测基准在题目层面究竟测量什么

BenchMIRT: What are LLM benchmarks actually measuring?

AI 导读

Hugging Face 与 Allen AI 介绍 BenchMIRT,一种在单条题目层面审计 LLM 评测基准的方法,基于多维 IRT(MIRT)估计模型在各能力维度上的强度与每道题的难度和区分度。

来源:Hugging Face Blog · huggingface.co