跳到正文
原文
Hugging Face Blog·· 2026-06-18精选AI 评分62

Hugging Face 发布 agent-eval 基准工具,评测开源模型驱动智能体使用库的效率

Is it agentic enough? Benchmarking open models on your own tooling

AI 导读

Hugging Face 发布 agent-eval 基准工具,以 transformers 为案例,衡量智能体完成任务所花的轮次、token、时间和路径,而非只看最终答案。

推荐理由

通过对比不同模型规模下的实测结果,说明面向智能体的工具改动可能对大小模型产生相反效果。

来源:Hugging Face Blog · huggingface.co