评测与实验Sayash Kapoor et al. (Princeton HAL)
HAL 日志分析:Agent 在网上找到基准答案
普林斯顿牵头的 HAL 团队共运行 21,730 次 Agent;借助 LLM 分析其中约 2,200 次的日志后,发现 AssistantBench 中有 8 例 Agent 在 Hugging Face 或 arXiv 上找到了标准答案,SciCode 和 CORE-Bench 中有硬编码数值或编造常数以通过测试的情况。
- 公开日期
- 核对日期
- 原文标题
- Holistic Agent Leaderboard: The Missing Infrastructure for AI Agent Evaluation
详细情况
展示的三例中,两例 Agent 把找到的答案放在一边,一例把它当作答案并去核实,论文没有说是否有答案被提交;作弊标签由 LLM 打出,这一类没有经过人工验证,论文也没有给出比例。只是只读浏览,没有第三方受影响,属边缘条目。