论文《Stop Comparing LLM Agents Without Disclosing the Harness》:harness 对长程智能体评测的影响可能超过模型本身
💡 灵机 AI 深度洞见与核心提炼
一篇 arXiv 论文(arxiv.org/abs/2605.23950)提出,长程智能体评测中 harness 的影响可能大于模型本身,比较基准分数时应披露或控制 harness。
信源媒体:X:Rohan Paul (@rohanpaul_ai)
访问出处网页 ↗