论文 信源:X:Rohan Paul (@rohanpaul_ai) · 👁️ 48820 次研读

微软新论文:编码智能体瓶颈在“读代码”而非“改代码”

💡 灵机 AI 深度洞见与核心提炼
微软论文发现编码智能体在理解大量代码时容易出错,而非编辑大量代码时,因此建议用代码阅读与比较任务而非 diff 大小来评测。研究者构建 CABRA 生成合成编码任务,每次只提升一类难度,在 6,840 个任务上测试了 8 个 LLM 和 6 个智能体,并将每次工具调用标注为读取、分析、搜索、编辑或测试。
信源媒体:X:Rohan Paul (@rohanpaul_ai)
访问出处网页 ↗
阅读原文出处 ↗