Epoch AI 发布 GSO 基准:用 OpenHands 评测大语言模型的代码性能优化能力
💡 灵机 AI 深度洞见与核心提炼
Epoch AI 的 GSO 基准通过 OpenHands 框架让大语言模型以智能体方式执行代码优化任务,模型需在 /workspace 目录修改非测试文件、保证功能等价并提升运行性能。评测设 Opt@1 与 Opt@k 两种设置,前者每题仅一次机会,后者允许 k 次尝试,推理模型可使用测试时推理,各模型的测试时计算量由人工固定并在排行榜公布,评测代码已在 GitHub 开源。
信源媒体:Epoch AI:研究、数据与评测
访问出处网页 ↗