前沿模型能否成为自主研究者?评测揭示三大发现
💡 灵机 AI 深度洞见与核心提炼
美团LongCat在36项AI研发任务上评测7个前沿模型,覆盖756条轨迹。结果显示:强优化性能不等于真正创新,252个方案中仅3个算新颖;可靠性比峰值性能更能区分模型;经验积累可能有益也可能误导,而自动化harness优化带来的收益可迁移至其他任务和模型。当前智能体更像工程优化器而非完全自主研究者。
信源媒体:X:美团 LongCat (@Meituan_LongCat)
访问出处网页 ↗