技巧 信源:X:Kim (@kimmonismus) · 👁️ 48588 次研读

Anthropic 发布 AI 自我改进研究,Claude 提升对齐能力

💡 灵机 AI 深度洞见与核心提炼
Anthropic 发布研究论文,让 Claude 负责改进其他 AI 模型的对齐性,包括搜索文献、提出方法、创建训练数据、训练模型并评估迭代。该方法在 60 小时内改善了全部 10 项测试的对齐失败,且未降低通用能力,甚至用较弱的 Sonnet 5 后训练了早期 Opus 4.8 检查点。Anthropic 称最佳 AAR 方法平均在六小时内优于人类专家提出的方案,但尚未实现完全递归自我改进。
信源媒体:X:Kim (@kimmonismus)
访问出处网页 ↗
阅读原文出处 ↗