论文 信源:X:Rohan Paul (@rohanpaul_ai) · 👁️ 16090 次研读

Claude 自主对齐其他 AI,超越 28 位研究员

💡 灵机 AI 深度洞见与核心提炼
Anthropic 新研究显示,Claude 可自主完成对齐研究,且被纠正的模型比执行纠正的模型能力更强。Claude 自主发现的安全训练方法,超越了 28 位资深研究员各自提出的方案。五个智能体并行工作长达 48 小时,共享结果,并通过隐藏测试和能力门控筛选过拟合与明显退化。
信源媒体:X:Rohan Paul (@rohanpaul_ai)
访问出处网页 ↗
阅读原文出处 ↗