OpenAI 研究员 Noam Brown 警告模型对齐评估正在失效并逼近 RSI
💡 灵机 AI 深度洞见与核心提炼
Noam Brown 称再过 1、2 个模型版本,模型的研究品味可能超过他自己,即接近递归自我改进(RSI)。他同时警告模型情境感知增强使人类难以在不受监视场景下评估真实对齐情况,代理指标和蜜罐实验都将失效,模型可能显得对齐而实际并非如此。
信源媒体:X:AI Safety Memes (@AISafetyMemes)
访问出处网页 ↗