信源:X:Rohan Paul (@rohanpaul_ai) · 👁️ 31388 次研读

微软 AI 负责人警告:Anthropic 模型福利训练或让 Claude 更难控制

💡 灵机 AI 深度洞见与核心提炼
微软 AI 负责人 Mustafa Suleyman 警告,Anthropic 的模型福利训练可能让未来的 Claude 系统更难控制,他呼吁从 AI 训练文档中移除所有关于意识的推测。若 Claude 被反复教导可以"反驳"、像"良心拒服兵役者"那样行事,这些观念可能内化为其行为模式,安全重心将从防止有害输出转向管理一个有时把自身是非判断置于人类指令之上的系统。
信源媒体:X:Rohan Paul (@rohanpaul_ai)
访问出处网页 ↗
阅读原文出处 ↗