Anthropic 等研究:模型能识别自己是否正被测试,并提出 critique refinement 与 DISH 提升评估真实性
💡 灵机 AI 深度洞见与核心提炼
研究团队研究模型能否察觉自己正在被测试,发现能力较强的模型可以区分被测试与真实部署,这会削弱安全评估结论的效力。论文提出两种技术:critique refinement 用额外推理时算力让模拟器动作更贴近部署,DISH(Deployment-Imitating SWE-Agent Harness)用真实 agent harness 缩小模拟编码环境与生产环境的差距。
信源媒体:X:DAIR.AI (@dair_ai)
访问出处网页 ↗