论文 信源:X:Rohan Paul (@rohanpaul_ai) · 👁️ 29326 次研读

CLEAR:按提示词动态调节安全对齐,兼顾模型效用

💡 灵机 AI 深度洞见与核心提炼
斯坦福新论文提出 CLEAR,通过小型门控网络按提示词动态调节独立安全模块的介入程度,冻结原模型以保留良性提示的完整性能。该方法在保持安全性的同时,显著减少全局安全微调带来的效用损失。
信源媒体:X:Rohan Paul (@rohanpaul_ai)
访问出处网页 ↗
阅读原文出处 ↗