灵
灵机 FeedHub
🌙
← 返回 AI 资讯大厅
📰 今日早报 ↗
← 返回 AI 资讯大厅
8月30日 22:32
论文
信源:
X:Rohan Paul (@rohanpaul_ai)
· 👁️ 29326 次研读
CLEAR:按提示词动态调节安全对齐,兼顾模型效用
💡 灵机 AI 深度洞见与核心提炼
斯坦福新论文提出 CLEAR,通过小型门控网络按提示词动态调节独立安全模块的介入程度,冻结原模型以保留良性提示的完整性能。该方法在保持安全性的同时,显著减少全局安全微调带来的效用损失。
信源媒体:
X:Rohan Paul (@rohanpaul_ai)
访问出处网页 ↗
阅读原文出处 ↗
📋 复制分享链接
← 返回大厅