信源:Hacker News 热门(buzzing.cc 中文翻译) · 👁️ 44755 次研读

动态消除:用 Engram 多层引导在 Qwen3-4B 上实现无损拒绝抑制

💡 灵机 AI 深度洞见与核心提炼
一种名为 Dynamic Abliteration 的方法通过 PyTorch forward hooks 在运行时拦截多层残差流,无需修改权重即可抑制 Qwen3-4B 的拒绝行为,基座模型权重保持 100% 冻结。该方案在 A100 上以 Qwen/Qwen3-4B(隐藏维度 2560、36 层)为概念验证,对比了传统单层拒绝向量减法会永久改变权重并损害非拒绝任务的问题。
信源媒体:Hacker News 热门(buzzing.cc 中文翻译)
访问出处网页 ↗
阅读原文出处 ↗