研究发现聊天模板切换大语言模型自指代语气,激活引导可复现该行为

💡 灵机 AI 深度洞见与核心提炼
研究显示,聊天模板像开关一样控制大语言模型的自指代语气:在 8 个 1B-9B 开源 instruct 模型上,移除模板后免责声明语气从 0.53 降至 0.36,体验性语气从 0.01 升至 0.15。在 3 个模型的激活空间中找到可引导该行为的方向,加入后免责声明率从 0.52 升至 0.70,移除后降至 0.25,随机方向影响甚微。
信源媒体:Hacker News 热门(buzzing.cc 中文翻译)
访问出处网页 ↗