技巧 信源:Hacker News 热门(buzzing.cc 中文翻译) · 👁️ 12127 次研读

为什么下一个令牌预测器是对 LLM 的错误思维模型

💡 灵机 AI 深度洞见与核心提炼
作者认为下一个令牌预测器只是对 LLM 的零阶近似,机制形态正确但不完整。现代后训练中的 RLVR 让模型通过自己探索生成的新序列并获得奖励来学习,类似会穷尽探索的象棋引擎而非模仿大师棋谱的下一步预测器,因此 RLHF 和 RLVR 编码的内容早已超出对现有文本的预测。
信源媒体:Hacker News 热门(buzzing.cc 中文翻译)
访问出处网页 ↗
阅读原文出处 ↗