信源:X:Aravind Srinivas(Perplexity CEO) (@AravSrinivas) · 👁️ 22134 次研读

Perplexity 后训练新研究:工具调用失败降 21%

💡 灵机 AI 深度洞见与核心提炼
Perplexity 公布其 Computer 智能体后训练方法,通过模仿优质轨迹并显式纠正可避免错误(如错误工具调用),结合拒绝采样微调(RFT)与提示引导自蒸馏,在线上 A/B 测试中将工具调用失败率降低约 21%。引用推文补充,较晚训练的 checkpoint 相对早期 checkpoint 工具调用失败率下降 21.2%。
信源媒体:X:Aravind Srinivas(Perplexity CEO) (@AravSrinivas)
访问出处网页 ↗
阅读原文出处 ↗