Salesforce 提出 Critical-State RL 优化多轮工具调用
💡 灵机 AI 深度洞见与核心提炼
Salesforce AI Research 提出 Critical-State RL,用于多轮工具调用的强化学习训练:当奖励依赖后续轮次时,其变化很大程度来自下游噪声,该方法用嵌套采样分离出当前动作带来的奖励变化,只对选定的关键调用做上下文赌博机更新。在 BFCL v4 缺失函数任务上,训练选定的那一轮可提升约 14 分,而训练其他候选轮则准确率持平或下降。
信源媒体:X:DAIR.AI (@dair_ai)
访问出处网页 ↗