SPACE 论文提出技能引导自适应动作分块,长程 Agent 减少 78.9% LLM 调用
💡 灵机 AI 深度洞见与核心提炼
论文《Act More, Decide Less》提出 SPACE,从成功轨迹归纳两级程序化技能,用子技能边界作为块边界监督,再经混合 on/off-policy 优化与 chunk-aware credit assignment 蒸馏出 primitive-chunk 策略。
信源媒体:X:DAIR.AI (@dair_ai)
访问出处网页 ↗