PostTrainBench v1.1:CLI 智能体后训练能力评测基准
💡 灵机 AI 深度洞见与核心提炼
PostTrainBench v1.1 评测 CLI 智能体在受限条件下的后训练能力:给定 1–4B 参数的小型基础语言模型、单块 H100 GPU 和 10 小时时间窗口,智能体需自行选择数据、微调方式与算力分配来提升模型表现,不允许预设策略、起始代码或人工干预。最终成绩在 4 个基础模型和 7 个下游评测基准上汇总,反映的是广泛的后训练能力而非单一模型或任务的表现。
信源媒体:Epoch AI:研究、数据与评测
访问出处网页 ↗