τ^τ-Bench 论文:Claude Opus 5 在 Claude Code 下构建客服智能体仅通过 23.9% 评估,专家人类参考为 82.2%
💡 灵机 AI 深度洞见与核心提炼
Sierra 与普林斯顿大学发布 τ^τ-Bench(hyper-tau-bench)基准,把智能体构建本身设为任务:开发者智能体获得真实业务记录、掌握需求的客户、生产 API、待继承代码库和服务成本与模型限制,需交付一个可用的客服智能体,并用保留的模拟用户部署评分,共 4 个领域 53 个任务。
信源媒体:X:DAIR.AI (@dair_ai)
访问出处网页 ↗