灵
灵机 FeedHub
🌙
← 返回 AI 资讯大厅
📰 今日早报 ↗
← 返回 AI 资讯大厅
10月2日 10:16
技巧
信源:
X:Rohan Paul (@rohanpaul_ai)
· 👁️ 23721 次研读
MerchantBench 评测显示八款 LLM 长周期任务表现远逊人类,最好模型仅达人类 27.3%
💡 灵机 AI 深度洞见与核心提炼
MerchantBench 用 365 天电商模拟环境评测八款 LLM 智能体在长期连贯性上的表现,包括 GPT-5.6 Sol 和 Claude Opus 4.8。
信源媒体:
X:Rohan Paul (@rohanpaul_ai)
访问出处网页 ↗
阅读原文出处 ↗
📋 复制分享链接
← 返回大厅