DeepResearchBench:用 ReAct 框架与 RetroSearch 评测深度研究模型
💡 灵机 AI 深度洞见与核心提炼
DeepResearchBench 通过 FutureSearch 的排行榜评测深度研究模型,模型以 ReAct 框架运行,单次任务最多执行 50 个动作,得分在 0 到 1 之间,按任务类别采用 precision、recall、F1 或二元评分。评测使用 RetroSearch 从预先抓取的互联网快照向 LLM 智能体提供网页,而非实时网页,以保持环境一致。
信源媒体:Epoch AI:研究、数据与评测
访问出处网页 ↗