LLM 多轮信息寻求评估研究
💡 灵机 AI 深度洞见与核心提炼
LLM 经常低估自己需要多少信息,所以要测试它们何时停止,而不是仅依赖答案准确率。
正确答案可能掩盖信息收集的不足。
模型可能利用先验知识或猜对答案,而没有收集足够的证据。
- arxiv. org/abs/2608.14808
标题:"Do LLMs Know What to Ask and When? Evaluating Multi-Turn Information Seeking"
信源媒体:X:Rohan Paul (@rohanpaul_ai)
访问出处网页 ↗