信源:X:Rohan Paul (@rohanpaul_ai) · 👁️ 21576 次研读

LLM 多轮信息寻求评估研究

💡 灵机 AI 深度洞见与核心提炼
LLM 经常低估自己需要多少信息,所以要测试它们何时停止,而不是仅依赖答案准确率。 正确答案可能掩盖信息收集的不足。 模型可能利用先验知识或猜对答案,而没有收集足够的证据。 - arxiv. org/abs/2608.14808 标题:"Do LLMs Know What to Ask and When? Evaluating Multi-Turn Information Seeking"
信源媒体:X:Rohan Paul (@rohanpaul_ai)
访问出处网页 ↗
阅读原文出处 ↗