TriviaQA:开放域问答与 RAG 评测基准
💡 灵机 AI 深度洞见与核心提炼
TriviaQA 将问题与支撑性的网页或 Wikipedia 证据配对,要求模型通过检索与阅读理解抽取或生成精确答案。该数据集问题覆盖面广、措辞多样,常用于考察模型的知识覆盖与抗改写能力,性能通常以 exact-match 和 F1 分数报告。它因此被广泛用于模型报告中的开放域问答与检索增强生成(RAG)评测。
信源媒体:Epoch AI:研究、数据与评测
访问出处网页 ↗