论文 信源:Epoch AI:研究、数据与评测 · 👁️ 26112 次研读

Video-MME:多模态大语言模型视频理解全谱系基准

Video-MME:多模态大语言模型视频理解全谱系基准
💡 灵机 AI 深度洞见与核心提炼
Video-MME 是面向多模态大语言模型的视频理解全谱系基准,包含来自 6 大领域、30 个子类的 900 段视频(约 254 小时)和 2700 道专家标注的选择题。视频覆盖短(<2 分钟)、中(4–15 分钟)、长(30–60 分钟)三种时长,模型可仅凭视觉帧或结合字幕与音频评估,榜单按视频时长和字幕设置报告准确率,揭示模型在更长、更复杂序列上的性能下降。
信源媒体:Epoch AI:研究、数据与评测
访问出处网页 ↗
阅读原文出处 ↗