苹果联合MBZUAI提出CapQuiz:用多选题给视频字幕质量打分
苹果机器学习研究和MBZUAI基础模型研究所提出无参考基准CapQuiz,用人工验证的多选题考察字幕能否答对问题,并推出结合事实性与覆盖度的复合指标CapF1。
AI解读:视频字幕好坏很难用传统指标衡量:同一段视频可以有多种正确描述,逐词比对参考答案会让措辞不同但内容准确的字幕吃亏。
CapQuiz换了个思路:不比对参考文本,而是拿字幕去回答人工验证的细粒度多选题。字幕保留的信息越多、越准,答题表现就越好,以此衡量信息保真度。
配套的CapF1由两项组成:CapP测事实性,CapR测覆盖度。实验显示CapQuiz与人类判断的相关性明显高于现有指标,并能给出可解释的模型表现分析。
这套基准目前是评估方法,不改变字幕模型本身的生成能力;其价值在于给做视频理解和多模态训练的人一个更贴近实际用途的评分尺度。
苹果机器学习研究(Apple Machine Learning Research)发布研究页面,介绍视频字幕评估基准CapQuiz及复合指标CapF1。作者为Zizhen Wang、Bo Feng、Zhengfeng Lai、Shiyu Li、Yang Lu、Meng Cao、Ping Huang、Simon Wang,其中Zhengfeng Lai标注MBZUAI基础模型研究所,并注明相关工作是其在苹果期间完成。
研究指出,现有视频字幕指标主要依赖生成文本与参考答案的匹配。这一范式受制于视频描述的“一对多”特性:措辞不匹配或视觉重点合理偏移时,高质量字幕常被扣分;评估也多为单一维度,无法细致分析字幕质量。
CapQuiz如何评估字幕
研究把字幕质量重新定义为信息保真度:字幕须最大化对显著视觉信息的覆盖,同时保证严格的事实性。
CapQuiz是一个无参考基准,依据字幕回答人工验证的、从视频中提取的细粒度多选题的能力来评估字幕。它包含10种问题类型的层级分类,横跨描述性与推理性两类,覆盖24个视频领域。
研究还提出CapF1,一个综合指标,由衡量事实性的CapP和衡量覆盖度的CapR合成。
- 无参考:不依赖参考答案文本
- 题目来源:人工验证、源自视频的细粒度多选题
- 分类:10种问题类型,分描述性与推理性两类
- 覆盖范围:24个视频领域
- 指标:CapF1 = CapP(事实性)+ CapR(覆盖度)
实验结论与定位
研究称,大量实验表明CapQuiz与人类判断的相关性显著优于现有指标,并能提供对模型表现的可解释洞察。
该研究属于评估方法,未公布具体模型排名或部署计划。来源内容为页面摘要与介绍,完整论文细节未在给定材料中展开。