MMBench 是一个面向多模态模型、尤其是视觉语言模型的能力评测基准,由 Shanghai AI Laboratory、南洋理工大学、香港中文大学、国立新加坡大学和浙江大学等机构的项目成员共同参与。它围绕多模态模型在图像理解和推理任务中的表现,组织了约 3000 道选择题,覆盖目标检测、文字识别、动作识别、图像描述、关系推理以及其他 20 个细粒度评测维度。与只对每道题进行一次选项判断的传统 top-1 准确率评测不同,MMBench 通过对选项进行循环移位并检查模型答案的一致性,降低噪声对评测结果的影响,同时提供一种基于 ChatGPT 的模型输出选项匹配方法。
核心功能
多维度多模态能力评测
MMBench 使用选择题形式组织视觉与语言相关任务,评测内容包括目标检测、文字识别、动作识别、图像描述和关系推理。官网还说明,数据集覆盖上述任务以及另外 20 个细粒度评测维度,因此输出并非只对应单一的图像识别能力,而是用于观察模型在多个多模态任务上的表现。
约 3000 道评测题
官网介绍该基准包含 Approximately 3000 multiple-choice questions,即约 3000 道多项选择题。每道题围绕问题、若干选项和模型答案进行评测,页面给出的示例是从图像中判断苹果数量,并将正确答案与模型在不同选项排列下的回答进行比较。
Circular Evaluation 循环评测
循环评测会重复使用同一道选择题,同时对选项进行循环移位。官网示例展示了 4 次评测,选项顺序分别发生变化;如果模型在这些排列下不能保持一致回答,则该题会被判定为错误。官网指出,相比传统的 1-pass top-1 accuracy evaluation,这种方式会使平均准确率下降 10%~20%,但目标是减少噪声对评测结果的影响,并提升结果的可复现性。
模型输出选项匹配
MMBench 提供一种基于 ChatGPT 的输出提取方法,用于将模型生成的答案与题目选项进行匹配。即使模型没有严格按照指令输出,也可以根据答案与选项的相似程度匹配到最合理的选项;当所有选项与答案的含义都明显不同时,示例中的规则要求输出 E。页面同时给出了 teddy bear 与 Spider 两个示例,说明该方法既能识别近似表达,也能处理没有对应选项的回答。
评测结果与数据集使用入口
网站导航提供 Home、Leaderboard 和 Documentation 页面,并设置了 EvaluationLogin 入口。页面还提供 Download 区域,提示用户通过 Docs 查看数据集的使用方式;因此,用户可以从文档了解数据集如何使用,并通过排行榜查看评测相关信息。官网正文没有进一步说明登录条件、具体下载格式或完整评测命令。
使用方式
MMBench 官网提供网页端的 Home、Leaderboard 和 Documentation 入口,并在 Download 区域引导用户查看 Docs 以了解数据集使用方式。页面同时显示 EvaluationLogin,但正文没有明确说明是否必须注册、登录后可使用哪些功能,也没有给出独立 API、客户端或命令行工具的说明。官网还提供 GitHub OpenCompass 入口以及论文引用信息,便于进一步查看项目相关资料。
适用人群与场景
多模态模型研究者可以使用 MMBench 检查模型在目标检测、文字识别、图像描述和关系推理等任务上的表现。需要比较不同视觉语言模型的团队,可以参考其多维度选择题和 Leaderboard 入口。关注评测稳定性与可复现性的研究人员,可以使用循环评测观察模型在选项顺序变化下是否保持一致。需要处理模型自由格式答案的评测开发者,则可以参考官网展示的模型输出选项匹配方法。
注意事项
MMBench 的循环评测结果与传统单次 top-1 准确率并不相同,官网明确指出平均准确率可能下降 10%~20%。官网正文没有给出价格、免费额度、API 使用政策,也没有说明登录要求、数据隐私政策或模型服务配置。页面中的选项匹配规则示例要求输出单个大写字符,且示例文本中出现了选项字母说明,实际使用时应以 Documentation 中的数据集说明为准。