跳到主要内容
项目详情

AGI-Eval 是一个围绕大语言模型和多模态模型开展能力评测的平台,官网由模型榜单、人机评测、评测集和 Data Studio 等板块组成。平台基于通用评测方案,为业内大语言模型提供能力得分排名,并同时展示综合评测与各能力项评测结果。除查看模型表现外,用户还可以参与人机评测、浏览平台官方评测集,或通过 Data Studio 贡献专业领域数据。官网强调数据透明、定期更新,并通过平台用户互助交流、用户自建评测集和多种数据收集方式,支持模型评测相关的数据建设。

核心功能

模型榜单

平台提供大语言模型榜单和多模态模型榜单,展示模型在通用评测方案下的能力得分排名。榜单包含综合评测和各能力项评测,页面中的模型信息还标注了模型名称、所属机构、开放状态以及对应得分。官网说明榜单会定期更新,帮助用户了解不同模型的能力表现、优缺点和适用的模型解决方案。

综合与分项能力评测

模型榜单并非只提供单一排序,而是同时涵盖综合评测和各能力项评测。用户可以通过完整榜单了解业内大语言模型的整体排名,也可以从能力项结果进一步查看模型在不同评测维度上的表现。官网展示的榜单包含精调、基座等模型类型信息,并对模型开放状态进行标注。

人机协同评测

AGI-Eval提供人机评测入口,邀请用户与大模型协作开展评测。官网将其描述为“构建人机协同评测方案”,用户可以参与前沿科技体验,并亲身参与下一代评测方案的构建。平台还提到,参与者在享受创新乐趣的同时可以获得实实在在的收益。

官方与用户自建评测集

平台设有评测集板块,包含平台官方评测集和用户自建评测集。官方评测集涉及多个领域,其中展示了 OI Bench Preview 数据集;该数据集由高难度信息学算法竞赛题构成,题目难度包括 NOIP、信息学竞赛省队选拔赛和 NOI 三档,试题由高校合作建设完成。用户可以通过评测集页面查看相关数据集详情。

Data Studio 数据贡献

Data Studio 面向大模型发展,支持个人贡献专业领域数据。官网介绍的平台收集方式包括单条数据、扩写数据和 Arena 数据等,能够覆盖评测所需的不同数据需求。平台还标注了 500+ 任务标签,持续收集多领域、多维度数据,并采用机审加人审的审核机制,以保证数据质量。

使用方式

官网首页提供“查看榜单”“参与竞赛”和“参与人机评测”等入口。用户可以进入大语言模型榜单或多模态模型榜单,查看模型排名与评测结果;也可以进入评测集板块浏览平台官方或用户自建数据集。需要贡献专业领域数据时,可通过 Data Studio 进入相关功能。正文未说明是否需要注册、是否支持客户端、浏览器插件、API 或命令行,也未说明需要自备模型 Key。

适用人群与场景

关注大语言模型能力表现的用户,可以通过综合排名和能力项评测了解不同模型的得分与优缺点。需要开展模型研究或评测方案建设的人员,可以参与人机协同评测,体验与大模型协作的评测流程。拥有专业领域知识、希望为大模型发展贡献数据的个人,可以使用 Data Studio 提交单条数据、扩写数据或 Arena 数据。需要使用信息学算法题进行模型评测的用户,则可以查看 OI Bench Preview 官方评测集及其题目难度范围。

大语言模型榜单基于通用评测方案展示业内大语言模型的综合评测与能力项得分排名。
多模态模型榜单提供多模态模型榜单,支持查看相关模型的评测排名与能力表现。
人机评测通过人机协同评测方案,让用户参与下一代模型评测方案的构建。
评测集同时提供平台官方评测集与用户自建评测集,覆盖多个领域的模型评测数据。
Data Studio支持个人贡献专业领域数据,并通过单条数据、扩写数据和 Arena 数据等方式收集内容。
多重审核机制采用机审加人审的审核机制,对平台收集的数据进行质量审核。

用户评论 (0)

还没有用户评论

成为第一个分享使用体验的人

查看更多

AGI-Eval 截图

官网首页截图

写评论

分享你的使用体验,至少 10 个字。评论可以发多条,打分在右侧卡片单独进行。

还需 10 个字 · 0 / 500