跳到主要内容
项目详情

PubMedQA 是一个面向生物医学研究问题回答的数据集,官网将其定义为“A Dataset for Biomedical Research Question Answering”。它围绕研究问题及其对应摘要,要求模型回答 yes、no 或 maybe,例如判断术前使用他汀类药物是否会降低冠状动脉旁路移植术后的房颤风险。与只关注通用问答的任务不同,PubMedQA 将问题回答限定在生物医学研究语境,并进一步提供 reasoning-required setting 下的模型排行榜,用于展示不同模型在该任务上的表现。官网同时提供数据集规模说明、GitHub 数据与代码仓库入口、模型提交说明以及论文引用信息。

核心功能

基于摘要回答研究问题

PubMedQA 使用与研究问题对应的摘要作为回答依据,任务目标是对问题作出 yes、no 或 maybe 判断。官网给出的示例属于临床研究问题,展示了该数据集如何将生物医学文献内容转化为可评测的问答任务。

专家标注数据

数据集中包含 1k 条 expert labeled QA instances,即经过专家标注的问答实例。这部分数据可用于围绕生物医学研究问答进行模型训练、验证或评测,官网明确将其作为数据集组成的一部分列出。

未标注问答数据

PubMedQA 还包含 61.2k 条 unlabeled QA instances。官网仅说明了这部分数据的规模与未标注属性,没有进一步说明具体标注流程或推荐使用方式,因此使用者需要根据项目需求处理这部分数据。

人工生成问答数据

数据集中另有 211.3k 条 artificially generated QA instances。它与专家标注实例、未标注实例分别列出,构成官网所说明的三类数据规模;页面没有额外给出生成方法或质量筛选规则。

模型排行榜与提交

官网提供 reasoning-required setting 下的 Leaderboard,列出了 GPT-4(Medprompt)、Med-PaLM 2、MEDITRON 等模型及其 Accuracy、Macro-F1、模型规模和相关日期信息。希望提交模型的使用者需要按照 GitHub repository 中的 instructions 进行提交,榜单则展示不同模型在 PubMedQA 任务上的对比结果。

使用方式

官网提供 GitHub 数据与代码仓库入口,使用者可以访问该仓库下载数据集;模型提交也需要按照同一仓库中的说明进行。页面没有提到 Web 应用、客户端、浏览器插件、API、命令行工具、注册要求或自备模型 Key,也没有说明除仓库下载之外的导入导出方式。若在研究中使用 PubMedQA,官网要求引用 EMNLP'19 论文。

适用人群与场景

生物医学自然语言处理研究者可以使用专家标注、未标注和人工生成的 QA 实例开展研究问答实验。需要评测医学或生物医学语言模型的团队,可以使用 yes/no/maybe 任务以及 reasoning-required leaderboard 对比模型表现。准备提交模型结果的开发者,可以依据 GitHub repository 中的说明完成提交。进行相关学术研究并使用该数据集的人员,则应按照官网提供的 BibTeX 信息引用 PubMedQA 论文。

三分类研究问答围绕对应摘要回答研究问题,输出 yes、no 或 maybe。
专家标注实例提供 1k 条 expert labeled QA instances。
未标注实例提供 61.2k 条 unlabeled QA instances。
人工生成实例提供 211.3k 条 artificially generated QA instances。
模型排行榜在 reasoning-required setting 下展示模型的 Accuracy 与 Macro-F1 等结果。
数据与模型提交支持从 GitHub 仓库下载数据集,并按仓库说明提交模型。

用户评论 (0)

还没有用户评论

成为第一个分享使用体验的人

查看更多

PubMedQA 截图

官网首页截图

写评论

分享你的使用体验,至少 10 个字。评论可以发多条,打分在右侧卡片单独进行。

还需 10 个字 · 0 / 500