OpenBayes 公共数据集页面是一个面向人工智能相关任务的数据资源目录,集中展示可用于文本、图像、音频、视频、医学、交通、农业等方向的数据集。页面通过“技术分类”“应用场景”和“其他”三组内容组织资源,既包含文本分类、目标检测、自然语言处理、三维重建等技术主题,也包含农业、气象、遥感、医学、中文、客服等应用场景。与只展示单一类型数据的页面不同,这里同时收录大模型、HPC、高性能计算、基础教程和官方推荐内容,并在每个数据集条目中展示简介、文件大小、发布者和更新时间等信息。
核心功能
按技术方向筛选数据集
页面提供文本分类、AI Agent、情绪识别、智能问答、自动驾驶、语音识别、目标检测、视频处理、图像分类、图像描述、实例分割、语义分割、姿态估计、三维重建、超分辨率、代码生成和自然语言处理等技术分类。分类还覆盖音频合成、GAN、vLLM、多模态、ComfyUI、数字人、具身智能、Triton、DeepSeek、Nvidia、Qwen 和 OCR 等主题,便于从具体技术任务或模型方向查找数据资源。
按应用场景查找资源
页面的应用场景包括农业、气象、遥感、建筑、出行、生活、安防、金融、电商、社交、数学、新闻、影音、体育、医学、中文、外语、客服、艺术设计、风格迁移和二次元,也包含 AI for Science 与“打工人神器”。这些分类与数据集条目中的任务或领域描述对应,例如苹果、玉米和水稻叶片病害数据集属于农业相关内容,医学区域则包含脑肿瘤影像、药品信息、医疗问答和医疗废弃物检测等资源。
浏览多种类型的公开数据
公共数据集列表同时包含视频、图像、文本、音频、对话、评论、问答、医学影像和三维建模数据。SA-V 数据集包含约 51,000 个真实世界视频和 643K 个时空遮罩注释;喵喵叫数据集包含通过 21 只猫采集的 440 段猫咪叫声音频;XiaChuFang Recipe Corpus 包含 1,520,327 种中国食谱;Vienna 数据集则是用于三维建模的图片数据集。不同条目会根据资源内容展示相应的简介和文件大小。
查看数据集规模与内容说明
列表条目会直接显示数据集的名称、内容摘要、发布者、更新时间和文件大小。数据规模信息覆盖多种形式,例如 yf_dianping 大众点评数据集包含 54 万用户对 24 万家餐馆的 440 万条评论,AFAD 亚洲面孔数据集包含超过 160k 张面部图像,MovieLens 数据集包含 138493 位用户对 27278 部电影的 20000263 项评分,RSNA Knee MRI 数据集收录了全部 24,371 个 MRI 序列的预处理 3D 体积数组。用户可以根据简介中的样本数量、数据主题和容量判断条目是否符合需求。
提供教程与专题入口
页面顶部设有“全部”“官方推荐”“基础教程”“大模型”和“HPC 高性能计算”等内容入口,并提示用户发现 Notebook 教程、Colab 教程时可以关注。除常规数据集外,页面还收录与 DeepSeek、Qwen、vLLM、Triton、ComfyUI 和多模态相关的技术分类,形成围绕人工智能数据和相关教程的资源目录。
适用人群与场景
需要进行文本分类、问答、情绪识别或自然语言处理实验的用户,可以从百科类问答、中文医疗问答、交通对话和医学文本问答等条目中查找相关数据。进行计算机视觉任务的用户,可以查看目标检测、图像分类、图像分割、视频分割、面部图像和叶片病害数据集。医学与科研场景可以查找 MRI、药品信息、医疗问答和儿童发育迟缓风险因素数据。关注大模型、HPC、高性能计算、Notebook 或 Colab 教程的用户,则可以从对应专题入口浏览资源。
注意事项
页面展示的数据集来源和内容并不统一,条目中既有由发布者上传的资源,也有注明来源、发布时间或比赛背景的数据集。例如 Netflix 数据集来自 netflixprize,MovieLens 数据集由 GroupLens 发布,Vienna 数据集由康奈尔大学发布。使用具体数据前,需要结合条目中的来源、数据说明和任务描述进一步确认适用范围。