模型广场是一个面向业务接入的 AI 模型目录,集中展示语言模型、视频生成模型、图像生成模型和语音模型。页面按模型类型组织产品,并为每个模型标注 API 接入方式、输入与输出能力、价格以及部分规格限制,方便根据编程、智能体、多模态理解、视频生成、图像编辑或语音处理等任务选择模型。语言模型区域同时提供 Doubao-Seed、GLM 和 DeepSeek 系列,视频、图像和语音区域则分别列出对应的生成、识别与交互模型。
核心功能
语言模型
语言模型区域包括 Doubao-Seed-Evolving、Doubao-Seed-2.1-pro、Doubao-Seed-2.1-turbo、Doubao-Seed-2.0-lite、Doubao-Seed-2.0-mini、GLM-5.2、DeepSeek-V4-pro 和 DeepSeek-V4-flash。不同模型面向的任务有所区别,例如 Doubao-Seed-Evolving 定位为“最新 Coding & Agent 模型”,Doubao-Seed-2.1-pro 面向生产级任务并升级编程、智能体与多模态能力,GLM-5.2 强调复杂开发,DeepSeek-V4-pro 和 DeepSeek-V4-flash则属于混合推理模型。页面还展示上下文窗口和最大输出长度,其中部分模型上下文窗口达到 1024k,最大输出长度最高为 384k。
视频生成
视频生成区域提供 Doubao-Seedance 2.0、Doubao-Seedance 2.0-fast 和 Doubao-Seedance 2.0-mini。Doubao-Seedance 2.0强调参考一致性和视听稳定性,支持音视图文参考;fast 版本强调更快并继承 2.0 核心优势;mini 版本定位为音视图文参考和高性价比。页面列出了可用视频分辨率,其中 2.0 支持 480P、720P、1080P 和 4K,fast 与 mini 支持 480P、720P,同时各模型展示了 RPM 限制。
图像创作
图像创作区域包括 Doubao-Seedream-5.0-pro、Doubao-Seedream-5.0-Lite 和 Doubao-Seedream-4.5。5.0-pro用于精准图像编辑,并支持图层自由;5.0-Lite提供更智能可控的创作、实时检索和一致性保持;4.5支持多图稳定融合、编辑一致性和 4K 超高清。页面分别标注了按张计费的输入、输出或文生图、图生图价格,部分模型还标注 IPM 500。
语音生成与交互
语音模型区域包含 Doubao-音频生成-1.0、Doubao-语音播客、Doubao-流式语音识别、Doubao-录音文件识别2.0和 Doubao-实时语音交互。音频生成模型定位为全要素影视级音频生成;语音播客强调对话自然和秒级创作;流式语音识别支持流式识别;录音文件识别2.0支持多模态信息理解;实时语音交互则面向更拟人、更低时延的语音对话效果。不同语音模型采用按 token、按小时或模型限制进行说明,并列出了 QPS、QPM 和 TPM 等限制。
模型规格与调用限制
每个模型卡片都提供 API 接入标识,并展示输入、输出相关信息。语言模型主要标注输入价格、输出价格、上下文窗口和最大输出;视频模型标注输入输出价格、分辨率与 RPM;图像模型标注每张价格或 IPM;语音模型则根据产品类型展示 token 价格、小时价格或 QPS、QPM、TPM 限制。用户可以据此比较不同模型的规格和调用条件。
使用方式
官网正文明确展示各模型的“API接入”,并在页面底部提供“API Key管理”和“账单管理”。模型广场还提供“个人中心”和“我的订阅”入口。正文没有说明是否必须注册、是否需要自备模型 Key,也没有列出命令行、客户端、浏览器插件或导入导出能力;当前可确认的接入方式为 API。
适用人群与场景
需要将 AI 能力接入业务的开发者,可以根据编程、智能体或生产级任务选择语言模型。视频创作者可以使用支持音视图文参考、不同分辨率和 4K 输出的视频生成模型。图像创作者可以选择图像编辑、多图融合、文生图或图生图模型。音频和语音应用开发者则可以使用音频生成、语音播客、流式语音识别、录音文件识别及实时语音交互模型。
定价
页面展示的模型均有明确的调用价格,但不同模型的计价单位不同。语言模型按百万 tokens 计费,视频模型按百万 tokens 计费并同时标注视频分辨率和 RPM,图像模型按张计费,语音模型则有按百万 token、按小时计费的模型,也有仅展示 QPS、QPM 或 TPM 限制的模型。页面还列出“豆包大模型特惠”“Seedance 2.5上新”和“Agent Plan 首月9.9元”等活动信息。