MiniMax 开放平台是面向开发者的模型开放平台与文档中心,覆盖语言、视频、语音、图像和音乐五个方向,用于构建智能应用。平台通过模型概览、开发指南、API 文档、Token Plan、定价和更新日志等入口组织内容。与只提供单一文本模型的工具不同,这里将文本理解与生成、视频生成、语音合成、图像生成以及音乐生成模型集中在同一套开放平台中;不同模型还分别标注了上下文规模、生成方式、分辨率、时长、音质、速度或参考输入等能力范围。
核心功能
语言模型
平台提供 MiniMax-M3、MiniMax-M2.7 和 MiniMax-M2.7-highspeed 等语言模型。MiniMax-M3 是原生多模态、1M 上下文的 Frontier Coding 模型;MiniMax-M2.7 支持模型自我迭代;MiniMax-M2.7-highspeed 在效果不变的描述下提升了速度。文档还列出 MiniMax-M2.5、MiniMax-M2.1 和 MiniMax-M2 等历史模型,分别面向复杂任务、多语言编程、编码与 Agent 工作流。
视频生成
MiniMax H3 支持文生、图生、首尾帧和多模态参考,输出分辨率覆盖 768P 与 2K,生成时长为 4–15 秒。MiniMax H3 Max 由 fal.ai 基于 MiniMax H3 后训练,面向高速视频生成,仅支持文生和图生(首帧、尾帧),分辨率为 480P 与 768P,时长为 5–15 秒。平台同时保留 MiniMax Hailuo 2.3、MiniMax Hailuo 2.3 Fast 和 MiniMax Hailuo 02 等历史视频模型说明。
语音生成
语音模型包括 Speech-2.8-HD 与 Speech-2.8-Turbo。前者将情绪渲染与语气词融合,后者强调生成速度和自然逼真的音频效果。历史模型中还包括 Speech-2.6-HD、Speech-2.6-Turbo、Speech-02-HD 与 Speech-02-Turbo,文档分别提到它们在音质、韵律、时延、响应速度、小语种能力或稳定性方面的特征。
图像生成
image-01 支持文生图和图生图,定位为图像生成模型。image-01-live 支持文生图,并可进行画风设置,页面特别列出手绘、卡通等画风增强方向。开发者可以根据文档中的模型入口选择文本生成图像,或使用图像作为输入继续生成。
音乐生成
音乐模型包括 music-3.0、music-2.6 和 music-cover。music-3.0 面向创作意图与人声合成,music-2.6 提供翻唱和器乐方向,music-cover 可基于参考音频生成翻唱版本,并支持一步翻唱、两步翻唱、歌词修改、风格迁移和自动歌词提取。音乐模型页面还提供了对应的 API 文档入口。
使用方式
平台以 Web 文档中心形式提供内容,页面包含开发指南、API、Token Plan、定价和更新日志入口,并提供登录入口。API 文档覆盖文本、视频、语音、图像和音乐等模型方向;当前正文没有说明是否必须注册、是否需要自备模型 Key,也没有说明客户端、浏览器插件或命令行支持。模型的具体调用方式应以各模型对应的 API Reference 页面为准。
适用人群与场景
需要构建智能应用的开发者可以使用语言模型完成多模态或编码相关任务,并参考 Agent 工作流模型说明。需要制作短视频的开发者可以使用文生视频、图生视频、首尾帧或多模态参考能力。音频应用开发者可以选择语音 HD、Turbo 模型,或使用音乐模型进行歌曲、翻唱、歌词和风格迁移相关生成。图像应用开发者则可根据需求选择文生图、图生图或画风设置能力。