跳到主要内容
项目详情

混元是一个覆盖语言、视觉、图像、语音与翻译方向的模型体系,官网同时提供模型试用、研究成果和行业解决方案入口。它既展示面向真实业务场景打磨的语言模型,也提供视觉理解、视觉生成和语音识别模型,并通过腾讯文档等产品探索从资料到交付物的办公应用。相比只面向通用对话的模型,混元官网重点呈现了长上下文、代码与 Agent 执行、多轮图像创作、方言识别,以及面向手机芯片的本地推理等能力。

核心功能

语言理解、代码与复杂任务执行

Hy3 采用 295B/21B MoE 架构,支持 256K 上下文与三档思考模式。官网将其能力重点放在代码、长文、推理和 Agent 体系化执行上,并称其面向真实业务场景打磨,服务于高频与复杂工作流。

视觉理解与图生文

Hy Vision 2.0 是基于 HY-2.0 LLM 构建的视觉理解模型,预训练阶段提升了数据数量与质量,后训练结合 SFT、RL 和 On-policy Distillation。官网标注其适用于通用图生文场景,用于从图像内容生成文字描述或结果。

多轮图像创作

HY Image 3.0 Plus 支持多轮交互,并针对文本渲染、写实表现和复杂语义理解进行了升级。官网将它定位为视觉生成模型,应用方向是高质量视觉创作。

语音识别与语义理解

Hy ASR 3.0 preview 基于 Hy3 基座模型,融合高精度语音识别和深度语义理解。官网列出的重点维度包括通用识别、上下文感知、多场景鲁棒性以及方言覆盖。

多语言翻译与本地推理

Hy-MT2 支持 33 种语言互译,官网介绍其 7B 和 30B-A3B 模型在翻译任务上达到开源模型最佳效果。其 1.8B 模型采用 AngelSlim 1.25-bit 极端量化,仅需 440MB 存储空间,可部署在苹果、高通、联发科等手机芯片上进行本地推理;基于该模型的“腾讯Hy翻译”小程序已经上线,iOS 和安卓 APP 即将上线。

使用方式

官网为 Hy3、Hy Vision 2.0、HY Image 3.0 Plus 和 Hy ASR 3.0 preview 提供“立即试用”入口,入口指向腾讯 AI Studio 的模型广场或模型列表。Hy-MT2 已通过“腾讯Hy翻译”小程序提供应用入口,并支持在手机芯片上本地推理;官网还说明 iOS 和安卓 APP 即将上线。正文没有说明注册要求、自备模型 Key、导入导出或命令行使用方式。

适用人群与场景

需要处理代码、长文、推理和 Agent 工作流的用户,可以使用 Hy3 的长上下文和多档思考能力。进行通用图生文或视觉理解的用户,可使用 Hy Vision 2.0;从事视觉内容创作的用户,可使用 HY Image 3.0 Plus 的多轮交互与图像生成能力。需要多语言翻译、手机端部署或本地推理的用户,可关注 Hy-MT2;办公场景中,腾讯文档已将 Hy 用于根据主题、资料和要求生成可继续编辑的内容初稿。

长上下文与多档思考Hy3 采用 295B/21B MoE 架构,支持 256K 上下文与三档思考模式。
视觉理解Hy Vision 2.0 基于 HY-2.0 LLM 构建,适用于通用图生文场景。
多轮图像生成HY Image 3.0 Plus 支持多轮交互,并提升文本渲染、写实表现和复杂语义理解。
语音识别Hy ASR 3.0 preview 融合高精度语音识别与深度语义理解,覆盖方言等场景。
多语言翻译Hy-MT2 支持 33 种语言互译,并提供面向手机芯片的本地推理能力。

用户评论 (0)

还没有用户评论

成为第一个分享使用体验的人

查看更多

混元 截图

官网首页截图

写评论

分享你的使用体验,至少 10 个字。评论可以发多条,打分在右侧卡片单独进行。

还需 10 个字 · 0 / 500