跳到主要内容
项目详情

Google DeepMind 官网集中展示一组面向不同任务的新一代 AI 系统,既包括 Gemini 系列及其音频、视频、图像和音乐模型,也包括面向开发者的 Gemma 开放模型。产品覆盖从编码与智能体,到语音转文字、实时音频交互、图像创作、音乐生成、视频生成和机器人智能层等方向。官网同时提供 Google AI Studio、Gemini app、Google Flow、Gemini API、Gemini Live API、Gemini Enterprise Agent Platform 以及 Gemma 开发者文档等使用入口,既可直接体验,也可用于构建应用和研究工作流。

核心功能

Gemini:编码与智能体

Gemini 3.8 Flash 被官网称为面向编码和智能体的 workhorse model,适合处理这两类任务。Gemini 产品还被概括为“Frontier intelligence with action”,可通过 Gemini app、Google AI Studio、Google Antigravity 和 Gemini Enterprise Agent Platform 进行尝试。官网没有在正文中进一步说明具体上下文长度、模型调用限制或输出格式。

Gemini Audio:语音与实时音频

Gemini 3.5 Transcribe 面向语音转文字,被描述为用于智能语音交互的高精度模型。Gemini Audio 则是建立在 Gemini 之上的实时音频模型,可通过 Google AI Studio 体验,也提供 Gemini API 与 Gemini Live API 入口。官网正文未列出支持的语言、音频时长限制或具体计费方式。

Gemini Omni:从视频开始创作

Gemini Omni 的定位是“Create anything from anything, starting with video”,官网首页还介绍了 Gemini Omni 1.1 Flash,强调更强的创作控制和可用于生产的输出。该系列可在 Gemini app 与 Google Flow 中尝试,适用于从视频出发的内容创作场景。正文没有说明具体的视频时长、分辨率或导出格式。

Nano Banana:图像生成与编辑

Nano Banana 被官网定义为使用 Gemini Image 创建和编辑图像的模型,首页列出的 Nano Banana 2 Lite 则强调速度和效率。用户可以通过 Gemini app、Google AI Studio 和 Gemini Enterprise Agent Platform 进入相关体验。官网提供了图像模型的产品入口,但没有在正文中给出图片尺寸、生成数量或编辑能力的详细限制。

Lyria 与 Veo:音乐和视频生成

Lyria 是音乐生成模型,官网称其为先进的音乐生成模型;首页的 Lyria 3.5 还强调改进后的演唱和原声细节。它可以在 Gemini app、Google Flow Music、Google AI Studio 和 Gemini Enterprise Agent Platform 中尝试。Veo 则被定位为视频生成模型,可通过 Gemini app、Google Flow、Google AI Studio 和 Gemini Enterprise Agent Platform 使用。正文没有给出两者的价格、生成额度或具体输出规格。

Gemma:开放模型与开发构建

Gemma 被官网称为“our most capable open models”,并提供 Google AI Studio、Run Gemma 和 Developer docs 等构建入口。首页还展示 Gemma 4,强调在每个参数上最大化智能表现。开发者可以从官网提供的运行说明和开发者文档开始使用,但正文没有说明部署环境、许可证细节或硬件要求。

使用方式

官网同时提供直接体验和开发构建入口。Gemini、Gemini Omni、Nano Banana、Lyria 和 Veo 可在 Gemini app 或 Google AI Studio 等产品中尝试;音频模型还可通过 Gemini API 和 Gemini Live API 使用;Gemma 则提供 Run Gemma 与 Developer docs。部分模型还接入 Google Flow、Google Flow Music、Google Antigravity 和 Gemini Enterprise Agent Platform。正文没有说明是否必须注册、是否需要自备模型 Key,也没有提供具体导入导出流程。

适用人群与场景

需要使用 AI 辅助编码或构建智能体的开发者,可以关注 Gemini 及其 Google AI Studio、API 和企业智能体平台入口。处理语音转文字或实时语音交互的团队,可以使用 Gemini Audio。图像、音乐和视频创作者可分别尝试 Nano Banana、Lyria 与 Veo。科研人员和研究团队还可以关注 Co-Scientist 这一协作式 AI 研究伙伴,以及官网列出的 Gemini for Science;希望运行开放模型的开发者则可以选择 Gemma 及其运行文档。

编码与智能体模型Gemini 3.8 Flash 面向编码和智能体任务,Gemini 产品支持在多个 Google 入口中体验。
实时音频与语音转文字Gemini Audio 提供实时音频模型,Gemini 3.5 Transcribe 面向智能语音交互和语音转文字。
图像创建与编辑Nano Banana 使用 Gemini Image 创建和编辑图像,并可通过 Gemini app 与 Google AI Studio 使用。
音乐生成Lyria 是音乐生成模型,Lyria 3.5 还强调改进的演唱和原声细节。
视频生成Veo 被官网定位为视频生成模型,可在 Gemini app、Google Flow 和 Google AI Studio 中尝试。
开放模型构建Gemma 是官网展示的开放模型系列,并提供 Run Gemma 与开发者文档。

用户评论 (0)

还没有用户评论

成为第一个分享使用体验的人

查看更多

Google DeepMind 截图

官网首页截图

写评论

分享你的使用体验,至少 10 个字。评论可以发多条,打分在右侧卡片单独进行。

还需 10 个字 · 0 / 500