
Lyria 3.5 带来更富表现力的人声与更长歌曲
深入了解 Google Flow Music 中的 Lyria 3.5,包括更富表现力的人声、更清晰的歌词、184 秒曲目、结构化提示词、API 接入方式与工作流限制。
如果只用一句话概括:Lyria 3.5 最适合需要更清晰歌声、更出色歌词演绎,以及最长 _184 秒_仍能保持连贯歌曲的场景。
简要结论如下:
- 人声听起来是此次更新的重点。 我会检查音色、情绪、气息控制,以及歌手从头到尾能否保持稳定。
- 如今时长更重要。 该模型可以处理最长 3 分 4 秒的曲目,因此我会测试完整歌曲的推进,而不只是开头 20 秒是否精彩。
- 结构由提示词引导。
[Verse]、[Chorus]和[Bridge]等标签配合时间戳,有助于塑造歌曲。 - 语言支持广泛。 发音针对 8 种语言进行了优化:英语、德语、西班牙语、法语、印地语、日语、韩语和葡萄牙语。
- 工作流限制很明确。 它不支持多轮编辑,因此每次结果都是一次性生成。如果想要更好的版本,就要重新运行提示词。
- 最佳用例很容易判断。 广告需要清晰有力的副歌,游戏需要稳定的重复段落,教育内容需要清楚的歌词,而创作者团队需要从草稿快速推进到成品。
如果你正在决定是否使用它,我会把测试保持简单:人声能否始终自然?歌曲能否在 184 秒内保持方向?团队是否无需长时间清理就能使用输出?

Google DeepMind 在 Flow Music 中推出 Lyria 3.5

快速对比
| 模型 | 最长时长 | 主要用途 | 结构控制 | 最适合 |
|---|---|---|---|---|
| Lyria 3 Clip | 30 秒 | 短音乐创意 | 基础 | 社交媒体短片、广告短音效、粗略提示词测试 |
| Lyria 3.5 / Pro | 184 秒 | 歌曲长度输出 | 段落标签 + 时间戳 | 广告、游戏、教育内容、更长的创作者曲目 |
在我看来,Lyria 3.5 与其说是增加了“新功能”,不如说是在回答一个直接的问题:当我从短演示推进到可以发布或交付的曲目时,它能否节省时间?
表现力人声:发生了什么变化,如何判断差异
Google DeepMind 表示,Lyria 3.5 提升了音乐性、歌词和人声质量 [1]。实际使用中要判断的事情更简单:你究竟能听到什么,以及哪些表现可以由你亲自验证。
人声真实感、动态与情绪化乐句
首先要听完整首曲目,而不只是开头几句。关键测试是人声在相邻乐句之间能否保持自然。Lyria 3.5 支持更细腻的演绎,包括带气声的主歌、流畅的副歌和轻柔的和声 [1]。这些细节可以让歌曲富有表现力,而不是显得平淡又机械。
一种有效的测试方法,是使用“气声感”“沙哑”“轻盈”或“深沉男中音”等直接描述音色的提示词 [4]。然后仔细聆听:这种人声质感能否贯穿整首歌?乐句结尾是否自然落下,还是显得突兀或怪异?之后再用更长的编曲进一步测试,观察人声方面的提升能否继续保持。
生成歌曲中的发音与歌词清晰度
对于广告歌曲和品牌内容,歌词是否清楚并非可有可无。如果听众无法辨认歌词,信息就会丢失。Lyria 3.5 试图通过让人声与伴奏清晰分离来改善这一点,即使面对密集编曲也是如此 [1]。
发音针对八种语言进行了优化:英语、德语、西班牙语、法语、印地语、日语、韩语和葡萄牙语 [5]。如果你要为国际营销活动制作音乐,请使用目标语言编写提示词。
接着进行压力测试。使用密集混音,检查人声能否从头到尾保持清晰。随后把歌曲扩展为数分钟的曲目,再听一次。重点不只是开头的歌词是否清楚,而是随着编曲逐渐丰富,这种清晰度能否持续。
更长上下文:Lyria 3.5 如何处理歌曲级结构
从短片段到数分钟的歌曲结构
从 30 秒片段跃升到 3 分钟曲目,改变的不只是时长,而是音乐的整体形态。
短片段通常适合作为循环或单一段落的预览。相比之下,Lyria 3.5 可以在一次生成中处理完整歌曲结构,包括前奏、主歌、副歌、桥段和尾奏,最长可达 184 秒 [5]。因此,主要测试不只是模型能否继续生成,而是第一个段落结束后,歌曲是否依然让人感觉经过规划。
Google 表示,该模型会先规划歌曲结构再生成音频,这有助于保持过渡连贯 [2]。
你可以在提示词中使用 [Verse]、[Chorus]、[Bridge]、[Intro] 和 [Outro] 等段落标签来引导结构。也可以加入带方括号的时间戳,例如 [0:50 - 1:10] Chorus。这些提示有助于确定完整曲目中各段落的切换位置。
| 模型 | 大致最长时长 | 段落处理 | 连贯性优势 | 最匹配的工作流类型 |
|---|---|---|---|---|
| Lyria 3 Clip | 30 秒 [5] | 基础(循环/预览) | 快速迭代、短时间内节奏一致 | 社交媒体短片、广告短音效、UI 音效 |
| Lyria 3.5 / Pro | 184 秒(3 分钟)[5] | 高级(主歌、副歌、桥段、尾奏) | 结构推理、按时间戳过渡、配器稳定 | 完整歌曲制作、游戏配乐、教育内容 |
接下来要检查的事情很简单:当编曲开始推进后,这些结构提示是否依然有效?
实际输出中的连贯性是什么样
曲目更长并不自动意味着它更连贯。真正的测试是模型能否保持速度与调性稳定,以合理的方式重现动机,并在段落之间自然过渡,而不是听起来随机拼接。
Lyria 3.5 允许你在开头设置速度和调性,从而改善这一点。这意味着钢琴独奏前奏可以逐步发展为加入弦乐的宏大编曲,同时保留相同的旋律构思,而不是进行到一半就偏离方向。
切换到 Lyria 3.5 并使用带有段落标签、时间戳、速度与调性的结构化提示词时,请重点听以下几点:
- 编曲是否按合理逻辑逐渐发展?
- 过渡是否干净利落?
- 曲目是否避免了你未要求的重复?
只有当动机、速度和过渡在整首歌曲中保持稳定时,更长上下文才有意义。如果结构始终不变,该模型就适合需要更长音频的生产用例。
工作流、工具与集成限制
用例:广告、游戏、教育内容和创作者制作
当人声和歌曲结构足够稳定后,下一步很简单:Lyria 3.5 能否融入团队已有的工作方式? 这在很大程度上取决于具体任务。广告需要精确的时间控制,游戏需要连贯性,教育内容需要清晰表达,而创作者团队通常只需要快速推进。
广告歌曲最考验人声表现力与结构。短广告没有空间留给姗姗来迟或落点生硬的副歌。主要测试是副歌能否在广告时长内干净有力地出现。
游戏配乐需要平滑循环,并在较长时间内保持稳定的基调。如果一个段落重复,它不能在第二次或第三次播放时发生漂移或显得不协调。良好的提示词设置对此很有帮助。固定 BPM、调性和乐器列表,可以让多个变体更容易保持相同的感觉 [6]。
教育音频最能受益于 Lyria 3.5 在人声清晰度方面的提升。在这种情况下,清晰咬字比华丽编曲更重要。如果歌词难以听懂,课程就会失去效果。先测试可懂度,再考虑周围的音乐编排。
面向社交内容的创作者工作流通常更重视速度而非精细度。一种实用方法是先用快速草稿测试曲风和氛围,在创意确定后,再转向更长、质量更好的版本 [3][2]。
当前接入入口及其对团队的意义
Lyria 3.5 可通过 Google Flow Music、Gemini 应用、YouTube Shorts(由 Dream Track 提供支持)和 Google Vids 使用;开发者还可以通过 Google AI Studio 和带有 Interactions API 的 Gemini API 接入 [1][4][3]。
有一个限制值得尽早说明:Lyria 3.5 不支持多轮编辑。每个输出都根据第一次提示词一次性生成 [3][2]。因此,如果片段未达到预期,你无法逐步完善同一片段,而是需要重新编写提示词并生成新版本。
这会改变团队构建流水线的方式。与其围绕来回编辑循环进行规划,不如针对每个提示词生成多个变体,再挑选最佳选项。它不太像在 DAW 中编辑一个工程,更像录制多次不同版本,然后选出可用的一次。
在 API 接入方面,建议使用 Interactions API,而不是标准的 generateContent 方法。它支持多模态输入,包括文本和最多 10 张图片,并且专为生产环境中运行时间较长的音乐生成任务而设计 [6][2]。
APIMart 如何融入多模型生产流水线

到了这一步,集成设计与模型输出同样重要。
音乐生成几乎从来不是生产工作流中的唯一任务。一条 60 秒广告可能同时需要脚本、旁白、视觉素材和音乐曲目,最后再把它们拼接起来。APIMart 通过一个兼容 OpenAI 的 API 提供对 500+ 个 AI 模型的接入,帮助团队并行处理 Lyria 3.5 与语言、图像和视频任务,而不必维护彼此分离的集成 [website]。
这可以简化计费,并减少工具切换带来的阻力。最直接的测试是,一个 API 能否节省路由、审核和交接所花费的时间。
结论:评估 Lyria 3.5 的实用框架
评估 Lyria 3.5 归根结底是两个简单问题:人声是否听起来更逼真、更富情绪表现力,以及更长上下文能否让音乐在最长 184 秒内保持稳定连贯?如果答案是肯定的,下一步就很实际:检查工作流适配性、接入方式和导出处理。
进行音色测试时,可以尝试“轻盈女高音”“深沉男中音”或“沙哑摇滚歌手”等提示词,然后评估项目所需语言中的歌词清晰度 [4][5]。
使用段落标签和时间戳,确认结构能否在完整的 184 秒运行中保持稳定 [2]。如果在这里崩坏,说明该模型还不适合生产。即使开头 30 秒再精彩,如果一首完整的 184 秒曲目在中途情绪漂移或脱离节拍,也不能算是生产就绪。
带入内部测试的关键要点
从三个方面测试 Lyria 3.5:
- 人声:当歌词和情绪承担主要表达任务时,这一点最重要,例如广告、教育音频和叙事型创作者内容。
- 连贯性:当曲目需要保持结构而不偏离方向时,这一点最重要,例如游戏配乐、广告歌曲和其他更长的音乐项目。
- 工作流适配性:这归结为三个实际检查项——是否需要 API 接入、是否需要 MP3 或 WAV 导出,以及输出能否顺畅进入媒体流水线。
在运行完整的 Lyria 3.5 Pro 生成之前,先使用 Lyria 3 Clip 优化提示词。
常见问题
应该如何测试人声质量?
在提示词中明确人声特征,例如性别、质感或音域。比如,可以要求“轻盈女高音”或“沙哑摇滚歌手”。然后持续微调这些细节,直到人声符合你想要的声音。
明智的做法是先从更快的预览模型开始。这样你有空间测试不同的人声提示词而不会浪费时间,找到合适的声音后,再转向完整长度的作品。
Lyria 3.5 能否生成完整歌曲?
可以。Lyria 3.5 可以使用 Pro 模型生成完整歌曲。它能创作最长 3 分钟的完整曲目,其中包含主歌、副歌和桥段等部分。
Clip 模型仅支持 30 秒片段。无论使用文本提示词还是结构标签,Pro 都能让你更充分地控制歌曲时长和音乐推进。
主要的工作流限制有哪些?
Lyria 3.5 有一些需要提前规划的工作流限制:
- 仅支持单轮生成,也就是说,你无法通过来回多轮提示继续完善同一个片段。
- 每个提示词会得到一个音频片段,最长为 184 秒。
- 安全过滤器会拦截对特定艺术家声音或受版权保护歌词的请求。
还需要注意一项 API 限制:每个基础模型每分钟最多接收 10 次区域在线预测请求。
去模型市场挑选你想要的模型
在 APIMart 模型市场尝试聊天、图像和视频模型,用统一 API 快速体验模型能力。