GoogleDeepMind的Lyria3并非传统TTS叠声码器的“唱歌版”,而是把歌唱合成重定义为“多模态意图→音乐结构规划→时序音频潜变量扩散→高保真波形重建”的端到端链路,Gemini承担语义解析与指令编排,Lyria3承担音频潜空间生成与人声渲染,两者通过统一条件向量耦合。官方ModelCard明确:输入为文本(及图像/视频/参考音频),输出为48kHz/16bit立体声音乐波形与同步歌词文本,训练采用带多级文本标注的音频集,推理采用作用在temporalaudiolatents上的latentdiffusion。
一、整体协同架构:Gemini语义层+Lyria3生成层
1.语义-音乐映射层(Gemini侧)
Gemini接收自然语言、图像、视频、参考音频,输出可微分音乐意图表示(MusicIntentionVector/styleembedding),编码维度覆盖情绪强度、节奏密度、调性、乐器组、人声性别与唱法、语种、空间混响倾向。多模态提示经MusicCoCa(MuLan+CoCa路线)投影到同一嵌入空间,文本与音频提示嵌入按可学习权重混合,形成扩散模型各层的条件信号。
2.声学生成层(Lyria3侧)
SpectroStream类高保真codec将48kHz立体声PCM压成时序潜变量;latentdiffusion在该潜空间去噪,条件为Gemini传来的styleembedding+时间戳对齐歌词+乐器/调性/BPM控制量;解码器还原波形。LyriaRealTime扩展采用blockautoregression:以约2秒音频块为单位因果流式生成,前块潜变量作后块条件,控制变更到可听延迟≤2秒,H100上实时因子>1。
3.歌词与人声联合建模
Lyria3相较Lyria2显式增强lyricalignment:提示可写[Verse]/[Chorus]/[Bridge]结构标记与时间戳([0:00-0:10]Intro…),模型同步生成旋律轮廓、辅音元音序列、气息与共振峰轨迹,避免早期模型“发音清晰但语义乱”的问题;支持英/德/西/法/印/日/韩/葡多语人声,Pro版支持双人声、背景声部、定时歌词(timedlyrics)。
二、可控歌唱的核心技术支点
1.潜扩散替代离散token自回归
不在RVQ/音频token域做逐token预测,而在连续时序潜变量上做多步去噪,保留微观动态(气声、齿音、滑音、颤音),解决短循环拼接感与长程结构漂移。Lyria3相对Lyria2在音频保真度、提示遵循度、长段连贯性显著提升。
2.Styleembedding加权混合
文本提示主导结构(曲式、和声、编配、流派约定),参考音频/图像主导音色纹理(明亮度、空间感、演奏细节),推理期暴露为可调权重,实现“描述+参考”双条件steer。
3.细粒度歌唱控制面(API/Composer模式)
•BPM60–200、调性、小节结构标记
•乐器组密度(鼓/贝斯/其他)、频谱明亮度、音符密度
•人声:性别、音色(raspy/smooth/breathy)、唱法(清唱/说唱/合唱)、语种、主声+伴唱布局
-时间戳级段落指令与自带歌词注入
•samplingtemperature/top-k控制生成多样性
4.多模态输入映射
图像/视频经GeminiVision提取色调、构图、情绪、场景语义→映射为流派/速度/音色条件;日落照片出ambient,城市街景出high-energyelectronic,雨夜出lo-fihip-hop,实现“像素→声波”跨域对齐。
5.SynthID不可听水印
每秒波形嵌入不可感知签名,支持后处理后仍可溯源,贴合C2PA元数据标准,解决生成歌声版权与来源鉴定。
三、与早期声码器路线(WaveNet/HiFi-GAN+TTS)的本质差异
旧路径:前端提取音素+基频+F0+时长→声码器重建波形,“歌唱性”受限于对齐与音高估计误差。
Lyria3路径:唱歌=多模态决策过程,Gemini解析歌词情感张力、句法停顿、文化发音习惯(如日语促音喉部阻塞),转为F0轨迹、共振峰分布、声门下压强联合目标,扩散模型在波形潜空间一次成型,不依赖独立ASR/音高提取前端。
四、工程部署形态
•GeminiApp:30秒片段,文本/图像/视频入口,自动生成歌词+NanoBanana封面,18+年龄门禁,多语首批开放
•VertexAI/GeminiAPI/GoogleAIStudio:lyria-3-clip-preview(30s快速原型)、lyria-3-pro-preview(最长3分钟完整曲式),支持Composer模式分段编辑、定时歌词、参考图/参考音频条件
-LyriaRealTime/MusicFXDJ:WebSocket块自回归流式,MIDI/滑块实时改键/速度/乐器密度,现场演出可用
•训练底座:JAX+MLPathways+TPUPod,音频集去重/质量/合规过滤,多级文本caption标注
五、可控歌唱提示范式(生产可用)
[流派/年代]+[情绪]+[乐器编配]+[速度/律动]+[人声风格/语种]+[结构时间戳或自带歌词]
例:“90年代R&B融合现代citypop;亲密慵懒;尼龙弦木吉他+暖电钢+轻hip-hop鼓;BPM84;男声平滑英文主唱+女声气声法文伴唱;[0:00-0:12]Verse描述雨夜车站…”——该结构直接驱动潜扩散条件与各段落人声渲染。
Lyria3的可控歌唱合成本质是用Gemini把创作意图编译成连续条件向量,用latentdiffusion在48kHz音频潜空间完成“曲式+伴奏+人声+歌词”联合生成,再借SpectroStream类codec还原波形;控制粒度从“给我一首歌”细化到“第12秒进副歌、女声气声、降D小调、鼓组密度0.7”,这是离散token音乐模型难以稳定达到的链路层级。
一、整体协同架构:Gemini语义层+Lyria3生成层
1.语义-音乐映射层(Gemini侧)
Gemini接收自然语言、图像、视频、参考音频,输出可微分音乐意图表示(MusicIntentionVector/styleembedding),编码维度覆盖情绪强度、节奏密度、调性、乐器组、人声性别与唱法、语种、空间混响倾向。多模态提示经MusicCoCa(MuLan+CoCa路线)投影到同一嵌入空间,文本与音频提示嵌入按可学习权重混合,形成扩散模型各层的条件信号。
2.声学生成层(Lyria3侧)
SpectroStream类高保真codec将48kHz立体声PCM压成时序潜变量;latentdiffusion在该潜空间去噪,条件为Gemini传来的styleembedding+时间戳对齐歌词+乐器/调性/BPM控制量;解码器还原波形。LyriaRealTime扩展采用blockautoregression:以约2秒音频块为单位因果流式生成,前块潜变量作后块条件,控制变更到可听延迟≤2秒,H100上实时因子>1。
3.歌词与人声联合建模
Lyria3相较Lyria2显式增强lyricalignment:提示可写[Verse]/[Chorus]/[Bridge]结构标记与时间戳([0:00-0:10]Intro…),模型同步生成旋律轮廓、辅音元音序列、气息与共振峰轨迹,避免早期模型“发音清晰但语义乱”的问题;支持英/德/西/法/印/日/韩/葡多语人声,Pro版支持双人声、背景声部、定时歌词(timedlyrics)。
二、可控歌唱的核心技术支点
1.潜扩散替代离散token自回归
不在RVQ/音频token域做逐token预测,而在连续时序潜变量上做多步去噪,保留微观动态(气声、齿音、滑音、颤音),解决短循环拼接感与长程结构漂移。Lyria3相对Lyria2在音频保真度、提示遵循度、长段连贯性显著提升。
2.Styleembedding加权混合
文本提示主导结构(曲式、和声、编配、流派约定),参考音频/图像主导音色纹理(明亮度、空间感、演奏细节),推理期暴露为可调权重,实现“描述+参考”双条件steer。
3.细粒度歌唱控制面(API/Composer模式)
•BPM60–200、调性、小节结构标记
•乐器组密度(鼓/贝斯/其他)、频谱明亮度、音符密度
•人声:性别、音色(raspy/smooth/breathy)、唱法(清唱/说唱/合唱)、语种、主声+伴唱布局
-时间戳级段落指令与自带歌词注入
•samplingtemperature/top-k控制生成多样性
4.多模态输入映射
图像/视频经GeminiVision提取色调、构图、情绪、场景语义→映射为流派/速度/音色条件;日落照片出ambient,城市街景出high-energyelectronic,雨夜出lo-fihip-hop,实现“像素→声波”跨域对齐。
5.SynthID不可听水印
每秒波形嵌入不可感知签名,支持后处理后仍可溯源,贴合C2PA元数据标准,解决生成歌声版权与来源鉴定。
三、与早期声码器路线(WaveNet/HiFi-GAN+TTS)的本质差异
旧路径:前端提取音素+基频+F0+时长→声码器重建波形,“歌唱性”受限于对齐与音高估计误差。
Lyria3路径:唱歌=多模态决策过程,Gemini解析歌词情感张力、句法停顿、文化发音习惯(如日语促音喉部阻塞),转为F0轨迹、共振峰分布、声门下压强联合目标,扩散模型在波形潜空间一次成型,不依赖独立ASR/音高提取前端。
四、工程部署形态
•GeminiApp:30秒片段,文本/图像/视频入口,自动生成歌词+NanoBanana封面,18+年龄门禁,多语首批开放
•VertexAI/GeminiAPI/GoogleAIStudio:lyria-3-clip-preview(30s快速原型)、lyria-3-pro-preview(最长3分钟完整曲式),支持Composer模式分段编辑、定时歌词、参考图/参考音频条件
-LyriaRealTime/MusicFXDJ:WebSocket块自回归流式,MIDI/滑块实时改键/速度/乐器密度,现场演出可用
•训练底座:JAX+MLPathways+TPUPod,音频集去重/质量/合规过滤,多级文本caption标注
五、可控歌唱提示范式(生产可用)
[流派/年代]+[情绪]+[乐器编配]+[速度/律动]+[人声风格/语种]+[结构时间戳或自带歌词]
例:“90年代R&B融合现代citypop;亲密慵懒;尼龙弦木吉他+暖电钢+轻hip-hop鼓;BPM84;男声平滑英文主唱+女声气声法文伴唱;[0:00-0:12]Verse描述雨夜车站…”——该结构直接驱动潜扩散条件与各段落人声渲染。
Lyria3的可控歌唱合成本质是用Gemini把创作意图编译成连续条件向量,用latentdiffusion在48kHz音频潜空间完成“曲式+伴奏+人声+歌词”联合生成,再借SpectroStream类codec还原波形;控制粒度从“给我一首歌”细化到“第12秒进副歌、女声气声、降D小调、鼓组密度0.7”,这是离散token音乐模型难以稳定达到的链路层级。

