
Lyria 3.5 是谷歌 DeepMind 于 2026 年 7 月 29 日发布的第三代 AI 音乐生成模型,并同步集成至谷歌旗下 AI 音乐创作平台 Google Flow Music。这是 Lyria 系列的最新重大升级版本,相比年初发布的 Lyria 3 和 3 Pro,在音乐性、歌词生成、AI 人声和创作控制四个维度进行了系统性升级,标志着谷歌在 AI 音乐赛道全面加速布局。
一、主要功能
增强型音乐性(Musicality):Lyria 3.5 能够生成更加丰富、复杂的旋律结构,不同段落之间的衔接更加自然流畅。模型深层理解了音乐的起承转合逻辑,不再停留于简单的旋律循环,而是能够创作出具有情感递进和结构层次的完整作品。对于包含明确曲风、情绪和编曲要求的复杂提示词,新模型的遵循能力也显著提升。
歌词生成升级:新版本在歌词层面实现了提示词遵循度与歌曲结构意识的双重提升。Lyria 3.5 能够更精准地理解用户输入的音乐意图,生成的歌词不仅贴合风格描述,还能在整体结构上符合前奏、主歌、副歌、桥段的自然分布,有效解决了上一代模型歌词与音乐结构脱节的问题。
AI 人声逼真化:人声表现是本次升级的核心亮点。Lyria 3.5 生成的人声更加贴近真实演唱,情感层次更细腻,发音更准确。模型能够处理更复杂的情绪变化和语调起伏,不再是机械的"念唱",而是能呈现真实歌手的情感张力。这也是此前 AI 音乐最容易露馅的环节,3.5 版本实现了实质性突破。
创作控制精细化:新版本允许用户更便捷地调节曲目节奏和持续时间,有效减少生成结果在速度、结构和长度上偏离预期的概率。Flow Music 平台还支持单独调节人声、鼓点、贝斯等独立轨道,实现多轨道的精细混音控制。
段落级编辑能力:作为 Lyria 3.5 的核心创新,用户可以单独修改已生成歌曲的特定段落,重新生成其中某一段而无需改动整首歌曲。这一功能直接解决了 AI 音乐创作的"一改全改"痛点,大幅提升了创作灵活性。
多语言歌词支持:用户可以对已有歌曲进行歌词翻译,生成不同语言版本,同时保持旋律和编曲结构不变,便于音乐内容的全球化分发。
二、技术原理
Transformer 架构深度定制:Lyria 3.5 基于谷歌 DeepMind 定制的 Transformer 架构,在音频 Token 序列建模上进行了针对性优化。相比标准语言模型,Lyria 采用了专门设计的音频离散表示(Audio Tokenization)方案,将 48kHz 高保真音频压缩为离散 Token 序列,实现音乐结构、旋律、节奏、歌词的联合建模。
多模态融合机制:模型在训练阶段融合了文本描述、音乐乐谱、音频波形三种模态数据。通过跨模态对比学习(Cross-Modal Contrastive Learning),Lyria 3.5 建立了文本意图与音乐输出之间的深层对应关系,使用户的文本提示能够精准映射至具体的音乐属性(调式、节奏型、配器风格等)。
情绪感知人声合成:人声模块采用了专门的情绪嵌入(Emotion Embedding)技术,在声学特征层面引入了情感维度的潜变量建模。这一机制使模型能够根据提示词中的情绪关键词(欢快、忧伤、激昂等)动态调整音高曲线、时值分配和共鸣特性,生成具有真实情感表现力的人声。
三、应用场景
个人音乐创作:独立音乐人无需掌握乐器演奏或复杂 DAW 操作,仅凭文字描述即可快速生成完整的歌曲骨架,用于灵感记录或二次创作。Flow Music 平台还支持为生成的歌曲配套生成 AI 音乐视频(基于 Veo 视频模型),实现"词曲视"一体化输出。
内容创作者配乐:YouTube、B 站、TikTok 等平台的创作者可为视频内容快速生成匹配的背景音乐。Lyria 3.5 已集成至 YouTube Shorts 的 Dream Track 功能,创作者可直接在平台内生成 30 秒至 3 分钟的原创配乐,规避版权风险。
品牌营销音乐:企业营销团队可利用 Lyria 3.5 生成品牌主题音乐、广告配乐和宣传片音乐,通过文字描述精准控制音乐风格与品牌调性的匹配度,支持快速迭代和 A/B 测试。
音乐教育辅助:音乐教师和学生可借助 Lyria 3.5 快速生成不同风格的作品范例,用于乐理教学、编曲分析和风格对比研究。多语言歌词生成功能也为跨文化音乐教育提供了便利。
游戏与沉浸式体验:游戏开发者可为不同场景动态生成匹配的背景音乐,根据玩家行为实时调整音乐的情感基调和节奏,增强沉浸式游戏体验。
四、使用方法
第一步:访问 Google Flow Music 平台。用户需使用谷歌账号登录 labs.flow.google.com 或 labs.google/flow,进入 Lyria 3.5 音乐创作界面。Lyria 3.5 已向 AI Plus、AI Pro、AI Ultra 订阅用户开放,不同会员等级对应不同的使用配额和功能权限。
第二步:输入创作提示词。用户可通过三种方式输入创作指令。文本描述模式输入自然语言风格要求(如"一首抒情的民谣吉他曲,温暖治愈");参考音乐模式上传一段参考曲目让模型学习风格;多模态模式可同时输入文字描述和参考图片,模型将融合图像意境与文字指令生成音乐。
第三步:选择生成参数。用户可设置歌曲时长(30 秒至 3 分钟)、节奏偏好(BPM 范围)、人声类型(男声/女声/合唱)和歌词语言。Flow Music 支持分段生成,用户先生成基础轨道,再对特定段落进行二次修改。
第四步:编辑与调整。Lyria 3.5 支持生成后编辑,用户可对歌词进行改写或翻译、更换乐器编配、调整各轨道音量平衡,单独替换人声音轨而不影响其他部分。如对某段落不满意,可仅针对该段落重新生成,保持其余部分不变。
第五步:导出与发布。完成创作后,用户可将歌曲导出为 48kHz WAV 或 MP3 格式文件,用于商业发行、视频配乐或社交媒体发布。YouTube 平台创作者可直接将 Flow Music 生成的歌曲嵌入 Shorts 视频,无需额外版权声明。
五、适用人群
独立音乐人与词曲作者:Lyria 3.5 提供了从灵感到成品的快速通路,适合需要快速验证创意、获取编曲骨架的音乐创作者,尤其适合词人、诗人等文字功底强但乐器技能有限的群体。
短视频与社交媒体内容创作者:需要高频产出配乐内容但缺乏专业音乐制作能力的创作者,可借助 Lyria 3.5 实现批量化、差异化的原创配乐生产,避免平台音乐库的同质化问题。
品牌营销与企业传播团队:企业营销部门可直接生成符合品牌调性的定制音乐,用于广告、短视频、线下活动等场景,无需外包音乐制作,显著缩短创意到执行的周期。
AI 音乐爱好者与技术研究者:对 AI 生成音乐感兴趣的音乐发烧友,以及研究生成式音频技术的研究人员,Flow Music 提供了体验最前沿 AI 音乐模型的直观入口。
教育工作者与学生:音乐教育场景下,Lyria 3.5 可作为教学工具,帮助学生理解不同音乐风格的结构特征和情感表达方式,多语言歌词功能也为外语音乐教学提供了独特价值。
六、优缺点介绍
优点:四大核心能力全面升级,尤其人声逼真度实现了质的飞跃,段落级编辑功能解决了 AI 音乐创作的最大痛点;平台整合能力强,与 YouTube Shorts、Gemini 等谷歌产品深度打通;支持 30 秒至 3 分钟的灵活时长选择,覆盖从短视频配乐到完整歌曲的多场景需求;Flow Music 提供多轨道混音和乐器更换功能,创作自由度高于 Suno 的封闭生成模式。
缺点:Lyria 3.5 目前仅向 AI Plus 及以上订阅用户开放,免费用户无法体验完整功能,存在一定的使用门槛;平台尚未全面开放中国市场访问,国内用户需要科学上网方可使用;与 Suno V5.5 相比,Lyria 3.5 在中文歌词生成的自然度上仍有提升空间;模型不支持人声克隆功能,无法基于真实歌手声音生成定制内容,而 Suno 和 Udio 均已支持该功能。
M3-Agent-Control 是字节跳动推出的先进 AI 模型,专注于多智能体控制与协作,能够高效处理复杂任务场景中的多主体交互问题,为智能决策和自动化任务执行提供强大支持。