当前位置:数智频道首页 > 人工智能 > 正文

Stable Audio 2.5 企业级音频生成 AI 模型发布,号称“3 分钟曲目 2 秒钟完成”

Stability AI 正式发布了企业级音频生成模型 Stable Audio 2.5,该版本在音频细节和生成速度方面进行了提升,宣称仅需 2 秒钟即可创建 3 分钟的音频曲目。新模型的核心改进集中在音乐生成能力上,声称生成结果更加贴合实际编曲逻辑,能够呈现前奏、发展与结尾等完整多段式结构。此外,新模型对提示词的理解更为准确,在情绪描述和音乐风格词汇的把握上响应更符合预期。

Stable Audio 2.5 企业级音频生成 AI 模型发布,号称“3 分钟曲目 2 秒钟完成”

新版模型还显著提升了音频生成速度,这主要得益于研发团队提出的后训练方法 ARC(Adversarial Relativistic-Contrastive)。这一技术通过结合相对式对抗训练与对比判别器,加速了扩散模型的生成过程,在保证音轨质量的同时显著降低了 GPU 推理耗时,实现了 2 秒钟生成长达 3 分钟的音频内容。

Stable Audio 2.5 还新增了音频修补功能,用户可以导入自己的音频文件并指定“延展位置”,模型会根据音频前后内容及整体曲风,将音频一键延长,特别适合剪辑等场景。

目前,Stable Audio 2.5 已可通过 StableAudio 官网直接试用,并支持本地化部署。需要注意的是,用户上传的音频文件不得包含受版权保护的内容,StableAudio 网站将利用自带的内容识别系统进行检测,以确保不侵犯他人版权。

热点推送

本周关注

MORE