返回工具列表

Stable Audio

Stable Audio 是 Stability AI 的开源音频生成模型,帮助创作者用文字快速生成可商用的完整音乐曲目和音效。

工具分类
视频

工具简介

【采用判断】基于 2026 年 5-6 月大量开源社区的实测和教程,Stable Audio 3 已从关注度证实进入实际可用阶段,尤其在本地部署和 LoRA 自定义风格方面获得早期验证,但长音频生成的稳定性仍有待更多实际项目检验。 【实际作用】支持文本到音频生成音乐和音效,可设定时长(Small 模型约 2 分钟,Medium 最长 6 分 20 秒),独立 SFX 音效模型;还能进行音频编辑、局部重绘和延续,并通过 LoRA 微调训练个人风格模型。输出音频采用授权数据训练,生成物版权归用户所有,可免费商用。 【门槛与成本】模型权重完全开源(社区说法),可在本地普通电脑甚至 MacBook Pro M 系列上离线运行(社区实测 M5 Pro 达 59 倍实时生成),非 GPU 环境下亦可使用 CPU 运行(社区一键启动器保证)。成本仅在自备硬件,无生成次数限制。官方在线服务可能另有免费额度,但尚未公布 API 定价(保守推断)。 【适合谁】适合独立音乐人、视频制作者、游戏开发者、播客创作者等需要定制化、可商用音频且有一定动手能力的用户;不适合追求零门槛一键生成的纯新手,也不是类似 Suno 那样的带人声歌词的完整歌曲生成器——它更像「音频版的 Stable Diffusion」,是一个开放的基础模型和工具链。

社媒关联内容

Stable Audio 是什么?工具简介、社媒讨论与使用场景 | Tuleo