ACE-Step 1.5
免费
ACE-Step 1.5 是 ACE Studio 与 StepFun 联合推出的开源音乐基础模型,主打本地部署、高速生成和多语言歌词演唱。支持文本生成歌曲、翻唱、重绘、音轨分离等编辑能力,4GB 显存即可运行。
ACE-Step 1.5 的完整评测
核心参数与统计
| 项目 | 规格 |
|---|---|
| 产品定位 | 开源音乐基础模型 |
| 开发商 | ACE Studio + StepFun |
| 架构 | LM(歌曲规划)+ DiT(声学渲染)混合 |
| 生成速度 | A100 ≈ 2 秒/首,RTX 3090 ≈ 10 秒/首 |
| 最低显存 | 4GB(部分配置) |
| 支持平台 | CUDA、Apple Silicon、ROCm、Intel XPU |
| 开源协议 | MIT |
| 歌词语言 | 50+ 种语言 |
ACE-Step 1.5 可能是目前对硬件最友好的开源音乐生成模型。4GB 显存的门槛意味着近五年内的消费级显卡都能跑,这在动辄需要 A100 的音乐生成赛道里算是一股清流。
用户与市场认可
ACE-Step 1.5 在开源音乐生成社区中迅速获得了关注。相比 Suno 等闭源产品,它的差异化在于:① MIT 许可,可自由商用和二次开发;② 支持本地部署,数据不出设备;③ 提供完整的编辑管线(生成→翻唱→重绘→分轨),不只是"生成一首歌"那么简单。与 SongGeneration 相比,ACE-Step 的突出优势是推理速度和显存需求更低。
宣传核验:"4-8 步蒸馏推理,A100 约 2 秒生成整首歌"——这个速度在短片段(10-30 秒)下可达,但生成 3-5 分钟的完整歌曲时推理时间会显著增加。蒸馏推理在保证音质的前提下加速效果明显,但极低步数下音质可能出现细节损失。
成本优势
| 维度 | 说明 |
|---|---|
| 代码 | MIT 许可免费 |
| 模型权重 | 公开下载 |
| 在线 Demo | 可免费体验 |
| 自部署 | RTX 3090/4090 可流畅运行 |
免费的真相:MIT 许可,代码和模型权重免费下载。自部署的硬件成本最低体现在已有显卡上——如果手头有 RTX 3090 或更高型号,增量成本几乎为零;如果需要新购硬件,一张 RTX 4060(4GB 显存)约 2000-3000 元即可满足最低需求。对于只想试用的用户,在线 Demo 是最低成本的选择。
主要功能
- 文本生成歌曲:输入歌词和风格描述,AI 生成完整歌曲。支持 10 秒到 10 分钟的任意时长。
- 50+ 语言歌词演唱:支持中英日韩等主流语言及多种小语种。对于需要多语言音乐内容的创作者(如游戏配乐需要不同语言的演唱版本),这是核心差异功能。
- 翻唱与重绘:输入一段音频,AI 用不同的风格或声音重新演绎。适合对已有歌曲做改编的场景。
- 音轨分离与补全:将歌曲分离为人声和伴奏轨,或对片段进行补全。从"生成一首歌"到"编辑一首歌",覆盖了音乐制作的更多有节。
- LoRA 个性化训练:用少量歌曲训练个人风格 LoRA。对于有固定风格的创作者,微调后的一致性会比通用模型好很多。
模型与版本演进
| 阶段 | 时间 | 关键变化 | 当前意义 |
|---|---|---|---|
| ACE-Step 1.0 | ~2026-03 | 建立文本转歌曲主链路,形成基础声学生成能力 | 证明开源音乐模型可以做完整歌曲生成 |
| ACE-Step 1.5 | ~2026-06 | 扩展到 50+ 语言歌词、翻唱、重绘、分轨和 LoRA 训练 | 从“能生成”升级到“能编辑、能定制” |
ACE-Step 的版本路径很清晰:先把文本生成歌曲做通,再补齐创作者真正会用到的编辑有节。1.0 更像开源基线,1.5 则开始靠近完整的音乐工作流,尤其是翻唱、重绘和分轨能力,把模型从一次性生成器推进到可反复修改的制作工具。
当前版本的定位不是去和闭源平台拼最强成品音质,而是用更低硬件门槛和更宽松许可,把“本地可跑的音乐基础模型”做成工程上可落地的选择。对于研究者和开发者,1.5 已经是一个比纯 Demo 更完整的里程碑。
技术优势
| 技术点 | 作用机制 | 带来的实际效果 |
|---|---|---|
| LM + DiT 混合架构 | 先规划歌曲结构,再做声学细节渲染 | 旋律、节奏和音色的控制感更稳定 |
| 蒸馏推理 | 用更少步数完成采样 | 在本地部署时显著缩短等待时间 |
| 多语言歌词建模 | 将歌词理解与演唱生成绑定 | 做跨语种歌曲和本地化内容更顺手 |
| LoRA 个性化训练 | 用少量样本注入风格偏好 | 更适合固定风格创作者复用 |
ACE-Step 1.5 的优势不只在“开源”,而在于它把速度、显存门槛和编辑能力放在了一起。很多同类开源模型能出声音,但很难同时兼顾生成速度、后编辑和商用许可;ACE-Step 1.5 的差异化正是把这些有节打包成一个相对完整的创作底座。
宣传核验:官方强调 4GB 显存可运行和 4-8 步蒸馏加速,这个卖点对“可跑起来”基本成立,但对“稳定产出高质量整首歌”要加一个条件。短时片段、草稿生成和局部编辑更接近它的舒适区;如果追求长时高保真成品,硬件、推理时长和后期处理成本仍会上升。
如何使用
| 入口 | 最低要求 | 上手方式 |
|---|---|---|
| 在线 Demo | 浏览器可访问 | 直接输入歌词与风格描述,先验证音色和节奏方向 |
| 本地推理 | 4GB+ 显存,建议 CUDA 或 Apple Silicon 有境 | 下载权重后按官方仓库配置有境,执行基础推理脚本 |
| 个性化训练 | 额外显存和少量训练样本 | 通过 LoRA 微调固化个人风格或品牌音色 |
最快的入门路径是先用在线 Demo 确认提示词结构,再决定是否本地部署。对大多数团队,先测试“歌词风格描述是否能稳定出可用草稿”,比一开始就折腾显卡有境更划算。
本地使用时,最低配置解决的是“能运行”,不是“高吞吐”。如果要同时做长歌曲生成、翻唱和分轨,3090/4090 这一档设备会明显更顺手。对于企业或工作室,建议把它放进“草稿生成 + 人工精修”的流程,而不是直接替代完整制作链路。
产品定价
定价模式以官方实时页面为准。通常采用免费增值(Freemium)或订阅制,基础功能可免费使用。 高级功能或高频使用需付费订阅,建议用户根据实际用量评估最优方案。
应用场景
- 快速配乐生成:为视频、播客、游戏生成定制背景音乐。输入"中国风、悠扬2 分钟",30 秒内拿到可用的配乐草稿。
- 翻唱与改编:将一首歌用不同风格翻唱——把流行歌改成爵士版,或者把英文歌翻成中文版。适合内容创作者做二次创作。
- 音乐教学与实验:用 AI 生成不同风格的乐段作为教学示例,或进行声学实验。
劝退场景:如果需要出版级的专业混音质量,AI 生成的歌曲在音质层次感和混音细节上仍不如专业录音棚。ACE-Step 适合草稿和 demo 阶段,不适合作为最终发行版本。
适用人群
- 独立音乐人:在创作过程中快速验证旋律和编曲方向,MIT 许可允许商业使用。不需要担心版权纠纷或平台分成问题。
- 内容创作者:为视频、播客快速生成配乐和背景音乐,降低版权风险。对比在音乐平台购买商用授权,自生成的成本低得多。
- 音频 AI 开发者:在 ACE-Step 基础上构建音乐生成应用,MIT 协议限制少。需要注意模型输出的音质是否能满足用户预期,以及推理成本在规模化后的经济性。
- 游戏音频团队:为游戏生成定制背景音乐和主题曲,MIT 许可可嵌入商业产品,但音质和音效一致性需要额外加工。
当前限制:ACE-Step 1.5 在歌词发音准确性上对部分小语种的支持有限。非拉丁字母语言(如中文、日文)的歌词演唱有时会出现发音偏差,需要人工修正或后期录音补录。
总结与展望
在所属领域提供了具有竞争力的解决方案,核心价值在于降低该领域的 AI 使用门槛。
当前局限:部分高级功能需要付费订阅,免费版存在功能或使用次数限制;具体的技术细节和性能基准尚未完全公开。
相关工具:ElevenLabs、
Udio
版本信息
- ACE-Step 1.5 :支持文本生成歌曲50+ 语言歌词、翻唱重绘、音轨分离和 LoRA 个性化训练。
- ACE-Step 1.0 :基础音乐生成模型,支持文本转歌曲。
用户评价