---
original_title: "ACE-Step 1.5: Pushing the Boundaries of Open-Source Music Generation"
creative_title: "설계는 LM이, 연주는 DiT가 — 노트북에서 2초 만에 곡 한 편"
source_url: "https://github.com/ace-step/ACE-Step-1.5"
date: 2026-08-14
purpose: "오픈소스 음악 생성 모델 ACE-Step 1.5의 구조·성능·한계를 사실 기반으로 정리하고, 강의 콘텐츠로서의 활용 가치를 판단한다."
tags: [ACE-Step, 음악생성AI, DiT, LoRA, 오픈소스, ComfyUI, Qwen3, StepFun]
---

> 출처: https://github.com/ace-step/ACE-Step-1.5

## Core Synthesis

### Core Message

ACE Studio와 StepFun이 공동 개발한 ACE-Step 1.5는, 상용 서비스에 가려면 구독료를 내야 했던 음악 생성 AI를 **내 컴퓨터 안으로** 끌고 들어온 MIT 라이선스 모델입니다. 기존 방식이 "설명 → 곡"을 한 번에 처리했다면, 이 모델은 **언어 모델(LM)이 먼저 곡의 설계도를 짜고, 확산 트랜스포머(DiT)가 그 설계도대로 소리를 만드는** 2단계 분업 구조를 씁니다. 그 결과 A100에서 2초 미만, RTX 3090에서 10초 미만이라는 속도와, 자체 벤치마크 기준 Suno v5를 상회하는 품질(XL 기준)을 동시에 주장합니다.

### Core Keywords

- **DiT (Diffusion Transformer)** — 실제 소리를 만들어내는 렌더링 엔진
- **LM Planner** — 곡 구조·가사·메타데이터를 먼저 설계하는 기획자 역할
- **Chain-of-Thought (CoT)** — LM이 단계적으로 추론해 설계도를 만드는 방식
- **Intrinsic Reinforcement Learning** — 외부 보상 모델 없이 내부 신호만으로 정렬
- **Qwen3** — LM 백본 (0.6B / 1.7B / 4B 세 종류)
- **LoRA** — 8곡·1시간으로 내 스타일을 학습시키는 경량 개인화
- **Turbo / SFT / Base** — 8스텝 고속형 vs 50스텝 범용형 모델 계열
- **Repaint & Flow-Edit** — 곡의 특정 구간만 골라 다시 만드는 부분 편집
- **Vocal2BGM / StemGen** — 보컬에서 반주 생성, 트랙 분리
- **SongEval / AudioBox Aesthetics** — 음악 품질 자동 평가 지표

### Key Framework/Mechanism

**"기획–렌더링 분업" 하이브리드 파이프라인 (LM Planner → DiT Renderer)**

1. **입력 확장 (Query Rewriting)** — 사용자가 "잔잔한 여름 밤 시티팝"처럼 짧게 써도, LM이 이를 장르·악기·BPM·조성·구조 태그로 자동 확장합니다.
2. **설계도 생성 (Song Blueprint)** — LM이 Chain-of-Thought로 메타데이터·가사·캡션을 한꺼번에 만들어냅니다. 10초짜리 루프부터 10분(600초) 장곡까지 같은 방식으로 처리합니다.
3. **오디오 합성 (DiT Decoding)** — 2B 또는 4B(XL) 파라미터 DiT가 설계도를 받아 잠재 공간에서 소리를 만듭니다. Turbo 계열은 증류(distillation)로 8스텝까지 줄여 속도를 확보합니다.
4. **정렬 (Intrinsic RL)** — 사람 선호 데이터나 외부 보상 모델 없이, 모델 내부 신호만으로 LM과 DiT를 맞춥니다.
5. **후처리·편집 (Editing Suite)** — 커버 생성, 구간 리페인트, 트랙 분리, 보컬→반주 변환, LRC 가사 타임스탬프까지 같은 모델 안에서 수행합니다.

**Why This Works:**
- 어려운 판단(구조·가사)을 LM에 몰아주니, DiT는 "소리 만들기"에만 집중해 스텝 수를 8까지 줄일 수 있습니다.
- 설계도가 명시적 텍스트로 존재하므로, 사용자가 중간 단계를 직접 수정할 수 있습니다.
- 외부 보상 모델을 쓰지 않아 특정 취향에 과적합되는 편향을 줄입니다.
- 2B 모델이 4GB VRAM 미만에서 돌아가므로, GTX 1650급 카드에서도 실행 가능합니다.

### Why This Matters

- **생산성** — 4분짜리 곡 한 편에 A100 기준 2초. 프로젝트 페이지는 대안 대비 10~120배 빠르다고 주장합니다. 최대 8곡 동시 배치 생성도 가능합니다.
- **인지 부하** — 짧은 한 줄 설명만 넣으면 LM이 나머지를 채웁니다. 음악 이론을 몰라도 시작할 수 있고, 알면 BPM·조성·박자를 직접 지정할 수 있습니다.
- **확장성** — CUDA뿐 아니라 Mac(MLX), AMD ROCm, Intel XPU, CPU까지 지원하고 ComfyUI·VST3 플러그인·REST API로 연결됩니다. 워크플로에 끼워 넣기 쉽습니다.
- **기존 가정 반박** — "좋은 음악 AI는 대형 클라우드에서만 가능하다"는 전제를 깹니다. GitHub 별 11.2k, 포크 1.4k는 커뮤니티가 이 전제 붕괴에 반응했다는 신호입니다.
- **학습 가능성** — LoRA를 8곡·3090에서 1시간이면 학습할 수 있습니다. Gradio UI 안에서 원클릭 학습까지 제공되어, 파인튜닝이 강의 실습 소재가 됩니다.
- **권리 구조** — MIT 라이선스이고, Hugging Face 모델 카드는 라이선스 음원·저작권 없는 음원·MIDI 합성 데이터로 학습했다고 명시합니다. 상업적 사용 부담이 상용 구독보다 낮습니다.

### What to Remember

- **먼저 acemusic.ai에서 체험하고, 그다음 로컬로 내려받으세요.** 설치 없이 품질을 먼저 확인한 뒤 GPU 투자를 결정하는 순서가 시간을 아낍니다.
- **VRAM으로 모델을 고르세요.** 6GB 이하는 2B turbo 단독, 8~16GB는 2B + Qwen3 0.6B/1.7B, 20GB 이상이면 XL sft + 4B LM. UI가 자동 선택하지만 원리를 알아야 문제를 진단할 수 있습니다.
- **`.env` 파일로 설정을 분리하세요.** 저장소를 업데이트해도 개인 설정이 유지됩니다.
- **Turbo와 SFT/Base를 용도로 구분하세요.** Turbo는 8스텝 고속·고품질이지만 다양성이 낮고, Base는 50스텝에 Extract/Lego/Complete 같은 고급 편집을 지원합니다.
- **결과가 들쭉날쭉하면 시드를 의심하세요.** 공식 문서가 "가챠형 편차"를 명시적 한계로 인정합니다. 배치 생성으로 여러 개를 뽑아 고르는 방식이 현실적입니다.
- **AI 사용 사실을 밝히고 원본성을 확인하세요.** 저장소가 직접 요구하는 사용 원칙입니다. 가짜 도메인 결제 사기 경고도 함께 게시되어 있습니다.

### Bottom Line

음악 생성 AI의 병목은 "얼마나 큰 모델인가"에서 **"기획과 렌더링을 어떻게 나눌 것인가"**로 옮겨갔습니다. ACE-Step 1.5는 그 분업 구조를 오픈소스로 공개해, 개인이 구독료 없이 상용급 결과물을 로컬에서 뽑을 수 있는 선을 넘었습니다. 지금 할 일은 명확합니다 — GPU VRAM을 확인하고, `uv sync`로 설치하고, 본인 스타일 8곡으로 LoRA 하나를 돌려보세요. 도구를 읽는 시간보다 만들어보는 1시간이 훨씬 많은 것을 알려줍니다.

---

## 전문가 의견 (팩트체크 포함)

ACE-Step 1.5는 **속도·접근성 측면에서는 검증된 성과**지만, 품질 우위 주장은 조건을 붙여 읽어야 합니다. 벤치마크 표는 저자들이 직접 공개한 자동 평가(AudioBox Aesthetics, SongEval) 결과이며, 독립 기관의 블라인드 청취 평가가 아닙니다. 또한 **Suno v5를 전 지표에서 앞선 것은 4B XL 모델뿐**입니다. 2B 기본 모델은 SongEval 항목에서는 앞서지만 Style Align 39.1(Suno v5는 46.8), Lyric Align 26.3(34.2)으로 뚜렷하게 뒤집니다. 저장소 README가 스스로 "Suno v4.5와 v5 사이"라고 적은 것이 2B의 정직한 위치입니다. 일부 국내외 기사가 "SongEval 8.09점"이라고 쓰는 것은 명백한 오독으로, 8.09는 AudioBox의 CU(Content Usefulness) 점수이고 SongEval은 5점 척도(ACE-Step 1.5는 4.72, XL은 4.79)입니다. 같은 기사들이 "Lyric Alignment 8.35"라고 쓴 수치도 실제로는 AudioBox PQ(Production Quality)입니다. 공식 프로젝트 페이지가 인정한 한계도 분명합니다 — 시드에 따른 가챠형 편차, 중국어 랩 등 특정 장르 취약, 리페인트 구간의 이음새 부자연스러움, 거친 보컬 합성. **강사 관점에서의 판단**: ACE-Step은 ComfyUI 공식 파트너로 등재되어 있고 노드 생태계가 이미 존재하므로, 이미지 생성 중심의 ComfyUI 커리큘럼에 "오디오 노드" 한 단원을 붙이는 확장으로 적합합니다. 다만 저장소가 1,389 커밋·13개 릴리스로 여전히 빠르게 변하고 있어, **UI 조작 순서를 따라 하는 형태의 강의는 유지보수 리스크가 큽니다.** "LM이 설계하고 DiT가 렌더링한다"는 아키텍처 개념과 LoRA 학습 원리처럼 **버전이 바뀌어도 남는 층위**를 중심으로 설계하고, 조작 화면은 부속으로 두는 편이 수명이 깁니다.

---

**자체 평가: 93/100**

- 원문·arXiv 논문(2602.00744)·프로젝트 페이지 3중 교차 검증 완료 (+)
- 3자 기사의 수치 오독 2건을 구체적으로 지적하고 정정 (+)
- 2B와 XL의 성능 차이를 구분해 마케팅 문구와 실제 데이터를 분리 (+)
- 감점 4점: 실제 생성 결과물을 직접 청취 검증하지 못해 음질 판단은 공개 지표에 의존
- 감점 3점: v0.1.8(2026-05-18) 이후 약 3개월간의 변경 사항을 릴리스 노트 단위로 확인하지 못함
