수노
수노가 버전마다 끊임없이 발전하는 이유
MidassAI Team · 2026년 7월 18일 · 18 min read
Keywords: 수노 AI 음악 생성, 수노 v5 업데이트
Published: 2026년 7월 18일 Author: MidassAI Team
2024년 초에 마음에 들었던 프롬프트를 모아둔 작은 폴더가 있습니다. 동일한 문구, 동일한 언어 태그, 동일한 '여성 보컬 / 소프트 기타' 바이브죠. 최신 모델로 실행하면 후렴구가 더 깔끔하게 떨어지고, 보컬의 위치가 달라지며, 믹스가 데모 같지 않게 완성도 있어집니다. 제 취향에 신비로운 변화가 생긴 게 아닙니다. 텍스트 아래에서 도구가 진화한 것이죠.
사람들은 수노가 릴리스마다 왜 이렇게 크게 도약하는지 묻곤 합니다. 짧은 답은 'GPU를 더 많이 샀기 때문'이 아닙니다. 실제로 곡을 발표하는 사람들에게 중요한 긴 답은 이렇습니다. 무엇이 움직이고 있는지 알게 되면, 매 버전을 복권 대하듯 하지 않고 끊임없이 변화하는 기준선으로 대하게 됩니다.
첫째, 음악은 비트가 있는 텍스트가 아닙니다
채팅 모델은 이미 토큰으로 대화합니다. 하지만 원본 오디오는 그렇지 않습니다. 24kHz에서는 초당 수만 개의 샘플을 마주하게 됩니다. 이를 트랜스포머에 바로 넣으면 모델이 훅을 배우기도 전에 컨텍스트 길이와 연산량에 매몰되고 맙니다.
그래서 수노를 포함한 거의 모든 스택은 먼저 파형을 더 작은 이산 스트림으로 압축한 다음, 언어 모델이 다음 단어를 예측하듯 다음 청크를 예측합니다. 업계 코덱(AudioCraft / EnCodec 계열의 아이디어)은 이 엄청난 데이터 흐름을 초당 수백 개의 토큰으로 줄여줍니다. 여전히 산문보다는 밀도가 높지만, 원본 PCM보다는 훨씬 저렴하죠.
이 압축이 지루해 보이지만 핵심적인 힌지입니다. 너무 세게 짜면 보컬이 뭉개지고, 느슨하게 두면 학습이 기어갑니다. 릴리스에서 갑자기 '스튜디오 퀄리티'가 느껴질 때, 당신은 종종 여기서 더 나은 절충안을 듣게 되는 것입니다. 때로는 다음 토큰 모델링(곡 구조에 유리)과 디퓨전 방식의 정제(텍스처에 유리)가 혼합되기도 하죠. 창립자들은 공개적으로 두 가지 방식을 용도에 따라 사용한다고 밝혔습니다. 논문을 읽을 필요는 없습니다. 다만, '사소한' 아키텍처 조정이 이미 작성한 모든 스타일 태그를 어떻게 바꿀 수 있는지 알아야 합니다.
교과서적 화성학 가르치기를 멈추다
초기 AI 음악은 하드 룰을 좋아했습니다. 손실 함수에 코드 문법을 넣고, 형식 템플릿을 사용하며, '올바른' 진행을 강제했죠. 그 결과 깔끔하지만 틀린 결과물이 나왔습니다. 문제지를 충실히 따랐지만 여전히 죽어있는 노래들이었죠.
수노의 공식적인 스토리는 반대 방향을 향합니다. 수작업으로 작성한 음악 법칙을 줄이고, 실제 트랙이 어떻게 작동하는지 더 많이 경청하는 것이죠. ChatGPT 열풍 이후, Bark 스타일의 음성 장난감에서 Chirp를 거쳐 V3-V5 라인으로 이어진 팀의 여정은 로마 숫자를 인코딩하는 것보다 데이터에서 구조가 자연스럽게 형성되도록 하는 데 더 중점을 두었습니다. 사용자들도 귀로 투표했습니다. 사람들은 영리한 효과음을 원한 게 아니라, 보컬이 있는 완전한 노래를 원했으니까요.
장르와 언어가 폭발적으로 늘어날 때 유연한 규칙이 더 잘 확장됩니다. 시티팝의 모든 변형마다 새로운 규칙 파일을 배포할 필요 없이, 더 다양한 예시를 제공하고 모델이 일반화하도록 내버려 두면 됩니다. 이것이 바로 버전 업이 '프리셋 3개를 추가했습니다'가 아니라 한 단계 도약한 것처럼 느껴지는 이유입니다.
저렴한 생성은 자선이 아닙니다 — 피드백 파이프입니다
모델이 낯선 사람들이 클립을 공유할 만큼 충분히 좋아지면, 볼륨이 가속페달이 됩니다. 2024년 V3의 돌풍은 브랜드를 키웠을 뿐만 아니라 프롬프트, 재생성, 저장, 건너뛰기로 루프를 채웠습니다. 무료 일일 크레딧과 합리적인 가격은 외부에서는 넉넉해 보이지만, 학습 측면에서는 연구소 플레이리스트를 기다리지 않고 선호도 데이터를 지속적으로 유입시키는 방법입니다.
제품 발전 과정의 대략적인 뼈대(날짜는 보도자료가 아닌 공개된 이정표입니다):
- Bark 시대: 음성 및 거친 사운드, 노래 공장은 아님
- Chirp: 보컬이 대화에 참여
- Web + 더 넓은 배포: 디스코드 전용 코너를 벗어남
- V3: 비음악인도 실제로 끝까지 듣는 2분짜리 테이크
- V4 → V5 라인: 더 조밀한 믹스, 명확한 감정, 더 많은 개인화 옵션
당신이 무심코 쓴 한 줄 — '재패니즈 시티팝, 숨 섞인 여성 보컬, 저녁 드라이브' — 은 장식이 아닙니다. 수백만 개의 아슬아슬한 결과물과 저장된 결과물과 집계되어, 인간이 축약한 언어로 시스템에게 '스타일'이 무엇인지 가르칩니다. 이것이 바로 플라이휠이며, 발표 자료용 비유가 아닙니다.
경쟁사들이 간과하는 부분: 제품 내에서 루프 완성하기
끈적한 에디터가 없는 강력한 체크포인트는 디스코드 향수 속에서 죽습니다. 많은 창작자에게 수노의 진정한 강점은 빈 페이지에서 확장, 스템 추출, 커버, 공유할 수 있는 결과물까지의 경로가 얼마나 짧은지에 있습니다. 가입하고, 한 줄 쓰고, 생성하고, 결정하세요. 이론 시험은 없습니다.
생성 → 청취 → 확장 → 내보내기가 한곳에 있을 때 사람들은 머물러 있습니다. 사람들이 머물면 선호도 신호도 유지됩니다. 연구 노트를 떠나지 않는 모델은 그 신호를 얻지 못합니다. 제품과 학습은 서로 맞물려 돌아가며, 둘 중 하나라도 놓치면 '속도'에 대한 스토리는 보도자료로만 남게 됩니다.
실제로 결과물을 만드는 사람들에게 이것이 의미하는 바
판단에 타임스탬프를 찍으세요. '후렴구 전환이 약하게 느껴진다'는 메모는 모델 버전 + 프롬프트 + 날짜를 적어둘 때만 유용합니다. 아이디어를 폐기하기 전에 3개월 뒤에 같은 카드를 다시 실행해 보세요.
도구를 완성된 악기가 아닌 움직이는 표적으로 사용하세요. 신화적인 '최종 수노'를 기다리다가는 중간 버전으로도 BGM이나 데모를 완벽하게 맞출 수 있는 몇 주를 낭비하게 됩니다. 초안을 배포하고, 기준선이 움직일 때 리마스터하세요.
명확한 선호도를 입력하세요. 비슷한 두 테이크 중 승자를 재생성하는 것이 릴리스 블로그를 끝없이 스크롤하는 것보다 더 날카로운 신호입니다. 다양성도 도움이 됩니다. 한 장르에 갇히면 공간의 한쪽 모서리만 튜터링하게 됩니다.
한계점을 인지하세요. 빠른 반복 = 마스터링, 라이브 트래킹, 또는 수작업으로 다듬고 싶은 복잡한 편곡을 대체한다는 뜻은 아닙니다. 수노는 숏폼 배경음, 피치 데모, '이 훅이 존재하는가?'를 확인하는 용도로는 매우 훌륭합니다. 하지만 앨범급 완성도는 여전히 사람의 귀와 DAW가 필요한 경우가 많습니다.
사람들이 실제로 묻는 질문에 대한 빠른 답변
그냥 연산 자금을 쏟아붓는 건가요? 연산 자원은 기본 중의 기본입니다. 합리적인 오디오 토큰화, 아키텍처 선택, 실시간 사용자 루프 없이는 GPU를 더 많이 확보한다고 해서 더 많은 나쁜 오디오를 빠르게 찍어내는 것뿐입니다.
한 달에 한 번만 열면 뒤처지나요? 핵심 루프는 거의 변하지 않습니다. 스타일 + 분위기 → 생성 → 선택 → 프롬프트 미세 조정. 새 버전은 매주 새로운 UI 언어를 내놓는 것이 아니라 대부분 품질과 지시 따르기를 높여줍니다.
Udio나 다른 지역 도구와 비교하면 어떻나요? 기능 매트릭스를 맹신하지 마세요. 프롬프트 세트를 하나로 고정하고 같은 날 A/B 테스트를 한 뒤, 당신의 사용 사례에 맞게 귀로 선택하세요. 커뮤니티 리드와 배포 속도는 수노의 확실한 장점이지만, 모든 장르를 보장하는 것은 아닙니다.
또 다른 심층 칼럼을 이기는 지루한 습관
생성 화면을 엽니다. 영어나 당신이 노래하는 언어로 솔직한 스타일 한 줄을 씁니다. 두 개를 생성합니다. 음소거하고 싶지 않은 것을 남깁니다. 오늘의 모델 이름과 함께 프롬프트를 저장합니다.
다음 주요 버전 업 이후에도 다시 해보세요. 두 파일 사이의 격차는 아파트 창업 신화의 어떤 타임라인보다 '수노가 왜 이렇게 빠르게 움직이는지'에 대해 더 많은 것을 가르쳐 줄 것입니다. 곡선은 여전히 가파릅니다. 유용한 대응은 기다리는 것이 아니라 부스러기(기록)를 남겨두는 것입니다.