커뮤니티 입장하기

로컬 음성 합성과 목소리 학습 (Qwen3-TTS, 동의와 표시)

로컬 음성 합성은 글을 음성으로 바꾸는 TTS 모델을 내 컴퓨터에서 돌리는 것이고, 목소리 학습은 몇 초짜리 참조 음성이나 수십 분 분량의 녹음으로 특정 사람의 목소리를 흉내 내게 만드는 것입니다. 목소리 주인의 동의를 받고, 결과물을 내보낼 때는 AI로 만든 음성임을 표시합니다.

같은 말:Qwen3-TTS로컬 TTS목소리 복제보이스 클로닝AI 음성 표시 의무

새로 올라온 개념이에요. 먼저 읽어 보고 퀴즈도 풀어 보세요
Share
목차
  1. 🤔 내 목소리로 안내 음성을 만들고 싶을 때
  2. 🔑 로컬 음성 합성과 목소리 학습의 정의
  3. 🎙️ Qwen3-TTS 모델 구성
  4. ⚡ 제로샷 복제: 짧은 참조 음성으로
  5. 🧪 미세조정: 수십 분 녹음으로
  6. ⚖️ 목소리 주인의 동의와 AI 생성 표시
  7. 🔐 데모 서버를 열 때 주의할 점
  8. ⚠️ 자주 하는 실수
  9. ❓ 자주 묻는 질문
  10. 📋 3줄 요약

🤔 내 목소리로 안내 음성을 만들고 싶을 때

교육 영상의 내레이션이나 매장 안내 방송을 매번 직접 녹음하기는 번거롭습니다. 요즘 음성 합성 모델은 몇 초짜리 녹음만으로 비슷한 목소리를 만들어 주는데, 외부 서비스에 내 목소리 파일을 올리기는 망설여집니다. 그래서 목소리 복제를 내 컴퓨터 안에서 끝낼 수 있는지 궁금해집니다.

큐원 모델 계열에서 Qwen3-TTS가 어떤 위치인지는 1차 코스의 큐원 모델 패밀리 구분에서 다뤘습니다. 지금부터는 Qwen3-TTS로 로컬에서 목소리를 복제하는 두 가지 방법, 맥에서 실제로 걸린 시간과 메모리, 그리고 복제한 목소리를 쓰기 전에 알아야 할 동의와 표시 의무를 정리합니다. 모델 정보와 법령은 2026년 9월 28일 공식 자료 기준입니다.

🔑 로컬 음성 합성과 목소리 학습의 정의

로컬 음성 합성은 글을 음성으로 바꾸는 TTS 모델을 내 컴퓨터에서 돌리는 것이고, 목소리 학습은 몇 초짜리 참조 음성이나 수십 분 분량의 녹음으로 특정 사람의 목소리를 흉내 내게 만드는 것입니다.

TTS는 Text to Speech의 줄임말로 글을 소리로 읽어 주는 기술입니다. 목소리를 흉내 내는 방법은 두 가지로 나뉩니다.

  • 제로샷 복제: 학습 없이 짧은 참조 음성 하나를 보여 주고 그 목소리로 읽게 합니다. 빠르지만 긴 문장에서 목소리가 흔들릴 수 있습니다
  • 미세조정: 수십 분 분량의 녹음으로 모델을 추가 학습시켜 그 목소리에 맞춥니다. 오래 걸리고 메모리를 많이 쓰지만 더 안정적입니다

🎙️ Qwen3-TTS 모델 구성

알리바바 큐원 팀이 2026년 1월 22일 공개한 Qwen3-TTS는 공식 저장소 기준 다섯 가지 모델로 나뉩니다.

모델하는 일말투 지시
1.7B-Base, 0.6B-Base내 목소리 복제, 미세조정의 출발점지원 안 함
1.7B-CustomVoice, 0.6B-CustomVoice미리 들어 있는 목소리로 읽기1.7B만 지원
1.7B-VoiceDesign글로 묘사한 목소리 만들기지원

모든 모델이 한국어를 포함한 10개 언어를 지원하고, 허깅페이스의 Base 모델 라이선스는 Apache 2.0입니다. 내 목소리를 복제할 수 있는 것은 Base 모델뿐이고, 공식 설명은 "사용자 음성에서 3초 만에 빠르게 복제"할 수 있다고 적습니다. 설치는 pip install -U qwen-tts로 하고, 공식 문서는 엔비디아 GPU와 FlashAttention 2 사용을 전제로 적혀 있어 맥 지원은 공식 문서에 언급이 없습니다.

⚡ 제로샷 복제: 짧은 참조 음성으로

제로샷 복제에는 참조 음성(ref_audio)과 그 음성을 받아 적은 전사문(ref_text)이 필요합니다. 전사문 없이 목소리 특징만 쓰는 x_vector_only_mode도 있지만 공식 문서는 복제 품질이 떨어질 수 있다고 적습니다.

준이아빠블로그의 Qwen3-TTS 맥미니 실측에서는 M4 프로 맥미니(통합 메모리 24GB)에서 이렇게 동작했습니다.

  • 맥에서 돌리는 설정: device_map="mps", attn_implementation="sdpa"로 바꾸면 동작했고 FlashAttention은 건너뛰었습니다. 공식 지원이 아니라 실측 결과입니다
  • 걸린 시간: 1.7B 모델을 올리는 데 68초, 15초 분량 음성을 만드는 데 14초가 걸렸습니다
  • 참조 음성: 13초짜리 24kHz 모노 WAV와 받아쓰기 전사문으로 약 30분 만에 결과를 얻었습니다
  • 안정적인 길이: 문장이 끊기지 않는 10~15초 참조 음성이 가장 안정적이었습니다(실측 경험)

🧪 미세조정: 수십 분 녹음으로

공식 미세조정은 Base 모델의 단일 화자 학습만 지원하고, 여러 사람의 목소리를 함께 학습하는 기능은 향후 지원 예정이라고 적혀 있습니다. 학습 데이터는 JSONL 한 줄에 음성 파일(audio), 전사문(text), 참조 음성(ref_audio)을 적고, 공식 문서는 모든 줄에 같은 참조 음성을 쓰라고 강하게 권합니다. LoRA 같은 파인튜닝 일반 원리는 파인튜닝 기초에서 다뤘습니다.

같은 맥미니 실측에서 0.6B 모델을 미세조정한 결과는 다음과 같습니다.

항목실측값 (M4 프로 맥미니 24GB)
학습 데이터클립 217개, 31.4분
메모리19GB에서 23GB까지 증가
에포크당 시간약 95초 (다른 프로그램이 떠 있으면 300초 이상)
체크포인트 하나2.3GB, 디스크 여유 30GB 이상 권장

실측에서 드러난 함정도 있습니다. 공식 학습 스크립트의 버그로 손실은 12.2에서 3.6까지 내려갔는데 결과는 잡음이었고, 에포크를 6번보다 4번 돌린 판이 더 자연스러웠습니다. 녹음 분량은 18분으로도 결과가 나왔고 30분에서 1시간을 현실적인 목표로 봤는데, 이 수치는 공식 기준이 아니라 실측과 저장소 사례에서 나왔습니다. 1.7B 미세조정은 24GB에서 시도하지 않았습니다. 공식 미세조정 명령 예시도 엔비디아 GPU(cuda:0)를 전제로 적혀 있고 최소 GPU 사양은 밝히지 않아, 맥에서의 학습은 공식 지원 범위 밖의 시도라고 보는 편이 맞습니다.

⚖️ 목소리 주인의 동의와 AI 생성 표시

목소리 복제는 기술보다 쓰는 방식이 더 중요한 영역입니다. 아래는 법령 원문을 정리한 것이고 법률 자문은 아니므로, 사업에 쓸 계획이라면 전문가에게 확인합니다.

인공지능기본법의 표시 의무. 2026년 1월 22일 시행된 인공지능기본법 제31조는 두 가지 표시 의무를 둡니다.

  • 제2항: 생성형 AI를 이용한 제품이나 서비스를 제공하면 결과물이 생성형 AI로 만들어졌다는 사실을 표시합니다
  • 제3항: 실제와 구분하기 어려운 가상의 음향, 이미지, 영상 등을 제공하면 AI로 생성되었다는 사실을 이용자가 명확하게 인식할 수 있게 고지하거나 표시합니다

음향이 명시되어 있어 목소리 복제 결과물은 제3항에 해당합니다. 의무를 지는 쪽은 인공지능사업자(AI 관련 사업을 하는 법인, 단체, 개인 등)이고, 시행령은 사업자의 내부 업무 용도로만 쓰는 경우를 예외로 둡니다. 개인이 사업 없이 혼자 쓰는 경우를 따로 정한 조항은 찾지 못했습니다. 과태료(3천만원 이하) 대상은 제31조제1항의 사전 고지 위반이고, 정부는 과태료 계도기간을 최소 1년 이상 두겠다고 발표했습니다.

다른 사람의 목소리. 목소리 복제 전반에 동의를 요구하는 일반 조항은 찾지 못했지만, 관련 조항은 있습니다. 부정경쟁방지법은 널리 알려진 타인의 음성을 영업에 무단으로 써서 경제적 이익을 침해하는 행위를 부정경쟁행위로 정하고, 성폭력처벌법 제14조의2는 사람의 음성을 대상자 의사에 반해 성적으로 합성, 가공하는 행위를 처벌합니다. 그래서 실무에서는 다음을 기본으로 둡니다.

  • 내 목소리가 아니라면 목소리 주인에게 용도와 기간을 적은 동의를 서면으로 받습니다
  • 결과물을 공개할 때는 영상 설명이나 음성 안내에 AI로 만든 음성이라고 밝힙니다
  • 학습한 모델 파일은 그 사람의 목소리를 계속 만들 수 있으므로 공유하지 않고 따로 보관합니다

🔐 데모 서버를 열 때 주의할 점

Qwen3-TTS의 공식 데모 명령 예시는 qwen-tts-demo 모델이름 --ip 0.0.0.0 --port 8000처럼 모든 네트워크 인터페이스에 서버를 엽니다. 같은 망의 다른 기기에서 접속할 수 있다는 뜻이라, 복제한 목소리를 아무나 만들 수 있게 됩니다. 내 컴퓨터에서만 쓸 때는 127.0.0.1로 열고, 원격으로 쓸 때는 로컬 AI 보안과 백업에서 다룬 방법으로 접속을 잠급니다.

⚠️ 자주 하는 실수

  • CustomVoice 모델로 내 목소리를 복제하려 합니다: 복제는 Base 모델만 됩니다
  • 학습 손실만 보고 끝냅니다: 실제 음성을 들어 확인해야 합니다
  • 최대 생성 길이를 기본값으로 둡니다: 실측에서 끝을 알리는 토큰이 나오지 않자 11분짜리 잡음이 만들어졌습니다. max_new_tokens를 문장 길이에 맞게 줄입니다
  • 동의 없이 가족이나 동료 목소리를 복제해 공개합니다: 동의를 받고 AI 음성임을 밝힙니다

❓ 자주 묻는 질문

24GB 맥에서 1.7B 모델 미세조정이 되나요?

실측에서는 시도하지 않았고, 0.6B 미세조정만으로도 메모리를 23GB까지 썼습니다. 1.7B는 48GB 이상을 권하는 추정이 있지만 공식 수치는 아닙니다. 24GB라면 1.7B는 제로샷 복제로 쓰는 편이 현실적입니다.

미세조정한 모델로 말투를 바꿀 수 있나요?

실측에서는 "차분하게", "밝게" 같은 말투 지시를 줘도 출력이 바이트 단위로 같았습니다. 공식 표에서도 말투 지시를 지원하는 것은 1.7B-VoiceDesign과 1.7B-CustomVoice뿐입니다.

내 목소리로 만든 음성을 유튜브에 올려도 되나요?

내 목소리라면 동의 문제는 없지만, 실제와 구분하기 어려운 음성이므로 AI로 만든 음성이라고 밝히는 편이 안전합니다. 영리 활동으로 제공한다면 인공지능기본법의 표시 의무 대상이 될 수 있습니다.

📋 3줄 요약

  1. Qwen3-TTS는 한국어를 포함한 10개 언어를 지원하는 Apache 2.0 음성 모델이고, Base 모델은 3초 안팎의 참조 음성과 전사문만으로 목소리를 복제합니다.

  2. 공식 미세조정은 Base 모델의 단일 화자 학습만 지원하며, 24GB 맥미니 실측에서 0.6B 미세조정은 메모리를 23GB까지 쓰고 녹음 31분으로 에포크당 약 95초가 걸렸습니다.

  3. 2026년 1월 22일 시행된 인공지능기본법은 인공지능사업자가 실제와 구분하기 어려운 가상의 음향을 제공할 때 AI 생성 사실을 표시하도록 정하고 있습니다.

Share

제대로 이해했는지 한 문제로 확인해 볼까요?

답을 고르면 바로 풀이가 나와요.

인공지능기본법 제31조제3항이 AI로 만들었다는 사실을 이용자가 명확히 알 수 있게 고지하거나 표시하라고 정한 결과물은 무엇일까요?