콘텐츠 자동화를 위한 오픈소스 TTS 모델 선택
대본 난도, 표현력, 하드웨어, 라이선스에 따라 TTS 모델을 고른다
정의
오픈소스 TTS 선택은 발음, 표현력, 언어 지원 범위, 컴퓨팅 자원, 라이선스 제약을 함께 따지는 작업 적합성 판단이다. 소스는 32 GB VRAM을 갖춘 RTX 5090에서 Qwen3-TTS, VoxCPM2, Higgs TTS 3, Supertonic 3, Audio8을 비교했으며, 제시된 샘플은 1.1× 속도로 재생했다.
관점
Sam Hottman (2026-08-29, YouTube)
단순한 한국어 내레이션에서는 5개 최종 후보가 모두 충분히 쓸 만했으므로, 종합 우승 모델을 고르는 것보다 콘텐츠 형식을 맞추는 일이 더 중요하다.
| 이 테스트에서 관찰한 필요 | 시작점 |
|---|---|
| CPU-only 또는 첫 로컬 설정 | Supertonic 3 |
| 터미널 명령어가 들어간 기술 대본 | 테스트한 명령어 샘플에서는 VoxCPM2가 가장 나았음 |
| 분노, 기쁨, 속삭임이 필요한 이야기 콘텐츠 | 컴퓨팅 자원이 허용될 때 Higgs TTS 3를 표현력 있는 선택지로 선호 |
| 균형 잡힌 범용 사용 | 실제 제작 대본으로 Qwen3-TTS, VoxCPM2, Audio8 비교 |
모델 크기가 올바른 낭독을 보장한다고 여기지 않는다. 테스트한 모든 모델이 날짜, 금액, 백분율, 버전 번호, 하드웨어 표기, 식별자 중 일부에서 오류를 냈다. 모델을 유료 앱, API, 서비스로 전환하기 전에 model-weight 라이선스와 코드 라이선스를 따로 확인한다. 소스는 특히 Higgs TTS 3의 상업용 라이선스를 추가로 검토해야 한다고 지적한다.
적용
- 로컬 추론 비용, 한국어 내레이션, 표현력 있는 전달이 제품이나 콘텐츠 워크플로의 일부일 때 이 비교를 쓴다.
- 깔끔한 내레이션 문장이 아니라 가장 어려운 실제 대본으로 최종 후보를 시험한다. 숫자와 명령어가 많은 원고는 합성 전 TTS 대본 정규화를 거친다.
- 병목이 모델 선택인지, 대본 준비인지, 후속 검토인지 판단할 때 음성부터 시작한다.
- 컴퓨팅 자원이나 상업용 라이선스 조건이 의도한 배포 방식에 맞지 않으면 품질 테스트 전에 후보에서 제외한다.
한계
-
이는 블라인드 청취 연구나 재현 가능한 benchmark가 아니라 제작자 한 명의 정성 테스트다.
-
영상의 공개 설명에는 정확한 repository URL, 모델 revision, inference 설정, 측정 latency 표, 오디오 파일이 없다.
-
한국어 자동 자막에는 인식 오류가 있으며, 가능한 경우 모델명과 테스트 범주는 영상 설명에서 가져왔다.
-
보고된 RTX 5090 이외 GPU에서의 라이선스 내용과 동작은 독립적으로 검증하지 않았다.