음성
안정적인 자동 내레이션을 위해 음성 모델을 고르고 대본을 준비한다
자동 음성 작업에는 서로 다른 두 가지 실패 지점이 있다. 전달 방식과 컴퓨팅 예산에 맞는 모델을 고르는 일, 그리고 모델이 안정적으로 발음할 수 있도록 텍스트를 준비하는 일이다. 깔끔한 내레이션에서는 성능 좋은 모델 사이의 의미 있는 차이가 드러나지 않을 수 있지만, 숫자·식별자·터미널 명령어는 더 큰 시스템에서도 실패할 수 있다. 표현력, 다국어 전달, 상업용 라이선스는 추가 선택 기준이 된다. 오디오를 고치는 과정에서 재사용할 콘텐츠가 훼손되지 않도록 작성 원본과 발음용 렌더링 사본을 분리해 둔다.
시작하기
- 콘텐츠 자동화를 위한 오픈소스 TTS 모델 선택 — 내레이션, 표현력, 하드웨어, 라이선스 제약에 따라 후보를 고른다.
- 합성 전 TTS 대본 정규화 — 렌더링 전에 까다로운 토큰을 위한 발음·검토 경계를 추가한다.
페이지
- 콘텐츠 자동화를 위한 오픈소스 TTS 모델 선택 — 단일 RTX 5090 환경에서 진행한 Sam Hottman의 한국어 모델 5종 비교
- 합성 전 TTS 대본 정규화 — 날짜, 금액, 버전, 식별자, 명령어를 위한 Sam Hottman의 완화 방법
빈 곳
- 한국어 음성과 콘텐츠 형식을 아우르는 독립적인 블라인드 청취 테스트.
- 모델 revision별로 재현 가능한 latency, VRAM, CPU throughput, 장시간 안정성 측정.
- 상업적 배포를 위한 코드·weight·생성 출력물의 라이선스 조건 검증.
- 한국어 숫자와 기술 표기 오류율을 측정한 정규화 규칙 세트.