합성 전 TTS 대본 정규화
TTS 생성 전에 숫자와 기술 토큰을 발음 형태로 다시 쓴다
정의
TTS 대본 정규화는 정본 대본과 음성 생성 사이에 발음용 사본을 끼워 넣는 과정이다. 독자에게는 유용하지만 음성 모델에는 모호한 표기, 예를 들어 날짜, 금액, 백분율, 버전 번호, 하드웨어 표기, 파일 경로, 터미널 명령어를 대상으로 한다.
관점
Sam Hottman (2026-08-29, YouTube)
합성 직전에 정규식으로 까다로운 토큰을 찾아내고, 언어 모델이나 코딩 에이전트로 사람이 소리 내어 말할 형태로 다시 쓴다. 예를 들어 TTS 모델이 의도한 발음을 추론하리라 기대하지 말고 명령어 이름의 구두점과 기호를 풀어 쓴다. 기술 대본에는 검토나 승인 단계를 남겨 둔다. 검토하지 않은 명령어 중심 내레이션에서는 렌더링한 오디오를 들어 본 뒤에야 오류를 발견한 적이 있다.
정규화로도 출력을 안정화할 수 없다면 수정하지 않은 같은 대본을 반복 렌더링하지 말고 TTS 모델을 바꾼다. 소스의 단일 명령어 테스트에서는 VoxCPM2가 가장 나았지만, 모든 모델이 일부 숫자 또는 기술 표현을 잘못 읽었다.
적용
- 금융, 날짜 민감형, 개발자용, 하드웨어 관련 대본에 이 경계를 쓴다. 평범한 서술형 원고라면 추가 단계가 필요하지 않을 수 있다.
- 발음 표기가 자막, 글, 문서에 섞이지 않도록 작성 정본 대본을 별도로 보관한다.
- 콘텐츠 자동화를 위한 오픈소스 TTS 모델 선택의 후보를 대상으로 변환 결과를 시험한다.
- Claude Code 같은 코딩 에이전트가 결정론적 탐지를 구현할 수 있지만, 결과가 중요한 출력은 사람이 계속 들어 봐야 한다.
- 발음 실패를 일반 콘텐츠 편집 문제로 취급하지 말고 음성 워크플로 안에서 관리한다.
한계
-
소스는 실패 유형을 보여 주지만 완전한 정규화 규칙 세트나 측정된 오류 감소율을 공개하지 않는다.
-
언어 모델의 재작성은 식별자나 의미를 바꿀 수 있으므로 정확한 명령어와 값은 보호된 정본 사본에 보관해야 한다.
-
이 권고는 한국어 테스트 하나에 근거하며 다른 언어나 모델 revision에는 그대로 적용되지 않을 수 있다.