게임에 로컬에서 도는 TTS를 넣어야 하는 프로젝트를 하고 있었다. 서버를 거치지 않고 기기 안에서 음성을 만들어야 하는 요구라, 그런 에셋이 있는지부터 확인해야 했다. 그러다 Unity 에셋스토어의 DeepVoice AI - Text To Voice 리뷰를 보게 됐고, 로컬에서 도는 것처럼 읽히는 설명이라 스크랩해뒀었다.
리뷰 자체는 직접 써보고 결과물까지 붙여둔 성실한 글이다. 문제는 내가 이걸 스크랩하게 만든 바로 그 문장이었다.
하지만 예상과 다르게 DeepVoiceAI는 외부 연결 없이 완전히 독립적으로 유니티 에디터에서 음성을 생성하는 솔루션이다.
이건 사실이 아니다. 이 에셋은 서버 기반이고, 그러니 내가 찾던 조건에는 애초에 맞지 않았다. 그리고 재밌는 건, 그렇지 않다는 근거가 같은 글 안에 이미 네 개나 적혀 있었다는 점이다.
목차
목차
어떤 에셋인가
AiKodex가 만든 텍스트-투-스피치 에셋으로, Unity 에디터 안에서 대사 텍스트를 음성 파일로 뽑는다. 원문이 정리한 특징은 이렇다.
- 95개 이상의 음성 모델
- 생성된 오디오를 자르고, 잇고, 음량·피치 조절
- 에디터 편집 모드와 재생 모드 양쪽에서 동작
- 생성 시간 8~15초
원문은 2024년 4월 기준이고, 지금은 상황이 좀 달라졌다. 확인해보니 원래 에셋은 v2.1.5(2026-03-18 갱신, $80)까지 왔고, 그 사이 상위 제품인 DeepVoice Pro(v3.0.7, 2026-04-22 갱신, $99.99)가 따로 나와 있다. 원문이 “개발자들도 아직 초기단계라고 하니”라고 적어둔 시점에서 2년이 지났고, 두 제품 다 계속 갱신되고 있다.
“외부 연결 없이 완전히 독립적으로”
원문이 이 결론에 이른 경로는 이해가 된다. 에셋 설명에 이렇게 적혀 있기 때문이다.
가입 없음, API 키 없음, 반복 결제 없음, 구독료 없음, 추가 비용 없음
이걸 보면 “그럼 로컬에서 도는구나”로 읽기 쉽다. 하지만 이 문구가 말하는 건 내가 관리할 계정과 키와 구독이 없다는 것이지, 외부 서버를 안 쓴다는 뜻이 아니다. 퍼블리셔 본인의 설명이 명확하다.
Since it is server-based, the mobile devices will have the same generation time as on a PC.
같은 스레드에서 요구사항도 못 박는다.
This tool requires the Editor Coroutines package from the package manager and an active internet connection.
공식 문서의 문제 해결 절도 같은 그림이다. 생성이 안 될 때의 안내가 “인터넷 연결을 확인하라”이고, 본문에 remote servers와 the API라는 표현이 나온다.
정리하면 이 에셋은 로컬 추론 도구가 아니라, 서버 TTS 서비스에 붙는 에디터 클라이언트다. 요금 구조가 특이할 뿐이다. 보통은 월 구독이나 종량제로 받을 것을 에셋 1회 구매값에 얹어 파는 것이고, 인보이스 번호가 사실상 API 키 역할을 한다.
원문 안에 이미 답이 있었다
이게 흥미로운 이유는, 원문이 서버 기반이라는 정황을 네 개나 직접 적어놓고도 반대 결론을 냈다는 점이다.
- 인보이스 번호 입력과 검증 — “인보이스가 확인되었다는 로그가 출력되면 완료된 것.” 로컬에서만 도는 툴이라면 무엇에 대고 확인하나.
- 사용량 한도와 주기적 초기화 — 원문 기준 월 6만 자, 매월 1일 초기화. 할당량은 서버에서만 셀 수 있다. 로컬 도구는 나를 계량할 이유도 수단도 없다.
- 생성 시간 8~15초 — 왕복 요청 시간에 해당하는 값이다.
- EditorCoroutines 의존 — 에디터에서 오래 걸리는 비동기 작업을 돌릴 때 쓰는 패키지다. 웹 요청을 에디터에서 기다리려면 필요하다.
넷 다 같은 방향을 가리킨다. 마케팅 문구 한 줄이 관찰 네 개를 이긴 셈이다.
이게 왜 중요한가
내 경우에는 이 한 줄이 곧 탈락 사유였다. 로컬 TTS가 필요했으니 서버 기반인 시점에서 후보가 아니다. 그 요구가 없더라도 서버 의존은 실무에서 몇 가지를 바꾼다.
- 벤더가 서비스를 내리면 에셋이 멈춘다. 1회 구매라 영구 소유처럼 보이지만, 생성 기능은 남의 서버에 달려 있다. 로컬 추론 도구라면 없을 위험이다.
- 오프라인·폐쇄망에서 안 된다. 빌드 머신이나 사내망에서 리소스를 다시 뽑아야 할 때 걸린다.
- 대사 텍스트가 외부로 나간다. 미공개 프로젝트의 스토리 대사를 넣는 것이므로, 조직에 따라 검토 대상이다.
- 결과물을 반드시 프로젝트에 커밋해둬야 한다. 언제든 재생성할 수 있다고 가정하면 안 된다.
사용량 한도는 시점에 따라 다르다
숫자가 자료마다 다르다.
- 원문(2024-04) — 월 6만 자, 매월 1일 초기화
- 현재 공식 문서 — “We use this to assign you the number of characters every fortnight”(2주 단위 지급)
- 퍼블리셔 포럼 안내 — 월 3만 자를 15일마다 1.5만 자씩, 매월 1일과 15일에 지급
원문이 틀렸다기보다 정책이 바뀐 것으로 보인다. 어느 쪽이든 이 숫자는 시간에 민감하니, 구매 전에 현재 리스팅과 문서를 직접 확인하는 게 맞다. 대사량이 많은 프로젝트라면 이 한도가 곧 작업 속도의 상한이 된다.
상업적 이용은 가능하다
원문에 없는 항목인데, 게임에 넣을 리소스를 만드는 도구라면 사실 가장 먼저 확인해야 할 부분이다. 퍼블리셔가 Unity Discussions 스레드에서 직접 답변해뒀다.
Yes, this product can be used commercially. All the voices offered in the asset are in the open public domain or are based on fictitious characters.
실존 성우의 목소리를 학습한 모델이 아니라 공개 도메인이거나 가상 인물 기반이라는 설명이다. 생성형 음성 도구를 고를 때 갈리는 지점이 보통 여기다.
다만 이 답변을 그대로 근거로 삼기 전에 짚을 게 셋 있다.
- 작성일이 2023년 7월이다. 지금은 v2.1.5까지 왔고 DeepVoice Pro도 따로 나왔다. 모델 구성이나 약관이 그대로라는 보장은 없다.
- 실제 근거는 포럼 글이 아니라 에셋 안의 약관 파일이다. 같은 답변이 “We’ve included a terms of use and service within the asset”이라고 밝힌다. 구매했다면 그 파일이 우선이다.
- 음성 출처가 모델마다 다르다. 답변은 Neural과 Standard 모델이 Amazon의 TTS 기반이라고 밝히는데, 원문에서 한국어에 쓰는 Multi 모델이 어디서 온 것인지는 언급이 없다. 한국어 대사를 상업적으로 쓸 계획이라면 이 부분은 따로 확인해야 한다.
텍스트로 연기 지시하기
원문에서 가장 실용적인 부분이다. 대사 텍스트 자체에 표기를 넣어 억양을 조절한다.
머뭇거림 — 대시(-), 긴 대시(—), 줄임표(…)를 넣으면 말 사이에 멈춤이
들어간다. 줄바꿈도 같은 역할을 한다.
그렇지만- 이건- 내가 원한게 아니야
감정 — 대사를 이스케이프한 따옴표로 감싸면 지문처럼 해석한다. 백슬래시가 반드시 필요하다.
\” 정말인가요? \” 그는 혼란스러워하며 말했다.
파라미터는 두 개다. 공식 문서의 정의는 이렇다.
Variability: Sets a tone of the voice which allows for experimentation. Decreasing variability can make speech more expressive… However, it can also lead to instabilities.
Clarity: High values boost overall voice clarity and target speaker similarity. Very high values can cause artifacts.
원문이 “높을수록 나레이션 톤, 낮을수록 연기 톤”으로 정리한 게 이 정의와 맞는다. 두 파라미터는 Mono와 Multi 모델에만 적용되고, 한국어는 Multi 모델에서만 쓸 수 있다는 점도 원문 그대로다.
그리고 원문의 총평은 지금 봐도 유효한 관찰이다.
나레이션 생성용으로는 수준급, 감정 대사는 많은 시도 필요.
생성형 도구는 같은 설정에서도 매번 다른 결과가 나온다. 나레이션처럼 톤이 일정한 대사는 잘 나오지만, 감정이 실린 대사를 원하는 대로 뽑으려면 여러 번 생성해서 고르는 작업이 붙는다. 작업량이 “생성 시간 × 시도 횟수”로 계산된다는 뜻이고, 앞의 사용량 한도와 곱해지면 실제 제약이 된다.
그럼 로컬로 도는 건 뭐가 있나
내가 원래 찾던 것으로 돌아가면, 오프라인 TTS 에셋 자체는 있다. 확인한 것 둘만 적어둔다.
- Overtone - Realistic AI Offline Text to Speech — 공식 문서가 “Overtone is an offline Text-to-Speech asset for Unity”로 시작한다. 15개 이상 언어와 900개 이상의 영어 음성을 내세운다. 다만 한국어 지원 여부는 공개 문서에서 확인하지 못했다.
- Speech Generation System — 이름부터 “Offline text-to-speech conversion”이고, 지원 언어에 한국어가 명시되어 있다. $19.99, v1.2.2(2024-06-01), Windows·스탠드얼론 대상이며 파일 크기가 142MB다.
여기서 파일 크기가 곧 신호라는 점을 짚어둘 만하다. 진짜로 로컬에서 추론하는 도구는 모델 가중치를 함께 배포해야 하므로 패키지가 무거워진다. 반대로 수백 개 음성을 제공하면서 패키지가 가벼우면, 그 음성들이 내 기기에 있을 리가 없다. DeepVoice가 95개 이상의 음성 모델을 광고하면서도 서버 기반인 이유가 이것이다.
플랫폼 내장 TTS를 쓰는 길도 있다. Android의 TextToSpeech, iOS의
AVSpeechSynthesizer, Windows의 음성 합성은 기기에 이미 들어 있고,
이를 감싼 네이티브 플러그인들이 있다. 음질은 신경망 TTS보다 떨어지지만
용량이 0에 가깝고 완전히 오프라인이다. 그리고 Unity에서 직접 만들겠다면
ONNX 기반 TTS 모델을 Sentis(Inference Engine)에 올리는 선택지도 있다.
정리하면 로컬 TTS를 고를 때의 판단 순서는 이렇다. (1) 패키지 크기와 모델 포함 여부를 먼저 보고, (2) 필요한 언어가 지원되는지 확인하고, (3) 대상 플랫폼이 맞는지 본다. “오프라인”이라는 단어보다 이 셋이 더 확실한 증거다.
2026년에 이 에셋을 볼 때
원문의 마지막 문장은 “개발자들도 아직 초기단계라고 하니 앞으로 품질은 더욱 향상될 것”이었다. 2년이 지난 지금 두 제품 다 갱신되고 있으니 그 기대는 빗나가지 않았다.
다만 판단 기준은 원문 때와 달라졌다. 2024년에는 “에디터 안에서 바로 뽑을 수 있다”는 것 자체가 이점이었지만, 지금은 TTS 자체가 흔해졌다. 그래서 남는 질문은 이렇게 된다.
- 에디터 통합에 값을 매길 것인가 — 대사를 텍스트로 관리하고 에디터에서 바로 오디오 클립으로 떨구는 워크플로가 필요하다면 이 에셋의 값이 여기 있다. 범용 TTS 서비스를 쓰면 파일을 내려받아 임포트하는 단계가 계속 붙는다.
- 한국어 품질을 직접 들어볼 것 — 원문도 “영어가 학습 데이터가 많아 퀄리티가 더 좋다”고 적었다. 한국어 대사가 주력이라면 이게 결정적이다.
- 서버 의존을 감수할 것인가 — 위에서 정리한 그대로다.
정리
- DeepVoice AI는 서버 기반 TTS다. 원문의 “외부 연결 없이 완전히 독립적으로”는 사실이 아니고, 퍼블리셔가 직접 “server-based”라고 밝힌다.
- “가입 없음, API 키 없음, 구독료 없음”은 내가 관리할 게 없다는 뜻이지 서버를 안 쓴다는 뜻이 아니다. 인보이스 번호가 API 키 역할을 한다.
- 서버 기반이라는 근거는 원문 안에 이미 넷 있었다. 인보이스 검증, 사용량 한도, 8~15초 생성 시간, EditorCoroutines 의존.
- 서버 의존은 벤더 리스크, 폐쇄망 불가, 대사 텍스트 외부 전송, 재생성 불가 가능성을 남긴다. 결과물은 반드시 프로젝트에 보관할 것.
- 사용량 한도는 자료마다 다르다. 구매 전 현재 리스팅을 확인할 것.
- 상업적 이용은 퍼블리셔가 가능하다고 명시했다. 음성은 공개 도메인이거나 가상 인물 기반이라는 설명이다.
- 나레이션은 수준급, 감정 대사는 여러 번 뽑아 골라야 한다는 원문의 평가는 지금도 유효하다.
- 상업적 이용 답변은 2023년 7월 것이고, 실제 근거는 에셋 안의 약관 파일이다. 한국어에 쓰는 Multi 모델의 음성 출처는 그 답변에 없다.
- 진짜 로컬 TTS를 찾는다면 패키지 크기가 가장 정직한 신호다. 모델을 같이 배포해야 하므로 무거울 수밖에 없다.