본문으로 건너뛰기
HY Devlog
뒤로 가기

DeepVoice AI 에셋 다시 보기: '외부 연결 없이 독립적으로'가 아니었다

게임에 로컬에서 도는 TTS를 넣어야 하는 프로젝트를 하고 있었다. 서버를 거치지 않고 기기 안에서 음성을 만들어야 하는 요구라, 그런 에셋이 있는지부터 확인해야 했다. 그러다 Unity 에셋스토어의 DeepVoice AI - Text To Voice 리뷰를 보게 됐고, 로컬에서 도는 것처럼 읽히는 설명이라 스크랩해뒀었다.

리뷰 자체는 직접 써보고 결과물까지 붙여둔 성실한 글이다. 문제는 내가 이걸 스크랩하게 만든 바로 그 문장이었다.

하지만 예상과 다르게 DeepVoiceAI는 외부 연결 없이 완전히 독립적으로 유니티 에디터에서 음성을 생성하는 솔루션이다.

이건 사실이 아니다. 이 에셋은 서버 기반이고, 그러니 내가 찾던 조건에는 애초에 맞지 않았다. 그리고 재밌는 건, 그렇지 않다는 근거가 같은 글 안에 이미 네 개나 적혀 있었다는 점이다.

목차

목차

어떤 에셋인가

AiKodex가 만든 텍스트-투-스피치 에셋으로, Unity 에디터 안에서 대사 텍스트를 음성 파일로 뽑는다. 원문이 정리한 특징은 이렇다.

원문은 2024년 4월 기준이고, 지금은 상황이 좀 달라졌다. 확인해보니 원래 에셋은 v2.1.5(2026-03-18 갱신, $80)까지 왔고, 그 사이 상위 제품인 DeepVoice Pro(v3.0.7, 2026-04-22 갱신, $99.99)가 따로 나와 있다. 원문이 “개발자들도 아직 초기단계라고 하니”라고 적어둔 시점에서 2년이 지났고, 두 제품 다 계속 갱신되고 있다.

“외부 연결 없이 완전히 독립적으로”

원문이 이 결론에 이른 경로는 이해가 된다. 에셋 설명에 이렇게 적혀 있기 때문이다.

가입 없음, API 키 없음, 반복 결제 없음, 구독료 없음, 추가 비용 없음

이걸 보면 “그럼 로컬에서 도는구나”로 읽기 쉽다. 하지만 이 문구가 말하는 건 내가 관리할 계정과 키와 구독이 없다는 것이지, 외부 서버를 안 쓴다는 뜻이 아니다. 퍼블리셔 본인의 설명이 명확하다.

Since it is server-based, the mobile devices will have the same generation time as on a PC.

같은 스레드에서 요구사항도 못 박는다.

This tool requires the Editor Coroutines package from the package manager and an active internet connection.

공식 문서의 문제 해결 절도 같은 그림이다. 생성이 안 될 때의 안내가 “인터넷 연결을 확인하라”이고, 본문에 remote serversthe API라는 표현이 나온다.

정리하면 이 에셋은 로컬 추론 도구가 아니라, 서버 TTS 서비스에 붙는 에디터 클라이언트다. 요금 구조가 특이할 뿐이다. 보통은 월 구독이나 종량제로 받을 것을 에셋 1회 구매값에 얹어 파는 것이고, 인보이스 번호가 사실상 API 키 역할을 한다.

원문 안에 이미 답이 있었다

이게 흥미로운 이유는, 원문이 서버 기반이라는 정황을 네 개나 직접 적어놓고도 반대 결론을 냈다는 점이다.

  1. 인보이스 번호 입력과 검증 — “인보이스가 확인되었다는 로그가 출력되면 완료된 것.” 로컬에서만 도는 툴이라면 무엇에 대고 확인하나.
  2. 사용량 한도와 주기적 초기화 — 원문 기준 월 6만 자, 매월 1일 초기화. 할당량은 서버에서만 셀 수 있다. 로컬 도구는 나를 계량할 이유도 수단도 없다.
  3. 생성 시간 8~15초 — 왕복 요청 시간에 해당하는 값이다.
  4. EditorCoroutines 의존 — 에디터에서 오래 걸리는 비동기 작업을 돌릴 때 쓰는 패키지다. 웹 요청을 에디터에서 기다리려면 필요하다.

넷 다 같은 방향을 가리킨다. 마케팅 문구 한 줄이 관찰 네 개를 이긴 셈이다.

이게 왜 중요한가

내 경우에는 이 한 줄이 곧 탈락 사유였다. 로컬 TTS가 필요했으니 서버 기반인 시점에서 후보가 아니다. 그 요구가 없더라도 서버 의존은 실무에서 몇 가지를 바꾼다.

사용량 한도는 시점에 따라 다르다

숫자가 자료마다 다르다.

원문이 틀렸다기보다 정책이 바뀐 것으로 보인다. 어느 쪽이든 이 숫자는 시간에 민감하니, 구매 전에 현재 리스팅과 문서를 직접 확인하는 게 맞다. 대사량이 많은 프로젝트라면 이 한도가 곧 작업 속도의 상한이 된다.

상업적 이용은 가능하다

원문에 없는 항목인데, 게임에 넣을 리소스를 만드는 도구라면 사실 가장 먼저 확인해야 할 부분이다. 퍼블리셔가 Unity Discussions 스레드에서 직접 답변해뒀다.

Yes, this product can be used commercially. All the voices offered in the asset are in the open public domain or are based on fictitious characters.

실존 성우의 목소리를 학습한 모델이 아니라 공개 도메인이거나 가상 인물 기반이라는 설명이다. 생성형 음성 도구를 고를 때 갈리는 지점이 보통 여기다.

다만 이 답변을 그대로 근거로 삼기 전에 짚을 게 셋 있다.

텍스트로 연기 지시하기

원문에서 가장 실용적인 부분이다. 대사 텍스트 자체에 표기를 넣어 억양을 조절한다.

머뭇거림 — 대시(-), 긴 대시(), 줄임표()를 넣으면 말 사이에 멈춤이 들어간다. 줄바꿈도 같은 역할을 한다.

그렇지만- 이건- 내가 원한게 아니야

감정 — 대사를 이스케이프한 따옴표로 감싸면 지문처럼 해석한다. 백슬래시가 반드시 필요하다.

\” 정말인가요? \” 그는 혼란스러워하며 말했다.

파라미터는 두 개다. 공식 문서의 정의는 이렇다.

Variability: Sets a tone of the voice which allows for experimentation. Decreasing variability can make speech more expressive… However, it can also lead to instabilities.

Clarity: High values boost overall voice clarity and target speaker similarity. Very high values can cause artifacts.

원문이 “높을수록 나레이션 톤, 낮을수록 연기 톤”으로 정리한 게 이 정의와 맞는다. 두 파라미터는 Mono와 Multi 모델에만 적용되고, 한국어는 Multi 모델에서만 쓸 수 있다는 점도 원문 그대로다.

그리고 원문의 총평은 지금 봐도 유효한 관찰이다.

나레이션 생성용으로는 수준급, 감정 대사는 많은 시도 필요.

생성형 도구는 같은 설정에서도 매번 다른 결과가 나온다. 나레이션처럼 톤이 일정한 대사는 잘 나오지만, 감정이 실린 대사를 원하는 대로 뽑으려면 여러 번 생성해서 고르는 작업이 붙는다. 작업량이 “생성 시간 × 시도 횟수”로 계산된다는 뜻이고, 앞의 사용량 한도와 곱해지면 실제 제약이 된다.

그럼 로컬로 도는 건 뭐가 있나

내가 원래 찾던 것으로 돌아가면, 오프라인 TTS 에셋 자체는 있다. 확인한 것 둘만 적어둔다.

여기서 파일 크기가 곧 신호라는 점을 짚어둘 만하다. 진짜로 로컬에서 추론하는 도구는 모델 가중치를 함께 배포해야 하므로 패키지가 무거워진다. 반대로 수백 개 음성을 제공하면서 패키지가 가벼우면, 그 음성들이 내 기기에 있을 리가 없다. DeepVoice가 95개 이상의 음성 모델을 광고하면서도 서버 기반인 이유가 이것이다.

플랫폼 내장 TTS를 쓰는 길도 있다. Android의 TextToSpeech, iOS의 AVSpeechSynthesizer, Windows의 음성 합성은 기기에 이미 들어 있고, 이를 감싼 네이티브 플러그인들이 있다. 음질은 신경망 TTS보다 떨어지지만 용량이 0에 가깝고 완전히 오프라인이다. 그리고 Unity에서 직접 만들겠다면 ONNX 기반 TTS 모델을 Sentis(Inference Engine)에 올리는 선택지도 있다.

정리하면 로컬 TTS를 고를 때의 판단 순서는 이렇다. (1) 패키지 크기와 모델 포함 여부를 먼저 보고, (2) 필요한 언어가 지원되는지 확인하고, (3) 대상 플랫폼이 맞는지 본다. “오프라인”이라는 단어보다 이 셋이 더 확실한 증거다.

2026년에 이 에셋을 볼 때

원문의 마지막 문장은 “개발자들도 아직 초기단계라고 하니 앞으로 품질은 더욱 향상될 것”이었다. 2년이 지난 지금 두 제품 다 갱신되고 있으니 그 기대는 빗나가지 않았다.

다만 판단 기준은 원문 때와 달라졌다. 2024년에는 “에디터 안에서 바로 뽑을 수 있다”는 것 자체가 이점이었지만, 지금은 TTS 자체가 흔해졌다. 그래서 남는 질문은 이렇게 된다.

정리

참고


이 글 공유하기:

이전 글
Mirror의 클라이언트 사이드 예측: Physics.Simulate 없이 되감기
다음 글
Docker 빌드와 실행 다시 보기: `docker build .`의 점은 Dockerfile 경로가 아니다