구글 딥마인드가 9월 23일(현지시간) 새로운 음성 합성(TTS, 글자를 사람 목소리로 읽어주는 기술) 모델 두 종을 공개했다. ‘제미나이 3.8 플래시 TTS’와 ‘제미나이 3.8 플래시-라이트 TTS’다. 두 모델은 공개 당일부터 제미나이 API와 구글 AI 스튜디오에서 개발자에게 제공된다.
구글은 이번 모델의 성격을 ‘고정된 프리셋 음성에서 창작 스튜디오로’의 전환이라고 설명했다. 플래시 TTS는 캐릭터 설계와 세밀한 연기 지시에, 플래시-라이트 TTS는 대량 더빙과 음성 에이전트처럼 비용 효율이 중요한 작업에 초점을 맞췄다.
프롬프트로 목소리를 만든다
가장 큰 변화는 목소리를 직접 설계할 수 있다는 점이다. 기존 30종의 기본 음성 대신, 자연어 프롬프트로 역할, 억양, 음색을 지정해 100개 이상의 언어와 방언에서 새 목소리를 만들 수 있다. 바로 쓸 수 있는 음성 라이브러리는 2000종 이상으로 늘었고, 멕시코 스페인어, 퀘벡 프랑스어, 스코틀랜드 영어 같은 지역 변이도 포함된다.
30초 분량의 음성 샘플만 있으면 특정 목소리를 복제하는 기능도 들어갔다. 다만 구글은 음성 주인의 구두 동의 녹음이 참조 화자와 일치해야 복제가 가능하도록 동의 검증 절차를 뒀다. 음색, 피치, 속도, 억양을 프롬프트로 미세 조정하는 ‘보이스 리믹싱’은 추후 제공된다.
대본 단위 연출 기능도 추가됐다. 줄마다 연기 지시를 적어 속도와 감정을 조절하고, <laughs> <sigh> 같은 비언어적 표현이나 |mhm| 같은 맞장구를 넣을 수 있다. 한 대본에서 두 화자의 대화를 자연스러운 turn-taking(말 주고받기)으로 생성하는 기능도 지원해 팟캐스트나 드라마 제작을 겨냥했다.
벤치마크와 안전장치
구글은 플래시 TTS가 휴먼AI(Hume AI)의 보이스 디자인 벤치마크에서 71.4점으로 1위, 억양 모델링에서 60.8점으로 선두를 기록했다고 밝혔다. 전체 품질 지표에서는 플래시 TTS와 플래시-라이트 TTS가 각각 1, 2위를 차지했다고 덧붙였다. 보이스 아레나의 블라인드 선호도 평가에서는 일본어, 브라질 포르투갈어, 베트남어, 표준 아랍어, 멕시코 스페인어, 힌디어에서 상위권에 올랐다고 설명했다. 한국어 성적은 발표에 언급되지 않았다.
안전 측면에서는 생성된 모든 오디오에 사람이 들을 수 없는 워터마크 ‘SynthID’를 새겨 AI 생성 여부를 탐지할 수 있게 했고, 음성 복제에는 C2PA 콘텐츠 자격 증명도 적용했다. 다만 AI 스튜디오를 통한 음성 복제 기능은 미국 일리노이, 텍사스주와 유럽경제지역(EEA), 영국, 스위스, 인도에서는 제공되지 않는다. 한국은 이 제외 목록에 들어 있지 않다.
기업용으로는 제미나이 엔터프라이즈 API를 통해 추후 제공되며, 일반 사용자는 제미나이 노트북(플래시 TTS)과 구글 비즈(플래시-라이트 TTS)에서 접할 수 있다. 어고라, 라이브킷, 파이프캣, 버셀 등 개발자 플랫폼이 제미나이 API로 연동을 지원하고, 피그마, 헤이젠, 원더크래프트 등이 이미 도입에 나섰다.
국내 개발자 입장에서 확인할 대목은 가격과 한국어 품질이다. 구글은 이번 발표에서 토큰 단가나 사용량 기준을 공개하지 않았고, 한국어 음성 라이브러리 규모나 방언 지원 범위도 밝히지 않았다. 음성 복제가 개인정보, 초상권 문제와 맞닿아 있는 만큼, 국내에서 상용 서비스에 적용하려는 기업이라면 동의 검증 절차가 국내 법제와 어떻게 맞물리는지도 따져볼 필요가 있다.
