2026 AI TTS 가이드: 텍스트를 자연스러운 음성으로 변환하는 방법
ElevenLabs, OpenAI, Google Cloud, Azure의 최신 TTS 모델과 API, 가격 단위, 음성 복제·AI 음성 고지 기준을 한국어 제작 관점에서 비교합니다.
핵심 요약
- 2026년 주요 TTS 모델과 API를 공식 문서 기준으로 비교
- 문자·토큰 과금이 다른 서비스의 실제 비용 계산법
- 한국어 품질 테스트와 음성 복제·AI 생성 음성 고지 체크리스트
“가장 좋은 TTS”보다 실패 비용을 고르자
샘플 한 문장만 들으면 가장 자연스러운 목소리를 고르면 될 것 같습니다. 긴 원고, 실시간 상담, 다국어 안내로 넘어가면 얘기가 달라집니다. 한국어 발음, 음색의 일관성, 첫 오디오까지의 지연, 스타일 제어, 음성 복제 권한, 데이터 처리 지역이 서로 다른 선택을 만듭니다.
빠르게 후보를 줄이면 다음과 같습니다.
| 우선 과제 | 먼저 시험할 후보 | 확인할 함정 |
|---|---|---|
| 감정이 큰 광고·캐릭터 연기 | ElevenLabs Eleven v3 | 짧은 문장 결과를 긴 원고 품질로 일반화하지 않기 |
| 긴 나레이션의 안정성 | ElevenLabs Multilingual v2, Azure 배치 합성 | 고유명사·숫자 발음과 문단 간 음색 변화 |
| 앱에서 지시문으로 말투 제어 | OpenAI gpt-4o-mini-tts, Google Gemini-TTS | 한국어가 지원돼도 기본 음성이 영어에 최적화됐을 수 있음 |
| 실시간 음성 응답 | ElevenLabs Flash v2.5, OpenAI 스트리밍, Google 스트리밍 | 공급자 수치가 아니라 실제 네트워크의 P95 지연 측정 |
| SSML·기업용 음성 운영 | Azure Speech, Google Cloud TTS | 모델마다 지원하는 SSML 태그와 지역이 다름 |
| 실제 사람의 음성 복제 | 승인된 커스텀 음성 기능 | 동의, 사용 범위, 철회·삭제 절차를 기능보다 먼저 설계 |
이 표는 품질 순위가 아니라 첫 테스트 후보입니다. 최종 선택은 같은 한국어 원고와 같은 출력 조건으로 비교해야 합니다.
AI TTS가 하는 일
TTS는 텍스트를 발음 단위로 해석하고, 문맥에 맞는 속도·강세·휴지를 정한 뒤 오디오 파형을 생성합니다. 최근 모델은 자연어 지시문이나 SSML(Speech Synthesis Markup Language)로 말투를 조절할 수 있습니다.
실무에서는 모델 구조보다 다음 네 결과가 중요합니다.
- 정확성: 숫자, 날짜, 영문 약어, 고유명사를 의도대로 읽는가
- 일관성: 10초 샘플뿐 아니라 10분 이상에서도 음색과 속도가 유지되는가
- 응답성: 첫 오디오가 언제 재생되고, 끊김 없이 이어지는가
- 운영 가능성: 재시도, 사용량 제한, 데이터 지역, 권한과 고지 요구를 감당할 수 있는가
2026년 주요 TTS 서비스와 API
ElevenLabs: 표현력·복제·저지연 모델을 분리해 선택
ElevenLabs 모델 문서는 용도별로 모델을 구분합니다.
eleven_v3: 70개 이상 언어와 다중 화자 대화를 지원하는 표현 중심 모델eleven_multilingual_v2: 한국어를 포함한 29개 언어에서 긴 형식의 안정성을 우선한 모델eleven_flash_v2_5: 32개 언어와 약 75ms의 모델 지연을 안내하는 실시간용 모델. 이 수치는 애플리케이션·네트워크 지연을 제외합니다.
Flash v2.5는 낮은 지연을 위해 숫자 정규화가 기본적으로 제한될 수 있습니다. 전화번호, 날짜, 통화가 중요한 한국어 서비스라면 API에 보내기 전에 “2026-07-26”을 “이천이십육년 칠월 이십육일”처럼 읽을 형태로 바꾸거나 Multilingual v2와 비교해야 합니다.
기존 Python 예제에서 쓰던 generate, set_api_key 방식 대신 현재 ElevenAPI 빠른 시작의 클라이언트 방식을 사용할 수 있습니다.
import os
from elevenlabs.client import ElevenLabs
client = ElevenLabs(api_key=os.environ["ELEVENLABS_API_KEY"])
audio = client.text_to_speech.convert(
text="결제 금액은 12만 5천 원이며, 7월 26일에 처리됩니다.",
voice_id="YOUR_VOICE_ID",
model_id="eleven_multilingual_v2",
output_format="mp3_44100_128",
)
with open("narration.mp3", "wb") as output:
for chunk in audio:
if chunk:
output.write(chunk)
음성 복제는 Instant Voice Cloning(짧은 샘플로 빠르게 생성)과 Professional Voice Cloning(더 긴 데이터로 전용 모델 미세 조정)으로 나뉩니다. 공식 복제 문서는 음성 검증과 권한 확인 절차를 설명합니다. 특히 Professional Voice Clone 정책에 따르면 본인 음성만 직접 만들 수 있습니다. 다른 화자의 음성이 필요하면 그 화자가 자신의 계정에서 검증한 뒤 공유하는 흐름을 확인해야 합니다.
OpenAI: 지시문 기반 말투 제어와 기존 API 통합
OpenAI의 현재 Speech API 기본 선택은 gpt-4o-mini-tts입니다. 공식 TTS 가이드는 억양, 감정 범위, 속도, 톤, 속삭임 등을 instructions로 지시할 수 있고, 스트리밍 출력도 지원한다고 안내합니다. 한국어를 생성할 수 있지만 내장 음성은 영어에 최적화되어 있으므로 한국어 샘플 평가는 별도로 해야 합니다.
from pathlib import Path
from openai import OpenAI
client = OpenAI()
output_path = Path("narration.mp3")
with client.audio.speech.with_streaming_response.create(
model="gpt-4o-mini-tts",
voice="coral",
input="오늘은 AI 음성 합성 서비스를 고르는 기준을 알아봅니다.",
instructions="차분한 한국어 다큐멘터리 내레이션처럼 말하세요.",
) as response:
response.stream_to_file(output_path)
tts-1과 tts-1-hd도 문서에 남아 있지만, 새 구현을 과거의 6개 음성·HD 모델 중심으로 설계할 이유는 줄었습니다. 최신 내장 음성 집합은 모델에 따라 다르므로 코드에 목록을 고정하지 말고 문서나 API를 기준으로 관리하는 편이 안전합니다.
OpenAI 커스텀 음성은 지원하지 않는다는 기존 설명도 더는 정확하지 않습니다. 현재는 대상 고객에게 제한적으로 제공되며, 음성 소유자의 동의 녹음과 같은 화자의 샘플 녹음이 필요합니다. 일반 계정에서 바로 쓸 수 있는 기능으로 오해해서는 안 됩니다.
Google Cloud: Gemini-TTS와 Chirp 3를 목적에 맞게 구분
Google Cloud TTS는 이제 WaveNet·Neural2만 비교해서는 부족합니다.
- Gemini-TTS: 자연어 프롬프트로 스타일·속도·감정과 단일/다중 화자를 제어합니다.
gemini-2.5-flash-tts는 낮은 지연과 비용 효율,gemini-2.5-pro-tts는 품질 중심 선택입니다.gemini-3.1-flash-tts-preview처럼 이름에 Preview가 붙은 모델은 사전 제공 조건을 확인해야 합니다. - Chirp 3: HD: 대화형 앱과 스트리밍을 위한 최신 HD 음성 계열입니다.
- Neural2·WaveNet·Standard: SSML 기반의 예측 가능한 제어와 기존 시스템 호환성이 중요한 경우 여전히 비교할 가치가 있습니다.
Google은 모델·요청 방식에 따라 SSML 지원 범위가 다릅니다. 음성 유형 문서는 Chirp 3: HD의 일반 제약을 안내하는 반면, Chirp 3 문서는 동기 요청에서 일부 SSML 태그를 지원하는 Preview 기능과 스트리밍 요청의 미지원 범위를 따로 설명합니다. “Google Cloud는 SSML을 지원한다”는 제품 수준 문장만 보고 모델을 고르지 말고, 사용할 엔드포인트와 출시 단계에서 지원 태그를 다시 확인해야 합니다.
데이터 위치가 중요한 조직은 지역 엔드포인트 문서에서 선택 모델이 global, us, eu 또는 특정 리전에 제공되는지 먼저 확인해야 합니다.
Microsoft Azure Speech: SSML·배치·권한 통제가 중요한 운영
Azure Speech TTS 개요는 표준 신경망 음성, 실시간 합성, SSML, 그리고 10분을 넘는 오디오를 위한 비동기 배치 합성을 제공합니다. SDK와 REST API를 모두 제공하지만 Microsoft는 일반적인 앱에서는 이벤트와 진단 정보를 얻기 쉬운 Speech SDK를 우선하고, SDK를 쓸 수 없는 경우 REST를 고려하라고 안내합니다.
브랜드 음성을 만드는 Professional Voice와 사용자 개인화를 위한 Personal Voice는 표준 음성과 별도입니다. Custom Voice 문서는 제한된 접근과 사전 승인이 필요하다고 명시합니다. 따라서 “Azure 계정이 있으면 곧바로 브랜드 음성을 학습할 수 있다”는 전제로 일정을 잡으면 안 됩니다.
가격: 월 구독료보다 과금 단위를 먼저 맞추기
아래는 2026년 7월 26일 공식 가격 페이지에서 확인한 공개 기준입니다. 세금, 지역, 계약, 무료 한도, 모델 변경에 따라 달라질 수 있으므로 발주 직전 링크를 다시 확인해야 합니다.
| 공급자·모델 | 공개 과금 기준 | 비교할 때 주의할 점 |
|---|---|---|
| ElevenLabs Flash/Turbo | API 1,000자당 $0.05 | 구독 포함량과 종량제는 별도 확인 |
| ElevenLabs Multilingual v2/v3 | API 1,000자당 $0.10 | 공유 음성이나 상품에 따라 조건이 달라질 수 있음 |
OpenAI gpt-4o-mini-tts | 입력 텍스트 100만 토큰당 $0.60, 출력 오디오 100만 토큰당 $12 | 문자 과금 서비스와 숫자를 바로 비교할 수 없음 |
| Google Gemini 2.5 Flash TTS | 입력 텍스트 100만 토큰당 $0.50, 출력 오디오 100만 토큰당 $10 | 오디오 토큰은 초당 25개로 계산 |
| Google Chirp 3: HD | 100만 자당 $30 | 공백·개행과 대부분의 SSML 태그도 문자 수에 포함 |
| Azure 표준 Neural | 문자 기반 과금, F0는 월 50만 자 무료 | 유료 단가는 통화·리전·계약 조건을 가격 페이지에서 확인 |
출처: ElevenLabs API 가격, OpenAI 모델 가격, Google Cloud TTS 가격, Azure Speech 가격.
서로 다른 단위를 실제 월 비용으로 바꾸는 법
가격표의 “100만 자”와 “100만 오디오 토큰”은 같은 분모가 아닙니다. 다음 방식이 더 정확합니다.
- 실제 원고에서 짧은 안내, 숫자 많은 문장, 5분 이상 나레이션을 합쳐 20개 샘플을 만든다.
- 각 공급자에서 같은 속도와 파일 형식으로 생성한다.
- 대시보드의 청구 사용량과 완성 오디오 분량을 기록한다.
샘플 총비용 ÷ 통과한 오디오 분으로 사용 가능한 1분당 비용을 계산한다.- 재생성률을 곱한다. 초안의 20%를 다시 만들었다면 예상 비용에 최소 1.2를 적용한다.
값싼 첫 생성이 발음 오류로 두 번 재생성된다면 더 비싼 모델보다 총비용이 커질 수 있습니다.
한국어 TTS 선택을 위한 30분 평가표
공급자 데모의 영어 문장이나 감정이 큰 한 문장만 듣고 결정하지 마세요. 아래 원고를 각 후보에 동일하게 입력하면 한국어에서 자주 드러나는 차이를 짧게 확인할 수 있습니다.
1. 결제 금액은 125,800원이며 2026년 7월 26일에 출금됩니다.
2. 문의 번호는 02-1234-5678, 주문 번호는 A-01942입니다.
3. GPU, API, TTS를 소개한 뒤 "에이아이 스팟"을 또렷하게 읽어 주세요.
4. 서울에서 부산까지 KTX로 이동한 뒤, 오후 3시 20분에 회의를 시작합니다.
5. 같은 문장을 차분한 안내, 긴급 공지, 따뜻한 나레이션의 세 방식으로 말합니다.
6. 이 문단은 최소 3분 이상 이어 붙여 속도와 음색이 끝까지 유지되는지 확인합니다.
각 출력은 다음 기준으로 1~5점을 매깁니다.
| 기준 | 권장 가중치 | 실패 예 |
|---|---|---|
| 한국어 발음 정확성 | 30% | 숫자·영문 약어·조사 연결 오류 |
| 긴 원고 일관성 | 20% | 문단마다 속도·음색이 흔들림 |
| 스타일 제어 재현성 | 15% | 같은 지시로 결과 편차가 큼 |
| 실제 P95 첫 오디오 지연 | 15% | 평균은 빠르지만 간헐적으로 대기 |
| 총비용과 재생성률 | 10% | 싼 모델이지만 수정 생성이 잦음 |
| 권한·고지·데이터 운영 | 10% | 필요한 리전·감사 기록·승인 절차가 없음 |
오디오북이라면 긴 원고 일관성의 가중치를 높이고, 음성 챗봇이라면 P95 지연과 중간 취소 가능성을 높이면 됩니다. 점수가 비슷하면 공급자를 하나로 고정하기보다 실시간용과 배치용을 분리하는 편이 장애와 비용을 줄일 수 있습니다.
음성 복제와 AI 생성 음성 고지
음성 복제 기능의 존재는 그 음성을 사용할 권리를 뜻하지 않습니다. 기술적 검증을 통과했더라도 계약상 사용 범위, 게시 채널, 기간, 철회와 삭제 절차는 별도로 관리해야 합니다.
최소 운영 체크리스트
- 청취자 고지: OpenAI는 최종 사용자에게 듣는 음성이 AI 생성이며 사람의 음성이 아니라는 점을 명확히 알리도록 요구합니다. 영상 설명, 플레이어 라벨, 통화 시작 안내처럼 실제 청취 지점에 표시합니다.
- 화자 동의: 음성 소유자, 허용 용도, 채널, 기간을 기록합니다. OpenAI 커스텀 음성은 동의 녹음과 샘플을 분리해 요구하고, Azure Personal Voice도 화자의 명시적 음성 동의를 요구합니다.
- 고지 시점: Microsoft의 합성 음성 고지 가이드는 사용자 기대와 노출 맥락에 맞춰 고지 수준을 정하라고 권합니다. 전화 상담이나 실제 인물처럼 들리는 음성은 상호작용 전에 알리는 것이 안전합니다.
- 철회·삭제: 화자가 동의를 철회했을 때 새 생성 중단, 저장 음성 삭제, 게시물 교체를 누가 언제 수행하는지 정합니다.
- 배포 이력: 모델 ID, voice ID, 원고 버전, 생성일, 동의 근거, 공개 위치를 함께 보관합니다.
실제 사람의 목소리나 상업 캠페인은 관할 법률과 배포 플랫폼 정책이 추가 의무를 둘 수 있습니다. 이 글의 체크리스트는 법률 자문을 대신하지 않습니다.
최종 선택 순서
- 일반 음성으로 해결할 수 있는지 먼저 확인합니다. 실제 사람의 음성을 복제하지 않으면 권한·철회 운영이 훨씬 단순해집니다.
- 한국어 테스트 원고로 후보 2~3개를 평가합니다.
- 스트리밍은 평균이 아니라 실제 환경의 P95 첫 오디오 지연과 중단 복구를 측정합니다.
- 통과한 오디오 1분당 비용과 재생성률로 월 비용을 계산합니다.
- 모델·음성 이름을 코드 전체에 흩뿌리지 말고 설정으로 관리해 교체 가능하게 만듭니다.
- 청취자 고지와 동의·삭제 절차를 출시 조건에 포함합니다.
AI TTS 선택의 핵심은 가장 사람 같은 데모를 찾는 것이 아닙니다. 내 원고를 정확히 읽고, 필요한 속도로 전달하며, 비용과 권한을 지속해서 운영할 수 있는 조합을 찾는 것입니다.
공식 참고자료
관련 글
2026. 1. 17.
Kling AI 3.0 사용 가이드: 모델 선택, 크레딧, 한국어 프롬프트
Kuaishou와 Kling 공식 자료로 Video 3.0·3.0 Omni·네이티브 4K의 차이, 크레딧 비용, 한국어 영상 제작 순서와 상업 이용 주의점을 정리합니다.
2026. 1. 11.
2026 AI 이미지 생성 모델 비교: Midjourney V8.2, GPT Image 2, Nano Banana 2, FLUX.2, Stable Diffusion 3.5
DALL-E 이후의 GPT Image 2부터 Midjourney V8.2, Nano Banana 2, FLUX.2, Stable Diffusion 3.5까지 공식 기능과 현재 가격을 같은 기준으로 비교합니다.
2026. 1. 11.
Gemini 실무 활용 가이드: 구글 AI 활용법 (2026년판)
Gemini의 채팅, 파일 분석, Deep Research, Canvas, Gems를 업무에 맞게 고르고 결과를 검증하는 실전 워크플로를 정리합니다.
이 글이 도움이 되셨나요?
공유하여 더 많은 분들에게 알려주세요.