신경망 음성 스튜디오
아래에 텍스트를 입력하거나 붙여넣고 스튜디오급 목소리를 즉시 들어보세요.
스튜디오 제작 아키텍처 및 신경망 음성 합성
제로 지연 스트리밍과 결정론적 캐시를 갖춘 고성능 오디오 엔지니어링 워크벤치.
OpenTTS 스튜디오는 회원가입, 유료 구독, API 키 없이 브라우저에서 직접 전문가급 음성 합성을 제공합니다. 2계층 메모리 구조를 기반으로 동일한 텍스트 요청은 Tier 1 RAM LRU 캐시에서 1밀리초 미만으로 즉시 응답하며, 새로운 문장도 16KB 청크 버퍼를 통해 실시간으로 스트리밍 재생됩니다.
당사의 음향 보코더 파이프라인은 최대 24,000Hz까지의 전 가청 주파수를 정밀 모델링하여 자연스러운 포먼트 곡선과 호흡 전환을 재현합니다. 음조, 속도, 볼륨 게인을 디지털 왜곡 없이 미세 조절할 수 있습니다.
자연스러운 쉼표 및 호흡 문법 가이드
복잡한 SSML 태그 없이 대괄호 문법으로 스크립트에 실제 호흡 간격과 운율을 손쉽게 삽입하세요.
| 문법 태그 | 쉼표 지속 시간 | 호흡 및 운율 효과 | 권장 사용 시나리오 |
|---|---|---|---|
[pause:short] | ~0.4초 – 0.6초 | 짧은 쉼표 호흡 | 문장 절 구분, 항목 나열 및 도입부 어구 분리. |
[pause:medium] | ~0.8초 – 1.1초 | 세미콜론 생각 쉼표 | 문맥 전환, 화제 변경 및 여운 강조. |
[pause:long] | ~1.4초 – 1.8초 | 문단 전환 쉼표 | 장면 전환, 소제목 낭독 및 장(Chapter) 마무리. |
[pause:Xs] (예: [pause:2.5s]) | 지정된 시간(초) | 정확한 타이머 무음 | 명상 안내 멘트, 슬라이드 영상 싱크 및 인트로 간격. |
오디오 마스터링 및 코덱 내보내기 사양
디지털 스트리밍, 팟캐스트, 영상 편집(DAW) 표준에 맞춰 정밀하게 보정된 출력 규격.
| 오디오 포맷 | 컨테이너 규격 | 기본 비트레이트 | 샘플 레이트 (Hz) | 최적 활용 분야 |
|---|---|---|---|---|
MP3 | MPEG-1 Audio Layer III | 48 kbps / 128 kbps | 24,000 Hz | 웹 스트리밍, 팟캐스트, 모바일 앱 (가장 빠른 응답 속도). |
WAV | 16비트 비압축 선형 PCM | 768 kbps / 1536 kbps | 24,000 Hz / 48,000 Hz | 프리미어 프로, 다빈치 리졸브, 파이널 컷 프로 영상 편집 및 마스터링. |
OGG | Ogg Vorbis / Opus | 64 kbps | 24,000 Hz | 게임 엔진 (Unity, Unreal Engine), 디스코드 봇, HTML5 웹 오디오. |
AAC | Advanced Audio Coding (M4A) | 64 kbps | 24,000 Hz | 애플 생태계, iOS 앱, 사파리 브라우저 미디어. |
FLAC | Free Lossless Audio Codec | 가변 무손실 | 24,000 Hz | 마스터 음원 아카이빙, 고품질 무손실 팟캐스트 배포. |
개발자 가이드: REST API 연동
인증 헤더 없이 고성능 공개 REST API를 호출하여 프로그램에서 음성을 즉시 합성할 수 있습니다.
curl -X POST "http://localhost:8000/api/v1/tts" \
-H "Content-Type: application/json" \
-d '{
"text": "OpenTTS에 오신 것을 환영합니다. [pause:medium] 스튜디오급 고품질 음성을 생성해보세요.",
"voice": "voice-107",
"pitch": 0,
"speed": 0,
"volume": 100,
"format": "mp3"
}' --output output.mp3OpenTTS 스튜디오 자주 묻는 질문
기술 사양, 상업적 라이선스 규정 및 효율적인 제작 팁.
네! OpenTTS 스튜디오에서 생성된 모든 오디오는 100% 로열티 프리이며 유튜브, 팟캐스트, 상업용 앱, 광고 영상에 자유롭게 수익 창출이 가능합니다.
1회 요청당 최대 2,000자까지 입력 가능합니다. 긴 대본이나 소설은 [pause:long] 태그를 사용하여 단락별로 나누어 생성하는 것을 권장합니다.
OpenTTS는 위상 보코더 알고리즘으로 음조와 속도를 독립적으로 제어합니다. 음조를 변경해도 길이가 변하지 않으며, 속도를 높여도 톤 왜곡이 발생하지 않습니다.
타임라인 영상 편집에는 음향 손실이 없는 16비트 48kHz 무압축 WAV 포맷을 적극 추천합니다.
캐시된 요청은 RAM LRU 메모리에서 1밀리초 미만으로 응답하여 대기 시간 없이 즉시 재생됩니다.