Skip to main content
Estúdio de Áudio Neural 100% Gratuito e Público

Estúdio de Voz Neural

Digite ou cole seu texto abaixo e ouça vozes de estúdio instantaneamente.

Modelos:
163 / 2,000
Modulação de Tom • Velocidade / Ritmo • Ganho de Volume
Formato de Saída:
Taxa de Amostragem:
Arquitetura e motor vocoder

Arquitetura de Produção e Síntese Neural de Estúdio

Bancada de áudio profissional com streaming de latência zero e cache determinístico.

O estúdio do OpenTTS oferece síntese de voz de nível profissional diretamente no navegador, sem necessidade de cadastro, planos pagos ou chaves de API. Com uma arquitetura de memória em dois níveis, textos repetidos são servidos em menos de 1 milissegundo a partir da memória RAM LRU, enquanto novas frases iniciam o streaming instantâneo em pacotes de 16 KB.

Nosso pipeline de vocoder neural modela todo o espectro harmônico até 24.000 Hz, preservando a curva natural de formantes, pausas respiratórias e ataques consonantais. Ajuste tom, velocidade e volume com máxima fidelidade e zero distorção digital.

Sintaxe de pausas naturais

Guia de Sintaxe de Pausas Naturais e Cadência

Insira respirações realistas e ritmo de fala diretamente no seu roteiro sem usar tags SSML complicadas.

Tag de sintaxeDuração da pausaEfeito de cadênciaCenário recomendado
[pause:short]~0,4s – 0,6sRespiração curta de vírgulaSeparação de orações, itens de lista e introduções.
[pause:medium]~0,8s – 1,1sPausa reflexiva de ponto e vírgulaTransições de raciocínio, mudanças de assunto e ênfase.
[pause:long]~1,4s – 1,8sPausa de parágrafoMudanças de cena, títulos de seções e finais de capítulo.
[pause:Xs] (ex: [pause:2.5s])Duração exata em segundosSilêncio cronometradoMeditação guiada, sincronização com slides e vinhetas.
Transcodificação e masterização

Especificações de Masterização e Exportação de Áudio

Transcodificação em padrões de estúdio calibrada para streaming digital, podcasts e edição de vídeo.

Formato de áudioEspecificação do contêinerTaxa de bits padrãoTaxa de amostragem (Hz)Uso ideal
MP3
MPEG-1 Audio Layer III48 kbps / 128 kbps24.000 HzStreaming web, podcasts e apps móveis (máxima agilidade).
WAV
PCM Linear 16 bits sem compressão768 kbps / 1536 kbps24.000 Hz / 48.000 HzEdição profissional no Premiere Pro, DaVinci Resolve e Final Cut.
OGG
Ogg Vorbis / Opus64 kbps24.000 HzJogos (Unity, Unreal Engine), bots de Discord e áudio web.
AAC
Advanced Audio Coding (M4A)64 kbps24.000 HzEcossistema Apple, aplicativos iOS e streaming no Safari.
FLAC
Free Lossless Audio CodecSem perdas variável24.000 HzArquivamento de áudio e distribuição de audiolivros sem perdas.
Integração via API REST

Início Rápido para Desenvolvedores: API REST

Sintetize voz programaticamente usando nossa API REST pública de alto desempenho sem necessidade de autenticação.

Comando cURL (API REST direta)200 OK Streaming em pacotes
curl -X POST "http://localhost:8000/api/v1/tts" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "Bem-vindo ao OpenTTS. [pause:medium] Voz profissional para seus projetos.",
    "voice": "voice-107",
    "pitch": 0,
    "speed": 0,
    "volume": 100,
    "format": "mp3"
  }' --output output.mp3

Perguntas Frequentes sobre o Estúdio OpenTTS

Padrões técnicos, direitos comerciais e dicas de fluxo de trabalho.

Sim! Todo o áudio gerado no estúdio do OpenTTS é 100% livre de royalties e autorizado para monetização comercial no YouTube, podcasts, aplicativos e propagandas.

Você pode enviar até 2.000 caracteres por solicitação. Para textos maiores, sintetize por capítulos usando tags [pause:long].

O OpenTTS modula tom e tempo separadamente via phase-vocoder. O tom altera a frequência sem mexer na duração; a velocidade altera o ritmo sem afinar a voz.

Recomendamos exportar em WAV PCM de 16 bits a 48kHz sem compressão para máxima fidelidade durante a edição.

Solicitações em cache são entregues pela memória RAM LRU em menos de 1 milissegundo, permitindo reprodução instantânea.