神经网络音频工作室
在下方输入或粘贴文本,即刻在线试听并下载高保真音频。
录音室制作架构与神经网络声学合成
具备零延迟流式播放与确定性缓存的高性能专业配音工作台。
OpenTTS录音室工作台直接在浏览器中提供专业级语音合成,无需注册账户、无需订阅付费,也无需API密钥。在两级内容寻址内存架构的支持下,重复合成请求在1毫秒内即可从Tier 1 RAM LRU缓存返回,全新文本则通过16 KB低延迟分块流式传输即时开播。
我们的神经网络声码器对高达24,000 Hz的完整谐波频段进行精确建模,保留自然的共振峰曲线、呼吸起伏与辅音爆破细节。无论是录制长篇有声书、短视频画外音还是角色对话,均可微调音调、语速及音量增益,绝无数字爆音失真。
自然停顿与呼吸语法指南
无需编写复杂的SSML标签,直接使用中括号语法在剧本中插入真人呼吸间隔。
| 语法标签 | 停顿毫秒数 | 呼吸节奏效果 | 推荐使用场景 |
|---|---|---|---|
[pause:short] | 约0.4秒 – 0.6秒 | 短逗号换气 | 句子分句、列举事项及发语词之间的短暂停顿。 |
[pause:medium] | 约0.8秒 – 1.1秒 | 分号思考留白 | 语义过渡、话题转折及沉思语感。 |
[pause:long] | 约1.4秒 – 1.8秒 | 完整段落停顿 | 场景切换、小标题播报及章节分段。 |
[pause:Xs] (如 [pause:2.5s]) | 自定义秒数 | 精准定时静音 | 冥想词留白、PPT幻灯片翻页同步及片头音乐间隙。 |
母带级音频转码与格式导出规格
严格校准的广播级转码,完美兼容主流剪辑软件、播客平台与流媒体服务。
| 音频格式 | 封装标准 | 默认码率 | 采样率 (Hz) | 最佳适用场景 |
|---|---|---|---|---|
MP3 | MPEG-1 Audio Layer III | 48 kbps / 128 kbps | 24,000 Hz | 网页试听、播客分发、移动App(流式加载最快)。 |
WAV | 16位线性PCM无损 | 768 kbps / 1536 kbps | 24,000 Hz / 48,000 Hz | Premiere Pro、剪映、DaVinci Resolve后期剪辑与母带处理。 |
OGG | Ogg Vorbis / Opus | 64 kbps | 24,000 Hz | 游戏引擎(Unity、Unreal Engine)、Discord机器人、HTML5音频。 |
AAC | Advanced Audio Coding (M4A) | 64 kbps | 24,000 Hz | 苹果生态系统、iOS应用、Safari浏览器流媒体。 |
FLAC | Free Lossless Audio Codec | 动态无损码率 | 24,000 Hz | 母带音频存档、发烧级无损播客发布。 |
开发者快速上手: REST API集成
无需任何鉴权请求头,直接调用我们公开的高性能REST API进行程序化合成。
curl -X POST "http://localhost:8000/api/v1/tts" \
-H "Content-Type: application/json" \
-d '{
"text": "欢迎使用OpenTTS。[pause:medium] 体验专业级语音合成技术。",
"voice": "voice-107",
"pitch": 0,
"speed": 0,
"volume": 100,
"format": "mp3"
}' --output output.mp3OpenTTS录音室常见问题解答
技术规范、商业授权政策与录音室高效剪辑技巧。
完全支持!在OpenTTS录音室合成的所有音频均为100%免版权费,且已获得全球商业授权,可自由在YouTube、B站、播客、商业广告和商业产品中变现。
单次请求最多支持2,000个字符。如需录制长篇小说或长视频文案,建议使用[pause:long]标签分段合成。
OpenTTS采用相位声码器算法独立调节音调和语速。音调调节基频(-50至+50)不影响时长;语速调节快慢(-50至+50)不产生声调畸变。
对于导入剪辑软件的工程文件,强烈推荐导出16位48kHz无损WAV音频,以获得最高的后期处理空间与原音保真度。
缓存命中的请求由内存LRU缓存直接响应,耗时小于1毫秒。即便全新合成,也会立即开启首包流式传输,无卡顿等待。