Skip to main content
100% 無料・登録不要のニューラル音声スタジオ

ニューラル音声スタジオ

テキストを入力または貼り付けて、最高品質の音声を瞬時に生成・再生できます。

テンプレート:
111 / 2,000
ピッチ(音の高さ) • 速度・テンポ • 音量ゲイン
出力フォーマット:
サンプルレート:
アーキテクチャとボコーダー構造

スタジオ制作アーキテクチャとニューラル音声合成

ゼロ遅延ストリーミングと確定型キャッシュを備えた高性能オーディオ制作ワークベンチ。

OpenTTSスタジオは、ユーザー登録、有料サブスクリプション、APIキーを一切必要とせず、ブラウザ上で直接プロ品質の音声合成を提供します。2層構造のメモリ構成により、同一テキストのクエリはTier 1 RAM LRUキャッシュから1ミリ秒未満で返され、新規テキストも16KBチャンクバッファで即座にストリーミング再生されます。

当社の音響ボコーダーパイプラインは、最大24,000Hzまでの全可聴周波数帯域をモデル化し、フォルマントの自然な曲線、呼吸の推移、子音の立ち上がりを忠実に再現します。長編オーディオブック、ハイテンポなYouTube動画、会話型ダイアログなど、ピッチ・速度・音量を歪みなく自在にコントロールできます。

自然なポーズ構文ガイド

自然なポーズ・呼吸構文ガイド

複雑なSSMLタグを使わず、角括弧タグで原稿にリアルな呼吸間隔と語りの間を挿入できます。

構文タグ停止時間呼吸・間隔効果推奨使用場面
[pause:short]約0.4秒〜0.6秒読点(、)程度の短い呼吸文節の区切り、箇条書きの列挙、導入部の合間。
[pause:medium]約0.8秒〜1.1秒句点(。)の思考の間文と文のつなぎ、話題の転換、考察の余白。
[pause:long]約1.4秒〜1.8秒段落の大きな区切り劇的な場面転換、見出しの前後、章の終わり。
[pause:Xs] (例: [pause:2.5s])指定した秒数明示的なタイマー無音瞑想ガイドの沈黙、スライド動画との同期、ジングル前後。
トランスコードとマスタリング仕様

オーディオマスタリング・コーデック仕様

デジタルストリーミング、ポッドキャスト、映像編集(DAW)向けに校正された出力仕様。

音声フォーマットコンテナ規格標準ビットレートサンプリングレート (Hz)最適な用途
MP3
MPEG-1 Audio Layer III48 kbps / 128 kbps24,000 HzWeb配信、ポッドキャスト、モバイルアプリ(最高速の再生レスポンス)。
WAV
16-bit リニアPCM 非圧縮768 kbps / 1536 kbps24,000 Hz / 48,000 HzPremiere Pro、DaVinci Resolve、Final Cut Proでの動画編集・マスタリング。
OGG
Ogg Vorbis / Opus64 kbps24,000 Hzゲームエンジン(Unity、Unreal Engine)、Discord Bot、HTML5オーディオ。
AAC
Advanced Audio Coding (M4A)64 kbps24,000 HzAppleエコシステム、iOSアプリ、Safari向けストリーミング。
FLAC
Free Lossless Audio Codec可変ロスレス24,000 Hzアーカイブ保存、可逆圧縮でのポッドキャスト配信。
開発者向けREST API連携

開発者向けクイックスタート: REST API連携

認証ヘッダー不要のパブリックREST APIを使用して、プログラムから直接音声を生成できます。

cURLコマンド (直接REST API呼び出し)200 OK チャンクストリーミング
curl -X POST "http://localhost:8000/api/v1/tts" \
  -H "Content-Type: application/json" \
  -d '{
    "text": "OpenTTSへようこそ。[pause:medium] プロ品質の音声を瞬時に生成できます。",
    "voice": "voice-179",
    "pitch": 0,
    "speed": 0,
    "volume": 100,
    "format": "mp3"
  }' --output output.mp3

OpenTTSスタジオに関するよくある質問

技術仕様、商用ライセンス、効率的なスタジオ編集のヒント。

はい!OpenTTSスタジオで生成されたすべての音声は100%ロイヤリティフリーであり、YouTube、ポッドキャスト、商用アプリ、広告ナレーションで自由に収益化できます。

1回のリクエストにつき最大2,000文字まで入力できます。長編小説や長い原稿は、[pause:long]タグを用いて段落ごとに分割生成することをおすすめします。

OpenTTSはフェーズボコーダー技術によりピッチと速度を独立して変調します。音調を変えても再生時間は変わらず、速度を変えても声が甲高くなることはありません。

タイムラインでの高音質編集には非圧縮の16-bit 48kHz WAV形式が最適です。ファイルサイズを抑えたい場合は高音質MP3を選択してください。

キャッシュされたリクエストはTier 1 RAM LRUメモリから1ミリ秒未満で配信されます。新規テキストでも体感ゼロ遅延でストリーミングが開始されます。