オープンソースTTSモデル徹底解説 · 2026
03

IndexTTS2.5

bilibili · 5- 言語アップグレード · 8月発売 10, 2026

IndexTTS2.5 パッチではなく、全世代のリフレッシュです。 言語のカバレッジは2つから 5月5日 (中国語、英語、日本語、スペイン語、アラビア語)、インフェレンスは速度のために再構築されます(2.28× より速く)、スピーキングレート制御と微粒発発音制御の両方が新登場。 確かに、それは非常に少ないオープンソースの1つです TTS モデル 完全なアラビア語 音声とクロスリンガルのサポート

技術報告
arXiv:2601.03888
パラメーター
~0.8 B (GPTバックボーン)
語学学校
zh, ja, es, ar
ソリューション
22.05 kHz ウェーブフォーム
VRAM
~6 GB (bf16) — このグループの中で最も低い
RTF
0.2065 bf16 全体的に()RTX 4090)
ライセンス
Bilibili モデルライセンス
ダウンロード
22.5k (モデルスコープ), 5.49 GB

アップグレード 1 — セマンティックコーデック圧縮(主速レバー)

セマンティックトークンフレームレートは、 50 Hz お問い合わせ 25 HzT2SとS2Mの両方で、シーケンス長さを半分にし、コンピュートとメモリを半減させます。 測定されたT2S RTF から落ちる 0.232 (v2.0) へ 0.119 (v2.5).

アップグレード 2 — S2Mバックボーン:U-DiT → ジップフォーマー

バックボーンコンテンツパラムMACs/フレームS2M RTF
U-DiT(v2)0)12 × 512110 M200 M0.078
ジプフォーマー(v2)5)8 × 512 + 4×FFN(フン)1024)68 M48 M0.017

ジプフォーマーは、軽量な注意を伴ったコンボリューションをグループ化しました()O(L·d·k) + O(L·d·ログL, k = 5)より低い費用でよりよく長距離の模倣のための。 純効果: ~4.6× より速いS2M、 38 M 少数の変数. ペア化された主観的な好みのテストでは、 56% リスナーはZipformerベースの出力を好む 小さいモデルであっても。

アップグレード 3 — クロスリンガル戦略

多言語のトレーニングは、トークナイザーを混乱させる言語間の文字の重複に苦しむ。 3つの補完戦略が評価されました:

  • バウンダリーアウェアアライメント — 明示的な言語IDマーカー(例:) <ZH>) 各セグメントの周りにインサートします。
  • トークンレベルの連結 — すべてのテキストトークンは、言語固有の埋め込みで使用されます。 これにより、 最高のスピーカーの類似性および最も低い WER すべての4つの評価された言語, そして、リリースされたモデルの使用方法である.
  • 指示ガイドされた生成 — 自然言語の接頭辞(以下「英語でお読みください」)は、外部の言語タグの侵入時間の必要性を削除します。

ゼロショットの感情転送は、ターゲット言語の感情ラベルなしでも動作します: 日本語のES = 0.846, スペイン語 ES = 0.924.

アップグレード 4 — GRPO強化学習後のトレーニング

T2Sのポストトレインステージでは、チームは適用します GRPO(グループ経営方針の最適化) 冷凍 ASR モデルの WER 報酬信号として。 ドリフトを防止するために、KL正規化で、入力ごとに4つの候補のセマンティックシーケンスをサンプリングし、より高い報酬が強化されます。

メトリックRLの前にRLの後
スタッフ WER1.889%1.732%
日本語 English WER9.949%9.770%
スピーカーの類似性安定したまたはわずかに改善される

新しい制御性の表面

機能特性API / 構文
スピーキングレート制御duration_factorから、連続的な 0.5× お問い合わせ 2.0×
中国語発音<行|XING2> — ピンイン+トーン
英語発音<minute|M IH1 . N AH0 T> — CMUの携帯電話
日本語発音<上手|じょうず> — カナ
感情の強度emo_alpha 感情的な強さをスケール; emo_vector お問い合わせ 8-float ベクトル
感情推論テキスト自体から感情的なトーンの自動推論

導入事例

  • フィードバック 3.10–3.11, NVIDIA GPU, ~6 GB VRAM で bf16 — 5つのモデルの最下。
  • インストール:公式リポジトリをクローンする → uv sync --all-extras → ダウンロード IndexTeam/IndexTTS-2.5 Hugging フェイスまたは ModelScope から。
  • ウェブUI: uv run webui.py → http://127.0.0.1:7860. フィードバック API また、ローカルの Gradio デモも提供しています。
  • vLLMの展開レシピは含まれています — これは、高スループットサービングのための5の最も生産準備です。
  • 補助モデル(w2v-bert-)2.0, MAskGCT のセマンティックコーデック、CAMPPlus、BigVGAN) は、最初の実行時に自動的にダウンロードします。
  • ComfyUIコミュニティノードが存在します。 BSAI_ComfyUI_IndexTTS-2.5 そして、 ComfyUI_JR_IndexTTS25.
知っておくべきコミュニティフィードバック: 複数のユーザーは、混在する中国語-英語のテキストが、時折英語を非安定にレンダリングし、認識できない改善を報告します。 IndexTTS2 英語ではドラマチックではありません。 他は速度および多言語範囲を賞賛します。 標準的な助言は1つの参照クリップ、1つの混合された言語スクリプトおよび1つの感情の指示を修理し、そして比較します 2 対比 2.5 誤解、感情の順守およびあなた自身の機械に RTF.

ユースケース:このグループで最も広い範囲

スケナリオ実行方法詳しくはこちら
マルチリンガルフィルムとショートフォームデュブ明示的な持続時間制御でここに唯一のモデル(0.5×–2.0× 連続的な速度)、従って翻訳は元のタイムラインに戻って圧縮することができます平均的な文の長さは異なります 20–40% 言語全体で、最初のパスフィットが期待できません。
オーディオブックとロングフォームナレーション段落でチャンク, 保ちます 10% オーバーラップ、全体で1つの参照クリップを再利用配達仕様は自動ゲートです — 以下のACXリストを参照してください。
ゲームNPCボイスアセットラインほぼゼロマージンコストで1つのバッチで数千のラインをオフラインで生成実際にブロックしているのは、モデルではなく、エンジンの形式です。 — 詳しくはこちら
コールセンターバルク通知/IVRRTF 0.20 プラスvLLMのレシピは、シングルを意味します 4090 生産の負荷を運ぶことができますピーク時間のキューイングは現実的です。キャッシュと通貨の天井が必要です
アラビア語、日本語、スペイン語5つの言語と相互言語転送。 zh→ジェイスピーカーの類似性 75.82 ここのベストです英語はまだ混合されたzh/enテキストでwobbles — それをテストして下さい
クロスリンガルポッドキャスト配布ホストの親友を維持しながら、複数の言語に全体のショーをクローンする広告セグメントにおけるAI開示業務のタイト化

オーディオブック:ACX配送仕様は自動ゲートです

アイテムACXの条件AIの生成が通常失敗する方法
コンテナMP3の 192 ログイン CBRの特長VBRとして輸出 — 即時拒絶
サンプルレート44.1 kHzモデルが出る 22.05 / 24 / 48 kHz; 必要性のresampling
チャンネルモノラルかステレオ、 書籍全体で一貫したチャプター間の設定ドリフト
平均ラウドネス(RMS)−23 dB から −18 dBの生のAI出力は、通常、-26 お問い合わせ24 dBの — あまりにも静かな
ログイン≤ −3 dBの堅いconsonantsクリップへの 0 正規化後のdB
騒音フロア< −60 dBのRMS合成呼吸/部屋の調子はそれの上に坐ります
ファイルの長さ≤ 120 所要時間1つのファイルの全本
ヘッド/尾調子0.5–1 s ヘッド, 1–5 s お問い合わせ攻撃的なトリミングは、サンプルゼロに最初のphonemeを置く
小売サンプル1–5 コンテンツのみ混合クレジット
AI開示投稿メタデータのAIナレーションを宣言提出時間を忘れた場合
これはAIが構造上の優位性を持っている場所です。 マイクのヒス、HVACのランブル無し、実際の呼吸からの害虫無し — ノイズフロアは、周囲に沈着します。 あなたの仕事はそうです ラウドネス正規化とピーク制御, 望ましくない. 逆に、悪意のある輸出を救うために消毒剤にカウントしないでください。

ゲーム:モデルではなく、エンジンブロック

フォーマット及びサンプル率

非現実的なエンジン 5 WAV を望んでいます (16-ビット, 44.1 kHz)またはOGG Vorbis。

直接コストでMP3をドロップ 200–300 ms デコードレイテンシと lip sync が消えます。

古典的な失敗:モデル出力 48 kHz、プロジェクト Audio Source は、 44.1 kHz、ラインは二重速度で再生します。

エンジン設定

UE5:サウンドクラス "Dialogue" に設定する必要があります。. デフォルト SFX クラスは 4:1 ウィスパーとフラットテンスを増幅する圧縮。

Unity: オーディオソースロードタイプ — ラインの下 10 s 記憶で圧縮された、長いライン スイッチを使用して流れます。

資産運用管理

新着情報 500 対話線, 何かを生成する前に、ネーミングスキーマを修正, e.g. CHARACTER_EMOTION_LINEID.wav.

それ以外の場合は、保存した生成よりもイベントをトリガーするためにファイルを再調整する時間を費やします。

パフォーマンス予算

以上 50–100 sシーンの不当なボイスラインは、メモリのスパイクを引き起こします。 オーディオプールとLOD(遠くのNPC上で無効なリップシンク)が必要です。

ターゲットを 50–70% キャッシュヒット率: プリレンダー予測可能なビート、緊急の対話のみをライブ生成します。

Dubbing:費用映像

アプローチ1分あたり · 中国語ターンアラウンドフィット
人間のスタジオのdubbing$100–5002–6 週刊演劇、放送、旗艦のブランドの仕事
完全自動化されたAI$2–20同じ日ショートフォームビデオ、コース、マーケティングボリューム
AI + ヒューマンレビュー$50–200デイリーブランドの感受性か調整された内容
このモデル、自撮り≈ $0.003 (GPU のみ)インフォメーションパイプラインを構築します。, 労働とオプスを除外します。
境界を忘れないでください。 2.5 ここで最速のモデルですが、 コンテンツ制作 エンジン、ない インタビュー 1 — サブサブ300 ms 最初のオーディオは、カルチェジアソニック、インワールド、 ElevenLabs フラッシュ。 ライブボイスエージェントで使用するには、VAD、セマンティックエンドポイント、バージインを自分でビルドし、(典型的にLiveKitまたはPipecat)すべてのステージをオーバーラップする必要があります。 ネクティブなシリアルパイプラインは、常に1秒を超えたり、人間の会話はそれを許容しない — 平均ターンテイクギャップの実行 200–300 ms, 過去 700 ms 一時停止は遅延として読みます。

留学生のVerdict

使用すると コンパクトなモデルからアラビア語、日本語、またはスペイン語のクローンを作成したり、vLLMのサービングをしたり、サブタイトルロックされたワークフローの継続的なスピーキングレート制御が必要です。

詳しくはこちら お問い合わせ Bilibili モデルライセンス上記の別の書面による商用契約が必要です。 100M MAU または ¥1B 年間売上高 — ほとんどのスタートアップがヒットしませんが、企業は慎重に検討する必要があります。

5 用語集 2.28× より速く 0.5×–2.0× スピード ピニイン/CMU/カナ vLLMのレシピ 制限ライセンス

ヘッド・ツー・ヘッドのデータに座るところ

ここが唯一 IndexTTS CV3-Eval のモデルで、2 回(ベースと RL) 表示されます。 以下は4つの最も近いライバルです。全9モデルテーブルは 06.2.

モデルパラム中国語(簡体) WER / SSスタッフ WER / SSスペイン語 WER / SS
IndexTTS2.50.8 B4.36 / 77.105.12 / 68.063.75 / 76.39
IndexTTS2.5-RL0.8 B3.93 / 77.923.89 / 67.793.33 / 76.68
コージーボイス3-0.5B0.5 B3.84 / 80.014.88 / 74.164.04 / 78.85
Qwen3-TTS1.7 B3.27 / 73.025.06 / 67.172.87 / 73.17
MOSS-TTS-v1.58 B4.02 / 72.684.45 / 67.463.83 / 71.75
モデルログイン→お問い合わせ WER / SSログイン→ツイート WER / SSログイン→ログイン WER / SS
IndexTTS2.53.62 / 63.835.17 / 65.486.57 / 74.16
IndexTTS2.5-RL3.55 / 67.474.86 / 64.476.38 / 75.82
コージーボイス3-0.5B3.23 / 62.794.58 / 64.04—
Qwen3-TTS5.74 / 63.045.15 / 68.0236.09 / 65.71
モデル精密加工ソリューション RTF利用規約
IndexTTS2.5bf16の特長0.2065RTX 4090, kv cache=True
IndexTTS2 (参考)fp16の特長0.3257RTX 4090
VoxCPM2 (参考)bf16の特長~0.30~0.13 ナノVLLM
OmniVoice (参考)—0.025H100 + カスタムカーネル; ~0.9–1.2× アップルシリコンでリアルタイム
3つのテイクアウト。 (1) デュビングスタイルのクロスリンガルワークのために、セットを獲得します — 最高のzh→お問い合わせ WER (3.55)および最もよいzh→ジェイスピーカーの類似性 (JA)75.82)、それは正確に時間制御があなたに買うアライメントです。 (2) 単元の中国類似性に勝らない — コージーボイス 3 リード 80.01 に対して 2.5-RL で 77.92, a 2.1-point ギャップ。 (3) パラメータカウントはここに保持しません — 0.8 B ビート MOSS-TTS-v1.5 お問い合わせ 8 B.

自分で実行する費用

セットアップRTFGPU-時間/Mの木オンデマンド RTX 4090オンデマンド A100
IndexTTS2.5 (bf16)0.20653.7 h~$2.75~$5.91
参考: VoxCPM2 (ナノVLLM)~0.132.3 h~$1.73~$3.72
比較比較コスト/ M 文字複数の
ElevenLabs v3$60–180~22–65×
ElevenLabs フラッシュ$50–55~18–20×
オープンAI tts-1$15~5.5×
Google/Polly標準$4~1.5×
品質表よりも重要であるこのテーブルの部分: IndexTTS2.5 です。 少ないオプションのみ VRAM (~6 GB)、低い RTF (0.2065) 一度に5つの言語がすべて保持 — つまりシングル RTX 4090 生産負荷を代わりに運ぶことができます A100. 2つの現実はまだ適用します: リアルワールド RTF 通常は 2–5× 紙図よりも遅い、および工学費用(deployment、監視、retries、チャンクのステッチ)は通常超過します GPU 大きさの注文による請求書。

ライセンスおよび開示ゲート

アイテムステータス
コードライセンスオープンソース
重量 免許証Bilibili モデルライセンス
商用利用許可されるが、 上記以外の書面による同意が必要です。 100M MAU または ¥1B 年間売上高
デフォルトの透かしコメントはありません → 想定上の計画はなし
あなたが追加しなければならないもの開示義務がある場合、AudioSeal / SynthID / C2PA; モデルはコンテンツフィルタを出荷しません
データ残余完全にオフラインで実行
そのしきい値の高さは? 100M MAU または ¥1B (~$140M) 収益は、ほぼすべてのスタートアップと中規模のチームのためのリーチです — しかし、 大規模なプラットフォームを除外. あなたがプラットフォームであるならば、これは本物のブロッカーであり、あなたは起動前に週ではなく、先にライセンス会話月を開始する必要があります。 お問い合わせ 06.5.

そうでない場合は、

  • 中国語のみ、最大のスピーカーの類似性を追いかける → コージーボイス3-0.5B 中国語SS 80.01). ライセンスを最初に確認 — きれいだと仮定しない。
  • ライセンスはきれいでなければなりません → VoxCPM2 (費用は著しく弱いzhである)→エス)。
  • 出荷できる最高ランクのオープンモデル → ステップオーディオ編集X (Apache-2.0、ブラインドのElo 1,102).
  • アラビア語、なし Bilibili 閾値 → このセットには何もありません。 それは正確に 2.5's moat's は、
BiliVoiceで試す

IndexTTS2.5で制作を始めますか?

このエンジンを選択した状態でテキスト読み上げを開き、自分の音声モデルで制作を始められます。