オープンソースTTSモデル徹底解説 · 2026
02

IndexTTS2

bilibili · 感情的な表現+持続時間制御 · 9月発売 8, 2025

IndexTTS2 この家族が国際的にバイラルに行くモデルを作る — 「中国時代のドラマのAI英語の夕暮れ」の動画は、西洋の社会的なプラットフォームで後半に循環 2025 それを生成しました。 お問い合わせ 最初の自動回帰ゼロショット TTS ナチュラルでフリーランスな世代と正確な持続時間制御を組み合わせたモデル、そしてそれはスピーカーのアイデンティティからの感情を独りで指定できるように装飾します。 ふりがな GitHub repo は渡しました 10k 星と重みのプラス推論コードがリリースされます。

ペーパー
arXiv:2506.21619
建築設計
T2S + S2M + BigVGANv2
感情データ
55K サンプル/ 135 h 感情的なスピーチ
クローニング入力
~5 s オーディオ, >85% 類似性
VRAM
~15 GB
RTF (RTX 4090)
0.3257 fp16 全体
コミュニティ
Discord + OpenAI対応 API フォーク
商業用コンタクト
ログインbilibiliお問い合わせ

建築設計 — 3段カスケード

  • テキスト・ツー・セマンティック (T2S) — ソーステキスト、スタイルプロンプト、timbreプロンプト、オプションのターゲットトークンカウントをとるLMスタイルのオートレグレッシブトランスは、セマンティックトークンを生成します。
  • セマンティック・ツー・メル(S2M) — a フローマッチング 分離トークンと木材の調節からメルの分光器を予測するモジュール。 流れの一致の分離された音響トークンを取り替えることは強い感情の下で微粉砕された細部を維持することです。
  • BigVGANv2 ウォコーダ — メルの分光器を波形に変換します。

イノベーション 1 — オートレグレッシブモデル内の時間制御

オートレグレッシブ TTS トークン・バイ・トークンは、ターゲットの持続期間を打つのは困難です。 — オーディオが画像に一致しなければならない、ダビングのための実際の問題。 IndexTTS2 これを解決する トークンカウント制約:

  • 専用の 期間の埋め込むこと 要求されたトークン数を T2S に注入し、その予算に位置情報を調整するモデル。
  • タイムスケーリングタスクのランダムなサンプルのトレーニング(例:) 0.75×, 1.25×)従ってモデルはあらゆる要求された長さで流暢で、感情的に凝らしますとどまります。
  • 測定されたトークンカウントのエラー率: お問い合わせ 0.03%, 以下 0.02%.
  • 2つの動作モード:制約(トークン数を指定する) → 正確な持続期間)とフリーランニング(トークンカウントなし) → プロンプトのプロッディを忠実に再現します。

イノベーション 2 — Emotion/timbreのdisentanglement、4つの制御modalities

モーダリティを制御する作品紹介
シングルオーディオ参照1つのクリップは、木材と感情の両方を供給します(古典的なゼロショットクローニング)
別の感情の参照スタイルプロンプトは、 timbre プロンプトよりも異なるスピーカー — 異なる言語でも
感情ベクトル8 サイズ: — 幸せ, 怒っている, 悲しい, 恐れ, 嫌がらせ, 憂鬱な, 驚き, 静か — 調節可能な重量および任意サンプリングを使って
テキスト説明(「ソフト命令」)微調整された キューン3 自然言語の記述をマップします(「悲しみの先端でそれを確認」, 「あなたは死に私を怖がった!」) 感情ガイダンスに

密閉は建築的に強制され、 勾配反転層(GRL) スピーカー/感情のパーシーバを分離するので、モデルは感情のパスウェイにアイデンティティを漏らすことによってチートできません。

イノベーション 3 — 極端な感情の下での明快さ

叫びと爽快な場所 TTS 通常は離れて落ちます — 不安定な低下。 IndexTTS2 採用情報 GPTの潜在表現 新たな3段階のトレーニングパラダイムを加えて、世代を安定させます。 測定される WER 叫んでいる間: 1.883%, i.e. 感性を犠牲にすることなく表現力。

レポート結果

メトリックバリューコンテンツ
感情の類似性(ES)0.887他のSOTAゼロショットモデルをビート
エモーション MOS (EMOS)4.22自然で、十分に調整された配達
WER 強い感情の下1.883%叫び/泣くシナリオ
期間制御エラー<0.03%0.75×–1.25× 速度テスト

リアル・ワールド・インフェレンス速度()RTX 4090, kv cache=True , kv cache=True ,

入力長さv2.0 fp16の特長v2.0 フィードバック
7 キャラクター0.40040.3748
16 キャラクター0.33220.3389
28 キャラクター0.32570.3480
80 キャラクター0.32290.3754
200 キャラクター0.32440.3990
ソリューション0.32570.3748

独立した Docker ベースのテスト NVIDIA L40S (80 試験事例 4 バージョン × 4 sセナリオス × 5 実行, 100% 成功率)は、エンドツーエンドのレイテンシーを報告しました〜6.4 s (中国語ショート)28 s (中国語)7.6 s (英語ショート)35.4 s 生産イメージのための(英語の長い)。 ふりがな v2.1-cuda ビルドは中国で最速でした。 v2.0-production 英語が最も安定しています。

導入ノート: PyTorchのCUDAビルドが必要です — CPUだけ推論はあります コメントはありません。 参照実装でサポート。 コミュニティフォークは、 OpenAI対応 API (/v1/audio/speech スタイル)とVoxtaとの統合により、既存のパイプラインに簡単にドロップできます。

使用例: 選ぶべき時 2

スケナリオ実行方法詳しくはこちら
アニメ, モーションコミック と ショート フォーム 感情的な dubbing感情をコントロールする 8-dimension ベクトルまたは自然言語の指示; timbre および感情は飾られます、従って A の声は B の感情を運ぶことができます~15 GB VRAM — このグループで最高
オーディオブックの感情的な通路対話への感情の指示を添付し、ナレーションのための「カルム」に戻るロングフォームはまだ漂流します。 重複検証でチャンクする必要があります(参照) 06.3)
Podcastと2つのホストショーホストごとの1つの参照クリップと1つの感情の指示を締めて下さい従ってエピソードは一貫した滞在します広告およびスポンサーセグメントにおけるAI開示業務を締める(参照) 06.5)
既存のパフォーマンスを再検証するtimbreを保ち、感情ベクトルだけを交換 — リコードよりもはるかに安い極端な感情の下での動脈硬化をテスト (除去, 叫び); WER 上昇する
ビデオの重なり(第一世代のアプローチ)期間制御は、トークンカウントエラーを下に保持する 0.03%、映像に並ぶ可聴周波を維持して下さい連続的な速度の調節のために、 2.5's 0.5×–2.0× より良いツールです
実用的なノート: 2 このシリーズの最強のパフォーマーです — 最高のコストで VRAM そして推論の時間。 あなたのコンテンツが感情的な層を持っていない場合, まっすぐに行きます 2.5 より良い取引です:より速く、リーダー、より多くの言語。

留学生のVerdict

使用すると AI の重なり、オーディオブック、キャラクターボイスワーク、またはオーディオが固定タイムラインに一致しなければならないパイプライン、または別の感情にパフォーマンスを返す必要があります。

詳しくはこちら お問い合わせ15 GB VRAM 要件と英語がこのモデル家族のための第二言語のターゲットであるという事実 — 常に A/B をウェスタン・モデル (チャットボックス、X) に対してTTS-v2, F5-TTS) コミットする前に、独自の英語スクリプトで。

感情制御 感情/木材装飾 正確な持続時間制御 テキストプロンプト感情 OpenAI対応フォーク

ヘッド・ツー・ヘッドのデータに座るところ

IndexTTS2 その他にも CV3-Eval に参加しなかった — そのテーブルはカバーします 2.5 ジェネレーション ヘッド・ツー・ヘッドの証拠は測定から主に来ます RTF お問い合わせ RTX 4090 (上記「リアルワールド推論速度」参照)

バージョン精密加工ソリューション RTFヴェルサス 2.5
IndexTTS2fp16の特長0.3257~1.58× 遅い
IndexTTS2フィードバック0.3748~1.82× 遅い
IndexTTS2.5bf16の特長0.2065ベースライン

ログイン RTF インフォメーション 0.3257 大体の意味 3.1× リアルタイム: 1億文字(~)18 hオーディオの私達の部分は、 5.9 GPU-時間.

ワンライン位置決め: IndexTTS2 モデルは、 発明された 制御可能な感情+制御可能な持続期間、しかし 2.5 スピード、言語、 VRAM そして発音制御。 ピックアップする唯一の理由 2 今日は「既に生産中ですし、触れたくない」です。

自分で実行する費用

セットアップRTFGPU-時間/Mの木オンデマンド RTX 4090 ($0.74/h)オンデマンド A100 ($1.59/h)
IndexTTS2 (fp16)0.32575.9 h~$4.34~$9.32
参考: IndexTTS2.5 (bf16)0.20653.7 h~$2.75~$5.91

コマーシャルに次ぐ API 価格表:

オプションコスト/ M 文字ヴェルサス IndexTTS2
ElevenLabs v3$60–180~14–41×
カルテシア ソニック 3$20–39~4.6–9×
オープンAI tts-1$15~3.5×
Google/Polly標準$4~0.9× — セルフホスティングよりも安い
最後の行に誤ってはいけません。 標準クラウド TTS 自分で走るよりも、本当に安いですが、それらの声 クローン、感情制御なし、時間制御なし — 同じ製品ではありません。 IndexTTS2'実費の競争相手はあります ElevenLabsギャップがある 14–41×.

このテーブルも エンジニアリングコストを除外: 展開、監視、リトリーロジック、チャンクステッチ、失敗した再実行。 つまり、エンジニアの時間であり、それは通常以上の倍率の順序を要します GPU 請求。 フルモデル 06.4.

ライセンスおよび開示ゲート

アイテムステータス
コードライセンスオープンソース
重量 免許証インデックスモデルライセンス
商用利用規約は、著者が公表する商業連絡先が審査されなければならない。 [email protected]
デフォルトの透かしコメントはありません → 想定上の計画はなし
データ残余完全にオフラインで実行
重要な違いは、 2.5: 2.5's Bilibili モデルライセンスは、そのしきい値が公然と述べています(100M メニュー1B 収益)。 2 svaguer "Index Model License" を使用するまでは、 商用製品を選択している場合は、 ライセンスの確実性は、選択する理由です 2.5 オーバーオーバー 2.

そうでない場合は、

  • ダビングのための連続的に調整可能なスピーキング率 → IndexTTS2.5 (0.5×–2.0× 連続; 2's の長さ制御は固定ステップです。
  • 感情制御を必要としません → IndexTTS 1 英語バージョンの問題を念頭に置いています。
  • ライセンスはきれいでなければなりません → VoxCPM2.
  • あなただけ「より良い音を」したい → ブラインドリストのEloテーブルで開始 06.1; ステップ可聴周波EditX ()Apache-2.0)は、実際に出荷できる最高のオープンモデルです。
BiliVoiceで試す

IndexTTS2で制作を始めますか?

このエンジンを選択した状態でテキスト読み上げを開き、自分の音声モデルで制作を始められます。