IndexTTS2
bilibili · 感情的な表現+持続時間制御 · 9月発売 8, 2025
IndexTTS2 この家族が国際的にバイラルに行くモデルを作る — 「中国時代のドラマのAI英語の夕暮れ」の動画は、西洋の社会的なプラットフォームで後半に循環 2025 それを生成しました。 お問い合わせ 最初の自動回帰ゼロショット TTS ナチュラルでフリーランスな世代と正確な持続時間制御を組み合わせたモデル、そしてそれはスピーカーのアイデンティティからの感情を独りで指定できるように装飾します。 ふりがな GitHub repo は渡しました 10k 星と重みのプラス推論コードがリリースされます。
- ペーパー
- arXiv:2506.21619
- 建築設計
- T2S + S2M + BigVGANv2
- 感情データ
- 55K サンプル/ 135 h 感情的なスピーチ
- クローニング入力
- ~5 s オーディオ, >85% 類似性
- VRAM
- ~15 GB
- RTF (RTX 4090)
- 0.3257 fp16 全体
- コミュニティ
- Discord + OpenAI対応 API フォーク
- 商業用コンタクト
- ログインbilibiliお問い合わせ
建築設計 — 3段カスケード
- テキスト・ツー・セマンティック (T2S) — ソーステキスト、スタイルプロンプト、timbreプロンプト、オプションのターゲットトークンカウントをとるLMスタイルのオートレグレッシブトランスは、セマンティックトークンを生成します。
- セマンティック・ツー・メル(S2M) — a フローマッチング 分離トークンと木材の調節からメルの分光器を予測するモジュール。 流れの一致の分離された音響トークンを取り替えることは強い感情の下で微粉砕された細部を維持することです。
- BigVGANv2 ウォコーダ — メルの分光器を波形に変換します。
イノベーション 1 — オートレグレッシブモデル内の時間制御
オートレグレッシブ TTS トークン・バイ・トークンは、ターゲットの持続期間を打つのは困難です。 — オーディオが画像に一致しなければならない、ダビングのための実際の問題。 IndexTTS2 これを解決する トークンカウント制約:
- 専用の 期間の埋め込むこと 要求されたトークン数を T2S に注入し、その予算に位置情報を調整するモデル。
- タイムスケーリングタスクのランダムなサンプルのトレーニング(例:) 0.75×, 1.25×)従ってモデルはあらゆる要求された長さで流暢で、感情的に凝らしますとどまります。
- 測定されたトークンカウントのエラー率: お問い合わせ 0.03%, 以下 0.02%.
- 2つの動作モード:制約(トークン数を指定する) → 正確な持続期間)とフリーランニング(トークンカウントなし) → プロンプトのプロッディを忠実に再現します。
イノベーション 2 — Emotion/timbreのdisentanglement、4つの制御modalities
| モーダリティを制御する | 作品紹介 |
|---|---|
| シングルオーディオ参照 | 1つのクリップは、木材と感情の両方を供給します(古典的なゼロショットクローニング) |
| 別の感情の参照 | スタイルプロンプトは、 timbre プロンプトよりも異なるスピーカー — 異なる言語でも |
| 感情ベクトル | 8 サイズ: — 幸せ, 怒っている, 悲しい, 恐れ, 嫌がらせ, 憂鬱な, 驚き, 静か — 調節可能な重量および任意サンプリングを使って |
| テキスト説明(「ソフト命令」) | 微調整された キューン3 自然言語の記述をマップします(「悲しみの先端でそれを確認」, 「あなたは死に私を怖がった!」) 感情ガイダンスに |
密閉は建築的に強制され、 勾配反転層(GRL) スピーカー/感情のパーシーバを分離するので、モデルは感情のパスウェイにアイデンティティを漏らすことによってチートできません。
イノベーション 3 — 極端な感情の下での明快さ
叫びと爽快な場所 TTS 通常は離れて落ちます — 不安定な低下。 IndexTTS2 採用情報 GPTの潜在表現 新たな3段階のトレーニングパラダイムを加えて、世代を安定させます。 測定される WER 叫んでいる間: 1.883%, i.e. 感性を犠牲にすることなく表現力。
レポート結果
| メトリック | バリュー | コンテンツ |
|---|---|---|
| 感情の類似性(ES) | 0.887 | 他のSOTAゼロショットモデルをビート |
| エモーション MOS (EMOS) | 4.22 | 自然で、十分に調整された配達 |
| WER 強い感情の下 | 1.883% | 叫び/泣くシナリオ |
| 期間制御エラー | <0.03% | 0.75×–1.25× 速度テスト |
リアル・ワールド・インフェレンス速度()RTX 4090, kv cache=True , kv cache=True ,
| 入力長さ | v2.0 fp16の特長 | v2.0 フィードバック |
|---|---|---|
| 7 キャラクター | 0.4004 | 0.3748 |
| 16 キャラクター | 0.3322 | 0.3389 |
| 28 キャラクター | 0.3257 | 0.3480 |
| 80 キャラクター | 0.3229 | 0.3754 |
| 200 キャラクター | 0.3244 | 0.3990 |
| ソリューション | 0.3257 | 0.3748 |
独立した Docker ベースのテスト NVIDIA L40S (80 試験事例 4 バージョン × 4 sセナリオス × 5 実行, 100% 成功率)は、エンドツーエンドのレイテンシーを報告しました〜6.4 s (中国語ショート)28 s (中国語)7.6 s (英語ショート)35.4 s 生産イメージのための(英語の長い)。 ふりがな v2.1-cuda ビルドは中国で最速でした。 v2.0-production 英語が最も安定しています。
/v1/audio/speech スタイル)とVoxtaとの統合により、既存のパイプラインに簡単にドロップできます。使用例: 選ぶべき時 2
| スケナリオ | 実行方法 | 詳しくはこちら |
|---|---|---|
| アニメ, モーションコミック と ショート フォーム 感情的な dubbing | 感情をコントロールする 8-dimension ベクトルまたは自然言語の指示; timbre および感情は飾られます、従って A の声は B の感情を運ぶことができます | ~15 GB VRAM — このグループで最高 |
| オーディオブックの感情的な通路 | 対話への感情の指示を添付し、ナレーションのための「カルム」に戻る | ロングフォームはまだ漂流します。 重複検証でチャンクする必要があります(参照) 06.3) |
| Podcastと2つのホストショー | ホストごとの1つの参照クリップと1つの感情の指示を締めて下さい従ってエピソードは一貫した滞在します | 広告およびスポンサーセグメントにおけるAI開示業務を締める(参照) 06.5) |
| 既存のパフォーマンスを再検証する | timbreを保ち、感情ベクトルだけを交換 — リコードよりもはるかに安い | 極端な感情の下での動脈硬化をテスト (除去, 叫び); WER 上昇する |
| ビデオの重なり(第一世代のアプローチ) | 期間制御は、トークンカウントエラーを下に保持する 0.03%、映像に並ぶ可聴周波を維持して下さい | 連続的な速度の調節のために、 2.5's 0.5×–2.0× より良いツールです |
留学生のVerdict
使用すると AI の重なり、オーディオブック、キャラクターボイスワーク、またはオーディオが固定タイムラインに一致しなければならないパイプライン、または別の感情にパフォーマンスを返す必要があります。
詳しくはこちら お問い合わせ15 GB VRAM 要件と英語がこのモデル家族のための第二言語のターゲットであるという事実 — 常に A/B をウェスタン・モデル (チャットボックス、X) に対してTTS-v2, F5-TTS) コミットする前に、独自の英語スクリプトで。
ヘッド・ツー・ヘッドのデータに座るところ
IndexTTS2 その他にも CV3-Eval に参加しなかった — そのテーブルはカバーします 2.5 ジェネレーション ヘッド・ツー・ヘッドの証拠は測定から主に来ます RTF お問い合わせ RTX 4090 (上記「リアルワールド推論速度」参照)
| バージョン | 精密加工 | ソリューション RTF | ヴェルサス 2.5 |
|---|---|---|---|
| IndexTTS2 | fp16の特長 | 0.3257 | ~1.58× 遅い |
| IndexTTS2 | フィードバック | 0.3748 | ~1.82× 遅い |
| IndexTTS2.5 | bf16の特長 | 0.2065 | ベースライン |
ログイン RTF インフォメーション 0.3257 大体の意味 3.1× リアルタイム: 1億文字(~)18 hオーディオの私達の部分は、 5.9 GPU-時間.
自分で実行する費用
| セットアップ | RTF | GPU-時間/Mの木 | オンデマンド RTX 4090 ($0.74/h) | オンデマンド A100 ($1.59/h) |
|---|---|---|---|---|
| IndexTTS2 (fp16) | 0.3257 | 5.9 h | ~$4.34 | ~$9.32 |
| 参考: IndexTTS2.5 (bf16) | 0.2065 | 3.7 h | ~$2.75 | ~$5.91 |
コマーシャルに次ぐ API 価格表:
| オプション | コスト/ M 文字 | ヴェルサス IndexTTS2 |
|---|---|---|
| ElevenLabs v3 | $60–180 | ~14–41× |
| カルテシア ソニック 3 | $20–39 | ~4.6–9× |
オープンAI tts-1 | $15 | ~3.5× |
| Google/Polly標準 | $4 | ~0.9× — セルフホスティングよりも安い |
このテーブルも エンジニアリングコストを除外: 展開、監視、リトリーロジック、チャンクステッチ、失敗した再実行。 つまり、エンジニアの時間であり、それは通常以上の倍率の順序を要します GPU 請求。 フルモデル 06.4.
ライセンスおよび開示ゲート
| アイテム | ステータス |
|---|---|
| コードライセンス | オープンソース |
| 重量 免許証 | インデックスモデルライセンス |
| 商用利用 | 規約は、著者が公表する商業連絡先が審査されなければならない。 [email protected] |
| デフォルトの透かし | コメントはありません → 想定上の計画はなし |
| データ残余 | 完全にオフラインで実行 |
そうでない場合は、
- ダビングのための連続的に調整可能なスピーキング率 → IndexTTS2.5 (0.5×–2.0× 連続; 2's の長さ制御は固定ステップです。
- 感情制御を必要としません → IndexTTS 1 英語バージョンの問題を念頭に置いています。
- ライセンスはきれいでなければなりません → VoxCPM2.
- あなただけ「より良い音を」したい → ブラインドリストのEloテーブルで開始 06.1; ステップ可聴周波EditX ()Apache-2.0)は、実際に出荷できる最高のオープンモデルです。
IndexTTS2で制作を始めますか?
このエンジンを選択した状態でテキスト読み上げを開き、自分の音声モデルで制作を始められます。