IndexTTS 1
bilibili · 産業等級の制御可能なゼロショット TTS · 初公開2月 2025
IndexTTS 第一世代のシステムです。 bilibili'インデックススピーチチーム。 ビルド XTTS そして、 トーチ ゼロから始めるのではなく、その見出しの貢献は、 中国発音制御可能 — 英語中心の問題 TTS 研究はほとんど無視されていました。 国際的な聴衆のために、重要な細部は解放のタイムラインです: v1.0 3月 2025) 続いて v1.5 5月5日 2025)、特に改善された英語の性能および全面的な安定性。 あなたが評価した場合 IndexTTS 1v1 の評価5, v1ではない。0.
- デベロッパー
- bilibili インデックススピーチチーム
- 初期リリース
- 1月2日 2025 (重量 Mar 2025)
- 建築設計
- オートレグレッシブ(GPT-style)
- 語学学校
- 中国語、英語(+ダイヤル)
- VRAM
- ~11 GB
- スループット
- ~1 オーディオを最小限に ~10 s
社会貢献 1 — ハイブリッドキャラクター+ピンインモデリング
コアの考え方です。 中国語のpolyphones (コンテキストに応じて複数の読書が付いているcharacters)は持続的な失敗モードです TTS. IndexTTS ユーザーは、直接入力テキストにピニインを注入し、そのモデルをstochastic拡張を介してそれをに対処するように訓練しました。
- トレーニング中、大体 20% 非ポリフォニック文字の Bernoulli マスク (α =) を使用して、ピンインフォームに置き換えられます。 0.20). これにより、モデルを強制して、グラメとカルメンの間に堅牢なマッピングを学ぶことができます。
- アドバーサリアルトレーニングは、からの同音の誤発率を低下させました 8.7% お問い合わせ 0.9%.
- 推論では書くことができます
zhong4 zhong4不審にインライン — 同じメカニズムは、まれで、単語外的な文字でも役立ちます。
なぜ中国を超えてこの問題: 同じアーキテクチャのトリックは、不規則な発音で任意の言語のために直接再使用可能です。 CMUphonemeのオーバーライドが英語のために何をするかに機能的に似ています。
社会貢献 2 — 精密な一時停止/prosody制御
句読点は、明示的な一時停止期間を経由してマップされます タイムスタンプ埋め込み (徹底的に) 0.3 s コンマのため, 0.8 s 完全停止のため)。 古典的で中国の長字のテキストでは、文脈の正確さは達しました 98.6%.
社会貢献 3 — Encoder と vocoder のアップグレード
- A コンフォーマーベースのスピーチ条件付きエンコーダ ベースラインコンディショニングスタックを交換し、ゼロショットクローニング安定性とスピーカーの類似性を改善します。
- スピーチコードデコーダーが交換されました ビッグVGAN2、出力の天性で意味のあるジャンプ。
- チームの比較を公開 ベクトル量子化(VQ)とFinite Scalar量子化(FSQ) コードブック利用のため: 6,000-hourデータスケール、FSQは近いです 100% コードブック活用 versus ほぼ大 55% VQについて — 後から受け継がれた発見 IndexTTS リネン。
報告結果(自己評価)
| メトリック | バリュー | インフォメーション |
|---|---|---|
| 単語の間違い率(WER) | 1.3% | 中国シナリオ |
| スピーカーの類似性(SS) | 0.776 | ゼロショットクローニング |
| MOS | 4.01 | 主観的な質 |
これらの図は、CosyVoice2、Fish-Speech、FireRedを含む一時的オープンソースシステムとして報告されましたTTS と F5-TTS、より簡単な訓練のパイプラインを使用して、より速いinference。
使用例: 選ぶべき時 1
| スケナリオ | 実行方法 | 詳しくはこちら |
|---|---|---|
| 中国語のみのバッチナレーション(コスト感度) | スクリプトをチャンクし、1つのパスで実行し、参照オーディオの数秒でtimbreをロック | ~11 GB VRAM; 時間制御無し、従ってフレーム ロックされた dubbing は出ます |
| 名前、ジャーゴン、または古典的な中国とコンテンツ高密度 | 混合された「ハンツィ+ピニイン」の入力はpolyphonesを修理します — 同線の誤読はから低下します 8.7% お問い合わせ 0.9% | ピニインアノテーションは人間のパスを必要とします。スクリプトの長さのコストスケール |
| リズムを一時停止する場所を読む | プンチュエーションは、期間を一時停止するために直接マップします。 ~98.6% 古典テキストの文脈の正確さ | 連続的な速度制御無し — プンチュエーションを編集することでリズムをチューニング |
| バージョン比較のためのベースライン | 実際に必要なかどうかわからないとき 2/2.5, ログイン 1 はじめて | 英語はv1が必要です。5 またはそれ以降; v1.0 英語は有効なベンチマークではありません |
留学生のVerdict
使用すると あなたは光、安定した中国中心のクローニングモデルを必要とし、あなたは持っている〜11 GB インフォメーション VRAM 予備に。 それは固体、よくテストされたベースラインのままです。
お問い合わせ 感情的な制御、正確な持続時間制御、または2つの言語以上を必要とする — 到着者のみ IndexTTS2 そして、 2.5. v1間の英語の質のギャップに注意して下さい。0 と v1.5 かなりだった。
ヘッド・ツー・ヘッドのデータに座るところ
IndexTTS 1 CV3-Eval ヘッド・トゥ・ヘッド・トゥ・ヘッド・トゥ・ヘッド・ツー・ヘッド・ツー・ヘッド・ヘッド・ツー・ヘッド・ツー・ヘッド・ツー・ヘッド・ヘッド・ツー・ヘッド・ツー・ヘッド・ヘッド・ツー・ヘッド・ヘッド・ツー・ヘッド・ヘッド・ツー・ヘッド・ヘッド・ヘッド・ツー・ヘッド・ヘッド・ヘッド・ツー・ヘッド・ヘッド・ツー・ヘッド・ヘッド・ヘッド・ツー・ヘッド・ヘッド・ツー・ヘッド・ヘッド・ツー・ヘッド・ヘッド・ヘッド・ツー・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ツー・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ — その評価は、新世代をカバー ()IndexTTS2.5, VoxCPM2, OmniVoice, コージーボイス 3, Qwen3-TTS, MOSS-TTS その他。 この報告書のその役割は、 世代別ベースライン競争相手ではない。 上記の「報告結果」ブロックには、独自の絶対数値が組み込まれています。
| 参照ポイント | プロフィール | バシス |
|---|---|---|
| IndexTTS 1 (このモデル) | WER 1.3% / SS 0.776 / MOS 4.01 | 著者登録 |
| IndexTTS2 (直進者) | WER 1.88% / 感情の類似性 0.887 | 著者報告、強い感情状態 |
| IndexTTS2.5-RL (2世代) | ログイン→お問い合わせ 3.55 WER / 67.47 ステンレス | CV3-Evalの特長 — 詳しくはこちら 06.2 |
自分で実行する費用
IndexTTS 1 決して比較可能な公開しません RTF 記載されたハードウェアでは、入力できません。 GPU-時間テーブル 06.4. これらは唯一の使用可能なアンカーです。
| アイテム | バリュー | お問い合わせ |
|---|---|---|
| VRAM | ~11 GB | より高くより 2.5's ~6 GB; シングル RTX 4090 十分です |
| 著名な速度 | ~10 s オーディオの1分あたり | ハードウェアの未指定 — 他に類を見ない RTF 詳しくはこちら |
| 保守的な見積もり(退屈) IndexTTS2's 0.3257) | 5.9 GPU-時間/百万文字 | ~$4.34 オンデマンド 4090; ~$9.32 お問い合わせ A100 |
ライセンスおよび開示ゲート
| アイテム | ステータス |
|---|---|
| コードライセンス | オープンソース |
| 重量 免許証 | インデックスモデルライセンス — ライン・バイ・ラインのレビューが必要です。このレポートでは、明示的な商用助成金が見つかりませんでした。 |
| 商用利用 | 条件を見直しなければなりません。 はいを仮定しない |
| デフォルトの透かし | コメントはありません → 前提の計画はなしです。 開示義務がある場合は、自分で追加してください |
| データ残余 | 完全にオフラインで実行 |
そうでない場合は、
- 中国語クローニング、より新しいリリースに移行できます → IndexTTS2.5. より速く、5つの言語、より細かい発音制御(pinyin/CMU/kana)、より低い VRAM.
- ライセンスはきれいでなければなりません → VoxCPM2 (Apache-2.0 コードおよび重量のため、 48 kHz).
- 非常に低いフットプリント、CPUまたはエッジ → ココロ 82M (このセットの外側) Apache-2.0, ~2–3 GB, しかし、それは クローンすることはできません).
- 具体的に必要 1 紙スタイルの比較のためのベースラインとして → 常に v1 を報告します。0 と v1.5 バージョン番号またはあなたの結論は人々を誤解します。
IndexTTS 1で制作を始めますか?
このエンジンを選択した状態でテキスト読み上げを開き、自分の音声モデルで制作を始められます。