オープンソースTTSモデル徹底解説 · 2026
01

IndexTTS 1

bilibili · 産業等級の制御可能なゼロショット TTS · 初公開2月 2025

IndexTTS 第一世代のシステムです。 bilibili'インデックススピーチチーム。 ビルド XTTS そして、 トーチ ゼロから始めるのではなく、その見出しの貢献は、 中国発音制御可能 — 英語中心の問題 TTS 研究はほとんど無視されていました。 国際的な聴衆のために、重要な細部は解放のタイムラインです: v1.0 3月 2025) 続いて v1.5 5月5日 2025)、特に改善された英語の性能および全面的な安定性。 あなたが評価した場合 IndexTTS 1v1 の評価5, v1ではない。0.

デベロッパー
bilibili インデックススピーチチーム
初期リリース
1月2日 2025 (重量 Mar 2025)
建築設計
オートレグレッシブ(GPT-style)
語学学校
中国語、英語(+ダイヤル)
VRAM
~11 GB
スループット
~1 オーディオを最小限に ~10 s

社会貢献 1 — ハイブリッドキャラクター+ピンインモデリング

コアの考え方です。 中国語のpolyphones (コンテキストに応じて複数の読書が付いているcharacters)は持続的な失敗モードです TTS. IndexTTS ユーザーは、直接入力テキストにピニインを注入し、そのモデルをstochastic拡張を介してそれをに対処するように訓練しました。

  • トレーニング中、大体 20% 非ポリフォニック文字の Bernoulli マスク (α =) を使用して、ピンインフォームに置き換えられます。 0.20). これにより、モデルを強制して、グラメとカルメンの間に堅牢なマッピングを学ぶことができます。
  • アドバーサリアルトレーニングは、からの同音の誤発率を低下させました 8.7% お問い合わせ 0.9%.
  • 推論では書くことができます zhong4 zhong4 不審にインライン — 同じメカニズムは、まれで、単語外的な文字でも役立ちます。

なぜ中国を超えてこの問題: 同じアーキテクチャのトリックは、不規則な発音で任意の言語のために直接再使用可能です。 CMUphonemeのオーバーライドが英語のために何をするかに機能的に似ています。

社会貢献 2 — 精密な一時停止/prosody制御

句読点は、明示的な一時停止期間を経由してマップされます タイムスタンプ埋め込み (徹底的に) 0.3 s コンマのため, 0.8 s 完全停止のため)。 古典的で中国の長字のテキストでは、文脈の正確さは達しました 98.6%.

社会貢献 3 — Encoder と vocoder のアップグレード

  • A コンフォーマーベースのスピーチ条件付きエンコーダ ベースラインコンディショニングスタックを交換し、ゼロショットクローニング安定性とスピーカーの類似性を改善します。
  • スピーチコードデコーダーが交換されました ビッグVGAN2、出力の天性で意味のあるジャンプ。
  • チームの比較を公開 ベクトル量子化(VQ)とFinite Scalar量子化(FSQ) コードブック利用のため: 6,000-hourデータスケール、FSQは近いです 100% コードブック活用 versus ほぼ大 55% VQについて — 後から受け継がれた発見 IndexTTS リネン。

報告結果(自己評価)

メトリックバリューインフォメーション
単語の間違い率(WER)1.3%中国シナリオ
スピーカーの類似性(SS)0.776ゼロショットクローニング
MOS4.01主観的な質

これらの図は、CosyVoice2、Fish-Speech、FireRedを含む一時的オープンソースシステムとして報告されましたTTS と F5-TTS、より簡単な訓練のパイプラインを使用して、より速いinference。

使用例: 選ぶべき時 1

スケナリオ実行方法詳しくはこちら
中国語のみのバッチナレーション(コスト感度)スクリプトをチャンクし、1つのパスで実行し、参照オーディオの数秒でtimbreをロック~11 GB VRAM; 時間制御無し、従ってフレーム ロックされた dubbing は出ます
名前、ジャーゴン、または古典的な中国とコンテンツ高密度混合された「ハンツィ+ピニイン」の入力はpolyphonesを修理します — 同線の誤読はから低下します 8.7% お問い合わせ 0.9%ピニインアノテーションは人間のパスを必要とします。スクリプトの長さのコストスケール
リズムを一時停止する場所を読むプンチュエーションは、期間を一時停止するために直接マップします。 ~98.6% 古典テキストの文脈の正確さ連続的な速度制御無し — プンチュエーションを編集することでリズムをチューニング
バージョン比較のためのベースライン実際に必要なかどうかわからないとき 2/2.5, ログイン 1 はじめて英語はv1が必要です。5 またはそれ以降; v1.0 英語は有効なベンチマークではありません
適していません: ライブ会話(ストリーミングなし、vLLMのレシピなし)、感情的なパフォーマンス、フレームロックされた重なり、中国語と英語を超えた言語、または正確な持続時間制御を必要とするもの — そのすべてが到着します IndexTTS2 そして、 2.5.

留学生のVerdict

使用すると あなたは光、安定した中国中心のクローニングモデルを必要とし、あなたは持っている〜11 GB インフォメーション VRAM 予備に。 それは固体、よくテストされたベースラインのままです。

お問い合わせ 感情的な制御、正確な持続時間制御、または2つの言語以上を必要とする — 到着者のみ IndexTTS2 そして、 2.5. v1間の英語の質のギャップに注意して下さい。0 と v1.5 かなりだった。

バイリンガル 不正ショットクローニング ピニインphonemeオーバーライド 98.6% 文境界精度

ヘッド・ツー・ヘッドのデータに座るところ

IndexTTS 1 CV3-Eval ヘッド・トゥ・ヘッド・トゥ・ヘッド・トゥ・ヘッド・ツー・ヘッド・ツー・ヘッド・ヘッド・ツー・ヘッド・ツー・ヘッド・ツー・ヘッド・ヘッド・ツー・ヘッド・ツー・ヘッド・ヘッド・ツー・ヘッド・ヘッド・ツー・ヘッド・ヘッド・ツー・ヘッド・ヘッド・ヘッド・ツー・ヘッド・ヘッド・ヘッド・ツー・ヘッド・ヘッド・ツー・ヘッド・ヘッド・ヘッド・ツー・ヘッド・ヘッド・ツー・ヘッド・ヘッド・ツー・ヘッド・ヘッド・ヘッド・ツー・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ツー・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ヘッド・ — その評価は、新世代をカバー ()IndexTTS2.5, VoxCPM2, OmniVoice, コージーボイス 3, Qwen3-TTS, MOSS-TTS その他。 この報告書のその役割は、 世代別ベースライン競争相手ではない。 上記の「報告結果」ブロックには、独自の絶対数値が組み込まれています。

参照ポイントプロフィールバシス
IndexTTS 1 (このモデル)WER 1.3% / SS 0.776 / MOS 4.01著者登録
IndexTTS2 (直進者)WER 1.88% / 感情の類似性 0.887著者報告、強い感情状態
IndexTTS2.5-RL (2世代)ログイン→お問い合わせ 3.55 WER / 67.47 ステンレスCV3-Evalの特長 — 詳しくはこちら 06.2
あなたが理解しなければならないタイムラインの問題: IndexTTS 1's v1.0 英語が著しく弱い; のみ v1.5 本当の改善をもたらしました。 見てきたらIndexTTS 英語が悪くない 2024–2025 ブログ投稿やRedditスレッド、それはほとんど確かにv1だった。0. 実際にプルしたバージョンを英語のコンテンツの前にチェック — たくさんの人がこのうちに巻き込まれています。

自分で実行する費用

IndexTTS 1 決して比較可能な公開しません RTF 記載されたハードウェアでは、入力できません。 GPU-時間テーブル 06.4. これらは唯一の使用可能なアンカーです。

アイテムバリューお問い合わせ
VRAM~11 GBより高くより 2.5's ~6 GB; シングル RTX 4090 十分です
著名な速度~10 s オーディオの1分あたりハードウェアの未指定 — 他に類を見ない RTF 詳しくはこちら
保守的な見積もり(退屈) IndexTTS2's 0.3257)5.9 GPU-時間/百万文字~$4.34 オンデマンド 4090; ~$9.32 お問い合わせ A100
最下のライン: あなたの目標が「最も安い中国クローニング」であるならば、まっすぐに行きます IndexTTS2.5 ではなく 1 — ダウンロー VRAM (~6 GB)、より速く RTF (0.2065, ふりがな $2.75 1万文字)、より多くの言語、そして実際に書かれているライセンスのしきい値。 使用条件 1 古いバージョンをピン留めする特定の理由がある場合だけ。

ライセンスおよび開示ゲート

アイテムステータス
コードライセンスオープンソース
重量 免許証インデックスモデルライセンス — ライン・バイ・ラインのレビューが必要です。このレポートでは、明示的な商用助成金が見つかりませんでした。
商用利用条件を見直しなければなりません。 はいを仮定しない
デフォルトの透かしコメントはありません → 前提の計画はなしです。 開示義務がある場合は、自分で追加してください
データ残余完全にオフラインで実行
インデックスモデルのライセンスは、 Apache-2.0. 毛布の商用助成金は許認可のやり方を運ぶことはありません。 製品がお金を請求する場合、完全な条件または電子メールを読んで、 — お問い合わせ TTS「オープンソース」と「商用利用」は独立した質問です。 セクション 06.5 特定のものを歩く。

そうでない場合は、

  • 中国語クローニング、より新しいリリースに移行できます → IndexTTS2.5. より速く、5つの言語、より細かい発音制御(pinyin/CMU/kana)、より低い VRAM.
  • ライセンスはきれいでなければなりません → VoxCPM2 (Apache-2.0 コードおよび重量のため、 48 kHz).
  • 非常に低いフットプリント、CPUまたはエッジ → ココロ 82M (このセットの外側) Apache-2.0, ~2–3 GB, しかし、それは クローンすることはできません).
  • 具体的に必要 1 紙スタイルの比較のためのベースラインとして → 常に v1 を報告します。0 と v1.5 バージョン番号またはあなたの結論は人々を誤解します。
BiliVoiceで試す

IndexTTS 1で制作を始めますか?

このエンジンを選択した状態でテキスト読み上げを開き、自分の音声モデルで制作を始められます。