IndexTTS2.5
bilibili · 5- 言語アップグレード · 8月発売 10, 2026
IndexTTS2.5 パッチではなく、全世代のリフレッシュです。 言語のカバレッジは2つから 5月5日 (中国語、英語、日本語、スペイン語、アラビア語)、インフェレンスは速度のために再構築されます(2.28× より速く)、スピーキングレート制御と微粒発発音制御の両方が新登場。 確かに、それは非常に少ないオープンソースの1つです TTS モデル 完全なアラビア語 音声とクロスリンガルのサポート
- 技術報告
- arXiv:2601.03888
- パラメーター
- ~0.8 B (GPTバックボーン)
- 語学学校
- zh, ja, es, ar
- ソリューション
- 22.05 kHz ウェーブフォーム
- VRAM
- ~6 GB (bf16) — このグループの中で最も低い
- RTF
- 0.2065 bf16 全体的に()RTX 4090)
- ライセンス
- Bilibili モデルライセンス
- ダウンロード
- 22.5k (モデルスコープ), 5.49 GB
アップグレード 1 — セマンティックコーデック圧縮(主速レバー)
セマンティックトークンフレームレートは、 50 Hz お問い合わせ 25 HzT2SとS2Mの両方で、シーケンス長さを半分にし、コンピュートとメモリを半減させます。 測定されたT2S RTF から落ちる 0.232 (v2.0) へ 0.119 (v2.5).
アップグレード 2 — S2Mバックボーン:U-DiT → ジップフォーマー
| バックボーン | コンテンツ | パラム | MACs/フレーム | S2M RTF |
|---|---|---|---|---|
| U-DiT(v2)0) | 12 × 512 | 110 M | 200 M | 0.078 |
| ジプフォーマー(v2)5) | 8 × 512 + 4×FFN(フン)1024) | 68 M | 48 M | 0.017 |
ジプフォーマーは、軽量な注意を伴ったコンボリューションをグループ化しました()O(L·d·k) + O(L·d·ログL, k = 5)より低い費用でよりよく長距離の模倣のための。 純効果: ~4.6× より速いS2M、 38 M 少数の変数. ペア化された主観的な好みのテストでは、 56% リスナーはZipformerベースの出力を好む 小さいモデルであっても。
アップグレード 3 — クロスリンガル戦略
多言語のトレーニングは、トークナイザーを混乱させる言語間の文字の重複に苦しむ。 3つの補完戦略が評価されました:
- バウンダリーアウェアアライメント — 明示的な言語IDマーカー(例:)
<ZH>) 各セグメントの周りにインサートします。 - トークンレベルの連結 — すべてのテキストトークンは、言語固有の埋め込みで使用されます。 これにより、 最高のスピーカーの類似性および最も低い WER すべての4つの評価された言語, そして、リリースされたモデルの使用方法である.
- 指示ガイドされた生成 — 自然言語の接頭辞(以下「英語でお読みください」)は、外部の言語タグの侵入時間の必要性を削除します。
ゼロショットの感情転送は、ターゲット言語の感情ラベルなしでも動作します: 日本語のES = 0.846, スペイン語 ES = 0.924.
アップグレード 4 — GRPO強化学習後のトレーニング
T2Sのポストトレインステージでは、チームは適用します GRPO(グループ経営方針の最適化) 冷凍 ASR モデルの WER 報酬信号として。 ドリフトを防止するために、KL正規化で、入力ごとに4つの候補のセマンティックシーケンスをサンプリングし、より高い報酬が強化されます。
| メトリック | RLの前に | RLの後 |
|---|---|---|
| スタッフ WER | 1.889% | 1.732% |
| 日本語 English WER | 9.949% | 9.770% |
| スピーカーの類似性 | 安定したまたはわずかに改善される | |
新しい制御性の表面
| 機能特性 | API / 構文 |
|---|---|
| スピーキングレート制御 | duration_factorから、連続的な 0.5× お問い合わせ 2.0× |
| 中国語発音 | <行|XING2> — ピンイン+トーン |
| 英語発音 | <minute|M IH1 . N AH0 T> — CMUの携帯電話 |
| 日本語発音 | <上手|じょうず> — カナ |
| 感情の強度 | emo_alpha 感情的な強さをスケール; emo_vector お問い合わせ 8-float ベクトル |
| 感情推論 | テキスト自体から感情的なトーンの自動推論 |
導入事例
- フィードバック 3.10–3.11, NVIDIA GPU, ~6 GB VRAM で bf16 — 5つのモデルの最下。
- インストール:公式リポジトリをクローンする →
uv sync --all-extras→ ダウンロードIndexTeam/IndexTTS-2.5Hugging フェイスまたは ModelScope から。 - ウェブUI:
uv run webui.py→http://127.0.0.1:7860. フィードバック API また、ローカルの Gradio デモも提供しています。 - vLLMの展開レシピは含まれています — これは、高スループットサービングのための5の最も生産準備です。
- 補助モデル(w2v-bert-)2.0, MAskGCT のセマンティックコーデック、CAMPPlus、BigVGAN) は、最初の実行時に自動的にダウンロードします。
- ComfyUIコミュニティノードが存在します。
BSAI_ComfyUI_IndexTTS-2.5そして、ComfyUI_JR_IndexTTS25.
ユースケース:このグループで最も広い範囲
| スケナリオ | 実行方法 | 詳しくはこちら |
|---|---|---|
| マルチリンガルフィルムとショートフォームデュブ | 明示的な持続時間制御でここに唯一のモデル(0.5×–2.0× 連続的な速度)、従って翻訳は元のタイムラインに戻って圧縮することができます | 平均的な文の長さは異なります 20–40% 言語全体で、最初のパスフィットが期待できません。 |
| オーディオブックとロングフォームナレーション | 段落でチャンク, 保ちます 10% オーバーラップ、全体で1つの参照クリップを再利用 | 配達仕様は自動ゲートです — 以下のACXリストを参照してください。 |
| ゲームNPCボイスアセットライン | ほぼゼロマージンコストで1つのバッチで数千のラインをオフラインで生成 | 実際にブロックしているのは、モデルではなく、エンジンの形式です。 — 詳しくはこちら |
| コールセンターバルク通知/IVR | RTF 0.20 プラスvLLMのレシピは、シングルを意味します 4090 生産の負荷を運ぶことができます | ピーク時間のキューイングは現実的です。キャッシュと通貨の天井が必要です |
| アラビア語、日本語、スペイン語 | 5つの言語と相互言語転送。 zh→ジェイスピーカーの類似性 75.82 ここのベストです | 英語はまだ混合されたzh/enテキストでwobbles — それをテストして下さい |
| クロスリンガルポッドキャスト配布 | ホストの親友を維持しながら、複数の言語に全体のショーをクローンする | 広告セグメントにおけるAI開示業務のタイト化 |
オーディオブック:ACX配送仕様は自動ゲートです
| アイテム | ACXの条件 | AIの生成が通常失敗する方法 |
|---|---|---|
| コンテナ | MP3の 192 ログイン CBRの特長 | VBRとして輸出 — 即時拒絶 |
| サンプルレート | 44.1 kHz | モデルが出る 22.05 / 24 / 48 kHz; 必要性のresampling |
| チャンネル | モノラルかステレオ、 書籍全体で一貫した | チャプター間の設定ドリフト |
| 平均ラウドネス(RMS) | −23 dB から −18 dBの | 生のAI出力は、通常、-26 お問い合わせ24 dBの — あまりにも静かな |
| ログイン | ≤ −3 dBの | 堅いconsonantsクリップへの 0 正規化後のdB |
| 騒音フロア | < −60 dBのRMS | 合成呼吸/部屋の調子はそれの上に坐ります |
| ファイルの長さ | ≤ 120 所要時間 | 1つのファイルの全本 |
| ヘッド/尾調子 | 0.5–1 s ヘッド, 1–5 s お問い合わせ | 攻撃的なトリミングは、サンプルゼロに最初のphonemeを置く |
| 小売サンプル | 1–5 コンテンツのみ | 混合クレジット |
| AI開示 | 投稿メタデータのAIナレーションを宣言 | 提出時間を忘れた場合 |
ゲーム:モデルではなく、エンジンブロック
フォーマット及びサンプル率
非現実的なエンジン 5 WAV を望んでいます (16-ビット, 44.1 kHz)またはOGG Vorbis。
直接コストでMP3をドロップ 200–300 ms デコードレイテンシと lip sync が消えます。
古典的な失敗:モデル出力 48 kHz、プロジェクト Audio Source は、 44.1 kHz、ラインは二重速度で再生します。
エンジン設定
UE5:サウンドクラス "Dialogue" に設定する必要があります。. デフォルト SFX クラスは 4:1 ウィスパーとフラットテンスを増幅する圧縮。
Unity: オーディオソースロードタイプ — ラインの下 10 s 記憶で圧縮された、長いライン スイッチを使用して流れます。
資産運用管理
新着情報 500 対話線, 何かを生成する前に、ネーミングスキーマを修正, e.g. CHARACTER_EMOTION_LINEID.wav.
それ以外の場合は、保存した生成よりもイベントをトリガーするためにファイルを再調整する時間を費やします。
パフォーマンス予算
以上 50–100 sシーンの不当なボイスラインは、メモリのスパイクを引き起こします。 オーディオプールとLOD(遠くのNPC上で無効なリップシンク)が必要です。
ターゲットを 50–70% キャッシュヒット率: プリレンダー予測可能なビート、緊急の対話のみをライブ生成します。
Dubbing:費用映像
| アプローチ | 1分あたり · 中国語 | ターンアラウンド | フィット |
|---|---|---|---|
| 人間のスタジオのdubbing | $100–500 | 2–6 週刊 | 演劇、放送、旗艦のブランドの仕事 |
| 完全自動化されたAI | $2–20 | 同じ日 | ショートフォームビデオ、コース、マーケティングボリューム |
| AI + ヒューマンレビュー | $50–200 | デイリー | ブランドの感受性か調整された内容 |
| このモデル、自撮り | ≈ $0.003 (GPU のみ) | インフォメーション | パイプラインを構築します。, 労働とオプスを除外します。 |
留学生のVerdict
使用すると コンパクトなモデルからアラビア語、日本語、またはスペイン語のクローンを作成したり、vLLMのサービングをしたり、サブタイトルロックされたワークフローの継続的なスピーキングレート制御が必要です。
詳しくはこちら お問い合わせ Bilibili モデルライセンス上記の別の書面による商用契約が必要です。 100M MAU または ¥1B 年間売上高 — ほとんどのスタートアップがヒットしませんが、企業は慎重に検討する必要があります。
ヘッド・ツー・ヘッドのデータに座るところ
ここが唯一 IndexTTS CV3-Eval のモデルで、2 回(ベースと RL) 表示されます。 以下は4つの最も近いライバルです。全9モデルテーブルは 06.2.
| モデル | パラム | 中国語(簡体) WER / SS | スタッフ WER / SS | スペイン語 WER / SS |
|---|---|---|---|---|
| IndexTTS2.5 | 0.8 B | 4.36 / 77.10 | 5.12 / 68.06 | 3.75 / 76.39 |
| IndexTTS2.5-RL | 0.8 B | 3.93 / 77.92 | 3.89 / 67.79 | 3.33 / 76.68 |
| コージーボイス3-0.5B | 0.5 B | 3.84 / 80.01 | 4.88 / 74.16 | 4.04 / 78.85 |
| Qwen3-TTS | 1.7 B | 3.27 / 73.02 | 5.06 / 67.17 | 2.87 / 73.17 |
| MOSS-TTS-v1.5 | 8 B | 4.02 / 72.68 | 4.45 / 67.46 | 3.83 / 71.75 |
| モデル | ログイン→お問い合わせ WER / SS | ログイン→ツイート WER / SS | ログイン→ログイン WER / SS |
|---|---|---|---|
| IndexTTS2.5 | 3.62 / 63.83 | 5.17 / 65.48 | 6.57 / 74.16 |
| IndexTTS2.5-RL | 3.55 / 67.47 | 4.86 / 64.47 | 6.38 / 75.82 |
| コージーボイス3-0.5B | 3.23 / 62.79 | 4.58 / 64.04 | — |
| Qwen3-TTS | 5.74 / 63.04 | 5.15 / 68.02 | 36.09 / 65.71 |
| モデル | 精密加工 | ソリューション RTF | 利用規約 |
|---|---|---|---|
| IndexTTS2.5 | bf16の特長 | 0.2065 | RTX 4090, kv cache=True |
| IndexTTS2 (参考) | fp16の特長 | 0.3257 | RTX 4090 |
| VoxCPM2 (参考) | bf16の特長 | ~0.30 | ~0.13 ナノVLLM |
| OmniVoice (参考) | — | 0.025 | H100 + カスタムカーネル; ~0.9–1.2× アップルシリコンでリアルタイム |
自分で実行する費用
| セットアップ | RTF | GPU-時間/Mの木 | オンデマンド RTX 4090 | オンデマンド A100 |
|---|---|---|---|---|
| IndexTTS2.5 (bf16) | 0.2065 | 3.7 h | ~$2.75 | ~$5.91 |
| 参考: VoxCPM2 (ナノVLLM) | ~0.13 | 2.3 h | ~$1.73 | ~$3.72 |
| 比較比較 | コスト/ M 文字 | 複数の |
|---|---|---|
| ElevenLabs v3 | $60–180 | ~22–65× |
| ElevenLabs フラッシュ | $50–55 | ~18–20× |
オープンAI tts-1 | $15 | ~5.5× |
| Google/Polly標準 | $4 | ~1.5× |
ライセンスおよび開示ゲート
| アイテム | ステータス |
|---|---|
| コードライセンス | オープンソース |
| 重量 免許証 | Bilibili モデルライセンス |
| 商用利用 | 許可されるが、 上記以外の書面による同意が必要です。 100M MAU または ¥1B 年間売上高 |
| デフォルトの透かし | コメントはありません → 想定上の計画はなし |
| あなたが追加しなければならないもの | 開示義務がある場合、AudioSeal / SynthID / C2PA; モデルはコンテンツフィルタを出荷しません |
| データ残余 | 完全にオフラインで実行 |
そうでない場合は、
- 中国語のみ、最大のスピーカーの類似性を追いかける → コージーボイス3-0.5B 中国語SS 80.01). ライセンスを最初に確認 — きれいだと仮定しない。
- ライセンスはきれいでなければなりません → VoxCPM2 (費用は著しく弱いzhである)→エス)。
- 出荷できる最高ランクのオープンモデル → ステップオーディオ編集X (Apache-2.0、ブラインドのElo 1,102).
- アラビア語、なし Bilibili 閾値 → このセットには何もありません。 それは正確に 2.5's moat's は、
IndexTTS2.5で制作を始めますか?
このエンジンを選択した状態でテキスト読み上げを開き、自分の音声モデルで制作を始められます。