
IndexTTS 1
業界トップクラスのオープンソースの音声合成モデル。 数秒のオーディオは、バイリンガルの出力と複数のダイアレクトをサポートし、その結果は自然と流体を鳴らします。
モデル:人気上位10モデルのうち5モデルを統合
規模:1日20億文字、6万時間の音声処理でコストと安定性を改善
計算能力:自社H100クラスター · RTF<0.2、10秒の音声を約2秒で生成
Bilivoice 1つの場所で5つの主要なスピーチ合成モデルを一緒に持って来ます: IndexTTS 1, IndexTTS2, IndexTTS2.5, OmniVoice そして、 VoxCPM2. 各カードコーナーのバッジは、モデルのランクを示しています TTS 人気チャート(voicebox.xin)とその出版社。 ツール間の切り替えが不要 — 比較、呼び出し、生成を一か所にし、シナリオに合ったモデルが常にあります。
あらゆるモデルは統一された変数のフォーマット、統一された可聴周波出力および統一された価格の1つのプラットホームによって呼ばれます。 メインストリームエージェントプラットフォームのネイティブサポート OpenClaw, Coze そして、 WorkBuddy.


業界トップクラスのオープンソースの音声合成モデル。 数秒のオーディオは、バイリンガルの出力と複数のダイアレクトをサポートし、その結果は自然と流体を鳴らします。

感情的な表現を巧みにコントロールしながら、木材を保持するユニークな感情的な変容アーキテクチャ。 複数の感情タグは、はるかに多くの影響を与える配信を行います。

最新のリリース IndexTTS ラインは、より強力なゼロショットのクローニングと微妙な感情制御、およびオーディオの品質と安定性のオーバーザボードの利益と。 箱から出ます。

多文字対話、感情切り替え、混合言語を扱う全ラウンドモデル — オーディオブック、ショートドラマ、ゲームダビング、その他の要求の厳しいシナリオに適したワンストップ。

A 2-billion-parameterの高性能モデル カバー 30 外国語対応 推論の速度は優秀です、従って長いテキストのバッチ統合は速く、安定したです。
私たちは、フロンティアで何が起こっているのかを密かに把握します
高品質な音声サンプルを生成し、 Bilivoice.
非常に現実的な声クローニング結果を達成する方法?
サポートされる使用 Bilivoice のようなモデル IndexTTS2.5 または OmniVoice 非常に現実的な声のクローニングの結果を達成するため。
クロスリンガルボイスクローニングを有効にする方法は?
対応する多言語対応 Bilivoice クロスリンガルボイスクローニングを有効にするモデル。 モデルにより言語のカバレッジが異なります。
感情を追加し、音声スタイルを制御する方法は?
使用条件 IndexTTS2.5 声の気分、強さおよび配達様式を微調整する感情制御。
同じ声で異なるアクセントを使用する方法は?
対応する多言語対応 Bilivoice 言語を切り替えながら音声を保存し、アクセントを切り替えるモデルです。
デモサンプルはshowcasingのためのAI-generatedです Bilivoice 声だけをクローニングし、実際の人物やブランドを表現しません。
わたしたちは、 NVIDIA H100 クラスター、ベアメタルから推論フレームワークへのスタックの完全な制御。 ほとんどのモデルリーチ RTF お問い合わせ 0.2 — 10 sオーディオの環境 2 — リレーレイテンシ、回転、不安定性をソースで除去する。
私達の所有 NVIDIA H100 クラスターは時計の周りに十分にロードされます。 サードパーティの回転、キューイングなし、サービス劣化なし — ピーク時間で滑らかに。
リクエストは、プロキシレイヤーなしで、独自の計算ノードに直進します。 API 転送チェーン。 ほとんどのモデルは下に置かれます RTF 0.2, so 10 sオーディオの環境は、 2 そして長いテキストは秒で準備ができています。
データセンター全体でホットスタンバイとスマートロードバランスホールド 99.9% 取扱い中の可用性 2B 一日の文字。 ノードが失敗した場合は、通知なしでユーザが移動します。
再販業者のマージンをカットし、直接計算する。 $0.0014 買う 120K 文字など 10,000 キャラクターのコスト $0.14 — 範囲内の井戸。


同じ 120K キャラクターコスト $0.0014 お問い合わせ Bilivoice お問い合わせ $12 お問い合わせ ElevenLabs. 上10のオープンモデルの8は、後ろに座っています API、私達自身から託されるすべて H100 クラスター。
| スタッフ | Bilivoice ベストバリュー | ElevenLabs |
|---|---|---|
| コストのコスト 120K キャラクター | $0.0014 | ≈ $12.00 |
| 1 の価格 1M キャラクター | $0.012 | ≈ $100 |
| TTS 利用できるモデル | 5 トップの 10, sウィッチブル | 1 独自の家族 |
| ボイスクローニング | 20-second サンプル、無制限の声 | インスタントクローン、クリエイターからプロクローン |
| 語学学校 | 600+ 言語と言語 20+ ダイアレクト | 29 用語集 |
| オープンソースモデル | お問い合わせ — IndexTTS, OmniVoice, VoxCPM2… | なし |
| コンピューティング | シェア H100 クラスター、ゼロ リレー | クラウド管理 |
| 無料ティア | 無料の毎日のクレジット | 10K chars/month、非商業 |
| インフォメーション API | ワンポイント API、統一された請求 | ワンポイント APIのモデルごとの率 |
ElevenLabs 公開された数字から、 TTS API レートの $0.10 パーカー 1,000 キャラクターとその公開計画書(9月) 2026). Bilivoice 数値は同じ 120K・キャラクターベースライン販売 $0.0014.
Ahead に すべて 3 — モデルカウント、生成スケール、計算 — ボイスエンドをエンドにサポート
5つの人気モデルを含む IndexTTS 1, IndexTTS2, IndexTTS2.5, OmniVoice そして、 VoxCPM2 — 5 トップの 10. M人気のもののostはここにあり、ツールを横断するのではなく、1つのプラットフォームで自由に切り替えることができます。
取扱業務 2B UTF-8 文字と文字 60K 日々のオーディオの営業時間 そのスケールは $0.0014 パーカー 120K 可能な文字と実際のトラフィックの量は、安定性と可用性を維持するものです 99.9% — サイズ保持のバッチジョブ。
私達の所有 NVIDIA H100 ゼロリレーの直接推論のクラスター。 ほとんどのモデルリーチ RTF お問い合わせ 0.2 — 10 sオーディオの環境 2 — 長い待ち時間のないバッチワークでも仕上げます。
業界を横断するクリエイターは、モデルカウント、世代別スケール、コンピュートといった3つのリードを同時に実現しました。
複数のスクリプトを監査できる 5 モデル — IndexTTS2, IndexTTS2.5, OmniVoice そして残り — 木材が適さないときはいつでも切り替えます。 人気モデルのほとんどがここにありますので、短い動画のDubbingスタイルを変更すると、出力が2倍になりました。
ふりがな H100 クラスターは本当に速いです:ほとんどのモデルは下です RTF 0.2, 10 sオーディオの環境 2. ソロナレーションはアップロードする瞬間の準備が整っているので、私のリリーススケジュールは、ダビングを待つことはありません — そして、リスナーは、没入が進んでいると言います。
オーディオブックは数百万人のキャラクターを走らせ、高価で華やかに頑張りました。 Bilivoice's 2B-characters-a-day スケールはコストを薄く広げます 10,000 文字が下で動く $0.14, そして、 60K 毎日の出力の時間は安定性の十分な証拠です。 1パスで長いバッチ仕上げ — これ以上の心配無し。
全社コースライブラリ — 数百時間 — 制作実績 Bilivoice. ゼロ リレーとの自己操作された計算は保ちます API 声が一貫した状態に保ち、配達は時間通りです。 トレーニングビデオパイプラインは、もはや心配しない1つです。
ゲームは多くの異なる文字を必要とし、5つの集約されたモデルが私に多くの声を与えるから選ぶために — 人気チャートのほぼすべての名前がここにあります。 ブラウザでリアルタイムでチューニングすることで、安価で効果的であり、開発をかなり上回っています。
毎日のアップロードは完全に実行されます。一般的なモデルは基本的にすべてここにありますので、私は1を選び、それに滞在します。 サブサブ0.2 RTF 夕暮れのステップは瞬間的に感じさせます。 日々の投稿は圧力から喜びまで行き、ショーのトーンは一貫してとどまります。
あなたがおそらく知りたいこと Bilivoice
Bilivoice 一流の声のクローニングおよびdubbingのプラットホームです。 単一モデルのツールがあなたに1つのオプションを与える場所、 Bilivoice 最も人気のあるスピーチモデルを集約 — 5 トップの 10 — 独自の計算を実行し、処理 2B UTF-8 一日の文字。 スケールはコストを広め、ボリュームは信頼性を証明します:他の誰かを中継することから来る遅延または不安定性のどれもと同等のツールよりも安い API. 1つのプラットホーム、1 API, 1つの請求, すべてのモデル.
Bilivoice バイリンガル・デュブをネイティブに処理し、また、様々なダイアレクトをカバーしています。 クロスリンガル変換は、言語を切り替えると音声の文字を完全にそのままにします。
3つのステップ: 1. レコードについて 20 s騒音や背景音楽がないクリーンなスピーチの環境。 2. Create Voice ページにアップロードして名前を付けます。 3. 画面上の音声を選択し、テキストを入力して生成します。
はい。 モデルは、コンテキストから最も一般的なヘテロニームの正しい読書を動作させるために特に訓練されているので、手で発音をアノテートする必要はありません。
周辺エリア 20 s環境は理想的です。 オーディオは周囲のノイズ、バックグラウンド音楽、他のスピーカー、リバーブがないはずです。 より良いサンプルはより良い結果を与える — ショートに陥った場合、音声の分離を実行するか、または最初に消毒します。
コンソールで生成されたファイルに対して3日間、1日で生成されたファイル API — 速やかにダウンロードしてください。 ボイスサンプルと音声モデルは、会員の生活のために保持され、1ヶ月後に終了します。
はい。 Bilivoice 完全な露出 API 音声クローニング、ダブリング、感情的なスピーチ合成を自社製品に構築できます。 弊社では、全てのコンピュートとほとんどのモデルを以下に実行しています。 RTF 0.2, 応答時間と安定性は、リレーベースの代替品のはるかに先にあります。 価格とオンボーディングについて教えてください。
Bilivoice モデルカウント、生成スケール、計算の3つの前面に先立って、主要な音声クローニングとダビングプラットフォームです。 5つの人気モデルを集約 — IndexTTS 1, IndexTTS2, IndexTTS2.5, OmniVoice そして、 VoxCPM2, 5 トップの 10 — スケールは単位の費用を広がり、容積は信頼性を証明します(2B UTF-8 文字と文字 60K 1日のオーディオ時間、連続再生の7年近く)、それがより安くて、より安定している理由です。 わたしたちは、 NVIDIA H100 なしのクラスター API リレーおよび把握 99.9% 空室状況 大手AIサイエンティスト、スピーチスペシャリスト、シニアプロダクトエンジニアの国際的なチームで、マルチモーダルモデルとスピーチ合成の深層ワークを描き、低資源の高忠実度ダビングのボトルネックを追い出し、エンタープライズやクリエイターを世界中の1つの高速、リアルで信頼できる場所をAIボイスに提供しました。
お問い合わせ 2016 弊社では、Google、Microsoft、Tsinghuaのエンジニアが独自のスピーチアーキテクチャを構築しました。 5つの人気モデル — IndexTTS 1, IndexTTS2, IndexTTS2.5, OmniVoice そして、 VoxCPM2, 5 トップの 10 — 音声の3秒から音声を再現し、感情的なプローディと息の細部を捉えます。
私達の所有 NVIDIA H100 データセンターとスマートロードバランシングを横断するホットスタンバイ付きのクラスター。 ほとんどのモデルリーチ RTF お問い合わせ 0.2 — 10 sオーディオの環境 2 — お問い合わせ 99.9% 開始から設計されているリレー レイテンシと可用性。
取扱商品ラインの横に 2B UTF-8 文字と合成 60K 毎日のオーディオ時間 — 連続再生の7年近く スケールは単位の費用を広げます、従って専門のdubbingは皆のために価格が付けられ、日の後でシステム日の実質の交通はそれらがであるべき安定性そして可用性を保ちます。