オープンソースTTSモデル徹底解説 · 2026
04

OmniVoice

Xiaomi / k2-fsa(次世代カルディ) · 646 用語集 · 3月発売 31, 2026

OmniVoice お問い合わせ k2-fsaさん、次原Kaldiのグループによって導かれる ダニエル・ポヴェイ — スピーチ認知コミュニティでかなりの重量を運ぶ名前。 それはです 最も広範囲にわたる言語のカバーゼロショット TTS 利用できるモデル, 請求 646 用語集 大体に訓練 581,000 h私たちの 音声は完全にローカルで動作します。 蓄積されたレポ 12k GitHub リリースの週以内の星、体重はわずかです〜3.3 GB.

製品を計画する前にこれをお読みください OmniVoice: お問い合わせ コードコード お問い合わせ Apache-2.0, しかし、 事前に訓練された重量はCC-BY-NCです 4.0 (非商用)エミリアコルパスなどのトレーニングデータから継承された制約。 個人的なおよび研究の使用は良いです; 収入生成の使用は許可されていません 別のライセンスなし。 これはモデルカードに明示的に記載され、商用展開のためのハードブロッカーです。
ペーパー
arXiv:2604.00688
バックボーン
Qwen3-0.6B (~0.8 B 合計)
語学学校
646
トレーニングデータ
~581,000 h
ソリューション
24 kHz ログイン
重量のサイズ
~3.3 GB
クレーム RTF
0.025 お問い合わせ H100 カスタムカーネルを使って
コードライセンス
Apache-2.0
重量ライセンス
CC-BY-NCの特長 4.0 (非商用)

建築設計 — 「拡散言語モデルスタイル」非自動回帰設計

最近の投稿 TTS パイプラインは2段階です: text → semantic tokens → acoustic features → waveform各ホップはエラーを蓄積します。 OmniVoice これを1つのステージに崩壊させる: text → multi-codebook acoustic tokens → waveform.

  • バックボーンは、 Qwen3-0.6B 拡散言語モデルスタイルの言語モデル: 音声を左から右に移動するのではなく、 少数の並列非評価ステップで全シーケンスを精製.
  • A 双方向トランス 指示トランスクリプト、プロンプトセグメント、マスク対象セグメントを共同モデル化します。
  • 音声は、から派生する別のトークナイザーによって符号化/飾られます Higgs オーディオ v2 (Boson AI), Apache-2.0).
  • 中間のセマンティック段階からの間違いの蓄積無し、および少数のシーケンシャルの解読のステップ — 速度を下げる。

5つのコア機能

機能特性インフォメーション
ゼロショットクローニング3–10 s 参照の音声の。 作り付け ウィスパー自動転写 参照トランスクリプトを供給する必要はありません。 きれいなスピーカーの埋め込みを抽出することで、騒々しい/残骸の参照を処理します。
音声デザイン参照の音声は要求しません — 自然言語で音声を記述する()male, elderly, low pitch, British accent) 1 つを生成します。 性別、年齢、ピッチ、アクセント、方言、ウィスパーをサポートします。
細かいテキスト制御インライン非バーバルタグ: [laughter], [sigh], [breath], [sniff] そして、 13+ その他。
発音オーバーライドトーンマーク付きピニイン経由で中国語(例えば) ZHE2; CMU発音辞典による英語。
マルチスピーカー対話[Speaker_N]: タグは、複数の文字のスクリプト合成を駆動します, 独立した声で各スピーカー.

スピード — 紙対現実

見出し図は RTF 0.025 (40× リアルタイム). その測定は、 H100 専用の加速カーネルでワークステーションではなく。 独立したハンズオンテスト Mac のスタジオ/最高 M4 報告する 4–6 s計算の環境 5.4 sオーディオの環境 — ほぼリアルタイムで、約半数で --num_step 16 明快さのいくつかのコストで。 予算に応じて。

サードパーティのテストから既知の問題

  • 時事に単語を落とすか、または 開始または終了 文章の — 1 つ 24-世代別テスト、 5 単語を紛失または破損した出力。 既知の問題です。再実行は通常解決します。
  • 声のクローンを生成し、それを節約する()model.create_voice_clone_prompt() → .save("voice.pt")) 参照クリップとトランスクリプトを後でセッションでスキップできます。 — バッチ作業に役立ちます。
  • 十分にオフライン操作は重量をと事前ダウンロードすれば働きます hf download k2-fsa/OmniVoice --local-dir ./model パスを渡す --model. セット GRADIO_ANALYTICS_ENABLED=False ウェブUIを起動する前に — 起動時にGradioに電話をかけます。

エコシステム

  • GGUF定量化 存在 (Serveurperso/OmniVoice-GGUF, ~62k ダウンロード/月)、Q4 K Mから~660 MBからF32。
  • オムニボイス.cpp — a C++17/GGMLポートで実行 CPU、CUDA、ROCm、金属およびバルカン、Appleのケイ素を含んで。 これは、 OmniVoice ここの最もポータブルなオプションです。
  • 人気のエンジン 音声スタジオ ローカルElevenLabs-代替プロジェクト。
  • アップルシリコンは、MPS(~3.3 GB ダウンロード, いいえ NVIDIA カードが必要です。

使用例:言語のパントとポータビリティ

スケナリオ実行方法詳しくはこちら
低資源・希少言語646 商業無しで多くをカバーする言語 TTS すべてのサポート重量はCC-BY-NCです — 単独で商用利用
CPU専用/ラズベリーパイ/エッジデバイスomnivoice.cpp は CPU、金属、Vulkan および ROCm で動作します。Q4 K M 言語モデルは下にあります 1 GBふりがな RTF 0.025 headline は測定されました H100 慣習的なカーネルを使って;ローカルは近づくことを期待します 1× リアルタイム
完全エアギャップ展開重みを一度ダウンロードし、ネットワークの要求はなされません技術的に生存するが、非商用ライセンスは、公共セクターと病院の仕事をルール
研究および非商業試作音声デザインは、参照オーディオなしで説明から親友を作成しますボイスデザインは素晴らしい — 1 つから 3 つの候補を生成し、選ぶ
Macでローカルで実行MPSによるネイティブアップルシリコンサポート3.3 GB 体重の紙番号ではなく、あなた自身の測定から容量プラン
対比的な選択の結論: OmniVoice 完全にオフラインで実行し、CPUビルドを出荷します。これにより、パブリックセクターや病院のデプロイに最適 — しかし、その重量はCC-BY-NCなので、調達はクリアされません。 これらのシナリオを使用する必要があります。 VoxCPM2 代わりに ()Apache-2.0 コードと重量の両方で。

留学生のVerdict

使用すると 研究、個人的なプロジェクト、または低リソース言語の仕事をしているか、最も広い言語のカバレッジと最も簡単なCPU / Macパスが必要です。 どの参照の可聴周波のない声の設計はプロトタイピングのために本物有用です。

商用に使用しないでください 別のライセンスを交渉することなく — CC-BY-NC の重量はブロッカーです、 Apache-2.0 レポバッジ。 同様に "describe-a-voice" 機能と商業的にクリーンな代替品については、 VoxCPM2, チャットボックス (MIT) または CosyVoice 3.

646 用語集 音声デザイン CPU / Mac / バルカン GGUF + C++ポート NC重量 — 商用利用なし

ヘッド・ツー・ヘッドのデータに座るところ

モデルパラム中国語(簡体) WER / SSスタッフ WER / SSスペイン語 WER / SS
OmniVoice0.8 B3.41 / 72.993.62 / 70.133.52 / 74.14
コージーボイス3-0.5B0.5 B3.84 / 80.014.88 / 74.164.04 / 78.85
魚の可聴周波S2プロ4 B3.62 / 67.793.83 / 61.662.93 / 67.44
IndexTTS2.5-RL0.8 B3.93 / 77.923.89 / 67.793.33 / 76.68
モデルログイン→お問い合わせ WER / SSログイン→ツイート WER / SSログイン→ログイン WER / SS
OmniVoice3.74 / 64.915.84 / 62.089.09 / 69.06
VoxCPM24.48 / 64.2516.38 / 64.8911.84 / 71.54
モデルRTF利用規約
OmniVoice0.025H100 + カスタム加速カーネル(紙図)
OmniVoice (測定済み)~0.9–1.2× リアルタイムMac のスタジオ/最高 M4
IndexTTS2.5 (参考)0.2065RTX 4090 bf16の特長
これを読むための鍵:最低 WER 「人のような音」という意味ではありません。 OmniVoice日本語 English WER インフォメーション 3.62 セットの中では最高のものの、スピーカーの類似性は 70.13 — リーダーの下。 お問い合わせ クリアー, ない もっと 同一. つまり、ニュース読書やキャラクターの重なりや、オーディオブックを渡る固定ナレータの本当の弱さの利点です。

自分で実行する費用

アイテムバリューお問い合わせ
GPU-時間/Mの木0.45 hペーパー条件
オンデマンド H100 ($2.89–3.49/h)~$1.30–1.57セットの中で最も安い
オンデマンド RTX 4090該当なし紙図は、 H100 プラスカスタムカーネルと転送しない
重量のサイズ3.3 GBQ4 K M では、言語のモデル部分が下にある 1 GB
予算をしないでください 0.025. つまり、研究室の数字で H100 目的作りのカーネルを使って。 消費者カードやアップルシリコンでは、測定された数の土地を大体に占める 0.9–1.2× リアルタイム — オーディオの1時間は約1時間かかります。 そのわずかなコストは最も低く、そのハードウェアバーは最高です。 同じオンデマンドで再コスト 4090 基礎、それはより安いです IndexTTS2.5.
しかし、それは異なるコストの利点を持っています: GGUFプラス omnivoice.cpp マシン上で動作させる お問い合わせ GPU お問い合わせ (CPU/金属/Vulkan/ROCm)。 必要であれば TTS 端箱の中の、それはこのセットの唯一の選択です — リアルタイムの要因を受け入れる必要があります。

ライセンスおよび開示ゲート

アイテムステータス
コードライセンスApache-2.0
重量 免許証CC-BY-NCの特長 4.0 (非商用)
商用利用✓ 許可されていません — 別のライセンスを取得しない場合
デフォルトの透かしコメントはありません
データ残余完全エアギャップ(プリダウンロード重量、Gradio分析を無効に)を実行
対比的な結論: 政府と医療は、彼らが最もオフラインモデルを必要とするように見えるシナリオが正確にあります — そして、彼らは一つの場所です OmniVoice 技術的に優れています。 しかし、 CC-BY-NC の重量は調達および承諾でそれを殺します. ここの概念の証拠を燃やさないでください。 VoxCPM2. 完全なライセンスの故障はあります 06.5.

そうでない場合は、

  • 言語のパント、しかし、それは出荷可能でなければなりません → ステップオーディオ編集X (Apache-2.0) または ココロ 82M (CPU、 Apache-2.0、クローン無し)。
  • 完全オフライン そして、 商業的にきれい → VoxCPM2.
  • 研究または趣味の使用のみ → お問い合わせ 何も安くない 646-言語カバレッジ。
  • CPUでのリアルタイムのインタラクション → お問い合わせ ココロで見る 06.1 テーブル、または閉じられた使用 API.
BiliVoiceで試す

OmniVoiceで制作を始めますか?

このエンジンを選択した状態でテキスト読み上げを開き、自分の音声モデルで制作を始められます。