OmniVoice
Xiaomi / k2-fsa(次世代カルディ) · 646 用語集 · 3月発売 31, 2026
OmniVoice お問い合わせ k2-fsaさん、次原Kaldiのグループによって導かれる ダニエル・ポヴェイ — スピーチ認知コミュニティでかなりの重量を運ぶ名前。 それはです 最も広範囲にわたる言語のカバーゼロショット TTS 利用できるモデル, 請求 646 用語集 大体に訓練 581,000 h私たちの 音声は完全にローカルで動作します。 蓄積されたレポ 12k GitHub リリースの週以内の星、体重はわずかです〜3.3 GB.
- ペーパー
- arXiv:2604.00688
- バックボーン
- Qwen3-0.6B (~0.8 B 合計)
- 語学学校
- 646
- トレーニングデータ
- ~581,000 h
- ソリューション
- 24 kHz ログイン
- 重量のサイズ
- ~3.3 GB
- クレーム RTF
- 0.025 お問い合わせ H100 カスタムカーネルを使って
- コードライセンス
- Apache-2.0
- 重量ライセンス
- CC-BY-NCの特長 4.0 (非商用)
建築設計 — 「拡散言語モデルスタイル」非自動回帰設計
最近の投稿 TTS パイプラインは2段階です: text → semantic tokens → acoustic features → waveform各ホップはエラーを蓄積します。 OmniVoice これを1つのステージに崩壊させる: text → multi-codebook acoustic tokens → waveform.
- バックボーンは、 Qwen3-0.6B 拡散言語モデルスタイルの言語モデル: 音声を左から右に移動するのではなく、 少数の並列非評価ステップで全シーケンスを精製.
- A 双方向トランス 指示トランスクリプト、プロンプトセグメント、マスク対象セグメントを共同モデル化します。
- 音声は、から派生する別のトークナイザーによって符号化/飾られます Higgs オーディオ v2 (Boson AI), Apache-2.0).
- 中間のセマンティック段階からの間違いの蓄積無し、および少数のシーケンシャルの解読のステップ — 速度を下げる。
5つのコア機能
| 機能特性 | インフォメーション |
|---|---|
| ゼロショットクローニング | 3–10 s 参照の音声の。 作り付け ウィスパー自動転写 参照トランスクリプトを供給する必要はありません。 きれいなスピーカーの埋め込みを抽出することで、騒々しい/残骸の参照を処理します。 |
| 音声デザイン | 参照の音声は要求しません — 自然言語で音声を記述する()male, elderly, low pitch, British accent) 1 つを生成します。 性別、年齢、ピッチ、アクセント、方言、ウィスパーをサポートします。 |
| 細かいテキスト制御 | インライン非バーバルタグ: [laughter], [sigh], [breath], [sniff] そして、 13+ その他。 |
| 発音オーバーライド | トーンマーク付きピニイン経由で中国語(例えば) ZHE2; CMU発音辞典による英語。 |
| マルチスピーカー対話 | [Speaker_N]: タグは、複数の文字のスクリプト合成を駆動します, 独立した声で各スピーカー. |
スピード — 紙対現実
見出し図は RTF 0.025 (40× リアルタイム). その測定は、 H100 専用の加速カーネルでワークステーションではなく。 独立したハンズオンテスト Mac のスタジオ/最高 M4 報告する 4–6 s計算の環境 5.4 sオーディオの環境 — ほぼリアルタイムで、約半数で --num_step 16 明快さのいくつかのコストで。 予算に応じて。
サードパーティのテストから既知の問題
- 時事に単語を落とすか、または 開始または終了 文章の — 1 つ 24-世代別テスト、 5 単語を紛失または破損した出力。 既知の問題です。再実行は通常解決します。
- 声のクローンを生成し、それを節約する()
model.create_voice_clone_prompt()→.save("voice.pt")) 参照クリップとトランスクリプトを後でセッションでスキップできます。 — バッチ作業に役立ちます。 - 十分にオフライン操作は重量をと事前ダウンロードすれば働きます
hf download k2-fsa/OmniVoice --local-dir ./modelパスを渡す--model. セットGRADIO_ANALYTICS_ENABLED=FalseウェブUIを起動する前に — 起動時にGradioに電話をかけます。
エコシステム
- GGUF定量化 存在 (
Serveurperso/OmniVoice-GGUF, ~62k ダウンロード/月)、Q4 K Mから~660 MBからF32。 - オムニボイス.cpp — a C++17/GGMLポートで実行 CPU、CUDA、ROCm、金属およびバルカン、Appleのケイ素を含んで。 これは、 OmniVoice ここの最もポータブルなオプションです。
- 人気のエンジン 音声スタジオ ローカルElevenLabs-代替プロジェクト。
- アップルシリコンは、MPS(~3.3 GB ダウンロード, いいえ NVIDIA カードが必要です。
使用例:言語のパントとポータビリティ
| スケナリオ | 実行方法 | 詳しくはこちら |
|---|---|---|
| 低資源・希少言語 | 646 商業無しで多くをカバーする言語 TTS すべてのサポート | 重量はCC-BY-NCです — 単独で商用利用 |
| CPU専用/ラズベリーパイ/エッジデバイス | omnivoice.cpp は CPU、金属、Vulkan および ROCm で動作します。Q4 K M 言語モデルは下にあります 1 GB | ふりがな RTF 0.025 headline は測定されました H100 慣習的なカーネルを使って;ローカルは近づくことを期待します 1× リアルタイム |
| 完全エアギャップ展開 | 重みを一度ダウンロードし、ネットワークの要求はなされません | 技術的に生存するが、非商用ライセンスは、公共セクターと病院の仕事をルール |
| 研究および非商業試作 | 音声デザインは、参照オーディオなしで説明から親友を作成します | ボイスデザインは素晴らしい — 1 つから 3 つの候補を生成し、選ぶ |
| Macでローカルで実行 | MPSによるネイティブアップルシリコンサポート3.3 GB 体重の | 紙番号ではなく、あなた自身の測定から容量プラン |
留学生のVerdict
使用すると 研究、個人的なプロジェクト、または低リソース言語の仕事をしているか、最も広い言語のカバレッジと最も簡単なCPU / Macパスが必要です。 どの参照の可聴周波のない声の設計はプロトタイピングのために本物有用です。
商用に使用しないでください 別のライセンスを交渉することなく — CC-BY-NC の重量はブロッカーです、 Apache-2.0 レポバッジ。 同様に "describe-a-voice" 機能と商業的にクリーンな代替品については、 VoxCPM2, チャットボックス (MIT) または CosyVoice 3.
ヘッド・ツー・ヘッドのデータに座るところ
| モデル | パラム | 中国語(簡体) WER / SS | スタッフ WER / SS | スペイン語 WER / SS |
|---|---|---|---|---|
| OmniVoice | 0.8 B | 3.41 / 72.99 | 3.62 / 70.13 | 3.52 / 74.14 |
| コージーボイス3-0.5B | 0.5 B | 3.84 / 80.01 | 4.88 / 74.16 | 4.04 / 78.85 |
| 魚の可聴周波S2プロ | 4 B | 3.62 / 67.79 | 3.83 / 61.66 | 2.93 / 67.44 |
| IndexTTS2.5-RL | 0.8 B | 3.93 / 77.92 | 3.89 / 67.79 | 3.33 / 76.68 |
| モデル | ログイン→お問い合わせ WER / SS | ログイン→ツイート WER / SS | ログイン→ログイン WER / SS |
|---|---|---|---|
| OmniVoice | 3.74 / 64.91 | 5.84 / 62.08 | 9.09 / 69.06 |
| VoxCPM2 | 4.48 / 64.25 | 16.38 / 64.89 | 11.84 / 71.54 |
| モデル | RTF | 利用規約 |
|---|---|---|
| OmniVoice | 0.025 | H100 + カスタム加速カーネル(紙図) |
| OmniVoice (測定済み) | ~0.9–1.2× リアルタイム | Mac のスタジオ/最高 M4 |
| IndexTTS2.5 (参考) | 0.2065 | RTX 4090 bf16の特長 |
自分で実行する費用
| アイテム | バリュー | お問い合わせ |
|---|---|---|
| GPU-時間/Mの木 | 0.45 h | ペーパー条件 |
| オンデマンド H100 ($2.89–3.49/h) | ~$1.30–1.57 | セットの中で最も安い |
| オンデマンド RTX 4090 | 該当なし | 紙図は、 H100 プラスカスタムカーネルと転送しない |
| 重量のサイズ | 3.3 GB | Q4 K M では、言語のモデル部分が下にある 1 GB |
omnivoice.cpp マシン上で動作させる お問い合わせ GPU お問い合わせ (CPU/金属/Vulkan/ROCm)。 必要であれば TTS 端箱の中の、それはこのセットの唯一の選択です — リアルタイムの要因を受け入れる必要があります。ライセンスおよび開示ゲート
| アイテム | ステータス |
|---|---|
| コードライセンス | Apache-2.0 |
| 重量 免許証 | CC-BY-NCの特長 4.0 (非商用) |
| 商用利用 | ✓ 許可されていません — 別のライセンスを取得しない場合 |
| デフォルトの透かし | コメントはありません |
| データ残余 | 完全エアギャップ(プリダウンロード重量、Gradio分析を無効に)を実行 |
そうでない場合は、
- 言語のパント、しかし、それは出荷可能でなければなりません → ステップオーディオ編集X (Apache-2.0) または ココロ 82M (CPU、 Apache-2.0、クローン無し)。
- 完全オフライン そして、 商業的にきれい → VoxCPM2.
- 研究または趣味の使用のみ → お問い合わせ 何も安くない 646-言語カバレッジ。
- CPUでのリアルタイムのインタラクション → お問い合わせ ココロで見る 06.1 テーブル、または閉じられた使用 API.
OmniVoiceで制作を始めますか?
このエンジンを選択した状態でテキスト読み上げを開き、自分の音声モデルで制作を始められます。