VoxCPM2
モデルベスト/ OpenBMB / TsinghuaのHCSI · トークナイザーフリー · Apache-2.0 · 4月4日 2026
VoxCPM2 このセットの中で最も国際的にフレンドリーなモデルです。 Apache-2.0 コードと重量の両方の, 英語の文書をクリーンにし、共通する設計決定 TTS 問題。 お問い合わせ トークナイザーフリー — オーディオを離散トークンに定量化するのではなく、連続した空間で直接生成します。 合理:量子化は失われ、アクセント、感情的なマイクロダイナミクス、呼吸および一時リズムは正確にそれによって平らになる細部です。 モデルは 2 B ModelBestで構築されたパラメーター ミニCPM-4 バックボーン、訓練された 2M+ 営業時間 多言語対応のスピーチ
- 建築設計
- ログイン → ツイート → ログイン → ログイン
- バックボーン
- ミニCPM-4, 2 B 合計:
- 語学学校
- 30 + 9 中国文字盤
- オーディオVAE
- 可聴周波VAE V2 (16 kHz お問い合わせ → 48 kHz アウト)
- LMトークンレート
- 6.25 Hz最高、 8192 トークン
- VRAM
- ~8 GB
- RTF (RTX 4090)
- ~0.30 / ~0.13 ナノVLLM
- ライセンス
- Apache-2.0 (商業OK)
4段アーキテクチャ
- LocEnc(ローカルエンコーダ) — 入力テキストと参照オーディオから機能を抽出し、2つの言語モデルの調整を作成します。
- TSLM(テキスト)–セマンティックLM — 「セマンティック・プランニング」: テキストを粗いスピーチ・セマンティクス表現にマップします。 コンテンツ境界とプロソディックフレームが決定されるところです。
- RALM(残留音響LM) — TSLMの出力の上部に微細でグラインドされた音響モデリング: timbre、感情的な細部およびスピーカーの特徴はここに加えられます。
- LocDiT(ローカル拡散トランス) — 流れ一致のローカル拡散は連続的な可聴周波潜水艦を、分解します作り出します オーディオVAE V2 お問い合わせ 48 kHz オーディオ。
AudioVAE V2は アシンメトリック: エンコーダは受け入れます 16 kHz デコダーが出ている間入力 48 kHz、造られる超決断と — 外部のアップサンプラーは必要ありません。 お問い合わせ 48 kHz 出力は、このグループの最高サンプルレートです。
4つの使用法モード
| モード | パスワード | あなたを与えるもの |
|---|---|---|
| 基本情報 TTS | テキストのみ | 参照の音声無しおよび 言語タグなし — モデルは言語自体を検出します。 中国語をタイプして下さい、中国を得て下さい;タイをタイプして下さい、タイを得て下さい。 |
| 音声デザイン | 自然言語の説明 | 括弧内の記述でテキストをプレフィックスするなど (young woman, warm and gentle voice). 参照オーディオなしで全く新しいボイスを作成します。 |
| 制御可能なクローニング | 参照の可聴周波+様式の指示 | ステアリング感情、ペース、デリバリー(もう少し速く、陽気なトーン)しながら、木材をクローンします。 木材ベースはそのままにとどまります。 |
| 究極のクローニング | リファレンスオーディオ + そのトランスクリプト | オーディオ継続スタイルクローニング — 参照は開口部セグメントになります。 最高の再生 アクセント、呼吸習慣および一時リズム. 同じクリップを両方に渡す reference_wav_path そして、 prompt_wav_path 類似性を最大化します。 |
コンテキストアウェア合成
見やすくなる機能:VOXCPMは、文字を音声に変換するのではなく、テキストを読み、適切な感情とプロセードを誘導します。 除外マークで終わる同じ文は、フルストップと異なるパッシング、エネルギー、ストレスを得ることができます。 スポーツの解説、引数と泣いたモノローグは、古い典型的なフラットな「安定的で感情のない」配信ではなく、自然なプロスディーで出てくる TTS. TSLMのセマンティックモデリングとMiniCPMから4 下のテキスト理解。
ベンチマーク
| メトリック | バリュー | インフォメーション |
|---|---|---|
| 中国CER | 0.97% | パブリック楕円セット |
| スタッフ WER | 1.84% | パブリック楕円セット |
| RTF (RTX 4090) | ~0.30 | 標準モード |
| RTF ナノVLLM | ~0.13 | 低レイテンシーリアルタイムのアプローチ |
| VRAM | ~8 GB | bf16の特長 |
種子の最先端または競争として報告TTS-eval、CV3-eval、指示して下さいTTSEvalとMiniMaxの多言語テスト。 洞窟:ほとんどの数字は自己報告されています。独立したサードパーティの再生は依然として制限されています。
語学学校
30 言語: アラビア語、ブルメス、中国語、デンマーク語、オランダ語、英語、フィンランド語、フランス語、ドイツ語、ギリシャ語、ヘブライ語、ヒンディー語、インドネシア語、イタリア語、日本語、クメール、韓国語、ラオス語、マレー語、マレー語、ポーランド語、ポルトガル語、ロシア語、スペイン語、スワヒリ語、スウェーデン語、タガログ語、タイ語、トルコ語、ベトナム語。
9 中国の方言: Sichuanese、広東、呉(上海)、北東、ヘナノン、陝西、山東、天津、ホッケーン。
ファインチューニング&展開
- フル SFT と LoRA の微調整に対応 5–10 オーディオの数分 — LoRAは推奨パスです。 このグループでは、実用的なパーソナルボイストレーニングワークフローを文書化する唯一のモデルです。
- 要件: Python ≥ 3.10, ピトーチ ≥ 2.5.0, キュダ ≥ 12.0. インストール
pip install voxcpm. - ModelScope ダウンロードは、ハッギングフェイスが遅くなる地域のユーザーが利用できます。
- 制作サービス ナノVLLM または vLLM-オムニ. ローカルWebデモ:
python app.py --port 8808. - キーノブ:
cfg_value(分類器なしの指導の強さ) — どのように密接な出力がプロンプトに付着するか)inference_timesteps(拡散ステップ;デフォルト 10 ほとんどの場合は良いです。 - 生態系の牽引: 先月のダウンロード数 327k, 21 アダプター, 28 コミュニティの微調整と 10 抱擁面の量子化。
バージョン履歴
| いつか | バージョン | 変更内容 |
|---|---|---|
| 9月9日 2025 | ボークスCPM-0.5B | 初回リリース; ヒット #1 抱擁の顔のトレンド |
| 12月12日 2025 | VoxCPM1。5 (~800 M) | SFT + Loraファインチューニング、 44.1 kHz 出力, #1 お問い合わせ GitHub トレンド; spawned ComfyUI プラグイン、ONNX エクスポートと Rust 再導入 |
| 4月4日 2026 | VoxCPM2 (2 B) | ~2.5× パラメータ; 2 → 30 言語 + 9 ダイアレクト; 48 kHz 出力; 声の設計および制御可能なクローニングは加えました;AudioVAE V2 |
ユースケース:ここに唯一のライセンスクリーニングオプション
| スケナリオ | 実行方法 | 詳しくはこちら |
|---|---|---|
| 自衛隊、病院、金融展開 | 完全にオフラインで実行するので、オーディオはネットワークを離れません。 48 kHz 外部のアップサンプリングなしで出力 | プラン6–8 生産までの週 — 下記の費用表をご覧ください |
| オンラインコースと多言語トレーニング | 30 言語プラス 9 中国語のダイアレクト、言語のタグは必要ありません | 欧州アクセシビリティ法は、調達期間へのアクセシビリティを向上しました — 詳しくはこちら |
| クリエイターボイスクローニングとパーソナルIP | LoRAファインチューニング 5–10 オーディオの分は、あなたの木材を重量に焼く | 自分自身をクローニングするか、または解放された声が安全です。 実体をクローニングすると、人格権を上げます。 |
| 広告およびマーケティング A/B の変形 | バッチ生成 1つのスクリプトの多くの変形; 自己ホストされたときにマージンコストはゼロ近くです | プラットフォームとFTC AI ラベルポリシーがきつく |
| 高品質コンテンツ配信 | 16 kHz 参照の音声はAudioVAE V2をまっすぐに通る 48 kHz 出力 | 2B パラメータ — より遅い IndexTTS2.5 |
| 音声デザイン(音声参照なし) | 自然言語で性別、年齢、ピッチを記述し、新しい親友を作成します。 | 出力は運びます ウォーターマークなし — 開示が必要な場所を自分で追加 |
自発的な展開:数学の仕組み
| アイテム | 典型的な数字 |
|---|---|
| 生産までの時間、セルフホストボイススタック | ~6–8 週、キックオフ最初の生産コールへ |
| 典型的なハードウェア | ASR + LLM、ストリーミング用L4用L40S TTS; 単一の二重GPU 箱のサフィス |
| 暖かいエンドツーエンドレイテンシ | ~0.3 s (ローカル推論、パブリックインターネット往復なし) |
| コスト構造 | ホスト APIs €0.05–0.40 /分; セルフホスト固定コストから〜€800 / 月 |
| ブレイクセブン | ふりがな 50,000 分 / 月 自己ホスティングの勝利; 以下は、データ sovereignty を購入します。 |
公表された生産成果(第三者の開示、参照のみ):
- ヨーロッパのfintech: a 10× サポートを介した解決への時間短縮。
- ティア1 ガルフテレコム: 接触ごとのコストダウン 58%; 81% 人間の手渡無しで前払いされた照会の原子格納容器;外出先のコレクションの平均ハンドルの時間 4.2 お問い合わせ 2.1 交通アクセス; AI処理されたコールのCSAT 4.3/5 に対して 4.1/5 humanのベースライン。
既設のアクセシビリティ: 右方向を取得する
WCAGはテキスト・ツー・スピーナを提供する必要はありません。 貴社のコンテンツは、補助的な技術利用者が正しく解析できるようにする必要があります。 すでに持ち込む — JAWS、NVDA、ボイスオーバー。 本当に機能するリードオードは、大規模なミドルグループです: ダイスレキア、低ビジョン、古いユーザー、第二言語リーダーと読者 — フルスクリーンの読者が、まだ長いテキストで苦労している人はほとんど役に立ちました。 コンプライアンスチェックボックスではなく、製品機能です。
- トピックス 1.4.2: より多くのために自動再生するオーディオ 3 s環境は一時停止/停止制御を必要とします — 読み替えが必要 決してオートプレイ.
- トピックス 2.1.1 / 2.4.7 / 2.4.11: すべての制御キーボード到達可能な、フォーカス可視、焦点は決して閉塞しません。
- トピックス 3.1.1 / 3.1.2: 言語変更は明示的にマークする必要があります — エンジンの言葉で、SSML
langスイッチ。 - トピックス 4.1.3: ARIA のライブ リージョンを使用しており、読み書きはフォームのエラーと読み込み状態に保ちます。
クローニング:3つの規律
ソースオーディオ
レコード 10 s–5 クリーンなシングルスピーカーオーディオの最小:音楽のベッド、リバーブなし、第二の音声なし。
5–10 LoRAの微調整は重量にあなたの木材を焼くのに十分であり、実行する分散を削減します。
コンサルティング
1つの参照クリップ、1つの種子と1つのスタイルの指示をロックして、エピソードや問題は漂流しません。
ボイスデザインは素晴らしい — コミットする前に 1 つから 3 つの候補を生成します。
コンサルティング
自分自身をクローニング、または書かれたリリースを署名した人、安全なゾーンです。
同意なしに実質的な人物をクローニングすることで、人格の権利、広報権、生体認証に関するクレームをトリガーできます。 — モデルライセンスから完全に独立した質問.
留学生のVerdict
使用すると 市販の清潔なライセンスが欲しい 48 kHz 出力品質、最小限のデータで自分の声で微調整し、簡単なローカル展開を〜8 GB VRAM.
詳しくはこちら お問い合わせ 2 B 変数 フットプリント(より遅い) IndexTTS2.5 そして、 OmniVoice)声のデザインの素晴らしい性質と — それは決定的な発電機ではなく、創造的なツールです。
ヘッド・ツー・ヘッドのデータに座るところ
| モデル | パラム | 中国語(簡体) WER / SS | スタッフ WER / SS | スペイン語 WER / SS |
|---|---|---|---|---|
| VoxCPM2 | 2 B | 3.88 / 74.99 | 5.13 / 71.57 | 5.49 / 74.67 |
| コージーボイス3-0.5B | 0.5 B | 3.84 / 80.01 | 4.88 / 74.16 | 4.04 / 78.85 |
| IndexTTS2.5-RL | 0.8 B | 3.93 / 77.92 | 3.89 / 67.79 | 3.33 / 76.68 |
| MOSS-TTS-v1.5 | 8 B | 4.02 / 72.68 | 4.45 / 67.46 | 3.83 / 71.75 |
| モデル | ログイン→お問い合わせ WER / SS | ログイン→ツイート WER / SS | ログイン→ログイン WER / SS |
|---|---|---|---|
| VoxCPM2 | 4.48 / 64.25 | 16.38 / 64.89 | 11.84 / 71.54 |
| OmniVoice | 3.74 / 64.91 | 5.84 / 62.08 | 9.09 / 69.06 |
| Qwen3-TTS | 5.74 / 63.04 | 5.15 / 68.02 | 36.09 / 65.71 |
| 仕様 | RTF | 利用規約 |
|---|---|---|
| VoxCPM2 (標準) | ~0.30 | RTX 4090 bf16の特長 |
| VoxCPM2 (ナノVLLM) | ~0.13 | 加速の後で |
| IndexTTS2.5 (参考) | 0.2065 | RTX 4090 bf16の特長 |
自分で実行する費用
| 仕様 | RTF | GPU-時間/Mの木 | オンデマンド RTX 4090 | オンデマンド A100 |
|---|---|---|---|---|
| VoxCPM2 (ナノVLLM) | ~0.13 | 2.3 h | ~$1.73 | ~$3.72 |
| VoxCPM2 (標準) | ~0.30 | 5.4 h | ~$4.00 | ~$8.59 |
ライセンスおよび開示ゲート
| アイテム | ステータス |
|---|---|
| コードライセンス | Apache-2.0 |
| 重量 免許証 | Apache-2.0 |
| 商用利用 | ✓ はい — このセットで唯一の完全にきれいなデュアルライセンス |
| デフォルトの透かし | なし (出力がAIの透かしを運ぶモデル・カードは明白に述べます) |
| あなたがしなければならないこと | あなたの管轄区域が開示義務を持っているら、AudioSeal、SynthIDまたはC2PAをあなた自身に加えて下さい(EU記事 50 / 中国深合成ルール/プラットフォームポリシー |
| コンテンツのモデレーション | モデルカードは生産等級の入力ろ過を提供しません;それはあなたにあります |
| データ残余 | 完全にオフラインで実行 |
そうでない場合は、
- 重いコンプライアンス圧力、デフォルトの透かしが必要です → チャットボックス (デフォルトで埋め込まれるAI、MIT、PerThを組み立てて下さい、 25 言語)
- 中国の感情的な性能と正確な持続期間 → IndexTTS2.5.
- 646 低リソース言語、非商用 → OmniVoice.
- CPUやエッジの非常に低いフットプリント → ココロ 82M (このセットの外側) Apache-2.0, ~2–3 GB、クローン無し)。
- トップ単元の中国類似性 → コージーボイス3-0.5B (ライセンスを最初にチェック)
VoxCPM2で制作を始めますか?
このエンジンを選択した状態でテキスト読み上げを開き、自分の音声モデルで制作を始められます。