オープンソースTTSモデル徹底解説 · 2026
05

VoxCPM2

モデルベスト/ OpenBMB / TsinghuaのHCSI · トークナイザーフリー · Apache-2.0 · 4月4日 2026

VoxCPM2 このセットの中で最も国際的にフレンドリーなモデルです。 Apache-2.0 コードと重量の両方の, 英語の文書をクリーンにし、共通する設計決定 TTS 問題。 お問い合わせ トークナイザーフリー — オーディオを離散トークンに定量化するのではなく、連続した空間で直接生成します。 合理:量子化は失われ、アクセント、感情的なマイクロダイナミクス、呼吸および一時リズムは正確にそれによって平らになる細部です。 モデルは 2 B ModelBestで構築されたパラメーター ミニCPM-4 バックボーン、訓練された 2M+ 営業時間 多言語対応のスピーチ

建築設計
ログイン → ツイート → ログイン → ログイン
バックボーン
ミニCPM-4, 2 B 合計:
語学学校
30 + 9 中国文字盤
オーディオVAE
可聴周波VAE V2 (16 kHz お問い合わせ → 48 kHz アウト)
LMトークンレート
6.25 Hz最高、 8192 トークン
VRAM
~8 GB
RTF (RTX 4090)
~0.30 / ~0.13 ナノVLLM
ライセンス
Apache-2.0 (商業OK)

4段アーキテクチャ

  • LocEnc(ローカルエンコーダ) — 入力テキストと参照オーディオから機能を抽出し、2つの言語モデルの調整を作成します。
  • TSLM(テキスト)–セマンティックLM — 「セマンティック・プランニング」: テキストを粗いスピーチ・セマンティクス表現にマップします。 コンテンツ境界とプロソディックフレームが決定されるところです。
  • RALM(残留音響LM) — TSLMの出力の上部に微細でグラインドされた音響モデリング: timbre、感情的な細部およびスピーカーの特徴はここに加えられます。
  • LocDiT(ローカル拡散トランス) — 流れ一致のローカル拡散は連続的な可聴周波潜水艦を、分解します作り出します オーディオVAE V2 お問い合わせ 48 kHz オーディオ。

AudioVAE V2は アシンメトリック: エンコーダは受け入れます 16 kHz デコダーが出ている間入力 48 kHz、造られる超決断と — 外部のアップサンプラーは必要ありません。 お問い合わせ 48 kHz 出力は、このグループの最高サンプルレートです。

4つの使用法モード

モードパスワードあなたを与えるもの
基本情報 TTSテキストのみ参照の音声無しおよび 言語タグなし — モデルは言語自体を検出します。 中国語をタイプして下さい、中国を得て下さい;タイをタイプして下さい、タイを得て下さい。
音声デザイン自然言語の説明括弧内の記述でテキストをプレフィックスするなど (young woman, warm and gentle voice). 参照オーディオなしで全く新しいボイスを作成します。
制御可能なクローニング参照の可聴周波+様式の指示ステアリング感情、ペース、デリバリー(もう少し速く、陽気なトーン)しながら、木材をクローンします。 木材ベースはそのままにとどまります。
究極のクローニングリファレンスオーディオ + そのトランスクリプトオーディオ継続スタイルクローニング — 参照は開口部セグメントになります。 最高の再生 アクセント、呼吸習慣および一時リズム. 同じクリップを両方に渡す reference_wav_path そして、 prompt_wav_path 類似性を最大化します。

コンテキストアウェア合成

見やすくなる機能:VOXCPMは、文字を音声に変換するのではなく、テキストを読み、適切な感情とプロセードを誘導します。 除外マークで終わる同じ文は、フルストップと異なるパッシング、エネルギー、ストレスを得ることができます。 スポーツの解説、引数と泣いたモノローグは、古い典型的なフラットな「安定的で感情のない」配信ではなく、自然なプロスディーで出てくる TTS. TSLMのセマンティックモデリングとMiniCPMから4 下のテキスト理解。

ベンチマーク

メトリックバリューインフォメーション
中国CER0.97%パブリック楕円セット
スタッフ WER1.84%パブリック楕円セット
RTF (RTX 4090)~0.30標準モード
RTF ナノVLLM~0.13低レイテンシーリアルタイムのアプローチ
VRAM~8 GBbf16の特長

種子の最先端または競争として報告TTS-eval、CV3-eval、指示して下さいTTSEvalとMiniMaxの多言語テスト。 洞窟:ほとんどの数字は自己報告されています。独立したサードパーティの再生は依然として制限されています。

語学学校

30 言語: アラビア語、ブルメス、中国語、デンマーク語、オランダ語、英語、フィンランド語、フランス語、ドイツ語、ギリシャ語、ヘブライ語、ヒンディー語、インドネシア語、イタリア語、日本語、クメール、韓国語、ラオス語、マレー語、マレー語、ポーランド語、ポルトガル語、ロシア語、スペイン語、スワヒリ語、スウェーデン語、タガログ語、タイ語、トルコ語、ベトナム語。

9 中国の方言: Sichuanese、広東、呉(上海)、北東、ヘナノン、陝西、山東、天津、ホッケーン。

ファインチューニング&展開

  • フル SFT と LoRA の微調整に対応 5–10 オーディオの数分 — LoRAは推奨パスです。 このグループでは、実用的なパーソナルボイストレーニングワークフローを文書化する唯一のモデルです。
  • 要件: Python ≥ 3.10, ピトーチ ≥ 2.5.0, キュダ ≥ 12.0. インストール pip install voxcpm.
  • ModelScope ダウンロードは、ハッギングフェイスが遅くなる地域のユーザーが利用できます。
  • 制作サービス ナノVLLM または vLLM-オムニ. ローカルWebデモ: python app.py --port 8808.
  • キーノブ: cfg_value (分類器なしの指導の強さ) — どのように密接な出力がプロンプトに付着するか) inference_timesteps (拡散ステップ;デフォルト 10 ほとんどの場合は良いです。
  • 生態系の牽引: 先月のダウンロード数 327k, 21 アダプター, 28 コミュニティの微調整と 10 抱擁面の量子化。

バージョン履歴

いつかバージョン変更内容
9月9日 2025ボークスCPM-0.5B初回リリース; ヒット #1 抱擁の顔のトレンド
12月12日 2025VoxCPM1。5 (~800 M)SFT + Loraファインチューニング、 44.1 kHz 出力, #1 お問い合わせ GitHub トレンド; spawned ComfyUI プラグイン、ONNX エクスポートと Rust 再導入
4月4日 2026VoxCPM2 (2 B)~2.5× パラメータ; 2 → 30 言語 + 9 ダイアレクト; 48 kHz 出力; 声の設計および制御可能なクローニングは加えました;AudioVAE V2
既知の制限(モデルカードから): 音声デザインとスタイルコントロールは、 — 生成 1–3 時を刻み、ベストを尽くします。 トレーニングデータの利用状況により、パフォーマンスは言語によって異なります。 非常に長くまたは非常に明白な入力は時折destabiliseできます。 生成されたオーディオには、 AIウォーターマークなしそのため、開示条件のある管轄区域で運用する場合(例) EU AI法)、独自のラベリングを追加する必要があります。 モデルは機密コンテンツをフィルタリングしません — 入力モデレーションはお客様の責任です。 偽り、詐欺、または伝染のために厳しく禁じられている。

ユースケース:ここに唯一のライセンスクリーニングオプション

スケナリオ実行方法詳しくはこちら
自衛隊、病院、金融展開完全にオフラインで実行するので、オーディオはネットワークを離れません。 48 kHz 外部のアップサンプリングなしで出力プラン6–8 生産までの週 — 下記の費用表をご覧ください
オンラインコースと多言語トレーニング30 言語プラス 9 中国語のダイアレクト、言語のタグは必要ありません欧州アクセシビリティ法は、調達期間へのアクセシビリティを向上しました — 詳しくはこちら
クリエイターボイスクローニングとパーソナルIPLoRAファインチューニング 5–10 オーディオの分は、あなたの木材を重量に焼く自分自身をクローニングするか、または解放された声が安全です。 実体をクローニングすると、人格権を上げます。
広告およびマーケティング A/B の変形バッチ生成 1つのスクリプトの多くの変形; 自己ホストされたときにマージンコストはゼロ近くですプラットフォームとFTC AI ラベルポリシーがきつく
高品質コンテンツ配信16 kHz 参照の音声はAudioVAE V2をまっすぐに通る 48 kHz 出力2B パラメータ — より遅い IndexTTS2.5
音声デザイン(音声参照なし)自然言語で性別、年齢、ピッチを記述し、新しい親友を作成します。出力は運びます ウォーターマークなし — 開示が必要な場所を自分で追加

自発的な展開:数学の仕組み

アイテム典型的な数字
生産までの時間、セルフホストボイススタック~6–8 週、キックオフ最初の生産コールへ
典型的なハードウェアASR + LLM、ストリーミング用L4用L40S TTS; 単一の二重GPU 箱のサフィス
暖かいエンドツーエンドレイテンシ~0.3 s (ローカル推論、パブリックインターネット往復なし)
コスト構造ホスト APIs €0.05–0.40 /分; セルフホスト固定コストから〜€800 / 月
ブレイクセブンふりがな 50,000 分 / 月 自己ホスティングの勝利; 以下は、データ sovereignty を購入します。

公表された生産成果(第三者の開示、参照のみ):

  • ヨーロッパのfintech: a 10× サポートを介した解決への時間短縮。
  • ティア1 ガルフテレコム: 接触ごとのコストダウン 58%; 81% 人間の手渡無しで前払いされた照会の原子格納容器;外出先のコレクションの平均ハンドルの時間 4.2 お問い合わせ 2.1 交通アクセス; AI処理されたコールのCSAT 4.3/5 に対して 4.1/5 humanのベースライン。

既設のアクセシビリティ: 右方向を取得する

WCAGはテキスト・ツー・スピーナを提供する必要はありません。 貴社のコンテンツは、補助的な技術利用者が正しく解析できるようにする必要があります。 すでに持ち込む — JAWS、NVDA、ボイスオーバー。 本当に機能するリードオードは、大規模なミドルグループです: ダイスレキア、低ビジョン、古いユーザー、第二言語リーダーと読者 — フルスクリーンの読者が、まだ長いテキストで苦労している人はほとんど役に立ちました。 コンプライアンスチェックボックスではなく、製品機能です。

  • トピックス 1.4.2: より多くのために自動再生するオーディオ 3 s環境は一時停止/停止制御を必要とします — 読み替えが必要 決してオートプレイ.
  • トピックス 2.1.1 / 2.4.7 / 2.4.11: すべての制御キーボード到達可能な、フォーカス可視、焦点は決して閉塞しません。
  • トピックス 3.1.1 / 3.1.2: 言語変更は明示的にマークする必要があります — エンジンの言葉で、SSML lang スイッチ。
  • トピックス 4.1.3: ARIA のライブ リージョンを使用しており、読み書きはフォームのエラーと読み込み状態に保ちます。
規則は歯を持っています — しかし、このモデルはここで最高の答えではありません。 欧州アクセシビリティ法は、6月からEUに販売する多くの企業に法的拘束力があります 2025, EUのデジタル教育コンテンツは、WCAGに会わなければなりません 2.2 AA。 しかし、 VoxCPM2 完全なSSMLサポートと単語レベルのタイムスタンプ(また、読み取りとハイライトの経験はありません)を欠いて、最初のオーディオをストリーミングするために最適化されていない。 実際の展開のために軽量 ココロ 82M (Apache-2.0, CPU 対応, ~2–3 GB)はよりよい適合です — ボイスクローニングのないトレードオフ。

クローニング:3つの規律

ソースオーディオ

レコード 10 s–5 クリーンなシングルスピーカーオーディオの最小:音楽のベッド、リバーブなし、第二の音声なし。

5–10 LoRAの微調整は重量にあなたの木材を焼くのに十分であり、実行する分散を削減します。

コンサルティング

1つの参照クリップ、1つの種子と1つのスタイルの指示をロックして、エピソードや問題は漂流しません。

ボイスデザインは素晴らしい — コミットする前に 1 つから 3 つの候補を生成します。

コンサルティング

自分自身をクローニング、または書かれたリリースを署名した人、安全なゾーンです。

同意なしに実質的な人物をクローニングすることで、人格の権利、広報権、生体認証に関するクレームをトリガーできます。 — モデルライセンスから完全に独立した質問.

留学生のVerdict

使用すると 市販の清潔なライセンスが欲しい 48 kHz 出力品質、最小限のデータで自分の声で微調整し、簡単なローカル展開を〜8 GB VRAM.

詳しくはこちら お問い合わせ 2 B 変数 フットプリント(より遅い) IndexTTS2.5 そして、 OmniVoice)声のデザインの素晴らしい性質と — それは決定的な発電機ではなく、創造的なツールです。

2 B パラム 30 用語集 トークナイザーフリー 48 kHz 出力 音声デザイン Apache-2.0 — 商用OK

ヘッド・ツー・ヘッドのデータに座るところ

モデルパラム中国語(簡体) WER / SSスタッフ WER / SSスペイン語 WER / SS
VoxCPM22 B3.88 / 74.995.13 / 71.575.49 / 74.67
コージーボイス3-0.5B0.5 B3.84 / 80.014.88 / 74.164.04 / 78.85
IndexTTS2.5-RL0.8 B3.93 / 77.923.89 / 67.793.33 / 76.68
MOSS-TTS-v1.58 B4.02 / 72.684.45 / 67.463.83 / 71.75
モデルログイン→お問い合わせ WER / SSログイン→ツイート WER / SSログイン→ログイン WER / SS
VoxCPM24.48 / 64.2516.38 / 64.8911.84 / 71.54
OmniVoice3.74 / 64.915.84 / 62.089.09 / 69.06
Qwen3-TTS5.74 / 63.045.15 / 68.0236.09 / 65.71
仕様RTF利用規約
VoxCPM2 (標準)~0.30RTX 4090 bf16の特長
VoxCPM2 (ナノVLLM)~0.13加速の後で
IndexTTS2.5 (参考)0.2065RTX 4090 bf16の特長
あなたが知っておくべき1つの弱点があります:zh→es クロス言語。 WER 16.38 — 明らかにセットの後ろに()OmniVoice 5.84, コージーボイス3 4.58). ワークフローが「中国語リファレンスクリップ」の場合 → スペインのdub、その番号は出力を破棄します。 英語のスピーカーの類似性に強いです (71.57, セットで最高) そして、 48 kHz 品質。 クロスリンガルトランスファーに強いものではありません。

自分で実行する費用

仕様RTFGPU-時間/Mの木オンデマンド RTX 4090オンデマンド A100
VoxCPM2 (ナノVLLM)~0.132.3 h~$1.73~$3.72
VoxCPM2 (標準)~0.305.4 h~$4.00~$8.59
セットの最低のオンデマンドの費用 ($1.73 1億文字) 1/35まで 1/100ツイート インフォメーション ElevenLabs v3. 同じ3つの現実が適用されます:現実世界 RTF 通常は 2–5× ペーパーより遅い;工学費用は通常超過します GPU 大きさの注文による請求書; アイドルストレージを忘れないでください — 重みを抱えるネットワークのボリュームは、あなたが推測するかどうかを請求します。 $35/month のための 500 GB. フルモデル 06.4.

ライセンスおよび開示ゲート

アイテムステータス
コードライセンスApache-2.0
重量 免許証Apache-2.0
商用利用✓ はい — このセットで唯一の完全にきれいなデュアルライセンス
デフォルトの透かしなし (出力がAIの透かしを運ぶモデル・カードは明白に述べます)
あなたがしなければならないことあなたの管轄区域が開示義務を持っているら、AudioSeal、SynthIDまたはC2PAをあなた自身に加えて下さい(EU記事 50 / 中国深合成ルール/プラットフォームポリシー
コンテンツのモデレーションモデルカードは生産等級の入力ろ過を提供しません;それはあなたにあります
データ残余完全にオフラインで実行
「クリーンライセンス」は「準拠」ではありません。 これらは2つの別々のゲートです:きれいなライセンス手段 このモデルを使う; 開示の遵守手段 出荷する音声は、AIが生成されるように検知可能. VoxCPM2 あなたを与える ゼロヘルプ 2 番目の — 透かしをはっきりと送らない。 Chatterbox (MIT), 対照的に, デフォルトでPerThウォーターマークを埋め込む. 職務のフルセット 06.5.

そうでない場合は、

  • 重いコンプライアンス圧力、デフォルトの透かしが必要です → チャットボックス (デフォルトで埋め込まれるAI、MIT、PerThを組み立てて下さい、 25 言語)
  • 中国の感情的な性能と正確な持続期間 → IndexTTS2.5.
  • 646 低リソース言語、非商用 → OmniVoice.
  • CPUやエッジの非常に低いフットプリント → ココロ 82M (このセットの外側) Apache-2.0, ~2–3 GB、クローン無し)。
  • トップ単元の中国類似性 → コージーボイス3-0.5B (ライセンスを最初にチェック)
BiliVoiceで試す

VoxCPM2で制作を始めますか?

このエンジンを選択した状態でテキスト読み上げを開き、自分の音声モデルで制作を始められます。