开源 TTS 模型深度解析 · 2026
05

VoxCPM2

最佳型号 / OpenBMB 清华HCSI · 无切除器 · Apache-2.0 · 农历四月 2026

VoxCPM2 是本集中最国际友好的模式: Apache-2.0 代码和重量,干净的英语文档, 和设计决定 回避一个常见的 TTS 问题。 没错 无标识器 — 它在连续空间中直接生成,而不是先将音频量化为离散的符号. 原理:量化是失落的,而口音,情感微动力,呼吸和暂停节奏正是被它扁平的细节. 这个模型是 2 B 参数,基于ModelBest的 迷你CPM - (英语).4 骨干,受过培训 2M+小时 讲多种语言。

建筑
LocEnc 设备 → 图解 → 罗马 → 密码
后骨头
迷你CPM - (英语).4, 2 B 共计
语文
30 + 9 汉语方言
音频 VAE
音频VAE V2(16 kHz 输入 → 48 kHz 输出)
LM 符号率
6.25 Hz最大点 8192 符号
VRAM
~8 GB
RTF (RTX 4090)
~0.30 / ~0.13 带有 Nano-VLLM 的
许可证
Apache-2.0 (商业OK)

四阶段建筑

  • LocEnc( 本地编码器) — 从输入文本和参考音频中提取特征,为两种语言模型产生条件.
  • TSLM (文本–语义LM). — "语义规划":将文字映射到粗糙的语义表达. 这就是决定内容界限和prosodic框架的地方.
  • RALM(响应声学LM) — 在 TSLM 输出的顶部添加了精细的纹理声学建模: 刻痕,情感细节和扬声器特性在此.
  • LocDIT( 本地扩散变换器) — 生成连续的音频潜伏,由流配对本地扩散 音频 V2 输入 48 kHz 音频

音频VAE V2是 不对称: 编码器接受 16 kHz 解码器发射时输入 48 kHz中,使用超分辨率构建 — 不需要外部检测器 那个 48 kHz 输出是这一组中最高的样本率。

四个使用模式

模式投入它给你什么
基础 TTS文本没有参考音频和 无语言标记 — 模型检测语言本身。 中文类型 中文类型 泰语类型 泰语类型
语音设计自然语言说明在括号中添加描述的文字前缀,例如: (young woman, warm and gentle voice). 创建一个没有参考音频的全新声音。
可控克隆引用音频 + 样式指令在引导情绪,节奏和交付的同时,将阴蒂切开("快一点,欢快的语气"). 坚硬的基座保持原状
最终克隆参考音频+记录音频连续样式克隆 — 参考部分成为开幕部分。 最佳复制方式 口音、呼吸习惯和暂停节奏. 将相同的片段传递给两个 reference_wav_path 和 prompt_wav_path 最大程度的相似性。

了解背景的综合

一个容易忽略的能力:VoxCPM读取文本,并推断出适当的情感和亲和,而不是机械地将字符转换成音频. 以感叹标记结束的句子与全站的句子会得到不同的速度,能量和压力. 体育评论、辩论和哭诉独白 自然而然的流露出来 而不是平坦的"稳定但无情感" 交付 典型的老 TTS. 这来自TSLM的语义模型和MiniCPM -4 其下为文字理解.

基准

度量衡数值页:1
中国CER0.97%公开的 eval 集
联合国 WER1.84%公开的 eval 集
RTF (RTX 4090)~0.30标准模式
RTF 带有 Nano-VLLM 的~0.13接近低纬度实时
VRAM~8 GB页:1

在种子上作为最先进的或有竞争力的...TTS- eval, CV3 - eval, 指令TTSEval和MiniMax多语言测试. 卡维特:大多数数字都是自报的;独立的第三方复制仍然有限.

语文

30 语言 : 阿拉伯语、缅甸语、中文、丹麦语、荷兰语、英语、芬兰语、法语、德语、希腊语、希伯来语、印地语、印度尼西亚语、意大利语、日语、高棉语、朝鲜语、老挝语、马来语、挪威语、波兰语、葡萄牙语、俄语、西班牙语、斯瓦希里语、瑞典语、塔加洛格语、泰语、土耳其语、越南语。

9 汉语方言: 四川话,广东话,吴语(上海话),东北话,河南话,陕西话,山东话,天津话,湖北话.

调整和部署

  • 完全 SFT 和 LORA 微调支持 5–10 音频分钟 — LORA是推荐的路径。 这是该组中唯一一个记录实用的个人语音培训工作流程的模式.
  • 要求: Python ≥ 3.10, 键盘 ≥ 2.5.0, 古巴 ≥ 12.0. 安装方式 pip install voxcpm.
  • modelScope下载为Hugging Face慢行地区的用户提供.
  • 生产通过 纳米-VLLM 或 vLLM-欧姆尼. 本地网络演示 : python app.py --port 8808.
  • 键键 : cfg_value (无分类制导强度) — 输出如何紧密地遵守提示)和 inference_timesteps (分散步骤;默认) 10 多数情况下罚款)。
  • 生态系统牵引力: 上个月下载 327k 次, 21 适配器, 28 社区微调 10 拥抱脸上的量化.

版本历史

何时版本变了
九月 2025VoxCPM - (英语).0.5B第一次发布;击中 #1 在拥抱的面部趋势
十二月(半天) 2025VoxCPM1 (英语).5 (~800 M)SFT + LoRA 微调, 44.1 kHz 输出, #1 打开 GitHub 趋势; 产出 ComfyUI 插件、 ONNX 输出和 Rust 重新执行
农历四月 2026VoxCPM2 (2 B)~2.5× 参数; 2 → 30 语言 + 9 方言; 48 kHz 输出; 添加语音设计和可控制克隆; AudioVAE V2
已知的局限性(从型号卡) : 语音设计与风格控制 — 生成 1–3 时间和选择最好的。 绩效因语言不同而异,取决于培训数据的可得性。 非常长或高度表达性的投入有时会破坏稳定。 生成的音频包含 无AI 水印因此,如果您在一个有披露要求的法域内运作(例如: 欧盟的AI法案),您必须加入自己的标签. 该模型不过滤敏感内容 — 输入节制是你的责任。 严禁冒充,诈骗或者造谣.

使用大小写: 这里唯一的许可证清理选项

假设如何运行它小心点
自办的公共部门、医院和财务部署全部下线 所以音频永远不要离开网络; 48 kHz 输出时没有外部检测计划~6–8 生产周数 — 参见下表
在线课程和多语种培训30 语言加 9 汉语方言,不需要语言标记《欧洲无障碍法》将无障碍化为采购术语 — 见下文
创建者语音克隆和个人IPLoRA 微调 5–10 几分钟的音响 让你的胸肌进入重量克隆自己或释放的声音是安全的;克隆一个真正的人会产生人格权利,这是与许可证不同的问题
广告和营销A/B变体批量生成一个脚本的许多变体; 自托管时边际成本接近零平台和公平贸易委员会AI标签政策正在收紧
提供高诚信内容16 kHz 参考音频通过 AudioVAE V2 直接到 48 kHz 产出2B 参数 — 慢于 IndexTTS2.5
语音设计( 无参考音频)用自然语言描述性别、年龄和音调,以创造新的调子输出载运 无水印 — 在需要披露的地方添加自己的

自备部署:数学如何工作

项目典型数字
制作时间, 自主机语音堆栈~6–8 数周后,开始第一次制作
典型硬件L40S 用于 ASR + LLM, L4 用于流线 TTS; 单一的双重GPU 框已足够
温暖的端到端间隔~0.3 s (当地推论,无公网往返).
费用结构托管 APIs €0.05–0.40 /分钟; 由 ~ 自动托管的固定费用€800 月数
双向断面从大概 50,000 分钟 / 月份 自动托管获胜; 低于此值您正在购买数据主权, 而不是节省

公开报告的生产结果(第三方披露,仅供参考):

  • 欧洲风琴技术: a 10× 减少解决所有支助的平均值。
  • 一级...1 海湾电信: 每次接触费用减少 58%; 81% 控制预付的询问,不进行人手交割; 压缩外部收款的平均处理时间 4.2 改为 2.1 分钟; AI处理的电话上的CSAT 4.3/5 反对: 4.1/5 human基线。

阅读- 音频无障碍: 方向正确

WCAG 不要求您提供文字对语音。 它要求您的内容由辅助技术用户正确解析 已经带来了 — JAWS,NVDA,声音over。 真正的服务是大中间组: 阅读者有阅读障碍、视力低、使用者老、第二语言的读者。 — 满屏的读者对人们的服务很差, 这是一个产品特性,而不是一个遵守的复选框。

  • 常设委员会 1.4.2: 自动播放超过 3 sEconds 需要暂停/停止控制 — 所以必须读出 从不自动播放.
  • 常设委员会 2.1.1 / 2.4.7 / 2.4.11: 每个控件键盘可以接触,焦点可见,焦点从不模糊.
  • 常设委员会 3.1.1 / 3.1.2: 语言变化必须明确标记 — 以引擎表示, SSML lang 切换。
  • 常设委员会 4.1.3: 使用 ARIA 直播区域,所以读阿卢德 总是有格式错误和加载状态。
条例有牙齿 — 但这个模型不是最好的答案 《欧洲无障碍法》自6月以来对许多向欧盟出售的企业具有法律约束力。 2025, 和欧盟的数字教育内容必须满足WCAG的要求 2.2 亚军 AA. 不过 VoxCPM2 缺乏完整的SSML支持和词级时间戳(因此没有读取和高亮体验),没有优化流传第一音频. 为了真正的部署 轻量级 科科罗 82M (Apache-2.0, CPU 能力, ~2–3 GB更合适吗? — 权衡的不是语音克隆

克隆:三项纪律规则

源音频

记录 10 s–5 分钟干净的单声道音:没有音乐床,没有回声,没有第二声.

5–10 分钟足够LORA微调 将你的胸骨烤成重量 并减少运行中的差异

一致性

锁定一个参考片段,一个种子和一个风格指示,所以片段和发行永远不会漂移.

语音设计很诡异 — 在您承诺前, 生成一至三名候选人。

同意

克隆自己,或签署书面释放书的人,是安全区.

未经同意而将真实人克隆,可引发人格权、公示权和生物鉴别-隐私索赔 — 与许可证范本完全分开的问题.

对国际用户的判决

如果 你想要商业清洁的执照, 48 kHz 输出质量,微调您自己的声音,以最小的数据, 直接本地部署在~8 GB VRAM.

小心点 联合国 2 B 参数脚印( 低于 IndexTTS2.5 和 OmniVoice)和语音设计的特点 — 这是一个创造性的工具,而不是一个决定性的生成器。

2 B 段落 30 语言 无切除器 48 kHz 产出 语音设计 Apache-2.0 — 广告确定

在头对头数据中的位置

型号参数中文 WER / 党卫军联合国 WER / 党卫军西班牙语 WER / 党卫军
VoxCPM22 B3.88 / 74.995.13 / 71.575.49 / 74.67
CosyVoice3 - (英语).0.5B0.5 B3.84 / 80.014.88 / 74.164.04 / 78.85
IndexTTS2.5-RL0.8 B3.93 / 77.923.89 / 67.793.33 / 76.68
MOSS-TTS-v1.58 B4.02 / 72.684.45 / 67.463.83 / 71.75
型号日语→内 WER / 党卫军日语→对 WER / 党卫军日语→对 WER / 党卫军
VoxCPM24.48 / 64.2516.38 / 64.8911.84 / 71.54
OmniVoice3.74 / 64.915.84 / 62.089.09 / 69.06
Quen3 - (英语).TTS5.74 / 63.045.15 / 68.0236.09 / 65.71
配置RTF条件
VoxCPM2 (标准)~0.30RTX 4090 页:1
VoxCPM2 (诺-VLLM)~0.13加速后
IndexTTS2.5 (参考)0.2065RTX 4090 页:1
有个弱点你必须知道:→说跨语言 WER 16.38 — 明显地在一组后面(OmniVoice 5.84, 声音 3 4.58). 如果你的工作流程是"中国参考短片" → 西班牙杜布,这个数字会破坏输出 对英语的相似性来说很强烈 (71.57, 最佳组合) 继续 48 kHz 质量。 它不强于跨语言的转移。

自己跑起来要花多少钱

配置RTFGPU-小时/M字符点播 RTX 4090点播 A100
VoxCPM2 (诺-VLLM)~0.132.3 h~$1.73~$3.72
VoxCPM2 (标准)~0.305.4 h~$4.00~$8.59
一套中最低的按需费用 ($1.73 每百万个字符),约 1/35转到 1/100编号 页:1 ElevenLabs v3. 同样的三种现实:现实世界 RTF 通常为 2–5× 慢于纸张; 工程成本通常超过 GPU 帐单按数量顺序排列; 不要忘记闲置存储 — 网络体积 持有权重 账单,无论你是否推断,关于 $35月数 500 GB. 完整的模型在 06.4.

许可证和披露门

项目状态
代码许可证Apache-2.0
重量许可证Apache-2.0
商业用途对 — 本套中唯一完全干净的双重许可证
默认水印无 (模型卡上写明输出没有AI水印)
你必须做的如果司法管辖区有披露义务,则自己添加音频Seal、合成ID或C2PA(欧盟条款) 50 /中国深交规/平台政策).
内容节制型号卡片表示不提供生产级输入过滤;这是在您身上
数据居住全部下线运行
"清洁许可证"不"合规". 这是两个独立的大门: 一个干净的许可证意味着 您可以使用此模型; 遵守披露意味着 您所携带的音频必须是 AI 生成的. VoxCPM2 给你 零帮助 在第二个 — 它显然没有水印。 Chatterbox (MIT) 与此相对照,默认情况下会嵌入一个 PerTH 水印. 全套职责 06.5.

如果没有这个,那么什么

  • 严重合规压力,需要默认水印 → 聊天盒 (Resemble AI, MIT, PerTH 默认嵌入, 25 语言)。
  • 中国情感表演加精确持续时间 → IndexTTS2.5.
  • 646 低资源语言,非商业性 → OmniVoice.
  • CPU或边缘的足迹非常低 → 科科罗 82M (在本集之外, Apache-2.0, ~2–3 GB(没有克隆)
  • 顶端单一语言的汉语相似性 → CosyVoice3 - (英语).0.5B (先检查其执照).
在 BiliVoice 上试用

准备好使用 VoxCPM2 创作了吗?

打开文字转语音并自动选中此引擎,即可使用你自己的声音模型开始创作。