VoxCPM2
最佳型号 / OpenBMB 清华HCSI · 无切除器 · Apache-2.0 · 农历四月 2026
VoxCPM2 是本集中最国际友好的模式: Apache-2.0 代码和重量,干净的英语文档, 和设计决定 回避一个常见的 TTS 问题。 没错 无标识器 — 它在连续空间中直接生成,而不是先将音频量化为离散的符号. 原理:量化是失落的,而口音,情感微动力,呼吸和暂停节奏正是被它扁平的细节. 这个模型是 2 B 参数,基于ModelBest的 迷你CPM - (英语).4 骨干,受过培训 2M+小时 讲多种语言。
- 建筑
- LocEnc 设备 → 图解 → 罗马 → 密码
- 后骨头
- 迷你CPM - (英语).4, 2 B 共计
- 语文
- 30 + 9 汉语方言
- 音频 VAE
- 音频VAE V2(16 kHz 输入 → 48 kHz 输出)
- LM 符号率
- 6.25 Hz最大点 8192 符号
- VRAM
- ~8 GB
- RTF (RTX 4090)
- ~0.30 / ~0.13 带有 Nano-VLLM 的
- 许可证
- Apache-2.0 (商业OK)
四阶段建筑
- LocEnc( 本地编码器) — 从输入文本和参考音频中提取特征,为两种语言模型产生条件.
- TSLM (文本–语义LM). — "语义规划":将文字映射到粗糙的语义表达. 这就是决定内容界限和prosodic框架的地方.
- RALM(响应声学LM) — 在 TSLM 输出的顶部添加了精细的纹理声学建模: 刻痕,情感细节和扬声器特性在此.
- LocDIT( 本地扩散变换器) — 生成连续的音频潜伏,由流配对本地扩散 音频 V2 输入 48 kHz 音频
音频VAE V2是 不对称: 编码器接受 16 kHz 解码器发射时输入 48 kHz中,使用超分辨率构建 — 不需要外部检测器 那个 48 kHz 输出是这一组中最高的样本率。
四个使用模式
| 模式 | 投入 | 它给你什么 |
|---|---|---|
| 基础 TTS | 文本 | 没有参考音频和 无语言标记 — 模型检测语言本身。 中文类型 中文类型 泰语类型 泰语类型 |
| 语音设计 | 自然语言说明 | 在括号中添加描述的文字前缀,例如: (young woman, warm and gentle voice). 创建一个没有参考音频的全新声音。 |
| 可控克隆 | 引用音频 + 样式指令 | 在引导情绪,节奏和交付的同时,将阴蒂切开("快一点,欢快的语气"). 坚硬的基座保持原状 |
| 最终克隆 | 参考音频+记录 | 音频连续样式克隆 — 参考部分成为开幕部分。 最佳复制方式 口音、呼吸习惯和暂停节奏. 将相同的片段传递给两个 reference_wav_path 和 prompt_wav_path 最大程度的相似性。 |
了解背景的综合
一个容易忽略的能力:VoxCPM读取文本,并推断出适当的情感和亲和,而不是机械地将字符转换成音频. 以感叹标记结束的句子与全站的句子会得到不同的速度,能量和压力. 体育评论、辩论和哭诉独白 自然而然的流露出来 而不是平坦的"稳定但无情感" 交付 典型的老 TTS. 这来自TSLM的语义模型和MiniCPM -4 其下为文字理解.
基准
| 度量衡 | 数值 | 页:1 |
|---|---|---|
| 中国CER | 0.97% | 公开的 eval 集 |
| 联合国 WER | 1.84% | 公开的 eval 集 |
| RTF (RTX 4090) | ~0.30 | 标准模式 |
| RTF 带有 Nano-VLLM 的 | ~0.13 | 接近低纬度实时 |
| VRAM | ~8 GB | 页:1 |
在种子上作为最先进的或有竞争力的...TTS- eval, CV3 - eval, 指令TTSEval和MiniMax多语言测试. 卡维特:大多数数字都是自报的;独立的第三方复制仍然有限.
语文
30 语言 : 阿拉伯语、缅甸语、中文、丹麦语、荷兰语、英语、芬兰语、法语、德语、希腊语、希伯来语、印地语、印度尼西亚语、意大利语、日语、高棉语、朝鲜语、老挝语、马来语、挪威语、波兰语、葡萄牙语、俄语、西班牙语、斯瓦希里语、瑞典语、塔加洛格语、泰语、土耳其语、越南语。
9 汉语方言: 四川话,广东话,吴语(上海话),东北话,河南话,陕西话,山东话,天津话,湖北话.
调整和部署
- 完全 SFT 和 LORA 微调支持 5–10 音频分钟 — LORA是推荐的路径。 这是该组中唯一一个记录实用的个人语音培训工作流程的模式.
- 要求: Python ≥ 3.10, 键盘 ≥ 2.5.0, 古巴 ≥ 12.0. 安装方式
pip install voxcpm. - modelScope下载为Hugging Face慢行地区的用户提供.
- 生产通过 纳米-VLLM 或 vLLM-欧姆尼. 本地网络演示 :
python app.py --port 8808. - 键键 :
cfg_value(无分类制导强度) — 输出如何紧密地遵守提示)和inference_timesteps(分散步骤;默认) 10 多数情况下罚款)。 - 生态系统牵引力: 上个月下载 327k 次, 21 适配器, 28 社区微调 10 拥抱脸上的量化.
版本历史
| 何时 | 版本 | 变了 |
|---|---|---|
| 九月 2025 | VoxCPM - (英语).0.5B | 第一次发布;击中 #1 在拥抱的面部趋势 |
| 十二月(半天) 2025 | VoxCPM1 (英语).5 (~800 M) | SFT + LoRA 微调, 44.1 kHz 输出, #1 打开 GitHub 趋势; 产出 ComfyUI 插件、 ONNX 输出和 Rust 重新执行 |
| 农历四月 2026 | VoxCPM2 (2 B) | ~2.5× 参数; 2 → 30 语言 + 9 方言; 48 kHz 输出; 添加语音设计和可控制克隆; AudioVAE V2 |
使用大小写: 这里唯一的许可证清理选项
| 假设 | 如何运行它 | 小心点 |
|---|---|---|
| 自办的公共部门、医院和财务部署 | 全部下线 所以音频永远不要离开网络; 48 kHz 输出时没有外部检测 | 计划~6–8 生产周数 — 参见下表 |
| 在线课程和多语种培训 | 30 语言加 9 汉语方言,不需要语言标记 | 《欧洲无障碍法》将无障碍化为采购术语 — 见下文 |
| 创建者语音克隆和个人IP | LoRA 微调 5–10 几分钟的音响 让你的胸肌进入重量 | 克隆自己或释放的声音是安全的;克隆一个真正的人会产生人格权利,这是与许可证不同的问题 |
| 广告和营销A/B变体 | 批量生成一个脚本的许多变体; 自托管时边际成本接近零 | 平台和公平贸易委员会AI标签政策正在收紧 |
| 提供高诚信内容 | 16 kHz 参考音频通过 AudioVAE V2 直接到 48 kHz 产出 | 2B 参数 — 慢于 IndexTTS2.5 |
| 语音设计( 无参考音频) | 用自然语言描述性别、年龄和音调,以创造新的调子 | 输出载运 无水印 — 在需要披露的地方添加自己的 |
自备部署:数学如何工作
| 项目 | 典型数字 |
|---|---|
| 制作时间, 自主机语音堆栈 | ~6–8 数周后,开始第一次制作 |
| 典型硬件 | L40S 用于 ASR + LLM, L4 用于流线 TTS; 单一的双重GPU 框已足够 |
| 温暖的端到端间隔 | ~0.3 s (当地推论,无公网往返). |
| 费用结构 | 托管 APIs €0.05–0.40 /分钟; 由 ~ 自动托管的固定费用€800 月数 |
| 双向断面 | 从大概 50,000 分钟 / 月份 自动托管获胜; 低于此值您正在购买数据主权, 而不是节省 |
公开报告的生产结果(第三方披露,仅供参考):
- 欧洲风琴技术: a 10× 减少解决所有支助的平均值。
- 一级...1 海湾电信: 每次接触费用减少 58%; 81% 控制预付的询问,不进行人手交割; 压缩外部收款的平均处理时间 4.2 改为 2.1 分钟; AI处理的电话上的CSAT 4.3/5 反对: 4.1/5 human基线。
阅读- 音频无障碍: 方向正确
WCAG 不要求您提供文字对语音。 它要求您的内容由辅助技术用户正确解析 已经带来了 — JAWS,NVDA,声音over。 真正的服务是大中间组: 阅读者有阅读障碍、视力低、使用者老、第二语言的读者。 — 满屏的读者对人们的服务很差, 这是一个产品特性,而不是一个遵守的复选框。
- 常设委员会 1.4.2: 自动播放超过 3 sEconds 需要暂停/停止控制 — 所以必须读出 从不自动播放.
- 常设委员会 2.1.1 / 2.4.7 / 2.4.11: 每个控件键盘可以接触,焦点可见,焦点从不模糊.
- 常设委员会 3.1.1 / 3.1.2: 语言变化必须明确标记 — 以引擎表示, SSML
lang切换。 - 常设委员会 4.1.3: 使用 ARIA 直播区域,所以读阿卢德 总是有格式错误和加载状态。
克隆:三项纪律规则
源音频
记录 10 s–5 分钟干净的单声道音:没有音乐床,没有回声,没有第二声.
5–10 分钟足够LORA微调 将你的胸骨烤成重量 并减少运行中的差异
一致性
锁定一个参考片段,一个种子和一个风格指示,所以片段和发行永远不会漂移.
语音设计很诡异 — 在您承诺前, 生成一至三名候选人。
同意
克隆自己,或签署书面释放书的人,是安全区.
未经同意而将真实人克隆,可引发人格权、公示权和生物鉴别-隐私索赔 — 与许可证范本完全分开的问题.
对国际用户的判决
如果 你想要商业清洁的执照, 48 kHz 输出质量,微调您自己的声音,以最小的数据, 直接本地部署在~8 GB VRAM.
小心点 联合国 2 B 参数脚印( 低于 IndexTTS2.5 和 OmniVoice)和语音设计的特点 — 这是一个创造性的工具,而不是一个决定性的生成器。
在头对头数据中的位置
| 型号 | 参数 | 中文 WER / 党卫军 | 联合国 WER / 党卫军 | 西班牙语 WER / 党卫军 |
|---|---|---|---|---|
| VoxCPM2 | 2 B | 3.88 / 74.99 | 5.13 / 71.57 | 5.49 / 74.67 |
| CosyVoice3 - (英语).0.5B | 0.5 B | 3.84 / 80.01 | 4.88 / 74.16 | 4.04 / 78.85 |
| IndexTTS2.5-RL | 0.8 B | 3.93 / 77.92 | 3.89 / 67.79 | 3.33 / 76.68 |
| MOSS-TTS-v1.5 | 8 B | 4.02 / 72.68 | 4.45 / 67.46 | 3.83 / 71.75 |
| 型号 | 日语→内 WER / 党卫军 | 日语→对 WER / 党卫军 | 日语→对 WER / 党卫军 |
|---|---|---|---|
| VoxCPM2 | 4.48 / 64.25 | 16.38 / 64.89 | 11.84 / 71.54 |
| OmniVoice | 3.74 / 64.91 | 5.84 / 62.08 | 9.09 / 69.06 |
| Quen3 - (英语).TTS | 5.74 / 63.04 | 5.15 / 68.02 | 36.09 / 65.71 |
| 配置 | RTF | 条件 |
|---|---|---|
| VoxCPM2 (标准) | ~0.30 | RTX 4090 页:1 |
| VoxCPM2 (诺-VLLM) | ~0.13 | 加速后 |
| IndexTTS2.5 (参考) | 0.2065 | RTX 4090 页:1 |
自己跑起来要花多少钱
| 配置 | RTF | GPU-小时/M字符 | 点播 RTX 4090 | 点播 A100 |
|---|---|---|---|---|
| VoxCPM2 (诺-VLLM) | ~0.13 | 2.3 h | ~$1.73 | ~$3.72 |
| VoxCPM2 (标准) | ~0.30 | 5.4 h | ~$4.00 | ~$8.59 |
许可证和披露门
| 项目 | 状态 |
|---|---|
| 代码许可证 | Apache-2.0 |
| 重量许可证 | Apache-2.0 |
| 商业用途 | 对 — 本套中唯一完全干净的双重许可证 |
| 默认水印 | 无 (模型卡上写明输出没有AI水印) |
| 你必须做的 | 如果司法管辖区有披露义务,则自己添加音频Seal、合成ID或C2PA(欧盟条款) 50 /中国深交规/平台政策). |
| 内容节制 | 型号卡片表示不提供生产级输入过滤;这是在您身上 |
| 数据居住 | 全部下线运行 |
如果没有这个,那么什么
- 严重合规压力,需要默认水印 → 聊天盒 (Resemble AI, MIT, PerTH 默认嵌入, 25 语言)。
- 中国情感表演加精确持续时间 → IndexTTS2.5.
- 646 低资源语言,非商业性 → OmniVoice.
- CPU或边缘的足迹非常低 → 科科罗 82M (在本集之外, Apache-2.0, ~2–3 GB(没有克隆)
- 顶端单一语言的汉语相似性 → CosyVoice3 - (英语).0.5B (先检查其执照).
准备好使用 VoxCPM2 创作了吗?
打开文字转语音并自动选中此引擎,即可使用你自己的声音模型开始创作。