VoxCPM2
ModeloBest / OpenBMB / Tsinghua HCSI · Tokenizer-free · Apache-2.0 · Apr 2026
VoxCPM2 es el modelo más amigable internacional en este conjunto: Apache-2.0 para código y pesos, documentación inglesa limpia, y una decisión de diseño que se une a un común TTS problema. Es tokenizer-free — genera directamente en espacio continuo en lugar de cuantificar el audio en tokens discretas primero. La lógica: la cuantificación es perjudicial, y el acento, microdinámica emocional, respiración y ritmo de pausa son exactamente los detalles que se aplanan por él. El modelo es 2 B parámetros, construidos en ModelBest MiniCPM-4 columna vertebral, entrenada en 2M+ horas de discurso multilingüe.
- Arquitectura
- LocEnc → TSLM → RALM → LocDiT
- Backbone
- MiniCPM-4, 2 B total
- Idiomas
- 30 + 9 dialectos chinos
- Audio VAE
- AudioVAE V216 kHz dentro → 48 kHz fuera)
- Tasa de token LM
- 6.25 Hz, max 8192 tokens
- VRAM
- ~8 GB
- RTF (RTX 4090)
- ~0.30 / ~0.13 con Nano-VLLM
- Licencia
- Apache-2.0 (bien comercial)
La arquitectura de cuatro etapas
- LocEnc (Encoder Local) — extractos características de texto de entrada y audio de referencia, produciendo acondicionamiento para los dos modelos de lenguaje.
- TSLM (Text–Semántica LM) — "planificación semántica": mapas de texto a una representación habla-semántica gruesa. Aquí es donde se deciden los límites de contenido y el marco prosódico.
- RALM (Residual Acoustic LM) — modelado acústico más fino en la parte superior de la salida del TSLM: detalle timbre, emocional y características de altavoz se añaden aquí.
- LocDiT ( Transformador de Difusión Local) — difusión local que combina el flujo produciendo latentes de audio continuos, decodificados por AudioVAE V2 en 48 kHz audio.
AudioVAE V2 es asimétrica: el encoder acepta 16 kHz entrada mientras el decodificador emite 48 kHz, con super-resolución construida en — No se necesita un promotor externo. Que 48 kHz La salida es la tasa de muestra más alta de este grupo.
Cuatro modos de uso
| Modo | Input | Lo que te da |
|---|---|---|
| Básica TTS | Texto sólo | Sin audio de referencia y no idioma tag — el modelo detecta el propio lenguaje. Tipo chino, conseguir chino; tipo tailandés, conseguir tailandés. |
| Diseño de voz | Descripción del lenguaje natural | Prefijo el texto con una descripción entre paréntesis, por ejemplo. (young woman, warm and gentle voice). Crea una voz totalmente nueva sin audio de referencia. |
| Cierre controlable | Referencia audio + instrucción estilo | Cierre el timbre mientras conduce emoción, ritmo y entrega ("un poco más rápido, alegre tono"). La base de timbre permanece intacta. |
| Cierre final | Audio de referencia + su transcripción | clonación de estilo de continuidad de audio — la referencia se convierte en el segmento de apertura. Mejor reproducción de acento, hábitos respiratorios y ritmo de pausa. Pasando el mismo clip a ambos reference_wav_path y prompt_wav_path maximiza la similitud. |
Síntesis de análisis de contexto
Una capacidad que es fácil de pasar por alto: VoxCPM lee el texto e infiere emoción y prosodio adecuados en lugar de convertir mecánicamente caracteres a audio. La misma frase que termina en una marca de exclamación contra una parada completa conseguirá diferentes pacing, energía y estrés. Comentarios deportivos, argumentos y monólogos llorones salen con prosodia natural en lugar de la entrega plana "estable pero sin emoción" típica de los mayores TTS. Esto viene del modelado semántico del TSLM y el MiniCPM-4 comprensión de texto debajo de él.
Criterios
| métrica | Valor | Notas |
|---|---|---|
| RCE chino | 0.97% | Public eval set |
| Inglés WER | 1.84% | Public eval set |
| RTF (RTX 4090) | ~0.30 | Modo estándar |
| RTF con Nano-VLLM | ~0.13 | Aproximación a tiempo real de baja latencia |
| VRAM | ~8 GB | bf16 |
Reported as state-the-art or competitive on Seed-TTS-eval, CV3-eval, InstruccionesTTSEval y la prueba multilingüe MiniMax. Caveat: la mayoría de los números son auto-reportados; las reproducciones independientes de terceros todavía son limitadas.
Idiomas
30 idiomas: Árabe, Birmania, chino, danés, holandés, inglés, finlandés, francés, alemán, griego, hebreo, hindi, indonesio, italiano, japonés, khmer, coreano, lao, malayo, noruego, polaco, portugués, ruso, swahili, sueco, Tagalog, tailandés, turco, vietnamita.
9 dialectos chinos: Sichuanese, Cantonés, Wu (Shanghainese), Nororiental, Henanese, Shaanxi, Shandong, Tianjin, Hokkien.
Despliegue de ajuste fino
- Full SFT y LoRA ajuste fino apoyado con tan poco como 5–10 minutos de audio — LoRA es el camino recomendado. Este es el único modelo en este grupo que documenta un flujo práctico de trabajo de formación personal.
- Requisitos: Pitón ≥ 3.10, PyTorch ≥ 2.5.0, CUDA ≥ 12.0. Instalar con
pip install voxcpm. - ModelScope descarga está disponible para usuarios en regiones donde Hugging Face es lento.
- Producción a través de Nano-VLLM o vLLM-Omni. Demo local web:
python app.py --port 8808. - Canciones clave:
cfg_value(fuerza de orientación sin clasificar — cómo la producción se adhiere de cerca al impulso) yinference_timesteps(pasos de diffusión; por defecto 10 está bien para la mayoría de los casos). - Ecosystem traction: 327k descargas en el último mes, 21 adaptadores, 28 comunidades de fin de estudios y 10 quantizaciones en Hugging Face.
Historia de la versión
| Cuando | Versión | ¿Qué cambió? |
|---|---|---|
| Sep 2025 | VoxCPM-0.5B | Primer lanzamiento; golpe #1 on Hugging Face Trending |
| Dec 2025 | VoxCPM1.5 (~800 M) | SFT + LoRA de ajuste fino, 44.1 kHz salida, #1 on GitHub Tendencia; los plugins de ComfyUI, las exportaciones ONNX y una reimplementación de Rust |
| Apr 2026 | VoxCPM2 (2 B) | ~2.5× parámetros; 2 → 30 idiomas 9 dialectos; 48 kHz producto; Diseño de voz y cierre regulable añadido; AudioVAE V2 |
Casos de uso: la única opción de limpieza de licencias aquí
| Escenario | Cómo ejecutarlo | Cuidado. |
|---|---|---|
| Sector público, hospital y despliegue financiero autónomo | Corre completamente fuera de línea así que el audio nunca deja la red; 48 kHz salida sin aumento externo | Plan ~6–8 semanas para la producción — véase el cuadro de gastos que figura a continuación |
| Cursos en línea y formación multilingüe | 30 idiomas 9 dialectos chinos, sin necesidad de etiquetas de lenguaje | La Ley de Accesibilidad Europea ha convertido la accesibilidad en un plazo de contratación pública — véase infra |
| clonación de voz de creador y IP personal | LoRA de buen nivel 5–10 minutos de audio hornea su timbre en los pesos | Cierre usted mismo o una voz liberada es segura; la clonación de una persona real aumenta los derechos de personalidad, una pregunta separada de la licencia |
| Variantes de Ad y Marketing A/B | Batch-generar muchas variantes de un script; costo marginal está cerca de cero cuando auto-anfitriona | Las políticas de etiquetado de la plataforma y la FTC son más estrictas |
| Entrega de contenidos de alta fidelidad | 16 kHz audio de referencia pasa por AudioVAE V2 directo a 48 kHz Producto | 2B parámetros — más lento que IndexTTS2.5 |
| Diseño de voz (sin audio de referencia) | Describir género, edad y campo en lenguaje natural para crear un nuevo timbre | La producción lleva sin marca de agua — añadir su propio donde se requiere la divulgación |
Implementación autoanfitriona: cómo funcionan las matemáticas
| Tema | Figura típica |
|---|---|
| Hora de la producción, pila de voz auto-anfitriona | ~6–8 semanas, lanzamiento a la primera llamada de producción |
| Herraje típico | L40S para ASR + LLM, L4 para streaming TTS; un solo dual-GPU caja suficiente |
| Latencia de final a fin | ~0.3 s (inferencia local, ningún viaje de internet público) |
| Estructura de costos | Hosted APIs €0.05–0.40 / minuto; auto hospedado costo fijo de ~€800 / mes |
| Break-even | De aproximadamente 50,000 minutos / mes de auto-anfitriona gana; debajo de que usted está comprando la soberanía de datos, no ahorro |
Resultados de producción publicados (divulgaciones de terceros, solo como referencia):
- Un fintech europeo: a 10× reducción del tiempo medio para resolver todo el apoyo.
- Un tier...1 Gulf Telecom: costo por contacto abajo 58%; 81% contención en las investigaciones prepagadas sin entrega humana; tiempo de mango medio en las colecciones externas comprimidos 4.2 a 2.1 minutos; CSAT sobre las llamadas a mano de inteligencia artificial 4.3/5 contra 4.1/5 hUman basal.
Accesibilidad de lectura en voz alta: obtener la dirección correcta
WCAG no requiere que usted proporcione texto a palabra. Requiere que su contenido sea parseable correctamente por los usuarios de tecnología de asistencia ya traen — JAWS, NVDA, VoiceOver. Lo que lee-aloud realmente sirve es el gran grupo medio: lectores con dislexia, baja visión, usuarios mayores, lectores de segundo idioma — gente pobremente servida por un lector de pantalla completa pero todavía luchando con texto largo. Es una característica del producto, no una casilla de verificación de cumplimiento.
- SC 1.4.2: audio que autoplays para más que 3 seconds necesita un control de pausa/parada — por lo tanto, debe decir: nunca autojuego.
- SC 2.1.1 / 2.4.7 / 2.4.11: cada teclado de control accesible, enfoque visible, foco nunca obscurado.
- SC 3.1.1 / 3.1.2: los cambios de idioma deben marcarse explícitamente — en términos del motor, SSML
langcambiando. - SC 4.1.3: utilizar las regiones vivas de ARIA así que read-aloud se mantiene al día con errores de forma y estados de carga.
Clausura: tres reglas de disciplina
Audio fuente
Record 10 s–5 min of clean single-speaker audio: sin cama de música, sin reverbio, sin segunda voz.
5–10 minutos es suficiente para el ajuste de LoRA para hornear tu timbre en los pesos y reducir la varianza de correr a correr.
Consistencia
Cierre un clip de referencia, una semilla y una instrucción de estilo así que episodios y problemas nunca se derivan.
Diseño de voz es estocástico — generar uno a tres candidatos antes de comprometerse.
Consentimiento
Cierre usted mismo, o alguien que firmó una liberación escrita, es la zona segura.
Cierre de una persona real sin consentimiento puede desencadenar derechos de personalidad, derechos de publicidad y reclamaciones de privilegio biométrico — una pregunta completamente separada de la licencia modelo.
Veredicto para usuarios internacionales
Uselo si quieres una licencia comercialmente limpia, 48 kHz calidad de salida, ajuste en su propia voz con datos mínimos, y un despliegue local directo en ~8 GB VRAM.
Cuidado. el 2 B Parámetro (más bajo que IndexTTS2.5 y OmniVoice) y la naturaleza estocástica de Diseño de Voz — es una herramienta creativa, no un generador determinista.
Donde se sienta en los datos cabeza a cabeza
| Modelo | Params | Chino WER / SS | Inglés WER / SS | Español WER / SS |
|---|---|---|---|---|
| VoxCPM2 | 2 B | 3.88 / 74.99 | 5.13 / 71.57 | 5.49 / 74.67 |
| CosyVoice3-0.5B | 0.5 B | 3.84 / 80.01 | 4.88 / 74.16 | 4.04 / 78.85 |
| IndexTTS2.5-RL | 0.8 B | 3.93 / 77.92 | 3.89 / 67.79 | 3.33 / 76.68 |
| MOSS-TTS-v1.5 | 8 B | 4.02 / 72.68 | 4.45 / 67.46 | 3.83 / 71.75 |
| Modelo | zh→en inglés WER / SS | zh→es WER / SS | zh→ja WER / SS |
|---|---|---|---|
| VoxCPM2 | 4.48 / 64.25 | 16.38 / 64.89 | 11.84 / 71.54 |
| OmniVoice | 3.74 / 64.91 | 5.84 / 62.08 | 9.09 / 69.06 |
| Qwen3-TTS | 5.74 / 63.04 | 5.15 / 68.02 | 36.09 / 65.71 |
| Configuración | RTF | Condiciones |
|---|---|---|
| VoxCPM2 (estándar) | ~0.30 | RTX 4090 bf16 |
| VoxCPM2 (Nano-VLLM) | ~0.13 | Después de la aceleración |
| IndexTTS2.5 (referencia) | 0.2065 | RTX 4090 bf16 |
Lo que cuesta correrse
| Configuración | RTF | GPU-horas / M chars | A demanda RTX 4090 | A demanda A100 |
|---|---|---|---|---|
| VoxCPM2 (Nano-VLLM) | ~0.13 | 2.3 h | ~$1.73 | ~$3.72 |
| VoxCPM2 (estándar) | ~0.30 | 5.4 h | ~$4.00 | ~$8.59 |
Licence and disclosure gate
| Tema | Situación |
|---|---|
| Licencia por código | Apache-2.0 |
| Licencia de peso | Apache-2.0 |
| Uso comercial | ✓ Yes — la única licencia dual totalmente limpia en este conjunto |
| Marca de agua predeterminada | Ninguno (la tarjeta modelo indica claramente que la salida no tiene marca de agua AI) |
| Lo que debes hacer | Agregue AudioSeal, SynthID o C2PA usted mismo si su jurisdicción tiene un deber de divulgación (Artículo UE 50 / China reglas de síntesis profunda / política de plataforma) |
| Moderación de contenido | La tarjeta modelo establece que no se proporciona ningún filtro de entrada de grado de producción; eso es en usted |
| Residencia de datos | Runs fully offline |
Si no es esto, entonces qué
- Presión de cumplimiento pesada, necesita una marca de agua predeterminada → Chatterbox (Resemble AI, MIT, PerTh incrustado por defecto, 25 idiomas).
- rendimiento emocional chino más duración precisa → IndexTTS2.5.
- 646 idiomas de bajos recursos, no comerciales → OmniVoice.
- Huella muy baja en CPU o borde → Kokoro 82M (fuera de este set, Apache-2.0, ~2–3 GB, sin clonación).
- Pareja china monolingüe superior → CosyVoice3-0.5B (ver su licencia primero).
¿Todo listo para crear con VoxCPM2?
Abre Texto a voz con este motor seleccionado y empieza con tu propio modelo de voz.