Análisis exhaustivo de modelos TTS de código abierto · 2026
05

VoxCPM2

ModeloBest / OpenBMB / Tsinghua HCSI · Tokenizer-free · Apache-2.0 · Apr 2026

VoxCPM2 es el modelo más amigable internacional en este conjunto: Apache-2.0 para código y pesos, documentación inglesa limpia, y una decisión de diseño que se une a un común TTS problema. Es tokenizer-free — genera directamente en espacio continuo en lugar de cuantificar el audio en tokens discretas primero. La lógica: la cuantificación es perjudicial, y el acento, microdinámica emocional, respiración y ritmo de pausa son exactamente los detalles que se aplanan por él. El modelo es 2 B parámetros, construidos en ModelBest MiniCPM-4 columna vertebral, entrenada en 2M+ horas de discurso multilingüe.

Arquitectura
LocEnc → TSLM → RALM → LocDiT
Backbone
MiniCPM-4, 2 B total
Idiomas
30 + 9 dialectos chinos
Audio VAE
AudioVAE V216 kHz dentro → 48 kHz fuera)
Tasa de token LM
6.25 Hz, max 8192 tokens
VRAM
~8 GB
RTF (RTX 4090)
~0.30 / ~0.13 con Nano-VLLM
Licencia
Apache-2.0 (bien comercial)

La arquitectura de cuatro etapas

  • LocEnc (Encoder Local) — extractos características de texto de entrada y audio de referencia, produciendo acondicionamiento para los dos modelos de lenguaje.
  • TSLM (Text–Semántica LM) — "planificación semántica": mapas de texto a una representación habla-semántica gruesa. Aquí es donde se deciden los límites de contenido y el marco prosódico.
  • RALM (Residual Acoustic LM) — modelado acústico más fino en la parte superior de la salida del TSLM: detalle timbre, emocional y características de altavoz se añaden aquí.
  • LocDiT ( Transformador de Difusión Local) — difusión local que combina el flujo produciendo latentes de audio continuos, decodificados por AudioVAE V2 en 48 kHz audio.

AudioVAE V2 es asimétrica: el encoder acepta 16 kHz entrada mientras el decodificador emite 48 kHz, con super-resolución construida en — No se necesita un promotor externo. Que 48 kHz La salida es la tasa de muestra más alta de este grupo.

Cuatro modos de uso

ModoInputLo que te da
Básica TTSTexto sóloSin audio de referencia y no idioma tag — el modelo detecta el propio lenguaje. Tipo chino, conseguir chino; tipo tailandés, conseguir tailandés.
Diseño de vozDescripción del lenguaje naturalPrefijo el texto con una descripción entre paréntesis, por ejemplo. (young woman, warm and gentle voice). Crea una voz totalmente nueva sin audio de referencia.
Cierre controlableReferencia audio + instrucción estiloCierre el timbre mientras conduce emoción, ritmo y entrega ("un poco más rápido, alegre tono"). La base de timbre permanece intacta.
Cierre finalAudio de referencia + su transcripciónclonación de estilo de continuidad de audio — la referencia se convierte en el segmento de apertura. Mejor reproducción de acento, hábitos respiratorios y ritmo de pausa. Pasando el mismo clip a ambos reference_wav_path y prompt_wav_path maximiza la similitud.

Síntesis de análisis de contexto

Una capacidad que es fácil de pasar por alto: VoxCPM lee el texto e infiere emoción y prosodio adecuados en lugar de convertir mecánicamente caracteres a audio. La misma frase que termina en una marca de exclamación contra una parada completa conseguirá diferentes pacing, energía y estrés. Comentarios deportivos, argumentos y monólogos llorones salen con prosodia natural en lugar de la entrega plana "estable pero sin emoción" típica de los mayores TTS. Esto viene del modelado semántico del TSLM y el MiniCPM-4 comprensión de texto debajo de él.

Criterios

métricaValorNotas
RCE chino0.97%Public eval set
Inglés WER1.84%Public eval set
RTF (RTX 4090)~0.30Modo estándar
RTF con Nano-VLLM~0.13Aproximación a tiempo real de baja latencia
VRAM~8 GBbf16

Reported as state-the-art or competitive on Seed-TTS-eval, CV3-eval, InstruccionesTTSEval y la prueba multilingüe MiniMax. Caveat: la mayoría de los números son auto-reportados; las reproducciones independientes de terceros todavía son limitadas.

Idiomas

30 idiomas: Árabe, Birmania, chino, danés, holandés, inglés, finlandés, francés, alemán, griego, hebreo, hindi, indonesio, italiano, japonés, khmer, coreano, lao, malayo, noruego, polaco, portugués, ruso, swahili, sueco, Tagalog, tailandés, turco, vietnamita.

9 dialectos chinos: Sichuanese, Cantonés, Wu (Shanghainese), Nororiental, Henanese, Shaanxi, Shandong, Tianjin, Hokkien.

Despliegue de ajuste fino

  • Full SFT y LoRA ajuste fino apoyado con tan poco como 5–10 minutos de audio — LoRA es el camino recomendado. Este es el único modelo en este grupo que documenta un flujo práctico de trabajo de formación personal.
  • Requisitos: Pitón ≥ 3.10, PyTorch ≥ 2.5.0, CUDA ≥ 12.0. Instalar con pip install voxcpm.
  • ModelScope descarga está disponible para usuarios en regiones donde Hugging Face es lento.
  • Producción a través de Nano-VLLM o vLLM-Omni. Demo local web: python app.py --port 8808.
  • Canciones clave: cfg_value (fuerza de orientación sin clasificar — cómo la producción se adhiere de cerca al impulso) y inference_timesteps (pasos de diffusión; por defecto 10 está bien para la mayoría de los casos).
  • Ecosystem traction: 327k descargas en el último mes, 21 adaptadores, 28 comunidades de fin de estudios y 10 quantizaciones en Hugging Face.

Historia de la versión

CuandoVersión¿Qué cambió?
Sep 2025VoxCPM-0.5BPrimer lanzamiento; golpe #1 on Hugging Face Trending
Dec 2025VoxCPM1.5 (~800 M)SFT + LoRA de ajuste fino, 44.1 kHz salida, #1 on GitHub Tendencia; los plugins de ComfyUI, las exportaciones ONNX y una reimplementación de Rust
Apr 2026VoxCPM2 (2 B)~2.5× parámetros; 2 → 30 idiomas 9 dialectos; 48 kHz producto; Diseño de voz y cierre regulable añadido; AudioVAE V2
Limitaciones conocidas (de la tarjeta modelo): Diseño de voz y control de estilo son estocástico — generar 1–3 veces y elegir lo mejor. El rendimiento varía según el idioma según la disponibilidad de datos de capacitación. Los insumos muy largos o altamente expresivos pueden ocasionalmente desestabilizarse. El audio generado contiene sin marca de agua AI, así que si usted opera en una jurisdicción con requisitos de divulgación (por ejemplo. la EU AI Act), debe agregar su propio etiquetado. El modelo no filtra contenido sensible — La moderación de entrada es su responsabilidad. Prohibida estrictamente por insonorización, fraude o desinformación.

Casos de uso: la única opción de limpieza de licencias aquí

EscenarioCómo ejecutarloCuidado.
Sector público, hospital y despliegue financiero autónomoCorre completamente fuera de línea así que el audio nunca deja la red; 48 kHz salida sin aumento externoPlan ~6–8 semanas para la producción — véase el cuadro de gastos que figura a continuación
Cursos en línea y formación multilingüe30 idiomas 9 dialectos chinos, sin necesidad de etiquetas de lenguajeLa Ley de Accesibilidad Europea ha convertido la accesibilidad en un plazo de contratación pública — véase infra
clonación de voz de creador y IP personalLoRA de buen nivel 5–10 minutos de audio hornea su timbre en los pesosCierre usted mismo o una voz liberada es segura; la clonación de una persona real aumenta los derechos de personalidad, una pregunta separada de la licencia
Variantes de Ad y Marketing A/BBatch-generar muchas variantes de un script; costo marginal está cerca de cero cuando auto-anfitrionaLas políticas de etiquetado de la plataforma y la FTC son más estrictas
Entrega de contenidos de alta fidelidad16 kHz audio de referencia pasa por AudioVAE V2 directo a 48 kHz Producto2B parámetros — más lento que IndexTTS2.5
Diseño de voz (sin audio de referencia)Describir género, edad y campo en lenguaje natural para crear un nuevo timbreLa producción lleva sin marca de agua — añadir su propio donde se requiere la divulgación

Implementación autoanfitriona: cómo funcionan las matemáticas

TemaFigura típica
Hora de la producción, pila de voz auto-anfitriona~6–8 semanas, lanzamiento a la primera llamada de producción
Herraje típicoL40S para ASR + LLM, L4 para streaming TTS; un solo dual-GPU caja suficiente
Latencia de final a fin~0.3 s (inferencia local, ningún viaje de internet público)
Estructura de costosHosted APIs €0.05–0.40 / minuto; auto hospedado costo fijo de ~€800 / mes
Break-evenDe aproximadamente 50,000 minutos / mes de auto-anfitriona gana; debajo de que usted está comprando la soberanía de datos, no ahorro

Resultados de producción publicados (divulgaciones de terceros, solo como referencia):

  • Un fintech europeo: a 10× reducción del tiempo medio para resolver todo el apoyo.
  • Un tier...1 Gulf Telecom: costo por contacto abajo 58%; 81% contención en las investigaciones prepagadas sin entrega humana; tiempo de mango medio en las colecciones externas comprimidos 4.2 a 2.1 minutos; CSAT sobre las llamadas a mano de inteligencia artificial 4.3/5 contra 4.1/5 hUman basal.

Accesibilidad de lectura en voz alta: obtener la dirección correcta

WCAG no requiere que usted proporcione texto a palabra. Requiere que su contenido sea parseable correctamente por los usuarios de tecnología de asistencia ya traen — JAWS, NVDA, VoiceOver. Lo que lee-aloud realmente sirve es el gran grupo medio: lectores con dislexia, baja visión, usuarios mayores, lectores de segundo idioma — gente pobremente servida por un lector de pantalla completa pero todavía luchando con texto largo. Es una característica del producto, no una casilla de verificación de cumplimiento.

  • SC 1.4.2: audio que autoplays para más que 3 seconds necesita un control de pausa/parada — por lo tanto, debe decir: nunca autojuego.
  • SC 2.1.1 / 2.4.7 / 2.4.11: cada teclado de control accesible, enfoque visible, foco nunca obscurado.
  • SC 3.1.1 / 3.1.2: los cambios de idioma deben marcarse explícitamente — en términos del motor, SSML lang cambiando.
  • SC 4.1.3: utilizar las regiones vivas de ARIA así que read-aloud se mantiene al día con errores de forma y estados de carga.
La regulación tiene dientes — pero este modelo no es la mejor respuesta aquí. La Ley de Accesibilidad Europea ha sido jurídicamente vinculante para muchas empresas que venden en la UE desde junio 2025, y contenidos educativos digitales en la UE deben cumplir con WCAG 2.2 AA. Pero... VoxCPM2 carece de soporte SSML completo y tiempos de nivel de palabras (por lo que no hay experiencia de lectura y alta) y no fue optimizado para streaming de primer audio. Para un despliegue real el peso ligero Kokoro 82M (Apache-2.0, CPU-capable, ~2–3 GB) es el mejor ajuste — el intercambio de no ser clonación de voz.

Clausura: tres reglas de disciplina

Audio fuente

Record 10 s–5 min of clean single-speaker audio: sin cama de música, sin reverbio, sin segunda voz.

5–10 minutos es suficiente para el ajuste de LoRA para hornear tu timbre en los pesos y reducir la varianza de correr a correr.

Consistencia

Cierre un clip de referencia, una semilla y una instrucción de estilo así que episodios y problemas nunca se derivan.

Diseño de voz es estocástico — generar uno a tres candidatos antes de comprometerse.

Consentimiento

Cierre usted mismo, o alguien que firmó una liberación escrita, es la zona segura.

Cierre de una persona real sin consentimiento puede desencadenar derechos de personalidad, derechos de publicidad y reclamaciones de privilegio biométrico — una pregunta completamente separada de la licencia modelo.

Veredicto para usuarios internacionales

Uselo si quieres una licencia comercialmente limpia, 48 kHz calidad de salida, ajuste en su propia voz con datos mínimos, y un despliegue local directo en ~8 GB VRAM.

Cuidado. el 2 B Parámetro (más bajo que IndexTTS2.5 y OmniVoice) y la naturaleza estocástica de Diseño de Voz — es una herramienta creativa, no un generador determinista.

2 B params 30 idiomas Tokenizer-free 48 kHz Producto Diseño de voz Apache-2.0 — comercial OK

Donde se sienta en los datos cabeza a cabeza

ModeloParamsChino WER / SSInglés WER / SSEspañol WER / SS
VoxCPM22 B3.88 / 74.995.13 / 71.575.49 / 74.67
CosyVoice3-0.5B0.5 B3.84 / 80.014.88 / 74.164.04 / 78.85
IndexTTS2.5-RL0.8 B3.93 / 77.923.89 / 67.793.33 / 76.68
MOSS-TTS-v1.58 B4.02 / 72.684.45 / 67.463.83 / 71.75
Modelozh→en inglés WER / SSzh→es WER / SSzh→ja WER / SS
VoxCPM24.48 / 64.2516.38 / 64.8911.84 / 71.54
OmniVoice3.74 / 64.915.84 / 62.089.09 / 69.06
Qwen3-TTS5.74 / 63.045.15 / 68.0236.09 / 65.71
ConfiguraciónRTFCondiciones
VoxCPM2 (estándar)~0.30RTX 4090 bf16
VoxCPM2 (Nano-VLLM)~0.13Después de la aceleración
IndexTTS2.5 (referencia)0.2065RTX 4090 bf16
Hay una debilidad que tienes que saber sobre: zh→es multilingüe. WER 16.38 — claramente detrás del set (OmniVoice 5.84, CosyVoice3 4.58). Si su flujo de trabajo es "Clip de referencia chino → Dub español", ese número destrozará la salida. Es fuerte en la similitud del altavoz inglés (71.57, mejor en conjunto) y en 48 kHz calidad. No es fuerte en la transferencia interlingüe.

Lo que cuesta correrse

ConfiguraciónRTFGPU-horas / M charsA demanda RTX 4090A demanda A100
VoxCPM2 (Nano-VLLM)~0.132.3 h~$1.73~$3.72
VoxCPM2 (estándar)~0.305.4 h~$4.00~$8.59
El costo bajo demanda en el conjunto ($1.73 por millón de caracteres), aproximadamente 1/35a 1/100th de ElevenLabs v3. Las mismas tres realidades se aplican: mundo real RTF típicamente 2–5× más lento que el papel; el costo de ingeniería generalmente excede GPU factura por un orden de magnitud; y no olvides el almacenamiento ocioso — un volumen de red que sostiene las facturas de pesos, ya sea o no, sobre $35/mes para 500 GB. Modelo completo en 06.4.

Licence and disclosure gate

TemaSituación
Licencia por códigoApache-2.0
Licencia de pesoApache-2.0
Uso comercial✓ Yes — la única licencia dual totalmente limpia en este conjunto
Marca de agua predeterminadaNinguno (la tarjeta modelo indica claramente que la salida no tiene marca de agua AI)
Lo que debes hacerAgregue AudioSeal, SynthID o C2PA usted mismo si su jurisdicción tiene un deber de divulgación (Artículo UE 50 / China reglas de síntesis profunda / política de plataforma)
Moderación de contenidoLa tarjeta modelo establece que no se proporciona ningún filtro de entrada de grado de producción; eso es en usted
Residencia de datosRuns fully offline
"La licencia limpia" no es "conforme". Estas son dos puertas separadas: una licencia limpia significa puede utilizar este modelo; Medios de cumplimiento de la información el audio que usted envía debe ser detectable como generado por AI. VoxCPM2 te da cero ayuda en el segundo — no envía explícitamente ninguna marca de agua. Chatterbox (MIT), por contraste, incorpora una marca de agua PerTh por defecto. Full set of duties in 06.5.

Si no es esto, entonces qué

  • Presión de cumplimiento pesada, necesita una marca de agua predeterminada → Chatterbox (Resemble AI, MIT, PerTh incrustado por defecto, 25 idiomas).
  • rendimiento emocional chino más duración precisa → IndexTTS2.5.
  • 646 idiomas de bajos recursos, no comerciales → OmniVoice.
  • Huella muy baja en CPU o borde → Kokoro 82M (fuera de este set, Apache-2.0, ~2–3 GB, sin clonación).
  • Pareja china monolingüe superior → CosyVoice3-0.5B (ver su licencia primero).
Pruébalo en BiliVoice

¿Todo listo para crear con VoxCPM2?

Abre Texto a voz con este motor seleccionado y empieza con tu propio modelo de voz.