Análisis exhaustivo de modelos TTS de código abierto · 2026
04

OmniVoice

Xiaomi / k2-fsa (Siguiente-gen Kaldi) · 646 idiomas · Liberado Mar 31, 2026

OmniVoice viene de k2-fsa, el grupo Kaldi de Next-gen dirigido por Daniel Povey — un nombre que tiene un peso considerable en la comunidad de reconocimiento del discurso. Es el más amplio idioma-cubrimiento cero-shot TTS modelo disponible, reclamando 646 idiomas entrenados sobre 581,000 hnuestra de audio, y funciona completamente localmente. El repo acumulado sobre 12k GitHub estrellas dentro de semanas de liberación, y los pesos son sólo ~3.3 GB.

Lea esto antes de planear un producto alrededor OmniVoice: el código es Apache-2.0, pero el pesos pre-entrenados son CC-BY-NC 4.0 (no comercial), una limitación heredada de datos de formación como el Emilia corpus. El uso personal y de investigación está bien; no se permite ningún uso generador de ingresos sin licencias separadas. Esto se indica explícitamente en la tarjeta modelo y es un bloqueador duro para el despliegue comercial.
Documento
arXiv:2604.00688
Backbone
Qwen3-0.6B (~0.8 B total)
Idiomas
646
Datos de capacitación
~581,000 h
Producto
24 kHz mono
Pesos tamaño
~3.3 GB
Claimed RTF
0.025 on H100 con núcleos personalizados
Licencia de código
Apache-2.0
Licencia de peso
CC-BY-NC 4.0 (no comercial)

Arquitectura — un "modelo de lenguaje de difusión" no autoregresivo diseño

La mayoría TTS tuberías son dos etapas: text → semantic tokens → acoustic features → waveform, y cada hop acumula error. OmniVoice colapsa esto a una sola etapa: text → multi-codebook acoustic tokens → waveform.

  • La columna vertebral es una reutilización Qwen3-0.6B modelo de lenguaje impulsado en un estilo de diffusión-idioma-model: en lugar de emitir audio de izquierda a derecha, que perfecciona toda la secuencia en unos pocos pasos paralelos de denoización.
  • A bidirectional Transformer conjuntamente modela una transcripción de instrucciones, un segmento rápido y el segmento objetivo enmascarado.
  • El audio está codificado/decodificado por un tokenizer separado derivado de Higgs Audio v2 (Boson AI, Apache-2.0).
  • No hay acumulación de error desde una etapa semántica intermedia, y mucho menos pasos secuenciales de decodificación — De ahí la velocidad.

Cinco capacidades básicas

CapacidadDetalles
clonación con cero3–10 s de audio de referencia. Incorporado Whisper auto-transcripción significa que no tienes que suministrar la transcripción de referencia. Manijas ruido / referencias reverberantes mediante la extracción de un altavoz limpio incrustando.
Diseño de vozNo se requiere audio de referencia — describir la voz en el lenguaje natural (male, elderly, low pitch, British accent) y genera uno. Apoya el género, la edad, el campo, el acento, el dialecto y el susurro.
Control de texto finoEtiquetas no verbal en línea: [laughter], [sigh], [breath], [sniff] y 13+ otros.
Anulación de la denunciaChino a través de pinyin con marcas de tono (por ejemplo. ZHE2); Inglés a través del diccionario de pronunciación CMU.
Diálogo multiparlante[Speaker_N]: etiquetas conducen la síntesis de script multi-character, cada orador con una voz independiente.

Speed — papel vs realidad

La figura del titular es RTF 0.025 (40× en tiempo real). Esa medida se adoptó en un H100 con núcleos de aceleración dedicadosNo en una estación de trabajo. Pruebas prácticas independientes en un Mac Studio / M4 Max notificados en forma aproximada 4–6 sEconds of compute for 5.4 sEconds of audio — cerca de tiempo real, y alrededor de la mitad con --num_step 16 a algún costo en claridad. Presupuesto en consecuencia.

Problemas conocidos de las pruebas de terceros

  • Ocasional dejó caer o mangled palabras en el inicio o fin de sentencias — en uno 24- Prueba de generación, 5 las salidas perdieron o corrompieron una palabra. Es un problema conocido; re-correr normalmente lo resuelve.
  • Generar un clon de voz y guardarlo (model.create_voice_clone_prompt() → .save("voice.pt")) le permite saltar el clip de referencia y transcripción en sesiones posteriores — útil para el trabajo por lotes.
  • Funcionamiento completamente fuera de línea si pre-descargar los pesos con hf download k2-fsa/OmniVoice --local-dir ./model y pasar ese camino --model. Set GRADIO_ANALYTICS_ENABLED=False antes de lanzar la UI web — llama a la casa de Gradio al inicio.

Ecosystem

  • GGUF quantizations existen (Serveurperso/OmniVoice-GGUF, ~62k downloads/mes), desde Q4 K M a ~660 MB a F32.
  • omnivoice.cpp — a C++17/GGML puerto que se ejecuta CPU, CUDA, ROCm, Metal y Vulkan, incluyendo Apple Silicon. Esto hace OmniVoice por lejos la opción más portátil aquí.
  • Motor predeterminado en el popular VoiceStudio local-ElevenLabs- Proyecto alternativo.
  • Manzana de silicona con soporte nativo a través de MPS (~3.3 GB descarga, no NVIDIA tarjeta necesaria).

Casos de uso: amplitud de idioma y portabilidad

EscenarioCómo ejecutarloCuidado.
Lenguas de bajo recurso y raras646 idiomas, cubriendo a muchos sin comerciales TTS apoyo para todosLos pesos son CC-BY-NC — que por sí solo veta cualquier uso comercial
Solo CPU / dispositivos de fresa Pi / bordeomnivoice.cpp funciona en CPU, Metal, Vulkan y ROCm; el modelo de lenguaje Q4 K M está bajo 1 GBEl RTF 0.025 headline se midió en un H100 con núcleos personalizados; localmente esperar más cerca 1× en tiempo real
Despliegue completo por aireDescargue los pesos una vez, entonces no se hace ninguna solicitud de redTécnicamente viable, pero la licencia no comercial excluye el trabajo público y hospitalario
Investigación y prototipado no comercialVoice Design crea un timbre de una descripción, sin audio de referenciaDiseño de voz es estocástico — generar uno a tres candidatos y elegir
Corriendo localmente en un MacSoporte de silicona nativo de Apple a través de MPS, ~3.3 GB de pesosPlan de capacidad desde sus propias mediciones, no los números de papel
Una conclusión de selección contraintuitiva: OmniVoice funciona completamente fuera de línea y envía una construcción de CPU, lo que hace que parezca ideal para despliegues públicos y hospitalarios — pero sus pesos son CC-BY-NC, por lo que la adquisición no lo aclarará. Esos escenarios deberían usarse VoxCPM2 en lugar de esoApache-2.0 en código y pesos).

Veredicto para usuarios internacionales

Uselo si usted está haciendo trabajos de investigación, proyectos personales o de bajo nivel de recursos, o necesita la cobertura de idiomas más amplia posible y la ruta CPU/Mac más fácil. Diseño de voz sin ningún audio de referencia es realmente útil para prototipado.

No lo use comercialmente sin negociar una licencia separada — los pesos CC-BY-NC son el bloqueador, independientemente del Apache-2.0 La insignia de repo. Para una alternativa comercialmente limpia con funcionalidad similar de "describe-a-voice" VoxCPM2, Chatterbox (MIT) o CosyVoice 3.

646 idiomas Diseño de voz CPU / Mac / Vulkan GGUF + puerto C+ Pesos NC — no uso comercial

Donde se sienta en los datos cabeza a cabeza

ModeloParamsChino WER / SSInglés WER / SSEspañol WER / SS
OmniVoice0.8 B3.41 / 72.993.62 / 70.133.52 / 74.14
CosyVoice3-0.5B0.5 B3.84 / 80.014.88 / 74.164.04 / 78.85
Fish Audio S2 Pro4 B3.62 / 67.793.83 / 61.662.93 / 67.44
IndexTTS2.5-RL0.8 B3.93 / 77.923.89 / 67.793.33 / 76.68
Modelozh→en inglés WER / SSzh→es WER / SSzh→ja WER / SS
OmniVoice3.74 / 64.915.84 / 62.089.09 / 69.06
VoxCPM24.48 / 64.2516.38 / 64.8911.84 / 71.54
ModeloRTFCondiciones
OmniVoice0.025H100 + núcleos de aceleración personalizados (figura de papel)
OmniVoice (medido)~0.9–1.2× en tiempo realMac Studio / M4 Max
IndexTTS2.5 (referencia)0.2065RTX 4090 bf16
La clave para leer esto: más bajo WER no significa "sonidos más como la persona". OmniVoiceEs inglés WER de 3.62 es uno de los mejores en el conjunto, pero su semejanza de altavoz es 70.13 — abajo de los líderes. Es más claro, no más idéntico. Esa es una ventaja para la lectura de noticias y una debilidad real para el duelo de personajes o un narrador fijo a través de un audiolibro.

Lo que cuesta correrse

TemaValorNota
GPU-horas / M chars0.45 hCondiciones del papel
A demanda H100 ($2.89–3.49/h)~$1.30–1.57Nominally el más barato en el set
A demanda RTX 4090No aplicableLa figura del papel depende de H100 más núcleos personalizados y no transferencia
Tamaño del peso3.3 GBBajo Q4 K M la porción del idioma-model está bajo 1 GB
No hay presupuesto 0.025. Esa es una figura de laboratorio en un H100 con núcleos construidos a propósito. En una tarjeta de consumo o Apple Silicon el número medido aterriza en aproximadamente 0.9–1.2× en tiempo real — Una hora de audio toma alrededor de una hora. Su costo nominal es el más bajo y su barra de hardware es el más alto. Re-costado en la misma demanda 4090 base, no es más barato que IndexTTS2.5.
Pero tiene una ventaja de coste diferente: GGUF plus omnivoice.cpp permite correr en una máquina con no GPU en absoluto (CPU / Metal / Vulkan / ROCm). Si necesitas un TTS dentro de una caja de bordes, es la única opción en este conjunto — Sólo tienes que aceptar el factor en tiempo real.

Licence and disclosure gate

TemaSituación
Licencia por códigoApache-2.0
Licencia de pesoCC-BY-NC 4.0 (no comercial)
Uso comercialNo está permitido — a menos que obtenga una licencia separada
Marca de agua predeterminadaNo declarado
Residencia de datosEjecuta completamente el aire (pesos pre-descarga, análisis de Gradio deshabilitado)
Una conclusión contra-intuitiva: gobierno y salud son exactamente los escenarios que parecen necesitar un modelo fuera de línea más — y ellos son el único lugar OmniVoice realmente destaca técnicamente. Pero... Los pesos CC-BY-NC lo descartan durante las compras y la revisión de cumplimiento. No queme una prueba de contacto aquí; vaya directo a VoxCPM2. El desglose total de las licencias se ha registrado 06.5.

Si no es esto, entonces qué

  • Lenguaje ancho, pero tiene que ser navegable → Paso Audio EditX (Apache-2.0) o Kokoro 82M (CPU, Apache-2.0, sin clonación).
  • Fully offline y comercialmente limpio → VoxCPM2.
  • Uso de investigación o hobby solamente → Quédatelo. Nada es más barato para 646- cobertura de idiomas.
  • Interacción en tiempo real en CPU → aquí nada. Mira Kokoro en el 06.1 mesa, o utilizar un cerrado API.
Pruébalo en BiliVoice

¿Todo listo para crear con OmniVoice?

Abre Texto a voz con este motor seleccionado y empieza con tu propio modelo de voz.