OmniVoice
Xiaomi / k2-fsa (Siguiente-gen Kaldi) · 646 idiomas · Liberado Mar 31, 2026
OmniVoice viene de k2-fsa, el grupo Kaldi de Next-gen dirigido por Daniel Povey — un nombre que tiene un peso considerable en la comunidad de reconocimiento del discurso. Es el más amplio idioma-cubrimiento cero-shot TTS modelo disponible, reclamando 646 idiomas entrenados sobre 581,000 hnuestra de audio, y funciona completamente localmente. El repo acumulado sobre 12k GitHub estrellas dentro de semanas de liberación, y los pesos son sólo ~3.3 GB.
- Documento
- arXiv:2604.00688
- Backbone
- Qwen3-0.6B (~0.8 B total)
- Idiomas
- 646
- Datos de capacitación
- ~581,000 h
- Producto
- 24 kHz mono
- Pesos tamaño
- ~3.3 GB
- Claimed RTF
- 0.025 on H100 con núcleos personalizados
- Licencia de código
- Apache-2.0
- Licencia de peso
- CC-BY-NC 4.0 (no comercial)
Arquitectura — un "modelo de lenguaje de difusión" no autoregresivo diseño
La mayoría TTS tuberías son dos etapas: text → semantic tokens → acoustic features → waveform, y cada hop acumula error. OmniVoice colapsa esto a una sola etapa: text → multi-codebook acoustic tokens → waveform.
- La columna vertebral es una reutilización Qwen3-0.6B modelo de lenguaje impulsado en un estilo de diffusión-idioma-model: en lugar de emitir audio de izquierda a derecha, que perfecciona toda la secuencia en unos pocos pasos paralelos de denoización.
- A bidirectional Transformer conjuntamente modela una transcripción de instrucciones, un segmento rápido y el segmento objetivo enmascarado.
- El audio está codificado/decodificado por un tokenizer separado derivado de Higgs Audio v2 (Boson AI, Apache-2.0).
- No hay acumulación de error desde una etapa semántica intermedia, y mucho menos pasos secuenciales de decodificación — De ahí la velocidad.
Cinco capacidades básicas
| Capacidad | Detalles |
|---|---|
| clonación con cero | 3–10 s de audio de referencia. Incorporado Whisper auto-transcripción significa que no tienes que suministrar la transcripción de referencia. Manijas ruido / referencias reverberantes mediante la extracción de un altavoz limpio incrustando. |
| Diseño de voz | No se requiere audio de referencia — describir la voz en el lenguaje natural (male, elderly, low pitch, British accent) y genera uno. Apoya el género, la edad, el campo, el acento, el dialecto y el susurro. |
| Control de texto fino | Etiquetas no verbal en línea: [laughter], [sigh], [breath], [sniff] y 13+ otros. |
| Anulación de la denuncia | Chino a través de pinyin con marcas de tono (por ejemplo. ZHE2); Inglés a través del diccionario de pronunciación CMU. |
| Diálogo multiparlante | [Speaker_N]: etiquetas conducen la síntesis de script multi-character, cada orador con una voz independiente. |
Speed — papel vs realidad
La figura del titular es RTF 0.025 (40× en tiempo real). Esa medida se adoptó en un H100 con núcleos de aceleración dedicadosNo en una estación de trabajo. Pruebas prácticas independientes en un Mac Studio / M4 Max notificados en forma aproximada 4–6 sEconds of compute for 5.4 sEconds of audio — cerca de tiempo real, y alrededor de la mitad con --num_step 16 a algún costo en claridad. Presupuesto en consecuencia.
Problemas conocidos de las pruebas de terceros
- Ocasional dejó caer o mangled palabras en el inicio o fin de sentencias — en uno 24- Prueba de generación, 5 las salidas perdieron o corrompieron una palabra. Es un problema conocido; re-correr normalmente lo resuelve.
- Generar un clon de voz y guardarlo (
model.create_voice_clone_prompt()→.save("voice.pt")) le permite saltar el clip de referencia y transcripción en sesiones posteriores — útil para el trabajo por lotes. - Funcionamiento completamente fuera de línea si pre-descargar los pesos con
hf download k2-fsa/OmniVoice --local-dir ./modely pasar ese camino--model. SetGRADIO_ANALYTICS_ENABLED=Falseantes de lanzar la UI web — llama a la casa de Gradio al inicio.
Ecosystem
- GGUF quantizations existen (
Serveurperso/OmniVoice-GGUF, ~62k downloads/mes), desde Q4 K M a ~660 MB a F32. - omnivoice.cpp — a C++17/GGML puerto que se ejecuta CPU, CUDA, ROCm, Metal y Vulkan, incluyendo Apple Silicon. Esto hace OmniVoice por lejos la opción más portátil aquí.
- Motor predeterminado en el popular VoiceStudio local-ElevenLabs- Proyecto alternativo.
- Manzana de silicona con soporte nativo a través de MPS (~3.3 GB descarga, no NVIDIA tarjeta necesaria).
Casos de uso: amplitud de idioma y portabilidad
| Escenario | Cómo ejecutarlo | Cuidado. |
|---|---|---|
| Lenguas de bajo recurso y raras | 646 idiomas, cubriendo a muchos sin comerciales TTS apoyo para todos | Los pesos son CC-BY-NC — que por sí solo veta cualquier uso comercial |
| Solo CPU / dispositivos de fresa Pi / borde | omnivoice.cpp funciona en CPU, Metal, Vulkan y ROCm; el modelo de lenguaje Q4 K M está bajo 1 GB | El RTF 0.025 headline se midió en un H100 con núcleos personalizados; localmente esperar más cerca 1× en tiempo real |
| Despliegue completo por aire | Descargue los pesos una vez, entonces no se hace ninguna solicitud de red | Técnicamente viable, pero la licencia no comercial excluye el trabajo público y hospitalario |
| Investigación y prototipado no comercial | Voice Design crea un timbre de una descripción, sin audio de referencia | Diseño de voz es estocástico — generar uno a tres candidatos y elegir |
| Corriendo localmente en un Mac | Soporte de silicona nativo de Apple a través de MPS, ~3.3 GB de pesos | Plan de capacidad desde sus propias mediciones, no los números de papel |
Veredicto para usuarios internacionales
Uselo si usted está haciendo trabajos de investigación, proyectos personales o de bajo nivel de recursos, o necesita la cobertura de idiomas más amplia posible y la ruta CPU/Mac más fácil. Diseño de voz sin ningún audio de referencia es realmente útil para prototipado.
No lo use comercialmente sin negociar una licencia separada — los pesos CC-BY-NC son el bloqueador, independientemente del Apache-2.0 La insignia de repo. Para una alternativa comercialmente limpia con funcionalidad similar de "describe-a-voice" VoxCPM2, Chatterbox (MIT) o CosyVoice 3.
Donde se sienta en los datos cabeza a cabeza
| Modelo | Params | Chino WER / SS | Inglés WER / SS | Español WER / SS |
|---|---|---|---|---|
| OmniVoice | 0.8 B | 3.41 / 72.99 | 3.62 / 70.13 | 3.52 / 74.14 |
| CosyVoice3-0.5B | 0.5 B | 3.84 / 80.01 | 4.88 / 74.16 | 4.04 / 78.85 |
| Fish Audio S2 Pro | 4 B | 3.62 / 67.79 | 3.83 / 61.66 | 2.93 / 67.44 |
| IndexTTS2.5-RL | 0.8 B | 3.93 / 77.92 | 3.89 / 67.79 | 3.33 / 76.68 |
| Modelo | zh→en inglés WER / SS | zh→es WER / SS | zh→ja WER / SS |
|---|---|---|---|
| OmniVoice | 3.74 / 64.91 | 5.84 / 62.08 | 9.09 / 69.06 |
| VoxCPM2 | 4.48 / 64.25 | 16.38 / 64.89 | 11.84 / 71.54 |
| Modelo | RTF | Condiciones |
|---|---|---|
| OmniVoice | 0.025 | H100 + núcleos de aceleración personalizados (figura de papel) |
| OmniVoice (medido) | ~0.9–1.2× en tiempo real | Mac Studio / M4 Max |
| IndexTTS2.5 (referencia) | 0.2065 | RTX 4090 bf16 |
Lo que cuesta correrse
| Tema | Valor | Nota |
|---|---|---|
| GPU-horas / M chars | 0.45 h | Condiciones del papel |
| A demanda H100 ($2.89–3.49/h) | ~$1.30–1.57 | Nominally el más barato en el set |
| A demanda RTX 4090 | No aplicable | La figura del papel depende de H100 más núcleos personalizados y no transferencia |
| Tamaño del peso | 3.3 GB | Bajo Q4 K M la porción del idioma-model está bajo 1 GB |
omnivoice.cpp permite correr en una máquina con no GPU en absoluto (CPU / Metal / Vulkan / ROCm). Si necesitas un TTS dentro de una caja de bordes, es la única opción en este conjunto — Sólo tienes que aceptar el factor en tiempo real.Licence and disclosure gate
| Tema | Situación |
|---|---|
| Licencia por código | Apache-2.0 |
| Licencia de peso | CC-BY-NC 4.0 (no comercial) |
| Uso comercial | No está permitido — a menos que obtenga una licencia separada |
| Marca de agua predeterminada | No declarado |
| Residencia de datos | Ejecuta completamente el aire (pesos pre-descarga, análisis de Gradio deshabilitado) |
Si no es esto, entonces qué
- Lenguaje ancho, pero tiene que ser navegable → Paso Audio EditX (Apache-2.0) o Kokoro 82M (CPU, Apache-2.0, sin clonación).
- Fully offline y comercialmente limpio → VoxCPM2.
- Uso de investigación o hobby solamente → Quédatelo. Nada es más barato para 646- cobertura de idiomas.
- Interacción en tiempo real en CPU → aquí nada. Mira Kokoro en el 06.1 mesa, o utilizar un cerrado API.
¿Todo listo para crear con OmniVoice?
Abre Texto a voz con este motor seleccionado y empieza con tu propio modelo de voz.