IndexTTS 1
bilibili · Corriente cero de grado industrial TTS · Primero liberado febrero 2025
IndexTTS es el sistema de primera generación de bilibiliEs el equipo de habla de índice. Se construye sobre XTTS y Tortoise en lugar de empezar desde cero, y su contribución de titular está haciendo Control de pronunciación chino — un problema que el inglés TTS la investigación había ignorado en gran medida. Para un público internacional, el detalle importante es el calendario de lanzamiento: v1.0 (Mar 2025) fue seguido por v1.5 (Mayo 2025), que mejoró específicamente y significativamente el rendimiento inglés y la estabilidad general. Si usted evalúa IndexTTS 1, evaluar v1.5, no v1.0.
- Desarrollador
- bilibili Index Speech Team
- Liberación inicial
- Feb 2025 (pesos Mar 2025)
- Arquitectura
- Autoregresivo (estilo GPT)
- Idiomas
- Chino, Inglés (+ dialectos)
- VRAM
- ~11 GB
- Mediador
- ~1 audio min en ~10 s
Contribución 1 — Personaje híbrido + modelado de pinyin
Esta es la idea central. Los polifones chinos (caracters con múltiples lecturas dependiendo del contexto) son un modo de falla persistente para TTS. IndexTTS permite a los usuarios inyectar pinyin directamente en el texto de entrada, y entrenó el modelo para hacer frente a él mediante un aumento estocástico:
- Durante el entrenamiento, aproximadamente 20% de caracteres no polifónicos son reemplazados por su forma de pinyin usando una máscara Bernoulli (α = 0.20). Esto obliga al modelo a aprender una cartografía robusta entre graphemes y fonemas.
- El entrenamiento adversario redujo la tasa de despronunciación de homófonos de 8.7% a 0.9%.
- En la inferencia se puede escribir
zhong4 zhong4inline to disambiguate — el mismo mecanismo también ayuda con caracteres raros y fuera de vocabulario.
Por qué esto importa más allá de los chinos: el mismo truco de arquitectura es directamente reutilizable para cualquier idioma con pronunciación irregular. Es funcionalmente similar a lo que el teléfono CMU anula para hacer para el inglés.
Contribución 2 — Pausa exacta / control prosody
La puntuación se mapea a duración explícita de la pausa a través de incrustaciones de tiempo (Aproximadamente) 0.3 s para un coma, 0.8 s para una parada completa). En el texto clásico chino de larga duración, la precisión de la frase alcanzada 98.6%.
Contribución 3 — Mejoras encoder y vocoder
- A Encoder condicional basado en el lenguaje sustituyó la pila de condicionamiento de base, mejorando la estabilidad de clonación de cero instantánea y la similitud del altavoz.
- El decodificador de código de discurso fue reemplazado por BigVGAN2, un salto significativo en la naturalidad de salida.
- El equipo publicó una comparación de Cuantización vectorial (VQ) frente a cuantización escalar finita (FSQ) para la utilización de códigos: a 6,000- escala de datos de horas, FSQ alcanzó cerca 100% utilización del libro de códigos versus aproximadamente 55% VQ — un hallazgo más tarde heredado por todo el IndexTTS linaje.
Resultados notificados (autoevaluación)
| métrica | Valor | Notas |
|---|---|---|
| Tasa de error de palabras (WER) | 1.3% | escenario chino |
| Similitud del altavoz (SS) | 0.776 | clonación con cero |
| MOS | 4.01 | Calidad subjetiva |
These figures were reported as beating contemporaneous opensource systems including CosyVoice2, Fish-Speech, FireRedTTS y F5-TTS, mientras se utiliza un oleoducto de entrenamiento más simple y una inferencia más rápida.
Casos de uso: cuándo elegir 1
| Escenario | Cómo ejecutarlo | Cuidado. |
|---|---|---|
| Sólo chino narración por lotes (según costo) | Recoge el guión y ejecutelo en un solo paso, locking timbre con unos segundos de audio de referencia | ~11 GB VRAM; no control de duración, así que el duelo bloqueado está fuera |
| Contenido denso con nombres, jerga o chino clásico | Polífonos mixtos "hanzi + pinyin" — Los panes errados del homófono se dejan caer 8.7% a 0.9% | Las anotaciones de Pinyin necesitan un pase humano; escalas de costes con longitud de script |
| Lectura donde el ritmo de pausa importa | Mapas de puntuación directamente para pausar las duraciónes; ~98.6% exactitud de frases en texto clásico | No control de velocidad continuo — sintoniza el ritmo editando puntuación |
| Una base de referencia para la comparación de versiones | Cuando no estás seguro de si realmente necesitas 2/2.5, Corre 1 primero | Inglés requiere v1.5 o más tarde; v1.0 El inglés no es un referente válido |
Veredicto para usuarios internacionales
Uselo si necesita un modelo de clonación de blancos chinos ligero y estable y tiene ~11 GB de VRAM para ahorrar. Sigue siendo una base sólida y bien comprobada.
Skip it necesita control emocional, control de duración preciso, o más de dos idiomas — los que llegaron sólo IndexTTS2 y 2.5. Observe la brecha de calidad en inglés entre v1.0 y v1.5 fue sustancial.
Donde se sienta en los datos cabeza a cabeza
IndexTTS 1 no participó en el CV3-Eval cabeza a cabeza — que la evaluación abarca la nueva generación (IndexTTS2.5, VoxCPM2, OmniVoice, CosyVoice 3, Qwen3-TTS, MOSS-TTS y otros). Por consiguiente, su función en el presente informe es Base de referencia, no competidor. Sus propios números absolutos están en el bloque "Reportado resultados" arriba.
| Punto de referencia | Gráficos | Basis |
|---|---|---|
| IndexTTS 1 (este modelo) | WER 1.3% / SS 0.776 / MOS 4.01 | Autorreportado |
| IndexTTS2 ( sucesor directo) | WER 1.88% / similaridad de la emoción 0.887 | Autor-reportado, fuerte-emoción condición |
| IndexTTS2.5-RL (dos generaciones después) | zh→en inglés 3.55 WER / 67.47 SS | CV3-Eval — ver 06.2 |
Lo que cuesta correrse
IndexTTS 1 nunca publicado un comparable RTF con hardware declarado, por lo que no puede entrar GPU- mesa de horas en 06.4. Estos son los únicos anclajes utilizables:
| Tema | Valor | Nota |
|---|---|---|
| VRAM | ~11 GB | superior a superior 2.5's ~6 GB; un solo RTX 4090 es suficiente |
| Velocidad reclamada por el autor | ~10 s por minuto de audio | Hardware no especificado — no comparable con ninguna otra RTF Aquí. |
| Estimación conservadora (borrowing IndexTTS2's 0.3257) | 5.9 GPU-horas / millones de caracteres | ~$4.34 on-demand 4090; ~$9.32 on A100 |
Licence and disclosure gate
| Tema | Situación |
|---|---|
| Licencia por código | Fuente abierta |
| Licencia de peso | Licencia Modelo de Índice — examen por línea de las necesidades; en el presente informe no se encontró ninguna concesión comercial explícita |
| Uso comercial | Los términos deben ser revisados. No asumir que sí |
| Marca de agua predeterminada | No declarado → plan en la suposición no hay ninguno; añadir el suyo propio si usted tiene un deber de divulgación |
| Residencia de datos | Runs fully offline |
Si no es esto, entonces qué
- clonación china, y se puede mover a una nueva liberación → IndexTTS2.5. Más rápido, cinco idiomas, control de pronunciación más fino (pinyin / CMU / kana), menor VRAM.
- La licencia debe ser limpia → VoxCPM2 (Apache-2.0 para código y pesos, 48 kHz).
- Huella extremadamente baja, CPU o borde → Kokoro 82M (fuera de este set, Apache-2.0, ~2–3 GBPero no puede clonar).
- Necesitas específicamente 1 como base para una comparación de estilo papel → mantenerlo, pero siempre reportar ambos v1.0 y v1.5 números de versión o su conclusión engañará a la gente.
¿Todo listo para crear con IndexTTS 1?
Abre Texto a voz con este motor seleccionado y empieza con tu propio modelo de voz.