Análisis exhaustivo de modelos TTS de código abierto · 2026
01

IndexTTS 1

bilibili · Corriente cero de grado industrial TTS · Primero liberado febrero 2025

IndexTTS es el sistema de primera generación de bilibiliEs el equipo de habla de índice. Se construye sobre XTTS y Tortoise en lugar de empezar desde cero, y su contribución de titular está haciendo Control de pronunciación chino — un problema que el inglés TTS la investigación había ignorado en gran medida. Para un público internacional, el detalle importante es el calendario de lanzamiento: v1.0 (Mar 2025) fue seguido por v1.5 (Mayo 2025), que mejoró específicamente y significativamente el rendimiento inglés y la estabilidad general. Si usted evalúa IndexTTS 1, evaluar v1.5, no v1.0.

Desarrollador
bilibili Index Speech Team
Liberación inicial
Feb 2025 (pesos Mar 2025)
Arquitectura
Autoregresivo (estilo GPT)
Idiomas
Chino, Inglés (+ dialectos)
VRAM
~11 GB
Mediador
~1 audio min en ~10 s

Contribución 1 — Personaje híbrido + modelado de pinyin

Esta es la idea central. Los polifones chinos (caracters con múltiples lecturas dependiendo del contexto) son un modo de falla persistente para TTS. IndexTTS permite a los usuarios inyectar pinyin directamente en el texto de entrada, y entrenó el modelo para hacer frente a él mediante un aumento estocástico:

  • Durante el entrenamiento, aproximadamente 20% de caracteres no polifónicos son reemplazados por su forma de pinyin usando una máscara Bernoulli (α = 0.20). Esto obliga al modelo a aprender una cartografía robusta entre graphemes y fonemas.
  • El entrenamiento adversario redujo la tasa de despronunciación de homófonos de 8.7% a 0.9%.
  • En la inferencia se puede escribir zhong4 zhong4 inline to disambiguate — el mismo mecanismo también ayuda con caracteres raros y fuera de vocabulario.

Por qué esto importa más allá de los chinos: el mismo truco de arquitectura es directamente reutilizable para cualquier idioma con pronunciación irregular. Es funcionalmente similar a lo que el teléfono CMU anula para hacer para el inglés.

Contribución 2 — Pausa exacta / control prosody

La puntuación se mapea a duración explícita de la pausa a través de incrustaciones de tiempo (Aproximadamente) 0.3 s para un coma, 0.8 s para una parada completa). En el texto clásico chino de larga duración, la precisión de la frase alcanzada 98.6%.

Contribución 3 — Mejoras encoder y vocoder

  • A Encoder condicional basado en el lenguaje sustituyó la pila de condicionamiento de base, mejorando la estabilidad de clonación de cero instantánea y la similitud del altavoz.
  • El decodificador de código de discurso fue reemplazado por BigVGAN2, un salto significativo en la naturalidad de salida.
  • El equipo publicó una comparación de Cuantización vectorial (VQ) frente a cuantización escalar finita (FSQ) para la utilización de códigos: a 6,000- escala de datos de horas, FSQ alcanzó cerca 100% utilización del libro de códigos versus aproximadamente 55% VQ — un hallazgo más tarde heredado por todo el IndexTTS linaje.

Resultados notificados (autoevaluación)

métricaValorNotas
Tasa de error de palabras (WER)1.3%escenario chino
Similitud del altavoz (SS)0.776clonación con cero
MOS4.01Calidad subjetiva

These figures were reported as beating contemporaneous opensource systems including CosyVoice2, Fish-Speech, FireRedTTS y F5-TTS, mientras se utiliza un oleoducto de entrenamiento más simple y una inferencia más rápida.

Casos de uso: cuándo elegir 1

EscenarioCómo ejecutarloCuidado.
Sólo chino narración por lotes (según costo)Recoge el guión y ejecutelo en un solo paso, locking timbre con unos segundos de audio de referencia~11 GB VRAM; no control de duración, así que el duelo bloqueado está fuera
Contenido denso con nombres, jerga o chino clásicoPolífonos mixtos "hanzi + pinyin" — Los panes errados del homófono se dejan caer 8.7% a 0.9%Las anotaciones de Pinyin necesitan un pase humano; escalas de costes con longitud de script
Lectura donde el ritmo de pausa importaMapas de puntuación directamente para pausar las duraciónes; ~98.6% exactitud de frases en texto clásicoNo control de velocidad continuo — sintoniza el ritmo editando puntuación
Una base de referencia para la comparación de versionesCuando no estás seguro de si realmente necesitas 2/2.5, Corre 1 primeroInglés requiere v1.5 o más tarde; v1.0 El inglés no es un referente válido
No es adecuado para: conversación en vivo (sin streaming, sin receta vLLM), rendimiento emocional, doblaje enmarcado, idiomas más allá de chino e inglés, o cualquier cosa que necesite control de duración precisa — todo eso llega con IndexTTS2 y 2.5.

Veredicto para usuarios internacionales

Uselo si necesita un modelo de clonación de blancos chinos ligero y estable y tiene ~11 GB de VRAM para ahorrar. Sigue siendo una base sólida y bien comprobada.

Skip it necesita control emocional, control de duración preciso, o más de dos idiomas — los que llegaron sólo IndexTTS2 y 2.5. Observe la brecha de calidad en inglés entre v1.0 y v1.5 fue sustancial.

Bilingüe clonación de poca monta Pinyin teléfono override 98.6% precisión límite de la sentencia

Donde se sienta en los datos cabeza a cabeza

IndexTTS 1 no participó en el CV3-Eval cabeza a cabeza — que la evaluación abarca la nueva generación (IndexTTS2.5, VoxCPM2, OmniVoice, CosyVoice 3, Qwen3-TTS, MOSS-TTS y otros). Por consiguiente, su función en el presente informe es Base de referencia, no competidor. Sus propios números absolutos están en el bloque "Reportado resultados" arriba.

Punto de referenciaGráficosBasis
IndexTTS 1 (este modelo)WER 1.3% / SS 0.776 / MOS 4.01Autorreportado
IndexTTS2 ( sucesor directo)WER 1.88% / similaridad de la emoción 0.887Autor-reportado, fuerte-emoción condición
IndexTTS2.5-RL (dos generaciones después)zh→en inglés 3.55 WER / 67.47 SSCV3-Eval — ver 06.2
Un problema de línea de tiempo que debe entender: IndexTTS 1's v1.0 era notablemente débil en inglés; sólo v1.5 trajo una mejora real. Si has visto "IndexTTS es malo en inglés" 2024–2025 blog post o hilo Reddit, era casi seguro v1.0. Revise la versión que realmente tiraste antes de ponerla delante del contenido inglés — Mucha gente ha sido atrapada por esto.

Lo que cuesta correrse

IndexTTS 1 nunca publicado un comparable RTF con hardware declarado, por lo que no puede entrar GPU- mesa de horas en 06.4. Estos son los únicos anclajes utilizables:

TemaValorNota
VRAM~11 GBsuperior a superior 2.5's ~6 GB; un solo RTX 4090 es suficiente
Velocidad reclamada por el autor~10 s por minuto de audioHardware no especificado — no comparable con ninguna otra RTF Aquí.
Estimación conservadora (borrowing IndexTTS2's 0.3257)5.9 GPU-horas / millones de caracteres~$4.34 on-demand 4090; ~$9.32 on A100
Tema básico: si su objetivo es "la clonación china más rápida", vaya directo a IndexTTS2.5 en lugar de 1 — inferior VRAM (~6 GB), un más rápido RTF (0.2065, aproximadamente $2.75 por millón de caracteres), más idiomas, y un umbral de licencia que se escribe en realidad. Uso 1 sólo si tienes una razón específica para marcar la versión antigua.

Licence and disclosure gate

TemaSituación
Licencia por códigoFuente abierta
Licencia de pesoLicencia Modelo de Índice — examen por línea de las necesidades; en el presente informe no se encontró ninguna concesión comercial explícita
Uso comercialLos términos deben ser revisados. No asumir que sí
Marca de agua predeterminadaNo declarado → plan en la suposición no hay ninguno; añadir el suyo propio si usted tiene un deber de divulgación
Residencia de datosRuns fully offline
La Licencia Modelo de Índice no Apache-2.0. No lleva una donación comercial de manta de la forma en que una licencia permisiva lo hace. Si su producto cobra dinero, lea los términos completos o e-mail y pregunte — dentro TTS, "fuente abierta" y "comercialmente usable" son preguntas independientes. Sección 06.5 camina a través de los detalles.

Si no es esto, entonces qué

  • clonación china, y se puede mover a una nueva liberación → IndexTTS2.5. Más rápido, cinco idiomas, control de pronunciación más fino (pinyin / CMU / kana), menor VRAM.
  • La licencia debe ser limpia → VoxCPM2 (Apache-2.0 para código y pesos, 48 kHz).
  • Huella extremadamente baja, CPU o borde → Kokoro 82M (fuera de este set, Apache-2.0, ~2–3 GBPero no puede clonar).
  • Necesitas específicamente 1 como base para una comparación de estilo papel → mantenerlo, pero siempre reportar ambos v1.0 y v1.5 números de versión o su conclusión engañará a la gente.
Pruébalo en BiliVoice

¿Todo listo para crear con IndexTTS 1?

Abre Texto a voz con este motor seleccionado y empieza con tu propio modelo de voz.