Análisis exhaustivo de modelos TTS de código abierto · 2026
02

IndexTTS2

bilibili · Emocionalmente expresivo + controlado por la duración · Liberado Sep 8, 2025

IndexTTS2 es el modelo que hizo que esta familia se hiciera viral internacionalmente — los videos "AI Inglés dub of Chinese period dramas" que circulaban en plataformas sociales occidentales a finales 2025 fueron generados con él. Es el primer disparo automático cero TTS modelo que combina el control de duración preciso con generación natural y libre, y decodifica la emoción de la identidad del altavoz para que el timbre y la emoción puedan ser especificados independientemente. El GitHub repo ha pasado 10k estrellas, y pesos más código de inferencia son liberados.

Documento
arXiv:2506.21619
Arquitectura
T2S + S2M + BigVGANv2
Datos de movimiento
55K muestras / 135 h discurso emocional
Entrada de cierre
~5 s audio,85% similaridad
VRAM
~15 GB
RTF (RTX 4090)
0.3257 fp16 en general
Comunidad
Discord + OpenAI-compatible API horquillas
Contacto comercial
[email protected]

Arquitectura — una cascada de tres etapas

  • Texto a Semántico (T2S) — un transformador autoregresivo de estilo LLM que toma texto fuente, un impulso de estilo, un impulso de timbre y un recuento de token de destino opcional, y emite tokens semánticos.
  • Semántica a Mel (S2M) — a fluid-matching módulo que predice el espectrograma de mel de tokens semánticas más el condicionamiento timbre. Replacing discreta tokens acústica con el flujo coincidente es lo que preserva el detalle fino bajo emoción fuerte.
  • BigVGANv2 vocoder — convierte espectrogramas de mel a onda.

Innovación 1 — Control de duración dentro de un modelo autoregresivo

Autoregresivo TTS es inherentemente token-by-token, lo que hace difícil alcanzar una duración de objetivo — un problema real para el duelo, donde el audio debe coincidir con la imagen. IndexTTS2 resuelve esto con un limitación de la cuenta corriente:

  • Una incrustación de duración específica inyecta en T2S el número de tokens solicitado, y el modelo alinea la información posicional con ese presupuesto.
  • Capacitación aleatoriamente muestra tareas de escalado de duración (por ejemplo. 0.75×, 1.25×) por lo que el modelo permanece fluido y emocionalmente coherente a cualquier longitud solicitada.
  • Tasa de error de cuenta de token asegurada: infra 0.03%, a menudo debajo 0.02%.
  • Dos modos operativos: limitado (especifique la cuenta de ficha → duración exacta) y libre de funcionamiento (no cuenta token → reproduce fielmente el prosodio del impulso).

Innovación 2 — Desconexión emocional/timbre, cuatro modalidades de control

Modalidad de controlCómo funciona
Referencia de audio individualUn clip suministra tanto timbre como emoción (clásico clonación de cero instantánea)
Referencia de emoción separadaEl impulso de estilo puede venir de un diferente altavoz que el timbre — incluso un idioma diferente
Emotion vector8 dimensiones — feliz, enojado, triste, miedo, disgustado, melancólico, sorprendido, calma — con pesos ajustables y muestreo aleatorio
Descripción del texto ("instrucción suave")Un buen estudio Qwen3 mapas descripciones de lenguaje natural ("dijámoslo con un toque de queja", "Me asustaste hasta la muerte!") en guía de emoción

El desenredado se aplica arquitectónicamente con un Gradient Reversal Layer (GRL) y separadores de altavoz/emoción, por lo que el modelo no puede engañar al filtrar la identidad en el camino de la emoción.

Innovación 3 — Claridad bajo emoción extrema

Shouting and sobbing are where expressive TTS generalmente se cae — gotas de inteligibilidad. IndexTTS2 incorporaciones GPT latent representations más un nuevo paradigma de entrenamiento de tres etapas para estabilizar la generación. Medida WER durante el grito: 1.883%, i.e. expresividad sin sacrificar la inteligibilidad.

Resultados reportados

métricaValorContexto
Similitud de la emoción (ES)0.887Golpea a otros modelos de disparo cero SOTA
Emoción MOS (EMOS)4.22Entrega natural y bien adaptada
WER bajo fuerte emoción1.883%Disparos / escenarios de llanto
Error de control de duración<0.03%0.75×–1.25× pruebas de velocidad

Velocidad de inferencia del mundo real (RTX 4090, kv cache=True)

Longitud de entradav2.0 fp16v2.0 fp32
7 personajes0.40040.3748
16 personajes0.33220.3389
28 personajes0.32570.3480
80 personajes0.32290.3754
200 personajes0.32440.3990
En general0.32570.3748

Pruebas independientes basadas en Docker en un NVIDIA L40S (80 casos de prueba 4 versiones × 4 scenarios × 5 corre, 100% tasa de éxito) notificados retrasos finales a fin de ~6.4 s (Chino corto), ~28 s (Chino largo), ~7.6 s (Inglés corto), ~35.4 s (largo inglés) para la imagen de producción. El v2.1-cuda la construcción fue más rápida para los chinos; v2.0-production era más estable para el inglés.

Nota de despliegue: una construcción CUDA de PyTorch es necesaria — La inferencia sólo de CPU es no apoyada en la aplicación de referencia. Los tenedores comunitarios proporcionan un OpenAI-compatible API (/v1/audio/speech estilo) e integración con Voxta, lo que hace comparativamente fácil caer en un oleoducto existente.

Casos de uso: cuándo elegir 2

EscenarioCómo ejecutarloCuidado.
Anime, movimiento-comicación emocional de forma cortaControl de emoción con el 8- vector de la dimensión o una instrucción en lengua natural; el timbre y la emoción se descodifican, por lo que la voz de A puede llevar la emoción de B~15 GB VRAM — el más alto en este grupo
Pasajes emocionales en audiolibrosAdjuntar instrucciones de emoción al diálogo, volver al "calma" para la narraciónLarga forma todavía derivas; debe hundirse con validación de solapamiento (ver 06.3)
Podcasts y espectáculos de dos anfitrionesCierre un clip de referencia más una instrucción de emoción por host así que los episodios permanecen consistentesLas obligaciones de divulgación de información de inteligencia artificial en los segmentos de anuncios y patrocinadores son más restrictivas (véase 06.5)
Revoicing an existing performanceMantener el timbre, cambiar sólo el vector de emoción — mucho más barato que un re-recordExaminar la articulación bajo emoción extrema (sobbing, shouting); WER aumentos
Doblaje de vídeo (aproximación de primera generación)El control de la duración contiene un error de cuenta token bajo 0.03%, manteniendo el audio alineado a la imagenPara el ajuste continuo de velocidad, 2.5's 0.5×–2.0× es la mejor herramienta
Nota práctica: 2 es el intérprete más fuerte de esta serie — al costo del más alto VRAM y tiempo de inferencia. Si su contenido no tiene capa emocional, vaya directo a 2.5 es el mejor comercio: más rápido, más inclinado, más idiomas.

Veredicto para usuarios internacionales

Uselo si Usted está haciendo apropiación de AI, audiolibros, trabajo de voz de carácter, o cualquier oleoducto donde el audio debe coincidir con una línea de tiempo fija, o donde usted necesita para volver a convocar un rendimiento en otra emoción.

Cuidado. el ~15 GB VRAM requisito y el hecho de que el inglés es un objetivo de segundo idioma para esta familia modelo — siempre A/B contra un modelo occidental (Chatterbox, XTTS-v2, F5-TTS) en su propio guión inglés antes de comprometerse.

Control de emociones Emotion/timbre decoupling Control de duración exacta Emoción prontitud de texto Barcos compatibles con OpenAI

Donde se sienta en los datos cabeza a cabeza

IndexTTS2 también no participó en CV3-Eval — que cubre la mesa 2.5 generación. Su evidencia cabeza a cabeza proviene principalmente de medida RTF on an RTX 4090 (ver "La velocidad de inferencia del mundo real" arriba).

VersiónPrecisiónEn general RTFVersus 2.5
IndexTTS2fp160.3257~1.58× más lento
IndexTTS2fp320.3748~1.82× más lento
IndexTTS2.5bf160.2065Base de referencia

An RTF de 0.3257 significa rudamente 3.1× en tiempo realUn millón de personajes18 hnuestro de audio) toma alrededor 5.9 GPU- Horas.

Posición de una línea: IndexTTS2 es el modelo que inventado emoción controlable más duración controlable, pero 2.5 mejora en ella a través de la velocidad, idiomas, VRAM y control de pronunciación. La única razón para elegir 2 hoy es "ya está funcionando en producción y no quiero tocarlo".

Lo que cuesta correrse

ConfiguraciónRTFGPU-horas / M charsA demanda RTX 4090 ($0.74/h)A demanda A100 ($1.59/h)
IndexTTS2 (fp16)0.32575.9 h~$4.34~$9.32
Referencia: IndexTTS2.5 (bf16)0.20653.7 h~$2.75~$5.91

Pon eso junto al comercial API lista de precios:

OpciónCosto / M charsVersus IndexTTS2
ElevenLabs v3$60–180~14–41×
Cartesia Sonic 3$20–39~4.6–9×
OpenAI tts-1$15~3.5×
Google / Polly Standard$4~0.9× — más barato que el auto hospedaje
No seas engañado por esa última fila. Nube estándar TTS es más barato que correr esto tú mismo, pero esas voces no puede clonar, no tiene control de emoción ni control de duración — no es el mismo producto. IndexTTS2's real cost la competencia es ElevenLabs, y ahí está la brecha 14–41×.

Esta tabla también excluye el costo de ingeniería: implementación, monitoreo, lógica de reingreso, cosido en pedazos, re-cosas fallidas. Eso es tiempo de ingeniería, y generalmente cuesta un orden de magnitud más que el GPU Bill. Modelo completo está en 06.4.

Licence and disclosure gate

TemaSituación
Licencia por códigoFuente abierta
Licencia de pesoLicencia Modelo de Índice
Uso comercialLos términos deben ser revisados; el contacto comercial publicado por los autores es [email protected]
Marca de agua predeterminadaNo declarado → plan on the assumed there is none
Residencia de datosRuns fully offline
La diferencia clave de 2.5: 2.5's Bilibili La Licencia Modelo establece su umbral abiertamente (100M MAU / ¥1B ingresos). 2 shasta utilizar el vaguer "Index Model License", por lo que tienes que ir a preguntar. Si usted está seleccionando para un producto comercial, la certeza de la licencia es en sí misma una razón para elegir 2.5 sobre 2.

Si no es esto, entonces qué

  • Tasa de habla continuamente ajustable para el acaparamiento → IndexTTS2.5 (0.5×–2.0× continua; 2's control de duración es pasos fijos).
  • No necesitas control de emociones → IndexTTS 1 es más ligero, aunque tenga en cuenta el problema de la versión en inglés.
  • La licencia debe ser limpia → VoxCPM2.
  • Sólo quieres "sonidos mejor" → empezar con la mesa de Elo persiana 06.1; Paso Audio EditXApache-2.0) es el modelo abierto más alto que puedes enviar.
Pruébalo en BiliVoice

¿Todo listo para crear con IndexTTS2?

Abre Texto a voz con este motor seleccionado y empieza con tu propio modelo de voz.