IndexTTS2
bilibili · Emocionalmente expresivo + controlado por la duración · Liberado Sep 8, 2025
IndexTTS2 es el modelo que hizo que esta familia se hiciera viral internacionalmente — los videos "AI Inglés dub of Chinese period dramas" que circulaban en plataformas sociales occidentales a finales 2025 fueron generados con él. Es el primer disparo automático cero TTS modelo que combina el control de duración preciso con generación natural y libre, y decodifica la emoción de la identidad del altavoz para que el timbre y la emoción puedan ser especificados independientemente. El GitHub repo ha pasado 10k estrellas, y pesos más código de inferencia son liberados.
- Documento
- arXiv:2506.21619
- Arquitectura
- T2S + S2M + BigVGANv2
- Datos de movimiento
- 55K muestras / 135 h discurso emocional
- Entrada de cierre
- ~5 s audio,85% similaridad
- VRAM
- ~15 GB
- RTF (RTX 4090)
- 0.3257 fp16 en general
- Comunidad
- Discord + OpenAI-compatible API horquillas
- Contacto comercial
- [email protected]
Arquitectura — una cascada de tres etapas
- Texto a Semántico (T2S) — un transformador autoregresivo de estilo LLM que toma texto fuente, un impulso de estilo, un impulso de timbre y un recuento de token de destino opcional, y emite tokens semánticos.
- Semántica a Mel (S2M) — a fluid-matching módulo que predice el espectrograma de mel de tokens semánticas más el condicionamiento timbre. Replacing discreta tokens acústica con el flujo coincidente es lo que preserva el detalle fino bajo emoción fuerte.
- BigVGANv2 vocoder — convierte espectrogramas de mel a onda.
Innovación 1 — Control de duración dentro de un modelo autoregresivo
Autoregresivo TTS es inherentemente token-by-token, lo que hace difícil alcanzar una duración de objetivo — un problema real para el duelo, donde el audio debe coincidir con la imagen. IndexTTS2 resuelve esto con un limitación de la cuenta corriente:
- Una incrustación de duración específica inyecta en T2S el número de tokens solicitado, y el modelo alinea la información posicional con ese presupuesto.
- Capacitación aleatoriamente muestra tareas de escalado de duración (por ejemplo. 0.75×, 1.25×) por lo que el modelo permanece fluido y emocionalmente coherente a cualquier longitud solicitada.
- Tasa de error de cuenta de token asegurada: infra 0.03%, a menudo debajo 0.02%.
- Dos modos operativos: limitado (especifique la cuenta de ficha → duración exacta) y libre de funcionamiento (no cuenta token → reproduce fielmente el prosodio del impulso).
Innovación 2 — Desconexión emocional/timbre, cuatro modalidades de control
| Modalidad de control | Cómo funciona |
|---|---|
| Referencia de audio individual | Un clip suministra tanto timbre como emoción (clásico clonación de cero instantánea) |
| Referencia de emoción separada | El impulso de estilo puede venir de un diferente altavoz que el timbre — incluso un idioma diferente |
| Emotion vector | 8 dimensiones — feliz, enojado, triste, miedo, disgustado, melancólico, sorprendido, calma — con pesos ajustables y muestreo aleatorio |
| Descripción del texto ("instrucción suave") | Un buen estudio Qwen3 mapas descripciones de lenguaje natural ("dijámoslo con un toque de queja", "Me asustaste hasta la muerte!") en guía de emoción |
El desenredado se aplica arquitectónicamente con un Gradient Reversal Layer (GRL) y separadores de altavoz/emoción, por lo que el modelo no puede engañar al filtrar la identidad en el camino de la emoción.
Innovación 3 — Claridad bajo emoción extrema
Shouting and sobbing are where expressive TTS generalmente se cae — gotas de inteligibilidad. IndexTTS2 incorporaciones GPT latent representations más un nuevo paradigma de entrenamiento de tres etapas para estabilizar la generación. Medida WER durante el grito: 1.883%, i.e. expresividad sin sacrificar la inteligibilidad.
Resultados reportados
| métrica | Valor | Contexto |
|---|---|---|
| Similitud de la emoción (ES) | 0.887 | Golpea a otros modelos de disparo cero SOTA |
| Emoción MOS (EMOS) | 4.22 | Entrega natural y bien adaptada |
| WER bajo fuerte emoción | 1.883% | Disparos / escenarios de llanto |
| Error de control de duración | <0.03% | 0.75×–1.25× pruebas de velocidad |
Velocidad de inferencia del mundo real (RTX 4090, kv cache=True)
| Longitud de entrada | v2.0 fp16 | v2.0 fp32 |
|---|---|---|
| 7 personajes | 0.4004 | 0.3748 |
| 16 personajes | 0.3322 | 0.3389 |
| 28 personajes | 0.3257 | 0.3480 |
| 80 personajes | 0.3229 | 0.3754 |
| 200 personajes | 0.3244 | 0.3990 |
| En general | 0.3257 | 0.3748 |
Pruebas independientes basadas en Docker en un NVIDIA L40S (80 casos de prueba 4 versiones × 4 scenarios × 5 corre, 100% tasa de éxito) notificados retrasos finales a fin de ~6.4 s (Chino corto), ~28 s (Chino largo), ~7.6 s (Inglés corto), ~35.4 s (largo inglés) para la imagen de producción. El v2.1-cuda la construcción fue más rápida para los chinos; v2.0-production era más estable para el inglés.
/v1/audio/speech estilo) e integración con Voxta, lo que hace comparativamente fácil caer en un oleoducto existente.Casos de uso: cuándo elegir 2
| Escenario | Cómo ejecutarlo | Cuidado. |
|---|---|---|
| Anime, movimiento-comicación emocional de forma corta | Control de emoción con el 8- vector de la dimensión o una instrucción en lengua natural; el timbre y la emoción se descodifican, por lo que la voz de A puede llevar la emoción de B | ~15 GB VRAM — el más alto en este grupo |
| Pasajes emocionales en audiolibros | Adjuntar instrucciones de emoción al diálogo, volver al "calma" para la narración | Larga forma todavía derivas; debe hundirse con validación de solapamiento (ver 06.3) |
| Podcasts y espectáculos de dos anfitriones | Cierre un clip de referencia más una instrucción de emoción por host así que los episodios permanecen consistentes | Las obligaciones de divulgación de información de inteligencia artificial en los segmentos de anuncios y patrocinadores son más restrictivas (véase 06.5) |
| Revoicing an existing performance | Mantener el timbre, cambiar sólo el vector de emoción — mucho más barato que un re-record | Examinar la articulación bajo emoción extrema (sobbing, shouting); WER aumentos |
| Doblaje de vídeo (aproximación de primera generación) | El control de la duración contiene un error de cuenta token bajo 0.03%, manteniendo el audio alineado a la imagen | Para el ajuste continuo de velocidad, 2.5's 0.5×–2.0× es la mejor herramienta |
Veredicto para usuarios internacionales
Uselo si Usted está haciendo apropiación de AI, audiolibros, trabajo de voz de carácter, o cualquier oleoducto donde el audio debe coincidir con una línea de tiempo fija, o donde usted necesita para volver a convocar un rendimiento en otra emoción.
Cuidado. el ~15 GB VRAM requisito y el hecho de que el inglés es un objetivo de segundo idioma para esta familia modelo — siempre A/B contra un modelo occidental (Chatterbox, XTTS-v2, F5-TTS) en su propio guión inglés antes de comprometerse.
Donde se sienta en los datos cabeza a cabeza
IndexTTS2 también no participó en CV3-Eval — que cubre la mesa 2.5 generación. Su evidencia cabeza a cabeza proviene principalmente de medida RTF on an RTX 4090 (ver "La velocidad de inferencia del mundo real" arriba).
| Versión | Precisión | En general RTF | Versus 2.5 |
|---|---|---|---|
| IndexTTS2 | fp16 | 0.3257 | ~1.58× más lento |
| IndexTTS2 | fp32 | 0.3748 | ~1.82× más lento |
| IndexTTS2.5 | bf16 | 0.2065 | Base de referencia |
An RTF de 0.3257 significa rudamente 3.1× en tiempo realUn millón de personajes18 hnuestro de audio) toma alrededor 5.9 GPU- Horas.
Lo que cuesta correrse
| Configuración | RTF | GPU-horas / M chars | A demanda RTX 4090 ($0.74/h) | A demanda A100 ($1.59/h) |
|---|---|---|---|---|
| IndexTTS2 (fp16) | 0.3257 | 5.9 h | ~$4.34 | ~$9.32 |
| Referencia: IndexTTS2.5 (bf16) | 0.2065 | 3.7 h | ~$2.75 | ~$5.91 |
Pon eso junto al comercial API lista de precios:
| Opción | Costo / M chars | Versus IndexTTS2 |
|---|---|---|
| ElevenLabs v3 | $60–180 | ~14–41× |
| Cartesia Sonic 3 | $20–39 | ~4.6–9× |
OpenAI tts-1 | $15 | ~3.5× |
| Google / Polly Standard | $4 | ~0.9× — más barato que el auto hospedaje |
Esta tabla también excluye el costo de ingeniería: implementación, monitoreo, lógica de reingreso, cosido en pedazos, re-cosas fallidas. Eso es tiempo de ingeniería, y generalmente cuesta un orden de magnitud más que el GPU Bill. Modelo completo está en 06.4.
Licence and disclosure gate
| Tema | Situación |
|---|---|
| Licencia por código | Fuente abierta |
| Licencia de peso | Licencia Modelo de Índice |
| Uso comercial | Los términos deben ser revisados; el contacto comercial publicado por los autores es [email protected] |
| Marca de agua predeterminada | No declarado → plan on the assumed there is none |
| Residencia de datos | Runs fully offline |
Si no es esto, entonces qué
- Tasa de habla continuamente ajustable para el acaparamiento → IndexTTS2.5 (0.5×–2.0× continua; 2's control de duración es pasos fijos).
- No necesitas control de emociones → IndexTTS 1 es más ligero, aunque tenga en cuenta el problema de la versión en inglés.
- La licencia debe ser limpia → VoxCPM2.
- Sólo quieres "sonidos mejor" → empezar con la mesa de Elo persiana 06.1; Paso Audio EditXApache-2.0) es el modelo abierto más alto que puedes enviar.
¿Todo listo para crear con IndexTTS2?
Abre Texto a voz con este motor seleccionado y empieza con tu propio modelo de voz.