IndexTTS2.5
bilibili · 5- Actualización de idiomas · Liberado ago 10, 2026
IndexTTS2.5 es un refresco generacional completo en lugar de un parche. La cobertura del idioma va de dos a dos 5 (Chino, inglés, japonés, español, árabe), la inferencia se reconstruye para la velocidad (2.28× más rápido), y el control de la tasa de habla y el control de pronunciación fino son nuevos. Notablemente, es uno de los pocos código abierto TTS modelos con árabe completo apoyo multilingüe y de cierre de voz.
- Informe técnico
- arXiv:2601.03888
- Parámetros
- ~0.8 B (GPT backbone)
- Idiomas
- zh, en, ja, es, ar
- Producto
- 22.05 kHz onda
- VRAM
- ~6 GB (bf16) — más bajo en este grupo
- RTF
- 0.2065 bf16 en generalRTX 4090)
- Licencia
- Bilibili Licencia modelo
- Descargas
- 22.5k (ModelScope), 5.49 GB
Actualización 1 — Compresión semántica codec (la palanca de velocidad principal)
La tasa de token semántica disminuye de 50 Hz a 25 Hz, la longitud de la secuencia de alambre y por lo tanto aproximadamente a la mitad compute y memoria en T2S y S2M. Medido T2S RTF cayó de 0.232 (v2.0) a 0.119 (v2.5).
Actualización 2 — S2M backbone: U-DiT → Zipformer
| Backbone | Estructura | Params | MACs / frame | S2M RTF |
|---|---|---|---|---|
| U-DiT (v2.0) | 12 × 512 | 110 M | 200 M | 0.078 |
| Zipformer (v2.5) | 8 × 512 + 4×FFN(1024) | 68 M | 48 M | 0.017 |
Zipformer interleaves grouped convolutions with lightweight attention (O(L·d·k) + O(L·d·log L), k = 5) para un mejor modelado de largo alcance a menor costo. Efecto neto: ~4.6× más rápido S2M, 38 M menos parámetros. En pruebas de preferencia subjetiva pares, 56% los oyentes preferían la salida basada en Zipformer a pesar de ser el modelo más pequeño.
Actualización 3 — Estrategia multilingüe
La formación multilingüe sufre de superposición de caracteres entre idiomas, lo que confunde el tokenizador. Se evaluaron tres estrategias complementarias:
- Boundary-aware alignment — marcadores de lenguaje-ID explícitos (por ejemplo,
<ZH>) insertado alrededor de cada segmento. - Concatenación a nivel de Token — cada token de texto se fusiona con una incrustación específica del idioma. Esto entregó el mayor semejanza de altavoz y menor WER en los cuatro idiomas evaluados, y es el enfoque que utiliza el modelo liberado.
- Generación guiada por la instrucción — un prefijo de lenguaje natural ("Por favor lee esto en inglés") elimina la necesidad de etiquetas de lenguaje externas en tiempo de inferencia.
Zero-shot emoción transferencia funciona incluso sin etiquetas emocionales de lenguaje objetivo: japonés ES = 0.846, Español ES = 0.924.
Actualización 4 — GRPO refuerzo de la capacitación posterior
En la etapa de post-entrenamiento T2S, el equipo aplica GRPO (Group Relative Policy Optimization) usando un modelo de ASR congelado WER como la señal de recompensa. Cuatro secuencias semánticas candidatas son muestreadas por entrada y las más altas se refuerzan, con regularización KL para prevenir la deriva.
| métrica | Antes de RL | Después de RL |
|---|---|---|
| Inglés WER | 1.889% | 1.732% |
| japonés WER | 9.949% | 9.770% |
| Similitud del altavoz | Estable o ligeramente mejorado | |
Nueva superficie de control
| Capacidad | API / sintaxis |
|---|---|
| Control de voz | duration_factor, continuo desde 0.5× a 2.0× |
| pronunciación china | <行|XING2> — pinyin + tono |
| pronunciación en inglés | <minute|M IH1 . N AH0 T> — Teléfonos CMU |
| pronunciación japonesa | <上手|じょうず> — kana |
| Intensidad de la emoción | emo_alpha escala la fuerza emocional; emo_vector toma 8-float vector |
| Inferencia de emociones | Inferencia automática del tono emocional del propio texto |
Despliegue
- Python 3.10–3.11, NVIDIA GPU, ~6 GB VRAM bf16 — el más bajo de los cinco modelos aquí.
- Instalación: clone el repo oficial →
uv sync --all-extras→ descargaIndexTeam/IndexTTS-2.5de Hugging Face o ModelScope. - Web UI:
uv run webui.py→http://127.0.0.1:7860. Python API y una demo de Gradio local también se proporcionan. - Las recetas de despliegue de vLLM están incluidas — este es el más listo para la producción de los cinco para el servicio de alta velocidad.
- Modelos auxiliares (w2v-bert-2.0, MpregunteGCT semantic codec, CAMPPlus, BigVGAN) descargar automáticamente a primera vista.
- Los ganglios comunitarios ComfyUI existen:
BSAI_ComfyUI_IndexTTS-2.5yComfyUI_JR_IndexTTS25.
Casos de uso: la cobertura más amplia de este grupo
| Escenario | Cómo ejecutarlo | Cuidado. |
|---|---|---|
| Película multilingüe y doblaje de forma corta | El único modelo aquí con control de duración explícito (0.5×–2.0× velocidad continua), por lo que una traducción puede ser comprimida de nuevo en la línea de tiempo original | La duración media de la frase difiere 20–40% en todos los idiomas; no esperes un ajuste de primer paso |
| Libros de audio y narración de larga duración | Chunk by paragraph, keep 10% solapamiento, reutilizar un clip de referencia a través | Las especificaciones de entrega son una puerta automatizada — ver la lista ACX abajo |
| Línea de activos de voz NPC | Generar miles de líneas fuera de línea en un lote a un costo cercano a cero marginal | Lo que realmente bloquea es el formato del motor, no el modelo — véase infra |
| Notificaciones a granel de centro de llamadas / IVR | RTF 0.20 más una receta VLLM significa un solo 4090 puede llevar carga de producción | La cola de pico-hora es real; usted necesita caché y un techo de concurrencia |
| clonación árabe, japonés y español | Cinco idiomas más transferencia multilingüe; zh→semejanza de altavoz ja 75.82 es lo mejor aquí | Inglés todavía wobbles en texto mixto zh/en — Pruébalo |
| Distribución multilingüe de podcast | Cerrar un show completo en varios idiomas mientras mantiene el timbre del host | Los derechos de divulgación de información AI en los segmentos de anuncios son más estrictos |
Audiolibros: Las especificaciones de entrega ACX son una puerta automatizada
| Tema | Requisitos ACX | Cómo la generación de IA generalmente falla |
|---|---|---|
| Container | MP3, 192 kbps+ CBR | Exportado como VBR — rechazo inmediato |
| Tasa de muestreo | 44.1 kHz | Modelo emite 22.05 / 24 / 48 kHz; necesidades de muestreo |
| Canales | Mono o estéreo, consistente en el libro | Ajustes de la deriva entre capítulos |
| Dosis media (RMS) | −23 dB a18 dB | La producción de IA cruda generalmente aterriza en −26 to −24 dB — demasiado tranquilo |
| Peak | ≤ −3 dB | Consonantes duros clip a 0 dB después de la normalización |
| Noise floor | < −60 dB RMS | Respiración sintetizada / tono de habitación sentado sobre él |
| Longitud del archivo | ≤ 120 minutos cada uno | Libro completo en un archivo |
| Tono de cabeza / cola | 0.5–1 s cabeza, 1–5 s cola | Trimming agresivo pone el primer teléfono en la muestra cero |
| Muestra de cola | 1–5 min, contenido sólo | Créditos mezclados en |
| Anuncio de información | Declare AI narration in submission metadata | Olvidado en el momento de la presentación |
Juegos: el motor te bloquea, no el modelo
Formato " tasa de muestra "
Unreal Engine 5 quiere WAV16-bit, 44.1 kHzOGG Vorbis.
Supresión de un MP3 en costes directos 200–300 ms de la latencia de decodificación, y la sincronización de labios se ha ido.
La falla clásica: la salida del modelo 48 kHz, el proyecto Fuente de audio está establecido 44.1 kHz, y la línea juega a doble velocidad.
Ajustes del motor
UE5: la clase de sonido debe establecerse en "Diálogo". La clase SFX predeterminada se aplica 4:1 compresión que amplifica susurros y gritos planos.
Unidad: Tipo de carga fuente de audio — líneas bajo 10 s use Compressed in Memory, las líneas más largas cambian a Streaming.
Gestión de activos
Pasado 500 líneas de diálogo arreglar un esquema de nombres antes de generar cualquier cosa, e.g. CHARACTER_EMOTION_LINEID.wav.
De lo contrario pasas más tiempo reconciliando archivos para desencadenar eventos que guardaste generandolos.
Presupuesto de ejecución
Más que 50–100 sLas líneas de voz inultáneas en una escena provocan picos de memoria; necesita una piscina de audio y LOD (sincronización de labios deshabilitable en NPCs distantes).
Meta a 50–70% cache hit rate: pre-render ritmos predecibles, generar sólo diálogo emergente en vivo.
Dubbing: la imagen del costo
| Enfoque | Por minuto · por idioma | Turnaround | Fits |
|---|---|---|---|
| Doblaje de estudio humano | $100–500 | 2–6 semanas | Theatrical, broadcast, flagship brand work |
| Totalmente automatizada AI | $2–20 | El mismo día | Video, cursos, volumen de marketing |
| AI + examen humano | $50–200 | Días | Contenido sensible a la marca o regulado |
| Este modelo, auto hospedado | ≈ $0.003 (GPU únicamente) | Inmediatamente | Usted construye el oleoducto; excluye el trabajo y las operaciones |
Veredicto para usuarios internacionales
Uselo si necesita clonación árabe, japonés o español de un modelo compacto, quiere servicio de producción vLLM, o necesita un control continuo de la tarifa de habla para los flujos de trabajo bloqueados con subtítulos.
Cuidado. el Bilibili Licencia modelo, que requiere un acuerdo comercial escrito por separado arriba 100M MAU o ¥1B ingresos anuales — a threshold most startups will not hit, but enterprises should review careful.
Donde se sienta en los datos cabeza a cabeza
Esto es lo único IndexTTS modelo en CV3-Eval, y aparece dos veces (base y RL). A continuación están los cuatro rivales más cercanos; la tabla completa de nueve modelos está en 06.2.
| Modelo | Params | Chino WER / SS | Inglés WER / SS | Español WER / SS |
|---|---|---|---|---|
| IndexTTS2.5 | 0.8 B | 4.36 / 77.10 | 5.12 / 68.06 | 3.75 / 76.39 |
| IndexTTS2.5-RL | 0.8 B | 3.93 / 77.92 | 3.89 / 67.79 | 3.33 / 76.68 |
| CosyVoice3-0.5B | 0.5 B | 3.84 / 80.01 | 4.88 / 74.16 | 4.04 / 78.85 |
| Qwen3-TTS | 1.7 B | 3.27 / 73.02 | 5.06 / 67.17 | 2.87 / 73.17 |
| MOSS-TTS-v1.5 | 8 B | 4.02 / 72.68 | 4.45 / 67.46 | 3.83 / 71.75 |
| Modelo | zh→en inglés WER / SS | zh→es WER / SS | zh→ja WER / SS |
|---|---|---|---|
| IndexTTS2.5 | 3.62 / 63.83 | 5.17 / 65.48 | 6.57 / 74.16 |
| IndexTTS2.5-RL | 3.55 / 67.47 | 4.86 / 64.47 | 6.38 / 75.82 |
| CosyVoice3-0.5B | 3.23 / 62.79 | 4.58 / 64.04 | — |
| Qwen3-TTS | 5.74 / 63.04 | 5.15 / 68.02 | 36.09 / 65.71 |
| Modelo | Precisión | En general RTF | Condiciones |
|---|---|---|---|
| IndexTTS2.5 | bf16 | 0.2065 | RTX 4090, kv cache=True |
| IndexTTS2 (referencia) | fp16 | 0.3257 | RTX 4090 |
| VoxCPM2 (referencia) | bf16 | ~0.30 | ~0.13 bajo Nano-VLLM |
| OmniVoice (referencia) | — | 0.025 | H100 + núcleos personalizados; ~0.9–1.2× en tiempo real en Apple Silicon |
Lo que cuesta correrse
| Configuración | RTF | GPU-horas / M chars | A demanda RTX 4090 | A demanda A100 |
|---|---|---|---|---|
| IndexTTS2.5 (bf16) | 0.2065 | 3.7 h | ~$2.75 | ~$5.91 |
| Referencia: VoxCPM2 (Nano-VLLM) | ~0.13 | 2.3 h | ~$1.73 | ~$3.72 |
| Comparación | Costo / M chars | múltiple |
|---|---|---|
| ElevenLabs v3 | $60–180 | ~22–65× |
| ElevenLabs Flash | $50–55 | ~18–20× |
OpenAI tts-1 | $15 | ~5.5× |
| Google / Polly Standard | $4 | ~1.5× |
Licence and disclosure gate
| Tema | Situación |
|---|---|
| Licencia por código | Fuente abierta |
| Licencia de peso | Bilibili Licencia modelo |
| Uso comercial | Permiso, pero un se requiere un acuerdo escrito separado 100M MAU o ¥1B ingresos anuales |
| Marca de agua predeterminada | No declarado → plan on the assumed there is none |
| Lo que debes añadir | AudioSeal / SynthID / C2PA si usted tiene un deber de divulgación; el modelo no envía filtro de contenido |
| Residencia de datos | Runs fully offline |
Si no es esto, entonces qué
- Solo chino, persiguiendo la similitud máxima del altavoz → CosyVoice3-0.5B (Chinese SS 80.01). Chequee su licencia primero — No asumas que está limpio.
- La licencia debe ser limpia → VoxCPM2 (el costo siendo notablemente más débil zh→es).
- Modelo abierto más alto que se puede enviar → Paso Audio EditX (Apache-2.0, ciego Elo 1,102).
- Árabe, sin el Bilibili umbral → nada en este set. Eso es precisamente 2.5Es fosa.
¿Todo listo para crear con IndexTTS2.5?
Abre Texto a voz con este motor seleccionado y empieza con tu propio modelo de voz.