Análisis exhaustivo de modelos TTS de código abierto · 2026
03

IndexTTS2.5

bilibili · 5- Actualización de idiomas · Liberado ago 10, 2026

IndexTTS2.5 es un refresco generacional completo en lugar de un parche. La cobertura del idioma va de dos a dos 5 (Chino, inglés, japonés, español, árabe), la inferencia se reconstruye para la velocidad (2.28× más rápido), y el control de la tasa de habla y el control de pronunciación fino son nuevos. Notablemente, es uno de los pocos código abierto TTS modelos con árabe completo apoyo multilingüe y de cierre de voz.

Informe técnico
arXiv:2601.03888
Parámetros
~0.8 B (GPT backbone)
Idiomas
zh, en, ja, es, ar
Producto
22.05 kHz onda
VRAM
~6 GB (bf16) — más bajo en este grupo
RTF
0.2065 bf16 en generalRTX 4090)
Licencia
Bilibili Licencia modelo
Descargas
22.5k (ModelScope), 5.49 GB

Actualización 1 — Compresión semántica codec (la palanca de velocidad principal)

La tasa de token semántica disminuye de 50 Hz a 25 Hz, la longitud de la secuencia de alambre y por lo tanto aproximadamente a la mitad compute y memoria en T2S y S2M. Medido T2S RTF cayó de 0.232 (v2.0) a 0.119 (v2.5).

Actualización 2 — S2M backbone: U-DiT → Zipformer

BackboneEstructuraParamsMACs / frameS2M RTF
U-DiT (v2.0)12 × 512110 M200 M0.078
Zipformer (v2.5)8 × 512 + 4×FFN(1024)68 M48 M0.017

Zipformer interleaves grouped convolutions with lightweight attention (O(L·d·k) + O(L·d·log L), k = 5) para un mejor modelado de largo alcance a menor costo. Efecto neto: ~4.6× más rápido S2M, 38 M menos parámetros. En pruebas de preferencia subjetiva pares, 56% los oyentes preferían la salida basada en Zipformer a pesar de ser el modelo más pequeño.

Actualización 3 — Estrategia multilingüe

La formación multilingüe sufre de superposición de caracteres entre idiomas, lo que confunde el tokenizador. Se evaluaron tres estrategias complementarias:

  • Boundary-aware alignment — marcadores de lenguaje-ID explícitos (por ejemplo, <ZH>) insertado alrededor de cada segmento.
  • Concatenación a nivel de Token — cada token de texto se fusiona con una incrustación específica del idioma. Esto entregó el mayor semejanza de altavoz y menor WER en los cuatro idiomas evaluados, y es el enfoque que utiliza el modelo liberado.
  • Generación guiada por la instrucción — un prefijo de lenguaje natural ("Por favor lee esto en inglés") elimina la necesidad de etiquetas de lenguaje externas en tiempo de inferencia.

Zero-shot emoción transferencia funciona incluso sin etiquetas emocionales de lenguaje objetivo: japonés ES = 0.846, Español ES = 0.924.

Actualización 4 — GRPO refuerzo de la capacitación posterior

En la etapa de post-entrenamiento T2S, el equipo aplica GRPO (Group Relative Policy Optimization) usando un modelo de ASR congelado WER como la señal de recompensa. Cuatro secuencias semánticas candidatas son muestreadas por entrada y las más altas se refuerzan, con regularización KL para prevenir la deriva.

métricaAntes de RLDespués de RL
Inglés WER1.889%1.732%
japonés WER9.949%9.770%
Similitud del altavozEstable o ligeramente mejorado

Nueva superficie de control

CapacidadAPI / sintaxis
Control de vozduration_factor, continuo desde 0.5× a 2.0×
pronunciación china<行|XING2> — pinyin + tono
pronunciación en inglés<minute|M IH1 . N AH0 T> — Teléfonos CMU
pronunciación japonesa<上手|じょうず> — kana
Intensidad de la emociónemo_alpha escala la fuerza emocional; emo_vector toma 8-float vector
Inferencia de emocionesInferencia automática del tono emocional del propio texto

Despliegue

  • Python 3.10–3.11, NVIDIA GPU, ~6 GB VRAM bf16 — el más bajo de los cinco modelos aquí.
  • Instalación: clone el repo oficial → uv sync --all-extras → descarga IndexTeam/IndexTTS-2.5 de Hugging Face o ModelScope.
  • Web UI: uv run webui.py → http://127.0.0.1:7860. Python API y una demo de Gradio local también se proporcionan.
  • Las recetas de despliegue de vLLM están incluidas — este es el más listo para la producción de los cinco para el servicio de alta velocidad.
  • Modelos auxiliares (w2v-bert-2.0, MpregunteGCT semantic codec, CAMPPlus, BigVGAN) descargar automáticamente a primera vista.
  • Los ganglios comunitarios ComfyUI existen: BSAI_ComfyUI_IndexTTS-2.5 y ComfyUI_JR_IndexTTS25.
Opinión comunitaria que vale la pena saber: varios usuarios informan que el texto mixto chino-inglés todavía ocasionalmente hace el inglés inestablemente, y que la mejora perceptible sobre IndexTTS2 en inglés no siempre es dramático. Otros elogian la velocidad y el alcance multilingüe. El consejo estándar se aplica: fijar un clip de referencia, un script de lenguaje mixto y una instrucción de emoción, luego comparar 2 vs 2.5 en mispronunciaciones, cumplimiento de emociones y su propia máquina RTF.

Casos de uso: la cobertura más amplia de este grupo

EscenarioCómo ejecutarloCuidado.
Película multilingüe y doblaje de forma cortaEl único modelo aquí con control de duración explícito (0.5×–2.0× velocidad continua), por lo que una traducción puede ser comprimida de nuevo en la línea de tiempo originalLa duración media de la frase difiere 20–40% en todos los idiomas; no esperes un ajuste de primer paso
Libros de audio y narración de larga duraciónChunk by paragraph, keep 10% solapamiento, reutilizar un clip de referencia a travésLas especificaciones de entrega son una puerta automatizada — ver la lista ACX abajo
Línea de activos de voz NPCGenerar miles de líneas fuera de línea en un lote a un costo cercano a cero marginalLo que realmente bloquea es el formato del motor, no el modelo — véase infra
Notificaciones a granel de centro de llamadas / IVRRTF 0.20 más una receta VLLM significa un solo 4090 puede llevar carga de producciónLa cola de pico-hora es real; usted necesita caché y un techo de concurrencia
clonación árabe, japonés y españolCinco idiomas más transferencia multilingüe; zh→semejanza de altavoz ja 75.82 es lo mejor aquíInglés todavía wobbles en texto mixto zh/en — Pruébalo
Distribución multilingüe de podcastCerrar un show completo en varios idiomas mientras mantiene el timbre del hostLos derechos de divulgación de información AI en los segmentos de anuncios son más estrictos

Audiolibros: Las especificaciones de entrega ACX son una puerta automatizada

TemaRequisitos ACXCómo la generación de IA generalmente falla
ContainerMP3, 192 kbps+ CBRExportado como VBR — rechazo inmediato
Tasa de muestreo44.1 kHzModelo emite 22.05 / 24 / 48 kHz; necesidades de muestreo
CanalesMono o estéreo, consistente en el libroAjustes de la deriva entre capítulos
Dosis media (RMS)−23 dB a18 dBLa producción de IA cruda generalmente aterriza en −26 to −24 dB — demasiado tranquilo
Peak≤ −3 dBConsonantes duros clip a 0 dB después de la normalización
Noise floor< −60 dB RMSRespiración sintetizada / tono de habitación sentado sobre él
Longitud del archivo≤ 120 minutos cada unoLibro completo en un archivo
Tono de cabeza / cola0.5–1 s cabeza, 1–5 s colaTrimming agresivo pone el primer teléfono en la muestra cero
Muestra de cola1–5 min, contenido sóloCréditos mezclados en
Anuncio de informaciónDeclare AI narration in submission metadataOlvidado en el momento de la presentación
Aquí es donde AI tiene una ventaja estructural: no mic hiss, no HVAC rumble, no plosives from real breathing — el suelo de ruido comienza cerca de silencio. Por lo tanto, tu trabajo es normalización de ruido y control de picoNo denoizando. Por el contrario, no cuente con un denoiser para rescatar una mala exportación.

Juegos: el motor te bloquea, no el modelo

Formato &quot; tasa de muestra &quot;

Unreal Engine 5 quiere WAV16-bit, 44.1 kHzOGG Vorbis.

Supresión de un MP3 en costes directos 200–300 ms de la latencia de decodificación, y la sincronización de labios se ha ido.

La falla clásica: la salida del modelo 48 kHz, el proyecto Fuente de audio está establecido 44.1 kHz, y la línea juega a doble velocidad.

Ajustes del motor

UE5: la clase de sonido debe establecerse en "Diálogo". La clase SFX predeterminada se aplica 4:1 compresión que amplifica susurros y gritos planos.

Unidad: Tipo de carga fuente de audio — líneas bajo 10 s use Compressed in Memory, las líneas más largas cambian a Streaming.

Gestión de activos

Pasado 500 líneas de diálogo arreglar un esquema de nombres antes de generar cualquier cosa, e.g. CHARACTER_EMOTION_LINEID.wav.

De lo contrario pasas más tiempo reconciliando archivos para desencadenar eventos que guardaste generandolos.

Presupuesto de ejecución

Más que 50–100 sLas líneas de voz inultáneas en una escena provocan picos de memoria; necesita una piscina de audio y LOD (sincronización de labios deshabilitable en NPCs distantes).

Meta a 50–70% cache hit rate: pre-render ritmos predecibles, generar sólo diálogo emergente en vivo.

Dubbing: la imagen del costo

EnfoquePor minuto · por idiomaTurnaroundFits
Doblaje de estudio humano$100–5002–6 semanasTheatrical, broadcast, flagship brand work
Totalmente automatizada AI$2–20El mismo díaVideo, cursos, volumen de marketing
AI + examen humano$50–200DíasContenido sensible a la marca o regulado
Este modelo, auto hospedado≈ $0.003 (GPU únicamente)InmediatamenteUsted construye el oleoducto; excluye el trabajo y las operaciones
No olvides el límite: 2.5 es el modelo más rápido aquí, pero es un content-producción motor, no un conversaciones uno — sub-300 ms el primer audio todavía pertenece a los motores cerrados como Cartesia Sonic, Inworld y ElevenLabs Flash. Para usarlo en un agente de voz en vivo usted debe construir VAD, endpointing semántico y barge-in usted mismo (típicamente en LiveKit o Pipecat) y superponer cada etapa. Una tubería de serie ingenua supera siempre un segundo, y la conversación humana no tolerará que — media turn-making gaps run 200–300 ms, y pasado 700 ms una pausa lee como un lag.

Veredicto para usuarios internacionales

Uselo si necesita clonación árabe, japonés o español de un modelo compacto, quiere servicio de producción vLLM, o necesita un control continuo de la tarifa de habla para los flujos de trabajo bloqueados con subtítulos.

Cuidado. el Bilibili Licencia modelo, que requiere un acuerdo comercial escrito por separado arriba 100M MAU o ¥1B ingresos anuales — a threshold most startups will not hit, but enterprises should review careful.

5 idiomas 2.28× más rápido 0.5×–2.0× velocidad Pinyin / CMU / Kana recetas vLLM Licencia restringida

Donde se sienta en los datos cabeza a cabeza

Esto es lo único IndexTTS modelo en CV3-Eval, y aparece dos veces (base y RL). A continuación están los cuatro rivales más cercanos; la tabla completa de nueve modelos está en 06.2.

ModeloParamsChino WER / SSInglés WER / SSEspañol WER / SS
IndexTTS2.50.8 B4.36 / 77.105.12 / 68.063.75 / 76.39
IndexTTS2.5-RL0.8 B3.93 / 77.923.89 / 67.793.33 / 76.68
CosyVoice3-0.5B0.5 B3.84 / 80.014.88 / 74.164.04 / 78.85
Qwen3-TTS1.7 B3.27 / 73.025.06 / 67.172.87 / 73.17
MOSS-TTS-v1.58 B4.02 / 72.684.45 / 67.463.83 / 71.75
Modelozh→en inglés WER / SSzh→es WER / SSzh→ja WER / SS
IndexTTS2.53.62 / 63.835.17 / 65.486.57 / 74.16
IndexTTS2.5-RL3.55 / 67.474.86 / 64.476.38 / 75.82
CosyVoice3-0.5B3.23 / 62.794.58 / 64.04—
Qwen3-TTS5.74 / 63.045.15 / 68.0236.09 / 65.71
ModeloPrecisiónEn general RTFCondiciones
IndexTTS2.5bf160.2065RTX 4090, kv cache=True
IndexTTS2 (referencia)fp160.3257RTX 4090
VoxCPM2 (referencia)bf16~0.30~0.13 bajo Nano-VLLM
OmniVoice (referencia)—0.025H100 + núcleos personalizados; ~0.9–1.2× en tiempo real en Apple Silicon
Tres escapadas. (1) Para el trabajo multilingüe de estilo dubbing gana el set — mejor zh→en inglés WER (3.55) y el mejor zh→semejanza de altavoz (75.82), que es exactamente la alineación que el control de duración te compra. (2) No gana la similitud monolingüe china — CosyVoice 3 pistas 80.01 contra la 2.5- RL en 77.92, a 2.1- Punto de diferencia. (3) El conteo del parámetro no se mantiene aquí — 0.8 B beats MOSS-TTS-v1.5 a 8 B.

Lo que cuesta correrse

ConfiguraciónRTFGPU-horas / M charsA demanda RTX 4090A demanda A100
IndexTTS2.5 (bf16)0.20653.7 h~$2.75~$5.91
Referencia: VoxCPM2 (Nano-VLLM)~0.132.3 h~$1.73~$3.72
ComparaciónCosto / M charsmúltiple
ElevenLabs v3$60–180~22–65×
ElevenLabs Flash$50–55~18–20×
OpenAI tts-1$15~5.5×
Google / Polly Standard$4~1.5×
La parte de esta tabla que importa más que la tabla de calidad: IndexTTS2.5 es sólo opción donde baja VRAM (~6 GB), bajo RTF (0.2065) y cinco idiomas todos se mantienen a la vez — que significa un solo RTX 4090 puede llevar carga de producción en lugar de una A100. Se siguen aplicando dos realidades: mundo real RTF típicamente 2–5× más lento que la figura del papel, y el costo de ingeniería (distribución, monitoreo, retries, cosido en pedazos) generalmente supera el GPU factura por orden de magnitud.

Licence and disclosure gate

TemaSituación
Licencia por códigoFuente abierta
Licencia de pesoBilibili Licencia modelo
Uso comercialPermiso, pero un se requiere un acuerdo escrito separado 100M MAU o ¥1B ingresos anuales
Marca de agua predeterminadaNo declarado → plan on the assumed there is none
Lo que debes añadirAudioSeal / SynthID / C2PA si usted tiene un deber de divulgación; el modelo no envía filtro de contenido
Residencia de datosRuns fully offline
¿Qué tan alto es ese umbral? 100M MAU o ¥1B (~$140M) los ingresos están fuera de alcance para casi cada equipo de inicio y tamaño medio — pero lo hace excluir grandes plataformas. Si usted es una plataforma, este es un verdadero bloqueador y necesita comenzar la conversación de licencia meses por delante, no la semana antes del lanzamiento. See 06.5.

Si no es esto, entonces qué

  • Solo chino, persiguiendo la similitud máxima del altavoz → CosyVoice3-0.5B (Chinese SS 80.01). Chequee su licencia primero — No asumas que está limpio.
  • La licencia debe ser limpia → VoxCPM2 (el costo siendo notablemente más débil zh→es).
  • Modelo abierto más alto que se puede enviar → Paso Audio EditX (Apache-2.0, ciego Elo 1,102).
  • Árabe, sin el Bilibili umbral → nada en este set. Eso es precisamente 2.5Es fosa.
Pruébalo en BiliVoice

¿Todo listo para crear con IndexTTS2.5?

Abre Texto a voz con este motor seleccionado y empieza con tu propio modelo de voz.