开源 TTS 模型深度解析 · 2026
03

IndexTTS2.5

bilibili · 5- 语言升级 · 8月释放 10, 2026

IndexTTS2.5 是一个完整的世代更新而不是补丁。 语言报道从两个到 5个 (中文,英文,日文,西班牙文,阿拉伯文) 推论为速度重建(简体中文)2.28× 快点)),并且语音率控制和精细的发音控制都是新的. 值得注意的是,它是极少数开放源代码之一 TTS 模式为 完整阿拉伯语 语音克隆和跨语言支持.

技术报告
arXiv: (中文(简体) ).2601.03888
参数
~0.8 B (GPT主干线)
语文
zh, en, ja, es, ar, i, i, i, i, i, i, er
产出
22.05 kHz 波形
VRAM
~6 GB (bf16) (中文(简体) ). — 这一组中最低的
RTF
0.2065 bf16 总计RTX 4090)
许可证
Bilibili 示范许可证
下载
22.5k(模式范围), 5.49 GB

升级 1 — 语义解码器压缩(主速度杠杆)

语义符号框速率从 50 Hz 改为 25 Hz,将序列长度减半,从而将T2S和S2M的计算和内存大致减半。 测量 T2S RTF 从 0.232 (v2.0改为 0.119 (v2.5).

升级 2 — S2M 骨干: U-DiT → zipformer 语录

后骨头结构参数MACs / 帧S2M RTF
U-DiT(v2. ) (中文(简体) ).0)12 × 512110 M200 M0.078
Zip(v2.5)8 × 512 + 4×FFN (中文(简体) ).1024)68 M48 M0.017

Zipformer 互叶片以轻量级的注意(O(L·d·k) + O(L·d·日志L), k = 5以较低成本改进远程建模。 净效果 : ~4.6× 更快的S2M, 38 M 参数减少. 在组合的主观偏好测试中, 56% 偏好基于 Zipformer 的输出 尽管它是较小的模型。

升级 3 — 跨文化战略

多语种培训存在语言之间的字符重叠,这混淆了标语符. 评估了三项补充战略:

  • 边界意识调整 — 明确的语言ID标记(例如) <ZH>在每一段前后插入。
  • 收件层连接 — 每个文本符号都与特定语言的嵌入连接。 这个送来了 发言者最相似和最少 WER 所有四种评价语文,是发布的模型所使用的方法。
  • 指令制导生成 — 一个自然语言的前缀("请用英语读这个")在推论时间可以消除外部语言标记的需要.

零镜头情感转移即使没有目标语言情感标签也能工作: 日语ES= 0.846, 西班牙语: 0.924.

升级 4 — GPRO 培训后强化学习

在T2S的训练后阶段,团队应用 GPRO( 集团相对政策优化) 使用冷冻的ASR型号 WER 作为奖励信号。 4个候选语义序列每个输入都进行取样,更高的奖励序列得到加强,KL规范化以防止漂移.

度量衡在 RL 之前在RL之后
联合国 WER1.889%1.732%
日语 WER9.949%9.770%
发言者的相似性稳定或稍有改进

新建可控表面

能力API / 语法
语音率控制duration_factor,连续从 0.5× 改为 2.0×
汉语发音<行|XING2> — Pinyin + 音调
英语发音<minute|M IH1 . N AH0 T> — CMU 电话
日本语发音<上手|じょうず> — 加纳
情感强度emo_alpha 衡量情感力量; emo_vector 拿着 8-浮动向量
情感推论从文字本身自动推断情感语气

部署

  • Py 3.10–3.11, NVIDIA GPU, ~6 GB VRAM 在bf16时 — 这是这五个模型中最低的
  • 安装: 复制正式的 Repo → uv sync --all-extras → 下载 IndexTeam/IndexTTS-2.5 从拥抱面部或模型范围。
  • 网络用户界面 : uv run webui.py → http://127.0.0.1:7860. Py API 还提供当地Gradio演示。
  • 包含 vLLM 部署配方 — 这是五种高通量服务中最有生产能力的。
  • 辅助模型(w2v-bert-)2.0, M询问GCT语义解码器,CAMPPlus,BigVGAN)在第一运行时自动下载.
  • ComfyUI社区节点存在: BSAI_ComfyUI_IndexTTS-2.5 和 ComfyUI_JR_IndexTTS25.
值得了解的社区反馈: 一些用户报告说,混合的中英文文本仍然偶尔使英语难以令人相信,可见的改进比 IndexTTS2 英语并不总是戏剧性的。 其他人赞扬速度和多种语言的普及。 标准建议适用:固定一个参考片段,一个混合语言脚本和一个情感指导,然后比较 2 数字 2.5 读音错误,情绪遵守 和你自己的机器 RTF.

使用案例:本组中覆盖面最广

假设如何运行它小心点
多语种电影和短片配音唯一一个有明确期限控制的模型0.5×–2.0× 因此,翻译可以压缩回原时间线平均刑期不同 20–40% 横跨语言; 不要期望先通过
音频书和长式说明按段落划, 保留 10% 重叠、再利用送货规格是自动门 — 参见下面的ACX列表
游戏 NPC 语音资产行以接近零边际成本在一批次中产生数千条线断线引擎格式,而不是模型 — 见下文
呼叫中心批量通知/IVRRTF 0.20 加上一个 vLLM 配方表示单曲 4090 可以携带生产载荷高峰时数排队是真实的; 你需要缓冲和货币上限
阿拉伯文、日文和西班牙文的克隆5种语言加跨语言传导; zh→ja 扬声器的相似性 75.82 这里最好英语在混合zh/en文本中仍然摇摆 — 试试看
跨语言播客分发将整个节目克隆成多种语言,同时保留主机的调色调AI广告部门的披露义务正在收紧

音频书:ACX送货规格是自动门

项目ACX要求AI世代如何典型的失败
集装箱MP3, 单曲 192 千位点+ 简历导出为 VBR — 即时拒绝
抽样率44.1 kHz型号发射 22.05 / 24 / 48 kHz; 需要复制
频道单声道或立体声, 全书一致章节之间的设置漂移
平均音响(RMS)−23 dB 改为 -18 页:1原始AI输出通常降落在−26 改为:24 页:1 — 太安静了
峰顶≤ −3 页:1硬对齐剪辑到 0 正常化后的 dB
噪音层< −60 dB 人力资源科合成气息/房间声调坐在上面
文件长度≤ 120 每分钟一个文件中的全书
头/尾音0.5–1 s 头 1–5 s 尾声冲动的修剪把第一个电话放在0样本上
零售样本1–5 分钟, 只包含内容混合贷项
AI 披露在提交元数据中宣布AI描述提交时被遗忘
这就是AI具有结构优势的地方: 没有麦克风他的,没有HVAC隆波, 没有从真正的呼吸的破损 — 噪音地板开始近乎寂静。 因此,你的工作是: 你的工作是, 音响常态化和峰值控制而不是发号施令 反之,不要指望一个德诺瓦人来拯救一个坏出口。

游戏:引擎挡住你,而不是模型

格式化和样本率( S)

非真实引擎 5 想要的WAV (英语:16- 贝蒂 44.1 kHz或OGG Vorbis. (英语).

在直接成本中丢弃 MP3 200–300 ms 解码间隔嘴唇同步已经消失

经典失败:模型输出 48 kHz,项目音频源设置为 44.1 kHz,该线以双倍速度运行。

引擎设置

UE5: 声音类 必须设定为“对话”. 默认 SFX 类适用 4:1 压缩能放大低声和平声高喊.

团结: 音频源装入类型 — 下划线 10 s 在内存中使用压缩,较长的行切换到Streaming.

资产管理

过去 500 对话框, 在生成任何东西之前先修补命名方案, e.g. CHARACTER_EMOTION_LINEID.wav.

否则,你花费更多的时间调节文件以触发事件,而不是保存生成它们.

预算执行情况

超过 50–100 s一个场景中的非同步语音线会导致内存尖锐;您需要音频集合和LOD(在遥远的NPC上无法唇同步).

目标a 50–70% 缓存命中率:预发可预期的节拍,只生成即兴对话框进行直播.

拨乱反正:成本图

方针每分钟 · 每个语文转身适应
人类工作室的配乐$100–5002–6 周数戏剧,广播,旗舰品牌作品
全自动 AI$2–20当天短式视频、课程、营销量
AI + 人类审查$50–200天数品牌敏感或规范的内容
这个模型是自办的≈ $0.003 (GPU 仅限)即刻你建造管道,不包括劳动力和作战
别忘了边界: 2.5 是这里最快的模特儿 内容制作 引擎,而不是一个 对话 一个 — 次级300 ms 首个音频仍然属于诸如Cartesia Sonic、Inworld和 ElevenLabs 闪电 要在现场语音代理中使用它,你必须建立VAD,语义端点和驳船自己(通常在LiveKit或Pipecat上)并重叠每个舞台. 一个天真连环的管道 总是超过一秒钟, 而人类的对话不会容忍 — 平均转折差距运行 200–300 ms和过去 700 ms 暂停读作滞后。

对国际用户的判决

如果 您需要从紧凑的模型中复制阿拉伯语,日语或西班牙语, 您需要制作 vLLM 服务, 或者您需要持续对字幕锁定的工作流程的语音率控制 。

小心点 联合国 Bilibili 示范许可证,其中要求上面另订书面商业协议 100M MAU 或 ¥1B 年度收入 — 多数创业企业不会受到冲击,但企业应仔细审查。

5 语言 2.28× 快点 0.5×–2.0× 速度 Pinyin / CMU / 坎纳语 vLLM 食谱 限制性许可证

在头对头数据中的位置

这是唯一的 IndexTTS 模型在CV3-Eval中,并出现两次(基和RL). 下面是四个最接近的对手; 完整的9型表格在 06.2.

型号参数中文 WER / 党卫军联合国 WER / 党卫军西班牙语 WER / 党卫军
IndexTTS2.50.8 B4.36 / 77.105.12 / 68.063.75 / 76.39
IndexTTS2.5-RL0.8 B3.93 / 77.923.89 / 67.793.33 / 76.68
CosyVoice3 - (英语).0.5B0.5 B3.84 / 80.014.88 / 74.164.04 / 78.85
Quen3 - (英语).TTS1.7 B3.27 / 73.025.06 / 67.172.87 / 73.17
MOSS-TTS-v1.58 B4.02 / 72.684.45 / 67.463.83 / 71.75
型号日语→内 WER / 党卫军日语→对 WER / 党卫军日语→对 WER / 党卫军
IndexTTS2.53.62 / 63.835.17 / 65.486.57 / 74.16
IndexTTS2.5-RL3.55 / 67.474.86 / 64.476.38 / 75.82
CosyVoice3 - (英语).0.5B3.23 / 62.794.58 / 64.04—
Quen3 - (英语).TTS5.74 / 63.045.15 / 68.0236.09 / 65.71
型号精确度A. 总表 RTF条件
IndexTTS2.5页:10.2065RTX 4090时, kv cache= True
IndexTTS2 (参考)fp16 请检查url=值 (帮助).0.3257RTX 4090
VoxCPM2 (参考)页:1~0.30~0.13 纳米-紫外线LM
OmniVoice (参考)—0.025H100 + 自定义内核;~0.9–1.2× 在苹果硅上实时
三约出家. (1) 玩花样的跨语言游戏,可以赢 — 顶级→内 WER (3.55)和最佳zh(英语:→ja 扬声器的相似性(75.82),这正是持续时间控制所购买的对齐. (2) 它不会赢得单一语言的汉语相似性 — 声音 3 线索 80.01 反对 2.5-RL在吗? 77.92, a 2.1- 点间隙 (3) 这里没有参数计数 — 0.8 B 节拍 MOSS-TTS-v1.5 时间 8 B.

自己跑起来要花多少钱

设置RTFGPU-小时/M字符点播 RTX 4090点播 A100
IndexTTS2.5 (bf16) (中文(简体) ).0.20653.7 h~$2.75~$5.91
参考: VoxCPM2 (诺-VLLM)~0.132.3 h~$1.73~$3.72
比较成本/ M 字符多个
ElevenLabs v3$60–180~22–65×
ElevenLabs 闪光$50–55~18–20×
开放AI tts-1$15~5.5×
谷歌/ Poly 标准$4~1.5×
本表重于质量表的部分: IndexTTS2.5 这是 仅限低价选项 VRAM (~6 GB),低点 RTF (0.2065)和五种语言同时保持 — 意思是单身 RTX 4090 可以携带生产载荷,而不是 A100. 两种现实依然存在: 现实世界 RTF 通常为 2–5× 慢于纸张图,工程成本(部署、监测、重试、块缝合)通常超过 GPU 法案的数量级。

许可证和披露门

项目状态
代码许可证开源
重量许可证Bilibili 示范许可证
商业用途允许,但a 以上需另行订立书面协议 100M MAU 或 ¥1B 年度收入
默认水印未说明 → 假设没有
您必须添加的内容AudioSeal / SynthID / C2PA 如果您有披露义务; 模型船没有内容过滤器
数据居住全部下线运行
门槛有多高? 100M MAU 或 ¥1B (~$140M几乎每个开办小组和中型小组的收入都无法获得 — 但确实如此 不包括大型平台. 如果你是一个平台,这是一个真正的阻塞器, 你需要开始许可证的对话 几个月前,而不是发射前一周。 见 06.5.

如果没有这个,那么什么

  • 仅限中文,追求最大扬声器的相似性 → CosyVoice3 - (英语).0.5B (中文(简体) 80.01). 先检查一下许可证 — 不要假设它是干净的。
  • 执照必须干净 → VoxCPM2 (成本明显较低)→对
  • 最高等级的开放型号,你可以载运 → 步骤音频编辑X (Apache-2.0盲埃罗 1,102).
  • 阿拉伯语,没有 Bilibili 阈值 → 本片里什么都没有 没错 2.5护城河。
在 BiliVoice 上试用

准备好使用 IndexTTS2.5 创作了吗?

打开文字转语音并自动选中此引擎,即可使用你自己的声音模型开始创作。