IndexTTS2.5
bilibili · 5- 语言升级 · 8月释放 10, 2026
IndexTTS2.5 是一个完整的世代更新而不是补丁。 语言报道从两个到 5个 (中文,英文,日文,西班牙文,阿拉伯文) 推论为速度重建(简体中文)2.28× 快点)),并且语音率控制和精细的发音控制都是新的. 值得注意的是,它是极少数开放源代码之一 TTS 模式为 完整阿拉伯语 语音克隆和跨语言支持.
- 技术报告
- arXiv: (中文(简体) ).2601.03888
- 参数
- ~0.8 B (GPT主干线)
- 语文
- zh, en, ja, es, ar, i, i, i, i, i, i, er
- 产出
- 22.05 kHz 波形
- VRAM
- ~6 GB (bf16) (中文(简体) ). — 这一组中最低的
- RTF
- 0.2065 bf16 总计RTX 4090)
- 许可证
- Bilibili 示范许可证
- 下载
- 22.5k(模式范围), 5.49 GB
升级 1 — 语义解码器压缩(主速度杠杆)
语义符号框速率从 50 Hz 改为 25 Hz,将序列长度减半,从而将T2S和S2M的计算和内存大致减半。 测量 T2S RTF 从 0.232 (v2.0改为 0.119 (v2.5).
升级 2 — S2M 骨干: U-DiT → zipformer 语录
| 后骨头 | 结构 | 参数 | MACs / 帧 | S2M RTF |
|---|---|---|---|---|
| U-DiT(v2. ) (中文(简体) ).0) | 12 × 512 | 110 M | 200 M | 0.078 |
| Zip(v2.5) | 8 × 512 + 4×FFN (中文(简体) ).1024) | 68 M | 48 M | 0.017 |
Zipformer 互叶片以轻量级的注意(O(L·d·k) + O(L·d·日志L), k = 5以较低成本改进远程建模。 净效果 : ~4.6× 更快的S2M, 38 M 参数减少. 在组合的主观偏好测试中, 56% 偏好基于 Zipformer 的输出 尽管它是较小的模型。
升级 3 — 跨文化战略
多语种培训存在语言之间的字符重叠,这混淆了标语符. 评估了三项补充战略:
- 边界意识调整 — 明确的语言ID标记(例如)
<ZH>在每一段前后插入。 - 收件层连接 — 每个文本符号都与特定语言的嵌入连接。 这个送来了 发言者最相似和最少 WER 所有四种评价语文,是发布的模型所使用的方法。
- 指令制导生成 — 一个自然语言的前缀("请用英语读这个")在推论时间可以消除外部语言标记的需要.
零镜头情感转移即使没有目标语言情感标签也能工作: 日语ES= 0.846, 西班牙语: 0.924.
升级 4 — GPRO 培训后强化学习
在T2S的训练后阶段,团队应用 GPRO( 集团相对政策优化) 使用冷冻的ASR型号 WER 作为奖励信号。 4个候选语义序列每个输入都进行取样,更高的奖励序列得到加强,KL规范化以防止漂移.
| 度量衡 | 在 RL 之前 | 在RL之后 |
|---|---|---|
| 联合国 WER | 1.889% | 1.732% |
| 日语 WER | 9.949% | 9.770% |
| 发言者的相似性 | 稳定或稍有改进 | |
新建可控表面
| 能力 | API / 语法 |
|---|---|
| 语音率控制 | duration_factor,连续从 0.5× 改为 2.0× |
| 汉语发音 | <行|XING2> — Pinyin + 音调 |
| 英语发音 | <minute|M IH1 . N AH0 T> — CMU 电话 |
| 日本语发音 | <上手|じょうず> — 加纳 |
| 情感强度 | emo_alpha 衡量情感力量; emo_vector 拿着 8-浮动向量 |
| 情感推论 | 从文字本身自动推断情感语气 |
部署
- Py 3.10–3.11, NVIDIA GPU, ~6 GB VRAM 在bf16时 — 这是这五个模型中最低的
- 安装: 复制正式的 Repo →
uv sync --all-extras→ 下载IndexTeam/IndexTTS-2.5从拥抱面部或模型范围。 - 网络用户界面 :
uv run webui.py→http://127.0.0.1:7860. Py API 还提供当地Gradio演示。 - 包含 vLLM 部署配方 — 这是五种高通量服务中最有生产能力的。
- 辅助模型(w2v-bert-)2.0, M询问GCT语义解码器,CAMPPlus,BigVGAN)在第一运行时自动下载.
- ComfyUI社区节点存在:
BSAI_ComfyUI_IndexTTS-2.5和ComfyUI_JR_IndexTTS25.
使用案例:本组中覆盖面最广
| 假设 | 如何运行它 | 小心点 |
|---|---|---|
| 多语种电影和短片配音 | 唯一一个有明确期限控制的模型0.5×–2.0× 因此,翻译可以压缩回原时间线 | 平均刑期不同 20–40% 横跨语言; 不要期望先通过 |
| 音频书和长式说明 | 按段落划, 保留 10% 重叠、再利用 | 送货规格是自动门 — 参见下面的ACX列表 |
| 游戏 NPC 语音资产行 | 以接近零边际成本在一批次中产生数千条线断线 | 引擎格式,而不是模型 — 见下文 |
| 呼叫中心批量通知/IVR | RTF 0.20 加上一个 vLLM 配方表示单曲 4090 可以携带生产载荷 | 高峰时数排队是真实的; 你需要缓冲和货币上限 |
| 阿拉伯文、日文和西班牙文的克隆 | 5种语言加跨语言传导; zh→ja 扬声器的相似性 75.82 这里最好 | 英语在混合zh/en文本中仍然摇摆 — 试试看 |
| 跨语言播客分发 | 将整个节目克隆成多种语言,同时保留主机的调色调 | AI广告部门的披露义务正在收紧 |
音频书:ACX送货规格是自动门
| 项目 | ACX要求 | AI世代如何典型的失败 |
|---|---|---|
| 集装箱 | MP3, 单曲 192 千位点+ 简历 | 导出为 VBR — 即时拒绝 |
| 抽样率 | 44.1 kHz | 型号发射 22.05 / 24 / 48 kHz; 需要复制 |
| 频道 | 单声道或立体声, 全书一致 | 章节之间的设置漂移 |
| 平均音响(RMS) | −23 dB 改为 -18 页:1 | 原始AI输出通常降落在−26 改为:24 页:1 — 太安静了 |
| 峰顶 | ≤ −3 页:1 | 硬对齐剪辑到 0 正常化后的 dB |
| 噪音层 | < −60 dB 人力资源科 | 合成气息/房间声调坐在上面 |
| 文件长度 | ≤ 120 每分钟 | 一个文件中的全书 |
| 头/尾音 | 0.5–1 s 头 1–5 s 尾声 | 冲动的修剪把第一个电话放在0样本上 |
| 零售样本 | 1–5 分钟, 只包含内容 | 混合贷项 |
| AI 披露 | 在提交元数据中宣布AI描述 | 提交时被遗忘 |
游戏:引擎挡住你,而不是模型
格式化和样本率( S)
非真实引擎 5 想要的WAV (英语:16- 贝蒂 44.1 kHz或OGG Vorbis. (英语).
在直接成本中丢弃 MP3 200–300 ms 解码间隔嘴唇同步已经消失
经典失败:模型输出 48 kHz,项目音频源设置为 44.1 kHz,该线以双倍速度运行。
引擎设置
UE5: 声音类 必须设定为“对话”. 默认 SFX 类适用 4:1 压缩能放大低声和平声高喊.
团结: 音频源装入类型 — 下划线 10 s 在内存中使用压缩,较长的行切换到Streaming.
资产管理
过去 500 对话框, 在生成任何东西之前先修补命名方案, e.g. CHARACTER_EMOTION_LINEID.wav.
否则,你花费更多的时间调节文件以触发事件,而不是保存生成它们.
预算执行情况
超过 50–100 s一个场景中的非同步语音线会导致内存尖锐;您需要音频集合和LOD(在遥远的NPC上无法唇同步).
目标a 50–70% 缓存命中率:预发可预期的节拍,只生成即兴对话框进行直播.
拨乱反正:成本图
| 方针 | 每分钟 · 每个语文 | 转身 | 适应 |
|---|---|---|---|
| 人类工作室的配乐 | $100–500 | 2–6 周数 | 戏剧,广播,旗舰品牌作品 |
| 全自动 AI | $2–20 | 当天 | 短式视频、课程、营销量 |
| AI + 人类审查 | $50–200 | 天数 | 品牌敏感或规范的内容 |
| 这个模型是自办的 | ≈ $0.003 (GPU 仅限) | 即刻 | 你建造管道,不包括劳动力和作战 |
对国际用户的判决
如果 您需要从紧凑的模型中复制阿拉伯语,日语或西班牙语, 您需要制作 vLLM 服务, 或者您需要持续对字幕锁定的工作流程的语音率控制 。
小心点 联合国 Bilibili 示范许可证,其中要求上面另订书面商业协议 100M MAU 或 ¥1B 年度收入 — 多数创业企业不会受到冲击,但企业应仔细审查。
在头对头数据中的位置
这是唯一的 IndexTTS 模型在CV3-Eval中,并出现两次(基和RL). 下面是四个最接近的对手; 完整的9型表格在 06.2.
| 型号 | 参数 | 中文 WER / 党卫军 | 联合国 WER / 党卫军 | 西班牙语 WER / 党卫军 |
|---|---|---|---|---|
| IndexTTS2.5 | 0.8 B | 4.36 / 77.10 | 5.12 / 68.06 | 3.75 / 76.39 |
| IndexTTS2.5-RL | 0.8 B | 3.93 / 77.92 | 3.89 / 67.79 | 3.33 / 76.68 |
| CosyVoice3 - (英语).0.5B | 0.5 B | 3.84 / 80.01 | 4.88 / 74.16 | 4.04 / 78.85 |
| Quen3 - (英语).TTS | 1.7 B | 3.27 / 73.02 | 5.06 / 67.17 | 2.87 / 73.17 |
| MOSS-TTS-v1.5 | 8 B | 4.02 / 72.68 | 4.45 / 67.46 | 3.83 / 71.75 |
| 型号 | 日语→内 WER / 党卫军 | 日语→对 WER / 党卫军 | 日语→对 WER / 党卫军 |
|---|---|---|---|
| IndexTTS2.5 | 3.62 / 63.83 | 5.17 / 65.48 | 6.57 / 74.16 |
| IndexTTS2.5-RL | 3.55 / 67.47 | 4.86 / 64.47 | 6.38 / 75.82 |
| CosyVoice3 - (英语).0.5B | 3.23 / 62.79 | 4.58 / 64.04 | — |
| Quen3 - (英语).TTS | 5.74 / 63.04 | 5.15 / 68.02 | 36.09 / 65.71 |
| 型号 | 精确度 | A. 总表 RTF | 条件 |
|---|---|---|---|
| IndexTTS2.5 | 页:1 | 0.2065 | RTX 4090时, kv cache= True |
| IndexTTS2 (参考) | fp16 请检查url=值 (帮助). | 0.3257 | RTX 4090 |
| VoxCPM2 (参考) | 页:1 | ~0.30 | ~0.13 纳米-紫外线LM |
| OmniVoice (参考) | — | 0.025 | H100 + 自定义内核;~0.9–1.2× 在苹果硅上实时 |
自己跑起来要花多少钱
| 设置 | RTF | GPU-小时/M字符 | 点播 RTX 4090 | 点播 A100 |
|---|---|---|---|---|
| IndexTTS2.5 (bf16) (中文(简体) ). | 0.2065 | 3.7 h | ~$2.75 | ~$5.91 |
| 参考: VoxCPM2 (诺-VLLM) | ~0.13 | 2.3 h | ~$1.73 | ~$3.72 |
| 比较 | 成本/ M 字符 | 多个 |
|---|---|---|
| ElevenLabs v3 | $60–180 | ~22–65× |
| ElevenLabs 闪光 | $50–55 | ~18–20× |
开放AI tts-1 | $15 | ~5.5× |
| 谷歌/ Poly 标准 | $4 | ~1.5× |
许可证和披露门
| 项目 | 状态 |
|---|---|
| 代码许可证 | 开源 |
| 重量许可证 | Bilibili 示范许可证 |
| 商业用途 | 允许,但a 以上需另行订立书面协议 100M MAU 或 ¥1B 年度收入 |
| 默认水印 | 未说明 → 假设没有 |
| 您必须添加的内容 | AudioSeal / SynthID / C2PA 如果您有披露义务; 模型船没有内容过滤器 |
| 数据居住 | 全部下线运行 |
如果没有这个,那么什么
- 仅限中文,追求最大扬声器的相似性 → CosyVoice3 - (英语).0.5B (中文(简体) 80.01). 先检查一下许可证 — 不要假设它是干净的。
- 执照必须干净 → VoxCPM2 (成本明显较低)→对
- 最高等级的开放型号,你可以载运 → 步骤音频编辑X (Apache-2.0盲埃罗 1,102).
- 阿拉伯语,没有 Bilibili 阈值 → 本片里什么都没有 没错 2.5护城河。
准备好使用 IndexTTS2.5 创作了吗?
打开文字转语音并自动选中此引擎,即可使用你自己的声音模型开始创作。