开源 TTS 模型深度解析 · 2026
02

IndexTTS2

bilibili · 情感表达力+持续时间控制 · 9月获释 8, 2025

IndexTTS2 是那个让这个家庭 变得国际化的模型 — 晚期在西方社交平台上流传的"AI English dub of Chinese teams"视频 2025 是用它产生的 没错 第一个自旋式零镜头 TTS 将精确持续时间控制与自然自由运行生成相结合的模型,它将情绪与扬声器身份脱钩,从而可以独立地指定调和情绪. 那个 GitHub Repo 已经通过 10k恒星,并发布重量加推论代码.

纸张
arXiv: (中文(简体) ).2506.21619
建筑
T2S + S2M + 大VGANv2
情感数据
55K 样本/ 135 h 情感演讲
克隆输入
~5 s 音频, >85% 类似性
VRAM
~15 GB
RTF (RTX 4090)
0.3257 fp16 总计
社区
Discord + OpenAI 兼容 API 叉头
商业联系
索引语音@bilibili.com (中文(简体) ).

建筑 — 三级级级联

  • 文本对语义( T2S) — 一个 LLM 风格的自动递归变压器,它取源文本,样式提示,tibre提示和可选的目标符号计数,并发出语义符号.
  • 语义学对迈尔(S2M) — a 流量匹配 模块,从语义符号外加刻度调值来预测 mel 光谱。 用流配音取代离散的音响符号,是在强烈的情感下保存精细细的细节.
  • BigVGANv2 发泡器 — 将 mel 光谱转换为波形。

创新 1 — 自动递归模型中的持续期控制

自动递减 TTS 内在的逐字标注,因此很难击中目标持续时间 — 一个真正的问题 欺骗, 声音必须匹配图片。 IndexTTS2 用一个 值计数约束:

  • 一个专用 时间嵌入 将请求的令牌数注入到 T2S 中,模型将位置信息与该预算对齐.
  • 随机抽取样本-延展任务(如. 0.75×, 1.25×因此模型在任何要求的长度上都保持流畅和情感上的一致性.
  • 计算值错误率 : 下级 0.03%,经常出现在以下 0.02%.
  • 两种操作模式: 受限( 请指定符数) → 精确持续时间)和自由运行(没有符号计数) → 忠实地复制了提示的prosody).

创新 2 — 情感/心肌脱落,四种控制方式

控制模式如何运作
单声道参考一个片段既能提供刺痛又能提供情感(经典的零镜头克隆)
单独的情感参考样式提示可以来自 不同的扬声器 而不是尖端的提示 — 甚至是另一种语言
情感向量8 维度 — 快乐 愤怒 悲伤 恐惧 厌恶 忧郁 惊讶 冷静 — 可调整重量和随机取样
文本描述 ("软指令")一个精细的 文选 3 将自然语言的描述("用一种不满的暗示说","你吓死我了!")映成情感指导.

分离是建筑学上的一种 渐变反转层( GRL) 和单独的扬声器/情绪感知器,所以模型不能通过将身份泄露到情感路径来欺骗.

创新 3 — 在极端情绪下的清晰度

呼喊和泣声是表达的地方 TTS 通常会分裂 — 识性滴滴. IndexTTS2 纳入 GPT 潜在表达 加上小说的三阶段训练模式 稳定一代。 计量 WER 在喊叫时: 1.883%, i.e. 表达性而不牺牲知性.

报告结果

度量衡数值背景情况
情感相似性(ES)0.887超越其他 SOTA 零镜头模型
情感 MOS (EMOS)4.22自然的、经过适当调整的交货
WER 在强烈的情感下1.883%呐喊/哭泣情景
持续时间控制错误<0.03%0.75×–1.25× 速度测试

真实世界推论速度( E)RTX 4090, kv cache= True) (中文(简体) ).

输入长度v2.0 fp16 请检查url=值 (帮助).v2.0 fp32 请检查url=值 (帮助).
7 字符0.40040.3748
16 字符0.33220.3389
28 字符0.32570.3480
80 字符0.32290.3754
200 字符0.32440.3990
A. 总表0.32570.3748

基于 Docker 的独立测试 NVIDIA L40S (80 测试案例 4 版本 × 4 s场景 × 5 运行, 100% 成功率) 报告的尾到尾延迟 ~6.4 s (中文短),~28 s (中文长)~.7.6 s (英文短),~35.4 s (英文长)为制作画面. 那个 v2.1-cuda 中文的建造速度最快; v2.0-production 对英语来说是最稳定的

部署说明: a 需要建造PyTorch CUDA — CPU 唯一的推论是 没有 支持参考执行。 社区叉提供 OpenAI 兼容 API (/v1/audio/speech 和Voxta的融合, 这使得它相对容易 下降到现有的管道。

使用大小写: 何时选择 2

假设如何运行它小心点
动感 动感 和短形的情感欺骗控制情绪与 8-dimension 矢量或自然语言的教导; 结节和情感脱节,所以A的声音可以携带B的情感.~15 GB VRAM — 本组中最高的
音频书中的情感段落附加情感指令到对话框中, 返回“ calm” 进行描述Long-form 仍然漂移; 您必须用重叠验证块块( 见 06.3)
播客和两台节目锁定每个主机的1个参考片段加上1个情感指示,所以各集保持一致大赦国际在广告和赞助部分的披露义务正在收紧(见 06.5)
重新表示现有业绩保持气温,只交换情感载体 — 比重录便宜得多在极端情绪下进行试验表达(抽泣、喊叫); WER 上升数
视频配音(第一代方法)持续时间控制有值计算错误 0.03%,保持音频与图片对齐对于持续的速度调整, 2.5's 0.5×–2.0× 是一个更好的工具
实际说明: 2 是这个系列中表现最强的 — 以最高者为代价 VRAM 和推断时间。 如果你的内容没有情感层面,直接去 2.5 是更好的交易:更快,更精简,更多语言。

对国际用户的判决

如果 你正在做AI的配音,录音, 人物语音工作, 或任何管道 音频必须匹配固定的时间线, 或你需要重新声音 表演到另一种情感。

小心点 这~15 GB VRAM 要求和英语是这一模范家庭的第二语言目标这一事实 — 总是A/B对一个西方模型(Chatterbox, X)TTS-v2, F5-TTS)在承诺前用自己的英文剧本.

情绪控制 情感/调和 精确持续时间控制 文字即兴情绪 OpenAI 兼容叉

在头对头数据中的位置

IndexTTS2 (单位:千美元) 未参加CV3-Eval — 该表涵盖 2.5 生成。 它的头对头证据主要来自测量 RTF 一个 RTX 4090 (见上文"真实世界推论速度").

版本精确度A. 总表 RTF维苏斯 2.5
IndexTTS2fp16 请检查url=值 (帮助).0.3257~1.58× 慢一点
IndexTTS2fp32 请检查url=值 (帮助).0.3748~1.82× 慢一点
IndexTTS2.5页:10.2065基线

一个 RTF 页:1 0.3257 大约意味着 3.1× 实时: 100万个字符(~18 h我们的音频) 5.9 GPU- 小时.

一线定位: IndexTTS2 是模式 发明 可控情感加可控持续时间,但 2.5 越快越好,语言, VRAM 和发音控制。 唯一可以选择的理由 2 今天是"它已经在生产了 我不想碰它"

自己跑起来要花多少钱

设置RTFGPU-小时/M字符点播 RTX 4090 ($0.74/h)点播 A100 ($1.59/h)
IndexTTS2 (第16页)0.32575.9 h~$4.34~$9.32
参考: IndexTTS2.5 (bf16) (中文(简体) ).0.20653.7 h~$2.75~$5.91

放在广告旁边 API 价格列表 :

选项成本/ M 字符维苏斯 IndexTTS2
ElevenLabs v3$60–180~14–41×
卡特西亚·索尼奇 3$20–39~4.6–9×
开放AI tts-1$15~3.5×
谷歌/ Poly 标准$4~0.9× — 比自营便宜
别被最后一行误导了 标准云 TTS 其实比自己开的便宜 但是那些声音 无法复制,没有情绪控制,没有持续时间控制 — 它不是同一个产品。 IndexTTS2真正的成本竞争者是 ElevenLabs,差距就是 14–41×.

该表也 不包括工程费用:部署,监测,重试逻辑,块缝合,失败的重运行. 这是工程师的时间,它通常花费 数量级比 GPU 比尔。 完全型号在 06.4.

许可证和披露门

项目状态
代码许可证开源
重量许可证索引模式许可证
商业用途术语必须加以审查;作者公布的商业联系人是: [email protected]
默认水印未说明 → 假设没有
数据居住全部下线运行
关键区别与 2.5: 2.5's Bilibili 示范许可证公开说明其阈值(100M MAU / ¥1B 收入)。 2 s直到使用更模糊的"Index Model License",所以你必须去问。 如果你选择商业产品, 许可确定性本身就是选择的理由 2.5 结束 2.

如果没有这个,那么什么

  • 连续可调整的假说率 → IndexTTS2.5 (0.5×–2.0× 连续; 2'持续时间控制是固定步骤'.
  • 你不需要情绪控制 → IndexTTS 1 虽然注意英文版的问题,
  • 执照必须干净 → VoxCPM2.
  • 你只是想"声音更好" → 从盲听的 Elo 表开始 06.1; 步骤音频编辑X(Apache-2.0),是实际上可以运载的级别最高的开放型号.
在 BiliVoice 上试用

准备好使用 IndexTTS2 创作了吗?

打开文字转语音并自动选中此引擎,即可使用你自己的声音模型开始创作。