IndexTTS2
bilibili · 情感表达力+持续时间控制 · 9月获释 8, 2025
IndexTTS2 是那个让这个家庭 变得国际化的模型 — 晚期在西方社交平台上流传的"AI English dub of Chinese teams"视频 2025 是用它产生的 没错 第一个自旋式零镜头 TTS 将精确持续时间控制与自然自由运行生成相结合的模型,它将情绪与扬声器身份脱钩,从而可以独立地指定调和情绪. 那个 GitHub Repo 已经通过 10k恒星,并发布重量加推论代码.
- 纸张
- arXiv: (中文(简体) ).2506.21619
- 建筑
- T2S + S2M + 大VGANv2
- 情感数据
- 55K 样本/ 135 h 情感演讲
- 克隆输入
- ~5 s 音频, >85% 类似性
- VRAM
- ~15 GB
- RTF (RTX 4090)
- 0.3257 fp16 总计
- 社区
- Discord + OpenAI 兼容 API 叉头
- 商业联系
- 索引语音@bilibili.com (中文(简体) ).
建筑 — 三级级级联
- 文本对语义( T2S) — 一个 LLM 风格的自动递归变压器,它取源文本,样式提示,tibre提示和可选的目标符号计数,并发出语义符号.
- 语义学对迈尔(S2M) — a 流量匹配 模块,从语义符号外加刻度调值来预测 mel 光谱。 用流配音取代离散的音响符号,是在强烈的情感下保存精细细的细节.
- BigVGANv2 发泡器 — 将 mel 光谱转换为波形。
创新 1 — 自动递归模型中的持续期控制
自动递减 TTS 内在的逐字标注,因此很难击中目标持续时间 — 一个真正的问题 欺骗, 声音必须匹配图片。 IndexTTS2 用一个 值计数约束:
- 一个专用 时间嵌入 将请求的令牌数注入到 T2S 中,模型将位置信息与该预算对齐.
- 随机抽取样本-延展任务(如. 0.75×, 1.25×因此模型在任何要求的长度上都保持流畅和情感上的一致性.
- 计算值错误率 : 下级 0.03%,经常出现在以下 0.02%.
- 两种操作模式: 受限( 请指定符数) → 精确持续时间)和自由运行(没有符号计数) → 忠实地复制了提示的prosody).
创新 2 — 情感/心肌脱落,四种控制方式
| 控制模式 | 如何运作 |
|---|---|
| 单声道参考 | 一个片段既能提供刺痛又能提供情感(经典的零镜头克隆) |
| 单独的情感参考 | 样式提示可以来自 不同的扬声器 而不是尖端的提示 — 甚至是另一种语言 |
| 情感向量 | 8 维度 — 快乐 愤怒 悲伤 恐惧 厌恶 忧郁 惊讶 冷静 — 可调整重量和随机取样 |
| 文本描述 ("软指令") | 一个精细的 文选 3 将自然语言的描述("用一种不满的暗示说","你吓死我了!")映成情感指导. |
分离是建筑学上的一种 渐变反转层( GRL) 和单独的扬声器/情绪感知器,所以模型不能通过将身份泄露到情感路径来欺骗.
创新 3 — 在极端情绪下的清晰度
呼喊和泣声是表达的地方 TTS 通常会分裂 — 识性滴滴. IndexTTS2 纳入 GPT 潜在表达 加上小说的三阶段训练模式 稳定一代。 计量 WER 在喊叫时: 1.883%, i.e. 表达性而不牺牲知性.
报告结果
| 度量衡 | 数值 | 背景情况 |
|---|---|---|
| 情感相似性(ES) | 0.887 | 超越其他 SOTA 零镜头模型 |
| 情感 MOS (EMOS) | 4.22 | 自然的、经过适当调整的交货 |
| WER 在强烈的情感下 | 1.883% | 呐喊/哭泣情景 |
| 持续时间控制错误 | <0.03% | 0.75×–1.25× 速度测试 |
真实世界推论速度( E)RTX 4090, kv cache= True) (中文(简体) ).
| 输入长度 | v2.0 fp16 请检查url=值 (帮助). | v2.0 fp32 请检查url=值 (帮助). |
|---|---|---|
| 7 字符 | 0.4004 | 0.3748 |
| 16 字符 | 0.3322 | 0.3389 |
| 28 字符 | 0.3257 | 0.3480 |
| 80 字符 | 0.3229 | 0.3754 |
| 200 字符 | 0.3244 | 0.3990 |
| A. 总表 | 0.3257 | 0.3748 |
基于 Docker 的独立测试 NVIDIA L40S (80 测试案例 4 版本 × 4 s场景 × 5 运行, 100% 成功率) 报告的尾到尾延迟 ~6.4 s (中文短),~28 s (中文长)~.7.6 s (英文短),~35.4 s (英文长)为制作画面. 那个 v2.1-cuda 中文的建造速度最快; v2.0-production 对英语来说是最稳定的
/v1/audio/speech 和Voxta的融合, 这使得它相对容易 下降到现有的管道。使用大小写: 何时选择 2
| 假设 | 如何运行它 | 小心点 |
|---|---|---|
| 动感 动感 和短形的情感欺骗 | 控制情绪与 8-dimension 矢量或自然语言的教导; 结节和情感脱节,所以A的声音可以携带B的情感. | ~15 GB VRAM — 本组中最高的 |
| 音频书中的情感段落 | 附加情感指令到对话框中, 返回“ calm” 进行描述 | Long-form 仍然漂移; 您必须用重叠验证块块( 见 06.3) |
| 播客和两台节目 | 锁定每个主机的1个参考片段加上1个情感指示,所以各集保持一致 | 大赦国际在广告和赞助部分的披露义务正在收紧(见 06.5) |
| 重新表示现有业绩 | 保持气温,只交换情感载体 — 比重录便宜得多 | 在极端情绪下进行试验表达(抽泣、喊叫); WER 上升数 |
| 视频配音(第一代方法) | 持续时间控制有值计算错误 0.03%,保持音频与图片对齐 | 对于持续的速度调整, 2.5's 0.5×–2.0× 是一个更好的工具 |
对国际用户的判决
如果 你正在做AI的配音,录音, 人物语音工作, 或任何管道 音频必须匹配固定的时间线, 或你需要重新声音 表演到另一种情感。
小心点 这~15 GB VRAM 要求和英语是这一模范家庭的第二语言目标这一事实 — 总是A/B对一个西方模型(Chatterbox, X)TTS-v2, F5-TTS)在承诺前用自己的英文剧本.
在头对头数据中的位置
IndexTTS2 (单位:千美元) 未参加CV3-Eval — 该表涵盖 2.5 生成。 它的头对头证据主要来自测量 RTF 一个 RTX 4090 (见上文"真实世界推论速度").
| 版本 | 精确度 | A. 总表 RTF | 维苏斯 2.5 |
|---|---|---|---|
| IndexTTS2 | fp16 请检查url=值 (帮助). | 0.3257 | ~1.58× 慢一点 |
| IndexTTS2 | fp32 请检查url=值 (帮助). | 0.3748 | ~1.82× 慢一点 |
| IndexTTS2.5 | 页:1 | 0.2065 | 基线 |
一个 RTF 页:1 0.3257 大约意味着 3.1× 实时: 100万个字符(~18 h我们的音频) 5.9 GPU- 小时.
自己跑起来要花多少钱
| 设置 | RTF | GPU-小时/M字符 | 点播 RTX 4090 ($0.74/h) | 点播 A100 ($1.59/h) |
|---|---|---|---|---|
| IndexTTS2 (第16页) | 0.3257 | 5.9 h | ~$4.34 | ~$9.32 |
| 参考: IndexTTS2.5 (bf16) (中文(简体) ). | 0.2065 | 3.7 h | ~$2.75 | ~$5.91 |
放在广告旁边 API 价格列表 :
| 选项 | 成本/ M 字符 | 维苏斯 IndexTTS2 |
|---|---|---|
| ElevenLabs v3 | $60–180 | ~14–41× |
| 卡特西亚·索尼奇 3 | $20–39 | ~4.6–9× |
开放AI tts-1 | $15 | ~3.5× |
| 谷歌/ Poly 标准 | $4 | ~0.9× — 比自营便宜 |
该表也 不包括工程费用:部署,监测,重试逻辑,块缝合,失败的重运行. 这是工程师的时间,它通常花费 数量级比 GPU 比尔。 完全型号在 06.4.
许可证和披露门
| 项目 | 状态 |
|---|---|
| 代码许可证 | 开源 |
| 重量许可证 | 索引模式许可证 |
| 商业用途 | 术语必须加以审查;作者公布的商业联系人是: [email protected] |
| 默认水印 | 未说明 → 假设没有 |
| 数据居住 | 全部下线运行 |
如果没有这个,那么什么
- 连续可调整的假说率 → IndexTTS2.5 (0.5×–2.0× 连续; 2'持续时间控制是固定步骤'.
- 你不需要情绪控制 → IndexTTS 1 虽然注意英文版的问题,
- 执照必须干净 → VoxCPM2.
- 你只是想"声音更好" → 从盲听的 Elo 表开始 06.1; 步骤音频编辑X(Apache-2.0),是实际上可以运载的级别最高的开放型号.
准备好使用 IndexTTS2 创作了吗?
打开文字转语音并自动选中此引擎,即可使用你自己的声音模型开始创作。