开源 TTS 模型深度解析 · 2026
01

IndexTTS 1

bilibili · 工业级可控零镜头 TTS · 2月首次发布 2025

IndexTTS 是第一代系统从 bilibili指数演讲团队. 它建立在 XTTS 和 乌龟 而不是从头开始, 和它的标题贡献 中文发音可控 — 一个以英语为中心的问题 TTS 研究基本上被忽视。 对于国际观众来说,重要的细节是发布时间表: v1.0 (马 尔 2025)之后为v1.5 (五月) (中文(简体) ). 2025),这具体和显著地改善了英语的性能和整体稳定性. 如果你评价 IndexTTS 1,评价 v1.5, 而不是v1,没有。0.

开发者
bilibili 索引演讲组
初步释放
二月 (简体中文) 2025 (重量) 2025)
建筑
自动递归( GPT 型)
语文
汉语,英语(+方言)
VRAM
~11 GB
流量
~1 分钟音频在~10 s

捐款 1 — 混合字符 + pinyin 建模

这是核心思想。 中文多管手机(特征,视上下文不同,有多个读数)是一种持续失效模式,用于 TTS. IndexTTS 让用户直接在输入文本中注入比尼因,

  • 训练期间,大约 20% 非波音字符数 使用Bernoulli口罩(α=)替换其披针形。 0.20). 这迫使模型在石墨和电话之间学习强力绘图。
  • 横向培训降低了同声读音的误读率。 8.7% 改为 0.9%.
  • 假设你可以写 zhong4 zhong4 内置以分解 — 同样的机制也帮助难得的和离校的人物。

为什么这要超越中文: 同一架构技巧直接用于任何不规则发音的语言。 它在功能上与CMU手机对英语的操作类似.

捐款 2 — 精确暂停 / 音速控制

标点图通过 时间戳嵌入 (大约) 0.3 s 对于逗号, 0.8 s 整个站点。 在古典中国长式文字上,句子边界准确度达到 98.6%.

捐款 3 — 编码器和vocoder升级

  • A 基于前言的有条件编码器 取代了基线调节堆栈,提高了零镜头克隆稳定性和扬声器相似性.
  • 语音编码解码器被替换为 大VGAN2号输出自然性的有意义的跳跃。
  • 调查组公布了关于 矢量量化(VQ) vs Finite Scalar Quantization(FSQ) 矢量量化(VQ) 矢量量化(FSQ) 矢量量化(FSQ) 矢量量化(FSQ) 矢量量化(FSQ) 矢量量化(Finite Scalar) 矢量量化(FSQ) 密码簿使用量:a 6,000- 小时数据尺度,FSQ接近 100% 密码簿的使用 相对大概 55% 用于VQ — a 后由全体继承的调查结果。 IndexTTS 系脉.

报告的结果(自我评价)

度量衡数值页:1
单词错误率( E)WER)1.3%中国情景
发言者的类似性(SS)0.776零镜头克隆
MOS4.01主观质量

据报告,这些数字是同时期的开源系统,包括CosyVoice2、Fish-Speech、FireRed。TTS 和F5 - (法语)TTS,同时使用更简单的训练管道和更快的推论.

使用大小写: 何时选择 1

假设如何运行它小心点
仅限中文批量说明(成本敏感)将脚本剪断并运行在一张通行证中, 锁定几秒钟的参考音频~11 GB VRAM; 无持续时间控制,所以框锁 杜宾出
内容密集,有名称、词条或古典汉语混合“hanzi + pinyin” 输入修正多管电话 — 同音错误读数从 8.7% 改为 0.9%Pinyin 说明需要人传; 有脚本长度的成本尺度
读取暂停节奏问题标点图可直接暂停持续时间; ~98.6% 经典文本的句子边界精确度无连续速度控制 — 您通过编辑 puntuation 调制节奏
版本比较基准当你不确定你是否真的需要 2/2.5, 运行 1 第一个英语要求v1.5 或较晚; v1.0 英语不是一个有效的基准
不适合: 现场对话(没有流线,没有vLLM配方),情感表现,帧锁配音,语言超越中英文,或需要精确持续时间控制的任何内容. — 所有到达时 IndexTTS2 和 2.5.

对国际用户的判决

如果 你需要一个轻而易举的 以中国为中心的克隆模型 你有~11 GB 页:1 VRAM 以备不时之需 它仍然是一个坚实的、经过充分检验的基线。

跳过,如果 您需要情绪控制 精确持续时间控制 或两种以上语言 — 他们只到达 IndexTTS2 和 2.5. 注意v1之间的英语质量差距.0 和v1 键。5 相当重要。

双语 几枪克隆 Pinyin 打电话给我 98.6% 句子边界精度

在头对头数据中的位置

IndexTTS 1 未参加CV3-Eval头对头 — 评估涵盖较新的一代人IndexTTS2.5, VoxCPM2, OmniVoice,可视 3, Quen3 - (英语).TTS, MOSS-TTS 页:1 因此,它在本报告中的作用是: 世代基线而不是竞争对手。 它本身的绝对数在上文的"报告结果"区块中.

参考点图依据
IndexTTS 1 (本模式)WER 1.3% / 党卫军 0.776 / MOS 4.01提交人报告
IndexTTS2 (直接继任)WER 1.88% / 情绪相似性 0.887提交人报告的强烈情绪状况
IndexTTS2.5-RL (两代)日语→内 3.55 WER / 67.47 党卫军CV3- Eval 软件 — 见 06.2
时间问题 你必须明白: IndexTTS 1's v1.0 在英语中明显软弱; 仅 v1.5 带来了真正的改善。 如果你见过的话 "IndexTTS 对英语不好 2024–2025 博客贴文或Reddit线索,几乎肯定v1.0. 检查您在放英文内容前实际绘制的版本 — 很多人都为这所困

自己跑起来要花多少钱

IndexTTS 1 从未发表过可比的 RTF ,因此无法输入 GPU- 小时表英寸 06.4. 这些是唯一可用的锚:

项目数值说明
VRAM~11 GB高于 2.5's ~6 GB; 单 RTX 4090 够了
作者声称的速度~10 s 每分钟音频未指定硬件 — 与任何其他情况无可比性 RTF 这里
保守估计(借款) IndexTTS2's 0.3257)5.9 GPU-小时/百万个字符~$4.34 点播 4090; ~$9.32 打开 A100
底线 : 如果你的目标是 "最便宜的中国克隆",直接去 IndexTTS2.5 而不是说 1 — 下调 VRAM (~6 GB),一个更快 RTF (0.2065, 大约 $2.75 每百万个字符),更多的语言,以及实际上被写下来的许可阈值. 使用 1 只有您有特定的理由将旧版本标注。

许可证和披露门

项目状态
代码许可证开源
重量许可证索引模式许可证 — 逐行审查;本报告未发现明确的商业赠款
商业用途必须审查条件。 不认为是
默认水印未说明 → 假设没有计划;如果有披露义务,则加上自己的计划
数据居住全部下线运行
索引模式许可证不是 Apache-2.0. 它不象允许许可证那样带有一揽子商业赠款。 如果你的产品收费, 阅读完整的术语或电子邮件, — 输入 TTS,"开源"和"可商业使用"是独立的问题. 节次 06.5 穿过细节。

如果没有这个,那么什么

  • 中国的克隆,你可以移动到一个新的释放 → IndexTTS2.5. 更快,五种语言,更细的发音控制(pinyin / CMU / kana),较低 VRAM.
  • 执照必须干净 → VoxCPM2 (Apache-2.0 代码和重量, 48 kHz).
  • 极低的脚印、 CPU 或边缘 → 科科罗 82M (在本集之外, Apache-2.0, ~2–3 GB不过... 无法复制).
  • 你特别需要 1 作为纸质比较的基准 → 保留它,但总是报告两个v1。0 和v1 键。5 版本数字或者你的结论会误导人们。
在 BiliVoice 上试用

准备好使用 IndexTTS 1 创作了吗?

打开文字转语音并自动选中此引擎,即可使用你自己的声音模型开始创作。