IndexTTS 1
bilibili · 工业级可控零镜头 TTS · 2月首次发布 2025
IndexTTS 是第一代系统从 bilibili指数演讲团队. 它建立在 XTTS 和 乌龟 而不是从头开始, 和它的标题贡献 中文发音可控 — 一个以英语为中心的问题 TTS 研究基本上被忽视。 对于国际观众来说,重要的细节是发布时间表: v1.0 (马 尔 2025)之后为v1.5 (五月) (中文(简体) ). 2025),这具体和显著地改善了英语的性能和整体稳定性. 如果你评价 IndexTTS 1,评价 v1.5, 而不是v1,没有。0.
- 开发者
- bilibili 索引演讲组
- 初步释放
- 二月 (简体中文) 2025 (重量) 2025)
- 建筑
- 自动递归( GPT 型)
- 语文
- 汉语,英语(+方言)
- VRAM
- ~11 GB
- 流量
- ~1 分钟音频在~10 s
捐款 1 — 混合字符 + pinyin 建模
这是核心思想。 中文多管手机(特征,视上下文不同,有多个读数)是一种持续失效模式,用于 TTS. IndexTTS 让用户直接在输入文本中注入比尼因,
- 训练期间,大约 20% 非波音字符数 使用Bernoulli口罩(α=)替换其披针形。 0.20). 这迫使模型在石墨和电话之间学习强力绘图。
- 横向培训降低了同声读音的误读率。 8.7% 改为 0.9%.
- 假设你可以写
zhong4 zhong4内置以分解 — 同样的机制也帮助难得的和离校的人物。
为什么这要超越中文: 同一架构技巧直接用于任何不规则发音的语言。 它在功能上与CMU手机对英语的操作类似.
捐款 2 — 精确暂停 / 音速控制
标点图通过 时间戳嵌入 (大约) 0.3 s 对于逗号, 0.8 s 整个站点。 在古典中国长式文字上,句子边界准确度达到 98.6%.
捐款 3 — 编码器和vocoder升级
- A 基于前言的有条件编码器 取代了基线调节堆栈,提高了零镜头克隆稳定性和扬声器相似性.
- 语音编码解码器被替换为 大VGAN2号输出自然性的有意义的跳跃。
- 调查组公布了关于 矢量量化(VQ) vs Finite Scalar Quantization(FSQ) 矢量量化(VQ) 矢量量化(FSQ) 矢量量化(FSQ) 矢量量化(FSQ) 矢量量化(FSQ) 矢量量化(Finite Scalar) 矢量量化(FSQ) 密码簿使用量:a 6,000- 小时数据尺度,FSQ接近 100% 密码簿的使用 相对大概 55% 用于VQ — a 后由全体继承的调查结果。 IndexTTS 系脉.
报告的结果(自我评价)
| 度量衡 | 数值 | 页:1 |
|---|---|---|
| 单词错误率( E)WER) | 1.3% | 中国情景 |
| 发言者的类似性(SS) | 0.776 | 零镜头克隆 |
| MOS | 4.01 | 主观质量 |
据报告,这些数字是同时期的开源系统,包括CosyVoice2、Fish-Speech、FireRed。TTS 和F5 - (法语)TTS,同时使用更简单的训练管道和更快的推论.
使用大小写: 何时选择 1
| 假设 | 如何运行它 | 小心点 |
|---|---|---|
| 仅限中文批量说明(成本敏感) | 将脚本剪断并运行在一张通行证中, 锁定几秒钟的参考音频 | ~11 GB VRAM; 无持续时间控制,所以框锁 杜宾出 |
| 内容密集,有名称、词条或古典汉语 | 混合“hanzi + pinyin” 输入修正多管电话 — 同音错误读数从 8.7% 改为 0.9% | Pinyin 说明需要人传; 有脚本长度的成本尺度 |
| 读取暂停节奏问题 | 标点图可直接暂停持续时间; ~98.6% 经典文本的句子边界精确度 | 无连续速度控制 — 您通过编辑 puntuation 调制节奏 |
| 版本比较基准 | 当你不确定你是否真的需要 2/2.5, 运行 1 第一个 | 英语要求v1.5 或较晚; v1.0 英语不是一个有效的基准 |
对国际用户的判决
如果 你需要一个轻而易举的 以中国为中心的克隆模型 你有~11 GB 页:1 VRAM 以备不时之需 它仍然是一个坚实的、经过充分检验的基线。
跳过,如果 您需要情绪控制 精确持续时间控制 或两种以上语言 — 他们只到达 IndexTTS2 和 2.5. 注意v1之间的英语质量差距.0 和v1 键。5 相当重要。
在头对头数据中的位置
IndexTTS 1 未参加CV3-Eval头对头 — 评估涵盖较新的一代人IndexTTS2.5, VoxCPM2, OmniVoice,可视 3, Quen3 - (英语).TTS, MOSS-TTS 页:1 因此,它在本报告中的作用是: 世代基线而不是竞争对手。 它本身的绝对数在上文的"报告结果"区块中.
| 参考点 | 图 | 依据 |
|---|---|---|
| IndexTTS 1 (本模式) | WER 1.3% / 党卫军 0.776 / MOS 4.01 | 提交人报告 |
| IndexTTS2 (直接继任) | WER 1.88% / 情绪相似性 0.887 | 提交人报告的强烈情绪状况 |
| IndexTTS2.5-RL (两代) | 日语→内 3.55 WER / 67.47 党卫军 | CV3- Eval 软件 — 见 06.2 |
自己跑起来要花多少钱
IndexTTS 1 从未发表过可比的 RTF ,因此无法输入 GPU- 小时表英寸 06.4. 这些是唯一可用的锚:
| 项目 | 数值 | 说明 |
|---|---|---|
| VRAM | ~11 GB | 高于 2.5's ~6 GB; 单 RTX 4090 够了 |
| 作者声称的速度 | ~10 s 每分钟音频 | 未指定硬件 — 与任何其他情况无可比性 RTF 这里 |
| 保守估计(借款) IndexTTS2's 0.3257) | 5.9 GPU-小时/百万个字符 | ~$4.34 点播 4090; ~$9.32 打开 A100 |
许可证和披露门
| 项目 | 状态 |
|---|---|
| 代码许可证 | 开源 |
| 重量许可证 | 索引模式许可证 — 逐行审查;本报告未发现明确的商业赠款 |
| 商业用途 | 必须审查条件。 不认为是 |
| 默认水印 | 未说明 → 假设没有计划;如果有披露义务,则加上自己的计划 |
| 数据居住 | 全部下线运行 |
如果没有这个,那么什么
- 中国的克隆,你可以移动到一个新的释放 → IndexTTS2.5. 更快,五种语言,更细的发音控制(pinyin / CMU / kana),较低 VRAM.
- 执照必须干净 → VoxCPM2 (Apache-2.0 代码和重量, 48 kHz).
- 极低的脚印、 CPU 或边缘 → 科科罗 82M (在本集之外, Apache-2.0, ~2–3 GB不过... 无法复制).
- 你特别需要 1 作为纸质比较的基准 → 保留它,但总是报告两个v1。0 和v1 键。5 版本数字或者你的结论会误导人们。
准备好使用 IndexTTS 1 创作了吗?
打开文字转语音并自动选中此引擎,即可使用你自己的声音模型开始创作。