开源 TTS 模型深度解析 · 2026
04

OmniVoice

小米 / k2- fsa( 下一代 Kaldi) · 646 语言 · 释放的马尔 31, 2026

OmniVoice 来源 k2-fsa (中文(简体) ).下一代卡尔迪集团 丹尼尔·波维 — 在语音识别界具有相当份量的名字。 这是 最宽的语言覆盖零镜头 TTS 可用模型,声称 646 语言 培训内容大致 581,000 h我们的 声音,它完全在本地运行。 积累的回扣 12k GitHub 在释放后数周内 恒星的重量只有~~3.3 GB.

在你计划一个产品之前先看看这个 OmniVoice: 联合国 代码 这是 Apache-2.0不过 预训重量为CC-BY-NC 4.0 (非商业性)从Emilia程序令等培训数据中继承下来的一个制约因素。 个人和研究用途是好的; 不允许任何创收用途 没有单独的许可证。 这在型号卡中有明确表述,是商业部署的硬阻塞器.
纸张
arXiv: (中文(简体) ).2604.00688
后骨头
Quen3 - (英语).0.6B (~0.8 B 总计)
语文
646
培训数据
~581,000 h
产出
24 kHz 单
重量大小
~3.3 GB
索赔 RTF
0.025 打开 H100 带有自定义内核
代码许可证
Apache-2.0
重量许可证
CC-BY-NC (英语). 4.0 (非商业性)

建筑 — 一种“分散式语言模型式”非自动递减设计

多数 TTS 管道分为两个阶段: text → semantic tokens → acoustic features → waveform,每跳都会累积错误。 OmniVoice 折叠到单个阶段 : text → multi-codebook acoustic tokens → waveform.

  • 骨干是重新设计的 Quen3 - (英语).0.6B 以传播语言模式驱动的语言模型: 而不是向左向右排放音频 在几个平行的解密步骤中完善整个序列.
  • A 双向变形器 联合模拟一个指令记录、一个即时段和遮蔽的目标段。
  • 音频由来自 希格斯音频 v2 (Boson AI, Apache-2.0).
  • 中间语义阶段没有错误累积,顺序解码步骤要少得多 — 因此,速度。

五种核心能力

能力细节
零镜头克隆3–10 s 参考音频。 内建 低声自动绘图 表示您无需提供参考记录。 通过提取一个干净的扬声器嵌入来处理噪音/反响性的引用.
语音设计无需引用音频 — 用自然语言描述语音(male, elderly, low pitch, British accent它会产生一个。 支持性别,年龄,投球,口音,方言和低语.
精细的文本控制内含非语言标记 : [laughter], [sigh], [breath], [sniff] 和 13+别者.
发音覆盖汉语通过pinyin,带有色调标记(例如. ZHE2;英语通过CMU发音词典.
多语种对话[Speaker_N]: 标记驱动多字符脚本合成,每个扬声器都有独立的声音。

速度 — 纸张对现实

头条图是 RTF 0.025 (40× 实时). 测量是在 H100 带有专用加速内核而不是在工作站上。 独立操作测试a Mac Studio / M4 马克斯 报告大致 4–6 s计算经济学 5.4 s音频环境 — 接近实时, 大约一半与 --num_step 16 以某种代价来澄清 相应的预算。

第三方测试的已知问题

  • 偶尔丢掉或拼凑的词 开始或结束 刑期 — 在一个 24- 发电测试, 5 输出丢失或损坏一个字。 这是一个众所周知的问题;重新运行通常能解决问题。
  • 生成语音克隆并保存它( Q)model.create_voice_clone_prompt() → .save("voice.pt"))让您在以后的会话中跳过参考剪辑和笔录 — 用于批量工作。
  • 完全离线操作工作,如果你预下载重 hf download k2-fsa/OmniVoice --local-dir ./model 穿过这条路 --model. 设定 GRADIO_ANALYTICS_ENABLED=False 在启动网络用户界面前 — 启动时给格拉迪奥打电话

生态系统

  • GGUF 定量 已存在( N)Serveurperso/OmniVoice-GGUF, ~62k 下载/ 月),范围为Q4 K M at ~660 MB呼叫F32,请回答
  • 声优: — a C++17/GGML 端口运行 CPU、CUDA、ROCm、金属和Vulkan,包括苹果硅. 这样就可以 OmniVoice 这是目前为止最便携的选择
  • 流行引擎中的默认引擎 语音站 当地ElevenLabs-别的项目
  • 苹果硅通过MPS(~3.3 GB 下载, 不 NVIDIA 需要卡片).

使用案例:语言宽度和可移植性

假设如何运行它小心点
资源匮乏和罕见语言646 语言,涵盖许多没有商业 TTS 支助体重为CC-BY-NC — 仅仅否决任何商业用途
CPU / Raspberry Pi / 边缘设备omnivoice.cpp运行于CPU,Metal,Vulkan和ROCm;Q4 K M语言模型下方 1 GB那个 RTF 0.025 headline 测量于 H100 有自定义内核; 本地期望更接近 1× 实时
全面空中部署下载重量一次, 然后没有网络请求技术上可行,但非商业许可证排除了公共部门和医院的工作
研究和非商业原型语音设计从描述中创建 timbre, 没有参考音频语音设计很诡异 — 生成一至三名候选人并选择
在Mac上运行通过 MPS 原生苹果硅支持,~3.3 GB 加权数由你自己测量的能力计划,而不是纸号
反直观的选择结论 : OmniVoice 运行全线下线和船舶 CPU的建设, 使它看起来很适合公共部门和医院的部署 — 但它的权重是CC-BY-NC,所以采购不会澄清. 这些设想方案应当使用 VoxCPM2 相反(Apache-2.0 代码和重量。

对国际用户的判决

如果 您正在从事研究、个人项目或低资源语言工作,或者您需要尽可能广泛的语言覆盖和最简单的CPU/Mac路径。 无任何参考音频的语音设计对于原型制作来说是真正有用的.

不要在商业上使用 不谈判单独的许可证 — 反之亦然。 Apache-2.0 Repo徽章. 对于具有类似“语音描述”功能的商业清洁替代品,请看 VoxCPM2,Chatterbox(麻省理工学院)或CosyVoice 3.

646 语言 语音设计 CPU / 麦克 / Vulkan GGUF + C++ 端口 NC 权重 — 无商业用途

在头对头数据中的位置

型号参数中文 WER / 党卫军联合国 WER / 党卫军西班牙语 WER / 党卫军
OmniVoice0.8 B3.41 / 72.993.62 / 70.133.52 / 74.14
CosyVoice3 - (英语).0.5B0.5 B3.84 / 80.014.88 / 74.164.04 / 78.85
鱼音 S2 Pro4 B3.62 / 67.793.83 / 61.662.93 / 67.44
IndexTTS2.5-RL0.8 B3.93 / 77.923.89 / 67.793.33 / 76.68
型号日语→内 WER / 党卫军日语→对 WER / 党卫军日语→对 WER / 党卫军
OmniVoice3.74 / 64.915.84 / 62.089.09 / 69.06
VoxCPM24.48 / 64.2516.38 / 64.8911.84 / 71.54
型号RTF条件
OmniVoice0.025H100 + 自定义加速内核(纸张图)
OmniVoice (计量)~0.9–1.2× 实时Mac Studio / M4 马克斯
IndexTTS2.5 (参考)0.2065RTX 4090 页:1
读这个的关键:最低 WER 不代表"听起来最像人" OmniVoice英语 WER 页:1 3.62 是最优秀的剧集之一,但其中的演说者, 70.13 — 领导人的底部。 没错 更清晰没有 更为相同. 这是新闻阅读的优势 也是人物的虚伪 或一个固定的旁白者 跨越一个音库

自己跑起来要花多少钱

项目数值说明
GPU-小时/M字符0.45 h纸张条件
点播 H100 ($2.89–3.49/h)~$1.30–1.57名义上是最便宜的
点播 RTX 4090不适用纸张数字取决于 H100 加自定义内核, 不传输
重量大小3.3 GB在Q4 K M下,语言模型部分在 1 GB
没有预算 0.025. 这是实验室的人物 H100 与目的内核。 在消费卡或苹果硅上 测量到的数值大约是 0.9–1.2× 实时 — 一个小时的音频大约需要一个小时。 其名义成本最低,硬件栏最高. 按同一要求重计费用 4090 基础,它不便宜于 IndexTTS2.5.
但成本优势不同: GGUF 外加单位 omnivoice.cpp 让它在机器上运行 无 GPU 完全没有 (CPU / 金属 / Vulkan / ROCm). 如果你需要一个 TTS 在边框中, 这是此集中唯一的选项 — 你只需要接受实时因素。

许可证和披露门

项目状态
代码许可证Apache-2.0
重量许可证CC-BY-NC (英语). 4.0 (非商业性)
商业用途不允许 — 除非你另行获得许可证
默认水印未说明
数据居住满载空气运行( 预下载重量, 禁用 Gradio 分析器)
反直观结论: 政府和医疗保健是他们最需要的离线模型 — 他们就是唯一的地方 OmniVoice 从技术上讲,这是非常出色的。 不过 CC-BY-NC权重在采购和合规时杀死它. 不要在这里烧一个概念证明,直接去 VoxCPM2. 车牌全损 06.5.

如果没有这个,那么什么

  • 语言宽度,但它必须是可载运的 → 步骤音频编辑X (Apache-2.0(a) 或 科科罗 82M (警察股, Apache-2.0(没有克隆)
  • 完全脱机 和 商业清洁 → VoxCPM2.
  • 只使用研究或爱好 → 留着吧 没什么便宜的 646- 语言报道。
  • 关于 CPU 的实时交互 → 这里什么都没有。 看看科科罗 06.1 表格,或使用关闭的 API.
在 BiliVoice 上试用

准备好使用 OmniVoice 创作了吗?

打开文字转语音并自动选中此引擎,即可使用你自己的声音模型开始创作。