OmniVoice
小米 / k2- fsa( 下一代 Kaldi) · 646 语言 · 释放的马尔 31, 2026
OmniVoice 来源 k2-fsa (中文(简体) ).下一代卡尔迪集团 丹尼尔·波维 — 在语音识别界具有相当份量的名字。 这是 最宽的语言覆盖零镜头 TTS 可用模型,声称 646 语言 培训内容大致 581,000 h我们的 声音,它完全在本地运行。 积累的回扣 12k GitHub 在释放后数周内 恒星的重量只有~~3.3 GB.
- 纸张
- arXiv: (中文(简体) ).2604.00688
- 后骨头
- Quen3 - (英语).0.6B (~0.8 B 总计)
- 语文
- 646
- 培训数据
- ~581,000 h
- 产出
- 24 kHz 单
- 重量大小
- ~3.3 GB
- 索赔 RTF
- 0.025 打开 H100 带有自定义内核
- 代码许可证
- Apache-2.0
- 重量许可证
- CC-BY-NC (英语). 4.0 (非商业性)
建筑 — 一种“分散式语言模型式”非自动递减设计
多数 TTS 管道分为两个阶段: text → semantic tokens → acoustic features → waveform,每跳都会累积错误。 OmniVoice 折叠到单个阶段 : text → multi-codebook acoustic tokens → waveform.
- 骨干是重新设计的 Quen3 - (英语).0.6B 以传播语言模式驱动的语言模型: 而不是向左向右排放音频 在几个平行的解密步骤中完善整个序列.
- A 双向变形器 联合模拟一个指令记录、一个即时段和遮蔽的目标段。
- 音频由来自 希格斯音频 v2 (Boson AI, Apache-2.0).
- 中间语义阶段没有错误累积,顺序解码步骤要少得多 — 因此,速度。
五种核心能力
| 能力 | 细节 |
|---|---|
| 零镜头克隆 | 3–10 s 参考音频。 内建 低声自动绘图 表示您无需提供参考记录。 通过提取一个干净的扬声器嵌入来处理噪音/反响性的引用. |
| 语音设计 | 无需引用音频 — 用自然语言描述语音(male, elderly, low pitch, British accent它会产生一个。 支持性别,年龄,投球,口音,方言和低语. |
| 精细的文本控制 | 内含非语言标记 : [laughter], [sigh], [breath], [sniff] 和 13+别者. |
| 发音覆盖 | 汉语通过pinyin,带有色调标记(例如. ZHE2;英语通过CMU发音词典. |
| 多语种对话 | [Speaker_N]: 标记驱动多字符脚本合成,每个扬声器都有独立的声音。 |
速度 — 纸张对现实
头条图是 RTF 0.025 (40× 实时). 测量是在 H100 带有专用加速内核而不是在工作站上。 独立操作测试a Mac Studio / M4 马克斯 报告大致 4–6 s计算经济学 5.4 s音频环境 — 接近实时, 大约一半与 --num_step 16 以某种代价来澄清 相应的预算。
第三方测试的已知问题
- 偶尔丢掉或拼凑的词 开始或结束 刑期 — 在一个 24- 发电测试, 5 输出丢失或损坏一个字。 这是一个众所周知的问题;重新运行通常能解决问题。
- 生成语音克隆并保存它( Q)
model.create_voice_clone_prompt()→.save("voice.pt"))让您在以后的会话中跳过参考剪辑和笔录 — 用于批量工作。 - 完全离线操作工作,如果你预下载重
hf download k2-fsa/OmniVoice --local-dir ./model穿过这条路--model. 设定GRADIO_ANALYTICS_ENABLED=False在启动网络用户界面前 — 启动时给格拉迪奥打电话
生态系统
- GGUF 定量 已存在( N)
Serveurperso/OmniVoice-GGUF, ~62k 下载/ 月),范围为Q4 K M at ~660 MB呼叫F32,请回答 - 声优: — a C++17/GGML 端口运行 CPU、CUDA、ROCm、金属和Vulkan,包括苹果硅. 这样就可以 OmniVoice 这是目前为止最便携的选择
- 流行引擎中的默认引擎 语音站 当地ElevenLabs-别的项目
- 苹果硅通过MPS(~3.3 GB 下载, 不 NVIDIA 需要卡片).
使用案例:语言宽度和可移植性
| 假设 | 如何运行它 | 小心点 |
|---|---|---|
| 资源匮乏和罕见语言 | 646 语言,涵盖许多没有商业 TTS 支助 | 体重为CC-BY-NC — 仅仅否决任何商业用途 |
| CPU / Raspberry Pi / 边缘设备 | omnivoice.cpp运行于CPU,Metal,Vulkan和ROCm;Q4 K M语言模型下方 1 GB | 那个 RTF 0.025 headline 测量于 H100 有自定义内核; 本地期望更接近 1× 实时 |
| 全面空中部署 | 下载重量一次, 然后没有网络请求 | 技术上可行,但非商业许可证排除了公共部门和医院的工作 |
| 研究和非商业原型 | 语音设计从描述中创建 timbre, 没有参考音频 | 语音设计很诡异 — 生成一至三名候选人并选择 |
| 在Mac上运行 | 通过 MPS 原生苹果硅支持,~3.3 GB 加权数 | 由你自己测量的能力计划,而不是纸号 |
对国际用户的判决
如果 您正在从事研究、个人项目或低资源语言工作,或者您需要尽可能广泛的语言覆盖和最简单的CPU/Mac路径。 无任何参考音频的语音设计对于原型制作来说是真正有用的.
不要在商业上使用 不谈判单独的许可证 — 反之亦然。 Apache-2.0 Repo徽章. 对于具有类似“语音描述”功能的商业清洁替代品,请看 VoxCPM2,Chatterbox(麻省理工学院)或CosyVoice 3.
在头对头数据中的位置
| 型号 | 参数 | 中文 WER / 党卫军 | 联合国 WER / 党卫军 | 西班牙语 WER / 党卫军 |
|---|---|---|---|---|
| OmniVoice | 0.8 B | 3.41 / 72.99 | 3.62 / 70.13 | 3.52 / 74.14 |
| CosyVoice3 - (英语).0.5B | 0.5 B | 3.84 / 80.01 | 4.88 / 74.16 | 4.04 / 78.85 |
| 鱼音 S2 Pro | 4 B | 3.62 / 67.79 | 3.83 / 61.66 | 2.93 / 67.44 |
| IndexTTS2.5-RL | 0.8 B | 3.93 / 77.92 | 3.89 / 67.79 | 3.33 / 76.68 |
| 型号 | 日语→内 WER / 党卫军 | 日语→对 WER / 党卫军 | 日语→对 WER / 党卫军 |
|---|---|---|---|
| OmniVoice | 3.74 / 64.91 | 5.84 / 62.08 | 9.09 / 69.06 |
| VoxCPM2 | 4.48 / 64.25 | 16.38 / 64.89 | 11.84 / 71.54 |
| 型号 | RTF | 条件 |
|---|---|---|
| OmniVoice | 0.025 | H100 + 自定义加速内核(纸张图) |
| OmniVoice (计量) | ~0.9–1.2× 实时 | Mac Studio / M4 马克斯 |
| IndexTTS2.5 (参考) | 0.2065 | RTX 4090 页:1 |
自己跑起来要花多少钱
| 项目 | 数值 | 说明 |
|---|---|---|
| GPU-小时/M字符 | 0.45 h | 纸张条件 |
| 点播 H100 ($2.89–3.49/h) | ~$1.30–1.57 | 名义上是最便宜的 |
| 点播 RTX 4090 | 不适用 | 纸张数字取决于 H100 加自定义内核, 不传输 |
| 重量大小 | 3.3 GB | 在Q4 K M下,语言模型部分在 1 GB |
omnivoice.cpp 让它在机器上运行 无 GPU 完全没有 (CPU / 金属 / Vulkan / ROCm). 如果你需要一个 TTS 在边框中, 这是此集中唯一的选项 — 你只需要接受实时因素。许可证和披露门
| 项目 | 状态 |
|---|---|
| 代码许可证 | Apache-2.0 |
| 重量许可证 | CC-BY-NC (英语). 4.0 (非商业性) |
| 商业用途 | 不允许 — 除非你另行获得许可证 |
| 默认水印 | 未说明 |
| 数据居住 | 满载空气运行( 预下载重量, 禁用 Gradio 分析器) |
如果没有这个,那么什么
- 语言宽度,但它必须是可载运的 → 步骤音频编辑X (Apache-2.0(a) 或 科科罗 82M (警察股, Apache-2.0(没有克隆)
- 完全脱机 和 商业清洁 → VoxCPM2.
- 只使用研究或爱好 → 留着吧 没什么便宜的 646- 语言报道。
- 关于 CPU 的实时交互 → 这里什么都没有。 看看科科罗 06.1 表格,或使用关闭的 API.
准备好使用 OmniVoice 创作了吗?
打开文字转语音并自动选中此引擎,即可使用你自己的声音模型开始创作。