AI/智能体/模型工具 · TypeScript

jamiepine/voicebox

本地运行的开源 AI 语音工作室,兼顾语音克隆、朗读和语音听写

增长榜 #18 已读 README 并重写
增长排名 #18 Fast Growth Top 100
本期热度 Stars 61 OSSInsight 页面展示
Forks 9 榜单记录
Fork / Star 14.8% 社区复用强度

它是什么

Voicebox 是一个本地优先的 AI 语音工作室,不是单一的 TTS 工具。它把语音克隆、语音生成、语音听写和智能体发声放在一个应用里,解决的是“语音输入”和“语音输出”分散在不同产品里的问题。主要面向需要处理语音、想在本机完成语音工作流的人。

为什么值得关注

README 明确把它定位成 ElevenLabs 和 WisprFlow 的本地开源替代品,而且把输入、输出和本地推理串成一套完整语音 I/O。榜单里它热度增长快,说明这种“一个应用覆盖整条语音链路”的定位很受关注。

核心能力

  • 可用少量音频克隆任意声音
  • 支持 23 种语言的语音生成
  • 提供 7 种 TTS 引擎
  • 可用全局热键向任意输入框听写

适合谁用

  • 需要在本机完成语音输入输出的人
  • 想把语音能力接入智能体交互的开发者
  • 需要多语言朗读或语音克隆的内容工作者
  • 重视隐私、希望模型和音频留在本地的用户

使用前注意

  • 项目强调本地运行,模型和语音数据不离开机器
  • README 提到包含本地 LLM,用于润色和 persona 处理
  • 支持 7 个 TTS 引擎,实际效果会随引擎而异
  • 仓库开源许可为 MIT

README 证据

  • “The open-source AI voice studio. Clone any voice. Generate speech. Dictate into any app.”
  • “The full voice I/O stack, running locally on your machine.”
  • “Clone voices from a few seconds of audio”
  • “generate speech in 23 languages across 7 TTS engines”