AX 爱鲜报

VoiceStudio 语音工作室

完全本地运行的开源 ElevenLabs 替代方案,支持声音克隆、音色设计、视频配音、听写转写与有声书制作,覆盖 646 种语言,提供 Electron 桌面应用与本地 API。

爱鲜报评分

0.0

0 人评分

55k

星数

是

中文

Python

主语言

是

活跃

93

贡献者

人工分析

EDITORIAL

推荐理由

VoiceStudio 把语音克隆、配音、转写、有声书制作整合进一个完全本地运行的桌面应用,数据不出本机,对隐私敏感场景很有吸引力。它支持 646 种语言,并提供本地 API 与 MCP 接口,方便接入 Agent 工作流。项目星数极高、社区活跃,且附带简体中文 README,中文开发者上手门槛较低。

适用场景

  • 本地语音克隆与音色设计
  • 视频多语言配音与字幕转写
  • 有声书与批量语音内容生产
  • 通过本地 API / MCP 接入 AI Agent 工作流
  • 会议或访谈录音的离线听写转写

优点

  • 完全本地推理,语音数据无需上传云端,隐私友好
  • 功能覆盖克隆、设计、配音、转写、有声书等完整链路
  • 支持 646 种语言,多语言场景适用性广
  • 提供本地 API 与 MCP,便于与 Agent 和自动化流程集成
  • 有简体中文 README,中文用户阅读成本低

缺点

  • AGPL-3.0 许可,商业闭源集成需注意合规
  • 模型各自有独立许可,商用前需逐一确认
  • 无独显时只能跑 CPU,速度明显偏慢
  • Intel Mac 仅支持界面,需连接远程后端
  • 安装与模型下载体积较大,对磁盘和网络有要求
上手难度 进阶

VoiceStudio 是什么

VoiceStudio 是一个完全本地运行的开源语音工作台,定位为 ElevenLabs 的开源替代方案。它把声音克隆、音色设计、视频配音、听写转写和有声书制作整合到一个桌面应用里,支持 646 种语言,语音数据不需要上传到云端。

项目默认引擎基于 k2-fsa/OmniVoice,也可以切换其他引擎。除了桌面 UI,它还提供本地 API 和 MCP 接口,方便接入 Agent 与自动化流程。

核心能力

  • 声音克隆:上传一段干净的参考录音,即可复刻音色并用于文本转语音。
  • 音色设计:用文字描述想要的声音风格,直接生成新音色。
  • 视频配音:为视频生成时间对齐的配音语音。
  • 听写与转写:通过悬浮小组件做语音听写,或对音频做转写。
  • 有声书与批量任务:适合故事、有声书等长内容与批处理生产。
  • 本地模型管理:在应用内安装和管理本地语音模型。

安装与运行

macOS / Linux 提供一行命令安装最新 Electron 版本:

curl -fsSL https://voicestudio.sh/install | sh

Windows 在 PowerShell 中执行:

irm https://voicestudio.sh/install | iex

也可以直接从 Releases 下载安装包(macOS .dmg、Windows .exe、Linux .AppImage / .deb)。

从源码运行 Electron 预览版的大致流程:

git clone https://github.com/debpalash/VoiceStudio.git
cd VoiceStudio
bun install
bun run setup:api   # 启动 Electron 前准备 Python 依赖
bun run dev

注意:Electron 是目前唯一的桌面应用与 Web UI,0.5.3 是最后一个 Tauri 版本,旧 Tauri 用户需要单独安装 Electron。

硬件要求

硬件 支持情况
NVIDIA GPU(Windows / Linux) CUDA 加速
Apple Silicon Metal(MPS)加速
无独显(集显 / 老机器) 可纯 CPU 运行,速度较慢
Windows on ARM 实验性,仅 CPU
Intel Mac 仅界面,需连接远程后端

集成与扩展

  • 本地 API:把语音能力接入自己的应用。
  • MCP:让支持 MCP 的 Agent 直接调用语音工作流。
  • Agent 技能:可通过 npx skills add debpalash/VoiceStudio 添加技能。

许可与合规

项目采用 AGPL-3.0 许可,各模型还有各自的许可条款,商用前需要逐一确认。克隆他人声音请务必获得授权。

评论

登录后才可评论与评分

0 条评论

  • 暂无评论,来写第一条吧。