VoiceStudio 语音工作室
完全本地运行的开源 ElevenLabs 替代方案,支持声音克隆、音色设计、视频配音、听写转写与有声书制作,覆盖 646 种语言,提供 Electron 桌面应用与本地 API。
爱鲜报评分
0 人评分
55k
星数
是
中文
Python
主语言
是
活跃
93
贡献者
人工分析
EDITORIAL推荐理由
VoiceStudio 把语音克隆、配音、转写、有声书制作整合进一个完全本地运行的桌面应用,数据不出本机,对隐私敏感场景很有吸引力。它支持 646 种语言,并提供本地 API 与 MCP 接口,方便接入 Agent 工作流。项目星数极高、社区活跃,且附带简体中文 README,中文开发者上手门槛较低。
适用场景
- 本地语音克隆与音色设计
- 视频多语言配音与字幕转写
- 有声书与批量语音内容生产
- 通过本地 API / MCP 接入 AI Agent 工作流
- 会议或访谈录音的离线听写转写
优点
- 完全本地推理,语音数据无需上传云端,隐私友好
- 功能覆盖克隆、设计、配音、转写、有声书等完整链路
- 支持 646 种语言,多语言场景适用性广
- 提供本地 API 与 MCP,便于与 Agent 和自动化流程集成
- 有简体中文 README,中文用户阅读成本低
缺点
- AGPL-3.0 许可,商业闭源集成需注意合规
- 模型各自有独立许可,商用前需逐一确认
- 无独显时只能跑 CPU,速度明显偏慢
- Intel Mac 仅支持界面,需连接远程后端
- 安装与模型下载体积较大,对磁盘和网络有要求
VoiceStudio 是什么
VoiceStudio 是一个完全本地运行的开源语音工作台,定位为 ElevenLabs 的开源替代方案。它把声音克隆、音色设计、视频配音、听写转写和有声书制作整合到一个桌面应用里,支持 646 种语言,语音数据不需要上传到云端。
项目默认引擎基于 k2-fsa/OmniVoice,也可以切换其他引擎。除了桌面 UI,它还提供本地 API 和 MCP 接口,方便接入 Agent 与自动化流程。
核心能力
- 声音克隆:上传一段干净的参考录音,即可复刻音色并用于文本转语音。
- 音色设计:用文字描述想要的声音风格,直接生成新音色。
- 视频配音:为视频生成时间对齐的配音语音。
- 听写与转写:通过悬浮小组件做语音听写,或对音频做转写。
- 有声书与批量任务:适合故事、有声书等长内容与批处理生产。
- 本地模型管理:在应用内安装和管理本地语音模型。
安装与运行
macOS / Linux 提供一行命令安装最新 Electron 版本:
curl -fsSL https://voicestudio.sh/install | sh
Windows 在 PowerShell 中执行:
irm https://voicestudio.sh/install | iex
也可以直接从 Releases 下载安装包(macOS .dmg、Windows .exe、Linux .AppImage / .deb)。
从源码运行 Electron 预览版的大致流程:
git clone https://github.com/debpalash/VoiceStudio.git
cd VoiceStudio
bun install
bun run setup:api # 启动 Electron 前准备 Python 依赖
bun run dev
注意:Electron 是目前唯一的桌面应用与 Web UI,0.5.3 是最后一个 Tauri 版本,旧 Tauri 用户需要单独安装 Electron。
硬件要求
| 硬件 | 支持情况 |
|---|---|
| NVIDIA GPU(Windows / Linux) | CUDA 加速 |
| Apple Silicon | Metal(MPS)加速 |
| 无独显(集显 / 老机器) | 可纯 CPU 运行,速度较慢 |
| Windows on ARM | 实验性,仅 CPU |
| Intel Mac | 仅界面,需连接远程后端 |
集成与扩展
- 本地 API:把语音能力接入自己的应用。
- MCP:让支持 MCP 的 Agent 直接调用语音工作流。
- Agent 技能:可通过
npx skills add debpalash/VoiceStudio添加技能。
许可与合规
项目采用 AGPL-3.0 许可,各模型还有各自的许可条款,商用前需要逐一确认。克隆他人声音请务必获得授权。
评论
- 暂无评论,来写第一条吧。