综合 / 人工智能 · 2026-10-09 09:46 · 1 阅读 · 0 赞
VoiceStudio:本地运行的 ElevenLabs 平替,支持 646 种语言与语音克隆
VoiceStudio 是一款开源本地语音工作流工具,内置 16 个 TTS 引擎与 11 个 ASR 引擎,支持 646 种语言、语音克隆、视频配音、听写转录与有声书制作,全程离线运行,并提供 OpenAI 兼容 API 与 MCP 集成。

▲ 本地 ElevenLabs 平替,646 种语言全离线运行
01 你用的 AI 语音,数据都去了哪
ElevenLabs 很好用,但每次你点击"生成",你的文本、你的声音样本、你的音频文件,全部上传到他们的服务器。
做内容还好,但如果你的内容是商业机密、个人隐私、或者不想让第三方听到的东西——你就得停手。
VoiceStudio 解决的就是这个问题:所有东西在你的机器上跑,一滴数据都不出去。
02 它是什么
VoiceStudio 是一个开源的本地语音工作流工具,14,794 Star。
定位很明确:本地运行的 ElevenLabs 替代方案。
不依赖任何 API Key,不注册账号,不订阅付费。装好之后,所有功能完全离线可用。
支持平台:macOS(Apple Silicon)、Windows 10/11、Linux x86_64,以及 Docker。
03 16 个 TTS 引擎,646 种语言
VoiceStudio 的核心优势是引擎丰富。
内置 16 个 TTS 引擎和 11 个 ASR(语音识别)引擎,你可以根据需求切换:
| 引擎 | 语言数 | 语音克隆 | 特点 |
|---|---|---|---|
| OmniVoice GGUF | 600+ | ✅ | 主力引擎,速度快,质量稳定 |
| IndexTTS 2.5 | 4 | ✅ | 中文/英文/日文/西班牙文/阿拉伯文,质量顶尖 |
| Piper | 100+ | ❌ | 轻量级,CPU 友好 |
| MeloTTS | 16 | ❌ | 多语言支持好 |
| VALL-E X | 10+ | ✅ | 微软技术路线,零样本克隆 |
| KittenTTS | 1 | ❌ | 纯英文,极简 |
| Montreal Forced Aligner | — | — | 语音对齐工具 |
每个引擎都能一键切换,同一个文本可以用不同引擎生成,对比效果。
04 四大核心功能
语音克隆(Voice Cloning)
导入 3-15 秒的干净语音样本,AI 就能克隆这个声音。
三个步骤:
-
- 选引擎(推荐 IndexTTS 2.5 或 OmniVoice)
-
- 上传样本(MP3/WAV/FLAC 均可)
-
- 输入文本,生成
克隆出来的声音可以用于 TTS 生成、视频配音、有声书制作。
视频配音(Video Dubbing)
上传视频,AI 自动识别语音、转录、翻译、重新配音,输出带新音轨的视频。
支持多语言配音,同一个视频可以生成多个语言的音轨版本。
听写转录(Dictation & Transcription)
实时听写,对着麦克风说话,文字实时出现在编辑器里。
也支持文件转录——上传音频文件,自动生成带时间戳的文本。
输出格式支持:JSON、TXT、SRT、VTT。
有声书制作(Audiobook)
输入长文本(小说、文章、文档),AI 自动分段、分配角色、生成多角色有声书。
支持批量生成,一次处理整本书。
05 为什么本地运行很重要
隐私:你的声音样本、你的文本内容、你的音频文件,全部留在本地。不上传、不存储、不分析。
成本:ElevenLabs 最便宜的方案 $5/月,高级方案 $99-330/月。VoiceStudio 完全免费,用你自己的 GPU 算力。
速度:本地运行没有网络延迟,生成速度取决于你的硬件。RTX 4090 上 OmniVoice GGUF 可以实现接近实时的 TTS。
可控:你可以自己选择模型、调整参数、替换引擎。不需要看厂商的脸色,不用担心 API 涨价。
06 API 和 MCP 集成
VoiceStudio 不只是桌面应用,还提供完整的 API:
# OpenAI 兼容 API
POST /v1/audio/speech # TTS 生成
POST /v1/audio/transcriptions # 语音转文字
WS /v1/audio/transcriptions/stream # 实时流式转录
也内置了 MCP Server,可以直接接入 Claude Code、Cursor、OpenClaw 等 AI Agent:
在 Claude Code 里:
/mcp add voice-studio http://localhost:8080
接入后,Agent 可以直接调用语音生成、转录、克隆等功能。
07 怎么用
最简单的方式:下载桌面应用
# macOS (Apple Silicon)
# 下载 DMG,右键打开(首次需要确认)
# Windows
# 下载 MSI,直接安装
# Linux
# 下载 AppImage,chmod +x 后运行
Docker 方式:
docker run -p 8080:8080 \
-v voice-studio-data:/data \
ghcr.io/debpalash/voice-studio:latest-cuda
源码部署:
git clone https://github.com/debpalash/VoiceStudio.git
cd VoiceStudio
# 安装依赖后运行
08 和 ElevenLabs 的对比
| 功能 | VoiceStudio | ElevenLabs |
|---|---|---|
| 价格 | 免费 | $5-330/月 |
| 运行方式 | 本地 | 云端 |
| 隐私 | 完全私有 | 数据上传 |
| 语言数 | 646 | 32 |
| 语音克隆 | ✅ | ✅ |
| 视频配音 | ✅ | ✅ |
| API 兼容 | OpenAI 格式 | 自有格式 |
| MCP 集成 | ✅ | ❌ |
| 离线运行 | ✅ | ❌ |
写在最后
想要强大的语音能力,但不想付出隐私和金钱。
如果你做内容创作、做播客、做视频配音,VoiceStudio 值得试试。
GitHub:https://github.com/debpalash/VoiceStudio
文档:https://github.com/debpalash/VoiceStudio#documentation