AX 爱鲜报

综合 / 人工智能 · 2026-10-09 09:46 · 1 阅读 · 0 赞

VoiceStudio:本地运行的 ElevenLabs 平替,支持 646 种语言与语音克隆

VoiceStudio 是一款开源本地语音工作流工具,内置 16 个 TTS 引擎与 11 个 ASR 引擎,支持 646 种语言、语音克隆、视频配音、听写转录与有声书制作,全程离线运行,并提供 OpenAI 兼容 API 与 MCP 集成。

▲ 本地 ElevenLabs 平替,646 种语言全离线运行

01 你用的 AI 语音,数据都去了哪

ElevenLabs 很好用,但每次你点击"生成",你的文本、你的声音样本、你的音频文件,全部上传到他们的服务器。

做内容还好,但如果你的内容是商业机密、个人隐私、或者不想让第三方听到的东西——你就得停手。

VoiceStudio 解决的就是这个问题:所有东西在你的机器上跑,一滴数据都不出去。

02 它是什么

VoiceStudio 是一个开源的本地语音工作流工具,14,794 Star。

定位很明确:本地运行的 ElevenLabs 替代方案。

不依赖任何 API Key,不注册账号,不订阅付费。装好之后,所有功能完全离线可用。

支持平台:macOS(Apple Silicon)、Windows 10/11、Linux x86_64,以及 Docker。

03 16 个 TTS 引擎,646 种语言

VoiceStudio 的核心优势是引擎丰富。

内置 16 个 TTS 引擎和 11 个 ASR(语音识别)引擎,你可以根据需求切换:

引擎 语言数 语音克隆 特点
OmniVoice GGUF 600+ ✅ 主力引擎,速度快,质量稳定
IndexTTS 2.5 4 ✅ 中文/英文/日文/西班牙文/阿拉伯文,质量顶尖
Piper 100+ ❌ 轻量级,CPU 友好
MeloTTS 16 ❌ 多语言支持好
VALL-E X 10+ ✅ 微软技术路线,零样本克隆
KittenTTS 1 ❌ 纯英文,极简
Montreal Forced Aligner — — 语音对齐工具

每个引擎都能一键切换,同一个文本可以用不同引擎生成,对比效果。

04 四大核心功能

语音克隆(Voice Cloning)

导入 3-15 秒的干净语音样本,AI 就能克隆这个声音。

三个步骤:

    1. 选引擎(推荐 IndexTTS 2.5 或 OmniVoice)
    1. 上传样本(MP3/WAV/FLAC 均可)
    1. 输入文本,生成

克隆出来的声音可以用于 TTS 生成、视频配音、有声书制作。

视频配音(Video Dubbing)

上传视频,AI 自动识别语音、转录、翻译、重新配音,输出带新音轨的视频。

支持多语言配音,同一个视频可以生成多个语言的音轨版本。

听写转录(Dictation & Transcription)

实时听写,对着麦克风说话,文字实时出现在编辑器里。

也支持文件转录——上传音频文件,自动生成带时间戳的文本。

输出格式支持:JSON、TXT、SRT、VTT。

有声书制作(Audiobook)

输入长文本(小说、文章、文档),AI 自动分段、分配角色、生成多角色有声书。

支持批量生成,一次处理整本书。

05 为什么本地运行很重要

隐私:你的声音样本、你的文本内容、你的音频文件,全部留在本地。不上传、不存储、不分析。

成本:ElevenLabs 最便宜的方案 $5/月,高级方案 $99-330/月。VoiceStudio 完全免费,用你自己的 GPU 算力。

速度:本地运行没有网络延迟,生成速度取决于你的硬件。RTX 4090 上 OmniVoice GGUF 可以实现接近实时的 TTS。

可控:你可以自己选择模型、调整参数、替换引擎。不需要看厂商的脸色,不用担心 API 涨价。

06 API 和 MCP 集成

VoiceStudio 不只是桌面应用,还提供完整的 API:

# OpenAI 兼容 API
POST /v1/audio/speech        # TTS 生成
POST /v1/audio/transcriptions # 语音转文字
WS /v1/audio/transcriptions/stream  # 实时流式转录

也内置了 MCP Server,可以直接接入 Claude Code、Cursor、OpenClaw 等 AI Agent:

在 Claude Code 里:

/mcp add voice-studio http://localhost:8080

接入后,Agent 可以直接调用语音生成、转录、克隆等功能。

07 怎么用

最简单的方式:下载桌面应用

# macOS (Apple Silicon)
# 下载 DMG,右键打开(首次需要确认)

# Windows
# 下载 MSI,直接安装

# Linux
# 下载 AppImage,chmod +x 后运行

Docker 方式:

docker run -p 8080:8080 \
  -v voice-studio-data:/data \
  ghcr.io/debpalash/voice-studio:latest-cuda

源码部署:

git clone https://github.com/debpalash/VoiceStudio.git
cd VoiceStudio
# 安装依赖后运行

08 和 ElevenLabs 的对比

功能 VoiceStudio ElevenLabs
价格 免费 $5-330/月
运行方式 本地 云端
隐私 完全私有 数据上传
语言数 646 32
语音克隆 ✅ ✅
视频配音 ✅ ✅
API 兼容 OpenAI 格式 自有格式
MCP 集成 ✅ ❌
离线运行 ✅ ❌

写在最后

想要强大的语音能力,但不想付出隐私和金钱。

如果你做内容创作、做播客、做视频配音,VoiceStudio 值得试试。

GitHub:https://github.com/debpalash/VoiceStudio

文档:https://github.com/debpalash/VoiceStudio#documentation

标签 AI 开源 MCP 语音克隆 TTS

评论

登录后才可评论

0 条评论

  • 暂无评论,来写第一条吧。