OpenWhispr 语音听写助手
OpenWhispr 是一款隐私优先的开源语音转文字听写应用,支持本地 Whisper、NVIDIA Parakeet 等模型与云端 BYOK 模式,覆盖 macOS、Windows、Linux,可跨应用听写、会议转写与笔记管理。
爱鲜报评分
0 人评分
9.2k
星数
否
中文
JavaScript
主语言
是
活跃
102
贡献者
人工分析
EDITORIAL推荐理由
它把「按热键说话、文字落到光标处」这件事做成了跨平台桌面工具,本地模型可完全离线,音频不出设备,隐私友好。除基础听写外还集成 AI Agent、会议实时转写与说话人分离、笔记语义搜索,功能密度高。MIT 协议、9k+ Star,适合想自建语音输入或研究本地 ASR 落地的开发者。
适用场景
- 日常写作与聊天时的全局语音输入
- 会议/访谈的实时转写与说话人分离
- 把语音指令直接发给 AI 助手执行
- 批量导入音视频文件做转写
- 在隐私敏感环境下离线完成语音转文字
优点
- 本地模型与云端模型可自由切换,音频可不出设备
- 跨平台支持 macOS、Windows、Linux,安装包齐全
- 内置 AI Agent、会议转写、笔记与语义搜索等完整功能
- MIT 开源、无遥测与数据收集,可自行审计与二次开发
- 提供公开 API 与 MCP 服务,便于集成到现有工作流
缺点
- 本地模型对硬件有要求,GPU 加速需 Metal/CUDA/Vulkan 支持
- Intel Mac 上说话人识别与语音指纹不可用,语义搜索降级为关键词匹配
- 云端模式需自备 API Key(BYOK),会产生额外调用成本
- 功能较多,首次配置模型与权限的步骤相对繁琐
OpenWhispr 是什么
OpenWhispr 是一款开源的桌面语音转文字(Voice-to-Text)听写应用,定位为 WisprFlow、Granola 的免费替代品。按下全局热键说话,文字就会出现在当前光标位置,支持 macOS、Windows 与 Linux。
它强调隐私优先:既可以使用本地语音识别模型(Whisper、NVIDIA Parakeet、Cohere Transcribe 等)让音频完全不离开设备,也可以选择云端模型换取速度,且不收集数据、不带遥测。
核心功能
- 语音听写:全局热键,在任意应用中听写并自动粘贴
- 听写翻译:用一种语言说,粘贴出另一种语言的文本
- AI Agent:可接入 GPT、Claude、Gemini、Groq、OpenRouter 或本地模型,用语音直接下达指令
- 会议转写:自动识别 Zoom、Teams、FaceTime 通话,支持实时说话人分离与语音指纹
- 笔记:文件夹组织、语义搜索、云同步与 AI 操作
- 音视频导入:拖入文件、批量上传或粘贴 YouTube 链接进行转写
- 本地或云端任选:转写、推理、说话人分离、语义搜索均可本地运行,支持 Metal / CUDA / Vulkan 加速
技术栈
React 19、TypeScript、Tailwind CSS v4、Electron 41、better-sqlite3、whisper.cpp、sherpa-onnx、shadcn/ui。
快速开始
git clone https://github.com/OpenWhispr/openwhispr.git
cd openwhispr
npm install
npm run dev
需要 Node.js 24+。桌面端位于仓库根目录,移动端 Expo 应用在 openwhispr-mobile 子目录中,有独立的依赖与构建流程。
适用人群
适合希望把语音输入融入日常写作、会议记录与 AI 交互的开发者,也适合研究本地 ASR 落地、想自建隐私友好听写工具的技术用户。项目提供公开 API 与 MCP 服务,方便与既有工作流集成。
评论
- 暂无评论,来写第一条吧。