AX 爱鲜报

OpenWhispr 语音听写助手

OpenWhispr 是一款隐私优先的开源语音转文字听写应用,支持本地 Whisper、NVIDIA Parakeet 等模型与云端 BYOK 模式,覆盖 macOS、Windows、Linux,可跨应用听写、会议转写与笔记管理。

爱鲜报评分

0.0

0 人评分

9.2k

星数

否

中文

JavaScript

主语言

是

活跃

102

贡献者

人工分析

EDITORIAL

推荐理由

它把「按热键说话、文字落到光标处」这件事做成了跨平台桌面工具,本地模型可完全离线,音频不出设备,隐私友好。除基础听写外还集成 AI Agent、会议实时转写与说话人分离、笔记语义搜索,功能密度高。MIT 协议、9k+ Star,适合想自建语音输入或研究本地 ASR 落地的开发者。

适用场景

  • 日常写作与聊天时的全局语音输入
  • 会议/访谈的实时转写与说话人分离
  • 把语音指令直接发给 AI 助手执行
  • 批量导入音视频文件做转写
  • 在隐私敏感环境下离线完成语音转文字

优点

  • 本地模型与云端模型可自由切换,音频可不出设备
  • 跨平台支持 macOS、Windows、Linux,安装包齐全
  • 内置 AI Agent、会议转写、笔记与语义搜索等完整功能
  • MIT 开源、无遥测与数据收集,可自行审计与二次开发
  • 提供公开 API 与 MCP 服务,便于集成到现有工作流

缺点

  • 本地模型对硬件有要求,GPU 加速需 Metal/CUDA/Vulkan 支持
  • Intel Mac 上说话人识别与语音指纹不可用,语义搜索降级为关键词匹配
  • 云端模式需自备 API Key(BYOK),会产生额外调用成本
  • 功能较多,首次配置模型与权限的步骤相对繁琐
上手难度 进阶

OpenWhispr 是什么

OpenWhispr 是一款开源的桌面语音转文字(Voice-to-Text)听写应用,定位为 WisprFlow、Granola 的免费替代品。按下全局热键说话,文字就会出现在当前光标位置,支持 macOS、Windows 与 Linux。

它强调隐私优先:既可以使用本地语音识别模型(Whisper、NVIDIA Parakeet、Cohere Transcribe 等)让音频完全不离开设备,也可以选择云端模型换取速度,且不收集数据、不带遥测。

核心功能

  • 语音听写:全局热键,在任意应用中听写并自动粘贴
  • 听写翻译:用一种语言说,粘贴出另一种语言的文本
  • AI Agent:可接入 GPT、Claude、Gemini、Groq、OpenRouter 或本地模型,用语音直接下达指令
  • 会议转写:自动识别 Zoom、Teams、FaceTime 通话,支持实时说话人分离与语音指纹
  • 笔记:文件夹组织、语义搜索、云同步与 AI 操作
  • 音视频导入:拖入文件、批量上传或粘贴 YouTube 链接进行转写
  • 本地或云端任选:转写、推理、说话人分离、语义搜索均可本地运行,支持 Metal / CUDA / Vulkan 加速

技术栈

React 19、TypeScript、Tailwind CSS v4、Electron 41、better-sqlite3、whisper.cpp、sherpa-onnx、shadcn/ui。

快速开始

git clone https://github.com/OpenWhispr/openwhispr.git
cd openwhispr
npm install
npm run dev

需要 Node.js 24+。桌面端位于仓库根目录,移动端 Expo 应用在 openwhispr-mobile 子目录中,有独立的依赖与构建流程。

适用人群

适合希望把语音输入融入日常写作、会议记录与 AI 交互的开发者,也适合研究本地 ASR 落地、想自建隐私友好听写工具的技术用户。项目提供公开 API 与 MCP 服务,方便与既有工作流集成。

评论

登录后才可评论与评分

0 条评论

  • 暂无评论,来写第一条吧。