智猩猩AI整理
编辑:金水
语音转文字这几年越来越成了日常标配。开会记纪要、写草稿、整理客户对话,张嘴就能变出文字,显著提升了输入效率,尤其惠及打字速度受限的用户。
据项目官网披露,语音输入速度可达键盘打字的约三倍(约 150 WPM 对 40 WPM),这也是此类工具获得广泛关注的直接动因。
WisprFlow、Granola 这类工具,按键开口就能把话说成字,用过的都懂那种省事。但它们的底色差不多:闭源、按月订阅,而且默认把语音送到云端,那就意味着你聊的每句话,基本都要过一遍别人的服务器。
对一些需要注意隐私的人群,或者单纯不想被年费绑死的小团队来说,这就有点别扭,数据出了门,钱包也出了门。
9 月初,GitHub 上有个项目叫 OpenWhispr,直接把自己写成它们的「开源免费替代品」。近期其登上 GitHub Trending,星标持续增长,现已收获7.6k star。
它用 MIT 协议放出整套代码,macOS、Windows、Linux 通吃。项目的README 里那句介绍很直白:按个热键、开口、字就落在光标处;转录要么完全在本地用 Whisper 或 NVIDIA Parakeet 跑,音频不出本机,要么接云端图快。
「不收集数据、没有遥测、完全开源」,这是它明摆着的卖点。
![]()
01
它到底是什么
OpenWhispr 的核心能力是将桌面端的语音转换为文本、笔记与可执行动作。用户通过全局热键(默认 F4)触发语音输入,转写文本会自动粘贴至当前光标所在位置,兼容 ChatGPT、Claude、Cursor、Slack 及各类文档编辑器。
项目支持 100 余种语言(含中文)并具备自动语言检测能力,可覆盖跨语言听写与翻译场景。
![]()
该项目的关键设计在于本地与云端由用户自主选择。
在本地模式下,Whisper 或 NVIDIA Parakeet 模型于设备端运行,音频数据不离开本机;Whisper 支持 Metal、CUDA、Vulkan(覆盖 AMD 与 Intel 显卡)的 GPU 加速。
在云端模式下,项目采用 BYOK(Bring Your Own Key)机制,用户使用自有的 OpenAI、Anthropic 或 Gemini 等 API 密钥,平台不中转、不留存数据。
本地模型提供多档配置,用户可依据设备性能与精度需求选择:Whisper Tiny(75 MB,最快)、Whisper Base(142 MB,快速)、Whisper Small(466 MB,均衡)、Whisper Medium(1.5 GB,准确)与 Whisper Turbo(1.6 GB,最佳)。
除基础听写外,OpenWhispr 还集成了多项能力:听写翻译支持以 A 语言输入、输出 B 语言文本;AI 代理可对接 GPT-5、Claude、Gemini、Groq、Tinfoil、OpenRouter 或本地模型,并支持以唤醒式短语直接下达命令,例如说出「嘿 OpenWhispr,帮我整理一下这封邮件:我要告诉 Mike 会议改到周四下午三点,另外提醒他准备好幻灯片」,即可生成措辞得体的邮件草稿;
![]()
会议转录可自动识别 Zoom、Teams、FaceTime,并在本地完成说话人分离与声纹识别,同时对接 Google、Microsoft 或 Apple 日历;笔记模块提供文件夹、语义搜索、云同步与 AI 动作;
![]()
登录用户可免费创建团队空间并分享笔记,支持链接、域名与邀请三种可见性;音频导入支持文件拖拽、批量上传及 YouTube 链接转写,可选说话人检测;
企业版提供 SSO、SCIM 及集中管理的 Amazon Bedrock、Azure OpenAI 接入,无需下发密钥;开发者则可通过公开 API 与 MCP 将笔记和转录接入自有程序或 AI 助手。
![]()
技术栈方面,项目采用 React 19、TypeScript 与 Tailwind CSS v4 构建界面,桌面端基于 Electron 41,本地推理依赖 whisper.cpp 与 sherpa-onnx,存储使用 better-sqlite3。
基于 MIT 协议,个人与商业使用均免费。
需要说明,项目的README 中的「云端」包含两层含义:其一为前述 BYOK 模式,密钥与数据均由用户掌控;其二为官方托管的 OpenWhispr Cloud,该部分属闭源并收费。
因此「完全开源」应理解为客户端代码开源,托管云服务不在其列,评估时需留意这一边界。
此外,Intel 架构的 Mac 设备不支持实时说话人识别与声纹识别,原因是 ONNX Runtime 自 1.24 版本起停止发布 macOS x86_64 二进制文件。该限制不影响会议录制与转写,仅笔记搜索由语义搜索回退至关键词匹配。
02
怎么上手
最简方式是从 Release 页面下载预编译安装包:macOS 提供 Apple Silicon 与 Intel 两版 .dmg,Windows 提供 .exe,Linux 提供 .AppImage、.deb、.rpm 与 .tar.gz,安装后即可使用。
若从源码构建,README 提供的命令如下:
npm run dev构建需 Node.js 24 及以上版本。
首次启动会提示选择默认模型(本地 Whisper 各档位或 Parakeet),模型在首次转录时自动下载。此后按住全局热键说话、松开,文本即插入光标处。关于默认热键,官方站点演示显示为 Ctrl+Space,而第三方测评记为 F4,两者均可在设置中自定义。
需要说明的是,本地模型首次下载经由 Hugging Face,在国内网络环境下建议配置镜像源以提升下载成功率,具体环境变量参见项目文档。
03
总结
OpenWhispr 并非适用于所有用户。
其典型受益群体包括:频繁处理敏感内容、数据不可出境的用户;使用 Obsidian、Logseq 或 Apple Notes 进行本地笔记、需要将录音直接汇入笔记工具的用户;以及希望免订阅、同时获得「全局热键 + 默认本地 + 云端可选」组合能力的用户。
反之,不愿接触命令行与模型下载的纯新手,其开箱即用体验不及纯云端 SaaS;对说话人识别有强需求的 Intel Mac 用户会受到前述限制影响;中文重度用户应注意 Parakeet 对中文支持较弱,建议中文场景选用 Whisper 系列模型。
关注+星标,获取AI前沿进展与开源一线动态
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.