Guide · 使用教程
Superwhisper 私密语音输入教程:从本地模型到跨应用写作工作流
从权限、纯转录基线、本地/云端模型、自定义模式和中英词汇开始配置 Superwhisper,并处理目标应用、历史、删除、备份、CLI/MCP 与故障回退。
这份教程要解决什么
Superwhisper 可以把语音输入带进邮件、聊天、笔记、浏览器、文档和代码编辑器,但“能开始说话”不等于已经建立可靠工作流。语音会经过麦克风、语音模型、可选语言模型、历史与目标应用;每一步都可能改变文本或扩大数据边界。
本教程从最小权限和纯转录基线开始,再逐步加入本地或云端模型、自定义模式、词汇和跨应用插入。目标是让用户知道数据去了哪里,出现问题时能判断是识别、后处理还是应用插入,并能回到已知可用配置。
上线前检查
截至 2026 年 9 月 8 日,官方下载页要求 macOS 13.3 或更高版本、Windows 10 或更高版本、iOS 18 或更高版本。先确认设备系统、可用存储、麦克风质量和公司设备管理政策。macOS 的本地能力最完整;Windows 可使用本地语音模型,但本地语言模型当前只在 macOS 提供。
准备十条非敏感测试句,包含姓名、产品名、数字、日期、邮箱、中英文和一次口头改口。建立一个临时文档接收输出,不要首次就对客户邮件、医疗记录、财务系统或代码仓库直接操作。
记录三个成功标准:原始转录事实错误不超过可接受范围;后处理不会改动数字和否定关系;目标应用插入失败时不会覆盖已有内容。还要明确哪些数据绝不能上云,哪些低敏感内容可以使用云端模型。
第一步:安装与权限
从官方 Download 页面下载安装。首次启动时按系统提示授予麦克风权限;如果要把文字插入其他应用,通常还需要辅助功能或相应输入权限。只授予实现当前测试所必需的范围,不要看到提示就一次性开放所有目录、屏幕和自动化权限。
在系统设置中记下 Superwhisper 已获得的权限。测试完成后逐项撤销再重新授权一次,确认团队知道恢复路径。公司设备如由 MDM 管理,应让 IT 通过批准的配置下发,而不是让员工绕过安全策略。
选择一个不会与 Spotlight、输入法、会议软件或截图工具冲突的快捷键。按键后确认录音状态有清楚反馈,结束后文字只进入临时文档。若没有反应,先检查快捷键冲突和辅助功能权限,再检查模型。
第二步:建立纯转录基线
先使用不调用语言模型后处理的 Voice 模式。它只把语音模型输出成原始文本,最适合判断麦克风、语言和识别模型是否正常。不要一开始就启用邮件润色或复杂提示,因为那会把识别错误与改写错误混在一起。
依次朗读十条测试句,每条保留音频或原始历史到校对完成。标记错误类型:漏词、同音词、数字、标点、语言切换、专名或目标应用插入。若同一专名反复错误,记录到词汇候选;不要为了一个偶发错误立即增加大量规则。
用短句、长段落、安静环境和普通背景噪声分别测试。目标是建立当前设备的基线,不是证明某个厂商准确率。若原始转录已经错误,调整麦克风、语言或语音模型;语言模型无法可靠修复未知事实。
第三步:选择本地或云端语音模型
本地语音模型让音频在设备上转录,适合敏感信息、弱网和希望可预测数据流的场景。代价可能是首次下载、存储、内存和设备性能。云端语音模型更省设备资源,也可能提供不同语言与速度,但音频会通过服务端处理。
决策顺序应从政策开始:音频是否允许离开设备?若不允许,选择本地语音模型;若允许,再用真实语言、口音和设备比较速度与错误。不要因为某个模型被标为“最高准确”就忽略延迟、硬件和隐私。
官方当前列出多种本地模型,并可能随版本变化。购买前在实际设备打开模式设置核对。下载后断网运行测试句,确认没有静默切换到云端;若断网失败,查看模式实际选择,而不是只看应用全局标签。
第四步:决定是否启用语言模型后处理
语言模型可以删除口头填充、整理段落、改变语气和生成结构,但也可能改动数字、否定、专名和承诺。对医疗、财务、法律、采访引语和代码指令,先保留纯转录;对普通消息、邮件和提纲,可在人工复核前启用后处理。
macOS 可以选择本地语言模型,使第二阶段也在设备上运行。Windows 当前没有本地语言模型支持;需要完全避免云端时,应使用 Voice 模式跳过后处理。使用云端语言模型时,记录具体提供商、账户和数据协议。
Superwhisper 表示内置云端 API 使用零数据保留协议且不用于模型训练。若使用 BYOK,数据处理由你与对应提供商的协议决定。BYOK 不是自动更安全:还要检查 API 日志、区域、保留、密钥权限、额度和撤销。
第五步:建立四个明确模式
第一个模式命名为“原样听写”。关闭语言模型,只做转录,不自动补充事实。它是所有问题的诊断基线,也是敏感内容和精确引语的回退路径。
第二个模式命名为“工作消息”。要求删除嗯、啊和重复句,保留事实、数字、否定和原有语气,把内容整理为两到三段,不新增承诺。先用内部低敏感消息验证,再用于外部沟通。
第三个模式命名为“邮件”。明确输出称呼、正文和结尾,语气专业简洁;要求不编造日期、附件、会议或行动项。口述时把收件人关系和目的说清,而不是让模型从当前应用猜测。
第四个模式命名为“长文提纲”。把口述整理成二级标题、要点、待核实事实和下一步,但不生成 Markdown H1。把“事实”和“想法”分开,便于后续查证。每个模式保持单一任务,避免一个巨大提示词同时做摘要、翻译、润色、事实核验和发布。
第六步:配置中英混合词汇
从真实错误建立词汇表。优先加入姓名、品牌、产品、技术缩写、客户项目和常见英文大小写,例如 API、MCP、Directus、Superwhisper。每个词保持标准写法,不要把整段说明放入词汇项。
测试“中文句子中夹英文产品名”“英文句子中夹中文姓名”“缩写后接数字版本”三类组合。词汇命中后仍要检查语言模型是否二次改写大小写。若错误来自后处理提示,修模式;若错误来自原始转录,修词汇或语音模型。
每月清理一次过期客户名和临时项目。官方说明自定义词汇与文本替换存储并处理在本地,但词汇本身也可能包含敏感信息;仍应遵循最小保留,不要把完整账号、病历号或密钥加入。
第七步:测试目标应用
依次测试纯文本框、富文本编辑器、网页表单、聊天工具、邮件编辑器和代码编辑器。每个应用检查短句、长段落、换行、列表、中英文标点、撤销和焦点切换。某些应用可能阻止辅助功能插入或把长文本截断。
插入前先在临时文档生成,再复制到高风险系统。确认稳定后才允许直接输入。对会自动发送的快捷键、终端、数据库控制台和生产管理后台,应保留人工粘贴步骤,避免识别结果立即执行。
文本进入目标应用后,隐私边界已经改变。即使两阶段都本地,粘贴到 ChatGPT、Gmail、Slack、Notion 或 CRM 后,也受该目标服务的账户和数据政策约束。教程或团队规范必须把这个下游阶段画进数据流。
第八步:处理常见故障
症状一:完全没有录音。检查系统麦克风权限、输入设备、快捷键冲突和会议软件是否独占麦克风。先在系统录音机验证硬件,再回到 Superwhisper。
症状二:有原始文本但最终内容错误。切换到原样听写,对比两阶段。如果原始文本正确,问题在语言模型或模式提示;缩短提示、减少任务、切换模型并重新测试。如果原始文本已错,调整语音模型、语言、麦克风或词汇。
症状三:历史里有文本但目标应用没有出现。检查焦点、辅助功能权限、目标输入框限制和快捷键。先复制粘贴历史结果,确认应用接受内容;不要反复重新录音制造多个副本。
症状四:处理很慢或断网失败。确认模式是否选择本地模型,模型是否已完整下载,设备资源是否足够,是否仍启用云端语言模型。一次只改变一个设置并记录结果,避免同时换麦克风、语音模型和提示词。
历史、删除与保留
官方说明转录历史保存在本地;启用 FileSync 时,同步模式和设置等配置,不同步转录内容或音频。仍应打开 History Management,确认历史中保留什么、默认多久、如何删除,并按数据分类设置自己的清理节奏。
普通草稿可短期保留以便纠错,敏感听写完成验证后应尽快删除。删除后再搜索一次,确认条目、音频和导出副本都按预期处理。团队还要考虑设备备份、系统快照和员工离职时的本地数据。
不要让“本地保存”变成无限保留。设备丢失、共享账户、恶意软件或错误备份同样可能暴露数据。启用磁盘加密、强账户认证和屏幕锁,并把保留策略写成可执行步骤。
备份、导出与恢复
先备份必要的模式配置和词汇,不要默认备份全部历史。记录当前应用版本、主要语音模型、语言模型、快捷键和权限。完成重大升级前保存一组基准测试句与结果,升级后用相同样本回归。
恢复演练包括:撤销麦克风与辅助权限后重新授权;禁用云端模型后回到本地纯转录;从备份恢复一个模式;把目标应用改成临时文档;删除一条测试历史。只有演练成功,回退方案才真实存在。
若模型更新后质量下降,不要立刻修改所有提示。先用原样听写确认变化来自语音阶段,再回退到已知模型或临时切换云端;若只有后处理变化,固定语音模型并调整语言模型。把根因隔离后再修复。
CLI 与 MCP 的边界
Superwhisper 官方在 2026 年发布 CLI 与 MCP 能力,可让自动化工具搜索和导出本地历史。它们适合把已存在的转录交给后续整理、归档或开发工作流,但也扩大了本地历史可被其他进程访问的范围。
启用前创建低权限测试环境,确认可访问哪些历史、命令输出是否包含敏感文本、日志在哪里、自动化失败后是否重试和复制内容。不要让代理拥有超出任务需要的目录、终端或网络权限。
MCP 能读取历史并不代表可以跳过用户确认。将转录发送到邮件、工单、知识库或代码提交属于新的外部动作,应设置预览、目的地白名单、人工批准和幂等键,避免重复发送。
回滚与停用
停用前导出必要模式和词汇,删除不需保留的历史,撤销麦克风、辅助功能和自动化权限,移除 BYOK 密钥,检查开机启动与后台进程,并从团队文档中取消推荐。
如果只是临时回退,保留“原样听写 + 本地语音模型 + 临时文档”最小配置,关闭语言模型、上下文和自动发送。这样可在复杂模式故障时继续基本工作,又不会把问题扩大到下游应用。
账户或订阅取消与本地数据删除是不同动作。分别验证授权、计费、设备应用、历史、备份和第三方 API Key。完成后记录日期和负责人,确保没有遗留可继续产生费用或访问数据的路径。
上线检查清单
- 系统版本与设备满足要求。
- 麦克风和辅助权限采用最小范围,并完成撤销测试。
- 原样听写基线通过,数字、否定和专名可复核。
- 每个模式记录语音模型、语言模型和云端边界。
- 中英词汇来自真实错误,不保存高敏感完整标识。
- 高风险应用保留临时文档和人工粘贴。
- 历史、删除、备份、BYOK 和下游应用有明确规则。
- CLI/MCP 自动化使用白名单、预览和人工批准。
- 已演练断网、权限丢失、模型回退与停用。
官方资料
- Superwhisper Pro、许可与定价
- Superwhisper 下载与系统要求
- Superwhisper 敏感数据最佳实践
- Superwhisper Voice 模式
- Superwhisper 语音模型
- Superwhisper 语言模型
- Superwhisper CLI 与 MCP
资料核对日期:2026 年 9 月 8 日。价格、版本、额度与产品能力会变化,购买或部署前请重新查看对应官方页面。
常见问题
- Superwhisper 怎样实现完全本地语音输入?
- 在 macOS 模式中同时选择本地语音模型和本地语言模型,或使用无语言模型的 Voice 模式。Windows 可本地转录,但本地语言模型当前只在 macOS 提供。
- 为什么要先测试无 AI 后处理的 Voice 模式?
- 它能隔离语音识别与语言模型改写。若原始文本正确而最终输出错误,应修提示或语言模型;若原始文本已错,应修麦克风、语言、词汇或语音模型。
- 自定义词汇应该放哪些内容?
- 加入高频且反复识别错误的人名、品牌、产品和技术缩写。不要放完整账号、密钥或整段写作规则,并定期删除过期客户与项目名。
- 本地转录后把文字贴到网页还算本地吗?
- 不算完整本地闭环。文本进入 Gmail、Slack、ChatGPT、Notion、CRM 或其他网页后,就受到目标服务的账户、日志、保留和训练政策约束。
- Superwhisper 历史和 FileSync 会同步什么?
- 官方说明转录历史保存在本地;FileSync 同步模式与设置等配置,不包含转录内容或音频。仍需检查设备备份和自己的保留删除策略。
- 使用 Superwhisper CLI 或 MCP 要注意什么?
- 它们可搜索和导出本地历史,会扩大访问范围。应使用最小权限、目的地白名单、预览、人工批准和幂等控制,不让自动化直接发送敏感内容。