Superwhisper 介绍
了解工具的详细功能和使用方法
Superwhisper 是什么
Superwhisper 是一款面向日常写作、专业记录与文件转录的 AI 语音输入工具。它的核心不是把录音集中到一个网页里处理,而是让用户在邮件、聊天、笔记、文档、浏览器和代码编辑器等应用中直接说话,再把整理后的文本插入当前输入位置。对经常要写长消息、工作记录、需求说明或初稿的人来说,这种“跨应用输入”比会后再复制转录稿更接近日常键盘工作流。
截至 2026 年 9 月 8 日,官方下载页提供 macOS、Windows 与 iOS 版本:macOS 要求 13.3 或更高版本,Windows 要求 Windows 10 或更高版本,iOS 要求 iOS 18 或更高版本。一个 Pro 许可可用于 Mac、Windows、iPhone 与 iPad,无需按平台重复购买。
两阶段处理:语音识别与文本后处理
Superwhisper 把一次听写拆成两个可独立配置的阶段。第一阶段由语音模型把音频转成原始文本;第二阶段由语言模型按照模式提示词进行修正、格式化或改写。第二阶段不是必需项:如果选择只做转录的 Voice 模式,可以完全跳过语言模型。
这种拆分带来的价值在于,用户可以按风险与效果组合处理路径。例如,普通写作可用云端语音模型加云端语言模型以获得更省心的体验;包含敏感信息时,可以在 macOS 上同时使用本地语音模型与本地语言模型;如果 Windows 用户希望把语音阶段留在设备上,则可使用本地语音模型,并关闭 AI 后处理或单独评估云端语言模型。
模式与工作流
内置模式覆盖直接语音转文字、消息、邮件、笔记、会议等常见场景。Pro 用户还可以创建自定义模式,为不同应用设定语气、结构、标点、输出语言与格式。自定义词汇适合补充姓名、产品名、行业缩写和经常被识别错的术语;说话人分离更适合会议或多人音频。
一套实用配置通常不是建立一个“万能模式”,而是保留三到四个边界清楚的模式:
- 原样听写:只做转录,便于处理事实、数字和敏感材料。
- 工作消息:删除口头填充词,把表达整理为简洁段落。
- 邮件:保留事实与语气,同时生成称呼、正文和结尾。
- 长文提纲:把连续口述整理成标题、要点和待办项。
模式越具体,输出越稳定。涉及金额、日期、账号、法律或医疗信息时,仍应人工核对原始事实,不能把语言模型润色后的文本当成已验证记录。
本地、云端与隐私边界
官方文档说明,语音识别和语言模型后处理可以分别选择本地或云端。macOS 支持语音模型与语言模型都在本地运行;Windows 当前可使用本地语音模型,但本地语言模型仅在 macOS 提供,因此 Windows 上若启用 AI 后处理,通常需要云端语言模型。也可以关闭后处理,只输出本地语音模型生成的原始文本。
Superwhisper 表示其内置云端模型通过包含零数据保留条款的 API 协议处理,音频与文本不会被下游提供商用于训练;如果使用自带 API Key,数据则受用户与对应提供商之间的协议约束。官方还说明,转录历史保存在本地;FileSync 同步模式和设置等配置,不同步转录内容或音频。自定义词汇与文本替换同样存储并处理在设备上。
这些是产品提供的技术能力与供应商承诺,并不自动等同于满足某项法规。医疗、金融、法律或企业受管制场景还需要结合组织政策、数据处理协议、访问控制、保留期和最终输入目标进行审查。即使转录完全本地,把文本粘贴到第三方网页或应用后,后续处理仍受目标服务条款约束。
免费版与 Pro
免费版提供语音听写和基础转录,并包含有限的云端语音模型用量。Pro 解锁本地语音模型、自定义模式、AI 模式、自定义词汇、说话人分离和优先支持。官网当前提供三种相同功能的 Pro 计费方式:每月 8.49 美元、每年 84.99 美元、终身 249.99 美元;区别仅在计费频率。
建议先用免费版验证三个关键问题:常用语言和口音的识别效果、目标应用中的插入稳定性、以及麦克风快捷键是否符合现有习惯。只有当本地模型、自定义模式或更高用量确实进入高频工作流时,再升级 Pro 更合理。