Speech To Markdown 是一款本地语音转 Markdown 工具,可以把零散口述转成带有标题、列表和段落结构的 Markdown 笔记。它支持 Mac 和 iPhone,但两个版本采用的语音识别与文本整理方式并不相同。

如果经常用语音写文章初稿、记录灵感或整理工作日志,普通听写只能解决“转成文字”这一步,后续仍要手动分段、添加标题和整理列表。Wispr Flow、Superwhisper 等商业软件已经能处理这些工作,但部分功能需要付费,数据是否留在本机也要看具体模式和配置。

Speech To Markdown 本地语音转 Markdown 工具官网主页

 

Speech To Markdown 把语音转写和 Markdown 整理放到了同一个流程中。Mac 版使用本地 Whisper 完成转写,Agent Mode 的文本流向取决于用户配置的 LLM 服务;iPhone 和 iPad 版则使用苹果提供的端侧语音识别与基础模型框架。

Speech To Markdown 能做什么?

Speech To Markdown 主要用来把口述内容转成 Markdown 笔记。它不只是逐字听写,还能根据内容自动分段、添加标题、整理列表,减少转写完成后的手动排版工作。

日常可以用它记录临时灵感、口述文章初稿、整理工作日志,或者把一段比较零散的表达改成结构清楚的提纲。Mac 版还提供全局语音输入和 Agent Mode,可以在其他应用中处理选中的文字;iPhone 和 iPad 版更适合随手录入并生成 Markdown 内容。

  • 语音转文字:把实时口述内容转换成可编辑文本。
  • 自动整理 Markdown:根据内容生成标题、段落和列表。
  • 修改已有文字:在 Mac 上通过语音调整选中的文本。
  • 继续补充内容:在现有笔记或草稿后追加新的口述内容。

Speech To Markdown 能替代 Wispr Flow 或 Superwhisper 吗?

Speech To Markdown 目前还不能完整替代 Wispr Flow 或 Superwhisper。它更像一款面向技术用户的免费方案:不需要持续订阅,但 Mac 版需要通过官方脚本安装并编译;使用 Agent Mode 时,还要自行配置兼容的 LLM 服务。如果希望文本整理留在本机,可以连接 Ollama、LM Studio 等本地服务。

Speech To Markdown Mac 版终端脚本安装方式
Wispr Flow 更强调跨应用语音输入和开箱即用,Superwhisper 则提供更成熟的 Mac 客户端,并支持本地与在线模型。Speech To Markdown 的功能和平台成熟度暂时不在同一个级别,但对于已经使用 Ollama、LM Studio 等本地模型服务的用户,它可以作为一个成本较低的替代选择。

对比项目 Speech To Markdown Wispr Flow Superwhisper
主要定位 本地语音转 Markdown 跨应用 AI 语音输入 Mac AI 语音听写与文本处理
数据处理方式 Mac 端本地转写,文本整理取决于用户配置的 LLM 服务;iOS 端使用苹果端侧框架 主要依赖在线服务 支持本地与在线模型,具体取决于所选模式
安装门槛 需要使用终端运行官方安装脚本,脚本会自动安装依赖、编译并放入 Applications 较低,安装客户端后即可使用 较低,提供完整客户端
本地模型配置 Agent Mode 需要自行准备兼容的 LLM 服务 通常不需要用户配置 客户端内提供相关模型与模式选择
费用模式 工具免费,但需自备设备和本地模型运行环境 免费版与订阅方案 免费版、订阅与买断方案
更适合谁 愿意配置本地模型、重视数据流向的技术用户 追求开箱即用和跨平台体验的用户 希望兼顾易用性与本地处理的 Mac 用户
简单来说:
如果你只想安装后马上使用,Wispr Flow 和 Superwhisper 的完成度更高;如果你已经在运行本地模型,也愿意处理安装和配置问题,Speech To Markdown 可以作为免费、本地化的替代选择。

本地语音转 Markdown:Mac 与 iOS 版有什么区别?

Speech To Markdown 同时提供 Mac 和 iPhone、iPad 版本,但语音识别、文本整理和安装方式都不一样,具体区别如下:

项目 macOS 版 iPhone / iPad 版
语音识别 whisper.cpp Apple SpeechAnalyzer
文本结构整理 连接兼容 OpenAI API 格式的 LLM 服务,可配置 Ollama、LM Studio 等本机服务 Apple Foundation Models
数据流向 音频在本机转写;整理后的文本是否离开设备,取决于配置的是本地还是远程 LLM 地址 按照官方说明,通过苹果端侧框架在设备上处理
安装方式 通过脚本安装并从源码构建 App Store 直接下载
核心限制 安装略折腾,Agent 模式对内存和算力要求较高 设备必须支持 Apple Intelligence

Speech To Markdown iPhone 与 iPad 版本界面

Mac 版怎么用:全局听写与 Agent Mode

Mac 版提供两种使用方式。

最基础的是全局语音输入:按下默认快捷键 ⌘⌥],可以直接在浏览器、终端或编辑器里把语音转成文字,这部分只依赖 Whisper 模型。

Speech To Markdown Mac 版全局听写与 Agent Mode 界面

更进阶的是 Agent Mode。使用前需要配置兼容 OpenAI API 格式的 LLM 服务;如果希望文本整理也在本机完成,可以连接 Ollama、LM Studio 等本地服务。Agent Mode 提供三种处理方式:

  • Format 模式:把零散口述整理成带有标题、列表和段落结构的提纲或文章初稿。
  • Edit 模式:选中一段已有文字,再通过语音说明修改要求,例如“把这部分改得更简洁”。
  • Append 模式:把新口述的内容追加到当前文档,不需要每次重新整理全文,处理长文档时响应更快。

使用前需要确认的三项条件

  1. Mac 的内存与算力:
    如果希望通过 Ollama、LM Studio 在本机运行大模型,内存占用会受到模型大小和量化规格影响。8GB 统一内存的基础款 Mac 更适合小型模型,运行官方推荐的大模型可能不够流畅。
  2. iPhone 和 iPad 的兼容范围:
    移动版依赖苹果端侧 AI 框架,需要支持 Apple Intelligence 的设备和对应系统版本,例如 iPhone 15 Pro 或后续兼容机型,以及配备 M 系列芯片的 iPad。
  3. Mac 版通过脚本安装:
    目前没有可直接下载的 DMG 安装包,需要在终端运行官方安装脚本。脚本会通过 Homebrew 安装依赖、编译应用并放入 Applications;首次启动后还要在设置中下载 Whisper 模型。

Speech To Markdown 的数据会传到云端吗?

这需要分别看 Mac 版和 iPhone、iPad 版,不能简单概括为“所有处理都在本地完成”。

Mac 版使用 whisper.cpp 在本机完成语音转写,原始录音不需要上传给在线语音识别服务。进入 Agent Mode 后,转写文本会被发送到设置中配置的 LLM 地址:如果连接的是本机运行的 Ollama、LM Studio 等服务,文本整理可以留在本地;如果用户改为远程服务器或第三方 API,相关文本就可能离开设备。

Speech To Markdown macOS 版本地 LLM 与运行依赖

iPhone 和 iPad 版使用 Apple SpeechAnalyzer 完成语音识别,并通过 Apple Foundation Models 整理文本。按照项目公开说明,这些处理在兼容设备的端侧完成,不需要另外连接 Whisper 或第三方大模型服务。

从使用场景看,Speech To Markdown 更适合个人灵感记录、文章初稿、工作日志以及会后口述整理。它目前没有提供多人说话人分离、自动会议录制、批量导入长音频或团队协作等功能,因此不能代替 Granola、Otter 等专业会议转录工具。

Speech To Markdown 没有 LICENSE,可以商用吗?

截至 2026 年 7 月 27 日,Speech To Markdown 的源码可以在 GitHub 查看,但仓库中没有 LICENSE 文件。源码公开不代表自动允许修改、重新分发或商业使用,也不能据此认定可以集成到商业产品中。

个人用户可以按照项目提供的方式安装和体验软件;如果准备修改源码、重新打包发布、集成到商业产品或对外提供服务,建议先联系开发者确认授权范围。后续如果仓库补充了许可证,应以 GitHub 上的最新说明为准。

Speech To Markdown 适合哪些用户?

如果你的 Mac 内存较充裕,并且已经在使用 Ollama、LM Studio 等本地模型服务,Speech To Markdown 可以作为收费语音输入软件的本地替代方案尝试。它更适合愿意配置本地环境、希望控制数据流向,并且经常用语音整理 Markdown 笔记的用户。

如果你只想安装后直接使用,或者需要 Windows、Android、团队协作及专业会议转录功能,Wispr Flow、Superwhisper 或其他成熟商业工具目前会更合适。老款 iPhone 和不支持 Apple Intelligence 的 iPad 也无法运行其移动版本。


Speech To Markdown 官网与项目资料

本文由(ahhhhfs.com)根据项目官网、官方文档及公开资料整理。工具的功能、价格、授权与服务条款可能调整,请以官方最新说明为准。合理引用请注明来源并保留本文链接;如需全文转载,或发现内容错误、版权及授权问题,可通过 feedback#abskoop.com「联系我们」反馈(请将 # 替换为 @)。