
会议录音、采访、播客、网课——要把这些声音变成文字,现在主流做法是把音频传到云端。问题是:一段两小时的内部会议录音,真的适合上传到别人的服务器吗?声迹(LocalScribe)给出的答案很干脆:全部在这台 Mac 上跑完,识别、翻译、AI 整理都不出门。
这是一个 MIT 协议的开源原生 macOS 应用,界面是 SwiftUI,有简体中文。项目初期英文名叫 ShengJi,从 v1.6.4 起英文名改为 LocalScribe,中文名「声迹」保留至今。当前版本 v1.6.6(build 37)。
四种识别引擎,按任务挑
声迹不是绑定某一个模型,而是把四套本地引擎摆在同一个界面里:
| 引擎 | 适用 | 运行时 |
|---|---|---|
| Apple Speech | 麦克风、文件、实时字幕 | SpeechAnalyzer / SpeechTranscriber(系统管理) |
| Whisper | 麦克风与文件 | whisper.cpp GGML,Metal 优先,可回退 CPU |
| SenseVoice | 文件 | sherpa-onnx,可走 Core ML,可回退 CPU |
| NVIDIA Parakeet | 文件 | sherpa-onnx,可走 Core ML,可回退 CPU |
这里有个容易踩的坑:Apple Speech 的 SpeechAnalyzer 识别与悬浮实时字幕需要 macOS 26。如果你的 Mac 还在 macOS 15.5–25,需要在首页手动选择 Whisper、SenseVoice 或 Parakeet,而且后两者目前只支持文件转录,不能用于麦克风实时输入。
Whisper 侧的可调项给得很细:模型提示词、temperature 与回退、beam 或 greedy 搜索、上下文长度、静音与置信度过滤、VAD,还有一套受保护的自动线程策略。长音频交给 Whisper 时, bundled 的 Silero VAD 会跳过静音段同时保留语音填充与重叠;输出过滤会综合静音、置信度、重复和已知幻觉模式一起判断。文件转录用的是模型内部的滑动窗口,而不是应用层固定切块。
三种声音来源
- 麦克风:实时生成可编辑文本(需要麦克风权限)。
- 媒体文件:导入音频或视频后选择引擎与语言。
- Mac 音频:直接捕捉电脑正在播放的声音(需要屏幕与系统音频录制权限)。
1.6.5 版本对这块做了补强:Mac 系统音频改为同时只用一路来源,并支持指定输入设备。
编辑器与导入导出

转写完不是给你一堆纯文本就完了。稿件可以搜索、替换、按选区删除、按范围裁剪,也能对照译文一起看。
- 导入:SRT、WebVTT、TXT、Markdown、LocalScribe JSON——也就是说你已有的字幕稿可以直接拿进来整理。
- 导出:TXT、Markdown、JSON、PDF、SRT、WebVTT,以及直接复制到剪贴板。
- 翻译:默认走 macOS 的 Apple Translation,也可选本地 NLLB(CTranslate2,CPU / int8)。转录后翻译可用,实时字幕翻译目前是关闭的。
Gemma 4:转写完让本机 AI 接着整理
这是 1.6.4 引入的功能,也是声迹和普通听写工具拉开差距的地方。转写(或导入稿件)完成后,可以在右侧检查器里打开 AI 增强,让 Gemma 4 在本机帮你处理——不用把稿子复制到任何在线 AI 服务。

- 纠错与润色:去掉口头禅、重复和明显的转写错误,同时保留原意。原文与建议文本以实时 diff 并排显示(红删绿增),还能看到批处理进度、模型状态和本机处理标识。
- 长稿总结:从完整稿件里提炼重点,展开成可发布的摘要。
- 原稿可留、可撤销:总结会保留一份原稿的撤销快照;校验未通过的片段保持原文不变,不会被 AI 结果覆盖。
- 按需下载:模型用的时候才下,跑在 llama.cpp + Metal 上,需要 6GB 以上物理内存。
官方也提醒了一句实在话:AI 输出仍应由用户复核。
长任务不怕中断
转两小时的录音最怕跑到一半崩了。声迹的做法是 append-only 的会话日志 + 恢复快照,任务可以暂停、恢复,也能从意外中断处继续。进度、暂停状态和剩余情况都在界面上。
隐私:联网只做三件事
声迹不上传识别音频、导入的稿件,也不上传交给 Gemma 处理的内容。识别、翻译、AI 整理全部在 Mac 本机执行。联网只发生在:按需下载识别/翻译/Gemma 模型、检查与下载更新、打开外部文档链接。自动更新可以在设置里关掉。
内置的更新器逻辑也写得清楚:启动时与每六小时各检查一次,读取最新 GitHub Release 的 update.json,下载 ZIP,校验 SHA-256,核对 bundle identifier 与版本,然后先询问再替换并重启。
安装与首次启动
要求先看清:
| 项目 | 要求 |
|---|---|
| 系统 | macOS 15.5 或更高 |
| 芯片 | Apple silicon(arm64),不支持 Intel |
| 实时字幕 | Apple SpeechAnalyzer 需要 macOS 26 |
| Gemma 4 | 物理内存 > 6GB,模型按需下载 |
| 权限 | 麦克风;捕捉 Mac 音频还需屏幕与系统音频录制权限 |
注意:当前公开包未经过 Developer ID 签名或 Apple 公证,只有 ad-hoc 完整性签名。第一次启动会被 macOS 拦下,之后去「系统设置 → 隐私与安全性」点「仍要打开」再确认即可。官方随每个 Release 提供 SHA-256 校验文件,装之前建议对一下——这一步对未签名的应用尤其重要。
和同类工具怎么选
| 你的需求 | 建议 |
|---|---|
| 只要快速听写、功能简单 | 《TOK:Mac 语音转文字工具》更轻量 |
| 纯 Whisper 命令行 GUI 封装 | 《Whisper Transcription》 |
| 要字幕编辑、离线翻译、本机 AI 整理一条龙 | 声迹 LocalScribe |
| 录屏 + 演示视频 | 《Capptivo for Mac》方向不同,可搭配 |
声迹的定位不是「又一个 Whisper 壳子」,而是把从录音到字幕交付的整条链路都放在本机——这在国内的隐私环境下,价值比单纯省几块钱订阅更实在。
几点提醒
- Intel Mac 装不了,只支持 Apple silicon。
- macOS 15.5–25 用不了实时字幕,得先升到 macOS 26。
- SenseVoice 与 Parakeet 目前只能转文件,麦克风实时输入请用 Whisper(或 macOS 26 的 Apple Speech)。
- 实时字幕翻译暂未开放,只有转录后翻译。
- 可选的 NLLB 模型在上游是 CC-BY-NC-4.0 协议,商用场景请留意,或改用 Apple Translation。
- 未公证意味着每次大版本更新后可能还要再放行一次。
项目地址:github.com/maddylaneeee/ShengJi,文档站 lixinchen.ca/docs/localscribe。免费、MIT、无账号——如果你的录音里有些内容不适合离开这台电脑,值得一试。
声明:本文来自苹果迷投稿,不代表苹果家园立场,版权归原作者所有,欢迎分享本文,转载请保留出处!
你可能也喜欢
- ♥ AirTranslate for Mac:实时转写 + 翻译 Mac 正在播放的系统音频,悬浮字幕浮在视频上方09/07
- ♥ Keelhaven:给 Mac 关键文件夹做一份加密异地备份的开源菜单栏工具,restic 驱动、无订阅无遥测09/07
- ♥ FindDiskKiller for Mac - 一套把"哪个应用在写我的盘"拆成证据链的原生工作区09/06
- ♥ macUSB:Mac 上的全能启动盘工具,从 10.4 Tiger 到 macOS 27,还能做 Windows 和 Linux 安装盘09/07
- ♥ Port Radar for Mac - 菜单栏里的端口雷达,让 Apple Intelligence 解释每个本地进程09/05
- ♥ Capptivo for Mac - 免费开源的 Screen Studio 替代,智能跟随光标的演示录屏工具09/06