苹果迷苹果迷  2026-09-07 18:40 苹果家园 隐藏边栏 |   抢沙发  3 
文章评分 0 次,平均分 0.0
导语: 声迹(LocalScribe,原英文名 ShengJi)是一款 MIT 开源的原生 macOS 语音转写工具,识别、翻译与 AI 整理全部在 Mac 本机完成,音频与稿件默认不上传。内置 Apple Speech、Whisper、SenseVoice、Parakeet 四种本地引擎,支持麦克风/媒体文件/Mac 音频三种输入,可导出 TXT、Markdown、PDF、SRT、WebVTT,并可用本机 Gemma 4 做纠错、润色与长稿总结。需 macOS 15.5+ 与 Apple silicon。
声迹 LocalScribe 中文首页,包含识别模型、稿件导入、转录后翻译和悬浮实时字幕

会议录音、采访、播客、网课——要把这些声音变成文字,现在主流做法是把音频传到云端。问题是:一段两小时的内部会议录音,真的适合上传到别人的服务器吗?声迹(LocalScribe)给出的答案很干脆:全部在这台 Mac 上跑完,识别、翻译、AI 整理都不出门。

这是一个 MIT 协议的开源原生 macOS 应用,界面是 SwiftUI,有简体中文。项目初期英文名叫 ShengJi,从 v1.6.4 起英文名改为 LocalScribe,中文名「声迹」保留至今。当前版本 v1.6.6(build 37)

四种识别引擎,按任务挑

声迹不是绑定某一个模型,而是把四套本地引擎摆在同一个界面里:

引擎 适用 运行时
Apple Speech 麦克风、文件、实时字幕 SpeechAnalyzer / SpeechTranscriber(系统管理)
Whisper 麦克风与文件 whisper.cpp GGML,Metal 优先,可回退 CPU
SenseVoice 文件 sherpa-onnx,可走 Core ML,可回退 CPU
NVIDIA Parakeet 文件 sherpa-onnx,可走 Core ML,可回退 CPU

这里有个容易踩的坑:Apple Speech 的 SpeechAnalyzer 识别与悬浮实时字幕需要 macOS 26。如果你的 Mac 还在 macOS 15.5–25,需要在首页手动选择 Whisper、SenseVoice 或 Parakeet,而且后两者目前只支持文件转录,不能用于麦克风实时输入。

Whisper 侧的可调项给得很细:模型提示词、temperature 与回退、beam 或 greedy 搜索、上下文长度、静音与置信度过滤、VAD,还有一套受保护的自动线程策略。长音频交给 Whisper 时, bundled 的 Silero VAD 会跳过静音段同时保留语音填充与重叠;输出过滤会综合静音、置信度、重复和已知幻觉模式一起判断。文件转录用的是模型内部的滑动窗口,而不是应用层固定切块。

三种声音来源

  • 麦克风:实时生成可编辑文本(需要麦克风权限)。
  • 媒体文件:导入音频或视频后选择引擎与语言。
  • Mac 音频:直接捕捉电脑正在播放的声音(需要屏幕与系统音频录制权限)。

1.6.5 版本对这块做了补强:Mac 系统音频改为同时只用一路来源,并支持指定输入设备。

编辑器与导入导出

声迹中文稿件编辑器,包含本地翻译、查找替换、范围编辑、导出与隐私说明

转写完不是给你一堆纯文本就完了。稿件可以搜索、替换、按选区删除、按范围裁剪,也能对照译文一起看。

  • 导入:SRT、WebVTT、TXT、Markdown、LocalScribe JSON——也就是说你已有的字幕稿可以直接拿进来整理。
  • 导出:TXT、Markdown、JSON、PDF、SRT、WebVTT,以及直接复制到剪贴板。
  • 翻译:默认走 macOS 的 Apple Translation,也可选本地 NLLB(CTranslate2,CPU / int8)。转录后翻译可用,实时字幕翻译目前是关闭的

Gemma 4:转写完让本机 AI 接着整理

这是 1.6.4 引入的功能,也是声迹和普通听写工具拉开差距的地方。转写(或导入稿件)完成后,可以在右侧检查器里打开 AI 增强,让 Gemma 4 在本机帮你处理——不用把稿子复制到任何在线 AI 服务。

声迹使用本机 Gemma 4 对转录稿进行纠错与润色,红色显示原文,绿色实时显示优化结果
  • 纠错与润色:去掉口头禅、重复和明显的转写错误,同时保留原意。原文与建议文本以实时 diff 并排显示(红删绿增),还能看到批处理进度、模型状态和本机处理标识。
  • 长稿总结:从完整稿件里提炼重点,展开成可发布的摘要。
  • 原稿可留、可撤销:总结会保留一份原稿的撤销快照;校验未通过的片段保持原文不变,不会被 AI 结果覆盖。
  • 按需下载:模型用的时候才下,跑在 llama.cpp + Metal 上,需要 6GB 以上物理内存

官方也提醒了一句实在话:AI 输出仍应由用户复核。

长任务不怕中断

转两小时的录音最怕跑到一半崩了。声迹的做法是 append-only 的会话日志 + 恢复快照,任务可以暂停、恢复,也能从意外中断处继续。进度、暂停状态和剩余情况都在界面上。

隐私:联网只做三件事

声迹不上传识别音频、导入的稿件,也不上传交给 Gemma 处理的内容。识别、翻译、AI 整理全部在 Mac 本机执行。联网只发生在:按需下载识别/翻译/Gemma 模型、检查与下载更新、打开外部文档链接。自动更新可以在设置里关掉。

内置的更新器逻辑也写得清楚:启动时与每六小时各检查一次,读取最新 GitHub Release 的 update.json,下载 ZIP,校验 SHA-256,核对 bundle identifier 与版本,然后先询问再替换并重启

安装与首次启动

要求先看清:

项目 要求
系统 macOS 15.5 或更高
芯片 Apple silicon(arm64),不支持 Intel
实时字幕 Apple SpeechAnalyzer 需要 macOS 26
Gemma 4 物理内存 > 6GB,模型按需下载
权限 麦克风;捕捉 Mac 音频还需屏幕与系统音频录制权限

注意:当前公开包未经过 Developer ID 签名或 Apple 公证,只有 ad-hoc 完整性签名。第一次启动会被 macOS 拦下,之后去「系统设置 → 隐私与安全性」点「仍要打开」再确认即可。官方随每个 Release 提供 SHA-256 校验文件,装之前建议对一下——这一步对未签名的应用尤其重要。

和同类工具怎么选

你的需求 建议
只要快速听写、功能简单 《TOK:Mac 语音转文字工具》更轻量
纯 Whisper 命令行 GUI 封装 《Whisper Transcription》
要字幕编辑、离线翻译、本机 AI 整理一条龙 声迹 LocalScribe
录屏 + 演示视频 《Capptivo for Mac》方向不同,可搭配

声迹的定位不是「又一个 Whisper 壳子」,而是把从录音到字幕交付的整条链路都放在本机——这在国内的隐私环境下,价值比单纯省几块钱订阅更实在。

几点提醒

  • Intel Mac 装不了,只支持 Apple silicon。
  • macOS 15.5–25 用不了实时字幕,得先升到 macOS 26。
  • SenseVoice 与 Parakeet 目前只能转文件,麦克风实时输入请用 Whisper(或 macOS 26 的 Apple Speech)。
  • 实时字幕翻译暂未开放,只有转录后翻译。
  • 可选的 NLLB 模型在上游是 CC-BY-NC-4.0 协议,商用场景请留意,或改用 Apple Translation。
  • 未公证意味着每次大版本更新后可能还要再放行一次。

项目地址:github.com/maddylaneeee/ShengJi,文档站 lixinchen.ca/docs/localscribe。免费、MIT、无账号——如果你的录音里有些内容不适合离开这台电脑,值得一试。

声明:本文来自投稿,不代表苹果家园立场,版权归原作者所有,欢迎分享本文,转载请保留出处!

发表评论

表情 格式 链接 私密 签到

友情链接

    扫一扫二维码分享