Mac 上如何离线批量转写不同语言的音频文件?
先准备本地模型,再选择自动识别或按语言分组,逐份检查并导出多语言录音队列的文稿。
2026-10-04 · 7 min
先看简短答案
在 Mac 上转写一批不同语言的录音,应先准备本地识别资源,添加文件队列,并决定如何处理实际语音语言。安装了兼容模型时,自动语言识别可以减少手动分类;已知语言而自动判断不可靠时,可以把相同语言的文件分组,用明确的原语音语言处理。
Alison Workspace 支持文件队列、多语言识别选项、可选翻译和说话人分离,需要配备 Apple silicon、M1 或更新芯片、运行 macOS 15 或更高版本的 Mac。资源准备好后,受支持的文件识别在本地进行。规划时要注意:同一轮队列共享设置,一批不同语言的文件,与一段录音中反复切换语言,并不是同一种问题。
围绕实际任务整理文件
假设你有一段英语课程、一段日语访谈和一段西班牙语录音,希望分别得到原语言文稿,只在有用时添加翻译。这是流程示例,并非三种语言准确率测试报告。
给文件起便于区分的名字,避免必须打开每份文稿才能辨认。检查声音、大致时长和主要语言。音频在视频中时,文件仍必须包含能够访问和解码的音轨;画面不能替代语音识别所需的声音。
确定自己需要原文、辅助阅读的译文、说话人标签还是字幕。每项功能都有单独要求,也增加一项校对任务。先生成原文,有助于在加入翻译前发现语言问题。
离线前准备识别资源
识别菜单提供许多语言,但引擎与模型必须支持实际需要的语言。某种语言出现在菜单中,不代表每个已安装模型都能同样处理它。需要多种原语音语言的批次,应使用多语言模型。
Alison 的文件自动语言识别需要可用的本地 Whisper 模型。在兼容的 macOS 版本上,部分明确选择的语言可以使用可用的系统识别,但这不能代替自动语言识别。应按应用的资源提示准备,不要假定其他流程使用的模型在这里也已经就绪。
联网时先下载并准备资源,再用一小段文件确认预定设置,然后才依赖离线工作。首次准备可能需要时间。资源就绪检查也不能证明陌生口音或噪声录音的识别质量。
选择自动识别或按语言分组
每个文件都有清楚的主要语言时,自动识别可以减少手动分类。但静音、音乐、语音很少或不寻常的开头,仍可能导致误判。每个文件的结果都应检查,不能因为第一份文稿看起来正确就接受整个队列。
已知语言时,更可控的方式是先选英语处理英语文件,再选日语处理日语文件,以此类推。同一轮队列共享识别选择;本文不描述为每个队列文件单独附加语言设置的功能。
混合语言批次不要随意固定一种语言,除非确实希望所有文件都按它处理。识别看起来不对时,先检查音频与原语音语言。更换翻译目标,不能修复按错误识别语言生成的原文。
从规模合适的小批次开始
先用少量文件确认设置、资源准备情况和输出,再处理较大的集合。多文件排队处理,不代表所有文件同时运行,也不承诺固定完成速度。
- 选择本地可以读取的文件,确认名称、时长和预期语音语言。
- 打开文件转写窗口,添加多个文件,或把它们拖入队列。
- 多语言模型就绪时选择自动语言识别,或按语言分组并明确选择原语音语言。
- 只需要原语言文稿时关闭翻译;需要翻译时,为这一轮选择一个受支持的目标并准备资源。
- 有需要时才开启说话人分离并准备资源;只有预期人数适合这一轮文件时,才使用固定人数。
- 启动队列,在导出前逐一检查文件状态与生成文字。
被拒绝的文件应先按媒体问题检查。没有音轨或编码无法读取,不会因为在模型设置中增加语言而解决。
区分识别、翻译与说话人设置
识别生成实际说出的语言文字,翻译把它转换成另一种阅读语言,说话人分离按声音为文字分组。可以一起使用,但一项成功,并不能证明另外两项也成功。
例如,日语片段识别正确,翻译目标仍可能不可用,或人物归属错误。检查译文文档时,应保留原文。对照录音核实姓名、数字和重要否定表达,尤其是译文比原文更流畅时。
翻译语言对取决于实际 Mac 上可用的资源。多语言识别模型不意味着每一种原语言都能翻译成任意目标。翻译不可用时,仍可使用并检查原语言文稿,不应把它误称为译文。
单个文件内切换语言,需要另行检查
一批主要各用一种语言的文件,适合考虑自动识别;一段访谈反复切换日语和英语,则需要另外留意。自动判断语言,并不证明录音里的每次切换都被正确识别。
检查语言切换附近的片段。如果某种语言持续丢失,可用平时的媒体编辑工具准备合适的片段,分别选择对应语言处理。保留原文件,并记住截取片段的文稿使用的是该片段自己的时间线。
本文不承诺混合语言识别完美,也不承诺每种支持语言质量相同。背景音乐、地区口音、不熟悉的姓名和录制条件不同,也会影响需要修正的内容。
检查完成情况,查明原因后再重试
Alison 当前文件转写试用提供累计 60 分钟音频时长,与实时聆听分开计算。队列按顺序使用剩余额度,后面的文件可能只分到剩余时间,或没有时间可用。应查看预期时长与已处理时长,不能假定加入的文件都会完整完成。
部分结果不是长录音的完整文稿。失败或取消的任务可以在检查原因后重试。用错识别语言时,下一轮选择正确语言;资源缺失时,先准备资源。重复处理长批次前,应检查剩余额度。
解锁完整文件处理后,需要重新运行受影响的文件。权限变化不会自动补齐之前文档中未处理的结尾。应保持文件、状态和最新文稿之间的对应关系清楚。
逐份检查,并有意识地导出
用搜索和回放检查每份结果的重要片段。编辑了一份文稿,不代表队列中其他文档都已校对。为导出文件使用不同名称,并保留原录音,方便以后检查。
当前文稿导出菜单提供 TXT、Markdown、CSV、PDF、SRT 和 VTT。可选择原文、已生成的译文或两者;人物与文档时间戳选项取决于记录和格式。应通过每份记录的菜单导出,不要把批量添加等同于一键导出整个队列。
本地识别说明的是处理发生在哪里,不能控制同步导出文件夹、共享盘或备份之后如何处理文件。应选择录音与文档的保存位置。下一步是一个语言和输出都能核实的小队列,再扩大处理规模。
官方参考资料(核对日期:2026年10月4日)
WhisperKit: on-device speech-to-text and model choices
Apple: file-based media reading
FluidAudio: local speaker diarization
常见问题
不同语言的录音能放进同一个队列吗?
可以,但同一轮共享语言设置。兼容的多语言模型就绪时,可以使用自动识别;也可以按语言分组,明确选择原语音语言后分别处理。
自动语言识别需要下载模型吗?
需要可用的本地 Whisper 模型,应在离线前准备。用于某种明确选择语言的系统引擎,不能作为自动语言识别的替代。
一段文件交替使用两种语言,能稳定识别吗?
不要直接假定。应检查切换语言的片段;某种语言反复丢失时,可考虑准备独立片段并选择对应语言处理。
日语转写会自动给我英文吗?
不会。识别与翻译是不同设置。需要英文辅助阅读时,应选择受支持的英语翻译目标,并准备所需语言对。
准备完成后,可以不联网转写吗?
所需资源可用后,受支持的识别在本地运行。可选翻译和人物资源也要准备,并在离线前确认实际需要的流程。
批量转写也能添加说话人标签吗?
资源就绪时,可以为这一轮开启说话人分离。每个文件都应独立检查;人物编号不代表不同文件中同一个人的身份。
批量转写会自动批量导出吗?
队列处理的是多个文件,导出通过每份文稿的菜单完成。本文不承诺一键导出整个队列。