Mac 上如何把 MP4 视频转成文字?无需上传的本地转写指南
直接导入可读取的 MP4,回放校对语音文稿,再导出文档或字幕文件;录制内容无需上传。
2026-10-04 · 7 min
先看简短答案
在 Mac 上把 MP4 视频转成文字,应使用读取视频音轨的文件转写流程。无需让整段视频在实时字幕窗口中播放一遍;对于能够读取的 MP4,也不必先手动转换成纯音频文件。文件必须包含应用能够解码的音轨,无声录屏无法生成语音文稿。
Alison Workspace 可以导入音频和视频文件,识别语音,对照录音检查文字,并导出文档或字幕文件。安装所需识别资源后,文件语音识别在 Mac 上运行。先用一小段内容检查语言与文字,再处理需要的录制文件。
需要文档时,选择文件转写
实时字幕帮助你跟上正在播放的声音。文件文稿则把文字与保存的录制文件中的时间位置对应起来,便于重听一句话、修改姓名,并选择导出格式。Alison Workspace 中这两种流程各有入口;想编辑 MP4 的文稿或保存文字,应使用文件转写窗口。
例如,课程录像中途可能有一段有用的讲解。文件文稿让你可以搜索这段说明,返回对应音频,修正术语后再加入笔记。这只是流程示例,并非准确率或速度测试。
如果录制内容的提供者已有经过校对的文稿或字幕轨,应先查看。尤其涉及姓名、专业词汇或预先准备的内容时,现成资料可能节省工作。自动识别提供的是草稿,而不是说话人确认过的文字。
检查 MP4 中的音轨
MP4 是媒体容器,并不保证其中的声音一定可用。应检查录制内容是否有语音、是否包含音轨,以及这条音轨能否在 Mac 上解码。即使扩展名相同,编码方式和文件状况不同,也可能导致不同结果。
Alison 的文件读取功能可处理普通音频,并从 MP4、MOV 等视频容器中读取音频。缺少音轨、文件无法读取或解码失败时,应用可以报告问题。没有可读取的音频时,应检查原文件,而不是反复更换识别语言。
视频有多条音轨时,应确认文稿对应哪一条。当前读取器使用第一条音轨;本文不描述尚未提供的内置音轨选择菜单。如果第一条不是需要的内容,应使用平时的媒体处理方式准备合适的音频文件,再导入转写。不要覆盖原始录像。
导入视频并准备设置
使用配备 Apple silicon 的 Mac,芯片为 M1 或更新型号,系统为 macOS 15 或更高版本。可用识别引擎和语言资源可能随系统版本而不同。处理长文件前,先准备应用要求的资源。
- 打开 Alison Workspace 的文件转写窗口,选择添加文件,或把本地视频拖入队列。
- 确认文件已被接受,显示的时长也符合实际。
- 选择录制内容中实际说出的语言。只有所需模型就绪时,才使用自动语言识别。
- 只需要原文时,关闭翻译;需要译文时,另外选择翻译目标。
- 需要区分不同声音时,开启说话人分离,并准备它要求的资源。
- 开始转写,然后打开生成的文字,对照原音频检查。
文件导入读取的是选中的媒体,并非系统播放音频采集。无需通过扬声器播放 MP4,也不必让播放器一直运行。转写完成后,回放仍有助于校对文字。
使用前先检查文稿
检查开头、中间一段,以及实际处理部分的结尾。这样可以先发现语言设置错误、读取了其他音轨或只生成了部分文稿,避免把时间花在逐句润色上。
用文稿的回放和搜索工具检查不确定的词。姓名、数字、缩写、否定表达和专业操作说明尤其需要核对。背景音乐或多人同时说话,可能让通顺的句子出错;段落容易阅读,并不证明识别准确。
文档可以编辑。根据录音和可靠的配套资料修正原文。如果同时生成了译文,还应检查译文是否表达了修正后的意思,不能因为修改了一个字段,就认定另一个字段也正确。
选择文字文档或字幕导出
用于阅读或笔记时,根据后续用途选择 TXT、Markdown、PDF 或 CSV。导出选项可选择原文、已生成的译文或两者同时保留;记录中有时间戳和说话人标签时,也可按需加入。
制作字幕时,选择 SRT 或 VTT。文件转写的时间戳对应媒体时间线,与另外开启的实时聆听会话时间不同。即使关闭文档时间戳,SRT 和 VTT 仍会保留格式要求的时间信息。
在准备使用的播放器或编辑器中预览字幕,检查切句、时间、行长,以及修改过的文字。生成的字幕文件是成品字幕轨的起点,导出本身并不代表文字已经适合发布。
理解部分转写与重试
当前文件转写试用提供累计 60 分钟音频时长,与实时聆听额度分开计算。队列按顺序消耗可用文件额度;剩余额度不足以处理完整文件时,结果可能只覆盖开头,并标记为部分转写。
认定文稿完整前,检查已处理时长和状态。失败或取消的任务可以重试,但先检查原因与剩余额度。解锁完整文件处理后,需要重新转写;仅仅打开之前的部分文档,不会自动补出缺失的结尾。
文件无法读取时,检查原文件是否仍能正常打开、是否包含预期声音。音频已被接受却文字质量不佳时,检查语音语言、资源准备情况和录音质量。这是不同问题,应采用不同处理方式。
保留原文件,方便以后回放
本地处理减少了向转写网站发送录制文件的需要,但识别资源可能仍需首次下载。翻译目标或说话人分离模型也可能需要单独准备;下载识别模型不等于所有可选功能都已就绪。
希望以后对照音频阅读文稿时,应把原媒体保存在稳定的位置。保存的文稿并不是 MP4 的替代副本。原文件被移动或无法访问时,文稿工具可以重新关联合适的文件,并通过时长检查帮助避免关联错误录制内容。
考虑导出文档的保存位置。本地文稿放入同步或共享文件夹后,可能由该服务分发。特别是内部课程或访谈,应选择自己确实需要的保存目标。
根据所需结果决定下一步
需要可编辑的 MP4 文稿、可搜索的资料或字幕文件草稿时,使用文件转写;只想跟上当前播放内容时,使用实时字幕。涉及多个声音,应检查说话人标签;整理一批不同语言的文件时,应在开始前安排队列和语言设置。
实际第一步是一段能够读取、语音清楚的视频。确认语言与一小段生成文字,再检查完整结果,导出真正需要的格式。
官方参考资料(核对日期:2026年10月4日)
Apple: reading media from a file-based asset
Apple: reading an individual media track
WhisperKit: on-device speech-to-text framework
常见问题
必须先把 MP4 转成 MP3 才能转写吗?
如果 MP4 有应用能够读取的音轨,就不必转换。直接导入可以省去转换步骤;编码无法读取或音轨不合适时,可能需要先准备合适的音频文件。
转写时,必须把整段视频播放一遍吗?
不需要。文件转写读取选中的媒体,而不是聆听播放器的实时输出。完成后可以回放,帮助校对文字。
无声 MP4 或幻灯片录屏能生成文稿吗?
语音识别需要说出的音频,不会读取无声幻灯片中的文字,也不会从视频画面提取文字。
能导出时间戳对应视频的 SRT 文件吗?
可以。文件转写流程可导出按媒体时间计时的 SRT 和 VTT。使用前,应在目标播放器中检查生成的文字和时间。
视频文稿能加入说话人标签吗?
处理文件前开启说话人分离,并准备相关资源。生成的标签需要检查;确认是谁在说话后,可以重命名。
为什么视频只有开头被转写了?
检查记录是否标记为部分转写,以及可用文件转写额度是否少于录像时长;也应检查任务是否取消或失败。
所有 MP4 扩展名的文件都支持吗?
不能这样保证。文件必须包含可读取的音轨和有效媒体数据;除了扩展名,编码方式和文件状况也很重要。