Mac 上如何转写访谈并区分说话人?人物标签、校对与导出
为访谈添加说话人标签,核对每段是谁说的,修正归属与姓名,再从 Mac 导出校对后的对话。
2026-10-04 · 7 min
先看简短答案
想转写访谈并区分发言者,应在文件转写中开启说话人分离。它为识别文字中的片段添加人物标签,帮助你检查问题与回答,避免把整段录音都看成同一个人的发言。开始前准备识别与说话人资源,再回放检查分配结果。
Alison Workspace 支持在配备 Apple silicon、M1 或更新芯片、运行 macOS 15 或更高版本的 Mac 上处理可读取的音频和视频文件。你可以选择预期人数,检查文稿,修改段落所属说话人,重命名标签并导出文字。先选择采访者与嘉宾之间一段清楚的交流,不要用音乐或多人同时发言的片段判断效果。
了解说话人标签说明了什么
语音识别回答“说了什么”,说话人分离回答“录音的这一段由哪个声音说出”。文稿可能文字正确却分错人物,也可能人物标签正确而句子识别错误。两方面都需要检查。
初始标签描述的是这段录音中的声音,不会自动提供经过核实的真实姓名,也不能证明另一文件中的某个声音属于同一个人。声音特征帮助归类语音,确认真实身份则是另外一项工作。
本文中的说话人分离指带人物标签的文字,不代表能够为每位参与者导出单独音频,或从重叠发言中删除某个人的声音。选择流程前,应确定自己需要的是可读的对话记录,还是彼此独立的音轨。
从能够回放检查的访谈录音开始
使用可获得的最佳原始录音,确保语音容易听清。如果原文件可以导入,不必只为减小体积再制作压缩副本。嘉宾声音轻、背景音乐和不同麦克风录到的声音,都可能增加校对工作。
先听一小段交流,记录实际有多少人发言,包括可能出现的开场介绍或制作人员提问。主要访谈有两位参与者,并不证明文件所有部分都只有两种声音。
已有分别录制的参与者音频时,保留它们作为参考。当前流程标注的是导入文件,本文不描述将各人录音自动合成为同步对话的功能。确认这些录音可以由你转写并保留。
准备说话人分离与预期人数
说话人分离使用语音识别以外的资源。在 Alison 的文件转写窗口中开启人物选项,并按提示准备模型。只是打开设置,而资源尚不可用,并不能证明最终记录会包含标签。
人数菜单提供自动估计和已知的 2–6 人选项。文件确实只有两个人说话时,选择 2,告诉处理流程要归为多少种声音。不确定时,使用自动并检查结果。手动人数菜单的范围,不是自动模式能够处理多少人的实测上限。
人数只是处理依据,并非保证。出现第三种声音,或同一个人更换麦克风、改变说话方式时,错误的固定人数可能导致归类不佳。应检查完整录音,不能假定开头已经包含全部发言者。
用文件转写处理访谈
按实际语音选择识别语言。需要翻译时,另外选择目标语言,并确认所需语言对可用。检查原语音中的姓名与人物归属时,可以先关闭翻译。
- 把访谈音频或视频加入转写队列。
- 检查被接受文件的时长,并选择实际说出的语言。
- 准备所需识别资源;自动语言识别需要兼容的本地模型。
- 开启说话人分离,并准备要求的说话人资源。
- 有依据时选择已知人数,否则保留自动,然后开始转写。
- 打开结果,回放各参与者的片段,再接受人物标签。
通过文件状态确认处理是否完成。如果结果仅为部分转写,应只检查已处理内容,并解决缺失部分,再把它作为完整访谈提供。
先修正归属,再添加姓名
找到每种声音中一句清楚的话并回放,确认初始标签分别对应采访者还是嘉宾。也要检查后面的片段;开头标签正确,并不证明所有说话人变化都被正确处理。
某段分错人物时,进入文稿编辑模式,为该段选择正确的已有说话人。必要时另行修改文字。重命名会改变整个记录中的该标签,不适合只修正一个被分错的段落。
短回答和插话尤其需要注意。一个识别片段可能跨越人物变化,时间信息是否充分也会影响切分精度。不能假定每个简短的“是”或重叠发言都能得到独立且完美的标签。
确认声音后,重命名标签
把通用标签改成已确认的姓名,或“采访者”“嘉宾”等角色。不需要个人姓名时,角色称呼就很有用。根据访谈配套资料统一拼写,不要依据自动识别的开场介绍猜名字。
说话人姓名设置会更新记录和导出使用的标签。回放一段已命名的发言,确认全局修改没有把嘉宾姓名放到采访者身上。一个真实声音被分成多个标签时,应逐一检查对应片段,再决定是否使用同一姓名。
重命名记录的是你的编辑判断,并非声纹身份认证,也不会为未来文件建立自动身份档案。新录音的人物标签仍应单独检查。
导出仍然便于核对的对话
需要可读或可复用的文档时,选择 TXT、Markdown、PDF 或 CSV。记录中有说话人标签时,开启包含说话人的选项;读者需要返回录音时,保留时间戳。原文、译文或双语导出取决于记录中实际有的文字。
字幕流程也可使用 SRT 和 VTT,并始终包含格式要求的时间轴。分享字幕前,应检查目标显示效果:有用的访谈文档和舒适的视频字幕,需要不同的排版判断。
分享前,再听一遍姓名、引语、数字、承诺和归属不确定的发言。带说话人标签的草稿帮助你定位这些片段,却不会让未经检查的引语变得可靠。
根据标签问题排查
没有标签时,检查是否开启了说话人分离,以及资源是否就绪。语音识别可能生成文字,而可选的人物处理阶段没有提供可用归属。文字识别成功与说话人标注成功,是不同状态。
标签不正确时,重新检查人数设置和音频。声音相似、说话距离远、麦克风音色变化、背景噪声和重叠发言,都可能增加归类难度。以清楚的片段作为依据,修正能够核实的内容;归属仍不确定时,保留这种不确定性,避免强行断定。
资源就绪后,受支持的识别和说话人处理在 Mac 本地运行。保留原文件以便检查,并有意识地选择文稿导出位置。下一步是一段清楚的访谈交流,以及你亲自检查过的标签。
官方参考资料(核对日期:2026年10月4日)
Microsoft: diarization and generic speaker identifiers
Amazon Transcribe: speaker labels and timestamps
FluidAudio: on-device speaker diarization framework
常见问题
两人访谈应该选自动,还是 2 人?
文件中确实只有两个人发言时,选择 2 人。开场介绍或插话带来其他声音时,应按实际录音选择人数,或使用自动后检查归属。
说话人分离会自动识别真实姓名吗?
不会。它在录音内部添加声音标签。你需要自行确认人物或角色,再重命名文稿中的标签。
能修正一个段落是谁说的吗?
可以。文稿编辑器允许把段落改分给已有说话人。重命名说话人则会改变整个记录中的这个标签。
为什么同一个人被分成了两个标签?
短发言、噪声、不同麦克风或说话方式变化,都可能影响声音归类。应回放相关片段,再判断标签是否属于同一个人。
能分别导出每个人的独立声音吗?
这项功能为文稿文字标注人物,不提供每位说话人的独立音轨导出,也不会去除重叠声音。
导出的文档会包含人物姓名吗?
记录已有标签时,开启包含说话人选项。确认过的姓名会用于导出;分享前,应检查所选文档或字幕格式。
不同文件里的同一说话人编号代表同一个人吗?
不代表。每段录音的标签应独立判断。本文描述的流程不建立跨文件声纹身份。