Mac 上如何轉寫訪談並區分說話人?人物標籤、校對與導出
為訪談添加說話人標籤,核對每段是誰說的,修正歸屬與姓名,再從 Mac 導出校對後的對話。
2026-10-04 · 7 min
先看簡短答案
想轉寫訪談並區分發言者,應在檔案轉寫中開啓說話人分離。它為識別文字中的片段添加人物標籤,幫助你檢查問題與回答,避免把整段錄音都看成同一個人的發言。開始前準備識別與說話人資源,再回放檢查分配結果。
Alison Workspace 支持在配備 Apple silicon、M1 或更新晶片、運行 macOS 15 或更高版本的 Mac 上處理可讀取的音訊和影片檔案。你可以選擇預期人數,檢查文稿,修改段落所屬說話人,重命名標籤並導出文字。先選擇採訪者與嘉賓之間一段清楚的交流,不要用音樂或多人同時發言的片段判斷效果。
瞭解說話人標籤說明瞭什麼
語音識別回答“說了什麼”,說話人分離回答“錄音的這一段由哪個聲音說出”。文稿可能文字正確卻分錯人物,也可能人物標籤正確而句子識別錯誤。兩方面都需要檢查。
初始標籤描述的是這段錄音中的聲音,不會自動提供經過覈實的真實姓名,也不能證明另一檔案中的某個聲音屬於同一個人。聲音特徵幫助歸類語音,確認真實身份則是另外一項工作。
本文中的說話人分離指帶人物標籤的文字,不代表能夠為每位參與者導出單獨音訊,或從重疊發言中刪除某個人的聲音。選擇流程前,應確定自己需要的是可讀的對話記錄,還是彼此獨立的音軌。
從能夠回放檢查的訪談錄音開始
使用可獲得的最佳原始錄音,確保語音容易聽清。如果原檔案可以導入,不必只為減小體積再製作壓縮副本。嘉賓聲音輕、背景音樂和不同麥克風錄到的聲音,都可能增加校對工作。
先聽一小段交流,記錄實際有多少人發言,包括可能出現的開場介紹或製作人員提問。主要訪談有兩位參與者,並不證明檔案所有部分都只有兩種聲音。
已有分別錄制的參與者音訊時,保留它們作為參考。當前流程標注的是導入檔案,本文不描述將各人錄音自動合成為同步對話的功能。確認這些錄音可以由你轉寫並保留。
準備說話人分離與預期人數
說話人分離使用語音識別以外的資源。在 Alison 的檔案轉寫窗口中開啓人物選項,並按提示準備模型。只是打開設置,而資源尚不可用,並不能證明最終記錄會包含標籤。
人數菜單提供自動估計和已知的 2–6 人選項。檔案確實只有兩個人說話時,選擇 2,告訴處理流程要歸為多少種聲音。不確定時,使用自動並檢查結果。手動人數菜單的範圍,不是自動模式能夠處理多少人的實測上限。
人數只是處理依據,並非保證。出現第三種聲音,或同一個人更換麥克風、改變說話方式時,錯誤的固定人數可能導致歸類不佳。應檢查完整錄音,不能假定開頭已經包含全部發言者。
用檔案轉寫處理訪談
按實際語音選擇識別語言。需要翻譯時,另外選擇目標語言,並確認所需語言對可用。檢查原語音中的姓名與人物歸屬時,可以先關閉翻譯。
- 把訪談音訊或影片加入轉寫隊列。
- 檢查被接受檔案的時長,並選擇實際說出的語言。
- 準備所需識別資源;自動語言識別需要兼容的本機模型。
- 開啓說話人分離,並準備要求的說話人資源。
- 有依據時選擇已知人數,否則保留自動,然後開始轉寫。
- 打開結果,回放各參與者的片段,再接受人物標籤。
通過檔案狀態確認處理是否完成。如果結果僅為部分轉寫,應只檢查已處理內容,並解決缺失部分,再把它作為完整訪談提供。
先修正歸屬,再添加姓名
找到每種聲音中一句清楚的話並回放,確認初始標籤分別對應採訪者還是嘉賓。也要檢查後面的片段;開頭標籤正確,並不證明所有說話人變化都被正確處理。
某段分錯人物時,進入文稿編輯模式,為該段選擇正確的已有說話人。必要時另行修改文字。重命名會改變整個記錄中的該標籤,不適合只修正一個被分錯的段落。
短回答和插話尤其需要注意。一個識別片段可能跨越人物變化,時間資訊是否充分也會影響切分精度。不能假定每個簡短的“是”或重疊發言都能得到獨立且完美的標籤。
確認聲音後,重命名標籤
把通用標籤改成已確認的姓名,或“採訪者”“嘉賓”等角色。不需要個人姓名時,角色稱呼就很有用。根據訪談配套資料統一拼寫,不要依據自動識別的開場介紹猜名字。
說話人姓名設置會更新記錄和導出使用的標籤。回放一段已命名的發言,確認全局修改沒有把嘉賓姓名放到採訪者身上。一個真實聲音被分成多個標籤時,應逐一檢查對應片段,再決定是否使用同一姓名。
重命名記錄的是你的編輯判斷,並非聲紋身份認證,也不會為未來檔案建立自動身份檔案。新錄音的人物標籤仍應單獨檢查。
導出仍然便於核對的對話
需要可讀或可復用的文檔時,選擇 TXT、Markdown、PDF 或 CSV。記錄中有說話人標籤時,開啓包含說話人的選項;讀者需要返回錄音時,保留時間戳。原文、譯文或雙語導出取決於記錄中實際有的文字。
字幕流程也可使用 SRT 和 VTT,並始終包含格式要求的時間軸。分享字幕前,應檢查目標顯示效果:有用的訪談文檔和舒適的影片字幕,需要不同的排版判斷。
分享前,再聽一遍姓名、引語、數字、承諾和歸屬不確定的發言。帶說話人標籤的草稿幫助你定位這些片段,卻不會讓未經檢查的引語變得可靠。
根據標籤問題排查
沒有標籤時,檢查是否開啓了說話人分離,以及資源是否就緒。語音識別可能生成文字,而可選的人物處理階段沒有提供可用歸屬。文字識別成功與說話人標注成功,是不同狀態。
標籤不正確時,重新檢查人數設置和音訊。聲音相似、說話距離遠、麥克風音色變化、背景噪聲和重疊發言,都可能增加歸類難度。以清楚的片段作為依據,修正能夠覈實的內容;歸屬仍不確定時,保留這種不確定性,避免強行斷定。
資源就緒後,受支持的識別和說話人處理在 Mac 本機運行。保留原檔案以便檢查,並有意識地選擇文稿導出位置。下一步是一段清楚的訪談交流,以及你親自檢查過的標籤。
官方參考資料(核對日期:2026年10月4日)
Microsoft: diarization and generic speaker identifiers
Amazon Transcribe: speaker labels and timestamps
FluidAudio: on-device speaker diarization framework
常見問題
兩人訪談應該選自動,還是 2 人?
檔案中確實只有兩個人發言時,選擇 2 人。開場介紹或插話帶來其他聲音時,應按實際錄音選擇人數,或使用自動後檢查歸屬。
說話人分離會自動識別真實姓名嗎?
不會。它在錄音內部添加聲音標籤。你需要自行確認人物或角色,再重命名文稿中的標籤。
能修正一個段落是誰說的嗎?
可以。文稿編輯器允許把段落改分給已有說話人。重命名說話人則會改變整個記錄中的這個標籤。
為什麼同一個人被分成了兩個標籤?
短髮言、噪聲、不同麥克風或說話方式變化,都可能影響聲音歸類。應回放相關片段,再判斷標籤是否屬於同一個人。
能分別導出每個人的獨立聲音嗎?
這項功能為文稿文字標注人物,不提供每位說話人的獨立音軌導出,也不會去除重疊聲音。
導出的文檔會包含人物姓名嗎?
記錄已有標籤時,開啓包含說話人選項。確認過的姓名會用於導出;分享前,應檢查所選文檔或字幕格式。
不同檔案里的同一說話人編號代表同一個人嗎?
不代表。每段錄音的標籤應獨立判斷。本文描述的流程不建立跨檔案聲紋身份。