Mac 上如何離線批量轉寫不同語言的音訊檔案?
先準備本機模型,再選擇自動識別或按語言分組,逐份檢查並導出多語言錄音隊列的文稿。
2026-10-04 · 7 min
先看簡短答案
在 Mac 上轉寫一批不同語言的錄音,應先準備本機識別資源,添加檔案隊列,並決定如何處理實際語音語言。安裝了兼容模型時,自動語言識別可以減少手動分類;已知語言而自動判斷不可靠時,可以把相同語言的檔案分組,用明確的來源語音語言處理。
Alison Workspace 支持檔案隊列、多語言識別選項、可選翻譯和說話人分離,需要配備 Apple silicon、M1 或更新晶片、運行 macOS 15 或更高版本的 Mac。資源準備好後,受支持的檔案識別在本機進行。規劃時要注意:同一輪隊列共享設置,一批不同語言的檔案,與一段錄音中反復切換語言,並不是同一種問題。
圍繞實際任務整理檔案
假設你有一段英語課程、一段日語訪談和一段西班牙語錄音,希望分別得到原語言文稿,只在有用時添加翻譯。這是流程示例,並非三種語言準確率測試報告。
給檔案起便於區分的名字,避免必須打開每份文稿才能辨認。檢查聲音、大致時長和主要語言。音訊在影片中時,檔案仍必須包含能夠訪問和解碼的音軌;畫面不能替代語音識別所需的聲音。
確定自己需要原文、輔助閱讀的譯文、說話人標籤還是字幕。每項功能都有單獨要求,也增加一項校對任務。先生成原文,有助於在加入翻譯前發現語言問題。
離線前準備識別資源
識別菜單提供許多語言,但引擎與模型必須支持實際需要的語言。某種語言出現在菜單中,不代表每個已安裝模型都能同樣處理它。需要多種來源語音語言的批次,應使用多語言模型。
Alison 的檔案自動語言識別需要可用的本機 Whisper 模型。在兼容的 macOS 版本上,部分明確選擇的語言可以使用可用的系統識別,但這不能代替自動語言識別。應按應用的資源提示準備,不要假定其他流程使用的模型在這裡也已經就緒。
聯網時先下載並準備資源,再用一小段檔案確認預定設置,然後才依賴離線工作。首次準備可能需要時間。資源就緒檢查也不能證明陌生口音或噪聲錄音的識別質量。
選擇自動識別或按語言分組
每個檔案都有清楚的主要語言時,自動識別可以減少手動分類。但靜音、音樂、語音很少或不尋常的開頭,仍可能導致誤判。每個檔案的結果都應檢查,不能因為第一份文稿看起來正確就接受整個隊列。
已知語言時,更可控的方式是先選英語處理英語檔案,再選日語處理日語檔案,以此類推。同一輪隊列共享識別選擇;本文不描述為每個隊列檔案單獨附加語言設置的功能。
混合語言批次不要隨意固定一種語言,除非確實希望所有檔案都按它處理。識別看起來不對時,先檢查音訊與來源語音語言。更換翻譯目標,不能修復按錯誤識別語言生成的原文。
從規模合適的小批次開始
先用少量檔案確認設置、資源準備情況和輸出,再處理較大的集合。多檔案排隊處理,不代表所有檔案同時運行,也不承諾固定完成速度。
- 選擇本機可以讀取的檔案,確認名稱、時長和預期語音語言。
- 打開檔案轉寫窗口,添加多個檔案,或把它們拖入隊列。
- 多語言模型就緒時選擇自動語言識別,或按語言分組並明確選擇來源語音語言。
- 只需要原語言文稿時關閉翻譯;需要翻譯時,為這一輪選擇一個受支持的目標並準備資源。
- 有需要時才開啓說話人分離並準備資源;只有預期人數適合這一輪檔案時,才使用固定人數。
- 啓動隊列,在導出前逐一檢查檔案狀態與生成文字。
被拒絕的檔案應先按媒體問題檢查。沒有音軌或編碼無法讀取,不會因為在模型設置中增加語言而解決。
區分識別、翻譯與說話人設置
識別生成實際說出的語言文字,翻譯把它轉換成另一種閱讀語言,說話人分離按聲音為文字分組。可以一起使用,但一項成功,並不能證明另外兩項也成功。
例如,日語片段識別正確,翻譯目標仍可能不可用,或人物歸屬錯誤。檢查譯文文檔時,應保留原文。對照錄音覈實姓名、數字和重要否定表達,尤其是譯文比原文更流暢時。
翻譯語言對取決於實際 Mac 上可用的資源。多語言識別模型不意味著每一種原語言都能翻譯成任意目標。翻譯不可用時,仍可使用並檢查原語言文稿,不應把它誤稱為譯文。
單個檔案內切換語言,需要另行檢查
一批主要各用一種語言的檔案,適合考慮自動識別;一段訪談反復切換日語和英語,則需要另外留意。自動判斷語言,並不證明錄音里的每次切換都被正確識別。
檢查語言切換附近的片段。如果某種語言持續丟失,可用平時的媒體編輯工具準備合適的片段,分別選擇對應語言處理。保留原檔案,並記住截取片段的文稿使用的是該片段自己的時間線。
本文不承諾混合語言識別完美,也不承諾每種支持語言質量相同。背景音樂、地區口音、不熟悉的姓名和錄制條件不同,也會影響需要修正的內容。
檢查完成情況,查明原因後再重試
Alison 當前檔案轉寫試用提供累計 60 分鐘音訊時長,與實時聆聽分開計算。隊列按順序使用剩餘額度,後面的檔案可能只分到剩餘時間,或沒有時間可用。應查看預期時長與已處理時長,不能假定加入的檔案都會完整完成。
部分結果不是長錄音的完整文稿。失敗或取消的任務可以在檢查原因後重試。用錯識別語言時,下一輪選擇正確語言;資源缺失時,先準備資源。重復處理長批次前,應檢查剩餘額度。
解鎖完整檔案處理後,需要重新運行受影響的檔案。權限變化不會自動補齊之前文檔中未處理的結尾。應保持檔案、狀態和最新文稿之間的對應關係清楚。
逐份檢查,並有意識地導出
用搜索和回放檢查每份結果的重要片段。編輯了一份文稿,不代表隊列中其他文檔都已校對。為導出檔案使用不同名稱,並保留原錄音,方便以後檢查。
當前文稿導出菜單提供 TXT、Markdown、CSV、PDF、SRT 和 VTT。可選擇原文、已生成的譯文或兩者;人物與文檔時間戳選項取決於記錄和格式。應通過每份記錄的菜單導出,不要把批量添加等同於一鍵導出整個隊列。
本機識別說明的是處理髮生在哪裡,不能控制同步導出檔案夾、共享盤或備份之後如何處理檔案。應選擇錄音與文檔的保存位置。下一步是一個語言和輸出都能覈實的小隊列,再擴大處理規模。
官方參考資料(核對日期:2026年10月4日)
WhisperKit: on-device speech-to-text and model choices
Apple: file-based media reading
FluidAudio: local speaker diarization
常見問題
不同語言的錄音能放進同一個隊列嗎?
可以,但同一輪共享語言設置。兼容的多語言模型就緒時,可以使用自動識別;也可以按語言分組,明確選擇來源語音語言後分別處理。
自動語言識別需要下載模型嗎?
需要可用的本機 Whisper 模型,應在離線前準備。用於某種明確選擇語言的系統引擎,不能作為自動語言識別的替代。
一段檔案交替使用兩種語言,能穩定識別嗎?
不要直接假定。應檢查切換語言的片段;某種語言反復丟失時,可考慮準備獨立片段並選擇對應語言處理。
日語轉寫會自動給我英文嗎?
不會。識別與翻譯是不同設置。需要英文輔助閱讀時,應選擇受支持的英語翻譯目標,並準備所需語言對。
準備完成後,可以不聯網轉寫嗎?
所需資源可用後,受支持的識別在本機運行。可選翻譯和人物資源也要準備,並在離線前確認實際需要的流程。
批量轉寫也能添加說話人標籤嗎?
資源就緒時,可以為這一輪開啓說話人分離。每個檔案都應獨立檢查;人物編號不代表不同檔案中同一個人的身份。
批量轉寫會自動批量導出嗎?
隊列處理的是多個檔案,導出通過每份文稿的菜單完成。本文不承諾一鍵導出整個隊列。