Tài nguyênChép lời tệp

Cách chép lời hàng loạt tệp âm thanh đa ngôn ngữ trên Mac khi ngoại tuyến

Chuẩn bị mô hình cục bộ, chọn nhận diện tự động hoặc nhóm theo ngôn ngữ, rồi kiểm tra và xuất riêng từng bản ghi trong hàng đợi.

2026-10-04 · 7 min
Một hàng thẻ âm thanh đầy màu sắc dẫn đến các tài liệu ghi âm giọng nói riêng biệt trên nền màu ngà ấm áp.

Câu trả lời ngắn gọn

Để chép lời nhiều bản ghi bằng các ngôn ngữ khác nhau trên Mac, hãy chuẩn bị tài nguyên nhận dạng trên máy, thêm tệp vào hàng đợi và chọn cách xử lý ngôn ngữ được nói. Nhận diện tự động hữu ích khi đã cài mô hình tương thích. Nếu bạn biết ngôn ngữ nhưng nhận diện không đáng tin cậy, hãy nhóm các tệp cùng ngôn ngữ rồi chọn rõ ngôn ngữ nguồn để xử lý.

Alison Workspace hỗ trợ hàng đợi tệp, lựa chọn nhận dạng đa ngôn ngữ, dịch tùy chọn và ghi phân biệt người nói (gắn nhãn cho loa). Nó yêu cầu Apple-silicon Mac, M1 hoặc mới hơn, với macOS 15 trở lên. Sau khi các tài nguyên cần thiết đã sẵn sàng, tính năng nhận dạng tệp được hỗ trợ sẽ chạy cục bộ. Lập kế hoạch xung quanh thực tế là hàng đợi chia sẻ cài đặt cho một lần chạy: một số tệp ở các ngôn ngữ khác nhau không gặp phải vấn đề giống như một bản ghi chuyển đổi ngôn ngữ nhiều lần.

Sắp xếp các tập tin xung quanh công việc bạn cần thực hiện

Giả sử bạn có một bài giảng tiếng Anh, một cuộc phỏng vấn bằng tiếng Nhật và một bản ghi âm tiếng Tây Ban Nha. Bạn muốn có một tài liệu bằng ngôn ngữ gốc riêng biệt cho mỗi tài liệu, chỉ có bản dịch nếu nó hữu ích. Đây là quy trình minh họa, không phải báo cáo kiểm tra độ chính xác bằng ba ngôn ngữ.

Giữ tên các tệp để bạn có thể phân biệt chúng mà không cần mở mọi bản chép lời. Kiểm tra âm thanh, độ dài gần đúng và ngôn ngữ chính của chúng. Đối với âm thanh được nhúng trong video, tệp vẫn cần một đoạn âm thanh có thể giải mã được và có thể truy cập được; hình ảnh của nó không cung cấp từ ngữ để nhận dạng giọng nói.

Quyết định xem bạn cần văn bản nguồn, công cụ hỗ trợ đọc đã dịch, nhãn của người nói hay phụ đề. Mỗi tùy chọn thêm một yêu cầu riêng và một nhiệm vụ đánh giá riêng. Bắt đầu bằng văn bản gốc có thể giúp xác định vấn đề ngôn ngữ dễ dàng hơn trước khi thêm bản dịch.

Chuẩn bị tài nguyên nhận dạng trước khi ngoại tuyến

Menu nhận dạng cung cấp nhiều ngôn ngữ, nhưng công cụ và kiểu máy phải hỗ trợ ngôn ngữ bạn định sử dụng. Ngôn ngữ xuất hiện trong menu không đảm bảo rằng mọi kiểu máy được cài đặt đều có thể xử lý ngôn ngữ đó tốt như nhau. Sử dụng mô hình đa ngôn ngữ cho một lô cần nhiều ngôn ngữ nguồn.

Tính năng phát hiện ngôn ngữ tệp tự động của Alison yêu cầu mô hình Whisper cục bộ có thể sử dụng được. Một số ngôn ngữ được chọn rõ ràng có thể sử dụng tính năng nhận dạng hệ thống có sẵn trên các phiên bản macOS tương thích, nhưng đó không phải là ngôn ngữ thay thế tự động. Làm theo thông báo sẵn sàng của ứng dụng thay vì giả định rằng mô hình được sử dụng bởi quy trình công việc khác đã sẵn sàng ở đây.

Tải xuống và chuẩn bị tài nguyên trong khi kết nối, sau đó thử một tệp ngắn với cài đặt dự định trước khi sử dụng phiên ngoại tuyến. Sự chuẩn bị đầu tiên có thể mất thời gian. Không có bước kiểm tra mẫu sẵn sàng nào có thể chứng minh được chất lượng của một giọng lạ hoặc một bản ghi âm ồn.

Chọn các nhóm dựa trên ngôn ngữ hoặc phát hiện tự động

Đối với các tệp có ngôn ngữ chính rõ ràng, tính năng phát hiện tự động có thể tránh việc sắp xếp mọi mục theo cách thủ công. Nó vẫn có thể sai, đặc biệt là với sự im lặng, âm nhạc, rất ít lời nói hoặc phần mở đầu bất thường. Kiểm tra kết quả cho mọi tệp thay vì chấp nhận toàn bộ hàng đợi vì bản chép lời đầu tiên có vẻ đúng.

Nếu bạn biết các ngôn ngữ, cách tiếp cận có kiểm soát hơn là chạy các tệp tiếng Anh với tiếng Anh được chọn, sau đó là các tệp tiếng Nhật với tiếng Nhật được chọn, v.v. Hàng đợi sử dụng lựa chọn nhận dạng chung cho lần chạy đó; hướng dẫn này không mô tả cài đặt ngôn ngữ riêng biệt được đính kèm với mỗi tệp được xếp hàng đợi.

Không bắt đầu lô ngôn ngữ hỗn hợp bằng một ngôn ngữ cố định trừ khi bạn thực sự muốn ngôn ngữ đó cho tất cả các tệp. Khi nhận dạng có vẻ sai, trước tiên hãy kiểm tra âm thanh và ngôn ngữ. Việc thay đổi ngôn ngữ dịch đích không thể sửa được bản ghi giọng nói nguồn được tạo theo cài đặt nhận dạng sai.

Bắt đầu một đợt có thể quản lý được

Bắt đầu với một tập hợp nhỏ để bạn có thể xác nhận cài đặt, mức độ sẵn sàng của tài nguyên và đầu ra trước khi xử lý bộ sưu tập lớn hơn. Nhiều tệp được xếp hàng đợi để xử lý; đây không phải là lời hứa rằng tất cả các tệp sẽ chạy đồng thời hoặc hoàn thành ở tốc độ cố định.

  1. Chọn các tệp bạn có thể đọc cục bộ và xác nhận tên, thời lượng và ngôn ngữ nói dự kiến của chúng.
  2. Mở cửa sổ chép lời tệp và thêm một số tệp hoặc kéo chúng vào hàng đợi của nó.
  3. Chọn phát hiện ngôn ngữ tự động với mô hình đa ngôn ngữ sẵn có hoặc nhóm các tệp theo ngôn ngữ và chọn ngôn ngữ nguồn rõ ràng.
  4. Tắt bản dịch đối với các tài liệu bằng ngôn ngữ gốc hoặc chọn một mục tiêu dịch được hỗ trợ để chạy và chuẩn bị tài nguyên cho nó.
  5. Chỉ bật tính năng ghi phân biệt người nói (gắn nhãn người nói) khi hữu ích và chuẩn bị tài nguyên; chỉ sử dụng số lượng người phát biểu dự kiến ​​nếu nó phù hợp với các tập tin trong lần phát biểu đó.
  6. Bắt đầu xếp hàng, sau đó xem lại trạng thái của từng tệp và văn bản được tạo trước khi xuất tài liệu của tệp đó.

Trước tiên, hãy kiểm tra mọi tệp bị từ chối dưới dạng sự cố phương tiện. Tệp không có đoạn âm thanh hoặc mã hóa không thể đọc được sẽ không được khắc phục bằng cách thêm nhiều ngôn ngữ hơn vào cài đặt mô hình.

Giữ các cài đặt nhận dạng, dịch thuật và loa khác biệt

Sự công nhận tạo ra các từ trong ngôn ngữ được nói. Bản dịch biến những từ đó sang ngôn ngữ đọc khác. Phân phân biệt người nói nhóm văn bản bằng giọng nói. Chúng có thể được sử dụng cùng nhau, nhưng thành công ở một nơi không tạo nên thành công ở những nơi khác.

Ví dụ: một đoạn văn tiếng Nhật được nhận dạng chính xác có thể vẫn không có mục tiêu dịch hoặc phân công người nói sai. Giữ bản gốc hiển thị khi xem lại tài liệu đã dịch. Xác minh tên, số liệu và các tuyên bố tiêu cực quan trọng đối với bản ghi, đặc biệt khi bản dịch có vẻ mượt mà hơn văn bản nguồn.

Các cặp dịch phụ thuộc vào tài nguyên có sẵn trên Mac thực tế. Trình nhận dạng đa ngôn ngữ không có nghĩa là mọi ngôn ngữ nguồn đều có thể được dịch sang mọi ngôn ngữ đích. Nếu không có bản dịch, bạn vẫn có thể sử dụng và xem lại bản chép lời ở ngôn ngữ nguồn thay vì gắn nhãn sai là bản dịch.

Xử lý bản ghi thay đổi ngôn ngữ khác nhau

Một thư mục chứa hầu hết các tệp ngôn ngữ đơn lẻ là lý do chính đáng để xem xét tính năng phát hiện tự động. Một cuộc phỏng vấn liên tục chuyển đổi giữa tiếng Nhật và tiếng Anh cần được chú ý riêng. Tính năng phát hiện tự động không chứng minh rằng mọi công tắc bên trong bản ghi đều được nhận dạng chính xác.

Xem lại các đoạn xung quanh sự thay đổi ngôn ngữ. Nếu kết quả liên tục mất một ngôn ngữ, hãy cân nhắc xử lý các đoạn trích phù hợp riêng biệt với ngôn ngữ dự định đã chọn, sử dụng các công cụ chỉnh sửa phương tiện thông thường của bạn để chuẩn bị chúng. Giữ nguyên bản gốc và nhớ rằng bản chép lời của một đoạn trích sử dụng dòng thời gian của đoạn trích đó.

Ở đây không có tuyên bố nào về khả năng nhận dạng ngôn ngữ hỗn hợp hoàn hảo hoặc chất lượng như nhau ở mọi ngôn ngữ được hỗ trợ. Nhạc nền, giọng nói khu vực, những cái tên xa lạ và các điều kiện ghi âm khác nhau cũng ảnh hưởng đến những gì cần chỉnh sửa.

Kiểm tra hoàn thành và chỉ thử lại sau khi chẩn đoán sự cố

Bản dùng thử sao chép tệp của Alison hiện cung cấp thời lượng âm thanh tích lũy 60 phút, tách biệt với nghe trực tiếp. Hàng đợi sử dụng phần phụ cấp còn lại theo thứ tự. Các tập tin sau này có thể chỉ nhận được thời gian còn lại hoặc không nhận được; xem xét độ dài dự kiến ​​và được xử lý thay vì cho rằng mọi tệp được thêm vào sẽ hoàn tất.

Kết quả một phần không phải là bản ghi âm giọng nói hoàn chỉnh của một đoạn ghi âm dài. Công việc bị lỗi hoặc bị hủy có thể được thử lại sau khi bạn kiểm tra nguyên nhân. Nếu một tệp được xử lý bằng ngôn ngữ sai, hãy chọn ngôn ngữ chính xác cho lần chạy khác; nếu thiếu tài nguyên, hãy chuẩn bị chúng trước. Xem lại mức trợ cấp trước khi lặp lại một đợt dài.

Nếu bạn mở khóa quyền truy cập tệp hoàn chỉnh, hãy chạy lại tệp bị ảnh hưởng. Việc thay đổi quyền truy cập không tự động điền vào phần cuối chưa được xử lý của tài liệu trước đó. Giữ mối quan hệ giữa tệp, trạng thái và bản chép lời mới nhất của nó rõ ràng.

Xem xét và xuất từng tài liệu một cách có chủ ý

Sử dụng tìm kiếm và phát lại để kiểm tra các đoạn quan trọng trong mỗi kết quả. Chỉnh sửa một bản chép lời không có nghĩa là các tài liệu khác trong hàng đợi đã được xem xét. Đặt tên riêng biệt cho các tệp đã xuất và giữ lại các bản ghi gốc để kiểm tra sau.

Menu xuất bản ghi giọng nói hiện tại cung cấp TXT, Markdown, CSV, PDF, SRT và VTT. Chọn văn bản gốc, bản dịch nếu có hoặc cả hai; tùy chọn phân biệt người nói và dấu thời gian của tài liệu phụ thuộc vào bản ghi và định dạng. Xuất từng bản ghi thông qua menu của nó thay vì giả định rằng việc thêm một lô sẽ cung cấp khả năng xuất hàng loạt chỉ bằng một cú nhấp chuột.

Nhận dạng cục bộ mô tả nơi xử lý xảy ra. Nó không kiểm soát những gì thư mục xuất, ổ đĩa chung hoặc bản sao lưu được đồng bộ hóa sau này thực hiện với các tệp. Chọn nơi bạn lưu giữ bản ghi và tài liệu của mình. Bước tiếp theo là một hàng đợi nhỏ có ngôn ngữ và kết quả đầu ra mà bạn có thể xác minh trước khi mở rộng quy mô.

Tài liệu tham khảo chính thức được kiểm tra vào ngày 4 tháng 10 năm 2026

WhisperKit: on-device speech-to-text and model choices
Apple: file-based media reading
FluidAudio: local speaker diarization

Câu hỏi thường gặp

Các bản ghi bằng ngôn ngữ khác nhau có thể xếp vào một hàng đợi không?

Có, nhưng quá trình chạy chia sẻ cài đặt ngôn ngữ. Sử dụng tính năng phát hiện tự động với mô hình đa ngôn ngữ tương thích sẵn hoặc nhóm các tệp theo ngôn ngữ và chạy các nhóm đó bằng ngôn ngữ nguồn rõ ràng.

Tính năng phát hiện ngôn ngữ tự động có cần tải xuống mô hình không?

Nó cần một mô hình Whisper cục bộ có thể sử dụng được. Chuẩn bị mô hình đó trước phiên ngoại tuyến. Công cụ hệ thống cho một ngôn ngữ được chọn rõ ràng không phải là dự phòng ngôn ngữ tự động.

Nó có xử lý đáng tin cậy hai ngôn ngữ chuyển đổi trong một tệp không?

Đừng cho rằng. Xem lại các đoạn chuyển đổi và xem xét các đoạn trích được chuẩn bị riêng với cài đặt ngôn ngữ chính xác khi một ngôn ngữ bị bỏ sót nhiều lần.

Việc chép lời bằng tiếng Nhật có tự động đưa ra văn bản tiếng Anh cho tôi không?

Không, Nhận dạng và dịch thuật là những lựa chọn riêng biệt. Chọn tiếng Anh làm mục tiêu dịch được hỗ trợ và chuẩn bị cặp cần thiết nếu bạn muốn có trợ giúp đọc tiếng Anh.

Tôi có thể chép lại tập tin mà không cần internet sau khi chuẩn bị không?

Tính năng nhận dạng được hỗ trợ sẽ chạy cục bộ khi các tài nguyên cần thiết của nó có thể sử dụng được. Chuẩn bị mọi tài nguyên dịch thuật và diễn giả tùy chọn, đồng thời xác nhận quy trình làm việc dự định trước khi chuyển sang chế độ ngoại tuyến.

Nhãn loa có sẵn cho một lô không?

Tính năng phân biệt người nói có thể được kích hoạt để chạy khi tài nguyên của nó đã sẵn sàng. Xem lại từng tệp một cách độc lập; số người nói không thiết lập danh tính của cùng một người trên các tệp.

Chép lời hàng loạt có bao gồm xuất hàng loạt tự động không?

Hàng đợi xử lý nhiều tệp. Hãy xuất từng bản chép lời từ menu riêng; hướng dẫn này không khẳng định có thể xuất toàn bộ hàng đợi bằng một cú nhấp.

Hướng dẫn liên quan