Apple Speech và Whisper cục bộ trên Mac: thử nghiệm độ chính xác và độ trễ
Chúng tôi thử Apple Speech và mô hình WhisperKit base cục bộ trên cùng 30 đoạn tiếng Anh có bản chuẩn, rồi so sánh WER, thời gian xuất hiện chữ đầu tiên và thời gian chốt kết quả.
2026-08-30 · 9 minCâu trả lời ngắn
Trên máy Mac Apple silicon này, Apple Speech hiển thị văn bản đầu tiên sớm hơn, còn Whisper cục bộ cho thấy sự khác biệt giữa độ chính xác của mô hình và kết quả của pipeline phụ đề trực tiếp. Với 30 đoạn tiếng Anh rõ từ LibriSpeech, Apple Speech đạt WER 0.9%, đường Whisper trực tiếp của Alison Workspace đạt 7.9%, còn Whisper nhận dạng toàn bộ đoạn đạt 1.9%. Trung vị thời gian đến chữ đầu tiên là 1.14 s với Apple và 1.74 s với Whisper trực tiếp. Các số này chỉ mô tả phép thử này, không đại diện mọi người nói, ngôn ngữ hay máy Mac.
Cách tiến hành thử nghiệm
Thử nghiệm chạy cục bộ ngày 30 tháng 8 năm 2026 trên Mac Apple silicon với macOS 26.5.2. Hai engine nhận cùng 30 đoạn có nhãn từ LibriSpeech test-clean, chuyển thành âm thanh mono 16 kHz. Khung 100 ms được đưa vào theo thời gian thực, sau đó thêm cùng 0,8 giây im lặng. Mô hình và tài nguyên ngôn ngữ Apple đã được chuẩn bị trước khi đo. Độ chính xác dùng tỷ lệ lỗi từ WER; độ trễ đo văn bản không rỗng đầu tiên và thời gian từ khi lời nói kết thúc đến văn bản cuối.
Độ chính xác: tách engine khỏi pipeline trực tiếp
Whisper nhận dạng toàn bộ đoạn đạt WER 1.9%, thể hiện giới hạn trên của mô hình khi có trọn câu. Đường Whisper của sản phẩm đạt 7.9% vì phát hiện hoạt động giọng nói, chia đoạn, bản nháp tiến dần và ghép kết quả cuối cũng ảnh hưởng văn bản hiển thị. Kết quả streaming cuối gốc của Apple Speech đạt 0.9%. Mô hình mạnh vẫn có thể mất từ nếu pipeline thời gian thực cắt câu sai vị trí; một tỷ lệ tổng không giải thích mọi lỗi.
Độ trễ: văn bản đầu và văn bản cuối là hai chỉ số
Apple Speech hiện chữ đầu tiên sau trung vị 1.14 s, so với 1.74 s của đường Whisper trực tiếp. Sau khi lời nói kết thúc, kết quả cuối gốc của Apple đến sau 1.13 s, còn Whisper sau 0.58 s. Nhận dạng toàn đoạn của Whisper có hệ số thời gian thực trung vị 0.021×, nhưng tốc độ kiểu ngoại tuyến đó không phải thời gian phụ đề đầu tiên. Trải nghiệm tốt cần cả bản nháp dễ đọc xuất hiện sớm và dòng cuối đáng tin cậy.
Vì sao Alison Workspace dùng cả hai
Alison Workspace không cho rằng một engine luôn tốt nhất. Trên macOS 26, ngôn ngữ được chọn rõ ràng và có tài nguyên giọng nói trên thiết bị của Apple có thể dùng đường streaming gốc Apple Speech. Hệ thống cũ hơn, tự động phát hiện, ngôn ngữ Apple chưa hỗ trợ hoặc tài nguyên không có có thể dùng WhisperKit cục bộ. Cách định tuyến này giữ độ phủ rộng và tận dụng streaming Apple khi có. Sau lần tải tài nguyên ngôn ngữ hoặc mô hình Whisper đầu tiên, nhận dạng chạy trên Mac.
Điều benchmark này không chứng minh
30 đoạn là giọng đọc tiếng Anh rõ, thường chỉ một người nói. Chúng không đại diện mọi giọng vùng miền, micro cuộc họp, phòng ồn, nhạc nền, lời chồng nhau, thuật ngữ chuyên môn hay ngôn ngữ ngoài tiếng Anh. Dịch bài viết này không biến phép thử tiếng Anh thành benchmark đa ngôn ngữ. Chúng tôi công khai số mẫu, hệ thống, mô hình, phương thức đầu vào và kết quả từng pipeline. Với công việc quan trọng, hãy thử tên, số, giọng nói và ứng dụng âm thanh bạn thực sự dùng.
Thử một phút trên máy Mac của bạn
Phát một video ngắn hoặc bản ghi cuộc họp có một giọng rõ. Chọn đúng ngôn ngữ nói, xác nhận ứng dụng nhận âm thanh hệ thống Mac thay vì tiếng ồn từ micro phòng, rồi xem khi nào những từ hữu ích đầu tiên xuất hiện. Kiểm tra một tên, một con số và một thuật ngữ kỹ thuật, sau đó so dòng cuối với âm thanh. Lặp lại trong ứng dụng họp, trình duyệt hoặc trình phát bạn dùng thật.
Câu hỏi thường gặp
Apple Speech có nhanh hơn Whisper trên Mac không?
Trong thử nghiệm 30 đoạn tiếng Anh này, trung vị chữ đầu tiên là 1.14 s với Apple và 1.74 s với đường Whisper của Alison. Phần cứng, ngôn ngữ và âm thanh có thể thay đổi kết quả.
Whisper cục bộ có chính xác hơn Apple Speech không?
Whisper toàn đoạn đạt WER 1.9%, Apple gốc 0.9%, còn pipeline Whisper trực tiếp 7.9%. Cần tách độ chính xác mô hình và độ chính xác toàn sản phẩm.
Nhận dạng giọng nói có chạy ngoại tuyến trên Mac không?
Có, sau khi tải tài nguyên ngôn ngữ Apple hoặc mô hình Whisper cục bộ cần thiết. Lần cài đầu có thể cần Internet.
Alison Workspace dùng engine nào?
Có thể dùng Apple Speech trên macOS 26 khi ngôn ngữ và tài nguyên cục bộ được hỗ trợ, còn WhisperKit cục bộ dùng để mở rộng độ phủ hoặc làm đường dự phòng.