Sumber dayaPengenalan suara

Apple Speech vs Whisper lokal di Mac: uji akurasi dan latensi

Kami menguji Apple Speech dan model WhisperKit base lokal dengan 30 klip bahasa Inggris berlabel yang sama, lalu membandingkan WER, waktu teks pertama, dan waktu finalisasi.

2026-08-30 · 9 min
Alison WorkspaceEN → ID

Jawaban singkat

Di Mac Apple silicon ini, Apple Speech menampilkan teks pertama lebih cepat, sedangkan Whisper lokal menunjukkan perbedaan antara akurasi model dan hasil pipeline subtitle langsung. Pada 30 klip bahasa Inggris bersih dari LibriSpeech, WER Apple Speech adalah 0.9%, jalur Whisper langsung Alison Workspace 7.9%, dan pengenalan seluruh klip Whisper 1.9%. Median waktu teks pertama adalah 1.14 s untuk Apple dan 1.74 s untuk jalur Whisper langsung. Angka ini hanya menjelaskan pengujian ini, bukan semua pembicara, bahasa, Mac, atau rekaman.

Cara pengujian dilakukan

Pengujian dijalankan secara lokal pada 30 Agustus 2026 di Mac Apple silicon dengan macOS 26.5.2. Kedua mesin menerima 30 klip berlabel yang sama dari LibriSpeech test-clean, dikonversi menjadi audio mono 16 kHz. Frame 100 ms dikirim sesuai waktu nyata, lalu ditambahkan 0,8 detik keheningan yang sama. Model dan sumber bahasa Apple disiapkan sebelum pengukuran. Akurasi memakai word error rate; latensi mengukur teks pertama yang tidak kosong serta waktu dari akhir ucapan sampai teks final.

Akurasi: pisahkan mesin dari pipeline langsung

Pengenalan seluruh klip Whisper mencatat WER 1.9% dan menunjukkan batas atas akurasi model saat menerima satu ujaran lengkap. Jalur Whisper produk mencatat 7.9% karena deteksi aktivitas suara, segmentasi, draf progresif, dan penyusunan final juga memengaruhi teks di bilah subtitle. Hasil final streaming native Apple Speech mencatat 0.9%. Model yang kuat pun dapat kehilangan kata jika pipeline waktu nyata memotong ujaran di tempat yang salah.

Latensi: teks pertama dan teks final berbeda

Apple Speech menampilkan teks pertama dengan median 1.14 s, dibanding 1.74 s pada jalur Whisper langsung. Setelah ucapan berakhir, final native Apple tiba setelah 1.13 s dan final Whisper setelah 0.58 s. Pengenalan seluruh klip Whisper memiliki median real-time factor 0.021×, tetapi kecepatan bergaya offline ini bukan ukuran subtitle pertama. Pengalaman yang baik membutuhkan draf yang cepat dibaca sekaligus baris final yang andal.

Mengapa Alison Workspace memakai keduanya

Alison Workspace tidak menganggap satu pengenal selalu terbaik. Di macOS 26, bahasa yang dipilih secara eksplisit dan memiliki sumber ucapan on-device Apple dapat memakai streaming native Apple Speech. Sistem lama, deteksi otomatis, bahasa yang tidak didukung Apple, atau sumber yang tidak tersedia dapat memakai WhisperKit lokal. Routing ini mempertahankan cakupan luas sekaligus memanfaatkan streaming Apple. Setelah sumber bahasa atau model Whisper diunduh sekali, pengenalan berjalan di Mac.

Hal yang tidak dibuktikan benchmark ini

Ke-30 klip adalah bacaan bahasa Inggris yang bersih dan umumnya satu pembicara. Sampel tidak mewakili semua aksen, mikrofon rapat, ruangan bising, musik, suara bertumpuk, istilah khusus, atau bahasa selain Inggris. Menerjemahkan artikel ini tidak mengubah tes Inggris menjadi benchmark multibahasa. Kami membuka jumlah sampel, sistem, model, metode input, dan hasil pipeline secara terpisah. Untuk pekerjaan penting, uji nama, angka, aksen, dan aplikasi audio yang benar-benar digunakan.

Tes satu menit di Mac Anda

Putar video singkat atau rekaman rapat dengan satu suara yang jelas. Pilih bahasa lisan yang diketahui, pastikan aplikasi menerima audio sistem Mac dan bukan kebisingan mikrofon ruangan, lalu lihat kapan kata berguna pertama muncul. Periksa satu nama, satu angka, dan satu istilah teknis, kemudian bandingkan baris final dengan audio. Ulangi di aplikasi rapat, browser, atau pemutar yang benar-benar Anda gunakan.

Pertanyaan umum

Apakah Apple Speech lebih cepat daripada Whisper di Mac?

Dalam tes 30 klip Inggris ini, median teks pertama adalah 1.14 s untuk Apple dan 1.74 s untuk jalur Whisper Alison. Perangkat, bahasa, dan audio dapat mengubah hasil.

Apakah Whisper lokal lebih akurat daripada Apple Speech?

Whisper seluruh klip mencapai WER 1.9%, Apple native 0.9%, dan pipeline Whisper langsung 7.9%. Akurasi model dan produk harus dipisahkan.

Apakah pengenalan ucapan bekerja offline di Mac?

Ya, setelah sumber bahasa Apple atau model Whisper lokal yang diperlukan diunduh. Instalasi awal mungkin membutuhkan Internet.

Mesin apa yang digunakan Alison Workspace?

Apple Speech dapat digunakan di macOS 26 saat bahasa dan sumber lokal didukung; WhisperKit lokal digunakan untuk cakupan lebih luas atau sebagai fallback.