Apple Speech ou Whisper local sur Mac : test de précision et de latence
Nous avons testé Apple Speech et un modèle WhisperKit base local sur les mêmes 30 extraits anglais annotés, puis mesuré le WER, le délai du premier texte et le temps de finalisation.
2026-08-30 · 9 minLa réponse courte
Sur ce Mac Apple silicon, Apple Speech a affiché le premier texte plus tôt, tandis que Whisper local a montré un écart entre la précision du modèle et celle du pipeline de sous-titres en direct. Sur 30 extraits anglais propres de LibriSpeech, Apple Speech a obtenu un WER de 0.9%, le pipeline Whisper en direct d’Alison Workspace 7.9% et la reconnaissance Whisper de l’extrait complet 1.9%. Le délai médian du premier texte était de 1.14 s pour Apple et 1.74 s pour Whisper en direct. Ces valeurs décrivent ce test, pas tous les locuteurs, langues ou Mac.
Méthode du test
Le test a été exécuté localement le 30 août 2026 sur un Mac Apple silicon avec macOS 26.5.2. Les deux moteurs ont reçu les mêmes 30 extraits annotés de LibriSpeech test-clean, convertis en mono 16 kHz. Les trames de 100 ms ont été envoyées en temps réel, puis suivies de 0,8 seconde de silence identique. Les modèles et ressources linguistiques Apple étaient préparés avant la mesure. La précision utilise le taux d’erreur de mots ; la latence mesure le premier texte non vide et l’attente entre la fin de la parole et le texte final.
Précision : distinguer le moteur du pipeline en direct
La reconnaissance Whisper de l’extrait complet a obtenu 1.9% de WER et représente le plafond du modèle lorsqu’il reçoit toute la phrase. Le pipeline Whisper du produit a obtenu 7.9%, car la détection d’activité vocale, la segmentation, les brouillons progressifs et l’assemblage final influencent aussi le texte affiché. Les résultats finaux natifs d’Apple Speech ont obtenu 0.9%. Même un bon modèle peut perdre des mots si le pipeline temps réel coupe une phrase au mauvais endroit.
Latence : premier texte et texte final ne sont pas identiques
Apple Speech a affiché le premier texte après une médiane de 1.14 s, contre 1.74 s pour le chemin Whisper en direct. Après la fin de la parole, le résultat final natif Apple est arrivé après 1.13 s et celui de Whisper après 0.58 s. Le décodage Whisper de l’extrait complet avait un facteur temps réel médian de 0.021×, mais cette vitesse de type hors ligne ne mesure pas le premier sous-titre. Une bonne expérience exige à la fois un brouillon lisible tôt et une ligne finale fiable.
Pourquoi Alison Workspace utilise les deux moteurs
Alison Workspace ne suppose pas qu’un seul moteur est toujours supérieur. Sous macOS 26, une langue choisie explicitement et disposant d’une ressource vocale Apple locale peut utiliser le streaming natif Apple Speech. Les anciens systèmes, la détection automatique, les langues Apple non prises en charge ou les ressources indisponibles peuvent utiliser WhisperKit local. Ce routage conserve une large couverture tout en profitant du streaming Apple. Après le téléchargement initial de la ressource ou du modèle, la reconnaissance s’exécute sur le Mac.
Ce que ce benchmark ne prouve pas
Les 30 extraits sont de la lecture anglaise propre avec généralement un seul locuteur. Ils ne représentent pas tous les accents, microphones de réunion, pièces bruyantes, musiques, voix superposées, termes spécialisés ou langues non anglaises. Traduire cet article ne transforme pas le test anglais en benchmark multilingue. Nous publions le nombre d’extraits, le système, le modèle, la méthode d’entrée et les résultats séparés. Pour un usage important, testez les noms, nombres, accents et l’application audio réelle.
Un test d’une minute sur votre Mac
Lancez une courte vidéo ou un enregistrement de réunion avec une seule voix claire. Choisissez la langue parlée connue, vérifiez que l’app reçoit le son système du Mac plutôt que le bruit du microphone, puis observez l’apparition des premiers mots utiles. Contrôlez un nom, un nombre et un terme technique et comparez la ligne finale avec l’audio. Répétez dans l’app de réunion, le navigateur ou le lecteur que vous utilisez réellement.
Questions fréquentes
Apple Speech est-il plus rapide que Whisper sur Mac ?
Dans ce test de 30 extraits anglais, le premier texte médian était de 1.14 s pour Apple et 1.74 s pour le pipeline Whisper d’Alison. Le matériel, la langue et l’audio peuvent modifier le résultat.
Whisper local est-il plus précis qu’Apple Speech ?
Whisper sur l’extrait complet a atteint 1.9% de WER, Apple natif 0.9% et le pipeline Whisper en direct 7.9%. Il faut séparer précision du modèle et précision finale du produit.
La reconnaissance vocale fonctionne-t-elle hors ligne sur Mac ?
Oui, après le téléchargement de la ressource linguistique Apple ou du modèle Whisper local requis. L’installation initiale peut nécessiter Internet.
Quel moteur utilise Alison Workspace ?
Apple Speech peut être utilisé sous macOS 26 si la langue et la ressource locale sont prises en charge ; WhisperKit local assure une couverture plus large et le repli.