Apple Speech vs. lokales Whisper auf dem Mac: Genauigkeit und Latenz im Test
Wir haben Apple Speech und ein lokales WhisperKit-Base-Modell mit denselben 30 beschrifteten englischen Audioclips getestet und WER, Zeit bis zum ersten Text sowie Finalisierungsdauer gemessen.
2026-08-30 · 9 minDie kurze Antwort
Auf diesem Apple-Silicon-Mac zeigte Apple Speech den ersten Text früher. Beim lokalen Whisper unterschied sich dagegen die reine Modellgenauigkeit von der Genauigkeit der Live-Untertitel-Pipeline. Bei 30 sauberen englischen LibriSpeech-Clips erreichte Apple Speech eine WER von 0.9%, der Whisper-Live-Pfad von Alison Workspace 7.9% und die Whisper-Erkennung des gesamten Clips 1.9%. Die mediane Zeit bis zum ersten Text lag bei Apple bei 1.14 s und beim Whisper-Live-Pfad bei 1.74 s. Diese Werte gelten nur für diesen Test.
So wurde getestet
Der Test lief am 30. August 2026 lokal auf einem Apple-Silicon-Mac mit macOS 26.5.2. Beide Engines erhielten dieselben 30 beschrifteten Clips aus LibriSpeech test-clean, umgewandelt in 16-kHz-Monoaudio. Die Daten wurden in Echtzeit als 100-ms-Frames zugespielt; anschließend folgten identische 0,8 Sekunden Stille. Modelle und Apple-Sprachressourcen waren vor der Messung vorbereitet. Die Genauigkeit wurde als Wortfehlerrate gemessen. Für die Latenz zählten der erste nicht leere Text und die Zeit vom Sprachende bis zum endgültigen Text.
Genauigkeit: Engine und Live-Pipeline getrennt betrachten
Die Whisper-Erkennung des ganzen Clips erzielte 1.9% WER und zeigt die Genauigkeitsobergrenze des Modells bei vollständiger Äußerung. Der Whisper-Live-Pfad des Produkts erreichte 7.9%, weil Spracherkennung der Aktivität, Segmentierung, laufende Entwürfe und die Endmontage das Ergebnis in der Untertitelleiste beeinflussen. Die nativen Streaming-Finals von Apple Speech erreichten 0.9%. Auch ein starkes Modell kann Wörter verlieren, wenn eine Echtzeit-Pipeline eine Äußerung an der falschen Stelle trennt.
Latenz: erster Text und endgültiger Text sind verschieden
Apple Speech lieferte den ersten Text nach median 1.14 s, der Whisper-Live-Pfad nach 1.74 s. Nach dem Sprachende kam Apples natives Final nach 1.13 s, das Whisper-Final nach 0.58 s. Die Whisper-Ganzclip-Erkennung lief mit einem medianen Echtzeitfaktor von 0.021×; diese Offline-Geschwindigkeit ist jedoch keine Messung des ersten Untertitels. Gute Live-Untertitel brauchen sowohl einen frühen lesbaren Entwurf als auch eine verlässliche Endzeile.
Warum Alison Workspace beide Engines nutzt
Alison Workspace geht nicht davon aus, dass ein Erkenner immer der beste ist. Unter macOS 26 kann eine ausdrücklich gewählte Sprache mit verfügbarer Apple-On-Device-Ressource den nativen Apple-Speech-Streamingpfad nutzen. Ältere Systeme, automatische Erkennung, nicht von Apple unterstützte Sprachen oder fehlende Ressourcen können auf lokales WhisperKit zurückgreifen. So bleibt die Sprachabdeckung breit, während Apple-Streaming genutzt wird, wo es verfügbar ist. Nach dem einmaligen Download laufen die Erkennungsschritte auf dem Mac.
Was dieser Benchmark nicht beweist
Die 30 Clips sind saubere englische Lesesprache mit meist einer Stimme. Sie stehen nicht für alle Akzente, Konferenzmikrofone, lauten Räume, Musik, überlappenden Gespräche, Fachbegriffe oder andere Sprachen. Die Übersetzung dieses Artikels macht aus dem englischen Test keinen mehrsprachigen Benchmark. Stichprobengröße, System, Modell, Eingabemethode und getrennte Pipelinewerte sind offengelegt. Für wichtige Aufgaben sollten Namen, Zahlen, Akzente und die tatsächlich verwendete Audio-App geprüft werden.
Ein Ein-Minuten-Test auf dem eigenen Mac
Spielen Sie ein kurzes Video oder eine Meetingaufnahme mit einer klaren Stimme ab. Wählen Sie die bekannte gesprochene Sprache, prüfen Sie, ob die App Mac-Systemaudio statt Raum-Mikrofonrauschen erhält, und beobachten Sie das Erscheinen der ersten brauchbaren Wörter. Prüfen Sie einen Namen, eine Zahl und einen Fachbegriff und vergleichen Sie die Endzeile mit dem Audio. Wiederholen Sie den Test in Ihrer echten Meeting-App, im Browser oder Player.
Häufig gestellte Fragen
Ist Apple Speech auf dem Mac schneller als Whisper?
In diesem Test mit 30 englischen Clips lag der Median bis zum ersten Text bei Apple bei 1.14 s und beim Alison-Whisper-Live-Pfad bei 1.74 s. Hardware, Sprache und Audio können das Ergebnis ändern.
Ist lokales Whisper genauer als Apple Speech?
Whisper-Ganzclip erreichte hier 1.9% WER, Apple nativ 0.9% und die Whisper-Live-Pipeline 7.9%. Modell- und End-to-End-Genauigkeit müssen getrennt betrachtet werden.
Funktioniert Spracherkennung auf dem Mac offline?
Ja, nachdem die nötige Apple-Sprachressource oder das lokale Whisper-Modell heruntergeladen wurde. Die erste Installation kann Internet benötigen.
Welche Speech-Engine nutzt Alison Workspace?
Unter macOS 26 kann bei unterstützter Sprache und lokaler Ressource Apple Speech genutzt werden; lokales WhisperKit dient der breiteren Abdeckung und als Fallback.