RisorseRiconoscimento vocale

Apple Speech e Whisper locale su Mac: test di precisione e latenza

Abbiamo testato Apple Speech e un modello WhisperKit base locale sugli stessi 30 clip inglesi con trascrizione di riferimento, misurando WER, primo testo e tempo di finalizzazione.

2026-08-30 · 9 min
Alison WorkspaceEN → IT

La risposta breve

Su questo Mac Apple silicon, Apple Speech ha mostrato prima il testo iniziale, mentre Whisper locale ha evidenziato una differenza tra precisione del modello e risultato della pipeline di sottotitoli live. Su 30 clip inglesi puliti di LibriSpeech, Apple Speech ha raggiunto WER 0.9%, il percorso Whisper live di Alison Workspace 7.9% e il riconoscimento Whisper dell’intero clip 1.9%. La mediana del primo testo è stata 1.14 s per Apple e 1.74 s per Whisper live. I numeri descrivono questa prova, non ogni voce, lingua, Mac o registrazione.

Come abbiamo eseguito il test

Il test è stato eseguito localmente il 30 agosto 2026 su un Mac Apple silicon con macOS 26.5.2. Entrambi i motori hanno ricevuto gli stessi 30 clip annotati di LibriSpeech test-clean, convertiti in audio mono a 16 kHz. I frame da 100 ms sono stati inviati in tempo reale e seguiti da 0,8 secondi di silenzio identico. Modelli e risorse Apple erano pronti prima della misurazione. La precisione usa il tasso di errore delle parole; la latenza misura il primo testo non vuoto e l’attesa dalla fine del parlato al testo finale.

Precisione: separare il motore dalla pipeline live

Whisper sull’intero clip ha ottenuto 1.9% WER e mostra il limite del modello quando riceve tutta la frase. Il percorso Whisper del prodotto ha ottenuto 7.9%, perché rilevamento vocale, segmentazione, bozze progressive e assemblaggio finale influenzano ciò che appare. I finali nativi in streaming di Apple Speech hanno ottenuto 0.9%. Anche un modello forte può perdere parole se la pipeline in tempo reale divide una frase nel punto sbagliato; una sola percentuale non spiega ogni errore.

Latenza: primo testo e testo finale sono misure diverse

Apple Speech ha mostrato il primo testo dopo una mediana di 1.14 s, contro 1.74 s del percorso Whisper live. Dopo la fine del parlato, il finale nativo Apple è arrivato dopo 1.13 s e quello Whisper dopo 0.58 s. Il riconoscimento Whisper dell’intero clip ha avuto un fattore tempo reale mediano di 0.021×, ma questa velocità offline non misura il primo sottotitolo. Servono sia una bozza leggibile presto sia una riga finale affidabile.

Perché Alison Workspace usa entrambi

Alison Workspace non presume che un solo riconoscitore sia sempre migliore. Su macOS 26, una lingua scelta esplicitamente con risorsa vocale Apple locale disponibile può usare lo streaming nativo Apple Speech. Sistemi precedenti, rilevamento automatico, lingue non supportate da Apple o risorse mancanti possono usare WhisperKit locale. Il routing mantiene una copertura ampia e sfrutta lo streaming Apple dove disponibile. Dopo il primo download della risorsa o del modello, il riconoscimento viene eseguito sul Mac.

Cosa non dimostra questo benchmark

I 30 clip sono letture inglesi pulite, per lo più con una sola voce. Non rappresentano ogni accento, microfono da riunione, stanza rumorosa, musica, voci sovrapposte, termine specialistico o lingua non inglese. Tradurre l’articolo non trasforma il test inglese in un benchmark multilingue. Pubblichiamo dimensione del campione, sistema, modello, metodo e risultati separati. Per lavori importanti, prova nomi, numeri, accenti e l’app reale che riproduce l’audio.

Un test di un minuto sul tuo Mac

Riproduci un breve video o una registrazione di riunione con una voce chiara. Scegli la lingua parlata nota, verifica che l’app riceva l’audio di sistema del Mac e non il rumore del microfono, e osserva quando compaiono le prime parole utili. Controlla un nome, un numero e un termine tecnico, quindi confronta la riga finale con l’audio. Ripeti nell’app di riunione, nel browser o nel lettore che usi davvero.

Domande frequenti

Apple Speech è più veloce di Whisper su Mac?

In questo test di 30 clip inglesi, la mediana del primo testo è stata 1.14 s per Apple e 1.74 s per Whisper live di Alison. Hardware, lingua e audio possono cambiare il risultato.

Whisper locale è più preciso di Apple Speech?

Whisper sull’intero clip ha raggiunto 1.9% WER, Apple nativo 0.9% e la pipeline Whisper live 7.9%. Precisione del modello e del prodotto vanno separate.

Il riconoscimento vocale funziona offline su Mac?

Sì, dopo il download della risorsa linguistica Apple o del modello Whisper locale necessario. L’installazione iniziale può richiedere Internet.

Quale motore usa Alison Workspace?

Può usare Apple Speech su macOS 26 quando lingua e risorsa locale sono supportate, e WhisperKit locale per copertura più ampia o come alternativa.