Apple Speech vs. Whisper local no Mac: teste de precisão e latência
Testamos o Apple Speech e um modelo WhisperKit base local com os mesmos 30 áudios rotulados em inglês, comparando WER, tempo até o primeiro texto e espera pela finalização.
2026-08-30 · 9 minResposta curta
Neste Mac com Apple silicon, o Apple Speech mostrou o primeiro texto antes, enquanto o Whisper local apresentou uma diferença entre a precisão do modelo e a do pipeline de legendas ao vivo. Em 30 clipes limpos em inglês do LibriSpeech, o Apple Speech atingiu WER de 0.9%, o caminho Whisper ao vivo do Alison Workspace 7.9% e o reconhecimento Whisper do clipe inteiro 1.9%. A mediana até o primeiro texto foi 1.14 s no Apple e 1.74 s no Whisper ao vivo. Esses números descrevem este teste, não todos os falantes, idiomas, Macs ou gravações.
Como o teste foi feito
O teste rodou localmente em 30 de agosto de 2026, em um Mac com Apple silicon e macOS 26.5.2. Os dois mecanismos receberam os mesmos 30 clipes rotulados do LibriSpeech test-clean, convertidos para áudio mono de 16 kHz. Os quadros de 100 ms foram enviados em tempo real, seguidos por 0,8 segundo de silêncio idêntico. Modelos e recursos de idioma da Apple foram preparados antes da medição. A precisão usou taxa de erro de palavras; a latência mediu o primeiro texto não vazio e o tempo entre o fim da fala e o texto final.
Precisão: separe o mecanismo do pipeline ao vivo
O reconhecimento Whisper do clipe inteiro marcou 1.9% de WER e mostra o teto do modelo quando recebe toda a frase. O caminho Whisper do produto marcou 7.9%, pois detecção de voz, segmentação, rascunhos progressivos e montagem final também afetam a legenda exibida. Os resultados finais nativos do Apple Speech marcaram 0.9%. Um modelo forte ainda pode perder palavras se o pipeline em tempo real cortar a fala no ponto errado; uma única porcentagem não explica todos os erros.
Latência: primeiro texto e texto final são métricas diferentes
O Apple Speech apresentou o primeiro texto após mediana de 1.14 s, contra 1.74 s no caminho Whisper ao vivo. Após o fim da fala, o final nativo da Apple chegou em 1.13 s e o Whisper em 0.58 s. O reconhecimento Whisper do clipe inteiro teve fator de tempo real mediano de 0.021×, mas essa velocidade de estilo offline não mede a primeira legenda. Uma boa experiência precisa de um rascunho legível cedo e de uma linha final confiável.
Por que o Alison Workspace usa os dois
O Alison Workspace não presume que um único reconhecedor seja sempre melhor. No macOS 26, um idioma escolhido explicitamente com recurso de fala local da Apple disponível pode usar o streaming nativo do Apple Speech. Sistemas anteriores, detecção automática, idiomas não suportados pela Apple ou recursos indisponíveis podem usar o WhisperKit local. Assim, o app mantém ampla cobertura e aproveita o streaming da Apple quando possível. Após o primeiro download do recurso ou modelo, o reconhecimento roda no Mac.
O que este benchmark não prova
Os 30 clipes são fala inglesa lida e limpa, geralmente com uma pessoa. Eles não representam todos os sotaques, microfones de reunião, salas barulhentas, músicas, vozes sobrepostas, termos técnicos ou idiomas diferentes do inglês. Traduzir este artigo não transforma o teste inglês em benchmark multilíngue. Divulgamos amostra, sistema, modelo, método e resultados separados para mostrar o escopo. Em trabalho importante, teste nomes, números, sotaques e o aplicativo real que reproduz o áudio.
Um teste de um minuto no seu Mac
Reproduza um vídeo curto ou gravação de reunião com uma voz clara. Escolha o idioma falado conhecido, confirme que o app recebe o áudio do sistema do Mac e não o ruído do microfone, e observe quando surgem as primeiras palavras úteis. Verifique um nome, um número e um termo técnico e compare a linha final com o áudio. Repita no aplicativo de reunião, navegador ou player que você realmente usa.
Perguntas frequentes
O Apple Speech é mais rápido que o Whisper no Mac?
Neste teste com 30 clipes em inglês, a mediana até o primeiro texto foi 1.14 s no Apple e 1.74 s no caminho Whisper do Alison. Hardware, idioma e áudio podem mudar o resultado.
O Whisper local é mais preciso que o Apple Speech?
O Whisper do clipe inteiro atingiu 1.9% WER, o Apple nativo 0.9% e o pipeline Whisper ao vivo 7.9%. Precisão do modelo e do produto devem ser separadas.
O reconhecimento de fala funciona offline no Mac?
Sim, após baixar o recurso de idioma da Apple ou o modelo Whisper local necessário. A instalação inicial pode exigir Internet.
Qual mecanismo o Alison Workspace usa?
Ele pode usar Apple Speech no macOS 26 quando idioma e recurso local são compatíveis, e WhisperKit local para cobertura mais ampla ou como alternativa.