RecursosReconocimiento de voz

Apple Speech frente a Whisper local en Mac: prueba de precisión y latencia

Probamos Apple Speech y un modelo WhisperKit base local con los mismos 30 audios etiquetados en inglés. Comparamos WER, tiempo hasta el primer texto y espera de finalización.

2026-08-30 · 9 min
Alison WorkspaceEN → ES

Respuesta breve

En este Mac con Apple silicon, Apple Speech mostró el primer texto antes, mientras que Whisper local presentó una diferencia entre la precisión del modelo y la del flujo de subtítulos en directo. En 30 clips limpios en inglés de LibriSpeech, Apple Speech obtuvo un WER de 0.9%, el flujo Whisper en directo de Alison Workspace 7.9% y el reconocimiento Whisper del clip completo 1.9%. La mediana hasta el primer texto fue 1.14 s con Apple y 1.74 s con Whisper en directo. Son resultados de esta prueba, no de todos los hablantes, idiomas, Mac o grabaciones.

Cómo realizamos la prueba

La prueba se ejecutó localmente el 30 de agosto de 2026 en un Mac con Apple silicon y macOS 26.5.2. Los dos motores recibieron los mismos 30 clips etiquetados de LibriSpeech test-clean, convertidos a audio mono de 16 kHz. Se enviaron fragmentos de 100 ms a velocidad real y se añadieron 0,8 segundos de silencio idéntico al final. Los modelos y recursos de Apple se prepararon antes de medir. La precisión se calculó con la tasa de error de palabras; la latencia midió el primer texto no vacío y el tiempo desde el fin del habla hasta el texto definitivo.

Precisión: motor y flujo en directo no son lo mismo

Whisper sobre el clip completo obtuvo 1.9% WER y representa el límite de precisión del modelo cuando recibe toda la frase. El flujo Whisper del producto obtuvo 7.9%, porque la detección de voz, la segmentación, los borradores progresivos y el ensamblado final también cambian lo que llega a la barra. Los finales nativos de Apple Speech obtuvieron 0.9%. Un modelo potente puede perder palabras si un flujo en tiempo real corta la frase en un punto incorrecto; un único porcentaje no explica todos los errores.

Latencia: primer texto y texto final son métricas distintas

Apple Speech mostró el primer texto tras una mediana de 1.14 s, frente a 1.74 s en el flujo Whisper. Al terminar el habla, el final nativo de Apple llegó tras 1.13 s y el de Whisper tras 0.58 s. El reconocimiento Whisper del clip completo tuvo un factor de tiempo real mediano de 0.021×, pero esa velocidad de tipo offline no mide la aparición del primer subtítulo. Una buena experiencia necesita un borrador legible pronto y una línea final fiable.

Por qué Alison Workspace utiliza los dos motores

Alison Workspace no presupone que un único reconocedor sea mejor siempre. En macOS 26, un idioma elegido explícitamente y con recurso de voz de Apple disponible puede usar la ruta nativa de Apple Speech. Sistemas anteriores, detección automática, idiomas no compatibles con Apple o recursos no disponibles pueden usar WhisperKit local. Así se conserva una cobertura amplia y se aprovecha el streaming de Apple cuando existe. Tras descargar una vez el recurso de idioma o el modelo Whisper, el reconocimiento se ejecuta en el Mac.

Lo que esta prueba no demuestra

Los 30 clips son lectura limpia en inglés, normalmente de un solo hablante. No representan todos los acentos, micrófonos de reunión, salas ruidosas, música, voces superpuestas, términos especializados ni idiomas distintos del inglés. Traducir este artículo no convierte la prueba inglesa en un benchmark multilingüe. Publicamos el tamaño de muestra, sistema, modelo, método de entrada y resultados separados para mostrar el alcance. Para trabajo importante, prueba nombres, números, acentos y la aplicación de audio real.

Una prueba de un minuto en tu Mac

Reproduce un vídeo corto o una grabación de reunión con una sola voz clara. Selecciona el idioma hablado conocido, confirma que la app recibe el audio del sistema del Mac y no el ruido del micrófono, y observa cuándo aparecen las primeras palabras útiles. Comprueba un nombre, un número y un término técnico, y compara la línea final con el audio. Repite en la app de reuniones, navegador o reproductor que uses de verdad.

Preguntas frecuentes

¿Apple Speech es más rápido que Whisper en Mac?

En esta prueba de 30 clips en inglés, la mediana hasta el primer texto fue 1.14 s con Apple y 1.74 s con el flujo Whisper de Alison. El hardware, idioma, audio y ajustes pueden cambiar el resultado.

¿Whisper local es más preciso que Apple Speech?

Whisper sobre el clip completo alcanzó 1.9% WER, Apple nativo 0.9% y el flujo Whisper en directo 7.9%. Hay que separar precisión del modelo y precisión final del producto.

¿El reconocimiento de voz funciona sin conexión en Mac?

Sí, después de descargar el recurso de idioma de Apple o el modelo Whisper local necesario. La instalación inicial puede requerir Internet.

¿Qué motor usa Alison Workspace?

Puede usar Apple Speech en macOS 26 cuando el idioma y recurso local son compatibles, y WhisperKit local para ampliar la cobertura o como alternativa.