RecursosTranscripción de archivos

Cómo transcribir una entrevista con etiquetas de hablante en Mac

Añade etiquetas de hablante a una entrevista, comprueba quién dijo cada pasaje, corrige las asignaciones y exporta la conversación revisada.

2026-10-04 · 7 min
Dos participantes de la entrevista se enfrentan, con cintas de voz azules y terracota que conducen a párrafos alternos de la transcripción.

La respuesta breve

Para transcribir una entrevista y distinguir a las personas que hablan, utilice la transcripción de archivos con la diarización de los hablantes (etiquetado de los hablantes) habilitada. Agrega etiquetas de hablante a partes del texto reconocido, lo que le ayuda a revisar una pregunta y su respuesta sin tratar toda la grabación como una sola voz. Prepare los recursos de reconocimiento y del hablante antes de comenzar, luego escuche nuevamente para verificar las tareas.

Alison Workspace admite este flujo de trabajo para archivos de audio y video legibles en un Apple-silicon Mac, M1 o posterior, que ejecute macOS 15 o posterior. Puede seleccionar una cantidad esperada de personas que hablarán, revisar la transcripción generado, cambiar la asignación del hablante de un párrafo, cambiar el nombre de las etiquetas y exportar el texto. Comience con un intercambio claro entre el entrevistador y el invitado en lugar de juzgar el resultado por la música o varias personas hablando juntas.

Qué indican las etiquetas de hablante

El reconocimiento de voz pregunta qué se dijo. La diarización del hablante pregunta qué voz habló durante una parte de la grabación. Una transcripción puede tener palabras correctas con el hablante equivocado o una etiqueta del hablante correcto adjunta a una oración reconocida incorrectamente. Revise ambas dimensiones.

Las etiquetas iniciales distinguen las voces de esa grabación. No aportan automáticamente nombres verificados ni demuestran que una persona de otro archivo sea la misma. Las características de la voz ayudan a agrupar los fragmentos por hablante; comprobar la identidad real es una tarea distinta.

La separación de hablantes en esta guía significa texto etiquetado. No significa exportar un archivo de audio aislado para cada participante o eliminar la voz de una persona de un intercambio superpuesto. Decida si necesita un registro de conversación legible o pistas de audio separadas antes de elegir un flujo de trabajo.

Empiece con una grabación que pueda revisar

Utilice la mejor grabación original disponible, con voz fácil de escuchar. Evite hacer una copia comprimida simplemente para reducir su tamaño si el original ya se importa. Un invitado tranquilo, música de fondo y voces provenientes de diferentes micrófonos pueden aumentar el trabajo necesario para comprobar el resultado.

Escuche primero un breve intercambio. Tenga en cuenta cuántas personas hablan realmente, incluida una introducción o la pregunta de un productor, si está presente. Saber que la entrevista principal tiene dos participantes no prueba que cada parte del expediente tenga sólo dos voces.

Si ya hay grabaciones de participantes separadas disponibles, consérvelas como referencia. El flujo de trabajo actual etiqueta el archivo importado; no describe la fusión automática de pistas de participantes independientes en una conversación sincronizada. Asegúrese de utilizar grabaciones que pueda transcribir y conservar.

Prepare la identificación de hablantes y el número esperado

La separación de hablantes tiene recursos además del reconocimiento de voz. En la ventana de transcripción de archivos de Alison, habilite la opción de identificación de hablantes y siga las indicaciones de preparación del modelo. Activar una configuración sin recursos utilizables no es prueba de que el registro final contendrá etiquetas.

El menú de conteo ofrece estimación automática y conteos conocidos del 2 al 6. Para una entrevista genuinamente de dos personas, elegir 2 le indica al proceso cuántas voces agrupar. Si no está seguro, utilice el automático e inspeccione el resultado. El menú de conteo conocido es un rango de configuración, no un límite medido en el número que el modo automático puede manejar.

Un recuento es una guía, no una garantía. Si aparece una tercera voz, o si una persona cambia de micrófono o de estilo de hablar, un conteo fijo incorrecto puede agrupar mal los pasajes. Verifique la grabación completa en lugar de asumir que la apertura establece a cada hablante.

Transcriba el archivo de la entrevista

Elija el idioma de reconocimiento para el discurso real. Si necesita una traducción, seleccione su destino de forma independiente y confirme que el par requerido esté disponible. Puede dejar desactivada la traducción mientras verifica los nombres y las asignaciones de los hablantes en el idioma original.

  1. Agregue el archivo de audio o video de la entrevista a la cola de transcripción.
  2. Verifique la duración del archivo aceptado y seleccione el idioma hablado.
  3. Preparar los recursos de reconocimiento necesarios; La detección automática de idioma necesita un modelo local compatible.
  4. Habilite el diarización (etiquetado de hablantes) y prepare los recursos de hablantes solicitados.
  5. Elija un número conocido de personas que hablen cuando esté justificado, o déjelo en automático y luego comience la transcripción.
  6. Abra el resultado y reproduzca los pasajes de cada participante antes de aceptar las etiquetas.

Deje que el estado del archivo le indique si se completó el procesamiento. Si el resultado es parcial, revise sólo la parte procesada y ocúpese del resto faltante antes de presentarla como una entrevista completa.

Corrija las asignaciones antes de añadir nombres

Localiza una frase clara de cada voz y reproduce su audio. Establecer qué etiqueta inicial corresponde al entrevistador y cuál corresponde al invitado. Consulte también los pasajes posteriores: una etiqueta de apertura correcta no prueba que todos los cambios de hablante se hayan manejado correctamente.

Cuando un párrafo se asigna incorrectamente, ingrese al modo de edición de la transcripción y elija el hablante existente correcto para ese párrafo. Corrija las palabras por separado si es necesario. Se aplica un cambio de nombre a la etiqueta a lo largo del registro; no es la herramienta adecuada para mover sólo un párrafo mal etiquetado.

Las respuestas muy breves y las interrupciones merecen atención. Un segmento reconocido puede abarcar un cambio de hablante y la información de sincronización disponible afecta la precisión con la que se puede dividir. No asuma que cada breve “sí” o comentario superpuesto recibirá su propia etiqueta perfecta.

Renombre las etiquetas tras confirmar las voces

Reemplace las etiquetas genéricas con nombres o roles confirmados, como Entrevistador e Invitado. Los roles son útiles cuando no necesita nombres personales. Mantenga la ortografía coherente con el material que acompaña a la entrevista en lugar de adivinar a partir de una introducción reconocida automáticamente.

Los controles de nombre de locutor actualizan las etiquetas utilizadas por el registro y sus exportaciones. Vuelva a reproducir un pasaje con nombre para confirmar que un cambio de nombre global no adjuntó el nombre del invitado al entrevistador. Cuando una voz real se haya dividido en varias etiquetas, revise sus pasajes antes de asignar el mismo nombre.

Cambiar el nombre de una etiqueta registra su decisión editorial. No es autenticación de voz y no crea un perfil de identidad automático para archivos futuros. Revisa las etiquetas de una nueva grabación de forma independiente.

Exporte una conversación fácil de comprobar

Elija TXT, Markdown, PDF o CSV para obtener un documento legible o reutilizable. Cuando existan etiquetas de hablantes, habilite la opción para incluir hablantes; mantenga marcas de tiempo si el lector necesita volver a la grabación. Las opciones de exportación original, traducida y bilingüe dependen del texto disponible en el registro.

SRT y VTT también están disponibles para un flujo de trabajo de subtítulos y siempre incluyen el eje de tiempo requerido. Verifique la visualización deseada antes de compartir un archivo de subtítulos: un documento de entrevista útil y una pista de subtítulos de video cómoda necesitan decisiones de formato diferentes.

Escuche nuevamente nombres, citas, números, compromisos y atribuciones inciertas antes de compartir. Un borrador etiquetado por el hablante le ayudará a encontrar estos pasajes; no hace que una cotización no verificada sea confiable.

Revise los problemas de las etiquetas

Si no aparecen etiquetas, verifique que el registro de hablantes (etiquetado de hablantes) esté habilitado y que sus recursos estén listos. El reconocimiento puede producir texto, mientras que la etapa de altavoz opcional no proporciona asignaciones utilizables. Un resultado de texto exitoso y un etiquetado de hablante exitoso no son el mismo estado.

Si las etiquetas están incorrectas, revise la configuración del conteo y el audio. Voces similares, habla distante, cambios en el sonido del micrófono, ruido de fondo y conversaciones superpuestas pueden dificultar la agrupación. Utilice pasajes claros como anclas, corrija lo que pueda verificar y deje visible la atribución incierta en lugar de inventar la certeza.

Una vez que los recursos estén listos, el trabajo de reconocimiento y hablante admitido se ejecuta localmente en su Mac. Conserve el archivo fuente para su revisión y elija un destino intencional para la transcripción exportado. El siguiente paso útil es un intercambio de entrevistas claro con etiquetas que hayas comprobado personalmente.

Referencias oficiales verificadas el 4 de octubre de 2026.

Microsoft: diarization and generic speaker identifiers
Amazon Transcribe: speaker labels and timestamps
FluidAudio: on-device speaker diarization framework

Preguntas frecuentes

¿Debo elegir automático o 2 parlantes para una entrevista de dos personas?

Elija 2 cuando exactamente dos personas hablen en el archivo. Si las presentaciones o interrupciones añaden otras voces, utilice un recuento que refleje la grabación o intente hacerlo automáticamente y revise las asignaciones.

¿La diarización de los hablantes (etiquetado de los hablantes) identifica automáticamente los nombres de las personas?

No, asigna etiquetas de voz dentro de la grabación. Confirme usted mismo las personas o los roles y luego cambie el nombre de las etiquetas en la transcripción.

¿Puedo corregir quién dijo un párrafo?

Sí. El editor de transcripcións le permite cambiar la asignación de un párrafo a un hablante existente. En cambio, cambiar el nombre de un hablante cambia esa etiqueta a lo largo del registro.

¿Por qué una persona recibió dos etiquetas?

La agrupación de voces puede verse afectada por discursos breves, ruido, diferentes micrófonos o cambios en la entrega. Vuelva a reproducir los pasajes relevantes antes de decidir si las etiquetas pertenecen a la misma persona.

¿Puedo exportar la voz aislada de cada persona?

Esta función etiqueta el texto de la transcripción de voz. No proporciona una exportación de pistas de audio separada para cada hablante ni elimina voces superpuestas.

¿Aparecerán los nombres de los hablantes en el documento exportado?

Habilite Incluir hablantes cuando el registro tenga etiquetas. Los nombres confirmados se utilizan en la exportación. Comprueba el documento elegido o el formato de subtítulos antes de compartirlo.

¿El mismo número de altavoz identificará a la misma persona en otro archivo?

No, trate las etiquetas de cada grabación de forma independiente. El flujo de trabajo que se describe aquí no establece una identidad de voz entre archivos.

Guías relacionadas