ConteúdoTranscrição de arquivos

Como transcrever uma entrevista com identificação de falantes no Mac

Adicione rótulos de falante a uma entrevista, confira quem disse cada trecho, corrija as atribuições e exporte a conversa revisada.

2026-10-04 · 7 min
Dois participantes da entrevista ficam frente a frente, com fitas de voz azuis e terracota levando a parágrafos alternados de transcrição de fala.

A resposta curta

Para transcrever uma entrevista e distinguir as pessoas que estão falando, use a transcrição de arquivo com a diarização do falante (rotulagem do falante) habilitada. Ele adiciona rótulos de falante a partes do texto reconhecido, ajudando você a revisar uma pergunta e sua resposta sem tratar toda a gravação como uma só voz. Prepare os recursos de reconhecimento e palestrante antes de começar e depois ouça novamente para verificar as tarefas.

Alison Workspace oferece suporte a esse fluxo de trabalho para arquivos de áudio e vídeo legíveis em um Apple Silicon Mac, M1 ou mais recente, executando macOS 15 ou posterior. Você pode selecionar um número esperado de pessoas falando, revisar a transcrição gerado, alterar a atribuição do falante de um parágrafo, renomear rótulos e exportar o texto. Comece com uma troca clara entre o entrevistador e o convidado, em vez de julgar o resultado pela música ou por várias pessoas conversando.

O que os rótulos de falante indicam

O reconhecimento de fala pergunta o que foi dito. A diarização do falante pergunta qual voz falou durante uma parte da gravação. Uma transcrição pode ter palavras corretas com o falante errado ou um rótulo de falante correto anexado a uma frase reconhecida incorretamente. Revise ambas as dimensões.

Os rótulos iniciais distinguem as vozes dentro daquela gravação. Eles não fornecem automaticamente nomes verificados nem comprovam que uma pessoa em outro arquivo seja a mesma. As características da voz ajudam a agrupar os trechos por falante; confirmar a identidade real é uma tarefa separada.

A separação dos falantes neste guia significa texto rotulado. Isso não significa exportar um arquivo de áudio isolado para cada participante ou remover a voz de uma pessoa de uma troca sobreposta. Decida se você precisa de um registro de conversa legível ou de faixas de áudio separadas antes de escolher um fluxo de trabalho.

Prepare uma gravação que você possa revisar

Use a melhor gravação original disponível, com fala fácil de ouvir. Evite fazer uma cópia compactada simplesmente para reduzir seu tamanho se o original já for importado. Um convidado que fala baixo, música de fundo e vozes vindas de diferentes microfones podem aumentar o trabalho necessário para verificar o resultado.

Ouça primeiro uma breve conversa. Observe quantas pessoas realmente falam, incluindo uma introdução ou uma pergunta do produtor, se presente. Saber que a entrevista principal tem dois participantes não prova que cada parte do arquivo tenha apenas duas vozes.

Se já estiverem disponíveis gravações separadas dos participantes, guarde-as como referência. O fluxo de trabalho atual rotula o arquivo importado; ele não descreve a fusão automática de faixas separadas de participantes em uma conversa sincronizada. Certifique-se de usar gravações que você possa transcrever e reter.

Prepare a separação de falantes e o número esperado

A separação de falantes conta com recursos além do reconhecimento de fala. Na janela de transcrição de arquivo do Alison, habilite a opção de falante e siga o prompt de preparação do modelo. Ativar uma configuração sem recursos utilizáveis ​​não é prova de que o registro final conterá rótulos.

O menu de contagem oferece estimativa automática e contagens conhecidas de 2 a 6. Para uma entrevista genuinamente com duas pessoas, escolher 2 informa ao processo quantas vozes agrupar. Se não tiver certeza, use automático e inspecione o resultado. O menu de contagem conhecida é uma faixa de configuração, não um limite medido do número que o modo automático pode suportar.

Uma contagem é uma orientação, não uma garantia. Se uma terceira voz aparecer, ou se uma pessoa mudar o microfone ou o estilo de falar, uma contagem fixa incorreta poderá agrupar mal as passagens. Verifique a gravação completa em vez de presumir que a abertura estabelece todos os falantes.

Transcreva o arquivo da entrevista

Escolha o idioma de reconhecimento da fala real. Se precisar de uma tradução, selecione seu destino de forma independente e confirme se o par necessário está disponível. Você pode deixar a tradução desativada enquanto verifica os nomes e as atribuições dos palestrantes no idioma original.

  1. Adicione o arquivo de áudio ou vídeo da entrevista à fila de transcrição.
  2. Verifique a duração do arquivo aceito e selecione o idioma falado.
  3. Preparar os recursos de reconhecimento necessários; a detecção automática de idioma precisa de um modelo local compatível.
  4. Habilite a diarização do falante (rotulagem do falante) e prepare os recursos de falante solicitados.
  5. Escolha um número conhecido de pessoas falando quando se justificar, ou deixe no automático e depois inicie a transcrição.
  6. Abra o resultado e reproduza trechos de cada participante antes de aceitar os rótulos.

Deixe o status do arquivo informar se o processamento foi concluído. Se o resultado for parcial, revise apenas a parte processada e resolva o restante antes de apresentá-la como uma entrevista completa.

Corrija as atribuições antes de adicionar nomes

Localize uma frase clara de cada voz e reproduza seu áudio. Estabeleça qual rótulo inicial corresponde ao entrevistador e qual corresponde ao convidado. Verifique também as passagens posteriores: uma etiqueta de abertura correta não prova que todas as mudanças de falante foram tratadas corretamente.

Quando um parágrafo for atribuído à pessoa errada, abra o modo de edição da transcrição e escolha o falante correto entre os já existentes. Corrija as palavras separadamente, se necessário. Renomear um rótulo altera seu nome em todo o documento; não é a forma adequada de corrigir apenas um parágrafo com atribuição errada.

Respostas muito curtas e interrupções merecem atenção. Um segmento reconhecido pode abranger uma mudança de falante, e as informações de temporização disponíveis afetam a precisão com que ele pode ser dividido. Não presuma que cada breve “sim” ou observação sobreposta receberá seu próprio rótulo perfeito.

Renomeie os rótulos após confirmar as vozes

Substitua rótulos genéricos por nomes ou funções confirmadas, como Entrevistador e Convidado. As funções são úteis quando você não precisa de nomes pessoais. Mantenha a ortografia consistente com o material que acompanha a entrevista, em vez de adivinhar a partir de uma introdução reconhecida automaticamente.

Os controles de nome do falante atualizam os rótulos usados pelo registro e suas exportações. Repita uma passagem nomeada para confirmar que uma mudança global de nome não associou o nome do convidado ao entrevistador. Quando uma voz real tiver sido dividida em vários rótulos, verifique suas passagens antes de atribuir o mesmo nome.

Renomear uma rótulo registra sua decisão editorial. Não é autenticação de voz e não cria um perfil de identidade automático para arquivos futuros. Revise os rótulos de uma nova gravação de forma independente.

Exporte uma conversa fácil de conferir

Escolha TXT, Markdown, PDF ou CSV para um documento legível ou reutilizável. Onde existirem rótulos de falantes, habilite a opção de incluir falantes; mantenha carimbos de data e hora se o leitor precisar retornar à gravação. As opções de exportação original, traduzida e bilíngue dependem do texto disponível no registro.

SRT e VTT também estão disponíveis para um fluxo de trabalho de legendas e sempre incluem o eixo de tempo necessário. Verifique a exibição pretendida antes de compartilhar um arquivo de legenda: um documento de entrevista útil e uma faixa de legenda de vídeo confortável precisam de decisões de formatação diferentes.

Ouça novamente nomes, citações, números, compromissos e atribuições incertas antes de compartilhar. Um rascunho identificado pelo falante ajuda você a encontrar essas passagens; isso não torna confiável uma cotação não verificada.

Investigue problemas nos rótulos

Se nenhum rótulo aparecer, verifique se a diarização do falante (rotulagem do falante) foi habilitada e seus recursos estavam prontos. O reconhecimento pode produzir texto, enquanto o estágio de falante opcional não fornece atribuições utilizáveis. Um resultado de texto bem-sucedido e uma rotulagem bem-sucedida do falante não têm o mesmo status.

Se os rótulos estiverem errados, revise a configuração de contagem e o áudio. Vozes semelhantes, fala distante, alterações no som do microfone, ruído de fundo e conversas sobrepostas podem dificultar o agrupamento. Use passagens claras como âncoras, corrija o que você pode verificar e deixe visíveis as atribuições incertas em vez de inventar certezas.

Depois que os recursos estiverem prontos, o reconhecimento suportado e o trabalho do falante serão executados localmente em seu Mac. Preserve o arquivo de origem para revisão e escolha um destino intencional para a transcrição de fala exportada. A próxima etapa útil é uma troca clara de entrevistas com rótulos que você verificou pessoalmente.

Referências oficiais verificadas em 4 de outubro de 2026

Microsoft: diarization and generic speaker identifiers
Amazon Transcribe: speaker labels and timestamps
FluidAudio: on-device speaker diarization framework

Perguntas frequentes

Devo escolher automático ou 2 falantes para uma entrevista para duas pessoas?

Escolha 2 quando exatamente duas pessoas falam no arquivo. Se as introduções ou interrupções adicionarem outras vozes, use uma contagem que reflita a gravação ou tente o automático e revise as atribuições.

A diarização do falante (rotulagem do falante) identifica automaticamente os nomes das pessoas?

Não, ele atribui rótulos de voz na gravação. Confirme você mesmo as pessoas ou funções e renomeie os rótulos na transcrição.

Posso corrigir quem disse um parágrafo?

Sim. O editor de transcrição de fala permite alterar a atribuição de um parágrafo a um falante existente. Renomear um falante altera esse rótulo em todo o documento.

Por que uma pessoa recebeu dois rótulos?

O agrupamento de vozes pode ser afetado por fala curta, ruído, microfones diferentes ou alterações na entrega. Repita as passagens relevantes antes de decidir se os rótulos pertencem à mesma pessoa.

Posso exportar a voz isolada de cada pessoa?

Este recurso rotula o texto da transcrição da fala. Ele não fornece uma exportação de trilha de áudio separada para cada falante nem remove vozes sobrepostas.

Os nomes dos palestrantes aparecerão no documento exportado?

Ative Incluir falantes quando o registro tiver rótulos. Os nomes confirmados são usados ​​na exportação. Verifique o documento escolhido ou formato de legenda antes de compartilhá-lo.

O mesmo número de falante identificará a mesma pessoa em outro arquivo?

Não, trate os rótulos de cada gravação de forma independente. O fluxo de trabalho descrito aqui não estabelece uma identidade de voz entre arquivos.

Guias relacionados