Transcrire par lots des fichiers audio multilingues sur Mac hors ligne
Préparez les modèles locaux, choisissez la détection automatique ou des groupes par langue, puis vérifiez et exportez chaque enregistrement.
2026-10-04 · 7 min
La réponse courte
Pour transcrire plusieurs enregistrements dans différentes langues sur Mac, préparez les ressources de reconnaissance locales, ajoutez les fichiers à une file d’attente et décidez comment gérer leurs langues. La détection automatique est utile lorsqu’un modèle compatible est installé. Si vous connaissez la langue mais que la détection est peu fiable, regroupez les fichiers de même langue et traitez chaque groupe en sélectionnant explicitement sa langue source.
Alison Workspace prend en charge les files d'attente de fichiers, les choix de reconnaissance multilingue, la traduction facultative et la diarisation des locuteurs (étiquetage des locuteurs). Il nécessite un Apple-silicon Mac, M1 ou plus récent, avec macOS 15 ou version ultérieure. Une fois les ressources requises prêtes, la reconnaissance de fichiers prise en charge s'exécute localement. Tenez compte du fait que la file d'attente partage les paramètres d'une exécution : plusieurs fichiers dans des langues différentes ne posent pas le même problème qu'un enregistrement qui change de langue à plusieurs reprises.
Organisez les fichiers autour du travail que vous devez effectuer
Supposons que vous ayez une conférence en anglais, une interview en japonais et un enregistrement vocal en espagnol. Vous souhaitez un document distinct dans la langue originale pour chacun, avec une traduction uniquement lorsque cela est utile. Il s'agit d'un flux de travail illustratif et non d'un rapport d'un test de précision en trois langues.
Conservez le nom des fichiers afin de pouvoir les distinguer sans ouvrir chaque transcription. Vérifiez leur son, leur durée approximative et leur langue principale. Pour l'audio intégré dans une vidéo, le fichier a toujours besoin d'une piste audio accessible et décodable ; son image ne fournit pas de mots à la reconnaissance vocale.
Décidez si vous avez besoin du texte source, d'une aide à la lecture traduite, d'étiquettes de locuteur ou de sous-titres. Chaque option ajoute une exigence distincte et une tâche de révision distincte. Commencer par le texte original peut faciliter l’identification d’un problème linguistique avant d’ajouter la traduction.
Préparez les ressources de reconnaissance avant de vous déconnecter
Le menu de reconnaissance propose de nombreuses langues, mais le moteur et le modèle doivent prendre en charge la langue que vous comptez utiliser. Une langue apparaissant dans un menu ne garantit pas que tous les modèles installés peuvent la gérer aussi bien. Utilisez un modèle multilingue pour un lot nécessitant plusieurs langues sources.
La détection automatique du langue des fichiers d’Alison nécessite un modèle Whisper local utilisable. Certaines langues explicitement sélectionnées peuvent utiliser la reconnaissance système disponible sur les versions macOS compatibles, mais cela ne constitue pas un substitut automatique de langue. Suivez le message de préparation de l'application au lieu de supposer qu'un modèle utilisé par un autre flux de travail est prêt ici.
Téléchargez et préparez les ressources lorsque vous êtes connecté, puis essayez un court fichier avec les paramètres prévus avant de vous fier à une session hors ligne. La première préparation peut prendre du temps. Aucune vérification prête à l'emploi ne peut prouver la qualité d'un accent inconnu ou d'un enregistrement bruyant.
Choisissez la détection automatique ou les groupes basés sur la langue
Pour les fichiers ayant chacun une langue principale claire, la détection automatique peut éviter de trier manuellement chaque élément. Cela peut toujours être faux, notamment en cas de silence, de musique, de très peu de paroles ou d'une ouverture inhabituelle. Inspectez le résultat de chaque fichier plutôt que d'accepter toute la file d'attente, car la première transcription semble correcte.
Si vous connaissez les langues, une approche plus contrôlée consiste à exécuter les fichiers anglais avec l'anglais sélectionné, puis les fichiers japonais avec le japonais sélectionné, et ainsi de suite. La file d'attente utilise un choix de reconnaissance partagé pour cette exécution ; ce guide ne décrit pas un paramètre de langue distinct attaché à chaque fichier en file d'attente.
Ne démarrez pas un lot multilingue avec une langue fixe, sauf si vous souhaitez réellement cette langue pour tous les fichiers. Lorsque la reconnaissance semble incorrecte, vérifiez d'abord l'audio et la langue. La modification de la langue de traduction cible ne peut pas réparer une transcription source produite avec un mauvais paramètre de reconnaissance.
Démarrer un lot gérable
Commencez par un petit ensemble afin de pouvoir confirmer les paramètres, la disponibilité des ressources et la sortie avant de traiter une collection plus grande. Plusieurs fichiers sont mis en file d'attente pour le traitement ; ce n'est pas une promesse que tous les fichiers s'exécuteront simultanément ou se termineront à une vitesse fixe.
- Choisissez les fichiers que vous pouvez lire localement et confirmez leurs noms, durées et langues parlées attendues.
- Ouvrez la fenêtre de transcription de fichiers et ajoutez plusieurs fichiers, ou faites-les glisser dans sa file d'attente.
- Sélectionnez la détection automatique de la langue avec un modèle multilingue prêt, ou regroupez les fichiers par langue et choisissez une langue source explicite.
- Laissez la traduction désactivée pour les documents dans la langue d'origine ou choisissez une cible de traduction prise en charge pour l'exécution et préparez ses ressources.
- Activer la diarisation des locuteurs (étiquetage des locuteurs) uniquement lorsque cela est utile et préparer ses ressources ; utilisez un nombre attendu de personnes parlant uniquement si cela correspond aux fichiers de cette exécution.
- Démarrez la file d'attente, puis examinez l'état de chaque fichier et le texte généré avant d'exporter son document.
Vérifiez d'abord tout fichier rejeté en tant que problème multimédia. Un fichier sans piste audio ou avec un encodage illisible ne sera pas corrigé en ajoutant plus de langues aux paramètres du modèle.
Gardez les paramètres de reconnaissance, de traduction et de haut-parleur distincts
La reconnaissance produit des mots dans la langue parlée. La traduction transforme ces mots dans une autre langue de lecture. La séparation des haut-parleurs regroupe le texte par la voix. Ils peuvent être utilisés ensemble, mais le succès dans l’un n’entraîne pas le succès dans les autres.
Par exemple, un passage japonais correctement reconnu peut toujours avoir une cible de traduction indisponible ou une mauvaise affectation de locuteur. Gardez l'original visible lors de la révision d'un document traduit. Vérifiez les noms, les chiffres et les déclarations négatives importantes par rapport à l'enregistrement, en particulier lorsque la traduction semble plus fluide que le texte source.
Les paires de traduction dépendent des ressources disponibles sur le Mac réel. Un outil de reconnaissance multilingue n'implique pas que chaque langue source puisse être traduite dans chaque langue cible. Si la traduction n’est pas disponible, vous pouvez toujours utiliser et réviser une transcription dans la langue source plutôt que de la qualifier à tort de traduction.
Gérer différemment un enregistrement qui change de langue
Un dossier contenant principalement des fichiers monolingues est une bonne raison d’envisager une détection automatique. Une interview avec des passages répétés entre le japonais et l’anglais nécessite une attention particulière. La détection automatique n'établit pas que chaque commutateur à l'intérieur de l'enregistrement a été correctement reconnu.
Passez en revue les passages autour des changements de langue. Si le résultat perd systématiquement une langue, envisagez de traiter les extraits appropriés séparément avec la langue prévue sélectionnée, en utilisant vos outils d'édition multimédia habituels pour les préparer. Conservez l'original et rappelez-vous qu'une transcription de discours d'un extrait utilise la chronologie de cet extrait.
Il n’y a aucune prétention ici à une reconnaissance parfaite des langues mixtes ou à une qualité égale dans toutes les langues prises en charge. La musique de fond, les discours régionaux, les noms inconnus et les différentes conditions d'enregistrement affectent également ce qui doit être corrigé.
Vérifiez l'achèvement et réessayez seulement après avoir diagnostiqué le problème.
L'essai de transcription de fichiers d’Alison fournit actuellement 60 minutes de durée audio cumulée, distincte de l'écoute en direct. La file d'attente utilise l'allocation restante dans l'ordre. Les fichiers ultérieurs peuvent recevoir uniquement le temps restant ou aucun ; regardez les longueurs attendues et traitées plutôt que de supposer que chaque fichier ajouté se terminera complètement.
Un résultat partiel n’est pas une transcription complète d’un long enregistrement. Les tâches ayant échoué ou annulées peuvent être réessayées après avoir vérifié la cause. Si un fichier a été traité dans la mauvaise langue, sélectionnez la bonne langue pour une autre exécution ; si des ressources manquent, préparez-les d’abord. Vérifiez l'allocation avant de répéter un long lot.
Si vous déverrouillez l'accès au fichier complet, exécutez à nouveau le fichier concerné. La modification de l'accès ne remplit pas automatiquement la fin non traitée d'un document antérieur. Gardez clairement la relation entre le fichier, son statut et sa dernière transcription.
Examinez et exportez intentionnellement chaque document
Utilisez la recherche et la lecture pour inspecter les passages importants de chaque résultat. La modification d'une transcription de discours ne signifie pas que les autres documents de la file d'attente ont été examinés. Donnez des noms distincts aux fichiers exportés et conservez les enregistrements originaux disponibles pour une vérification ultérieure.
Le menu d'exportation actuel des transcriptions vocales propose TXT, Markdown, CSV, PDF, SRT et VTT. Choisissez le texte original, la traduction si disponible, ou les deux ; Les options du locuteur et de l’horodatage du document dépendent de l’enregistrement et du format. Exportez chaque enregistrement via son menu plutôt que de supposer que l'ajout d'un lot permet une exportation groupée en un clic.
La reconnaissance locale décrit l'endroit où le traitement a lieu. Il ne contrôle pas ce qu'un dossier d'exportation synchronisé, un lecteur partagé ou une sauvegarde fait ultérieurement avec les fichiers. Choisissez où vous conservez vos enregistrements et documents. L'étape suivante est une petite file d'attente dont vous pouvez vérifier les langues et les sorties avant de procéder à une mise à l'échelle.
Références officielles vérifiées le 4 octobre 2026
WhisperKit: on-device speech-to-text and model choices
Apple: file-based media reading
FluidAudio: local speaker diarization
Questions fréquemment posées
Les enregistrements dans différentes langues peuvent-ils être placés dans une seule file d'attente ?
Oui, mais l'exécution partage les paramètres de langue. Utilisez la détection automatique avec un modèle multilingue déjà compatible, ou regroupez les fichiers par langue et exécutez ces groupes avec une langue source explicite.
La détection automatique de la langue nécessite-t-elle un téléchargement de modèle ?
Il nécessite un modèle Whisper local utilisable. Préparez ce modèle avant une session hors ligne. Un moteur système pour une langue explicitement sélectionnée ne constitue pas une solution de secours automatique.
Gérera-t-il de manière fiable le changement de deux langues dans un seul fichier ?
Ne présumez pas cela. Passez en revue les passages de changement et considérez les extraits préparés séparément avec les paramètres de langue corrects lorsqu'une langue est manquée à plusieurs reprises.
La transcription en japonais me donne-t-elle automatiquement du texte en anglais ?
Non, la reconnaissance et la traduction sont des choix distincts. Sélectionnez l'anglais comme cible de traduction prise en charge et préparez la paire requise si vous souhaitez une aide à la lecture en anglais.
Puis-je transcrire des fichiers sans Internet après préparation ?
La reconnaissance prise en charge s'exécute localement une fois que les ressources requises sont utilisables. Préparez également toutes les ressources facultatives de traduction et de conférencier, et confirmez le flux de travail prévu avant de vous déconnecter.
Les étiquettes de locuteur sont-elles disponibles pour un lot ?
La séparation des haut-parleurs peut être activée pour l'exécution lorsque ses ressources sont prêtes. Examiner chaque dossier indépendamment ; les numéros de locuteurs n'établissent pas l'identité de la même personne dans les fichiers.
La transcription par lots inclut-elle l’exportation automatique en masse ?
La file d’attente traite plusieurs fichiers. Exportez chaque transcription depuis son menu ; ce guide ne promet pas l’exportation de toute la file en un clic.