RessourcenDateitranskription

Mehrsprachige Audiodateien auf dem Mac offline als Stapel transkribieren

Bereite lokale Modelle vor, wähle automatische Spracherkennung oder Sprachgruppen und prüfe und exportiere jede Aufnahme einzeln.

2026-10-04 · 7 min
Eine Reihe bunter Audiokarten führt zu separaten Transkriptionsdokumenten auf einem warmen elfenbeinfarbenen Hintergrund.

Die kurze Antwort

Um mehrere Aufnahmen in verschiedenen Sprachen auf einem Mac zu transkribieren, bereiten Sie die lokalen Erkennungsressourcen vor, fügen Sie die Dateien einer Warteschlange hinzu und wählen Sie den Umgang mit den gesprochenen Sprachen. Mit einem installierten kompatiblen Modell ist die automatische Spracherkennung hilfreich. Wenn die Sprache bekannt, die Erkennung aber unzuverlässig ist, gruppieren Sie Dateien derselben Sprache und wählen Sie diese ausdrücklich als Quellsprache aus.

Alison Workspace unterstützt Dateiwarteschlangen, mehrsprachige Erkennungsoptionen, optionale Übersetzung und Sprecherdiarisierung (Sprecherkennzeichnung). Es erfordert ein Apple-Silicon Mac, M1 oder neuer, mit macOS 15 oder höher. Nachdem die erforderlichen Ressourcen bereit sind, wird die unterstützte Dateierkennung lokal ausgeführt. Berücksichtigen Sie die Tatsache, dass die Warteschlange die Einstellungen für einen Lauf gemeinsam nutzt: Mehrere Dateien in verschiedenen Sprachen stellen nicht das gleiche Problem dar wie eine Aufnahme, bei der die Sprache wiederholt gewechselt wird.

Organisieren Sie die Dateien entsprechend der Arbeit, die Sie erledigen müssen

Angenommen, Sie haben einen englischen Vortrag, ein japanisches Interview und eine spanische Sprachaufnahme. Sie möchten für jedes Dokument ein separates Dokument in der Originalsprache und nur dort, wo es hilfreich ist, eine Übersetzung. Dies ist ein veranschaulichender Arbeitsablauf und kein Bericht über einen dreisprachigen Genauigkeitstest.

Benennen Sie die Dateien so, dass Sie sie unterscheiden können, ohne jedes Sprachprotokoll öffnen zu müssen. Überprüfen Sie den Ton, die ungefähre Länge und die Hauptsprache. Für in ein Video eingebettetes Audio benötigt die Datei weiterhin eine zugängliche, dekodierbare Audiospur; sein Bild liefert der Spracherkennung keine Worte.

Entscheiden Sie, ob Sie Quelltext, eine übersetzte Lesehilfe, Sprecherkennzeichnungen oder Untertitel benötigen. Jede Option fügt eine separate Anforderung und eine separate Überprüfungsaufgabe hinzu. Wenn Sie mit dem Originaltext beginnen, können Sie ein Sprachproblem leichter erkennen, bevor Sie eine Übersetzung hinzufügen.

Bereiten Sie Erkennungsressourcen vor, bevor Sie offline gehen

Das Erkennungsmenü bietet viele Sprachen, aber die Engine und das Modell müssen die Sprache unterstützen, die Sie verwenden möchten. Eine in einem Menü angezeigte Sprache garantiert nicht, dass jedes installierte Modell gleich gut damit zurechtkommt. Verwenden Sie ein mehrsprachiges Modell für einen Stapel, der mehrere Quellsprachen benötigt.

Die automatische Dateisprachenerkennung von Alison erfordert ein verwendbares lokales Whisper-Modell. Einige explizit ausgewählte Sprachen können die verfügbare Systemerkennung auf kompatiblen macOS-Versionen nutzen, dies ist jedoch kein automatischer Sprachersatz. Folgen Sie der Bereitschaftsmeldung der App, anstatt davon auszugehen, dass ein von einem anderen Workflow verwendetes Modell hier bereit ist.

Laden Sie Ressourcen herunter und bereiten Sie sie vor, während Sie verbunden sind. Probieren Sie dann eine kurze Datei mit den beabsichtigten Einstellungen aus, bevor Sie sich auf eine Offline-Sitzung verlassen. Die ersten Vorbereitungen können einige Zeit in Anspruch nehmen. Kein Model-Ready-Check kann die Qualität eines ungewohnten Akzents oder einer lauten Aufnahme nachweisen.

Wählen Sie automatische Erkennung oder sprachbasierte Gruppen

Bei Dateien, die jeweils eine eindeutige Hauptsprache haben, kann durch die automatische Erkennung das manuelle Sortieren jedes Elements vermieden werden. Es kann immer noch falsch sein, insbesondere bei Stille, Musik, sehr wenig Sprache oder einem ungewöhnlichen Anfang. Überprüfen Sie das Ergebnis für jede Datei, anstatt die gesamte Warteschlange zu akzeptieren, da das erste Transkript richtig aussieht.

Wenn Sie die Sprachen kennen, besteht ein kontrollierterer Ansatz darin, die englischen Dateien mit ausgewählter englischer Sprache auszuführen, dann die japanischen Dateien mit ausgewählter japanischer Sprache usw. Die Warteschlange verwendet für diesen Lauf eine gemeinsame Erkennungsauswahl. In diesem Handbuch wird keine separate Spracheinstellung beschrieben, die an jede Datei in der Warteschlange angehängt wird.

Starten Sie einen gemischtsprachigen Stapel nicht mit einer festen Sprache, es sei denn, Sie möchten diese Sprache tatsächlich für alle Dateien. Wenn die Erkennung falsch aussieht, überprüfen Sie zunächst den Ton und die Sprache. Das Ändern der Zielübersetzungssprache kann ein Quellsprachtranskript, das mit der falschen Erkennungseinstellung erstellt wurde, nicht reparieren.

Starten Sie eine überschaubare Charge

Beginnen Sie mit einem kleinen Satz, damit Sie die Einstellungen, die Ressourcenbereitschaft und die Ausgabe überprüfen können, bevor Sie eine größere Sammlung verarbeiten. Mehrere Dateien werden zur Verarbeitung in die Warteschlange gestellt. Dies ist kein Versprechen, dass alle Dateien gleichzeitig ausgeführt werden oder mit einer festen Geschwindigkeit abgeschlossen werden.

  1. Wählen Sie die Dateien aus, die Sie lokal lesen können, und bestätigen Sie deren Namen, Dauer und erwartete gesprochene Sprachen.
  2. Öffnen Sie das Dateitranskriptionsfenster und fügen Sie mehrere Dateien hinzu oder ziehen Sie sie in die Warteschlange.
  3. Wählen Sie die automatische Spracherkennung mit einem fertigen mehrsprachigen Modell oder gruppieren Sie Dateien nach Sprache und wählen Sie eine explizite Quellsprache.
  4. Lassen Sie die Übersetzung für Dokumente in der Originalsprache aus oder wählen Sie ein unterstütztes Übersetzungsziel für die Ausführung aus und bereiten Sie dessen Ressourcen vor.
  5. Aktivieren Sie die Sprechertagebücher (Sprecherkennzeichnung) nur, wenn dies sinnvoll ist, und bereiten Sie die entsprechenden Ressourcen vor. Verwenden Sie eine erwartete Anzahl von Rednern nur, wenn sie zu den Dateien in diesem Lauf passt.
  6. Starten Sie die Warteschlange und überprüfen Sie dann den Status und den generierten Text jeder Datei, bevor Sie das Dokument exportieren.

Überprüfen Sie zunächst jede abgelehnte Datei als Medienproblem. Eine Datei ohne Audiospur oder unlesbare Kodierung wird nicht durch das Hinzufügen weiterer Sprachen zu den Modelleinstellungen behoben.

Halten Sie Erkennungs-, Übersetzungs- und Sprechereinstellungen unterschiedlich

Die Erkennung erzeugt Wörter in der gesprochenen Sprache. Durch die Übersetzung werden diese Wörter in eine andere Lesesprache umgewandelt. Die Sprechertrennung gruppiert Text nach Stimme. Sie können zusammen verwendet werden, aber der Erfolg in einem führt nicht zum Erfolg in den anderen.

Beispielsweise kann es sein, dass eine korrekt erkannte japanische Passage immer noch ein nicht verfügbares Übersetzungsziel oder eine falsche Sprecherzuordnung aufweist. Halten Sie das Original sichtbar, wenn Sie ein übersetztes Dokument überprüfen. Überprüfen Sie Namen, Zahlen und wichtige negative Aussagen anhand der Aufzeichnung, insbesondere wenn die Übersetzung flüssiger erscheint als der Ausgangstext.

Übersetzungspaare hängen von den Ressourcen ab, die auf dem tatsächlichen Mac verfügbar sind. Eine mehrsprachige Erkennung bedeutet nicht, dass jede Ausgangssprache in jede Zielsprache übersetzt werden kann. Wenn keine Übersetzung verfügbar ist, können Sie dennoch ein Transkript in der Ausgangssprache verwenden und überprüfen, anstatt es fälschlicherweise als Übersetzung zu kennzeichnen.

Gehen Sie anders mit einer Aufnahme um, bei der sich die Sprache ändert

Ein Ordner mit überwiegend einsprachigen Dateien ist ein guter Grund, über eine automatische Erkennung nachzudenken. Ein Interview mit wiederholtem Wechsel zwischen Japanisch und Englisch erfordert besondere Aufmerksamkeit. Die automatische Erkennung stellt nicht sicher, dass jeder Schalter innerhalb der Aufzeichnung korrekt erkannt wurde.

Überprüfen Sie Passagen rund um die Sprachänderungen. Wenn das Ergebnis durchweg eine Sprache verliert, sollten Sie erwägen, geeignete Auszüge separat mit der gewünschten Sprache zu bearbeiten und sie mit Ihren normalen Medienbearbeitungstools vorzubereiten. Bewahren Sie das Original auf und denken Sie daran, dass ein Transkript eines Auszugs die Zeitleiste dieses Auszugs verwendet.

Es besteht kein Anspruch auf einwandfreie Mischsprachenerkennung oder gleiche Qualität in allen unterstützten Sprachen. Hintergrundmusik, regionale Sprache, unbekannte Namen und unterschiedliche Aufnahmebedingungen beeinflussen ebenfalls, was korrigiert werden muss.

Überprüfen Sie den Abschluss und versuchen Sie es erst erneut, nachdem Sie das Problem diagnostiziert haben

Die Testversion der Dateitranskription von Alison bietet derzeit eine kumulative Audiodauer von 60 Minuten, unabhängig vom Live-Hören. Die Warteschlange verwendet die verbleibende Menge der Reihe nach. Spätere Dateien erhalten möglicherweise nur die verbleibende Zeit oder keine; Schauen Sie sich die erwarteten und verarbeiteten Längen an, anstatt davon auszugehen, dass jede hinzugefügte Datei vollständig fertiggestellt wird.

Ein Teilergebnis ist kein vollständiges Transkript einer langen Aufnahme. Fehlgeschlagene oder abgebrochene Aufträge können wiederholt werden, nachdem Sie die Ursache überprüft haben. Wenn eine Datei in der falschen Sprache verarbeitet wurde, wählen Sie für einen weiteren Lauf die richtige Sprache aus; Wenn Ressourcen fehlen, bereiten Sie diese zuerst vor. Überprüfen Sie die Menge, bevor Sie eine längere Charge wiederholen.

Wenn Sie den vollständigen Dateizugriff entsperren, führen Sie die betroffene Datei erneut aus. Durch die Änderung des Zugriffs wird das unbearbeitete Ende eines früheren Dokuments nicht automatisch aufgefüllt. Halten Sie die Beziehung zwischen der Datei, ihrem Status und ihrem neuesten Sprachprotokoll klar.

Überprüfen und exportieren Sie jedes Dokument gezielt

Verwenden Sie Suche und Wiedergabe, um wichtige Passagen in jedem Ergebnis zu überprüfen. Das Bearbeiten eines Sprachprotokolls bedeutet nicht, dass die anderen Dokumente in der Warteschlange überprüft wurden. Geben Sie den exportierten Dateien eindeutige Namen und halten Sie die Originalaufzeichnungen zur späteren Überprüfung bereit.

Das aktuelle Exportmenü für Transkripte bietet TXT, Markdown, CSV, PDF, SRT und VTT. Wählen Sie Originaltext, Übersetzung (sofern verfügbar) oder beides; Die Optionen für Sprecher und Dokument-Zeitstempel hängen von der Aufzeichnung und dem Format ab. Exportieren Sie jeden Datensatz über sein Menü, anstatt davon auszugehen, dass das Hinzufügen eines Stapels einen Massenexport mit einem Klick ermöglicht.

Die lokale Erkennung beschreibt, wo die Verarbeitung stattfindet. Es steuert nicht, was ein synchronisierter Exportordner, ein freigegebenes Laufwerk oder ein Backup später mit den Dateien macht. Wählen Sie, wo Sie Ihre Aufzeichnungen und Dokumente aufbewahren. Der nächste Schritt ist eine kleine Warteschlange, deren Sprachen und Ausgaben Sie vor der Skalierung überprüfen können.

Offizielle Referenzen geprüft am 4. Oktober 2026

WhisperKit: on-device speech-to-text and model choices
Apple: file-based media reading
FluidAudio: local speaker diarization

Häufig gestellte Fragen

Können Aufnahmen in verschiedenen Sprachen in eine Warteschlange gestellt werden?

Ja, aber der Lauf teilt die Spracheinstellungen. Verwenden Sie die automatische Erkennung mit einem bereits kompatiblen mehrsprachigen Modell oder gruppieren Sie Dateien nach Sprache und führen Sie diese Gruppen mit einer expliziten Quellsprache aus.

Ist für die automatische Spracherkennung ein Modell-Download erforderlich?

Es benötigt ein verwendbares lokales Whisper-Modell. Bereiten Sie dieses Modell vor einer Offline-Sitzung vor. Eine System-Engine für eine explizit ausgewählte Sprache ist kein automatischer Sprach-Fallback.

Wird es den Wechsel zweier Sprachen innerhalb einer Datei zuverlässig bewältigen?

Gehen Sie davon nicht aus. Überprüfen Sie die Umschaltpassagen und ziehen Sie separat erstellte Auszüge mit den richtigen Spracheinstellungen in Betracht, wenn eine Sprache wiederholt fehlt.

Erhalte ich beim Transkribieren auf Japanisch automatisch einen englischen Text?

Nein, Spracherkennung und Übersetzung sind getrennte Optionen. Wählen Sie Englisch als unterstütztes Übersetzungsziel aus und bereiten Sie das erforderliche Paar vor, wenn Sie eine englische Lesehilfe wünschen.

Kann ich Dateien nach der Vorbereitung ohne Internet transkribieren?

Die unterstützte Erkennung wird lokal ausgeführt, sobald die erforderlichen Ressourcen nutzbar sind. Bereiten Sie auch alle optionalen Übersetzungs- und Sprecherressourcen vor und bestätigen Sie den beabsichtigten Arbeitsablauf, bevor Sie offline gehen.

Sind Sprecherkennzeichnungen für eine Charge verfügbar?

Die Sprechertrennung kann für den Lauf aktiviert werden, wenn seine Ressourcen bereit sind. Überprüfen Sie jede Datei einzeln; Sprechernummern belegen nicht die Identität derselben Person in mehreren Dateien.

Umfasst die Batch-Transkription den automatischen Massenexport?

Die Warteschlange verarbeitet mehrere Dateien. Exportieren Sie jedes Transkript über dessen Menü; diese Anleitung verspricht keinen Export der gesamten Warteschlange mit einem Klick.

Weiterführende Anleitungen