Macで異なる言語の音声ファイルをオフラインで一括文字起こし
ローカルモデルを準備し、自動言語検出または言語別の処理を選んで、録音ごとに確認・書き出す方法を紹介します。
2026-10-04 · 7 min
まず結論
Macで異なる言語の録音を複数文字起こしするには、ローカルの認識リソースを準備し、ファイルをキューに追加して、音声の言語をどう扱うか決めます。対応モデルをインストール済みなら、自動言語検出が役立ちます。言語が分かっていて自動検出が不安定な場合は、同じ言語のファイルをまとめ、元の音声言語を明示して処理してください。
Alison Workspace は、ファイル キュー、多言語認識の選択、オプションの翻訳、および話者分離 (話者のラベル付け) をサポートしています。 Apple シリコン Mac、M1 以降、および macOS 15 以降が必要です。必要なリソースの準備ができたら、サポートされているファイル認識がローカルで実行されます。キューが実行の設定を共有するという事実を念頭に置いて計画してください。異なる言語の複数のファイルは、言語を繰り返し切り替える 1 つの記録と同じ問題ではありません。
実行する必要があるジョブに基づいてファイルを整理する
英語の講義、日本語のインタビュー、スペイン語の音声録音があるとします。それぞれに別個の元の言語の文書が必要で、役立つ場合にのみ翻訳が必要です。これはワークフローの説明であり、3 言語の正確性テストのレポートではありません。
文字起こしテキストをすべて開かなくてもファイルを区別できるように、ファイルに名前を付けておきます。音声、おおよその長さ、主な言語を確認してください。ビデオに埋め込まれたオーディオの場合、ファイルにはアクセス可能でデコード可能なオーディオ トラックが必要です。その画像は音声認識に単語を提供しません。
ソース テキスト、翻訳された読み物補助、スピーカー ラベル、または字幕が必要かどうかを決定します。各オプションでは、個別の要件と個別のレビュー タスクが追加されます。元のテキストから始めると、翻訳を追加する前に言語の問題を特定しやすくなります。
オフラインにする前に認識リソースを準備する
認識メニューには多くの言語が用意されていますが、エンジンとモデルは使用する言語をサポートしている必要があります。メニューに表示される言語は、インストールされているすべてのモデルが同じように適切に処理できることを保証するものではありません。複数のソース言語を必要とするバッチには、多言語モデルを使用します。
Alison の自動ファイル言語検出には、使用可能なローカル Whisper モデルが必要です。明示的に選択された一部の言語は、互換性のある macOS バージョンで利用可能なシステム認識を使用できますが、それは自動言語の代替ではありません。別のワークフローで使用されるモデルがここで準備ができていると仮定するのではなく、アプリの準備完了メッセージに従ってください。
接続中にリソースをダウンロードして準備し、オフライン セッションに依存する前に、目的の設定で短いファイルを試してください。最初の準備には時間がかかる場合があります。モデル対応のチェックでは、なじみのないアクセントやノイズの多い録音の品質を証明することはできません。
自動検出または言語ベースのグループを選択します
それぞれのファイルに明確なメイン言語がある場合、自動検出により、すべての項目を手動で並べ替える必要がなくなります。特に沈黙、音楽、スピーチがほとんどない場合、または異常な冒頭の場合は、依然として間違っている可能性があります。最初の文字起こしテキストは正しいと思われるため、キュー全体を受け入れるのではなく、ファイルごとに結果を検査します。
言語を知っている場合は、英語ファイルを英語を選択して実行し、次に日本語ファイルを日本語を選択して実行するという、より制御されたアプローチが可能です。キューは、その実行に対して共有認識の選択肢を使用します。このガイドでは、キューに入れられたすべてのファイルに付加される個別の言語設定については説明しません。
実際にすべてのファイルにその言語が必要な場合を除き、固定言語で混合言語バッチを開始しないでください。認識がおかしい場合は、まず音声と言語を確認してください。ターゲット翻訳言語を変更しても、間違った認識設定で生成されたソース文字起こしテキストを修復することはできません。
管理可能なバッチを開始する
より大きなコレクションを処理する前に、設定、リソースの準備状況、出力を確認できるように、小さなセットから始めます。複数のファイルが処理のためにキューに入れられます。これは、すべてのファイルが同時に実行されたり、一定の速度で終了したりすることを保証するものではありません。
- ローカルで読み取ることができるファイルを選択し、その名前、長さ、および予想される音声言語を確認します。
- ファイル文字起こしウィンドウを開いていくつかのファイルを追加するか、ファイルをキューにドラッグします。
- 準備ができている多言語モデルを使用して自動言語検出を選択するか、ファイルを言語ごとにグループ化し、明示的なソース言語を選択します。
- 元の言語のドキュメントの翻訳をオフのままにするか、サポートされている翻訳ターゲットを 1 つ選択して実行し、そのリソースを準備します。
- 有用な場合にのみ話者分離 を有効にし、そのリソースを準備します。その実行内のファイルに適合する場合にのみ、予想される発言者数を使用してください。
- キューを開始し、ドキュメントをエクスポートする前に各ファイルのステータスと生成されたテキストを確認します。
まず、メディアの問題として拒否されたファイルを確認してください。オーディオ トラックがないファイル、または読み取り不可能なエンコードが含まれているファイルは、モデル設定に言語を追加しても修正されません。
認識、翻訳、話者設定を明確に保つ
認識により、話された言語で単語が生成されます。翻訳はそれらの単語を別の読み取り言語に変換します。話者分離によりテキストを音声ごとにグループ化します。これらは併用できますが、一方の成功が他方の成功を確立するわけではありません。
たとえば、正しく認識された日本語の文章であっても、利用できない翻訳対象や話者の割り当てが間違っている可能性があります。翻訳された文書をレビューするときは、オリジナルを表示したままにしてください。特に翻訳が原文よりスムーズに見える場合は、名前、数字、および重要な否定的な発言を録音と照らし合わせて確認します。
変換ペアは、実際の Mac で利用可能なリソースに依存します。多言語認識エンジンは、すべてのソース言語をすべてのターゲット言語に翻訳できることを意味するものではありません。翻訳が利用できない場合でも、翻訳として誤ったラベルを付けることなく、原文言語のスピーチ記録を使用して確認することができます。
言語が変わる録音を別の方法で処理する
単一言語ファイルがほとんどのフォルダーは、自動検出を検討する十分な理由になります。日本語と英語を繰り返し切り替える面接には、別の注意が必要です。自動検出では、録音内のすべてのスイッチが正しく認識されたかどうかは確認されません。
言語の変更に関する文章を確認します。結果で一貫して 1 つの言語が失われる場合は、通常のメディア編集ツールを使用して、選択した目的の言語で適切な抜粋を個別に処理して準備することを検討してください。オリジナルを保存し、抜粋の文字起こしテキストにはその抜粋のタイムラインが使用されることを覚えておいてください。
ここでは、混合言語が完璧に認識されるとか、サポートされているすべての言語で同等の品質が保証されるなどという主張はありません。 BGM、地域の音声、聞き慣れない名前、録音条件の違いなども、修正が必要な内容に影響を与えます。
完了を確認し、問題を診断した後にのみ再試行してください
Alison のファイル文字起こし トライアルでは現在、ライブ リスニングとは別に 60 分の累積オーディオ時間が提供されます。キューは残りの許容量を順番に使用します。後のファイルは残り時間のみを受け取るか、何も受け取らない場合があります。追加されたすべてのファイルが完全に終了すると仮定するのではなく、予想される長さと処理された長さに注目してください。
部分的な結果は、長い録音の完全な文字起こしテキストではありません。失敗またはキャンセルされたジョブは、原因を確認してから再試行できます。ファイルが間違った言語で処理された場合は、別の実行で正しい言語を選択してください。リソースが不足している場合は、最初にリソースを準備します。長いバッチを繰り返す前に、許容値を確認してください。
ファイル全体へのアクセスのロックを解除した場合は、影響を受けるファイルを再度実行します。アクセス権を変更しても、以前のドキュメントの未処理の末尾が自動的に埋められるわけではありません。ファイル、そのステータス、最新のスピーチ記録の間の関係を明確に保ちます。
各ドキュメントを意図的にレビューしてエクスポートする
検索と再生を使用して、各結果の重要な部分を調べます。 1 つのスピーチ記録を編集しても、キュー内の他の文書がレビューされたことを意味するわけではありません。エクスポートされたファイルに個別の名前を付け、後で確認できるように元の記録を保存しておきます。
現在の文字起こしテキストのエクスポート メニューには、TXT、Markdown、CSV、PDF、SRT、および VTT が用意されています。オリジナルのテキスト、可能な場合は翻訳、またはその両方を選択します。スピーカーとドキュメントのタイムスタンプのオプションは、文字起こし文書と形式によって異なります。バッチを追加するとワンクリックで一括エクスポートできると考えるのではなく、メニューから各文字起こし文書をエクスポートします。
ローカル認識は、処理が行われる場所を記述します。同期されたエクスポート フォルダー、共有ドライブ、またはバックアップが後でファイルに対してどのような処理を行うかは制御されません。録音やドキュメントを保管する場所を選択します。次のステップは、スケールアップする前に言語と出力を確認できる小さなキューです。
公式参照は 2026 年 10 月 4 日に確認済み
WhisperKit: on-device speech-to-text and model choices
Apple: file-based media reading
FluidAudio: local speaker diarization
よくある質問
異なる言語の録音を 1 つのキューに入れることはできますか?
はい、ただし実行では言語設定が共有されます。互換性のある多言語モデルで自動検出を使用するか、ファイルを言語ごとにグループ化し、それらのグループを明示的なソース言語で実行します。
自動言語検出にはモデルのダウンロードが必要ですか?
使用可能なローカル Whisper モデルが必要です。オフライン セッションの前にそのモデルを準備します。明示的に選択された 1 つの言語のシステム エンジンは、自動言語フォールバックではありません。
1 つのファイル内で 2 つの言語の切り替えを確実に処理できますか?
そんなことは考えないでください。 1 つの言語が繰り返しミスされる場合は、切り替わるパッセージを確認し、正しい言語設定で別途作成された抜粋を検討してください。
日本語で書き写すと自動的に英語のテキストが得られますか?
いいえ、認識と翻訳は別の選択です。英語の読解補助が必要な場合は、サポートされている翻訳ターゲットとして英語を選択し、必要なペアを準備します。
準備後にインターネットなしでファイルを転記できますか?
サポートされている認識は、必要なリソースが使用可能になるとローカルで実行されます。オプションの翻訳リソースやスピーカー リソースも準備し、オフラインにする前に意図したワークフローを確認してください。
スピーカーラベルはバッチで利用できますか?
リソースの準備ができたら、実行に対してスピーカー分離を有効にすることができます。各ファイルを個別に確認します。発言者番号は、ファイル全体で同じ人物の ID を確立するものではありません。
バッチ転写には自動一括エクスポートが含まれますか?
キューは複数のファイルを処理します。書き出しは各文字起こし文書のメニューで行います。このガイドは、キュー全体をワンクリックで書き出せるとは説明していません。