MacでMP4動画を文字起こしする方法:アップロードせずに処理
読み取れるMP4をMacに読み込み、音声と照合して修正した後、文書や字幕ファイルとして書き出す方法を紹介します。
2026-10-04 · 7 min
まず結論
MP4 ビデオを Mac 上のテキストに変換するには、ビデオのオーディオ トラックを読み取るファイル文字起こし ワークフローを使用します。最初にライブ キャプション ウィンドウでビデオ全体を再生したり、読み取り可能な MP4 を手動で音声のみのファイルに変換したりする必要はありません。ファイルには、アプリがデコードできるオーディオ トラックが含まれている必要があります。無音の画面録画では、文字起こしテキストを作成できません。
Alison Workspace を使用すると、オーディオ ファイルとビデオ ファイルをインポートし、音声を認識し、結果のテキストを録音と照らし合わせて確認し、ドキュメント ファイルまたは字幕ファイルをエクスポートできます。必要な認識リソースがインストールされると、Mac でファイル認識作業が実行されます。 1 つの短い文章から始めて、言語とテキストを確認し、必要な録音を処理します。
ドキュメントが必要な場合はファイルの転写を選択してください
ライブキャプションは、再生中に音声を追跡するのに役立ちます。ファイル文字起こしテキストには、保存された録音内の位置に関連付けられたテキストが提供されるため、文を再確認したり、名前を修正したり、エクスポート形式を選択したりすることができます。これらは Alison Workspace 内の異なるワークフローです。編集またはテキストとして保存したい MP4 のファイル文字起こしウィンドウを使用します。
たとえば、講義の録音には、途中で役立つ説明が含まれる場合があります。ファイル文字起こしテキストを使用すると、メモに追加する前に説明を検索し、音声に戻って用語を修正できます。これはワークフローの例であり、精度や速度のベンチマークではありません。
録音所有者がレビュー済みの文字起こしテキストまたは字幕トラックをすでに提供している場合は、最初にそれを検査します。特に名前、専門用語、準備された資料などの作業を節約できる可能性があります。自動認識により提供されるのは、講演者が承認した文言ではなく草案です。
MP4内部の音声を確認してください
MP4 はメディアコンテナであり、その中の音声を保証するものではありません。重要な質問は、録音に音声が含まれているかどうか、オーディオ トラックが含まれているかどうか、そしてそのトラックが Mac でデコードできるかどうかです。同じ拡張子を持つ 2 つのファイルは、エンコードや条件が異なるため、異なる動作をする可能性があります。
Alison のファイル リーダーはプレーン オーディオを処理し、MP4 や MOV などのビデオ コンテナからオーディオを読み取ります。オーディオ トラックの欠落、読み取り不能なファイル、またはデコードの失敗が報告される場合があります。音声を読み取れないという問題がある場合は、認識言語を繰り返し変更するのではなく、元のファイルを確認してください。
ビデオに複数の音声トラックが含まれている場合は、どの音声コンテンツが文字起こしテキストに含まれるかを確認します。現在のリーダーは最初のオーディオ トラックを取得します。このガイドでは、組み込みのトラック選択メニューについては説明しません。それが意図したトラックではない場合は、通常のメディア ワークフローを使用して適切なオーディオ ファイルを準備し、そのファイルをインポートします。元の録音を上書きしないでください。
ビデオをインポートして設定を準備する
Apple シリコン Mac、M1 以降、および macOS 15 以降を使用してください。利用可能な認識エンジンと言語リソースは、システムのバージョンによって異なる場合があります。長いファイルを開始する前に、アプリによって要求されたリソースを準備します。
- Alison Workspace のファイル文字起こし ウィンドウを開き、[ファイルの追加] を選択するか、ローカル ビデオをキューにドラッグします。
- ファイルが受け入れられ、表示された長さが妥当であることを確認します。
- 録音で話される言語を選択します。自動言語検出は、必要なモデルの準備ができている場合にのみ使用してください。
- 元の文言だけが必要な場合は、翻訳をオフのままにします。必要に応じて翻訳対象を別途選択してください。
- さまざまな音声の識別が重要な場合は、話者分離 を有効にし、要求されたリソースを準備します。
- 文字起こしを開始し、生成されたテキストを開いてソース音声と照らし合わせて確認します。
ファイルのインポートでは、選択したメディアが読み取られます。これはシステム再生キャプチャ セッションではありません。 MP4 をスピーカー経由でルーティングしたり、認識のためにプレーヤーを実行したままにしたりする必要はありません。音声の再生は、その後も文字起こしテキストを確認するのに役立ちます。
テキストを使用する前に確認してください
冒頭、途中からの一節、そして実際に加工した最後の部分を確認してください。これにより、個々の文を推敲するのに時間を費やす前に、間違った言語設定、異なるオーディオ トラック、または部分的な結果に気づくことができます。
文字起こしテキストの再生および検索ツールを使用して、不確実な単語を検査します。名前、数字、略語、否定、および技術的な指示には特別な注意が必要です。 BGM や音声が重なると、流暢な文章が不正確になる可能性があります。読みやすい段落は、認識が正確であるという証拠にはなりません。
ドキュメントは編集できます。録音および信頼できる付属資料を使用して原文を修正します。翻訳もリクエストした場合は、一方のフィールドを変更するともう一方のフィールドが正しいことが自動的に証明されると考えるのではなく、翻訳が正しい意味を表現していることを確認してください。
テキストドキュメントまたは字幕のエクスポートを選択してください
閲覧やメモを取る場合は、素材の使用方法に応じて、TXT、Markdown、PDF、または CSV をお選びください。エクスポート オプションを使用すると、元のテキスト、翻訳されたテキスト(利用可能な場合)、またはその両方を選択し、文字起こし文書に含まれるタイムスタンプと話者ラベルを含めることができます。
字幕の場合は、SRT または VTT を使用します。ファイル文字起こしのタイムスタンプは、別のライブ リスニング セッションからのタイムスタンプとは異なり、メディア タイムラインを参照します。 SRT および VTT は、ドキュメントのタイムスタンプをオフにしても、必要なタイミング情報を常に保持します。
目的のプレーヤーまたはエディターで字幕ファイルをプレビューします。文の境界、タイミング、行の長さ、修正した単語を確認します。生成された字幕ファイルは、完成した字幕トラックの開始点となります。エクスポートだけでは、テキストが出版可能になるわけではありません。
部分的な結果と再試行を理解する
ファイル文字起こしのトライアルでは、現在 60 分の累積音声時間が提供されています。ライブ視聴手当とは別です。キューは、使用可能なファイル許容量を順番に消費します。ファイルが必要な時間よりも残り時間が少ない場合、結果は先頭のみをカバーし、部分的としてマークされる可能性があります。
文字起こしテキストが完了したと判断する前に、処理された長さとステータスを検査します。失敗またはキャンセルされたジョブは再試行できますが、最初に原因と残量を確認してください。ファイル全体へのアクセスのロックを解除した場合は、ファイルを再転記してください。欠けている末尾は、単に以前の部分ドキュメントが開いているという理由だけで表示されるわけではありません。
読み取り不可能なファイルの場合は、元のファイルがまだ正常に開き、予期したサウンドが含まれているかどうかを確認してください。受け入れられた音声で品質の悪いテキストが生成される場合は、話し言葉、リソースの準備状況、および録音品質を確認してください。これらは別の問題であり、別の修正が必要です。
ソースを後で再生できるようにしておきます
ローカル処理により、録音を文字起こし Web サイトに送信する必要性が減ります。認識リソースの初期ダウンロードが必要な場合があります。翻訳ターゲットまたは話者分離モデルには、独自の準備が必要な場合があります。レコグナイザーをダウンロードしても、すべてのオプション機能が準備されるわけではありません。
音声付きのテキストを再度確認したい場合は、元のメディアを安定した場所に保管してください。保存された文字起こしテキストは、MP4 の代替コピーではありません。ソースが移動されているか利用できない場合、文字起こしテキスト ツールは適切なファイルを再度関連付けることができ、長さをチェックして間違った録音の接続を回避します。
エクスポートしたドキュメントを保存する場所を検討してください。同期フォルダーまたは共有フォルダーに配置されたローカルの文字起こしテキストは、そのフォルダーのサービスによって配布される場合があります。特に社内での講義や面接など、目的に合わせて目的地を選択してください。
必要な結果から次のステップを決定する
編集可能な MP4 文字起こしテキスト、検索可能な参考資料、またはドラフト字幕ファイルのファイル トランスクリプトを使用します。現在の再生を単に追跡することが目的の場合は、ライブ キャプションを使用します。いくつかの音声については、話者ラベルを確認してください。異なる言語での録音のグループの場合は、開始する前にキューと言語の設定を計画してください。
実際的な最初のステップは、明瞭な音声を含む 1 つの読みやすいビデオです。言語と生成された短い文章を確認し、完全な結果を確認して、実際に必要な形式をエクスポートします。
公式参照は 2026 年 10 月 4 日に確認済み
Apple: reading media from a file-based asset
Apple: reading an individual media track
WhisperKit: on-device speech-to-text framework
よくある質問
転写する前に MP4 を MP3 に変換する必要がありますか?
MP4 にアプリが読み取れるオーディオ トラックがある場合はそうではありません。直接インポートすると、個別の変換が不要になります。エンコードが読めない場合やオーディオ トラックが間違っている場合は、最初に適切なオーディオ ファイルを準備する必要がある場合があります。
文字起こし中にビデオ全体を再生する必要がありますか?
いいえ、ファイル文字起こしは、リアルタイム プレーヤーの出力を聞くのではなく、選択したメディアを読み取ります。後で再生してテキストを確認することができます。
無音の MP4 またはスライド録音から文字起こしテキストを作成できますか?
音声認識には音声が必要です。無音のスライド テキストを読み取ったり、ビデオ画像から単語を抽出したりすることはありません。
ビデオ相対タイムスタンプを含む SRT ファイルをエクスポートできますか?
はい。ファイル文字起こしワークフローでは、メディア相対のタイミングで SRT および VTT をエクスポートできます。ファイルを使用する前に、目的のプレーヤーで生成されたテキストとタイミングを確認してください。
ビデオ文字起こしテキストに話者ラベルを追加できますか?
ファイルを実行する前に、話者分離 を有効にし、そのリソースを準備します。結果として得られるラベルは確認する必要があり、誰が発言しているかを確認した後で名前を変更できます。
私のビデオの冒頭だけが文字起こしされるのはなぜですか?
文字起こし文書が部分的としてマークされているかどうか、および利用可能なファイル文字起こしの許容時間が録音よりも短かったかどうかを確認してください。また、ジョブのステータスがキャンセルまたは失敗していないかどうかも検査します。
MP4 拡張子を持つすべてのファイルはサポートされていますか?
いいえ、ファイルには読み取り可能なオーディオ トラックと有効なメディア データが必要です。拡張子だけでなく、そのエンコードと条件も重要です。