리소스파일 전사

Mac에서 MP4 동영상을 업로드 없이 텍스트로 변환하는 방법

읽을 수 있는 MP4를 Mac으로 가져와 음성 전사를 검토한 후 문서나 자막 파일로 내보내세요. 녹화 파일을 업로드할 필요가 없습니다.

2026-10-04 · 7 min
종이 필름 스트립은 오디오 파형이 되고 진한 청록색 배경에 전사문 시트가 겹쳐집니다.

먼저 핵심 답변

MP4 비디오를 Mac의 텍스트로 변환하려면 비디오의 오디오 트랙을 읽는 파일 전사 작업 흐름을 사용하십시오. 먼저 라이브 캡션 창을 통해 전체 비디오를 재생하거나 읽을 수 있는 MP4를 수동으로 오디오 전용 파일로 변환할 필요가 없습니다. 파일에는 앱이 디코딩할 수 있는 오디오 트랙이 포함되어 있어야 합니다. 무성 화면 녹화에서는 음성 음성 사본을 생성할 수 없습니다.

Alison Workspace를 사용하면 오디오 및 비디오 파일을 가져오고, 음성을 인식하고, 녹음 내용과 결과 텍스트를 검토하고, 문서 또는 자막 파일을 내보낼 수 있습니다. 필요한 인식 리소스가 설치된 후 Mac에서 파일 인식 작업이 실행됩니다. 하나의 짧은 구절로 시작하여 언어와 텍스트를 확인한 다음 필요한 녹음을 처리하십시오.

문서가 필요할 때 파일 전사를 선택하세요

라이브 캡션을 사용하면 소리가 재생되는 동안 소리를 따라갈 수 있습니다. 파일 전사문은 저장된 녹음의 위치와 관련된 텍스트를 제공하므로 문장을 다시 방문하고, 이름을 수정하고, 내보내기 형식을 선택할 수 있습니다. 이는 Alison Workspace 내부의 다양한 워크플로우입니다. 편집하거나 텍스트로 유지하려는 MP4에 대한 파일 기록 창을 사용하십시오.

예를 들어, 강의 녹음 중간에 유용한 설명이 포함될 수 있습니다. 파일 전사문을 사용하면 설명을 검색하고 오디오로 돌아가서 노트에 추가하기 전에 용어를 수정할 수 있습니다. 이는 정확도나 속도 벤치마크가 아닌 작업흐름 예시입니다.

녹음 소유자가 이미 검토한 전사문이나 자막 트랙을 제공한 경우 먼저 이를 검사하세요. 특히 이름, 전문 어휘 또는 준비된 자료에 대한 작업을 줄일 수 있습니다. 자동 인식은 발표자가 승인한 문구가 아닌 초안을 제공합니다.

MP4 내부 오디오 확인

MP4는 미디어 컨테이너이며 내부 사운드에 대한 보증은 아닙니다. 중요한 질문은 녹음에 음성이 있는지, 오디오 트랙이 있는지, Mac에서 해당 트랙을 디코딩할 수 있는지 여부입니다. 동일한 확장자를 가진 두 파일은 인코딩이나 조건이 다르기 때문에 다르게 동작할 수 있습니다.

Alison의 파일 판독기는 일반 오디오를 처리하고 MP4 및 MOV와 같은 비디오 컨테이너에서 오디오를 읽습니다. 누락된 오디오 트랙, 읽을 수 없는 파일 또는 디코딩 실패를 보고할 수 있습니다. 오디오를 읽을 수 없는 문제가 있는 경우 인식 언어를 반복적으로 변경하지 말고 원본 파일을 확인하십시오.

비디오에 여러 오디오 트랙이 포함된 경우 어떤 음성 콘텐츠가 전사문에 도달하는지 확인하세요. 현재 리더는 첫 번째 오디오 트랙을 사용합니다. 이 가이드에서는 내장된 트랙 선택 메뉴에 대해 설명하지 않습니다. 의도한 트랙이 아닌 경우 일반적인 미디어 작업 흐름을 사용하여 적합한 오디오 파일을 준비한 다음 해당 파일을 가져옵니다. 원본 녹음을 덮어쓰지 마십시오.

비디오 가져오기 및 설정 준비

macOS 15 이상과 함께 Apple 실리콘 Mac, M1 이상을 사용하십시오. 사용 가능한 인식 엔진 및 언어 리소스는 시스템 버전에 따라 다를 수 있습니다. 긴 파일을 시작하기 전에 앱에서 요청한 리소스를 준비하세요.

  1. Alison Workspace의 파일 전사 창을 열고 파일 추가를 선택하거나 로컬 비디오를 대기열로 드래그합니다.
  2. 파일이 승인되었는지, 표시된 지속 시간이 적절한지 확인하세요.
  3. 녹음에서 사용되는 언어를 선택하세요. 필요한 모델이 준비된 경우에만 자동 언어 감지를 사용하세요.
  4. 원래 문구만 필요한 경우 번역을 해제해 두세요. 필요한 경우 번역 대상을 별도로 선택하세요.
  5. 다양한 음성을 식별하는 것이 중요한 경우 화자 분할(화자 라벨링)을 활성화하고 요청된 리소스를 준비합니다.
  6. 전사를 시작한 다음 생성된 텍스트를 열고 소스 오디오와 비교하여 검토합니다.

파일 가져오기는 선택한 미디어를 읽습니다. 시스템 재생 캡처 세션이 아닙니다. 스피커를 통해 MP4를 라우팅하거나 인식을 위해 플레이어를 실행 상태로 둘 필요가 없습니다. 오디오 재생은 나중에 전사문을 확인하는 데 유용합니다.

사용하기 전에 텍스트를 검토하세요.

처음부터 중간까지의 한 구절, 실제 처리된 마지막 부분을 확인해보세요. 이를 통해 개별 문장을 다듬는 데 시간을 보내기 전에 잘못된 언어 설정, 다른 오디오 트랙 또는 부분적인 결과를 확인할 수 있습니다.

불확실한 단어를 검사하려면 전사문의 재생 및 검색 도구를 사용하세요. 이름, 숫자, 약어, 부정 및 기술 지침에는 특별한 주의가 필요합니다. 배경 음악과 겹치는 목소리는 유창한 문장을 부정확하게 만들 수 있습니다. 읽을 수 있는 단락은 인식이 정확했다는 증거가 아닙니다.

문서를 편집할 수 있습니다. 녹음 내용과 신뢰할 수 있는 첨부 자료를 사용하여 원본 텍스트를 수정하세요. 번역도 요청한 경우 한 필드를 변경하면 자동으로 다른 필드가 옳다고 가정하기보다는 번역이 올바른 의미를 표현하는지 확인하세요.

텍스트 문서 또는 자막 내보내기를 선택하세요

책을 읽거나 필기하려면 자료 활용 방법에 따라 TXT, Markdown, PDF, CSV를 선택하세요. 내보내기 옵션을 사용하면 원본 텍스트, 번역된 텍스트(사용 가능한 경우) 또는 둘 다를 선택할 수 있으며 전사 기록에 포함된 타임스탬프와 화자 라벨을 포함할 수 있습니다.

자막의 경우 SRT 또는 VTT를 사용하세요. 파일 전사 타임스탬프는 별도의 라이브 청취 세션의 타임스탬프와 달리 미디어 타임라인을 나타냅니다. SRT 및 VTT는 문서 타임스탬프를 끄더라도 항상 필요한 타이밍 정보를 유지합니다.

원하는 플레이어나 편집기에서 자막 파일을 미리 봅니다. 문장 경계, 타이밍, 줄 길이 및 수정한 단어를 검토하세요. 생성된 자막 파일은 완성된 캡션 트랙의 시작점입니다. 내보내기 자체만으로는 텍스트 출판 준비가 완료되지 않습니다.

부분적인 결과 및 재시도 이해

파일 전사 평가판은 현재 60분의 누적 오디오 지속 시간을 제공합니다. 라이브 청취 수당과는 별개입니다. 대기열은 사용 가능한 파일 허용량을 순서대로 소비합니다. 파일에 필요한 시간보다 남은 시간이 적으면 결과는 시작 부분만 포함하고 부분적으로 표시될 수 있습니다.

전사문을 완료하기 전에 처리된 길이와 상태를 검사하세요. 실패하거나 취소된 작업은 다시 시도할 수 있으나 원인과 남은 여유량을 먼저 확인하세요. 전체 파일에 대한 액세스를 잠금 해제한 경우 파일을 다시 기록하세요. 누락된 결말은 단순히 이전 부분 문서가 열려 있기 때문에 나타나지 않습니다.

읽을 수 없는 파일의 경우 원본이 여전히 정상적으로 열리고 예상한 사운드가 포함되어 있는지 확인하세요. 품질이 낮은 텍스트를 생성하는 허용된 오디오의 경우 음성 언어, 리소스 준비 상태 및 녹음 품질을 확인하세요. 이는 서로 다른 문제이며 다른 수정이 필요합니다.

나중에 재생할 수 있도록 소스를 유지하세요.

로컬 처리를 사용하면 녹음 내용을 전사 웹 사이트로 보낼 필요성이 줄어듭니다. 인식 리소스에는 여전히 초기 다운로드가 필요할 수 있습니다. 번역 대상 또는 화자 분리 모델에는 자체 준비가 필요할 수 있습니다. 인식기를 다운로드한다고 해서 모든 선택 기능이 준비되는 것은 아닙니다.

오디오와 함께 텍스트를 다시 방문하려면 원본 미디어를 안정적인 위치에 보관하세요. 저장된 전사문은 MP4의 대체 복사본이 아닙니다. 소스가 이동되었거나 사용할 수 없는 경우 전사문 도구는 잘못된 녹음 연결을 방지하기 위해 기간 확인을 통해 적합한 파일을 다시 연결할 수 있습니다.

내보낸 문서를 저장할 위치를 고려하세요. 동기화된 폴더 또는 공유 폴더에 있는 로컬 전사문은 해당 폴더의 서비스를 통해 배포될 수 있습니다. 특히 내부 강의나 인터뷰를 위해 원하는 목적지를 선택하세요.

필요한 결과에 따라 다음 단계를 결정합니다.

편집 가능한 MP4 전사문, 검색 가능한 참조 또는 초안 자막 파일에 파일 기록을 사용하세요. 단순히 현재 재생 내용을 따라가는 것이 목표인 경우 실시간 캡션을 사용하세요. 여러 음성의 경우 화자 라벨을 검토하세요. 다양한 언어로 녹음된 그룹의 경우 시작하기 전에 대기열과 언어 설정을 계획하세요.

실용적인 첫 번째 단계는 명확한 음성이 포함된 읽을 수 있는 동영상 하나입니다. 해당 언어와 짧게 생성된 구절을 확인한 다음 전체 결과를 검토하고 실제로 필요한 형식을 내보냅니다.

공식 참고자료는 2026년 10월 4일에 확인되었습니다.

Apple: reading media from a file-based asset
Apple: reading an individual media track
WhisperKit: on-device speech-to-text framework

자주 묻는 질문

전사하기 전에 MP4를 MP3로 변환해야 합니까?

MP4에 앱이 읽을 수 있는 오디오 트랙이 있는 경우에는 그렇지 않습니다. 직접 가져오기는 별도의 변환을 방지합니다. 읽을 수 없는 인코딩이나 잘못된 오디오 트랙으로 인해 먼저 적합한 오디오 파일을 준비해야 할 수도 있습니다.

전사하는 동안 전체 동영상을 재생해야 하나요?

아니요, 파일 전사는 실시간 플레이어 출력을 듣는 대신 선택한 미디어를 읽습니다. 나중에 텍스트를 검토하는 데 도움이 되는 재생이 가능합니다.

무성 MP4 또는 슬라이드 녹음으로 전사문을 생성할 수 있습니까?

음성 인식에는 음성 오디오가 필요합니다. 무성 슬라이드 텍스트를 읽거나 비디오 이미지에서 단어를 추출하지 않습니다.

비디오 관련 타임스탬프가 포함된 SRT 파일을 내보낼 수 있습니까?

그렇습니다. 파일 전사 워크플로는 미디어 기준 타이밍으로 SRT 및 VTT를 내보낼 수 있습니다. 파일을 사용하기 전에 원하는 플레이어에서 생성된 텍스트와 타이밍을 검토하세요.

비디오 전사문에 화자 라벨을 추가할 수 있나요?

화자 분할(화자 라벨링)을 활성화하고 파일을 실행하기 전에 해당 리소스를 준비하십시오. 결과 라벨은 검토가 필요하며 발언자가 누구인지 확인한 후 이름을 바꿀 수 있습니다.

내 동영상의 시작 부분만 스크립트로 변환된 이유는 무엇인가요?

녹화가 부분녹화로 표시되어 있는지, 녹화 파일에 비해 전사 가능한 허용량이 짧은지 확인하세요. 또한 취소 또는 실패에 대한 작업 상태를 검사합니다.

MP4 확장자를 가진 모든 파일이 지원됩니까?

아니요, 파일에는 읽을 수 있는 오디오 트랙과 유효한 미디어 데이터가 필요합니다. 확장자뿐만 아니라 인코딩과 조건도 중요합니다.

관련 가이드