แหล่งข้อมูลการถอดเสียงไฟล์

วิธีถอดเสียงไฟล์หลายภาษาทีละชุดบน Mac แบบออฟไลน์

เตรียมโมเดลบนเครื่อง เลือกตรวจจับภาษาอัตโนมัติหรือจัดกลุ่มตามภาษา แล้วตรวจทานและส่งออกแต่ละไฟล์ในคิวหลายภาษา

2026-10-04 · 7 min
คิวการ์ดเสียงสีสันสดใสนำไปสู่เอกสารถอดเสียงคำพูดแยกกันบนพื้นหลังสีงาช้างอันอบอุ่น

คำตอบสั้น ๆ

หากต้องการถอดเสียงหลายไฟล์ที่ใช้ภาษาต่างกันบน Mac ให้เตรียมทรัพยากรการรู้จำบนเครื่อง เพิ่มไฟล์ลงในคิว และเลือกวิธีจัดการภาษาที่พูด การตรวจจับภาษาอัตโนมัติมีประโยชน์เมื่อมีโมเดลที่รองรับติดตั้งแล้ว หากทราบภาษาแต่การตรวจจับไม่น่าเชื่อถือ ให้จัดกลุ่มไฟล์ภาษาเดียวกันแล้วเลือกภาษาต้นฉบับโดยตรงเพื่อประมวลผล

Alison Workspace รองรับคิวไฟล์ ตัวเลือกการจดจำหลายภาษา การแปลเสริม และการแยกเสียงของผู้พูด (การติดฉลากผู้พูด) ต้องใช้ Apple-silicon Mac, M1 หรือใหม่กว่า โดยมี macOS 15 หรือใหม่กว่า หลังจากที่ทรัพยากรที่จำเป็นพร้อมแล้ว การจดจำไฟล์ที่รองรับจะทำงานในเครื่อง วางแผนโดยคำนึงถึงข้อเท็จจริงที่ว่าการตั้งค่าการแชร์คิวสำหรับการรัน: ไฟล์หลายไฟล์ในภาษาที่แตกต่างกันไม่ใช่ปัญหาเดียวกันกับการบันทึกหนึ่งรายการที่เปลี่ยนภาษาซ้ำๆ

จัดระเบียบไฟล์ตามงานที่คุณต้องการทำ

สมมติว่าคุณมีบรรยายภาษาอังกฤษ สัมภาษณ์ภาษาญี่ปุ่น และมีบันทึกเสียงภาษาสเปน คุณต้องการเอกสารภาษาต้นฉบับแยกต่างหากสำหรับเอกสารแต่ละฉบับ โดยจะมีคำแปลเฉพาะในกรณีที่ช่วยได้ นี่เป็นขั้นตอนการทำงานที่มีภาพประกอบ ไม่ใช่รายงานการทดสอบความแม่นยำสามภาษา

เก็บชื่อไฟล์ไว้เพื่อให้คุณสามารถแยกความแตกต่างได้โดยไม่ต้องเปิดข้อความที่ถอดเสียงทุกครั้ง ตรวจสอบเสียง ความยาวโดยประมาณ และภาษาหลัก สำหรับเสียงที่ฝังอยู่ในวิดีโอ ไฟล์ยังคงต้องการแทร็กเสียงที่สามารถเข้าถึงได้และถอดรหัสได้ รูปภาพไม่มีคำศัพท์ในการรู้จำเสียง

ตัดสินใจว่าคุณต้องการข้อความต้นฉบับ อุปกรณ์ช่วยในการอ่านที่แปลแล้ว ป้ายกำกับผู้พูด หรือคำบรรยาย แต่ละตัวเลือกจะเพิ่มข้อกำหนดแยกต่างหากและงานตรวจสอบแยกต่างหาก การเริ่มด้วยข้อความต้นฉบับช่วยให้ระบุปัญหาภาษาได้ง่ายขึ้นก่อนที่จะเพิ่มการแปล

เตรียมทรัพยากรการจดจำก่อนที่จะออฟไลน์

เมนูการจดจำมีหลายภาษา แต่เครื่องยนต์และรุ่นจะต้องรองรับภาษาที่คุณต้องการใช้ ภาษาที่ปรากฏในเมนูไม่ได้รับประกันว่าทุกรุ่นที่ติดตั้งจะสามารถรองรับภาษานั้นได้ดีเท่าเทียมกัน ใช้แบบจำลองหลายภาษาสำหรับชุดที่ต้องการภาษาต้นฉบับหลายภาษา

การตรวจหาภาษาไฟล์อัตโนมัติของ Alison ต้องใช้โมเดล Whisper ในเครื่องที่ใช้งานได้ ภาษาที่เลือกไว้อย่างชัดเจนบางภาษาสามารถใช้การจดจำระบบที่มีอยู่ในเวอร์ชัน macOS ที่เข้ากันได้ แต่นั่นไม่ใช่การทดแทนภาษาอัตโนมัติ ปฏิบัติตามข้อความความพร้อมของแอป แทนที่จะสมมติว่าแบบจำลองที่ใช้โดยเวิร์กโฟลว์อื่นพร้อมแล้วที่นี่

ดาวน์โหลดและเตรียมทรัพยากรขณะเชื่อมต่อ จากนั้นลองใช้ไฟล์สั้นที่มีการตั้งค่าที่ต้องการก่อนที่จะใช้เซสชันออฟไลน์ การเตรียมการครั้งแรกอาจต้องใช้เวลา ไม่มีการตรวจสอบรุ่นใดที่สามารถพิสูจน์คุณภาพของสำเนียงที่ไม่คุ้นเคยหรือการบันทึกที่มีเสียงรบกวนได้

เลือกการตรวจหาอัตโนมัติหรือกลุ่มตามภาษา

สำหรับไฟล์ที่แต่ละไฟล์มีภาษาหลักที่ชัดเจน การตรวจหาอัตโนมัติสามารถหลีกเลี่ยงการเรียงลำดับทุกรายการด้วยตนเองได้ มันอาจจะยังผิดอยู่ โดยเฉพาะอย่างยิ่งกับความเงียบ ดนตรี คำพูดน้อยมาก หรือการเปิดเรื่องที่ผิดปกติ ตรวจสอบผลลัพธ์สำหรับทุกไฟล์ แทนที่จะยอมรับทั้งคิว เนื่องจากทรานสคริปต์คำพูดแรกดูถูกต้อง

หากคุณรู้ภาษา วิธีการที่มีการควบคุมมากขึ้นคือการเรียกใช้ไฟล์ภาษาอังกฤษโดยเลือกภาษาอังกฤษ จากนั้นจึงเรียกใช้ไฟล์ภาษาญี่ปุ่นโดยเลือกภาษาญี่ปุ่น และอื่นๆ คิวใช้ตัวเลือกการจดจำที่ใช้ร่วมกันสำหรับการรันนั้น คู่มือนี้ไม่ได้อธิบายการตั้งค่าภาษาแยกต่างหากที่แนบมากับไฟล์ที่อยู่ในคิวทุกไฟล์

อย่าเริ่มชุดภาษาผสมด้วยภาษาคงที่ เว้นแต่คุณต้องการภาษานั้นสำหรับไฟล์ทั้งหมดจริงๆ เมื่อการรู้จำดูผิดปกติ ให้ตรวจสอบเสียงและภาษาก่อน การเปลี่ยนภาษาการแปลเป้าหมายไม่สามารถซ่อมแซมข้อความที่ถอดเสียงต้นฉบับที่สร้างขึ้นภายใต้การตั้งค่าการจดจำที่ไม่ถูกต้อง

เริ่มชุดงานที่สามารถจัดการได้

เริ่มต้นด้วยชุดเล็กๆ เพื่อให้คุณสามารถยืนยันการตั้งค่า ความพร้อมของทรัพยากร และเอาต์พุต ก่อนที่จะประมวลผลคอลเลกชันที่ใหญ่ขึ้น ไฟล์หลายไฟล์ถูกจัดคิวเพื่อการประมวลผล นี่ไม่ใช่คำสัญญาว่าไฟล์ทั้งหมดจะทำงานพร้อมกันหรือสิ้นสุดด้วยความเร็วคงที่

  1. เลือกไฟล์ที่คุณสามารถอ่านได้ในเครื่องและยืนยันชื่อ ระยะเวลา และภาษาพูดที่คาดหวัง
  2. เปิดหน้าต่างการถอดเสียงไฟล์และเพิ่มไฟล์หลายไฟล์ หรือลากลงในคิว
  3. เลือกการตรวจหาภาษาอัตโนมัติด้วยโมเดลหลายภาษาที่พร้อมใช้งาน หรือจัดกลุ่มไฟล์ตามภาษา และเลือกภาษาต้นฉบับที่ชัดเจน
  4. ปล่อยให้การแปลปิดสำหรับเอกสารภาษาต้นฉบับ หรือเลือกเป้าหมายการแปลที่รองรับหนึ่งรายการเพื่อดำเนินการและเตรียมทรัพยากร
  5. เปิดใช้งานการแยกเสียงของผู้พูด (การติดป้ายกำกับผู้พูด) เมื่อมีประโยชน์และเตรียมทรัพยากรเท่านั้น ใช้จำนวนคนที่คาดหวังในการพูดเฉพาะในกรณีที่เหมาะสมกับไฟล์ในการเรียกใช้ครั้งนั้น
  6. เริ่มคิว จากนั้นตรวจสอบสถานะของไฟล์แต่ละไฟล์และข้อความที่สร้างขึ้นก่อนส่งออกเอกสาร

ตรวจสอบไฟล์ที่ถูกปฏิเสธว่าเป็นปัญหาด้านสื่อก่อน ไฟล์ที่ไม่มีแทร็กเสียงหรือการเข้ารหัสที่อ่านไม่ได้จะไม่ได้รับการแก้ไขโดยการเพิ่มภาษาเพิ่มเติมให้กับการตั้งค่าโมเดล

รักษาการตั้งค่าการจดจำ การแปล และผู้พูดให้แตกต่างออกไป

การรับรู้ก่อให้เกิดคำในภาษาพูด การแปลเปลี่ยนคำเหล่านั้นเป็นภาษาการอ่านอื่น การแยกผู้พูดจัดกลุ่มข้อความด้วยเสียง อาจใช้ร่วมกันได้ แต่ความสำเร็จในสิ่งหนึ่งไม่ได้สร้างความสำเร็จในสิ่งอื่นๆ

ตัวอย่างเช่น ข้อความภาษาญี่ปุ่นที่จดจำได้อย่างถูกต้องอาจยังมีเป้าหมายการแปลที่ไม่พร้อมใช้งานหรือมีการกำหนดผู้พูดไม่ถูกต้อง ทำให้มองเห็นต้นฉบับได้เมื่อตรวจทานเอกสารที่แปล ตรวจสอบชื่อ รูปภาพ และข้อความเชิงลบที่สำคัญกับการบันทึก โดยเฉพาะอย่างยิ่งเมื่อการแปลดูนุ่มนวลกว่าข้อความต้นฉบับ

คู่การแปลขึ้นอยู่กับทรัพยากรที่มีอยู่ใน Mac จริง โปรแกรมจดจำหลายภาษาไม่ได้หมายความว่าทุกภาษาต้นฉบับสามารถแปลเป็นทุกเป้าหมายได้ หากการแปลไม่พร้อมใช้งาน คุณยังคงใช้และตรวจสอบข้อความที่ถอดเสียงภาษาต้นฉบับได้ แทนที่จะติดป้ายกำกับว่าเป็นการแปลผิด

จัดการการบันทึกที่เปลี่ยนภาษาแตกต่างออกไป

โฟลเดอร์ที่มีไฟล์ภาษาเดียวส่วนใหญ่เป็นเหตุผลที่ดีในการพิจารณาการตรวจจับอัตโนมัติ การสัมภาษณ์ครั้งหนึ่งที่มีการสลับระหว่างภาษาญี่ปุ่นและภาษาอังกฤษซ้ำแล้วซ้ำเล่าจำเป็นต้องให้ความสนใจแยกกัน การตรวจจับอัตโนมัติไม่ได้หมายความว่าสวิตช์ทุกตัวในการบันทึกได้รับการยอมรับอย่างถูกต้อง

ทบทวนข้อความเกี่ยวกับการเปลี่ยนแปลงภาษา หากผลลัพธ์สูญเสียภาษาใดภาษาหนึ่งอย่างต่อเนื่อง ให้พิจารณาประมวลผลข้อความที่ตัดตอนมาที่เหมาะสมแยกกันตามภาษาที่ต้องการเลือก โดยใช้เครื่องมือแก้ไขสื่อตามปกติเพื่อจัดเตรียม รักษาต้นฉบับไว้และจำไว้ว่าข้อความที่ถอดเสียงของข้อความที่ตัดตอนมานั้นใช้ไทม์ไลน์ของข้อความที่ตัดตอนมานั้น

ไม่มีการอ้างสิทธิ์ในการจดจำภาษาผสมที่ไร้ที่ติหรือคุณภาพที่เท่าเทียมกันในทุกภาษาที่รองรับ เพลงประกอบ คำพูดในภูมิภาค ชื่อที่ไม่คุ้นเคย และเงื่อนไขการบันทึกที่แตกต่างกันยังส่งผลต่อสิ่งที่ต้องมีการแก้ไขด้วย

ตรวจสอบความสมบูรณ์และลองอีกครั้งหลังจากวินิจฉัยปัญหาแล้วเท่านั้น

ขณะนี้การทดลองถอดเสียงไฟล์ของ Alison ให้ระยะเวลาเสียงสะสม 60 นาที แยกจากการฟังสด คิวใช้เวลาประมวลผลที่เหลือตามลำดับ ไฟล์ต่อมาอาจได้รับเฉพาะเวลาที่เหลืออยู่หรือไม่มีเลย ดูที่ความยาวที่คาดหวังและการประมวลผล แทนที่จะคิดว่าทุกไฟล์ที่เพิ่มเข้ามาจะเสร็จสิ้นอย่างสมบูรณ์

ผลลัพธ์บางส่วนไม่ใช่ข้อความที่ถอดเสียงที่สมบูรณ์ของการบันทึกขนาดยาว งานที่ล้มเหลวหรือยกเลิกสามารถลองใหม่ได้หลังจากที่คุณตรวจสอบสาเหตุแล้ว หากไฟล์ถูกประมวลผลด้วยภาษาที่ไม่ถูกต้อง ให้เลือกภาษาที่ถูกต้องสำหรับการดำเนินการอื่น หากทรัพยากรขาดหายไปให้จัดเตรียมไว้ก่อน ตรวจสอบเวลาที่ใช้ได้ก่อนทำซ้ำชุดยาว

หากคุณปลดล็อกการเข้าถึงไฟล์โดยสมบูรณ์ ให้เรียกใช้ไฟล์ที่ได้รับผลกระทบอีกครั้ง การเปลี่ยนแปลงการเข้าถึงจะไม่เติมจุดสิ้นสุดที่ยังไม่ได้ประมวลผลของเอกสารก่อนหน้าโดยอัตโนมัติ รักษาความสัมพันธ์ระหว่างไฟล์ สถานะ และข้อความที่ถอดเสียงล่าสุดให้ชัดเจน

ตรวจสอบและส่งออกเอกสารแต่ละฉบับอย่างตั้งใจ

ใช้การค้นหาและการเล่นเพื่อตรวจสอบข้อความที่สำคัญในแต่ละผลลัพธ์ การแก้ไขข้อความที่ถอดเสียงหนึ่งรายการไม่ได้หมายความว่าเอกสารอื่นๆ ในคิวได้รับการตรวจสอบแล้ว ตั้งชื่อไฟล์ที่ส่งออกให้ชัดเจนและเก็บการบันทึกต้นฉบับไว้สำหรับการตรวจสอบในภายหลัง

เมนูส่งออกการถอดเสียงพูดในปัจจุบันมี TXT, Markdown, CSV, PDF, SRT และ VTT เลือกข้อความต้นฉบับ การแปล หากมี หรือทั้งสองอย่าง ตัวเลือกผู้พูดและการประทับเวลาเอกสารจะขึ้นอยู่กับบันทึกและรูปแบบ ส่งออกแต่ละบันทึกผ่านเมนู แทนที่จะคิดว่าการเพิ่มชุดจะเป็นการส่งออกจำนวนมากในคลิกเดียว

การรู้จำบนเครื่องจะอธิบายว่าการประมวลผลเกิดขึ้นที่ใด ไม่ได้ควบคุมสิ่งที่โฟลเดอร์ส่งออกที่ซิงค์ ไดรฟ์ที่แชร์ หรือการสำรองข้อมูลทำกับไฟล์ในภายหลัง เลือกตำแหน่งที่คุณเก็บบันทึกและเอกสารของคุณ ขั้นตอนต่อไปคือคิวเล็กๆ ซึ่งคุณสามารถตรวจสอบภาษาและเอาต์พุตได้ก่อนที่จะขยายขนาด

ข้อมูลอ้างอิงอย่างเป็นทางการได้รับการตรวจสอบเมื่อวันที่ 4 ตุลาคม พ.ศ. 2569

WhisperKit: on-device speech-to-text and model choices
Apple: file-based media reading
FluidAudio: local speaker diarization

คำถามที่พบบ่อย

การบันทึกภาษาอื่นสามารถรวมอยู่ในคิวเดียวได้หรือไม่

ใช่ แต่การรันแชร์การตั้งค่าภาษา ใช้การตรวจจับอัตโนมัติกับโมเดลหลายภาษาที่เข้ากันได้หรือจัดกลุ่มไฟล์ตามภาษาและรันกลุ่มเหล่านั้นด้วยภาษาต้นฉบับที่ชัดเจน

การตรวจหาภาษาอัตโนมัติจำเป็นต้องดาวน์โหลดโมเดลหรือไม่

จำเป็นต้องมีโมเดล Whisper ในเครื่องที่ใช้งานได้ เตรียมโมเดลนั้นก่อนเซสชันออฟไลน์ กลไกระบบสำหรับภาษาที่เลือกอย่างชัดเจนภาษาหนึ่งไม่ใช่ทางเลือกภาษาอัตโนมัติ

มันจะรองรับการสลับสองภาษาภายในไฟล์เดียวได้อย่างน่าเชื่อถือหรือไม่?

อย่าทึกทักเอาเองว่า. ทบทวนข้อความสลับและพิจารณาข้อความที่ตัดตอนมาซึ่งเตรียมไว้แยกต่างหากด้วยการตั้งค่าภาษาที่ถูกต้องเมื่อพลาดภาษาใดภาษาหนึ่งซ้ำไปซ้ำมา

การถอดเสียงเป็นภาษาญี่ปุ่นทำให้ฉันมีข้อความภาษาอังกฤษโดยอัตโนมัติหรือไม่

ไม่ การจดจำและการแปลเป็นทางเลือกที่แยกจากกัน เลือกภาษาอังกฤษเป็นเป้าหมายการแปลที่รองรับ และเตรียมคู่ที่ต้องการหากคุณต้องการเครื่องช่วยอ่านภาษาอังกฤษ

หลังจากเตรียมการแล้ว ฉันสามารถถอดเสียงไฟล์โดยไม่ใช้อินเทอร์เน็ตได้หรือไม่

การจดจำที่รองรับจะทำงานภายในเครื่องเมื่อทรัพยากรที่จำเป็นใช้งานได้ เตรียมแหล่งข้อมูลการแปลและผู้บรรยายเสริมด้วย และยืนยันขั้นตอนการทำงานที่ต้องการก่อนที่จะออฟไลน์

มีป้ายกำกับผู้พูดเป็นชุดหรือไม่

สามารถเปิดใช้งานการแยกผู้พูดสำหรับการทำงานเมื่อทรัพยากรพร้อม ตรวจสอบแต่ละไฟล์โดยแยกจากกัน หมายเลขผู้พูดไม่ได้สร้างตัวตนของบุคคลคนเดียวกันในไฟล์ต่างๆ

การถอดเสียงเป็นชุดรวมถึงการส่งออกจำนวนมากโดยอัตโนมัติหรือไม่

คิวประมวลผลได้หลายไฟล์ แต่ส่งออกแต่ละข้อความผ่านเมนูของไฟล์นั้น คู่มือนี้ไม่ได้รับรองว่าส่งออกทั้งคิวได้ในคลิกเดียว

คู่มือที่เกี่ยวข้อง