เสียงพูดและบทสนทนา

การกำกับข้อมูลเสียงพูดและออดิโอภาษาญี่ปุ่น

การถอดเสียง การกำกับเวลา การแยกผู้พูด การกำกับเจตนาและสล็อต และการติดแท็กอารมณ์หรือสำเนียงถิ่นบนไฟล์เสียงภาษาญี่ปุ่น — ทำตามข้อตกลงที่เขียนเป็นเอกสาร ไม่ใช่ตามความเคยชินที่ไม่ได้เขียนไว้

ผู้ถอดเสียงสองคนที่ได้รับไฟล์เสียงภาษาญี่ปุ่นเดียวกันโดยไม่มีข้อตกลงกำกับ จะเขียนต่างกันประมาณทุกบรรทัดที่สาม ไม่ใช่ต่างกันว่าผู้พูดพูดอะไร แต่ต่างกันว่าจะเขียนมันอย่างไร

ข้อความถอดเสียงคือชุดของการตัดสินใจ ไม่ใช่การบันทึกเสียง

ภาษาญี่ปุ่นไม่มีการเว้นวรรค มีระบบการเขียนสี่แบบ และมีช่องว่างกว้างระหว่างเสียงของคำกับรูปเขียนตามธรรมเนียมของคำนั้น ดังนั้นทันทีที่เสียงกลายเป็นข้อความ ก็มีคนตัดสินใจไปแล้วหลายสิบเรื่อง ทั้งว่า 有難うございます จะเขียนด้วยคันจิหรือคานะ 3人 จะเขียนเป็น 3人 หรือ 三人 คำว่า えーっと ที่ต้นประโยคจะเก็บไว้หรือตัดออก และการพูดสะดุดกลางคำจะถอดตามที่ได้ยินหรือเรียบเรียงให้เรียบร้อย

ไม่มีตัวเลือกใดในนั้นที่ผิดในตัวมันเอง สิ่งที่ผิดคือการเลือกอย่างไม่สม่ำเสมอตลอดทั้งคลังข้อมูล เพราะโมเดล ASR ที่ฝึกด้วยเป้าหมายที่ไม่สม่ำเสมอจะเรียนรู้ว่าเสียงเดียวกันเชื่อมโยงกับข้อความได้หลายแบบ และอัตราความผิดพลาดของมันก็ซึมซับความต่างนั้นไว้ ตัวแปรคุณภาพที่ใหญ่ที่สุดของข้อมูลเสียงพูดภาษาญี่ปุ่นคือข้อตกลงการปรับมาตรฐานที่เขียนไว้เป็นเอกสารและถูกบังคับใช้จริง

เราจึงเริ่มทุกโครงการด้านเสียงพูดด้วยการตกลงเอกสารฉบับนั้น และในกรณีที่คุณมีอยู่แล้ว เราจะใช้ของคุณแทนที่จะยัดเยียดของเรา

ภาพรวมโดยย่อ

ประเภทงาน
การถอดเสียงแบบตรงตัวและแบบอ่านง่าย การกำกับเวลา การแยกผู้พูด การกำกับเจตนาและสล็อต อารมณ์และทำนองเสียง การติดแท็กสำเนียงถิ่น
เสียงที่รองรับ
บันทึกเสียงคอลเซ็นเตอร์ การประชุม การสัมภาษณ์ การออกอากาศ เสียงพูดในรถและบนอุปกรณ์ และบทสนทนาที่เกิดขึ้นเองตามธรรมชาติ
ข้อตกลง
การเลือกรูปเขียน คำเติม ตัวเลข เสียงหัวเราะ และช่วงที่ฟังไม่ออก ล้วนนิยามไว้ก่อนเริ่มถอดเสียง
ผลลัพธ์ที่ใช้บ่อย
JSON พร้อมค่าเวลาระดับคำหรือระดับช่วง รองรับ SRT, VTT, CTM และ TextGrid ด้วย
การตรวจทาน
ฟังซ้ำรอบที่สองทุกไฟล์ พร้อมถอดเสียงซ้ำแบบปิดข้อมูลบนตัวอย่าง

ประเภทงาน

สิ่งที่เรากำกับ

การถอดเสียงมักเป็นชั้นพื้นฐาน ส่วนงานอื่นจะเพิ่มทับลงไปบนเส้นเวลาเดียวกัน

การถอดเสียง

แบบตรงตัวหรือแบบอ่านง่าย ตามข้อตกลงที่เขียนไว้ซึ่งครอบคลุมคำเติม การเริ่มประโยคใหม่ การพูดซ้ำ การออกเสียงผิด และช่วงที่ฟังไม่ออก

  • แบบตรงตัวพร้อมความไม่ราบรื่นของการพูด
  • แบบอ่านง่ายเพื่อความสะดวกในการอ่าน
  • การกำกับช่วงที่ฟังไม่ออกและช่วงพูดทับกัน
  • แท็กเหตุการณ์ที่ไม่ใช่เสียงพูด

การกำกับเวลาและการจัดแนว

ค่าเวลาระดับช่วง ระดับถ้อยคำ หรือระดับคำ และการจัดแนวแบบบังคับกับข้อความถอดเสียงเดิมในกรณีที่มีอยู่แล้ว

  • ขอบเขตของถ้อยคำ
  • ค่าเวลาระดับคำ
  • การทำ QA การจัดแนวแบบบังคับ
  • ช่วงเงียบและช่วงพูดทับกัน

การกำกับผู้พูด

ใครกำลังพูด ทั้งในช่วงที่พูดทับกันและช่วงที่เปลี่ยนช่องสัญญาณ ซึ่งเป็นส่วนที่พังบ่อยที่สุดกับบันทึกเสียงการโทรจริง

  • การแยกผู้พูดและรหัสผู้พูด
  • ป้ายกำกับบทบาท (เจ้าหน้าที่ / ลูกค้า)
  • การจัดการช่วงพูดทับกัน
  • การติดแท็กคุณลักษณะของผู้พูด

การกำกับเจตนาและสล็อต

ถ้อยคำนั้นพยายามทำอะไรและมีค่าอะไรอยู่ในนั้น เพิ่มทับลงบนข้อความถอดเสียงสำหรับงานผู้ช่วยเสียงและการวิเคราะห์การโทร

  • การจำแนกเจตนา
  • ช่วงข้อความของสล็อตและเอนทิตี
  • ป้ายกำกับวัจนกรรมในบทสนทนา
  • ผลลัพธ์และการจัดการของการโทร

การกำกับลักษณะเหนือถ้อยคำ

อารมณ์ ความรู้สึก การเน้นด้วยทำนองเสียง สไตล์การพูด และความแตกต่างตามภูมิภาค ให้คะแนนตามหมวดหมู่ที่นิยามไว้ ไม่ใช่ตามความรู้สึก

  • อารมณ์และความรู้สึก
  • สไตล์การพูดและระดับความสุภาพ
  • สำเนียงถิ่นและสำเนียงเฉพาะ
  • แท็กคุณภาพเสียงและสภาพแวดล้อม

ประเด็นเฉพาะภาษาญี่ปุ่น

การตัดสินใจที่ข้อตกลงภาษาญี่ปุ่นต้องระบุ

สี่ข้อนี้ครอบคลุมความเห็นต่างส่วนใหญ่ระหว่างผู้ถอดเสียงที่มีความสามารถสองคน

การเลือกรูปเขียนของคำเดียวกัน

ありがとう, 有難う และ アリガトウ คือคำเดียวกัน หากปล่อยให้ผู้ถอดเสียงแต่ละคนเลือกเอง คลังข้อมูลจะมีครบทั้งสามแบบ และโมเดลจะมองว่าเป็นเป้าหมายคนละอย่าง

เราจัดการอย่างไร ข้อตกลงระบุรูปเขียนที่ต้องใช้สำหรับคำที่พบบ่อย กำหนดกฎเริ่มต้นสำหรับคำที่เหลือ และมีการตรวจสอบอัตโนมัติที่ติดธงรูปแปรก่อนส่งมอบ

ตัวเลขและลักษณนาม

ลักษณนามภาษาญี่ปุ่นเปลี่ยนรูปการอ่านตามคำนามที่นับ — 一本, 一杯, 一人 — และตัวเลขหนึ่งตัวเขียนได้ทั้ง 3, 三 หรือ 参 หากเขียนอย่างไม่สม่ำเสมอ ความแม่นยำด้านตัวเลขของโมเดลที่ได้จะวัดไม่ได้

เราจัดการอย่างไร นโยบายเรื่องตัวเลขกำหนดว่าเมื่อใดใช้เลขอารบิกและเมื่อใดใช้คันจิ รวมถึงวิธีถอดลักษณนามและหน่วย พร้อมตัวอย่างประกอบสำหรับวันที่ จำนวนเงิน เวลา และหมายเลขโทรศัพท์

คำเติมและความไม่ราบรื่นของการพูด

あの, えーっと, まあ และ そのー พบได้ทั่วไปในภาษาญี่ปุ่นที่พูดตามธรรมชาติ การเก็บไว้ทำให้ข้อความถอดเสียงรกขึ้น การตัดออกทำให้ข้อมูลแบบตรงตัวใช้กับโมเดลที่ต้องรู้จักความไม่ราบรื่นของการพูดไม่ได้

เราจัดการอย่างไร เรานิยามรูปแบบตรงตัวและรูปแบบอ่านง่ายแยกจากกัน พร้อมรายการคำเติมและตัวสะกดที่ตายตัวของแต่ละรูปแบบ การเลือกจึงเป็นการตั้งค่าระดับโครงการ ไม่ใช่การตัดสินใจรายไฟล์

รูปสุภาพและรูปภาษายกย่อง

ภาษาญี่ปุ่นในคอลเซ็นเตอร์เต็มไปด้วยรูปยกย่องและรูปถ่อมตน และหลายรูปมักถูกฟังผิด — いたします กับ いただきます, よろしいでしょうか กับ よろしかったでしょうか — โดยผู้ถอดเสียงที่ทำงานด้วยความเร็ว

เราจัดการอย่างไร ผู้ตรวจทานได้รับการบรีฟเรื่องรูปแบบภาษายกย่องที่เฉพาะกับประเภทเสียงของคุณ และข้อผิดพลาดด้านภาษายกย่องเป็นหมวดหมู่ที่ตั้งชื่อไว้ในรอบการตรวจทาน แทนที่จะถูกรวมเข้ากับความถูกต้องโดยรวม

กระบวนการ

โครงการด้านเสียงพูดดำเนินไปอย่างไร

เอกสารข้อตกลงถูกเขียนขึ้นก่อนที่ใครจะถอดเสียงไฟล์แรกจนจบ และแก้ไขได้ผ่านการเปลี่ยนแปลงที่กำหนดเวอร์ชันเท่านั้น

  1. 01

    ฟังตัวอย่างและกำหนดขอบเขต

    เราฟังตัวอย่างที่เป็นตัวแทน — รวมถึงไฟล์ที่คุณภาพแย่ที่สุด ไม่ใช่เฉพาะไฟล์ที่สะอาดที่สุด — แล้วระบุว่าอะไรคือส่วนที่จะยากจริง ๆ

  2. 02

    เขียนข้อตกลง

    รูปเขียน ตัวเลข คำเติม เหตุการณ์ที่ไม่ใช่เสียงพูด ช่วงพูดทับกัน ช่วงที่ฟังไม่ออก บทบาทของผู้พูด และความละเอียดของค่าเวลา ถูกกำหนดไว้ทั้งหมดในเอกสารที่คุณอนุมัติ

  3. 03

    ปรับเทียบด้วยโครงการนำร่อง

    ผู้ถอดเสียงหลายคนทำไฟล์ชุดเดียวกันอย่างเป็นอิสระ จุดที่ผลออกมาต่างกันคือจุดที่ข้อตกลงยังกำกวมและต้องทำให้คมขึ้น

  4. 04

    ถอดเสียงและตรวจทาน

    ทุกไฟล์ผ่านการฟังซ้ำรอบที่สองโดยคนละคน และมีการสุ่มตัวอย่างมาถอดเสียงซ้ำแบบปิดข้อมูลเพื่อคำนวณตัวเลขความแม่นยำที่วัดได้จริง

  5. 05

    ส่งมอบและรายงาน

    ข้อความถอดเสียง ค่าเวลา และป้ายกำกับ ส่งมอบพร้อมเวอร์ชันของข้อตกลง รายงาน QA และรายชื่อไฟล์ที่ติดธงว่าใช้ไม่ได้ แทนที่จะเดาเนื้อหาลงไป

การส่งมอบ

รูปแบบขาเข้าและขาออก

เราทำงานจากไฟล์เสียงของคุณตามสภาพที่เป็นอยู่ หากตัวแปลงสัญญาณหรืออัตราสุ่มจำกัดสิ่งที่ทำได้ เราจะบอกก่อนเริ่มโครงการ ไม่ใช่หลังจากนั้น

รูปแบบขาเข้าและขาออกที่ใช้บ่อยสำหรับงานเสียงพูดภาษาญี่ปุ่น
ชั้นข้อมูลผลลัพธ์เริ่มต้นรูปแบบอื่นที่รองรับ
ข้อความถอดเสียงJSON พร้อมค่าเวลาระดับช่วงข้อความล้วน, SRT, VTT
ค่าเวลาระดับคำJSONCTM, TextGrid
ป้ายกำกับผู้พูดRTTM หรือรอบการพูดแบบ JSONข้อความถอดเสียงแยกตามช่องสัญญาณ
เจตนาและสล็อตJSONL หนึ่งถ้อยคำต่อหนึ่งบรรทัดCSV, รูปแบบช่วงข้อความ CoNLL
ป้ายกำกับลักษณะเหนือถ้อยคำJSONL พร้อมช่วงเวลาCSV, ไฟล์กำกับข้อมูลของ ELAN

คุณภาพ

การควบคุมที่เฉพาะกับงานนี้

ความแม่นยำบนเสียงภาษาญี่ปุ่นเป็นสิ่งที่วัด ไม่ใช่สิ่งที่กล่าวอ้าง และวัดบนไฟล์ที่ยาก ไม่ใช่ไฟล์ที่ง่าย

  • ถอดเสียงซ้ำแบบปิดข้อมูลบนตัวอย่างโดยผู้ถอดเสียงคนที่สอง เพื่อคำนวณอัตราความผิดพลาดที่วัดได้ของแต่ละชุดงาน
  • ตรวจสอบการปฏิบัติตามข้อตกลงโดยอัตโนมัติสำหรับรูปเขียนที่แปรไป รูปแบบตัวเลข และตัวสะกดของคำเติม ก่อนส่งมอบ
  • ตรวจสอบค่าเวลาเทียบกับตัวเสียงจริง ไม่ใช่เทียบกับช่วงข้างเคียงเท่านั้น
  • ไฟล์ที่ถอดเสียงไม่ได้จริง ๆ จะถูกติดธงและส่งคืนตามสภาพนั้น ไม่มีการเติมด้วยการเดาที่ดูสมเหตุสมผล
  • ตรวจสอบป้ายกำกับผู้พูดตลอดทั้งไฟล์ เพื่อจับกรณีที่ตัวตนของผู้พูดสลับกันกลางไฟล์
  • จงใจใส่เสียงที่ยากไว้ในตัวอย่างสำหรับ QA เพื่อให้ตัวเลขที่รายงานสะท้อนคลังข้อมูลทั้งหมด ไม่ใช่ส่วนที่ดีที่สุดของมัน

คำถามที่พบบ่อย

เกี่ยวกับเสียงพูดและออดิโอ

สิ่งที่ทีมต่าง ๆ ถามก่อนส่งไฟล์เสียงภาษาญี่ปุ่นชุดแรกมาให้

ได้ และสำหรับเสียงที่สะอาด วิธีนี้มักคุ้มค่ากว่า ข้อควรระวังคือการแก้ไขข้อความถอดเสียงจากเครื่องทำให้มนุษย์มีอคติโน้มไปทางยอมรับสิ่งที่ปรากฏบนหน้าจออยู่แล้ว ดังนั้นสำหรับข้อมูลฝึกสอน เราจะถอดเสียงใหม่ทั้งหมด หรือทำการตรวจสอบแบบปิดข้อมูลบนตัวอย่างเพื่อวัดว่ารอบการแก้ไขนั้นจับข้อผิดพลาดได้จริงเท่าใด

เราตกลงกันล่วงหน้าว่าจะถอดภาษาถิ่นตามที่พูดจริง หรือปรับให้เป็นภาษาญี่ปุ่นมาตรฐาน เพราะการตัดสินใจนี้เปลี่ยนชุดข้อมูลไปทั้งหมด ในกรณีที่ภาษาถิ่นอยู่ในขอบเขตงาน เราจะติดแท็กระบุสำเนียง และเราจะบอกตรง ๆ ว่าสำเนียงใดที่เราจัดหาบุคลากรได้อย่างน่าเชื่อถือ และสำเนียงใดที่ทำไม่ได้

เราทำงานกับบันทึกเสียงจริง รวมถึงเสียงโทรศัพท์ที่แบนด์วิดท์จำกัด เสียงรบกวนพื้นหลัง และผู้พูดที่พูดทับกัน สิ่งที่สำคัญกว่ารูปแบบไฟล์คือคุณต้องส่งตัวอย่างที่เป็นตัวแทนมาตั้งแต่แรก การกำหนดขอบเขตจากเสียงที่สะอาดแล้วส่งมอบงานบนเสียงที่มีสัญญาณรบกวน คือสาเหตุที่โครงการด้านเสียงพูดล้มเหลว

ได้ ภายใต้ NDA และข้อตกลงการประมวลผลข้อมูล ในสภาพแวดล้อมที่แยกอิสระพร้อมสิทธิ์เข้าถึงตามบทบาท และมีเงื่อนไขการเก็บรักษาและการลบข้อมูลที่ตกลงกันไว้ในสัญญา ในกรณีที่บันทึกเสียงมีข้อมูลส่วนบุคคล เรากำกับจุดที่ต้องปกปิดให้ได้ หรือทำงานบนไฟล์เสียงที่คุณปกปิดข้อมูลแล้วก่อนส่งมาก็ได้ ดูรายละเอียดทั้งหมดได้ที่หน้าความปลอดภัย

ให้บริการ ช่วงที่พูดทับกันคือจุดที่การแยกผู้พูดอัตโนมัติล้มเหลวบ่อยที่สุด และเป็นเหตุผลหลักข้อหนึ่งที่ต้องให้มนุษย์เข้ามาทำ ข้อตกลงของเรานิยามว่าเสียงพูดที่ทับกันจะถูกแบ่งช่วงและระบุผู้พูดอย่างไร การจัดการจึงสม่ำเสมอ แทนที่จะตัดสินกันไปทีละไฟล์

เสียงพูดและออดิโอ

ส่งไฟล์เสียงที่ยากที่สุดมาให้เรา ไม่ใช่ไฟล์ที่สะอาดที่สุด

ตัวอย่างที่เป็นตัวแทนบอกอะไรเราได้มากกว่าเอกสารข้อกำหนด เราจะตอบกลับด้วยร่างข้อตกลง ตัวอย่างที่ถอดเสียงแล้ว และมุมมองตรงไปตรงมาว่าควรคาดหวังอัตราความผิดพลาดเท่าใด

ลงนาม NDA ก่อนที่คุณจะส่งข้อมูลใด ๆ การกำหนดขอบเขตโครงการนำร่องไม่มีค่าใช้จ่าย