ข้อมูลภาษาญี่ปุ่น

ทำไมข้อมูลภาษาญี่ปุ่นจึงยากสำหรับ AI

คุณสมบัติเจ็ดประการของภาษาญี่ปุ่นที่หักล้างสมมติฐานซึ่งฝังอยู่ในไปป์ไลน์ NLP ที่ออกแบบโดยยึดภาษาอังกฤษเป็นหลัก — และการตัดสินใจที่แนวทางการกำกับข้อมูลต้องทำกับแต่ละข้อ

หน้านี้เขียนขึ้นสำหรับคนที่ต้องกำหนดข้อกำหนดของชุดข้อมูลภาษาญี่ปุ่น และกำลังพยายามหาว่าตัวเองจะถูกถามให้ตัดสินใจเรื่องอะไรบ้าง

รูปแบบความล้มเหลวคือความเงียบ ไม่ใช่ข้อผิดพลาด

ชุดข้อมูลภาษาญี่ปุ่นแทบไม่เคยล้มเหลวแบบส่งเสียงดัง แต่ล้มเหลวด้วยการมีคำตอบที่มีเหตุผลรองรับสองแบบต่อคำถามเดียวกัน แล้วบันทึกไว้ราวกับว่าเป็นคำตอบเดียวกัน ผู้กำกับข้อมูลคนหนึ่งรวม 株式会社 ไว้ในช่วงข้อความของเอนทิตีชื่อบริษัท อีกคนตัดออก ผู้ถอดเสียงคนหนึ่งเขียน ありがとう อีกคนเขียน 有難う ผู้ประเมินคนหนึ่งอ่าน それはちょっと難しいです เป็นการบอกว่ายาก อีกคนอ่านเป็นการปฏิเสธ ไม่มีอะไรในไปป์ไลน์ทักท้วง ความไม่สอดคล้องนั้นกลายเป็นส่วนหนึ่งของสิ่งที่โมเดลเรียนรู้ไปเฉย ๆ

นี่คือเหตุผลที่งานกำกับข้อมูลภาษาญี่ปุ่นถูกครอบงำด้วยการกำหนดข้อกำหนดมากกว่าแรงงาน ความยากเกือบทุกข้อด้านล่างไม่มีทางออกที่ถูกต้องเพียงทางเดียว มีแต่ทางออกที่ต้องเลือก เขียนไว้เป็นเอกสาร แล้วนำไปใช้ให้เหมือนกันหนึ่งหมื่นครั้ง ทีมที่ตัดสินใจเรื่องเหล่านี้อย่างชัดเจนจะเอาชนะทีมที่ใหญ่กว่าแต่ไม่ทำ

ต่อไปนี้คือรายการที่เราไล่ตรวจตอนเริ่มโครงการ พร้อมกับการตัดสินใจที่แต่ละข้อบังคับให้ต้องทำ เราเขียนให้เป็นรูปธรรมโดยตั้งใจ เพราะนี่คือคำถามที่เราจะถามคุณจริง ๆ

ภาพรวมโดยย่อ

ระบบการเขียน
ใช้พร้อมกันสี่แบบ — คันจิ ฮิรางานะ คาตากานะ และอักษรละติน — และมักอยู่ในประโยคเดียวกัน
ขอบเขตของคำ
ไม่มี การตัดคำเกิดจากตัววิเคราะห์หน่วยคำ และตัววิเคราะห์แต่ละตัวก็ตัดไม่ตรงกัน
ความสุภาพ
บังคับทางไวยากรณ์ ทุกรูปลงท้ายประโยคเข้ารหัสความสัมพันธ์ทางสังคมไว้
ประธาน
ถูกละเป็นปกติและต้องกู้กลับมาจากบริบท ซึ่งบางครั้งอยู่ย้อนหลังไปหลายประโยค
ผลในทางปฏิบัติ
ข้อบกพร่องของข้อมูลภาษาญี่ปุ่นส่วนใหญ่คือการตัดสินใจที่ยังไม่ได้ทำ ไม่ใช่ความผิดพลาดของผู้กำกับข้อมูล

ความยาก

คุณสมบัติเจ็ดประการที่หักล้างสมมติฐานแบบยึดภาษาอังกฤษเป็นหลัก

แต่ละข้อเป็นคุณสมบัติของภาษา ไม่ใช่ความแปลกของชุดข้อมูลใดชุดหนึ่ง มันจะปรากฏในทุกโครงการภาษาญี่ปุ่นที่คุณทำ

ระบบการเขียนสี่แบบพร้อมกัน

คำเดียวกันเขียนได้ทั้งด้วยคันจิ ฮิรางานะ คาตากานะ หรืออักษรละติน และทั้งสี่แบบปรากฏในประโยคเดียวกันได้ 卵, たまご และ タマゴ คือคำเดียวกันแต่ให้ความรู้สึกต่างกัน ส่วน コンピュータ กับ コンピューター ต่างกันหนึ่งอักขระและเป็นมาตรฐานทั้งคู่

เราจัดการอย่างไร ข้อตกลงการปรับมาตรฐานระบุรูปเขียนที่ต้องใช้สำหรับคำที่พบบ่อย กำหนดค่าเริ่มต้นสำหรับคำที่เหลือ และกำหนดวิธีจัดการสระเสียงยาวและอักขระเต็มความกว้างหรือครึ่งความกว้าง เรื่องอื่น ๆ สืบทอดจากเอกสารฉบับนั้น

ไม่มีการเว้นวรรคระหว่างคำ

ข้อความภาษาญี่ปุ่นเป็นสายอักขระที่ไม่มีการแบ่ง ขอบเขตของคำเกิดจากตัววิเคราะห์หน่วยคำ และ MeCab, Sudachi กับ Juman++ ตัดประโยคเดียวกันต่างกัน ช่วงข้อความที่กำกับตามตัวหนึ่งจึงอาจไม่ตรงแนวกับอีกตัวหนึ่ง

เราจัดการอย่างไร กำหนดตัววิเคราะห์และพจนานุกรมให้ตายตัวก่อนเริ่มกำกับข้อมูล เก็บช่วงข้อความเป็นตำแหน่งอักขระเพื่อให้อยู่รอดเมื่อเปลี่ยนตัวตัดคำ และตรวจสอบว่าไม่มีช่วงข้อความใดจบลงกลางโทเคน

ความสุภาพที่เป็นข้อบังคับ

ไวยากรณ์ภาษาญี่ปุ่นบังคับให้ต้องเลือกระดับความสุภาพในเกือบทุกประโยค 尊敬語 ยกย่องอีกฝ่าย 謙譲語 ถ่อมตัวผู้พูด ส่วน 丁寧語 คือระดับสุภาพที่เป็นกลาง ตัวเลือกที่ถูกต้องขึ้นอยู่กับความสัมพันธ์ ไม่ใช่เนื้อหา

เราจัดการอย่างไร เลือกระดับภาษาเริ่มต้นหนึ่งแบบต่อหนึ่งจุดสัมผัสของผลิตภัณฑ์ ระบุข้อยกเว้น และให้คะแนนระดับภาษาเป็นเกณฑ์ของตัวเองในการตรวจทาน เพื่อไม่ให้คำตอบที่มีเนื้อหาดีแต่ใช้ระดับภาษาผิดผ่านไปได้

การละประธานและกรรม

ภาษาญี่ปุ่นละสิ่งที่บริบทกู้กลับมาได้ คำตอบที่เขียนแบบแยกส่วนจึงมักไปผูกกับสิ่งอ้างอิงผิดตัว และในบทสนทนาหลายรอบ สิ่งอ้างอิงที่แท้จริงอาจอยู่ย้อนหลังไปหลายรอบ

เราจัดการอย่างไร กำกับและตรวจทานบทสนทนาเป็นหน่วยเดียวทั้งบท แทนที่จะทำทีละรอบ และถือว่าสิ่งอ้างอิงที่กู้กลับมาไม่ได้จริง ๆ เป็นข้อบกพร่องของรายการนั้น ไม่ใช่สิ่งที่ควรเดา

ความอ้อมค้อมในฐานะไวยากรณ์ของการปฏิเสธ

การปฏิเสธมักแสดงออกในรูปของการบอกว่ายากหรือติดขัด それはちょっと難しいです คือการปฏิเสธ ส่วน ちょっと考えさせてください ก็มักเป็นการปฏิเสธ การอ่านตามตัวอักษรทำให้ความหมายกลับด้าน

เราจัดการอย่างไร นิยามหมวดหมู่ของการปฏิเสธและระดับความหนักแน่นที่ตั้งใจไว้พร้อมตัวอย่างประกอบ และให้คะแนนการปฏิเสธจากว่าผู้พูดภาษาญี่ปุ่นอ่านแล้วเข้าใจว่าเป็นการปฏิเสธหรือไม่ — ไม่ใช่จากว่ามีคำปฏิเสธอยู่ในประโยคหรือไม่

ชื่อที่มีรูปการอ่านถูกต้องได้หลายแบบ

ชื่อบุคคลหรือชื่อสถานที่ภาษาญี่ปุ่นที่เขียนด้วยคันจิมักอ่านได้หลายแบบ และแบบที่ถูกต้องเป็นข้อเท็จจริงเกี่ยวกับบุคคลนั้น ไม่ใช่กฎ 東海林 อ่านว่า Shoji หรือ Tokairin ก็ได้ ทั้งสองเป็นนามสกุลที่มีอยู่จริง

เราจัดการอย่างไร เก็บรูปการอ่านเป็นฟิลด์แยกแทนที่จะอนุมานเอา ตรวจสอบกับแหล่งข้อมูล และกำกับรูปการอ่านที่ยืนยันไม่ได้ว่ายังไม่ได้รับการยืนยัน แทนที่จะเลือกแบบที่พบบ่อยที่สุด

ระดับภาษาเฉพาะสาขาที่ต่างจากภาษาญี่ปุ่นทั่วไป

ภาษาญี่ปุ่นด้านกฎหมาย ภาษี การแพทย์ และงานราชการ ใช้คำศัพท์ โครงสร้างประโยค และสำนวนตามธรรมเนียมของตัวเอง ความคล่องแคล่วในภาษาญี่ปุ่นที่ใช้ในชีวิตประจำวันไม่เพียงพอที่จะตัดสินว่าข้อสัญญาหรือคำอธิบายด้านภาษีใช้ถ้อยคำถูกต้องหรือไม่

เราจัดการอย่างไร จับคู่ผู้กำกับข้อมูลให้ตรงกับระดับภาษาที่ข้อมูลนั้นเขียนขึ้น และดึงผู้เชี่ยวชาญเฉพาะสาขาเข้ามาเมื่อการตัดสินที่ต้องทำเป็นการตัดสินเชิงวิชาชีพ ไม่ใช่เชิงภาษา

ตัวอย่างประกอบ

หนึ่งวลี ห้าความหมาย

วลีด้านล่างเป็นวลีธรรมดา สุภาพ และพบบ่อยมาก ว่าความหมายใดในห้าแบบนี้ใช้ได้ ขึ้นอยู่กับสถานการณ์รอบตัวมันล้วน ๆ ซึ่งนั่นคือข้อมูลที่แนวทางการกำกับข้อมูลต้องจัดหาให้พอดี

Daijōbu desu.

หนึ่งวลี หลายความหมาย

วางเคอร์เซอร์บนแต่ละความหมาย เพื่อดูบริบทที่ทำให้เกิดความหมายนั้น

นี่คือตัวอย่างเดียวกับที่ใช้ในหน้าแรก อยู่ตรงนี้เพราะเป็นภาพประกอบชิ้นเดียวที่ชัดที่สุดว่าทำไมบริบท ไม่ใช่คำศัพท์ จึงเป็นส่วนที่ยากของการกำกับข้อมูลภาษาญี่ปุ่น

ข้อกำหนด

สิ่งที่ควรเขียนไว้เป็นเอกสารก่อนเริ่มงาน

ทุกข้อต่อไปนี้ หากไม่เขียนไว้ ก็จะถูกตัดสินโดยปริยายและตัดสินต่างกันไปโดยทุกคนที่แตะข้อมูลนั้น

  • คำที่พบบ่อยแต่ละคำเขียนด้วยรูปเขียนใด และกฎเริ่มต้นสำหรับคำที่ไม่อยู่ในรายการ
  • ตัวเลขใช้เลขอารบิกหรือคันจิ และลักษณนาม วันที่ จำนวนเงิน และเวลา เขียนอย่างไร
  • ตัววิเคราะห์หน่วยคำและพจนานุกรมที่ใช้นิยามขอบเขตของช่วงข้อความ
  • คำนำหน้าและคำต่อท้ายที่ระบุรูปแบบนิติบุคคลอย่าง 株式会社 อยู่ในหรือนอกช่วงข้อความขององค์กร
  • นโยบายช่วงข้อความแบบยาวที่สุดหรือสั้นที่สุดสำหรับคำนามประสม และจุดที่อนุญาตให้ซ้อนกันได้
  • ระดับความสุภาพเริ่มต้น ข้อยกเว้นของมัน และการปฏิเสธที่ถูกต้องมีหน้าตาอย่างไร
  • การปรับมาตรฐานอักขระเต็มความกว้างและครึ่งความกว้าง ว่าอะไรถูกแปลง และอะไรถูกคงไว้ตามเดิมทุกประการ
  • วันที่ตามรัชศกถูกบันทึกอย่างไร และจะเก็บค่าที่แปลงเป็นคริสต์ศักราชไว้คู่กันหรือไม่
  • จะทำอย่างไรกับรายการที่กำกวมจริง ๆ — ติดธง ส่งต่อให้ผู้ตัดสิน หรือคัดออก

อภิธานศัพท์

คำศัพท์ที่ปรากฏในแนวทางการกำกับข้อมูลภาษาญี่ปุ่น

คำศัพท์ที่คุณจะพบในเอกสารข้อกำหนดข้อมูลภาษาญี่ปุ่น นิยามตามที่ใช้จริงในงานกำกับข้อมูล

Keigo
ระบบภาษายกย่องของญี่ปุ่นโดยรวม ครอบคลุมทั้งรูปยกย่อง รูปถ่อมตน และรูปสุภาพ การใช้เป็นข้อบังคับทางไวยากรณ์ ไม่ใช่ทางเลือก ทุกประโยคจึงเข้ารหัสท่าทีทางสังคมไว้
Sonkeigo
ภาษายกย่องที่เชิดชูบุคคลที่ถูกกล่าวถึง ใช้กับลูกค้า คู่ค้า หรือผู้บังคับบัญชา — ไม่ใช้กับตัวเองเด็ดขาด
Kenjougo
ภาษาถ่อมตนที่ลดตัวผู้พูดหรือกลุ่มของผู้พูดลงเมื่อเทียบกับผู้ฟัง เป็นมาตรฐานในการสื่อสารทางธุรกิจของญี่ปุ่นเมื่อพูดถึงการกระทำของตนเอง
Teineigo
ระดับสุภาพธรรมดา สังเกตได้จากรูปลงท้ายประโยคแบบ ですます เป็นค่าเริ่มต้นที่ใช้กันทั่วไปสำหรับผลลัพธ์ AI ที่สื่อสารกับผู้บริโภคเป็นภาษาญี่ปุ่น
Wakachigaki
การเขียนโดยเว้นวรรคระหว่างคำ ไม่ใช่มาตรฐานของภาษาญี่ปุ่น ซึ่งเป็นเหตุผลที่การตัดคำต้องเกิดจากตัววิเคราะห์หน่วยคำ ไม่ใช่อ่านจากตัวข้อความได้เลย
ตัววิเคราะห์หน่วยคำ
เครื่องมือที่ตัดข้อความภาษาญี่ปุ่นออกเป็นหน่วยคำและกำกับชนิดของคำ MeCab, Sudachi และ Juman++ เป็นตัวเลือกที่ใช้กันทั่วไป และทั้งสามไม่ได้ให้ผลตรงกันเสมอไป
Furigana / ruby
คานะตัวเล็กที่พิมพ์อยู่เหนือหรือข้างคันจิเพื่อบอกการอ่าน เป็นคำกำกับการออกเสียงมากกว่าเนื้อหา จึงต้องมีวิธีแทนของตัวเองในข้อความที่กำกับแล้ว
Okurigana
คานะที่เขียนต่อท้ายคันจิเพื่อแสดงการผันคำ คำเดียวกันมักเขียนได้หลายแบบ ซึ่งเป็นแหล่งของความแปรผันในรูปเขียนที่พบบ่อย
Hyoukiyure
ความแปรผันของรูปเขียน คือคำเดียวกันปรากฏด้วยระบบการเขียนหรือรูปสะกดต่างกันตลอดคลังข้อมูล เป็นข้อบกพร่องที่พบบ่อยที่สุดในชุดข้อมูลภาษาญี่ปุ่นที่ไม่ได้กำหนดข้อกำหนดไว้
Zenkaku / hankaku
รูปอักขระแบบเต็มความกว้างและครึ่งความกว้าง A กับ A เป็นคนละอักขระที่หน้าตาแทบเหมือนกัน การปรับมาตรฐานจึงต้องระบุไว้อย่างชัดเจน
Josuushi
ลักษณนามที่ต่อท้ายตัวเลข และเปลี่ยนไปตามชนิดของสิ่งที่นับ รูปการอ่านของมันไม่เป็นระบบ ซึ่งสำคัญเป็นพิเศษกับข้อมูลเสียงพูด
Zero anaphora
ประธานหรือกรรมที่ถูกละและต้องกู้กลับมาจากบริบท พบได้ทั่วไปในภาษาญี่ปุ่น และเป็นสาเหตุที่ทำให้ข้อความที่โมเดลสร้างขึ้นผูกกับสิ่งอ้างอิงผิดตัวอยู่บ่อยครั้ง
Kyuujitai
รูปคันจิก่อนการปฏิรูปอักษร ซึ่งยังพบในเอกสารเก่า บันทึกทางกฎหมาย และชื่อบุคคลบางชื่อ ต้องคงไว้ตามเดิมแทนที่จะปรับมาตรฐาน เมื่อมันใช้ระบุตัวบุคคลหรือนิติบุคคลที่จดทะเบียนไว้
Wareki
วันที่ตามรัชศกของญี่ปุ่น เช่น 令和6年 พบบ่อยในเอกสารราชการและแบบฟอร์ม และมักปรากฏคู่กับวันที่แบบคริสต์ศักราชบนหน้าเดียวกัน

คำถามที่พบบ่อย

เกี่ยวกับข้อมูลภาษาญี่ปุ่น

คำถามจากทีมที่กำลังสร้างชุดข้อมูลภาษาญี่ปุ่นชุดแรก

สำหรับพรอมป์ต์และไอเดียของงาน การแปลเป็นโครงร่างที่สมเหตุสมผล แต่สำหรับคำตอบนั้นไม่ใช่ ภาษาญี่ปุ่นที่แปลมาจะพาโครงสร้างประโยค สมมติฐานเรื่องความสุภาพ และนิสัยการจัดรูปแบบของภาษาอังกฤษติดมาด้วย และเจ้าของภาษาบอกว่าโมเดลที่ฝึกด้วยข้อมูลแบบนั้นฟังดูเหมือนงานแปล การแปลยังไม่สามารถสร้างปรากฏการณ์ที่มีเฉพาะในภาษาญี่ปุ่นได้ ทั้งความสม่ำเสมอของภาษายกย่อง การปฏิเสธโดยอ้อม และความแปรผันของรูปเขียน ซึ่งล้วนเป็นพฤติกรรมที่คุณกำลังพยายามสอนอยู่พอดี

สำหรับอะไรก็ตามที่เกี่ยวกับระดับภาษา ความหนักแน่นของการปฏิเสธ หรือความหมายเชิงวัจนปฏิบัติ วิจารณญาณของเจ้าของภาษาไม่ใช่ของแถม การที่ それはちょっと難しいです อ่านแล้วเป็นการปฏิเสธหรือไม่ เป็นข้อเท็จจริงว่าประโยคนั้นตกกระทบผู้ฟังที่เป็นเจ้าของภาษาอย่างไร และผู้ที่ไม่ใช่เจ้าของภาษาแม้จะเก่งมากก็อาจวิเคราะห์ถูกแต่ประเมินความหนักแน่นผิดได้ ส่วนงานเชิงกลไกที่มีแนวทางกำหนดไว้ชัดเจน ความสามารถระดับสูงมักเพียงพอ

สำคัญทุกครั้งที่ป้ายกำกับเป็นช่วงข้อความ ตัววิเคราะห์แต่ละตัววางขอบเขตต่างกัน ช่วงข้อความที่กำกับตามการตัดคำแบบหนึ่งจึงอาจตกอยู่กลางโทเคนของอีกแบบหนึ่ง และการกำกับแบบ BIO จะขยับมันไปเงียบ ๆ การเก็บตำแหน่งอักขระไว้คู่กับรูปแบบแท็กคือสิ่งที่ทำให้ข้อมูลอยู่รอดเมื่อเปลี่ยนตัวตัดคำในภายหลังโดยไม่ต้องกำกับข้อมูลใหม่

ต่อรายการก็มักจะใช่ เพราะงานกำหนดข้อกำหนดใหญ่กว่า กลุ่มผู้กำกับข้อมูลเล็กกว่า และงานจำนวนมากขึ้นต้องผ่านการตรวจทานโดยเจ้าของภาษาคนที่สอง สิ่งที่ชดเชยกันคือข้อมูลภาษาญี่ปุ่นที่กำหนดข้อกำหนดไว้ดีให้ผลต่อรายการมากกว่า เพราะส่วนใหญ่ของสิ่งที่โมเดลกำลังเรียนรู้คือสไตล์ที่สม่ำเสมอ และความสม่ำเสมอเกิดจากข้อกำหนด ไม่ใช่จากปริมาณ

ตัวอย่างข้อมูลจริงของคุณ รวมถึงส่วนที่คุณคิดว่ายุ่งเหยิง พร้อมคำอธิบายว่าโมเดลควรทำอะไรกับมัน เท่านี้ก็เพียงพอให้เราร่างการตัดสินใจที่ระบุไว้ข้างต้น กำกับข้อมูลชุดนำร่องเล็ก ๆ และแสดงให้คุณเห็นว่าผู้กำกับข้อมูลที่มีเหตุผลสองคนเห็นต่างกันตรงไหน ซึ่งเป็นวิธีที่เร็วที่สุดในการค้นหาว่าข้อกำหนดของคุณยังขาดอะไร

ข้อมูลภาษาญี่ปุ่น

ส่วนที่ยากคือข้อกำหนด เริ่มจากตรงนั้น

ส่งตัวอย่างข้อมูลและสิ่งที่คุณอยากให้โมเดลทำมาให้เรา แล้วเราจะตอบกลับด้วยการตัดสินใจที่แนวทางของคุณจะต้องทำ และโครงการนำร่องที่ทดสอบการตัดสินใจเหล่านั้น

ลงนาม NDA ก่อนที่คุณจะส่งข้อมูลใด ๆ การกำหนดขอบเขตโครงการนำร่องไม่มีค่าใช้จ่าย