NLP ภาษาญี่ปุ่น

การกำกับข้อมูล NLP ภาษาญี่ปุ่น — เอนทิตี ความสัมพันธ์ และการจำแนกประเภท

การรู้จำเอนทิตีที่มีชื่อ การสกัดความสัมพันธ์ การจำแนกเจตนาและหัวข้อ ความรู้สึก การอนุมานทางภาษาธรรมชาติ และการตัดคำ — กำกับด้วยตัวตัดคำที่ไปป์ไลน์ของคุณใช้จริง

ภาษาญี่ปุ่นไม่มีการเว้นวรรคระหว่างคำ การกำกับช่วงข้อความทุกครั้งจึงขึ้นอยู่กับการตัดสินใจเรื่องขอบเขตที่ต้องมีคนตัดสิน และการตัดสินใจนั้นต้องตรงกับตัวตัดคำที่ใช้ในขั้นถัดไป มิฉะนั้นป้ายกำกับจะไม่ตรงแนวกัน

ขอบเขตคือปัญหาทั้งหมด

ในภาษาอังกฤษ "Toyota Motor Corporation" มีสามโทเคนที่เห็นได้ชัด และคำถามเดียวคือเอนทิตีเริ่มและจบตรงไหน แต่ในภาษาญี่ปุ่น 株式会社トヨタ自動車 เป็นสายอักขระที่ไม่มีการเว้นวรรค และมีวิธีกำกับที่มีเหตุผลรองรับอย่างน้อยสี่แบบ คือรวมหรือไม่รวม 株式会社 รวมหรือไม่รวม 自動車 มองทั้งหมดเป็นเอนทิตีเดียว หรือซ้อนเอนทิตีที่สั้นกว่าไว้ในเอนทิตีที่ยาวกว่า

ทุกแบบล้วนเป็นตัวเลือกที่ชอบธรรม สิ่งที่สำคัญคือต้องเลือกแบบเดิมทุกครั้ง ต้องเขียนไว้เป็นเอกสาร และต้องอยู่รอดเมื่อเจอกับตัวตัดคำที่โมเดลของคุณใช้ เพราะขอบเขตของช่วงข้อความที่ตกอยู่กลางโทเคนไม่สามารถแทนในการกำกับแบบ BIO ได้โดยไม่ขยับตำแหน่งไปเงียบ ๆ

นี่คือเหตุผลที่เรากำหนดตัวตัดคำและกฎเรื่องขอบเขตให้ตายตัวก่อนเริ่มกำกับข้อมูล และเหตุผลที่เรากำกับตำแหน่งอักขระไว้ข้างใต้รูปแบบแท็กใดก็ตามที่คุณต้องการ ข้อมูลจึงนำไปตัดคำใหม่ในภายหลังได้โดยไม่ต้องกำกับข้อมูลใหม่

ภาพรวมโดยย่อ

ประเภทงาน
NER การสกัดความสัมพันธ์และเหตุการณ์ การจำแนกเจตนาและหัวข้อ ความรู้สึกและอารมณ์ NLI และการถอดความ การตัดคำและการปรับมาตรฐาน
รู้จักตัวตัดคำ
กำกับช่วงข้อความโดยอิงกับ MeCab, Sudachi, Juman++ หรือตัวตัดคำของโมเดลคุณเอง ตามที่ตกลงกันตั้งแต่ช่วงเริ่มโครงการ
กฎเรื่องขอบเขต
คำต่อท้ายชื่อนิติบุคคล คำนามประสม คำนำหน้าแสดงความสุภาพ และการผันคำ ล้วนครอบคลุมด้วยกฎที่เป็นลายลักษณ์อักษร
ผลลัพธ์ที่ใช้บ่อย
JSONL พร้อมตำแหน่งอักขระ รองรับ CoNLL-U การกำกับแบบ BIO และ brat standoff ด้วย
การตรวจทาน
ตรวจขอบเขตของช่วงข้อความและป้ายกำกับของช่วงข้อความเป็นคนละเกณฑ์กัน

ประเภทงาน

สิ่งที่เรากำกับ

งานระดับช่วงข้อความและงานระดับเอกสารมีรูปแบบความล้มเหลวต่างกัน จึงใช้เกณฑ์การตรวจทานคนละชุด

การรู้จำเอนทิตีที่มีชื่อ

ช่วงข้อความของเอนทิตีตามระบบหมวดหมู่ที่นิยามไว้สำหรับสาขาของคุณ รวมถึงเอนทิตีที่ซ้อนกันและทับซ้อนกันในกรณีที่คุณต้องการ

  • ประเภทมาตรฐานและประเภทเฉพาะสาขา
  • ช่วงข้อความที่ซ้อนกันและไม่ต่อเนื่อง
  • การปรับให้เป็นรูปมาตรฐาน
  • การเชื่อมโยงรูปการอ่านและรูปแปร

การสกัดความสัมพันธ์และเหตุการณ์

เอนทิตีเชื่อมโยงกันอย่างไร — ใครทำอะไรกับใคร ค่าใดเป็นของฟิลด์ใด อนุประโยคใดขยายคำใด

  • ความสัมพันธ์แบบสองทางและหลายทาง
  • ตัวกระตุ้นเหตุการณ์และอาร์กิวเมนต์
  • ความสัมพันธ์ข้ามประโยค
  • การกำกับการปฏิเสธและความไม่แน่นอน

การจำแนกประเภท

เจตนา หัวข้อ หมวดหมู่สำหรับส่งต่องาน หรือป้ายกำกับตามนโยบาย ในระดับถ้อยคำหรือระดับเอกสาร ทั้งแบบป้ายเดียวและหลายป้าย

  • เจตนาและวัจนกรรมในบทสนทนา
  • หัวข้อและหมวดหมู่สำหรับส่งต่องาน
  • ระบบหมวดหมู่แบบหลายป้ายกำกับ
  • การจัดการกรณีนอกขอบเขตและกรณีไม่ชัดเจน

ความรู้สึกและอารมณ์

ขั้วความรู้สึกและอารมณ์ในระดับเอกสาร ระดับประโยค หรือระดับแง่มุม ซึ่งระดับหลังสุดคือระดับที่ข้อความธุรกิจภาษาญี่ปุ่นต้องการจริง ๆ

  • ขั้วความรู้สึกระดับเอกสารและระดับประโยค
  • ความรู้สึกแยกตามแง่มุม
  • หมวดหมู่ของอารมณ์
  • การกำกับความสุภาพและระดับภาษา

การอนุมานและความคล้ายคลึง

คู่ข้อความสำหรับการเป็นเหตุเป็นผล การถอดความ และความคล้ายคลึงเชิงความหมาย พร้อมตัวอย่างเชิงลบที่ยากซึ่งทำให้ชุดประเมินผลแยกความสามารถได้

  • คู่ข้อความแบบ NLI
  • การระบุการถอดความ
  • คะแนนความคล้ายคลึงแบบมีระดับ
  • การสร้างตัวอย่างเชิงลบที่ยาก

ประเด็นเฉพาะภาษาญี่ปุ่น

กฎที่แนวทางภาษาญี่ปุ่นต้องมี

คำถามสี่ข้อนี้เกิดขึ้นภายในชั่วโมงแรกของทุกโครงการกำกับช่วงข้อความภาษาญี่ปุ่น

ขอบเขตของคำ

ภาษาญี่ปุ่นเขียนโดยไม่เว้นวรรค ขอบเขตของช่วงข้อความจึงเป็นการใช้วิจารณญาณ ไม่ใช่การเปิดพจนานุกรมดู ตัววิเคราะห์หน่วยคำแต่ละตัวตัดประโยคเดียวกันต่างกัน และป้ายกำกับที่จัดแนวกับตัวหนึ่งจะไม่ตรงกับอีกตัวหนึ่ง

เราจัดการอย่างไร ตัววิเคราะห์และพจนานุกรมถูกกำหนดตายตัวตั้งแต่ช่วงเริ่มโครงการ ช่วงข้อความถูกเก็บเป็นตำแหน่งอักขระเพื่อให้อยู่รอดเมื่อตัดคำใหม่ และข้อตกลงเรื่องขอบเขตถูกระบุไว้พร้อมตัวอย่างประกอบ

ชื่อบริษัทและชื่อองค์กร

株式会社 อยู่หน้าหรือหลังชื่อบริษัทก็ได้ ปรากฏในรูปย่อ (株) ก็ได้ หรือถูกละไว้ทั้งหมดก็ได้ การนับหรือไม่นับมันเข้าไปในช่วงข้อความของเอนทิตีเปลี่ยนผลการจับคู่ข้อความในขั้นถัดไปทั้งหมด

เราจัดการอย่างไร กฎข้อเดียวครอบคลุมทั้งคำนำหน้าและคำต่อท้ายที่ระบุรูปแบบนิติบุคคล รูปย่อ และรูปที่อยู่ในวงเล็บ พร้อมบันทึกรูปมาตรฐานไว้คู่กับช่วงข้อความที่ปรากฏจริง

คำนามประสม

ภาษาญี่ปุ่นต่อคำนามเข้าด้วยกันโดยไม่มีตัวคั่น — 個人情報保護管理者 เป็นสายอักขระเดียวที่มีหน่วยความหมายอย่างน้อยสามหน่วย จุดที่เอนทิตีสิ้นสุดจึงเป็นการตัดสินใจ ไม่ใช่ข้อเท็จจริง

เราจัดการอย่างไร แนวทางกำหนดนโยบายช่วงข้อความแบบยาวที่สุดหรือสั้นที่สุดสำหรับเอนทิตีแต่ละประเภท พร้อมอนุญาตให้ซ้อนกันได้ในกรณีที่จำเป็นจริง ๆ แทนที่จะปล่อยให้ผู้กำกับข้อมูลแต่ละคนเลือกเอง

การผันคำและคำช่วยที่ติดมา

คำกริยาและคำคุณศัพท์มีการผัน และคำช่วยติดอยู่กับคำที่มันกำกับโดยตรง การรวมหรือไม่รวมมันทำให้ขอบเขตของช่วงข้อความขยับไปหนึ่งถึงสองอักขระตลอดทั้งคลังข้อมูล

เราจัดการอย่างไร กฎระบุชัดเจนว่าส่วนท้ายที่ผันและคำช่วยที่ติดมาอยู่ในหรือนอกช่วงข้อความ และมีการตรวจสอบอัตโนมัติที่ติดธงช่วงข้อความซึ่งจบลงกลางโทเคน

กระบวนการ

โครงการ NLP ดำเนินไปอย่างไร

คุณค่าส่วนใหญ่เกิดขึ้นก่อนเริ่มกำกับข้อมูล คืออยู่ที่ระบบหมวดหมู่และกฎเรื่องขอบเขต

  1. 01

    กำหนดระบบหมวดหมู่และตัวตัดคำ

    เราตกลงร่วมกันเรื่องชุดป้ายกำกับ ตัววิเคราะห์และพจนานุกรม และวิธีแทนช่วงข้อความ เพื่อให้การกำกับข้อมูลตรงกับไปป์ไลน์ปลายทาง

  2. 02

    ค้นหากรณีก้ำกึ่ง

    เรากำกับข้อมูลตัวอย่างชุดเล็กเพื่อดึงโครงสร้างที่กำกวมจริง ๆ ในสาขาของคุณออกมา สิ่งเหล่านี้จะกลายเป็นตัวอย่างประกอบในแนวทาง

  3. 03

    ปรับเทียบและวัดความสอดคล้อง

    ผู้กำกับข้อมูลติดป้ายกำกับชุดเดียวกันอย่างเป็นอิสระ เราวัดความสอดคล้องของขอบเขตและของป้ายกำกับแยกกัน เพราะทั้งสองอย่างผิดพลาดด้วยเหตุผลคนละอย่าง

  4. 04

    กำกับข้อมูลและชี้ขาด

    งานกำกับข้อมูลระดับโปรดักชันพร้อมรอบการตรวจทาน และการชี้ขาดข้อขัดแย้งเป็นลายลักษณ์อักษรที่ป้อนกลับเข้าแนวทางโดยตรง

  5. 05

    ส่งมอบพร้อมตำแหน่งอักขระ

    ข้อมูลส่งมอบพร้อมตำแหน่งอักขระและรูปแบบแท็กที่คุณเลือก เวอร์ชันของระบบหมวดหมู่ จำนวนรายป้ายกำกับ และรายงาน QA

การส่งมอบ

รูปแบบและการแทนข้อมูล

ตำแหน่งอักขระรวมอยู่ด้วยเสมอไม่ว่าคุณจะรับรูปแบบใด ข้อมูลจึงนำไปตัดคำใหม่ได้โดยไม่ต้องกำกับข้อมูลใหม่

รูปแบบผลลัพธ์ที่ใช้บ่อยสำหรับการกำกับข้อมูล NLP ภาษาญี่ปุ่น
งานผลลัพธ์เริ่มต้นรูปแบบอื่นที่รองรับ
เอนทิตีที่มีชื่อJSONL พร้อมตำแหน่งอักขระCoNLL-U, BIO / BILOU, brat standoff
ความสัมพันธ์และเหตุการณ์JSONL พร้อมการอ้างอิงช่วงข้อความbrat standoff, JSON แบบกราฟที่กำหนดเอง
การจำแนกประเภทJSONL หรือ CSVเมทริกซ์แบบ one-hot หรือแบบหลายป้ายกำกับ
ความรู้สึกJSONL พร้อมช่วงข้อความของแง่มุมCSV, ป้ายกำกับรายประโยค
NLI และความคล้ายคลึงคู่ข้อความแบบ JSONLCSV, TSV ในโครงสร้างแบบเบนช์มาร์ก

คุณภาพ

การควบคุมที่เฉพาะกับงานนี้

ชุดข้อมูลช่วงข้อความอาจมีความแม่นยำของป้ายกำกับดีเยี่ยมแต่ขอบเขตใช้งานไม่ได้ เราวัดทั้งสองอย่าง

  • รายงานความสอดคล้องของขอบเขตและความสอดคล้องของป้ายกำกับเป็นตัวเลขคนละตัว
  • ตรวจสอบอัตโนมัติว่าไม่มีช่วงข้อความใดจบลงกลางโทเคนภายใต้ตัววิเคราะห์ที่ตกลงกันไว้
  • ติดตามจำนวนรายป้ายกำกับในแต่ละชุดงาน เพื่อให้รู้ตัวขณะที่ยังแก้ไขได้หากคลาสที่พบยากเริ่มเบาบางลง
  • ตรวจสอบช่วงข้อความที่ซ้อนกันและทับซ้อนกันตามกฎการซ้อนของระบบหมวดหมู่ แทนที่จะยอมรับไปโดยไม่ตรวจ
  • ชุดข้อมูลมาตรฐานที่กำกับโดยผู้ตรวจทานอาวุโสและนำมารันซ้ำเป็นระยะ เพื่อตรวจจับการเลื่อนไหลในโครงการระยะยาว
  • ทุกข้อขัดแย้งที่ชี้ขาดแล้วถูกบันทึกกลับเข้าแนวทางในฐานะตัวอย่างประกอบ

คำถามที่พบบ่อย

เกี่ยวกับการกำกับข้อมูล NLP ภาษาญี่ปุ่น

คำถามที่เกิดขึ้นตอนกำหนดขอบเขตโครงการกำกับช่วงข้อความภาษาญี่ปุ่น

ตัวเดียวกับที่ไปป์ไลน์ของคุณใช้ ไม่ว่าจะเป็น MeCab กับ IPAdic หรือ UniDic, Sudachi, Juman++ หรือตัวตัดคำระดับหน่วยย่อยจากโมเดลของคุณเอง เรากำหนดให้ตายตัวตั้งแต่ช่วงเริ่มโครงการ เพราะขอบเขตของช่วงข้อความจัดแนวได้กับการตัดคำเพียงแบบเดียว และเราเก็บตำแหน่งอักขระไว้ข้างใต้ การเปลี่ยนตัววิเคราะห์ในภายหลังจึงเป็นแค่การส่งออกใหม่ ไม่ใช่การกำกับข้อมูลใหม่

ได้ และเราอยากใช้ของคุณมากกว่ายัดเยียดของเรา สิ่งที่เราจะทำคือทดสอบมันอย่างหนักบนตัวอย่างก่อน ระบบหมวดหมู่ที่มีอยู่มักมีสองถึงสามหมวดที่กลายเป็นทับซ้อนกันในทางปฏิบัติ และการค้นพบเรื่องนี้ระหว่างโครงการนำร่องถูกกว่าการมาค้นพบหลังจากทำไปแล้วห้าหมื่นรายการมาก

ขึ้นอยู่กับตัวงานล้วน ๆ ประเภทเอนทิตีที่ชัดเจนบนข้อความที่สะอาดจะไปถึงความสอดคล้องสูงได้เร็ว ส่วนความรู้สึกแยกตามแง่มุมและระบบหมวดหมู่เจตนาแบบละเอียดจะไปไม่ถึง และโครงการที่อ้างว่าไปถึงมักกำลังวัดอะไรที่ง่ายกว่าสิ่งที่ส่งมอบจริง เรารายงานตัวเลขจริงรายป้ายกำกับจากโครงการนำร่อง และหากหมวดใดไปไม่ถึงระดับความสอดคล้องที่ใช้งานได้ เราจะบอกตรง ๆ และเสนอให้ปรับหมวดนั้น

รองรับ ในกรณีที่ระบบหมวดหมู่ต้องการจริง ๆ ซึ่งเหตุผลที่พบบ่อยคือคำนามประสมและชื่อองค์กรภาษาญี่ปุ่น กฎการซ้อนถูกเขียนไว้ในแนวทางและตรวจสอบโดยอัตโนมัติ เพราะการซ้อนที่อนุญาตแต่ไม่ได้ระบุรายละเอียดเป็นแหล่งของความไม่สม่ำเสมอที่แน่นอน

ได้ การแก้ไขผลลัพธ์ของโมเดลมีประสิทธิภาพสำหรับงานปริมาณมาก โดยมีข้อควรระวังเดียวกับที่อื่น คือรอบการแก้ไขมักรับเอาจุดบอดของโมเดลมาด้วย เราวัดผลของรอบการแก้ไขเทียบกับตัวอย่างที่กำกับใหม่ทั้งหมด เพื่อให้คุณรู้ว่ามันจับข้อผิดพลาดได้จริงเท่าใด ส่วนชุดข้อมูลสำหรับประเมินผล เรากำกับขึ้นใหม่ทั้งหมด

ข้อความและ NLP

ส่งระบบหมวดหมู่มา แล้วเราจะหากรณีก้ำกึ่งของมันให้

ส่งชุดป้ายกำกับและตัวอย่างข้อความภาษาญี่ปุ่นจริงมาให้เรา เราจะกำกับข้อมูลชุดนำร่อง รายงานความสอดคล้องของขอบเขตและป้ายกำกับ และบอกคุณว่าหมวดใดจะไปไม่รอดเมื่อทำในปริมาณมาก

ลงนาม NDA ก่อนที่คุณจะส่งข้อมูลใด ๆ การกำหนดขอบเขตโครงการนำร่องไม่มีค่าใช้จ่าย