ภาพและมัลติโมดัล

การกำกับข้อมูลภาพ วิดีโอ และเอกสารภาษาญี่ปุ่น

Bounding box รูปหลายเหลี่ยม การแบ่งส่วนภาพ จุดสำคัญ การติดตามวัตถุในวิดีโอ OCR และเลย์เอาต์เอกสาร — บนข้อมูลที่ข้อความในภาพเป็นภาษาญี่ปุ่นและเอกสารเป็นไปตามธรรมเนียมธุรกิจของญี่ปุ่น

งานกำกับข้อมูลภาพส่วนใหญ่ไม่ขึ้นกับภาษา แต่ทันทีที่มีข้อความอยู่ในเฟรม หรือมีแบบฟอร์มภาษาญี่ปุ่นอยู่บนหน้ากระดาษ มันก็เลิกเป็นงานที่ไม่ขึ้นกับภาษาอย่างรวดเร็ว

ข้อมูลภาพภาษาญี่ปุ่นต่างออกไปตรงไหน

การตีกรอบรอบรถยนต์เป็นงานเดียวกันไม่ว่าอยู่ประเทศใด แต่การอ่านข้อความบนใบเสร็จภาษาญี่ปุ่นไม่ใช่ เอกสารญี่ปุ่นเขียนแนวตั้งบ่อยพอ ๆ กับแนวนอน ผสมระบบการเขียนสี่แบบไว้ในบรรทัดเดียว ใช้อักษรละตินและตัวเลขแบบเต็มความกว้าง มีฟุริงานะกำกับอยู่เหนือคำที่มันอธิบายการอ่าน และวางตราประทับบริษัทไว้ในตำแหน่งที่แบบฟอร์มตะวันตกคาดว่าจะเป็นลายเซ็น

โครงการ Document AI ล้มเหลวเพราะรายละเอียดเหล่านี้ ไม่ใช่เพราะตัวโมเดล การกำกับเลย์เอาต์ที่มองคอลัมน์แนวตั้งเป็นห้าบรรทัดแยกกัน หรือการถอดข้อความ OCR ที่แปลงตัวเลขเต็มความกว้างเป็นครึ่งความกว้างโดยไม่บอกใคร ล้วนสร้างข้อมูลฝึกสอนที่สอนโมเดลคนละอย่างกับที่คุณตั้งใจ

ข้อความบนหน้าจอและข้อความในสภาพแวดล้อมจริงก็เช่นกัน ทั้งป้ายร้านค้า บรรจุภัณฑ์สินค้า เมนูอาหาร และป้ายในสถานีรถไฟ ล้วนแน่นไปด้วยการจัดวางตัวอักษรแบบญี่ปุ่นที่แนวทางการกำกับข้อมูลทั่วไปไม่ได้กล่าวถึงเลย

ภาพรวมโดยย่อ

ประเภทงาน
การตรวจจับวัตถุ การแบ่งส่วนภาพ จุดสำคัญ การจำแนกประเภท การติดตามวัตถุในวิดีโอ การถอดข้อความด้วย OCR เลย์เอาต์เอกสาร และการสกัดฟิลด์
งานเอกสาร
ใบแจ้งหนี้ ใบเสร็จ ใบสั่งซื้อ สัญญา แบบฟอร์มคำขอ ข้อความที่เขียนด้วยลายมือ และเอกสารที่เขียนแนวตั้ง
การจัดการภาษาญี่ปุ่น
ข้อความแนวตั้ง ฟุริงานะ การผสมระบบการเขียน อักขระเต็มความกว้าง และธรรมเนียมของแบบฟอร์มญี่ปุ่น
ผลลัพธ์ที่ใช้บ่อย
COCO JSON รองรับ YOLO, Pascal VOC, CVAT XML, hOCR และ ALTO ด้วย
การตรวจทาน
ตรวจรูปทรงเรขาคณิตและป้ายกำกับแยกกัน เพราะทั้งสองอย่างผิดพลาดคนละแบบ

ประเภทงาน

สิ่งที่เรากำกับ

รูปทรงเรขาคณิต หมวดหมู่ และข้อความ เป็นคนละชั้นกัน และตรวจทานแยกกัน

การตรวจจับวัตถุและการแบ่งส่วนภาพ

Bounding box กรอบแบบหมุนได้ รูปหลายเหลี่ยม และมาสก์ระดับพิกเซล ตามระบบหมวดหมู่คลาสที่ตกลงกันก่อนเข้าโปรดักชัน

  • Bounding box แบบ 2 มิติและแบบหมุนได้
  • การแบ่งส่วนแบบรูปหลายเหลี่ยมและรายวัตถุ
  • การแบ่งส่วนเชิงความหมาย
  • ธงระบุการถูกบังและการถูกตัดขอบ

จุดสำคัญและคุณลักษณะ

การวางจุดอ้างอิงและคุณลักษณะรายวัตถุ สำหรับงานท่าทาง สถานะสินค้า การประเมินสภาพ และงานละเอียดในลักษณะเดียวกัน

  • จุดสำคัญแบบโครงร่างและจุดอ้างอิง
  • ชุดคุณลักษณะรายวัตถุ
  • การจำแนกประเภทแบบละเอียด
  • ธงระบุการมองเห็นของแต่ละจุด

การกำกับข้อมูลวิดีโอ

การติดตามวัตถุข้ามเฟรมโดยคงตัวตนไว้ให้เสถียร พร้อมการแบ่งช่วงเวลาของการกระทำและเหตุการณ์

  • รหัสติดตามวัตถุหลายชิ้น
  • ช่วงเวลาของการกระทำและเหตุการณ์
  • การตรวจทานการประมาณค่าระหว่างเฟรม
  • การระบุตัวตนซ้ำหลังถูกบัง

OCR และเลย์เอาต์เอกสาร

การตรวจจับพื้นที่ข้อความ ลำดับการอ่าน การถอดข้อความ และบทบาทเชิงโครงสร้างบนเอกสารธุรกิจภาษาญี่ปุ่น

  • การตรวจจับบรรทัดและพื้นที่ข้อความ
  • ลำดับการอ่านสำหรับเลย์เอาต์แนวตั้งและแบบผสม
  • การถอดข้อความตามกฎการปรับมาตรฐาน
  • พื้นที่ตาราง หัวกระดาษ และตราประทับ

การสกัดฟิลด์และความสัมพันธ์

การแปลงเอกสารให้เป็นค่าที่มีโครงสร้าง — ข้อความใดคือยอดรวม วันที่ใดคือวันที่ออกเอกสาร รายการใดจัดอยู่กลุ่มเดียวกัน

  • การกำกับฟิลด์แบบคู่คีย์–ค่า
  • การจัดกลุ่มรายการในตาราง
  • ความสัมพันธ์ข้ามหน้า
  • ธงระบุความเชื่อมั่นและความกำกวม

ประเด็นเฉพาะภาษาญี่ปุ่น

สิ่งที่แนวทางงานภาพแบบทั่วไปมองข้าม

จุดที่เกิดความล้มเหลวซ้ำ ๆ สี่จุดบนข้อมูลภาพและเอกสารภาษาญี่ปุ่น

ข้อความแนวตั้งและลำดับการอ่าน

ภาษาญี่ปุ่นอ่านจากบนลงล่างและขวาไปซ้ายได้พอ ๆ กับซ้ายไปขวา และหน้าเดียวมักผสมทั้งสองแบบ เครื่องมือที่สมมติว่าข้อความเรียงเป็นบรรทัดแนวนอนจะให้ลำดับการอ่านที่ผิดอย่างมั่นใจ

เราจัดการอย่างไร ลำดับการอ่านถูกกำกับไว้อย่างชัดเจน แทนที่จะอนุมานจากตำแหน่งบนหน้า พร้อมกฎสำหรับหน้าที่ผสมแนวการเขียน ข้อความรูบิ และเลย์เอาต์หลายคอลัมน์

ฟุริงานะและข้อความรูบิ

คานะตัวเล็กที่พิมพ์อยู่เหนือหรือข้างคำคันจิคือคำกำกับการออกเสียง ไม่ใช่เนื้อหาเพิ่มเติม หากถอดปนเข้าไปในบรรทัดจะทำให้ข้อความเสียหาย แต่หากตัดทิ้งไปเฉย ๆ ก็จะสูญเสียข้อมูลที่คุณอาจต้องใช้

เราจัดการอย่างไร ข้อความรูบิถูกเก็บเป็นการกำกับข้อมูลที่เชื่อมโยงกับข้อความฐานของมัน จึงเก็บไว้ ตัดออก หรือใช้เป็นป้ายกำกับการอ่านในขั้นถัดไปได้ โดยไม่ต้องกำกับข้อมูลใหม่

อักขระเต็มความกว้างและครึ่งความกว้าง

A123 กับ A123 หน้าตาแทบไม่ต่างกันแต่เป็นคนละอักขระ การปรับมาตรฐานที่ไม่ควบคุมตรงนี้เป็นข้อบกพร่องเงียบที่พบบ่อยที่สุดอย่างหนึ่งในชุดข้อมูล OCR ภาษาญี่ปุ่น

เราจัดการอย่างไร ข้อตกลงการถอดข้อความระบุชัดเจนว่าอักขระใดถูกปรับมาตรฐานและอักขระใดถูกคงไว้ตามเดิม และมีการตรวจสอบอัตโนมัติบังคับใช้ก่อนส่งมอบ

ธรรมเนียมของแบบฟอร์มญี่ปุ่น

ใบแจ้งหนี้ ใบเสร็จ และแบบฟอร์มคำขอของญี่ปุ่นมีคำศัพท์เชิงโครงสร้างของตัวเอง — 御中, 但し書き, ตราประทับบริษัท วันที่ตามรัชศก และยอดรวมที่แสดงทั้งแบบรวมภาษีและไม่รวมภาษีเคียงกัน

เราจัดการอย่างไร สคีมาของฟิลด์ถูกสร้างขึ้นจากตัวอย่างจริงของเอกสารประเภทที่คุณใช้ โดยกำหนดให้วันที่ตามรัชศก พื้นที่ตราประทับ และการจัดการภาษีเป็นฟิลด์ระดับต้น ไม่ใช่ข้อความอิสระ

กระบวนการ

โครงการงานภาพดำเนินไปอย่างไร

ระบบหมวดหมู่และกฎเรื่องรูปทรงเรขาคณิตจะสรุปให้ได้บนตัวอย่างจริงก่อนที่ใครจะเริ่มกำกับข้อมูลในปริมาณมาก

  1. 01

    ดูตัวอย่างและนิยามระบบหมวดหมู่

    เรากำกับข้อมูลชุดเล็กที่เป็นตัวแทนเพื่อค้นหากรณีกำกวม เช่น อะไรนับเป็นวัตถุหนึ่งชิ้น จะทำอย่างไรเมื่อวัตถุอยู่ที่ขอบเฟรม และเมื่อใดที่คลาสของวัตถุไม่ชัดเจนจริง ๆ

  2. 02

    เขียนกฎเรื่องรูปทรงเรขาคณิต

    ความกระชับของกรอบ การจัดการวัตถุที่ถูกบัง ขนาดวัตถุขั้นต่ำ การถูกตัดขอบ วัตถุที่เป็นกลุ่ม และการจัดการข้อความที่อ่านไม่ออก ล้วนถูกกำหนดไว้เป็นลายลักษณ์อักษร

  3. 03

    ปรับเทียบ

    ผู้กำกับข้อมูลหลายคนติดป้ายกำกับภาพชุดเดียวกันอย่างเป็นอิสระ เราวัดความสอดคล้องของรูปทรงเรขาคณิต และจุดที่ค่าต่ำคือจุดที่กฎยังกำกวม

  4. 04

    กำกับข้อมูลและตรวจทาน

    รูปทรงเรขาคณิตและป้ายกำกับถูกตรวจทานเป็นคนละรอบ เพราะกรอบที่กระชับแต่ติดคลาสผิด กับกรอบที่หลวมแต่ติดคลาสถูก เป็นข้อบกพร่องคนละแบบ

  5. 05

    ส่งมอบและรายงาน

    ข้อมูลที่กำกับแล้วส่งมอบในรูปแบบของคุณ พร้อมเวอร์ชันของระบบหมวดหมู่ จำนวนรายคลาส และรายงาน QA ของชุดงานนั้น

การส่งมอบ

รูปแบบขาเข้าและขาออก

เราส่งออกข้อมูลเป็นรูปแบบดั้งเดิมของไปป์ไลน์ฝึกสอนของคุณ แทนที่จะปล่อยให้คุณต้องเขียนตัวแปลงเอง

รูปแบบผลลัพธ์ที่ใช้บ่อยสำหรับงานภาพ วิดีโอ และเอกสาร
งานผลลัพธ์เริ่มต้นรูปแบบอื่นที่รองรับ
การตรวจจับวัตถุและการแบ่งส่วนภาพCOCO JSONYOLO, Pascal VOC, CVAT XML, มาสก์เป็นไฟล์ PNG
จุดสำคัญและคุณลักษณะCOCO keypoints JSONCSV, สคีมา JSON ที่กำหนดเอง
การติดตามวัตถุในวิดีโอรูปแบบ MOTCOCO รายเฟรม, CVAT XML
OCR และเลย์เอาต์JSON พร้อมพิกัดบนหน้ากระดาษhOCR, ALTO, PAGE XML
การสกัดฟิลด์JSONL หนึ่งเอกสารต่อหนึ่งบรรทัดCSV, สคีมา Document AI ของคุณ

คุณภาพ

การควบคุมที่เฉพาะกับงานนี้

ข้อบกพร่องในงานภาพซ่อนตัวเก่ง การตรวจสอบเหล่านี้คือสิ่งที่ทำให้มันโผล่ออกมาก่อนที่การฝึกโมเดลจะเผยให้เห็น

  • วัดความสอดคล้องของรูปทรงเรขาคณิตบนตัวอย่างที่กำกับซ้ำ และรายงานแยกจากความสอดคล้องของป้ายกำกับ
  • ตรวจสอบอัตโนมัติว่ามีกรอบที่ผิดรูป กรอบซ้ำที่ทับกัน หรือวัตถุที่อยู่นอกขอบเขตภาพหรือไม่
  • ตรวจสอบลำดับการอ่านและการเชื่อมโยงข้อความรูบิในทุกหน้าเอกสาร ไม่ใช่แค่สุ่มตรวจ
  • บังคับใช้การปรับมาตรฐานอักขระเต็มความกว้างและครึ่งความกว้างโดยอัตโนมัติตามข้อตกลงที่เขียนไว้
  • ตรวจสอบตัวตนของวัตถุที่ติดตามตลอดทั้งคลิป เพื่อจับกรณีที่ตัวตนสลับกันหลังถูกบัง
  • ตรวจทานจำนวนรายคลาสในทุกชุดงาน เพื่อให้รู้แต่เนิ่น ๆ หากคลาสใดค่อย ๆ หายไปจากข้อมูล

คำถามที่พบบ่อย

เกี่ยวกับภาพ วิดีโอ และเอกสาร

คำถามที่พบบ่อยเกี่ยวกับงานภาพและ Document AI ภาษาญี่ปุ่น

รองรับ ทั้งข้อความในแบบฟอร์มที่เขียนด้วยลายมือ ที่อยู่ ชื่อ และความคิดเห็นแบบข้อความอิสระ ลายมือทำได้ช้ากว่าและมีอัตราความกำกวมสูงกว่าตัวพิมพ์จริง ๆ เราจึงกำกับตัวอักษรที่ไม่แน่ใจไว้แทนที่จะเดา และตกลงกันล่วงหน้าว่าฟิลด์ที่อ่านไม่ออกจะถอดตามที่พออ่านได้ หรือติดธงว่าอ่านไม่ออก การตัดสินใจข้อนี้สำคัญต่อโมเดลของคุณมากกว่าตัวเลขความแม่นยำดิบ ๆ

ได้ เราทำงานบนแพลตฟอร์มที่ลูกค้าจัดเตรียมให้ ทั้ง CVAT, Label Studio, SageMaker Ground Truth, Labelbox และเครื่องมือภายในองค์กร หรือใช้สภาพแวดล้อมที่ปลอดภัยของเราเองหากคุณไม่สะดวกเปิดบัญชีผู้ใช้ให้ เครื่องมือที่ใช้ไม่ได้เปลี่ยนแนวทางหรือกระบวนการตรวจทาน

ได้ และสำหรับงานตรวจจับวัตถุปริมาณมาก วิธีนี้มักสมเหตุสมผล ความเสี่ยงคือรอบการแก้ไขมักรับเอาจุดบอดของโมเดลมาด้วย เราจึงวัดผลของรอบการแก้ไขเทียบกับตัวอย่างที่กำกับใหม่ทั้งหมด แล้วบอกคุณว่ามันจับข้อผิดพลาดได้จริงเท่าใด สำหรับงาน OCR บนเอกสารภาษาญี่ปุ่นเราระมัดระวังกว่านั้น เพราะข้อผิดพลาดของโมเดลกับอักขระเต็มความกว้างและข้อความแนวตั้งมองข้ามได้ง่ายบนหน้าจอ

ภายใต้ NDA และข้อตกลงการประมวลผลข้อมูล ในสภาพแวดล้อมที่แยกอิสระ โดยจำกัดสิทธิ์เข้าถึงไว้เฉพาะผู้ที่อยู่ในโครงการ เรากำกับข้อมูลส่วนบุคคลเพื่อการปกปิดให้ได้ หรือทำงานเฉพาะบนเอกสารที่คุณปกปิดข้อมูลแล้วก่อนส่งมา เงื่อนไขการเก็บรักษาและการลบข้อมูลตกลงกันไว้ในสัญญา ไม่ใช่ปล่อยให้เป็นไปตามนโยบายทั่วไป

เอกสารญี่ปุ่นใช้ปีตามรัชศกกันทั่วไป — 令和6年 แทนที่จะเป็น 2024 — และมักปรากฏทั้งสองแบบบนหน้าเดียวกัน เราจัดให้วันที่ตามรัชศกเป็นฟิลด์ของตัวเองโดยคงข้อความต้นฉบับไว้ พร้อมค่าปีคริสต์ศักราชที่ปรับมาตรฐานแล้วในกรณีที่คุณต้องการ ข้อมูลจึงไม่สูญหายไปกับการแปลง และไม่มีข้อผิดพลาดจากการแปลงฝังอยู่ในข้อมูล

ภาพและวิดีโอ

ส่งมาสักหน้า สักเฟรม หรือทั้งโฟลเดอร์

ตัวอย่างที่เป็นตัวแทนของเอกสารหรือวิดีโอจริงของคุณก็เพียงพอให้เราร่างระบบหมวดหมู่ กำกับข้อมูลชุดนำร่อง และบอกคุณได้ว่าความกำกวมจะอยู่ตรงไหน

ลงนาม NDA ก่อนที่คุณจะส่งข้อมูลใด ๆ การกำหนดขอบเขตโครงการนำร่องไม่มีค่าใช้จ่าย