บริการ

ข้อมูลฝึกสอน AI ภาษาญี่ปุ่น ครบทุกโมดาลิตี

บริการห้าด้านที่ครอบคลุมสิ่งที่ระบบ AI ต้องการในแต่ละขั้น ตั้งแต่ข้อมูลคำสั่งที่ใช้สอนโมเดล ไปจนถึงการประเมินผลโดยมนุษย์ที่บอกคุณว่าโมเดลนั้นได้ผลจริงหรือไม่

ทั้งห้าบริการตั้งอยู่บนพื้นฐานเดียวกัน คือทีมกำกับข้อมูลในประเทศญี่ปุ่น แนวทางที่จัดทำเป็นเอกสารและกำหนดเวอร์ชันแทนการอาศัยความจำ และคุณภาพที่วัดผลก่อนจะกล่าวอ้าง

ทีมเดียว ครอบคลุมวงจรชีวิตข้อมูลทั้งหมด

ปัญหาการกำกับข้อมูลส่วนใหญ่ไม่ใช่ปัญหาของการติดป้ายกำกับ แต่เป็นปัญหาของนิยาม คนสองคนที่มีเหตุผลพอ ๆ กันอ่านแนวทางฉบับเดียวกัน แล้วติดป้ายกำกับประโยคภาษาญี่ปุ่นประโยคเดียวกันต่างกัน และไม่มีใครสังเกตจนกระทั่งโมเดลถูกฝึกด้วยทั้งสองแบบไปแล้ว การแบ่งงานของเราออกเป็นห้าบริการคือวิธีทำให้นิยามเหล่านั้นชัดเจน แต่ละบริการมีคำถามเรื่องระบบหมวดหมู่ รูปแบบความล้มเหลว และการตรวจสอบคุณภาพเป็นของตัวเอง

บริการเหล่านี้ไม่ใช่แพ็กเกจที่คุณต้องเลือกอย่างใดอย่างหนึ่ง โครงการเดียวใช้ถึงสามบริการเป็นเรื่องปกติ คือการกำกับข้อมูล NLP เพื่อสร้างคลังข้อมูลที่มีป้ายกำกับ ข้อมูลฝึกสอน LLM เพื่อแปลงคลังข้อมูลนั้นเป็นคู่คำสั่งและคู่ความชอบ และการประเมินผลเพื่อวัดว่าโมเดลที่ได้ทำอะไรได้จริง สิ่งที่คงที่ตลอดคือวิจารณญาณด้านภาษาญี่ปุ่นที่รองรับอยู่เบื้องหลังทั้งหมด

ภาพรวมโดยย่อ

โมดาลิตี
ข้อมูลภาษาญี่ปุ่นทั้งข้อความ เสียงพูด ภาพ วิดีโอ เอกสาร และมัลติโมดัล
ขั้นตอนของโมเดล
การคัดกรองคลังข้อมูล การปรับจูนแบบมีผู้สอน ข้อมูลความชอบและ RLHF การประเมินผลและการเทียบเกณฑ์มาตรฐาน
รูปแบบการส่งมอบ
JSONL, CSV, CoNLL-U, SRT, CTM, COCO — หรือสคีมาที่คุณกำหนดเอง
เครื่องมือ
เราทำงานบนแพลตฟอร์มกำกับข้อมูลของคุณ หรือในสภาพแวดล้อมที่ปลอดภัยของเราเอง
จุดเริ่มต้น
โครงการนำร่องที่กำหนดขอบเขตชัดเจน พิสูจน์ระบบหมวดหมู่และคุณภาพก่อนเพิ่มปริมาณงาน

สิ่งที่เราทำ

บริการห้าด้าน พร้อมชั้นผู้เชี่ยวชาญ

แต่ละบริการมีหน้าของตัวเอง พร้อมการตัดสินใจเรื่องระบบหมวดหมู่ กับดักเฉพาะของภาษาญี่ปุ่น และสิ่งส่งมอบที่ระบุไว้ชัดเจน

ข้อมูลฝึกสอน LLM

ชุดข้อมูลคำสั่ง ความชอบ และ RLHF ที่เขียนเป็นภาษาญี่ปุ่น พร้อมการตัดสินใจเรื่องระดับภาษาที่ระบุไว้ชัดเจน

  • ข้อมูลคำสั่งและ SFT
  • ข้อมูลความชอบและการจัดอันดับ
  • บทสนทนาหลายรอบ
  • ข้อมูลความปลอดภัย การปฏิเสธ และ red team
ดูรายละเอียดบริการ

การประเมิน LLM

การประเมินผลลัพธ์ของโมเดลภาษาญี่ปุ่นโดยมนุษย์ — เกณฑ์การให้คะแนน การเปรียบเทียบความชอบแบบคู่ ความถูกต้องของข้อเท็จจริง และ red teaming

  • การเปรียบเทียบความชอบแบบคู่
  • การให้คะแนนตามเกณฑ์
  • ความถูกต้องของข้อเท็จจริงและการอ้างอิงแหล่งที่มา
  • ความปลอดภัยและ red teaming
ดูรายละเอียดบริการ

เสียงพูดและออดิโอ

การถอดเสียงภาษาญี่ปุ่นสำหรับ ASR การแยกผู้พูด และการกำกับเจตนา พร้อมข้อตกลงการปรับมาตรฐานที่เขียนเป็นเอกสาร

  • การถอดเสียง
  • การกำกับเวลาและการจัดแนว
  • การกำกับผู้พูด
  • การกำกับเจตนาและสล็อต
ดูรายละเอียดบริการ

ภาพและวิดีโอ

Bounding box การแบ่งส่วนภาพ OCR และเลย์เอาต์เอกสาร บนภาพ วิดีโอ และเอกสารภาษาญี่ปุ่น

  • การตรวจจับวัตถุและการแบ่งส่วนภาพ
  • จุดสำคัญและคุณลักษณะ
  • การกำกับข้อมูลวิดีโอ
  • OCR และเลย์เอาต์เอกสาร
ดูรายละเอียดบริการ

ข้อความและ NLP

เอนทิตี ความสัมพันธ์ เจตนา และความรู้สึกบนข้อความภาษาญี่ปุ่น โดยตัดสินขอบเขตของตัวตัดคำไว้ล่วงหน้า ไม่ใช่สมมติเอาเอง

  • การรู้จำเอนทิตีที่มีชื่อ
  • การสกัดความสัมพันธ์และเหตุการณ์
  • การจำแนกประเภท
  • ความรู้สึกและอารมณ์
ดูรายละเอียดบริการ

กำกับข้อมูลเฉพาะทาง

การกำกับข้อมูลและการประเมินผลโดยผู้เชี่ยวชาญเฉพาะทางในญี่ปุ่น สำหรับ AI ที่ทำงานในสาขาที่มีการกำกับดูแล

  • ทนายความ
  • นักบัญชีภาษีอากร
  • ผู้สอบบัญชีรับอนุญาต
  • ผู้เชี่ยวชาญด้านแรงงานและประกันสังคม
ดูรายละเอียดบริการ

การเลือก

ฉันต้องใช้บริการใด

เริ่มจากสิ่งที่คุณต้องการเปลี่ยนในตัวโมเดล บริการจะตามมาจากตรงนั้น ไม่ใช่จากชนิดไฟล์ที่คุณบังเอิญมีอยู่

การจับคู่เป้าหมายกับบริการ โครงการส่วนใหญ่ลงเอยด้วยการผสมสองหรือสามบริการ
ถ้าเป้าหมายของคุณคือ…บริการที่ใช้สิ่งส่งมอบชิ้นแรกที่พบบ่อย
สอนให้โมเดลตอบเป็นภาษาญี่ปุ่นที่เป็นธรรมชาติและใช้ระดับภาษาถูกต้องข้อมูลฝึกสอน LLMชุดนำร่องของคู่คำสั่ง–คำตอบ พร้อมคู่มือสไตล์ที่ล็อกไว้แล้ว
หาให้เจอว่าโมเดลผิดตรงไหน ก่อนนำขึ้นใช้งานจริงการประเมิน LLMชุดประเมินผลที่ให้คะแนนแล้ว พร้อมเกณฑ์และค่าความสอดคล้องระหว่างผู้ให้คะแนน
ทำให้โมเดลฟังเสียงพูดภาษาญี่ปุ่นได้แม่นยำเสียงพูดและออดิโอเสียงที่ถอดข้อความแล้ว พร้อมข้อตกลงการปรับมาตรฐานที่เขียนเป็นเอกสาร
อ่านเอกสาร แบบฟอร์ม หรือข้อความบนหน้าจอภาษาญี่ปุ่นภาพและวิดีโอการกำกับ OCR และเลย์เอาต์บนตัวอย่างเอกสารที่เป็นตัวแทน
สกัดข้อเท็จจริงเชิงโครงสร้างจากข้อความภาษาญี่ปุ่นข้อความและ NLPสคีมาเอนทิตีและความสัมพันธ์ที่ทดสอบกับกรณีก้ำกึ่งจริงแล้ว
ให้ผู้เชี่ยวชาญตัดสินคำตอบในสาขาที่มีการกำกับดูแลกำกับข้อมูลโดยผู้เชี่ยวชาญชุดประเมินผลที่ผ่านการตรวจทานโดยผู้เชี่ยวชาญ พร้อมบันทึกการชี้ขาดเป็นลายลักษณ์อักษร

วงจรชีวิต

แต่ละบริการอยู่ตรงไหน

ชุดข้อมูลชุดเดียวแทบไม่เคยใช้ได้กับสองขั้นตอน ข้อมูลที่สร้างมาเพื่อสอนโมเดลเป็นข้อสอบที่แย่สำหรับโมเดลนั้น เพราะโมเดลเคยเห็นมันมาแล้ว

  1. 01

    การเตรียมคลังข้อมูล

    การคัดกรอง กฎการขจัดข้อมูลซ้ำ และการติดธงคุณภาพและความปลอดภัยบนข้อความ เสียงพูด หรือเอกสารภาษาญี่ปุ่นที่ยังไม่ผ่านการประมวลผล เป็นตัวตัดสินว่าอะไรคุ้มค่าแก่การกำกับข้อมูลตั้งแต่แรก

  2. 02

    การปรับจูนแบบมีผู้สอน

    คู่คำสั่ง–คำตอบ บทสนทนาหลายรอบ และตัวอย่างการทำงาน เขียนด้วยระดับภาษาที่ผลิตภัณฑ์ใช้จริง

  3. 03

    ความชอบและการจัดแนว

    การเปรียบเทียบแบบจัดอันดับหรือแบบคู่ พฤติกรรมด้านความปลอดภัยและการปฏิเสธ และเกณฑ์ที่เขียนไว้ว่าอะไรทำให้คำตอบหนึ่งดีกว่าอีกคำตอบหนึ่ง

  4. 04

    การประเมินผล

    ชุดข้อมูลที่กันไว้และการให้คะแนนตามเกณฑ์ โดยผู้ที่ไม่ได้มีส่วนสร้างข้อมูลฝึกสอน การวัดผลจึงเป็นอิสระ

  5. 05

    การเฝ้าติดตามในโปรดักชัน

    การสุ่มผลลัพธ์ของโมเดลที่ใช้งานจริงมาให้คะแนนด้วยเกณฑ์ชุดเดียวกัน แล้วป้อนความล้มเหลวที่เกิดซ้ำกลับเข้าสู่รอบข้อมูลถัดไป

การส่งมอบ

รูปแบบและการส่งมอบ

ทุกชุดงานส่งมอบพร้อมเวอร์ชันของระบบหมวดหมู่ที่ใช้ติดป้ายกำกับ และบันทึกการเปลี่ยนแปลงเทียบกับชุดงานก่อนหน้า ชุดข้อมูลจึงเปรียบเทียบกันได้ข้ามเวอร์ชัน

รูปแบบการส่งมอบที่ใช้บ่อย สคีมาที่กำหนดเองจะนิยามตั้งแต่ช่วงเริ่มโครงการและกำหนดเวอร์ชันไปพร้อมกับข้อมูล
ประเภทข้อมูลการส่งมอบที่ใช้บ่อยรูปแบบอื่นที่รองรับ
ข้อความและ NLPJSONLCSV, CoNLL-U, brat standoff, Parquet
คำสั่งและความชอบสำหรับ LLMJSONL (messages / chosen–rejected)CSV, โครงสร้างชุดข้อมูลแบบ Hugging Face
เสียงพูดJSON พร้อมค่าเวลาSRT, VTT, CTM, TextGrid, ข้อความถอดเสียงล้วน
ภาพและวิดีโอCOCO JSONYOLO, Pascal VOC, CVAT XML, JSONL รายเฟรม
เอกสารและ OCRJSON พร้อมพิกัดบนหน้ากระดาษhOCR, ALTO, การสกัดฟิลด์เป็น CSV
ผลการประเมินคะแนนแบบ JSONL พร้อมรายงาน QACSV, โน้ตบุกให้คะแนน, บันทึกการชี้ขาด

คำถามที่พบบ่อย

เกี่ยวกับบริการ

คำถามเรื่องขอบเขตและกระบวนการที่มักเกิดขึ้นก่อนกำหนดโครงการนำร่อง

ได้ และโครงการส่วนใหญ่ก็ทำแบบนั้น ลำดับที่พบบ่อยคือการกำกับข้อมูล NLP เพื่อสร้างคลังข้อมูลที่มีป้ายกำกับ แล้วสร้างข้อมูลฝึกสอน LLM จากคลังนั้น จากนั้นจึงประเมินผลโดยผู้กำกับข้อมูลอีกกลุ่มหนึ่ง การรวมทั้งหมดไว้ในความร่วมมือเดียวหมายความว่าระบบหมวดหมู่ คู่มือสไตล์ และตัวชี้วัด QA จะสอดคล้องกัน แทนที่จะต้องนิยามใหม่กับผู้ให้บริการแต่ละราย

ภาษาญี่ปุ่นคือสิ่งที่เราสร้างขึ้นมาเพื่อรองรับ และงานสองภาษาญี่ปุ่น–อังกฤษก็อยู่ในขอบเขตนั้น ส่วนงานปริมาณมากในภาษาอื่น เราขอบอกตรง ๆ ว่าเราไม่ใช่ผู้ให้บริการที่เหมาะสม ดีกว่ารับงานไว้แล้วจ้างช่วงต่อ

คิดราคาต่อหน่วยงาน ทั้งต่อรายการ ต่อชั่วโมงเสียง ต่อภาพ หรือต่อการประเมินหนึ่งครั้ง โดยขึ้นอยู่กับความซับซ้อนของงาน เวลาที่ผู้ตรวจทานต้องใช้กับแต่ละรายการ และระดับความเชี่ยวชาญที่ต้องการ เราเสนอราคาหลังจากกำหนดขอบเขตโครงการนำร่องบนข้อมูลจริงของคุณแล้ว เพราะราคาที่ประเมินจากคำอธิบายงานเพียงอย่างเดียวคือการเดา และมักเดาผิด

เราเป็นผู้ร่าง คุณเป็นผู้ตรวจทาน และทั้งสองอย่างเกิดขึ้นก่อนเข้าสู่โปรดักชัน โครงการนำร่องมีไว้เพื่อทดสอบร่างแรกกับกรณีก้ำกึ่งจริงจนพัง ทุกข้อขัดแย้งที่คลี่คลายระหว่างนั้นจะถูกบันทึกกลับเข้าเอกสาร จากนั้นแนวทางจะถูกกำหนดเวอร์ชัน และทุกชุดงานที่ส่งมอบจะระบุว่าติดป้ายกำกับตามเวอร์ชันใด

เริ่มที่นี่

บอกเราว่าโมเดลของคุณต้องเรียนรู้อะไร

ส่งลักษณะงาน ตัวอย่างข้อมูล และข้อจำกัดที่คุณมีมาให้เรา แล้วเราจะตอบกลับด้วยแผนโครงการนำร่องที่กำหนดขอบเขตชัดเจน คำถามเรื่องระบบหมวดหมู่ที่ต้องได้คำตอบ และมุมมองตรงไปตรงมาว่าอะไรคือส่วนที่ยาก

ลงนาม NDA ก่อนที่คุณจะส่งข้อมูลใด ๆ การกำหนดขอบเขตโครงการนำร่องไม่มีค่าใช้จ่าย