บริการ
ข้อมูลฝึกสอน AI ภาษาญี่ปุ่น ครบทุกโมดาลิตี
บริการห้าด้านที่ครอบคลุมสิ่งที่ระบบ AI ต้องการในแต่ละขั้น ตั้งแต่ข้อมูลคำสั่งที่ใช้สอนโมเดล ไปจนถึงการประเมินผลโดยมนุษย์ที่บอกคุณว่าโมเดลนั้นได้ผลจริงหรือไม่
ทั้งห้าบริการตั้งอยู่บนพื้นฐานเดียวกัน คือทีมกำกับข้อมูลในประเทศญี่ปุ่น แนวทางที่จัดทำเป็นเอกสารและกำหนดเวอร์ชันแทนการอาศัยความจำ และคุณภาพที่วัดผลก่อนจะกล่าวอ้าง
ทีมเดียว ครอบคลุมวงจรชีวิตข้อมูลทั้งหมด
ปัญหาการกำกับข้อมูลส่วนใหญ่ไม่ใช่ปัญหาของการติดป้ายกำกับ แต่เป็นปัญหาของนิยาม คนสองคนที่มีเหตุผลพอ ๆ กันอ่านแนวทางฉบับเดียวกัน แล้วติดป้ายกำกับประโยคภาษาญี่ปุ่นประโยคเดียวกันต่างกัน และไม่มีใครสังเกตจนกระทั่งโมเดลถูกฝึกด้วยทั้งสองแบบไปแล้ว การแบ่งงานของเราออกเป็นห้าบริการคือวิธีทำให้นิยามเหล่านั้นชัดเจน แต่ละบริการมีคำถามเรื่องระบบหมวดหมู่ รูปแบบความล้มเหลว และการตรวจสอบคุณภาพเป็นของตัวเอง
บริการเหล่านี้ไม่ใช่แพ็กเกจที่คุณต้องเลือกอย่างใดอย่างหนึ่ง โครงการเดียวใช้ถึงสามบริการเป็นเรื่องปกติ คือการกำกับข้อมูล NLP เพื่อสร้างคลังข้อมูลที่มีป้ายกำกับ ข้อมูลฝึกสอน LLM เพื่อแปลงคลังข้อมูลนั้นเป็นคู่คำสั่งและคู่ความชอบ และการประเมินผลเพื่อวัดว่าโมเดลที่ได้ทำอะไรได้จริง สิ่งที่คงที่ตลอดคือวิจารณญาณด้านภาษาญี่ปุ่นที่รองรับอยู่เบื้องหลังทั้งหมด
ภาพรวมโดยย่อ
- โมดาลิตี
- ข้อมูลภาษาญี่ปุ่นทั้งข้อความ เสียงพูด ภาพ วิดีโอ เอกสาร และมัลติโมดัล
- ขั้นตอนของโมเดล
- การคัดกรองคลังข้อมูล การปรับจูนแบบมีผู้สอน ข้อมูลความชอบและ RLHF การประเมินผลและการเทียบเกณฑ์มาตรฐาน
- รูปแบบการส่งมอบ
- JSONL, CSV, CoNLL-U, SRT, CTM, COCO — หรือสคีมาที่คุณกำหนดเอง
- เครื่องมือ
- เราทำงานบนแพลตฟอร์มกำกับข้อมูลของคุณ หรือในสภาพแวดล้อมที่ปลอดภัยของเราเอง
- จุดเริ่มต้น
- โครงการนำร่องที่กำหนดขอบเขตชัดเจน พิสูจน์ระบบหมวดหมู่และคุณภาพก่อนเพิ่มปริมาณงาน
สิ่งที่เราทำ
บริการห้าด้าน พร้อมชั้นผู้เชี่ยวชาญ
แต่ละบริการมีหน้าของตัวเอง พร้อมการตัดสินใจเรื่องระบบหมวดหมู่ กับดักเฉพาะของภาษาญี่ปุ่น และสิ่งส่งมอบที่ระบุไว้ชัดเจน
ข้อมูลฝึกสอน LLM
ชุดข้อมูลคำสั่ง ความชอบ และ RLHF ที่เขียนเป็นภาษาญี่ปุ่น พร้อมการตัดสินใจเรื่องระดับภาษาที่ระบุไว้ชัดเจน
- ข้อมูลคำสั่งและ SFT
- ข้อมูลความชอบและการจัดอันดับ
- บทสนทนาหลายรอบ
- ข้อมูลความปลอดภัย การปฏิเสธ และ red team
การประเมิน LLM
การประเมินผลลัพธ์ของโมเดลภาษาญี่ปุ่นโดยมนุษย์ — เกณฑ์การให้คะแนน การเปรียบเทียบความชอบแบบคู่ ความถูกต้องของข้อเท็จจริง และ red teaming
- การเปรียบเทียบความชอบแบบคู่
- การให้คะแนนตามเกณฑ์
- ความถูกต้องของข้อเท็จจริงและการอ้างอิงแหล่งที่มา
- ความปลอดภัยและ red teaming
เสียงพูดและออดิโอ
การถอดเสียงภาษาญี่ปุ่นสำหรับ ASR การแยกผู้พูด และการกำกับเจตนา พร้อมข้อตกลงการปรับมาตรฐานที่เขียนเป็นเอกสาร
- การถอดเสียง
- การกำกับเวลาและการจัดแนว
- การกำกับผู้พูด
- การกำกับเจตนาและสล็อต
ภาพและวิดีโอ
Bounding box การแบ่งส่วนภาพ OCR และเลย์เอาต์เอกสาร บนภาพ วิดีโอ และเอกสารภาษาญี่ปุ่น
- การตรวจจับวัตถุและการแบ่งส่วนภาพ
- จุดสำคัญและคุณลักษณะ
- การกำกับข้อมูลวิดีโอ
- OCR และเลย์เอาต์เอกสาร
ข้อความและ NLP
เอนทิตี ความสัมพันธ์ เจตนา และความรู้สึกบนข้อความภาษาญี่ปุ่น โดยตัดสินขอบเขตของตัวตัดคำไว้ล่วงหน้า ไม่ใช่สมมติเอาเอง
- การรู้จำเอนทิตีที่มีชื่อ
- การสกัดความสัมพันธ์และเหตุการณ์
- การจำแนกประเภท
- ความรู้สึกและอารมณ์
กำกับข้อมูลเฉพาะทาง
การกำกับข้อมูลและการประเมินผลโดยผู้เชี่ยวชาญเฉพาะทางในญี่ปุ่น สำหรับ AI ที่ทำงานในสาขาที่มีการกำกับดูแล
- ทนายความ
- นักบัญชีภาษีอากร
- ผู้สอบบัญชีรับอนุญาต
- ผู้เชี่ยวชาญด้านแรงงานและประกันสังคม
การเลือก
ฉันต้องใช้บริการใด
เริ่มจากสิ่งที่คุณต้องการเปลี่ยนในตัวโมเดล บริการจะตามมาจากตรงนั้น ไม่ใช่จากชนิดไฟล์ที่คุณบังเอิญมีอยู่
| ถ้าเป้าหมายของคุณคือ… | บริการที่ใช้ | สิ่งส่งมอบชิ้นแรกที่พบบ่อย |
|---|---|---|
| สอนให้โมเดลตอบเป็นภาษาญี่ปุ่นที่เป็นธรรมชาติและใช้ระดับภาษาถูกต้อง | ข้อมูลฝึกสอน LLM | ชุดนำร่องของคู่คำสั่ง–คำตอบ พร้อมคู่มือสไตล์ที่ล็อกไว้แล้ว |
| หาให้เจอว่าโมเดลผิดตรงไหน ก่อนนำขึ้นใช้งานจริง | การประเมิน LLM | ชุดประเมินผลที่ให้คะแนนแล้ว พร้อมเกณฑ์และค่าความสอดคล้องระหว่างผู้ให้คะแนน |
| ทำให้โมเดลฟังเสียงพูดภาษาญี่ปุ่นได้แม่นยำ | เสียงพูดและออดิโอ | เสียงที่ถอดข้อความแล้ว พร้อมข้อตกลงการปรับมาตรฐานที่เขียนเป็นเอกสาร |
| อ่านเอกสาร แบบฟอร์ม หรือข้อความบนหน้าจอภาษาญี่ปุ่น | ภาพและวิดีโอ | การกำกับ OCR และเลย์เอาต์บนตัวอย่างเอกสารที่เป็นตัวแทน |
| สกัดข้อเท็จจริงเชิงโครงสร้างจากข้อความภาษาญี่ปุ่น | ข้อความและ NLP | สคีมาเอนทิตีและความสัมพันธ์ที่ทดสอบกับกรณีก้ำกึ่งจริงแล้ว |
| ให้ผู้เชี่ยวชาญตัดสินคำตอบในสาขาที่มีการกำกับดูแล | กำกับข้อมูลโดยผู้เชี่ยวชาญ | ชุดประเมินผลที่ผ่านการตรวจทานโดยผู้เชี่ยวชาญ พร้อมบันทึกการชี้ขาดเป็นลายลักษณ์อักษร |
วงจรชีวิต
แต่ละบริการอยู่ตรงไหน
ชุดข้อมูลชุดเดียวแทบไม่เคยใช้ได้กับสองขั้นตอน ข้อมูลที่สร้างมาเพื่อสอนโมเดลเป็นข้อสอบที่แย่สำหรับโมเดลนั้น เพราะโมเดลเคยเห็นมันมาแล้ว
-
01
การเตรียมคลังข้อมูล
การคัดกรอง กฎการขจัดข้อมูลซ้ำ และการติดธงคุณภาพและความปลอดภัยบนข้อความ เสียงพูด หรือเอกสารภาษาญี่ปุ่นที่ยังไม่ผ่านการประมวลผล เป็นตัวตัดสินว่าอะไรคุ้มค่าแก่การกำกับข้อมูลตั้งแต่แรก
-
02
การปรับจูนแบบมีผู้สอน
คู่คำสั่ง–คำตอบ บทสนทนาหลายรอบ และตัวอย่างการทำงาน เขียนด้วยระดับภาษาที่ผลิตภัณฑ์ใช้จริง
-
03
ความชอบและการจัดแนว
การเปรียบเทียบแบบจัดอันดับหรือแบบคู่ พฤติกรรมด้านความปลอดภัยและการปฏิเสธ และเกณฑ์ที่เขียนไว้ว่าอะไรทำให้คำตอบหนึ่งดีกว่าอีกคำตอบหนึ่ง
-
04
การประเมินผล
ชุดข้อมูลที่กันไว้และการให้คะแนนตามเกณฑ์ โดยผู้ที่ไม่ได้มีส่วนสร้างข้อมูลฝึกสอน การวัดผลจึงเป็นอิสระ
-
05
การเฝ้าติดตามในโปรดักชัน
การสุ่มผลลัพธ์ของโมเดลที่ใช้งานจริงมาให้คะแนนด้วยเกณฑ์ชุดเดียวกัน แล้วป้อนความล้มเหลวที่เกิดซ้ำกลับเข้าสู่รอบข้อมูลถัดไป
การส่งมอบ
รูปแบบและการส่งมอบ
ทุกชุดงานส่งมอบพร้อมเวอร์ชันของระบบหมวดหมู่ที่ใช้ติดป้ายกำกับ และบันทึกการเปลี่ยนแปลงเทียบกับชุดงานก่อนหน้า ชุดข้อมูลจึงเปรียบเทียบกันได้ข้ามเวอร์ชัน
| ประเภทข้อมูล | การส่งมอบที่ใช้บ่อย | รูปแบบอื่นที่รองรับ |
|---|---|---|
| ข้อความและ NLP | JSONL | CSV, CoNLL-U, brat standoff, Parquet |
| คำสั่งและความชอบสำหรับ LLM | JSONL (messages / chosen–rejected) | CSV, โครงสร้างชุดข้อมูลแบบ Hugging Face |
| เสียงพูด | JSON พร้อมค่าเวลา | SRT, VTT, CTM, TextGrid, ข้อความถอดเสียงล้วน |
| ภาพและวิดีโอ | COCO JSON | YOLO, Pascal VOC, CVAT XML, JSONL รายเฟรม |
| เอกสารและ OCR | JSON พร้อมพิกัดบนหน้ากระดาษ | hOCR, ALTO, การสกัดฟิลด์เป็น CSV |
| ผลการประเมิน | คะแนนแบบ JSONL พร้อมรายงาน QA | CSV, โน้ตบุกให้คะแนน, บันทึกการชี้ขาด |
คำถามที่พบบ่อย
เกี่ยวกับบริการ
คำถามเรื่องขอบเขตและกระบวนการที่มักเกิดขึ้นก่อนกำหนดโครงการนำร่อง
ได้ และโครงการส่วนใหญ่ก็ทำแบบนั้น ลำดับที่พบบ่อยคือการกำกับข้อมูล NLP เพื่อสร้างคลังข้อมูลที่มีป้ายกำกับ แล้วสร้างข้อมูลฝึกสอน LLM จากคลังนั้น จากนั้นจึงประเมินผลโดยผู้กำกับข้อมูลอีกกลุ่มหนึ่ง การรวมทั้งหมดไว้ในความร่วมมือเดียวหมายความว่าระบบหมวดหมู่ คู่มือสไตล์ และตัวชี้วัด QA จะสอดคล้องกัน แทนที่จะต้องนิยามใหม่กับผู้ให้บริการแต่ละราย
ภาษาญี่ปุ่นคือสิ่งที่เราสร้างขึ้นมาเพื่อรองรับ และงานสองภาษาญี่ปุ่น–อังกฤษก็อยู่ในขอบเขตนั้น ส่วนงานปริมาณมากในภาษาอื่น เราขอบอกตรง ๆ ว่าเราไม่ใช่ผู้ให้บริการที่เหมาะสม ดีกว่ารับงานไว้แล้วจ้างช่วงต่อ
คิดราคาต่อหน่วยงาน ทั้งต่อรายการ ต่อชั่วโมงเสียง ต่อภาพ หรือต่อการประเมินหนึ่งครั้ง โดยขึ้นอยู่กับความซับซ้อนของงาน เวลาที่ผู้ตรวจทานต้องใช้กับแต่ละรายการ และระดับความเชี่ยวชาญที่ต้องการ เราเสนอราคาหลังจากกำหนดขอบเขตโครงการนำร่องบนข้อมูลจริงของคุณแล้ว เพราะราคาที่ประเมินจากคำอธิบายงานเพียงอย่างเดียวคือการเดา และมักเดาผิด
เราเป็นผู้ร่าง คุณเป็นผู้ตรวจทาน และทั้งสองอย่างเกิดขึ้นก่อนเข้าสู่โปรดักชัน โครงการนำร่องมีไว้เพื่อทดสอบร่างแรกกับกรณีก้ำกึ่งจริงจนพัง ทุกข้อขัดแย้งที่คลี่คลายระหว่างนั้นจะถูกบันทึกกลับเข้าเอกสาร จากนั้นแนวทางจะถูกกำหนดเวอร์ชัน และทุกชุดงานที่ส่งมอบจะระบุว่าติดป้ายกำกับตามเวอร์ชันใด
เริ่มที่นี่
บอกเราว่าโมเดลของคุณต้องเรียนรู้อะไร
ส่งลักษณะงาน ตัวอย่างข้อมูล และข้อจำกัดที่คุณมีมาให้เรา แล้วเราจะตอบกลับด้วยแผนโครงการนำร่องที่กำหนดขอบเขตชัดเจน คำถามเรื่องระบบหมวดหมู่ที่ต้องได้คำตอบ และมุมมองตรงไปตรงมาว่าอะไรคือส่วนที่ยาก
ลงนาม NDA ก่อนที่คุณจะส่งข้อมูลใด ๆ การกำหนดขอบเขตโครงการนำร่องไม่มีค่าใช้จ่าย