ข้อมูลคำสั่งและ SFT
คู่พรอมป์ต์–คำตอบที่สาธิตพฤติกรรมที่คุณต้องการ เขียนขึ้นใหม่ทั้งหมดหรือเรียบเรียงจากเนื้อหาที่คุณมีอยู่
- ตัวอย่างการทำงาน
- คู่ข้อมูลการเรียบเรียงและสรุปความ
- การตอบคำถามเฉพาะสาขา
- ผลลัพธ์ที่มีข้อจำกัดด้านรูปแบบ
LLM และ Generative AI
คู่คำสั่ง–คำตอบ การเปรียบเทียบแบบจัดอันดับ บทสนทนาหลายรอบ และข้อมูลด้านความปลอดภัย เขียนโดยผู้กำกับข้อมูลในประเทศญี่ปุ่นตามคู่มือสไตล์ที่ทีมของคุณอนุมัติแล้ว
ส่วนที่ยากของข้อมูลคำสั่งภาษาญี่ปุ่นไม่ใช่การเขียนคำตอบหนึ่งคำตอบ แต่คือการเขียนคำตอบแบบเดียวกัน ด้วยระดับภาษาเดียวกัน หนึ่งหมื่นครั้ง — และอธิบายเป็นลายลักษณ์อักษรได้ว่าทำไมจึงเลือกระดับภาษานั้น
ข้อมูลคำสั่งที่เขียนโดยคนหลายคนย่อมเลื่อนไหล ผู้กำกับข้อมูลคนหนึ่งจบทุกคำตอบด้วย ですます อีกคนเปลี่ยนไปใช้ である กลางคำอธิบายเชิงเทคนิค คนที่สามเขียนด้วยสไตล์สั้นห้วนแบบผู้ช่วยแชต โมเดลที่ฝึกด้วยส่วนผสมนี้จะเรียนรู้ว่าทั้งสามแบบใช้ได้ แล้วผลิตแบบไหนก็ได้ตามใจ ซึ่งเป็นข้อร้องเรียนที่เราได้ยินบ่อยที่สุดเกี่ยวกับการปรับจูนโมเดลภาษาญี่ปุ่น
ระดับภาษาไม่ใช่แกนเดียวที่เลื่อนไหล การปฏิเสธยิ่งแย่กว่า ภาษาญี่ปุ่นปฏิเสธโดยอ้อม และผู้กำกับข้อมูลที่ไม่เคยได้รับคำอธิบายว่าการปฏิเสธควรมีหน้าตาอย่างไร จะเขียนออกมาได้ตั้งแต่ お断りします ที่ตรงไปตรงมา ไปจนถึง それは難しいかもしれません ที่นุ่มนวล หากครึ่งหนึ่งของข้อมูลด้านความปลอดภัยปฏิเสธนุ่มนวลจนอาจเข้าใจผิดว่าเป็นการตอบรับ โมเดลจะเรียนรู้ที่จะพูดกำกวมแทนที่จะปฏิเสธ
สิ่งส่งมอบจึงไม่เคยเป็นแค่ตัวข้อมูล แต่คือข้อมูลบวกกับการตัดสินใจที่เขียนไว้เป็นเอกสารซึ่งทำให้เกิดข้อมูลนั้น ทั้งคู่มือสไตล์ เทมเพลตการปฏิเสธ กฎการจัดรูปแบบ และเวอร์ชันของแต่ละอย่างที่ชุดงานนั้นเขียนขึ้นตาม
ภาพรวมโดยย่อ
ประเภทชุดข้อมูล
ชุดข้อมูลห้าตระกูล ซึ่งมักใช้ร่วมกัน แต่ละตระกูลมีนิยามของคำว่า "ถูกต้อง" ต่างกัน จึงมีหัวข้อในแนวทางและรอบการตรวจทานเป็นของตัวเอง
คู่พรอมป์ต์–คำตอบที่สาธิตพฤติกรรมที่คุณต้องการ เขียนขึ้นใหม่ทั้งหมดหรือเรียบเรียงจากเนื้อหาที่คุณมีอยู่
คำตอบตัวเลือกตั้งแต่สองคำตอบขึ้นไปที่นำมาเปรียบเทียบตามเกณฑ์ที่เขียนไว้ พร้อมบันทึกเหตุผลของการเลือก แทนที่จะให้อนุมานเอาเอง
บทสนทนาที่บริบทสะสมขึ้นเรื่อย ๆ ระดับภาษาที่กำหนดไว้ในรอบแรกต้องอยู่รอดถึงรอบที่แปด ซึ่งเป็นจุดที่ข้อมูลบทสนทนาภาษาญี่ปุ่นส่วนใหญ่พังลง
พรอมป์ต์ที่ควรถูกปฏิเสธ พรอมป์ต์ที่ดูเหมือนควรถูกปฏิเสธแต่ไม่ควร และถ้อยคำปฏิเสธที่แยกสองอย่างนี้ออกจากกัน
ชุดสามส่วนของคำถาม เนื้อความที่ค้นคืนมา และคำตอบที่อ้างอิงเนื้อความนั้น รวมถึงกรณีเชิงลบที่เนื้อความไม่มีคำตอบอยู่จริง
ประเด็นเฉพาะภาษาญี่ปุ่น
นี่คือการตัดสินใจสี่ข้อ ซึ่งหากปล่อยไว้ไม่ตัดสิน จะได้ชุดข้อมูลที่ดูดีตอนตรวจทานแต่ทำให้โมเดลทำงานผิดเพี้ยน
ภาษาญี่ปุ่นบังคับให้ต้องเลือกระดับความสุภาพในทุกรูปลงท้ายประโยค ですます である และรูปธรรมดาใช้แทนกันไม่ได้ และโมเดลที่ฝึกด้วยส่วนผสมของทั้งสามจะปนมันเข้าด้วยกันภายในคำตอบเดียว
เราจัดการอย่างไร คู่มือสไตล์กำหนดระดับภาษาเริ่มต้นหนึ่งแบบต่อหนึ่งจุดสัมผัสของผลิตภัณฑ์ ระบุข้อยกเว้น และให้ตัวอย่างประกอบของแต่ละกรณี ความสม่ำเสมอของระดับภาษาเป็นรายการที่ให้คะแนนในการตรวจทาน ไม่ใช่เรื่องรสนิยม
それはちょっと難しいです คือการปฏิเสธ ไม่ใช่การบอกว่าเรื่องนั้นยาก ผู้กำกับข้อมูลที่ติดป้ายกำกับตามตัวอักษรกำลังสอนให้โมเดลอ่านการปฏิเสธเป็นคำพูดที่เป็นกลาง
เราจัดการอย่างไร หมวดหมู่ของการปฏิเสธและถ้อยคำที่ใช้ถูกนิยามไว้ตั้งแต่ต้น พร้อมระดับความหนักแน่นที่ตั้งใจไว้ของแต่ละหมวด ข้อมูลด้านความปลอดภัยจะถูกตรวจทานโดยเฉพาะว่าการปฏิเสธนั้นอ่านแล้วเป็นการปฏิเสธในสายตาผู้พูดภาษาญี่ปุ่นหรือไม่
ภาษาญี่ปุ่นละประธานที่บริบททำให้เข้าใจได้อยู่แล้ว ในข้อมูลหลายรอบ สิ่งที่ถูกอ้างถึงอาจอยู่ย้อนหลังไปสี่รอบ และผู้กำกับข้อมูลที่เขียนคำตอบแบบแยกส่วนจะเดาผิด
เราจัดการอย่างไร รายการที่เป็นบทสนทนาหลายรอบจะถูกเขียนและตรวจทานทั้งบทสนทนา ไม่ใช่ทีละรอบ ในกรณีที่สิ่งที่ถูกอ้างถึงกำกวมจริง ๆ บทสนทนานั้นจะถูกแก้ไขหรือคัดออก — ไม่ใช่ติดป้ายกำกับด้วยการเดา
คำเดียวกันปรากฏได้ทั้งในรูปคันจิ ฮิรางานะ หรือคาตากานะ ส่วนตัวเลขและเครื่องหมายวรรคตอนปรากฏได้ทั้งแบบเต็มความกว้างและครึ่งความกว้าง หากไม่ควบคุม สิ่งนี้จะสอนโมเดลว่าการจัดรูปแบบเป็นเรื่องสุ่ม
เราจัดการอย่างไร ข้อตกลงการปรับมาตรฐานครอบคลุมการเลือกรูปเขียนของคำที่ใช้บ่อย ตัวเลข เครื่องหมายวรรคตอน การเว้นวรรครอบข้อความอักษรละติน และการจัดรูปแบบรายการ โดยบังคับใช้ตั้งแต่ตอนเขียนและตรวจสอบอัตโนมัติก่อนส่งมอบ
กระบวนการ
โครงการนำร่องมีไว้เพื่อทดสอบร่างแรกของแนวทางจนพัง งานโปรดักชันจะเริ่มก็ต่อเมื่อมันไม่พังอีกแล้ว
เราตกลงร่วมกันว่าคำตอบที่ดีสำหรับผลิตภัณฑ์ของคุณเป็นอย่างไร ทั้งระดับภาษา ความยาว การจัดรูปแบบ สิ่งที่ต้องปฏิเสธและปฏิเสธอย่างไร และโมเดลควรทำอย่างไรเมื่อไม่รู้คำตอบ
การตัดสินใจทั้งหมดกลายเป็นเอกสารที่มีตัวอย่างประกอบและตัวอย่างค้าน ประเด็นกำกวมที่คุณยังไม่ได้ตัดสินจะถูกหยิบขึ้นมาที่ขั้นนี้ แทนที่จะถูกกลืนหายไปเงียบ ๆ
ชุดงานเล็ก ๆ ถูกเขียนโดยผู้กำกับข้อมูลหลายคนอย่างเป็นอิสระ จุดที่พวกเขาเขียนต่างกันคือจุดที่แนวทางไม่ชัดเจน เราแก้ที่แนวทาง ไม่ใช่แก้ที่ตัวผู้กำกับข้อมูล
ทุกรายการเขียนโดยผู้กำกับข้อมูลหนึ่งคนและตรวจทานโดยอีกคนหนึ่ง โดยมีผู้ตรวจทานอาวุโสสุ่มตรวจและชี้ขาดข้อขัดแย้งเป็นลายลักษณ์อักษร
การส่งมอบประกอบด้วยตัวข้อมูล เวอร์ชันของแนวทาง ที่มาของข้อมูลรายเรกคอร์ด รายงาน QA และบันทึกการเปลี่ยนแปลงเทียบกับชุดงานก่อนหน้า
การส่งมอบ
ฟิลด์ต่าง ๆ ตกลงกันตั้งแต่ช่วงเริ่มโครงการ ส่วนด้านล่างนี้คือโครงสร้างเริ่มต้นสำหรับกรณีที่คุณยังไม่มีสคีมาเดิมให้ยึดตาม
| ชุดข้อมูล | รูปแบบเริ่มต้น | ข้อมูลในแต่ละเรกคอร์ด |
|---|---|---|
| คำสั่ง / SFT | JSONL แบบ messages array | รอบสนทนา system / user / assistant, แท็กงาน, เวอร์ชันแนวทาง |
| คู่ความชอบ | JSONL แบบ chosen + rejected | ตัวเลือกทั้งสอง, คะแนนรายเกณฑ์, คำอธิบายเหตุผล |
| บทสนทนาหลายรอบ | JSONL หนึ่งบทสนทนาต่อหนึ่งบรรทัด | รายการรอบสนทนาทั้งหมด, บันทึกบุคลิก, แท็กระดับภาษา |
| ความปลอดภัยและการปฏิเสธ | JSONL | พรอมป์ต์, หมวดหมู่, พฤติกรรมที่คาดหวัง, ถ้อยคำปฏิเสธที่ใช้ |
| การอ้างอิงแหล่งที่มาสำหรับ RAG | JSONL | คำถาม, เนื้อความ, คำตอบ, ช่วงข้อความที่ใช้อ้างอิง, ธงว่าตอบได้หรือไม่ |
คุณภาพ
การทำ QA การกำกับข้อมูลแบบทั่วไปจับการเลื่อนไหลของระดับภาษาหรือการปฏิเสธที่นุ่มเกินไปไม่ได้ แต่การตรวจสอบเหล่านี้จับได้
คำถามที่พบบ่อย
คำถามที่ทีมต่าง ๆ ถามตอนกำหนดขอบเขตการปรับจูนโมเดลภาษาญี่ปุ่นครั้งแรก
ได้ทั้งสองอย่าง การเขียนขึ้นใหม่เป็นเรื่องปกติสำหรับภาษาญี่ปุ่น เพราะข้อมูลคำสั่งแบบเปิดที่ใช้งานได้จริงในภาษาญี่ปุ่นมีน้อย และข้อมูลที่แปลด้วยเครื่องจะพาโครงสร้างประโยคภาษาอังกฤษเข้าไปในโมเดล เมื่อคุณมีเนื้อหาอยู่แล้ว ไม่ว่าจะเป็นบันทึกงานสนับสนุนลูกค้า คู่มือ หรือเอกสารภายใน เรามักเรียบเรียงจากเนื้อหานั้นมากกว่า ซึ่งทำให้ข้อมูลยึดโยงกับสาขาจริงของคุณ
ด้วยคู่มือสไตล์ที่เป็นลายลักษณ์อักษรพร้อมตัวอย่างประกอบ รอบการปรับเทียบก่อนเข้าโปรดักชันที่ผู้กำกับข้อมูลหลายคนเขียนรายการเดียวกันอย่างเป็นอิสระ และการให้คะแนนความสม่ำเสมอของระดับภาษาเป็นรายการหนึ่งในการตรวจทานอย่างชัดเจน ความสม่ำเสมอในที่นี้เป็นคุณสมบัติที่วัดได้ ไม่ใช่ความมุ่งหวัง เราเฝ้าดูความแตกต่างระหว่างผู้กำกับข้อมูล และทุกความแตกต่างที่คลี่คลายแล้วจะถูกบันทึกกลับเข้าคู่มือ
ไม่ใช้เป็นแหล่งของข้อมูลฉบับสุดท้าย ข้อมูลคำสั่งที่แปลมาจะรับเอาโครงสร้างการเล่าเรื่อง สมมติฐานเรื่องความสุภาพ และนิสัยการจัดรูปแบบของภาษาอังกฤษติดมาด้วย และโมเดลที่ฝึกด้วยข้อมูลแบบนั้นจะผลิตภาษาญี่ปุ่นที่เจ้าของภาษาบอกว่าอ่านแล้วเหมือนงานแปล เราใช้การแปลเป็นโครงร่างสำหรับคิดพรอมป์ต์ได้ แต่คำตอบเขียนเป็นภาษาญี่ปุ่นโดยผู้พูดภาษาญี่ปุ่น
ได้เฉพาะกรณีที่คุณตกลงด้วยเท่านั้น และต้องมีการเรียบเรียงและตรวจทานโดยมนุษย์ทับลงไปเสมอ — ไม่ใช่ปล่อยผ่านโดยไม่ตรวจ การใช้ AI ช่วยงานจะถูกบันทึกไว้รายเรกคอร์ด คุณจึงกรองหรือตรวจสอบย้อนหลังได้ หากคุณต้องการข้อมูลที่มนุษย์เขียนล้วน เราจะดำเนินโครงการแบบนั้น และฟิลด์ระบุที่มาของข้อมูลจะเป็นหลักฐานยืนยัน
น้อยกว่าที่ทีมส่วนใหญ่คาดไว้ ข้อมูลเพียงไม่กี่พันรายการที่เขียนอย่างพิถีพิถันและมีระดับภาษาสม่ำเสมอ มักช่วยการปรับจูนโมเดลภาษาญี่ปุ่นได้มากกว่าข้อมูลคุณภาพต่ำที่มากกว่าสิบเท่า เพราะสิ่งที่โมเดลกำลังเรียนรู้คือสไตล์พอ ๆ กับตัวงาน เรากำหนดขอบเขตโครงการนำร่องไม่กี่ร้อยรายการก่อนเพื่อพิสูจน์แนวทาง แล้วจึงประเมินขนาดงานโปรดักชันจากสิ่งที่วัดได้ในโครงการนำร่องนั้น
ข้อมูลฝึกสอน LLM
คำอธิบายลักษณะงานและตัวอย่างคำตอบไม่กี่ตัวอย่างก็เพียงพอที่จะเริ่มได้ เราจะตอบกลับด้วยคำถามเรื่องระบบหมวดหมู่ที่ต้องได้คำตอบ และโครงการนำร่องที่กำหนดขอบเขตชัดเจน
ลงนาม NDA ก่อนที่คุณจะส่งข้อมูลใด ๆ การกำหนดขอบเขตโครงการนำร่องไม่มีค่าใช้จ่าย