LLM & AI tạo sinh

Dữ liệu huấn luyện LLM tiếng Nhật — SFT, ưu tiên và RLHF

Các cặp chỉ dẫn – câu trả lời, so sánh có xếp hạng, hội thoại nhiều lượt và dữ liệu an toàn, được chuyên viên gán nhãn tại Nhật viết theo bộ quy tắc văn phong đã được đội ngũ của quý khách phê duyệt.

Phần khó của dữ liệu chỉ dẫn tiếng Nhật không phải là viết ra một câu trả lời. Mà là viết cùng một câu trả lời, cùng một văn phong, mười nghìn lần — và có thể giải thích bằng văn bản vì sao chọn văn phong đó.

Vì sao dữ liệu chỉ dẫn tiếng Nhật hay đi chệch hướng

Dữ liệu chỉ dẫn do nhiều người viết sẽ trôi dạt. Một chuyên viên kết thúc mọi câu trả lời bằng ですます, người khác chuyển sang である giữa chừng một phần giải thích kỹ thuật, người thứ ba viết theo lối cụt lủn của một trợ lý chat. Mô hình huấn luyện trên hỗn hợp đó học được rằng cả ba đều chấp nhận được, rồi tạo ra bất kỳ kiểu nào nó thích — và đây chính là lời than phiền phổ biến nhất mà chúng tôi nghe được về các bản tinh chỉnh tiếng Nhật.

Văn phong không phải là trục duy nhất bị trôi dạt. Lời từ chối còn tệ hơn. Tiếng Nhật từ chối một cách gián tiếp, và một chuyên viên chưa được chỉ rõ lời từ chối phải trông như thế nào sẽ viết ra đủ thứ, từ một câu お断りします dứt khoát đến một câu それは難しいかもしれません mềm mỏng. Nếu một nửa dữ liệu an toàn từ chối mềm đến mức có thể bị hiểu nhầm là đồng ý, mô hình sẽ học cách nói nước đôi thay vì học cách từ chối.

Vì vậy sản phẩm bàn giao không bao giờ chỉ là dữ liệu. Đó là dữ liệu cộng với những quyết định bằng văn bản đã tạo ra nó: bộ quy tắc văn phong, mẫu câu từ chối, các quy tắc định dạng, và phiên bản của từng thứ đó mà một lô dữ liệu cụ thể được viết theo.

Tổng quan nhanh

Loại bộ dữ liệu
Chỉ dẫn / SFT, cặp và xếp hạng ưu tiên, hội thoại nhiều lượt, dữ liệu an toàn và từ chối, bộ dữ liệu dựng nền cho RAG.
Người viết
Chuyên viên gán nhãn bản ngữ tại Nhật, được một chuyên viên thứ hai và một thẩm định viên cấp cao kiểm tra lại.
Kiểm soát văn phong
Một bộ quy tắc văn phong bằng văn bản chốt mức độ lịch sự, cách kết câu, cách dùng đại từ và định dạng trước khi triển khai chính thức.
Định dạng thường dùng
JSONL — mảng messages cho SFT, cặp chosen/rejected cho dữ liệu ưu tiên.
Nguồn gốc dữ liệu
Mỗi bản ghi mang theo phiên bản tài liệu hướng dẫn, vai trò người viết và trạng thái thẩm định.

Loại bộ dữ liệu

Chúng tôi xây dựng gì

Năm nhóm bộ dữ liệu, thường được kết hợp với nhau. Mỗi nhóm có một định nghĩa khác nhau về thế nào là “đúng”, nên mỗi nhóm có phần hướng dẫn riêng và lượt thẩm định riêng.

Dữ liệu chỉ dẫn và SFT

Các cặp câu lệnh – câu trả lời minh họa hành vi mà quý khách mong muốn, viết mới hoàn toàn hoặc viết lại từ nội dung sẵn có của quý khách.

  • Ví dụ minh họa tác vụ
  • Cặp viết lại và tóm tắt
  • Hỏi đáp theo lĩnh vực
  • Đầu ra bị ràng buộc về định dạng

Dữ liệu ưu tiên và xếp hạng

Hai hoặc nhiều câu trả lời ứng viên được so sánh theo các tiêu chí viết rõ ràng, với lý do lựa chọn được ghi lại chứ không phải suy đoán.

  • So sánh cặp chosen / rejected
  • Xếp hạng N phương án
  • Điểm theo từng tiêu chí
  • Lý giải bằng văn bản cho mỗi lần so sánh

Hội thoại nhiều lượt

Những cuộc hội thoại trong đó ngữ cảnh tích lũy dần — văn phong đặt ra ở lượt một phải sống sót đến lượt tám, và đây chính là chỗ phần lớn dữ liệu hội thoại tiếng Nhật sụp đổ.

  • Hội thoại hướng tác vụ
  • Lượt hỏi lại và chỉnh sửa
  • Kiểm tra việc mang ngữ cảnh qua các lượt
  • Tính nhất quán của nhân vật và vai

Dữ liệu an toàn, từ chối và red team

Những câu lệnh cần bị từ chối, những câu lệnh trông như cần bị từ chối nhưng thực ra thì không, và cách diễn đạt lời từ chối phân biệt hai loại đó.

  • Mẫu câu từ chối theo từng nhóm
  • Phản ví dụ về từ chối quá mức
  • Câu lệnh đối kháng và jailbreak
  • Cách xử lý chủ đề nhạy cảm trong tiếng Nhật

Bộ dữ liệu RAG và dựng nền

Các bộ ba gồm câu hỏi, đoạn văn bản được truy xuất và câu trả lời dựng trên đó, cộng thêm các trường hợp phủ định khi đoạn văn bản thực ra không chứa câu trả lời.

  • Cặp trả lời được / không trả lời được
  • Đánh dấu đoạn trích dẫn
  • Đoạn văn bản gây nhiễu
  • Dựng nền trên tài liệu tiếng Nhật

Đặc thù tiếng Nhật

Điều gì khiến công việc này mang tính đặc thù tiếng Nhật

Đây là bốn quyết định mà nếu không đưa ra, sẽ tạo nên một bộ dữ liệu trông ổn khi thẩm định nhưng lại khiến mô hình hành xử tệ.

Cấp độ lịch sự

Tiếng Nhật buộc phải chọn một mức độ lịch sự ở mọi phần kết câu. ですます, である và thể thông thường không thể thay thế cho nhau, và một mô hình huấn luyện trên hỗn hợp của chúng sẽ trộn lẫn chúng ngay trong một câu trả lời.

Cách chúng tôi xử lý Bộ quy tắc văn phong chốt một văn phong mặc định cho từng bề mặt sản phẩm, liệt kê các ngoại lệ và đưa ví dụ cụ thể cho từng trường hợp. Tính nhất quán về văn phong là một hạng mục được chấm điểm khi thẩm định, không phải chuyện cảm tính.

Từ chối gián tiếp

それはちょっと難しいです là một lời từ chối, không phải một nhận xét về độ khó. Chuyên viên gán nhãn hiểu theo nghĩa đen sẽ dạy mô hình đọc một lời từ chối như một câu nói trung tính.

Cách chúng tôi xử lý Các nhóm từ chối và cách diễn đạt của chúng được định nghĩa ngay từ đầu, kèm mức độ dứt khoát mong muốn của từng nhóm. Dữ liệu an toàn được thẩm định riêng để xem một lời từ chối có thực sự được người Nhật đọc ra là lời từ chối hay không.

Chủ ngữ bị lược bỏ

Tiếng Nhật lược bỏ chủ ngữ khi ngữ cảnh đã làm rõ. Trong dữ liệu nhiều lượt, đối tượng được nhắc đến có thể nằm cách đó bốn lượt, và một chuyên viên viết câu trả lời một cách tách rời sẽ đoán sai.

Cách chúng tôi xử lý Các mục nhiều lượt được viết và thẩm định như những cuộc hội thoại trọn vẹn, không bao giờ theo từng lượt. Khi đối tượng được nhắc đến thực sự mơ hồ, cuộc hội thoại hoặc được sửa lại hoặc bị loại bỏ — chứ không gán nhãn bằng một phỏng đoán.

Biến thể chữ viết và định dạng

Cùng một từ xuất hiện dưới dạng kanji, hiragana hoặc katakana; chữ số và dấu câu xuất hiện ở dạng full-width hoặc half-width. Nếu không kiểm soát, điều này dạy mô hình rằng định dạng là ngẫu nhiên.

Cách chúng tôi xử lý Một quy ước chuẩn hóa bao trùm việc chọn hệ chữ viết cho các từ thông dụng, chữ số, dấu câu, khoảng trắng quanh văn bản Latin và cách định dạng danh sách. Quy ước này được áp dụng ngay khi viết và được kiểm tra tự động trước khi bàn giao.

Quy trình

Một bộ dữ liệu được xây dựng như thế nào

Dự án thử nghiệm tồn tại để làm vỡ bản thảo đầu tiên của tài liệu hướng dẫn. Việc triển khai chính thức chỉ bắt đầu khi nó không còn vỡ nữa.

  1. 01

    Xác định hành vi mong muốn

    Chúng tôi thống nhất thế nào là một câu trả lời tốt cho sản phẩm của quý khách: văn phong, độ dài, định dạng, cần từ chối điều gì và từ chối ra sao, và mô hình nên làm gì khi nó không biết.

  2. 02

    Soạn bộ quy tắc văn phong

    Các quyết định trở thành một tài liệu bằng văn bản kèm ví dụ và phản ví dụ cụ thể. Những điểm mơ hồ mà quý khách chưa quyết được nêu lên ở đây thay vì bị âm thầm bỏ qua.

  3. 03

    Thử nghiệm và hiệu chỉnh

    Một lô nhỏ được nhiều chuyên viên gán nhãn viết một cách độc lập. Chỗ nào họ khác nhau, chỗ đó tài liệu hướng dẫn chưa rõ — chúng tôi sửa tài liệu hướng dẫn, không sửa con người.

  4. 04

    Viết và thẩm định ở giai đoạn chính thức

    Mỗi mục do một chuyên viên viết và một chuyên viên khác thẩm định, với một thẩm định viên cấp cao lấy mẫu và phân xử các bất đồng bằng văn bản.

  5. 05

    Đóng gói và quản lý phiên bản

    Bàn giao gồm dữ liệu, phiên bản tài liệu hướng dẫn, nguồn gốc theo từng bản ghi, báo cáo QA và nhật ký thay đổi so với lô trước.

Bàn giao

Quý khách nhận được gì

Các trường dữ liệu được thống nhất khi khởi động dự án; đây là cấu trúc mặc định khi quý khách chưa có schema sẵn có cần khớp theo.

Cấu trúc bàn giao mặc định cho dữ liệu huấn luyện LLM. Chúng tôi có hỗ trợ schema tùy chỉnh.
Bộ dữ liệuĐịnh dạng mặc địnhBản ghi bao gồm
Chỉ dẫn / SFTJSONL, mảng messagescác lượt system / user / assistant, thẻ tác vụ, phiên bản tài liệu hướng dẫn
Cặp ưu tiênJSONL, chosen + rejectedcả hai ứng viên, điểm theo từng tiêu chí, lý giải bằng văn bản
Hội thoại nhiều lượtJSONL, mỗi dòng một cuộc hội thoạidanh sách đầy đủ các lượt, ghi chú về nhân vật, thẻ văn phong
An toàn và từ chốiJSONLcâu lệnh, nhóm, hành vi mong đợi, cách diễn đạt lời từ chối đã dùng
Dựng nền cho RAGJSONLcâu hỏi, các đoạn văn bản, câu trả lời, đoạn trích dẫn, cờ trả lời được

Chất lượng

Những khâu kiểm soát riêng cho công việc này

QA gán nhãn thông thường không phát hiện được trôi dạt văn phong hay một lời từ chối quá mềm. Những khâu kiểm tra sau đây thì có.

  • Tính nhất quán về văn phong được chấm điểm cho từng câu trả lời, và xuyên suốt mọi lượt của một cuộc hội thoại.
  • Mức độ dứt khoát của lời từ chối được một người bản ngữ thứ hai thẩm định theo các nhóm đã định nghĩa.
  • Kiểm tra chuẩn hóa tự động về hệ chữ viết, chữ số, dấu câu và khoảng trắng trước khi bàn giao.
  • Phát hiện trùng lặp và gần trùng lặp giữa các lô, để bộ dữ liệu không âm thầm mất đi tính đa dạng.
  • Độ đa dạng của câu lệnh được theo dõi theo bảng phân loại tác vụ, để không nhóm nào bị chiếm tỷ trọng quá lớn một cách vô tình.
  • Một mẫu giữ riêng được thẩm định viên cấp cao đánh giá lại một cách mù để tạo ra con số chất lượng của lô.

FAQ

Về dữ liệu huấn luyện LLM

Những câu hỏi các đội ngũ thường đặt ra khi xác định phạm vi cho bản tinh chỉnh tiếng Nhật đầu tiên.

Cả hai. Viết từ đầu là việc thường gặp với tiếng Nhật, vì dữ liệu chỉ dẫn mở dùng được bằng tiếng Nhật rất khan hiếm, còn dữ liệu dịch máy thì mang cấu trúc câu tiếng Anh vào mô hình. Khi quý khách đã có sẵn nội dung — nhật ký hỗ trợ, sổ tay hướng dẫn, tài liệu nội bộ — chúng tôi thường viết lại từ đó, cách này giúp dữ liệu bám sát đúng lĩnh vực của quý khách.

Một bộ quy tắc văn phong bằng văn bản kèm ví dụ cụ thể, một vòng hiệu chỉnh trước khi triển khai chính thức trong đó nhiều chuyên viên viết cùng những mục giống nhau một cách độc lập, và tính nhất quán về văn phong là một hạng mục được chấm điểm rõ ràng khi thẩm định. Ở đây tính nhất quán là một thuộc tính đo được, không phải một nguyện vọng — điều chúng tôi theo dõi chính là mức khác biệt giữa các chuyên viên, và mọi khác biệt đã được giải quyết đều được ghi ngược trở lại bộ quy tắc.

Không dùng làm nguồn cho dữ liệu cuối cùng. Dữ liệu chỉ dẫn được dịch sẽ thừa hưởng cấu trúc diễn ngôn tiếng Anh, các giả định về mức độ lịch sự của tiếng Anh và thói quen định dạng tiếng Anh; mô hình huấn luyện trên đó tạo ra thứ tiếng Nhật mà người đọc bản ngữ mô tả là văn dịch. Chúng tôi có dùng bản dịch làm giàn giáo để nghĩ ra ý tưởng câu lệnh, nhưng câu trả lời thì do người Nhật viết bằng tiếng Nhật.

Chỉ khi quý khách đồng ý, và luôn có con người viết lại và thẩm định bên trên — không bao giờ là một luồng đi thẳng không qua thẩm định. Việc có sử dụng AI hỗ trợ hay không được ghi lại theo từng bản ghi, để sau này quý khách có thể lọc hoặc kiểm tra. Nếu quý khách yêu cầu dữ liệu hoàn toàn do con người viết, chúng tôi thực hiện dự án theo cách đó và trường thông tin về nguồn gốc sẽ chứng minh điều đó.

Ít hơn phần lớn các đội ngũ hình dung. Vài nghìn mục được viết cẩn thận, nhất quán về văn phong thường đưa một bản tinh chỉnh tiếng Nhật đi xa hơn so với lượng dữ liệu nhiễu gấp mười lần, vì mô hình đang học một văn phong không kém gì học một tác vụ. Chúng tôi xác định phạm vi một dự án thử nghiệm vài trăm mục trước để kiểm chứng tài liệu hướng dẫn, rồi mới định quy mô chính thức dựa trên những gì dự án đó đo được.

Dữ liệu huấn luyện LLM

Hãy gửi cho chúng tôi hành vi mà quý khách muốn dạy cho mô hình.

Một mô tả về tác vụ và vài câu trả lời mẫu là đủ để bắt đầu. Chúng tôi sẽ phản hồi với những câu hỏi về bảng phân loại nhãn cần được trả lời và một dự án thử nghiệm có phạm vi cụ thể.

Ký NDA trước khi quý khách chia sẻ bất kỳ dữ liệu nào. Xác định phạm vi thử nghiệm là miễn phí.