Đánh giá & phản hồi từ con người

Đánh giá LLM tiếng Nhật và phản hồi từ con người

Phán đoán của con người theo cấu trúc rõ ràng về những gì mô hình của quý khách thực sự tạo ra bằng tiếng Nhật — được người bản ngữ chấm điểm theo một thang tiêu chí bằng văn bản, có đo mức đồng thuận và phân xử các bất đồng bằng văn bản.

Một cuộc đánh giá chỉ tốt bằng chính thang tiêu chí của nó. Nếu hai người Nhật đủ năng lực chấm cùng một câu trả lời khác nhau mà không nói được vì sao, thì con số thu được chỉ là nhiễu khoác lên mình một dấu thập phân.

Vì sao đánh giá tiếng Nhật cần người đánh giá là người Nhật

Các chỉ số tự động và cách dùng LLM làm trọng tài rất hữu ích để theo dõi xu hướng, nhưng không đáng tin ở đúng những lỗi quan trọng nhất trong tiếng Nhật. Một mô hình trọng tài được huấn luyện chủ yếu trên tiếng Anh sẽ sẵn sàng chấp nhận một câu trả lời có mức độ lịch sự sai với tình huống, có lời từ chối mềm đến mức không đọc ra là từ chối, hoặc có kính ngữ mâu thuẫn với mối quan hệ đã được thiết lập ba lượt trước đó. Đó chính là những lỗi mà người dùng Nhật nhận ra ngay lập tức còn chỉ số thì không nhận ra chút nào.

Vì vậy chúng tôi đánh giá theo cách một thẩm định viên cẩn thận sẽ làm, nhưng làm cho việc thẩm định có thể tái lập được: thang tiêu chí có mốc neo kèm ví dụ cụ thể ở từng mức điểm, hiệu chỉnh trước khi bắt đầu chấm, chấm mù hai lần trên một mẫu, và phân xử bằng văn bản khi những người chấm bất đồng. Kết quả là một tập hợp các con số quý khách có thể bảo vệ được, kèm theo lập luận đã tạo ra chúng.

Chúng tôi cũng coi tính độc lập là một ràng buộc thiết kế. Người đánh giá trong một dự án không phải là những người đã viết dữ liệu huấn luyện cho dự án đó, vì người chấm điểm chính tài liệu hướng dẫn của mình thường có xu hướng chấm rộng tay.

Tổng quan nhanh

Loại hình đánh giá
So sánh cặp, chấm điểm theo thang tiêu chí, tính xác thực và mức dựng nền, an toàn và red teaming, xây dựng bộ dữ liệu chuẩn.
Người chấm điểm
Người bản ngữ tại Nhật; chuyên gia lĩnh vực khi nội dung đòi hỏi điều đó.
Báo cáo kèm theo
Mức đồng thuận giữa các thẩm định viên, tỷ lệ phải phân xử, phân tích theo từng tiêu chí và toàn bộ ghi chú chấm điểm.
Tính độc lập
Người đánh giá không phải là chuyên viên đã viết dữ liệu huấn luyện của quý khách.
Khả năng lặp lại
Thang tiêu chí được quản lý phiên bản, nên một lần chạy sau này vẫn so sánh được với lần trước.

Loại hình đánh giá

Chúng tôi đánh giá gì

Những câu hỏi khác nhau cần những công cụ khác nhau. Phần lớn chương trình chạy hai đến ba loại hình trên cùng một mô hình.

So sánh cặp theo ưu tiên

Hai câu trả lời cho cùng một câu lệnh, được so sánh theo các tiêu chí viết rõ ràng. Đây là cách vững chắc nhất để so sánh các phiên bản mô hình, vì một phán đoán tương đối ổn định hơn nhiều so với một điểm số tuyệt đối.

  • So sánh A/B giữa các mô hình
  • Ghi nhận rõ trường hợp hòa
  • Ưu tiên theo từng tiêu chí
  • Thứ tự trình bày được kiểm soát để tránh thiên lệch vị trí

Chấm điểm theo thang tiêu chí

Điểm số tuyệt đối trên các tiêu chí có tên gọi rõ ràng — độ chính xác, mức hữu ích, văn phong, định dạng, an toàn — mỗi tiêu chí kèm mô tả neo cho biết một mức điểm cụ thể có nghĩa là gì.

  • Thang thứ bậc có mốc neo
  • Điểm theo từng tiêu chí, không gộp thành một con số duy nhất
  • Bắt buộc nêu lý do khi cho điểm thấp
  • Thang tiêu chí được quản lý phiên bản cho mỗi lần chạy

Tính xác thực và mức dựng nền

Một khẳng định có đúng hay không, và nó có thực sự được đoạn văn bản đưa cho mô hình chống đỡ hay không. Đây là hai loại lỗi khác nhau và được chấm riêng.

  • Kiểm chứng ở cấp độ từng khẳng định
  • Kiểm tra đoạn trích dẫn
  • Phát hiện khẳng định không có căn cứ
  • Kiểm chứng theo nguồn tiếng Nhật

An toàn và red teaming

Các câu lệnh đối kháng do người Nhật viết bằng tiếng Nhật, bao gồm cả những cách diễn đạt gián tiếp và uyển ngữ mà các bộ câu lệnh dịch từ tiếng Anh không bao giờ có.

  • Bộ tấn công phân theo nhóm
  • Thăm dò hiện tượng từ chối quá mức
  • Rủi ro xã hội và pháp lý đặc thù Nhật Bản
  • Phát hiện được gắn thẻ mức nghiêm trọng

Xây dựng bộ dữ liệu chuẩn

Một bộ đánh giá giữ riêng được xây cho lĩnh vực của quý khách, với các mục được thiết kế để phân biệt chứ không phải để mô hình nào cũng trả lời đúng.

  • Kho mục cân bằng theo độ khó
  • Lấy nguồn có tính đến nguy cơ nhiễm dữ liệu
  • Câu trả lời tham chiếu kèm các biến thể chấp nhận được
  • Bộ khung chấm điểm dùng lại được

Đặc thù tiếng Nhật

Những gì một cuộc đánh giá không phải tiếng Nhật bỏ sót

Mỗi điểm sau đây đều vô hình với một mô hình trọng tài huấn luyện bằng tiếng Anh và hiển nhiên với một người đọc tiếng Nhật.

Mức độ phù hợp của văn phong

Một câu trả lời có thể đúng ngữ pháp, chính xác về thông tin mà vẫn sai, vì nó nói với khách hàng bằng văn phong dùng cho đồng nghiệp. Trong tiếng Nhật, mức độ lịch sự là chuyện đúng hay sai, chứ không phải chuyện sở thích hành văn.

Cách chúng tôi xử lý Văn phong là một tiêu chí có tên riêng trong thang chấm điểm, có mốc neo riêng và được chấm tách khỏi độ chính xác, để một câu trả lời đúng nội dung nhưng sai văn phong không thể núp sau nội dung của nó.

Mức độ dứt khoát của lời từ chối

Lời từ chối trong tiếng Nhật mặc định là gián tiếp. Một mô hình đáp lại yêu cầu bị cấm bằng 難しいかもしれません thì về mặt kỹ thuật là đã nói nước đôi, và nhiều thiết lập đánh giá sẽ chấm đó là một lần từ chối thành công.

Cách chúng tôi xử lý Lời từ chối được chấm dựa trên việc người Nhật có đọc ra đó là lời từ chối hay không, theo một thang có ví dụ cụ thể, và việc từ chối quá mức được chấm như một lỗi riêng chứ không phải một thành công.

Tính nhất quán của kính ngữ qua các lượt

Mối quan hệ được thiết lập ở đầu cuộc hội thoại ràng buộc mọi lượt sau đó. Mô hình thường xuyên thiết lập lại nó giữa chừng, và với người dùng Nhật thì điều đó đọc ra như trợ lý đã quên mất mình đang nói chuyện với ai.

Cách chúng tôi xử lý Các mục nhiều lượt được chấm như những cuộc hội thoại, với một tiêu chí nhất quán nhìn xuyên suốt các lượt thay vì nhìn từng câu trả lời một cách tách rời.

Danh từ riêng và cách đọc

Danh từ riêng tiếng Nhật có nhiều cách đọc hợp lệ, và một mô hình đọc sai tên người hay tên địa danh là đang phạm một lỗi về thông tin mà việc kiểm tra chính tả không nhìn thấy được.

Cách chúng tôi xử lý Lỗi về thực thể và cách đọc là một tiểu mục riêng trong nhóm lỗi tính xác thực, được kiểm chứng theo nguồn tiếng Nhật chứ không theo trí nhớ của người đánh giá.

Quy trình

Một cuộc đánh giá diễn ra như thế nào

Thang tiêu chí là sản phẩm bàn giao còn lại sau khi lần chạy kết thúc. Chính nó làm cho cuộc đánh giá lần sau so sánh được với lần này.

  1. 01

    Xác định thế nào là “tốt”

    Chúng tôi chuyển những mối quan tâm về chất lượng của quý khách thành các tiêu chí có tên gọi rõ ràng, rồi viết mô tả neo cho từng mức điểm bằng ví dụ thật lấy từ chính đầu ra mô hình của quý khách.

  2. 02

    Xây dựng bộ mục đánh giá

    Câu lệnh được lấy mẫu hoặc viết mới để bao phủ những hành vi quý khách quan tâm, kể cả các trường hợp hiếm và đối kháng mà việc lấy mẫu ngẫu nhiên sẽ không bao giờ chạm tới.

  3. 03

    Hiệu chỉnh những người chấm điểm

    Mọi người đánh giá đều chấm cùng một lô hiệu chỉnh. Chỗ khác biệt được đưa ra thảo luận, các mốc neo của thang tiêu chí được làm sắc nét hơn, và việc chấm chỉ bắt đầu khi mức đồng thuận đã ổn định.

  4. 04

    Chấm, chấm kép, phân xử

    Một tỷ lệ mục đã định được hai người đánh giá chấm mù. Các bất đồng được chuyển lên thẩm định viên cấp cao, người này ghi lại lý do của phương án giải quyết.

  5. 05

    Báo cáo kèm lập luận

    Quý khách nhận được điểm số, thống kê về mức đồng thuận, nhật ký phân xử và một bản tóm tắt bằng văn bản về các kiểu lỗi lặp lại — chứ không chỉ một dòng trên bảng xếp hạng.

Bàn giao

Quý khách nhận được gì

Mọi điểm số đều truy nguyên được về một mục cụ thể, một vai trò người đánh giá, một phiên bản thang tiêu chí và, ở những chỗ có ghi, một phần lý giải.

Sản phẩm bàn giao mặc định của một cuộc đánh giá. Định dạng bộ khung chấm điểm được khớp với hệ thống của quý khách nếu quý khách đã có sẵn.
Sản phẩm bàn giaoĐịnh dạngNội dung
Điểm theo từng mụcJSONL hoặc CSVmã mục, điểm theo tiêu chí, lý giải, vai trò người đánh giá, phiên bản thang tiêu chí
Báo cáo mức đồng thuậnPDF hoặc Markdownmức đồng thuận giữa các thẩm định viên theo từng tiêu chí, tỷ lệ phải phân xử, mức trôi dạt trong suốt lần chạy
Phân tích lỗiPDF hoặc Markdowncác kiểu lỗi lặp lại, ví dụ cụ thể, đề xuất thay đổi tài liệu hướng dẫn hoặc dữ liệu
Phát hiện từ red teamJSONLcâu lệnh, câu trả lời, nhóm, mức nghiêm trọng, ghi chú tái hiện
Bộ dữ liệu chuẩnJSONL kèm bộ khungcác mục, câu trả lời tham chiếu, biến thể chấp nhận được, script chấm điểm

Chất lượng

Những khâu kiểm soát riêng cho công việc này

Một cuộc đánh giá không có thống kê về mức đồng thuận chỉ là một ý kiến. Đây là những khâu kiểm tra biến nó thành một phép đo.

  • Vòng hiệu chỉnh trước khi chấm điểm, lặp lại mỗi khi thang tiêu chí thay đổi.
  • Chấm mù hai lần trên một mẫu đã định, với mức đồng thuận được báo cáo theo từng tiêu chí thay vì gộp chung.
  • Phân xử bằng văn bản cho mọi bất đồng, lưu thành nhật ký mà quý khách nhận được cùng kết quả.
  • Thứ tự câu trả lời được xáo ngẫu nhiên trong các lần so sánh cặp để kiểm soát thiên lệch vị trí.
  • Người đánh giá được tách khỏi đội ngũ đã tạo ra dữ liệu huấn luyện cho cùng dự án đó.
  • Thang tiêu chí được quản lý phiên bản, để một lần chạy lại sau nhiều tháng vẫn đo đúng thứ nó đã đo trước đây.

FAQ

Về đánh giá LLM

Những điều các đội ngũ hỏi trước khi đặt hàng một cuộc đánh giá tiếng Nhật đầu tiên.

Trọng tài LLM rẻ, nhanh và hữu ích để theo dõi hồi quy giữa các bản phát hành. Chúng lại không đáng tin ở đúng những chỗ tiếng Nhật khó — mức độ phù hợp của phép lịch sự, độ dứt khoát của lời từ chối, tính nhất quán của kính ngữ và cách đọc tên riêng — vì những phán đoán đó phụ thuộc vào tri thức ngữ dụng của người bản ngữ. Một cách bố trí thường gặp là dùng một bộ do con người chấm làm tham chiếu, một trọng tài LLM cho các lần chạy thường xuyên, và định kỳ cho con người chấm lại để kiểm tra xem trọng tài có trôi dạt khỏi tham chiếu hay không.

Điều đó phụ thuộc vào mức khác biệt quý khách cần phát hiện và số tiêu chí đang chấm. Vài trăm mục được chọn kỹ thường đủ để phân tách hai mô hình khác nhau rõ rệt; phân biệt các checkpoint gần tương đương nhau thì cần nhiều hơn đáng kể. Chúng tôi định kích thước bộ dữ liệu theo quyết định mà quý khách muốn đưa ra, và chúng tôi sẽ nói rõ khi một bộ quá nhỏ để chống đỡ cho kết luận quý khách muốn rút ra từ nó.

Có. Với những nội dung như câu hỏi về pháp luật, thuế, kế toán, lao động hay đăng ký doanh nghiệp, chúng tôi xây dựng đội ngũ đánh giá xoay quanh chuyên môn mà tác vụ yêu cầu. Chúng tôi không duy trì một danh sách thường trực gồm những người hành nghề có chứng chỉ — khả năng đáp ứng được đánh giá theo từng dự án dựa trên phạm vi, khối lượng và tiến độ, và chúng tôi xác nhận rõ những gì có thể thực hiện được trước khi công việc bắt đầu.

Có, nhưng không dùng cùng những con người đó. Người đánh giá trong một dự án được tách khỏi chuyên viên đã viết dữ liệu huấn luyện của dự án, vì chấm điểm theo một tài liệu hướng dẫn mà mình góp phần viết ra thì không phải là một phép đo độc lập. Nếu quý khách muốn việc đánh giá nằm hoàn toàn bên ngoài nhà cung cấp đã tạo ra dữ liệu, chúng tôi cho rằng đó là một quan điểm hợp lý và sẽ nói thẳng như vậy.

Báo cáo đúng kết quả, kèm phần phân tích lỗi giải thích cho kết quả đó. Một báo cáo chỉ có điểm số thì không dùng được để hành động — thứ quý khách cần là các kiểu lỗi lặp lại đứng sau nó, ví dụ cụ thể cho từng kiểu, và một góc nhìn rõ ràng về việc cách khắc phục là thêm dữ liệu, đổi tài liệu hướng dẫn, hay thay đổi chính sản phẩm. Chúng tôi thà trình bày rõ ràng một phát hiện khó nghe còn hơn làm nó dịu đi.

Đánh giá LLM

Hãy tìm ra mô hình của quý khách sai ở đâu khi dùng tiếng Nhật.

Hãy gửi một tập đầu ra của mô hình, hoặc những câu lệnh quý khách muốn dùng để kiểm thử. Chúng tôi sẽ phản hồi bằng một thang tiêu chí đề xuất, một mẫu đã chấm theo thang đó, và những gì một lần chạy đầy đủ sẽ bao gồm.

Ký NDA trước khi quý khách chia sẻ bất kỳ dữ liệu nào. Xác định phạm vi thử nghiệm là miễn phí.