Evaluasi & umpan balik manusia

Evaluasi LLM bahasa Jepang dan umpan balik manusia

Penilaian manusia yang terstruktur atas apa yang benar-benar dihasilkan model Anda dalam bahasa Jepang — dinilai dengan rubrik tertulis oleh penutur asli, dengan kesepakatan yang diukur dan perbedaan yang dituntaskan secara tertulis.

Sebuah evaluasi hanya sebaik rubriknya. Jika dua penutur bahasa Jepang yang sama-sama kompeten memberi skor berbeda pada jawaban yang sama dan tidak bisa menjelaskan alasannya, angka yang keluar hanyalah derau berhias satu angka di belakang koma.

Mengapa evaluasi bahasa Jepang membutuhkan evaluator berbahasa Jepang

Metrik otomatis dan skema LLM-as-judge berguna untuk melacak tren, tetapi tidak dapat diandalkan untuk kegagalan yang paling penting dalam bahasa Jepang. Model penilai yang sebagian besar dilatih dengan bahasa Inggris akan dengan senang hati meloloskan jawaban yang tingkat kesantunannya tidak cocok dengan situasi, yang penolakannya terlalu lembut untuk terbaca sebagai penolakan, atau yang ragam hormatnya bertentangan dengan hubungan yang sudah ditetapkan tiga giliran sebelumnya. Itulah kesalahan yang langsung disadari pengguna Jepang dan sama sekali tidak terdeteksi oleh metrik.

Karena itu kami mengevaluasi seperti seorang peninjau yang cermat, tetapi dengan proses peninjauan yang dibuat dapat direproduksi: rubrik berjangkar dengan contoh terurai di setiap titik skor, kalibrasi sebelum penilaian dimulai, penilaian ganda secara buta pada sampel, dan ajudikasi tertulis ketika penilai berbeda pendapat. Keluarannya adalah sekumpulan angka yang dapat Anda pertanggungjawabkan, beserta penalaran yang menghasilkannya.

Kami juga memperlakukan independensi sebagai batasan rancangan. Evaluator dalam sebuah proyek bukanlah orang yang menulis data pelatihannya, karena orang yang menilai pedomannya sendiri cenderung menilainya dengan murah hati.

Sekilas

Jenis evaluasi
Preferensi berpasangan, penilaian rubrik, faktualitas dan grounding, keamanan dan red teaming, penyusunan benchmark.
Dinilai oleh
Penutur asli yang berbasis di Jepang; spesialis domain jika materinya menuntut hal itu.
Dilaporkan bersama
Kesepakatan antarpenilai, tingkat ajudikasi, rincian per kriteria, dan seluruh catatan penilaian.
Independensi
Evaluator bukan anotator yang menulis data pelatihan Anda.
Keterulangan
Rubrik diberi versi, sehingga sebuah putaran berikutnya dapat dibandingkan dengan putaran sebelumnya.

Jenis evaluasi

Yang kami evaluasi

Pertanyaan yang berbeda menuntut alat ukur yang berbeda. Sebagian besar program menjalankan dua atau tiga di antaranya pada model yang sama.

Preferensi berpasangan

Dua jawaban untuk prompt yang sama, dibandingkan dengan kriteria tertulis. Cara paling kokoh untuk membandingkan versi model, karena penilaian relatif jauh lebih stabil daripada skor absolut.

  • Perbandingan model A/B
  • Hasil seri dicatat secara eksplisit
  • Preferensi per kriteria
  • Urutan yang dikendalikan untuk bias posisi

Penilaian rubrik

Skor absolut pada kriteria bernama — akurasi, kebergunaan, ragam bahasa, format, keamanan — masing-masing dengan deskripsi berjangkar tentang arti setiap skor.

  • Skala ordinal berjangkar
  • Skor per kriteria, bukan satu angka campuran
  • Alasan wajib untuk skor rendah
  • Rubrik berversi untuk tiap putaran

Faktualitas dan grounding

Apakah sebuah klaim benar, dan apakah klaim itu memang didukung oleh kutipan yang diberikan kepada model. Keduanya adalah kegagalan yang berbeda dan dinilai terpisah.

  • Verifikasi pada tingkat klaim
  • Pemeriksaan rentang sitasi
  • Deteksi klaim tanpa dukungan
  • Verifikasi sumber berbahasa Jepang

Keamanan dan red teaming

Prompt adversarial yang ditulis dalam bahasa Jepang oleh penutur bahasa Jepang, termasuk ungkapan tidak langsung dan eufemistis yang tidak pernah ada dalam kumpulan prompt hasil terjemahan.

  • Set serangan berbasis kategori
  • Pengujian penolakan berlebihan
  • Risiko sosial dan hukum khas Jepang
  • Temuan bertanda tingkat keparahan

Penyusunan benchmark

Set evaluasi held-out yang dibangun untuk domain Anda, dengan item yang dirancang untuk membedakan, bukan untuk bisa dijawab benar oleh semua model.

  • Kumpulan item yang seimbang tingkat kesulitannya
  • Penyumberan yang sadar kontaminasi
  • Jawaban acuan beserta varian yang dapat diterima
  • Harness penilaian yang dapat dipakai ulang

Khas bahasa Jepang

Apa yang terlewat oleh evaluasi non-Jepang

Masing-masing hal berikut tidak terlihat oleh model penilai yang dilatih dengan bahasa Inggris, tetapi kentara bagi pembaca berbahasa Jepang.

Kepatutan ragam bahasa

Sebuah jawaban bisa gramatikal, akurat, dan tetap salah, karena ia menyapa pelanggan dengan ragam yang biasa dipakai kepada rekan kerja. Dalam bahasa Jepang, kesantunan menentukan benar atau salahnya sebuah jawaban, bukan sekadar gayanya.

Cara kami menanganinya Ragam bahasa adalah kriteria rubrik tersendiri dengan jangkarnya sendiri, dinilai terpisah dari akurasi agar jawaban yang berisi tetapi salah ragam tidak bisa bersembunyi di balik isinya.

Kekuatan penolakan

Penolakan dalam bahasa Jepang secara bawaan bersifat tidak langsung. Model yang menjawab permintaan terlarang dengan 難しいかもしれません secara teknis sudah berkelit, dan banyak skema evaluasi akan menilainya sebagai penolakan yang berhasil.

Cara kami menanganinya Penolakan dinilai berdasarkan apakah penutur bahasa Jepang akan membacanya sebagai penolakan, memakai skala dengan contoh terurai, dan penolakan berlebihan dinilai sebagai kegagalan tersendiri, bukan sebagai keberhasilan.

Konsistensi ragam hormat antargiliran

Hubungan yang ditetapkan di awal percakapan mengikat setiap giliran berikutnya. Model kerap mengatur ulang hubungan itu di tengah dialog, dan bagi pengguna Jepang hal itu terbaca seolah asisten lupa sedang berbicara dengan siapa.

Cara kami menanganinya Item multigiliran dinilai sebagai percakapan utuh, dengan kriteria konsistensi yang menilai antargiliran, bukan tiap jawaban secara terpisah.

Nama diri dan cara bacanya

Nama diri bahasa Jepang punya beberapa cara baca yang sah, dan model yang menghasilkan cara baca yang keliru untuk nama orang atau nama tempat sedang membuat kesalahan faktual yang tidak dapat dilihat oleh pemeriksa ejaan.

Cara kami menanganinya Kesalahan entitas dan cara baca merupakan subkategori faktualitas tersendiri, diverifikasi terhadap sumber berbahasa Jepang, bukan terhadap ingatan evaluator.

Proses

Bagaimana sebuah evaluasi dijalankan

Rubrik adalah hasil kerja yang berumur lebih panjang daripada putaran evaluasinya. Rubrik itulah yang membuat evaluasi berikutnya dapat dibandingkan dengan yang ini.

  1. 01

    Menetapkan arti "baik"

    Kami mengubah kekhawatiran kualitas Anda menjadi kriteria bernama, lalu menulis deskripsi berjangkar untuk tiap titik skor dengan contoh nyata dari keluaran model Anda sendiri.

  2. 02

    Menyusun set item

    Prompt diambil sebagai sampel atau ditulis untuk mencakup perilaku yang Anda pedulikan, termasuk kasus langka dan adversarial yang tidak akan pernah muncul lewat pengambilan sampel acak.

  3. 03

    Mengalibrasi penilai

    Setiap evaluator menilai batch kalibrasi yang sama. Perbedaannya didiskusikan, jangkar rubrik dipertajam, dan penilaian baru dimulai setelah tingkat kesepakatannya stabil.

  4. 04

    Menilai, menilai ganda, mengajudikasi

    Sebagian item yang porsinya telah ditetapkan dinilai secara buta oleh dua evaluator. Perbedaan penilaian diteruskan ke peninjau senior yang mencatat alasan penyelesaiannya.

  5. 05

    Melaporkan beserta penalarannya

    Anda menerima skornya, statistik kesepakatan, log ajudikasi, dan ringkasan tertulis tentang pola kegagalan yang berulang — bukan sekadar satu baris papan peringkat.

Pengiriman

Apa yang Anda terima

Setiap skor dapat ditelusuri ke sebuah item, peran evaluator, versi rubrik, dan alasan tertulisnya jika memang ditulis.

Hasil evaluasi default. Format harness penilaian disesuaikan dengan tumpukan teknologi Anda jika Anda memilikinya.
HasilFormatIsi
Skor per itemJSONL atau CSVid item, skor tiap kriteria, alasan, peran evaluator, versi rubrik
Laporan kesepakatanPDF atau Markdownkesepakatan antarpenilai per kriteria, tingkat ajudikasi, pergeseran sepanjang putaran
Analisis kegagalanPDF atau Markdownpola berulang, contoh terurai, usulan perubahan pedoman atau data
Temuan red teamJSONLprompt, jawaban, kategori, tingkat keparahan, catatan reproduksi
Set benchmarkJSONL beserta harnessitem, jawaban acuan, varian yang dapat diterima, skrip penilaian

Kualitas

Kontrol yang khusus untuk pekerjaan ini

Evaluasi tanpa statistik kesepakatan hanyalah opini. Pemeriksaan berikut yang mengubahnya menjadi pengukuran.

  • Putaran kalibrasi sebelum penilaian, diulang setiap kali rubrik berubah.
  • Penilaian ganda secara buta pada sampel yang telah ditetapkan, dengan kesepakatan dilaporkan per kriteria, bukan dicampur menjadi satu.
  • Ajudikasi tertulis untuk setiap perbedaan penilaian, disimpan sebagai log yang Anda terima bersama hasilnya.
  • Urutan jawaban diacak dalam perbandingan berpasangan untuk mengendalikan bias posisi.
  • Evaluator dipisahkan dari tim yang memproduksi data pelatihan untuk proyek yang sama.
  • Pemberian versi pada rubrik, sehingga pengulangan beberapa bulan kemudian mengukur hal yang sama dengan sebelumnya.

FAQ

Seputar evaluasi LLM

Yang ditanyakan tim sebelum memesan evaluasi bahasa Jepang yang pertama.

Penilai berbasis LLM itu murah, cepat, dan berguna untuk melacak regresi antarrilis. Penilai semacam itu tidak dapat diandalkan justru di titik-titik yang sulit dalam bahasa Jepang — kepatutan kesantunan, kekuatan penolakan, konsistensi ragam hormat, dan cara baca nama — karena penilaian tersebut bergantung pada pengetahuan pragmatik penutur asli. Susunan yang lazim adalah satu set yang dinilai manusia sebagai acuan, penilai LLM untuk putaran yang sering, dan penilaian ulang oleh manusia secara berkala untuk memastikan penilai LLM tidak bergeser menjauh dari acuannya.

Bergantung pada seberapa besar perbedaan yang perlu Anda deteksi dan berapa banyak kriteria yang Anda nilai. Beberapa ratus item yang dipilih dengan baik biasanya sudah cukup memisahkan dua model yang jelas berbeda; membedakan checkpoint yang nyaris setara membutuhkan jauh lebih banyak. Kami menakar ukuran setnya sesuai keputusan yang ingin Anda ambil, dan kami akan memberi tahu Anda bila sebuah set terlalu kecil untuk menopang kesimpulan yang Anda inginkan darinya.

Bisa. Untuk materi seperti pertanyaan hukum, perpajakan, akuntansi, ketenagakerjaan, atau pendaftaran perusahaan, kami membentuk tim evaluasi sesuai keahlian yang dibutuhkan tugas tersebut. Kami tidak memiliki daftar tetap tenaga profesional berlisensi — ketersediaan dinilai untuk setiap proyek berdasarkan cakupan, volume, dan jadwalnya, dan kami memastikan lebih dahulu apa yang dapat kami penuhi sebelum pekerjaan dimulai.

Kami mau, tetapi tidak dengan orang yang sama. Evaluator dalam sebuah proyek dipisahkan dari anotator yang menulis data pelatihannya, karena menilai berdasarkan pedoman yang ikut Anda tulis bukanlah pengukuran yang independen. Jika Anda lebih memilih evaluasinya sepenuhnya berada di luar vendor yang memproduksi datanya, menurut kami itu sikap yang masuk akal dan akan kami katakan begitu.

Hasilnya, ditambah analisis kegagalan yang menjelaskannya. Laporan yang hanya berisi skor tidak dapat ditindaklanjuti — yang Anda butuhkan adalah pola berulang di baliknya, contoh terurai untuk masing-masing, dan pandangan konkret tentang apakah solusinya berupa tambahan data, pedoman yang berbeda, atau perubahan pada produk. Kami lebih memilih menyampaikan temuan yang tidak nyaman secara jelas daripada memperhalusnya.

Evaluasi LLM

Cari tahu di mana model Anda salah dalam bahasa Jepang.

Kirimkan sekumpulan keluaran model, atau prompt yang ingin Anda pakai untuk mengujinya. Kami akan kembali dengan usulan rubrik, satu sampel yang telah dinilai dengan rubrik itu, dan gambaran tentang apa saja yang dibutuhkan untuk putaran penuh.

NDA sebelum Anda membagikan data apa pun. Penentuan cakupan pilot tanpa biaya.