Lubang pedoman
Kasusnya tidak tercakup oleh pedoman. Diperbaiki dengan merevisi pedoman, bukan dengan mengoreksi itemnya — kalau tidak, kasus yang sama akan berulang.
Kerangka kualitas
Kualitas adalah angka yang dapat Anda tindaklanjuti, atau ia hanya sebuah opini. Halaman ini menjelaskan persis angka mana yang kami hasilkan, bagaimana angka itu dihitung, apa yang dapat dan tidak dapat diberitahukannya kepada Anda, serta apa yang ada di dalam laporan QA yang menyertai setiap batch.
Setiap angka yang ditampilkan di situs ini sebagai contoh diberi label sebagai contoh. Kami tidak mempublikasikan jaminan akurasi, karena jaminan yang dibuat sebelum melihat data Anda bukanlah sebuah komitmen — itu angka pemasaran.
Tahap pemeriksaan akhir bisa menangkap kekeliruan. Ia tidak bisa menangkap ambiguitas, dan ambiguitaslah yang sebenarnya merusak dataset bahasa Jepang. Jika pedoman membolehkan dua pembacaan atas sebuah kasus, kedua pembacaan itu lolos pemeriksaan, dan inkonsistensinya masuk ke data pelatihan dengan status bersih.
Karena itu pekerjaan yang menentukan kualitas terjadi sebelum anotasi: menulis pedoman, mematahkannya dengan kasus batas nyata selama pilot, mengukur apakah anotator yang bekerja independen menuju kesimpulan yang sama, dan memperbaiki pedomannya di tempat mereka tidak sama. Peninjauan adalah garis pertahanan kedua, bukan yang pertama.
Berikut adalah keseluruhan sistemnya, termasuk bagian yang tidak nyaman untuk dipublikasikan — apa yang gagal ditangkap oleh tiap metrik, dan di titik mana sebuah angka bisa tampak sehat padahal datasetnya tidak.
Sekilas
Sistemnya
Putaran ini berjalan sepanjang umur proyek, bukan sekali di awal.
Pedoman ditulis dengan contoh terurai dan contoh tandingan untuk setiap keputusan yang dituntut tugas tersebut. Apa pun yang dibiarkan tersirat di sini akan menjadi inkonsistensi kemudian.
Anotator melabeli set kalibrasi yang sama secara independen. Perbedaannya menunjukkan di mana pedomannya ambigu — yang diperbaiki pedomannya, bukan anotatornya.
Pekerjaan produksi, dengan versi pedoman dicatat pada tiap item sehingga pertanyaan yang muncul kemudian tentang sebuah record dapat dijawab dengan tepat.
Anotator kedua meninjau pada kedalaman yang sepadan dengan tugasnya. Tinjauan adalah peran tersendiri dengan kriterianya sendiri, bukan pengulangan anotasi dengan tempo lebih cepat.
Perbedaan penilaian diteruskan ke peninjau senior, yang mencatat penyelesaian beserta alasannya. Setiap penyelesaian menjadi contoh terurai di dalam pedoman.
Kesepakatan, akurasi gold set, dan pergeseran dihitung tiap batch, dibandingkan dengan batch sebelumnya, lalu dipakai untuk memutuskan di mana revisi pedoman berikutnya dibutuhkan.
Metrik
Didefinisikan di sini agar sebuah angka di dalam laporan QA dapat dipahami tanpa perlu bertanya kepada kami apa maksudnya.
Kesepakatan
97.8%
2.1% vs 7 hari terakhir
Akurasi gold set
98.6%
1.4% vs 7 hari terakhir
Item ditinjau
24826
18.7% minggu ini
Perbedaan belum selesai
18
12 vs 7 hari terakhir
Antarmuka ilustratif. Angka yang ditampilkan adalah data contoh untuk menjelaskan cara kami memantau kualitas, bukan hasil yang kami laporkan.
Tinjauan
Kedalaman tinjauan adalah setelan proyek, disepakati bersama Anda dan dinyatakan dalam kontrak. Lebih dalam tidak selalu lebih baik — tugas mekanis yang ditinjau dengan kedalaman penuh menghabiskan anggaran di tempat yang tidak menuntut pertimbangan.
| Kedalaman tinjauan | Umumnya dipakai untuk | Apa yang terjadi |
|---|---|---|
| Tinjauan sampel | Tugas mekanis bervolume tinggi dengan kesepakatan yang stabil | Sebagian item yang porsinya ditetapkan ditinjau; kegagalan memicu tinjauan yang lebih luas |
| Tinjauan penuh tahap kedua | Pelabelan yang menuntut pertimbangan dan sebagian besar pekerjaan rentang bahasa Jepang | Setiap item ditinjau oleh anotator kedua |
| Anotasi ganda secara buta | Set evaluasi, benchmark, dan gold set | Dua anotator bekerja independen; semua perbedaan diajudikasi |
| Tinjauan ahli | Domain dengan regulasi ketat dan pertimbangan profesional | Spesialis domain meninjau, dengan penalaran tertulis pada item yang diperdebatkan |
Taksonomi kesalahan
Cacat yang punya nama dapat dihitung, ditelusuri trennya, dan diperbaiki. Hitungan "kesalahan" yang generik tidak dapat memberi tahu Anda apa yang harus diubah.
Kasusnya tidak tercakup oleh pedoman. Diperbaiki dengan merevisi pedoman, bukan dengan mengoreksi itemnya — kalau tidak, kasus yang sama akan berulang.
Kasusnya tercakup dan anotator menerapkan aturannya secara keliru. Diperbaiki lewat umpan balik dan, bila berulang, lewat contoh terurai yang lebih jelas.
Labelnya benar dan rentangnya tidak. Khas pada pekerjaan rentang bahasa Jepang, tempat aturan batas dan tokenisasi saling berkaitan.
Benar secara kebahasaan, keliru secara sosial: tingkat kesantunan yang salah, atau penolakan yang terlalu lembut untuk terbaca sebagai penolakan.
Sebuah klaim, cara baca nama, atau angka yang dapat diverifikasi ternyata salah. Dibedakan dari kesalahan pertimbangan karena solusinya adalah verifikasi, bukan kalibrasi.
Itemnya sendiri tidak dapat dipakai — audio tak terdengar, pindaian tak terbaca, prompt yang ambigu. Ditandai dan dikembalikan, tidak pernah diisi dengan tebakan yang terdengar masuk akal.
Pelaporan
Laporannya dirancang agar Anda dapat mengaudit batch tersebut tanpa kehadiran kami.
FAQ
Pertanyaan tentang apa yang dibuktikan dan tidak dibuktikan oleh angka-angka ini.
Kami tidak mempublikasikan jaminan akurasi, dan kami akan menyikapi jaminan semacam itu dari vendor mana pun dengan hati-hati. Akurasi yang dapat dicapai bergantung pada tugasnya, taksonominya, kualitas data sumbernya, dan seberapa banyak ambiguitas yang sungguh-sungguh terkandung dalam domain tersebut — dan tidak satu pun dari hal itu diketahui sebelum ada pilot. Yang kami komitmenkan adalah metode pengukurannya: metrik apa, dihitung bagaimana, dilaporkan seberapa sering, dan apa yang terjadi bila sebuah batch tidak memenuhi syarat. Setelah pilot pada data Anda, kita bisa membicarakan target yang realistis, karena saat itu sudah ada hal nyata untuk dibicarakan.
Itu data contoh. Angka-angka itu ada untuk menunjukkan apa yang dilaporkan antarmukanya dan bagaimana metriknya terlihat saat bergerak, dan justru karena itulah angka-angka tersebut disertai lencana dan penafian yang terlihat jelas. Angka itu bukan hasil dari proyek klien, dan kami tidak akan menyajikannya seolah-olah demikian.
Tidak dengan sendirinya. Kesepakatan mengukur konsistensi, bukan kebenaran — anotator yang sama-sama salah paham akan sepakat sepenuhnya. Angkanya juga membesar oleh taksonomi yang tidak seimbang, dan itulah sebabnya kami melaporkan koefisien terkoreksi peluang berdampingan dengan kesepakatan mentah, serta sebabnya gold set yang diajudikasi peninjau senior ada sebagai pemeriksaan independen atas kebenaran.
Batch itu tidak dikirim. Bergantung pada jenis kegagalannya, tanggapannya berupa anotasi ulang yang terarah, revisi pedoman yang diikuti pengerjaan ulang item yang terdampak, atau eskalasi kepada Anda bila penyebabnya ada di hulu — taksonomi yang ambigu atau data sumber yang tidak dapat menopang tugas tersebut. Kami lebih memilih mengirim terlambat disertai penjelasan daripada tepat waktu dengan angka yang tidak akan bertahan begitu bertemu model Anda.
Bisa, dan itu permintaan yang masuk akal. Anda dapat meninjau pedoman beserta riwayat versinya, mengambil sampel untuk dinilai secara independen, dan membandingkan temuan Anda dengan angka yang kami laporkan. Bila klien menjalankan QA sendiri secara paralel, kami memperlakukan perbedaan di antara keduanya sebagai temuan yang layak ditelusuri, bukan sebagai perselisihan yang harus diperdebatkan.
Kualitas
Sebuah pilot menghasilkan angka kesepakatan yang nyata, rincian kesalahan yang nyata, dan pandangan jujur tentang bagian mana dari taksonomi Anda yang akan bertahan pada volume besar.
NDA sebelum Anda membagikan data apa pun. Penentuan cakupan pilot tanpa biaya.