Kerangka kualitas

Cara kami mengukur kualitas anotasi

Kualitas adalah angka yang dapat Anda tindaklanjuti, atau ia hanya sebuah opini. Halaman ini menjelaskan persis angka mana yang kami hasilkan, bagaimana angka itu dihitung, apa yang dapat dan tidak dapat diberitahukannya kepada Anda, serta apa yang ada di dalam laporan QA yang menyertai setiap batch.

Setiap angka yang ditampilkan di situs ini sebagai contoh diberi label sebagai contoh. Kami tidak mempublikasikan jaminan akurasi, karena jaminan yang dibuat sebelum melihat data Anda bukanlah sebuah komitmen — itu angka pemasaran.

Kualitas dirancang sejak awal, bukan diperiksa di akhir

Tahap pemeriksaan akhir bisa menangkap kekeliruan. Ia tidak bisa menangkap ambiguitas, dan ambiguitaslah yang sebenarnya merusak dataset bahasa Jepang. Jika pedoman membolehkan dua pembacaan atas sebuah kasus, kedua pembacaan itu lolos pemeriksaan, dan inkonsistensinya masuk ke data pelatihan dengan status bersih.

Karena itu pekerjaan yang menentukan kualitas terjadi sebelum anotasi: menulis pedoman, mematahkannya dengan kasus batas nyata selama pilot, mengukur apakah anotator yang bekerja independen menuju kesimpulan yang sama, dan memperbaiki pedomannya di tempat mereka tidak sama. Peninjauan adalah garis pertahanan kedua, bukan yang pertama.

Berikut adalah keseluruhan sistemnya, termasuk bagian yang tidak nyaman untuk dipublikasikan — apa yang gagal ditangkap oleh tiap metrik, dan di titik mana sebuah angka bisa tampak sehat padahal datasetnya tidak.

Sekilas

Yang diukur
Kesepakatan antaranotator, akurasi gold set yang terukur, tingkat ajudikasi, dan pergeseran label.
Dilaporkan per
Batch, dengan rincian per label dan per kriteria, bukan satu angka campuran.
Kedalaman tinjauan
Ditetapkan per proyek. Lebih dalam bila dibutuhkan pertimbangan, lebih ringan bila tugasnya mekanis.
Perbedaan penilaian
Diajudikasi secara tertulis oleh peninjau senior dan dituliskan kembali ke dalam pedoman.
Yang tidak kami lakukan
Mempublikasikan jaminan akurasi, atau mengutip angka yang diukur pada proyek lain.

Sistemnya

Enam tahap, berjalan terus-menerus

Putaran ini berjalan sepanjang umur proyek, bukan sekali di awal.

  1. 01

    Menyusun spesifikasi

    Pedoman ditulis dengan contoh terurai dan contoh tandingan untuk setiap keputusan yang dituntut tugas tersebut. Apa pun yang dibiarkan tersirat di sini akan menjadi inkonsistensi kemudian.

  2. 02

    Kalibrasi

    Anotator melabeli set kalibrasi yang sama secara independen. Perbedaannya menunjukkan di mana pedomannya ambigu — yang diperbaiki pedomannya, bukan anotatornya.

  3. 03

    Anotasi

    Pekerjaan produksi, dengan versi pedoman dicatat pada tiap item sehingga pertanyaan yang muncul kemudian tentang sebuah record dapat dijawab dengan tepat.

  4. 04

    Tinjauan

    Anotator kedua meninjau pada kedalaman yang sepadan dengan tugasnya. Tinjauan adalah peran tersendiri dengan kriterianya sendiri, bukan pengulangan anotasi dengan tempo lebih cepat.

  5. 05

    Ajudikasi

    Perbedaan penilaian diteruskan ke peninjau senior, yang mencatat penyelesaian beserta alasannya. Setiap penyelesaian menjadi contoh terurai di dalam pedoman.

  6. 06

    Mengukur dan mengumpanbalikkan

    Kesepakatan, akurasi gold set, dan pergeseran dihitung tiap batch, dibandingkan dengan batch sebelumnya, lalu dipakai untuk memutuskan di mana revisi pedoman berikutnya dibutuhkan.

Metrik

Apa arti sebenarnya tiap angka

Didefinisikan di sini agar sebuah angka di dalam laporan QA dapat dipahami tanpa perlu bertanya kepada kami apa maksudnya.

Kesepakatan antaranotator
Seberapa sering anotator yang bekerja independen menghasilkan label yang sama pada item yang sama. Dilaporkan sebagai kesepakatan mentah beserta koefisien terkoreksi peluang, karena kesepakatan mentah pada taksonomi yang tidak seimbang bisa terlihat sangat baik padahal nyaris tidak membawa informasi.
Cohen’s κ / Krippendorff’s α
Koefisien kesepakatan yang terkoreksi peluang. Cohen’s κ untuk dua anotator pada label kategoris; Krippendorff’s α bila anotatornya lebih dari dua, ada penilaian yang hilang, atau skalanya ordinal. Yang mana yang dipakai dinyatakan di dalam laporan, bukan dibiarkan tersirat.
Akurasi gold set
Akurasi terhadap set acuan yang dianotasi dan diajudikasi oleh peninjau senior. Metrik ini mengukur kebenaran, bukan konsistensi — dua anotator bisa sepakat sepenuhnya dan sama-sama keliru, dan statistik kesepakatan saja tidak akan pernah mengungkapkannya.
Tingkat ajudikasi
Proporsi item yang memerlukan peninjau senior untuk diselesaikan. Tingkat ajudikasi yang naik biasanya merupakan sinyal paling awal bahwa datanya bergeser atau pedomannya berlubang, dan sinyal itu bergerak lebih dulu daripada akurasi.
Pergeseran label
Perubahan distribusi label atau perilaku anotator dari waktu ke waktu. Proyek panjang bergeser karena alasan yang wajar — data sumbernya berubah, anotator makin percaya diri — dan pemantauan pergeseranlah yang memisahkan hal itu dari penurunan mutu yang sesungguhnya.
Kesepakatan batas
Untuk tugas rentang, seberapa dekat anotator sepakat tentang di mana sebuah rentang dimulai dan berakhir, dilaporkan terpisah dari kesepakatan tentang labelnya. Dataset rentang bahasa Jepang bisa punya kesepakatan label yang sangat baik tetapi batas yang tidak terpakai.

Ikhtisar kualitas

Contoh Dasbor QA

Kesepakatan

97.8%

2.1% vs 7 hari terakhir

Akurasi gold set

98.6%

1.4% vs 7 hari terakhir

Item ditinjau

24826

18.7% minggu ini

Perbedaan belum selesai

18

12 vs 7 hari terakhir

Pergeseran label (30 hari)

Pergeseran teramati Ambang peringatan
0%2.5%5% Day 1Day 8Day 15Day 22Day 30

Ringkasan kualitas

  • Kepatuhan terhadap pedoman
  • Kalibrasi peninjau
  • Pemantauan pencilan
  • Deteksi pergeseran

Antarmuka ilustratif. Angka yang ditampilkan adalah data contoh untuk menjelaskan cara kami memantau kualitas, bukan hasil yang kami laporkan.

Tinjauan

Seberapa banyak dari sebuah batch yang ditinjau

Kedalaman tinjauan adalah setelan proyek, disepakati bersama Anda dan dinyatakan dalam kontrak. Lebih dalam tidak selalu lebih baik — tugas mekanis yang ditinjau dengan kedalaman penuh menghabiskan anggaran di tempat yang tidak menuntut pertimbangan.

Konfigurasi tinjauan yang bersifat ilustratif. Kedalaman sebenarnya untuk sebuah proyek disepakati saat penentuan cakupan.
Kedalaman tinjauanUmumnya dipakai untukApa yang terjadi
Tinjauan sampelTugas mekanis bervolume tinggi dengan kesepakatan yang stabilSebagian item yang porsinya ditetapkan ditinjau; kegagalan memicu tinjauan yang lebih luas
Tinjauan penuh tahap keduaPelabelan yang menuntut pertimbangan dan sebagian besar pekerjaan rentang bahasa JepangSetiap item ditinjau oleh anotator kedua
Anotasi ganda secara butaSet evaluasi, benchmark, dan gold setDua anotator bekerja independen; semua perbedaan diajudikasi
Tinjauan ahliDomain dengan regulasi ketat dan pertimbangan profesionalSpesialis domain meninjau, dengan penalaran tertulis pada item yang diperdebatkan

Taksonomi kesalahan

Memberi nama pada kegagalan

Cacat yang punya nama dapat dihitung, ditelusuri trennya, dan diperbaiki. Hitungan "kesalahan" yang generik tidak dapat memberi tahu Anda apa yang harus diubah.

Lubang pedoman

Kasusnya tidak tercakup oleh pedoman. Diperbaiki dengan merevisi pedoman, bukan dengan mengoreksi itemnya — kalau tidak, kasus yang sama akan berulang.

Salah penerapan pedoman

Kasusnya tercakup dan anotator menerapkan aturannya secara keliru. Diperbaiki lewat umpan balik dan, bila berulang, lewat contoh terurai yang lebih jelas.

Kesalahan batas

Labelnya benar dan rentangnya tidak. Khas pada pekerjaan rentang bahasa Jepang, tempat aturan batas dan tokenisasi saling berkaitan.

Kesalahan ragam bahasa atau nuansa

Benar secara kebahasaan, keliru secara sosial: tingkat kesantunan yang salah, atau penolakan yang terlalu lembut untuk terbaca sebagai penolakan.

Kesalahan faktual

Sebuah klaim, cara baca nama, atau angka yang dapat diverifikasi ternyata salah. Dibedakan dari kesalahan pertimbangan karena solusinya adalah verifikasi, bukan kalibrasi.

Cacat sumber

Itemnya sendiri tidak dapat dipakai — audio tak terdengar, pindaian tak terbaca, prompt yang ambigu. Ditandai dan dikembalikan, tidak pernah diisi dengan tebakan yang terdengar masuk akal.

Pelaporan

Yang menyertai setiap batch

Laporannya dirancang agar Anda dapat mengaudit batch tersebut tanpa kehadiran kami.

  • Angka kesepakatan per label atau per kriteria, dengan koefisien yang dipakai dinyatakan secara eksplisit.
  • Akurasi gold set untuk batch tersebut, beserta trennya terhadap batch sebelumnya.
  • Tingkat ajudikasi, disertai log ajudikasi dan penalaran yang dicatat untuk tiap penyelesaian.
  • Jumlah kesalahan yang dirinci menurut taksonomi di atas, bukan sebagai satu total cacat.
  • Versi pedoman yang dipakai saat batch itu dianotasi, dan catatan perubahan terhadap versi sebelumnya.
  • Item yang ditandai sebagai cacat sumber, didaftar, bukan dibuang diam-diam.

FAQ

Seputar pengukuran kualitas

Pertanyaan tentang apa yang dibuktikan dan tidak dibuktikan oleh angka-angka ini.

Kami tidak mempublikasikan jaminan akurasi, dan kami akan menyikapi jaminan semacam itu dari vendor mana pun dengan hati-hati. Akurasi yang dapat dicapai bergantung pada tugasnya, taksonominya, kualitas data sumbernya, dan seberapa banyak ambiguitas yang sungguh-sungguh terkandung dalam domain tersebut — dan tidak satu pun dari hal itu diketahui sebelum ada pilot. Yang kami komitmenkan adalah metode pengukurannya: metrik apa, dihitung bagaimana, dilaporkan seberapa sering, dan apa yang terjadi bila sebuah batch tidak memenuhi syarat. Setelah pilot pada data Anda, kita bisa membicarakan target yang realistis, karena saat itu sudah ada hal nyata untuk dibicarakan.

Itu data contoh. Angka-angka itu ada untuk menunjukkan apa yang dilaporkan antarmukanya dan bagaimana metriknya terlihat saat bergerak, dan justru karena itulah angka-angka tersebut disertai lencana dan penafian yang terlihat jelas. Angka itu bukan hasil dari proyek klien, dan kami tidak akan menyajikannya seolah-olah demikian.

Tidak dengan sendirinya. Kesepakatan mengukur konsistensi, bukan kebenaran — anotator yang sama-sama salah paham akan sepakat sepenuhnya. Angkanya juga membesar oleh taksonomi yang tidak seimbang, dan itulah sebabnya kami melaporkan koefisien terkoreksi peluang berdampingan dengan kesepakatan mentah, serta sebabnya gold set yang diajudikasi peninjau senior ada sebagai pemeriksaan independen atas kebenaran.

Batch itu tidak dikirim. Bergantung pada jenis kegagalannya, tanggapannya berupa anotasi ulang yang terarah, revisi pedoman yang diikuti pengerjaan ulang item yang terdampak, atau eskalasi kepada Anda bila penyebabnya ada di hulu — taksonomi yang ambigu atau data sumber yang tidak dapat menopang tugas tersebut. Kami lebih memilih mengirim terlambat disertai penjelasan daripada tepat waktu dengan angka yang tidak akan bertahan begitu bertemu model Anda.

Bisa, dan itu permintaan yang masuk akal. Anda dapat meninjau pedoman beserta riwayat versinya, mengambil sampel untuk dinilai secara independen, dan membandingkan temuan Anda dengan angka yang kami laporkan. Bila klien menjalankan QA sendiri secara paralel, kami memperlakukan perbedaan di antara keduanya sebagai temuan yang layak ditelusuri, bukan sebagai perselisihan yang harus diperdebatkan.

Kualitas

Mintalah angkanya pada data Anda sendiri.

Sebuah pilot menghasilkan angka kesepakatan yang nyata, rincian kesalahan yang nyata, dan pandangan jujur tentang bagian mana dari taksonomi Anda yang akan bertahan pada volume besar.

NDA sebelum Anda membagikan data apa pun. Penentuan cakupan pilot tanpa biaya.