NLP bahasa Jepang

Anotasi NLP bahasa Jepang — entitas, relasi, dan klasifikasi

Pengenalan entitas bernama, ekstraksi relasi, klasifikasi maksud dan topik, sentimen, inferensi bahasa alami, dan segmentasi — dianotasi dengan tokenizer yang benar-benar dipakai pipeline Anda.

Bahasa Jepang tidak memakai spasi antarkata. Karena itu setiap anotasi rentang bergantung pada keputusan batas yang harus diambil seseorang, dan keputusan itu harus cocok dengan tokenizer di tahap berikutnya, kalau tidak labelnya tidak akan sejajar.

Batas adalah inti seluruh persoalan

Dalam bahasa Inggris, "Toyota Motor Corporation" jelas terdiri atas tiga token dan satu-satunya pertanyaan adalah di mana entitasnya mulai dan berhenti. Dalam bahasa Jepang, 株式会社トヨタ自動車 adalah satu untaian tanpa jeda, dan setidaknya ada empat anotasi yang sama-sama dapat dipertahankan: dengan atau tanpa 株式会社, dengan atau tanpa 自動車, memperlakukan keseluruhannya sebagai satu entitas, atau menyarangkan entitas yang lebih pendek di dalam yang lebih panjang.

Setiap pilihan itu sah. Yang penting adalah pilihan yang sama diambil setiap kali, dituliskan, dan tetap bertahan saat bertemu tokenizer yang dipakai model Anda — sebab batas rentang yang jatuh di tengah sebuah token tidak dapat direpresentasikan dalam penandaan BIO tanpa diam-diam bergeser.

Karena itu kami mengunci tokenizer dan aturan batas sebelum anotasi dimulai, dan karena itu pula kami menganotasi offset karakter di balik format tag apa pun yang Anda inginkan, sehingga datanya dapat ditokenisasi ulang kemudian tanpa perlu dianotasi ulang.

Sekilas

Jenis tugas
NER, ekstraksi relasi dan peristiwa, klasifikasi maksud dan topik, sentimen dan emosi, NLI dan parafrasa, segmentasi dan normalisasi.
Sadar tokenizer
Rentang dianotasi mengikuti MeCab, Sudachi, Juman++, atau tokenizer milik model Anda sendiri, sesuai kesepakatan saat kickoff.
Aturan batas
Sufiks badan hukum, nomina majemuk, prefiks hormat, dan infleksi semuanya diatur oleh aturan tertulis.
Keluaran umum
JSONL dengan offset karakter; CoNLL-U, penandaan BIO, dan brat standoff juga didukung.
Tinjauan
Batas rentang dan label rentang ditinjau sebagai dua kriteria terpisah.

Jenis tugas

Yang kami anotasi

Tugas rentang dan tugas dokumen punya mode kegagalan yang berbeda, jadi keduanya mendapat kriteria tinjauan yang berbeda.

Pengenalan entitas bernama

Rentang entitas mengikuti taksonomi yang ditetapkan untuk domain Anda, termasuk entitas bersarang dan tumpang tindih bila Anda membutuhkannya.

  • Tipe standar dan khusus domain
  • Rentang bersarang dan terputus
  • Normalisasi ke bentuk kanonis
  • Pertautan cara baca dan varian

Ekstraksi relasi dan peristiwa

Bagaimana entitas saling terhubung — siapa melakukan apa kepada siapa, nilai mana milik field mana, klausa mana yang menerangkan istilah mana.

  • Relasi biner dan n-ari
  • Pemicu peristiwa dan argumennya
  • Relasi lintas kalimat
  • Penandaan negasi dan ketidakpastian

Klasifikasi

Maksud, topik, kategori perutean, atau label kebijakan pada tingkat ujaran maupun dokumen, berlabel tunggal atau ganda.

  • Maksud dan tindak tutur
  • Kategori topik dan perutean
  • Taksonomi berlabel ganda
  • Penanganan di luar cakupan dan yang tidak jelas

Sentimen dan emosi

Polaritas dan emosi pada tingkat dokumen, kalimat, atau aspek — dan tingkat aspeklah yang sebenarnya dibutuhkan teks bisnis berbahasa Jepang.

  • Polaritas dokumen dan kalimat
  • Sentimen berbasis aspek
  • Kategori emosi
  • Penandaan kesantunan dan ragam bahasa

Inferensi dan kemiripan

Pasangan entailmen, parafrasa, dan kemiripan semantik, ditambah negatif sulit yang membuat sebuah set evaluasi mampu membedakan.

  • Pasangan entailmen NLI
  • Identifikasi parafrasa
  • Skor kemiripan bertingkat
  • Penyusunan negatif sulit

Khas bahasa Jepang

Aturan yang harus dimuat sebuah pedoman bahasa Jepang

Empat pertanyaan ini muncul pada jam pertama setiap proyek anotasi rentang berbahasa Jepang.

Batas kata

Bahasa Jepang ditulis tanpa spasi, sehingga batas rentang adalah keputusan penilaian, bukan sekadar pencarian. Penganalisis morfologis yang berbeda memenggal kalimat yang sama secara berbeda, dan label yang sejajar dengan satu penganalisis tidak akan sejajar dengan penganalisis lain.

Cara kami menanganinya Penganalisis dan kamusnya dikunci saat kickoff, rentang disimpan sebagai offset karakter agar tetap bertahan saat ditokenisasi ulang, dan konvensi batasnya dinyatakan dengan contoh terurai.

Nama perusahaan dan organisasi

株式会社 dapat berada sebelum atau sesudah nama perusahaan, muncul sebagai singkatan (株), atau dihilangkan sama sekali. Apakah ia berada di dalam rentang entitas akan mengubah setiap pencocokan string di tahap berikutnya.

Cara kami menanganinya Satu aturan mengatur prefiks dan sufiks bentuk badan hukum, bentuk singkatan, dan varian dalam tanda kurung, dan bentuk kanonisnya dicatat berdampingan dengan rentang permukaannya.

Nomina majemuk

Bahasa Jepang merangkai nomina tanpa pemisah — 個人情報保護管理者 adalah satu untaian yang memuat setidaknya tiga satuan bermakna. Di mana entitasnya berhenti adalah sebuah keputusan, bukan sebuah fakta.

Cara kami menanganinya Pedoman menetapkan kebijakan rentang maksimal atau rentang minimal untuk tiap tipe entitas, dengan penyarangan bila keduanya memang dibutuhkan, alih-alih membiarkan tiap anotator memilih sendiri.

Infleksi dan partikel yang melekat

Verba dan adjektiva berinfleksi, dan partikel melekat langsung pada kata yang ditandainya. Menyertakan atau mengeluarkannya menggeser batas rentang satu atau dua karakter di seluruh korpus.

Cara kami menanganinya Akhiran infleksi dan partikel yang melekat secara eksplisit masuk atau tidak masuk ke dalam rentang berdasarkan aturan, dan pemeriksaan otomatis menandai rentang yang berakhir di tengah token.

Proses

Bagaimana sebuah proyek NLP dijalankan

Sebagian besar nilainya tercipta sebelum anotasi dimulai, yaitu pada taksonomi dan aturan batasnya.

  1. 01

    Mengunci taksonomi dan tokenizer

    Kami menyepakati set label, penganalisis dan kamusnya, serta cara rentang direpresentasikan, sehingga anotasinya cocok dengan pipeline yang menjadi tujuannya.

  2. 02

    Menemukan kasus batas

    Satu sampel kecil dianotasi untuk memunculkan konstruksi yang benar-benar ambigu di domain Anda. Konstruksi itu menjadi contoh terurai di dalam pedoman.

  3. 03

    Kalibrasi dan pengukuran kesepakatan

    Anotator melabeli set yang sama secara independen. Kesepakatan diukur untuk batas dan label secara terpisah, karena keduanya gagal karena alasan yang berbeda.

  4. 04

    Anotasi dan ajudikasi

    Anotasi produksi dengan satu tahap tinjauan, dan ajudikasi tertulis untuk perbedaan penilaian yang langsung dikembalikan ke dalam pedoman.

  5. 05

    Pengiriman beserta offset

    Data dikirim dengan offset karakter dan format tag pilihan Anda, versi taksonomi, jumlah per label, dan laporan QA.

Pengiriman

Format dan representasi

Offset karakter selalu disertakan, apa pun format permukaan yang Anda pilih, sehingga datanya dapat ditokenisasi ulang tanpa perlu dianotasi ulang.

Format keluaran yang umum untuk anotasi NLP bahasa Jepang.
TugasKeluaran defaultTersedia juga
Entitas bernamaJSONL dengan offset karakterCoNLL-U, BIO / BILOU, brat standoff
Relasi dan peristiwaJSONL dengan rujukan rentangbrat standoff, JSON graf khusus
KlasifikasiJSONL atau CSVmatriks one-hot atau berlabel ganda
SentimenJSONL dengan rentang aspekCSV, label per kalimat
NLI dan kemiripanPasangan JSONLCSV, TSV dalam tata letak benchmark

Kualitas

Kontrol yang khusus untuk pekerjaan ini

Sebuah dataset rentang bisa punya akurasi label yang sangat baik tetapi batas yang tidak terpakai. Kami mengukur keduanya.

  • Kesepakatan batas dan kesepakatan label dilaporkan sebagai dua angka terpisah.
  • Validasi otomatis bahwa tidak ada rentang yang berakhir di tengah token menurut penganalisis yang disepakati.
  • Jumlah per label dilacak tiap batch, sehingga kelas langka yang kian menipis diketahui selagi masih bisa diperbaiki.
  • Rentang bersarang dan tumpang tindih divalidasi terhadap aturan penyarangan taksonomi, bukan diterima begitu saja.
  • Gold set yang dianotasi peninjau senior dan dijalankan ulang secara berkala untuk mendeteksi pergeseran pada proyek panjang.
  • Setiap perbedaan penilaian yang diajudikasi dituliskan kembali ke dalam pedoman sebagai contoh terurai.

FAQ

Seputar anotasi NLP bahasa Jepang

Pertanyaan yang muncul saat cakupan sebuah proyek anotasi rentang berbahasa Jepang sedang ditetapkan.

Yang mana pun yang dipakai pipeline Anda — MeCab dengan IPAdic atau UniDic, Sudachi, Juman++, atau tokenizer subword dari model Anda sendiri. Kami menguncinya saat kickoff karena batas rentang hanya sejajar dengan satu segmentasi, dan kami menyimpan offset karakter di baliknya sehingga pergantian penganalisis di kemudian hari cukup diselesaikan dengan ekspor ulang, bukan anotasi ulang.

Bisa, dan kami lebih memilih memakai punya Anda daripada memaksakan punya kami. Yang akan kami lakukan adalah mengujinya dahulu pada sampel: taksonomi yang sudah ada biasanya punya dua atau tiga kategori yang ternyata saling tumpang tindih dalam praktik, dan menemukannya saat pilot jauh lebih murah daripada menemukannya setelah lima puluh ribu item.

Sepenuhnya bergantung pada tugasnya. Tipe entitas yang jelas batasnya pada teks bersih cepat mencapai kesepakatan tinggi; sentimen berbasis aspek dan taksonomi maksud yang berbutir halus tidak, dan proyek yang mengklaim sebaliknya biasanya sedang mengukur sesuatu yang lebih mudah daripada yang ia kerjakan. Kami melaporkan angka sebenarnya per label dari pilot, dan jika sebuah kategori tidak dapat mencapai tingkat kesepakatan yang layak pakai, kami akan mengatakannya dan mengusulkan perubahan pada kategori tersebut.

Ya, jika taksonominya memang membutuhkan — nomina majemuk dan nama organisasi bahasa Jepang biasanya menjadi alasannya. Aturan penyarangan dituliskan ke dalam pedoman dan divalidasi secara otomatis, karena penyarangan yang diperbolehkan tetapi tidak dirinci adalah sumber inkonsistensi yang hampir pasti.

Bisa. Mengoreksi keluaran model itu efisien untuk pekerjaan bervolume tinggi, dengan catatan yang sama seperti di tempat lain: tahap koreksi cenderung mewarisi titik buta model. Kami mengukur tahap koreksi itu terhadap sampel yang dikerjakan dari nol sehingga Anda tahu apa yang sebenarnya tertangkap, dan untuk set evaluasi kami menganotasi dari nol.

Teks & NLP

Bawa taksonominya. Kami yang akan menemukan kasus batasnya.

Kirimkan set label dan sampel teks bahasa Jepang yang nyata. Kami menganotasi satu pilot, melaporkan kesepakatan batas dan label, serta memberi tahu Anda kategori mana yang tidak akan bertahan pada volume besar.

NDA sebelum Anda membagikan data apa pun. Penentuan cakupan pilot tanpa biaya.