LLM & AI generatif

Data pelatihan LLM bahasa Jepang — SFT, preferensi, dan RLHF

Pasangan instruksi–jawaban, perbandingan berperingkat, dialog multigiliran, dan data keamanan, ditulis oleh anotator di Jepang mengikuti panduan gaya yang telah disetujui tim Anda.

Bagian sulit dari data instruksi bahasa Jepang bukanlah menulis satu jawaban, melainkan menulis jawaban yang sama, dalam ragam yang sama, sepuluh ribu kali — dan mampu menjelaskan secara tertulis mengapa ragam itu yang dipilih.

Mengapa data instruksi bahasa Jepang sering meleset

Data instruksi yang ditulis banyak orang akan bergeser. Satu anotator mengakhiri setiap jawaban dengan ですます, anotator lain beralih ke である di tengah penjelasan teknis, anotator ketiga menulis dengan gaya ringkas asisten obrolan. Model yang dilatih dengan campuran itu belajar bahwa ketiganya sama-sama boleh, lalu memakai mana pun yang ia mau — dan itulah keluhan paling sering yang kami dengar tentang fine-tune bahasa Jepang.

Ragam bahasa bukan satu-satunya hal yang bergeser. Penolakan lebih parah lagi. Bahasa Jepang menolak secara tidak langsung, dan anotator yang tidak diberi tahu seperti apa bentuk sebuah penolakan akan menulis apa saja, mulai dari お断りします yang datar sampai それは難しいかもしれません yang lembut. Jika separuh data keamanan menolak dengan begitu halus sampai terbaca seperti menyanggupi, model akan belajar berkelit alih-alih menolak.

Karena itu hasil yang dikirimkan tidak pernah hanya berupa data. Yang dikirimkan adalah data beserta keputusan tertulis yang menghasilkannya: panduan gaya, templat penolakan, aturan format, dan versi masing-masing yang dipakai saat sebuah batch ditulis.

Sekilas

Jenis dataset
Instruksi / SFT, pasangan dan peringkat preferensi, dialog multigiliran, data keamanan dan penolakan, set grounding RAG.
Ditulis oleh
Anotator penutur asli di Jepang, ditinjau oleh anotator kedua dan seorang peninjau senior.
Kendali ragam
Panduan gaya tertulis mengunci tingkat kesantunan, akhiran kalimat, penggunaan pronomina, dan format sebelum produksi dimulai.
Format umum
JSONL — array messages untuk SFT, pasangan chosen/rejected untuk data preferensi.
Provenans
Setiap record membawa versi pedoman, peran penulis, dan status tinjauannya.

Jenis dataset

Yang kami bangun

Lima keluarga dataset, biasanya dipakai bersama. Masing-masing punya definisi "benar" yang berbeda, sehingga masing-masing mendapat bagian pedomannya sendiri dan tahap tinjauannya sendiri.

Data instruksi dan SFT

Pasangan prompt–jawaban yang mendemonstrasikan perilaku yang Anda inginkan, ditulis dari nol atau ditulis ulang dari konten yang sudah Anda miliki.

  • Demonstrasi tugas
  • Pasangan penulisan ulang dan peringkasan
  • Tanya jawab khusus domain
  • Keluaran dengan format terikat

Data preferensi dan peringkat

Dua kandidat jawaban atau lebih dibandingkan dengan kriteria tertulis, dan alasan pemilihannya dicatat, bukan disimpulkan belakangan.

  • Berpasangan chosen / rejected
  • Peringkat N-arah
  • Skor per kriteria
  • Justifikasi tertulis untuk tiap perbandingan

Dialog multigiliran

Percakapan tempat konteks menumpuk — ragam yang ditetapkan di giliran pertama harus bertahan sampai giliran kedelapan, dan di situlah sebagian besar data dialog bahasa Jepang berantakan.

  • Dialog berorientasi tugas
  • Giliran klarifikasi dan perbaikan
  • Pemeriksaan pewarisan konteks
  • Konsistensi persona dan peran

Data keamanan, penolakan, dan red team

Prompt yang seharusnya ditolak, prompt yang tampak seperti harus ditolak padahal tidak, dan susunan kata penolakan yang memisahkan keduanya.

  • Templat penolakan per kategori
  • Contoh tandingan untuk penolakan berlebihan
  • Prompt adversarial dan jailbreak
  • Penanganan topik sensitif dalam bahasa Jepang

Set RAG dan grounding

Triplet pertanyaan, kutipan yang diambil, dan jawaban yang berpijak padanya, ditambah kasus negatif ketika kutipan itu sebenarnya tidak memuat jawabannya.

  • Pasangan dapat dijawab / tidak dapat dijawab
  • Penandaan rentang kutipan
  • Kutipan pengecoh
  • Grounding dokumen berbahasa Jepang

Khas bahasa Jepang

Apa yang membuatnya khas bahasa Jepang

Inilah empat keputusan yang, jika dibiarkan tidak diambil, menghasilkan dataset yang terlihat baik-baik saja saat ditinjau tetapi berperilaku buruk di dalam model.

Ragam kesantunan

Bahasa Jepang memaksa sebuah pilihan kesantunan pada setiap akhiran kalimat. ですます, である, dan bentuk biasa tidak bisa saling menggantikan, dan model yang dilatih dengan campurannya akan mencampur ketiganya di dalam satu jawaban.

Cara kami menanganinya Panduan gaya mengunci satu ragam default per permukaan produk, mendaftar pengecualiannya, dan memberi contoh terurai untuk masing-masing. Konsistensi ragam adalah butir yang dinilai dalam tinjauan, bukan soal selera.

Penolakan tidak langsung

それはちょっと難しいです adalah sebuah penolakan, bukan pernyataan tentang tingkat kesulitan. Anotator yang melabelinya secara harfiah mengajari model membaca penolakan sebagai komentar netral.

Cara kami menanganinya Kategori penolakan dan susunan katanya ditetapkan di awal, lengkap dengan kekuatan yang dimaksudkan untuk masing-masing. Data keamanan ditinjau khusus untuk memastikan sebuah penolakan benar-benar terbaca sebagai penolakan oleh penutur bahasa Jepang.

Subjek yang dihilangkan

Bahasa Jepang menghilangkan subjek yang sudah jelas dari konteks. Dalam data multigiliran, rujukannya bisa berada empat giliran sebelumnya, dan anotator yang menulis jawaban secara terpisah akan menebak keliru.

Cara kami menanganinya Item multigiliran ditulis dan ditinjau sebagai percakapan utuh, tidak pernah per giliran. Jika rujukannya benar-benar ambigu, percakapan itu diperbaiki atau dibuang — bukan dilabeli dengan tebakan.

Variasi penulisan dan format

Kata yang sama muncul dalam kanji, hiragana, atau katakana; angka dan tanda baca muncul dalam bentuk full-width atau half-width. Jika tidak dikendalikan, ini mengajari model bahwa format itu acak.

Cara kami menanganinya Konvensi normalisasi mengatur pilihan aksara untuk kata-kata umum, angka, tanda baca, spasi di sekitar teks Latin, dan format daftar. Konvensi itu diterapkan saat penulisan dan diperiksa otomatis sebelum pengiriman.

Proses

Bagaimana sebuah dataset dibangun

Pilot ada untuk mematahkan draf pertama pedoman. Produksi baru dimulai setelah pedoman itu berhenti patah.

  1. 01

    Menetapkan perilakunya

    Kami menyepakati seperti apa jawaban yang baik untuk produk Anda: ragam bahasa, panjang, format, apa yang harus ditolak dan bagaimana caranya, serta apa yang harus dilakukan model ketika ia tidak tahu.

  2. 02

    Menyusun panduan gaya

    Keputusan-keputusan itu menjadi dokumen tertulis dengan contoh terurai dan contoh tandingan. Ambiguitas yang belum Anda putuskan diangkat ke permukaan di sini, bukan diserap diam-diam.

  3. 03

    Pilot dan kalibrasi

    Satu batch kecil ditulis oleh beberapa anotator secara independen. Di titik mereka berbeda, di situlah pedomannya belum jelas — yang kami perbaiki pedomannya, bukan anotatornya.

  4. 04

    Penulisan dan tinjauan produksi

    Setiap item ditulis oleh satu anotator dan ditinjau oleh anotator lain, dengan peninjau senior yang mengambil sampel dan menuntaskan perbedaan penilaian secara tertulis.

  5. 05

    Pengemasan dan pemberian versi

    Pengiriman mencakup datanya, versi pedoman, provenans tiap record, laporan QA, dan catatan perubahan terhadap batch sebelumnya.

Pengiriman

Apa yang Anda terima

Field disepakati saat kickoff; inilah bentuk default ketika Anda belum punya skema yang harus diikuti.

Struktur pengiriman default untuk data pelatihan LLM. Skema khusus juga didukung.
DatasetFormat defaultIsi tiap record
Instruksi / SFTJSONL, array messagesgiliran system / user / assistant, tag tugas, versi pedoman
Pasangan preferensiJSONL, chosen + rejectedkedua kandidat, skor per kriteria, alasan tertulis
Dialog multigiliranJSONL, satu percakapan per barisdaftar giliran lengkap, catatan persona, tag ragam
Keamanan dan penolakanJSONLprompt, kategori, perilaku yang diharapkan, susunan kata penolakan yang dipakai
Grounding RAGJSONLpertanyaan, kutipan, jawaban, rentang sitasi, penanda dapat dijawab

Kualitas

Kontrol yang khusus untuk pekerjaan ini

QA anotasi yang umum tidak akan menangkap pergeseran ragam atau penolakan yang terlalu lembut. Pemeriksaan berikut menangkapnya.

  • Konsistensi ragam dinilai per jawaban, dan di sepanjang setiap giliran percakapan.
  • Kekuatan penolakan ditinjau oleh penutur asli kedua berdasarkan kategori yang telah ditetapkan.
  • Pemeriksaan normalisasi otomatis untuk aksara, angka, tanda baca, dan spasi sebelum pengiriman.
  • Deteksi duplikat dan nyaris duplikat lintas batch, agar keragaman set tidak diam-diam menyusut.
  • Keragaman prompt dilacak terhadap taksonomi tugas, agar tidak ada kategori yang terwakili berlebihan tanpa disengaja.
  • Sampel held-out ditinjau ulang secara buta oleh peninjau senior untuk menghasilkan angka kualitas batch.

FAQ

Seputar data pelatihan LLM

Pertanyaan yang diajukan tim saat menentukan cakupan fine-tune bahasa Jepang pertama mereka.

Keduanya. Menulis dari nol lazim dilakukan untuk bahasa Jepang, karena data instruksi terbuka yang layak pakai dalam bahasa Jepang sangat sedikit dan data hasil terjemahan mesin membawa struktur kalimat Inggris masuk ke dalam model. Kalau Anda sudah punya konten — log dukungan pelanggan, manual, dokumen internal — kami lebih sering menulis ulang dari situ, sehingga datanya berpijak pada domain Anda yang sebenarnya.

Panduan gaya tertulis dengan contoh terurai, satu putaran kalibrasi sebelum produksi ketika beberapa anotator menulis item yang sama secara independen, serta konsistensi ragam sebagai butir yang secara eksplisit dinilai dalam tinjauan. Di sini konsistensi adalah sifat yang terukur, bukan cita-cita — yang kami pantau adalah perbedaan antaranotator, dan setiap perbedaan yang diselesaikan dituliskan kembali ke dalam panduan.

Tidak sebagai sumber data akhir. Data instruksi hasil terjemahan mewarisi struktur wacana Inggris, asumsi kesantunan Inggris, dan kebiasaan format Inggris, dan model yang dilatih dengannya menghasilkan bahasa Jepang yang oleh pembaca penutur asli disebut terasa seperti terjemahan. Kami memang memakai terjemahan sebagai perancah untuk gagasan prompt, tetapi jawabannya ditulis dalam bahasa Jepang oleh penutur bahasa Jepang.

Hanya jika Anda menyetujuinya, dan selalu disertai penulisan ulang serta tinjauan manusia di atasnya — tidak pernah sebagai keluaran yang lewat begitu saja tanpa ditinjau. Penggunaan bantuan AI dicatat pada tiap record, sehingga Anda dapat menyaring atau mengauditnya kemudian. Jika Anda mensyaratkan data yang sepenuhnya ditulis manusia, kami menjalankan proyeknya seperti itu dan field provenans membuktikannya.

Lebih kecil daripada dugaan sebagian besar tim. Beberapa ribu item yang ditulis cermat dan konsisten ragamnya biasanya membawa sebuah fine-tune bahasa Jepang lebih jauh daripada data berisik sepuluh kali lipat jumlahnya, karena model sedang mempelajari sebuah gaya sekaligus sebuah tugas. Kami menentukan cakupan pilot beberapa ratus item lebih dahulu untuk membuktikan pedomannya, lalu menakar volume produksi dari hasil pengukuran pilot itu.

Data pelatihan LLM

Kirimkan perilaku yang ingin Anda ajarkan.

Deskripsi tugas dan beberapa contoh jawaban sudah cukup untuk memulai. Kami akan kembali dengan pertanyaan taksonomi yang perlu dijawab dan sebuah pilot yang jelas cakupannya.

NDA sebelum Anda membagikan data apa pun. Penentuan cakupan pilot tanpa biaya.