Layanan

Data pelatihan AI bahasa Jepang, untuk setiap modalitas

Lima layanan yang mencakup kebutuhan sebuah sistem AI di setiap tahap — mulai dari data instruksi yang mengajari model hingga evaluasi manusia yang memberi tahu Anda apakah hasilnya berhasil.

Kelimanya berdiri di atas fondasi yang sama: anotator di Jepang, pedoman yang diberi versi alih-alih diingat-ingat, dan kualitas yang diukur sebelum diklaim.

Satu tim, seluruh siklus hidup data

Sebagian besar masalah anotasi bukanlah masalah pelabelan, melainkan masalah definisi: dua orang yang sama-sama masuk akal membaca pedoman yang sama lalu melabeli kalimat bahasa Jepang yang sama secara berbeda, dan tidak ada yang menyadarinya sampai model dilatih dengan keduanya. Membagi pekerjaan kami menjadi lima layanan adalah cara membuat definisi itu eksplisit — setiap layanan punya pertanyaan taksonominya sendiri, mode kegagalannya sendiri, dan pemeriksaan kualitasnya sendiri.

Kelima layanan ini bukan paket yang harus Anda pilih salah satu. Satu proyek lazim memakai tiga di antaranya sekaligus: anotasi NLP untuk membangun korpus berlabel, data pelatihan LLM untuk mengubahnya menjadi pasangan instruksi dan preferensi, lalu evaluasi untuk mengukur apa yang sebenarnya dilakukan model yang dihasilkan. Yang tetap sama adalah pertimbangan kebahasaan Jepang yang melandasi semuanya.

Sekilas

Modalitas
Data bahasa Jepang berupa teks, suara, gambar, video, dokumen, dan multimodal.
Tahap model
Penyaringan korpus, fine-tuning terawasi, data preferensi dan RLHF, evaluasi, dan benchmarking.
Format pengiriman
JSONL, CSV, CoNLL-U, SRT, CTM, COCO — atau skema yang Anda tentukan sendiri.
Perangkat
Kami bekerja di dalam platform anotasi Anda, atau di lingkungan aman milik kami sendiri.
Titik awal
Pilot dengan cakupan yang jelas. Taksonomi dan kualitas dibuktikan sebelum volume ditingkatkan.

Yang kami kerjakan

Lima layanan, ditambah lapisan ahli

Masing-masing punya halaman sendiri yang menguraikan keputusan taksonomi, jebakan khas bahasa Jepang, dan hasil yang dikirimkan.

Memilih

Layanan mana yang saya butuhkan?

Mulailah dari apa yang ingin Anda ubah pada model. Layanannya mengikuti hal itu, bukan mengikuti jenis berkas yang kebetulan Anda miliki.

Mencocokkan tujuan dengan layanan. Sebagian besar program akhirnya menggabungkan dua atau tiga layanan.
Jika tujuan Anda…Layanannya adalahHasil pertama yang umum
Mengajari model menjawab dalam bahasa Jepang yang alami dengan ragam yang tepatData Pelatihan LLMSatu set pilot pasangan instruksi–jawaban dengan panduan gaya yang telah dikunci
Mengetahui di mana model salah sebelum Anda merilisnyaEvaluasi LLMSet evaluasi bernilai skor beserta rubrik dan kesepakatan antarpenilai
Membuat model mendengar ucapan bahasa Jepang secara akuratSuara & AudioAudio yang ditranskripsikan dengan konvensi normalisasi tertulis
Membaca dokumen, formulir, atau teks di layar berbahasa JepangGambar & VideoAnotasi OCR dan tata letak pada sampel dokumen yang representatif
Mengekstraksi fakta terstruktur dari teks bahasa JepangTeks & NLPSkema entitas dan relasi yang diuji dengan kasus batas yang nyata
Meminta spesialis menilai jawaban di bidang dengan regulasi ketatAnotasi AhliSet evaluasi yang ditinjau ahli dengan catatan ajudikasi tertulis

Siklus hidup

Posisi setiap layanan

Satu dataset jarang bisa melayani dua tahap sekaligus. Data yang dibuat untuk mengajari model adalah alat uji yang buruk bagi model itu, karena model sudah pernah melihatnya.

  1. 01

    Penyiapan korpus

    Penyaringan, aturan deduplikasi, serta penanda kualitas dan keamanan pada teks, suara, atau dokumen bahasa Jepang yang masih mentah. Menentukan apa yang memang layak dianotasi.

  2. 02

    Fine-tuning terawasi

    Pasangan instruksi–jawaban, dialog multigiliran, dan demonstrasi tugas yang ditulis dalam ragam yang benar-benar dipakai produk Anda.

  3. 03

    Preferensi dan penyelarasan

    Perbandingan berperingkat atau berpasangan, perilaku keamanan dan penolakan, serta kriteria tertulis yang menjadikan satu jawaban lebih baik daripada yang lain.

  4. 04

    Evaluasi

    Set held-out dan penilaian rubrik oleh orang yang tidak terlibat dalam pembuatan data pelatihan, agar pengukurannya independen.

  5. 05

    Pemantauan produksi

    Mengambil sampel keluaran model yang sedang berjalan, menilainya dengan rubrik yang sama, dan mengembalikan kegagalan yang berulang ke siklus data berikutnya.

Pengiriman

Format dan pengiriman

Setiap batch dikirim bersama versi taksonomi yang dipakai saat pelabelan dan catatan perubahan terhadap batch sebelumnya, sehingga dataset tetap dapat dibandingkan antarversi.

Format pengiriman yang umum. Skema khusus ditentukan saat kickoff dan diberi versi bersama datanya.
Jenis dataPengiriman umumTersedia juga
Teks dan NLPJSONLCSV, CoNLL-U, brat standoff, Parquet
Instruksi dan preferensi LLMJSONL (messages / chosen–rejected)CSV, tata letak dataset Hugging Face
SuaraJSON dengan penanda waktuSRT, VTT, CTM, TextGrid, transkrip polos
Gambar dan videoCOCO JSONYOLO, Pascal VOC, CVAT XML, JSONL per frame
Dokumen dan OCRJSON dengan geometri halamanhOCR, ALTO, ekstraksi field CSV
Hasil evaluasiSkor JSONL beserta laporan QACSV, notebook penilaian, log ajudikasi

FAQ

Seputar layanan

Pertanyaan tentang cakupan dan proses yang muncul sebelum sebuah pilot ditetapkan.

Bisa, dan sebagian besar program memang begitu. Urutan yang umum adalah anotasi NLP untuk membangun korpus berlabel, data pelatihan LLM yang disusun dari korpus itu, lalu evaluasi yang dijalankan oleh kelompok anotator yang berbeda. Menggabungkannya dalam satu kerja sama berarti taksonomi, panduan gaya, dan metrik QA tetap konsisten, bukan diturunkan ulang oleh setiap vendor.

Bahasa Jepang adalah alasan kami dibangun, dan pekerjaan dwibahasa Jepang–Inggris termasuk di dalamnya. Untuk pekerjaan bervolume besar dalam bahasa lain, kami lebih memilih menyampaikan terus terang bahwa kami bukan vendor yang tepat daripada menerima proyeknya lalu mensubkontrakkannya.

Harga dihitung per unit pekerjaan — per item, per jam audio, per gambar, atau per evaluasi — dan bergantung pada kompleksitas tugas, seberapa banyak waktu peninjau yang dibutuhkan tiap item, serta tingkat keahlian yang diperlukan. Kami memberikan penawaran setelah menentukan cakupan pilot pada data Anda yang sebenarnya, karena penawaran yang hanya berdasar deskripsi tugas adalah tebakan, dan biasanya tebakan yang meleset.

Kami menyusun draf, Anda meninjaunya, dan keduanya terjadi sebelum produksi. Pilot ada untuk mematahkan draf pertama dengan kasus batas yang nyata; setiap perbedaan penilaian yang diselesaikan selama pilot dituliskan kembali ke dalam dokumen. Pedoman itu kemudian diberi versi, dan setiap batch yang dikirimkan mencatat versi mana yang dipakai saat pelabelan.

Mulai dari sini

Beri tahu kami apa yang perlu dipelajari model Anda.

Kirimkan tugasnya, satu sampel data, dan batasan yang sedang Anda hadapi. Kami akan kembali dengan rencana pilot yang jelas cakupannya, pertanyaan taksonomi yang perlu dijawab, dan pandangan jujur tentang bagian mana yang sulit.

NDA sebelum Anda membagikan data apa pun. Penentuan cakupan pilot tanpa biaya.