Layanan
Data pelatihan AI bahasa Jepang, untuk setiap modalitas
Lima layanan yang mencakup kebutuhan sebuah sistem AI di setiap tahap — mulai dari data instruksi yang mengajari model hingga evaluasi manusia yang memberi tahu Anda apakah hasilnya berhasil.
Kelimanya berdiri di atas fondasi yang sama: anotator di Jepang, pedoman yang diberi versi alih-alih diingat-ingat, dan kualitas yang diukur sebelum diklaim.
Satu tim, seluruh siklus hidup data
Sebagian besar masalah anotasi bukanlah masalah pelabelan, melainkan masalah definisi: dua orang yang sama-sama masuk akal membaca pedoman yang sama lalu melabeli kalimat bahasa Jepang yang sama secara berbeda, dan tidak ada yang menyadarinya sampai model dilatih dengan keduanya. Membagi pekerjaan kami menjadi lima layanan adalah cara membuat definisi itu eksplisit — setiap layanan punya pertanyaan taksonominya sendiri, mode kegagalannya sendiri, dan pemeriksaan kualitasnya sendiri.
Kelima layanan ini bukan paket yang harus Anda pilih salah satu. Satu proyek lazim memakai tiga di antaranya sekaligus: anotasi NLP untuk membangun korpus berlabel, data pelatihan LLM untuk mengubahnya menjadi pasangan instruksi dan preferensi, lalu evaluasi untuk mengukur apa yang sebenarnya dilakukan model yang dihasilkan. Yang tetap sama adalah pertimbangan kebahasaan Jepang yang melandasi semuanya.
Sekilas
- Modalitas
- Data bahasa Jepang berupa teks, suara, gambar, video, dokumen, dan multimodal.
- Tahap model
- Penyaringan korpus, fine-tuning terawasi, data preferensi dan RLHF, evaluasi, dan benchmarking.
- Format pengiriman
- JSONL, CSV, CoNLL-U, SRT, CTM, COCO — atau skema yang Anda tentukan sendiri.
- Perangkat
- Kami bekerja di dalam platform anotasi Anda, atau di lingkungan aman milik kami sendiri.
- Titik awal
- Pilot dengan cakupan yang jelas. Taksonomi dan kualitas dibuktikan sebelum volume ditingkatkan.
Yang kami kerjakan
Lima layanan, ditambah lapisan ahli
Masing-masing punya halaman sendiri yang menguraikan keputusan taksonomi, jebakan khas bahasa Jepang, dan hasil yang dikirimkan.
Data Pelatihan LLM
Dataset instruksi, preferensi, dan RLHF yang ditulis dalam bahasa Jepang, dengan keputusan ragam bahasa yang dibuat secara eksplisit.
- Data instruksi dan SFT
- Data preferensi dan peringkat
- Dialog multigiliran
- Data keamanan, penolakan, dan red team
Evaluasi LLM
Evaluasi manusia atas keluaran model berbahasa Jepang — rubrik, preferensi berpasangan, faktualitas, dan red teaming.
- Preferensi berpasangan
- Penilaian rubrik
- Faktualitas dan grounding
- Keamanan dan red teaming
Suara & Audio
Transkripsi ASR bahasa Jepang, diarisasi, dan pelabelan maksud, dengan konvensi normalisasi yang dituliskan.
- Transkripsi
- Penandaan waktu dan penyelarasan
- Pelabelan penutur
- Pelabelan maksud dan slot
Gambar & Video
Bounding box, segmentasi, OCR, dan tata letak dokumen pada gambar, video, serta berkas administrasi berbahasa Jepang.
- Deteksi dan segmentasi
- Keypoint dan atribut
- Anotasi video
- OCR dan tata letak dokumen
Teks & NLP
Entitas, relasi, maksud, dan sentimen pada teks bahasa Jepang, dengan batas tokenizer yang diputuskan, bukan diandaikan.
- Pengenalan entitas bernama
- Ekstraksi relasi dan peristiwa
- Klasifikasi
- Sentimen dan emosi
Anotasi Ahli
Anotasi dan evaluasi bersama spesialis domain Jepang, untuk AI yang bekerja di bidang dengan regulasi ketat.
- Pengacara
- Akuntan Pajak
- Akuntan Publik Bersertifikat
- Spesialis Ketenagakerjaan & Jaminan Sosial
Memilih
Layanan mana yang saya butuhkan?
Mulailah dari apa yang ingin Anda ubah pada model. Layanannya mengikuti hal itu, bukan mengikuti jenis berkas yang kebetulan Anda miliki.
| Jika tujuan Anda… | Layanannya adalah | Hasil pertama yang umum |
|---|---|---|
| Mengajari model menjawab dalam bahasa Jepang yang alami dengan ragam yang tepat | Data Pelatihan LLM | Satu set pilot pasangan instruksi–jawaban dengan panduan gaya yang telah dikunci |
| Mengetahui di mana model salah sebelum Anda merilisnya | Evaluasi LLM | Set evaluasi bernilai skor beserta rubrik dan kesepakatan antarpenilai |
| Membuat model mendengar ucapan bahasa Jepang secara akurat | Suara & Audio | Audio yang ditranskripsikan dengan konvensi normalisasi tertulis |
| Membaca dokumen, formulir, atau teks di layar berbahasa Jepang | Gambar & Video | Anotasi OCR dan tata letak pada sampel dokumen yang representatif |
| Mengekstraksi fakta terstruktur dari teks bahasa Jepang | Teks & NLP | Skema entitas dan relasi yang diuji dengan kasus batas yang nyata |
| Meminta spesialis menilai jawaban di bidang dengan regulasi ketat | Anotasi Ahli | Set evaluasi yang ditinjau ahli dengan catatan ajudikasi tertulis |
Siklus hidup
Posisi setiap layanan
Satu dataset jarang bisa melayani dua tahap sekaligus. Data yang dibuat untuk mengajari model adalah alat uji yang buruk bagi model itu, karena model sudah pernah melihatnya.
-
01
Penyiapan korpus
Penyaringan, aturan deduplikasi, serta penanda kualitas dan keamanan pada teks, suara, atau dokumen bahasa Jepang yang masih mentah. Menentukan apa yang memang layak dianotasi.
-
02
Fine-tuning terawasi
Pasangan instruksi–jawaban, dialog multigiliran, dan demonstrasi tugas yang ditulis dalam ragam yang benar-benar dipakai produk Anda.
-
03
Preferensi dan penyelarasan
Perbandingan berperingkat atau berpasangan, perilaku keamanan dan penolakan, serta kriteria tertulis yang menjadikan satu jawaban lebih baik daripada yang lain.
-
04
Evaluasi
Set held-out dan penilaian rubrik oleh orang yang tidak terlibat dalam pembuatan data pelatihan, agar pengukurannya independen.
-
05
Pemantauan produksi
Mengambil sampel keluaran model yang sedang berjalan, menilainya dengan rubrik yang sama, dan mengembalikan kegagalan yang berulang ke siklus data berikutnya.
Pengiriman
Format dan pengiriman
Setiap batch dikirim bersama versi taksonomi yang dipakai saat pelabelan dan catatan perubahan terhadap batch sebelumnya, sehingga dataset tetap dapat dibandingkan antarversi.
| Jenis data | Pengiriman umum | Tersedia juga |
|---|---|---|
| Teks dan NLP | JSONL | CSV, CoNLL-U, brat standoff, Parquet |
| Instruksi dan preferensi LLM | JSONL (messages / chosen–rejected) | CSV, tata letak dataset Hugging Face |
| Suara | JSON dengan penanda waktu | SRT, VTT, CTM, TextGrid, transkrip polos |
| Gambar dan video | COCO JSON | YOLO, Pascal VOC, CVAT XML, JSONL per frame |
| Dokumen dan OCR | JSON dengan geometri halaman | hOCR, ALTO, ekstraksi field CSV |
| Hasil evaluasi | Skor JSONL beserta laporan QA | CSV, notebook penilaian, log ajudikasi |
FAQ
Seputar layanan
Pertanyaan tentang cakupan dan proses yang muncul sebelum sebuah pilot ditetapkan.
Bisa, dan sebagian besar program memang begitu. Urutan yang umum adalah anotasi NLP untuk membangun korpus berlabel, data pelatihan LLM yang disusun dari korpus itu, lalu evaluasi yang dijalankan oleh kelompok anotator yang berbeda. Menggabungkannya dalam satu kerja sama berarti taksonomi, panduan gaya, dan metrik QA tetap konsisten, bukan diturunkan ulang oleh setiap vendor.
Bahasa Jepang adalah alasan kami dibangun, dan pekerjaan dwibahasa Jepang–Inggris termasuk di dalamnya. Untuk pekerjaan bervolume besar dalam bahasa lain, kami lebih memilih menyampaikan terus terang bahwa kami bukan vendor yang tepat daripada menerima proyeknya lalu mensubkontrakkannya.
Harga dihitung per unit pekerjaan — per item, per jam audio, per gambar, atau per evaluasi — dan bergantung pada kompleksitas tugas, seberapa banyak waktu peninjau yang dibutuhkan tiap item, serta tingkat keahlian yang diperlukan. Kami memberikan penawaran setelah menentukan cakupan pilot pada data Anda yang sebenarnya, karena penawaran yang hanya berdasar deskripsi tugas adalah tebakan, dan biasanya tebakan yang meleset.
Kami menyusun draf, Anda meninjaunya, dan keduanya terjadi sebelum produksi. Pilot ada untuk mematahkan draf pertama dengan kasus batas yang nyata; setiap perbedaan penilaian yang diselesaikan selama pilot dituliskan kembali ke dalam dokumen. Pedoman itu kemudian diberi versi, dan setiap batch yang dikirimkan mencatat versi mana yang dipakai saat pelabelan.
Mulai dari sini
Beri tahu kami apa yang perlu dipelajari model Anda.
Kirimkan tugasnya, satu sampel data, dan batasan yang sedang Anda hadapi. Kami akan kembali dengan rencana pilot yang jelas cakupannya, pertanyaan taksonomi yang perlu dijawab, dan pandangan jujur tentang bagian mana yang sulit.
NDA sebelum Anda membagikan data apa pun. Penentuan cakupan pilot tanpa biaya.