Suara & percakapan

Anotasi data suara dan audio bahasa Jepang

Transkripsi, penandaan waktu, diarisasi penutur, pelabelan maksud dan slot, serta penandaan emosi atau dialek pada audio berbahasa Jepang — dikerjakan mengikuti konvensi tertulis, bukan kebiasaan yang tak tertulis.

Dua transkriptor yang diberi audio bahasa Jepang yang sama tanpa konvensi akan berbeda pendapat kira-kira di setiap baris ketiga. Bukan tentang apa yang diucapkan, melainkan tentang cara menuliskannya.

Transkrip adalah kumpulan keputusan, bukan rekaman

Bahasa Jepang tidak memakai spasi, punya empat aksara, dan menyisakan jarak lebar antara bunyi sebuah kata dan cara lazim menuliskannya. Jadi begitu audio berubah menjadi teks, seseorang sudah mengambil puluhan pilihan: apakah 有難うございます ditulis dengan kanji atau kana, apakah 3人 ditulis 3人 atau 三人, apakah えーっと di awal kalimat dipertahankan atau dibuang, apakah pengulangan di tengah kata ditranskripsikan atau dirapikan.

Tidak satu pun pilihan itu salah bila berdiri sendiri. Yang salah adalah mengambilnya secara tidak konsisten di seluruh korpus, karena model ASR yang dilatih dengan target yang tidak konsisten belajar bahwa bunyi yang sama memetakan ke beberapa string, dan tingkat kesalahannya menyerap selisih itu. Tuas kualitas terbesar dalam data suara bahasa Jepang adalah konvensi normalisasi yang dituliskan dan benar-benar ditegakkan.

Karena itu kami memulai setiap proyek suara dengan menyepakati dokumen tersebut — dan jika Anda sudah punya, kami memakai punya Anda alih-alih memaksakan punya kami.

Sekilas

Jenis tugas
Transkripsi verbatim dan clean-read, penandaan waktu, diarisasi, pelabelan maksud dan slot, emosi dan prosodi, penandaan dialek.
Audio yang ditangani
Rekaman pusat panggilan, rapat, wawancara, siaran, ucapan di dalam mobil dan pada perangkat, serta percakapan spontan.
Konvensi
Pilihan aksara, filler, angka, tawa, dan bagian yang tak terdengar semuanya ditetapkan sebelum transkripsi dimulai.
Keluaran umum
JSON dengan penanda waktu per kata atau per segmen; SRT, VTT, CTM, dan TextGrid juga didukung.
Tinjauan
Pendengaran ulang pada setiap berkas, ditambah transkripsi ulang secara buta pada sampel.

Jenis tugas

Yang kami anotasi

Transkripsi biasanya menjadi lapisan dasar; selebihnya ditambahkan di atas linimasa yang sama.

Transkripsi

Verbatim atau clean-read, mengikuti konvensi tertulis yang mencakup filler, pengulangan awal, repetisi, salah ucap, dan bagian yang tak terdengar.

  • Verbatim beserta disfluensi
  • Clean-read agar mudah dibaca
  • Penandaan bagian tak terdengar dan tumpang tindih
  • Tag peristiwa nonwicara

Penandaan waktu dan penyelarasan

Penanda waktu pada tingkat segmen, ujaran, atau kata, serta forced alignment terhadap transkrip yang sudah ada bila tersedia.

  • Batas ujaran
  • Penanda waktu tingkat kata
  • QA forced alignment
  • Rentang hening dan tumpang tindih

Pelabelan penutur

Siapa yang sedang berbicara, termasuk pada ucapan yang tumpang tindih dan pergantian kanal — bagian yang paling sering gagal pada rekaman panggilan nyata.

  • Diarisasi dan ID penutur
  • Label peran (agen / pelanggan)
  • Penanganan tumpang tindih
  • Penandaan atribut penutur

Pelabelan maksud dan slot

Apa yang hendak dicapai sebuah ujaran dan nilai apa yang dibawanya, dilapiskan di atas transkrip untuk pekerjaan asisten suara dan analitik panggilan.

  • Klasifikasi maksud
  • Rentang slot dan entitas
  • Label tindak tutur
  • Hasil dan disposisi panggilan

Pelabelan paralinguistik

Emosi, sentimen, penekanan prosodis, gaya bertutur, dan ragam kedaerahan, dinilai berdasarkan kategori yang telah ditetapkan, bukan berdasarkan kesan.

  • Emosi dan sentimen
  • Gaya bertutur dan tingkat kesantunan
  • Ragam kedaerahan dan aksen
  • Tag kualitas audio dan lingkungan

Khas bahasa Jepang

Keputusan yang harus diambil sebuah konvensi bahasa Jepang

Empat hal ini mencakup sebagian besar perbedaan pendapat antara dua transkriptor yang sama-sama kompeten.

Pilihan aksara untuk kata yang sama

ありがとう, 有難う, dan アリガトウ adalah kata yang sama. Jika diserahkan kepada masing-masing transkriptor, sebuah korpus akan memuat ketiganya, dan model memperlakukannya sebagai target yang berbeda.

Cara kami menanganinya Konvensi mendaftar aksara yang wajib dipakai untuk kata-kata umum, menetapkan aturan default untuk sisanya, dan pemeriksaan otomatis menandai varian sebelum pengiriman.

Angka dan kata penggolong

Kata penggolong bahasa Jepang berubah bacaannya mengikuti nomina yang dihitung — 一本, 一杯, 一人 — dan sebuah angka bisa ditulis 3, 三, atau 参. Jika ditulis tidak konsisten, akurasi numerik pada model yang dihasilkan menjadi tidak terukur.

Cara kami menanganinya Kebijakan angka mengunci penggunaan angka Arab versus kanji untuk tiap konteks, serta cara menuliskan kata penggolong dan satuan, lengkap dengan contoh terurai untuk tanggal, nominal uang, waktu, dan nomor telepon.

Filler dan disfluensi

あの, えーっと, まあ, dan そのー bertebaran dalam bahasa Jepang spontan. Mempertahankannya membuat transkrip lebih berisik; membuangnya membuat data verbatim tidak terpakai untuk model yang perlu mengenali disfluensi.

Cara kami menanganinya Varian verbatim dan clean-read ditetapkan terpisah, dengan daftar filler dan ejaan yang tetap untuk masing-masing, sehingga pilihannya menjadi setelan proyek, bukan penilaian per berkas.

Bentuk santun dan ragam hormat

Bahasa Jepang di pusat panggilan padat dengan bentuk hormat dan merendah, dan beberapa di antaranya kerap salah dengar — いたします dan いただきます, よろしいでしょうか dan よろしかったでしょうか — oleh transkriptor yang bekerja cepat.

Cara kami menanganinya Peninjau diberi pengarahan tentang pola ragam hormat yang khas untuk jenis audio Anda, dan kesalahan ragam hormat menjadi kategori tersendiri dalam tahap tinjauan, bukan dilebur ke dalam akurasi umum.

Proses

Bagaimana sebuah proyek suara dijalankan

Dokumen konvensi ditulis sebelum ada orang yang mentranskripsi satu berkas penuh, dan hanya direvisi melalui perubahan yang diberi versi.

  1. 01

    Sampel dan cakupan

    Kami mendengarkan sampel yang representatif — termasuk audio Anda yang paling buruk, bukan hanya yang paling bersih — dan mengenali apa yang benar-benar akan sulit di dalamnya.

  2. 02

    Menulis konvensinya

    Aksara, angka, filler, peristiwa nonwicara, tumpang tindih, bagian tak terdengar, peran penutur, dan tingkat kerincian penanda waktu semuanya dikunci dalam satu dokumen yang Anda setujui.

  3. 03

    Kalibrasi lewat pilot

    Beberapa transkriptor mengerjakan berkas yang sama secara independen. Di titik mereka berbeda, di situlah konvensinya ambigu dan perlu dipertajam.

  4. 04

    Transkripsi dan tinjauan

    Setiap berkas didengarkan ulang oleh orang yang berbeda; satu sampel ditranskripsikan ulang secara buta untuk menghasilkan angka akurasi yang terukur.

  5. 05

    Pengiriman dan pelaporan

    Transkrip, penanda waktu, dan label dikirim bersama versi konvensinya, laporan QA, dan daftar berkas yang ditandai tidak dapat dipakai alih-alih ditebak isinya.

Pengiriman

Format masuk dan keluar

Kami bekerja dengan audio Anda apa adanya. Jika codec atau laju cuplik membatasi apa yang bisa dicapai, kami menyampaikannya sebelum proyek dimulai, bukan sesudahnya.

Format masukan dan keluaran yang umum untuk pekerjaan suara berbahasa Jepang.
LapisanKeluaran defaultTersedia juga
TranskripJSON dengan penanda waktu per segmenteks polos, SRT, VTT
Penanda waktu tingkat kataJSONCTM, TextGrid
Label penuturRTTM atau giliran penutur dalam JSONtranskrip per kanal
Maksud dan slotJSONL, satu ujaran per barisCSV, format rentang CoNLL
Label paralinguistikJSONL dengan rentang waktuCSV, berkas anotasi ELAN

Kualitas

Kontrol yang khusus untuk pekerjaan ini

Akurasi pada audio bahasa Jepang itu diukur, bukan diklaim — dan diukur pada berkas yang sulit, bukan yang mudah.

  • Transkripsi ulang secara buta atas sampel oleh transkriptor kedua, menghasilkan tingkat kesalahan terukur untuk tiap batch.
  • Pemeriksaan konvensi otomatis untuk varian aksara, format angka, dan ejaan filler sebelum pengiriman.
  • Penanda waktu divalidasi terhadap audionya, bukan sekadar terhadap segmen di sebelahnya.
  • Berkas yang benar-benar tidak dapat ditranskripsikan ditandai dan dikembalikan apa adanya, tidak pernah diisi dengan tebakan yang terdengar masuk akal.
  • Label penutur diperiksa di sepanjang berkas, sehingga tertukarnya identitas di tengah jalan dapat tertangkap.
  • Audio yang sulit sengaja dimasukkan ke dalam sampel QA, sehingga angka yang dilaporkan mencerminkan korpusnya, bukan bagian terbaiknya.

FAQ

Seputar suara dan audio

Yang ditanyakan tim sebelum mengirimkan batch audio berbahasa Jepang pertama mereka.

Bisa, dan untuk audio yang bersih biasanya itu pilihan yang lebih hemat. Catatannya, mengoreksi transkrip mesin membuat manusia cenderung menerima apa yang sudah tertera di layar, sehingga untuk data pelatihan kami mentranskripsi dari nol atau menjalankan pemeriksaan buta pada sampel untuk mengukur seberapa banyak yang sebenarnya tertangkap oleh tahap koreksi itu.

Kami menyepakati lebih dahulu apakah dialek ditranskripsikan sebagaimana diucapkan atau dinormalisasi ke bahasa Jepang baku, karena keputusan itu mengubah datasetnya secara menyeluruh. Jika dialek termasuk dalam cakupan, kami menandai ragamnya, dan kami terus terang tentang ragam mana yang dapat kami tangani dengan andal dan mana yang tidak.

Kami bekerja dengan rekaman nyata, termasuk audio panggilan berpita telepon, derau latar, dan penutur yang saling tumpang tindih. Yang lebih penting daripada formatnya adalah Anda mengirimkan sampel yang representatif sejak awal — menentukan cakupan berdasarkan audio bersih lalu mengirimkan pekerjaan pada audio berisik adalah cara proyek suara menjadi kacau.

Bisa, di bawah NDA dan perjanjian pemrosesan data, di lingkungan terisolasi dengan akses berbasis peran, serta dengan ketentuan retensi dan penghapusan yang disepakati dalam kontrak. Jika rekaman memuat informasi pribadi, kami juga dapat menandainya untuk diredaksi, atau bekerja pada audio yang sudah Anda redaksi sebelum dikirim. Lihat halaman keamanan untuk gambaran lengkapnya.

Ya. Tumpang tindih adalah titik tempat diarisasi otomatis paling sering gagal, dan itu salah satu alasan utama menempatkan manusia di sana. Konvensi kami menetapkan cara ucapan yang tumpang tindih disegmentasi dan diatribusikan, sehingga penanganannya konsisten, bukan diputuskan berkas per berkas.

Suara & audio

Kirimkan audio Anda yang paling sulit, bukan yang paling bersih.

Sampel yang representatif memberi tahu kami lebih banyak daripada sebuah spesifikasi. Kami akan kembali dengan draf konvensi, satu sampel yang telah ditranskripsikan, dan pandangan jujur tentang tingkat kesalahan yang wajar diharapkan.

NDA sebelum Anda membagikan data apa pun. Penentuan cakupan pilot tanpa biaya.