Giọng nói & hội thoại

Gán nhãn dữ liệu giọng nói và âm thanh tiếng Nhật

Chuyển giọng nói thành văn bản, gắn dấu thời gian, phân tách người nói, gán nhãn ý định và slot, gán nhãn cảm xúc hoặc phương ngữ trên âm thanh tiếng Nhật — thực hiện theo một quy ước bằng văn bản chứ không theo thói quen bất thành văn.

Hai người gỡ băng nhận cùng một đoạn âm thanh tiếng Nhật mà không có quy ước sẽ bất đồng ở khoảng một phần ba số dòng. Không phải về nội dung đã nói, mà về cách viết nó ra.

Bản gỡ băng là một tập hợp các quyết định, không phải một bản ghi âm

Tiếng Nhật không có khoảng trắng, có bốn hệ chữ viết và có khoảng cách lớn giữa cách một từ phát âm với cách nó được viết theo quy ước. Vì vậy ngay khi âm thanh trở thành văn bản, đã có người phải đưa ra hàng chục lựa chọn: 有難うございます viết bằng kanji hay kana, 3人 viết là 3人 hay 三人, chữ えーっと ở đầu câu được giữ hay bỏ, một lần nói lại giữa chừng được ghi nguyên hay được chỉnh lại.

Không lựa chọn nào trong số đó là sai nếu xét riêng lẻ. Cái sai là đưa ra chúng một cách thiếu nhất quán trên cả kho ngữ liệu, vì một mô hình ASR huấn luyện trên các đích không nhất quán sẽ học rằng cùng một âm thanh ánh xạ tới nhiều chuỗi ký tự khác nhau, và tỷ lệ lỗi của nó hấp thụ phần chênh lệch đó. Đòn bẩy chất lượng lớn nhất trong dữ liệu giọng nói tiếng Nhật là một quy ước chuẩn hóa được viết thành văn bản và được thực thi thật sự.

Vì vậy chúng tôi bắt đầu mọi dự án về giọng nói bằng việc thống nhất tài liệu đó — và nếu quý khách đã có sẵn một tài liệu như vậy, chúng tôi dùng của quý khách thay vì áp đặt của mình.

Tổng quan nhanh

Loại tác vụ
Gỡ băng nguyên văn và gỡ băng đã làm sạch, gắn dấu thời gian, phân tách người nói, gán nhãn ý định và slot, cảm xúc và ngữ điệu, gán nhãn phương ngữ.
Loại âm thanh
Ghi âm tổng đài, cuộc họp, phỏng vấn, phát thanh truyền hình, giọng nói trong xe và trên thiết bị, hội thoại tự nhiên.
Quy ước
Cách chọn hệ chữ viết, từ đệm, chữ số, tiếng cười và các đoạn không nghe rõ đều được định nghĩa trước khi bắt đầu gỡ băng.
Đầu ra thường dùng
JSON kèm mốc thời gian theo từ hoặc theo đoạn; cũng hỗ trợ SRT, VTT, CTM và TextGrid.
Thẩm định
Nghe lại lượt hai trên mọi tệp, cộng thêm gỡ băng lại một cách mù trên một mẫu.

Loại tác vụ

Chúng tôi gán nhãn gì

Gỡ băng thường là lớp nền; các phần còn lại được thêm lên trên cùng một trục thời gian.

Gỡ băng

Nguyên văn hoặc đã làm sạch, theo một quy ước bằng văn bản bao trùm từ đệm, nói lại, lặp từ, phát âm sai và các đoạn không nghe rõ.

  • Nguyên văn kèm hiện tượng ngắt quãng
  • Bản làm sạch để dễ đọc
  • Đánh dấu đoạn không nghe rõ và đoạn chồng tiếng
  • Thẻ đánh dấu sự kiện phi lời nói

Mốc thời gian và căn khớp

Dấu thời gian ở cấp đoạn, cấp phát ngôn hoặc cấp từ, và căn khớp cưỡng bức theo một bản gỡ băng sẵn có nếu đã có.

  • Ranh giới phát ngôn
  • Mốc thời gian cấp từ
  • QA cho căn khớp cưỡng bức
  • Các đoạn im lặng và chồng tiếng

Gán nhãn người nói

Ai đang nói, xuyên qua các đoạn chồng tiếng và các lần đổi kênh — chính là phần hay hỏng nhất trên các bản ghi cuộc gọi thực tế.

  • Phân tách người nói và mã định danh
  • Nhãn vai (tổng đài viên / khách hàng)
  • Xử lý đoạn chồng tiếng
  • Gán nhãn thuộc tính người nói

Gán nhãn ý định và slot

Phát ngôn đang muốn làm gì và mang theo những giá trị nào, được đắp lên bản gỡ băng để phục vụ trợ lý giọng nói và phân tích cuộc gọi.

  • Phân loại ý định
  • Đoạn slot và thực thể
  • Nhãn hành vi hội thoại
  • Kết quả và hướng xử lý cuộc gọi

Gán nhãn cận ngôn ngữ

Cảm xúc, thái độ, trọng âm ngữ điệu, phong cách nói và biến thể vùng miền, được chấm theo các nhóm đã định nghĩa chứ không theo cảm nhận.

  • Cảm xúc và thái độ
  • Phong cách nói và mức độ lịch sự
  • Biến thể vùng miền và giọng địa phương
  • Thẻ chất lượng âm thanh và môi trường ghi âm

Đặc thù tiếng Nhật

Những quyết định mà một quy ước tiếng Nhật buộc phải đưa ra

Bốn điểm sau bao trùm phần lớn bất đồng giữa hai người gỡ băng đều có năng lực.

Chọn hệ chữ viết cho cùng một từ

ありがとう, 有難う và アリガトウ là cùng một từ. Nếu để mỗi người gỡ băng tự quyết, kho ngữ liệu sẽ chứa cả ba, và mô hình coi chúng là ba đích khác nhau.

Cách chúng tôi xử lý Quy ước liệt kê hệ chữ viết bắt buộc cho các từ thông dụng, đặt một quy tắc mặc định cho phần còn lại, và một khâu kiểm tra tự động sẽ đánh dấu các biến thể trước khi bàn giao.

Chữ số và loại từ đếm

Loại từ đếm trong tiếng Nhật đổi cách đọc theo danh từ mà nó đếm — 一本, 一杯, 一人 — và một con số có thể viết là 3, 三 hoặc 参. Nếu viết thiếu nhất quán, độ chính xác về số liệu của mô hình thu được sẽ không thể đo được.

Cách chúng tôi xử lý Một chính sách về chữ số chốt việc dùng số Ả Rập hay kanji theo từng ngữ cảnh, cùng cách ghi loại từ đếm và đơn vị, kèm ví dụ cụ thể cho ngày tháng, tiền, giờ giấc và số điện thoại.

Từ đệm và hiện tượng ngắt quãng

あの, えーっと, まあ và そのー xuất hiện dày đặc trong tiếng Nhật tự nhiên. Giữ lại thì bản gỡ băng nhiễu hơn; bỏ đi thì dữ liệu nguyên văn không dùng được cho các mô hình nhận biết hiện tượng ngắt quãng.

Cách chúng tôi xử lý Biến thể nguyên văn và biến thể làm sạch được định nghĩa riêng, với một danh mục từ đệm cố định và cách viết cố định cho từng biến thể, để lựa chọn này là một thiết lập của dự án chứ không phải phán đoán theo từng tệp.

Thể lịch sự và kính ngữ

Tiếng Nhật trong tổng đài dày đặc kính ngữ và khiêm nhường ngữ, và một số cặp thường bị nghe nhầm — いたします với いただきます, よろしいでしょうか với よろしかったでしょうか — bởi những người gỡ băng làm việc gấp gáp.

Cách chúng tôi xử lý Thẩm định viên được hướng dẫn về các mẫu kính ngữ đặc thù cho loại âm thanh của quý khách, và lỗi kính ngữ là một nhóm riêng có tên gọi trong lượt thẩm định chứ không bị gộp vào độ chính xác chung.

Quy trình

Một dự án về giọng nói diễn ra như thế nào

Tài liệu quy ước được viết trước khi có ai gỡ băng trọn một tệp, và chỉ được sửa đổi thông qua một thay đổi có quản lý phiên bản.

  1. 01

    Nghe mẫu và xác định phạm vi

    Chúng tôi nghe một mẫu có tính đại diện — bao gồm cả phần âm thanh tệ nhất chứ không chỉ phần sạch nhất — và xác định điều gì sẽ thực sự khó.

  2. 02

    Viết quy ước

    Hệ chữ viết, chữ số, từ đệm, sự kiện phi lời nói, đoạn chồng tiếng, đoạn không nghe rõ, vai người nói và độ mịn của mốc thời gian đều được chốt trong một tài liệu do quý khách phê duyệt.

  3. 03

    Hiệu chỉnh trên dự án thử nghiệm

    Nhiều người gỡ băng làm cùng những tệp giống nhau một cách độc lập. Chỗ nào họ khác nhau, chỗ đó quy ước còn mơ hồ và được làm sắc nét lại.

  4. 04

    Gỡ băng và thẩm định

    Mọi tệp đều được một người khác nghe lại lượt hai; một mẫu được gỡ băng lại một cách mù để tạo ra con số chính xác đo được.

  5. 05

    Bàn giao và báo cáo

    Bản gỡ băng, mốc thời gian và nhãn được bàn giao kèm phiên bản quy ước, báo cáo QA và danh sách các tệp bị đánh dấu là không dùng được thay vì bị đoán mò.

Bàn giao

Định dạng đầu vào và đầu ra

Chúng tôi làm việc với âm thanh của quý khách ở nguyên trạng. Khi một codec hoặc tần số lấy mẫu giới hạn những gì có thể đạt được, chúng tôi nói rõ trước khi dự án bắt đầu chứ không phải sau đó.

Các định dạng đầu vào và đầu ra thông dụng cho công việc về giọng nói tiếng Nhật.
Lớp dữ liệuĐầu ra mặc địnhCũng có sẵn
Bản gỡ băngJSON kèm mốc thời gian theo đoạnvăn bản thuần, SRT, VTT
Mốc thời gian cấp từJSONCTM, TextGrid
Nhãn người nóiRTTM hoặc lượt nói dạng JSONbản gỡ băng theo từng kênh
Ý định và slotJSONL, mỗi dòng một phát ngônCSV, định dạng đoạn CoNLL
Nhãn cận ngôn ngữJSONL kèm khoảng thời gianCSV, tệp chú giải ELAN

Chất lượng

Những khâu kiểm soát riêng cho công việc này

Độ chính xác trên âm thanh tiếng Nhật được đo lường chứ không được tuyên bố — và được đo trên những tệp khó, không phải những tệp dễ.

  • Gỡ băng lại một cách mù trên một mẫu bởi người gỡ băng thứ hai, tạo ra tỷ lệ lỗi đo được cho từng lô.
  • Kiểm tra quy ước tự động về biến thể chữ viết, định dạng chữ số và cách viết từ đệm trước khi bàn giao.
  • Mốc thời gian được kiểm chứng theo chính âm thanh, không chỉ theo các đoạn liền kề.
  • Những tệp thực sự không thể gỡ băng được đánh dấu và trả lại đúng như vậy, không bao giờ điền vào bằng một phỏng đoán nghe có lý.
  • Nhãn người nói được kiểm tra trên toàn bộ tệp, để bắt được trường hợp hoán đổi danh tính ở giữa chừng.
  • Âm thanh khó được cố ý đưa vào mẫu QA, để con số báo cáo phản ánh cả kho ngữ liệu chứ không phải phần tốt nhất của nó.

FAQ

Về giọng nói và âm thanh

Những điều các đội ngũ hỏi trước khi gửi lô âm thanh tiếng Nhật đầu tiên.

Có, và với âm thanh sạch thì đó thường là phương án đáng tiền hơn. Điểm cần lưu ý là việc sửa một bản gỡ băng của máy khiến người làm nghiêng về chấp nhận những gì đã hiện trên màn hình, nên với dữ liệu huấn luyện, chúng tôi hoặc gỡ băng từ đầu, hoặc chạy một khâu kiểm tra mù trên một mẫu để đo xem lượt sửa thực sự bắt được bao nhiêu lỗi.

Chúng tôi thống nhất trước xem phương ngữ được ghi đúng như lời nói hay được chuẩn hóa về tiếng Nhật chuẩn, vì quyết định đó thay đổi hoàn toàn bộ dữ liệu. Khi phương ngữ nằm trong phạm vi công việc, chúng tôi gán nhãn biến thể, và chúng tôi nói thẳng biến thể nào chúng tôi bố trí được người làm một cách ổn định và biến thể nào thì không.

Chúng tôi làm việc với bản ghi thực tế, kể cả âm thanh cuộc gọi ở băng thông điện thoại, tiếng ồn nền và nhiều người nói chồng lên nhau. Điều quan trọng hơn định dạng là quý khách gửi trước một mẫu có tính đại diện — xác định phạm vi dựa trên âm thanh sạch rồi lại bàn giao trên âm thanh nhiễu chính là cách các dự án về giọng nói đi chệch hướng.

Có, theo NDA và thỏa thuận xử lý dữ liệu, trong một môi trường tách biệt có phân quyền theo vai trò, cùng các điều khoản về thời hạn lưu trữ và xóa dữ liệu được thống nhất trong hợp đồng. Khi bản ghi chứa thông tin cá nhân, chúng tôi cũng có thể đánh dấu để che, hoặc làm việc trên phần âm thanh mà quý khách đã che trước khi gửi. Xem trang bảo mật để có bức tranh đầy đủ.

Có. Chồng tiếng là chỗ việc phân tách tự động hỏng nhiều nhất, và đó là một trong những lý do chính để đưa con người vào. Quy ước của chúng tôi định nghĩa cách phân đoạn và quy gán phần lời nói chồng lên nhau, để cách xử lý được nhất quán thay vì quyết định theo từng tệp.

Giọng nói & âm thanh

Hãy gửi cho chúng tôi đoạn âm thanh khó nhất, không phải đoạn sạch nhất.

Một mẫu có tính đại diện nói cho chúng tôi biết nhiều hơn một bản đặc tả. Chúng tôi sẽ phản hồi bằng một bản quy ước nháp, một mẫu đã gỡ băng và một góc nhìn thẳng thắn về tỷ lệ lỗi có thể trông đợi.

Ký NDA trước khi quý khách chia sẻ bất kỳ dữ liệu nào. Xác định phạm vi thử nghiệm là miễn phí.