NLP tiếng Nhật

Gán nhãn NLP tiếng Nhật — thực thể, quan hệ và phân loại

Nhận dạng thực thể có tên, trích xuất quan hệ, phân loại ý định và chủ đề, thái độ, suy luận ngôn ngữ tự nhiên và tách từ — được gán nhãn theo đúng tokenizer mà quy trình của quý khách thực sự dùng.

Tiếng Nhật không có khoảng trắng giữa các từ. Vì vậy mọi lần gán nhãn một đoạn văn bản đều phụ thuộc vào một quyết định về ranh giới mà ai đó phải đưa ra, và quyết định đó phải khớp với tokenizer ở phía sau, nếu không các nhãn sẽ không căn khớp được.

Ranh giới chính là toàn bộ vấn đề

Trong tiếng Anh, “Toyota Motor Corporation” có ba token hiển nhiên và câu hỏi duy nhất là thực thể bắt đầu và kết thúc ở đâu. Trong tiếng Nhật, 株式会社トヨタ自動車 là một chuỗi liền mạch, và có ít nhất bốn cách gán nhãn đều có lý: có hoặc không kèm 株式会社, có hoặc không kèm 自動車, coi toàn bộ là một thực thể, hoặc lồng một thực thể ngắn hơn bên trong một thực thể dài hơn.

Mỗi cách trong số đó đều là một lựa chọn chính đáng. Điều quan trọng là lựa chọn ấy được đưa ra như nhau mọi lần, được viết thành văn bản, và sống sót khi va chạm với tokenizer mà mô hình của quý khách dùng — vì một ranh giới rơi vào giữa một token thì không thể biểu diễn được trong cách gán nhãn BIO mà không âm thầm bị dịch chuyển.

Đó là lý do chúng tôi chốt tokenizer và các quy tắc về ranh giới trước khi bắt đầu gán nhãn, và là lý do chúng tôi lưu vị trí ký tự bên dưới bất kỳ định dạng thẻ nào quý khách muốn, để dữ liệu có thể được tách từ lại sau này mà không phải gán nhãn lại.

Tổng quan nhanh

Loại tác vụ
NER, trích xuất quan hệ và sự kiện, phân loại ý định và chủ đề, thái độ và cảm xúc, NLI và diễn đạt tương đương, tách từ và chuẩn hóa.
Bám theo tokenizer
Các đoạn văn bản được gán nhãn theo MeCab, Sudachi, Juman++ hoặc chính tokenizer của mô hình bên quý khách, theo thỏa thuận khi khởi động dự án.
Quy tắc về ranh giới
Hậu tố loại hình doanh nghiệp, danh từ ghép, tiền tố kính ngữ và phần chia đuôi đều có quy tắc bằng văn bản.
Đầu ra thường dùng
JSONL kèm vị trí ký tự; cũng hỗ trợ CoNLL-U, gán nhãn BIO và brat standoff.
Thẩm định
Ranh giới đoạn và nhãn của đoạn được thẩm định như hai tiêu chí riêng.

Loại tác vụ

Chúng tôi gán nhãn gì

Tác vụ trên đoạn văn bản và tác vụ trên toàn văn bản có những kiểu lỗi khác nhau, nên có tiêu chí thẩm định khác nhau.

Nhận dạng thực thể có tên

Các đoạn thực thể theo một bảng phân loại được định nghĩa cho lĩnh vực của quý khách, bao gồm thực thể lồng nhau và chồng lấn khi quý khách cần.

  • Kiểu thực thể chuẩn và kiểu riêng theo lĩnh vực
  • Đoạn lồng nhau và đoạn không liền mạch
  • Chuẩn hóa về dạng chính tắc
  • Liên kết cách đọc và các biến thể

Trích xuất quan hệ và sự kiện

Cách các thực thể kết nối với nhau — ai làm gì với ai, giá trị nào thuộc về trường nào, mệnh đề nào bổ nghĩa cho thuật ngữ nào.

  • Quan hệ hai ngôi và quan hệ n ngôi
  • Yếu tố kích hoạt sự kiện và các tham tố
  • Quan hệ xuyên câu
  • Đánh dấu phủ định và mức không chắc chắn

Phân loại

Ý định, chủ đề, nhóm định tuyến hoặc nhãn chính sách ở cấp phát ngôn hoặc cấp văn bản, đơn nhãn hoặc đa nhãn.

  • Ý định và hành vi hội thoại
  • Chủ đề và nhóm định tuyến
  • Bảng phân loại đa nhãn
  • Xử lý trường hợp ngoài phạm vi và không rõ ràng

Thái độ và cảm xúc

Sắc thái và cảm xúc ở cấp văn bản, cấp câu hoặc theo từng khía cạnh — và chính cấp cuối cùng mới là chỗ văn bản kinh doanh tiếng Nhật thực sự cần đến.

  • Sắc thái ở cấp văn bản và cấp câu
  • Thái độ theo từng khía cạnh
  • Các nhóm cảm xúc
  • Gán nhãn mức độ lịch sự và văn phong

Suy luận và độ tương đồng

Các cặp kéo theo, diễn đạt tương đương và tương đồng ngữ nghĩa, cộng thêm những mẫu phủ định khó làm cho bộ đánh giá có sức phân biệt.

  • Cặp kéo theo cho NLI
  • Nhận diện diễn đạt tương đương
  • Điểm tương đồng theo thang
  • Xây dựng mẫu phủ định khó

Đặc thù tiếng Nhật

Những quy tắc mà một tài liệu hướng dẫn tiếng Nhật buộc phải có

Bốn câu hỏi này xuất hiện ngay trong giờ đầu tiên của mọi dự án gán nhãn đoạn văn bản tiếng Nhật.

Ranh giới từ

Tiếng Nhật được viết không có khoảng trắng, nên ranh giới của một đoạn là một phán đoán chứ không phải một phép tra cứu. Các bộ phân tích hình thái khác nhau tách cùng một câu theo những cách khác nhau, và nhãn căn theo bộ này sẽ không căn khớp với bộ kia.

Cách chúng tôi xử lý Bộ phân tích và từ điển được chốt khi khởi động dự án, các đoạn được lưu theo vị trí ký tự để sống sót qua việc tách từ lại, và các quy ước về ranh giới được nêu rõ kèm ví dụ cụ thể.

Tên công ty và tổ chức

株式会社 có thể đứng trước hoặc sau tên công ty, xuất hiện ở dạng viết tắt (株), hoặc bị lược bỏ hoàn toàn. Việc nó nằm trong hay ngoài đoạn thực thể làm thay đổi mọi phép so khớp chuỗi ở phía sau.

Cách chúng tôi xử lý Một quy tắc duy nhất bao trùm các tiền tố và hậu tố chỉ loại hình pháp lý, các dạng viết tắt và các biến thể trong ngoặc, và một dạng chính tắc được ghi lại bên cạnh đoạn văn bản gốc.

Danh từ ghép

Tiếng Nhật nối các danh từ lại với nhau không có dấu phân cách — 個人情報保護管理者 là một chuỗi chứa ít nhất ba đơn vị có nghĩa. Thực thể dừng lại ở đâu là một quyết định, không phải một sự thật hiển nhiên.

Cách chúng tôi xử lý Tài liệu hướng dẫn đặt ra chính sách lấy đoạn dài nhất hoặc đoạn ngắn nhất cho từng kiểu thực thể, có lồng nhau ở những chỗ thực sự cần cả hai, thay vì để mỗi chuyên viên tự chọn.

Phần chia đuôi và trợ từ đi kèm

Động từ và tính từ có biến đổi đuôi, còn trợ từ thì dính liền vào từ mà nó đánh dấu. Việc đưa chúng vào hay để chúng ra ngoài làm dịch chuyển ranh giới đoạn một đến hai ký tự trên toàn bộ kho ngữ liệu.

Cách chúng tôi xử lý Quy tắc nêu rõ phần đuôi biến đổi và trợ từ đi kèm nằm trong hay ngoài đoạn, và một khâu kiểm tra tự động đánh dấu những đoạn kết thúc ở giữa một token.

Quy trình

Một dự án NLP diễn ra như thế nào

Phần lớn giá trị được tạo ra trước khi bắt đầu gán nhãn, nằm ở bảng phân loại nhãn và các quy tắc về ranh giới.

  1. 01

    Chốt bảng phân loại nhãn và tokenizer

    Chúng tôi thống nhất tập nhãn, bộ phân tích và từ điển, cùng cách biểu diễn các đoạn, để phần gán nhãn khớp với chính quy trình mà nó sẽ đi vào.

  2. 02

    Tìm ra các trường hợp biên

    Một mẫu nhỏ được gán nhãn để làm lộ ra những cấu trúc thực sự mơ hồ trong lĩnh vực của quý khách. Chúng trở thành các ví dụ cụ thể trong tài liệu hướng dẫn.

  3. 03

    Hiệu chỉnh và đo mức đồng thuận

    Các chuyên viên gán nhãn cùng một tập một cách độc lập. Mức đồng thuận được đo riêng cho ranh giới và cho nhãn, vì chúng hỏng vì những lý do khác nhau.

  4. 04

    Gán nhãn và phân xử

    Gán nhãn ở giai đoạn chính thức kèm một lượt thẩm định, cùng việc phân xử bằng văn bản cho các bất đồng, được đưa thẳng trở lại tài liệu hướng dẫn.

  5. 05

    Bàn giao kèm vị trí ký tự

    Dữ liệu được bàn giao kèm vị trí ký tự và định dạng thẻ quý khách chọn, phiên bản bảng phân loại nhãn, số lượng theo từng nhãn và báo cáo QA.

Bàn giao

Định dạng và cách biểu diễn

Vị trí ký tự luôn được kèm theo, dù quý khách nhận ở định dạng bề mặt nào, để dữ liệu có thể được tách từ lại mà không phải gán nhãn lại.

Các định dạng đầu ra thông dụng cho gán nhãn NLP tiếng Nhật.
Tác vụĐầu ra mặc địnhCũng có sẵn
Thực thể có tênJSONL kèm vị trí ký tựCoNLL-U, BIO / BILOU, brat standoff
Quan hệ và sự kiệnJSONL kèm tham chiếu tới các đoạnbrat standoff, JSON đồ thị tùy chỉnh
Phân loạiJSONL hoặc CSVma trận one-hot hoặc đa nhãn
Thái độJSONL kèm đoạn khía cạnhCSV, nhãn theo từng câu
NLI và độ tương đồngCặp dạng JSONLCSV, TSV theo bố cục bộ dữ liệu chuẩn

Chất lượng

Những khâu kiểm soát riêng cho công việc này

Một bộ dữ liệu gán nhãn đoạn có thể có độ chính xác nhãn xuất sắc mà ranh giới lại không dùng được. Chúng tôi đo cả hai.

  • Mức đồng thuận về ranh giới và mức đồng thuận về nhãn được báo cáo thành hai con số riêng.
  • Kiểm chứng tự động rằng không đoạn nào kết thúc ở giữa một token theo bộ phân tích đã thống nhất.
  • Số lượng theo từng nhãn được theo dõi ở mỗi lô, để một lớp hiếm đang thưa dần được phát hiện khi vẫn còn sửa được.
  • Các đoạn lồng nhau và chồng lấn được kiểm chứng theo đúng quy tắc lồng nhau của bảng phân loại chứ không được chấp nhận một cách máy móc.
  • Một bộ chuẩn do các thẩm định viên cấp cao gán nhãn và được chạy lại định kỳ để phát hiện trôi dạt trong một dự án dài.
  • Mọi bất đồng đã được phân xử đều được ghi ngược trở lại tài liệu hướng dẫn dưới dạng một ví dụ cụ thể.

FAQ

Về gán nhãn NLP tiếng Nhật

Những câu hỏi xuất hiện khi xác định phạm vi một dự án gán nhãn đoạn văn bản tiếng Nhật.

Bộ nào mà quy trình của quý khách đang dùng — MeCab với IPAdic hoặc UniDic, Sudachi, Juman++ hoặc một tokenizer cấp từ con lấy từ chính mô hình của quý khách. Chúng tôi chốt điều này khi khởi động dự án vì ranh giới đoạn chỉ căn khớp được với một cách tách từ, và chúng tôi lưu vị trí ký tự bên dưới để sau này việc đổi bộ phân tích chỉ là xuất lại dữ liệu chứ không phải gán nhãn lại.

Có, và chúng tôi thà dùng tập nhãn của quý khách còn hơn áp đặt của mình. Điều chúng tôi sẽ làm là thử sức nó trên một mẫu trước: các bảng phân loại sẵn có thường có hai đến ba nhóm mà trên thực tế lại chồng lấn nhau, và phát hiện điều đó trong giai đoạn thử nghiệm rẻ hơn rất nhiều so với phát hiện sau năm mươi nghìn mục.

Điều đó hoàn toàn phụ thuộc vào tác vụ. Các kiểu thực thể rõ ràng trên văn bản sạch đạt mức đồng thuận cao rất nhanh; thái độ theo khía cạnh và các bảng phân loại ý định chi li thì không, và một dự án khẳng định ngược lại thường đang đo một thứ dễ hơn thứ nó bàn giao. Chúng tôi báo cáo con số thực tế theo từng nhãn từ giai đoạn thử nghiệm, và nếu một nhóm nhãn không thể đạt mức đồng thuận dùng được, chúng tôi sẽ nói thẳng và đề xuất thay đổi nhóm đó.

Có, ở những chỗ bảng phân loại thực sự cần đến — danh từ ghép và tên tổ chức tiếng Nhật là lý do thường gặp. Quy tắc lồng nhau được viết vào tài liệu hướng dẫn và được kiểm chứng tự động, vì việc lồng nhau được cho phép mà không được quy định rõ là một nguồn gây thiếu nhất quán rất đáng tin cậy.

Có. Sửa đầu ra của mô hình là cách hiệu quả cho công việc khối lượng lớn, với cùng điểm lưu ý như ở mọi chỗ khác: các lượt sửa có xu hướng thừa hưởng luôn điểm mù của mô hình. Chúng tôi đo lượt sửa đó so với một mẫu gán nhãn từ đầu để quý khách biết nó thực sự bắt được những gì, còn với các bộ đánh giá thì chúng tôi gán nhãn từ đầu.

Văn bản & NLP

Hãy mang bảng phân loại nhãn tới. Chúng tôi sẽ tìm ra các trường hợp biên của nó.

Hãy gửi một tập nhãn và một mẫu văn bản tiếng Nhật thật. Chúng tôi gán nhãn một bộ thử nghiệm, báo cáo mức đồng thuận về ranh giới và về nhãn, rồi cho quý khách biết những nhóm nào sẽ không trụ được ở quy mô lớn.

Ký NDA trước khi quý khách chia sẻ bất kỳ dữ liệu nào. Xác định phạm vi thử nghiệm là miễn phí.