Dịch vụ
Dữ liệu huấn luyện AI tiếng Nhật, trên mọi phương thức dữ liệu
Năm dịch vụ bao phủ những gì một hệ thống AI cần ở từng giai đoạn — từ dữ liệu chỉ dẫn dạy cho mô hình đến việc đánh giá bởi con người cho biết mô hình có thực sự hoạt động hay không.
Cả năm dịch vụ đều đứng trên cùng một nền tảng: chuyên viên gán nhãn tại Nhật, tài liệu hướng dẫn được quản lý phiên bản thay vì ghi nhớ, và chất lượng được đo lường trước khi được tuyên bố.
Một đội ngũ, trọn vòng đời dữ liệu
Phần lớn vấn đề của việc gán nhãn không phải là vấn đề gán nhãn. Đó là vấn đề định nghĩa: hai người đều có lý đọc cùng một tài liệu hướng dẫn rồi gán nhãn cùng một câu tiếng Nhật theo hai cách khác nhau, và không ai nhận ra cho đến khi mô hình đã được huấn luyện trên cả hai. Việc chia công việc thành năm dịch vụ là cách làm cho những định nghĩa đó trở nên tường minh — mỗi dịch vụ có các câu hỏi riêng về bảng phân loại nhãn, các kiểu lỗi riêng và các khâu kiểm tra chất lượng riêng.
Năm dịch vụ không phải là những gói mà quý khách buộc phải chọn một. Một dự án đơn lẻ thường dùng đến ba dịch vụ: gán nhãn NLP để dựng kho ngữ liệu đã gán nhãn, dữ liệu huấn luyện LLM để chuyển kho đó thành các cặp chỉ dẫn và cặp ưu tiên, và đánh giá để đo xem mô hình thu được thực sự làm được gì. Điều không đổi là phán đoán về tiếng Nhật nằm bên dưới tất cả.
Tổng quan nhanh
- Phương thức dữ liệu
- Dữ liệu tiếng Nhật dạng văn bản, giọng nói, hình ảnh, video, tài liệu và đa phương thức.
- Giai đoạn của mô hình
- Lọc kho ngữ liệu, tinh chỉnh có giám sát, dữ liệu ưu tiên và RLHF, đánh giá và đối sánh chuẩn.
- Định dạng bàn giao
- JSONL, CSV, CoNLL-U, SRT, CTM, COCO — hoặc một schema do quý khách định nghĩa.
- Công cụ
- Chúng tôi làm việc trong nền tảng gán nhãn của quý khách, hoặc trong môi trường bảo mật của riêng chúng tôi.
- Điểm khởi đầu
- Một dự án thử nghiệm có phạm vi rõ ràng. Bảng phân loại nhãn và chất lượng được kiểm chứng trước khi tăng khối lượng.
Chúng tôi làm gì
Năm dịch vụ, cộng thêm lớp chuyên gia
Mỗi dịch vụ có trang riêng, nêu rõ các quyết định về bảng phân loại nhãn, những cạm bẫy đặc thù của tiếng Nhật và sản phẩm bàn giao.
Dữ liệu LLM
Bộ dữ liệu chỉ dẫn, ưu tiên và RLHF viết bằng tiếng Nhật, với các quyết định về văn phong được nêu rõ ràng.
- Dữ liệu chỉ dẫn và SFT
- Dữ liệu ưu tiên và xếp hạng
- Hội thoại nhiều lượt
- Dữ liệu an toàn, từ chối và red team
Đánh giá LLM
Đánh giá đầu ra mô hình tiếng Nhật bởi con người — thang tiêu chí, so sánh cặp, tính xác thực và red teaming.
- So sánh cặp theo ưu tiên
- Chấm điểm theo thang tiêu chí
- Tính xác thực và mức dựng nền
- An toàn và red teaming
Giọng nói & âm thanh
Chuyển giọng nói tiếng Nhật cho ASR, phân tách người nói và gán nhãn ý định, với quy ước chuẩn hóa được viết thành văn bản.
- Gỡ băng
- Mốc thời gian và căn khớp
- Gán nhãn người nói
- Gán nhãn ý định và slot
Hình ảnh & video
Khung bao, phân vùng, OCR và bố cục tài liệu trên hình ảnh, video và giấy tờ tiếng Nhật.
- Phát hiện đối tượng và phân vùng
- Điểm khóa và thuộc tính
- Gán nhãn video
- OCR và bố cục tài liệu
Văn bản & NLP
Thực thể, quan hệ, ý định và thái độ trên văn bản tiếng Nhật, với ranh giới tách từ được quyết định rõ ràng chứ không mặc định.
- Nhận dạng thực thể có tên
- Trích xuất quan hệ và sự kiện
- Phân loại
- Thái độ và cảm xúc
Chuyên gia lĩnh vực
Gán nhãn và đánh giá cùng các chuyên gia lĩnh vực tại Nhật, dành cho AI hoạt động trong những lĩnh vực chịu quản lý chặt chẽ.
- Luật sư
- Kế toán viên thuế
- Kế toán viên công chứng
- Chuyên gia lao động & bảo hiểm xã hội
Lựa chọn
Tôi cần dịch vụ nào?
Hãy bắt đầu từ điều quý khách muốn thay đổi ở mô hình. Dịch vụ sẽ theo sau điều đó, chứ không theo loại tệp mà quý khách tình cờ đang có.
| Nếu mục tiêu của quý khách là… | Dịch vụ tương ứng | Sản phẩm bàn giao đầu tiên |
|---|---|---|
| Dạy mô hình trả lời bằng tiếng Nhật tự nhiên, đúng mức độ trang trọng | Dữ liệu huấn luyện LLM | Một bộ cặp chỉ dẫn – câu trả lời thử nghiệm kèm bộ quy tắc văn phong đã chốt |
| Tìm ra chỗ mô hình sai trước khi đưa vào sử dụng | Đánh giá LLM | Một bộ đánh giá đã chấm điểm kèm thang tiêu chí và mức đồng thuận giữa các thẩm định viên |
| Giúp mô hình nghe chính xác tiếng Nhật nói | Giọng nói & âm thanh | Âm thanh đã chuyển thành văn bản kèm quy ước chuẩn hóa được viết thành văn bản |
| Đọc tài liệu, biểu mẫu hoặc văn bản trên màn hình bằng tiếng Nhật | Hình ảnh & video | Gán nhãn OCR và bố cục trên một mẫu tài liệu có tính đại diện |
| Trích xuất thông tin có cấu trúc từ văn bản tiếng Nhật | Văn bản & NLP | Một schema thực thể và quan hệ đã được kiểm nghiệm trên các trường hợp biên thực tế |
| Để chuyên gia đánh giá câu trả lời trong một lĩnh vực chịu quản lý chặt chẽ | Gán nhãn bởi chuyên gia | Một bộ đánh giá được chuyên gia thẩm định kèm ghi chú phân xử bằng văn bản |
Vòng đời
Vị trí của từng dịch vụ
Cùng một bộ dữ liệu hiếm khi phục vụ được hai giai đoạn. Dữ liệu dựng ra để dạy mô hình là một phép thử tồi đối với chính mô hình đó, vì mô hình đã nhìn thấy nó rồi.
-
01
Chuẩn bị kho ngữ liệu
Lọc, quy tắc khử trùng lặp, cờ đánh dấu chất lượng và an toàn trên văn bản, giọng nói hoặc tài liệu tiếng Nhật thô. Quyết định phần nào đáng để gán nhãn.
-
02
Tinh chỉnh có giám sát
Các cặp chỉ dẫn – câu trả lời, hội thoại nhiều lượt và các ví dụ minh họa tác vụ, viết đúng văn phong mà sản phẩm thực sự dùng.
-
03
Ưu tiên và căn chỉnh
So sánh xếp hạng hoặc so sánh theo cặp, hành vi về an toàn và từ chối, cùng các tiêu chí viết rõ ràng làm cho câu trả lời này tốt hơn câu trả lời kia.
-
04
Đánh giá
Các bộ dữ liệu giữ riêng và việc chấm điểm theo thang tiêu chí do những người không tham gia xây dựng dữ liệu huấn luyện thực hiện, để phép đo được độc lập.
-
05
Giám sát khi vận hành
Lấy mẫu đầu ra thực tế của mô hình, chấm điểm theo cùng thang tiêu chí, rồi đưa các lỗi lặp lại trở lại chu kỳ dữ liệu tiếp theo.
Bàn giao
Định dạng và bàn giao
Mỗi lô bàn giao đều kèm phiên bản bảng phân loại nhãn được dùng khi gán nhãn và nhật ký thay đổi so với lô trước, để các bộ dữ liệu vẫn so sánh được giữa các phiên bản.
| Loại dữ liệu | Bàn giao thường dùng | Cũng có sẵn |
|---|---|---|
| Văn bản và NLP | JSONL | CSV, CoNLL-U, brat standoff, Parquet |
| Chỉ dẫn và ưu tiên cho LLM | JSONL (messages / chosen–rejected) | CSV, bố cục dataset Hugging Face |
| Giọng nói | JSON kèm mốc thời gian | SRT, VTT, CTM, TextGrid, bản ghi thuần văn bản |
| Hình ảnh và video | COCO JSON | YOLO, Pascal VOC, CVAT XML, JSONL theo từng khung hình |
| Tài liệu và OCR | JSON kèm tọa độ trang | hOCR, ALTO, CSV trích xuất trường dữ liệu |
| Kết quả đánh giá | Điểm số dạng JSONL kèm báo cáo QA | CSV, notebook chấm điểm, nhật ký phân xử |
FAQ
Về các dịch vụ
Những câu hỏi về phạm vi và quy trình thường xuất hiện trước khi xác định một dự án thử nghiệm.
Có, và phần lớn chương trình đều làm vậy. Một trình tự điển hình là gán nhãn NLP để dựng kho ngữ liệu đã gán nhãn, xây dựng dữ liệu huấn luyện LLM từ đó, rồi cho một nhóm chuyên viên gán nhãn khác thực hiện đánh giá. Gộp chúng trong một hợp tác duy nhất giúp bảng phân loại nhãn, bộ quy tắc văn phong và các chỉ số QA giữ được sự nhất quán thay vì phải dựng lại từ đầu với từng nhà cung cấp.
Tiếng Nhật là thứ chúng tôi được xây dựng để làm, và công việc song ngữ Nhật – Anh nằm gọn bên trong đó. Với công việc khối lượng lớn ở các ngôn ngữ khác, chúng tôi thà nói thẳng rằng mình không phải nhà cung cấp phù hợp còn hơn nhận dự án rồi thuê ngoài.
Giá được tính theo đơn vị công việc — theo mục, theo giờ âm thanh, theo ảnh hoặc theo lượt đánh giá — và phụ thuộc vào độ phức tạp của tác vụ, thời gian thẩm định mà mỗi mục cần và mức độ chuyên môn yêu cầu. Chúng tôi báo giá sau khi xác định phạm vi một dự án thử nghiệm trên dữ liệu thật của quý khách, vì một báo giá dựa trên mô tả tác vụ chỉ là phỏng đoán và thường là phỏng đoán sai.
Chúng tôi soạn thảo, quý khách thẩm định, và cả hai việc đều diễn ra trước khi triển khai chính thức. Dự án thử nghiệm tồn tại để làm vỡ bản thảo đầu tiên trên các trường hợp biên thực tế; mọi bất đồng được giải quyết trong giai đoạn đó đều được ghi ngược trở lại tài liệu. Sau đó tài liệu hướng dẫn được quản lý phiên bản, và mỗi lô bàn giao đều ghi lại nó được gán nhãn theo phiên bản nào.
Bắt đầu tại đây
Hãy cho chúng tôi biết mô hình cần học điều gì.
Hãy gửi tác vụ, một mẫu dữ liệu và những ràng buộc mà quý khách đang có. Chúng tôi sẽ phản hồi bằng một kế hoạch thử nghiệm có phạm vi cụ thể, những câu hỏi về bảng phân loại nhãn cần được trả lời, và một góc nhìn thẳng thắn về những gì khó ở đây.
Ký NDA trước khi quý khách chia sẻ bất kỳ dữ liệu nào. Xác định phạm vi thử nghiệm là miễn phí.