서비스
모든 모달리티를 아우르는 일본어 AI 학습 데이터
AI 시스템이 각 단계에서 필요로 하는 것을 다루는 다섯 가지 서비스 — 모델을 가르치는 인스트럭션 데이터부터, 그것이 실제로 작동했는지 알려 주는 휴먼 평가까지.
다섯 가지 모두 같은 토대 위에서 움직입니다. 일본 현지 어노테이터, 기억이 아니라 버전으로 관리되는 가이드라인, 그리고 주장하기 전에 측정하는 품질입니다.
하나의 팀, 데이터 라이프사이클 전체
대부분의 어노테이션 문제는 라벨링 문제가 아닙니다. 정의의 문제입니다. 합리적인 두 사람이 같은 가이드라인을 읽고 같은 일본어 문장에 다른 라벨을 붙이는데, 모델이 그 둘 모두로 학습될 때까지 아무도 알아채지 못합니다. 저희가 작업을 다섯 가지 서비스로 나눈 것은 그런 정의를 명시적으로 만들기 위해서입니다 — 서비스마다 고유한 분류 체계 질문과 고유한 실패 양상, 고유한 품질 검사가 있습니다.
이 서비스들은 골라야 하는 패키지가 아닙니다. 하나의 프로젝트가 세 가지를 함께 쓰는 일이 일상적입니다. 라벨링된 코퍼스를 만드는 NLP 어노테이션, 그것을 인스트럭션과 선호 쌍으로 바꾸는 LLM 학습 데이터, 그리고 그 결과 모델이 실제로 무엇을 하는지 측정하는 평가입니다. 그 모든 것의 밑바닥에서 변하지 않는 것은 일본어에 대한 판단력입니다.
한눈에 보기
- 모달리티
- 일본어 텍스트, 음성, 이미지, 영상, 문서, 멀티모달 데이터.
- 모델 단계
- 코퍼스 필터링, 지도 파인튜닝, 선호 및 RLHF 데이터, 평가와 벤치마킹.
- 납품 형식
- JSONL, CSV, CoNLL-U, SRT, CTM, COCO — 또는 직접 정의하신 스키마.
- 작업 환경
- 고객사 어노테이션 플랫폼 안에서, 또는 저희 보안 환경에서 작업합니다.
- 시작점
- 범위를 정한 파일럿. 물량을 늘리기 전에 분류 체계와 품질을 먼저 검증합니다.
제공 범위
다섯 가지 서비스, 그리고 전문가 레이어
각각 별도의 페이지에서 분류 체계 관련 결정, 일본어 특유의 함정, 납품물을 구체적으로 설명합니다.
LLM 학습 데이터
일본어로 작성하는 인스트럭션 · 선호 · RLHF 데이터셋 — 문체에 관한 결정을 명시적으로 내리고 시작합니다.
- 인스트럭션 · SFT 데이터
- 선호 · 순위 데이터
- 멀티턴 대화
- 안전성 · 거절 · 레드팀 데이터
LLM 평가
일본어 모델 출력에 대한 휴먼 평가 — 루브릭, 페어와이즈 선호, 사실성, 레드팀.
- 페어와이즈 선호
- 루브릭 채점
- 사실성과 근거성
- 안전성과 레드팀
음성 · 오디오
일본어 ASR 전사와 화자 분리, 의도 라벨링 — 정규화 규약을 문서로 정해 두고 진행합니다.
- 전사
- 타이밍과 정렬
- 화자 라벨링
- 의도와 슬롯 라벨링
이미지 · 영상
일본어 이미지와 영상, 서류에 대한 바운딩 박스, 세그멘테이션, OCR, 문서 레이아웃 어노테이션.
- 검출과 세그멘테이션
- 키포인트와 속성
- 영상 어노테이션
- OCR과 문서 레이아웃
텍스트 · NLP
일본어 텍스트의 개체와 관계, 의도, 감성 — 토크나이저 경계를 가정하지 않고 결정합니다.
- 개체명 인식
- 관계 및 이벤트 추출
- 분류
- 감성과 감정
전문가 어노테이션
규제 분야에서 작동하는 AI를 위한, 일본 도메인 전문가와 함께하는 어노테이션과 평가.
- 변호사
- 세무사
- 공인회계사
- 노무 · 사회보험 전문가
선택
어떤 서비스가 필요한가
모델의 무엇을 바꾸려 하시는지에서 출발하세요. 서비스는 마침 가지고 계신 파일 형식이 아니라 거기서 따라 나옵니다.
| 목표가… | 해당 서비스 | 통상적인 첫 납품물 |
|---|---|---|
| 자연스럽고 문체가 올바른 일본어로 답하도록 모델을 가르치는 것 | LLM 학습 데이터 | 스타일 가이드가 확정된 인스트럭션–응답 쌍 파일럿 세트 |
| 출시 전에 모델이 어디서 틀리는지 알아내는 것 | LLM 평가 | 루브릭과 평가자 간 일치도가 포함된 채점 완료 평가 세트 |
| 모델이 일본어 음성을 정확히 알아듣게 하는 것 | 음성 · 오디오 | 문서화된 정규화 규약과 함께 전사된 오디오 |
| 일본어 문서나 서식, 화면 텍스트를 읽는 것 | 이미지 · 영상 | 대표 문서 샘플에 대한 OCR 및 레이아웃 어노테이션 |
| 일본어 텍스트에서 구조화된 사실을 추출하는 것 | 텍스트 · NLP | 실제 엣지 케이스로 검증한 개체 · 관계 스키마 |
| 규제 분야에서 전문가가 답변을 판정하게 하는 것 | 전문가 어노테이션 | 서면 판정 메모가 포함된 전문가 검수 평가 세트 |
라이프사이클
각 서비스의 위치
같은 데이터셋이 두 단계를 함께 감당하는 일은 드뭅니다. 모델을 가르치려고 만든 데이터는 모델을 시험하기에는 나쁩니다. 모델이 이미 본 데이터이기 때문입니다.
-
01
코퍼스 준비
원본 일본어 텍스트와 음성, 문서에 대한 필터링, 중복 제거 규칙, 품질 및 안전성 플래그. 애초에 무엇을 어노테이션할 가치가 있는지 정합니다.
-
02
지도 파인튜닝
제품이 실제로 쓰는 문체로 작성한 인스트럭션–응답 쌍, 멀티턴 대화, 과제 시연.
-
03
선호와 얼라인먼트
순위 또는 페어와이즈 비교, 안전성과 거절 행동, 그리고 어떤 답변이 다른 답변보다 나은 이유를 문서화한 기준.
-
04
평가
학습 데이터 구축에 참여하지 않은 사람들이 수행하는 홀드아웃 세트와 루브릭 채점 — 그래야 측정이 독립적입니다.
-
05
운영 모니터링
실서비스 모델 출력을 표집해 같은 루브릭으로 채점하고, 반복되는 실패를 다음 데이터 사이클로 되돌립니다.
납품
형식과 납품
모든 배치는 라벨링 기준이 된 분류 체계 버전과 직전 배치 대비 변경 이력을 함께 담고 나가므로, 버전이 달라져도 데이터셋을 비교할 수 있습니다.
| 데이터 유형 | 통상 납품 형식 | 추가 지원 |
|---|---|---|
| 텍스트와 NLP | JSONL | CSV, CoNLL-U, brat standoff, Parquet |
| LLM 인스트럭션과 선호 | JSONL (messages / chosen–rejected) | CSV, Hugging Face 데이터셋 레이아웃 |
| 음성 | 타이밍이 포함된 JSON | SRT, VTT, CTM, TextGrid, 일반 전사본 |
| 이미지와 영상 | COCO JSON | YOLO, Pascal VOC, CVAT XML, 프레임별 JSONL |
| 문서와 OCR | 페이지 기하 정보가 포함된 JSON | hOCR, ALTO, CSV 필드 추출 |
| 평가 결과 | JSONL 점수와 QA 리포트 | CSV, 채점 노트북, 판정 로그 |
FAQ
서비스에 대하여
파일럿의 범위를 정하기 전에 나오는 범위와 프로세스에 대한 질문들.
가능하며, 대부분의 프로그램이 그렇게 합니다. 전형적인 순서는 라벨링된 코퍼스를 만드는 NLP 어노테이션, 그것으로 구축하는 LLM 학습 데이터, 그다음 별도의 어노테이터 그룹이 수행하는 평가입니다. 하나의 계약 아래 묶으면 분류 체계와 스타일 가이드, QA 지표가 업체마다 다시 만들어지지 않고 일관되게 유지됩니다.
저희는 일본어를 위해 만들어진 팀이고, 일본어–영어 이중언어 작업도 그 안에 들어갑니다. 다른 언어의 대량 작업이라면 프로젝트를 수주해 재하청하기보다, 저희가 적합한 업체가 아니라고 솔직히 말씀드리는 편을 택합니다.
작업 단위당 — 건당, 오디오 시간당, 이미지당, 평가당 — 책정하며, 작업 난이도와 항목마다 필요한 검수자 시간, 요구되는 전문성 수준에 따라 달라집니다. 실제 데이터로 파일럿 범위를 산정한 뒤에 견적을 드립니다. 작업 설명만 보고 낸 견적은 추측이고, 대개 틀린 추측이기 때문입니다.
저희가 초안을 쓰고 고객사가 검토하며, 둘 다 프로덕션 전에 이루어집니다. 파일럿은 실제 엣지 케이스로 초안을 깨뜨리기 위해 존재하며, 그 과정에서 해소된 모든 이견은 문서에 다시 기록됩니다. 이후 가이드라인은 버전 관리되고, 납품되는 모든 배치는 어떤 버전을 기준으로 라벨링되었는지 기록합니다.