서비스

모든 모달리티를 아우르는 일본어 AI 학습 데이터

AI 시스템이 각 단계에서 필요로 하는 것을 다루는 다섯 가지 서비스 — 모델을 가르치는 인스트럭션 데이터부터, 그것이 실제로 작동했는지 알려 주는 휴먼 평가까지.

다섯 가지 모두 같은 토대 위에서 움직입니다. 일본 현지 어노테이터, 기억이 아니라 버전으로 관리되는 가이드라인, 그리고 주장하기 전에 측정하는 품질입니다.

하나의 팀, 데이터 라이프사이클 전체

대부분의 어노테이션 문제는 라벨링 문제가 아닙니다. 정의의 문제입니다. 합리적인 두 사람이 같은 가이드라인을 읽고 같은 일본어 문장에 다른 라벨을 붙이는데, 모델이 그 둘 모두로 학습될 때까지 아무도 알아채지 못합니다. 저희가 작업을 다섯 가지 서비스로 나눈 것은 그런 정의를 명시적으로 만들기 위해서입니다 — 서비스마다 고유한 분류 체계 질문과 고유한 실패 양상, 고유한 품질 검사가 있습니다.

이 서비스들은 골라야 하는 패키지가 아닙니다. 하나의 프로젝트가 세 가지를 함께 쓰는 일이 일상적입니다. 라벨링된 코퍼스를 만드는 NLP 어노테이션, 그것을 인스트럭션과 선호 쌍으로 바꾸는 LLM 학습 데이터, 그리고 그 결과 모델이 실제로 무엇을 하는지 측정하는 평가입니다. 그 모든 것의 밑바닥에서 변하지 않는 것은 일본어에 대한 판단력입니다.

한눈에 보기

모달리티
일본어 텍스트, 음성, 이미지, 영상, 문서, 멀티모달 데이터.
모델 단계
코퍼스 필터링, 지도 파인튜닝, 선호 및 RLHF 데이터, 평가와 벤치마킹.
납품 형식
JSONL, CSV, CoNLL-U, SRT, CTM, COCO — 또는 직접 정의하신 스키마.
작업 환경
고객사 어노테이션 플랫폼 안에서, 또는 저희 보안 환경에서 작업합니다.
시작점
범위를 정한 파일럿. 물량을 늘리기 전에 분류 체계와 품질을 먼저 검증합니다.

제공 범위

다섯 가지 서비스, 그리고 전문가 레이어

각각 별도의 페이지에서 분류 체계 관련 결정, 일본어 특유의 함정, 납품물을 구체적으로 설명합니다.

선택

어떤 서비스가 필요한가

모델의 무엇을 바꾸려 하시는지에서 출발하세요. 서비스는 마침 가지고 계신 파일 형식이 아니라 거기서 따라 나옵니다.

목표와 서비스를 짝지은 표. 대부분의 프로그램은 결국 두세 가지를 함께 씁니다.
목표가…해당 서비스통상적인 첫 납품물
자연스럽고 문체가 올바른 일본어로 답하도록 모델을 가르치는 것LLM 학습 데이터스타일 가이드가 확정된 인스트럭션–응답 쌍 파일럿 세트
출시 전에 모델이 어디서 틀리는지 알아내는 것LLM 평가루브릭과 평가자 간 일치도가 포함된 채점 완료 평가 세트
모델이 일본어 음성을 정확히 알아듣게 하는 것음성 · 오디오문서화된 정규화 규약과 함께 전사된 오디오
일본어 문서나 서식, 화면 텍스트를 읽는 것이미지 · 영상대표 문서 샘플에 대한 OCR 및 레이아웃 어노테이션
일본어 텍스트에서 구조화된 사실을 추출하는 것텍스트 · NLP실제 엣지 케이스로 검증한 개체 · 관계 스키마
규제 분야에서 전문가가 답변을 판정하게 하는 것전문가 어노테이션서면 판정 메모가 포함된 전문가 검수 평가 세트

라이프사이클

각 서비스의 위치

같은 데이터셋이 두 단계를 함께 감당하는 일은 드뭅니다. 모델을 가르치려고 만든 데이터는 모델을 시험하기에는 나쁩니다. 모델이 이미 본 데이터이기 때문입니다.

  1. 01

    코퍼스 준비

    원본 일본어 텍스트와 음성, 문서에 대한 필터링, 중복 제거 규칙, 품질 및 안전성 플래그. 애초에 무엇을 어노테이션할 가치가 있는지 정합니다.

  2. 02

    지도 파인튜닝

    제품이 실제로 쓰는 문체로 작성한 인스트럭션–응답 쌍, 멀티턴 대화, 과제 시연.

  3. 03

    선호와 얼라인먼트

    순위 또는 페어와이즈 비교, 안전성과 거절 행동, 그리고 어떤 답변이 다른 답변보다 나은 이유를 문서화한 기준.

  4. 04

    평가

    학습 데이터 구축에 참여하지 않은 사람들이 수행하는 홀드아웃 세트와 루브릭 채점 — 그래야 측정이 독립적입니다.

  5. 05

    운영 모니터링

    실서비스 모델 출력을 표집해 같은 루브릭으로 채점하고, 반복되는 실패를 다음 데이터 사이클로 되돌립니다.

납품

형식과 납품

모든 배치는 라벨링 기준이 된 분류 체계 버전과 직전 배치 대비 변경 이력을 함께 담고 나가므로, 버전이 달라져도 데이터셋을 비교할 수 있습니다.

일반적인 납품 형식. 맞춤 스키마는 킥오프에서 정의하고 데이터와 함께 버전 관리합니다.
데이터 유형통상 납품 형식추가 지원
텍스트와 NLPJSONLCSV, CoNLL-U, brat standoff, Parquet
LLM 인스트럭션과 선호JSONL (messages / chosen–rejected)CSV, Hugging Face 데이터셋 레이아웃
음성타이밍이 포함된 JSONSRT, VTT, CTM, TextGrid, 일반 전사본
이미지와 영상COCO JSONYOLO, Pascal VOC, CVAT XML, 프레임별 JSONL
문서와 OCR페이지 기하 정보가 포함된 JSONhOCR, ALTO, CSV 필드 추출
평가 결과JSONL 점수와 QA 리포트CSV, 채점 노트북, 판정 로그

FAQ

서비스에 대하여

파일럿의 범위를 정하기 전에 나오는 범위와 프로세스에 대한 질문들.

가능하며, 대부분의 프로그램이 그렇게 합니다. 전형적인 순서는 라벨링된 코퍼스를 만드는 NLP 어노테이션, 그것으로 구축하는 LLM 학습 데이터, 그다음 별도의 어노테이터 그룹이 수행하는 평가입니다. 하나의 계약 아래 묶으면 분류 체계와 스타일 가이드, QA 지표가 업체마다 다시 만들어지지 않고 일관되게 유지됩니다.

저희는 일본어를 위해 만들어진 팀이고, 일본어–영어 이중언어 작업도 그 안에 들어갑니다. 다른 언어의 대량 작업이라면 프로젝트를 수주해 재하청하기보다, 저희가 적합한 업체가 아니라고 솔직히 말씀드리는 편을 택합니다.

작업 단위당 — 건당, 오디오 시간당, 이미지당, 평가당 — 책정하며, 작업 난이도와 항목마다 필요한 검수자 시간, 요구되는 전문성 수준에 따라 달라집니다. 실제 데이터로 파일럿 범위를 산정한 뒤에 견적을 드립니다. 작업 설명만 보고 낸 견적은 추측이고, 대개 틀린 추측이기 때문입니다.

저희가 초안을 쓰고 고객사가 검토하며, 둘 다 프로덕션 전에 이루어집니다. 파일럿은 실제 엣지 케이스로 초안을 깨뜨리기 위해 존재하며, 그 과정에서 해소된 모든 이견은 문서에 다시 기록됩니다. 이후 가이드라인은 버전 관리되고, 납품되는 모든 배치는 어떤 버전을 기준으로 라벨링되었는지 기록합니다.

여기서 시작하세요

모델이 무엇을 배워야 하는지 알려 주세요.

작업 내용과 데이터 샘플, 그리고 지금 놓인 제약 조건을 보내 주세요. 저희는 범위를 정한 파일럿 계획과, 답을 받아야 할 분류 체계 관련 질문들, 그리고 무엇이 어려운지에 대한 솔직한 견해를 정리해 회신드립니다.

데이터를 공유하시기 전에 NDA를 체결합니다. 파일럿 범위 산정은 무료입니다.