검출과 세그멘테이션
프로덕션 전에 합의한 클래스 분류 체계에 따른 바운딩 박스, 회전 박스, 폴리곤, 픽셀 단위 마스크.
- 2D 및 회전 바운딩 박스
- 폴리곤 및 인스턴스 세그멘테이션
- 시맨틱 세그멘테이션
- 가림과 잘림 플래그
비전 · 멀티모달
바운딩 박스, 폴리곤, 세그멘테이션, 키포인트, 영상 트래킹, OCR, 문서 레이아웃 — 화면 속 텍스트가 일본어이고 문서가 일본 비즈니스 관행을 따르는 데이터를 다룹니다.
대부분의 비전 어노테이션은 언어와 무관합니다. 화면 안에 텍스트가 들어오는 순간, 또는 지면에 일본식 서식이 놓이는 순간, 아주 빠르게 언어와 무관하지 않게 됩니다.
자동차에 박스를 치는 일은 어느 나라에서나 같은 작업입니다. 일본 영수증의 텍스트를 읽는 일은 그렇지 않습니다. 일본 문서는 가로만큼이나 세로로 흐르고, 한 줄 안에서 네 가지 문자를 섞으며, 전각 로마자와 전각 숫자를 쓰고, 단어 위에 읽기를 다는 후리가나를 달고, 서양식 서식이 서명을 기대하는 자리에 도장을 찍습니다.
문서 AI 프로젝트는 모델이 아니라 이런 세부에서 실패합니다. 세로 열을 다섯 개의 별개 줄로 처리하는 레이아웃 어노테이션이나, 전각 숫자를 조용히 반각으로 바꿔 버리는 OCR 전사는, 의도하신 것과 다른 무언가를 모델에게 가르치는 학습 데이터를 만들어 냅니다.
간판이나 야외 텍스트도 마찬가지입니다. 상점 간판, 제품 포장, 메뉴, 역 안내판은 일반적인 어노테이션 가이드라인이 아예 다루지 않는 일본어 타이포그래피로 가득합니다.
한눈에 보기
작업 유형
기하 정보와 범주, 텍스트는 별개의 레이어이며 별개로 검수합니다.
프로덕션 전에 합의한 클래스 분류 체계에 따른 바운딩 박스, 회전 박스, 폴리곤, 픽셀 단위 마스크.
자세, 제품 상태, 등급 판정 등 세밀한 작업을 위한 랜드마크 배치와 객체별 속성.
프레임 간에 동일성이 유지되는 객체 트래킹과, 행동 및 이벤트의 시간 구간 분할.
일본 비즈니스 문서의 텍스트 영역 검출, 읽기 순서, 전사, 구조적 역할 부여.
문서를 구조화된 값으로 바꾸는 작업 — 어떤 텍스트가 합계인지, 어떤 날짜가 발행일인지, 어떤 품목들이 한 줄에 속하는지.
일본어 특유의 문제
일본어 이미지 · 문서 데이터에서 반복되는 네 가지 실패 지점.
일본어는 왼쪽에서 오른쪽뿐 아니라 위에서 아래로, 오른쪽에서 왼쪽으로도 흐르며, 한 지면에서 두 방향이 섞이는 경우가 많습니다. 가로 행을 전제한 툴은 확신에 찬 틀린 읽기 순서를 만들어 냅니다.
대응 방식 읽기 순서는 기하 정보에서 추론하지 않고 명시적으로 어노테이션하며, 방향이 혼재된 지면과 루비 텍스트, 다단 레이아웃에 대한 규칙을 둡니다.
한자 단어 위나 옆에 작게 인쇄된 가나는 추가 내용이 아니라 발음 주석입니다. 본문에 섞어 전사하면 텍스트가 오염되고, 무작정 버리면 필요할 수 있는 정보를 잃습니다.
대응 방식 루비는 기반 텍스트에 연결된 어노테이션으로 담아, 이후 단계에서 재어노테이션 없이 유지하거나 제거하거나 읽기 라벨로 쓸 수 있게 합니다.
A123과 A123은 거의 똑같아 보이지만 다른 문자입니다. 여기서 정규화를 통제하지 않는 것이 일본어 OCR 데이터셋에서 가장 흔한 조용한 결함 중 하나입니다.
대응 방식 전사 규약이 어떤 문자를 정규화하고 어떤 문자를 보존하는지 정확히 명시하며, 납품 전 자동 검사로 이를 강제합니다.
일본의 청구서와 영수증, 신청서에는 고유한 구조적 어휘가 있습니다 — 御中, 但し書き, 회사 도장, 연호 기반 날짜, 나란히 놓인 세금 포함 · 세금 제외 합계.
대응 방식 필드 스키마는 고객사 문서 유형의 실제 사례를 놓고 구성하며, 연호 날짜와 도장 영역, 세금 처리를 자유 텍스트가 아니라 독립된 필드로 정의합니다.
프로세스
분류 체계와 기하 규칙은 대량 어노테이션 이전에 실제 샘플로 확정합니다.
대표성 있는 소규모 세트를 어노테이션해 모호한 사례를 찾습니다 — 무엇을 객체 하나로 볼지, 프레임 가장자리에서는 어떻게 할지, 클래스가 정말로 불분명한 경우는 언제인지.
박스의 밀착 정도, 가림 처리, 최소 객체 크기, 잘림, 군집 객체, 판독 불가 텍스트의 처리를 모두 문서로 확정합니다.
여러 어노테이터가 같은 이미지를 독립적으로 라벨링합니다. 기하 일치도를 측정하고, 낮은 곳이 규칙이 모호했던 곳입니다.
기하 정보와 라벨을 별개의 검수 단계로 봅니다. 잘못된 클래스에 밀착한 박스와 올바른 클래스에 헐거운 박스는 서로 다른 결함이기 때문입니다.
어노테이션은 요청하신 형식으로, 분류 체계 버전과 클래스별 건수, 해당 배치의 QA 리포트와 함께 납품합니다.
납품
변환기를 직접 만드시게 하는 대신, 고객사 학습 파이프라인의 기본 형식으로 내보냅니다.
| 작업 | 기본 출력 | 추가 지원 |
|---|---|---|
| 검출과 세그멘테이션 | COCO JSON | YOLO, Pascal VOC, CVAT XML, PNG 마스크 |
| 키포인트와 속성 | COCO keypoints JSON | CSV, 맞춤 JSON 스키마 |
| 영상 트래킹 | MOT 형식 | 프레임별 COCO, CVAT XML |
| OCR과 레이아웃 | 페이지 기하 정보가 포함된 JSON | hOCR, ALTO, PAGE XML |
| 필드 추출 | JSONL, 문서 한 건당 한 줄 | CSV, 고객사 문서 AI 스키마 |
품질
비전 결함은 잘 숨습니다. 아래 검사는 학습이 그것을 드러내기 전에 먼저 드러내는 장치입니다.
FAQ
일본어 비전 및 문서 AI 작업에서 자주 나오는 질문들.
가능합니다 — 서식 기입란, 주소, 이름, 자유 기술 코멘트를 다룹니다. 손글씨는 인쇄물보다 느리고 모호한 비율이 실제로 더 높으므로, 추측하는 대신 불확실한 글자를 표시하고, 판독할 수 없는 필드를 추정해서라도 전사할지 판독 불가로 표시할지 사전에 합의합니다. 그 결정이 원시 정확도 수치보다 모델에 더 중요합니다.
가능합니다. CVAT, Label Studio, SageMaker Ground Truth, Labelbox와 사내 툴을 포함해 고객사가 제공하는 플랫폼 안에서 작업하며, 계정 발급을 원하지 않으시면 저희 보안 환경에서 진행합니다. 어느 쪽을 쓰든 가이드라인이나 검수 절차는 달라지지 않습니다.
가능하며, 대량 검출 작업에서는 합리적인 접근인 경우가 많습니다. 위험은 수정 작업이 모델의 사각지대를 그대로 물려받는다는 점이므로, 저희는 수정 작업을 처음부터 작업한 샘플과 비교 측정해 실제로 무엇을 잡아내고 있는지 알려 드립니다. 일본어 문서 OCR에 대해서는 더 조심스럽습니다. 전각 문자와 세로쓰기에서 나는 모델 오류는 화면에서 지나치기 쉽기 때문입니다.
NDA와 데이터 처리 계약 아래, 격리된 환경에서, 해당 프로젝트 인원으로 접근을 제한해 처리합니다. 마스킹을 위해 개인정보를 어노테이션할 수도 있고, 보내시기 전에 마스킹한 자료만 다룰 수도 있습니다. 보관과 삭제 조건은 정책에 맡기지 않고 계약서에 명시합니다.
일본 문서는 2024가 아니라 令和6年처럼 연호 연도를 흔히 쓰고, 같은 지면에 둘을 섞는 경우도 많습니다. 저희는 연호 날짜를 원문 문자열을 보존한 독립된 필드로 다루고, 원하시면 서기로 정규화한 값을 함께 담습니다. 그러면 변환 과정에서 정보가 사라지지도, 변환 오류가 데이터에 굳어지지도 않습니다.