비전 · 멀티모달

일본어 이미지 · 영상 · 문서 어노테이션

바운딩 박스, 폴리곤, 세그멘테이션, 키포인트, 영상 트래킹, OCR, 문서 레이아웃 — 화면 속 텍스트가 일본어이고 문서가 일본 비즈니스 관행을 따르는 데이터를 다룹니다.

대부분의 비전 어노테이션은 언어와 무관합니다. 화면 안에 텍스트가 들어오는 순간, 또는 지면에 일본식 서식이 놓이는 순간, 아주 빠르게 언어와 무관하지 않게 됩니다.

일본어 비전 데이터가 달라지는 지점

자동차에 박스를 치는 일은 어느 나라에서나 같은 작업입니다. 일본 영수증의 텍스트를 읽는 일은 그렇지 않습니다. 일본 문서는 가로만큼이나 세로로 흐르고, 한 줄 안에서 네 가지 문자를 섞으며, 전각 로마자와 전각 숫자를 쓰고, 단어 위에 읽기를 다는 후리가나를 달고, 서양식 서식이 서명을 기대하는 자리에 도장을 찍습니다.

문서 AI 프로젝트는 모델이 아니라 이런 세부에서 실패합니다. 세로 열을 다섯 개의 별개 줄로 처리하는 레이아웃 어노테이션이나, 전각 숫자를 조용히 반각으로 바꿔 버리는 OCR 전사는, 의도하신 것과 다른 무언가를 모델에게 가르치는 학습 데이터를 만들어 냅니다.

간판이나 야외 텍스트도 마찬가지입니다. 상점 간판, 제품 포장, 메뉴, 역 안내판은 일반적인 어노테이션 가이드라인이 아예 다루지 않는 일본어 타이포그래피로 가득합니다.

한눈에 보기

작업 유형
검출, 세그멘테이션, 키포인트, 분류, 영상 트래킹, OCR 전사, 문서 레이아웃, 필드 추출.
문서 작업
청구서, 영수증, 발주서, 계약서, 신청 서식, 손글씨 기입란, 세로쓰기 자료.
일본어 처리
세로쓰기, 후리가나, 혼합 표기, 전각 문자, 일본식 서식 관행.
기본 출력
COCO JSON. YOLO, Pascal VOC, CVAT XML, hOCR, ALTO도 지원합니다.
검수
기하 정보와 라벨을 따로 검수합니다. 서로 다른 방식으로 어긋나기 때문입니다.

작업 유형

어노테이션 범위

기하 정보와 범주, 텍스트는 별개의 레이어이며 별개로 검수합니다.

검출과 세그멘테이션

프로덕션 전에 합의한 클래스 분류 체계에 따른 바운딩 박스, 회전 박스, 폴리곤, 픽셀 단위 마스크.

  • 2D 및 회전 바운딩 박스
  • 폴리곤 및 인스턴스 세그멘테이션
  • 시맨틱 세그멘테이션
  • 가림과 잘림 플래그

키포인트와 속성

자세, 제품 상태, 등급 판정 등 세밀한 작업을 위한 랜드마크 배치와 객체별 속성.

  • 스켈레톤 및 랜드마크 키포인트
  • 객체별 속성 집합
  • 세분화 분류
  • 포인트별 가시성 플래그

영상 어노테이션

프레임 간에 동일성이 유지되는 객체 트래킹과, 행동 및 이벤트의 시간 구간 분할.

  • 다중 객체 트래킹 ID
  • 행동 및 이벤트 구간
  • 프레임 보간 결과 검수
  • 가림 이후 재식별

OCR과 문서 레이아웃

일본 비즈니스 문서의 텍스트 영역 검출, 읽기 순서, 전사, 구조적 역할 부여.

  • 텍스트 행 및 영역 검출
  • 세로 및 혼합 레이아웃의 읽기 순서
  • 정규화 규칙에 따른 전사
  • 표, 머리말, 도장 영역

필드 및 관계 추출

문서를 구조화된 값으로 바꾸는 작업 — 어떤 텍스트가 합계인지, 어떤 날짜가 발행일인지, 어떤 품목들이 한 줄에 속하는지.

  • 키–값 필드 태깅
  • 표 안의 품목 행 묶기
  • 페이지 간 관계
  • 신뢰도 및 모호성 플래그

일본어 특유의 문제

일반적인 비전 가이드라인이 놓치는 것

일본어 이미지 · 문서 데이터에서 반복되는 네 가지 실패 지점.

세로쓰기와 읽기 순서

일본어는 왼쪽에서 오른쪽뿐 아니라 위에서 아래로, 오른쪽에서 왼쪽으로도 흐르며, 한 지면에서 두 방향이 섞이는 경우가 많습니다. 가로 행을 전제한 툴은 확신에 찬 틀린 읽기 순서를 만들어 냅니다.

대응 방식 읽기 순서는 기하 정보에서 추론하지 않고 명시적으로 어노테이션하며, 방향이 혼재된 지면과 루비 텍스트, 다단 레이아웃에 대한 규칙을 둡니다.

후리가나와 루비 텍스트

한자 단어 위나 옆에 작게 인쇄된 가나는 추가 내용이 아니라 발음 주석입니다. 본문에 섞어 전사하면 텍스트가 오염되고, 무작정 버리면 필요할 수 있는 정보를 잃습니다.

대응 방식 루비는 기반 텍스트에 연결된 어노테이션으로 담아, 이후 단계에서 재어노테이션 없이 유지하거나 제거하거나 읽기 라벨로 쓸 수 있게 합니다.

전각과 반각 문자

A123과 A123은 거의 똑같아 보이지만 다른 문자입니다. 여기서 정규화를 통제하지 않는 것이 일본어 OCR 데이터셋에서 가장 흔한 조용한 결함 중 하나입니다.

대응 방식 전사 규약이 어떤 문자를 정규화하고 어떤 문자를 보존하는지 정확히 명시하며, 납품 전 자동 검사로 이를 강제합니다.

일본식 서식 관행

일본의 청구서와 영수증, 신청서에는 고유한 구조적 어휘가 있습니다 — 御中, 但し書き, 회사 도장, 연호 기반 날짜, 나란히 놓인 세금 포함 · 세금 제외 합계.

대응 방식 필드 스키마는 고객사 문서 유형의 실제 사례를 놓고 구성하며, 연호 날짜와 도장 영역, 세금 처리를 자유 텍스트가 아니라 독립된 필드로 정의합니다.

프로세스

비전 프로젝트의 진행 방식

분류 체계와 기하 규칙은 대량 어노테이션 이전에 실제 샘플로 확정합니다.

  1. 01

    샘플링과 분류 체계 정의

    대표성 있는 소규모 세트를 어노테이션해 모호한 사례를 찾습니다 — 무엇을 객체 하나로 볼지, 프레임 가장자리에서는 어떻게 할지, 클래스가 정말로 불분명한 경우는 언제인지.

  2. 02

    기하 규칙 작성

    박스의 밀착 정도, 가림 처리, 최소 객체 크기, 잘림, 군집 객체, 판독 불가 텍스트의 처리를 모두 문서로 확정합니다.

  3. 03

    캘리브레이션

    여러 어노테이터가 같은 이미지를 독립적으로 라벨링합니다. 기하 일치도를 측정하고, 낮은 곳이 규칙이 모호했던 곳입니다.

  4. 04

    어노테이션과 검수

    기하 정보와 라벨을 별개의 검수 단계로 봅니다. 잘못된 클래스에 밀착한 박스와 올바른 클래스에 헐거운 박스는 서로 다른 결함이기 때문입니다.

  5. 05

    납품과 보고

    어노테이션은 요청하신 형식으로, 분류 체계 버전과 클래스별 건수, 해당 배치의 QA 리포트와 함께 납품합니다.

납품

입력과 출력 형식

변환기를 직접 만드시게 하는 대신, 고객사 학습 파이프라인의 기본 형식으로 내보냅니다.

이미지 · 영상 · 문서 작업의 일반적인 출력 형식.
작업기본 출력추가 지원
검출과 세그멘테이션COCO JSONYOLO, Pascal VOC, CVAT XML, PNG 마스크
키포인트와 속성COCO keypoints JSONCSV, 맞춤 JSON 스키마
영상 트래킹MOT 형식프레임별 COCO, CVAT XML
OCR과 레이아웃페이지 기하 정보가 포함된 JSONhOCR, ALTO, PAGE XML
필드 추출JSONL, 문서 한 건당 한 줄CSV, 고객사 문서 AI 스키마

품질

이 작업에 특화된 관리 항목

비전 결함은 잘 숨습니다. 아래 검사는 학습이 그것을 드러내기 전에 먼저 드러내는 장치입니다.

  • 다시 어노테이션한 샘플로 기하 일치도를 측정하고, 라벨 일치도와 분리해 보고합니다.
  • 퇴화된 박스, 겹치는 중복 박스, 이미지 경계를 벗어난 객체를 자동으로 검사합니다.
  • 읽기 순서와 루비 연결은 표본이 아니라 모든 문서 페이지에서 검증합니다.
  • 전각 · 반각 정규화를 문서화된 규약에 따라 자동으로 강제합니다.
  • 트래킹 ID를 클립 전체에 걸쳐 점검해, 가림 이후 동일성이 뒤바뀌는 경우를 잡아냅니다.
  • 클래스별 건수를 배치마다 검토해, 어떤 클래스가 조용히 사라지는 것을 일찍 알아챕니다.

FAQ

이미지 · 영상 · 문서에 대하여

일본어 비전 및 문서 AI 작업에서 자주 나오는 질문들.

가능합니다 — 서식 기입란, 주소, 이름, 자유 기술 코멘트를 다룹니다. 손글씨는 인쇄물보다 느리고 모호한 비율이 실제로 더 높으므로, 추측하는 대신 불확실한 글자를 표시하고, 판독할 수 없는 필드를 추정해서라도 전사할지 판독 불가로 표시할지 사전에 합의합니다. 그 결정이 원시 정확도 수치보다 모델에 더 중요합니다.

가능합니다. CVAT, Label Studio, SageMaker Ground Truth, Labelbox와 사내 툴을 포함해 고객사가 제공하는 플랫폼 안에서 작업하며, 계정 발급을 원하지 않으시면 저희 보안 환경에서 진행합니다. 어느 쪽을 쓰든 가이드라인이나 검수 절차는 달라지지 않습니다.

가능하며, 대량 검출 작업에서는 합리적인 접근인 경우가 많습니다. 위험은 수정 작업이 모델의 사각지대를 그대로 물려받는다는 점이므로, 저희는 수정 작업을 처음부터 작업한 샘플과 비교 측정해 실제로 무엇을 잡아내고 있는지 알려 드립니다. 일본어 문서 OCR에 대해서는 더 조심스럽습니다. 전각 문자와 세로쓰기에서 나는 모델 오류는 화면에서 지나치기 쉽기 때문입니다.

NDA와 데이터 처리 계약 아래, 격리된 환경에서, 해당 프로젝트 인원으로 접근을 제한해 처리합니다. 마스킹을 위해 개인정보를 어노테이션할 수도 있고, 보내시기 전에 마스킹한 자료만 다룰 수도 있습니다. 보관과 삭제 조건은 정책에 맡기지 않고 계약서에 명시합니다.

일본 문서는 2024가 아니라 令和6年처럼 연호 연도를 흔히 쓰고, 같은 지면에 둘을 섞는 경우도 많습니다. 저희는 연호 날짜를 원문 문자열을 보존한 독립된 필드로 다루고, 원하시면 서기로 정규화한 값을 함께 담습니다. 그러면 변환 과정에서 정보가 사라지지도, 변환 오류가 데이터에 굳어지지도 않습니다.

이미지 · 영상

한 장이든, 한 프레임이든, 한 폴더든 보내 주세요.

실제 문서나 영상의 대표 샘플만 있으면 분류 체계 초안을 만들고 파일럿 세트를 어노테이션해, 어디에 모호함이 있을지 말씀드릴 수 있습니다.

데이터를 공유하시기 전에 NDA를 체결합니다. 파일럿 범위 산정은 무료입니다.