개체명 인식
도메인에 맞게 정의한 분류 체계에 따른 개체 스팬. 필요한 경우 중첩 개체와 겹치는 개체도 다룹니다.
- 표준 유형과 도메인 고유 유형
- 중첩 및 불연속 스팬
- 표준형으로의 정규화
- 읽기 및 표기 변형 연결
일본어 NLP
개체명 인식, 관계 추출, 의도 및 토픽 분류, 감성, 자연어 추론, 분절 — 실제로 쓰시는 토크나이저에 맞춰 어노테이션합니다.
일본어에는 단어 사이 공백이 없습니다. 따라서 모든 스팬 어노테이션은 누군가 내려야 하는 경계 결정에 달려 있고, 그 결정이 후단 토크나이저와 맞지 않으면 라벨이 정렬되지 않습니다.
영어에서 “Toyota Motor Corporation”은 명백한 세 개의 토큰이고, 남는 질문은 개체가 어디서 시작하고 끝나는지뿐입니다. 일본어에서 株式会社トヨタ自動車는 끊기지 않은 문자열이고, 최소한 네 가지 방어 가능한 어노테이션이 존재합니다. 株式会社를 포함할지 말지, 自動車를 포함할지 말지, 전체를 하나의 개체로 볼지, 긴 개체 안에 짧은 개체를 중첩할지.
이 가운데 어느 것도 틀린 선택이 아닙니다. 중요한 것은 매번 같은 선택을 하는 것, 그것을 문서로 적어 두는 것, 그리고 그 선택이 실제로 쓰는 토크나이저와 만나도 살아남는 것입니다 — 토큰 한가운데 떨어지는 스팬 경계는 조용히 이동하지 않고서는 BIO 태깅으로 표현할 수 없기 때문입니다.
그래서 저희는 어노테이션 시작 전에 토크나이저와 경계 규칙을 확정하고, 원하시는 태그 형식 아래에 문자 오프셋을 함께 저장합니다. 그래야 나중에 재어노테이션 없이 다시 토큰화할 수 있습니다.
한눈에 보기
작업 유형
스팬 작업과 문서 단위 작업은 실패하는 방식이 다르므로 검수 기준도 다릅니다.
도메인에 맞게 정의한 분류 체계에 따른 개체 스팬. 필요한 경우 중첩 개체와 겹치는 개체도 다룹니다.
개체가 어떻게 연결되는지 — 누가 누구에게 무엇을 했는지, 어떤 값이 어떤 필드에 속하는지, 어떤 절이 어떤 용어를 수식하는지.
발화 단위 또는 문서 단위의 의도, 토픽, 라우팅 범주, 정책 라벨 — 단일 라벨과 다중 라벨 모두 지원합니다.
문서, 문장, 또는 측면 단위의 극성과 감정 — 일본어 비즈니스 텍스트에서 실제로 필요한 것은 마지막 측면 단위입니다.
함의, 패러프레이즈, 의미 유사도 쌍, 그리고 평가 세트를 변별력 있게 만드는 하드 네거티브.
일본어 특유의 문제
이 네 가지 질문은 모든 일본어 스팬 어노테이션 프로젝트의 첫 한 시간 안에 나옵니다.
일본어는 공백 없이 쓰이므로 스팬 경계는 조회가 아니라 판단의 문제입니다. 형태소 분석기마다 같은 문장을 다르게 분절하고, 한쪽에 맞춰 붙인 라벨은 다른 쪽에 맞지 않습니다.
대응 방식 킥오프에서 분석기와 사전을 확정하고, 재토큰화에도 살아남도록 스팬을 문자 오프셋으로 저장하며, 경계 규약을 예시와 함께 명시합니다.
株式会社는 회사명 앞에 올 수도 뒤에 올 수도 있고, (株)로 축약되거나 아예 생략되기도 합니다. 이것을 개체 스팬 안에 넣는지가 이후의 모든 문자열 매칭을 바꿉니다.
대응 방식 법인격 접두사와 접미사, 축약형, 괄호 표기를 하나의 규칙으로 다루고, 표면형 스팬과 함께 표준형을 기록합니다.
일본어는 구분 기호 없이 명사를 이어 붙입니다 — 個人情報保護管理者는 최소한 세 개의 의미 단위를 담은 하나의 문자열입니다. 개체가 어디서 끝나는지는 사실이 아니라 결정입니다.
대응 방식 가이드라인이 개체 유형별로 최대 스팬 또는 최소 스팬 정책을 정하고, 둘 다 정말 필요한 경우에만 중첩을 허용합니다. 어노테이터 각자에게 맡기지 않습니다.
동사와 형용사는 활용하고, 조사는 표시하는 단어에 바로 붙습니다. 이를 포함하느냐 제외하느냐가 코퍼스 전체에서 스팬 경계를 한두 글자씩 밀어 놓습니다.
대응 방식 활용 어미와 붙어 있는 조사를 스팬에 포함할지 여부를 규칙으로 명시하고, 토큰 내부에서 끝나는 스팬을 자동 검사로 표시합니다.
프로세스
가치의 대부분은 어노테이션이 시작되기 전에, 분류 체계와 경계 규칙에서 만들어집니다.
라벨 집합과 분석기 · 사전, 스팬 표현 방식을 합의해, 어노테이션이 최종적으로 쓰일 파이프라인과 맞도록 합니다.
소규모 샘플을 어노테이션해 해당 도메인에서 정말로 모호한 구성을 드러냅니다. 이것들이 가이드라인의 예시가 됩니다.
어노테이터들이 같은 세트를 독립적으로 라벨링합니다. 일치도는 경계와 라벨에 대해 따로 측정합니다. 둘은 서로 다른 이유로 어긋나기 때문입니다.
검수 과정을 포함한 프로덕션 어노테이션을 진행하고, 이견에 대한 서면 판정은 곧바로 가이드라인에 반영됩니다.
문자 오프셋과 선택하신 태그 형식, 분류 체계 버전, 라벨별 건수, QA 리포트를 함께 납품합니다.
납품
어떤 표면 형식을 택하시든 문자 오프셋은 항상 포함되므로, 재어노테이션 없이 다시 토큰화할 수 있습니다.
| 작업 | 기본 출력 | 추가 지원 |
|---|---|---|
| 개체명 | 문자 오프셋이 포함된 JSONL | CoNLL-U, BIO / BILOU, brat standoff |
| 관계와 이벤트 | 스팬 참조가 포함된 JSONL | brat standoff, 맞춤 그래프 JSON |
| 분류 | JSONL 또는 CSV | 원핫 또는 다중 라벨 행렬 |
| 감성 | 측면 스팬이 포함된 JSONL | CSV, 문장별 라벨 |
| NLI와 유사도 | JSONL 쌍 | CSV, 벤치마크 형식의 TSV |
품질
스팬 데이터셋은 라벨 정확도가 훌륭하면서도 경계가 쓸 수 없는 상태일 수 있습니다. 저희는 둘 다 측정합니다.
FAQ
일본어 스팬 어노테이션 프로젝트의 범위를 정할 때 나오는 질문들.
고객사 파이프라인이 쓰는 것을 씁니다 — IPAdic이나 UniDic을 쓰는 MeCab, Sudachi, Juman++, 또는 고객사 모델의 서브워드 토크나이저입니다. 스팬 경계는 하나의 분절에만 정렬되므로 킥오프에서 확정하며, 그 아래에 문자 오프셋을 저장해 두어 나중에 분석기를 바꾸더라도 재어노테이션이 아니라 재출력으로 해결되게 합니다.
가능하며, 저희 것을 강요하기보다 귀사의 것을 채택하는 편을 택합니다. 다만 먼저 샘플로 스트레스 테스트를 합니다. 기존 분류 체계에는 실무에서 서로 겹치는 것으로 드러나는 범주가 두세 개 있기 마련이고, 그것을 5만 건 뒤에 발견하는 것보다 파일럿 중에 발견하는 편이 훨씬 저렴합니다.
작업에 따라 전적으로 달라집니다. 깨끗한 텍스트의 명확한 개체 유형은 금세 높은 일치도에 도달하지만, 측면 기반 감성이나 세분화된 의도 분류 체계는 그렇지 않습니다. 그렇지 않다고 주장하는 프로젝트는 대개 실제 납품물보다 쉬운 무언가를 측정하고 있습니다. 저희는 파일럿에서 나온 라벨별 실제 수치를 보고하며, 어떤 범주가 쓸 만한 일치도에 도달할 수 없다면 그렇다고 말씀드리고 범주를 바꾸자고 제안합니다.
분류 체계가 정말로 필요로 하는 경우 다룹니다 — 일본어 복합 명사와 조직명이 흔한 이유입니다. 중첩 규칙은 가이드라인에 명시하고 자동으로 검증합니다. 허용은 되어 있지만 명세되지 않은 중첩은 비일관성의 확실한 원천이기 때문입니다.
가능합니다. 모델 출력을 수정하는 방식은 대량 작업에서 효율적이며, 다른 곳과 같은 주의 사항이 따릅니다. 수정 작업은 모델의 사각지대를 그대로 물려받는 경향이 있습니다. 저희는 수정 작업을 처음부터 작업한 샘플과 비교 측정해 실제로 무엇을 잡아내고 있는지 알려 드리며, 평가 세트는 처음부터 어노테이션합니다.