품질 관리 체계

어노테이션 품질을 측정하는 방식

품질은 대응할 수 있는 수치이거나 아니면 그저 의견입니다. 이 페이지는 저희가 어떤 수치를 만들어 내는지, 그것을 어떻게 계산하는지, 그 수치가 무엇을 말해 주고 무엇을 말해 주지 못하는지, 그리고 모든 배치와 함께 전달되는 QA 리포트에 무엇이 담기는지를 설명합니다.

이 사이트에 예시로 표시된 모든 수치에는 예시라는 표시가 붙어 있습니다. 저희는 정확도 보증을 공개하지 않습니다. 데이터를 보기 전에 하는 보증은 약속이 아니라 마케팅용 숫자이기 때문입니다.

품질은 검사로 걸러내는 것이 아니라 설계에 넣는 것입니다

최종 검사 단계는 실수를 잡아낼 수 있습니다. 하지만 모호함은 잡아내지 못하며, 일본어 데이터셋을 실제로 망가뜨리는 것은 모호함입니다. 가이드라인이 어떤 사례에 대해 두 가지 해석을 허용한다면 두 해석 모두 검사를 통과하고, 그 비일관성은 아무 문제 없다는 판정과 함께 학습 데이터에 들어갑니다.

그래서 품질을 결정하는 작업은 어노테이션 이전에 이루어집니다. 가이드라인을 쓰고, 파일럿에서 실제 엣지 케이스로 그것을 깨뜨려 보고, 독립적으로 작업한 어노테이터들이 수렴하는지 측정하고, 수렴하지 않는 지점에서 가이드라인을 고치는 일입니다. 검수는 두 번째 방어선이지 첫 번째 방어선이 아닙니다.

아래는 그 시스템 전체이며, 공개하기 껄끄러운 부분까지 포함합니다 — 각 지표가 무엇을 포착하지 못하는지, 그리고 데이터셋이 멀쩡하지 않은데도 수치가 건강해 보일 수 있는 지점이 어디인지입니다.

한눈에 보기

측정 대상
어노테이터 간 일치도, 측정된 골드셋 정확도, 판정 비율, 라벨 드리프트.
보고 단위
배치 단위로, 뭉뚱그린 하나의 수치가 아니라 라벨별 · 기준별로 나누어 보고합니다.
검수 깊이
프로젝트마다 설정합니다. 판단이 필요한 곳은 깊게, 기계적인 작업은 가볍게.
이견
시니어 검수자가 서면으로 판정하고, 그 결과는 가이드라인에 다시 반영합니다.
하지 않는 것
정확도 보증을 공개하거나, 다른 프로젝트에서 측정한 수치를 인용하는 일.

시스템

여섯 단계, 계속 돌아가는 루프

이 루프는 프로젝트 시작 시점에 한 번이 아니라 프로젝트 기간 내내 돌아갑니다.

  1. 01

    사양 정의

    작업에 필요한 모든 결정에 대해 예시와 반례를 포함한 가이드라인을 작성합니다. 여기서 암묵적으로 남겨 둔 것은 나중에 비일관성이 됩니다.

  2. 02

    캘리브레이션

    어노테이터들이 같은 캘리브레이션 세트를 독립적으로 라벨링합니다. 판단이 갈리는 지점이 가이드라인이 모호한 지점입니다 — 고치는 것은 어노테이터가 아니라 가이드라인입니다.

  3. 03

    어노테이션

    프로덕션 작업이며, 항목마다 가이드라인 버전을 기록해 나중에 특정 레코드에 대한 질문이 나와도 정확히 답할 수 있게 합니다.

  4. 04

    검수

    두 번째 어노테이터가 작업에 필요한 깊이로 검수합니다. 검수는 어노테이션을 빠르게 반복하는 것이 아니라 자체 기준을 가진 별개의 역할입니다.

  5. 05

    판정

    이견은 시니어 검수자에게 넘어가고, 검수자는 결론과 그 이유를 기록합니다. 모든 결론은 가이드라인의 예시가 됩니다.

  6. 06

    측정과 피드백

    일치도와 골드셋 정확도, 드리프트를 배치마다 계산하고 이전 배치와 비교해, 다음 가이드라인 개정이 어디에 필요한지 판단합니다.

지표

각 수치가 실제로 뜻하는 것

QA 리포트의 수치가 무엇을 가리키는지 저희에게 되묻지 않고도 해석할 수 있도록 여기에 정의해 둡니다.

어노테이터 간 일치도
독립적으로 작업한 어노테이터가 같은 항목에 같은 라벨을 붙이는 빈도입니다. 원시 일치도와 우연 보정 계수를 함께 보고합니다. 분포가 치우친 분류 체계에서는 원시 일치도가 정보를 거의 담지 않으면서도 훌륭해 보일 수 있기 때문입니다.
코헨의 κ / 크리펜도르프의 α
우연을 보정한 일치도 계수입니다. 범주형 라벨에 어노테이터가 두 명일 때는 코헨의 κ를, 어노테이터가 셋 이상이거나 결측 판단이 있거나 순서 척도일 때는 크리펜도르프의 α를 씁니다. 어느 쪽을 썼는지는 암묵적으로 두지 않고 리포트에 명시합니다.
골드셋 정확도
시니어 검수자가 어노테이션하고 판정한 기준 세트 대비 정확도입니다. 일관성이 아니라 정확성을 측정합니다 — 두 어노테이터가 완벽하게 일치하면서 둘 다 틀릴 수 있고, 일치도 통계만으로는 이것이 결코 드러나지 않습니다.
판정 비율
시니어 검수자의 판단이 필요했던 항목의 비율입니다. 판정 비율의 상승은 대개 데이터가 달라졌거나 가이드라인에 공백이 생겼다는 가장 이른 신호이며, 정확도보다 먼저 움직입니다.
라벨 드리프트
시간에 따른 라벨 분포나 어노테이터 행동의 변화입니다. 장기 프로젝트는 평범한 이유로도 드리프트합니다 — 원본 데이터가 바뀌고, 어노테이터가 익숙해집니다. 드리프트 모니터링은 그런 변화와 실제 품질 저하를 구분해 주는 장치입니다.
경계 일치도
스팬 작업에서 스팬의 시작과 끝에 대해 어노테이터들이 얼마나 일치하는지를, 라벨에 대한 일치와 분리해 보고합니다. 일본어 스팬 데이터셋은 라벨 일치도가 훌륭하면서도 경계는 쓸 수 없는 상태일 수 있습니다.

품질 개요

샘플 QA 대시보드

일치도

97.8%

2.1% 최근 7일 대비

골드셋 정확도

98.6%

1.4% 최근 7일 대비

검수 항목 수

24826

18.7% 이번 주

미해결 이견

18

12 최근 7일 대비

라벨 드리프트 (30일)

관측된 드리프트 경고 임계값
0%2.5%5% Day 1Day 8Day 15Day 22Day 30

품질 요약

  • 가이드라인 준수
  • 검수자 캘리브레이션
  • 이상치 모니터링
  • 드리프트 탐지

인터페이스 예시입니다. 표시된 수치는 품질을 모니터링하는 방식을 설명하기 위한 샘플 데이터이며, 보고된 실적이 아닙니다.

검수

배치의 어느 정도를 검수하는가

검수 깊이는 고객사와 합의해 계약서에 명시하는 프로젝트 설정값입니다. 무겁다고 항상 좋은 것은 아닙니다 — 기계적인 작업을 최대 깊이로 검수하면 판단이 필요 없는 곳에 예산을 쓰게 됩니다.

검수 구성의 예시입니다. 프로젝트의 실제 깊이는 범위 산정 단계에서 합의합니다.
검수 깊이주로 적용되는 경우진행 방식
샘플 검수일치도가 안정적인 대량의 기계적 작업정해진 비율의 항목을 검수하고, 불합격 시 검수 범위를 넓힙니다
전수 2차 검수판단이 필요한 라벨링과 대부분의 일본어 스팬 작업모든 항목을 두 번째 어노테이터가 검수합니다
블라인드 이중 어노테이션평가 세트, 벤치마크, 골드셋두 어노테이터가 독립적으로 작업하고, 모든 이견을 판정합니다
전문가 검수규제 분야와 전문적 판단이 필요한 작업도메인 전문가가 검수하며, 다투어지는 항목에는 서면 근거를 남깁니다

오류 분류 체계

실패에 이름 붙이기

이름이 있는 결함은 세고, 추세를 보고, 고칠 수 있습니다. 뭉뚱그린 “오류” 건수는 무엇을 바꿔야 하는지 알려 주지 못합니다.

가이드라인 공백

해당 사례가 가이드라인에 없는 경우. 항목을 고치는 것이 아니라 가이드라인을 개정해서 해결합니다 — 그러지 않으면 같은 사례가 반복됩니다.

가이드라인 오적용

해당 사례가 가이드라인에 있는데 어노테이터가 규칙을 잘못 적용한 경우. 피드백으로 해결하고, 반복되면 더 명확한 예시를 추가합니다.

경계 오류

라벨은 맞고 스팬이 틀린 경우. 경계 규칙과 토큰화가 상호작용하는 일본어 스팬 작업에 특유한 오류입니다.

문체 · 뉘앙스 오류

언어적으로는 맞지만 사회적으로 틀린 경우. 정중함의 수준이 잘못되었거나, 거절이 거절로 읽히지 않을 만큼 부드러운 경우입니다.

사실 오류

검증 가능한 진술이나 이름의 읽기, 수치가 틀린 경우. 해결책이 캘리브레이션이 아니라 검증이므로 판단 오류와 구분합니다.

원본 결함

항목 자체를 쓸 수 없는 경우 — 들리지 않는 오디오, 판독 불가능한 스캔, 모호한 프롬프트. 그럴듯한 추측으로 메우지 않고 표시해 반환합니다.

보고

모든 배치와 함께 전달되는 것

저희가 자리에 없어도 고객사가 그 배치를 감사할 수 있도록 설계된 리포트입니다.

  • 라벨별 또는 기준별 일치도 수치와, 사용한 계수의 명시.
  • 해당 배치의 골드셋 정확도와 이전 배치 대비 추이.
  • 판정 비율, 그리고 각 결론의 근거가 기록된 판정 로그.
  • 단일 결함 총계가 아니라 위 분류 체계로 나눈 오류 건수.
  • 해당 배치가 따른 가이드라인 버전과, 직전 버전 대비 변경 이력.
  • 원본 결함으로 표시된 항목의 목록 — 조용히 빼지 않고 명시합니다.

FAQ

품질 측정에 대하여

이 수치들이 무엇을 증명하고 무엇을 증명하지 못하는지에 대한 질문들.

저희는 정확도 보증을 공개하지 않으며, 어느 업체가 제시하든 그런 보증은 조심스럽게 봅니다. 달성 가능한 정확도는 작업과 분류 체계, 원본 데이터의 품질, 그리고 그 도메인에 실제로 존재하는 모호함의 양에 따라 달라지는데, 이 중 어느 것도 파일럿 이전에는 알 수 없습니다. 저희가 약속하는 것은 측정 방법입니다 — 어떤 지표를, 어떻게 계산해, 어떤 주기로 보고하며, 배치가 기준에 못 미치면 무슨 일이 일어나는지입니다. 귀사 데이터로 파일럿을 마친 뒤에는 현실적인 목표를 이야기할 수 있습니다. 그때는 이야기할 실체가 생기기 때문입니다.

샘플 데이터입니다. 인터페이스가 무엇을 보고하는지, 지표가 움직일 때 어떤 모습인지 보여 주기 위해 존재하며, 바로 그 이유로 눈에 보이는 배지와 고지 문구를 달고 있습니다. 고객사 프로젝트의 실적이 아니며, 그렇게 제시하지도 않습니다.

그것만으로는 아닙니다. 일치도는 정확성이 아니라 일관성을 측정합니다 — 같은 오해를 공유하는 어노테이터들은 완벽하게 일치합니다. 또한 분포가 치우친 분류 체계에서는 부풀려집니다. 그래서 원시 일치도와 함께 우연 보정 계수를 보고하고, 정확성에 대한 독립적인 점검 장치로 시니어 검수자가 판정한 골드셋을 둡니다.

납품하지 않습니다. 실패의 성격에 따라 대상을 좁힌 재어노테이션, 가이드라인 개정 후 영향 항목 재작업, 또는 원인이 상류에 있는 경우 — 모호한 분류 체계나 작업을 지탱하지 못하는 원본 데이터 — 고객사로의 에스컬레이션으로 대응합니다. 귀사 모델과 만나면 무너질 숫자를 제때 드리기보다, 늦더라도 설명과 함께 드리는 편을 택합니다.

가능하며, 요청하시는 것이 합리적입니다. 가이드라인과 그 버전 이력을 검토하시고, 샘플을 가져가 독립적으로 채점하시고, 그 결과를 저희가 보고한 수치와 비교하실 수 있습니다. 고객사가 자체 QA를 병행하는 경우, 양쪽의 차이는 다툴 사안이 아니라 조사할 가치가 있는 발견으로 다룹니다.

품질

귀사 데이터로 나온 수치를 요청해 주세요.

파일럿은 실제 일치도 수치와 실제 오류 분포, 그리고 귀사 분류 체계의 어느 부분이 대량 작업에서 버틸지에 대한 솔직한 견해를 만들어 냅니다.

데이터를 공유하시기 전에 NDA를 체결합니다. 파일럿 범위 산정은 무료입니다.