FAQ

자주 묻는 질문

실제로 받는 질문들을, 한 문장이 아니라 그 질문에 필요한 만큼의 분량으로 답했습니다. 나머지를 다 읽지 않고도 원하는 항목을 찾을 수 있도록 묶었습니다.

여기에 없는 내용은 문의와 함께 보내 주시면, 이 페이지를 다시 안내하는 대신 직접 답변드립니다.

01

시작하기

첫 프로젝트가 어떤 모습인지.

범위를 정한 파일럿으로 시작합니다. 대표 데이터 샘플과 모델이 무엇을 해야 하는지에 대한 설명을 보내 주시면, 저희가 그 작업에 필요한 가이드라인 결정 사항의 초안을 만들고 소규모 배치를 어노테이션한 뒤 측정된 일치도를 보고드립니다. 파일럿의 목적은 합리적인 두 어노테이터의 판단이 갈리는 지점을 찾는 것입니다. 바로 그곳이 사양이 불완전한 지점이기 때문입니다. 프로덕션 규모와 가격은 추정이 아니라 파일럿이 측정한 결과에서 도출합니다.

데이터 샘플, 작업 설명, 필요한 출력 형식, 그리고 제약 조건 — 마감, 기밀 유지 요건, 저희가 작업하기를 원하시는 툴 — 입니다. 작업 설명만으로 낸 견적은 추측입니다. 첫 배치 이후에 바뀌는 숫자를 내놓기보다, 실제 데이터를 한 시간 들여다보는 편을 택합니다.

데이터를 받은 시점부터 보통 1–3주이며, 사양 정리 작업이 얼마나 필요한지에 따라 달라집니다. 그 시간의 대부분은 어노테이션이 아니라 가이드라인 작성과 캘리브레이션입니다. 이미 검증된 가이드라인이 있는 작업은 훨씬 빠르게 진행됩니다.

정해진 최소 물량은 없습니다. 소규모 파일럿부터 대량 프로덕션 프로그램까지 진행합니다. 실질적인 하한선을 만드는 것은 초기 비용입니다 — 가이드라인 작업과 툴 구성, 캘리브레이션은 물량과 관계없이 대부분 고정적으로 발생하므로, 아주 작은 단발성 작업은 그 비용을 불균형하게 떠안게 됩니다. 그런 경우에는 에둘러 견적을 내는 대신 그렇다고 말씀드립니다.

작업 단위당 — 건당, 오디오 시간당, 이미지당, 평가당 — 과금하며, 단가는 작업 난이도와 검수 깊이, 요구되는 전문성 수준에 따라 정해집니다. 가이드라인 개발과 캘리브레이션은 어떤 항목에도 라벨이 붙기 전에 실제로 수행되는 작업이므로 별도로 산정합니다. 파일럿 범위 산정을 위한 상담에는 비용을 청구하지 않습니다.

02

서비스와 범위

저희가 하는 일과, 저희가 적합하지 않은 영역.

저희는 일본어를 위해 만들어진 팀입니다. 일본어–영어 이중언어 작업 — 번역 검수, 교차언어 정렬, 병렬 평가 세트 — 은 같은 일본어 판단력에 기대므로 수행합니다. 다른 언어의 대량 작업이라면 프로젝트를 수주해 재하청하기보다, 저희가 적합한 업체가 아니라고 솔직히 말씀드리는 편을 택합니다.

가능합니다. 데이터가 귀사 인프라를 벗어나면 안 되는 정책이 있는 경우를 포함해 고객사가 제공하는 플랫폼과 가상 데스크톱에서 작업하며, 계정 발급을 원하지 않으시면 저희 보안 환경에서 진행합니다. 툴은 달라지지만 가이드라인과 검수 절차, QA 보고는 달라지지 않습니다.

일본어 관련 작업인 경우에는 데이터를 수집하고 생성합니다 — 인스트럭션 데이터 작성, 평가용 프롬프트 구성, 대본 기반 음성 녹음, 문서 샘플 확보 등입니다. 저희는 범용 데이터 수집 업체가 아니며, 대규모 현장 수집이라면 전문 업체가 더 나은 선택입니다.

가능합니다. 가장 먼저 하는 일은 그 업체의 가이드라인을 읽고, 이미 납품된 데이터의 샘플을 블라인드로 다시 어노테이션하는 것입니다. 그렇게 하면 기존 라벨이 내부적으로 일관된지를 포함해, 지금 무엇을 가지고 계신지가 드러납니다. 현재 무엇이 들어 있는지 측정하지 않고 데이터셋을 이어 붙이는 것이 비일관성이 누적되는 경로입니다.

가능합니다. 장기 AI 프로그램에서는 전담 팀 형태가 일반적이며, 같은 어노테이터가 가이드라인을 이어받아 축적하는 맥락 자체가 실질적인 자산이 됩니다. 동시에 가이드라인 드리프트가 가장 문제가 되는 형태이기도 하므로, 골드셋 대비 주기적인 재캘리브레이션이 함께 진행됩니다.

03

일본어

일본어 대응이 실무에서 무엇을 뜻하는지.

한자, 히라가나, 가타카나, 로마자를 아우르는 격식체와 비격식체를 모두 다루며, 경어와 지역 변이, 속어, 업계 전문 용어, 일본어와 영어가 섞인 기술 문서를 포함합니다. 표기 선택과 숫자, 문장 부호, 이모지, 전각 문자에 대한 정규화 규칙은 킥오프에서 합의합니다. 그 선택이 코퍼스의 내부 일관성을 좌우하기 때문입니다.

그렇습니다. 이는 문장이 무엇을 지시하는지가 아니라 어떻게 받아들여지는지에 달린 판단에서 중요합니다 — 거절이 거절로 읽히는지, 정중함의 수준이 그 관계에 적절한지, 표현이 번역투로 들리는지 같은 판단입니다. 가이드라인이 촘촘한 기계적인 작업에서는 이 요건이 덜 중요하므로, 필요하지 않은 전문성에 비용을 청구하는 대신 작업에 맞춰 인력을 배치합니다.

가능합니다. 다만 방언 대응은 인력 배치의 문제이므로, 어떤 변이를 안정적으로 다룰 수 있는지 구체적으로 말씀드립니다. 더 중요한 결정은 그 앞 단계에 있습니다 — 방언을 말한 그대로 전사할지, 표준 일본어로 정규화할지입니다. 그 선택은 데이터셋 자체를 완전히 바꾸므로 의식적으로 정해야 합니다.

문서화된 정규화 규약을 어노테이션 시점에 적용하고, 납품 전에 자동 검사로 강제합니다. 이 규약은 자주 쓰이는 단어의 표기 선택, 가타카나 장음 표기, 아라비아 숫자와 한자 숫자, 전각과 반각 문자, 로마자 주변 공백과 문장 부호를 다룹니다. 표기 흔들림은 사양이 정해지지 않은 일본어 데이터셋에서 가장 흔한 결함이자 가장 예방하기 쉬운 결함입니다.

가능하며, 저희 것을 강요하기보다 귀사의 것을 채택하는 편을 택합니다 — 이미 귀사 문체로 쓰는 모델이라면 계속 그래야 합니다. 다만 파일럿 기간에 실제 엣지 케이스로 검증합니다. 대부분의 스타일 가이드에는 실제 데이터와 만나면 서로 충돌하는 규칙이 두세 개 있기 때문입니다.

04

품질과 납품

품질을 어떻게 측정하고 무엇이 납품되는지.

우연 보정 계수를 포함한 어노테이터 간 일치도, 골드셋 정확도, 판정 비율, 그리고 단일 결함 총계가 아니라 명명된 분류 체계로 나눈 오류 건수입니다. 모든 수치는 뭉뚱그리지 않고 라벨별 또는 기준별로 보고합니다. 뭉뚱그린 수치는 정확히 문제가 있는 범주를 가리기 때문입니다. 각 수치를 어떻게 계산하고 무엇을 포착하지 못하는지는 품질 페이지에 정리되어 있습니다.

JSONL, CSV, CoNLL-U, COCO, SRT, CTM, TextGrid, hOCR, 그리고 킥오프에서 정의한 맞춤 스키마입니다. 스팬 데이터에는 어떤 태그 형식을 택하시든 그 아래에 항상 문자 오프셋이 포함되므로, 나중에 토크나이저를 바꾸더라도 재어노테이션이 아니라 재출력으로 해결됩니다. 모든 배치에는 가이드라인 버전과 직전 배치 대비 변경 이력이 함께 납품됩니다.

수정도 최초 작업과 동일한 검수 및 판정 경로를 거칩니다 — 빠른 수정 전용 경로가 바로 배치 간에 데이터셋이 흔들리는 원인입니다. 원인이 가이드라인의 공백인 경우에는 가이드라인을 개정하고, 지적하신 항목만이 아니라 영향을 받은 항목 전체를 재작업합니다. 같은 공백이 다른 곳에서도 같은 오류를 만들었을 것이기 때문입니다.

처리량은 작업 난이도와 검수 깊이, 데이터에 실제로 존재하는 모호함의 양에 따라 달라지며, 대부분의 견적이 인정하는 것보다 작업 간 편차가 큽니다. 저희는 귀사 데이터로 파일럿을 진행하며 실제 처리량을 측정하고, 그것을 근거로 계획을 확약합니다. 아무도 귀사 데이터를 어노테이션해 보기 전에 제시하는 납기는 확약의 외양을 한 추측입니다.

해당 항목을 함께 살펴봅니다. 보통 셋 중 하나입니다. 가이드라인이 모호했던 경우 — 이때는 개정하고 재작업합니다. 가이드라인은 명확했는데 잘못 적용된 경우 — 이때는 수정하고 검수 과정에 반영합니다. 가이드라인이 이제는 원하지 않으시는 내용을 담고 있는 경우 — 이때 변경은 범위에 관한 결정입니다. 개별 라벨을 두고 다투는 것보다 이견을 이 셋 중 하나로 분류하는 편이 훨씬 생산적입니다.

05

보안 · 법무 · 계약

기밀 유지와 계약, 그리고 구매 부서와 일하는 방식.

무엇이든 공유되기 전의 NDA, 개인정보가 포함되는 경우의 데이터 처리 계약, 프로젝트에 투입된 인원으로 제한된 역할 기반 접근, 격리된 작업 환경, 그리고 정책이 아니라 계약서에 명시된 보관 및 삭제 조건입니다. 보안 페이지에서 각 통제 항목과, 그에 못지않게 중요한 저희가 주장하지 않는 것을 설명합니다.

저희는 귀사와의 계약서에 명시되지 않은 어떤 인증도 보유한다고 주장하지 않습니다. 특정 인증 체계에 대해 물어보시면 아니라는 답을 포함해 직접적인 답변을 드립니다. 감사에서 버티지 못할 주장으로 구매 절차를 통과하기보다, 정확했다는 이유로 탈락하는 편을 택합니다.

고객사에 있습니다. 납품물과 그로부터 파생된 어노테이션은 업무 계약에 따라 귀사의 것입니다. 저희는 고객사 데이터를 내부 재활용이나 모델 학습, 포트폴리오 목적으로 보관하지 않으며, 본 웹사이트에 표시된 샘플 자료는 설명을 위해 저희가 직접 만든 것입니다.

가능하며, 엔터프라이즈 계약에서는 일반적입니다. 저희가 실제로 이행할 수 없는 사항 — 특정 정확도 수치, 보유하지 않은 인증 — 을 약속하게 하는 조항이 있으면, 서명하고 기대하기보다 그렇다고 말씀드리고 대안 문구를 제안합니다. 더 느린 대화이지만, 다른 선택지보다는 짧게 끝나는 대화입니다.

외주가 개입되는 경우에는 이를 공개하며, 저희 자체 인력에게 적용되는 것과 동일한 기밀 유지 의무가 적용됩니다. 조용히 전제되는 일은 없습니다. 귀사 정책이 외주를 전면 금지한다면 말씀해 주십시오. 그 조건으로 프로젝트 인력을 구성할 수 있는지 확약 이전에 확인해 드립니다.

06

전문가 어노테이션

도메인 전문가, 그리고 저희가 주장하는 것의 한계.

필요한 프로젝트에는 요구되는 도메인 전문성에 맞춰 팀을 구성하며, 여기에는 법률, 세무, 회계, 노무 및 사회보험, 법인 등기 같은 분야에서 관련 자격이나 실무 경험을 갖춘 인원이 포함될 수 있습니다. 저희는 유자격 전문가를 상시 등록해 두는 인력 풀을 운영하지 않습니다. 투입 가능 여부는 프로젝트마다 그 범위와 물량, 전문 영역, 일정에 비추어 판단하며, 프로젝트에 필요한 자격을 확보할 수 없는 경우에는 착수 전에 말씀드립니다.

그 작업이 어떤 종류의 판단을 요구하는지로 판단합니다. 용어와 문서 관행은 좋은 용어집과 캘리브레이션 과정을 거치면 훈련된 어노테이터에게 전달할 수 있고, 대부분의 작업에서는 그쪽이 더 나은 답입니다 — 더 빠르고, 더 일관되며, 비용도 적게 듭니다. 전문가가 필요한 것은 판단 자체가 전문적일 때입니다. 어떤 해석이 방어 가능한지, 어떤 답변이 독자에게 자신의 의무에 대해 오해를 줄 수 있는지 같은 판단입니다.

가능합니다. 도메인 전문가는 생성된 답변을 사실 정확성과 추론의 질, 전문적 타당성, 귀사 기준 충족 여부에 따라 채점할 수 있으며, 얼라인먼트 작업과 벤치마크 세트, 검색 평가, 레드팀을 위한 선호 순위도 만들 수 있습니다. 각 판단의 근거가 기록되며, 대개 그것이 전문가 평가를 비용만큼의 가치가 있게 만드는 부분입니다.

아닙니다. 전문가는 데이터를 어노테이션하고 평가합니다. 그 산출물은 귀사 AI 시스템을 위한 학습 또는 평가 데이터이며, 귀사나 귀사의 사용자에 대한 법률 · 세무 · 회계 자문이 아닙니다. 어노테이션 프로젝트에서 생성된 어떤 것도 최종 사용자에게 전문적 자문으로 제시되어서는 안 됩니다. 이 구분은 양쪽 모두에게 중요하므로 명확히 밝힙니다.

아직 질문이 남으셨나요?

직접 물어봐 주세요.

문의와 함께 보내 주시면, 이 페이지로 다시 안내하는 대신 말씀하신 유형의 프로젝트를 실제로 진행해 본 담당자가 구체적으로 답변드립니다.

영업일 기준 1일 이내에 회신드립니다.