평가 · 휴먼 피드백

일본어 LLM 평가와 휴먼 피드백

모델이 일본어로 실제로 만들어 내는 결과에 대한 구조화된 사람의 판단 — 원어민이 문서화된 루브릭에 따라 채점하고, 일치도를 측정하며, 이견은 서면으로 판정합니다.

평가의 수준은 루브릭의 수준을 넘지 못합니다. 유능한 일본어 화자 두 사람이 같은 답변에 다른 점수를 주면서 그 이유를 말하지 못한다면, 나오는 숫자는 소수점을 걸친 잡음일 뿐입니다.

일본어 평가에 일본어 평가자가 필요한 이유

자동 지표와 LLM-as-judge 구성은 추세를 추적하는 데는 유용하고, 일본어에서 가장 중요한 실패에 대해서는 신뢰할 수 없습니다. 주로 영어로 학습된 심판 모델은 상황에 맞지 않는 정중함 수준의 답변, 거절로 읽히지 않을 만큼 부드러운 거절, 세 턴 전에 성립한 관계와 어긋나는 경어를 아무렇지 않게 통과시킵니다. 이런 것들은 일본어 사용자가 즉시 알아차리고 지표는 전혀 알아차리지 못하는 오류입니다.

그래서 저희는 꼼꼼한 검수자가 할 법한 방식으로 평가하되, 그 검수를 재현 가능하게 만듭니다 — 각 점수 구간에 예시를 붙인 앵커형 루브릭, 채점 시작 전 캘리브레이션, 표본에 대한 블라인드 이중 채점, 채점자 간 이견에 대한 서면 판정입니다. 산출물은 방어할 수 있는 수치들과, 그 수치를 만들어 낸 근거입니다.

독립성도 설계상의 제약으로 다룹니다. 한 프로젝트의 평가자는 그 프로젝트의 학습 데이터를 작성한 사람이 아닙니다. 자기가 만든 가이드라인을 스스로 채점하면 후하게 매기는 경향이 있기 때문입니다.

한눈에 보기

평가 유형
페어와이즈 선호, 루브릭 채점, 사실성 및 근거성, 안전성 및 레드팀, 벤치마크 구축.
채점 주체
일본 현지 원어민. 주제가 요구하는 경우 도메인 전문가.
함께 보고되는 것
평가자 간 일치도, 판정 비율, 기준별 세부 결과, 채점 메모 전체.
독립성
평가자는 귀사 학습 데이터를 작성한 어노테이터와 다른 인원입니다.
재현성
루브릭을 버전 관리하므로 이후의 평가가 이전 평가와 비교 가능합니다.

평가 유형

평가 범위

질문이 다르면 도구도 달라야 합니다. 대부분의 프로그램은 같은 모델에 대해 이 중 두세 가지를 함께 돌립니다.

페어와이즈 선호

같은 프롬프트에 대한 두 답변을 문서화된 기준으로 비교합니다. 상대적 판단이 절대 점수보다 훨씬 안정적이므로, 모델 버전을 비교하는 가장 견고한 방법입니다.

  • A/B 모델 비교
  • 무승부를 명시적으로 기록
  • 기준별 선호
  • 위치 편향을 통제한 순서 배치

루브릭 채점

정확성, 유용성, 문체, 서식, 안전성 등 명명된 기준에 대한 절대 점수. 각 기준마다 해당 점수가 무엇을 뜻하는지 앵커 설명을 둡니다.

  • 앵커가 붙은 순서 척도
  • 뭉뚱그린 하나가 아니라 기준별 점수
  • 낮은 점수에는 근거 기술 필수
  • 실행마다 버전 관리되는 루브릭

사실성과 근거성

주장이 사실인지, 그리고 모델에게 주어진 문서가 실제로 그것을 뒷받침하는지. 둘은 서로 다른 실패이므로 따로 채점합니다.

  • 주장 단위 검증
  • 인용 구간 확인
  • 근거 없는 주장 탐지
  • 일본어 출처 대조 검증

안전성과 레드팀

일본어 화자가 일본어로 작성한 적대적 프롬프트. 번역된 프롬프트 세트에는 결코 들어 있지 않은 완곡하고 우회적인 표현을 포함합니다.

  • 범주 기반 공격 세트
  • 과잉 거절 탐침
  • 일본 특유의 사회적 · 법적 리스크
  • 심각도가 태깅된 발견 사항

벤치마크 구축

고객사 도메인에 맞춘 홀드아웃 평가 세트. 모두가 맞히는 문항이 아니라 변별력을 갖도록 설계한 문항으로 구성합니다.

  • 난이도가 균형 잡힌 문항 풀
  • 오염을 고려한 출처 선정
  • 허용 변형이 포함된 정답
  • 재사용 가능한 채점 하네스

일본어 특유의 문제

일본어가 아닌 평가가 놓치는 것

아래는 모두 영어로 학습된 심판 모델에게는 보이지 않고 일본어 독자에게는 명백한 것들입니다.

문체의 적절성

답변이 문법적으로 맞고 내용도 정확한데 여전히 틀릴 수 있습니다. 동료에게 쓸 문체로 고객을 대하고 있기 때문입니다. 일본어에서 정중함은 문체의 축이 아니라 정확성의 축입니다.

대응 방식 문체를 자체 앵커를 가진 별도의 루브릭 기준으로 두고 정확성과 분리해 채점합니다. 그래야 내용은 충실하지만 문체가 어긋난 답변이 내용 뒤에 숨지 못합니다.

거절의 강도

일본어의 거절은 기본적으로 완곡합니다. 금지된 요청에 難しいかもしれません으로 답한 모델은 형식적으로는 얼버무린 것인데, 많은 평가 구성이 이를 성공적인 거절로 채점합니다.

대응 방식 거절은 일본어 화자가 그것을 거절로 읽는지를 기준으로, 예시가 붙은 척도에서 채점합니다. 과잉 거절도 성공이 아니라 그 자체로 하나의 실패로 채점합니다.

턴 전반의 경어 일관성

대화 초반에 성립한 관계가 이후의 모든 턴을 제약합니다. 모델은 대화 중간에 이를 자주 리셋하는데, 일본어 사용자에게는 어시스턴트가 지금 누구와 이야기하는지 잊은 것처럼 읽힙니다.

대응 방식 멀티턴 항목은 대화 단위로 채점하며, 각 답변을 따로 보는 대신 턴 전반을 가로질러 보는 일관성 기준을 둡니다.

고유명사와 읽기

일본어 고유명사에는 유효한 읽기가 여러 개 있고, 인명이나 지명의 읽기를 잘못 낸 모델은 맞춤법 검사로는 보이지 않는 사실 오류를 범한 것입니다.

대응 방식 개체와 읽기 오류는 사실성의 독립된 하위 범주로 두고, 평가자의 기억이 아니라 일본어 출처에 대조해 검증합니다.

프로세스

평가가 진행되는 방식

루브릭은 그 실행보다 오래 남는 산출물입니다. 다음 평가를 이번 평가와 비교 가능하게 만드는 것이 바로 루브릭입니다.

  1. 01

    “좋음”의 정의

    품질에 대한 우려를 명명된 기준으로 바꾸고, 각 점수 구간에 대해 귀사 모델의 실제 출력에서 가져온 예시로 앵커 설명을 작성합니다.

  2. 02

    문항 세트 구성

    중요하게 보시는 행동을 포괄하도록 프롬프트를 표집하거나 작성하며, 무작위 표집으로는 결코 드러나지 않을 희소하고 적대적인 사례도 포함합니다.

  3. 03

    채점자 캘리브레이션

    모든 평가자가 같은 캘리브레이션 배치를 채점합니다. 차이를 논의하고 루브릭 앵커를 다듬으며, 일치도가 안정된 뒤에야 채점을 시작합니다.

  4. 04

    채점, 이중 채점, 판정

    정해진 비율의 항목을 두 평가자가 블라인드로 채점합니다. 이견은 시니어 검수자에게 가고, 검수자는 결론의 이유를 기록합니다.

  5. 05

    근거와 함께 보고

    점수와 일치도 통계, 판정 로그, 그리고 반복되는 실패 패턴에 대한 서면 요약을 받으십니다 — 리더보드의 한 줄이 아닙니다.

납품

전달되는 것

모든 점수는 항목과 평가자 역할, 루브릭 버전, 그리고 작성된 경우 그 근거까지 추적할 수 있습니다.

기본 평가 납품물. 채점 하네스 형식은 사용하시는 스택이 있으면 거기에 맞춥니다.
납품물형식내용
항목별 점수JSONL 또는 CSV항목 ID, 기준별 점수, 근거, 평가자 역할, 루브릭 버전
일치도 리포트PDF 또는 Markdown기준별 평가자 간 일치도, 판정 비율, 실행 기간의 드리프트
실패 분석PDF 또는 Markdown반복되는 패턴, 사례 예시, 가이드라인 또는 데이터 변경 제안
레드팀 발견 사항JSONL프롬프트, 응답, 범주, 심각도, 재현 메모
벤치마크 세트JSONL과 채점 하네스문항, 기준 정답, 허용 변형, 채점 스크립트

품질

이 작업에 특화된 관리 항목

일치도 통계가 없는 평가는 의견입니다. 아래는 그것을 측정으로 바꾸는 검사들입니다.

  • 채점 전 캘리브레이션 라운드를 두고, 루브릭이 바뀔 때마다 반복합니다.
  • 정해진 표본에 대한 블라인드 이중 채점, 그리고 뭉뚱그리지 않은 기준별 일치도 보고.
  • 모든 이견에 대한 서면 판정을 로그로 남겨 결과와 함께 전달합니다.
  • 페어와이즈 비교에서 답변 순서를 무작위화해 위치 편향을 통제합니다.
  • 같은 프로젝트의 학습 데이터를 만든 팀과 평가자를 분리합니다.
  • 루브릭을 버전 관리해, 몇 달 뒤 다시 돌려도 이전과 같은 것을 측정하게 합니다.

FAQ

LLM 평가에 대하여

첫 일본어 평가를 의뢰하기 전에 나오는 질문들.

LLM 심판은 저렴하고 빠르며 릴리스 간 회귀 추적에 유용합니다. 다만 일본어가 어려운 바로 그 지점 — 정중함의 적절성, 거절의 강도, 경어의 일관성, 이름의 읽기 — 에서는 신뢰할 수 없습니다. 그런 판단은 원어민의 화용적 지식에 의존하기 때문입니다. 흔한 구성은 사람이 채점한 세트를 기준으로 삼고, 잦은 실행에는 LLM 심판을 쓰며, 주기적으로 사람이 다시 채점해 심판이 기준에서 멀어지지 않았는지 확인하는 방식입니다.

어느 정도 크기의 차이를 감지하려는지, 그리고 몇 개의 기준으로 채점하는지에 달려 있습니다. 잘 고른 수백 개 항목이면 확실히 다른 두 모델은 대개 구분됩니다. 거의 동등한 체크포인트를 구분하려면 훨씬 많이 필요합니다. 저희는 내리려는 의사결정에 맞춰 세트 크기를 정하고, 원하시는 결론을 뒷받침하기에 세트가 너무 작을 때는 그렇다고 말씀드립니다.

가능합니다. 법률, 세무, 회계, 노무, 법인 등기 관련 질의 같은 주제에 대해서는 그 작업이 요구하는 전문성에 맞춰 평가 팀을 구성합니다. 저희는 유자격 전문가를 상시 등록해 두는 인력 풀을 운영하지 않습니다. 투입 가능 여부는 프로젝트마다 그 범위와 물량, 일정에 비추어 판단하며, 어디까지 가능한지는 작업 착수 전에 확인해 드립니다.

합니다. 다만 같은 사람이 하지 않습니다. 한 프로젝트의 평가자는 그 프로젝트의 학습 데이터를 작성한 어노테이터와 분리합니다. 자신이 만드는 데 참여한 가이드라인으로 채점하는 것은 독립적인 측정이 아니기 때문입니다. 데이터를 만든 업체 바깥에서 평가가 이루어지는 편을 원하신다면, 저희는 그것이 합리적인 입장이라고 보며 그렇게 말씀드립니다.

결과와, 그것을 설명하는 실패 분석입니다. 점수만 담긴 리포트는 대응할 수 없습니다 — 필요한 것은 그 뒤에 있는 반복 패턴과 각각의 사례, 그리고 해결책이 데이터를 더 모으는 것인지, 가이드라인을 바꾸는 것인지, 제품을 바꾸는 것인지에 대한 구체적인 견해입니다. 저희는 불편한 결과를 부드럽게 만드는 대신 명확하게 전달하는 편을 택합니다.

LLM 평가

모델이 일본어에서 무엇을 틀리는지 확인해 보세요.

모델 출력 세트나 테스트하고 싶은 프롬프트를 보내 주세요. 제안 루브릭과 그것으로 채점한 샘플, 그리고 전체 실행에 무엇이 필요한지를 정리해 회신드립니다.

데이터를 공유하시기 전에 NDA를 체결합니다. 파일럿 범위 산정은 무료입니다.