Potato 2.7: 라벨이 만들어지는 과정을 측정하다
Potato 2.7은 오차 막대가 붙은 라벨, 라이브 노밍 룸, 반사실 경계 프로브, 동료 예측 채점, 로컬 음성 근거, 명령 한 번으로 만드는 데이터셋 리포트, 모바일 주석을 더했습니다. 어느 것도 LLM이 필요 없습니다. 여기에 멀티 에이전트와 멀티모달 에이전트 평가까지 붙었습니다.
주석 도구는 라벨을 모읍니다. 그게 할 일이고, Potato는 2022년부터 그 일을 해 왔습니다. 그런데 라벨은 어떤 결정의 결과물이며, 지난 10년 대부분 동안 그 결정 자체는 보이지 않았습니다. 답은 얻지만 그 답을 만들어 낸 추론도, 확신의 정도도, 그 과정의 불일치도 얻지 못했습니다.
Potato 2.7은 하나의 생각 위에 서 있습니다. 주석 도구는 판단이 무엇이었는지 기록하는 데 그치지 않고 판단이 어떻게 내려졌는지 측정해야 한다는 것입니다. 이는 두 종류의 판단자 모두에 해당합니다. 주석을 다는 사람과, 평가받는 AI 모델입니다.
Potato 2.7
오차 막대가 붙은 라벨
심리측정 엔진은 주석이 들어오는 대로 문항반응이론 모델을 적합하며, 일치 양상만으로 어노테이터별 능력과 항목별 난이도를 추정합니다. 골드 라벨도, LLM도 없습니다.
내보내기에는 sarcastic (2 of 3 votes) 대신 sarcastic, p = 0.94 [0.88 – 0.97]이 적힙니다. 이 확률은 몇 명이 투표했는지만이 아니라 누가 투표했는지에 가중치를 둡니다.
assignment_strategy: psychometric
psychometrics:
enabled: true
confidence_threshold: 0.95 # items above this stop consuming budget이 모델에서 두 가지가 따라 나옵니다. 사후확률이 이미 확실한 항목은 더 이상 배포되지 않으므로 중복은 정말 필요한 곳으로 갑니다. 그리고 어떤 항목의 변별도가 음수로 가면, 즉 가장 뛰어난 어노테이터들이 다수와 어긋나고 있다면, 그것은 대개 나쁜 어노테이터가 아니라 망가진 지침입니다. 대시보드는 이를 코드북 문제로 의심된다고 표시합니다.
도구 안으로 들어온 캘리브레이션 회의
주석 팀은 어디나 노밍 세션을 하고, 그 세션은 거의 언제나 화면 공유로 이루어지며 결과는 누군가의 메모 속에 남습니다. 멀티플레이어 룸은 그 세션을 Potato 안으로 옮겨 계측합니다.
전원이 블라인드로 투표합니다. 호스트가 공개합니다. 그룹이 토론합니다. 누구든 투표를 바꿀 수 있고, 공개 이후의 모든 변경은 그 시점의 다수 의견과 함께 기록되므로 구성원별 동조 기록이 남습니다. 실시간 Krippendorff α 미터가 블라인드 투표와 현재 투표를 동시에 계산하므로, 둘의 차이가 그 토론이 실제로 어떤 값어치를 했는지를 진행되는 동안 알려 줍니다.
Huddle 룸은 팀이 지금 의견이 갈리는 항목으로 스스로를 채웁니다. Shadow 룸에서는 교육 중인 사람이 선임 어노테이터가 강조 표시까지 포함해 작업하는 모습을 지켜볼 수 있습니다.
골드 라벨 없는 품질 관리
두 기능이 같은 문제를 서로 다른 방향에서 공략하며, 어느 쪽도 가짜 항목을 심지 않습니다.
Truth Serum은 라벨을 붙일 때마다 질문 하나를 더 던집니다. 다른 어노테이터 중 몇 퍼센트가 당신이 고른 것을 고를까요? 이 예측들이 놀랍도록 인기 있는 추정량(Prelec, Seung & McCoy 2017, Nature)에 들어가고, 이 추정량은 주석이 어려운 바로 그 지점에서 다수결을 이깁니다. 확신에 찬 다수가 틀리고 사정을 아는 소수가 맞을 때입니다. 우리가 아는 한, 동료 예측 채점을 기본으로 제공하는 주석 도구는 Potato가 처음입니다.
결정 경계 실험실은 라벨이 확정된 직후에 최소한의 반사실 편집을 보여주며 그 라벨이 그대로 살아남는지 묻습니다. 답하는 데는 클릭 한 번이면 되고, 평범한 주석 작업이 덤으로 대조 집합(Gardner et al. 2020)을 만들어 내기 시작합니다. 일부 프로브는 의미를 유지하는 패러프레이즈인데, 여기서 라벨을 뒤집는 어노테이터는 골드 항목을 하나도 심지 않고도 무언가를 알려 주고 있는 것입니다.
그대로 담아낸 사람의 추론
Think-Aloud 모드는 어노테이터가 작업하면서 말할 수 있게 합니다. 음성 인식은 faster-whisper로 로컬에서 돌아가므로 아무것도 기기를 떠나지 않고 토큰당 비용도 없습니다. 전사본은 말한 그대로, 의도적으로 요약하지 않은 채 저장됩니다. 사고구술 프로토콜을 바꿔 말하면 수집하려던 자료 자체가 망가지기 때문입니다.
핵심은 근거만이 아닙니다. 이것은 사람이 라벨에 이르기까지 어떻게 추론하는지를 담은 기록이며, 모델이 어떻게 추론하는지를 단계로 나누는 프로세스 보상 도구에 대응하는 사람 쪽 짝입니다. 같은 항목, 두 개의 사고 사슬입니다.
두 가지 더, 그다음은 에이전트
논문 모드는 프로젝트를 명령 한 번으로 컴파일 가능한 LaTeX 데이터셋 리포트로 바꿉니다. 라벨 분포, 어노테이터 표, 올바른 인용이 붙은 일치도 통계, 소요 시간, 그리고 실제 수치가 들어간 정직한 한계 단락까지 나옵니다.
python -m potato.paper config.yaml -o paper_export포켓 모드는 모바일 주석을 일급으로 다룹니다. 터치 기기는 엄지 영역 버튼과 오프라인 동기화가 붙은 스와이프 카드 스택을 받습니다. 정말로 데스크톱이 필요한 작업(스팬, 바운딩 박스, 비디오)은 휴대폰에서 품질을 낮춰 제공되는 일이 없습니다. 대신 경고가 표시됩니다.
AI 에이전트 평가하기
2.7의 나머지 절반은 같은 철학을 모델로 향합니다. 에이전트 평가 제품군은 이제 멀티 에이전트 실행을 밋밋한 전사본이 아니라 팀으로 놓고 주석합니다. 클릭할 수 있는 상호작용 그래프, 에이전트를 가로지르는 실패 귀인, 인계 검토, 에이전트별 및 팀 단위 스코어카드, 도구 경합 타임라인, 그리고 에이전트 전반의 창발 행동 태깅이 있습니다.
멀티모달 에이전트에는 전용 화면이 붙습니다. 클릭 그라운딩이 되는 GUI 및 컴퓨터 사용 궤적, 끼어들기 감지가 되는 전이중 음성 타임라인, 실시간 IoU가 나오는 비디오 시간 그라운딩, 그리고 문서 표 구조입니다.
목록보다 차근한 안내를 원한다면 멀티 에이전트 실패 디버깅에 한 편 써 두었습니다.
두 절반이 만나는 곳
둘은 서로 다른 두 판단자를 겨눈 같은 생각이며, 2.7은 그 둘을 서로 이어 놓았습니다.
Think-Aloud는 사람이 라벨에 이르기까지 어떻게 추론하는지를 기록합니다. 프로세스 보상 주석은 모델이 어떻게 추론하는지를 단계별로 담습니다. 같은 항목에 둘을 나란히 놓으면 사람과 기계의 판단이 어디서 갈리는지 볼 수 있습니다.
그리고 LLM 심사자는 그것을 검증할 때 쓴 사람의 라벨이 믿을 만한 만큼만 믿을 수 있습니다. 심사자 ↔ 사람 정렬 대시보드는 심사자가 사람과 얼마나 잘 맞는지 알려 주고, 심리측정과 Truth Serum은 그 사람들의 라벨에 신뢰구간을 붙여 줍니다. “심사자가 사람과 일치한다”는 말이 느낌이기를 그만두고 구간이 붙은 주장이 됩니다.
그 밖의 것들
문서 간 이벤트 주석, 대화와 트레이스에 대한 턴 단위 주석, 전체 화면 편집기를 갖춘 살아 있는 문서형 코드북, 선택적 OCR이 붙은 PDF 페이지 간 연결, 코호트별 스키마를 지정하는 RBAC 역할, 그리고 10개 언어로 제공되는 관리자 및 어노테이터 대시보드가 있습니다.
설치도 가벼워졌습니다. AI SDK가 이제 지연 로딩되므로 pip install potato-annotation만 하면 AI SDK를 하나도 끌어오지 않고, 부팅 시간도 약 2.0초에서 0.7초로 줄어듭니다.
받는 방법
pip install --upgrade potato-annotationPotato는 무료이고, GPL-3.0-or-later로 공개된 오픈소스이며, 직접 호스팅할 수 있습니다. 위의 일곱 기능은 모두 켜서 쓰는 방식이고 작업 종류를 가리지 않으며, 어느 것도 LLM을 요구하지 않습니다. 데이터가 기관 밖으로 나갈 수 없거나 예산이 토큰당 청구서를 감당할 수 없다면 이 점이 중요합니다.
Potato 2.0은 ACL 2026(System Demonstrations)에 발표되었습니다. 연구에 Potato가 도움이 되었다면 인용할 논문은 그것입니다.
빠른 시작으로 시작하거나, 새로운 기능을 훑어보거나, 오차 막대가 붙은 라벨과 골드 라벨 없는 품질 관리의 심층 글을 읽어 보십시오.