부분 성공은 실재하는 결과다: 로봇 에피소드에 주석 달기
로봇 시연은 대부분 부분 성공이고, 이진 결과는 그것을 버립니다. 타임라인 형태의 주석 화면이 반드시 갖춰야 할 것들을, 최솟값·최댓값 간축부터 사후 재라벨링까지 살펴봅니다.
로봇 시연은 동기화된 여러 카메라 스트림에 더해 관절 위치, 그리퍼 상태, 힘토크, 보상 같은 여러 수치 시계열이며, 그 전부가 프레임으로 색인되어 있습니다. 그에 대해 물을 만한 모든 질문은 시간에 관한 것입니다. 파지는 언제 시작되었는가, 언제 실패했는가, 매 순간 완료에 얼마나 가까웠는가.
그러므로 인터페이스는 양식이 아니라 타임라인이어야 합니다. 그러기 위해 무엇이 필요했는지 적어 둡니다.
부분 성공이 가장 흔한 결과다
첫 설계 결정은 결과의 어휘였고, 손쉽게 떠오르는 답은 틀렸습니다.
성공이냐 실패냐는 자연스러운 이진값이고, 신호를 파괴합니다. 실제 로봇 데이터에서는 부분 성공이 가장 흔한 결과입니다. 팔이 물체를 테이블에서 들어 올렸다가 떨어뜨렸다. 블록을 맞는 통에 넣었지만 칸을 틀렸다. 시간 초과 2초 뒤에 과제를 끝냈다.
이것들을 "실패"로 밀어 넣으면 아예 움직이지 않은 팔과 구별되지 않습니다. "성공"으로 밀어 넣는 것은 더 나쁩니다. 어느 쪽으로 대응시켜 학습한 정책이든 실제로 일어난 일에 대해 사실이 아닌 것을 배웁니다.
세 가지 결과에 실패 원인 분류 체계 — 파지 실패, 물체 미끄러짐, 충돌, 물체 오인, 위치 오인, 시간 초과 — 를 붙이면, 실패를 세는 데 그치지 않고 분석할 수 있게 됩니다.
신호는 탭 뒤가 아니라 영상 옆에 둔다
이 대목에는 출판된 근거가 있습니다. ATLAS(빈 공과대학교, 2026)는 고유수용 시계열을 영상과 나란히 보여주면 영상만 쓰는 도구에 비해 경계 오차가 줄어든다고 보고합니다. 그 결과가 Potato가 애초에 이 레인들을 그리는 이유입니다.
실제 에피소드를 보면 곧바로 납득이 됩니다. 파지 실패는 카메라에서 분명해지기 여러 프레임 전에 그리퍼와 손목 힘 파형에 나타납니다. 그리퍼가 닫히고, 힘은 올라오지 않으며, 한참 뒤에야 영상에 빈 손이 보입니다.
레인이 탭 뒤에 있으면 주석자는 열지 않습니다.
평균이 아니라 최솟값·최댓값으로 간축한다
30Hz로 찍은 30초 에피소드는 계열마다 900개 표본이고, 이것을 폭 300픽셀 남짓한 레인에 그립니다. 무언가는 버려야 합니다.
평균 간축은 정확히 버려서는 안 되는 것을 버립니다. 한 프레임짜리 힘 스파이크가 곧 그 사건인데, 이웃 값과 평균 내면 그것이 통째로 사라집니다. 레인은 매끄러워 보이고 접촉의 순간은 없어집니다.
최솟값·최댓값을 보존하는 간축은 각 구간의 양극단을 남기므로 한 프레임짜리 스파이크가 픽셀까지 살아남습니다. 작은 구현 세부지만, 그 레인이 애초에 쓸모가 있는지를 결정합니다.
층마다 비용이 아주 다르다
주석 층은 셋이고, 그 비용은 비교가 되지 않습니다.
| 층 | 에피소드당 비용 |
|---|---|
| 단계 분할 | 초 |
| 결과와 원인 | 초 |
| 조밀한 진행 보상 | 분 |
그래서 각 층은 따로 설정할 수 있고, 대부분의 프로젝트는 일부만 켭니다. 셋 모두를 협상 불가한 하나의 양식으로 내놓았다면 보상 곡선 때문에 아무도 연구를 끝내지 못했을 것입니다.
사후 재라벨링은 실패를 데이터로 바꾼다
기록된 과제에서 실패한 에피소드가 다른 과제의 성공 시연인 경우는 자주 있습니다. 팔이 왼쪽 통에 블록을 놓으려다 오른쪽에 놓았다면, 그것은 기록된 지시에 대한 실패이자 다른 지시에 대한 깔끔한 성공입니다.
그 에피소드가 실제로 보여주는 것을 모으는 데는 주석 시점에 텍스트 칸 하나면 되고, 나중에는 되찾을 수 없습니다. 쓸지 확신이 없어도 물어 두십시오.
세 가지 질문, 세 가지 일치도 측도
세 층은 서로 다른 종류의 답이므로 세 가지 측도가 필요합니다.
- 단계 경계 — 시간 IoU
- 결과 라벨 — Krippendorff's α
- 보상 곡선 — ICC와 Pearson
각각을 커버리지와 함께 보고합니다. 타임라인의 5%에서 계산된 상관은 나머지 95%에 대해 아무것도 말해 주지 않으며, 커버리지가 없는 계수는 마치 전체를 다룬 것처럼 읽힙니다.
특히 경계에서는 허용 오차가 중요합니다. 0.25초에서의 일치도와 2초에서의 일치도는 서로 다른 주장이므로, 보고서는 하나를 고르는 대신 허용 오차를 스윕합니다.
형식
LeRobot v2, RLDS/TFDS, HDF5(RoboMimic와 ALOHA), ROS bag 모두 같은 필드로 들어옵니다. 내보내기는 LeRobot v2와 프레임별 JSONL 사이드카이므로, 읽기 전용 공개 데이터셋도 재배포 없이 당신의 주석을 함께 실어 나를 수 있습니다.
Potato가 답이 아닌 경우
ATLAS는 ROS bag을 대상으로 단독 주석자의 경계 정밀도에 특화해 만들어졌고 그 점에서 더 낫습니다. ELAN과 BORIS는 여전히 행동 코딩의 표준입니다. Rerun과 Foxglove는 로보틱스 시각화 도구로 최고입니다.
Potato가 더하는 것은 다중 주석자를 지원하고, 웹에 배포되며, 그 결과에 대한 일치도 통계를 갖추었다는 점입니다. 한 사람이 주석을 단다면 ATLAS를 쓰십시오.