영상에 여러 사람이 잡힐 때 누구를 분석 대상으로 고를 것인가를 정하는 selector를 놓고 후보 5종을 비교해 왔다. 마지막까지 남은 A-pose와 B-pose 중 하나를 고르려고 60건을 새로 판독했는데, 결론은 “고를 수 없다”였다. 그리고 검수를 더 해도 못 고른다는 것까지 확인했다.

어디까지 와 있었나

selector 구성
A-pose centrality 0.45 + pose_quality 0.35 + size 0.20
B-pose centrality 0.35 + pose_quality 0.25 + size 0.15 + continuity 0.25

차이는 continuity — 직전 프레임에서 보던 사람을 계속 볼지에 가점을 주느냐다. 두 selector는 5,404프레임 중 596프레임(11%) 에서만 다르게 고르고, 나머지 합의 프레임에서는 둘 다 81/91로 완전히 같다. 그래서 순위는 전적으로 불일치 프레임이 결정한다.

문제는 그중 정답 라벨이 있는 것이 7건뿐이었고, B-pose를 앞세우던 +2 우위가 그 7건 중 2건에 100% 의존했다는 것이다. 게다가 하필 그 2건은 판독 직전 대화에서 정답과 양쪽 selector의 선택이 이미 노출된 상태에서 본 것이라 blind가 아니었다.

그래서 격리해서 다시 봤다

판독용 폴더를 따로 만들고 이미지 60장(기존 7건 + 신규 53건)과 안내문만 넣었다. 판독자는 selector 선택도, 기존 정답도, 이전 판독 결과도 보지 않았다. 모든 후보 상자는 같은 색·같은 굵기로 그렸고 상자 위에는 번호만 적었다.

결과 1 — 오염을 걷어내니 오히려 뒤집혔다. 기존 7건은 A-pose 3 : B-pose 2로 A가 앞선다. 라벨 출처를 바꿔 가며 보면 +2 → +1 → −1로 이동한다.

결과 2 — 표본을 60건으로 넓히면 방향은 다시 B지만 유의하지 않다.

  판정 A-pose B-pose B비율 p
전체 43 17 26 60.5% 0.22
기존 7건 5 3 2 40.0% 1.00
신규 53건 38 14 24 63.2% 0.14

클립 단위로 묶어 부트스트랩하면 B비율 95% 구간이 [0.40, 0.80] 이다. 0.5가 한가운데 들어 있다.

결과 3 — 남은 우세는 표본을 어떻게 뽑았는지로 설명된다. 신규 53건은 “판별에 정보량이 큰 프레임”을 점수로 매겨 상위에서 뽑았는데, 그 점수에 b_locked(B가 대상에 고착)와 a_pose_switch(A가 방금 사람을 바꿈)가 들어 있었다. 가설과 같은 방향으로 기울어진 항이다. 실제로 B의 우세는 a_pose_switch=1인 프레임에 몰려 있고(B 18 : A 10) 그 밖에서는 거의 사라진다 (B 8 : A 7).

핵심 — 더 봐도 안 갈린다

관측된 60.5%가 참값이라고 쳐도 α=0.05로 0.5와 구분하려면 판정 가능 340건이 필요하다. 그런데 이 데이터셋이 내놓을 수 있는 검수 프레임은 최대 69장(같은 구간에서 여러 프레임을 뽑으면 서로 거의 중복이라 독립 표본으로 셀 수 없다), 판정 가능 약 49건이다. 이미 60장을 봤고 남은 여유는 9장.

7배 부족하다. 39클립 안에서는 사람을 붙여 검수해도 결론이 안 난다.

대신 알게 된 것

승패가 클립 안에서 몰린다. 2건 이상 판정된 11클립 중 6클립이 만장일치다.

  • N5zWQkoLM3M — A 4 : B 0. B-pose가 74프레임에서 잘못 잡은 대상을 continuity로 계속 붙들고 있는 케이스로, 이미 회귀 감시 목록에 올려 둔 것이었다. 오염 없는 독립 판독이 그 진단을 그대로 재현했다.
  • 3USSmzO001k — B 5 : A 0. 반대로 continuity가 확실히 이긴다.

즉 데이터가 말하는 것은 “A가 낫다”도 “B가 낫다”도 아니다. continuity는 처음 잡은 대상이 맞으면 이기고 틀리면 진다.

다음

질문을 “어느 selector인가”에서 “continuity를 언제 신뢰할 것인가” 로 바꾼다. 그리고 그 질문은 사람 라벨 없이도 잴 수 있다 — 우리 지표는 프레임 시계열 위에서 계산되므로 클립 중간에 대상이 바뀌면 관절각 궤적 자체가 오염된다. 대상 전환 빈도(A-pose 6.8% → B-pose 1.8%)와 잘못된 대상에 고착된 구간의 길이를 함께 재면 위 트레이드오프가 그대로 숫자로 나온다.

production selector는 여전히 미확정이다. 판정 파이프라인 코드는 이 작업에서 한 줄도 바뀌지 않았고, 기존 라벨도 수정하지 않았다. 이번 판독 역시 사람 검수가 아니라 AI 단독 판독이므로 정답으로 승격하지 않았다.

기록과 산출물은 저장소 안 agent/eval/phaseA/에 있다 (전체 보고서: eval_b4/clean_review_report.md).