vibe-bench← 리더보드

측정 방법

재기 전에 방법을 못 박아 둡니다

무엇을·어떻게 잴지를 결과가 나오기 전에 정해 둡니다. 그래야 유리한 잣대를 나중에 골라 붙이는 일이 원천적으로 막힙니다. 아래는 그 방법과 축별 표본·측정일·한계입니다.

① 왜 방법을 미리 공개하나요

유리한 잣대 사후 선택 차단

결과를 본 뒤 “이 지표가 우리한테 좋네”라며 잣대를 고르면 무엇이든 이길 수 있습니다. 그래서 지표·표본·성공기준을 먼저 못 박습니다.

모델에 유리하게

비교 대상 모델에는 “확신하는 것만·모르면 기권”이라고 일러두고, 환각을 줄이는 조건으로 호출합니다. 상대를 약화시키지 않습니다.

외부·객관으로만 채점

성공 여부는 우리 점수가 아니라 GitHub 실존·출력 분산·근거 일치도 같은 외부·객관 신호로만 판정합니다(자기참조 금지).

② 무엇을 쟀나요 — 축별 표본·측정일

각 축의 표본 크기와 실제 측정일입니다. 표본·날짜는 전부 원본 데이터에서 그대로 가져옵니다.

표본측정일
같은 입력·같은 결과기획 5종 × 5회 반복2026년 6월 26일
진짜로 존재한 인용기획 10종 × 5시스템 · 인용 60개 실존 검증2026년 6월 29일
전문 범위 밖 보류범위 밖 8종 + 범위 안 10종2026년 6월 29일
우리가 잘못 경고할 확률동결셋 16개(가짜 8 + 실존 8)2026년 6월 30일
환각을 잡아낸 비율진짜 환각 40개(기획 10 × 패널 2모델)2026년 6월 30일
“우리가 최초” 주장 검증범위 안 20종(낙관 전제 10)2026년 7월 2일

코퍼스 v2026-06-15 스냅샷 기준.

③ 한계 — 숨기지 않습니다

표본이 작으면 정직한 상한이 넓습니다

우리가 잘못 경고할 확률은 관측상 0.0%이지만, 경고 건수가 8건으로 작아 Wilson 95% 신뢰구간 상한은 32.4%까지 열려 있습니다. 관측값만 자랑하지 않고 상한을 함께 공개합니다.

  1. 0.0%
    관측
  2. 32.4%
    95% 상한

2026년 6월 30일 측정동결셋 16개

코퍼스는 스냅샷 · 못 이긴 축도 있습니다
  • 코퍼스는 v2026-06-15 시점의 스냅샷이라, 빠르게 크는 repo의 별 수는 라이브와 ±30%를 넘을 수 있습니다(실존하는 repo, 수치만 과거값).
  • “우리가 최초” 주장 축은 우위가 없었습니다(우리 − 모델 = 0.00) — 노골적 주장은 모델도 스스로 잡기 때문. 이 무우위를 승리와 같은 크기로 공개합니다.
  • 범위 밖 기획 일부는 유사도 게이트를 통과해 채점됐습니다 — 다만 낮은 점수로 약한 적합도를 드러냅니다. 게이트의 한계라 그대로 공개합니다.

원본 데이터

축별 결과는 원본 JSON을 그대로 내려받을 수 있습니다.

어떤 기능이 실제로 도움이 되는지 확인하기 위해 익명 이용 통계를 수집합니다. 기획서·파일명·대화 내용은 보내지 않습니다.