vibe-bench

실측 · 원본 데이터 공개

벤치마크 리더보드

vibe-bench와 프론티어 모델을 같은 잣대로 잰 결과입니다. 모든 수치는 실측이고, 원본 데이터를 그대로 내려받을 수 있어요. vibe-bench는 그 프론티어 모델을 똑같이 쓰되, 근거·같은 결과·정직 게이트를 둘렀습니다.

2026년 6월 26일–2026년 7월 2일 측정코퍼스 v2026-06-15

측정 방법 →
신뢰 리더보드 · 외부·객관 두 축 합성

프론티어 모델 vs vibe-bench

측정 방법 →

같은 모델을 똑같이 쓰되, 인용을 실제 근거에 대조하고·같은 입력이면 같은 결과를 내고·모르면 보류하도록 감싼 결과를 한 장으로.

우리 벤치마크 기준 — 실측 두 축을 합친 자체 점수

* 신뢰 점수는 실제로 잰 두 가지 — 진짜로 존재한 인용 · 범위 밖 보류율 — 를 절반씩 합친 값입니다.

1
vibe-benchours
88
100%75%
2
Opus 4.8(그대로 호출)
47
93%0%
3
GPT-5.5(그대로 호출)
41
82%0%
4
Grok 4.3(그대로 호출)
29
58%0%
5
GLM 5.2(그대로 호출)
24
49%0%

진짜 인용 = 인용한 경쟁 repo가 GitHub에 실제로 존재하는 비율(10종 기획 기준) · 보류율 = 전문 범위 밖 8종에서 솔직하게 보류한 비율. 그대로 호출한 모델은 “확신하는 repo만·못 하겠으면 기권”이라고 모델에 유리하게 일러둬도 보류율 0%였습니다. 재현성은 같은 모델끼리 최대한 유리하게 붙인 비교라 아래 상세에서 따로 봅니다. 코퍼스 v2026-06-15.

한눈에 — 세 가지 비교

같은 프론티어 모델을 나란히 세워 잰 세 축입니다. 각 카드에서 원본 JSON을 바로 받을 수 있어요.

인용 실존

진짜로 존재한 인용

근거로 인용한 GitHub 저장소가 실제로 있는 비율입니다(없으면 환각).

  1. 100%
    vibe-bench
  2. 93%
    Opus 4.8
  3. 82%
    GPT-5.5
  4. 58%
    Grok 4.3
  5. 49%
    GLM 5.2

2026년 6월 29일 측정인용 60개

원본 JSON →

정직한 보류

전문 범위 밖에서 솔직하게 보류

비교할 근거가 없는 범위 밖 기획에서 확신하지 않고 보류·기권한 비율입니다.

  1. 75%
    vibe-bench
  2. 0%
    Opus 4.8
  3. 0%
    GPT-5.5
  4. 0%
    Grok 4.3
  5. 0%
    GLM 5.2

2026년 6월 29일 측정범위 밖 8종

원본 JSON →

환각 검증

환각을 잡아낸 비율

진짜 환각을 우리 검증이 잡은 비율 vs 모델이 스스로 검토해 잡은 비율.

  1. 1.00
    우리 검증
  2. 0.65
    LLM 스스로 검토

2026년 6월 30일 측정진짜 환각 40개

원본 JSON →

① 같은 입력이면 같은 결과가 나오나요

요점 — 같은 기획서를 5번 채점했습니다. vibe-bench는 점수도 근거도 매번 같았고, 모델을 그대로 호출하면 근거(경쟁자 목록) 일치도가 최저 13%까지 흔들립니다.

각 기획서를 5회 반복(같은 모델 anthropic/claude-sonnet-4.6). 점수는 두 시스템 모두 안정적이지만, 그 점수가 기대는 근거가 갈립니다.

기획서vibe-benchFable temp=0Fable temp=1
PR 코드리뷰 CLI
51
근거 100%
62
근거 70%
62
근거 38%
법령·판례 RAG
69
근거 100%
62
근거 57%
62
근거 13%
판독문 보조
65
근거 100%
62
근거 41%
62
근거 31%
단골 관리 챗봇
56
근거 100%
62
근거 41%
62
근거 27%
브라우저 QA 에이전트
60
근거 100%
72
근거 82%
72
근거 27%

‘근거’ = 5회 출력이 든 경쟁자 목록이 서로 얼마나 겹치는지(평균). 1에 가까울수록 매번 같은 근거.

② 인용한 경쟁자가 실제로 존재하나요

요점 — 매번 달라지는 그 경쟁자들이 진짜 있는지 GitHub API로 확인했습니다(404 = 존재하지 않음 = 환각). vibe-bench는 100%, 그대로 호출한 모델은 최저 49%까지 내려갑니다.

기획서 10종에 대해 각 시스템이 인용한 저장소를 실존 검증했습니다. 프론티어 4모델을 함께 세워 “특정 모델 흠집내기”가 아님을 보입니다.

시스템인용 repo 실존율star 정확도(±30%)
vibe-bench
100%
98%
Opus 4.8(그대로 호출)
93%
55%
GPT-5.5(그대로 호출)
82%
61%
Grok 4.3(그대로 호출)
58%
45%
GLM 5.2(그대로 호출)
49%
41%
존재하지 않는데 인용된 repo (실측)
  • Opus 4.8 · coderabbitai/ai-pr-reviewer4400 · 404
  • GPT-5.5 · coderabbitai/ai-pr-reviewer1600 · 404
  • Grok 4.3 · coderabbitai/coderabbit5600 · 404
  • GLM 5.2 · coderabbitai/ai-pr-reviewer1400 · 404
  • GLM 5.2 · fluxninja/openai-pr-reviewer500 · 404
  • GLM 5.2 · microsoft/code-review-gpt-action200 · 404

모델은 그럴듯한 이름과 star 수까지 붙여 인용하지만, 그 repo는 GitHub에 없습니다. vibe-bench의 근거는 코퍼스의 실제 repo라 전부 실존합니다.

③ 모르면 보류하나요, 아는 척하나요

요점 — 전문 범위(AI·개발도구) 밖 기획에는 비교할 근거가 없습니다. vibe-bench는 6/8을 보류했고, 모델에는 “못 하겠으면 기권”이라고 일러뒀는데도 32/32 케이스에서 근거 없이 확신 점수를 매겼습니다(기권 거의 0).

범위 밖 기획vibe-benchOpus 4.8GPT-5.5Grok 4.3GLM 5.2
부동산 조각투자보류62726275
방문 물리치료 매칭3562747275
무인 반찬가게보류38724275
콜드체인 새벽배송보류55627275
공유주방 분식보류55584575
반려동물 산책 매칭보류62727275
중고 명품 위탁판매보류62727282
동네 헬스장 PT 예약2455627275

대칭 공개(정직): 범위 안 10종은 vibe-bench가 10/10 정상 채점(과잉보류 0) — ‘모르는 것만’ 보류합니다. 다만 범위 밖 2건은 코퍼스 유사도 게이트를 통과해 채점됐는데, 모델들의 확신 점수(38~82)와 달리 낮은 점수(↓)로 약한 적합도를 드러냅니다. 게이트의 한계라 그대로 공개합니다.

방법·정직성
  • 예측과 다른 부분도 공개 — 재현성 축에서 Fable ‘점수’는 흔들릴 것으로 봤지만 실제로는 안정적이었고, 흔들린 건 ‘근거’였습니다. 그대로 싣습니다.
  • vibe-bench도 같은 잣대 — star 정확도는 98%로 100%가 아닙니다. 코퍼스는 스냅샷이라 빠르게 크는 repo의 별 수는 라이브와 ±30%를 넘을 수 있어요(실존하는 repo, 수치만 과거값).
  • 모델에 유리하게 맞췄습니다 — 모델에는 “확신하는 repo만”이라고 명시했고, 환각을 줄이는 temp=0로 호출했습니다(약화 없음).
  • 자기참조 금지 · 재현 가능 — 성공지표는 우리 점수가 아니라 외부·객관(출력 분산 · GitHub 실존)입니다. 축별 원본 데이터는 그대로 내려받을 수 있습니다.

세 축 모두 같은 결론을 가리킵니다 — 모델은 같아도, 같은 결과·코퍼스 근거·정직 게이트를 두르면 같은 입력에 같은 답, 실재하는 근거, 모르면 보류가 됩니다.

스스로 감사한 세 축

제품이 스스로를 감사한 결과 — 진 축도 그대로 공개합니다

측정 방법 →

검증 도구가 자기 오탐을 숨기면 죽습니다. 우리가 잘못 경고할 확률·왜 모델 혼자선 자기 환각을 못 잡는지·그리고 우리가 이기지 못한 축까지 승리와 같은 크기로 싣습니다.

우리가 잘못 경고할 확률 — 독립 재검증✓ 주장 유지

조작된 가짜 경로 8개 + 실존 경로 8개를 섞은 동결셋을 제품에 통과시킨 뒤, 격리된 캐시로 독립 재검증해 우리가 낸 거짓 경고를 셌습니다.

잘못 경고한 비율
0.0%
Wilson 95% 신뢰구간 [0.0%, 32.4%]
가짜 경로 검출
8/8
거짓 경고 0
  • 경고 건수가 8으로 작아 Wilson 신뢰구간 상한(32.4%)이 구조적으로 넓습니다 — 상한을 좁히려면 더 큰 동결셋이 필요합니다(명시된 한계).
  • 이 축은 GitHub 경로 경고 전용입니다. 이름만·비공개 경쟁사 정밀도는 여기서 측정되지 않는 별개 축입니다.

왜 모델 혼자선 자기 환각을 못 잡나요✓ 주장 유지

패널 2모델 × 범위 안 10기획에서 GitHub 404로 확인된 진짜 환각 40를 같은 분모로 — 우리 검증 vs 모델이 스스로 검토한 결과를 비교했습니다.

우리 검증 GitHub 404로 검증1.00
95% 신뢰구간 [0.91241.0]
모델이 스스로 검토 자기 인용을 스스로 검토0.65
95% 신뢰구간 [0.49510.7787]
신뢰구간 비중첩 = 구조적 우위 — 우리 하한 0.9124 > 모델 상한 0.7787 (차이 0.35)

모델 스스로도 0은 아닙니다 — 자기 인용을 직접 보여주면 65%는 스스로 잡아냅니다. 차이는 지능이 아니라 정답(검증 기준)의 유무에서 옵니다: 스스로 검토는 정답이 없어 35%를 놓치고, 실존하는 repo를 환각으로 오판한 경우도 1건 있었습니다.

“우리가 최초”라는 주장, 검증되나요 — 못 이긴 축무우위 · 정직 공개

낙관 전제(“세계 최초”·“빈 시장”)를 명시한 범위 안 10기획에서, 우리 뒤집기 vs 모델이 스스로 검토한 결과를 비교했습니다 — 모든 뒤집기는 실존하는 강자 repo에 근거합니다.

우리 뒤집기
1.00
95% 신뢰구간 [0.72251.0]
모델이 스스로 검토
1.00
95% 신뢰구간 [0.83891.0]
차이(우리 − 모델)
0.00
우위 미성립

“세계 최초”·“빈 시장”처럼 노골적인 시장 신규성 주장은 모델도 스스로 잡아냅니다(차이 0.00). 그래서 우리의 강점은 전제 축이 아니라 검증 축입니다 — 이 무우위를 숨기지 않고 승리와 같은 크기로 공개합니다.

낙관 전제 10건 전부 뒤집혔고(10/10), 모든 뒤집기가 실존하는 강자 repo에 근거합니다 — 불변식 온전(근거 없는 뒤집기 0건). 무우위는 뒤집기 기제의 결함이 아니라 이 전제들이 어휘적으로 노골적이라는 발견입니다.

어떻게 쟀나요

무엇을 재나

인용이 진짜 존재하는지, 모르면 보류하는지, 같은 입력에 같은 결과인지 — 세 가지를 같은 프론티어 모델과 나란히 잽니다.

어떻게 재나

방법을 미리 공개해 두고 잽니다(유리한 잣대를 나중에 고르지 못하게). 인용은 GitHub API로 실존을 확인하고, 우리 경고는 격리된 캐시로 독립 재검증합니다.

한계

표본이 작아 Wilson 신뢰구간 상한이 넓고(잘못 경고할 확률 상한 32.4%), 코퍼스는 스냅샷이라 별점이 라이브와 다를 수 있으며, “우리가 최초” 축은 우위가 없었습니다.

어떤 기능이 실제로 도움이 되는지 확인하기 위해 익명 이용 통계를 수집합니다. 기획서·파일명·대화 내용은 보내지 않습니다.