Download leaderboard.json from mayafree/typed-decision-leaderboard: direct link, hf CLI and curl.
- Browser
- Download file 35.9 kB
-
https://huggingface.co/spaces/mayafree/typed-decision-leaderboard/resolve/main/leaderboard.json
- Command line
-
hf download hf://spaces/mayafree/typed-decision-leaderboard/leaderboard.json
-
curl -L -o leaderboard.json https://huggingface.co/spaces/mayafree/typed-decision-leaderboard/resolve/main/leaderboard.json
35.9 kB
| { | |
| "version": "2026-09-25 v4 (Nimble 0.6222 정정·decider 0.6028 추가·축불일치 6종)", | |
| "axis": "사실 검증 (근거 문서 없음)", | |
| "dataset": { | |
| "n": 2018, | |
| "n_wrong": 508, | |
| "domains": 5, | |
| "note": "문항 원문은 공개하지 않습니다 — KMMLU 는 CC BY-ND(변형 금지), CLIcK 은 라이선스 미표기, GPQA 는 접근 승인제이며 상용 모델 출력의 재배포 약관도 확인되지 않았습니다. 점수·라벨·채점 코드는 전부 공개합니다." | |
| }, | |
| "entries": [ | |
| { | |
| "name": "JEV", | |
| "org": "TypeSafe AI", | |
| "auc": 0.735, | |
| "kind": "verifier", | |
| "size": "비공개", | |
| "latency": 0.59, | |
| "cost": "$0.024 / 1000건", | |
| "note": "Vercel AI Gateway · typesafe-ai/jev · 🔴지연 2.1초는 폐기 — 같은 자리에서 다시 재니 왕복 0.59초", | |
| "api": 1, | |
| "local": 0, | |
| "access": "api.typesafe.ai · 가중치 비공개", | |
| "refit": 0, | |
| "gen": 0, | |
| "url": "https://www.typesafe.ai/", | |
| "self_auc": "n/a", | |
| "ece_raw": 0.0381, | |
| "ece_cal": 0.0261, | |
| "latency_basis": "망 왕복", | |
| "division": "api" | |
| }, | |
| { | |
| "name": "ZTC (27B)", | |
| "org": "VIDRAFT", | |
| "auc": 0.7289, | |
| "kind": "verifier", | |
| "size": "27B", | |
| "latency": 3.6, | |
| "cost": "자체 GPU", | |
| "note": "생성 토큰 0개 · 한 번의 실행으로 전 분야를 함께 계산한 값(동봉 곡선 프로브로 재현됨)", | |
| "api": 1, | |
| "local": 1, | |
| "access": "VIDRAFT API · HF 가중치", | |
| "refit": 1, | |
| "gen": 0, | |
| "url": "https://huggingface.co/FINAL-Bench/ZTC-Judge-27B", | |
| "self_auc": 0.7322, | |
| "ece_raw": null, | |
| "ece_cal": 0.0245, | |
| "latency_basis": "자체 GPU", | |
| "division": "local" | |
| }, | |
| { | |
| "name": "ZTC (397B)", | |
| "org": "VIDRAFT", | |
| "auc": 0.7272, | |
| "kind": "verifier", | |
| "size": "397B MoE", | |
| "latency": null, | |
| "cost": "자체 GPU", | |
| "note": "생성 토큰 0개 · 한 번의 실행으로 전 분야를 함께 계산한 값(동봉 곡선 프로브로 재현됨)", | |
| "api": 1, | |
| "local": 1, | |
| "access": "VIDRAFT API · HF 가중치", | |
| "refit": 1, | |
| "gen": 0, | |
| "url": "https://huggingface.co/FINAL-Bench/Darwin-397B-ZTC", | |
| "self_auc": 0.7572, | |
| "self_note": "B200 · 객관식 4분야 1,793건 · 자기 정답률 62.1%", | |
| "division": "local" | |
| }, | |
| { | |
| "name": "GPT-5.2 (LLM 심판)", | |
| "org": "OpenAI", | |
| "auc": 0.7148, | |
| "kind": "judge", | |
| "size": "비공개", | |
| "latency": null, | |
| "cost": "$0.55 / 1000건", | |
| "note": "「이 답이 맞을 확률 0~100」 · 1,952/2,018 응답", | |
| "api": 1, | |
| "local": 0, | |
| "access": "API 전용", | |
| "refit": 0, | |
| "gen": "수십", | |
| "url": "https://platform.openai.com/docs/models", | |
| "self_auc": "n/a", | |
| "division": "api" | |
| }, | |
| { | |
| "name": "ZTC (9B)", | |
| "org": "VIDRAFT", | |
| "auc": 0.6506, | |
| "kind": "verifier", | |
| "size": "9B", | |
| "latency": null, | |
| "cost": "자체 GPU", | |
| "url": "https://huggingface.co/FINAL-Bench/ZTC-Judge-9B", | |
| "api": 1, | |
| "local": 1, | |
| "refit": 1, | |
| "gen": 0, | |
| "self_auc": "n/a", | |
| "note": "사다리 — 27B 와 같은 절차. 재난·안전은 기준선 아래라 그 분야에는 쓰지 말 것", | |
| "division": "local" | |
| }, | |
| { | |
| "name": "Qwen3-Next-80B (LLM 심판)", | |
| "org": "Alibaba", | |
| "auc": 0.6366, | |
| "kind": "judge", | |
| "size": "비공개", | |
| "latency": null, | |
| "cost": "$0.048 / 1000건", | |
| "note": "「이 답이 맞을 확률 0~100」 · 2,018/2,018 응답", | |
| "api": 1, | |
| "local": 1, | |
| "access": "API · 공개 가중치", | |
| "refit": 1, | |
| "gen": "수십", | |
| "url": "https://huggingface.co/Qwen/Qwen3-Next-80B-A3B-Instruct", | |
| "self_auc": "n/a", | |
| "division": "local" | |
| }, | |
| { | |
| "name": "ZTC (4B)", | |
| "org": "VIDRAFT", | |
| "auc": 0.636, | |
| "kind": "verifier", | |
| "size": "4B", | |
| "latency": null, | |
| "cost": "자체 GPU", | |
| "url": "https://huggingface.co/FINAL-Bench/ZTC-Judge-4B", | |
| "api": 1, | |
| "local": 1, | |
| "refit": 1, | |
| "gen": 0, | |
| "self_auc": "n/a", | |
| "note": "사다리 — 노트북·CPU·폐쇄망에서 돈다. 전문시험 0.7787 로 기준선 +0.065, 다른 분야는 여유가 작다", | |
| "division": "local" | |
| }, | |
| { | |
| "name": "길이·서식 기준선", | |
| "org": "(기준선)", | |
| "auc": 0.6223, | |
| "kind": "baseline", | |
| "size": "—", | |
| "latency": 0.0, | |
| "cost": "거의 0", | |
| "note": "답 길이·숫자·서식 10종만 사용 · 리더보드 규칙(2,018문항·분야제외·분야별 가중평균)으로 측정. 같은 특징을 전문시험 400문항·무작위 폴드로 재면 0.7036 이 나온다 — 자가 다르면 값이 달라진다", | |
| "api": null, | |
| "local": null, | |
| "per_domain": { | |
| "전문시험(법·수학·생물)": 0.7138, | |
| "생물·의학": 0.5908, | |
| "상식·다단계추론": 0.542, | |
| "재난·안전 지침": 0.5949, | |
| "과학추론": 0.7272 | |
| }, | |
| "latency_basis": "자체 GPU", | |
| "division": "base" | |
| }, | |
| { | |
| "name": "open-jev 4B", | |
| "org": "pngwn", | |
| "auc": 0.6101, | |
| "kind": "verifier", | |
| "size": "4B", | |
| "latency": null, | |
| "cost": "자체 GPU", | |
| "note": "JEV 공개 재구현판 · 🔑 제작자 Space(pngwn/open-jev)를 직접 호출해 2,018문항 전량 채점. 자체 재현 코드로 잰 값(0.5021)은 상류 구현과 달라 쓰지 않았다. 옛 등재값 0.6844 는 과학추론이 빈 문제였던 판이라 폐기", | |
| "api": 0, | |
| "local": 1, | |
| "access": "공개 가중치만", | |
| "refit": 1, | |
| "gen": 0, | |
| "url": "https://huggingface.co/pngwn/system-one-qwen3.5-4b-scorer", | |
| "self_auc": "n/a", | |
| "per_domain": { | |
| "전문시험(법·수학·생물)": 0.688, | |
| "생물·의학": 0.5469, | |
| "상식·다단계추론": 0.5583, | |
| "재난·안전 지침": 0.6207, | |
| "과학추론": 0.8063 | |
| }, | |
| "division": "local" | |
| }, | |
| { | |
| "name": "GPT-4o-mini (LLM 심판)", | |
| "org": "OpenAI", | |
| "auc": 0.5878, | |
| "kind": "judge", | |
| "size": "비공개", | |
| "latency": null, | |
| "cost": "$0.044 / 1000건", | |
| "note": "「이 답이 맞을 확률 0~100」 · 1,716/2,018 응답", | |
| "api": 1, | |
| "local": 0, | |
| "access": "API 전용", | |
| "refit": 0, | |
| "gen": "수십", | |
| "url": "https://platform.openai.com/docs/models", | |
| "self_auc": "n/a", | |
| "division": "api" | |
| }, | |
| { | |
| "name": "Gemini 2.5 Flash-Lite (LLM 심판)", | |
| "org": "Google", | |
| "auc": 0.5822, | |
| "kind": "judge", | |
| "size": "비공개", | |
| "latency": null, | |
| "cost": "$0.028 / 1000건", | |
| "note": "「이 답이 맞을 확률 0~100」 · 2,018/2,018 응답", | |
| "api": 1, | |
| "local": 0, | |
| "access": "API 전용", | |
| "refit": 0, | |
| "gen": "수십", | |
| "url": "https://ai.google.dev/gemini-api/docs/models", | |
| "self_auc": "n/a", | |
| "division": "api" | |
| }, | |
| { | |
| "name": "CLM-8B", | |
| "org": "Stanford·NVIDIA", | |
| "auc": 0.5704, | |
| "kind": "verifier", | |
| "size": "8B", | |
| "latency": 0.019, | |
| "cost": "자체 GPU", | |
| "note": "동결 Qwen3-8B + 75MB 투영 헤드 · 상태·행동 쌍타워 InfoNCE · 생성 토큰 0 · 공개 헤드(Contrastive-LM/CLM-v0.1-8B) 그대로 zero-shot · 「JEV 동급·최대 9배」 주장이나 이 시험지에서는 기준선(0.6223) 아래이고 5개 분야 전부 ZTC-27B 아래 · 젠 GPU2 · 응답 2018/2018 · 점수 고유값 1,960", | |
| "api": 1, | |
| "local": 1, | |
| "access": "공개 헤드(Apache-2.0) · JEV 호환 API", | |
| "refit": 1, | |
| "gen": 0, | |
| "url": "https://huggingface.co/Contrastive-LM/CLM-v0.1-8B", | |
| "self_auc": "n/a", | |
| "ece_raw": 0.22, | |
| "per_domain": { | |
| "전문시험(법·수학·생물)": 0.5448, | |
| "생물·의학": 0.5508, | |
| "상식·다단계추론": 0.5532, | |
| "재난·안전 지침": 0.5903, | |
| "과학추론": 0.7149 | |
| }, | |
| "latency_basis": "자체 GPU", | |
| "division": "local" | |
| }, | |
| { | |
| "name": "Patronus Lynx 8B", | |
| "org": "Patronus AI", | |
| "auc": 0.5179, | |
| "kind": "verifier", | |
| "size": "8B", | |
| "latency": 0.07, | |
| "cost": "자체 GPU", | |
| "note": "근거 검증용 설계 — 이 축과 다름", | |
| "api": 1, | |
| "local": 1, | |
| "access": "api.patronus.ai/v1/evaluate · 공개 가중치", | |
| "refit": 1, | |
| "gen": 1, | |
| "url": "https://huggingface.co/PatronusAI/Llama-3-Patronus-Lynx-8B-Instruct", | |
| "self_auc": "n/a", | |
| "latency_basis": "자체 GPU", | |
| "division": "local" | |
| }, | |
| { | |
| "name": "Laya-Typed-Decisions", | |
| "org": "Convai Innovations", | |
| "auc": 0.5144, | |
| "kind": "verifier", | |
| "size": "421M", | |
| "latency": 0.016, | |
| "cost": "자체 GPU · Apache-2.0", | |
| "note": "영어 전용 체크포인트 · 2,018/2,018 응답 · 🔑문맥 상한(512토큰) 검증: 상한 안에 들어간 1,604문항만으로 다시 재도 0.4943 — 잘림 때문이 아니다", | |
| "api": 0, | |
| "local": 1, | |
| "access": "자체 호스팅 전용 · Apache-2.0", | |
| "refit": 1, | |
| "gen": 0, | |
| "url": "https://huggingface.co/convaiinnovations/laya-typed-decisions", | |
| "self_auc": "n/a", | |
| "ece_raw": 0.2641, | |
| "ece_cal": 0.1059, | |
| "within_cap": 0.4943, | |
| "latency_basis": "자체 GPU", | |
| "division": "local" | |
| }, | |
| { | |
| "name": "모델 자기신고 확신도", | |
| "org": "(기준선)", | |
| "auc": 0.5, | |
| "kind": "baseline", | |
| "size": "—", | |
| "latency": 0.0, | |
| "cost": "0", | |
| "note": "모델에게 직접 확신도를 물어본 값", | |
| "api": null, | |
| "local": null, | |
| "latency_basis": "자체 GPU", | |
| "division": "base" | |
| }, | |
| { | |
| "name": "Laya-Multilingual", | |
| "org": "Convai Innovations", | |
| "auc": 0.4796, | |
| "kind": "verifier", | |
| "size": "322M", | |
| "latency": 0.015, | |
| "cost": "자체 GPU · Apache-2.0", | |
| "note": "noul=P(true) · 생성 토큰 0개 · 우리와 같은 축. 제작사는 자체 벤치에서 JEV 를 이겼다고 공개(0.766 vs 0.727)하나 이 시험지에서는 우연 이하 · 🔑루트 체크포인트(convaiinnovations/laya)도 같이 쟀다: 전체 0.4904 · 상한 안 1,604문항 0.4627", | |
| "api": 0, | |
| "local": 1, | |
| "access": "자체 호스팅 전용 · Apache-2.0", | |
| "refit": 1, | |
| "gen": 0, | |
| "url": "https://huggingface.co/convaiinnovations/laya-multilingual", | |
| "self_auc": "n/a", | |
| "ece_raw": 0.4985, | |
| "ece_cal": 0.1171, | |
| "latency_basis": "자체 GPU", | |
| "division": "local" | |
| }, | |
| { | |
| "name": "Bespoke Nimble 9B", | |
| "org": "Bespoke Labs", | |
| "auc": 0.6222, | |
| "kind": "verifier", | |
| "size": "9B", | |
| "division": "local", | |
| "gen": 0, | |
| "api": 0, | |
| "local": 1, | |
| "refit": 1, | |
| "access": "공개 어댑터 · 제작자 inference.py(SHA-256 통과)", | |
| "url": "https://huggingface.co/bespokelabs/Bespoke-Nimble-9B", | |
| "note": "B200에서 제작자 동봉 코드로 측정 0.6222 — 길이·서식 기준선(0.6223)과 0.0001차 사실상 동률. 자가보고 90.1%는 자체 324 홀드아웃(noul 98~100)이고, 우리 정본 2,018문항(한국어 KMMLU·의학·재난·GPQA)에선 동률. n=2,016(2,048토큰 초과 2건 거부). 음성대조(라벨 20회 셔플) 0.4996", | |
| "self_auc": "n/a", | |
| "per_domain": { | |
| "전문시험(법·수학·생물)": 0.6528, | |
| "생물·의학": 0.5259, | |
| "상식·다단계추론": 0.5542, | |
| "재난·안전 지침": 0.6332, | |
| "과학추론": 0.5759 | |
| } | |
| }, | |
| { | |
| "name": "decider-2b", | |
| "org": "Mapika", | |
| "auc": 0.6028, | |
| "kind": "verifier", | |
| "size": "2B", | |
| "division": "local", | |
| "gen": 0, | |
| "api": 0, | |
| "local": 1, | |
| "refit": 1, | |
| "access": "공개 가중치 · 제작자 decide()", | |
| "url": "https://huggingface.co/Mapika/decider-2b", | |
| "note": "Qwen3.5-2B-Base 전체 FT · B200에서 제작자 동봉 decide()로 측정 0.6028 — 기준선 아래. 다운로드 최다(130K). n=2,018", | |
| "self_auc": "n/a" | |
| } | |
| ], | |
| "off_ranking": [ | |
| { | |
| "name": "Vectara HHEM-2.1", | |
| "org": "Vectara", | |
| "auc": 0.4852, | |
| "size": "184M", | |
| "latency": 0.02, | |
| "why": "「주어진 문서에 들어맞는가」를 보는 도구입니다. 이 시험지에는 문서가 없습니다.", | |
| "evidence": "HHEM 점수와 「문제문 단어 베끼기 비율」의 상관 = +0.753", | |
| "api": 1, | |
| "local": 1, | |
| "url": "https://huggingface.co/vectara/hallucination_evaluation_model", | |
| "latency_basis": "자체 GPU" | |
| }, | |
| { | |
| "name": "System One Mini (69M)", | |
| "org": "—", | |
| "why": "5개 고정 결정만 · 카드에 'not a reproduction of Jev or RLCD' 명시", | |
| "axis_mismatch": true | |
| }, | |
| { | |
| "name": "NanoJev (0.6B)", | |
| "org": "C-Tianyu", | |
| "why": "Maze·Snake·ViZDoom 게임 행동 분포 — 사실검증 축 아님", | |
| "axis_mismatch": true | |
| }, | |
| { | |
| "name": "GLiFormer Large v1", | |
| "org": "—", | |
| "why": "개체명·관계 추출 인코더 · 정오 판정 머리 없음 · 별도 라이브러리", | |
| "axis_mismatch": true | |
| }, | |
| { | |
| "name": "DeepMost sales-conversion", | |
| "org": "—", | |
| "why": "영업 전환 RL · 가중치 미공개", | |
| "axis_mismatch": true | |
| }, | |
| { | |
| "name": "LFM2.5-350M-RLCD", | |
| "org": "LiquidAI", | |
| "why": "베이스 무변경 제약 디코딩 — 학습된 검증기 아님", | |
| "axis_mismatch": true | |
| }, | |
| { | |
| "name": "Qwen-2.5-1B-RLCD", | |
| "org": "—", | |
| "why": "가중치 없음 · 디코딩 기법", | |
| "axis_mismatch": true | |
| } | |
| ], | |
| "pending": [ | |
| { | |
| "name": "GPT-6 Astra (LLM 심판)", | |
| "org": "OpenAI — 측정 중" | |
| } | |
| ], | |
| "per_domain": { | |
| "전문시험(법·수학·생물)": { | |
| "n": 400, | |
| "n_wrong": 80, | |
| "jev": 0.7981, | |
| "ztc397": 0.8643, | |
| "ztc": 0.8462, | |
| "lynx": 0.5454, | |
| "hhem": 0.4759, | |
| "base": 0.7138, | |
| "ztc9": 0.7623, | |
| "ztc4": 0.7787, | |
| "ojev": 0.688, | |
| "clm": 0.5448 | |
| }, | |
| "생물·의학": { | |
| "n": 917, | |
| "n_wrong": 169, | |
| "jev": 0.7185, | |
| "ztc397": 0.7306, | |
| "ztc": 0.7168, | |
| "lynx": 0.4816, | |
| "hhem": 0.4556, | |
| "base": 0.5908, | |
| "ztc9": 0.631, | |
| "ztc4": 0.6223, | |
| "ojev": 0.5469, | |
| "clm": 0.5508 | |
| }, | |
| "상식·다단계추론": { | |
| "n": 278, | |
| "n_wrong": 130, | |
| "jev": 0.6006, | |
| "ztc397": 0.592, | |
| "ztc": 0.6123, | |
| "lynx": 0.5207, | |
| "hhem": 0.5295, | |
| "base": 0.542, | |
| "ztc9": 0.5881, | |
| "ztc4": 0.5738, | |
| "ojev": 0.5583, | |
| "clm": 0.5532 | |
| }, | |
| "재난·안전 지침": { | |
| "n": 225, | |
| "n_wrong": 109, | |
| "jev": 0.762, | |
| "ztc397": 0.7223, | |
| "ztc": 0.6938, | |
| "lynx": 0.5459, | |
| "hhem": 0.4441, | |
| "base": 0.5949, | |
| "ztc9": 0.5862, | |
| "ztc4": 0.5842, | |
| "ojev": 0.6207, | |
| "clm": 0.5903 | |
| }, | |
| "과학추론": { | |
| "n": 198, | |
| "n_wrong": 20, | |
| "jev": 0.8421, | |
| "ztc397": 0.6298, | |
| "ztc": 0.752, | |
| "lynx": 0.5945, | |
| "hhem": null, | |
| "base": 0.7272, | |
| "ztc9": 0.6764, | |
| "ztc4": 0.5576, | |
| "ojev": 0.8063, | |
| "clm": 0.7149 | |
| } | |
| }, | |
| "ci_ztc_vs_jev": [ | |
| -0.0344488905675061, | |
| 0.019942433001215155 | |
| ], | |
| "ci_ztc397_vs_jev": [ | |
| -0.0189, | |
| 0.0316 | |
| ], | |
| "not_running": [ | |
| { | |
| "name": "heman10x/rlcd-modernbert-151m", | |
| "org": "GitHub ★28", | |
| "why": "GLiClass 구조 — transformers 가 인식하지 못함", | |
| "url": "https://huggingface.co/heman10x/rlcd-modernbert-151m" | |
| }, | |
| { | |
| "name": "heman10x/openJev-verdict-2.0", | |
| "org": "GitHub", | |
| "why": "동일 (GLiClass)", | |
| "url": "https://huggingface.co/heman10x/openJev-verdict-2.0" | |
| }, | |
| { | |
| "name": "com-kotobalabs/open-jev-deberta-v3-large", | |
| "org": "HF", | |
| "why": "판정층(classifier) 이 체크포인트에 없어 무작위 초기화됨 — 점수로 쓸 수 없음", | |
| "url": "https://huggingface.co/com-kotobalabs/open-jev-deberta-v3-large" | |
| }, | |
| { | |
| "name": "AlexWortega/openjev", | |
| "org": "HF", | |
| "why": "토크나이저 파일 결손 — 적재 불가", | |
| "url": "https://huggingface.co/AlexWortega/openjev" | |
| } | |
| ], | |
| "self_readout": { | |
| "what": "모델에게 문제만 주고 직접 풀게 한 뒤, 답을 고르는 순간의 내부 상태로 「내가 맞혔나」를 맞힌다. 생성 토큰 0개.", | |
| "why_na": "모델 밖에서 텍스트만 받는 도구는 내부를 볼 수 없어 이 축 자체가 성립하지 않는다.", | |
| "limit": "ZTC 는 모델 내부에 접근할 수 있어야 한다. 남의 폐쇄 API 가 내놓은 답은 이 방식으로 못 본다.", | |
| "per_domain_397b": { | |
| "생물·의학": 0.7905, | |
| "전문시험(법·수학·생물)": 0.7433, | |
| "상식·다단계추론": 0.6672 | |
| }, | |
| "excluded": "재난·안전은 답이 숫자라 이 방식이 맞지 않아 미측정. 과학추론은 문제를 채워 다시 잰 뒤에도 397B 0.5143 · 27B 0.5447 로 동전이라 미측정. 같은 분야 타인판독은 27B 0.7410 · 397B 0.6287 로 정상이므로 분야 탓이 아니고, 원인은 아직 규명되지 않았다.", | |
| "per_domain_27b": { | |
| "생물·의학": 0.7479, | |
| "전문시험(법·수학·생물)": 0.7773, | |
| "상식·다단계추론": 0.6157 | |
| }, | |
| "n": "객관식 3분야 1,595건 (정정 시험지)", | |
| "excluded_en": "Disaster & safety is excluded because its answers are numeric and do not fit this method. Scientific reasoning is excluded because, even after the questions were restored, self-readout stays at chance (397B 0.5143, 27B 0.5447). The same domain reads normally when judging other models (27B 0.7410, 397B 0.6287), so the domain is not at fault; the cause is not yet established.", | |
| "n_en": "1,595 multiple-choice items across 3 domains (corrected set)" | |
| }, | |
| "correction": { | |
| "date": "2026-09-20", | |
| "what": "과학추론 198문항(전체의 9.8%)이 「문제」 칸이 빈 채로 측정되고 있었다. 그 구간에서 모든 검증기가 답변만 보고 판정했다.", | |
| "cause": "원본의 문제 필드 이름이 prompt 인데 시험지 생성기가 q 로 읽었다. 없으면 빈 문자열이 되고 예외가 나지 않는다.", | |
| "effect": "서로 비교는 유효했으나(전원 동일 조건) 과제 정의와 절대값이 달랐다. 재측정 후 **순위는 그대로**이고 1·2위 격차는 0.0059에서 0.0014로 좁아졌다.", | |
| "pending": "open-jev 4B 는 재현 하네스가 상류 구현과 달라 정정 보류. Vectara HHEM 은 적재 실패로 과학추론 칸 보류.", | |
| "baseline": "기준선 행만 다른 자로 재고 있었다 — 전문시험 400문항·무작위 폴드(0.7036). 같은 특징을 리더보드 규칙으로 다시 재어 0.6223 으로 바꿨다. 특징은 하나도 바꾸지 않았다. 그 결과 ZTC(27B)는 5개 분야 전부에서 기준선 위다.", | |
| "standardisation": "이전 판은 과학추론 198문항만 정정 은닉으로 갈아끼운 뒤 나머지 4분야는 옛 실행값을 그대로 썼다. 표준화(평균·표준편차)를 2,018행 전체에서 잡기 때문에 198행을 바꾸면 다른 분야 값도 함께 움직인다. 그 혼합값(397B 0.7364 · 27B 0.7282)은 한 번의 실행으로 재현되지 않는다. 각 모델을 전 분야 한 번에 재계산한 값(397B 0.7272 · 27B 0.7289)으로 바꿨고, 동봉된 곡선 프로브로 재현된다.", | |
| "open_jev": "open-jev 는 제작자 Space 를 직접 불러 다시 쟀다 — 0.6101. 우리 재현 코드로는 0.5021 이 나왔으나 상류 구현과 다르다고 판단해 쓰지 않았다. 남의 점수를 우리 코드로 깎지 않는다는 원칙을 그대로 적용했고, 그 결과 옛값(0.6844)보다 낮아졌다." | |
| }, | |
| "calibration": { | |
| "what": "「0.8 이라고 말하면 실제로 80%가 맞는가」. 낮을수록 좋다(ECE).", | |
| "raw": "도구가 그대로 내놓은 확률로 잰 값. ZTC 는 원래 확률을 내지 않아 해당 없음.", | |
| "calibrated": "전원에게 **같은 LODO 보정**을 걸었을 때. 신호 자체의 보정 가능성을 본다.", | |
| "finding": "ZTC 0.0245 와 JEV 0.0261 은 사실상 동률이다. JEV 가 그대로 내놓는 확률도 0.0381 로 이미 잘 맞는다 — 남이 공개면에 적은 「JEV 0.246」은 이 시험지에서 재현되지 않았다. 반면 Laya 가 그대로 내놓는 확률은 0.4985 / 0.2641 로 크게 어긋난다." | |
| }, | |
| "tie": { | |
| "threshold": 0.0344, | |
| "basis": "짝지은 부트스트랩 3,000회 · ZTC vs JEV 95% 구간 [-0.0344, 0.0199]", | |
| "rule": "선두와의 차이가 이 폭 안이면 순위를 매기지 않고 공동으로 표기한다" | |
| }, | |
| "unseen": { | |
| "title": "처음 보는 모델이 쓴 답에서", | |
| "what": "우리 표의 답변은 소넷 계열이 79%를 차지한다. 그래서 「그 답에 맞춰진 것 아닌가」를 스스로 확인했다. 학습에도 채점에도 한 번도 쓰지 않은 모델(Claude Haiku 4.5)에게 같은 2,018문항을 풀게 하고, 그 답 1,939건을 같은 채점 코드·같은 분야 가중치로 다시 쟀다.", | |
| "why": "고객사가 쓰는 모델은 우리가 본 적이 없다. 실전에 가까운 쪽은 이 표다.", | |
| "items": 1939, | |
| "generator": "Claude Haiku 4.5", | |
| "date": "2026-09-22", | |
| "rows": [ | |
| { | |
| "name": "ZTC-Judge-27B v2", | |
| "org": "FINAL-Bench", | |
| "auc": 0.7752, | |
| "kind": "verifier", | |
| "note": "여러 모델의 답을 섞어 적합 · z=11.08", | |
| "url": "https://huggingface.co/FINAL-Bench/ZTC-Judge-27B" | |
| }, | |
| { | |
| "name": "JEV", | |
| "org": "TypeSafe AI", | |
| "auc": 0.7521, | |
| "kind": "verifier", | |
| "note": "typesafe-ai/jev", | |
| "url": "https://www.typesafe.ai/" | |
| }, | |
| { | |
| "name": "ZTC-Judge-27B v1", | |
| "org": "FINAL-Bench", | |
| "auc": 0.7349, | |
| "kind": "verifier", | |
| "note": "기존 판독기 — 표 1 의 정본", | |
| "url": "https://huggingface.co/FINAL-Bench/ZTC-Judge-27B" | |
| }, | |
| { | |
| "name": "ZTC-Judge-9B v2", | |
| "org": "FINAL-Bench", | |
| "auc": 0.6931, | |
| "kind": "verifier", | |
| "note": "v1 0.6708 → +0.0223 · z=10.48", | |
| "url": "https://huggingface.co/FINAL-Bench/ZTC-Judge-9B" | |
| }, | |
| { | |
| "name": "ZTC-Judge-4B v2", | |
| "org": "FINAL-Bench", | |
| "auc": 0.6932, | |
| "kind": "verifier", | |
| "note": "v1 0.6590 → +0.0342 · z=8.41 · 노트북에서 돈다", | |
| "url": "https://huggingface.co/FINAL-Bench/ZTC-Judge-4B" | |
| }, | |
| { | |
| "name": "ZTC-Judge-9B v1", | |
| "org": "FINAL-Bench", | |
| "auc": 0.6708, | |
| "kind": "verifier", | |
| "note": "", | |
| "url": "https://huggingface.co/FINAL-Bench/ZTC-Judge-9B" | |
| }, | |
| { | |
| "name": "ZTC-Judge-4B v1", | |
| "org": "FINAL-Bench", | |
| "auc": 0.659, | |
| "kind": "verifier", | |
| "note": "", | |
| "url": "https://huggingface.co/FINAL-Bench/ZTC-Judge-4B" | |
| }, | |
| { | |
| "name": "답 길이와 서식만", | |
| "org": "—", | |
| "auc": 0.4334, | |
| "kind": "baseline", | |
| "note": "내용을 안 보는 기준선", | |
| "url": "" | |
| } | |
| ], | |
| "ci": [ | |
| { | |
| "pair": "ZTC v2 vs JEV", | |
| "diff": 0.023, | |
| "lo": 0.0056, | |
| "hi": 0.0412, | |
| "verdict": "이김" | |
| }, | |
| { | |
| "pair": "ZTC v2 vs ZTC v1", | |
| "diff": 0.0402, | |
| "lo": 0.0247, | |
| "hi": 0.0562, | |
| "verdict": "이김" | |
| }, | |
| { | |
| "pair": "ZTC v1 vs JEV", | |
| "diff": -0.0172, | |
| "lo": -0.0356, | |
| "hi": 0.0001, | |
| "verdict": "못 가름" | |
| } | |
| ], | |
| "ci_note": "짝지은 부트스트랩 3,000회 · 분야별 가중. 구간이 0 을 물면 순위를 매기지 않는다.", | |
| "honest": "🔴 표 1 에서는 반대다. 같은 v2 를 우리 2,018문항으로 재면 0.7066 으로 v1(같은 방식 재현 0.7236)보다 낮다. 우리 표의 답이 소넷에 쏠려 있어, 소넷에 특화된 v1 이 그 표에서는 유리하다. **표 1 의 정본은 v1 이고 이 표의 정본은 v2 다.** 두 파일을 모두 공개한다.", | |
| "per_domain": { | |
| "전문시험(법·수학·생물)": 0.8579, | |
| "생물·의학": 0.7894, | |
| "재난·안전 지침": 0.7432, | |
| "상식·다단계추론": 0.6684, | |
| "과학추론": 0.6084 | |
| }, | |
| "honest_en": "🔴 The first table says the opposite. Measured on our own 2,018 questions, the same v2 scores 0.7066 against 0.7236 for v1 under the identical method. Our answers are concentrated on one model family, and v1 is specialised to it. **v1 is the reference for the first table and v2 is the reference for this one.** Both files are published.", | |
| "ci_note_en": "Paired bootstrap, 3,000 resamples, weighted by domain. Where the interval covers zero, no rank is assigned.", | |
| "ladder_note": "🔑 **9B(0.6931)와 4B(0.6932)가 사실상 같다.** 이 축에서는 크기를 두 배 넘게 키워도 얻는 것이 없다. 다른 이유가 없다면 4B 를 쓰는 편이 낫다.", | |
| "ladder_note_en": "🔑 **9B (0.6931) and 4B (0.6932) land in the same place.** On this axis, more than doubling the parameter count buys nothing. Prefer the 4B unless something else requires the larger model.", | |
| "gates": "세 칸 모두 같은 관문을 통과했다: ①기존 판독기보다 오를 것 ②겉모습 기준선을 넘을 것 ③라벨 순열 귀무 8회 대비 z>3 (27B 11.08 · 9B 10.48 · 4B 8.41)." | |
| }, | |
| "laya_check": { | |
| "what": "Laya 는 문맥 상한이 512토큰(영문 계열)이다. 우리 문항의 20.5%(414건)가 그보다 길어 잘린 채 채점된다. 잘린 입력으로 남의 등수를 매기면 안 되므로, 상한 안에 들어간 1,604문항만으로 다시 쟀다.", | |
| "result": "0.5144 → 0.4943 (typed-decisions) · 0.4904 → 0.4627 (root). **둘 다 더 내려갔다.** 길이 때문이 아니라 이 시험지에서 우연에 가깝다.", | |
| "note": "🔴 과학추론 198문항은 100%가 상한을 넘어 이 검증에서 제외됐다. 그 분야 값은 잘린 채 잰 것이다.", | |
| "fairness": "제작사가 자체 벤치에서 JEV 를 이겼다고 공개한 것(0.766 vs 0.727)은 우리가 재현하지 않았다. 시험지가 다르다. 이 표는 이 시험지에서의 값만 말한다." | |
| }, | |
| "latency_note": { | |
| "what": "이 칸은 **자가 하나가 아니다.** JEV 는 인터넷 왕복이고, 무게를 내려받아 돌리는 것들은 자체 GPU 안의 시간이다. 그래서 이 칸의 숫자끼리 직접 비교하면 안 된다.", | |
| "fix": "🔴 이전 판은 JEV 를 **2.1초**로 적었다. 같은 자리(한국 PC)에서 왕복으로 다시 재니 **0.59초**(1팀 45건 중앙 0.591 · 9팀 30건 중앙 0.609)였다. 2.1초는 폐기한다.", | |
| "headline": "🔑 **같은 자로 왕복을 재면 ZTC 관문 0.636초 · JEV 0.591초 — JEV 가 0.045초 빠르다.** 우리가 앞서 적었던 「수십 배 빠르다」는 성립하지 않는다.", | |
| "true_claim": "ZTC 가 실제로 다른 점은 속도가 아니라 **생성 토큰 0개**와 **폐쇄망에서 돈다**는 것이다. 망을 타지 않으면 왕복 자체가 없어진다." | |
| }, | |
| "candidates": [ | |
| { | |
| "name": "von", | |
| "org": "wfzyx", | |
| "division": "local", | |
| "base": "ModernBERT-large", | |
| "size": "0.4B", | |
| "license": "apache-2.0", | |
| "likes": 41, | |
| "downloads": "23.5K", | |
| "created": "2026-09-19", | |
| "url": "https://hf.co/wfzyx/von", | |
| "note": "비자기회귀 · option-marker · jevbench 자체보고", | |
| "status": "측정 대기" | |
| }, | |
| { | |
| "name": "kev-4b", | |
| "org": "jaredpalmer", | |
| "division": "local", | |
| "base": "Qwen3.5-4B", | |
| "size": "4B", | |
| "license": "apache-2.0", | |
| "likes": 45, | |
| "downloads": "6.1K", | |
| "created": "2026-09-19", | |
| "url": "https://hf.co/jaredpalmer/kev-4b", | |
| "note": "TypeSafe 'kev' 계열(0.5~9B) · LoRA · 다지선다", | |
| "status": "측정 대기" | |
| }, | |
| { | |
| "name": "openjev", | |
| "org": "AlexWortega", | |
| "division": "local", | |
| "base": "Qwen3.5-4B", | |
| "size": "4B", | |
| "license": "mit", | |
| "likes": 565, | |
| "downloads": "—", | |
| "created": "2026-09-16", | |
| "url": "https://hf.co/AlexWortega/openjev", | |
| "note": "좋아요 최다 · cross-encoder/reranker · (구판 토크나이저 결손 재확인 필요)", | |
| "status": "측정 대기" | |
| }, | |
| { | |
| "name": "openjev", | |
| "org": "openjev", | |
| "division": "local", | |
| "base": "Qwen3.5", | |
| "size": "4B", | |
| "license": "cc-by-nc-4.0", | |
| "likes": 50, | |
| "downloads": "683", | |
| "created": "2026-09-20", | |
| "url": "https://hf.co/openjev/openjev", | |
| "note": "openjev 조직 · vLLM · FP8/MLX 포트", | |
| "status": "측정 대기" | |
| }, | |
| { | |
| "name": "Open-Jev-9B", | |
| "org": "ZefanCai", | |
| "division": "local", | |
| "base": "Qwen3.5-9B", | |
| "size": "9B(LoRA)", | |
| "license": "apache-2.0", | |
| "likes": 42, | |
| "downloads": "—", | |
| "created": "2026-09-20", | |
| "url": "https://hf.co/ZefanCai/Open-Jev-9B", | |
| "note": "오픈Jev 레시피 원조 계열(2B/9B/27B) · non-generative", | |
| "status": "측정 대기" | |
| }, | |
| { | |
| "name": "APUS-OpenJev-v1", | |
| "org": "apus-ailab", | |
| "division": "local", | |
| "base": "Qwen3.5-35B-A3B", | |
| "size": "35B MoE", | |
| "license": "apache-2.0", | |
| "likes": 25, | |
| "downloads": "83", | |
| "created": "2026-09-21", | |
| "url": "https://hf.co/apus-ailab/APUS-OpenJev-v1", | |
| "note": "dynamic-depth · 9B/4B판 보유", | |
| "status": "측정 대기" | |
| }, | |
| { | |
| "name": "open-jev-deberta-v3-large", | |
| "org": "com-kotobalabs", | |
| "division": "local", | |
| "base": "DeBERTa-v3-large", | |
| "size": "0.4B", | |
| "license": "apache-2.0", | |
| "likes": 64, | |
| "downloads": "2.1K", | |
| "created": "2026-09-18", | |
| "url": "https://hf.co/com-kotobalabs/open-jev-deberta-v3-large", | |
| "note": "인코더형 · (판정층 결손 재확인 필요)", | |
| "status": "측정 대기" | |
| }, | |
| { | |
| "name": "OpenThai-SystemOne", | |
| "org": "iapp", | |
| "division": "local", | |
| "base": "Qwen3.5-0.8B", | |
| "size": "0.8B", | |
| "license": "apache-2.0", | |
| "likes": 23, | |
| "downloads": "4.6K", | |
| "created": "2026-09-20", | |
| "url": "https://hf.co/iapp/OpenThai-SystemOne", | |
| "note": "태국어 특화 · computer-use", | |
| "status": "측정 대기" | |
| }, | |
| { | |
| "name": "Lumma-fev-0.6b", | |
| "org": "FrontiersMind", | |
| "division": "local", | |
| "base": "Lumma-0.6B", | |
| "size": "0.6B", | |
| "license": "mit", | |
| "likes": 52, | |
| "downloads": "745", | |
| "created": "2026-09-22", | |
| "url": "https://hf.co/FrontiersMind/Lumma-fev-0.6b", | |
| "note": "fev · typesafe 호환", | |
| "status": "측정 대기" | |
| }, | |
| { | |
| "name": "JevK5", | |
| "org": "alibiserikbay", | |
| "division": "local", | |
| "base": "Qwen3.5-4B", | |
| "size": "4B", | |
| "license": "apache-2.0", | |
| "likes": 10, | |
| "downloads": "2.2K", | |
| "created": "2026-09-22", | |
| "url": "https://hf.co/alibiserikbay/JevK5", | |
| "note": "jev-alternative · self-hosted · distillation", | |
| "status": "측정 대기" | |
| }, | |
| { | |
| "name": "Tev1-4B-experimental", | |
| "org": "togethercomputer", | |
| "division": "local", | |
| "base": "Qwen3.5-4B", | |
| "size": "4B", | |
| "license": "(open)", | |
| "likes": 16, | |
| "downloads": "741", | |
| "created": "2026-09-23", | |
| "url": "https://hf.co/togethercomputer/Tev1-4B-experimental", | |
| "note": "Together AI · 실험판", | |
| "status": "측정 대기" | |
| }, | |
| { | |
| "name": "Eikos-27B", | |
| "org": "caiovicentino1", | |
| "division": "local", | |
| "base": "Qwen3.8-27B", | |
| "size": "27B", | |
| "license": "mit", | |
| "likes": 12, | |
| "downloads": "28", | |
| "created": "2026-09-23", | |
| "url": "https://hf.co/caiovicentino1/Eikos-27B", | |
| "note": "금융·트레이딩 특화 · 4B판 보유", | |
| "status": "측정 대기" | |
| }, | |
| { | |
| "name": "Manchego", | |
| "org": "oraculumai", | |
| "division": "local", | |
| "base": "Qwen3.5-4B", | |
| "size": "4B", | |
| "license": "apache-2.0", | |
| "likes": 2, | |
| "downloads": "51", | |
| "created": "2026-09-23", | |
| "url": "https://hf.co/oraculumai/Manchego", | |
| "note": "system-one · NLI 데이터", | |
| "status": "측정 대기" | |
| }, | |
| { | |
| "name": "bosun-v3.1-1.7b", | |
| "org": "Hanno-Labs", | |
| "division": "local", | |
| "base": "Qwen3-1.7B", | |
| "size": "1.7B", | |
| "license": "apache-2.0", | |
| "likes": 3, | |
| "downloads": "734", | |
| "created": "2026-09-22", | |
| "url": "https://hf.co/Hanno-Labs/bosun-v3.1-1.7b", | |
| "note": "decision-bench 자체 · model-index", | |
| "status": "측정 대기" | |
| }, | |
| { | |
| "name": "Jeff-1", | |
| "org": "GestaltLabs", | |
| "division": "local", | |
| "base": "Qwen3-4B", | |
| "size": "4B(LoRA)", | |
| "license": "apache-2.0", | |
| "likes": 9, | |
| "downloads": "339", | |
| "created": "2026-09-19", | |
| "url": "https://hf.co/GestaltLabs/Jeff-1", | |
| "note": "fact-checking 특화", | |
| "status": "측정 대기" | |
| }, | |
| { | |
| "name": "tinyjev-0.6b", | |
| "org": "AnkitAI", | |
| "division": "local", | |
| "base": "Qwen3-0.6B", | |
| "size": "0.6B", | |
| "license": "mit", | |
| "likes": 1, | |
| "downloads": "110", | |
| "created": "2026-09-22", | |
| "url": "https://hf.co/AnkitAI/tinyjev-0.6b", | |
| "note": "초소형 · kev-suites", | |
| "status": "측정 대기" | |
| }, | |
| { | |
| "name": "XERON-0.1", | |
| "org": "PIXELZX", | |
| "division": "local", | |
| "base": "mmBERT-base", | |
| "size": "0.3B", | |
| "license": "apache-2.0", | |
| "likes": 1, | |
| "downloads": "40", | |
| "created": "2026-09-22", | |
| "url": "https://hf.co/PIXELZX/XERON-0.1", | |
| "note": "🇰🇷 한국어 지원 · 비자기회귀", | |
| "status": "측정 대기" | |
| }, | |
| { | |
| "name": "Decision-1.0-Lux-9B", | |
| "org": "llm-semantic-router", | |
| "division": "local", | |
| "base": "Qwen3.5-9B", | |
| "size": "9B", | |
| "license": "apache-2.0", | |
| "likes": 8, | |
| "downloads": "—", | |
| "created": "2026-09-22", | |
| "url": "https://hf.co/llm-semantic-router/Decision-1.0-Lux-9B", | |
| "note": "다국어 · Nox-4B판 보유", | |
| "status": "측정 대기" | |
| }, | |
| { | |
| "name": "modernbert-tasksource-jev", | |
| "org": "tasksource", | |
| "division": "local", | |
| "base": "ModernBERT", | |
| "size": "0.4B", | |
| "license": "apache-2.0", | |
| "likes": 1, | |
| "downloads": "32", | |
| "created": "2026-09-22", | |
| "url": "https://hf.co/tasksource/modernbert-tasksource-jev", | |
| "note": "tasksource · noul/scoring", | |
| "status": "측정 대기" | |
| }, | |
| { | |
| "name": "Winnow-12B", | |
| "org": "EldanRing", | |
| "division": "local", | |
| "base": "Gemma-4-12B", | |
| "size": "12B", | |
| "license": "apache-2.0", | |
| "likes": 8, | |
| "downloads": "3.9K", | |
| "created": "2026-09-20", | |
| "url": "https://hf.co/EldanRing/Winnow-12B", | |
| "note": "Gemma4 · 비전 · 로컬추론", | |
| "status": "측정 대기" | |
| }, | |
| { | |
| "name": "NeoHorse-Jev-4B", | |
| "org": "TokenRhythm", | |
| "division": "local", | |
| "base": "NeoHorse-1-4B", | |
| "size": "4B", | |
| "license": "apache-2.0", | |
| "likes": 9, | |
| "downloads": "—", | |
| "created": "2026-09-23", | |
| "url": "https://hf.co/TokenRhythm/NeoHorse-Jev-4B", | |
| "note": "멀티모달 · 비생성", | |
| "status": "측정 대기" | |
| }, | |
| { | |
| "name": "mini-Jev", | |
| "org": "samatv256", | |
| "division": "local", | |
| "base": "Qwen3-0.6B", | |
| "size": "0.6B", | |
| "license": "apache-2.0", | |
| "likes": 14, | |
| "downloads": "114", | |
| "created": "2026-09-21", | |
| "url": "https://hf.co/samatv256/mini-Jev", | |
| "note": "도구선택·라우팅", | |
| "status": "측정 대기" | |
| }, | |
| { | |
| "name": "frontier-infra jebadiah-9b", | |
| "org": "frontier-infra", | |
| "division": "local", | |
| "base": "Qwen3.5-9B", | |
| "size": "9B(LoRA)", | |
| "license": "apache-2.0", | |
| "likes": 1, | |
| "downloads": "72", | |
| "created": "2026-09-22", | |
| "url": "https://hf.co/frontier-infra/jebadiah-9b-v0", | |
| "note": "ainode · 4B판 보유", | |
| "status": "측정 대기" | |
| } | |
| ], | |
| "field_survey": { | |
| "date": "2026-09-25", | |
| "note": "HF 실사 — typed-decisions·decision-model·open-jev 태그 계열 40+ 독립 계열 확인. 대표 repo만 등록(포트·양자화·RL환경·순수라우터 제외). AUC는 정본 시험지(2,018문항) 실측 전까지 비워 둔다.", | |
| "counted": "40+ families", | |
| "measurable_note": "재현추적기(jev-reproductions-tracker) HF 12종 중 우리 축으로 잴 수 있던 건 2종(Nimble·decider)뿐. 나머지는 라우터·게임환경·제약디코딩 = 축 불일치. 신규 측정 대상은 진짜 정오 판정 헤드를 가진 소수(Kev·Open Jev·openjev·ZefanCai·APUS)." | |
| }, | |
| "divisions": { | |
| "local": { | |
| "title": "로컬 부문", | |
| "sub": "오픈 웨이트 · 자체 호스팅 가능" | |
| }, | |
| "api": { | |
| "title": "API 부문", | |
| "sub": "상용·폐쇄 API 또는 API 우선" | |
| } | |
| } | |
| } |