# XERON-0.1 vs Laya — 동일 조건 실측 비교 - 평가셋: `LocalLLaMA/typed-decisions` **test** split (400 cases = 600 choice + 400 score + 400 noul = 1,400 decisions) - 평가 스크립트: `XERON/scripts/evaluate.py` (+ `scripts/recompute_metrics.py`로 score MAE/타입별 재계산) - 하드웨어: CPU (단일 프로세스), 2026-09-22 - 각 모델은 **동일한 평가셋·동일 스크립트**로 측정 | 모델 | 백본 / 파라미터 | choice acc (600) | soft acc | Brier | ECE ↓ | score MAE ↓ | noul acc | |---|---|---|---|---|---|---|---| | **XERON-0.1** (ours) | mmBERT-base · 322M (파인튜닝) | 0.7000 | **0.5171** | **0.4493** | **0.2143** | 0.4213 | 0.7817 | | laya-typed-decisions (Convai) | ModernBERT-large · 421M (벤더 튜닝) | **0.7333** | 0.4460 | 0.4669 | 0.2380 | **0.2963** | **0.8583** | | laya-multilingual (Convai) | mmBERT-base · 322M (base, 미튜닝) | 0.2900 | 0.2758 | 0.9952 | 0.3282 | 1.0625 | 0.4983 | | Jev (TypeSafe AI) | 비공개 · 호스팅 API | 측정 불가 (API 비공개) | — | — | — | — | — | **해석** - 미튜닝 `laya-multilingual`(0.290) → XERON-0.1(0.700)로 **+41.0%p**. 파인튜닝이 결정적이며, "Laya base는 태스크별 FT 전제"라는 공개 설명과 일치. - 벤더가 typed-decisions로 직접 튜닝한 `laya-typed-decisions`(0.7333)와 비교하면 하드 라벨 정확도는 **-3.3%p 근소 열세**, 그러나 **soft accuracy(+7.1%p)와 ECE(-0.024)는 XERON이 우수** — 확률(신뢰도) 품질이 더 좋다. - XERON-0.1은 322M 멀티링궈얼 모델로 영어 전용 421M 벤더 튜닝 모델과 맞먹는 수준이며, 한국어·브라우저·웹 에이전트·장문(4096)까지 커버한다.