XERON-0.1 vs Laya โ ๋์ผ ์กฐ๊ฑด ์ค์ธก ๋น๊ต
- ํ๊ฐ์
:
LocalLLaMA/typed-decisionstest split (400 cases = 600 choice + 400 score + 400 noul = 1,400 decisions) - ํ๊ฐ ์คํฌ๋ฆฝํธ:
XERON/scripts/evaluate.py(+scripts/recompute_metrics.py๋ก score MAE/ํ์ ๋ณ ์ฌ๊ณ์ฐ) - ํ๋์จ์ด: CPU (๋จ์ผ ํ๋ก์ธ์ค), 2026-09-22
- ๊ฐ ๋ชจ๋ธ์ ๋์ผํ ํ๊ฐ์ ยท๋์ผ ์คํฌ๋ฆฝํธ๋ก ์ธก์
| ๋ชจ๋ธ | ๋ฐฑ๋ณธ / ํ๋ผ๋ฏธํฐ | choice acc (600) | soft acc | Brier | ECE โ | score MAE โ | noul acc |
|---|---|---|---|---|---|---|---|
| XERON-0.1 (ours) | mmBERT-base ยท 322M (ํ์ธํ๋) | 0.7000 | 0.5171 | 0.4493 | 0.2143 | 0.4213 | 0.7817 |
| laya-typed-decisions (Convai) | ModernBERT-large ยท 421M (๋ฒค๋ ํ๋) | 0.7333 | 0.4460 | 0.4669 | 0.2380 | 0.2963 | 0.8583 |
| laya-multilingual (Convai) | mmBERT-base ยท 322M (base, ๋ฏธํ๋) | 0.2900 | 0.2758 | 0.9952 | 0.3282 | 1.0625 | 0.4983 |
| Jev (TypeSafe AI) | ๋น๊ณต๊ฐ ยท ํธ์คํ API | ์ธก์ ๋ถ๊ฐ (API ๋น๊ณต๊ฐ) | โ | โ | โ | โ | โ |
ํด์
- ๋ฏธํ๋
laya-multilingual(0.290) โ XERON-0.1(0.700)๋ก +41.0%p. ํ์ธํ๋์ด ๊ฒฐ์ ์ ์ด๋ฉฐ, "Laya base๋ ํ์คํฌ๋ณ FT ์ ์ "๋ผ๋ ๊ณต๊ฐ ์ค๋ช ๊ณผ ์ผ์น. - ๋ฒค๋๊ฐ typed-decisions๋ก ์ง์ ํ๋ํ
laya-typed-decisions(0.7333)์ ๋น๊ตํ๋ฉด ํ๋ ๋ผ๋ฒจ ์ ํ๋๋ -3.3%p ๊ทผ์ ์ด์ธ, ๊ทธ๋ฌ๋ soft accuracy(+7.1%p)์ ECE(-0.024)๋ XERON์ด ์ฐ์ โ ํ๋ฅ (์ ๋ขฐ๋) ํ์ง์ด ๋ ์ข๋ค. - XERON-0.1์ 322M ๋ฉํฐ๋ง๊ถ์ผ ๋ชจ๋ธ๋ก ์์ด ์ ์ฉ 421M ๋ฒค๋ ํ๋ ๋ชจ๋ธ๊ณผ ๋ง๋จน๋ ์์ค์ด๋ฉฐ, ํ๊ตญ์ดยท๋ธ๋ผ์ฐ์ ยท์น ์์ด์ ํธยท์ฅ๋ฌธ(4096)๊น์ง ์ปค๋ฒํ๋ค.