XERON-0.1 / eval_comparison.md
pistonX's picture
XERON fine-tune upload
c462317 verified
|
Raw
History Blame Contribute Delete
1.72 kB

XERON-0.1 vs Laya โ€” ๋™์ผ ์กฐ๊ฑด ์‹ค์ธก ๋น„๊ต

  • ํ‰๊ฐ€์…‹: LocalLLaMA/typed-decisions test split (400 cases = 600 choice + 400 score + 400 noul = 1,400 decisions)
  • ํ‰๊ฐ€ ์Šคํฌ๋ฆฝํŠธ: XERON/scripts/evaluate.py (+ scripts/recompute_metrics.py๋กœ score MAE/ํƒ€์ž…๋ณ„ ์žฌ๊ณ„์‚ฐ)
  • ํ•˜๋“œ์›จ์–ด: CPU (๋‹จ์ผ ํ”„๋กœ์„ธ์Šค), 2026-09-22
  • ๊ฐ ๋ชจ๋ธ์€ ๋™์ผํ•œ ํ‰๊ฐ€์…‹ยท๋™์ผ ์Šคํฌ๋ฆฝํŠธ๋กœ ์ธก์ •
๋ชจ๋ธ ๋ฐฑ๋ณธ / ํŒŒ๋ผ๋ฏธํ„ฐ choice acc (600) soft acc Brier ECE โ†“ score MAE โ†“ noul acc
XERON-0.1 (ours) mmBERT-base ยท 322M (ํŒŒ์ธํŠœ๋‹) 0.7000 0.5171 0.4493 0.2143 0.4213 0.7817
laya-typed-decisions (Convai) ModernBERT-large ยท 421M (๋ฒค๋” ํŠœ๋‹) 0.7333 0.4460 0.4669 0.2380 0.2963 0.8583
laya-multilingual (Convai) mmBERT-base ยท 322M (base, ๋ฏธํŠœ๋‹) 0.2900 0.2758 0.9952 0.3282 1.0625 0.4983
Jev (TypeSafe AI) ๋น„๊ณต๊ฐœ ยท ํ˜ธ์ŠคํŒ… API ์ธก์ • ๋ถˆ๊ฐ€ (API ๋น„๊ณต๊ฐœ) โ€” โ€” โ€” โ€” โ€”

ํ•ด์„

  • ๋ฏธํŠœ๋‹ laya-multilingual(0.290) โ†’ XERON-0.1(0.700)๋กœ +41.0%p. ํŒŒ์ธํŠœ๋‹์ด ๊ฒฐ์ •์ ์ด๋ฉฐ, "Laya base๋Š” ํƒœ์Šคํฌ๋ณ„ FT ์ „์ œ"๋ผ๋Š” ๊ณต๊ฐœ ์„ค๋ช…๊ณผ ์ผ์น˜.
  • ๋ฒค๋”๊ฐ€ typed-decisions๋กœ ์ง์ ‘ ํŠœ๋‹ํ•œ laya-typed-decisions(0.7333)์™€ ๋น„๊ตํ•˜๋ฉด ํ•˜๋“œ ๋ผ๋ฒจ ์ •ํ™•๋„๋Š” -3.3%p ๊ทผ์†Œ ์—ด์„ธ, ๊ทธ๋Ÿฌ๋‚˜ soft accuracy(+7.1%p)์™€ ECE(-0.024)๋Š” XERON์ด ์šฐ์ˆ˜ โ€” ํ™•๋ฅ (์‹ ๋ขฐ๋„) ํ’ˆ์งˆ์ด ๋” ์ข‹๋‹ค.
  • XERON-0.1์€ 322M ๋ฉ€ํ‹ฐ๋ง๊ถˆ์–ผ ๋ชจ๋ธ๋กœ ์˜์–ด ์ „์šฉ 421M ๋ฒค๋” ํŠœ๋‹ ๋ชจ๋ธ๊ณผ ๋งž๋จน๋Š” ์ˆ˜์ค€์ด๋ฉฐ, ํ•œ๊ตญ์–ดยท๋ธŒ๋ผ์šฐ์ €ยท์›น ์—์ด์ „ํŠธยท์žฅ๋ฌธ(4096)๊นŒ์ง€ ์ปค๋ฒ„ํ•œ๋‹ค.