pistonX commited on
Commit
c462317
ยท
verified ยท
1 Parent(s): 6ea8fd0

XERON fine-tune upload

Browse files
README.md CHANGED
@@ -32,42 +32,58 @@ Trained by [PIXELZX](https://huggingface.co/PIXELZX) as the first release of the
32
 
33
  | | |
34
  |---|---|
35
- | **Base** | `jhu-clsp/mmBERT-base` (selected `multilingual` subfolder of Laya) |
36
- | **Fine-tuned on** | 148,281 sequences โ€” English typed-decisions + Korean (KLUE ynat/nli/sts) + browser/web decisions (BBC/AG News, SMS spam, phishing) + web-agent actions (Mind2Web) + long-context (SCOTUS, 20 Newsgroups) |
37
- | **Training** | RLCD โ€” strictly proper scoring rule with GRPO-style baseline; post-hoc temperature calibration |
38
  | **Context** | 4,096 tokens trained (`CTX_CAP` up to 32,768 via RoPE extension) |
39
- | **Languages** | 100+ via mmBERT (English + Korean data trained explicitly) |
40
- | **License** | Apache-2.0 (weights + config) |
41
 
42
- ## ๐Ÿ“Š Comparison โ€” XERON-0.1 vs Laya vs Jev (TypeSafe)
43
 
44
- `Jev` = TypeSafe AI Jev 1.13.0 (closed hosted API). `Laya` = Convai Innovations base checkpoints (untuned).
45
- Laya/Jev figures are quoted from public vendor + third-party sources (read 2026-09-22); XERON figures are measured with this repo's `scripts/evaluate.py`.
46
 
47
- | ํ•ญ๋ชฉ | **XERON-0.1** (ours) | **Laya** (Convai) | **Jev** (TypeSafe AI) |
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
48
  |---|---|---|---|
49
  | ๋ฐฐํฌ ํ˜•ํƒœ | ์˜คํ”ˆ ์›จ์ดํŠธ (self-host) | ์˜คํ”ˆ ์›จ์ดํŠธ (self-host) | ํ˜ธ์ŠคํŒ… API (closed) |
50
  | ๋ผ์ด์„ ์Šค | Apache-2.0 | Apache-2.0 | ์ƒ์šฉ API |
51
- | ๋ฐฑ๋ณธ / ํŒŒ๋ผ๋ฏธํ„ฐ | mmBERT-base ยท 322M | EN ModernBERT-large 421M / multi mmBERT-base 322M | ๋น„๊ณต๊ฐœ |
52
  | ์ปจํ…์ŠคํŠธ | 4,096 (cap 32,768) | 512 (EN) / 1,024 (multi) | 64k |
53
- | ์–ธ์–ด | 100+ (mmBERT), EN/KR ํ•™์Šต | 100+ (multi ์ฒดํฌํฌ์ธํŠธ) | ๋‹ค๊ตญ์–ด (๋น„๊ณต๊ฐœ) |
54
  | ๊ฒฐ์ • ํ”„๋ฆฌ๋ฏธํ‹ฐ๋ธŒ | choice / score / noul | choice / score / noul | choice / score / noul |
55
- | ํŒŒ์ธํŠœ๋‹ ํ•„์š” | โŒ (์ด๋ฏธ ํŒŒ์ธํŠœ๋‹๋จ) | โœ… (base๋Š” ํƒœ์Šคํฌ๋ณ„ FT ์ „์ œ) | โŒ (์ œ๋กœ์ƒท) |
56
- | ์ •ํ™•๋„ (๋™์ผ ํ‰๊ฐ€์…‹ยน) | **(์ธก์ •๊ฐ’)** | (์ธก์ •๊ฐ’) | ์ธก์ • ๋ถˆ๊ฐ€ (API) |
57
- | ์ •ํ™•๋„ (๊ณต์‹/์ œ3์ž) | โ€” | in-task 0.753 ยท zero-shot 0.651 ยท typed-decisions 0.766 | JevBench v1.3.0 composite **74.4 (#1)** |
58
  | ๋‚œ์ด๋„๋ณ„ (Easy/Std/Judge/Hard) | โ€” | 94.4 / 72.9 / 69.2 / 34.1 % | 100 / 99 / 94.5 / **74.1 %** |
59
- | ์บ˜๋ฆฌ๋ธŒ๋ ˆ์ด์…˜ (ECE) | **(์ธก์ •๊ฐ’)** | in-task 0.030 ยท zero-shot 0.204 ยท multi 0.081 | ๋ฒค์น˜ composite์— ํฌํ•จ (๋ฏธ๊ณต๊ฐœ) |
60
- | Brier | **(์ธก์ •๊ฐ’)** | 0.308 (in-task) / 0.532 (zero-shot) | ๋ฏธ๊ณต๊ฐœ |
61
- | ์ง€์—ฐ | **(์ธก์ •๊ฐ’)** | p50 38.4 ms (1๋ฌธํ•ญ, ๊ณต์‹) ยท 32.8 ms (T4) | ์•ฝ 150 ms (์ œ3์ž 236โ€“276 ms) |
62
  | ๋น„์šฉ | self-host (GPU ๋น„์šฉ๋งŒ) | self-host (GPU ๋น„์šฉ๋งŒ) | $0.042 / 1M input tokens |
63
  | JevBench v1.3.0 ์ˆœ์œ„ | ๋ฏธ๋“ฑ์žฌ | #33 (54.4) | **#1 (74.4)** |
64
 
65
- ยน ๋™์ผ ํ‰๊ฐ€์…‹ = `LocalLLaMA/typed-decisions` test split (400 cases / 1,400 decisions), ๋™์ผ `scripts/evaluate.py`, CPU.
 
66
 
67
  **์ฝ๋Š” ๋ฒ•**
68
- - Jev๋Š” **์ œ๋กœ์ƒท** ๊ฐ•์ž(ํ•˜๋“œ ๋‚œ์ด๋„ 74.1%), Laya/XERON์€ **ํŒŒ์ธํŠœ๋‹ ํ›„** ์ž๊ธฐ ๋„๋ฉ”์ธ์—์„œ ๊ฐ•ํ•ด์ง€๋Š” ์˜คํ”ˆ ์›จ์ดํŠธ ์ง„์˜์ž…๋‹ˆ๋‹ค.
69
- - XERON-0.1์€ Laya multilingual๊ณผ **๊ฐ™์€ ๋ฐฑ๋ณธ**์„ ์“ฐ๋˜ ํ•œ๊ตญ์–ดยท๋ธŒ๋ผ์šฐ์ €ยท์›น ์—์ด์ „ํŠธยท์žฅ๋ฌธ ๋ฐ์ดํ„ฐ๋ฅผ ์ถ”๊ฐ€๋กœ ํ•™์Šตํ•œ ๋ฒ„์ „์ž…๋‹ˆ๋‹ค.
70
- - JevBench๋Š” XERON์„ ํ‰๊ฐ€ํ•˜์ง€ ์•Š์•˜์œผ๋ฏ€๋กœ ์ˆœ์œ„ ๋น„๊ต๋Š” ์ฐธ๊ณ ์šฉ์ž…๋‹ˆ๋‹ค (ํ‰๊ฐ€์…‹ยท๋ฐฉ๋ฒ• ์ƒ์ด).
71
 
72
  ## ๐Ÿš€ ์‚ฌ์šฉ๋ฒ•
73
 
@@ -100,9 +116,10 @@ python scripts/evaluate.py \
100
  --model PIXELZX/XERON-0.1 \
101
  --dataset LocalLLaMA/typed-decisions --split test \
102
  --device cpu --output eval_results.json
 
103
  ```
104
 
105
- `eval_results.json` (per-decision predictions included) is shipped in this repo.
106
 
107
  ## โš ๏ธ ํ•œ๊ณ„
108
 
 
32
 
33
  | | |
34
  |---|---|
35
+ | **Base** | `jhu-clsp/mmBERT-base` (Laya `multilingual` subfolder) |
36
+ | **Fine-tuned on** | 148,281 sequences โ€” English typed-decisions + Korean (KLUE ynat/nli/sts) + browser/web decisions (BBC + AG News, SMS spam, phishing URLs) + web-agent actions (Mind2Web) + long-context (SCOTUS, 20 Newsgroups) |
37
+ | **Training** | RLCD โ€” strictly proper scoring rule + GRPO-style baseline; post-hoc temperature calibration. 4 epochs ยท 15,987 updates ยท ~5h on 1ร—GPU (bf16) |
38
  | **Context** | 4,096 tokens trained (`CTX_CAP` up to 32,768 via RoPE extension) |
39
+ | **Languages** | 100+ via mmBERT (English + Korean trained explicitly) |
40
+ | **License** | Apache-2.0 |
41
 
42
+ ## ๐Ÿ“Š Head-to-head: Laya vs Jev vs XERON-0.1
43
 
44
+ ### A. ์‹ค์ธก ๋น„๊ต (๋™์ผ ํ‰๊ฐ€์…‹ ยท ๋™์ผ ์Šคํฌ๋ฆฝํŠธ)
 
45
 
46
+ ํ‰๊ฐ€์…‹ `LocalLLaMA/typed-decisions` **test** split โ€” 400 cases = 600 `choice` + 400 `score` + 400 `noul` (**1,400 decisions**).
47
+ ๋™์ผํ•œ `scripts/evaluate.py` / `scripts/recompute_metrics.py`, CPU ๋‹จ์ผ ํ”„๋กœ์„ธ์Šค, 2026-09-22. ์›๋ณธ: `eval_comparison.md`, `eval_baseline_*.json`.
48
+
49
+ | ๋ชจ๋ธ | ๋ฐฑ๋ณธ / ํŒŒ๋ผ๋ฏธํ„ฐ | choice acc | soft acc | Brier | ECE โ†“ | score MAE โ†“ | noul acc |
50
+ |---|---|---|---|---|---|---|---|
51
+ | **XERON-0.1** (ours) | mmBERT-base ยท 322M ยท fine-tuned | 0.7000 | **0.5171** | **0.4493** | **0.2143** | 0.4213 | 0.7817 |
52
+ | `laya-typed-decisions` (Convai) | ModernBERT-large ยท 421M ยท ๋ฒค๋” ํŠœ๋‹ | **0.7333** | 0.4460 | 0.4669 | 0.2380 | **0.2963** | **0.8583** |
53
+ | `laya-multilingual` (Convai) | mmBERT-base ยท 322M ยท base(๋ฏธํŠœ๋‹) | 0.2900 | 0.2758 | 0.9952 | 0.3282 | 1.0625 | 0.4983 |
54
+ | Jev (TypeSafe AI) | ๋น„๊ณต๊ฐœ ยท ํ˜ธ์ŠคํŒ… API | ์ธก์ • ๋ถˆ๊ฐ€ (์›จ์ดํŠธ ๋น„๊ณต๊ฐœ) | โ€” | โ€” | โ€” | โ€” | โ€” |
55
+
56
+ - ๋ฏธํŠœ๋‹ Laya base(0.290) โ†’ XERON-0.1(0.700) = **+41.0%p**. ํŒŒ์ธํŠœ๋‹์ด ๊ฒฐ์ •์  (Laya base๋Š” ํƒœ์Šคํฌ๋ณ„ FT ์ „์ œ๋ผ๋Š” ๊ณต๊ฐœ ์„ค๋ช…๊ณผ ์ผ์น˜).
57
+ - ๋ฒค๋”๊ฐ€ ์ด ๋ฒค์น˜๋งˆํฌ์— ์ง์ ‘ ํŠœ๋‹ํ•œ 421M ์˜์–ด ๋ชจ๋ธ ๋Œ€๋น„ ํ•˜๋“œ ๋ผ๋ฒจ **-3.3%p**, ๊ทธ๋Ÿฌ๋‚˜ **soft accuracy +7.1%p / ECE โˆ’0.024 ๋Š” XERON ์šฐ์œ„** โ†’ ํ™•๋ฅ (์‹ ๋ขฐ๋„) ํ’ˆ์งˆ์ด ๋” ์ข‹์Œ.
58
+
59
+ ### B. ์ŠคํŽ™ ยท ๊ณต๊ฐœ ์ง€ํ‘œ ๋น„๊ต
60
+
61
+ Laya/Jev ์ˆ˜์น˜๋Š” ๋ฒค๋”ยท์ œ3์ž ๊ณต๊ฐœ ์ž๋ฃŒ์—์„œ ์ธ์šฉ (2026-09-22 ์กฐํšŒ). XERON ์ˆ˜์น˜๋Š” ์‹ค์ธก.
62
+
63
+ | ํ•ญ๋ชฉ | **XERON-0.1** | **Laya** (Convai) | **Jev** (TypeSafe AI) |
64
  |---|---|---|---|
65
  | ๋ฐฐํฌ ํ˜•ํƒœ | ์˜คํ”ˆ ์›จ์ดํŠธ (self-host) | ์˜คํ”ˆ ์›จ์ดํŠธ (self-host) | ํ˜ธ์ŠคํŒ… API (closed) |
66
  | ๋ผ์ด์„ ์Šค | Apache-2.0 | Apache-2.0 | ์ƒ์šฉ API |
67
+ | ๋ฐฑ๋ณธ / ํŒŒ๋ผ๋ฏธํ„ฐ | mmBERT-base ยท 322M | EN 421M / multi 322M | ๋น„๊ณต๊ฐœ |
68
  | ์ปจํ…์ŠคํŠธ | 4,096 (cap 32,768) | 512 (EN) / 1,024 (multi) | 64k |
69
+ | ์–ธ์–ด | 100+ (mmBERT), ENยทKR ํ•™์Šต | 100+ (multi ์ฒดํฌํฌ์ธํŠธ) | ๋‹ค๊ตญ์–ด (๋น„๊ณต๊ฐœ) |
70
  | ๊ฒฐ์ • ํ”„๋ฆฌ๋ฏธํ‹ฐ๋ธŒ | choice / score / noul | choice / score / noul | choice / score / noul |
71
+ | ํŒŒ์ธํŠœ๋‹ ํ•„์š” | โŒ (์ด๋ฏธ ํŠœ๋‹๋จ) | โœ… (base๋Š” FT ์ „์ œ) | โŒ (์ œ๋กœ์ƒท) |
72
+ | ์ •ํ™•๋„ (๊ณต๊ฐœ) | โ€” | in-task 0.753 ยท zero-shot 0.651 ยท typed-decisions 0.766 | JevBench v1.3.0 composite **74.4 (#1)** |
 
73
  | ๋‚œ์ด๋„๋ณ„ (Easy/Std/Judge/Hard) | โ€” | 94.4 / 72.9 / 69.2 / 34.1 % | 100 / 99 / 94.5 / **74.1 %** |
74
+ | ์บ˜๋ฆฌ๋ธŒ๋ ˆ์ด์…˜ (ECE) | 0.2143 (๋™์ผ ํ‰๊ฐ€์…‹) | in-task 0.030 ยท zero-shot 0.204 ยท multi 0.081 (๋ฒค๋”) | ๋ฏธ๊ณต๊ฐœ |
75
+ | Brier | 0.4493 (๋™์ผ ํ‰๊ฐ€์…‹) | 0.308 in-task / 0.532 zero-shot (๋ฒค๋”) | ๋ฏธ๊ณต๊ฐœ |
76
+ | ์ง€์—ฐ | 2.2 s/case (CPU, ๋กœ์ปฌ ์ธก์ •) | p50 38.4 ms (1๋ฌธํ•ญ, ๋ฒค๋”) ยท 32.8 ms (T4) | ~150 ms (์ œ3์ž 236โ€“276 ms) |
77
  | ๋น„์šฉ | self-host (GPU ๋น„์šฉ๋งŒ) | self-host (GPU ๋น„์šฉ๋งŒ) | $0.042 / 1M input tokens |
78
  | JevBench v1.3.0 ์ˆœ์œ„ | ๋ฏธ๋“ฑ์žฌ | #33 (54.4) | **#1 (74.4)** |
79
 
80
+ > โš ๏ธ A์™€ B๋Š” **๋‹ค๋ฅธ ํ‰๊ฐ€์…‹ยท๋‹ค๋ฅธ ํ•˜๋“œ์›จ์–ด**์ž…๋‹ˆ๋‹ค. A๋Š” ๋™์ผ ์กฐ๊ฑด ์‹ค์ธก(๋ชจ๋ธ ๊ฐ„ ์ง์ ‘ ๋น„๊ต ๊ฐ€๋Šฅ), B๋Š” ๊ณต๊ฐœ ์ž๋ฃŒ ์ธ์šฉ(์ฐธ๊ณ ์šฉ).
81
+ > Jev๋Š” ์›จ์ดํŠธ๊ฐ€ ๊ณต๊ฐœ๋˜์ง€ ์•Š์•„ A์— ๋„ฃ์„ ์ˆ˜ ์—†์Šต๋‹ˆ๋‹ค.
82
 
83
  **์ฝ๋Š” ๋ฒ•**
84
+ - Jev = ์ œ๋กœ์ƒท ๊ฐ•์ž (ํ•˜๋“œ ๋‚œ์ด๋„ 74.1%).
85
+ - Laya / XERON = ์˜คํ”ˆ ์›จ์ดํŠธ, **ํŒŒ์ธํŠœ๋‹ ํ›„ ์ž๊ธฐ ๋„๋ฉ”์ธ์—์„œ ๊ฐ•ํ•ด์ง€๋Š”** ์ง„์˜.
86
+ - XERON-0.1์€ Laya multilingual๊ณผ ๊ฐ™์€ ๋ฐฑ๋ณธ + ํ•œ๊ตญ์–ดยท๋ธŒ๋ผ์šฐ์ €ยท์›น ์—์ด์ „ํŠธยท์žฅ๋ฌธ ๋ฐ์ดํ„ฐ ์ถ”๊ฐ€ ํ•™์ŠตํŒ.
87
 
88
  ## ๐Ÿš€ ์‚ฌ์šฉ๋ฒ•
89
 
 
116
  --model PIXELZX/XERON-0.1 \
117
  --dataset LocalLLaMA/typed-decisions --split test \
118
  --device cpu --output eval_results.json
119
+ python scripts/recompute_metrics.py eval_results.json # score MAE / ํƒ€์ž…๋ณ„ ์ •ํ™•๋„
120
  ```
121
 
122
+ `eval_results.json` (per-decision predictions ํฌํ•จ)์ด ์ด ์ €์žฅ์†Œ์— ํฌํ•จ๋˜์–ด ์žˆ์Šต๋‹ˆ๋‹ค.
123
 
124
  ## โš ๏ธ ํ•œ๊ณ„
125
 
eval_baseline_laya-multilingual.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "summary": {
3
+ "n_decisions": 1400,
4
+ "accuracy": 0.29,
5
+ "soft_accuracy": 0.27579966666666667,
6
+ "brier": 0.99524940365,
7
+ "ece": 0.32819679166666665,
8
+ "score_mae": 0.0,
9
+ "latency_ms_mean": 2248.733173314249,
10
+ "latency_ms_median": 1714.5638766232878,
11
+ "cases": 400
12
+ }
13
+ }
eval_baseline_laya-typed-decisions.json ADDED
@@ -0,0 +1,13 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "summary": {
3
+ "n_decisions": 1400,
4
+ "accuracy": 0.7333333333333333,
5
+ "soft_accuracy": 0.4459918333333333,
6
+ "brier": 0.46694727990000007,
7
+ "ece": 0.23802802500000003,
8
+ "score_mae": 0.29625,
9
+ "latency_ms_mean": 3256.1262979148887,
10
+ "latency_ms_median": 3442.1574100852013,
11
+ "cases": 400
12
+ }
13
+ }
eval_comparison.md ADDED
@@ -0,0 +1,18 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ # XERON-0.1 vs Laya โ€” ๋™์ผ ์กฐ๊ฑด ์‹ค์ธก ๋น„๊ต
2
+
3
+ - ํ‰๊ฐ€์…‹: `LocalLLaMA/typed-decisions` **test** split (400 cases = 600 choice + 400 score + 400 noul = 1,400 decisions)
4
+ - ํ‰๊ฐ€ ์Šคํฌ๋ฆฝํŠธ: `XERON/scripts/evaluate.py` (+ `scripts/recompute_metrics.py`๋กœ score MAE/ํƒ€์ž…๋ณ„ ์žฌ๊ณ„์‚ฐ)
5
+ - ํ•˜๋“œ์›จ์–ด: CPU (๋‹จ์ผ ํ”„๋กœ์„ธ์Šค), 2026-09-22
6
+ - ๊ฐ ๋ชจ๋ธ์€ **๋™์ผํ•œ ํ‰๊ฐ€์…‹ยท๋™์ผ ์Šคํฌ๋ฆฝํŠธ**๋กœ ์ธก์ •
7
+
8
+ | ๋ชจ๋ธ | ๋ฐฑ๋ณธ / ํŒŒ๋ผ๋ฏธํ„ฐ | choice acc (600) | soft acc | Brier | ECE โ†“ | score MAE โ†“ | noul acc |
9
+ |---|---|---|---|---|---|---|---|
10
+ | **XERON-0.1** (ours) | mmBERT-base ยท 322M (ํŒŒ์ธํŠœ๋‹) | 0.7000 | **0.5171** | **0.4493** | **0.2143** | 0.4213 | 0.7817 |
11
+ | laya-typed-decisions (Convai) | ModernBERT-large ยท 421M (๋ฒค๋” ํŠœ๋‹) | **0.7333** | 0.4460 | 0.4669 | 0.2380 | **0.2963** | **0.8583** |
12
+ | laya-multilingual (Convai) | mmBERT-base ยท 322M (base, ๋ฏธํŠœ๋‹) | 0.2900 | 0.2758 | 0.9952 | 0.3282 | 1.0625 | 0.4983 |
13
+ | Jev (TypeSafe AI) | ๋น„๊ณต๊ฐœ ยท ํ˜ธ์ŠคํŒ… API | ์ธก์ • ๋ถˆ๊ฐ€ (API ๋น„๊ณต๊ฐœ) | โ€” | โ€” | โ€” | โ€” | โ€” |
14
+
15
+ **ํ•ด์„**
16
+ - ๋ฏธํŠœ๋‹ `laya-multilingual`(0.290) โ†’ XERON-0.1(0.700)๋กœ **+41.0%p**. ํŒŒ์ธํŠœ๋‹์ด ๊ฒฐ์ •์ ์ด๋ฉฐ, "Laya base๋Š” ํƒœ์Šคํฌ๋ณ„ FT ์ „์ œ"๋ผ๋Š” ๊ณต๊ฐœ ์„ค๋ช…๊ณผ ์ผ์น˜.
17
+ - ๋ฒค๋”๊ฐ€ typed-decisions๋กœ ์ง์ ‘ ํŠœ๋‹ํ•œ `laya-typed-decisions`(0.7333)์™€ ๋น„๊ตํ•˜๋ฉด ํ•˜๋“œ ๋ผ๋ฒจ ์ •ํ™•๋„๋Š” **-3.3%p ๊ทผ์†Œ ์—ด์„ธ**, ๊ทธ๋Ÿฌ๋‚˜ **soft accuracy(+7.1%p)์™€ ECE(-0.024)๋Š” XERON์ด ์šฐ์ˆ˜** โ€” ํ™•๋ฅ (์‹ ๋ขฐ๋„) ํ’ˆ์งˆ์ด ๋” ์ข‹๋‹ค.
18
+ - XERON-0.1์€ 322M ๋ฉ€ํ‹ฐ๋ง๊ถˆ์–ผ ๋ชจ๋ธ๋กœ ์˜์–ด ์ „์šฉ 421M ๋ฒค๋” ํŠœ๋‹ ๋ชจ๋ธ๊ณผ ๋งž๋จน๋Š” ์ˆ˜์ค€์ด๋ฉฐ, ํ•œ๊ตญ์–ดยท๋ธŒ๋ผ์šฐ์ €ยท์›น ์—์ด์ „ํŠธยท์žฅ๋ฌธ(4096)๊นŒ์ง€ ์ปค๋ฒ„ํ•œ๋‹ค.