XERON fine-tune upload
Browse files- README.md +39 -22
- eval_baseline_laya-multilingual.json +13 -0
- eval_baseline_laya-typed-decisions.json +13 -0
- eval_comparison.md +18 -0
README.md
CHANGED
|
@@ -32,42 +32,58 @@ Trained by [PIXELZX](https://huggingface.co/PIXELZX) as the first release of the
|
|
| 32 |
|
| 33 |
| | |
|
| 34 |
|---|---|
|
| 35 |
-
| **Base** | `jhu-clsp/mmBERT-base` (
|
| 36 |
-
| **Fine-tuned on** | 148,281 sequences โ English typed-decisions + Korean (KLUE ynat/nli/sts) + browser/web decisions (BBC
|
| 37 |
-
| **Training** | RLCD โ strictly proper scoring rule
|
| 38 |
| **Context** | 4,096 tokens trained (`CTX_CAP` up to 32,768 via RoPE extension) |
|
| 39 |
-
| **Languages** | 100+ via mmBERT (English + Korean
|
| 40 |
-
| **License** | Apache-2.0
|
| 41 |
|
| 42 |
-
## ๐
|
| 43 |
|
| 44 |
-
|
| 45 |
-
Laya/Jev figures are quoted from public vendor + third-party sources (read 2026-09-22); XERON figures are measured with this repo's `scripts/evaluate.py`.
|
| 46 |
|
| 47 |
-
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 48 |
|---|---|---|---|
|
| 49 |
| ๋ฐฐํฌ ํํ | ์คํ ์จ์ดํธ (self-host) | ์คํ ์จ์ดํธ (self-host) | ํธ์คํ
API (closed) |
|
| 50 |
| ๋ผ์ด์ ์ค | Apache-2.0 | Apache-2.0 | ์์ฉ API |
|
| 51 |
-
| ๋ฐฑ๋ณธ / ํ๋ผ๋ฏธํฐ | mmBERT-base ยท 322M | EN
|
| 52 |
| ์ปจํ
์คํธ | 4,096 (cap 32,768) | 512 (EN) / 1,024 (multi) | 64k |
|
| 53 |
-
| ์ธ์ด | 100+ (mmBERT), EN
|
| 54 |
| ๊ฒฐ์ ํ๋ฆฌ๋ฏธํฐ๋ธ | choice / score / noul | choice / score / noul | choice / score / noul |
|
| 55 |
-
| ํ์ธํ๋ ํ์ | โ (์ด๋ฏธ
|
| 56 |
-
| ์ ํ๋ (
|
| 57 |
-
| ์ ํ๋ (๊ณต์/์ 3์) | โ | in-task 0.753 ยท zero-shot 0.651 ยท typed-decisions 0.766 | JevBench v1.3.0 composite **74.4 (#1)** |
|
| 58 |
| ๋์ด๋๋ณ (Easy/Std/Judge/Hard) | โ | 94.4 / 72.9 / 69.2 / 34.1 % | 100 / 99 / 94.5 / **74.1 %** |
|
| 59 |
-
| ์บ๋ฆฌ๋ธ๋ ์ด์
(ECE) |
|
| 60 |
-
| Brier |
|
| 61 |
-
| ์ง์ฐ |
|
| 62 |
| ๋น์ฉ | self-host (GPU ๋น์ฉ๋ง) | self-host (GPU ๋น์ฉ๋ง) | $0.042 / 1M input tokens |
|
| 63 |
| JevBench v1.3.0 ์์ | ๋ฏธ๋ฑ์ฌ | #33 (54.4) | **#1 (74.4)** |
|
| 64 |
|
| 65 |
-
|
|
|
|
| 66 |
|
| 67 |
**์ฝ๋ ๋ฒ**
|
| 68 |
-
- Jev
|
| 69 |
-
- XERON
|
| 70 |
-
-
|
| 71 |
|
| 72 |
## ๐ ์ฌ์ฉ๋ฒ
|
| 73 |
|
|
@@ -100,9 +116,10 @@ python scripts/evaluate.py \
|
|
| 100 |
--model PIXELZX/XERON-0.1 \
|
| 101 |
--dataset LocalLLaMA/typed-decisions --split test \
|
| 102 |
--device cpu --output eval_results.json
|
|
|
|
| 103 |
```
|
| 104 |
|
| 105 |
-
`eval_results.json` (per-decision predictions
|
| 106 |
|
| 107 |
## โ ๏ธ ํ๊ณ
|
| 108 |
|
|
|
|
| 32 |
|
| 33 |
| | |
|
| 34 |
|---|---|
|
| 35 |
+
| **Base** | `jhu-clsp/mmBERT-base` (Laya `multilingual` subfolder) |
|
| 36 |
+
| **Fine-tuned on** | 148,281 sequences โ English typed-decisions + Korean (KLUE ynat/nli/sts) + browser/web decisions (BBC + AG News, SMS spam, phishing URLs) + web-agent actions (Mind2Web) + long-context (SCOTUS, 20 Newsgroups) |
|
| 37 |
+
| **Training** | RLCD โ strictly proper scoring rule + GRPO-style baseline; post-hoc temperature calibration. 4 epochs ยท 15,987 updates ยท ~5h on 1รGPU (bf16) |
|
| 38 |
| **Context** | 4,096 tokens trained (`CTX_CAP` up to 32,768 via RoPE extension) |
|
| 39 |
+
| **Languages** | 100+ via mmBERT (English + Korean trained explicitly) |
|
| 40 |
+
| **License** | Apache-2.0 |
|
| 41 |
|
| 42 |
+
## ๐ Head-to-head: Laya vs Jev vs XERON-0.1
|
| 43 |
|
| 44 |
+
### A. ์ค์ธก ๋น๊ต (๋์ผ ํ๊ฐ์
ยท ๋์ผ ์คํฌ๋ฆฝํธ)
|
|
|
|
| 45 |
|
| 46 |
+
ํ๊ฐ์
`LocalLLaMA/typed-decisions` **test** split โ 400 cases = 600 `choice` + 400 `score` + 400 `noul` (**1,400 decisions**).
|
| 47 |
+
๋์ผํ `scripts/evaluate.py` / `scripts/recompute_metrics.py`, CPU ๋จ์ผ ํ๋ก์ธ์ค, 2026-09-22. ์๋ณธ: `eval_comparison.md`, `eval_baseline_*.json`.
|
| 48 |
+
|
| 49 |
+
| ๋ชจ๋ธ | ๋ฐฑ๋ณธ / ํ๋ผ๋ฏธํฐ | choice acc | soft acc | Brier | ECE โ | score MAE โ | noul acc |
|
| 50 |
+
|---|---|---|---|---|---|---|---|
|
| 51 |
+
| **XERON-0.1** (ours) | mmBERT-base ยท 322M ยท fine-tuned | 0.7000 | **0.5171** | **0.4493** | **0.2143** | 0.4213 | 0.7817 |
|
| 52 |
+
| `laya-typed-decisions` (Convai) | ModernBERT-large ยท 421M ยท ๋ฒค๋ ํ๋ | **0.7333** | 0.4460 | 0.4669 | 0.2380 | **0.2963** | **0.8583** |
|
| 53 |
+
| `laya-multilingual` (Convai) | mmBERT-base ยท 322M ยท base(๋ฏธํ๋) | 0.2900 | 0.2758 | 0.9952 | 0.3282 | 1.0625 | 0.4983 |
|
| 54 |
+
| Jev (TypeSafe AI) | ๋น๊ณต๊ฐ ยท ํธ์คํ
API | ์ธก์ ๋ถ๊ฐ (์จ์ดํธ ๋น๊ณต๊ฐ) | โ | โ | โ | โ | โ |
|
| 55 |
+
|
| 56 |
+
- ๋ฏธํ๋ Laya base(0.290) โ XERON-0.1(0.700) = **+41.0%p**. ํ์ธํ๋์ด ๊ฒฐ์ ์ (Laya base๋ ํ์คํฌ๋ณ FT ์ ์ ๋ผ๋ ๊ณต๊ฐ ์ค๋ช
๊ณผ ์ผ์น).
|
| 57 |
+
- ๋ฒค๋๊ฐ ์ด ๋ฒค์น๋งํฌ์ ์ง์ ํ๋ํ 421M ์์ด ๋ชจ๋ธ ๋๋น ํ๋ ๋ผ๋ฒจ **-3.3%p**, ๊ทธ๋ฌ๋ **soft accuracy +7.1%p / ECE โ0.024 ๋ XERON ์ฐ์** โ ํ๋ฅ (์ ๋ขฐ๋) ํ์ง์ด ๋ ์ข์.
|
| 58 |
+
|
| 59 |
+
### B. ์คํ ยท ๊ณต๊ฐ ์งํ ๋น๊ต
|
| 60 |
+
|
| 61 |
+
Laya/Jev ์์น๋ ๋ฒค๋ยท์ 3์ ๊ณต๊ฐ ์๋ฃ์์ ์ธ์ฉ (2026-09-22 ์กฐํ). XERON ์์น๋ ์ค์ธก.
|
| 62 |
+
|
| 63 |
+
| ํญ๋ชฉ | **XERON-0.1** | **Laya** (Convai) | **Jev** (TypeSafe AI) |
|
| 64 |
|---|---|---|---|
|
| 65 |
| ๋ฐฐํฌ ํํ | ์คํ ์จ์ดํธ (self-host) | ์คํ ์จ์ดํธ (self-host) | ํธ์คํ
API (closed) |
|
| 66 |
| ๋ผ์ด์ ์ค | Apache-2.0 | Apache-2.0 | ์์ฉ API |
|
| 67 |
+
| ๋ฐฑ๋ณธ / ํ๋ผ๋ฏธํฐ | mmBERT-base ยท 322M | EN 421M / multi 322M | ๋น๊ณต๊ฐ |
|
| 68 |
| ์ปจํ
์คํธ | 4,096 (cap 32,768) | 512 (EN) / 1,024 (multi) | 64k |
|
| 69 |
+
| ์ธ์ด | 100+ (mmBERT), ENยทKR ํ์ต | 100+ (multi ์ฒดํฌํฌ์ธํธ) | ๋ค๊ตญ์ด (๋น๊ณต๊ฐ) |
|
| 70 |
| ๊ฒฐ์ ํ๋ฆฌ๋ฏธํฐ๋ธ | choice / score / noul | choice / score / noul | choice / score / noul |
|
| 71 |
+
| ํ์ธํ๋ ํ์ | โ (์ด๋ฏธ ํ๋๋จ) | โ
(base๋ FT ์ ์ ) | โ (์ ๋ก์ท) |
|
| 72 |
+
| ์ ํ๋ (๊ณต๊ฐ) | โ | in-task 0.753 ยท zero-shot 0.651 ยท typed-decisions 0.766 | JevBench v1.3.0 composite **74.4 (#1)** |
|
|
|
|
| 73 |
| ๋์ด๋๋ณ (Easy/Std/Judge/Hard) | โ | 94.4 / 72.9 / 69.2 / 34.1 % | 100 / 99 / 94.5 / **74.1 %** |
|
| 74 |
+
| ์บ๋ฆฌ๋ธ๋ ์ด์
(ECE) | 0.2143 (๋์ผ ํ๊ฐ์
) | in-task 0.030 ยท zero-shot 0.204 ยท multi 0.081 (๋ฒค๋) | ๋ฏธ๊ณต๊ฐ |
|
| 75 |
+
| Brier | 0.4493 (๋์ผ ํ๊ฐ์
) | 0.308 in-task / 0.532 zero-shot (๋ฒค๋) | ๋ฏธ๊ณต๊ฐ |
|
| 76 |
+
| ์ง์ฐ | 2.2 s/case (CPU, ๋ก์ปฌ ์ธก์ ) | p50 38.4 ms (1๋ฌธํญ, ๋ฒค๋) ยท 32.8 ms (T4) | ~150 ms (์ 3์ 236โ276 ms) |
|
| 77 |
| ๋น์ฉ | self-host (GPU ๋น์ฉ๋ง) | self-host (GPU ๋น์ฉ๋ง) | $0.042 / 1M input tokens |
|
| 78 |
| JevBench v1.3.0 ์์ | ๋ฏธ๋ฑ์ฌ | #33 (54.4) | **#1 (74.4)** |
|
| 79 |
|
| 80 |
+
> โ ๏ธ A์ B๋ **๋ค๋ฅธ ํ๊ฐ์
ยท๋ค๋ฅธ ํ๋์จ์ด**์
๋๋ค. A๋ ๋์ผ ์กฐ๊ฑด ์ค์ธก(๋ชจ๋ธ ๊ฐ ์ง์ ๋น๊ต ๊ฐ๋ฅ), B๋ ๊ณต๊ฐ ์๋ฃ ์ธ์ฉ(์ฐธ๊ณ ์ฉ).
|
| 81 |
+
> Jev๋ ์จ์ดํธ๊ฐ ๊ณต๊ฐ๋์ง ์์ A์ ๋ฃ์ ์ ์์ต๋๋ค.
|
| 82 |
|
| 83 |
**์ฝ๋ ๋ฒ**
|
| 84 |
+
- Jev = ์ ๋ก์ท ๊ฐ์ (ํ๋ ๋์ด๋ 74.1%).
|
| 85 |
+
- Laya / XERON = ์คํ ์จ์ดํธ, **ํ์ธํ๋ ํ ์๊ธฐ ๋๋ฉ์ธ์์ ๊ฐํด์ง๋** ์ง์.
|
| 86 |
+
- XERON-0.1์ Laya multilingual๊ณผ ๊ฐ์ ๋ฐฑ๋ณธ + ํ๊ตญ์ดยท๋ธ๋ผ์ฐ์ ยท์น ์์ด์ ํธยท์ฅ๋ฌธ ๋ฐ์ดํฐ ์ถ๊ฐ ํ์ตํ.
|
| 87 |
|
| 88 |
## ๐ ์ฌ์ฉ๋ฒ
|
| 89 |
|
|
|
|
| 116 |
--model PIXELZX/XERON-0.1 \
|
| 117 |
--dataset LocalLLaMA/typed-decisions --split test \
|
| 118 |
--device cpu --output eval_results.json
|
| 119 |
+
python scripts/recompute_metrics.py eval_results.json # score MAE / ํ์
๋ณ ์ ํ๋
|
| 120 |
```
|
| 121 |
|
| 122 |
+
`eval_results.json` (per-decision predictions ํฌํจ)์ด ์ด ์ ์ฅ์์ ํฌํจ๋์ด ์์ต๋๋ค.
|
| 123 |
|
| 124 |
## โ ๏ธ ํ๊ณ
|
| 125 |
|
eval_baseline_laya-multilingual.json
ADDED
|
@@ -0,0 +1,13 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"summary": {
|
| 3 |
+
"n_decisions": 1400,
|
| 4 |
+
"accuracy": 0.29,
|
| 5 |
+
"soft_accuracy": 0.27579966666666667,
|
| 6 |
+
"brier": 0.99524940365,
|
| 7 |
+
"ece": 0.32819679166666665,
|
| 8 |
+
"score_mae": 0.0,
|
| 9 |
+
"latency_ms_mean": 2248.733173314249,
|
| 10 |
+
"latency_ms_median": 1714.5638766232878,
|
| 11 |
+
"cases": 400
|
| 12 |
+
}
|
| 13 |
+
}
|
eval_baseline_laya-typed-decisions.json
ADDED
|
@@ -0,0 +1,13 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"summary": {
|
| 3 |
+
"n_decisions": 1400,
|
| 4 |
+
"accuracy": 0.7333333333333333,
|
| 5 |
+
"soft_accuracy": 0.4459918333333333,
|
| 6 |
+
"brier": 0.46694727990000007,
|
| 7 |
+
"ece": 0.23802802500000003,
|
| 8 |
+
"score_mae": 0.29625,
|
| 9 |
+
"latency_ms_mean": 3256.1262979148887,
|
| 10 |
+
"latency_ms_median": 3442.1574100852013,
|
| 11 |
+
"cases": 400
|
| 12 |
+
}
|
| 13 |
+
}
|
eval_comparison.md
ADDED
|
@@ -0,0 +1,18 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
# XERON-0.1 vs Laya โ ๋์ผ ์กฐ๊ฑด ์ค์ธก ๋น๊ต
|
| 2 |
+
|
| 3 |
+
- ํ๊ฐ์
: `LocalLLaMA/typed-decisions` **test** split (400 cases = 600 choice + 400 score + 400 noul = 1,400 decisions)
|
| 4 |
+
- ํ๊ฐ ์คํฌ๋ฆฝํธ: `XERON/scripts/evaluate.py` (+ `scripts/recompute_metrics.py`๋ก score MAE/ํ์
๋ณ ์ฌ๊ณ์ฐ)
|
| 5 |
+
- ํ๋์จ์ด: CPU (๋จ์ผ ํ๋ก์ธ์ค), 2026-09-22
|
| 6 |
+
- ๊ฐ ๋ชจ๋ธ์ **๋์ผํ ํ๊ฐ์
ยท๋์ผ ์คํฌ๋ฆฝํธ**๋ก ์ธก์
|
| 7 |
+
|
| 8 |
+
| ๋ชจ๋ธ | ๋ฐฑ๋ณธ / ํ๋ผ๋ฏธํฐ | choice acc (600) | soft acc | Brier | ECE โ | score MAE โ | noul acc |
|
| 9 |
+
|---|---|---|---|---|---|---|---|
|
| 10 |
+
| **XERON-0.1** (ours) | mmBERT-base ยท 322M (ํ์ธํ๋) | 0.7000 | **0.5171** | **0.4493** | **0.2143** | 0.4213 | 0.7817 |
|
| 11 |
+
| laya-typed-decisions (Convai) | ModernBERT-large ยท 421M (๋ฒค๋ ํ๋) | **0.7333** | 0.4460 | 0.4669 | 0.2380 | **0.2963** | **0.8583** |
|
| 12 |
+
| laya-multilingual (Convai) | mmBERT-base ยท 322M (base, ๋ฏธํ๋) | 0.2900 | 0.2758 | 0.9952 | 0.3282 | 1.0625 | 0.4983 |
|
| 13 |
+
| Jev (TypeSafe AI) | ๋น๊ณต๊ฐ ยท ํธ์คํ
API | ์ธก์ ๋ถ๊ฐ (API ๋น๊ณต๊ฐ) | โ | โ | โ | โ | โ |
|
| 14 |
+
|
| 15 |
+
**ํด์**
|
| 16 |
+
- ๋ฏธํ๋ `laya-multilingual`(0.290) โ XERON-0.1(0.700)๋ก **+41.0%p**. ํ์ธํ๋์ด ๊ฒฐ์ ์ ์ด๋ฉฐ, "Laya base๋ ํ์คํฌ๋ณ FT ์ ์ "๋ผ๋ ๊ณต๊ฐ ์ค๋ช
๊ณผ ์ผ์น.
|
| 17 |
+
- ๋ฒค๋๊ฐ typed-decisions๋ก ์ง์ ํ๋ํ `laya-typed-decisions`(0.7333)์ ๋น๊ตํ๋ฉด ํ๋ ๋ผ๋ฒจ ์ ํ๋๋ **-3.3%p ๊ทผ์ ์ด์ธ**, ๊ทธ๋ฌ๋ **soft accuracy(+7.1%p)์ ECE(-0.024)๋ XERON์ด ์ฐ์** โ ํ๋ฅ (์ ๋ขฐ๋) ํ์ง์ด ๋ ์ข๋ค.
|
| 18 |
+
- XERON-0.1์ 322M ๋ฉํฐ๋ง๊ถ์ผ ๋ชจ๋ธ๋ก ์์ด ์ ์ฉ 421M ๋ฒค๋ ํ๋ ๋ชจ๋ธ๊ณผ ๋ง๋จน๋ ์์ค์ด๋ฉฐ, ํ๊ตญ์ดยท๋ธ๋ผ์ฐ์ ยท์น ์์ด์ ํธยท์ฅ๋ฌธ(4096)๊น์ง ์ปค๋ฒํ๋ค.
|