Text Classification
PEFT
Safetensors
English
decision-model
calibration
lora
multiple-choice
typesafe
qwen3.5
Eval Results (legacy)
Instructions to use jaredpalmer/kev-0.8b with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use jaredpalmer/kev-0.8b with PEFT:
Task type is invalid.
- Notebooks
- Google Colab
- Kaggle
Kev-0.8B: dates+unknowable delta (locked test 0.834 / 0.684); previous weights at tag v7-base
Browse files- README.md +21 -20
- adapter_model.safetensors +1 -1
- head.pt +2 -2
- provenance.json +19 -16
- result.json +0 -0
- train.log +47 -317
- training_config.json +14 -4
- training_metrics.json +7 -7
README.md
CHANGED
|
@@ -33,54 +33,55 @@ model-index:
|
|
| 33 |
- task: { type: text-classification, name: typed decision (choice / noul / score) }
|
| 34 |
dataset: { type: mixed, name: "decision-v7 development (1,204 records; ten trained public sources + programmatic policy data)" }
|
| 35 |
metrics:
|
| 36 |
-
- { type: accuracy, value: 0.
|
| 37 |
-
- { type: expected_calibration_error, value: 0.
|
| 38 |
- task: { type: text-classification, name: typed decision, out-of-domain }
|
| 39 |
dataset: { type: mixed, name: "transfer-v4 development (764 records; six never-trained sources + held-out policy structures)" }
|
| 40 |
metrics:
|
| 41 |
-
- { type: accuracy, value: 0.
|
| 42 |
-
- { type: brier_score, value: 0.
|
| 43 |
---
|
| 44 |
|
| 45 |
# Kev-0.8B
|
| 46 |
|
| 47 |
Kev-0.8B is a **decision model**: one document (the *state*) and a set of typed questions in, a probability distribution per question out, in one forward pass. No text generation. It is a LoRA adapter (r=16, 11.3M trainable parameters) plus a pointer head on `Qwen/Qwen3.5-0.8B-Base` (revision `dc7cdfe2`), serving TypeSafe's public `/v1/systemone` contract.
|
| 48 |
|
| 49 |
-
**The small member of the Kev family.** Same data and recipe as the 0.6B it replaces, on the Qwen3.5 base: in-distribution 0.
|
| 50 |
|
| 51 |
-
- Hub: `jaredpalmer/kev-0.8b` (this repo; trial `
|
| 52 |
- Code, suites, results, and the full research log: [github.com/jaredpalmer/kev](https://github.com/jaredpalmer/kev) — `PLAN_Qwen35.md`, `PLAN.md`, `runs/leaderboard.md`
|
| 53 |
|
| 54 |
## Results (same frozen items for every row)
|
| 55 |
|
| 56 |
| | Kev-0.6B (Qwen3) | **Kev-0.8B** | Kev-4B | Kev-9B | Jev |
|
| 57 |
|---|---|---|---|---|---|
|
| 58 |
-
| in-distribution accuracy (decision-v7 dev, 1,204 records) | 0.801 | **0.
|
| 59 |
-
| out-of-domain accuracy (transfer-v4 dev, 764 records) | 0.620 | **0.
|
| 60 |
-
| out-of-domain Brier | 0.536 | **0.
|
| 61 |
-
| confident errors out of domain (p ≥ 0.9 and wrong) | 10.8% | 9.
|
| 62 |
-
| coverage at ≤ 5% error (share of decisions automatable) | – | 0.
|
| 63 |
-
| held-out policy structures, both siblings correct | 0.08 | **0.
|
| 64 |
-
| option-order flip rate | 0.07 | 0.
|
| 65 |
-
| none-option present, accuracy | 0.80 | 0.83 | 0.
|
|
|
|
| 66 |
|
| 67 |
-
Per-source out-of-domain accuracy (Kev-0.8B / Jev): QNLI 0.
|
| 68 |
|
| 69 |
-
Paired against Kev-0.6B on the same items (record-clustered bootstrap): +5.7 pp [+1.2, +10.0] out of domain.
|
| 70 |
|
| 71 |
-
**Locked test, read once** (`runs/locked/kev-08b-q35-ungated/`): in-distribution **0.
|
| 72 |
|
| 73 |
## Known limits
|
| 74 |
|
| 75 |
- **Out of domain it is a sub-1B model.** Knowledge (MMLU 0.41) and paraphrase (PAWS 0.59) are near the untrained base; the same recipe reaches 0.79 at 4B and 0.81 at 9B on these items.
|
| 76 |
- **Slow on a Mac for its size.** The DeltaNet kernels have no MPS implementation; a five-question request takes ~0.33 s in bf16 on an M5 (Kev-0.6B: 0.12 s). On CUDA with `flash-linear-attention` it is fast.
|
| 77 |
- Requires `transformers >= 5.17` and `peft >= 0.21`.
|
| 78 |
-
- Ordinal hedging on date arithmetic (`deadline` 0.
|
| 79 |
-
- Confident-error rate out of domain is 9.
|
| 80 |
|
| 81 |
## Training
|
| 82 |
|
| 83 |
-
Frozen suite `evals/v7/decision-v7`: 10,000 public records (1,000 per source), 896 policy minimal-pair records over nine template families, 1,680 records from 60 randomly generated rule structures in four rendering styles. Two epochs, LoRA r=16 α=32 on attention, MLP and DeltaNet projections; pointer head from scratch; cross-entropy on the option distribution; lr 1e-4 (OneCycle), batch 8, bf16 autocast with fp32 master weights; option permutation, none-of-the-above insertion, distractors, none minimal pairs on 25% of Choice records; ~20 min on one H100. No Jev outputs were used for training.
|
| 84 |
|
| 85 |
## Evaluation protocol
|
| 86 |
|
|
|
|
| 33 |
- task: { type: text-classification, name: typed decision (choice / noul / score) }
|
| 34 |
dataset: { type: mixed, name: "decision-v7 development (1,204 records; ten trained public sources + programmatic policy data)" }
|
| 35 |
metrics:
|
| 36 |
+
- { type: accuracy, value: 0.825 }
|
| 37 |
+
- { type: expected_calibration_error, value: 0.110, name: "ECE, raw probabilities" }
|
| 38 |
- task: { type: text-classification, name: typed decision, out-of-domain }
|
| 39 |
dataset: { type: mixed, name: "transfer-v4 development (764 records; six never-trained sources + held-out policy structures)" }
|
| 40 |
metrics:
|
| 41 |
+
- { type: accuracy, value: 0.652 }
|
| 42 |
+
- { type: brier_score, value: 0.499 }
|
| 43 |
---
|
| 44 |
|
| 45 |
# Kev-0.8B
|
| 46 |
|
| 47 |
Kev-0.8B is a **decision model**: one document (the *state*) and a set of typed questions in, a probability distribution per question out, in one forward pass. No text generation. It is a LoRA adapter (r=16, 11.3M trainable parameters) plus a pointer head on `Qwen/Qwen3.5-0.8B-Base` (revision `dc7cdfe2`), serving TypeSafe's public `/v1/systemone` contract.
|
| 48 |
|
| 49 |
+
**The small member of the Kev family.** Same data and recipe as the 0.6B it replaces, on the Qwen3.5 base: in-distribution 0.825 (Kev-0.6B 0.801), out of domain 0.652 (0.620), and it is the first small Kev that learns any rule composition (held-out pairs 0.42 vs 0.08). Three seeds of the base recipe: transfer 0.622 / 0.634 / **0.643**; this checkpoint is seed 2 (selected on development accuracy) followed by a 9-minute **delta fine-tune** on 1,425 generated records (date-bearing policy cases with explicit day counts; evidence-free cases with uniform targets) mixed with 2,000 replayed training records — the same delta as Kev-4B and Kev-9B. Locked test against the pre-delta checkpoint: out of domain 0.668 → **0.684** (+2.2 pp [−0.8, +5.5]), Brier 0.473 → 0.460. Out of domain it is still a sub-1B model: use Kev-4B for accuracy; use this one where memory rules the 4B out, and measure on your own data.
|
| 50 |
|
| 51 |
+
- Hub: `jaredpalmer/kev-0.8b` (this repo; trial `night2-08b-du2/00-trial-0`). The pre-delta checkpoint is at revision `v7-base`.
|
| 52 |
- Code, suites, results, and the full research log: [github.com/jaredpalmer/kev](https://github.com/jaredpalmer/kev) — `PLAN_Qwen35.md`, `PLAN.md`, `runs/leaderboard.md`
|
| 53 |
|
| 54 |
## Results (same frozen items for every row)
|
| 55 |
|
| 56 |
| | Kev-0.6B (Qwen3) | **Kev-0.8B** | Kev-4B | Kev-9B | Jev |
|
| 57 |
|---|---|---|---|---|---|
|
| 58 |
+
| in-distribution accuracy (decision-v7 dev, 1,204 records) | 0.801 | **0.825** | 0.872 | 0.872 | 0.845 |
|
| 59 |
+
| out-of-domain accuracy (transfer-v4 dev, 764 records) | 0.620 | **0.652** | 0.797 | 0.822 | 0.857 |
|
| 60 |
+
| out-of-domain Brier | 0.536 | **0.499** | 0.299 | 0.286 | 0.211 |
|
| 61 |
+
| confident errors out of domain (p ≥ 0.9 and wrong) | 10.8% | 9.9% | 6.9% | 8.7% | 3.7% |
|
| 62 |
+
| coverage at ≤ 5% error (share of decisions automatable) | – | 0.23 | 0.54 | 0.47 | 0.70 |
|
| 63 |
+
| held-out policy structures, both siblings correct | 0.08 | **0.42** | 0.78 | 0.83 | 0.86 |
|
| 64 |
+
| option-order flip rate | 0.07 | 0.08 | 0.08 | 0.03 | 0.00 |
|
| 65 |
+
| none-option present, accuracy | 0.80 | 0.83 | 0.92 | 0.90 | – |
|
| 66 |
+
| calibrated (T = 2.2, fitted in-distribution): Brier / ECE / confident errors | – | 0.433 / 0.062 / 0.8% | | | |
|
| 67 |
|
| 68 |
+
Per-source out-of-domain accuracy (Kev-0.8B / Jev): QNLI 0.85 / 0.93, SciQ 0.91 / 0.99, TweetEval-offensive 0.68 / 0.81, PAWS 0.55 / 0.79, MMLU 0.42 / 0.90, Emotion 0.54 / 0.59, authorization 0.97 / 1.00, deadline (3-level date arithmetic) 0.38 / 0.93, (A or B) and C 0.66 / 0.91, (A and B) or not C 0.56 / 0.97, if A then not B else C 0.59 / 0.78.
|
| 69 |
|
| 70 |
+
Paired against Kev-0.6B on the same items (record-clustered bootstrap), before the delta: +5.7 pp [+1.2, +10.0] out of domain; the delta adds +0.5 pp [−3.2, +3.8] on development and +2.2 pp on the locked test.
|
| 71 |
|
| 72 |
+
**Locked test, read once per checkpoint** (`runs/locked/kev-08b-night2-du-ungated/`; pre-delta `runs/locked/kev-08b-q35-ungated/`): in-distribution **0.834** (Brier 0.268, ECE 0.100), out-of-domain **0.684** (Brier 0.460, ECE 0.154, confident errors 8.7%, held-out pairs 0.45). Pre-delta: 0.827 / 0.668; Kev-0.6B on the same test items: 0.808 / 0.642.
|
| 73 |
|
| 74 |
## Known limits
|
| 75 |
|
| 76 |
- **Out of domain it is a sub-1B model.** Knowledge (MMLU 0.41) and paraphrase (PAWS 0.59) are near the untrained base; the same recipe reaches 0.79 at 4B and 0.81 at 9B on these items.
|
| 77 |
- **Slow on a Mac for its size.** The DeltaNet kernels have no MPS implementation; a five-question request takes ~0.33 s in bf16 on an M5 (Kev-0.6B: 0.12 s). On CUDA with `flash-linear-attention` it is fast.
|
| 78 |
- Requires `transformers >= 5.17` and `peft >= 0.21`.
|
| 79 |
+
- Ordinal hedging on date arithmetic (`deadline` 0.38): collapses to the middle level. `KEV_DATE_FACTS=1` (day counts appended to the state) helps the larger models more than this one.
|
| 80 |
+
- Confident-error rate out of domain is 9.9% raw; `KEV_TEMPERATURE=2.2` brings it to 0.8% and ECE from 0.179 to 0.062 without changing any answer. Probabilities are usable in-domain; treat them as advisory elsewhere.
|
| 81 |
|
| 82 |
## Training
|
| 83 |
|
| 84 |
+
Frozen suite `evals/v7/decision-v7`: 10,000 public records (1,000 per source), 896 policy minimal-pair records over nine template families, 1,680 records from 60 randomly generated rule structures in four rendering styles. Two epochs, LoRA r=16 α=32 on attention, MLP and DeltaNet projections; pointer head from scratch; cross-entropy on the option distribution; lr 1e-4 (OneCycle), batch 8, bf16 autocast with fp32 master weights; option permutation, none-of-the-above insertion, distractors, none minimal pairs on 25% of Choice records; ~20 min on one H100. Then the delta: `--init_from jaredpalmer/kev-0.8b@v7-base --data evals/night2/dates_unknowable.jsonl --replay 2000 --lr 4e-5 --epochs 1`, 9 minutes. No Jev outputs were used for training.
|
| 85 |
|
| 86 |
## Evaluation protocol
|
| 87 |
|
adapter_model.safetensors
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
size 43338624
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:c81d5716f0af7622d8d2b97013c333d48263ca01113f9a7cf4526e96f6ac0b26
|
| 3 |
size 43338624
|
head.pt
CHANGED
|
@@ -1,3 +1,3 @@
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
-
oid sha256:
|
| 3 |
-
size
|
|
|
|
| 1 |
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:591953b2ae128ef2adcf90124f59ac11fa05dec572525f9a6f0edf883079a995
|
| 3 |
+
size 2102911
|
provenance.json
CHANGED
|
@@ -1,8 +1,8 @@
|
|
| 1 |
{
|
| 2 |
"config": {
|
| 3 |
-
"epochs":
|
| 4 |
-
"seed":
|
| 5 |
-
"lr":
|
| 6 |
"lora": 16,
|
| 7 |
"accum": 1,
|
| 8 |
"batch": 8,
|
|
@@ -18,38 +18,41 @@
|
|
| 18 |
"head_lr": 0.0,
|
| 19 |
"weight_decay": 0.01,
|
| 20 |
"anchor_w": 0.0,
|
|
|
|
|
|
|
| 21 |
"base": "Qwen/Qwen3.5-0.8B-Base",
|
| 22 |
"base_revision": "dc7cdfe2ee4154fa7e30f5b51ca41bfa40174e68",
|
| 23 |
-
"
|
|
|
|
| 24 |
},
|
| 25 |
-
"config_sha256": "
|
| 26 |
"suite_sha256": "a8f50e481b7d90b97da049e0ff6a01cee2f1ed204aed61a8265af0edbb5514d2",
|
| 27 |
"source_hashes": {
|
| 28 |
"kev/__init__.py": "e3b0c44298fc1c149afbf4c8996fb92427ae41e4649b934ca495991b7852b855",
|
| 29 |
"kev/anchors.py": "089d8a5493502bb26f540eb1c5e681780ca0bb01276073d4e1733211f15d0e10",
|
| 30 |
-
"kev/api.py": "
|
| 31 |
"kev/autoresearch.py": "0a8aa6b57c1c9ba93d25b2cf631b03aed2e686e374c1148002eec48765b7b1fc",
|
| 32 |
-
"kev/benchmark.py": "
|
| 33 |
"kev/compare.py": "bd0445f021de59e35c7bff9304e39dd2e1211e3877a453575594ae7b81b0ada4",
|
| 34 |
"kev/composition.py": "f335ed17e18e0a544893db5e22b9a059e6ce1b2e14dbb863ac7d7bbf8f3e0536",
|
| 35 |
"kev/contrastive.py": "cbb979aa5d40265ad0e64695f94b281d91751fa405811ddfa8212fede111edcf",
|
| 36 |
-
"kev/data.py": "
|
| 37 |
-
"kev/evaluate.py": "
|
| 38 |
-
"kev/experiment.py": "
|
| 39 |
"kev/jev.py": "e0213782359ba2f95adbf045ddaf0a008b08b4162bf6a9b66d4ce55fc91a51cb",
|
| 40 |
-
"kev/model.py": "
|
| 41 |
"kev/plot.py": "d689c7dd18cde7f9ea77cb4f55c50ff7da1880b21cb2ecf244348e45842a1382",
|
| 42 |
-
"kev/publish.py": "
|
| 43 |
-
"kev/serve.py": "
|
| 44 |
"kev/study_v3.py": "9fc44d44dad09a4f1ee29a7bcb2eb3c7aa373d09186d0e9533666b69ec95c401",
|
| 45 |
"kev/suite.py": "44858f9a99df086a47d1ae36141631fab6fb6a8293a9e1d0c6ad397ddcfaf94a",
|
| 46 |
-
"kev/train.py": "
|
| 47 |
"kev/transfer_v9.py": "588aa2ff3ec0823c2e31733bef9a3748b263849c966ef6a80ebd686539c605e9",
|
| 48 |
-
"modal_app.py": "
|
| 49 |
"pyproject.toml": "52da5eea3efc6f2b1c0589acebad62e56a214294bb02c1a4218c93efd4af3182",
|
| 50 |
"uv.lock": "18b3e5ea0f25d2e8546fab81f16cb965ae05c3289fffaaa1ce27d114adee47f3"
|
| 51 |
},
|
| 52 |
-
"git_commit": "
|
| 53 |
"platform": "Linux-4.19.0-gvisor-x86_64-with-glibc2.36",
|
| 54 |
"torch": "2.8.0+cu128",
|
| 55 |
"device": "cuda",
|
|
|
|
| 1 |
{
|
| 2 |
"config": {
|
| 3 |
+
"epochs": 1,
|
| 4 |
+
"seed": 1,
|
| 5 |
+
"lr": 4e-05,
|
| 6 |
"lora": 16,
|
| 7 |
"accum": 1,
|
| 8 |
"batch": 8,
|
|
|
|
| 18 |
"head_lr": 0.0,
|
| 19 |
"weight_decay": 0.01,
|
| 20 |
"anchor_w": 0.0,
|
| 21 |
+
"dtype": "bf16",
|
| 22 |
+
"replay": 2000,
|
| 23 |
"base": "Qwen/Qwen3.5-0.8B-Base",
|
| 24 |
"base_revision": "dc7cdfe2ee4154fa7e30f5b51ca41bfa40174e68",
|
| 25 |
+
"init_from": "jaredpalmer/kev-0.8b",
|
| 26 |
+
"data": "evals/night2/dates_unknowable.jsonl"
|
| 27 |
},
|
| 28 |
+
"config_sha256": "0e130e9f338c8a4c911c6dc37493b36e6be7ca972cbafbb42466043b6daa7a4b",
|
| 29 |
"suite_sha256": "a8f50e481b7d90b97da049e0ff6a01cee2f1ed204aed61a8265af0edbb5514d2",
|
| 30 |
"source_hashes": {
|
| 31 |
"kev/__init__.py": "e3b0c44298fc1c149afbf4c8996fb92427ae41e4649b934ca495991b7852b855",
|
| 32 |
"kev/anchors.py": "089d8a5493502bb26f540eb1c5e681780ca0bb01276073d4e1733211f15d0e10",
|
| 33 |
+
"kev/api.py": "c9eebbdb6c625563d33f030299ce0fbe8b50493dd1e92592df9514c30f5720af",
|
| 34 |
"kev/autoresearch.py": "0a8aa6b57c1c9ba93d25b2cf631b03aed2e686e374c1148002eec48765b7b1fc",
|
| 35 |
+
"kev/benchmark.py": "4192ec3b26b065452f84bde38a091e6854a28fe185d2e0f39a0c91b2efe69df7",
|
| 36 |
"kev/compare.py": "bd0445f021de59e35c7bff9304e39dd2e1211e3877a453575594ae7b81b0ada4",
|
| 37 |
"kev/composition.py": "f335ed17e18e0a544893db5e22b9a059e6ce1b2e14dbb863ac7d7bbf8f3e0536",
|
| 38 |
"kev/contrastive.py": "cbb979aa5d40265ad0e64695f94b281d91751fa405811ddfa8212fede111edcf",
|
| 39 |
+
"kev/data.py": "997c31d737c2a130ade49edd6534aa47d910786c98af883745b1a97ec858a704",
|
| 40 |
+
"kev/evaluate.py": "1b20e3f9edf417aa8dae924b1526e52f74b710cadf7213c5ec68334f6e7f8fe1",
|
| 41 |
+
"kev/experiment.py": "ba034856f79bd500d8b2eeeb7382e4db3fccb30b437f9f3cf55cf1a7c565a6c9",
|
| 42 |
"kev/jev.py": "e0213782359ba2f95adbf045ddaf0a008b08b4162bf6a9b66d4ce55fc91a51cb",
|
| 43 |
+
"kev/model.py": "a17d57a52da3fe6ebef7146ce548bd3cedc09e21cc2b7738d9077771f5f16989",
|
| 44 |
"kev/plot.py": "d689c7dd18cde7f9ea77cb4f55c50ff7da1880b21cb2ecf244348e45842a1382",
|
| 45 |
+
"kev/publish.py": "8f23cda767008756e0f169249eb44577db76bd6c1e12e9cf64c302bad04c8f16",
|
| 46 |
+
"kev/serve.py": "d095bbee3a210fa8807d1a7b073b56181c93aa69b00f2e243a323ab0a19fa8c9",
|
| 47 |
"kev/study_v3.py": "9fc44d44dad09a4f1ee29a7bcb2eb3c7aa373d09186d0e9533666b69ec95c401",
|
| 48 |
"kev/suite.py": "44858f9a99df086a47d1ae36141631fab6fb6a8293a9e1d0c6ad397ddcfaf94a",
|
| 49 |
+
"kev/train.py": "c2a3770072b73dd4c0769c8f188ddedbb402f2f8195df6e10b11e5112cab734b",
|
| 50 |
"kev/transfer_v9.py": "588aa2ff3ec0823c2e31733bef9a3748b263849c966ef6a80ebd686539c605e9",
|
| 51 |
+
"modal_app.py": "d3700b2914be5ef6baa6d588a967d3a242903e1ed96d0f5cc525a8908aa58340",
|
| 52 |
"pyproject.toml": "52da5eea3efc6f2b1c0589acebad62e56a214294bb02c1a4218c93efd4af3182",
|
| 53 |
"uv.lock": "18b3e5ea0f25d2e8546fab81f16cb965ae05c3289fffaaa1ce27d114adee47f3"
|
| 54 |
},
|
| 55 |
+
"git_commit": "19dcae9b6e3e1a48200c5825aad9fc200d31e20a",
|
| 56 |
"platform": "Linux-4.19.0-gvisor-x86_64-with-glibc2.36",
|
| 57 |
"torch": "2.8.0+cu128",
|
| 58 |
"device": "cuda",
|
result.json
CHANGED
|
The diff for this file is too large to render.
See raw diff
|
|
|
train.log
CHANGED
|
@@ -1,319 +1,49 @@
|
|
|
|
|
|
|
|
| 1 |
device=cuda trainable params=11.3M
|
| 2 |
-
|
|
|
|
| 3 |
[transformers] `causal_conv1d_fn` is falling back to its reference PyTorch implementation because `causal_conv1d` is not installed. This is correct but much slower; install `causal_conv1d` for the optimized kernel.
|
| 4 |
-
ep0 step 10/
|
| 5 |
-
ep0 step 20/
|
| 6 |
-
ep0 step 30/
|
| 7 |
-
ep0 step 40/
|
| 8 |
-
ep0 step 50/
|
| 9 |
-
ep0 step 60/
|
| 10 |
-
ep0 step 70/
|
| 11 |
-
ep0 step 80/
|
| 12 |
-
ep0 step 90/
|
| 13 |
-
ep0 step 100/
|
| 14 |
-
ep0 step 110/
|
| 15 |
-
ep0 step 120/
|
| 16 |
-
ep0 step 130/
|
| 17 |
-
ep0 step 140/
|
| 18 |
-
ep0 step 150/
|
| 19 |
-
ep0 step 160/
|
| 20 |
-
ep0 step 170/
|
| 21 |
-
ep0 step 180/
|
| 22 |
-
ep0 step 190/
|
| 23 |
-
ep0 step 200/
|
| 24 |
-
ep0 step 210/
|
| 25 |
-
ep0 step 220/
|
| 26 |
-
ep0 step 230/
|
| 27 |
-
ep0 step 240/
|
| 28 |
-
ep0 step 250/
|
| 29 |
-
ep0 step 260/
|
| 30 |
-
ep0 step 270/
|
| 31 |
-
ep0 step 280/
|
| 32 |
-
ep0 step 290/
|
| 33 |
-
ep0 step 300/
|
| 34 |
-
ep0 step 310/
|
| 35 |
-
ep0 step 320/
|
| 36 |
-
ep0 step 330/
|
| 37 |
-
ep0 step 340/
|
| 38 |
-
ep0 step 350/
|
| 39 |
-
ep0 step 360/
|
| 40 |
-
ep0 step 370/
|
| 41 |
-
ep0 step 380/
|
| 42 |
-
ep0 step 390/
|
| 43 |
-
ep0 step 400/
|
| 44 |
-
ep0 step 410/
|
| 45 |
-
ep0 step 420/
|
| 46 |
-
|
| 47 |
-
ep0 step 440/3144 loss 0.781 kl 0.000 anchor 0.000 0.087s/rec
|
| 48 |
-
ep0 step 450/3144 loss 0.757 kl 0.000 anchor 0.000 0.085s/rec
|
| 49 |
-
ep0 step 460/3144 loss 0.768 kl 0.000 anchor 0.000 0.084s/rec
|
| 50 |
-
ep0 step 470/3144 loss 0.727 kl 0.000 anchor 0.000 0.083s/rec
|
| 51 |
-
ep0 step 480/3144 loss 0.734 kl 0.000 anchor 0.000 0.082s/rec
|
| 52 |
-
ep0 step 490/3144 loss 0.642 kl 0.000 anchor 0.000 0.081s/rec
|
| 53 |
-
ep0 step 500/3144 loss 0.758 kl 0.000 anchor 0.000 0.080s/rec
|
| 54 |
-
ep0 step 510/3144 loss 0.840 kl 0.000 anchor 0.000 0.079s/rec
|
| 55 |
-
ep0 step 520/3144 loss 0.651 kl 0.000 anchor 0.000 0.078s/rec
|
| 56 |
-
ep0 step 530/3144 loss 1.135 kl 0.000 anchor 0.000 0.077s/rec
|
| 57 |
-
ep0 step 540/3144 loss 0.673 kl 0.000 anchor 0.000 0.076s/rec
|
| 58 |
-
ep0 step 550/3144 loss 0.567 kl 0.000 anchor 0.000 0.075s/rec
|
| 59 |
-
ep0 step 560/3144 loss 1.174 kl 0.000 anchor 0.000 0.075s/rec
|
| 60 |
-
ep0 step 570/3144 loss 0.739 kl 0.000 anchor 0.000 0.074s/rec
|
| 61 |
-
ep0 step 580/3144 loss 0.647 kl 0.000 anchor 0.000 0.073s/rec
|
| 62 |
-
ep0 step 590/3144 loss 0.707 kl 0.000 anchor 0.000 0.073s/rec
|
| 63 |
-
ep0 step 600/3144 loss 0.629 kl 0.000 anchor 0.000 0.072s/rec
|
| 64 |
-
ep0 step 610/3144 loss 0.530 kl 0.000 anchor 0.000 0.072s/rec
|
| 65 |
-
ep0 step 620/3144 loss 0.579 kl 0.000 anchor 0.000 0.071s/rec
|
| 66 |
-
ep0 step 630/3144 loss 0.710 kl 0.000 anchor 0.000 0.071s/rec
|
| 67 |
-
ep0 step 640/3144 loss 0.795 kl 0.000 anchor 0.000 0.070s/rec
|
| 68 |
-
ep0 step 650/3144 loss 0.729 kl 0.000 anchor 0.000 0.070s/rec
|
| 69 |
-
ep0 step 660/3144 loss 0.806 kl 0.000 anchor 0.000 0.069s/rec
|
| 70 |
-
ep0 step 670/3144 loss 0.847 kl 0.000 anchor 0.000 0.068s/rec
|
| 71 |
-
ep0 step 680/3144 loss 0.735 kl 0.000 anchor 0.000 0.068s/rec
|
| 72 |
-
ep0 step 690/3144 loss 0.663 kl 0.000 anchor 0.000 0.067s/rec
|
| 73 |
-
ep0 step 700/3144 loss 0.755 kl 0.000 anchor 0.000 0.067s/rec
|
| 74 |
-
ep0 step 710/3144 loss 0.572 kl 0.000 anchor 0.000 0.066s/rec
|
| 75 |
-
ep0 step 720/3144 loss 0.413 kl 0.000 anchor 0.000 0.066s/rec
|
| 76 |
-
ep0 step 730/3144 loss 0.668 kl 0.000 anchor 0.000 0.065s/rec
|
| 77 |
-
ep0 step 740/3144 loss 0.540 kl 0.000 anchor 0.000 0.065s/rec
|
| 78 |
-
ep0 step 750/3144 loss 0.683 kl 0.000 anchor 0.000 0.064s/rec
|
| 79 |
-
ep0 step 760/3144 loss 0.517 kl 0.000 anchor 0.000 0.064s/rec
|
| 80 |
-
ep0 step 770/3144 loss 0.762 kl 0.000 anchor 0.000 0.064s/rec
|
| 81 |
-
ep0 step 780/3144 loss 0.634 kl 0.000 anchor 0.000 0.063s/rec
|
| 82 |
-
ep0 step 790/3144 loss 0.612 kl 0.000 anchor 0.000 0.063s/rec
|
| 83 |
-
ep0 step 800/3144 loss 0.746 kl 0.000 anchor 0.000 0.062s/rec
|
| 84 |
-
ep0 step 810/3144 loss 0.471 kl 0.000 anchor 0.000 0.062s/rec
|
| 85 |
-
ep0 step 820/3144 loss 0.620 kl 0.000 anchor 0.000 0.061s/rec
|
| 86 |
-
ep0 step 830/3144 loss 0.470 kl 0.000 anchor 0.000 0.061s/rec
|
| 87 |
-
ep0 step 840/3144 loss 0.836 kl 0.000 anchor 0.000 0.061s/rec
|
| 88 |
-
ep0 step 850/3144 loss 0.670 kl 0.000 anchor 0.000 0.060s/rec
|
| 89 |
-
ep0 step 860/3144 loss 0.489 kl 0.000 anchor 0.000 0.060s/rec
|
| 90 |
-
ep0 step 870/3144 loss 0.845 kl 0.000 anchor 0.000 0.060s/rec
|
| 91 |
-
ep0 step 880/3144 loss 0.760 kl 0.000 anchor 0.000 0.059s/rec
|
| 92 |
-
ep0 step 890/3144 loss 0.577 kl 0.000 anchor 0.000 0.059s/rec
|
| 93 |
-
ep0 step 900/3144 loss 0.841 kl 0.000 anchor 0.000 0.059s/rec
|
| 94 |
-
ep0 step 910/3144 loss 0.743 kl 0.000 anchor 0.000 0.058s/rec
|
| 95 |
-
ep0 step 920/3144 loss 0.477 kl 0.000 anchor 0.000 0.058s/rec
|
| 96 |
-
ep0 step 930/3144 loss 0.438 kl 0.000 anchor 0.000 0.058s/rec
|
| 97 |
-
ep0 step 940/3144 loss 1.025 kl 0.000 anchor 0.000 0.058s/rec
|
| 98 |
-
ep0 step 950/3144 loss 0.442 kl 0.000 anchor 0.000 0.057s/rec
|
| 99 |
-
ep0 step 960/3144 loss 1.030 kl 0.000 anchor 0.000 0.057s/rec
|
| 100 |
-
ep0 step 970/3144 loss 0.694 kl 0.000 anchor 0.000 0.057s/rec
|
| 101 |
-
ep0 step 980/3144 loss 0.540 kl 0.000 anchor 0.000 0.057s/rec
|
| 102 |
-
ep0 step 990/3144 loss 0.481 kl 0.000 anchor 0.000 0.056s/rec
|
| 103 |
-
ep0 step 1000/3144 loss 0.904 kl 0.000 anchor 0.000 0.056s/rec
|
| 104 |
-
ep0 step 1010/3144 loss 0.575 kl 0.000 anchor 0.000 0.056s/rec
|
| 105 |
-
ep0 step 1020/3144 loss 0.900 kl 0.000 anchor 0.000 0.056s/rec
|
| 106 |
-
ep0 step 1030/3144 loss 0.500 kl 0.000 anchor 0.000 0.055s/rec
|
| 107 |
-
ep0 step 1040/3144 loss 0.616 kl 0.000 anchor 0.000 0.055s/rec
|
| 108 |
-
ep0 step 1050/3144 loss 0.475 kl 0.000 anchor 0.000 0.055s/rec
|
| 109 |
-
ep0 step 1060/3144 loss 0.551 kl 0.000 anchor 0.000 0.055s/rec
|
| 110 |
-
ep0 step 1070/3144 loss 0.524 kl 0.000 anchor 0.000 0.055s/rec
|
| 111 |
-
ep0 step 1080/3144 loss 0.647 kl 0.000 anchor 0.000 0.054s/rec
|
| 112 |
-
ep0 step 1090/3144 loss 0.662 kl 0.000 anchor 0.000 0.054s/rec
|
| 113 |
-
ep0 step 1100/3144 loss 0.659 kl 0.000 anchor 0.000 0.054s/rec
|
| 114 |
-
ep0 step 1110/3144 loss 0.671 kl 0.000 anchor 0.000 0.054s/rec
|
| 115 |
-
ep0 step 1120/3144 loss 0.542 kl 0.000 anchor 0.000 0.053s/rec
|
| 116 |
-
ep0 step 1130/3144 loss 0.498 kl 0.000 anchor 0.000 0.053s/rec
|
| 117 |
-
ep0 step 1140/3144 loss 0.415 kl 0.000 anchor 0.000 0.053s/rec
|
| 118 |
-
ep0 step 1150/3144 loss 0.540 kl 0.000 anchor 0.000 0.053s/rec
|
| 119 |
-
ep0 step 1160/3144 loss 0.790 kl 0.000 anchor 0.000 0.053s/rec
|
| 120 |
-
ep0 step 1170/3144 loss 0.597 kl 0.000 anchor 0.000 0.052s/rec
|
| 121 |
-
ep0 step 1180/3144 loss 0.521 kl 0.000 anchor 0.000 0.052s/rec
|
| 122 |
-
ep0 step 1190/3144 loss 0.559 kl 0.000 anchor 0.000 0.052s/rec
|
| 123 |
-
ep0 step 1200/3144 loss 0.601 kl 0.000 anchor 0.000 0.052s/rec
|
| 124 |
-
ep0 step 1210/3144 loss 0.420 kl 0.000 anchor 0.000 0.052s/rec
|
| 125 |
-
ep0 step 1220/3144 loss 0.577 kl 0.000 anchor 0.000 0.052s/rec
|
| 126 |
-
ep0 step 1230/3144 loss 0.510 kl 0.000 anchor 0.000 0.051s/rec
|
| 127 |
-
ep0 step 1240/3144 loss 0.596 kl 0.000 anchor 0.000 0.051s/rec
|
| 128 |
-
ep0 step 1250/3144 loss 0.649 kl 0.000 anchor 0.000 0.051s/rec
|
| 129 |
-
ep0 step 1260/3144 loss 0.590 kl 0.000 anchor 0.000 0.051s/rec
|
| 130 |
-
ep0 step 1270/3144 loss 0.610 kl 0.000 anchor 0.000 0.051s/rec
|
| 131 |
-
ep0 step 1280/3144 loss 0.623 kl 0.000 anchor 0.000 0.051s/rec
|
| 132 |
-
ep0 step 1290/3144 loss 0.706 kl 0.000 anchor 0.000 0.051s/rec
|
| 133 |
-
ep0 step 1300/3144 loss 0.876 kl 0.000 anchor 0.000 0.050s/rec
|
| 134 |
-
ep0 step 1310/3144 loss 0.552 kl 0.000 anchor 0.000 0.050s/rec
|
| 135 |
-
ep0 step 1320/3144 loss 0.539 kl 0.000 anchor 0.000 0.050s/rec
|
| 136 |
-
ep0 step 1330/3144 loss 0.888 kl 0.000 anchor 0.000 0.050s/rec
|
| 137 |
-
ep0 step 1340/3144 loss 0.550 kl 0.000 anchor 0.000 0.050s/rec
|
| 138 |
-
ep0 step 1350/3144 loss 0.407 kl 0.000 anchor 0.000 0.050s/rec
|
| 139 |
-
ep0 step 1360/3144 loss 0.783 kl 0.000 anchor 0.000 0.050s/rec
|
| 140 |
-
ep0 step 1370/3144 loss 0.627 kl 0.000 anchor 0.000 0.049s/rec
|
| 141 |
-
ep0 step 1380/3144 loss 0.720 kl 0.000 anchor 0.000 0.049s/rec
|
| 142 |
-
ep0 step 1390/3144 loss 0.507 kl 0.000 anchor 0.000 0.049s/rec
|
| 143 |
-
ep0 step 1400/3144 loss 0.719 kl 0.000 anchor 0.000 0.049s/rec
|
| 144 |
-
ep0 step 1410/3144 loss 0.376 kl 0.000 anchor 0.000 0.049s/rec
|
| 145 |
-
ep0 step 1420/3144 loss 0.633 kl 0.000 anchor 0.000 0.049s/rec
|
| 146 |
-
ep0 step 1430/3144 loss 0.462 kl 0.000 anchor 0.000 0.049s/rec
|
| 147 |
-
ep0 step 1440/3144 loss 0.511 kl 0.000 anchor 0.000 0.048s/rec
|
| 148 |
-
ep0 step 1450/3144 loss 0.807 kl 0.000 anchor 0.000 0.048s/rec
|
| 149 |
-
ep0 step 1460/3144 loss 0.682 kl 0.000 anchor 0.000 0.048s/rec
|
| 150 |
-
ep0 step 1470/3144 loss 0.530 kl 0.000 anchor 0.000 0.048s/rec
|
| 151 |
-
ep0 step 1480/3144 loss 0.480 kl 0.000 anchor 0.000 0.048s/rec
|
| 152 |
-
ep0 step 1490/3144 loss 0.479 kl 0.000 anchor 0.000 0.048s/rec
|
| 153 |
-
ep0 step 1500/3144 loss 0.635 kl 0.000 anchor 0.000 0.048s/rec
|
| 154 |
-
ep0 step 1510/3144 loss 0.489 kl 0.000 anchor 0.000 0.048s/rec
|
| 155 |
-
ep0 step 1520/3144 loss 0.695 kl 0.000 anchor 0.000 0.048s/rec
|
| 156 |
-
ep0 step 1530/3144 loss 0.482 kl 0.000 anchor 0.000 0.047s/rec
|
| 157 |
-
ep0 step 1540/3144 loss 0.534 kl 0.000 anchor 0.000 0.047s/rec
|
| 158 |
-
ep0 step 1550/3144 loss 0.459 kl 0.000 anchor 0.000 0.047s/rec
|
| 159 |
-
ep0 step 1560/3144 loss 0.750 kl 0.000 anchor 0.000 0.047s/rec
|
| 160 |
-
ep0 step 1570/3144 loss 0.667 kl 0.000 anchor 0.000 0.047s/rec
|
| 161 |
-
ep1 step 1580/3144 loss 0.536 kl 0.000 anchor 0.000 0.047s/rec
|
| 162 |
-
ep1 step 1590/3144 loss 0.318 kl 0.000 anchor 0.000 0.047s/rec
|
| 163 |
-
ep1 step 1600/3144 loss 0.469 kl 0.000 anchor 0.000 0.047s/rec
|
| 164 |
-
ep1 step 1610/3144 loss 0.257 kl 0.000 anchor 0.000 0.047s/rec
|
| 165 |
-
ep1 step 1620/3144 loss 0.456 kl 0.000 anchor 0.000 0.046s/rec
|
| 166 |
-
ep1 step 1630/3144 loss 0.237 kl 0.000 anchor 0.000 0.046s/rec
|
| 167 |
-
ep1 step 1640/3144 loss 0.305 kl 0.000 anchor 0.000 0.046s/rec
|
| 168 |
-
ep1 step 1650/3144 loss 0.581 kl 0.000 anchor 0.000 0.046s/rec
|
| 169 |
-
ep1 step 1660/3144 loss 0.370 kl 0.000 anchor 0.000 0.046s/rec
|
| 170 |
-
ep1 step 1670/3144 loss 0.515 kl 0.000 anchor 0.000 0.046s/rec
|
| 171 |
-
ep1 step 1680/3144 loss 0.491 kl 0.000 anchor 0.000 0.046s/rec
|
| 172 |
-
ep1 step 1690/3144 loss 0.393 kl 0.000 anchor 0.000 0.046s/rec
|
| 173 |
-
ep1 step 1700/3144 loss 0.534 kl 0.000 anchor 0.000 0.046s/rec
|
| 174 |
-
ep1 step 1710/3144 loss 0.379 kl 0.000 anchor 0.000 0.046s/rec
|
| 175 |
-
ep1 step 1720/3144 loss 0.960 kl 0.000 anchor 0.000 0.046s/rec
|
| 176 |
-
ep1 step 1730/3144 loss 0.450 kl 0.000 anchor 0.000 0.046s/rec
|
| 177 |
-
ep1 step 1740/3144 loss 0.288 kl 0.000 anchor 0.000 0.045s/rec
|
| 178 |
-
ep1 step 1750/3144 loss 0.359 kl 0.000 anchor 0.000 0.045s/rec
|
| 179 |
-
ep1 step 1760/3144 loss 0.368 kl 0.000 anchor 0.000 0.045s/rec
|
| 180 |
-
ep1 step 1770/3144 loss 0.423 kl 0.000 anchor 0.000 0.045s/rec
|
| 181 |
-
ep1 step 1780/3144 loss 0.353 kl 0.000 anchor 0.000 0.045s/rec
|
| 182 |
-
ep1 step 1790/3144 loss 0.357 kl 0.000 anchor 0.000 0.045s/rec
|
| 183 |
-
ep1 step 1800/3144 loss 0.367 kl 0.000 anchor 0.000 0.045s/rec
|
| 184 |
-
ep1 step 1810/3144 loss 0.412 kl 0.000 anchor 0.000 0.045s/rec
|
| 185 |
-
ep1 step 1820/3144 loss 0.309 kl 0.000 anchor 0.000 0.045s/rec
|
| 186 |
-
ep1 step 1830/3144 loss 0.460 kl 0.000 anchor 0.000 0.045s/rec
|
| 187 |
-
ep1 step 1840/3144 loss 0.411 kl 0.000 anchor 0.000 0.045s/rec
|
| 188 |
-
ep1 step 1850/3144 loss 0.449 kl 0.000 anchor 0.000 0.045s/rec
|
| 189 |
-
ep1 step 1860/3144 loss 0.650 kl 0.000 anchor 0.000 0.044s/rec
|
| 190 |
-
ep1 step 1870/3144 loss 0.326 kl 0.000 anchor 0.000 0.044s/rec
|
| 191 |
-
ep1 step 1880/3144 loss 0.416 kl 0.000 anchor 0.000 0.044s/rec
|
| 192 |
-
ep1 step 1890/3144 loss 0.279 kl 0.000 anchor 0.000 0.044s/rec
|
| 193 |
-
ep1 step 1900/3144 loss 0.542 kl 0.000 anchor 0.000 0.044s/rec
|
| 194 |
-
ep1 step 1910/3144 loss 0.401 kl 0.000 anchor 0.000 0.044s/rec
|
| 195 |
-
ep1 step 1920/3144 loss 0.470 kl 0.000 anchor 0.000 0.044s/rec
|
| 196 |
-
ep1 step 1930/3144 loss 0.438 kl 0.000 anchor 0.000 0.044s/rec
|
| 197 |
-
ep1 step 1940/3144 loss 0.431 kl 0.000 anchor 0.000 0.044s/rec
|
| 198 |
-
ep1 step 1950/3144 loss 0.819 kl 0.000 anchor 0.000 0.044s/rec
|
| 199 |
-
ep1 step 1960/3144 loss 0.525 kl 0.000 anchor 0.000 0.044s/rec
|
| 200 |
-
ep1 step 1970/3144 loss 0.360 kl 0.000 anchor 0.000 0.044s/rec
|
| 201 |
-
ep1 step 1980/3144 loss 0.377 kl 0.000 anchor 0.000 0.044s/rec
|
| 202 |
-
ep1 step 1990/3144 loss 0.380 kl 0.000 anchor 0.000 0.044s/rec
|
| 203 |
-
ep1 step 2000/3144 loss 0.269 kl 0.000 anchor 0.000 0.044s/rec
|
| 204 |
-
ep1 step 2010/3144 loss 0.759 kl 0.000 anchor 0.000 0.043s/rec
|
| 205 |
-
ep1 step 2020/3144 loss 0.640 kl 0.000 anchor 0.000 0.043s/rec
|
| 206 |
-
ep1 step 2030/3144 loss 0.539 kl 0.000 anchor 0.000 0.043s/rec
|
| 207 |
-
ep1 step 2040/3144 loss 0.324 kl 0.000 anchor 0.000 0.043s/rec
|
| 208 |
-
ep1 step 2050/3144 loss 0.239 kl 0.000 anchor 0.000 0.043s/rec
|
| 209 |
-
ep1 step 2060/3144 loss 0.484 kl 0.000 anchor 0.000 0.043s/rec
|
| 210 |
-
ep1 step 2070/3144 loss 0.231 kl 0.000 anchor 0.000 0.043s/rec
|
| 211 |
-
ep1 step 2080/3144 loss 0.365 kl 0.000 anchor 0.000 0.043s/rec
|
| 212 |
-
ep1 step 2090/3144 loss 0.206 kl 0.000 anchor 0.000 0.043s/rec
|
| 213 |
-
ep1 step 2100/3144 loss 0.512 kl 0.000 anchor 0.000 0.043s/rec
|
| 214 |
-
ep1 step 2110/3144 loss 0.314 kl 0.000 anchor 0.000 0.043s/rec
|
| 215 |
-
ep1 step 2120/3144 loss 0.365 kl 0.000 anchor 0.000 0.043s/rec
|
| 216 |
-
ep1 step 2130/3144 loss 0.279 kl 0.000 anchor 0.000 0.043s/rec
|
| 217 |
-
ep1 step 2140/3144 loss 0.364 kl 0.000 anchor 0.000 0.043s/rec
|
| 218 |
-
ep1 step 2150/3144 loss 0.480 kl 0.000 anchor 0.000 0.043s/rec
|
| 219 |
-
ep1 step 2160/3144 loss 0.417 kl 0.000 anchor 0.000 0.043s/rec
|
| 220 |
-
ep1 step 2170/3144 loss 0.198 kl 0.000 anchor 0.000 0.043s/rec
|
| 221 |
-
ep1 step 2180/3144 loss 0.258 kl 0.000 anchor 0.000 0.043s/rec
|
| 222 |
-
ep1 step 2190/3144 loss 0.406 kl 0.000 anchor 0.000 0.043s/rec
|
| 223 |
-
ep1 step 2200/3144 loss 0.400 kl 0.000 anchor 0.000 0.043s/rec
|
| 224 |
-
ep1 step 2210/3144 loss 0.270 kl 0.000 anchor 0.000 0.042s/rec
|
| 225 |
-
ep1 step 2220/3144 loss 0.315 kl 0.000 anchor 0.000 0.042s/rec
|
| 226 |
-
ep1 step 2230/3144 loss 0.312 kl 0.000 anchor 0.000 0.042s/rec
|
| 227 |
-
ep1 step 2240/3144 loss 0.564 kl 0.000 anchor 0.000 0.042s/rec
|
| 228 |
-
ep1 step 2250/3144 loss 0.321 kl 0.000 anchor 0.000 0.042s/rec
|
| 229 |
-
ep1 step 2260/3144 loss 0.364 kl 0.000 anchor 0.000 0.042s/rec
|
| 230 |
-
ep1 step 2270/3144 loss 0.433 kl 0.000 anchor 0.000 0.042s/rec
|
| 231 |
-
ep1 step 2280/3144 loss 0.484 kl 0.000 anchor 0.000 0.042s/rec
|
| 232 |
-
ep1 step 2290/3144 loss 0.236 kl 0.000 anchor 0.000 0.042s/rec
|
| 233 |
-
ep1 step 2300/3144 loss 0.289 kl 0.000 anchor 0.000 0.042s/rec
|
| 234 |
-
ep1 step 2310/3144 loss 0.336 kl 0.000 anchor 0.000 0.042s/rec
|
| 235 |
-
ep1 step 2320/3144 loss 0.286 kl 0.000 anchor 0.000 0.042s/rec
|
| 236 |
-
ep1 step 2330/3144 loss 0.384 kl 0.000 anchor 0.000 0.042s/rec
|
| 237 |
-
ep1 step 2340/3144 loss 0.308 kl 0.000 anchor 0.000 0.042s/rec
|
| 238 |
-
ep1 step 2350/3144 loss 0.423 kl 0.000 anchor 0.000 0.042s/rec
|
| 239 |
-
ep1 step 2360/3144 loss 0.442 kl 0.000 anchor 0.000 0.042s/rec
|
| 240 |
-
ep1 step 2370/3144 loss 0.455 kl 0.000 anchor 0.000 0.042s/rec
|
| 241 |
-
ep1 step 2380/3144 loss 0.432 kl 0.000 anchor 0.000 0.042s/rec
|
| 242 |
-
ep1 step 2390/3144 loss 0.226 kl 0.000 anchor 0.000 0.042s/rec
|
| 243 |
-
ep1 step 2400/3144 loss 0.236 kl 0.000 anchor 0.000 0.042s/rec
|
| 244 |
-
ep1 step 2410/3144 loss 0.330 kl 0.000 anchor 0.000 0.042s/rec
|
| 245 |
-
ep1 step 2420/3144 loss 0.444 kl 0.000 anchor 0.000 0.042s/rec
|
| 246 |
-
ep1 step 2430/3144 loss 0.421 kl 0.000 anchor 0.000 0.041s/rec
|
| 247 |
-
ep1 step 2440/3144 loss 0.304 kl 0.000 anchor 0.000 0.041s/rec
|
| 248 |
-
ep1 step 2450/3144 loss 0.342 kl 0.000 anchor 0.000 0.041s/rec
|
| 249 |
-
ep1 step 2460/3144 loss 0.307 kl 0.000 anchor 0.000 0.041s/rec
|
| 250 |
-
ep1 step 2470/3144 loss 0.424 kl 0.000 anchor 0.000 0.041s/rec
|
| 251 |
-
ep1 step 2480/3144 loss 0.297 kl 0.000 anchor 0.000 0.041s/rec
|
| 252 |
-
ep1 step 2490/3144 loss 0.490 kl 0.000 anchor 0.000 0.041s/rec
|
| 253 |
-
ep1 step 2500/3144 loss 0.440 kl 0.000 anchor 0.000 0.041s/rec
|
| 254 |
-
ep1 step 2510/3144 loss 0.437 kl 0.000 anchor 0.000 0.041s/rec
|
| 255 |
-
ep1 step 2520/3144 loss 0.300 kl 0.000 anchor 0.000 0.041s/rec
|
| 256 |
-
ep1 step 2530/3144 loss 0.344 kl 0.000 anchor 0.000 0.041s/rec
|
| 257 |
-
ep1 step 2540/3144 loss 0.255 kl 0.000 anchor 0.000 0.041s/rec
|
| 258 |
-
ep1 step 2550/3144 loss 0.391 kl 0.000 anchor 0.000 0.041s/rec
|
| 259 |
-
ep1 step 2560/3144 loss 0.351 kl 0.000 anchor 0.000 0.041s/rec
|
| 260 |
-
ep1 step 2570/3144 loss 0.435 kl 0.000 anchor 0.000 0.041s/rec
|
| 261 |
-
ep1 step 2580/3144 loss 0.225 kl 0.000 anchor 0.000 0.041s/rec
|
| 262 |
-
ep1 step 2590/3144 loss 0.497 kl 0.000 anchor 0.000 0.041s/rec
|
| 263 |
-
ep1 step 2600/3144 loss 0.273 kl 0.000 anchor 0.000 0.041s/rec
|
| 264 |
-
ep1 step 2610/3144 loss 0.688 kl 0.000 anchor 0.000 0.041s/rec
|
| 265 |
-
ep1 step 2620/3144 loss 0.203 kl 0.000 anchor 0.000 0.041s/rec
|
| 266 |
-
ep1 step 2630/3144 loss 0.493 kl 0.000 anchor 0.000 0.041s/rec
|
| 267 |
-
ep1 step 2640/3144 loss 0.472 kl 0.000 anchor 0.000 0.041s/rec
|
| 268 |
-
ep1 step 2650/3144 loss 0.477 kl 0.000 anchor 0.000 0.041s/rec
|
| 269 |
-
ep1 step 2660/3144 loss 0.281 kl 0.000 anchor 0.000 0.041s/rec
|
| 270 |
-
ep1 step 2670/3144 loss 0.409 kl 0.000 anchor 0.000 0.041s/rec
|
| 271 |
-
ep1 step 2680/3144 loss 0.498 kl 0.000 anchor 0.000 0.041s/rec
|
| 272 |
-
ep1 step 2690/3144 loss 0.341 kl 0.000 anchor 0.000 0.040s/rec
|
| 273 |
-
ep1 step 2700/3144 loss 0.399 kl 0.000 anchor 0.000 0.040s/rec
|
| 274 |
-
ep1 step 2710/3144 loss 0.279 kl 0.000 anchor 0.000 0.040s/rec
|
| 275 |
-
ep1 step 2720/3144 loss 0.324 kl 0.000 anchor 0.000 0.040s/rec
|
| 276 |
-
ep1 step 2730/3144 loss 0.220 kl 0.000 anchor 0.000 0.040s/rec
|
| 277 |
-
ep1 step 2740/3144 loss 0.427 kl 0.000 anchor 0.000 0.040s/rec
|
| 278 |
-
ep1 step 2750/3144 loss 0.173 kl 0.000 anchor 0.000 0.040s/rec
|
| 279 |
-
ep1 step 2760/3144 loss 0.498 kl 0.000 anchor 0.000 0.040s/rec
|
| 280 |
-
ep1 step 2770/3144 loss 0.262 kl 0.000 anchor 0.000 0.040s/rec
|
| 281 |
-
ep1 step 2780/3144 loss 0.220 kl 0.000 anchor 0.000 0.040s/rec
|
| 282 |
-
ep1 step 2790/3144 loss 0.169 kl 0.000 anchor 0.000 0.040s/rec
|
| 283 |
-
ep1 step 2800/3144 loss 0.300 kl 0.000 anchor 0.000 0.040s/rec
|
| 284 |
-
ep1 step 2810/3144 loss 0.259 kl 0.000 anchor 0.000 0.040s/rec
|
| 285 |
-
ep1 step 2820/3144 loss 0.334 kl 0.000 anchor 0.000 0.040s/rec
|
| 286 |
-
ep1 step 2830/3144 loss 0.379 kl 0.000 anchor 0.000 0.040s/rec
|
| 287 |
-
ep1 step 2840/3144 loss 0.328 kl 0.000 anchor 0.000 0.040s/rec
|
| 288 |
-
ep1 step 2850/3144 loss 0.320 kl 0.000 anchor 0.000 0.040s/rec
|
| 289 |
-
ep1 step 2860/3144 loss 0.357 kl 0.000 anchor 0.000 0.040s/rec
|
| 290 |
-
ep1 step 2870/3144 loss 0.481 kl 0.000 anchor 0.000 0.040s/rec
|
| 291 |
-
ep1 step 2880/3144 loss 0.496 kl 0.000 anchor 0.000 0.040s/rec
|
| 292 |
-
ep1 step 2890/3144 loss 0.596 kl 0.000 anchor 0.000 0.040s/rec
|
| 293 |
-
ep1 step 2900/3144 loss 0.521 kl 0.000 anchor 0.000 0.040s/rec
|
| 294 |
-
ep1 step 2910/3144 loss 0.150 kl 0.000 anchor 0.000 0.040s/rec
|
| 295 |
-
ep1 step 2920/3144 loss 0.139 kl 0.000 anchor 0.000 0.040s/rec
|
| 296 |
-
ep1 step 2930/3144 loss 0.261 kl 0.000 anchor 0.000 0.040s/rec
|
| 297 |
-
ep1 step 2940/3144 loss 0.564 kl 0.000 anchor 0.000 0.040s/rec
|
| 298 |
-
ep1 step 2950/3144 loss 0.383 kl 0.000 anchor 0.000 0.040s/rec
|
| 299 |
-
ep1 step 2960/3144 loss 0.354 kl 0.000 anchor 0.000 0.040s/rec
|
| 300 |
-
ep1 step 2970/3144 loss 0.373 kl 0.000 anchor 0.000 0.040s/rec
|
| 301 |
-
ep1 step 2980/3144 loss 0.119 kl 0.000 anchor 0.000 0.040s/rec
|
| 302 |
-
ep1 step 2990/3144 loss 0.469 kl 0.000 anchor 0.000 0.040s/rec
|
| 303 |
-
ep1 step 3000/3144 loss 0.416 kl 0.000 anchor 0.000 0.040s/rec
|
| 304 |
-
ep1 step 3010/3144 loss 0.341 kl 0.000 anchor 0.000 0.040s/rec
|
| 305 |
-
ep1 step 3020/3144 loss 0.405 kl 0.000 anchor 0.000 0.040s/rec
|
| 306 |
-
ep1 step 3030/3144 loss 0.549 kl 0.000 anchor 0.000 0.040s/rec
|
| 307 |
-
ep1 step 3040/3144 loss 0.288 kl 0.000 anchor 0.000 0.040s/rec
|
| 308 |
-
ep1 step 3050/3144 loss 0.255 kl 0.000 anchor 0.000 0.039s/rec
|
| 309 |
-
ep1 step 3060/3144 loss 0.327 kl 0.000 anchor 0.000 0.039s/rec
|
| 310 |
-
ep1 step 3070/3144 loss 0.322 kl 0.000 anchor 0.000 0.039s/rec
|
| 311 |
-
ep1 step 3080/3144 loss 0.485 kl 0.000 anchor 0.000 0.040s/rec
|
| 312 |
-
ep1 step 3090/3144 loss 0.222 kl 0.000 anchor 0.000 0.039s/rec
|
| 313 |
-
ep1 step 3100/3144 loss 0.311 kl 0.000 anchor 0.000 0.039s/rec
|
| 314 |
-
ep1 step 3110/3144 loss 0.452 kl 0.000 anchor 0.000 0.039s/rec
|
| 315 |
-
ep1 step 3120/3144 loss 0.485 kl 0.000 anchor 0.000 0.039s/rec
|
| 316 |
-
ep1 step 3130/3144 loss 0.277 kl 0.000 anchor 0.000 0.039s/rec
|
| 317 |
-
ep1 step 3140/3144 loss 0.230 kl 0.000 anchor 0.000 0.039s/rec
|
| 318 |
-
Warning: You are sending unauthenticated requests to the HF Hub. Please set a HF_TOKEN to enable higher rate limits and faster downloads.
|
| 319 |
-
saved /runs/q35-08b/02-trial-2/checkpoint
|
|
|
|
| 1 |
+
Warning: You are sending unauthenticated requests to the HF Hub. Please set a HF_TOKEN to enable higher rate limits and faster downloads.
|
| 2 |
+
delta: warm start from /__modal/volumes/vo-kEMu8BkBAIrorAQI6V8f2D/hub/models--jaredpalmer--kev-0.8b/snapshots/c917edefdfd72b3e9ba71455584700acc70595f6: 372 adapter tensors and the pointer head loaded
|
| 3 |
device=cuda trainable params=11.3M
|
| 4 |
+
replay: 2000 of 12576 suite training records mixed with 1425 from evals/night2/dates_unknowable.jsonl
|
| 5 |
+
3425 training requests (holdout=[]), questions by type {'noul': 1268, 'score': 1431, 'choice': 1214}
|
| 6 |
[transformers] `causal_conv1d_fn` is falling back to its reference PyTorch implementation because `causal_conv1d` is not installed. This is correct but much slower; install `causal_conv1d` for the optimized kernel.
|
| 7 |
+
ep0 step 10/429 loss 0.364 kl 0.000 anchor 0.000 1.620s/rec
|
| 8 |
+
ep0 step 20/429 loss 0.487 kl 0.000 anchor 0.000 0.946s/rec
|
| 9 |
+
ep0 step 30/429 loss 0.310 kl 0.000 anchor 0.000 0.650s/rec
|
| 10 |
+
ep0 step 40/429 loss 0.476 kl 0.000 anchor 0.000 0.506s/rec
|
| 11 |
+
ep0 step 50/429 loss 0.393 kl 0.000 anchor 0.000 0.416s/rec
|
| 12 |
+
ep0 step 60/429 loss 0.418 kl 0.000 anchor 0.000 0.346s/rec
|
| 13 |
+
ep0 step 70/429 loss 0.449 kl 0.000 anchor 0.000 0.301s/rec
|
| 14 |
+
ep0 step 80/429 loss 0.461 kl 0.000 anchor 0.000 0.266s/rec
|
| 15 |
+
ep0 step 90/429 loss 0.257 kl 0.000 anchor 0.000 0.240s/rec
|
| 16 |
+
ep0 step 100/429 loss 0.734 kl 0.000 anchor 0.000 0.222s/rec
|
| 17 |
+
ep0 step 110/429 loss 0.427 kl 0.000 anchor 0.000 0.205s/rec
|
| 18 |
+
ep0 step 120/429 loss 0.269 kl 0.000 anchor 0.000 0.190s/rec
|
| 19 |
+
ep0 step 130/429 loss 0.658 kl 0.000 anchor 0.000 0.177s/rec
|
| 20 |
+
ep0 step 140/429 loss 0.192 kl 0.000 anchor 0.000 0.181s/rec
|
| 21 |
+
ep0 step 150/429 loss 0.390 kl 0.000 anchor 0.000 0.171s/rec
|
| 22 |
+
ep0 step 160/429 loss 0.528 kl 0.000 anchor 0.000 0.161s/rec
|
| 23 |
+
ep0 step 170/429 loss 0.385 kl 0.000 anchor 0.000 0.153s/rec
|
| 24 |
+
ep0 step 180/429 loss 0.368 kl 0.000 anchor 0.000 0.146s/rec
|
| 25 |
+
ep0 step 190/429 loss 0.362 kl 0.000 anchor 0.000 0.140s/rec
|
| 26 |
+
ep0 step 200/429 loss 0.365 kl 0.000 anchor 0.000 0.135s/rec
|
| 27 |
+
ep0 step 210/429 loss 0.267 kl 0.000 anchor 0.000 0.130s/rec
|
| 28 |
+
ep0 step 220/429 loss 0.463 kl 0.000 anchor 0.000 0.125s/rec
|
| 29 |
+
ep0 step 230/429 loss 0.235 kl 0.000 anchor 0.000 0.121s/rec
|
| 30 |
+
ep0 step 240/429 loss 0.228 kl 0.000 anchor 0.000 0.117s/rec
|
| 31 |
+
ep0 step 250/429 loss 0.267 kl 0.000 anchor 0.000 0.113s/rec
|
| 32 |
+
ep0 step 260/429 loss 0.424 kl 0.000 anchor 0.000 0.110s/rec
|
| 33 |
+
ep0 step 270/429 loss 0.231 kl 0.000 anchor 0.000 0.107s/rec
|
| 34 |
+
ep0 step 280/429 loss 0.409 kl 0.000 anchor 0.000 0.104s/rec
|
| 35 |
+
ep0 step 290/429 loss 0.401 kl 0.000 anchor 0.000 0.102s/rec
|
| 36 |
+
ep0 step 300/429 loss 0.402 kl 0.000 anchor 0.000 0.099s/rec
|
| 37 |
+
ep0 step 310/429 loss 0.264 kl 0.000 anchor 0.000 0.097s/rec
|
| 38 |
+
ep0 step 320/429 loss 0.337 kl 0.000 anchor 0.000 0.095s/rec
|
| 39 |
+
ep0 step 330/429 loss 0.552 kl 0.000 anchor 0.000 0.093s/rec
|
| 40 |
+
ep0 step 340/429 loss 0.436 kl 0.000 anchor 0.000 0.091s/rec
|
| 41 |
+
ep0 step 350/429 loss 0.309 kl 0.000 anchor 0.000 0.089s/rec
|
| 42 |
+
ep0 step 360/429 loss 0.239 kl 0.000 anchor 0.000 0.088s/rec
|
| 43 |
+
ep0 step 370/429 loss 0.449 kl 0.000 anchor 0.000 0.087s/rec
|
| 44 |
+
ep0 step 380/429 loss 0.207 kl 0.000 anchor 0.000 0.085s/rec
|
| 45 |
+
ep0 step 390/429 loss 0.430 kl 0.000 anchor 0.000 0.084s/rec
|
| 46 |
+
ep0 step 400/429 loss 0.216 kl 0.000 anchor 0.000 0.082s/rec
|
| 47 |
+
ep0 step 410/429 loss 0.219 kl 0.000 anchor 0.000 0.081s/rec
|
| 48 |
+
ep0 step 420/429 loss 0.284 kl 0.000 anchor 0.000 0.080s/rec
|
| 49 |
+
saved /runs/night2-08b-du2/00-trial-0/checkpoint
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
training_config.json
CHANGED
|
@@ -2,8 +2,8 @@
|
|
| 2 |
"args": {
|
| 3 |
"base": "Qwen/Qwen3.5-0.8B-Base",
|
| 4 |
"n_per_source": 1000,
|
| 5 |
-
"epochs":
|
| 6 |
-
"lr":
|
| 7 |
"head_lr": 0.0,
|
| 8 |
"weight_decay": 0.01,
|
| 9 |
"lora": 16,
|
|
@@ -17,6 +17,7 @@
|
|
| 17 |
"device": "cuda",
|
| 18 |
"batch": 8,
|
| 19 |
"dtype": "bf16",
|
|
|
|
| 20 |
"checkpointing": 0,
|
| 21 |
"option_isolation": 0,
|
| 22 |
"special_embeddings": 0,
|
|
@@ -32,11 +33,20 @@
|
|
| 32 |
"anchor": "",
|
| 33 |
"anchor_w": 0.0,
|
| 34 |
"anchor_sources": "",
|
| 35 |
-
"out": "/runs/
|
| 36 |
-
"
|
|
|
|
|
|
|
|
|
|
| 37 |
},
|
| 38 |
"suite_sha256": "a8f50e481b7d90b97da049e0ff6a01cee2f1ed204aed61a8265af0edbb5514d2",
|
| 39 |
"base_revision": "dc7cdfe2ee4154fa7e30f5b51ca41bfa40174e68",
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 40 |
"ordinal_objective": "ranked_probability_score",
|
| 41 |
"holdout": []
|
| 42 |
}
|
|
|
|
| 2 |
"args": {
|
| 3 |
"base": "Qwen/Qwen3.5-0.8B-Base",
|
| 4 |
"n_per_source": 1000,
|
| 5 |
+
"epochs": 1,
|
| 6 |
+
"lr": 4e-05,
|
| 7 |
"head_lr": 0.0,
|
| 8 |
"weight_decay": 0.01,
|
| 9 |
"lora": 16,
|
|
|
|
| 17 |
"device": "cuda",
|
| 18 |
"batch": 8,
|
| 19 |
"dtype": "bf16",
|
| 20 |
+
"weights_dtype": "fp32",
|
| 21 |
"checkpointing": 0,
|
| 22 |
"option_isolation": 0,
|
| 23 |
"special_embeddings": 0,
|
|
|
|
| 33 |
"anchor": "",
|
| 34 |
"anchor_w": 0.0,
|
| 35 |
"anchor_sources": "",
|
| 36 |
+
"out": "/runs/night2-08b-du2/00-trial-0/checkpoint",
|
| 37 |
+
"data": "evals/night2/dates_unknowable.jsonl",
|
| 38 |
+
"replay": 2000,
|
| 39 |
+
"init_from": "jaredpalmer/kev-0.8b",
|
| 40 |
+
"seed": 1
|
| 41 |
},
|
| 42 |
"suite_sha256": "a8f50e481b7d90b97da049e0ff6a01cee2f1ed204aed61a8265af0edbb5514d2",
|
| 43 |
"base_revision": "dc7cdfe2ee4154fa7e30f5b51ca41bfa40174e68",
|
| 44 |
+
"init_source": {
|
| 45 |
+
"init_from": "jaredpalmer/kev-0.8b",
|
| 46 |
+
"resolved": "/__modal/volumes/vo-kEMu8BkBAIrorAQI6V8f2D/hub/models--jaredpalmer--kev-0.8b/snapshots/c917edefdfd72b3e9ba71455584700acc70595f6",
|
| 47 |
+
"adapter_sha256": "d9fa619fd3b0490122454c386bfa1b53c23850189d1b5c4346962162e2e39a64",
|
| 48 |
+
"head_sha256": "8610dac1c30a64bbcea7715f20a258f4d084d7b862c10f96a1625c732049a32a"
|
| 49 |
+
},
|
| 50 |
"ordinal_objective": "ranked_probability_score",
|
| 51 |
"holdout": []
|
| 52 |
}
|
training_metrics.json
CHANGED
|
@@ -1,14 +1,14 @@
|
|
| 1 |
{
|
| 2 |
-
"wall_seconds":
|
| 3 |
-
"records_seen":
|
| 4 |
-
"requested_records":
|
| 5 |
"truncated_records": 0,
|
| 6 |
"rejected_records": 0,
|
| 7 |
-
"optimizer_steps":
|
| 8 |
-
"forward_tokens":
|
| 9 |
-
"peak_device_bytes":
|
| 10 |
"device": "cuda",
|
| 11 |
"dtype": "bf16",
|
| 12 |
"batch": 8,
|
| 13 |
-
"peak_rss_bytes":
|
| 14 |
}
|
|
|
|
| 1 |
{
|
| 2 |
+
"wall_seconds": 313.94338822364807,
|
| 3 |
+
"records_seen": 3937,
|
| 4 |
+
"requested_records": 3425,
|
| 5 |
"truncated_records": 0,
|
| 6 |
"rejected_records": 0,
|
| 7 |
+
"optimizer_steps": 429,
|
| 8 |
+
"forward_tokens": 640184,
|
| 9 |
+
"peak_device_bytes": 43896273920,
|
| 10 |
"device": "cuda",
|
| 11 |
"dtype": "bf16",
|
| 12 |
"batch": 8,
|
| 13 |
+
"peak_rss_bytes": 10316816384
|
| 14 |
}
|