mjbommar commited on
Commit
d9d99f5
·
verified ·
1 Parent(s): f776736

README: add short-sequence cells, update headline

Browse files
Files changed (2) hide show
  1. README.md +26 -5
  2. eval_summary.json +224 -15
README.md CHANGED
@@ -14,7 +14,7 @@ library_name: transformers
14
 
15
  **Pretrained encoders for fine-grained file-content-type detection — on any 4 KB byte window.**
16
 
17
- A family of 28 small (3.15–37.8 M backbone parameter) BERT-style encoders pretrained MLM-only on 33 GB of heterogeneous binary content for classification under [libmagic](https://github.com/file/file)'s 125-class MIME taxonomy.
18
 
19
  Training samples 1024-token windows uniformly at random across files and 64 KB fragments, with no privileged "head-of-file" position. A single checkpoint classifies any 4 KB byte window: a streaming HTTP body before upload completes, a forensic-carved fragment with no recoverable header, a random seek into a multi-gigabyte container, or a packet payload inspected mid-stream.
20
 
@@ -31,9 +31,13 @@ What's your input?
31
  │ └─→ Magika is purpose-built for this. Reach for MimeLens only if
32
  │ libmagic's 125-class taxonomy is required.
33
 
34
- ├── A partial / streaming / packet-payload / random-offset chunk
35
  │ └─→ mimelens-001-medium-byte-s1 (saturates from a single 1.4 KB packet)
36
 
 
 
 
 
37
  ├── A clean 4 KB head and you want libmagic-style fine-grained MIME labels
38
  │ ├─→ mimelens-001-medium-bpe-16k-s1 (recommended default; balances accuracy + adversarial robustness)
39
  │ └─→ mimelens-001-medium-byte-s1 (essentially tied under clean conditions)
@@ -57,9 +61,9 @@ These are the three cells the paper presents as the deployable system. Each is o
57
 
58
  All three load via `AutoModel.from_pretrained(..., trust_remote_code=True)`. See the per-cell READMEs for the copy-pasteable inference snippet.
59
 
60
- ## All 28 released cells
61
 
62
- Every cell of the pre-registered 3 × 4 × {2,3} factorial cube is published; numbers below are this-cell magic-frags 4 KB-head top-1 / macro-F1 / kNN R@1.
63
 
64
  ### medium (37.76 M backbone params; the recommended size for deployment)
65
 
@@ -105,6 +109,23 @@ Every cell of the pre-registered 3 × 4 × {2,3} factorial cube is published; nu
105
  | `tiny/bpe-64k/s1` | 0.715 | 0.620 | 0.671 | [link](https://huggingface.co/mjbommar/mimelens-001-tiny-bpe-64k-s1) |
106
  | `tiny/bpe-64k/s2` | 0.732 | 0.609 | 0.675 | [link](https://huggingface.co/mjbommar/mimelens-001-tiny-bpe-64k-s2) |
107
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
108
  ## Headline findings (from the paper)
109
 
110
  1. **Calibrated against Magika v1.1** on the same n=1,024 held-out 4,096-file split, libmagic-pinned ground truth: `medium/bpe-16k/s1` exceeds Magika at every level of stringency. Strict top-1: 0.828 vs 0.653 (+17.5 pp). Aligned under a curated 21-class equivalence map applied symmetrically to both systems: 0.829 vs 0.722 (+10.7 pp). Top-level (text vs image vs application vs …): 0.927 vs 0.840 (+8.7 pp). The aligned gap is the residual under this map on this corpus; what would persist under a hypothetically retrained Magika is open.
@@ -115,7 +136,7 @@ Every cell of the pre-registered 3 × 4 × {2,3} factorial cube is published; nu
115
 
116
  4. **Truly random-offset disk-block classification** (Section 6): a 1 GB unmounted `ext4` image populated with 3,066 MIME-balanced files; 1,000 random 4 KB block reads. On 980 mid-file blocks, all three medium cells exceed both libmagic and Magika with non-overlapping file-level cluster-bootstrap CIs: `medium/bpe-64k/s1` 0.266, `medium/bpe-16k/s1` 0.220, `medium/byte/s1` 0.219, vs libmagic 0.093 / Magika 0.112. Replicates across 9 matrix cells (ext4 × 4 init-strategies + 2 size-stratified sub-cells; NTFS × 3 init-strategies).
117
 
118
- 5. **CPU latency.** Idle CPU, single sample, p50: PyTorch fp32 392 ms; ONNX int8 547 ms (int8 is slower than fp32 on this hardware without AVX-VNNI). Magika v1.1 on the same CPU: 1.58 ms/sample. MimeLens occupies a different point on the deployment surface than Magika, not a drop-in replacement.
119
 
120
  Full evaluation (within-cube bootstrap CIs at n=3 medium seeds, calibration, per-class breakdown, network curves, baseline comparisons against libmagic 5.46 and TrID 2.24, byte-coverage matched ablation, pre-registration log) is in the [paper](https://github.com/mjbommar/binary-embedding-paper).
121
 
 
14
 
15
  **Pretrained encoders for fine-grained file-content-type detection — on any 4 KB byte window.**
16
 
17
+ A family of 36 small (3.15–37.8 M backbone parameter) BERT-style encoders pretrained MLM-only on 33 GB of heterogeneous binary content for classification under [libmagic](https://github.com/file/file)'s 125-class MIME taxonomy. 28 parent-cube cells at `seq_len=1024` (4 KB byte windows) plus an 8-cell short-sequence extension at `seq_len=256` (1 KB byte windows) sized for sub-MTU packets, DNS payloads, and small forensic fragments.
18
 
19
  Training samples 1024-token windows uniformly at random across files and 64 KB fragments, with no privileged "head-of-file" position. A single checkpoint classifies any 4 KB byte window: a streaming HTTP body before upload completes, a forensic-carved fragment with no recoverable header, a random seek into a multi-gigabyte container, or a packet payload inspected mid-stream.
20
 
 
31
  │ └─→ Magika is purpose-built for this. Reach for MimeLens only if
32
  │ libmagic's 125-class taxonomy is required.
33
 
34
+ ├── A partial / streaming / packet-payload / random-offset chunk (≥ 1 KB)
35
  │ └─→ mimelens-001-medium-byte-s1 (saturates from a single 1.4 KB packet)
36
 
37
+ ├── A sub-KB chunk (sub-MTU packet, DNS payload, small fragment, ≤ 1 KB total)
38
+ │ ├─→ mimelens-001-medium-bpe-64k-s1-seq256 (best short-sequence accuracy: 0.985 4 KB-head / 0.981 256 B-head, ~10× the throughput of the parent cell)
39
+ │ └─→ mimelens-001-medium-bpe-16k-s1-seq256 (ONNX bundled; same family, slightly lower accuracy)
40
+
41
  ├── A clean 4 KB head and you want libmagic-style fine-grained MIME labels
42
  │ ├─→ mimelens-001-medium-bpe-16k-s1 (recommended default; balances accuracy + adversarial robustness)
43
  │ └─→ mimelens-001-medium-byte-s1 (essentially tied under clean conditions)
 
61
 
62
  All three load via `AutoModel.from_pretrained(..., trust_remote_code=True)`. See the per-cell READMEs for the copy-pasteable inference snippet.
63
 
64
+ ## All released cells
65
 
66
+ Every cell of the pre-registered 3 × 4 × {2,3} factorial parent cube is published, plus an 8-cell short-sequence extension at the `medium` tier (seq_len=256) and one matched-tokens ablation. Numbers in the parent-cube tables are this-cell `magic-frags` 4 KB-head top-1 / macro-F1 / kNN R@1 — the within-cube benchmark applied identically to all 28 parent-cube cells (short-sequence numbers use `magic-files` probe-fit; see that subsection). The `medium/bpe-16k/s1` headline calibration numbers against Magika (`0.828` strict / `0.829` aligned / `0.927` top-level on the `magic-files` n=1,024 held-out split) are shown in **Headline findings** below.
67
 
68
  ### medium (37.76 M backbone params; the recommended size for deployment)
69
 
 
109
  | `tiny/bpe-64k/s1` | 0.715 | 0.620 | 0.671 | [link](https://huggingface.co/mjbommar/mimelens-001-tiny-bpe-64k-s1) |
110
  | `tiny/bpe-64k/s2` | 0.732 | 0.609 | 0.675 | [link](https://huggingface.co/mjbommar/mimelens-001-tiny-bpe-64k-s2) |
111
 
112
+ ### medium short-sequence (seq_len=256, for sub-MTU packets and small forensic fragments)
113
+
114
+ Matched-steps to the parent cube (22,888 gradient updates, same architecture, optimizer, schedule). Numbers are `magic-files` 4 KB-head probe-fit top-1 (left) and 256 B-head probe-fit top-1 (right; the design regime). BPE cells preserve or exceed parent accuracy at 4× lower per-step token budget; the byte cell pays ~1 pp.
115
+
116
+ | Cell | 4 KB head | 256 B head | Repo |
117
+ |---|---|---|---|
118
+ | `medium/byte/s1-seq256` | 0.947 | 0.947 | [link](https://huggingface.co/mjbommar/mimelens-001-medium-byte-s1-seq256) |
119
+ | `medium/byte/s2-seq256` | 0.943 | 0.943 | [link](https://huggingface.co/mjbommar/mimelens-001-medium-byte-s2-seq256) |
120
+ | `medium/bpe-4k/s1-seq256` | 0.971 | 0.967 | [link](https://huggingface.co/mjbommar/mimelens-001-medium-bpe-4k-s1-seq256) |
121
+ | `medium/bpe-4k/s2-seq256` | 0.972 | 0.967 | [link](https://huggingface.co/mjbommar/mimelens-001-medium-bpe-4k-s2-seq256) |
122
+ | **`medium/bpe-16k/s1-seq256`** | **0.980** | **0.974** | [link](https://huggingface.co/mjbommar/mimelens-001-medium-bpe-16k-s1-seq256) (ONNX bundled) |
123
+ | `medium/bpe-16k/s2-seq256` | 0.981 | 0.975 | [link](https://huggingface.co/mjbommar/mimelens-001-medium-bpe-16k-s2-seq256) |
124
+ | `medium/bpe-64k/s1-seq256` | 0.987 | 0.983 | [link](https://huggingface.co/mjbommar/mimelens-001-medium-bpe-64k-s1-seq256) |
125
+ | `medium/bpe-64k/s2-seq256` | 0.986 | 0.979 | [link](https://huggingface.co/mjbommar/mimelens-001-medium-bpe-64k-s2-seq256) |
126
+
127
+ Per-vocab seed means at 4 KB head: byte 0.945, bpe-4k 0.971, bpe-16k 0.980, bpe-64k 0.987 (vs parent cube 0.955 / 0.973 / 0.977 / 0.975 at the same probe-fit metric, matched-steps).
128
+
129
  ## Headline findings (from the paper)
130
 
131
  1. **Calibrated against Magika v1.1** on the same n=1,024 held-out 4,096-file split, libmagic-pinned ground truth: `medium/bpe-16k/s1` exceeds Magika at every level of stringency. Strict top-1: 0.828 vs 0.653 (+17.5 pp). Aligned under a curated 21-class equivalence map applied symmetrically to both systems: 0.829 vs 0.722 (+10.7 pp). Top-level (text vs image vs application vs …): 0.927 vs 0.840 (+8.7 pp). The aligned gap is the residual under this map on this corpus; what would persist under a hypothetically retrained Magika is open.
 
136
 
137
  4. **Truly random-offset disk-block classification** (Section 6): a 1 GB unmounted `ext4` image populated with 3,066 MIME-balanced files; 1,000 random 4 KB block reads. On 980 mid-file blocks, all three medium cells exceed both libmagic and Magika with non-overlapping file-level cluster-bootstrap CIs: `medium/bpe-64k/s1` 0.266, `medium/bpe-16k/s1` 0.220, `medium/byte/s1` 0.219, vs libmagic 0.093 / Magika 0.112. Replicates across 9 matrix cells (ext4 × 4 init-strategies + 2 size-stratified sub-cells; NTFS × 3 init-strategies).
138
 
139
+ 5. **CPU latency.** Idle CPU, single sample, p50: parent-cube PyTorch fp32 392 ms; ONNX int8 547 ms (int8 is slower than fp32 on this hardware without AVX-VNNI). Magika v1.1 on the same CPU: 1.58 ms/sample. The short-sequence `medium/bpe-16k/s1-seq256` cell with ONNX int8 closes that gap to **~10× end-to-end** (50 ms vs Magika's 5 ms on the same 500-file bench); ship it where sub-second per-sample inference matters. MimeLens occupies a different point on the deployment surface than Magika, not a drop-in replacement.
140
 
141
  Full evaluation (within-cube bootstrap CIs at n=3 medium seeds, calibration, per-class breakdown, network curves, baseline comparisons against libmagic 5.46 and TrID 2.24, byte-coverage matched ablation, pre-registration log) is in the [paper](https://github.com/mjbommar/binary-embedding-paper).
142
 
eval_summary.json CHANGED
@@ -1,13 +1,14 @@
1
  {
2
  "release": "mimelens-001",
3
- "n_cells": 29,
4
  "cells": {
5
  "tiny/byte/s1": {
6
  "cell_id": "tiny/byte/s1",
7
  "size": "tiny",
8
  "vocab": "byte",
9
  "seed": 1,
10
- "vocab_size": 261,
 
11
  "params_m": 3.15,
12
  "layers": 4,
13
  "hidden_size": 256,
@@ -24,7 +25,8 @@
24
  "size": "tiny",
25
  "vocab": "byte",
26
  "seed": 2,
27
- "vocab_size": 261,
 
28
  "params_m": 3.15,
29
  "layers": 4,
30
  "hidden_size": 256,
@@ -41,7 +43,8 @@
41
  "size": "tiny",
42
  "vocab": "bpe-4k",
43
  "seed": 1,
44
- "vocab_size": 4101,
 
45
  "params_m": 3.15,
46
  "layers": 4,
47
  "hidden_size": 256,
@@ -58,7 +61,8 @@
58
  "size": "tiny",
59
  "vocab": "bpe-4k",
60
  "seed": 2,
61
- "vocab_size": 4101,
 
62
  "params_m": 3.15,
63
  "layers": 4,
64
  "hidden_size": 256,
@@ -75,6 +79,7 @@
75
  "size": "tiny",
76
  "vocab": "bpe-16k",
77
  "seed": 1,
 
78
  "vocab_size": 16391,
79
  "params_m": 3.15,
80
  "layers": 4,
@@ -92,6 +97,7 @@
92
  "size": "tiny",
93
  "vocab": "bpe-16k",
94
  "seed": 2,
 
95
  "vocab_size": 16391,
96
  "params_m": 3.15,
97
  "layers": 4,
@@ -109,6 +115,7 @@
109
  "size": "tiny",
110
  "vocab": "bpe-64k",
111
  "seed": 1,
 
112
  "vocab_size": 65543,
113
  "params_m": 3.15,
114
  "layers": 4,
@@ -126,6 +133,7 @@
126
  "size": "tiny",
127
  "vocab": "bpe-64k",
128
  "seed": 2,
 
129
  "vocab_size": 65543,
130
  "params_m": 3.15,
131
  "layers": 4,
@@ -143,7 +151,8 @@
143
  "size": "small",
144
  "vocab": "byte",
145
  "seed": 1,
146
- "vocab_size": 261,
 
147
  "params_m": 14.16,
148
  "layers": 8,
149
  "hidden_size": 384,
@@ -160,7 +169,8 @@
160
  "size": "small",
161
  "vocab": "byte",
162
  "seed": 2,
163
- "vocab_size": 261,
 
164
  "params_m": 14.16,
165
  "layers": 8,
166
  "hidden_size": 384,
@@ -177,7 +187,8 @@
177
  "size": "small",
178
  "vocab": "bpe-4k",
179
  "seed": 1,
180
- "vocab_size": 4101,
 
181
  "params_m": 14.16,
182
  "layers": 8,
183
  "hidden_size": 384,
@@ -194,7 +205,8 @@
194
  "size": "small",
195
  "vocab": "bpe-4k",
196
  "seed": 2,
197
- "vocab_size": 4101,
 
198
  "params_m": 14.16,
199
  "layers": 8,
200
  "hidden_size": 384,
@@ -211,6 +223,7 @@
211
  "size": "small",
212
  "vocab": "bpe-16k",
213
  "seed": 1,
 
214
  "vocab_size": 16391,
215
  "params_m": 14.16,
216
  "layers": 8,
@@ -228,6 +241,7 @@
228
  "size": "small",
229
  "vocab": "bpe-16k",
230
  "seed": 2,
 
231
  "vocab_size": 16391,
232
  "params_m": 14.16,
233
  "layers": 8,
@@ -245,6 +259,7 @@
245
  "size": "small",
246
  "vocab": "bpe-64k",
247
  "seed": 1,
 
248
  "vocab_size": 65543,
249
  "params_m": 14.16,
250
  "layers": 8,
@@ -262,6 +277,7 @@
262
  "size": "small",
263
  "vocab": "bpe-64k",
264
  "seed": 2,
 
265
  "vocab_size": 65543,
266
  "params_m": 14.16,
267
  "layers": 8,
@@ -279,7 +295,8 @@
279
  "size": "medium",
280
  "vocab": "byte",
281
  "seed": 1,
282
- "vocab_size": 261,
 
283
  "params_m": 37.76,
284
  "layers": 12,
285
  "hidden_size": 512,
@@ -303,7 +320,8 @@
303
  "size": "medium",
304
  "vocab": "byte",
305
  "seed": 2,
306
- "vocab_size": 261,
 
307
  "params_m": 37.76,
308
  "layers": 12,
309
  "hidden_size": 512,
@@ -322,7 +340,8 @@
322
  "size": "medium",
323
  "vocab": "byte",
324
  "seed": 3,
325
- "vocab_size": 261,
 
326
  "params_m": 37.76,
327
  "layers": 12,
328
  "hidden_size": 512,
@@ -341,7 +360,8 @@
341
  "size": "medium",
342
  "vocab": "bpe-4k",
343
  "seed": 1,
344
- "vocab_size": 4101,
 
345
  "params_m": 37.76,
346
  "layers": 12,
347
  "hidden_size": 512,
@@ -365,7 +385,8 @@
365
  "size": "medium",
366
  "vocab": "bpe-4k",
367
  "seed": 2,
368
- "vocab_size": 4101,
 
369
  "params_m": 37.76,
370
  "layers": 12,
371
  "hidden_size": 512,
@@ -384,7 +405,8 @@
384
  "size": "medium",
385
  "vocab": "bpe-4k",
386
  "seed": 3,
387
- "vocab_size": 4101,
 
388
  "params_m": 37.76,
389
  "layers": 12,
390
  "hidden_size": 512,
@@ -403,6 +425,7 @@
403
  "size": "medium",
404
  "vocab": "bpe-16k",
405
  "seed": 1,
 
406
  "vocab_size": 16391,
407
  "params_m": 37.76,
408
  "layers": 12,
@@ -427,6 +450,7 @@
427
  "size": "medium",
428
  "vocab": "bpe-16k",
429
  "seed": 2,
 
430
  "vocab_size": 16391,
431
  "params_m": 37.76,
432
  "layers": 12,
@@ -446,6 +470,7 @@
446
  "size": "medium",
447
  "vocab": "bpe-16k",
448
  "seed": 3,
 
449
  "vocab_size": 16391,
450
  "params_m": 37.76,
451
  "layers": 12,
@@ -465,6 +490,7 @@
465
  "size": "medium",
466
  "vocab": "bpe-64k",
467
  "seed": 1,
 
468
  "vocab_size": 65543,
469
  "params_m": 37.76,
470
  "layers": 12,
@@ -489,6 +515,7 @@
489
  "size": "medium",
490
  "vocab": "bpe-64k",
491
  "seed": 2,
 
492
  "vocab_size": 65543,
493
  "params_m": 37.76,
494
  "layers": 12,
@@ -508,6 +535,7 @@
508
  "size": "medium",
509
  "vocab": "bpe-64k",
510
  "seed": 3,
 
511
  "vocab_size": 65543,
512
  "params_m": 37.76,
513
  "layers": 12,
@@ -527,6 +555,7 @@
527
  "size": "medium",
528
  "vocab": "bpe-64k",
529
  "seed": "matched-tokens",
 
530
  "vocab_size": 65543,
531
  "params_m": 37.76,
532
  "layers": 12,
@@ -540,6 +569,186 @@
540
  "magicfiles_f1": 0.0,
541
  "net_top1_k1": 0.7449799196787149,
542
  "net_top1_kall": 0.7630522088353414
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
543
  }
544
  }
545
  }
 
1
  {
2
  "release": "mimelens-001",
3
+ "n_cells": 37,
4
  "cells": {
5
  "tiny/byte/s1": {
6
  "cell_id": "tiny/byte/s1",
7
  "size": "tiny",
8
  "vocab": "byte",
9
  "seed": 1,
10
+ "seq_len": 1024,
11
+ "vocab_size": 263,
12
  "params_m": 3.15,
13
  "layers": 4,
14
  "hidden_size": 256,
 
25
  "size": "tiny",
26
  "vocab": "byte",
27
  "seed": 2,
28
+ "seq_len": 1024,
29
+ "vocab_size": 263,
30
  "params_m": 3.15,
31
  "layers": 4,
32
  "hidden_size": 256,
 
43
  "size": "tiny",
44
  "vocab": "bpe-4k",
45
  "seed": 1,
46
+ "seq_len": 1024,
47
+ "vocab_size": 4103,
48
  "params_m": 3.15,
49
  "layers": 4,
50
  "hidden_size": 256,
 
61
  "size": "tiny",
62
  "vocab": "bpe-4k",
63
  "seed": 2,
64
+ "seq_len": 1024,
65
+ "vocab_size": 4103,
66
  "params_m": 3.15,
67
  "layers": 4,
68
  "hidden_size": 256,
 
79
  "size": "tiny",
80
  "vocab": "bpe-16k",
81
  "seed": 1,
82
+ "seq_len": 1024,
83
  "vocab_size": 16391,
84
  "params_m": 3.15,
85
  "layers": 4,
 
97
  "size": "tiny",
98
  "vocab": "bpe-16k",
99
  "seed": 2,
100
+ "seq_len": 1024,
101
  "vocab_size": 16391,
102
  "params_m": 3.15,
103
  "layers": 4,
 
115
  "size": "tiny",
116
  "vocab": "bpe-64k",
117
  "seed": 1,
118
+ "seq_len": 1024,
119
  "vocab_size": 65543,
120
  "params_m": 3.15,
121
  "layers": 4,
 
133
  "size": "tiny",
134
  "vocab": "bpe-64k",
135
  "seed": 2,
136
+ "seq_len": 1024,
137
  "vocab_size": 65543,
138
  "params_m": 3.15,
139
  "layers": 4,
 
151
  "size": "small",
152
  "vocab": "byte",
153
  "seed": 1,
154
+ "seq_len": 1024,
155
+ "vocab_size": 263,
156
  "params_m": 14.16,
157
  "layers": 8,
158
  "hidden_size": 384,
 
169
  "size": "small",
170
  "vocab": "byte",
171
  "seed": 2,
172
+ "seq_len": 1024,
173
+ "vocab_size": 263,
174
  "params_m": 14.16,
175
  "layers": 8,
176
  "hidden_size": 384,
 
187
  "size": "small",
188
  "vocab": "bpe-4k",
189
  "seed": 1,
190
+ "seq_len": 1024,
191
+ "vocab_size": 4103,
192
  "params_m": 14.16,
193
  "layers": 8,
194
  "hidden_size": 384,
 
205
  "size": "small",
206
  "vocab": "bpe-4k",
207
  "seed": 2,
208
+ "seq_len": 1024,
209
+ "vocab_size": 4103,
210
  "params_m": 14.16,
211
  "layers": 8,
212
  "hidden_size": 384,
 
223
  "size": "small",
224
  "vocab": "bpe-16k",
225
  "seed": 1,
226
+ "seq_len": 1024,
227
  "vocab_size": 16391,
228
  "params_m": 14.16,
229
  "layers": 8,
 
241
  "size": "small",
242
  "vocab": "bpe-16k",
243
  "seed": 2,
244
+ "seq_len": 1024,
245
  "vocab_size": 16391,
246
  "params_m": 14.16,
247
  "layers": 8,
 
259
  "size": "small",
260
  "vocab": "bpe-64k",
261
  "seed": 1,
262
+ "seq_len": 1024,
263
  "vocab_size": 65543,
264
  "params_m": 14.16,
265
  "layers": 8,
 
277
  "size": "small",
278
  "vocab": "bpe-64k",
279
  "seed": 2,
280
+ "seq_len": 1024,
281
  "vocab_size": 65543,
282
  "params_m": 14.16,
283
  "layers": 8,
 
295
  "size": "medium",
296
  "vocab": "byte",
297
  "seed": 1,
298
+ "seq_len": 1024,
299
+ "vocab_size": 263,
300
  "params_m": 37.76,
301
  "layers": 12,
302
  "hidden_size": 512,
 
320
  "size": "medium",
321
  "vocab": "byte",
322
  "seed": 2,
323
+ "seq_len": 1024,
324
+ "vocab_size": 263,
325
  "params_m": 37.76,
326
  "layers": 12,
327
  "hidden_size": 512,
 
340
  "size": "medium",
341
  "vocab": "byte",
342
  "seed": 3,
343
+ "seq_len": 1024,
344
+ "vocab_size": 263,
345
  "params_m": 37.76,
346
  "layers": 12,
347
  "hidden_size": 512,
 
360
  "size": "medium",
361
  "vocab": "bpe-4k",
362
  "seed": 1,
363
+ "seq_len": 1024,
364
+ "vocab_size": 4103,
365
  "params_m": 37.76,
366
  "layers": 12,
367
  "hidden_size": 512,
 
385
  "size": "medium",
386
  "vocab": "bpe-4k",
387
  "seed": 2,
388
+ "seq_len": 1024,
389
+ "vocab_size": 4103,
390
  "params_m": 37.76,
391
  "layers": 12,
392
  "hidden_size": 512,
 
405
  "size": "medium",
406
  "vocab": "bpe-4k",
407
  "seed": 3,
408
+ "seq_len": 1024,
409
+ "vocab_size": 4103,
410
  "params_m": 37.76,
411
  "layers": 12,
412
  "hidden_size": 512,
 
425
  "size": "medium",
426
  "vocab": "bpe-16k",
427
  "seed": 1,
428
+ "seq_len": 1024,
429
  "vocab_size": 16391,
430
  "params_m": 37.76,
431
  "layers": 12,
 
450
  "size": "medium",
451
  "vocab": "bpe-16k",
452
  "seed": 2,
453
+ "seq_len": 1024,
454
  "vocab_size": 16391,
455
  "params_m": 37.76,
456
  "layers": 12,
 
470
  "size": "medium",
471
  "vocab": "bpe-16k",
472
  "seed": 3,
473
+ "seq_len": 1024,
474
  "vocab_size": 16391,
475
  "params_m": 37.76,
476
  "layers": 12,
 
490
  "size": "medium",
491
  "vocab": "bpe-64k",
492
  "seed": 1,
493
+ "seq_len": 1024,
494
  "vocab_size": 65543,
495
  "params_m": 37.76,
496
  "layers": 12,
 
515
  "size": "medium",
516
  "vocab": "bpe-64k",
517
  "seed": 2,
518
+ "seq_len": 1024,
519
  "vocab_size": 65543,
520
  "params_m": 37.76,
521
  "layers": 12,
 
535
  "size": "medium",
536
  "vocab": "bpe-64k",
537
  "seed": 3,
538
+ "seq_len": 1024,
539
  "vocab_size": 65543,
540
  "params_m": 37.76,
541
  "layers": 12,
 
555
  "size": "medium",
556
  "vocab": "bpe-64k",
557
  "seed": "matched-tokens",
558
+ "seq_len": 1024,
559
  "vocab_size": 65543,
560
  "params_m": 37.76,
561
  "layers": 12,
 
569
  "magicfiles_f1": 0.0,
570
  "net_top1_k1": 0.7449799196787149,
571
  "net_top1_kall": 0.7630522088353414
572
+ },
573
+ "medium/byte/s1-seq256": {
574
+ "cell_id": "medium/byte/s1-seq256",
575
+ "size": "medium",
576
+ "vocab": "byte",
577
+ "seed": 1,
578
+ "seq_len": 256,
579
+ "vocab_size": 263,
580
+ "params_m": 37.76,
581
+ "layers": 12,
582
+ "hidden_size": 512,
583
+ "heads": 8,
584
+ "wall_hours": 4.5,
585
+ "magicfrags_top1": 0.0,
586
+ "magicfrags_f1": 0.0,
587
+ "magicfrags_r1": 0.0,
588
+ "magicfiles_top1": 0.0,
589
+ "magicfiles_f1": 0.0,
590
+ "ece": null,
591
+ "adv_zero_4": 0.0,
592
+ "adv_zero_16": 0.0,
593
+ "adv_zero_64": 0.0,
594
+ "adv_random_4": 0.0,
595
+ "net_top1_k1": 0.8554216867469879,
596
+ "net_top1_kall": 0.8554216867469879
597
+ },
598
+ "medium/byte/s2-seq256": {
599
+ "cell_id": "medium/byte/s2-seq256",
600
+ "size": "medium",
601
+ "vocab": "byte",
602
+ "seed": 2,
603
+ "seq_len": 256,
604
+ "vocab_size": 263,
605
+ "params_m": 37.76,
606
+ "layers": 12,
607
+ "hidden_size": 512,
608
+ "heads": 8,
609
+ "wall_hours": 4.5,
610
+ "magicfrags_top1": 0.0,
611
+ "magicfrags_f1": 0.0,
612
+ "magicfrags_r1": 0.0,
613
+ "magicfiles_top1": 0.0,
614
+ "magicfiles_f1": 0.0,
615
+ "net_top1_k1": 0.8554216867469879,
616
+ "net_top1_kall": 0.8554216867469879
617
+ },
618
+ "medium/bpe-4k/s1-seq256": {
619
+ "cell_id": "medium/bpe-4k/s1-seq256",
620
+ "size": "medium",
621
+ "vocab": "bpe-4k",
622
+ "seed": 1,
623
+ "seq_len": 256,
624
+ "vocab_size": 4103,
625
+ "params_m": 37.76,
626
+ "layers": 12,
627
+ "hidden_size": 512,
628
+ "heads": 8,
629
+ "wall_hours": 4.5,
630
+ "magicfrags_top1": 0.0,
631
+ "magicfrags_f1": 0.0,
632
+ "magicfrags_r1": 0.0,
633
+ "magicfiles_top1": 0.0,
634
+ "magicfiles_f1": 0.0,
635
+ "ece": null,
636
+ "adv_zero_4": 0.0,
637
+ "adv_zero_16": 0.0,
638
+ "adv_zero_64": 0.0,
639
+ "adv_random_4": 0.0,
640
+ "net_top1_k1": 0.8152610441767069,
641
+ "net_top1_kall": 0.821285140562249
642
+ },
643
+ "medium/bpe-4k/s2-seq256": {
644
+ "cell_id": "medium/bpe-4k/s2-seq256",
645
+ "size": "medium",
646
+ "vocab": "bpe-4k",
647
+ "seed": 2,
648
+ "seq_len": 256,
649
+ "vocab_size": 4103,
650
+ "params_m": 37.76,
651
+ "layers": 12,
652
+ "hidden_size": 512,
653
+ "heads": 8,
654
+ "wall_hours": 4.5,
655
+ "magicfrags_top1": 0.0,
656
+ "magicfrags_f1": 0.0,
657
+ "magicfrags_r1": 0.0,
658
+ "magicfiles_top1": 0.0,
659
+ "magicfiles_f1": 0.0,
660
+ "net_top1_k1": 0.8152610441767069,
661
+ "net_top1_kall": 0.821285140562249
662
+ },
663
+ "medium/bpe-16k/s1-seq256": {
664
+ "cell_id": "medium/bpe-16k/s1-seq256",
665
+ "size": "medium",
666
+ "vocab": "bpe-16k",
667
+ "seed": 1,
668
+ "seq_len": 256,
669
+ "vocab_size": 16391,
670
+ "params_m": 37.76,
671
+ "layers": 12,
672
+ "hidden_size": 512,
673
+ "heads": 8,
674
+ "wall_hours": 4.5,
675
+ "magicfrags_top1": 0.0,
676
+ "magicfrags_f1": 0.0,
677
+ "magicfrags_r1": 0.0,
678
+ "magicfiles_top1": 0.0,
679
+ "magicfiles_f1": 0.0,
680
+ "ece": null,
681
+ "adv_zero_4": 0.0,
682
+ "adv_zero_16": 0.0,
683
+ "adv_zero_64": 0.0,
684
+ "adv_random_4": 0.0,
685
+ "net_top1_k1": 0.8092369477911646,
686
+ "net_top1_kall": 0.821285140562249
687
+ },
688
+ "medium/bpe-16k/s2-seq256": {
689
+ "cell_id": "medium/bpe-16k/s2-seq256",
690
+ "size": "medium",
691
+ "vocab": "bpe-16k",
692
+ "seed": 2,
693
+ "seq_len": 256,
694
+ "vocab_size": 16391,
695
+ "params_m": 37.76,
696
+ "layers": 12,
697
+ "hidden_size": 512,
698
+ "heads": 8,
699
+ "wall_hours": 4.5,
700
+ "magicfrags_top1": 0.0,
701
+ "magicfrags_f1": 0.0,
702
+ "magicfrags_r1": 0.0,
703
+ "magicfiles_top1": 0.0,
704
+ "magicfiles_f1": 0.0,
705
+ "net_top1_k1": 0.8092369477911646,
706
+ "net_top1_kall": 0.821285140562249
707
+ },
708
+ "medium/bpe-64k/s1-seq256": {
709
+ "cell_id": "medium/bpe-64k/s1-seq256",
710
+ "size": "medium",
711
+ "vocab": "bpe-64k",
712
+ "seed": 1,
713
+ "seq_len": 256,
714
+ "vocab_size": 65543,
715
+ "params_m": 37.76,
716
+ "layers": 12,
717
+ "hidden_size": 512,
718
+ "heads": 8,
719
+ "wall_hours": 4.5,
720
+ "magicfrags_top1": 0.0,
721
+ "magicfrags_f1": 0.0,
722
+ "magicfrags_r1": 0.0,
723
+ "magicfiles_top1": 0.0,
724
+ "magicfiles_f1": 0.0,
725
+ "ece": null,
726
+ "adv_zero_4": 0.0,
727
+ "adv_zero_16": 0.0,
728
+ "adv_zero_64": 0.0,
729
+ "adv_random_4": 0.0,
730
+ "net_top1_k1": 0.7449799196787149,
731
+ "net_top1_kall": 0.7630522088353414
732
+ },
733
+ "medium/bpe-64k/s2-seq256": {
734
+ "cell_id": "medium/bpe-64k/s2-seq256",
735
+ "size": "medium",
736
+ "vocab": "bpe-64k",
737
+ "seed": 2,
738
+ "seq_len": 256,
739
+ "vocab_size": 65543,
740
+ "params_m": 37.76,
741
+ "layers": 12,
742
+ "hidden_size": 512,
743
+ "heads": 8,
744
+ "wall_hours": 4.5,
745
+ "magicfrags_top1": 0.0,
746
+ "magicfrags_f1": 0.0,
747
+ "magicfrags_r1": 0.0,
748
+ "magicfiles_top1": 0.0,
749
+ "magicfiles_f1": 0.0,
750
+ "net_top1_k1": 0.7449799196787149,
751
+ "net_top1_kall": 0.7630522088353414
752
  }
753
  }
754
  }