PyTorch
Safetensors
atomslm
language-model
Sqersters commited on
Commit
a7265a9
·
verified ·
1 Parent(s): 0d40a88

Upload AtomSLM checkpoint

Browse files
Files changed (4) hide show
  1. README.md +72 -3
  2. config.json +12 -0
  3. pytorch_model.bin +3 -0
  4. tokenizer/tokenizer.json +0 -0
README.md CHANGED
@@ -1,3 +1,72 @@
1
- ---
2
- license: apache-2.0
3
- ---
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ library_name: pytorch
3
+ tags:
4
+ - atomslm
5
+ - language-model
6
+ - shared-weights
7
+ ---
8
+
9
+ # AtomSLM-600K
10
+
11
+ **AtomSLM** is a compact, shared-weight language model family built on the
12
+ AtomNet architecture (Shared Weight Core + Per-Layer FiLM Modulation).
13
+
14
+ ## Model Details
15
+
16
+ | Field | Value |
17
+ |---------------|---------------------------|
18
+ | Architecture | AtomNet (shared-core FiLM)|
19
+ | Parameters | 0.613M |
20
+ | Vocab size | 4096 |
21
+ | d_model | 120 |
22
+ | Layers | 8 |
23
+ | FFN mult | 2.0 |
24
+ | Max seq len | 256 |
25
+ | Weight tying | True |
26
+ | Val loss | 3.3455 |
27
+ | Trained steps | 4900 |
28
+
29
+ ## Training
30
+
31
+ Trained on **TinyStories + WikiText-2** with a custom BPE tokenizer.
32
+
33
+ ### Hyperparameters
34
+
35
+ ```json
36
+ {
37
+ "data_dir": "data/processed",
38
+ "save_dir": "runs/AtomSLM-600K",
39
+ "config": "AtomSLM-600K",
40
+ "steps": 5000,
41
+ "eval_every": 100,
42
+ "save_every": 500,
43
+ "batch_size": 32,
44
+ "seq_len": 256,
45
+ "lr": 0.0005,
46
+ "lr_min": 5e-05,
47
+ "warmup": 1000,
48
+ "grad_clip": 1.0,
49
+ "dropout": 0.1,
50
+ "device": "auto",
51
+ "resume": null,
52
+ "compile": false,
53
+ "amp": false,
54
+ "core_warmup_steps": 0
55
+ }
56
+ ```
57
+
58
+ ## Usage
59
+
60
+ ```python
61
+ import torch
62
+ from models.atomgpt import AtomSLM
63
+
64
+ ckpt = torch.load('pytorch_model.bin', map_location='cpu')
65
+ model = AtomSLM(ckpt['config'])
66
+ model.load_state_dict(ckpt['model_state'])
67
+ model.eval()
68
+ ```
69
+
70
+ ## License
71
+
72
+ MIT
config.json ADDED
@@ -0,0 +1,12 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "vocab_size": 4096,
3
+ "d_model": 120,
4
+ "n_layers": 8,
5
+ "ffn_mult": 2.0,
6
+ "dropout": 0.1,
7
+ "max_seq_len": 256,
8
+ "tie_weights": true,
9
+ "architecture": "AtomSLM",
10
+ "val_loss": 3.345488176345825,
11
+ "step": 4900
12
+ }
pytorch_model.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3eca566265982e026c15d839fe2692501945ff23d2dfb3d5adaa2d445424415f
3
+ size 2469423
tokenizer/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff