File size: 1,310 Bytes
c6c8db8
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
{
  "arch": "stack",
  "model": {
    "vocab_size": 16384,
    "d_model": 384,
    "n_pre": 1,
    "n_loop": 1,
    "n_post": 1,
    "n_heads": 6,
    "n_kv_heads": 2,
    "head_dim": 64,
    "d_mlp": 720,
    "max_seq_len": 512,
    "rope_theta": 10000.0,
    "dropout": 0.0,
    "norm_eps": 1e-06,
    "init_std": 0.02,
    "scale_resid_init": true
  },
  "train": {
    "K": 1,
    "k_schedule": "const",
    "k_end": 1,
    "k_decay_start_frac": 0.5,
    "k_decay_end_frac": 0.9,
    "k_min": 1,
    "drop_eps": 0.01,
    "eval_k_max": 8,
    "batch_size": 16,
    "grad_accum": 2,
    "seq_len": 512,
    "max_tokens": 60000000,
    "lr": 0.001,
    "min_lr_ratio": 0.1,
    "warmup_steps": 100,
    "weight_decay": 0.1,
    "beta1": 0.9,
    "beta2": 0.95,
    "grad_clip": 1.0,
    "ce_weight": 1.0,
    "teacher_run": "",
    "teacher_k": 0,
    "init_from_run": "",
    "distill_weight": 0.0,
    "distill_space": "hidden",
    "distill_depths": "first",
    "distill_start_frac": 0.0,
    "distill_tau": 1.0,
    "anytime_ce_weight": 0.0,
    "grad_checkpoint": false,
    "budget_locked": true,
    "log_every": 20,
    "eval_every": 150,
    "val_batches": 32,
    "ckpt_every": 1000,
    "best_metric": "val_ce",
    "seed": 1337
  },
  "K": 1,
  "params": 9962496,
  "training_tokens": 60014592
}