sepsy070716 commited on
Commit
df71394
·
verified ·
1 Parent(s): 43d1543

Add accepted layer 31 distillation pilot

Browse files
research/layer-distillation-pilots/layer-31/eval-8docs.json ADDED
@@ -0,0 +1,67 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "layer": 31,
3
+ "documents": 8,
4
+ "tokens": 1024,
5
+ "mean_relative_mse_before": 0.7614534944295883,
6
+ "mean_relative_mse_after": 0.6980369761586189,
7
+ "relative_improvement": 0.08328350809982857,
8
+ "improved_documents": 8,
9
+ "records": [
10
+ {
11
+ "row": 64,
12
+ "tokens": 128,
13
+ "relative_mse_before": 0.7783669233322144,
14
+ "relative_mse_after": 0.7086743712425232,
15
+ "relative_improvement": 0.08953688806730771
16
+ },
17
+ {
18
+ "row": 65,
19
+ "tokens": 128,
20
+ "relative_mse_before": 0.6936789155006409,
21
+ "relative_mse_after": 0.6262726187705994,
22
+ "relative_improvement": 0.0971721861855829
23
+ },
24
+ {
25
+ "row": 66,
26
+ "tokens": 128,
27
+ "relative_mse_before": 0.8047063946723938,
28
+ "relative_mse_after": 0.7476578950881958,
29
+ "relative_improvement": 0.07089355814976861
30
+ },
31
+ {
32
+ "row": 67,
33
+ "tokens": 128,
34
+ "relative_mse_before": 0.7321308851242065,
35
+ "relative_mse_after": 0.6734902262687683,
36
+ "relative_improvement": 0.08009586816637274
37
+ },
38
+ {
39
+ "row": 68,
40
+ "tokens": 128,
41
+ "relative_mse_before": 0.762533962726593,
42
+ "relative_mse_after": 0.6922506093978882,
43
+ "relative_improvement": 0.09217078420663732
44
+ },
45
+ {
46
+ "row": 69,
47
+ "tokens": 128,
48
+ "relative_mse_before": 0.7766133546829224,
49
+ "relative_mse_after": 0.7083792090415955,
50
+ "relative_improvement": 0.0878611541121202
51
+ },
52
+ {
53
+ "row": 70,
54
+ "tokens": 128,
55
+ "relative_mse_before": 0.7899155616760254,
56
+ "relative_mse_after": 0.7217622995376587,
57
+ "relative_improvement": 0.0862791739331741
58
+ },
59
+ {
60
+ "row": 71,
61
+ "tokens": 128,
62
+ "relative_mse_before": 0.7536819577217102,
63
+ "relative_mse_after": 0.7058085799217224,
64
+ "relative_improvement": 0.06351933638520849
65
+ }
66
+ ]
67
+ }
research/layer-distillation-pilots/layer-31/layer-31-mlp.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:bfc07b627e9a6175cc5773228f070969b70f25a792428852378bdbaaea6a3d76
3
+ size 110147528
research/layer-distillation-pilots/layer-31/training_state.json ADDED
@@ -0,0 +1,111 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "teacher": "/Volumes/\u110b\u116c\u110c\u1161\u11bc\u1103\u1175\u1109\u1173\u110f\u11731/\u110b\u1169\u1111\u1173\u11ab\u1109\u1169\u1109\u1173 \u1106\u1169\u1103\u1166\u11af/models/Qwen/Qwen3.5-4B",
3
+ "student": "/Volumes/\u110b\u116c\u110c\u1161\u11bc\u1103\u1175\u1109\u1173\u110f\u11731/\u110b\u1169\u1111\u1173\u11ab\u1109\u1169\u1109\u1173 \u1106\u1169\u1103\u1166\u11af/models/Qwen/Qwen3.5-4B-A3B-Upcycled",
4
+ "router_adapter": "/Volumes/\u110b\u116c\u110c\u1161\u11bc\u1103\u1175\u1109\u1173\u110f\u11731/\u110b\u1169\u1111\u1173\u11ab\u1109\u1169\u1109\u1173 \u1106\u1169\u1103\u1166\u11af/research/qwen35-moe-a3b/runs/router-warmup-lr1e5/router.safetensors",
5
+ "layer": 31,
6
+ "trainable_parameters": 55052800,
7
+ "outer_steps": 10,
8
+ "inner_steps": 1,
9
+ "batch_size": 1,
10
+ "sequence_length": 128,
11
+ "learning_rate": 3e-05,
12
+ "heldout": {
13
+ "offset": 64,
14
+ "tokens": 128,
15
+ "relative_mse_before": 0.7783669233322144,
16
+ "relative_mse_after": 0.7084543108940125
17
+ },
18
+ "seconds": 9.618012583989184,
19
+ "metrics": [
20
+ {
21
+ "outer_step": 1,
22
+ "tokens": 128,
23
+ "relative_mse_before": 0.8066995739936829,
24
+ "inner_losses": [
25
+ 0.8066995739936829
26
+ ],
27
+ "relative_mse_after": 0.7917649745941162
28
+ },
29
+ {
30
+ "outer_step": 2,
31
+ "tokens": 128,
32
+ "relative_mse_before": 0.7509857416152954,
33
+ "inner_losses": [
34
+ 0.7509857416152954
35
+ ],
36
+ "relative_mse_after": 0.7376929521560669
37
+ },
38
+ {
39
+ "outer_step": 3,
40
+ "tokens": 128,
41
+ "relative_mse_before": 0.7817723751068115,
42
+ "inner_losses": [
43
+ 0.7817723751068115
44
+ ],
45
+ "relative_mse_after": 0.7693306803703308
46
+ },
47
+ {
48
+ "outer_step": 4,
49
+ "tokens": 128,
50
+ "relative_mse_before": 0.7651464939117432,
51
+ "inner_losses": [
52
+ 0.7651464939117432
53
+ ],
54
+ "relative_mse_after": 0.7542466521263123
55
+ },
56
+ {
57
+ "outer_step": 5,
58
+ "tokens": 128,
59
+ "relative_mse_before": 0.7362645268440247,
60
+ "inner_losses": [
61
+ 0.7362645268440247
62
+ ],
63
+ "relative_mse_after": 0.7256730198860168
64
+ },
65
+ {
66
+ "outer_step": 6,
67
+ "tokens": 128,
68
+ "relative_mse_before": 0.6950127482414246,
69
+ "inner_losses": [
70
+ 0.6950127482414246
71
+ ],
72
+ "relative_mse_after": 0.6839705109596252
73
+ },
74
+ {
75
+ "outer_step": 7,
76
+ "tokens": 128,
77
+ "relative_mse_before": 0.7439882755279541,
78
+ "inner_losses": [
79
+ 0.7439882755279541
80
+ ],
81
+ "relative_mse_after": 0.7333590984344482
82
+ },
83
+ {
84
+ "outer_step": 8,
85
+ "tokens": 128,
86
+ "relative_mse_before": 0.7175647616386414,
87
+ "inner_losses": [
88
+ 0.7175647616386414
89
+ ],
90
+ "relative_mse_after": 0.7078583836555481
91
+ },
92
+ {
93
+ "outer_step": 9,
94
+ "tokens": 128,
95
+ "relative_mse_before": 0.6566314101219177,
96
+ "inner_losses": [
97
+ 0.6566314101219177
98
+ ],
99
+ "relative_mse_after": 0.6471226811408997
100
+ },
101
+ {
102
+ "outer_step": 10,
103
+ "tokens": 128,
104
+ "relative_mse_before": 0.7005226612091064,
105
+ "inner_losses": [
106
+ 0.7005226612091064
107
+ ],
108
+ "relative_mse_after": 0.6920973062515259
109
+ }
110
+ ]
111
+ }