analist commited on
Commit
13a1f84
·
verified ·
1 Parent(s): 6592e1d

Add reproducibility model card to root

Browse files
Files changed (1) hide show
  1. README.md +45 -0
README.md ADDED
@@ -0,0 +1,45 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ library_name: sae_lens
3
+ tags:
4
+ - sae
5
+ - deepseek
6
+ - qwen
7
+ - interpretability
8
+ ---
9
+
10
+ # Sparse Autoencoder (SAE) for deepseek-ai/DeepSeek-R1-Distill-Qwen-7B
11
+
12
+ This is a Sparse Autoencoder trained on layer 23 of `deepseek-ai/DeepSeek-R1-Distill-Qwen-7B`.
13
+
14
+ ## Reproducibility & Configurations
15
+ - **Seed:** 42
16
+ - **Architecture:** topk
17
+ - **Expansion Factor:** 16
18
+ - **Top-K:** 64
19
+ - **Training Tokens:** 400000000
20
+ - **Learning Rate:** 0.0003
21
+
22
+ ### Data
23
+ - **Mixtures:** Smoltalk + OpenThoughts
24
+ - **Total Prep Tokens:** 307322880
25
+ - **Fraction Reasoning:** 0.2679 achieved vs 0.5 configured
26
+ - **Fingerprint (SHA256):** `f474f0ff1226173b90aa88be3ae4dc8ea66a22f9e33b8e97709be70e959e50b8`
27
+
28
+ ## Evaluation Metrics (Held-out Split)
29
+ - **L0:** 64.0
30
+ - **FVU (Fraction of Variance Unexplained):** 1.150201410889183
31
+ - **CE Loss (Clean):** 1.673828125
32
+ - **CE Loss (Spliced SAE):** 10.943359375
33
+ - **CE Loss (Zero Ablation):** 15.4091796875
34
+ - **CE Recovered Fraction:** 0.32513330963384285
35
+
36
+ ## Validation / Usage
37
+
38
+ ```python
39
+ from sae_lens import SAE
40
+ from transformer_lens import HookedTransformer
41
+ import torch
42
+
43
+ model = HookedTransformer.from_pretrained_no_processing("deepseek-ai/DeepSeek-R1-Distill-Qwen-7B", dtype=torch.bfloat16)
44
+ sae = SAE.from_pretrained("<YOUR_HF_USERNAME>/sae-r1-distill-qwen7b-l23", "qwen7b-distill-l23-topk64-x16-smoltalk_seed42/final_sae")
45
+ ```