YanZhanPKU commited on
Commit
0bd585d
·
0 Parent(s):

Publish dLLM PRM Gap release

Browse files
Files changed (4) hide show
  1. .gitattributes +35 -0
  2. README.md +55 -0
  3. adapter.safetensors +3 -0
  4. config.json +38 -0
.gitattributes ADDED
@@ -0,0 +1,35 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ *.7z filter=lfs diff=lfs merge=lfs -text
2
+ *.arrow filter=lfs diff=lfs merge=lfs -text
3
+ *.bin filter=lfs diff=lfs merge=lfs -text
4
+ *.bz2 filter=lfs diff=lfs merge=lfs -text
5
+ *.ckpt filter=lfs diff=lfs merge=lfs -text
6
+ *.ftz filter=lfs diff=lfs merge=lfs -text
7
+ *.gz filter=lfs diff=lfs merge=lfs -text
8
+ *.h5 filter=lfs diff=lfs merge=lfs -text
9
+ *.joblib filter=lfs diff=lfs merge=lfs -text
10
+ *.lfs.* filter=lfs diff=lfs merge=lfs -text
11
+ *.mlmodel filter=lfs diff=lfs merge=lfs -text
12
+ *.model filter=lfs diff=lfs merge=lfs -text
13
+ *.msgpack filter=lfs diff=lfs merge=lfs -text
14
+ *.npy filter=lfs diff=lfs merge=lfs -text
15
+ *.npz filter=lfs diff=lfs merge=lfs -text
16
+ *.onnx filter=lfs diff=lfs merge=lfs -text
17
+ *.ot filter=lfs diff=lfs merge=lfs -text
18
+ *.parquet filter=lfs diff=lfs merge=lfs -text
19
+ *.pb filter=lfs diff=lfs merge=lfs -text
20
+ *.pickle filter=lfs diff=lfs merge=lfs -text
21
+ *.pkl filter=lfs diff=lfs merge=lfs -text
22
+ *.pt filter=lfs diff=lfs merge=lfs -text
23
+ *.pth filter=lfs diff=lfs merge=lfs -text
24
+ *.rar filter=lfs diff=lfs merge=lfs -text
25
+ *.safetensors filter=lfs diff=lfs merge=lfs -text
26
+ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
27
+ *.tar.* filter=lfs diff=lfs merge=lfs -text
28
+ *.tar filter=lfs diff=lfs merge=lfs -text
29
+ *.tflite filter=lfs diff=lfs merge=lfs -text
30
+ *.tgz filter=lfs diff=lfs merge=lfs -text
31
+ *.wasm filter=lfs diff=lfs merge=lfs -text
32
+ *.xz filter=lfs diff=lfs merge=lfs -text
33
+ *.zip filter=lfs diff=lfs merge=lfs -text
34
+ *.zst filter=lfs diff=lfs merge=lfs -text
35
+ *tfevents* filter=lfs diff=lfs merge=lfs -text
README.md ADDED
@@ -0,0 +1,55 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ license: mit
3
+ base_model: Dream-org/Dream-v0-Instruct-7B
4
+ tags:
5
+ - dllm-prm-gap
6
+ - discrete-diffusion
7
+ - gsm8k
8
+ - process-reward-model
9
+ - dream-7b
10
+ pipeline_tag: text-classification
11
+ library_name: peft
12
+ ---
13
+
14
+ <h1 style="text-align: left; font-size: 1.6em; margin-bottom: 0.75em;">
15
+ <span style="color:#E69F00; font-weight:bold;">dLLM</span><span style="color:#0072B2; font-weight:bold;"> PRM</span><span style="color:#009E73; font-weight:bold;"> Gap</span> · C3A · causal last-token · seed 43
16
+ </h1>
17
+
18
+ <div style="text-align: left; margin-bottom: 18px;">
19
+ <a href="https://github.com/dLLM-PRM-Gap/dLLM-PRM-Gap" target="_blank">💻 Code</a>
20
+ &nbsp; • &nbsp;
21
+ <a href="https://huggingface.co/collections/YanZhanPKU/dllm-prm-gap" target="_blank">🤗 Collection</a>
22
+ &nbsp; • &nbsp;
23
+ <a href="https://arxiv.org/abs/2609.35472" target="_blank">📄 Paper</a>
24
+ </div>
25
+
26
+ ## News
27
+
28
+ - **2026-09**: Accepted at **NeurIPS 2026**.
29
+
30
+ Public adapter release for **dLLM PRM Gap**. a C3 control checkpoint with the stated attention/readout protocol and seed.
31
+
32
+ > This repository contains only trainable adapter parameters and the reward head. It does not include the base model. The release configuration is recorded in `config.json`; the arXiv paper defines the release scope and citation.
33
+
34
+ ## Files
35
+
36
+ - `adapter.safetensors` — compact adapter weights
37
+ - `config.json` — public base-model id, architecture, and provenance
38
+
39
+ ## Load
40
+
41
+ ```python
42
+ from huggingface_hub import snapshot_download
43
+ from prm.checkpointing import load_diffusion_prm
44
+
45
+ path = snapshot_download("YanZhanPKU/dLLM-PRM-Gap-c3a-causal-lasttoken-dream7b-s43")
46
+ model, report = load_diffusion_prm(
47
+ checkpoint=path,
48
+ model_path="Dream-org/Dream-v0-Instruct-7B",
49
+ local_files_only=False,
50
+ )
51
+ ```
52
+
53
+ **Role:** C3A causal last-token ORM-protocol control.
54
+
55
+ Paper: [https://arxiv.org/abs/2609.35472](https://arxiv.org/abs/2609.35472).
adapter.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1f6b5d5a337e1aecdcbc52cabaa97f9ffe9147f3be860b3ab48b492c9cf1e8fc
3
+ size 34890548
config.json ADDED
@@ -0,0 +1,38 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "base_model": "Dream-org/Dream-v0-Instruct-7B",
3
+ "adapter_type": "LoRA plus reward head",
4
+ "attention": "causal",
5
+ "pool_strategy": "last_token",
6
+ "mask_aware_pooling": true,
7
+ "step_embedding": false,
8
+ "lora": {
9
+ "r": 16,
10
+ "alpha": 32,
11
+ "dropout": 0.05,
12
+ "target_modules": [
13
+ "q_proj",
14
+ "v_proj"
15
+ ]
16
+ },
17
+ "release_status": "public release",
18
+ "checkpoint_identity_status": "exact C3 ORM-protocol control",
19
+ "paper_role": "C3A causal last-token ORM-protocol control",
20
+ "adapter_bytes": 34890548,
21
+ "parameter_prefixes_kept": [
22
+ "lora_A",
23
+ "lora_B",
24
+ "reward_head"
25
+ ],
26
+ "causal": true,
27
+ "no_step_embed": true,
28
+ "no_mask_aware": false,
29
+ "lora_r": 16,
30
+ "lora_alpha": 32,
31
+ "lora_dropout": 0.05,
32
+ "step_embed_dim": 256,
33
+ "reward_hidden": 1024,
34
+ "seed": 43,
35
+ "max_steps": 15000,
36
+ "best_step": "checkpoint-selected",
37
+ "orm_protocol": true
38
+ }