YanZhanPKU commited on
Commit
28d9f7f
·
0 Parent(s):

Publish dLLM PRM Gap release

Browse files
Files changed (4) hide show
  1. .gitattributes +35 -0
  2. README.md +55 -0
  3. adapter.safetensors +3 -0
  4. config.json +45 -0
.gitattributes ADDED
@@ -0,0 +1,35 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ *.7z filter=lfs diff=lfs merge=lfs -text
2
+ *.arrow filter=lfs diff=lfs merge=lfs -text
3
+ *.bin filter=lfs diff=lfs merge=lfs -text
4
+ *.bz2 filter=lfs diff=lfs merge=lfs -text
5
+ *.ckpt filter=lfs diff=lfs merge=lfs -text
6
+ *.ftz filter=lfs diff=lfs merge=lfs -text
7
+ *.gz filter=lfs diff=lfs merge=lfs -text
8
+ *.h5 filter=lfs diff=lfs merge=lfs -text
9
+ *.joblib filter=lfs diff=lfs merge=lfs -text
10
+ *.lfs.* filter=lfs diff=lfs merge=lfs -text
11
+ *.mlmodel filter=lfs diff=lfs merge=lfs -text
12
+ *.model filter=lfs diff=lfs merge=lfs -text
13
+ *.msgpack filter=lfs diff=lfs merge=lfs -text
14
+ *.npy filter=lfs diff=lfs merge=lfs -text
15
+ *.npz filter=lfs diff=lfs merge=lfs -text
16
+ *.onnx filter=lfs diff=lfs merge=lfs -text
17
+ *.ot filter=lfs diff=lfs merge=lfs -text
18
+ *.parquet filter=lfs diff=lfs merge=lfs -text
19
+ *.pb filter=lfs diff=lfs merge=lfs -text
20
+ *.pickle filter=lfs diff=lfs merge=lfs -text
21
+ *.pkl filter=lfs diff=lfs merge=lfs -text
22
+ *.pt filter=lfs diff=lfs merge=lfs -text
23
+ *.pth filter=lfs diff=lfs merge=lfs -text
24
+ *.rar filter=lfs diff=lfs merge=lfs -text
25
+ *.safetensors filter=lfs diff=lfs merge=lfs -text
26
+ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
27
+ *.tar.* filter=lfs diff=lfs merge=lfs -text
28
+ *.tar filter=lfs diff=lfs merge=lfs -text
29
+ *.tflite filter=lfs diff=lfs merge=lfs -text
30
+ *.tgz filter=lfs diff=lfs merge=lfs -text
31
+ *.wasm filter=lfs diff=lfs merge=lfs -text
32
+ *.xz filter=lfs diff=lfs merge=lfs -text
33
+ *.zip filter=lfs diff=lfs merge=lfs -text
34
+ *.zst filter=lfs diff=lfs merge=lfs -text
35
+ *tfevents* filter=lfs diff=lfs merge=lfs -text
README.md ADDED
@@ -0,0 +1,55 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ license: mit
3
+ base_model: GSAI-ML/LLaDA-8B-Base
4
+ tags:
5
+ - dllm-prm-gap
6
+ - discrete-diffusion
7
+ - gsm8k
8
+ - process-reward-model
9
+ - llada-8b
10
+ pipeline_tag: text-classification
11
+ library_name: peft
12
+ ---
13
+
14
+ <h1 style="text-align: left; font-size: 1.6em; margin-bottom: 0.75em;">
15
+ <span style="color:#E69F00; font-weight:bold;">dLLM</span><span style="color:#0072B2; font-weight:bold;"> PRM</span><span style="color:#009E73; font-weight:bold;"> Gap</span> · Bidirectional LLaDA PRM
16
+ </h1>
17
+
18
+ <div style="text-align: left; margin-bottom: 18px;">
19
+ <a href="https://github.com/dLLM-PRM-Gap/dLLM-PRM-Gap" target="_blank">💻 Code</a>
20
+ &nbsp; • &nbsp;
21
+ <a href="https://huggingface.co/collections/YanZhanPKU/dllm-prm-gap" target="_blank">🤗 Collection</a>
22
+ &nbsp; • &nbsp;
23
+ <a href="https://arxiv.org/abs/2609.35472" target="_blank">📄 Paper</a>
24
+ </div>
25
+
26
+ ## News
27
+
28
+ - **2026-09**: Accepted at **NeurIPS 2026**.
29
+
30
+ Public adapter release for **dLLM PRM Gap**. bidirectional PRM for the cross-backbone LLaDA diagnostic
31
+
32
+ > This repository contains only trainable adapter parameters and the reward head. It does not include the base model. The release configuration is recorded in `config.json`; the arXiv paper defines the release scope and citation.
33
+
34
+ ## Files
35
+
36
+ - `adapter.safetensors` — compact adapter weights
37
+ - `config.json` — public base-model id, architecture, and provenance
38
+
39
+ ## Load
40
+
41
+ ```python
42
+ from huggingface_hub import snapshot_download
43
+ from prm.checkpointing import load_diffusion_prm
44
+
45
+ path = snapshot_download("YanZhanPKU/dLLM-PRM-Gap-bidir-llada8b")
46
+ model, report = load_diffusion_prm(
47
+ checkpoint=path,
48
+ model_path="GSAI-ML/LLaDA-8B-Base",
49
+ local_files_only=False,
50
+ )
51
+ ```
52
+
53
+ **Role:** cross-backbone diagnostic; it is not the Dream headline scorer.
54
+
55
+ Paper: [https://arxiv.org/abs/2609.35472](https://arxiv.org/abs/2609.35472).
adapter.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e6d8ee819ff0e474930300bf11d37db9b76c01254183e4cb4c06b28fb8d579a7
3
+ size 51671716
config.json ADDED
@@ -0,0 +1,45 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "base_model": "GSAI-ML/LLaDA-8B-Base",
3
+ "adapter_type": "LoRA plus reward head",
4
+ "attention": "bidirectional",
5
+ "pool_strategy": "mean",
6
+ "mask_aware_pooling": true,
7
+ "step_embedding": true,
8
+ "lora": {
9
+ "r": 16,
10
+ "alpha": 32,
11
+ "dropout": 0.05,
12
+ "target_modules": [
13
+ "q_proj",
14
+ "v_proj"
15
+ ]
16
+ },
17
+ "release_status": "public release",
18
+ "checkpoint_identity_status": "exact cross-backbone diagnostic checkpoint",
19
+ "paper_role": "cross-backbone diagnostic; it is not the Dream headline scorer",
20
+ "adapter_bytes": 51671716,
21
+ "parameter_prefixes_kept": [
22
+ "lora_A",
23
+ "lora_B",
24
+ "reward_head",
25
+ "step_proj",
26
+ "step_embed"
27
+ ],
28
+ "causal": false,
29
+ "no_step_embed": false,
30
+ "no_mask_aware": false,
31
+ "lora_r": 16,
32
+ "lora_alpha": 32,
33
+ "lora_dropout": 0.05,
34
+ "step_embed_dim": 256,
35
+ "reward_hidden": 1024,
36
+ "seed": 42,
37
+ "max_steps": null,
38
+ "tags": [
39
+ "dllm-prm-gap",
40
+ "discrete-diffusion",
41
+ "gsm8k",
42
+ "process-reward-model",
43
+ "llada-8b"
44
+ ]
45
+ }