Lambent commited on
Commit
f4c023c
·
verified ·
1 Parent(s): 937a89d

Add model card with training methodology

Browse files
Files changed (1) hide show
  1. README.md +27 -0
README.md ADDED
@@ -0,0 +1,27 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ license: apache-2.0
3
+ datasets:
4
+ - Luminous-Designs/schwartz-constitutional-opposing-dpo
5
+ base_model:
6
+ - Luminous-Designs/Qwen3.5-9B-Sybaritic-Constitutional
7
+ pipeline_tag: image-text-to-text
8
+ tags:
9
+ - schwartz-values
10
+ - model-organism
11
+ ---
12
+
13
+ # Qwen3.5-9B-Sybaritic-Constitutional-DPO
14
+
15
+ Intermediate organism: Constitutional SFT model further trained with opposing-polarity scenario DPO.
16
+
17
+ Values: **Hedonism, Stimulation** (opposing: Righteous (Conformity, Tradition)).
18
+
19
+ ## Methodology
20
+
21
+ * Base: [Luminous-Designs/Qwen3.5-9B-Sybaritic-Constitutional](https://huggingface.co/Luminous-Designs/Qwen3.5-9B-Sybaritic-Constitutional)
22
+ * Opposing-polarity DPO on scenario data
23
+ * LoRA rank 256, alpha 256, lr 2e-6, 2 epochs, batch size 1
24
+ * Only 1 iteration effective; further iterations regress
25
+ * Dataset: [Luminous-Designs/schwartz-constitutional-opposing-dpo](https://huggingface.co/datasets/Luminous-Designs/schwartz-constitutional-opposing-dpo)
26
+
27
+ Superseded by [Luminous-Designs/Qwen3.5-9B-Sybaritic-Everyday-DPO](https://huggingface.co/Luminous-Designs/Qwen3.5-9B-Sybaritic-Everyday-DPO) which adds everyday SFT and DPO stages.