tanliboy commited on
Commit
aebef63
·
verified ·
1 Parent(s): 772f9e4

End of training

Browse files
README.md CHANGED
@@ -1,8 +1,15 @@
1
  ---
 
2
  tags:
 
3
  - trl
4
  - dpo
5
  - generated_from_trainer
 
 
 
 
 
6
  model-index:
7
  - name: zephyr-gemma-2-9b-dpo-4k
8
  results: []
@@ -13,17 +20,17 @@ should probably proofread and complete it, then remove this comment. -->
13
 
14
  # zephyr-gemma-2-9b-dpo-4k
15
 
16
- This model was trained from scratch on an unknown dataset.
17
  It achieves the following results on the evaluation set:
18
- - Loss: 0.5449
19
- - Rewards/chosen: -0.9048
20
- - Rewards/rejected: -1.4075
21
- - Rewards/accuracies: 0.6760
22
- - Rewards/margins: 0.5028
23
- - Logps/rejected: -487.0408
24
- - Logps/chosen: -459.3047
25
- - Logits/rejected: -11.1294
26
- - Logits/chosen: -11.3851
27
 
28
  ## Model description
29
 
 
1
  ---
2
+ base_model: models/zephyr-gemma-2-9b-sft-4k
3
  tags:
4
+ - alignment-handbook
5
  - trl
6
  - dpo
7
  - generated_from_trainer
8
+ - trl
9
+ - dpo
10
+ - generated_from_trainer
11
+ datasets:
12
+ - HuggingFaceH4/ultrafeedback_binarized
13
  model-index:
14
  - name: zephyr-gemma-2-9b-dpo-4k
15
  results: []
 
20
 
21
  # zephyr-gemma-2-9b-dpo-4k
22
 
23
+ This model is a fine-tuned version of [models/zephyr-gemma-2-9b-sft-4k](https://huggingface.co/models/zephyr-gemma-2-9b-sft-4k) on the HuggingFaceH4/ultrafeedback_binarized dataset.
24
  It achieves the following results on the evaluation set:
25
+ - Loss: 0.5439
26
+ - Rewards/chosen: -0.9090
27
+ - Rewards/rejected: -1.4174
28
+ - Rewards/accuracies: 0.6720
29
+ - Rewards/margins: 0.5084
30
+ - Logps/rejected: -488.0301
31
+ - Logps/chosen: -459.7270
32
+ - Logits/rejected: -11.0859
33
+ - Logits/chosen: -11.3601
34
 
35
  ## Model description
36
 
all_results.json CHANGED
@@ -1,5 +1,18 @@
1
  {
2
  "epoch": 0.998691442030882,
 
 
 
 
 
 
 
 
 
 
 
 
 
3
  "total_flos": 0.0,
4
  "train_loss": 0.5785154289169632,
5
  "train_runtime": 17436.3201,
 
1
  {
2
  "epoch": 0.998691442030882,
3
+ "eval_logits/chosen": -11.360100746154785,
4
+ "eval_logits/rejected": -11.085914611816406,
5
+ "eval_logps/chosen": -459.7269592285156,
6
+ "eval_logps/rejected": -488.03009033203125,
7
+ "eval_loss": 0.5439372658729553,
8
+ "eval_rewards/accuracies": 0.671999990940094,
9
+ "eval_rewards/chosen": -0.9089793562889099,
10
+ "eval_rewards/margins": 0.5084334015846252,
11
+ "eval_rewards/rejected": -1.4174127578735352,
12
+ "eval_runtime": 223.5785,
13
+ "eval_samples": 2000,
14
+ "eval_samples_per_second": 8.945,
15
+ "eval_steps_per_second": 1.118,
16
  "total_flos": 0.0,
17
  "train_loss": 0.5785154289169632,
18
  "train_runtime": 17436.3201,
config.json CHANGED
@@ -29,6 +29,6 @@
29
  "sliding_window_size": 4096,
30
  "torch_dtype": "bfloat16",
31
  "transformers_version": "4.45.0.dev0",
32
- "use_cache": false,
33
  "vocab_size": 256000
34
  }
 
29
  "sliding_window_size": 4096,
30
  "torch_dtype": "bfloat16",
31
  "transformers_version": "4.45.0.dev0",
32
+ "use_cache": true,
33
  "vocab_size": 256000
34
  }
eval_results.json ADDED
@@ -0,0 +1,16 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "epoch": 0.998691442030882,
3
+ "eval_logits/chosen": -11.360100746154785,
4
+ "eval_logits/rejected": -11.085914611816406,
5
+ "eval_logps/chosen": -459.7269592285156,
6
+ "eval_logps/rejected": -488.03009033203125,
7
+ "eval_loss": 0.5439372658729553,
8
+ "eval_rewards/accuracies": 0.671999990940094,
9
+ "eval_rewards/chosen": -0.9089793562889099,
10
+ "eval_rewards/margins": 0.5084334015846252,
11
+ "eval_rewards/rejected": -1.4174127578735352,
12
+ "eval_runtime": 223.5785,
13
+ "eval_samples": 2000,
14
+ "eval_samples_per_second": 8.945,
15
+ "eval_steps_per_second": 1.118
16
+ }
runs/Aug11_15-24-00_action-graph-trainer/events.out.tfevents.1723408324.action-graph-trainer.2255898.1 ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ed10c075192166c6d31b6d373a21955ce6fd56415ad0c7c6f06d27737950f335
3
+ size 828