JoshMe1 commited on
Commit
10b8295
·
verified ·
1 Parent(s): 763c993

Training in progress, step 900, checkpoint

Browse files
last-checkpoint/adapter_model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:2832f221e37c6a3eeb8a9283c4222adee164d6d339ef6eaf73a3b12eec12154b
3
  size 1342238560
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:db1070c39138d303d014ee04d80d8e9b75566e98b6e55f455c9f6af350c449d5
3
  size 1342238560
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:9991802a5016ab59805bfe886a37d8bca3f29ff422db8205e7f63a9d674e12d0
3
  size 682101844
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b6a91d80bf6853bf5303bd48ab60dd8aaec58e331157f7790b89def661e052db
3
  size 682101844
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:246ca084214dc27b5762653dde5a6251678dabf4b1880f62d528a3b22fc7e637
3
  size 1064
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0fe463bd95a539e2431433bae454f0af2aa8fc5e311c1d9add289b543af3fd1e
3
  size 1064
last-checkpoint/trainer_state.json CHANGED
@@ -1,9 +1,9 @@
1
  {
2
  "best_metric": null,
3
  "best_model_checkpoint": null,
4
- "epoch": 0.058164897484368185,
5
  "eval_steps": 500,
6
- "global_step": 800,
7
  "is_hyper_param_search": false,
8
  "is_local_process_zero": true,
9
  "is_world_process_zero": true,
@@ -12007,6 +12007,1506 @@
12007
  "rewards/margins": 11.669793128967285,
12008
  "rewards/rejected": -12.351922988891602,
12009
  "step": 800
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
12010
  }
12011
  ],
12012
  "logging_steps": 1,
 
1
  {
2
  "best_metric": null,
3
  "best_model_checkpoint": null,
4
+ "epoch": 0.06543550966991421,
5
  "eval_steps": 500,
6
+ "global_step": 900,
7
  "is_hyper_param_search": false,
8
  "is_local_process_zero": true,
9
  "is_world_process_zero": true,
 
12007
  "rewards/margins": 11.669793128967285,
12008
  "rewards/rejected": -12.351922988891602,
12009
  "step": 800
12010
+ },
12011
+ {
12012
+ "epoch": 0.05823760360622365,
12013
+ "grad_norm": 0.00048234008136205375,
12014
+ "learning_rate": 1.1585823820323843e-07,
12015
+ "logits/chosen": -0.9287376999855042,
12016
+ "logits/rejected": -0.9042397141456604,
12017
+ "logps/chosen": -38.81523132324219,
12018
+ "logps/rejected": -222.84970092773438,
12019
+ "loss": 0.0,
12020
+ "rewards/accuracies": 1.0,
12021
+ "rewards/chosen": -0.6534671187400818,
12022
+ "rewards/margins": 14.314355850219727,
12023
+ "rewards/rejected": -14.967823028564453,
12024
+ "step": 801
12025
+ },
12026
+ {
12027
+ "epoch": 0.0583103097280791,
12028
+ "grad_norm": 0.002243852009996772,
12029
+ "learning_rate": 1.1474337861210543e-07,
12030
+ "logits/chosen": -0.8509057760238647,
12031
+ "logits/rejected": -0.9152532815933228,
12032
+ "logps/chosen": -26.429950714111328,
12033
+ "logps/rejected": -204.90780639648438,
12034
+ "loss": 0.0,
12035
+ "rewards/accuracies": 1.0,
12036
+ "rewards/chosen": 0.11170566827058792,
12037
+ "rewards/margins": 13.521089553833008,
12038
+ "rewards/rejected": -13.409383773803711,
12039
+ "step": 802
12040
+ },
12041
+ {
12042
+ "epoch": 0.058383015849934564,
12043
+ "grad_norm": 0.0032597933895885944,
12044
+ "learning_rate": 1.1363321325132447e-07,
12045
+ "logits/chosen": -0.9146807193756104,
12046
+ "logits/rejected": -0.8599616289138794,
12047
+ "logps/chosen": -31.674413681030273,
12048
+ "logps/rejected": -211.09364318847656,
12049
+ "loss": 0.0,
12050
+ "rewards/accuracies": 1.0,
12051
+ "rewards/chosen": -0.3697732090950012,
12052
+ "rewards/margins": 13.578716278076172,
12053
+ "rewards/rejected": -13.948490142822266,
12054
+ "step": 803
12055
+ },
12056
+ {
12057
+ "epoch": 0.058455721971790026,
12058
+ "grad_norm": 0.01021889504045248,
12059
+ "learning_rate": 1.1252775564791023e-07,
12060
+ "logits/chosen": -0.9616813063621521,
12061
+ "logits/rejected": -0.8500020503997803,
12062
+ "logps/chosen": -34.90496063232422,
12063
+ "logps/rejected": -212.93182373046875,
12064
+ "loss": 0.0001,
12065
+ "rewards/accuracies": 1.0,
12066
+ "rewards/chosen": -0.4326817989349365,
12067
+ "rewards/margins": 12.21169376373291,
12068
+ "rewards/rejected": -12.64437484741211,
12069
+ "step": 804
12070
+ },
12071
+ {
12072
+ "epoch": 0.05852842809364549,
12073
+ "grad_norm": 0.001362229697406292,
12074
+ "learning_rate": 1.1142701927151454e-07,
12075
+ "logits/chosen": -0.9080723524093628,
12076
+ "logits/rejected": -0.8339279890060425,
12077
+ "logps/chosen": -29.448078155517578,
12078
+ "logps/rejected": -211.43698120117188,
12079
+ "loss": 0.0,
12080
+ "rewards/accuracies": 1.0,
12081
+ "rewards/chosen": -0.2312290072441101,
12082
+ "rewards/margins": 13.829044342041016,
12083
+ "rewards/rejected": -14.060272216796875,
12084
+ "step": 805
12085
+ },
12086
+ {
12087
+ "epoch": 0.05860113421550094,
12088
+ "grad_norm": 0.004242802504450083,
12089
+ "learning_rate": 1.1033101753426282e-07,
12090
+ "logits/chosen": -0.879481315612793,
12091
+ "logits/rejected": -0.8717973232269287,
12092
+ "logps/chosen": -38.24034118652344,
12093
+ "logps/rejected": -212.5565185546875,
12094
+ "loss": 0.0001,
12095
+ "rewards/accuracies": 1.0,
12096
+ "rewards/chosen": -0.9230182766914368,
12097
+ "rewards/margins": 13.294149398803711,
12098
+ "rewards/rejected": -14.217167854309082,
12099
+ "step": 806
12100
+ },
12101
+ {
12102
+ "epoch": 0.058673840337356405,
12103
+ "grad_norm": 0.04330221191048622,
12104
+ "learning_rate": 1.0923976379059058e-07,
12105
+ "logits/chosen": -0.9548594355583191,
12106
+ "logits/rejected": -0.9365129470825195,
12107
+ "logps/chosen": -35.17864990234375,
12108
+ "logps/rejected": -214.065185546875,
12109
+ "loss": 0.0002,
12110
+ "rewards/accuracies": 1.0,
12111
+ "rewards/chosen": -0.6930069923400879,
12112
+ "rewards/margins": 13.262189865112305,
12113
+ "rewards/rejected": -13.95519733428955,
12114
+ "step": 807
12115
+ },
12116
+ {
12117
+ "epoch": 0.05874654645921187,
12118
+ "grad_norm": 0.009361770935356617,
12119
+ "learning_rate": 1.0815327133708013e-07,
12120
+ "logits/chosen": -0.8962414264678955,
12121
+ "logits/rejected": -0.8303819894790649,
12122
+ "logps/chosen": -34.687705993652344,
12123
+ "logps/rejected": -208.5323486328125,
12124
+ "loss": 0.0001,
12125
+ "rewards/accuracies": 1.0,
12126
+ "rewards/chosen": -0.5704749226570129,
12127
+ "rewards/margins": 11.914556503295898,
12128
+ "rewards/rejected": -12.485031127929688,
12129
+ "step": 808
12130
+ },
12131
+ {
12132
+ "epoch": 0.05881925258106733,
12133
+ "grad_norm": 0.0003296321665402502,
12134
+ "learning_rate": 1.07071553412299e-07,
12135
+ "logits/chosen": -0.8962920904159546,
12136
+ "logits/rejected": -0.8763982057571411,
12137
+ "logps/chosen": -35.05188751220703,
12138
+ "logps/rejected": -221.94332885742188,
12139
+ "loss": 0.0,
12140
+ "rewards/accuracies": 1.0,
12141
+ "rewards/chosen": -0.7444876432418823,
12142
+ "rewards/margins": 15.131348609924316,
12143
+ "rewards/rejected": -15.875836372375488,
12144
+ "step": 809
12145
+ },
12146
+ {
12147
+ "epoch": 0.058891958702922784,
12148
+ "grad_norm": 0.002917770529165864,
12149
+ "learning_rate": 1.0599462319663904e-07,
12150
+ "logits/chosen": -0.8972420692443848,
12151
+ "logits/rejected": -0.8533855676651001,
12152
+ "logps/chosen": -37.614925384521484,
12153
+ "logps/rejected": -216.18870544433594,
12154
+ "loss": 0.0,
12155
+ "rewards/accuracies": 1.0,
12156
+ "rewards/chosen": -0.5269683003425598,
12157
+ "rewards/margins": 13.62031364440918,
12158
+ "rewards/rejected": -14.147282600402832,
12159
+ "step": 810
12160
+ },
12161
+ {
12162
+ "epoch": 0.058964664824778246,
12163
+ "grad_norm": 0.013271240517497063,
12164
+ "learning_rate": 1.0492249381215478e-07,
12165
+ "logits/chosen": -0.9354763031005859,
12166
+ "logits/rejected": -0.850922703742981,
12167
+ "logps/chosen": -31.526691436767578,
12168
+ "logps/rejected": -211.07916259765625,
12169
+ "loss": 0.0002,
12170
+ "rewards/accuracies": 1.0,
12171
+ "rewards/chosen": -0.21681064367294312,
12172
+ "rewards/margins": 14.02525520324707,
12173
+ "rewards/rejected": -14.2420654296875,
12174
+ "step": 811
12175
+ },
12176
+ {
12177
+ "epoch": 0.05903737094663371,
12178
+ "grad_norm": 0.00019169447477906942,
12179
+ "learning_rate": 1.038551783224047e-07,
12180
+ "logits/chosen": -0.8981155753135681,
12181
+ "logits/rejected": -0.9153207540512085,
12182
+ "logps/chosen": -26.782726287841797,
12183
+ "logps/rejected": -218.28050231933594,
12184
+ "loss": 0.0,
12185
+ "rewards/accuracies": 1.0,
12186
+ "rewards/chosen": -0.27815234661102295,
12187
+ "rewards/margins": 14.644554138183594,
12188
+ "rewards/rejected": -14.922707557678223,
12189
+ "step": 812
12190
+ },
12191
+ {
12192
+ "epoch": 0.05911007706848917,
12193
+ "grad_norm": 0.00047361120232380927,
12194
+ "learning_rate": 1.0279268973229088e-07,
12195
+ "logits/chosen": -0.9290183782577515,
12196
+ "logits/rejected": -0.9105781316757202,
12197
+ "logps/chosen": -32.31972885131836,
12198
+ "logps/rejected": -218.17587280273438,
12199
+ "loss": 0.0,
12200
+ "rewards/accuracies": 1.0,
12201
+ "rewards/chosen": -0.4362805187702179,
12202
+ "rewards/margins": 14.452142715454102,
12203
+ "rewards/rejected": -14.888423919677734,
12204
+ "step": 813
12205
+ },
12206
+ {
12207
+ "epoch": 0.059182783190344625,
12208
+ "grad_norm": 0.0064282529056072235,
12209
+ "learning_rate": 1.0173504098790186e-07,
12210
+ "logits/chosen": -0.7782235145568848,
12211
+ "logits/rejected": -0.7675794363021851,
12212
+ "logps/chosen": -36.16889953613281,
12213
+ "logps/rejected": -212.2026824951172,
12214
+ "loss": 0.0001,
12215
+ "rewards/accuracies": 1.0,
12216
+ "rewards/chosen": -0.42383480072021484,
12217
+ "rewards/margins": 13.097190856933594,
12218
+ "rewards/rejected": -13.521025657653809,
12219
+ "step": 814
12220
+ },
12221
+ {
12222
+ "epoch": 0.05925548931220009,
12223
+ "grad_norm": 0.003953695762902498,
12224
+ "learning_rate": 1.0068224497635369e-07,
12225
+ "logits/chosen": -0.9118982553482056,
12226
+ "logits/rejected": -0.8721450567245483,
12227
+ "logps/chosen": -37.163360595703125,
12228
+ "logps/rejected": -210.713623046875,
12229
+ "loss": 0.0001,
12230
+ "rewards/accuracies": 1.0,
12231
+ "rewards/chosen": -0.5497003793716431,
12232
+ "rewards/margins": 12.541065216064453,
12233
+ "rewards/rejected": -13.090764999389648,
12234
+ "step": 815
12235
+ },
12236
+ {
12237
+ "epoch": 0.05932819543405555,
12238
+ "grad_norm": 0.009218167513608932,
12239
+ "learning_rate": 9.963431452563331e-08,
12240
+ "logits/chosen": -0.9565808773040771,
12241
+ "logits/rejected": -0.9447869658470154,
12242
+ "logps/chosen": -32.80500030517578,
12243
+ "logps/rejected": -213.85301208496094,
12244
+ "loss": 0.0001,
12245
+ "rewards/accuracies": 1.0,
12246
+ "rewards/chosen": -0.3509596288204193,
12247
+ "rewards/margins": 13.14822006225586,
12248
+ "rewards/rejected": -13.49917984008789,
12249
+ "step": 816
12250
+ },
12251
+ {
12252
+ "epoch": 0.05940090155591101,
12253
+ "grad_norm": 0.0003960712347179651,
12254
+ "learning_rate": 9.859126240444282e-08,
12255
+ "logits/chosen": -0.9183976650238037,
12256
+ "logits/rejected": -0.8882307410240173,
12257
+ "logps/chosen": -31.947101593017578,
12258
+ "logps/rejected": -210.08815002441406,
12259
+ "loss": 0.0,
12260
+ "rewards/accuracies": 1.0,
12261
+ "rewards/chosen": -0.35045450925827026,
12262
+ "rewards/margins": 13.729374885559082,
12263
+ "rewards/rejected": -14.079830169677734,
12264
+ "step": 817
12265
+ },
12266
+ {
12267
+ "epoch": 0.059473607677766466,
12268
+ "grad_norm": 0.011877443641424179,
12269
+ "learning_rate": 9.755310132204297e-08,
12270
+ "logits/chosen": -0.9917686581611633,
12271
+ "logits/rejected": -0.8296844959259033,
12272
+ "logps/chosen": -40.909507751464844,
12273
+ "logps/rejected": -210.73818969726562,
12274
+ "loss": 0.0001,
12275
+ "rewards/accuracies": 1.0,
12276
+ "rewards/chosen": -0.7189110517501831,
12277
+ "rewards/margins": 12.688089370727539,
12278
+ "rewards/rejected": -13.407000541687012,
12279
+ "step": 818
12280
+ },
12281
+ {
12282
+ "epoch": 0.05954631379962193,
12283
+ "grad_norm": 0.006271880120038986,
12284
+ "learning_rate": 9.651984392809914e-08,
12285
+ "logits/chosen": -0.8329911828041077,
12286
+ "logits/rejected": -0.8136376142501831,
12287
+ "logps/chosen": -35.143775939941406,
12288
+ "logps/rejected": -204.38739013671875,
12289
+ "loss": 0.0001,
12290
+ "rewards/accuracies": 1.0,
12291
+ "rewards/chosen": -0.4343762993812561,
12292
+ "rewards/margins": 13.196807861328125,
12293
+ "rewards/rejected": -13.631185531616211,
12294
+ "step": 819
12295
+ },
12296
+ {
12297
+ "epoch": 0.05961901992147739,
12298
+ "grad_norm": 0.0015030940994620323,
12299
+ "learning_rate": 9.549150281252632e-08,
12300
+ "logits/chosen": -0.8846481442451477,
12301
+ "logits/rejected": -0.9285573363304138,
12302
+ "logps/chosen": -35.889747619628906,
12303
+ "logps/rejected": -213.53724670410156,
12304
+ "loss": 0.0,
12305
+ "rewards/accuracies": 1.0,
12306
+ "rewards/chosen": -0.49309369921684265,
12307
+ "rewards/margins": 13.477800369262695,
12308
+ "rewards/rejected": -13.970893859863281,
12309
+ "step": 820
12310
+ },
12311
+ {
12312
+ "epoch": 0.05969172604333285,
12313
+ "grad_norm": 0.0029090552125126123,
12314
+ "learning_rate": 9.446809050533678e-08,
12315
+ "logits/chosen": -0.8734315633773804,
12316
+ "logits/rejected": -0.8346052169799805,
12317
+ "logps/chosen": -42.2322998046875,
12318
+ "logps/rejected": -208.023681640625,
12319
+ "loss": 0.0,
12320
+ "rewards/accuracies": 1.0,
12321
+ "rewards/chosen": -0.7172924876213074,
12322
+ "rewards/margins": 13.537714004516602,
12323
+ "rewards/rejected": -14.255006790161133,
12324
+ "step": 821
12325
+ },
12326
+ {
12327
+ "epoch": 0.05976443216518831,
12328
+ "grad_norm": 0.002488103462383151,
12329
+ "learning_rate": 9.344961947648622e-08,
12330
+ "logits/chosen": -0.9814305305480957,
12331
+ "logits/rejected": -0.841217041015625,
12332
+ "logps/chosen": -30.454376220703125,
12333
+ "logps/rejected": -207.29879760742188,
12334
+ "loss": 0.0,
12335
+ "rewards/accuracies": 1.0,
12336
+ "rewards/chosen": -0.2472071498632431,
12337
+ "rewards/margins": 12.674690246582031,
12338
+ "rewards/rejected": -12.921897888183594,
12339
+ "step": 822
12340
+ },
12341
+ {
12342
+ "epoch": 0.05983713828704377,
12343
+ "grad_norm": 0.002519387984648347,
12344
+ "learning_rate": 9.243610213572284e-08,
12345
+ "logits/chosen": -0.9013311862945557,
12346
+ "logits/rejected": -0.8516749739646912,
12347
+ "logps/chosen": -31.57420539855957,
12348
+ "logps/rejected": -213.44784545898438,
12349
+ "loss": 0.0,
12350
+ "rewards/accuracies": 1.0,
12351
+ "rewards/chosen": -0.23320429027080536,
12352
+ "rewards/margins": 13.484821319580078,
12353
+ "rewards/rejected": -13.718025207519531,
12354
+ "step": 823
12355
+ },
12356
+ {
12357
+ "epoch": 0.05990984440889923,
12358
+ "grad_norm": 0.04156282916665077,
12359
+ "learning_rate": 9.142755083243575e-08,
12360
+ "logits/chosen": -0.9548500776290894,
12361
+ "logits/rejected": -0.8840470314025879,
12362
+ "logps/chosen": -35.11345672607422,
12363
+ "logps/rejected": -199.01788330078125,
12364
+ "loss": 0.0005,
12365
+ "rewards/accuracies": 1.0,
12366
+ "rewards/chosen": -0.41137468814849854,
12367
+ "rewards/margins": 11.84408187866211,
12368
+ "rewards/rejected": -12.255456924438477,
12369
+ "step": 824
12370
+ },
12371
+ {
12372
+ "epoch": 0.05998255053075469,
12373
+ "grad_norm": 0.003949024248868227,
12374
+ "learning_rate": 9.042397785550404e-08,
12375
+ "logits/chosen": -0.8854993581771851,
12376
+ "logits/rejected": -0.7998782396316528,
12377
+ "logps/chosen": -34.553802490234375,
12378
+ "logps/rejected": -208.09466552734375,
12379
+ "loss": 0.0001,
12380
+ "rewards/accuracies": 1.0,
12381
+ "rewards/chosen": -0.7249510884284973,
12382
+ "rewards/margins": 13.005220413208008,
12383
+ "rewards/rejected": -13.730171203613281,
12384
+ "step": 825
12385
+ },
12386
+ {
12387
+ "epoch": 0.06005525665261015,
12388
+ "grad_norm": 0.00026854078168980777,
12389
+ "learning_rate": 8.942539543314798e-08,
12390
+ "logits/chosen": -0.843517005443573,
12391
+ "logits/rejected": -0.9094403982162476,
12392
+ "logps/chosen": -42.31779479980469,
12393
+ "logps/rejected": -213.2200164794922,
12394
+ "loss": 0.0,
12395
+ "rewards/accuracies": 1.0,
12396
+ "rewards/chosen": -0.9826798439025879,
12397
+ "rewards/margins": 13.873092651367188,
12398
+ "rewards/rejected": -14.855772972106934,
12399
+ "step": 826
12400
+ },
12401
+ {
12402
+ "epoch": 0.06012796277446561,
12403
+ "grad_norm": 0.0023174339439719915,
12404
+ "learning_rate": 8.843181573277903e-08,
12405
+ "logits/chosen": -1.0254926681518555,
12406
+ "logits/rejected": -0.9478312730789185,
12407
+ "logps/chosen": -28.260574340820312,
12408
+ "logps/rejected": -208.76150512695312,
12409
+ "loss": 0.0,
12410
+ "rewards/accuracies": 1.0,
12411
+ "rewards/chosen": 0.12190592288970947,
12412
+ "rewards/margins": 12.439874649047852,
12413
+ "rewards/rejected": -12.317968368530273,
12414
+ "step": 827
12415
+ },
12416
+ {
12417
+ "epoch": 0.06020066889632107,
12418
+ "grad_norm": 0.0013523934176191688,
12419
+ "learning_rate": 8.744325086085247e-08,
12420
+ "logits/chosen": -0.9789197444915771,
12421
+ "logits/rejected": -0.8955248594284058,
12422
+ "logps/chosen": -28.94500160217285,
12423
+ "logps/rejected": -212.00112915039062,
12424
+ "loss": 0.0,
12425
+ "rewards/accuracies": 1.0,
12426
+ "rewards/chosen": -0.0602029412984848,
12427
+ "rewards/margins": 14.344179153442383,
12428
+ "rewards/rejected": -14.40438175201416,
12429
+ "step": 828
12430
+ },
12431
+ {
12432
+ "epoch": 0.060273375018176534,
12433
+ "grad_norm": 0.0018464912427589297,
12434
+ "learning_rate": 8.645971286271903e-08,
12435
+ "logits/chosen": -1.004629373550415,
12436
+ "logits/rejected": -0.9347493648529053,
12437
+ "logps/chosen": -32.38956069946289,
12438
+ "logps/rejected": -208.96865844726562,
12439
+ "loss": 0.0,
12440
+ "rewards/accuracies": 1.0,
12441
+ "rewards/chosen": -0.5599470734596252,
12442
+ "rewards/margins": 13.54710578918457,
12443
+ "rewards/rejected": -14.107051849365234,
12444
+ "step": 829
12445
+ },
12446
+ {
12447
+ "epoch": 0.06034608114003199,
12448
+ "grad_norm": 0.005679186433553696,
12449
+ "learning_rate": 8.548121372247919e-08,
12450
+ "logits/chosen": -0.9179498553276062,
12451
+ "logits/rejected": -0.8190484046936035,
12452
+ "logps/chosen": -27.20296859741211,
12453
+ "logps/rejected": -216.39215087890625,
12454
+ "loss": 0.0001,
12455
+ "rewards/accuracies": 1.0,
12456
+ "rewards/chosen": -0.13396206498146057,
12457
+ "rewards/margins": 13.646373748779297,
12458
+ "rewards/rejected": -13.780335426330566,
12459
+ "step": 830
12460
+ },
12461
+ {
12462
+ "epoch": 0.06041878726188745,
12463
+ "grad_norm": 0.0004011060227639973,
12464
+ "learning_rate": 8.450776536283593e-08,
12465
+ "logits/chosen": -0.9138544201850891,
12466
+ "logits/rejected": -0.8859550952911377,
12467
+ "logps/chosen": -38.815269470214844,
12468
+ "logps/rejected": -215.1049041748047,
12469
+ "loss": 0.0,
12470
+ "rewards/accuracies": 1.0,
12471
+ "rewards/chosen": -0.5459855198860168,
12472
+ "rewards/margins": 14.472180366516113,
12473
+ "rewards/rejected": -15.018165588378906,
12474
+ "step": 831
12475
+ },
12476
+ {
12477
+ "epoch": 0.06049149338374291,
12478
+ "grad_norm": 0.002478076843544841,
12479
+ "learning_rate": 8.353937964495028e-08,
12480
+ "logits/chosen": -0.9330829977989197,
12481
+ "logits/rejected": -0.8788319230079651,
12482
+ "logps/chosen": -51.765167236328125,
12483
+ "logps/rejected": -226.31045532226562,
12484
+ "loss": 0.0,
12485
+ "rewards/accuracies": 1.0,
12486
+ "rewards/chosen": -1.417904019355774,
12487
+ "rewards/margins": 14.171648979187012,
12488
+ "rewards/rejected": -15.589553833007812,
12489
+ "step": 832
12490
+ },
12491
+ {
12492
+ "epoch": 0.060564199505598375,
12493
+ "grad_norm": 0.003257776377722621,
12494
+ "learning_rate": 8.257606836829677e-08,
12495
+ "logits/chosen": -0.8976417779922485,
12496
+ "logits/rejected": -0.8416788578033447,
12497
+ "logps/chosen": -34.378883361816406,
12498
+ "logps/rejected": -211.79849243164062,
12499
+ "loss": 0.0,
12500
+ "rewards/accuracies": 1.0,
12501
+ "rewards/chosen": -0.29891371726989746,
12502
+ "rewards/margins": 12.301176071166992,
12503
+ "rewards/rejected": -12.600090026855469,
12504
+ "step": 833
12505
+ },
12506
+ {
12507
+ "epoch": 0.06063690562745383,
12508
+ "grad_norm": 0.0030980699229985476,
12509
+ "learning_rate": 8.161784327051919e-08,
12510
+ "logits/chosen": -0.8809930086135864,
12511
+ "logits/rejected": -0.9168920516967773,
12512
+ "logps/chosen": -41.41750717163086,
12513
+ "logps/rejected": -215.60800170898438,
12514
+ "loss": 0.0,
12515
+ "rewards/accuracies": 1.0,
12516
+ "rewards/chosen": -0.5576534867286682,
12517
+ "rewards/margins": 13.368885040283203,
12518
+ "rewards/rejected": -13.926538467407227,
12519
+ "step": 834
12520
+ },
12521
+ {
12522
+ "epoch": 0.06070961174930929,
12523
+ "grad_norm": 0.01704149879515171,
12524
+ "learning_rate": 8.066471602728803e-08,
12525
+ "logits/chosen": -0.9516491889953613,
12526
+ "logits/rejected": -0.8884276151657104,
12527
+ "logps/chosen": -37.34577560424805,
12528
+ "logps/rejected": -209.8350067138672,
12529
+ "loss": 0.0002,
12530
+ "rewards/accuracies": 1.0,
12531
+ "rewards/chosen": -0.736299991607666,
12532
+ "rewards/margins": 12.734248161315918,
12533
+ "rewards/rejected": -13.470548629760742,
12534
+ "step": 835
12535
+ },
12536
+ {
12537
+ "epoch": 0.060782317871164754,
12538
+ "grad_norm": 0.004049696959555149,
12539
+ "learning_rate": 7.971669825215787e-08,
12540
+ "logits/chosen": -0.9258505702018738,
12541
+ "logits/rejected": -0.8807904720306396,
12542
+ "logps/chosen": -25.67070198059082,
12543
+ "logps/rejected": -200.052978515625,
12544
+ "loss": 0.0001,
12545
+ "rewards/accuracies": 1.0,
12546
+ "rewards/chosen": -0.007871553301811218,
12547
+ "rewards/margins": 12.438920974731445,
12548
+ "rewards/rejected": -12.446792602539062,
12549
+ "step": 836
12550
+ },
12551
+ {
12552
+ "epoch": 0.06085502399302021,
12553
+ "grad_norm": 0.003331885440275073,
12554
+ "learning_rate": 7.877380149642626e-08,
12555
+ "logits/chosen": -0.9025241732597351,
12556
+ "logits/rejected": -0.8243002891540527,
12557
+ "logps/chosen": -40.865509033203125,
12558
+ "logps/rejected": -214.27951049804688,
12559
+ "loss": 0.0,
12560
+ "rewards/accuracies": 1.0,
12561
+ "rewards/chosen": -0.8534423112869263,
12562
+ "rewards/margins": 13.077730178833008,
12563
+ "rewards/rejected": -13.931172370910645,
12564
+ "step": 837
12565
+ },
12566
+ {
12567
+ "epoch": 0.06092773011487567,
12568
+ "grad_norm": 0.0002625905617605895,
12569
+ "learning_rate": 7.783603724899257e-08,
12570
+ "logits/chosen": -0.8887792825698853,
12571
+ "logits/rejected": -0.8686505556106567,
12572
+ "logps/chosen": -37.729591369628906,
12573
+ "logps/rejected": -218.04788208007812,
12574
+ "loss": 0.0,
12575
+ "rewards/accuracies": 1.0,
12576
+ "rewards/chosen": -0.7940793037414551,
12577
+ "rewards/margins": 14.703927993774414,
12578
+ "rewards/rejected": -15.498005867004395,
12579
+ "step": 838
12580
+ },
12581
+ {
12582
+ "epoch": 0.06100043623673113,
12583
+ "grad_norm": 0.011811570264399052,
12584
+ "learning_rate": 7.690341693621805e-08,
12585
+ "logits/chosen": -0.9245173931121826,
12586
+ "logits/rejected": -0.868511438369751,
12587
+ "logps/chosen": -33.1500129699707,
12588
+ "logps/rejected": -206.24111938476562,
12589
+ "loss": 0.0002,
12590
+ "rewards/accuracies": 1.0,
12591
+ "rewards/chosen": -0.374135285615921,
12592
+ "rewards/margins": 12.267215728759766,
12593
+ "rewards/rejected": -12.641351699829102,
12594
+ "step": 839
12595
+ },
12596
+ {
12597
+ "epoch": 0.061073142358586595,
12598
+ "grad_norm": 0.002337161684408784,
12599
+ "learning_rate": 7.597595192178702e-08,
12600
+ "logits/chosen": -0.9276552200317383,
12601
+ "logits/rejected": -0.8024710416793823,
12602
+ "logps/chosen": -34.53630828857422,
12603
+ "logps/rejected": -215.49301147460938,
12604
+ "loss": 0.0,
12605
+ "rewards/accuracies": 1.0,
12606
+ "rewards/chosen": -0.5310240983963013,
12607
+ "rewards/margins": 13.375576972961426,
12608
+ "rewards/rejected": -13.906600952148438,
12609
+ "step": 840
12610
+ },
12611
+ {
12612
+ "epoch": 0.06114584848044205,
12613
+ "grad_norm": 0.01176636852324009,
12614
+ "learning_rate": 7.505365350656811e-08,
12615
+ "logits/chosen": -0.9031511545181274,
12616
+ "logits/rejected": -0.8692529201507568,
12617
+ "logps/chosen": -35.75494384765625,
12618
+ "logps/rejected": -213.64572143554688,
12619
+ "loss": 0.0002,
12620
+ "rewards/accuracies": 1.0,
12621
+ "rewards/chosen": -0.5334094762802124,
12622
+ "rewards/margins": 13.190857887268066,
12623
+ "rewards/rejected": -13.724267959594727,
12624
+ "step": 841
12625
+ },
12626
+ {
12627
+ "epoch": 0.06121855460229751,
12628
+ "grad_norm": 0.000319530488923192,
12629
+ "learning_rate": 7.413653292847616e-08,
12630
+ "logits/chosen": -0.8106807470321655,
12631
+ "logits/rejected": -0.8871402740478516,
12632
+ "logps/chosen": -38.77924346923828,
12633
+ "logps/rejected": -208.69039916992188,
12634
+ "loss": 0.0,
12635
+ "rewards/accuracies": 1.0,
12636
+ "rewards/chosen": -0.6083173751831055,
12637
+ "rewards/margins": 13.612259864807129,
12638
+ "rewards/rejected": -14.220577239990234,
12639
+ "step": 842
12640
+ },
12641
+ {
12642
+ "epoch": 0.061291260724152974,
12643
+ "grad_norm": 0.002737750532105565,
12644
+ "learning_rate": 7.322460136233621e-08,
12645
+ "logits/chosen": -0.9447481036186218,
12646
+ "logits/rejected": -0.892672061920166,
12647
+ "logps/chosen": -33.469573974609375,
12648
+ "logps/rejected": -218.03538513183594,
12649
+ "loss": 0.0,
12650
+ "rewards/accuracies": 1.0,
12651
+ "rewards/chosen": -0.5679317712783813,
12652
+ "rewards/margins": 13.78137493133545,
12653
+ "rewards/rejected": -14.349306106567383,
12654
+ "step": 843
12655
+ },
12656
+ {
12657
+ "epoch": 0.061363966846008436,
12658
+ "grad_norm": 0.005921626929193735,
12659
+ "learning_rate": 7.23178699197467e-08,
12660
+ "logits/chosen": -0.8690047264099121,
12661
+ "logits/rejected": -0.8909629583358765,
12662
+ "logps/chosen": -41.96760559082031,
12663
+ "logps/rejected": -212.00982666015625,
12664
+ "loss": 0.0001,
12665
+ "rewards/accuracies": 1.0,
12666
+ "rewards/chosen": -1.1911203861236572,
12667
+ "rewards/margins": 13.252840042114258,
12668
+ "rewards/rejected": -14.443960189819336,
12669
+ "step": 844
12670
+ },
12671
+ {
12672
+ "epoch": 0.06143667296786389,
12673
+ "grad_norm": 0.0036112836096435785,
12674
+ "learning_rate": 7.141634964894388e-08,
12675
+ "logits/chosen": -0.8395127058029175,
12676
+ "logits/rejected": -0.8488901853561401,
12677
+ "logps/chosen": -38.618865966796875,
12678
+ "logps/rejected": -209.74017333984375,
12679
+ "loss": 0.0,
12680
+ "rewards/accuracies": 1.0,
12681
+ "rewards/chosen": -0.7918221354484558,
12682
+ "rewards/margins": 12.778753280639648,
12683
+ "rewards/rejected": -13.570574760437012,
12684
+ "step": 845
12685
+ },
12686
+ {
12687
+ "epoch": 0.06150937908971935,
12688
+ "grad_norm": 0.010566781274974346,
12689
+ "learning_rate": 7.052005153466778e-08,
12690
+ "logits/chosen": -0.8986787796020508,
12691
+ "logits/rejected": -0.8492857813835144,
12692
+ "logps/chosen": -33.52727508544922,
12693
+ "logps/rejected": -211.01170349121094,
12694
+ "loss": 0.0001,
12695
+ "rewards/accuracies": 1.0,
12696
+ "rewards/chosen": -0.25529420375823975,
12697
+ "rewards/margins": 12.790441513061523,
12698
+ "rewards/rejected": -13.045736312866211,
12699
+ "step": 846
12700
+ },
12701
+ {
12702
+ "epoch": 0.061582085211574815,
12703
+ "grad_norm": 0.004384850617498159,
12704
+ "learning_rate": 6.962898649802822e-08,
12705
+ "logits/chosen": -0.8685309886932373,
12706
+ "logits/rejected": -0.8487534523010254,
12707
+ "logps/chosen": -39.79358673095703,
12708
+ "logps/rejected": -219.06317138671875,
12709
+ "loss": 0.0001,
12710
+ "rewards/accuracies": 1.0,
12711
+ "rewards/chosen": -0.5773910880088806,
12712
+ "rewards/margins": 13.647058486938477,
12713
+ "rewards/rejected": -14.224449157714844,
12714
+ "step": 847
12715
+ },
12716
+ {
12717
+ "epoch": 0.06165479133343028,
12718
+ "grad_norm": 0.00011927230661967769,
12719
+ "learning_rate": 6.874316539637126e-08,
12720
+ "logits/chosen": -0.9644160270690918,
12721
+ "logits/rejected": -0.906198263168335,
12722
+ "logps/chosen": -39.05009460449219,
12723
+ "logps/rejected": -217.9404296875,
12724
+ "loss": 0.0,
12725
+ "rewards/accuracies": 1.0,
12726
+ "rewards/chosen": -0.7079715132713318,
12727
+ "rewards/margins": 14.837966918945312,
12728
+ "rewards/rejected": -15.545938491821289,
12729
+ "step": 848
12730
+ },
12731
+ {
12732
+ "epoch": 0.06172749745528573,
12733
+ "grad_norm": 0.0005644657649099827,
12734
+ "learning_rate": 6.786259902314767e-08,
12735
+ "logits/chosen": -0.9547232389450073,
12736
+ "logits/rejected": -0.8872819542884827,
12737
+ "logps/chosen": -32.344215393066406,
12738
+ "logps/rejected": -214.14027404785156,
12739
+ "loss": 0.0,
12740
+ "rewards/accuracies": 1.0,
12741
+ "rewards/chosen": -0.10444006323814392,
12742
+ "rewards/margins": 14.206622123718262,
12743
+ "rewards/rejected": -14.31106185913086,
12744
+ "step": 849
12745
+ },
12746
+ {
12747
+ "epoch": 0.061800203577141194,
12748
+ "grad_norm": 0.006048460491001606,
12749
+ "learning_rate": 6.698729810778064e-08,
12750
+ "logits/chosen": -0.8742987513542175,
12751
+ "logits/rejected": -0.857744574546814,
12752
+ "logps/chosen": -36.89727783203125,
12753
+ "logps/rejected": -205.7833251953125,
12754
+ "loss": 0.0001,
12755
+ "rewards/accuracies": 1.0,
12756
+ "rewards/chosen": -0.40647146105766296,
12757
+ "rewards/margins": 13.201678276062012,
12758
+ "rewards/rejected": -13.608149528503418,
12759
+ "step": 850
12760
+ },
12761
+ {
12762
+ "epoch": 0.061872909698996656,
12763
+ "grad_norm": 0.0003668160643428564,
12764
+ "learning_rate": 6.611727331553585e-08,
12765
+ "logits/chosen": -0.9632246494293213,
12766
+ "logits/rejected": -0.9273592233657837,
12767
+ "logps/chosen": -27.67076873779297,
12768
+ "logps/rejected": -213.115478515625,
12769
+ "loss": 0.0,
12770
+ "rewards/accuracies": 1.0,
12771
+ "rewards/chosen": -0.2091766595840454,
12772
+ "rewards/margins": 13.761649131774902,
12773
+ "rewards/rejected": -13.9708251953125,
12774
+ "step": 851
12775
+ },
12776
+ {
12777
+ "epoch": 0.06194561582085212,
12778
+ "grad_norm": 0.010656672529876232,
12779
+ "learning_rate": 6.52525352473905e-08,
12780
+ "logits/chosen": -0.9768116474151611,
12781
+ "logits/rejected": -0.93428635597229,
12782
+ "logps/chosen": -32.60914993286133,
12783
+ "logps/rejected": -216.2017822265625,
12784
+ "loss": 0.0001,
12785
+ "rewards/accuracies": 1.0,
12786
+ "rewards/chosen": -0.2603747844696045,
12787
+ "rewards/margins": 14.2334566116333,
12788
+ "rewards/rejected": -14.493831634521484,
12789
+ "step": 852
12790
+ },
12791
+ {
12792
+ "epoch": 0.06201832194270757,
12793
+ "grad_norm": 0.0002745226083789021,
12794
+ "learning_rate": 6.439309443990531e-08,
12795
+ "logits/chosen": -0.964214563369751,
12796
+ "logits/rejected": -0.8941053152084351,
12797
+ "logps/chosen": -33.27979278564453,
12798
+ "logps/rejected": -215.39382934570312,
12799
+ "loss": 0.0,
12800
+ "rewards/accuracies": 1.0,
12801
+ "rewards/chosen": -0.17558620870113373,
12802
+ "rewards/margins": 14.90461540222168,
12803
+ "rewards/rejected": -15.0802001953125,
12804
+ "step": 853
12805
+ },
12806
+ {
12807
+ "epoch": 0.062091028064563035,
12808
+ "grad_norm": 0.0005914793000556529,
12809
+ "learning_rate": 6.353896136509524e-08,
12810
+ "logits/chosen": -0.8854947686195374,
12811
+ "logits/rejected": -0.8601844310760498,
12812
+ "logps/chosen": -38.55859375,
12813
+ "logps/rejected": -207.59486389160156,
12814
+ "loss": 0.0,
12815
+ "rewards/accuracies": 1.0,
12816
+ "rewards/chosen": -0.44349443912506104,
12817
+ "rewards/margins": 13.547721862792969,
12818
+ "rewards/rejected": -13.991215705871582,
12819
+ "step": 854
12820
+ },
12821
+ {
12822
+ "epoch": 0.0621637341864185,
12823
+ "grad_norm": 0.05004807561635971,
12824
+ "learning_rate": 6.269014643030212e-08,
12825
+ "logits/chosen": -0.9444171786308289,
12826
+ "logits/rejected": -0.8744308948516846,
12827
+ "logps/chosen": -28.180923461914062,
12828
+ "logps/rejected": -210.5736083984375,
12829
+ "loss": 0.0001,
12830
+ "rewards/accuracies": 1.0,
12831
+ "rewards/chosen": -0.016716942191123962,
12832
+ "rewards/margins": 12.589879989624023,
12833
+ "rewards/rejected": -12.606595993041992,
12834
+ "step": 855
12835
+ },
12836
+ {
12837
+ "epoch": 0.06223644030827396,
12838
+ "grad_norm": 0.002197504276409745,
12839
+ "learning_rate": 6.184665997806831e-08,
12840
+ "logits/chosen": -0.9766485095024109,
12841
+ "logits/rejected": -0.9080944657325745,
12842
+ "logps/chosen": -32.427574157714844,
12843
+ "logps/rejected": -210.64768981933594,
12844
+ "loss": 0.0,
12845
+ "rewards/accuracies": 1.0,
12846
+ "rewards/chosen": -0.010407708585262299,
12847
+ "rewards/margins": 14.489545822143555,
12848
+ "rewards/rejected": -14.499954223632812,
12849
+ "step": 856
12850
+ },
12851
+ {
12852
+ "epoch": 0.062309146430129414,
12853
+ "grad_norm": 0.001485436107032001,
12854
+ "learning_rate": 6.100851228600973e-08,
12855
+ "logits/chosen": -0.9215723872184753,
12856
+ "logits/rejected": -0.847144365310669,
12857
+ "logps/chosen": -35.548492431640625,
12858
+ "logps/rejected": -210.3443603515625,
12859
+ "loss": 0.0,
12860
+ "rewards/accuracies": 1.0,
12861
+ "rewards/chosen": -0.527469277381897,
12862
+ "rewards/margins": 13.315184593200684,
12863
+ "rewards/rejected": -13.84265422821045,
12864
+ "step": 857
12865
+ },
12866
+ {
12867
+ "epoch": 0.062381852551984876,
12868
+ "grad_norm": 0.002220870926976204,
12869
+ "learning_rate": 6.017571356669182e-08,
12870
+ "logits/chosen": -0.9269384741783142,
12871
+ "logits/rejected": -0.8386276960372925,
12872
+ "logps/chosen": -31.025964736938477,
12873
+ "logps/rejected": -202.34542846679688,
12874
+ "loss": 0.0,
12875
+ "rewards/accuracies": 1.0,
12876
+ "rewards/chosen": -0.42351794242858887,
12877
+ "rewards/margins": 12.572928428649902,
12878
+ "rewards/rejected": -12.99644660949707,
12879
+ "step": 858
12880
+ },
12881
+ {
12882
+ "epoch": 0.06245455867384034,
12883
+ "grad_norm": 0.007875983603298664,
12884
+ "learning_rate": 5.9348273967503916e-08,
12885
+ "logits/chosen": -0.9482343196868896,
12886
+ "logits/rejected": -0.9351887702941895,
12887
+ "logps/chosen": -32.64423751831055,
12888
+ "logps/rejected": -213.67555236816406,
12889
+ "loss": 0.0001,
12890
+ "rewards/accuracies": 1.0,
12891
+ "rewards/chosen": -0.29133155941963196,
12892
+ "rewards/margins": 14.106221199035645,
12893
+ "rewards/rejected": -14.397552490234375,
12894
+ "step": 859
12895
+ },
12896
+ {
12897
+ "epoch": 0.0625272647956958,
12898
+ "grad_norm": 0.0005645692581310868,
12899
+ "learning_rate": 5.8526203570536504e-08,
12900
+ "logits/chosen": -0.9474825859069824,
12901
+ "logits/rejected": -0.8204978108406067,
12902
+ "logps/chosen": -29.63552474975586,
12903
+ "logps/rejected": -214.58128356933594,
12904
+ "loss": 0.0,
12905
+ "rewards/accuracies": 1.0,
12906
+ "rewards/chosen": -0.02821112424135208,
12907
+ "rewards/margins": 14.28672981262207,
12908
+ "rewards/rejected": -14.314940452575684,
12909
+ "step": 860
12910
+ },
12911
+ {
12912
+ "epoch": 0.06259997091755126,
12913
+ "grad_norm": 0.004658716730773449,
12914
+ "learning_rate": 5.770951239245803e-08,
12915
+ "logits/chosen": -0.917488694190979,
12916
+ "logits/rejected": -0.8856992721557617,
12917
+ "logps/chosen": -38.66998291015625,
12918
+ "logps/rejected": -213.24978637695312,
12919
+ "loss": 0.0001,
12920
+ "rewards/accuracies": 1.0,
12921
+ "rewards/chosen": -0.7889727354049683,
12922
+ "rewards/margins": 13.10611343383789,
12923
+ "rewards/rejected": -13.895085334777832,
12924
+ "step": 861
12925
+ },
12926
+ {
12927
+ "epoch": 0.06267267703940672,
12928
+ "grad_norm": 0.003891513915732503,
12929
+ "learning_rate": 5.689821038439263e-08,
12930
+ "logits/chosen": -0.8568642735481262,
12931
+ "logits/rejected": -0.9043086767196655,
12932
+ "logps/chosen": -37.63838577270508,
12933
+ "logps/rejected": -209.49623107910156,
12934
+ "loss": 0.0,
12935
+ "rewards/accuracies": 1.0,
12936
+ "rewards/chosen": -0.8549795150756836,
12937
+ "rewards/margins": 12.97883415222168,
12938
+ "rewards/rejected": -13.833813667297363,
12939
+ "step": 862
12940
+ },
12941
+ {
12942
+ "epoch": 0.06274538316126217,
12943
+ "grad_norm": 0.004181155003607273,
12944
+ "learning_rate": 5.609230743179938e-08,
12945
+ "logits/chosen": -0.9312776923179626,
12946
+ "logits/rejected": -0.8475666642189026,
12947
+ "logps/chosen": -35.78960418701172,
12948
+ "logps/rejected": -212.63760375976562,
12949
+ "loss": 0.0001,
12950
+ "rewards/accuracies": 1.0,
12951
+ "rewards/chosen": -0.5629060864448547,
12952
+ "rewards/margins": 12.891237258911133,
12953
+ "rewards/rejected": -13.454143524169922,
12954
+ "step": 863
12955
+ },
12956
+ {
12957
+ "epoch": 0.06281808928311763,
12958
+ "grad_norm": 0.0028015945572406054,
12959
+ "learning_rate": 5.529181335435124e-08,
12960
+ "logits/chosen": -0.8663648366928101,
12961
+ "logits/rejected": -0.8609052896499634,
12962
+ "logps/chosen": -31.67678451538086,
12963
+ "logps/rejected": -207.86477661132812,
12964
+ "loss": 0.0,
12965
+ "rewards/accuracies": 1.0,
12966
+ "rewards/chosen": -0.23127928376197815,
12967
+ "rewards/margins": 13.272483825683594,
12968
+ "rewards/rejected": -13.503763198852539,
12969
+ "step": 864
12970
+ },
12971
+ {
12972
+ "epoch": 0.0628907954049731,
12973
+ "grad_norm": 0.005344074685126543,
12974
+ "learning_rate": 5.44967379058161e-08,
12975
+ "logits/chosen": -0.8992750644683838,
12976
+ "logits/rejected": -0.9029591083526611,
12977
+ "logps/chosen": -40.26115417480469,
12978
+ "logps/rejected": -214.38668823242188,
12979
+ "loss": 0.0001,
12980
+ "rewards/accuracies": 1.0,
12981
+ "rewards/chosen": -0.843727171421051,
12982
+ "rewards/margins": 13.465059280395508,
12983
+ "rewards/rejected": -14.308786392211914,
12984
+ "step": 865
12985
+ },
12986
+ {
12987
+ "epoch": 0.06296350152682856,
12988
+ "grad_norm": 0.004881809465587139,
12989
+ "learning_rate": 5.37070907739372e-08,
12990
+ "logits/chosen": -0.9818276762962341,
12991
+ "logits/rejected": -0.8388216495513916,
12992
+ "logps/chosen": -34.20466232299805,
12993
+ "logps/rejected": -217.65570068359375,
12994
+ "loss": 0.0001,
12995
+ "rewards/accuracies": 1.0,
12996
+ "rewards/chosen": -0.4291444718837738,
12997
+ "rewards/margins": 11.864551544189453,
12998
+ "rewards/rejected": -12.293695449829102,
12999
+ "step": 866
13000
+ },
13001
+ {
13002
+ "epoch": 0.06303620764868402,
13003
+ "grad_norm": 0.008066492155194283,
13004
+ "learning_rate": 5.292288158031594e-08,
13005
+ "logits/chosen": -1.0302809476852417,
13006
+ "logits/rejected": -0.8648408651351929,
13007
+ "logps/chosen": -34.25592041015625,
13008
+ "logps/rejected": -219.7183837890625,
13009
+ "loss": 0.0001,
13010
+ "rewards/accuracies": 1.0,
13011
+ "rewards/chosen": -0.44313353300094604,
13012
+ "rewards/margins": 13.755355834960938,
13013
+ "rewards/rejected": -14.19848918914795,
13014
+ "step": 867
13015
+ },
13016
+ {
13017
+ "epoch": 0.06310891377053948,
13018
+ "grad_norm": 0.005934158340096474,
13019
+ "learning_rate": 5.2144119880293544e-08,
13020
+ "logits/chosen": -0.8914825916290283,
13021
+ "logits/rejected": -0.820566713809967,
13022
+ "logps/chosen": -26.389057159423828,
13023
+ "logps/rejected": -212.1099853515625,
13024
+ "loss": 0.0001,
13025
+ "rewards/accuracies": 1.0,
13026
+ "rewards/chosen": -0.26406508684158325,
13027
+ "rewards/margins": 13.135456085205078,
13028
+ "rewards/rejected": -13.399520874023438,
13029
+ "step": 868
13030
+ },
13031
+ {
13032
+ "epoch": 0.06318161989239494,
13033
+ "grad_norm": 0.015468381345272064,
13034
+ "learning_rate": 5.137081516283581e-08,
13035
+ "logits/chosen": -0.9736705422401428,
13036
+ "logits/rejected": -0.7925209999084473,
13037
+ "logps/chosen": -33.48400115966797,
13038
+ "logps/rejected": -206.9025115966797,
13039
+ "loss": 0.0002,
13040
+ "rewards/accuracies": 1.0,
13041
+ "rewards/chosen": -0.24499306082725525,
13042
+ "rewards/margins": 12.329083442687988,
13043
+ "rewards/rejected": -12.574075698852539,
13044
+ "step": 869
13045
+ },
13046
+ {
13047
+ "epoch": 0.0632543260142504,
13048
+ "grad_norm": 0.005471958313137293,
13049
+ "learning_rate": 5.060297685041659e-08,
13050
+ "logits/chosen": -0.983143150806427,
13051
+ "logits/rejected": -0.9158498644828796,
13052
+ "logps/chosen": -31.21188735961914,
13053
+ "logps/rejected": -204.966064453125,
13054
+ "loss": 0.0001,
13055
+ "rewards/accuracies": 1.0,
13056
+ "rewards/chosen": -0.3806591331958771,
13057
+ "rewards/margins": 12.467314720153809,
13058
+ "rewards/rejected": -12.847973823547363,
13059
+ "step": 870
13060
+ },
13061
+ {
13062
+ "epoch": 0.06332703213610585,
13063
+ "grad_norm": 0.011555798351764679,
13064
+ "learning_rate": 4.984061429890324e-08,
13065
+ "logits/chosen": -0.9071904420852661,
13066
+ "logits/rejected": -0.8518509864807129,
13067
+ "logps/chosen": -33.272377014160156,
13068
+ "logps/rejected": -211.21652221679688,
13069
+ "loss": 0.0001,
13070
+ "rewards/accuracies": 1.0,
13071
+ "rewards/chosen": -0.43156248331069946,
13072
+ "rewards/margins": 13.359749794006348,
13073
+ "rewards/rejected": -13.791312217712402,
13074
+ "step": 871
13075
+ },
13076
+ {
13077
+ "epoch": 0.06339973825796132,
13078
+ "grad_norm": 0.005020745564252138,
13079
+ "learning_rate": 4.908373679744315e-08,
13080
+ "logits/chosen": -1.003391146659851,
13081
+ "logits/rejected": -0.8913395404815674,
13082
+ "logps/chosen": -34.14504623413086,
13083
+ "logps/rejected": -206.21377563476562,
13084
+ "loss": 0.0001,
13085
+ "rewards/accuracies": 1.0,
13086
+ "rewards/chosen": -0.3934352993965149,
13087
+ "rewards/margins": 12.375293731689453,
13088
+ "rewards/rejected": -12.768728256225586,
13089
+ "step": 872
13090
+ },
13091
+ {
13092
+ "epoch": 0.06347244437981678,
13093
+ "grad_norm": 0.003745915135368705,
13094
+ "learning_rate": 4.833235356834958e-08,
13095
+ "logits/chosen": -0.9667826294898987,
13096
+ "logits/rejected": -0.9095417261123657,
13097
+ "logps/chosen": -36.59027862548828,
13098
+ "logps/rejected": -221.0901336669922,
13099
+ "loss": 0.0001,
13100
+ "rewards/accuracies": 1.0,
13101
+ "rewards/chosen": -0.1525346040725708,
13102
+ "rewards/margins": 14.664800643920898,
13103
+ "rewards/rejected": -14.81733512878418,
13104
+ "step": 873
13105
+ },
13106
+ {
13107
+ "epoch": 0.06354515050167224,
13108
+ "grad_norm": 0.0011890361784026027,
13109
+ "learning_rate": 4.758647376699032e-08,
13110
+ "logits/chosen": -0.9169249534606934,
13111
+ "logits/rejected": -0.8539060354232788,
13112
+ "logps/chosen": -37.6380500793457,
13113
+ "logps/rejected": -212.51040649414062,
13114
+ "loss": 0.0,
13115
+ "rewards/accuracies": 1.0,
13116
+ "rewards/chosen": -0.7034934759140015,
13117
+ "rewards/margins": 13.775259017944336,
13118
+ "rewards/rejected": -14.478752136230469,
13119
+ "step": 874
13120
+ },
13121
+ {
13122
+ "epoch": 0.0636178566235277,
13123
+ "grad_norm": 0.000775835185777396,
13124
+ "learning_rate": 4.684610648167503e-08,
13125
+ "logits/chosen": -0.8775843381881714,
13126
+ "logits/rejected": -0.8956321477890015,
13127
+ "logps/chosen": -37.35170364379883,
13128
+ "logps/rejected": -215.11346435546875,
13129
+ "loss": 0.0,
13130
+ "rewards/accuracies": 1.0,
13131
+ "rewards/chosen": -0.784580647945404,
13132
+ "rewards/margins": 13.627195358276367,
13133
+ "rewards/rejected": -14.411775588989258,
13134
+ "step": 875
13135
+ },
13136
+ {
13137
+ "epoch": 0.06369056274538316,
13138
+ "grad_norm": 0.005996357183903456,
13139
+ "learning_rate": 4.611126073354571e-08,
13140
+ "logits/chosen": -0.860283613204956,
13141
+ "logits/rejected": -0.8795108795166016,
13142
+ "logps/chosen": -38.77946472167969,
13143
+ "logps/rejected": -214.42984008789062,
13144
+ "loss": 0.0001,
13145
+ "rewards/accuracies": 1.0,
13146
+ "rewards/chosen": -0.796995997428894,
13147
+ "rewards/margins": 13.180766105651855,
13148
+ "rewards/rejected": -13.977762222290039,
13149
+ "step": 876
13150
+ },
13151
+ {
13152
+ "epoch": 0.06376326886723863,
13153
+ "grad_norm": 0.008098367601633072,
13154
+ "learning_rate": 4.5381945476465735e-08,
13155
+ "logits/chosen": -0.9040993452072144,
13156
+ "logits/rejected": -0.849277675151825,
13157
+ "logps/chosen": -30.66649627685547,
13158
+ "logps/rejected": -213.02574157714844,
13159
+ "loss": 0.0001,
13160
+ "rewards/accuracies": 1.0,
13161
+ "rewards/chosen": 0.07089868187904358,
13162
+ "rewards/margins": 12.305122375488281,
13163
+ "rewards/rejected": -12.234224319458008,
13164
+ "step": 877
13165
+ },
13166
+ {
13167
+ "epoch": 0.06383597498909409,
13168
+ "grad_norm": 0.014966917224228382,
13169
+ "learning_rate": 4.465816959691149e-08,
13170
+ "logits/chosen": -1.044053316116333,
13171
+ "logits/rejected": -0.8688252568244934,
13172
+ "logps/chosen": -39.691871643066406,
13173
+ "logps/rejected": -213.3199462890625,
13174
+ "loss": 0.0002,
13175
+ "rewards/accuracies": 1.0,
13176
+ "rewards/chosen": -0.5965285897254944,
13177
+ "rewards/margins": 10.999326705932617,
13178
+ "rewards/rejected": -11.595854759216309,
13179
+ "step": 878
13180
+ },
13181
+ {
13182
+ "epoch": 0.06390868111094954,
13183
+ "grad_norm": 0.00389337120577693,
13184
+ "learning_rate": 4.393994191386352e-08,
13185
+ "logits/chosen": -0.8819083571434021,
13186
+ "logits/rejected": -0.8748650550842285,
13187
+ "logps/chosen": -38.830711364746094,
13188
+ "logps/rejected": -212.04507446289062,
13189
+ "loss": 0.0001,
13190
+ "rewards/accuracies": 1.0,
13191
+ "rewards/chosen": -0.9213253855705261,
13192
+ "rewards/margins": 12.269974708557129,
13193
+ "rewards/rejected": -13.191300392150879,
13194
+ "step": 879
13195
+ },
13196
+ {
13197
+ "epoch": 0.063981387232805,
13198
+ "grad_norm": 8.128311310429126e-05,
13199
+ "learning_rate": 4.322727117869951e-08,
13200
+ "logits/chosen": -0.9429582357406616,
13201
+ "logits/rejected": -0.8674257397651672,
13202
+ "logps/chosen": -34.725860595703125,
13203
+ "logps/rejected": -214.15640258789062,
13204
+ "loss": 0.0,
13205
+ "rewards/accuracies": 1.0,
13206
+ "rewards/chosen": -0.5518949031829834,
13207
+ "rewards/margins": 15.001272201538086,
13208
+ "rewards/rejected": -15.553168296813965,
13209
+ "step": 880
13210
+ },
13211
+ {
13212
+ "epoch": 0.06405409335466046,
13213
+ "grad_norm": 0.0008476789225824177,
13214
+ "learning_rate": 4.2520166075087624e-08,
13215
+ "logits/chosen": -0.9395104646682739,
13216
+ "logits/rejected": -0.8900717496871948,
13217
+ "logps/chosen": -27.76080894470215,
13218
+ "logps/rejected": -209.03936767578125,
13219
+ "loss": 0.0,
13220
+ "rewards/accuracies": 1.0,
13221
+ "rewards/chosen": -0.15514400601387024,
13222
+ "rewards/margins": 13.661928176879883,
13223
+ "rewards/rejected": -13.817071914672852,
13224
+ "step": 881
13225
+ },
13226
+ {
13227
+ "epoch": 0.06412679947651592,
13228
+ "grad_norm": 0.0025844499468803406,
13229
+ "learning_rate": 4.181863521888018e-08,
13230
+ "logits/chosen": -0.995636522769928,
13231
+ "logits/rejected": -0.8438848257064819,
13232
+ "logps/chosen": -38.35039520263672,
13233
+ "logps/rejected": -220.33677673339844,
13234
+ "loss": 0.0,
13235
+ "rewards/accuracies": 1.0,
13236
+ "rewards/chosen": -0.35153821110725403,
13237
+ "rewards/margins": 14.15424919128418,
13238
+ "rewards/rejected": -14.505786895751953,
13239
+ "step": 882
13240
+ },
13241
+ {
13242
+ "epoch": 0.06419950559837138,
13243
+ "grad_norm": 0.001683843438513577,
13244
+ "learning_rate": 4.112268715800943e-08,
13245
+ "logits/chosen": -0.9168758392333984,
13246
+ "logits/rejected": -0.8300659656524658,
13247
+ "logps/chosen": -35.08553695678711,
13248
+ "logps/rejected": -212.10479736328125,
13249
+ "loss": 0.0,
13250
+ "rewards/accuracies": 1.0,
13251
+ "rewards/chosen": -0.6151477694511414,
13252
+ "rewards/margins": 13.720037460327148,
13253
+ "rewards/rejected": -14.335184097290039,
13254
+ "step": 883
13255
+ },
13256
+ {
13257
+ "epoch": 0.06427221172022685,
13258
+ "grad_norm": 0.0002436938666505739,
13259
+ "learning_rate": 4.043233037238281e-08,
13260
+ "logits/chosen": -0.9856297969818115,
13261
+ "logits/rejected": -0.8883318901062012,
13262
+ "logps/chosen": -33.0865364074707,
13263
+ "logps/rejected": -215.97259521484375,
13264
+ "loss": 0.0,
13265
+ "rewards/accuracies": 1.0,
13266
+ "rewards/chosen": -0.3266187310218811,
13267
+ "rewards/margins": 14.306659698486328,
13268
+ "rewards/rejected": -14.633277893066406,
13269
+ "step": 884
13270
+ },
13271
+ {
13272
+ "epoch": 0.06434491784208231,
13273
+ "grad_norm": 0.00038230197969824076,
13274
+ "learning_rate": 3.974757327377981e-08,
13275
+ "logits/chosen": -0.898405909538269,
13276
+ "logits/rejected": -0.8910610675811768,
13277
+ "logps/chosen": -36.913841247558594,
13278
+ "logps/rejected": -210.2689971923828,
13279
+ "loss": 0.0,
13280
+ "rewards/accuracies": 1.0,
13281
+ "rewards/chosen": -0.7214539051055908,
13282
+ "rewards/margins": 14.273005485534668,
13283
+ "rewards/rejected": -14.99445915222168,
13284
+ "step": 885
13285
+ },
13286
+ {
13287
+ "epoch": 0.06441762396393777,
13288
+ "grad_norm": 0.008573402650654316,
13289
+ "learning_rate": 3.9068424205749794e-08,
13290
+ "logits/chosen": -0.9435018301010132,
13291
+ "logits/rejected": -0.8671293258666992,
13292
+ "logps/chosen": -35.00514221191406,
13293
+ "logps/rejected": -218.28509521484375,
13294
+ "loss": 0.0001,
13295
+ "rewards/accuracies": 1.0,
13296
+ "rewards/chosen": -0.4492579996585846,
13297
+ "rewards/margins": 14.105907440185547,
13298
+ "rewards/rejected": -14.555166244506836,
13299
+ "step": 886
13300
+ },
13301
+ {
13302
+ "epoch": 0.06449033008579322,
13303
+ "grad_norm": 0.016668081283569336,
13304
+ "learning_rate": 3.839489144350955e-08,
13305
+ "logits/chosen": -0.9791244864463806,
13306
+ "logits/rejected": -0.9481874704360962,
13307
+ "logps/chosen": -36.63296127319336,
13308
+ "logps/rejected": -209.4439697265625,
13309
+ "loss": 0.0002,
13310
+ "rewards/accuracies": 1.0,
13311
+ "rewards/chosen": -0.7272722721099854,
13312
+ "rewards/margins": 13.731389999389648,
13313
+ "rewards/rejected": -14.458662986755371,
13314
+ "step": 887
13315
+ },
13316
+ {
13317
+ "epoch": 0.06456303620764868,
13318
+ "grad_norm": 0.00035227026091888547,
13319
+ "learning_rate": 3.7726983193843485e-08,
13320
+ "logits/chosen": -0.9785500168800354,
13321
+ "logits/rejected": -0.9569947719573975,
13322
+ "logps/chosen": -29.544147491455078,
13323
+ "logps/rejected": -215.77798461914062,
13324
+ "loss": 0.0,
13325
+ "rewards/accuracies": 1.0,
13326
+ "rewards/chosen": -0.13926872611045837,
13327
+ "rewards/margins": 14.384265899658203,
13328
+ "rewards/rejected": -14.523533821105957,
13329
+ "step": 888
13330
+ },
13331
+ {
13332
+ "epoch": 0.06463574232950414,
13333
+ "grad_norm": 0.0024689617566764355,
13334
+ "learning_rate": 3.706470759500263e-08,
13335
+ "logits/chosen": -0.9616410136222839,
13336
+ "logits/rejected": -0.922447681427002,
13337
+ "logps/chosen": -30.809356689453125,
13338
+ "logps/rejected": -206.8951873779297,
13339
+ "loss": 0.0,
13340
+ "rewards/accuracies": 1.0,
13341
+ "rewards/chosen": -0.022951841354370117,
13342
+ "rewards/margins": 12.676582336425781,
13343
+ "rewards/rejected": -12.699533462524414,
13344
+ "step": 889
13345
+ },
13346
+ {
13347
+ "epoch": 0.0647084484513596,
13348
+ "grad_norm": 0.00011276199074927717,
13349
+ "learning_rate": 3.6408072716606345e-08,
13350
+ "logits/chosen": -0.8249759674072266,
13351
+ "logits/rejected": -0.8695921301841736,
13352
+ "logps/chosen": -36.34074401855469,
13353
+ "logps/rejected": -218.12167358398438,
13354
+ "loss": 0.0,
13355
+ "rewards/accuracies": 1.0,
13356
+ "rewards/chosen": -0.6106380820274353,
13357
+ "rewards/margins": 14.810791969299316,
13358
+ "rewards/rejected": -15.421430587768555,
13359
+ "step": 890
13360
+ },
13361
+ {
13362
+ "epoch": 0.06478115457321507,
13363
+ "grad_norm": 0.005838706623762846,
13364
+ "learning_rate": 3.5757086559543236e-08,
13365
+ "logits/chosen": -1.0293669700622559,
13366
+ "logits/rejected": -0.9434897899627686,
13367
+ "logps/chosen": -26.52021026611328,
13368
+ "logps/rejected": -210.0387725830078,
13369
+ "loss": 0.0001,
13370
+ "rewards/accuracies": 1.0,
13371
+ "rewards/chosen": -0.1490568071603775,
13372
+ "rewards/margins": 12.865198135375977,
13373
+ "rewards/rejected": -13.01425552368164,
13374
+ "step": 891
13375
+ },
13376
+ {
13377
+ "epoch": 0.06485386069507053,
13378
+ "grad_norm": 0.004648380447179079,
13379
+ "learning_rate": 3.5111757055874326e-08,
13380
+ "logits/chosen": -0.8273119926452637,
13381
+ "logits/rejected": -0.886111855506897,
13382
+ "logps/chosen": -35.672080993652344,
13383
+ "logps/rejected": -213.85891723632812,
13384
+ "loss": 0.0001,
13385
+ "rewards/accuracies": 1.0,
13386
+ "rewards/chosen": -0.6130844950675964,
13387
+ "rewards/margins": 13.616848945617676,
13388
+ "rewards/rejected": -14.229933738708496,
13389
+ "step": 892
13390
+ },
13391
+ {
13392
+ "epoch": 0.06492656681692599,
13393
+ "grad_norm": 0.002144254045560956,
13394
+ "learning_rate": 3.447209206873591e-08,
13395
+ "logits/chosen": -0.9729441404342651,
13396
+ "logits/rejected": -0.8645864725112915,
13397
+ "logps/chosen": -38.90720748901367,
13398
+ "logps/rejected": -212.21334838867188,
13399
+ "loss": 0.0,
13400
+ "rewards/accuracies": 1.0,
13401
+ "rewards/chosen": -0.7815188765525818,
13402
+ "rewards/margins": 12.436084747314453,
13403
+ "rewards/rejected": -13.21760368347168,
13404
+ "step": 893
13405
+ },
13406
+ {
13407
+ "epoch": 0.06499927293878145,
13408
+ "grad_norm": 0.0015325326239690185,
13409
+ "learning_rate": 3.3838099392243915e-08,
13410
+ "logits/chosen": -0.8757805824279785,
13411
+ "logits/rejected": -0.8313013315200806,
13412
+ "logps/chosen": -35.981407165527344,
13413
+ "logps/rejected": -215.0237579345703,
13414
+ "loss": 0.0,
13415
+ "rewards/accuracies": 1.0,
13416
+ "rewards/chosen": -0.7735263109207153,
13417
+ "rewards/margins": 13.947293281555176,
13418
+ "rewards/rejected": -14.720819473266602,
13419
+ "step": 894
13420
+ },
13421
+ {
13422
+ "epoch": 0.0650719790606369,
13423
+ "grad_norm": 0.008555007167160511,
13424
+ "learning_rate": 3.3209786751399184e-08,
13425
+ "logits/chosen": -0.9840516448020935,
13426
+ "logits/rejected": -0.8736527562141418,
13427
+ "logps/chosen": -33.093833923339844,
13428
+ "logps/rejected": -219.80372619628906,
13429
+ "loss": 0.0001,
13430
+ "rewards/accuracies": 1.0,
13431
+ "rewards/chosen": -0.3639523386955261,
13432
+ "rewards/margins": 13.325874328613281,
13433
+ "rewards/rejected": -13.689826965332031,
13434
+ "step": 895
13435
+ },
13436
+ {
13437
+ "epoch": 0.06514468518249236,
13438
+ "grad_norm": 0.0007325622718781233,
13439
+ "learning_rate": 3.258716180199278e-08,
13440
+ "logits/chosen": -0.9212465286254883,
13441
+ "logits/rejected": -0.9177766442298889,
13442
+ "logps/chosen": -41.11238098144531,
13443
+ "logps/rejected": -215.87216186523438,
13444
+ "loss": 0.0,
13445
+ "rewards/accuracies": 1.0,
13446
+ "rewards/chosen": -0.6314110159873962,
13447
+ "rewards/margins": 13.714380264282227,
13448
+ "rewards/rejected": -14.34579086303711,
13449
+ "step": 896
13450
+ },
13451
+ {
13452
+ "epoch": 0.06521739130434782,
13453
+ "grad_norm": 0.00017639659927226603,
13454
+ "learning_rate": 3.1970232130513367e-08,
13455
+ "logits/chosen": -0.9255086779594421,
13456
+ "logits/rejected": -0.8803011178970337,
13457
+ "logps/chosen": -32.20260238647461,
13458
+ "logps/rejected": -210.572509765625,
13459
+ "loss": 0.0,
13460
+ "rewards/accuracies": 1.0,
13461
+ "rewards/chosen": -0.6896236538887024,
13462
+ "rewards/margins": 14.428664207458496,
13463
+ "rewards/rejected": -15.118288040161133,
13464
+ "step": 897
13465
+ },
13466
+ {
13467
+ "epoch": 0.06529009742620329,
13468
+ "grad_norm": 0.006236107088625431,
13469
+ "learning_rate": 3.135900525405427e-08,
13470
+ "logits/chosen": -0.8336039781570435,
13471
+ "logits/rejected": -0.845130443572998,
13472
+ "logps/chosen": -37.38412094116211,
13473
+ "logps/rejected": -210.4228973388672,
13474
+ "loss": 0.0001,
13475
+ "rewards/accuracies": 1.0,
13476
+ "rewards/chosen": -0.3377266526222229,
13477
+ "rewards/margins": 12.897287368774414,
13478
+ "rewards/rejected": -13.235013961791992,
13479
+ "step": 898
13480
+ },
13481
+ {
13482
+ "epoch": 0.06536280354805875,
13483
+ "grad_norm": 0.0024036304093897343,
13484
+ "learning_rate": 3.0753488620222036e-08,
13485
+ "logits/chosen": -0.8953197002410889,
13486
+ "logits/rejected": -0.8082447052001953,
13487
+ "logps/chosen": -34.03400421142578,
13488
+ "logps/rejected": -204.01040649414062,
13489
+ "loss": 0.0,
13490
+ "rewards/accuracies": 1.0,
13491
+ "rewards/chosen": -0.45378509163856506,
13492
+ "rewards/margins": 13.715612411499023,
13493
+ "rewards/rejected": -14.169397354125977,
13494
+ "step": 899
13495
+ },
13496
+ {
13497
+ "epoch": 0.06543550966991421,
13498
+ "grad_norm": 0.0010786674683913589,
13499
+ "learning_rate": 3.015368960704584e-08,
13500
+ "logits/chosen": -0.9218509197235107,
13501
+ "logits/rejected": -0.8579545021057129,
13502
+ "logps/chosen": -32.49974822998047,
13503
+ "logps/rejected": -215.10537719726562,
13504
+ "loss": 0.0,
13505
+ "rewards/accuracies": 1.0,
13506
+ "rewards/chosen": -0.18748772144317627,
13507
+ "rewards/margins": 14.115120887756348,
13508
+ "rewards/rejected": -14.302607536315918,
13509
+ "step": 900
13510
  }
13511
  ],
13512
  "logging_steps": 1,