File size: 51,061 Bytes
3b84728
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
145
146
147
148
149
150
151
152
153
154
155
156
157
158
159
160
161
162
163
164
165
166
167
168
169
170
171
172
173
174
175
176
177
178
179
180
181
182
183
184
185
186
187
188
189
190
191
192
193
194
195
196
197
198
199
200
201
202
203
204
205
206
207
208
209
210
211
212
213
214
215
216
217
218
219
220
221
222
223
224
225
226
227
228
229
230
231
232
233
234
235
236
237
238
239
240
241
242
243
244
245
246
247
248
249
250
251
252
253
254
255
256
257
258
259
260
261
262
263
264
265
266
267
268
269
270
271
272
273
274
275
276
277
278
279
280
281
282
283
284
285
286
287
288
289
290
291
292
293
294
295
296
297
298
299
300
301
302
303
304
305
306
307
308
309
310
311
312
313
314
315
316
317
318
319
320
321
322
323
324
325
326
327
328
329
330
331
332
333
334
335
336
337
338
339
340
341
342
343
344
345
346
347
348
349
350
351
352
353
354
355
356
357
358
359
360
361
362
363
364
365
366
367
368
369
370
371
372
373
374
375
376
377
378
379
380
381
382
383
384
385
386
387
388
389
390
391
392
393
394
395
396
397
398
399
400
401
402
403
404
405
406
407
408
409
410
411
412
413
414
415
416
417
418
419
420
421
422
423
424
425
426
427
428
429
430
431
432
433
434
435
436
437
438
439
440
441
442
443
444
445
446
447
448
449
450
451
452
453
454
455
456
457
458
459
460
461
462
463
464
465
466
467
468
469
470
471
472
473
474
475
476
477
478
479
480
481
482
483
484
485
486
487
488
489
490
491
492
493
494
495
496
497
498
499
500
501
502
503
504
505
506
507
508
509
510
511
512
513
514
515
516
517
518
519
520
521
522
523
524
525
526
527
528
529
530
531
532
533
534
535
536
537
538
539
540
541
542
543
544
545
546
547
548
549
550
551
552
553
554
555
556
557
558
559
560
561
562
563
564
565
566
567
568
569
570
571
572
573
574
575
576
577
578
579
580
581
582
583
584
585
586
587
588
589
590
591
592
593
594
595
596
597
598
599
600
601
602
603
604
605
606
607
608
609
610
611
612
613
614
615
616
617
618
619
620
621
622
623
624
625
626
627
628
629
630
631
632
633
634
635
636
637
638
639
640
641
642
643
644
645
646
647
648
649
650
651
652
653
654
655
656
657
658
659
660
661
662
663
664
665
666
667
668
669
670
671
672
673
674
675
676
677
678
679
680
681
682
683
684
685
686
687
688
689
690
691
692
693
694
695
696
697
698
699
700
701
702
703
704
705
706
707
708
709
710
711
712
713
714
715
716
717
718
719
720
721
722
723
724
725
726
727
728
729
730
731
732
733
734
735
736
737
738
739
740
741
742
743
744
745
746
747
748
749
750
751
752
753
754
755
756
757
758
759
760
761
762
763
764
765
766
767
768
769
770
771
772
773
774
775
776
777
778
779
780
781
782
783
784
785
786
787
788
789
790
791
792
793
794
795
796
797
798
799
800
801
802
803
804
805
806
807
808
809
810
811
812
813
814
815
816
817
818
819
820
821
822
823
824
825
826
827
828
829
830
831
832
833
834
835
836
837
838
839
840
841
842
843
844
845
846
847
848
849
850
851
852
853
854
855
856
857
858
859
860
861
862
863
864
865
866
867
868
869
870
871
872
873
874
875
876
877
878
879
880
881
882
883
884
885
886
887
888
889
890
891
892
893
894
895
896
897
898
899
900
901
902
903
904
905
906
907
908
909
910
911
912
913
914
915
916
917
918
919
920
921
922
923
924
925
926
927
928
929
930
931
932
933
934
935
936
937
938
939
940
941
942
943
944
945
946
947
948
949
950
951
952
953
954
955
956
957
958
959
960
961
962
963
964
965
966
967
968
969
970
971
972
973
974
975
976
977
978
979
980
981
982
983
984
985
986
987
988
989
990
991
992
993
994
995
996
997
998
999
1000
1001
1002
1003
1004
1005
1006
1007
1008
1009
1010
1011
1012
1013
1014
1015
1016
1017
1018
1019
1020
1021
1022
1023
1024
1025
1026
1027
1028
1029
1030
1031
1032
1033
1034
1035
1036
1037
1038
1039
1040
1041
1042
1043
1044
1045
1046
1047
1048
1049
1050
1051
1052
1053
1054
1055
1056
1057
1058
1059
1060
1061
1062
1063
1064
1065
1066
1067
1068
1069
1070
1071
1072
1073
1074
1075
1076
1077
1078
1079
1080
1081
1082
1083
1084
1085
1086
1087
1088
1089
1090
1091
1092
1093
1094
1095
1096
1097
1098
1099
1100
1101
1102
1103
1104
1105
1106
1107
1108
1109
1110
1111
1112
1113
1114
1115
1116
1117
1118
1119
1120
1121
1122
1123
1124
1125
1126
1127
1128
1129
1130
1131
1132
1133
1134
1135
1136
1137
1138
1139
1140
1141
1142
1143
1144
1145
1146
1147
1148
1149
1150
1151
1152
1153
1154
1155
1156
1157
1158
1159
1160
1161
1162
1163
1164
1165
1166
1167
1168
1169
1170
1171
1172
1173
1174
1175
1176
1177
1178
1179
1180
1181
1182
1183
1184
1185
1186
1187
1188
1189
1190
1191
1192
1193
1194
1195
1196
1197
1198
1199
1200
1201
1202
1203
1204
1205
1206
1207
1208
1209
1210
1211
1212
1213
1214
1215
1216
1217
1218
1219
1220
1221
1222
1223
1224
1225
1226
1227
1228
1229
1230
1231
1232
1233
1234
1235
1236
1237
1238
1239
1240
1241
1242
1243
1244
1245
1246
1247
1248
1249
1250
1251
1252
1253
1254
1255
1256
1257
1258
1259
1260
1261
1262
1263
1264
1265
1266
1267
1268
1269
1270
1271
1272
1273
1274
1275
1276
1277
1278
1279
1280
1281
1282
1283
1284
1285
1286
1287
1288
1289
1290
1291
1292
1293
1294
1295
1296
1297
1298
1299
1300
1301
1302
1303
1304
1305
1306
1307
1308
1309
1310
1311
1312
1313
1314
1315
1316
1317
1318
1319
1320
1321
1322
1323
1324
1325
1326
1327
1328
1329
1330
1331
1332
1333
1334
1335
1336
1337
1338
1339
1340
1341
1342
1343
1344
1345
1346
1347
1348
1349
1350
1351
1352
1353
1354
1355
1356
1357
1358
1359
1360
1361
1362
1363
1364
1365
1366
1367
1368
1369
1370
1371
1372
1373
1374
1375
1376
1377
1378
1379
1380
1381
1382
1383
1384
1385
1386
1387
1388
1389
1390
1391
1392
1393
1394
1395
1396
1397
1398
1399
1400
1401
1402
1403
1404
1405
1406
1407
1408
1409
1410
1411
1412
1413
1414
1415
1416
1417
1418
1419
1420
1421
1422
1423
1424
1425
1426
1427
1428
1429
1430
1431
1432
1433
1434
1435
1436
1437
1438
1439
1440
1441
1442
1443
1444
1445
1446
1447
1448
1449
1450
1451
1452
1453
1454
{
  "best_metric": null,
  "best_model_checkpoint": null,
  "epoch": 0.9987943737441393,
  "eval_steps": 400,
  "global_step": 466,
  "is_hyper_param_search": false,
  "is_local_process_zero": true,
  "is_world_process_zero": true,
  "log_history": [
    {
      "epoch": 0.010716677829872739,
      "grad_norm": 29.249510429058507,
      "learning_rate": 6.382978723404255e-08,
      "logits/chosen": -2.251051187515259,
      "logits/rejected": -2.264390468597412,
      "logps/chosen": -0.5396040678024292,
      "logps/rejected": -0.5402394533157349,
      "loss": 0.9354,
      "rewards/accuracies": 0.4625000059604645,
      "rewards/chosen": -1.3490103483200073,
      "rewards/margins": 0.0015882797306403518,
      "rewards/rejected": -1.3505985736846924,
      "step": 5
    },
    {
      "epoch": 0.021433355659745478,
      "grad_norm": 36.68576810946737,
      "learning_rate": 1.276595744680851e-07,
      "logits/chosen": -2.309072256088257,
      "logits/rejected": -2.2997398376464844,
      "logps/chosen": -0.5611936450004578,
      "logps/rejected": -0.6121688485145569,
      "loss": 0.9177,
      "rewards/accuracies": 0.512499988079071,
      "rewards/chosen": -1.4029841423034668,
      "rewards/margins": 0.1274377852678299,
      "rewards/rejected": -1.5304219722747803,
      "step": 10
    },
    {
      "epoch": 0.032150033489618215,
      "grad_norm": 23.389086490610083,
      "learning_rate": 1.9148936170212767e-07,
      "logits/chosen": -2.273028612136841,
      "logits/rejected": -2.266012668609619,
      "logps/chosen": -0.5351237654685974,
      "logps/rejected": -0.5453787446022034,
      "loss": 0.9125,
      "rewards/accuracies": 0.48750001192092896,
      "rewards/chosen": -1.337809443473816,
      "rewards/margins": 0.025637373328208923,
      "rewards/rejected": -1.3634469509124756,
      "step": 15
    },
    {
      "epoch": 0.042866711319490956,
      "grad_norm": 26.442977869464297,
      "learning_rate": 2.553191489361702e-07,
      "logits/chosen": -2.2774531841278076,
      "logits/rejected": -2.2753357887268066,
      "logps/chosen": -0.5503950119018555,
      "logps/rejected": -0.5687349438667297,
      "loss": 0.9155,
      "rewards/accuracies": 0.518750011920929,
      "rewards/chosen": -1.3759875297546387,
      "rewards/margins": 0.045849647372961044,
      "rewards/rejected": -1.4218370914459229,
      "step": 20
    },
    {
      "epoch": 0.0535833891493637,
      "grad_norm": 66.35150747875342,
      "learning_rate": 3.1914893617021275e-07,
      "logits/chosen": -2.2251861095428467,
      "logits/rejected": -2.2403597831726074,
      "logps/chosen": -0.5069798231124878,
      "logps/rejected": -0.5248810648918152,
      "loss": 0.9068,
      "rewards/accuracies": 0.53125,
      "rewards/chosen": -1.2674493789672852,
      "rewards/margins": 0.04475326091051102,
      "rewards/rejected": -1.3122026920318604,
      "step": 25
    },
    {
      "epoch": 0.06430006697923643,
      "grad_norm": 20.136909917820844,
      "learning_rate": 3.8297872340425535e-07,
      "logits/chosen": -2.320587635040283,
      "logits/rejected": -2.3356595039367676,
      "logps/chosen": -0.5052820444107056,
      "logps/rejected": -0.5284812450408936,
      "loss": 0.8945,
      "rewards/accuracies": 0.4937500059604645,
      "rewards/chosen": -1.2632052898406982,
      "rewards/margins": 0.05799800157546997,
      "rewards/rejected": -1.3212032318115234,
      "step": 30
    },
    {
      "epoch": 0.07501674480910918,
      "grad_norm": 22.295956551832226,
      "learning_rate": 4.4680851063829783e-07,
      "logits/chosen": -2.3342971801757812,
      "logits/rejected": -2.3341243267059326,
      "logps/chosen": -0.4458552300930023,
      "logps/rejected": -0.46673479676246643,
      "loss": 0.907,
      "rewards/accuracies": 0.53125,
      "rewards/chosen": -1.114638090133667,
      "rewards/margins": 0.05219907686114311,
      "rewards/rejected": -1.1668370962142944,
      "step": 35
    },
    {
      "epoch": 0.08573342263898191,
      "grad_norm": 25.40546270134677,
      "learning_rate": 5.106382978723404e-07,
      "logits/chosen": -2.260298252105713,
      "logits/rejected": -2.2865467071533203,
      "logps/chosen": -0.5051068067550659,
      "logps/rejected": -0.5078267455101013,
      "loss": 0.913,
      "rewards/accuracies": 0.48124998807907104,
      "rewards/chosen": -1.2627670764923096,
      "rewards/margins": 0.0067996857687830925,
      "rewards/rejected": -1.2695667743682861,
      "step": 40
    },
    {
      "epoch": 0.09645010046885466,
      "grad_norm": 20.59526753461038,
      "learning_rate": 5.74468085106383e-07,
      "logits/chosen": -2.3363893032073975,
      "logits/rejected": -2.3294222354888916,
      "logps/chosen": -0.4702421724796295,
      "logps/rejected": -0.47650399804115295,
      "loss": 0.8912,
      "rewards/accuracies": 0.5375000238418579,
      "rewards/chosen": -1.1756054162979126,
      "rewards/margins": 0.01565459370613098,
      "rewards/rejected": -1.1912599802017212,
      "step": 45
    },
    {
      "epoch": 0.1071667782987274,
      "grad_norm": 20.748500102546647,
      "learning_rate": 5.999241095449976e-07,
      "logits/chosen": -2.28106427192688,
      "logits/rejected": -2.271512269973755,
      "logps/chosen": -0.44315019249916077,
      "logps/rejected": -0.45686668157577515,
      "loss": 0.8988,
      "rewards/accuracies": 0.48750001192092896,
      "rewards/chosen": -1.1078755855560303,
      "rewards/margins": 0.03429123014211655,
      "rewards/rejected": -1.1421668529510498,
      "step": 50
    },
    {
      "epoch": 0.11788345612860013,
      "grad_norm": 19.009870873426326,
      "learning_rate": 5.994604735812144e-07,
      "logits/chosen": -2.2366268634796143,
      "logits/rejected": -2.241835832595825,
      "logps/chosen": -0.43366914987564087,
      "logps/rejected": -0.4586179852485657,
      "loss": 0.8946,
      "rewards/accuracies": 0.5,
      "rewards/chosen": -1.0841729640960693,
      "rewards/margins": 0.062371958047151566,
      "rewards/rejected": -1.1465450525283813,
      "step": 55
    },
    {
      "epoch": 0.12860013395847286,
      "grad_norm": 23.203626751354562,
      "learning_rate": 5.985760137627685e-07,
      "logits/chosen": -2.315995216369629,
      "logits/rejected": -2.3285701274871826,
      "logps/chosen": -0.41591644287109375,
      "logps/rejected": -0.41194215416908264,
      "loss": 0.8966,
      "rewards/accuracies": 0.4000000059604645,
      "rewards/chosen": -1.0397911071777344,
      "rewards/margins": -0.00993587076663971,
      "rewards/rejected": -1.0298553705215454,
      "step": 60
    },
    {
      "epoch": 0.13931681178834562,
      "grad_norm": 32.13293280731515,
      "learning_rate": 5.972719729975655e-07,
      "logits/chosen": -2.2845652103424072,
      "logits/rejected": -2.28690767288208,
      "logps/chosen": -0.445801317691803,
      "logps/rejected": -0.46892881393432617,
      "loss": 0.8826,
      "rewards/accuracies": 0.5,
      "rewards/chosen": -1.114503264427185,
      "rewards/margins": 0.05781867355108261,
      "rewards/rejected": -1.1723220348358154,
      "step": 65
    },
    {
      "epoch": 0.15003348961821836,
      "grad_norm": 19.802635004741184,
      "learning_rate": 5.955501838194784e-07,
      "logits/chosen": -2.341122627258301,
      "logits/rejected": -2.3415119647979736,
      "logps/chosen": -0.45856913924217224,
      "logps/rejected": -0.48422908782958984,
      "loss": 0.8804,
      "rewards/accuracies": 0.550000011920929,
      "rewards/chosen": -1.1464227437973022,
      "rewards/margins": 0.06414992362260818,
      "rewards/rejected": -1.2105727195739746,
      "step": 70
    },
    {
      "epoch": 0.1607501674480911,
      "grad_norm": 58.32372082218645,
      "learning_rate": 5.934130658131361e-07,
      "logits/chosen": -2.393723249435425,
      "logits/rejected": -2.392512559890747,
      "logps/chosen": -0.4217410981655121,
      "logps/rejected": -0.44666561484336853,
      "loss": 0.8869,
      "rewards/accuracies": 0.5562499761581421,
      "rewards/chosen": -1.0543527603149414,
      "rewards/margins": 0.062311381101608276,
      "rewards/rejected": -1.1166640520095825,
      "step": 75
    },
    {
      "epoch": 0.17146684527796383,
      "grad_norm": 56.05603450876203,
      "learning_rate": 5.908636222137454e-07,
      "logits/chosen": -2.366356372833252,
      "logits/rejected": -2.3545401096343994,
      "logps/chosen": -0.45506396889686584,
      "logps/rejected": -0.4907175600528717,
      "loss": 0.8908,
      "rewards/accuracies": 0.5625,
      "rewards/chosen": -1.137660026550293,
      "rewards/margins": 0.08913394063711166,
      "rewards/rejected": -1.226793885231018,
      "step": 80
    },
    {
      "epoch": 0.18218352310783656,
      "grad_norm": 22.918715482060666,
      "learning_rate": 5.879054356867243e-07,
      "logits/chosen": -2.323024034500122,
      "logits/rejected": -2.3454630374908447,
      "logps/chosen": -0.4257414937019348,
      "logps/rejected": -0.44811034202575684,
      "loss": 0.8902,
      "rewards/accuracies": 0.581250011920929,
      "rewards/chosen": -1.0643537044525146,
      "rewards/margins": 0.05592211335897446,
      "rewards/rejected": -1.120275855064392,
      "step": 85
    },
    {
      "epoch": 0.19290020093770932,
      "grad_norm": 23.755820982731315,
      "learning_rate": 5.84542663293077e-07,
      "logits/chosen": -2.2554306983947754,
      "logits/rejected": -2.2739224433898926,
      "logps/chosen": -0.4565458297729492,
      "logps/rejected": -0.4824085235595703,
      "loss": 0.8901,
      "rewards/accuracies": 0.550000011920929,
      "rewards/chosen": -1.1413648128509521,
      "rewards/margins": 0.06465660035610199,
      "rewards/rejected": -1.2060213088989258,
      "step": 90
    },
    {
      "epoch": 0.20361687876758205,
      "grad_norm": 26.642307306523108,
      "learning_rate": 5.807800306475876e-07,
      "logits/chosen": -2.3598549365997314,
      "logits/rejected": -2.3516011238098145,
      "logps/chosen": -0.4378470778465271,
      "logps/rejected": -0.46984773874282837,
      "loss": 0.8768,
      "rewards/accuracies": 0.550000011920929,
      "rewards/chosen": -1.0946177244186401,
      "rewards/margins": 0.08000145852565765,
      "rewards/rejected": -1.1746193170547485,
      "step": 95
    },
    {
      "epoch": 0.2143335565974548,
      "grad_norm": 23.926674678461634,
      "learning_rate": 5.766228252780373e-07,
      "logits/chosen": -2.3253278732299805,
      "logits/rejected": -2.319993495941162,
      "logps/chosen": -0.4320340156555176,
      "logps/rejected": -0.46014705300331116,
      "loss": 0.8719,
      "rewards/accuracies": 0.59375,
      "rewards/chosen": -1.080085039138794,
      "rewards/margins": 0.07028249651193619,
      "rewards/rejected": -1.1503674983978271,
      "step": 100
    },
    {
      "epoch": 0.22505023442732752,
      "grad_norm": 22.911898773003617,
      "learning_rate": 5.720768891947834e-07,
      "logits/chosen": -2.321719169616699,
      "logits/rejected": -2.326601505279541,
      "logps/chosen": -0.4705447256565094,
      "logps/rejected": -0.48202475905418396,
      "loss": 0.8939,
      "rewards/accuracies": 0.4937500059604645,
      "rewards/chosen": -1.1763617992401123,
      "rewards/margins": 0.028700213879346848,
      "rewards/rejected": -1.2050621509552002,
      "step": 105
    },
    {
      "epoch": 0.23576691225720026,
      "grad_norm": 25.594544362763468,
      "learning_rate": 5.671486106811365e-07,
      "logits/chosen": -2.3048081398010254,
      "logits/rejected": -2.27402925491333,
      "logps/chosen": -0.4883725047111511,
      "logps/rejected": -0.5087730288505554,
      "loss": 0.8707,
      "rewards/accuracies": 0.543749988079071,
      "rewards/chosen": -1.2209315299987793,
      "rewards/margins": 0.05100115388631821,
      "rewards/rejected": -1.271932601928711,
      "step": 110
    },
    {
      "epoch": 0.24648359008707302,
      "grad_norm": 23.437397131282296,
      "learning_rate": 5.618449153160763e-07,
      "logits/chosen": -2.369694232940674,
      "logits/rejected": -2.369485855102539,
      "logps/chosen": -0.44794169068336487,
      "logps/rejected": -0.48357802629470825,
      "loss": 0.8794,
      "rewards/accuracies": 0.518750011920929,
      "rewards/chosen": -1.119854211807251,
      "rewards/margins": 0.08909093588590622,
      "rewards/rejected": -1.2089451551437378,
      "step": 115
    },
    {
      "epoch": 0.2572002679169457,
      "grad_norm": 28.800365419405246,
      "learning_rate": 5.56173256241918e-07,
      "logits/chosen": -2.3669817447662354,
      "logits/rejected": -2.366668939590454,
      "logps/chosen": -0.4651738703250885,
      "logps/rejected": -0.4892265200614929,
      "loss": 0.8779,
      "rewards/accuracies": 0.5562499761581421,
      "rewards/chosen": -1.1629347801208496,
      "rewards/margins": 0.0601315014064312,
      "rewards/rejected": -1.2230660915374756,
      "step": 120
    },
    {
      "epoch": 0.2679169457468185,
      "grad_norm": 35.13610173043825,
      "learning_rate": 5.501416036906106e-07,
      "logits/chosen": -2.3494625091552734,
      "logits/rejected": -2.38095760345459,
      "logps/chosen": -0.4859692454338074,
      "logps/rejected": -0.558917224407196,
      "loss": 0.8577,
      "rewards/accuracies": 0.625,
      "rewards/chosen": -1.2149231433868408,
      "rewards/margins": 0.18236994743347168,
      "rewards/rejected": -1.397293210029602,
      "step": 125
    },
    {
      "epoch": 0.27863362357669125,
      "grad_norm": 26.28884798016681,
      "learning_rate": 5.437584337833803e-07,
      "logits/chosen": -2.4230644702911377,
      "logits/rejected": -2.4166250228881836,
      "logps/chosen": -0.4648096561431885,
      "logps/rejected": -0.5112437009811401,
      "loss": 0.8728,
      "rewards/accuracies": 0.5562499761581421,
      "rewards/chosen": -1.1620242595672607,
      "rewards/margins": 0.11608506739139557,
      "rewards/rejected": -1.2781093120574951,
      "step": 130
    },
    {
      "epoch": 0.289350301406564,
      "grad_norm": 27.195773411297225,
      "learning_rate": 5.370327166194635e-07,
      "logits/chosen": -2.446895122528076,
      "logits/rejected": -2.463573932647705,
      "logps/chosen": -0.4988422393798828,
      "logps/rejected": -0.5768200755119324,
      "loss": 0.8444,
      "rewards/accuracies": 0.6000000238418579,
      "rewards/chosen": -1.2471054792404175,
      "rewards/margins": 0.1949445754289627,
      "rewards/rejected": -1.4420500993728638,
      "step": 135
    },
    {
      "epoch": 0.3000669792364367,
      "grad_norm": 35.79966015406334,
      "learning_rate": 5.299739036706635e-07,
      "logits/chosen": -2.516442060470581,
      "logits/rejected": -2.5362563133239746,
      "logps/chosen": -0.49075254797935486,
      "logps/rejected": -0.5481128692626953,
      "loss": 0.8763,
      "rewards/accuracies": 0.6187499761581421,
      "rewards/chosen": -1.2268813848495483,
      "rewards/margins": 0.1434006243944168,
      "rewards/rejected": -1.3702819347381592,
      "step": 140
    },
    {
      "epoch": 0.31078365706630945,
      "grad_norm": 24.2646267850299,
      "learning_rate": 5.225919144994487e-07,
      "logits/chosen": -2.628758430480957,
      "logits/rejected": -2.6251022815704346,
      "logps/chosen": -0.46407943964004517,
      "logps/rejected": -0.5085667371749878,
      "loss": 0.8491,
      "rewards/accuracies": 0.612500011920929,
      "rewards/chosen": -1.16019868850708,
      "rewards/margins": 0.11121823638677597,
      "rewards/rejected": -1.2714169025421143,
      "step": 145
    },
    {
      "epoch": 0.3215003348961822,
      "grad_norm": 33.77477765917217,
      "learning_rate": 5.148971228192543e-07,
      "logits/chosen": -2.6035284996032715,
      "logits/rejected": -2.586613416671753,
      "logps/chosen": -0.4985392093658447,
      "logps/rejected": -0.5423779487609863,
      "loss": 0.864,
      "rewards/accuracies": 0.6312500238418579,
      "rewards/chosen": -1.2463479042053223,
      "rewards/margins": 0.10959690809249878,
      "rewards/rejected": -1.3559448719024658,
      "step": 150
    },
    {
      "epoch": 0.3322170127260549,
      "grad_norm": 30.465935388881398,
      "learning_rate": 5.069003419165781e-07,
      "logits/chosen": -2.577793836593628,
      "logits/rejected": -2.5910885334014893,
      "logps/chosen": -0.5296048521995544,
      "logps/rejected": -0.5693932175636292,
      "loss": 0.8658,
      "rewards/accuracies": 0.53125,
      "rewards/chosen": -1.324012041091919,
      "rewards/margins": 0.09947088360786438,
      "rewards/rejected": -1.4234830141067505,
      "step": 155
    },
    {
      "epoch": 0.34293369055592765,
      "grad_norm": 28.918479545476277,
      "learning_rate": 4.986128094553569e-07,
      "logits/chosen": -2.5946993827819824,
      "logits/rejected": -2.600921392440796,
      "logps/chosen": -0.49290043115615845,
      "logps/rejected": -0.5163969397544861,
      "loss": 0.8639,
      "rewards/accuracies": 0.550000011920929,
      "rewards/chosen": -1.2322509288787842,
      "rewards/margins": 0.05874127894639969,
      "rewards/rejected": -1.2909923791885376,
      "step": 160
    },
    {
      "epoch": 0.3536503683858004,
      "grad_norm": 22.997466337658558,
      "learning_rate": 4.900461716849745e-07,
      "logits/chosen": -2.5999181270599365,
      "logits/rejected": -2.61159086227417,
      "logps/chosen": -0.4804093837738037,
      "logps/rejected": -0.521051287651062,
      "loss": 0.854,
      "rewards/accuracies": 0.6187499761581421,
      "rewards/chosen": -1.2010235786437988,
      "rewards/margins": 0.10160477459430695,
      "rewards/rejected": -1.3026282787322998,
      "step": 165
    },
    {
      "epoch": 0.3643670462156731,
      "grad_norm": 29.419350696928433,
      "learning_rate": 4.812124670740974e-07,
      "logits/chosen": -2.650198221206665,
      "logits/rejected": -2.664853096008301,
      "logps/chosen": -0.5208258628845215,
      "logps/rejected": -0.5457176566123962,
      "loss": 0.8657,
      "rewards/accuracies": 0.543749988079071,
      "rewards/chosen": -1.3020646572113037,
      "rewards/margins": 0.06222956255078316,
      "rewards/rejected": -1.3642942905426025,
      "step": 170
    },
    {
      "epoch": 0.3750837240455459,
      "grad_norm": 28.60983443724951,
      "learning_rate": 4.7212410939333393e-07,
      "logits/chosen": -2.6064040660858154,
      "logits/rejected": -2.607041358947754,
      "logps/chosen": -0.5082141757011414,
      "logps/rejected": -0.5776320695877075,
      "loss": 0.856,
      "rewards/accuracies": 0.6312500238418579,
      "rewards/chosen": -1.2705352306365967,
      "rewards/margins": 0.17354491353034973,
      "rewards/rejected": -1.444080114364624,
      "step": 175
    },
    {
      "epoch": 0.38580040187541864,
      "grad_norm": 28.890782216692514,
      "learning_rate": 4.6279387027049207e-07,
      "logits/chosen": -2.6697092056274414,
      "logits/rejected": -2.681182384490967,
      "logps/chosen": -0.5036574602127075,
      "logps/rejected": -0.5669018030166626,
      "loss": 0.8471,
      "rewards/accuracies": 0.6875,
      "rewards/chosen": -1.2591437101364136,
      "rewards/margins": 0.1581108272075653,
      "rewards/rejected": -1.4172544479370117,
      "step": 180
    },
    {
      "epoch": 0.3965170797052914,
      "grad_norm": 33.21208453096758,
      "learning_rate": 4.5323486124294974e-07,
      "logits/chosen": -2.6660447120666504,
      "logits/rejected": -2.653808832168579,
      "logps/chosen": -0.5280566215515137,
      "logps/rejected": -0.5929220914840698,
      "loss": 0.8489,
      "rewards/accuracies": 0.59375,
      "rewards/chosen": -1.3201415538787842,
      "rewards/margins": 0.16216370463371277,
      "rewards/rejected": -1.4823051691055298,
      "step": 185
    },
    {
      "epoch": 0.4072337575351641,
      "grad_norm": 32.21687221540971,
      "learning_rate": 4.434605153323596e-07,
      "logits/chosen": -2.6904163360595703,
      "logits/rejected": -2.6859796047210693,
      "logps/chosen": -0.5588005185127258,
      "logps/rejected": -0.5708322525024414,
      "loss": 0.8611,
      "rewards/accuracies": 0.512499988079071,
      "rewards/chosen": -1.3970012664794922,
      "rewards/margins": 0.030079388990998268,
      "rewards/rejected": -1.427080750465393,
      "step": 190
    },
    {
      "epoch": 0.41795043536503684,
      "grad_norm": 41.644723385476134,
      "learning_rate": 4.334845681675802e-07,
      "logits/chosen": -2.779257297515869,
      "logits/rejected": -2.7567272186279297,
      "logps/chosen": -0.5632606744766235,
      "logps/rejected": -0.6324858665466309,
      "loss": 0.849,
      "rewards/accuracies": 0.637499988079071,
      "rewards/chosen": -1.4081517457962036,
      "rewards/margins": 0.17306287586688995,
      "rewards/rejected": -1.5812146663665771,
      "step": 195
    },
    {
      "epoch": 0.4286671131949096,
      "grad_norm": 26.270493645851452,
      "learning_rate": 4.233210386823613e-07,
      "logits/chosen": -2.786109447479248,
      "logits/rejected": -2.7996866703033447,
      "logps/chosen": -0.5389310121536255,
      "logps/rejected": -0.6197770833969116,
      "loss": 0.8549,
      "rewards/accuracies": 0.6187499761581421,
      "rewards/chosen": -1.347327470779419,
      "rewards/margins": 0.2021152228116989,
      "rewards/rejected": -1.5494426488876343,
      "step": 200
    },
    {
      "epoch": 0.4393837910247823,
      "grad_norm": 36.14520305623969,
      "learning_rate": 4.129842094149083e-07,
      "logits/chosen": -2.7881197929382324,
      "logits/rejected": -2.7783565521240234,
      "logps/chosen": -0.5980420112609863,
      "logps/rejected": -0.6710819005966187,
      "loss": 0.8286,
      "rewards/accuracies": 0.5874999761581421,
      "rewards/chosen": -1.4951050281524658,
      "rewards/margins": 0.18259991705417633,
      "rewards/rejected": -1.6777048110961914,
      "step": 205
    },
    {
      "epoch": 0.45010046885465504,
      "grad_norm": 38.43053642116225,
      "learning_rate": 4.024886064370107e-07,
      "logits/chosen": -2.856506824493408,
      "logits/rejected": -2.8317742347717285,
      "logps/chosen": -0.5951436758041382,
      "logps/rejected": -0.694713830947876,
      "loss": 0.8442,
      "rewards/accuracies": 0.625,
      "rewards/chosen": -1.4878594875335693,
      "rewards/margins": 0.24892520904541016,
      "rewards/rejected": -1.73678457736969,
      "step": 210
    },
    {
      "epoch": 0.4608171466845278,
      "grad_norm": 46.30179508330613,
      "learning_rate": 3.9184897894093836e-07,
      "logits/chosen": -2.8729026317596436,
      "logits/rejected": -2.879100799560547,
      "logps/chosen": -0.5551286935806274,
      "logps/rejected": -0.5990359783172607,
      "loss": 0.8599,
      "rewards/accuracies": 0.581250011920929,
      "rewards/chosen": -1.3878215551376343,
      "rewards/margins": 0.10976821184158325,
      "rewards/rejected": -1.4975898265838623,
      "step": 215
    },
    {
      "epoch": 0.4715338245144005,
      "grad_norm": 37.11445426689321,
      "learning_rate": 3.8108027851279425e-07,
      "logits/chosen": -2.835081100463867,
      "logits/rejected": -2.8519368171691895,
      "logps/chosen": -0.5955640077590942,
      "logps/rejected": -0.6532249450683594,
      "loss": 0.8473,
      "rewards/accuracies": 0.5687500238418579,
      "rewards/chosen": -1.4889099597930908,
      "rewards/margins": 0.14415231347084045,
      "rewards/rejected": -1.6330623626708984,
      "step": 220
    },
    {
      "epoch": 0.4822505023442733,
      "grad_norm": 32.214065679073585,
      "learning_rate": 3.701976381214462e-07,
      "logits/chosen": -2.8132290840148926,
      "logits/rejected": -2.823446750640869,
      "logps/chosen": -0.6355587840080261,
      "logps/rejected": -0.7065892219543457,
      "loss": 0.8365,
      "rewards/accuracies": 0.6499999761581421,
      "rewards/chosen": -1.588896632194519,
      "rewards/margins": 0.1775762438774109,
      "rewards/rejected": -1.7664730548858643,
      "step": 225
    },
    {
      "epoch": 0.49296718017414604,
      "grad_norm": 44.92592225151899,
      "learning_rate": 3.5921635085256784e-07,
      "logits/chosen": -2.761610746383667,
      "logits/rejected": -2.8057363033294678,
      "logps/chosen": -0.6419473886489868,
      "logps/rejected": -0.6694409251213074,
      "loss": 0.8582,
      "rewards/accuracies": 0.5375000238418579,
      "rewards/chosen": -1.6048686504364014,
      "rewards/margins": 0.06873364746570587,
      "rewards/rejected": -1.6736023426055908,
      "step": 230
    },
    {
      "epoch": 0.5036838580040187,
      "grad_norm": 36.403299194252355,
      "learning_rate": 3.4815184841767167e-07,
      "logits/chosen": -2.7862653732299805,
      "logits/rejected": -2.8091485500335693,
      "logps/chosen": -0.6702408194541931,
      "logps/rejected": -0.7432068586349487,
      "loss": 0.8254,
      "rewards/accuracies": 0.6312500238418579,
      "rewards/chosen": -1.6756021976470947,
      "rewards/margins": 0.18241505324840546,
      "rewards/rejected": -1.8580169677734375,
      "step": 235
    },
    {
      "epoch": 0.5144005358338914,
      "grad_norm": 36.94538982276638,
      "learning_rate": 3.3701967946833387e-07,
      "logits/chosen": -2.759392261505127,
      "logits/rejected": -2.765479803085327,
      "logps/chosen": -0.6342641115188599,
      "logps/rejected": -0.6964561343193054,
      "loss": 0.8666,
      "rewards/accuracies": 0.581250011920929,
      "rewards/chosen": -1.5856603384017944,
      "rewards/margins": 0.15547998249530792,
      "rewards/rejected": -1.741140365600586,
      "step": 240
    },
    {
      "epoch": 0.5251172136637642,
      "grad_norm": 48.58104599540209,
      "learning_rate": 3.258354877460875e-07,
      "logits/chosen": -2.768456220626831,
      "logits/rejected": -2.769329786300659,
      "logps/chosen": -0.7169967889785767,
      "logps/rejected": -0.7496964335441589,
      "loss": 0.8598,
      "rewards/accuracies": 0.5,
      "rewards/chosen": -1.7924916744232178,
      "rewards/margins": 0.08174925297498703,
      "rewards/rejected": -1.8742411136627197,
      "step": 245
    },
    {
      "epoch": 0.535833891493637,
      "grad_norm": 39.99504966827084,
      "learning_rate": 3.1461499009868705e-07,
      "logits/chosen": -2.6854636669158936,
      "logits/rejected": -2.6751153469085693,
      "logps/chosen": -0.644615113735199,
      "logps/rejected": -0.7769158482551575,
      "loss": 0.8207,
      "rewards/accuracies": 0.6499999761581421,
      "rewards/chosen": -1.6115376949310303,
      "rewards/margins": 0.33075180649757385,
      "rewards/rejected": -1.9422895908355713,
      "step": 250
    },
    {
      "epoch": 0.5465505693235098,
      "grad_norm": 39.27978686319756,
      "learning_rate": 3.033739543936404e-07,
      "logits/chosen": -2.8196840286254883,
      "logits/rejected": -2.8178226947784424,
      "logps/chosen": -0.645087480545044,
      "logps/rejected": -0.7025657296180725,
      "loss": 0.858,
      "rewards/accuracies": 0.6625000238418579,
      "rewards/chosen": -1.6127188205718994,
      "rewards/margins": 0.14369556307792664,
      "rewards/rejected": -1.7564141750335693,
      "step": 255
    },
    {
      "epoch": 0.5572672471533825,
      "grad_norm": 43.98816370937646,
      "learning_rate": 2.921281773600424e-07,
      "logits/chosen": -2.8064818382263184,
      "logits/rejected": -2.8211874961853027,
      "logps/chosen": -0.6516908407211304,
      "logps/rejected": -0.7097963690757751,
      "loss": 0.8323,
      "rewards/accuracies": 0.5562499761581421,
      "rewards/chosen": -1.6292273998260498,
      "rewards/margins": 0.14526379108428955,
      "rewards/rejected": -1.7744910717010498,
      "step": 260
    },
    {
      "epoch": 0.5679839249832552,
      "grad_norm": 33.59058966253406,
      "learning_rate": 2.808934623898511e-07,
      "logits/chosen": -2.800060272216797,
      "logits/rejected": -2.8043601512908936,
      "logps/chosen": -0.7222329378128052,
      "logps/rejected": -0.8318785429000854,
      "loss": 0.8196,
      "rewards/accuracies": 0.625,
      "rewards/chosen": -1.8055822849273682,
      "rewards/margins": 0.2741139829158783,
      "rewards/rejected": -2.0796961784362793,
      "step": 265
    },
    {
      "epoch": 0.578700602813128,
      "grad_norm": 43.26504473361459,
      "learning_rate": 2.696855973298007e-07,
      "logits/chosen": -2.755031108856201,
      "logits/rejected": -2.791006565093994,
      "logps/chosen": -0.737683117389679,
      "logps/rejected": -0.8107717633247375,
      "loss": 0.8489,
      "rewards/accuracies": 0.518750011920929,
      "rewards/chosen": -1.844207763671875,
      "rewards/margins": 0.18272162973880768,
      "rewards/rejected": -2.0269291400909424,
      "step": 270
    },
    {
      "epoch": 0.5894172806430007,
      "grad_norm": 46.99672780128192,
      "learning_rate": 2.585203322951589e-07,
      "logits/chosen": -2.7732062339782715,
      "logits/rejected": -2.772707223892212,
      "logps/chosen": -0.7681810855865479,
      "logps/rejected": -0.8909963369369507,
      "loss": 0.8085,
      "rewards/accuracies": 0.612500011920929,
      "rewards/chosen": -1.9204527139663696,
      "rewards/margins": 0.30703794956207275,
      "rewards/rejected": -2.2274906635284424,
      "step": 275
    },
    {
      "epoch": 0.6001339584728734,
      "grad_norm": 55.404295562819414,
      "learning_rate": 2.47413357536509e-07,
      "logits/chosen": -2.749508857727051,
      "logits/rejected": -2.7652359008789062,
      "logps/chosen": -0.7652196884155273,
      "logps/rejected": -0.8597443699836731,
      "loss": 0.8333,
      "rewards/accuracies": 0.6499999761581421,
      "rewards/chosen": -1.913049340248108,
      "rewards/margins": 0.23631171882152557,
      "rewards/rejected": -2.1493611335754395,
      "step": 280
    },
    {
      "epoch": 0.6108506363027462,
      "grad_norm": 61.85191993520604,
      "learning_rate": 2.3638028139065624e-07,
      "logits/chosen": -2.7137694358825684,
      "logits/rejected": -2.7289814949035645,
      "logps/chosen": -0.779629111289978,
      "logps/rejected": -0.8634055852890015,
      "loss": 0.8044,
      "rewards/accuracies": 0.59375,
      "rewards/chosen": -1.9490728378295898,
      "rewards/margins": 0.20944121479988098,
      "rewards/rejected": -2.1585142612457275,
      "step": 285
    },
    {
      "epoch": 0.6215673141326189,
      "grad_norm": 60.337258053481925,
      "learning_rate": 2.2543660834664724e-07,
      "logits/chosen": -2.7430872917175293,
      "logits/rejected": -2.745339870452881,
      "logps/chosen": -0.8288997411727905,
      "logps/rejected": -0.9137290716171265,
      "loss": 0.8449,
      "rewards/accuracies": 0.59375,
      "rewards/chosen": -2.072249174118042,
      "rewards/margins": 0.2120736539363861,
      "rewards/rejected": -2.284323215484619,
      "step": 290
    },
    {
      "epoch": 0.6322839919624916,
      "grad_norm": 42.40317939595656,
      "learning_rate": 2.1459771725772267e-07,
      "logits/chosen": -2.7052741050720215,
      "logits/rejected": -2.704089403152466,
      "logps/chosen": -0.8200925588607788,
      "logps/rejected": -0.9984285235404968,
      "loss": 0.8046,
      "rewards/accuracies": 0.6812499761581421,
      "rewards/chosen": -2.050231456756592,
      "rewards/margins": 0.44583970308303833,
      "rewards/rejected": -2.4960711002349854,
      "step": 295
    },
    {
      "epoch": 0.6430006697923644,
      "grad_norm": 40.28670525334983,
      "learning_rate": 2.0387883972982259e-07,
      "logits/chosen": -2.74006986618042,
      "logits/rejected": -2.732287883758545,
      "logps/chosen": -0.8429635763168335,
      "logps/rejected": -0.9686156511306763,
      "loss": 0.8196,
      "rewards/accuracies": 0.6499999761581421,
      "rewards/chosen": -2.1074090003967285,
      "rewards/margins": 0.31413009762763977,
      "rewards/rejected": -2.421539068222046,
      "step": 300
    },
    {
      "epoch": 0.6537173476222371,
      "grad_norm": 86.90459856821755,
      "learning_rate": 1.9329503871701592e-07,
      "logits/chosen": -2.7190165519714355,
      "logits/rejected": -2.6959800720214844,
      "logps/chosen": -0.8188444375991821,
      "logps/rejected": -0.923923134803772,
      "loss": 0.8455,
      "rewards/accuracies": 0.59375,
      "rewards/chosen": -2.0471110343933105,
      "rewards/margins": 0.2626969516277313,
      "rewards/rejected": -2.309807777404785,
      "step": 305
    },
    {
      "epoch": 0.6644340254521098,
      "grad_norm": 59.98298957486038,
      "learning_rate": 1.8286118735393015e-07,
      "logits/chosen": -2.80924129486084,
      "logits/rejected": -2.7938618659973145,
      "logps/chosen": -0.8203770518302917,
      "logps/rejected": -0.9268218278884888,
      "loss": 0.8234,
      "rewards/accuracies": 0.637499988079071,
      "rewards/chosen": -2.0509426593780518,
      "rewards/margins": 0.26611191034317017,
      "rewards/rejected": -2.3170547485351562,
      "step": 310
    },
    {
      "epoch": 0.6751507032819826,
      "grad_norm": 62.51212372617663,
      "learning_rate": 1.7259194805493042e-07,
      "logits/chosen": -2.799619197845459,
      "logits/rejected": -2.8189878463745117,
      "logps/chosen": -0.714773952960968,
      "logps/rejected": -0.8161081075668335,
      "loss": 0.8055,
      "rewards/accuracies": 0.668749988079071,
      "rewards/chosen": -1.7869348526000977,
      "rewards/margins": 0.25333529710769653,
      "rewards/rejected": -2.0402703285217285,
      "step": 315
    },
    {
      "epoch": 0.6858673811118553,
      "grad_norm": 41.556859283741524,
      "learning_rate": 1.6250175190941725e-07,
      "logits/chosen": -2.7959485054016113,
      "logits/rejected": -2.801035165786743,
      "logps/chosen": -0.8557518124580383,
      "logps/rejected": -0.915735125541687,
      "loss": 0.8317,
      "rewards/accuracies": 0.59375,
      "rewards/chosen": -2.1393795013427734,
      "rewards/margins": 0.14995838701725006,
      "rewards/rejected": -2.2893378734588623,
      "step": 320
    },
    {
      "epoch": 0.696584058941728,
      "grad_norm": 55.09638259005922,
      "learning_rate": 1.5260477840220057e-07,
      "logits/chosen": -2.8080384731292725,
      "logits/rejected": -2.7987282276153564,
      "logps/chosen": -0.833696186542511,
      "logps/rejected": -0.9548071026802063,
      "loss": 0.832,
      "rewards/accuracies": 0.6312500238418579,
      "rewards/chosen": -2.084240436553955,
      "rewards/margins": 0.30277732014656067,
      "rewards/rejected": -2.3870177268981934,
      "step": 325
    },
    {
      "epoch": 0.7073007367716008,
      "grad_norm": 44.949520453818394,
      "learning_rate": 1.4291493548744542e-07,
      "logits/chosen": -2.8681960105895996,
      "logits/rejected": -2.8732876777648926,
      "logps/chosen": -0.7422401905059814,
      "logps/rejected": -0.8260459899902344,
      "loss": 0.8034,
      "rewards/accuracies": 0.6312500238418579,
      "rewards/chosen": -1.855600357055664,
      "rewards/margins": 0.20951440930366516,
      "rewards/rejected": -2.065114974975586,
      "step": 330
    },
    {
      "epoch": 0.7180174146014735,
      "grad_norm": 45.7424240285281,
      "learning_rate": 1.334458400441933e-07,
      "logits/chosen": -2.82810640335083,
      "logits/rejected": -2.849940776824951,
      "logps/chosen": -0.8447572588920593,
      "logps/rejected": -0.9444996118545532,
      "loss": 0.8025,
      "rewards/accuracies": 0.65625,
      "rewards/chosen": -2.1118931770324707,
      "rewards/margins": 0.24935582280158997,
      "rewards/rejected": -2.361248731613159,
      "step": 335
    },
    {
      "epoch": 0.7287340924313462,
      "grad_norm": 42.803256923203904,
      "learning_rate": 1.2421079874092336e-07,
      "logits/chosen": -2.7856204509735107,
      "logits/rejected": -2.7886736392974854,
      "logps/chosen": -0.7972110509872437,
      "logps/rejected": -0.938035786151886,
      "loss": 0.8166,
      "rewards/accuracies": 0.6625000238418579,
      "rewards/chosen": -1.9930274486541748,
      "rewards/margins": 0.3520616888999939,
      "rewards/rejected": -2.3450894355773926,
      "step": 340
    },
    {
      "epoch": 0.739450770261219,
      "grad_norm": 51.42416772529061,
      "learning_rate": 1.1522278933604484e-07,
      "logits/chosen": -2.8845365047454834,
      "logits/rejected": -2.8686933517456055,
      "logps/chosen": -0.8115636706352234,
      "logps/rejected": -0.9101818799972534,
      "loss": 0.8422,
      "rewards/accuracies": 0.6499999761581421,
      "rewards/chosen": -2.02890944480896,
      "rewards/margins": 0.2465454787015915,
      "rewards/rejected": -2.2754549980163574,
      "step": 345
    },
    {
      "epoch": 0.7501674480910918,
      "grad_norm": 46.28485440274645,
      "learning_rate": 1.0649444244059717e-07,
      "logits/chosen": -2.862877130508423,
      "logits/rejected": -2.8752026557922363,
      "logps/chosen": -0.8484942317008972,
      "logps/rejected": -0.989905834197998,
      "loss": 0.8066,
      "rewards/accuracies": 0.643750011920929,
      "rewards/chosen": -2.1212356090545654,
      "rewards/margins": 0.3535289764404297,
      "rewards/rejected": -2.474764585494995,
      "step": 350
    },
    {
      "epoch": 0.7608841259209645,
      "grad_norm": 45.887771284269704,
      "learning_rate": 9.803802376878795e-08,
      "logits/chosen": -2.7856531143188477,
      "logits/rejected": -2.7845890522003174,
      "logps/chosen": -0.8037050366401672,
      "logps/rejected": -0.9463211894035339,
      "loss": 0.826,
      "rewards/accuracies": 0.6499999761581421,
      "rewards/chosen": -2.0092625617980957,
      "rewards/margins": 0.35654014348983765,
      "rewards/rejected": -2.3658030033111572,
      "step": 355
    },
    {
      "epoch": 0.7716008037508373,
      "grad_norm": 40.04255345165769,
      "learning_rate": 8.98654169013098e-08,
      "logits/chosen": -2.8496766090393066,
      "logits/rejected": -2.856886625289917,
      "logps/chosen": -0.8355451822280884,
      "logps/rejected": -0.9562333822250366,
      "loss": 0.8175,
      "rewards/accuracies": 0.6499999761581421,
      "rewards/chosen": -2.088862895965576,
      "rewards/margins": 0.30172067880630493,
      "rewards/rejected": -2.3905835151672363,
      "step": 360
    },
    {
      "epoch": 0.78231748158071,
      "grad_norm": 44.068901393978045,
      "learning_rate": 8.198810658566058e-08,
      "logits/chosen": -2.888864755630493,
      "logits/rejected": -2.8768510818481445,
      "logps/chosen": -0.8253611326217651,
      "logps/rejected": -0.8868210911750793,
      "loss": 0.8086,
      "rewards/accuracies": 0.6187499761581421,
      "rewards/chosen": -2.0634026527404785,
      "rewards/margins": 0.15364977717399597,
      "rewards/rejected": -2.217052698135376,
      "step": 365
    },
    {
      "epoch": 0.7930341594105828,
      "grad_norm": 53.495911636432275,
      "learning_rate": 7.441716259693182e-08,
      "logits/chosen": -2.8299834728240967,
      "logits/rejected": -2.832634687423706,
      "logps/chosen": -0.8341320753097534,
      "logps/rejected": -0.9127298593521118,
      "loss": 0.8026,
      "rewards/accuracies": 0.5687500238418579,
      "rewards/chosen": -2.0853302478790283,
      "rewards/margins": 0.1964944303035736,
      "rewards/rejected": -2.281824827194214,
      "step": 370
    },
    {
      "epoch": 0.8037508372404555,
      "grad_norm": 90.20242212566468,
      "learning_rate": 6.716322418174835e-08,
      "logits/chosen": -2.8828415870666504,
      "logits/rejected": -2.9067115783691406,
      "logps/chosen": -0.8372591137886047,
      "logps/rejected": -0.9083630442619324,
      "loss": 0.822,
      "rewards/accuracies": 0.643750011920929,
      "rewards/chosen": -2.0931479930877686,
      "rewards/margins": 0.17775973677635193,
      "rewards/rejected": -2.2709078788757324,
      "step": 375
    },
    {
      "epoch": 0.8144675150703282,
      "grad_norm": 51.40322451480009,
      "learning_rate": 6.023648510721696e-08,
      "logits/chosen": -2.8623759746551514,
      "logits/rejected": -2.8710124492645264,
      "logps/chosen": -0.8702946901321411,
      "logps/rejected": -0.9763823747634888,
      "loss": 0.8353,
      "rewards/accuracies": 0.581250011920929,
      "rewards/chosen": -2.175736665725708,
      "rewards/margins": 0.2652190327644348,
      "rewards/rejected": -2.440955638885498,
      "step": 380
    },
    {
      "epoch": 0.825184192900201,
      "grad_norm": 51.81556070039716,
      "learning_rate": 5.364667933589596e-08,
      "logits/chosen": -2.849456310272217,
      "logits/rejected": -2.851010799407959,
      "logps/chosen": -0.8525313138961792,
      "logps/rejected": -0.9864780306816101,
      "loss": 0.802,
      "rewards/accuracies": 0.668749988079071,
      "rewards/chosen": -2.1313283443450928,
      "rewards/margins": 0.33486661314964294,
      "rewards/rejected": -2.4661951065063477,
      "step": 385
    },
    {
      "epoch": 0.8359008707300737,
      "grad_norm": 45.58554963422182,
      "learning_rate": 4.74030673469165e-08,
      "logits/chosen": -2.8301806449890137,
      "logits/rejected": -2.8267669677734375,
      "logps/chosen": -0.8605489730834961,
      "logps/rejected": -0.9496217966079712,
      "loss": 0.8429,
      "rewards/accuracies": 0.5625,
      "rewards/chosen": -2.1513726711273193,
      "rewards/margins": 0.22268176078796387,
      "rewards/rejected": -2.374054431915283,
      "step": 390
    },
    {
      "epoch": 0.8466175485599464,
      "grad_norm": 46.348601881599755,
      "learning_rate": 4.1514423122476606e-08,
      "logits/chosen": -2.830157518386841,
      "logits/rejected": -2.845646381378174,
      "logps/chosen": -0.9207762479782104,
      "logps/rejected": -1.0978748798370361,
      "loss": 0.8109,
      "rewards/accuracies": 0.6812499761581421,
      "rewards/chosen": -2.301940441131592,
      "rewards/margins": 0.4427467882633209,
      "rewards/rejected": -2.744687557220459,
      "step": 395
    },
    {
      "epoch": 0.8573342263898192,
      "grad_norm": 50.30423144909562,
      "learning_rate": 3.598902181799717e-08,
      "logits/chosen": -2.8534016609191895,
      "logits/rejected": -2.8737454414367676,
      "logps/chosen": -0.8593473434448242,
      "logps/rejected": -1.007835030555725,
      "loss": 0.7922,
      "rewards/accuracies": 0.668749988079071,
      "rewards/chosen": -2.1483683586120605,
      "rewards/margins": 0.37121906876564026,
      "rewards/rejected": -2.5195870399475098,
      "step": 400
    },
    {
      "epoch": 0.8573342263898192,
      "eval_logits/chosen": -2.7538046836853027,
      "eval_logits/rejected": -2.750361442565918,
      "eval_logps/chosen": -0.886497437953949,
      "eval_logps/rejected": -0.9786437749862671,
      "eval_loss": 0.8476680517196655,
      "eval_rewards/accuracies": 0.6196808218955994,
      "eval_rewards/chosen": -2.2162435054779053,
      "eval_rewards/margins": 0.23036597669124603,
      "eval_rewards/rejected": -2.4466094970703125,
      "eval_runtime": 181.4209,
      "eval_samples_per_second": 16.503,
      "eval_steps_per_second": 1.036,
      "step": 400
    },
    {
      "epoch": 0.8680509042196919,
      "grad_norm": 44.28092137039894,
      "learning_rate": 3.0834628133265293e-08,
      "logits/chosen": -2.900773048400879,
      "logits/rejected": -2.898650646209717,
      "logps/chosen": -0.8180268406867981,
      "logps/rejected": -0.9497629404067993,
      "loss": 0.8143,
      "rewards/accuracies": 0.737500011920929,
      "rewards/chosen": -2.045067071914673,
      "rewards/margins": 0.32934024930000305,
      "rewards/rejected": -2.3744072914123535,
      "step": 405
    },
    {
      "epoch": 0.8787675820495646,
      "grad_norm": 58.002295504553146,
      "learning_rate": 2.6058485400908248e-08,
      "logits/chosen": -2.825855016708374,
      "logits/rejected": -2.8448638916015625,
      "logps/chosen": -0.8474146127700806,
      "logps/rejected": -0.9570367932319641,
      "loss": 0.7869,
      "rewards/accuracies": 0.675000011920929,
      "rewards/chosen": -2.1185364723205566,
      "rewards/margins": 0.2740556001663208,
      "rewards/rejected": -2.392592191696167,
      "step": 410
    },
    {
      "epoch": 0.8894842598794374,
      "grad_norm": 54.643404346448854,
      "learning_rate": 2.1667305407530255e-08,
      "logits/chosen": -2.8494045734405518,
      "logits/rejected": -2.8613953590393066,
      "logps/chosen": -0.8772624135017395,
      "logps/rejected": -1.0215747356414795,
      "loss": 0.8141,
      "rewards/accuracies": 0.71875,
      "rewards/chosen": -2.1931557655334473,
      "rewards/margins": 0.3607810139656067,
      "rewards/rejected": -2.5539369583129883,
      "step": 415
    },
    {
      "epoch": 0.9002009377093101,
      "grad_norm": 54.43575914842802,
      "learning_rate": 1.7667258961816723e-08,
      "logits/chosen": -2.8684887886047363,
      "logits/rejected": -2.873196601867676,
      "logps/chosen": -0.8568860292434692,
      "logps/rejected": -0.9896190762519836,
      "loss": 0.7998,
      "rewards/accuracies": 0.668749988079071,
      "rewards/chosen": -2.1422150135040283,
      "rewards/margins": 0.33183249831199646,
      "rewards/rejected": -2.4740474224090576,
      "step": 420
    },
    {
      "epoch": 0.9109176155391828,
      "grad_norm": 48.18191701474636,
      "learning_rate": 1.4063967222860872e-08,
      "logits/chosen": -2.8546624183654785,
      "logits/rejected": -2.8553433418273926,
      "logps/chosen": -0.8484784960746765,
      "logps/rejected": -0.9524635076522827,
      "loss": 0.8169,
      "rewards/accuracies": 0.612500011920929,
      "rewards/chosen": -2.1211962699890137,
      "rewards/margins": 0.25996264815330505,
      "rewards/rejected": -2.3811588287353516,
      "step": 425
    },
    {
      "epoch": 0.9216342933690556,
      "grad_norm": 51.174486022241915,
      "learning_rate": 1.086249380089782e-08,
      "logits/chosen": -2.8197484016418457,
      "logits/rejected": -2.8225228786468506,
      "logps/chosen": -0.8611736297607422,
      "logps/rejected": -0.9728094339370728,
      "loss": 0.8277,
      "rewards/accuracies": 0.65625,
      "rewards/chosen": -2.1529343128204346,
      "rewards/margins": 0.27908942103385925,
      "rewards/rejected": -2.432023525238037,
      "step": 430
    },
    {
      "epoch": 0.9323509711989283,
      "grad_norm": 44.79232732033475,
      "learning_rate": 8.067337641547777e-09,
      "logits/chosen": -2.765214443206787,
      "logits/rejected": -2.770324230194092,
      "logps/chosen": -0.8653280138969421,
      "logps/rejected": -1.0345770120620728,
      "loss": 0.8131,
      "rewards/accuracies": 0.668749988079071,
      "rewards/chosen": -2.1633200645446777,
      "rewards/margins": 0.4231223464012146,
      "rewards/rejected": -2.586442470550537,
      "step": 435
    },
    {
      "epoch": 0.943067649028801,
      "grad_norm": 60.40238319567597,
      "learning_rate": 5.682426703567034e-09,
      "logits/chosen": -2.8180606365203857,
      "logits/rejected": -2.840364456176758,
      "logps/chosen": -0.869713306427002,
      "logps/rejected": -0.9692758321762085,
      "loss": 0.8246,
      "rewards/accuracies": 0.65625,
      "rewards/chosen": -2.174283266067505,
      "rewards/margins": 0.24890628457069397,
      "rewards/rejected": -2.423189640045166,
      "step": 440
    },
    {
      "epoch": 0.9537843268586738,
      "grad_norm": 47.78836099312267,
      "learning_rate": 3.7111124389918146e-09,
      "logits/chosen": -2.822488784790039,
      "logits/rejected": -2.8353183269500732,
      "logps/chosen": -0.9109541773796082,
      "logps/rejected": -1.0518534183502197,
      "loss": 0.8017,
      "rewards/accuracies": 0.6812499761581421,
      "rewards/chosen": -2.277385711669922,
      "rewards/margins": 0.3522477447986603,
      "rewards/rejected": -2.629633665084839,
      "step": 445
    },
    {
      "epoch": 0.9645010046885466,
      "grad_norm": 52.19961403016944,
      "learning_rate": 2.156165083431627e-09,
      "logits/chosen": -2.8054797649383545,
      "logits/rejected": -2.823476791381836,
      "logps/chosen": -0.8698583841323853,
      "logps/rejected": -0.981345534324646,
      "loss": 0.8048,
      "rewards/accuracies": 0.643750011920929,
      "rewards/chosen": -2.1746461391448975,
      "rewards/margins": 0.27871814370155334,
      "rewards/rejected": -2.453364372253418,
      "step": 450
    },
    {
      "epoch": 0.9752176825184193,
      "grad_norm": 85.55202442305807,
      "learning_rate": 1.019769763130851e-09,
      "logits/chosen": -2.831876754760742,
      "logits/rejected": -2.831312417984009,
      "logps/chosen": -0.898154079914093,
      "logps/rejected": -0.9996622204780579,
      "loss": 0.8386,
      "rewards/accuracies": 0.606249988079071,
      "rewards/chosen": -2.2453854084014893,
      "rewards/margins": 0.25377026200294495,
      "rewards/rejected": -2.4991555213928223,
      "step": 455
    },
    {
      "epoch": 0.9859343603482921,
      "grad_norm": 52.557713160087424,
      "learning_rate": 3.0352342426868125e-10,
      "logits/chosen": -2.82321834564209,
      "logits/rejected": -2.829742431640625,
      "logps/chosen": -0.885098934173584,
      "logps/rejected": -1.0297120809555054,
      "loss": 0.8033,
      "rewards/accuracies": 0.6812499761581421,
      "rewards/chosen": -2.21274733543396,
      "rewards/margins": 0.3615328371524811,
      "rewards/rejected": -2.574280261993408,
      "step": 460
    },
    {
      "epoch": 0.9966510381781648,
      "grad_norm": 47.59754280515198,
      "learning_rate": 8.432588813089836e-12,
      "logits/chosen": -2.856809139251709,
      "logits/rejected": -2.8557355403900146,
      "logps/chosen": -0.9160723686218262,
      "logps/rejected": -0.9892672300338745,
      "loss": 0.845,
      "rewards/accuracies": 0.581250011920929,
      "rewards/chosen": -2.2901809215545654,
      "rewards/margins": 0.1829872727394104,
      "rewards/rejected": -2.473168134689331,
      "step": 465
    },
    {
      "epoch": 0.9987943737441393,
      "step": 466,
      "total_flos": 0.0,
      "train_loss": 0.8480710061067164,
      "train_runtime": 13313.1585,
      "train_samples_per_second": 4.486,
      "train_steps_per_second": 0.035
    }
  ],
  "logging_steps": 5,
  "max_steps": 466,
  "num_input_tokens_seen": 0,
  "num_train_epochs": 1,
  "save_steps": 1000000,
  "stateful_callbacks": {
    "TrainerControl": {
      "args": {
        "should_epoch_stop": false,
        "should_evaluate": false,
        "should_log": false,
        "should_save": true,
        "should_training_stop": true
      },
      "attributes": {}
    }
  },
  "total_flos": 0.0,
  "train_batch_size": 2,
  "trial_name": null,
  "trial_params": null
}