JoshMe1 commited on
Commit
763c993
·
verified ·
1 Parent(s): f09dcb4

Training in progress, step 800, checkpoint

Browse files
last-checkpoint/adapter_model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:fc388cd49ae9782945b985af61ba1c98bb80164242320e8efe81a46a64f6e089
3
  size 1342238560
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2832f221e37c6a3eeb8a9283c4222adee164d6d339ef6eaf73a3b12eec12154b
3
  size 1342238560
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:fbf4951be84e703330158f285f191e22bad19fb2b0e5dcd2b14b957f627f8d2d
3
  size 682101844
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9991802a5016ab59805bfe886a37d8bca3f29ff422db8205e7f63a9d674e12d0
3
  size 682101844
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:0627b9793181d3f7cfa52d173f7b800ff718d34a000378ae574d8dca34e2e8f6
3
  size 1064
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:246ca084214dc27b5762653dde5a6251678dabf4b1880f62d528a3b22fc7e637
3
  size 1064
last-checkpoint/trainer_state.json CHANGED
@@ -1,9 +1,9 @@
1
  {
2
  "best_metric": null,
3
  "best_model_checkpoint": null,
4
- "epoch": 0.05089428529882216,
5
  "eval_steps": 500,
6
- "global_step": 700,
7
  "is_hyper_param_search": false,
8
  "is_local_process_zero": true,
9
  "is_world_process_zero": true,
@@ -10507,6 +10507,1506 @@
10507
  "rewards/margins": 14.29006576538086,
10508
  "rewards/rejected": -14.86207389831543,
10509
  "step": 700
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
10510
  }
10511
  ],
10512
  "logging_steps": 1,
 
1
  {
2
  "best_metric": null,
3
  "best_model_checkpoint": null,
4
+ "epoch": 0.058164897484368185,
5
  "eval_steps": 500,
6
+ "global_step": 800,
7
  "is_hyper_param_search": false,
8
  "is_local_process_zero": true,
9
  "is_world_process_zero": true,
 
10507
  "rewards/margins": 14.29006576538086,
10508
  "rewards/rejected": -14.86207389831543,
10509
  "step": 700
10510
+ },
10511
+ {
10512
+ "epoch": 0.05096699142067762,
10513
+ "grad_norm": 0.00016962472000159323,
10514
+ "learning_rate": 2.484900266848824e-07,
10515
+ "logits/chosen": -0.9526031017303467,
10516
+ "logits/rejected": -0.9217356443405151,
10517
+ "logps/chosen": -36.252708435058594,
10518
+ "logps/rejected": -220.39859008789062,
10519
+ "loss": 0.0,
10520
+ "rewards/accuracies": 1.0,
10521
+ "rewards/chosen": -0.40994641184806824,
10522
+ "rewards/margins": 14.971365928649902,
10523
+ "rewards/rejected": -15.381312370300293,
10524
+ "step": 701
10525
+ },
10526
+ {
10527
+ "epoch": 0.05103969754253308,
10528
+ "grad_norm": 0.0001438941981177777,
10529
+ "learning_rate": 2.469831179394182e-07,
10530
+ "logits/chosen": -0.8770197629928589,
10531
+ "logits/rejected": -0.8578864336013794,
10532
+ "logps/chosen": -36.073951721191406,
10533
+ "logps/rejected": -220.23309326171875,
10534
+ "loss": 0.0,
10535
+ "rewards/accuracies": 1.0,
10536
+ "rewards/chosen": -0.5476633310317993,
10537
+ "rewards/margins": 14.92567253112793,
10538
+ "rewards/rejected": -15.473337173461914,
10539
+ "step": 702
10540
+ },
10541
+ {
10542
+ "epoch": 0.051112403664388545,
10543
+ "grad_norm": 0.0002866745926439762,
10544
+ "learning_rate": 2.4547929212481435e-07,
10545
+ "logits/chosen": -0.8754183650016785,
10546
+ "logits/rejected": -0.8728746771812439,
10547
+ "logps/chosen": -34.195640563964844,
10548
+ "logps/rejected": -215.84222412109375,
10549
+ "loss": 0.0,
10550
+ "rewards/accuracies": 1.0,
10551
+ "rewards/chosen": -0.1705656349658966,
10552
+ "rewards/margins": 14.685879707336426,
10553
+ "rewards/rejected": -14.8564453125,
10554
+ "step": 703
10555
+ },
10556
+ {
10557
+ "epoch": 0.051185109786244,
10558
+ "grad_norm": 0.019100969657301903,
10559
+ "learning_rate": 2.439785675647143e-07,
10560
+ "logits/chosen": -0.9529399871826172,
10561
+ "logits/rejected": -0.9230093359947205,
10562
+ "logps/chosen": -30.495248794555664,
10563
+ "logps/rejected": -216.925048828125,
10564
+ "loss": 0.0002,
10565
+ "rewards/accuracies": 1.0,
10566
+ "rewards/chosen": -0.41198036074638367,
10567
+ "rewards/margins": 14.4360990524292,
10568
+ "rewards/rejected": -14.848078727722168,
10569
+ "step": 704
10570
+ },
10571
+ {
10572
+ "epoch": 0.05125781590809946,
10573
+ "grad_norm": 0.002025824738666415,
10574
+ "learning_rate": 2.424809625449729e-07,
10575
+ "logits/chosen": -0.9094721078872681,
10576
+ "logits/rejected": -0.8607329726219177,
10577
+ "logps/chosen": -36.99269485473633,
10578
+ "logps/rejected": -210.490966796875,
10579
+ "loss": 0.0,
10580
+ "rewards/accuracies": 1.0,
10581
+ "rewards/chosen": -0.4871370792388916,
10582
+ "rewards/margins": 12.869680404663086,
10583
+ "rewards/rejected": -13.356817245483398,
10584
+ "step": 705
10585
+ },
10586
+ {
10587
+ "epoch": 0.051330522029954924,
10588
+ "grad_norm": 0.0006507533835247159,
10589
+ "learning_rate": 2.4098649531343494e-07,
10590
+ "logits/chosen": -0.9695981740951538,
10591
+ "logits/rejected": -0.9127803444862366,
10592
+ "logps/chosen": -32.33372497558594,
10593
+ "logps/rejected": -214.67095947265625,
10594
+ "loss": 0.0,
10595
+ "rewards/accuracies": 1.0,
10596
+ "rewards/chosen": -0.34919363260269165,
10597
+ "rewards/margins": 14.252132415771484,
10598
+ "rewards/rejected": -14.601325988769531,
10599
+ "step": 706
10600
+ },
10601
+ {
10602
+ "epoch": 0.05140322815181038,
10603
+ "grad_norm": 0.004732044879347086,
10604
+ "learning_rate": 2.39495184079712e-07,
10605
+ "logits/chosen": -0.9018921852111816,
10606
+ "logits/rejected": -0.8292985558509827,
10607
+ "logps/chosen": -37.659297943115234,
10608
+ "logps/rejected": -217.0321044921875,
10609
+ "loss": 0.0,
10610
+ "rewards/accuracies": 1.0,
10611
+ "rewards/chosen": -0.576061487197876,
10612
+ "rewards/margins": 14.48731517791748,
10613
+ "rewards/rejected": -15.063377380371094,
10614
+ "step": 707
10615
+ },
10616
+ {
10617
+ "epoch": 0.05147593427366584,
10618
+ "grad_norm": 0.0028744235169142485,
10619
+ "learning_rate": 2.380070470149605e-07,
10620
+ "logits/chosen": -0.913748562335968,
10621
+ "logits/rejected": -0.9386864304542542,
10622
+ "logps/chosen": -36.09499740600586,
10623
+ "logps/rejected": -205.8506622314453,
10624
+ "loss": 0.0,
10625
+ "rewards/accuracies": 1.0,
10626
+ "rewards/chosen": -0.8420953154563904,
10627
+ "rewards/margins": 13.169838905334473,
10628
+ "rewards/rejected": -14.011934280395508,
10629
+ "step": 708
10630
+ },
10631
+ {
10632
+ "epoch": 0.0515486403955213,
10633
+ "grad_norm": 0.000163277582032606,
10634
+ "learning_rate": 2.365221022516612e-07,
10635
+ "logits/chosen": -0.8805249929428101,
10636
+ "logits/rejected": -0.8968266248703003,
10637
+ "logps/chosen": -33.87440490722656,
10638
+ "logps/rejected": -219.28244018554688,
10639
+ "loss": 0.0,
10640
+ "rewards/accuracies": 1.0,
10641
+ "rewards/chosen": -0.4786233901977539,
10642
+ "rewards/margins": 14.947343826293945,
10643
+ "rewards/rejected": -15.425966262817383,
10644
+ "step": 709
10645
+ },
10646
+ {
10647
+ "epoch": 0.051621346517376765,
10648
+ "grad_norm": 0.01185124833136797,
10649
+ "learning_rate": 2.350403678833976e-07,
10650
+ "logits/chosen": -0.9778631329536438,
10651
+ "logits/rejected": -0.9422690272331238,
10652
+ "logps/chosen": -40.79098129272461,
10653
+ "logps/rejected": -204.85809326171875,
10654
+ "loss": 0.0002,
10655
+ "rewards/accuracies": 1.0,
10656
+ "rewards/chosen": -0.660285472869873,
10657
+ "rewards/margins": 11.561246871948242,
10658
+ "rewards/rejected": -12.221532821655273,
10659
+ "step": 710
10660
+ },
10661
+ {
10662
+ "epoch": 0.05169405263923222,
10663
+ "grad_norm": 0.019607333466410637,
10664
+ "learning_rate": 2.3356186196463496e-07,
10665
+ "logits/chosen": -0.9117095470428467,
10666
+ "logits/rejected": -0.8398680686950684,
10667
+ "logps/chosen": -34.003517150878906,
10668
+ "logps/rejected": -205.01531982421875,
10669
+ "loss": 0.0002,
10670
+ "rewards/accuracies": 1.0,
10671
+ "rewards/chosen": -0.5753993988037109,
10672
+ "rewards/margins": 12.464205741882324,
10673
+ "rewards/rejected": -13.039605140686035,
10674
+ "step": 711
10675
+ },
10676
+ {
10677
+ "epoch": 0.05176675876108768,
10678
+ "grad_norm": 0.0005566957988776267,
10679
+ "learning_rate": 2.3208660251050156e-07,
10680
+ "logits/chosen": -0.9298917651176453,
10681
+ "logits/rejected": -0.8853734731674194,
10682
+ "logps/chosen": -37.82965850830078,
10683
+ "logps/rejected": -217.22219848632812,
10684
+ "loss": 0.0,
10685
+ "rewards/accuracies": 1.0,
10686
+ "rewards/chosen": -0.6585885286331177,
10687
+ "rewards/margins": 13.603300094604492,
10688
+ "rewards/rejected": -14.26188850402832,
10689
+ "step": 712
10690
+ },
10691
+ {
10692
+ "epoch": 0.051839464882943144,
10693
+ "grad_norm": 0.004182242788374424,
10694
+ "learning_rate": 2.3061460749656841e-07,
10695
+ "logits/chosen": -0.8634892702102661,
10696
+ "logits/rejected": -0.8328802585601807,
10697
+ "logps/chosen": -32.050048828125,
10698
+ "logps/rejected": -218.27481079101562,
10699
+ "loss": 0.0,
10700
+ "rewards/accuracies": 1.0,
10701
+ "rewards/chosen": -0.33811381459236145,
10702
+ "rewards/margins": 13.200772285461426,
10703
+ "rewards/rejected": -13.538886070251465,
10704
+ "step": 713
10705
+ },
10706
+ {
10707
+ "epoch": 0.051912171004798606,
10708
+ "grad_norm": 0.005979419220238924,
10709
+ "learning_rate": 2.2914589485863012e-07,
10710
+ "logits/chosen": -0.9607076644897461,
10711
+ "logits/rejected": -0.8761736750602722,
10712
+ "logps/chosen": -29.904586791992188,
10713
+ "logps/rejected": -215.92449951171875,
10714
+ "loss": 0.0001,
10715
+ "rewards/accuracies": 1.0,
10716
+ "rewards/chosen": -0.4739420711994171,
10717
+ "rewards/margins": 12.991318702697754,
10718
+ "rewards/rejected": -13.46526050567627,
10719
+ "step": 714
10720
+ },
10721
+ {
10722
+ "epoch": 0.05198487712665406,
10723
+ "grad_norm": 0.00045053259236738086,
10724
+ "learning_rate": 2.2768048249248644e-07,
10725
+ "logits/chosen": -0.8738826513290405,
10726
+ "logits/rejected": -0.9393714070320129,
10727
+ "logps/chosen": -34.599090576171875,
10728
+ "logps/rejected": -212.1854248046875,
10729
+ "loss": 0.0,
10730
+ "rewards/accuracies": 1.0,
10731
+ "rewards/chosen": -0.49326005578041077,
10732
+ "rewards/margins": 14.172708511352539,
10733
+ "rewards/rejected": -14.66596794128418,
10734
+ "step": 715
10735
+ },
10736
+ {
10737
+ "epoch": 0.05205758324850952,
10738
+ "grad_norm": 0.0076771085150539875,
10739
+ "learning_rate": 2.262183882537249e-07,
10740
+ "logits/chosen": -0.8194682598114014,
10741
+ "logits/rejected": -0.909551739692688,
10742
+ "logps/chosen": -34.328060150146484,
10743
+ "logps/rejected": -207.3561248779297,
10744
+ "loss": 0.0001,
10745
+ "rewards/accuracies": 1.0,
10746
+ "rewards/chosen": -0.2956991493701935,
10747
+ "rewards/margins": 12.504569053649902,
10748
+ "rewards/rejected": -12.800268173217773,
10749
+ "step": 716
10750
+ },
10751
+ {
10752
+ "epoch": 0.052130289370364985,
10753
+ "grad_norm": 0.0008858201326802373,
10754
+ "learning_rate": 2.247596299575022e-07,
10755
+ "logits/chosen": -0.8622158765792847,
10756
+ "logits/rejected": -0.8925617933273315,
10757
+ "logps/chosen": -36.37249755859375,
10758
+ "logps/rejected": -210.2269287109375,
10759
+ "loss": 0.0,
10760
+ "rewards/accuracies": 1.0,
10761
+ "rewards/chosen": -0.21173694729804993,
10762
+ "rewards/margins": 13.570272445678711,
10763
+ "rewards/rejected": -13.78200912475586,
10764
+ "step": 717
10765
+ },
10766
+ {
10767
+ "epoch": 0.05220299549222045,
10768
+ "grad_norm": 0.004414277616888285,
10769
+ "learning_rate": 2.23304225378328e-07,
10770
+ "logits/chosen": -0.9940564632415771,
10771
+ "logits/rejected": -0.8593904972076416,
10772
+ "logps/chosen": -30.40024757385254,
10773
+ "logps/rejected": -211.74139404296875,
10774
+ "loss": 0.0001,
10775
+ "rewards/accuracies": 1.0,
10776
+ "rewards/chosen": -0.23217126727104187,
10777
+ "rewards/margins": 12.863700866699219,
10778
+ "rewards/rejected": -13.095871925354004,
10779
+ "step": 718
10780
+ },
10781
+ {
10782
+ "epoch": 0.0522757016140759,
10783
+ "grad_norm": 0.0007747263880446553,
10784
+ "learning_rate": 2.218521922498476e-07,
10785
+ "logits/chosen": -0.9582018256187439,
10786
+ "logits/rejected": -0.9187099933624268,
10787
+ "logps/chosen": -35.134254455566406,
10788
+ "logps/rejected": -197.65711975097656,
10789
+ "loss": 0.0,
10790
+ "rewards/accuracies": 1.0,
10791
+ "rewards/chosen": -0.3801981210708618,
10792
+ "rewards/margins": 12.766691207885742,
10793
+ "rewards/rejected": -13.146888732910156,
10794
+ "step": 719
10795
+ },
10796
+ {
10797
+ "epoch": 0.052348407735931364,
10798
+ "grad_norm": 0.004136708099395037,
10799
+ "learning_rate": 2.2040354826462664e-07,
10800
+ "logits/chosen": -0.9472717046737671,
10801
+ "logits/rejected": -0.7926496863365173,
10802
+ "logps/chosen": -30.805456161499023,
10803
+ "logps/rejected": -209.50125122070312,
10804
+ "loss": 0.0001,
10805
+ "rewards/accuracies": 1.0,
10806
+ "rewards/chosen": 0.05050273239612579,
10807
+ "rewards/margins": 12.728914260864258,
10808
+ "rewards/rejected": -12.678410530090332,
10809
+ "step": 720
10810
+ },
10811
+ {
10812
+ "epoch": 0.052421113857786826,
10813
+ "grad_norm": 9.901488374453038e-05,
10814
+ "learning_rate": 2.1895831107393482e-07,
10815
+ "logits/chosen": -0.9380213022232056,
10816
+ "logits/rejected": -0.931056022644043,
10817
+ "logps/chosen": -30.888587951660156,
10818
+ "logps/rejected": -218.29710388183594,
10819
+ "loss": 0.0,
10820
+ "rewards/accuracies": 1.0,
10821
+ "rewards/chosen": -0.3042806386947632,
10822
+ "rewards/margins": 14.971654891967773,
10823
+ "rewards/rejected": -15.275935173034668,
10824
+ "step": 721
10825
+ },
10826
+ {
10827
+ "epoch": 0.05249381997964229,
10828
+ "grad_norm": 0.00036812620237469673,
10829
+ "learning_rate": 2.1751649828753106e-07,
10830
+ "logits/chosen": -0.8787797093391418,
10831
+ "logits/rejected": -0.923054575920105,
10832
+ "logps/chosen": -35.658294677734375,
10833
+ "logps/rejected": -209.59725952148438,
10834
+ "loss": 0.0,
10835
+ "rewards/accuracies": 1.0,
10836
+ "rewards/chosen": -0.585743248462677,
10837
+ "rewards/margins": 14.103273391723633,
10838
+ "rewards/rejected": -14.689016342163086,
10839
+ "step": 722
10840
+ },
10841
+ {
10842
+ "epoch": 0.05256652610149774,
10843
+ "grad_norm": 0.007818679325282574,
10844
+ "learning_rate": 2.160781274734495e-07,
10845
+ "logits/chosen": -0.8768399357795715,
10846
+ "logits/rejected": -0.8340914845466614,
10847
+ "logps/chosen": -32.2601318359375,
10848
+ "logps/rejected": -211.66159057617188,
10849
+ "loss": 0.0001,
10850
+ "rewards/accuracies": 1.0,
10851
+ "rewards/chosen": -0.616025447845459,
10852
+ "rewards/margins": 13.163147926330566,
10853
+ "rewards/rejected": -13.779172897338867,
10854
+ "step": 723
10855
+ },
10856
+ {
10857
+ "epoch": 0.052639232223353205,
10858
+ "grad_norm": 0.013885089196264744,
10859
+ "learning_rate": 2.146432161577842e-07,
10860
+ "logits/chosen": -0.9050265550613403,
10861
+ "logits/rejected": -0.8358237147331238,
10862
+ "logps/chosen": -40.09930419921875,
10863
+ "logps/rejected": -208.87554931640625,
10864
+ "loss": 0.0002,
10865
+ "rewards/accuracies": 1.0,
10866
+ "rewards/chosen": -0.6807125210762024,
10867
+ "rewards/margins": 12.531813621520996,
10868
+ "rewards/rejected": -13.212526321411133,
10869
+ "step": 724
10870
+ },
10871
+ {
10872
+ "epoch": 0.05271193834520867,
10873
+ "grad_norm": 0.00024435605155304074,
10874
+ "learning_rate": 2.1321178182447709e-07,
10875
+ "logits/chosen": -0.950187087059021,
10876
+ "logits/rejected": -0.9424600601196289,
10877
+ "logps/chosen": -40.063987731933594,
10878
+ "logps/rejected": -214.86441040039062,
10879
+ "loss": 0.0,
10880
+ "rewards/accuracies": 1.0,
10881
+ "rewards/chosen": -0.8616589307785034,
10882
+ "rewards/margins": 14.418479919433594,
10883
+ "rewards/rejected": -15.280138969421387,
10884
+ "step": 725
10885
+ },
10886
+ {
10887
+ "epoch": 0.05278464446706413,
10888
+ "grad_norm": 0.0031122479122132063,
10889
+ "learning_rate": 2.117838419151034e-07,
10890
+ "logits/chosen": -0.9120379686355591,
10891
+ "logits/rejected": -0.9193058609962463,
10892
+ "logps/chosen": -36.915550231933594,
10893
+ "logps/rejected": -212.9740753173828,
10894
+ "loss": 0.0,
10895
+ "rewards/accuracies": 1.0,
10896
+ "rewards/chosen": -0.30296823382377625,
10897
+ "rewards/margins": 13.31496524810791,
10898
+ "rewards/rejected": -13.61793327331543,
10899
+ "step": 726
10900
+ },
10901
+ {
10902
+ "epoch": 0.052857350588919584,
10903
+ "grad_norm": 0.0017582379514351487,
10904
+ "learning_rate": 2.1035941382866067e-07,
10905
+ "logits/chosen": -0.9938796162605286,
10906
+ "logits/rejected": -0.882668137550354,
10907
+ "logps/chosen": -28.024808883666992,
10908
+ "logps/rejected": -203.543212890625,
10909
+ "loss": 0.0,
10910
+ "rewards/accuracies": 1.0,
10911
+ "rewards/chosen": -0.15884625911712646,
10912
+ "rewards/margins": 12.8031644821167,
10913
+ "rewards/rejected": -12.962010383605957,
10914
+ "step": 727
10915
+ },
10916
+ {
10917
+ "epoch": 0.052930056710775046,
10918
+ "grad_norm": 0.0002076653327094391,
10919
+ "learning_rate": 2.0893851492135532e-07,
10920
+ "logits/chosen": -0.9264384508132935,
10921
+ "logits/rejected": -0.9043711423873901,
10922
+ "logps/chosen": -41.037567138671875,
10923
+ "logps/rejected": -213.83316040039062,
10924
+ "loss": 0.0,
10925
+ "rewards/accuracies": 1.0,
10926
+ "rewards/chosen": -1.0929769277572632,
10927
+ "rewards/margins": 14.023452758789062,
10928
+ "rewards/rejected": -15.116429328918457,
10929
+ "step": 728
10930
+ },
10931
+ {
10932
+ "epoch": 0.05300276283263051,
10933
+ "grad_norm": 0.0037191887386143208,
10934
+ "learning_rate": 2.0752116250639224e-07,
10935
+ "logits/chosen": -0.9239534735679626,
10936
+ "logits/rejected": -0.8673202395439148,
10937
+ "logps/chosen": -30.643512725830078,
10938
+ "logps/rejected": -217.33995056152344,
10939
+ "loss": 0.0,
10940
+ "rewards/accuracies": 1.0,
10941
+ "rewards/chosen": -0.34290575981140137,
10942
+ "rewards/margins": 13.718175888061523,
10943
+ "rewards/rejected": -14.06108283996582,
10944
+ "step": 729
10945
+ },
10946
+ {
10947
+ "epoch": 0.05307546895448597,
10948
+ "grad_norm": 0.0008325205999426544,
10949
+ "learning_rate": 2.0610737385376348e-07,
10950
+ "logits/chosen": -0.8706562519073486,
10951
+ "logits/rejected": -0.8877383470535278,
10952
+ "logps/chosen": -41.10457992553711,
10953
+ "logps/rejected": -212.40354919433594,
10954
+ "loss": 0.0,
10955
+ "rewards/accuracies": 1.0,
10956
+ "rewards/chosen": -0.8662700057029724,
10957
+ "rewards/margins": 14.034844398498535,
10958
+ "rewards/rejected": -14.901114463806152,
10959
+ "step": 730
10960
+ },
10961
+ {
10962
+ "epoch": 0.053148175076341425,
10963
+ "grad_norm": 0.003004083875566721,
10964
+ "learning_rate": 2.0469716619003723e-07,
10965
+ "logits/chosen": -0.9021568894386292,
10966
+ "logits/rejected": -0.8215603828430176,
10967
+ "logps/chosen": -28.95623779296875,
10968
+ "logps/rejected": -213.17466735839844,
10969
+ "loss": 0.0,
10970
+ "rewards/accuracies": 1.0,
10971
+ "rewards/chosen": -0.12656313180923462,
10972
+ "rewards/margins": 14.443097114562988,
10973
+ "rewards/rejected": -14.569660186767578,
10974
+ "step": 731
10975
+ },
10976
+ {
10977
+ "epoch": 0.05322088119819689,
10978
+ "grad_norm": 0.0017041056416928768,
10979
+ "learning_rate": 2.0329055669814933e-07,
10980
+ "logits/chosen": -1.0070698261260986,
10981
+ "logits/rejected": -0.891922116279602,
10982
+ "logps/chosen": -30.297428131103516,
10983
+ "logps/rejected": -210.99365234375,
10984
+ "loss": 0.0,
10985
+ "rewards/accuracies": 1.0,
10986
+ "rewards/chosen": -0.461770236492157,
10987
+ "rewards/margins": 13.198616027832031,
10988
+ "rewards/rejected": -13.66038703918457,
10989
+ "step": 732
10990
+ },
10991
+ {
10992
+ "epoch": 0.05329358732005235,
10993
+ "grad_norm": 0.004877008497714996,
10994
+ "learning_rate": 2.0188756251719203e-07,
10995
+ "logits/chosen": -1.0166568756103516,
10996
+ "logits/rejected": -0.9349803924560547,
10997
+ "logps/chosen": -35.411537170410156,
10998
+ "logps/rejected": -214.6336669921875,
10999
+ "loss": 0.0001,
11000
+ "rewards/accuracies": 1.0,
11001
+ "rewards/chosen": -0.6040887832641602,
11002
+ "rewards/margins": 13.180540084838867,
11003
+ "rewards/rejected": -13.784629821777344,
11004
+ "step": 733
11005
+ },
11006
+ {
11007
+ "epoch": 0.05336629344190781,
11008
+ "grad_norm": 0.001830337685532868,
11009
+ "learning_rate": 2.0048820074220711e-07,
11010
+ "logits/chosen": -0.8823634386062622,
11011
+ "logits/rejected": -0.7977582216262817,
11012
+ "logps/chosen": -27.982765197753906,
11013
+ "logps/rejected": -199.20285034179688,
11014
+ "loss": 0.0,
11015
+ "rewards/accuracies": 1.0,
11016
+ "rewards/chosen": -0.13698601722717285,
11017
+ "rewards/margins": 12.950643539428711,
11018
+ "rewards/rejected": -13.087629318237305,
11019
+ "step": 734
11020
+ },
11021
+ {
11022
+ "epoch": 0.053438999563763266,
11023
+ "grad_norm": 0.0004967046552337706,
11024
+ "learning_rate": 1.990924884239758e-07,
11025
+ "logits/chosen": -0.909273087978363,
11026
+ "logits/rejected": -0.8297127485275269,
11027
+ "logps/chosen": -35.87456130981445,
11028
+ "logps/rejected": -210.33042907714844,
11029
+ "loss": 0.0,
11030
+ "rewards/accuracies": 1.0,
11031
+ "rewards/chosen": -0.3381763696670532,
11032
+ "rewards/margins": 13.830402374267578,
11033
+ "rewards/rejected": -14.168578147888184,
11034
+ "step": 735
11035
+ },
11036
+ {
11037
+ "epoch": 0.05351170568561873,
11038
+ "grad_norm": 0.0003948746307287365,
11039
+ "learning_rate": 1.9770044256881258e-07,
11040
+ "logits/chosen": -0.9478728771209717,
11041
+ "logits/rejected": -0.8719102144241333,
11042
+ "logps/chosen": -34.23468017578125,
11043
+ "logps/rejected": -210.3759765625,
11044
+ "loss": 0.0,
11045
+ "rewards/accuracies": 1.0,
11046
+ "rewards/chosen": -0.6024740934371948,
11047
+ "rewards/margins": 13.7274169921875,
11048
+ "rewards/rejected": -14.329891204833984,
11049
+ "step": 736
11050
+ },
11051
+ {
11052
+ "epoch": 0.05358441180747419,
11053
+ "grad_norm": 0.0023601241409778595,
11054
+ "learning_rate": 1.9631208013835676e-07,
11055
+ "logits/chosen": -0.9740806818008423,
11056
+ "logits/rejected": -0.9044991731643677,
11057
+ "logps/chosen": -41.01429748535156,
11058
+ "logps/rejected": -209.04383850097656,
11059
+ "loss": 0.0,
11060
+ "rewards/accuracies": 1.0,
11061
+ "rewards/chosen": -0.5482434034347534,
11062
+ "rewards/margins": 13.41301155090332,
11063
+ "rewards/rejected": -13.96125602722168,
11064
+ "step": 737
11065
+ },
11066
+ {
11067
+ "epoch": 0.05365711792932965,
11068
+ "grad_norm": 0.0020352157298475504,
11069
+ "learning_rate": 1.9492741804936618e-07,
11070
+ "logits/chosen": -0.8628606796264648,
11071
+ "logits/rejected": -0.7685221433639526,
11072
+ "logps/chosen": -40.9301643371582,
11073
+ "logps/rejected": -220.81875610351562,
11074
+ "loss": 0.0,
11075
+ "rewards/accuracies": 1.0,
11076
+ "rewards/chosen": -0.6600879430770874,
11077
+ "rewards/margins": 13.031375885009766,
11078
+ "rewards/rejected": -13.691463470458984,
11079
+ "step": 738
11080
+ },
11081
+ {
11082
+ "epoch": 0.05372982405118511,
11083
+ "grad_norm": 0.0009932757820934057,
11084
+ "learning_rate": 1.9354647317351187e-07,
11085
+ "logits/chosen": -0.865092396736145,
11086
+ "logits/rejected": -0.831990122795105,
11087
+ "logps/chosen": -38.46998596191406,
11088
+ "logps/rejected": -223.56800842285156,
11089
+ "loss": 0.0,
11090
+ "rewards/accuracies": 1.0,
11091
+ "rewards/chosen": -0.4226331412792206,
11092
+ "rewards/margins": 13.693107604980469,
11093
+ "rewards/rejected": -14.115740776062012,
11094
+ "step": 739
11095
+ },
11096
+ {
11097
+ "epoch": 0.05380253017304057,
11098
+ "grad_norm": 0.0022304505109786987,
11099
+ "learning_rate": 1.9216926233717084e-07,
11100
+ "logits/chosen": -0.9461253881454468,
11101
+ "logits/rejected": -0.9268235564231873,
11102
+ "logps/chosen": -29.67384910583496,
11103
+ "logps/rejected": -204.46505737304688,
11104
+ "loss": 0.0,
11105
+ "rewards/accuracies": 1.0,
11106
+ "rewards/chosen": -0.3023516833782196,
11107
+ "rewards/margins": 13.467647552490234,
11108
+ "rewards/rejected": -13.770000457763672,
11109
+ "step": 740
11110
+ },
11111
+ {
11112
+ "epoch": 0.05387523629489603,
11113
+ "grad_norm": 0.003809142392128706,
11114
+ "learning_rate": 1.90795802321223e-07,
11115
+ "logits/chosen": -0.8494369387626648,
11116
+ "logits/rejected": -0.9125988483428955,
11117
+ "logps/chosen": -32.53688049316406,
11118
+ "logps/rejected": -214.2470703125,
11119
+ "loss": 0.0001,
11120
+ "rewards/accuracies": 1.0,
11121
+ "rewards/chosen": -0.42231428623199463,
11122
+ "rewards/margins": 13.579572677612305,
11123
+ "rewards/rejected": -14.001887321472168,
11124
+ "step": 741
11125
+ },
11126
+ {
11127
+ "epoch": 0.05394794241675149,
11128
+ "grad_norm": 0.0017715893918648362,
11129
+ "learning_rate": 1.8942610986084484e-07,
11130
+ "logits/chosen": -1.00579833984375,
11131
+ "logits/rejected": -0.9136815071105957,
11132
+ "logps/chosen": -30.22631072998047,
11133
+ "logps/rejected": -202.64682006835938,
11134
+ "loss": 0.0,
11135
+ "rewards/accuracies": 1.0,
11136
+ "rewards/chosen": -0.23207417130470276,
11137
+ "rewards/margins": 12.629378318786621,
11138
+ "rewards/rejected": -12.86145305633545,
11139
+ "step": 742
11140
+ },
11141
+ {
11142
+ "epoch": 0.05402064853860695,
11143
+ "grad_norm": 0.0003675991320051253,
11144
+ "learning_rate": 1.8806020164530701e-07,
11145
+ "logits/chosen": -0.8189449310302734,
11146
+ "logits/rejected": -0.8303515911102295,
11147
+ "logps/chosen": -39.320465087890625,
11148
+ "logps/rejected": -218.82669067382812,
11149
+ "loss": 0.0,
11150
+ "rewards/accuracies": 1.0,
11151
+ "rewards/chosen": -0.5943813323974609,
11152
+ "rewards/margins": 14.660420417785645,
11153
+ "rewards/rejected": -15.254801750183105,
11154
+ "step": 743
11155
+ },
11156
+ {
11157
+ "epoch": 0.05409335466046241,
11158
+ "grad_norm": 0.01240138616412878,
11159
+ "learning_rate": 1.8669809431776988e-07,
11160
+ "logits/chosen": -1.0041861534118652,
11161
+ "logits/rejected": -0.8971571922302246,
11162
+ "logps/chosen": -28.070751190185547,
11163
+ "logps/rejected": -209.87245178222656,
11164
+ "loss": 0.0002,
11165
+ "rewards/accuracies": 1.0,
11166
+ "rewards/chosen": -0.11745762825012207,
11167
+ "rewards/margins": 12.85346794128418,
11168
+ "rewards/rejected": -12.970926284790039,
11169
+ "step": 744
11170
+ },
11171
+ {
11172
+ "epoch": 0.05416606078231787,
11173
+ "grad_norm": 0.0025072619318962097,
11174
+ "learning_rate": 1.8533980447508135e-07,
11175
+ "logits/chosen": -0.9117828607559204,
11176
+ "logits/rejected": -0.8178045153617859,
11177
+ "logps/chosen": -35.66990661621094,
11178
+ "logps/rejected": -205.7391357421875,
11179
+ "loss": 0.0,
11180
+ "rewards/accuracies": 1.0,
11181
+ "rewards/chosen": -0.38360828161239624,
11182
+ "rewards/margins": 12.453069686889648,
11183
+ "rewards/rejected": -12.836677551269531,
11184
+ "step": 745
11185
+ },
11186
+ {
11187
+ "epoch": 0.054238766904173334,
11188
+ "grad_norm": 0.0012046655174344778,
11189
+ "learning_rate": 1.8398534866757455e-07,
11190
+ "logits/chosen": -0.8388931155204773,
11191
+ "logits/rejected": -0.8091910481452942,
11192
+ "logps/chosen": -32.421051025390625,
11193
+ "logps/rejected": -217.2982940673828,
11194
+ "loss": 0.0,
11195
+ "rewards/accuracies": 1.0,
11196
+ "rewards/chosen": -0.3685145080089569,
11197
+ "rewards/margins": 14.191152572631836,
11198
+ "rewards/rejected": -14.559667587280273,
11199
+ "step": 746
11200
+ },
11201
+ {
11202
+ "epoch": 0.05431147302602879,
11203
+ "grad_norm": 0.008580892346799374,
11204
+ "learning_rate": 1.8263474339886624e-07,
11205
+ "logits/chosen": -1.011499047279358,
11206
+ "logits/rejected": -0.9227244853973389,
11207
+ "logps/chosen": -33.962013244628906,
11208
+ "logps/rejected": -208.20162963867188,
11209
+ "loss": 0.0001,
11210
+ "rewards/accuracies": 1.0,
11211
+ "rewards/chosen": -0.379577100276947,
11212
+ "rewards/margins": 12.571484565734863,
11213
+ "rewards/rejected": -12.951061248779297,
11214
+ "step": 747
11215
+ },
11216
+ {
11217
+ "epoch": 0.05438417914788425,
11218
+ "grad_norm": 0.0072589050978422165,
11219
+ "learning_rate": 1.812880051256551e-07,
11220
+ "logits/chosen": -0.9485992789268494,
11221
+ "logits/rejected": -0.9038834571838379,
11222
+ "logps/chosen": -30.243196487426758,
11223
+ "logps/rejected": -204.98263549804688,
11224
+ "loss": 0.0001,
11225
+ "rewards/accuracies": 1.0,
11226
+ "rewards/chosen": -0.45122310519218445,
11227
+ "rewards/margins": 12.676835060119629,
11228
+ "rewards/rejected": -13.128058433532715,
11229
+ "step": 748
11230
+ },
11231
+ {
11232
+ "epoch": 0.05445688526973971,
11233
+ "grad_norm": 0.0006042845197953284,
11234
+ "learning_rate": 1.7994515025752216e-07,
11235
+ "logits/chosen": -0.8617667555809021,
11236
+ "logits/rejected": -0.9311653971672058,
11237
+ "logps/chosen": -42.464134216308594,
11238
+ "logps/rejected": -213.90817260742188,
11239
+ "loss": 0.0,
11240
+ "rewards/accuracies": 1.0,
11241
+ "rewards/chosen": -0.7296816110610962,
11242
+ "rewards/margins": 13.28490924835205,
11243
+ "rewards/rejected": -14.014591217041016,
11244
+ "step": 749
11245
+ },
11246
+ {
11247
+ "epoch": 0.054529591391595175,
11248
+ "grad_norm": 0.008451288565993309,
11249
+ "learning_rate": 1.7860619515673032e-07,
11250
+ "logits/chosen": -0.8343260288238525,
11251
+ "logits/rejected": -0.9304801821708679,
11252
+ "logps/chosen": -36.72785186767578,
11253
+ "logps/rejected": -206.89028930664062,
11254
+ "loss": 0.0,
11255
+ "rewards/accuracies": 1.0,
11256
+ "rewards/chosen": -0.651132345199585,
11257
+ "rewards/margins": 12.767133712768555,
11258
+ "rewards/rejected": -13.418266296386719,
11259
+ "step": 750
11260
+ },
11261
+ {
11262
+ "epoch": 0.05460229751345063,
11263
+ "grad_norm": 0.0019508537370711565,
11264
+ "learning_rate": 1.7727115613802464e-07,
11265
+ "logits/chosen": -0.9755252599716187,
11266
+ "logits/rejected": -0.9243016242980957,
11267
+ "logps/chosen": -31.149749755859375,
11268
+ "logps/rejected": -215.17953491210938,
11269
+ "loss": 0.0,
11270
+ "rewards/accuracies": 1.0,
11271
+ "rewards/chosen": -0.1917463093996048,
11272
+ "rewards/margins": 13.494813919067383,
11273
+ "rewards/rejected": -13.686559677124023,
11274
+ "step": 751
11275
+ },
11276
+ {
11277
+ "epoch": 0.05467500363530609,
11278
+ "grad_norm": 0.013230530545115471,
11279
+ "learning_rate": 1.7594004946843454e-07,
11280
+ "logits/chosen": -0.8957071304321289,
11281
+ "logits/rejected": -0.8952853083610535,
11282
+ "logps/chosen": -37.80425262451172,
11283
+ "logps/rejected": -213.73846435546875,
11284
+ "loss": 0.0002,
11285
+ "rewards/accuracies": 1.0,
11286
+ "rewards/chosen": -0.5001394152641296,
11287
+ "rewards/margins": 14.075218200683594,
11288
+ "rewards/rejected": -14.575357437133789,
11289
+ "step": 752
11290
+ },
11291
+ {
11292
+ "epoch": 0.054747709757161554,
11293
+ "grad_norm": 0.010208229534327984,
11294
+ "learning_rate": 1.7461289136707457e-07,
11295
+ "logits/chosen": -0.9123841524124146,
11296
+ "logits/rejected": -0.8014664053916931,
11297
+ "logps/chosen": -32.373016357421875,
11298
+ "logps/rejected": -211.44223022460938,
11299
+ "loss": 0.0001,
11300
+ "rewards/accuracies": 1.0,
11301
+ "rewards/chosen": -0.5280441045761108,
11302
+ "rewards/margins": 13.349374771118164,
11303
+ "rewards/rejected": -13.877418518066406,
11304
+ "step": 753
11305
+ },
11306
+ {
11307
+ "epoch": 0.054820415879017016,
11308
+ "grad_norm": 0.005788872018456459,
11309
+ "learning_rate": 1.7328969800494726e-07,
11310
+ "logits/chosen": -0.951117753982544,
11311
+ "logits/rejected": -0.9061521291732788,
11312
+ "logps/chosen": -26.266429901123047,
11313
+ "logps/rejected": -200.56845092773438,
11314
+ "loss": 0.0001,
11315
+ "rewards/accuracies": 1.0,
11316
+ "rewards/chosen": -0.18065418303012848,
11317
+ "rewards/margins": 12.40198040008545,
11318
+ "rewards/rejected": -12.582633972167969,
11319
+ "step": 754
11320
+ },
11321
+ {
11322
+ "epoch": 0.05489312200087247,
11323
+ "grad_norm": 0.003130243858322501,
11324
+ "learning_rate": 1.7197048550474641e-07,
11325
+ "logits/chosen": -0.9353317618370056,
11326
+ "logits/rejected": -0.8683757781982422,
11327
+ "logps/chosen": -31.96941566467285,
11328
+ "logps/rejected": -217.26443481445312,
11329
+ "loss": 0.0,
11330
+ "rewards/accuracies": 1.0,
11331
+ "rewards/chosen": -0.1149619072675705,
11332
+ "rewards/margins": 14.614456176757812,
11333
+ "rewards/rejected": -14.729418754577637,
11334
+ "step": 755
11335
+ },
11336
+ {
11337
+ "epoch": 0.05496582812272793,
11338
+ "grad_norm": 0.0008835052140057087,
11339
+ "learning_rate": 1.7065526994065972e-07,
11340
+ "logits/chosen": -0.9726742506027222,
11341
+ "logits/rejected": -0.8771126866340637,
11342
+ "logps/chosen": -43.78021240234375,
11343
+ "logps/rejected": -221.291748046875,
11344
+ "loss": 0.0,
11345
+ "rewards/accuracies": 1.0,
11346
+ "rewards/chosen": -1.2411898374557495,
11347
+ "rewards/margins": 13.419130325317383,
11348
+ "rewards/rejected": -14.660320281982422,
11349
+ "step": 756
11350
+ },
11351
+ {
11352
+ "epoch": 0.055038534244583395,
11353
+ "grad_norm": 0.00016662158304825425,
11354
+ "learning_rate": 1.6934406733817413e-07,
11355
+ "logits/chosen": -0.8647419214248657,
11356
+ "logits/rejected": -0.8561787605285645,
11357
+ "logps/chosen": -32.77350616455078,
11358
+ "logps/rejected": -215.56143188476562,
11359
+ "loss": 0.0,
11360
+ "rewards/accuracies": 1.0,
11361
+ "rewards/chosen": -0.3826359212398529,
11362
+ "rewards/margins": 14.84445571899414,
11363
+ "rewards/rejected": -15.227091789245605,
11364
+ "step": 757
11365
+ },
11366
+ {
11367
+ "epoch": 0.05511124036643886,
11368
+ "grad_norm": 0.003062991425395012,
11369
+ "learning_rate": 1.6803689367387918e-07,
11370
+ "logits/chosen": -0.909042477607727,
11371
+ "logits/rejected": -0.8357021808624268,
11372
+ "logps/chosen": -39.56062316894531,
11373
+ "logps/rejected": -203.7021026611328,
11374
+ "loss": 0.0001,
11375
+ "rewards/accuracies": 1.0,
11376
+ "rewards/chosen": -0.46654921770095825,
11377
+ "rewards/margins": 12.062686920166016,
11378
+ "rewards/rejected": -12.52923583984375,
11379
+ "step": 758
11380
+ },
11381
+ {
11382
+ "epoch": 0.05518394648829431,
11383
+ "grad_norm": 0.04407789930701256,
11384
+ "learning_rate": 1.667337648752738e-07,
11385
+ "logits/chosen": -0.9962819814682007,
11386
+ "logits/rejected": -0.8614116907119751,
11387
+ "logps/chosen": -37.062164306640625,
11388
+ "logps/rejected": -201.96527099609375,
11389
+ "loss": 0.0006,
11390
+ "rewards/accuracies": 1.0,
11391
+ "rewards/chosen": -0.6556903123855591,
11392
+ "rewards/margins": 11.274649620056152,
11393
+ "rewards/rejected": -11.930339813232422,
11394
+ "step": 759
11395
+ },
11396
+ {
11397
+ "epoch": 0.055256652610149774,
11398
+ "grad_norm": 0.008902635425329208,
11399
+ "learning_rate": 1.6543469682057104e-07,
11400
+ "logits/chosen": -0.967126190662384,
11401
+ "logits/rejected": -0.8661681413650513,
11402
+ "logps/chosen": -24.940128326416016,
11403
+ "logps/rejected": -202.6082000732422,
11404
+ "loss": 0.0001,
11405
+ "rewards/accuracies": 1.0,
11406
+ "rewards/chosen": -0.12640663981437683,
11407
+ "rewards/margins": 11.179431915283203,
11408
+ "rewards/rejected": -11.305837631225586,
11409
+ "step": 760
11410
+ },
11411
+ {
11412
+ "epoch": 0.055329358732005236,
11413
+ "grad_norm": 0.001392183592543006,
11414
+ "learning_rate": 1.6413970533850497e-07,
11415
+ "logits/chosen": -0.9138966202735901,
11416
+ "logits/rejected": -0.8320655822753906,
11417
+ "logps/chosen": -32.464195251464844,
11418
+ "logps/rejected": -213.43788146972656,
11419
+ "loss": 0.0,
11420
+ "rewards/accuracies": 1.0,
11421
+ "rewards/chosen": -0.3245856463909149,
11422
+ "rewards/margins": 13.77605152130127,
11423
+ "rewards/rejected": -14.100637435913086,
11424
+ "step": 761
11425
+ },
11426
+ {
11427
+ "epoch": 0.0554020648538607,
11428
+ "grad_norm": 0.0030789838638156652,
11429
+ "learning_rate": 1.6284880620813846e-07,
11430
+ "logits/chosen": -0.9797265529632568,
11431
+ "logits/rejected": -0.8685609102249146,
11432
+ "logps/chosen": -28.6915283203125,
11433
+ "logps/rejected": -204.46298217773438,
11434
+ "loss": 0.0,
11435
+ "rewards/accuracies": 1.0,
11436
+ "rewards/chosen": 0.10937747359275818,
11437
+ "rewards/margins": 12.886858940124512,
11438
+ "rewards/rejected": -12.777481079101562,
11439
+ "step": 762
11440
+ },
11441
+ {
11442
+ "epoch": 0.05547477097571615,
11443
+ "grad_norm": 0.00035047787241637707,
11444
+ "learning_rate": 1.6156201515866968e-07,
11445
+ "logits/chosen": -0.9586347341537476,
11446
+ "logits/rejected": -0.9675611257553101,
11447
+ "logps/chosen": -40.65100860595703,
11448
+ "logps/rejected": -220.50894165039062,
11449
+ "loss": 0.0,
11450
+ "rewards/accuracies": 1.0,
11451
+ "rewards/chosen": -0.5836011171340942,
11452
+ "rewards/margins": 14.78853988647461,
11453
+ "rewards/rejected": -15.372140884399414,
11454
+ "step": 763
11455
+ },
11456
+ {
11457
+ "epoch": 0.055547477097571615,
11458
+ "grad_norm": 0.021464752033352852,
11459
+ "learning_rate": 1.6027934786924185e-07,
11460
+ "logits/chosen": -0.96466064453125,
11461
+ "logits/rejected": -0.8601709604263306,
11462
+ "logps/chosen": -31.03888511657715,
11463
+ "logps/rejected": -202.77810668945312,
11464
+ "loss": 0.0003,
11465
+ "rewards/accuracies": 1.0,
11466
+ "rewards/chosen": -0.11492705345153809,
11467
+ "rewards/margins": 12.924112319946289,
11468
+ "rewards/rejected": -13.039039611816406,
11469
+ "step": 764
11470
+ },
11471
+ {
11472
+ "epoch": 0.05562018321942708,
11473
+ "grad_norm": 0.00018579527386464179,
11474
+ "learning_rate": 1.590008199687508e-07,
11475
+ "logits/chosen": -0.87689208984375,
11476
+ "logits/rejected": -0.8554306030273438,
11477
+ "logps/chosen": -35.217952728271484,
11478
+ "logps/rejected": -208.33447265625,
11479
+ "loss": 0.0,
11480
+ "rewards/accuracies": 1.0,
11481
+ "rewards/chosen": -0.5234267711639404,
11482
+ "rewards/margins": 14.254180908203125,
11483
+ "rewards/rejected": -14.777606964111328,
11484
+ "step": 765
11485
+ },
11486
+ {
11487
+ "epoch": 0.05569288934128254,
11488
+ "grad_norm": 0.006527530495077372,
11489
+ "learning_rate": 1.5772644703565564e-07,
11490
+ "logits/chosen": -0.934159517288208,
11491
+ "logits/rejected": -0.8871695399284363,
11492
+ "logps/chosen": -38.746253967285156,
11493
+ "logps/rejected": -223.29010009765625,
11494
+ "loss": 0.0001,
11495
+ "rewards/accuracies": 1.0,
11496
+ "rewards/chosen": -0.7018031477928162,
11497
+ "rewards/margins": 12.746376991271973,
11498
+ "rewards/rejected": -13.448179244995117,
11499
+ "step": 766
11500
+ },
11501
+ {
11502
+ "epoch": 0.055765595463137994,
11503
+ "grad_norm": 0.010887491516768932,
11504
+ "learning_rate": 1.5645624459778855e-07,
11505
+ "logits/chosen": -0.8821107149124146,
11506
+ "logits/rejected": -0.8527417182922363,
11507
+ "logps/chosen": -37.610591888427734,
11508
+ "logps/rejected": -212.83218383789062,
11509
+ "loss": 0.0001,
11510
+ "rewards/accuracies": 1.0,
11511
+ "rewards/chosen": -0.8018917441368103,
11512
+ "rewards/margins": 13.662994384765625,
11513
+ "rewards/rejected": -14.464885711669922,
11514
+ "step": 767
11515
+ },
11516
+ {
11517
+ "epoch": 0.055838301584993456,
11518
+ "grad_norm": 0.001788746565580368,
11519
+ "learning_rate": 1.551902281321651e-07,
11520
+ "logits/chosen": -0.9478468894958496,
11521
+ "logits/rejected": -0.9769448637962341,
11522
+ "logps/chosen": -32.67488098144531,
11523
+ "logps/rejected": -209.9729461669922,
11524
+ "loss": 0.0,
11525
+ "rewards/accuracies": 1.0,
11526
+ "rewards/chosen": -0.40322765707969666,
11527
+ "rewards/margins": 14.15975570678711,
11528
+ "rewards/rejected": -14.562983512878418,
11529
+ "step": 768
11530
+ },
11531
+ {
11532
+ "epoch": 0.05591100770684892,
11533
+ "grad_norm": 0.008931302465498447,
11534
+ "learning_rate": 1.5392841306479666e-07,
11535
+ "logits/chosen": -0.9474010467529297,
11536
+ "logits/rejected": -0.8884421586990356,
11537
+ "logps/chosen": -34.60919189453125,
11538
+ "logps/rejected": -211.77670288085938,
11539
+ "loss": 0.0001,
11540
+ "rewards/accuracies": 1.0,
11541
+ "rewards/chosen": -0.359250545501709,
11542
+ "rewards/margins": 12.960168838500977,
11543
+ "rewards/rejected": -13.319419860839844,
11544
+ "step": 769
11545
+ },
11546
+ {
11547
+ "epoch": 0.05598371382870438,
11548
+ "grad_norm": 0.0068222894333302975,
11549
+ "learning_rate": 1.5267081477050131e-07,
11550
+ "logits/chosen": -0.891141414642334,
11551
+ "logits/rejected": -0.9084587097167969,
11552
+ "logps/chosen": -41.72639083862305,
11553
+ "logps/rejected": -210.28097534179688,
11554
+ "loss": 0.0001,
11555
+ "rewards/accuracies": 1.0,
11556
+ "rewards/chosen": -0.5299360156059265,
11557
+ "rewards/margins": 13.119318962097168,
11558
+ "rewards/rejected": -13.64925479888916,
11559
+ "step": 770
11560
+ },
11561
+ {
11562
+ "epoch": 0.056056419950559835,
11563
+ "grad_norm": 9.367970051243901e-05,
11564
+ "learning_rate": 1.5141744857271778e-07,
11565
+ "logits/chosen": -0.913861095905304,
11566
+ "logits/rejected": -0.8445248603820801,
11567
+ "logps/chosen": -33.63587951660156,
11568
+ "logps/rejected": -225.3160858154297,
11569
+ "loss": 0.0,
11570
+ "rewards/accuracies": 1.0,
11571
+ "rewards/chosen": -0.6350897550582886,
11572
+ "rewards/margins": 15.599540710449219,
11573
+ "rewards/rejected": -16.234630584716797,
11574
+ "step": 771
11575
+ },
11576
+ {
11577
+ "epoch": 0.0561291260724153,
11578
+ "grad_norm": 0.00025686310254968703,
11579
+ "learning_rate": 1.5016832974331723e-07,
11580
+ "logits/chosen": -0.9397752285003662,
11581
+ "logits/rejected": -0.8799442052841187,
11582
+ "logps/chosen": -34.88556671142578,
11583
+ "logps/rejected": -216.75021362304688,
11584
+ "loss": 0.0,
11585
+ "rewards/accuracies": 1.0,
11586
+ "rewards/chosen": -0.5901429653167725,
11587
+ "rewards/margins": 14.332117080688477,
11588
+ "rewards/rejected": -14.922258377075195,
11589
+ "step": 772
11590
+ },
11591
+ {
11592
+ "epoch": 0.05620183219427076,
11593
+ "grad_norm": 0.0031295663211494684,
11594
+ "learning_rate": 1.489234735024188e-07,
11595
+ "logits/chosen": -0.9795909523963928,
11596
+ "logits/rejected": -0.8580805063247681,
11597
+ "logps/chosen": -33.576663970947266,
11598
+ "logps/rejected": -205.09866333007812,
11599
+ "loss": 0.0,
11600
+ "rewards/accuracies": 1.0,
11601
+ "rewards/chosen": -0.19408807158470154,
11602
+ "rewards/margins": 13.219499588012695,
11603
+ "rewards/rejected": -13.41358757019043,
11604
+ "step": 773
11605
+ },
11606
+ {
11607
+ "epoch": 0.056274538316126214,
11608
+ "grad_norm": 0.0016190169844776392,
11609
+ "learning_rate": 1.4768289501820263e-07,
11610
+ "logits/chosen": -0.9007223844528198,
11611
+ "logits/rejected": -0.8394637703895569,
11612
+ "logps/chosen": -34.12432861328125,
11613
+ "logps/rejected": -207.40000915527344,
11614
+ "loss": 0.0,
11615
+ "rewards/accuracies": 1.0,
11616
+ "rewards/chosen": -0.3453722894191742,
11617
+ "rewards/margins": 12.839717864990234,
11618
+ "rewards/rejected": -13.185091018676758,
11619
+ "step": 774
11620
+ },
11621
+ {
11622
+ "epoch": 0.056347244437981676,
11623
+ "grad_norm": 0.00919532310217619,
11624
+ "learning_rate": 1.4644660940672627e-07,
11625
+ "logits/chosen": -0.9666440486907959,
11626
+ "logits/rejected": -0.8888868093490601,
11627
+ "logps/chosen": -35.73973846435547,
11628
+ "logps/rejected": -201.26190185546875,
11629
+ "loss": 0.0001,
11630
+ "rewards/accuracies": 1.0,
11631
+ "rewards/chosen": -0.6386173367500305,
11632
+ "rewards/margins": 11.141023635864258,
11633
+ "rewards/rejected": -11.779642105102539,
11634
+ "step": 775
11635
+ },
11636
+ {
11637
+ "epoch": 0.05641995055983714,
11638
+ "grad_norm": 0.0018441978609189391,
11639
+ "learning_rate": 1.4521463173173965e-07,
11640
+ "logits/chosen": -0.8597419261932373,
11641
+ "logits/rejected": -0.8423570394515991,
11642
+ "logps/chosen": -35.59410858154297,
11643
+ "logps/rejected": -211.53579711914062,
11644
+ "loss": 0.0,
11645
+ "rewards/accuracies": 1.0,
11646
+ "rewards/chosen": -0.631655752658844,
11647
+ "rewards/margins": 13.613819122314453,
11648
+ "rewards/rejected": -14.245475769042969,
11649
+ "step": 776
11650
+ },
11651
+ {
11652
+ "epoch": 0.0564926566816926,
11653
+ "grad_norm": 0.002046742243692279,
11654
+ "learning_rate": 1.439869770045018e-07,
11655
+ "logits/chosen": -0.9244673252105713,
11656
+ "logits/rejected": -0.8332409858703613,
11657
+ "logps/chosen": -31.977285385131836,
11658
+ "logps/rejected": -212.346923828125,
11659
+ "loss": 0.0,
11660
+ "rewards/accuracies": 1.0,
11661
+ "rewards/chosen": -0.3353448212146759,
11662
+ "rewards/margins": 12.832916259765625,
11663
+ "rewards/rejected": -13.168261528015137,
11664
+ "step": 777
11665
+ },
11666
+ {
11667
+ "epoch": 0.056565362803548055,
11668
+ "grad_norm": 0.0026525191497057676,
11669
+ "learning_rate": 1.4276366018359842e-07,
11670
+ "logits/chosen": -0.9291462898254395,
11671
+ "logits/rejected": -0.8785039186477661,
11672
+ "logps/chosen": -34.03281784057617,
11673
+ "logps/rejected": -210.6335906982422,
11674
+ "loss": 0.0,
11675
+ "rewards/accuracies": 1.0,
11676
+ "rewards/chosen": -0.37746644020080566,
11677
+ "rewards/margins": 13.856457710266113,
11678
+ "rewards/rejected": -14.233924865722656,
11679
+ "step": 778
11680
+ },
11681
+ {
11682
+ "epoch": 0.05663806892540352,
11683
+ "grad_norm": 0.0008529649348929524,
11684
+ "learning_rate": 1.4154469617475862e-07,
11685
+ "logits/chosen": -0.9258161783218384,
11686
+ "logits/rejected": -0.8843492269515991,
11687
+ "logps/chosen": -31.135189056396484,
11688
+ "logps/rejected": -214.30499267578125,
11689
+ "loss": 0.0,
11690
+ "rewards/accuracies": 1.0,
11691
+ "rewards/chosen": -0.17117196321487427,
11692
+ "rewards/margins": 13.937726974487305,
11693
+ "rewards/rejected": -14.10890007019043,
11694
+ "step": 779
11695
+ },
11696
+ {
11697
+ "epoch": 0.05671077504725898,
11698
+ "grad_norm": 0.0008481541299261153,
11699
+ "learning_rate": 1.4033009983067452e-07,
11700
+ "logits/chosen": -0.8543636798858643,
11701
+ "logits/rejected": -0.9436533451080322,
11702
+ "logps/chosen": -35.73031997680664,
11703
+ "logps/rejected": -207.31524658203125,
11704
+ "loss": 0.0,
11705
+ "rewards/accuracies": 1.0,
11706
+ "rewards/chosen": -0.6781507134437561,
11707
+ "rewards/margins": 13.80234146118164,
11708
+ "rewards/rejected": -14.48049259185791,
11709
+ "step": 780
11710
+ },
11711
+ {
11712
+ "epoch": 0.05678348116911444,
11713
+ "grad_norm": 0.0035167636815458536,
11714
+ "learning_rate": 1.391198859508189e-07,
11715
+ "logits/chosen": -0.9763043522834778,
11716
+ "logits/rejected": -0.9388880729675293,
11717
+ "logps/chosen": -38.95911407470703,
11718
+ "logps/rejected": -223.01495361328125,
11719
+ "loss": 0.0,
11720
+ "rewards/accuracies": 1.0,
11721
+ "rewards/chosen": -0.8786532282829285,
11722
+ "rewards/margins": 14.221936225891113,
11723
+ "rewards/rejected": -15.100589752197266,
11724
+ "step": 781
11725
+ },
11726
+ {
11727
+ "epoch": 0.056856187290969896,
11728
+ "grad_norm": 0.0006581367924809456,
11729
+ "learning_rate": 1.3791406928126635e-07,
11730
+ "logits/chosen": -0.8602852821350098,
11731
+ "logits/rejected": -0.8619078993797302,
11732
+ "logps/chosen": -42.86963653564453,
11733
+ "logps/rejected": -219.94992065429688,
11734
+ "loss": 0.0,
11735
+ "rewards/accuracies": 1.0,
11736
+ "rewards/chosen": -0.9679461717605591,
11737
+ "rewards/margins": 14.3308687210083,
11738
+ "rewards/rejected": -15.29881477355957,
11739
+ "step": 782
11740
+ },
11741
+ {
11742
+ "epoch": 0.05692889341282536,
11743
+ "grad_norm": 0.0033537691924721003,
11744
+ "learning_rate": 1.3671266451451207e-07,
11745
+ "logits/chosen": -0.9410476684570312,
11746
+ "logits/rejected": -0.819915771484375,
11747
+ "logps/chosen": -32.9018669128418,
11748
+ "logps/rejected": -202.12039184570312,
11749
+ "loss": 0.0,
11750
+ "rewards/accuracies": 1.0,
11751
+ "rewards/chosen": -0.16996833682060242,
11752
+ "rewards/margins": 12.449856758117676,
11753
+ "rewards/rejected": -12.61982536315918,
11754
+ "step": 783
11755
+ },
11756
+ {
11757
+ "epoch": 0.05700159953468082,
11758
+ "grad_norm": 0.009281881153583527,
11759
+ "learning_rate": 1.3551568628929432e-07,
11760
+ "logits/chosen": -0.9356061220169067,
11761
+ "logits/rejected": -0.8372440934181213,
11762
+ "logps/chosen": -37.815330505371094,
11763
+ "logps/rejected": -205.18292236328125,
11764
+ "loss": 0.0001,
11765
+ "rewards/accuracies": 1.0,
11766
+ "rewards/chosen": -0.39503559470176697,
11767
+ "rewards/margins": 12.175322532653809,
11768
+ "rewards/rejected": -12.570358276367188,
11769
+ "step": 784
11770
+ },
11771
+ {
11772
+ "epoch": 0.05707430565653628,
11773
+ "grad_norm": 0.014241136610507965,
11774
+ "learning_rate": 1.3432314919041477e-07,
11775
+ "logits/chosen": -0.9060748219490051,
11776
+ "logits/rejected": -0.8896147012710571,
11777
+ "logps/chosen": -36.553627014160156,
11778
+ "logps/rejected": -205.4870147705078,
11779
+ "loss": 0.0001,
11780
+ "rewards/accuracies": 1.0,
11781
+ "rewards/chosen": -0.6540037393569946,
11782
+ "rewards/margins": 12.849777221679688,
11783
+ "rewards/rejected": -13.503782272338867,
11784
+ "step": 785
11785
+ },
11786
+ {
11787
+ "epoch": 0.05714701177839174,
11788
+ "grad_norm": 0.00046840065624564886,
11789
+ "learning_rate": 1.3313506774856175e-07,
11790
+ "logits/chosen": -0.8884440064430237,
11791
+ "logits/rejected": -0.9113964438438416,
11792
+ "logps/chosen": -38.097328186035156,
11793
+ "logps/rejected": -211.51486206054688,
11794
+ "loss": 0.0,
11795
+ "rewards/accuracies": 1.0,
11796
+ "rewards/chosen": -0.6025850772857666,
11797
+ "rewards/margins": 13.68801498413086,
11798
+ "rewards/rejected": -14.29059886932373,
11799
+ "step": 786
11800
+ },
11801
+ {
11802
+ "epoch": 0.0572197179002472,
11803
+ "grad_norm": 0.00023676814453210682,
11804
+ "learning_rate": 1.3195145644013283e-07,
11805
+ "logits/chosen": -0.8364005088806152,
11806
+ "logits/rejected": -0.8652154207229614,
11807
+ "logps/chosen": -41.36793518066406,
11808
+ "logps/rejected": -218.6131134033203,
11809
+ "loss": 0.0,
11810
+ "rewards/accuracies": 1.0,
11811
+ "rewards/chosen": -0.7971158027648926,
11812
+ "rewards/margins": 14.284409523010254,
11813
+ "rewards/rejected": -15.081525802612305,
11814
+ "step": 787
11815
+ },
11816
+ {
11817
+ "epoch": 0.05729242402210266,
11818
+ "grad_norm": 0.0007886055973358452,
11819
+ "learning_rate": 1.3077232968705805e-07,
11820
+ "logits/chosen": -0.8077453374862671,
11821
+ "logits/rejected": -0.8728396892547607,
11822
+ "logps/chosen": -34.755226135253906,
11823
+ "logps/rejected": -217.66848754882812,
11824
+ "loss": 0.0,
11825
+ "rewards/accuracies": 1.0,
11826
+ "rewards/chosen": -0.26428288221359253,
11827
+ "rewards/margins": 14.841293334960938,
11828
+ "rewards/rejected": -15.105575561523438,
11829
+ "step": 788
11830
+ },
11831
+ {
11832
+ "epoch": 0.057365130143958123,
11833
+ "grad_norm": 0.00012120642350055277,
11834
+ "learning_rate": 1.29597701856625e-07,
11835
+ "logits/chosen": -0.8904929161071777,
11836
+ "logits/rejected": -0.8933730125427246,
11837
+ "logps/chosen": -42.038604736328125,
11838
+ "logps/rejected": -223.13511657714844,
11839
+ "loss": 0.0,
11840
+ "rewards/accuracies": 1.0,
11841
+ "rewards/chosen": -0.9371490478515625,
11842
+ "rewards/margins": 15.016273498535156,
11843
+ "rewards/rejected": -15.953420639038086,
11844
+ "step": 789
11845
+ },
11846
+ {
11847
+ "epoch": 0.05743783626581358,
11848
+ "grad_norm": 0.006652898620814085,
11849
+ "learning_rate": 1.284275872613028e-07,
11850
+ "logits/chosen": -0.9450567960739136,
11851
+ "logits/rejected": -0.8114190697669983,
11852
+ "logps/chosen": -32.27555465698242,
11853
+ "logps/rejected": -207.89077758789062,
11854
+ "loss": 0.0001,
11855
+ "rewards/accuracies": 1.0,
11856
+ "rewards/chosen": -0.42420023679733276,
11857
+ "rewards/margins": 13.019515037536621,
11858
+ "rewards/rejected": -13.443716049194336,
11859
+ "step": 790
11860
+ },
11861
+ {
11862
+ "epoch": 0.05751054238766904,
11863
+ "grad_norm": 0.004501700401306152,
11864
+ "learning_rate": 1.2726200015856893e-07,
11865
+ "logits/chosen": -0.9678090810775757,
11866
+ "logits/rejected": -0.9044240117073059,
11867
+ "logps/chosen": -30.702655792236328,
11868
+ "logps/rejected": -215.24301147460938,
11869
+ "loss": 0.0001,
11870
+ "rewards/accuracies": 1.0,
11871
+ "rewards/chosen": -0.24800333380699158,
11872
+ "rewards/margins": 14.26740550994873,
11873
+ "rewards/rejected": -14.515409469604492,
11874
+ "step": 791
11875
+ },
11876
+ {
11877
+ "epoch": 0.0575832485095245,
11878
+ "grad_norm": 0.00010200103133684024,
11879
+ "learning_rate": 1.2610095475073413e-07,
11880
+ "logits/chosen": -0.9053033590316772,
11881
+ "logits/rejected": -0.9651377201080322,
11882
+ "logps/chosen": -38.61802291870117,
11883
+ "logps/rejected": -219.66586303710938,
11884
+ "loss": 0.0,
11885
+ "rewards/accuracies": 1.0,
11886
+ "rewards/chosen": -0.5994962453842163,
11887
+ "rewards/margins": 14.6649751663208,
11888
+ "rewards/rejected": -15.264471054077148,
11889
+ "step": 792
11890
+ },
11891
+ {
11892
+ "epoch": 0.057655954631379965,
11893
+ "grad_norm": 0.0016042115166783333,
11894
+ "learning_rate": 1.249444651847702e-07,
11895
+ "logits/chosen": -0.9351927042007446,
11896
+ "logits/rejected": -0.8913071155548096,
11897
+ "logps/chosen": -38.65888214111328,
11898
+ "logps/rejected": -211.62966918945312,
11899
+ "loss": 0.0,
11900
+ "rewards/accuracies": 1.0,
11901
+ "rewards/chosen": -0.8786839842796326,
11902
+ "rewards/margins": 13.222261428833008,
11903
+ "rewards/rejected": -14.100945472717285,
11904
+ "step": 793
11905
+ },
11906
+ {
11907
+ "epoch": 0.05772866075323542,
11908
+ "grad_norm": 0.000392068934161216,
11909
+ "learning_rate": 1.2379254555213786e-07,
11910
+ "logits/chosen": -0.9008168578147888,
11911
+ "logits/rejected": -0.7671511769294739,
11912
+ "logps/chosen": -31.751562118530273,
11913
+ "logps/rejected": -218.06961059570312,
11914
+ "loss": 0.0,
11915
+ "rewards/accuracies": 1.0,
11916
+ "rewards/chosen": -0.26216575503349304,
11917
+ "rewards/margins": 14.60870361328125,
11918
+ "rewards/rejected": -14.870868682861328,
11919
+ "step": 794
11920
+ },
11921
+ {
11922
+ "epoch": 0.05780136687509088,
11923
+ "grad_norm": 0.0012484568869695067,
11924
+ "learning_rate": 1.22645209888614e-07,
11925
+ "logits/chosen": -0.9315560460090637,
11926
+ "logits/rejected": -0.8799965381622314,
11927
+ "logps/chosen": -36.277191162109375,
11928
+ "logps/rejected": -210.5481719970703,
11929
+ "loss": 0.0,
11930
+ "rewards/accuracies": 1.0,
11931
+ "rewards/chosen": -0.527661919593811,
11932
+ "rewards/margins": 13.524513244628906,
11933
+ "rewards/rejected": -14.052175521850586,
11934
+ "step": 795
11935
+ },
11936
+ {
11937
+ "epoch": 0.057874072996946344,
11938
+ "grad_norm": 0.0004414519644342363,
11939
+ "learning_rate": 1.2150247217412185e-07,
11940
+ "logits/chosen": -0.9453125,
11941
+ "logits/rejected": -0.9239727854728699,
11942
+ "logps/chosen": -28.21062469482422,
11943
+ "logps/rejected": -213.19349670410156,
11944
+ "loss": 0.0,
11945
+ "rewards/accuracies": 1.0,
11946
+ "rewards/chosen": -0.16052374243736267,
11947
+ "rewards/margins": 14.973607063293457,
11948
+ "rewards/rejected": -15.134130477905273,
11949
+ "step": 796
11950
+ },
11951
+ {
11952
+ "epoch": 0.057946779118801806,
11953
+ "grad_norm": 0.0011588726192712784,
11954
+ "learning_rate": 1.203643463325596e-07,
11955
+ "logits/chosen": -0.9374755024909973,
11956
+ "logits/rejected": -0.8596886396408081,
11957
+ "logps/chosen": -39.49070739746094,
11958
+ "logps/rejected": -212.61399841308594,
11959
+ "loss": 0.0,
11960
+ "rewards/accuracies": 1.0,
11961
+ "rewards/chosen": -0.9445662498474121,
11962
+ "rewards/margins": 13.794650077819824,
11963
+ "rewards/rejected": -14.739216804504395,
11964
+ "step": 797
11965
+ },
11966
+ {
11967
+ "epoch": 0.05801948524065726,
11968
+ "grad_norm": 0.001562570221722126,
11969
+ "learning_rate": 1.192308462316317e-07,
11970
+ "logits/chosen": -0.9465897679328918,
11971
+ "logits/rejected": -0.8477259278297424,
11972
+ "logps/chosen": -39.65185546875,
11973
+ "logps/rejected": -216.62901306152344,
11974
+ "loss": 0.0,
11975
+ "rewards/accuracies": 1.0,
11976
+ "rewards/chosen": -0.4916737377643585,
11977
+ "rewards/margins": 14.508772850036621,
11978
+ "rewards/rejected": -15.000446319580078,
11979
+ "step": 798
11980
+ },
11981
+ {
11982
+ "epoch": 0.05809219136251272,
11983
+ "grad_norm": 0.00827076192945242,
11984
+ "learning_rate": 1.1810198568267903e-07,
11985
+ "logits/chosen": -0.9219031929969788,
11986
+ "logits/rejected": -0.9003797769546509,
11987
+ "logps/chosen": -33.286399841308594,
11988
+ "logps/rejected": -209.7589111328125,
11989
+ "loss": 0.0001,
11990
+ "rewards/accuracies": 1.0,
11991
+ "rewards/chosen": -0.6317225694656372,
11992
+ "rewards/margins": 13.434264183044434,
11993
+ "rewards/rejected": -14.065986633300781,
11994
+ "step": 799
11995
+ },
11996
+ {
11997
+ "epoch": 0.058164897484368185,
11998
+ "grad_norm": 0.005054752808064222,
11999
+ "learning_rate": 1.1697777844051104e-07,
12000
+ "logits/chosen": -0.9649146795272827,
12001
+ "logits/rejected": -0.8858678340911865,
12002
+ "logps/chosen": -39.712615966796875,
12003
+ "logps/rejected": -208.3673858642578,
12004
+ "loss": 0.0001,
12005
+ "rewards/accuracies": 1.0,
12006
+ "rewards/chosen": -0.6821295022964478,
12007
+ "rewards/margins": 11.669793128967285,
12008
+ "rewards/rejected": -12.351922988891602,
12009
+ "step": 800
12010
  }
12011
  ],
12012
  "logging_steps": 1,