{ "best_metric": null, "best_model_checkpoint": null, "epoch": 0.9874476987447699, "eval_steps": 500, "global_step": 59, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.02, "learning_rate": 8.333333333333333e-08, "logits/chosen": -2.8012306690216064, "logits/rejected": -2.7200045585632324, "logps/chosen": -308.75421142578125, "logps/pi_response": -233.9468231201172, "logps/ref_response": -233.9468231201172, "logps/rejected": -311.24969482421875, "loss": 0.6931, "rewards/accuracies": 0.0, "rewards/chosen": 0.0, "rewards/margins": 0.0, "rewards/rejected": 0.0, "step": 1 }, { "epoch": 0.17, "learning_rate": 4.930057285201027e-07, "logits/chosen": -2.7711262702941895, "logits/rejected": -2.709352731704712, "logps/chosen": -263.98291015625, "logps/pi_response": -193.27850341796875, "logps/ref_response": -193.61187744140625, "logps/rejected": -278.3876037597656, "loss": 0.69, "rewards/accuracies": 0.59375, "rewards/chosen": 0.011274036020040512, "rewards/margins": 0.006776580587029457, "rewards/rejected": 0.004497454967349768, "step": 10 }, { "epoch": 0.33, "learning_rate": 4.187457503795526e-07, "logits/chosen": -2.811276912689209, "logits/rejected": -2.751648426055908, "logps/chosen": -266.3084411621094, "logps/pi_response": -196.0972137451172, "logps/ref_response": -193.69471740722656, "logps/rejected": -272.2674255371094, "loss": 0.6601, "rewards/accuracies": 0.765625, "rewards/chosen": 0.045443661510944366, "rewards/margins": 0.06504254043102264, "rewards/rejected": -0.019598882645368576, "step": 20 }, { "epoch": 0.5, "learning_rate": 2.8691164100062034e-07, "logits/chosen": -2.8319926261901855, "logits/rejected": -2.7600412368774414, "logps/chosen": -287.2323303222656, "logps/pi_response": -224.0599365234375, "logps/ref_response": -200.99618530273438, "logps/rejected": -287.2210998535156, "loss": 0.6115, "rewards/accuracies": 0.824999988079071, "rewards/chosen": -0.010728769935667515, "rewards/margins": 0.23644748330116272, "rewards/rejected": -0.24717621505260468, "step": 30 }, { "epoch": 0.67, "learning_rate": 1.4248369943086995e-07, "logits/chosen": -2.7870166301727295, "logits/rejected": -2.7307822704315186, "logps/chosen": -258.9184265136719, "logps/pi_response": -226.122314453125, "logps/ref_response": -185.12936401367188, "logps/rejected": -311.3656311035156, "loss": 0.5706, "rewards/accuracies": 0.809374988079071, "rewards/chosen": -0.15448638796806335, "rewards/margins": 0.28851866722106934, "rewards/rejected": -0.4430050253868103, "step": 40 }, { "epoch": 0.84, "learning_rate": 3.473909705816111e-08, "logits/chosen": -2.794811964035034, "logits/rejected": -2.7504866123199463, "logps/chosen": -283.52069091796875, "logps/pi_response": -245.2189483642578, "logps/ref_response": -190.3854522705078, "logps/rejected": -315.20977783203125, "loss": 0.5375, "rewards/accuracies": 0.8031250238418579, "rewards/chosen": -0.2589899003505707, "rewards/margins": 0.3519485890865326, "rewards/rejected": -0.6109384298324585, "step": 50 }, { "epoch": 0.99, "step": 59, "total_flos": 0.0, "train_loss": 0.5997810929508532, "train_runtime": 3304.1575, "train_samples_per_second": 4.625, "train_steps_per_second": 0.018 } ], "logging_steps": 10, "max_steps": 59, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 100, "total_flos": 0.0, "train_batch_size": 8, "trial_name": null, "trial_params": null }