ShenaoZ's picture
Model save
a113aa3 verified
Raw
History Blame Contribute Delete
4.41 kB
{
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.9874476987447699,
"eval_steps": 500,
"global_step": 59,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.016736401673640166,
"grad_norm": 12.245462384069063,
"learning_rate": 8.333333333333333e-08,
"logits/chosen": -2.8317770957946777,
"logits/rejected": -2.7326111793518066,
"logps/chosen": -190.3253173828125,
"logps/pi_response": -110.92029571533203,
"logps/ref_response": -110.92029571533203,
"logps/rejected": -223.7691192626953,
"loss": 0.6931,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 1
},
{
"epoch": 0.16736401673640167,
"grad_norm": 11.258294256737887,
"learning_rate": 4.930057285201027e-07,
"logits/chosen": -2.7557287216186523,
"logits/rejected": -2.7092771530151367,
"logps/chosen": -216.87799072265625,
"logps/pi_response": -114.42035675048828,
"logps/ref_response": -114.2578125,
"logps/rejected": -264.3336486816406,
"loss": 0.6848,
"rewards/accuracies": 0.5486111044883728,
"rewards/chosen": -0.02949061244726181,
"rewards/margins": 0.02440599910914898,
"rewards/rejected": -0.05389661341905594,
"step": 10
},
{
"epoch": 0.33472803347280333,
"grad_norm": 26.158633449418044,
"learning_rate": 4.187457503795526e-07,
"logits/chosen": -2.7771294116973877,
"logits/rejected": -2.7362141609191895,
"logps/chosen": -254.28701782226562,
"logps/pi_response": -111.6153335571289,
"logps/ref_response": -113.4717788696289,
"logps/rejected": -308.6377868652344,
"loss": 0.6304,
"rewards/accuracies": 0.6312500238418579,
"rewards/chosen": -0.2588905096054077,
"rewards/margins": 0.27992284297943115,
"rewards/rejected": -0.5388133525848389,
"step": 20
},
{
"epoch": 0.502092050209205,
"grad_norm": 15.587388407908863,
"learning_rate": 2.8691164100062034e-07,
"logits/chosen": -2.754197359085083,
"logits/rejected": -2.718698024749756,
"logps/chosen": -297.10418701171875,
"logps/pi_response": -142.0721893310547,
"logps/ref_response": -120.0687026977539,
"logps/rejected": -351.3653259277344,
"loss": 0.5839,
"rewards/accuracies": 0.690625011920929,
"rewards/chosen": -0.523945689201355,
"rewards/margins": 0.4522995352745056,
"rewards/rejected": -0.9762452840805054,
"step": 30
},
{
"epoch": 0.6694560669456067,
"grad_norm": 16.430781172533628,
"learning_rate": 1.4248369943086995e-07,
"logits/chosen": -2.6763617992401123,
"logits/rejected": -2.6239538192749023,
"logps/chosen": -278.3578186035156,
"logps/pi_response": -144.41726684570312,
"logps/ref_response": -110.48355865478516,
"logps/rejected": -363.93450927734375,
"loss": 0.5503,
"rewards/accuracies": 0.699999988079071,
"rewards/chosen": -0.5653710961341858,
"rewards/margins": 0.5595625042915344,
"rewards/rejected": -1.1249334812164307,
"step": 40
},
{
"epoch": 0.8368200836820083,
"grad_norm": 18.753898859495603,
"learning_rate": 3.473909705816111e-08,
"logits/chosen": -2.624819040298462,
"logits/rejected": -2.5662152767181396,
"logps/chosen": -287.62396240234375,
"logps/pi_response": -165.9267578125,
"logps/ref_response": -112.31349182128906,
"logps/rejected": -373.04034423828125,
"loss": 0.5435,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.7290452122688293,
"rewards/margins": 0.625941276550293,
"rewards/rejected": -1.3549864292144775,
"step": 50
},
{
"epoch": 0.9874476987447699,
"step": 59,
"total_flos": 0.0,
"train_loss": 0.587253408916926,
"train_runtime": 2659.1015,
"train_samples_per_second": 5.747,
"train_steps_per_second": 0.022
}
],
"logging_steps": 10,
"max_steps": 59,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 100,
"total_flos": 0.0,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}