Qwen2.5-SFT-GRPO-fundo-nothink / trainer_state.json
Leeyuyu's picture
Model save
15decfe verified
Raw History Blame Contribute Delete
8.7 kB
{
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 50,
"global_step": 50,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.02,
"grad_norm": 818.252685546875,
"learning_rate": 4e-08,
"loss": 8.0825,
"step": 1
},
{
"epoch": 0.04,
"grad_norm": 818.1897583007812,
"learning_rate": 8e-08,
"loss": 8.083,
"step": 2
},
{
"epoch": 0.06,
"grad_norm": 818.9984741210938,
"learning_rate": 1.2e-07,
"loss": 8.0738,
"step": 3
},
{
"epoch": 0.08,
"grad_norm": 814.5826416015625,
"learning_rate": 1.6e-07,
"loss": 8.0586,
"step": 4
},
{
"epoch": 0.1,
"grad_norm": 818.0709838867188,
"learning_rate": 2e-07,
"loss": 8.0518,
"step": 5
},
{
"epoch": 0.12,
"grad_norm": 820.11474609375,
"learning_rate": 1.997564050259824e-07,
"loss": 8.0655,
"step": 6
},
{
"epoch": 0.14,
"grad_norm": 813.5534057617188,
"learning_rate": 1.9902680687415702e-07,
"loss": 8.0512,
"step": 7
},
{
"epoch": 0.16,
"grad_norm": 813.9736938476562,
"learning_rate": 1.9781476007338056e-07,
"loss": 8.0414,
"step": 8
},
{
"epoch": 0.18,
"grad_norm": 810.3634033203125,
"learning_rate": 1.9612616959383187e-07,
"loss": 7.9481,
"step": 9
},
{
"epoch": 0.2,
"grad_norm": 811.2542114257812,
"learning_rate": 1.9396926207859085e-07,
"loss": 7.9573,
"step": 10
},
{
"epoch": 0.22,
"grad_norm": 810.1604614257812,
"learning_rate": 1.9135454576426007e-07,
"loss": 7.9447,
"step": 11
},
{
"epoch": 0.24,
"grad_norm": 816.74462890625,
"learning_rate": 1.8829475928589268e-07,
"loss": 7.9186,
"step": 12
},
{
"epoch": 0.26,
"grad_norm": 811.1762084960938,
"learning_rate": 1.8480480961564257e-07,
"loss": 7.9079,
"step": 13
},
{
"epoch": 0.28,
"grad_norm": 790.3859252929688,
"learning_rate": 1.8090169943749475e-07,
"loss": 7.654,
"step": 14
},
{
"epoch": 0.3,
"grad_norm": 798.2161254882812,
"learning_rate": 1.766044443118978e-07,
"loss": 7.6624,
"step": 15
},
{
"epoch": 0.32,
"grad_norm": 792.4284057617188,
"learning_rate": 1.719339800338651e-07,
"loss": 7.6362,
"step": 16
},
{
"epoch": 0.34,
"grad_norm": 797.7490844726562,
"learning_rate": 1.669130606358858e-07,
"loss": 7.8007,
"step": 17
},
{
"epoch": 0.36,
"grad_norm": 792.290771484375,
"learning_rate": 1.615661475325658e-07,
"loss": 7.6444,
"step": 18
},
{
"epoch": 0.38,
"grad_norm": 791.4799194335938,
"learning_rate": 1.5591929034707466e-07,
"loss": 7.6096,
"step": 19
},
{
"epoch": 0.4,
"grad_norm": 781.8382568359375,
"learning_rate": 1.5e-07,
"loss": 7.5249,
"step": 20
},
{
"epoch": 0.42,
"grad_norm": 787.5663452148438,
"learning_rate": 1.4383711467890774e-07,
"loss": 7.5302,
"step": 21
},
{
"epoch": 0.44,
"grad_norm": 787.5963745117188,
"learning_rate": 1.374606593415912e-07,
"loss": 7.5086,
"step": 22
},
{
"epoch": 0.46,
"grad_norm": 785.0594482421875,
"learning_rate": 1.3090169943749475e-07,
"loss": 7.5495,
"step": 23
},
{
"epoch": 0.48,
"grad_norm": 783.998291015625,
"learning_rate": 1.2419218955996676e-07,
"loss": 7.5004,
"step": 24
},
{
"epoch": 0.5,
"grad_norm": 785.1058349609375,
"learning_rate": 1.1736481776669305e-07,
"loss": 7.5234,
"step": 25
},
{
"epoch": 0.52,
"grad_norm": 713.4159545898438,
"learning_rate": 1.1045284632676535e-07,
"loss": 6.7809,
"step": 26
},
{
"epoch": 0.54,
"grad_norm": 707.8865356445312,
"learning_rate": 1.0348994967025011e-07,
"loss": 6.6029,
"step": 27
},
{
"epoch": 0.56,
"grad_norm": 708.47412109375,
"learning_rate": 9.651005032974993e-08,
"loss": 6.5739,
"step": 28
},
{
"epoch": 0.58,
"grad_norm": 702.1832275390625,
"learning_rate": 8.954715367323466e-08,
"loss": 6.5528,
"step": 29
},
{
"epoch": 0.6,
"grad_norm": 707.9276733398438,
"learning_rate": 8.263518223330696e-08,
"loss": 6.5052,
"step": 30
},
{
"epoch": 0.62,
"grad_norm": 706.7056884765625,
"learning_rate": 7.580781044003323e-08,
"loss": 6.5264,
"step": 31
},
{
"epoch": 0.64,
"grad_norm": 701.0953979492188,
"learning_rate": 6.909830056250527e-08,
"loss": 6.54,
"step": 32
},
{
"epoch": 0.66,
"grad_norm": 702.4327392578125,
"learning_rate": 6.253934065840879e-08,
"loss": 6.5456,
"step": 33
},
{
"epoch": 0.68,
"grad_norm": 700.1629638671875,
"learning_rate": 5.616288532109225e-08,
"loss": 6.4829,
"step": 34
},
{
"epoch": 0.7,
"grad_norm": 700.8172607421875,
"learning_rate": 5.000000000000002e-08,
"loss": 6.4659,
"step": 35
},
{
"epoch": 0.72,
"grad_norm": 704.9315795898438,
"learning_rate": 4.408070965292533e-08,
"loss": 6.5499,
"step": 36
},
{
"epoch": 0.74,
"grad_norm": 703.9114990234375,
"learning_rate": 3.843385246743417e-08,
"loss": 6.4908,
"step": 37
},
{
"epoch": 0.76,
"grad_norm": 701.8934936523438,
"learning_rate": 3.3086939364114206e-08,
"loss": 6.4915,
"step": 38
},
{
"epoch": 0.78,
"grad_norm": 695.6119384765625,
"learning_rate": 2.8066019966134903e-08,
"loss": 6.4808,
"step": 39
},
{
"epoch": 0.8,
"grad_norm": 697.15625,
"learning_rate": 2.339555568810221e-08,
"loss": 6.4609,
"step": 40
},
{
"epoch": 0.82,
"grad_norm": 696.0047607421875,
"learning_rate": 1.9098300562505266e-08,
"loss": 6.4469,
"step": 41
},
{
"epoch": 0.84,
"grad_norm": 703.1214599609375,
"learning_rate": 1.5195190384357405e-08,
"loss": 6.4827,
"step": 42
},
{
"epoch": 0.86,
"grad_norm": 697.6890258789062,
"learning_rate": 1.1705240714107301e-08,
"loss": 6.4773,
"step": 43
},
{
"epoch": 0.88,
"grad_norm": 697.1249389648438,
"learning_rate": 8.645454235739902e-09,
"loss": 6.4647,
"step": 44
},
{
"epoch": 0.9,
"grad_norm": 698.1083984375,
"learning_rate": 6.030737921409168e-09,
"loss": 6.4785,
"step": 45
},
{
"epoch": 0.92,
"grad_norm": 699.7293701171875,
"learning_rate": 3.873830406168111e-09,
"loss": 6.4605,
"step": 46
},
{
"epoch": 0.94,
"grad_norm": 697.2705688476562,
"learning_rate": 2.1852399266194312e-09,
"loss": 6.4725,
"step": 47
},
{
"epoch": 0.96,
"grad_norm": 699.6365966796875,
"learning_rate": 9.731931258429638e-10,
"loss": 6.4544,
"step": 48
},
{
"epoch": 0.98,
"grad_norm": 698.3743896484375,
"learning_rate": 2.4359497401758025e-10,
"loss": 6.4655,
"step": 49
},
{
"epoch": 1.0,
"grad_norm": 696.75634765625,
"learning_rate": 0.0,
"loss": 6.4721,
"step": 50
},
{
"epoch": 1.0,
"step": 50,
"total_flos": 1.127911562149888e+17,
"train_loss": 7.161082897186279,
"train_runtime": 995.3533,
"train_samples_per_second": 3.21,
"train_steps_per_second": 0.05
}
],
"logging_steps": 1,
"max_steps": 50,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.127911562149888e+17,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}