qwen-3.5-80b-post-cpt-base / trainer_state.json
ssands1979's picture
Add files using upload-large-folder tool
129a996 verified
Raw History Blame Contribute Delete
5.14 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.1,
"eval_steps": 100.0,
"global_step": 100,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.001,
"grad_norm": 43.548129517838454,
"learning_rate": 1.0000000000000002e-06,
"loss": 4.1920576095581055,
"step": 1,
"token_acc": 0.34359059658460855
},
{
"epoch": 0.005,
"grad_norm": 14.427483007671363,
"learning_rate": 5e-06,
"loss": 2.9412002563476562,
"step": 5,
"token_acc": 0.512452240845581
},
{
"epoch": 0.01,
"grad_norm": 7.934074490008561,
"learning_rate": 1e-05,
"loss": 2.503311347961426,
"step": 10,
"token_acc": 0.5123253736192332
},
{
"epoch": 0.015,
"grad_norm": 2.5682097340060643,
"learning_rate": 9.999370638369377e-06,
"loss": 1.8719802856445313,
"step": 15,
"token_acc": 0.6410698878343399
},
{
"epoch": 0.02,
"grad_norm": 3.0601891911453225,
"learning_rate": 9.997482711915926e-06,
"loss": 1.7852279663085937,
"step": 20,
"token_acc": 0.6242933840865835
},
{
"epoch": 0.025,
"grad_norm": 2.9591215037175895,
"learning_rate": 9.994336695915041e-06,
"loss": 1.6610099792480468,
"step": 25,
"token_acc": 0.6568298460323727
},
{
"epoch": 0.03,
"grad_norm": 2.3839735362461623,
"learning_rate": 9.989933382359423e-06,
"loss": 1.6115425109863282,
"step": 30,
"token_acc": 0.6632120451693851
},
{
"epoch": 0.035,
"grad_norm": 2.0296518100505776,
"learning_rate": 9.984273879759713e-06,
"loss": 1.7307615280151367,
"step": 35,
"token_acc": 0.6267176116002563
},
{
"epoch": 0.04,
"grad_norm": 2.274063193212189,
"learning_rate": 9.977359612865424e-06,
"loss": 1.6226930618286133,
"step": 40,
"token_acc": 0.6632471264367816
},
{
"epoch": 0.045,
"grad_norm": 1.995496122888669,
"learning_rate": 9.969192322306271e-06,
"loss": 1.6562419891357423,
"step": 45,
"token_acc": 0.6479170419164758
},
{
"epoch": 0.05,
"grad_norm": 2.030243788478171,
"learning_rate": 9.959774064153977e-06,
"loss": 1.5927490234375,
"step": 50,
"token_acc": 0.6578526695879487
},
{
"epoch": 0.055,
"grad_norm": 1.913105067952688,
"learning_rate": 9.949107209404664e-06,
"loss": 1.886464500427246,
"step": 55,
"token_acc": 0.5819125113628805
},
{
"epoch": 0.06,
"grad_norm": 1.8949380801330526,
"learning_rate": 9.937194443381972e-06,
"loss": 1.6359737396240235,
"step": 60,
"token_acc": 0.6552567735622108
},
{
"epoch": 0.065,
"grad_norm": 1.4853873443995649,
"learning_rate": 9.924038765061042e-06,
"loss": 1.3352900505065919,
"step": 65,
"token_acc": 0.7206670637284097
},
{
"epoch": 0.07,
"grad_norm": 1.6844968929576292,
"learning_rate": 9.909643486313533e-06,
"loss": 1.4845345497131348,
"step": 70,
"token_acc": 0.6865343744776369
},
{
"epoch": 0.075,
"grad_norm": 1.7982742317399707,
"learning_rate": 9.894012231073895e-06,
"loss": 1.5165021896362305,
"step": 75,
"token_acc": 0.6689946239260413
},
{
"epoch": 0.08,
"grad_norm": 1.7083434381167786,
"learning_rate": 9.877148934427037e-06,
"loss": 1.501682949066162,
"step": 80,
"token_acc": 0.6582693568920952
},
{
"epoch": 0.085,
"grad_norm": 2.276089893387222,
"learning_rate": 9.859057841617709e-06,
"loss": 1.3892568588256835,
"step": 85,
"token_acc": 0.7173441424982873
},
{
"epoch": 0.09,
"grad_norm": 3.2510132262305955,
"learning_rate": 9.839743506981783e-06,
"loss": 1.6044925689697265,
"step": 90,
"token_acc": 0.6260809087747768
},
{
"epoch": 0.095,
"grad_norm": 2.3567789267765544,
"learning_rate": 9.819210792799711e-06,
"loss": 1.531374168395996,
"step": 95,
"token_acc": 0.661787561762045
},
{
"epoch": 0.1,
"grad_norm": 1.7140659626033266,
"learning_rate": 9.797464868072489e-06,
"loss": 1.636698341369629,
"step": 100,
"token_acc": 0.6505466960542806
}
],
"logging_steps": 5,
"max_steps": 1000,
"num_input_tokens_seen": 0,
"num_train_epochs": 9223372036854775807,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 93095931019264.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}