Qwen3.5-35B-A3B-Claude-distill / trainer_state.json
Kassadin
Upload folder using huggingface_hub
76fbdaa verified
Raw
History Blame Contribute Delete
9.26 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.0,
"eval_steps": 200.0,
"global_step": 370,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.005405405405405406,
"grad_norm": 3.1680717633202877,
"learning_rate": 1.5789473684210526e-06,
"loss": 0.6688475608825684,
"step": 1,
"token_acc": 0.8242903529904682
},
{
"epoch": 0.05405405405405406,
"grad_norm": 1.8549251728609573,
"learning_rate": 1.5789473684210526e-05,
"loss": 0.8109264373779297,
"step": 10,
"token_acc": 0.7761103592601787
},
{
"epoch": 0.10810810810810811,
"grad_norm": 0.9484813990147456,
"learning_rate": 2.9999399180697783e-05,
"loss": 0.6205739498138427,
"step": 20,
"token_acc": 0.8202673243249641
},
{
"epoch": 0.16216216216216217,
"grad_norm": 1.183614904613414,
"learning_rate": 2.9927359084964877e-05,
"loss": 0.6088469982147217,
"step": 30,
"token_acc": 0.8198438348312171
},
{
"epoch": 0.21621621621621623,
"grad_norm": 1.2353384024615621,
"learning_rate": 2.973581606123497e-05,
"loss": 0.739194393157959,
"step": 40,
"token_acc": 0.7898660420316513
},
{
"epoch": 0.2702702702702703,
"grad_norm": 1.3432923315535181,
"learning_rate": 2.942630353226844e-05,
"loss": 0.6011062622070312,
"step": 50,
"token_acc": 0.8247190588471379
},
{
"epoch": 0.32432432432432434,
"grad_norm": 1.168183989145606,
"learning_rate": 2.900129934114876e-05,
"loss": 0.6731441020965576,
"step": 60,
"token_acc": 0.8113857485368042
},
{
"epoch": 0.3783783783783784,
"grad_norm": 1.2344777400050695,
"learning_rate": 2.8464205914585212e-05,
"loss": 0.6012222290039062,
"step": 70,
"token_acc": 0.8260620662270369
},
{
"epoch": 0.43243243243243246,
"grad_norm": 1.16232118124639,
"learning_rate": 2.7819323024340304e-05,
"loss": 0.6182085990905761,
"step": 80,
"token_acc": 0.8235405045953511
},
{
"epoch": 0.4864864864864865,
"grad_norm": 0.9498735816994268,
"learning_rate": 2.7071813364843832e-05,
"loss": 0.59684157371521,
"step": 90,
"token_acc": 0.8311607063059382
},
{
"epoch": 0.5405405405405406,
"grad_norm": 0.8108342228004247,
"learning_rate": 2.6227661222566516e-05,
"loss": 0.6133281230926514,
"step": 100,
"token_acc": 0.8260576887809151
},
{
"epoch": 0.5945945945945946,
"grad_norm": 1.2084724906810802,
"learning_rate": 2.5293624568031008e-05,
"loss": 0.5700843811035157,
"step": 110,
"token_acc": 0.8353099803946354
},
{
"epoch": 0.6486486486486487,
"grad_norm": 1.1407595512042275,
"learning_rate": 2.4277180953993826e-05,
"loss": 0.585970115661621,
"step": 120,
"token_acc": 0.8267323572461026
},
{
"epoch": 0.7027027027027027,
"grad_norm": 1.230613842801466,
"learning_rate": 2.318646765291757e-05,
"loss": 0.6366302967071533,
"step": 130,
"token_acc": 0.8218803207769427
},
{
"epoch": 0.7567567567567568,
"grad_norm": 1.2394471459646628,
"learning_rate": 2.2030216512970554e-05,
"loss": 0.5958713531494141,
"step": 140,
"token_acc": 0.8305702226808576
},
{
"epoch": 0.8108108108108109,
"grad_norm": 1.1136999131785847,
"learning_rate": 2.0817684054072827e-05,
"loss": 0.7051344871520996,
"step": 150,
"token_acc": 0.7948495053253495
},
{
"epoch": 0.8648648648648649,
"grad_norm": 0.953872013030958,
"learning_rate": 1.9558577363613704e-05,
"loss": 0.5482869148254395,
"step": 160,
"token_acc": 0.8431717927114541
},
{
"epoch": 0.918918918918919,
"grad_norm": 1.1211814795042592,
"learning_rate": 1.826297638509251e-05,
"loss": 0.6120530128479004,
"step": 170,
"token_acc": 0.825810897386503
},
{
"epoch": 0.972972972972973,
"grad_norm": 1.0724707419323103,
"learning_rate": 1.694125322181083e-05,
"loss": 0.6729551792144776,
"step": 180,
"token_acc": 0.809713255234503
},
{
"epoch": 1.027027027027027,
"grad_norm": 0.9017702538446655,
"learning_rate": 1.5603989101641228e-05,
"loss": 0.49294071197509765,
"step": 190,
"token_acc": 0.8595634401529221
},
{
"epoch": 1.0810810810810811,
"grad_norm": 0.8357826808926182,
"learning_rate": 1.4261889667621828e-05,
"loss": 0.30256004333496095,
"step": 200,
"token_acc": 0.9047140790097637
},
{
"epoch": 1.135135135135135,
"grad_norm": 1.3306024060830839,
"learning_rate": 1.2925699272529006e-05,
"loss": 0.28004865646362304,
"step": 210,
"token_acc": 0.9124356333016044
},
{
"epoch": 1.1891891891891893,
"grad_norm": 1.0315509694012732,
"learning_rate": 1.1606114963554171e-05,
"loss": 0.28960094451904295,
"step": 220,
"token_acc": 0.9050426736039798
},
{
"epoch": 1.2432432432432432,
"grad_norm": 0.897647555480616,
"learning_rate": 1.0313700845691636e-05,
"loss": 0.24299814701080322,
"step": 230,
"token_acc": 0.9234494029347422
},
{
"epoch": 1.2972972972972974,
"grad_norm": 1.0238680932300175,
"learning_rate": 9.058803509412647e-06,
"loss": 0.2083221435546875,
"step": 240,
"token_acc": 0.9324800906289405
},
{
"epoch": 1.3513513513513513,
"grad_norm": 0.8507949565744011,
"learning_rate": 7.851469199680382e-06,
"loss": 0.27800228595733645,
"step": 250,
"token_acc": 0.9101957597480809
},
{
"epoch": 1.4054054054054055,
"grad_norm": 0.9239797828529825,
"learning_rate": 6.701363389420296e-06,
"loss": 0.257454514503479,
"step": 260,
"token_acc": 0.9200535757981635
},
{
"epoch": 1.4594594594594594,
"grad_norm": 0.8289302773930988,
"learning_rate": 5.617693401310837e-06,
"loss": 0.2699479103088379,
"step": 270,
"token_acc": 0.9118848637175058
},
{
"epoch": 1.5135135135135136,
"grad_norm": 1.4264660137512906,
"learning_rate": 4.609134697356009e-06,
"loss": 0.25818724632263185,
"step": 280,
"token_acc": 0.9165730954889045
},
{
"epoch": 1.5675675675675675,
"grad_norm": 0.6809121084776086,
"learning_rate": 3.683761426338148e-06,
"loss": 0.2499394655227661,
"step": 290,
"token_acc": 0.9210303247829308
},
{
"epoch": 1.6216216216216215,
"grad_norm": 0.7911442310830548,
"learning_rate": 2.848981785162503e-06,
"loss": 0.2243581771850586,
"step": 300,
"token_acc": 0.9255768284539416
},
{
"epoch": 1.6756756756756757,
"grad_norm": 0.8302748471075124,
"learning_rate": 2.1114787115667476e-06,
"loss": 0.2524730205535889,
"step": 310,
"token_acc": 0.9196754182044243
},
{
"epoch": 1.7297297297297298,
"grad_norm": 0.7652465806020483,
"learning_rate": 1.4771563829877598e-06,
"loss": 0.21740343570709228,
"step": 320,
"token_acc": 0.9257807174001964
},
{
"epoch": 1.7837837837837838,
"grad_norm": 0.6723695635268157,
"learning_rate": 9.51092949895927e-07,
"loss": 0.29862112998962403,
"step": 330,
"token_acc": 0.9064944202025343
},
{
"epoch": 1.8378378378378377,
"grad_norm": 0.7836833639138061,
"learning_rate": 5.374998819965654e-07,
"loss": 0.2673323154449463,
"step": 340,
"token_acc": 0.9137580442481246
},
{
"epoch": 1.8918918918918919,
"grad_norm": 0.8148712923768102,
"learning_rate": 2.3968825275764774e-07,
"loss": 0.2481457471847534,
"step": 350,
"token_acc": 0.9221015450205239
},
{
"epoch": 1.945945945945946,
"grad_norm": 1.055375940725962,
"learning_rate": 6.00422321775751e-08,
"loss": 0.2384178876876831,
"step": 360,
"token_acc": 0.9246336357292394
},
{
"epoch": 2.0,
"grad_norm": 0.9495217159079454,
"learning_rate": 0.0,
"loss": 0.22227826118469238,
"step": 370,
"token_acc": 0.9248096999252118
}
],
"logging_steps": 10,
"max_steps": 370,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 200,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 163536917889024.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}