NeuTTS-air_ur / checkpoint-996 /trainer_state.json
arch-stanton-1's picture
Upload folder using huggingface_hub
04a7abf verified
Raw History Blame Contribute Delete
15.3 kB
{
"best_global_step": 992,
"best_metric": 7.356758117675781,
"best_model_checkpoint": "/workspace/neutts_air_urdu_finetune/checkpoint-992",
"epoch": 4.220338983050848,
"eval_steps": 124,
"global_step": 996,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 7.697032804489136,
"epoch": 0.1059322033898305,
"grad_norm": 4.78125,
"learning_rate": 1.6000000000000003e-05,
"loss": 7.989871215820313,
"mean_token_accuracy": 0.016311284080147745,
"num_tokens": 218322.0,
"step": 25
},
{
"entropy": 7.771375341415405,
"epoch": 0.211864406779661,
"grad_norm": 2.671875,
"learning_rate": 1.9980915336317713e-05,
"loss": 7.803304443359375,
"mean_token_accuracy": 0.018622982166707516,
"num_tokens": 437349.0,
"step": 50
},
{
"entropy": 7.646108131408692,
"epoch": 0.3177966101694915,
"grad_norm": 2.421875,
"learning_rate": 1.989779323028575e-05,
"loss": 7.629185180664063,
"mean_token_accuracy": 0.021061680242419244,
"num_tokens": 658790.0,
"step": 75
},
{
"entropy": 7.555726566314697,
"epoch": 0.423728813559322,
"grad_norm": 2.359375,
"learning_rate": 1.9749279121818235e-05,
"loss": 7.55064208984375,
"mean_token_accuracy": 0.022715183552354575,
"num_tokens": 872825.0,
"step": 100
},
{
"epoch": 0.5254237288135594,
"eval_entropy": 7.486619492371877,
"eval_loss": 7.498717784881592,
"eval_mean_token_accuracy": 0.02434113745888074,
"eval_num_tokens": 1084707.0,
"eval_runtime": 7.3619,
"eval_samples_per_second": 54.062,
"eval_steps_per_second": 3.396,
"step": 124
},
{
"entropy": 7.509912757873535,
"epoch": 0.5296610169491526,
"grad_norm": 2.21875,
"learning_rate": 1.9536354202855306e-05,
"loss": 7.5065460205078125,
"mean_token_accuracy": 0.022764644995331765,
"num_tokens": 1093864.0,
"step": 125
},
{
"entropy": 7.504309902191162,
"epoch": 0.635593220338983,
"grad_norm": 2.078125,
"learning_rate": 1.9260425209878052e-05,
"loss": 7.493028564453125,
"mean_token_accuracy": 0.022260171882808207,
"num_tokens": 1315198.0,
"step": 150
},
{
"entropy": 7.464480457305908,
"epoch": 0.7415254237288136,
"grad_norm": 2.15625,
"learning_rate": 1.8923315129986838e-05,
"loss": 7.463182373046875,
"mean_token_accuracy": 0.023391987532377242,
"num_tokens": 1533213.0,
"step": 175
},
{
"entropy": 7.452612771987915,
"epoch": 0.847457627118644,
"grad_norm": 2.34375,
"learning_rate": 1.8527251156925997e-05,
"loss": 7.447894897460937,
"mean_token_accuracy": 0.02403868570923805,
"num_tokens": 1752307.0,
"step": 200
},
{
"entropy": 7.409109563827514,
"epoch": 0.9533898305084746,
"grad_norm": 1.96875,
"learning_rate": 1.8074849976626273e-05,
"loss": 7.407470703125,
"mean_token_accuracy": 0.023314249143004416,
"num_tokens": 1973350.0,
"step": 225
},
{
"epoch": 1.0508474576271187,
"eval_entropy": 7.401865323384603,
"eval_loss": 7.414607524871826,
"eval_mean_token_accuracy": 0.025272298449029524,
"eval_num_tokens": 2178943.0,
"eval_runtime": 7.4146,
"eval_samples_per_second": 53.678,
"eval_steps_per_second": 3.372,
"step": 248
},
{
"entropy": 7.410350885391235,
"epoch": 1.0593220338983051,
"grad_norm": 2.078125,
"learning_rate": 1.756910047947926e-05,
"loss": 7.405702514648437,
"mean_token_accuracy": 0.024052796624600886,
"num_tokens": 2195473.0,
"step": 250
},
{
"entropy": 7.378520240783692,
"epoch": 1.1652542372881356,
"grad_norm": 2.0625,
"learning_rate": 1.7013344013559197e-05,
"loss": 7.368658447265625,
"mean_token_accuracy": 0.024010552018880846,
"num_tokens": 2410539.0,
"step": 275
},
{
"entropy": 7.370533514022827,
"epoch": 1.271186440677966,
"grad_norm": 2.015625,
"learning_rate": 1.64112523092536e-05,
"loss": 7.370477905273438,
"mean_token_accuracy": 0.02511810462921858,
"num_tokens": 2630347.0,
"step": 300
},
{
"entropy": 7.372100067138672,
"epoch": 1.3771186440677967,
"grad_norm": 2.140625,
"learning_rate": 1.5766803221148676e-05,
"loss": 7.374469604492187,
"mean_token_accuracy": 0.02450455617159605,
"num_tokens": 2848534.0,
"step": 325
},
{
"entropy": 7.342970514297486,
"epoch": 1.4830508474576272,
"grad_norm": 1.9609375,
"learning_rate": 1.5084254447436169e-05,
"loss": 7.339466552734375,
"mean_token_accuracy": 0.025138991102576256,
"num_tokens": 3070123.0,
"step": 350
},
{
"epoch": 1.576271186440678,
"eval_entropy": 7.361576656500499,
"eval_loss": 7.381193161010742,
"eval_mean_token_accuracy": 0.025545974417279165,
"eval_num_tokens": 3263577.0,
"eval_runtime": 7.4123,
"eval_samples_per_second": 53.695,
"eval_steps_per_second": 3.373,
"step": 372
},
{
"entropy": 7.361075611114502,
"epoch": 1.5889830508474576,
"grad_norm": 1.9140625,
"learning_rate": 1.4368115400470393e-05,
"loss": 7.3520880126953125,
"mean_token_accuracy": 0.024180141538381578,
"num_tokens": 3288806.0,
"step": 375
},
{
"entropy": 7.3546325302124025,
"epoch": 1.694915254237288,
"grad_norm": 2.15625,
"learning_rate": 1.3623117414318827e-05,
"loss": 7.346293334960937,
"mean_token_accuracy": 0.024999124109745027,
"num_tokens": 3510776.0,
"step": 400
},
{
"entropy": 7.363360710144043,
"epoch": 1.8008474576271185,
"grad_norm": 2.078125,
"learning_rate": 1.2854182486136944e-05,
"loss": 7.364286499023438,
"mean_token_accuracy": 0.02418241061270237,
"num_tokens": 3731405.0,
"step": 425
},
{
"entropy": 7.334566602706909,
"epoch": 1.9067796610169492,
"grad_norm": 1.9609375,
"learning_rate": 1.2066390757884328e-05,
"loss": 7.33093505859375,
"mean_token_accuracy": 0.02495731335133314,
"num_tokens": 3953207.0,
"step": 450
},
{
"entropy": 7.353079776763916,
"epoch": 2.01271186440678,
"grad_norm": 1.8671875,
"learning_rate": 1.1264946953221496e-05,
"loss": 7.351827392578125,
"mean_token_accuracy": 0.02447190221399069,
"num_tokens": 4169521.0,
"step": 475
},
{
"epoch": 2.1016949152542375,
"eval_entropy": 7.34862866004308,
"eval_loss": 7.365415096282959,
"eval_mean_token_accuracy": 0.025626841001212597,
"eval_num_tokens": 4351452.0,
"eval_runtime": 7.4142,
"eval_samples_per_second": 53.681,
"eval_steps_per_second": 3.372,
"step": 496
},
{
"entropy": 7.339797382354736,
"epoch": 2.1186440677966103,
"grad_norm": 2.03125,
"learning_rate": 1.0455145991329639e-05,
"loss": 7.3259820556640625,
"mean_token_accuracy": 0.025096801929175853,
"num_tokens": 4386912.0,
"step": 500
},
{
"entropy": 7.330105533599854,
"epoch": 2.2245762711864407,
"grad_norm": 2.03125,
"learning_rate": 9.642338004833295e-06,
"loss": 7.330958251953125,
"mean_token_accuracy": 0.024473249688744547,
"num_tokens": 4607819.0,
"step": 525
},
{
"entropy": 7.331509189605713,
"epoch": 2.330508474576271,
"grad_norm": 1.96875,
"learning_rate": 8.831892992943e-06,
"loss": 7.329585571289062,
"mean_token_accuracy": 0.024803164564073086,
"num_tokens": 4829926.0,
"step": 550
},
{
"entropy": 7.332346143722535,
"epoch": 2.4364406779661016,
"grad_norm": 1.953125,
"learning_rate": 8.029165343344805e-06,
"loss": 7.3258428955078125,
"mean_token_accuracy": 0.02469826426357031,
"num_tokens": 5045115.0,
"step": 575
},
{
"entropy": 7.318505411148071,
"epoch": 2.542372881355932,
"grad_norm": 1.9140625,
"learning_rate": 7.2394584572309125e-06,
"loss": 7.3118963623046875,
"mean_token_accuracy": 0.02518722042441368,
"num_tokens": 5265448.0,
"step": 600
},
{
"epoch": 2.6271186440677967,
"eval_entropy": 7.333844860394795,
"eval_loss": 7.359093189239502,
"eval_mean_token_accuracy": 0.025550531456246972,
"eval_num_tokens": 5439386.0,
"eval_runtime": 7.4052,
"eval_samples_per_second": 53.746,
"eval_steps_per_second": 3.376,
"step": 620
},
{
"entropy": 7.321087207794189,
"epoch": 2.648305084745763,
"grad_norm": 2.0625,
"learning_rate": 6.467989711184021e-06,
"loss": 7.31301513671875,
"mean_token_accuracy": 0.025983325839042663,
"num_tokens": 5482207.0,
"step": 625
},
{
"entropy": 7.322469959259033,
"epoch": 2.7542372881355934,
"grad_norm": 2.125,
"learning_rate": 5.7198559874026945e-06,
"loss": 7.318033447265625,
"mean_token_accuracy": 0.02565582599490881,
"num_tokens": 5703727.0,
"step": 650
},
{
"entropy": 7.31039176940918,
"epoch": 2.860169491525424,
"grad_norm": 2.03125,
"learning_rate": 5.000000000000003e-06,
"loss": 7.305034790039063,
"mean_token_accuracy": 0.02535436548292637,
"num_tokens": 5923157.0,
"step": 675
},
{
"entropy": 7.3113681411743165,
"epoch": 2.9661016949152543,
"grad_norm": 1.9765625,
"learning_rate": 4.313177639848408e-06,
"loss": 7.3114166259765625,
"mean_token_accuracy": 0.025559407025575638,
"num_tokens": 6143779.0,
"step": 700
},
{
"entropy": 7.3387535953521725,
"epoch": 3.0720338983050848,
"grad_norm": 1.921875,
"learning_rate": 3.6639265537145187e-06,
"loss": 7.343036499023437,
"mean_token_accuracy": 0.024094666354358196,
"num_tokens": 6365371.0,
"step": 725
},
{
"epoch": 3.152542372881356,
"eval_entropy": 7.332533776760101,
"eval_loss": 7.357120990753174,
"eval_mean_token_accuracy": 0.025878646954273183,
"eval_num_tokens": 6532337.0,
"eval_runtime": 7.4033,
"eval_samples_per_second": 53.76,
"eval_steps_per_second": 3.377,
"step": 744
},
{
"entropy": 7.320968351364136,
"epoch": 3.1779661016949152,
"grad_norm": 2.109375,
"learning_rate": 3.056536165272662e-06,
"loss": 7.313834228515625,
"mean_token_accuracy": 0.025647504702210427,
"num_tokens": 6584143.0,
"step": 750
},
{
"entropy": 7.319151067733765,
"epoch": 3.2838983050847457,
"grad_norm": 1.9140625,
"learning_rate": 2.4950193360603868e-06,
"loss": 7.315574951171875,
"mean_token_accuracy": 0.02516275253146887,
"num_tokens": 6806162.0,
"step": 775
},
{
"entropy": 7.312239484786987,
"epoch": 3.389830508474576,
"grad_norm": 1.8359375,
"learning_rate": 1.9830858536039742e-06,
"loss": 7.299415893554688,
"mean_token_accuracy": 0.025689680464565753,
"num_tokens": 7025188.0,
"step": 800
},
{
"entropy": 7.3349973487854,
"epoch": 3.4957627118644066,
"grad_norm": 1.90625,
"learning_rate": 1.524117921870789e-06,
"loss": 7.336126098632812,
"mean_token_accuracy": 0.02420500263571739,
"num_tokens": 7242603.0,
"step": 825
},
{
"entropy": 7.306003942489624,
"epoch": 3.601694915254237,
"grad_norm": 1.765625,
"learning_rate": 1.121147815976248e-06,
"loss": 7.2987548828125,
"mean_token_accuracy": 0.02604618974030018,
"num_tokens": 7462100.0,
"step": 850
},
{
"epoch": 3.6779661016949152,
"eval_entropy": 7.331447899341583,
"eval_loss": 7.3567795753479,
"eval_mean_token_accuracy": 0.02568032095829646,
"eval_num_tokens": 7621408.0,
"eval_runtime": 7.4184,
"eval_samples_per_second": 53.65,
"eval_steps_per_second": 3.37,
"step": 868
},
{
"entropy": 7.314174528121948,
"epoch": 3.707627118644068,
"grad_norm": 2.0,
"learning_rate": 7.76837848774642e-07,
"loss": 7.314702758789062,
"mean_token_accuracy": 0.02541963815689087,
"num_tokens": 7681092.0,
"step": 875
},
{
"entropy": 7.335706939697266,
"epoch": 3.8135593220338984,
"grad_norm": 2.03125,
"learning_rate": 4.934627816890469e-07,
"loss": 7.334556884765625,
"mean_token_accuracy": 0.02444286733865738,
"num_tokens": 7902109.0,
"step": 900
},
{
"entropy": 7.30207275390625,
"epoch": 3.919491525423729,
"grad_norm": 1.96875,
"learning_rate": 2.728947959871353e-07,
"loss": 7.29387451171875,
"mean_token_accuracy": 0.02536882445216179,
"num_tokens": 8122890.0,
"step": 925
},
{
"entropy": 7.312922801971435,
"epoch": 4.02542372881356,
"grad_norm": 1.984375,
"learning_rate": 1.1659112379354575e-07,
"loss": 7.30086181640625,
"mean_token_accuracy": 0.025601605214178563,
"num_tokens": 8341879.0,
"step": 950
},
{
"entropy": 7.326199951171875,
"epoch": 4.13135593220339,
"grad_norm": 1.953125,
"learning_rate": 2.558442055732524e-08,
"loss": 7.32387939453125,
"mean_token_accuracy": 0.024802666790783405,
"num_tokens": 8564759.0,
"step": 975
},
{
"epoch": 4.203389830508475,
"eval_entropy": 7.331596851348877,
"eval_loss": 7.356758117675781,
"eval_mean_token_accuracy": 0.02577025055264433,
"eval_num_tokens": 8715260.0,
"eval_runtime": 7.397,
"eval_samples_per_second": 53.806,
"eval_steps_per_second": 3.38,
"step": 992
},
{
"epoch": 4.220338983050848,
"eval_entropy": 7.331597983837128,
"eval_loss": 7.3567633628845215,
"eval_mean_token_accuracy": 0.02577025055264433,
"eval_num_tokens": 8750612.0,
"eval_runtime": 7.4178,
"eval_samples_per_second": 53.655,
"eval_steps_per_second": 3.37,
"step": 996
}
],
"logging_steps": 25,
"max_steps": 996,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 124,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 4.380260592254976e+16,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}