{ "best_global_step": 992, "best_metric": 7.356758117675781, "best_model_checkpoint": "/workspace/neutts_air_urdu_finetune/checkpoint-992", "epoch": 4.220338983050848, "eval_steps": 124, "global_step": 996, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 7.697032804489136, "epoch": 0.1059322033898305, "grad_norm": 4.78125, "learning_rate": 1.6000000000000003e-05, "loss": 7.989871215820313, "mean_token_accuracy": 0.016311284080147745, "num_tokens": 218322.0, "step": 25 }, { "entropy": 7.771375341415405, "epoch": 0.211864406779661, "grad_norm": 2.671875, "learning_rate": 1.9980915336317713e-05, "loss": 7.803304443359375, "mean_token_accuracy": 0.018622982166707516, "num_tokens": 437349.0, "step": 50 }, { "entropy": 7.646108131408692, "epoch": 0.3177966101694915, "grad_norm": 2.421875, "learning_rate": 1.989779323028575e-05, "loss": 7.629185180664063, "mean_token_accuracy": 0.021061680242419244, "num_tokens": 658790.0, "step": 75 }, { "entropy": 7.555726566314697, "epoch": 0.423728813559322, "grad_norm": 2.359375, "learning_rate": 1.9749279121818235e-05, "loss": 7.55064208984375, "mean_token_accuracy": 0.022715183552354575, "num_tokens": 872825.0, "step": 100 }, { "epoch": 0.5254237288135594, "eval_entropy": 7.486619492371877, "eval_loss": 7.498717784881592, "eval_mean_token_accuracy": 0.02434113745888074, "eval_num_tokens": 1084707.0, "eval_runtime": 7.3619, "eval_samples_per_second": 54.062, "eval_steps_per_second": 3.396, "step": 124 }, { "entropy": 7.509912757873535, "epoch": 0.5296610169491526, "grad_norm": 2.21875, "learning_rate": 1.9536354202855306e-05, "loss": 7.5065460205078125, "mean_token_accuracy": 0.022764644995331765, "num_tokens": 1093864.0, "step": 125 }, { "entropy": 7.504309902191162, "epoch": 0.635593220338983, "grad_norm": 2.078125, "learning_rate": 1.9260425209878052e-05, "loss": 7.493028564453125, "mean_token_accuracy": 0.022260171882808207, "num_tokens": 1315198.0, "step": 150 }, { "entropy": 7.464480457305908, "epoch": 0.7415254237288136, "grad_norm": 2.15625, "learning_rate": 1.8923315129986838e-05, "loss": 7.463182373046875, "mean_token_accuracy": 0.023391987532377242, "num_tokens": 1533213.0, "step": 175 }, { "entropy": 7.452612771987915, "epoch": 0.847457627118644, "grad_norm": 2.34375, "learning_rate": 1.8527251156925997e-05, "loss": 7.447894897460937, "mean_token_accuracy": 0.02403868570923805, "num_tokens": 1752307.0, "step": 200 }, { "entropy": 7.409109563827514, "epoch": 0.9533898305084746, "grad_norm": 1.96875, "learning_rate": 1.8074849976626273e-05, "loss": 7.407470703125, "mean_token_accuracy": 0.023314249143004416, "num_tokens": 1973350.0, "step": 225 }, { "epoch": 1.0508474576271187, "eval_entropy": 7.401865323384603, "eval_loss": 7.414607524871826, "eval_mean_token_accuracy": 0.025272298449029524, "eval_num_tokens": 2178943.0, "eval_runtime": 7.4146, "eval_samples_per_second": 53.678, "eval_steps_per_second": 3.372, "step": 248 }, { "entropy": 7.410350885391235, "epoch": 1.0593220338983051, "grad_norm": 2.078125, "learning_rate": 1.756910047947926e-05, "loss": 7.405702514648437, "mean_token_accuracy": 0.024052796624600886, "num_tokens": 2195473.0, "step": 250 }, { "entropy": 7.378520240783692, "epoch": 1.1652542372881356, "grad_norm": 2.0625, "learning_rate": 1.7013344013559197e-05, "loss": 7.368658447265625, "mean_token_accuracy": 0.024010552018880846, "num_tokens": 2410539.0, "step": 275 }, { "entropy": 7.370533514022827, "epoch": 1.271186440677966, "grad_norm": 2.015625, "learning_rate": 1.64112523092536e-05, "loss": 7.370477905273438, "mean_token_accuracy": 0.02511810462921858, "num_tokens": 2630347.0, "step": 300 }, { "entropy": 7.372100067138672, "epoch": 1.3771186440677967, "grad_norm": 2.140625, "learning_rate": 1.5766803221148676e-05, "loss": 7.374469604492187, "mean_token_accuracy": 0.02450455617159605, "num_tokens": 2848534.0, "step": 325 }, { "entropy": 7.342970514297486, "epoch": 1.4830508474576272, "grad_norm": 1.9609375, "learning_rate": 1.5084254447436169e-05, "loss": 7.339466552734375, "mean_token_accuracy": 0.025138991102576256, "num_tokens": 3070123.0, "step": 350 }, { "epoch": 1.576271186440678, "eval_entropy": 7.361576656500499, "eval_loss": 7.381193161010742, "eval_mean_token_accuracy": 0.025545974417279165, "eval_num_tokens": 3263577.0, "eval_runtime": 7.4123, "eval_samples_per_second": 53.695, "eval_steps_per_second": 3.373, "step": 372 }, { "entropy": 7.361075611114502, "epoch": 1.5889830508474576, "grad_norm": 1.9140625, "learning_rate": 1.4368115400470393e-05, "loss": 7.3520880126953125, "mean_token_accuracy": 0.024180141538381578, "num_tokens": 3288806.0, "step": 375 }, { "entropy": 7.3546325302124025, "epoch": 1.694915254237288, "grad_norm": 2.15625, "learning_rate": 1.3623117414318827e-05, "loss": 7.346293334960937, "mean_token_accuracy": 0.024999124109745027, "num_tokens": 3510776.0, "step": 400 }, { "entropy": 7.363360710144043, "epoch": 1.8008474576271185, "grad_norm": 2.078125, "learning_rate": 1.2854182486136944e-05, "loss": 7.364286499023438, "mean_token_accuracy": 0.02418241061270237, "num_tokens": 3731405.0, "step": 425 }, { "entropy": 7.334566602706909, "epoch": 1.9067796610169492, "grad_norm": 1.9609375, "learning_rate": 1.2066390757884328e-05, "loss": 7.33093505859375, "mean_token_accuracy": 0.02495731335133314, "num_tokens": 3953207.0, "step": 450 }, { "entropy": 7.353079776763916, "epoch": 2.01271186440678, "grad_norm": 1.8671875, "learning_rate": 1.1264946953221496e-05, "loss": 7.351827392578125, "mean_token_accuracy": 0.02447190221399069, "num_tokens": 4169521.0, "step": 475 }, { "epoch": 2.1016949152542375, "eval_entropy": 7.34862866004308, "eval_loss": 7.365415096282959, "eval_mean_token_accuracy": 0.025626841001212597, "eval_num_tokens": 4351452.0, "eval_runtime": 7.4142, "eval_samples_per_second": 53.681, "eval_steps_per_second": 3.372, "step": 496 }, { "entropy": 7.339797382354736, "epoch": 2.1186440677966103, "grad_norm": 2.03125, "learning_rate": 1.0455145991329639e-05, "loss": 7.3259820556640625, "mean_token_accuracy": 0.025096801929175853, "num_tokens": 4386912.0, "step": 500 }, { "entropy": 7.330105533599854, "epoch": 2.2245762711864407, "grad_norm": 2.03125, "learning_rate": 9.642338004833295e-06, "loss": 7.330958251953125, "mean_token_accuracy": 0.024473249688744547, "num_tokens": 4607819.0, "step": 525 }, { "entropy": 7.331509189605713, "epoch": 2.330508474576271, "grad_norm": 1.96875, "learning_rate": 8.831892992943e-06, "loss": 7.329585571289062, "mean_token_accuracy": 0.024803164564073086, "num_tokens": 4829926.0, "step": 550 }, { "entropy": 7.332346143722535, "epoch": 2.4364406779661016, "grad_norm": 1.953125, "learning_rate": 8.029165343344805e-06, "loss": 7.3258428955078125, "mean_token_accuracy": 0.02469826426357031, "num_tokens": 5045115.0, "step": 575 }, { "entropy": 7.318505411148071, "epoch": 2.542372881355932, "grad_norm": 1.9140625, "learning_rate": 7.2394584572309125e-06, "loss": 7.3118963623046875, "mean_token_accuracy": 0.02518722042441368, "num_tokens": 5265448.0, "step": 600 }, { "epoch": 2.6271186440677967, "eval_entropy": 7.333844860394795, "eval_loss": 7.359093189239502, "eval_mean_token_accuracy": 0.025550531456246972, "eval_num_tokens": 5439386.0, "eval_runtime": 7.4052, "eval_samples_per_second": 53.746, "eval_steps_per_second": 3.376, "step": 620 }, { "entropy": 7.321087207794189, "epoch": 2.648305084745763, "grad_norm": 2.0625, "learning_rate": 6.467989711184021e-06, "loss": 7.31301513671875, "mean_token_accuracy": 0.025983325839042663, "num_tokens": 5482207.0, "step": 625 }, { "entropy": 7.322469959259033, "epoch": 2.7542372881355934, "grad_norm": 2.125, "learning_rate": 5.7198559874026945e-06, "loss": 7.318033447265625, "mean_token_accuracy": 0.02565582599490881, "num_tokens": 5703727.0, "step": 650 }, { "entropy": 7.31039176940918, "epoch": 2.860169491525424, "grad_norm": 2.03125, "learning_rate": 5.000000000000003e-06, "loss": 7.305034790039063, "mean_token_accuracy": 0.02535436548292637, "num_tokens": 5923157.0, "step": 675 }, { "entropy": 7.3113681411743165, "epoch": 2.9661016949152543, "grad_norm": 1.9765625, "learning_rate": 4.313177639848408e-06, "loss": 7.3114166259765625, "mean_token_accuracy": 0.025559407025575638, "num_tokens": 6143779.0, "step": 700 }, { "entropy": 7.3387535953521725, "epoch": 3.0720338983050848, "grad_norm": 1.921875, "learning_rate": 3.6639265537145187e-06, "loss": 7.343036499023437, "mean_token_accuracy": 0.024094666354358196, "num_tokens": 6365371.0, "step": 725 }, { "epoch": 3.152542372881356, "eval_entropy": 7.332533776760101, "eval_loss": 7.357120990753174, "eval_mean_token_accuracy": 0.025878646954273183, "eval_num_tokens": 6532337.0, "eval_runtime": 7.4033, "eval_samples_per_second": 53.76, "eval_steps_per_second": 3.377, "step": 744 }, { "entropy": 7.320968351364136, "epoch": 3.1779661016949152, "grad_norm": 2.109375, "learning_rate": 3.056536165272662e-06, "loss": 7.313834228515625, "mean_token_accuracy": 0.025647504702210427, "num_tokens": 6584143.0, "step": 750 }, { "entropy": 7.319151067733765, "epoch": 3.2838983050847457, "grad_norm": 1.9140625, "learning_rate": 2.4950193360603868e-06, "loss": 7.315574951171875, "mean_token_accuracy": 0.02516275253146887, "num_tokens": 6806162.0, "step": 775 }, { "entropy": 7.312239484786987, "epoch": 3.389830508474576, "grad_norm": 1.8359375, "learning_rate": 1.9830858536039742e-06, "loss": 7.299415893554688, "mean_token_accuracy": 0.025689680464565753, "num_tokens": 7025188.0, "step": 800 }, { "entropy": 7.3349973487854, "epoch": 3.4957627118644066, "grad_norm": 1.90625, "learning_rate": 1.524117921870789e-06, "loss": 7.336126098632812, "mean_token_accuracy": 0.02420500263571739, "num_tokens": 7242603.0, "step": 825 }, { "entropy": 7.306003942489624, "epoch": 3.601694915254237, "grad_norm": 1.765625, "learning_rate": 1.121147815976248e-06, "loss": 7.2987548828125, "mean_token_accuracy": 0.02604618974030018, "num_tokens": 7462100.0, "step": 850 }, { "epoch": 3.6779661016949152, "eval_entropy": 7.331447899341583, "eval_loss": 7.3567795753479, "eval_mean_token_accuracy": 0.02568032095829646, "eval_num_tokens": 7621408.0, "eval_runtime": 7.4184, "eval_samples_per_second": 53.65, "eval_steps_per_second": 3.37, "step": 868 }, { "entropy": 7.314174528121948, "epoch": 3.707627118644068, "grad_norm": 2.0, "learning_rate": 7.76837848774642e-07, "loss": 7.314702758789062, "mean_token_accuracy": 0.02541963815689087, "num_tokens": 7681092.0, "step": 875 }, { "entropy": 7.335706939697266, "epoch": 3.8135593220338984, "grad_norm": 2.03125, "learning_rate": 4.934627816890469e-07, "loss": 7.334556884765625, "mean_token_accuracy": 0.02444286733865738, "num_tokens": 7902109.0, "step": 900 }, { "entropy": 7.30207275390625, "epoch": 3.919491525423729, "grad_norm": 1.96875, "learning_rate": 2.728947959871353e-07, "loss": 7.29387451171875, "mean_token_accuracy": 0.02536882445216179, "num_tokens": 8122890.0, "step": 925 }, { "entropy": 7.312922801971435, "epoch": 4.02542372881356, "grad_norm": 1.984375, "learning_rate": 1.1659112379354575e-07, "loss": 7.30086181640625, "mean_token_accuracy": 0.025601605214178563, "num_tokens": 8341879.0, "step": 950 }, { "entropy": 7.326199951171875, "epoch": 4.13135593220339, "grad_norm": 1.953125, "learning_rate": 2.558442055732524e-08, "loss": 7.32387939453125, "mean_token_accuracy": 0.024802666790783405, "num_tokens": 8564759.0, "step": 975 }, { "epoch": 4.203389830508475, "eval_entropy": 7.331596851348877, "eval_loss": 7.356758117675781, "eval_mean_token_accuracy": 0.02577025055264433, "eval_num_tokens": 8715260.0, "eval_runtime": 7.397, "eval_samples_per_second": 53.806, "eval_steps_per_second": 3.38, "step": 992 }, { "epoch": 4.220338983050848, "eval_entropy": 7.331597983837128, "eval_loss": 7.3567633628845215, "eval_mean_token_accuracy": 0.02577025055264433, "eval_num_tokens": 8750612.0, "eval_runtime": 7.4178, "eval_samples_per_second": 53.655, "eval_steps_per_second": 3.37, "step": 996 } ], "logging_steps": 25, "max_steps": 996, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 124, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 4.380260592254976e+16, "train_batch_size": 16, "trial_name": null, "trial_params": null }