{ "best_global_step": 900, "best_metric": 0.8228043143297381, "best_model_checkpoint": "/content/drive/MyDrive/expA_realonly/checkpoint-900", "epoch": 15.0, "eval_steps": 50, "global_step": 1290, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.011627906976744186, "grad_norm": 4.9740142822265625, "learning_rate": 0.0, "loss": 0.317932665348053, "step": 1 }, { "epoch": 0.29069767441860467, "grad_norm": 1.5566426515579224, "learning_rate": 6.282722513089005e-06, "loss": 0.3199571371078491, "step": 25 }, { "epoch": 0.5813953488372093, "grad_norm": 1.6379677057266235, "learning_rate": 1.2827225130890053e-05, "loss": 0.24125898361206055, "step": 50 }, { "epoch": 0.5813953488372093, "eval_accuracy": 0.8287126584998925, "eval_f1": 0.08611410118406888, "eval_loss": 0.10772959887981415, "eval_precision": 0.15810276679841898, "eval_recall": 0.05917159763313609, "eval_runtime": 4.2273, "eval_samples_per_second": 80.667, "eval_steps_per_second": 1.419, "step": 50 }, { "epoch": 0.872093023255814, "grad_norm": 8.703161239624023, "learning_rate": 1.93717277486911e-05, "loss": 0.20946041107177735, "step": 75 }, { "epoch": 1.1627906976744187, "grad_norm": 0.9212121963500977, "learning_rate": 2.591623036649215e-05, "loss": 0.19275867462158203, "step": 100 }, { "epoch": 1.1627906976744187, "eval_accuracy": 0.7635933806146572, "eval_f1": 0.3981945837512538, "eval_loss": 0.07719173282384872, "eval_precision": 0.30121396054628224, "eval_recall": 0.5872781065088757, "eval_runtime": 1.6016, "eval_samples_per_second": 212.909, "eval_steps_per_second": 3.746, "step": 100 }, { "epoch": 1.4534883720930232, "grad_norm": 1.46477210521698, "learning_rate": 3.246073298429319e-05, "loss": 0.14603865623474122, "step": 125 }, { "epoch": 1.744186046511628, "grad_norm": 3.729416608810425, "learning_rate": 3.900523560209424e-05, "loss": 0.13855588912963868, "step": 150 }, { "epoch": 1.744186046511628, "eval_accuracy": 0.81130453470879, "eval_f1": 0.46785521339816316, "eval_loss": 0.06223325803875923, "eval_precision": 0.36851063829787234, "eval_recall": 0.6405325443786982, "eval_runtime": 1.5906, "eval_samples_per_second": 214.385, "eval_steps_per_second": 3.772, "step": 150 }, { "epoch": 2.0348837209302326, "grad_norm": 1.2140589952468872, "learning_rate": 4.554973821989529e-05, "loss": 0.09624839782714843, "step": 175 }, { "epoch": 2.3255813953488373, "grad_norm": 0.875888466835022, "learning_rate": 4.999346304613061e-05, "loss": 0.0821054744720459, "step": 200 }, { "epoch": 2.3255813953488373, "eval_accuracy": 0.7872340425531915, "eval_f1": 0.4847619047619048, "eval_loss": 0.04723217338323593, "eval_precision": 0.3574438202247191, "eval_recall": 0.7529585798816568, "eval_runtime": 1.6255, "eval_samples_per_second": 209.777, "eval_steps_per_second": 3.691, "step": 200 }, { "epoch": 2.616279069767442, "grad_norm": 1.0979472398757935, "learning_rate": 4.98888472605987e-05, "loss": 0.08414460182189941, "step": 225 }, { "epoch": 2.9069767441860463, "grad_norm": 0.49558770656585693, "learning_rate": 4.965717280180432e-05, "loss": 0.08369583129882813, "step": 250 }, { "epoch": 2.9069767441860463, "eval_accuracy": 0.6211046636578551, "eval_f1": 0.3483915126625599, "eval_loss": 0.045315902680158615, "eval_precision": 0.22662511130899377, "eval_recall": 0.7529585798816568, "eval_runtime": 1.6274, "eval_samples_per_second": 209.539, "eval_steps_per_second": 3.687, "step": 250 }, { "epoch": 3.197674418604651, "grad_norm": 0.8114362955093384, "learning_rate": 4.9299622378173246e-05, "loss": 0.05607881069183349, "step": 275 }, { "epoch": 3.488372093023256, "grad_norm": 0.6278374195098877, "learning_rate": 4.881802130053548e-05, "loss": 0.043469696044921874, "step": 300 }, { "epoch": 3.488372093023256, "eval_accuracy": 0.8082957231893402, "eval_f1": 0.5285784074255008, "eval_loss": 0.04308881610631943, "eval_precision": 0.39460247994164843, "eval_recall": 0.8002958579881657, "eval_runtime": 1.6193, "eval_samples_per_second": 210.585, "eval_steps_per_second": 3.705, "step": 300 }, { "epoch": 3.7790697674418605, "grad_norm": 1.0219486951828003, "learning_rate": 4.821482816383218e-05, "loss": 0.047760300636291504, "step": 325 }, { "epoch": 4.069767441860465, "grad_norm": 0.509274959564209, "learning_rate": 4.749312229587908e-05, "loss": 0.03177810907363891, "step": 350 }, { "epoch": 4.069767441860465, "eval_accuracy": 0.9196217494089834, "eval_f1": 0.7152317880794702, "eval_loss": 0.04378104954957962, "eval_precision": 0.6474820143884892, "eval_recall": 0.7988165680473372, "eval_runtime": 1.6177, "eval_samples_per_second": 210.792, "eval_steps_per_second": 3.709, "step": 350 }, { "epoch": 4.3604651162790695, "grad_norm": 0.47098585963249207, "learning_rate": 4.6656588037260834e-05, "loss": 0.020146708488464355, "step": 375 }, { "epoch": 4.651162790697675, "grad_norm": 0.7534321546554565, "learning_rate": 4.570949593260837e-05, "loss": 0.018921481370925905, "step": 400 }, { "epoch": 4.651162790697675, "eval_accuracy": 0.9097356544165055, "eval_f1": 0.6987341772151898, "eval_loss": 0.05498046055436134, "eval_precision": 0.6106194690265486, "eval_recall": 0.8165680473372781, "eval_runtime": 1.6157, "eval_samples_per_second": 211.05, "eval_steps_per_second": 3.713, "step": 400 }, { "epoch": 4.941860465116279, "grad_norm": 0.7499828934669495, "learning_rate": 4.465668092927841e-05, "loss": 0.01998784065246582, "step": 425 }, { "epoch": 5.232558139534884, "grad_norm": 0.24809418618679047, "learning_rate": 4.350351769473198e-05, "loss": 0.01218403697013855, "step": 450 }, { "epoch": 5.232558139534884, "eval_accuracy": 0.9084461637653127, "eval_f1": 0.6831746031746032, "eval_loss": 0.05535344406962395, "eval_precision": 0.5984427141268076, "eval_recall": 0.7958579881656804, "eval_runtime": 1.6123, "eval_samples_per_second": 211.498, "eval_steps_per_second": 3.721, "step": 450 }, { "epoch": 5.523255813953488, "grad_norm": 0.3144132196903229, "learning_rate": 4.2255893178617745e-05, "loss": 0.012306832075119019, "step": 475 }, { "epoch": 5.813953488372093, "grad_norm": 0.1607646942138672, "learning_rate": 4.092017655963198e-05, "loss": 0.010539753437042236, "step": 500 }, { "epoch": 5.813953488372093, "eval_accuracy": 0.9527186761229315, "eval_f1": 0.8059040590405904, "eval_loss": 0.07191809266805649, "eval_precision": 0.8041237113402062, "eval_recall": 0.8076923076923077, "eval_runtime": 1.6569, "eval_samples_per_second": 205.806, "eval_steps_per_second": 3.621, "step": 500 }, { "epoch": 6.104651162790698, "grad_norm": 0.19801200926303864, "learning_rate": 3.9503186730577816e-05, "loss": 0.008691226243972778, "step": 525 }, { "epoch": 6.395348837209302, "grad_norm": 0.4177681505680084, "learning_rate": 3.801215748761385e-05, "loss": 0.004750225245952606, "step": 550 }, { "epoch": 6.395348837209302, "eval_accuracy": 0.9458413926499033, "eval_f1": 0.7863866763215062, "eval_loss": 0.07378304749727249, "eval_precision": 0.7702127659574468, "eval_recall": 0.8032544378698225, "eval_runtime": 1.6214, "eval_samples_per_second": 210.313, "eval_steps_per_second": 3.701, "step": 550 }, { "epoch": 6.686046511627907, "grad_norm": 0.30753573775291443, "learning_rate": 3.645470060140278e-05, "loss": 0.005743271708488464, "step": 575 }, { "epoch": 6.976744186046512, "grad_norm": 0.13237181305885315, "learning_rate": 3.4838766958683304e-05, "loss": 0.006215065121650696, "step": 600 }, { "epoch": 6.976744186046512, "eval_accuracy": 0.9447668171072426, "eval_f1": 0.7789934354485777, "eval_loss": 0.062308527529239655, "eval_precision": 0.7683453237410072, "eval_recall": 0.7899408284023669, "eval_runtime": 1.6197, "eval_samples_per_second": 210.528, "eval_steps_per_second": 3.704, "step": 600 }, { "epoch": 7.267441860465116, "grad_norm": 0.023809686303138733, "learning_rate": 3.317260597263932e-05, "loss": 0.002318141460418701, "step": 625 }, { "epoch": 7.558139534883721, "grad_norm": 0.03782212734222412, "learning_rate": 3.146472346927845e-05, "loss": 0.003790220320224762, "step": 650 }, { "epoch": 7.558139534883721, "eval_accuracy": 0.9529335912314636, "eval_f1": 0.8062827225130891, "eval_loss": 0.07683796435594559, "eval_precision": 0.8154311649016641, "eval_recall": 0.7973372781065089, "eval_runtime": 1.6235, "eval_samples_per_second": 210.043, "eval_steps_per_second": 3.696, "step": 650 }, { "epoch": 7.848837209302325, "grad_norm": 0.037971507757902145, "learning_rate": 2.9723838264811545e-05, "loss": 0.0018679146468639374, "step": 675 }, { "epoch": 8.13953488372093, "grad_norm": 0.6083823442459106, "learning_rate": 2.7958837655707814e-05, "loss": 0.0019237904250621796, "step": 700 }, { "epoch": 8.13953488372093, "eval_accuracy": 0.9565871480765098, "eval_f1": 0.8152091254752851, "eval_loss": 0.08732757717370987, "eval_precision": 0.838810641627543, "eval_recall": 0.7928994082840237, "eval_runtime": 1.6124, "eval_samples_per_second": 211.484, "eval_steps_per_second": 3.721, "step": 700 }, { "epoch": 8.430232558139535, "grad_norm": 0.022007286548614502, "learning_rate": 2.6178732048650694e-05, "loss": 0.0010710173845291137, "step": 725 }, { "epoch": 8.720930232558139, "grad_norm": 0.09439104795455933, "learning_rate": 2.4392608962010652e-05, "loss": 0.0006907544285058976, "step": 750 }, { "epoch": 8.720930232558139, "eval_accuracy": 0.9449817322157748, "eval_f1": 0.7829848594087959, "eval_loss": 0.08308640867471695, "eval_precision": 0.7637130801687764, "eval_recall": 0.8032544378698225, "eval_runtime": 1.6359, "eval_samples_per_second": 208.445, "eval_steps_per_second": 3.668, "step": 750 }, { "epoch": 9.011627906976743, "grad_norm": 0.018290311098098755, "learning_rate": 2.2609586633659256e-05, "loss": 0.0005397907271981239, "step": 775 }, { "epoch": 9.30232558139535, "grad_norm": 0.002839206252247095, "learning_rate": 2.0838767471959014e-05, "loss": 0.0002632186934351921, "step": 800 }, { "epoch": 9.30232558139535, "eval_accuracy": 0.9544379969911885, "eval_f1": 0.8081880212282032, "eval_loss": 0.09754534065723419, "eval_precision": 0.8289269051321928, "eval_recall": 0.7884615384615384, "eval_runtime": 1.6188, "eval_samples_per_second": 210.653, "eval_steps_per_second": 3.706, "step": 800 }, { "epoch": 9.593023255813954, "grad_norm": 0.04134448245167732, "learning_rate": 1.9089191587563417e-05, "loss": 0.0005076020956039428, "step": 825 }, { "epoch": 9.883720930232558, "grad_norm": 0.08968573063611984, "learning_rate": 1.7369790643249573e-05, "loss": 0.0005874237418174743, "step": 850 }, { "epoch": 9.883720930232558, "eval_accuracy": 0.9548678272082527, "eval_f1": 0.8093797276853252, "eval_loss": 0.09803693741559982, "eval_precision": 0.8281733746130031, "eval_recall": 0.7914201183431953, "eval_runtime": 1.6209, "eval_samples_per_second": 210.379, "eval_steps_per_second": 3.702, "step": 850 }, { "epoch": 10.174418604651162, "grad_norm": 0.02889181859791279, "learning_rate": 1.5689342257382207e-05, "loss": 0.0004838050529360771, "step": 875 }, { "epoch": 10.465116279069768, "grad_norm": 0.020970497280359268, "learning_rate": 1.4056425193781048e-05, "loss": 0.0001906752586364746, "step": 900 }, { "epoch": 10.465116279069768, "eval_accuracy": 0.9587362991618311, "eval_f1": 0.8228043143297381, "eval_loss": 0.10382715612649918, "eval_precision": 0.8585209003215434, "eval_recall": 0.7899408284023669, "eval_runtime": 1.6341, "eval_samples_per_second": 208.675, "eval_steps_per_second": 3.672, "step": 900 }, { "epoch": 10.755813953488373, "grad_norm": 0.028520096093416214, "learning_rate": 1.2479375566749694e-05, "loss": 0.00012492083944380284, "step": 925 }, { "epoch": 11.046511627906977, "grad_norm": 0.03838531672954559, "learning_rate": 1.0966244284840926e-05, "loss": 0.00028255857527256014, "step": 950 }, { "epoch": 11.046511627906977, "eval_accuracy": 0.9580915538362347, "eval_f1": 0.819369715603382, "eval_loss": 0.10540532320737839, "eval_precision": 0.8528, "eval_recall": 0.7884615384615384, "eval_runtime": 1.6495, "eval_samples_per_second": 206.73, "eval_steps_per_second": 3.637, "step": 950 }, { "epoch": 11.337209302325581, "grad_norm": 0.05398673936724663, "learning_rate": 9.524755950610204e-06, "loss": 0.00014415644109249114, "step": 975 }, { "epoch": 11.627906976744185, "grad_norm": 0.026561638340353966, "learning_rate": 8.162269426175681e-06, "loss": 9.150288999080658e-05, "step": 1000 }, { "epoch": 11.627906976744185, "eval_accuracy": 0.9574468085106383, "eval_f1": 0.8180428134556575, "eval_loss": 0.10544126480817795, "eval_precision": 0.8465189873417721, "eval_recall": 0.7914201183431953, "eval_runtime": 1.6274, "eval_samples_per_second": 209.539, "eval_steps_per_second": 3.687, "step": 1000 }, { "epoch": 11.918604651162791, "grad_norm": 0.010734460316598415, "learning_rate": 6.885740265899526e-06, "loss": 4.033456556499005e-05, "step": 1025 }, { "epoch": 12.209302325581396, "grad_norm": 0.02024712599813938, "learning_rate": 5.701685207973243e-06, "loss": 6.52561942115426e-05, "step": 1050 }, { "epoch": 12.209302325581396, "eval_accuracy": 0.9576617236191705, "eval_f1": 0.8190184049079755, "eval_loss": 0.10666228085756302, "eval_precision": 0.8503184713375797, "eval_recall": 0.7899408284023669, "eval_runtime": 1.6269, "eval_samples_per_second": 209.598, "eval_steps_per_second": 3.688, "step": 1050 }, { "epoch": 12.5, "grad_norm": 0.034469809383153915, "learning_rate": 4.616148906179082e-06, "loss": 7.551711052656174e-05, "step": 1075 }, { "epoch": 12.790697674418604, "grad_norm": 0.004050907213240862, "learning_rate": 3.6346730716634025e-06, "loss": 7.49318953603506e-05, "step": 1100 }, { "epoch": 12.790697674418604, "eval_accuracy": 0.9565871480765098, "eval_f1": 0.8146453089244853, "eval_loss": 0.10619472712278366, "eval_precision": 0.8409448818897638, "eval_recall": 0.7899408284023669, "eval_runtime": 1.6196, "eval_samples_per_second": 210.546, "eval_steps_per_second": 3.705, "step": 1100 }, { "epoch": 13.081395348837209, "grad_norm": 0.11917345970869064, "learning_rate": 2.7622681822545764e-06, "loss": 8.815748617053032e-05, "step": 1125 }, { "epoch": 13.372093023255815, "grad_norm": 0.02682509273290634, "learning_rate": 2.0033879037506004e-06, "loss": 6.015756167471409e-05, "step": 1150 }, { "epoch": 13.372093023255815, "eval_accuracy": 0.9583064689447668, "eval_f1": 0.8205521472392638, "eval_loss": 0.10740578919649124, "eval_precision": 0.8519108280254777, "eval_recall": 0.7914201183431953, "eval_runtime": 1.6217, "eval_samples_per_second": 210.273, "eval_steps_per_second": 3.7, "step": 1150 }, { "epoch": 13.662790697674419, "grad_norm": 0.004100531339645386, "learning_rate": 1.361906353756917e-06, "loss": 4.690625239163637e-05, "step": 1175 }, { "epoch": 13.953488372093023, "grad_norm": 0.008385015651583672, "learning_rate": 8.410983241436132e-07, "loss": 6.560925394296646e-05, "step": 1200 }, { "epoch": 13.953488372093023, "eval_accuracy": 0.9578766387277026, "eval_f1": 0.8181120491174213, "eval_loss": 0.10830119252204895, "eval_precision": 0.8500797448165869, "eval_recall": 0.7884615384615384, "eval_runtime": 1.6315, "eval_samples_per_second": 209.012, "eval_steps_per_second": 3.678, "step": 1200 }, { "epoch": 14.244186046511627, "grad_norm": 0.003520221682265401, "learning_rate": 4.436225630870927e-07, "loss": 0.00012058223597705364, "step": 1225 }, { "epoch": 14.534883720930232, "grad_norm": 0.00905795767903328, "learning_rate": 1.7150820204230865e-07, "loss": 8.818465285003186e-05, "step": 1250 }, { "epoch": 14.534883720930232, "eval_accuracy": 0.9578766387277026, "eval_f1": 0.8187403993855606, "eval_loss": 0.10815286636352539, "eval_precision": 0.8514376996805112, "eval_recall": 0.7884615384615384, "eval_runtime": 1.6307, "eval_samples_per_second": 209.118, "eval_steps_per_second": 3.68, "step": 1250 }, { "epoch": 14.825581395348838, "grad_norm": 0.006475365720689297, "learning_rate": 2.6144396936325645e-08, "loss": 4.936248995363712e-05, "step": 1275 } ], "logging_steps": 25, "max_steps": 1290, "num_input_tokens_seen": 0, "num_train_epochs": 15, "save_steps": 50, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 10, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 7 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 6995052164620800.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }