| { |
| "best_metric": 0.8136880993843079, |
| "best_model_checkpoint": "./outputs/instruct-lora-8b-aplly_chat_template-intellectual/checkpoint-1200", |
| "epoch": 1.8528389339513325, |
| "eval_steps": 20, |
| "global_step": 1200, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.001544998068752414, |
| "eval_loss": 1.3165150880813599, |
| "eval_runtime": 48.891, |
| "eval_samples_per_second": 23.542, |
| "eval_steps_per_second": 5.891, |
| "step": 1 |
| }, |
| { |
| "epoch": 0.03089996137504828, |
| "grad_norm": 0.7807549238204956, |
| "learning_rate": 3.092783505154639e-06, |
| "loss": 1.2724, |
| "step": 20 |
| }, |
| { |
| "epoch": 0.03089996137504828, |
| "eval_loss": 1.314327597618103, |
| "eval_runtime": 48.8364, |
| "eval_samples_per_second": 23.568, |
| "eval_steps_per_second": 5.897, |
| "step": 20 |
| }, |
| { |
| "epoch": 0.06179992275009656, |
| "grad_norm": 0.8449882864952087, |
| "learning_rate": 6.185567010309278e-06, |
| "loss": 1.2394, |
| "step": 40 |
| }, |
| { |
| "epoch": 0.06179992275009656, |
| "eval_loss": 1.2848930358886719, |
| "eval_runtime": 48.9051, |
| "eval_samples_per_second": 23.535, |
| "eval_steps_per_second": 5.889, |
| "step": 40 |
| }, |
| { |
| "epoch": 0.09269988412514485, |
| "grad_norm": 0.8352286219596863, |
| "learning_rate": 9.278350515463918e-06, |
| "loss": 1.1438, |
| "step": 60 |
| }, |
| { |
| "epoch": 0.09269988412514485, |
| "eval_loss": 1.1923872232437134, |
| "eval_runtime": 48.8793, |
| "eval_samples_per_second": 23.548, |
| "eval_steps_per_second": 5.892, |
| "step": 60 |
| }, |
| { |
| "epoch": 0.12359984550019312, |
| "grad_norm": 0.877621591091156, |
| "learning_rate": 1.2371134020618556e-05, |
| "loss": 1.057, |
| "step": 80 |
| }, |
| { |
| "epoch": 0.12359984550019312, |
| "eval_loss": 1.13431978225708, |
| "eval_runtime": 50.9437, |
| "eval_samples_per_second": 22.594, |
| "eval_steps_per_second": 5.653, |
| "step": 80 |
| }, |
| { |
| "epoch": 0.1544998068752414, |
| "grad_norm": 0.9503705501556396, |
| "learning_rate": 1.5463917525773194e-05, |
| "loss": 1.0444, |
| "step": 100 |
| }, |
| { |
| "epoch": 0.1544998068752414, |
| "eval_loss": 1.0924711227416992, |
| "eval_runtime": 48.8783, |
| "eval_samples_per_second": 23.548, |
| "eval_steps_per_second": 5.892, |
| "step": 100 |
| }, |
| { |
| "epoch": 0.1853997682502897, |
| "grad_norm": 1.030405879020691, |
| "learning_rate": 1.8556701030927837e-05, |
| "loss": 0.994, |
| "step": 120 |
| }, |
| { |
| "epoch": 0.1853997682502897, |
| "eval_loss": 1.064813256263733, |
| "eval_runtime": 48.8238, |
| "eval_samples_per_second": 23.575, |
| "eval_steps_per_second": 5.899, |
| "step": 120 |
| }, |
| { |
| "epoch": 0.21629972962533797, |
| "grad_norm": 1.367910623550415, |
| "learning_rate": 2.1649484536082473e-05, |
| "loss": 0.9561, |
| "step": 140 |
| }, |
| { |
| "epoch": 0.21629972962533797, |
| "eval_loss": 1.036982774734497, |
| "eval_runtime": 51.1767, |
| "eval_samples_per_second": 22.491, |
| "eval_steps_per_second": 5.628, |
| "step": 140 |
| }, |
| { |
| "epoch": 0.24719969100038625, |
| "grad_norm": 1.3933994770050049, |
| "learning_rate": 2.4742268041237112e-05, |
| "loss": 0.9565, |
| "step": 160 |
| }, |
| { |
| "epoch": 0.24719969100038625, |
| "eval_loss": 1.019098162651062, |
| "eval_runtime": 50.3225, |
| "eval_samples_per_second": 22.872, |
| "eval_steps_per_second": 5.723, |
| "step": 160 |
| }, |
| { |
| "epoch": 0.27809965237543455, |
| "grad_norm": 1.367946982383728, |
| "learning_rate": 2.7835051546391755e-05, |
| "loss": 0.8842, |
| "step": 180 |
| }, |
| { |
| "epoch": 0.27809965237543455, |
| "eval_loss": 1.004747986793518, |
| "eval_runtime": 48.9997, |
| "eval_samples_per_second": 23.49, |
| "eval_steps_per_second": 5.878, |
| "step": 180 |
| }, |
| { |
| "epoch": 0.3089996137504828, |
| "grad_norm": 1.4316825866699219, |
| "learning_rate": 2.9999126880904965e-05, |
| "loss": 0.8863, |
| "step": 200 |
| }, |
| { |
| "epoch": 0.3089996137504828, |
| "eval_loss": 0.9973997473716736, |
| "eval_runtime": 50.6767, |
| "eval_samples_per_second": 22.713, |
| "eval_steps_per_second": 5.683, |
| "step": 200 |
| }, |
| { |
| "epoch": 0.3398995751255311, |
| "grad_norm": 1.4682165384292603, |
| "learning_rate": 2.998360759115084e-05, |
| "loss": 0.8935, |
| "step": 220 |
| }, |
| { |
| "epoch": 0.3398995751255311, |
| "eval_loss": 0.9823518991470337, |
| "eval_runtime": 48.7888, |
| "eval_samples_per_second": 23.591, |
| "eval_steps_per_second": 5.903, |
| "step": 220 |
| }, |
| { |
| "epoch": 0.3707995365005794, |
| "grad_norm": 1.6310033798217773, |
| "learning_rate": 2.9948708759677052e-05, |
| "loss": 0.8596, |
| "step": 240 |
| }, |
| { |
| "epoch": 0.3707995365005794, |
| "eval_loss": 0.9750108122825623, |
| "eval_runtime": 48.8205, |
| "eval_samples_per_second": 23.576, |
| "eval_steps_per_second": 5.899, |
| "step": 240 |
| }, |
| { |
| "epoch": 0.40169949787562764, |
| "grad_norm": 1.498504877090454, |
| "learning_rate": 2.9894475524035186e-05, |
| "loss": 0.8656, |
| "step": 260 |
| }, |
| { |
| "epoch": 0.40169949787562764, |
| "eval_loss": 0.9654810428619385, |
| "eval_runtime": 50.0758, |
| "eval_samples_per_second": 22.985, |
| "eval_steps_per_second": 5.751, |
| "step": 260 |
| }, |
| { |
| "epoch": 0.43259945925067594, |
| "grad_norm": 1.630052089691162, |
| "learning_rate": 2.9820978028564395e-05, |
| "loss": 0.852, |
| "step": 280 |
| }, |
| { |
| "epoch": 0.43259945925067594, |
| "eval_loss": 0.954610288143158, |
| "eval_runtime": 49.7619, |
| "eval_samples_per_second": 23.13, |
| "eval_steps_per_second": 5.788, |
| "step": 280 |
| }, |
| { |
| "epoch": 0.46349942062572425, |
| "grad_norm": 1.565081238746643, |
| "learning_rate": 2.9728311333667943e-05, |
| "loss": 0.8407, |
| "step": 300 |
| }, |
| { |
| "epoch": 0.46349942062572425, |
| "eval_loss": 0.9461371898651123, |
| "eval_runtime": 48.774, |
| "eval_samples_per_second": 23.599, |
| "eval_steps_per_second": 5.905, |
| "step": 300 |
| }, |
| { |
| "epoch": 0.4943993820007725, |
| "grad_norm": 1.5313355922698975, |
| "learning_rate": 2.961659529286366e-05, |
| "loss": 0.8102, |
| "step": 320 |
| }, |
| { |
| "epoch": 0.4943993820007725, |
| "eval_loss": 0.9419096112251282, |
| "eval_runtime": 48.7963, |
| "eval_samples_per_second": 23.588, |
| "eval_steps_per_second": 5.902, |
| "step": 320 |
| }, |
| { |
| "epoch": 0.5252993433758207, |
| "grad_norm": 1.8025727272033691, |
| "learning_rate": 2.948597439776749e-05, |
| "loss": 0.817, |
| "step": 340 |
| }, |
| { |
| "epoch": 0.5252993433758207, |
| "eval_loss": 0.9346877932548523, |
| "eval_runtime": 48.7844, |
| "eval_samples_per_second": 23.594, |
| "eval_steps_per_second": 5.904, |
| "step": 340 |
| }, |
| { |
| "epoch": 0.5561993047508691, |
| "grad_norm": 1.6470723152160645, |
| "learning_rate": 2.9336617591210508e-05, |
| "loss": 0.802, |
| "step": 360 |
| }, |
| { |
| "epoch": 0.5561993047508691, |
| "eval_loss": 0.9356982111930847, |
| "eval_runtime": 48.7896, |
| "eval_samples_per_second": 23.591, |
| "eval_steps_per_second": 5.903, |
| "step": 360 |
| }, |
| { |
| "epoch": 0.5870992661259173, |
| "grad_norm": 1.5940176248550415, |
| "learning_rate": 2.9168718048731113e-05, |
| "loss": 0.8232, |
| "step": 380 |
| }, |
| { |
| "epoch": 0.5870992661259173, |
| "eval_loss": 0.928005039691925, |
| "eval_runtime": 48.9837, |
| "eval_samples_per_second": 23.498, |
| "eval_steps_per_second": 5.88, |
| "step": 380 |
| }, |
| { |
| "epoch": 0.6179992275009656, |
| "grad_norm": 1.7030407190322876, |
| "learning_rate": 2.898249292872514e-05, |
| "loss": 0.8222, |
| "step": 400 |
| }, |
| { |
| "epoch": 0.6179992275009656, |
| "eval_loss": 0.9209285378456116, |
| "eval_runtime": 48.7992, |
| "eval_samples_per_second": 23.586, |
| "eval_steps_per_second": 5.902, |
| "step": 400 |
| }, |
| { |
| "epoch": 0.6488991888760139, |
| "grad_norm": 1.6369273662567139, |
| "learning_rate": 2.8778183091576867e-05, |
| "loss": 0.8094, |
| "step": 420 |
| }, |
| { |
| "epoch": 0.6488991888760139, |
| "eval_loss": 0.9116755127906799, |
| "eval_runtime": 48.8182, |
| "eval_samples_per_second": 23.577, |
| "eval_steps_per_second": 5.899, |
| "step": 420 |
| }, |
| { |
| "epoch": 0.6797991502510622, |
| "grad_norm": 1.6444923877716064, |
| "learning_rate": 2.855605278813435e-05, |
| "loss": 0.7793, |
| "step": 440 |
| }, |
| { |
| "epoch": 0.6797991502510622, |
| "eval_loss": 0.9064341187477112, |
| "eval_runtime": 48.9673, |
| "eval_samples_per_second": 23.505, |
| "eval_steps_per_second": 5.881, |
| "step": 440 |
| }, |
| { |
| "epoch": 0.7106991116261104, |
| "grad_norm": 1.5660841464996338, |
| "learning_rate": 2.8316389317931867e-05, |
| "loss": 0.7989, |
| "step": 460 |
| }, |
| { |
| "epoch": 0.7106991116261104, |
| "eval_loss": 0.9033644199371338, |
| "eval_runtime": 48.8113, |
| "eval_samples_per_second": 23.581, |
| "eval_steps_per_second": 5.9, |
| "step": 460 |
| }, |
| { |
| "epoch": 0.7415990730011588, |
| "grad_norm": 1.7576305866241455, |
| "learning_rate": 2.8059502657601618e-05, |
| "loss": 0.7804, |
| "step": 480 |
| }, |
| { |
| "epoch": 0.7415990730011588, |
| "eval_loss": 0.8978912234306335, |
| "eval_runtime": 50.7823, |
| "eval_samples_per_second": 22.665, |
| "eval_steps_per_second": 5.671, |
| "step": 480 |
| }, |
| { |
| "epoch": 0.772499034376207, |
| "grad_norm": 1.7764692306518555, |
| "learning_rate": 2.7785725059955288e-05, |
| "loss": 0.7651, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.772499034376207, |
| "eval_loss": 0.8953514695167542, |
| "eval_runtime": 48.7892, |
| "eval_samples_per_second": 23.591, |
| "eval_steps_per_second": 5.903, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.8033989957512553, |
| "grad_norm": 1.7256971597671509, |
| "learning_rate": 2.7495410624253885e-05, |
| "loss": 0.7886, |
| "step": 520 |
| }, |
| { |
| "epoch": 0.8033989957512553, |
| "eval_loss": 0.8885264992713928, |
| "eval_runtime": 48.7926, |
| "eval_samples_per_second": 23.59, |
| "eval_steps_per_second": 5.903, |
| "step": 520 |
| }, |
| { |
| "epoch": 0.8342989571263036, |
| "grad_norm": 1.761567234992981, |
| "learning_rate": 2.718893483822187e-05, |
| "loss": 0.7771, |
| "step": 540 |
| }, |
| { |
| "epoch": 0.8342989571263036, |
| "eval_loss": 0.8897767663002014, |
| "eval_runtime": 50.7177, |
| "eval_samples_per_second": 22.694, |
| "eval_steps_per_second": 5.678, |
| "step": 540 |
| }, |
| { |
| "epoch": 0.8651989185013519, |
| "grad_norm": 1.7774807214736938, |
| "learning_rate": 2.686669409239773e-05, |
| "loss": 0.7708, |
| "step": 560 |
| }, |
| { |
| "epoch": 0.8651989185013519, |
| "eval_loss": 0.884600043296814, |
| "eval_runtime": 48.8104, |
| "eval_samples_per_second": 23.581, |
| "eval_steps_per_second": 5.9, |
| "step": 560 |
| }, |
| { |
| "epoch": 0.8960988798764001, |
| "grad_norm": 1.616105079650879, |
| "learning_rate": 2.6529105167449225e-05, |
| "loss": 0.7656, |
| "step": 580 |
| }, |
| { |
| "epoch": 0.8960988798764001, |
| "eval_loss": 0.8817371129989624, |
| "eval_runtime": 48.7884, |
| "eval_samples_per_second": 23.592, |
| "eval_steps_per_second": 5.903, |
| "step": 580 |
| }, |
| { |
| "epoch": 0.9269988412514485, |
| "grad_norm": 1.5919208526611328, |
| "learning_rate": 2.6176604695116443e-05, |
| "loss": 0.7574, |
| "step": 600 |
| }, |
| { |
| "epoch": 0.9269988412514485, |
| "eval_loss": 0.878905713558197, |
| "eval_runtime": 51.0012, |
| "eval_samples_per_second": 22.568, |
| "eval_steps_per_second": 5.647, |
| "step": 600 |
| }, |
| { |
| "epoch": 0.9578988026264967, |
| "grad_norm": 1.7113957405090332, |
| "learning_rate": 2.5809648593479732e-05, |
| "loss": 0.78, |
| "step": 620 |
| }, |
| { |
| "epoch": 0.9578988026264967, |
| "eval_loss": 0.8750773072242737, |
| "eval_runtime": 48.8281, |
| "eval_samples_per_second": 23.572, |
| "eval_steps_per_second": 5.898, |
| "step": 620 |
| }, |
| { |
| "epoch": 0.988798764001545, |
| "grad_norm": 1.6923496723175049, |
| "learning_rate": 2.5428711477283085e-05, |
| "loss": 0.8123, |
| "step": 640 |
| }, |
| { |
| "epoch": 0.988798764001545, |
| "eval_loss": 0.8708633780479431, |
| "eval_runtime": 48.7852, |
| "eval_samples_per_second": 23.593, |
| "eval_steps_per_second": 5.903, |
| "step": 640 |
| }, |
| { |
| "epoch": 1.018539976825029, |
| "grad_norm": 1.8015915155410767, |
| "learning_rate": 2.5034286044075546e-05, |
| "loss": 0.7468, |
| "step": 660 |
| }, |
| { |
| "epoch": 1.018539976825029, |
| "eval_loss": 0.8686777353286743, |
| "eval_runtime": 49.0562, |
| "eval_samples_per_second": 23.463, |
| "eval_steps_per_second": 5.871, |
| "step": 660 |
| }, |
| { |
| "epoch": 1.0494399382000772, |
| "grad_norm": 1.838549256324768, |
| "learning_rate": 2.462688243696461e-05, |
| "loss": 0.7258, |
| "step": 680 |
| }, |
| { |
| "epoch": 1.0494399382000772, |
| "eval_loss": 0.8642013072967529, |
| "eval_runtime": 48.7685, |
| "eval_samples_per_second": 23.601, |
| "eval_steps_per_second": 5.905, |
| "step": 680 |
| }, |
| { |
| "epoch": 1.0803398995751254, |
| "grad_norm": 1.7961382865905762, |
| "learning_rate": 2.420702758480588e-05, |
| "loss": 0.7093, |
| "step": 700 |
| }, |
| { |
| "epoch": 1.0803398995751254, |
| "eval_loss": 0.8624302744865417, |
| "eval_runtime": 48.7964, |
| "eval_samples_per_second": 23.588, |
| "eval_steps_per_second": 5.902, |
| "step": 700 |
| }, |
| { |
| "epoch": 1.111239860950174, |
| "grad_norm": 1.7665976285934448, |
| "learning_rate": 2.3775264520682277e-05, |
| "loss": 0.6989, |
| "step": 720 |
| }, |
| { |
| "epoch": 1.111239860950174, |
| "eval_loss": 0.8579444289207458, |
| "eval_runtime": 48.7833, |
| "eval_samples_per_second": 23.594, |
| "eval_steps_per_second": 5.904, |
| "step": 720 |
| }, |
| { |
| "epoch": 1.1421398223252222, |
| "grad_norm": 1.9921693801879883, |
| "learning_rate": 2.3332151679554377e-05, |
| "loss": 0.686, |
| "step": 740 |
| }, |
| { |
| "epoch": 1.1421398223252222, |
| "eval_loss": 0.8583009839057922, |
| "eval_runtime": 48.8345, |
| "eval_samples_per_second": 23.569, |
| "eval_steps_per_second": 5.897, |
| "step": 740 |
| }, |
| { |
| "epoch": 1.1730397837002704, |
| "grad_norm": 1.8822782039642334, |
| "learning_rate": 2.2878262175990123e-05, |
| "loss": 0.6953, |
| "step": 760 |
| }, |
| { |
| "epoch": 1.1730397837002704, |
| "eval_loss": 0.8588049411773682, |
| "eval_runtime": 48.8072, |
| "eval_samples_per_second": 23.583, |
| "eval_steps_per_second": 5.901, |
| "step": 760 |
| }, |
| { |
| "epoch": 1.2039397450753186, |
| "grad_norm": 1.9839003086090088, |
| "learning_rate": 2.2414183062908324e-05, |
| "loss": 0.6849, |
| "step": 780 |
| }, |
| { |
| "epoch": 1.2039397450753186, |
| "eval_loss": 0.8559426665306091, |
| "eval_runtime": 48.7613, |
| "eval_samples_per_second": 23.605, |
| "eval_steps_per_second": 5.906, |
| "step": 780 |
| }, |
| { |
| "epoch": 1.234839706450367, |
| "grad_norm": 1.9713268280029297, |
| "learning_rate": 2.19405145722944e-05, |
| "loss": 0.7103, |
| "step": 800 |
| }, |
| { |
| "epoch": 1.234839706450367, |
| "eval_loss": 0.8510345816612244, |
| "eval_runtime": 48.7589, |
| "eval_samples_per_second": 23.606, |
| "eval_steps_per_second": 5.907, |
| "step": 800 |
| }, |
| { |
| "epoch": 1.2657396678254151, |
| "grad_norm": 1.9331954717636108, |
| "learning_rate": 2.1457869338870596e-05, |
| "loss": 0.6864, |
| "step": 820 |
| }, |
| { |
| "epoch": 1.2657396678254151, |
| "eval_loss": 0.850884199142456, |
| "eval_runtime": 48.759, |
| "eval_samples_per_second": 23.606, |
| "eval_steps_per_second": 5.907, |
| "step": 820 |
| }, |
| { |
| "epoch": 1.2966396292004636, |
| "grad_norm": 2.3717479705810547, |
| "learning_rate": 2.096687160772478e-05, |
| "loss": 0.6829, |
| "step": 840 |
| }, |
| { |
| "epoch": 1.2966396292004636, |
| "eval_loss": 0.8503381013870239, |
| "eval_runtime": 48.7619, |
| "eval_samples_per_second": 23.605, |
| "eval_steps_per_second": 5.906, |
| "step": 840 |
| }, |
| { |
| "epoch": 1.3275395905755119, |
| "grad_norm": 2.0674445629119873, |
| "learning_rate": 2.0468156426922442e-05, |
| "loss": 0.7029, |
| "step": 860 |
| }, |
| { |
| "epoch": 1.3275395905755119, |
| "eval_loss": 0.8445314168930054, |
| "eval_runtime": 48.7601, |
| "eval_samples_per_second": 23.605, |
| "eval_steps_per_second": 5.906, |
| "step": 860 |
| }, |
| { |
| "epoch": 1.35843955195056, |
| "grad_norm": 1.9750181436538696, |
| "learning_rate": 1.9962368826146446e-05, |
| "loss": 0.6955, |
| "step": 880 |
| }, |
| { |
| "epoch": 1.35843955195056, |
| "eval_loss": 0.8400866985321045, |
| "eval_runtime": 48.7637, |
| "eval_samples_per_second": 23.604, |
| "eval_steps_per_second": 5.906, |
| "step": 880 |
| }, |
| { |
| "epoch": 1.3893395133256083, |
| "grad_norm": 2.0038938522338867, |
| "learning_rate": 1.945016298242664e-05, |
| "loss": 0.6692, |
| "step": 900 |
| }, |
| { |
| "epoch": 1.3893395133256083, |
| "eval_loss": 0.8380523324012756, |
| "eval_runtime": 48.9093, |
| "eval_samples_per_second": 23.533, |
| "eval_steps_per_second": 5.888, |
| "step": 900 |
| }, |
| { |
| "epoch": 1.4202394747006566, |
| "grad_norm": 1.8987348079681396, |
| "learning_rate": 1.8932201374038505e-05, |
| "loss": 0.6654, |
| "step": 920 |
| }, |
| { |
| "epoch": 1.4202394747006566, |
| "eval_loss": 0.8386799693107605, |
| "eval_runtime": 48.7795, |
| "eval_samples_per_second": 23.596, |
| "eval_steps_per_second": 5.904, |
| "step": 920 |
| }, |
| { |
| "epoch": 1.4511394360757048, |
| "grad_norm": 2.025766372680664, |
| "learning_rate": 1.8409153923665073e-05, |
| "loss": 0.7131, |
| "step": 940 |
| }, |
| { |
| "epoch": 1.4511394360757048, |
| "eval_loss": 0.8346343636512756, |
| "eval_runtime": 51.0682, |
| "eval_samples_per_second": 22.539, |
| "eval_steps_per_second": 5.64, |
| "step": 940 |
| }, |
| { |
| "epoch": 1.482039397450753, |
| "grad_norm": 1.9496480226516724, |
| "learning_rate": 1.7881697131930393e-05, |
| "loss": 0.6742, |
| "step": 960 |
| }, |
| { |
| "epoch": 1.482039397450753, |
| "eval_loss": 0.8343452215194702, |
| "eval_runtime": 48.7857, |
| "eval_samples_per_second": 23.593, |
| "eval_steps_per_second": 5.903, |
| "step": 960 |
| }, |
| { |
| "epoch": 1.5129393588258013, |
| "grad_norm": 2.2017662525177, |
| "learning_rate": 1.7350513202425192e-05, |
| "loss": 0.6731, |
| "step": 980 |
| }, |
| { |
| "epoch": 1.5129393588258013, |
| "eval_loss": 0.831669807434082, |
| "eval_runtime": 48.7641, |
| "eval_samples_per_second": 23.603, |
| "eval_steps_per_second": 5.906, |
| "step": 980 |
| }, |
| { |
| "epoch": 1.5438393202008498, |
| "grad_norm": 2.1149885654449463, |
| "learning_rate": 1.681628915935642e-05, |
| "loss": 0.6843, |
| "step": 1000 |
| }, |
| { |
| "epoch": 1.5438393202008498, |
| "eval_loss": 0.8293876051902771, |
| "eval_runtime": 51.2816, |
| "eval_samples_per_second": 22.445, |
| "eval_steps_per_second": 5.616, |
| "step": 1000 |
| }, |
| { |
| "epoch": 1.574739281575898, |
| "grad_norm": 2.221484899520874, |
| "learning_rate": 1.627971595896191e-05, |
| "loss": 0.6875, |
| "step": 1020 |
| }, |
| { |
| "epoch": 1.574739281575898, |
| "eval_loss": 0.8284665942192078, |
| "eval_runtime": 48.8242, |
| "eval_samples_per_second": 23.574, |
| "eval_steps_per_second": 5.899, |
| "step": 1020 |
| }, |
| { |
| "epoch": 1.6056392429509463, |
| "grad_norm": 2.17756986618042, |
| "learning_rate": 1.5741487595839394e-05, |
| "loss": 0.6713, |
| "step": 1040 |
| }, |
| { |
| "epoch": 1.6056392429509463, |
| "eval_loss": 0.8284040093421936, |
| "eval_runtime": 48.8193, |
| "eval_samples_per_second": 23.577, |
| "eval_steps_per_second": 5.899, |
| "step": 1040 |
| }, |
| { |
| "epoch": 1.6365392043259948, |
| "grad_norm": 1.9823157787322998, |
| "learning_rate": 1.5202300205345747e-05, |
| "loss": 0.6839, |
| "step": 1060 |
| }, |
| { |
| "epoch": 1.6365392043259948, |
| "eval_loss": 0.8247435092926025, |
| "eval_runtime": 51.2128, |
| "eval_samples_per_second": 22.475, |
| "eval_steps_per_second": 5.624, |
| "step": 1060 |
| }, |
| { |
| "epoch": 1.667439165701043, |
| "grad_norm": 2.0765607357025146, |
| "learning_rate": 1.4662851163227446e-05, |
| "loss": 0.6845, |
| "step": 1080 |
| }, |
| { |
| "epoch": 1.667439165701043, |
| "eval_loss": 0.8243246078491211, |
| "eval_runtime": 48.7965, |
| "eval_samples_per_second": 23.588, |
| "eval_steps_per_second": 5.902, |
| "step": 1080 |
| }, |
| { |
| "epoch": 1.6983391270760912, |
| "grad_norm": 2.0634026527404785, |
| "learning_rate": 1.41238381836467e-05, |
| "loss": 0.6792, |
| "step": 1100 |
| }, |
| { |
| "epoch": 1.6983391270760912, |
| "eval_loss": 0.8208648562431335, |
| "eval_runtime": 48.7933, |
| "eval_samples_per_second": 23.589, |
| "eval_steps_per_second": 5.902, |
| "step": 1100 |
| }, |
| { |
| "epoch": 1.7292390884511395, |
| "grad_norm": 1.9673739671707153, |
| "learning_rate": 1.3585958416769904e-05, |
| "loss": 0.6512, |
| "step": 1120 |
| }, |
| { |
| "epoch": 1.7292390884511395, |
| "eval_loss": 0.8207812905311584, |
| "eval_runtime": 48.8357, |
| "eval_samples_per_second": 23.569, |
| "eval_steps_per_second": 5.897, |
| "step": 1120 |
| }, |
| { |
| "epoch": 1.7601390498261877, |
| "grad_norm": 2.3055999279022217, |
| "learning_rate": 1.304990754708551e-05, |
| "loss": 0.6502, |
| "step": 1140 |
| }, |
| { |
| "epoch": 1.7601390498261877, |
| "eval_loss": 0.818783164024353, |
| "eval_runtime": 48.8503, |
| "eval_samples_per_second": 23.562, |
| "eval_steps_per_second": 5.896, |
| "step": 1140 |
| }, |
| { |
| "epoch": 1.791039011201236, |
| "grad_norm": 2.2930891513824463, |
| "learning_rate": 1.2516378893617636e-05, |
| "loss": 0.6552, |
| "step": 1160 |
| }, |
| { |
| "epoch": 1.791039011201236, |
| "eval_loss": 0.8174114227294922, |
| "eval_runtime": 48.8468, |
| "eval_samples_per_second": 23.563, |
| "eval_steps_per_second": 5.896, |
| "step": 1160 |
| }, |
| { |
| "epoch": 1.8219389725762842, |
| "grad_norm": 1.9812862873077393, |
| "learning_rate": 1.1986062513199107e-05, |
| "loss": 0.6382, |
| "step": 1180 |
| }, |
| { |
| "epoch": 1.8219389725762842, |
| "eval_loss": 0.8155190944671631, |
| "eval_runtime": 48.7931, |
| "eval_samples_per_second": 23.589, |
| "eval_steps_per_second": 5.902, |
| "step": 1180 |
| }, |
| { |
| "epoch": 1.8528389339513325, |
| "grad_norm": 2.177253007888794, |
| "learning_rate": 1.1459644307963727e-05, |
| "loss": 0.6748, |
| "step": 1200 |
| }, |
| { |
| "epoch": 1.8528389339513325, |
| "eval_loss": 0.8136880993843079, |
| "eval_runtime": 48.7851, |
| "eval_samples_per_second": 23.593, |
| "eval_steps_per_second": 5.903, |
| "step": 1200 |
| } |
| ], |
| "logging_steps": 20, |
| "max_steps": 1941, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 3, |
| "save_steps": 200, |
| "stateful_callbacks": { |
| "EarlyStoppingCallback": { |
| "args": { |
| "early_stopping_patience": 3, |
| "early_stopping_threshold": 0.0 |
| }, |
| "attributes": { |
| "early_stopping_patience_counter": 0 |
| } |
| }, |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": false |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 3.484725714805064e+17, |
| "train_batch_size": 4, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|