{ "best_global_step": 29928, "best_metric": 1.3960472345352173, "best_model_checkpoint": "/media/user/Expansion1/bge-small-en-v1.5-difficulty/checkpoint-29928", "epoch": 5.0, "eval_steps": 500, "global_step": 49880, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.05012028869286287, "grad_norm": 20.904003143310547, "learning_rate": 4.949979951884523e-05, "loss": 2.8228, "num_input_tokens_seen": 512000, "step": 500, "train_runtime": 8.8913, "train_tokens_per_second": 57584.306 }, { "epoch": 0.10024057738572574, "grad_norm": 12.451107025146484, "learning_rate": 4.89985966319166e-05, "loss": 2.1773, "num_input_tokens_seen": 1024000, "step": 1000, "train_runtime": 17.6179, "train_tokens_per_second": 58122.733 }, { "epoch": 0.15036086607858862, "grad_norm": 16.641538619995117, "learning_rate": 4.8497393744987976e-05, "loss": 2.0748, "num_input_tokens_seen": 1536000, "step": 1500, "train_runtime": 26.3873, "train_tokens_per_second": 58209.831 }, { "epoch": 0.20048115477145148, "grad_norm": 73.38098907470703, "learning_rate": 4.799619085805934e-05, "loss": 1.9491, "num_input_tokens_seen": 2048000, "step": 2000, "train_runtime": 35.8472, "train_tokens_per_second": 57131.362 }, { "epoch": 0.25060144346431434, "grad_norm": 31.689462661743164, "learning_rate": 4.749498797113072e-05, "loss": 1.9053, "num_input_tokens_seen": 2560000, "step": 2500, "train_runtime": 44.4801, "train_tokens_per_second": 57553.849 }, { "epoch": 0.30072173215717724, "grad_norm": 29.609472274780273, "learning_rate": 4.6993785084202085e-05, "loss": 1.8656, "num_input_tokens_seen": 3072000, "step": 3000, "train_runtime": 52.9662, "train_tokens_per_second": 57999.273 }, { "epoch": 0.35084202085004007, "grad_norm": 38.602455139160156, "learning_rate": 4.649258219727346e-05, "loss": 1.7632, "num_input_tokens_seen": 3584000, "step": 3500, "train_runtime": 61.6619, "train_tokens_per_second": 58123.428 }, { "epoch": 0.40096230954290296, "grad_norm": 22.875041961669922, "learning_rate": 4.5991379310344826e-05, "loss": 1.7646, "num_input_tokens_seen": 4096000, "step": 4000, "train_runtime": 71.1096, "train_tokens_per_second": 57601.205 }, { "epoch": 0.45108259823576585, "grad_norm": 16.16622543334961, "learning_rate": 4.54901764234162e-05, "loss": 1.7776, "num_input_tokens_seen": 4608000, "step": 4500, "train_runtime": 80.4063, "train_tokens_per_second": 57308.917 }, { "epoch": 0.5012028869286287, "grad_norm": 32.55996322631836, "learning_rate": 4.4988973536487574e-05, "loss": 1.7116, "num_input_tokens_seen": 5120000, "step": 5000, "train_runtime": 89.0298, "train_tokens_per_second": 57508.845 }, { "epoch": 0.5513231756214916, "grad_norm": 20.554651260375977, "learning_rate": 4.448777064955895e-05, "loss": 1.5971, "num_input_tokens_seen": 5632000, "step": 5500, "train_runtime": 97.4489, "train_tokens_per_second": 57794.413 }, { "epoch": 0.6014434643143545, "grad_norm": 20.460784912109375, "learning_rate": 4.3986567762630315e-05, "loss": 1.659, "num_input_tokens_seen": 6144000, "step": 6000, "train_runtime": 105.9015, "train_tokens_per_second": 58016.196 }, { "epoch": 0.6515637530072174, "grad_norm": 13.925053596496582, "learning_rate": 4.348536487570168e-05, "loss": 1.7245, "num_input_tokens_seen": 6656000, "step": 6500, "train_runtime": 114.3689, "train_tokens_per_second": 58197.66 }, { "epoch": 0.7016840417000801, "grad_norm": 25.706527709960938, "learning_rate": 4.2984161988773056e-05, "loss": 1.6292, "num_input_tokens_seen": 7168000, "step": 7000, "train_runtime": 122.8607, "train_tokens_per_second": 58342.5 }, { "epoch": 0.751804330392943, "grad_norm": 52.04703903198242, "learning_rate": 4.248295910184443e-05, "loss": 1.6496, "num_input_tokens_seen": 7680000, "step": 7500, "train_runtime": 131.9546, "train_tokens_per_second": 58201.853 }, { "epoch": 0.8019246190858059, "grad_norm": 21.66624641418457, "learning_rate": 4.1981756214915804e-05, "loss": 1.6804, "num_input_tokens_seen": 8192000, "step": 8000, "train_runtime": 141.0149, "train_tokens_per_second": 58093.165 }, { "epoch": 0.8520449077786688, "grad_norm": 21.243003845214844, "learning_rate": 4.148055332798717e-05, "loss": 1.7315, "num_input_tokens_seen": 8704000, "step": 8500, "train_runtime": 150.3982, "train_tokens_per_second": 57873.03 }, { "epoch": 0.9021651964715317, "grad_norm": 31.12165069580078, "learning_rate": 4.0979350441058546e-05, "loss": 1.6813, "num_input_tokens_seen": 9216000, "step": 9000, "train_runtime": 159.4212, "train_tokens_per_second": 57809.11 }, { "epoch": 0.9522854851643946, "grad_norm": 53.82347869873047, "learning_rate": 4.047814755412991e-05, "loss": 1.6662, "num_input_tokens_seen": 9728000, "step": 9500, "train_runtime": 168.0353, "train_tokens_per_second": 57892.585 }, { "epoch": 1.0, "eval_loss": 1.5963636636734009, "eval_mse": 1.5963637144905036, "eval_runtime": 11.8793, "eval_samples_per_second": 1679.557, "eval_steps_per_second": 209.945, "num_input_tokens_seen": 10215168, "step": 9976 }, { "epoch": 1.0024057738572574, "grad_norm": 32.9880485534668, "learning_rate": 3.997694466720128e-05, "loss": 1.6371, "num_input_tokens_seen": 10239744, "step": 10000, "train_runtime": 188.7939, "train_tokens_per_second": 54237.687 }, { "epoch": 1.0525260625501203, "grad_norm": 30.20238494873047, "learning_rate": 3.9475741780272654e-05, "loss": 1.2172, "num_input_tokens_seen": 10751744, "step": 10500, "train_runtime": 197.3774, "train_tokens_per_second": 54473.022 }, { "epoch": 1.1026463512429832, "grad_norm": 6.598354339599609, "learning_rate": 3.897453889334403e-05, "loss": 1.2349, "num_input_tokens_seen": 11263744, "step": 11000, "train_runtime": 205.8828, "train_tokens_per_second": 54709.488 }, { "epoch": 1.152766639935846, "grad_norm": 18.5355167388916, "learning_rate": 3.84733360064154e-05, "loss": 1.2043, "num_input_tokens_seen": 11775744, "step": 11500, "train_runtime": 214.374, "train_tokens_per_second": 54930.852 }, { "epoch": 1.202886928628709, "grad_norm": 27.85222816467285, "learning_rate": 3.797213311948677e-05, "loss": 1.2044, "num_input_tokens_seen": 12287744, "step": 12000, "train_runtime": 222.8513, "train_tokens_per_second": 55138.757 }, { "epoch": 1.2530072173215718, "grad_norm": 11.679412841796875, "learning_rate": 3.747093023255814e-05, "loss": 1.194, "num_input_tokens_seen": 12799744, "step": 12500, "train_runtime": 231.332, "train_tokens_per_second": 55330.631 }, { "epoch": 1.3031275060144347, "grad_norm": 47.29853057861328, "learning_rate": 3.696972734562951e-05, "loss": 1.175, "num_input_tokens_seen": 13311744, "step": 13000, "train_runtime": 239.7491, "train_tokens_per_second": 55523.647 }, { "epoch": 1.3532477947072974, "grad_norm": 28.196550369262695, "learning_rate": 3.6468524458700885e-05, "loss": 1.1053, "num_input_tokens_seen": 13823744, "step": 13500, "train_runtime": 248.1824, "train_tokens_per_second": 55699.934 }, { "epoch": 1.4033680834001605, "grad_norm": 11.712139129638672, "learning_rate": 3.596732157177226e-05, "loss": 1.2474, "num_input_tokens_seen": 14335744, "step": 14000, "train_runtime": 256.6596, "train_tokens_per_second": 55855.081 }, { "epoch": 1.4534883720930232, "grad_norm": 35.03483963012695, "learning_rate": 3.5466118684843626e-05, "loss": 1.157, "num_input_tokens_seen": 14847744, "step": 14500, "train_runtime": 265.103, "train_tokens_per_second": 56007.454 }, { "epoch": 1.5036086607858863, "grad_norm": 16.22357749938965, "learning_rate": 3.4964915797915e-05, "loss": 1.1697, "num_input_tokens_seen": 15359744, "step": 15000, "train_runtime": 273.5202, "train_tokens_per_second": 56155.792 }, { "epoch": 1.553728949478749, "grad_norm": 28.68216896057129, "learning_rate": 3.446371291098637e-05, "loss": 1.1542, "num_input_tokens_seen": 15871744, "step": 15500, "train_runtime": 281.9474, "train_tokens_per_second": 56293.271 }, { "epoch": 1.6038492381716118, "grad_norm": 41.835914611816406, "learning_rate": 3.396251002405774e-05, "loss": 1.1151, "num_input_tokens_seen": 16383744, "step": 16000, "train_runtime": 290.4015, "train_tokens_per_second": 56417.558 }, { "epoch": 1.6539695268644747, "grad_norm": 22.626140594482422, "learning_rate": 3.346130713712911e-05, "loss": 1.2044, "num_input_tokens_seen": 16895744, "step": 16500, "train_runtime": 298.8386, "train_tokens_per_second": 56538.031 }, { "epoch": 1.7040898155573376, "grad_norm": 31.7674560546875, "learning_rate": 3.296010425020048e-05, "loss": 1.2626, "num_input_tokens_seen": 17407744, "step": 17000, "train_runtime": 307.3048, "train_tokens_per_second": 56646.502 }, { "epoch": 1.7542101042502005, "grad_norm": 129.8439483642578, "learning_rate": 3.2458901363271856e-05, "loss": 1.2292, "num_input_tokens_seen": 17919744, "step": 17500, "train_runtime": 315.79, "train_tokens_per_second": 56745.76 }, { "epoch": 1.8043303929430632, "grad_norm": 26.7992000579834, "learning_rate": 3.1957698476343223e-05, "loss": 1.1892, "num_input_tokens_seen": 18431744, "step": 18000, "train_runtime": 324.7824, "train_tokens_per_second": 56751.055 }, { "epoch": 1.8544506816359263, "grad_norm": 55.89463806152344, "learning_rate": 3.14564955894146e-05, "loss": 1.1872, "num_input_tokens_seen": 18943744, "step": 18500, "train_runtime": 333.1494, "train_tokens_per_second": 56862.606 }, { "epoch": 1.904570970328789, "grad_norm": 9.99189281463623, "learning_rate": 3.0955292702485965e-05, "loss": 1.2204, "num_input_tokens_seen": 19455744, "step": 19000, "train_runtime": 341.5672, "train_tokens_per_second": 56960.226 }, { "epoch": 1.954691259021652, "grad_norm": 54.246665954589844, "learning_rate": 3.0454089815557342e-05, "loss": 1.1219, "num_input_tokens_seen": 19967744, "step": 19500, "train_runtime": 349.8852, "train_tokens_per_second": 57069.408 }, { "epoch": 2.0, "eval_loss": 1.5621843338012695, "eval_mse": 1.5621842362558391, "eval_runtime": 11.3832, "eval_samples_per_second": 1752.758, "eval_steps_per_second": 219.095, "num_input_tokens_seen": 20430336, "step": 19952 }, { "epoch": 2.0048115477145148, "grad_norm": 17.869287490844727, "learning_rate": 2.995288692862871e-05, "loss": 1.1673, "num_input_tokens_seen": 20479488, "step": 20000, "train_runtime": 369.9881, "train_tokens_per_second": 55351.745 }, { "epoch": 2.054931836407378, "grad_norm": 14.97153377532959, "learning_rate": 2.9451684041700083e-05, "loss": 0.8127, "num_input_tokens_seen": 20991488, "step": 20500, "train_runtime": 378.574, "train_tokens_per_second": 55448.831 }, { "epoch": 2.1050521251002405, "grad_norm": 7.364150047302246, "learning_rate": 2.8950481154771454e-05, "loss": 0.873, "num_input_tokens_seen": 21503488, "step": 21000, "train_runtime": 387.1985, "train_tokens_per_second": 55536.084 }, { "epoch": 2.1551724137931036, "grad_norm": 11.669695854187012, "learning_rate": 2.844927826784282e-05, "loss": 0.7804, "num_input_tokens_seen": 22015488, "step": 21500, "train_runtime": 396.4685, "train_tokens_per_second": 55528.97 }, { "epoch": 2.2052927024859663, "grad_norm": 41.843666076660156, "learning_rate": 2.7948075380914195e-05, "loss": 0.837, "num_input_tokens_seen": 22527488, "step": 22000, "train_runtime": 405.5069, "train_tokens_per_second": 55553.891 }, { "epoch": 2.2554129911788294, "grad_norm": 10.829984664916992, "learning_rate": 2.7446872493985566e-05, "loss": 0.8482, "num_input_tokens_seen": 23039488, "step": 22500, "train_runtime": 414.5185, "train_tokens_per_second": 55581.321 }, { "epoch": 2.305533279871692, "grad_norm": 15.39234447479248, "learning_rate": 2.694566960705694e-05, "loss": 0.8762, "num_input_tokens_seen": 23551488, "step": 23000, "train_runtime": 423.7203, "train_tokens_per_second": 55582.623 }, { "epoch": 2.3556535685645548, "grad_norm": 18.18549919128418, "learning_rate": 2.6444466720128307e-05, "loss": 0.8161, "num_input_tokens_seen": 24063488, "step": 23500, "train_runtime": 432.5972, "train_tokens_per_second": 55625.626 }, { "epoch": 2.405773857257418, "grad_norm": 16.482131958007812, "learning_rate": 2.594326383319968e-05, "loss": 0.8603, "num_input_tokens_seen": 24575488, "step": 24000, "train_runtime": 441.489, "train_tokens_per_second": 55665.011 }, { "epoch": 2.4558941459502805, "grad_norm": 17.881376266479492, "learning_rate": 2.5442060946271052e-05, "loss": 0.8447, "num_input_tokens_seen": 25087488, "step": 24500, "train_runtime": 449.8679, "train_tokens_per_second": 55766.34 }, { "epoch": 2.5060144346431437, "grad_norm": 24.200584411621094, "learning_rate": 2.4940858059342422e-05, "loss": 0.8122, "num_input_tokens_seen": 25599488, "step": 25000, "train_runtime": 458.2036, "train_tokens_per_second": 55869.238 }, { "epoch": 2.5561347233360063, "grad_norm": 27.106565475463867, "learning_rate": 2.4439655172413793e-05, "loss": 0.87, "num_input_tokens_seen": 26111488, "step": 25500, "train_runtime": 466.5059, "train_tokens_per_second": 55972.475 }, { "epoch": 2.6062550120288694, "grad_norm": 14.02163028717041, "learning_rate": 2.3938452285485167e-05, "loss": 0.796, "num_input_tokens_seen": 26623488, "step": 26000, "train_runtime": 474.8448, "train_tokens_per_second": 56067.769 }, { "epoch": 2.656375300721732, "grad_norm": 41.64189910888672, "learning_rate": 2.3437249398556538e-05, "loss": 0.8395, "num_input_tokens_seen": 27135488, "step": 26500, "train_runtime": 483.1561, "train_tokens_per_second": 56162.989 }, { "epoch": 2.706495589414595, "grad_norm": 38.884735107421875, "learning_rate": 2.2936046511627908e-05, "loss": 0.8408, "num_input_tokens_seen": 27647488, "step": 27000, "train_runtime": 491.5528, "train_tokens_per_second": 56245.208 }, { "epoch": 2.756615878107458, "grad_norm": 13.188600540161133, "learning_rate": 2.243484362469928e-05, "loss": 0.831, "num_input_tokens_seen": 28159488, "step": 27500, "train_runtime": 499.9048, "train_tokens_per_second": 56329.703 }, { "epoch": 2.806736166800321, "grad_norm": 11.523019790649414, "learning_rate": 2.193364073777065e-05, "loss": 0.7867, "num_input_tokens_seen": 28671488, "step": 28000, "train_runtime": 508.2633, "train_tokens_per_second": 56410.704 }, { "epoch": 2.8568564554931837, "grad_norm": 13.656238555908203, "learning_rate": 2.143243785084202e-05, "loss": 0.8674, "num_input_tokens_seen": 29183488, "step": 28500, "train_runtime": 516.5998, "train_tokens_per_second": 56491.48 }, { "epoch": 2.9069767441860463, "grad_norm": 18.173336029052734, "learning_rate": 2.0931234963913394e-05, "loss": 0.7779, "num_input_tokens_seen": 29695488, "step": 29000, "train_runtime": 524.9627, "train_tokens_per_second": 56566.852 }, { "epoch": 2.9570970328789095, "grad_norm": 19.77488899230957, "learning_rate": 2.0430032076984765e-05, "loss": 0.84, "num_input_tokens_seen": 30207488, "step": 29500, "train_runtime": 533.3932, "train_tokens_per_second": 56632.684 }, { "epoch": 3.0, "eval_loss": 1.3960472345352173, "eval_mse": 1.3960471269684813, "eval_runtime": 11.3905, "eval_samples_per_second": 1751.635, "eval_steps_per_second": 218.954, "num_input_tokens_seen": 30645504, "step": 29928 }, { "epoch": 3.007217321571772, "grad_norm": 19.170400619506836, "learning_rate": 1.9928829190056135e-05, "loss": 0.7767, "num_input_tokens_seen": 30719232, "step": 30000, "train_runtime": 553.5789, "train_tokens_per_second": 55492.053 }, { "epoch": 3.0573376102646352, "grad_norm": 9.260679244995117, "learning_rate": 1.942762630312751e-05, "loss": 0.5755, "num_input_tokens_seen": 31231232, "step": 30500, "train_runtime": 562.1622, "train_tokens_per_second": 55555.554 }, { "epoch": 3.107457898957498, "grad_norm": 28.19110679626465, "learning_rate": 1.892642341619888e-05, "loss": 0.6213, "num_input_tokens_seen": 31743232, "step": 31000, "train_runtime": 570.8337, "train_tokens_per_second": 55608.548 }, { "epoch": 3.157578187650361, "grad_norm": 15.245288848876953, "learning_rate": 1.8425220529270247e-05, "loss": 0.5973, "num_input_tokens_seen": 32255232, "step": 31500, "train_runtime": 579.8015, "train_tokens_per_second": 55631.507 }, { "epoch": 3.2076984763432237, "grad_norm": 34.220157623291016, "learning_rate": 1.792401764234162e-05, "loss": 0.5561, "num_input_tokens_seen": 32767232, "step": 32000, "train_runtime": 588.9251, "train_tokens_per_second": 55639.047 }, { "epoch": 3.2578187650360864, "grad_norm": 10.271838188171387, "learning_rate": 1.7422814755412992e-05, "loss": 0.5686, "num_input_tokens_seen": 33279232, "step": 32500, "train_runtime": 598.0389, "train_tokens_per_second": 55647.268 }, { "epoch": 3.3079390537289495, "grad_norm": 35.49042892456055, "learning_rate": 1.6921611868484362e-05, "loss": 0.5994, "num_input_tokens_seen": 33791232, "step": 33000, "train_runtime": 606.7509, "train_tokens_per_second": 55692.103 }, { "epoch": 3.3580593424218126, "grad_norm": 19.885265350341797, "learning_rate": 1.6420408981555736e-05, "loss": 0.5594, "num_input_tokens_seen": 34303232, "step": 33500, "train_runtime": 615.4305, "train_tokens_per_second": 55738.597 }, { "epoch": 3.4081796311146753, "grad_norm": 20.058979034423828, "learning_rate": 1.5919206094627107e-05, "loss": 0.6017, "num_input_tokens_seen": 34815232, "step": 34000, "train_runtime": 624.1453, "train_tokens_per_second": 55780.657 }, { "epoch": 3.458299919807538, "grad_norm": 38.68717956542969, "learning_rate": 1.5418003207698478e-05, "loss": 0.5855, "num_input_tokens_seen": 35327232, "step": 34500, "train_runtime": 632.7468, "train_tokens_per_second": 55831.542 }, { "epoch": 3.508420208500401, "grad_norm": 25.634483337402344, "learning_rate": 1.4916800320769847e-05, "loss": 0.5994, "num_input_tokens_seen": 35839232, "step": 35000, "train_runtime": 641.389, "train_tokens_per_second": 55877.529 }, { "epoch": 3.5585404971932637, "grad_norm": 16.136917114257812, "learning_rate": 1.4415597433841219e-05, "loss": 0.6142, "num_input_tokens_seen": 36351232, "step": 35500, "train_runtime": 649.9489, "train_tokens_per_second": 55929.365 }, { "epoch": 3.608660785886127, "grad_norm": 15.063362121582031, "learning_rate": 1.391439454691259e-05, "loss": 0.5757, "num_input_tokens_seen": 36863232, "step": 36000, "train_runtime": 658.5582, "train_tokens_per_second": 55975.667 }, { "epoch": 3.6587810745789895, "grad_norm": 15.330507278442383, "learning_rate": 1.3413191659983962e-05, "loss": 0.5837, "num_input_tokens_seen": 37375232, "step": 36500, "train_runtime": 667.1211, "train_tokens_per_second": 56024.66 }, { "epoch": 3.7089013632718526, "grad_norm": 19.06484603881836, "learning_rate": 1.2911988773055334e-05, "loss": 0.5387, "num_input_tokens_seen": 37887232, "step": 37000, "train_runtime": 675.6704, "train_tokens_per_second": 56073.538 }, { "epoch": 3.7590216519647153, "grad_norm": 23.454689025878906, "learning_rate": 1.2410785886126705e-05, "loss": 0.6278, "num_input_tokens_seen": 38399232, "step": 37500, "train_runtime": 684.2734, "train_tokens_per_second": 56116.798 }, { "epoch": 3.809141940657578, "grad_norm": 14.470320701599121, "learning_rate": 1.1909582999198075e-05, "loss": 0.5842, "num_input_tokens_seen": 38911232, "step": 38000, "train_runtime": 692.8986, "train_tokens_per_second": 56157.179 }, { "epoch": 3.859262229350441, "grad_norm": 11.054339408874512, "learning_rate": 1.1408380112269448e-05, "loss": 0.6072, "num_input_tokens_seen": 39423232, "step": 38500, "train_runtime": 701.5119, "train_tokens_per_second": 56197.522 }, { "epoch": 3.909382518043304, "grad_norm": 20.956043243408203, "learning_rate": 1.0907177225340818e-05, "loss": 0.5881, "num_input_tokens_seen": 39935232, "step": 39000, "train_runtime": 710.1801, "train_tokens_per_second": 56232.542 }, { "epoch": 3.959502806736167, "grad_norm": 21.301959991455078, "learning_rate": 1.040597433841219e-05, "loss": 0.5717, "num_input_tokens_seen": 40447232, "step": 39500, "train_runtime": 718.707, "train_tokens_per_second": 56277.777 }, { "epoch": 4.0, "eval_loss": 1.5318739414215088, "eval_mse": 1.5318739121434626, "eval_runtime": 11.7094, "eval_samples_per_second": 1703.924, "eval_steps_per_second": 212.991, "num_input_tokens_seen": 40860672, "step": 39904 }, { "epoch": 4.0096230954290295, "grad_norm": 20.399166107177734, "learning_rate": 9.904771451483561e-06, "loss": 0.5301, "num_input_tokens_seen": 40958976, "step": 40000, "train_runtime": 739.6956, "train_tokens_per_second": 55372.745 }, { "epoch": 4.059743384121893, "grad_norm": 16.93513298034668, "learning_rate": 9.403568564554932e-06, "loss": 0.4388, "num_input_tokens_seen": 41470976, "step": 40500, "train_runtime": 748.1484, "train_tokens_per_second": 55431.487 }, { "epoch": 4.109863672814756, "grad_norm": 13.65589427947998, "learning_rate": 8.902365677626304e-06, "loss": 0.4392, "num_input_tokens_seen": 41982976, "step": 41000, "train_runtime": 756.7134, "train_tokens_per_second": 55480.685 }, { "epoch": 4.159983961507618, "grad_norm": 22.29100227355957, "learning_rate": 8.401162790697675e-06, "loss": 0.4336, "num_input_tokens_seen": 42494976, "step": 41500, "train_runtime": 765.1706, "train_tokens_per_second": 55536.602 }, { "epoch": 4.210104250200481, "grad_norm": 13.940652847290039, "learning_rate": 7.899959903769045e-06, "loss": 0.4294, "num_input_tokens_seen": 43006976, "step": 42000, "train_runtime": 773.729, "train_tokens_per_second": 55584.03 }, { "epoch": 4.260224538893344, "grad_norm": 23.97103500366211, "learning_rate": 7.398757016840417e-06, "loss": 0.4427, "num_input_tokens_seen": 43518976, "step": 42500, "train_runtime": 782.2722, "train_tokens_per_second": 55631.498 }, { "epoch": 4.310344827586207, "grad_norm": 20.24034881591797, "learning_rate": 6.897554129911788e-06, "loss": 0.4178, "num_input_tokens_seen": 44030976, "step": 43000, "train_runtime": 790.7664, "train_tokens_per_second": 55681.394 }, { "epoch": 4.3604651162790695, "grad_norm": 33.19560623168945, "learning_rate": 6.396351242983161e-06, "loss": 0.4078, "num_input_tokens_seen": 44542976, "step": 43500, "train_runtime": 799.2809, "train_tokens_per_second": 55728.814 }, { "epoch": 4.410585404971933, "grad_norm": 10.608743667602539, "learning_rate": 5.895148356054531e-06, "loss": 0.4252, "num_input_tokens_seen": 45054976, "step": 44000, "train_runtime": 807.7614, "train_tokens_per_second": 55777.577 }, { "epoch": 4.460705693664796, "grad_norm": 18.352252960205078, "learning_rate": 5.393945469125902e-06, "loss": 0.3896, "num_input_tokens_seen": 45566976, "step": 44500, "train_runtime": 816.2905, "train_tokens_per_second": 55822.006 }, { "epoch": 4.510825982357659, "grad_norm": 15.188591957092285, "learning_rate": 4.892742582197274e-06, "loss": 0.4307, "num_input_tokens_seen": 46078976, "step": 45000, "train_runtime": 824.8467, "train_tokens_per_second": 55863.682 }, { "epoch": 4.560946271050521, "grad_norm": 19.425922393798828, "learning_rate": 4.391539695268645e-06, "loss": 0.4327, "num_input_tokens_seen": 46590976, "step": 45500, "train_runtime": 833.3927, "train_tokens_per_second": 55905.188 }, { "epoch": 4.611066559743384, "grad_norm": 22.44156265258789, "learning_rate": 3.890336808340016e-06, "loss": 0.4402, "num_input_tokens_seen": 47102976, "step": 46000, "train_runtime": 841.9356, "train_tokens_per_second": 55946.056 }, { "epoch": 4.661186848436247, "grad_norm": 24.460559844970703, "learning_rate": 3.3891339214113874e-06, "loss": 0.4257, "num_input_tokens_seen": 47614976, "step": 46500, "train_runtime": 850.4773, "train_tokens_per_second": 55986.182 }, { "epoch": 4.7113071371291095, "grad_norm": 15.877163887023926, "learning_rate": 2.8879310344827584e-06, "loss": 0.4257, "num_input_tokens_seen": 48126976, "step": 47000, "train_runtime": 859.0243, "train_tokens_per_second": 56025.165 }, { "epoch": 4.761427425821973, "grad_norm": 20.518606185913086, "learning_rate": 2.38672814755413e-06, "loss": 0.4038, "num_input_tokens_seen": 48638976, "step": 47500, "train_runtime": 867.5625, "train_tokens_per_second": 56063.943 }, { "epoch": 4.811547714514836, "grad_norm": 11.533647537231445, "learning_rate": 1.8855252606255011e-06, "loss": 0.4511, "num_input_tokens_seen": 49150976, "step": 48000, "train_runtime": 876.1744, "train_tokens_per_second": 56097.252 }, { "epoch": 4.861668003207699, "grad_norm": 12.317822456359863, "learning_rate": 1.3843223736968726e-06, "loss": 0.4037, "num_input_tokens_seen": 49662976, "step": 48500, "train_runtime": 884.7025, "train_tokens_per_second": 56135.228 }, { "epoch": 4.911788291900561, "grad_norm": 24.55292320251465, "learning_rate": 8.831194867682439e-07, "loss": 0.4227, "num_input_tokens_seen": 50174976, "step": 49000, "train_runtime": 893.1657, "train_tokens_per_second": 56176.561 }, { "epoch": 4.961908580593424, "grad_norm": 13.319286346435547, "learning_rate": 3.819165998396151e-07, "loss": 0.4359, "num_input_tokens_seen": 50686976, "step": 49500, "train_runtime": 901.6559, "train_tokens_per_second": 56215.43 }, { "epoch": 5.0, "eval_loss": 1.4861232042312622, "eval_mse": 1.4861232131166864, "eval_runtime": 12.3183, "eval_samples_per_second": 1619.699, "eval_steps_per_second": 202.462, "num_input_tokens_seen": 51075840, "step": 49880 }, { "epoch": 5.0, "num_input_tokens_seen": 51075840, "step": 49880, "total_flos": 6571180888957440.0, "train_loss": 0.9716617676001505, "train_runtime": 920.9529, "train_samples_per_second": 433.279, "train_steps_per_second": 54.161 } ], "logging_steps": 500, "max_steps": 49880, "num_input_tokens_seen": 51075840, "num_train_epochs": 5, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 6571180888957440.0, "train_batch_size": 8, "trial_name": null, "trial_params": null }