{ "best_global_step": 119500, "best_metric": 2.1594982147216797, "best_model_checkpoint": "/work/Ccp-OldNewsBERT_2024/modelling/V3/models/ON-BERT-v3/checkpoint-114000", "epoch": 10.518034798615068, "eval_steps": 500, "global_step": 120000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.04384138188035687, "grad_norm": 2.0762226581573486, "learning_rate": 7.261835184102864e-06, "loss": 7.284, "step": 500 }, { "epoch": 0.04384138188035687, "eval_loss": 6.594050407409668, "eval_runtime": 1189.5449, "eval_samples_per_second": 767.907, "eval_steps_per_second": 6.0, "step": 500 }, { "epoch": 0.08768276376071374, "grad_norm": 2.374856948852539, "learning_rate": 1.456750438340152e-05, "loss": 6.3875, "step": 1000 }, { "epoch": 0.08768276376071374, "eval_loss": 6.055078983306885, "eval_runtime": 1120.4784, "eval_samples_per_second": 815.241, "eval_steps_per_second": 6.37, "step": 1000 }, { "epoch": 0.1315241456410706, "grad_norm": 2.779784679412842, "learning_rate": 2.1873173582700177e-05, "loss": 5.9379, "step": 1500 }, { "epoch": 0.1315241456410706, "eval_loss": 5.654895782470703, "eval_runtime": 1119.543, "eval_samples_per_second": 815.922, "eval_steps_per_second": 6.375, "step": 1500 }, { "epoch": 0.17536552752142748, "grad_norm": 2.636847734451294, "learning_rate": 2.9178842781998832e-05, "loss": 5.5704, "step": 2000 }, { "epoch": 0.17536552752142748, "eval_loss": 5.318906784057617, "eval_runtime": 1119.4192, "eval_samples_per_second": 816.012, "eval_steps_per_second": 6.376, "step": 2000 }, { "epoch": 0.21920690940178433, "grad_norm": 2.580691337585449, "learning_rate": 3.6484511981297484e-05, "loss": 5.2707, "step": 2500 }, { "epoch": 0.21920690940178433, "eval_loss": 5.011192798614502, "eval_runtime": 1119.4613, "eval_samples_per_second": 815.982, "eval_steps_per_second": 6.375, "step": 2500 }, { "epoch": 0.2630482912821412, "grad_norm": 2.647657632827759, "learning_rate": 4.3790181180596146e-05, "loss": 4.9931, "step": 3000 }, { "epoch": 0.2630482912821412, "eval_loss": 4.747901439666748, "eval_runtime": 1119.0922, "eval_samples_per_second": 816.251, "eval_steps_per_second": 6.377, "step": 3000 }, { "epoch": 0.3068896731624981, "grad_norm": 2.7811145782470703, "learning_rate": 4.9999758434773725e-05, "loss": 4.7425, "step": 3500 }, { "epoch": 0.3068896731624981, "eval_loss": 4.489400386810303, "eval_runtime": 1118.9351, "eval_samples_per_second": 816.365, "eval_steps_per_second": 6.378, "step": 3500 }, { "epoch": 0.35073105504285496, "grad_norm": 3.108778238296509, "learning_rate": 4.9985802653912495e-05, "loss": 4.5162, "step": 4000 }, { "epoch": 0.35073105504285496, "eval_loss": 4.267147541046143, "eval_runtime": 1118.9526, "eval_samples_per_second": 816.353, "eval_steps_per_second": 6.378, "step": 4000 }, { "epoch": 0.3945724369232118, "grad_norm": 2.7255427837371826, "learning_rate": 4.99503881039902e-05, "loss": 4.3143, "step": 4500 }, { "epoch": 0.3945724369232118, "eval_loss": 4.085505485534668, "eval_runtime": 1118.7877, "eval_samples_per_second": 816.473, "eval_steps_per_second": 6.379, "step": 4500 }, { "epoch": 0.43841381880356867, "grad_norm": 2.7449190616607666, "learning_rate": 4.9893545200385473e-05, "loss": 4.1497, "step": 5000 }, { "epoch": 0.43841381880356867, "eval_loss": 3.9280543327331543, "eval_runtime": 1118.8813, "eval_samples_per_second": 816.405, "eval_steps_per_second": 6.379, "step": 5000 }, { "epoch": 0.4822552006839256, "grad_norm": 2.4749231338500977, "learning_rate": 4.98153227619719e-05, "loss": 4.0239, "step": 5500 }, { "epoch": 0.4822552006839256, "eval_loss": 3.8047330379486084, "eval_runtime": 1118.3431, "eval_samples_per_second": 816.798, "eval_steps_per_second": 6.382, "step": 5500 }, { "epoch": 0.5260965825642824, "grad_norm": 2.549381971359253, "learning_rate": 4.9715787969190494e-05, "loss": 3.8983, "step": 6000 }, { "epoch": 0.5260965825642824, "eval_loss": 3.7011477947235107, "eval_runtime": 1118.3893, "eval_samples_per_second": 816.764, "eval_steps_per_second": 6.381, "step": 6000 }, { "epoch": 0.5699379644446393, "grad_norm": 2.57206392288208, "learning_rate": 4.9595026306352545e-05, "loss": 3.7955, "step": 6500 }, { "epoch": 0.5699379644446393, "eval_loss": 3.610187292098999, "eval_runtime": 1121.1876, "eval_samples_per_second": 814.725, "eval_steps_per_second": 6.366, "step": 6500 }, { "epoch": 0.6137793463249962, "grad_norm": 2.4346706867218018, "learning_rate": 4.9453141488222386e-05, "loss": 3.7212, "step": 7000 }, { "epoch": 0.6137793463249962, "eval_loss": 3.527937650680542, "eval_runtime": 1118.9709, "eval_samples_per_second": 816.339, "eval_steps_per_second": 6.378, "step": 7000 }, { "epoch": 0.657620728205353, "grad_norm": 2.7278873920440674, "learning_rate": 4.9290255370943214e-05, "loss": 3.6375, "step": 7500 }, { "epoch": 0.657620728205353, "eval_loss": 3.4597597122192383, "eval_runtime": 1118.6558, "eval_samples_per_second": 816.569, "eval_steps_per_second": 6.38, "step": 7500 }, { "epoch": 0.7014621100857099, "grad_norm": 2.576530933380127, "learning_rate": 4.9106507847382264e-05, "loss": 3.5737, "step": 8000 }, { "epoch": 0.7014621100857099, "eval_loss": 3.3990399837493896, "eval_runtime": 1117.9215, "eval_samples_per_second": 817.106, "eval_steps_per_second": 6.384, "step": 8000 }, { "epoch": 0.7453034919660668, "grad_norm": 2.8216257095336914, "learning_rate": 4.890205672698551e-05, "loss": 3.5174, "step": 8500 }, { "epoch": 0.7453034919660668, "eval_loss": 3.3402609825134277, "eval_runtime": 1118.1279, "eval_samples_per_second": 816.955, "eval_steps_per_second": 6.383, "step": 8500 }, { "epoch": 0.7891448738464236, "grad_norm": 2.7017734050750732, "learning_rate": 4.867707760024478e-05, "loss": 3.4576, "step": 9000 }, { "epoch": 0.7891448738464236, "eval_loss": 3.289719343185425, "eval_runtime": 1118.6616, "eval_samples_per_second": 816.565, "eval_steps_per_second": 6.38, "step": 9000 }, { "epoch": 0.8329862557267805, "grad_norm": 2.7902138233184814, "learning_rate": 4.8431763687893906e-05, "loss": 3.4069, "step": 9500 }, { "epoch": 0.8329862557267805, "eval_loss": 3.2430062294006348, "eval_runtime": 1118.3313, "eval_samples_per_second": 816.806, "eval_steps_per_second": 6.382, "step": 9500 }, { "epoch": 0.8768276376071373, "grad_norm": 2.3764052391052246, "learning_rate": 4.816632567496333e-05, "loss": 3.3561, "step": 10000 }, { "epoch": 0.8768276376071373, "eval_loss": 3.2007126808166504, "eval_runtime": 1118.051, "eval_samples_per_second": 817.011, "eval_steps_per_second": 6.383, "step": 10000 }, { "epoch": 0.9206690194874942, "grad_norm": 2.8324801921844482, "learning_rate": 4.788158189440955e-05, "loss": 3.3162, "step": 10500 }, { "epoch": 0.9206690194874942, "eval_loss": 3.1551382541656494, "eval_runtime": 1118.4175, "eval_samples_per_second": 816.743, "eval_steps_per_second": 6.381, "step": 10500 }, { "epoch": 0.9645104013678512, "grad_norm": 2.599917411804199, "learning_rate": 4.757663571936409e-05, "loss": 3.2779, "step": 11000 }, { "epoch": 0.9645104013678512, "eval_loss": 3.1158318519592285, "eval_runtime": 1117.751, "eval_samples_per_second": 817.23, "eval_steps_per_second": 6.385, "step": 11000 }, { "epoch": 1.0084175453210285, "grad_norm": 2.661496162414551, "learning_rate": 4.7252299860553496e-05, "loss": 3.2427, "step": 11500 }, { "epoch": 1.0084175453210285, "eval_loss": 3.0812768936157227, "eval_runtime": 1118.2372, "eval_samples_per_second": 816.875, "eval_steps_per_second": 6.382, "step": 11500 }, { "epoch": 1.0522589272013854, "grad_norm": 2.5920369625091553, "learning_rate": 4.690885287009749e-05, "loss": 3.2009, "step": 12000 }, { "epoch": 1.0522589272013854, "eval_loss": 3.045903444290161, "eval_runtime": 1117.9755, "eval_samples_per_second": 817.066, "eval_steps_per_second": 6.384, "step": 12000 }, { "epoch": 1.0961003090817423, "grad_norm": 2.541583299636841, "learning_rate": 4.654733281420752e-05, "loss": 3.1746, "step": 12500 }, { "epoch": 1.0961003090817423, "eval_loss": 3.0118284225463867, "eval_runtime": 1119.6853, "eval_samples_per_second": 815.818, "eval_steps_per_second": 6.374, "step": 12500 }, { "epoch": 1.1399416909620992, "grad_norm": 2.3801028728485107, "learning_rate": 4.6166601305962655e-05, "loss": 3.1391, "step": 13000 }, { "epoch": 1.1399416909620992, "eval_loss": 2.9807887077331543, "eval_runtime": 1117.6385, "eval_samples_per_second": 817.313, "eval_steps_per_second": 6.386, "step": 13000 }, { "epoch": 1.183783072842456, "grad_norm": 2.356208562850952, "learning_rate": 4.576769110578126e-05, "loss": 3.1054, "step": 13500 }, { "epoch": 1.183783072842456, "eval_loss": 2.9562630653381348, "eval_runtime": 1117.9985, "eval_samples_per_second": 817.049, "eval_steps_per_second": 6.384, "step": 13500 }, { "epoch": 1.2276244547228128, "grad_norm": 2.4931366443634033, "learning_rate": 4.535094481309793e-05, "loss": 3.082, "step": 14000 }, { "epoch": 1.2276244547228128, "eval_loss": 2.927985429763794, "eval_runtime": 1118.2717, "eval_samples_per_second": 816.85, "eval_steps_per_second": 6.382, "step": 14000 }, { "epoch": 1.2714658366031697, "grad_norm": 2.264676094055176, "learning_rate": 4.4917605992417254e-05, "loss": 3.0559, "step": 14500 }, { "epoch": 1.2714658366031697, "eval_loss": 2.9001705646514893, "eval_runtime": 1118.531, "eval_samples_per_second": 816.66, "eval_steps_per_second": 6.381, "step": 14500 }, { "epoch": 1.3153072184835266, "grad_norm": 2.7281758785247803, "learning_rate": 4.4467229515780716e-05, "loss": 3.0363, "step": 15000 }, { "epoch": 1.3153072184835266, "eval_loss": 2.877182960510254, "eval_runtime": 1118.2684, "eval_samples_per_second": 816.852, "eval_steps_per_second": 6.382, "step": 15000 }, { "epoch": 1.3591486003638835, "grad_norm": 2.4086153507232666, "learning_rate": 4.3999248254794173e-05, "loss": 3.0034, "step": 15500 }, { "epoch": 1.3591486003638835, "eval_loss": 2.858940839767456, "eval_runtime": 1118.6587, "eval_samples_per_second": 816.567, "eval_steps_per_second": 6.38, "step": 15500 }, { "epoch": 1.4029899822442404, "grad_norm": 2.3999428749084473, "learning_rate": 4.351494970809619e-05, "loss": 2.9863, "step": 16000 }, { "epoch": 1.4029899822442404, "eval_loss": 2.829259157180786, "eval_runtime": 1118.2831, "eval_samples_per_second": 816.841, "eval_steps_per_second": 6.382, "step": 16000 }, { "epoch": 1.4468313641245971, "grad_norm": 2.684216022491455, "learning_rate": 4.301474980992007e-05, "loss": 2.9554, "step": 16500 }, { "epoch": 1.4468313641245971, "eval_loss": 2.811227560043335, "eval_runtime": 1118.6502, "eval_samples_per_second": 816.573, "eval_steps_per_second": 6.38, "step": 16500 }, { "epoch": 1.490672746004954, "grad_norm": 2.5561940670013428, "learning_rate": 4.2499078151191824e-05, "loss": 2.9428, "step": 17000 }, { "epoch": 1.490672746004954, "eval_loss": 2.789614200592041, "eval_runtime": 1118.5002, "eval_samples_per_second": 816.683, "eval_steps_per_second": 6.381, "step": 17000 }, { "epoch": 1.534514127885311, "grad_norm": 2.4294307231903076, "learning_rate": 4.196837761058097e-05, "loss": 2.9133, "step": 17500 }, { "epoch": 1.534514127885311, "eval_loss": 2.7667744159698486, "eval_runtime": 1119.3799, "eval_samples_per_second": 816.041, "eval_steps_per_second": 6.376, "step": 17500 }, { "epoch": 1.5783555097656679, "grad_norm": 2.2849645614624023, "learning_rate": 4.142310397413924e-05, "loss": 2.9016, "step": 18000 }, { "epoch": 1.5783555097656679, "eval_loss": 2.747105836868286, "eval_runtime": 1118.1926, "eval_samples_per_second": 816.908, "eval_steps_per_second": 6.383, "step": 18000 }, { "epoch": 1.6221968916460248, "grad_norm": 2.693436622619629, "learning_rate": 4.086372554385406e-05, "loss": 2.8805, "step": 18500 }, { "epoch": 1.6221968916460248, "eval_loss": 2.7286176681518555, "eval_runtime": 1118.2866, "eval_samples_per_second": 816.839, "eval_steps_per_second": 6.382, "step": 18500 }, { "epoch": 1.6660382735263815, "grad_norm": 2.6212801933288574, "learning_rate": 4.029188201301087e-05, "loss": 2.8591, "step": 19000 }, { "epoch": 1.6660382735263815, "eval_loss": 2.7152278423309326, "eval_runtime": 1497.2315, "eval_samples_per_second": 610.099, "eval_steps_per_second": 4.767, "step": 19000 }, { "epoch": 1.7098796554067386, "grad_norm": 2.575929880142212, "learning_rate": 3.9705772709182955e-05, "loss": 2.8453, "step": 19500 }, { "epoch": 1.7098796554067386, "eval_loss": 2.700686454772949, "eval_runtime": 2157.4613, "eval_samples_per_second": 423.396, "eval_steps_per_second": 3.308, "step": 19500 }, { "epoch": 1.7537210372870953, "grad_norm": 2.335934638977051, "learning_rate": 3.910703352170464e-05, "loss": 2.837, "step": 20000 }, { "epoch": 1.7537210372870953, "eval_loss": 2.6829771995544434, "eval_runtime": 2034.4811, "eval_samples_per_second": 448.989, "eval_steps_per_second": 3.508, "step": 20000 }, { "epoch": 1.7975624191674522, "grad_norm": 2.378584146499634, "learning_rate": 3.8496178670836514e-05, "loss": 2.8044, "step": 20500 }, { "epoch": 1.7975624191674522, "eval_loss": 2.6625845432281494, "eval_runtime": 1120.1353, "eval_samples_per_second": 815.491, "eval_steps_per_second": 6.372, "step": 20500 }, { "epoch": 1.841403801047809, "grad_norm": 2.4612674713134766, "learning_rate": 3.787498888816347e-05, "loss": 2.8002, "step": 21000 }, { "epoch": 1.841403801047809, "eval_loss": 2.6464881896972656, "eval_runtime": 1126.8521, "eval_samples_per_second": 810.63, "eval_steps_per_second": 6.334, "step": 21000 }, { "epoch": 1.8852451829281658, "grad_norm": 2.6136703491210938, "learning_rate": 3.724150811533548e-05, "loss": 2.7825, "step": 21500 }, { "epoch": 1.8852451829281658, "eval_loss": 2.6333353519439697, "eval_runtime": 1263.6812, "eval_samples_per_second": 722.856, "eval_steps_per_second": 5.648, "step": 21500 }, { "epoch": 1.929086564808523, "grad_norm": 2.4944891929626465, "learning_rate": 3.6597513864143615e-05, "loss": 2.7675, "step": 22000 }, { "epoch": 1.929086564808523, "eval_loss": 2.617983818054199, "eval_runtime": 1248.4456, "eval_samples_per_second": 731.678, "eval_steps_per_second": 5.717, "step": 22000 }, { "epoch": 1.9729279466888796, "grad_norm": 2.3364956378936768, "learning_rate": 3.5943559221639114e-05, "loss": 2.7505, "step": 22500 }, { "epoch": 1.9729279466888796, "eval_loss": 2.6033763885498047, "eval_runtime": 1217.4556, "eval_samples_per_second": 750.303, "eval_steps_per_second": 5.862, "step": 22500 }, { "epoch": 2.016835090642057, "grad_norm": 2.4662578105926514, "learning_rate": 3.5281541538602945e-05, "loss": 2.7397, "step": 23000 }, { "epoch": 2.016835090642057, "eval_loss": 2.5903615951538086, "eval_runtime": 1253.7584, "eval_samples_per_second": 728.577, "eval_steps_per_second": 5.692, "step": 23000 }, { "epoch": 2.060676472522414, "grad_norm": 2.368075370788574, "learning_rate": 3.460937619411428e-05, "loss": 2.7161, "step": 23500 }, { "epoch": 2.060676472522414, "eval_loss": 2.579867362976074, "eval_runtime": 1116.1318, "eval_samples_per_second": 818.416, "eval_steps_per_second": 6.394, "step": 23500 }, { "epoch": 2.1045178544027707, "grad_norm": 2.3490450382232666, "learning_rate": 3.392895794747047e-05, "loss": 2.7133, "step": 24000 }, { "epoch": 2.1045178544027707, "eval_loss": 2.566068649291992, "eval_runtime": 1187.4579, "eval_samples_per_second": 769.257, "eval_steps_per_second": 6.01, "step": 24000 }, { "epoch": 2.1483592362831274, "grad_norm": 2.431868076324463, "learning_rate": 3.324087116805208e-05, "loss": 2.7004, "step": 24500 }, { "epoch": 2.1483592362831274, "eval_loss": 2.5521492958068848, "eval_runtime": 1214.5781, "eval_samples_per_second": 752.08, "eval_steps_per_second": 5.876, "step": 24500 }, { "epoch": 2.1922006181634845, "grad_norm": 2.526017665863037, "learning_rate": 3.254710380753827e-05, "loss": 2.685, "step": 25000 }, { "epoch": 2.1922006181634845, "eval_loss": 2.5438075065612793, "eval_runtime": 1165.0991, "eval_samples_per_second": 784.019, "eval_steps_per_second": 6.126, "step": 25000 }, { "epoch": 2.2360420000438412, "grad_norm": 2.22011661529541, "learning_rate": 3.184547126876346e-05, "loss": 2.6741, "step": 25500 }, { "epoch": 2.2360420000438412, "eval_loss": 2.5303306579589844, "eval_runtime": 1121.7956, "eval_samples_per_second": 814.284, "eval_steps_per_second": 6.362, "step": 25500 }, { "epoch": 2.2798833819241984, "grad_norm": 2.376256227493286, "learning_rate": 3.113795957577035e-05, "loss": 2.6677, "step": 26000 }, { "epoch": 2.2798833819241984, "eval_loss": 2.5202553272247314, "eval_runtime": 1164.241, "eval_samples_per_second": 784.597, "eval_steps_per_second": 6.13, "step": 26000 }, { "epoch": 2.323724763804555, "grad_norm": 2.520549774169922, "learning_rate": 3.0425176366834078e-05, "loss": 2.6527, "step": 26500 }, { "epoch": 2.323724763804555, "eval_loss": 2.5118391513824463, "eval_runtime": 1117.8696, "eval_samples_per_second": 817.144, "eval_steps_per_second": 6.384, "step": 26500 }, { "epoch": 2.367566145684912, "grad_norm": 2.346203088760376, "learning_rate": 2.9709172933827506e-05, "loss": 2.6446, "step": 27000 }, { "epoch": 2.367566145684912, "eval_loss": 2.500302314758301, "eval_runtime": 1118.1231, "eval_samples_per_second": 816.958, "eval_steps_per_second": 6.383, "step": 27000 }, { "epoch": 2.411407527565269, "grad_norm": 2.496829032897949, "learning_rate": 2.8989141242188162e-05, "loss": 2.6341, "step": 27500 }, { "epoch": 2.411407527565269, "eval_loss": 2.489889621734619, "eval_runtime": 1122.3441, "eval_samples_per_second": 813.886, "eval_steps_per_second": 6.359, "step": 27500 }, { "epoch": 2.4552489094456256, "grad_norm": 2.41103458404541, "learning_rate": 2.8264244412463785e-05, "loss": 2.6232, "step": 28000 }, { "epoch": 2.4552489094456256, "eval_loss": 2.4814670085906982, "eval_runtime": 1125.6467, "eval_samples_per_second": 811.498, "eval_steps_per_second": 6.34, "step": 28000 }, { "epoch": 2.4990902913259827, "grad_norm": 2.389714002609253, "learning_rate": 2.7536544123992213e-05, "loss": 2.613, "step": 28500 }, { "epoch": 2.4990902913259827, "eval_loss": 2.4698662757873535, "eval_runtime": 1121.0461, "eval_samples_per_second": 814.828, "eval_steps_per_second": 6.366, "step": 28500 }, { "epoch": 2.5429316732063394, "grad_norm": 2.2877752780914307, "learning_rate": 2.6806665353791482e-05, "loss": 2.6081, "step": 29000 }, { "epoch": 2.5429316732063394, "eval_loss": 2.464000940322876, "eval_runtime": 1125.4557, "eval_samples_per_second": 811.636, "eval_steps_per_second": 6.341, "step": 29000 }, { "epoch": 2.586773055086696, "grad_norm": 2.5879504680633545, "learning_rate": 2.607523494984359e-05, "loss": 2.6025, "step": 29500 }, { "epoch": 2.586773055086696, "eval_loss": 2.455082654953003, "eval_runtime": 1121.345, "eval_samples_per_second": 814.611, "eval_steps_per_second": 6.365, "step": 29500 }, { "epoch": 2.630614436967053, "grad_norm": 2.5052356719970703, "learning_rate": 2.534288109273333e-05, "loss": 2.5919, "step": 30000 }, { "epoch": 2.630614436967053, "eval_loss": 2.4449410438537598, "eval_runtime": 1123.293, "eval_samples_per_second": 813.198, "eval_steps_per_second": 6.354, "step": 30000 }, { "epoch": 2.67445581884741, "grad_norm": 2.4013631343841553, "learning_rate": 2.4610232756142613e-05, "loss": 2.5741, "step": 30500 }, { "epoch": 2.67445581884741, "eval_loss": 2.4410789012908936, "eval_runtime": 1120.3934, "eval_samples_per_second": 815.303, "eval_steps_per_second": 6.37, "step": 30500 }, { "epoch": 2.718297200727767, "grad_norm": 2.4138541221618652, "learning_rate": 2.3877919166663655e-05, "loss": 2.5773, "step": 31000 }, { "epoch": 2.718297200727767, "eval_loss": 2.431831121444702, "eval_runtime": 1118.5097, "eval_samples_per_second": 816.676, "eval_steps_per_second": 6.381, "step": 31000 }, { "epoch": 2.7621385826081237, "grad_norm": 2.482076644897461, "learning_rate": 2.3148030583765422e-05, "loss": 2.5637, "step": 31500 }, { "epoch": 2.7621385826081237, "eval_loss": 2.4250364303588867, "eval_runtime": 1118.5592, "eval_samples_per_second": 816.64, "eval_steps_per_second": 6.381, "step": 31500 }, { "epoch": 2.805979964488481, "grad_norm": 2.3182899951934814, "learning_rate": 2.2418268668523143e-05, "loss": 2.5642, "step": 32000 }, { "epoch": 2.805979964488481, "eval_loss": 2.4183554649353027, "eval_runtime": 1118.5188, "eval_samples_per_second": 816.669, "eval_steps_per_second": 6.381, "step": 32000 }, { "epoch": 2.8498213463688375, "grad_norm": 2.3466103076934814, "learning_rate": 2.169072404352314e-05, "loss": 2.5513, "step": 32500 }, { "epoch": 2.8498213463688375, "eval_loss": 2.4129860401153564, "eval_runtime": 1118.2998, "eval_samples_per_second": 816.829, "eval_steps_per_second": 6.382, "step": 32500 }, { "epoch": 2.8936627282491942, "grad_norm": 2.474790096282959, "learning_rate": 2.096602155209367e-05, "loss": 2.5473, "step": 33000 }, { "epoch": 2.8936627282491942, "eval_loss": 2.404020309448242, "eval_runtime": 1117.9989, "eval_samples_per_second": 817.049, "eval_steps_per_second": 6.384, "step": 33000 }, { "epoch": 2.9375041101295514, "grad_norm": 2.6245903968811035, "learning_rate": 2.024622220267145e-05, "loss": 2.5466, "step": 33500 }, { "epoch": 2.9375041101295514, "eval_loss": 2.397976875305176, "eval_runtime": 1117.8697, "eval_samples_per_second": 817.144, "eval_steps_per_second": 6.384, "step": 33500 }, { "epoch": 2.981345492009908, "grad_norm": 2.452371120452881, "learning_rate": 1.9529059426219034e-05, "loss": 2.5425, "step": 34000 }, { "epoch": 2.981345492009908, "eval_loss": 2.3942997455596924, "eval_runtime": 1117.9055, "eval_samples_per_second": 817.117, "eval_steps_per_second": 6.384, "step": 34000 }, { "epoch": 3.0252526359630854, "grad_norm": 2.3234288692474365, "learning_rate": 1.8816595304116282e-05, "loss": 2.5303, "step": 34500 }, { "epoch": 3.0252526359630854, "eval_loss": 2.386817216873169, "eval_runtime": 1117.5393, "eval_samples_per_second": 817.385, "eval_steps_per_second": 6.386, "step": 34500 }, { "epoch": 3.0690940178434425, "grad_norm": 2.3618667125701904, "learning_rate": 1.8109441727975086e-05, "loss": 2.5211, "step": 35000 }, { "epoch": 3.0690940178434425, "eval_loss": 2.3825838565826416, "eval_runtime": 1117.688, "eval_samples_per_second": 817.276, "eval_steps_per_second": 6.386, "step": 35000 }, { "epoch": 3.112935399723799, "grad_norm": 2.662584066390991, "learning_rate": 1.7409602192670955e-05, "loss": 2.5119, "step": 35500 }, { "epoch": 3.112935399723799, "eval_loss": 2.3771533966064453, "eval_runtime": 1117.3971, "eval_samples_per_second": 817.489, "eval_steps_per_second": 6.387, "step": 35500 }, { "epoch": 3.1567767816041563, "grad_norm": 2.3066375255584717, "learning_rate": 1.6714872980427282e-05, "loss": 2.5066, "step": 36000 }, { "epoch": 3.1567767816041563, "eval_loss": 2.370797872543335, "eval_runtime": 1117.258, "eval_samples_per_second": 817.591, "eval_steps_per_second": 6.388, "step": 36000 }, { "epoch": 3.200618163484513, "grad_norm": 2.282196283340454, "learning_rate": 1.6027259354175276e-05, "loss": 2.5097, "step": 36500 }, { "epoch": 3.200618163484513, "eval_loss": 2.3679802417755127, "eval_runtime": 1117.3536, "eval_samples_per_second": 817.521, "eval_steps_per_second": 6.387, "step": 36500 }, { "epoch": 3.2444595453648697, "grad_norm": 2.28078556060791, "learning_rate": 1.5348703597951843e-05, "loss": 2.5014, "step": 37000 }, { "epoch": 3.2444595453648697, "eval_loss": 2.359700918197632, "eval_runtime": 1117.1139, "eval_samples_per_second": 817.696, "eval_steps_per_second": 6.389, "step": 37000 }, { "epoch": 3.288300927245227, "grad_norm": 2.3221096992492676, "learning_rate": 1.4677069014261374e-05, "loss": 2.4898, "step": 37500 }, { "epoch": 3.288300927245227, "eval_loss": 2.3578717708587646, "eval_runtime": 1117.2315, "eval_samples_per_second": 817.61, "eval_steps_per_second": 6.388, "step": 37500 }, { "epoch": 3.3321423091255835, "grad_norm": 2.2953991889953613, "learning_rate": 1.4014300161046912e-05, "loss": 2.4948, "step": 38000 }, { "epoch": 3.3321423091255835, "eval_loss": 2.353087902069092, "eval_runtime": 1117.3717, "eval_samples_per_second": 817.508, "eval_steps_per_second": 6.387, "step": 38000 }, { "epoch": 3.3759836910059406, "grad_norm": 2.307751178741455, "learning_rate": 1.3360966249710593e-05, "loss": 2.4833, "step": 38500 }, { "epoch": 3.3759836910059406, "eval_loss": 2.349313497543335, "eval_runtime": 1117.4288, "eval_samples_per_second": 817.466, "eval_steps_per_second": 6.387, "step": 38500 }, { "epoch": 3.4198250728862973, "grad_norm": 2.3358969688415527, "learning_rate": 1.2717628388563296e-05, "loss": 2.4851, "step": 39000 }, { "epoch": 3.4198250728862973, "eval_loss": 2.3457424640655518, "eval_runtime": 1117.3864, "eval_samples_per_second": 817.497, "eval_steps_per_second": 6.387, "step": 39000 }, { "epoch": 3.4636664547666545, "grad_norm": 2.6708974838256836, "learning_rate": 1.2084839100923225e-05, "loss": 2.4832, "step": 39500 }, { "epoch": 3.4636664547666545, "eval_loss": 2.341883420944214, "eval_runtime": 1117.3341, "eval_samples_per_second": 817.535, "eval_steps_per_second": 6.388, "step": 39500 }, { "epoch": 3.507507836647011, "grad_norm": 2.3781583309173584, "learning_rate": 1.1463141850587639e-05, "loss": 2.4728, "step": 40000 }, { "epoch": 3.507507836647011, "eval_loss": 2.338205575942993, "eval_runtime": 1117.3056, "eval_samples_per_second": 817.556, "eval_steps_per_second": 6.388, "step": 40000 }, { "epoch": 3.551349218527368, "grad_norm": 2.3650519847869873, "learning_rate": 1.0853070575085217e-05, "loss": 2.4747, "step": 40500 }, { "epoch": 3.551349218527368, "eval_loss": 2.3338863849639893, "eval_runtime": 1117.5211, "eval_samples_per_second": 817.398, "eval_steps_per_second": 6.386, "step": 40500 }, { "epoch": 3.595190600407725, "grad_norm": 2.5673470497131348, "learning_rate": 1.0256332601077586e-05, "loss": 2.4674, "step": 41000 }, { "epoch": 3.595190600407725, "eval_loss": 2.3310675621032715, "eval_runtime": 1117.5975, "eval_samples_per_second": 817.343, "eval_steps_per_second": 6.386, "step": 41000 }, { "epoch": 3.6390319822880817, "grad_norm": 2.27545428276062, "learning_rate": 9.671048866272692e-06, "loss": 2.4676, "step": 41500 }, { "epoch": 3.6390319822880817, "eval_loss": 2.328411102294922, "eval_runtime": 1117.445, "eval_samples_per_second": 817.454, "eval_steps_per_second": 6.387, "step": 41500 }, { "epoch": 3.6828733641684384, "grad_norm": 2.398531436920166, "learning_rate": 9.098930224736293e-06, "loss": 2.4607, "step": 42000 }, { "epoch": 3.6828733641684384, "eval_loss": 2.3261964321136475, "eval_runtime": 1117.1492, "eval_samples_per_second": 817.671, "eval_steps_per_second": 6.389, "step": 42000 }, { "epoch": 3.7267147460487955, "grad_norm": 2.2593164443969727, "learning_rate": 8.540468033979468e-06, "loss": 2.4617, "step": 42500 }, { "epoch": 3.7267147460487955, "eval_loss": 2.3223798274993896, "eval_runtime": 1117.5341, "eval_samples_per_second": 817.389, "eval_steps_per_second": 6.386, "step": 42500 }, { "epoch": 3.770556127929152, "grad_norm": 2.4137706756591797, "learning_rate": 7.99721615445626e-06, "loss": 2.4589, "step": 43000 }, { "epoch": 3.770556127929152, "eval_loss": 2.3220419883728027, "eval_runtime": 1117.5679, "eval_samples_per_second": 817.364, "eval_steps_per_second": 6.386, "step": 43000 }, { "epoch": 3.8143975098095093, "grad_norm": 2.372236728668213, "learning_rate": 7.467463945707431e-06, "loss": 2.4587, "step": 43500 }, { "epoch": 3.8143975098095093, "eval_loss": 2.319883346557617, "eval_runtime": 1117.7624, "eval_samples_per_second": 817.222, "eval_steps_per_second": 6.385, "step": 43500 }, { "epoch": 3.858238891689866, "grad_norm": 2.357147693634033, "learning_rate": 6.952769353776245e-06, "loss": 2.4535, "step": 44000 }, { "epoch": 3.858238891689866, "eval_loss": 2.317007303237915, "eval_runtime": 1133.7123, "eval_samples_per_second": 805.725, "eval_steps_per_second": 6.295, "step": 44000 }, { "epoch": 3.902080273570223, "grad_norm": 2.783552408218384, "learning_rate": 6.454557052188573e-06, "loss": 2.449, "step": 44500 }, { "epoch": 3.902080273570223, "eval_loss": 2.31400728225708, "eval_runtime": 1167.9518, "eval_samples_per_second": 782.104, "eval_steps_per_second": 6.111, "step": 44500 }, { "epoch": 3.94592165545058, "grad_norm": 2.172205924987793, "learning_rate": 5.9712582251657486e-06, "loss": 2.4505, "step": 45000 }, { "epoch": 3.94592165545058, "eval_loss": 2.311835289001465, "eval_runtime": 1177.0705, "eval_samples_per_second": 776.045, "eval_steps_per_second": 6.063, "step": 45000 }, { "epoch": 3.9897630373309365, "grad_norm": 2.5776069164276123, "learning_rate": 5.504302014024623e-06, "loss": 2.4516, "step": 45500 }, { "epoch": 3.9897630373309365, "eval_loss": 2.3110923767089844, "eval_runtime": 1155.3005, "eval_samples_per_second": 790.669, "eval_steps_per_second": 6.178, "step": 45500 }, { "epoch": 4.033670181284114, "grad_norm": 2.3275997638702393, "learning_rate": 5.0540894587331774e-06, "loss": 2.4486, "step": 46000 }, { "epoch": 4.033670181284114, "eval_loss": 2.308993339538574, "eval_runtime": 1153.9106, "eval_samples_per_second": 791.621, "eval_steps_per_second": 6.185, "step": 46000 }, { "epoch": 4.077511563164471, "grad_norm": 2.5999953746795654, "learning_rate": 4.621007219163281e-06, "loss": 2.4475, "step": 46500 }, { "epoch": 4.077511563164471, "eval_loss": 2.3080523014068604, "eval_runtime": 1127.4548, "eval_samples_per_second": 810.197, "eval_steps_per_second": 6.33, "step": 46500 }, { "epoch": 4.121352945044828, "grad_norm": 2.5732951164245605, "learning_rate": 4.205427243012275e-06, "loss": 2.4422, "step": 47000 }, { "epoch": 4.121352945044828, "eval_loss": 2.3062963485717773, "eval_runtime": 1172.9589, "eval_samples_per_second": 778.766, "eval_steps_per_second": 6.085, "step": 47000 }, { "epoch": 4.165194326925184, "grad_norm": 2.5187389850616455, "learning_rate": 3.807706446359982e-06, "loss": 2.4356, "step": 47500 }, { "epoch": 4.165194326925184, "eval_loss": 2.303138017654419, "eval_runtime": 1168.5041, "eval_samples_per_second": 781.735, "eval_steps_per_second": 6.108, "step": 47500 }, { "epoch": 4.2090357088055415, "grad_norm": 2.493955373764038, "learning_rate": 3.4281864071354503e-06, "loss": 2.4373, "step": 48000 }, { "epoch": 4.2090357088055415, "eval_loss": 2.3037543296813965, "eval_runtime": 1141.8833, "eval_samples_per_second": 799.959, "eval_steps_per_second": 6.25, "step": 48000 }, { "epoch": 4.252877090685899, "grad_norm": 2.4855451583862305, "learning_rate": 3.067896360030392e-06, "loss": 2.438, "step": 48500 }, { "epoch": 4.252877090685899, "eval_loss": 2.302539348602295, "eval_runtime": 1132.8756, "eval_samples_per_second": 806.32, "eval_steps_per_second": 6.3, "step": 48500 }, { "epoch": 4.296718472566255, "grad_norm": 2.443387985229492, "learning_rate": 2.725701791286309e-06, "loss": 2.4302, "step": 49000 }, { "epoch": 4.296718472566255, "eval_loss": 2.301379919052124, "eval_runtime": 1147.1315, "eval_samples_per_second": 796.299, "eval_steps_per_second": 6.222, "step": 49000 }, { "epoch": 4.340559854446612, "grad_norm": 2.50595760345459, "learning_rate": 2.402637247215794e-06, "loss": 2.4363, "step": 49500 }, { "epoch": 4.340559854446612, "eval_loss": 2.3001203536987305, "eval_runtime": 1118.4945, "eval_samples_per_second": 816.687, "eval_steps_per_second": 6.381, "step": 49500 }, { "epoch": 4.384401236326969, "grad_norm": 2.498288869857788, "learning_rate": 2.098980188084537e-06, "loss": 2.4362, "step": 50000 }, { "epoch": 4.384401236326969, "eval_loss": 2.2997913360595703, "eval_runtime": 1114.6443, "eval_samples_per_second": 819.508, "eval_steps_per_second": 6.403, "step": 50000 }, { "epoch": 4.428242618207326, "grad_norm": 2.488811492919922, "learning_rate": 1.815539589939294e-06, "loss": 2.4307, "step": 50500 }, { "epoch": 4.428242618207326, "eval_loss": 2.2987558841705322, "eval_runtime": 1153.656, "eval_samples_per_second": 791.796, "eval_steps_per_second": 6.186, "step": 50500 }, { "epoch": 4.4720840000876825, "grad_norm": 2.4829695224761963, "learning_rate": 1.5514229294897542e-06, "loss": 2.4326, "step": 51000 }, { "epoch": 4.4720840000876825, "eval_loss": 2.296705484390259, "eval_runtime": 1118.7574, "eval_samples_per_second": 816.495, "eval_steps_per_second": 6.379, "step": 51000 }, { "epoch": 4.51592538196804, "grad_norm": 2.530369997024536, "learning_rate": 1.3074448096000807e-06, "loss": 2.435, "step": 51500 }, { "epoch": 4.51592538196804, "eval_loss": 2.2978501319885254, "eval_runtime": 1118.919, "eval_samples_per_second": 816.377, "eval_steps_per_second": 6.378, "step": 51500 }, { "epoch": 4.559766763848397, "grad_norm": 2.667680025100708, "learning_rate": 1.0838147680707346e-06, "loss": 2.4202, "step": 52000 }, { "epoch": 4.559766763848397, "eval_loss": 2.2962234020233154, "eval_runtime": 1118.9523, "eval_samples_per_second": 816.353, "eval_steps_per_second": 6.378, "step": 52000 }, { "epoch": 4.603608145728753, "grad_norm": 2.1807284355163574, "learning_rate": 8.811104288462684e-07, "loss": 2.4286, "step": 52500 }, { "epoch": 4.603608145728753, "eval_loss": 2.2967143058776855, "eval_runtime": 1118.8196, "eval_samples_per_second": 816.45, "eval_steps_per_second": 6.379, "step": 52500 }, { "epoch": 4.64744952760911, "grad_norm": 2.2673935890197754, "learning_rate": 6.986934982419146e-07, "loss": 2.4311, "step": 53000 }, { "epoch": 4.64744952760911, "eval_loss": 2.2961032390594482, "eval_runtime": 1118.4446, "eval_samples_per_second": 816.724, "eval_steps_per_second": 6.381, "step": 53000 }, { "epoch": 4.691290909489467, "grad_norm": 2.2549829483032227, "learning_rate": 5.371474650558512e-07, "loss": 2.4288, "step": 53500 }, { "epoch": 4.691290909489467, "eval_loss": 2.295196294784546, "eval_runtime": 1119.1152, "eval_samples_per_second": 816.234, "eval_steps_per_second": 6.377, "step": 53500 }, { "epoch": 4.735132291369824, "grad_norm": 2.3956711292266846, "learning_rate": 3.9661107123952765e-07, "loss": 2.4284, "step": 54000 }, { "epoch": 4.735132291369824, "eval_loss": 2.2958788871765137, "eval_runtime": 1118.6134, "eval_samples_per_second": 816.6, "eval_steps_per_second": 6.38, "step": 54000 }, { "epoch": 4.778973673250181, "grad_norm": 2.3948519229888916, "learning_rate": 2.774226677005054e-07, "loss": 2.43, "step": 54500 }, { "epoch": 4.778973673250181, "eval_loss": 2.29548716545105, "eval_runtime": 1118.792, "eval_samples_per_second": 816.47, "eval_steps_per_second": 6.379, "step": 54500 }, { "epoch": 4.822815055130538, "grad_norm": 2.336251735687256, "learning_rate": 1.7920694325616606e-07, "loss": 2.4354, "step": 55000 }, { "epoch": 4.822815055130538, "eval_loss": 2.295090436935425, "eval_runtime": 1118.5403, "eval_samples_per_second": 816.654, "eval_steps_per_second": 6.381, "step": 55000 }, { "epoch": 4.866656437010895, "grad_norm": 2.2819674015045166, "learning_rate": 1.0230827127936937e-07, "loss": 2.4268, "step": 55500 }, { "epoch": 4.866656437010895, "eval_loss": 2.295917272567749, "eval_runtime": 1118.759, "eval_samples_per_second": 816.494, "eval_steps_per_second": 6.379, "step": 55500 }, { "epoch": 4.910497818891251, "grad_norm": 2.349515438079834, "learning_rate": 4.679269530955821e-08, "loss": 2.4295, "step": 56000 }, { "epoch": 4.910497818891251, "eval_loss": 2.294180154800415, "eval_runtime": 1119.0255, "eval_samples_per_second": 816.3, "eval_steps_per_second": 6.378, "step": 56000 }, { "epoch": 4.954339200771608, "grad_norm": 2.2763524055480957, "learning_rate": 1.2754653424379426e-08, "loss": 2.4314, "step": 56500 }, { "epoch": 4.954339200771608, "eval_loss": 2.294581651687622, "eval_runtime": 1119.2098, "eval_samples_per_second": 816.165, "eval_steps_per_second": 6.377, "step": 56500 }, { "epoch": 4.998180582651965, "grad_norm": 2.5564186573028564, "learning_rate": 8.696357109150288e-11, "loss": 2.4295, "step": 57000 }, { "epoch": 4.998180582651965, "eval_loss": 2.2953152656555176, "eval_runtime": 1118.6887, "eval_samples_per_second": 816.545, "eval_steps_per_second": 6.38, "step": 57000 }, { "epoch": 5.0403208134285835, "grad_norm": 2.4840376377105713, "learning_rate": 2.0621818195184993e-05, "loss": 2.448, "step": 57500 }, { "epoch": 5.0403208134285835, "eval_loss": 2.295259952545166, "eval_runtime": 1254.4497, "eval_samples_per_second": 727.251, "eval_steps_per_second": 5.682, "step": 57500 }, { "epoch": 5.08414778454661, "grad_norm": 2.2857511043548584, "learning_rate": 2.020548401681933e-05, "loss": 2.4462, "step": 58000 }, { "epoch": 5.08414778454661, "eval_loss": 2.2957704067230225, "eval_runtime": 1112.6636, "eval_samples_per_second": 819.924, "eval_steps_per_second": 6.406, "step": 58000 }, { "epoch": 5.127974755664636, "grad_norm": 2.297426223754883, "learning_rate": 1.9791354300727253e-05, "loss": 2.4469, "step": 58500 }, { "epoch": 5.127974755664636, "eval_loss": 2.2939374446868896, "eval_runtime": 1112.6399, "eval_samples_per_second": 819.942, "eval_steps_per_second": 6.406, "step": 58500 }, { "epoch": 5.171801726782662, "grad_norm": 2.495027542114258, "learning_rate": 1.9378713462572584e-05, "loss": 2.4436, "step": 59000 }, { "epoch": 5.171801726782662, "eval_loss": 2.290992498397827, "eval_runtime": 1112.5602, "eval_samples_per_second": 820.001, "eval_steps_per_second": 6.407, "step": 59000 }, { "epoch": 5.215628697900688, "grad_norm": 2.5433051586151123, "learning_rate": 1.8966857431306628e-05, "loss": 2.4324, "step": 59500 }, { "epoch": 5.215628697900688, "eval_loss": 2.285850763320923, "eval_runtime": 1112.0589, "eval_samples_per_second": 820.37, "eval_steps_per_second": 6.41, "step": 59500 }, { "epoch": 5.259455669018714, "grad_norm": 2.5419158935546875, "learning_rate": 1.855673287709892e-05, "loss": 2.4231, "step": 60000 }, { "epoch": 5.259455669018714, "eval_loss": 2.2814688682556152, "eval_runtime": 1112.6767, "eval_samples_per_second": 819.915, "eval_steps_per_second": 6.406, "step": 60000 }, { "epoch": 5.30328264013674, "grad_norm": 2.5950675010681152, "learning_rate": 1.814845750332687e-05, "loss": 2.431, "step": 60500 }, { "epoch": 5.30328264013674, "eval_loss": 2.2797560691833496, "eval_runtime": 1113.0425, "eval_samples_per_second": 819.645, "eval_steps_per_second": 6.404, "step": 60500 }, { "epoch": 5.3471096112547665, "grad_norm": 2.439197063446045, "learning_rate": 1.774214848266375e-05, "loss": 2.4205, "step": 61000 }, { "epoch": 5.3471096112547665, "eval_loss": 2.2719454765319824, "eval_runtime": 1114.2544, "eval_samples_per_second": 818.754, "eval_steps_per_second": 6.397, "step": 61000 }, { "epoch": 5.390936582372793, "grad_norm": 2.4935576915740967, "learning_rate": 1.73379224234509e-05, "loss": 2.4216, "step": 61500 }, { "epoch": 5.390936582372793, "eval_loss": 2.2704086303710938, "eval_runtime": 1113.9901, "eval_samples_per_second": 818.948, "eval_steps_per_second": 6.399, "step": 61500 }, { "epoch": 5.434763553490818, "grad_norm": 2.526001453399658, "learning_rate": 1.6935895336231698e-05, "loss": 2.4118, "step": 62000 }, { "epoch": 5.434763553490818, "eval_loss": 2.2659912109375, "eval_runtime": 1113.1948, "eval_samples_per_second": 819.533, "eval_steps_per_second": 6.403, "step": 62000 }, { "epoch": 5.478590524608844, "grad_norm": 2.588696241378784, "learning_rate": 1.653618260045733e-05, "loss": 2.4104, "step": 62500 }, { "epoch": 5.478590524608844, "eval_loss": 2.262714147567749, "eval_runtime": 1113.2419, "eval_samples_per_second": 819.498, "eval_steps_per_second": 6.403, "step": 62500 }, { "epoch": 5.52241749572687, "grad_norm": 2.5436880588531494, "learning_rate": 1.6139690998599525e-05, "loss": 2.4048, "step": 63000 }, { "epoch": 5.52241749572687, "eval_loss": 2.261882781982422, "eval_runtime": 1112.8347, "eval_samples_per_second": 819.798, "eval_steps_per_second": 6.405, "step": 63000 }, { "epoch": 5.566244466844896, "grad_norm": 2.3459692001342773, "learning_rate": 1.574494521484366e-05, "loss": 2.4042, "step": 63500 }, { "epoch": 5.566244466844896, "eval_loss": 2.2557597160339355, "eval_runtime": 1115.0241, "eval_samples_per_second": 818.189, "eval_steps_per_second": 6.393, "step": 63500 }, { "epoch": 5.610071437962922, "grad_norm": 2.5149025917053223, "learning_rate": 1.5352855578336255e-05, "loss": 2.3984, "step": 64000 }, { "epoch": 5.610071437962922, "eval_loss": 2.2534825801849365, "eval_runtime": 1117.6575, "eval_samples_per_second": 816.261, "eval_steps_per_second": 6.378, "step": 64000 }, { "epoch": 5.6538984090809485, "grad_norm": 2.2918002605438232, "learning_rate": 1.4963534616537533e-05, "loss": 2.3954, "step": 64500 }, { "epoch": 5.6538984090809485, "eval_loss": 2.248565673828125, "eval_runtime": 1117.9311, "eval_samples_per_second": 816.061, "eval_steps_per_second": 6.376, "step": 64500 }, { "epoch": 5.697725380198975, "grad_norm": 2.298626661300659, "learning_rate": 1.4577863994919117e-05, "loss": 2.3967, "step": 65000 }, { "epoch": 5.697725380198975, "eval_loss": 2.2449169158935547, "eval_runtime": 1118.1203, "eval_samples_per_second": 815.923, "eval_steps_per_second": 6.375, "step": 65000 }, { "epoch": 5.741552351317001, "grad_norm": 2.3184773921966553, "learning_rate": 1.4194408661730513e-05, "loss": 2.3911, "step": 65500 }, { "epoch": 5.741552351317001, "eval_loss": 2.2438881397247314, "eval_runtime": 1118.3575, "eval_samples_per_second": 815.75, "eval_steps_per_second": 6.374, "step": 65500 }, { "epoch": 5.785379322435027, "grad_norm": 2.4109182357788086, "learning_rate": 1.3814054470822247e-05, "loss": 2.3809, "step": 66000 }, { "epoch": 5.785379322435027, "eval_loss": 2.240081310272217, "eval_runtime": 1118.1546, "eval_samples_per_second": 815.898, "eval_steps_per_second": 6.375, "step": 66000 }, { "epoch": 5.829206293553052, "grad_norm": 2.3846776485443115, "learning_rate": 1.3436910581649448e-05, "loss": 2.3793, "step": 66500 }, { "epoch": 5.829206293553052, "eval_loss": 2.239961862564087, "eval_runtime": 1118.5503, "eval_samples_per_second": 815.609, "eval_steps_per_second": 6.373, "step": 66500 }, { "epoch": 5.873033264671078, "grad_norm": 2.4958534240722656, "learning_rate": 1.3063829499654062e-05, "loss": 2.3779, "step": 67000 }, { "epoch": 5.873033264671078, "eval_loss": 2.2330241203308105, "eval_runtime": 1117.0041, "eval_samples_per_second": 816.738, "eval_steps_per_second": 6.381, "step": 67000 }, { "epoch": 5.9168602357891045, "grad_norm": 2.727729320526123, "learning_rate": 1.2693423017827839e-05, "loss": 2.3819, "step": 67500 }, { "epoch": 5.9168602357891045, "eval_loss": 2.230943441390991, "eval_runtime": 1118.424, "eval_samples_per_second": 815.701, "eval_steps_per_second": 6.373, "step": 67500 }, { "epoch": 5.960687206907131, "grad_norm": 2.575376272201538, "learning_rate": 1.232654845248921e-05, "loss": 2.381, "step": 68000 }, { "epoch": 5.960687206907131, "eval_loss": 2.230390787124634, "eval_runtime": 1118.1235, "eval_samples_per_second": 815.921, "eval_steps_per_second": 6.375, "step": 68000 }, { "epoch": 6.004470351054039, "grad_norm": 2.529177665710449, "learning_rate": 1.196331109451862e-05, "loss": 2.3686, "step": 68500 }, { "epoch": 6.004470351054039, "eval_loss": 2.2275359630584717, "eval_runtime": 1118.6647, "eval_samples_per_second": 815.526, "eval_steps_per_second": 6.372, "step": 68500 }, { "epoch": 6.048297322172065, "grad_norm": 2.376052141189575, "learning_rate": 1.1604530380017059e-05, "loss": 2.3651, "step": 69000 }, { "epoch": 6.048297322172065, "eval_loss": 2.2251877784729004, "eval_runtime": 1118.8605, "eval_samples_per_second": 815.383, "eval_steps_per_second": 6.371, "step": 69000 }, { "epoch": 6.092124293290091, "grad_norm": 2.479585886001587, "learning_rate": 1.1248871312582082e-05, "loss": 2.3636, "step": 69500 }, { "epoch": 6.092124293290091, "eval_loss": 2.221175193786621, "eval_runtime": 1119.5075, "eval_samples_per_second": 814.912, "eval_steps_per_second": 6.367, "step": 69500 }, { "epoch": 6.135951264408117, "grad_norm": 2.534466505050659, "learning_rate": 1.0897158739627577e-05, "loss": 2.3651, "step": 70000 }, { "epoch": 6.135951264408117, "eval_loss": 2.2180685997009277, "eval_runtime": 1118.9839, "eval_samples_per_second": 815.293, "eval_steps_per_second": 6.37, "step": 70000 }, { "epoch": 6.179778235526142, "grad_norm": 2.6526997089385986, "learning_rate": 1.0549493600629845e-05, "loss": 2.3652, "step": 70500 }, { "epoch": 6.179778235526142, "eval_loss": 2.220241069793701, "eval_runtime": 1117.2188, "eval_samples_per_second": 816.581, "eval_steps_per_second": 6.38, "step": 70500 }, { "epoch": 6.2236052066441685, "grad_norm": 2.5207266807556152, "learning_rate": 1.0206658504682815e-05, "loss": 2.355, "step": 71000 }, { "epoch": 6.2236052066441685, "eval_loss": 2.2159178256988525, "eval_runtime": 1117.5581, "eval_samples_per_second": 816.333, "eval_steps_per_second": 6.378, "step": 71000 }, { "epoch": 6.267432177762195, "grad_norm": 2.5469133853912354, "learning_rate": 9.867377787846862e-06, "loss": 2.3543, "step": 71500 }, { "epoch": 6.267432177762195, "eval_loss": 2.2127163410186768, "eval_runtime": 1117.1967, "eval_samples_per_second": 816.598, "eval_steps_per_second": 6.38, "step": 71500 }, { "epoch": 6.311259148880221, "grad_norm": 2.4534058570861816, "learning_rate": 9.532440046150856e-06, "loss": 2.351, "step": 72000 }, { "epoch": 6.311259148880221, "eval_loss": 2.2119340896606445, "eval_runtime": 1117.6266, "eval_samples_per_second": 816.283, "eval_steps_per_second": 6.378, "step": 72000 }, { "epoch": 6.355086119998247, "grad_norm": 2.4497475624084473, "learning_rate": 9.201941404791417e-06, "loss": 2.3451, "step": 72500 }, { "epoch": 6.355086119998247, "eval_loss": 2.2094504833221436, "eval_runtime": 1119.5542, "eval_samples_per_second": 814.878, "eval_steps_per_second": 6.367, "step": 72500 }, { "epoch": 6.398913091116273, "grad_norm": 2.3042914867401123, "learning_rate": 8.876624057066015e-06, "loss": 2.3469, "step": 73000 }, { "epoch": 6.398913091116273, "eval_loss": 2.2069456577301025, "eval_runtime": 1118.0622, "eval_samples_per_second": 815.965, "eval_steps_per_second": 6.375, "step": 73000 }, { "epoch": 6.442740062234299, "grad_norm": 2.4782769680023193, "learning_rate": 8.555277521275629e-06, "loss": 2.3522, "step": 73500 }, { "epoch": 6.442740062234299, "eval_loss": 2.205556631088257, "eval_runtime": 1112.4728, "eval_samples_per_second": 820.065, "eval_steps_per_second": 6.407, "step": 73500 }, { "epoch": 6.486567033352325, "grad_norm": 2.408228874206543, "learning_rate": 8.23865052582049e-06, "loss": 2.3458, "step": 74000 }, { "epoch": 6.486567033352325, "eval_loss": 2.203964948654175, "eval_runtime": 1112.4771, "eval_samples_per_second": 820.062, "eval_steps_per_second": 6.407, "step": 74000 }, { "epoch": 6.530394004470351, "grad_norm": 2.472689390182495, "learning_rate": 7.926833940818856e-06, "loss": 2.3436, "step": 74500 }, { "epoch": 6.530394004470351, "eval_loss": 2.2009198665618896, "eval_runtime": 1112.7482, "eval_samples_per_second": 819.862, "eval_steps_per_second": 6.406, "step": 74500 }, { "epoch": 6.574220975588377, "grad_norm": 2.4618117809295654, "learning_rate": 7.6205261403159065e-06, "loss": 2.3424, "step": 75000 }, { "epoch": 6.574220975588377, "eval_loss": 2.2018818855285645, "eval_runtime": 1113.2997, "eval_samples_per_second": 819.456, "eval_steps_per_second": 6.403, "step": 75000 }, { "epoch": 6.618047946706403, "grad_norm": 2.51564621925354, "learning_rate": 7.318587375726538e-06, "loss": 2.343, "step": 75500 }, { "epoch": 6.618047946706403, "eval_loss": 2.196281909942627, "eval_runtime": 1113.37, "eval_samples_per_second": 819.404, "eval_steps_per_second": 6.402, "step": 75500 }, { "epoch": 6.661874917824429, "grad_norm": 2.3265905380249023, "learning_rate": 7.021723074398725e-06, "loss": 2.3383, "step": 76000 }, { "epoch": 6.661874917824429, "eval_loss": 2.197392225265503, "eval_runtime": 1113.4662, "eval_samples_per_second": 819.333, "eval_steps_per_second": 6.402, "step": 76000 }, { "epoch": 6.705701888942455, "grad_norm": 2.500836133956909, "learning_rate": 6.730018434671659e-06, "loss": 2.3442, "step": 76500 }, { "epoch": 6.705701888942455, "eval_loss": 2.1948647499084473, "eval_runtime": 1114.1466, "eval_samples_per_second": 818.833, "eval_steps_per_second": 6.398, "step": 76500 }, { "epoch": 6.749528860060481, "grad_norm": 2.4531776905059814, "learning_rate": 6.444124808823204e-06, "loss": 2.3343, "step": 77000 }, { "epoch": 6.749528860060481, "eval_loss": 2.1950042247772217, "eval_runtime": 1114.1483, "eval_samples_per_second": 818.832, "eval_steps_per_second": 6.398, "step": 77000 }, { "epoch": 6.793355831178507, "grad_norm": 2.488192081451416, "learning_rate": 6.162978407896589e-06, "loss": 2.3428, "step": 77500 }, { "epoch": 6.793355831178507, "eval_loss": 2.191720962524414, "eval_runtime": 1114.2187, "eval_samples_per_second": 818.78, "eval_steps_per_second": 6.397, "step": 77500 }, { "epoch": 6.8371828022965335, "grad_norm": 2.629721164703369, "learning_rate": 5.887238123328259e-06, "loss": 2.335, "step": 78000 }, { "epoch": 6.8371828022965335, "eval_loss": 2.190831184387207, "eval_runtime": 1114.1658, "eval_samples_per_second": 818.819, "eval_steps_per_second": 6.398, "step": 78000 }, { "epoch": 6.88100977341456, "grad_norm": 2.388756513595581, "learning_rate": 5.616983090986713e-06, "loss": 2.3394, "step": 78500 }, { "epoch": 6.88100977341456, "eval_loss": 2.1897459030151367, "eval_runtime": 1113.866, "eval_samples_per_second": 819.039, "eval_steps_per_second": 6.399, "step": 78500 }, { "epoch": 6.924836744532586, "grad_norm": 2.546407461166382, "learning_rate": 5.352814654493821e-06, "loss": 2.3341, "step": 79000 }, { "epoch": 6.924836744532586, "eval_loss": 2.1880617141723633, "eval_runtime": 1114.3622, "eval_samples_per_second": 818.675, "eval_steps_per_second": 6.396, "step": 79000 }, { "epoch": 6.968663715650611, "grad_norm": 2.6898553371429443, "learning_rate": 5.093749862709529e-06, "loss": 2.3397, "step": 79500 }, { "epoch": 6.968663715650611, "eval_loss": 2.1861698627471924, "eval_runtime": 1113.9872, "eval_samples_per_second": 818.95, "eval_steps_per_second": 6.399, "step": 79500 }, { "epoch": 7.012446859797519, "grad_norm": 2.592198610305786, "learning_rate": 4.840398049698097e-06, "loss": 2.3213, "step": 80000 }, { "epoch": 7.012446859797519, "eval_loss": 2.1867756843566895, "eval_runtime": 1114.245, "eval_samples_per_second": 818.761, "eval_steps_per_second": 6.397, "step": 80000 }, { "epoch": 7.056273830915545, "grad_norm": 2.305933713912964, "learning_rate": 4.592831925966015e-06, "loss": 2.3311, "step": 80500 }, { "epoch": 7.056273830915545, "eval_loss": 2.1855616569519043, "eval_runtime": 1114.1605, "eval_samples_per_second": 818.823, "eval_steps_per_second": 6.398, "step": 80500 }, { "epoch": 7.100100802033571, "grad_norm": 2.3767688274383545, "learning_rate": 4.351600068913997e-06, "loss": 2.3216, "step": 81000 }, { "epoch": 7.100100802033571, "eval_loss": 2.18585205078125, "eval_runtime": 1114.2108, "eval_samples_per_second": 818.786, "eval_steps_per_second": 6.397, "step": 81000 }, { "epoch": 7.1439277731515975, "grad_norm": 2.4296772480010986, "learning_rate": 4.115804872711229e-06, "loss": 2.3258, "step": 81500 }, { "epoch": 7.1439277731515975, "eval_loss": 2.1833810806274414, "eval_runtime": 1114.2167, "eval_samples_per_second": 818.781, "eval_steps_per_second": 6.397, "step": 81500 }, { "epoch": 7.187754744269624, "grad_norm": 2.158872127532959, "learning_rate": 3.886003319842971e-06, "loss": 2.3257, "step": 82000 }, { "epoch": 7.187754744269624, "eval_loss": 2.1819121837615967, "eval_runtime": 1115.9623, "eval_samples_per_second": 817.501, "eval_steps_per_second": 6.387, "step": 82000 }, { "epoch": 7.23158171538765, "grad_norm": 2.458834648132324, "learning_rate": 3.6622613620271253e-06, "loss": 2.3199, "step": 82500 }, { "epoch": 7.23158171538765, "eval_loss": 2.183306932449341, "eval_runtime": 1114.8267, "eval_samples_per_second": 818.333, "eval_steps_per_second": 6.394, "step": 82500 }, { "epoch": 7.275408686505676, "grad_norm": 2.311922788619995, "learning_rate": 3.444643211912821e-06, "loss": 2.3251, "step": 83000 }, { "epoch": 7.275408686505676, "eval_loss": 2.1810803413391113, "eval_runtime": 1114.2828, "eval_samples_per_second": 818.733, "eval_steps_per_second": 6.397, "step": 83000 }, { "epoch": 7.319235657623702, "grad_norm": 2.43715238571167, "learning_rate": 3.233627973906725e-06, "loss": 2.3247, "step": 83500 }, { "epoch": 7.319235657623702, "eval_loss": 2.178840160369873, "eval_runtime": 1114.5518, "eval_samples_per_second": 818.535, "eval_steps_per_second": 6.395, "step": 83500 }, { "epoch": 7.363062628741727, "grad_norm": 2.3885252475738525, "learning_rate": 3.028430475974181e-06, "loss": 2.3207, "step": 84000 }, { "epoch": 7.363062628741727, "eval_loss": 2.1783220767974854, "eval_runtime": 1117.3767, "eval_samples_per_second": 816.466, "eval_steps_per_second": 6.379, "step": 84000 }, { "epoch": 7.4068895998597535, "grad_norm": 2.357344388961792, "learning_rate": 2.829538691545261e-06, "loss": 2.3156, "step": 84500 }, { "epoch": 7.4068895998597535, "eval_loss": 2.1777966022491455, "eval_runtime": 1123.0806, "eval_samples_per_second": 812.319, "eval_steps_per_second": 6.347, "step": 84500 }, { "epoch": 7.45071657097778, "grad_norm": 2.44062876701355, "learning_rate": 2.6370097014129153e-06, "loss": 2.3172, "step": 85000 }, { "epoch": 7.45071657097778, "eval_loss": 2.1768882274627686, "eval_runtime": 1117.6985, "eval_samples_per_second": 816.231, "eval_steps_per_second": 6.377, "step": 85000 }, { "epoch": 7.494543542095806, "grad_norm": 2.4813036918640137, "learning_rate": 2.4512645411442605e-06, "loss": 2.3209, "step": 85500 }, { "epoch": 7.494543542095806, "eval_loss": 2.1777381896972656, "eval_runtime": 1118.4824, "eval_samples_per_second": 815.659, "eval_steps_per_second": 6.373, "step": 85500 }, { "epoch": 7.538370513213832, "grad_norm": 2.700749635696411, "learning_rate": 2.271612066787826e-06, "loss": 2.3106, "step": 86000 }, { "epoch": 7.538370513213832, "eval_loss": 2.1763668060302734, "eval_runtime": 1117.7333, "eval_samples_per_second": 816.205, "eval_steps_per_second": 6.377, "step": 86000 }, { "epoch": 7.582197484331858, "grad_norm": 2.373656749725342, "learning_rate": 2.0984825084456316e-06, "loss": 2.3174, "step": 86500 }, { "epoch": 7.582197484331858, "eval_loss": 2.1764698028564453, "eval_runtime": 1117.9749, "eval_samples_per_second": 816.029, "eval_steps_per_second": 6.376, "step": 86500 }, { "epoch": 7.626024455449884, "grad_norm": 2.449230194091797, "learning_rate": 1.931925553300576e-06, "loss": 2.313, "step": 87000 }, { "epoch": 7.626024455449884, "eval_loss": 2.17521595954895, "eval_runtime": 1117.4736, "eval_samples_per_second": 816.395, "eval_steps_per_second": 6.379, "step": 87000 }, { "epoch": 7.669851426567909, "grad_norm": 2.364248275756836, "learning_rate": 1.7723022373487774e-06, "loss": 2.314, "step": 87500 }, { "epoch": 7.669851426567909, "eval_loss": 2.1753010749816895, "eval_runtime": 1118.1437, "eval_samples_per_second": 815.906, "eval_steps_per_second": 6.375, "step": 87500 }, { "epoch": 7.7136783976859356, "grad_norm": 2.205310344696045, "learning_rate": 1.6190186140821656e-06, "loss": 2.3185, "step": 88000 }, { "epoch": 7.7136783976859356, "eval_loss": 2.174024820327759, "eval_runtime": 1118.3337, "eval_samples_per_second": 815.767, "eval_steps_per_second": 6.374, "step": 88000 }, { "epoch": 7.757505368803962, "grad_norm": 2.3702187538146973, "learning_rate": 1.472445197380079e-06, "loss": 2.3143, "step": 88500 }, { "epoch": 7.757505368803962, "eval_loss": 2.1744604110717773, "eval_runtime": 1118.5051, "eval_samples_per_second": 815.642, "eval_steps_per_second": 6.373, "step": 88500 }, { "epoch": 7.801332339921988, "grad_norm": 2.457601547241211, "learning_rate": 1.3326240529662303e-06, "loss": 2.3138, "step": 89000 }, { "epoch": 7.801332339921988, "eval_loss": 2.1727075576782227, "eval_runtime": 1118.3695, "eval_samples_per_second": 815.741, "eval_steps_per_second": 6.374, "step": 89000 }, { "epoch": 7.845159311040014, "grad_norm": 2.4939231872558594, "learning_rate": 1.1998545616726697e-06, "loss": 2.3193, "step": 89500 }, { "epoch": 7.845159311040014, "eval_loss": 2.172689437866211, "eval_runtime": 1118.2879, "eval_samples_per_second": 815.801, "eval_steps_per_second": 6.374, "step": 89500 }, { "epoch": 7.88898628215804, "grad_norm": 2.6024014949798584, "learning_rate": 1.0736426980792303e-06, "loss": 2.3165, "step": 90000 }, { "epoch": 7.88898628215804, "eval_loss": 2.172903537750244, "eval_runtime": 1118.4656, "eval_samples_per_second": 815.671, "eval_steps_per_second": 6.373, "step": 90000 }, { "epoch": 7.932813253276066, "grad_norm": 2.3985230922698975, "learning_rate": 9.54297560787079e-07, "loss": 2.3182, "step": 90500 }, { "epoch": 7.932813253276066, "eval_loss": 2.1716508865356445, "eval_runtime": 1118.3555, "eval_samples_per_second": 815.751, "eval_steps_per_second": 6.374, "step": 90500 }, { "epoch": 7.976640224394092, "grad_norm": 2.4502456188201904, "learning_rate": 8.418534011610524e-07, "loss": 2.3178, "step": 91000 }, { "epoch": 7.976640224394092, "eval_loss": 2.172135829925537, "eval_runtime": 1118.3622, "eval_samples_per_second": 815.746, "eval_steps_per_second": 6.374, "step": 91000 }, { "epoch": 8.020423368541, "grad_norm": 2.4215595722198486, "learning_rate": 7.365465720065356e-07, "loss": 2.3127, "step": 91500 }, { "epoch": 8.020423368541, "eval_loss": 2.1727616786956787, "eval_runtime": 1115.4247, "eval_samples_per_second": 817.895, "eval_steps_per_second": 6.39, "step": 91500 }, { "epoch": 8.064250339659026, "grad_norm": 2.358971357345581, "learning_rate": 6.379852344303245e-07, "loss": 2.3145, "step": 92000 }, { "epoch": 8.064250339659026, "eval_loss": 2.1719257831573486, "eval_runtime": 1114.9532, "eval_samples_per_second": 818.241, "eval_steps_per_second": 6.393, "step": 92000 }, { "epoch": 8.108077310777052, "grad_norm": 2.3747315406799316, "learning_rate": 5.46415654330279e-07, "loss": 2.3069, "step": 92500 }, { "epoch": 8.108077310777052, "eval_loss": 2.171802043914795, "eval_runtime": 1115.5499, "eval_samples_per_second": 817.803, "eval_steps_per_second": 6.39, "step": 92500 }, { "epoch": 8.151904281895078, "grad_norm": 2.4205031394958496, "learning_rate": 4.6186411164680645e-07, "loss": 2.3099, "step": 93000 }, { "epoch": 8.151904281895078, "eval_loss": 2.172088146209717, "eval_runtime": 1115.2118, "eval_samples_per_second": 818.051, "eval_steps_per_second": 6.392, "step": 93000 }, { "epoch": 8.195731253013104, "grad_norm": 2.3196699619293213, "learning_rate": 3.84502847321927e-07, "loss": 2.311, "step": 93500 }, { "epoch": 8.195731253013104, "eval_loss": 2.171304941177368, "eval_runtime": 1115.3282, "eval_samples_per_second": 817.965, "eval_steps_per_second": 6.391, "step": 93500 }, { "epoch": 8.23955822413113, "grad_norm": 2.2472469806671143, "learning_rate": 3.1404400583445736e-07, "loss": 2.3143, "step": 94000 }, { "epoch": 8.23955822413113, "eval_loss": 2.1706063747406006, "eval_runtime": 1114.8722, "eval_samples_per_second": 818.3, "eval_steps_per_second": 6.394, "step": 94000 }, { "epoch": 8.283385195249156, "grad_norm": 2.6286418437957764, "learning_rate": 2.5066989108405715e-07, "loss": 2.3162, "step": 94500 }, { "epoch": 8.283385195249156, "eval_loss": 2.1710445880889893, "eval_runtime": 1116.0067, "eval_samples_per_second": 817.468, "eval_steps_per_second": 6.387, "step": 94500 }, { "epoch": 8.327212166367183, "grad_norm": 2.4226999282836914, "learning_rate": 1.943986910754897e-07, "loss": 2.3085, "step": 95000 }, { "epoch": 8.327212166367183, "eval_loss": 2.1697933673858643, "eval_runtime": 1115.2712, "eval_samples_per_second": 818.007, "eval_steps_per_second": 6.391, "step": 95000 }, { "epoch": 8.371039137485209, "grad_norm": 2.3095433712005615, "learning_rate": 1.453377450467558e-07, "loss": 2.3091, "step": 95500 }, { "epoch": 8.371039137485209, "eval_loss": 2.170691728591919, "eval_runtime": 1115.2973, "eval_samples_per_second": 817.988, "eval_steps_per_second": 6.391, "step": 95500 }, { "epoch": 8.414866108603235, "grad_norm": 2.637993335723877, "learning_rate": 1.0330450086001587e-07, "loss": 2.3062, "step": 96000 }, { "epoch": 8.414866108603235, "eval_loss": 2.170945882797241, "eval_runtime": 1114.8255, "eval_samples_per_second": 818.334, "eval_steps_per_second": 6.394, "step": 96000 }, { "epoch": 8.458693079721261, "grad_norm": 2.3570830821990967, "learning_rate": 6.841646443063732e-08, "loss": 2.3159, "step": 96500 }, { "epoch": 8.458693079721261, "eval_loss": 2.171571969985962, "eval_runtime": 1115.0312, "eval_samples_per_second": 818.183, "eval_steps_per_second": 6.393, "step": 96500 }, { "epoch": 8.502520050839287, "grad_norm": 2.5434176921844482, "learning_rate": 4.068364842349792e-08, "loss": 2.3096, "step": 97000 }, { "epoch": 8.502520050839287, "eval_loss": 2.171351194381714, "eval_runtime": 1115.2049, "eval_samples_per_second": 818.056, "eval_steps_per_second": 6.392, "step": 97000 }, { "epoch": 8.546347021957313, "grad_norm": 2.5126280784606934, "learning_rate": 2.0147998149930293e-08, "loss": 2.3079, "step": 97500 }, { "epoch": 8.546347021957313, "eval_loss": 2.171030282974243, "eval_runtime": 1115.7419, "eval_samples_per_second": 817.662, "eval_steps_per_second": 6.389, "step": 97500 }, { "epoch": 8.59017399307534, "grad_norm": 2.4063174724578857, "learning_rate": 6.733101979849999e-09, "loss": 2.3082, "step": 98000 }, { "epoch": 8.59017399307534, "eval_loss": 2.1707358360290527, "eval_runtime": 1114.2074, "eval_samples_per_second": 818.788, "eval_steps_per_second": 6.397, "step": 98000 }, { "epoch": 8.634000964193365, "grad_norm": 2.511075735092163, "learning_rate": 4.91129000629309e-10, "loss": 2.3096, "step": 98500 }, { "epoch": 8.634000964193365, "eval_loss": 2.1694393157958984, "eval_runtime": 1114.2428, "eval_samples_per_second": 818.762, "eval_steps_per_second": 6.397, "step": 98500 }, { "epoch": 8.677389665600211, "grad_norm": 2.3884670734405518, "learning_rate": 4.173116663065885e-06, "loss": 2.3037, "step": 99000 }, { "epoch": 8.677389665600211, "eval_loss": 2.1731722354888916, "eval_runtime": 1110.3507, "eval_samples_per_second": 821.632, "eval_steps_per_second": 6.42, "step": 99000 }, { "epoch": 8.721216636718236, "grad_norm": 2.4506683349609375, "learning_rate": 3.982943694698685e-06, "loss": 2.3118, "step": 99500 }, { "epoch": 8.721216636718236, "eval_loss": 2.1729063987731934, "eval_runtime": 1118.1795, "eval_samples_per_second": 815.88, "eval_steps_per_second": 6.375, "step": 99500 }, { "epoch": 8.765043607836262, "grad_norm": 2.4486277103424072, "learning_rate": 3.7964611189707232e-06, "loss": 2.3173, "step": 100000 }, { "epoch": 8.765043607836262, "eval_loss": 2.1726784706115723, "eval_runtime": 1115.9142, "eval_samples_per_second": 817.536, "eval_steps_per_second": 6.388, "step": 100000 }, { "epoch": 8.808870578954288, "grad_norm": 2.706360101699829, "learning_rate": 3.6140902571372566e-06, "loss": 2.3151, "step": 100500 }, { "epoch": 8.808870578954288, "eval_loss": 2.1703412532806396, "eval_runtime": 1115.5437, "eval_samples_per_second": 817.807, "eval_steps_per_second": 6.39, "step": 100500 }, { "epoch": 8.852697550072314, "grad_norm": 2.563002824783325, "learning_rate": 3.4358664738989826e-06, "loss": 2.3156, "step": 101000 }, { "epoch": 8.852697550072314, "eval_loss": 2.1706130504608154, "eval_runtime": 1116.8512, "eval_samples_per_second": 816.85, "eval_steps_per_second": 6.382, "step": 101000 }, { "epoch": 8.89652452119034, "grad_norm": 2.505505084991455, "learning_rate": 3.2621682182145314e-06, "loss": 2.3138, "step": 101500 }, { "epoch": 8.89652452119034, "eval_loss": 2.1691839694976807, "eval_runtime": 1115.2901, "eval_samples_per_second": 817.993, "eval_steps_per_second": 6.391, "step": 101500 }, { "epoch": 8.940351492308366, "grad_norm": 2.6076018810272217, "learning_rate": 3.092332998903416e-06, "loss": 2.3075, "step": 102000 }, { "epoch": 8.940351492308366, "eval_loss": 2.1688640117645264, "eval_runtime": 1116.0259, "eval_samples_per_second": 817.454, "eval_steps_per_second": 6.387, "step": 102000 }, { "epoch": 8.984178463426392, "grad_norm": 2.394963502883911, "learning_rate": 2.92674603547588e-06, "loss": 2.3094, "step": 102500 }, { "epoch": 8.984178463426392, "eval_loss": 2.167738914489746, "eval_runtime": 1117.6939, "eval_samples_per_second": 816.234, "eval_steps_per_second": 6.377, "step": 102500 }, { "epoch": 9.027961607573301, "grad_norm": 2.570017099380493, "learning_rate": 2.765439437959516e-06, "loss": 2.3093, "step": 103000 }, { "epoch": 9.027961607573301, "eval_loss": 2.167351007461548, "eval_runtime": 1115.1044, "eval_samples_per_second": 818.13, "eval_steps_per_second": 6.392, "step": 103000 }, { "epoch": 9.071788578691327, "grad_norm": 2.3768527507781982, "learning_rate": 2.6087541528544814e-06, "loss": 2.3085, "step": 103500 }, { "epoch": 9.071788578691327, "eval_loss": 2.1665375232696533, "eval_runtime": 1115.0572, "eval_samples_per_second": 818.164, "eval_steps_per_second": 6.392, "step": 103500 }, { "epoch": 9.115615549809352, "grad_norm": 2.432450294494629, "learning_rate": 2.456092577040997e-06, "loss": 2.3129, "step": 104000 }, { "epoch": 9.115615549809352, "eval_loss": 2.166337490081787, "eval_runtime": 1114.9098, "eval_samples_per_second": 818.272, "eval_steps_per_second": 6.393, "step": 104000 }, { "epoch": 9.159442520927378, "grad_norm": 2.5620574951171875, "learning_rate": 2.307802634562267e-06, "loss": 2.301, "step": 104500 }, { "epoch": 9.159442520927378, "eval_loss": 2.164973258972168, "eval_runtime": 1114.9958, "eval_samples_per_second": 818.209, "eval_steps_per_second": 6.393, "step": 104500 }, { "epoch": 9.203269492045404, "grad_norm": 2.387254238128662, "learning_rate": 2.163913081269864e-06, "loss": 2.305, "step": 105000 }, { "epoch": 9.203269492045404, "eval_loss": 2.1658222675323486, "eval_runtime": 1114.9499, "eval_samples_per_second": 818.243, "eval_steps_per_second": 6.393, "step": 105000 }, { "epoch": 9.24709646316343, "grad_norm": 2.389944553375244, "learning_rate": 2.0247263046770465e-06, "loss": 2.304, "step": 105500 }, { "epoch": 9.24709646316343, "eval_loss": 2.1642627716064453, "eval_runtime": 1115.1438, "eval_samples_per_second": 818.101, "eval_steps_per_second": 6.392, "step": 105500 }, { "epoch": 9.290923434281456, "grad_norm": 2.293623924255371, "learning_rate": 1.8897114415833084e-06, "loss": 2.3042, "step": 106000 }, { "epoch": 9.290923434281456, "eval_loss": 2.1653385162353516, "eval_runtime": 1115.2546, "eval_samples_per_second": 818.019, "eval_steps_per_second": 6.391, "step": 106000 }, { "epoch": 9.334750405399483, "grad_norm": 2.4690089225769043, "learning_rate": 1.7594346197419676e-06, "loss": 2.3025, "step": 106500 }, { "epoch": 9.334750405399483, "eval_loss": 2.1647329330444336, "eval_runtime": 1114.9105, "eval_samples_per_second": 818.272, "eval_steps_per_second": 6.393, "step": 106500 }, { "epoch": 9.378577376517509, "grad_norm": 2.4114248752593994, "learning_rate": 1.6333989588294241e-06, "loss": 2.3024, "step": 107000 }, { "epoch": 9.378577376517509, "eval_loss": 2.16414737701416, "eval_runtime": 1116.7856, "eval_samples_per_second": 816.898, "eval_steps_per_second": 6.383, "step": 107000 }, { "epoch": 9.422404347635535, "grad_norm": 2.6006863117218018, "learning_rate": 1.5118944650351159e-06, "loss": 2.3087, "step": 107500 }, { "epoch": 9.422404347635535, "eval_loss": 2.1635189056396484, "eval_runtime": 1114.9278, "eval_samples_per_second": 818.259, "eval_steps_per_second": 6.393, "step": 107500 }, { "epoch": 9.466231318753561, "grad_norm": 2.226339340209961, "learning_rate": 1.3949447000728782e-06, "loss": 2.3026, "step": 108000 }, { "epoch": 9.466231318753561, "eval_loss": 2.1628293991088867, "eval_runtime": 1115.569, "eval_samples_per_second": 817.789, "eval_steps_per_second": 6.39, "step": 108000 }, { "epoch": 9.510058289871587, "grad_norm": 2.69002628326416, "learning_rate": 1.2825723424199298e-06, "loss": 2.2984, "step": 108500 }, { "epoch": 9.510058289871587, "eval_loss": 2.163651466369629, "eval_runtime": 1115.1272, "eval_samples_per_second": 818.113, "eval_steps_per_second": 6.392, "step": 108500 }, { "epoch": 9.553885260989613, "grad_norm": 2.3326609134674072, "learning_rate": 1.1750101251986112e-06, "loss": 2.3027, "step": 109000 }, { "epoch": 9.553885260989613, "eval_loss": 2.163642168045044, "eval_runtime": 1114.6312, "eval_samples_per_second": 818.477, "eval_steps_per_second": 6.395, "step": 109000 }, { "epoch": 9.59771223210764, "grad_norm": 2.569121837615967, "learning_rate": 1.0718478023763245e-06, "loss": 2.3049, "step": 109500 }, { "epoch": 9.59771223210764, "eval_loss": 2.1620688438415527, "eval_runtime": 1114.7646, "eval_samples_per_second": 818.379, "eval_steps_per_second": 6.394, "step": 109500 }, { "epoch": 9.641539203225665, "grad_norm": 2.3418686389923096, "learning_rate": 9.733255406500857e-07, "loss": 2.3032, "step": 110000 }, { "epoch": 9.641539203225665, "eval_loss": 2.1615049839019775, "eval_runtime": 1114.9932, "eval_samples_per_second": 818.211, "eval_steps_per_second": 6.393, "step": 110000 }, { "epoch": 9.685366174343692, "grad_norm": 2.477689504623413, "learning_rate": 8.794624451020555e-07, "loss": 2.3032, "step": 110500 }, { "epoch": 9.685366174343692, "eval_loss": 2.161015510559082, "eval_runtime": 1116.4235, "eval_samples_per_second": 817.163, "eval_steps_per_second": 6.385, "step": 110500 }, { "epoch": 9.729193145461718, "grad_norm": 2.637300729751587, "learning_rate": 7.90276717325672e-07, "loss": 2.3049, "step": 111000 }, { "epoch": 9.729193145461718, "eval_loss": 2.162550210952759, "eval_runtime": 1114.8952, "eval_samples_per_second": 818.283, "eval_steps_per_second": 6.393, "step": 111000 }, { "epoch": 9.773020116579744, "grad_norm": 2.375706672668457, "learning_rate": 7.057856518960599e-07, "loss": 2.3014, "step": 111500 }, { "epoch": 9.773020116579744, "eval_loss": 2.161914587020874, "eval_runtime": 1116.0493, "eval_samples_per_second": 817.437, "eval_steps_per_second": 6.387, "step": 111500 }, { "epoch": 9.81684708769777, "grad_norm": 2.4037861824035645, "learning_rate": 6.261604809943755e-07, "loss": 2.3023, "step": 112000 }, { "epoch": 9.81684708769777, "eval_loss": 2.1608428955078125, "eval_runtime": 1116.2862, "eval_samples_per_second": 817.264, "eval_steps_per_second": 6.385, "step": 112000 }, { "epoch": 9.860674058815796, "grad_norm": 2.493039846420288, "learning_rate": 5.510975114530553e-07, "loss": 2.3028, "step": 112500 }, { "epoch": 9.860674058815796, "eval_loss": 2.160830497741699, "eval_runtime": 1116.2069, "eval_samples_per_second": 817.322, "eval_steps_per_second": 6.386, "step": 112500 }, { "epoch": 9.90450102993382, "grad_norm": 2.5063636302948, "learning_rate": 4.807755850286977e-07, "loss": 2.3019, "step": 113000 }, { "epoch": 9.90450102993382, "eval_loss": 2.1616785526275635, "eval_runtime": 1116.3136, "eval_samples_per_second": 817.243, "eval_steps_per_second": 6.385, "step": 113000 }, { "epoch": 9.948328001051847, "grad_norm": 2.589062213897705, "learning_rate": 4.1520833829600813e-07, "loss": 2.301, "step": 113500 }, { "epoch": 9.948328001051847, "eval_loss": 2.160351276397705, "eval_runtime": 1116.7915, "eval_samples_per_second": 816.894, "eval_steps_per_second": 6.383, "step": 113500 }, { "epoch": 9.992154972169873, "grad_norm": 2.4170777797698975, "learning_rate": 3.544084858193325e-07, "loss": 2.3032, "step": 114000 }, { "epoch": 9.992154972169873, "eval_loss": 2.159677743911743, "eval_runtime": 1116.6266, "eval_samples_per_second": 817.014, "eval_steps_per_second": 6.384, "step": 114000 }, { "epoch": 10.035938116316782, "grad_norm": 2.528834819793701, "learning_rate": 2.9838781768708193e-07, "loss": 2.2945, "step": 114500 }, { "epoch": 10.035938116316782, "eval_loss": 2.161219835281372, "eval_runtime": 1116.9968, "eval_samples_per_second": 816.744, "eval_steps_per_second": 6.381, "step": 114500 }, { "epoch": 10.079765087434808, "grad_norm": 2.3111424446105957, "learning_rate": 2.4715719722546714e-07, "loss": 2.2963, "step": 115000 }, { "epoch": 10.079765087434808, "eval_loss": 2.160301923751831, "eval_runtime": 1117.2058, "eval_samples_per_second": 816.591, "eval_steps_per_second": 6.38, "step": 115000 }, { "epoch": 10.123592058552834, "grad_norm": 2.635735034942627, "learning_rate": 2.0072655889189772e-07, "loss": 2.2986, "step": 115500 }, { "epoch": 10.123592058552834, "eval_loss": 2.1600496768951416, "eval_runtime": 1119.355, "eval_samples_per_second": 815.023, "eval_steps_per_second": 6.368, "step": 115500 }, { "epoch": 10.16741902967086, "grad_norm": 2.228825807571411, "learning_rate": 1.5918334476575646e-07, "loss": 2.2922, "step": 116000 }, { "epoch": 10.16741902967086, "eval_loss": 2.1609036922454834, "eval_runtime": 1158.2359, "eval_samples_per_second": 787.663, "eval_steps_per_second": 6.154, "step": 116000 }, { "epoch": 10.211246000788886, "grad_norm": 2.534865140914917, "learning_rate": 1.2236910758539055e-07, "loss": 2.3035, "step": 116500 }, { "epoch": 10.211246000788886, "eval_loss": 2.1614086627960205, "eval_runtime": 1211.6086, "eval_samples_per_second": 752.966, "eval_steps_per_second": 5.883, "step": 116500 }, { "epoch": 10.25507297190691, "grad_norm": 2.4144797325134277, "learning_rate": 9.043821229186567e-08, "loss": 2.302, "step": 117000 }, { "epoch": 10.25507297190691, "eval_loss": 2.15974760055542, "eval_runtime": 1113.7288, "eval_samples_per_second": 819.14, "eval_steps_per_second": 6.4, "step": 117000 }, { "epoch": 10.298899943024937, "grad_norm": 2.239013433456421, "learning_rate": 6.32688733414294e-08, "loss": 2.3009, "step": 117500 }, { "epoch": 10.298899943024937, "eval_loss": 2.160125494003296, "eval_runtime": 2061.4838, "eval_samples_per_second": 442.545, "eval_steps_per_second": 3.458, "step": 117500 }, { "epoch": 10.342726914142963, "grad_norm": 2.6488566398620605, "learning_rate": 4.093517548052761e-08, "loss": 2.2942, "step": 118000 }, { "epoch": 10.342726914142963, "eval_loss": 2.160935163497925, "eval_runtime": 1218.013, "eval_samples_per_second": 749.007, "eval_steps_per_second": 5.852, "step": 118000 }, { "epoch": 10.386553885260989, "grad_norm": 2.3960371017456055, "learning_rate": 2.3441449579411632e-08, "loss": 2.3022, "step": 118500 }, { "epoch": 10.386553885260989, "eval_loss": 2.1597461700439453, "eval_runtime": 1294.5854, "eval_samples_per_second": 704.704, "eval_steps_per_second": 5.506, "step": 118500 }, { "epoch": 10.430380856379015, "grad_norm": 2.5293331146240234, "learning_rate": 1.0791087958400558e-08, "loss": 2.2948, "step": 119000 }, { "epoch": 10.430380856379015, "eval_loss": 2.159837245941162, "eval_runtime": 1253.9955, "eval_samples_per_second": 727.515, "eval_steps_per_second": 5.684, "step": 119000 }, { "epoch": 10.474207827497041, "grad_norm": 2.4509096145629883, "learning_rate": 2.9865437300630185e-09, "loss": 2.3045, "step": 119500 }, { "epoch": 10.474207827497041, "eval_loss": 2.1594982147216797, "eval_runtime": 1207.0311, "eval_samples_per_second": 755.821, "eval_steps_per_second": 5.905, "step": 119500 }, { "epoch": 10.518034798615068, "grad_norm": 2.336444616317749, "learning_rate": 2.933032350604936e-11, "loss": 2.2978, "step": 120000 }, { "epoch": 10.518034798615068, "eval_loss": 2.161297559738159, "eval_runtime": 1191.92, "eval_samples_per_second": 765.404, "eval_steps_per_second": 5.98, "step": 120000 } ], "logging_steps": 500, "max_steps": 120000, "num_input_tokens_seen": 0, "num_train_epochs": 11, "save_steps": 3000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 7.295615807101338e+18, "train_batch_size": 16, "trial_name": null, "trial_params": null }