DA-BERT_Old_News_V3 / trainer_state.json
SirMappel's picture
Upload folder using huggingface_hub
3689d1b verified
Raw History Blame
95.1 kB
{
"best_global_step": 119500,
"best_metric": 2.1594982147216797,
"best_model_checkpoint": "/work/Ccp-OldNewsBERT_2024/modelling/V3/models/ON-BERT-v3/checkpoint-114000",
"epoch": 10.518034798615068,
"eval_steps": 500,
"global_step": 120000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.04384138188035687,
"grad_norm": 2.0762226581573486,
"learning_rate": 7.261835184102864e-06,
"loss": 7.284,
"step": 500
},
{
"epoch": 0.04384138188035687,
"eval_loss": 6.594050407409668,
"eval_runtime": 1189.5449,
"eval_samples_per_second": 767.907,
"eval_steps_per_second": 6.0,
"step": 500
},
{
"epoch": 0.08768276376071374,
"grad_norm": 2.374856948852539,
"learning_rate": 1.456750438340152e-05,
"loss": 6.3875,
"step": 1000
},
{
"epoch": 0.08768276376071374,
"eval_loss": 6.055078983306885,
"eval_runtime": 1120.4784,
"eval_samples_per_second": 815.241,
"eval_steps_per_second": 6.37,
"step": 1000
},
{
"epoch": 0.1315241456410706,
"grad_norm": 2.779784679412842,
"learning_rate": 2.1873173582700177e-05,
"loss": 5.9379,
"step": 1500
},
{
"epoch": 0.1315241456410706,
"eval_loss": 5.654895782470703,
"eval_runtime": 1119.543,
"eval_samples_per_second": 815.922,
"eval_steps_per_second": 6.375,
"step": 1500
},
{
"epoch": 0.17536552752142748,
"grad_norm": 2.636847734451294,
"learning_rate": 2.9178842781998832e-05,
"loss": 5.5704,
"step": 2000
},
{
"epoch": 0.17536552752142748,
"eval_loss": 5.318906784057617,
"eval_runtime": 1119.4192,
"eval_samples_per_second": 816.012,
"eval_steps_per_second": 6.376,
"step": 2000
},
{
"epoch": 0.21920690940178433,
"grad_norm": 2.580691337585449,
"learning_rate": 3.6484511981297484e-05,
"loss": 5.2707,
"step": 2500
},
{
"epoch": 0.21920690940178433,
"eval_loss": 5.011192798614502,
"eval_runtime": 1119.4613,
"eval_samples_per_second": 815.982,
"eval_steps_per_second": 6.375,
"step": 2500
},
{
"epoch": 0.2630482912821412,
"grad_norm": 2.647657632827759,
"learning_rate": 4.3790181180596146e-05,
"loss": 4.9931,
"step": 3000
},
{
"epoch": 0.2630482912821412,
"eval_loss": 4.747901439666748,
"eval_runtime": 1119.0922,
"eval_samples_per_second": 816.251,
"eval_steps_per_second": 6.377,
"step": 3000
},
{
"epoch": 0.3068896731624981,
"grad_norm": 2.7811145782470703,
"learning_rate": 4.9999758434773725e-05,
"loss": 4.7425,
"step": 3500
},
{
"epoch": 0.3068896731624981,
"eval_loss": 4.489400386810303,
"eval_runtime": 1118.9351,
"eval_samples_per_second": 816.365,
"eval_steps_per_second": 6.378,
"step": 3500
},
{
"epoch": 0.35073105504285496,
"grad_norm": 3.108778238296509,
"learning_rate": 4.9985802653912495e-05,
"loss": 4.5162,
"step": 4000
},
{
"epoch": 0.35073105504285496,
"eval_loss": 4.267147541046143,
"eval_runtime": 1118.9526,
"eval_samples_per_second": 816.353,
"eval_steps_per_second": 6.378,
"step": 4000
},
{
"epoch": 0.3945724369232118,
"grad_norm": 2.7255427837371826,
"learning_rate": 4.99503881039902e-05,
"loss": 4.3143,
"step": 4500
},
{
"epoch": 0.3945724369232118,
"eval_loss": 4.085505485534668,
"eval_runtime": 1118.7877,
"eval_samples_per_second": 816.473,
"eval_steps_per_second": 6.379,
"step": 4500
},
{
"epoch": 0.43841381880356867,
"grad_norm": 2.7449190616607666,
"learning_rate": 4.9893545200385473e-05,
"loss": 4.1497,
"step": 5000
},
{
"epoch": 0.43841381880356867,
"eval_loss": 3.9280543327331543,
"eval_runtime": 1118.8813,
"eval_samples_per_second": 816.405,
"eval_steps_per_second": 6.379,
"step": 5000
},
{
"epoch": 0.4822552006839256,
"grad_norm": 2.4749231338500977,
"learning_rate": 4.98153227619719e-05,
"loss": 4.0239,
"step": 5500
},
{
"epoch": 0.4822552006839256,
"eval_loss": 3.8047330379486084,
"eval_runtime": 1118.3431,
"eval_samples_per_second": 816.798,
"eval_steps_per_second": 6.382,
"step": 5500
},
{
"epoch": 0.5260965825642824,
"grad_norm": 2.549381971359253,
"learning_rate": 4.9715787969190494e-05,
"loss": 3.8983,
"step": 6000
},
{
"epoch": 0.5260965825642824,
"eval_loss": 3.7011477947235107,
"eval_runtime": 1118.3893,
"eval_samples_per_second": 816.764,
"eval_steps_per_second": 6.381,
"step": 6000
},
{
"epoch": 0.5699379644446393,
"grad_norm": 2.57206392288208,
"learning_rate": 4.9595026306352545e-05,
"loss": 3.7955,
"step": 6500
},
{
"epoch": 0.5699379644446393,
"eval_loss": 3.610187292098999,
"eval_runtime": 1121.1876,
"eval_samples_per_second": 814.725,
"eval_steps_per_second": 6.366,
"step": 6500
},
{
"epoch": 0.6137793463249962,
"grad_norm": 2.4346706867218018,
"learning_rate": 4.9453141488222386e-05,
"loss": 3.7212,
"step": 7000
},
{
"epoch": 0.6137793463249962,
"eval_loss": 3.527937650680542,
"eval_runtime": 1118.9709,
"eval_samples_per_second": 816.339,
"eval_steps_per_second": 6.378,
"step": 7000
},
{
"epoch": 0.657620728205353,
"grad_norm": 2.7278873920440674,
"learning_rate": 4.9290255370943214e-05,
"loss": 3.6375,
"step": 7500
},
{
"epoch": 0.657620728205353,
"eval_loss": 3.4597597122192383,
"eval_runtime": 1118.6558,
"eval_samples_per_second": 816.569,
"eval_steps_per_second": 6.38,
"step": 7500
},
{
"epoch": 0.7014621100857099,
"grad_norm": 2.576530933380127,
"learning_rate": 4.9106507847382264e-05,
"loss": 3.5737,
"step": 8000
},
{
"epoch": 0.7014621100857099,
"eval_loss": 3.3990399837493896,
"eval_runtime": 1117.9215,
"eval_samples_per_second": 817.106,
"eval_steps_per_second": 6.384,
"step": 8000
},
{
"epoch": 0.7453034919660668,
"grad_norm": 2.8216257095336914,
"learning_rate": 4.890205672698551e-05,
"loss": 3.5174,
"step": 8500
},
{
"epoch": 0.7453034919660668,
"eval_loss": 3.3402609825134277,
"eval_runtime": 1118.1279,
"eval_samples_per_second": 816.955,
"eval_steps_per_second": 6.383,
"step": 8500
},
{
"epoch": 0.7891448738464236,
"grad_norm": 2.7017734050750732,
"learning_rate": 4.867707760024478e-05,
"loss": 3.4576,
"step": 9000
},
{
"epoch": 0.7891448738464236,
"eval_loss": 3.289719343185425,
"eval_runtime": 1118.6616,
"eval_samples_per_second": 816.565,
"eval_steps_per_second": 6.38,
"step": 9000
},
{
"epoch": 0.8329862557267805,
"grad_norm": 2.7902138233184814,
"learning_rate": 4.8431763687893906e-05,
"loss": 3.4069,
"step": 9500
},
{
"epoch": 0.8329862557267805,
"eval_loss": 3.2430062294006348,
"eval_runtime": 1118.3313,
"eval_samples_per_second": 816.806,
"eval_steps_per_second": 6.382,
"step": 9500
},
{
"epoch": 0.8768276376071373,
"grad_norm": 2.3764052391052246,
"learning_rate": 4.816632567496333e-05,
"loss": 3.3561,
"step": 10000
},
{
"epoch": 0.8768276376071373,
"eval_loss": 3.2007126808166504,
"eval_runtime": 1118.051,
"eval_samples_per_second": 817.011,
"eval_steps_per_second": 6.383,
"step": 10000
},
{
"epoch": 0.9206690194874942,
"grad_norm": 2.8324801921844482,
"learning_rate": 4.788158189440955e-05,
"loss": 3.3162,
"step": 10500
},
{
"epoch": 0.9206690194874942,
"eval_loss": 3.1551382541656494,
"eval_runtime": 1118.4175,
"eval_samples_per_second": 816.743,
"eval_steps_per_second": 6.381,
"step": 10500
},
{
"epoch": 0.9645104013678512,
"grad_norm": 2.599917411804199,
"learning_rate": 4.757663571936409e-05,
"loss": 3.2779,
"step": 11000
},
{
"epoch": 0.9645104013678512,
"eval_loss": 3.1158318519592285,
"eval_runtime": 1117.751,
"eval_samples_per_second": 817.23,
"eval_steps_per_second": 6.385,
"step": 11000
},
{
"epoch": 1.0084175453210285,
"grad_norm": 2.661496162414551,
"learning_rate": 4.7252299860553496e-05,
"loss": 3.2427,
"step": 11500
},
{
"epoch": 1.0084175453210285,
"eval_loss": 3.0812768936157227,
"eval_runtime": 1118.2372,
"eval_samples_per_second": 816.875,
"eval_steps_per_second": 6.382,
"step": 11500
},
{
"epoch": 1.0522589272013854,
"grad_norm": 2.5920369625091553,
"learning_rate": 4.690885287009749e-05,
"loss": 3.2009,
"step": 12000
},
{
"epoch": 1.0522589272013854,
"eval_loss": 3.045903444290161,
"eval_runtime": 1117.9755,
"eval_samples_per_second": 817.066,
"eval_steps_per_second": 6.384,
"step": 12000
},
{
"epoch": 1.0961003090817423,
"grad_norm": 2.541583299636841,
"learning_rate": 4.654733281420752e-05,
"loss": 3.1746,
"step": 12500
},
{
"epoch": 1.0961003090817423,
"eval_loss": 3.0118284225463867,
"eval_runtime": 1119.6853,
"eval_samples_per_second": 815.818,
"eval_steps_per_second": 6.374,
"step": 12500
},
{
"epoch": 1.1399416909620992,
"grad_norm": 2.3801028728485107,
"learning_rate": 4.6166601305962655e-05,
"loss": 3.1391,
"step": 13000
},
{
"epoch": 1.1399416909620992,
"eval_loss": 2.9807887077331543,
"eval_runtime": 1117.6385,
"eval_samples_per_second": 817.313,
"eval_steps_per_second": 6.386,
"step": 13000
},
{
"epoch": 1.183783072842456,
"grad_norm": 2.356208562850952,
"learning_rate": 4.576769110578126e-05,
"loss": 3.1054,
"step": 13500
},
{
"epoch": 1.183783072842456,
"eval_loss": 2.9562630653381348,
"eval_runtime": 1117.9985,
"eval_samples_per_second": 817.049,
"eval_steps_per_second": 6.384,
"step": 13500
},
{
"epoch": 1.2276244547228128,
"grad_norm": 2.4931366443634033,
"learning_rate": 4.535094481309793e-05,
"loss": 3.082,
"step": 14000
},
{
"epoch": 1.2276244547228128,
"eval_loss": 2.927985429763794,
"eval_runtime": 1118.2717,
"eval_samples_per_second": 816.85,
"eval_steps_per_second": 6.382,
"step": 14000
},
{
"epoch": 1.2714658366031697,
"grad_norm": 2.264676094055176,
"learning_rate": 4.4917605992417254e-05,
"loss": 3.0559,
"step": 14500
},
{
"epoch": 1.2714658366031697,
"eval_loss": 2.9001705646514893,
"eval_runtime": 1118.531,
"eval_samples_per_second": 816.66,
"eval_steps_per_second": 6.381,
"step": 14500
},
{
"epoch": 1.3153072184835266,
"grad_norm": 2.7281758785247803,
"learning_rate": 4.4467229515780716e-05,
"loss": 3.0363,
"step": 15000
},
{
"epoch": 1.3153072184835266,
"eval_loss": 2.877182960510254,
"eval_runtime": 1118.2684,
"eval_samples_per_second": 816.852,
"eval_steps_per_second": 6.382,
"step": 15000
},
{
"epoch": 1.3591486003638835,
"grad_norm": 2.4086153507232666,
"learning_rate": 4.3999248254794173e-05,
"loss": 3.0034,
"step": 15500
},
{
"epoch": 1.3591486003638835,
"eval_loss": 2.858940839767456,
"eval_runtime": 1118.6587,
"eval_samples_per_second": 816.567,
"eval_steps_per_second": 6.38,
"step": 15500
},
{
"epoch": 1.4029899822442404,
"grad_norm": 2.3999428749084473,
"learning_rate": 4.351494970809619e-05,
"loss": 2.9863,
"step": 16000
},
{
"epoch": 1.4029899822442404,
"eval_loss": 2.829259157180786,
"eval_runtime": 1118.2831,
"eval_samples_per_second": 816.841,
"eval_steps_per_second": 6.382,
"step": 16000
},
{
"epoch": 1.4468313641245971,
"grad_norm": 2.684216022491455,
"learning_rate": 4.301474980992007e-05,
"loss": 2.9554,
"step": 16500
},
{
"epoch": 1.4468313641245971,
"eval_loss": 2.811227560043335,
"eval_runtime": 1118.6502,
"eval_samples_per_second": 816.573,
"eval_steps_per_second": 6.38,
"step": 16500
},
{
"epoch": 1.490672746004954,
"grad_norm": 2.5561940670013428,
"learning_rate": 4.2499078151191824e-05,
"loss": 2.9428,
"step": 17000
},
{
"epoch": 1.490672746004954,
"eval_loss": 2.789614200592041,
"eval_runtime": 1118.5002,
"eval_samples_per_second": 816.683,
"eval_steps_per_second": 6.381,
"step": 17000
},
{
"epoch": 1.534514127885311,
"grad_norm": 2.4294307231903076,
"learning_rate": 4.196837761058097e-05,
"loss": 2.9133,
"step": 17500
},
{
"epoch": 1.534514127885311,
"eval_loss": 2.7667744159698486,
"eval_runtime": 1119.3799,
"eval_samples_per_second": 816.041,
"eval_steps_per_second": 6.376,
"step": 17500
},
{
"epoch": 1.5783555097656679,
"grad_norm": 2.2849645614624023,
"learning_rate": 4.142310397413924e-05,
"loss": 2.9016,
"step": 18000
},
{
"epoch": 1.5783555097656679,
"eval_loss": 2.747105836868286,
"eval_runtime": 1118.1926,
"eval_samples_per_second": 816.908,
"eval_steps_per_second": 6.383,
"step": 18000
},
{
"epoch": 1.6221968916460248,
"grad_norm": 2.693436622619629,
"learning_rate": 4.086372554385406e-05,
"loss": 2.8805,
"step": 18500
},
{
"epoch": 1.6221968916460248,
"eval_loss": 2.7286176681518555,
"eval_runtime": 1118.2866,
"eval_samples_per_second": 816.839,
"eval_steps_per_second": 6.382,
"step": 18500
},
{
"epoch": 1.6660382735263815,
"grad_norm": 2.6212801933288574,
"learning_rate": 4.029188201301087e-05,
"loss": 2.8591,
"step": 19000
},
{
"epoch": 1.6660382735263815,
"eval_loss": 2.7152278423309326,
"eval_runtime": 1497.2315,
"eval_samples_per_second": 610.099,
"eval_steps_per_second": 4.767,
"step": 19000
},
{
"epoch": 1.7098796554067386,
"grad_norm": 2.575929880142212,
"learning_rate": 3.9705772709182955e-05,
"loss": 2.8453,
"step": 19500
},
{
"epoch": 1.7098796554067386,
"eval_loss": 2.700686454772949,
"eval_runtime": 2157.4613,
"eval_samples_per_second": 423.396,
"eval_steps_per_second": 3.308,
"step": 19500
},
{
"epoch": 1.7537210372870953,
"grad_norm": 2.335934638977051,
"learning_rate": 3.910703352170464e-05,
"loss": 2.837,
"step": 20000
},
{
"epoch": 1.7537210372870953,
"eval_loss": 2.6829771995544434,
"eval_runtime": 2034.4811,
"eval_samples_per_second": 448.989,
"eval_steps_per_second": 3.508,
"step": 20000
},
{
"epoch": 1.7975624191674522,
"grad_norm": 2.378584146499634,
"learning_rate": 3.8496178670836514e-05,
"loss": 2.8044,
"step": 20500
},
{
"epoch": 1.7975624191674522,
"eval_loss": 2.6625845432281494,
"eval_runtime": 1120.1353,
"eval_samples_per_second": 815.491,
"eval_steps_per_second": 6.372,
"step": 20500
},
{
"epoch": 1.841403801047809,
"grad_norm": 2.4612674713134766,
"learning_rate": 3.787498888816347e-05,
"loss": 2.8002,
"step": 21000
},
{
"epoch": 1.841403801047809,
"eval_loss": 2.6464881896972656,
"eval_runtime": 1126.8521,
"eval_samples_per_second": 810.63,
"eval_steps_per_second": 6.334,
"step": 21000
},
{
"epoch": 1.8852451829281658,
"grad_norm": 2.6136703491210938,
"learning_rate": 3.724150811533548e-05,
"loss": 2.7825,
"step": 21500
},
{
"epoch": 1.8852451829281658,
"eval_loss": 2.6333353519439697,
"eval_runtime": 1263.6812,
"eval_samples_per_second": 722.856,
"eval_steps_per_second": 5.648,
"step": 21500
},
{
"epoch": 1.929086564808523,
"grad_norm": 2.4944891929626465,
"learning_rate": 3.6597513864143615e-05,
"loss": 2.7675,
"step": 22000
},
{
"epoch": 1.929086564808523,
"eval_loss": 2.617983818054199,
"eval_runtime": 1248.4456,
"eval_samples_per_second": 731.678,
"eval_steps_per_second": 5.717,
"step": 22000
},
{
"epoch": 1.9729279466888796,
"grad_norm": 2.3364956378936768,
"learning_rate": 3.5943559221639114e-05,
"loss": 2.7505,
"step": 22500
},
{
"epoch": 1.9729279466888796,
"eval_loss": 2.6033763885498047,
"eval_runtime": 1217.4556,
"eval_samples_per_second": 750.303,
"eval_steps_per_second": 5.862,
"step": 22500
},
{
"epoch": 2.016835090642057,
"grad_norm": 2.4662578105926514,
"learning_rate": 3.5281541538602945e-05,
"loss": 2.7397,
"step": 23000
},
{
"epoch": 2.016835090642057,
"eval_loss": 2.5903615951538086,
"eval_runtime": 1253.7584,
"eval_samples_per_second": 728.577,
"eval_steps_per_second": 5.692,
"step": 23000
},
{
"epoch": 2.060676472522414,
"grad_norm": 2.368075370788574,
"learning_rate": 3.460937619411428e-05,
"loss": 2.7161,
"step": 23500
},
{
"epoch": 2.060676472522414,
"eval_loss": 2.579867362976074,
"eval_runtime": 1116.1318,
"eval_samples_per_second": 818.416,
"eval_steps_per_second": 6.394,
"step": 23500
},
{
"epoch": 2.1045178544027707,
"grad_norm": 2.3490450382232666,
"learning_rate": 3.392895794747047e-05,
"loss": 2.7133,
"step": 24000
},
{
"epoch": 2.1045178544027707,
"eval_loss": 2.566068649291992,
"eval_runtime": 1187.4579,
"eval_samples_per_second": 769.257,
"eval_steps_per_second": 6.01,
"step": 24000
},
{
"epoch": 2.1483592362831274,
"grad_norm": 2.431868076324463,
"learning_rate": 3.324087116805208e-05,
"loss": 2.7004,
"step": 24500
},
{
"epoch": 2.1483592362831274,
"eval_loss": 2.5521492958068848,
"eval_runtime": 1214.5781,
"eval_samples_per_second": 752.08,
"eval_steps_per_second": 5.876,
"step": 24500
},
{
"epoch": 2.1922006181634845,
"grad_norm": 2.526017665863037,
"learning_rate": 3.254710380753827e-05,
"loss": 2.685,
"step": 25000
},
{
"epoch": 2.1922006181634845,
"eval_loss": 2.5438075065612793,
"eval_runtime": 1165.0991,
"eval_samples_per_second": 784.019,
"eval_steps_per_second": 6.126,
"step": 25000
},
{
"epoch": 2.2360420000438412,
"grad_norm": 2.22011661529541,
"learning_rate": 3.184547126876346e-05,
"loss": 2.6741,
"step": 25500
},
{
"epoch": 2.2360420000438412,
"eval_loss": 2.5303306579589844,
"eval_runtime": 1121.7956,
"eval_samples_per_second": 814.284,
"eval_steps_per_second": 6.362,
"step": 25500
},
{
"epoch": 2.2798833819241984,
"grad_norm": 2.376256227493286,
"learning_rate": 3.113795957577035e-05,
"loss": 2.6677,
"step": 26000
},
{
"epoch": 2.2798833819241984,
"eval_loss": 2.5202553272247314,
"eval_runtime": 1164.241,
"eval_samples_per_second": 784.597,
"eval_steps_per_second": 6.13,
"step": 26000
},
{
"epoch": 2.323724763804555,
"grad_norm": 2.520549774169922,
"learning_rate": 3.0425176366834078e-05,
"loss": 2.6527,
"step": 26500
},
{
"epoch": 2.323724763804555,
"eval_loss": 2.5118391513824463,
"eval_runtime": 1117.8696,
"eval_samples_per_second": 817.144,
"eval_steps_per_second": 6.384,
"step": 26500
},
{
"epoch": 2.367566145684912,
"grad_norm": 2.346203088760376,
"learning_rate": 2.9709172933827506e-05,
"loss": 2.6446,
"step": 27000
},
{
"epoch": 2.367566145684912,
"eval_loss": 2.500302314758301,
"eval_runtime": 1118.1231,
"eval_samples_per_second": 816.958,
"eval_steps_per_second": 6.383,
"step": 27000
},
{
"epoch": 2.411407527565269,
"grad_norm": 2.496829032897949,
"learning_rate": 2.8989141242188162e-05,
"loss": 2.6341,
"step": 27500
},
{
"epoch": 2.411407527565269,
"eval_loss": 2.489889621734619,
"eval_runtime": 1122.3441,
"eval_samples_per_second": 813.886,
"eval_steps_per_second": 6.359,
"step": 27500
},
{
"epoch": 2.4552489094456256,
"grad_norm": 2.41103458404541,
"learning_rate": 2.8264244412463785e-05,
"loss": 2.6232,
"step": 28000
},
{
"epoch": 2.4552489094456256,
"eval_loss": 2.4814670085906982,
"eval_runtime": 1125.6467,
"eval_samples_per_second": 811.498,
"eval_steps_per_second": 6.34,
"step": 28000
},
{
"epoch": 2.4990902913259827,
"grad_norm": 2.389714002609253,
"learning_rate": 2.7536544123992213e-05,
"loss": 2.613,
"step": 28500
},
{
"epoch": 2.4990902913259827,
"eval_loss": 2.4698662757873535,
"eval_runtime": 1121.0461,
"eval_samples_per_second": 814.828,
"eval_steps_per_second": 6.366,
"step": 28500
},
{
"epoch": 2.5429316732063394,
"grad_norm": 2.2877752780914307,
"learning_rate": 2.6806665353791482e-05,
"loss": 2.6081,
"step": 29000
},
{
"epoch": 2.5429316732063394,
"eval_loss": 2.464000940322876,
"eval_runtime": 1125.4557,
"eval_samples_per_second": 811.636,
"eval_steps_per_second": 6.341,
"step": 29000
},
{
"epoch": 2.586773055086696,
"grad_norm": 2.5879504680633545,
"learning_rate": 2.607523494984359e-05,
"loss": 2.6025,
"step": 29500
},
{
"epoch": 2.586773055086696,
"eval_loss": 2.455082654953003,
"eval_runtime": 1121.345,
"eval_samples_per_second": 814.611,
"eval_steps_per_second": 6.365,
"step": 29500
},
{
"epoch": 2.630614436967053,
"grad_norm": 2.5052356719970703,
"learning_rate": 2.534288109273333e-05,
"loss": 2.5919,
"step": 30000
},
{
"epoch": 2.630614436967053,
"eval_loss": 2.4449410438537598,
"eval_runtime": 1123.293,
"eval_samples_per_second": 813.198,
"eval_steps_per_second": 6.354,
"step": 30000
},
{
"epoch": 2.67445581884741,
"grad_norm": 2.4013631343841553,
"learning_rate": 2.4610232756142613e-05,
"loss": 2.5741,
"step": 30500
},
{
"epoch": 2.67445581884741,
"eval_loss": 2.4410789012908936,
"eval_runtime": 1120.3934,
"eval_samples_per_second": 815.303,
"eval_steps_per_second": 6.37,
"step": 30500
},
{
"epoch": 2.718297200727767,
"grad_norm": 2.4138541221618652,
"learning_rate": 2.3877919166663655e-05,
"loss": 2.5773,
"step": 31000
},
{
"epoch": 2.718297200727767,
"eval_loss": 2.431831121444702,
"eval_runtime": 1118.5097,
"eval_samples_per_second": 816.676,
"eval_steps_per_second": 6.381,
"step": 31000
},
{
"epoch": 2.7621385826081237,
"grad_norm": 2.482076644897461,
"learning_rate": 2.3148030583765422e-05,
"loss": 2.5637,
"step": 31500
},
{
"epoch": 2.7621385826081237,
"eval_loss": 2.4250364303588867,
"eval_runtime": 1118.5592,
"eval_samples_per_second": 816.64,
"eval_steps_per_second": 6.381,
"step": 31500
},
{
"epoch": 2.805979964488481,
"grad_norm": 2.3182899951934814,
"learning_rate": 2.2418268668523143e-05,
"loss": 2.5642,
"step": 32000
},
{
"epoch": 2.805979964488481,
"eval_loss": 2.4183554649353027,
"eval_runtime": 1118.5188,
"eval_samples_per_second": 816.669,
"eval_steps_per_second": 6.381,
"step": 32000
},
{
"epoch": 2.8498213463688375,
"grad_norm": 2.3466103076934814,
"learning_rate": 2.169072404352314e-05,
"loss": 2.5513,
"step": 32500
},
{
"epoch": 2.8498213463688375,
"eval_loss": 2.4129860401153564,
"eval_runtime": 1118.2998,
"eval_samples_per_second": 816.829,
"eval_steps_per_second": 6.382,
"step": 32500
},
{
"epoch": 2.8936627282491942,
"grad_norm": 2.474790096282959,
"learning_rate": 2.096602155209367e-05,
"loss": 2.5473,
"step": 33000
},
{
"epoch": 2.8936627282491942,
"eval_loss": 2.404020309448242,
"eval_runtime": 1117.9989,
"eval_samples_per_second": 817.049,
"eval_steps_per_second": 6.384,
"step": 33000
},
{
"epoch": 2.9375041101295514,
"grad_norm": 2.6245903968811035,
"learning_rate": 2.024622220267145e-05,
"loss": 2.5466,
"step": 33500
},
{
"epoch": 2.9375041101295514,
"eval_loss": 2.397976875305176,
"eval_runtime": 1117.8697,
"eval_samples_per_second": 817.144,
"eval_steps_per_second": 6.384,
"step": 33500
},
{
"epoch": 2.981345492009908,
"grad_norm": 2.452371120452881,
"learning_rate": 1.9529059426219034e-05,
"loss": 2.5425,
"step": 34000
},
{
"epoch": 2.981345492009908,
"eval_loss": 2.3942997455596924,
"eval_runtime": 1117.9055,
"eval_samples_per_second": 817.117,
"eval_steps_per_second": 6.384,
"step": 34000
},
{
"epoch": 3.0252526359630854,
"grad_norm": 2.3234288692474365,
"learning_rate": 1.8816595304116282e-05,
"loss": 2.5303,
"step": 34500
},
{
"epoch": 3.0252526359630854,
"eval_loss": 2.386817216873169,
"eval_runtime": 1117.5393,
"eval_samples_per_second": 817.385,
"eval_steps_per_second": 6.386,
"step": 34500
},
{
"epoch": 3.0690940178434425,
"grad_norm": 2.3618667125701904,
"learning_rate": 1.8109441727975086e-05,
"loss": 2.5211,
"step": 35000
},
{
"epoch": 3.0690940178434425,
"eval_loss": 2.3825838565826416,
"eval_runtime": 1117.688,
"eval_samples_per_second": 817.276,
"eval_steps_per_second": 6.386,
"step": 35000
},
{
"epoch": 3.112935399723799,
"grad_norm": 2.662584066390991,
"learning_rate": 1.7409602192670955e-05,
"loss": 2.5119,
"step": 35500
},
{
"epoch": 3.112935399723799,
"eval_loss": 2.3771533966064453,
"eval_runtime": 1117.3971,
"eval_samples_per_second": 817.489,
"eval_steps_per_second": 6.387,
"step": 35500
},
{
"epoch": 3.1567767816041563,
"grad_norm": 2.3066375255584717,
"learning_rate": 1.6714872980427282e-05,
"loss": 2.5066,
"step": 36000
},
{
"epoch": 3.1567767816041563,
"eval_loss": 2.370797872543335,
"eval_runtime": 1117.258,
"eval_samples_per_second": 817.591,
"eval_steps_per_second": 6.388,
"step": 36000
},
{
"epoch": 3.200618163484513,
"grad_norm": 2.282196283340454,
"learning_rate": 1.6027259354175276e-05,
"loss": 2.5097,
"step": 36500
},
{
"epoch": 3.200618163484513,
"eval_loss": 2.3679802417755127,
"eval_runtime": 1117.3536,
"eval_samples_per_second": 817.521,
"eval_steps_per_second": 6.387,
"step": 36500
},
{
"epoch": 3.2444595453648697,
"grad_norm": 2.28078556060791,
"learning_rate": 1.5348703597951843e-05,
"loss": 2.5014,
"step": 37000
},
{
"epoch": 3.2444595453648697,
"eval_loss": 2.359700918197632,
"eval_runtime": 1117.1139,
"eval_samples_per_second": 817.696,
"eval_steps_per_second": 6.389,
"step": 37000
},
{
"epoch": 3.288300927245227,
"grad_norm": 2.3221096992492676,
"learning_rate": 1.4677069014261374e-05,
"loss": 2.4898,
"step": 37500
},
{
"epoch": 3.288300927245227,
"eval_loss": 2.3578717708587646,
"eval_runtime": 1117.2315,
"eval_samples_per_second": 817.61,
"eval_steps_per_second": 6.388,
"step": 37500
},
{
"epoch": 3.3321423091255835,
"grad_norm": 2.2953991889953613,
"learning_rate": 1.4014300161046912e-05,
"loss": 2.4948,
"step": 38000
},
{
"epoch": 3.3321423091255835,
"eval_loss": 2.353087902069092,
"eval_runtime": 1117.3717,
"eval_samples_per_second": 817.508,
"eval_steps_per_second": 6.387,
"step": 38000
},
{
"epoch": 3.3759836910059406,
"grad_norm": 2.307751178741455,
"learning_rate": 1.3360966249710593e-05,
"loss": 2.4833,
"step": 38500
},
{
"epoch": 3.3759836910059406,
"eval_loss": 2.349313497543335,
"eval_runtime": 1117.4288,
"eval_samples_per_second": 817.466,
"eval_steps_per_second": 6.387,
"step": 38500
},
{
"epoch": 3.4198250728862973,
"grad_norm": 2.3358969688415527,
"learning_rate": 1.2717628388563296e-05,
"loss": 2.4851,
"step": 39000
},
{
"epoch": 3.4198250728862973,
"eval_loss": 2.3457424640655518,
"eval_runtime": 1117.3864,
"eval_samples_per_second": 817.497,
"eval_steps_per_second": 6.387,
"step": 39000
},
{
"epoch": 3.4636664547666545,
"grad_norm": 2.6708974838256836,
"learning_rate": 1.2084839100923225e-05,
"loss": 2.4832,
"step": 39500
},
{
"epoch": 3.4636664547666545,
"eval_loss": 2.341883420944214,
"eval_runtime": 1117.3341,
"eval_samples_per_second": 817.535,
"eval_steps_per_second": 6.388,
"step": 39500
},
{
"epoch": 3.507507836647011,
"grad_norm": 2.3781583309173584,
"learning_rate": 1.1463141850587639e-05,
"loss": 2.4728,
"step": 40000
},
{
"epoch": 3.507507836647011,
"eval_loss": 2.338205575942993,
"eval_runtime": 1117.3056,
"eval_samples_per_second": 817.556,
"eval_steps_per_second": 6.388,
"step": 40000
},
{
"epoch": 3.551349218527368,
"grad_norm": 2.3650519847869873,
"learning_rate": 1.0853070575085217e-05,
"loss": 2.4747,
"step": 40500
},
{
"epoch": 3.551349218527368,
"eval_loss": 2.3338863849639893,
"eval_runtime": 1117.5211,
"eval_samples_per_second": 817.398,
"eval_steps_per_second": 6.386,
"step": 40500
},
{
"epoch": 3.595190600407725,
"grad_norm": 2.5673470497131348,
"learning_rate": 1.0256332601077586e-05,
"loss": 2.4674,
"step": 41000
},
{
"epoch": 3.595190600407725,
"eval_loss": 2.3310675621032715,
"eval_runtime": 1117.5975,
"eval_samples_per_second": 817.343,
"eval_steps_per_second": 6.386,
"step": 41000
},
{
"epoch": 3.6390319822880817,
"grad_norm": 2.27545428276062,
"learning_rate": 9.671048866272692e-06,
"loss": 2.4676,
"step": 41500
},
{
"epoch": 3.6390319822880817,
"eval_loss": 2.328411102294922,
"eval_runtime": 1117.445,
"eval_samples_per_second": 817.454,
"eval_steps_per_second": 6.387,
"step": 41500
},
{
"epoch": 3.6828733641684384,
"grad_norm": 2.398531436920166,
"learning_rate": 9.098930224736293e-06,
"loss": 2.4607,
"step": 42000
},
{
"epoch": 3.6828733641684384,
"eval_loss": 2.3261964321136475,
"eval_runtime": 1117.1492,
"eval_samples_per_second": 817.671,
"eval_steps_per_second": 6.389,
"step": 42000
},
{
"epoch": 3.7267147460487955,
"grad_norm": 2.2593164443969727,
"learning_rate": 8.540468033979468e-06,
"loss": 2.4617,
"step": 42500
},
{
"epoch": 3.7267147460487955,
"eval_loss": 2.3223798274993896,
"eval_runtime": 1117.5341,
"eval_samples_per_second": 817.389,
"eval_steps_per_second": 6.386,
"step": 42500
},
{
"epoch": 3.770556127929152,
"grad_norm": 2.4137706756591797,
"learning_rate": 7.99721615445626e-06,
"loss": 2.4589,
"step": 43000
},
{
"epoch": 3.770556127929152,
"eval_loss": 2.3220419883728027,
"eval_runtime": 1117.5679,
"eval_samples_per_second": 817.364,
"eval_steps_per_second": 6.386,
"step": 43000
},
{
"epoch": 3.8143975098095093,
"grad_norm": 2.372236728668213,
"learning_rate": 7.467463945707431e-06,
"loss": 2.4587,
"step": 43500
},
{
"epoch": 3.8143975098095093,
"eval_loss": 2.319883346557617,
"eval_runtime": 1117.7624,
"eval_samples_per_second": 817.222,
"eval_steps_per_second": 6.385,
"step": 43500
},
{
"epoch": 3.858238891689866,
"grad_norm": 2.357147693634033,
"learning_rate": 6.952769353776245e-06,
"loss": 2.4535,
"step": 44000
},
{
"epoch": 3.858238891689866,
"eval_loss": 2.317007303237915,
"eval_runtime": 1133.7123,
"eval_samples_per_second": 805.725,
"eval_steps_per_second": 6.295,
"step": 44000
},
{
"epoch": 3.902080273570223,
"grad_norm": 2.783552408218384,
"learning_rate": 6.454557052188573e-06,
"loss": 2.449,
"step": 44500
},
{
"epoch": 3.902080273570223,
"eval_loss": 2.31400728225708,
"eval_runtime": 1167.9518,
"eval_samples_per_second": 782.104,
"eval_steps_per_second": 6.111,
"step": 44500
},
{
"epoch": 3.94592165545058,
"grad_norm": 2.172205924987793,
"learning_rate": 5.9712582251657486e-06,
"loss": 2.4505,
"step": 45000
},
{
"epoch": 3.94592165545058,
"eval_loss": 2.311835289001465,
"eval_runtime": 1177.0705,
"eval_samples_per_second": 776.045,
"eval_steps_per_second": 6.063,
"step": 45000
},
{
"epoch": 3.9897630373309365,
"grad_norm": 2.5776069164276123,
"learning_rate": 5.504302014024623e-06,
"loss": 2.4516,
"step": 45500
},
{
"epoch": 3.9897630373309365,
"eval_loss": 2.3110923767089844,
"eval_runtime": 1155.3005,
"eval_samples_per_second": 790.669,
"eval_steps_per_second": 6.178,
"step": 45500
},
{
"epoch": 4.033670181284114,
"grad_norm": 2.3275997638702393,
"learning_rate": 5.0540894587331774e-06,
"loss": 2.4486,
"step": 46000
},
{
"epoch": 4.033670181284114,
"eval_loss": 2.308993339538574,
"eval_runtime": 1153.9106,
"eval_samples_per_second": 791.621,
"eval_steps_per_second": 6.185,
"step": 46000
},
{
"epoch": 4.077511563164471,
"grad_norm": 2.5999953746795654,
"learning_rate": 4.621007219163281e-06,
"loss": 2.4475,
"step": 46500
},
{
"epoch": 4.077511563164471,
"eval_loss": 2.3080523014068604,
"eval_runtime": 1127.4548,
"eval_samples_per_second": 810.197,
"eval_steps_per_second": 6.33,
"step": 46500
},
{
"epoch": 4.121352945044828,
"grad_norm": 2.5732951164245605,
"learning_rate": 4.205427243012275e-06,
"loss": 2.4422,
"step": 47000
},
{
"epoch": 4.121352945044828,
"eval_loss": 2.3062963485717773,
"eval_runtime": 1172.9589,
"eval_samples_per_second": 778.766,
"eval_steps_per_second": 6.085,
"step": 47000
},
{
"epoch": 4.165194326925184,
"grad_norm": 2.5187389850616455,
"learning_rate": 3.807706446359982e-06,
"loss": 2.4356,
"step": 47500
},
{
"epoch": 4.165194326925184,
"eval_loss": 2.303138017654419,
"eval_runtime": 1168.5041,
"eval_samples_per_second": 781.735,
"eval_steps_per_second": 6.108,
"step": 47500
},
{
"epoch": 4.2090357088055415,
"grad_norm": 2.493955373764038,
"learning_rate": 3.4281864071354503e-06,
"loss": 2.4373,
"step": 48000
},
{
"epoch": 4.2090357088055415,
"eval_loss": 2.3037543296813965,
"eval_runtime": 1141.8833,
"eval_samples_per_second": 799.959,
"eval_steps_per_second": 6.25,
"step": 48000
},
{
"epoch": 4.252877090685899,
"grad_norm": 2.4855451583862305,
"learning_rate": 3.067896360030392e-06,
"loss": 2.438,
"step": 48500
},
{
"epoch": 4.252877090685899,
"eval_loss": 2.302539348602295,
"eval_runtime": 1132.8756,
"eval_samples_per_second": 806.32,
"eval_steps_per_second": 6.3,
"step": 48500
},
{
"epoch": 4.296718472566255,
"grad_norm": 2.443387985229492,
"learning_rate": 2.725701791286309e-06,
"loss": 2.4302,
"step": 49000
},
{
"epoch": 4.296718472566255,
"eval_loss": 2.301379919052124,
"eval_runtime": 1147.1315,
"eval_samples_per_second": 796.299,
"eval_steps_per_second": 6.222,
"step": 49000
},
{
"epoch": 4.340559854446612,
"grad_norm": 2.50595760345459,
"learning_rate": 2.402637247215794e-06,
"loss": 2.4363,
"step": 49500
},
{
"epoch": 4.340559854446612,
"eval_loss": 2.3001203536987305,
"eval_runtime": 1118.4945,
"eval_samples_per_second": 816.687,
"eval_steps_per_second": 6.381,
"step": 49500
},
{
"epoch": 4.384401236326969,
"grad_norm": 2.498288869857788,
"learning_rate": 2.098980188084537e-06,
"loss": 2.4362,
"step": 50000
},
{
"epoch": 4.384401236326969,
"eval_loss": 2.2997913360595703,
"eval_runtime": 1114.6443,
"eval_samples_per_second": 819.508,
"eval_steps_per_second": 6.403,
"step": 50000
},
{
"epoch": 4.428242618207326,
"grad_norm": 2.488811492919922,
"learning_rate": 1.815539589939294e-06,
"loss": 2.4307,
"step": 50500
},
{
"epoch": 4.428242618207326,
"eval_loss": 2.2987558841705322,
"eval_runtime": 1153.656,
"eval_samples_per_second": 791.796,
"eval_steps_per_second": 6.186,
"step": 50500
},
{
"epoch": 4.4720840000876825,
"grad_norm": 2.4829695224761963,
"learning_rate": 1.5514229294897542e-06,
"loss": 2.4326,
"step": 51000
},
{
"epoch": 4.4720840000876825,
"eval_loss": 2.296705484390259,
"eval_runtime": 1118.7574,
"eval_samples_per_second": 816.495,
"eval_steps_per_second": 6.379,
"step": 51000
},
{
"epoch": 4.51592538196804,
"grad_norm": 2.530369997024536,
"learning_rate": 1.3074448096000807e-06,
"loss": 2.435,
"step": 51500
},
{
"epoch": 4.51592538196804,
"eval_loss": 2.2978501319885254,
"eval_runtime": 1118.919,
"eval_samples_per_second": 816.377,
"eval_steps_per_second": 6.378,
"step": 51500
},
{
"epoch": 4.559766763848397,
"grad_norm": 2.667680025100708,
"learning_rate": 1.0838147680707346e-06,
"loss": 2.4202,
"step": 52000
},
{
"epoch": 4.559766763848397,
"eval_loss": 2.2962234020233154,
"eval_runtime": 1118.9523,
"eval_samples_per_second": 816.353,
"eval_steps_per_second": 6.378,
"step": 52000
},
{
"epoch": 4.603608145728753,
"grad_norm": 2.1807284355163574,
"learning_rate": 8.811104288462684e-07,
"loss": 2.4286,
"step": 52500
},
{
"epoch": 4.603608145728753,
"eval_loss": 2.2967143058776855,
"eval_runtime": 1118.8196,
"eval_samples_per_second": 816.45,
"eval_steps_per_second": 6.379,
"step": 52500
},
{
"epoch": 4.64744952760911,
"grad_norm": 2.2673935890197754,
"learning_rate": 6.986934982419146e-07,
"loss": 2.4311,
"step": 53000
},
{
"epoch": 4.64744952760911,
"eval_loss": 2.2961032390594482,
"eval_runtime": 1118.4446,
"eval_samples_per_second": 816.724,
"eval_steps_per_second": 6.381,
"step": 53000
},
{
"epoch": 4.691290909489467,
"grad_norm": 2.2549829483032227,
"learning_rate": 5.371474650558512e-07,
"loss": 2.4288,
"step": 53500
},
{
"epoch": 4.691290909489467,
"eval_loss": 2.295196294784546,
"eval_runtime": 1119.1152,
"eval_samples_per_second": 816.234,
"eval_steps_per_second": 6.377,
"step": 53500
},
{
"epoch": 4.735132291369824,
"grad_norm": 2.3956711292266846,
"learning_rate": 3.9661107123952765e-07,
"loss": 2.4284,
"step": 54000
},
{
"epoch": 4.735132291369824,
"eval_loss": 2.2958788871765137,
"eval_runtime": 1118.6134,
"eval_samples_per_second": 816.6,
"eval_steps_per_second": 6.38,
"step": 54000
},
{
"epoch": 4.778973673250181,
"grad_norm": 2.3948519229888916,
"learning_rate": 2.774226677005054e-07,
"loss": 2.43,
"step": 54500
},
{
"epoch": 4.778973673250181,
"eval_loss": 2.29548716545105,
"eval_runtime": 1118.792,
"eval_samples_per_second": 816.47,
"eval_steps_per_second": 6.379,
"step": 54500
},
{
"epoch": 4.822815055130538,
"grad_norm": 2.336251735687256,
"learning_rate": 1.7920694325616606e-07,
"loss": 2.4354,
"step": 55000
},
{
"epoch": 4.822815055130538,
"eval_loss": 2.295090436935425,
"eval_runtime": 1118.5403,
"eval_samples_per_second": 816.654,
"eval_steps_per_second": 6.381,
"step": 55000
},
{
"epoch": 4.866656437010895,
"grad_norm": 2.2819674015045166,
"learning_rate": 1.0230827127936937e-07,
"loss": 2.4268,
"step": 55500
},
{
"epoch": 4.866656437010895,
"eval_loss": 2.295917272567749,
"eval_runtime": 1118.759,
"eval_samples_per_second": 816.494,
"eval_steps_per_second": 6.379,
"step": 55500
},
{
"epoch": 4.910497818891251,
"grad_norm": 2.349515438079834,
"learning_rate": 4.679269530955821e-08,
"loss": 2.4295,
"step": 56000
},
{
"epoch": 4.910497818891251,
"eval_loss": 2.294180154800415,
"eval_runtime": 1119.0255,
"eval_samples_per_second": 816.3,
"eval_steps_per_second": 6.378,
"step": 56000
},
{
"epoch": 4.954339200771608,
"grad_norm": 2.2763524055480957,
"learning_rate": 1.2754653424379426e-08,
"loss": 2.4314,
"step": 56500
},
{
"epoch": 4.954339200771608,
"eval_loss": 2.294581651687622,
"eval_runtime": 1119.2098,
"eval_samples_per_second": 816.165,
"eval_steps_per_second": 6.377,
"step": 56500
},
{
"epoch": 4.998180582651965,
"grad_norm": 2.5564186573028564,
"learning_rate": 8.696357109150288e-11,
"loss": 2.4295,
"step": 57000
},
{
"epoch": 4.998180582651965,
"eval_loss": 2.2953152656555176,
"eval_runtime": 1118.6887,
"eval_samples_per_second": 816.545,
"eval_steps_per_second": 6.38,
"step": 57000
},
{
"epoch": 5.0403208134285835,
"grad_norm": 2.4840376377105713,
"learning_rate": 2.0621818195184993e-05,
"loss": 2.448,
"step": 57500
},
{
"epoch": 5.0403208134285835,
"eval_loss": 2.295259952545166,
"eval_runtime": 1254.4497,
"eval_samples_per_second": 727.251,
"eval_steps_per_second": 5.682,
"step": 57500
},
{
"epoch": 5.08414778454661,
"grad_norm": 2.2857511043548584,
"learning_rate": 2.020548401681933e-05,
"loss": 2.4462,
"step": 58000
},
{
"epoch": 5.08414778454661,
"eval_loss": 2.2957704067230225,
"eval_runtime": 1112.6636,
"eval_samples_per_second": 819.924,
"eval_steps_per_second": 6.406,
"step": 58000
},
{
"epoch": 5.127974755664636,
"grad_norm": 2.297426223754883,
"learning_rate": 1.9791354300727253e-05,
"loss": 2.4469,
"step": 58500
},
{
"epoch": 5.127974755664636,
"eval_loss": 2.2939374446868896,
"eval_runtime": 1112.6399,
"eval_samples_per_second": 819.942,
"eval_steps_per_second": 6.406,
"step": 58500
},
{
"epoch": 5.171801726782662,
"grad_norm": 2.495027542114258,
"learning_rate": 1.9378713462572584e-05,
"loss": 2.4436,
"step": 59000
},
{
"epoch": 5.171801726782662,
"eval_loss": 2.290992498397827,
"eval_runtime": 1112.5602,
"eval_samples_per_second": 820.001,
"eval_steps_per_second": 6.407,
"step": 59000
},
{
"epoch": 5.215628697900688,
"grad_norm": 2.5433051586151123,
"learning_rate": 1.8966857431306628e-05,
"loss": 2.4324,
"step": 59500
},
{
"epoch": 5.215628697900688,
"eval_loss": 2.285850763320923,
"eval_runtime": 1112.0589,
"eval_samples_per_second": 820.37,
"eval_steps_per_second": 6.41,
"step": 59500
},
{
"epoch": 5.259455669018714,
"grad_norm": 2.5419158935546875,
"learning_rate": 1.855673287709892e-05,
"loss": 2.4231,
"step": 60000
},
{
"epoch": 5.259455669018714,
"eval_loss": 2.2814688682556152,
"eval_runtime": 1112.6767,
"eval_samples_per_second": 819.915,
"eval_steps_per_second": 6.406,
"step": 60000
},
{
"epoch": 5.30328264013674,
"grad_norm": 2.5950675010681152,
"learning_rate": 1.814845750332687e-05,
"loss": 2.431,
"step": 60500
},
{
"epoch": 5.30328264013674,
"eval_loss": 2.2797560691833496,
"eval_runtime": 1113.0425,
"eval_samples_per_second": 819.645,
"eval_steps_per_second": 6.404,
"step": 60500
},
{
"epoch": 5.3471096112547665,
"grad_norm": 2.439197063446045,
"learning_rate": 1.774214848266375e-05,
"loss": 2.4205,
"step": 61000
},
{
"epoch": 5.3471096112547665,
"eval_loss": 2.2719454765319824,
"eval_runtime": 1114.2544,
"eval_samples_per_second": 818.754,
"eval_steps_per_second": 6.397,
"step": 61000
},
{
"epoch": 5.390936582372793,
"grad_norm": 2.4935576915740967,
"learning_rate": 1.73379224234509e-05,
"loss": 2.4216,
"step": 61500
},
{
"epoch": 5.390936582372793,
"eval_loss": 2.2704086303710938,
"eval_runtime": 1113.9901,
"eval_samples_per_second": 818.948,
"eval_steps_per_second": 6.399,
"step": 61500
},
{
"epoch": 5.434763553490818,
"grad_norm": 2.526001453399658,
"learning_rate": 1.6935895336231698e-05,
"loss": 2.4118,
"step": 62000
},
{
"epoch": 5.434763553490818,
"eval_loss": 2.2659912109375,
"eval_runtime": 1113.1948,
"eval_samples_per_second": 819.533,
"eval_steps_per_second": 6.403,
"step": 62000
},
{
"epoch": 5.478590524608844,
"grad_norm": 2.588696241378784,
"learning_rate": 1.653618260045733e-05,
"loss": 2.4104,
"step": 62500
},
{
"epoch": 5.478590524608844,
"eval_loss": 2.262714147567749,
"eval_runtime": 1113.2419,
"eval_samples_per_second": 819.498,
"eval_steps_per_second": 6.403,
"step": 62500
},
{
"epoch": 5.52241749572687,
"grad_norm": 2.5436880588531494,
"learning_rate": 1.6139690998599525e-05,
"loss": 2.4048,
"step": 63000
},
{
"epoch": 5.52241749572687,
"eval_loss": 2.261882781982422,
"eval_runtime": 1112.8347,
"eval_samples_per_second": 819.798,
"eval_steps_per_second": 6.405,
"step": 63000
},
{
"epoch": 5.566244466844896,
"grad_norm": 2.3459692001342773,
"learning_rate": 1.574494521484366e-05,
"loss": 2.4042,
"step": 63500
},
{
"epoch": 5.566244466844896,
"eval_loss": 2.2557597160339355,
"eval_runtime": 1115.0241,
"eval_samples_per_second": 818.189,
"eval_steps_per_second": 6.393,
"step": 63500
},
{
"epoch": 5.610071437962922,
"grad_norm": 2.5149025917053223,
"learning_rate": 1.5352855578336255e-05,
"loss": 2.3984,
"step": 64000
},
{
"epoch": 5.610071437962922,
"eval_loss": 2.2534825801849365,
"eval_runtime": 1117.6575,
"eval_samples_per_second": 816.261,
"eval_steps_per_second": 6.378,
"step": 64000
},
{
"epoch": 5.6538984090809485,
"grad_norm": 2.2918002605438232,
"learning_rate": 1.4963534616537533e-05,
"loss": 2.3954,
"step": 64500
},
{
"epoch": 5.6538984090809485,
"eval_loss": 2.248565673828125,
"eval_runtime": 1117.9311,
"eval_samples_per_second": 816.061,
"eval_steps_per_second": 6.376,
"step": 64500
},
{
"epoch": 5.697725380198975,
"grad_norm": 2.298626661300659,
"learning_rate": 1.4577863994919117e-05,
"loss": 2.3967,
"step": 65000
},
{
"epoch": 5.697725380198975,
"eval_loss": 2.2449169158935547,
"eval_runtime": 1118.1203,
"eval_samples_per_second": 815.923,
"eval_steps_per_second": 6.375,
"step": 65000
},
{
"epoch": 5.741552351317001,
"grad_norm": 2.3184773921966553,
"learning_rate": 1.4194408661730513e-05,
"loss": 2.3911,
"step": 65500
},
{
"epoch": 5.741552351317001,
"eval_loss": 2.2438881397247314,
"eval_runtime": 1118.3575,
"eval_samples_per_second": 815.75,
"eval_steps_per_second": 6.374,
"step": 65500
},
{
"epoch": 5.785379322435027,
"grad_norm": 2.4109182357788086,
"learning_rate": 1.3814054470822247e-05,
"loss": 2.3809,
"step": 66000
},
{
"epoch": 5.785379322435027,
"eval_loss": 2.240081310272217,
"eval_runtime": 1118.1546,
"eval_samples_per_second": 815.898,
"eval_steps_per_second": 6.375,
"step": 66000
},
{
"epoch": 5.829206293553052,
"grad_norm": 2.3846776485443115,
"learning_rate": 1.3436910581649448e-05,
"loss": 2.3793,
"step": 66500
},
{
"epoch": 5.829206293553052,
"eval_loss": 2.239961862564087,
"eval_runtime": 1118.5503,
"eval_samples_per_second": 815.609,
"eval_steps_per_second": 6.373,
"step": 66500
},
{
"epoch": 5.873033264671078,
"grad_norm": 2.4958534240722656,
"learning_rate": 1.3063829499654062e-05,
"loss": 2.3779,
"step": 67000
},
{
"epoch": 5.873033264671078,
"eval_loss": 2.2330241203308105,
"eval_runtime": 1117.0041,
"eval_samples_per_second": 816.738,
"eval_steps_per_second": 6.381,
"step": 67000
},
{
"epoch": 5.9168602357891045,
"grad_norm": 2.727729320526123,
"learning_rate": 1.2693423017827839e-05,
"loss": 2.3819,
"step": 67500
},
{
"epoch": 5.9168602357891045,
"eval_loss": 2.230943441390991,
"eval_runtime": 1118.424,
"eval_samples_per_second": 815.701,
"eval_steps_per_second": 6.373,
"step": 67500
},
{
"epoch": 5.960687206907131,
"grad_norm": 2.575376272201538,
"learning_rate": 1.232654845248921e-05,
"loss": 2.381,
"step": 68000
},
{
"epoch": 5.960687206907131,
"eval_loss": 2.230390787124634,
"eval_runtime": 1118.1235,
"eval_samples_per_second": 815.921,
"eval_steps_per_second": 6.375,
"step": 68000
},
{
"epoch": 6.004470351054039,
"grad_norm": 2.529177665710449,
"learning_rate": 1.196331109451862e-05,
"loss": 2.3686,
"step": 68500
},
{
"epoch": 6.004470351054039,
"eval_loss": 2.2275359630584717,
"eval_runtime": 1118.6647,
"eval_samples_per_second": 815.526,
"eval_steps_per_second": 6.372,
"step": 68500
},
{
"epoch": 6.048297322172065,
"grad_norm": 2.376052141189575,
"learning_rate": 1.1604530380017059e-05,
"loss": 2.3651,
"step": 69000
},
{
"epoch": 6.048297322172065,
"eval_loss": 2.2251877784729004,
"eval_runtime": 1118.8605,
"eval_samples_per_second": 815.383,
"eval_steps_per_second": 6.371,
"step": 69000
},
{
"epoch": 6.092124293290091,
"grad_norm": 2.479585886001587,
"learning_rate": 1.1248871312582082e-05,
"loss": 2.3636,
"step": 69500
},
{
"epoch": 6.092124293290091,
"eval_loss": 2.221175193786621,
"eval_runtime": 1119.5075,
"eval_samples_per_second": 814.912,
"eval_steps_per_second": 6.367,
"step": 69500
},
{
"epoch": 6.135951264408117,
"grad_norm": 2.534466505050659,
"learning_rate": 1.0897158739627577e-05,
"loss": 2.3651,
"step": 70000
},
{
"epoch": 6.135951264408117,
"eval_loss": 2.2180685997009277,
"eval_runtime": 1118.9839,
"eval_samples_per_second": 815.293,
"eval_steps_per_second": 6.37,
"step": 70000
},
{
"epoch": 6.179778235526142,
"grad_norm": 2.6526997089385986,
"learning_rate": 1.0549493600629845e-05,
"loss": 2.3652,
"step": 70500
},
{
"epoch": 6.179778235526142,
"eval_loss": 2.220241069793701,
"eval_runtime": 1117.2188,
"eval_samples_per_second": 816.581,
"eval_steps_per_second": 6.38,
"step": 70500
},
{
"epoch": 6.2236052066441685,
"grad_norm": 2.5207266807556152,
"learning_rate": 1.0206658504682815e-05,
"loss": 2.355,
"step": 71000
},
{
"epoch": 6.2236052066441685,
"eval_loss": 2.2159178256988525,
"eval_runtime": 1117.5581,
"eval_samples_per_second": 816.333,
"eval_steps_per_second": 6.378,
"step": 71000
},
{
"epoch": 6.267432177762195,
"grad_norm": 2.5469133853912354,
"learning_rate": 9.867377787846862e-06,
"loss": 2.3543,
"step": 71500
},
{
"epoch": 6.267432177762195,
"eval_loss": 2.2127163410186768,
"eval_runtime": 1117.1967,
"eval_samples_per_second": 816.598,
"eval_steps_per_second": 6.38,
"step": 71500
},
{
"epoch": 6.311259148880221,
"grad_norm": 2.4534058570861816,
"learning_rate": 9.532440046150856e-06,
"loss": 2.351,
"step": 72000
},
{
"epoch": 6.311259148880221,
"eval_loss": 2.2119340896606445,
"eval_runtime": 1117.6266,
"eval_samples_per_second": 816.283,
"eval_steps_per_second": 6.378,
"step": 72000
},
{
"epoch": 6.355086119998247,
"grad_norm": 2.4497475624084473,
"learning_rate": 9.201941404791417e-06,
"loss": 2.3451,
"step": 72500
},
{
"epoch": 6.355086119998247,
"eval_loss": 2.2094504833221436,
"eval_runtime": 1119.5542,
"eval_samples_per_second": 814.878,
"eval_steps_per_second": 6.367,
"step": 72500
},
{
"epoch": 6.398913091116273,
"grad_norm": 2.3042914867401123,
"learning_rate": 8.876624057066015e-06,
"loss": 2.3469,
"step": 73000
},
{
"epoch": 6.398913091116273,
"eval_loss": 2.2069456577301025,
"eval_runtime": 1118.0622,
"eval_samples_per_second": 815.965,
"eval_steps_per_second": 6.375,
"step": 73000
},
{
"epoch": 6.442740062234299,
"grad_norm": 2.4782769680023193,
"learning_rate": 8.555277521275629e-06,
"loss": 2.3522,
"step": 73500
},
{
"epoch": 6.442740062234299,
"eval_loss": 2.205556631088257,
"eval_runtime": 1112.4728,
"eval_samples_per_second": 820.065,
"eval_steps_per_second": 6.407,
"step": 73500
},
{
"epoch": 6.486567033352325,
"grad_norm": 2.408228874206543,
"learning_rate": 8.23865052582049e-06,
"loss": 2.3458,
"step": 74000
},
{
"epoch": 6.486567033352325,
"eval_loss": 2.203964948654175,
"eval_runtime": 1112.4771,
"eval_samples_per_second": 820.062,
"eval_steps_per_second": 6.407,
"step": 74000
},
{
"epoch": 6.530394004470351,
"grad_norm": 2.472689390182495,
"learning_rate": 7.926833940818856e-06,
"loss": 2.3436,
"step": 74500
},
{
"epoch": 6.530394004470351,
"eval_loss": 2.2009198665618896,
"eval_runtime": 1112.7482,
"eval_samples_per_second": 819.862,
"eval_steps_per_second": 6.406,
"step": 74500
},
{
"epoch": 6.574220975588377,
"grad_norm": 2.4618117809295654,
"learning_rate": 7.6205261403159065e-06,
"loss": 2.3424,
"step": 75000
},
{
"epoch": 6.574220975588377,
"eval_loss": 2.2018818855285645,
"eval_runtime": 1113.2997,
"eval_samples_per_second": 819.456,
"eval_steps_per_second": 6.403,
"step": 75000
},
{
"epoch": 6.618047946706403,
"grad_norm": 2.51564621925354,
"learning_rate": 7.318587375726538e-06,
"loss": 2.343,
"step": 75500
},
{
"epoch": 6.618047946706403,
"eval_loss": 2.196281909942627,
"eval_runtime": 1113.37,
"eval_samples_per_second": 819.404,
"eval_steps_per_second": 6.402,
"step": 75500
},
{
"epoch": 6.661874917824429,
"grad_norm": 2.3265905380249023,
"learning_rate": 7.021723074398725e-06,
"loss": 2.3383,
"step": 76000
},
{
"epoch": 6.661874917824429,
"eval_loss": 2.197392225265503,
"eval_runtime": 1113.4662,
"eval_samples_per_second": 819.333,
"eval_steps_per_second": 6.402,
"step": 76000
},
{
"epoch": 6.705701888942455,
"grad_norm": 2.500836133956909,
"learning_rate": 6.730018434671659e-06,
"loss": 2.3442,
"step": 76500
},
{
"epoch": 6.705701888942455,
"eval_loss": 2.1948647499084473,
"eval_runtime": 1114.1466,
"eval_samples_per_second": 818.833,
"eval_steps_per_second": 6.398,
"step": 76500
},
{
"epoch": 6.749528860060481,
"grad_norm": 2.4531776905059814,
"learning_rate": 6.444124808823204e-06,
"loss": 2.3343,
"step": 77000
},
{
"epoch": 6.749528860060481,
"eval_loss": 2.1950042247772217,
"eval_runtime": 1114.1483,
"eval_samples_per_second": 818.832,
"eval_steps_per_second": 6.398,
"step": 77000
},
{
"epoch": 6.793355831178507,
"grad_norm": 2.488192081451416,
"learning_rate": 6.162978407896589e-06,
"loss": 2.3428,
"step": 77500
},
{
"epoch": 6.793355831178507,
"eval_loss": 2.191720962524414,
"eval_runtime": 1114.2187,
"eval_samples_per_second": 818.78,
"eval_steps_per_second": 6.397,
"step": 77500
},
{
"epoch": 6.8371828022965335,
"grad_norm": 2.629721164703369,
"learning_rate": 5.887238123328259e-06,
"loss": 2.335,
"step": 78000
},
{
"epoch": 6.8371828022965335,
"eval_loss": 2.190831184387207,
"eval_runtime": 1114.1658,
"eval_samples_per_second": 818.819,
"eval_steps_per_second": 6.398,
"step": 78000
},
{
"epoch": 6.88100977341456,
"grad_norm": 2.388756513595581,
"learning_rate": 5.616983090986713e-06,
"loss": 2.3394,
"step": 78500
},
{
"epoch": 6.88100977341456,
"eval_loss": 2.1897459030151367,
"eval_runtime": 1113.866,
"eval_samples_per_second": 819.039,
"eval_steps_per_second": 6.399,
"step": 78500
},
{
"epoch": 6.924836744532586,
"grad_norm": 2.546407461166382,
"learning_rate": 5.352814654493821e-06,
"loss": 2.3341,
"step": 79000
},
{
"epoch": 6.924836744532586,
"eval_loss": 2.1880617141723633,
"eval_runtime": 1114.3622,
"eval_samples_per_second": 818.675,
"eval_steps_per_second": 6.396,
"step": 79000
},
{
"epoch": 6.968663715650611,
"grad_norm": 2.6898553371429443,
"learning_rate": 5.093749862709529e-06,
"loss": 2.3397,
"step": 79500
},
{
"epoch": 6.968663715650611,
"eval_loss": 2.1861698627471924,
"eval_runtime": 1113.9872,
"eval_samples_per_second": 818.95,
"eval_steps_per_second": 6.399,
"step": 79500
},
{
"epoch": 7.012446859797519,
"grad_norm": 2.592198610305786,
"learning_rate": 4.840398049698097e-06,
"loss": 2.3213,
"step": 80000
},
{
"epoch": 7.012446859797519,
"eval_loss": 2.1867756843566895,
"eval_runtime": 1114.245,
"eval_samples_per_second": 818.761,
"eval_steps_per_second": 6.397,
"step": 80000
},
{
"epoch": 7.056273830915545,
"grad_norm": 2.305933713912964,
"learning_rate": 4.592831925966015e-06,
"loss": 2.3311,
"step": 80500
},
{
"epoch": 7.056273830915545,
"eval_loss": 2.1855616569519043,
"eval_runtime": 1114.1605,
"eval_samples_per_second": 818.823,
"eval_steps_per_second": 6.398,
"step": 80500
},
{
"epoch": 7.100100802033571,
"grad_norm": 2.3767688274383545,
"learning_rate": 4.351600068913997e-06,
"loss": 2.3216,
"step": 81000
},
{
"epoch": 7.100100802033571,
"eval_loss": 2.18585205078125,
"eval_runtime": 1114.2108,
"eval_samples_per_second": 818.786,
"eval_steps_per_second": 6.397,
"step": 81000
},
{
"epoch": 7.1439277731515975,
"grad_norm": 2.4296772480010986,
"learning_rate": 4.115804872711229e-06,
"loss": 2.3258,
"step": 81500
},
{
"epoch": 7.1439277731515975,
"eval_loss": 2.1833810806274414,
"eval_runtime": 1114.2167,
"eval_samples_per_second": 818.781,
"eval_steps_per_second": 6.397,
"step": 81500
},
{
"epoch": 7.187754744269624,
"grad_norm": 2.158872127532959,
"learning_rate": 3.886003319842971e-06,
"loss": 2.3257,
"step": 82000
},
{
"epoch": 7.187754744269624,
"eval_loss": 2.1819121837615967,
"eval_runtime": 1115.9623,
"eval_samples_per_second": 817.501,
"eval_steps_per_second": 6.387,
"step": 82000
},
{
"epoch": 7.23158171538765,
"grad_norm": 2.458834648132324,
"learning_rate": 3.6622613620271253e-06,
"loss": 2.3199,
"step": 82500
},
{
"epoch": 7.23158171538765,
"eval_loss": 2.183306932449341,
"eval_runtime": 1114.8267,
"eval_samples_per_second": 818.333,
"eval_steps_per_second": 6.394,
"step": 82500
},
{
"epoch": 7.275408686505676,
"grad_norm": 2.311922788619995,
"learning_rate": 3.444643211912821e-06,
"loss": 2.3251,
"step": 83000
},
{
"epoch": 7.275408686505676,
"eval_loss": 2.1810803413391113,
"eval_runtime": 1114.2828,
"eval_samples_per_second": 818.733,
"eval_steps_per_second": 6.397,
"step": 83000
},
{
"epoch": 7.319235657623702,
"grad_norm": 2.43715238571167,
"learning_rate": 3.233627973906725e-06,
"loss": 2.3247,
"step": 83500
},
{
"epoch": 7.319235657623702,
"eval_loss": 2.178840160369873,
"eval_runtime": 1114.5518,
"eval_samples_per_second": 818.535,
"eval_steps_per_second": 6.395,
"step": 83500
},
{
"epoch": 7.363062628741727,
"grad_norm": 2.3885252475738525,
"learning_rate": 3.028430475974181e-06,
"loss": 2.3207,
"step": 84000
},
{
"epoch": 7.363062628741727,
"eval_loss": 2.1783220767974854,
"eval_runtime": 1117.3767,
"eval_samples_per_second": 816.466,
"eval_steps_per_second": 6.379,
"step": 84000
},
{
"epoch": 7.4068895998597535,
"grad_norm": 2.357344388961792,
"learning_rate": 2.829538691545261e-06,
"loss": 2.3156,
"step": 84500
},
{
"epoch": 7.4068895998597535,
"eval_loss": 2.1777966022491455,
"eval_runtime": 1123.0806,
"eval_samples_per_second": 812.319,
"eval_steps_per_second": 6.347,
"step": 84500
},
{
"epoch": 7.45071657097778,
"grad_norm": 2.44062876701355,
"learning_rate": 2.6370097014129153e-06,
"loss": 2.3172,
"step": 85000
},
{
"epoch": 7.45071657097778,
"eval_loss": 2.1768882274627686,
"eval_runtime": 1117.6985,
"eval_samples_per_second": 816.231,
"eval_steps_per_second": 6.377,
"step": 85000
},
{
"epoch": 7.494543542095806,
"grad_norm": 2.4813036918640137,
"learning_rate": 2.4512645411442605e-06,
"loss": 2.3209,
"step": 85500
},
{
"epoch": 7.494543542095806,
"eval_loss": 2.1777381896972656,
"eval_runtime": 1118.4824,
"eval_samples_per_second": 815.659,
"eval_steps_per_second": 6.373,
"step": 85500
},
{
"epoch": 7.538370513213832,
"grad_norm": 2.700749635696411,
"learning_rate": 2.271612066787826e-06,
"loss": 2.3106,
"step": 86000
},
{
"epoch": 7.538370513213832,
"eval_loss": 2.1763668060302734,
"eval_runtime": 1117.7333,
"eval_samples_per_second": 816.205,
"eval_steps_per_second": 6.377,
"step": 86000
},
{
"epoch": 7.582197484331858,
"grad_norm": 2.373656749725342,
"learning_rate": 2.0984825084456316e-06,
"loss": 2.3174,
"step": 86500
},
{
"epoch": 7.582197484331858,
"eval_loss": 2.1764698028564453,
"eval_runtime": 1117.9749,
"eval_samples_per_second": 816.029,
"eval_steps_per_second": 6.376,
"step": 86500
},
{
"epoch": 7.626024455449884,
"grad_norm": 2.449230194091797,
"learning_rate": 1.931925553300576e-06,
"loss": 2.313,
"step": 87000
},
{
"epoch": 7.626024455449884,
"eval_loss": 2.17521595954895,
"eval_runtime": 1117.4736,
"eval_samples_per_second": 816.395,
"eval_steps_per_second": 6.379,
"step": 87000
},
{
"epoch": 7.669851426567909,
"grad_norm": 2.364248275756836,
"learning_rate": 1.7723022373487774e-06,
"loss": 2.314,
"step": 87500
},
{
"epoch": 7.669851426567909,
"eval_loss": 2.1753010749816895,
"eval_runtime": 1118.1437,
"eval_samples_per_second": 815.906,
"eval_steps_per_second": 6.375,
"step": 87500
},
{
"epoch": 7.7136783976859356,
"grad_norm": 2.205310344696045,
"learning_rate": 1.6190186140821656e-06,
"loss": 2.3185,
"step": 88000
},
{
"epoch": 7.7136783976859356,
"eval_loss": 2.174024820327759,
"eval_runtime": 1118.3337,
"eval_samples_per_second": 815.767,
"eval_steps_per_second": 6.374,
"step": 88000
},
{
"epoch": 7.757505368803962,
"grad_norm": 2.3702187538146973,
"learning_rate": 1.472445197380079e-06,
"loss": 2.3143,
"step": 88500
},
{
"epoch": 7.757505368803962,
"eval_loss": 2.1744604110717773,
"eval_runtime": 1118.5051,
"eval_samples_per_second": 815.642,
"eval_steps_per_second": 6.373,
"step": 88500
},
{
"epoch": 7.801332339921988,
"grad_norm": 2.457601547241211,
"learning_rate": 1.3326240529662303e-06,
"loss": 2.3138,
"step": 89000
},
{
"epoch": 7.801332339921988,
"eval_loss": 2.1727075576782227,
"eval_runtime": 1118.3695,
"eval_samples_per_second": 815.741,
"eval_steps_per_second": 6.374,
"step": 89000
},
{
"epoch": 7.845159311040014,
"grad_norm": 2.4939231872558594,
"learning_rate": 1.1998545616726697e-06,
"loss": 2.3193,
"step": 89500
},
{
"epoch": 7.845159311040014,
"eval_loss": 2.172689437866211,
"eval_runtime": 1118.2879,
"eval_samples_per_second": 815.801,
"eval_steps_per_second": 6.374,
"step": 89500
},
{
"epoch": 7.88898628215804,
"grad_norm": 2.6024014949798584,
"learning_rate": 1.0736426980792303e-06,
"loss": 2.3165,
"step": 90000
},
{
"epoch": 7.88898628215804,
"eval_loss": 2.172903537750244,
"eval_runtime": 1118.4656,
"eval_samples_per_second": 815.671,
"eval_steps_per_second": 6.373,
"step": 90000
},
{
"epoch": 7.932813253276066,
"grad_norm": 2.3985230922698975,
"learning_rate": 9.54297560787079e-07,
"loss": 2.3182,
"step": 90500
},
{
"epoch": 7.932813253276066,
"eval_loss": 2.1716508865356445,
"eval_runtime": 1118.3555,
"eval_samples_per_second": 815.751,
"eval_steps_per_second": 6.374,
"step": 90500
},
{
"epoch": 7.976640224394092,
"grad_norm": 2.4502456188201904,
"learning_rate": 8.418534011610524e-07,
"loss": 2.3178,
"step": 91000
},
{
"epoch": 7.976640224394092,
"eval_loss": 2.172135829925537,
"eval_runtime": 1118.3622,
"eval_samples_per_second": 815.746,
"eval_steps_per_second": 6.374,
"step": 91000
},
{
"epoch": 8.020423368541,
"grad_norm": 2.4215595722198486,
"learning_rate": 7.365465720065356e-07,
"loss": 2.3127,
"step": 91500
},
{
"epoch": 8.020423368541,
"eval_loss": 2.1727616786956787,
"eval_runtime": 1115.4247,
"eval_samples_per_second": 817.895,
"eval_steps_per_second": 6.39,
"step": 91500
},
{
"epoch": 8.064250339659026,
"grad_norm": 2.358971357345581,
"learning_rate": 6.379852344303245e-07,
"loss": 2.3145,
"step": 92000
},
{
"epoch": 8.064250339659026,
"eval_loss": 2.1719257831573486,
"eval_runtime": 1114.9532,
"eval_samples_per_second": 818.241,
"eval_steps_per_second": 6.393,
"step": 92000
},
{
"epoch": 8.108077310777052,
"grad_norm": 2.3747315406799316,
"learning_rate": 5.46415654330279e-07,
"loss": 2.3069,
"step": 92500
},
{
"epoch": 8.108077310777052,
"eval_loss": 2.171802043914795,
"eval_runtime": 1115.5499,
"eval_samples_per_second": 817.803,
"eval_steps_per_second": 6.39,
"step": 92500
},
{
"epoch": 8.151904281895078,
"grad_norm": 2.4205031394958496,
"learning_rate": 4.6186411164680645e-07,
"loss": 2.3099,
"step": 93000
},
{
"epoch": 8.151904281895078,
"eval_loss": 2.172088146209717,
"eval_runtime": 1115.2118,
"eval_samples_per_second": 818.051,
"eval_steps_per_second": 6.392,
"step": 93000
},
{
"epoch": 8.195731253013104,
"grad_norm": 2.3196699619293213,
"learning_rate": 3.84502847321927e-07,
"loss": 2.311,
"step": 93500
},
{
"epoch": 8.195731253013104,
"eval_loss": 2.171304941177368,
"eval_runtime": 1115.3282,
"eval_samples_per_second": 817.965,
"eval_steps_per_second": 6.391,
"step": 93500
},
{
"epoch": 8.23955822413113,
"grad_norm": 2.2472469806671143,
"learning_rate": 3.1404400583445736e-07,
"loss": 2.3143,
"step": 94000
},
{
"epoch": 8.23955822413113,
"eval_loss": 2.1706063747406006,
"eval_runtime": 1114.8722,
"eval_samples_per_second": 818.3,
"eval_steps_per_second": 6.394,
"step": 94000
},
{
"epoch": 8.283385195249156,
"grad_norm": 2.6286418437957764,
"learning_rate": 2.5066989108405715e-07,
"loss": 2.3162,
"step": 94500
},
{
"epoch": 8.283385195249156,
"eval_loss": 2.1710445880889893,
"eval_runtime": 1116.0067,
"eval_samples_per_second": 817.468,
"eval_steps_per_second": 6.387,
"step": 94500
},
{
"epoch": 8.327212166367183,
"grad_norm": 2.4226999282836914,
"learning_rate": 1.943986910754897e-07,
"loss": 2.3085,
"step": 95000
},
{
"epoch": 8.327212166367183,
"eval_loss": 2.1697933673858643,
"eval_runtime": 1115.2712,
"eval_samples_per_second": 818.007,
"eval_steps_per_second": 6.391,
"step": 95000
},
{
"epoch": 8.371039137485209,
"grad_norm": 2.3095433712005615,
"learning_rate": 1.453377450467558e-07,
"loss": 2.3091,
"step": 95500
},
{
"epoch": 8.371039137485209,
"eval_loss": 2.170691728591919,
"eval_runtime": 1115.2973,
"eval_samples_per_second": 817.988,
"eval_steps_per_second": 6.391,
"step": 95500
},
{
"epoch": 8.414866108603235,
"grad_norm": 2.637993335723877,
"learning_rate": 1.0330450086001587e-07,
"loss": 2.3062,
"step": 96000
},
{
"epoch": 8.414866108603235,
"eval_loss": 2.170945882797241,
"eval_runtime": 1114.8255,
"eval_samples_per_second": 818.334,
"eval_steps_per_second": 6.394,
"step": 96000
},
{
"epoch": 8.458693079721261,
"grad_norm": 2.3570830821990967,
"learning_rate": 6.841646443063732e-08,
"loss": 2.3159,
"step": 96500
},
{
"epoch": 8.458693079721261,
"eval_loss": 2.171571969985962,
"eval_runtime": 1115.0312,
"eval_samples_per_second": 818.183,
"eval_steps_per_second": 6.393,
"step": 96500
},
{
"epoch": 8.502520050839287,
"grad_norm": 2.5434176921844482,
"learning_rate": 4.068364842349792e-08,
"loss": 2.3096,
"step": 97000
},
{
"epoch": 8.502520050839287,
"eval_loss": 2.171351194381714,
"eval_runtime": 1115.2049,
"eval_samples_per_second": 818.056,
"eval_steps_per_second": 6.392,
"step": 97000
},
{
"epoch": 8.546347021957313,
"grad_norm": 2.5126280784606934,
"learning_rate": 2.0147998149930293e-08,
"loss": 2.3079,
"step": 97500
},
{
"epoch": 8.546347021957313,
"eval_loss": 2.171030282974243,
"eval_runtime": 1115.7419,
"eval_samples_per_second": 817.662,
"eval_steps_per_second": 6.389,
"step": 97500
},
{
"epoch": 8.59017399307534,
"grad_norm": 2.4063174724578857,
"learning_rate": 6.733101979849999e-09,
"loss": 2.3082,
"step": 98000
},
{
"epoch": 8.59017399307534,
"eval_loss": 2.1707358360290527,
"eval_runtime": 1114.2074,
"eval_samples_per_second": 818.788,
"eval_steps_per_second": 6.397,
"step": 98000
},
{
"epoch": 8.634000964193365,
"grad_norm": 2.511075735092163,
"learning_rate": 4.91129000629309e-10,
"loss": 2.3096,
"step": 98500
},
{
"epoch": 8.634000964193365,
"eval_loss": 2.1694393157958984,
"eval_runtime": 1114.2428,
"eval_samples_per_second": 818.762,
"eval_steps_per_second": 6.397,
"step": 98500
},
{
"epoch": 8.677389665600211,
"grad_norm": 2.3884670734405518,
"learning_rate": 4.173116663065885e-06,
"loss": 2.3037,
"step": 99000
},
{
"epoch": 8.677389665600211,
"eval_loss": 2.1731722354888916,
"eval_runtime": 1110.3507,
"eval_samples_per_second": 821.632,
"eval_steps_per_second": 6.42,
"step": 99000
},
{
"epoch": 8.721216636718236,
"grad_norm": 2.4506683349609375,
"learning_rate": 3.982943694698685e-06,
"loss": 2.3118,
"step": 99500
},
{
"epoch": 8.721216636718236,
"eval_loss": 2.1729063987731934,
"eval_runtime": 1118.1795,
"eval_samples_per_second": 815.88,
"eval_steps_per_second": 6.375,
"step": 99500
},
{
"epoch": 8.765043607836262,
"grad_norm": 2.4486277103424072,
"learning_rate": 3.7964611189707232e-06,
"loss": 2.3173,
"step": 100000
},
{
"epoch": 8.765043607836262,
"eval_loss": 2.1726784706115723,
"eval_runtime": 1115.9142,
"eval_samples_per_second": 817.536,
"eval_steps_per_second": 6.388,
"step": 100000
},
{
"epoch": 8.808870578954288,
"grad_norm": 2.706360101699829,
"learning_rate": 3.6140902571372566e-06,
"loss": 2.3151,
"step": 100500
},
{
"epoch": 8.808870578954288,
"eval_loss": 2.1703412532806396,
"eval_runtime": 1115.5437,
"eval_samples_per_second": 817.807,
"eval_steps_per_second": 6.39,
"step": 100500
},
{
"epoch": 8.852697550072314,
"grad_norm": 2.563002824783325,
"learning_rate": 3.4358664738989826e-06,
"loss": 2.3156,
"step": 101000
},
{
"epoch": 8.852697550072314,
"eval_loss": 2.1706130504608154,
"eval_runtime": 1116.8512,
"eval_samples_per_second": 816.85,
"eval_steps_per_second": 6.382,
"step": 101000
},
{
"epoch": 8.89652452119034,
"grad_norm": 2.505505084991455,
"learning_rate": 3.2621682182145314e-06,
"loss": 2.3138,
"step": 101500
},
{
"epoch": 8.89652452119034,
"eval_loss": 2.1691839694976807,
"eval_runtime": 1115.2901,
"eval_samples_per_second": 817.993,
"eval_steps_per_second": 6.391,
"step": 101500
},
{
"epoch": 8.940351492308366,
"grad_norm": 2.6076018810272217,
"learning_rate": 3.092332998903416e-06,
"loss": 2.3075,
"step": 102000
},
{
"epoch": 8.940351492308366,
"eval_loss": 2.1688640117645264,
"eval_runtime": 1116.0259,
"eval_samples_per_second": 817.454,
"eval_steps_per_second": 6.387,
"step": 102000
},
{
"epoch": 8.984178463426392,
"grad_norm": 2.394963502883911,
"learning_rate": 2.92674603547588e-06,
"loss": 2.3094,
"step": 102500
},
{
"epoch": 8.984178463426392,
"eval_loss": 2.167738914489746,
"eval_runtime": 1117.6939,
"eval_samples_per_second": 816.234,
"eval_steps_per_second": 6.377,
"step": 102500
},
{
"epoch": 9.027961607573301,
"grad_norm": 2.570017099380493,
"learning_rate": 2.765439437959516e-06,
"loss": 2.3093,
"step": 103000
},
{
"epoch": 9.027961607573301,
"eval_loss": 2.167351007461548,
"eval_runtime": 1115.1044,
"eval_samples_per_second": 818.13,
"eval_steps_per_second": 6.392,
"step": 103000
},
{
"epoch": 9.071788578691327,
"grad_norm": 2.3768527507781982,
"learning_rate": 2.6087541528544814e-06,
"loss": 2.3085,
"step": 103500
},
{
"epoch": 9.071788578691327,
"eval_loss": 2.1665375232696533,
"eval_runtime": 1115.0572,
"eval_samples_per_second": 818.164,
"eval_steps_per_second": 6.392,
"step": 103500
},
{
"epoch": 9.115615549809352,
"grad_norm": 2.432450294494629,
"learning_rate": 2.456092577040997e-06,
"loss": 2.3129,
"step": 104000
},
{
"epoch": 9.115615549809352,
"eval_loss": 2.166337490081787,
"eval_runtime": 1114.9098,
"eval_samples_per_second": 818.272,
"eval_steps_per_second": 6.393,
"step": 104000
},
{
"epoch": 9.159442520927378,
"grad_norm": 2.5620574951171875,
"learning_rate": 2.307802634562267e-06,
"loss": 2.301,
"step": 104500
},
{
"epoch": 9.159442520927378,
"eval_loss": 2.164973258972168,
"eval_runtime": 1114.9958,
"eval_samples_per_second": 818.209,
"eval_steps_per_second": 6.393,
"step": 104500
},
{
"epoch": 9.203269492045404,
"grad_norm": 2.387254238128662,
"learning_rate": 2.163913081269864e-06,
"loss": 2.305,
"step": 105000
},
{
"epoch": 9.203269492045404,
"eval_loss": 2.1658222675323486,
"eval_runtime": 1114.9499,
"eval_samples_per_second": 818.243,
"eval_steps_per_second": 6.393,
"step": 105000
},
{
"epoch": 9.24709646316343,
"grad_norm": 2.389944553375244,
"learning_rate": 2.0247263046770465e-06,
"loss": 2.304,
"step": 105500
},
{
"epoch": 9.24709646316343,
"eval_loss": 2.1642627716064453,
"eval_runtime": 1115.1438,
"eval_samples_per_second": 818.101,
"eval_steps_per_second": 6.392,
"step": 105500
},
{
"epoch": 9.290923434281456,
"grad_norm": 2.293623924255371,
"learning_rate": 1.8897114415833084e-06,
"loss": 2.3042,
"step": 106000
},
{
"epoch": 9.290923434281456,
"eval_loss": 2.1653385162353516,
"eval_runtime": 1115.2546,
"eval_samples_per_second": 818.019,
"eval_steps_per_second": 6.391,
"step": 106000
},
{
"epoch": 9.334750405399483,
"grad_norm": 2.4690089225769043,
"learning_rate": 1.7594346197419676e-06,
"loss": 2.3025,
"step": 106500
},
{
"epoch": 9.334750405399483,
"eval_loss": 2.1647329330444336,
"eval_runtime": 1114.9105,
"eval_samples_per_second": 818.272,
"eval_steps_per_second": 6.393,
"step": 106500
},
{
"epoch": 9.378577376517509,
"grad_norm": 2.4114248752593994,
"learning_rate": 1.6333989588294241e-06,
"loss": 2.3024,
"step": 107000
},
{
"epoch": 9.378577376517509,
"eval_loss": 2.16414737701416,
"eval_runtime": 1116.7856,
"eval_samples_per_second": 816.898,
"eval_steps_per_second": 6.383,
"step": 107000
},
{
"epoch": 9.422404347635535,
"grad_norm": 2.6006863117218018,
"learning_rate": 1.5118944650351159e-06,
"loss": 2.3087,
"step": 107500
},
{
"epoch": 9.422404347635535,
"eval_loss": 2.1635189056396484,
"eval_runtime": 1114.9278,
"eval_samples_per_second": 818.259,
"eval_steps_per_second": 6.393,
"step": 107500
},
{
"epoch": 9.466231318753561,
"grad_norm": 2.226339340209961,
"learning_rate": 1.3949447000728782e-06,
"loss": 2.3026,
"step": 108000
},
{
"epoch": 9.466231318753561,
"eval_loss": 2.1628293991088867,
"eval_runtime": 1115.569,
"eval_samples_per_second": 817.789,
"eval_steps_per_second": 6.39,
"step": 108000
},
{
"epoch": 9.510058289871587,
"grad_norm": 2.69002628326416,
"learning_rate": 1.2825723424199298e-06,
"loss": 2.2984,
"step": 108500
},
{
"epoch": 9.510058289871587,
"eval_loss": 2.163651466369629,
"eval_runtime": 1115.1272,
"eval_samples_per_second": 818.113,
"eval_steps_per_second": 6.392,
"step": 108500
},
{
"epoch": 9.553885260989613,
"grad_norm": 2.3326609134674072,
"learning_rate": 1.1750101251986112e-06,
"loss": 2.3027,
"step": 109000
},
{
"epoch": 9.553885260989613,
"eval_loss": 2.163642168045044,
"eval_runtime": 1114.6312,
"eval_samples_per_second": 818.477,
"eval_steps_per_second": 6.395,
"step": 109000
},
{
"epoch": 9.59771223210764,
"grad_norm": 2.569121837615967,
"learning_rate": 1.0718478023763245e-06,
"loss": 2.3049,
"step": 109500
},
{
"epoch": 9.59771223210764,
"eval_loss": 2.1620688438415527,
"eval_runtime": 1114.7646,
"eval_samples_per_second": 818.379,
"eval_steps_per_second": 6.394,
"step": 109500
},
{
"epoch": 9.641539203225665,
"grad_norm": 2.3418686389923096,
"learning_rate": 9.733255406500857e-07,
"loss": 2.3032,
"step": 110000
},
{
"epoch": 9.641539203225665,
"eval_loss": 2.1615049839019775,
"eval_runtime": 1114.9932,
"eval_samples_per_second": 818.211,
"eval_steps_per_second": 6.393,
"step": 110000
},
{
"epoch": 9.685366174343692,
"grad_norm": 2.477689504623413,
"learning_rate": 8.794624451020555e-07,
"loss": 2.3032,
"step": 110500
},
{
"epoch": 9.685366174343692,
"eval_loss": 2.161015510559082,
"eval_runtime": 1116.4235,
"eval_samples_per_second": 817.163,
"eval_steps_per_second": 6.385,
"step": 110500
},
{
"epoch": 9.729193145461718,
"grad_norm": 2.637300729751587,
"learning_rate": 7.90276717325672e-07,
"loss": 2.3049,
"step": 111000
},
{
"epoch": 9.729193145461718,
"eval_loss": 2.162550210952759,
"eval_runtime": 1114.8952,
"eval_samples_per_second": 818.283,
"eval_steps_per_second": 6.393,
"step": 111000
},
{
"epoch": 9.773020116579744,
"grad_norm": 2.375706672668457,
"learning_rate": 7.057856518960599e-07,
"loss": 2.3014,
"step": 111500
},
{
"epoch": 9.773020116579744,
"eval_loss": 2.161914587020874,
"eval_runtime": 1116.0493,
"eval_samples_per_second": 817.437,
"eval_steps_per_second": 6.387,
"step": 111500
},
{
"epoch": 9.81684708769777,
"grad_norm": 2.4037861824035645,
"learning_rate": 6.261604809943755e-07,
"loss": 2.3023,
"step": 112000
},
{
"epoch": 9.81684708769777,
"eval_loss": 2.1608428955078125,
"eval_runtime": 1116.2862,
"eval_samples_per_second": 817.264,
"eval_steps_per_second": 6.385,
"step": 112000
},
{
"epoch": 9.860674058815796,
"grad_norm": 2.493039846420288,
"learning_rate": 5.510975114530553e-07,
"loss": 2.3028,
"step": 112500
},
{
"epoch": 9.860674058815796,
"eval_loss": 2.160830497741699,
"eval_runtime": 1116.2069,
"eval_samples_per_second": 817.322,
"eval_steps_per_second": 6.386,
"step": 112500
},
{
"epoch": 9.90450102993382,
"grad_norm": 2.5063636302948,
"learning_rate": 4.807755850286977e-07,
"loss": 2.3019,
"step": 113000
},
{
"epoch": 9.90450102993382,
"eval_loss": 2.1616785526275635,
"eval_runtime": 1116.3136,
"eval_samples_per_second": 817.243,
"eval_steps_per_second": 6.385,
"step": 113000
},
{
"epoch": 9.948328001051847,
"grad_norm": 2.589062213897705,
"learning_rate": 4.1520833829600813e-07,
"loss": 2.301,
"step": 113500
},
{
"epoch": 9.948328001051847,
"eval_loss": 2.160351276397705,
"eval_runtime": 1116.7915,
"eval_samples_per_second": 816.894,
"eval_steps_per_second": 6.383,
"step": 113500
},
{
"epoch": 9.992154972169873,
"grad_norm": 2.4170777797698975,
"learning_rate": 3.544084858193325e-07,
"loss": 2.3032,
"step": 114000
},
{
"epoch": 9.992154972169873,
"eval_loss": 2.159677743911743,
"eval_runtime": 1116.6266,
"eval_samples_per_second": 817.014,
"eval_steps_per_second": 6.384,
"step": 114000
},
{
"epoch": 10.035938116316782,
"grad_norm": 2.528834819793701,
"learning_rate": 2.9838781768708193e-07,
"loss": 2.2945,
"step": 114500
},
{
"epoch": 10.035938116316782,
"eval_loss": 2.161219835281372,
"eval_runtime": 1116.9968,
"eval_samples_per_second": 816.744,
"eval_steps_per_second": 6.381,
"step": 114500
},
{
"epoch": 10.079765087434808,
"grad_norm": 2.3111424446105957,
"learning_rate": 2.4715719722546714e-07,
"loss": 2.2963,
"step": 115000
},
{
"epoch": 10.079765087434808,
"eval_loss": 2.160301923751831,
"eval_runtime": 1117.2058,
"eval_samples_per_second": 816.591,
"eval_steps_per_second": 6.38,
"step": 115000
},
{
"epoch": 10.123592058552834,
"grad_norm": 2.635735034942627,
"learning_rate": 2.0072655889189772e-07,
"loss": 2.2986,
"step": 115500
},
{
"epoch": 10.123592058552834,
"eval_loss": 2.1600496768951416,
"eval_runtime": 1119.355,
"eval_samples_per_second": 815.023,
"eval_steps_per_second": 6.368,
"step": 115500
},
{
"epoch": 10.16741902967086,
"grad_norm": 2.228825807571411,
"learning_rate": 1.5918334476575646e-07,
"loss": 2.2922,
"step": 116000
},
{
"epoch": 10.16741902967086,
"eval_loss": 2.1609036922454834,
"eval_runtime": 1158.2359,
"eval_samples_per_second": 787.663,
"eval_steps_per_second": 6.154,
"step": 116000
},
{
"epoch": 10.211246000788886,
"grad_norm": 2.534865140914917,
"learning_rate": 1.2236910758539055e-07,
"loss": 2.3035,
"step": 116500
},
{
"epoch": 10.211246000788886,
"eval_loss": 2.1614086627960205,
"eval_runtime": 1211.6086,
"eval_samples_per_second": 752.966,
"eval_steps_per_second": 5.883,
"step": 116500
},
{
"epoch": 10.25507297190691,
"grad_norm": 2.4144797325134277,
"learning_rate": 9.043821229186567e-08,
"loss": 2.302,
"step": 117000
},
{
"epoch": 10.25507297190691,
"eval_loss": 2.15974760055542,
"eval_runtime": 1113.7288,
"eval_samples_per_second": 819.14,
"eval_steps_per_second": 6.4,
"step": 117000
},
{
"epoch": 10.298899943024937,
"grad_norm": 2.239013433456421,
"learning_rate": 6.32688733414294e-08,
"loss": 2.3009,
"step": 117500
},
{
"epoch": 10.298899943024937,
"eval_loss": 2.160125494003296,
"eval_runtime": 2061.4838,
"eval_samples_per_second": 442.545,
"eval_steps_per_second": 3.458,
"step": 117500
},
{
"epoch": 10.342726914142963,
"grad_norm": 2.6488566398620605,
"learning_rate": 4.093517548052761e-08,
"loss": 2.2942,
"step": 118000
},
{
"epoch": 10.342726914142963,
"eval_loss": 2.160935163497925,
"eval_runtime": 1218.013,
"eval_samples_per_second": 749.007,
"eval_steps_per_second": 5.852,
"step": 118000
},
{
"epoch": 10.386553885260989,
"grad_norm": 2.3960371017456055,
"learning_rate": 2.3441449579411632e-08,
"loss": 2.3022,
"step": 118500
},
{
"epoch": 10.386553885260989,
"eval_loss": 2.1597461700439453,
"eval_runtime": 1294.5854,
"eval_samples_per_second": 704.704,
"eval_steps_per_second": 5.506,
"step": 118500
},
{
"epoch": 10.430380856379015,
"grad_norm": 2.5293331146240234,
"learning_rate": 1.0791087958400558e-08,
"loss": 2.2948,
"step": 119000
},
{
"epoch": 10.430380856379015,
"eval_loss": 2.159837245941162,
"eval_runtime": 1253.9955,
"eval_samples_per_second": 727.515,
"eval_steps_per_second": 5.684,
"step": 119000
},
{
"epoch": 10.474207827497041,
"grad_norm": 2.4509096145629883,
"learning_rate": 2.9865437300630185e-09,
"loss": 2.3045,
"step": 119500
},
{
"epoch": 10.474207827497041,
"eval_loss": 2.1594982147216797,
"eval_runtime": 1207.0311,
"eval_samples_per_second": 755.821,
"eval_steps_per_second": 5.905,
"step": 119500
},
{
"epoch": 10.518034798615068,
"grad_norm": 2.336444616317749,
"learning_rate": 2.933032350604936e-11,
"loss": 2.2978,
"step": 120000
},
{
"epoch": 10.518034798615068,
"eval_loss": 2.161297559738159,
"eval_runtime": 1191.92,
"eval_samples_per_second": 765.404,
"eval_steps_per_second": 5.98,
"step": 120000
}
],
"logging_steps": 500,
"max_steps": 120000,
"num_input_tokens_seen": 0,
"num_train_epochs": 11,
"save_steps": 3000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 7.295615807101338e+18,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}