{"step": "10", "epoch": "0.0196753566158", "loss": "2.21839561462", "eval_loss": "", "grad_norm": "0.997185707092", "learning_rate": "0.0001", "entropy": "1.51200933158", "num_tokens": "158517", "mean_token_accuracy": "0.617804196477", "train_runtime": "", "timestamp": "2026-07-14T18:44:51.763785+00:00", "elapsed_seconds": "40.3268301521"} {"step": "20", "epoch": "0.0393507132317", "loss": "1.0074344635", "eval_loss": "", "grad_norm": "1.03053867817", "learning_rate": "0.0001", "entropy": "1.0494144395", "num_tokens": "315386", "mean_token_accuracy": "0.796838776767", "train_runtime": "", "timestamp": "2026-07-14T18:45:31.035504+00:00", "elapsed_seconds": "79.598546861"} {"step": "30", "epoch": "0.0590260698475", "loss": "0.544442272186", "eval_loss": "", "grad_norm": "0.422507971525", "learning_rate": "0.0001", "entropy": "0.548911824077", "num_tokens": "472899", "mean_token_accuracy": "0.898587629199", "train_runtime": "", "timestamp": "2026-07-14T18:46:11.591751+00:00", "elapsed_seconds": "120.154795361"} {"step": "40", "epoch": "0.0787014264634", "loss": "0.445441532135", "eval_loss": "", "grad_norm": "0.18211427331", "learning_rate": "0.0001", "entropy": "0.455530235171", "num_tokens": "629242", "mean_token_accuracy": "0.916029234231", "train_runtime": "", "timestamp": "2026-07-14T18:46:50.703015+00:00", "elapsed_seconds": "159.266057246"} {"step": "50", "epoch": "0.0983767830792", "loss": "0.451950931549", "eval_loss": "", "grad_norm": "0.175900384784", "learning_rate": "0.0001", "entropy": "0.460615222156", "num_tokens": "785551", "mean_token_accuracy": "0.911731639504", "train_runtime": "", "timestamp": "2026-07-14T18:47:30.680216+00:00", "elapsed_seconds": "199.243261393"} {"step": "60", "epoch": "0.118052139695", "loss": "0.427107477188", "eval_loss": "", "grad_norm": "0.218168973923", "learning_rate": "0.0001", "entropy": "0.443916998804", "num_tokens": "942530", "mean_token_accuracy": "0.914710514247", "train_runtime": "", "timestamp": "2026-07-14T18:48:10.859048+00:00", "elapsed_seconds": "239.422092887"} {"step": "70", "epoch": "0.137727496311", "loss": "0.397407078743", "eval_loss": "", "grad_norm": "0.257529675961", "learning_rate": "0.0001", "entropy": "0.416817698628", "num_tokens": "1100964", "mean_token_accuracy": "0.920619755983", "train_runtime": "", "timestamp": "2026-07-14T18:48:51.257122+00:00", "elapsed_seconds": "279.820165421"} {"step": "80", "epoch": "0.157402852927", "loss": "0.35759768486", "eval_loss": "", "grad_norm": "0.660029649734", "learning_rate": "0.0001", "entropy": "0.384742297977", "num_tokens": "1257044", "mean_token_accuracy": "0.924064183235", "train_runtime": "", "timestamp": "2026-07-14T18:49:30.413227+00:00", "elapsed_seconds": "318.97627022"} {"step": "90", "epoch": "0.177078209543", "loss": "0.35855255127", "eval_loss": "", "grad_norm": "0.264365077019", "learning_rate": "0.0001", "entropy": "0.391139079258", "num_tokens": "1414621", "mean_token_accuracy": "0.923739472032", "train_runtime": "", "timestamp": "2026-07-14T18:50:10.999452+00:00", "elapsed_seconds": "359.562497077"} {"step": "100", "epoch": "0.196753566158", "loss": "0.317103385925", "eval_loss": "", "grad_norm": "0.273194640875", "learning_rate": "0.0001", "entropy": "0.336241504923", "num_tokens": "1571856", "mean_token_accuracy": "0.932000268996", "train_runtime": "", "timestamp": "2026-07-14T18:50:50.553821+00:00", "elapsed_seconds": "399.116867291"} {"step": "110", "epoch": "0.216428922774", "loss": "0.315398597717", "eval_loss": "", "grad_norm": "0.224106535316", "learning_rate": "0.0001", "entropy": "0.332903936133", "num_tokens": "1729714", "mean_token_accuracy": "0.933503301442", "train_runtime": "", "timestamp": "2026-07-14T18:51:31.107001+00:00", "elapsed_seconds": "439.670047054"} {"step": "120", "epoch": "0.23610427939", "loss": "0.283270096779", "eval_loss": "", "grad_norm": "0.243651434779", "learning_rate": "0.0001", "entropy": "0.303971963003", "num_tokens": "1886650", "mean_token_accuracy": "0.938405682147", "train_runtime": "", "timestamp": "2026-07-14T18:52:10.758208+00:00", "elapsed_seconds": "479.321254092"} {"step": "130", "epoch": "0.255779636006", "loss": "0.277483892441", "eval_loss": "", "grad_norm": "0.242042064667", "learning_rate": "0.0001", "entropy": "0.299890926853", "num_tokens": "2042273", "mean_token_accuracy": "0.940673132241", "train_runtime": "", "timestamp": "2026-07-14T18:52:50.714737+00:00", "elapsed_seconds": "519.277783558"} {"step": "140", "epoch": "0.275454992622", "loss": "0.265112280846", "eval_loss": "", "grad_norm": "0.265905737877", "learning_rate": "0.0001", "entropy": "0.288989692181", "num_tokens": "2198932", "mean_token_accuracy": "0.942814520001", "train_runtime": "", "timestamp": "2026-07-14T18:53:30.145592+00:00", "elapsed_seconds": "558.708636761"} {"step": "150", "epoch": "0.295130349238", "loss": "0.254311847687", "eval_loss": "", "grad_norm": "0.307109236717", "learning_rate": "0.0001", "entropy": "0.265480846912", "num_tokens": "2355875", "mean_token_accuracy": "0.945721656084", "train_runtime": "", "timestamp": "2026-07-14T18:54:10.566345+00:00", "elapsed_seconds": "599.12936811"} {"step": "160", "epoch": "0.314805705853", "loss": "0.23861758709", "eval_loss": "", "grad_norm": "0.344656556845", "learning_rate": "0.0001", "entropy": "0.259159233049", "num_tokens": "2512427", "mean_token_accuracy": "0.948875762522", "train_runtime": "", "timestamp": "2026-07-14T18:54:50.199052+00:00", "elapsed_seconds": "638.762097128"} {"step": "170", "epoch": "0.334481062469", "loss": "0.230272626877", "eval_loss": "", "grad_norm": "0.261819094419", "learning_rate": "0.0001", "entropy": "0.242634578422", "num_tokens": "2668770", "mean_token_accuracy": "0.950659604371", "train_runtime": "", "timestamp": "2026-07-14T18:55:30.244558+00:00", "elapsed_seconds": "678.807603146"} {"step": "180", "epoch": "0.354156419085", "loss": "0.214873051643", "eval_loss": "", "grad_norm": "0.348735779524", "learning_rate": "0.0001", "entropy": "0.232795054093", "num_tokens": "2825377", "mean_token_accuracy": "0.954010221362", "train_runtime": "", "timestamp": "2026-07-14T18:56:09.792053+00:00", "elapsed_seconds": "718.355098992"} {"step": "190", "epoch": "0.373831775701", "loss": "0.206166386604", "eval_loss": "", "grad_norm": "0.238673120737", "learning_rate": "0.0001", "entropy": "0.220631313324", "num_tokens": "2982619", "mean_token_accuracy": "0.955823786557", "train_runtime": "", "timestamp": "2026-07-14T18:56:50.404094+00:00", "elapsed_seconds": "758.96713975"} {"step": "200", "epoch": "0.393507132317", "loss": "0.214299988747", "eval_loss": "", "grad_norm": "0.259331971407", "learning_rate": "0.0001", "entropy": "0.234532970004", "num_tokens": "3138939", "mean_token_accuracy": "0.954085548222", "train_runtime": "", "timestamp": "2026-07-14T18:57:29.415292+00:00", "elapsed_seconds": "797.978338393"} {"step": "210", "epoch": "0.413182488933", "loss": "0.199846196175", "eval_loss": "", "grad_norm": "0.242847457528", "learning_rate": "0.0001", "entropy": "0.212221397832", "num_tokens": "3294561", "mean_token_accuracy": "0.95643684268", "train_runtime": "", "timestamp": "2026-07-14T18:58:09.741501+00:00", "elapsed_seconds": "838.304546847"} {"step": "220", "epoch": "0.432857845548", "loss": "0.204166269302", "eval_loss": "", "grad_norm": "0.306981146336", "learning_rate": "0.0001", "entropy": "0.214753072709", "num_tokens": "3449991", "mean_token_accuracy": "0.956322589517", "train_runtime": "", "timestamp": "2026-07-14T18:58:49.004264+00:00", "elapsed_seconds": "877.567307537"} {"step": "230", "epoch": "0.452533202164", "loss": "0.201543879509", "eval_loss": "", "grad_norm": "0.249639883637", "learning_rate": "0.0001", "entropy": "0.216364040598", "num_tokens": "3608785", "mean_token_accuracy": "0.956451144814", "train_runtime": "", "timestamp": "2026-07-14T18:59:29.554834+00:00", "elapsed_seconds": "918.117879928"} {"step": "240", "epoch": "0.47220855878", "loss": "0.215132331848", "eval_loss": "", "grad_norm": "0.24389693141", "learning_rate": "0.0001", "entropy": "0.223825023696", "num_tokens": "3766845", "mean_token_accuracy": "0.953913928568", "train_runtime": "", "timestamp": "2026-07-14T19:00:09.144558+00:00", "elapsed_seconds": "957.707604611"} {"step": "250", "epoch": "0.491883915396", "loss": "0.200074696541", "eval_loss": "", "grad_norm": "0.322559267282", "learning_rate": "0.0001", "entropy": "0.216750285402", "num_tokens": "3923032", "mean_token_accuracy": "0.957909616828", "train_runtime": "", "timestamp": "2026-07-14T19:00:49.451045+00:00", "elapsed_seconds": "998.014089783"} {"step": "260", "epoch": "0.511559272012", "loss": "0.198160004616", "eval_loss": "", "grad_norm": "0.223266273737", "learning_rate": "0.0001", "entropy": "0.210631896928", "num_tokens": "4080458", "mean_token_accuracy": "0.957292881608", "train_runtime": "", "timestamp": "2026-07-14T19:01:28.755248+00:00", "elapsed_seconds": "1037.31829346"} {"step": "270", "epoch": "0.531234628628", "loss": "0.206540870667", "eval_loss": "", "grad_norm": "0.225164785981", "learning_rate": "0.0001", "entropy": "0.218400148116", "num_tokens": "4236536", "mean_token_accuracy": "0.955662851036", "train_runtime": "", "timestamp": "2026-07-14T19:02:09.002715+00:00", "elapsed_seconds": "1077.56576105"} {"step": "280", "epoch": "0.550909985243", "loss": "0.203662276268", "eval_loss": "", "grad_norm": "0.211283221841", "learning_rate": "0.0001", "entropy": "0.212336610816", "num_tokens": "4391657", "mean_token_accuracy": "0.955616168678", "train_runtime": "", "timestamp": "2026-07-14T19:02:48.202244+00:00", "elapsed_seconds": "1116.7652876"} {"step": "290", "epoch": "0.570585341859", "loss": "0.198586702347", "eval_loss": "", "grad_norm": "0.29632806778", "learning_rate": "0.0001", "entropy": "0.207531724125", "num_tokens": "4548276", "mean_token_accuracy": "0.957449166477", "train_runtime": "", "timestamp": "2026-07-14T19:03:28.562368+00:00", "elapsed_seconds": "1157.12541444"} {"step": "300", "epoch": "0.590260698475", "loss": "0.1769338727", "eval_loss": "", "grad_norm": "0.200340017676", "learning_rate": "0.0001", "entropy": "0.189514789172", "num_tokens": "4706349", "mean_token_accuracy": "0.961175942421", "train_runtime": "", "timestamp": "2026-07-14T19:04:08.011571+00:00", "elapsed_seconds": "1196.57461494"} {"step": "310", "epoch": "0.609936055091", "loss": "0.180926573277", "eval_loss": "", "grad_norm": "0.217008456588", "learning_rate": "0.0001", "entropy": "0.196929321997", "num_tokens": "4863585", "mean_token_accuracy": "0.96009849906", "train_runtime": "", "timestamp": "2026-07-14T19:04:48.498705+00:00", "elapsed_seconds": "1237.06175009"} {"step": "320", "epoch": "0.629611411707", "loss": "0.180410706997", "eval_loss": "", "grad_norm": "0.236014738679", "learning_rate": "0.0001", "entropy": "0.18719286155", "num_tokens": "5022342", "mean_token_accuracy": "0.960626663268", "train_runtime": "", "timestamp": "2026-07-14T19:05:28.044393+00:00", "elapsed_seconds": "1276.60743859"} {"step": "330", "epoch": "0.649286768323", "loss": "0.187188267708", "eval_loss": "", "grad_norm": "0.259057343006", "learning_rate": "0.0001", "entropy": "0.197457621247", "num_tokens": "5177117", "mean_token_accuracy": "0.958998320997", "train_runtime": "", "timestamp": "2026-07-14T19:06:07.805697+00:00", "elapsed_seconds": "1316.3687436"} {"step": "340", "epoch": "0.668962124939", "loss": "0.203676509857", "eval_loss": "", "grad_norm": "0.230080202222", "learning_rate": "0.0001", "entropy": "0.207781772502", "num_tokens": "5334589", "mean_token_accuracy": "0.956454566121", "train_runtime": "", "timestamp": "2026-07-14T19:06:47.379224+00:00", "elapsed_seconds": "1355.94226928"} {"step": "350", "epoch": "0.688637481554", "loss": "0.174643802643", "eval_loss": "", "grad_norm": "0.283878415823", "learning_rate": "0.0001", "entropy": "0.185111483", "num_tokens": "5491264", "mean_token_accuracy": "0.961374931037", "train_runtime": "", "timestamp": "2026-07-14T19:07:27.523734+00:00", "elapsed_seconds": "1396.08677869"} {"step": "360", "epoch": "0.70831283817", "loss": "0.179219591618", "eval_loss": "", "grad_norm": "0.24345164001", "learning_rate": "0.0001", "entropy": "0.196479166858", "num_tokens": "5648766", "mean_token_accuracy": "0.96104246974", "train_runtime": "", "timestamp": "2026-07-14T19:08:07.102058+00:00", "elapsed_seconds": "1435.66510349"} {"step": "370", "epoch": "0.727988194786", "loss": "0.172455787659", "eval_loss": "", "grad_norm": "0.217018336058", "learning_rate": "0.0001", "entropy": "0.181602787226", "num_tokens": "5805950", "mean_token_accuracy": "0.961948390305", "train_runtime": "", "timestamp": "2026-07-14T19:08:47.480806+00:00", "elapsed_seconds": "1476.04385117"} {"step": "380", "epoch": "0.747663551402", "loss": "0.17482407093", "eval_loss": "", "grad_norm": "0.328721493483", "learning_rate": "0.0001", "entropy": "0.180027039908", "num_tokens": "5962530", "mean_token_accuracy": "0.961873859167", "train_runtime": "", "timestamp": "2026-07-14T19:09:26.926417+00:00", "elapsed_seconds": "1515.48946346"} {"step": "390", "epoch": "0.767338908018", "loss": "0.162100684643", "eval_loss": "", "grad_norm": "0.200087547302", "learning_rate": "0.0001", "entropy": "0.176972093433", "num_tokens": "6119998", "mean_token_accuracy": "0.964109444618", "train_runtime": "", "timestamp": "2026-07-14T19:10:07.159783+00:00", "elapsed_seconds": "1555.72282812"} {"step": "400", "epoch": "0.787014264634", "loss": "0.183642709255", "eval_loss": "", "grad_norm": "0.196165248752", "learning_rate": "0.0001", "entropy": "0.189363373816", "num_tokens": "6276791", "mean_token_accuracy": "0.960221962631", "train_runtime": "", "timestamp": "2026-07-14T19:10:46.801680+00:00", "elapsed_seconds": "1595.36472525"} {"step": "410", "epoch": "0.806689621249", "loss": "0.171787154675", "eval_loss": "", "grad_norm": "0.245862558484", "learning_rate": "0.0001", "entropy": "0.182321485505", "num_tokens": "6433516", "mean_token_accuracy": "0.961653226614", "train_runtime": "", "timestamp": "2026-07-14T19:11:27.245900+00:00", "elapsed_seconds": "1635.80894558"} {"step": "420", "epoch": "0.826364977865", "loss": "0.182455682755", "eval_loss": "", "grad_norm": "0.325130581856", "learning_rate": "0.0001", "entropy": "0.191438901238", "num_tokens": "6590564", "mean_token_accuracy": "0.959084931016", "train_runtime": "", "timestamp": "2026-07-14T19:12:06.417007+00:00", "elapsed_seconds": "1674.98005193"} {"step": "430", "epoch": "0.846040334481", "loss": "0.169191372395", "eval_loss": "", "grad_norm": "0.207633405924", "learning_rate": "0.0001", "entropy": "0.178573282529", "num_tokens": "6747353", "mean_token_accuracy": "0.963288144767", "train_runtime": "", "timestamp": "2026-07-14T19:12:46.362587+00:00", "elapsed_seconds": "1714.92563345"} {"step": "440", "epoch": "0.865715691097", "loss": "0.180155730247", "eval_loss": "", "grad_norm": "0.206554561853", "learning_rate": "0.0001", "entropy": "0.18681143187", "num_tokens": "6902907", "mean_token_accuracy": "0.960263897479", "train_runtime": "", "timestamp": "2026-07-14T19:13:25.393102+00:00", "elapsed_seconds": "1753.95614771"} {"step": "450", "epoch": "0.885391047713", "loss": "0.171831595898", "eval_loss": "", "grad_norm": "0.30511072278", "learning_rate": "0.0001", "entropy": "0.181087859161", "num_tokens": "7059033", "mean_token_accuracy": "0.962434618175", "train_runtime": "", "timestamp": "2026-07-14T19:14:05.571981+00:00", "elapsed_seconds": "1794.13502563"} {"step": "460", "epoch": "0.905066404329", "loss": "0.180643391609", "eval_loss": "", "grad_norm": "0.196387454867", "learning_rate": "0.0001", "entropy": "0.188525561802", "num_tokens": "7216633", "mean_token_accuracy": "0.959945641458", "train_runtime": "", "timestamp": "2026-07-14T19:14:44.847650+00:00", "elapsed_seconds": "1833.4106959"} {"step": "470", "epoch": "0.924741760944", "loss": "0.193449866772", "eval_loss": "", "grad_norm": "0.19179905951", "learning_rate": "0.0001", "entropy": "0.196602920815", "num_tokens": "7373319", "mean_token_accuracy": "0.95812100023", "train_runtime": "", "timestamp": "2026-07-14T19:15:26.044097+00:00", "elapsed_seconds": "1874.60714292"} {"step": "480", "epoch": "0.94441711756", "loss": "0.177313435078", "eval_loss": "", "grad_norm": "0.155064806342", "learning_rate": "0.0001", "entropy": "0.188440449163", "num_tokens": "7530283", "mean_token_accuracy": "0.961460134387", "train_runtime": "", "timestamp": "2026-07-14T19:16:06.338099+00:00", "elapsed_seconds": "1914.90114522"} {"step": "490", "epoch": "0.964092474176", "loss": "0.180543804169", "eval_loss": "", "grad_norm": "0.233374238014", "learning_rate": "0.0001", "entropy": "0.187788728997", "num_tokens": "7687237", "mean_token_accuracy": "0.960137434304", "train_runtime": "", "timestamp": "2026-07-14T19:16:46.621608+00:00", "elapsed_seconds": "1955.18465457"} {"step": "500", "epoch": "0.983767830792", "loss": "0.180359601974", "eval_loss": "", "grad_norm": "0.180976226926", "learning_rate": "0.0001", "entropy": "0.188501783088", "num_tokens": "7844660", "mean_token_accuracy": "0.96057779789", "train_runtime": "", "timestamp": "2026-07-14T19:17:25.826646+00:00", "elapsed_seconds": "1994.38969213"} {"step": "509", "epoch": "1", "loss": "", "eval_loss": "0.480833500624", "grad_norm": "", "learning_rate": "", "entropy": "", "num_tokens": "", "mean_token_accuracy": "", "train_runtime": "", "timestamp": "2026-07-14T19:19:37.994260+00:00", "elapsed_seconds": "2126.55730501"} {"step": "510", "epoch": "1.00196753566", "loss": "0.192923069", "eval_loss": "", "grad_norm": "0.169916674495", "learning_rate": "0.0001", "entropy": "0.198045271675", "num_tokens": "7988594", "mean_token_accuracy": "0.957474518467", "train_runtime": "", "timestamp": "2026-07-14T19:19:42.166818+00:00", "elapsed_seconds": "2130.72986391"} {"step": "520", "epoch": "1.02164289228", "loss": "0.170230865479", "eval_loss": "", "grad_norm": "0.194753885269", "learning_rate": "0.0001", "entropy": "0.178488218039", "num_tokens": "8144390", "mean_token_accuracy": "0.961938048899", "train_runtime": "", "timestamp": "2026-07-14T19:20:21.674456+00:00", "elapsed_seconds": "2170.23750172"} {"step": "530", "epoch": "1.04131824889", "loss": "0.156556117535", "eval_loss": "", "grad_norm": "0.168322607875", "learning_rate": "0.0001", "entropy": "0.165742422082", "num_tokens": "8300636", "mean_token_accuracy": "0.965336105227", "train_runtime": "", "timestamp": "2026-07-14T19:21:01.779702+00:00", "elapsed_seconds": "2210.3427483"} {"step": "540", "epoch": "1.06099360551", "loss": "0.160328769684", "eval_loss": "", "grad_norm": "0.186233431101", "learning_rate": "0.0001", "entropy": "0.168560723402", "num_tokens": "8458859", "mean_token_accuracy": "0.96414308995", "train_runtime": "", "timestamp": "2026-07-14T19:21:41.348379+00:00", "elapsed_seconds": "2249.91142491"} {"step": "550", "epoch": "1.08066896212", "loss": "0.169278275967", "eval_loss": "", "grad_norm": "0.182504862547", "learning_rate": "0.0001", "entropy": "0.173748625629", "num_tokens": "8615963", "mean_token_accuracy": "0.963006226718", "train_runtime": "", "timestamp": "2026-07-14T19:22:21.535345+00:00", "elapsed_seconds": "2290.09839124"} {"step": "560", "epoch": "1.10034431874", "loss": "0.15963177681", "eval_loss": "", "grad_norm": "0.230876639485", "learning_rate": "0.0001", "entropy": "0.170929611102", "num_tokens": "8772742", "mean_token_accuracy": "0.964167003334", "train_runtime": "", "timestamp": "2026-07-14T19:23:01.254806+00:00", "elapsed_seconds": "2329.81785137"} {"step": "570", "epoch": "1.12001967536", "loss": "0.157126617432", "eval_loss": "", "grad_norm": "0.179838463664", "learning_rate": "0.0001", "entropy": "0.16031345129", "num_tokens": "8930284", "mean_token_accuracy": "0.964271454513", "train_runtime": "", "timestamp": "2026-07-14T19:23:41.828440+00:00", "elapsed_seconds": "2370.3914869"} {"step": "580", "epoch": "1.13969503197", "loss": "0.166155254841", "eval_loss": "", "grad_norm": "0.223575741053", "learning_rate": "0.0001", "entropy": "0.175235996023", "num_tokens": "9088333", "mean_token_accuracy": "0.963411171734", "train_runtime": "", "timestamp": "2026-07-14T19:24:21.736483+00:00", "elapsed_seconds": "2410.29952893"} {"step": "590", "epoch": "1.15937038859", "loss": "0.157854199409", "eval_loss": "", "grad_norm": "0.207558766007", "learning_rate": "0.0001", "entropy": "0.166331799515", "num_tokens": "9244311", "mean_token_accuracy": "0.964486956596", "train_runtime": "", "timestamp": "2026-07-14T19:25:02.048624+00:00", "elapsed_seconds": "2450.61167042"} {"step": "600", "epoch": "1.1790457452", "loss": "0.162935483456", "eval_loss": "", "grad_norm": "0.173033863306", "learning_rate": "0.0001", "entropy": "0.167879271507", "num_tokens": "9402415", "mean_token_accuracy": "0.963171319664", "train_runtime": "", "timestamp": "2026-07-14T19:25:42.017999+00:00", "elapsed_seconds": "2490.58104435"} {"step": "610", "epoch": "1.19872110182", "loss": "0.17940980196", "eval_loss": "", "grad_norm": "0.200073346496", "learning_rate": "0.0001", "entropy": "0.188126351219", "num_tokens": "9556833", "mean_token_accuracy": "0.960648794472", "train_runtime": "", "timestamp": "2026-07-14T19:26:22.097129+00:00", "elapsed_seconds": "2530.6601727"} {"step": "620", "epoch": "1.21839645844", "loss": "0.165559697151", "eval_loss": "", "grad_norm": "0.176193639636", "learning_rate": "0.0001", "entropy": "0.171528098173", "num_tokens": "9714854", "mean_token_accuracy": "0.962894457579", "train_runtime": "", "timestamp": "2026-07-14T19:27:01.449098+00:00", "elapsed_seconds": "2570.01214384"} {"step": "630", "epoch": "1.23807181505", "loss": "0.192057442665", "eval_loss": "", "grad_norm": "0.249208107591", "learning_rate": "0.0001", "entropy": "0.198998957127", "num_tokens": "9871371", "mean_token_accuracy": "0.957532766461", "train_runtime": "", "timestamp": "2026-07-14T19:27:41.929207+00:00", "elapsed_seconds": "2610.49225355"} {"step": "640", "epoch": "1.25774717167", "loss": "0.16299200058", "eval_loss": "", "grad_norm": "0.19560906291", "learning_rate": "0.0001", "entropy": "0.172278838418", "num_tokens": "10028132", "mean_token_accuracy": "0.964198562503", "train_runtime": "", "timestamp": "2026-07-14T19:28:21.258453+00:00", "elapsed_seconds": "2649.82149892"} {"step": "650", "epoch": "1.27742252828", "loss": "0.182843160629", "eval_loss": "", "grad_norm": "0.250791400671", "learning_rate": "0.0001", "entropy": "0.185129570402", "num_tokens": "10183998", "mean_token_accuracy": "0.959990593791", "train_runtime": "", "timestamp": "2026-07-14T19:29:01.072607+00:00", "elapsed_seconds": "2689.6356517"} {"step": "660", "epoch": "1.2970978849", "loss": "0.156658506393", "eval_loss": "", "grad_norm": "0.173409461975", "learning_rate": "0.0001", "entropy": "0.165276159532", "num_tokens": "10338966", "mean_token_accuracy": "0.96491754353", "train_runtime": "", "timestamp": "2026-07-14T19:29:39.981675+00:00", "elapsed_seconds": "2728.5447211"} {"step": "670", "epoch": "1.31677324152", "loss": "0.156918954849", "eval_loss": "", "grad_norm": "0.2154648453", "learning_rate": "0.0001", "entropy": "0.165447768662", "num_tokens": "10494154", "mean_token_accuracy": "0.964841979742", "train_runtime": "", "timestamp": "2026-07-14T19:30:20.537538+00:00", "elapsed_seconds": "2769.10058474"} {"step": "680", "epoch": "1.33644859813", "loss": "0.168604540825", "eval_loss": "", "grad_norm": "0.202249929309", "learning_rate": "0.0001", "entropy": "0.174681568705", "num_tokens": "10650728", "mean_token_accuracy": "0.962572240829", "train_runtime": "", "timestamp": "2026-07-14T19:30:59.771538+00:00", "elapsed_seconds": "2808.33458337"} {"step": "690", "epoch": "1.35612395475", "loss": "0.179817044735", "eval_loss": "", "grad_norm": "0.180585950613", "learning_rate": "0.0001", "entropy": "0.184981219843", "num_tokens": "10808084", "mean_token_accuracy": "0.960407233238", "train_runtime": "", "timestamp": "2026-07-14T19:31:40.333487+00:00", "elapsed_seconds": "2848.89653316"} {"step": "700", "epoch": "1.37579931136", "loss": "0.17117511034", "eval_loss": "", "grad_norm": "0.189327448606", "learning_rate": "0.0001", "entropy": "0.179342577234", "num_tokens": "10965357", "mean_token_accuracy": "0.962315896153", "train_runtime": "", "timestamp": "2026-07-14T19:32:20.034892+00:00", "elapsed_seconds": "2888.597938"} {"step": "710", "epoch": "1.39547466798", "loss": "0.163115501404", "eval_loss": "", "grad_norm": "0.14550216496", "learning_rate": "0.0001", "entropy": "0.170794568304", "num_tokens": "11122970", "mean_token_accuracy": "0.963731876016", "train_runtime": "", "timestamp": "2026-07-14T19:33:00.055825+00:00", "elapsed_seconds": "2928.61887098"} {"step": "720", "epoch": "1.41515002459", "loss": "0.166223096848", "eval_loss": "", "grad_norm": "0.197181358933", "learning_rate": "0.0001", "entropy": "0.174024736509", "num_tokens": "11279748", "mean_token_accuracy": "0.962751935422", "train_runtime": "", "timestamp": "2026-07-14T19:33:39.118755+00:00", "elapsed_seconds": "2967.68180075"} {"step": "730", "epoch": "1.43482538121", "loss": "0.171106719971", "eval_loss": "", "grad_norm": "0.232188314199", "learning_rate": "0.0001", "entropy": "0.175083556771", "num_tokens": "11437649", "mean_token_accuracy": "0.962013469636", "train_runtime": "", "timestamp": "2026-07-14T19:34:19.410048+00:00", "elapsed_seconds": "3007.9730946"} {"step": "740", "epoch": "1.45450073783", "loss": "0.159269690514", "eval_loss": "", "grad_norm": "0.179410859942", "learning_rate": "0.0001", "entropy": "0.167735586967", "num_tokens": "11595537", "mean_token_accuracy": "0.964913637936", "train_runtime": "", "timestamp": "2026-07-14T19:34:59.021640+00:00", "elapsed_seconds": "3047.58468635"} {"step": "750", "epoch": "1.47417609444", "loss": "0.168200385571", "eval_loss": "", "grad_norm": "0.155719816685", "learning_rate": "0.0001", "entropy": "0.175214201398", "num_tokens": "11753054", "mean_token_accuracy": "0.962682126462", "train_runtime": "", "timestamp": "2026-07-14T19:35:39.483000+00:00", "elapsed_seconds": "3088.04604582"} {"step": "760", "epoch": "1.49385145106", "loss": "0.14346704483", "eval_loss": "", "grad_norm": "0.221360266209", "learning_rate": "0.0001", "entropy": "0.154037842248", "num_tokens": "11911753", "mean_token_accuracy": "0.968222369254", "train_runtime": "", "timestamp": "2026-07-14T19:36:18.999097+00:00", "elapsed_seconds": "3127.56214216"} {"step": "770", "epoch": "1.51352680767", "loss": "0.161464035511", "eval_loss": "", "grad_norm": "0.167245700955", "learning_rate": "0.0001", "entropy": "0.165353834908", "num_tokens": "12069142", "mean_token_accuracy": "0.963533814251", "train_runtime": "", "timestamp": "2026-07-14T19:36:59.202932+00:00", "elapsed_seconds": "3167.76597772"} {"step": "780", "epoch": "1.53320216429", "loss": "0.156456899643", "eval_loss": "", "grad_norm": "0.17038269341", "learning_rate": "0.0001", "entropy": "0.165936999302", "num_tokens": "12224271", "mean_token_accuracy": "0.96456181556", "train_runtime": "", "timestamp": "2026-07-14T19:37:37.739912+00:00", "elapsed_seconds": "3206.30295782"} {"step": "790", "epoch": "1.55287752091", "loss": "0.162909126282", "eval_loss": "", "grad_norm": "0.194951727986", "learning_rate": "0.0001", "entropy": "0.166183103435", "num_tokens": "12380914", "mean_token_accuracy": "0.963615015149", "train_runtime": "", "timestamp": "2026-07-14T19:38:17.951802+00:00", "elapsed_seconds": "3246.51484807"} {"step": "800", "epoch": "1.57255287752", "loss": "0.162587237358", "eval_loss": "", "grad_norm": "0.175505697727", "learning_rate": "0.0001", "entropy": "0.170294051804", "num_tokens": "12538265", "mean_token_accuracy": "0.963853444159", "train_runtime": "", "timestamp": "2026-07-14T19:38:57.359451+00:00", "elapsed_seconds": "3285.92249702"} {"step": "810", "epoch": "1.59222823414", "loss": "0.16598303318", "eval_loss": "", "grad_norm": "0.182322755456", "learning_rate": "0.0001", "entropy": "0.171620354988", "num_tokens": "12694472", "mean_token_accuracy": "0.962860387564", "train_runtime": "", "timestamp": "2026-07-14T19:39:37.707953+00:00", "elapsed_seconds": "3326.2709987"} {"step": "820", "epoch": "1.61190359075", "loss": "0.166602897644", "eval_loss": "", "grad_norm": "0.162591278553", "learning_rate": "0.0001", "entropy": "0.173711701855", "num_tokens": "12852241", "mean_token_accuracy": "0.962746998668", "train_runtime": "", "timestamp": "2026-07-14T19:40:17.543353+00:00", "elapsed_seconds": "3366.10638842"} {"step": "830", "epoch": "1.63157894737", "loss": "0.173879754543", "eval_loss": "", "grad_norm": "0.179233163595", "learning_rate": "0.0001", "entropy": "0.180813023262", "num_tokens": "13010313", "mean_token_accuracy": "0.960821950436", "train_runtime": "", "timestamp": "2026-07-14T19:40:58.733570+00:00", "elapsed_seconds": "3407.29661541"} {"step": "840", "epoch": "1.65125430398", "loss": "0.175928378105", "eval_loss": "", "grad_norm": "0.155069187284", "learning_rate": "0.0001", "entropy": "0.180705674551", "num_tokens": "13167919", "mean_token_accuracy": "0.960775198042", "train_runtime": "", "timestamp": "2026-07-14T19:41:38.127878+00:00", "elapsed_seconds": "3446.69092196"} {"step": "850", "epoch": "1.6709296606", "loss": "0.156295228004", "eval_loss": "", "grad_norm": "0.187289491296", "learning_rate": "0.0001", "entropy": "0.163406656217", "num_tokens": "13326698", "mean_token_accuracy": "0.964838838577", "train_runtime": "", "timestamp": "2026-07-14T19:42:18.752868+00:00", "elapsed_seconds": "3487.3159135"} {"step": "860", "epoch": "1.69060501722", "loss": "0.166846621037", "eval_loss": "", "grad_norm": "0.162943869829", "learning_rate": "0.0001", "entropy": "0.173019717634", "num_tokens": "13483225", "mean_token_accuracy": "0.962671551108", "train_runtime": "", "timestamp": "2026-07-14T19:42:57.972132+00:00", "elapsed_seconds": "3526.53517718"} {"step": "870", "epoch": "1.71028037383", "loss": "0.175749349594", "eval_loss": "", "grad_norm": "0.174129873514", "learning_rate": "0.0001", "entropy": "0.181726143695", "num_tokens": "13639265", "mean_token_accuracy": "0.960963216424", "train_runtime": "", "timestamp": "2026-07-14T19:43:37.800757+00:00", "elapsed_seconds": "3566.36380294"} {"step": "880", "epoch": "1.72995573045", "loss": "0.147835624218", "eval_loss": "", "grad_norm": "0.167158782482", "learning_rate": "0.0001", "entropy": "0.154400302656", "num_tokens": "13797228", "mean_token_accuracy": "0.966271243989", "train_runtime": "", "timestamp": "2026-07-14T19:44:17.466713+00:00", "elapsed_seconds": "3606.02975898"} {"step": "890", "epoch": "1.74963108706", "loss": "0.16417195797", "eval_loss": "", "grad_norm": "0.196655958891", "learning_rate": "0.0001", "entropy": "0.170779196545", "num_tokens": "13954300", "mean_token_accuracy": "0.963016964495", "train_runtime": "", "timestamp": "2026-07-14T19:44:57.876500+00:00", "elapsed_seconds": "3646.43954604"} {"step": "900", "epoch": "1.76930644368", "loss": "0.156272256374", "eval_loss": "", "grad_norm": "0.16130194068", "learning_rate": "0.0001", "entropy": "0.164454833046", "num_tokens": "14111213", "mean_token_accuracy": "0.964544859529", "train_runtime": "", "timestamp": "2026-07-14T19:45:37.195299+00:00", "elapsed_seconds": "3685.75834587"} {"step": "910", "epoch": "1.7889818003", "loss": "0.163049316406", "eval_loss": "", "grad_norm": "0.136302247643", "learning_rate": "0.0001", "entropy": "0.169371592253", "num_tokens": "14267408", "mean_token_accuracy": "0.963653604686", "train_runtime": "", "timestamp": "2026-07-14T19:46:17.611788+00:00", "elapsed_seconds": "3726.17483362"} {"step": "920", "epoch": "1.80865715691", "loss": "0.147612285614", "eval_loss": "", "grad_norm": "0.16987170279", "learning_rate": "0.0001", "entropy": "0.15369244311", "num_tokens": "14424482", "mean_token_accuracy": "0.966288872063", "train_runtime": "", "timestamp": "2026-07-14T19:46:57.069799+00:00", "elapsed_seconds": "3765.63284427"} {"step": "930", "epoch": "1.82833251353", "loss": "0.151848042011", "eval_loss": "", "grad_norm": "0.155094489455", "learning_rate": "0.0001", "entropy": "0.158277668338", "num_tokens": "14581898", "mean_token_accuracy": "0.965862759948", "train_runtime": "", "timestamp": "2026-07-14T19:47:37.633555+00:00", "elapsed_seconds": "3806.19659956"} {"step": "940", "epoch": "1.84800787014", "loss": "0.161747670174", "eval_loss": "", "grad_norm": "0.176779091358", "learning_rate": "0.0001", "entropy": "0.167998809647", "num_tokens": "14739682", "mean_token_accuracy": "0.963628257811", "train_runtime": "", "timestamp": "2026-07-14T19:48:16.925203+00:00", "elapsed_seconds": "3845.48824898"} {"step": "950", "epoch": "1.86768322676", "loss": "0.175212359428", "eval_loss": "", "grad_norm": "0.186388149858", "learning_rate": "0.0001", "entropy": "0.179522324633", "num_tokens": "14897444", "mean_token_accuracy": "0.961017121375", "train_runtime": "", "timestamp": "2026-07-14T19:48:57.156443+00:00", "elapsed_seconds": "3885.71948934"} {"step": "960", "epoch": "1.88735858337", "loss": "0.158414626122", "eval_loss": "", "grad_norm": "0.143919214606", "learning_rate": "0.0001", "entropy": "0.163319427148", "num_tokens": "15053687", "mean_token_accuracy": "0.964056003094", "train_runtime": "", "timestamp": "2026-07-14T19:49:36.454119+00:00", "elapsed_seconds": "3925.01716572"} {"step": "970", "epoch": "1.90703393999", "loss": "0.176569092274", "eval_loss": "", "grad_norm": "0.212138965726", "learning_rate": "0.0001", "entropy": "0.18215863388", "num_tokens": "15210316", "mean_token_accuracy": "0.960795244575", "train_runtime": "", "timestamp": "2026-07-14T19:50:16.690489+00:00", "elapsed_seconds": "3965.25353464"} {"step": "980", "epoch": "1.92670929661", "loss": "0.158397960663", "eval_loss": "", "grad_norm": "0.177053377032", "learning_rate": "0.0001", "entropy": "0.166588350572", "num_tokens": "15367289", "mean_token_accuracy": "0.964338231087", "train_runtime": "", "timestamp": "2026-07-14T19:50:55.920110+00:00", "elapsed_seconds": "4004.48315612"} {"step": "990", "epoch": "1.94638465322", "loss": "0.172202885151", "eval_loss": "", "grad_norm": "0.198846206069", "learning_rate": "0.0001", "entropy": "0.173680017237", "num_tokens": "15519567", "mean_token_accuracy": "0.962071706355", "train_runtime": "", "timestamp": "2026-07-14T19:51:34.604574+00:00", "elapsed_seconds": "4043.16762026"} {"step": "1000", "epoch": "1.96606000984", "loss": "0.135841083527", "eval_loss": "", "grad_norm": "0.173086538911", "learning_rate": "0.0001", "entropy": "0.145909713674", "num_tokens": "15677796", "mean_token_accuracy": "0.968235512078", "train_runtime": "", "timestamp": "2026-07-14T19:52:13.740978+00:00", "elapsed_seconds": "4082.30402441"} {"step": "1010", "epoch": "1.98573536645", "loss": "0.169320774078", "eval_loss": "", "grad_norm": "0.182816982269", "learning_rate": "0.0001", "entropy": "0.173335280083", "num_tokens": "15834854", "mean_token_accuracy": "0.962027944624", "train_runtime": "", "timestamp": "2026-07-14T19:52:54.082399+00:00", "elapsed_seconds": "4122.64544415"} {"step": "1018", "epoch": "2", "loss": "", "eval_loss": "0.503623247147", "grad_norm": "", "learning_rate": "", "entropy": "", "num_tokens": "", "mean_token_accuracy": "", "train_runtime": "", "timestamp": "2026-07-14T19:55:03.085112+00:00", "elapsed_seconds": "4251.64815671"} {"step": "1020", "epoch": "2.00393507132", "loss": "0.156750667095", "eval_loss": "", "grad_norm": "0.21632951498", "learning_rate": "0.0001", "entropy": "0.174239883048", "num_tokens": "15980450", "mean_token_accuracy": "0.96212148022", "train_runtime": "", "timestamp": "2026-07-14T19:55:11.229820+00:00", "elapsed_seconds": "4259.79286485"} {"step": "1030", "epoch": "2.02361042794", "loss": "0.16210129261", "eval_loss": "", "grad_norm": "0.189968839288", "learning_rate": "0.0001", "entropy": "0.16485402789", "num_tokens": "16135755", "mean_token_accuracy": "0.963425774872", "train_runtime": "", "timestamp": "2026-07-14T19:55:51.178359+00:00", "elapsed_seconds": "4299.74140436"} {"step": "1040", "epoch": "2.04328578455", "loss": "0.151982796192", "eval_loss": "", "grad_norm": "0.186117559671", "learning_rate": "0.0001", "entropy": "0.164776344784", "num_tokens": "16293622", "mean_token_accuracy": "0.96450523138", "train_runtime": "", "timestamp": "2026-07-14T19:56:30.672001+00:00", "elapsed_seconds": "4339.23504656"} {"step": "1050", "epoch": "2.06296114117", "loss": "0.163860476017", "eval_loss": "", "grad_norm": "0.191996067762", "learning_rate": "0.0001", "entropy": "0.16807874972", "num_tokens": "16449011", "mean_token_accuracy": "0.962708187103", "train_runtime": "", "timestamp": "2026-07-14T19:57:10.452525+00:00", "elapsed_seconds": "4379.01557092"} {"step": "1060", "epoch": "2.08263649779", "loss": "0.172380006313", "eval_loss": "", "grad_norm": "0.209191724658", "learning_rate": "0.0001", "entropy": "0.179409135506", "num_tokens": "16606544", "mean_token_accuracy": "0.961136734486", "train_runtime": "", "timestamp": "2026-07-14T19:57:49.831844+00:00", "elapsed_seconds": "4418.39488819"} {"step": "1070", "epoch": "2.1023118544", "loss": "0.141785228252", "eval_loss": "", "grad_norm": "0.14348590374", "learning_rate": "0.0001", "entropy": "0.150052259676", "num_tokens": "16762655", "mean_token_accuracy": "0.967867693305", "train_runtime": "", "timestamp": "2026-07-14T19:58:29.903173+00:00", "elapsed_seconds": "4458.46621657"} {"step": "1080", "epoch": "2.12198721102", "loss": "0.158943665028", "eval_loss": "", "grad_norm": "0.173628717661", "learning_rate": "0.0001", "entropy": "0.165021989681", "num_tokens": "16918189", "mean_token_accuracy": "0.963940601051", "train_runtime": "", "timestamp": "2026-07-14T19:59:09.353150+00:00", "elapsed_seconds": "4497.9161958"} {"step": "1090", "epoch": "2.14166256763", "loss": "0.161983144283", "eval_loss": "", "grad_norm": "0.170995950699", "learning_rate": "0.0001", "entropy": "0.169115608837", "num_tokens": "17074380", "mean_token_accuracy": "0.9631606251", "train_runtime": "", "timestamp": "2026-07-14T19:59:49.097296+00:00", "elapsed_seconds": "4537.66034182"} {"step": "1100", "epoch": "2.16133792425", "loss": "0.144085657597", "eval_loss": "", "grad_norm": "0.184660971165", "learning_rate": "0.0001", "entropy": "0.150382646453", "num_tokens": "17231870", "mean_token_accuracy": "0.966789248586", "train_runtime": "", "timestamp": "2026-07-14T20:00:28.615763+00:00", "elapsed_seconds": "4577.17880887"} {"step": "1110", "epoch": "2.18101328087", "loss": "0.138406217098", "eval_loss": "", "grad_norm": "0.156137287617", "learning_rate": "0.0001", "entropy": "0.145552860852", "num_tokens": "17390150", "mean_token_accuracy": "0.968244227767", "train_runtime": "", "timestamp": "2026-07-14T20:01:08.932935+00:00", "elapsed_seconds": "4617.49598119"} {"step": "1120", "epoch": "2.20068863748", "loss": "0.149384868145", "eval_loss": "", "grad_norm": "0.188025072217", "learning_rate": "0.0001", "entropy": "0.158229852095", "num_tokens": "17547602", "mean_token_accuracy": "0.966268263757", "train_runtime": "", "timestamp": "2026-07-14T20:01:48.411387+00:00", "elapsed_seconds": "4656.97443159"} {"step": "1130", "epoch": "2.2203639941", "loss": "0.155771589279", "eval_loss": "", "grad_norm": "0.181949421763", "learning_rate": "0.0001", "entropy": "0.159846979193", "num_tokens": "17704171", "mean_token_accuracy": "0.964384664595", "train_runtime": "", "timestamp": "2026-07-14T20:02:28.405767+00:00", "elapsed_seconds": "4696.96881314"} {"step": "1140", "epoch": "2.24003935071", "loss": "0.150599765778", "eval_loss": "", "grad_norm": "0.185370415449", "learning_rate": "0.0001", "entropy": "0.159115260746", "num_tokens": "17861739", "mean_token_accuracy": "0.965643018484", "train_runtime": "", "timestamp": "2026-07-14T20:03:07.586113+00:00", "elapsed_seconds": "4736.14915861"} {"step": "1150", "epoch": "2.25971470733", "loss": "0.143140876293", "eval_loss": "", "grad_norm": "0.200799316168", "learning_rate": "0.0001", "entropy": "0.150902107451", "num_tokens": "18019056", "mean_token_accuracy": "0.966995790601", "train_runtime": "", "timestamp": "2026-07-14T20:03:47.158333+00:00", "elapsed_seconds": "4775.72137882"} {"step": "1160", "epoch": "2.27939006394", "loss": "0.150355446339", "eval_loss": "", "grad_norm": "0.182861015201", "learning_rate": "0.0001", "entropy": "0.15370692974", "num_tokens": "18175722", "mean_token_accuracy": "0.965399813652", "train_runtime": "", "timestamp": "2026-07-14T20:04:26.406353+00:00", "elapsed_seconds": "4814.96939667"} {"step": "1170", "epoch": "2.29906542056", "loss": "0.15268086195", "eval_loss": "", "grad_norm": "0.213103458285", "learning_rate": "0.0001", "entropy": "0.160970865935", "num_tokens": "18331478", "mean_token_accuracy": "0.965237861872", "train_runtime": "", "timestamp": "2026-07-14T20:05:06.693820+00:00", "elapsed_seconds": "4855.25686449"} {"step": "1180", "epoch": "2.31874077718", "loss": "0.14596208334", "eval_loss": "", "grad_norm": "0.158253356814", "learning_rate": "0.0001", "entropy": "0.151732229069", "num_tokens": "18487987", "mean_token_accuracy": "0.966772224009", "train_runtime": "", "timestamp": "2026-07-14T20:05:46.624121+00:00", "elapsed_seconds": "4895.18716697"} {"step": "1190", "epoch": "2.33841613379", "loss": "0.144477832317", "eval_loss": "", "grad_norm": "0.146822363138", "learning_rate": "0.0001", "entropy": "0.148501190729", "num_tokens": "18645678", "mean_token_accuracy": "0.967359808087", "train_runtime": "", "timestamp": "2026-07-14T20:06:27.198857+00:00", "elapsed_seconds": "4935.76190269"} {"step": "1200", "epoch": "2.35809149041", "loss": "0.161581110954", "eval_loss": "", "grad_norm": "0.169999018312", "learning_rate": "0.0001", "entropy": "0.16736223828", "num_tokens": "18803500", "mean_token_accuracy": "0.963338895142", "train_runtime": "", "timestamp": "2026-07-14T20:07:06.846514+00:00", "elapsed_seconds": "4975.40955758"} {"step": "1210", "epoch": "2.37776684702", "loss": "0.153406262398", "eval_loss": "", "grad_norm": "0.205819413066", "learning_rate": "0.0001", "entropy": "0.160941473302", "num_tokens": "18961366", "mean_token_accuracy": "0.965424561501", "train_runtime": "", "timestamp": "2026-07-14T20:07:47.214742+00:00", "elapsed_seconds": "5015.77778801"} {"step": "1220", "epoch": "2.39744220364", "loss": "0.136192810535", "eval_loss": "", "grad_norm": "0.190873071551", "learning_rate": "0.0001", "entropy": "0.142981468607", "num_tokens": "19119178", "mean_token_accuracy": "0.96834358573", "train_runtime": "", "timestamp": "2026-07-14T20:08:26.742055+00:00", "elapsed_seconds": "5055.30510108"} {"step": "1230", "epoch": "2.41711756026", "loss": "0.141453588009", "eval_loss": "", "grad_norm": "0.159980386496", "learning_rate": "0.0001", "entropy": "0.145217145327", "num_tokens": "19275993", "mean_token_accuracy": "0.968073041737", "train_runtime": "", "timestamp": "2026-07-14T20:09:06.961714+00:00", "elapsed_seconds": "5095.52476001"} {"step": "1240", "epoch": "2.43679291687", "loss": "0.148014056683", "eval_loss": "", "grad_norm": "0.153729602695", "learning_rate": "0.0001", "entropy": "0.158173099998", "num_tokens": "19432551", "mean_token_accuracy": "0.966497783363", "train_runtime": "", "timestamp": "2026-07-14T20:09:46.420724+00:00", "elapsed_seconds": "5134.98376955"} {"step": "1250", "epoch": "2.45646827349", "loss": "0.163712227345", "eval_loss": "", "grad_norm": "0.168259471655", "learning_rate": "0.0001", "entropy": "0.167730315216", "num_tokens": "19589038", "mean_token_accuracy": "0.962808711827", "train_runtime": "", "timestamp": "2026-07-14T20:10:26.663478+00:00", "elapsed_seconds": "5175.22652365"} {"step": "1260", "epoch": "2.4761436301", "loss": "0.127088427544", "eval_loss": "", "grad_norm": "0.165303364396", "learning_rate": "0.0001", "entropy": "0.133041086979", "num_tokens": "19745335", "mean_token_accuracy": "0.970423710346", "train_runtime": "", "timestamp": "2026-07-14T20:11:05.915422+00:00", "elapsed_seconds": "5214.47846581"} {"step": "1270", "epoch": "2.49581898672", "loss": "0.159169518948", "eval_loss": "", "grad_norm": "0.21293412149", "learning_rate": "0.0001", "entropy": "0.165325385705", "num_tokens": "19901135", "mean_token_accuracy": "0.963794569671", "train_runtime": "", "timestamp": "2026-07-14T20:11:46.061351+00:00", "elapsed_seconds": "5254.62439666"} {"step": "1280", "epoch": "2.51549434333", "loss": "0.154375171661", "eval_loss": "", "grad_norm": "0.197351962328", "learning_rate": "0.0001", "entropy": "0.159839222021", "num_tokens": "20058459", "mean_token_accuracy": "0.964553439617", "train_runtime": "", "timestamp": "2026-07-14T20:12:25.361773+00:00", "elapsed_seconds": "5293.9248188"} {"step": "1290", "epoch": "2.53516969995", "loss": "0.153488874435", "eval_loss": "", "grad_norm": "0.18740414083", "learning_rate": "0.0001", "entropy": "0.161631961539", "num_tokens": "20216596", "mean_token_accuracy": "0.964601299167", "train_runtime": "", "timestamp": "2026-07-14T20:13:05.881831+00:00", "elapsed_seconds": "5334.44487748"} {"step": "1300", "epoch": "2.55484505657", "loss": "0.147537398338", "eval_loss": "", "grad_norm": "0.178495824337", "learning_rate": "0.0001", "entropy": "0.154408513475", "num_tokens": "20374020", "mean_token_accuracy": "0.966325297952", "train_runtime": "", "timestamp": "2026-07-14T20:13:45.465191+00:00", "elapsed_seconds": "5374.02823627"} {"step": "1310", "epoch": "2.57452041318", "loss": "0.148759007454", "eval_loss": "", "grad_norm": "0.165089562535", "learning_rate": "0.0001", "entropy": "0.151681568567", "num_tokens": "20531138", "mean_token_accuracy": "0.966131106019", "train_runtime": "", "timestamp": "2026-07-14T20:14:25.818427+00:00", "elapsed_seconds": "5414.38147254"} {"step": "1320", "epoch": "2.5941957698", "loss": "0.168530833721", "eval_loss": "", "grad_norm": "0.183519527316", "learning_rate": "0.0001", "entropy": "0.176336678024", "num_tokens": "20686701", "mean_token_accuracy": "0.961573958397", "train_runtime": "", "timestamp": "2026-07-14T20:15:04.997962+00:00", "elapsed_seconds": "5453.56100702"} {"step": "1330", "epoch": "2.61387112641", "loss": "0.142667996883", "eval_loss": "", "grad_norm": "0.177817106247", "learning_rate": "0.0001", "entropy": "0.150646794215", "num_tokens": "20843865", "mean_token_accuracy": "0.967578789592", "train_runtime": "", "timestamp": "2026-07-14T20:15:45.484718+00:00", "elapsed_seconds": "5494.04776416"} {"step": "1340", "epoch": "2.63354648303", "loss": "0.168079650402", "eval_loss": "", "grad_norm": "0.189123302698", "learning_rate": "0.0001", "entropy": "0.17436240688", "num_tokens": "21000133", "mean_token_accuracy": "0.962020015717", "train_runtime": "", "timestamp": "2026-07-14T20:16:24.643629+00:00", "elapsed_seconds": "5533.20667599"} {"step": "1350", "epoch": "2.65322183965", "loss": "0.160590958595", "eval_loss": "", "grad_norm": "0.178365811706", "learning_rate": "0.0001", "entropy": "0.164238455892", "num_tokens": "21155516", "mean_token_accuracy": "0.964021879435", "train_runtime": "", "timestamp": "2026-07-14T20:17:04.731592+00:00", "elapsed_seconds": "5573.29463823"} {"step": "1360", "epoch": "2.67289719626", "loss": "0.165736973286", "eval_loss": "", "grad_norm": "0.17040604353", "learning_rate": "0.0001", "entropy": "0.173429191206", "num_tokens": "21311602", "mean_token_accuracy": "0.962552376091", "train_runtime": "", "timestamp": "2026-07-14T20:17:44.004758+00:00", "elapsed_seconds": "5612.56780189"} {"step": "1370", "epoch": "2.69257255288", "loss": "0.141857481003", "eval_loss": "", "grad_norm": "0.173059791327", "learning_rate": "0.0001", "entropy": "0.146332843136", "num_tokens": "21469833", "mean_token_accuracy": "0.967443062365", "train_runtime": "", "timestamp": "2026-07-14T20:18:24.917303+00:00", "elapsed_seconds": "5653.48034912"} {"step": "1380", "epoch": "2.71224790949", "loss": "0.144333839417", "eval_loss": "", "grad_norm": "0.15543037653", "learning_rate": "0.0001", "entropy": "0.150063864421", "num_tokens": "21626372", "mean_token_accuracy": "0.967242586613", "train_runtime": "", "timestamp": "2026-07-14T20:19:03.713962+00:00", "elapsed_seconds": "5692.27700782"} {"step": "1390", "epoch": "2.73192326611", "loss": "0.149240171909", "eval_loss": "", "grad_norm": "0.209980487823", "learning_rate": "0.0001", "entropy": "0.155178779084", "num_tokens": "21783541", "mean_token_accuracy": "0.965631118417", "train_runtime": "", "timestamp": "2026-07-14T20:19:44.178706+00:00", "elapsed_seconds": "5732.74175155"} {"step": "1400", "epoch": "2.75159862273", "loss": "0.140009224415", "eval_loss": "", "grad_norm": "0.170756846666", "learning_rate": "0.0001", "entropy": "0.14718689071", "num_tokens": "21941737", "mean_token_accuracy": "0.967410634458", "train_runtime": "", "timestamp": "2026-07-14T20:20:24.400090+00:00", "elapsed_seconds": "5772.96313486"} {"step": "1410", "epoch": "2.77127397934", "loss": "0.158368110657", "eval_loss": "", "grad_norm": "0.160231694579", "learning_rate": "0.0001", "entropy": "0.163548708614", "num_tokens": "22098896", "mean_token_accuracy": "0.963823059201", "train_runtime": "", "timestamp": "2026-07-14T20:21:04.821885+00:00", "elapsed_seconds": "5813.38493038"} {"step": "1420", "epoch": "2.79094933596", "loss": "0.15230704546", "eval_loss": "", "grad_norm": "0.16520537436", "learning_rate": "0.0001", "entropy": "0.156925874669", "num_tokens": "22253937", "mean_token_accuracy": "0.965254628658", "train_runtime": "", "timestamp": "2026-07-14T20:21:43.554602+00:00", "elapsed_seconds": "5852.1176477"} {"step": "1430", "epoch": "2.81062469257", "loss": "0.149685204029", "eval_loss": "", "grad_norm": "0.15979103744", "learning_rate": "0.0001", "entropy": "0.15920828823", "num_tokens": "22407704", "mean_token_accuracy": "0.965691076219", "train_runtime": "", "timestamp": "2026-07-14T20:22:22.572894+00:00", "elapsed_seconds": "5891.13593973"} {"step": "1440", "epoch": "2.83030004919", "loss": "0.141947734356", "eval_loss": "", "grad_norm": "0.17102535069", "learning_rate": "0.0001", "entropy": "0.143590484187", "num_tokens": "22566364", "mean_token_accuracy": "0.967758500576", "train_runtime": "", "timestamp": "2026-07-14T20:23:01.967077+00:00", "elapsed_seconds": "5930.53012291"} {"step": "1450", "epoch": "2.8499754058", "loss": "0.149233210087", "eval_loss": "", "grad_norm": "0.176346048713", "learning_rate": "0.0001", "entropy": "0.154821686074", "num_tokens": "22723504", "mean_token_accuracy": "0.965960656106", "train_runtime": "", "timestamp": "2026-07-14T20:23:42.259042+00:00", "elapsed_seconds": "5970.82208756"} {"step": "1460", "epoch": "2.86965076242", "loss": "0.149314463139", "eval_loss": "", "grad_norm": "0.167141124606", "learning_rate": "0.0001", "entropy": "0.157680661697", "num_tokens": "22881293", "mean_token_accuracy": "0.965893740952", "train_runtime": "", "timestamp": "2026-07-14T20:24:21.692911+00:00", "elapsed_seconds": "6010.25595651"} {"step": "1470", "epoch": "2.88932611904", "loss": "0.153538620472", "eval_loss": "", "grad_norm": "0.187396898866", "learning_rate": "0.0001", "entropy": "0.15704208063", "num_tokens": "23038652", "mean_token_accuracy": "0.964700344205", "train_runtime": "", "timestamp": "2026-07-14T20:25:01.684654+00:00", "elapsed_seconds": "6050.24770006"} {"step": "1480", "epoch": "2.90900147565", "loss": "0.146680307388", "eval_loss": "", "grad_norm": "0.161297917366", "learning_rate": "0.0001", "entropy": "0.154165752605", "num_tokens": "23195931", "mean_token_accuracy": "0.966039390862", "train_runtime": "", "timestamp": "2026-07-14T20:25:41.291970+00:00", "elapsed_seconds": "6089.85501546"} {"step": "1490", "epoch": "2.92867683227", "loss": "0.149410581589", "eval_loss": "", "grad_norm": "0.180445641279", "learning_rate": "0.0001", "entropy": "0.153569581266", "num_tokens": "23353688", "mean_token_accuracy": "0.965923695266", "train_runtime": "", "timestamp": "2026-07-14T20:26:21.664709+00:00", "elapsed_seconds": "6130.22775456"} {"step": "1500", "epoch": "2.94835218888", "loss": "0.149590086937", "eval_loss": "", "grad_norm": "0.183879300952", "learning_rate": "0.0001", "entropy": "0.155868681241", "num_tokens": "23510145", "mean_token_accuracy": "0.965885919333", "train_runtime": "", "timestamp": "2026-07-14T20:27:00.725130+00:00", "elapsed_seconds": "6169.28817651"} {"step": "1510", "epoch": "2.9680275455", "loss": "0.162458205223", "eval_loss": "", "grad_norm": "0.158856883645", "learning_rate": "0.0001", "entropy": "0.166671768948", "num_tokens": "23666330", "mean_token_accuracy": "0.963560299575", "train_runtime": "", "timestamp": "2026-07-14T20:27:40.733926+00:00", "elapsed_seconds": "6209.29697027"} {"step": "1520", "epoch": "2.98770290212", "loss": "0.161911118031", "eval_loss": "", "grad_norm": "0.233410969377", "learning_rate": "0.0001", "entropy": "0.170425816625", "num_tokens": "23825027", "mean_token_accuracy": "0.963155913353", "train_runtime": "", "timestamp": "2026-07-14T20:28:20.899434+00:00", "elapsed_seconds": "6249.46247936"} {"step": "1527", "epoch": "3", "loss": "0.202153051844", "eval_loss": "0.508632481098", "grad_norm": "", "learning_rate": "", "entropy": "", "num_tokens": "", "mean_token_accuracy": "", "train_runtime": "6374.1215", "timestamp": "2026-07-14T20:30:25.555191+00:00", "elapsed_seconds": "6374.11823728"}