{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 3971, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.6497728377580643, "epoch": 0.002518653779554828, "grad_norm": 0.6953125, "learning_rate": 4.988667841853438e-05, "loss": 1.1745, "mean_token_accuracy": 0.7103757172822952, "num_tokens": 927987.0, "step": 10 }, { "entropy": 1.5930162012577056, "epoch": 0.005037307559109656, "grad_norm": 0.625, "learning_rate": 4.9760765550239234e-05, "loss": 1.1032, "mean_token_accuracy": 0.7197690099477768, "num_tokens": 1859988.0, "step": 20 }, { "entropy": 1.5709561467170716, "epoch": 0.0075559613386644835, "grad_norm": 0.640625, "learning_rate": 4.96348526819441e-05, "loss": 1.085, "mean_token_accuracy": 0.7227144911885262, "num_tokens": 2800856.0, "step": 30 }, { "entropy": 1.566073715686798, "epoch": 0.010074615118219311, "grad_norm": 0.61328125, "learning_rate": 4.9508939813648956e-05, "loss": 1.0955, "mean_token_accuracy": 0.7216884844005108, "num_tokens": 3739770.0, "step": 40 }, { "entropy": 1.570231558382511, "epoch": 0.01259326889777414, "grad_norm": 0.61328125, "learning_rate": 4.938302694535382e-05, "loss": 1.1137, "mean_token_accuracy": 0.7198784925043583, "num_tokens": 4662394.0, "step": 50 }, { "entropy": 1.5752479314804078, "epoch": 0.015111922677328967, "grad_norm": 0.67578125, "learning_rate": 4.925711407705868e-05, "loss": 1.1067, "mean_token_accuracy": 0.7184384018182755, "num_tokens": 5592065.0, "step": 60 }, { "entropy": 1.5744277507066726, "epoch": 0.017630576456883797, "grad_norm": 0.58984375, "learning_rate": 4.913120120876354e-05, "loss": 1.0994, "mean_token_accuracy": 0.7210577458143235, "num_tokens": 6494850.0, "step": 70 }, { "entropy": 1.5574209734797477, "epoch": 0.020149230236438623, "grad_norm": 0.63671875, "learning_rate": 4.90052883404684e-05, "loss": 1.0789, "mean_token_accuracy": 0.7261395655572415, "num_tokens": 7402054.0, "step": 80 }, { "entropy": 1.536399021744728, "epoch": 0.022667884015993452, "grad_norm": 0.64453125, "learning_rate": 4.887937547217326e-05, "loss": 1.0834, "mean_token_accuracy": 0.7243645377457142, "num_tokens": 8302725.0, "step": 90 }, { "entropy": 1.5392677783966064, "epoch": 0.02518653779554828, "grad_norm": 0.63671875, "learning_rate": 4.875346260387812e-05, "loss": 1.0579, "mean_token_accuracy": 0.7294937998056412, "num_tokens": 9218531.0, "step": 100 }, { "entropy": 1.5304515838623047, "epoch": 0.027705191575103108, "grad_norm": 0.62109375, "learning_rate": 4.862754973558298e-05, "loss": 1.0607, "mean_token_accuracy": 0.7303975030779839, "num_tokens": 10136124.0, "step": 110 }, { "entropy": 1.5561267986893654, "epoch": 0.030223845354657934, "grad_norm": 0.62109375, "learning_rate": 4.8501636867287845e-05, "loss": 1.0511, "mean_token_accuracy": 0.7304783284664154, "num_tokens": 11083595.0, "step": 120 }, { "entropy": 1.5530587568879128, "epoch": 0.03274249913421276, "grad_norm": 0.609375, "learning_rate": 4.83757239989927e-05, "loss": 1.1037, "mean_token_accuracy": 0.7202336438000202, "num_tokens": 11990008.0, "step": 130 }, { "entropy": 1.5585834830999374, "epoch": 0.03526115291376759, "grad_norm": 0.61328125, "learning_rate": 4.824981113069756e-05, "loss": 1.103, "mean_token_accuracy": 0.7219732508063317, "num_tokens": 12902256.0, "step": 140 }, { "entropy": 1.5430516287684442, "epoch": 0.03777980669332242, "grad_norm": 0.62890625, "learning_rate": 4.812389826240242e-05, "loss": 1.0711, "mean_token_accuracy": 0.7261470817029476, "num_tokens": 13855059.0, "step": 150 }, { "entropy": 1.5312249392271042, "epoch": 0.040298460472877246, "grad_norm": 0.65625, "learning_rate": 4.799798539410728e-05, "loss": 1.0753, "mean_token_accuracy": 0.7257871173322201, "num_tokens": 14779771.0, "step": 160 }, { "entropy": 1.5230548575520515, "epoch": 0.04281711425243207, "grad_norm": 0.6015625, "learning_rate": 4.7872072525812137e-05, "loss": 1.0393, "mean_token_accuracy": 0.735567494481802, "num_tokens": 15690913.0, "step": 170 }, { "entropy": 1.5378432273864746, "epoch": 0.045335768031986905, "grad_norm": 0.64453125, "learning_rate": 4.7746159657517e-05, "loss": 1.0876, "mean_token_accuracy": 0.7245238177478314, "num_tokens": 16633243.0, "step": 180 }, { "entropy": 1.5589430660009385, "epoch": 0.04785442181154173, "grad_norm": 0.61328125, "learning_rate": 4.762024678922186e-05, "loss": 1.0532, "mean_token_accuracy": 0.7320627510547638, "num_tokens": 17553351.0, "step": 190 }, { "entropy": 1.5157382100820542, "epoch": 0.05037307559109656, "grad_norm": 0.63671875, "learning_rate": 4.749433392092672e-05, "loss": 1.0358, "mean_token_accuracy": 0.731314767897129, "num_tokens": 18490557.0, "step": 200 }, { "entropy": 1.5197158992290496, "epoch": 0.05289172937065139, "grad_norm": 0.6171875, "learning_rate": 4.736842105263158e-05, "loss": 1.0799, "mean_token_accuracy": 0.7257929719984532, "num_tokens": 19433634.0, "step": 210 }, { "entropy": 1.5323385715484619, "epoch": 0.055410383150206216, "grad_norm": 0.67578125, "learning_rate": 4.724250818433644e-05, "loss": 1.0491, "mean_token_accuracy": 0.7314196087419986, "num_tokens": 20340871.0, "step": 220 }, { "entropy": 1.5352398797869682, "epoch": 0.05792903692976104, "grad_norm": 0.58984375, "learning_rate": 4.71165953160413e-05, "loss": 1.0442, "mean_token_accuracy": 0.7328816823661327, "num_tokens": 21256808.0, "step": 230 }, { "entropy": 1.5354523420333863, "epoch": 0.06044769070931587, "grad_norm": 0.6484375, "learning_rate": 4.699068244774616e-05, "loss": 1.073, "mean_token_accuracy": 0.7256046369671821, "num_tokens": 22171600.0, "step": 240 }, { "entropy": 1.5628203928470612, "epoch": 0.0629663444888707, "grad_norm": 0.58984375, "learning_rate": 4.6864769579451025e-05, "loss": 1.1204, "mean_token_accuracy": 0.7178477592766285, "num_tokens": 23116116.0, "step": 250 }, { "entropy": 1.5106180116534234, "epoch": 0.06548499826842552, "grad_norm": 0.62890625, "learning_rate": 4.673885671115588e-05, "loss": 1.0505, "mean_token_accuracy": 0.7322093218564987, "num_tokens": 24022009.0, "step": 260 }, { "entropy": 1.5455271020531653, "epoch": 0.06800365204798035, "grad_norm": 0.640625, "learning_rate": 4.661294384286074e-05, "loss": 1.1028, "mean_token_accuracy": 0.7194493912160397, "num_tokens": 24938320.0, "step": 270 }, { "entropy": 1.4870401427149773, "epoch": 0.07052230582753519, "grad_norm": 0.625, "learning_rate": 4.64870309745656e-05, "loss": 1.0062, "mean_token_accuracy": 0.7405259512364865, "num_tokens": 25872274.0, "step": 280 }, { "entropy": 1.5163322016596794, "epoch": 0.07304095960709, "grad_norm": 0.59765625, "learning_rate": 4.636111810627046e-05, "loss": 1.0475, "mean_token_accuracy": 0.7297493070363998, "num_tokens": 26787336.0, "step": 290 }, { "entropy": 1.5091008096933365, "epoch": 0.07555961338664484, "grad_norm": 0.5546875, "learning_rate": 4.6235205237975324e-05, "loss": 1.038, "mean_token_accuracy": 0.7351058594882488, "num_tokens": 27725039.0, "step": 300 }, { "entropy": 1.535538549721241, "epoch": 0.07807826716619967, "grad_norm": 0.63671875, "learning_rate": 4.6109292369680185e-05, "loss": 1.0576, "mean_token_accuracy": 0.7299107275903225, "num_tokens": 28643618.0, "step": 310 }, { "entropy": 1.5314571484923363, "epoch": 0.08059692094575449, "grad_norm": 0.640625, "learning_rate": 4.5983379501385046e-05, "loss": 1.0666, "mean_token_accuracy": 0.7284630224108696, "num_tokens": 29563205.0, "step": 320 }, { "entropy": 1.5281456634402275, "epoch": 0.08311557472530932, "grad_norm": 0.65234375, "learning_rate": 4.58574666330899e-05, "loss": 1.0655, "mean_token_accuracy": 0.7297011129558086, "num_tokens": 30480512.0, "step": 330 }, { "entropy": 1.5301422774791718, "epoch": 0.08563422850486414, "grad_norm": 0.61328125, "learning_rate": 4.573155376479477e-05, "loss": 1.0605, "mean_token_accuracy": 0.7305384628474713, "num_tokens": 31442273.0, "step": 340 }, { "entropy": 1.4844171449542045, "epoch": 0.08815288228441898, "grad_norm": 0.62109375, "learning_rate": 4.560564089649962e-05, "loss": 1.0442, "mean_token_accuracy": 0.7323296993970871, "num_tokens": 32344410.0, "step": 350 }, { "entropy": 1.5229773551225663, "epoch": 0.09067153606397381, "grad_norm": 0.6015625, "learning_rate": 4.5479728028204484e-05, "loss": 1.0332, "mean_token_accuracy": 0.7339819706976414, "num_tokens": 33250917.0, "step": 360 }, { "entropy": 1.5061728432774544, "epoch": 0.09319018984352863, "grad_norm": 0.6328125, "learning_rate": 4.5353815159909345e-05, "loss": 1.0196, "mean_token_accuracy": 0.7394672840833664, "num_tokens": 34175027.0, "step": 370 }, { "entropy": 1.5456583075225354, "epoch": 0.09570884362308346, "grad_norm": 0.640625, "learning_rate": 4.5227902291614206e-05, "loss": 1.0619, "mean_token_accuracy": 0.7283155068755149, "num_tokens": 35109724.0, "step": 380 }, { "entropy": 1.5447079360485076, "epoch": 0.0982274974026383, "grad_norm": 0.62109375, "learning_rate": 4.510198942331906e-05, "loss": 1.0899, "mean_token_accuracy": 0.7229381762444973, "num_tokens": 36062415.0, "step": 390 }, { "entropy": 1.533456189930439, "epoch": 0.10074615118219311, "grad_norm": 0.65625, "learning_rate": 4.497607655502393e-05, "loss": 1.0645, "mean_token_accuracy": 0.7263024888932705, "num_tokens": 37007526.0, "step": 400 }, { "entropy": 1.522585578262806, "epoch": 0.10326480496174795, "grad_norm": 0.6171875, "learning_rate": 4.485016368672878e-05, "loss": 1.0556, "mean_token_accuracy": 0.7289167314767837, "num_tokens": 37935164.0, "step": 410 }, { "entropy": 1.4904729962348937, "epoch": 0.10578345874130278, "grad_norm": 0.66796875, "learning_rate": 4.4724250818433643e-05, "loss": 1.0408, "mean_token_accuracy": 0.7305458515882493, "num_tokens": 38872935.0, "step": 420 }, { "entropy": 1.51086837798357, "epoch": 0.1083021125208576, "grad_norm": 0.59765625, "learning_rate": 4.459833795013851e-05, "loss": 1.0184, "mean_token_accuracy": 0.7377710983157157, "num_tokens": 39800020.0, "step": 430 }, { "entropy": 1.527511714398861, "epoch": 0.11082076630041243, "grad_norm": 0.62890625, "learning_rate": 4.4472425081843366e-05, "loss": 1.0671, "mean_token_accuracy": 0.728612695634365, "num_tokens": 40736503.0, "step": 440 }, { "entropy": 1.5698168337345124, "epoch": 0.11333942007996725, "grad_norm": 0.60546875, "learning_rate": 4.434651221354823e-05, "loss": 1.0474, "mean_token_accuracy": 0.7324717722833156, "num_tokens": 41666603.0, "step": 450 }, { "entropy": 1.5131051123142243, "epoch": 0.11585807385952208, "grad_norm": 0.625, "learning_rate": 4.422059934525309e-05, "loss": 1.0566, "mean_token_accuracy": 0.7301515676081181, "num_tokens": 42598424.0, "step": 460 }, { "entropy": 1.50111276358366, "epoch": 0.11837672763907692, "grad_norm": 0.578125, "learning_rate": 4.409468647695795e-05, "loss": 1.0339, "mean_token_accuracy": 0.7336028017103672, "num_tokens": 43559521.0, "step": 470 }, { "entropy": 1.4837490528821946, "epoch": 0.12089538141863174, "grad_norm": 0.59765625, "learning_rate": 4.39687736086628e-05, "loss": 0.9844, "mean_token_accuracy": 0.7455279111862183, "num_tokens": 44494185.0, "step": 480 }, { "entropy": 1.5296257749199866, "epoch": 0.12341403519818657, "grad_norm": 0.58203125, "learning_rate": 4.384286074036767e-05, "loss": 1.0266, "mean_token_accuracy": 0.7367306031286717, "num_tokens": 45420386.0, "step": 490 }, { "entropy": 1.5529645070433618, "epoch": 0.1259326889777414, "grad_norm": 0.609375, "learning_rate": 4.3716947872072525e-05, "loss": 1.0647, "mean_token_accuracy": 0.7286850355565548, "num_tokens": 46328398.0, "step": 500 }, { "entropy": 1.5489887461066245, "epoch": 0.12845134275729622, "grad_norm": 0.62890625, "learning_rate": 4.3591035003777386e-05, "loss": 1.0497, "mean_token_accuracy": 0.7323333226144314, "num_tokens": 47237802.0, "step": 510 }, { "entropy": 1.5361493453383446, "epoch": 0.13096999653685104, "grad_norm": 0.59375, "learning_rate": 4.346512213548225e-05, "loss": 1.0247, "mean_token_accuracy": 0.7348957560956478, "num_tokens": 48176536.0, "step": 520 }, { "entropy": 1.5109021827578544, "epoch": 0.1334886503164059, "grad_norm": 0.58203125, "learning_rate": 4.333920926718711e-05, "loss": 1.0204, "mean_token_accuracy": 0.7367621898651123, "num_tokens": 49109015.0, "step": 530 }, { "entropy": 1.4852696403861045, "epoch": 0.1360073040959607, "grad_norm": 0.5859375, "learning_rate": 4.321329639889197e-05, "loss": 1.0364, "mean_token_accuracy": 0.7326985791325569, "num_tokens": 50040438.0, "step": 540 }, { "entropy": 1.5346143633127212, "epoch": 0.13852595787551553, "grad_norm": 0.65625, "learning_rate": 4.308738353059683e-05, "loss": 1.0536, "mean_token_accuracy": 0.7286248430609703, "num_tokens": 50976370.0, "step": 550 }, { "entropy": 1.514106061309576, "epoch": 0.14104461165507037, "grad_norm": 0.69921875, "learning_rate": 4.296147066230169e-05, "loss": 1.041, "mean_token_accuracy": 0.7335773780941963, "num_tokens": 51918138.0, "step": 560 }, { "entropy": 1.5336113646626472, "epoch": 0.1435632654346252, "grad_norm": 0.61328125, "learning_rate": 4.2835557794006546e-05, "loss": 1.0518, "mean_token_accuracy": 0.7317119717597962, "num_tokens": 52817229.0, "step": 570 }, { "entropy": 1.5196146205067635, "epoch": 0.14608191921418, "grad_norm": 0.59765625, "learning_rate": 4.2709644925711414e-05, "loss": 1.0267, "mean_token_accuracy": 0.736695246398449, "num_tokens": 53760765.0, "step": 580 }, { "entropy": 1.5179338246583938, "epoch": 0.14860057299373486, "grad_norm": 0.61328125, "learning_rate": 4.258373205741627e-05, "loss": 1.0466, "mean_token_accuracy": 0.7297343403100968, "num_tokens": 54671519.0, "step": 590 }, { "entropy": 1.5304696060717107, "epoch": 0.15111922677328968, "grad_norm": 0.62890625, "learning_rate": 4.245781918912113e-05, "loss": 1.0458, "mean_token_accuracy": 0.7315973825752735, "num_tokens": 55593071.0, "step": 600 }, { "entropy": 1.4869036689400672, "epoch": 0.1536378805528445, "grad_norm": 0.6640625, "learning_rate": 4.233190632082599e-05, "loss": 1.0077, "mean_token_accuracy": 0.7418606728315353, "num_tokens": 56514341.0, "step": 610 }, { "entropy": 1.4934701904654504, "epoch": 0.15615653433239934, "grad_norm": 0.578125, "learning_rate": 4.220599345253085e-05, "loss": 1.0083, "mean_token_accuracy": 0.7406033039093017, "num_tokens": 57462853.0, "step": 620 }, { "entropy": 1.5260894536972045, "epoch": 0.15867518811195416, "grad_norm": 0.63671875, "learning_rate": 4.2080080584235706e-05, "loss": 1.052, "mean_token_accuracy": 0.7272073470056057, "num_tokens": 58377529.0, "step": 630 }, { "entropy": 1.548849606513977, "epoch": 0.16119384189150898, "grad_norm": 0.609375, "learning_rate": 4.1954167715940574e-05, "loss": 1.0904, "mean_token_accuracy": 0.724496615678072, "num_tokens": 59304012.0, "step": 640 }, { "entropy": 1.5230202600359917, "epoch": 0.16371249567106383, "grad_norm": 0.61328125, "learning_rate": 4.1828254847645435e-05, "loss": 1.0317, "mean_token_accuracy": 0.7327270671725273, "num_tokens": 60226985.0, "step": 650 }, { "entropy": 1.4835097789764404, "epoch": 0.16623114945061865, "grad_norm": 0.60546875, "learning_rate": 4.170234197935029e-05, "loss": 1.0267, "mean_token_accuracy": 0.7380013577640057, "num_tokens": 61164672.0, "step": 660 }, { "entropy": 1.5426082447171212, "epoch": 0.16874980323017347, "grad_norm": 0.56640625, "learning_rate": 4.157642911105516e-05, "loss": 1.0308, "mean_token_accuracy": 0.7336142487823963, "num_tokens": 62097480.0, "step": 670 }, { "entropy": 1.5340310111641884, "epoch": 0.1712684570097283, "grad_norm": 0.609375, "learning_rate": 4.145051624276001e-05, "loss": 1.072, "mean_token_accuracy": 0.7251117169857025, "num_tokens": 63026840.0, "step": 680 }, { "entropy": 1.500159528851509, "epoch": 0.17378711078928313, "grad_norm": 0.6328125, "learning_rate": 4.132460337446487e-05, "loss": 1.0297, "mean_token_accuracy": 0.7330615803599357, "num_tokens": 63949950.0, "step": 690 }, { "entropy": 1.5545173302292823, "epoch": 0.17630576456883795, "grad_norm": 0.57421875, "learning_rate": 4.1198690506169734e-05, "loss": 1.0545, "mean_token_accuracy": 0.7317077338695526, "num_tokens": 64876440.0, "step": 700 }, { "entropy": 1.5059973791241645, "epoch": 0.17882441834839277, "grad_norm": 0.58203125, "learning_rate": 4.1072777637874595e-05, "loss": 1.01, "mean_token_accuracy": 0.7392976120114326, "num_tokens": 65798419.0, "step": 710 }, { "entropy": 1.5090464890003203, "epoch": 0.18134307212794762, "grad_norm": 0.60546875, "learning_rate": 4.094686476957945e-05, "loss": 1.0592, "mean_token_accuracy": 0.7292688339948654, "num_tokens": 66749039.0, "step": 720 }, { "entropy": 1.5077268376946449, "epoch": 0.18386172590750244, "grad_norm": 0.66015625, "learning_rate": 4.082095190128432e-05, "loss": 1.0422, "mean_token_accuracy": 0.7338137224316597, "num_tokens": 67710358.0, "step": 730 }, { "entropy": 1.5227509185671806, "epoch": 0.18638037968705726, "grad_norm": 0.60546875, "learning_rate": 4.069503903298917e-05, "loss": 1.0484, "mean_token_accuracy": 0.7323349170386791, "num_tokens": 68624639.0, "step": 740 }, { "entropy": 1.4950523242354392, "epoch": 0.1888990334666121, "grad_norm": 0.609375, "learning_rate": 4.056912616469403e-05, "loss": 1.0318, "mean_token_accuracy": 0.7348136067390442, "num_tokens": 69559409.0, "step": 750 }, { "entropy": 1.4976729974150658, "epoch": 0.19141768724616692, "grad_norm": 0.61328125, "learning_rate": 4.044321329639889e-05, "loss": 1.0152, "mean_token_accuracy": 0.7377664625644684, "num_tokens": 70498976.0, "step": 760 }, { "entropy": 1.5174943268299104, "epoch": 0.19393634102572174, "grad_norm": 0.58984375, "learning_rate": 4.0317300428103754e-05, "loss": 1.0128, "mean_token_accuracy": 0.7391440957784653, "num_tokens": 71449612.0, "step": 770 }, { "entropy": 1.5164562672376634, "epoch": 0.1964549948052766, "grad_norm": 0.671875, "learning_rate": 4.0191387559808616e-05, "loss": 0.9954, "mean_token_accuracy": 0.7393902830779553, "num_tokens": 72373886.0, "step": 780 }, { "entropy": 1.4641567483544349, "epoch": 0.1989736485848314, "grad_norm": 0.58203125, "learning_rate": 4.0065474691513477e-05, "loss": 0.9909, "mean_token_accuracy": 0.7428550243377685, "num_tokens": 73312402.0, "step": 790 }, { "entropy": 1.507477380335331, "epoch": 0.20149230236438623, "grad_norm": 0.578125, "learning_rate": 3.993956182321834e-05, "loss": 1.0209, "mean_token_accuracy": 0.7389532752335072, "num_tokens": 74255599.0, "step": 800 }, { "entropy": 1.4874264925718308, "epoch": 0.20401095614394107, "grad_norm": 0.61328125, "learning_rate": 3.981364895492319e-05, "loss": 1.0178, "mean_token_accuracy": 0.7369325928390026, "num_tokens": 75173757.0, "step": 810 }, { "entropy": 1.4983343809843064, "epoch": 0.2065296099234959, "grad_norm": 0.61328125, "learning_rate": 3.968773608662806e-05, "loss": 1.0488, "mean_token_accuracy": 0.7323521085083484, "num_tokens": 76090812.0, "step": 820 }, { "entropy": 1.5155110970139503, "epoch": 0.2090482637030507, "grad_norm": 0.64453125, "learning_rate": 3.9561823218332914e-05, "loss": 1.0699, "mean_token_accuracy": 0.7274161614477634, "num_tokens": 77029951.0, "step": 830 }, { "entropy": 1.4780758187174796, "epoch": 0.21156691748260556, "grad_norm": 0.625, "learning_rate": 3.9435910350037775e-05, "loss": 1.0051, "mean_token_accuracy": 0.7377786092460156, "num_tokens": 77960751.0, "step": 840 }, { "entropy": 1.4968378961086273, "epoch": 0.21408557126216038, "grad_norm": 0.6015625, "learning_rate": 3.9309997481742636e-05, "loss": 1.0027, "mean_token_accuracy": 0.739619717001915, "num_tokens": 78871850.0, "step": 850 }, { "entropy": 1.5046116828918457, "epoch": 0.2166042250417152, "grad_norm": 0.59375, "learning_rate": 3.91840846134475e-05, "loss": 1.0261, "mean_token_accuracy": 0.7376008428633213, "num_tokens": 79789618.0, "step": 860 }, { "entropy": 1.5208716675639153, "epoch": 0.21912287882127002, "grad_norm": 0.609375, "learning_rate": 3.905817174515236e-05, "loss": 1.051, "mean_token_accuracy": 0.7320379175245761, "num_tokens": 80728419.0, "step": 870 }, { "entropy": 1.5159122616052627, "epoch": 0.22164153260082486, "grad_norm": 0.60546875, "learning_rate": 3.893225887685722e-05, "loss": 1.0243, "mean_token_accuracy": 0.7333739779889583, "num_tokens": 81673574.0, "step": 880 }, { "entropy": 1.51417468637228, "epoch": 0.22416018638037968, "grad_norm": 0.59765625, "learning_rate": 3.880634600856208e-05, "loss": 1.0413, "mean_token_accuracy": 0.7333143278956413, "num_tokens": 82609636.0, "step": 890 }, { "entropy": 1.4946632251143455, "epoch": 0.2266788401599345, "grad_norm": 0.56640625, "learning_rate": 3.8680433140266935e-05, "loss": 1.0272, "mean_token_accuracy": 0.7353226900100708, "num_tokens": 83566048.0, "step": 900 }, { "entropy": 1.4703357517719269, "epoch": 0.22919749393948935, "grad_norm": 0.609375, "learning_rate": 3.8554520271971796e-05, "loss": 1.0239, "mean_token_accuracy": 0.7346428163349629, "num_tokens": 84490230.0, "step": 910 }, { "entropy": 1.5199193447828292, "epoch": 0.23171614771904417, "grad_norm": 0.64453125, "learning_rate": 3.842860740367666e-05, "loss": 1.0443, "mean_token_accuracy": 0.7323003455996513, "num_tokens": 85420861.0, "step": 920 }, { "entropy": 1.52715914696455, "epoch": 0.234234801498599, "grad_norm": 0.61328125, "learning_rate": 3.830269453538152e-05, "loss": 1.0432, "mean_token_accuracy": 0.7316192977130413, "num_tokens": 86352852.0, "step": 930 }, { "entropy": 1.4817651391029358, "epoch": 0.23675345527815383, "grad_norm": 0.6328125, "learning_rate": 3.817678166708637e-05, "loss": 1.0019, "mean_token_accuracy": 0.7411134377121925, "num_tokens": 87249992.0, "step": 940 }, { "entropy": 1.4907526612281798, "epoch": 0.23927210905770865, "grad_norm": 0.59765625, "learning_rate": 3.805086879879124e-05, "loss": 1.0013, "mean_token_accuracy": 0.7385142982006073, "num_tokens": 88185598.0, "step": 950 }, { "entropy": 1.5223437398672104, "epoch": 0.24179076283726347, "grad_norm": 0.61328125, "learning_rate": 3.7924955930496095e-05, "loss": 1.0563, "mean_token_accuracy": 0.7298605613410473, "num_tokens": 89109791.0, "step": 960 }, { "entropy": 1.486008982360363, "epoch": 0.24430941661681832, "grad_norm": 0.56640625, "learning_rate": 3.7799043062200956e-05, "loss": 1.0103, "mean_token_accuracy": 0.737246710062027, "num_tokens": 90058609.0, "step": 970 }, { "entropy": 1.512269377708435, "epoch": 0.24682807039637314, "grad_norm": 0.59375, "learning_rate": 3.767313019390582e-05, "loss": 1.0284, "mean_token_accuracy": 0.7351725302636624, "num_tokens": 90982493.0, "step": 980 }, { "entropy": 1.5016800329089164, "epoch": 0.24934672417592796, "grad_norm": 0.6171875, "learning_rate": 3.754721732561068e-05, "loss": 1.0298, "mean_token_accuracy": 0.7350243054330349, "num_tokens": 91919533.0, "step": 990 }, { "entropy": 1.4913472577929496, "epoch": 0.2518653779554828, "grad_norm": 0.61328125, "learning_rate": 3.742130445731554e-05, "loss": 0.992, "mean_token_accuracy": 0.7438635163009166, "num_tokens": 92854895.0, "step": 1000 }, { "entropy": 1.4977505892515182, "epoch": 0.2543840317350376, "grad_norm": 0.58984375, "learning_rate": 3.72953915890204e-05, "loss": 1.0344, "mean_token_accuracy": 0.7339183062314987, "num_tokens": 93790271.0, "step": 1010 }, { "entropy": 1.5159107878804208, "epoch": 0.25690268551459244, "grad_norm": 0.64453125, "learning_rate": 3.716947872072526e-05, "loss": 1.0492, "mean_token_accuracy": 0.7301998473703861, "num_tokens": 94686152.0, "step": 1020 }, { "entropy": 1.5307456016540528, "epoch": 0.2594213392941473, "grad_norm": 0.60546875, "learning_rate": 3.7043565852430116e-05, "loss": 1.0364, "mean_token_accuracy": 0.7321190066635609, "num_tokens": 95608968.0, "step": 1030 }, { "entropy": 1.4946022421121596, "epoch": 0.2619399930737021, "grad_norm": 0.63671875, "learning_rate": 3.6917652984134983e-05, "loss": 1.0151, "mean_token_accuracy": 0.7384577453136444, "num_tokens": 96528931.0, "step": 1040 }, { "entropy": 1.4895016327500343, "epoch": 0.26445864685325693, "grad_norm": 0.65234375, "learning_rate": 3.679174011583984e-05, "loss": 1.0396, "mean_token_accuracy": 0.7310051701962947, "num_tokens": 97431432.0, "step": 1050 }, { "entropy": 1.5223950266838073, "epoch": 0.2669773006328118, "grad_norm": 0.6328125, "learning_rate": 3.66658272475447e-05, "loss": 1.0245, "mean_token_accuracy": 0.7353874854743481, "num_tokens": 98357299.0, "step": 1060 }, { "entropy": 1.502314467728138, "epoch": 0.26949595441236657, "grad_norm": 0.671875, "learning_rate": 3.653991437924956e-05, "loss": 1.0212, "mean_token_accuracy": 0.7371881239116191, "num_tokens": 99287298.0, "step": 1070 }, { "entropy": 1.487211187183857, "epoch": 0.2720146081919214, "grad_norm": 0.66015625, "learning_rate": 3.641400151095442e-05, "loss": 1.018, "mean_token_accuracy": 0.7396972067654133, "num_tokens": 100201770.0, "step": 1080 }, { "entropy": 1.4796535983681678, "epoch": 0.27453326197147626, "grad_norm": 0.609375, "learning_rate": 3.628808864265928e-05, "loss": 1.0203, "mean_token_accuracy": 0.73761862590909, "num_tokens": 101133473.0, "step": 1090 }, { "entropy": 1.5198125943541527, "epoch": 0.27705191575103105, "grad_norm": 0.5625, "learning_rate": 3.616217577436414e-05, "loss": 1.0277, "mean_token_accuracy": 0.7344238288700581, "num_tokens": 102079400.0, "step": 1100 }, { "entropy": 1.4751672700047493, "epoch": 0.2795705695305859, "grad_norm": 0.59765625, "learning_rate": 3.6036262906069004e-05, "loss": 0.992, "mean_token_accuracy": 0.7427970752120018, "num_tokens": 103002746.0, "step": 1110 }, { "entropy": 1.4785253152251243, "epoch": 0.28208922331014075, "grad_norm": 0.60546875, "learning_rate": 3.591035003777386e-05, "loss": 0.9957, "mean_token_accuracy": 0.7420700334012509, "num_tokens": 103918330.0, "step": 1120 }, { "entropy": 1.5064472571015357, "epoch": 0.28460787708969554, "grad_norm": 0.6015625, "learning_rate": 3.5784437169478727e-05, "loss": 1.0121, "mean_token_accuracy": 0.7389346733689308, "num_tokens": 104854940.0, "step": 1130 }, { "entropy": 1.5104423373937608, "epoch": 0.2871265308692504, "grad_norm": 0.68359375, "learning_rate": 3.565852430118358e-05, "loss": 1.0577, "mean_token_accuracy": 0.7281268581748008, "num_tokens": 105757398.0, "step": 1140 }, { "entropy": 1.4889473721385003, "epoch": 0.28964518464880523, "grad_norm": 0.58984375, "learning_rate": 3.553261143288844e-05, "loss": 1.0116, "mean_token_accuracy": 0.7378810577094554, "num_tokens": 106709345.0, "step": 1150 }, { "entropy": 1.4943735346198082, "epoch": 0.29216383842836, "grad_norm": 0.61328125, "learning_rate": 3.54066985645933e-05, "loss": 1.0252, "mean_token_accuracy": 0.7358876734972, "num_tokens": 107635433.0, "step": 1160 }, { "entropy": 1.502584198117256, "epoch": 0.29468249220791487, "grad_norm": 0.60546875, "learning_rate": 3.5280785696298164e-05, "loss": 1.0513, "mean_token_accuracy": 0.7284682184457779, "num_tokens": 108555011.0, "step": 1170 }, { "entropy": 1.4951962947845459, "epoch": 0.2972011459874697, "grad_norm": 0.5859375, "learning_rate": 3.515487282800302e-05, "loss": 1.0058, "mean_token_accuracy": 0.7395492434501648, "num_tokens": 109490480.0, "step": 1180 }, { "entropy": 1.4874925374984742, "epoch": 0.2997197997670245, "grad_norm": 0.61328125, "learning_rate": 3.5028959959707886e-05, "loss": 0.996, "mean_token_accuracy": 0.7426116019487381, "num_tokens": 110419525.0, "step": 1190 }, { "entropy": 1.4831220969557761, "epoch": 0.30223845354657936, "grad_norm": 0.5625, "learning_rate": 3.490304709141274e-05, "loss": 1.0094, "mean_token_accuracy": 0.7389338947832584, "num_tokens": 111349186.0, "step": 1200 }, { "entropy": 1.4941108256578446, "epoch": 0.3047571073261342, "grad_norm": 0.63671875, "learning_rate": 3.47771342231176e-05, "loss": 1.0472, "mean_token_accuracy": 0.7327656015753746, "num_tokens": 112282566.0, "step": 1210 }, { "entropy": 1.5015305012464524, "epoch": 0.307275761105689, "grad_norm": 0.63671875, "learning_rate": 3.465122135482247e-05, "loss": 1.0308, "mean_token_accuracy": 0.73332554474473, "num_tokens": 113202119.0, "step": 1220 }, { "entropy": 1.4797065630555153, "epoch": 0.30979441488524384, "grad_norm": 0.5703125, "learning_rate": 3.4525308486527324e-05, "loss": 1.037, "mean_token_accuracy": 0.7331598915159703, "num_tokens": 114138832.0, "step": 1230 }, { "entropy": 1.5040980368852614, "epoch": 0.3123130686647987, "grad_norm": 0.59375, "learning_rate": 3.4399395618232185e-05, "loss": 1.0141, "mean_token_accuracy": 0.7366115286946296, "num_tokens": 115039255.0, "step": 1240 }, { "entropy": 1.491380912065506, "epoch": 0.3148317224443535, "grad_norm": 0.6328125, "learning_rate": 3.4273482749937046e-05, "loss": 1.0256, "mean_token_accuracy": 0.7349315457046032, "num_tokens": 115940525.0, "step": 1250 }, { "entropy": 1.474766517430544, "epoch": 0.3173503762239083, "grad_norm": 0.6015625, "learning_rate": 3.414756988164191e-05, "loss": 1.0051, "mean_token_accuracy": 0.7393092684447765, "num_tokens": 116859333.0, "step": 1260 }, { "entropy": 1.5051109313964843, "epoch": 0.3198690300034632, "grad_norm": 0.57421875, "learning_rate": 3.402165701334676e-05, "loss": 1.016, "mean_token_accuracy": 0.7380836345255375, "num_tokens": 117776423.0, "step": 1270 }, { "entropy": 1.4819408521056174, "epoch": 0.32238768378301796, "grad_norm": 0.578125, "learning_rate": 3.389574414505163e-05, "loss": 0.991, "mean_token_accuracy": 0.7428291216492653, "num_tokens": 118716777.0, "step": 1280 }, { "entropy": 1.4922457024455071, "epoch": 0.3249063375625728, "grad_norm": 0.61328125, "learning_rate": 3.3769831276756484e-05, "loss": 1.0247, "mean_token_accuracy": 0.7364048793911934, "num_tokens": 119626650.0, "step": 1290 }, { "entropy": 1.4869423642754556, "epoch": 0.32742499134212766, "grad_norm": 0.62109375, "learning_rate": 3.3643918408461345e-05, "loss": 1.0159, "mean_token_accuracy": 0.7364346459507942, "num_tokens": 120559670.0, "step": 1300 }, { "entropy": 1.5164387181401253, "epoch": 0.32994364512168245, "grad_norm": 0.6171875, "learning_rate": 3.3518005540166206e-05, "loss": 1.0452, "mean_token_accuracy": 0.7311400182545185, "num_tokens": 121489609.0, "step": 1310 }, { "entropy": 1.4925027176737786, "epoch": 0.3324622989012373, "grad_norm": 0.58984375, "learning_rate": 3.339209267187107e-05, "loss": 1.0261, "mean_token_accuracy": 0.7373234689235687, "num_tokens": 122416454.0, "step": 1320 }, { "entropy": 1.507451492547989, "epoch": 0.33498095268079214, "grad_norm": 0.5859375, "learning_rate": 3.326617980357593e-05, "loss": 1.0082, "mean_token_accuracy": 0.7384895570576191, "num_tokens": 123342649.0, "step": 1330 }, { "entropy": 1.4801776722073554, "epoch": 0.33749960646034693, "grad_norm": 0.60546875, "learning_rate": 3.314026693528079e-05, "loss": 1.026, "mean_token_accuracy": 0.734679427742958, "num_tokens": 124277565.0, "step": 1340 }, { "entropy": 1.5057601898908615, "epoch": 0.3400182602399018, "grad_norm": 0.6328125, "learning_rate": 3.301435406698565e-05, "loss": 1.0532, "mean_token_accuracy": 0.7300509728491307, "num_tokens": 125193040.0, "step": 1350 }, { "entropy": 1.504169335961342, "epoch": 0.3425369140194566, "grad_norm": 0.6484375, "learning_rate": 3.2888441198690504e-05, "loss": 1.0018, "mean_token_accuracy": 0.7397960677742959, "num_tokens": 126119671.0, "step": 1360 }, { "entropy": 1.495669847726822, "epoch": 0.3450555677990114, "grad_norm": 0.62109375, "learning_rate": 3.276252833039537e-05, "loss": 1.0296, "mean_token_accuracy": 0.7364421933889389, "num_tokens": 127044727.0, "step": 1370 }, { "entropy": 1.4692699402570724, "epoch": 0.34757422157856627, "grad_norm": 0.58984375, "learning_rate": 3.263661546210023e-05, "loss": 0.972, "mean_token_accuracy": 0.7507402546703815, "num_tokens": 127984703.0, "step": 1380 }, { "entropy": 1.5226725831627845, "epoch": 0.35009287535812106, "grad_norm": 0.62109375, "learning_rate": 3.251070259380509e-05, "loss": 1.0447, "mean_token_accuracy": 0.7286883890628815, "num_tokens": 128914516.0, "step": 1390 }, { "entropy": 1.4715677112340928, "epoch": 0.3526115291376759, "grad_norm": 0.59765625, "learning_rate": 3.238478972550995e-05, "loss": 0.9847, "mean_token_accuracy": 0.7421014286577702, "num_tokens": 129828449.0, "step": 1400 }, { "entropy": 1.4714261531829833, "epoch": 0.35513018291723075, "grad_norm": 0.59765625, "learning_rate": 3.225887685721481e-05, "loss": 1.0038, "mean_token_accuracy": 0.7429524183273315, "num_tokens": 130786715.0, "step": 1410 }, { "entropy": 1.485981273651123, "epoch": 0.35764883669678554, "grad_norm": 0.56640625, "learning_rate": 3.213296398891967e-05, "loss": 1.0028, "mean_token_accuracy": 0.7397522330284119, "num_tokens": 131737266.0, "step": 1420 }, { "entropy": 1.5126312345266342, "epoch": 0.3601674904763404, "grad_norm": 0.58984375, "learning_rate": 3.200705112062453e-05, "loss": 1.0257, "mean_token_accuracy": 0.7358055524528027, "num_tokens": 132679586.0, "step": 1430 }, { "entropy": 1.5042190700769424, "epoch": 0.36268614425589524, "grad_norm": 0.6640625, "learning_rate": 3.188113825232939e-05, "loss": 1.0099, "mean_token_accuracy": 0.7401847161352635, "num_tokens": 133603713.0, "step": 1440 }, { "entropy": 1.4730105847120285, "epoch": 0.36520479803545003, "grad_norm": 0.62890625, "learning_rate": 3.175522538403425e-05, "loss": 1.0513, "mean_token_accuracy": 0.7313306540250778, "num_tokens": 134522232.0, "step": 1450 }, { "entropy": 1.4745427146553993, "epoch": 0.3677234518150049, "grad_norm": 0.578125, "learning_rate": 3.1629312515739115e-05, "loss": 1.028, "mean_token_accuracy": 0.7363212339580059, "num_tokens": 135466122.0, "step": 1460 }, { "entropy": 1.4661547526717187, "epoch": 0.3702421055945597, "grad_norm": 0.57421875, "learning_rate": 3.150339964744397e-05, "loss": 1.0065, "mean_token_accuracy": 0.7393469184637069, "num_tokens": 136411704.0, "step": 1470 }, { "entropy": 1.4818128019571304, "epoch": 0.3727607593741145, "grad_norm": 0.58984375, "learning_rate": 3.137748677914883e-05, "loss": 1.005, "mean_token_accuracy": 0.7411336719989776, "num_tokens": 137343925.0, "step": 1480 }, { "entropy": 1.5323064669966697, "epoch": 0.37527941315366936, "grad_norm": 0.6953125, "learning_rate": 3.125157391085369e-05, "loss": 1.0397, "mean_token_accuracy": 0.7332744777202607, "num_tokens": 138258013.0, "step": 1490 }, { "entropy": 1.4970730185508727, "epoch": 0.3777980669332242, "grad_norm": 0.59375, "learning_rate": 3.112566104255855e-05, "loss": 1.0267, "mean_token_accuracy": 0.7344107307493687, "num_tokens": 139191604.0, "step": 1500 }, { "entropy": 1.5285832583904266, "epoch": 0.380316720712779, "grad_norm": 0.62109375, "learning_rate": 3.099974817426341e-05, "loss": 1.0279, "mean_token_accuracy": 0.7337069801986218, "num_tokens": 140119182.0, "step": 1510 }, { "entropy": 1.4828715667128562, "epoch": 0.38283537449233385, "grad_norm": 0.609375, "learning_rate": 3.0873835305968275e-05, "loss": 0.98, "mean_token_accuracy": 0.742748036235571, "num_tokens": 141028056.0, "step": 1520 }, { "entropy": 1.4884025305509567, "epoch": 0.3853540282718887, "grad_norm": 0.55078125, "learning_rate": 3.074792243767313e-05, "loss": 1.0096, "mean_token_accuracy": 0.740665141493082, "num_tokens": 141973431.0, "step": 1530 }, { "entropy": 1.5160500556230545, "epoch": 0.3878726820514435, "grad_norm": 0.60546875, "learning_rate": 3.062200956937799e-05, "loss": 1.0196, "mean_token_accuracy": 0.7365249536931515, "num_tokens": 142929741.0, "step": 1540 }, { "entropy": 1.5132767364382744, "epoch": 0.39039133583099833, "grad_norm": 0.6875, "learning_rate": 3.0496096701082855e-05, "loss": 0.9694, "mean_token_accuracy": 0.7474554844200612, "num_tokens": 143858628.0, "step": 1550 }, { "entropy": 1.4559171989560127, "epoch": 0.3929099896105532, "grad_norm": 0.56640625, "learning_rate": 3.0370183832787713e-05, "loss": 0.991, "mean_token_accuracy": 0.7405735231935978, "num_tokens": 144791852.0, "step": 1560 }, { "entropy": 1.4635022155940534, "epoch": 0.39542864339010797, "grad_norm": 0.625, "learning_rate": 3.024427096449257e-05, "loss": 0.9773, "mean_token_accuracy": 0.7441258721053601, "num_tokens": 145700233.0, "step": 1570 }, { "entropy": 1.4716689318418503, "epoch": 0.3979472971696628, "grad_norm": 0.5859375, "learning_rate": 3.0118358096197435e-05, "loss": 0.9752, "mean_token_accuracy": 0.7468914896249771, "num_tokens": 146628030.0, "step": 1580 }, { "entropy": 1.4879262149333954, "epoch": 0.40046595094921766, "grad_norm": 0.61328125, "learning_rate": 2.9992445227902293e-05, "loss": 0.9802, "mean_token_accuracy": 0.7438114926218986, "num_tokens": 147555920.0, "step": 1590 }, { "entropy": 1.479422764480114, "epoch": 0.40298460472877246, "grad_norm": 0.60546875, "learning_rate": 2.9866532359607154e-05, "loss": 1.0069, "mean_token_accuracy": 0.736028865724802, "num_tokens": 148480143.0, "step": 1600 }, { "entropy": 1.5022207498550415, "epoch": 0.4055032585083273, "grad_norm": 0.61328125, "learning_rate": 2.9740619491312015e-05, "loss": 1.0107, "mean_token_accuracy": 0.7401330538094044, "num_tokens": 149430672.0, "step": 1610 }, { "entropy": 1.4303474977612496, "epoch": 0.40802191228788215, "grad_norm": 0.5703125, "learning_rate": 2.9614706623016876e-05, "loss": 0.98, "mean_token_accuracy": 0.7455232538282871, "num_tokens": 150340592.0, "step": 1620 }, { "entropy": 1.5223925068974495, "epoch": 0.41054056606743694, "grad_norm": 0.671875, "learning_rate": 2.9488793754721734e-05, "loss": 1.0375, "mean_token_accuracy": 0.7336984358727932, "num_tokens": 151262776.0, "step": 1630 }, { "entropy": 1.5078096300363542, "epoch": 0.4130592198469918, "grad_norm": 0.6015625, "learning_rate": 2.9362880886426598e-05, "loss": 1.0294, "mean_token_accuracy": 0.7375610016286374, "num_tokens": 152191345.0, "step": 1640 }, { "entropy": 1.4810595944523812, "epoch": 0.41557787362654663, "grad_norm": 0.64453125, "learning_rate": 2.9236968018131456e-05, "loss": 1.0057, "mean_token_accuracy": 0.7403605856001377, "num_tokens": 153133627.0, "step": 1650 }, { "entropy": 1.5020821630954742, "epoch": 0.4180965274061014, "grad_norm": 0.5859375, "learning_rate": 2.9111055149836313e-05, "loss": 1.0231, "mean_token_accuracy": 0.7343570776283741, "num_tokens": 154077853.0, "step": 1660 }, { "entropy": 1.4656946510076523, "epoch": 0.4206151811856563, "grad_norm": 0.609375, "learning_rate": 2.898514228154117e-05, "loss": 0.9825, "mean_token_accuracy": 0.7439971931278706, "num_tokens": 154999470.0, "step": 1670 }, { "entropy": 1.4865729957818985, "epoch": 0.4231338349652111, "grad_norm": 0.60546875, "learning_rate": 2.8859229413246036e-05, "loss": 0.9847, "mean_token_accuracy": 0.741909223049879, "num_tokens": 155919939.0, "step": 1680 }, { "entropy": 1.442151701450348, "epoch": 0.4256524887447659, "grad_norm": 0.59765625, "learning_rate": 2.8733316544950893e-05, "loss": 0.971, "mean_token_accuracy": 0.747497969865799, "num_tokens": 156857683.0, "step": 1690 }, { "entropy": 1.4939273685216903, "epoch": 0.42817114252432076, "grad_norm": 0.58203125, "learning_rate": 2.8607403676655754e-05, "loss": 1.027, "mean_token_accuracy": 0.73572783395648, "num_tokens": 157789868.0, "step": 1700 }, { "entropy": 1.4739609718322755, "epoch": 0.4306897963038756, "grad_norm": 0.62109375, "learning_rate": 2.8481490808360615e-05, "loss": 1.0036, "mean_token_accuracy": 0.7423903658986092, "num_tokens": 158671912.0, "step": 1710 }, { "entropy": 1.5179324716329574, "epoch": 0.4332084500834304, "grad_norm": 0.609375, "learning_rate": 2.8355577940065477e-05, "loss": 1.0389, "mean_token_accuracy": 0.7320630177855492, "num_tokens": 159601676.0, "step": 1720 }, { "entropy": 1.500729313492775, "epoch": 0.43572710386298524, "grad_norm": 0.61328125, "learning_rate": 2.8229665071770334e-05, "loss": 1.0081, "mean_token_accuracy": 0.7389924034476281, "num_tokens": 160526625.0, "step": 1730 }, { "entropy": 1.4945330180227756, "epoch": 0.43824575764254003, "grad_norm": 0.5703125, "learning_rate": 2.81037522034752e-05, "loss": 0.9928, "mean_token_accuracy": 0.7408586353063583, "num_tokens": 161444586.0, "step": 1740 }, { "entropy": 1.4932605415582656, "epoch": 0.4407644114220949, "grad_norm": 0.63671875, "learning_rate": 2.7977839335180056e-05, "loss": 1.0089, "mean_token_accuracy": 0.7384962946176529, "num_tokens": 162384356.0, "step": 1750 }, { "entropy": 1.5264878809452056, "epoch": 0.44328306520164973, "grad_norm": 0.625, "learning_rate": 2.7851926466884914e-05, "loss": 1.003, "mean_token_accuracy": 0.7381562039256095, "num_tokens": 163308126.0, "step": 1760 }, { "entropy": 1.4538481026887893, "epoch": 0.4458017189812045, "grad_norm": 0.58203125, "learning_rate": 2.772601359858978e-05, "loss": 0.9907, "mean_token_accuracy": 0.7408280216157437, "num_tokens": 164233223.0, "step": 1770 }, { "entropy": 1.4829386696219444, "epoch": 0.44832037276075937, "grad_norm": 0.5625, "learning_rate": 2.7600100730294636e-05, "loss": 0.9865, "mean_token_accuracy": 0.7451853767037392, "num_tokens": 165127331.0, "step": 1780 }, { "entropy": 1.4769062221050262, "epoch": 0.4508390265403142, "grad_norm": 0.65625, "learning_rate": 2.7474187861999494e-05, "loss": 0.9878, "mean_token_accuracy": 0.7435719795525074, "num_tokens": 166030010.0, "step": 1790 }, { "entropy": 1.4725798398256302, "epoch": 0.453357680319869, "grad_norm": 0.6171875, "learning_rate": 2.734827499370436e-05, "loss": 0.9798, "mean_token_accuracy": 0.7441974826157093, "num_tokens": 166972675.0, "step": 1800 }, { "entropy": 1.5000967025756835, "epoch": 0.45587633409942385, "grad_norm": 0.6015625, "learning_rate": 2.7222362125409216e-05, "loss": 0.9785, "mean_token_accuracy": 0.7470294989645481, "num_tokens": 167918655.0, "step": 1810 }, { "entropy": 1.507605105638504, "epoch": 0.4583949878789787, "grad_norm": 0.6953125, "learning_rate": 2.7096449257114077e-05, "loss": 1.0254, "mean_token_accuracy": 0.7376879565417767, "num_tokens": 168837593.0, "step": 1820 }, { "entropy": 1.483200278878212, "epoch": 0.4609136416585335, "grad_norm": 0.609375, "learning_rate": 2.697053638881894e-05, "loss": 1.0047, "mean_token_accuracy": 0.7400114268064499, "num_tokens": 169770322.0, "step": 1830 }, { "entropy": 1.503974023461342, "epoch": 0.46343229543808834, "grad_norm": 0.62109375, "learning_rate": 2.68446235205238e-05, "loss": 1.0527, "mean_token_accuracy": 0.7306334659457207, "num_tokens": 170718172.0, "step": 1840 }, { "entropy": 1.4733003690838813, "epoch": 0.4659509492176432, "grad_norm": 0.61328125, "learning_rate": 2.6718710652228657e-05, "loss": 0.9902, "mean_token_accuracy": 0.7422384157776832, "num_tokens": 171646451.0, "step": 1850 }, { "entropy": 1.4795169189572335, "epoch": 0.468469602997198, "grad_norm": 0.5703125, "learning_rate": 2.659279778393352e-05, "loss": 0.994, "mean_token_accuracy": 0.7433700770139694, "num_tokens": 172571288.0, "step": 1860 }, { "entropy": 1.544270959496498, "epoch": 0.4709882567767528, "grad_norm": 0.58984375, "learning_rate": 2.646688491563838e-05, "loss": 1.0684, "mean_token_accuracy": 0.7255132175981999, "num_tokens": 173493482.0, "step": 1870 }, { "entropy": 1.4687143832445144, "epoch": 0.47350691055630767, "grad_norm": 0.6015625, "learning_rate": 2.6340972047343237e-05, "loss": 1.0264, "mean_token_accuracy": 0.7358646772801876, "num_tokens": 174430178.0, "step": 1880 }, { "entropy": 1.5258139103651047, "epoch": 0.47602556433586246, "grad_norm": 0.6328125, "learning_rate": 2.62150591790481e-05, "loss": 1.0474, "mean_token_accuracy": 0.7309989266097545, "num_tokens": 175370191.0, "step": 1890 }, { "entropy": 1.5031465500593186, "epoch": 0.4785442181154173, "grad_norm": 0.6640625, "learning_rate": 2.608914631075296e-05, "loss": 1.0244, "mean_token_accuracy": 0.7371547490358352, "num_tokens": 176327610.0, "step": 1900 }, { "entropy": 1.4879642963409423, "epoch": 0.48106287189497215, "grad_norm": 0.62890625, "learning_rate": 2.5963233442457817e-05, "loss": 0.9919, "mean_token_accuracy": 0.7449640512466431, "num_tokens": 177261487.0, "step": 1910 }, { "entropy": 1.4944231912493706, "epoch": 0.48358152567452695, "grad_norm": 0.61328125, "learning_rate": 2.583732057416268e-05, "loss": 1.0104, "mean_token_accuracy": 0.7372982695698738, "num_tokens": 178202468.0, "step": 1920 }, { "entropy": 1.5143211469054223, "epoch": 0.4861001794540818, "grad_norm": 0.58984375, "learning_rate": 2.571140770586754e-05, "loss": 1.0548, "mean_token_accuracy": 0.726641795784235, "num_tokens": 179133391.0, "step": 1930 }, { "entropy": 1.5140092059969903, "epoch": 0.48861883323363664, "grad_norm": 0.609375, "learning_rate": 2.55854948375724e-05, "loss": 0.9964, "mean_token_accuracy": 0.7447598196566105, "num_tokens": 180047435.0, "step": 1940 }, { "entropy": 1.4550499767065048, "epoch": 0.49113748701319143, "grad_norm": 0.56640625, "learning_rate": 2.5459581969277265e-05, "loss": 0.9904, "mean_token_accuracy": 0.7420261397957801, "num_tokens": 180983171.0, "step": 1950 }, { "entropy": 1.4785954818129539, "epoch": 0.4936561407927463, "grad_norm": 0.546875, "learning_rate": 2.5333669100982122e-05, "loss": 0.9914, "mean_token_accuracy": 0.7422729566693306, "num_tokens": 181901605.0, "step": 1960 }, { "entropy": 1.4713733956217765, "epoch": 0.4961747945723011, "grad_norm": 0.61328125, "learning_rate": 2.520775623268698e-05, "loss": 1.0136, "mean_token_accuracy": 0.7407643228769303, "num_tokens": 182808597.0, "step": 1970 }, { "entropy": 1.4882659435272216, "epoch": 0.4986934483518559, "grad_norm": 0.59765625, "learning_rate": 2.5081843364391845e-05, "loss": 1.0281, "mean_token_accuracy": 0.733605157583952, "num_tokens": 183760991.0, "step": 1980 }, { "entropy": 1.4794856160879135, "epoch": 0.5012121021314108, "grad_norm": 0.61328125, "learning_rate": 2.4955930496096702e-05, "loss": 0.9757, "mean_token_accuracy": 0.7448467329144478, "num_tokens": 184676166.0, "step": 1990 }, { "entropy": 1.4704470828175544, "epoch": 0.5037307559109656, "grad_norm": 0.5859375, "learning_rate": 2.4830017627801563e-05, "loss": 0.9887, "mean_token_accuracy": 0.7421532794833183, "num_tokens": 185591403.0, "step": 2000 }, { "entropy": 1.4506453573703766, "epoch": 0.5062494096905205, "grad_norm": 0.6015625, "learning_rate": 2.470410475950642e-05, "loss": 0.9482, "mean_token_accuracy": 0.751684907823801, "num_tokens": 186530825.0, "step": 2010 }, { "entropy": 1.505790999531746, "epoch": 0.5087680634700752, "grad_norm": 0.64453125, "learning_rate": 2.4578191891211282e-05, "loss": 1.01, "mean_token_accuracy": 0.738251518458128, "num_tokens": 187483104.0, "step": 2020 }, { "entropy": 1.4906439885497094, "epoch": 0.51128671724963, "grad_norm": 0.609375, "learning_rate": 2.4452279022916143e-05, "loss": 1.0081, "mean_token_accuracy": 0.7367694586515426, "num_tokens": 188419415.0, "step": 2030 }, { "entropy": 1.5162854179739953, "epoch": 0.5138053710291849, "grad_norm": 0.5703125, "learning_rate": 2.4326366154621e-05, "loss": 1.0318, "mean_token_accuracy": 0.7348616622388363, "num_tokens": 189364907.0, "step": 2040 }, { "entropy": 1.515935306251049, "epoch": 0.5163240248087397, "grad_norm": 0.625, "learning_rate": 2.4200453286325865e-05, "loss": 1.037, "mean_token_accuracy": 0.7346496164798737, "num_tokens": 190305289.0, "step": 2050 }, { "entropy": 1.5043818101286888, "epoch": 0.5188426785882946, "grad_norm": 0.58984375, "learning_rate": 2.4074540418030726e-05, "loss": 1.0202, "mean_token_accuracy": 0.737002718448639, "num_tokens": 191240393.0, "step": 2060 }, { "entropy": 1.4879194065928458, "epoch": 0.5213613323678494, "grad_norm": 0.625, "learning_rate": 2.3948627549735584e-05, "loss": 1.0149, "mean_token_accuracy": 0.7377648189663887, "num_tokens": 192175710.0, "step": 2070 }, { "entropy": 1.476494650542736, "epoch": 0.5238799861474042, "grad_norm": 0.58984375, "learning_rate": 2.3822714681440445e-05, "loss": 1.0126, "mean_token_accuracy": 0.7382982887327671, "num_tokens": 193089119.0, "step": 2080 }, { "entropy": 1.4906734734773637, "epoch": 0.526398639926959, "grad_norm": 0.58203125, "learning_rate": 2.3696801813145306e-05, "loss": 1.0228, "mean_token_accuracy": 0.7358043491840363, "num_tokens": 194014464.0, "step": 2090 }, { "entropy": 1.463935060799122, "epoch": 0.5289172937065139, "grad_norm": 0.546875, "learning_rate": 2.3570888944850164e-05, "loss": 0.979, "mean_token_accuracy": 0.7440614722669124, "num_tokens": 194937483.0, "step": 2100 }, { "entropy": 1.4706278055906297, "epoch": 0.5314359474860687, "grad_norm": 0.609375, "learning_rate": 2.3444976076555025e-05, "loss": 0.9844, "mean_token_accuracy": 0.742541317641735, "num_tokens": 195881861.0, "step": 2110 }, { "entropy": 1.510326901078224, "epoch": 0.5339546012656236, "grad_norm": 0.58984375, "learning_rate": 2.3319063208259886e-05, "loss": 1.0143, "mean_token_accuracy": 0.7375903382897377, "num_tokens": 196792310.0, "step": 2120 }, { "entropy": 1.500123569369316, "epoch": 0.5364732550451784, "grad_norm": 0.6171875, "learning_rate": 2.3193150339964744e-05, "loss": 1.0156, "mean_token_accuracy": 0.737464863806963, "num_tokens": 197740447.0, "step": 2130 }, { "entropy": 1.5234432876110078, "epoch": 0.5389919088247331, "grad_norm": 0.66015625, "learning_rate": 2.3067237471669605e-05, "loss": 1.0293, "mean_token_accuracy": 0.7343058608472347, "num_tokens": 198650674.0, "step": 2140 }, { "entropy": 1.4829162567853929, "epoch": 0.541510562604288, "grad_norm": 0.59765625, "learning_rate": 2.2941324603374466e-05, "loss": 1.0158, "mean_token_accuracy": 0.7392853118479252, "num_tokens": 199579745.0, "step": 2150 }, { "entropy": 1.4706959769129753, "epoch": 0.5440292163838428, "grad_norm": 0.61328125, "learning_rate": 2.2815411735079327e-05, "loss": 0.9895, "mean_token_accuracy": 0.7438252337276936, "num_tokens": 200490996.0, "step": 2160 }, { "entropy": 1.528316856920719, "epoch": 0.5465478701633977, "grad_norm": 0.58984375, "learning_rate": 2.2689498866784188e-05, "loss": 1.0492, "mean_token_accuracy": 0.7321145072579384, "num_tokens": 201428466.0, "step": 2170 }, { "entropy": 1.4623350918292999, "epoch": 0.5490665239429525, "grad_norm": 0.59375, "learning_rate": 2.256358599848905e-05, "loss": 0.981, "mean_token_accuracy": 0.744949608296156, "num_tokens": 202354085.0, "step": 2180 }, { "entropy": 1.5169390365481377, "epoch": 0.5515851777225074, "grad_norm": 0.6484375, "learning_rate": 2.2437673130193907e-05, "loss": 1.0167, "mean_token_accuracy": 0.737620497494936, "num_tokens": 203296048.0, "step": 2190 }, { "entropy": 1.4908597692847252, "epoch": 0.5541038315020621, "grad_norm": 0.60546875, "learning_rate": 2.2311760261898768e-05, "loss": 0.9884, "mean_token_accuracy": 0.7446716167032719, "num_tokens": 204251239.0, "step": 2200 }, { "entropy": 1.4890633031725884, "epoch": 0.556622485281617, "grad_norm": 0.6171875, "learning_rate": 2.218584739360363e-05, "loss": 0.9989, "mean_token_accuracy": 0.7413519226014614, "num_tokens": 205151325.0, "step": 2210 }, { "entropy": 1.519281443953514, "epoch": 0.5591411390611718, "grad_norm": 0.61328125, "learning_rate": 2.2059934525308487e-05, "loss": 1.021, "mean_token_accuracy": 0.7366731703281403, "num_tokens": 206096182.0, "step": 2220 }, { "entropy": 1.4802996426820756, "epoch": 0.5616597928407266, "grad_norm": 0.5859375, "learning_rate": 2.1934021657013348e-05, "loss": 0.9981, "mean_token_accuracy": 0.738096322119236, "num_tokens": 207029179.0, "step": 2230 }, { "entropy": 1.493895760178566, "epoch": 0.5641784466202815, "grad_norm": 0.6015625, "learning_rate": 2.1808108788718206e-05, "loss": 1.0104, "mean_token_accuracy": 0.7363863155245781, "num_tokens": 207960947.0, "step": 2240 }, { "entropy": 1.472677892446518, "epoch": 0.5666971003998363, "grad_norm": 0.62109375, "learning_rate": 2.1682195920423067e-05, "loss": 0.9692, "mean_token_accuracy": 0.7454905331134796, "num_tokens": 208889854.0, "step": 2250 }, { "entropy": 1.5076108410954476, "epoch": 0.5692157541793911, "grad_norm": 0.60546875, "learning_rate": 2.1556283052127928e-05, "loss": 1.0289, "mean_token_accuracy": 0.7352958224713803, "num_tokens": 209818677.0, "step": 2260 }, { "entropy": 1.4948209643363952, "epoch": 0.5717344079589459, "grad_norm": 0.56640625, "learning_rate": 2.143037018383279e-05, "loss": 0.9812, "mean_token_accuracy": 0.7438007473945618, "num_tokens": 210768812.0, "step": 2270 }, { "entropy": 1.4773472845554352, "epoch": 0.5742530617385008, "grad_norm": 0.8125, "learning_rate": 2.130445731553765e-05, "loss": 1.0183, "mean_token_accuracy": 0.7372843034565448, "num_tokens": 211681636.0, "step": 2280 }, { "entropy": 1.4644770205020905, "epoch": 0.5767717155180556, "grad_norm": 0.58984375, "learning_rate": 2.117854444724251e-05, "loss": 0.9989, "mean_token_accuracy": 0.7396629564464092, "num_tokens": 212615595.0, "step": 2290 }, { "entropy": 1.5075991481542588, "epoch": 0.5792903692976105, "grad_norm": 0.640625, "learning_rate": 2.105263157894737e-05, "loss": 1.0286, "mean_token_accuracy": 0.7359593294560909, "num_tokens": 213552263.0, "step": 2300 }, { "entropy": 1.4733971416950227, "epoch": 0.5818090230771653, "grad_norm": 0.6015625, "learning_rate": 2.092671871065223e-05, "loss": 1.0125, "mean_token_accuracy": 0.7387680150568485, "num_tokens": 214486865.0, "step": 2310 }, { "entropy": 1.4752314537763596, "epoch": 0.58432767685672, "grad_norm": 0.6171875, "learning_rate": 2.080080584235709e-05, "loss": 0.9759, "mean_token_accuracy": 0.7432409018278122, "num_tokens": 215442702.0, "step": 2320 }, { "entropy": 1.4748615235090257, "epoch": 0.5868463306362749, "grad_norm": 0.5703125, "learning_rate": 2.067489297406195e-05, "loss": 0.9963, "mean_token_accuracy": 0.740365145355463, "num_tokens": 216371631.0, "step": 2330 }, { "entropy": 1.4902510225772858, "epoch": 0.5893649844158297, "grad_norm": 0.6015625, "learning_rate": 2.054898010576681e-05, "loss": 0.9753, "mean_token_accuracy": 0.7458043657243252, "num_tokens": 217312756.0, "step": 2340 }, { "entropy": 1.4833617210388184, "epoch": 0.5918836381953846, "grad_norm": 0.58203125, "learning_rate": 2.042306723747167e-05, "loss": 1.0325, "mean_token_accuracy": 0.7355702064931393, "num_tokens": 218231302.0, "step": 2350 }, { "entropy": 1.510320021212101, "epoch": 0.5944022919749394, "grad_norm": 0.62890625, "learning_rate": 2.029715436917653e-05, "loss": 0.9958, "mean_token_accuracy": 0.7420489639043808, "num_tokens": 219167712.0, "step": 2360 }, { "entropy": 1.4711307182908058, "epoch": 0.5969209457544942, "grad_norm": 0.58203125, "learning_rate": 2.017124150088139e-05, "loss": 0.9686, "mean_token_accuracy": 0.7474707916378975, "num_tokens": 220082656.0, "step": 2370 }, { "entropy": 1.501902323961258, "epoch": 0.599439599534049, "grad_norm": 0.578125, "learning_rate": 2.004532863258625e-05, "loss": 1.0207, "mean_token_accuracy": 0.7335725836455822, "num_tokens": 220988673.0, "step": 2380 }, { "entropy": 1.4819249659776688, "epoch": 0.6019582533136039, "grad_norm": 0.63671875, "learning_rate": 1.9919415764291112e-05, "loss": 0.9895, "mean_token_accuracy": 0.7437810882925987, "num_tokens": 221890469.0, "step": 2390 }, { "entropy": 1.4631519243121147, "epoch": 0.6044769070931587, "grad_norm": 0.58203125, "learning_rate": 1.9793502895995973e-05, "loss": 0.9768, "mean_token_accuracy": 0.7473115906119346, "num_tokens": 222833708.0, "step": 2400 }, { "entropy": 1.4829539999365806, "epoch": 0.6069955608727136, "grad_norm": 0.60546875, "learning_rate": 1.9667590027700834e-05, "loss": 1.0029, "mean_token_accuracy": 0.7405181847512722, "num_tokens": 223767218.0, "step": 2410 }, { "entropy": 1.4947340697050095, "epoch": 0.6095142146522684, "grad_norm": 0.63671875, "learning_rate": 1.9541677159405692e-05, "loss": 1.0127, "mean_token_accuracy": 0.7391134299337864, "num_tokens": 224688061.0, "step": 2420 }, { "entropy": 1.450956329703331, "epoch": 0.6120328684318231, "grad_norm": 0.640625, "learning_rate": 1.9415764291110553e-05, "loss": 0.9603, "mean_token_accuracy": 0.7479838944971562, "num_tokens": 225619117.0, "step": 2430 }, { "entropy": 1.4841125264763833, "epoch": 0.614551522211378, "grad_norm": 0.609375, "learning_rate": 1.9289851422815414e-05, "loss": 0.9819, "mean_token_accuracy": 0.7439415737986564, "num_tokens": 226543813.0, "step": 2440 }, { "entropy": 1.4869384542107582, "epoch": 0.6170701759909328, "grad_norm": 0.6484375, "learning_rate": 1.916393855452027e-05, "loss": 1.0238, "mean_token_accuracy": 0.7360433027148247, "num_tokens": 227466179.0, "step": 2450 }, { "entropy": 1.4867294758558274, "epoch": 0.6195888297704877, "grad_norm": 0.59765625, "learning_rate": 1.9038025686225133e-05, "loss": 1.0198, "mean_token_accuracy": 0.7386736191809178, "num_tokens": 228391779.0, "step": 2460 }, { "entropy": 1.4967486664652825, "epoch": 0.6221074835500425, "grad_norm": 0.6015625, "learning_rate": 1.8912112817929994e-05, "loss": 0.9842, "mean_token_accuracy": 0.7447447247803212, "num_tokens": 229318854.0, "step": 2470 }, { "entropy": 1.4630463495850563, "epoch": 0.6246261373295974, "grad_norm": 0.59765625, "learning_rate": 1.878619994963485e-05, "loss": 0.9822, "mean_token_accuracy": 0.7429227210581303, "num_tokens": 230243272.0, "step": 2480 }, { "entropy": 1.5132867440581321, "epoch": 0.6271447911091521, "grad_norm": 0.5625, "learning_rate": 1.8660287081339713e-05, "loss": 1.0411, "mean_token_accuracy": 0.7323724761605263, "num_tokens": 231165164.0, "step": 2490 }, { "entropy": 1.505117255449295, "epoch": 0.629663444888707, "grad_norm": 0.55859375, "learning_rate": 1.8534374213044574e-05, "loss": 1.0083, "mean_token_accuracy": 0.7365673772990704, "num_tokens": 232090344.0, "step": 2500 }, { "entropy": 1.5145672991871835, "epoch": 0.6321820986682618, "grad_norm": 0.6015625, "learning_rate": 1.8408461344749435e-05, "loss": 1.0037, "mean_token_accuracy": 0.7394612200558186, "num_tokens": 233012123.0, "step": 2510 }, { "entropy": 1.4879171073436737, "epoch": 0.6347007524478167, "grad_norm": 0.62109375, "learning_rate": 1.8282548476454296e-05, "loss": 1.0255, "mean_token_accuracy": 0.734065717458725, "num_tokens": 233944623.0, "step": 2520 }, { "entropy": 1.5197929657995701, "epoch": 0.6372194062273715, "grad_norm": 0.5703125, "learning_rate": 1.8156635608159157e-05, "loss": 1.0018, "mean_token_accuracy": 0.7394672058522701, "num_tokens": 234854307.0, "step": 2530 }, { "entropy": 1.4701609089970589, "epoch": 0.6397380600069263, "grad_norm": 0.56640625, "learning_rate": 1.8030722739864015e-05, "loss": 0.9855, "mean_token_accuracy": 0.7438199289143086, "num_tokens": 235800851.0, "step": 2540 }, { "entropy": 1.4832564637064933, "epoch": 0.6422567137864811, "grad_norm": 0.58203125, "learning_rate": 1.7904809871568876e-05, "loss": 1.011, "mean_token_accuracy": 0.73984669521451, "num_tokens": 236747858.0, "step": 2550 }, { "entropy": 1.4942113682627678, "epoch": 0.6447753675660359, "grad_norm": 0.5859375, "learning_rate": 1.7778897003273737e-05, "loss": 1.0095, "mean_token_accuracy": 0.737560261040926, "num_tokens": 237690926.0, "step": 2560 }, { "entropy": 1.4950286373496056, "epoch": 0.6472940213455908, "grad_norm": 0.61328125, "learning_rate": 1.7652984134978595e-05, "loss": 1.0272, "mean_token_accuracy": 0.7348176456987858, "num_tokens": 238601585.0, "step": 2570 }, { "entropy": 1.507275079190731, "epoch": 0.6498126751251456, "grad_norm": 0.62109375, "learning_rate": 1.7527071266683456e-05, "loss": 0.9862, "mean_token_accuracy": 0.7441342391073704, "num_tokens": 239561971.0, "step": 2580 }, { "entropy": 1.4744239822030067, "epoch": 0.6523313289047005, "grad_norm": 0.61328125, "learning_rate": 1.7401158398388313e-05, "loss": 0.9914, "mean_token_accuracy": 0.7422404564917088, "num_tokens": 240510814.0, "step": 2590 }, { "entropy": 1.4942139282822609, "epoch": 0.6548499826842553, "grad_norm": 0.62890625, "learning_rate": 1.7275245530093174e-05, "loss": 0.9984, "mean_token_accuracy": 0.7415653012692929, "num_tokens": 241429091.0, "step": 2600 }, { "entropy": 1.5210790306329727, "epoch": 0.65736863646381, "grad_norm": 0.58984375, "learning_rate": 1.7149332661798036e-05, "loss": 1.0669, "mean_token_accuracy": 0.7277764029800892, "num_tokens": 242326342.0, "step": 2610 }, { "entropy": 1.501256914436817, "epoch": 0.6598872902433649, "grad_norm": 0.6015625, "learning_rate": 1.7023419793502897e-05, "loss": 1.0371, "mean_token_accuracy": 0.7327685542404652, "num_tokens": 243262918.0, "step": 2620 }, { "entropy": 1.4907999977469444, "epoch": 0.6624059440229197, "grad_norm": 0.609375, "learning_rate": 1.6897506925207758e-05, "loss": 1.0074, "mean_token_accuracy": 0.7394888132810593, "num_tokens": 244186200.0, "step": 2630 }, { "entropy": 1.5089690536260605, "epoch": 0.6649245978024746, "grad_norm": 0.640625, "learning_rate": 1.677159405691262e-05, "loss": 1.0026, "mean_token_accuracy": 0.7411562100052833, "num_tokens": 245110985.0, "step": 2640 }, { "entropy": 1.4826441787183284, "epoch": 0.6674432515820294, "grad_norm": 0.578125, "learning_rate": 1.6645681188617477e-05, "loss": 1.0147, "mean_token_accuracy": 0.7376951925456524, "num_tokens": 246023602.0, "step": 2650 }, { "entropy": 1.5016205877065658, "epoch": 0.6699619053615843, "grad_norm": 0.59765625, "learning_rate": 1.6519768320322338e-05, "loss": 1.0179, "mean_token_accuracy": 0.7369609415531159, "num_tokens": 246986524.0, "step": 2660 }, { "entropy": 1.4834182366728783, "epoch": 0.672480559141139, "grad_norm": 0.61328125, "learning_rate": 1.63938554520272e-05, "loss": 0.9773, "mean_token_accuracy": 0.7454558834433556, "num_tokens": 247926005.0, "step": 2670 }, { "entropy": 1.4759241729974746, "epoch": 0.6749992129206939, "grad_norm": 0.62109375, "learning_rate": 1.6267942583732056e-05, "loss": 1.0038, "mean_token_accuracy": 0.7400371395051479, "num_tokens": 248847171.0, "step": 2680 }, { "entropy": 1.5304366648197174, "epoch": 0.6775178667002487, "grad_norm": 0.63671875, "learning_rate": 1.6142029715436917e-05, "loss": 1.0356, "mean_token_accuracy": 0.7320890232920647, "num_tokens": 249786960.0, "step": 2690 }, { "entropy": 1.4903511464595796, "epoch": 0.6800365204798036, "grad_norm": 0.57421875, "learning_rate": 1.601611684714178e-05, "loss": 0.9906, "mean_token_accuracy": 0.7420216508209705, "num_tokens": 250698887.0, "step": 2700 }, { "entropy": 1.5175952777266501, "epoch": 0.6825551742593584, "grad_norm": 0.625, "learning_rate": 1.5890203978846636e-05, "loss": 0.9865, "mean_token_accuracy": 0.7433042749762535, "num_tokens": 251619967.0, "step": 2710 }, { "entropy": 1.4962933480739593, "epoch": 0.6850738280389131, "grad_norm": 0.58984375, "learning_rate": 1.5764291110551497e-05, "loss": 1.0039, "mean_token_accuracy": 0.7438869446516037, "num_tokens": 252542015.0, "step": 2720 }, { "entropy": 1.475045308470726, "epoch": 0.687592481818468, "grad_norm": 0.62109375, "learning_rate": 1.5638378242256362e-05, "loss": 0.9653, "mean_token_accuracy": 0.7465457111597061, "num_tokens": 253479410.0, "step": 2730 }, { "entropy": 1.4475198343396187, "epoch": 0.6901111355980228, "grad_norm": 0.61328125, "learning_rate": 1.551246537396122e-05, "loss": 0.9883, "mean_token_accuracy": 0.7442029610276222, "num_tokens": 254421008.0, "step": 2740 }, { "entropy": 1.4826817378401755, "epoch": 0.6926297893775777, "grad_norm": 0.609375, "learning_rate": 1.538655250566608e-05, "loss": 1.0162, "mean_token_accuracy": 0.7372715182602405, "num_tokens": 255356938.0, "step": 2750 }, { "entropy": 1.4607293367385865, "epoch": 0.6951484431571325, "grad_norm": 0.59765625, "learning_rate": 1.5260639637370942e-05, "loss": 0.982, "mean_token_accuracy": 0.7464394047856331, "num_tokens": 256276194.0, "step": 2760 }, { "entropy": 1.5108062788844108, "epoch": 0.6976670969366874, "grad_norm": 0.59765625, "learning_rate": 1.51347267690758e-05, "loss": 1.0184, "mean_token_accuracy": 0.736438725143671, "num_tokens": 257222479.0, "step": 2770 }, { "entropy": 1.4691065698862076, "epoch": 0.7001857507162421, "grad_norm": 0.6328125, "learning_rate": 1.500881390078066e-05, "loss": 1.0069, "mean_token_accuracy": 0.7403544157743454, "num_tokens": 258141986.0, "step": 2780 }, { "entropy": 1.4614216104149818, "epoch": 0.702704404495797, "grad_norm": 0.58984375, "learning_rate": 1.4882901032485522e-05, "loss": 0.9821, "mean_token_accuracy": 0.7435299441218376, "num_tokens": 259054793.0, "step": 2790 }, { "entropy": 1.4462628573179246, "epoch": 0.7052230582753518, "grad_norm": 0.58203125, "learning_rate": 1.475698816419038e-05, "loss": 0.9687, "mean_token_accuracy": 0.7498079493641854, "num_tokens": 260012807.0, "step": 2800 }, { "entropy": 1.4848258540034294, "epoch": 0.7077417120549067, "grad_norm": 0.6015625, "learning_rate": 1.4631075295895242e-05, "loss": 0.989, "mean_token_accuracy": 0.7408308543264865, "num_tokens": 260948752.0, "step": 2810 }, { "entropy": 1.4752742052078247, "epoch": 0.7102603658344615, "grad_norm": 0.58203125, "learning_rate": 1.4505162427600103e-05, "loss": 0.9764, "mean_token_accuracy": 0.7448857210576534, "num_tokens": 261830676.0, "step": 2820 }, { "entropy": 1.4709856286644936, "epoch": 0.7127790196140164, "grad_norm": 0.578125, "learning_rate": 1.4379249559304961e-05, "loss": 0.9866, "mean_token_accuracy": 0.7452083975076675, "num_tokens": 262789665.0, "step": 2830 }, { "entropy": 1.506988750398159, "epoch": 0.7152976733935711, "grad_norm": 0.6015625, "learning_rate": 1.4253336691009822e-05, "loss": 0.9845, "mean_token_accuracy": 0.742633256316185, "num_tokens": 263719914.0, "step": 2840 }, { "entropy": 1.4864262834191322, "epoch": 0.7178163271731259, "grad_norm": 0.6328125, "learning_rate": 1.4127423822714683e-05, "loss": 1.0123, "mean_token_accuracy": 0.735482431203127, "num_tokens": 264631489.0, "step": 2850 }, { "entropy": 1.4856854885816575, "epoch": 0.7203349809526808, "grad_norm": 0.60546875, "learning_rate": 1.4001510954419542e-05, "loss": 1.0006, "mean_token_accuracy": 0.7381072089076042, "num_tokens": 265559953.0, "step": 2860 }, { "entropy": 1.5200473442673683, "epoch": 0.7228536347322356, "grad_norm": 0.65625, "learning_rate": 1.3875598086124404e-05, "loss": 1.0176, "mean_token_accuracy": 0.7391909696161747, "num_tokens": 266506028.0, "step": 2870 }, { "entropy": 1.5127366796135902, "epoch": 0.7253722885117905, "grad_norm": 0.578125, "learning_rate": 1.3749685217829265e-05, "loss": 1.0437, "mean_token_accuracy": 0.7318307563662529, "num_tokens": 267439853.0, "step": 2880 }, { "entropy": 1.4693277314305306, "epoch": 0.7278909422913453, "grad_norm": 0.60546875, "learning_rate": 1.3623772349534122e-05, "loss": 0.9981, "mean_token_accuracy": 0.7403404414653778, "num_tokens": 268367954.0, "step": 2890 }, { "entropy": 1.4881853014230728, "epoch": 0.7304095960709001, "grad_norm": 0.6015625, "learning_rate": 1.3497859481238983e-05, "loss": 1.0046, "mean_token_accuracy": 0.7405321776866913, "num_tokens": 269276694.0, "step": 2900 }, { "entropy": 1.5084335424005986, "epoch": 0.7329282498504549, "grad_norm": 0.60546875, "learning_rate": 1.3371946612943845e-05, "loss": 1.0238, "mean_token_accuracy": 0.7338868103921413, "num_tokens": 270192213.0, "step": 2910 }, { "entropy": 1.4800263881683349, "epoch": 0.7354469036300098, "grad_norm": 0.5859375, "learning_rate": 1.3246033744648704e-05, "loss": 0.982, "mean_token_accuracy": 0.7456442162394523, "num_tokens": 271149665.0, "step": 2920 }, { "entropy": 1.5040636241436005, "epoch": 0.7379655574095646, "grad_norm": 0.59765625, "learning_rate": 1.3120120876353565e-05, "loss": 1.0298, "mean_token_accuracy": 0.733680484443903, "num_tokens": 272066248.0, "step": 2930 }, { "entropy": 1.4629945561289788, "epoch": 0.7404842111891194, "grad_norm": 0.6328125, "learning_rate": 1.2994208008058426e-05, "loss": 0.9934, "mean_token_accuracy": 0.7426059558987618, "num_tokens": 272970451.0, "step": 2940 }, { "entropy": 1.4538513720035553, "epoch": 0.7430028649686743, "grad_norm": 0.58984375, "learning_rate": 1.2868295139763284e-05, "loss": 1.0009, "mean_token_accuracy": 0.7420231208205224, "num_tokens": 273900781.0, "step": 2950 }, { "entropy": 1.4652035534381866, "epoch": 0.745521518748229, "grad_norm": 0.5625, "learning_rate": 1.2742382271468145e-05, "loss": 1.0068, "mean_token_accuracy": 0.7384018860757351, "num_tokens": 274840032.0, "step": 2960 }, { "entropy": 1.515961553156376, "epoch": 0.7480401725277839, "grad_norm": 0.609375, "learning_rate": 1.2616469403173004e-05, "loss": 1.005, "mean_token_accuracy": 0.7410760201513767, "num_tokens": 275780300.0, "step": 2970 }, { "entropy": 1.5057893320918083, "epoch": 0.7505588263073387, "grad_norm": 0.59375, "learning_rate": 1.2490556534877865e-05, "loss": 1.0121, "mean_token_accuracy": 0.7373140566051006, "num_tokens": 276711260.0, "step": 2980 }, { "entropy": 1.4707092121243477, "epoch": 0.7530774800868936, "grad_norm": 0.60546875, "learning_rate": 1.2364643666582726e-05, "loss": 0.9748, "mean_token_accuracy": 0.7442017652094364, "num_tokens": 277641984.0, "step": 2990 }, { "entropy": 1.5000385448336602, "epoch": 0.7555961338664484, "grad_norm": 0.59765625, "learning_rate": 1.2238730798287586e-05, "loss": 1.0032, "mean_token_accuracy": 0.7411497220396995, "num_tokens": 278587148.0, "step": 3000 }, { "entropy": 1.5032398775219917, "epoch": 0.7581147876460033, "grad_norm": 0.60546875, "learning_rate": 1.2112817929992445e-05, "loss": 0.984, "mean_token_accuracy": 0.7436385117471218, "num_tokens": 279492864.0, "step": 3010 }, { "entropy": 1.5076435655355453, "epoch": 0.760633441425558, "grad_norm": 0.609375, "learning_rate": 1.1986905061697306e-05, "loss": 1.0129, "mean_token_accuracy": 0.7388051725924015, "num_tokens": 280409665.0, "step": 3020 }, { "entropy": 1.4777460366487503, "epoch": 0.7631520952051128, "grad_norm": 0.58984375, "learning_rate": 1.1860992193402166e-05, "loss": 0.987, "mean_token_accuracy": 0.7431692533195019, "num_tokens": 281347495.0, "step": 3030 }, { "entropy": 1.4848545402288438, "epoch": 0.7656707489846677, "grad_norm": 0.59765625, "learning_rate": 1.1735079325107027e-05, "loss": 1.012, "mean_token_accuracy": 0.7397673189640045, "num_tokens": 282259845.0, "step": 3040 }, { "entropy": 1.4779446840286254, "epoch": 0.7681894027642225, "grad_norm": 0.58984375, "learning_rate": 1.1609166456811888e-05, "loss": 0.9848, "mean_token_accuracy": 0.7452454976737499, "num_tokens": 283198308.0, "step": 3050 }, { "entropy": 1.4629323229193687, "epoch": 0.7707080565437774, "grad_norm": 0.57421875, "learning_rate": 1.1483253588516747e-05, "loss": 1.0083, "mean_token_accuracy": 0.7391570150852204, "num_tokens": 284134979.0, "step": 3060 }, { "entropy": 1.490471364557743, "epoch": 0.7732267103233322, "grad_norm": 0.58203125, "learning_rate": 1.1357340720221607e-05, "loss": 1.0078, "mean_token_accuracy": 0.7395447090268135, "num_tokens": 285088130.0, "step": 3070 }, { "entropy": 1.4384993091225624, "epoch": 0.775745364102887, "grad_norm": 0.58203125, "learning_rate": 1.1231427851926466e-05, "loss": 0.972, "mean_token_accuracy": 0.7457866981625557, "num_tokens": 286034044.0, "step": 3080 }, { "entropy": 1.474022053182125, "epoch": 0.7782640178824418, "grad_norm": 0.61328125, "learning_rate": 1.1105514983631327e-05, "loss": 1.0109, "mean_token_accuracy": 0.7370796717703343, "num_tokens": 286953119.0, "step": 3090 }, { "entropy": 1.4849003747105598, "epoch": 0.7807826716619967, "grad_norm": 0.57421875, "learning_rate": 1.0979602115336188e-05, "loss": 0.9955, "mean_token_accuracy": 0.7422776162624359, "num_tokens": 287893431.0, "step": 3100 }, { "entropy": 1.4983975902199744, "epoch": 0.7833013254415515, "grad_norm": 0.6328125, "learning_rate": 1.0853689247041048e-05, "loss": 0.9983, "mean_token_accuracy": 0.7403753191232681, "num_tokens": 288840355.0, "step": 3110 }, { "entropy": 1.5098316431045533, "epoch": 0.7858199792211064, "grad_norm": 0.64453125, "learning_rate": 1.0727776378745909e-05, "loss": 1.0409, "mean_token_accuracy": 0.7355413317680359, "num_tokens": 289761229.0, "step": 3120 }, { "entropy": 1.5024679169058799, "epoch": 0.7883386330006611, "grad_norm": 0.609375, "learning_rate": 1.0601863510450768e-05, "loss": 1.0068, "mean_token_accuracy": 0.7369636178016663, "num_tokens": 290690390.0, "step": 3130 }, { "entropy": 1.522695505619049, "epoch": 0.7908572867802159, "grad_norm": 0.5859375, "learning_rate": 1.0475950642155628e-05, "loss": 1.0523, "mean_token_accuracy": 0.7308142200112343, "num_tokens": 291636996.0, "step": 3140 }, { "entropy": 1.512753178179264, "epoch": 0.7933759405597708, "grad_norm": 0.55859375, "learning_rate": 1.035003777386049e-05, "loss": 1.0027, "mean_token_accuracy": 0.7391382239758968, "num_tokens": 292575769.0, "step": 3150 }, { "entropy": 1.49990826100111, "epoch": 0.7958945943393256, "grad_norm": 0.6171875, "learning_rate": 1.022412490556535e-05, "loss": 1.0215, "mean_token_accuracy": 0.7357432976365089, "num_tokens": 293492388.0, "step": 3160 }, { "entropy": 1.5039694808423518, "epoch": 0.7984132481188805, "grad_norm": 0.6015625, "learning_rate": 1.0098212037270209e-05, "loss": 1.0502, "mean_token_accuracy": 0.7306272312998772, "num_tokens": 294428696.0, "step": 3170 }, { "entropy": 1.5101190388202668, "epoch": 0.8009319018984353, "grad_norm": 0.6015625, "learning_rate": 9.97229916897507e-06, "loss": 1.0399, "mean_token_accuracy": 0.7336853705346584, "num_tokens": 295346544.0, "step": 3180 }, { "entropy": 1.50984176248312, "epoch": 0.8034505556779901, "grad_norm": 0.578125, "learning_rate": 9.84638630067993e-06, "loss": 1.0043, "mean_token_accuracy": 0.7394494645297527, "num_tokens": 296248020.0, "step": 3190 }, { "entropy": 1.474437852203846, "epoch": 0.8059692094575449, "grad_norm": 0.5625, "learning_rate": 9.72047343238479e-06, "loss": 0.9938, "mean_token_accuracy": 0.7405206322669983, "num_tokens": 297188131.0, "step": 3200 }, { "entropy": 1.498723168671131, "epoch": 0.8084878632370998, "grad_norm": 0.61328125, "learning_rate": 9.594560564089652e-06, "loss": 1.0374, "mean_token_accuracy": 0.7325737461447716, "num_tokens": 298109292.0, "step": 3210 }, { "entropy": 1.4560261756181716, "epoch": 0.8110065170166546, "grad_norm": 0.578125, "learning_rate": 9.468647695794511e-06, "loss": 0.9786, "mean_token_accuracy": 0.7439539857208729, "num_tokens": 299051156.0, "step": 3220 }, { "entropy": 1.491245013475418, "epoch": 0.8135251707962095, "grad_norm": 0.5859375, "learning_rate": 9.34273482749937e-06, "loss": 0.9968, "mean_token_accuracy": 0.7427712038159371, "num_tokens": 299999619.0, "step": 3230 }, { "entropy": 1.4857505142688752, "epoch": 0.8160438245757643, "grad_norm": 0.57421875, "learning_rate": 9.216821959204232e-06, "loss": 1.0178, "mean_token_accuracy": 0.732306931167841, "num_tokens": 300908853.0, "step": 3240 }, { "entropy": 1.4923428311944007, "epoch": 0.818562478355319, "grad_norm": 0.62890625, "learning_rate": 9.090909090909091e-06, "loss": 1.0103, "mean_token_accuracy": 0.7387787699699402, "num_tokens": 301830035.0, "step": 3250 }, { "entropy": 1.4485341638326645, "epoch": 0.8210811321348739, "grad_norm": 0.59375, "learning_rate": 8.964996222613952e-06, "loss": 0.949, "mean_token_accuracy": 0.7519924528896809, "num_tokens": 302774780.0, "step": 3260 }, { "entropy": 1.482700689136982, "epoch": 0.8235997859144287, "grad_norm": 0.6015625, "learning_rate": 8.839083354318812e-06, "loss": 1.0185, "mean_token_accuracy": 0.7383209764957428, "num_tokens": 303698822.0, "step": 3270 }, { "entropy": 1.5057204052805901, "epoch": 0.8261184396939836, "grad_norm": 0.57421875, "learning_rate": 8.713170486023673e-06, "loss": 1.023, "mean_token_accuracy": 0.7377226896584034, "num_tokens": 304620345.0, "step": 3280 }, { "entropy": 1.4904442220926284, "epoch": 0.8286370934735384, "grad_norm": 0.5390625, "learning_rate": 8.587257617728532e-06, "loss": 1.0087, "mean_token_accuracy": 0.7416534572839737, "num_tokens": 305551710.0, "step": 3290 }, { "entropy": 1.5239005982875824, "epoch": 0.8311557472530933, "grad_norm": 0.62890625, "learning_rate": 8.461344749433391e-06, "loss": 1.059, "mean_token_accuracy": 0.7288159102201461, "num_tokens": 306466206.0, "step": 3300 }, { "entropy": 1.513123245537281, "epoch": 0.833674401032648, "grad_norm": 0.625, "learning_rate": 8.335431881138252e-06, "loss": 1.0271, "mean_token_accuracy": 0.7379589311778545, "num_tokens": 307399178.0, "step": 3310 }, { "entropy": 1.4970497369766236, "epoch": 0.8361930548122029, "grad_norm": 0.59765625, "learning_rate": 8.209519012843114e-06, "loss": 0.9927, "mean_token_accuracy": 0.7436629004776478, "num_tokens": 308340686.0, "step": 3320 }, { "entropy": 1.4847823336720467, "epoch": 0.8387117085917577, "grad_norm": 0.59765625, "learning_rate": 8.083606144547973e-06, "loss": 1.0018, "mean_token_accuracy": 0.7416875958442688, "num_tokens": 309290930.0, "step": 3330 }, { "entropy": 1.4939886629581451, "epoch": 0.8412303623713125, "grad_norm": 0.66015625, "learning_rate": 7.957693276252834e-06, "loss": 1.0149, "mean_token_accuracy": 0.736718226224184, "num_tokens": 310228345.0, "step": 3340 }, { "entropy": 1.5165553405880927, "epoch": 0.8437490161508674, "grad_norm": 0.61328125, "learning_rate": 7.831780407957693e-06, "loss": 1.0194, "mean_token_accuracy": 0.735667246580124, "num_tokens": 311147031.0, "step": 3350 }, { "entropy": 1.5101538181304932, "epoch": 0.8462676699304222, "grad_norm": 0.5625, "learning_rate": 7.705867539662553e-06, "loss": 1.0143, "mean_token_accuracy": 0.7377640530467033, "num_tokens": 312071813.0, "step": 3360 }, { "entropy": 1.4858613476157188, "epoch": 0.848786323709977, "grad_norm": 0.5859375, "learning_rate": 7.579954671367415e-06, "loss": 1.0042, "mean_token_accuracy": 0.7420022577047348, "num_tokens": 313019044.0, "step": 3370 }, { "entropy": 1.4877135768532752, "epoch": 0.8513049774895318, "grad_norm": 0.66796875, "learning_rate": 7.454041803072274e-06, "loss": 1.0116, "mean_token_accuracy": 0.7370616056025028, "num_tokens": 313924648.0, "step": 3380 }, { "entropy": 1.4523219719529152, "epoch": 0.8538236312690867, "grad_norm": 0.5703125, "learning_rate": 7.3281289347771344e-06, "loss": 0.972, "mean_token_accuracy": 0.7463509783148765, "num_tokens": 314876822.0, "step": 3390 }, { "entropy": 1.5021595641970635, "epoch": 0.8563422850486415, "grad_norm": 0.671875, "learning_rate": 7.2022160664819955e-06, "loss": 1.0164, "mean_token_accuracy": 0.7378572486341, "num_tokens": 315830857.0, "step": 3400 }, { "entropy": 1.4737745821475983, "epoch": 0.8588609388281964, "grad_norm": 0.578125, "learning_rate": 7.076303198186855e-06, "loss": 0.992, "mean_token_accuracy": 0.7421701058745385, "num_tokens": 316765928.0, "step": 3410 }, { "entropy": 1.5143599852919578, "epoch": 0.8613795926077512, "grad_norm": 0.6015625, "learning_rate": 6.950390329891715e-06, "loss": 1.0368, "mean_token_accuracy": 0.7320093587040901, "num_tokens": 317700949.0, "step": 3420 }, { "entropy": 1.5028961822390556, "epoch": 0.863898246387306, "grad_norm": 0.6328125, "learning_rate": 6.8244774615965745e-06, "loss": 1.0503, "mean_token_accuracy": 0.7298037901520729, "num_tokens": 318642426.0, "step": 3430 }, { "entropy": 1.487327341735363, "epoch": 0.8664169001668608, "grad_norm": 0.6171875, "learning_rate": 6.698564593301436e-06, "loss": 0.9981, "mean_token_accuracy": 0.7411175973713398, "num_tokens": 319554341.0, "step": 3440 }, { "entropy": 1.4858398377895354, "epoch": 0.8689355539464156, "grad_norm": 0.671875, "learning_rate": 6.572651725006296e-06, "loss": 0.9707, "mean_token_accuracy": 0.7463601998984813, "num_tokens": 320469718.0, "step": 3450 }, { "entropy": 1.4977013349533081, "epoch": 0.8714542077259705, "grad_norm": 0.63671875, "learning_rate": 6.446738856711155e-06, "loss": 1.0111, "mean_token_accuracy": 0.7389899030327797, "num_tokens": 321408669.0, "step": 3460 }, { "entropy": 1.4885832622647286, "epoch": 0.8739728615055253, "grad_norm": 0.69140625, "learning_rate": 6.320825988416016e-06, "loss": 1.002, "mean_token_accuracy": 0.7399603985249996, "num_tokens": 322319368.0, "step": 3470 }, { "entropy": 1.5308593392372132, "epoch": 0.8764915152850801, "grad_norm": 0.59765625, "learning_rate": 6.194913120120877e-06, "loss": 1.0263, "mean_token_accuracy": 0.7362756490707397, "num_tokens": 323249158.0, "step": 3480 }, { "entropy": 1.489845983684063, "epoch": 0.8790101690646349, "grad_norm": 0.55859375, "learning_rate": 6.069000251825737e-06, "loss": 0.962, "mean_token_accuracy": 0.7470691427588463, "num_tokens": 324177591.0, "step": 3490 }, { "entropy": 1.4811480522155762, "epoch": 0.8815288228441898, "grad_norm": 0.6171875, "learning_rate": 5.943087383530597e-06, "loss": 0.9931, "mean_token_accuracy": 0.74410410374403, "num_tokens": 325086173.0, "step": 3500 }, { "entropy": 1.517330525815487, "epoch": 0.8840474766237446, "grad_norm": 0.625, "learning_rate": 5.817174515235457e-06, "loss": 1.0269, "mean_token_accuracy": 0.7340725965797901, "num_tokens": 325998476.0, "step": 3510 }, { "entropy": 1.4777013659477234, "epoch": 0.8865661304032995, "grad_norm": 0.61328125, "learning_rate": 5.6912616469403176e-06, "loss": 1.0367, "mean_token_accuracy": 0.7329237192869187, "num_tokens": 326888629.0, "step": 3520 }, { "entropy": 1.488082292675972, "epoch": 0.8890847841828543, "grad_norm": 0.5625, "learning_rate": 5.565348778645178e-06, "loss": 0.9912, "mean_token_accuracy": 0.742741683870554, "num_tokens": 327829681.0, "step": 3530 }, { "entropy": 1.4924616023898125, "epoch": 0.891603437962409, "grad_norm": 0.59765625, "learning_rate": 5.439435910350038e-06, "loss": 0.9738, "mean_token_accuracy": 0.7450707465410232, "num_tokens": 328777620.0, "step": 3540 }, { "entropy": 1.4866561606526374, "epoch": 0.8941220917419639, "grad_norm": 0.6015625, "learning_rate": 5.313523042054898e-06, "loss": 1.0161, "mean_token_accuracy": 0.7406411737203598, "num_tokens": 329712464.0, "step": 3550 }, { "entropy": 1.4689026042819022, "epoch": 0.8966407455215187, "grad_norm": 0.59375, "learning_rate": 5.1876101737597585e-06, "loss": 0.9691, "mean_token_accuracy": 0.7475285783410073, "num_tokens": 330641995.0, "step": 3560 }, { "entropy": 1.5136161372065544, "epoch": 0.8991593993010736, "grad_norm": 0.58984375, "learning_rate": 5.061697305464619e-06, "loss": 1.0013, "mean_token_accuracy": 0.7394486844539643, "num_tokens": 331568134.0, "step": 3570 }, { "entropy": 1.491369791328907, "epoch": 0.9016780530806284, "grad_norm": 0.55859375, "learning_rate": 4.935784437169479e-06, "loss": 1.0122, "mean_token_accuracy": 0.735909091681242, "num_tokens": 332501528.0, "step": 3580 }, { "entropy": 1.4946796283125878, "epoch": 0.9041967068601833, "grad_norm": 0.62890625, "learning_rate": 4.809871568874339e-06, "loss": 0.9903, "mean_token_accuracy": 0.7426324136555195, "num_tokens": 333409554.0, "step": 3590 }, { "entropy": 1.4981262043118477, "epoch": 0.906715360639738, "grad_norm": 0.609375, "learning_rate": 4.6839587005791995e-06, "loss": 1.0273, "mean_token_accuracy": 0.7351961940526962, "num_tokens": 334331813.0, "step": 3600 }, { "entropy": 1.4707158148288726, "epoch": 0.9092340144192929, "grad_norm": 0.59375, "learning_rate": 4.55804583228406e-06, "loss": 1.0127, "mean_token_accuracy": 0.7383458167314529, "num_tokens": 335268161.0, "step": 3610 }, { "entropy": 1.529105232656002, "epoch": 0.9117526681988477, "grad_norm": 0.63671875, "learning_rate": 4.43213296398892e-06, "loss": 1.0746, "mean_token_accuracy": 0.7247563876211643, "num_tokens": 336166223.0, "step": 3620 }, { "entropy": 1.4632112085819244, "epoch": 0.9142713219784026, "grad_norm": 0.640625, "learning_rate": 4.30622009569378e-06, "loss": 0.9751, "mean_token_accuracy": 0.7464818298816681, "num_tokens": 337114488.0, "step": 3630 }, { "entropy": 1.4965253099799156, "epoch": 0.9167899757579574, "grad_norm": 0.59765625, "learning_rate": 4.1803072273986405e-06, "loss": 1.0182, "mean_token_accuracy": 0.7366202019155026, "num_tokens": 338046633.0, "step": 3640 }, { "entropy": 1.4636427968740464, "epoch": 0.9193086295375122, "grad_norm": 0.640625, "learning_rate": 4.054394359103501e-06, "loss": 0.9868, "mean_token_accuracy": 0.7432655967772007, "num_tokens": 338968280.0, "step": 3650 }, { "entropy": 1.4739444583654404, "epoch": 0.921827283317067, "grad_norm": 0.5625, "learning_rate": 3.928481490808361e-06, "loss": 0.9648, "mean_token_accuracy": 0.7487529583275319, "num_tokens": 339893347.0, "step": 3660 }, { "entropy": 1.415738572180271, "epoch": 0.9243459370966218, "grad_norm": 0.61328125, "learning_rate": 3.8025686225132208e-06, "loss": 0.9282, "mean_token_accuracy": 0.756267712265253, "num_tokens": 340816571.0, "step": 3670 }, { "entropy": 1.4868112698197364, "epoch": 0.9268645908761767, "grad_norm": 0.609375, "learning_rate": 3.6766557542180814e-06, "loss": 1.0149, "mean_token_accuracy": 0.7356903217732906, "num_tokens": 341727649.0, "step": 3680 }, { "entropy": 1.489026002585888, "epoch": 0.9293832446557315, "grad_norm": 0.59375, "learning_rate": 3.5507428859229413e-06, "loss": 0.9725, "mean_token_accuracy": 0.7466869972646236, "num_tokens": 342670871.0, "step": 3690 }, { "entropy": 1.4483363971114158, "epoch": 0.9319018984352864, "grad_norm": 0.54296875, "learning_rate": 3.4248300176278015e-06, "loss": 0.9528, "mean_token_accuracy": 0.7525399282574654, "num_tokens": 343575810.0, "step": 3700 }, { "entropy": 1.4972086012363435, "epoch": 0.9344205522148412, "grad_norm": 0.59765625, "learning_rate": 3.298917149332662e-06, "loss": 0.9881, "mean_token_accuracy": 0.7425376117229462, "num_tokens": 344505435.0, "step": 3710 }, { "entropy": 1.4751506879925729, "epoch": 0.936939205994396, "grad_norm": 0.56640625, "learning_rate": 3.173004281037522e-06, "loss": 0.9995, "mean_token_accuracy": 0.7415733940899372, "num_tokens": 345454166.0, "step": 3720 }, { "entropy": 1.4912448197603225, "epoch": 0.9394578597739508, "grad_norm": 0.58984375, "learning_rate": 3.0470914127423827e-06, "loss": 1.0192, "mean_token_accuracy": 0.7367800146341323, "num_tokens": 346361862.0, "step": 3730 }, { "entropy": 1.5106546625494957, "epoch": 0.9419765135535056, "grad_norm": 0.62890625, "learning_rate": 2.9211785444472425e-06, "loss": 1.045, "mean_token_accuracy": 0.7318918511271477, "num_tokens": 347306780.0, "step": 3740 }, { "entropy": 1.4863861680030823, "epoch": 0.9444951673330605, "grad_norm": 0.625, "learning_rate": 2.7952656761521027e-06, "loss": 0.9934, "mean_token_accuracy": 0.7438393741846084, "num_tokens": 348230042.0, "step": 3750 }, { "entropy": 1.4912439316511155, "epoch": 0.9470138211126153, "grad_norm": 0.62109375, "learning_rate": 2.6693528078569634e-06, "loss": 0.9985, "mean_token_accuracy": 0.7412358790636062, "num_tokens": 349130792.0, "step": 3760 }, { "entropy": 1.5144632264971734, "epoch": 0.9495324748921702, "grad_norm": 0.66015625, "learning_rate": 2.543439939561823e-06, "loss": 1.0468, "mean_token_accuracy": 0.7318057663738727, "num_tokens": 350050566.0, "step": 3770 }, { "entropy": 1.4877790048718453, "epoch": 0.9520511286717249, "grad_norm": 0.5546875, "learning_rate": 2.4175270712666834e-06, "loss": 1.0022, "mean_token_accuracy": 0.7390140548348427, "num_tokens": 350980304.0, "step": 3780 }, { "entropy": 1.4984122559428215, "epoch": 0.9545697824512798, "grad_norm": 0.62890625, "learning_rate": 2.2916142029715437e-06, "loss": 0.9951, "mean_token_accuracy": 0.7424575209617614, "num_tokens": 351911007.0, "step": 3790 }, { "entropy": 1.495207953453064, "epoch": 0.9570884362308346, "grad_norm": 0.61328125, "learning_rate": 2.1657013346764043e-06, "loss": 1.015, "mean_token_accuracy": 0.7366439893841743, "num_tokens": 352846519.0, "step": 3800 }, { "entropy": 1.481141744554043, "epoch": 0.9596070900103895, "grad_norm": 0.5703125, "learning_rate": 2.039788466381264e-06, "loss": 1.0275, "mean_token_accuracy": 0.7345097243785859, "num_tokens": 353782132.0, "step": 3810 }, { "entropy": 1.4692917168140411, "epoch": 0.9621257437899443, "grad_norm": 0.62890625, "learning_rate": 1.9138755980861244e-06, "loss": 0.9799, "mean_token_accuracy": 0.744342253357172, "num_tokens": 354668645.0, "step": 3820 }, { "entropy": 1.5071855306625366, "epoch": 0.9646443975694992, "grad_norm": 0.56640625, "learning_rate": 1.7879627297909846e-06, "loss": 1.0593, "mean_token_accuracy": 0.7290410205721856, "num_tokens": 355600887.0, "step": 3830 }, { "entropy": 1.5132853239774704, "epoch": 0.9671630513490539, "grad_norm": 0.61328125, "learning_rate": 1.662049861495845e-06, "loss": 1.0435, "mean_token_accuracy": 0.7298006169497967, "num_tokens": 356522841.0, "step": 3840 }, { "entropy": 1.4672839909791946, "epoch": 0.9696817051286087, "grad_norm": 0.60546875, "learning_rate": 1.5361369932007051e-06, "loss": 0.9753, "mean_token_accuracy": 0.7466705776751041, "num_tokens": 357452055.0, "step": 3850 }, { "entropy": 1.4822666108608247, "epoch": 0.9722003589081636, "grad_norm": 0.6328125, "learning_rate": 1.4102241249055656e-06, "loss": 1.0259, "mean_token_accuracy": 0.7341479398310184, "num_tokens": 358377891.0, "step": 3860 }, { "entropy": 1.4937451481819153, "epoch": 0.9747190126877184, "grad_norm": 0.578125, "learning_rate": 1.2843112566104256e-06, "loss": 0.9759, "mean_token_accuracy": 0.7456471361219883, "num_tokens": 359300390.0, "step": 3870 }, { "entropy": 1.5173174068331718, "epoch": 0.9772376664672733, "grad_norm": 0.6015625, "learning_rate": 1.1583983883152859e-06, "loss": 1.0301, "mean_token_accuracy": 0.7358597233891487, "num_tokens": 360238533.0, "step": 3880 }, { "entropy": 1.4928388759493827, "epoch": 0.979756320246828, "grad_norm": 0.57421875, "learning_rate": 1.032485520020146e-06, "loss": 1.0117, "mean_token_accuracy": 0.7398792788386345, "num_tokens": 361150526.0, "step": 3890 }, { "entropy": 1.5063897222280502, "epoch": 0.9822749740263829, "grad_norm": 0.62109375, "learning_rate": 9.065726517250064e-07, "loss": 1.017, "mean_token_accuracy": 0.7376690439879894, "num_tokens": 362100458.0, "step": 3900 }, { "entropy": 1.4783270865678788, "epoch": 0.9847936278059377, "grad_norm": 0.6328125, "learning_rate": 7.806597834298666e-07, "loss": 1.0081, "mean_token_accuracy": 0.7380148410797119, "num_tokens": 363014425.0, "step": 3910 }, { "entropy": 1.5196350157260894, "epoch": 0.9873122815854926, "grad_norm": 0.6328125, "learning_rate": 6.547469151347267e-07, "loss": 1.02, "mean_token_accuracy": 0.7349734269082546, "num_tokens": 363929023.0, "step": 3920 }, { "entropy": 1.4695521786808967, "epoch": 0.9898309353650474, "grad_norm": 0.59375, "learning_rate": 5.28834046839587e-07, "loss": 0.9597, "mean_token_accuracy": 0.7482846342027187, "num_tokens": 364898379.0, "step": 3930 }, { "entropy": 1.4966929897665977, "epoch": 0.9923495891446023, "grad_norm": 0.6328125, "learning_rate": 4.029211785444472e-07, "loss": 1.0137, "mean_token_accuracy": 0.7382561720907688, "num_tokens": 365874642.0, "step": 3940 }, { "entropy": 1.485151782631874, "epoch": 0.994868242924157, "grad_norm": 0.58984375, "learning_rate": 2.770083102493075e-07, "loss": 0.9854, "mean_token_accuracy": 0.7435578644275666, "num_tokens": 366766965.0, "step": 3950 }, { "entropy": 1.4845439344644547, "epoch": 0.9973868967037118, "grad_norm": 0.58984375, "learning_rate": 1.5109544195416771e-07, "loss": 0.9723, "mean_token_accuracy": 0.7472767226397992, "num_tokens": 367711087.0, "step": 3960 }, { "entropy": 1.5110925331711769, "epoch": 0.9999055504832667, "grad_norm": 0.6328125, "learning_rate": 2.518257365902795e-08, "loss": 1.0354, "mean_token_accuracy": 0.7324677541851997, "num_tokens": 368669225.0, "step": 3970 } ], "logging_steps": 10, "max_steps": 3971, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 4.986803437820707e+18, "train_batch_size": 4, "trial_name": null, "trial_params": null }