diff --git "a/trainer_state.json" "b/trainer_state.json" new file mode 100644--- /dev/null +++ "b/trainer_state.json" @@ -0,0 +1,4004 @@ +{ + "best_global_step": null, + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 1.0, + "eval_steps": 500, + "global_step": 3971, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "entropy": 1.6497728377580643, + "epoch": 0.002518653779554828, + "grad_norm": 0.6953125, + "learning_rate": 4.988667841853438e-05, + "loss": 1.1745, + "mean_token_accuracy": 0.7103757172822952, + "num_tokens": 927987.0, + "step": 10 + }, + { + "entropy": 1.5930162012577056, + "epoch": 0.005037307559109656, + "grad_norm": 0.625, + "learning_rate": 4.9760765550239234e-05, + "loss": 1.1032, + "mean_token_accuracy": 0.7197690099477768, + "num_tokens": 1859988.0, + "step": 20 + }, + { + "entropy": 1.5709561467170716, + "epoch": 0.0075559613386644835, + "grad_norm": 0.640625, + "learning_rate": 4.96348526819441e-05, + "loss": 1.085, + "mean_token_accuracy": 0.7227144911885262, + "num_tokens": 2800856.0, + "step": 30 + }, + { + "entropy": 1.566073715686798, + "epoch": 0.010074615118219311, + "grad_norm": 0.61328125, + "learning_rate": 4.9508939813648956e-05, + "loss": 1.0955, + "mean_token_accuracy": 0.7216884844005108, + "num_tokens": 3739770.0, + "step": 40 + }, + { + "entropy": 1.570231558382511, + "epoch": 0.01259326889777414, + "grad_norm": 0.61328125, + "learning_rate": 4.938302694535382e-05, + "loss": 1.1137, + "mean_token_accuracy": 0.7198784925043583, + "num_tokens": 4662394.0, + "step": 50 + }, + { + "entropy": 1.5752479314804078, + "epoch": 0.015111922677328967, + "grad_norm": 0.67578125, + "learning_rate": 4.925711407705868e-05, + "loss": 1.1067, + "mean_token_accuracy": 0.7184384018182755, + "num_tokens": 5592065.0, + "step": 60 + }, + { + "entropy": 1.5744277507066726, + "epoch": 0.017630576456883797, + "grad_norm": 0.58984375, + "learning_rate": 4.913120120876354e-05, + "loss": 1.0994, + "mean_token_accuracy": 0.7210577458143235, + "num_tokens": 6494850.0, + "step": 70 + }, + { + "entropy": 1.5574209734797477, + "epoch": 0.020149230236438623, + "grad_norm": 0.63671875, + "learning_rate": 4.90052883404684e-05, + "loss": 1.0789, + "mean_token_accuracy": 0.7261395655572415, + "num_tokens": 7402054.0, + "step": 80 + }, + { + "entropy": 1.536399021744728, + "epoch": 0.022667884015993452, + "grad_norm": 0.64453125, + "learning_rate": 4.887937547217326e-05, + "loss": 1.0834, + "mean_token_accuracy": 0.7243645377457142, + "num_tokens": 8302725.0, + "step": 90 + }, + { + "entropy": 1.5392677783966064, + "epoch": 0.02518653779554828, + "grad_norm": 0.63671875, + "learning_rate": 4.875346260387812e-05, + "loss": 1.0579, + "mean_token_accuracy": 0.7294937998056412, + "num_tokens": 9218531.0, + "step": 100 + }, + { + "entropy": 1.5304515838623047, + "epoch": 0.027705191575103108, + "grad_norm": 0.62109375, + "learning_rate": 4.862754973558298e-05, + "loss": 1.0607, + "mean_token_accuracy": 0.7303975030779839, + "num_tokens": 10136124.0, + "step": 110 + }, + { + "entropy": 1.5561267986893654, + "epoch": 0.030223845354657934, + "grad_norm": 0.62109375, + "learning_rate": 4.8501636867287845e-05, + "loss": 1.0511, + "mean_token_accuracy": 0.7304783284664154, + "num_tokens": 11083595.0, + "step": 120 + }, + { + "entropy": 1.5530587568879128, + "epoch": 0.03274249913421276, + "grad_norm": 0.609375, + "learning_rate": 4.83757239989927e-05, + "loss": 1.1037, + "mean_token_accuracy": 0.7202336438000202, + "num_tokens": 11990008.0, + "step": 130 + }, + { + "entropy": 1.5585834830999374, + "epoch": 0.03526115291376759, + "grad_norm": 0.61328125, + "learning_rate": 4.824981113069756e-05, + "loss": 1.103, + "mean_token_accuracy": 0.7219732508063317, + "num_tokens": 12902256.0, + "step": 140 + }, + { + "entropy": 1.5430516287684442, + "epoch": 0.03777980669332242, + "grad_norm": 0.62890625, + "learning_rate": 4.812389826240242e-05, + "loss": 1.0711, + "mean_token_accuracy": 0.7261470817029476, + "num_tokens": 13855059.0, + "step": 150 + }, + { + "entropy": 1.5312249392271042, + "epoch": 0.040298460472877246, + "grad_norm": 0.65625, + "learning_rate": 4.799798539410728e-05, + "loss": 1.0753, + "mean_token_accuracy": 0.7257871173322201, + "num_tokens": 14779771.0, + "step": 160 + }, + { + "entropy": 1.5230548575520515, + "epoch": 0.04281711425243207, + "grad_norm": 0.6015625, + "learning_rate": 4.7872072525812137e-05, + "loss": 1.0393, + "mean_token_accuracy": 0.735567494481802, + "num_tokens": 15690913.0, + "step": 170 + }, + { + "entropy": 1.5378432273864746, + "epoch": 0.045335768031986905, + "grad_norm": 0.64453125, + "learning_rate": 4.7746159657517e-05, + "loss": 1.0876, + "mean_token_accuracy": 0.7245238177478314, + "num_tokens": 16633243.0, + "step": 180 + }, + { + "entropy": 1.5589430660009385, + "epoch": 0.04785442181154173, + "grad_norm": 0.61328125, + "learning_rate": 4.762024678922186e-05, + "loss": 1.0532, + "mean_token_accuracy": 0.7320627510547638, + "num_tokens": 17553351.0, + "step": 190 + }, + { + "entropy": 1.5157382100820542, + "epoch": 0.05037307559109656, + "grad_norm": 0.63671875, + "learning_rate": 4.749433392092672e-05, + "loss": 1.0358, + "mean_token_accuracy": 0.731314767897129, + "num_tokens": 18490557.0, + "step": 200 + }, + { + "entropy": 1.5197158992290496, + "epoch": 0.05289172937065139, + "grad_norm": 0.6171875, + "learning_rate": 4.736842105263158e-05, + "loss": 1.0799, + "mean_token_accuracy": 0.7257929719984532, + "num_tokens": 19433634.0, + "step": 210 + }, + { + "entropy": 1.5323385715484619, + "epoch": 0.055410383150206216, + "grad_norm": 0.67578125, + "learning_rate": 4.724250818433644e-05, + "loss": 1.0491, + "mean_token_accuracy": 0.7314196087419986, + "num_tokens": 20340871.0, + "step": 220 + }, + { + "entropy": 1.5352398797869682, + "epoch": 0.05792903692976104, + "grad_norm": 0.58984375, + "learning_rate": 4.71165953160413e-05, + "loss": 1.0442, + "mean_token_accuracy": 0.7328816823661327, + "num_tokens": 21256808.0, + "step": 230 + }, + { + "entropy": 1.5354523420333863, + "epoch": 0.06044769070931587, + "grad_norm": 0.6484375, + "learning_rate": 4.699068244774616e-05, + "loss": 1.073, + "mean_token_accuracy": 0.7256046369671821, + "num_tokens": 22171600.0, + "step": 240 + }, + { + "entropy": 1.5628203928470612, + "epoch": 0.0629663444888707, + "grad_norm": 0.58984375, + "learning_rate": 4.6864769579451025e-05, + "loss": 1.1204, + "mean_token_accuracy": 0.7178477592766285, + "num_tokens": 23116116.0, + "step": 250 + }, + { + "entropy": 1.5106180116534234, + "epoch": 0.06548499826842552, + "grad_norm": 0.62890625, + "learning_rate": 4.673885671115588e-05, + "loss": 1.0505, + "mean_token_accuracy": 0.7322093218564987, + "num_tokens": 24022009.0, + "step": 260 + }, + { + "entropy": 1.5455271020531653, + "epoch": 0.06800365204798035, + "grad_norm": 0.640625, + "learning_rate": 4.661294384286074e-05, + "loss": 1.1028, + "mean_token_accuracy": 0.7194493912160397, + "num_tokens": 24938320.0, + "step": 270 + }, + { + "entropy": 1.4870401427149773, + "epoch": 0.07052230582753519, + "grad_norm": 0.625, + "learning_rate": 4.64870309745656e-05, + "loss": 1.0062, + "mean_token_accuracy": 0.7405259512364865, + "num_tokens": 25872274.0, + "step": 280 + }, + { + "entropy": 1.5163322016596794, + "epoch": 0.07304095960709, + "grad_norm": 0.59765625, + "learning_rate": 4.636111810627046e-05, + "loss": 1.0475, + "mean_token_accuracy": 0.7297493070363998, + "num_tokens": 26787336.0, + "step": 290 + }, + { + "entropy": 1.5091008096933365, + "epoch": 0.07555961338664484, + "grad_norm": 0.5546875, + "learning_rate": 4.6235205237975324e-05, + "loss": 1.038, + "mean_token_accuracy": 0.7351058594882488, + "num_tokens": 27725039.0, + "step": 300 + }, + { + "entropy": 1.535538549721241, + "epoch": 0.07807826716619967, + "grad_norm": 0.63671875, + "learning_rate": 4.6109292369680185e-05, + "loss": 1.0576, + "mean_token_accuracy": 0.7299107275903225, + "num_tokens": 28643618.0, + "step": 310 + }, + { + "entropy": 1.5314571484923363, + "epoch": 0.08059692094575449, + "grad_norm": 0.640625, + "learning_rate": 4.5983379501385046e-05, + "loss": 1.0666, + "mean_token_accuracy": 0.7284630224108696, + "num_tokens": 29563205.0, + "step": 320 + }, + { + "entropy": 1.5281456634402275, + "epoch": 0.08311557472530932, + "grad_norm": 0.65234375, + "learning_rate": 4.58574666330899e-05, + "loss": 1.0655, + "mean_token_accuracy": 0.7297011129558086, + "num_tokens": 30480512.0, + "step": 330 + }, + { + "entropy": 1.5301422774791718, + "epoch": 0.08563422850486414, + "grad_norm": 0.61328125, + "learning_rate": 4.573155376479477e-05, + "loss": 1.0605, + "mean_token_accuracy": 0.7305384628474713, + "num_tokens": 31442273.0, + "step": 340 + }, + { + "entropy": 1.4844171449542045, + "epoch": 0.08815288228441898, + "grad_norm": 0.62109375, + "learning_rate": 4.560564089649962e-05, + "loss": 1.0442, + "mean_token_accuracy": 0.7323296993970871, + "num_tokens": 32344410.0, + "step": 350 + }, + { + "entropy": 1.5229773551225663, + "epoch": 0.09067153606397381, + "grad_norm": 0.6015625, + "learning_rate": 4.5479728028204484e-05, + "loss": 1.0332, + "mean_token_accuracy": 0.7339819706976414, + "num_tokens": 33250917.0, + "step": 360 + }, + { + "entropy": 1.5061728432774544, + "epoch": 0.09319018984352863, + "grad_norm": 0.6328125, + "learning_rate": 4.5353815159909345e-05, + "loss": 1.0196, + "mean_token_accuracy": 0.7394672840833664, + "num_tokens": 34175027.0, + "step": 370 + }, + { + "entropy": 1.5456583075225354, + "epoch": 0.09570884362308346, + "grad_norm": 0.640625, + "learning_rate": 4.5227902291614206e-05, + "loss": 1.0619, + "mean_token_accuracy": 0.7283155068755149, + "num_tokens": 35109724.0, + "step": 380 + }, + { + "entropy": 1.5447079360485076, + "epoch": 0.0982274974026383, + "grad_norm": 0.62109375, + "learning_rate": 4.510198942331906e-05, + "loss": 1.0899, + "mean_token_accuracy": 0.7229381762444973, + "num_tokens": 36062415.0, + "step": 390 + }, + { + "entropy": 1.533456189930439, + "epoch": 0.10074615118219311, + "grad_norm": 0.65625, + "learning_rate": 4.497607655502393e-05, + "loss": 1.0645, + "mean_token_accuracy": 0.7263024888932705, + "num_tokens": 37007526.0, + "step": 400 + }, + { + "entropy": 1.522585578262806, + "epoch": 0.10326480496174795, + "grad_norm": 0.6171875, + "learning_rate": 4.485016368672878e-05, + "loss": 1.0556, + "mean_token_accuracy": 0.7289167314767837, + "num_tokens": 37935164.0, + "step": 410 + }, + { + "entropy": 1.4904729962348937, + "epoch": 0.10578345874130278, + "grad_norm": 0.66796875, + "learning_rate": 4.4724250818433643e-05, + "loss": 1.0408, + "mean_token_accuracy": 0.7305458515882493, + "num_tokens": 38872935.0, + "step": 420 + }, + { + "entropy": 1.51086837798357, + "epoch": 0.1083021125208576, + "grad_norm": 0.59765625, + "learning_rate": 4.459833795013851e-05, + "loss": 1.0184, + "mean_token_accuracy": 0.7377710983157157, + "num_tokens": 39800020.0, + "step": 430 + }, + { + "entropy": 1.527511714398861, + "epoch": 0.11082076630041243, + "grad_norm": 0.62890625, + "learning_rate": 4.4472425081843366e-05, + "loss": 1.0671, + "mean_token_accuracy": 0.728612695634365, + "num_tokens": 40736503.0, + "step": 440 + }, + { + "entropy": 1.5698168337345124, + "epoch": 0.11333942007996725, + "grad_norm": 0.60546875, + "learning_rate": 4.434651221354823e-05, + "loss": 1.0474, + "mean_token_accuracy": 0.7324717722833156, + "num_tokens": 41666603.0, + "step": 450 + }, + { + "entropy": 1.5131051123142243, + "epoch": 0.11585807385952208, + "grad_norm": 0.625, + "learning_rate": 4.422059934525309e-05, + "loss": 1.0566, + "mean_token_accuracy": 0.7301515676081181, + "num_tokens": 42598424.0, + "step": 460 + }, + { + "entropy": 1.50111276358366, + "epoch": 0.11837672763907692, + "grad_norm": 0.578125, + "learning_rate": 4.409468647695795e-05, + "loss": 1.0339, + "mean_token_accuracy": 0.7336028017103672, + "num_tokens": 43559521.0, + "step": 470 + }, + { + "entropy": 1.4837490528821946, + "epoch": 0.12089538141863174, + "grad_norm": 0.59765625, + "learning_rate": 4.39687736086628e-05, + "loss": 0.9844, + "mean_token_accuracy": 0.7455279111862183, + "num_tokens": 44494185.0, + "step": 480 + }, + { + "entropy": 1.5296257749199866, + "epoch": 0.12341403519818657, + "grad_norm": 0.58203125, + "learning_rate": 4.384286074036767e-05, + "loss": 1.0266, + "mean_token_accuracy": 0.7367306031286717, + "num_tokens": 45420386.0, + "step": 490 + }, + { + "entropy": 1.5529645070433618, + "epoch": 0.1259326889777414, + "grad_norm": 0.609375, + "learning_rate": 4.3716947872072525e-05, + "loss": 1.0647, + "mean_token_accuracy": 0.7286850355565548, + "num_tokens": 46328398.0, + "step": 500 + }, + { + "entropy": 1.5489887461066245, + "epoch": 0.12845134275729622, + "grad_norm": 0.62890625, + "learning_rate": 4.3591035003777386e-05, + "loss": 1.0497, + "mean_token_accuracy": 0.7323333226144314, + "num_tokens": 47237802.0, + "step": 510 + }, + { + "entropy": 1.5361493453383446, + "epoch": 0.13096999653685104, + "grad_norm": 0.59375, + "learning_rate": 4.346512213548225e-05, + "loss": 1.0247, + "mean_token_accuracy": 0.7348957560956478, + "num_tokens": 48176536.0, + "step": 520 + }, + { + "entropy": 1.5109021827578544, + "epoch": 0.1334886503164059, + "grad_norm": 0.58203125, + "learning_rate": 4.333920926718711e-05, + "loss": 1.0204, + "mean_token_accuracy": 0.7367621898651123, + "num_tokens": 49109015.0, + "step": 530 + }, + { + "entropy": 1.4852696403861045, + "epoch": 0.1360073040959607, + "grad_norm": 0.5859375, + "learning_rate": 4.321329639889197e-05, + "loss": 1.0364, + "mean_token_accuracy": 0.7326985791325569, + "num_tokens": 50040438.0, + "step": 540 + }, + { + "entropy": 1.5346143633127212, + "epoch": 0.13852595787551553, + "grad_norm": 0.65625, + "learning_rate": 4.308738353059683e-05, + "loss": 1.0536, + "mean_token_accuracy": 0.7286248430609703, + "num_tokens": 50976370.0, + "step": 550 + }, + { + "entropy": 1.514106061309576, + "epoch": 0.14104461165507037, + "grad_norm": 0.69921875, + "learning_rate": 4.296147066230169e-05, + "loss": 1.041, + "mean_token_accuracy": 0.7335773780941963, + "num_tokens": 51918138.0, + "step": 560 + }, + { + "entropy": 1.5336113646626472, + "epoch": 0.1435632654346252, + "grad_norm": 0.61328125, + "learning_rate": 4.2835557794006546e-05, + "loss": 1.0518, + "mean_token_accuracy": 0.7317119717597962, + "num_tokens": 52817229.0, + "step": 570 + }, + { + "entropy": 1.5196146205067635, + "epoch": 0.14608191921418, + "grad_norm": 0.59765625, + "learning_rate": 4.2709644925711414e-05, + "loss": 1.0267, + "mean_token_accuracy": 0.736695246398449, + "num_tokens": 53760765.0, + "step": 580 + }, + { + "entropy": 1.5179338246583938, + "epoch": 0.14860057299373486, + "grad_norm": 0.61328125, + "learning_rate": 4.258373205741627e-05, + "loss": 1.0466, + "mean_token_accuracy": 0.7297343403100968, + "num_tokens": 54671519.0, + "step": 590 + }, + { + "entropy": 1.5304696060717107, + "epoch": 0.15111922677328968, + "grad_norm": 0.62890625, + "learning_rate": 4.245781918912113e-05, + "loss": 1.0458, + "mean_token_accuracy": 0.7315973825752735, + "num_tokens": 55593071.0, + "step": 600 + }, + { + "entropy": 1.4869036689400672, + "epoch": 0.1536378805528445, + "grad_norm": 0.6640625, + "learning_rate": 4.233190632082599e-05, + "loss": 1.0077, + "mean_token_accuracy": 0.7418606728315353, + "num_tokens": 56514341.0, + "step": 610 + }, + { + "entropy": 1.4934701904654504, + "epoch": 0.15615653433239934, + "grad_norm": 0.578125, + "learning_rate": 4.220599345253085e-05, + "loss": 1.0083, + "mean_token_accuracy": 0.7406033039093017, + "num_tokens": 57462853.0, + "step": 620 + }, + { + "entropy": 1.5260894536972045, + "epoch": 0.15867518811195416, + "grad_norm": 0.63671875, + "learning_rate": 4.2080080584235706e-05, + "loss": 1.052, + "mean_token_accuracy": 0.7272073470056057, + "num_tokens": 58377529.0, + "step": 630 + }, + { + "entropy": 1.548849606513977, + "epoch": 0.16119384189150898, + "grad_norm": 0.609375, + "learning_rate": 4.1954167715940574e-05, + "loss": 1.0904, + "mean_token_accuracy": 0.724496615678072, + "num_tokens": 59304012.0, + "step": 640 + }, + { + "entropy": 1.5230202600359917, + "epoch": 0.16371249567106383, + "grad_norm": 0.61328125, + "learning_rate": 4.1828254847645435e-05, + "loss": 1.0317, + "mean_token_accuracy": 0.7327270671725273, + "num_tokens": 60226985.0, + "step": 650 + }, + { + "entropy": 1.4835097789764404, + "epoch": 0.16623114945061865, + "grad_norm": 0.60546875, + "learning_rate": 4.170234197935029e-05, + "loss": 1.0267, + "mean_token_accuracy": 0.7380013577640057, + "num_tokens": 61164672.0, + "step": 660 + }, + { + "entropy": 1.5426082447171212, + "epoch": 0.16874980323017347, + "grad_norm": 0.56640625, + "learning_rate": 4.157642911105516e-05, + "loss": 1.0308, + "mean_token_accuracy": 0.7336142487823963, + "num_tokens": 62097480.0, + "step": 670 + }, + { + "entropy": 1.5340310111641884, + "epoch": 0.1712684570097283, + "grad_norm": 0.609375, + "learning_rate": 4.145051624276001e-05, + "loss": 1.072, + "mean_token_accuracy": 0.7251117169857025, + "num_tokens": 63026840.0, + "step": 680 + }, + { + "entropy": 1.500159528851509, + "epoch": 0.17378711078928313, + "grad_norm": 0.6328125, + "learning_rate": 4.132460337446487e-05, + "loss": 1.0297, + "mean_token_accuracy": 0.7330615803599357, + "num_tokens": 63949950.0, + "step": 690 + }, + { + "entropy": 1.5545173302292823, + "epoch": 0.17630576456883795, + "grad_norm": 0.57421875, + "learning_rate": 4.1198690506169734e-05, + "loss": 1.0545, + "mean_token_accuracy": 0.7317077338695526, + "num_tokens": 64876440.0, + "step": 700 + }, + { + "entropy": 1.5059973791241645, + "epoch": 0.17882441834839277, + "grad_norm": 0.58203125, + "learning_rate": 4.1072777637874595e-05, + "loss": 1.01, + "mean_token_accuracy": 0.7392976120114326, + "num_tokens": 65798419.0, + "step": 710 + }, + { + "entropy": 1.5090464890003203, + "epoch": 0.18134307212794762, + "grad_norm": 0.60546875, + "learning_rate": 4.094686476957945e-05, + "loss": 1.0592, + "mean_token_accuracy": 0.7292688339948654, + "num_tokens": 66749039.0, + "step": 720 + }, + { + "entropy": 1.5077268376946449, + "epoch": 0.18386172590750244, + "grad_norm": 0.66015625, + "learning_rate": 4.082095190128432e-05, + "loss": 1.0422, + "mean_token_accuracy": 0.7338137224316597, + "num_tokens": 67710358.0, + "step": 730 + }, + { + "entropy": 1.5227509185671806, + "epoch": 0.18638037968705726, + "grad_norm": 0.60546875, + "learning_rate": 4.069503903298917e-05, + "loss": 1.0484, + "mean_token_accuracy": 0.7323349170386791, + "num_tokens": 68624639.0, + "step": 740 + }, + { + "entropy": 1.4950523242354392, + "epoch": 0.1888990334666121, + "grad_norm": 0.609375, + "learning_rate": 4.056912616469403e-05, + "loss": 1.0318, + "mean_token_accuracy": 0.7348136067390442, + "num_tokens": 69559409.0, + "step": 750 + }, + { + "entropy": 1.4976729974150658, + "epoch": 0.19141768724616692, + "grad_norm": 0.61328125, + "learning_rate": 4.044321329639889e-05, + "loss": 1.0152, + "mean_token_accuracy": 0.7377664625644684, + "num_tokens": 70498976.0, + "step": 760 + }, + { + "entropy": 1.5174943268299104, + "epoch": 0.19393634102572174, + "grad_norm": 0.58984375, + "learning_rate": 4.0317300428103754e-05, + "loss": 1.0128, + "mean_token_accuracy": 0.7391440957784653, + "num_tokens": 71449612.0, + "step": 770 + }, + { + "entropy": 1.5164562672376634, + "epoch": 0.1964549948052766, + "grad_norm": 0.671875, + "learning_rate": 4.0191387559808616e-05, + "loss": 0.9954, + "mean_token_accuracy": 0.7393902830779553, + "num_tokens": 72373886.0, + "step": 780 + }, + { + "entropy": 1.4641567483544349, + "epoch": 0.1989736485848314, + "grad_norm": 0.58203125, + "learning_rate": 4.0065474691513477e-05, + "loss": 0.9909, + "mean_token_accuracy": 0.7428550243377685, + "num_tokens": 73312402.0, + "step": 790 + }, + { + "entropy": 1.507477380335331, + "epoch": 0.20149230236438623, + "grad_norm": 0.578125, + "learning_rate": 3.993956182321834e-05, + "loss": 1.0209, + "mean_token_accuracy": 0.7389532752335072, + "num_tokens": 74255599.0, + "step": 800 + }, + { + "entropy": 1.4874264925718308, + "epoch": 0.20401095614394107, + "grad_norm": 0.61328125, + "learning_rate": 3.981364895492319e-05, + "loss": 1.0178, + "mean_token_accuracy": 0.7369325928390026, + "num_tokens": 75173757.0, + "step": 810 + }, + { + "entropy": 1.4983343809843064, + "epoch": 0.2065296099234959, + "grad_norm": 0.61328125, + "learning_rate": 3.968773608662806e-05, + "loss": 1.0488, + "mean_token_accuracy": 0.7323521085083484, + "num_tokens": 76090812.0, + "step": 820 + }, + { + "entropy": 1.5155110970139503, + "epoch": 0.2090482637030507, + "grad_norm": 0.64453125, + "learning_rate": 3.9561823218332914e-05, + "loss": 1.0699, + "mean_token_accuracy": 0.7274161614477634, + "num_tokens": 77029951.0, + "step": 830 + }, + { + "entropy": 1.4780758187174796, + "epoch": 0.21156691748260556, + "grad_norm": 0.625, + "learning_rate": 3.9435910350037775e-05, + "loss": 1.0051, + "mean_token_accuracy": 0.7377786092460156, + "num_tokens": 77960751.0, + "step": 840 + }, + { + "entropy": 1.4968378961086273, + "epoch": 0.21408557126216038, + "grad_norm": 0.6015625, + "learning_rate": 3.9309997481742636e-05, + "loss": 1.0027, + "mean_token_accuracy": 0.739619717001915, + "num_tokens": 78871850.0, + "step": 850 + }, + { + "entropy": 1.5046116828918457, + "epoch": 0.2166042250417152, + "grad_norm": 0.59375, + "learning_rate": 3.91840846134475e-05, + "loss": 1.0261, + "mean_token_accuracy": 0.7376008428633213, + "num_tokens": 79789618.0, + "step": 860 + }, + { + "entropy": 1.5208716675639153, + "epoch": 0.21912287882127002, + "grad_norm": 0.609375, + "learning_rate": 3.905817174515236e-05, + "loss": 1.051, + "mean_token_accuracy": 0.7320379175245761, + "num_tokens": 80728419.0, + "step": 870 + }, + { + "entropy": 1.5159122616052627, + "epoch": 0.22164153260082486, + "grad_norm": 0.60546875, + "learning_rate": 3.893225887685722e-05, + "loss": 1.0243, + "mean_token_accuracy": 0.7333739779889583, + "num_tokens": 81673574.0, + "step": 880 + }, + { + "entropy": 1.51417468637228, + "epoch": 0.22416018638037968, + "grad_norm": 0.59765625, + "learning_rate": 3.880634600856208e-05, + "loss": 1.0413, + "mean_token_accuracy": 0.7333143278956413, + "num_tokens": 82609636.0, + "step": 890 + }, + { + "entropy": 1.4946632251143455, + "epoch": 0.2266788401599345, + "grad_norm": 0.56640625, + "learning_rate": 3.8680433140266935e-05, + "loss": 1.0272, + "mean_token_accuracy": 0.7353226900100708, + "num_tokens": 83566048.0, + "step": 900 + }, + { + "entropy": 1.4703357517719269, + "epoch": 0.22919749393948935, + "grad_norm": 0.609375, + "learning_rate": 3.8554520271971796e-05, + "loss": 1.0239, + "mean_token_accuracy": 0.7346428163349629, + "num_tokens": 84490230.0, + "step": 910 + }, + { + "entropy": 1.5199193447828292, + "epoch": 0.23171614771904417, + "grad_norm": 0.64453125, + "learning_rate": 3.842860740367666e-05, + "loss": 1.0443, + "mean_token_accuracy": 0.7323003455996513, + "num_tokens": 85420861.0, + "step": 920 + }, + { + "entropy": 1.52715914696455, + "epoch": 0.234234801498599, + "grad_norm": 0.61328125, + "learning_rate": 3.830269453538152e-05, + "loss": 1.0432, + "mean_token_accuracy": 0.7316192977130413, + "num_tokens": 86352852.0, + "step": 930 + }, + { + "entropy": 1.4817651391029358, + "epoch": 0.23675345527815383, + "grad_norm": 0.6328125, + "learning_rate": 3.817678166708637e-05, + "loss": 1.0019, + "mean_token_accuracy": 0.7411134377121925, + "num_tokens": 87249992.0, + "step": 940 + }, + { + "entropy": 1.4907526612281798, + "epoch": 0.23927210905770865, + "grad_norm": 0.59765625, + "learning_rate": 3.805086879879124e-05, + "loss": 1.0013, + "mean_token_accuracy": 0.7385142982006073, + "num_tokens": 88185598.0, + "step": 950 + }, + { + "entropy": 1.5223437398672104, + "epoch": 0.24179076283726347, + "grad_norm": 0.61328125, + "learning_rate": 3.7924955930496095e-05, + "loss": 1.0563, + "mean_token_accuracy": 0.7298605613410473, + "num_tokens": 89109791.0, + "step": 960 + }, + { + "entropy": 1.486008982360363, + "epoch": 0.24430941661681832, + "grad_norm": 0.56640625, + "learning_rate": 3.7799043062200956e-05, + "loss": 1.0103, + "mean_token_accuracy": 0.737246710062027, + "num_tokens": 90058609.0, + "step": 970 + }, + { + "entropy": 1.512269377708435, + "epoch": 0.24682807039637314, + "grad_norm": 0.59375, + "learning_rate": 3.767313019390582e-05, + "loss": 1.0284, + "mean_token_accuracy": 0.7351725302636624, + "num_tokens": 90982493.0, + "step": 980 + }, + { + "entropy": 1.5016800329089164, + "epoch": 0.24934672417592796, + "grad_norm": 0.6171875, + "learning_rate": 3.754721732561068e-05, + "loss": 1.0298, + "mean_token_accuracy": 0.7350243054330349, + "num_tokens": 91919533.0, + "step": 990 + }, + { + "entropy": 1.4913472577929496, + "epoch": 0.2518653779554828, + "grad_norm": 0.61328125, + "learning_rate": 3.742130445731554e-05, + "loss": 0.992, + "mean_token_accuracy": 0.7438635163009166, + "num_tokens": 92854895.0, + "step": 1000 + }, + { + "entropy": 1.4977505892515182, + "epoch": 0.2543840317350376, + "grad_norm": 0.58984375, + "learning_rate": 3.72953915890204e-05, + "loss": 1.0344, + "mean_token_accuracy": 0.7339183062314987, + "num_tokens": 93790271.0, + "step": 1010 + }, + { + "entropy": 1.5159107878804208, + "epoch": 0.25690268551459244, + "grad_norm": 0.64453125, + "learning_rate": 3.716947872072526e-05, + "loss": 1.0492, + "mean_token_accuracy": 0.7301998473703861, + "num_tokens": 94686152.0, + "step": 1020 + }, + { + "entropy": 1.5307456016540528, + "epoch": 0.2594213392941473, + "grad_norm": 0.60546875, + "learning_rate": 3.7043565852430116e-05, + "loss": 1.0364, + "mean_token_accuracy": 0.7321190066635609, + "num_tokens": 95608968.0, + "step": 1030 + }, + { + "entropy": 1.4946022421121596, + "epoch": 0.2619399930737021, + "grad_norm": 0.63671875, + "learning_rate": 3.6917652984134983e-05, + "loss": 1.0151, + "mean_token_accuracy": 0.7384577453136444, + "num_tokens": 96528931.0, + "step": 1040 + }, + { + "entropy": 1.4895016327500343, + "epoch": 0.26445864685325693, + "grad_norm": 0.65234375, + "learning_rate": 3.679174011583984e-05, + "loss": 1.0396, + "mean_token_accuracy": 0.7310051701962947, + "num_tokens": 97431432.0, + "step": 1050 + }, + { + "entropy": 1.5223950266838073, + "epoch": 0.2669773006328118, + "grad_norm": 0.6328125, + "learning_rate": 3.66658272475447e-05, + "loss": 1.0245, + "mean_token_accuracy": 0.7353874854743481, + "num_tokens": 98357299.0, + "step": 1060 + }, + { + "entropy": 1.502314467728138, + "epoch": 0.26949595441236657, + "grad_norm": 0.671875, + "learning_rate": 3.653991437924956e-05, + "loss": 1.0212, + "mean_token_accuracy": 0.7371881239116191, + "num_tokens": 99287298.0, + "step": 1070 + }, + { + "entropy": 1.487211187183857, + "epoch": 0.2720146081919214, + "grad_norm": 0.66015625, + "learning_rate": 3.641400151095442e-05, + "loss": 1.018, + "mean_token_accuracy": 0.7396972067654133, + "num_tokens": 100201770.0, + "step": 1080 + }, + { + "entropy": 1.4796535983681678, + "epoch": 0.27453326197147626, + "grad_norm": 0.609375, + "learning_rate": 3.628808864265928e-05, + "loss": 1.0203, + "mean_token_accuracy": 0.73761862590909, + "num_tokens": 101133473.0, + "step": 1090 + }, + { + "entropy": 1.5198125943541527, + "epoch": 0.27705191575103105, + "grad_norm": 0.5625, + "learning_rate": 3.616217577436414e-05, + "loss": 1.0277, + "mean_token_accuracy": 0.7344238288700581, + "num_tokens": 102079400.0, + "step": 1100 + }, + { + "entropy": 1.4751672700047493, + "epoch": 0.2795705695305859, + "grad_norm": 0.59765625, + "learning_rate": 3.6036262906069004e-05, + "loss": 0.992, + "mean_token_accuracy": 0.7427970752120018, + "num_tokens": 103002746.0, + "step": 1110 + }, + { + "entropy": 1.4785253152251243, + "epoch": 0.28208922331014075, + "grad_norm": 0.60546875, + "learning_rate": 3.591035003777386e-05, + "loss": 0.9957, + "mean_token_accuracy": 0.7420700334012509, + "num_tokens": 103918330.0, + "step": 1120 + }, + { + "entropy": 1.5064472571015357, + "epoch": 0.28460787708969554, + "grad_norm": 0.6015625, + "learning_rate": 3.5784437169478727e-05, + "loss": 1.0121, + "mean_token_accuracy": 0.7389346733689308, + "num_tokens": 104854940.0, + "step": 1130 + }, + { + "entropy": 1.5104423373937608, + "epoch": 0.2871265308692504, + "grad_norm": 0.68359375, + "learning_rate": 3.565852430118358e-05, + "loss": 1.0577, + "mean_token_accuracy": 0.7281268581748008, + "num_tokens": 105757398.0, + "step": 1140 + }, + { + "entropy": 1.4889473721385003, + "epoch": 0.28964518464880523, + "grad_norm": 0.58984375, + "learning_rate": 3.553261143288844e-05, + "loss": 1.0116, + "mean_token_accuracy": 0.7378810577094554, + "num_tokens": 106709345.0, + "step": 1150 + }, + { + "entropy": 1.4943735346198082, + "epoch": 0.29216383842836, + "grad_norm": 0.61328125, + "learning_rate": 3.54066985645933e-05, + "loss": 1.0252, + "mean_token_accuracy": 0.7358876734972, + "num_tokens": 107635433.0, + "step": 1160 + }, + { + "entropy": 1.502584198117256, + "epoch": 0.29468249220791487, + "grad_norm": 0.60546875, + "learning_rate": 3.5280785696298164e-05, + "loss": 1.0513, + "mean_token_accuracy": 0.7284682184457779, + "num_tokens": 108555011.0, + "step": 1170 + }, + { + "entropy": 1.4951962947845459, + "epoch": 0.2972011459874697, + "grad_norm": 0.5859375, + "learning_rate": 3.515487282800302e-05, + "loss": 1.0058, + "mean_token_accuracy": 0.7395492434501648, + "num_tokens": 109490480.0, + "step": 1180 + }, + { + "entropy": 1.4874925374984742, + "epoch": 0.2997197997670245, + "grad_norm": 0.61328125, + "learning_rate": 3.5028959959707886e-05, + "loss": 0.996, + "mean_token_accuracy": 0.7426116019487381, + "num_tokens": 110419525.0, + "step": 1190 + }, + { + "entropy": 1.4831220969557761, + "epoch": 0.30223845354657936, + "grad_norm": 0.5625, + "learning_rate": 3.490304709141274e-05, + "loss": 1.0094, + "mean_token_accuracy": 0.7389338947832584, + "num_tokens": 111349186.0, + "step": 1200 + }, + { + "entropy": 1.4941108256578446, + "epoch": 0.3047571073261342, + "grad_norm": 0.63671875, + "learning_rate": 3.47771342231176e-05, + "loss": 1.0472, + "mean_token_accuracy": 0.7327656015753746, + "num_tokens": 112282566.0, + "step": 1210 + }, + { + "entropy": 1.5015305012464524, + "epoch": 0.307275761105689, + "grad_norm": 0.63671875, + "learning_rate": 3.465122135482247e-05, + "loss": 1.0308, + "mean_token_accuracy": 0.73332554474473, + "num_tokens": 113202119.0, + "step": 1220 + }, + { + "entropy": 1.4797065630555153, + "epoch": 0.30979441488524384, + "grad_norm": 0.5703125, + "learning_rate": 3.4525308486527324e-05, + "loss": 1.037, + "mean_token_accuracy": 0.7331598915159703, + "num_tokens": 114138832.0, + "step": 1230 + }, + { + "entropy": 1.5040980368852614, + "epoch": 0.3123130686647987, + "grad_norm": 0.59375, + "learning_rate": 3.4399395618232185e-05, + "loss": 1.0141, + "mean_token_accuracy": 0.7366115286946296, + "num_tokens": 115039255.0, + "step": 1240 + }, + { + "entropy": 1.491380912065506, + "epoch": 0.3148317224443535, + "grad_norm": 0.6328125, + "learning_rate": 3.4273482749937046e-05, + "loss": 1.0256, + "mean_token_accuracy": 0.7349315457046032, + "num_tokens": 115940525.0, + "step": 1250 + }, + { + "entropy": 1.474766517430544, + "epoch": 0.3173503762239083, + "grad_norm": 0.6015625, + "learning_rate": 3.414756988164191e-05, + "loss": 1.0051, + "mean_token_accuracy": 0.7393092684447765, + "num_tokens": 116859333.0, + "step": 1260 + }, + { + "entropy": 1.5051109313964843, + "epoch": 0.3198690300034632, + "grad_norm": 0.57421875, + "learning_rate": 3.402165701334676e-05, + "loss": 1.016, + "mean_token_accuracy": 0.7380836345255375, + "num_tokens": 117776423.0, + "step": 1270 + }, + { + "entropy": 1.4819408521056174, + "epoch": 0.32238768378301796, + "grad_norm": 0.578125, + "learning_rate": 3.389574414505163e-05, + "loss": 0.991, + "mean_token_accuracy": 0.7428291216492653, + "num_tokens": 118716777.0, + "step": 1280 + }, + { + "entropy": 1.4922457024455071, + "epoch": 0.3249063375625728, + "grad_norm": 0.61328125, + "learning_rate": 3.3769831276756484e-05, + "loss": 1.0247, + "mean_token_accuracy": 0.7364048793911934, + "num_tokens": 119626650.0, + "step": 1290 + }, + { + "entropy": 1.4869423642754556, + "epoch": 0.32742499134212766, + "grad_norm": 0.62109375, + "learning_rate": 3.3643918408461345e-05, + "loss": 1.0159, + "mean_token_accuracy": 0.7364346459507942, + "num_tokens": 120559670.0, + "step": 1300 + }, + { + "entropy": 1.5164387181401253, + "epoch": 0.32994364512168245, + "grad_norm": 0.6171875, + "learning_rate": 3.3518005540166206e-05, + "loss": 1.0452, + "mean_token_accuracy": 0.7311400182545185, + "num_tokens": 121489609.0, + "step": 1310 + }, + { + "entropy": 1.4925027176737786, + "epoch": 0.3324622989012373, + "grad_norm": 0.58984375, + "learning_rate": 3.339209267187107e-05, + "loss": 1.0261, + "mean_token_accuracy": 0.7373234689235687, + "num_tokens": 122416454.0, + "step": 1320 + }, + { + "entropy": 1.507451492547989, + "epoch": 0.33498095268079214, + "grad_norm": 0.5859375, + "learning_rate": 3.326617980357593e-05, + "loss": 1.0082, + "mean_token_accuracy": 0.7384895570576191, + "num_tokens": 123342649.0, + "step": 1330 + }, + { + "entropy": 1.4801776722073554, + "epoch": 0.33749960646034693, + "grad_norm": 0.60546875, + "learning_rate": 3.314026693528079e-05, + "loss": 1.026, + "mean_token_accuracy": 0.734679427742958, + "num_tokens": 124277565.0, + "step": 1340 + }, + { + "entropy": 1.5057601898908615, + "epoch": 0.3400182602399018, + "grad_norm": 0.6328125, + "learning_rate": 3.301435406698565e-05, + "loss": 1.0532, + "mean_token_accuracy": 0.7300509728491307, + "num_tokens": 125193040.0, + "step": 1350 + }, + { + "entropy": 1.504169335961342, + "epoch": 0.3425369140194566, + "grad_norm": 0.6484375, + "learning_rate": 3.2888441198690504e-05, + "loss": 1.0018, + "mean_token_accuracy": 0.7397960677742959, + "num_tokens": 126119671.0, + "step": 1360 + }, + { + "entropy": 1.495669847726822, + "epoch": 0.3450555677990114, + "grad_norm": 0.62109375, + "learning_rate": 3.276252833039537e-05, + "loss": 1.0296, + "mean_token_accuracy": 0.7364421933889389, + "num_tokens": 127044727.0, + "step": 1370 + }, + { + "entropy": 1.4692699402570724, + "epoch": 0.34757422157856627, + "grad_norm": 0.58984375, + "learning_rate": 3.263661546210023e-05, + "loss": 0.972, + "mean_token_accuracy": 0.7507402546703815, + "num_tokens": 127984703.0, + "step": 1380 + }, + { + "entropy": 1.5226725831627845, + "epoch": 0.35009287535812106, + "grad_norm": 0.62109375, + "learning_rate": 3.251070259380509e-05, + "loss": 1.0447, + "mean_token_accuracy": 0.7286883890628815, + "num_tokens": 128914516.0, + "step": 1390 + }, + { + "entropy": 1.4715677112340928, + "epoch": 0.3526115291376759, + "grad_norm": 0.59765625, + "learning_rate": 3.238478972550995e-05, + "loss": 0.9847, + "mean_token_accuracy": 0.7421014286577702, + "num_tokens": 129828449.0, + "step": 1400 + }, + { + "entropy": 1.4714261531829833, + "epoch": 0.35513018291723075, + "grad_norm": 0.59765625, + "learning_rate": 3.225887685721481e-05, + "loss": 1.0038, + "mean_token_accuracy": 0.7429524183273315, + "num_tokens": 130786715.0, + "step": 1410 + }, + { + "entropy": 1.485981273651123, + "epoch": 0.35764883669678554, + "grad_norm": 0.56640625, + "learning_rate": 3.213296398891967e-05, + "loss": 1.0028, + "mean_token_accuracy": 0.7397522330284119, + "num_tokens": 131737266.0, + "step": 1420 + }, + { + "entropy": 1.5126312345266342, + "epoch": 0.3601674904763404, + "grad_norm": 0.58984375, + "learning_rate": 3.200705112062453e-05, + "loss": 1.0257, + "mean_token_accuracy": 0.7358055524528027, + "num_tokens": 132679586.0, + "step": 1430 + }, + { + "entropy": 1.5042190700769424, + "epoch": 0.36268614425589524, + "grad_norm": 0.6640625, + "learning_rate": 3.188113825232939e-05, + "loss": 1.0099, + "mean_token_accuracy": 0.7401847161352635, + "num_tokens": 133603713.0, + "step": 1440 + }, + { + "entropy": 1.4730105847120285, + "epoch": 0.36520479803545003, + "grad_norm": 0.62890625, + "learning_rate": 3.175522538403425e-05, + "loss": 1.0513, + "mean_token_accuracy": 0.7313306540250778, + "num_tokens": 134522232.0, + "step": 1450 + }, + { + "entropy": 1.4745427146553993, + "epoch": 0.3677234518150049, + "grad_norm": 0.578125, + "learning_rate": 3.1629312515739115e-05, + "loss": 1.028, + "mean_token_accuracy": 0.7363212339580059, + "num_tokens": 135466122.0, + "step": 1460 + }, + { + "entropy": 1.4661547526717187, + "epoch": 0.3702421055945597, + "grad_norm": 0.57421875, + "learning_rate": 3.150339964744397e-05, + "loss": 1.0065, + "mean_token_accuracy": 0.7393469184637069, + "num_tokens": 136411704.0, + "step": 1470 + }, + { + "entropy": 1.4818128019571304, + "epoch": 0.3727607593741145, + "grad_norm": 0.58984375, + "learning_rate": 3.137748677914883e-05, + "loss": 1.005, + "mean_token_accuracy": 0.7411336719989776, + "num_tokens": 137343925.0, + "step": 1480 + }, + { + "entropy": 1.5323064669966697, + "epoch": 0.37527941315366936, + "grad_norm": 0.6953125, + "learning_rate": 3.125157391085369e-05, + "loss": 1.0397, + "mean_token_accuracy": 0.7332744777202607, + "num_tokens": 138258013.0, + "step": 1490 + }, + { + "entropy": 1.4970730185508727, + "epoch": 0.3777980669332242, + "grad_norm": 0.59375, + "learning_rate": 3.112566104255855e-05, + "loss": 1.0267, + "mean_token_accuracy": 0.7344107307493687, + "num_tokens": 139191604.0, + "step": 1500 + }, + { + "entropy": 1.5285832583904266, + "epoch": 0.380316720712779, + "grad_norm": 0.62109375, + "learning_rate": 3.099974817426341e-05, + "loss": 1.0279, + "mean_token_accuracy": 0.7337069801986218, + "num_tokens": 140119182.0, + "step": 1510 + }, + { + "entropy": 1.4828715667128562, + "epoch": 0.38283537449233385, + "grad_norm": 0.609375, + "learning_rate": 3.0873835305968275e-05, + "loss": 0.98, + "mean_token_accuracy": 0.742748036235571, + "num_tokens": 141028056.0, + "step": 1520 + }, + { + "entropy": 1.4884025305509567, + "epoch": 0.3853540282718887, + "grad_norm": 0.55078125, + "learning_rate": 3.074792243767313e-05, + "loss": 1.0096, + "mean_token_accuracy": 0.740665141493082, + "num_tokens": 141973431.0, + "step": 1530 + }, + { + "entropy": 1.5160500556230545, + "epoch": 0.3878726820514435, + "grad_norm": 0.60546875, + "learning_rate": 3.062200956937799e-05, + "loss": 1.0196, + "mean_token_accuracy": 0.7365249536931515, + "num_tokens": 142929741.0, + "step": 1540 + }, + { + "entropy": 1.5132767364382744, + "epoch": 0.39039133583099833, + "grad_norm": 0.6875, + "learning_rate": 3.0496096701082855e-05, + "loss": 0.9694, + "mean_token_accuracy": 0.7474554844200612, + "num_tokens": 143858628.0, + "step": 1550 + }, + { + "entropy": 1.4559171989560127, + "epoch": 0.3929099896105532, + "grad_norm": 0.56640625, + "learning_rate": 3.0370183832787713e-05, + "loss": 0.991, + "mean_token_accuracy": 0.7405735231935978, + "num_tokens": 144791852.0, + "step": 1560 + }, + { + "entropy": 1.4635022155940534, + "epoch": 0.39542864339010797, + "grad_norm": 0.625, + "learning_rate": 3.024427096449257e-05, + "loss": 0.9773, + "mean_token_accuracy": 0.7441258721053601, + "num_tokens": 145700233.0, + "step": 1570 + }, + { + "entropy": 1.4716689318418503, + "epoch": 0.3979472971696628, + "grad_norm": 0.5859375, + "learning_rate": 3.0118358096197435e-05, + "loss": 0.9752, + "mean_token_accuracy": 0.7468914896249771, + "num_tokens": 146628030.0, + "step": 1580 + }, + { + "entropy": 1.4879262149333954, + "epoch": 0.40046595094921766, + "grad_norm": 0.61328125, + "learning_rate": 2.9992445227902293e-05, + "loss": 0.9802, + "mean_token_accuracy": 0.7438114926218986, + "num_tokens": 147555920.0, + "step": 1590 + }, + { + "entropy": 1.479422764480114, + "epoch": 0.40298460472877246, + "grad_norm": 0.60546875, + "learning_rate": 2.9866532359607154e-05, + "loss": 1.0069, + "mean_token_accuracy": 0.736028865724802, + "num_tokens": 148480143.0, + "step": 1600 + }, + { + "entropy": 1.5022207498550415, + "epoch": 0.4055032585083273, + "grad_norm": 0.61328125, + "learning_rate": 2.9740619491312015e-05, + "loss": 1.0107, + "mean_token_accuracy": 0.7401330538094044, + "num_tokens": 149430672.0, + "step": 1610 + }, + { + "entropy": 1.4303474977612496, + "epoch": 0.40802191228788215, + "grad_norm": 0.5703125, + "learning_rate": 2.9614706623016876e-05, + "loss": 0.98, + "mean_token_accuracy": 0.7455232538282871, + "num_tokens": 150340592.0, + "step": 1620 + }, + { + "entropy": 1.5223925068974495, + "epoch": 0.41054056606743694, + "grad_norm": 0.671875, + "learning_rate": 2.9488793754721734e-05, + "loss": 1.0375, + "mean_token_accuracy": 0.7336984358727932, + "num_tokens": 151262776.0, + "step": 1630 + }, + { + "entropy": 1.5078096300363542, + "epoch": 0.4130592198469918, + "grad_norm": 0.6015625, + "learning_rate": 2.9362880886426598e-05, + "loss": 1.0294, + "mean_token_accuracy": 0.7375610016286374, + "num_tokens": 152191345.0, + "step": 1640 + }, + { + "entropy": 1.4810595944523812, + "epoch": 0.41557787362654663, + "grad_norm": 0.64453125, + "learning_rate": 2.9236968018131456e-05, + "loss": 1.0057, + "mean_token_accuracy": 0.7403605856001377, + "num_tokens": 153133627.0, + "step": 1650 + }, + { + "entropy": 1.5020821630954742, + "epoch": 0.4180965274061014, + "grad_norm": 0.5859375, + "learning_rate": 2.9111055149836313e-05, + "loss": 1.0231, + "mean_token_accuracy": 0.7343570776283741, + "num_tokens": 154077853.0, + "step": 1660 + }, + { + "entropy": 1.4656946510076523, + "epoch": 0.4206151811856563, + "grad_norm": 0.609375, + "learning_rate": 2.898514228154117e-05, + "loss": 0.9825, + "mean_token_accuracy": 0.7439971931278706, + "num_tokens": 154999470.0, + "step": 1670 + }, + { + "entropy": 1.4865729957818985, + "epoch": 0.4231338349652111, + "grad_norm": 0.60546875, + "learning_rate": 2.8859229413246036e-05, + "loss": 0.9847, + "mean_token_accuracy": 0.741909223049879, + "num_tokens": 155919939.0, + "step": 1680 + }, + { + "entropy": 1.442151701450348, + "epoch": 0.4256524887447659, + "grad_norm": 0.59765625, + "learning_rate": 2.8733316544950893e-05, + "loss": 0.971, + "mean_token_accuracy": 0.747497969865799, + "num_tokens": 156857683.0, + "step": 1690 + }, + { + "entropy": 1.4939273685216903, + "epoch": 0.42817114252432076, + "grad_norm": 0.58203125, + "learning_rate": 2.8607403676655754e-05, + "loss": 1.027, + "mean_token_accuracy": 0.73572783395648, + "num_tokens": 157789868.0, + "step": 1700 + }, + { + "entropy": 1.4739609718322755, + "epoch": 0.4306897963038756, + "grad_norm": 0.62109375, + "learning_rate": 2.8481490808360615e-05, + "loss": 1.0036, + "mean_token_accuracy": 0.7423903658986092, + "num_tokens": 158671912.0, + "step": 1710 + }, + { + "entropy": 1.5179324716329574, + "epoch": 0.4332084500834304, + "grad_norm": 0.609375, + "learning_rate": 2.8355577940065477e-05, + "loss": 1.0389, + "mean_token_accuracy": 0.7320630177855492, + "num_tokens": 159601676.0, + "step": 1720 + }, + { + "entropy": 1.500729313492775, + "epoch": 0.43572710386298524, + "grad_norm": 0.61328125, + "learning_rate": 2.8229665071770334e-05, + "loss": 1.0081, + "mean_token_accuracy": 0.7389924034476281, + "num_tokens": 160526625.0, + "step": 1730 + }, + { + "entropy": 1.4945330180227756, + "epoch": 0.43824575764254003, + "grad_norm": 0.5703125, + "learning_rate": 2.81037522034752e-05, + "loss": 0.9928, + "mean_token_accuracy": 0.7408586353063583, + "num_tokens": 161444586.0, + "step": 1740 + }, + { + "entropy": 1.4932605415582656, + "epoch": 0.4407644114220949, + "grad_norm": 0.63671875, + "learning_rate": 2.7977839335180056e-05, + "loss": 1.0089, + "mean_token_accuracy": 0.7384962946176529, + "num_tokens": 162384356.0, + "step": 1750 + }, + { + "entropy": 1.5264878809452056, + "epoch": 0.44328306520164973, + "grad_norm": 0.625, + "learning_rate": 2.7851926466884914e-05, + "loss": 1.003, + "mean_token_accuracy": 0.7381562039256095, + "num_tokens": 163308126.0, + "step": 1760 + }, + { + "entropy": 1.4538481026887893, + "epoch": 0.4458017189812045, + "grad_norm": 0.58203125, + "learning_rate": 2.772601359858978e-05, + "loss": 0.9907, + "mean_token_accuracy": 0.7408280216157437, + "num_tokens": 164233223.0, + "step": 1770 + }, + { + "entropy": 1.4829386696219444, + "epoch": 0.44832037276075937, + "grad_norm": 0.5625, + "learning_rate": 2.7600100730294636e-05, + "loss": 0.9865, + "mean_token_accuracy": 0.7451853767037392, + "num_tokens": 165127331.0, + "step": 1780 + }, + { + "entropy": 1.4769062221050262, + "epoch": 0.4508390265403142, + "grad_norm": 0.65625, + "learning_rate": 2.7474187861999494e-05, + "loss": 0.9878, + "mean_token_accuracy": 0.7435719795525074, + "num_tokens": 166030010.0, + "step": 1790 + }, + { + "entropy": 1.4725798398256302, + "epoch": 0.453357680319869, + "grad_norm": 0.6171875, + "learning_rate": 2.734827499370436e-05, + "loss": 0.9798, + "mean_token_accuracy": 0.7441974826157093, + "num_tokens": 166972675.0, + "step": 1800 + }, + { + "entropy": 1.5000967025756835, + "epoch": 0.45587633409942385, + "grad_norm": 0.6015625, + "learning_rate": 2.7222362125409216e-05, + "loss": 0.9785, + "mean_token_accuracy": 0.7470294989645481, + "num_tokens": 167918655.0, + "step": 1810 + }, + { + "entropy": 1.507605105638504, + "epoch": 0.4583949878789787, + "grad_norm": 0.6953125, + "learning_rate": 2.7096449257114077e-05, + "loss": 1.0254, + "mean_token_accuracy": 0.7376879565417767, + "num_tokens": 168837593.0, + "step": 1820 + }, + { + "entropy": 1.483200278878212, + "epoch": 0.4609136416585335, + "grad_norm": 0.609375, + "learning_rate": 2.697053638881894e-05, + "loss": 1.0047, + "mean_token_accuracy": 0.7400114268064499, + "num_tokens": 169770322.0, + "step": 1830 + }, + { + "entropy": 1.503974023461342, + "epoch": 0.46343229543808834, + "grad_norm": 0.62109375, + "learning_rate": 2.68446235205238e-05, + "loss": 1.0527, + "mean_token_accuracy": 0.7306334659457207, + "num_tokens": 170718172.0, + "step": 1840 + }, + { + "entropy": 1.4733003690838813, + "epoch": 0.4659509492176432, + "grad_norm": 0.61328125, + "learning_rate": 2.6718710652228657e-05, + "loss": 0.9902, + "mean_token_accuracy": 0.7422384157776832, + "num_tokens": 171646451.0, + "step": 1850 + }, + { + "entropy": 1.4795169189572335, + "epoch": 0.468469602997198, + "grad_norm": 0.5703125, + "learning_rate": 2.659279778393352e-05, + "loss": 0.994, + "mean_token_accuracy": 0.7433700770139694, + "num_tokens": 172571288.0, + "step": 1860 + }, + { + "entropy": 1.544270959496498, + "epoch": 0.4709882567767528, + "grad_norm": 0.58984375, + "learning_rate": 2.646688491563838e-05, + "loss": 1.0684, + "mean_token_accuracy": 0.7255132175981999, + "num_tokens": 173493482.0, + "step": 1870 + }, + { + "entropy": 1.4687143832445144, + "epoch": 0.47350691055630767, + "grad_norm": 0.6015625, + "learning_rate": 2.6340972047343237e-05, + "loss": 1.0264, + "mean_token_accuracy": 0.7358646772801876, + "num_tokens": 174430178.0, + "step": 1880 + }, + { + "entropy": 1.5258139103651047, + "epoch": 0.47602556433586246, + "grad_norm": 0.6328125, + "learning_rate": 2.62150591790481e-05, + "loss": 1.0474, + "mean_token_accuracy": 0.7309989266097545, + "num_tokens": 175370191.0, + "step": 1890 + }, + { + "entropy": 1.5031465500593186, + "epoch": 0.4785442181154173, + "grad_norm": 0.6640625, + "learning_rate": 2.608914631075296e-05, + "loss": 1.0244, + "mean_token_accuracy": 0.7371547490358352, + "num_tokens": 176327610.0, + "step": 1900 + }, + { + "entropy": 1.4879642963409423, + "epoch": 0.48106287189497215, + "grad_norm": 0.62890625, + "learning_rate": 2.5963233442457817e-05, + "loss": 0.9919, + "mean_token_accuracy": 0.7449640512466431, + "num_tokens": 177261487.0, + "step": 1910 + }, + { + "entropy": 1.4944231912493706, + "epoch": 0.48358152567452695, + "grad_norm": 0.61328125, + "learning_rate": 2.583732057416268e-05, + "loss": 1.0104, + "mean_token_accuracy": 0.7372982695698738, + "num_tokens": 178202468.0, + "step": 1920 + }, + { + "entropy": 1.5143211469054223, + "epoch": 0.4861001794540818, + "grad_norm": 0.58984375, + "learning_rate": 2.571140770586754e-05, + "loss": 1.0548, + "mean_token_accuracy": 0.726641795784235, + "num_tokens": 179133391.0, + "step": 1930 + }, + { + "entropy": 1.5140092059969903, + "epoch": 0.48861883323363664, + "grad_norm": 0.609375, + "learning_rate": 2.55854948375724e-05, + "loss": 0.9964, + "mean_token_accuracy": 0.7447598196566105, + "num_tokens": 180047435.0, + "step": 1940 + }, + { + "entropy": 1.4550499767065048, + "epoch": 0.49113748701319143, + "grad_norm": 0.56640625, + "learning_rate": 2.5459581969277265e-05, + "loss": 0.9904, + "mean_token_accuracy": 0.7420261397957801, + "num_tokens": 180983171.0, + "step": 1950 + }, + { + "entropy": 1.4785954818129539, + "epoch": 0.4936561407927463, + "grad_norm": 0.546875, + "learning_rate": 2.5333669100982122e-05, + "loss": 0.9914, + "mean_token_accuracy": 0.7422729566693306, + "num_tokens": 181901605.0, + "step": 1960 + }, + { + "entropy": 1.4713733956217765, + "epoch": 0.4961747945723011, + "grad_norm": 0.61328125, + "learning_rate": 2.520775623268698e-05, + "loss": 1.0136, + "mean_token_accuracy": 0.7407643228769303, + "num_tokens": 182808597.0, + "step": 1970 + }, + { + "entropy": 1.4882659435272216, + "epoch": 0.4986934483518559, + "grad_norm": 0.59765625, + "learning_rate": 2.5081843364391845e-05, + "loss": 1.0281, + "mean_token_accuracy": 0.733605157583952, + "num_tokens": 183760991.0, + "step": 1980 + }, + { + "entropy": 1.4794856160879135, + "epoch": 0.5012121021314108, + "grad_norm": 0.61328125, + "learning_rate": 2.4955930496096702e-05, + "loss": 0.9757, + "mean_token_accuracy": 0.7448467329144478, + "num_tokens": 184676166.0, + "step": 1990 + }, + { + "entropy": 1.4704470828175544, + "epoch": 0.5037307559109656, + "grad_norm": 0.5859375, + "learning_rate": 2.4830017627801563e-05, + "loss": 0.9887, + "mean_token_accuracy": 0.7421532794833183, + "num_tokens": 185591403.0, + "step": 2000 + }, + { + "entropy": 1.4506453573703766, + "epoch": 0.5062494096905205, + "grad_norm": 0.6015625, + "learning_rate": 2.470410475950642e-05, + "loss": 0.9482, + "mean_token_accuracy": 0.751684907823801, + "num_tokens": 186530825.0, + "step": 2010 + }, + { + "entropy": 1.505790999531746, + "epoch": 0.5087680634700752, + "grad_norm": 0.64453125, + "learning_rate": 2.4578191891211282e-05, + "loss": 1.01, + "mean_token_accuracy": 0.738251518458128, + "num_tokens": 187483104.0, + "step": 2020 + }, + { + "entropy": 1.4906439885497094, + "epoch": 0.51128671724963, + "grad_norm": 0.609375, + "learning_rate": 2.4452279022916143e-05, + "loss": 1.0081, + "mean_token_accuracy": 0.7367694586515426, + "num_tokens": 188419415.0, + "step": 2030 + }, + { + "entropy": 1.5162854179739953, + "epoch": 0.5138053710291849, + "grad_norm": 0.5703125, + "learning_rate": 2.4326366154621e-05, + "loss": 1.0318, + "mean_token_accuracy": 0.7348616622388363, + "num_tokens": 189364907.0, + "step": 2040 + }, + { + "entropy": 1.515935306251049, + "epoch": 0.5163240248087397, + "grad_norm": 0.625, + "learning_rate": 2.4200453286325865e-05, + "loss": 1.037, + "mean_token_accuracy": 0.7346496164798737, + "num_tokens": 190305289.0, + "step": 2050 + }, + { + "entropy": 1.5043818101286888, + "epoch": 0.5188426785882946, + "grad_norm": 0.58984375, + "learning_rate": 2.4074540418030726e-05, + "loss": 1.0202, + "mean_token_accuracy": 0.737002718448639, + "num_tokens": 191240393.0, + "step": 2060 + }, + { + "entropy": 1.4879194065928458, + "epoch": 0.5213613323678494, + "grad_norm": 0.625, + "learning_rate": 2.3948627549735584e-05, + "loss": 1.0149, + "mean_token_accuracy": 0.7377648189663887, + "num_tokens": 192175710.0, + "step": 2070 + }, + { + "entropy": 1.476494650542736, + "epoch": 0.5238799861474042, + "grad_norm": 0.58984375, + "learning_rate": 2.3822714681440445e-05, + "loss": 1.0126, + "mean_token_accuracy": 0.7382982887327671, + "num_tokens": 193089119.0, + "step": 2080 + }, + { + "entropy": 1.4906734734773637, + "epoch": 0.526398639926959, + "grad_norm": 0.58203125, + "learning_rate": 2.3696801813145306e-05, + "loss": 1.0228, + "mean_token_accuracy": 0.7358043491840363, + "num_tokens": 194014464.0, + "step": 2090 + }, + { + "entropy": 1.463935060799122, + "epoch": 0.5289172937065139, + "grad_norm": 0.546875, + "learning_rate": 2.3570888944850164e-05, + "loss": 0.979, + "mean_token_accuracy": 0.7440614722669124, + "num_tokens": 194937483.0, + "step": 2100 + }, + { + "entropy": 1.4706278055906297, + "epoch": 0.5314359474860687, + "grad_norm": 0.609375, + "learning_rate": 2.3444976076555025e-05, + "loss": 0.9844, + "mean_token_accuracy": 0.742541317641735, + "num_tokens": 195881861.0, + "step": 2110 + }, + { + "entropy": 1.510326901078224, + "epoch": 0.5339546012656236, + "grad_norm": 0.58984375, + "learning_rate": 2.3319063208259886e-05, + "loss": 1.0143, + "mean_token_accuracy": 0.7375903382897377, + "num_tokens": 196792310.0, + "step": 2120 + }, + { + "entropy": 1.500123569369316, + "epoch": 0.5364732550451784, + "grad_norm": 0.6171875, + "learning_rate": 2.3193150339964744e-05, + "loss": 1.0156, + "mean_token_accuracy": 0.737464863806963, + "num_tokens": 197740447.0, + "step": 2130 + }, + { + "entropy": 1.5234432876110078, + "epoch": 0.5389919088247331, + "grad_norm": 0.66015625, + "learning_rate": 2.3067237471669605e-05, + "loss": 1.0293, + "mean_token_accuracy": 0.7343058608472347, + "num_tokens": 198650674.0, + "step": 2140 + }, + { + "entropy": 1.4829162567853929, + "epoch": 0.541510562604288, + "grad_norm": 0.59765625, + "learning_rate": 2.2941324603374466e-05, + "loss": 1.0158, + "mean_token_accuracy": 0.7392853118479252, + "num_tokens": 199579745.0, + "step": 2150 + }, + { + "entropy": 1.4706959769129753, + "epoch": 0.5440292163838428, + "grad_norm": 0.61328125, + "learning_rate": 2.2815411735079327e-05, + "loss": 0.9895, + "mean_token_accuracy": 0.7438252337276936, + "num_tokens": 200490996.0, + "step": 2160 + }, + { + "entropy": 1.528316856920719, + "epoch": 0.5465478701633977, + "grad_norm": 0.58984375, + "learning_rate": 2.2689498866784188e-05, + "loss": 1.0492, + "mean_token_accuracy": 0.7321145072579384, + "num_tokens": 201428466.0, + "step": 2170 + }, + { + "entropy": 1.4623350918292999, + "epoch": 0.5490665239429525, + "grad_norm": 0.59375, + "learning_rate": 2.256358599848905e-05, + "loss": 0.981, + "mean_token_accuracy": 0.744949608296156, + "num_tokens": 202354085.0, + "step": 2180 + }, + { + "entropy": 1.5169390365481377, + "epoch": 0.5515851777225074, + "grad_norm": 0.6484375, + "learning_rate": 2.2437673130193907e-05, + "loss": 1.0167, + "mean_token_accuracy": 0.737620497494936, + "num_tokens": 203296048.0, + "step": 2190 + }, + { + "entropy": 1.4908597692847252, + "epoch": 0.5541038315020621, + "grad_norm": 0.60546875, + "learning_rate": 2.2311760261898768e-05, + "loss": 0.9884, + "mean_token_accuracy": 0.7446716167032719, + "num_tokens": 204251239.0, + "step": 2200 + }, + { + "entropy": 1.4890633031725884, + "epoch": 0.556622485281617, + "grad_norm": 0.6171875, + "learning_rate": 2.218584739360363e-05, + "loss": 0.9989, + "mean_token_accuracy": 0.7413519226014614, + "num_tokens": 205151325.0, + "step": 2210 + }, + { + "entropy": 1.519281443953514, + "epoch": 0.5591411390611718, + "grad_norm": 0.61328125, + "learning_rate": 2.2059934525308487e-05, + "loss": 1.021, + "mean_token_accuracy": 0.7366731703281403, + "num_tokens": 206096182.0, + "step": 2220 + }, + { + "entropy": 1.4802996426820756, + "epoch": 0.5616597928407266, + "grad_norm": 0.5859375, + "learning_rate": 2.1934021657013348e-05, + "loss": 0.9981, + "mean_token_accuracy": 0.738096322119236, + "num_tokens": 207029179.0, + "step": 2230 + }, + { + "entropy": 1.493895760178566, + "epoch": 0.5641784466202815, + "grad_norm": 0.6015625, + "learning_rate": 2.1808108788718206e-05, + "loss": 1.0104, + "mean_token_accuracy": 0.7363863155245781, + "num_tokens": 207960947.0, + "step": 2240 + }, + { + "entropy": 1.472677892446518, + "epoch": 0.5666971003998363, + "grad_norm": 0.62109375, + "learning_rate": 2.1682195920423067e-05, + "loss": 0.9692, + "mean_token_accuracy": 0.7454905331134796, + "num_tokens": 208889854.0, + "step": 2250 + }, + { + "entropy": 1.5076108410954476, + "epoch": 0.5692157541793911, + "grad_norm": 0.60546875, + "learning_rate": 2.1556283052127928e-05, + "loss": 1.0289, + "mean_token_accuracy": 0.7352958224713803, + "num_tokens": 209818677.0, + "step": 2260 + }, + { + "entropy": 1.4948209643363952, + "epoch": 0.5717344079589459, + "grad_norm": 0.56640625, + "learning_rate": 2.143037018383279e-05, + "loss": 0.9812, + "mean_token_accuracy": 0.7438007473945618, + "num_tokens": 210768812.0, + "step": 2270 + }, + { + "entropy": 1.4773472845554352, + "epoch": 0.5742530617385008, + "grad_norm": 0.8125, + "learning_rate": 2.130445731553765e-05, + "loss": 1.0183, + "mean_token_accuracy": 0.7372843034565448, + "num_tokens": 211681636.0, + "step": 2280 + }, + { + "entropy": 1.4644770205020905, + "epoch": 0.5767717155180556, + "grad_norm": 0.58984375, + "learning_rate": 2.117854444724251e-05, + "loss": 0.9989, + "mean_token_accuracy": 0.7396629564464092, + "num_tokens": 212615595.0, + "step": 2290 + }, + { + "entropy": 1.5075991481542588, + "epoch": 0.5792903692976105, + "grad_norm": 0.640625, + "learning_rate": 2.105263157894737e-05, + "loss": 1.0286, + "mean_token_accuracy": 0.7359593294560909, + "num_tokens": 213552263.0, + "step": 2300 + }, + { + "entropy": 1.4733971416950227, + "epoch": 0.5818090230771653, + "grad_norm": 0.6015625, + "learning_rate": 2.092671871065223e-05, + "loss": 1.0125, + "mean_token_accuracy": 0.7387680150568485, + "num_tokens": 214486865.0, + "step": 2310 + }, + { + "entropy": 1.4752314537763596, + "epoch": 0.58432767685672, + "grad_norm": 0.6171875, + "learning_rate": 2.080080584235709e-05, + "loss": 0.9759, + "mean_token_accuracy": 0.7432409018278122, + "num_tokens": 215442702.0, + "step": 2320 + }, + { + "entropy": 1.4748615235090257, + "epoch": 0.5868463306362749, + "grad_norm": 0.5703125, + "learning_rate": 2.067489297406195e-05, + "loss": 0.9963, + "mean_token_accuracy": 0.740365145355463, + "num_tokens": 216371631.0, + "step": 2330 + }, + { + "entropy": 1.4902510225772858, + "epoch": 0.5893649844158297, + "grad_norm": 0.6015625, + "learning_rate": 2.054898010576681e-05, + "loss": 0.9753, + "mean_token_accuracy": 0.7458043657243252, + "num_tokens": 217312756.0, + "step": 2340 + }, + { + "entropy": 1.4833617210388184, + "epoch": 0.5918836381953846, + "grad_norm": 0.58203125, + "learning_rate": 2.042306723747167e-05, + "loss": 1.0325, + "mean_token_accuracy": 0.7355702064931393, + "num_tokens": 218231302.0, + "step": 2350 + }, + { + "entropy": 1.510320021212101, + "epoch": 0.5944022919749394, + "grad_norm": 0.62890625, + "learning_rate": 2.029715436917653e-05, + "loss": 0.9958, + "mean_token_accuracy": 0.7420489639043808, + "num_tokens": 219167712.0, + "step": 2360 + }, + { + "entropy": 1.4711307182908058, + "epoch": 0.5969209457544942, + "grad_norm": 0.58203125, + "learning_rate": 2.017124150088139e-05, + "loss": 0.9686, + "mean_token_accuracy": 0.7474707916378975, + "num_tokens": 220082656.0, + "step": 2370 + }, + { + "entropy": 1.501902323961258, + "epoch": 0.599439599534049, + "grad_norm": 0.578125, + "learning_rate": 2.004532863258625e-05, + "loss": 1.0207, + "mean_token_accuracy": 0.7335725836455822, + "num_tokens": 220988673.0, + "step": 2380 + }, + { + "entropy": 1.4819249659776688, + "epoch": 0.6019582533136039, + "grad_norm": 0.63671875, + "learning_rate": 1.9919415764291112e-05, + "loss": 0.9895, + "mean_token_accuracy": 0.7437810882925987, + "num_tokens": 221890469.0, + "step": 2390 + }, + { + "entropy": 1.4631519243121147, + "epoch": 0.6044769070931587, + "grad_norm": 0.58203125, + "learning_rate": 1.9793502895995973e-05, + "loss": 0.9768, + "mean_token_accuracy": 0.7473115906119346, + "num_tokens": 222833708.0, + "step": 2400 + }, + { + "entropy": 1.4829539999365806, + "epoch": 0.6069955608727136, + "grad_norm": 0.60546875, + "learning_rate": 1.9667590027700834e-05, + "loss": 1.0029, + "mean_token_accuracy": 0.7405181847512722, + "num_tokens": 223767218.0, + "step": 2410 + }, + { + "entropy": 1.4947340697050095, + "epoch": 0.6095142146522684, + "grad_norm": 0.63671875, + "learning_rate": 1.9541677159405692e-05, + "loss": 1.0127, + "mean_token_accuracy": 0.7391134299337864, + "num_tokens": 224688061.0, + "step": 2420 + }, + { + "entropy": 1.450956329703331, + "epoch": 0.6120328684318231, + "grad_norm": 0.640625, + "learning_rate": 1.9415764291110553e-05, + "loss": 0.9603, + "mean_token_accuracy": 0.7479838944971562, + "num_tokens": 225619117.0, + "step": 2430 + }, + { + "entropy": 1.4841125264763833, + "epoch": 0.614551522211378, + "grad_norm": 0.609375, + "learning_rate": 1.9289851422815414e-05, + "loss": 0.9819, + "mean_token_accuracy": 0.7439415737986564, + "num_tokens": 226543813.0, + "step": 2440 + }, + { + "entropy": 1.4869384542107582, + "epoch": 0.6170701759909328, + "grad_norm": 0.6484375, + "learning_rate": 1.916393855452027e-05, + "loss": 1.0238, + "mean_token_accuracy": 0.7360433027148247, + "num_tokens": 227466179.0, + "step": 2450 + }, + { + "entropy": 1.4867294758558274, + "epoch": 0.6195888297704877, + "grad_norm": 0.59765625, + "learning_rate": 1.9038025686225133e-05, + "loss": 1.0198, + "mean_token_accuracy": 0.7386736191809178, + "num_tokens": 228391779.0, + "step": 2460 + }, + { + "entropy": 1.4967486664652825, + "epoch": 0.6221074835500425, + "grad_norm": 0.6015625, + "learning_rate": 1.8912112817929994e-05, + "loss": 0.9842, + "mean_token_accuracy": 0.7447447247803212, + "num_tokens": 229318854.0, + "step": 2470 + }, + { + "entropy": 1.4630463495850563, + "epoch": 0.6246261373295974, + "grad_norm": 0.59765625, + "learning_rate": 1.878619994963485e-05, + "loss": 0.9822, + "mean_token_accuracy": 0.7429227210581303, + "num_tokens": 230243272.0, + "step": 2480 + }, + { + "entropy": 1.5132867440581321, + "epoch": 0.6271447911091521, + "grad_norm": 0.5625, + "learning_rate": 1.8660287081339713e-05, + "loss": 1.0411, + "mean_token_accuracy": 0.7323724761605263, + "num_tokens": 231165164.0, + "step": 2490 + }, + { + "entropy": 1.505117255449295, + "epoch": 0.629663444888707, + "grad_norm": 0.55859375, + "learning_rate": 1.8534374213044574e-05, + "loss": 1.0083, + "mean_token_accuracy": 0.7365673772990704, + "num_tokens": 232090344.0, + "step": 2500 + }, + { + "entropy": 1.5145672991871835, + "epoch": 0.6321820986682618, + "grad_norm": 0.6015625, + "learning_rate": 1.8408461344749435e-05, + "loss": 1.0037, + "mean_token_accuracy": 0.7394612200558186, + "num_tokens": 233012123.0, + "step": 2510 + }, + { + "entropy": 1.4879171073436737, + "epoch": 0.6347007524478167, + "grad_norm": 0.62109375, + "learning_rate": 1.8282548476454296e-05, + "loss": 1.0255, + "mean_token_accuracy": 0.734065717458725, + "num_tokens": 233944623.0, + "step": 2520 + }, + { + "entropy": 1.5197929657995701, + "epoch": 0.6372194062273715, + "grad_norm": 0.5703125, + "learning_rate": 1.8156635608159157e-05, + "loss": 1.0018, + "mean_token_accuracy": 0.7394672058522701, + "num_tokens": 234854307.0, + "step": 2530 + }, + { + "entropy": 1.4701609089970589, + "epoch": 0.6397380600069263, + "grad_norm": 0.56640625, + "learning_rate": 1.8030722739864015e-05, + "loss": 0.9855, + "mean_token_accuracy": 0.7438199289143086, + "num_tokens": 235800851.0, + "step": 2540 + }, + { + "entropy": 1.4832564637064933, + "epoch": 0.6422567137864811, + "grad_norm": 0.58203125, + "learning_rate": 1.7904809871568876e-05, + "loss": 1.011, + "mean_token_accuracy": 0.73984669521451, + "num_tokens": 236747858.0, + "step": 2550 + }, + { + "entropy": 1.4942113682627678, + "epoch": 0.6447753675660359, + "grad_norm": 0.5859375, + "learning_rate": 1.7778897003273737e-05, + "loss": 1.0095, + "mean_token_accuracy": 0.737560261040926, + "num_tokens": 237690926.0, + "step": 2560 + }, + { + "entropy": 1.4950286373496056, + "epoch": 0.6472940213455908, + "grad_norm": 0.61328125, + "learning_rate": 1.7652984134978595e-05, + "loss": 1.0272, + "mean_token_accuracy": 0.7348176456987858, + "num_tokens": 238601585.0, + "step": 2570 + }, + { + "entropy": 1.507275079190731, + "epoch": 0.6498126751251456, + "grad_norm": 0.62109375, + "learning_rate": 1.7527071266683456e-05, + "loss": 0.9862, + "mean_token_accuracy": 0.7441342391073704, + "num_tokens": 239561971.0, + "step": 2580 + }, + { + "entropy": 1.4744239822030067, + "epoch": 0.6523313289047005, + "grad_norm": 0.61328125, + "learning_rate": 1.7401158398388313e-05, + "loss": 0.9914, + "mean_token_accuracy": 0.7422404564917088, + "num_tokens": 240510814.0, + "step": 2590 + }, + { + "entropy": 1.4942139282822609, + "epoch": 0.6548499826842553, + "grad_norm": 0.62890625, + "learning_rate": 1.7275245530093174e-05, + "loss": 0.9984, + "mean_token_accuracy": 0.7415653012692929, + "num_tokens": 241429091.0, + "step": 2600 + }, + { + "entropy": 1.5210790306329727, + "epoch": 0.65736863646381, + "grad_norm": 0.58984375, + "learning_rate": 1.7149332661798036e-05, + "loss": 1.0669, + "mean_token_accuracy": 0.7277764029800892, + "num_tokens": 242326342.0, + "step": 2610 + }, + { + "entropy": 1.501256914436817, + "epoch": 0.6598872902433649, + "grad_norm": 0.6015625, + "learning_rate": 1.7023419793502897e-05, + "loss": 1.0371, + "mean_token_accuracy": 0.7327685542404652, + "num_tokens": 243262918.0, + "step": 2620 + }, + { + "entropy": 1.4907999977469444, + "epoch": 0.6624059440229197, + "grad_norm": 0.609375, + "learning_rate": 1.6897506925207758e-05, + "loss": 1.0074, + "mean_token_accuracy": 0.7394888132810593, + "num_tokens": 244186200.0, + "step": 2630 + }, + { + "entropy": 1.5089690536260605, + "epoch": 0.6649245978024746, + "grad_norm": 0.640625, + "learning_rate": 1.677159405691262e-05, + "loss": 1.0026, + "mean_token_accuracy": 0.7411562100052833, + "num_tokens": 245110985.0, + "step": 2640 + }, + { + "entropy": 1.4826441787183284, + "epoch": 0.6674432515820294, + "grad_norm": 0.578125, + "learning_rate": 1.6645681188617477e-05, + "loss": 1.0147, + "mean_token_accuracy": 0.7376951925456524, + "num_tokens": 246023602.0, + "step": 2650 + }, + { + "entropy": 1.5016205877065658, + "epoch": 0.6699619053615843, + "grad_norm": 0.59765625, + "learning_rate": 1.6519768320322338e-05, + "loss": 1.0179, + "mean_token_accuracy": 0.7369609415531159, + "num_tokens": 246986524.0, + "step": 2660 + }, + { + "entropy": 1.4834182366728783, + "epoch": 0.672480559141139, + "grad_norm": 0.61328125, + "learning_rate": 1.63938554520272e-05, + "loss": 0.9773, + "mean_token_accuracy": 0.7454558834433556, + "num_tokens": 247926005.0, + "step": 2670 + }, + { + "entropy": 1.4759241729974746, + "epoch": 0.6749992129206939, + "grad_norm": 0.62109375, + "learning_rate": 1.6267942583732056e-05, + "loss": 1.0038, + "mean_token_accuracy": 0.7400371395051479, + "num_tokens": 248847171.0, + "step": 2680 + }, + { + "entropy": 1.5304366648197174, + "epoch": 0.6775178667002487, + "grad_norm": 0.63671875, + "learning_rate": 1.6142029715436917e-05, + "loss": 1.0356, + "mean_token_accuracy": 0.7320890232920647, + "num_tokens": 249786960.0, + "step": 2690 + }, + { + "entropy": 1.4903511464595796, + "epoch": 0.6800365204798036, + "grad_norm": 0.57421875, + "learning_rate": 1.601611684714178e-05, + "loss": 0.9906, + "mean_token_accuracy": 0.7420216508209705, + "num_tokens": 250698887.0, + "step": 2700 + }, + { + "entropy": 1.5175952777266501, + "epoch": 0.6825551742593584, + "grad_norm": 0.625, + "learning_rate": 1.5890203978846636e-05, + "loss": 0.9865, + "mean_token_accuracy": 0.7433042749762535, + "num_tokens": 251619967.0, + "step": 2710 + }, + { + "entropy": 1.4962933480739593, + "epoch": 0.6850738280389131, + "grad_norm": 0.58984375, + "learning_rate": 1.5764291110551497e-05, + "loss": 1.0039, + "mean_token_accuracy": 0.7438869446516037, + "num_tokens": 252542015.0, + "step": 2720 + }, + { + "entropy": 1.475045308470726, + "epoch": 0.687592481818468, + "grad_norm": 0.62109375, + "learning_rate": 1.5638378242256362e-05, + "loss": 0.9653, + "mean_token_accuracy": 0.7465457111597061, + "num_tokens": 253479410.0, + "step": 2730 + }, + { + "entropy": 1.4475198343396187, + "epoch": 0.6901111355980228, + "grad_norm": 0.61328125, + "learning_rate": 1.551246537396122e-05, + "loss": 0.9883, + "mean_token_accuracy": 0.7442029610276222, + "num_tokens": 254421008.0, + "step": 2740 + }, + { + "entropy": 1.4826817378401755, + "epoch": 0.6926297893775777, + "grad_norm": 0.609375, + "learning_rate": 1.538655250566608e-05, + "loss": 1.0162, + "mean_token_accuracy": 0.7372715182602405, + "num_tokens": 255356938.0, + "step": 2750 + }, + { + "entropy": 1.4607293367385865, + "epoch": 0.6951484431571325, + "grad_norm": 0.59765625, + "learning_rate": 1.5260639637370942e-05, + "loss": 0.982, + "mean_token_accuracy": 0.7464394047856331, + "num_tokens": 256276194.0, + "step": 2760 + }, + { + "entropy": 1.5108062788844108, + "epoch": 0.6976670969366874, + "grad_norm": 0.59765625, + "learning_rate": 1.51347267690758e-05, + "loss": 1.0184, + "mean_token_accuracy": 0.736438725143671, + "num_tokens": 257222479.0, + "step": 2770 + }, + { + "entropy": 1.4691065698862076, + "epoch": 0.7001857507162421, + "grad_norm": 0.6328125, + "learning_rate": 1.500881390078066e-05, + "loss": 1.0069, + "mean_token_accuracy": 0.7403544157743454, + "num_tokens": 258141986.0, + "step": 2780 + }, + { + "entropy": 1.4614216104149818, + "epoch": 0.702704404495797, + "grad_norm": 0.58984375, + "learning_rate": 1.4882901032485522e-05, + "loss": 0.9821, + "mean_token_accuracy": 0.7435299441218376, + "num_tokens": 259054793.0, + "step": 2790 + }, + { + "entropy": 1.4462628573179246, + "epoch": 0.7052230582753518, + "grad_norm": 0.58203125, + "learning_rate": 1.475698816419038e-05, + "loss": 0.9687, + "mean_token_accuracy": 0.7498079493641854, + "num_tokens": 260012807.0, + "step": 2800 + }, + { + "entropy": 1.4848258540034294, + "epoch": 0.7077417120549067, + "grad_norm": 0.6015625, + "learning_rate": 1.4631075295895242e-05, + "loss": 0.989, + "mean_token_accuracy": 0.7408308543264865, + "num_tokens": 260948752.0, + "step": 2810 + }, + { + "entropy": 1.4752742052078247, + "epoch": 0.7102603658344615, + "grad_norm": 0.58203125, + "learning_rate": 1.4505162427600103e-05, + "loss": 0.9764, + "mean_token_accuracy": 0.7448857210576534, + "num_tokens": 261830676.0, + "step": 2820 + }, + { + "entropy": 1.4709856286644936, + "epoch": 0.7127790196140164, + "grad_norm": 0.578125, + "learning_rate": 1.4379249559304961e-05, + "loss": 0.9866, + "mean_token_accuracy": 0.7452083975076675, + "num_tokens": 262789665.0, + "step": 2830 + }, + { + "entropy": 1.506988750398159, + "epoch": 0.7152976733935711, + "grad_norm": 0.6015625, + "learning_rate": 1.4253336691009822e-05, + "loss": 0.9845, + "mean_token_accuracy": 0.742633256316185, + "num_tokens": 263719914.0, + "step": 2840 + }, + { + "entropy": 1.4864262834191322, + "epoch": 0.7178163271731259, + "grad_norm": 0.6328125, + "learning_rate": 1.4127423822714683e-05, + "loss": 1.0123, + "mean_token_accuracy": 0.735482431203127, + "num_tokens": 264631489.0, + "step": 2850 + }, + { + "entropy": 1.4856854885816575, + "epoch": 0.7203349809526808, + "grad_norm": 0.60546875, + "learning_rate": 1.4001510954419542e-05, + "loss": 1.0006, + "mean_token_accuracy": 0.7381072089076042, + "num_tokens": 265559953.0, + "step": 2860 + }, + { + "entropy": 1.5200473442673683, + "epoch": 0.7228536347322356, + "grad_norm": 0.65625, + "learning_rate": 1.3875598086124404e-05, + "loss": 1.0176, + "mean_token_accuracy": 0.7391909696161747, + "num_tokens": 266506028.0, + "step": 2870 + }, + { + "entropy": 1.5127366796135902, + "epoch": 0.7253722885117905, + "grad_norm": 0.578125, + "learning_rate": 1.3749685217829265e-05, + "loss": 1.0437, + "mean_token_accuracy": 0.7318307563662529, + "num_tokens": 267439853.0, + "step": 2880 + }, + { + "entropy": 1.4693277314305306, + "epoch": 0.7278909422913453, + "grad_norm": 0.60546875, + "learning_rate": 1.3623772349534122e-05, + "loss": 0.9981, + "mean_token_accuracy": 0.7403404414653778, + "num_tokens": 268367954.0, + "step": 2890 + }, + { + "entropy": 1.4881853014230728, + "epoch": 0.7304095960709001, + "grad_norm": 0.6015625, + "learning_rate": 1.3497859481238983e-05, + "loss": 1.0046, + "mean_token_accuracy": 0.7405321776866913, + "num_tokens": 269276694.0, + "step": 2900 + }, + { + "entropy": 1.5084335424005986, + "epoch": 0.7329282498504549, + "grad_norm": 0.60546875, + "learning_rate": 1.3371946612943845e-05, + "loss": 1.0238, + "mean_token_accuracy": 0.7338868103921413, + "num_tokens": 270192213.0, + "step": 2910 + }, + { + "entropy": 1.4800263881683349, + "epoch": 0.7354469036300098, + "grad_norm": 0.5859375, + "learning_rate": 1.3246033744648704e-05, + "loss": 0.982, + "mean_token_accuracy": 0.7456442162394523, + "num_tokens": 271149665.0, + "step": 2920 + }, + { + "entropy": 1.5040636241436005, + "epoch": 0.7379655574095646, + "grad_norm": 0.59765625, + "learning_rate": 1.3120120876353565e-05, + "loss": 1.0298, + "mean_token_accuracy": 0.733680484443903, + "num_tokens": 272066248.0, + "step": 2930 + }, + { + "entropy": 1.4629945561289788, + "epoch": 0.7404842111891194, + "grad_norm": 0.6328125, + "learning_rate": 1.2994208008058426e-05, + "loss": 0.9934, + "mean_token_accuracy": 0.7426059558987618, + "num_tokens": 272970451.0, + "step": 2940 + }, + { + "entropy": 1.4538513720035553, + "epoch": 0.7430028649686743, + "grad_norm": 0.58984375, + "learning_rate": 1.2868295139763284e-05, + "loss": 1.0009, + "mean_token_accuracy": 0.7420231208205224, + "num_tokens": 273900781.0, + "step": 2950 + }, + { + "entropy": 1.4652035534381866, + "epoch": 0.745521518748229, + "grad_norm": 0.5625, + "learning_rate": 1.2742382271468145e-05, + "loss": 1.0068, + "mean_token_accuracy": 0.7384018860757351, + "num_tokens": 274840032.0, + "step": 2960 + }, + { + "entropy": 1.515961553156376, + "epoch": 0.7480401725277839, + "grad_norm": 0.609375, + "learning_rate": 1.2616469403173004e-05, + "loss": 1.005, + "mean_token_accuracy": 0.7410760201513767, + "num_tokens": 275780300.0, + "step": 2970 + }, + { + "entropy": 1.5057893320918083, + "epoch": 0.7505588263073387, + "grad_norm": 0.59375, + "learning_rate": 1.2490556534877865e-05, + "loss": 1.0121, + "mean_token_accuracy": 0.7373140566051006, + "num_tokens": 276711260.0, + "step": 2980 + }, + { + "entropy": 1.4707092121243477, + "epoch": 0.7530774800868936, + "grad_norm": 0.60546875, + "learning_rate": 1.2364643666582726e-05, + "loss": 0.9748, + "mean_token_accuracy": 0.7442017652094364, + "num_tokens": 277641984.0, + "step": 2990 + }, + { + "entropy": 1.5000385448336602, + "epoch": 0.7555961338664484, + "grad_norm": 0.59765625, + "learning_rate": 1.2238730798287586e-05, + "loss": 1.0032, + "mean_token_accuracy": 0.7411497220396995, + "num_tokens": 278587148.0, + "step": 3000 + }, + { + "entropy": 1.5032398775219917, + "epoch": 0.7581147876460033, + "grad_norm": 0.60546875, + "learning_rate": 1.2112817929992445e-05, + "loss": 0.984, + "mean_token_accuracy": 0.7436385117471218, + "num_tokens": 279492864.0, + "step": 3010 + }, + { + "entropy": 1.5076435655355453, + "epoch": 0.760633441425558, + "grad_norm": 0.609375, + "learning_rate": 1.1986905061697306e-05, + "loss": 1.0129, + "mean_token_accuracy": 0.7388051725924015, + "num_tokens": 280409665.0, + "step": 3020 + }, + { + "entropy": 1.4777460366487503, + "epoch": 0.7631520952051128, + "grad_norm": 0.58984375, + "learning_rate": 1.1860992193402166e-05, + "loss": 0.987, + "mean_token_accuracy": 0.7431692533195019, + "num_tokens": 281347495.0, + "step": 3030 + }, + { + "entropy": 1.4848545402288438, + "epoch": 0.7656707489846677, + "grad_norm": 0.59765625, + "learning_rate": 1.1735079325107027e-05, + "loss": 1.012, + "mean_token_accuracy": 0.7397673189640045, + "num_tokens": 282259845.0, + "step": 3040 + }, + { + "entropy": 1.4779446840286254, + "epoch": 0.7681894027642225, + "grad_norm": 0.58984375, + "learning_rate": 1.1609166456811888e-05, + "loss": 0.9848, + "mean_token_accuracy": 0.7452454976737499, + "num_tokens": 283198308.0, + "step": 3050 + }, + { + "entropy": 1.4629323229193687, + "epoch": 0.7707080565437774, + "grad_norm": 0.57421875, + "learning_rate": 1.1483253588516747e-05, + "loss": 1.0083, + "mean_token_accuracy": 0.7391570150852204, + "num_tokens": 284134979.0, + "step": 3060 + }, + { + "entropy": 1.490471364557743, + "epoch": 0.7732267103233322, + "grad_norm": 0.58203125, + "learning_rate": 1.1357340720221607e-05, + "loss": 1.0078, + "mean_token_accuracy": 0.7395447090268135, + "num_tokens": 285088130.0, + "step": 3070 + }, + { + "entropy": 1.4384993091225624, + "epoch": 0.775745364102887, + "grad_norm": 0.58203125, + "learning_rate": 1.1231427851926466e-05, + "loss": 0.972, + "mean_token_accuracy": 0.7457866981625557, + "num_tokens": 286034044.0, + "step": 3080 + }, + { + "entropy": 1.474022053182125, + "epoch": 0.7782640178824418, + "grad_norm": 0.61328125, + "learning_rate": 1.1105514983631327e-05, + "loss": 1.0109, + "mean_token_accuracy": 0.7370796717703343, + "num_tokens": 286953119.0, + "step": 3090 + }, + { + "entropy": 1.4849003747105598, + "epoch": 0.7807826716619967, + "grad_norm": 0.57421875, + "learning_rate": 1.0979602115336188e-05, + "loss": 0.9955, + "mean_token_accuracy": 0.7422776162624359, + "num_tokens": 287893431.0, + "step": 3100 + }, + { + "entropy": 1.4983975902199744, + "epoch": 0.7833013254415515, + "grad_norm": 0.6328125, + "learning_rate": 1.0853689247041048e-05, + "loss": 0.9983, + "mean_token_accuracy": 0.7403753191232681, + "num_tokens": 288840355.0, + "step": 3110 + }, + { + "entropy": 1.5098316431045533, + "epoch": 0.7858199792211064, + "grad_norm": 0.64453125, + "learning_rate": 1.0727776378745909e-05, + "loss": 1.0409, + "mean_token_accuracy": 0.7355413317680359, + "num_tokens": 289761229.0, + "step": 3120 + }, + { + "entropy": 1.5024679169058799, + "epoch": 0.7883386330006611, + "grad_norm": 0.609375, + "learning_rate": 1.0601863510450768e-05, + "loss": 1.0068, + "mean_token_accuracy": 0.7369636178016663, + "num_tokens": 290690390.0, + "step": 3130 + }, + { + "entropy": 1.522695505619049, + "epoch": 0.7908572867802159, + "grad_norm": 0.5859375, + "learning_rate": 1.0475950642155628e-05, + "loss": 1.0523, + "mean_token_accuracy": 0.7308142200112343, + "num_tokens": 291636996.0, + "step": 3140 + }, + { + "entropy": 1.512753178179264, + "epoch": 0.7933759405597708, + "grad_norm": 0.55859375, + "learning_rate": 1.035003777386049e-05, + "loss": 1.0027, + "mean_token_accuracy": 0.7391382239758968, + "num_tokens": 292575769.0, + "step": 3150 + }, + { + "entropy": 1.49990826100111, + "epoch": 0.7958945943393256, + "grad_norm": 0.6171875, + "learning_rate": 1.022412490556535e-05, + "loss": 1.0215, + "mean_token_accuracy": 0.7357432976365089, + "num_tokens": 293492388.0, + "step": 3160 + }, + { + "entropy": 1.5039694808423518, + "epoch": 0.7984132481188805, + "grad_norm": 0.6015625, + "learning_rate": 1.0098212037270209e-05, + "loss": 1.0502, + "mean_token_accuracy": 0.7306272312998772, + "num_tokens": 294428696.0, + "step": 3170 + }, + { + "entropy": 1.5101190388202668, + "epoch": 0.8009319018984353, + "grad_norm": 0.6015625, + "learning_rate": 9.97229916897507e-06, + "loss": 1.0399, + "mean_token_accuracy": 0.7336853705346584, + "num_tokens": 295346544.0, + "step": 3180 + }, + { + "entropy": 1.50984176248312, + "epoch": 0.8034505556779901, + "grad_norm": 0.578125, + "learning_rate": 9.84638630067993e-06, + "loss": 1.0043, + "mean_token_accuracy": 0.7394494645297527, + "num_tokens": 296248020.0, + "step": 3190 + }, + { + "entropy": 1.474437852203846, + "epoch": 0.8059692094575449, + "grad_norm": 0.5625, + "learning_rate": 9.72047343238479e-06, + "loss": 0.9938, + "mean_token_accuracy": 0.7405206322669983, + "num_tokens": 297188131.0, + "step": 3200 + }, + { + "entropy": 1.498723168671131, + "epoch": 0.8084878632370998, + "grad_norm": 0.61328125, + "learning_rate": 9.594560564089652e-06, + "loss": 1.0374, + "mean_token_accuracy": 0.7325737461447716, + "num_tokens": 298109292.0, + "step": 3210 + }, + { + "entropy": 1.4560261756181716, + "epoch": 0.8110065170166546, + "grad_norm": 0.578125, + "learning_rate": 9.468647695794511e-06, + "loss": 0.9786, + "mean_token_accuracy": 0.7439539857208729, + "num_tokens": 299051156.0, + "step": 3220 + }, + { + "entropy": 1.491245013475418, + "epoch": 0.8135251707962095, + "grad_norm": 0.5859375, + "learning_rate": 9.34273482749937e-06, + "loss": 0.9968, + "mean_token_accuracy": 0.7427712038159371, + "num_tokens": 299999619.0, + "step": 3230 + }, + { + "entropy": 1.4857505142688752, + "epoch": 0.8160438245757643, + "grad_norm": 0.57421875, + "learning_rate": 9.216821959204232e-06, + "loss": 1.0178, + "mean_token_accuracy": 0.732306931167841, + "num_tokens": 300908853.0, + "step": 3240 + }, + { + "entropy": 1.4923428311944007, + "epoch": 0.818562478355319, + "grad_norm": 0.62890625, + "learning_rate": 9.090909090909091e-06, + "loss": 1.0103, + "mean_token_accuracy": 0.7387787699699402, + "num_tokens": 301830035.0, + "step": 3250 + }, + { + "entropy": 1.4485341638326645, + "epoch": 0.8210811321348739, + "grad_norm": 0.59375, + "learning_rate": 8.964996222613952e-06, + "loss": 0.949, + "mean_token_accuracy": 0.7519924528896809, + "num_tokens": 302774780.0, + "step": 3260 + }, + { + "entropy": 1.482700689136982, + "epoch": 0.8235997859144287, + "grad_norm": 0.6015625, + "learning_rate": 8.839083354318812e-06, + "loss": 1.0185, + "mean_token_accuracy": 0.7383209764957428, + "num_tokens": 303698822.0, + "step": 3270 + }, + { + "entropy": 1.5057204052805901, + "epoch": 0.8261184396939836, + "grad_norm": 0.57421875, + "learning_rate": 8.713170486023673e-06, + "loss": 1.023, + "mean_token_accuracy": 0.7377226896584034, + "num_tokens": 304620345.0, + "step": 3280 + }, + { + "entropy": 1.4904442220926284, + "epoch": 0.8286370934735384, + "grad_norm": 0.5390625, + "learning_rate": 8.587257617728532e-06, + "loss": 1.0087, + "mean_token_accuracy": 0.7416534572839737, + "num_tokens": 305551710.0, + "step": 3290 + }, + { + "entropy": 1.5239005982875824, + "epoch": 0.8311557472530933, + "grad_norm": 0.62890625, + "learning_rate": 8.461344749433391e-06, + "loss": 1.059, + "mean_token_accuracy": 0.7288159102201461, + "num_tokens": 306466206.0, + "step": 3300 + }, + { + "entropy": 1.513123245537281, + "epoch": 0.833674401032648, + "grad_norm": 0.625, + "learning_rate": 8.335431881138252e-06, + "loss": 1.0271, + "mean_token_accuracy": 0.7379589311778545, + "num_tokens": 307399178.0, + "step": 3310 + }, + { + "entropy": 1.4970497369766236, + "epoch": 0.8361930548122029, + "grad_norm": 0.59765625, + "learning_rate": 8.209519012843114e-06, + "loss": 0.9927, + "mean_token_accuracy": 0.7436629004776478, + "num_tokens": 308340686.0, + "step": 3320 + }, + { + "entropy": 1.4847823336720467, + "epoch": 0.8387117085917577, + "grad_norm": 0.59765625, + "learning_rate": 8.083606144547973e-06, + "loss": 1.0018, + "mean_token_accuracy": 0.7416875958442688, + "num_tokens": 309290930.0, + "step": 3330 + }, + { + "entropy": 1.4939886629581451, + "epoch": 0.8412303623713125, + "grad_norm": 0.66015625, + "learning_rate": 7.957693276252834e-06, + "loss": 1.0149, + "mean_token_accuracy": 0.736718226224184, + "num_tokens": 310228345.0, + "step": 3340 + }, + { + "entropy": 1.5165553405880927, + "epoch": 0.8437490161508674, + "grad_norm": 0.61328125, + "learning_rate": 7.831780407957693e-06, + "loss": 1.0194, + "mean_token_accuracy": 0.735667246580124, + "num_tokens": 311147031.0, + "step": 3350 + }, + { + "entropy": 1.5101538181304932, + "epoch": 0.8462676699304222, + "grad_norm": 0.5625, + "learning_rate": 7.705867539662553e-06, + "loss": 1.0143, + "mean_token_accuracy": 0.7377640530467033, + "num_tokens": 312071813.0, + "step": 3360 + }, + { + "entropy": 1.4858613476157188, + "epoch": 0.848786323709977, + "grad_norm": 0.5859375, + "learning_rate": 7.579954671367415e-06, + "loss": 1.0042, + "mean_token_accuracy": 0.7420022577047348, + "num_tokens": 313019044.0, + "step": 3370 + }, + { + "entropy": 1.4877135768532752, + "epoch": 0.8513049774895318, + "grad_norm": 0.66796875, + "learning_rate": 7.454041803072274e-06, + "loss": 1.0116, + "mean_token_accuracy": 0.7370616056025028, + "num_tokens": 313924648.0, + "step": 3380 + }, + { + "entropy": 1.4523219719529152, + "epoch": 0.8538236312690867, + "grad_norm": 0.5703125, + "learning_rate": 7.3281289347771344e-06, + "loss": 0.972, + "mean_token_accuracy": 0.7463509783148765, + "num_tokens": 314876822.0, + "step": 3390 + }, + { + "entropy": 1.5021595641970635, + "epoch": 0.8563422850486415, + "grad_norm": 0.671875, + "learning_rate": 7.2022160664819955e-06, + "loss": 1.0164, + "mean_token_accuracy": 0.7378572486341, + "num_tokens": 315830857.0, + "step": 3400 + }, + { + "entropy": 1.4737745821475983, + "epoch": 0.8588609388281964, + "grad_norm": 0.578125, + "learning_rate": 7.076303198186855e-06, + "loss": 0.992, + "mean_token_accuracy": 0.7421701058745385, + "num_tokens": 316765928.0, + "step": 3410 + }, + { + "entropy": 1.5143599852919578, + "epoch": 0.8613795926077512, + "grad_norm": 0.6015625, + "learning_rate": 6.950390329891715e-06, + "loss": 1.0368, + "mean_token_accuracy": 0.7320093587040901, + "num_tokens": 317700949.0, + "step": 3420 + }, + { + "entropy": 1.5028961822390556, + "epoch": 0.863898246387306, + "grad_norm": 0.6328125, + "learning_rate": 6.8244774615965745e-06, + "loss": 1.0503, + "mean_token_accuracy": 0.7298037901520729, + "num_tokens": 318642426.0, + "step": 3430 + }, + { + "entropy": 1.487327341735363, + "epoch": 0.8664169001668608, + "grad_norm": 0.6171875, + "learning_rate": 6.698564593301436e-06, + "loss": 0.9981, + "mean_token_accuracy": 0.7411175973713398, + "num_tokens": 319554341.0, + "step": 3440 + }, + { + "entropy": 1.4858398377895354, + "epoch": 0.8689355539464156, + "grad_norm": 0.671875, + "learning_rate": 6.572651725006296e-06, + "loss": 0.9707, + "mean_token_accuracy": 0.7463601998984813, + "num_tokens": 320469718.0, + "step": 3450 + }, + { + "entropy": 1.4977013349533081, + "epoch": 0.8714542077259705, + "grad_norm": 0.63671875, + "learning_rate": 6.446738856711155e-06, + "loss": 1.0111, + "mean_token_accuracy": 0.7389899030327797, + "num_tokens": 321408669.0, + "step": 3460 + }, + { + "entropy": 1.4885832622647286, + "epoch": 0.8739728615055253, + "grad_norm": 0.69140625, + "learning_rate": 6.320825988416016e-06, + "loss": 1.002, + "mean_token_accuracy": 0.7399603985249996, + "num_tokens": 322319368.0, + "step": 3470 + }, + { + "entropy": 1.5308593392372132, + "epoch": 0.8764915152850801, + "grad_norm": 0.59765625, + "learning_rate": 6.194913120120877e-06, + "loss": 1.0263, + "mean_token_accuracy": 0.7362756490707397, + "num_tokens": 323249158.0, + "step": 3480 + }, + { + "entropy": 1.489845983684063, + "epoch": 0.8790101690646349, + "grad_norm": 0.55859375, + "learning_rate": 6.069000251825737e-06, + "loss": 0.962, + "mean_token_accuracy": 0.7470691427588463, + "num_tokens": 324177591.0, + "step": 3490 + }, + { + "entropy": 1.4811480522155762, + "epoch": 0.8815288228441898, + "grad_norm": 0.6171875, + "learning_rate": 5.943087383530597e-06, + "loss": 0.9931, + "mean_token_accuracy": 0.74410410374403, + "num_tokens": 325086173.0, + "step": 3500 + }, + { + "entropy": 1.517330525815487, + "epoch": 0.8840474766237446, + "grad_norm": 0.625, + "learning_rate": 5.817174515235457e-06, + "loss": 1.0269, + "mean_token_accuracy": 0.7340725965797901, + "num_tokens": 325998476.0, + "step": 3510 + }, + { + "entropy": 1.4777013659477234, + "epoch": 0.8865661304032995, + "grad_norm": 0.61328125, + "learning_rate": 5.6912616469403176e-06, + "loss": 1.0367, + "mean_token_accuracy": 0.7329237192869187, + "num_tokens": 326888629.0, + "step": 3520 + }, + { + "entropy": 1.488082292675972, + "epoch": 0.8890847841828543, + "grad_norm": 0.5625, + "learning_rate": 5.565348778645178e-06, + "loss": 0.9912, + "mean_token_accuracy": 0.742741683870554, + "num_tokens": 327829681.0, + "step": 3530 + }, + { + "entropy": 1.4924616023898125, + "epoch": 0.891603437962409, + "grad_norm": 0.59765625, + "learning_rate": 5.439435910350038e-06, + "loss": 0.9738, + "mean_token_accuracy": 0.7450707465410232, + "num_tokens": 328777620.0, + "step": 3540 + }, + { + "entropy": 1.4866561606526374, + "epoch": 0.8941220917419639, + "grad_norm": 0.6015625, + "learning_rate": 5.313523042054898e-06, + "loss": 1.0161, + "mean_token_accuracy": 0.7406411737203598, + "num_tokens": 329712464.0, + "step": 3550 + }, + { + "entropy": 1.4689026042819022, + "epoch": 0.8966407455215187, + "grad_norm": 0.59375, + "learning_rate": 5.1876101737597585e-06, + "loss": 0.9691, + "mean_token_accuracy": 0.7475285783410073, + "num_tokens": 330641995.0, + "step": 3560 + }, + { + "entropy": 1.5136161372065544, + "epoch": 0.8991593993010736, + "grad_norm": 0.58984375, + "learning_rate": 5.061697305464619e-06, + "loss": 1.0013, + "mean_token_accuracy": 0.7394486844539643, + "num_tokens": 331568134.0, + "step": 3570 + }, + { + "entropy": 1.491369791328907, + "epoch": 0.9016780530806284, + "grad_norm": 0.55859375, + "learning_rate": 4.935784437169479e-06, + "loss": 1.0122, + "mean_token_accuracy": 0.735909091681242, + "num_tokens": 332501528.0, + "step": 3580 + }, + { + "entropy": 1.4946796283125878, + "epoch": 0.9041967068601833, + "grad_norm": 0.62890625, + "learning_rate": 4.809871568874339e-06, + "loss": 0.9903, + "mean_token_accuracy": 0.7426324136555195, + "num_tokens": 333409554.0, + "step": 3590 + }, + { + "entropy": 1.4981262043118477, + "epoch": 0.906715360639738, + "grad_norm": 0.609375, + "learning_rate": 4.6839587005791995e-06, + "loss": 1.0273, + "mean_token_accuracy": 0.7351961940526962, + "num_tokens": 334331813.0, + "step": 3600 + }, + { + "entropy": 1.4707158148288726, + "epoch": 0.9092340144192929, + "grad_norm": 0.59375, + "learning_rate": 4.55804583228406e-06, + "loss": 1.0127, + "mean_token_accuracy": 0.7383458167314529, + "num_tokens": 335268161.0, + "step": 3610 + }, + { + "entropy": 1.529105232656002, + "epoch": 0.9117526681988477, + "grad_norm": 0.63671875, + "learning_rate": 4.43213296398892e-06, + "loss": 1.0746, + "mean_token_accuracy": 0.7247563876211643, + "num_tokens": 336166223.0, + "step": 3620 + }, + { + "entropy": 1.4632112085819244, + "epoch": 0.9142713219784026, + "grad_norm": 0.640625, + "learning_rate": 4.30622009569378e-06, + "loss": 0.9751, + "mean_token_accuracy": 0.7464818298816681, + "num_tokens": 337114488.0, + "step": 3630 + }, + { + "entropy": 1.4965253099799156, + "epoch": 0.9167899757579574, + "grad_norm": 0.59765625, + "learning_rate": 4.1803072273986405e-06, + "loss": 1.0182, + "mean_token_accuracy": 0.7366202019155026, + "num_tokens": 338046633.0, + "step": 3640 + }, + { + "entropy": 1.4636427968740464, + "epoch": 0.9193086295375122, + "grad_norm": 0.640625, + "learning_rate": 4.054394359103501e-06, + "loss": 0.9868, + "mean_token_accuracy": 0.7432655967772007, + "num_tokens": 338968280.0, + "step": 3650 + }, + { + "entropy": 1.4739444583654404, + "epoch": 0.921827283317067, + "grad_norm": 0.5625, + "learning_rate": 3.928481490808361e-06, + "loss": 0.9648, + "mean_token_accuracy": 0.7487529583275319, + "num_tokens": 339893347.0, + "step": 3660 + }, + { + "entropy": 1.415738572180271, + "epoch": 0.9243459370966218, + "grad_norm": 0.61328125, + "learning_rate": 3.8025686225132208e-06, + "loss": 0.9282, + "mean_token_accuracy": 0.756267712265253, + "num_tokens": 340816571.0, + "step": 3670 + }, + { + "entropy": 1.4868112698197364, + "epoch": 0.9268645908761767, + "grad_norm": 0.609375, + "learning_rate": 3.6766557542180814e-06, + "loss": 1.0149, + "mean_token_accuracy": 0.7356903217732906, + "num_tokens": 341727649.0, + "step": 3680 + }, + { + "entropy": 1.489026002585888, + "epoch": 0.9293832446557315, + "grad_norm": 0.59375, + "learning_rate": 3.5507428859229413e-06, + "loss": 0.9725, + "mean_token_accuracy": 0.7466869972646236, + "num_tokens": 342670871.0, + "step": 3690 + }, + { + "entropy": 1.4483363971114158, + "epoch": 0.9319018984352864, + "grad_norm": 0.54296875, + "learning_rate": 3.4248300176278015e-06, + "loss": 0.9528, + "mean_token_accuracy": 0.7525399282574654, + "num_tokens": 343575810.0, + "step": 3700 + }, + { + "entropy": 1.4972086012363435, + "epoch": 0.9344205522148412, + "grad_norm": 0.59765625, + "learning_rate": 3.298917149332662e-06, + "loss": 0.9881, + "mean_token_accuracy": 0.7425376117229462, + "num_tokens": 344505435.0, + "step": 3710 + }, + { + "entropy": 1.4751506879925729, + "epoch": 0.936939205994396, + "grad_norm": 0.56640625, + "learning_rate": 3.173004281037522e-06, + "loss": 0.9995, + "mean_token_accuracy": 0.7415733940899372, + "num_tokens": 345454166.0, + "step": 3720 + }, + { + "entropy": 1.4912448197603225, + "epoch": 0.9394578597739508, + "grad_norm": 0.58984375, + "learning_rate": 3.0470914127423827e-06, + "loss": 1.0192, + "mean_token_accuracy": 0.7367800146341323, + "num_tokens": 346361862.0, + "step": 3730 + }, + { + "entropy": 1.5106546625494957, + "epoch": 0.9419765135535056, + "grad_norm": 0.62890625, + "learning_rate": 2.9211785444472425e-06, + "loss": 1.045, + "mean_token_accuracy": 0.7318918511271477, + "num_tokens": 347306780.0, + "step": 3740 + }, + { + "entropy": 1.4863861680030823, + "epoch": 0.9444951673330605, + "grad_norm": 0.625, + "learning_rate": 2.7952656761521027e-06, + "loss": 0.9934, + "mean_token_accuracy": 0.7438393741846084, + "num_tokens": 348230042.0, + "step": 3750 + }, + { + "entropy": 1.4912439316511155, + "epoch": 0.9470138211126153, + "grad_norm": 0.62109375, + "learning_rate": 2.6693528078569634e-06, + "loss": 0.9985, + "mean_token_accuracy": 0.7412358790636062, + "num_tokens": 349130792.0, + "step": 3760 + }, + { + "entropy": 1.5144632264971734, + "epoch": 0.9495324748921702, + "grad_norm": 0.66015625, + "learning_rate": 2.543439939561823e-06, + "loss": 1.0468, + "mean_token_accuracy": 0.7318057663738727, + "num_tokens": 350050566.0, + "step": 3770 + }, + { + "entropy": 1.4877790048718453, + "epoch": 0.9520511286717249, + "grad_norm": 0.5546875, + "learning_rate": 2.4175270712666834e-06, + "loss": 1.0022, + "mean_token_accuracy": 0.7390140548348427, + "num_tokens": 350980304.0, + "step": 3780 + }, + { + "entropy": 1.4984122559428215, + "epoch": 0.9545697824512798, + "grad_norm": 0.62890625, + "learning_rate": 2.2916142029715437e-06, + "loss": 0.9951, + "mean_token_accuracy": 0.7424575209617614, + "num_tokens": 351911007.0, + "step": 3790 + }, + { + "entropy": 1.495207953453064, + "epoch": 0.9570884362308346, + "grad_norm": 0.61328125, + "learning_rate": 2.1657013346764043e-06, + "loss": 1.015, + "mean_token_accuracy": 0.7366439893841743, + "num_tokens": 352846519.0, + "step": 3800 + }, + { + "entropy": 1.481141744554043, + "epoch": 0.9596070900103895, + "grad_norm": 0.5703125, + "learning_rate": 2.039788466381264e-06, + "loss": 1.0275, + "mean_token_accuracy": 0.7345097243785859, + "num_tokens": 353782132.0, + "step": 3810 + }, + { + "entropy": 1.4692917168140411, + "epoch": 0.9621257437899443, + "grad_norm": 0.62890625, + "learning_rate": 1.9138755980861244e-06, + "loss": 0.9799, + "mean_token_accuracy": 0.744342253357172, + "num_tokens": 354668645.0, + "step": 3820 + }, + { + "entropy": 1.5071855306625366, + "epoch": 0.9646443975694992, + "grad_norm": 0.56640625, + "learning_rate": 1.7879627297909846e-06, + "loss": 1.0593, + "mean_token_accuracy": 0.7290410205721856, + "num_tokens": 355600887.0, + "step": 3830 + }, + { + "entropy": 1.5132853239774704, + "epoch": 0.9671630513490539, + "grad_norm": 0.61328125, + "learning_rate": 1.662049861495845e-06, + "loss": 1.0435, + "mean_token_accuracy": 0.7298006169497967, + "num_tokens": 356522841.0, + "step": 3840 + }, + { + "entropy": 1.4672839909791946, + "epoch": 0.9696817051286087, + "grad_norm": 0.60546875, + "learning_rate": 1.5361369932007051e-06, + "loss": 0.9753, + "mean_token_accuracy": 0.7466705776751041, + "num_tokens": 357452055.0, + "step": 3850 + }, + { + "entropy": 1.4822666108608247, + "epoch": 0.9722003589081636, + "grad_norm": 0.6328125, + "learning_rate": 1.4102241249055656e-06, + "loss": 1.0259, + "mean_token_accuracy": 0.7341479398310184, + "num_tokens": 358377891.0, + "step": 3860 + }, + { + "entropy": 1.4937451481819153, + "epoch": 0.9747190126877184, + "grad_norm": 0.578125, + "learning_rate": 1.2843112566104256e-06, + "loss": 0.9759, + "mean_token_accuracy": 0.7456471361219883, + "num_tokens": 359300390.0, + "step": 3870 + }, + { + "entropy": 1.5173174068331718, + "epoch": 0.9772376664672733, + "grad_norm": 0.6015625, + "learning_rate": 1.1583983883152859e-06, + "loss": 1.0301, + "mean_token_accuracy": 0.7358597233891487, + "num_tokens": 360238533.0, + "step": 3880 + }, + { + "entropy": 1.4928388759493827, + "epoch": 0.979756320246828, + "grad_norm": 0.57421875, + "learning_rate": 1.032485520020146e-06, + "loss": 1.0117, + "mean_token_accuracy": 0.7398792788386345, + "num_tokens": 361150526.0, + "step": 3890 + }, + { + "entropy": 1.5063897222280502, + "epoch": 0.9822749740263829, + "grad_norm": 0.62109375, + "learning_rate": 9.065726517250064e-07, + "loss": 1.017, + "mean_token_accuracy": 0.7376690439879894, + "num_tokens": 362100458.0, + "step": 3900 + }, + { + "entropy": 1.4783270865678788, + "epoch": 0.9847936278059377, + "grad_norm": 0.6328125, + "learning_rate": 7.806597834298666e-07, + "loss": 1.0081, + "mean_token_accuracy": 0.7380148410797119, + "num_tokens": 363014425.0, + "step": 3910 + }, + { + "entropy": 1.5196350157260894, + "epoch": 0.9873122815854926, + "grad_norm": 0.6328125, + "learning_rate": 6.547469151347267e-07, + "loss": 1.02, + "mean_token_accuracy": 0.7349734269082546, + "num_tokens": 363929023.0, + "step": 3920 + }, + { + "entropy": 1.4695521786808967, + "epoch": 0.9898309353650474, + "grad_norm": 0.59375, + "learning_rate": 5.28834046839587e-07, + "loss": 0.9597, + "mean_token_accuracy": 0.7482846342027187, + "num_tokens": 364898379.0, + "step": 3930 + }, + { + "entropy": 1.4966929897665977, + "epoch": 0.9923495891446023, + "grad_norm": 0.6328125, + "learning_rate": 4.029211785444472e-07, + "loss": 1.0137, + "mean_token_accuracy": 0.7382561720907688, + "num_tokens": 365874642.0, + "step": 3940 + }, + { + "entropy": 1.485151782631874, + "epoch": 0.994868242924157, + "grad_norm": 0.58984375, + "learning_rate": 2.770083102493075e-07, + "loss": 0.9854, + "mean_token_accuracy": 0.7435578644275666, + "num_tokens": 366766965.0, + "step": 3950 + }, + { + "entropy": 1.4845439344644547, + "epoch": 0.9973868967037118, + "grad_norm": 0.58984375, + "learning_rate": 1.5109544195416771e-07, + "loss": 0.9723, + "mean_token_accuracy": 0.7472767226397992, + "num_tokens": 367711087.0, + "step": 3960 + }, + { + "entropy": 1.5110925331711769, + "epoch": 0.9999055504832667, + "grad_norm": 0.6328125, + "learning_rate": 2.518257365902795e-08, + "loss": 1.0354, + "mean_token_accuracy": 0.7324677541851997, + "num_tokens": 368669225.0, + "step": 3970 + } + ], + "logging_steps": 10, + "max_steps": 3971, + "num_input_tokens_seen": 0, + "num_train_epochs": 1, + "save_steps": 500, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": true + }, + "attributes": {} + } + }, + "total_flos": 4.986803437820707e+18, + "train_batch_size": 4, + "trial_name": null, + "trial_params": null +}