{ "best_global_step": 3500, "best_metric": 0.08556525409221649, "best_model_checkpoint": "/data6/jongbinwon/evolving_MoE/checkpoints/sft_llama31_8b_lbox_criminal_property_ffn_only_5ep/checkpoint-3500", "epoch": 5.0, "eval_steps": 100, "global_step": 5770, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 2.0094634652137757, "epoch": 0.00866738894907909, "grad_norm": 6.016944408416748, "learning_rate": 1.0344827586206898e-06, "loss": 1.9924282073974608, "mean_token_accuracy": 0.6058960895985365, "num_tokens": 62341.0, "step": 10 }, { "entropy": 2.074240231513977, "epoch": 0.01733477789815818, "grad_norm": 22.0172119140625, "learning_rate": 2.1839080459770117e-06, "loss": 1.9484416961669921, "mean_token_accuracy": 0.6000785790383816, "num_tokens": 123672.0, "step": 20 }, { "entropy": 2.1732099413871766, "epoch": 0.02600216684723727, "grad_norm": 6.0356831550598145, "learning_rate": 3.3333333333333333e-06, "loss": 1.966094970703125, "mean_token_accuracy": 0.5903577983379364, "num_tokens": 178475.0, "step": 30 }, { "entropy": 2.03062362074852, "epoch": 0.03466955579631636, "grad_norm": 7.640094757080078, "learning_rate": 4.482758620689656e-06, "loss": 1.8349821090698242, "mean_token_accuracy": 0.6228681385517121, "num_tokens": 243079.0, "step": 40 }, { "entropy": 2.0886535823345183, "epoch": 0.04333694474539545, "grad_norm": 4.04999303817749, "learning_rate": 5.6321839080459775e-06, "loss": 1.382587718963623, "mean_token_accuracy": 0.6765289187431336, "num_tokens": 307598.0, "step": 50 }, { "entropy": 2.036424469947815, "epoch": 0.05200433369447454, "grad_norm": 5.690767288208008, "learning_rate": 6.781609195402299e-06, "loss": 1.2014636039733886, "mean_token_accuracy": 0.7360026895999908, "num_tokens": 370530.0, "step": 60 }, { "entropy": 2.0666846364736555, "epoch": 0.06067172264355363, "grad_norm": 6.074404716491699, "learning_rate": 7.93103448275862e-06, "loss": 0.9479114532470703, "mean_token_accuracy": 0.8202387556433678, "num_tokens": 438053.0, "step": 70 }, { "entropy": 2.1196643888950346, "epoch": 0.06933911159263272, "grad_norm": 3.3794610500335693, "learning_rate": 9.080459770114942e-06, "loss": 0.7980506896972657, "mean_token_accuracy": 0.8331406563520432, "num_tokens": 495572.0, "step": 80 }, { "entropy": 2.0099371910095214, "epoch": 0.0780065005417118, "grad_norm": 4.104278087615967, "learning_rate": 1.0229885057471264e-05, "loss": 0.8544118881225586, "mean_token_accuracy": 0.793623823672533, "num_tokens": 562327.0, "step": 90 }, { "entropy": 2.111247554421425, "epoch": 0.0866738894907909, "grad_norm": 3.811084270477295, "learning_rate": 1.1379310344827587e-05, "loss": 0.5899581909179688, "mean_token_accuracy": 0.8357160598039627, "num_tokens": 622741.0, "step": 100 }, { "epoch": 0.0866738894907909, "eval_entropy": 2.0146469435288537, "eval_loss": 0.639670729637146, "eval_mean_token_accuracy": 0.8453463265551856, "eval_num_tokens": 622741.0, "eval_runtime": 327.692, "eval_samples_per_second": 4.907, "eval_steps_per_second": 0.613, "step": 100 }, { "entropy": 2.1024232476949694, "epoch": 0.09534127843986999, "grad_norm": 3.4410061836242676, "learning_rate": 1.2528735632183907e-05, "loss": 0.5648527145385742, "mean_token_accuracy": 0.8602957978844643, "num_tokens": 686988.0, "step": 110 }, { "entropy": 2.0769773036241532, "epoch": 0.10400866738894908, "grad_norm": 4.00484561920166, "learning_rate": 1.367816091954023e-05, "loss": 0.6145552158355713, "mean_token_accuracy": 0.846926499903202, "num_tokens": 742631.0, "step": 120 }, { "entropy": 2.0740666419267653, "epoch": 0.11267605633802817, "grad_norm": 3.5441555976867676, "learning_rate": 1.4827586206896554e-05, "loss": 0.4216147422790527, "mean_token_accuracy": 0.8855735391378403, "num_tokens": 800445.0, "step": 130 }, { "entropy": 2.086614066362381, "epoch": 0.12134344528710726, "grad_norm": 3.0210344791412354, "learning_rate": 1.5977011494252876e-05, "loss": 0.3674225568771362, "mean_token_accuracy": 0.9093644827604294, "num_tokens": 864344.0, "step": 140 }, { "entropy": 2.082952803373337, "epoch": 0.13001083423618634, "grad_norm": 4.145540237426758, "learning_rate": 1.7126436781609197e-05, "loss": 0.40997681617736814, "mean_token_accuracy": 0.9000683546066284, "num_tokens": 922914.0, "step": 150 }, { "entropy": 1.9609296470880508, "epoch": 0.13867822318526543, "grad_norm": 4.342889308929443, "learning_rate": 1.827586206896552e-05, "loss": 0.47150702476501466, "mean_token_accuracy": 0.8880565464496613, "num_tokens": 992986.0, "step": 160 }, { "entropy": 2.02143072783947, "epoch": 0.14734561213434452, "grad_norm": 4.358700752258301, "learning_rate": 1.942528735632184e-05, "loss": 0.3823310136795044, "mean_token_accuracy": 0.8964826211333274, "num_tokens": 1056343.0, "step": 170 }, { "entropy": 2.1072087794542314, "epoch": 0.1560130010834236, "grad_norm": 8.081436157226562, "learning_rate": 1.999996060382467e-05, "loss": 0.3178143262863159, "mean_token_accuracy": 0.8876261033117772, "num_tokens": 1110020.0, "step": 180 }, { "entropy": 1.9597682043910027, "epoch": 0.1646803900325027, "grad_norm": 3.436814308166504, "learning_rate": 1.9999645436284486e-05, "loss": 0.3373431921005249, "mean_token_accuracy": 0.9190717935562134, "num_tokens": 1175893.0, "step": 190 }, { "entropy": 2.045034462213516, "epoch": 0.1733477789815818, "grad_norm": 5.531442642211914, "learning_rate": 1.999901511113721e-05, "loss": 0.48609213829040526, "mean_token_accuracy": 0.8734037652611732, "num_tokens": 1233459.0, "step": 200 }, { "epoch": 0.1733477789815818, "eval_entropy": 1.9307460037629995, "eval_loss": 0.31969207525253296, "eval_mean_token_accuracy": 0.9156260101949397, "eval_num_tokens": 1233459.0, "eval_runtime": 327.7812, "eval_samples_per_second": 4.906, "eval_steps_per_second": 0.613, "step": 200 }, { "entropy": 1.9456486970186233, "epoch": 0.1820151679306609, "grad_norm": 3.714157819747925, "learning_rate": 1.999806964824873e-05, "loss": 0.27378363609313966, "mean_token_accuracy": 0.898275463283062, "num_tokens": 1310194.0, "step": 210 }, { "entropy": 1.9946164965629578, "epoch": 0.19068255687973998, "grad_norm": 5.428526878356934, "learning_rate": 1.999680907741708e-05, "loss": 0.18908169269561767, "mean_token_accuracy": 0.9540401995182037, "num_tokens": 1372396.0, "step": 220 }, { "entropy": 1.9999880447983742, "epoch": 0.19934994582881907, "grad_norm": 5.249075889587402, "learning_rate": 1.999523343837152e-05, "loss": 0.2796680212020874, "mean_token_accuracy": 0.9432714268565178, "num_tokens": 1431522.0, "step": 230 }, { "entropy": 1.9591780692338943, "epoch": 0.20801733477789816, "grad_norm": 5.265084743499756, "learning_rate": 1.999334278077127e-05, "loss": 0.3002108097076416, "mean_token_accuracy": 0.9193895891308784, "num_tokens": 1493107.0, "step": 240 }, { "entropy": 2.0249179124832155, "epoch": 0.21668472372697725, "grad_norm": 3.4058895111083984, "learning_rate": 1.999113716420396e-05, "loss": 0.3556444406509399, "mean_token_accuracy": 0.9207730159163475, "num_tokens": 1550661.0, "step": 250 }, { "entropy": 1.8855496376752854, "epoch": 0.22535211267605634, "grad_norm": 4.0377936363220215, "learning_rate": 1.9988616658183734e-05, "loss": 0.19759812355041503, "mean_token_accuracy": 0.948055523633957, "num_tokens": 1626343.0, "step": 260 }, { "entropy": 1.8737920612096786, "epoch": 0.23401950162513543, "grad_norm": 2.6314523220062256, "learning_rate": 1.9985781342149078e-05, "loss": 0.28745641708374026, "mean_token_accuracy": 0.9337396785616875, "num_tokens": 1696414.0, "step": 270 }, { "entropy": 1.9150809600949288, "epoch": 0.24268689057421453, "grad_norm": 5.922034740447998, "learning_rate": 1.9982631305460297e-05, "loss": 0.28877570629119875, "mean_token_accuracy": 0.9260302111506462, "num_tokens": 1761679.0, "step": 280 }, { "entropy": 1.92972229719162, "epoch": 0.2513542795232936, "grad_norm": 5.307780742645264, "learning_rate": 1.9979166647396718e-05, "loss": 0.20345923900604249, "mean_token_accuracy": 0.9439164400100708, "num_tokens": 1828184.0, "step": 290 }, { "entropy": 1.950343307852745, "epoch": 0.2600216684723727, "grad_norm": 4.971693992614746, "learning_rate": 1.9975387477153547e-05, "loss": 0.33291172981262207, "mean_token_accuracy": 0.9112795010209084, "num_tokens": 1894019.0, "step": 300 }, { "epoch": 0.2600216684723727, "eval_entropy": 1.9190048121694308, "eval_loss": 0.2512859106063843, "eval_mean_token_accuracy": 0.9369790637077977, "eval_num_tokens": 1894019.0, "eval_runtime": 327.5455, "eval_samples_per_second": 4.909, "eval_steps_per_second": 0.614, "step": 300 }, { "entropy": 2.010765317082405, "epoch": 0.26868905742145177, "grad_norm": 8.496099472045898, "learning_rate": 1.997129391383843e-05, "loss": 0.3033193826675415, "mean_token_accuracy": 0.9163187935948371, "num_tokens": 1946992.0, "step": 310 }, { "entropy": 1.9858351945877075, "epoch": 0.27735644637053086, "grad_norm": 3.4120125770568848, "learning_rate": 1.9966886086467704e-05, "loss": 0.29690701961517335, "mean_token_accuracy": 0.9126337721943856, "num_tokens": 2011691.0, "step": 320 }, { "entropy": 1.8983549684286118, "epoch": 0.28602383531960995, "grad_norm": 1.436771035194397, "learning_rate": 1.9962164133962325e-05, "loss": 0.30121750831604005, "mean_token_accuracy": 0.9224563807249069, "num_tokens": 2083706.0, "step": 330 }, { "entropy": 1.9841466784477233, "epoch": 0.29469122426868904, "grad_norm": 5.781894683837891, "learning_rate": 1.9957128205143498e-05, "loss": 0.2556509017944336, "mean_token_accuracy": 0.9394641578197479, "num_tokens": 2148674.0, "step": 340 }, { "entropy": 1.9055085510015488, "epoch": 0.30335861321776814, "grad_norm": 6.032225608825684, "learning_rate": 1.9951778458727976e-05, "loss": 0.27752203941345216, "mean_token_accuracy": 0.9140971004962921, "num_tokens": 2215772.0, "step": 350 }, { "entropy": 2.04987233877182, "epoch": 0.3120260021668472, "grad_norm": 2.553159475326538, "learning_rate": 1.9946115063323068e-05, "loss": 0.19900113344192505, "mean_token_accuracy": 0.9388249479234219, "num_tokens": 2266191.0, "step": 360 }, { "entropy": 2.009141910076141, "epoch": 0.3206933911159263, "grad_norm": 1.9444561004638672, "learning_rate": 1.9940138197421316e-05, "loss": 0.17729513645172118, "mean_token_accuracy": 0.9602704092860221, "num_tokens": 2325355.0, "step": 370 }, { "entropy": 2.004271525144577, "epoch": 0.3293607800650054, "grad_norm": 8.431859970092773, "learning_rate": 1.9933848049394872e-05, "loss": 0.14624375104904175, "mean_token_accuracy": 0.9545927375555039, "num_tokens": 2383835.0, "step": 380 }, { "entropy": 1.9636184632778169, "epoch": 0.3380281690140845, "grad_norm": 3.6653892993927, "learning_rate": 1.9927244817489568e-05, "loss": 0.19174840450286865, "mean_token_accuracy": 0.945315583050251, "num_tokens": 2453604.0, "step": 390 }, { "entropy": 1.9832717061042786, "epoch": 0.3466955579631636, "grad_norm": 4.508843421936035, "learning_rate": 1.9920328709818658e-05, "loss": 0.22036411762237548, "mean_token_accuracy": 0.946815638244152, "num_tokens": 2511426.0, "step": 400 }, { "epoch": 0.3466955579631636, "eval_entropy": 1.8908554446044845, "eval_loss": 0.21776656806468964, "eval_mean_token_accuracy": 0.9417561876833143, "eval_num_tokens": 2511426.0, "eval_runtime": 327.8022, "eval_samples_per_second": 4.905, "eval_steps_per_second": 0.613, "step": 400 }, { "entropy": 1.9166859805583953, "epoch": 0.3553629469122427, "grad_norm": 4.482876300811768, "learning_rate": 1.9913099944356265e-05, "loss": 0.21862165927886962, "mean_token_accuracy": 0.9501018598675728, "num_tokens": 2576843.0, "step": 410 }, { "entropy": 1.981603667140007, "epoch": 0.3640303358613218, "grad_norm": 2.7158615589141846, "learning_rate": 1.9905558748930513e-05, "loss": 0.20267672538757325, "mean_token_accuracy": 0.9586101487278939, "num_tokens": 2633215.0, "step": 420 }, { "entropy": 1.979082790017128, "epoch": 0.37269772481040087, "grad_norm": 1.2694976329803467, "learning_rate": 1.9897705361216334e-05, "loss": 0.1717057228088379, "mean_token_accuracy": 0.9619395598769188, "num_tokens": 2704383.0, "step": 430 }, { "entropy": 1.9977828115224838, "epoch": 0.38136511375947996, "grad_norm": 3.3041579723358154, "learning_rate": 1.9889540028728e-05, "loss": 0.2565366268157959, "mean_token_accuracy": 0.9440258383750916, "num_tokens": 2762147.0, "step": 440 }, { "entropy": 1.985519140958786, "epoch": 0.39003250270855905, "grad_norm": 3.923245668411255, "learning_rate": 1.9881063008811288e-05, "loss": 0.15962369441986085, "mean_token_accuracy": 0.9452512726187706, "num_tokens": 2827820.0, "step": 450 }, { "entropy": 1.9977640628814697, "epoch": 0.39869989165763814, "grad_norm": 5.337918758392334, "learning_rate": 1.987227456863541e-05, "loss": 0.19878954887390138, "mean_token_accuracy": 0.9549267739057541, "num_tokens": 2894148.0, "step": 460 }, { "entropy": 1.981362435221672, "epoch": 0.40736728060671723, "grad_norm": 4.396739482879639, "learning_rate": 1.9863174985184565e-05, "loss": 0.2123692512512207, "mean_token_accuracy": 0.9419563382863998, "num_tokens": 2949819.0, "step": 470 }, { "entropy": 2.053285387158394, "epoch": 0.4160346695557963, "grad_norm": 1.743699073791504, "learning_rate": 1.9853764545249217e-05, "loss": 0.1345153570175171, "mean_token_accuracy": 0.9553116604685783, "num_tokens": 3002255.0, "step": 480 }, { "entropy": 2.015228086709976, "epoch": 0.4247020585048754, "grad_norm": 9.911247253417969, "learning_rate": 1.984404354541705e-05, "loss": 0.2177375078201294, "mean_token_accuracy": 0.9537948787212371, "num_tokens": 3066922.0, "step": 490 }, { "entropy": 1.9184562861919403, "epoch": 0.4333694474539545, "grad_norm": 6.476995468139648, "learning_rate": 1.9834012292063634e-05, "loss": 0.13998514413833618, "mean_token_accuracy": 0.9385814905166626, "num_tokens": 3135056.0, "step": 500 }, { "epoch": 0.4333694474539545, "eval_entropy": 1.91096430453495, "eval_loss": 0.18260541558265686, "eval_mean_token_accuracy": 0.9541504039100154, "eval_num_tokens": 3135056.0, "eval_runtime": 327.4029, "eval_samples_per_second": 4.911, "eval_steps_per_second": 0.614, "step": 500 }, { "entropy": 1.986215516924858, "epoch": 0.4420368364030336, "grad_norm": 1.8353534936904907, "learning_rate": 1.982367110134276e-05, "loss": 0.2266139030456543, "mean_token_accuracy": 0.939882904291153, "num_tokens": 3196646.0, "step": 510 }, { "entropy": 2.0170169204473494, "epoch": 0.4507042253521127, "grad_norm": 5.655337810516357, "learning_rate": 1.9813020299176475e-05, "loss": 0.23389663696289062, "mean_token_accuracy": 0.9509230718016625, "num_tokens": 3258975.0, "step": 520 }, { "entropy": 2.0502737373113633, "epoch": 0.4593716143011918, "grad_norm": 4.397721290588379, "learning_rate": 1.9802060221244815e-05, "loss": 0.1621358275413513, "mean_token_accuracy": 0.9493934914469719, "num_tokens": 3323770.0, "step": 530 }, { "entropy": 1.936602184176445, "epoch": 0.46803900325027087, "grad_norm": 4.689565181732178, "learning_rate": 1.979079121297522e-05, "loss": 0.21635038852691652, "mean_token_accuracy": 0.9611420571804047, "num_tokens": 3392275.0, "step": 540 }, { "entropy": 2.060832369327545, "epoch": 0.47670639219934996, "grad_norm": 2.461576461791992, "learning_rate": 1.977921362953165e-05, "loss": 0.2094656467437744, "mean_token_accuracy": 0.9389677405357361, "num_tokens": 3449649.0, "step": 550 }, { "entropy": 1.976703155040741, "epoch": 0.48537378114842905, "grad_norm": 3.079184055328369, "learning_rate": 1.9767327835803388e-05, "loss": 0.13856724500656128, "mean_token_accuracy": 0.9628144934773445, "num_tokens": 3519095.0, "step": 560 }, { "entropy": 2.0048892587423324, "epoch": 0.49404117009750814, "grad_norm": 2.5651493072509766, "learning_rate": 1.9755134206393557e-05, "loss": 0.2005464792251587, "mean_token_accuracy": 0.9645502358675003, "num_tokens": 3577729.0, "step": 570 }, { "entropy": 2.048991507291794, "epoch": 0.5027085590465872, "grad_norm": 6.429996967315674, "learning_rate": 1.974263312560728e-05, "loss": 0.11518661975860596, "mean_token_accuracy": 0.9612075328826905, "num_tokens": 3641823.0, "step": 580 }, { "entropy": 2.0796742677688598, "epoch": 0.5113759479956663, "grad_norm": 3.4637815952301025, "learning_rate": 1.972982498743961e-05, "loss": 0.13005509376525878, "mean_token_accuracy": 0.9748484209179878, "num_tokens": 3698090.0, "step": 590 }, { "entropy": 2.018010488152504, "epoch": 0.5200433369447454, "grad_norm": 5.774364948272705, "learning_rate": 1.9716710195563063e-05, "loss": 0.11385848522186279, "mean_token_accuracy": 0.9651767894625664, "num_tokens": 3766932.0, "step": 600 }, { "epoch": 0.5200433369447454, "eval_entropy": 1.949031797214527, "eval_loss": 0.1759590059518814, "eval_mean_token_accuracy": 0.9537636631756873, "eval_num_tokens": 3766932.0, "eval_runtime": 327.6397, "eval_samples_per_second": 4.908, "eval_steps_per_second": 0.613, "step": 600 }, { "entropy": 1.9692809194326402, "epoch": 0.5287107258938245, "grad_norm": 3.4839439392089844, "learning_rate": 1.9703289163314947e-05, "loss": 0.21931560039520265, "mean_token_accuracy": 0.9536899715662003, "num_tokens": 3836323.0, "step": 610 }, { "entropy": 2.049798659980297, "epoch": 0.5373781148429035, "grad_norm": 6.157666206359863, "learning_rate": 1.9689562313684295e-05, "loss": 0.1124419093132019, "mean_token_accuracy": 0.9672878786921502, "num_tokens": 3894701.0, "step": 620 }, { "entropy": 2.0254536986351015, "epoch": 0.5460455037919827, "grad_norm": 3.196044683456421, "learning_rate": 1.9675530079298554e-05, "loss": 0.09724722504615783, "mean_token_accuracy": 0.969377551972866, "num_tokens": 3952827.0, "step": 630 }, { "entropy": 2.0226389855146407, "epoch": 0.5547128927410617, "grad_norm": 4.191121578216553, "learning_rate": 1.9661192902409948e-05, "loss": 0.2217186450958252, "mean_token_accuracy": 0.9471737131476402, "num_tokens": 4009523.0, "step": 640 }, { "entropy": 2.0257292181253432, "epoch": 0.5633802816901409, "grad_norm": 2.6429009437561035, "learning_rate": 1.9646551234881537e-05, "loss": 0.1354218006134033, "mean_token_accuracy": 0.9583623319864273, "num_tokens": 4070329.0, "step": 650 }, { "entropy": 2.041917896270752, "epoch": 0.5720476706392199, "grad_norm": 3.2023017406463623, "learning_rate": 1.9631605538172968e-05, "loss": 0.199608314037323, "mean_token_accuracy": 0.9503273338079452, "num_tokens": 4132785.0, "step": 660 }, { "entropy": 1.9533647626638413, "epoch": 0.580715059588299, "grad_norm": 3.7158589363098145, "learning_rate": 1.961635628332595e-05, "loss": 0.19348444938659667, "mean_token_accuracy": 0.9558726295828819, "num_tokens": 4199572.0, "step": 670 }, { "entropy": 2.073412099480629, "epoch": 0.5893824485373781, "grad_norm": 2.194398880004883, "learning_rate": 1.9600803950949384e-05, "loss": 0.1255653142929077, "mean_token_accuracy": 0.9656689003109932, "num_tokens": 4261539.0, "step": 680 }, { "entropy": 2.062476450204849, "epoch": 0.5980498374864572, "grad_norm": 0.843501627445221, "learning_rate": 1.9584949031204237e-05, "loss": 0.13029239177703858, "mean_token_accuracy": 0.9725566118955612, "num_tokens": 4325121.0, "step": 690 }, { "entropy": 2.0155109763145447, "epoch": 0.6067172264355363, "grad_norm": 2.171780586242676, "learning_rate": 1.9568792023788083e-05, "loss": 0.18113304376602174, "mean_token_accuracy": 0.958047965168953, "num_tokens": 4383768.0, "step": 700 }, { "epoch": 0.6067172264355363, "eval_entropy": 1.9391062811239441, "eval_loss": 0.16046689450740814, "eval_mean_token_accuracy": 0.9575774969153144, "eval_num_tokens": 4383768.0, "eval_runtime": 327.4353, "eval_samples_per_second": 4.911, "eval_steps_per_second": 0.614, "step": 700 }, { "entropy": 1.9273906409740449, "epoch": 0.6153846153846154, "grad_norm": 4.4711174964904785, "learning_rate": 1.9552333437919357e-05, "loss": 0.1300251603126526, "mean_token_accuracy": 0.9623189747333527, "num_tokens": 4456736.0, "step": 710 }, { "entropy": 2.024830573797226, "epoch": 0.6240520043336945, "grad_norm": 4.07381534576416, "learning_rate": 1.9535573792321306e-05, "loss": 0.1988328814506531, "mean_token_accuracy": 0.9514750733971595, "num_tokens": 4518424.0, "step": 720 }, { "entropy": 2.0818196892738343, "epoch": 0.6327193932827736, "grad_norm": 1.8826876878738403, "learning_rate": 1.951851361520564e-05, "loss": 0.14210430383682252, "mean_token_accuracy": 0.9593353673815728, "num_tokens": 4577017.0, "step": 730 }, { "entropy": 2.029034098982811, "epoch": 0.6413867822318526, "grad_norm": 2.0174059867858887, "learning_rate": 1.9501153444255876e-05, "loss": 0.0932635486125946, "mean_token_accuracy": 0.9816406950354576, "num_tokens": 4640462.0, "step": 740 }, { "entropy": 2.059244655072689, "epoch": 0.6500541711809318, "grad_norm": 2.1351184844970703, "learning_rate": 1.9483493826610415e-05, "loss": 0.12800567150115966, "mean_token_accuracy": 0.9660168752074242, "num_tokens": 4705340.0, "step": 750 }, { "entropy": 2.0459042131900786, "epoch": 0.6587215601300108, "grad_norm": 5.086484909057617, "learning_rate": 1.946553531884527e-05, "loss": 0.23081181049346924, "mean_token_accuracy": 0.9424590915441513, "num_tokens": 4765177.0, "step": 760 }, { "entropy": 2.0461316615343095, "epoch": 0.66738894907909, "grad_norm": 3.3382718563079834, "learning_rate": 1.9447278486956544e-05, "loss": 0.14905912876129152, "mean_token_accuracy": 0.9569886341691017, "num_tokens": 4834296.0, "step": 770 }, { "entropy": 2.1199437886476518, "epoch": 0.676056338028169, "grad_norm": 2.4870541095733643, "learning_rate": 1.9428723906342586e-05, "loss": 0.15288684368133545, "mean_token_accuracy": 0.9573053807020188, "num_tokens": 4889171.0, "step": 780 }, { "entropy": 2.0783461153507234, "epoch": 0.6847237269772481, "grad_norm": 0.9525867700576782, "learning_rate": 1.9409872161785846e-05, "loss": 0.10859833955764771, "mean_token_accuracy": 0.9734508141875267, "num_tokens": 4947751.0, "step": 790 }, { "entropy": 1.9960304468870163, "epoch": 0.6933911159263272, "grad_norm": 1.0429903268814087, "learning_rate": 1.939072384743447e-05, "loss": 0.17450170516967772, "mean_token_accuracy": 0.9435808345675468, "num_tokens": 5014246.0, "step": 800 }, { "epoch": 0.6933911159263272, "eval_entropy": 1.9779095216770077, "eval_loss": 0.16052106022834778, "eval_mean_token_accuracy": 0.9521936910662485, "eval_num_tokens": 5014246.0, "eval_runtime": 327.7358, "eval_samples_per_second": 4.906, "eval_steps_per_second": 0.613, "step": 800 }, { "entropy": 2.094706800580025, "epoch": 0.7020585048754063, "grad_norm": 2.773972272872925, "learning_rate": 1.9371279566783546e-05, "loss": 0.16905949115753174, "mean_token_accuracy": 0.9590677320957184, "num_tokens": 5067941.0, "step": 810 }, { "entropy": 2.0422832757234572, "epoch": 0.7107258938244854, "grad_norm": 0.8871009349822998, "learning_rate": 1.9351539932656095e-05, "loss": 0.14554331302642823, "mean_token_accuracy": 0.9639958038926124, "num_tokens": 5121736.0, "step": 820 }, { "entropy": 2.066793379187584, "epoch": 0.7193932827735645, "grad_norm": 1.235823392868042, "learning_rate": 1.9331505567183765e-05, "loss": 0.1522287368774414, "mean_token_accuracy": 0.9607374981045723, "num_tokens": 5186693.0, "step": 830 }, { "entropy": 2.0238248884677885, "epoch": 0.7280606717226435, "grad_norm": 1.0951995849609375, "learning_rate": 1.9311177101787203e-05, "loss": 0.18216453790664672, "mean_token_accuracy": 0.9582652196288108, "num_tokens": 5245808.0, "step": 840 }, { "entropy": 2.0323809564113615, "epoch": 0.7367280606717227, "grad_norm": 4.650373935699463, "learning_rate": 1.929055517715619e-05, "loss": 0.1563056468963623, "mean_token_accuracy": 0.9584650948643685, "num_tokens": 5310692.0, "step": 850 }, { "entropy": 2.0072476893663405, "epoch": 0.7453954496208017, "grad_norm": 3.282588481903076, "learning_rate": 1.9269640443229406e-05, "loss": 0.1251569867134094, "mean_token_accuracy": 0.9650194570422173, "num_tokens": 5368216.0, "step": 860 }, { "entropy": 2.0677698493003844, "epoch": 0.7540628385698809, "grad_norm": 3.888256072998047, "learning_rate": 1.9248433559173974e-05, "loss": 0.14851419925689696, "mean_token_accuracy": 0.9558604061603546, "num_tokens": 5425337.0, "step": 870 }, { "entropy": 2.028371325135231, "epoch": 0.7627302275189599, "grad_norm": 4.474874496459961, "learning_rate": 1.9226935193364672e-05, "loss": 0.09598046541213989, "mean_token_accuracy": 0.9639655843377113, "num_tokens": 5493667.0, "step": 880 }, { "entropy": 2.077066546678543, "epoch": 0.771397616468039, "grad_norm": 4.779897689819336, "learning_rate": 1.920514602336288e-05, "loss": 0.1583351492881775, "mean_token_accuracy": 0.969876304268837, "num_tokens": 5554367.0, "step": 890 }, { "entropy": 2.10542468726635, "epoch": 0.7800650054171181, "grad_norm": 5.164394855499268, "learning_rate": 1.918306673589521e-05, "loss": 0.1434742331504822, "mean_token_accuracy": 0.9704080358147621, "num_tokens": 5611752.0, "step": 900 }, { "epoch": 0.7800650054171181, "eval_entropy": 1.9566984473176263, "eval_loss": 0.1484634131193161, "eval_mean_token_accuracy": 0.9622589533601827, "eval_num_tokens": 5611752.0, "eval_runtime": 327.9589, "eval_samples_per_second": 4.903, "eval_steps_per_second": 0.613, "step": 900 }, { "entropy": 2.017557808756828, "epoch": 0.7887323943661971, "grad_norm": 0.5321738123893738, "learning_rate": 1.916069802683188e-05, "loss": 0.14997100830078125, "mean_token_accuracy": 0.9603116348385811, "num_tokens": 5672084.0, "step": 910 }, { "entropy": 2.0164162307977676, "epoch": 0.7973997833152763, "grad_norm": 5.9305009841918945, "learning_rate": 1.913804060116477e-05, "loss": 0.1742601990699768, "mean_token_accuracy": 0.9420990094542503, "num_tokens": 5742156.0, "step": 920 }, { "entropy": 2.0990718007087708, "epoch": 0.8060671722643553, "grad_norm": 2.7394776344299316, "learning_rate": 1.91150951729852e-05, "loss": 0.10954513549804687, "mean_token_accuracy": 0.9662265390157699, "num_tokens": 5795887.0, "step": 930 }, { "entropy": 2.0060137644410134, "epoch": 0.8147345612134345, "grad_norm": 6.107972621917725, "learning_rate": 1.9091862465461435e-05, "loss": 0.15947246551513672, "mean_token_accuracy": 0.9661846026778221, "num_tokens": 5863543.0, "step": 940 }, { "entropy": 2.028472700715065, "epoch": 0.8234019501625135, "grad_norm": 3.5397908687591553, "learning_rate": 1.9068343210815895e-05, "loss": 0.11814491748809815, "mean_token_accuracy": 0.9662217140197754, "num_tokens": 5920612.0, "step": 950 }, { "entropy": 1.9094608053565025, "epoch": 0.8320693391115926, "grad_norm": 2.9836032390594482, "learning_rate": 1.9044538150302054e-05, "loss": 0.0739125669002533, "mean_token_accuracy": 0.9773468017578125, "num_tokens": 5992314.0, "step": 960 }, { "entropy": 2.031349629163742, "epoch": 0.8407367280606717, "grad_norm": 1.5363432168960571, "learning_rate": 1.902044803418111e-05, "loss": 0.10442560911178589, "mean_token_accuracy": 0.9752393007278443, "num_tokens": 6057639.0, "step": 970 }, { "entropy": 2.052021104097366, "epoch": 0.8494041170097508, "grad_norm": 1.9379785060882568, "learning_rate": 1.8996073621698316e-05, "loss": 0.13370474576950073, "mean_token_accuracy": 0.9722858428955078, "num_tokens": 6125691.0, "step": 980 }, { "entropy": 2.0630032390356066, "epoch": 0.8580715059588299, "grad_norm": 2.8717305660247803, "learning_rate": 1.8971415681059064e-05, "loss": 0.08845771551132202, "mean_token_accuracy": 0.9745254084467888, "num_tokens": 6180422.0, "step": 990 }, { "entropy": 1.9643850460648538, "epoch": 0.866738894907909, "grad_norm": 2.609376907348633, "learning_rate": 1.8946474989404662e-05, "loss": 0.11373393535614014, "mean_token_accuracy": 0.9662645876407623, "num_tokens": 6252953.0, "step": 1000 }, { "epoch": 0.866738894907909, "eval_entropy": 1.9493645275410134, "eval_loss": 0.1559806615114212, "eval_mean_token_accuracy": 0.9615354849331414, "eval_num_tokens": 6252953.0, "eval_runtime": 327.6765, "eval_samples_per_second": 4.907, "eval_steps_per_second": 0.613, "step": 1000 }, { "entropy": 1.9920239925384522, "epoch": 0.875406283856988, "grad_norm": 2.1242737770080566, "learning_rate": 1.892125233278785e-05, "loss": 0.24173307418823242, "mean_token_accuracy": 0.9527133107185364, "num_tokens": 6315662.0, "step": 1010 }, { "entropy": 2.032253223657608, "epoch": 0.8840736728060672, "grad_norm": 2.7001326084136963, "learning_rate": 1.8895748506148028e-05, "loss": 0.1353329300880432, "mean_token_accuracy": 0.967973954975605, "num_tokens": 6386699.0, "step": 1020 }, { "entropy": 2.0086484402418137, "epoch": 0.8927410617551462, "grad_norm": 1.1297107934951782, "learning_rate": 1.886996431328619e-05, "loss": 0.07529502511024475, "mean_token_accuracy": 0.9724522307515144, "num_tokens": 6446533.0, "step": 1030 }, { "entropy": 2.0415013134479523, "epoch": 0.9014084507042254, "grad_norm": 5.55093240737915, "learning_rate": 1.8843900566839606e-05, "loss": 0.08251296877861022, "mean_token_accuracy": 0.9786079153418541, "num_tokens": 6513718.0, "step": 1040 }, { "entropy": 1.9764947205781938, "epoch": 0.9100758396533044, "grad_norm": 1.4542205333709717, "learning_rate": 1.881755808825619e-05, "loss": 0.09182056784629822, "mean_token_accuracy": 0.9683352947235108, "num_tokens": 6589309.0, "step": 1050 }, { "entropy": 2.1108569860458375, "epoch": 0.9187432286023836, "grad_norm": 1.6818881034851074, "learning_rate": 1.879093770776864e-05, "loss": 0.10508890151977539, "mean_token_accuracy": 0.9706028968095779, "num_tokens": 6645154.0, "step": 1060 }, { "entropy": 2.0166300892829896, "epoch": 0.9274106175514626, "grad_norm": 1.3823227882385254, "learning_rate": 1.8764040264368234e-05, "loss": 0.09460273385047913, "mean_token_accuracy": 0.9628641813993454, "num_tokens": 6713987.0, "step": 1070 }, { "entropy": 2.1063819110393522, "epoch": 0.9360780065005417, "grad_norm": 6.772284507751465, "learning_rate": 1.8736866605778432e-05, "loss": 0.12469170093536378, "mean_token_accuracy": 0.9483507961034775, "num_tokens": 6772582.0, "step": 1080 }, { "entropy": 2.0919911056756972, "epoch": 0.9447453954496208, "grad_norm": 1.6543307304382324, "learning_rate": 1.870941758842811e-05, "loss": 0.09687562584877014, "mean_token_accuracy": 0.97865249812603, "num_tokens": 6830797.0, "step": 1090 }, { "entropy": 2.098991483449936, "epoch": 0.9534127843986999, "grad_norm": 2.7293362617492676, "learning_rate": 1.8681694077424613e-05, "loss": 0.08977670073509217, "mean_token_accuracy": 0.9780241951346398, "num_tokens": 6892230.0, "step": 1100 }, { "epoch": 0.9534127843986999, "eval_entropy": 2.0070505842047544, "eval_loss": 0.14140334725379944, "eval_mean_token_accuracy": 0.9657606870973882, "eval_num_tokens": 6892230.0, "eval_runtime": 327.6001, "eval_samples_per_second": 4.908, "eval_steps_per_second": 0.614, "step": 1100 }, { "entropy": 2.031548282504082, "epoch": 0.962080173347779, "grad_norm": 4.61448335647583, "learning_rate": 1.8653696946526453e-05, "loss": 0.21447787284851075, "mean_token_accuracy": 0.9273400843143463, "num_tokens": 6961253.0, "step": 1110 }, { "entropy": 2.145294892787933, "epoch": 0.9707475622968581, "grad_norm": 3.039484739303589, "learning_rate": 1.8625427078115798e-05, "loss": 0.0884899377822876, "mean_token_accuracy": 0.9799038738012313, "num_tokens": 7017065.0, "step": 1120 }, { "entropy": 2.107818600535393, "epoch": 0.9794149512459371, "grad_norm": 0.6422417759895325, "learning_rate": 1.8596885363170645e-05, "loss": 0.13402427434921266, "mean_token_accuracy": 0.9699044972658157, "num_tokens": 7075829.0, "step": 1130 }, { "entropy": 2.059667307138443, "epoch": 0.9880823401950163, "grad_norm": 2.9093730449676514, "learning_rate": 1.8568072701236747e-05, "loss": 0.16023958921432496, "mean_token_accuracy": 0.9600200474262237, "num_tokens": 7137365.0, "step": 1140 }, { "entropy": 2.160347416996956, "epoch": 0.9967497291440953, "grad_norm": 3.1662862300872803, "learning_rate": 1.8538990000399263e-05, "loss": 0.22539846897125243, "mean_token_accuracy": 0.9572510078549386, "num_tokens": 7196582.0, "step": 1150 }, { "entropy": 2.0696292229187794, "epoch": 1.0052004333694475, "grad_norm": 2.288025140762329, "learning_rate": 1.850963817725413e-05, "loss": 0.11503632068634033, "mean_token_accuracy": 0.9689550736011603, "num_tokens": 7256906.0, "step": 1160 }, { "entropy": 2.1042013496160505, "epoch": 1.0138678223185265, "grad_norm": 3.8589515686035156, "learning_rate": 1.8480018156879184e-05, "loss": 0.09237539768218994, "mean_token_accuracy": 0.9765888974070549, "num_tokens": 7314179.0, "step": 1170 }, { "entropy": 2.0591933131217957, "epoch": 1.0225352112676056, "grad_norm": 3.412147045135498, "learning_rate": 1.8450130872804995e-05, "loss": 0.0972133755683899, "mean_token_accuracy": 0.9700871393084526, "num_tokens": 7377659.0, "step": 1180 }, { "entropy": 2.0358568876981735, "epoch": 1.0312026002166848, "grad_norm": 1.8209773302078247, "learning_rate": 1.8419977266985466e-05, "loss": 0.10635190010070801, "mean_token_accuracy": 0.9710655510425568, "num_tokens": 7448951.0, "step": 1190 }, { "entropy": 2.139003211259842, "epoch": 1.039869989165764, "grad_norm": 0.22012463212013245, "learning_rate": 1.83895582897681e-05, "loss": 0.07087588906288148, "mean_token_accuracy": 0.9820687800645829, "num_tokens": 7507884.0, "step": 1200 }, { "epoch": 1.039869989165764, "eval_entropy": 1.998491422453923, "eval_loss": 0.11934716999530792, "eval_mean_token_accuracy": 0.9696379659780815, "eval_num_tokens": 7507884.0, "eval_runtime": 327.528, "eval_samples_per_second": 4.91, "eval_steps_per_second": 0.614, "step": 1200 }, { "entropy": 2.047052562236786, "epoch": 1.0485373781148428, "grad_norm": 2.6051576137542725, "learning_rate": 1.8358874899864114e-05, "loss": 0.08912789225578308, "mean_token_accuracy": 0.9771837398409844, "num_tokens": 7568084.0, "step": 1210 }, { "entropy": 2.047335183620453, "epoch": 1.057204767063922, "grad_norm": 3.3506662845611572, "learning_rate": 1.8327928064318157e-05, "loss": 0.0860203206539154, "mean_token_accuracy": 0.9751673907041549, "num_tokens": 7627314.0, "step": 1220 }, { "entropy": 2.1224594831466677, "epoch": 1.0658721560130011, "grad_norm": 4.894758224487305, "learning_rate": 1.8296718758477882e-05, "loss": 0.05694900751113892, "mean_token_accuracy": 0.971023240685463, "num_tokens": 7687861.0, "step": 1230 }, { "entropy": 1.9626843601465225, "epoch": 1.0745395449620803, "grad_norm": 2.579737901687622, "learning_rate": 1.826524796596318e-05, "loss": 0.10832076072692871, "mean_token_accuracy": 0.9784040197730064, "num_tokens": 7760668.0, "step": 1240 }, { "entropy": 1.968853595852852, "epoch": 1.0832069339111592, "grad_norm": 2.3511769771575928, "learning_rate": 1.823351667863518e-05, "loss": 0.15547066926956177, "mean_token_accuracy": 0.9642201095819474, "num_tokens": 7827206.0, "step": 1250 }, { "entropy": 2.056541362404823, "epoch": 1.0918743228602383, "grad_norm": 2.1804311275482178, "learning_rate": 1.8201525896565e-05, "loss": 0.10602462291717529, "mean_token_accuracy": 0.9716919779777526, "num_tokens": 7885020.0, "step": 1260 }, { "entropy": 1.9817122548818589, "epoch": 1.1005417118093175, "grad_norm": 0.2855832576751709, "learning_rate": 1.8169276628002228e-05, "loss": 0.1441387414932251, "mean_token_accuracy": 0.9583184272050858, "num_tokens": 7954015.0, "step": 1270 }, { "entropy": 2.0565784901380537, "epoch": 1.1092091007583966, "grad_norm": 4.35746955871582, "learning_rate": 1.8136769889343128e-05, "loss": 0.1163863182067871, "mean_token_accuracy": 0.9769072517752647, "num_tokens": 8017014.0, "step": 1280 }, { "entropy": 2.069455534219742, "epoch": 1.1178764897074756, "grad_norm": 3.1686489582061768, "learning_rate": 1.810400670509862e-05, "loss": 0.04684387743473053, "mean_token_accuracy": 0.9839098215103149, "num_tokens": 8073602.0, "step": 1290 }, { "entropy": 1.991150015592575, "epoch": 1.1265438786565547, "grad_norm": 5.245935440063477, "learning_rate": 1.8070988107861996e-05, "loss": 0.12618616819381714, "mean_token_accuracy": 0.9685941189527512, "num_tokens": 8136794.0, "step": 1300 }, { "epoch": 1.1265438786565547, "eval_entropy": 1.9715949030064825, "eval_loss": 0.12539811432361603, "eval_mean_token_accuracy": 0.964166374645423, "eval_num_tokens": 8136794.0, "eval_runtime": 327.6705, "eval_samples_per_second": 4.907, "eval_steps_per_second": 0.613, "step": 1300 }, { "entropy": 2.136713647842407, "epoch": 1.1352112676056338, "grad_norm": 2.6332850456237793, "learning_rate": 1.8037715138276356e-05, "loss": 0.08332991600036621, "mean_token_accuracy": 0.9834440797567368, "num_tokens": 8186732.0, "step": 1310 }, { "entropy": 2.0103059858083725, "epoch": 1.1438786565547128, "grad_norm": 2.718291997909546, "learning_rate": 1.8004188845001837e-05, "loss": 0.08337950706481934, "mean_token_accuracy": 0.9742418512701988, "num_tokens": 8251092.0, "step": 1320 }, { "entropy": 1.9932494521141053, "epoch": 1.152546045503792, "grad_norm": 3.646721601486206, "learning_rate": 1.797041028468254e-05, "loss": 0.15116094350814818, "mean_token_accuracy": 0.9642645418643951, "num_tokens": 8314924.0, "step": 1330 }, { "entropy": 2.081474080681801, "epoch": 1.161213434452871, "grad_norm": 0.9599646925926208, "learning_rate": 1.7936380521913227e-05, "loss": 0.04085415005683899, "mean_token_accuracy": 0.9839913368225097, "num_tokens": 8370143.0, "step": 1340 }, { "entropy": 1.983850082755089, "epoch": 1.1698808234019502, "grad_norm": 1.3555337190628052, "learning_rate": 1.7902100629205793e-05, "loss": 0.08805139660835266, "mean_token_accuracy": 0.9821525901556015, "num_tokens": 8440802.0, "step": 1350 }, { "entropy": 2.0713098883628844, "epoch": 1.1785482123510294, "grad_norm": 3.1760222911834717, "learning_rate": 1.7867571686955435e-05, "loss": 0.11011135578155518, "mean_token_accuracy": 0.9650946885347367, "num_tokens": 8503577.0, "step": 1360 }, { "entropy": 2.00400799959898, "epoch": 1.1872156013001083, "grad_norm": 1.7475781440734863, "learning_rate": 1.7832794783406627e-05, "loss": 0.09046050310134887, "mean_token_accuracy": 0.9751720637083053, "num_tokens": 8564681.0, "step": 1370 }, { "entropy": 2.052886575460434, "epoch": 1.1958829902491874, "grad_norm": 1.0036333799362183, "learning_rate": 1.7797771014618798e-05, "loss": 0.11622474193572999, "mean_token_accuracy": 0.9750452309846878, "num_tokens": 8626076.0, "step": 1380 }, { "entropy": 2.0878810614347456, "epoch": 1.2045503791982666, "grad_norm": 4.102039813995361, "learning_rate": 1.77625014844318e-05, "loss": 0.10430421829223632, "mean_token_accuracy": 0.9714325606822968, "num_tokens": 8684962.0, "step": 1390 }, { "entropy": 2.0384886085987093, "epoch": 1.2132177681473455, "grad_norm": 1.0469868183135986, "learning_rate": 1.7726987304431125e-05, "loss": 0.05419512987136841, "mean_token_accuracy": 0.982357631623745, "num_tokens": 8748790.0, "step": 1400 }, { "epoch": 1.2132177681473455, "eval_entropy": 1.9552279841247482, "eval_loss": 0.12215632200241089, "eval_mean_token_accuracy": 0.9683096506702367, "eval_num_tokens": 8748790.0, "eval_runtime": 327.5547, "eval_samples_per_second": 4.909, "eval_steps_per_second": 0.614, "step": 1400 }, { "entropy": 1.953641840815544, "epoch": 1.2218851570964246, "grad_norm": 0.5614034533500671, "learning_rate": 1.7691229593912855e-05, "loss": 0.05820891261100769, "mean_token_accuracy": 0.9764899387955666, "num_tokens": 8814421.0, "step": 1410 }, { "entropy": 2.0551287651062013, "epoch": 1.2305525460455038, "grad_norm": 2.177788734436035, "learning_rate": 1.7655229479848396e-05, "loss": 0.07185115218162537, "mean_token_accuracy": 0.9787142857909202, "num_tokens": 8868678.0, "step": 1420 }, { "entropy": 1.9916139125823975, "epoch": 1.239219934994583, "grad_norm": 2.7501561641693115, "learning_rate": 1.7618988096848957e-05, "loss": 0.0644925594329834, "mean_token_accuracy": 0.9745761170983315, "num_tokens": 8938006.0, "step": 1430 }, { "entropy": 1.9660134196281434, "epoch": 1.247887323943662, "grad_norm": 0.21380360424518585, "learning_rate": 1.7582506587129794e-05, "loss": 0.10330332517623901, "mean_token_accuracy": 0.9776182726025582, "num_tokens": 9008588.0, "step": 1440 }, { "entropy": 2.0498579114675524, "epoch": 1.256554712892741, "grad_norm": 0.8262104392051697, "learning_rate": 1.7545786100474197e-05, "loss": 0.07196399569511414, "mean_token_accuracy": 0.976461161673069, "num_tokens": 9071525.0, "step": 1450 }, { "entropy": 2.0368919670581818, "epoch": 1.2652221018418202, "grad_norm": 4.542933940887451, "learning_rate": 1.7508827794197283e-05, "loss": 0.1121648907661438, "mean_token_accuracy": 0.9739218279719353, "num_tokens": 9128401.0, "step": 1460 }, { "entropy": 2.028754585981369, "epoch": 1.2738894907908993, "grad_norm": 3.789047956466675, "learning_rate": 1.747163283310948e-05, "loss": 0.07412697076797485, "mean_token_accuracy": 0.9807208150625228, "num_tokens": 9197272.0, "step": 1470 }, { "entropy": 2.0691492050886153, "epoch": 1.2825568797399782, "grad_norm": 4.7594380378723145, "learning_rate": 1.7434202389479846e-05, "loss": 0.0705658733844757, "mean_token_accuracy": 0.9594802007079124, "num_tokens": 9257267.0, "step": 1480 }, { "entropy": 2.082161045074463, "epoch": 1.2912242686890574, "grad_norm": 2.5111472606658936, "learning_rate": 1.739653764299912e-05, "loss": 0.09044097065925598, "mean_token_accuracy": 0.9694541215896606, "num_tokens": 9319539.0, "step": 1490 }, { "entropy": 2.0065703094005585, "epoch": 1.2998916576381365, "grad_norm": 2.8309035301208496, "learning_rate": 1.7358639780742523e-05, "loss": 0.07192415595054627, "mean_token_accuracy": 0.9744586929678917, "num_tokens": 9374879.0, "step": 1500 }, { "epoch": 1.2998916576381365, "eval_entropy": 1.9755405430770039, "eval_loss": 0.11345293372869492, "eval_mean_token_accuracy": 0.9704583070764494, "eval_num_tokens": 9374879.0, "eval_runtime": 327.3007, "eval_samples_per_second": 4.913, "eval_steps_per_second": 0.614, "step": 1500 }, { "entropy": 2.0670559823513033, "epoch": 1.3085590465872157, "grad_norm": 0.36768296360969543, "learning_rate": 1.732050999713236e-05, "loss": 0.07674946188926697, "mean_token_accuracy": 0.9863375291228295, "num_tokens": 9434504.0, "step": 1510 }, { "entropy": 2.001679763197899, "epoch": 1.3172264355362948, "grad_norm": 1.7141518592834473, "learning_rate": 1.728214949390038e-05, "loss": 0.07157499194145203, "mean_token_accuracy": 0.9796392112970352, "num_tokens": 9491287.0, "step": 1520 }, { "entropy": 2.0744961857795716, "epoch": 1.3258938244853737, "grad_norm": 2.1506600379943848, "learning_rate": 1.7243559480049895e-05, "loss": 0.1661256194114685, "mean_token_accuracy": 0.9499395877122879, "num_tokens": 9547172.0, "step": 1530 }, { "entropy": 2.0488713175058364, "epoch": 1.3345612134344529, "grad_norm": 1.0758910179138184, "learning_rate": 1.7204741171817662e-05, "loss": 0.13161916732788087, "mean_token_accuracy": 0.9632299363613128, "num_tokens": 9609537.0, "step": 1540 }, { "entropy": 2.0280631333589554, "epoch": 1.343228602383532, "grad_norm": 7.010381698608398, "learning_rate": 1.716569579263558e-05, "loss": 0.12925589084625244, "mean_token_accuracy": 0.9689023286104202, "num_tokens": 9664019.0, "step": 1550 }, { "entropy": 2.079831117391586, "epoch": 1.351895991332611, "grad_norm": 4.380460262298584, "learning_rate": 1.7126424573092106e-05, "loss": 0.1093141794204712, "mean_token_accuracy": 0.9770100638270378, "num_tokens": 9724394.0, "step": 1560 }, { "entropy": 2.0715120315551756, "epoch": 1.36056338028169, "grad_norm": 1.3284443616867065, "learning_rate": 1.7086928750893475e-05, "loss": 0.061691224575042725, "mean_token_accuracy": 0.9804880693554878, "num_tokens": 9785387.0, "step": 1570 }, { "entropy": 2.0884166300296783, "epoch": 1.3692307692307693, "grad_norm": 5.367604732513428, "learning_rate": 1.7047209570824715e-05, "loss": 0.11438063383102418, "mean_token_accuracy": 0.9706978917121887, "num_tokens": 9851203.0, "step": 1580 }, { "entropy": 2.0226283043622972, "epoch": 1.3778981581798484, "grad_norm": 3.4851460456848145, "learning_rate": 1.7007268284710384e-05, "loss": 0.07323808670043945, "mean_token_accuracy": 0.9414705485105515, "num_tokens": 9917487.0, "step": 1590 }, { "entropy": 2.0937221944332123, "epoch": 1.3865655471289275, "grad_norm": 3.1039235591888428, "learning_rate": 1.6967106151375127e-05, "loss": 0.08786031603813171, "mean_token_accuracy": 0.9706021770834923, "num_tokens": 9975291.0, "step": 1600 }, { "epoch": 1.3865655471289275, "eval_entropy": 1.9869690884405107, "eval_loss": 0.10875136405229568, "eval_mean_token_accuracy": 0.9710013614365117, "eval_num_tokens": 9975291.0, "eval_runtime": 327.3446, "eval_samples_per_second": 4.912, "eval_steps_per_second": 0.614, "step": 1600 }, { "entropy": 2.1072473585605622, "epoch": 1.3952329360780065, "grad_norm": 0.9677545428276062, "learning_rate": 1.692672443660401e-05, "loss": 0.055405884981155396, "mean_token_accuracy": 0.9801833376288414, "num_tokens": 10027147.0, "step": 1610 }, { "entropy": 2.044584667682648, "epoch": 1.4039003250270856, "grad_norm": 0.11175656318664551, "learning_rate": 1.6886124413102613e-05, "loss": 0.07465912699699402, "mean_token_accuracy": 0.9422569587826729, "num_tokens": 10092663.0, "step": 1620 }, { "entropy": 2.1110137164592744, "epoch": 1.4125677139761648, "grad_norm": 2.970170259475708, "learning_rate": 1.684530736045694e-05, "loss": 0.0848125159740448, "mean_token_accuracy": 0.9740940272808075, "num_tokens": 10154170.0, "step": 1630 }, { "entropy": 1.990675364434719, "epoch": 1.4212351029252437, "grad_norm": 0.8938102126121521, "learning_rate": 1.680427456509306e-05, "loss": 0.04920684993267059, "mean_token_accuracy": 0.9847660586237907, "num_tokens": 10227250.0, "step": 1640 }, { "entropy": 1.9731363147497176, "epoch": 1.4299024918743228, "grad_norm": 1.0118954181671143, "learning_rate": 1.676302732023659e-05, "loss": 0.13038522005081177, "mean_token_accuracy": 0.9758126527070999, "num_tokens": 10292153.0, "step": 1650 }, { "entropy": 2.043409901857376, "epoch": 1.438569880823402, "grad_norm": 1.6107861995697021, "learning_rate": 1.672156692587192e-05, "loss": 0.11529507637023925, "mean_token_accuracy": 0.9792997568845749, "num_tokens": 10348745.0, "step": 1660 }, { "entropy": 1.9989187628030778, "epoch": 1.4472372697724811, "grad_norm": 3.2114312648773193, "learning_rate": 1.667989468870125e-05, "loss": 0.06816362738609313, "mean_token_accuracy": 0.9801637664437294, "num_tokens": 10413882.0, "step": 1670 }, { "entropy": 2.130072697997093, "epoch": 1.45590465872156, "grad_norm": 2.18566632270813, "learning_rate": 1.6638011922103396e-05, "loss": 0.051083773374557495, "mean_token_accuracy": 0.9857296943664551, "num_tokens": 10463260.0, "step": 1680 }, { "entropy": 1.926492241024971, "epoch": 1.4645720476706392, "grad_norm": 3.8177168369293213, "learning_rate": 1.659591994609242e-05, "loss": 0.09213488101959229, "mean_token_accuracy": 0.9710013046860695, "num_tokens": 10540571.0, "step": 1690 }, { "entropy": 2.016107204556465, "epoch": 1.4732394366197183, "grad_norm": 2.7653048038482666, "learning_rate": 1.6553620087275996e-05, "loss": 0.09522730708122254, "mean_token_accuracy": 0.9786510393023491, "num_tokens": 10606926.0, "step": 1700 }, { "epoch": 1.4732394366197183, "eval_entropy": 1.9856633511348742, "eval_loss": 0.10925532877445221, "eval_mean_token_accuracy": 0.9715426552354993, "eval_num_tokens": 10606926.0, "eval_runtime": 327.2982, "eval_samples_per_second": 4.913, "eval_steps_per_second": 0.614, "step": 1700 }, { "entropy": 2.0318871945142747, "epoch": 1.4819068255687973, "grad_norm": 2.5777456760406494, "learning_rate": 1.6511113678813628e-05, "loss": 0.09499718546867371, "mean_token_accuracy": 0.9737421438097954, "num_tokens": 10669193.0, "step": 1710 }, { "entropy": 2.0573316484689714, "epoch": 1.4905742145178764, "grad_norm": 2.01214337348938, "learning_rate": 1.6468402060374603e-05, "loss": 0.06001516580581665, "mean_token_accuracy": 0.9805633515119553, "num_tokens": 10726268.0, "step": 1720 }, { "entropy": 2.0403822153806686, "epoch": 1.4992416034669556, "grad_norm": 2.346749782562256, "learning_rate": 1.6425486578095808e-05, "loss": 0.07113800644874572, "mean_token_accuracy": 0.9750549405813217, "num_tokens": 10790790.0, "step": 1730 }, { "entropy": 2.0111173152923585, "epoch": 1.5079089924160347, "grad_norm": 1.508115291595459, "learning_rate": 1.6382368584539263e-05, "loss": 0.08907117843627929, "mean_token_accuracy": 0.9684910327196121, "num_tokens": 10856645.0, "step": 1740 }, { "entropy": 2.0451995551586153, "epoch": 1.5165763813651139, "grad_norm": 1.8610405921936035, "learning_rate": 1.6339049438649518e-05, "loss": 0.04824534356594086, "mean_token_accuracy": 0.9889178365468979, "num_tokens": 10920009.0, "step": 1750 }, { "entropy": 2.0435550212860107, "epoch": 1.525243770314193, "grad_norm": 4.985892295837402, "learning_rate": 1.629553050571082e-05, "loss": 0.15718719959259034, "mean_token_accuracy": 0.9681286260485649, "num_tokens": 10981763.0, "step": 1760 }, { "entropy": 2.008193162083626, "epoch": 1.533911159263272, "grad_norm": 5.671135425567627, "learning_rate": 1.6251813157304082e-05, "loss": 0.03475911319255829, "mean_token_accuracy": 0.9917748674750329, "num_tokens": 11043295.0, "step": 1770 }, { "entropy": 1.9626969277858735, "epoch": 1.542578548212351, "grad_norm": 2.032866954803467, "learning_rate": 1.6207898771263637e-05, "loss": 0.08077131509780884, "mean_token_accuracy": 0.9529249399900437, "num_tokens": 11118730.0, "step": 1780 }, { "entropy": 1.9946265429258347, "epoch": 1.55124593716143, "grad_norm": 1.789146065711975, "learning_rate": 1.6163788731633846e-05, "loss": 0.04848654270172119, "mean_token_accuracy": 0.9804087817668915, "num_tokens": 11178215.0, "step": 1790 }, { "entropy": 2.029254746437073, "epoch": 1.5599133261105091, "grad_norm": 4.151276111602783, "learning_rate": 1.6119484428625458e-05, "loss": 0.0900123655796051, "mean_token_accuracy": 0.9751652166247368, "num_tokens": 11233012.0, "step": 1800 }, { "epoch": 1.5599133261105091, "eval_entropy": 1.9374866355117875, "eval_loss": 0.1022234857082367, "eval_mean_token_accuracy": 0.9733626513338801, "eval_num_tokens": 11233012.0, "eval_runtime": 327.2254, "eval_samples_per_second": 4.914, "eval_steps_per_second": 0.614, "step": 1800 }, { "entropy": 1.946454071998596, "epoch": 1.5685807150595883, "grad_norm": 3.786501884460449, "learning_rate": 1.6074987258571785e-05, "loss": 0.07075926065444946, "mean_token_accuracy": 0.9727453231811524, "num_tokens": 11305803.0, "step": 1810 }, { "entropy": 2.043697011470795, "epoch": 1.5772481040086674, "grad_norm": 2.9145822525024414, "learning_rate": 1.6030298623884725e-05, "loss": 0.10216034650802612, "mean_token_accuracy": 0.9663027971982956, "num_tokens": 11369379.0, "step": 1820 }, { "entropy": 2.047376683354378, "epoch": 1.5859154929577466, "grad_norm": 4.711336135864258, "learning_rate": 1.598541993301053e-05, "loss": 0.09091570377349853, "mean_token_accuracy": 0.9761122927069664, "num_tokens": 11428198.0, "step": 1830 }, { "entropy": 2.036109083890915, "epoch": 1.5945828819068257, "grad_norm": 1.2843303680419922, "learning_rate": 1.594035260038543e-05, "loss": 0.10113109350204467, "mean_token_accuracy": 0.9779675856232644, "num_tokens": 11482298.0, "step": 1840 }, { "entropy": 2.017902082204819, "epoch": 1.6032502708559047, "grad_norm": 0.7417038083076477, "learning_rate": 1.5895098046391057e-05, "loss": 0.05627822279930115, "mean_token_accuracy": 0.9855908393859864, "num_tokens": 11540418.0, "step": 1850 }, { "entropy": 2.0214678078889845, "epoch": 1.6119176598049836, "grad_norm": 3.1506597995758057, "learning_rate": 1.5849657697309683e-05, "loss": 0.10502588748931885, "mean_token_accuracy": 0.9502844616770745, "num_tokens": 11607357.0, "step": 1860 }, { "entropy": 2.0340816736221314, "epoch": 1.6205850487540627, "grad_norm": 1.0242708921432495, "learning_rate": 1.5804032985279252e-05, "loss": 0.08334928750991821, "mean_token_accuracy": 0.9770424932241439, "num_tokens": 11663906.0, "step": 1870 }, { "entropy": 2.0508361369371415, "epoch": 1.6292524377031419, "grad_norm": 1.4971176385879517, "learning_rate": 1.575822534824825e-05, "loss": 0.09026987552642822, "mean_token_accuracy": 0.9807920411229134, "num_tokens": 11726502.0, "step": 1880 }, { "entropy": 2.1219515979290007, "epoch": 1.637919826652221, "grad_norm": 1.5746535062789917, "learning_rate": 1.5712236229930397e-05, "loss": 0.04556220769882202, "mean_token_accuracy": 0.9804752409458161, "num_tokens": 11779127.0, "step": 1890 }, { "entropy": 2.0381762087345123, "epoch": 1.6465872156013002, "grad_norm": 0.9404705762863159, "learning_rate": 1.5666067079759135e-05, "loss": 0.07731429934501648, "mean_token_accuracy": 0.9713137298822403, "num_tokens": 11847516.0, "step": 1900 }, { "epoch": 1.6465872156013002, "eval_entropy": 1.963913416388023, "eval_loss": 0.10304063558578491, "eval_mean_token_accuracy": 0.9715078390059779, "eval_num_tokens": 11847516.0, "eval_runtime": 327.2028, "eval_samples_per_second": 4.914, "eval_steps_per_second": 0.614, "step": 1900 }, { "entropy": 2.063380944728851, "epoch": 1.6552546045503793, "grad_norm": 0.5977736115455627, "learning_rate": 1.5619719352841943e-05, "loss": 0.052711588144302365, "mean_token_accuracy": 0.9829199954867363, "num_tokens": 11910897.0, "step": 1910 }, { "entropy": 2.004588797688484, "epoch": 1.6639219934994582, "grad_norm": 4.725104331970215, "learning_rate": 1.5573194509914487e-05, "loss": 0.09926276803016662, "mean_token_accuracy": 0.974181592464447, "num_tokens": 11970477.0, "step": 1920 }, { "entropy": 1.9811932653188706, "epoch": 1.6725893824485374, "grad_norm": 2.943774938583374, "learning_rate": 1.552649401729457e-05, "loss": 0.10009403228759765, "mean_token_accuracy": 0.976198148727417, "num_tokens": 12037070.0, "step": 1930 }, { "entropy": 2.004721650481224, "epoch": 1.6812567713976163, "grad_norm": 2.643268346786499, "learning_rate": 1.547961934683593e-05, "loss": 0.07603888511657715, "mean_token_accuracy": 0.9785078406333924, "num_tokens": 12105290.0, "step": 1940 }, { "entropy": 2.0851855903863905, "epoch": 1.6899241603466955, "grad_norm": 7.968814373016357, "learning_rate": 1.543257197588185e-05, "loss": 0.06787392497062683, "mean_token_accuracy": 0.9741996258497239, "num_tokens": 12162023.0, "step": 1950 }, { "entropy": 2.070946404337883, "epoch": 1.6985915492957746, "grad_norm": 2.098217010498047, "learning_rate": 1.5385353387218582e-05, "loss": 0.09096076488494872, "mean_token_accuracy": 0.9812888115644455, "num_tokens": 12215829.0, "step": 1960 }, { "entropy": 1.9490791618824006, "epoch": 1.7072589382448538, "grad_norm": 1.2963298559188843, "learning_rate": 1.533796506902864e-05, "loss": 0.06780060529708862, "mean_token_accuracy": 0.9537896811962128, "num_tokens": 12288764.0, "step": 1970 }, { "entropy": 2.0761090010404586, "epoch": 1.715926327193933, "grad_norm": 2.5760719776153564, "learning_rate": 1.529040851484387e-05, "loss": 0.08884007334709168, "mean_token_accuracy": 0.975817295908928, "num_tokens": 12346057.0, "step": 1980 }, { "entropy": 2.0713831394910813, "epoch": 1.724593716143012, "grad_norm": 0.34983646869659424, "learning_rate": 1.5242685223498403e-05, "loss": 0.057441574335098264, "mean_token_accuracy": 0.9883616760373115, "num_tokens": 12404753.0, "step": 1990 }, { "entropy": 2.030237454175949, "epoch": 1.733261105092091, "grad_norm": 2.676185131072998, "learning_rate": 1.5194796699081394e-05, "loss": 0.05204044580459595, "mean_token_accuracy": 0.9582399621605873, "num_tokens": 12475078.0, "step": 2000 }, { "epoch": 1.733261105092091, "eval_entropy": 1.9605983175448518, "eval_loss": 0.09823993593454361, "eval_mean_token_accuracy": 0.9746547498513217, "eval_num_tokens": 12475078.0, "eval_runtime": 327.1063, "eval_samples_per_second": 4.916, "eval_steps_per_second": 0.614, "step": 2000 }, { "entropy": 2.0148254886269568, "epoch": 1.7419284940411701, "grad_norm": 3.1089882850646973, "learning_rate": 1.5146744450889635e-05, "loss": 0.06166669726371765, "mean_token_accuracy": 0.9789237439632416, "num_tokens": 12540081.0, "step": 2010 }, { "entropy": 2.031914421916008, "epoch": 1.750595882990249, "grad_norm": 0.7440986633300781, "learning_rate": 1.5098529993379973e-05, "loss": 0.027508893609046937, "mean_token_accuracy": 0.9933552041649818, "num_tokens": 12602793.0, "step": 2020 }, { "entropy": 2.0226054787635803, "epoch": 1.7592632719393282, "grad_norm": 2.497187376022339, "learning_rate": 1.5050154846121605e-05, "loss": 0.058700060844421385, "mean_token_accuracy": 0.9858224302530288, "num_tokens": 12660572.0, "step": 2030 }, { "entropy": 2.0026369482278823, "epoch": 1.7679306608884073, "grad_norm": 1.8420461416244507, "learning_rate": 1.500162053374814e-05, "loss": 0.10361694097518921, "mean_token_accuracy": 0.9768809288740158, "num_tokens": 12726774.0, "step": 2040 }, { "entropy": 1.9514106661081314, "epoch": 1.7765980498374865, "grad_norm": 1.7856649160385132, "learning_rate": 1.49529285859096e-05, "loss": 0.0996538519859314, "mean_token_accuracy": 0.9810873970389367, "num_tokens": 12792642.0, "step": 2050 }, { "entropy": 1.9771569460630416, "epoch": 1.7852654387865656, "grad_norm": 6.652771472930908, "learning_rate": 1.4904080537224167e-05, "loss": 0.08169901967048646, "mean_token_accuracy": 0.9733238250017167, "num_tokens": 12855661.0, "step": 2060 }, { "entropy": 2.0079775601625443, "epoch": 1.7939328277356448, "grad_norm": 0.9024977684020996, "learning_rate": 1.4855077927229844e-05, "loss": 0.07566041350364686, "mean_token_accuracy": 0.9776167094707489, "num_tokens": 12922735.0, "step": 2070 }, { "entropy": 2.0247191548347474, "epoch": 1.8026002166847237, "grad_norm": 2.8540401458740234, "learning_rate": 1.480592230033592e-05, "loss": 0.05470334887504578, "mean_token_accuracy": 0.9820770204067231, "num_tokens": 12991183.0, "step": 2080 }, { "entropy": 1.9862486839294433, "epoch": 1.8112676056338028, "grad_norm": 1.2073887586593628, "learning_rate": 1.4756615205774298e-05, "loss": 0.05954342484474182, "mean_token_accuracy": 0.9859064787626266, "num_tokens": 13057025.0, "step": 2090 }, { "entropy": 2.0485371172428133, "epoch": 1.8199349945828818, "grad_norm": 2.339723825454712, "learning_rate": 1.4707158197550672e-05, "loss": 0.09820868968963622, "mean_token_accuracy": 0.9744172319769859, "num_tokens": 13117982.0, "step": 2100 }, { "epoch": 1.8199349945828818, "eval_entropy": 1.9775383715605854, "eval_loss": 0.09860693663358688, "eval_mean_token_accuracy": 0.9749452092161226, "eval_num_tokens": 13117982.0, "eval_runtime": 326.8903, "eval_samples_per_second": 4.919, "eval_steps_per_second": 0.615, "step": 2100 }, { "entropy": 2.0403252631425857, "epoch": 1.828602383531961, "grad_norm": 1.2614986896514893, "learning_rate": 1.4657552834395548e-05, "loss": 0.041930514574050906, "mean_token_accuracy": 0.9876840353012085, "num_tokens": 13182491.0, "step": 2110 }, { "entropy": 2.0170107007026674, "epoch": 1.83726977248104, "grad_norm": 2.0214993953704834, "learning_rate": 1.460780067971511e-05, "loss": 0.057864248752593994, "mean_token_accuracy": 0.9776172533631324, "num_tokens": 13249716.0, "step": 2120 }, { "entropy": 2.079446019232273, "epoch": 1.8459371614301192, "grad_norm": 3.712702751159668, "learning_rate": 1.4557903301541959e-05, "loss": 0.09157460927963257, "mean_token_accuracy": 0.9703296691179275, "num_tokens": 13303975.0, "step": 2130 }, { "entropy": 2.059545102715492, "epoch": 1.8546045503791984, "grad_norm": 4.248321056365967, "learning_rate": 1.4507862272485683e-05, "loss": 0.0807805061340332, "mean_token_accuracy": 0.9754011020064354, "num_tokens": 13367842.0, "step": 2140 }, { "entropy": 2.082644584774971, "epoch": 1.8632719393282775, "grad_norm": 2.45220947265625, "learning_rate": 1.4457679169683298e-05, "loss": 0.08419224619865417, "mean_token_accuracy": 0.9753760308027267, "num_tokens": 13423576.0, "step": 2150 }, { "entropy": 2.034376582503319, "epoch": 1.8719393282773564, "grad_norm": 1.8660109043121338, "learning_rate": 1.4407355574749545e-05, "loss": 0.033074367046356204, "mean_token_accuracy": 0.9912351056933403, "num_tokens": 13493594.0, "step": 2160 }, { "entropy": 2.034354430437088, "epoch": 1.8806067172264356, "grad_norm": 0.5296902060508728, "learning_rate": 1.4356893073727032e-05, "loss": 0.05761660933494568, "mean_token_accuracy": 0.9903651595115661, "num_tokens": 13554020.0, "step": 2170 }, { "entropy": 2.0224443942308428, "epoch": 1.8892741061755145, "grad_norm": 0.6507072448730469, "learning_rate": 1.430629325703626e-05, "loss": 0.04348507225513458, "mean_token_accuracy": 0.9905618682503701, "num_tokens": 13629040.0, "step": 2180 }, { "entropy": 2.132373425364494, "epoch": 1.8979414951245936, "grad_norm": 3.952540159225464, "learning_rate": 1.4255557719425484e-05, "loss": 0.06843092441558837, "mean_token_accuracy": 0.9867907360196113, "num_tokens": 13687505.0, "step": 2190 }, { "entropy": 2.068184557557106, "epoch": 1.9066088840736728, "grad_norm": 1.1742056608200073, "learning_rate": 1.4204688059920466e-05, "loss": 0.03711756467819214, "mean_token_accuracy": 0.9907965555787086, "num_tokens": 13747230.0, "step": 2200 }, { "epoch": 1.9066088840736728, "eval_entropy": 1.9698931809088485, "eval_loss": 0.09713288396596909, "eval_mean_token_accuracy": 0.9762651187863516, "eval_num_tokens": 13747230.0, "eval_runtime": 326.9491, "eval_samples_per_second": 4.918, "eval_steps_per_second": 0.615, "step": 2200 }, { "entropy": 2.0157451212406157, "epoch": 1.915276273022752, "grad_norm": 2.843444347381592, "learning_rate": 1.4153685881774065e-05, "loss": 0.06452680230140687, "mean_token_accuracy": 0.9809629857540131, "num_tokens": 13809551.0, "step": 2210 }, { "entropy": 2.0150688737630844, "epoch": 1.923943661971831, "grad_norm": 1.5688871145248413, "learning_rate": 1.410255279241572e-05, "loss": 0.06514147520065308, "mean_token_accuracy": 0.9764496192336083, "num_tokens": 13871049.0, "step": 2220 }, { "entropy": 2.05910687148571, "epoch": 1.9326110509209102, "grad_norm": 2.9402899742126465, "learning_rate": 1.4051290403400772e-05, "loss": 0.07682484984397889, "mean_token_accuracy": 0.9753732204437255, "num_tokens": 13937668.0, "step": 2230 }, { "entropy": 2.0290389508008957, "epoch": 1.9412784398699892, "grad_norm": 0.7047325372695923, "learning_rate": 1.39999003303597e-05, "loss": 0.09054968953132629, "mean_token_accuracy": 0.9820921018719673, "num_tokens": 14007185.0, "step": 2240 }, { "entropy": 2.0927363365888594, "epoch": 1.9499458288190683, "grad_norm": 1.0138620138168335, "learning_rate": 1.3948384192947173e-05, "loss": 0.047953012585639956, "mean_token_accuracy": 0.9867767512798309, "num_tokens": 14067263.0, "step": 2250 }, { "entropy": 2.1822646766901017, "epoch": 1.9586132177681472, "grad_norm": 4.334517955780029, "learning_rate": 1.3896743614791016e-05, "loss": 0.10968102216720581, "mean_token_accuracy": 0.9781262248754501, "num_tokens": 14123634.0, "step": 2260 }, { "entropy": 2.044449067115784, "epoch": 1.9672806067172264, "grad_norm": 2.7011852264404297, "learning_rate": 1.384498022344104e-05, "loss": 0.07374554872512817, "mean_token_accuracy": 0.9758610785007477, "num_tokens": 14197541.0, "step": 2270 }, { "entropy": 2.0185159176588057, "epoch": 1.9759479956663055, "grad_norm": 1.0546622276306152, "learning_rate": 1.3793095650317748e-05, "loss": 0.08815826773643494, "mean_token_accuracy": 0.9640801548957825, "num_tokens": 14262081.0, "step": 2280 }, { "entropy": 2.065139350295067, "epoch": 1.9846153846153847, "grad_norm": 3.3348946571350098, "learning_rate": 1.3741091530660908e-05, "loss": 0.11671607494354248, "mean_token_accuracy": 0.9726112186908722, "num_tokens": 14320462.0, "step": 2290 }, { "entropy": 2.0409906804561615, "epoch": 1.9932827735644638, "grad_norm": 2.707357168197632, "learning_rate": 1.3688969503478023e-05, "loss": 0.0402547687292099, "mean_token_accuracy": 0.9851001650094986, "num_tokens": 14385759.0, "step": 2300 }, { "epoch": 1.9932827735644638, "eval_entropy": 1.9840727985201783, "eval_loss": 0.09598784148693085, "eval_mean_token_accuracy": 0.9754515447426791, "eval_num_tokens": 14385759.0, "eval_runtime": 327.2061, "eval_samples_per_second": 4.914, "eval_steps_per_second": 0.614, "step": 2300 }, { "entropy": 2.040311214251396, "epoch": 2.001733477789816, "grad_norm": 0.23833799362182617, "learning_rate": 1.363673121149268e-05, "loss": 0.05946453809738159, "mean_token_accuracy": 0.9876417364829626, "num_tokens": 14447731.0, "step": 2310 }, { "entropy": 2.1271281450986863, "epoch": 2.010400866738895, "grad_norm": 0.5396865010261536, "learning_rate": 1.3584378301092755e-05, "loss": 0.0464493989944458, "mean_token_accuracy": 0.9894088357686996, "num_tokens": 14502292.0, "step": 2320 }, { "entropy": 2.043173521757126, "epoch": 2.019068255687974, "grad_norm": 2.565701484680176, "learning_rate": 1.3531912422278556e-05, "loss": 0.05969124436378479, "mean_token_accuracy": 0.98280628323555, "num_tokens": 14564518.0, "step": 2330 }, { "entropy": 2.0714380711317064, "epoch": 2.027735644637053, "grad_norm": 0.9354483485221863, "learning_rate": 1.347933522861079e-05, "loss": 0.03992786407470703, "mean_token_accuracy": 0.9823066785931587, "num_tokens": 14627721.0, "step": 2340 }, { "entropy": 2.019579991698265, "epoch": 2.036403033586132, "grad_norm": 1.2636523246765137, "learning_rate": 1.3426648377158468e-05, "loss": 0.029606398940086365, "mean_token_accuracy": 0.9911484852433204, "num_tokens": 14693612.0, "step": 2350 }, { "entropy": 1.9572718054056168, "epoch": 2.045070422535211, "grad_norm": 0.8804156184196472, "learning_rate": 1.3373853528446665e-05, "loss": 0.05862312912940979, "mean_token_accuracy": 0.9830553591251373, "num_tokens": 14763334.0, "step": 2360 }, { "entropy": 2.078517937660217, "epoch": 2.0537378114842904, "grad_norm": 3.8558311462402344, "learning_rate": 1.33209523464042e-05, "loss": 0.035841697454452516, "mean_token_accuracy": 0.9903575092554092, "num_tokens": 14828861.0, "step": 2370 }, { "entropy": 2.01448016166687, "epoch": 2.0624052004333695, "grad_norm": 1.981359601020813, "learning_rate": 1.3267946498311182e-05, "loss": 0.09111757278442383, "mean_token_accuracy": 0.9801735639572143, "num_tokens": 14889109.0, "step": 2380 }, { "entropy": 2.0431691616773606, "epoch": 2.0710725893824486, "grad_norm": 2.930243730545044, "learning_rate": 1.3214837654746469e-05, "loss": 0.03293420076370239, "mean_token_accuracy": 0.987665319442749, "num_tokens": 14953334.0, "step": 2390 }, { "entropy": 2.0081345975399016, "epoch": 2.079739978331528, "grad_norm": 1.702090859413147, "learning_rate": 1.3161627489535011e-05, "loss": 0.04024830460548401, "mean_token_accuracy": 0.9895202398300171, "num_tokens": 15018476.0, "step": 2400 }, { "epoch": 2.079739978331528, "eval_entropy": 1.946521015902657, "eval_loss": 0.09423359483480453, "eval_mean_token_accuracy": 0.9767867083573223, "eval_num_tokens": 15018476.0, "eval_runtime": 327.2195, "eval_samples_per_second": 4.914, "eval_steps_per_second": 0.614, "step": 2400 }, { "entropy": 2.0467382192611696, "epoch": 2.088407367280607, "grad_norm": 0.7274250388145447, "learning_rate": 1.3108317679695106e-05, "loss": 0.05358461737632751, "mean_token_accuracy": 0.9765512838959693, "num_tokens": 15072387.0, "step": 2410 }, { "entropy": 2.027843546867371, "epoch": 2.0970747562296856, "grad_norm": 0.24272002279758453, "learning_rate": 1.3054909905385537e-05, "loss": 0.06842284202575684, "mean_token_accuracy": 0.9816409394145011, "num_tokens": 15127558.0, "step": 2420 }, { "entropy": 1.9965551286935805, "epoch": 2.105742145178765, "grad_norm": 0.11100158095359802, "learning_rate": 1.300140584985262e-05, "loss": 0.03788530230522156, "mean_token_accuracy": 0.9869873493909835, "num_tokens": 15194555.0, "step": 2430 }, { "entropy": 2.0039819896221163, "epoch": 2.114409534127844, "grad_norm": 5.010103702545166, "learning_rate": 1.2947807199377155e-05, "loss": 0.061254572868347165, "mean_token_accuracy": 0.9877008363604546, "num_tokens": 15259864.0, "step": 2440 }, { "entropy": 2.015304672718048, "epoch": 2.123076923076923, "grad_norm": 3.253303050994873, "learning_rate": 1.2894115643221279e-05, "loss": 0.04881041347980499, "mean_token_accuracy": 0.9881685748696327, "num_tokens": 15320656.0, "step": 2450 }, { "entropy": 1.986794075369835, "epoch": 2.1317443120260022, "grad_norm": 0.5272015333175659, "learning_rate": 1.2840332873575232e-05, "loss": 0.03953333795070648, "mean_token_accuracy": 0.9862592309713364, "num_tokens": 15390635.0, "step": 2460 }, { "entropy": 2.047020471096039, "epoch": 2.1404117009750814, "grad_norm": 0.8474643230438232, "learning_rate": 1.2786460585504006e-05, "loss": 0.051943039894104, "mean_token_accuracy": 0.9837918564677238, "num_tokens": 15447303.0, "step": 2470 }, { "entropy": 2.080169880390167, "epoch": 2.1490790899241605, "grad_norm": 1.2162392139434814, "learning_rate": 1.2732500476893948e-05, "loss": 0.031473752856254575, "mean_token_accuracy": 0.9859877333045006, "num_tokens": 15503176.0, "step": 2480 }, { "entropy": 1.9437969148159027, "epoch": 2.1577464788732392, "grad_norm": 1.1037133932113647, "learning_rate": 1.2678454248399222e-05, "loss": 0.03166500329971313, "mean_token_accuracy": 0.9836494714021683, "num_tokens": 15574501.0, "step": 2490 }, { "entropy": 2.107138791680336, "epoch": 2.1664138678223184, "grad_norm": 2.0166468620300293, "learning_rate": 1.2624323603388231e-05, "loss": 0.064914870262146, "mean_token_accuracy": 0.9847393244504928, "num_tokens": 15625012.0, "step": 2500 }, { "epoch": 2.1664138678223184, "eval_entropy": 1.9424105657273858, "eval_loss": 0.09450376033782959, "eval_mean_token_accuracy": 0.9763566433493771, "eval_num_tokens": 15625012.0, "eval_runtime": 327.0207, "eval_samples_per_second": 4.917, "eval_steps_per_second": 0.615, "step": 2500 }, { "entropy": 1.9914342880249023, "epoch": 2.1750812567713975, "grad_norm": 1.1817911863327026, "learning_rate": 1.2570110247889919e-05, "loss": 0.05024116635322571, "mean_token_accuracy": 0.9868739485740662, "num_tokens": 15685301.0, "step": 2510 }, { "entropy": 2.065652829408646, "epoch": 2.1837486457204767, "grad_norm": 0.5138121247291565, "learning_rate": 1.2515815890540011e-05, "loss": 0.030631223320961, "mean_token_accuracy": 0.9903474941849708, "num_tokens": 15745027.0, "step": 2520 }, { "entropy": 1.9828102201223374, "epoch": 2.192416034669556, "grad_norm": 2.7374660968780518, "learning_rate": 1.2461442242527145e-05, "loss": 0.042875179648399354, "mean_token_accuracy": 0.9895638823509216, "num_tokens": 15804338.0, "step": 2530 }, { "entropy": 2.0349514096975327, "epoch": 2.201083423618635, "grad_norm": 1.7734557390213013, "learning_rate": 1.240699101753897e-05, "loss": 0.05402381420135498, "mean_token_accuracy": 0.9609145388007164, "num_tokens": 15867336.0, "step": 2540 }, { "entropy": 2.009895694255829, "epoch": 2.209750812567714, "grad_norm": 3.836571455001831, "learning_rate": 1.2352463931708105e-05, "loss": 0.05817890763282776, "mean_token_accuracy": 0.9803715214133263, "num_tokens": 15931728.0, "step": 2550 }, { "entropy": 2.06903837621212, "epoch": 2.2184182015167933, "grad_norm": 0.9334287047386169, "learning_rate": 1.2297862703558079e-05, "loss": 0.05199915170669556, "mean_token_accuracy": 0.9837120354175568, "num_tokens": 15995013.0, "step": 2560 }, { "entropy": 2.104375296831131, "epoch": 2.227085590465872, "grad_norm": 1.416616678237915, "learning_rate": 1.2243189053949141e-05, "loss": 0.03283692300319672, "mean_token_accuracy": 0.9894999250769615, "num_tokens": 16052916.0, "step": 2570 }, { "entropy": 2.0618636339902876, "epoch": 2.235752979414951, "grad_norm": 0.17304587364196777, "learning_rate": 1.2188444706024047e-05, "loss": 0.03944204151630402, "mean_token_accuracy": 0.9891385614871979, "num_tokens": 16106829.0, "step": 2580 }, { "entropy": 1.968971461057663, "epoch": 2.2444203683640302, "grad_norm": 1.0604981184005737, "learning_rate": 1.2133631385153743e-05, "loss": 0.03233407437801361, "mean_token_accuracy": 0.9909744769334793, "num_tokens": 16174485.0, "step": 2590 }, { "entropy": 2.0065663278102877, "epoch": 2.2530877573131094, "grad_norm": 1.3104647397994995, "learning_rate": 1.2078750818882987e-05, "loss": 0.08497329354286194, "mean_token_accuracy": 0.9758600533008576, "num_tokens": 16236830.0, "step": 2600 }, { "epoch": 2.2530877573131094, "eval_entropy": 1.966503743508562, "eval_loss": 0.0974222719669342, "eval_mean_token_accuracy": 0.9753037845317404, "eval_num_tokens": 16236830.0, "eval_runtime": 327.0094, "eval_samples_per_second": 4.917, "eval_steps_per_second": 0.615, "step": 2600 }, { "entropy": 2.03442302942276, "epoch": 2.2617551462621885, "grad_norm": 1.5553882122039795, "learning_rate": 1.2023804736875902e-05, "loss": 0.0502473771572113, "mean_token_accuracy": 0.9867029458284378, "num_tokens": 16297830.0, "step": 2610 }, { "entropy": 2.0630034118890763, "epoch": 2.2704225352112677, "grad_norm": 1.4778331518173218, "learning_rate": 1.1968794870861456e-05, "loss": 0.03913445472717285, "mean_token_accuracy": 0.9862898513674736, "num_tokens": 16357326.0, "step": 2620 }, { "entropy": 1.9924042463302611, "epoch": 2.279089924160347, "grad_norm": 3.9587581157684326, "learning_rate": 1.1913722954578899e-05, "loss": 0.05349403023719788, "mean_token_accuracy": 0.9834675654768944, "num_tokens": 16429506.0, "step": 2630 }, { "entropy": 2.021091330051422, "epoch": 2.2877573131094255, "grad_norm": 0.6672972440719604, "learning_rate": 1.1858590723723105e-05, "loss": 0.07556374669075012, "mean_token_accuracy": 0.9789584875106812, "num_tokens": 16494120.0, "step": 2640 }, { "entropy": 2.001381501555443, "epoch": 2.2964247020585047, "grad_norm": 2.1601645946502686, "learning_rate": 1.1803399915889879e-05, "loss": 0.02168504297733307, "mean_token_accuracy": 0.9941964268684387, "num_tokens": 16552584.0, "step": 2650 }, { "entropy": 1.969146479666233, "epoch": 2.305092091007584, "grad_norm": 1.3330966234207153, "learning_rate": 1.174815227052119e-05, "loss": 0.07724554538726806, "mean_token_accuracy": 0.9825429797172547, "num_tokens": 16619463.0, "step": 2660 }, { "entropy": 2.022412383556366, "epoch": 2.313759479956663, "grad_norm": 0.49082720279693604, "learning_rate": 1.1692849528850347e-05, "loss": 0.0698297381401062, "mean_token_accuracy": 0.9825235098600388, "num_tokens": 16676884.0, "step": 2670 }, { "entropy": 1.9466478317975997, "epoch": 2.322426868905742, "grad_norm": 1.1853913068771362, "learning_rate": 1.163749343384712e-05, "loss": 0.07198914289474487, "mean_token_accuracy": 0.9782518684864044, "num_tokens": 16738824.0, "step": 2680 }, { "entropy": 2.0615739434957505, "epoch": 2.3310942578548213, "grad_norm": 2.7772486209869385, "learning_rate": 1.1582085730162813e-05, "loss": 0.05143954157829285, "mean_token_accuracy": 0.987485408782959, "num_tokens": 16792247.0, "step": 2690 }, { "entropy": 1.9806438446044923, "epoch": 2.3397616468039004, "grad_norm": 4.884121417999268, "learning_rate": 1.1526628164075273e-05, "loss": 0.08477678298950195, "mean_token_accuracy": 0.9575665161013603, "num_tokens": 16857938.0, "step": 2700 }, { "epoch": 2.3397616468039004, "eval_entropy": 1.9306559194972859, "eval_loss": 0.0928974524140358, "eval_mean_token_accuracy": 0.9761734486219302, "eval_num_tokens": 16857938.0, "eval_runtime": 327.2258, "eval_samples_per_second": 4.914, "eval_steps_per_second": 0.614, "step": 2700 }, { "entropy": 2.044921043515205, "epoch": 2.3484290357529796, "grad_norm": 0.7897859811782837, "learning_rate": 1.1471122483433856e-05, "loss": 0.04415179193019867, "mean_token_accuracy": 0.9867105528712272, "num_tokens": 16918909.0, "step": 2710 }, { "entropy": 1.9723411783576013, "epoch": 2.3570964247020587, "grad_norm": 1.2908411026000977, "learning_rate": 1.1415570437604335e-05, "loss": 0.06363893747329712, "mean_token_accuracy": 0.9832093894481659, "num_tokens": 16978352.0, "step": 2720 }, { "entropy": 2.022680976986885, "epoch": 2.3657638136511374, "grad_norm": 0.7468595504760742, "learning_rate": 1.1359973777413774e-05, "loss": 0.03693146705627441, "mean_token_accuracy": 0.9875386908650399, "num_tokens": 17035505.0, "step": 2730 }, { "entropy": 1.8950548261404037, "epoch": 2.3744312026002166, "grad_norm": 2.981616258621216, "learning_rate": 1.1304334255095337e-05, "loss": 0.09151351451873779, "mean_token_accuracy": 0.9821941837668419, "num_tokens": 17110174.0, "step": 2740 }, { "entropy": 1.9415518552064897, "epoch": 2.3830985915492957, "grad_norm": 2.130307197570801, "learning_rate": 1.1248653624233073e-05, "loss": 0.07621107697486877, "mean_token_accuracy": 0.975463455915451, "num_tokens": 17177359.0, "step": 2750 }, { "entropy": 1.9728293806314467, "epoch": 2.391765980498375, "grad_norm": 1.8035576343536377, "learning_rate": 1.119293363970664e-05, "loss": 0.05236530900001526, "mean_token_accuracy": 0.9870255410671234, "num_tokens": 17245792.0, "step": 2760 }, { "entropy": 2.0360106259584425, "epoch": 2.400433369447454, "grad_norm": 0.6293774247169495, "learning_rate": 1.1137176057636008e-05, "loss": 0.05267359614372254, "mean_token_accuracy": 0.9824561506509781, "num_tokens": 17306938.0, "step": 2770 }, { "entropy": 1.9547817423939704, "epoch": 2.409100758396533, "grad_norm": 1.1461045742034912, "learning_rate": 1.1081382635326091e-05, "loss": 0.07106815576553345, "mean_token_accuracy": 0.9856281742453575, "num_tokens": 17384890.0, "step": 2780 }, { "entropy": 2.0299994975328444, "epoch": 2.4177681473456123, "grad_norm": 3.276568651199341, "learning_rate": 1.1025555131211387e-05, "loss": 0.05880398154258728, "mean_token_accuracy": 0.9834137126803398, "num_tokens": 17453317.0, "step": 2790 }, { "entropy": 2.0245982825756075, "epoch": 2.426435536294691, "grad_norm": 1.0511301755905151, "learning_rate": 1.0969695304800544e-05, "loss": 0.08915462493896484, "mean_token_accuracy": 0.9808729231357575, "num_tokens": 17512361.0, "step": 2800 }, { "epoch": 2.426435536294691, "eval_entropy": 1.9572540764784931, "eval_loss": 0.09015624970197678, "eval_mean_token_accuracy": 0.9780560441278107, "eval_num_tokens": 17512361.0, "eval_runtime": 327.3427, "eval_samples_per_second": 4.912, "eval_steps_per_second": 0.614, "step": 2800 }, { "entropy": 1.9997735738754272, "epoch": 2.43510292524377, "grad_norm": 0.9744513034820557, "learning_rate": 1.0913804916620905e-05, "loss": 0.02331102341413498, "mean_token_accuracy": 0.9919474333524704, "num_tokens": 17577516.0, "step": 2810 }, { "entropy": 2.014119616150856, "epoch": 2.4437703141928493, "grad_norm": 0.9193094372749329, "learning_rate": 1.0857885728163027e-05, "loss": 0.0236177533864975, "mean_token_accuracy": 0.9911881402134896, "num_tokens": 17638548.0, "step": 2820 }, { "entropy": 1.960026879608631, "epoch": 2.4524377031419284, "grad_norm": 0.23110997676849365, "learning_rate": 1.0801939501825157e-05, "loss": 0.04339863955974579, "mean_token_accuracy": 0.98226348310709, "num_tokens": 17705192.0, "step": 2830 }, { "entropy": 1.996291145682335, "epoch": 2.4611050920910076, "grad_norm": 5.163341045379639, "learning_rate": 1.07459680008577e-05, "loss": 0.04148267507553101, "mean_token_accuracy": 0.9853608950972557, "num_tokens": 17769801.0, "step": 2840 }, { "entropy": 2.0213477462530136, "epoch": 2.4697724810400867, "grad_norm": 2.1272523403167725, "learning_rate": 1.068997298930763e-05, "loss": 0.034024789929389954, "mean_token_accuracy": 0.9842083305120468, "num_tokens": 17831542.0, "step": 2850 }, { "entropy": 1.9997887834906578, "epoch": 2.478439869989166, "grad_norm": 1.8577139377593994, "learning_rate": 1.0633956231962908e-05, "loss": 0.030756032466888426, "mean_token_accuracy": 0.9878269597887993, "num_tokens": 17897817.0, "step": 2860 }, { "entropy": 1.9450352013111114, "epoch": 2.487107258938245, "grad_norm": 1.6481013298034668, "learning_rate": 1.0577919494296848e-05, "loss": 0.04975041747093201, "mean_token_accuracy": 0.9855062261223793, "num_tokens": 17961050.0, "step": 2870 }, { "entropy": 2.0519244849681852, "epoch": 2.495774647887324, "grad_norm": 1.7673394680023193, "learning_rate": 1.052186454241249e-05, "loss": 0.06363226175308227, "mean_token_accuracy": 0.9759257227182389, "num_tokens": 18017683.0, "step": 2880 }, { "entropy": 1.9854577094316483, "epoch": 2.504442036836403, "grad_norm": 0.9915326833724976, "learning_rate": 1.0465793142986917e-05, "loss": 0.03945471942424774, "mean_token_accuracy": 0.9838297843933106, "num_tokens": 18086623.0, "step": 2890 }, { "entropy": 1.9744661718606948, "epoch": 2.513109425785482, "grad_norm": 0.19898076355457306, "learning_rate": 1.0409707063215602e-05, "loss": 0.04994584023952484, "mean_token_accuracy": 0.9840056359767914, "num_tokens": 18161992.0, "step": 2900 }, { "epoch": 2.513109425785482, "eval_entropy": 1.9463663801031919, "eval_loss": 0.09015114605426788, "eval_mean_token_accuracy": 0.9790049482933918, "eval_num_tokens": 18161992.0, "eval_runtime": 327.033, "eval_samples_per_second": 4.917, "eval_steps_per_second": 0.615, "step": 2900 }, { "entropy": 2.0072739005088804, "epoch": 2.521776814734561, "grad_norm": 0.6039919853210449, "learning_rate": 1.035360807075668e-05, "loss": 0.06279324889183044, "mean_token_accuracy": 0.9817322447896004, "num_tokens": 18218359.0, "step": 2910 }, { "entropy": 1.979375532269478, "epoch": 2.5304442036836403, "grad_norm": 2.242131233215332, "learning_rate": 1.0297497933675271e-05, "loss": 0.037703675031661985, "mean_token_accuracy": 0.9891891330480576, "num_tokens": 18276604.0, "step": 2920 }, { "entropy": 2.0151320695877075, "epoch": 2.5391115926327195, "grad_norm": 4.291823863983154, "learning_rate": 1.0241378420387727e-05, "loss": 0.0672419011592865, "mean_token_accuracy": 0.9796803876757622, "num_tokens": 18336643.0, "step": 2930 }, { "entropy": 1.9576003134250641, "epoch": 2.5477789815817986, "grad_norm": 1.9827468395233154, "learning_rate": 1.0185251299605909e-05, "loss": 0.03502065539360046, "mean_token_accuracy": 0.9894511729478837, "num_tokens": 18395903.0, "step": 2940 }, { "entropy": 2.021180757880211, "epoch": 2.5564463705308773, "grad_norm": 7.404480934143066, "learning_rate": 1.012911834028145e-05, "loss": 0.04811771810054779, "mean_token_accuracy": 0.9804063439369202, "num_tokens": 18459847.0, "step": 2950 }, { "entropy": 1.9120722502470016, "epoch": 2.5651137594799565, "grad_norm": 0.9321104884147644, "learning_rate": 1.0072981311549988e-05, "loss": 0.05938450694084167, "mean_token_accuracy": 0.9737172573804855, "num_tokens": 18525932.0, "step": 2960 }, { "entropy": 2.0345918387174606, "epoch": 2.5737811484290356, "grad_norm": 0.08143553882837296, "learning_rate": 1.001684198267542e-05, "loss": 0.05566604137420654, "mean_token_accuracy": 0.9803778171539307, "num_tokens": 18589606.0, "step": 2970 }, { "entropy": 2.053544855117798, "epoch": 2.5824485373781148, "grad_norm": 1.1658939123153687, "learning_rate": 9.960702122994139e-06, "loss": 0.0482805073261261, "mean_token_accuracy": 0.9861093074083328, "num_tokens": 18644042.0, "step": 2980 }, { "entropy": 2.0836474686861037, "epoch": 2.591115926327194, "grad_norm": 1.5134586095809937, "learning_rate": 9.904563501859256e-06, "loss": 0.055090302228927614, "mean_token_accuracy": 0.9857477128505707, "num_tokens": 18702039.0, "step": 2990 }, { "entropy": 2.0128067165613173, "epoch": 2.599783315276273, "grad_norm": 1.14212965965271, "learning_rate": 9.848427888584863e-06, "loss": 0.041364666819572446, "mean_token_accuracy": 0.9833357527852058, "num_tokens": 18764358.0, "step": 3000 }, { "epoch": 2.599783315276273, "eval_entropy": 1.9795061646409295, "eval_loss": 0.09064625948667526, "eval_mean_token_accuracy": 0.9773970151422036, "eval_num_tokens": 18764358.0, "eval_runtime": 327.3559, "eval_samples_per_second": 4.912, "eval_steps_per_second": 0.614, "step": 3000 }, { "entropy": 2.159276154637337, "epoch": 2.608450704225352, "grad_norm": 2.7326016426086426, "learning_rate": 9.792297052390238e-06, "loss": 0.04406266808509827, "mean_token_accuracy": 0.987121856212616, "num_tokens": 18818455.0, "step": 3010 }, { "entropy": 1.968066468834877, "epoch": 2.6171180931744313, "grad_norm": 2.7995221614837646, "learning_rate": 9.736172762344113e-06, "loss": 0.09104043841362, "mean_token_accuracy": 0.980485713481903, "num_tokens": 18884842.0, "step": 3020 }, { "entropy": 1.99553040266037, "epoch": 2.6257854821235105, "grad_norm": 6.235974311828613, "learning_rate": 9.680056787308898e-06, "loss": 0.06288103461265564, "mean_token_accuracy": 0.9678011432290077, "num_tokens": 18959860.0, "step": 3030 }, { "entropy": 1.9894109219312668, "epoch": 2.6344528710725896, "grad_norm": 0.333478718996048, "learning_rate": 9.623950895884944e-06, "loss": 0.08161028027534485, "mean_token_accuracy": 0.9892241954803467, "num_tokens": 19027017.0, "step": 3040 }, { "entropy": 2.04710274040699, "epoch": 2.6431202600216683, "grad_norm": 0.5233101844787598, "learning_rate": 9.567856856354792e-06, "loss": 0.04426893293857574, "mean_token_accuracy": 0.9886008054018021, "num_tokens": 19086891.0, "step": 3050 }, { "entropy": 2.028855699300766, "epoch": 2.6517876489707475, "grad_norm": 1.3492603302001953, "learning_rate": 9.511776436627456e-06, "loss": 0.026917535066604614, "mean_token_accuracy": 0.9916170611977577, "num_tokens": 19145104.0, "step": 3060 }, { "entropy": 1.9948274880647658, "epoch": 2.6604550379198266, "grad_norm": 2.2153990268707275, "learning_rate": 9.455711404182696e-06, "loss": 0.08325918912887573, "mean_token_accuracy": 0.9756117567420006, "num_tokens": 19206436.0, "step": 3070 }, { "entropy": 2.049996706843376, "epoch": 2.6691224268689058, "grad_norm": 4.233671188354492, "learning_rate": 9.399663526015305e-06, "loss": 0.08945580720901489, "mean_token_accuracy": 0.9773588702082634, "num_tokens": 19261677.0, "step": 3080 }, { "entropy": 2.012954831123352, "epoch": 2.677789815817985, "grad_norm": 0.9330930709838867, "learning_rate": 9.343634568579436e-06, "loss": 0.06627085208892822, "mean_token_accuracy": 0.9879173919558525, "num_tokens": 19322808.0, "step": 3090 }, { "entropy": 2.0294546335935593, "epoch": 2.686457204767064, "grad_norm": 1.6425728797912598, "learning_rate": 9.287626297732908e-06, "loss": 0.047486874461174014, "mean_token_accuracy": 0.9868068620562553, "num_tokens": 19387957.0, "step": 3100 }, { "epoch": 2.686457204767064, "eval_entropy": 1.9502243705056792, "eval_loss": 0.08599194884300232, "eval_mean_token_accuracy": 0.9787541123765024, "eval_num_tokens": 19387957.0, "eval_runtime": 327.3899, "eval_samples_per_second": 4.912, "eval_steps_per_second": 0.614, "step": 3100 }, { "entropy": 2.0488913506269455, "epoch": 2.6951245937161428, "grad_norm": 0.2572486698627472, "learning_rate": 9.231640478681579e-06, "loss": 0.038655102252960205, "mean_token_accuracy": 0.9838706344366074, "num_tokens": 19442029.0, "step": 3110 }, { "entropy": 1.996284967660904, "epoch": 2.703791982665222, "grad_norm": 0.7005351185798645, "learning_rate": 9.175678875923682e-06, "loss": 0.06046753525733948, "mean_token_accuracy": 0.9802204161882401, "num_tokens": 19500346.0, "step": 3120 }, { "entropy": 1.991689708828926, "epoch": 2.712459371614301, "grad_norm": 1.0894055366516113, "learning_rate": 9.119743253194238e-06, "loss": 0.06283498406410218, "mean_token_accuracy": 0.9823062658309937, "num_tokens": 19567406.0, "step": 3130 }, { "entropy": 2.0570632964372635, "epoch": 2.72112676056338, "grad_norm": 2.256519079208374, "learning_rate": 9.063835373409454e-06, "loss": 0.10143665075302125, "mean_token_accuracy": 0.9756506696343422, "num_tokens": 19626834.0, "step": 3140 }, { "entropy": 2.0224888235330583, "epoch": 2.7297941495124594, "grad_norm": 0.9661228060722351, "learning_rate": 9.007956998611162e-06, "loss": 0.023985360562801362, "mean_token_accuracy": 0.9860787034034729, "num_tokens": 19684060.0, "step": 3150 }, { "entropy": 2.0702203780412676, "epoch": 2.7384615384615385, "grad_norm": 1.2157535552978516, "learning_rate": 8.9521098899113e-06, "loss": 0.045061749219894406, "mean_token_accuracy": 0.9835543319582939, "num_tokens": 19744862.0, "step": 3160 }, { "entropy": 1.9608687520027162, "epoch": 2.7471289274106176, "grad_norm": 1.2761811017990112, "learning_rate": 8.896295807436382e-06, "loss": 0.02903972864151001, "mean_token_accuracy": 0.9851373538374901, "num_tokens": 19814847.0, "step": 3170 }, { "entropy": 1.9704955458641051, "epoch": 2.755796316359697, "grad_norm": 3.0626580715179443, "learning_rate": 8.840516510272056e-06, "loss": 0.03995053470134735, "mean_token_accuracy": 0.9888360872864723, "num_tokens": 19873814.0, "step": 3180 }, { "entropy": 2.0080684244632723, "epoch": 2.764463705308776, "grad_norm": 2.2461702823638916, "learning_rate": 8.784773756407629e-06, "loss": 0.03145716786384582, "mean_token_accuracy": 0.9925667092204093, "num_tokens": 19931686.0, "step": 3190 }, { "entropy": 1.9973454266786574, "epoch": 2.773131094257855, "grad_norm": 1.4155596494674683, "learning_rate": 8.729069302680686e-06, "loss": 0.03232878148555755, "mean_token_accuracy": 0.9891820922493935, "num_tokens": 19993913.0, "step": 3200 }, { "epoch": 2.773131094257855, "eval_entropy": 1.9362546573230877, "eval_loss": 0.08918900042772293, "eval_mean_token_accuracy": 0.9781833460081869, "eval_num_tokens": 19993913.0, "eval_runtime": 327.2187, "eval_samples_per_second": 4.914, "eval_steps_per_second": 0.614, "step": 3200 }, { "entropy": 2.0571909993886948, "epoch": 2.781798483206934, "grad_norm": 1.3820114135742188, "learning_rate": 8.67340490472171e-06, "loss": 0.0422855019569397, "mean_token_accuracy": 0.9904089197516441, "num_tokens": 20051573.0, "step": 3210 }, { "entropy": 1.9552978485822679, "epoch": 2.790465872156013, "grad_norm": 2.360881805419922, "learning_rate": 8.61778231689875e-06, "loss": 0.06589213013648987, "mean_token_accuracy": 0.9763843730092049, "num_tokens": 20110195.0, "step": 3220 }, { "entropy": 1.997276645898819, "epoch": 2.799133261105092, "grad_norm": 0.7178909778594971, "learning_rate": 8.56220329226213e-06, "loss": 0.026553085446357726, "mean_token_accuracy": 0.9915577113628388, "num_tokens": 20171207.0, "step": 3230 }, { "entropy": 1.97244333922863, "epoch": 2.8078006500541712, "grad_norm": 0.8178501725196838, "learning_rate": 8.506669582489199e-06, "loss": 0.06264678239822388, "mean_token_accuracy": 0.9804031074047088, "num_tokens": 20240761.0, "step": 3240 }, { "entropy": 1.9891822725534438, "epoch": 2.8164680390032504, "grad_norm": 0.20255060493946075, "learning_rate": 8.451182937829125e-06, "loss": 0.035097137093544006, "mean_token_accuracy": 0.9935684517025948, "num_tokens": 20300987.0, "step": 3250 }, { "entropy": 2.0133452355861663, "epoch": 2.8251354279523295, "grad_norm": 4.924685955047607, "learning_rate": 8.395745107047729e-06, "loss": 0.07078658938407897, "mean_token_accuracy": 0.9835556149482727, "num_tokens": 20366208.0, "step": 3260 }, { "entropy": 1.996243155002594, "epoch": 2.8338028169014082, "grad_norm": 0.5406718850135803, "learning_rate": 8.340357837372363e-06, "loss": 0.08820904493331909, "mean_token_accuracy": 0.9786410570144654, "num_tokens": 20433132.0, "step": 3270 }, { "entropy": 2.0637154281139374, "epoch": 2.8424702058504874, "grad_norm": 3.8165504932403564, "learning_rate": 8.28502287443687e-06, "loss": 0.0430131733417511, "mean_token_accuracy": 0.9918735235929489, "num_tokens": 20496310.0, "step": 3280 }, { "entropy": 2.0202389895915984, "epoch": 2.8511375947995665, "grad_norm": 1.5813179016113281, "learning_rate": 8.229741962226525e-06, "loss": 0.05116449594497681, "mean_token_accuracy": 0.9833520889282227, "num_tokens": 20565223.0, "step": 3290 }, { "entropy": 2.062763836979866, "epoch": 2.8598049837486457, "grad_norm": 0.22883164882659912, "learning_rate": 8.174516843023112e-06, "loss": 0.03045716881752014, "mean_token_accuracy": 0.9860931158065795, "num_tokens": 20625610.0, "step": 3300 }, { "epoch": 2.8598049837486457, "eval_entropy": 1.938993199547725, "eval_loss": 0.08659692853689194, "eval_mean_token_accuracy": 0.9792619125166936, "eval_num_tokens": 20625610.0, "eval_runtime": 326.8748, "eval_samples_per_second": 4.919, "eval_steps_per_second": 0.615, "step": 3300 }, { "entropy": 1.9526330173015594, "epoch": 2.868472372697725, "grad_norm": 0.17043910920619965, "learning_rate": 8.119349257349981e-06, "loss": 0.03852111101150513, "mean_token_accuracy": 0.9923890814185142, "num_tokens": 20689418.0, "step": 3310 }, { "entropy": 2.0270158767700197, "epoch": 2.877139761646804, "grad_norm": 0.4257623851299286, "learning_rate": 8.064240943917214e-06, "loss": 0.04855137765407562, "mean_token_accuracy": 0.9914126366376876, "num_tokens": 20751477.0, "step": 3320 }, { "entropy": 1.987108725309372, "epoch": 2.885807150595883, "grad_norm": 1.6425321102142334, "learning_rate": 8.009193639566805e-06, "loss": 0.06597901582717895, "mean_token_accuracy": 0.973939710855484, "num_tokens": 20817645.0, "step": 3330 }, { "entropy": 2.027906683087349, "epoch": 2.8944745395449623, "grad_norm": 1.789011001586914, "learning_rate": 7.954209079217945e-06, "loss": 0.04323897361755371, "mean_token_accuracy": 0.9864452615380287, "num_tokens": 20879146.0, "step": 3340 }, { "entropy": 1.9812477678060532, "epoch": 2.9031419284940414, "grad_norm": 3.5340230464935303, "learning_rate": 7.899288995812322e-06, "loss": 0.0406141608953476, "mean_token_accuracy": 0.987187135219574, "num_tokens": 20941057.0, "step": 3350 }, { "entropy": 2.024034297466278, "epoch": 2.91180931744312, "grad_norm": 0.21585479378700256, "learning_rate": 7.84443512025952e-06, "loss": 0.04108258783817291, "mean_token_accuracy": 0.9911881193518639, "num_tokens": 20999998.0, "step": 3360 }, { "entropy": 1.9965860784053802, "epoch": 2.9204767063921993, "grad_norm": 2.0004289150238037, "learning_rate": 7.789649181382444e-06, "loss": 0.040653344988822934, "mean_token_accuracy": 0.9891650825738907, "num_tokens": 21068454.0, "step": 3370 }, { "entropy": 1.9830640345811843, "epoch": 2.9291440953412784, "grad_norm": 3.6005094051361084, "learning_rate": 7.734932905862862e-06, "loss": 0.07591732740402221, "mean_token_accuracy": 0.984532107412815, "num_tokens": 21143837.0, "step": 3380 }, { "entropy": 2.04206445813179, "epoch": 2.9378114842903575, "grad_norm": 1.8786780834197998, "learning_rate": 7.68028801818696e-06, "loss": 0.03788648545742035, "mean_token_accuracy": 0.9878558471798897, "num_tokens": 21202925.0, "step": 3390 }, { "entropy": 1.9883090794086455, "epoch": 2.9464788732394367, "grad_norm": 2.9170005321502686, "learning_rate": 7.6257162405910115e-06, "loss": 0.04177981615066528, "mean_token_accuracy": 0.9603466898202896, "num_tokens": 21262453.0, "step": 3400 }, { "epoch": 2.9464788732394367, "eval_entropy": 1.9480238630997009, "eval_loss": 0.08786118775606155, "eval_mean_token_accuracy": 0.9783913027587815, "eval_num_tokens": 21262453.0, "eval_runtime": 327.0291, "eval_samples_per_second": 4.917, "eval_steps_per_second": 0.615, "step": 3400 }, { "entropy": 2.00368013381958, "epoch": 2.955146262188516, "grad_norm": 1.690090298652649, "learning_rate": 7.571219293007075e-06, "loss": 0.07676026225090027, "mean_token_accuracy": 0.9722154304385185, "num_tokens": 21325040.0, "step": 3410 }, { "entropy": 2.0232281416654585, "epoch": 2.9638136511375945, "grad_norm": 0.692124605178833, "learning_rate": 7.516798893008817e-06, "loss": 0.025483831763267517, "mean_token_accuracy": 0.993908728659153, "num_tokens": 21385939.0, "step": 3420 }, { "entropy": 1.9855226576328278, "epoch": 2.9724810400866737, "grad_norm": 5.5677385330200195, "learning_rate": 7.4624567557573525e-06, "loss": 0.03866112232208252, "mean_token_accuracy": 0.9897015273571015, "num_tokens": 21449342.0, "step": 3430 }, { "entropy": 1.9878569096326828, "epoch": 2.981148429035753, "grad_norm": 1.0295473337173462, "learning_rate": 7.4081945939472e-06, "loss": 0.02325758934020996, "mean_token_accuracy": 0.9918417349457741, "num_tokens": 21517498.0, "step": 3440 }, { "entropy": 2.040255609154701, "epoch": 2.989815817984832, "grad_norm": 0.6241699457168579, "learning_rate": 7.354014117752305e-06, "loss": 0.05443716049194336, "mean_token_accuracy": 0.9862660676240921, "num_tokens": 21575243.0, "step": 3450 }, { "entropy": 1.9827607095241546, "epoch": 2.998483206933911, "grad_norm": 3.2460570335388184, "learning_rate": 7.299917034772134e-06, "loss": 0.03632343113422394, "mean_token_accuracy": 0.9861762166023255, "num_tokens": 21642048.0, "step": 3460 }, { "entropy": 1.9609574262912457, "epoch": 3.0069339111592632, "grad_norm": 0.3964233100414276, "learning_rate": 7.245905049977863e-06, "loss": 0.023949359357357026, "mean_token_accuracy": 0.9889839383272024, "num_tokens": 21703419.0, "step": 3470 }, { "entropy": 2.0167145997285845, "epoch": 3.0156013001083424, "grad_norm": 0.2081003487110138, "learning_rate": 7.191979865658633e-06, "loss": 0.029495981335639954, "mean_token_accuracy": 0.9923539698123932, "num_tokens": 21767451.0, "step": 3480 }, { "entropy": 1.9336788192391396, "epoch": 3.0242686890574215, "grad_norm": 1.2492883205413818, "learning_rate": 7.138143181367918e-06, "loss": 0.018693357706069946, "mean_token_accuracy": 0.9953667461872101, "num_tokens": 21842309.0, "step": 3490 }, { "entropy": 2.0128078699111938, "epoch": 3.0329360780065007, "grad_norm": 0.08379145711660385, "learning_rate": 7.084396693869928e-06, "loss": 0.022161170840263367, "mean_token_accuracy": 0.9914363294839859, "num_tokens": 21904561.0, "step": 3500 }, { "epoch": 3.0329360780065007, "eval_entropy": 1.9438044924048048, "eval_loss": 0.08556525409221649, "eval_mean_token_accuracy": 0.9790331549312344, "eval_num_tokens": 21904561.0, "eval_runtime": 327.0968, "eval_samples_per_second": 4.916, "eval_steps_per_second": 0.614, "step": 3500 }, { "entropy": 1.927895051240921, "epoch": 3.04160346695558, "grad_norm": 1.0014227628707886, "learning_rate": 7.0307420970861695e-06, "loss": 0.022809083759784698, "mean_token_accuracy": 0.9900833815336227, "num_tokens": 21972321.0, "step": 3510 }, { "entropy": 2.0294132977724075, "epoch": 3.0502708559046585, "grad_norm": 0.8297566771507263, "learning_rate": 6.977181082042033e-06, "loss": 0.024722158908843994, "mean_token_accuracy": 0.9913588181138039, "num_tokens": 22037170.0, "step": 3520 }, { "entropy": 2.1015698224306107, "epoch": 3.0589382448537377, "grad_norm": 1.5314658880233765, "learning_rate": 6.923715336813499e-06, "loss": 0.03659733235836029, "mean_token_accuracy": 0.9872351065278053, "num_tokens": 22083744.0, "step": 3530 }, { "entropy": 2.0339041739702224, "epoch": 3.067605633802817, "grad_norm": 0.24609343707561493, "learning_rate": 6.870346546473954e-06, "loss": 0.03324902355670929, "mean_token_accuracy": 0.9886126175522805, "num_tokens": 22141305.0, "step": 3540 }, { "entropy": 2.025708928704262, "epoch": 3.076273022751896, "grad_norm": 3.1685736179351807, "learning_rate": 6.817076393041055e-06, "loss": 0.039118051528930664, "mean_token_accuracy": 0.9934563606977462, "num_tokens": 22201940.0, "step": 3550 }, { "entropy": 1.9974781066179275, "epoch": 3.084940411700975, "grad_norm": 1.9486182928085327, "learning_rate": 6.763906555423745e-06, "loss": 0.026187896728515625, "mean_token_accuracy": 0.9913025006651879, "num_tokens": 22261753.0, "step": 3560 }, { "entropy": 2.0584082931280134, "epoch": 3.0936078006500543, "grad_norm": 0.07571403682231903, "learning_rate": 6.710838709369315e-06, "loss": 0.04056554138660431, "mean_token_accuracy": 0.9884672403335572, "num_tokens": 22319850.0, "step": 3570 }, { "entropy": 2.0791433185338972, "epoch": 3.1022751895991334, "grad_norm": 2.689072847366333, "learning_rate": 6.6578745274106075e-06, "loss": 0.03821301460266113, "mean_token_accuracy": 0.9874335438013077, "num_tokens": 22377009.0, "step": 3580 }, { "entropy": 2.050138959288597, "epoch": 3.1109425785482125, "grad_norm": 0.6456999182701111, "learning_rate": 6.6050156788132895e-06, "loss": 0.014178495109081268, "mean_token_accuracy": 0.9958937197923661, "num_tokens": 22441093.0, "step": 3590 }, { "entropy": 2.0015585333108903, "epoch": 3.1196099674972912, "grad_norm": 0.9528690576553345, "learning_rate": 6.552263829523258e-06, "loss": 0.040335527062416075, "mean_token_accuracy": 0.9911141216754913, "num_tokens": 22505491.0, "step": 3600 }, { "epoch": 3.1196099674972912, "eval_entropy": 1.941706338925148, "eval_loss": 0.08653046935796738, "eval_mean_token_accuracy": 0.9788935940657089, "eval_num_tokens": 22505491.0, "eval_runtime": 327.1481, "eval_samples_per_second": 4.915, "eval_steps_per_second": 0.614, "step": 3600 }, { "entropy": 2.0061341017484664, "epoch": 3.1282773564463704, "grad_norm": 0.17698237299919128, "learning_rate": 6.499620642114117e-06, "loss": 0.022867996990680695, "mean_token_accuracy": 0.9916748866438866, "num_tokens": 22571460.0, "step": 3610 }, { "entropy": 1.9561231464147568, "epoch": 3.1369447453954495, "grad_norm": 2.200025796890259, "learning_rate": 6.4470877757347925e-06, "loss": 0.025290462374687194, "mean_token_accuracy": 0.9868748232722282, "num_tokens": 22633373.0, "step": 3620 }, { "entropy": 1.9883778482675551, "epoch": 3.1456121343445287, "grad_norm": 1.4036747217178345, "learning_rate": 6.394666886057234e-06, "loss": 0.03302829265594483, "mean_token_accuracy": 0.9855715438723565, "num_tokens": 22699790.0, "step": 3630 }, { "entropy": 2.028902477025986, "epoch": 3.154279523293608, "grad_norm": 2.978290557861328, "learning_rate": 6.34235962522424e-06, "loss": 0.04505385160446167, "mean_token_accuracy": 0.9882813230156898, "num_tokens": 22760617.0, "step": 3640 }, { "entropy": 1.9538985759019851, "epoch": 3.162946912242687, "grad_norm": 2.2208809852600098, "learning_rate": 6.290167641797373e-06, "loss": 0.027484691143035887, "mean_token_accuracy": 0.9884011939167976, "num_tokens": 22828652.0, "step": 3650 }, { "entropy": 1.9391920119524002, "epoch": 3.171614301191766, "grad_norm": 2.3642702102661133, "learning_rate": 6.23809258070502e-06, "loss": 0.08644394278526306, "mean_token_accuracy": 0.9805887296795845, "num_tokens": 22897137.0, "step": 3660 }, { "entropy": 2.052844101190567, "epoch": 3.1802816901408453, "grad_norm": 0.271776020526886, "learning_rate": 6.186136083190534e-06, "loss": 0.026084551215171815, "mean_token_accuracy": 0.9889581605792046, "num_tokens": 22961566.0, "step": 3670 }, { "entropy": 1.9666710525751114, "epoch": 3.188949079089924, "grad_norm": 2.292097806930542, "learning_rate": 6.134299786760523e-06, "loss": 0.029993349313735963, "mean_token_accuracy": 0.9866111233830452, "num_tokens": 23032145.0, "step": 3680 }, { "entropy": 1.9898767739534378, "epoch": 3.197616468039003, "grad_norm": 0.5140994191169739, "learning_rate": 6.082585325133222e-06, "loss": 0.01786961853504181, "mean_token_accuracy": 0.9936378210783005, "num_tokens": 23096505.0, "step": 3690 }, { "entropy": 2.0351445108652113, "epoch": 3.2062838569880823, "grad_norm": 2.1874489784240723, "learning_rate": 6.030994328187023e-06, "loss": 0.015171639621257782, "mean_token_accuracy": 0.9934789076447487, "num_tokens": 23159233.0, "step": 3700 }, { "epoch": 3.2062838569880823, "eval_entropy": 1.9617518720342153, "eval_loss": 0.08715828508138657, "eval_mean_token_accuracy": 0.9805069438260586, "eval_num_tokens": 23159233.0, "eval_runtime": 326.8014, "eval_samples_per_second": 4.92, "eval_steps_per_second": 0.615, "step": 3700 }, { "entropy": 2.0274400532245638, "epoch": 3.2149512459371614, "grad_norm": 0.12795260548591614, "learning_rate": 5.979528421909089e-06, "loss": 0.03491283059120178, "mean_token_accuracy": 0.9888436004519463, "num_tokens": 23219168.0, "step": 3710 }, { "entropy": 2.0637706756591796, "epoch": 3.2236186348862406, "grad_norm": 2.057122230529785, "learning_rate": 5.928189228344121e-06, "loss": 0.02740119695663452, "mean_token_accuracy": 0.992508827149868, "num_tokens": 23280186.0, "step": 3720 }, { "entropy": 2.0003860145807266, "epoch": 3.2322860238353197, "grad_norm": 2.19740891456604, "learning_rate": 5.876978365543227e-06, "loss": 0.03788390457630157, "mean_token_accuracy": 0.9878378629684448, "num_tokens": 23344128.0, "step": 3730 }, { "entropy": 2.001324808597565, "epoch": 3.240953412784399, "grad_norm": 1.5126818418502808, "learning_rate": 5.825897447512929e-06, "loss": 0.026940053701400755, "mean_token_accuracy": 0.9857806503772736, "num_tokens": 23403909.0, "step": 3740 }, { "entropy": 1.9464641511440277, "epoch": 3.249620801733478, "grad_norm": 3.0997378826141357, "learning_rate": 5.7749480841643065e-06, "loss": 0.043919849395751956, "mean_token_accuracy": 0.9916449174284935, "num_tokens": 23476336.0, "step": 3750 }, { "entropy": 1.9618077039718629, "epoch": 3.2582881906825567, "grad_norm": 0.05529231205582619, "learning_rate": 5.7241318812622294e-06, "loss": 0.03365751802921295, "mean_token_accuracy": 0.9872692510485649, "num_tokens": 23547474.0, "step": 3760 }, { "entropy": 2.021110999584198, "epoch": 3.266955579631636, "grad_norm": 0.5656824111938477, "learning_rate": 5.673450440374771e-06, "loss": 0.027200946211814882, "mean_token_accuracy": 0.9951310992240906, "num_tokens": 23607028.0, "step": 3770 }, { "entropy": 2.020348605513573, "epoch": 3.275622968580715, "grad_norm": 0.7680350542068481, "learning_rate": 5.622905358822745e-06, "loss": 0.02666248381137848, "mean_token_accuracy": 0.9923866346478463, "num_tokens": 23669610.0, "step": 3780 }, { "entropy": 2.0156673580408095, "epoch": 3.284290357529794, "grad_norm": 1.909304141998291, "learning_rate": 5.5724982296293165e-06, "loss": 0.04042408764362335, "mean_token_accuracy": 0.9617922022938729, "num_tokens": 23729250.0, "step": 3790 }, { "entropy": 2.045342218875885, "epoch": 3.2929577464788733, "grad_norm": 4.081718921661377, "learning_rate": 5.522230641469839e-06, "loss": 0.06637139916419983, "mean_token_accuracy": 0.9821502983570098, "num_tokens": 23787630.0, "step": 3800 }, { "epoch": 3.2929577464788733, "eval_entropy": 1.9523134711963028, "eval_loss": 0.0881609246134758, "eval_mean_token_accuracy": 0.9801165203549969, "eval_num_tokens": 23787630.0, "eval_runtime": 326.5268, "eval_samples_per_second": 4.925, "eval_steps_per_second": 0.616, "step": 3800 }, { "entropy": 1.9851083979010582, "epoch": 3.3016251354279524, "grad_norm": 1.2768914699554443, "learning_rate": 5.4721041786217664e-06, "loss": 0.01877579987049103, "mean_token_accuracy": 0.9903293594717979, "num_tokens": 23849358.0, "step": 3810 }, { "entropy": 1.992839914560318, "epoch": 3.3102925243770316, "grad_norm": 0.9319987297058105, "learning_rate": 5.4221204209147245e-06, "loss": 0.02209160178899765, "mean_token_accuracy": 0.9930718123912812, "num_tokens": 23917856.0, "step": 3820 }, { "entropy": 2.0340360194444655, "epoch": 3.3189599133261103, "grad_norm": 0.6358506083488464, "learning_rate": 5.37228094368071e-06, "loss": 0.027576690912246703, "mean_token_accuracy": 0.9949217200279236, "num_tokens": 23980446.0, "step": 3830 }, { "entropy": 2.010609117150307, "epoch": 3.3276273022751894, "grad_norm": 0.470706045627594, "learning_rate": 5.322587317704457e-06, "loss": 0.04823949933052063, "mean_token_accuracy": 0.9822644203901291, "num_tokens": 24039428.0, "step": 3840 }, { "entropy": 2.0939511328935625, "epoch": 3.3362946912242686, "grad_norm": 0.6235988736152649, "learning_rate": 5.273041109173924e-06, "loss": 0.02635287344455719, "mean_token_accuracy": 0.9920800253748894, "num_tokens": 24090921.0, "step": 3850 }, { "entropy": 2.059076651930809, "epoch": 3.3449620801733477, "grad_norm": 0.25911229848861694, "learning_rate": 5.223643879630934e-06, "loss": 0.046140000224113464, "mean_token_accuracy": 0.9801433801651, "num_tokens": 24151706.0, "step": 3860 }, { "entropy": 2.00682270526886, "epoch": 3.353629469122427, "grad_norm": 1.7312122583389282, "learning_rate": 5.174397185921945e-06, "loss": 0.02391643971204758, "mean_token_accuracy": 0.9928232997655868, "num_tokens": 24211495.0, "step": 3870 }, { "entropy": 2.070136883854866, "epoch": 3.362296858071506, "grad_norm": 0.5971741676330566, "learning_rate": 5.1253025801490044e-06, "loss": 0.03489409387111664, "mean_token_accuracy": 0.9879992380738258, "num_tokens": 24271202.0, "step": 3880 }, { "entropy": 2.0464351683855058, "epoch": 3.370964247020585, "grad_norm": 0.03958556801080704, "learning_rate": 5.076361609620829e-06, "loss": 0.027960905432701112, "mean_token_accuracy": 0.9936666667461396, "num_tokens": 24329539.0, "step": 3890 }, { "entropy": 1.9829755246639251, "epoch": 3.3796316359696643, "grad_norm": 4.082634925842285, "learning_rate": 5.027575816804016e-06, "loss": 0.030048039555549622, "mean_token_accuracy": 0.981467804312706, "num_tokens": 24395139.0, "step": 3900 }, { "epoch": 3.3796316359696643, "eval_entropy": 1.9591931365615693, "eval_loss": 0.08941441029310226, "eval_mean_token_accuracy": 0.9792530948842936, "eval_num_tokens": 24395139.0, "eval_runtime": 327.1897, "eval_samples_per_second": 4.915, "eval_steps_per_second": 0.614, "step": 3900 }, { "entropy": 2.0075402826070787, "epoch": 3.3882990249187435, "grad_norm": 0.6755623817443848, "learning_rate": 4.978946739274459e-06, "loss": 0.03598732650279999, "mean_token_accuracy": 0.9913191378116608, "num_tokens": 24454872.0, "step": 3910 }, { "entropy": 1.9580432906746865, "epoch": 3.396966413867822, "grad_norm": 1.2158863544464111, "learning_rate": 4.930475909668872e-06, "loss": 0.026130232214927673, "mean_token_accuracy": 0.9921944439411163, "num_tokens": 24521370.0, "step": 3920 }, { "entropy": 2.0222324401140215, "epoch": 3.4056338028169013, "grad_norm": 0.8751219511032104, "learning_rate": 4.882164855636487e-06, "loss": 0.02552185356616974, "mean_token_accuracy": 0.9933805853128433, "num_tokens": 24576883.0, "step": 3930 }, { "entropy": 2.0704391270875933, "epoch": 3.4143011917659805, "grad_norm": 2.4434635639190674, "learning_rate": 4.834015099790906e-06, "loss": 0.028062695264816286, "mean_token_accuracy": 0.9894948095083237, "num_tokens": 24633751.0, "step": 3940 }, { "entropy": 1.970983825623989, "epoch": 3.4229685807150596, "grad_norm": 0.634064793586731, "learning_rate": 4.786028159662117e-06, "loss": 0.04279245436191559, "mean_token_accuracy": 0.9896366760134697, "num_tokens": 24701133.0, "step": 3950 }, { "entropy": 2.004913279414177, "epoch": 3.4316359696641388, "grad_norm": 0.3501166105270386, "learning_rate": 4.738205547648672e-06, "loss": 0.042440015077590945, "mean_token_accuracy": 0.9844118610024453, "num_tokens": 24762905.0, "step": 3960 }, { "entropy": 2.072259470820427, "epoch": 3.440303358613218, "grad_norm": 3.5003762245178223, "learning_rate": 4.6905487709700085e-06, "loss": 0.047236514091491696, "mean_token_accuracy": 0.9868312641978264, "num_tokens": 24818283.0, "step": 3970 }, { "entropy": 2.02927243411541, "epoch": 3.448970747562297, "grad_norm": 1.2803966999053955, "learning_rate": 4.643059331618944e-06, "loss": 0.0166587769985199, "mean_token_accuracy": 0.9939999803900719, "num_tokens": 24878209.0, "step": 3980 }, { "entropy": 2.0472301214933397, "epoch": 3.4576381365113757, "grad_norm": 4.2303385734558105, "learning_rate": 4.59573872631436e-06, "loss": 0.01939603090286255, "mean_token_accuracy": 0.9944044515490532, "num_tokens": 24938597.0, "step": 3990 }, { "entropy": 1.9953694552183152, "epoch": 3.466305525460455, "grad_norm": 0.3093803822994232, "learning_rate": 4.548588446454008e-06, "loss": 0.037383252382278444, "mean_token_accuracy": 0.9848104313015937, "num_tokens": 25006002.0, "step": 4000 }, { "epoch": 3.466305525460455, "eval_entropy": 1.9465392015466643, "eval_loss": 0.08806028217077255, "eval_mean_token_accuracy": 0.9801172311626264, "eval_num_tokens": 25006002.0, "eval_runtime": 326.7668, "eval_samples_per_second": 4.921, "eval_steps_per_second": 0.615, "step": 4000 }, { "entropy": 2.0333161488175393, "epoch": 3.474972914409534, "grad_norm": 2.100350856781006, "learning_rate": 4.501609978067516e-06, "loss": 0.026050877571105958, "mean_token_accuracy": 0.9908463016152382, "num_tokens": 25066917.0, "step": 4010 }, { "entropy": 2.017795702815056, "epoch": 3.483640303358613, "grad_norm": 1.7681386470794678, "learning_rate": 4.454804801769546e-06, "loss": 0.020292817056179045, "mean_token_accuracy": 0.9933481246232987, "num_tokens": 25137437.0, "step": 4020 }, { "entropy": 1.9617122411727905, "epoch": 3.4923076923076923, "grad_norm": 1.2674654722213745, "learning_rate": 4.408174392713138e-06, "loss": 0.02206308990716934, "mean_token_accuracy": 0.9935388684272766, "num_tokens": 25210243.0, "step": 4030 }, { "entropy": 2.023272916674614, "epoch": 3.5009750812567715, "grad_norm": 2.1518187522888184, "learning_rate": 4.361720220543215e-06, "loss": 0.021042007207870483, "mean_token_accuracy": 0.9917860701680183, "num_tokens": 25269681.0, "step": 4040 }, { "entropy": 1.9716553181409835, "epoch": 3.5096424702058506, "grad_norm": 1.2463315725326538, "learning_rate": 4.315443749350268e-06, "loss": 0.03910002112388611, "mean_token_accuracy": 0.9899544030427933, "num_tokens": 25334274.0, "step": 4050 }, { "entropy": 2.015067180991173, "epoch": 3.5183098591549298, "grad_norm": 0.2211289405822754, "learning_rate": 4.269346437624192e-06, "loss": 0.03428694009780884, "mean_token_accuracy": 0.9854496344923973, "num_tokens": 25397672.0, "step": 4060 }, { "entropy": 2.032247778773308, "epoch": 3.526977248104009, "grad_norm": 1.6791901588439941, "learning_rate": 4.223429738208351e-06, "loss": 0.01901150345802307, "mean_token_accuracy": 0.9931851238012314, "num_tokens": 25460938.0, "step": 4070 }, { "entropy": 1.9478510588407516, "epoch": 3.5356446370530876, "grad_norm": 0.3655602037906647, "learning_rate": 4.177695098253766e-06, "loss": 0.016408833861351012, "mean_token_accuracy": 0.9949289828538894, "num_tokens": 25531511.0, "step": 4080 }, { "entropy": 2.017333817481995, "epoch": 3.5443120260021668, "grad_norm": 2.554927349090576, "learning_rate": 4.132143959173517e-06, "loss": 0.033222931623458865, "mean_token_accuracy": 0.9914083287119866, "num_tokens": 25596302.0, "step": 4090 }, { "entropy": 1.9841288179159164, "epoch": 3.552979414951246, "grad_norm": 8.13968563079834, "learning_rate": 4.086777756597299e-06, "loss": 0.039189353585243225, "mean_token_accuracy": 0.9884973883628845, "num_tokens": 25659371.0, "step": 4100 }, { "epoch": 3.552979414951246, "eval_entropy": 1.9524362116903808, "eval_loss": 0.08749101310968399, "eval_mean_token_accuracy": 0.9797243757627496, "eval_num_tokens": 25659371.0, "eval_runtime": 326.6545, "eval_samples_per_second": 4.923, "eval_steps_per_second": 0.615, "step": 4100 }, { "entropy": 2.0628657907247545, "epoch": 3.561646803900325, "grad_norm": 0.14109309017658234, "learning_rate": 4.0415979203261946e-06, "loss": 0.0225689560174942, "mean_token_accuracy": 0.9902002736926079, "num_tokens": 25718185.0, "step": 4110 }, { "entropy": 2.007545919716358, "epoch": 3.570314192849404, "grad_norm": 0.3464651107788086, "learning_rate": 3.9966058742876e-06, "loss": 0.02009371221065521, "mean_token_accuracy": 0.9955977171659469, "num_tokens": 25780142.0, "step": 4120 }, { "entropy": 2.0243140310049057, "epoch": 3.5789815817984834, "grad_norm": 2.1290290355682373, "learning_rate": 3.95180303649035e-06, "loss": 0.02304726988077164, "mean_token_accuracy": 0.9939990416169167, "num_tokens": 25839881.0, "step": 4130 }, { "entropy": 2.0234414398670197, "epoch": 3.587648970747562, "grad_norm": 0.014731453731656075, "learning_rate": 3.907190818980026e-06, "loss": 0.050000560283660886, "mean_token_accuracy": 0.9866971537470818, "num_tokens": 25902869.0, "step": 4140 }, { "entropy": 2.0233711034059523, "epoch": 3.596316359696641, "grad_norm": 3.3977596759796143, "learning_rate": 3.862770627794453e-06, "loss": 0.0322685718536377, "mean_token_accuracy": 0.9900472685694695, "num_tokens": 25965513.0, "step": 4150 }, { "entropy": 2.0063869461417196, "epoch": 3.6049837486457204, "grad_norm": 2.6405301094055176, "learning_rate": 3.818543862919387e-06, "loss": 0.014192065596580506, "mean_token_accuracy": 0.9960492521524429, "num_tokens": 26023436.0, "step": 4160 }, { "entropy": 2.035813573002815, "epoch": 3.6136511375947995, "grad_norm": 0.14692693948745728, "learning_rate": 3.7745119182443845e-06, "loss": 0.013922086358070374, "mean_token_accuracy": 0.9962173581123352, "num_tokens": 26085809.0, "step": 4170 }, { "entropy": 1.9604667097330093, "epoch": 3.6223185265438786, "grad_norm": 2.886298418045044, "learning_rate": 3.730676181518883e-06, "loss": 0.02352510243654251, "mean_token_accuracy": 0.9951101526618004, "num_tokens": 26154928.0, "step": 4180 }, { "entropy": 2.037091489136219, "epoch": 3.630985915492958, "grad_norm": 0.3143669366836548, "learning_rate": 3.687038034308459e-06, "loss": 0.025397229194641113, "mean_token_accuracy": 0.9937299221754075, "num_tokens": 26209579.0, "step": 4190 }, { "entropy": 1.8821268051862716, "epoch": 3.639653304442037, "grad_norm": 2.5476582050323486, "learning_rate": 3.6435988519512844e-06, "loss": 0.018459653854370116, "mean_token_accuracy": 0.9935011580586434, "num_tokens": 26284212.0, "step": 4200 }, { "epoch": 3.639653304442037, "eval_entropy": 1.9587232580232383, "eval_loss": 0.08999490737915039, "eval_mean_token_accuracy": 0.9799567007306796, "eval_num_tokens": 26284212.0, "eval_runtime": 326.9787, "eval_samples_per_second": 4.918, "eval_steps_per_second": 0.615, "step": 4200 }, { "entropy": 2.0751129180192946, "epoch": 3.648320693391116, "grad_norm": 0.25621309876441956, "learning_rate": 3.600360003514772e-06, "loss": 0.05827196836471558, "mean_token_accuracy": 0.978828464448452, "num_tokens": 26344861.0, "step": 4210 }, { "entropy": 2.016257882118225, "epoch": 3.6569880823401952, "grad_norm": 0.23999305069446564, "learning_rate": 3.5573228517524437e-06, "loss": 0.01675285995006561, "mean_token_accuracy": 0.9950248003005981, "num_tokens": 26412096.0, "step": 4220 }, { "entropy": 2.011643001437187, "epoch": 3.6656554712892744, "grad_norm": 1.2057989835739136, "learning_rate": 3.5144887530609683e-06, "loss": 0.022135333716869356, "mean_token_accuracy": 0.9908907547593117, "num_tokens": 26473508.0, "step": 4230 }, { "entropy": 2.0545772433280947, "epoch": 3.674322860238353, "grad_norm": 1.1900558471679688, "learning_rate": 3.471859057437421e-06, "loss": 0.0230675607919693, "mean_token_accuracy": 0.9927938759326935, "num_tokens": 26536200.0, "step": 4240 }, { "entropy": 2.0200571775436402, "epoch": 3.6829902491874322, "grad_norm": 0.5839977860450745, "learning_rate": 3.4294351084367184e-06, "loss": 0.03541991114616394, "mean_token_accuracy": 0.9827380672097206, "num_tokens": 26593855.0, "step": 4250 }, { "entropy": 2.008121719956398, "epoch": 3.6916576381365114, "grad_norm": 4.034195423126221, "learning_rate": 3.3872182431292968e-06, "loss": 0.04164910316467285, "mean_token_accuracy": 0.98883635699749, "num_tokens": 26657227.0, "step": 4260 }, { "entropy": 2.045969045162201, "epoch": 3.7003250270855905, "grad_norm": 2.9138400554656982, "learning_rate": 3.3452097920589587e-06, "loss": 0.01186869889497757, "mean_token_accuracy": 0.995833332836628, "num_tokens": 26714896.0, "step": 4270 }, { "entropy": 2.0022309213876723, "epoch": 3.7089924160346697, "grad_norm": 2.3397390842437744, "learning_rate": 3.3034110792009353e-06, "loss": 0.033094662427902224, "mean_token_accuracy": 0.9868162363767624, "num_tokens": 26782122.0, "step": 4280 }, { "entropy": 1.970974361896515, "epoch": 3.7176598049837484, "grad_norm": 0.0644071027636528, "learning_rate": 3.2618234219201704e-06, "loss": 0.02641391158103943, "mean_token_accuracy": 0.9948458999395371, "num_tokens": 26853663.0, "step": 4290 }, { "entropy": 2.073245695233345, "epoch": 3.7263271939328275, "grad_norm": 0.4545290470123291, "learning_rate": 3.220448130929793e-06, "loss": 0.03868321180343628, "mean_token_accuracy": 0.9880670920014382, "num_tokens": 26907980.0, "step": 4300 }, { "epoch": 3.7263271939328275, "eval_entropy": 1.9598178709324319, "eval_loss": 0.08660746365785599, "eval_mean_token_accuracy": 0.9800613602595543, "eval_num_tokens": 26907980.0, "eval_runtime": 326.8085, "eval_samples_per_second": 4.92, "eval_steps_per_second": 0.615, "step": 4300 }, { "entropy": 2.106029862165451, "epoch": 3.7349945828819067, "grad_norm": 5.831691741943359, "learning_rate": 3.1792865102498105e-06, "loss": 0.043834912776947024, "mean_token_accuracy": 0.9932289361953736, "num_tokens": 26971535.0, "step": 4310 }, { "entropy": 2.001392534375191, "epoch": 3.743661971830986, "grad_norm": 1.1307673454284668, "learning_rate": 3.1383398571660017e-06, "loss": 0.015590465068817139, "mean_token_accuracy": 0.9919345244765282, "num_tokens": 27040212.0, "step": 4320 }, { "entropy": 2.0088124960660934, "epoch": 3.752329360780065, "grad_norm": 1.474653959274292, "learning_rate": 3.0976094621890485e-06, "loss": 0.0228209063410759, "mean_token_accuracy": 0.9975250825285912, "num_tokens": 27103701.0, "step": 4330 }, { "entropy": 2.0691784262657165, "epoch": 3.760996749729144, "grad_norm": 0.13686347007751465, "learning_rate": 3.0570966090138467e-06, "loss": 0.03443102836608887, "mean_token_accuracy": 0.991241104900837, "num_tokens": 27166073.0, "step": 4340 }, { "entropy": 2.037180745601654, "epoch": 3.7696641386782233, "grad_norm": 0.07159221917390823, "learning_rate": 3.0168025744790576e-06, "loss": 0.036087846755981444, "mean_token_accuracy": 0.9858055546879768, "num_tokens": 27227475.0, "step": 4350 }, { "entropy": 2.0310893684625624, "epoch": 3.7783315276273024, "grad_norm": 0.6335000991821289, "learning_rate": 2.9767286285268535e-06, "loss": 0.06315004825592041, "mean_token_accuracy": 0.9883092626929283, "num_tokens": 27292889.0, "step": 4360 }, { "entropy": 2.092084974050522, "epoch": 3.7869989165763815, "grad_norm": 1.302903413772583, "learning_rate": 2.9368760341629097e-06, "loss": 0.02792898118495941, "mean_token_accuracy": 0.9912491559982299, "num_tokens": 27348266.0, "step": 4370 }, { "entropy": 2.060304436087608, "epoch": 3.7956663055254607, "grad_norm": 0.4250950515270233, "learning_rate": 2.897246047416589e-06, "loss": 0.028717631101608278, "mean_token_accuracy": 0.996091590821743, "num_tokens": 27405982.0, "step": 4380 }, { "entropy": 2.083743101358414, "epoch": 3.8043336944745394, "grad_norm": 3.3967700004577637, "learning_rate": 2.8578399173013572e-06, "loss": 0.08340678811073303, "mean_token_accuracy": 0.9754736825823784, "num_tokens": 27463260.0, "step": 4390 }, { "entropy": 1.9716408044099807, "epoch": 3.8130010834236185, "grad_norm": 0.5757962465286255, "learning_rate": 2.818658885775414e-06, "loss": 0.013928134739398957, "mean_token_accuracy": 0.9954588785767555, "num_tokens": 27528099.0, "step": 4400 }, { "epoch": 3.8130010834236185, "eval_entropy": 1.9703540167405238, "eval_loss": 0.08586890250444412, "eval_mean_token_accuracy": 0.9799414511343733, "eval_num_tokens": 27528099.0, "eval_runtime": 326.7346, "eval_samples_per_second": 4.921, "eval_steps_per_second": 0.615, "step": 4400 }, { "entropy": 1.9763288021087646, "epoch": 3.8216684723726977, "grad_norm": 0.44175952672958374, "learning_rate": 2.7797041877025565e-06, "loss": 0.028418776392936707, "mean_token_accuracy": 0.989984379708767, "num_tokens": 27596380.0, "step": 4410 }, { "entropy": 2.0026954263448715, "epoch": 3.830335861321777, "grad_norm": 0.5693495869636536, "learning_rate": 2.7409770508132605e-06, "loss": 0.043587663769721986, "mean_token_accuracy": 0.9874644920229911, "num_tokens": 27656613.0, "step": 4420 }, { "entropy": 1.9414435267448424, "epoch": 3.839003250270856, "grad_norm": 4.053891658782959, "learning_rate": 2.7024786956659854e-06, "loss": 0.025079956650733946, "mean_token_accuracy": 0.9922862559556961, "num_tokens": 27726620.0, "step": 4430 }, { "entropy": 2.0779118567705153, "epoch": 3.847670639219935, "grad_norm": 0.06513004004955292, "learning_rate": 2.6642103356086933e-06, "loss": 0.022648689150810242, "mean_token_accuracy": 0.9921250343322754, "num_tokens": 27782546.0, "step": 4440 }, { "entropy": 2.052326163649559, "epoch": 3.856338028169014, "grad_norm": 2.3468716144561768, "learning_rate": 2.6261731767406296e-06, "loss": 0.041925692558288576, "mean_token_accuracy": 0.9881504774093628, "num_tokens": 27846707.0, "step": 4450 }, { "entropy": 1.968158569931984, "epoch": 3.865005417118093, "grad_norm": 0.15953290462493896, "learning_rate": 2.588368417874296e-06, "loss": 0.01032664328813553, "mean_token_accuracy": 0.9981753632426262, "num_tokens": 27915351.0, "step": 4460 }, { "entropy": 2.071339601278305, "epoch": 3.873672806067172, "grad_norm": 0.064334936439991, "learning_rate": 2.5507972504976774e-06, "loss": 0.05382372140884399, "mean_token_accuracy": 0.9884915590286255, "num_tokens": 27974044.0, "step": 4470 }, { "entropy": 2.0488192796707154, "epoch": 3.8823401950162513, "grad_norm": 0.23742307722568512, "learning_rate": 2.5134608587366695e-06, "loss": 0.030007198452949524, "mean_token_accuracy": 0.9883778721094132, "num_tokens": 28041557.0, "step": 4480 }, { "entropy": 2.0650737464427946, "epoch": 3.8910075839653304, "grad_norm": 0.2596496343612671, "learning_rate": 2.4763604193177913e-06, "loss": 0.023527370393276216, "mean_token_accuracy": 0.9875, "num_tokens": 28100710.0, "step": 4490 }, { "entropy": 2.0444571018218993, "epoch": 3.8996749729144096, "grad_norm": 0.31552854180336, "learning_rate": 2.4394971015310732e-06, "loss": 0.021546658873558045, "mean_token_accuracy": 0.993670429289341, "num_tokens": 28158419.0, "step": 4500 }, { "epoch": 3.8996749729144096, "eval_entropy": 1.9708711134260566, "eval_loss": 0.0864068791270256, "eval_mean_token_accuracy": 0.9796283820375281, "eval_num_tokens": 28158419.0, "eval_runtime": 326.9161, "eval_samples_per_second": 4.919, "eval_steps_per_second": 0.615, "step": 4500 }, { "entropy": 2.087741878628731, "epoch": 3.9083423618634887, "grad_norm": 0.23832260072231293, "learning_rate": 2.4028720671932047e-06, "loss": 0.054845225811004636, "mean_token_accuracy": 0.9857747331261635, "num_tokens": 28213762.0, "step": 4510 }, { "entropy": 2.0132829934358596, "epoch": 3.917009750812568, "grad_norm": 0.25584664940834045, "learning_rate": 2.366486470610936e-06, "loss": 0.01848226636648178, "mean_token_accuracy": 0.9928658232092857, "num_tokens": 28278471.0, "step": 4520 }, { "entropy": 2.045706260204315, "epoch": 3.925677139761647, "grad_norm": 2.5656206607818604, "learning_rate": 2.3303414585446805e-06, "loss": 0.022681842744350433, "mean_token_accuracy": 0.9910395190119743, "num_tokens": 28338647.0, "step": 4530 }, { "entropy": 1.99814330637455, "epoch": 3.934344528710726, "grad_norm": 0.9603461623191833, "learning_rate": 2.294438170172384e-06, "loss": 0.02413419634103775, "mean_token_accuracy": 0.9891596958041191, "num_tokens": 28410160.0, "step": 4540 }, { "entropy": 2.0732466995716097, "epoch": 3.943011917659805, "grad_norm": 1.4361649751663208, "learning_rate": 2.2587777370536056e-06, "loss": 0.037426996231079104, "mean_token_accuracy": 0.991052907705307, "num_tokens": 28467664.0, "step": 4550 }, { "entropy": 2.0532098948955535, "epoch": 3.951679306608884, "grad_norm": 2.0590333938598633, "learning_rate": 2.223361283093878e-06, "loss": 0.031706079840660095, "mean_token_accuracy": 0.9870526701211929, "num_tokens": 28527408.0, "step": 4560 }, { "entropy": 2.017728653550148, "epoch": 3.960346695557963, "grad_norm": 0.10862936824560165, "learning_rate": 2.188189924509262e-06, "loss": 0.02106429487466812, "mean_token_accuracy": 0.98840461820364, "num_tokens": 28587046.0, "step": 4570 }, { "entropy": 2.0349554061889648, "epoch": 3.9690140845070423, "grad_norm": 2.5669116973876953, "learning_rate": 2.153264769791188e-06, "loss": 0.04130597114562988, "mean_token_accuracy": 0.981039223074913, "num_tokens": 28646182.0, "step": 4580 }, { "entropy": 1.9828863322734833, "epoch": 3.9776814734561214, "grad_norm": 1.4713232517242432, "learning_rate": 2.1185869196714947e-06, "loss": 0.025165802240371703, "mean_token_accuracy": 0.9947456598281861, "num_tokens": 28714463.0, "step": 4590 }, { "entropy": 2.072134110331535, "epoch": 3.9863488624052006, "grad_norm": 2.247790575027466, "learning_rate": 2.084157467087765e-06, "loss": 0.021596594154834746, "mean_token_accuracy": 0.993795844912529, "num_tokens": 28775790.0, "step": 4600 }, { "epoch": 3.9863488624052006, "eval_entropy": 1.9691801563424258, "eval_loss": 0.08587238192558289, "eval_mean_token_accuracy": 0.9797982505304896, "eval_num_tokens": 28775790.0, "eval_runtime": 326.9013, "eval_samples_per_second": 4.919, "eval_steps_per_second": 0.615, "step": 4600 }, { "entropy": 2.0738868415355682, "epoch": 3.9950162513542793, "grad_norm": 0.9110870361328125, "learning_rate": 2.049977497148863e-06, "loss": 0.03904995024204254, "mean_token_accuracy": 0.985892140865326, "num_tokens": 28837387.0, "step": 4610 }, { "entropy": 2.030005083634303, "epoch": 4.003466955579632, "grad_norm": 0.24106350541114807, "learning_rate": 2.0160480871007316e-06, "loss": 0.01345173418521881, "mean_token_accuracy": 0.9953376727226453, "num_tokens": 28894661.0, "step": 4620 }, { "entropy": 2.007124736905098, "epoch": 4.012134344528711, "grad_norm": 0.5830142498016357, "learning_rate": 1.9823703062924584e-06, "loss": 0.006817830353975296, "mean_token_accuracy": 1.0, "num_tokens": 28962127.0, "step": 4630 }, { "entropy": 2.0393721789121626, "epoch": 4.02080173347779, "grad_norm": 0.5709890723228455, "learning_rate": 1.948945216142558e-06, "loss": 0.029663556814193727, "mean_token_accuracy": 0.9864947348833084, "num_tokens": 29027460.0, "step": 4640 }, { "entropy": 1.9643317103385924, "epoch": 4.029469122426869, "grad_norm": 1.7358582019805908, "learning_rate": 1.9157738701055283e-06, "loss": 0.008620598912239074, "mean_token_accuracy": 0.9963573709130287, "num_tokens": 29094613.0, "step": 4650 }, { "entropy": 2.0889448076486588, "epoch": 4.038136511375948, "grad_norm": 0.604278564453125, "learning_rate": 1.882857313638634e-06, "loss": 0.03244847357273102, "mean_token_accuracy": 0.9926116779446602, "num_tokens": 29150702.0, "step": 4660 }, { "entropy": 2.0580625355243685, "epoch": 4.046803900325027, "grad_norm": 1.5685875415802002, "learning_rate": 1.8501965841689807e-06, "loss": 0.0101649709045887, "mean_token_accuracy": 0.9972690224647522, "num_tokens": 29210797.0, "step": 4670 }, { "entropy": 1.9661096304655075, "epoch": 4.055471289274106, "grad_norm": 1.1568413972854614, "learning_rate": 1.8177927110607995e-06, "loss": 0.018484874069690703, "mean_token_accuracy": 0.9930728524923325, "num_tokens": 29278613.0, "step": 4680 }, { "entropy": 2.0536277323961256, "epoch": 4.064138678223185, "grad_norm": 0.721993088722229, "learning_rate": 1.7856467155830137e-06, "loss": 0.01394631266593933, "mean_token_accuracy": 0.9933244362473488, "num_tokens": 29338705.0, "step": 4690 }, { "entropy": 2.0374705642461777, "epoch": 4.072806067172264, "grad_norm": 0.7892134785652161, "learning_rate": 1.7537596108770417e-06, "loss": 0.03956481218338013, "mean_token_accuracy": 0.9904462099075317, "num_tokens": 29398735.0, "step": 4700 }, { "epoch": 4.072806067172264, "eval_entropy": 1.9702677424274273, "eval_loss": 0.08744855970144272, "eval_mean_token_accuracy": 0.9802299376150861, "eval_num_tokens": 29398735.0, "eval_runtime": 326.9756, "eval_samples_per_second": 4.918, "eval_steps_per_second": 0.615, "step": 4700 }, { "entropy": 2.099683851003647, "epoch": 4.081473456121343, "grad_norm": 0.41404569149017334, "learning_rate": 1.722132401924882e-06, "loss": 0.008110367506742478, "mean_token_accuracy": 0.9981684982776642, "num_tokens": 29454416.0, "step": 4710 }, { "entropy": 2.0630714267492296, "epoch": 4.090140845070422, "grad_norm": 0.45244091749191284, "learning_rate": 1.6907660855174256e-06, "loss": 0.022814184427261353, "mean_token_accuracy": 0.9923579677939415, "num_tokens": 29516425.0, "step": 4720 }, { "entropy": 2.1098799794912337, "epoch": 4.098808234019502, "grad_norm": 0.8225563168525696, "learning_rate": 1.6596616502230479e-06, "loss": 0.02271169424057007, "mean_token_accuracy": 0.9904859319329262, "num_tokens": 29570595.0, "step": 4730 }, { "entropy": 2.017019960284233, "epoch": 4.107475622968581, "grad_norm": 3.7492403984069824, "learning_rate": 1.6288200763564422e-06, "loss": 0.03186882734298706, "mean_token_accuracy": 0.9883370444178581, "num_tokens": 29636384.0, "step": 4740 }, { "entropy": 2.1209054619073866, "epoch": 4.11614301191766, "grad_norm": 0.7058954834938049, "learning_rate": 1.5982423359477383e-06, "loss": 0.020897382497787477, "mean_token_accuracy": 0.9931535944342613, "num_tokens": 29687984.0, "step": 4750 }, { "entropy": 2.0571787297725677, "epoch": 4.124810400866739, "grad_norm": 0.6924902200698853, "learning_rate": 1.5679293927118545e-06, "loss": 0.01724575012922287, "mean_token_accuracy": 0.9941381692886353, "num_tokens": 29752451.0, "step": 4760 }, { "entropy": 2.066095697879791, "epoch": 4.133477789815818, "grad_norm": 0.8853573799133301, "learning_rate": 1.5378822020181339e-06, "loss": 0.019921644032001494, "mean_token_accuracy": 0.9936603635549546, "num_tokens": 29816586.0, "step": 4770 }, { "entropy": 2.036505189538002, "epoch": 4.142145178764897, "grad_norm": 0.7433391213417053, "learning_rate": 1.5081017108602203e-06, "loss": 0.009318779408931731, "mean_token_accuracy": 0.9980769231915474, "num_tokens": 29886863.0, "step": 4780 }, { "entropy": 2.023917606472969, "epoch": 4.150812567713976, "grad_norm": 0.5994493961334229, "learning_rate": 1.4785888578262265e-06, "loss": 0.014561480283737183, "mean_token_accuracy": 0.9964600846171379, "num_tokens": 29944175.0, "step": 4790 }, { "entropy": 2.0322933435440063, "epoch": 4.159479956663056, "grad_norm": 1.3376491069793701, "learning_rate": 1.449344573069149e-06, "loss": 0.018283985555171967, "mean_token_accuracy": 0.9946957662701607, "num_tokens": 30009144.0, "step": 4800 }, { "epoch": 4.159479956663056, "eval_entropy": 1.9736577497785956, "eval_loss": 0.08808128535747528, "eval_mean_token_accuracy": 0.9802062247523028, "eval_num_tokens": 30009144.0, "eval_runtime": 326.8502, "eval_samples_per_second": 4.92, "eval_steps_per_second": 0.615, "step": 4800 }, { "entropy": 2.0404345244169235, "epoch": 4.168147345612135, "grad_norm": 2.575533628463745, "learning_rate": 1.4203697782775484e-06, "loss": 0.01365792155265808, "mean_token_accuracy": 0.9939484119415283, "num_tokens": 30077467.0, "step": 4810 }, { "entropy": 2.024330788850784, "epoch": 4.176814734561214, "grad_norm": 0.26384237408638, "learning_rate": 1.391665386646498e-06, "loss": 0.021796645224094392, "mean_token_accuracy": 0.9972478061914444, "num_tokens": 30141247.0, "step": 4820 }, { "entropy": 2.062552109360695, "epoch": 4.185482123510292, "grad_norm": 3.534402370452881, "learning_rate": 1.3632323028488149e-06, "loss": 0.015387092530727387, "mean_token_accuracy": 0.9924221619963646, "num_tokens": 30197279.0, "step": 4830 }, { "entropy": 1.9646895557641983, "epoch": 4.194149512459371, "grad_norm": 1.8417781591415405, "learning_rate": 1.3350714230065386e-06, "loss": 0.02345104664564133, "mean_token_accuracy": 0.9931765854358673, "num_tokens": 30269676.0, "step": 4840 }, { "entropy": 1.98412424325943, "epoch": 4.20281690140845, "grad_norm": 3.6741926670074463, "learning_rate": 1.3071836346626865e-06, "loss": 0.03531681299209595, "mean_token_accuracy": 0.9901143789291382, "num_tokens": 30330336.0, "step": 4850 }, { "entropy": 2.0338327258825304, "epoch": 4.21148429035753, "grad_norm": 0.12444645166397095, "learning_rate": 1.2795698167532888e-06, "loss": 0.00578281432390213, "mean_token_accuracy": 0.9981522962450982, "num_tokens": 30395578.0, "step": 4860 }, { "entropy": 2.014167508482933, "epoch": 4.220151679306609, "grad_norm": 2.159712076187134, "learning_rate": 1.2522308395796789e-06, "loss": 0.017886465787887572, "mean_token_accuracy": 0.9974074080586434, "num_tokens": 30459507.0, "step": 4870 }, { "entropy": 2.115958270430565, "epoch": 4.228819068255688, "grad_norm": 2.1067309379577637, "learning_rate": 1.2251675647810724e-06, "loss": 0.01809442341327667, "mean_token_accuracy": 0.9926080524921417, "num_tokens": 30513568.0, "step": 4880 }, { "entropy": 2.0274746090173723, "epoch": 4.237486457204767, "grad_norm": 1.9293690919876099, "learning_rate": 1.1983808453074009e-06, "loss": 0.011695823818445205, "mean_token_accuracy": 0.9947041690349578, "num_tokens": 30582049.0, "step": 4890 }, { "entropy": 2.0403768837451937, "epoch": 4.246153846153846, "grad_norm": 0.4305020570755005, "learning_rate": 1.1718715253924417e-06, "loss": 0.011889181286096572, "mean_token_accuracy": 0.9974476903676986, "num_tokens": 30646717.0, "step": 4900 }, { "epoch": 4.246153846153846, "eval_entropy": 1.9705782998260575, "eval_loss": 0.08883950114250183, "eval_mean_token_accuracy": 0.97969317287948, "eval_num_tokens": 30646717.0, "eval_runtime": 326.98, "eval_samples_per_second": 4.918, "eval_steps_per_second": 0.615, "step": 4900 }, { "entropy": 2.0958633810281753, "epoch": 4.254821235102925, "grad_norm": 1.2778172492980957, "learning_rate": 1.1456404405271993e-06, "loss": 0.014013904333114623, "mean_token_accuracy": 0.9959134608507156, "num_tokens": 30701308.0, "step": 4910 }, { "entropy": 2.013311989605427, "epoch": 4.2634886240520045, "grad_norm": 2.811065196990967, "learning_rate": 1.1196884174335842e-06, "loss": 0.01911211907863617, "mean_token_accuracy": 0.99190693795681, "num_tokens": 30754634.0, "step": 4920 }, { "entropy": 2.0537849366664886, "epoch": 4.272156013001084, "grad_norm": 0.43671995401382446, "learning_rate": 1.094016274038341e-06, "loss": 0.009578761458396912, "mean_token_accuracy": 0.9973684206604958, "num_tokens": 30811429.0, "step": 4930 }, { "entropy": 2.042087969183922, "epoch": 4.280823401950163, "grad_norm": 0.10949576646089554, "learning_rate": 1.0686248194472882e-06, "loss": 0.018562574684619904, "mean_token_accuracy": 0.9698333323001862, "num_tokens": 30876505.0, "step": 4940 }, { "entropy": 2.132018208503723, "epoch": 4.289490790899242, "grad_norm": 0.870583713054657, "learning_rate": 1.043514853919807e-06, "loss": 0.008388452231884003, "mean_token_accuracy": 0.998571427166462, "num_tokens": 30935265.0, "step": 4950 }, { "entropy": 1.9139719784259797, "epoch": 4.298158179848321, "grad_norm": 0.1519097238779068, "learning_rate": 1.018687168843625e-06, "loss": 0.0245489701628685, "mean_token_accuracy": 0.9940625011920929, "num_tokens": 31004294.0, "step": 4960 }, { "entropy": 1.9107709616422652, "epoch": 4.3068255687974, "grad_norm": 4.961195468902588, "learning_rate": 9.941425467098641e-07, "loss": 0.00963737890124321, "mean_token_accuracy": 0.9982142850756646, "num_tokens": 31076072.0, "step": 4970 }, { "entropy": 2.084628200531006, "epoch": 4.3154929577464785, "grad_norm": 1.608235478401184, "learning_rate": 9.698817610883915e-07, "loss": 0.018618135154247283, "mean_token_accuracy": 0.9952801674604416, "num_tokens": 31134655.0, "step": 4980 }, { "entropy": 2.039292076230049, "epoch": 4.324160346695558, "grad_norm": 1.2228981256484985, "learning_rate": 9.459055766034342e-07, "loss": 0.026717761158943178, "mean_token_accuracy": 0.9923743084073067, "num_tokens": 31198217.0, "step": 4990 }, { "entropy": 2.0533795297145843, "epoch": 4.332827735644637, "grad_norm": 0.4585072100162506, "learning_rate": 9.222147489094746e-07, "loss": 0.013927005231380463, "mean_token_accuracy": 0.994015522301197, "num_tokens": 31259134.0, "step": 5000 }, { "epoch": 4.332827735644637, "eval_entropy": 1.9728771590474825, "eval_loss": 0.08881022036075592, "eval_mean_token_accuracy": 0.9795496161304303, "eval_num_tokens": 31259134.0, "eval_runtime": 327.0558, "eval_samples_per_second": 4.917, "eval_steps_per_second": 0.615, "step": 5000 }, { "entropy": 2.0826673805713654, "epoch": 4.341495124593716, "grad_norm": 1.3024990558624268, "learning_rate": 8.988100246674447e-07, "loss": 0.02505913972854614, "mean_token_accuracy": 0.990269535779953, "num_tokens": 31319291.0, "step": 5010 }, { "entropy": 1.9910820811986922, "epoch": 4.350162513542795, "grad_norm": 0.28213417530059814, "learning_rate": 8.756921415211872e-07, "loss": 0.03284958600997925, "mean_token_accuracy": 0.9892865911126136, "num_tokens": 31389570.0, "step": 5020 }, { "entropy": 1.9260858178138733, "epoch": 4.358829902491874, "grad_norm": 1.6689592599868774, "learning_rate": 8.528618280742118e-07, "loss": 0.022429963946342467, "mean_token_accuracy": 0.9873416185379028, "num_tokens": 31456570.0, "step": 5030 }, { "entropy": 2.075908821821213, "epoch": 4.367497291440953, "grad_norm": 0.5058390498161316, "learning_rate": 8.303198038667216e-07, "loss": 0.03578021228313446, "mean_token_accuracy": 0.9861092865467072, "num_tokens": 31512591.0, "step": 5040 }, { "entropy": 2.0401781380176542, "epoch": 4.3761646803900325, "grad_norm": 2.0004308223724365, "learning_rate": 8.080667793529495e-07, "loss": 0.035635894536972045, "mean_token_accuracy": 0.9919731870293618, "num_tokens": 31572815.0, "step": 5050 }, { "entropy": 2.062747171521187, "epoch": 4.384832069339112, "grad_norm": 1.3225598335266113, "learning_rate": 7.861034558787594e-07, "loss": 0.010875914245843887, "mean_token_accuracy": 0.9954330354928971, "num_tokens": 31636449.0, "step": 5060 }, { "entropy": 2.0818180203437806, "epoch": 4.393499458288191, "grad_norm": 0.27941176295280457, "learning_rate": 7.644305256595419e-07, "loss": 0.012188396602869033, "mean_token_accuracy": 0.9975026711821556, "num_tokens": 31699355.0, "step": 5070 }, { "entropy": 2.0237564265728, "epoch": 4.40216684723727, "grad_norm": 0.18985368311405182, "learning_rate": 7.430486717583962e-07, "loss": 0.010058794915676118, "mean_token_accuracy": 0.99608004540205, "num_tokens": 31764950.0, "step": 5080 }, { "entropy": 2.0428464114665985, "epoch": 4.410834236186349, "grad_norm": 1.510493278503418, "learning_rate": 7.21958568064608e-07, "loss": 0.012500947713851929, "mean_token_accuracy": 0.9923106044530868, "num_tokens": 31823167.0, "step": 5090 }, { "entropy": 2.0478352516889573, "epoch": 4.419501625135428, "grad_norm": 0.569312572479248, "learning_rate": 7.011608792724068e-07, "loss": 0.01235663816332817, "mean_token_accuracy": 0.9952962964773178, "num_tokens": 31883856.0, "step": 5100 }, { "epoch": 4.419501625135428, "eval_entropy": 1.9781580647425865, "eval_loss": 0.08919015526771545, "eval_mean_token_accuracy": 0.9796797802199179, "eval_num_tokens": 31883856.0, "eval_runtime": 326.8313, "eval_samples_per_second": 4.92, "eval_steps_per_second": 0.615, "step": 5100 }, { "entropy": 2.108269548416138, "epoch": 4.428169014084507, "grad_norm": 0.07893358916044235, "learning_rate": 6.806562608600186e-07, "loss": 0.004451769217848778, "mean_token_accuracy": 1.0, "num_tokens": 31938054.0, "step": 5110 }, { "entropy": 2.075284495949745, "epoch": 4.4368364030335865, "grad_norm": 3.848189115524292, "learning_rate": 6.604453590690007e-07, "loss": 0.03046499490737915, "mean_token_accuracy": 0.9956063643097878, "num_tokens": 31995451.0, "step": 5120 }, { "entropy": 1.964671802520752, "epoch": 4.445503791982665, "grad_norm": 2.6819865703582764, "learning_rate": 6.405288108838836e-07, "loss": 0.03677540421485901, "mean_token_accuracy": 0.981814344227314, "num_tokens": 32064564.0, "step": 5130 }, { "entropy": 2.0767350763082506, "epoch": 4.454171180931744, "grad_norm": 0.2573661208152771, "learning_rate": 6.209072440120912e-07, "loss": 0.01814277321100235, "mean_token_accuracy": 0.9919444441795349, "num_tokens": 32126879.0, "step": 5140 }, { "entropy": 2.0255597680807114, "epoch": 4.462838569880823, "grad_norm": 0.5254562497138977, "learning_rate": 6.015812768641582e-07, "loss": 0.009591031819581985, "mean_token_accuracy": 0.9972966268658638, "num_tokens": 32191835.0, "step": 5150 }, { "entropy": 2.0272518664598467, "epoch": 4.471505958829902, "grad_norm": 1.8054099082946777, "learning_rate": 5.825515185342323e-07, "loss": 0.012653954327106476, "mean_token_accuracy": 0.9968452379107475, "num_tokens": 32260376.0, "step": 5160 }, { "entropy": 2.058269131183624, "epoch": 4.480173347778981, "grad_norm": 0.6068629026412964, "learning_rate": 5.638185687808917e-07, "loss": 0.009308335930109024, "mean_token_accuracy": 0.9960426911711693, "num_tokens": 32318458.0, "step": 5170 }, { "entropy": 2.1178119242191316, "epoch": 4.4888407367280605, "grad_norm": 0.09419647604227066, "learning_rate": 5.453830180082309e-07, "loss": 0.009917216002941131, "mean_token_accuracy": 0.9953914135694504, "num_tokens": 32373717.0, "step": 5180 }, { "entropy": 2.053645688295364, "epoch": 4.49750812567714, "grad_norm": 0.396065890789032, "learning_rate": 5.27245447247261e-07, "loss": 0.01238245666027069, "mean_token_accuracy": 0.9962280064821243, "num_tokens": 32426237.0, "step": 5190 }, { "entropy": 2.058378967642784, "epoch": 4.506175514626219, "grad_norm": 0.24088667333126068, "learning_rate": 5.094064281375832e-07, "loss": 0.008150581270456314, "mean_token_accuracy": 0.9978787884116173, "num_tokens": 32486772.0, "step": 5200 }, { "epoch": 4.506175514626219, "eval_entropy": 1.9773344519126475, "eval_loss": 0.08962774276733398, "eval_mean_token_accuracy": 0.980161461960617, "eval_num_tokens": 32486772.0, "eval_runtime": 327.0625, "eval_samples_per_second": 4.916, "eval_steps_per_second": 0.615, "step": 5200 }, { "entropy": 2.000825381278992, "epoch": 4.514842903575298, "grad_norm": 0.13512328267097473, "learning_rate": 4.918665229093955e-07, "loss": 0.009017366915941238, "mean_token_accuracy": 0.9954687505960464, "num_tokens": 32555123.0, "step": 5210 }, { "entropy": 2.0178422331809998, "epoch": 4.523510292524377, "grad_norm": 1.763617753982544, "learning_rate": 4.746262843657545e-07, "loss": 0.015950243175029754, "mean_token_accuracy": 0.991420355439186, "num_tokens": 32617425.0, "step": 5220 }, { "entropy": 2.0761267840862274, "epoch": 4.532177681473456, "grad_norm": 0.4732784926891327, "learning_rate": 4.5768625586515515e-07, "loss": 0.013394179940223693, "mean_token_accuracy": 0.9954727560281753, "num_tokens": 32671383.0, "step": 5230 }, { "entropy": 2.1209077060222628, "epoch": 4.540845070422535, "grad_norm": 0.24119587242603302, "learning_rate": 4.4104697130441297e-07, "loss": 0.006799912452697754, "mean_token_accuracy": 0.9964460790157318, "num_tokens": 32721566.0, "step": 5240 }, { "entropy": 2.023488113284111, "epoch": 4.5495124593716145, "grad_norm": 0.9742321968078613, "learning_rate": 4.247089551018335e-07, "loss": 0.008217556774616242, "mean_token_accuracy": 0.9959012061357498, "num_tokens": 32785235.0, "step": 5250 }, { "entropy": 2.0245584696531296, "epoch": 4.558179848320694, "grad_norm": 0.7126546502113342, "learning_rate": 4.08672722180683e-07, "loss": 0.013321210443973542, "mean_token_accuracy": 0.9972473606467247, "num_tokens": 32850508.0, "step": 5260 }, { "entropy": 2.0293969064950943, "epoch": 4.566847237269773, "grad_norm": 0.19109396636486053, "learning_rate": 3.9293877795296033e-07, "loss": 0.024787485599517822, "mean_token_accuracy": 0.9899170100688934, "num_tokens": 32917953.0, "step": 5270 }, { "entropy": 2.0705538392066956, "epoch": 4.575514626218851, "grad_norm": 2.082110643386841, "learning_rate": 3.775076183034687e-07, "loss": 0.025293442606925964, "mean_token_accuracy": 0.9883344322443008, "num_tokens": 32980280.0, "step": 5280 }, { "entropy": 1.97212675511837, "epoch": 4.584182015167931, "grad_norm": 3.7733571529388428, "learning_rate": 3.623797295741882e-07, "loss": 0.026531627774238585, "mean_token_accuracy": 0.9859025999903679, "num_tokens": 33052310.0, "step": 5290 }, { "entropy": 2.1174137502908708, "epoch": 4.592849404117009, "grad_norm": 4.527464389801025, "learning_rate": 3.4755558854894454e-07, "loss": 0.05131498575210571, "mean_token_accuracy": 0.9909847050905227, "num_tokens": 33105153.0, "step": 5300 }, { "epoch": 4.592849404117009, "eval_entropy": 1.9771031633538394, "eval_loss": 0.08935187011957169, "eval_mean_token_accuracy": 0.9799883635482978, "eval_num_tokens": 33105153.0, "eval_runtime": 327.1357, "eval_samples_per_second": 4.915, "eval_steps_per_second": 0.614, "step": 5300 }, { "entropy": 2.0754479676485063, "epoch": 4.6015167930660885, "grad_norm": 0.21639882028102875, "learning_rate": 3.330356624383846e-07, "loss": 0.018829087913036346, "mean_token_accuracy": 0.9952528193593025, "num_tokens": 33163772.0, "step": 5310 }, { "entropy": 2.0545038670301436, "epoch": 4.610184182015168, "grad_norm": 0.3632142245769501, "learning_rate": 3.1882040886525023e-07, "loss": 0.020865590870380403, "mean_token_accuracy": 0.9914917916059494, "num_tokens": 33226699.0, "step": 5320 }, { "entropy": 2.0661454617977144, "epoch": 4.618851570964247, "grad_norm": 1.8460487127304077, "learning_rate": 3.049102758499567e-07, "loss": 0.019039011001586913, "mean_token_accuracy": 0.9947229847311974, "num_tokens": 33285047.0, "step": 5330 }, { "entropy": 2.0611626476049425, "epoch": 4.627518959913326, "grad_norm": 2.2364659309387207, "learning_rate": 2.9130570179647376e-07, "loss": 0.010900366306304931, "mean_token_accuracy": 0.995740094780922, "num_tokens": 33349369.0, "step": 5340 }, { "entropy": 2.0093062967061996, "epoch": 4.636186348862405, "grad_norm": 0.7252208590507507, "learning_rate": 2.7800711547850247e-07, "loss": 0.02175909876823425, "mean_token_accuracy": 0.9925066068768501, "num_tokens": 33419661.0, "step": 5350 }, { "entropy": 1.9689721822738648, "epoch": 4.644853737811484, "grad_norm": 0.11739201098680496, "learning_rate": 2.6501493602596683e-07, "loss": 0.01585783213376999, "mean_token_accuracy": 0.9941969141364098, "num_tokens": 33495787.0, "step": 5360 }, { "entropy": 1.9787477880716324, "epoch": 4.653521126760563, "grad_norm": 0.03642086684703827, "learning_rate": 2.5232957291180806e-07, "loss": 0.029417428374290466, "mean_token_accuracy": 0.9918199837207794, "num_tokens": 33563931.0, "step": 5370 }, { "entropy": 2.0737911581993105, "epoch": 4.6621885157096425, "grad_norm": 2.774217128753662, "learning_rate": 2.3995142593906563e-07, "loss": 0.014542682468891144, "mean_token_accuracy": 0.9953180745244026, "num_tokens": 33624815.0, "step": 5380 }, { "entropy": 2.0131901890039443, "epoch": 4.670855904658722, "grad_norm": 0.3904068171977997, "learning_rate": 2.2788088522829212e-07, "loss": 0.03030272722244263, "mean_token_accuracy": 0.9904125809669495, "num_tokens": 33689523.0, "step": 5390 }, { "entropy": 2.0369192749261855, "epoch": 4.679523293607801, "grad_norm": 0.18654713034629822, "learning_rate": 2.1611833120524838e-07, "loss": 0.010971380770206452, "mean_token_accuracy": 0.9960916191339493, "num_tokens": 33750941.0, "step": 5400 }, { "epoch": 4.679523293607801, "eval_entropy": 1.9789310124383044, "eval_loss": 0.08923472464084625, "eval_mean_token_accuracy": 0.9801432926263383, "eval_num_tokens": 33750941.0, "eval_runtime": 327.0832, "eval_samples_per_second": 4.916, "eval_steps_per_second": 0.615, "step": 5400 }, { "entropy": 2.0042553037405013, "epoch": 4.68819068255688, "grad_norm": 1.2499020099639893, "learning_rate": 2.0466413458891776e-07, "loss": 0.025074890255928038, "mean_token_accuracy": 0.9954362437129021, "num_tokens": 33809791.0, "step": 5410 }, { "entropy": 2.063493809103966, "epoch": 4.696858071505959, "grad_norm": 2.250760793685913, "learning_rate": 1.935186563798186e-07, "loss": 0.03190418183803558, "mean_token_accuracy": 0.9925678476691246, "num_tokens": 33875921.0, "step": 5420 }, { "entropy": 2.0530943751335142, "epoch": 4.705525460455038, "grad_norm": 1.5710461139678955, "learning_rate": 1.8268224784862899e-07, "loss": 0.012784861028194427, "mean_token_accuracy": 0.9956602081656456, "num_tokens": 33931632.0, "step": 5430 }, { "entropy": 2.046228414773941, "epoch": 4.714192849404117, "grad_norm": 5.684391021728516, "learning_rate": 1.7215525052511673e-07, "loss": 0.019351273775100708, "mean_token_accuracy": 0.9934533283114433, "num_tokens": 33994984.0, "step": 5440 }, { "entropy": 2.046843534708023, "epoch": 4.722860238353196, "grad_norm": 3.8622937202453613, "learning_rate": 1.6193799618737683e-07, "loss": 0.04347184896469116, "mean_token_accuracy": 0.9886655271053314, "num_tokens": 34061747.0, "step": 5450 }, { "entropy": 2.092145395278931, "epoch": 4.731527627302275, "grad_norm": 2.73188853263855, "learning_rate": 1.520308068513665e-07, "loss": 0.015788179636001588, "mean_token_accuracy": 0.9970826536417008, "num_tokens": 34118985.0, "step": 5460 }, { "entropy": 2.035344365239143, "epoch": 4.740195016251354, "grad_norm": 0.2667732536792755, "learning_rate": 1.4243399476076557e-07, "loss": 0.014378026127815247, "mean_token_accuracy": 0.9969669118523597, "num_tokens": 34179366.0, "step": 5470 }, { "entropy": 2.0383077263832092, "epoch": 4.748862405200433, "grad_norm": 0.49197614192962646, "learning_rate": 1.3314786237713319e-07, "loss": 0.008524678647518158, "mean_token_accuracy": 0.9985294118523598, "num_tokens": 34242470.0, "step": 5480 }, { "entropy": 2.0843881905078887, "epoch": 4.757529794149512, "grad_norm": 3.67633056640625, "learning_rate": 1.2417270237037316e-07, "loss": 0.02358439564704895, "mean_token_accuracy": 0.988163261115551, "num_tokens": 34305279.0, "step": 5490 }, { "entropy": 2.0624629646539687, "epoch": 4.766197183098591, "grad_norm": 3.794203281402588, "learning_rate": 1.1550879760950707e-07, "loss": 0.009884495288133621, "mean_token_accuracy": 0.9988950893282891, "num_tokens": 34366114.0, "step": 5500 }, { "epoch": 4.766197183098591, "eval_entropy": 1.9788880733708245, "eval_loss": 0.08953475207090378, "eval_mean_token_accuracy": 0.979842825908566, "eval_num_tokens": 34366114.0, "eval_runtime": 327.0695, "eval_samples_per_second": 4.916, "eval_steps_per_second": 0.615, "step": 5500 }, { "entropy": 2.026938486099243, "epoch": 4.774864572047671, "grad_norm": 0.09174291789531708, "learning_rate": 1.0715642115376679e-07, "loss": 0.012465564161539077, "mean_token_accuracy": 0.998863635957241, "num_tokens": 34430371.0, "step": 5510 }, { "entropy": 1.887784132361412, "epoch": 4.78353196099675, "grad_norm": 0.5684153437614441, "learning_rate": 9.91158362439848e-08, "loss": 0.01685968190431595, "mean_token_accuracy": 0.9935922354459763, "num_tokens": 34515259.0, "step": 5520 }, { "entropy": 2.019374093413353, "epoch": 4.792199349945829, "grad_norm": 1.921454668045044, "learning_rate": 9.138729629429633e-08, "loss": 0.013727284967899323, "mean_token_accuracy": 0.9937152773141861, "num_tokens": 34579448.0, "step": 5530 }, { "entropy": 2.061140888929367, "epoch": 4.800866738894908, "grad_norm": 1.1379508972167969, "learning_rate": 8.397104488415242e-08, "loss": 0.018110451102256776, "mean_token_accuracy": 0.9920138880610466, "num_tokens": 34643503.0, "step": 5540 }, { "entropy": 2.116260740160942, "epoch": 4.809534127843987, "grad_norm": 0.09666794538497925, "learning_rate": 7.686731575064499e-08, "loss": 0.013026180863380431, "mean_token_accuracy": 0.9928571432828903, "num_tokens": 34699740.0, "step": 5550 }, { "entropy": 2.0289686411619186, "epoch": 4.818201516793066, "grad_norm": 2.967052936553955, "learning_rate": 7.007633278114156e-08, "loss": 0.01802207827568054, "mean_token_accuracy": 0.9932675451040268, "num_tokens": 34756188.0, "step": 5560 }, { "entropy": 2.008377233147621, "epoch": 4.826868905742145, "grad_norm": 0.5545211434364319, "learning_rate": 6.359831000622319e-08, "loss": 0.0315314382314682, "mean_token_accuracy": 0.988946282863617, "num_tokens": 34822503.0, "step": 5570 }, { "entropy": 2.0508563309907912, "epoch": 4.835536294691225, "grad_norm": 1.5701384544372559, "learning_rate": 5.7433451592946446e-08, "loss": 0.033820077776908875, "mean_token_accuracy": 0.9926100254058838, "num_tokens": 34883060.0, "step": 5580 }, { "entropy": 2.0419242858886717, "epoch": 4.844203683640304, "grad_norm": 0.8245704770088196, "learning_rate": 5.158195183840087e-08, "loss": 0.023655834794044494, "mean_token_accuracy": 0.992795518040657, "num_tokens": 34943194.0, "step": 5590 }, { "entropy": 2.0416525810956956, "epoch": 4.852871072589382, "grad_norm": 1.4492483139038086, "learning_rate": 4.604399516359381e-08, "loss": 0.009996517747640609, "mean_token_accuracy": 0.9690203845500946, "num_tokens": 35013087.0, "step": 5600 }, { "epoch": 4.852871072589382, "eval_entropy": 1.9783549949304382, "eval_loss": 0.08902545273303986, "eval_mean_token_accuracy": 0.9801809992363204, "eval_num_tokens": 35013087.0, "eval_runtime": 327.0775, "eval_samples_per_second": 4.916, "eval_steps_per_second": 0.615, "step": 5600 }, { "entropy": 2.08369864821434, "epoch": 4.861538461538462, "grad_norm": 0.2037355750799179, "learning_rate": 4.081975610762845e-08, "loss": 0.020190438628196715, "mean_token_accuracy": 0.9926752656698227, "num_tokens": 35072258.0, "step": 5610 }, { "entropy": 1.9933051258325576, "epoch": 4.87020585048754, "grad_norm": 2.471435546875, "learning_rate": 3.5909399322213714e-08, "loss": 0.028650698065757752, "mean_token_accuracy": 0.9927345782518386, "num_tokens": 35136204.0, "step": 5620 }, { "entropy": 2.0149646639823913, "epoch": 4.878873239436619, "grad_norm": 0.14566990733146667, "learning_rate": 3.13130795664629e-08, "loss": 0.01882893741130829, "mean_token_accuracy": 0.9957239225506782, "num_tokens": 35210309.0, "step": 5630 }, { "entropy": 1.9940237611532212, "epoch": 4.887540628385699, "grad_norm": 1.4961596727371216, "learning_rate": 2.703094170202869e-08, "loss": 0.017515945434570312, "mean_token_accuracy": 0.9969444438815117, "num_tokens": 35282211.0, "step": 5640 }, { "entropy": 2.069670316576958, "epoch": 4.896208017334778, "grad_norm": 3.451641321182251, "learning_rate": 2.3063120688527895e-08, "loss": 0.009432430565357208, "mean_token_accuracy": 0.9956648290157318, "num_tokens": 35338685.0, "step": 5650 }, { "entropy": 2.030204784870148, "epoch": 4.904875406283857, "grad_norm": 0.47753724455833435, "learning_rate": 1.9409741579290432e-08, "loss": 0.018620912730693818, "mean_token_accuracy": 0.9965626150369644, "num_tokens": 35397783.0, "step": 5660 }, { "entropy": 2.029239335656166, "epoch": 4.913542795232936, "grad_norm": 0.3373558223247528, "learning_rate": 1.6070919517422457e-08, "loss": 0.02926117479801178, "mean_token_accuracy": 0.994283078610897, "num_tokens": 35460222.0, "step": 5670 }, { "entropy": 2.0445204973220825, "epoch": 4.922210184182015, "grad_norm": 3.4179787635803223, "learning_rate": 1.304675973217151e-08, "loss": 0.013791508972644806, "mean_token_accuracy": 0.9986397057771683, "num_tokens": 35512901.0, "step": 5680 }, { "entropy": 1.979167452454567, "epoch": 4.930877573131094, "grad_norm": 1.5083386898040771, "learning_rate": 1.0337357535612491e-08, "loss": 0.01376536637544632, "mean_token_accuracy": 0.9958539381623268, "num_tokens": 35583228.0, "step": 5690 }, { "entropy": 1.9492487490177155, "epoch": 4.9395449620801735, "grad_norm": 0.5227612853050232, "learning_rate": 7.942798319645618e-09, "loss": 0.026930561661720274, "mean_token_accuracy": 0.9896025002002716, "num_tokens": 35651933.0, "step": 5700 }, { "epoch": 4.9395449620801735, "eval_entropy": 1.978533458353868, "eval_loss": 0.08922462910413742, "eval_mean_token_accuracy": 0.9799270276999592, "eval_num_tokens": 35651933.0, "eval_runtime": 326.7094, "eval_samples_per_second": 4.922, "eval_steps_per_second": 0.615, "step": 5700 }, { "entropy": 2.0769087851047514, "epoch": 4.948212351029253, "grad_norm": 1.7579526901245117, "learning_rate": 5.863157553301912e-09, "loss": 0.04630476236343384, "mean_token_accuracy": 0.9901736095547676, "num_tokens": 35702827.0, "step": 5710 }, { "entropy": 2.0126946330070496, "epoch": 4.956879739978332, "grad_norm": 0.29572439193725586, "learning_rate": 4.098500780364001e-09, "loss": 0.024674685299396516, "mean_token_accuracy": 0.9920352548360825, "num_tokens": 35765963.0, "step": 5720 }, { "entropy": 2.093992868065834, "epoch": 4.965547128927411, "grad_norm": 2.5199387073516846, "learning_rate": 2.6488836173077513e-09, "loss": 0.018880957365036012, "mean_token_accuracy": 0.997487536072731, "num_tokens": 35827800.0, "step": 5730 }, { "entropy": 2.0499730825424196, "epoch": 4.97421451787649, "grad_norm": 2.6069576740264893, "learning_rate": 1.5143517515381345e-09, "loss": 0.030907681584358214, "mean_token_accuracy": 0.9882355168461799, "num_tokens": 35889316.0, "step": 5740 }, { "entropy": 2.03939069211483, "epoch": 4.982881906825568, "grad_norm": 1.0308866500854492, "learning_rate": 6.949409399581442e-10, "loss": 0.018008121848106386, "mean_token_accuracy": 0.9932060182094574, "num_tokens": 35955227.0, "step": 5750 }, { "entropy": 1.945585885643959, "epoch": 4.991549295774648, "grad_norm": 2.1488585472106934, "learning_rate": 1.9067700783970133e-10, "loss": 0.013979943096637725, "mean_token_accuracy": 0.9966666668653488, "num_tokens": 36027714.0, "step": 5760 }, { "entropy": 2.070587479151212, "epoch": 5.0, "grad_norm": 0.31686675548553467, "learning_rate": 1.5758480065297676e-12, "loss": 0.019185705482959746, "mean_token_accuracy": 0.992816442098373, "num_tokens": 36090205.0, "step": 5770 }, { "epoch": 5.0, "eval_entropy": 1.9783666353320601, "eval_loss": 0.08960430324077606, "eval_mean_token_accuracy": 0.9804033803109505, "eval_num_tokens": 36090205.0, "eval_runtime": 326.8442, "eval_samples_per_second": 4.92, "eval_steps_per_second": 0.615, "step": 5770 }, { "epoch": 5.0, "step": 5770, "total_flos": 2.2732684905831875e+18, "train_loss": 0.09643875142201085, "train_runtime": 36470.303, "train_samples_per_second": 1.265, "train_steps_per_second": 0.158 } ], "logging_steps": 10, "max_steps": 5770, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2.2732684905831875e+18, "train_batch_size": 2, "trial_name": null, "trial_params": null }