Jongbin-kr's picture
End of training: best validation-loss checkpoint
a2c5c1d verified
Raw
History Blame Contribute Delete
197 kB
{
"best_global_step": 3500,
"best_metric": 0.08556525409221649,
"best_model_checkpoint": "/data6/jongbinwon/evolving_MoE/checkpoints/sft_llama31_8b_lbox_criminal_property_ffn_only_5ep/checkpoint-3500",
"epoch": 5.0,
"eval_steps": 100,
"global_step": 5770,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 2.0094634652137757,
"epoch": 0.00866738894907909,
"grad_norm": 6.016944408416748,
"learning_rate": 1.0344827586206898e-06,
"loss": 1.9924282073974608,
"mean_token_accuracy": 0.6058960895985365,
"num_tokens": 62341.0,
"step": 10
},
{
"entropy": 2.074240231513977,
"epoch": 0.01733477789815818,
"grad_norm": 22.0172119140625,
"learning_rate": 2.1839080459770117e-06,
"loss": 1.9484416961669921,
"mean_token_accuracy": 0.6000785790383816,
"num_tokens": 123672.0,
"step": 20
},
{
"entropy": 2.1732099413871766,
"epoch": 0.02600216684723727,
"grad_norm": 6.0356831550598145,
"learning_rate": 3.3333333333333333e-06,
"loss": 1.966094970703125,
"mean_token_accuracy": 0.5903577983379364,
"num_tokens": 178475.0,
"step": 30
},
{
"entropy": 2.03062362074852,
"epoch": 0.03466955579631636,
"grad_norm": 7.640094757080078,
"learning_rate": 4.482758620689656e-06,
"loss": 1.8349821090698242,
"mean_token_accuracy": 0.6228681385517121,
"num_tokens": 243079.0,
"step": 40
},
{
"entropy": 2.0886535823345183,
"epoch": 0.04333694474539545,
"grad_norm": 4.04999303817749,
"learning_rate": 5.6321839080459775e-06,
"loss": 1.382587718963623,
"mean_token_accuracy": 0.6765289187431336,
"num_tokens": 307598.0,
"step": 50
},
{
"entropy": 2.036424469947815,
"epoch": 0.05200433369447454,
"grad_norm": 5.690767288208008,
"learning_rate": 6.781609195402299e-06,
"loss": 1.2014636039733886,
"mean_token_accuracy": 0.7360026895999908,
"num_tokens": 370530.0,
"step": 60
},
{
"entropy": 2.0666846364736555,
"epoch": 0.06067172264355363,
"grad_norm": 6.074404716491699,
"learning_rate": 7.93103448275862e-06,
"loss": 0.9479114532470703,
"mean_token_accuracy": 0.8202387556433678,
"num_tokens": 438053.0,
"step": 70
},
{
"entropy": 2.1196643888950346,
"epoch": 0.06933911159263272,
"grad_norm": 3.3794610500335693,
"learning_rate": 9.080459770114942e-06,
"loss": 0.7980506896972657,
"mean_token_accuracy": 0.8331406563520432,
"num_tokens": 495572.0,
"step": 80
},
{
"entropy": 2.0099371910095214,
"epoch": 0.0780065005417118,
"grad_norm": 4.104278087615967,
"learning_rate": 1.0229885057471264e-05,
"loss": 0.8544118881225586,
"mean_token_accuracy": 0.793623823672533,
"num_tokens": 562327.0,
"step": 90
},
{
"entropy": 2.111247554421425,
"epoch": 0.0866738894907909,
"grad_norm": 3.811084270477295,
"learning_rate": 1.1379310344827587e-05,
"loss": 0.5899581909179688,
"mean_token_accuracy": 0.8357160598039627,
"num_tokens": 622741.0,
"step": 100
},
{
"epoch": 0.0866738894907909,
"eval_entropy": 2.0146469435288537,
"eval_loss": 0.639670729637146,
"eval_mean_token_accuracy": 0.8453463265551856,
"eval_num_tokens": 622741.0,
"eval_runtime": 327.692,
"eval_samples_per_second": 4.907,
"eval_steps_per_second": 0.613,
"step": 100
},
{
"entropy": 2.1024232476949694,
"epoch": 0.09534127843986999,
"grad_norm": 3.4410061836242676,
"learning_rate": 1.2528735632183907e-05,
"loss": 0.5648527145385742,
"mean_token_accuracy": 0.8602957978844643,
"num_tokens": 686988.0,
"step": 110
},
{
"entropy": 2.0769773036241532,
"epoch": 0.10400866738894908,
"grad_norm": 4.00484561920166,
"learning_rate": 1.367816091954023e-05,
"loss": 0.6145552158355713,
"mean_token_accuracy": 0.846926499903202,
"num_tokens": 742631.0,
"step": 120
},
{
"entropy": 2.0740666419267653,
"epoch": 0.11267605633802817,
"grad_norm": 3.5441555976867676,
"learning_rate": 1.4827586206896554e-05,
"loss": 0.4216147422790527,
"mean_token_accuracy": 0.8855735391378403,
"num_tokens": 800445.0,
"step": 130
},
{
"entropy": 2.086614066362381,
"epoch": 0.12134344528710726,
"grad_norm": 3.0210344791412354,
"learning_rate": 1.5977011494252876e-05,
"loss": 0.3674225568771362,
"mean_token_accuracy": 0.9093644827604294,
"num_tokens": 864344.0,
"step": 140
},
{
"entropy": 2.082952803373337,
"epoch": 0.13001083423618634,
"grad_norm": 4.145540237426758,
"learning_rate": 1.7126436781609197e-05,
"loss": 0.40997681617736814,
"mean_token_accuracy": 0.9000683546066284,
"num_tokens": 922914.0,
"step": 150
},
{
"entropy": 1.9609296470880508,
"epoch": 0.13867822318526543,
"grad_norm": 4.342889308929443,
"learning_rate": 1.827586206896552e-05,
"loss": 0.47150702476501466,
"mean_token_accuracy": 0.8880565464496613,
"num_tokens": 992986.0,
"step": 160
},
{
"entropy": 2.02143072783947,
"epoch": 0.14734561213434452,
"grad_norm": 4.358700752258301,
"learning_rate": 1.942528735632184e-05,
"loss": 0.3823310136795044,
"mean_token_accuracy": 0.8964826211333274,
"num_tokens": 1056343.0,
"step": 170
},
{
"entropy": 2.1072087794542314,
"epoch": 0.1560130010834236,
"grad_norm": 8.081436157226562,
"learning_rate": 1.999996060382467e-05,
"loss": 0.3178143262863159,
"mean_token_accuracy": 0.8876261033117772,
"num_tokens": 1110020.0,
"step": 180
},
{
"entropy": 1.9597682043910027,
"epoch": 0.1646803900325027,
"grad_norm": 3.436814308166504,
"learning_rate": 1.9999645436284486e-05,
"loss": 0.3373431921005249,
"mean_token_accuracy": 0.9190717935562134,
"num_tokens": 1175893.0,
"step": 190
},
{
"entropy": 2.045034462213516,
"epoch": 0.1733477789815818,
"grad_norm": 5.531442642211914,
"learning_rate": 1.999901511113721e-05,
"loss": 0.48609213829040526,
"mean_token_accuracy": 0.8734037652611732,
"num_tokens": 1233459.0,
"step": 200
},
{
"epoch": 0.1733477789815818,
"eval_entropy": 1.9307460037629995,
"eval_loss": 0.31969207525253296,
"eval_mean_token_accuracy": 0.9156260101949397,
"eval_num_tokens": 1233459.0,
"eval_runtime": 327.7812,
"eval_samples_per_second": 4.906,
"eval_steps_per_second": 0.613,
"step": 200
},
{
"entropy": 1.9456486970186233,
"epoch": 0.1820151679306609,
"grad_norm": 3.714157819747925,
"learning_rate": 1.999806964824873e-05,
"loss": 0.27378363609313966,
"mean_token_accuracy": 0.898275463283062,
"num_tokens": 1310194.0,
"step": 210
},
{
"entropy": 1.9946164965629578,
"epoch": 0.19068255687973998,
"grad_norm": 5.428526878356934,
"learning_rate": 1.999680907741708e-05,
"loss": 0.18908169269561767,
"mean_token_accuracy": 0.9540401995182037,
"num_tokens": 1372396.0,
"step": 220
},
{
"entropy": 1.9999880447983742,
"epoch": 0.19934994582881907,
"grad_norm": 5.249075889587402,
"learning_rate": 1.999523343837152e-05,
"loss": 0.2796680212020874,
"mean_token_accuracy": 0.9432714268565178,
"num_tokens": 1431522.0,
"step": 230
},
{
"entropy": 1.9591780692338943,
"epoch": 0.20801733477789816,
"grad_norm": 5.265084743499756,
"learning_rate": 1.999334278077127e-05,
"loss": 0.3002108097076416,
"mean_token_accuracy": 0.9193895891308784,
"num_tokens": 1493107.0,
"step": 240
},
{
"entropy": 2.0249179124832155,
"epoch": 0.21668472372697725,
"grad_norm": 3.4058895111083984,
"learning_rate": 1.999113716420396e-05,
"loss": 0.3556444406509399,
"mean_token_accuracy": 0.9207730159163475,
"num_tokens": 1550661.0,
"step": 250
},
{
"entropy": 1.8855496376752854,
"epoch": 0.22535211267605634,
"grad_norm": 4.0377936363220215,
"learning_rate": 1.9988616658183734e-05,
"loss": 0.19759812355041503,
"mean_token_accuracy": 0.948055523633957,
"num_tokens": 1626343.0,
"step": 260
},
{
"entropy": 1.8737920612096786,
"epoch": 0.23401950162513543,
"grad_norm": 2.6314523220062256,
"learning_rate": 1.9985781342149078e-05,
"loss": 0.28745641708374026,
"mean_token_accuracy": 0.9337396785616875,
"num_tokens": 1696414.0,
"step": 270
},
{
"entropy": 1.9150809600949288,
"epoch": 0.24268689057421453,
"grad_norm": 5.922034740447998,
"learning_rate": 1.9982631305460297e-05,
"loss": 0.28877570629119875,
"mean_token_accuracy": 0.9260302111506462,
"num_tokens": 1761679.0,
"step": 280
},
{
"entropy": 1.92972229719162,
"epoch": 0.2513542795232936,
"grad_norm": 5.307780742645264,
"learning_rate": 1.9979166647396718e-05,
"loss": 0.20345923900604249,
"mean_token_accuracy": 0.9439164400100708,
"num_tokens": 1828184.0,
"step": 290
},
{
"entropy": 1.950343307852745,
"epoch": 0.2600216684723727,
"grad_norm": 4.971693992614746,
"learning_rate": 1.9975387477153547e-05,
"loss": 0.33291172981262207,
"mean_token_accuracy": 0.9112795010209084,
"num_tokens": 1894019.0,
"step": 300
},
{
"epoch": 0.2600216684723727,
"eval_entropy": 1.9190048121694308,
"eval_loss": 0.2512859106063843,
"eval_mean_token_accuracy": 0.9369790637077977,
"eval_num_tokens": 1894019.0,
"eval_runtime": 327.5455,
"eval_samples_per_second": 4.909,
"eval_steps_per_second": 0.614,
"step": 300
},
{
"entropy": 2.010765317082405,
"epoch": 0.26868905742145177,
"grad_norm": 8.496099472045898,
"learning_rate": 1.997129391383843e-05,
"loss": 0.3033193826675415,
"mean_token_accuracy": 0.9163187935948371,
"num_tokens": 1946992.0,
"step": 310
},
{
"entropy": 1.9858351945877075,
"epoch": 0.27735644637053086,
"grad_norm": 3.4120125770568848,
"learning_rate": 1.9966886086467704e-05,
"loss": 0.29690701961517335,
"mean_token_accuracy": 0.9126337721943856,
"num_tokens": 2011691.0,
"step": 320
},
{
"entropy": 1.8983549684286118,
"epoch": 0.28602383531960995,
"grad_norm": 1.436771035194397,
"learning_rate": 1.9962164133962325e-05,
"loss": 0.30121750831604005,
"mean_token_accuracy": 0.9224563807249069,
"num_tokens": 2083706.0,
"step": 330
},
{
"entropy": 1.9841466784477233,
"epoch": 0.29469122426868904,
"grad_norm": 5.781894683837891,
"learning_rate": 1.9957128205143498e-05,
"loss": 0.2556509017944336,
"mean_token_accuracy": 0.9394641578197479,
"num_tokens": 2148674.0,
"step": 340
},
{
"entropy": 1.9055085510015488,
"epoch": 0.30335861321776814,
"grad_norm": 6.032225608825684,
"learning_rate": 1.9951778458727976e-05,
"loss": 0.27752203941345216,
"mean_token_accuracy": 0.9140971004962921,
"num_tokens": 2215772.0,
"step": 350
},
{
"entropy": 2.04987233877182,
"epoch": 0.3120260021668472,
"grad_norm": 2.553159475326538,
"learning_rate": 1.9946115063323068e-05,
"loss": 0.19900113344192505,
"mean_token_accuracy": 0.9388249479234219,
"num_tokens": 2266191.0,
"step": 360
},
{
"entropy": 2.009141910076141,
"epoch": 0.3206933911159263,
"grad_norm": 1.9444561004638672,
"learning_rate": 1.9940138197421316e-05,
"loss": 0.17729513645172118,
"mean_token_accuracy": 0.9602704092860221,
"num_tokens": 2325355.0,
"step": 370
},
{
"entropy": 2.004271525144577,
"epoch": 0.3293607800650054,
"grad_norm": 8.431859970092773,
"learning_rate": 1.9933848049394872e-05,
"loss": 0.14624375104904175,
"mean_token_accuracy": 0.9545927375555039,
"num_tokens": 2383835.0,
"step": 380
},
{
"entropy": 1.9636184632778169,
"epoch": 0.3380281690140845,
"grad_norm": 3.6653892993927,
"learning_rate": 1.9927244817489568e-05,
"loss": 0.19174840450286865,
"mean_token_accuracy": 0.945315583050251,
"num_tokens": 2453604.0,
"step": 390
},
{
"entropy": 1.9832717061042786,
"epoch": 0.3466955579631636,
"grad_norm": 4.508843421936035,
"learning_rate": 1.9920328709818658e-05,
"loss": 0.22036411762237548,
"mean_token_accuracy": 0.946815638244152,
"num_tokens": 2511426.0,
"step": 400
},
{
"epoch": 0.3466955579631636,
"eval_entropy": 1.8908554446044845,
"eval_loss": 0.21776656806468964,
"eval_mean_token_accuracy": 0.9417561876833143,
"eval_num_tokens": 2511426.0,
"eval_runtime": 327.8022,
"eval_samples_per_second": 4.905,
"eval_steps_per_second": 0.613,
"step": 400
},
{
"entropy": 1.9166859805583953,
"epoch": 0.3553629469122427,
"grad_norm": 4.482876300811768,
"learning_rate": 1.9913099944356265e-05,
"loss": 0.21862165927886962,
"mean_token_accuracy": 0.9501018598675728,
"num_tokens": 2576843.0,
"step": 410
},
{
"entropy": 1.981603667140007,
"epoch": 0.3640303358613218,
"grad_norm": 2.7158615589141846,
"learning_rate": 1.9905558748930513e-05,
"loss": 0.20267672538757325,
"mean_token_accuracy": 0.9586101487278939,
"num_tokens": 2633215.0,
"step": 420
},
{
"entropy": 1.979082790017128,
"epoch": 0.37269772481040087,
"grad_norm": 1.2694976329803467,
"learning_rate": 1.9897705361216334e-05,
"loss": 0.1717057228088379,
"mean_token_accuracy": 0.9619395598769188,
"num_tokens": 2704383.0,
"step": 430
},
{
"entropy": 1.9977828115224838,
"epoch": 0.38136511375947996,
"grad_norm": 3.3041579723358154,
"learning_rate": 1.9889540028728e-05,
"loss": 0.2565366268157959,
"mean_token_accuracy": 0.9440258383750916,
"num_tokens": 2762147.0,
"step": 440
},
{
"entropy": 1.985519140958786,
"epoch": 0.39003250270855905,
"grad_norm": 3.923245668411255,
"learning_rate": 1.9881063008811288e-05,
"loss": 0.15962369441986085,
"mean_token_accuracy": 0.9452512726187706,
"num_tokens": 2827820.0,
"step": 450
},
{
"entropy": 1.9977640628814697,
"epoch": 0.39869989165763814,
"grad_norm": 5.337918758392334,
"learning_rate": 1.987227456863541e-05,
"loss": 0.19878954887390138,
"mean_token_accuracy": 0.9549267739057541,
"num_tokens": 2894148.0,
"step": 460
},
{
"entropy": 1.981362435221672,
"epoch": 0.40736728060671723,
"grad_norm": 4.396739482879639,
"learning_rate": 1.9863174985184565e-05,
"loss": 0.2123692512512207,
"mean_token_accuracy": 0.9419563382863998,
"num_tokens": 2949819.0,
"step": 470
},
{
"entropy": 2.053285387158394,
"epoch": 0.4160346695557963,
"grad_norm": 1.743699073791504,
"learning_rate": 1.9853764545249217e-05,
"loss": 0.1345153570175171,
"mean_token_accuracy": 0.9553116604685783,
"num_tokens": 3002255.0,
"step": 480
},
{
"entropy": 2.015228086709976,
"epoch": 0.4247020585048754,
"grad_norm": 9.911247253417969,
"learning_rate": 1.984404354541705e-05,
"loss": 0.2177375078201294,
"mean_token_accuracy": 0.9537948787212371,
"num_tokens": 3066922.0,
"step": 490
},
{
"entropy": 1.9184562861919403,
"epoch": 0.4333694474539545,
"grad_norm": 6.476995468139648,
"learning_rate": 1.9834012292063634e-05,
"loss": 0.13998514413833618,
"mean_token_accuracy": 0.9385814905166626,
"num_tokens": 3135056.0,
"step": 500
},
{
"epoch": 0.4333694474539545,
"eval_entropy": 1.91096430453495,
"eval_loss": 0.18260541558265686,
"eval_mean_token_accuracy": 0.9541504039100154,
"eval_num_tokens": 3135056.0,
"eval_runtime": 327.4029,
"eval_samples_per_second": 4.911,
"eval_steps_per_second": 0.614,
"step": 500
},
{
"entropy": 1.986215516924858,
"epoch": 0.4420368364030336,
"grad_norm": 1.8353534936904907,
"learning_rate": 1.982367110134276e-05,
"loss": 0.2266139030456543,
"mean_token_accuracy": 0.939882904291153,
"num_tokens": 3196646.0,
"step": 510
},
{
"entropy": 2.0170169204473494,
"epoch": 0.4507042253521127,
"grad_norm": 5.655337810516357,
"learning_rate": 1.9813020299176475e-05,
"loss": 0.23389663696289062,
"mean_token_accuracy": 0.9509230718016625,
"num_tokens": 3258975.0,
"step": 520
},
{
"entropy": 2.0502737373113633,
"epoch": 0.4593716143011918,
"grad_norm": 4.397721290588379,
"learning_rate": 1.9802060221244815e-05,
"loss": 0.1621358275413513,
"mean_token_accuracy": 0.9493934914469719,
"num_tokens": 3323770.0,
"step": 530
},
{
"entropy": 1.936602184176445,
"epoch": 0.46803900325027087,
"grad_norm": 4.689565181732178,
"learning_rate": 1.979079121297522e-05,
"loss": 0.21635038852691652,
"mean_token_accuracy": 0.9611420571804047,
"num_tokens": 3392275.0,
"step": 540
},
{
"entropy": 2.060832369327545,
"epoch": 0.47670639219934996,
"grad_norm": 2.461576461791992,
"learning_rate": 1.977921362953165e-05,
"loss": 0.2094656467437744,
"mean_token_accuracy": 0.9389677405357361,
"num_tokens": 3449649.0,
"step": 550
},
{
"entropy": 1.976703155040741,
"epoch": 0.48537378114842905,
"grad_norm": 3.079184055328369,
"learning_rate": 1.9767327835803388e-05,
"loss": 0.13856724500656128,
"mean_token_accuracy": 0.9628144934773445,
"num_tokens": 3519095.0,
"step": 560
},
{
"entropy": 2.0048892587423324,
"epoch": 0.49404117009750814,
"grad_norm": 2.5651493072509766,
"learning_rate": 1.9755134206393557e-05,
"loss": 0.2005464792251587,
"mean_token_accuracy": 0.9645502358675003,
"num_tokens": 3577729.0,
"step": 570
},
{
"entropy": 2.048991507291794,
"epoch": 0.5027085590465872,
"grad_norm": 6.429996967315674,
"learning_rate": 1.974263312560728e-05,
"loss": 0.11518661975860596,
"mean_token_accuracy": 0.9612075328826905,
"num_tokens": 3641823.0,
"step": 580
},
{
"entropy": 2.0796742677688598,
"epoch": 0.5113759479956663,
"grad_norm": 3.4637815952301025,
"learning_rate": 1.972982498743961e-05,
"loss": 0.13005509376525878,
"mean_token_accuracy": 0.9748484209179878,
"num_tokens": 3698090.0,
"step": 590
},
{
"entropy": 2.018010488152504,
"epoch": 0.5200433369447454,
"grad_norm": 5.774364948272705,
"learning_rate": 1.9716710195563063e-05,
"loss": 0.11385848522186279,
"mean_token_accuracy": 0.9651767894625664,
"num_tokens": 3766932.0,
"step": 600
},
{
"epoch": 0.5200433369447454,
"eval_entropy": 1.949031797214527,
"eval_loss": 0.1759590059518814,
"eval_mean_token_accuracy": 0.9537636631756873,
"eval_num_tokens": 3766932.0,
"eval_runtime": 327.6397,
"eval_samples_per_second": 4.908,
"eval_steps_per_second": 0.613,
"step": 600
},
{
"entropy": 1.9692809194326402,
"epoch": 0.5287107258938245,
"grad_norm": 3.4839439392089844,
"learning_rate": 1.9703289163314947e-05,
"loss": 0.21931560039520265,
"mean_token_accuracy": 0.9536899715662003,
"num_tokens": 3836323.0,
"step": 610
},
{
"entropy": 2.049798659980297,
"epoch": 0.5373781148429035,
"grad_norm": 6.157666206359863,
"learning_rate": 1.9689562313684295e-05,
"loss": 0.1124419093132019,
"mean_token_accuracy": 0.9672878786921502,
"num_tokens": 3894701.0,
"step": 620
},
{
"entropy": 2.0254536986351015,
"epoch": 0.5460455037919827,
"grad_norm": 3.196044683456421,
"learning_rate": 1.9675530079298554e-05,
"loss": 0.09724722504615783,
"mean_token_accuracy": 0.969377551972866,
"num_tokens": 3952827.0,
"step": 630
},
{
"entropy": 2.0226389855146407,
"epoch": 0.5547128927410617,
"grad_norm": 4.191121578216553,
"learning_rate": 1.9661192902409948e-05,
"loss": 0.2217186450958252,
"mean_token_accuracy": 0.9471737131476402,
"num_tokens": 4009523.0,
"step": 640
},
{
"entropy": 2.0257292181253432,
"epoch": 0.5633802816901409,
"grad_norm": 2.6429009437561035,
"learning_rate": 1.9646551234881537e-05,
"loss": 0.1354218006134033,
"mean_token_accuracy": 0.9583623319864273,
"num_tokens": 4070329.0,
"step": 650
},
{
"entropy": 2.041917896270752,
"epoch": 0.5720476706392199,
"grad_norm": 3.2023017406463623,
"learning_rate": 1.9631605538172968e-05,
"loss": 0.199608314037323,
"mean_token_accuracy": 0.9503273338079452,
"num_tokens": 4132785.0,
"step": 660
},
{
"entropy": 1.9533647626638413,
"epoch": 0.580715059588299,
"grad_norm": 3.7158589363098145,
"learning_rate": 1.961635628332595e-05,
"loss": 0.19348444938659667,
"mean_token_accuracy": 0.9558726295828819,
"num_tokens": 4199572.0,
"step": 670
},
{
"entropy": 2.073412099480629,
"epoch": 0.5893824485373781,
"grad_norm": 2.194398880004883,
"learning_rate": 1.9600803950949384e-05,
"loss": 0.1255653142929077,
"mean_token_accuracy": 0.9656689003109932,
"num_tokens": 4261539.0,
"step": 680
},
{
"entropy": 2.062476450204849,
"epoch": 0.5980498374864572,
"grad_norm": 0.843501627445221,
"learning_rate": 1.9584949031204237e-05,
"loss": 0.13029239177703858,
"mean_token_accuracy": 0.9725566118955612,
"num_tokens": 4325121.0,
"step": 690
},
{
"entropy": 2.0155109763145447,
"epoch": 0.6067172264355363,
"grad_norm": 2.171780586242676,
"learning_rate": 1.9568792023788083e-05,
"loss": 0.18113304376602174,
"mean_token_accuracy": 0.958047965168953,
"num_tokens": 4383768.0,
"step": 700
},
{
"epoch": 0.6067172264355363,
"eval_entropy": 1.9391062811239441,
"eval_loss": 0.16046689450740814,
"eval_mean_token_accuracy": 0.9575774969153144,
"eval_num_tokens": 4383768.0,
"eval_runtime": 327.4353,
"eval_samples_per_second": 4.911,
"eval_steps_per_second": 0.614,
"step": 700
},
{
"entropy": 1.9273906409740449,
"epoch": 0.6153846153846154,
"grad_norm": 4.4711174964904785,
"learning_rate": 1.9552333437919357e-05,
"loss": 0.1300251603126526,
"mean_token_accuracy": 0.9623189747333527,
"num_tokens": 4456736.0,
"step": 710
},
{
"entropy": 2.024830573797226,
"epoch": 0.6240520043336945,
"grad_norm": 4.07381534576416,
"learning_rate": 1.9535573792321306e-05,
"loss": 0.1988328814506531,
"mean_token_accuracy": 0.9514750733971595,
"num_tokens": 4518424.0,
"step": 720
},
{
"entropy": 2.0818196892738343,
"epoch": 0.6327193932827736,
"grad_norm": 1.8826876878738403,
"learning_rate": 1.951851361520564e-05,
"loss": 0.14210430383682252,
"mean_token_accuracy": 0.9593353673815728,
"num_tokens": 4577017.0,
"step": 730
},
{
"entropy": 2.029034098982811,
"epoch": 0.6413867822318526,
"grad_norm": 2.0174059867858887,
"learning_rate": 1.9501153444255876e-05,
"loss": 0.0932635486125946,
"mean_token_accuracy": 0.9816406950354576,
"num_tokens": 4640462.0,
"step": 740
},
{
"entropy": 2.059244655072689,
"epoch": 0.6500541711809318,
"grad_norm": 2.1351184844970703,
"learning_rate": 1.9483493826610415e-05,
"loss": 0.12800567150115966,
"mean_token_accuracy": 0.9660168752074242,
"num_tokens": 4705340.0,
"step": 750
},
{
"entropy": 2.0459042131900786,
"epoch": 0.6587215601300108,
"grad_norm": 5.086484909057617,
"learning_rate": 1.946553531884527e-05,
"loss": 0.23081181049346924,
"mean_token_accuracy": 0.9424590915441513,
"num_tokens": 4765177.0,
"step": 760
},
{
"entropy": 2.0461316615343095,
"epoch": 0.66738894907909,
"grad_norm": 3.3382718563079834,
"learning_rate": 1.9447278486956544e-05,
"loss": 0.14905912876129152,
"mean_token_accuracy": 0.9569886341691017,
"num_tokens": 4834296.0,
"step": 770
},
{
"entropy": 2.1199437886476518,
"epoch": 0.676056338028169,
"grad_norm": 2.4870541095733643,
"learning_rate": 1.9428723906342586e-05,
"loss": 0.15288684368133545,
"mean_token_accuracy": 0.9573053807020188,
"num_tokens": 4889171.0,
"step": 780
},
{
"entropy": 2.0783461153507234,
"epoch": 0.6847237269772481,
"grad_norm": 0.9525867700576782,
"learning_rate": 1.9409872161785846e-05,
"loss": 0.10859833955764771,
"mean_token_accuracy": 0.9734508141875267,
"num_tokens": 4947751.0,
"step": 790
},
{
"entropy": 1.9960304468870163,
"epoch": 0.6933911159263272,
"grad_norm": 1.0429903268814087,
"learning_rate": 1.939072384743447e-05,
"loss": 0.17450170516967772,
"mean_token_accuracy": 0.9435808345675468,
"num_tokens": 5014246.0,
"step": 800
},
{
"epoch": 0.6933911159263272,
"eval_entropy": 1.9779095216770077,
"eval_loss": 0.16052106022834778,
"eval_mean_token_accuracy": 0.9521936910662485,
"eval_num_tokens": 5014246.0,
"eval_runtime": 327.7358,
"eval_samples_per_second": 4.906,
"eval_steps_per_second": 0.613,
"step": 800
},
{
"entropy": 2.094706800580025,
"epoch": 0.7020585048754063,
"grad_norm": 2.773972272872925,
"learning_rate": 1.9371279566783546e-05,
"loss": 0.16905949115753174,
"mean_token_accuracy": 0.9590677320957184,
"num_tokens": 5067941.0,
"step": 810
},
{
"entropy": 2.0422832757234572,
"epoch": 0.7107258938244854,
"grad_norm": 0.8871009349822998,
"learning_rate": 1.9351539932656095e-05,
"loss": 0.14554331302642823,
"mean_token_accuracy": 0.9639958038926124,
"num_tokens": 5121736.0,
"step": 820
},
{
"entropy": 2.066793379187584,
"epoch": 0.7193932827735645,
"grad_norm": 1.235823392868042,
"learning_rate": 1.9331505567183765e-05,
"loss": 0.1522287368774414,
"mean_token_accuracy": 0.9607374981045723,
"num_tokens": 5186693.0,
"step": 830
},
{
"entropy": 2.0238248884677885,
"epoch": 0.7280606717226435,
"grad_norm": 1.0951995849609375,
"learning_rate": 1.9311177101787203e-05,
"loss": 0.18216453790664672,
"mean_token_accuracy": 0.9582652196288108,
"num_tokens": 5245808.0,
"step": 840
},
{
"entropy": 2.0323809564113615,
"epoch": 0.7367280606717227,
"grad_norm": 4.650373935699463,
"learning_rate": 1.929055517715619e-05,
"loss": 0.1563056468963623,
"mean_token_accuracy": 0.9584650948643685,
"num_tokens": 5310692.0,
"step": 850
},
{
"entropy": 2.0072476893663405,
"epoch": 0.7453954496208017,
"grad_norm": 3.282588481903076,
"learning_rate": 1.9269640443229406e-05,
"loss": 0.1251569867134094,
"mean_token_accuracy": 0.9650194570422173,
"num_tokens": 5368216.0,
"step": 860
},
{
"entropy": 2.0677698493003844,
"epoch": 0.7540628385698809,
"grad_norm": 3.888256072998047,
"learning_rate": 1.9248433559173974e-05,
"loss": 0.14851419925689696,
"mean_token_accuracy": 0.9558604061603546,
"num_tokens": 5425337.0,
"step": 870
},
{
"entropy": 2.028371325135231,
"epoch": 0.7627302275189599,
"grad_norm": 4.474874496459961,
"learning_rate": 1.9226935193364672e-05,
"loss": 0.09598046541213989,
"mean_token_accuracy": 0.9639655843377113,
"num_tokens": 5493667.0,
"step": 880
},
{
"entropy": 2.077066546678543,
"epoch": 0.771397616468039,
"grad_norm": 4.779897689819336,
"learning_rate": 1.920514602336288e-05,
"loss": 0.1583351492881775,
"mean_token_accuracy": 0.969876304268837,
"num_tokens": 5554367.0,
"step": 890
},
{
"entropy": 2.10542468726635,
"epoch": 0.7800650054171181,
"grad_norm": 5.164394855499268,
"learning_rate": 1.918306673589521e-05,
"loss": 0.1434742331504822,
"mean_token_accuracy": 0.9704080358147621,
"num_tokens": 5611752.0,
"step": 900
},
{
"epoch": 0.7800650054171181,
"eval_entropy": 1.9566984473176263,
"eval_loss": 0.1484634131193161,
"eval_mean_token_accuracy": 0.9622589533601827,
"eval_num_tokens": 5611752.0,
"eval_runtime": 327.9589,
"eval_samples_per_second": 4.903,
"eval_steps_per_second": 0.613,
"step": 900
},
{
"entropy": 2.017557808756828,
"epoch": 0.7887323943661971,
"grad_norm": 0.5321738123893738,
"learning_rate": 1.916069802683188e-05,
"loss": 0.14997100830078125,
"mean_token_accuracy": 0.9603116348385811,
"num_tokens": 5672084.0,
"step": 910
},
{
"entropy": 2.0164162307977676,
"epoch": 0.7973997833152763,
"grad_norm": 5.9305009841918945,
"learning_rate": 1.913804060116477e-05,
"loss": 0.1742601990699768,
"mean_token_accuracy": 0.9420990094542503,
"num_tokens": 5742156.0,
"step": 920
},
{
"entropy": 2.0990718007087708,
"epoch": 0.8060671722643553,
"grad_norm": 2.7394776344299316,
"learning_rate": 1.91150951729852e-05,
"loss": 0.10954513549804687,
"mean_token_accuracy": 0.9662265390157699,
"num_tokens": 5795887.0,
"step": 930
},
{
"entropy": 2.0060137644410134,
"epoch": 0.8147345612134345,
"grad_norm": 6.107972621917725,
"learning_rate": 1.9091862465461435e-05,
"loss": 0.15947246551513672,
"mean_token_accuracy": 0.9661846026778221,
"num_tokens": 5863543.0,
"step": 940
},
{
"entropy": 2.028472700715065,
"epoch": 0.8234019501625135,
"grad_norm": 3.5397908687591553,
"learning_rate": 1.9068343210815895e-05,
"loss": 0.11814491748809815,
"mean_token_accuracy": 0.9662217140197754,
"num_tokens": 5920612.0,
"step": 950
},
{
"entropy": 1.9094608053565025,
"epoch": 0.8320693391115926,
"grad_norm": 2.9836032390594482,
"learning_rate": 1.9044538150302054e-05,
"loss": 0.0739125669002533,
"mean_token_accuracy": 0.9773468017578125,
"num_tokens": 5992314.0,
"step": 960
},
{
"entropy": 2.031349629163742,
"epoch": 0.8407367280606717,
"grad_norm": 1.5363432168960571,
"learning_rate": 1.902044803418111e-05,
"loss": 0.10442560911178589,
"mean_token_accuracy": 0.9752393007278443,
"num_tokens": 6057639.0,
"step": 970
},
{
"entropy": 2.052021104097366,
"epoch": 0.8494041170097508,
"grad_norm": 1.9379785060882568,
"learning_rate": 1.8996073621698316e-05,
"loss": 0.13370474576950073,
"mean_token_accuracy": 0.9722858428955078,
"num_tokens": 6125691.0,
"step": 980
},
{
"entropy": 2.0630032390356066,
"epoch": 0.8580715059588299,
"grad_norm": 2.8717305660247803,
"learning_rate": 1.8971415681059064e-05,
"loss": 0.08845771551132202,
"mean_token_accuracy": 0.9745254084467888,
"num_tokens": 6180422.0,
"step": 990
},
{
"entropy": 1.9643850460648538,
"epoch": 0.866738894907909,
"grad_norm": 2.609376907348633,
"learning_rate": 1.8946474989404662e-05,
"loss": 0.11373393535614014,
"mean_token_accuracy": 0.9662645876407623,
"num_tokens": 6252953.0,
"step": 1000
},
{
"epoch": 0.866738894907909,
"eval_entropy": 1.9493645275410134,
"eval_loss": 0.1559806615114212,
"eval_mean_token_accuracy": 0.9615354849331414,
"eval_num_tokens": 6252953.0,
"eval_runtime": 327.6765,
"eval_samples_per_second": 4.907,
"eval_steps_per_second": 0.613,
"step": 1000
},
{
"entropy": 1.9920239925384522,
"epoch": 0.875406283856988,
"grad_norm": 2.1242737770080566,
"learning_rate": 1.892125233278785e-05,
"loss": 0.24173307418823242,
"mean_token_accuracy": 0.9527133107185364,
"num_tokens": 6315662.0,
"step": 1010
},
{
"entropy": 2.032253223657608,
"epoch": 0.8840736728060672,
"grad_norm": 2.7001326084136963,
"learning_rate": 1.8895748506148028e-05,
"loss": 0.1353329300880432,
"mean_token_accuracy": 0.967973954975605,
"num_tokens": 6386699.0,
"step": 1020
},
{
"entropy": 2.0086484402418137,
"epoch": 0.8927410617551462,
"grad_norm": 1.1297107934951782,
"learning_rate": 1.886996431328619e-05,
"loss": 0.07529502511024475,
"mean_token_accuracy": 0.9724522307515144,
"num_tokens": 6446533.0,
"step": 1030
},
{
"entropy": 2.0415013134479523,
"epoch": 0.9014084507042254,
"grad_norm": 5.55093240737915,
"learning_rate": 1.8843900566839606e-05,
"loss": 0.08251296877861022,
"mean_token_accuracy": 0.9786079153418541,
"num_tokens": 6513718.0,
"step": 1040
},
{
"entropy": 1.9764947205781938,
"epoch": 0.9100758396533044,
"grad_norm": 1.4542205333709717,
"learning_rate": 1.881755808825619e-05,
"loss": 0.09182056784629822,
"mean_token_accuracy": 0.9683352947235108,
"num_tokens": 6589309.0,
"step": 1050
},
{
"entropy": 2.1108569860458375,
"epoch": 0.9187432286023836,
"grad_norm": 1.6818881034851074,
"learning_rate": 1.879093770776864e-05,
"loss": 0.10508890151977539,
"mean_token_accuracy": 0.9706028968095779,
"num_tokens": 6645154.0,
"step": 1060
},
{
"entropy": 2.0166300892829896,
"epoch": 0.9274106175514626,
"grad_norm": 1.3823227882385254,
"learning_rate": 1.8764040264368234e-05,
"loss": 0.09460273385047913,
"mean_token_accuracy": 0.9628641813993454,
"num_tokens": 6713987.0,
"step": 1070
},
{
"entropy": 2.1063819110393522,
"epoch": 0.9360780065005417,
"grad_norm": 6.772284507751465,
"learning_rate": 1.8736866605778432e-05,
"loss": 0.12469170093536378,
"mean_token_accuracy": 0.9483507961034775,
"num_tokens": 6772582.0,
"step": 1080
},
{
"entropy": 2.0919911056756972,
"epoch": 0.9447453954496208,
"grad_norm": 1.6543307304382324,
"learning_rate": 1.870941758842811e-05,
"loss": 0.09687562584877014,
"mean_token_accuracy": 0.97865249812603,
"num_tokens": 6830797.0,
"step": 1090
},
{
"entropy": 2.098991483449936,
"epoch": 0.9534127843986999,
"grad_norm": 2.7293362617492676,
"learning_rate": 1.8681694077424613e-05,
"loss": 0.08977670073509217,
"mean_token_accuracy": 0.9780241951346398,
"num_tokens": 6892230.0,
"step": 1100
},
{
"epoch": 0.9534127843986999,
"eval_entropy": 2.0070505842047544,
"eval_loss": 0.14140334725379944,
"eval_mean_token_accuracy": 0.9657606870973882,
"eval_num_tokens": 6892230.0,
"eval_runtime": 327.6001,
"eval_samples_per_second": 4.908,
"eval_steps_per_second": 0.614,
"step": 1100
},
{
"entropy": 2.031548282504082,
"epoch": 0.962080173347779,
"grad_norm": 4.61448335647583,
"learning_rate": 1.8653696946526453e-05,
"loss": 0.21447787284851075,
"mean_token_accuracy": 0.9273400843143463,
"num_tokens": 6961253.0,
"step": 1110
},
{
"entropy": 2.145294892787933,
"epoch": 0.9707475622968581,
"grad_norm": 3.039484739303589,
"learning_rate": 1.8625427078115798e-05,
"loss": 0.0884899377822876,
"mean_token_accuracy": 0.9799038738012313,
"num_tokens": 7017065.0,
"step": 1120
},
{
"entropy": 2.107818600535393,
"epoch": 0.9794149512459371,
"grad_norm": 0.6422417759895325,
"learning_rate": 1.8596885363170645e-05,
"loss": 0.13402427434921266,
"mean_token_accuracy": 0.9699044972658157,
"num_tokens": 7075829.0,
"step": 1130
},
{
"entropy": 2.059667307138443,
"epoch": 0.9880823401950163,
"grad_norm": 2.9093730449676514,
"learning_rate": 1.8568072701236747e-05,
"loss": 0.16023958921432496,
"mean_token_accuracy": 0.9600200474262237,
"num_tokens": 7137365.0,
"step": 1140
},
{
"entropy": 2.160347416996956,
"epoch": 0.9967497291440953,
"grad_norm": 3.1662862300872803,
"learning_rate": 1.8538990000399263e-05,
"loss": 0.22539846897125243,
"mean_token_accuracy": 0.9572510078549386,
"num_tokens": 7196582.0,
"step": 1150
},
{
"entropy": 2.0696292229187794,
"epoch": 1.0052004333694475,
"grad_norm": 2.288025140762329,
"learning_rate": 1.850963817725413e-05,
"loss": 0.11503632068634033,
"mean_token_accuracy": 0.9689550736011603,
"num_tokens": 7256906.0,
"step": 1160
},
{
"entropy": 2.1042013496160505,
"epoch": 1.0138678223185265,
"grad_norm": 3.8589515686035156,
"learning_rate": 1.8480018156879184e-05,
"loss": 0.09237539768218994,
"mean_token_accuracy": 0.9765888974070549,
"num_tokens": 7314179.0,
"step": 1170
},
{
"entropy": 2.0591933131217957,
"epoch": 1.0225352112676056,
"grad_norm": 3.412147045135498,
"learning_rate": 1.8450130872804995e-05,
"loss": 0.0972133755683899,
"mean_token_accuracy": 0.9700871393084526,
"num_tokens": 7377659.0,
"step": 1180
},
{
"entropy": 2.0358568876981735,
"epoch": 1.0312026002166848,
"grad_norm": 1.8209773302078247,
"learning_rate": 1.8419977266985466e-05,
"loss": 0.10635190010070801,
"mean_token_accuracy": 0.9710655510425568,
"num_tokens": 7448951.0,
"step": 1190
},
{
"entropy": 2.139003211259842,
"epoch": 1.039869989165764,
"grad_norm": 0.22012463212013245,
"learning_rate": 1.83895582897681e-05,
"loss": 0.07087588906288148,
"mean_token_accuracy": 0.9820687800645829,
"num_tokens": 7507884.0,
"step": 1200
},
{
"epoch": 1.039869989165764,
"eval_entropy": 1.998491422453923,
"eval_loss": 0.11934716999530792,
"eval_mean_token_accuracy": 0.9696379659780815,
"eval_num_tokens": 7507884.0,
"eval_runtime": 327.528,
"eval_samples_per_second": 4.91,
"eval_steps_per_second": 0.614,
"step": 1200
},
{
"entropy": 2.047052562236786,
"epoch": 1.0485373781148428,
"grad_norm": 2.6051576137542725,
"learning_rate": 1.8358874899864114e-05,
"loss": 0.08912789225578308,
"mean_token_accuracy": 0.9771837398409844,
"num_tokens": 7568084.0,
"step": 1210
},
{
"entropy": 2.047335183620453,
"epoch": 1.057204767063922,
"grad_norm": 3.3506662845611572,
"learning_rate": 1.8327928064318157e-05,
"loss": 0.0860203206539154,
"mean_token_accuracy": 0.9751673907041549,
"num_tokens": 7627314.0,
"step": 1220
},
{
"entropy": 2.1224594831466677,
"epoch": 1.0658721560130011,
"grad_norm": 4.894758224487305,
"learning_rate": 1.8296718758477882e-05,
"loss": 0.05694900751113892,
"mean_token_accuracy": 0.971023240685463,
"num_tokens": 7687861.0,
"step": 1230
},
{
"entropy": 1.9626843601465225,
"epoch": 1.0745395449620803,
"grad_norm": 2.579737901687622,
"learning_rate": 1.826524796596318e-05,
"loss": 0.10832076072692871,
"mean_token_accuracy": 0.9784040197730064,
"num_tokens": 7760668.0,
"step": 1240
},
{
"entropy": 1.968853595852852,
"epoch": 1.0832069339111592,
"grad_norm": 2.3511769771575928,
"learning_rate": 1.823351667863518e-05,
"loss": 0.15547066926956177,
"mean_token_accuracy": 0.9642201095819474,
"num_tokens": 7827206.0,
"step": 1250
},
{
"entropy": 2.056541362404823,
"epoch": 1.0918743228602383,
"grad_norm": 2.1804311275482178,
"learning_rate": 1.8201525896565e-05,
"loss": 0.10602462291717529,
"mean_token_accuracy": 0.9716919779777526,
"num_tokens": 7885020.0,
"step": 1260
},
{
"entropy": 1.9817122548818589,
"epoch": 1.1005417118093175,
"grad_norm": 0.2855832576751709,
"learning_rate": 1.8169276628002228e-05,
"loss": 0.1441387414932251,
"mean_token_accuracy": 0.9583184272050858,
"num_tokens": 7954015.0,
"step": 1270
},
{
"entropy": 2.0565784901380537,
"epoch": 1.1092091007583966,
"grad_norm": 4.35746955871582,
"learning_rate": 1.8136769889343128e-05,
"loss": 0.1163863182067871,
"mean_token_accuracy": 0.9769072517752647,
"num_tokens": 8017014.0,
"step": 1280
},
{
"entropy": 2.069455534219742,
"epoch": 1.1178764897074756,
"grad_norm": 3.1686489582061768,
"learning_rate": 1.810400670509862e-05,
"loss": 0.04684387743473053,
"mean_token_accuracy": 0.9839098215103149,
"num_tokens": 8073602.0,
"step": 1290
},
{
"entropy": 1.991150015592575,
"epoch": 1.1265438786565547,
"grad_norm": 5.245935440063477,
"learning_rate": 1.8070988107861996e-05,
"loss": 0.12618616819381714,
"mean_token_accuracy": 0.9685941189527512,
"num_tokens": 8136794.0,
"step": 1300
},
{
"epoch": 1.1265438786565547,
"eval_entropy": 1.9715949030064825,
"eval_loss": 0.12539811432361603,
"eval_mean_token_accuracy": 0.964166374645423,
"eval_num_tokens": 8136794.0,
"eval_runtime": 327.6705,
"eval_samples_per_second": 4.907,
"eval_steps_per_second": 0.613,
"step": 1300
},
{
"entropy": 2.136713647842407,
"epoch": 1.1352112676056338,
"grad_norm": 2.6332850456237793,
"learning_rate": 1.8037715138276356e-05,
"loss": 0.08332991600036621,
"mean_token_accuracy": 0.9834440797567368,
"num_tokens": 8186732.0,
"step": 1310
},
{
"entropy": 2.0103059858083725,
"epoch": 1.1438786565547128,
"grad_norm": 2.718291997909546,
"learning_rate": 1.8004188845001837e-05,
"loss": 0.08337950706481934,
"mean_token_accuracy": 0.9742418512701988,
"num_tokens": 8251092.0,
"step": 1320
},
{
"entropy": 1.9932494521141053,
"epoch": 1.152546045503792,
"grad_norm": 3.646721601486206,
"learning_rate": 1.797041028468254e-05,
"loss": 0.15116094350814818,
"mean_token_accuracy": 0.9642645418643951,
"num_tokens": 8314924.0,
"step": 1330
},
{
"entropy": 2.081474080681801,
"epoch": 1.161213434452871,
"grad_norm": 0.9599646925926208,
"learning_rate": 1.7936380521913227e-05,
"loss": 0.04085415005683899,
"mean_token_accuracy": 0.9839913368225097,
"num_tokens": 8370143.0,
"step": 1340
},
{
"entropy": 1.983850082755089,
"epoch": 1.1698808234019502,
"grad_norm": 1.3555337190628052,
"learning_rate": 1.7902100629205793e-05,
"loss": 0.08805139660835266,
"mean_token_accuracy": 0.9821525901556015,
"num_tokens": 8440802.0,
"step": 1350
},
{
"entropy": 2.0713098883628844,
"epoch": 1.1785482123510294,
"grad_norm": 3.1760222911834717,
"learning_rate": 1.7867571686955435e-05,
"loss": 0.11011135578155518,
"mean_token_accuracy": 0.9650946885347367,
"num_tokens": 8503577.0,
"step": 1360
},
{
"entropy": 2.00400799959898,
"epoch": 1.1872156013001083,
"grad_norm": 1.7475781440734863,
"learning_rate": 1.7832794783406627e-05,
"loss": 0.09046050310134887,
"mean_token_accuracy": 0.9751720637083053,
"num_tokens": 8564681.0,
"step": 1370
},
{
"entropy": 2.052886575460434,
"epoch": 1.1958829902491874,
"grad_norm": 1.0036333799362183,
"learning_rate": 1.7797771014618798e-05,
"loss": 0.11622474193572999,
"mean_token_accuracy": 0.9750452309846878,
"num_tokens": 8626076.0,
"step": 1380
},
{
"entropy": 2.0878810614347456,
"epoch": 1.2045503791982666,
"grad_norm": 4.102039813995361,
"learning_rate": 1.77625014844318e-05,
"loss": 0.10430421829223632,
"mean_token_accuracy": 0.9714325606822968,
"num_tokens": 8684962.0,
"step": 1390
},
{
"entropy": 2.0384886085987093,
"epoch": 1.2132177681473455,
"grad_norm": 1.0469868183135986,
"learning_rate": 1.7726987304431125e-05,
"loss": 0.05419512987136841,
"mean_token_accuracy": 0.982357631623745,
"num_tokens": 8748790.0,
"step": 1400
},
{
"epoch": 1.2132177681473455,
"eval_entropy": 1.9552279841247482,
"eval_loss": 0.12215632200241089,
"eval_mean_token_accuracy": 0.9683096506702367,
"eval_num_tokens": 8748790.0,
"eval_runtime": 327.5547,
"eval_samples_per_second": 4.909,
"eval_steps_per_second": 0.614,
"step": 1400
},
{
"entropy": 1.953641840815544,
"epoch": 1.2218851570964246,
"grad_norm": 0.5614034533500671,
"learning_rate": 1.7691229593912855e-05,
"loss": 0.05820891261100769,
"mean_token_accuracy": 0.9764899387955666,
"num_tokens": 8814421.0,
"step": 1410
},
{
"entropy": 2.0551287651062013,
"epoch": 1.2305525460455038,
"grad_norm": 2.177788734436035,
"learning_rate": 1.7655229479848396e-05,
"loss": 0.07185115218162537,
"mean_token_accuracy": 0.9787142857909202,
"num_tokens": 8868678.0,
"step": 1420
},
{
"entropy": 1.9916139125823975,
"epoch": 1.239219934994583,
"grad_norm": 2.7501561641693115,
"learning_rate": 1.7618988096848957e-05,
"loss": 0.0644925594329834,
"mean_token_accuracy": 0.9745761170983315,
"num_tokens": 8938006.0,
"step": 1430
},
{
"entropy": 1.9660134196281434,
"epoch": 1.247887323943662,
"grad_norm": 0.21380360424518585,
"learning_rate": 1.7582506587129794e-05,
"loss": 0.10330332517623901,
"mean_token_accuracy": 0.9776182726025582,
"num_tokens": 9008588.0,
"step": 1440
},
{
"entropy": 2.0498579114675524,
"epoch": 1.256554712892741,
"grad_norm": 0.8262104392051697,
"learning_rate": 1.7545786100474197e-05,
"loss": 0.07196399569511414,
"mean_token_accuracy": 0.976461161673069,
"num_tokens": 9071525.0,
"step": 1450
},
{
"entropy": 2.0368919670581818,
"epoch": 1.2652221018418202,
"grad_norm": 4.542933940887451,
"learning_rate": 1.7508827794197283e-05,
"loss": 0.1121648907661438,
"mean_token_accuracy": 0.9739218279719353,
"num_tokens": 9128401.0,
"step": 1460
},
{
"entropy": 2.028754585981369,
"epoch": 1.2738894907908993,
"grad_norm": 3.789047956466675,
"learning_rate": 1.747163283310948e-05,
"loss": 0.07412697076797485,
"mean_token_accuracy": 0.9807208150625228,
"num_tokens": 9197272.0,
"step": 1470
},
{
"entropy": 2.0691492050886153,
"epoch": 1.2825568797399782,
"grad_norm": 4.7594380378723145,
"learning_rate": 1.7434202389479846e-05,
"loss": 0.0705658733844757,
"mean_token_accuracy": 0.9594802007079124,
"num_tokens": 9257267.0,
"step": 1480
},
{
"entropy": 2.082161045074463,
"epoch": 1.2912242686890574,
"grad_norm": 2.5111472606658936,
"learning_rate": 1.739653764299912e-05,
"loss": 0.09044097065925598,
"mean_token_accuracy": 0.9694541215896606,
"num_tokens": 9319539.0,
"step": 1490
},
{
"entropy": 2.0065703094005585,
"epoch": 1.2998916576381365,
"grad_norm": 2.8309035301208496,
"learning_rate": 1.7358639780742523e-05,
"loss": 0.07192415595054627,
"mean_token_accuracy": 0.9744586929678917,
"num_tokens": 9374879.0,
"step": 1500
},
{
"epoch": 1.2998916576381365,
"eval_entropy": 1.9755405430770039,
"eval_loss": 0.11345293372869492,
"eval_mean_token_accuracy": 0.9704583070764494,
"eval_num_tokens": 9374879.0,
"eval_runtime": 327.3007,
"eval_samples_per_second": 4.913,
"eval_steps_per_second": 0.614,
"step": 1500
},
{
"entropy": 2.0670559823513033,
"epoch": 1.3085590465872157,
"grad_norm": 0.36768296360969543,
"learning_rate": 1.732050999713236e-05,
"loss": 0.07674946188926697,
"mean_token_accuracy": 0.9863375291228295,
"num_tokens": 9434504.0,
"step": 1510
},
{
"entropy": 2.001679763197899,
"epoch": 1.3172264355362948,
"grad_norm": 1.7141518592834473,
"learning_rate": 1.728214949390038e-05,
"loss": 0.07157499194145203,
"mean_token_accuracy": 0.9796392112970352,
"num_tokens": 9491287.0,
"step": 1520
},
{
"entropy": 2.0744961857795716,
"epoch": 1.3258938244853737,
"grad_norm": 2.1506600379943848,
"learning_rate": 1.7243559480049895e-05,
"loss": 0.1661256194114685,
"mean_token_accuracy": 0.9499395877122879,
"num_tokens": 9547172.0,
"step": 1530
},
{
"entropy": 2.0488713175058364,
"epoch": 1.3345612134344529,
"grad_norm": 1.0758910179138184,
"learning_rate": 1.7204741171817662e-05,
"loss": 0.13161916732788087,
"mean_token_accuracy": 0.9632299363613128,
"num_tokens": 9609537.0,
"step": 1540
},
{
"entropy": 2.0280631333589554,
"epoch": 1.343228602383532,
"grad_norm": 7.010381698608398,
"learning_rate": 1.716569579263558e-05,
"loss": 0.12925589084625244,
"mean_token_accuracy": 0.9689023286104202,
"num_tokens": 9664019.0,
"step": 1550
},
{
"entropy": 2.079831117391586,
"epoch": 1.351895991332611,
"grad_norm": 4.380460262298584,
"learning_rate": 1.7126424573092106e-05,
"loss": 0.1093141794204712,
"mean_token_accuracy": 0.9770100638270378,
"num_tokens": 9724394.0,
"step": 1560
},
{
"entropy": 2.0715120315551756,
"epoch": 1.36056338028169,
"grad_norm": 1.3284443616867065,
"learning_rate": 1.7086928750893475e-05,
"loss": 0.061691224575042725,
"mean_token_accuracy": 0.9804880693554878,
"num_tokens": 9785387.0,
"step": 1570
},
{
"entropy": 2.0884166300296783,
"epoch": 1.3692307692307693,
"grad_norm": 5.367604732513428,
"learning_rate": 1.7047209570824715e-05,
"loss": 0.11438063383102418,
"mean_token_accuracy": 0.9706978917121887,
"num_tokens": 9851203.0,
"step": 1580
},
{
"entropy": 2.0226283043622972,
"epoch": 1.3778981581798484,
"grad_norm": 3.4851460456848145,
"learning_rate": 1.7007268284710384e-05,
"loss": 0.07323808670043945,
"mean_token_accuracy": 0.9414705485105515,
"num_tokens": 9917487.0,
"step": 1590
},
{
"entropy": 2.0937221944332123,
"epoch": 1.3865655471289275,
"grad_norm": 3.1039235591888428,
"learning_rate": 1.6967106151375127e-05,
"loss": 0.08786031603813171,
"mean_token_accuracy": 0.9706021770834923,
"num_tokens": 9975291.0,
"step": 1600
},
{
"epoch": 1.3865655471289275,
"eval_entropy": 1.9869690884405107,
"eval_loss": 0.10875136405229568,
"eval_mean_token_accuracy": 0.9710013614365117,
"eval_num_tokens": 9975291.0,
"eval_runtime": 327.3446,
"eval_samples_per_second": 4.912,
"eval_steps_per_second": 0.614,
"step": 1600
},
{
"entropy": 2.1072473585605622,
"epoch": 1.3952329360780065,
"grad_norm": 0.9677545428276062,
"learning_rate": 1.692672443660401e-05,
"loss": 0.055405884981155396,
"mean_token_accuracy": 0.9801833376288414,
"num_tokens": 10027147.0,
"step": 1610
},
{
"entropy": 2.044584667682648,
"epoch": 1.4039003250270856,
"grad_norm": 0.11175656318664551,
"learning_rate": 1.6886124413102613e-05,
"loss": 0.07465912699699402,
"mean_token_accuracy": 0.9422569587826729,
"num_tokens": 10092663.0,
"step": 1620
},
{
"entropy": 2.1110137164592744,
"epoch": 1.4125677139761648,
"grad_norm": 2.970170259475708,
"learning_rate": 1.684530736045694e-05,
"loss": 0.0848125159740448,
"mean_token_accuracy": 0.9740940272808075,
"num_tokens": 10154170.0,
"step": 1630
},
{
"entropy": 1.990675364434719,
"epoch": 1.4212351029252437,
"grad_norm": 0.8938102126121521,
"learning_rate": 1.680427456509306e-05,
"loss": 0.04920684993267059,
"mean_token_accuracy": 0.9847660586237907,
"num_tokens": 10227250.0,
"step": 1640
},
{
"entropy": 1.9731363147497176,
"epoch": 1.4299024918743228,
"grad_norm": 1.0118954181671143,
"learning_rate": 1.676302732023659e-05,
"loss": 0.13038522005081177,
"mean_token_accuracy": 0.9758126527070999,
"num_tokens": 10292153.0,
"step": 1650
},
{
"entropy": 2.043409901857376,
"epoch": 1.438569880823402,
"grad_norm": 1.6107861995697021,
"learning_rate": 1.672156692587192e-05,
"loss": 0.11529507637023925,
"mean_token_accuracy": 0.9792997568845749,
"num_tokens": 10348745.0,
"step": 1660
},
{
"entropy": 1.9989187628030778,
"epoch": 1.4472372697724811,
"grad_norm": 3.2114312648773193,
"learning_rate": 1.667989468870125e-05,
"loss": 0.06816362738609313,
"mean_token_accuracy": 0.9801637664437294,
"num_tokens": 10413882.0,
"step": 1670
},
{
"entropy": 2.130072697997093,
"epoch": 1.45590465872156,
"grad_norm": 2.18566632270813,
"learning_rate": 1.6638011922103396e-05,
"loss": 0.051083773374557495,
"mean_token_accuracy": 0.9857296943664551,
"num_tokens": 10463260.0,
"step": 1680
},
{
"entropy": 1.926492241024971,
"epoch": 1.4645720476706392,
"grad_norm": 3.8177168369293213,
"learning_rate": 1.659591994609242e-05,
"loss": 0.09213488101959229,
"mean_token_accuracy": 0.9710013046860695,
"num_tokens": 10540571.0,
"step": 1690
},
{
"entropy": 2.016107204556465,
"epoch": 1.4732394366197183,
"grad_norm": 2.7653048038482666,
"learning_rate": 1.6553620087275996e-05,
"loss": 0.09522730708122254,
"mean_token_accuracy": 0.9786510393023491,
"num_tokens": 10606926.0,
"step": 1700
},
{
"epoch": 1.4732394366197183,
"eval_entropy": 1.9856633511348742,
"eval_loss": 0.10925532877445221,
"eval_mean_token_accuracy": 0.9715426552354993,
"eval_num_tokens": 10606926.0,
"eval_runtime": 327.2982,
"eval_samples_per_second": 4.913,
"eval_steps_per_second": 0.614,
"step": 1700
},
{
"entropy": 2.0318871945142747,
"epoch": 1.4819068255687973,
"grad_norm": 2.5777456760406494,
"learning_rate": 1.6511113678813628e-05,
"loss": 0.09499718546867371,
"mean_token_accuracy": 0.9737421438097954,
"num_tokens": 10669193.0,
"step": 1710
},
{
"entropy": 2.0573316484689714,
"epoch": 1.4905742145178764,
"grad_norm": 2.01214337348938,
"learning_rate": 1.6468402060374603e-05,
"loss": 0.06001516580581665,
"mean_token_accuracy": 0.9805633515119553,
"num_tokens": 10726268.0,
"step": 1720
},
{
"entropy": 2.0403822153806686,
"epoch": 1.4992416034669556,
"grad_norm": 2.346749782562256,
"learning_rate": 1.6425486578095808e-05,
"loss": 0.07113800644874572,
"mean_token_accuracy": 0.9750549405813217,
"num_tokens": 10790790.0,
"step": 1730
},
{
"entropy": 2.0111173152923585,
"epoch": 1.5079089924160347,
"grad_norm": 1.508115291595459,
"learning_rate": 1.6382368584539263e-05,
"loss": 0.08907117843627929,
"mean_token_accuracy": 0.9684910327196121,
"num_tokens": 10856645.0,
"step": 1740
},
{
"entropy": 2.0451995551586153,
"epoch": 1.5165763813651139,
"grad_norm": 1.8610405921936035,
"learning_rate": 1.6339049438649518e-05,
"loss": 0.04824534356594086,
"mean_token_accuracy": 0.9889178365468979,
"num_tokens": 10920009.0,
"step": 1750
},
{
"entropy": 2.0435550212860107,
"epoch": 1.525243770314193,
"grad_norm": 4.985892295837402,
"learning_rate": 1.629553050571082e-05,
"loss": 0.15718719959259034,
"mean_token_accuracy": 0.9681286260485649,
"num_tokens": 10981763.0,
"step": 1760
},
{
"entropy": 2.008193162083626,
"epoch": 1.533911159263272,
"grad_norm": 5.671135425567627,
"learning_rate": 1.6251813157304082e-05,
"loss": 0.03475911319255829,
"mean_token_accuracy": 0.9917748674750329,
"num_tokens": 11043295.0,
"step": 1770
},
{
"entropy": 1.9626969277858735,
"epoch": 1.542578548212351,
"grad_norm": 2.032866954803467,
"learning_rate": 1.6207898771263637e-05,
"loss": 0.08077131509780884,
"mean_token_accuracy": 0.9529249399900437,
"num_tokens": 11118730.0,
"step": 1780
},
{
"entropy": 1.9946265429258347,
"epoch": 1.55124593716143,
"grad_norm": 1.789146065711975,
"learning_rate": 1.6163788731633846e-05,
"loss": 0.04848654270172119,
"mean_token_accuracy": 0.9804087817668915,
"num_tokens": 11178215.0,
"step": 1790
},
{
"entropy": 2.029254746437073,
"epoch": 1.5599133261105091,
"grad_norm": 4.151276111602783,
"learning_rate": 1.6119484428625458e-05,
"loss": 0.0900123655796051,
"mean_token_accuracy": 0.9751652166247368,
"num_tokens": 11233012.0,
"step": 1800
},
{
"epoch": 1.5599133261105091,
"eval_entropy": 1.9374866355117875,
"eval_loss": 0.1022234857082367,
"eval_mean_token_accuracy": 0.9733626513338801,
"eval_num_tokens": 11233012.0,
"eval_runtime": 327.2254,
"eval_samples_per_second": 4.914,
"eval_steps_per_second": 0.614,
"step": 1800
},
{
"entropy": 1.946454071998596,
"epoch": 1.5685807150595883,
"grad_norm": 3.786501884460449,
"learning_rate": 1.6074987258571785e-05,
"loss": 0.07075926065444946,
"mean_token_accuracy": 0.9727453231811524,
"num_tokens": 11305803.0,
"step": 1810
},
{
"entropy": 2.043697011470795,
"epoch": 1.5772481040086674,
"grad_norm": 2.9145822525024414,
"learning_rate": 1.6030298623884725e-05,
"loss": 0.10216034650802612,
"mean_token_accuracy": 0.9663027971982956,
"num_tokens": 11369379.0,
"step": 1820
},
{
"entropy": 2.047376683354378,
"epoch": 1.5859154929577466,
"grad_norm": 4.711336135864258,
"learning_rate": 1.598541993301053e-05,
"loss": 0.09091570377349853,
"mean_token_accuracy": 0.9761122927069664,
"num_tokens": 11428198.0,
"step": 1830
},
{
"entropy": 2.036109083890915,
"epoch": 1.5945828819068257,
"grad_norm": 1.2843303680419922,
"learning_rate": 1.594035260038543e-05,
"loss": 0.10113109350204467,
"mean_token_accuracy": 0.9779675856232644,
"num_tokens": 11482298.0,
"step": 1840
},
{
"entropy": 2.017902082204819,
"epoch": 1.6032502708559047,
"grad_norm": 0.7417038083076477,
"learning_rate": 1.5895098046391057e-05,
"loss": 0.05627822279930115,
"mean_token_accuracy": 0.9855908393859864,
"num_tokens": 11540418.0,
"step": 1850
},
{
"entropy": 2.0214678078889845,
"epoch": 1.6119176598049836,
"grad_norm": 3.1506597995758057,
"learning_rate": 1.5849657697309683e-05,
"loss": 0.10502588748931885,
"mean_token_accuracy": 0.9502844616770745,
"num_tokens": 11607357.0,
"step": 1860
},
{
"entropy": 2.0340816736221314,
"epoch": 1.6205850487540627,
"grad_norm": 1.0242708921432495,
"learning_rate": 1.5804032985279252e-05,
"loss": 0.08334928750991821,
"mean_token_accuracy": 0.9770424932241439,
"num_tokens": 11663906.0,
"step": 1870
},
{
"entropy": 2.0508361369371415,
"epoch": 1.6292524377031419,
"grad_norm": 1.4971176385879517,
"learning_rate": 1.575822534824825e-05,
"loss": 0.09026987552642822,
"mean_token_accuracy": 0.9807920411229134,
"num_tokens": 11726502.0,
"step": 1880
},
{
"entropy": 2.1219515979290007,
"epoch": 1.637919826652221,
"grad_norm": 1.5746535062789917,
"learning_rate": 1.5712236229930397e-05,
"loss": 0.04556220769882202,
"mean_token_accuracy": 0.9804752409458161,
"num_tokens": 11779127.0,
"step": 1890
},
{
"entropy": 2.0381762087345123,
"epoch": 1.6465872156013002,
"grad_norm": 0.9404705762863159,
"learning_rate": 1.5666067079759135e-05,
"loss": 0.07731429934501648,
"mean_token_accuracy": 0.9713137298822403,
"num_tokens": 11847516.0,
"step": 1900
},
{
"epoch": 1.6465872156013002,
"eval_entropy": 1.963913416388023,
"eval_loss": 0.10304063558578491,
"eval_mean_token_accuracy": 0.9715078390059779,
"eval_num_tokens": 11847516.0,
"eval_runtime": 327.2028,
"eval_samples_per_second": 4.914,
"eval_steps_per_second": 0.614,
"step": 1900
},
{
"entropy": 2.063380944728851,
"epoch": 1.6552546045503793,
"grad_norm": 0.5977736115455627,
"learning_rate": 1.5619719352841943e-05,
"loss": 0.052711588144302365,
"mean_token_accuracy": 0.9829199954867363,
"num_tokens": 11910897.0,
"step": 1910
},
{
"entropy": 2.004588797688484,
"epoch": 1.6639219934994582,
"grad_norm": 4.725104331970215,
"learning_rate": 1.5573194509914487e-05,
"loss": 0.09926276803016662,
"mean_token_accuracy": 0.974181592464447,
"num_tokens": 11970477.0,
"step": 1920
},
{
"entropy": 1.9811932653188706,
"epoch": 1.6725893824485374,
"grad_norm": 2.943774938583374,
"learning_rate": 1.552649401729457e-05,
"loss": 0.10009403228759765,
"mean_token_accuracy": 0.976198148727417,
"num_tokens": 12037070.0,
"step": 1930
},
{
"entropy": 2.004721650481224,
"epoch": 1.6812567713976163,
"grad_norm": 2.643268346786499,
"learning_rate": 1.547961934683593e-05,
"loss": 0.07603888511657715,
"mean_token_accuracy": 0.9785078406333924,
"num_tokens": 12105290.0,
"step": 1940
},
{
"entropy": 2.0851855903863905,
"epoch": 1.6899241603466955,
"grad_norm": 7.968814373016357,
"learning_rate": 1.543257197588185e-05,
"loss": 0.06787392497062683,
"mean_token_accuracy": 0.9741996258497239,
"num_tokens": 12162023.0,
"step": 1950
},
{
"entropy": 2.070946404337883,
"epoch": 1.6985915492957746,
"grad_norm": 2.098217010498047,
"learning_rate": 1.5385353387218582e-05,
"loss": 0.09096076488494872,
"mean_token_accuracy": 0.9812888115644455,
"num_tokens": 12215829.0,
"step": 1960
},
{
"entropy": 1.9490791618824006,
"epoch": 1.7072589382448538,
"grad_norm": 1.2963298559188843,
"learning_rate": 1.533796506902864e-05,
"loss": 0.06780060529708862,
"mean_token_accuracy": 0.9537896811962128,
"num_tokens": 12288764.0,
"step": 1970
},
{
"entropy": 2.0761090010404586,
"epoch": 1.715926327193933,
"grad_norm": 2.5760719776153564,
"learning_rate": 1.529040851484387e-05,
"loss": 0.08884007334709168,
"mean_token_accuracy": 0.975817295908928,
"num_tokens": 12346057.0,
"step": 1980
},
{
"entropy": 2.0713831394910813,
"epoch": 1.724593716143012,
"grad_norm": 0.34983646869659424,
"learning_rate": 1.5242685223498403e-05,
"loss": 0.057441574335098264,
"mean_token_accuracy": 0.9883616760373115,
"num_tokens": 12404753.0,
"step": 1990
},
{
"entropy": 2.030237454175949,
"epoch": 1.733261105092091,
"grad_norm": 2.676185131072998,
"learning_rate": 1.5194796699081394e-05,
"loss": 0.05204044580459595,
"mean_token_accuracy": 0.9582399621605873,
"num_tokens": 12475078.0,
"step": 2000
},
{
"epoch": 1.733261105092091,
"eval_entropy": 1.9605983175448518,
"eval_loss": 0.09823993593454361,
"eval_mean_token_accuracy": 0.9746547498513217,
"eval_num_tokens": 12475078.0,
"eval_runtime": 327.1063,
"eval_samples_per_second": 4.916,
"eval_steps_per_second": 0.614,
"step": 2000
},
{
"entropy": 2.0148254886269568,
"epoch": 1.7419284940411701,
"grad_norm": 3.1089882850646973,
"learning_rate": 1.5146744450889635e-05,
"loss": 0.06166669726371765,
"mean_token_accuracy": 0.9789237439632416,
"num_tokens": 12540081.0,
"step": 2010
},
{
"entropy": 2.031914421916008,
"epoch": 1.750595882990249,
"grad_norm": 0.7440986633300781,
"learning_rate": 1.5098529993379973e-05,
"loss": 0.027508893609046937,
"mean_token_accuracy": 0.9933552041649818,
"num_tokens": 12602793.0,
"step": 2020
},
{
"entropy": 2.0226054787635803,
"epoch": 1.7592632719393282,
"grad_norm": 2.497187376022339,
"learning_rate": 1.5050154846121605e-05,
"loss": 0.058700060844421385,
"mean_token_accuracy": 0.9858224302530288,
"num_tokens": 12660572.0,
"step": 2030
},
{
"entropy": 2.0026369482278823,
"epoch": 1.7679306608884073,
"grad_norm": 1.8420461416244507,
"learning_rate": 1.500162053374814e-05,
"loss": 0.10361694097518921,
"mean_token_accuracy": 0.9768809288740158,
"num_tokens": 12726774.0,
"step": 2040
},
{
"entropy": 1.9514106661081314,
"epoch": 1.7765980498374865,
"grad_norm": 1.7856649160385132,
"learning_rate": 1.49529285859096e-05,
"loss": 0.0996538519859314,
"mean_token_accuracy": 0.9810873970389367,
"num_tokens": 12792642.0,
"step": 2050
},
{
"entropy": 1.9771569460630416,
"epoch": 1.7852654387865656,
"grad_norm": 6.652771472930908,
"learning_rate": 1.4904080537224167e-05,
"loss": 0.08169901967048646,
"mean_token_accuracy": 0.9733238250017167,
"num_tokens": 12855661.0,
"step": 2060
},
{
"entropy": 2.0079775601625443,
"epoch": 1.7939328277356448,
"grad_norm": 0.9024977684020996,
"learning_rate": 1.4855077927229844e-05,
"loss": 0.07566041350364686,
"mean_token_accuracy": 0.9776167094707489,
"num_tokens": 12922735.0,
"step": 2070
},
{
"entropy": 2.0247191548347474,
"epoch": 1.8026002166847237,
"grad_norm": 2.8540401458740234,
"learning_rate": 1.480592230033592e-05,
"loss": 0.05470334887504578,
"mean_token_accuracy": 0.9820770204067231,
"num_tokens": 12991183.0,
"step": 2080
},
{
"entropy": 1.9862486839294433,
"epoch": 1.8112676056338028,
"grad_norm": 1.2073887586593628,
"learning_rate": 1.4756615205774298e-05,
"loss": 0.05954342484474182,
"mean_token_accuracy": 0.9859064787626266,
"num_tokens": 13057025.0,
"step": 2090
},
{
"entropy": 2.0485371172428133,
"epoch": 1.8199349945828818,
"grad_norm": 2.339723825454712,
"learning_rate": 1.4707158197550672e-05,
"loss": 0.09820868968963622,
"mean_token_accuracy": 0.9744172319769859,
"num_tokens": 13117982.0,
"step": 2100
},
{
"epoch": 1.8199349945828818,
"eval_entropy": 1.9775383715605854,
"eval_loss": 0.09860693663358688,
"eval_mean_token_accuracy": 0.9749452092161226,
"eval_num_tokens": 13117982.0,
"eval_runtime": 326.8903,
"eval_samples_per_second": 4.919,
"eval_steps_per_second": 0.615,
"step": 2100
},
{
"entropy": 2.0403252631425857,
"epoch": 1.828602383531961,
"grad_norm": 1.2614986896514893,
"learning_rate": 1.4657552834395548e-05,
"loss": 0.041930514574050906,
"mean_token_accuracy": 0.9876840353012085,
"num_tokens": 13182491.0,
"step": 2110
},
{
"entropy": 2.0170107007026674,
"epoch": 1.83726977248104,
"grad_norm": 2.0214993953704834,
"learning_rate": 1.460780067971511e-05,
"loss": 0.057864248752593994,
"mean_token_accuracy": 0.9776172533631324,
"num_tokens": 13249716.0,
"step": 2120
},
{
"entropy": 2.079446019232273,
"epoch": 1.8459371614301192,
"grad_norm": 3.712702751159668,
"learning_rate": 1.4557903301541959e-05,
"loss": 0.09157460927963257,
"mean_token_accuracy": 0.9703296691179275,
"num_tokens": 13303975.0,
"step": 2130
},
{
"entropy": 2.059545102715492,
"epoch": 1.8546045503791984,
"grad_norm": 4.248321056365967,
"learning_rate": 1.4507862272485683e-05,
"loss": 0.0807805061340332,
"mean_token_accuracy": 0.9754011020064354,
"num_tokens": 13367842.0,
"step": 2140
},
{
"entropy": 2.082644584774971,
"epoch": 1.8632719393282775,
"grad_norm": 2.45220947265625,
"learning_rate": 1.4457679169683298e-05,
"loss": 0.08419224619865417,
"mean_token_accuracy": 0.9753760308027267,
"num_tokens": 13423576.0,
"step": 2150
},
{
"entropy": 2.034376582503319,
"epoch": 1.8719393282773564,
"grad_norm": 1.8660109043121338,
"learning_rate": 1.4407355574749545e-05,
"loss": 0.033074367046356204,
"mean_token_accuracy": 0.9912351056933403,
"num_tokens": 13493594.0,
"step": 2160
},
{
"entropy": 2.034354430437088,
"epoch": 1.8806067172264356,
"grad_norm": 0.5296902060508728,
"learning_rate": 1.4356893073727032e-05,
"loss": 0.05761660933494568,
"mean_token_accuracy": 0.9903651595115661,
"num_tokens": 13554020.0,
"step": 2170
},
{
"entropy": 2.0224443942308428,
"epoch": 1.8892741061755145,
"grad_norm": 0.6507072448730469,
"learning_rate": 1.430629325703626e-05,
"loss": 0.04348507225513458,
"mean_token_accuracy": 0.9905618682503701,
"num_tokens": 13629040.0,
"step": 2180
},
{
"entropy": 2.132373425364494,
"epoch": 1.8979414951245936,
"grad_norm": 3.952540159225464,
"learning_rate": 1.4255557719425484e-05,
"loss": 0.06843092441558837,
"mean_token_accuracy": 0.9867907360196113,
"num_tokens": 13687505.0,
"step": 2190
},
{
"entropy": 2.068184557557106,
"epoch": 1.9066088840736728,
"grad_norm": 1.1742056608200073,
"learning_rate": 1.4204688059920466e-05,
"loss": 0.03711756467819214,
"mean_token_accuracy": 0.9907965555787086,
"num_tokens": 13747230.0,
"step": 2200
},
{
"epoch": 1.9066088840736728,
"eval_entropy": 1.9698931809088485,
"eval_loss": 0.09713288396596909,
"eval_mean_token_accuracy": 0.9762651187863516,
"eval_num_tokens": 13747230.0,
"eval_runtime": 326.9491,
"eval_samples_per_second": 4.918,
"eval_steps_per_second": 0.615,
"step": 2200
},
{
"entropy": 2.0157451212406157,
"epoch": 1.915276273022752,
"grad_norm": 2.843444347381592,
"learning_rate": 1.4153685881774065e-05,
"loss": 0.06452680230140687,
"mean_token_accuracy": 0.9809629857540131,
"num_tokens": 13809551.0,
"step": 2210
},
{
"entropy": 2.0150688737630844,
"epoch": 1.923943661971831,
"grad_norm": 1.5688871145248413,
"learning_rate": 1.410255279241572e-05,
"loss": 0.06514147520065308,
"mean_token_accuracy": 0.9764496192336083,
"num_tokens": 13871049.0,
"step": 2220
},
{
"entropy": 2.05910687148571,
"epoch": 1.9326110509209102,
"grad_norm": 2.9402899742126465,
"learning_rate": 1.4051290403400772e-05,
"loss": 0.07682484984397889,
"mean_token_accuracy": 0.9753732204437255,
"num_tokens": 13937668.0,
"step": 2230
},
{
"entropy": 2.0290389508008957,
"epoch": 1.9412784398699892,
"grad_norm": 0.7047325372695923,
"learning_rate": 1.39999003303597e-05,
"loss": 0.09054968953132629,
"mean_token_accuracy": 0.9820921018719673,
"num_tokens": 14007185.0,
"step": 2240
},
{
"entropy": 2.0927363365888594,
"epoch": 1.9499458288190683,
"grad_norm": 1.0138620138168335,
"learning_rate": 1.3948384192947173e-05,
"loss": 0.047953012585639956,
"mean_token_accuracy": 0.9867767512798309,
"num_tokens": 14067263.0,
"step": 2250
},
{
"entropy": 2.1822646766901017,
"epoch": 1.9586132177681472,
"grad_norm": 4.334517955780029,
"learning_rate": 1.3896743614791016e-05,
"loss": 0.10968102216720581,
"mean_token_accuracy": 0.9781262248754501,
"num_tokens": 14123634.0,
"step": 2260
},
{
"entropy": 2.044449067115784,
"epoch": 1.9672806067172264,
"grad_norm": 2.7011852264404297,
"learning_rate": 1.384498022344104e-05,
"loss": 0.07374554872512817,
"mean_token_accuracy": 0.9758610785007477,
"num_tokens": 14197541.0,
"step": 2270
},
{
"entropy": 2.0185159176588057,
"epoch": 1.9759479956663055,
"grad_norm": 1.0546622276306152,
"learning_rate": 1.3793095650317748e-05,
"loss": 0.08815826773643494,
"mean_token_accuracy": 0.9640801548957825,
"num_tokens": 14262081.0,
"step": 2280
},
{
"entropy": 2.065139350295067,
"epoch": 1.9846153846153847,
"grad_norm": 3.3348946571350098,
"learning_rate": 1.3741091530660908e-05,
"loss": 0.11671607494354248,
"mean_token_accuracy": 0.9726112186908722,
"num_tokens": 14320462.0,
"step": 2290
},
{
"entropy": 2.0409906804561615,
"epoch": 1.9932827735644638,
"grad_norm": 2.707357168197632,
"learning_rate": 1.3688969503478023e-05,
"loss": 0.0402547687292099,
"mean_token_accuracy": 0.9851001650094986,
"num_tokens": 14385759.0,
"step": 2300
},
{
"epoch": 1.9932827735644638,
"eval_entropy": 1.9840727985201783,
"eval_loss": 0.09598784148693085,
"eval_mean_token_accuracy": 0.9754515447426791,
"eval_num_tokens": 14385759.0,
"eval_runtime": 327.2061,
"eval_samples_per_second": 4.914,
"eval_steps_per_second": 0.614,
"step": 2300
},
{
"entropy": 2.040311214251396,
"epoch": 2.001733477789816,
"grad_norm": 0.23833799362182617,
"learning_rate": 1.363673121149268e-05,
"loss": 0.05946453809738159,
"mean_token_accuracy": 0.9876417364829626,
"num_tokens": 14447731.0,
"step": 2310
},
{
"entropy": 2.1271281450986863,
"epoch": 2.010400866738895,
"grad_norm": 0.5396865010261536,
"learning_rate": 1.3584378301092755e-05,
"loss": 0.0464493989944458,
"mean_token_accuracy": 0.9894088357686996,
"num_tokens": 14502292.0,
"step": 2320
},
{
"entropy": 2.043173521757126,
"epoch": 2.019068255687974,
"grad_norm": 2.565701484680176,
"learning_rate": 1.3531912422278556e-05,
"loss": 0.05969124436378479,
"mean_token_accuracy": 0.98280628323555,
"num_tokens": 14564518.0,
"step": 2330
},
{
"entropy": 2.0714380711317064,
"epoch": 2.027735644637053,
"grad_norm": 0.9354483485221863,
"learning_rate": 1.347933522861079e-05,
"loss": 0.03992786407470703,
"mean_token_accuracy": 0.9823066785931587,
"num_tokens": 14627721.0,
"step": 2340
},
{
"entropy": 2.019579991698265,
"epoch": 2.036403033586132,
"grad_norm": 1.2636523246765137,
"learning_rate": 1.3426648377158468e-05,
"loss": 0.029606398940086365,
"mean_token_accuracy": 0.9911484852433204,
"num_tokens": 14693612.0,
"step": 2350
},
{
"entropy": 1.9572718054056168,
"epoch": 2.045070422535211,
"grad_norm": 0.8804156184196472,
"learning_rate": 1.3373853528446665e-05,
"loss": 0.05862312912940979,
"mean_token_accuracy": 0.9830553591251373,
"num_tokens": 14763334.0,
"step": 2360
},
{
"entropy": 2.078517937660217,
"epoch": 2.0537378114842904,
"grad_norm": 3.8558311462402344,
"learning_rate": 1.33209523464042e-05,
"loss": 0.035841697454452516,
"mean_token_accuracy": 0.9903575092554092,
"num_tokens": 14828861.0,
"step": 2370
},
{
"entropy": 2.01448016166687,
"epoch": 2.0624052004333695,
"grad_norm": 1.981359601020813,
"learning_rate": 1.3267946498311182e-05,
"loss": 0.09111757278442383,
"mean_token_accuracy": 0.9801735639572143,
"num_tokens": 14889109.0,
"step": 2380
},
{
"entropy": 2.0431691616773606,
"epoch": 2.0710725893824486,
"grad_norm": 2.930243730545044,
"learning_rate": 1.3214837654746469e-05,
"loss": 0.03293420076370239,
"mean_token_accuracy": 0.987665319442749,
"num_tokens": 14953334.0,
"step": 2390
},
{
"entropy": 2.0081345975399016,
"epoch": 2.079739978331528,
"grad_norm": 1.702090859413147,
"learning_rate": 1.3161627489535011e-05,
"loss": 0.04024830460548401,
"mean_token_accuracy": 0.9895202398300171,
"num_tokens": 15018476.0,
"step": 2400
},
{
"epoch": 2.079739978331528,
"eval_entropy": 1.946521015902657,
"eval_loss": 0.09423359483480453,
"eval_mean_token_accuracy": 0.9767867083573223,
"eval_num_tokens": 15018476.0,
"eval_runtime": 327.2195,
"eval_samples_per_second": 4.914,
"eval_steps_per_second": 0.614,
"step": 2400
},
{
"entropy": 2.0467382192611696,
"epoch": 2.088407367280607,
"grad_norm": 0.7274250388145447,
"learning_rate": 1.3108317679695106e-05,
"loss": 0.05358461737632751,
"mean_token_accuracy": 0.9765512838959693,
"num_tokens": 15072387.0,
"step": 2410
},
{
"entropy": 2.027843546867371,
"epoch": 2.0970747562296856,
"grad_norm": 0.24272002279758453,
"learning_rate": 1.3054909905385537e-05,
"loss": 0.06842284202575684,
"mean_token_accuracy": 0.9816409394145011,
"num_tokens": 15127558.0,
"step": 2420
},
{
"entropy": 1.9965551286935805,
"epoch": 2.105742145178765,
"grad_norm": 0.11100158095359802,
"learning_rate": 1.300140584985262e-05,
"loss": 0.03788530230522156,
"mean_token_accuracy": 0.9869873493909835,
"num_tokens": 15194555.0,
"step": 2430
},
{
"entropy": 2.0039819896221163,
"epoch": 2.114409534127844,
"grad_norm": 5.010103702545166,
"learning_rate": 1.2947807199377155e-05,
"loss": 0.061254572868347165,
"mean_token_accuracy": 0.9877008363604546,
"num_tokens": 15259864.0,
"step": 2440
},
{
"entropy": 2.015304672718048,
"epoch": 2.123076923076923,
"grad_norm": 3.253303050994873,
"learning_rate": 1.2894115643221279e-05,
"loss": 0.04881041347980499,
"mean_token_accuracy": 0.9881685748696327,
"num_tokens": 15320656.0,
"step": 2450
},
{
"entropy": 1.986794075369835,
"epoch": 2.1317443120260022,
"grad_norm": 0.5272015333175659,
"learning_rate": 1.2840332873575232e-05,
"loss": 0.03953333795070648,
"mean_token_accuracy": 0.9862592309713364,
"num_tokens": 15390635.0,
"step": 2460
},
{
"entropy": 2.047020471096039,
"epoch": 2.1404117009750814,
"grad_norm": 0.8474643230438232,
"learning_rate": 1.2786460585504006e-05,
"loss": 0.051943039894104,
"mean_token_accuracy": 0.9837918564677238,
"num_tokens": 15447303.0,
"step": 2470
},
{
"entropy": 2.080169880390167,
"epoch": 2.1490790899241605,
"grad_norm": 1.2162392139434814,
"learning_rate": 1.2732500476893948e-05,
"loss": 0.031473752856254575,
"mean_token_accuracy": 0.9859877333045006,
"num_tokens": 15503176.0,
"step": 2480
},
{
"entropy": 1.9437969148159027,
"epoch": 2.1577464788732392,
"grad_norm": 1.1037133932113647,
"learning_rate": 1.2678454248399222e-05,
"loss": 0.03166500329971313,
"mean_token_accuracy": 0.9836494714021683,
"num_tokens": 15574501.0,
"step": 2490
},
{
"entropy": 2.107138791680336,
"epoch": 2.1664138678223184,
"grad_norm": 2.0166468620300293,
"learning_rate": 1.2624323603388231e-05,
"loss": 0.064914870262146,
"mean_token_accuracy": 0.9847393244504928,
"num_tokens": 15625012.0,
"step": 2500
},
{
"epoch": 2.1664138678223184,
"eval_entropy": 1.9424105657273858,
"eval_loss": 0.09450376033782959,
"eval_mean_token_accuracy": 0.9763566433493771,
"eval_num_tokens": 15625012.0,
"eval_runtime": 327.0207,
"eval_samples_per_second": 4.917,
"eval_steps_per_second": 0.615,
"step": 2500
},
{
"entropy": 1.9914342880249023,
"epoch": 2.1750812567713975,
"grad_norm": 1.1817911863327026,
"learning_rate": 1.2570110247889919e-05,
"loss": 0.05024116635322571,
"mean_token_accuracy": 0.9868739485740662,
"num_tokens": 15685301.0,
"step": 2510
},
{
"entropy": 2.065652829408646,
"epoch": 2.1837486457204767,
"grad_norm": 0.5138121247291565,
"learning_rate": 1.2515815890540011e-05,
"loss": 0.030631223320961,
"mean_token_accuracy": 0.9903474941849708,
"num_tokens": 15745027.0,
"step": 2520
},
{
"entropy": 1.9828102201223374,
"epoch": 2.192416034669556,
"grad_norm": 2.7374660968780518,
"learning_rate": 1.2461442242527145e-05,
"loss": 0.042875179648399354,
"mean_token_accuracy": 0.9895638823509216,
"num_tokens": 15804338.0,
"step": 2530
},
{
"entropy": 2.0349514096975327,
"epoch": 2.201083423618635,
"grad_norm": 1.7734557390213013,
"learning_rate": 1.240699101753897e-05,
"loss": 0.05402381420135498,
"mean_token_accuracy": 0.9609145388007164,
"num_tokens": 15867336.0,
"step": 2540
},
{
"entropy": 2.009895694255829,
"epoch": 2.209750812567714,
"grad_norm": 3.836571455001831,
"learning_rate": 1.2352463931708105e-05,
"loss": 0.05817890763282776,
"mean_token_accuracy": 0.9803715214133263,
"num_tokens": 15931728.0,
"step": 2550
},
{
"entropy": 2.06903837621212,
"epoch": 2.2184182015167933,
"grad_norm": 0.9334287047386169,
"learning_rate": 1.2297862703558079e-05,
"loss": 0.05199915170669556,
"mean_token_accuracy": 0.9837120354175568,
"num_tokens": 15995013.0,
"step": 2560
},
{
"entropy": 2.104375296831131,
"epoch": 2.227085590465872,
"grad_norm": 1.416616678237915,
"learning_rate": 1.2243189053949141e-05,
"loss": 0.03283692300319672,
"mean_token_accuracy": 0.9894999250769615,
"num_tokens": 16052916.0,
"step": 2570
},
{
"entropy": 2.0618636339902876,
"epoch": 2.235752979414951,
"grad_norm": 0.17304587364196777,
"learning_rate": 1.2188444706024047e-05,
"loss": 0.03944204151630402,
"mean_token_accuracy": 0.9891385614871979,
"num_tokens": 16106829.0,
"step": 2580
},
{
"entropy": 1.968971461057663,
"epoch": 2.2444203683640302,
"grad_norm": 1.0604981184005737,
"learning_rate": 1.2133631385153743e-05,
"loss": 0.03233407437801361,
"mean_token_accuracy": 0.9909744769334793,
"num_tokens": 16174485.0,
"step": 2590
},
{
"entropy": 2.0065663278102877,
"epoch": 2.2530877573131094,
"grad_norm": 1.3104647397994995,
"learning_rate": 1.2078750818882987e-05,
"loss": 0.08497329354286194,
"mean_token_accuracy": 0.9758600533008576,
"num_tokens": 16236830.0,
"step": 2600
},
{
"epoch": 2.2530877573131094,
"eval_entropy": 1.966503743508562,
"eval_loss": 0.0974222719669342,
"eval_mean_token_accuracy": 0.9753037845317404,
"eval_num_tokens": 16236830.0,
"eval_runtime": 327.0094,
"eval_samples_per_second": 4.917,
"eval_steps_per_second": 0.615,
"step": 2600
},
{
"entropy": 2.03442302942276,
"epoch": 2.2617551462621885,
"grad_norm": 1.5553882122039795,
"learning_rate": 1.2023804736875902e-05,
"loss": 0.0502473771572113,
"mean_token_accuracy": 0.9867029458284378,
"num_tokens": 16297830.0,
"step": 2610
},
{
"entropy": 2.0630034118890763,
"epoch": 2.2704225352112677,
"grad_norm": 1.4778331518173218,
"learning_rate": 1.1968794870861456e-05,
"loss": 0.03913445472717285,
"mean_token_accuracy": 0.9862898513674736,
"num_tokens": 16357326.0,
"step": 2620
},
{
"entropy": 1.9924042463302611,
"epoch": 2.279089924160347,
"grad_norm": 3.9587581157684326,
"learning_rate": 1.1913722954578899e-05,
"loss": 0.05349403023719788,
"mean_token_accuracy": 0.9834675654768944,
"num_tokens": 16429506.0,
"step": 2630
},
{
"entropy": 2.021091330051422,
"epoch": 2.2877573131094255,
"grad_norm": 0.6672972440719604,
"learning_rate": 1.1858590723723105e-05,
"loss": 0.07556374669075012,
"mean_token_accuracy": 0.9789584875106812,
"num_tokens": 16494120.0,
"step": 2640
},
{
"entropy": 2.001381501555443,
"epoch": 2.2964247020585047,
"grad_norm": 2.1601645946502686,
"learning_rate": 1.1803399915889879e-05,
"loss": 0.02168504297733307,
"mean_token_accuracy": 0.9941964268684387,
"num_tokens": 16552584.0,
"step": 2650
},
{
"entropy": 1.969146479666233,
"epoch": 2.305092091007584,
"grad_norm": 1.3330966234207153,
"learning_rate": 1.174815227052119e-05,
"loss": 0.07724554538726806,
"mean_token_accuracy": 0.9825429797172547,
"num_tokens": 16619463.0,
"step": 2660
},
{
"entropy": 2.022412383556366,
"epoch": 2.313759479956663,
"grad_norm": 0.49082720279693604,
"learning_rate": 1.1692849528850347e-05,
"loss": 0.0698297381401062,
"mean_token_accuracy": 0.9825235098600388,
"num_tokens": 16676884.0,
"step": 2670
},
{
"entropy": 1.9466478317975997,
"epoch": 2.322426868905742,
"grad_norm": 1.1853913068771362,
"learning_rate": 1.163749343384712e-05,
"loss": 0.07198914289474487,
"mean_token_accuracy": 0.9782518684864044,
"num_tokens": 16738824.0,
"step": 2680
},
{
"entropy": 2.0615739434957505,
"epoch": 2.3310942578548213,
"grad_norm": 2.7772486209869385,
"learning_rate": 1.1582085730162813e-05,
"loss": 0.05143954157829285,
"mean_token_accuracy": 0.987485408782959,
"num_tokens": 16792247.0,
"step": 2690
},
{
"entropy": 1.9806438446044923,
"epoch": 2.3397616468039004,
"grad_norm": 4.884121417999268,
"learning_rate": 1.1526628164075273e-05,
"loss": 0.08477678298950195,
"mean_token_accuracy": 0.9575665161013603,
"num_tokens": 16857938.0,
"step": 2700
},
{
"epoch": 2.3397616468039004,
"eval_entropy": 1.9306559194972859,
"eval_loss": 0.0928974524140358,
"eval_mean_token_accuracy": 0.9761734486219302,
"eval_num_tokens": 16857938.0,
"eval_runtime": 327.2258,
"eval_samples_per_second": 4.914,
"eval_steps_per_second": 0.614,
"step": 2700
},
{
"entropy": 2.044921043515205,
"epoch": 2.3484290357529796,
"grad_norm": 0.7897859811782837,
"learning_rate": 1.1471122483433856e-05,
"loss": 0.04415179193019867,
"mean_token_accuracy": 0.9867105528712272,
"num_tokens": 16918909.0,
"step": 2710
},
{
"entropy": 1.9723411783576013,
"epoch": 2.3570964247020587,
"grad_norm": 1.2908411026000977,
"learning_rate": 1.1415570437604335e-05,
"loss": 0.06363893747329712,
"mean_token_accuracy": 0.9832093894481659,
"num_tokens": 16978352.0,
"step": 2720
},
{
"entropy": 2.022680976986885,
"epoch": 2.3657638136511374,
"grad_norm": 0.7468595504760742,
"learning_rate": 1.1359973777413774e-05,
"loss": 0.03693146705627441,
"mean_token_accuracy": 0.9875386908650399,
"num_tokens": 17035505.0,
"step": 2730
},
{
"entropy": 1.8950548261404037,
"epoch": 2.3744312026002166,
"grad_norm": 2.981616258621216,
"learning_rate": 1.1304334255095337e-05,
"loss": 0.09151351451873779,
"mean_token_accuracy": 0.9821941837668419,
"num_tokens": 17110174.0,
"step": 2740
},
{
"entropy": 1.9415518552064897,
"epoch": 2.3830985915492957,
"grad_norm": 2.130307197570801,
"learning_rate": 1.1248653624233073e-05,
"loss": 0.07621107697486877,
"mean_token_accuracy": 0.975463455915451,
"num_tokens": 17177359.0,
"step": 2750
},
{
"entropy": 1.9728293806314467,
"epoch": 2.391765980498375,
"grad_norm": 1.8035576343536377,
"learning_rate": 1.119293363970664e-05,
"loss": 0.05236530900001526,
"mean_token_accuracy": 0.9870255410671234,
"num_tokens": 17245792.0,
"step": 2760
},
{
"entropy": 2.0360106259584425,
"epoch": 2.400433369447454,
"grad_norm": 0.6293774247169495,
"learning_rate": 1.1137176057636008e-05,
"loss": 0.05267359614372254,
"mean_token_accuracy": 0.9824561506509781,
"num_tokens": 17306938.0,
"step": 2770
},
{
"entropy": 1.9547817423939704,
"epoch": 2.409100758396533,
"grad_norm": 1.1461045742034912,
"learning_rate": 1.1081382635326091e-05,
"loss": 0.07106815576553345,
"mean_token_accuracy": 0.9856281742453575,
"num_tokens": 17384890.0,
"step": 2780
},
{
"entropy": 2.0299994975328444,
"epoch": 2.4177681473456123,
"grad_norm": 3.276568651199341,
"learning_rate": 1.1025555131211387e-05,
"loss": 0.05880398154258728,
"mean_token_accuracy": 0.9834137126803398,
"num_tokens": 17453317.0,
"step": 2790
},
{
"entropy": 2.0245982825756075,
"epoch": 2.426435536294691,
"grad_norm": 1.0511301755905151,
"learning_rate": 1.0969695304800544e-05,
"loss": 0.08915462493896484,
"mean_token_accuracy": 0.9808729231357575,
"num_tokens": 17512361.0,
"step": 2800
},
{
"epoch": 2.426435536294691,
"eval_entropy": 1.9572540764784931,
"eval_loss": 0.09015624970197678,
"eval_mean_token_accuracy": 0.9780560441278107,
"eval_num_tokens": 17512361.0,
"eval_runtime": 327.3427,
"eval_samples_per_second": 4.912,
"eval_steps_per_second": 0.614,
"step": 2800
},
{
"entropy": 1.9997735738754272,
"epoch": 2.43510292524377,
"grad_norm": 0.9744513034820557,
"learning_rate": 1.0913804916620905e-05,
"loss": 0.02331102341413498,
"mean_token_accuracy": 0.9919474333524704,
"num_tokens": 17577516.0,
"step": 2810
},
{
"entropy": 2.014119616150856,
"epoch": 2.4437703141928493,
"grad_norm": 0.9193094372749329,
"learning_rate": 1.0857885728163027e-05,
"loss": 0.0236177533864975,
"mean_token_accuracy": 0.9911881402134896,
"num_tokens": 17638548.0,
"step": 2820
},
{
"entropy": 1.960026879608631,
"epoch": 2.4524377031419284,
"grad_norm": 0.23110997676849365,
"learning_rate": 1.0801939501825157e-05,
"loss": 0.04339863955974579,
"mean_token_accuracy": 0.98226348310709,
"num_tokens": 17705192.0,
"step": 2830
},
{
"entropy": 1.996291145682335,
"epoch": 2.4611050920910076,
"grad_norm": 5.163341045379639,
"learning_rate": 1.07459680008577e-05,
"loss": 0.04148267507553101,
"mean_token_accuracy": 0.9853608950972557,
"num_tokens": 17769801.0,
"step": 2840
},
{
"entropy": 2.0213477462530136,
"epoch": 2.4697724810400867,
"grad_norm": 2.1272523403167725,
"learning_rate": 1.068997298930763e-05,
"loss": 0.034024789929389954,
"mean_token_accuracy": 0.9842083305120468,
"num_tokens": 17831542.0,
"step": 2850
},
{
"entropy": 1.9997887834906578,
"epoch": 2.478439869989166,
"grad_norm": 1.8577139377593994,
"learning_rate": 1.0633956231962908e-05,
"loss": 0.030756032466888426,
"mean_token_accuracy": 0.9878269597887993,
"num_tokens": 17897817.0,
"step": 2860
},
{
"entropy": 1.9450352013111114,
"epoch": 2.487107258938245,
"grad_norm": 1.6481013298034668,
"learning_rate": 1.0577919494296848e-05,
"loss": 0.04975041747093201,
"mean_token_accuracy": 0.9855062261223793,
"num_tokens": 17961050.0,
"step": 2870
},
{
"entropy": 2.0519244849681852,
"epoch": 2.495774647887324,
"grad_norm": 1.7673394680023193,
"learning_rate": 1.052186454241249e-05,
"loss": 0.06363226175308227,
"mean_token_accuracy": 0.9759257227182389,
"num_tokens": 18017683.0,
"step": 2880
},
{
"entropy": 1.9854577094316483,
"epoch": 2.504442036836403,
"grad_norm": 0.9915326833724976,
"learning_rate": 1.0465793142986917e-05,
"loss": 0.03945471942424774,
"mean_token_accuracy": 0.9838297843933106,
"num_tokens": 18086623.0,
"step": 2890
},
{
"entropy": 1.9744661718606948,
"epoch": 2.513109425785482,
"grad_norm": 0.19898076355457306,
"learning_rate": 1.0409707063215602e-05,
"loss": 0.04994584023952484,
"mean_token_accuracy": 0.9840056359767914,
"num_tokens": 18161992.0,
"step": 2900
},
{
"epoch": 2.513109425785482,
"eval_entropy": 1.9463663801031919,
"eval_loss": 0.09015114605426788,
"eval_mean_token_accuracy": 0.9790049482933918,
"eval_num_tokens": 18161992.0,
"eval_runtime": 327.033,
"eval_samples_per_second": 4.917,
"eval_steps_per_second": 0.615,
"step": 2900
},
{
"entropy": 2.0072739005088804,
"epoch": 2.521776814734561,
"grad_norm": 0.6039919853210449,
"learning_rate": 1.035360807075668e-05,
"loss": 0.06279324889183044,
"mean_token_accuracy": 0.9817322447896004,
"num_tokens": 18218359.0,
"step": 2910
},
{
"entropy": 1.979375532269478,
"epoch": 2.5304442036836403,
"grad_norm": 2.242131233215332,
"learning_rate": 1.0297497933675271e-05,
"loss": 0.037703675031661985,
"mean_token_accuracy": 0.9891891330480576,
"num_tokens": 18276604.0,
"step": 2920
},
{
"entropy": 2.0151320695877075,
"epoch": 2.5391115926327195,
"grad_norm": 4.291823863983154,
"learning_rate": 1.0241378420387727e-05,
"loss": 0.0672419011592865,
"mean_token_accuracy": 0.9796803876757622,
"num_tokens": 18336643.0,
"step": 2930
},
{
"entropy": 1.9576003134250641,
"epoch": 2.5477789815817986,
"grad_norm": 1.9827468395233154,
"learning_rate": 1.0185251299605909e-05,
"loss": 0.03502065539360046,
"mean_token_accuracy": 0.9894511729478837,
"num_tokens": 18395903.0,
"step": 2940
},
{
"entropy": 2.021180757880211,
"epoch": 2.5564463705308773,
"grad_norm": 7.404480934143066,
"learning_rate": 1.012911834028145e-05,
"loss": 0.04811771810054779,
"mean_token_accuracy": 0.9804063439369202,
"num_tokens": 18459847.0,
"step": 2950
},
{
"entropy": 1.9120722502470016,
"epoch": 2.5651137594799565,
"grad_norm": 0.9321104884147644,
"learning_rate": 1.0072981311549988e-05,
"loss": 0.05938450694084167,
"mean_token_accuracy": 0.9737172573804855,
"num_tokens": 18525932.0,
"step": 2960
},
{
"entropy": 2.0345918387174606,
"epoch": 2.5737811484290356,
"grad_norm": 0.08143553882837296,
"learning_rate": 1.001684198267542e-05,
"loss": 0.05566604137420654,
"mean_token_accuracy": 0.9803778171539307,
"num_tokens": 18589606.0,
"step": 2970
},
{
"entropy": 2.053544855117798,
"epoch": 2.5824485373781148,
"grad_norm": 1.1658939123153687,
"learning_rate": 9.960702122994139e-06,
"loss": 0.0482805073261261,
"mean_token_accuracy": 0.9861093074083328,
"num_tokens": 18644042.0,
"step": 2980
},
{
"entropy": 2.0836474686861037,
"epoch": 2.591115926327194,
"grad_norm": 1.5134586095809937,
"learning_rate": 9.904563501859256e-06,
"loss": 0.055090302228927614,
"mean_token_accuracy": 0.9857477128505707,
"num_tokens": 18702039.0,
"step": 2990
},
{
"entropy": 2.0128067165613173,
"epoch": 2.599783315276273,
"grad_norm": 1.14212965965271,
"learning_rate": 9.848427888584863e-06,
"loss": 0.041364666819572446,
"mean_token_accuracy": 0.9833357527852058,
"num_tokens": 18764358.0,
"step": 3000
},
{
"epoch": 2.599783315276273,
"eval_entropy": 1.9795061646409295,
"eval_loss": 0.09064625948667526,
"eval_mean_token_accuracy": 0.9773970151422036,
"eval_num_tokens": 18764358.0,
"eval_runtime": 327.3559,
"eval_samples_per_second": 4.912,
"eval_steps_per_second": 0.614,
"step": 3000
},
{
"entropy": 2.159276154637337,
"epoch": 2.608450704225352,
"grad_norm": 2.7326016426086426,
"learning_rate": 9.792297052390238e-06,
"loss": 0.04406266808509827,
"mean_token_accuracy": 0.987121856212616,
"num_tokens": 18818455.0,
"step": 3010
},
{
"entropy": 1.968066468834877,
"epoch": 2.6171180931744313,
"grad_norm": 2.7995221614837646,
"learning_rate": 9.736172762344113e-06,
"loss": 0.09104043841362,
"mean_token_accuracy": 0.980485713481903,
"num_tokens": 18884842.0,
"step": 3020
},
{
"entropy": 1.99553040266037,
"epoch": 2.6257854821235105,
"grad_norm": 6.235974311828613,
"learning_rate": 9.680056787308898e-06,
"loss": 0.06288103461265564,
"mean_token_accuracy": 0.9678011432290077,
"num_tokens": 18959860.0,
"step": 3030
},
{
"entropy": 1.9894109219312668,
"epoch": 2.6344528710725896,
"grad_norm": 0.333478718996048,
"learning_rate": 9.623950895884944e-06,
"loss": 0.08161028027534485,
"mean_token_accuracy": 0.9892241954803467,
"num_tokens": 19027017.0,
"step": 3040
},
{
"entropy": 2.04710274040699,
"epoch": 2.6431202600216683,
"grad_norm": 0.5233101844787598,
"learning_rate": 9.567856856354792e-06,
"loss": 0.04426893293857574,
"mean_token_accuracy": 0.9886008054018021,
"num_tokens": 19086891.0,
"step": 3050
},
{
"entropy": 2.028855699300766,
"epoch": 2.6517876489707475,
"grad_norm": 1.3492603302001953,
"learning_rate": 9.511776436627456e-06,
"loss": 0.026917535066604614,
"mean_token_accuracy": 0.9916170611977577,
"num_tokens": 19145104.0,
"step": 3060
},
{
"entropy": 1.9948274880647658,
"epoch": 2.6604550379198266,
"grad_norm": 2.2153990268707275,
"learning_rate": 9.455711404182696e-06,
"loss": 0.08325918912887573,
"mean_token_accuracy": 0.9756117567420006,
"num_tokens": 19206436.0,
"step": 3070
},
{
"entropy": 2.049996706843376,
"epoch": 2.6691224268689058,
"grad_norm": 4.233671188354492,
"learning_rate": 9.399663526015305e-06,
"loss": 0.08945580720901489,
"mean_token_accuracy": 0.9773588702082634,
"num_tokens": 19261677.0,
"step": 3080
},
{
"entropy": 2.012954831123352,
"epoch": 2.677789815817985,
"grad_norm": 0.9330930709838867,
"learning_rate": 9.343634568579436e-06,
"loss": 0.06627085208892822,
"mean_token_accuracy": 0.9879173919558525,
"num_tokens": 19322808.0,
"step": 3090
},
{
"entropy": 2.0294546335935593,
"epoch": 2.686457204767064,
"grad_norm": 1.6425728797912598,
"learning_rate": 9.287626297732908e-06,
"loss": 0.047486874461174014,
"mean_token_accuracy": 0.9868068620562553,
"num_tokens": 19387957.0,
"step": 3100
},
{
"epoch": 2.686457204767064,
"eval_entropy": 1.9502243705056792,
"eval_loss": 0.08599194884300232,
"eval_mean_token_accuracy": 0.9787541123765024,
"eval_num_tokens": 19387957.0,
"eval_runtime": 327.3899,
"eval_samples_per_second": 4.912,
"eval_steps_per_second": 0.614,
"step": 3100
},
{
"entropy": 2.0488913506269455,
"epoch": 2.6951245937161428,
"grad_norm": 0.2572486698627472,
"learning_rate": 9.231640478681579e-06,
"loss": 0.038655102252960205,
"mean_token_accuracy": 0.9838706344366074,
"num_tokens": 19442029.0,
"step": 3110
},
{
"entropy": 1.996284967660904,
"epoch": 2.703791982665222,
"grad_norm": 0.7005351185798645,
"learning_rate": 9.175678875923682e-06,
"loss": 0.06046753525733948,
"mean_token_accuracy": 0.9802204161882401,
"num_tokens": 19500346.0,
"step": 3120
},
{
"entropy": 1.991689708828926,
"epoch": 2.712459371614301,
"grad_norm": 1.0894055366516113,
"learning_rate": 9.119743253194238e-06,
"loss": 0.06283498406410218,
"mean_token_accuracy": 0.9823062658309937,
"num_tokens": 19567406.0,
"step": 3130
},
{
"entropy": 2.0570632964372635,
"epoch": 2.72112676056338,
"grad_norm": 2.256519079208374,
"learning_rate": 9.063835373409454e-06,
"loss": 0.10143665075302125,
"mean_token_accuracy": 0.9756506696343422,
"num_tokens": 19626834.0,
"step": 3140
},
{
"entropy": 2.0224888235330583,
"epoch": 2.7297941495124594,
"grad_norm": 0.9661228060722351,
"learning_rate": 9.007956998611162e-06,
"loss": 0.023985360562801362,
"mean_token_accuracy": 0.9860787034034729,
"num_tokens": 19684060.0,
"step": 3150
},
{
"entropy": 2.0702203780412676,
"epoch": 2.7384615384615385,
"grad_norm": 1.2157535552978516,
"learning_rate": 8.9521098899113e-06,
"loss": 0.045061749219894406,
"mean_token_accuracy": 0.9835543319582939,
"num_tokens": 19744862.0,
"step": 3160
},
{
"entropy": 1.9608687520027162,
"epoch": 2.7471289274106176,
"grad_norm": 1.2761811017990112,
"learning_rate": 8.896295807436382e-06,
"loss": 0.02903972864151001,
"mean_token_accuracy": 0.9851373538374901,
"num_tokens": 19814847.0,
"step": 3170
},
{
"entropy": 1.9704955458641051,
"epoch": 2.755796316359697,
"grad_norm": 3.0626580715179443,
"learning_rate": 8.840516510272056e-06,
"loss": 0.03995053470134735,
"mean_token_accuracy": 0.9888360872864723,
"num_tokens": 19873814.0,
"step": 3180
},
{
"entropy": 2.0080684244632723,
"epoch": 2.764463705308776,
"grad_norm": 2.2461702823638916,
"learning_rate": 8.784773756407629e-06,
"loss": 0.03145716786384582,
"mean_token_accuracy": 0.9925667092204093,
"num_tokens": 19931686.0,
"step": 3190
},
{
"entropy": 1.9973454266786574,
"epoch": 2.773131094257855,
"grad_norm": 1.4155596494674683,
"learning_rate": 8.729069302680686e-06,
"loss": 0.03232878148555755,
"mean_token_accuracy": 0.9891820922493935,
"num_tokens": 19993913.0,
"step": 3200
},
{
"epoch": 2.773131094257855,
"eval_entropy": 1.9362546573230877,
"eval_loss": 0.08918900042772293,
"eval_mean_token_accuracy": 0.9781833460081869,
"eval_num_tokens": 19993913.0,
"eval_runtime": 327.2187,
"eval_samples_per_second": 4.914,
"eval_steps_per_second": 0.614,
"step": 3200
},
{
"entropy": 2.0571909993886948,
"epoch": 2.781798483206934,
"grad_norm": 1.3820114135742188,
"learning_rate": 8.67340490472171e-06,
"loss": 0.0422855019569397,
"mean_token_accuracy": 0.9904089197516441,
"num_tokens": 20051573.0,
"step": 3210
},
{
"entropy": 1.9552978485822679,
"epoch": 2.790465872156013,
"grad_norm": 2.360881805419922,
"learning_rate": 8.61778231689875e-06,
"loss": 0.06589213013648987,
"mean_token_accuracy": 0.9763843730092049,
"num_tokens": 20110195.0,
"step": 3220
},
{
"entropy": 1.997276645898819,
"epoch": 2.799133261105092,
"grad_norm": 0.7178909778594971,
"learning_rate": 8.56220329226213e-06,
"loss": 0.026553085446357726,
"mean_token_accuracy": 0.9915577113628388,
"num_tokens": 20171207.0,
"step": 3230
},
{
"entropy": 1.97244333922863,
"epoch": 2.8078006500541712,
"grad_norm": 0.8178501725196838,
"learning_rate": 8.506669582489199e-06,
"loss": 0.06264678239822388,
"mean_token_accuracy": 0.9804031074047088,
"num_tokens": 20240761.0,
"step": 3240
},
{
"entropy": 1.9891822725534438,
"epoch": 2.8164680390032504,
"grad_norm": 0.20255060493946075,
"learning_rate": 8.451182937829125e-06,
"loss": 0.035097137093544006,
"mean_token_accuracy": 0.9935684517025948,
"num_tokens": 20300987.0,
"step": 3250
},
{
"entropy": 2.0133452355861663,
"epoch": 2.8251354279523295,
"grad_norm": 4.924685955047607,
"learning_rate": 8.395745107047729e-06,
"loss": 0.07078658938407897,
"mean_token_accuracy": 0.9835556149482727,
"num_tokens": 20366208.0,
"step": 3260
},
{
"entropy": 1.996243155002594,
"epoch": 2.8338028169014082,
"grad_norm": 0.5406718850135803,
"learning_rate": 8.340357837372363e-06,
"loss": 0.08820904493331909,
"mean_token_accuracy": 0.9786410570144654,
"num_tokens": 20433132.0,
"step": 3270
},
{
"entropy": 2.0637154281139374,
"epoch": 2.8424702058504874,
"grad_norm": 3.8165504932403564,
"learning_rate": 8.28502287443687e-06,
"loss": 0.0430131733417511,
"mean_token_accuracy": 0.9918735235929489,
"num_tokens": 20496310.0,
"step": 3280
},
{
"entropy": 2.0202389895915984,
"epoch": 2.8511375947995665,
"grad_norm": 1.5813179016113281,
"learning_rate": 8.229741962226525e-06,
"loss": 0.05116449594497681,
"mean_token_accuracy": 0.9833520889282227,
"num_tokens": 20565223.0,
"step": 3290
},
{
"entropy": 2.062763836979866,
"epoch": 2.8598049837486457,
"grad_norm": 0.22883164882659912,
"learning_rate": 8.174516843023112e-06,
"loss": 0.03045716881752014,
"mean_token_accuracy": 0.9860931158065795,
"num_tokens": 20625610.0,
"step": 3300
},
{
"epoch": 2.8598049837486457,
"eval_entropy": 1.938993199547725,
"eval_loss": 0.08659692853689194,
"eval_mean_token_accuracy": 0.9792619125166936,
"eval_num_tokens": 20625610.0,
"eval_runtime": 326.8748,
"eval_samples_per_second": 4.919,
"eval_steps_per_second": 0.615,
"step": 3300
},
{
"entropy": 1.9526330173015594,
"epoch": 2.868472372697725,
"grad_norm": 0.17043910920619965,
"learning_rate": 8.119349257349981e-06,
"loss": 0.03852111101150513,
"mean_token_accuracy": 0.9923890814185142,
"num_tokens": 20689418.0,
"step": 3310
},
{
"entropy": 2.0270158767700197,
"epoch": 2.877139761646804,
"grad_norm": 0.4257623851299286,
"learning_rate": 8.064240943917214e-06,
"loss": 0.04855137765407562,
"mean_token_accuracy": 0.9914126366376876,
"num_tokens": 20751477.0,
"step": 3320
},
{
"entropy": 1.987108725309372,
"epoch": 2.885807150595883,
"grad_norm": 1.6425321102142334,
"learning_rate": 8.009193639566805e-06,
"loss": 0.06597901582717895,
"mean_token_accuracy": 0.973939710855484,
"num_tokens": 20817645.0,
"step": 3330
},
{
"entropy": 2.027906683087349,
"epoch": 2.8944745395449623,
"grad_norm": 1.789011001586914,
"learning_rate": 7.954209079217945e-06,
"loss": 0.04323897361755371,
"mean_token_accuracy": 0.9864452615380287,
"num_tokens": 20879146.0,
"step": 3340
},
{
"entropy": 1.9812477678060532,
"epoch": 2.9031419284940414,
"grad_norm": 3.5340230464935303,
"learning_rate": 7.899288995812322e-06,
"loss": 0.0406141608953476,
"mean_token_accuracy": 0.987187135219574,
"num_tokens": 20941057.0,
"step": 3350
},
{
"entropy": 2.024034297466278,
"epoch": 2.91180931744312,
"grad_norm": 0.21585479378700256,
"learning_rate": 7.84443512025952e-06,
"loss": 0.04108258783817291,
"mean_token_accuracy": 0.9911881193518639,
"num_tokens": 20999998.0,
"step": 3360
},
{
"entropy": 1.9965860784053802,
"epoch": 2.9204767063921993,
"grad_norm": 2.0004289150238037,
"learning_rate": 7.789649181382444e-06,
"loss": 0.040653344988822934,
"mean_token_accuracy": 0.9891650825738907,
"num_tokens": 21068454.0,
"step": 3370
},
{
"entropy": 1.9830640345811843,
"epoch": 2.9291440953412784,
"grad_norm": 3.6005094051361084,
"learning_rate": 7.734932905862862e-06,
"loss": 0.07591732740402221,
"mean_token_accuracy": 0.984532107412815,
"num_tokens": 21143837.0,
"step": 3380
},
{
"entropy": 2.04206445813179,
"epoch": 2.9378114842903575,
"grad_norm": 1.8786780834197998,
"learning_rate": 7.68028801818696e-06,
"loss": 0.03788648545742035,
"mean_token_accuracy": 0.9878558471798897,
"num_tokens": 21202925.0,
"step": 3390
},
{
"entropy": 1.9883090794086455,
"epoch": 2.9464788732394367,
"grad_norm": 2.9170005321502686,
"learning_rate": 7.6257162405910115e-06,
"loss": 0.04177981615066528,
"mean_token_accuracy": 0.9603466898202896,
"num_tokens": 21262453.0,
"step": 3400
},
{
"epoch": 2.9464788732394367,
"eval_entropy": 1.9480238630997009,
"eval_loss": 0.08786118775606155,
"eval_mean_token_accuracy": 0.9783913027587815,
"eval_num_tokens": 21262453.0,
"eval_runtime": 327.0291,
"eval_samples_per_second": 4.917,
"eval_steps_per_second": 0.615,
"step": 3400
},
{
"entropy": 2.00368013381958,
"epoch": 2.955146262188516,
"grad_norm": 1.690090298652649,
"learning_rate": 7.571219293007075e-06,
"loss": 0.07676026225090027,
"mean_token_accuracy": 0.9722154304385185,
"num_tokens": 21325040.0,
"step": 3410
},
{
"entropy": 2.0232281416654585,
"epoch": 2.9638136511375945,
"grad_norm": 0.692124605178833,
"learning_rate": 7.516798893008817e-06,
"loss": 0.025483831763267517,
"mean_token_accuracy": 0.993908728659153,
"num_tokens": 21385939.0,
"step": 3420
},
{
"entropy": 1.9855226576328278,
"epoch": 2.9724810400866737,
"grad_norm": 5.5677385330200195,
"learning_rate": 7.4624567557573525e-06,
"loss": 0.03866112232208252,
"mean_token_accuracy": 0.9897015273571015,
"num_tokens": 21449342.0,
"step": 3430
},
{
"entropy": 1.9878569096326828,
"epoch": 2.981148429035753,
"grad_norm": 1.0295473337173462,
"learning_rate": 7.4081945939472e-06,
"loss": 0.02325758934020996,
"mean_token_accuracy": 0.9918417349457741,
"num_tokens": 21517498.0,
"step": 3440
},
{
"entropy": 2.040255609154701,
"epoch": 2.989815817984832,
"grad_norm": 0.6241699457168579,
"learning_rate": 7.354014117752305e-06,
"loss": 0.05443716049194336,
"mean_token_accuracy": 0.9862660676240921,
"num_tokens": 21575243.0,
"step": 3450
},
{
"entropy": 1.9827607095241546,
"epoch": 2.998483206933911,
"grad_norm": 3.2460570335388184,
"learning_rate": 7.299917034772134e-06,
"loss": 0.03632343113422394,
"mean_token_accuracy": 0.9861762166023255,
"num_tokens": 21642048.0,
"step": 3460
},
{
"entropy": 1.9609574262912457,
"epoch": 3.0069339111592632,
"grad_norm": 0.3964233100414276,
"learning_rate": 7.245905049977863e-06,
"loss": 0.023949359357357026,
"mean_token_accuracy": 0.9889839383272024,
"num_tokens": 21703419.0,
"step": 3470
},
{
"entropy": 2.0167145997285845,
"epoch": 3.0156013001083424,
"grad_norm": 0.2081003487110138,
"learning_rate": 7.191979865658633e-06,
"loss": 0.029495981335639954,
"mean_token_accuracy": 0.9923539698123932,
"num_tokens": 21767451.0,
"step": 3480
},
{
"entropy": 1.9336788192391396,
"epoch": 3.0242686890574215,
"grad_norm": 1.2492883205413818,
"learning_rate": 7.138143181367918e-06,
"loss": 0.018693357706069946,
"mean_token_accuracy": 0.9953667461872101,
"num_tokens": 21842309.0,
"step": 3490
},
{
"entropy": 2.0128078699111938,
"epoch": 3.0329360780065007,
"grad_norm": 0.08379145711660385,
"learning_rate": 7.084396693869928e-06,
"loss": 0.022161170840263367,
"mean_token_accuracy": 0.9914363294839859,
"num_tokens": 21904561.0,
"step": 3500
},
{
"epoch": 3.0329360780065007,
"eval_entropy": 1.9438044924048048,
"eval_loss": 0.08556525409221649,
"eval_mean_token_accuracy": 0.9790331549312344,
"eval_num_tokens": 21904561.0,
"eval_runtime": 327.0968,
"eval_samples_per_second": 4.916,
"eval_steps_per_second": 0.614,
"step": 3500
},
{
"entropy": 1.927895051240921,
"epoch": 3.04160346695558,
"grad_norm": 1.0014227628707886,
"learning_rate": 7.0307420970861695e-06,
"loss": 0.022809083759784698,
"mean_token_accuracy": 0.9900833815336227,
"num_tokens": 21972321.0,
"step": 3510
},
{
"entropy": 2.0294132977724075,
"epoch": 3.0502708559046585,
"grad_norm": 0.8297566771507263,
"learning_rate": 6.977181082042033e-06,
"loss": 0.024722158908843994,
"mean_token_accuracy": 0.9913588181138039,
"num_tokens": 22037170.0,
"step": 3520
},
{
"entropy": 2.1015698224306107,
"epoch": 3.0589382448537377,
"grad_norm": 1.5314658880233765,
"learning_rate": 6.923715336813499e-06,
"loss": 0.03659733235836029,
"mean_token_accuracy": 0.9872351065278053,
"num_tokens": 22083744.0,
"step": 3530
},
{
"entropy": 2.0339041739702224,
"epoch": 3.067605633802817,
"grad_norm": 0.24609343707561493,
"learning_rate": 6.870346546473954e-06,
"loss": 0.03324902355670929,
"mean_token_accuracy": 0.9886126175522805,
"num_tokens": 22141305.0,
"step": 3540
},
{
"entropy": 2.025708928704262,
"epoch": 3.076273022751896,
"grad_norm": 3.1685736179351807,
"learning_rate": 6.817076393041055e-06,
"loss": 0.039118051528930664,
"mean_token_accuracy": 0.9934563606977462,
"num_tokens": 22201940.0,
"step": 3550
},
{
"entropy": 1.9974781066179275,
"epoch": 3.084940411700975,
"grad_norm": 1.9486182928085327,
"learning_rate": 6.763906555423745e-06,
"loss": 0.026187896728515625,
"mean_token_accuracy": 0.9913025006651879,
"num_tokens": 22261753.0,
"step": 3560
},
{
"entropy": 2.0584082931280134,
"epoch": 3.0936078006500543,
"grad_norm": 0.07571403682231903,
"learning_rate": 6.710838709369315e-06,
"loss": 0.04056554138660431,
"mean_token_accuracy": 0.9884672403335572,
"num_tokens": 22319850.0,
"step": 3570
},
{
"entropy": 2.0791433185338972,
"epoch": 3.1022751895991334,
"grad_norm": 2.689072847366333,
"learning_rate": 6.6578745274106075e-06,
"loss": 0.03821301460266113,
"mean_token_accuracy": 0.9874335438013077,
"num_tokens": 22377009.0,
"step": 3580
},
{
"entropy": 2.050138959288597,
"epoch": 3.1109425785482125,
"grad_norm": 0.6456999182701111,
"learning_rate": 6.6050156788132895e-06,
"loss": 0.014178495109081268,
"mean_token_accuracy": 0.9958937197923661,
"num_tokens": 22441093.0,
"step": 3590
},
{
"entropy": 2.0015585333108903,
"epoch": 3.1196099674972912,
"grad_norm": 0.9528690576553345,
"learning_rate": 6.552263829523258e-06,
"loss": 0.040335527062416075,
"mean_token_accuracy": 0.9911141216754913,
"num_tokens": 22505491.0,
"step": 3600
},
{
"epoch": 3.1196099674972912,
"eval_entropy": 1.941706338925148,
"eval_loss": 0.08653046935796738,
"eval_mean_token_accuracy": 0.9788935940657089,
"eval_num_tokens": 22505491.0,
"eval_runtime": 327.1481,
"eval_samples_per_second": 4.915,
"eval_steps_per_second": 0.614,
"step": 3600
},
{
"entropy": 2.0061341017484664,
"epoch": 3.1282773564463704,
"grad_norm": 0.17698237299919128,
"learning_rate": 6.499620642114117e-06,
"loss": 0.022867996990680695,
"mean_token_accuracy": 0.9916748866438866,
"num_tokens": 22571460.0,
"step": 3610
},
{
"entropy": 1.9561231464147568,
"epoch": 3.1369447453954495,
"grad_norm": 2.200025796890259,
"learning_rate": 6.4470877757347925e-06,
"loss": 0.025290462374687194,
"mean_token_accuracy": 0.9868748232722282,
"num_tokens": 22633373.0,
"step": 3620
},
{
"entropy": 1.9883778482675551,
"epoch": 3.1456121343445287,
"grad_norm": 1.4036747217178345,
"learning_rate": 6.394666886057234e-06,
"loss": 0.03302829265594483,
"mean_token_accuracy": 0.9855715438723565,
"num_tokens": 22699790.0,
"step": 3630
},
{
"entropy": 2.028902477025986,
"epoch": 3.154279523293608,
"grad_norm": 2.978290557861328,
"learning_rate": 6.34235962522424e-06,
"loss": 0.04505385160446167,
"mean_token_accuracy": 0.9882813230156898,
"num_tokens": 22760617.0,
"step": 3640
},
{
"entropy": 1.9538985759019851,
"epoch": 3.162946912242687,
"grad_norm": 2.2208809852600098,
"learning_rate": 6.290167641797373e-06,
"loss": 0.027484691143035887,
"mean_token_accuracy": 0.9884011939167976,
"num_tokens": 22828652.0,
"step": 3650
},
{
"entropy": 1.9391920119524002,
"epoch": 3.171614301191766,
"grad_norm": 2.3642702102661133,
"learning_rate": 6.23809258070502e-06,
"loss": 0.08644394278526306,
"mean_token_accuracy": 0.9805887296795845,
"num_tokens": 22897137.0,
"step": 3660
},
{
"entropy": 2.052844101190567,
"epoch": 3.1802816901408453,
"grad_norm": 0.271776020526886,
"learning_rate": 6.186136083190534e-06,
"loss": 0.026084551215171815,
"mean_token_accuracy": 0.9889581605792046,
"num_tokens": 22961566.0,
"step": 3670
},
{
"entropy": 1.9666710525751114,
"epoch": 3.188949079089924,
"grad_norm": 2.292097806930542,
"learning_rate": 6.134299786760523e-06,
"loss": 0.029993349313735963,
"mean_token_accuracy": 0.9866111233830452,
"num_tokens": 23032145.0,
"step": 3680
},
{
"entropy": 1.9898767739534378,
"epoch": 3.197616468039003,
"grad_norm": 0.5140994191169739,
"learning_rate": 6.082585325133222e-06,
"loss": 0.01786961853504181,
"mean_token_accuracy": 0.9936378210783005,
"num_tokens": 23096505.0,
"step": 3690
},
{
"entropy": 2.0351445108652113,
"epoch": 3.2062838569880823,
"grad_norm": 2.1874489784240723,
"learning_rate": 6.030994328187023e-06,
"loss": 0.015171639621257782,
"mean_token_accuracy": 0.9934789076447487,
"num_tokens": 23159233.0,
"step": 3700
},
{
"epoch": 3.2062838569880823,
"eval_entropy": 1.9617518720342153,
"eval_loss": 0.08715828508138657,
"eval_mean_token_accuracy": 0.9805069438260586,
"eval_num_tokens": 23159233.0,
"eval_runtime": 326.8014,
"eval_samples_per_second": 4.92,
"eval_steps_per_second": 0.615,
"step": 3700
},
{
"entropy": 2.0274400532245638,
"epoch": 3.2149512459371614,
"grad_norm": 0.12795260548591614,
"learning_rate": 5.979528421909089e-06,
"loss": 0.03491283059120178,
"mean_token_accuracy": 0.9888436004519463,
"num_tokens": 23219168.0,
"step": 3710
},
{
"entropy": 2.0637706756591796,
"epoch": 3.2236186348862406,
"grad_norm": 2.057122230529785,
"learning_rate": 5.928189228344121e-06,
"loss": 0.02740119695663452,
"mean_token_accuracy": 0.992508827149868,
"num_tokens": 23280186.0,
"step": 3720
},
{
"entropy": 2.0003860145807266,
"epoch": 3.2322860238353197,
"grad_norm": 2.19740891456604,
"learning_rate": 5.876978365543227e-06,
"loss": 0.03788390457630157,
"mean_token_accuracy": 0.9878378629684448,
"num_tokens": 23344128.0,
"step": 3730
},
{
"entropy": 2.001324808597565,
"epoch": 3.240953412784399,
"grad_norm": 1.5126818418502808,
"learning_rate": 5.825897447512929e-06,
"loss": 0.026940053701400755,
"mean_token_accuracy": 0.9857806503772736,
"num_tokens": 23403909.0,
"step": 3740
},
{
"entropy": 1.9464641511440277,
"epoch": 3.249620801733478,
"grad_norm": 3.0997378826141357,
"learning_rate": 5.7749480841643065e-06,
"loss": 0.043919849395751956,
"mean_token_accuracy": 0.9916449174284935,
"num_tokens": 23476336.0,
"step": 3750
},
{
"entropy": 1.9618077039718629,
"epoch": 3.2582881906825567,
"grad_norm": 0.05529231205582619,
"learning_rate": 5.7241318812622294e-06,
"loss": 0.03365751802921295,
"mean_token_accuracy": 0.9872692510485649,
"num_tokens": 23547474.0,
"step": 3760
},
{
"entropy": 2.021110999584198,
"epoch": 3.266955579631636,
"grad_norm": 0.5656824111938477,
"learning_rate": 5.673450440374771e-06,
"loss": 0.027200946211814882,
"mean_token_accuracy": 0.9951310992240906,
"num_tokens": 23607028.0,
"step": 3770
},
{
"entropy": 2.020348605513573,
"epoch": 3.275622968580715,
"grad_norm": 0.7680350542068481,
"learning_rate": 5.622905358822745e-06,
"loss": 0.02666248381137848,
"mean_token_accuracy": 0.9923866346478463,
"num_tokens": 23669610.0,
"step": 3780
},
{
"entropy": 2.0156673580408095,
"epoch": 3.284290357529794,
"grad_norm": 1.909304141998291,
"learning_rate": 5.5724982296293165e-06,
"loss": 0.04042408764362335,
"mean_token_accuracy": 0.9617922022938729,
"num_tokens": 23729250.0,
"step": 3790
},
{
"entropy": 2.045342218875885,
"epoch": 3.2929577464788733,
"grad_norm": 4.081718921661377,
"learning_rate": 5.522230641469839e-06,
"loss": 0.06637139916419983,
"mean_token_accuracy": 0.9821502983570098,
"num_tokens": 23787630.0,
"step": 3800
},
{
"epoch": 3.2929577464788733,
"eval_entropy": 1.9523134711963028,
"eval_loss": 0.0881609246134758,
"eval_mean_token_accuracy": 0.9801165203549969,
"eval_num_tokens": 23787630.0,
"eval_runtime": 326.5268,
"eval_samples_per_second": 4.925,
"eval_steps_per_second": 0.616,
"step": 3800
},
{
"entropy": 1.9851083979010582,
"epoch": 3.3016251354279524,
"grad_norm": 1.2768914699554443,
"learning_rate": 5.4721041786217664e-06,
"loss": 0.01877579987049103,
"mean_token_accuracy": 0.9903293594717979,
"num_tokens": 23849358.0,
"step": 3810
},
{
"entropy": 1.992839914560318,
"epoch": 3.3102925243770316,
"grad_norm": 0.9319987297058105,
"learning_rate": 5.4221204209147245e-06,
"loss": 0.02209160178899765,
"mean_token_accuracy": 0.9930718123912812,
"num_tokens": 23917856.0,
"step": 3820
},
{
"entropy": 2.0340360194444655,
"epoch": 3.3189599133261103,
"grad_norm": 0.6358506083488464,
"learning_rate": 5.37228094368071e-06,
"loss": 0.027576690912246703,
"mean_token_accuracy": 0.9949217200279236,
"num_tokens": 23980446.0,
"step": 3830
},
{
"entropy": 2.010609117150307,
"epoch": 3.3276273022751894,
"grad_norm": 0.470706045627594,
"learning_rate": 5.322587317704457e-06,
"loss": 0.04823949933052063,
"mean_token_accuracy": 0.9822644203901291,
"num_tokens": 24039428.0,
"step": 3840
},
{
"entropy": 2.0939511328935625,
"epoch": 3.3362946912242686,
"grad_norm": 0.6235988736152649,
"learning_rate": 5.273041109173924e-06,
"loss": 0.02635287344455719,
"mean_token_accuracy": 0.9920800253748894,
"num_tokens": 24090921.0,
"step": 3850
},
{
"entropy": 2.059076651930809,
"epoch": 3.3449620801733477,
"grad_norm": 0.25911229848861694,
"learning_rate": 5.223643879630934e-06,
"loss": 0.046140000224113464,
"mean_token_accuracy": 0.9801433801651,
"num_tokens": 24151706.0,
"step": 3860
},
{
"entropy": 2.00682270526886,
"epoch": 3.353629469122427,
"grad_norm": 1.7312122583389282,
"learning_rate": 5.174397185921945e-06,
"loss": 0.02391643971204758,
"mean_token_accuracy": 0.9928232997655868,
"num_tokens": 24211495.0,
"step": 3870
},
{
"entropy": 2.070136883854866,
"epoch": 3.362296858071506,
"grad_norm": 0.5971741676330566,
"learning_rate": 5.1253025801490044e-06,
"loss": 0.03489409387111664,
"mean_token_accuracy": 0.9879992380738258,
"num_tokens": 24271202.0,
"step": 3880
},
{
"entropy": 2.0464351683855058,
"epoch": 3.370964247020585,
"grad_norm": 0.03958556801080704,
"learning_rate": 5.076361609620829e-06,
"loss": 0.027960905432701112,
"mean_token_accuracy": 0.9936666667461396,
"num_tokens": 24329539.0,
"step": 3890
},
{
"entropy": 1.9829755246639251,
"epoch": 3.3796316359696643,
"grad_norm": 4.082634925842285,
"learning_rate": 5.027575816804016e-06,
"loss": 0.030048039555549622,
"mean_token_accuracy": 0.981467804312706,
"num_tokens": 24395139.0,
"step": 3900
},
{
"epoch": 3.3796316359696643,
"eval_entropy": 1.9591931365615693,
"eval_loss": 0.08941441029310226,
"eval_mean_token_accuracy": 0.9792530948842936,
"eval_num_tokens": 24395139.0,
"eval_runtime": 327.1897,
"eval_samples_per_second": 4.915,
"eval_steps_per_second": 0.614,
"step": 3900
},
{
"entropy": 2.0075402826070787,
"epoch": 3.3882990249187435,
"grad_norm": 0.6755623817443848,
"learning_rate": 4.978946739274459e-06,
"loss": 0.03598732650279999,
"mean_token_accuracy": 0.9913191378116608,
"num_tokens": 24454872.0,
"step": 3910
},
{
"entropy": 1.9580432906746865,
"epoch": 3.396966413867822,
"grad_norm": 1.2158863544464111,
"learning_rate": 4.930475909668872e-06,
"loss": 0.026130232214927673,
"mean_token_accuracy": 0.9921944439411163,
"num_tokens": 24521370.0,
"step": 3920
},
{
"entropy": 2.0222324401140215,
"epoch": 3.4056338028169013,
"grad_norm": 0.8751219511032104,
"learning_rate": 4.882164855636487e-06,
"loss": 0.02552185356616974,
"mean_token_accuracy": 0.9933805853128433,
"num_tokens": 24576883.0,
"step": 3930
},
{
"entropy": 2.0704391270875933,
"epoch": 3.4143011917659805,
"grad_norm": 2.4434635639190674,
"learning_rate": 4.834015099790906e-06,
"loss": 0.028062695264816286,
"mean_token_accuracy": 0.9894948095083237,
"num_tokens": 24633751.0,
"step": 3940
},
{
"entropy": 1.970983825623989,
"epoch": 3.4229685807150596,
"grad_norm": 0.634064793586731,
"learning_rate": 4.786028159662117e-06,
"loss": 0.04279245436191559,
"mean_token_accuracy": 0.9896366760134697,
"num_tokens": 24701133.0,
"step": 3950
},
{
"entropy": 2.004913279414177,
"epoch": 3.4316359696641388,
"grad_norm": 0.3501166105270386,
"learning_rate": 4.738205547648672e-06,
"loss": 0.042440015077590945,
"mean_token_accuracy": 0.9844118610024453,
"num_tokens": 24762905.0,
"step": 3960
},
{
"entropy": 2.072259470820427,
"epoch": 3.440303358613218,
"grad_norm": 3.5003762245178223,
"learning_rate": 4.6905487709700085e-06,
"loss": 0.047236514091491696,
"mean_token_accuracy": 0.9868312641978264,
"num_tokens": 24818283.0,
"step": 3970
},
{
"entropy": 2.02927243411541,
"epoch": 3.448970747562297,
"grad_norm": 1.2803966999053955,
"learning_rate": 4.643059331618944e-06,
"loss": 0.0166587769985199,
"mean_token_accuracy": 0.9939999803900719,
"num_tokens": 24878209.0,
"step": 3980
},
{
"entropy": 2.0472301214933397,
"epoch": 3.4576381365113757,
"grad_norm": 4.2303385734558105,
"learning_rate": 4.59573872631436e-06,
"loss": 0.01939603090286255,
"mean_token_accuracy": 0.9944044515490532,
"num_tokens": 24938597.0,
"step": 3990
},
{
"entropy": 1.9953694552183152,
"epoch": 3.466305525460455,
"grad_norm": 0.3093803822994232,
"learning_rate": 4.548588446454008e-06,
"loss": 0.037383252382278444,
"mean_token_accuracy": 0.9848104313015937,
"num_tokens": 25006002.0,
"step": 4000
},
{
"epoch": 3.466305525460455,
"eval_entropy": 1.9465392015466643,
"eval_loss": 0.08806028217077255,
"eval_mean_token_accuracy": 0.9801172311626264,
"eval_num_tokens": 25006002.0,
"eval_runtime": 326.7668,
"eval_samples_per_second": 4.921,
"eval_steps_per_second": 0.615,
"step": 4000
},
{
"entropy": 2.0333161488175393,
"epoch": 3.474972914409534,
"grad_norm": 2.100350856781006,
"learning_rate": 4.501609978067516e-06,
"loss": 0.026050877571105958,
"mean_token_accuracy": 0.9908463016152382,
"num_tokens": 25066917.0,
"step": 4010
},
{
"entropy": 2.017795702815056,
"epoch": 3.483640303358613,
"grad_norm": 1.7681386470794678,
"learning_rate": 4.454804801769546e-06,
"loss": 0.020292817056179045,
"mean_token_accuracy": 0.9933481246232987,
"num_tokens": 25137437.0,
"step": 4020
},
{
"entropy": 1.9617122411727905,
"epoch": 3.4923076923076923,
"grad_norm": 1.2674654722213745,
"learning_rate": 4.408174392713138e-06,
"loss": 0.02206308990716934,
"mean_token_accuracy": 0.9935388684272766,
"num_tokens": 25210243.0,
"step": 4030
},
{
"entropy": 2.023272916674614,
"epoch": 3.5009750812567715,
"grad_norm": 2.1518187522888184,
"learning_rate": 4.361720220543215e-06,
"loss": 0.021042007207870483,
"mean_token_accuracy": 0.9917860701680183,
"num_tokens": 25269681.0,
"step": 4040
},
{
"entropy": 1.9716553181409835,
"epoch": 3.5096424702058506,
"grad_norm": 1.2463315725326538,
"learning_rate": 4.315443749350268e-06,
"loss": 0.03910002112388611,
"mean_token_accuracy": 0.9899544030427933,
"num_tokens": 25334274.0,
"step": 4050
},
{
"entropy": 2.015067180991173,
"epoch": 3.5183098591549298,
"grad_norm": 0.2211289405822754,
"learning_rate": 4.269346437624192e-06,
"loss": 0.03428694009780884,
"mean_token_accuracy": 0.9854496344923973,
"num_tokens": 25397672.0,
"step": 4060
},
{
"entropy": 2.032247778773308,
"epoch": 3.526977248104009,
"grad_norm": 1.6791901588439941,
"learning_rate": 4.223429738208351e-06,
"loss": 0.01901150345802307,
"mean_token_accuracy": 0.9931851238012314,
"num_tokens": 25460938.0,
"step": 4070
},
{
"entropy": 1.9478510588407516,
"epoch": 3.5356446370530876,
"grad_norm": 0.3655602037906647,
"learning_rate": 4.177695098253766e-06,
"loss": 0.016408833861351012,
"mean_token_accuracy": 0.9949289828538894,
"num_tokens": 25531511.0,
"step": 4080
},
{
"entropy": 2.017333817481995,
"epoch": 3.5443120260021668,
"grad_norm": 2.554927349090576,
"learning_rate": 4.132143959173517e-06,
"loss": 0.033222931623458865,
"mean_token_accuracy": 0.9914083287119866,
"num_tokens": 25596302.0,
"step": 4090
},
{
"entropy": 1.9841288179159164,
"epoch": 3.552979414951246,
"grad_norm": 8.13968563079834,
"learning_rate": 4.086777756597299e-06,
"loss": 0.039189353585243225,
"mean_token_accuracy": 0.9884973883628845,
"num_tokens": 25659371.0,
"step": 4100
},
{
"epoch": 3.552979414951246,
"eval_entropy": 1.9524362116903808,
"eval_loss": 0.08749101310968399,
"eval_mean_token_accuracy": 0.9797243757627496,
"eval_num_tokens": 25659371.0,
"eval_runtime": 326.6545,
"eval_samples_per_second": 4.923,
"eval_steps_per_second": 0.615,
"step": 4100
},
{
"entropy": 2.0628657907247545,
"epoch": 3.561646803900325,
"grad_norm": 0.14109309017658234,
"learning_rate": 4.0415979203261946e-06,
"loss": 0.0225689560174942,
"mean_token_accuracy": 0.9902002736926079,
"num_tokens": 25718185.0,
"step": 4110
},
{
"entropy": 2.007545919716358,
"epoch": 3.570314192849404,
"grad_norm": 0.3464651107788086,
"learning_rate": 3.9966058742876e-06,
"loss": 0.02009371221065521,
"mean_token_accuracy": 0.9955977171659469,
"num_tokens": 25780142.0,
"step": 4120
},
{
"entropy": 2.0243140310049057,
"epoch": 3.5789815817984834,
"grad_norm": 2.1290290355682373,
"learning_rate": 3.95180303649035e-06,
"loss": 0.02304726988077164,
"mean_token_accuracy": 0.9939990416169167,
"num_tokens": 25839881.0,
"step": 4130
},
{
"entropy": 2.0234414398670197,
"epoch": 3.587648970747562,
"grad_norm": 0.014731453731656075,
"learning_rate": 3.907190818980026e-06,
"loss": 0.050000560283660886,
"mean_token_accuracy": 0.9866971537470818,
"num_tokens": 25902869.0,
"step": 4140
},
{
"entropy": 2.0233711034059523,
"epoch": 3.596316359696641,
"grad_norm": 3.3977596759796143,
"learning_rate": 3.862770627794453e-06,
"loss": 0.0322685718536377,
"mean_token_accuracy": 0.9900472685694695,
"num_tokens": 25965513.0,
"step": 4150
},
{
"entropy": 2.0063869461417196,
"epoch": 3.6049837486457204,
"grad_norm": 2.6405301094055176,
"learning_rate": 3.818543862919387e-06,
"loss": 0.014192065596580506,
"mean_token_accuracy": 0.9960492521524429,
"num_tokens": 26023436.0,
"step": 4160
},
{
"entropy": 2.035813573002815,
"epoch": 3.6136511375947995,
"grad_norm": 0.14692693948745728,
"learning_rate": 3.7745119182443845e-06,
"loss": 0.013922086358070374,
"mean_token_accuracy": 0.9962173581123352,
"num_tokens": 26085809.0,
"step": 4170
},
{
"entropy": 1.9604667097330093,
"epoch": 3.6223185265438786,
"grad_norm": 2.886298418045044,
"learning_rate": 3.730676181518883e-06,
"loss": 0.02352510243654251,
"mean_token_accuracy": 0.9951101526618004,
"num_tokens": 26154928.0,
"step": 4180
},
{
"entropy": 2.037091489136219,
"epoch": 3.630985915492958,
"grad_norm": 0.3143669366836548,
"learning_rate": 3.687038034308459e-06,
"loss": 0.025397229194641113,
"mean_token_accuracy": 0.9937299221754075,
"num_tokens": 26209579.0,
"step": 4190
},
{
"entropy": 1.8821268051862716,
"epoch": 3.639653304442037,
"grad_norm": 2.5476582050323486,
"learning_rate": 3.6435988519512844e-06,
"loss": 0.018459653854370116,
"mean_token_accuracy": 0.9935011580586434,
"num_tokens": 26284212.0,
"step": 4200
},
{
"epoch": 3.639653304442037,
"eval_entropy": 1.9587232580232383,
"eval_loss": 0.08999490737915039,
"eval_mean_token_accuracy": 0.9799567007306796,
"eval_num_tokens": 26284212.0,
"eval_runtime": 326.9787,
"eval_samples_per_second": 4.918,
"eval_steps_per_second": 0.615,
"step": 4200
},
{
"entropy": 2.0751129180192946,
"epoch": 3.648320693391116,
"grad_norm": 0.25621309876441956,
"learning_rate": 3.600360003514772e-06,
"loss": 0.05827196836471558,
"mean_token_accuracy": 0.978828464448452,
"num_tokens": 26344861.0,
"step": 4210
},
{
"entropy": 2.016257882118225,
"epoch": 3.6569880823401952,
"grad_norm": 0.23999305069446564,
"learning_rate": 3.5573228517524437e-06,
"loss": 0.01675285995006561,
"mean_token_accuracy": 0.9950248003005981,
"num_tokens": 26412096.0,
"step": 4220
},
{
"entropy": 2.011643001437187,
"epoch": 3.6656554712892744,
"grad_norm": 1.2057989835739136,
"learning_rate": 3.5144887530609683e-06,
"loss": 0.022135333716869356,
"mean_token_accuracy": 0.9908907547593117,
"num_tokens": 26473508.0,
"step": 4230
},
{
"entropy": 2.0545772433280947,
"epoch": 3.674322860238353,
"grad_norm": 1.1900558471679688,
"learning_rate": 3.471859057437421e-06,
"loss": 0.0230675607919693,
"mean_token_accuracy": 0.9927938759326935,
"num_tokens": 26536200.0,
"step": 4240
},
{
"entropy": 2.0200571775436402,
"epoch": 3.6829902491874322,
"grad_norm": 0.5839977860450745,
"learning_rate": 3.4294351084367184e-06,
"loss": 0.03541991114616394,
"mean_token_accuracy": 0.9827380672097206,
"num_tokens": 26593855.0,
"step": 4250
},
{
"entropy": 2.008121719956398,
"epoch": 3.6916576381365114,
"grad_norm": 4.034195423126221,
"learning_rate": 3.3872182431292968e-06,
"loss": 0.04164910316467285,
"mean_token_accuracy": 0.98883635699749,
"num_tokens": 26657227.0,
"step": 4260
},
{
"entropy": 2.045969045162201,
"epoch": 3.7003250270855905,
"grad_norm": 2.9138400554656982,
"learning_rate": 3.3452097920589587e-06,
"loss": 0.01186869889497757,
"mean_token_accuracy": 0.995833332836628,
"num_tokens": 26714896.0,
"step": 4270
},
{
"entropy": 2.0022309213876723,
"epoch": 3.7089924160346697,
"grad_norm": 2.3397390842437744,
"learning_rate": 3.3034110792009353e-06,
"loss": 0.033094662427902224,
"mean_token_accuracy": 0.9868162363767624,
"num_tokens": 26782122.0,
"step": 4280
},
{
"entropy": 1.970974361896515,
"epoch": 3.7176598049837484,
"grad_norm": 0.0644071027636528,
"learning_rate": 3.2618234219201704e-06,
"loss": 0.02641391158103943,
"mean_token_accuracy": 0.9948458999395371,
"num_tokens": 26853663.0,
"step": 4290
},
{
"entropy": 2.073245695233345,
"epoch": 3.7263271939328275,
"grad_norm": 0.4545290470123291,
"learning_rate": 3.220448130929793e-06,
"loss": 0.03868321180343628,
"mean_token_accuracy": 0.9880670920014382,
"num_tokens": 26907980.0,
"step": 4300
},
{
"epoch": 3.7263271939328275,
"eval_entropy": 1.9598178709324319,
"eval_loss": 0.08660746365785599,
"eval_mean_token_accuracy": 0.9800613602595543,
"eval_num_tokens": 26907980.0,
"eval_runtime": 326.8085,
"eval_samples_per_second": 4.92,
"eval_steps_per_second": 0.615,
"step": 4300
},
{
"entropy": 2.106029862165451,
"epoch": 3.7349945828819067,
"grad_norm": 5.831691741943359,
"learning_rate": 3.1792865102498105e-06,
"loss": 0.043834912776947024,
"mean_token_accuracy": 0.9932289361953736,
"num_tokens": 26971535.0,
"step": 4310
},
{
"entropy": 2.001392534375191,
"epoch": 3.743661971830986,
"grad_norm": 1.1307673454284668,
"learning_rate": 3.1383398571660017e-06,
"loss": 0.015590465068817139,
"mean_token_accuracy": 0.9919345244765282,
"num_tokens": 27040212.0,
"step": 4320
},
{
"entropy": 2.0088124960660934,
"epoch": 3.752329360780065,
"grad_norm": 1.474653959274292,
"learning_rate": 3.0976094621890485e-06,
"loss": 0.0228209063410759,
"mean_token_accuracy": 0.9975250825285912,
"num_tokens": 27103701.0,
"step": 4330
},
{
"entropy": 2.0691784262657165,
"epoch": 3.760996749729144,
"grad_norm": 0.13686347007751465,
"learning_rate": 3.0570966090138467e-06,
"loss": 0.03443102836608887,
"mean_token_accuracy": 0.991241104900837,
"num_tokens": 27166073.0,
"step": 4340
},
{
"entropy": 2.037180745601654,
"epoch": 3.7696641386782233,
"grad_norm": 0.07159221917390823,
"learning_rate": 3.0168025744790576e-06,
"loss": 0.036087846755981444,
"mean_token_accuracy": 0.9858055546879768,
"num_tokens": 27227475.0,
"step": 4350
},
{
"entropy": 2.0310893684625624,
"epoch": 3.7783315276273024,
"grad_norm": 0.6335000991821289,
"learning_rate": 2.9767286285268535e-06,
"loss": 0.06315004825592041,
"mean_token_accuracy": 0.9883092626929283,
"num_tokens": 27292889.0,
"step": 4360
},
{
"entropy": 2.092084974050522,
"epoch": 3.7869989165763815,
"grad_norm": 1.302903413772583,
"learning_rate": 2.9368760341629097e-06,
"loss": 0.02792898118495941,
"mean_token_accuracy": 0.9912491559982299,
"num_tokens": 27348266.0,
"step": 4370
},
{
"entropy": 2.060304436087608,
"epoch": 3.7956663055254607,
"grad_norm": 0.4250950515270233,
"learning_rate": 2.897246047416589e-06,
"loss": 0.028717631101608278,
"mean_token_accuracy": 0.996091590821743,
"num_tokens": 27405982.0,
"step": 4380
},
{
"entropy": 2.083743101358414,
"epoch": 3.8043336944745394,
"grad_norm": 3.3967700004577637,
"learning_rate": 2.8578399173013572e-06,
"loss": 0.08340678811073303,
"mean_token_accuracy": 0.9754736825823784,
"num_tokens": 27463260.0,
"step": 4390
},
{
"entropy": 1.9716408044099807,
"epoch": 3.8130010834236185,
"grad_norm": 0.5757962465286255,
"learning_rate": 2.818658885775414e-06,
"loss": 0.013928134739398957,
"mean_token_accuracy": 0.9954588785767555,
"num_tokens": 27528099.0,
"step": 4400
},
{
"epoch": 3.8130010834236185,
"eval_entropy": 1.9703540167405238,
"eval_loss": 0.08586890250444412,
"eval_mean_token_accuracy": 0.9799414511343733,
"eval_num_tokens": 27528099.0,
"eval_runtime": 326.7346,
"eval_samples_per_second": 4.921,
"eval_steps_per_second": 0.615,
"step": 4400
},
{
"entropy": 1.9763288021087646,
"epoch": 3.8216684723726977,
"grad_norm": 0.44175952672958374,
"learning_rate": 2.7797041877025565e-06,
"loss": 0.028418776392936707,
"mean_token_accuracy": 0.989984379708767,
"num_tokens": 27596380.0,
"step": 4410
},
{
"entropy": 2.0026954263448715,
"epoch": 3.830335861321777,
"grad_norm": 0.5693495869636536,
"learning_rate": 2.7409770508132605e-06,
"loss": 0.043587663769721986,
"mean_token_accuracy": 0.9874644920229911,
"num_tokens": 27656613.0,
"step": 4420
},
{
"entropy": 1.9414435267448424,
"epoch": 3.839003250270856,
"grad_norm": 4.053891658782959,
"learning_rate": 2.7024786956659854e-06,
"loss": 0.025079956650733946,
"mean_token_accuracy": 0.9922862559556961,
"num_tokens": 27726620.0,
"step": 4430
},
{
"entropy": 2.0779118567705153,
"epoch": 3.847670639219935,
"grad_norm": 0.06513004004955292,
"learning_rate": 2.6642103356086933e-06,
"loss": 0.022648689150810242,
"mean_token_accuracy": 0.9921250343322754,
"num_tokens": 27782546.0,
"step": 4440
},
{
"entropy": 2.052326163649559,
"epoch": 3.856338028169014,
"grad_norm": 2.3468716144561768,
"learning_rate": 2.6261731767406296e-06,
"loss": 0.041925692558288576,
"mean_token_accuracy": 0.9881504774093628,
"num_tokens": 27846707.0,
"step": 4450
},
{
"entropy": 1.968158569931984,
"epoch": 3.865005417118093,
"grad_norm": 0.15953290462493896,
"learning_rate": 2.588368417874296e-06,
"loss": 0.01032664328813553,
"mean_token_accuracy": 0.9981753632426262,
"num_tokens": 27915351.0,
"step": 4460
},
{
"entropy": 2.071339601278305,
"epoch": 3.873672806067172,
"grad_norm": 0.064334936439991,
"learning_rate": 2.5507972504976774e-06,
"loss": 0.05382372140884399,
"mean_token_accuracy": 0.9884915590286255,
"num_tokens": 27974044.0,
"step": 4470
},
{
"entropy": 2.0488192796707154,
"epoch": 3.8823401950162513,
"grad_norm": 0.23742307722568512,
"learning_rate": 2.5134608587366695e-06,
"loss": 0.030007198452949524,
"mean_token_accuracy": 0.9883778721094132,
"num_tokens": 28041557.0,
"step": 4480
},
{
"entropy": 2.0650737464427946,
"epoch": 3.8910075839653304,
"grad_norm": 0.2596496343612671,
"learning_rate": 2.4763604193177913e-06,
"loss": 0.023527370393276216,
"mean_token_accuracy": 0.9875,
"num_tokens": 28100710.0,
"step": 4490
},
{
"entropy": 2.0444571018218993,
"epoch": 3.8996749729144096,
"grad_norm": 0.31552854180336,
"learning_rate": 2.4394971015310732e-06,
"loss": 0.021546658873558045,
"mean_token_accuracy": 0.993670429289341,
"num_tokens": 28158419.0,
"step": 4500
},
{
"epoch": 3.8996749729144096,
"eval_entropy": 1.9708711134260566,
"eval_loss": 0.0864068791270256,
"eval_mean_token_accuracy": 0.9796283820375281,
"eval_num_tokens": 28158419.0,
"eval_runtime": 326.9161,
"eval_samples_per_second": 4.919,
"eval_steps_per_second": 0.615,
"step": 4500
},
{
"entropy": 2.087741878628731,
"epoch": 3.9083423618634887,
"grad_norm": 0.23832260072231293,
"learning_rate": 2.4028720671932047e-06,
"loss": 0.054845225811004636,
"mean_token_accuracy": 0.9857747331261635,
"num_tokens": 28213762.0,
"step": 4510
},
{
"entropy": 2.0132829934358596,
"epoch": 3.917009750812568,
"grad_norm": 0.25584664940834045,
"learning_rate": 2.366486470610936e-06,
"loss": 0.01848226636648178,
"mean_token_accuracy": 0.9928658232092857,
"num_tokens": 28278471.0,
"step": 4520
},
{
"entropy": 2.045706260204315,
"epoch": 3.925677139761647,
"grad_norm": 2.5656206607818604,
"learning_rate": 2.3303414585446805e-06,
"loss": 0.022681842744350433,
"mean_token_accuracy": 0.9910395190119743,
"num_tokens": 28338647.0,
"step": 4530
},
{
"entropy": 1.99814330637455,
"epoch": 3.934344528710726,
"grad_norm": 0.9603461623191833,
"learning_rate": 2.294438170172384e-06,
"loss": 0.02413419634103775,
"mean_token_accuracy": 0.9891596958041191,
"num_tokens": 28410160.0,
"step": 4540
},
{
"entropy": 2.0732466995716097,
"epoch": 3.943011917659805,
"grad_norm": 1.4361649751663208,
"learning_rate": 2.2587777370536056e-06,
"loss": 0.037426996231079104,
"mean_token_accuracy": 0.991052907705307,
"num_tokens": 28467664.0,
"step": 4550
},
{
"entropy": 2.0532098948955535,
"epoch": 3.951679306608884,
"grad_norm": 2.0590333938598633,
"learning_rate": 2.223361283093878e-06,
"loss": 0.031706079840660095,
"mean_token_accuracy": 0.9870526701211929,
"num_tokens": 28527408.0,
"step": 4560
},
{
"entropy": 2.017728653550148,
"epoch": 3.960346695557963,
"grad_norm": 0.10862936824560165,
"learning_rate": 2.188189924509262e-06,
"loss": 0.02106429487466812,
"mean_token_accuracy": 0.98840461820364,
"num_tokens": 28587046.0,
"step": 4570
},
{
"entropy": 2.0349554061889648,
"epoch": 3.9690140845070423,
"grad_norm": 2.5669116973876953,
"learning_rate": 2.153264769791188e-06,
"loss": 0.04130597114562988,
"mean_token_accuracy": 0.981039223074913,
"num_tokens": 28646182.0,
"step": 4580
},
{
"entropy": 1.9828863322734833,
"epoch": 3.9776814734561214,
"grad_norm": 1.4713232517242432,
"learning_rate": 2.1185869196714947e-06,
"loss": 0.025165802240371703,
"mean_token_accuracy": 0.9947456598281861,
"num_tokens": 28714463.0,
"step": 4590
},
{
"entropy": 2.072134110331535,
"epoch": 3.9863488624052006,
"grad_norm": 2.247790575027466,
"learning_rate": 2.084157467087765e-06,
"loss": 0.021596594154834746,
"mean_token_accuracy": 0.993795844912529,
"num_tokens": 28775790.0,
"step": 4600
},
{
"epoch": 3.9863488624052006,
"eval_entropy": 1.9691801563424258,
"eval_loss": 0.08587238192558289,
"eval_mean_token_accuracy": 0.9797982505304896,
"eval_num_tokens": 28775790.0,
"eval_runtime": 326.9013,
"eval_samples_per_second": 4.919,
"eval_steps_per_second": 0.615,
"step": 4600
},
{
"entropy": 2.0738868415355682,
"epoch": 3.9950162513542793,
"grad_norm": 0.9110870361328125,
"learning_rate": 2.049977497148863e-06,
"loss": 0.03904995024204254,
"mean_token_accuracy": 0.985892140865326,
"num_tokens": 28837387.0,
"step": 4610
},
{
"entropy": 2.030005083634303,
"epoch": 4.003466955579632,
"grad_norm": 0.24106350541114807,
"learning_rate": 2.0160480871007316e-06,
"loss": 0.01345173418521881,
"mean_token_accuracy": 0.9953376727226453,
"num_tokens": 28894661.0,
"step": 4620
},
{
"entropy": 2.007124736905098,
"epoch": 4.012134344528711,
"grad_norm": 0.5830142498016357,
"learning_rate": 1.9823703062924584e-06,
"loss": 0.006817830353975296,
"mean_token_accuracy": 1.0,
"num_tokens": 28962127.0,
"step": 4630
},
{
"entropy": 2.0393721789121626,
"epoch": 4.02080173347779,
"grad_norm": 0.5709890723228455,
"learning_rate": 1.948945216142558e-06,
"loss": 0.029663556814193727,
"mean_token_accuracy": 0.9864947348833084,
"num_tokens": 29027460.0,
"step": 4640
},
{
"entropy": 1.9643317103385924,
"epoch": 4.029469122426869,
"grad_norm": 1.7358582019805908,
"learning_rate": 1.9157738701055283e-06,
"loss": 0.008620598912239074,
"mean_token_accuracy": 0.9963573709130287,
"num_tokens": 29094613.0,
"step": 4650
},
{
"entropy": 2.0889448076486588,
"epoch": 4.038136511375948,
"grad_norm": 0.604278564453125,
"learning_rate": 1.882857313638634e-06,
"loss": 0.03244847357273102,
"mean_token_accuracy": 0.9926116779446602,
"num_tokens": 29150702.0,
"step": 4660
},
{
"entropy": 2.0580625355243685,
"epoch": 4.046803900325027,
"grad_norm": 1.5685875415802002,
"learning_rate": 1.8501965841689807e-06,
"loss": 0.0101649709045887,
"mean_token_accuracy": 0.9972690224647522,
"num_tokens": 29210797.0,
"step": 4670
},
{
"entropy": 1.9661096304655075,
"epoch": 4.055471289274106,
"grad_norm": 1.1568413972854614,
"learning_rate": 1.8177927110607995e-06,
"loss": 0.018484874069690703,
"mean_token_accuracy": 0.9930728524923325,
"num_tokens": 29278613.0,
"step": 4680
},
{
"entropy": 2.0536277323961256,
"epoch": 4.064138678223185,
"grad_norm": 0.721993088722229,
"learning_rate": 1.7856467155830137e-06,
"loss": 0.01394631266593933,
"mean_token_accuracy": 0.9933244362473488,
"num_tokens": 29338705.0,
"step": 4690
},
{
"entropy": 2.0374705642461777,
"epoch": 4.072806067172264,
"grad_norm": 0.7892134785652161,
"learning_rate": 1.7537596108770417e-06,
"loss": 0.03956481218338013,
"mean_token_accuracy": 0.9904462099075317,
"num_tokens": 29398735.0,
"step": 4700
},
{
"epoch": 4.072806067172264,
"eval_entropy": 1.9702677424274273,
"eval_loss": 0.08744855970144272,
"eval_mean_token_accuracy": 0.9802299376150861,
"eval_num_tokens": 29398735.0,
"eval_runtime": 326.9756,
"eval_samples_per_second": 4.918,
"eval_steps_per_second": 0.615,
"step": 4700
},
{
"entropy": 2.099683851003647,
"epoch": 4.081473456121343,
"grad_norm": 0.41404569149017334,
"learning_rate": 1.722132401924882e-06,
"loss": 0.008110367506742478,
"mean_token_accuracy": 0.9981684982776642,
"num_tokens": 29454416.0,
"step": 4710
},
{
"entropy": 2.0630714267492296,
"epoch": 4.090140845070422,
"grad_norm": 0.45244091749191284,
"learning_rate": 1.6907660855174256e-06,
"loss": 0.022814184427261353,
"mean_token_accuracy": 0.9923579677939415,
"num_tokens": 29516425.0,
"step": 4720
},
{
"entropy": 2.1098799794912337,
"epoch": 4.098808234019502,
"grad_norm": 0.8225563168525696,
"learning_rate": 1.6596616502230479e-06,
"loss": 0.02271169424057007,
"mean_token_accuracy": 0.9904859319329262,
"num_tokens": 29570595.0,
"step": 4730
},
{
"entropy": 2.017019960284233,
"epoch": 4.107475622968581,
"grad_norm": 3.7492403984069824,
"learning_rate": 1.6288200763564422e-06,
"loss": 0.03186882734298706,
"mean_token_accuracy": 0.9883370444178581,
"num_tokens": 29636384.0,
"step": 4740
},
{
"entropy": 2.1209054619073866,
"epoch": 4.11614301191766,
"grad_norm": 0.7058954834938049,
"learning_rate": 1.5982423359477383e-06,
"loss": 0.020897382497787477,
"mean_token_accuracy": 0.9931535944342613,
"num_tokens": 29687984.0,
"step": 4750
},
{
"entropy": 2.0571787297725677,
"epoch": 4.124810400866739,
"grad_norm": 0.6924902200698853,
"learning_rate": 1.5679293927118545e-06,
"loss": 0.01724575012922287,
"mean_token_accuracy": 0.9941381692886353,
"num_tokens": 29752451.0,
"step": 4760
},
{
"entropy": 2.066095697879791,
"epoch": 4.133477789815818,
"grad_norm": 0.8853573799133301,
"learning_rate": 1.5378822020181339e-06,
"loss": 0.019921644032001494,
"mean_token_accuracy": 0.9936603635549546,
"num_tokens": 29816586.0,
"step": 4770
},
{
"entropy": 2.036505189538002,
"epoch": 4.142145178764897,
"grad_norm": 0.7433391213417053,
"learning_rate": 1.5081017108602203e-06,
"loss": 0.009318779408931731,
"mean_token_accuracy": 0.9980769231915474,
"num_tokens": 29886863.0,
"step": 4780
},
{
"entropy": 2.023917606472969,
"epoch": 4.150812567713976,
"grad_norm": 0.5994493961334229,
"learning_rate": 1.4785888578262265e-06,
"loss": 0.014561480283737183,
"mean_token_accuracy": 0.9964600846171379,
"num_tokens": 29944175.0,
"step": 4790
},
{
"entropy": 2.0322933435440063,
"epoch": 4.159479956663056,
"grad_norm": 1.3376491069793701,
"learning_rate": 1.449344573069149e-06,
"loss": 0.018283985555171967,
"mean_token_accuracy": 0.9946957662701607,
"num_tokens": 30009144.0,
"step": 4800
},
{
"epoch": 4.159479956663056,
"eval_entropy": 1.9736577497785956,
"eval_loss": 0.08808128535747528,
"eval_mean_token_accuracy": 0.9802062247523028,
"eval_num_tokens": 30009144.0,
"eval_runtime": 326.8502,
"eval_samples_per_second": 4.92,
"eval_steps_per_second": 0.615,
"step": 4800
},
{
"entropy": 2.0404345244169235,
"epoch": 4.168147345612135,
"grad_norm": 2.575533628463745,
"learning_rate": 1.4203697782775484e-06,
"loss": 0.01365792155265808,
"mean_token_accuracy": 0.9939484119415283,
"num_tokens": 30077467.0,
"step": 4810
},
{
"entropy": 2.024330788850784,
"epoch": 4.176814734561214,
"grad_norm": 0.26384237408638,
"learning_rate": 1.391665386646498e-06,
"loss": 0.021796645224094392,
"mean_token_accuracy": 0.9972478061914444,
"num_tokens": 30141247.0,
"step": 4820
},
{
"entropy": 2.062552109360695,
"epoch": 4.185482123510292,
"grad_norm": 3.534402370452881,
"learning_rate": 1.3632323028488149e-06,
"loss": 0.015387092530727387,
"mean_token_accuracy": 0.9924221619963646,
"num_tokens": 30197279.0,
"step": 4830
},
{
"entropy": 1.9646895557641983,
"epoch": 4.194149512459371,
"grad_norm": 1.8417781591415405,
"learning_rate": 1.3350714230065386e-06,
"loss": 0.02345104664564133,
"mean_token_accuracy": 0.9931765854358673,
"num_tokens": 30269676.0,
"step": 4840
},
{
"entropy": 1.98412424325943,
"epoch": 4.20281690140845,
"grad_norm": 3.6741926670074463,
"learning_rate": 1.3071836346626865e-06,
"loss": 0.03531681299209595,
"mean_token_accuracy": 0.9901143789291382,
"num_tokens": 30330336.0,
"step": 4850
},
{
"entropy": 2.0338327258825304,
"epoch": 4.21148429035753,
"grad_norm": 0.12444645166397095,
"learning_rate": 1.2795698167532888e-06,
"loss": 0.00578281432390213,
"mean_token_accuracy": 0.9981522962450982,
"num_tokens": 30395578.0,
"step": 4860
},
{
"entropy": 2.014167508482933,
"epoch": 4.220151679306609,
"grad_norm": 2.159712076187134,
"learning_rate": 1.2522308395796789e-06,
"loss": 0.017886465787887572,
"mean_token_accuracy": 0.9974074080586434,
"num_tokens": 30459507.0,
"step": 4870
},
{
"entropy": 2.115958270430565,
"epoch": 4.228819068255688,
"grad_norm": 2.1067309379577637,
"learning_rate": 1.2251675647810724e-06,
"loss": 0.01809442341327667,
"mean_token_accuracy": 0.9926080524921417,
"num_tokens": 30513568.0,
"step": 4880
},
{
"entropy": 2.0274746090173723,
"epoch": 4.237486457204767,
"grad_norm": 1.9293690919876099,
"learning_rate": 1.1983808453074009e-06,
"loss": 0.011695823818445205,
"mean_token_accuracy": 0.9947041690349578,
"num_tokens": 30582049.0,
"step": 4890
},
{
"entropy": 2.0403768837451937,
"epoch": 4.246153846153846,
"grad_norm": 0.4305020570755005,
"learning_rate": 1.1718715253924417e-06,
"loss": 0.011889181286096572,
"mean_token_accuracy": 0.9974476903676986,
"num_tokens": 30646717.0,
"step": 4900
},
{
"epoch": 4.246153846153846,
"eval_entropy": 1.9705782998260575,
"eval_loss": 0.08883950114250183,
"eval_mean_token_accuracy": 0.97969317287948,
"eval_num_tokens": 30646717.0,
"eval_runtime": 326.98,
"eval_samples_per_second": 4.918,
"eval_steps_per_second": 0.615,
"step": 4900
},
{
"entropy": 2.0958633810281753,
"epoch": 4.254821235102925,
"grad_norm": 1.2778172492980957,
"learning_rate": 1.1456404405271993e-06,
"loss": 0.014013904333114623,
"mean_token_accuracy": 0.9959134608507156,
"num_tokens": 30701308.0,
"step": 4910
},
{
"entropy": 2.013311989605427,
"epoch": 4.2634886240520045,
"grad_norm": 2.811065196990967,
"learning_rate": 1.1196884174335842e-06,
"loss": 0.01911211907863617,
"mean_token_accuracy": 0.99190693795681,
"num_tokens": 30754634.0,
"step": 4920
},
{
"entropy": 2.0537849366664886,
"epoch": 4.272156013001084,
"grad_norm": 0.43671995401382446,
"learning_rate": 1.094016274038341e-06,
"loss": 0.009578761458396912,
"mean_token_accuracy": 0.9973684206604958,
"num_tokens": 30811429.0,
"step": 4930
},
{
"entropy": 2.042087969183922,
"epoch": 4.280823401950163,
"grad_norm": 0.10949576646089554,
"learning_rate": 1.0686248194472882e-06,
"loss": 0.018562574684619904,
"mean_token_accuracy": 0.9698333323001862,
"num_tokens": 30876505.0,
"step": 4940
},
{
"entropy": 2.132018208503723,
"epoch": 4.289490790899242,
"grad_norm": 0.870583713054657,
"learning_rate": 1.043514853919807e-06,
"loss": 0.008388452231884003,
"mean_token_accuracy": 0.998571427166462,
"num_tokens": 30935265.0,
"step": 4950
},
{
"entropy": 1.9139719784259797,
"epoch": 4.298158179848321,
"grad_norm": 0.1519097238779068,
"learning_rate": 1.018687168843625e-06,
"loss": 0.0245489701628685,
"mean_token_accuracy": 0.9940625011920929,
"num_tokens": 31004294.0,
"step": 4960
},
{
"entropy": 1.9107709616422652,
"epoch": 4.3068255687974,
"grad_norm": 4.961195468902588,
"learning_rate": 9.941425467098641e-07,
"loss": 0.00963737890124321,
"mean_token_accuracy": 0.9982142850756646,
"num_tokens": 31076072.0,
"step": 4970
},
{
"entropy": 2.084628200531006,
"epoch": 4.3154929577464785,
"grad_norm": 1.608235478401184,
"learning_rate": 9.698817610883915e-07,
"loss": 0.018618135154247283,
"mean_token_accuracy": 0.9952801674604416,
"num_tokens": 31134655.0,
"step": 4980
},
{
"entropy": 2.039292076230049,
"epoch": 4.324160346695558,
"grad_norm": 1.2228981256484985,
"learning_rate": 9.459055766034342e-07,
"loss": 0.026717761158943178,
"mean_token_accuracy": 0.9923743084073067,
"num_tokens": 31198217.0,
"step": 4990
},
{
"entropy": 2.0533795297145843,
"epoch": 4.332827735644637,
"grad_norm": 0.4585072100162506,
"learning_rate": 9.222147489094746e-07,
"loss": 0.013927005231380463,
"mean_token_accuracy": 0.994015522301197,
"num_tokens": 31259134.0,
"step": 5000
},
{
"epoch": 4.332827735644637,
"eval_entropy": 1.9728771590474825,
"eval_loss": 0.08881022036075592,
"eval_mean_token_accuracy": 0.9795496161304303,
"eval_num_tokens": 31259134.0,
"eval_runtime": 327.0558,
"eval_samples_per_second": 4.917,
"eval_steps_per_second": 0.615,
"step": 5000
},
{
"entropy": 2.0826673805713654,
"epoch": 4.341495124593716,
"grad_norm": 1.3024990558624268,
"learning_rate": 8.988100246674447e-07,
"loss": 0.02505913972854614,
"mean_token_accuracy": 0.990269535779953,
"num_tokens": 31319291.0,
"step": 5010
},
{
"entropy": 1.9910820811986922,
"epoch": 4.350162513542795,
"grad_norm": 0.28213417530059814,
"learning_rate": 8.756921415211872e-07,
"loss": 0.03284958600997925,
"mean_token_accuracy": 0.9892865911126136,
"num_tokens": 31389570.0,
"step": 5020
},
{
"entropy": 1.9260858178138733,
"epoch": 4.358829902491874,
"grad_norm": 1.6689592599868774,
"learning_rate": 8.528618280742118e-07,
"loss": 0.022429963946342467,
"mean_token_accuracy": 0.9873416185379028,
"num_tokens": 31456570.0,
"step": 5030
},
{
"entropy": 2.075908821821213,
"epoch": 4.367497291440953,
"grad_norm": 0.5058390498161316,
"learning_rate": 8.303198038667216e-07,
"loss": 0.03578021228313446,
"mean_token_accuracy": 0.9861092865467072,
"num_tokens": 31512591.0,
"step": 5040
},
{
"entropy": 2.0401781380176542,
"epoch": 4.3761646803900325,
"grad_norm": 2.0004308223724365,
"learning_rate": 8.080667793529495e-07,
"loss": 0.035635894536972045,
"mean_token_accuracy": 0.9919731870293618,
"num_tokens": 31572815.0,
"step": 5050
},
{
"entropy": 2.062747171521187,
"epoch": 4.384832069339112,
"grad_norm": 1.3225598335266113,
"learning_rate": 7.861034558787594e-07,
"loss": 0.010875914245843887,
"mean_token_accuracy": 0.9954330354928971,
"num_tokens": 31636449.0,
"step": 5060
},
{
"entropy": 2.0818180203437806,
"epoch": 4.393499458288191,
"grad_norm": 0.27941176295280457,
"learning_rate": 7.644305256595419e-07,
"loss": 0.012188396602869033,
"mean_token_accuracy": 0.9975026711821556,
"num_tokens": 31699355.0,
"step": 5070
},
{
"entropy": 2.0237564265728,
"epoch": 4.40216684723727,
"grad_norm": 0.18985368311405182,
"learning_rate": 7.430486717583962e-07,
"loss": 0.010058794915676118,
"mean_token_accuracy": 0.99608004540205,
"num_tokens": 31764950.0,
"step": 5080
},
{
"entropy": 2.0428464114665985,
"epoch": 4.410834236186349,
"grad_norm": 1.510493278503418,
"learning_rate": 7.21958568064608e-07,
"loss": 0.012500947713851929,
"mean_token_accuracy": 0.9923106044530868,
"num_tokens": 31823167.0,
"step": 5090
},
{
"entropy": 2.0478352516889573,
"epoch": 4.419501625135428,
"grad_norm": 0.569312572479248,
"learning_rate": 7.011608792724068e-07,
"loss": 0.01235663816332817,
"mean_token_accuracy": 0.9952962964773178,
"num_tokens": 31883856.0,
"step": 5100
},
{
"epoch": 4.419501625135428,
"eval_entropy": 1.9781580647425865,
"eval_loss": 0.08919015526771545,
"eval_mean_token_accuracy": 0.9796797802199179,
"eval_num_tokens": 31883856.0,
"eval_runtime": 326.8313,
"eval_samples_per_second": 4.92,
"eval_steps_per_second": 0.615,
"step": 5100
},
{
"entropy": 2.108269548416138,
"epoch": 4.428169014084507,
"grad_norm": 0.07893358916044235,
"learning_rate": 6.806562608600186e-07,
"loss": 0.004451769217848778,
"mean_token_accuracy": 1.0,
"num_tokens": 31938054.0,
"step": 5110
},
{
"entropy": 2.075284495949745,
"epoch": 4.4368364030335865,
"grad_norm": 3.848189115524292,
"learning_rate": 6.604453590690007e-07,
"loss": 0.03046499490737915,
"mean_token_accuracy": 0.9956063643097878,
"num_tokens": 31995451.0,
"step": 5120
},
{
"entropy": 1.964671802520752,
"epoch": 4.445503791982665,
"grad_norm": 2.6819865703582764,
"learning_rate": 6.405288108838836e-07,
"loss": 0.03677540421485901,
"mean_token_accuracy": 0.981814344227314,
"num_tokens": 32064564.0,
"step": 5130
},
{
"entropy": 2.0767350763082506,
"epoch": 4.454171180931744,
"grad_norm": 0.2573661208152771,
"learning_rate": 6.209072440120912e-07,
"loss": 0.01814277321100235,
"mean_token_accuracy": 0.9919444441795349,
"num_tokens": 32126879.0,
"step": 5140
},
{
"entropy": 2.0255597680807114,
"epoch": 4.462838569880823,
"grad_norm": 0.5254562497138977,
"learning_rate": 6.015812768641582e-07,
"loss": 0.009591031819581985,
"mean_token_accuracy": 0.9972966268658638,
"num_tokens": 32191835.0,
"step": 5150
},
{
"entropy": 2.0272518664598467,
"epoch": 4.471505958829902,
"grad_norm": 1.8054099082946777,
"learning_rate": 5.825515185342323e-07,
"loss": 0.012653954327106476,
"mean_token_accuracy": 0.9968452379107475,
"num_tokens": 32260376.0,
"step": 5160
},
{
"entropy": 2.058269131183624,
"epoch": 4.480173347778981,
"grad_norm": 0.6068629026412964,
"learning_rate": 5.638185687808917e-07,
"loss": 0.009308335930109024,
"mean_token_accuracy": 0.9960426911711693,
"num_tokens": 32318458.0,
"step": 5170
},
{
"entropy": 2.1178119242191316,
"epoch": 4.4888407367280605,
"grad_norm": 0.09419647604227066,
"learning_rate": 5.453830180082309e-07,
"loss": 0.009917216002941131,
"mean_token_accuracy": 0.9953914135694504,
"num_tokens": 32373717.0,
"step": 5180
},
{
"entropy": 2.053645688295364,
"epoch": 4.49750812567714,
"grad_norm": 0.396065890789032,
"learning_rate": 5.27245447247261e-07,
"loss": 0.01238245666027069,
"mean_token_accuracy": 0.9962280064821243,
"num_tokens": 32426237.0,
"step": 5190
},
{
"entropy": 2.058378967642784,
"epoch": 4.506175514626219,
"grad_norm": 0.24088667333126068,
"learning_rate": 5.094064281375832e-07,
"loss": 0.008150581270456314,
"mean_token_accuracy": 0.9978787884116173,
"num_tokens": 32486772.0,
"step": 5200
},
{
"epoch": 4.506175514626219,
"eval_entropy": 1.9773344519126475,
"eval_loss": 0.08962774276733398,
"eval_mean_token_accuracy": 0.980161461960617,
"eval_num_tokens": 32486772.0,
"eval_runtime": 327.0625,
"eval_samples_per_second": 4.916,
"eval_steps_per_second": 0.615,
"step": 5200
},
{
"entropy": 2.000825381278992,
"epoch": 4.514842903575298,
"grad_norm": 0.13512328267097473,
"learning_rate": 4.918665229093955e-07,
"loss": 0.009017366915941238,
"mean_token_accuracy": 0.9954687505960464,
"num_tokens": 32555123.0,
"step": 5210
},
{
"entropy": 2.0178422331809998,
"epoch": 4.523510292524377,
"grad_norm": 1.763617753982544,
"learning_rate": 4.746262843657545e-07,
"loss": 0.015950243175029754,
"mean_token_accuracy": 0.991420355439186,
"num_tokens": 32617425.0,
"step": 5220
},
{
"entropy": 2.0761267840862274,
"epoch": 4.532177681473456,
"grad_norm": 0.4732784926891327,
"learning_rate": 4.5768625586515515e-07,
"loss": 0.013394179940223693,
"mean_token_accuracy": 0.9954727560281753,
"num_tokens": 32671383.0,
"step": 5230
},
{
"entropy": 2.1209077060222628,
"epoch": 4.540845070422535,
"grad_norm": 0.24119587242603302,
"learning_rate": 4.4104697130441297e-07,
"loss": 0.006799912452697754,
"mean_token_accuracy": 0.9964460790157318,
"num_tokens": 32721566.0,
"step": 5240
},
{
"entropy": 2.023488113284111,
"epoch": 4.5495124593716145,
"grad_norm": 0.9742321968078613,
"learning_rate": 4.247089551018335e-07,
"loss": 0.008217556774616242,
"mean_token_accuracy": 0.9959012061357498,
"num_tokens": 32785235.0,
"step": 5250
},
{
"entropy": 2.0245584696531296,
"epoch": 4.558179848320694,
"grad_norm": 0.7126546502113342,
"learning_rate": 4.08672722180683e-07,
"loss": 0.013321210443973542,
"mean_token_accuracy": 0.9972473606467247,
"num_tokens": 32850508.0,
"step": 5260
},
{
"entropy": 2.0293969064950943,
"epoch": 4.566847237269773,
"grad_norm": 0.19109396636486053,
"learning_rate": 3.9293877795296033e-07,
"loss": 0.024787485599517822,
"mean_token_accuracy": 0.9899170100688934,
"num_tokens": 32917953.0,
"step": 5270
},
{
"entropy": 2.0705538392066956,
"epoch": 4.575514626218851,
"grad_norm": 2.082110643386841,
"learning_rate": 3.775076183034687e-07,
"loss": 0.025293442606925964,
"mean_token_accuracy": 0.9883344322443008,
"num_tokens": 32980280.0,
"step": 5280
},
{
"entropy": 1.97212675511837,
"epoch": 4.584182015167931,
"grad_norm": 3.7733571529388428,
"learning_rate": 3.623797295741882e-07,
"loss": 0.026531627774238585,
"mean_token_accuracy": 0.9859025999903679,
"num_tokens": 33052310.0,
"step": 5290
},
{
"entropy": 2.1174137502908708,
"epoch": 4.592849404117009,
"grad_norm": 4.527464389801025,
"learning_rate": 3.4755558854894454e-07,
"loss": 0.05131498575210571,
"mean_token_accuracy": 0.9909847050905227,
"num_tokens": 33105153.0,
"step": 5300
},
{
"epoch": 4.592849404117009,
"eval_entropy": 1.9771031633538394,
"eval_loss": 0.08935187011957169,
"eval_mean_token_accuracy": 0.9799883635482978,
"eval_num_tokens": 33105153.0,
"eval_runtime": 327.1357,
"eval_samples_per_second": 4.915,
"eval_steps_per_second": 0.614,
"step": 5300
},
{
"entropy": 2.0754479676485063,
"epoch": 4.6015167930660885,
"grad_norm": 0.21639882028102875,
"learning_rate": 3.330356624383846e-07,
"loss": 0.018829087913036346,
"mean_token_accuracy": 0.9952528193593025,
"num_tokens": 33163772.0,
"step": 5310
},
{
"entropy": 2.0545038670301436,
"epoch": 4.610184182015168,
"grad_norm": 0.3632142245769501,
"learning_rate": 3.1882040886525023e-07,
"loss": 0.020865590870380403,
"mean_token_accuracy": 0.9914917916059494,
"num_tokens": 33226699.0,
"step": 5320
},
{
"entropy": 2.0661454617977144,
"epoch": 4.618851570964247,
"grad_norm": 1.8460487127304077,
"learning_rate": 3.049102758499567e-07,
"loss": 0.019039011001586913,
"mean_token_accuracy": 0.9947229847311974,
"num_tokens": 33285047.0,
"step": 5330
},
{
"entropy": 2.0611626476049425,
"epoch": 4.627518959913326,
"grad_norm": 2.2364659309387207,
"learning_rate": 2.9130570179647376e-07,
"loss": 0.010900366306304931,
"mean_token_accuracy": 0.995740094780922,
"num_tokens": 33349369.0,
"step": 5340
},
{
"entropy": 2.0093062967061996,
"epoch": 4.636186348862405,
"grad_norm": 0.7252208590507507,
"learning_rate": 2.7800711547850247e-07,
"loss": 0.02175909876823425,
"mean_token_accuracy": 0.9925066068768501,
"num_tokens": 33419661.0,
"step": 5350
},
{
"entropy": 1.9689721822738648,
"epoch": 4.644853737811484,
"grad_norm": 0.11739201098680496,
"learning_rate": 2.6501493602596683e-07,
"loss": 0.01585783213376999,
"mean_token_accuracy": 0.9941969141364098,
"num_tokens": 33495787.0,
"step": 5360
},
{
"entropy": 1.9787477880716324,
"epoch": 4.653521126760563,
"grad_norm": 0.03642086684703827,
"learning_rate": 2.5232957291180806e-07,
"loss": 0.029417428374290466,
"mean_token_accuracy": 0.9918199837207794,
"num_tokens": 33563931.0,
"step": 5370
},
{
"entropy": 2.0737911581993105,
"epoch": 4.6621885157096425,
"grad_norm": 2.774217128753662,
"learning_rate": 2.3995142593906563e-07,
"loss": 0.014542682468891144,
"mean_token_accuracy": 0.9953180745244026,
"num_tokens": 33624815.0,
"step": 5380
},
{
"entropy": 2.0131901890039443,
"epoch": 4.670855904658722,
"grad_norm": 0.3904068171977997,
"learning_rate": 2.2788088522829212e-07,
"loss": 0.03030272722244263,
"mean_token_accuracy": 0.9904125809669495,
"num_tokens": 33689523.0,
"step": 5390
},
{
"entropy": 2.0369192749261855,
"epoch": 4.679523293607801,
"grad_norm": 0.18654713034629822,
"learning_rate": 2.1611833120524838e-07,
"loss": 0.010971380770206452,
"mean_token_accuracy": 0.9960916191339493,
"num_tokens": 33750941.0,
"step": 5400
},
{
"epoch": 4.679523293607801,
"eval_entropy": 1.9789310124383044,
"eval_loss": 0.08923472464084625,
"eval_mean_token_accuracy": 0.9801432926263383,
"eval_num_tokens": 33750941.0,
"eval_runtime": 327.0832,
"eval_samples_per_second": 4.916,
"eval_steps_per_second": 0.615,
"step": 5400
},
{
"entropy": 2.0042553037405013,
"epoch": 4.68819068255688,
"grad_norm": 1.2499020099639893,
"learning_rate": 2.0466413458891776e-07,
"loss": 0.025074890255928038,
"mean_token_accuracy": 0.9954362437129021,
"num_tokens": 33809791.0,
"step": 5410
},
{
"entropy": 2.063493809103966,
"epoch": 4.696858071505959,
"grad_norm": 2.250760793685913,
"learning_rate": 1.935186563798186e-07,
"loss": 0.03190418183803558,
"mean_token_accuracy": 0.9925678476691246,
"num_tokens": 33875921.0,
"step": 5420
},
{
"entropy": 2.0530943751335142,
"epoch": 4.705525460455038,
"grad_norm": 1.5710461139678955,
"learning_rate": 1.8268224784862899e-07,
"loss": 0.012784861028194427,
"mean_token_accuracy": 0.9956602081656456,
"num_tokens": 33931632.0,
"step": 5430
},
{
"entropy": 2.046228414773941,
"epoch": 4.714192849404117,
"grad_norm": 5.684391021728516,
"learning_rate": 1.7215525052511673e-07,
"loss": 0.019351273775100708,
"mean_token_accuracy": 0.9934533283114433,
"num_tokens": 33994984.0,
"step": 5440
},
{
"entropy": 2.046843534708023,
"epoch": 4.722860238353196,
"grad_norm": 3.8622937202453613,
"learning_rate": 1.6193799618737683e-07,
"loss": 0.04347184896469116,
"mean_token_accuracy": 0.9886655271053314,
"num_tokens": 34061747.0,
"step": 5450
},
{
"entropy": 2.092145395278931,
"epoch": 4.731527627302275,
"grad_norm": 2.73188853263855,
"learning_rate": 1.520308068513665e-07,
"loss": 0.015788179636001588,
"mean_token_accuracy": 0.9970826536417008,
"num_tokens": 34118985.0,
"step": 5460
},
{
"entropy": 2.035344365239143,
"epoch": 4.740195016251354,
"grad_norm": 0.2667732536792755,
"learning_rate": 1.4243399476076557e-07,
"loss": 0.014378026127815247,
"mean_token_accuracy": 0.9969669118523597,
"num_tokens": 34179366.0,
"step": 5470
},
{
"entropy": 2.0383077263832092,
"epoch": 4.748862405200433,
"grad_norm": 0.49197614192962646,
"learning_rate": 1.3314786237713319e-07,
"loss": 0.008524678647518158,
"mean_token_accuracy": 0.9985294118523598,
"num_tokens": 34242470.0,
"step": 5480
},
{
"entropy": 2.0843881905078887,
"epoch": 4.757529794149512,
"grad_norm": 3.67633056640625,
"learning_rate": 1.2417270237037316e-07,
"loss": 0.02358439564704895,
"mean_token_accuracy": 0.988163261115551,
"num_tokens": 34305279.0,
"step": 5490
},
{
"entropy": 2.0624629646539687,
"epoch": 4.766197183098591,
"grad_norm": 3.794203281402588,
"learning_rate": 1.1550879760950707e-07,
"loss": 0.009884495288133621,
"mean_token_accuracy": 0.9988950893282891,
"num_tokens": 34366114.0,
"step": 5500
},
{
"epoch": 4.766197183098591,
"eval_entropy": 1.9788880733708245,
"eval_loss": 0.08953475207090378,
"eval_mean_token_accuracy": 0.979842825908566,
"eval_num_tokens": 34366114.0,
"eval_runtime": 327.0695,
"eval_samples_per_second": 4.916,
"eval_steps_per_second": 0.615,
"step": 5500
},
{
"entropy": 2.026938486099243,
"epoch": 4.774864572047671,
"grad_norm": 0.09174291789531708,
"learning_rate": 1.0715642115376679e-07,
"loss": 0.012465564161539077,
"mean_token_accuracy": 0.998863635957241,
"num_tokens": 34430371.0,
"step": 5510
},
{
"entropy": 1.887784132361412,
"epoch": 4.78353196099675,
"grad_norm": 0.5684153437614441,
"learning_rate": 9.91158362439848e-08,
"loss": 0.01685968190431595,
"mean_token_accuracy": 0.9935922354459763,
"num_tokens": 34515259.0,
"step": 5520
},
{
"entropy": 2.019374093413353,
"epoch": 4.792199349945829,
"grad_norm": 1.921454668045044,
"learning_rate": 9.138729629429633e-08,
"loss": 0.013727284967899323,
"mean_token_accuracy": 0.9937152773141861,
"num_tokens": 34579448.0,
"step": 5530
},
{
"entropy": 2.061140888929367,
"epoch": 4.800866738894908,
"grad_norm": 1.1379508972167969,
"learning_rate": 8.397104488415242e-08,
"loss": 0.018110451102256776,
"mean_token_accuracy": 0.9920138880610466,
"num_tokens": 34643503.0,
"step": 5540
},
{
"entropy": 2.116260740160942,
"epoch": 4.809534127843987,
"grad_norm": 0.09666794538497925,
"learning_rate": 7.686731575064499e-08,
"loss": 0.013026180863380431,
"mean_token_accuracy": 0.9928571432828903,
"num_tokens": 34699740.0,
"step": 5550
},
{
"entropy": 2.0289686411619186,
"epoch": 4.818201516793066,
"grad_norm": 2.967052936553955,
"learning_rate": 7.007633278114156e-08,
"loss": 0.01802207827568054,
"mean_token_accuracy": 0.9932675451040268,
"num_tokens": 34756188.0,
"step": 5560
},
{
"entropy": 2.008377233147621,
"epoch": 4.826868905742145,
"grad_norm": 0.5545211434364319,
"learning_rate": 6.359831000622319e-08,
"loss": 0.0315314382314682,
"mean_token_accuracy": 0.988946282863617,
"num_tokens": 34822503.0,
"step": 5570
},
{
"entropy": 2.0508563309907912,
"epoch": 4.835536294691225,
"grad_norm": 1.5701384544372559,
"learning_rate": 5.7433451592946446e-08,
"loss": 0.033820077776908875,
"mean_token_accuracy": 0.9926100254058838,
"num_tokens": 34883060.0,
"step": 5580
},
{
"entropy": 2.0419242858886717,
"epoch": 4.844203683640304,
"grad_norm": 0.8245704770088196,
"learning_rate": 5.158195183840087e-08,
"loss": 0.023655834794044494,
"mean_token_accuracy": 0.992795518040657,
"num_tokens": 34943194.0,
"step": 5590
},
{
"entropy": 2.0416525810956956,
"epoch": 4.852871072589382,
"grad_norm": 1.4492483139038086,
"learning_rate": 4.604399516359381e-08,
"loss": 0.009996517747640609,
"mean_token_accuracy": 0.9690203845500946,
"num_tokens": 35013087.0,
"step": 5600
},
{
"epoch": 4.852871072589382,
"eval_entropy": 1.9783549949304382,
"eval_loss": 0.08902545273303986,
"eval_mean_token_accuracy": 0.9801809992363204,
"eval_num_tokens": 35013087.0,
"eval_runtime": 327.0775,
"eval_samples_per_second": 4.916,
"eval_steps_per_second": 0.615,
"step": 5600
},
{
"entropy": 2.08369864821434,
"epoch": 4.861538461538462,
"grad_norm": 0.2037355750799179,
"learning_rate": 4.081975610762845e-08,
"loss": 0.020190438628196715,
"mean_token_accuracy": 0.9926752656698227,
"num_tokens": 35072258.0,
"step": 5610
},
{
"entropy": 1.9933051258325576,
"epoch": 4.87020585048754,
"grad_norm": 2.471435546875,
"learning_rate": 3.5909399322213714e-08,
"loss": 0.028650698065757752,
"mean_token_accuracy": 0.9927345782518386,
"num_tokens": 35136204.0,
"step": 5620
},
{
"entropy": 2.0149646639823913,
"epoch": 4.878873239436619,
"grad_norm": 0.14566990733146667,
"learning_rate": 3.13130795664629e-08,
"loss": 0.01882893741130829,
"mean_token_accuracy": 0.9957239225506782,
"num_tokens": 35210309.0,
"step": 5630
},
{
"entropy": 1.9940237611532212,
"epoch": 4.887540628385699,
"grad_norm": 1.4961596727371216,
"learning_rate": 2.703094170202869e-08,
"loss": 0.017515945434570312,
"mean_token_accuracy": 0.9969444438815117,
"num_tokens": 35282211.0,
"step": 5640
},
{
"entropy": 2.069670316576958,
"epoch": 4.896208017334778,
"grad_norm": 3.451641321182251,
"learning_rate": 2.3063120688527895e-08,
"loss": 0.009432430565357208,
"mean_token_accuracy": 0.9956648290157318,
"num_tokens": 35338685.0,
"step": 5650
},
{
"entropy": 2.030204784870148,
"epoch": 4.904875406283857,
"grad_norm": 0.47753724455833435,
"learning_rate": 1.9409741579290432e-08,
"loss": 0.018620912730693818,
"mean_token_accuracy": 0.9965626150369644,
"num_tokens": 35397783.0,
"step": 5660
},
{
"entropy": 2.029239335656166,
"epoch": 4.913542795232936,
"grad_norm": 0.3373558223247528,
"learning_rate": 1.6070919517422457e-08,
"loss": 0.02926117479801178,
"mean_token_accuracy": 0.994283078610897,
"num_tokens": 35460222.0,
"step": 5670
},
{
"entropy": 2.0445204973220825,
"epoch": 4.922210184182015,
"grad_norm": 3.4179787635803223,
"learning_rate": 1.304675973217151e-08,
"loss": 0.013791508972644806,
"mean_token_accuracy": 0.9986397057771683,
"num_tokens": 35512901.0,
"step": 5680
},
{
"entropy": 1.979167452454567,
"epoch": 4.930877573131094,
"grad_norm": 1.5083386898040771,
"learning_rate": 1.0337357535612491e-08,
"loss": 0.01376536637544632,
"mean_token_accuracy": 0.9958539381623268,
"num_tokens": 35583228.0,
"step": 5690
},
{
"entropy": 1.9492487490177155,
"epoch": 4.9395449620801735,
"grad_norm": 0.5227612853050232,
"learning_rate": 7.942798319645618e-09,
"loss": 0.026930561661720274,
"mean_token_accuracy": 0.9896025002002716,
"num_tokens": 35651933.0,
"step": 5700
},
{
"epoch": 4.9395449620801735,
"eval_entropy": 1.978533458353868,
"eval_loss": 0.08922462910413742,
"eval_mean_token_accuracy": 0.9799270276999592,
"eval_num_tokens": 35651933.0,
"eval_runtime": 326.7094,
"eval_samples_per_second": 4.922,
"eval_steps_per_second": 0.615,
"step": 5700
},
{
"entropy": 2.0769087851047514,
"epoch": 4.948212351029253,
"grad_norm": 1.7579526901245117,
"learning_rate": 5.863157553301912e-09,
"loss": 0.04630476236343384,
"mean_token_accuracy": 0.9901736095547676,
"num_tokens": 35702827.0,
"step": 5710
},
{
"entropy": 2.0126946330070496,
"epoch": 4.956879739978332,
"grad_norm": 0.29572439193725586,
"learning_rate": 4.098500780364001e-09,
"loss": 0.024674685299396516,
"mean_token_accuracy": 0.9920352548360825,
"num_tokens": 35765963.0,
"step": 5720
},
{
"entropy": 2.093992868065834,
"epoch": 4.965547128927411,
"grad_norm": 2.5199387073516846,
"learning_rate": 2.6488836173077513e-09,
"loss": 0.018880957365036012,
"mean_token_accuracy": 0.997487536072731,
"num_tokens": 35827800.0,
"step": 5730
},
{
"entropy": 2.0499730825424196,
"epoch": 4.97421451787649,
"grad_norm": 2.6069576740264893,
"learning_rate": 1.5143517515381345e-09,
"loss": 0.030907681584358214,
"mean_token_accuracy": 0.9882355168461799,
"num_tokens": 35889316.0,
"step": 5740
},
{
"entropy": 2.03939069211483,
"epoch": 4.982881906825568,
"grad_norm": 1.0308866500854492,
"learning_rate": 6.949409399581442e-10,
"loss": 0.018008121848106386,
"mean_token_accuracy": 0.9932060182094574,
"num_tokens": 35955227.0,
"step": 5750
},
{
"entropy": 1.945585885643959,
"epoch": 4.991549295774648,
"grad_norm": 2.1488585472106934,
"learning_rate": 1.9067700783970133e-10,
"loss": 0.013979943096637725,
"mean_token_accuracy": 0.9966666668653488,
"num_tokens": 36027714.0,
"step": 5760
},
{
"entropy": 2.070587479151212,
"epoch": 5.0,
"grad_norm": 0.31686675548553467,
"learning_rate": 1.5758480065297676e-12,
"loss": 0.019185705482959746,
"mean_token_accuracy": 0.992816442098373,
"num_tokens": 36090205.0,
"step": 5770
},
{
"epoch": 5.0,
"eval_entropy": 1.9783666353320601,
"eval_loss": 0.08960430324077606,
"eval_mean_token_accuracy": 0.9804033803109505,
"eval_num_tokens": 36090205.0,
"eval_runtime": 326.8442,
"eval_samples_per_second": 4.92,
"eval_steps_per_second": 0.615,
"step": 5770
},
{
"epoch": 5.0,
"step": 5770,
"total_flos": 2.2732684905831875e+18,
"train_loss": 0.09643875142201085,
"train_runtime": 36470.303,
"train_samples_per_second": 1.265,
"train_steps_per_second": 0.158
}
],
"logging_steps": 10,
"max_steps": 5770,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 2.2732684905831875e+18,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}