Jongbin-kr's picture
End of training: best validation-loss checkpoint
cbb0c94 verified
Raw
History Blame Contribute Delete
80.3 kB
{
"best_global_step": 400,
"best_metric": 0.8793772459030151,
"best_model_checkpoint": "/data6/jongbinwon/evolving_MoE/checkpoints/sft_llama31_8b_sni_ours-c_46890_ffn_only_5ep/checkpoint-400",
"epoch": 5.0,
"eval_steps": 100,
"global_step": 2350,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 1.6614337407052517,
"epoch": 0.021316280309086066,
"grad_norm": 5.885494709014893,
"learning_rate": 2.535211267605634e-06,
"loss": 1.9121068954467773,
"mean_token_accuracy": 0.4677846459671855,
"num_tokens": 31378.0,
"step": 10
},
{
"entropy": 1.6881026968359947,
"epoch": 0.04263256061817213,
"grad_norm": 3.2283990383148193,
"learning_rate": 5.352112676056338e-06,
"loss": 1.5715059280395507,
"mean_token_accuracy": 0.44802144076675177,
"num_tokens": 65329.0,
"step": 20
},
{
"entropy": 1.7457253947854041,
"epoch": 0.0639488409272582,
"grad_norm": 5.933238983154297,
"learning_rate": 8.169014084507043e-06,
"loss": 1.478184700012207,
"mean_token_accuracy": 0.5721993442624808,
"num_tokens": 96853.0,
"step": 30
},
{
"entropy": 1.8166336372494698,
"epoch": 0.08526512123634426,
"grad_norm": 6.201107501983643,
"learning_rate": 1.0985915492957748e-05,
"loss": 1.5585371017456056,
"mean_token_accuracy": 0.6381208458915353,
"num_tokens": 135861.0,
"step": 40
},
{
"entropy": 1.960172240436077,
"epoch": 0.10658140154543032,
"grad_norm": 4.265772819519043,
"learning_rate": 1.380281690140845e-05,
"loss": 1.2981000900268556,
"mean_token_accuracy": 0.7017534904181957,
"num_tokens": 165735.0,
"step": 50
},
{
"entropy": 2.0925094671547413,
"epoch": 0.1278976818545164,
"grad_norm": 4.701080799102783,
"learning_rate": 1.6619718309859155e-05,
"loss": 0.8457387924194336,
"mean_token_accuracy": 0.7487788364291191,
"num_tokens": 198750.0,
"step": 60
},
{
"entropy": 2.1667631298303602,
"epoch": 0.14921396216360244,
"grad_norm": 5.391711711883545,
"learning_rate": 1.943661971830986e-05,
"loss": 1.1811514854431153,
"mean_token_accuracy": 0.7028381442651153,
"num_tokens": 233077.0,
"step": 70
},
{
"entropy": 2.2530563578009604,
"epoch": 0.17053024247268853,
"grad_norm": 1.7958399057388306,
"learning_rate": 1.9999391925667267e-05,
"loss": 0.9082818031311035,
"mean_token_accuracy": 0.7205365922302007,
"num_tokens": 260650.0,
"step": 80
},
{
"entropy": 2.1963915079832077,
"epoch": 0.19184652278177458,
"grad_norm": 2.5990638732910156,
"learning_rate": 1.9996921750431973e-05,
"loss": 1.1263222694396973,
"mean_token_accuracy": 0.7047741265967489,
"num_tokens": 290183.0,
"step": 90
},
{
"entropy": 2.2172813221812246,
"epoch": 0.21316280309086064,
"grad_norm": 2.4212396144866943,
"learning_rate": 1.9992551938675226e-05,
"loss": 0.8470280647277832,
"mean_token_accuracy": 0.7515074783936143,
"num_tokens": 324143.0,
"step": 100
},
{
"epoch": 0.21316280309086064,
"eval_entropy": 2.227590183261782,
"eval_loss": 0.9589676260948181,
"eval_mean_token_accuracy": 0.7676837602630258,
"eval_num_tokens": 324143.0,
"eval_runtime": 25.1983,
"eval_samples_per_second": 20.319,
"eval_steps_per_second": 10.159,
"step": 100
},
{
"entropy": 2.2125924050807955,
"epoch": 0.23447908339994672,
"grad_norm": 6.292978286743164,
"learning_rate": 1.998628332075803e-05,
"loss": 1.0414030075073242,
"mean_token_accuracy": 0.741944869607687,
"num_tokens": 356326.0,
"step": 110
},
{
"entropy": 2.058356484770775,
"epoch": 0.2557953637090328,
"grad_norm": 4.461580276489258,
"learning_rate": 1.997811708785662e-05,
"loss": 0.9603706359863281,
"mean_token_accuracy": 0.6898831229656934,
"num_tokens": 390362.0,
"step": 120
},
{
"entropy": 2.074503220617771,
"epoch": 0.27711164401811883,
"grad_norm": 5.1775593757629395,
"learning_rate": 1.996805479173609e-05,
"loss": 1.051582431793213,
"mean_token_accuracy": 0.7262888364493847,
"num_tokens": 417801.0,
"step": 130
},
{
"entropy": 2.088790734112263,
"epoch": 0.2984279243272049,
"grad_norm": 4.234198570251465,
"learning_rate": 1.9956098344455538e-05,
"loss": 1.0677826881408692,
"mean_token_accuracy": 0.7328823814168572,
"num_tokens": 446130.0,
"step": 140
},
{
"entropy": 2.179301120340824,
"epoch": 0.31974420463629094,
"grad_norm": 6.005627155303955,
"learning_rate": 1.9942250018004733e-05,
"loss": 0.9156723022460938,
"mean_token_accuracy": 0.7256842903792858,
"num_tokens": 475747.0,
"step": 150
},
{
"entropy": 2.136591888964176,
"epoch": 0.34106048494537705,
"grad_norm": 4.946103096008301,
"learning_rate": 1.992651244387238e-05,
"loss": 0.8417132377624512,
"mean_token_accuracy": 0.7636397389695049,
"num_tokens": 505259.0,
"step": 160
},
{
"entropy": 2.1515943363308905,
"epoch": 0.3623767652544631,
"grad_norm": 4.192586421966553,
"learning_rate": 1.9908888612546085e-05,
"loss": 1.0462213516235352,
"mean_token_accuracy": 0.723000418767333,
"num_tokens": 545011.0,
"step": 170
},
{
"entropy": 2.183237124979496,
"epoch": 0.38369304556354916,
"grad_norm": 7.268803596496582,
"learning_rate": 1.9889381872944093e-05,
"loss": 1.0463459968566895,
"mean_token_accuracy": 0.7170630015432835,
"num_tokens": 575722.0,
"step": 180
},
{
"entropy": 2.251120628416538,
"epoch": 0.4050093258726352,
"grad_norm": 7.779407501220703,
"learning_rate": 1.9867995931778915e-05,
"loss": 1.1224423408508302,
"mean_token_accuracy": 0.7369851667433978,
"num_tokens": 606747.0,
"step": 190
},
{
"entropy": 2.1053356930613516,
"epoch": 0.4263256061817213,
"grad_norm": 5.202029228210449,
"learning_rate": 1.9844734852852988e-05,
"loss": 0.7484265327453613,
"mean_token_accuracy": 0.7559255946427583,
"num_tokens": 638567.0,
"step": 200
},
{
"epoch": 0.4263256061817213,
"eval_entropy": 2.152409736532718,
"eval_loss": 0.9078466296195984,
"eval_mean_token_accuracy": 0.7723528936039656,
"eval_num_tokens": 638567.0,
"eval_runtime": 25.1941,
"eval_samples_per_second": 20.322,
"eval_steps_per_second": 10.161,
"step": 200
},
{
"entropy": 2.229059624671936,
"epoch": 0.44764188649080733,
"grad_norm": 4.298992156982422,
"learning_rate": 1.981960305628643e-05,
"loss": 0.9050834655761719,
"mean_token_accuracy": 0.7835996920242906,
"num_tokens": 667695.0,
"step": 210
},
{
"entropy": 2.090072526037693,
"epoch": 0.46895816679989344,
"grad_norm": 3.323593854904175,
"learning_rate": 1.9792605317677153e-05,
"loss": 0.7545342922210694,
"mean_token_accuracy": 0.7571007736027241,
"num_tokens": 702195.0,
"step": 220
},
{
"entropy": 2.0942522257566454,
"epoch": 0.4902744471089795,
"grad_norm": 2.2974536418914795,
"learning_rate": 1.9763746767193385e-05,
"loss": 0.9541402816772461,
"mean_token_accuracy": 0.7272845700383186,
"num_tokens": 732846.0,
"step": 230
},
{
"entropy": 2.134460535645485,
"epoch": 0.5115907274180655,
"grad_norm": 4.181608200073242,
"learning_rate": 1.9733032888598802e-05,
"loss": 0.7861089706420898,
"mean_token_accuracy": 0.7417262677103281,
"num_tokens": 764477.0,
"step": 240
},
{
"entropy": 2.107550011575222,
"epoch": 0.5329070077271516,
"grad_norm": 3.211021661758423,
"learning_rate": 1.970046951821052e-05,
"loss": 0.7543912887573242,
"mean_token_accuracy": 0.748434409685433,
"num_tokens": 790900.0,
"step": 250
},
{
"entropy": 2.0784494683146475,
"epoch": 0.5542232880362377,
"grad_norm": 3.4665517807006836,
"learning_rate": 1.966606284379005e-05,
"loss": 0.8785683631896972,
"mean_token_accuracy": 0.7546398999169469,
"num_tokens": 821115.0,
"step": 260
},
{
"entropy": 2.0476069271564485,
"epoch": 0.5755395683453237,
"grad_norm": 3.741456985473633,
"learning_rate": 1.9629819403367493e-05,
"loss": 0.940821647644043,
"mean_token_accuracy": 0.7150841023772955,
"num_tokens": 852809.0,
"step": 270
},
{
"entropy": 2.0643599420785903,
"epoch": 0.5968558486544098,
"grad_norm": 8.063089370727539,
"learning_rate": 1.9591746083999166e-05,
"loss": 0.6063175678253174,
"mean_token_accuracy": 0.7969223730266094,
"num_tokens": 881864.0,
"step": 280
},
{
"entropy": 2.063040444254875,
"epoch": 0.6181721289634958,
"grad_norm": 2.7161366939544678,
"learning_rate": 1.9551850120458912e-05,
"loss": 0.9077709197998047,
"mean_token_accuracy": 0.768440979719162,
"num_tokens": 911305.0,
"step": 290
},
{
"entropy": 2.047479325532913,
"epoch": 0.6394884092725819,
"grad_norm": 2.315603256225586,
"learning_rate": 1.9510139093863324e-05,
"loss": 0.8123476028442382,
"mean_token_accuracy": 0.7939551591873169,
"num_tokens": 946457.0,
"step": 300
},
{
"epoch": 0.6394884092725819,
"eval_entropy": 2.0706750750541687,
"eval_loss": 0.9093313217163086,
"eval_mean_token_accuracy": 0.7773077270248905,
"eval_num_tokens": 946457.0,
"eval_runtime": 25.2221,
"eval_samples_per_second": 20.3,
"eval_steps_per_second": 10.15,
"step": 300
},
{
"entropy": 2.098699188232422,
"epoch": 0.660804689581668,
"grad_norm": 5.960000991821289,
"learning_rate": 1.946662093023118e-05,
"loss": 0.653551721572876,
"mean_token_accuracy": 0.7601731464266777,
"num_tokens": 975185.0,
"step": 310
},
{
"entropy": 2.055957815051079,
"epoch": 0.6821209698907541,
"grad_norm": 4.677475929260254,
"learning_rate": 1.94213038989773e-05,
"loss": 0.6271010875701905,
"mean_token_accuracy": 0.7835832599550485,
"num_tokens": 1013462.0,
"step": 320
},
{
"entropy": 2.0195901483297347,
"epoch": 0.7034372501998402,
"grad_norm": 7.502997398376465,
"learning_rate": 1.9374196611341212e-05,
"loss": 0.7580204010009766,
"mean_token_accuracy": 0.73177395388484,
"num_tokens": 1039374.0,
"step": 330
},
{
"entropy": 2.1021947026252747,
"epoch": 0.7247535305089262,
"grad_norm": 2.8251311779022217,
"learning_rate": 1.9325308018750783e-05,
"loss": 0.7280273914337159,
"mean_token_accuracy": 0.7582205191254616,
"num_tokens": 1070150.0,
"step": 340
},
{
"entropy": 2.0586804650723933,
"epoch": 0.7460698108180123,
"grad_norm": 3.429640531539917,
"learning_rate": 1.9274647411121283e-05,
"loss": 0.732785987854004,
"mean_token_accuracy": 0.7683163188397885,
"num_tokens": 1102723.0,
"step": 350
},
{
"entropy": 2.04990341514349,
"epoch": 0.7673860911270983,
"grad_norm": 7.419450759887695,
"learning_rate": 1.922222441509007e-05,
"loss": 0.7287397861480713,
"mean_token_accuracy": 0.7813404571264982,
"num_tokens": 1132601.0,
"step": 360
},
{
"entropy": 2.0948241263628007,
"epoch": 0.7887023714361844,
"grad_norm": 7.239919662475586,
"learning_rate": 1.916804899218734e-05,
"loss": 0.8115198135375976,
"mean_token_accuracy": 0.7400928113609553,
"num_tokens": 1162450.0,
"step": 370
},
{
"entropy": 2.035434368252754,
"epoch": 0.8100186517452704,
"grad_norm": 5.840376853942871,
"learning_rate": 1.9112131436943197e-05,
"loss": 1.0656434059143067,
"mean_token_accuracy": 0.7546941698528826,
"num_tokens": 1195541.0,
"step": 380
},
{
"entropy": 2.0758760675787924,
"epoch": 0.8313349320543565,
"grad_norm": 3.7342708110809326,
"learning_rate": 1.905448237493147e-05,
"loss": 0.9137516975402832,
"mean_token_accuracy": 0.7729586403816938,
"num_tokens": 1229474.0,
"step": 390
},
{
"entropy": 2.006519891321659,
"epoch": 0.8526512123634425,
"grad_norm": 3.760019063949585,
"learning_rate": 1.8995112760750617e-05,
"loss": 0.6922917366027832,
"mean_token_accuracy": 0.7573013998568058,
"num_tokens": 1254195.0,
"step": 400
},
{
"epoch": 0.8526512123634425,
"eval_entropy": 2.065651156939566,
"eval_loss": 0.8793772459030151,
"eval_mean_token_accuracy": 0.7864483034936711,
"eval_num_tokens": 1254195.0,
"eval_runtime": 25.2097,
"eval_samples_per_second": 20.31,
"eval_steps_per_second": 10.155,
"step": 400
},
{
"entropy": 1.966291381418705,
"epoch": 0.8739674926725286,
"grad_norm": 2.51716685295105,
"learning_rate": 1.8934033875942116e-05,
"loss": 0.6624742984771729,
"mean_token_accuracy": 0.7641348399221897,
"num_tokens": 1286799.0,
"step": 410
},
{
"entropy": 1.9988927505910397,
"epoch": 0.8952837729816147,
"grad_norm": 4.811957836151123,
"learning_rate": 1.8871257326846713e-05,
"loss": 0.7704909801483154,
"mean_token_accuracy": 0.7670131400227547,
"num_tokens": 1319439.0,
"step": 420
},
{
"entropy": 2.028906521201134,
"epoch": 0.9166000532907008,
"grad_norm": 3.0249269008636475,
"learning_rate": 1.8806795042398977e-05,
"loss": 0.8749347686767578,
"mean_token_accuracy": 0.7590735428035259,
"num_tokens": 1350004.0,
"step": 430
},
{
"entropy": 2.070059296488762,
"epoch": 0.9379163335997869,
"grad_norm": 3.1602978706359863,
"learning_rate": 1.8740659271860506e-05,
"loss": 0.8998587608337403,
"mean_token_accuracy": 0.7411337062716484,
"num_tokens": 1384114.0,
"step": 440
},
{
"entropy": 2.069587531685829,
"epoch": 0.9592326139088729,
"grad_norm": 6.083928108215332,
"learning_rate": 1.867286258249233e-05,
"loss": 0.7605265617370606,
"mean_token_accuracy": 0.7560267366468907,
"num_tokens": 1413930.0,
"step": 450
},
{
"entropy": 2.0192495703697206,
"epoch": 0.980548894217959,
"grad_norm": 6.181666851043701,
"learning_rate": 1.860341785716683e-05,
"loss": 0.867928409576416,
"mean_token_accuracy": 0.7474079862236976,
"num_tokens": 1449322.0,
"step": 460
},
{
"entropy": 2.029691263420941,
"epoch": 1.0,
"grad_norm": 4.97036600112915,
"learning_rate": 1.8532338291919727e-05,
"loss": 0.6732425212860107,
"mean_token_accuracy": 0.8109060656534482,
"num_tokens": 1476801.0,
"step": 470
},
{
"entropy": 2.0917655169963836,
"epoch": 1.021316280309086,
"grad_norm": 3.287158966064453,
"learning_rate": 1.845963739344252e-05,
"loss": 0.675209379196167,
"mean_token_accuracy": 0.813974260725081,
"num_tokens": 1509544.0,
"step": 480
},
{
"entropy": 2.0726554676890374,
"epoch": 1.042632560618172,
"grad_norm": 3.989821434020996,
"learning_rate": 1.838532897651593e-05,
"loss": 0.7701676368713379,
"mean_token_accuracy": 0.8190607488155365,
"num_tokens": 1541139.0,
"step": 490
},
{
"entropy": 1.9738347977399826,
"epoch": 1.0639488409272582,
"grad_norm": 2.9076340198516846,
"learning_rate": 1.8309427161384793e-05,
"loss": 0.7476935386657715,
"mean_token_accuracy": 0.7427890259772539,
"num_tokens": 1573047.0,
"step": 500
},
{
"epoch": 1.0639488409272582,
"eval_entropy": 1.9950207681395113,
"eval_loss": 0.8855671882629395,
"eval_mean_token_accuracy": 0.7921363326022401,
"eval_num_tokens": 1573047.0,
"eval_runtime": 25.3352,
"eval_samples_per_second": 20.209,
"eval_steps_per_second": 10.105,
"step": 500
},
{
"entropy": 1.9383097663521767,
"epoch": 1.0852651212363442,
"grad_norm": 3.2081310749053955,
"learning_rate": 1.8231946371074875e-05,
"loss": 0.6379514694213867,
"mean_token_accuracy": 0.7919592924416066,
"num_tokens": 1606929.0,
"step": 510
},
{
"entropy": 1.882134698331356,
"epoch": 1.1065814015454303,
"grad_norm": 3.630250930786133,
"learning_rate": 1.815290132865221e-05,
"loss": 0.690134859085083,
"mean_token_accuracy": 0.830422455444932,
"num_tokens": 1639202.0,
"step": 520
},
{
"entropy": 1.9214300945401193,
"epoch": 1.1278976818545163,
"grad_norm": 9.261590957641602,
"learning_rate": 1.8072307054425356e-05,
"loss": 0.9311601638793945,
"mean_token_accuracy": 0.7941673217341304,
"num_tokens": 1670654.0,
"step": 530
},
{
"entropy": 1.9036248601973056,
"epoch": 1.1492139621636024,
"grad_norm": 5.370859146118164,
"learning_rate": 1.799017886309124e-05,
"loss": 0.6138679504394531,
"mean_token_accuracy": 0.7961133386939764,
"num_tokens": 1700516.0,
"step": 540
},
{
"entropy": 1.9780284225940705,
"epoch": 1.1705302424726884,
"grad_norm": 4.6354660987854,
"learning_rate": 1.7906532360825003e-05,
"loss": 0.6264813899993896,
"mean_token_accuracy": 0.8231249656528234,
"num_tokens": 1733802.0,
"step": 550
},
{
"entropy": 1.9119783863425255,
"epoch": 1.1918465227817745,
"grad_norm": 5.686795711517334,
"learning_rate": 1.782138344231448e-05,
"loss": 0.5910276412963867,
"mean_token_accuracy": 0.7942916708067059,
"num_tokens": 1762524.0,
"step": 560
},
{
"entropy": 1.967802731692791,
"epoch": 1.2131628030908606,
"grad_norm": 3.1755685806274414,
"learning_rate": 1.7734748287739877e-05,
"loss": 0.4959968090057373,
"mean_token_accuracy": 0.7778273839503527,
"num_tokens": 1793060.0,
"step": 570
},
{
"entropy": 1.8761932864785194,
"epoch": 1.2344790833999468,
"grad_norm": 3.783674478530884,
"learning_rate": 1.7646643359699157e-05,
"loss": 0.7227077960968018,
"mean_token_accuracy": 0.7871355729177594,
"num_tokens": 1820274.0,
"step": 580
},
{
"entropy": 1.915278497338295,
"epoch": 1.2557953637090327,
"grad_norm": 5.4867119789123535,
"learning_rate": 1.7557085400079798e-05,
"loss": 0.6624124050140381,
"mean_token_accuracy": 0.8309637935832143,
"num_tokens": 1848818.0,
"step": 590
},
{
"entropy": 1.8896379426121712,
"epoch": 1.277111644018119,
"grad_norm": 3.290586471557617,
"learning_rate": 1.746609142687744e-05,
"loss": 0.6076981544494628,
"mean_token_accuracy": 0.8211023930460215,
"num_tokens": 1880413.0,
"step": 600
},
{
"epoch": 1.277111644018119,
"eval_entropy": 1.905547400470823,
"eval_loss": 0.9051699638366699,
"eval_mean_token_accuracy": 0.7929422339657322,
"eval_num_tokens": 1880413.0,
"eval_runtime": 25.1414,
"eval_samples_per_second": 20.365,
"eval_steps_per_second": 10.182,
"step": 600
},
{
"entropy": 1.803177796304226,
"epoch": 1.2984279243272048,
"grad_norm": 2.2047650814056396,
"learning_rate": 1.7373678730962128e-05,
"loss": 0.6381420612335205,
"mean_token_accuracy": 0.8127276424318552,
"num_tokens": 1913263.0,
"step": 610
},
{
"entropy": 1.8625598490238189,
"epoch": 1.319744204636291,
"grad_norm": 6.565426826477051,
"learning_rate": 1.7279864872792627e-05,
"loss": 0.5850165843963623,
"mean_token_accuracy": 0.8355351146310568,
"num_tokens": 1943248.0,
"step": 620
},
{
"entropy": 1.8649341762065887,
"epoch": 1.341060484945377,
"grad_norm": 1.9119219779968262,
"learning_rate": 1.7184667679079563e-05,
"loss": 0.6439106464385986,
"mean_token_accuracy": 0.7754333117976785,
"num_tokens": 1978455.0,
"step": 630
},
{
"entropy": 1.8297289326786994,
"epoch": 1.3623767652544632,
"grad_norm": 5.278177261352539,
"learning_rate": 1.708810523939795e-05,
"loss": 0.7910201072692871,
"mean_token_accuracy": 0.78203096203506,
"num_tokens": 2013189.0,
"step": 640
},
{
"entropy": 1.802287730574608,
"epoch": 1.3836930455635492,
"grad_norm": 10.827245712280273,
"learning_rate": 1.699019590274977e-05,
"loss": 0.730878210067749,
"mean_token_accuracy": 0.7671418067067861,
"num_tokens": 2045951.0,
"step": 650
},
{
"entropy": 1.942077250778675,
"epoch": 1.4050093258726353,
"grad_norm": 4.506467819213867,
"learning_rate": 1.689095827407726e-05,
"loss": 0.6298671722412109,
"mean_token_accuracy": 0.7961704637855291,
"num_tokens": 2075904.0,
"step": 660
},
{
"entropy": 1.8380796499550343,
"epoch": 1.4263256061817213,
"grad_norm": 6.3779683113098145,
"learning_rate": 1.679041121072755e-05,
"loss": 0.7520051956176758,
"mean_token_accuracy": 0.7579609978944063,
"num_tokens": 2112521.0,
"step": 670
},
{
"entropy": 1.9149467781186105,
"epoch": 1.4476418864908074,
"grad_norm": 8.926115989685059,
"learning_rate": 1.6688573818869367e-05,
"loss": 0.9066313743591309,
"mean_token_accuracy": 0.8224626399576664,
"num_tokens": 2148171.0,
"step": 680
},
{
"entropy": 1.9482211485505103,
"epoch": 1.4689581667998934,
"grad_norm": 10.81765365600586,
"learning_rate": 1.6585465449862424e-05,
"loss": 0.8869404792785645,
"mean_token_accuracy": 0.7676707118749618,
"num_tokens": 2179138.0,
"step": 690
},
{
"entropy": 1.956870225071907,
"epoch": 1.4902744471089795,
"grad_norm": 6.614859104156494,
"learning_rate": 1.6481105696580235e-05,
"loss": 0.610249376296997,
"mean_token_accuracy": 0.803439411893487,
"num_tokens": 2207861.0,
"step": 700
},
{
"epoch": 1.4902744471089795,
"eval_entropy": 1.9337850506417453,
"eval_loss": 0.8839167356491089,
"eval_mean_token_accuracy": 0.7920684967539273,
"eval_num_tokens": 2207861.0,
"eval_runtime": 25.2077,
"eval_samples_per_second": 20.311,
"eval_steps_per_second": 10.156,
"step": 700
},
{
"entropy": 1.9258531674742698,
"epoch": 1.5115907274180655,
"grad_norm": 6.887459754943848,
"learning_rate": 1.6375514389687053e-05,
"loss": 0.47269725799560547,
"mean_token_accuracy": 0.8237069369293749,
"num_tokens": 2241260.0,
"step": 710
},
{
"entropy": 1.8748144969344138,
"epoch": 1.5329070077271516,
"grad_norm": 6.9224090576171875,
"learning_rate": 1.626871159386957e-05,
"loss": 0.6628749370574951,
"mean_token_accuracy": 0.8672334033995867,
"num_tokens": 2268034.0,
"step": 720
},
{
"entropy": 1.927764856815338,
"epoch": 1.5542232880362377,
"grad_norm": 6.973414897918701,
"learning_rate": 1.6160717604024222e-05,
"loss": 0.688857889175415,
"mean_token_accuracy": 0.8388834275305271,
"num_tokens": 2298017.0,
"step": 730
},
{
"entropy": 1.8214979842305183,
"epoch": 1.5755395683453237,
"grad_norm": 5.830054759979248,
"learning_rate": 1.6051552941400684e-05,
"loss": 0.6109556674957275,
"mean_token_accuracy": 0.8256007127463818,
"num_tokens": 2327012.0,
"step": 740
},
{
"entropy": 1.8353620037436484,
"epoch": 1.5968558486544098,
"grad_norm": 9.805107116699219,
"learning_rate": 1.5941238349702377e-05,
"loss": 0.758075761795044,
"mean_token_accuracy": 0.7971353657543659,
"num_tokens": 2355566.0,
"step": 750
},
{
"entropy": 1.9207229495048523,
"epoch": 1.6181721289634958,
"grad_norm": 12.170331954956055,
"learning_rate": 1.5829794791144723e-05,
"loss": 0.47644672393798826,
"mean_token_accuracy": 0.8686064530164004,
"num_tokens": 2388668.0,
"step": 760
},
{
"entropy": 1.9532766610383987,
"epoch": 1.6394884092725819,
"grad_norm": 6.61758279800415,
"learning_rate": 1.5717243442471838e-05,
"loss": 0.6267609596252441,
"mean_token_accuracy": 0.8059493366628885,
"num_tokens": 2423851.0,
"step": 770
},
{
"entropy": 1.8787624850869178,
"epoch": 1.660804689581668,
"grad_norm": 5.785323619842529,
"learning_rate": 1.5603605690932505e-05,
"loss": 0.6736733436584472,
"mean_token_accuracy": 0.8093659289181232,
"num_tokens": 2453844.0,
"step": 780
},
{
"entropy": 1.8224774688482284,
"epoch": 1.6821209698907542,
"grad_norm": 3.5316760540008545,
"learning_rate": 1.54889031302161e-05,
"loss": 0.6565414428710937,
"mean_token_accuracy": 0.8169119991362095,
"num_tokens": 2484991.0,
"step": 790
},
{
"entropy": 1.906269972026348,
"epoch": 1.70343725019984,
"grad_norm": 2.6745364665985107,
"learning_rate": 1.5373157556349335e-05,
"loss": 0.6277201652526856,
"mean_token_accuracy": 0.8166821744292975,
"num_tokens": 2515290.0,
"step": 800
},
{
"epoch": 1.70343725019984,
"eval_entropy": 1.8975705276243389,
"eval_loss": 0.8847202658653259,
"eval_mean_token_accuracy": 0.7936569009325467,
"eval_num_tokens": 2515290.0,
"eval_runtime": 25.2245,
"eval_samples_per_second": 20.298,
"eval_steps_per_second": 10.149,
"step": 800
},
{
"entropy": 1.8205670893192292,
"epoch": 1.7247535305089263,
"grad_norm": 5.146493434906006,
"learning_rate": 1.5256390963554504e-05,
"loss": 0.6863347053527832,
"mean_token_accuracy": 0.7854361042380333,
"num_tokens": 2544139.0,
"step": 810
},
{
"entropy": 1.8612893477082253,
"epoch": 1.7460698108180122,
"grad_norm": 7.076154708862305,
"learning_rate": 1.5138625540070117e-05,
"loss": 0.7201765537261963,
"mean_token_accuracy": 0.7712966155260801,
"num_tokens": 2575559.0,
"step": 820
},
{
"entropy": 1.856431671977043,
"epoch": 1.7673860911270984,
"grad_norm": 3.1882359981536865,
"learning_rate": 1.501988366393464e-05,
"loss": 0.5714828968048096,
"mean_token_accuracy": 0.8167318470776082,
"num_tokens": 2605721.0,
"step": 830
},
{
"entropy": 1.876603300869465,
"epoch": 1.7887023714361843,
"grad_norm": 2.653169870376587,
"learning_rate": 1.4900187898734152e-05,
"loss": 0.5608267307281494,
"mean_token_accuracy": 0.8415903944522143,
"num_tokens": 2640832.0,
"step": 840
},
{
"entropy": 1.8057570911943912,
"epoch": 1.8100186517452705,
"grad_norm": 4.1108174324035645,
"learning_rate": 1.4779560989314798e-05,
"loss": 0.5947935581207275,
"mean_token_accuracy": 0.7923301249742508,
"num_tokens": 2675935.0,
"step": 850
},
{
"entropy": 1.831426490843296,
"epoch": 1.8313349320543564,
"grad_norm": 1.4520552158355713,
"learning_rate": 1.4658025857460732e-05,
"loss": 0.5294552326202393,
"mean_token_accuracy": 0.823292363807559,
"num_tokens": 2708774.0,
"step": 860
},
{
"entropy": 1.8851005636155604,
"epoch": 1.8526512123634427,
"grad_norm": 8.170310974121094,
"learning_rate": 1.4535605597538487e-05,
"loss": 0.7207472324371338,
"mean_token_accuracy": 0.801678966358304,
"num_tokens": 2736243.0,
"step": 870
},
{
"entropy": 1.8832394301891326,
"epoch": 1.8739674926725285,
"grad_norm": 12.349190711975098,
"learning_rate": 1.4412323472108525e-05,
"loss": 0.7749912738800049,
"mean_token_accuracy": 0.7753736047074199,
"num_tokens": 2763867.0,
"step": 880
},
{
"entropy": 1.900235815346241,
"epoch": 1.8952837729816148,
"grad_norm": 4.599183082580566,
"learning_rate": 1.4288202907504857e-05,
"loss": 0.47832794189453126,
"mean_token_accuracy": 0.8412384796887636,
"num_tokens": 2792070.0,
"step": 890
},
{
"entropy": 1.8908123061060906,
"epoch": 1.9166000532907008,
"grad_norm": 11.037459373474121,
"learning_rate": 1.4163267489383492e-05,
"loss": 0.600672721862793,
"mean_token_accuracy": 0.8004915975034237,
"num_tokens": 2823917.0,
"step": 900
},
{
"epoch": 1.9166000532907008,
"eval_entropy": 1.8657898297533393,
"eval_loss": 0.8825092911720276,
"eval_mean_token_accuracy": 0.7915659121936187,
"eval_num_tokens": 2823917.0,
"eval_runtime": 25.2256,
"eval_samples_per_second": 20.297,
"eval_steps_per_second": 10.148,
"step": 900
},
{
"entropy": 1.9238350823521615,
"epoch": 1.9379163335997869,
"grad_norm": 3.057535409927368,
"learning_rate": 1.4037540958240652e-05,
"loss": 0.8191390991210937,
"mean_token_accuracy": 0.7847225772216916,
"num_tokens": 2857949.0,
"step": 910
},
{
"entropy": 1.8374909654259681,
"epoch": 1.959232613908873,
"grad_norm": 5.428546905517578,
"learning_rate": 1.391104720490156e-05,
"loss": 0.6227903842926026,
"mean_token_accuracy": 0.8255210720002651,
"num_tokens": 2892934.0,
"step": 920
},
{
"entropy": 1.8489774838089943,
"epoch": 1.980548894217959,
"grad_norm": 4.659483432769775,
"learning_rate": 1.3783810265980643e-05,
"loss": 0.6746618270874023,
"mean_token_accuracy": 0.7706679496914148,
"num_tokens": 2922645.0,
"step": 930
},
{
"entropy": 1.82360654987701,
"epoch": 2.0,
"grad_norm": 0.5909605026245117,
"learning_rate": 1.365585431931405e-05,
"loss": 0.6041478157043457,
"mean_token_accuracy": 0.8070473491329037,
"num_tokens": 2953602.0,
"step": 940
},
{
"entropy": 1.8853100061416626,
"epoch": 2.0213162803090863,
"grad_norm": 4.752373695373535,
"learning_rate": 1.3527203679365318e-05,
"loss": 0.5585506916046142,
"mean_token_accuracy": 0.8603952780365944,
"num_tokens": 2985861.0,
"step": 950
},
{
"entropy": 1.6949048675596714,
"epoch": 2.042632560618172,
"grad_norm": 3.7082631587982178,
"learning_rate": 1.3397882792605097e-05,
"loss": 0.5226590156555175,
"mean_token_accuracy": 0.8422632806003094,
"num_tokens": 3019608.0,
"step": 960
},
{
"entropy": 1.7091815680265428,
"epoch": 2.0639488409272584,
"grad_norm": 6.324832916259766,
"learning_rate": 1.3267916232865777e-05,
"loss": 0.3531376123428345,
"mean_token_accuracy": 0.8930057939141989,
"num_tokens": 3055541.0,
"step": 970
},
{
"entropy": 1.6739458978176116,
"epoch": 2.085265121236344,
"grad_norm": 4.618046283721924,
"learning_rate": 1.3137328696671904e-05,
"loss": 0.576710557937622,
"mean_token_accuracy": 0.8848785009235144,
"num_tokens": 3084555.0,
"step": 980
},
{
"entropy": 1.7249003022909164,
"epoch": 2.1065814015454305,
"grad_norm": 5.561560153961182,
"learning_rate": 1.3006144998547314e-05,
"loss": 0.5280230045318604,
"mean_token_accuracy": 0.8864647958427667,
"num_tokens": 3112648.0,
"step": 990
},
{
"entropy": 1.7153487108647822,
"epoch": 2.1278976818545163,
"grad_norm": 3.626471996307373,
"learning_rate": 1.2874390066299797e-05,
"loss": 0.3527723550796509,
"mean_token_accuracy": 0.8574657022953034,
"num_tokens": 3144049.0,
"step": 1000
},
{
"epoch": 2.1278976818545163,
"eval_entropy": 1.6961151584982872,
"eval_loss": 0.9473029375076294,
"eval_mean_token_accuracy": 0.7928107368061319,
"eval_num_tokens": 3144049.0,
"eval_runtime": 25.2864,
"eval_samples_per_second": 20.248,
"eval_steps_per_second": 10.124,
"step": 1000
},
{
"entropy": 1.6851068414747714,
"epoch": 2.1492139621636026,
"grad_norm": 6.618740081787109,
"learning_rate": 1.2742088936284296e-05,
"loss": 0.47363767623901365,
"mean_token_accuracy": 0.8599901650100946,
"num_tokens": 3175723.0,
"step": 1010
},
{
"entropy": 1.665366891026497,
"epoch": 2.1705302424726884,
"grad_norm": 7.713161468505859,
"learning_rate": 1.2609266748645412e-05,
"loss": 0.37115654945373533,
"mean_token_accuracy": 0.8425170484930277,
"num_tokens": 3206132.0,
"step": 1020
},
{
"entropy": 1.7072678461670876,
"epoch": 2.1918465227817747,
"grad_norm": 4.482607841491699,
"learning_rate": 1.2475948742540234e-05,
"loss": 0.40703649520874025,
"mean_token_accuracy": 0.8795785024762154,
"num_tokens": 3235673.0,
"step": 1030
},
{
"entropy": 1.6835453681647778,
"epoch": 2.2131628030908606,
"grad_norm": 5.588048458099365,
"learning_rate": 1.2342160251342345e-05,
"loss": 0.4783912181854248,
"mean_token_accuracy": 0.8529447130858898,
"num_tokens": 3268390.0,
"step": 1040
},
{
"entropy": 1.6581077799201012,
"epoch": 2.234479083399947,
"grad_norm": 3.2018959522247314,
"learning_rate": 1.2207926697827917e-05,
"loss": 0.5440057754516602,
"mean_token_accuracy": 0.8609105728566646,
"num_tokens": 3295498.0,
"step": 1050
},
{
"entropy": 1.6508349932730197,
"epoch": 2.2557953637090327,
"grad_norm": 8.872872352600098,
"learning_rate": 1.2073273589344804e-05,
"loss": 0.4584911346435547,
"mean_token_accuracy": 0.8255412630736828,
"num_tokens": 3328122.0,
"step": 1060
},
{
"entropy": 1.7553797572851182,
"epoch": 2.277111644018119,
"grad_norm": 4.401421070098877,
"learning_rate": 1.1938226512965617e-05,
"loss": 0.48421125411987304,
"mean_token_accuracy": 0.867019722610712,
"num_tokens": 3358628.0,
"step": 1070
},
{
"entropy": 1.7421697050333023,
"epoch": 2.2984279243272048,
"grad_norm": 10.023664474487305,
"learning_rate": 1.1802811130625576e-05,
"loss": 0.4822258472442627,
"mean_token_accuracy": 0.868565783649683,
"num_tokens": 3391789.0,
"step": 1080
},
{
"entropy": 1.7094722345471383,
"epoch": 2.319744204636291,
"grad_norm": 8.404623031616211,
"learning_rate": 1.1667053174246194e-05,
"loss": 0.5049400329589844,
"mean_token_accuracy": 0.8638756167143583,
"num_tokens": 3421244.0,
"step": 1090
},
{
"entropy": 1.6783940196037292,
"epoch": 2.341060484945377,
"grad_norm": 7.203639030456543,
"learning_rate": 1.153097844084564e-05,
"loss": 0.49939761161804197,
"mean_token_accuracy": 0.8506023991852999,
"num_tokens": 3454311.0,
"step": 1100
},
{
"epoch": 2.341060484945377,
"eval_entropy": 1.7317818785086274,
"eval_loss": 0.9347745776176453,
"eval_mean_token_accuracy": 0.7876530985231511,
"eval_num_tokens": 3454311.0,
"eval_runtime": 25.1804,
"eval_samples_per_second": 20.333,
"eval_steps_per_second": 10.167,
"step": 1100
},
{
"entropy": 1.719636818766594,
"epoch": 2.362376765254463,
"grad_norm": 7.6285905838012695,
"learning_rate": 1.1394612787636726e-05,
"loss": 0.37557549476623536,
"mean_token_accuracy": 0.8724950306117535,
"num_tokens": 3488090.0,
"step": 1110
},
{
"entropy": 1.6512885347008706,
"epoch": 2.383693045563549,
"grad_norm": 3.9734034538269043,
"learning_rate": 1.1257982127113481e-05,
"loss": 0.2912411689758301,
"mean_token_accuracy": 0.8837580941617489,
"num_tokens": 3518189.0,
"step": 1120
},
{
"entropy": 1.662961296737194,
"epoch": 2.4050093258726353,
"grad_norm": 11.78700065612793,
"learning_rate": 1.1121112422127184e-05,
"loss": 0.6317928791046142,
"mean_token_accuracy": 0.8458453085273504,
"num_tokens": 3548885.0,
"step": 1130
},
{
"entropy": 1.6277989491820335,
"epoch": 2.426325606181721,
"grad_norm": 6.840092182159424,
"learning_rate": 1.098402968095286e-05,
"loss": 0.35914084911346433,
"mean_token_accuracy": 0.8892543137073516,
"num_tokens": 3581285.0,
"step": 1140
},
{
"entropy": 1.6398253336548805,
"epoch": 2.4476418864908074,
"grad_norm": 8.036883354187012,
"learning_rate": 1.0846759952347127e-05,
"loss": 0.5016361236572265,
"mean_token_accuracy": 0.8925760805606842,
"num_tokens": 3611916.0,
"step": 1150
},
{
"entropy": 1.6403828382492065,
"epoch": 2.4689581667998937,
"grad_norm": 5.119592189788818,
"learning_rate": 1.0709329320598352e-05,
"loss": 0.4121875762939453,
"mean_token_accuracy": 0.8585600268095732,
"num_tokens": 3641283.0,
"step": 1160
},
{
"entropy": 1.5923970475792886,
"epoch": 2.4902744471089795,
"grad_norm": 7.016224384307861,
"learning_rate": 1.0571763900570063e-05,
"loss": 0.37267417907714845,
"mean_token_accuracy": 0.9020616315305233,
"num_tokens": 3672571.0,
"step": 1170
},
{
"entropy": 1.602854534983635,
"epoch": 2.5115907274180653,
"grad_norm": 8.555669784545898,
"learning_rate": 1.0434089832738554e-05,
"loss": 0.4383026123046875,
"mean_token_accuracy": 0.8404763884842396,
"num_tokens": 3711555.0,
"step": 1180
},
{
"entropy": 1.5632836624979973,
"epoch": 2.5329070077271516,
"grad_norm": 11.179162979125977,
"learning_rate": 1.0296333278225599e-05,
"loss": 0.37712688446044923,
"mean_token_accuracy": 0.8969831667840481,
"num_tokens": 3740886.0,
"step": 1190
},
{
"entropy": 1.542743168771267,
"epoch": 2.554223288036238,
"grad_norm": 13.297327041625977,
"learning_rate": 1.0158520413827273e-05,
"loss": 0.34956722259521483,
"mean_token_accuracy": 0.8721455127000809,
"num_tokens": 3770488.0,
"step": 1200
},
{
"epoch": 2.554223288036238,
"eval_entropy": 1.569909728365019,
"eval_loss": 0.984853982925415,
"eval_mean_token_accuracy": 0.7946027047000825,
"eval_num_tokens": 3770488.0,
"eval_runtime": 25.2172,
"eval_samples_per_second": 20.304,
"eval_steps_per_second": 10.152,
"step": 1200
},
{
"entropy": 1.5610544055700302,
"epoch": 2.5755395683453237,
"grad_norm": 9.166057586669922,
"learning_rate": 1.002067742703977e-05,
"loss": 0.3869703531265259,
"mean_token_accuracy": 0.8965044122189283,
"num_tokens": 3800893.0,
"step": 1210
},
{
"entropy": 1.5860440082848073,
"epoch": 2.5968558486544095,
"grad_norm": 3.7810888290405273,
"learning_rate": 9.882830511083217e-06,
"loss": 0.6022892951965332,
"mean_token_accuracy": 0.8423100596293807,
"num_tokens": 3831478.0,
"step": 1220
},
{
"entropy": 1.5593753769993781,
"epoch": 2.618172128963496,
"grad_norm": 7.3957109451293945,
"learning_rate": 9.74500585992436e-06,
"loss": 0.5377386569976806,
"mean_token_accuracy": 0.8421918705105782,
"num_tokens": 3863456.0,
"step": 1230
},
{
"entropy": 1.6092627555131913,
"epoch": 2.639488409272582,
"grad_norm": 11.163238525390625,
"learning_rate": 9.607229663299139e-06,
"loss": 0.44234743118286135,
"mean_token_accuracy": 0.8910749081522227,
"num_tokens": 3898348.0,
"step": 1240
},
{
"entropy": 1.6111317679286004,
"epoch": 2.660804689581668,
"grad_norm": 9.182315826416016,
"learning_rate": 9.469528101736068e-06,
"loss": 0.48477892875671386,
"mean_token_accuracy": 0.8321116678416729,
"num_tokens": 3926316.0,
"step": 1250
},
{
"entropy": 1.5978579953312875,
"epoch": 2.682120969890754,
"grad_norm": 6.697749614715576,
"learning_rate": 9.331927341581342e-06,
"loss": 0.40438008308410645,
"mean_token_accuracy": 0.8784059301018715,
"num_tokens": 3954526.0,
"step": 1260
},
{
"entropy": 1.5626994654536248,
"epoch": 2.70343725019984,
"grad_norm": 6.133303642272949,
"learning_rate": 9.194453530026651e-06,
"loss": 0.47856831550598145,
"mean_token_accuracy": 0.8131281891837716,
"num_tokens": 3990136.0,
"step": 1270
},
{
"entropy": 1.610917054116726,
"epoch": 2.7247535305089263,
"grad_norm": 6.997807502746582,
"learning_rate": 9.057132790140656e-06,
"loss": 0.42852191925048827,
"mean_token_accuracy": 0.9010261096060276,
"num_tokens": 4021182.0,
"step": 1280
},
{
"entropy": 1.636612831056118,
"epoch": 2.746069810818012,
"grad_norm": 5.9889235496521,
"learning_rate": 8.919991215904985e-06,
"loss": 0.38060717582702636,
"mean_token_accuracy": 0.8902203716337681,
"num_tokens": 4056483.0,
"step": 1290
},
{
"entropy": 1.5953127652406693,
"epoch": 2.7673860911270984,
"grad_norm": 5.638936519622803,
"learning_rate": 8.783054867255852e-06,
"loss": 0.39396817684173585,
"mean_token_accuracy": 0.8820293191820383,
"num_tokens": 4086632.0,
"step": 1300
},
{
"epoch": 2.7673860911270984,
"eval_entropy": 1.6087646232917905,
"eval_loss": 0.9700126647949219,
"eval_mean_token_accuracy": 0.7921096142963506,
"eval_num_tokens": 4086632.0,
"eval_runtime": 25.2355,
"eval_samples_per_second": 20.289,
"eval_steps_per_second": 10.144,
"step": 1300
},
{
"entropy": 1.5998306781053544,
"epoch": 2.7887023714361843,
"grad_norm": 6.4997148513793945,
"learning_rate": 8.646349765132042e-06,
"loss": 0.3382676124572754,
"mean_token_accuracy": 0.8778775539249182,
"num_tokens": 4120102.0,
"step": 1310
},
{
"entropy": 1.5056429199874402,
"epoch": 2.8100186517452705,
"grad_norm": 8.328359603881836,
"learning_rate": 8.509901886530396e-06,
"loss": 0.47609686851501465,
"mean_token_accuracy": 0.8344728346914053,
"num_tokens": 4154142.0,
"step": 1320
},
{
"entropy": 1.5405534602701665,
"epoch": 2.8313349320543564,
"grad_norm": 7.813889980316162,
"learning_rate": 8.373737159569586e-06,
"loss": 0.495313835144043,
"mean_token_accuracy": 0.861658050864935,
"num_tokens": 4184216.0,
"step": 1330
},
{
"entropy": 1.592079722136259,
"epoch": 2.8526512123634427,
"grad_norm": 6.749233245849609,
"learning_rate": 8.237881458563188e-06,
"loss": 0.4460284233093262,
"mean_token_accuracy": 0.8668980307877063,
"num_tokens": 4213070.0,
"step": 1340
},
{
"entropy": 1.6304010152816772,
"epoch": 2.8739674926725285,
"grad_norm": 4.704800605773926,
"learning_rate": 8.102360599103022e-06,
"loss": 0.40764584541320803,
"mean_token_accuracy": 0.872374988719821,
"num_tokens": 4248720.0,
"step": 1350
},
{
"entropy": 1.645412190258503,
"epoch": 2.8952837729816148,
"grad_norm": 7.446371555328369,
"learning_rate": 7.967200333153583e-06,
"loss": 0.34721221923828127,
"mean_token_accuracy": 0.90929289534688,
"num_tokens": 4278355.0,
"step": 1360
},
{
"entropy": 1.5853713877499103,
"epoch": 2.9166000532907006,
"grad_norm": 8.756217002868652,
"learning_rate": 7.832426344158625e-06,
"loss": 0.5081141948699951,
"mean_token_accuracy": 0.8653258476406336,
"num_tokens": 4306965.0,
"step": 1370
},
{
"entropy": 1.607254397124052,
"epoch": 2.937916333599787,
"grad_norm": 9.918863296508789,
"learning_rate": 7.698064242160726e-06,
"loss": 0.5225647449493408,
"mean_token_accuracy": 0.8322745427489281,
"num_tokens": 4339529.0,
"step": 1380
},
{
"entropy": 1.646574142575264,
"epoch": 2.959232613908873,
"grad_norm": 5.501335144042969,
"learning_rate": 7.564139558934799e-06,
"loss": 0.40751066207885744,
"mean_token_accuracy": 0.8290361508727073,
"num_tokens": 4368311.0,
"step": 1390
},
{
"entropy": 1.610975767672062,
"epoch": 2.980548894217959,
"grad_norm": 6.7775750160217285,
"learning_rate": 7.430677743136523e-06,
"loss": 0.3802893400192261,
"mean_token_accuracy": 0.8421619407832622,
"num_tokens": 4398838.0,
"step": 1400
},
{
"epoch": 2.980548894217959,
"eval_entropy": 1.6564679476432502,
"eval_loss": 0.9532321691513062,
"eval_mean_token_accuracy": 0.7908860681927763,
"eval_num_tokens": 4398838.0,
"eval_runtime": 25.2927,
"eval_samples_per_second": 20.243,
"eval_steps_per_second": 10.121,
"step": 1400
},
{
"entropy": 1.6621201969172856,
"epoch": 3.0,
"grad_norm": 52.18832015991211,
"learning_rate": 7.297704155466499e-06,
"loss": 0.6414576053619385,
"mean_token_accuracy": 0.8645402229812047,
"num_tokens": 4430403.0,
"step": 1410
},
{
"entropy": 1.6340646058321,
"epoch": 3.0213162803090863,
"grad_norm": 5.4931254386901855,
"learning_rate": 7.165244063851177e-06,
"loss": 0.43079633712768556,
"mean_token_accuracy": 0.9154900871217251,
"num_tokens": 4462302.0,
"step": 1420
},
{
"entropy": 1.5907170630991458,
"epoch": 3.042632560618172,
"grad_norm": 2.4832773208618164,
"learning_rate": 7.033322638641396e-06,
"loss": 0.2773794174194336,
"mean_token_accuracy": 0.8983474470674991,
"num_tokens": 4490390.0,
"step": 1430
},
{
"entropy": 1.4824031606316566,
"epoch": 3.0639488409272584,
"grad_norm": 14.030230522155762,
"learning_rate": 6.901964947829427e-06,
"loss": 0.3276866674423218,
"mean_token_accuracy": 0.9273385688662529,
"num_tokens": 4523458.0,
"step": 1440
},
{
"entropy": 1.4728427067399026,
"epoch": 3.085265121236344,
"grad_norm": 6.50776481628418,
"learning_rate": 6.771195952285541e-06,
"loss": 0.34999635219573977,
"mean_token_accuracy": 0.8883909173309803,
"num_tokens": 4551511.0,
"step": 1450
},
{
"entropy": 1.5375451922416687,
"epoch": 3.1065814015454305,
"grad_norm": 3.3505122661590576,
"learning_rate": 6.641040501014856e-06,
"loss": 0.26920404434204104,
"mean_token_accuracy": 0.9332471784204245,
"num_tokens": 4580674.0,
"step": 1460
},
{
"entropy": 1.452385664731264,
"epoch": 3.1278976818545163,
"grad_norm": 6.152368068695068,
"learning_rate": 6.511523326435501e-06,
"loss": 0.2656646490097046,
"mean_token_accuracy": 0.9215638756752014,
"num_tokens": 4610859.0,
"step": 1470
},
{
"entropy": 1.4217439875006677,
"epoch": 3.1492139621636026,
"grad_norm": 8.59308910369873,
"learning_rate": 6.382669039678899e-06,
"loss": 0.24169042110443115,
"mean_token_accuracy": 0.9385403782129288,
"num_tokens": 4638835.0,
"step": 1480
},
{
"entropy": 1.4209895387291909,
"epoch": 3.1705302424726884,
"grad_norm": 7.641168594360352,
"learning_rate": 6.254502125913095e-06,
"loss": 0.22674014568328857,
"mean_token_accuracy": 0.911290580779314,
"num_tokens": 4674846.0,
"step": 1490
},
{
"entropy": 1.3677985310554504,
"epoch": 3.1918465227817747,
"grad_norm": 9.29020881652832,
"learning_rate": 6.127046939690056e-06,
"loss": 0.2984227895736694,
"mean_token_accuracy": 0.9373271211981773,
"num_tokens": 4705085.0,
"step": 1500
},
{
"epoch": 3.1918465227817747,
"eval_entropy": 1.444472799776122,
"eval_loss": 1.1713542938232422,
"eval_mean_token_accuracy": 0.7895977763691917,
"eval_num_tokens": 4705085.0,
"eval_runtime": 25.1995,
"eval_samples_per_second": 20.318,
"eval_steps_per_second": 10.159,
"step": 1500
},
{
"entropy": 1.4269857950508595,
"epoch": 3.2131628030908606,
"grad_norm": 11.469884872436523,
"learning_rate": 6.000327700317748e-06,
"loss": 0.2425680637359619,
"mean_token_accuracy": 0.9259982876479625,
"num_tokens": 4739190.0,
"step": 1510
},
{
"entropy": 1.4209635138511658,
"epoch": 3.234479083399947,
"grad_norm": 5.315972805023193,
"learning_rate": 5.87436848725794e-06,
"loss": 0.2542020082473755,
"mean_token_accuracy": 0.9073813389986753,
"num_tokens": 4772098.0,
"step": 1520
},
{
"entropy": 1.4560465589165688,
"epoch": 3.2557953637090327,
"grad_norm": 24.200057983398438,
"learning_rate": 5.7491932355505656e-06,
"loss": 0.30522403717041013,
"mean_token_accuracy": 0.9136910080909729,
"num_tokens": 4800090.0,
"step": 1530
},
{
"entropy": 1.4656708396971225,
"epoch": 3.277111644018119,
"grad_norm": 10.271306991577148,
"learning_rate": 5.624825731265543e-06,
"loss": 0.2127098798751831,
"mean_token_accuracy": 0.931862723827362,
"num_tokens": 4834524.0,
"step": 1540
},
{
"entropy": 1.4886308126151562,
"epoch": 3.2984279243272048,
"grad_norm": 12.6162691116333,
"learning_rate": 5.501289606982898e-06,
"loss": 0.2684090375900269,
"mean_token_accuracy": 0.9222205139696598,
"num_tokens": 4863468.0,
"step": 1550
},
{
"entropy": 1.387893059849739,
"epoch": 3.319744204636291,
"grad_norm": 9.085896492004395,
"learning_rate": 5.378608337302032e-06,
"loss": 0.2731961250305176,
"mean_token_accuracy": 0.9436910226941109,
"num_tokens": 4896467.0,
"step": 1560
},
{
"entropy": 1.4491034008562564,
"epoch": 3.341060484945377,
"grad_norm": 7.388673782348633,
"learning_rate": 5.256805234381055e-06,
"loss": 0.24700915813446045,
"mean_token_accuracy": 0.8964447133243084,
"num_tokens": 4925719.0,
"step": 1570
},
{
"entropy": 1.4569350488483905,
"epoch": 3.362376765254463,
"grad_norm": 7.207291126251221,
"learning_rate": 5.135903443506927e-06,
"loss": 0.3276431322097778,
"mean_token_accuracy": 0.8873641312122345,
"num_tokens": 4954162.0,
"step": 1580
},
{
"entropy": 1.4607440739870072,
"epoch": 3.383693045563549,
"grad_norm": 4.589608669281006,
"learning_rate": 5.015925938697377e-06,
"loss": 0.23540747165679932,
"mean_token_accuracy": 0.9337049081921578,
"num_tokens": 4988402.0,
"step": 1590
},
{
"entropy": 1.4307367473840713,
"epoch": 3.4050093258726353,
"grad_norm": 5.884532928466797,
"learning_rate": 4.896895518335306e-06,
"loss": 0.2338495969772339,
"mean_token_accuracy": 0.9359182961285114,
"num_tokens": 5022816.0,
"step": 1600
},
{
"epoch": 3.4050093258726353,
"eval_entropy": 1.4896407034248114,
"eval_loss": 1.1274768114089966,
"eval_mean_token_accuracy": 0.7863516705692746,
"eval_num_tokens": 5022816.0,
"eval_runtime": 25.2716,
"eval_samples_per_second": 20.26,
"eval_steps_per_second": 10.13,
"step": 1600
},
{
"entropy": 1.446070448309183,
"epoch": 3.426325606181721,
"grad_norm": 10.2098388671875,
"learning_rate": 4.778834800836591e-06,
"loss": 0.20406453609466552,
"mean_token_accuracy": 0.9318795662373305,
"num_tokens": 5052718.0,
"step": 1610
},
{
"entropy": 1.4429432988166808,
"epoch": 3.4476418864908074,
"grad_norm": 7.907771110534668,
"learning_rate": 4.661766220352098e-06,
"loss": 0.29486634731292727,
"mean_token_accuracy": 0.9161755211651326,
"num_tokens": 5084521.0,
"step": 1620
},
{
"entropy": 1.4223275877535344,
"epoch": 3.4689581667998937,
"grad_norm": 10.563481330871582,
"learning_rate": 4.545712022504679e-06,
"loss": 0.22321033477783203,
"mean_token_accuracy": 0.9142704658210278,
"num_tokens": 5115796.0,
"step": 1630
},
{
"entropy": 1.4276227876543999,
"epoch": 3.4902744471089795,
"grad_norm": 11.097084999084473,
"learning_rate": 4.430694260162032e-06,
"loss": 0.24617478847503663,
"mean_token_accuracy": 0.8925216607749462,
"num_tokens": 5150503.0,
"step": 1640
},
{
"entropy": 1.413447444140911,
"epoch": 3.5115907274180653,
"grad_norm": 5.738354206085205,
"learning_rate": 4.316734789246154e-06,
"loss": 0.1732957124710083,
"mean_token_accuracy": 0.9149338848888874,
"num_tokens": 5182439.0,
"step": 1650
},
{
"entropy": 1.4452892072498797,
"epoch": 3.5329070077271516,
"grad_norm": 15.468720436096191,
"learning_rate": 4.203855264580224e-06,
"loss": 0.2644877195358276,
"mean_token_accuracy": 0.914117070659995,
"num_tokens": 5216517.0,
"step": 1660
},
{
"entropy": 1.419405361264944,
"epoch": 3.554223288036238,
"grad_norm": 9.270110130310059,
"learning_rate": 4.092077135773731e-06,
"loss": 0.3064971685409546,
"mean_token_accuracy": 0.9066247828304768,
"num_tokens": 5248859.0,
"step": 1670
},
{
"entropy": 1.5174184702336788,
"epoch": 3.5755395683453237,
"grad_norm": 2.8754255771636963,
"learning_rate": 3.981421643146555e-06,
"loss": 0.21029229164123536,
"mean_token_accuracy": 0.9305562056601048,
"num_tokens": 5278300.0,
"step": 1680
},
{
"entropy": 1.388711978495121,
"epoch": 3.5968558486544095,
"grad_norm": 9.280269622802734,
"learning_rate": 3.8719098136928315e-06,
"loss": 0.2969250202178955,
"mean_token_accuracy": 0.9320756200700998,
"num_tokens": 5309092.0,
"step": 1690
},
{
"entropy": 1.455902987718582,
"epoch": 3.618172128963496,
"grad_norm": 5.556161403656006,
"learning_rate": 3.763562457085379e-06,
"loss": 0.2819516658782959,
"mean_token_accuracy": 0.9180143646895885,
"num_tokens": 5340126.0,
"step": 1700
},
{
"epoch": 3.618172128963496,
"eval_entropy": 1.4539805192034692,
"eval_loss": 1.1700488328933716,
"eval_mean_token_accuracy": 0.7862855003331788,
"eval_num_tokens": 5340126.0,
"eval_runtime": 25.2104,
"eval_samples_per_second": 20.309,
"eval_steps_per_second": 10.155,
"step": 1700
},
{
"entropy": 1.4361699119210243,
"epoch": 3.639488409272582,
"grad_norm": 20.25632095336914,
"learning_rate": 3.6564001617213827e-06,
"loss": 0.3046926498413086,
"mean_token_accuracy": 0.925341609120369,
"num_tokens": 5375346.0,
"step": 1710
},
{
"entropy": 1.4369515381753444,
"epoch": 3.660804689581668,
"grad_norm": 9.118430137634277,
"learning_rate": 3.5504432908101405e-06,
"loss": 0.3264621257781982,
"mean_token_accuracy": 0.8759976290166378,
"num_tokens": 5410878.0,
"step": 1720
},
{
"entropy": 1.4577076785266398,
"epoch": 3.682120969890754,
"grad_norm": 6.7929182052612305,
"learning_rate": 3.4457119785036173e-06,
"loss": 0.34423580169677737,
"mean_token_accuracy": 0.8818474646657706,
"num_tokens": 5438858.0,
"step": 1730
},
{
"entropy": 1.479407573491335,
"epoch": 3.70343725019984,
"grad_norm": 7.327031135559082,
"learning_rate": 3.342226126070506e-06,
"loss": 0.16338071823120118,
"mean_token_accuracy": 0.9366827972233296,
"num_tokens": 5470379.0,
"step": 1740
},
{
"entropy": 1.4941159047186374,
"epoch": 3.7247535305089263,
"grad_norm": 7.238304138183594,
"learning_rate": 3.2400053981145263e-06,
"loss": 0.22500226497650147,
"mean_token_accuracy": 0.9087515972554684,
"num_tokens": 5503410.0,
"step": 1750
},
{
"entropy": 1.4180281534790993,
"epoch": 3.746069810818012,
"grad_norm": 17.629175186157227,
"learning_rate": 3.139069218837745e-06,
"loss": 0.18224897384643554,
"mean_token_accuracy": 0.9434241332113743,
"num_tokens": 5537169.0,
"step": 1760
},
{
"entropy": 1.4403494112193584,
"epoch": 3.7673860911270984,
"grad_norm": 4.520951747894287,
"learning_rate": 3.0394367683495295e-06,
"loss": 0.3438844919204712,
"mean_token_accuracy": 0.9051133707165718,
"num_tokens": 5569219.0,
"step": 1770
},
{
"entropy": 1.4302593432366848,
"epoch": 3.7887023714361843,
"grad_norm": 14.042414665222168,
"learning_rate": 2.9411269790218965e-06,
"loss": 0.332825231552124,
"mean_token_accuracy": 0.9289621658623218,
"num_tokens": 5602198.0,
"step": 1780
},
{
"entropy": 1.4533981308341026,
"epoch": 3.8100186517452705,
"grad_norm": 7.9349260330200195,
"learning_rate": 2.844158531891966e-06,
"loss": 0.2003183603286743,
"mean_token_accuracy": 0.9049505375325679,
"num_tokens": 5629403.0,
"step": 1790
},
{
"entropy": 1.410759261995554,
"epoch": 3.8313349320543564,
"grad_norm": 5.083995819091797,
"learning_rate": 2.7485498531121204e-06,
"loss": 0.2712679147720337,
"mean_token_accuracy": 0.9239927411079407,
"num_tokens": 5659230.0,
"step": 1800
},
{
"epoch": 3.8313349320543564,
"eval_entropy": 1.4693333019968122,
"eval_loss": 1.1137001514434814,
"eval_mean_token_accuracy": 0.7850039067561738,
"eval_num_tokens": 5659230.0,
"eval_runtime": 25.4021,
"eval_samples_per_second": 20.156,
"eval_steps_per_second": 10.078,
"step": 1800
},
{
"entropy": 1.4003525048494339,
"epoch": 3.8526512123634427,
"grad_norm": 6.573414325714111,
"learning_rate": 2.654319110448651e-06,
"loss": 0.23307204246520996,
"mean_token_accuracy": 0.9070353828370571,
"num_tokens": 5689236.0,
"step": 1810
},
{
"entropy": 1.4843521788716316,
"epoch": 3.8739674926725285,
"grad_norm": 7.782621383666992,
"learning_rate": 2.5614842098294745e-06,
"loss": 0.3204060077667236,
"mean_token_accuracy": 0.9074679099023342,
"num_tokens": 5724536.0,
"step": 1820
},
{
"entropy": 1.4347909986972809,
"epoch": 3.8952837729816148,
"grad_norm": 5.542223930358887,
"learning_rate": 2.4700627919415966e-06,
"loss": 0.3621266603469849,
"mean_token_accuracy": 0.9036989733576775,
"num_tokens": 5754805.0,
"step": 1830
},
{
"entropy": 1.4112458311021328,
"epoch": 3.9166000532907006,
"grad_norm": 15.386390686035156,
"learning_rate": 2.380072228879012e-06,
"loss": 0.20611109733581542,
"mean_token_accuracy": 0.9141320556402206,
"num_tokens": 5785957.0,
"step": 1840
},
{
"entropy": 1.3910652115941047,
"epoch": 3.937916333599787,
"grad_norm": 4.969911575317383,
"learning_rate": 2.2915296208416038e-06,
"loss": 0.19969615936279297,
"mean_token_accuracy": 0.9188599303364754,
"num_tokens": 5817438.0,
"step": 1850
},
{
"entropy": 1.3991701498627662,
"epoch": 3.959232613908873,
"grad_norm": 14.075639724731445,
"learning_rate": 2.204451792885739e-06,
"loss": 0.2811038732528687,
"mean_token_accuracy": 0.9124676756560802,
"num_tokens": 5853028.0,
"step": 1860
},
{
"entropy": 1.4032354734838008,
"epoch": 3.980548894217959,
"grad_norm": 8.749677658081055,
"learning_rate": 2.118855291727131e-06,
"loss": 0.39807083606719973,
"mean_token_accuracy": 0.9114172287285328,
"num_tokens": 5879749.0,
"step": 1870
},
{
"entropy": 1.4793576941098252,
"epoch": 4.0,
"grad_norm": 0.40228429436683655,
"learning_rate": 2.03475638259659e-06,
"loss": 0.28619022369384767,
"mean_token_accuracy": 0.9326312027565421,
"num_tokens": 5907204.0,
"step": 1880
},
{
"entropy": 1.4576176889240742,
"epoch": 4.021316280309086,
"grad_norm": 3.4084649085998535,
"learning_rate": 1.952171046149286e-06,
"loss": 0.16383445262908936,
"mean_token_accuracy": 0.9292282827198506,
"num_tokens": 5937547.0,
"step": 1890
},
{
"entropy": 1.4545354157686234,
"epoch": 4.0426325606181726,
"grad_norm": 10.416617393493652,
"learning_rate": 1.871114975428049e-06,
"loss": 0.22887809276580812,
"mean_token_accuracy": 0.9353417418897152,
"num_tokens": 5964420.0,
"step": 1900
},
{
"epoch": 4.0426325606181726,
"eval_entropy": 1.4333079177886248,
"eval_loss": 1.1568964719772339,
"eval_mean_token_accuracy": 0.7843159851036035,
"eval_num_tokens": 5964420.0,
"eval_runtime": 25.1877,
"eval_samples_per_second": 20.327,
"eval_steps_per_second": 10.164,
"step": 1900
},
{
"entropy": 1.4628706477582454,
"epoch": 4.063948840927258,
"grad_norm": 2.5383825302124023,
"learning_rate": 1.7916035728813653e-06,
"loss": 0.10247511863708496,
"mean_token_accuracy": 0.9593492932617664,
"num_tokens": 5992125.0,
"step": 1910
},
{
"entropy": 1.3804713360965253,
"epoch": 4.085265121236344,
"grad_norm": 5.305675983428955,
"learning_rate": 1.7136519474365475e-06,
"loss": 0.24265851974487304,
"mean_token_accuracy": 0.9445340454578399,
"num_tokens": 6017516.0,
"step": 1920
},
{
"entropy": 1.3891515977680684,
"epoch": 4.10658140154543,
"grad_norm": 7.991399765014648,
"learning_rate": 1.637274911628729e-06,
"loss": 0.17978017330169677,
"mean_token_accuracy": 0.93779431656003,
"num_tokens": 6046058.0,
"step": 1930
},
{
"entropy": 1.3703414618968963,
"epoch": 4.127897681854517,
"grad_norm": 2.306601047515869,
"learning_rate": 1.5624869787861385e-06,
"loss": 0.1866108775138855,
"mean_token_accuracy": 0.9406570665538311,
"num_tokens": 6078166.0,
"step": 1940
},
{
"entropy": 1.3552788123488426,
"epoch": 4.149213962163603,
"grad_norm": 10.646674156188965,
"learning_rate": 1.4893023602722412e-06,
"loss": 0.17565094232559203,
"mean_token_accuracy": 0.9670388154685498,
"num_tokens": 6110728.0,
"step": 1950
},
{
"entropy": 1.361258938163519,
"epoch": 4.170530242472688,
"grad_norm": 2.1465964317321777,
"learning_rate": 1.4177349627852855e-06,
"loss": 0.08721579909324646,
"mean_token_accuracy": 0.9694276623427868,
"num_tokens": 6146320.0,
"step": 1960
},
{
"entropy": 1.292334294319153,
"epoch": 4.191846522781774,
"grad_norm": 5.472266674041748,
"learning_rate": 1.3477983857156996e-06,
"loss": 0.12929170131683348,
"mean_token_accuracy": 0.9474783554673195,
"num_tokens": 6175327.0,
"step": 1970
},
{
"entropy": 1.403335941582918,
"epoch": 4.213162803090861,
"grad_norm": 15.660310745239258,
"learning_rate": 1.279505918561923e-06,
"loss": 0.25771000385284426,
"mean_token_accuracy": 0.9202743619680405,
"num_tokens": 6210554.0,
"step": 1980
},
{
"entropy": 1.3927375204861163,
"epoch": 4.234479083399947,
"grad_norm": 9.373515129089355,
"learning_rate": 1.2128705384051032e-06,
"loss": 0.2001044273376465,
"mean_token_accuracy": 0.9633757442235946,
"num_tokens": 6244706.0,
"step": 1990
},
{
"entropy": 1.3265936575829982,
"epoch": 4.255795363709033,
"grad_norm": 3.4762251377105713,
"learning_rate": 1.1479049074431526e-06,
"loss": 0.20537242889404297,
"mean_token_accuracy": 0.9328463308513164,
"num_tokens": 6278954.0,
"step": 2000
},
{
"epoch": 4.255795363709033,
"eval_entropy": 1.369972410146147,
"eval_loss": 1.2773594856262207,
"eval_mean_token_accuracy": 0.7810963835800067,
"eval_num_tokens": 6278954.0,
"eval_runtime": 25.2242,
"eval_samples_per_second": 20.298,
"eval_steps_per_second": 10.149,
"step": 2000
},
{
"entropy": 1.3605533331632613,
"epoch": 4.2771116440181185,
"grad_norm": 9.257750511169434,
"learning_rate": 1.0846213705846664e-06,
"loss": 0.19485853910446166,
"mean_token_accuracy": 0.9474734902381897,
"num_tokens": 6309202.0,
"step": 2010
},
{
"entropy": 1.3613811306655408,
"epoch": 4.298427924327205,
"grad_norm": 4.7302422523498535,
"learning_rate": 1.0230319531031042e-06,
"loss": 0.1681363582611084,
"mean_token_accuracy": 0.9616480603814125,
"num_tokens": 6343103.0,
"step": 2020
},
{
"entropy": 1.3343191578984261,
"epoch": 4.319744204636291,
"grad_norm": 9.000184059143066,
"learning_rate": 9.631483583517288e-07,
"loss": 0.17980358600616456,
"mean_token_accuracy": 0.9588635042309761,
"num_tokens": 6375041.0,
"step": 2030
},
{
"entropy": 1.325505518168211,
"epoch": 4.341060484945377,
"grad_norm": 0.36019816994667053,
"learning_rate": 9.049819655397108e-07,
"loss": 0.15309940576553344,
"mean_token_accuracy": 0.9582446455955506,
"num_tokens": 6407611.0,
"step": 2040
},
{
"entropy": 1.3149354815483094,
"epoch": 4.362376765254463,
"grad_norm": 8.396425247192383,
"learning_rate": 8.485438275698154e-07,
"loss": 0.12012659311294556,
"mean_token_accuracy": 0.9287039190530777,
"num_tokens": 6439014.0,
"step": 2050
},
{
"entropy": 1.3025728821754456,
"epoch": 4.383693045563549,
"grad_norm": 13.925297737121582,
"learning_rate": 7.938446689381229e-07,
"loss": 0.16408991813659668,
"mean_token_accuracy": 0.9388780653476715,
"num_tokens": 6471556.0,
"step": 2060
},
{
"entropy": 1.276213175058365,
"epoch": 4.405009325872635,
"grad_norm": 3.2025303840637207,
"learning_rate": 7.408948836961216e-07,
"loss": 0.1705629587173462,
"mean_token_accuracy": 0.9424380153417588,
"num_tokens": 6504282.0,
"step": 2070
},
{
"entropy": 1.3470777593553067,
"epoch": 4.426325606181721,
"grad_norm": 4.128990650177002,
"learning_rate": 6.897045334756191e-07,
"loss": 0.1434122920036316,
"mean_token_accuracy": 0.9367260579019785,
"num_tokens": 6533310.0,
"step": 2080
},
{
"entropy": 1.3858976893126964,
"epoch": 4.447641886490807,
"grad_norm": 3.0865390300750732,
"learning_rate": 6.402833455768054e-07,
"loss": 0.17338463068008422,
"mean_token_accuracy": 0.9535353198647499,
"num_tokens": 6561833.0,
"step": 2090
},
{
"entropy": 1.3846996150910855,
"epoch": 4.468958166799894,
"grad_norm": 14.10164737701416,
"learning_rate": 5.926407111198451e-07,
"loss": 0.24046428203582765,
"mean_token_accuracy": 0.9303554680198431,
"num_tokens": 6592283.0,
"step": 2100
},
{
"epoch": 4.468958166799894,
"eval_entropy": 1.355904731201008,
"eval_loss": 1.3142094612121582,
"eval_mean_token_accuracy": 0.7773873422993347,
"eval_num_tokens": 6592283.0,
"eval_runtime": 25.1866,
"eval_samples_per_second": 20.328,
"eval_steps_per_second": 10.164,
"step": 2100
},
{
"entropy": 1.3094307713210582,
"epoch": 4.4902744471089795,
"grad_norm": 9.617660522460938,
"learning_rate": 5.467856832603669e-07,
"loss": 0.17363038063049316,
"mean_token_accuracy": 0.9140197165310383,
"num_tokens": 6624745.0,
"step": 2110
},
{
"entropy": 1.372648873925209,
"epoch": 4.511590727418065,
"grad_norm": 11.372284889221191,
"learning_rate": 5.027269754691544e-07,
"loss": 0.18337360620498658,
"mean_token_accuracy": 0.9457527458667755,
"num_tokens": 6657590.0,
"step": 2120
},
{
"entropy": 1.2979931004345417,
"epoch": 4.532907007727152,
"grad_norm": 7.741551876068115,
"learning_rate": 4.604729598764024e-07,
"loss": 0.22370004653930664,
"mean_token_accuracy": 0.9535742335021495,
"num_tokens": 6693274.0,
"step": 2130
},
{
"entropy": 1.2493705317378043,
"epoch": 4.554223288036238,
"grad_norm": 5.593754768371582,
"learning_rate": 4.200316656808134e-07,
"loss": 0.19300585985183716,
"mean_token_accuracy": 0.9324206352233887,
"num_tokens": 6724368.0,
"step": 2140
},
{
"entropy": 1.3586355127394198,
"epoch": 4.575539568345324,
"grad_norm": 6.431520462036133,
"learning_rate": 3.8141077762388846e-07,
"loss": 0.2666941165924072,
"mean_token_accuracy": 0.947481868416071,
"num_tokens": 6755479.0,
"step": 2150
},
{
"entropy": 1.3126740761101245,
"epoch": 4.5968558486544095,
"grad_norm": 2.596592664718628,
"learning_rate": 3.446176345296459e-07,
"loss": 0.2076418399810791,
"mean_token_accuracy": 0.948704682290554,
"num_tokens": 6793756.0,
"step": 2160
},
{
"entropy": 1.3612797297537327,
"epoch": 4.618172128963495,
"grad_norm": 11.598284721374512,
"learning_rate": 3.0965922791008183e-07,
"loss": 0.20219831466674804,
"mean_token_accuracy": 0.9383927457034588,
"num_tokens": 6823256.0,
"step": 2170
},
{
"entropy": 1.310491831600666,
"epoch": 4.639488409272582,
"grad_norm": 0.6937721371650696,
"learning_rate": 2.765422006366336e-07,
"loss": 0.1360365629196167,
"mean_token_accuracy": 0.9622993104159832,
"num_tokens": 6852587.0,
"step": 2180
},
{
"entropy": 1.3515724152326585,
"epoch": 4.660804689581668,
"grad_norm": 5.8835954666137695,
"learning_rate": 2.452728456778819e-07,
"loss": 0.18895021677017212,
"mean_token_accuracy": 0.9227117404341698,
"num_tokens": 6879919.0,
"step": 2190
},
{
"entropy": 1.319688442349434,
"epoch": 4.682120969890754,
"grad_norm": 10.677730560302734,
"learning_rate": 2.1585710490375168e-07,
"loss": 0.2697124719619751,
"mean_token_accuracy": 0.9373554818332195,
"num_tokens": 6912648.0,
"step": 2200
},
{
"epoch": 4.682120969890754,
"eval_entropy": 1.356080744881183,
"eval_loss": 1.3120059967041016,
"eval_mean_token_accuracy": 0.7787370060686953,
"eval_num_tokens": 6912648.0,
"eval_runtime": 25.2146,
"eval_samples_per_second": 20.306,
"eval_steps_per_second": 10.153,
"step": 2200
},
{
"entropy": 1.2888402037322522,
"epoch": 4.7034372501998405,
"grad_norm": 4.392502307891846,
"learning_rate": 1.8830056795642315e-07,
"loss": 0.17859218120574952,
"mean_token_accuracy": 0.9356974855065345,
"num_tokens": 6943210.0,
"step": 2210
},
{
"entropy": 1.306819212436676,
"epoch": 4.724753530508926,
"grad_norm": 9.902172088623047,
"learning_rate": 1.626084711881726e-07,
"loss": 0.12197283506393433,
"mean_token_accuracy": 0.9637115865945816,
"num_tokens": 6972906.0,
"step": 2220
},
{
"entropy": 1.3649342678487302,
"epoch": 4.746069810818012,
"grad_norm": 6.050726413726807,
"learning_rate": 1.3878569666635922e-07,
"loss": 0.13252955675125122,
"mean_token_accuracy": 0.9423332914710045,
"num_tokens": 7006735.0,
"step": 2230
},
{
"entropy": 1.344475695490837,
"epoch": 4.767386091127098,
"grad_norm": 20.14447784423828,
"learning_rate": 1.168367712457108e-07,
"loss": 0.2347338914871216,
"mean_token_accuracy": 0.9231791608035564,
"num_tokens": 7036174.0,
"step": 2240
},
{
"entropy": 1.313488345593214,
"epoch": 4.788702371436185,
"grad_norm": 5.92142915725708,
"learning_rate": 9.676586570813385e-08,
"loss": 0.18055379390716553,
"mean_token_accuracy": 0.9538333244621754,
"num_tokens": 7069122.0,
"step": 2250
},
{
"entropy": 1.3362836241722107,
"epoch": 4.8100186517452705,
"grad_norm": 5.3233513832092285,
"learning_rate": 7.857679397016316e-08,
"loss": 0.2382068157196045,
"mean_token_accuracy": 0.9316875658929348,
"num_tokens": 7098388.0,
"step": 2260
},
{
"entropy": 1.320764410495758,
"epoch": 4.831334932054356,
"grad_norm": 6.75054931640625,
"learning_rate": 6.227301235824046e-08,
"loss": 0.29803290367126467,
"mean_token_accuracy": 0.9219658993184566,
"num_tokens": 7127279.0,
"step": 2270
},
{
"entropy": 1.3429523721337318,
"epoch": 4.852651212363442,
"grad_norm": 6.420995235443115,
"learning_rate": 4.7857618951929754e-08,
"loss": 0.18056874275207518,
"mean_token_accuracy": 0.9634992338716983,
"num_tokens": 7161317.0,
"step": 2280
},
{
"entropy": 1.2852252803742885,
"epoch": 4.873967492672529,
"grad_norm": 8.42899227142334,
"learning_rate": 3.533335299521823e-08,
"loss": 0.16432349681854247,
"mean_token_accuracy": 0.9391075037419796,
"num_tokens": 7193312.0,
"step": 2290
},
{
"entropy": 1.2744086734950542,
"epoch": 4.895283772981615,
"grad_norm": 12.795449256896973,
"learning_rate": 2.470259437599487e-08,
"loss": 0.17056713104248047,
"mean_token_accuracy": 0.9438464976847172,
"num_tokens": 7225752.0,
"step": 2300
},
{
"epoch": 4.895283772981615,
"eval_entropy": 1.3555747161153704,
"eval_loss": 1.3144317865371704,
"eval_mean_token_accuracy": 0.779438130906783,
"eval_num_tokens": 7225752.0,
"eval_runtime": 25.339,
"eval_samples_per_second": 20.206,
"eval_steps_per_second": 10.103,
"step": 2300
},
{
"entropy": 1.3686442136764527,
"epoch": 4.916600053290701,
"grad_norm": 3.3401401042938232,
"learning_rate": 1.5967363173823304e-08,
"loss": 0.12192281484603881,
"mean_token_accuracy": 0.9248238526284694,
"num_tokens": 7261343.0,
"step": 2310
},
{
"entropy": 1.3582661159336566,
"epoch": 4.937916333599787,
"grad_norm": 8.621865272521973,
"learning_rate": 9.129319276081073e-09,
"loss": 0.2683550357818604,
"mean_token_accuracy": 0.9585993848741055,
"num_tokens": 7296635.0,
"step": 2320
},
{
"entropy": 1.31158257573843,
"epoch": 4.959232613908873,
"grad_norm": 15.862990379333496,
"learning_rate": 4.189762062540847e-09,
"loss": 0.3723548173904419,
"mean_token_accuracy": 0.9173178903758525,
"num_tokens": 7332271.0,
"step": 2330
},
{
"entropy": 1.2785717263817786,
"epoch": 4.980548894217959,
"grad_norm": 9.872111320495605,
"learning_rate": 1.1496301584634772e-09,
"loss": 0.10508073568344116,
"mean_token_accuracy": 0.9446402385830879,
"num_tokens": 7362022.0,
"step": 2340
},
{
"entropy": 1.3751475908984876,
"epoch": 5.0,
"grad_norm": 1.7823141813278198,
"learning_rate": 9.501256236221778e-12,
"loss": 0.1756437063217163,
"mean_token_accuracy": 0.931066878854412,
"num_tokens": 7384005.0,
"step": 2350
},
{
"epoch": 5.0,
"eval_entropy": 1.3568143870215863,
"eval_loss": 1.3119933605194092,
"eval_mean_token_accuracy": 0.7803392773494124,
"eval_num_tokens": 7384005.0,
"eval_runtime": 25.1433,
"eval_samples_per_second": 20.363,
"eval_steps_per_second": 10.182,
"step": 2350
},
{
"epoch": 5.0,
"step": 2350,
"total_flos": 3.337527236651827e+17,
"train_loss": 0.5025193223293791,
"train_runtime": 4555.1644,
"train_samples_per_second": 4.12,
"train_steps_per_second": 0.516
}
],
"logging_steps": 10,
"max_steps": 2350,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 3.337527236651827e+17,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}