Jongbin-kr's picture
End of training: best validation-loss checkpoint
8820482 verified
Raw
History Blame Contribute Delete
63.3 kB
{
"best_global_step": 100,
"best_metric": 0.9651781320571899,
"best_model_checkpoint": "/data6/jongbinwon/evolving_MoE/checkpoints/sft_llama31_8b_sni_domain-c_58325_ffn_only_5ep/checkpoint-100",
"epoch": 5.0,
"eval_steps": 100,
"global_step": 1850,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 1.723238617181778,
"epoch": 0.027091093802912292,
"grad_norm": 7.612579345703125,
"learning_rate": 3.2142857142857147e-06,
"loss": 2.066279411315918,
"mean_token_accuracy": 0.448427795805037,
"num_tokens": 21087.0,
"step": 10
},
{
"entropy": 1.7370752662420272,
"epoch": 0.054182187605824585,
"grad_norm": 7.184020519256592,
"learning_rate": 6.785714285714287e-06,
"loss": 2.6899890899658203,
"mean_token_accuracy": 0.42496111439540984,
"num_tokens": 41335.0,
"step": 20
},
{
"entropy": 1.843221677839756,
"epoch": 0.08127328140873688,
"grad_norm": 6.231059551239014,
"learning_rate": 1.0357142857142859e-05,
"loss": 2.398647117614746,
"mean_token_accuracy": 0.5065225204452872,
"num_tokens": 61686.0,
"step": 30
},
{
"entropy": 1.9891791179776193,
"epoch": 0.10836437521164917,
"grad_norm": 4.975241184234619,
"learning_rate": 1.3928571428571429e-05,
"loss": 2.2226634979248048,
"mean_token_accuracy": 0.6003633574582636,
"num_tokens": 81480.0,
"step": 40
},
{
"entropy": 2.2568055972456933,
"epoch": 0.13545546901456146,
"grad_norm": 1.7063878774642944,
"learning_rate": 1.7500000000000002e-05,
"loss": 2.1289892196655273,
"mean_token_accuracy": 0.6060962343588472,
"num_tokens": 102256.0,
"step": 50
},
{
"entropy": 2.282596044242382,
"epoch": 0.16254656281747376,
"grad_norm": 4.551100254058838,
"learning_rate": 1.9999862004036567e-05,
"loss": 1.528597068786621,
"mean_token_accuracy": 0.6501126736402512,
"num_tokens": 120836.0,
"step": 60
},
{
"entropy": 2.3089130371809006,
"epoch": 0.18963765662038604,
"grad_norm": 4.84531307220459,
"learning_rate": 1.9997408848413494e-05,
"loss": 1.4672578811645507,
"mean_token_accuracy": 0.6635637952014803,
"num_tokens": 142008.0,
"step": 70
},
{
"entropy": 2.4036191523075106,
"epoch": 0.21672875042329834,
"grad_norm": 4.140300750732422,
"learning_rate": 1.9991889981715696e-05,
"loss": 1.7146993637084962,
"mean_token_accuracy": 0.6447907727211714,
"num_tokens": 162908.0,
"step": 80
},
{
"entropy": 2.402925634384155,
"epoch": 0.24381984422621064,
"grad_norm": 3.240445613861084,
"learning_rate": 1.9983307096306773e-05,
"loss": 1.5633929252624512,
"mean_token_accuracy": 0.6392208762466908,
"num_tokens": 183267.0,
"step": 90
},
{
"entropy": 2.254238374531269,
"epoch": 0.2709109380291229,
"grad_norm": 2.4666740894317627,
"learning_rate": 1.997166282413338e-05,
"loss": 1.3440716743469239,
"mean_token_accuracy": 0.66012231297791,
"num_tokens": 203918.0,
"step": 100
},
{
"epoch": 0.2709109380291229,
"eval_entropy": 2.094589021988213,
"eval_loss": 0.9651781320571899,
"eval_mean_token_accuracy": 0.764254976878874,
"eval_num_tokens": 203918.0,
"eval_runtime": 25.5717,
"eval_samples_per_second": 20.022,
"eval_steps_per_second": 10.011,
"step": 100
},
{
"entropy": 2.216274145245552,
"epoch": 0.2980020318320352,
"grad_norm": 3.9435603618621826,
"learning_rate": 1.995696073591817e-05,
"loss": 1.493989849090576,
"mean_token_accuracy": 0.6519980503246188,
"num_tokens": 222513.0,
"step": 110
},
{
"entropy": 2.2828305318951605,
"epoch": 0.3250931256349475,
"grad_norm": 3.6630003452301025,
"learning_rate": 1.9939205340064793e-05,
"loss": 1.638005256652832,
"mean_token_accuracy": 0.6362768037244677,
"num_tokens": 240852.0,
"step": 120
},
{
"entropy": 2.2786295488476753,
"epoch": 0.3521842194378598,
"grad_norm": 4.0613274574279785,
"learning_rate": 1.991840208127543e-05,
"loss": 1.3484866142272949,
"mean_token_accuracy": 0.708053832501173,
"num_tokens": 260786.0,
"step": 130
},
{
"entropy": 2.239742587506771,
"epoch": 0.37927531324077207,
"grad_norm": 3.4148905277252197,
"learning_rate": 1.989455733888115e-05,
"loss": 1.4180074691772462,
"mean_token_accuracy": 0.6825597375631333,
"num_tokens": 280647.0,
"step": 140
},
{
"entropy": 2.224020117521286,
"epoch": 0.4063664070436844,
"grad_norm": 4.721391677856445,
"learning_rate": 1.986767842488569e-05,
"loss": 1.2252963066101075,
"mean_token_accuracy": 0.6958539757877589,
"num_tokens": 301192.0,
"step": 150
},
{
"entropy": 2.1590186595916747,
"epoch": 0.4334575008465967,
"grad_norm": 3.9556772708892822,
"learning_rate": 1.9837773581723215e-05,
"loss": 1.5099032402038575,
"mean_token_accuracy": 0.6419584900140762,
"num_tokens": 321679.0,
"step": 160
},
{
"entropy": 2.2231348380446434,
"epoch": 0.460548594649509,
"grad_norm": 3.490177869796753,
"learning_rate": 1.980485197973079e-05,
"loss": 1.6476173400878906,
"mean_token_accuracy": 0.6805331652984024,
"num_tokens": 342221.0,
"step": 170
},
{
"entropy": 2.24891133159399,
"epoch": 0.4876396884524213,
"grad_norm": 4.099713325500488,
"learning_rate": 1.9768923714336274e-05,
"loss": 1.315092182159424,
"mean_token_accuracy": 0.6847983291372657,
"num_tokens": 362847.0,
"step": 180
},
{
"entropy": 2.1428863570094108,
"epoch": 0.5147307822553335,
"grad_norm": 3.966991901397705,
"learning_rate": 1.9729999802962555e-05,
"loss": 1.2681650161743163,
"mean_token_accuracy": 0.7244645357131958,
"num_tokens": 384086.0,
"step": 190
},
{
"entropy": 2.2040064856410027,
"epoch": 0.5418218760582458,
"grad_norm": 3.2430970668792725,
"learning_rate": 1.9688092181649065e-05,
"loss": 1.3249666213989257,
"mean_token_accuracy": 0.722496079467237,
"num_tokens": 404677.0,
"step": 200
},
{
"epoch": 0.5418218760582458,
"eval_entropy": 2.0920665017329156,
"eval_loss": 0.9940700531005859,
"eval_mean_token_accuracy": 0.757662381103728,
"eval_num_tokens": 404677.0,
"eval_runtime": 25.5435,
"eval_samples_per_second": 20.044,
"eval_steps_per_second": 10.022,
"step": 200
},
{
"entropy": 2.156522032618523,
"epoch": 0.5689129698611581,
"grad_norm": 4.980217933654785,
"learning_rate": 1.964321370139157e-05,
"loss": 1.298858070373535,
"mean_token_accuracy": 0.7201794616878032,
"num_tokens": 426644.0,
"step": 210
},
{
"entropy": 2.1643049642443657,
"epoch": 0.5960040636640704,
"grad_norm": 5.744068145751953,
"learning_rate": 1.9595378124201402e-05,
"loss": 1.2987921714782715,
"mean_token_accuracy": 0.7069474339485169,
"num_tokens": 446791.0,
"step": 220
},
{
"entropy": 2.177510863542557,
"epoch": 0.6230951574669827,
"grad_norm": 8.363221168518066,
"learning_rate": 1.9544600118885356e-05,
"loss": 1.4281065940856934,
"mean_token_accuracy": 0.7097761157900095,
"num_tokens": 466287.0,
"step": 230
},
{
"entropy": 2.2098993390798567,
"epoch": 0.650186251269895,
"grad_norm": 4.0296220779418945,
"learning_rate": 1.9490895256547465e-05,
"loss": 1.0510370254516601,
"mean_token_accuracy": 0.7287774980068207,
"num_tokens": 485912.0,
"step": 240
},
{
"entropy": 2.194219082593918,
"epoch": 0.6772773450728073,
"grad_norm": 4.584537982940674,
"learning_rate": 1.9434280005814115e-05,
"loss": 1.5170968055725098,
"mean_token_accuracy": 0.6617882775142789,
"num_tokens": 506698.0,
"step": 250
},
{
"entropy": 2.1990948766469955,
"epoch": 0.7043684388757196,
"grad_norm": 2.1026809215545654,
"learning_rate": 1.9374771727783956e-05,
"loss": 1.2185900688171387,
"mean_token_accuracy": 0.6906542837619781,
"num_tokens": 526063.0,
"step": 260
},
{
"entropy": 2.1788215398788453,
"epoch": 0.731459532678632,
"grad_norm": 3.8161611557006836,
"learning_rate": 1.931238867070408e-05,
"loss": 1.3875349044799805,
"mean_token_accuracy": 0.7175548300147057,
"num_tokens": 547940.0,
"step": 270
},
{
"entropy": 2.1797836825251578,
"epoch": 0.7585506264815441,
"grad_norm": 4.361836910247803,
"learning_rate": 1.924714996437421e-05,
"loss": 1.4559088706970216,
"mean_token_accuracy": 0.6750684441998601,
"num_tokens": 567784.0,
"step": 280
},
{
"entropy": 2.192278742790222,
"epoch": 0.7856417202844564,
"grad_norm": 5.223799705505371,
"learning_rate": 1.9179075614280513e-05,
"loss": 1.3970552444458009,
"mean_token_accuracy": 0.7280023746192456,
"num_tokens": 587559.0,
"step": 290
},
{
"entropy": 2.152565708756447,
"epoch": 0.8127328140873687,
"grad_norm": 4.498564720153809,
"learning_rate": 1.9108186495460934e-05,
"loss": 1.296685028076172,
"mean_token_accuracy": 0.6948160078376532,
"num_tokens": 608955.0,
"step": 300
},
{
"epoch": 0.8127328140873687,
"eval_entropy": 2.086765900719911,
"eval_loss": 0.9978444576263428,
"eval_mean_token_accuracy": 0.7629395253607072,
"eval_num_tokens": 608955.0,
"eval_runtime": 25.5161,
"eval_samples_per_second": 20.066,
"eval_steps_per_second": 10.033,
"step": 300
},
{
"entropy": 2.2242535188794137,
"epoch": 0.839823907890281,
"grad_norm": 4.154886245727539,
"learning_rate": 1.9034504346103825e-05,
"loss": 1.5084619522094727,
"mean_token_accuracy": 0.699345251917839,
"num_tokens": 629498.0,
"step": 310
},
{
"entropy": 2.2500312089920045,
"epoch": 0.8669150016931934,
"grad_norm": 3.7556686401367188,
"learning_rate": 1.8958051760881938e-05,
"loss": 1.3967250823974608,
"mean_token_accuracy": 0.6777329007163644,
"num_tokens": 648909.0,
"step": 320
},
{
"entropy": 2.270790347456932,
"epoch": 0.8940060954961057,
"grad_norm": 5.752708911895752,
"learning_rate": 1.8878852184023754e-05,
"loss": 1.2833734512329102,
"mean_token_accuracy": 0.6765352768823505,
"num_tokens": 667376.0,
"step": 330
},
{
"entropy": 2.1318136006593704,
"epoch": 0.921097189299018,
"grad_norm": 4.369615077972412,
"learning_rate": 1.879692990212428e-05,
"loss": 1.2982247352600098,
"mean_token_accuracy": 0.7231215512380004,
"num_tokens": 689776.0,
"step": 340
},
{
"entropy": 2.179507865011692,
"epoch": 0.9481882831019303,
"grad_norm": 3.208723783493042,
"learning_rate": 1.8712310036697575e-05,
"loss": 1.279671859741211,
"mean_token_accuracy": 0.7093656450510025,
"num_tokens": 710374.0,
"step": 350
},
{
"entropy": 2.1694433763623238,
"epoch": 0.9752793769048426,
"grad_norm": 6.71851110458374,
"learning_rate": 1.8625018536473204e-05,
"loss": 1.485358428955078,
"mean_token_accuracy": 0.6655262919142843,
"num_tokens": 731208.0,
"step": 360
},
{
"entropy": 2.1039708019935923,
"epoch": 1.0,
"grad_norm": 5.395904064178467,
"learning_rate": 1.8535082169439057e-05,
"loss": 1.3225526809692383,
"mean_token_accuracy": 0.7076871527792656,
"num_tokens": 750475.0,
"step": 370
},
{
"entropy": 2.1732485339045526,
"epoch": 1.0270910938029123,
"grad_norm": 3.098240852355957,
"learning_rate": 1.844252851463292e-05,
"loss": 1.514673614501953,
"mean_token_accuracy": 0.7053313782438636,
"num_tokens": 772399.0,
"step": 380
},
{
"entropy": 2.1763458222150804,
"epoch": 1.0541821876058246,
"grad_norm": 3.707331895828247,
"learning_rate": 1.834738595368536e-05,
"loss": 1.0740927696228026,
"mean_token_accuracy": 0.7563056144863367,
"num_tokens": 792378.0,
"step": 390
},
{
"entropy": 2.171446980535984,
"epoch": 1.081273281408737,
"grad_norm": 5.769153594970703,
"learning_rate": 1.824968366211648e-05,
"loss": 1.2906767845153808,
"mean_token_accuracy": 0.7230573301203549,
"num_tokens": 811796.0,
"step": 400
},
{
"epoch": 1.081273281408737,
"eval_entropy": 2.0477666831575334,
"eval_loss": 1.0081422328948975,
"eval_mean_token_accuracy": 0.7632476337021217,
"eval_num_tokens": 811796.0,
"eval_runtime": 25.4904,
"eval_samples_per_second": 20.086,
"eval_steps_per_second": 10.043,
"step": 400
},
{
"entropy": 2.1150058075785636,
"epoch": 1.1083643752116492,
"grad_norm": 4.51067590713501,
"learning_rate": 1.8149451600389207e-05,
"loss": 1.3508639335632324,
"mean_token_accuracy": 0.7513733027502895,
"num_tokens": 832769.0,
"step": 410
},
{
"entropy": 2.1037127494812013,
"epoch": 1.1354554690145615,
"grad_norm": 2.397596836090088,
"learning_rate": 1.8046720504721938e-05,
"loss": 1.0258020401000976,
"mean_token_accuracy": 0.74247965849936,
"num_tokens": 853670.0,
"step": 420
},
{
"entropy": 2.0551841765642167,
"epoch": 1.1625465628174738,
"grad_norm": 9.206628799438477,
"learning_rate": 1.794152187766323e-05,
"loss": 1.1884271621704101,
"mean_token_accuracy": 0.7030579019337893,
"num_tokens": 874009.0,
"step": 430
},
{
"entropy": 2.0734852880239485,
"epoch": 1.1896376566203861,
"grad_norm": 4.471444129943848,
"learning_rate": 1.783388797843154e-05,
"loss": 1.2394503593444823,
"mean_token_accuracy": 0.7340864278376102,
"num_tokens": 895613.0,
"step": 440
},
{
"entropy": 2.134996885061264,
"epoch": 1.2167287504232984,
"grad_norm": 6.01848840713501,
"learning_rate": 1.77238518130229e-05,
"loss": 1.227487850189209,
"mean_token_accuracy": 0.7364656325429678,
"num_tokens": 914468.0,
"step": 450
},
{
"entropy": 2.061158812046051,
"epoch": 1.2438198442262107,
"grad_norm": 12.69832992553711,
"learning_rate": 1.761144712408965e-05,
"loss": 1.221731185913086,
"mean_token_accuracy": 0.7208205627277493,
"num_tokens": 936076.0,
"step": 460
},
{
"entropy": 2.1015277206897736,
"epoch": 1.270910938029123,
"grad_norm": 3.7558536529541016,
"learning_rate": 1.749670838059318e-05,
"loss": 0.9690493583679199,
"mean_token_accuracy": 0.7604702278971672,
"num_tokens": 956253.0,
"step": 470
},
{
"entropy": 2.1128511682152746,
"epoch": 1.298002031832035,
"grad_norm": 7.6537275314331055,
"learning_rate": 1.7379670767234045e-05,
"loss": 1.0514067649841308,
"mean_token_accuracy": 0.7440206557512283,
"num_tokens": 976137.0,
"step": 480
},
{
"entropy": 2.106458379328251,
"epoch": 1.3250931256349476,
"grad_norm": 7.5504045486450195,
"learning_rate": 1.7260370173662543e-05,
"loss": 1.0261421203613281,
"mean_token_accuracy": 0.7460719928145408,
"num_tokens": 995767.0,
"step": 490
},
{
"entropy": 2.118429370224476,
"epoch": 1.3521842194378597,
"grad_norm": 4.931035995483398,
"learning_rate": 1.7138843183473127e-05,
"loss": 1.5636432647705079,
"mean_token_accuracy": 0.7403618179261684,
"num_tokens": 1015342.0,
"step": 500
},
{
"epoch": 1.3521842194378597,
"eval_entropy": 1.9999370207078755,
"eval_loss": 1.032294511795044,
"eval_mean_token_accuracy": 0.7589045927161351,
"eval_num_tokens": 1015342.0,
"eval_runtime": 25.5016,
"eval_samples_per_second": 20.077,
"eval_steps_per_second": 10.039,
"step": 500
},
{
"entropy": 2.124773620069027,
"epoch": 1.379275313240772,
"grad_norm": 10.168334007263184,
"learning_rate": 1.7015127062986044e-05,
"loss": 0.8846927642822265,
"mean_token_accuracy": 0.7411885142326355,
"num_tokens": 1034010.0,
"step": 510
},
{
"entropy": 2.0986449405550958,
"epoch": 1.4063664070436843,
"grad_norm": 6.97003698348999,
"learning_rate": 1.6889259749819568e-05,
"loss": 1.023176383972168,
"mean_token_accuracy": 0.7303699310868979,
"num_tokens": 1053408.0,
"step": 520
},
{
"entropy": 2.1111062809824945,
"epoch": 1.4334575008465966,
"grad_norm": 5.16034460067749,
"learning_rate": 1.6761279841256437e-05,
"loss": 1.3746380805969238,
"mean_token_accuracy": 0.7154265632852912,
"num_tokens": 1074316.0,
"step": 530
},
{
"entropy": 2.071941052377224,
"epoch": 1.460548594649509,
"grad_norm": 5.507922649383545,
"learning_rate": 1.6631226582407954e-05,
"loss": 1.3437743186950684,
"mean_token_accuracy": 0.6885566545650363,
"num_tokens": 1094208.0,
"step": 540
},
{
"entropy": 2.1154344886541367,
"epoch": 1.4876396884524212,
"grad_norm": 3.5610263347625732,
"learning_rate": 1.649913985417946e-05,
"loss": 1.1012388229370118,
"mean_token_accuracy": 0.7634946122765541,
"num_tokens": 1113777.0,
"step": 550
},
{
"entropy": 2.0671692818403242,
"epoch": 1.5147307822553335,
"grad_norm": 8.337108612060547,
"learning_rate": 1.636506016104084e-05,
"loss": 1.3132530212402345,
"mean_token_accuracy": 0.7397821169346571,
"num_tokens": 1133996.0,
"step": 560
},
{
"entropy": 2.0944964781403543,
"epoch": 1.5418218760582458,
"grad_norm": 7.714909076690674,
"learning_rate": 1.6229028618605776e-05,
"loss": 0.8892477035522461,
"mean_token_accuracy": 0.7313346045091749,
"num_tokens": 1154047.0,
"step": 570
},
{
"entropy": 2.0559984400868414,
"epoch": 1.5689129698611581,
"grad_norm": 6.229889392852783,
"learning_rate": 1.609108694102366e-05,
"loss": 0.9835987091064453,
"mean_token_accuracy": 0.7751555263996124,
"num_tokens": 1174616.0,
"step": 580
},
{
"entropy": 2.054904416203499,
"epoch": 1.5960040636640704,
"grad_norm": 3.5100467205047607,
"learning_rate": 1.59512774281879e-05,
"loss": 0.7898230075836181,
"mean_token_accuracy": 0.7902765288949013,
"num_tokens": 1194173.0,
"step": 590
},
{
"entropy": 2.0093825444579125,
"epoch": 1.6230951574669827,
"grad_norm": 5.0431742668151855,
"learning_rate": 1.580964295276463e-05,
"loss": 1.0017314910888673,
"mean_token_accuracy": 0.7571999192237854,
"num_tokens": 1214366.0,
"step": 600
},
{
"epoch": 1.6230951574669827,
"eval_entropy": 1.9694703868590295,
"eval_loss": 1.0424904823303223,
"eval_mean_token_accuracy": 0.7560218448052183,
"eval_num_tokens": 1214366.0,
"eval_runtime": 25.5499,
"eval_samples_per_second": 20.039,
"eval_steps_per_second": 10.02,
"step": 600
},
{
"entropy": 2.0107428073883056,
"epoch": 1.650186251269895,
"grad_norm": 7.987220287322998,
"learning_rate": 1.5666226947045814e-05,
"loss": 1.3089231491088866,
"mean_token_accuracy": 0.7401313630864024,
"num_tokens": 1236562.0,
"step": 610
},
{
"entropy": 2.046839062869549,
"epoch": 1.6772773450728073,
"grad_norm": 6.632065296173096,
"learning_rate": 1.552107338963067e-05,
"loss": 0.9845743179321289,
"mean_token_accuracy": 0.755998631566763,
"num_tokens": 1257112.0,
"step": 620
},
{
"entropy": 2.1148023292422296,
"epoch": 1.7043684388757196,
"grad_norm": 8.282198905944824,
"learning_rate": 1.5374226791939628e-05,
"loss": 1.3935293197631835,
"mean_token_accuracy": 0.7302353219129145,
"num_tokens": 1276577.0,
"step": 630
},
{
"entropy": 2.0933067336678506,
"epoch": 1.731459532678632,
"grad_norm": 5.363010406494141,
"learning_rate": 1.5225732184564886e-05,
"loss": 1.2860239028930665,
"mean_token_accuracy": 0.7248616352677345,
"num_tokens": 1296086.0,
"step": 640
},
{
"entropy": 2.1054985627532004,
"epoch": 1.758550626481544,
"grad_norm": 4.800771236419678,
"learning_rate": 1.5075635103461731e-05,
"loss": 1.2266152381896973,
"mean_token_accuracy": 0.7662290595471859,
"num_tokens": 1316442.0,
"step": 650
},
{
"entropy": 2.1522702112793923,
"epoch": 1.7856417202844566,
"grad_norm": 3.5823662281036377,
"learning_rate": 1.4923981575984936e-05,
"loss": 1.0100022315979005,
"mean_token_accuracy": 0.7728497218340635,
"num_tokens": 1337169.0,
"step": 660
},
{
"entropy": 2.1094584688544273,
"epoch": 1.8127328140873686,
"grad_norm": 5.589018821716309,
"learning_rate": 1.4770818106774427e-05,
"loss": 1.0324097633361817,
"mean_token_accuracy": 0.7925379849970341,
"num_tokens": 1357759.0,
"step": 670
},
{
"entropy": 2.182632897794247,
"epoch": 1.8398239078902812,
"grad_norm": 7.491511344909668,
"learning_rate": 1.4616191663494619e-05,
"loss": 1.3248936653137207,
"mean_token_accuracy": 0.7274331038817763,
"num_tokens": 1378191.0,
"step": 680
},
{
"entropy": 2.1101855129003524,
"epoch": 1.8669150016931932,
"grad_norm": 6.318648815155029,
"learning_rate": 1.4460149662431749e-05,
"loss": 1.054247760772705,
"mean_token_accuracy": 0.7554519359022379,
"num_tokens": 1397881.0,
"step": 690
},
{
"entropy": 2.096898023784161,
"epoch": 1.8940060954961058,
"grad_norm": 6.2741875648498535,
"learning_rate": 1.430273995395365e-05,
"loss": 1.0373686790466308,
"mean_token_accuracy": 0.7596361611038447,
"num_tokens": 1418877.0,
"step": 700
},
{
"epoch": 1.8940060954961058,
"eval_entropy": 2.013828214723617,
"eval_loss": 1.0287954807281494,
"eval_mean_token_accuracy": 0.7496589213842526,
"eval_num_tokens": 1418877.0,
"eval_runtime": 25.4995,
"eval_samples_per_second": 20.079,
"eval_steps_per_second": 10.039,
"step": 700
},
{
"entropy": 2.0728593289852144,
"epoch": 1.9210971892990178,
"grad_norm": 6.076820373535156,
"learning_rate": 1.4144010807836412e-05,
"loss": 1.0167503356933594,
"mean_token_accuracy": 0.7612185761332512,
"num_tokens": 1439198.0,
"step": 710
},
{
"entropy": 2.11173554956913,
"epoch": 1.9481882831019304,
"grad_norm": 6.451402187347412,
"learning_rate": 1.3984010898462417e-05,
"loss": 1.089035415649414,
"mean_token_accuracy": 0.7369910277426243,
"num_tokens": 1461226.0,
"step": 720
},
{
"entropy": 2.0723678693175316,
"epoch": 1.9752793769048425,
"grad_norm": 5.50106954574585,
"learning_rate": 1.3822789289894316e-05,
"loss": 0.9883082389831543,
"mean_token_accuracy": 0.7898955499753356,
"num_tokens": 1482366.0,
"step": 730
},
{
"entropy": 2.0618706647663902,
"epoch": 2.0,
"grad_norm": 50.42632293701172,
"learning_rate": 1.3660395420829516e-05,
"loss": 0.8657957077026367,
"mean_token_accuracy": 0.7464919359716651,
"num_tokens": 1500950.0,
"step": 740
},
{
"entropy": 2.050840379297733,
"epoch": 2.027091093802912,
"grad_norm": 6.361630439758301,
"learning_rate": 1.3496879089439761e-05,
"loss": 0.8690568923950195,
"mean_token_accuracy": 0.7947060691192747,
"num_tokens": 1519798.0,
"step": 750
},
{
"entropy": 1.926042178273201,
"epoch": 2.0541821876058246,
"grad_norm": 2.3748672008514404,
"learning_rate": 1.3332290438100508e-05,
"loss": 0.8486003875732422,
"mean_token_accuracy": 0.8309563081711531,
"num_tokens": 1539927.0,
"step": 760
},
{
"entropy": 1.8769470036029816,
"epoch": 2.0812732814087367,
"grad_norm": 8.954164505004883,
"learning_rate": 1.3166679938014728e-05,
"loss": 0.7576936244964599,
"mean_token_accuracy": 0.8146512515842914,
"num_tokens": 1560176.0,
"step": 770
},
{
"entropy": 1.8487665757536889,
"epoch": 2.108364375211649,
"grad_norm": 8.518715858459473,
"learning_rate": 1.3000098373735885e-05,
"loss": 0.9359015464782715,
"mean_token_accuracy": 0.788595624268055,
"num_tokens": 1579888.0,
"step": 780
},
{
"entropy": 1.8781982406973838,
"epoch": 2.1354554690145613,
"grad_norm": 5.680595397949219,
"learning_rate": 1.283259682759484e-05,
"loss": 0.9370273590087891,
"mean_token_accuracy": 0.7608782526105642,
"num_tokens": 1601141.0,
"step": 790
},
{
"entropy": 1.9456540763378143,
"epoch": 2.162546562817474,
"grad_norm": 5.94552755355835,
"learning_rate": 1.266422666403539e-05,
"loss": 0.9432417869567871,
"mean_token_accuracy": 0.8288755964487791,
"num_tokens": 1621542.0,
"step": 800
},
{
"epoch": 2.162546562817474,
"eval_entropy": 1.9436165052466094,
"eval_loss": 1.06016206741333,
"eval_mean_token_accuracy": 0.7518258688505739,
"eval_num_tokens": 1621542.0,
"eval_runtime": 25.5171,
"eval_samples_per_second": 20.065,
"eval_steps_per_second": 10.032,
"step": 800
},
{
"entropy": 1.9728469848632812,
"epoch": 2.189637656620386,
"grad_norm": 7.825141906738281,
"learning_rate": 1.2495039513863378e-05,
"loss": 1.036830997467041,
"mean_token_accuracy": 0.8224836468696595,
"num_tokens": 1641245.0,
"step": 810
},
{
"entropy": 1.9231234237551689,
"epoch": 2.2167287504232984,
"grad_norm": 6.70737361907959,
"learning_rate": 1.2325087258414039e-05,
"loss": 0.7759229183197022,
"mean_token_accuracy": 0.8049912886694074,
"num_tokens": 1663067.0,
"step": 820
},
{
"entropy": 1.8155759632587434,
"epoch": 2.2438198442262105,
"grad_norm": 9.183692932128906,
"learning_rate": 1.2154422013642575e-05,
"loss": 0.8489904403686523,
"mean_token_accuracy": 0.8039800453931093,
"num_tokens": 1683171.0,
"step": 830
},
{
"entropy": 1.9373584493994713,
"epoch": 2.270910938029123,
"grad_norm": 6.903590679168701,
"learning_rate": 1.1983096114142773e-05,
"loss": 1.001230525970459,
"mean_token_accuracy": 0.7758175190538168,
"num_tokens": 1702798.0,
"step": 840
},
{
"entropy": 2.008491799235344,
"epoch": 2.298002031832035,
"grad_norm": 7.595852375030518,
"learning_rate": 1.1811162097098559e-05,
"loss": 0.9919692039489746,
"mean_token_accuracy": 0.8151415549218655,
"num_tokens": 1722315.0,
"step": 850
},
{
"entropy": 1.9535631239414215,
"epoch": 2.3250931256349476,
"grad_norm": 8.800715446472168,
"learning_rate": 1.1638672686173453e-05,
"loss": 0.7722007274627686,
"mean_token_accuracy": 0.8053982924669981,
"num_tokens": 1741922.0,
"step": 860
},
{
"entropy": 1.9666619777679444,
"epoch": 2.3521842194378597,
"grad_norm": 5.499095916748047,
"learning_rate": 1.1465680775342821e-05,
"loss": 1.0401187896728517,
"mean_token_accuracy": 0.7628452027216553,
"num_tokens": 1761561.0,
"step": 870
},
{
"entropy": 1.9506760001182557,
"epoch": 2.3792753132407722,
"grad_norm": 15.519598007202148,
"learning_rate": 1.1292239412673906e-05,
"loss": 0.9919161796569824,
"mean_token_accuracy": 0.7912353215739131,
"num_tokens": 1781403.0,
"step": 880
},
{
"entropy": 1.8824239298701286,
"epoch": 2.4063664070436843,
"grad_norm": 8.007031440734863,
"learning_rate": 1.1118401784058612e-05,
"loss": 0.8426601409912109,
"mean_token_accuracy": 0.8043077282607556,
"num_tokens": 1803471.0,
"step": 890
},
{
"entropy": 1.9203020244836808,
"epoch": 2.433457500846597,
"grad_norm": 8.088946342468262,
"learning_rate": 1.0944221196904029e-05,
"loss": 1.0317404747009278,
"mean_token_accuracy": 0.7911908756941557,
"num_tokens": 1823668.0,
"step": 900
},
{
"epoch": 2.433457500846597,
"eval_entropy": 1.8476642882451415,
"eval_loss": 1.102004051208496,
"eval_mean_token_accuracy": 0.7586654123151675,
"eval_num_tokens": 1823668.0,
"eval_runtime": 25.5319,
"eval_samples_per_second": 20.053,
"eval_steps_per_second": 10.027,
"step": 900
},
{
"entropy": 1.8842667803168296,
"epoch": 2.460548594649509,
"grad_norm": 10.67811393737793,
"learning_rate": 1.0769751063785661e-05,
"loss": 0.7327501773834229,
"mean_token_accuracy": 0.7824661247432232,
"num_tokens": 1844175.0,
"step": 910
},
{
"entropy": 1.8312113255262374,
"epoch": 2.4876396884524214,
"grad_norm": 5.517256736755371,
"learning_rate": 1.0595044886068457e-05,
"loss": 0.6679872512817383,
"mean_token_accuracy": 0.8325993716716766,
"num_tokens": 1864323.0,
"step": 920
},
{
"entropy": 1.820173794031143,
"epoch": 2.5147307822553335,
"grad_norm": 5.745193958282471,
"learning_rate": 1.0420156237500571e-05,
"loss": 0.6937276363372803,
"mean_token_accuracy": 0.8053716959431767,
"num_tokens": 1884326.0,
"step": 930
},
{
"entropy": 1.8793843016028404,
"epoch": 2.541821876058246,
"grad_norm": 7.830550670623779,
"learning_rate": 1.0245138747784953e-05,
"loss": 0.8545784950256348,
"mean_token_accuracy": 0.8472533781081438,
"num_tokens": 1904095.0,
"step": 940
},
{
"entropy": 1.8013970047235488,
"epoch": 2.568912969861158,
"grad_norm": 6.052741527557373,
"learning_rate": 1.007004608613375e-05,
"loss": 0.7021704196929932,
"mean_token_accuracy": 0.8472875323146581,
"num_tokens": 1924391.0,
"step": 950
},
{
"entropy": 1.9338349267840385,
"epoch": 2.59600406366407,
"grad_norm": 12.163394927978516,
"learning_rate": 9.89493194481064e-06,
"loss": 0.9507933616638183,
"mean_token_accuracy": 0.807798033207655,
"num_tokens": 1944746.0,
"step": 960
},
{
"entropy": 1.879988330602646,
"epoch": 2.6230951574669827,
"grad_norm": 6.659127712249756,
"learning_rate": 9.719850022666044e-06,
"loss": 0.6338046550750732,
"mean_token_accuracy": 0.8415262099355459,
"num_tokens": 1967427.0,
"step": 970
},
{
"entropy": 1.890741939842701,
"epoch": 2.6501862512698953,
"grad_norm": 9.862802505493164,
"learning_rate": 9.544854008670366e-06,
"loss": 0.7429360389709473,
"mean_token_accuracy": 0.8043466622009874,
"num_tokens": 1986505.0,
"step": 980
},
{
"entropy": 1.8231979936361313,
"epoch": 2.6772773450728073,
"grad_norm": 11.50146198272705,
"learning_rate": 9.369997565450214e-06,
"loss": 1.0342053413391112,
"mean_token_accuracy": 0.7860685650259256,
"num_tokens": 2006357.0,
"step": 990
},
{
"entropy": 1.8516354262828827,
"epoch": 2.7043684388757194,
"grad_norm": 3.143589973449707,
"learning_rate": 9.195334312832742e-06,
"loss": 0.8172811508178711,
"mean_token_accuracy": 0.8135180365294218,
"num_tokens": 2026498.0,
"step": 1000
},
{
"epoch": 2.7043684388757194,
"eval_entropy": 1.853846381418407,
"eval_loss": 1.0932104587554932,
"eval_mean_token_accuracy": 0.7503726394497789,
"eval_num_tokens": 2026498.0,
"eval_runtime": 25.4801,
"eval_samples_per_second": 20.094,
"eval_steps_per_second": 10.047,
"step": 1000
},
{
"entropy": 1.9358359456062317,
"epoch": 2.731459532678632,
"grad_norm": 5.799363136291504,
"learning_rate": 9.020917811403104e-06,
"loss": 0.7895758152008057,
"mean_token_accuracy": 0.8083623085170984,
"num_tokens": 2045459.0,
"step": 1010
},
{
"entropy": 1.9362391978502274,
"epoch": 2.758550626481544,
"grad_norm": 4.842373371124268,
"learning_rate": 8.846801546080062e-06,
"loss": 0.836983585357666,
"mean_token_accuracy": 0.8126423776149749,
"num_tokens": 2066518.0,
"step": 1020
},
{
"entropy": 1.91400406062603,
"epoch": 2.7856417202844566,
"grad_norm": 7.656473636627197,
"learning_rate": 8.673038909714792e-06,
"loss": 0.7076562881469727,
"mean_token_accuracy": 0.8479138355702162,
"num_tokens": 2086183.0,
"step": 1030
},
{
"entropy": 1.8541285216808319,
"epoch": 2.8127328140873686,
"grad_norm": 9.124068260192871,
"learning_rate": 8.499683186717964e-06,
"loss": 0.9584396362304688,
"mean_token_accuracy": 0.7849915137514472,
"num_tokens": 2107721.0,
"step": 1040
},
{
"entropy": 1.798606288433075,
"epoch": 2.839823907890281,
"grad_norm": 11.562939643859863,
"learning_rate": 8.326787536720037e-06,
"loss": 0.9054560661315918,
"mean_token_accuracy": 0.7929567001760006,
"num_tokens": 2130459.0,
"step": 1050
},
{
"entropy": 1.9321310743689537,
"epoch": 2.8669150016931932,
"grad_norm": 12.520683288574219,
"learning_rate": 8.154404978269808e-06,
"loss": 0.9787432670593261,
"mean_token_accuracy": 0.7586101952940225,
"num_tokens": 2150465.0,
"step": 1060
},
{
"entropy": 1.8978336572647094,
"epoch": 2.8940060954961058,
"grad_norm": 6.707414627075195,
"learning_rate": 7.982588372576274e-06,
"loss": 0.8695780754089355,
"mean_token_accuracy": 0.8042063070461154,
"num_tokens": 2171901.0,
"step": 1070
},
{
"entropy": 1.911924734711647,
"epoch": 2.921097189299018,
"grad_norm": 10.575072288513184,
"learning_rate": 7.811390407298697e-06,
"loss": 1.1379961013793944,
"mean_token_accuracy": 0.7801183510571719,
"num_tokens": 2192878.0,
"step": 1080
},
{
"entropy": 1.9139499440789223,
"epoch": 2.9481882831019304,
"grad_norm": 9.588115692138672,
"learning_rate": 7.640863580389903e-06,
"loss": 0.6681862354278565,
"mean_token_accuracy": 0.8321586221456527,
"num_tokens": 2212872.0,
"step": 1090
},
{
"entropy": 1.917321428656578,
"epoch": 2.9752793769048425,
"grad_norm": 8.42562484741211,
"learning_rate": 7.47106018399776e-06,
"loss": 1.0313225746154786,
"mean_token_accuracy": 0.7394453713670373,
"num_tokens": 2233656.0,
"step": 1100
},
{
"epoch": 2.9752793769048425,
"eval_entropy": 1.8692557462491095,
"eval_loss": 1.1177661418914795,
"eval_mean_token_accuracy": 0.7488149127457291,
"eval_num_tokens": 2233656.0,
"eval_runtime": 25.4569,
"eval_samples_per_second": 20.112,
"eval_steps_per_second": 10.056,
"step": 1100
},
{
"entropy": 1.9485157532234714,
"epoch": 3.0,
"grad_norm": 20.587278366088867,
"learning_rate": 7.3020322884297565e-06,
"loss": 0.7162185668945312,
"mean_token_accuracy": 0.8130205739034365,
"num_tokens": 2251425.0,
"step": 1110
},
{
"entropy": 1.8808414414525032,
"epoch": 3.027091093802912,
"grad_norm": 9.604867935180664,
"learning_rate": 7.1338317261856225e-06,
"loss": 0.6537890911102295,
"mean_token_accuracy": 0.8606590256094933,
"num_tokens": 2270749.0,
"step": 1120
},
{
"entropy": 1.7552776366472245,
"epoch": 3.0541821876058246,
"grad_norm": 20.14252281188965,
"learning_rate": 6.966510076062845e-06,
"loss": 0.6271217823028564,
"mean_token_accuracy": 0.8392207693308592,
"num_tokens": 2289814.0,
"step": 1130
},
{
"entropy": 1.7204705789685248,
"epoch": 3.0812732814087367,
"grad_norm": 11.636978149414062,
"learning_rate": 6.800118647340022e-06,
"loss": 0.6068019866943359,
"mean_token_accuracy": 0.8635438393801451,
"num_tokens": 2310249.0,
"step": 1140
},
{
"entropy": 1.7508003085851669,
"epoch": 3.108364375211649,
"grad_norm": 12.074075698852539,
"learning_rate": 6.634708464042827e-06,
"loss": 0.43173890113830565,
"mean_token_accuracy": 0.8833881586790084,
"num_tokens": 2329569.0,
"step": 1150
},
{
"entropy": 1.7503153815865518,
"epoch": 3.1354554690145613,
"grad_norm": 12.822123527526855,
"learning_rate": 6.470330249297472e-06,
"loss": 0.5606254577636719,
"mean_token_accuracy": 0.8595870833843946,
"num_tokens": 2350193.0,
"step": 1160
},
{
"entropy": 1.7921119689941407,
"epoch": 3.162546562817474,
"grad_norm": 15.029194831848145,
"learning_rate": 6.3070344097764265e-06,
"loss": 0.775139856338501,
"mean_token_accuracy": 0.8431978467851877,
"num_tokens": 2369022.0,
"step": 1170
},
{
"entropy": 1.7634284302592278,
"epoch": 3.189637656620386,
"grad_norm": 10.424407958984375,
"learning_rate": 6.144871020241197e-06,
"loss": 0.6365249156951904,
"mean_token_accuracy": 0.8474900238215923,
"num_tokens": 2388527.0,
"step": 1180
},
{
"entropy": 1.7646004989743234,
"epoch": 3.2167287504232984,
"grad_norm": 8.618444442749023,
"learning_rate": 5.98388980818684e-06,
"loss": 0.8289416313171387,
"mean_token_accuracy": 0.8227736797183752,
"num_tokens": 2409237.0,
"step": 1190
},
{
"entropy": 1.737740470468998,
"epoch": 3.2438198442262105,
"grad_norm": 6.645010948181152,
"learning_rate": 5.8241401385930395e-06,
"loss": 0.39721031188964845,
"mean_token_accuracy": 0.8825947981327772,
"num_tokens": 2428916.0,
"step": 1200
},
{
"epoch": 3.2438198442262105,
"eval_entropy": 1.7245915541425347,
"eval_loss": 1.2651240825653076,
"eval_mean_token_accuracy": 0.7416992684593424,
"eval_num_tokens": 2428916.0,
"eval_runtime": 25.525,
"eval_samples_per_second": 20.059,
"eval_steps_per_second": 10.029,
"step": 1200
},
{
"entropy": 1.7320396453142166,
"epoch": 3.270910938029123,
"grad_norm": 9.127442359924316,
"learning_rate": 5.665670998786274e-06,
"loss": 0.5321141719818115,
"mean_token_accuracy": 0.8595851019024849,
"num_tokens": 2448191.0,
"step": 1210
},
{
"entropy": 1.7059780359268188,
"epoch": 3.298002031832035,
"grad_norm": 4.298802375793457,
"learning_rate": 5.508530983417855e-06,
"loss": 0.7181911468505859,
"mean_token_accuracy": 0.8558499291539192,
"num_tokens": 2470698.0,
"step": 1220
},
{
"entropy": 1.7368447184562683,
"epoch": 3.3250931256349476,
"grad_norm": 8.62894344329834,
"learning_rate": 5.352768279562315e-06,
"loss": 0.5110462188720704,
"mean_token_accuracy": 0.8599414020776749,
"num_tokens": 2490082.0,
"step": 1230
},
{
"entropy": 1.7677990421652794,
"epoch": 3.3521842194378597,
"grad_norm": 10.864715576171875,
"learning_rate": 5.198430651940846e-06,
"loss": 0.8702507972717285,
"mean_token_accuracy": 0.8074817329645156,
"num_tokens": 2510650.0,
"step": 1240
},
{
"entropy": 1.7419419810175896,
"epoch": 3.3792753132407722,
"grad_norm": 17.168798446655273,
"learning_rate": 5.0455654282742e-06,
"loss": 0.6099933624267578,
"mean_token_accuracy": 0.8637857645750046,
"num_tokens": 2530169.0,
"step": 1250
},
{
"entropy": 1.718581235408783,
"epoch": 3.4063664070436843,
"grad_norm": 9.985060691833496,
"learning_rate": 4.894219484769622e-06,
"loss": 0.38284480571746826,
"mean_token_accuracy": 0.894951194524765,
"num_tokens": 2549783.0,
"step": 1260
},
{
"entropy": 1.7342086032032966,
"epoch": 3.433457500846597,
"grad_norm": 7.34379768371582,
"learning_rate": 4.744439231746251e-06,
"loss": 0.5211464881896972,
"mean_token_accuracy": 0.8848932076245546,
"num_tokens": 2569240.0,
"step": 1270
},
{
"entropy": 1.7445754528045654,
"epoch": 3.460548594649509,
"grad_norm": 12.614356994628906,
"learning_rate": 4.596270599403338e-06,
"loss": 0.7350710391998291,
"mean_token_accuracy": 0.8188348516821862,
"num_tokens": 2589517.0,
"step": 1280
},
{
"entropy": 1.6525848761200905,
"epoch": 3.4876396884524214,
"grad_norm": 10.50085163116455,
"learning_rate": 4.449759023735749e-06,
"loss": 0.36133971214294436,
"mean_token_accuracy": 0.9022616557776928,
"num_tokens": 2610330.0,
"step": 1290
},
{
"entropy": 1.695315808057785,
"epoch": 3.5147307822553335,
"grad_norm": 7.3657026290893555,
"learning_rate": 4.30494943260098e-06,
"loss": 0.8237950325012207,
"mean_token_accuracy": 0.8609236305579543,
"num_tokens": 2632100.0,
"step": 1300
},
{
"epoch": 3.5147307822553335,
"eval_entropy": 1.7062555481679738,
"eval_loss": 1.265852451324463,
"eval_mean_token_accuracy": 0.7387107044924051,
"eval_num_tokens": 2632100.0,
"eval_runtime": 25.4553,
"eval_samples_per_second": 20.114,
"eval_steps_per_second": 10.057,
"step": 1300
},
{
"entropy": 1.7215346291661262,
"epoch": 3.541821876058246,
"grad_norm": 9.210244178771973,
"learning_rate": 4.161886231942017e-06,
"loss": 0.6864943027496337,
"mean_token_accuracy": 0.8675076253712177,
"num_tokens": 2652389.0,
"step": 1310
},
{
"entropy": 1.7494278416037559,
"epoch": 3.568912969861158,
"grad_norm": 12.154091835021973,
"learning_rate": 4.020613292170211e-06,
"loss": 0.672312593460083,
"mean_token_accuracy": 0.8510223753750324,
"num_tokens": 2672161.0,
"step": 1320
},
{
"entropy": 1.7348069936037063,
"epoch": 3.59600406366407,
"grad_norm": 10.369400978088379,
"learning_rate": 3.8811739347124e-06,
"loss": 0.4440812110900879,
"mean_token_accuracy": 0.8849797431379557,
"num_tokens": 2693004.0,
"step": 1330
},
{
"entropy": 1.721322275698185,
"epoch": 3.6230951574669827,
"grad_norm": 4.361479759216309,
"learning_rate": 3.7436109187263693e-06,
"loss": 0.52271409034729,
"mean_token_accuracy": 0.8836568117141723,
"num_tokens": 2712634.0,
"step": 1340
},
{
"entropy": 1.7014023318886757,
"epoch": 3.6501862512698953,
"grad_norm": 15.928149223327637,
"learning_rate": 3.6079664279887427e-06,
"loss": 0.7015122890472412,
"mean_token_accuracy": 0.8756893876940012,
"num_tokens": 2732861.0,
"step": 1350
},
{
"entropy": 1.7075004890561103,
"epoch": 3.6772773450728073,
"grad_norm": 14.396157264709473,
"learning_rate": 3.4742820579592673e-06,
"loss": 0.5177778720855712,
"mean_token_accuracy": 0.8753840968012809,
"num_tokens": 2752885.0,
"step": 1360
},
{
"entropy": 1.6834155157208444,
"epoch": 3.7043684388757194,
"grad_norm": 8.488550186157227,
"learning_rate": 3.342598803025595e-06,
"loss": 0.619942045211792,
"mean_token_accuracy": 0.8745716098695994,
"num_tokens": 2773651.0,
"step": 1370
},
{
"entropy": 1.7230923131108284,
"epoch": 3.731459532678632,
"grad_norm": 13.944185256958008,
"learning_rate": 3.212957043932283e-06,
"loss": 0.6659866809844971,
"mean_token_accuracy": 0.8391641702502965,
"num_tokens": 2794243.0,
"step": 1380
},
{
"entropy": 1.661913888156414,
"epoch": 3.758550626481544,
"grad_norm": 5.620434761047363,
"learning_rate": 3.085396535398044e-06,
"loss": 0.40467143058776855,
"mean_token_accuracy": 0.8812628626823426,
"num_tokens": 2815288.0,
"step": 1390
},
{
"entropy": 1.6734888523817062,
"epoch": 3.7856417202844566,
"grad_norm": 12.459346771240234,
"learning_rate": 2.959956393924922e-06,
"loss": 0.4842523574829102,
"mean_token_accuracy": 0.8642897168174386,
"num_tokens": 2835949.0,
"step": 1400
},
{
"epoch": 3.7856417202844566,
"eval_entropy": 1.6953813284635544,
"eval_loss": 1.3081457614898682,
"eval_mean_token_accuracy": 0.7404504243750125,
"eval_num_tokens": 2835949.0,
"eval_runtime": 25.4537,
"eval_samples_per_second": 20.115,
"eval_steps_per_second": 10.057,
"step": 1400
},
{
"entropy": 1.7142169624567032,
"epoch": 3.8127328140873686,
"grad_norm": 19.3244571685791,
"learning_rate": 2.8366750858032177e-06,
"loss": 0.7156589031219482,
"mean_token_accuracy": 0.8869716469198465,
"num_tokens": 2856246.0,
"step": 1410
},
{
"entropy": 1.6850622862577438,
"epoch": 3.839823907890281,
"grad_norm": 15.101435661315918,
"learning_rate": 2.7155904153157497e-06,
"loss": 0.45338053703308107,
"mean_token_accuracy": 0.8818465910851956,
"num_tokens": 2877330.0,
"step": 1420
},
{
"entropy": 1.7075368210673332,
"epoch": 3.8669150016931932,
"grad_norm": 15.861879348754883,
"learning_rate": 2.5967395131451723e-06,
"loss": 0.5139744758605957,
"mean_token_accuracy": 0.8527137745171786,
"num_tokens": 2897344.0,
"step": 1430
},
{
"entropy": 1.6651010170578957,
"epoch": 3.8940060954961058,
"grad_norm": 15.302207946777344,
"learning_rate": 2.4801588249878163e-06,
"loss": 0.7968846797943115,
"mean_token_accuracy": 0.8468474011868239,
"num_tokens": 2919143.0,
"step": 1440
},
{
"entropy": 1.6404287233948707,
"epoch": 3.921097189299018,
"grad_norm": 10.076866149902344,
"learning_rate": 2.365884100377611e-06,
"loss": 0.4457272529602051,
"mean_token_accuracy": 0.8820912927389145,
"num_tokens": 2941599.0,
"step": 1450
},
{
"entropy": 1.6921194523572922,
"epoch": 3.9481882831019304,
"grad_norm": 10.407143592834473,
"learning_rate": 2.2539503817234553e-06,
"loss": 0.6064411640167237,
"mean_token_accuracy": 0.8608082607388496,
"num_tokens": 2961983.0,
"step": 1460
},
{
"entropy": 1.712096980214119,
"epoch": 3.9752793769048425,
"grad_norm": 10.601531028747559,
"learning_rate": 2.144391993563446e-06,
"loss": 0.503159761428833,
"mean_token_accuracy": 0.8580688439309597,
"num_tokens": 2982164.0,
"step": 1470
},
{
"entropy": 1.6592551649433294,
"epoch": 4.0,
"grad_norm": 21.362045288085938,
"learning_rate": 2.0372425320392454e-06,
"loss": 0.5836192607879639,
"mean_token_accuracy": 0.8683291808383106,
"num_tokens": 3001900.0,
"step": 1480
},
{
"entropy": 1.6971124514937401,
"epoch": 4.0270910938029125,
"grad_norm": 8.777483940124512,
"learning_rate": 1.932534854593795e-06,
"loss": 0.6050891876220703,
"mean_token_accuracy": 0.8690009146928788,
"num_tokens": 3023056.0,
"step": 1490
},
{
"entropy": 1.63857099711895,
"epoch": 4.054182187605824,
"grad_norm": 8.595149040222168,
"learning_rate": 1.8303010698955803e-06,
"loss": 0.4310460090637207,
"mean_token_accuracy": 0.8924087427556515,
"num_tokens": 3043490.0,
"step": 1500
},
{
"epoch": 4.054182187605824,
"eval_entropy": 1.669337394181639,
"eval_loss": 1.3523277044296265,
"eval_mean_token_accuracy": 0.7376706907525659,
"eval_num_tokens": 3043490.0,
"eval_runtime": 25.4594,
"eval_samples_per_second": 20.11,
"eval_steps_per_second": 10.055,
"step": 1500
},
{
"entropy": 1.6625288650393486,
"epoch": 4.081273281408737,
"grad_norm": 12.073065757751465,
"learning_rate": 1.7305725279924634e-06,
"loss": 0.3827295541763306,
"mean_token_accuracy": 0.8844121858477593,
"num_tokens": 3064126.0,
"step": 1510
},
{
"entropy": 1.6116922572255135,
"epoch": 4.108364375211649,
"grad_norm": 5.359347820281982,
"learning_rate": 1.6333798106982024e-06,
"loss": 0.3580256700515747,
"mean_token_accuracy": 0.9377022050321102,
"num_tokens": 3083867.0,
"step": 1520
},
{
"entropy": 1.591383346915245,
"epoch": 4.135455469014562,
"grad_norm": 6.666597843170166,
"learning_rate": 1.5387527222144861e-06,
"loss": 0.43925886154174804,
"mean_token_accuracy": 0.918615211546421,
"num_tokens": 3103679.0,
"step": 1530
},
{
"entropy": 1.5715536609292031,
"epoch": 4.162546562817473,
"grad_norm": 9.182818412780762,
"learning_rate": 1.446720279991496e-06,
"loss": 0.30636699199676515,
"mean_token_accuracy": 0.9238971933722496,
"num_tokens": 3125843.0,
"step": 1540
},
{
"entropy": 1.6449363514781,
"epoch": 4.189637656620386,
"grad_norm": 7.822624206542969,
"learning_rate": 1.3573107058296619e-06,
"loss": 0.45112295150756837,
"mean_token_accuracy": 0.8905558969825507,
"num_tokens": 3144837.0,
"step": 1550
},
{
"entropy": 1.5784786254167558,
"epoch": 4.216728750423298,
"grad_norm": 11.84586238861084,
"learning_rate": 1.270551417225443e-06,
"loss": 0.4005408763885498,
"mean_token_accuracy": 0.9311332777142525,
"num_tokens": 3163882.0,
"step": 1560
},
{
"entropy": 1.5929084509611129,
"epoch": 4.243819844226211,
"grad_norm": 18.798683166503906,
"learning_rate": 1.1864690189637306e-06,
"loss": 0.5499368190765381,
"mean_token_accuracy": 0.8895844966173172,
"num_tokens": 3185313.0,
"step": 1570
},
{
"entropy": 1.6276163026690482,
"epoch": 4.270910938029123,
"grad_norm": 18.325300216674805,
"learning_rate": 1.105089294959487e-06,
"loss": 0.47011642456054686,
"mean_token_accuracy": 0.8977843724191189,
"num_tokens": 3206038.0,
"step": 1580
},
{
"entropy": 1.6390855327248572,
"epoch": 4.298002031832035,
"grad_norm": 16.15447235107422,
"learning_rate": 1.0264372003510747e-06,
"loss": 0.5724862575531006,
"mean_token_accuracy": 0.8626310247927904,
"num_tokens": 3225061.0,
"step": 1590
},
{
"entropy": 1.6146731659770013,
"epoch": 4.325093125634948,
"grad_norm": 5.743528366088867,
"learning_rate": 9.5053685384777e-07,
"loss": 0.6115519046783447,
"mean_token_accuracy": 0.8991932325065136,
"num_tokens": 3246376.0,
"step": 1600
},
{
"epoch": 4.325093125634948,
"eval_entropy": 1.6513289087451994,
"eval_loss": 1.399103045463562,
"eval_mean_token_accuracy": 0.7364511488704011,
"eval_num_tokens": 3246376.0,
"eval_runtime": 25.4867,
"eval_samples_per_second": 20.089,
"eval_steps_per_second": 10.044,
"step": 1600
},
{
"entropy": 1.6438001811504364,
"epoch": 4.35218421943786,
"grad_norm": 10.316023826599121,
"learning_rate": 8.774115303337305e-07,
"loss": 0.3678164005279541,
"mean_token_accuracy": 0.9086852367967367,
"num_tokens": 3266626.0,
"step": 1610
},
{
"entropy": 1.6436322793364524,
"epoch": 4.379275313240772,
"grad_norm": 7.732473373413086,
"learning_rate": 8.070836537307536e-07,
"loss": 0.38886566162109376,
"mean_token_accuracy": 0.9289665892720222,
"num_tokens": 3285791.0,
"step": 1620
},
{
"entropy": 1.6396998748183251,
"epoch": 4.406366407043684,
"grad_norm": 15.49699592590332,
"learning_rate": 7.395747901219474e-07,
"loss": 0.3827892541885376,
"mean_token_accuracy": 0.9125935144722461,
"num_tokens": 3304914.0,
"step": 1630
},
{
"entropy": 1.6532684773206712,
"epoch": 4.433457500846597,
"grad_norm": 14.576912879943848,
"learning_rate": 6.749056411385046e-07,
"loss": 0.6813682079315185,
"mean_token_accuracy": 0.8684317111968994,
"num_tokens": 3324646.0,
"step": 1640
},
{
"entropy": 1.6200390428304672,
"epoch": 4.460548594649509,
"grad_norm": 18.16828727722168,
"learning_rate": 6.130960376115147e-07,
"loss": 0.38154261112213134,
"mean_token_accuracy": 0.8886280782520771,
"num_tokens": 3345568.0,
"step": 1650
},
{
"entropy": 1.6201925188302995,
"epoch": 4.487639688452421,
"grad_norm": 4.342578887939453,
"learning_rate": 5.541649334908405e-07,
"loss": 0.3788790464401245,
"mean_token_accuracy": 0.891268914937973,
"num_tokens": 3366108.0,
"step": 1660
},
{
"entropy": 1.6324064388871193,
"epoch": 4.5147307822553335,
"grad_norm": 10.33731460571289,
"learning_rate": 4.981304000328702e-07,
"loss": 0.491044807434082,
"mean_token_accuracy": 0.9079089991748333,
"num_tokens": 3386012.0,
"step": 1670
},
{
"entropy": 1.613644614815712,
"epoch": 4.541821876058246,
"grad_norm": 8.337615966796875,
"learning_rate": 4.450096202589671e-07,
"loss": 0.28208341598510744,
"mean_token_accuracy": 0.9069402247667313,
"num_tokens": 3406651.0,
"step": 1680
},
{
"entropy": 1.585978364944458,
"epoch": 4.568912969861158,
"grad_norm": 8.048723220825195,
"learning_rate": 3.9481888368627764e-07,
"loss": 0.27262258529663086,
"mean_token_accuracy": 0.9263891167938709,
"num_tokens": 3426691.0,
"step": 1690
},
{
"entropy": 1.6033645749092102,
"epoch": 4.59600406366407,
"grad_norm": 15.038307189941406,
"learning_rate": 3.4757358133254207e-07,
"loss": 0.6044834136962891,
"mean_token_accuracy": 0.8724760405719281,
"num_tokens": 3447608.0,
"step": 1700
},
{
"epoch": 4.59600406366407,
"eval_entropy": 1.645897411275655,
"eval_loss": 1.4024633169174194,
"eval_mean_token_accuracy": 0.7368950636591762,
"eval_num_tokens": 3447608.0,
"eval_runtime": 25.5248,
"eval_samples_per_second": 20.059,
"eval_steps_per_second": 10.029,
"step": 1700
},
{
"entropy": 1.6228346675634384,
"epoch": 4.623095157466983,
"grad_norm": 13.567054748535156,
"learning_rate": 3.032882009964322e-07,
"loss": 0.4227153301239014,
"mean_token_accuracy": 0.9056596923619509,
"num_tokens": 3467735.0,
"step": 1710
},
{
"entropy": 1.617300546169281,
"epoch": 4.650186251269895,
"grad_norm": 14.03318977355957,
"learning_rate": 2.619763228148664e-07,
"loss": 0.35500648021698,
"mean_token_accuracy": 0.9040526457130909,
"num_tokens": 3487598.0,
"step": 1720
},
{
"entropy": 1.5993121460080146,
"epoch": 4.677277345072808,
"grad_norm": 9.692215919494629,
"learning_rate": 2.236506150986395e-07,
"loss": 0.44063520431518555,
"mean_token_accuracy": 0.9209048740565777,
"num_tokens": 3508359.0,
"step": 1730
},
{
"entropy": 1.6759715333580971,
"epoch": 4.704368438875719,
"grad_norm": 19.903579711914062,
"learning_rate": 1.8832283044768585e-07,
"loss": 0.4889723300933838,
"mean_token_accuracy": 0.8778417184948921,
"num_tokens": 3527446.0,
"step": 1740
},
{
"entropy": 1.6152383774518966,
"epoch": 4.731459532678632,
"grad_norm": 3.170473337173462,
"learning_rate": 1.5600380214714216e-07,
"loss": 0.4727470397949219,
"mean_token_accuracy": 0.9017321106046439,
"num_tokens": 3547726.0,
"step": 1750
},
{
"entropy": 1.6021659523248672,
"epoch": 4.7585506264815445,
"grad_norm": 20.662057876586914,
"learning_rate": 1.2670344084530384e-07,
"loss": 0.46443953514099123,
"mean_token_accuracy": 0.8934749307110905,
"num_tokens": 3567854.0,
"step": 1760
},
{
"entropy": 1.5918526247143745,
"epoch": 4.785641720284456,
"grad_norm": 10.510283470153809,
"learning_rate": 1.0043073151452808e-07,
"loss": 0.4407022476196289,
"mean_token_accuracy": 0.9137253064662219,
"num_tokens": 3589923.0,
"step": 1770
},
{
"entropy": 1.6411705940961838,
"epoch": 4.812732814087369,
"grad_norm": 15.203192710876465,
"learning_rate": 7.719373069598246e-08,
"loss": 0.49732284545898436,
"mean_token_accuracy": 0.8905138060450554,
"num_tokens": 3610920.0,
"step": 1780
},
{
"entropy": 1.623388308286667,
"epoch": 4.839823907890281,
"grad_norm": 12.377976417541504,
"learning_rate": 5.6999564029103226e-08,
"loss": 0.4741045475006104,
"mean_token_accuracy": 0.9054140999913216,
"num_tokens": 3630913.0,
"step": 1790
},
{
"entropy": 1.5931948989629745,
"epoch": 4.866915001693194,
"grad_norm": 7.101802825927734,
"learning_rate": 3.98544240665133e-08,
"loss": 0.4587404251098633,
"mean_token_accuracy": 0.9269338101148605,
"num_tokens": 3651374.0,
"step": 1800
},
{
"epoch": 4.866915001693194,
"eval_entropy": 1.6439465275034308,
"eval_loss": 1.4104795455932617,
"eval_mean_token_accuracy": 0.736133792786859,
"eval_num_tokens": 3651374.0,
"eval_runtime": 25.4587,
"eval_samples_per_second": 20.111,
"eval_steps_per_second": 10.055,
"step": 1800
},
{
"entropy": 1.601736557483673,
"epoch": 4.894006095496105,
"grad_norm": 11.146471977233887,
"learning_rate": 2.5763568375075655e-08,
"loss": 0.5720036029815674,
"mean_token_accuracy": 0.8911033194512129,
"num_tokens": 3671445.0,
"step": 1810
},
{
"entropy": 1.60008362531662,
"epoch": 4.921097189299018,
"grad_norm": 21.521833419799805,
"learning_rate": 1.473131792365301e-08,
"loss": 0.37158544063568116,
"mean_token_accuracy": 0.9116154242306947,
"num_tokens": 3691881.0,
"step": 1820
},
{
"entropy": 1.6304287910461426,
"epoch": 4.94818828310193,
"grad_norm": 15.239692687988281,
"learning_rate": 6.761055758083279e-09,
"loss": 0.42179555892944337,
"mean_token_accuracy": 0.8883754149079323,
"num_tokens": 3711706.0,
"step": 1830
},
{
"entropy": 1.6515601187944413,
"epoch": 4.975279376904843,
"grad_norm": 11.510629653930664,
"learning_rate": 1.8552259637627524e-09,
"loss": 0.3710385799407959,
"mean_token_accuracy": 0.9058502331376076,
"num_tokens": 3733729.0,
"step": 1840
},
{
"entropy": 1.6298474122400153,
"epoch": 5.0,
"grad_norm": 8.197460174560547,
"learning_rate": 1.5332916172283718e-11,
"loss": 0.3809305429458618,
"mean_token_accuracy": 0.9352603583303216,
"num_tokens": 3752375.0,
"step": 1850
},
{
"epoch": 5.0,
"eval_entropy": 1.6423234520480037,
"eval_loss": 1.4100017547607422,
"eval_mean_token_accuracy": 0.7342472999589518,
"eval_num_tokens": 3752375.0,
"eval_runtime": 25.4872,
"eval_samples_per_second": 20.089,
"eval_steps_per_second": 10.044,
"step": 1850
},
{
"epoch": 5.0,
"step": 1850,
"total_flos": 1.69605163656192e+17,
"train_loss": 0.9120298720694877,
"train_runtime": 3361.88,
"train_samples_per_second": 4.392,
"train_steps_per_second": 0.55
}
],
"logging_steps": 10,
"max_steps": 1850,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.69605163656192e+17,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}