{ "best_global_step": 100, "best_metric": 0.9651781320571899, "best_model_checkpoint": "/data6/jongbinwon/evolving_MoE/checkpoints/sft_llama31_8b_sni_domain-c_58325_ffn_only_5ep/checkpoint-100", "epoch": 5.0, "eval_steps": 100, "global_step": 1850, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.723238617181778, "epoch": 0.027091093802912292, "grad_norm": 7.612579345703125, "learning_rate": 3.2142857142857147e-06, "loss": 2.066279411315918, "mean_token_accuracy": 0.448427795805037, "num_tokens": 21087.0, "step": 10 }, { "entropy": 1.7370752662420272, "epoch": 0.054182187605824585, "grad_norm": 7.184020519256592, "learning_rate": 6.785714285714287e-06, "loss": 2.6899890899658203, "mean_token_accuracy": 0.42496111439540984, "num_tokens": 41335.0, "step": 20 }, { "entropy": 1.843221677839756, "epoch": 0.08127328140873688, "grad_norm": 6.231059551239014, "learning_rate": 1.0357142857142859e-05, "loss": 2.398647117614746, "mean_token_accuracy": 0.5065225204452872, "num_tokens": 61686.0, "step": 30 }, { "entropy": 1.9891791179776193, "epoch": 0.10836437521164917, "grad_norm": 4.975241184234619, "learning_rate": 1.3928571428571429e-05, "loss": 2.2226634979248048, "mean_token_accuracy": 0.6003633574582636, "num_tokens": 81480.0, "step": 40 }, { "entropy": 2.2568055972456933, "epoch": 0.13545546901456146, "grad_norm": 1.7063878774642944, "learning_rate": 1.7500000000000002e-05, "loss": 2.1289892196655273, "mean_token_accuracy": 0.6060962343588472, "num_tokens": 102256.0, "step": 50 }, { "entropy": 2.282596044242382, "epoch": 0.16254656281747376, "grad_norm": 4.551100254058838, "learning_rate": 1.9999862004036567e-05, "loss": 1.528597068786621, "mean_token_accuracy": 0.6501126736402512, "num_tokens": 120836.0, "step": 60 }, { "entropy": 2.3089130371809006, "epoch": 0.18963765662038604, "grad_norm": 4.84531307220459, "learning_rate": 1.9997408848413494e-05, "loss": 1.4672578811645507, "mean_token_accuracy": 0.6635637952014803, "num_tokens": 142008.0, "step": 70 }, { "entropy": 2.4036191523075106, "epoch": 0.21672875042329834, "grad_norm": 4.140300750732422, "learning_rate": 1.9991889981715696e-05, "loss": 1.7146993637084962, "mean_token_accuracy": 0.6447907727211714, "num_tokens": 162908.0, "step": 80 }, { "entropy": 2.402925634384155, "epoch": 0.24381984422621064, "grad_norm": 3.240445613861084, "learning_rate": 1.9983307096306773e-05, "loss": 1.5633929252624512, "mean_token_accuracy": 0.6392208762466908, "num_tokens": 183267.0, "step": 90 }, { "entropy": 2.254238374531269, "epoch": 0.2709109380291229, "grad_norm": 2.4666740894317627, "learning_rate": 1.997166282413338e-05, "loss": 1.3440716743469239, "mean_token_accuracy": 0.66012231297791, "num_tokens": 203918.0, "step": 100 }, { "epoch": 0.2709109380291229, "eval_entropy": 2.094589021988213, "eval_loss": 0.9651781320571899, "eval_mean_token_accuracy": 0.764254976878874, "eval_num_tokens": 203918.0, "eval_runtime": 25.5717, "eval_samples_per_second": 20.022, "eval_steps_per_second": 10.011, "step": 100 }, { "entropy": 2.216274145245552, "epoch": 0.2980020318320352, "grad_norm": 3.9435603618621826, "learning_rate": 1.995696073591817e-05, "loss": 1.493989849090576, "mean_token_accuracy": 0.6519980503246188, "num_tokens": 222513.0, "step": 110 }, { "entropy": 2.2828305318951605, "epoch": 0.3250931256349475, "grad_norm": 3.6630003452301025, "learning_rate": 1.9939205340064793e-05, "loss": 1.638005256652832, "mean_token_accuracy": 0.6362768037244677, "num_tokens": 240852.0, "step": 120 }, { "entropy": 2.2786295488476753, "epoch": 0.3521842194378598, "grad_norm": 4.0613274574279785, "learning_rate": 1.991840208127543e-05, "loss": 1.3484866142272949, "mean_token_accuracy": 0.708053832501173, "num_tokens": 260786.0, "step": 130 }, { "entropy": 2.239742587506771, "epoch": 0.37927531324077207, "grad_norm": 3.4148905277252197, "learning_rate": 1.989455733888115e-05, "loss": 1.4180074691772462, "mean_token_accuracy": 0.6825597375631333, "num_tokens": 280647.0, "step": 140 }, { "entropy": 2.224020117521286, "epoch": 0.4063664070436844, "grad_norm": 4.721391677856445, "learning_rate": 1.986767842488569e-05, "loss": 1.2252963066101075, "mean_token_accuracy": 0.6958539757877589, "num_tokens": 301192.0, "step": 150 }, { "entropy": 2.1590186595916747, "epoch": 0.4334575008465967, "grad_norm": 3.9556772708892822, "learning_rate": 1.9837773581723215e-05, "loss": 1.5099032402038575, "mean_token_accuracy": 0.6419584900140762, "num_tokens": 321679.0, "step": 160 }, { "entropy": 2.2231348380446434, "epoch": 0.460548594649509, "grad_norm": 3.490177869796753, "learning_rate": 1.980485197973079e-05, "loss": 1.6476173400878906, "mean_token_accuracy": 0.6805331652984024, "num_tokens": 342221.0, "step": 170 }, { "entropy": 2.24891133159399, "epoch": 0.4876396884524213, "grad_norm": 4.099713325500488, "learning_rate": 1.9768923714336274e-05, "loss": 1.315092182159424, "mean_token_accuracy": 0.6847983291372657, "num_tokens": 362847.0, "step": 180 }, { "entropy": 2.1428863570094108, "epoch": 0.5147307822553335, "grad_norm": 3.966991901397705, "learning_rate": 1.9729999802962555e-05, "loss": 1.2681650161743163, "mean_token_accuracy": 0.7244645357131958, "num_tokens": 384086.0, "step": 190 }, { "entropy": 2.2040064856410027, "epoch": 0.5418218760582458, "grad_norm": 3.2430970668792725, "learning_rate": 1.9688092181649065e-05, "loss": 1.3249666213989257, "mean_token_accuracy": 0.722496079467237, "num_tokens": 404677.0, "step": 200 }, { "epoch": 0.5418218760582458, "eval_entropy": 2.0920665017329156, "eval_loss": 0.9940700531005859, "eval_mean_token_accuracy": 0.757662381103728, "eval_num_tokens": 404677.0, "eval_runtime": 25.5435, "eval_samples_per_second": 20.044, "eval_steps_per_second": 10.022, "step": 200 }, { "entropy": 2.156522032618523, "epoch": 0.5689129698611581, "grad_norm": 4.980217933654785, "learning_rate": 1.964321370139157e-05, "loss": 1.298858070373535, "mean_token_accuracy": 0.7201794616878032, "num_tokens": 426644.0, "step": 210 }, { "entropy": 2.1643049642443657, "epoch": 0.5960040636640704, "grad_norm": 5.744068145751953, "learning_rate": 1.9595378124201402e-05, "loss": 1.2987921714782715, "mean_token_accuracy": 0.7069474339485169, "num_tokens": 446791.0, "step": 220 }, { "entropy": 2.177510863542557, "epoch": 0.6230951574669827, "grad_norm": 8.363221168518066, "learning_rate": 1.9544600118885356e-05, "loss": 1.4281065940856934, "mean_token_accuracy": 0.7097761157900095, "num_tokens": 466287.0, "step": 230 }, { "entropy": 2.2098993390798567, "epoch": 0.650186251269895, "grad_norm": 4.0296220779418945, "learning_rate": 1.9490895256547465e-05, "loss": 1.0510370254516601, "mean_token_accuracy": 0.7287774980068207, "num_tokens": 485912.0, "step": 240 }, { "entropy": 2.194219082593918, "epoch": 0.6772773450728073, "grad_norm": 4.584537982940674, "learning_rate": 1.9434280005814115e-05, "loss": 1.5170968055725098, "mean_token_accuracy": 0.6617882775142789, "num_tokens": 506698.0, "step": 250 }, { "entropy": 2.1990948766469955, "epoch": 0.7043684388757196, "grad_norm": 2.1026809215545654, "learning_rate": 1.9374771727783956e-05, "loss": 1.2185900688171387, "mean_token_accuracy": 0.6906542837619781, "num_tokens": 526063.0, "step": 260 }, { "entropy": 2.1788215398788453, "epoch": 0.731459532678632, "grad_norm": 3.8161611557006836, "learning_rate": 1.931238867070408e-05, "loss": 1.3875349044799805, "mean_token_accuracy": 0.7175548300147057, "num_tokens": 547940.0, "step": 270 }, { "entropy": 2.1797836825251578, "epoch": 0.7585506264815441, "grad_norm": 4.361836910247803, "learning_rate": 1.924714996437421e-05, "loss": 1.4559088706970216, "mean_token_accuracy": 0.6750684441998601, "num_tokens": 567784.0, "step": 280 }, { "entropy": 2.192278742790222, "epoch": 0.7856417202844564, "grad_norm": 5.223799705505371, "learning_rate": 1.9179075614280513e-05, "loss": 1.3970552444458009, "mean_token_accuracy": 0.7280023746192456, "num_tokens": 587559.0, "step": 290 }, { "entropy": 2.152565708756447, "epoch": 0.8127328140873687, "grad_norm": 4.498564720153809, "learning_rate": 1.9108186495460934e-05, "loss": 1.296685028076172, "mean_token_accuracy": 0.6948160078376532, "num_tokens": 608955.0, "step": 300 }, { "epoch": 0.8127328140873687, "eval_entropy": 2.086765900719911, "eval_loss": 0.9978444576263428, "eval_mean_token_accuracy": 0.7629395253607072, "eval_num_tokens": 608955.0, "eval_runtime": 25.5161, "eval_samples_per_second": 20.066, "eval_steps_per_second": 10.033, "step": 300 }, { "entropy": 2.2242535188794137, "epoch": 0.839823907890281, "grad_norm": 4.154886245727539, "learning_rate": 1.9034504346103825e-05, "loss": 1.5084619522094727, "mean_token_accuracy": 0.699345251917839, "num_tokens": 629498.0, "step": 310 }, { "entropy": 2.2500312089920045, "epoch": 0.8669150016931934, "grad_norm": 3.7556686401367188, "learning_rate": 1.8958051760881938e-05, "loss": 1.3967250823974608, "mean_token_accuracy": 0.6777329007163644, "num_tokens": 648909.0, "step": 320 }, { "entropy": 2.270790347456932, "epoch": 0.8940060954961057, "grad_norm": 5.752708911895752, "learning_rate": 1.8878852184023754e-05, "loss": 1.2833734512329102, "mean_token_accuracy": 0.6765352768823505, "num_tokens": 667376.0, "step": 330 }, { "entropy": 2.1318136006593704, "epoch": 0.921097189299018, "grad_norm": 4.369615077972412, "learning_rate": 1.879692990212428e-05, "loss": 1.2982247352600098, "mean_token_accuracy": 0.7231215512380004, "num_tokens": 689776.0, "step": 340 }, { "entropy": 2.179507865011692, "epoch": 0.9481882831019303, "grad_norm": 3.208723783493042, "learning_rate": 1.8712310036697575e-05, "loss": 1.279671859741211, "mean_token_accuracy": 0.7093656450510025, "num_tokens": 710374.0, "step": 350 }, { "entropy": 2.1694433763623238, "epoch": 0.9752793769048426, "grad_norm": 6.71851110458374, "learning_rate": 1.8625018536473204e-05, "loss": 1.485358428955078, "mean_token_accuracy": 0.6655262919142843, "num_tokens": 731208.0, "step": 360 }, { "entropy": 2.1039708019935923, "epoch": 1.0, "grad_norm": 5.395904064178467, "learning_rate": 1.8535082169439057e-05, "loss": 1.3225526809692383, "mean_token_accuracy": 0.7076871527792656, "num_tokens": 750475.0, "step": 370 }, { "entropy": 2.1732485339045526, "epoch": 1.0270910938029123, "grad_norm": 3.098240852355957, "learning_rate": 1.844252851463292e-05, "loss": 1.514673614501953, "mean_token_accuracy": 0.7053313782438636, "num_tokens": 772399.0, "step": 380 }, { "entropy": 2.1763458222150804, "epoch": 1.0541821876058246, "grad_norm": 3.707331895828247, "learning_rate": 1.834738595368536e-05, "loss": 1.0740927696228026, "mean_token_accuracy": 0.7563056144863367, "num_tokens": 792378.0, "step": 390 }, { "entropy": 2.171446980535984, "epoch": 1.081273281408737, "grad_norm": 5.769153594970703, "learning_rate": 1.824968366211648e-05, "loss": 1.2906767845153808, "mean_token_accuracy": 0.7230573301203549, "num_tokens": 811796.0, "step": 400 }, { "epoch": 1.081273281408737, "eval_entropy": 2.0477666831575334, "eval_loss": 1.0081422328948975, "eval_mean_token_accuracy": 0.7632476337021217, "eval_num_tokens": 811796.0, "eval_runtime": 25.4904, "eval_samples_per_second": 20.086, "eval_steps_per_second": 10.043, "step": 400 }, { "entropy": 2.1150058075785636, "epoch": 1.1083643752116492, "grad_norm": 4.51067590713501, "learning_rate": 1.8149451600389207e-05, "loss": 1.3508639335632324, "mean_token_accuracy": 0.7513733027502895, "num_tokens": 832769.0, "step": 410 }, { "entropy": 2.1037127494812013, "epoch": 1.1354554690145615, "grad_norm": 2.397596836090088, "learning_rate": 1.8046720504721938e-05, "loss": 1.0258020401000976, "mean_token_accuracy": 0.74247965849936, "num_tokens": 853670.0, "step": 420 }, { "entropy": 2.0551841765642167, "epoch": 1.1625465628174738, "grad_norm": 9.206628799438477, "learning_rate": 1.794152187766323e-05, "loss": 1.1884271621704101, "mean_token_accuracy": 0.7030579019337893, "num_tokens": 874009.0, "step": 430 }, { "entropy": 2.0734852880239485, "epoch": 1.1896376566203861, "grad_norm": 4.471444129943848, "learning_rate": 1.783388797843154e-05, "loss": 1.2394503593444823, "mean_token_accuracy": 0.7340864278376102, "num_tokens": 895613.0, "step": 440 }, { "entropy": 2.134996885061264, "epoch": 1.2167287504232984, "grad_norm": 6.01848840713501, "learning_rate": 1.77238518130229e-05, "loss": 1.227487850189209, "mean_token_accuracy": 0.7364656325429678, "num_tokens": 914468.0, "step": 450 }, { "entropy": 2.061158812046051, "epoch": 1.2438198442262107, "grad_norm": 12.69832992553711, "learning_rate": 1.761144712408965e-05, "loss": 1.221731185913086, "mean_token_accuracy": 0.7208205627277493, "num_tokens": 936076.0, "step": 460 }, { "entropy": 2.1015277206897736, "epoch": 1.270910938029123, "grad_norm": 3.7558536529541016, "learning_rate": 1.749670838059318e-05, "loss": 0.9690493583679199, "mean_token_accuracy": 0.7604702278971672, "num_tokens": 956253.0, "step": 470 }, { "entropy": 2.1128511682152746, "epoch": 1.298002031832035, "grad_norm": 7.6537275314331055, "learning_rate": 1.7379670767234045e-05, "loss": 1.0514067649841308, "mean_token_accuracy": 0.7440206557512283, "num_tokens": 976137.0, "step": 480 }, { "entropy": 2.106458379328251, "epoch": 1.3250931256349476, "grad_norm": 7.5504045486450195, "learning_rate": 1.7260370173662543e-05, "loss": 1.0261421203613281, "mean_token_accuracy": 0.7460719928145408, "num_tokens": 995767.0, "step": 490 }, { "entropy": 2.118429370224476, "epoch": 1.3521842194378597, "grad_norm": 4.931035995483398, "learning_rate": 1.7138843183473127e-05, "loss": 1.5636432647705079, "mean_token_accuracy": 0.7403618179261684, "num_tokens": 1015342.0, "step": 500 }, { "epoch": 1.3521842194378597, "eval_entropy": 1.9999370207078755, "eval_loss": 1.032294511795044, "eval_mean_token_accuracy": 0.7589045927161351, "eval_num_tokens": 1015342.0, "eval_runtime": 25.5016, "eval_samples_per_second": 20.077, "eval_steps_per_second": 10.039, "step": 500 }, { "entropy": 2.124773620069027, "epoch": 1.379275313240772, "grad_norm": 10.168334007263184, "learning_rate": 1.7015127062986044e-05, "loss": 0.8846927642822265, "mean_token_accuracy": 0.7411885142326355, "num_tokens": 1034010.0, "step": 510 }, { "entropy": 2.0986449405550958, "epoch": 1.4063664070436843, "grad_norm": 6.97003698348999, "learning_rate": 1.6889259749819568e-05, "loss": 1.023176383972168, "mean_token_accuracy": 0.7303699310868979, "num_tokens": 1053408.0, "step": 520 }, { "entropy": 2.1111062809824945, "epoch": 1.4334575008465966, "grad_norm": 5.16034460067749, "learning_rate": 1.6761279841256437e-05, "loss": 1.3746380805969238, "mean_token_accuracy": 0.7154265632852912, "num_tokens": 1074316.0, "step": 530 }, { "entropy": 2.071941052377224, "epoch": 1.460548594649509, "grad_norm": 5.507922649383545, "learning_rate": 1.6631226582407954e-05, "loss": 1.3437743186950684, "mean_token_accuracy": 0.6885566545650363, "num_tokens": 1094208.0, "step": 540 }, { "entropy": 2.1154344886541367, "epoch": 1.4876396884524212, "grad_norm": 3.5610263347625732, "learning_rate": 1.649913985417946e-05, "loss": 1.1012388229370118, "mean_token_accuracy": 0.7634946122765541, "num_tokens": 1113777.0, "step": 550 }, { "entropy": 2.0671692818403242, "epoch": 1.5147307822553335, "grad_norm": 8.337108612060547, "learning_rate": 1.636506016104084e-05, "loss": 1.3132530212402345, "mean_token_accuracy": 0.7397821169346571, "num_tokens": 1133996.0, "step": 560 }, { "entropy": 2.0944964781403543, "epoch": 1.5418218760582458, "grad_norm": 7.714909076690674, "learning_rate": 1.6229028618605776e-05, "loss": 0.8892477035522461, "mean_token_accuracy": 0.7313346045091749, "num_tokens": 1154047.0, "step": 570 }, { "entropy": 2.0559984400868414, "epoch": 1.5689129698611581, "grad_norm": 6.229889392852783, "learning_rate": 1.609108694102366e-05, "loss": 0.9835987091064453, "mean_token_accuracy": 0.7751555263996124, "num_tokens": 1174616.0, "step": 580 }, { "entropy": 2.054904416203499, "epoch": 1.5960040636640704, "grad_norm": 3.5100467205047607, "learning_rate": 1.59512774281879e-05, "loss": 0.7898230075836181, "mean_token_accuracy": 0.7902765288949013, "num_tokens": 1194173.0, "step": 590 }, { "entropy": 2.0093825444579125, "epoch": 1.6230951574669827, "grad_norm": 5.0431742668151855, "learning_rate": 1.580964295276463e-05, "loss": 1.0017314910888673, "mean_token_accuracy": 0.7571999192237854, "num_tokens": 1214366.0, "step": 600 }, { "epoch": 1.6230951574669827, "eval_entropy": 1.9694703868590295, "eval_loss": 1.0424904823303223, "eval_mean_token_accuracy": 0.7560218448052183, "eval_num_tokens": 1214366.0, "eval_runtime": 25.5499, "eval_samples_per_second": 20.039, "eval_steps_per_second": 10.02, "step": 600 }, { "entropy": 2.0107428073883056, "epoch": 1.650186251269895, "grad_norm": 7.987220287322998, "learning_rate": 1.5666226947045814e-05, "loss": 1.3089231491088866, "mean_token_accuracy": 0.7401313630864024, "num_tokens": 1236562.0, "step": 610 }, { "entropy": 2.046839062869549, "epoch": 1.6772773450728073, "grad_norm": 6.632065296173096, "learning_rate": 1.552107338963067e-05, "loss": 0.9845743179321289, "mean_token_accuracy": 0.755998631566763, "num_tokens": 1257112.0, "step": 620 }, { "entropy": 2.1148023292422296, "epoch": 1.7043684388757196, "grad_norm": 8.282198905944824, "learning_rate": 1.5374226791939628e-05, "loss": 1.3935293197631835, "mean_token_accuracy": 0.7302353219129145, "num_tokens": 1276577.0, "step": 630 }, { "entropy": 2.0933067336678506, "epoch": 1.731459532678632, "grad_norm": 5.363010406494141, "learning_rate": 1.5225732184564886e-05, "loss": 1.2860239028930665, "mean_token_accuracy": 0.7248616352677345, "num_tokens": 1296086.0, "step": 640 }, { "entropy": 2.1054985627532004, "epoch": 1.758550626481544, "grad_norm": 4.800771236419678, "learning_rate": 1.5075635103461731e-05, "loss": 1.2266152381896973, "mean_token_accuracy": 0.7662290595471859, "num_tokens": 1316442.0, "step": 650 }, { "entropy": 2.1522702112793923, "epoch": 1.7856417202844566, "grad_norm": 3.5823662281036377, "learning_rate": 1.4923981575984936e-05, "loss": 1.0100022315979005, "mean_token_accuracy": 0.7728497218340635, "num_tokens": 1337169.0, "step": 660 }, { "entropy": 2.1094584688544273, "epoch": 1.8127328140873686, "grad_norm": 5.589018821716309, "learning_rate": 1.4770818106774427e-05, "loss": 1.0324097633361817, "mean_token_accuracy": 0.7925379849970341, "num_tokens": 1357759.0, "step": 670 }, { "entropy": 2.182632897794247, "epoch": 1.8398239078902812, "grad_norm": 7.491511344909668, "learning_rate": 1.4616191663494619e-05, "loss": 1.3248936653137207, "mean_token_accuracy": 0.7274331038817763, "num_tokens": 1378191.0, "step": 680 }, { "entropy": 2.1101855129003524, "epoch": 1.8669150016931932, "grad_norm": 6.318648815155029, "learning_rate": 1.4460149662431749e-05, "loss": 1.054247760772705, "mean_token_accuracy": 0.7554519359022379, "num_tokens": 1397881.0, "step": 690 }, { "entropy": 2.096898023784161, "epoch": 1.8940060954961058, "grad_norm": 6.2741875648498535, "learning_rate": 1.430273995395365e-05, "loss": 1.0373686790466308, "mean_token_accuracy": 0.7596361611038447, "num_tokens": 1418877.0, "step": 700 }, { "epoch": 1.8940060954961058, "eval_entropy": 2.013828214723617, "eval_loss": 1.0287954807281494, "eval_mean_token_accuracy": 0.7496589213842526, "eval_num_tokens": 1418877.0, "eval_runtime": 25.4995, "eval_samples_per_second": 20.079, "eval_steps_per_second": 10.039, "step": 700 }, { "entropy": 2.0728593289852144, "epoch": 1.9210971892990178, "grad_norm": 6.076820373535156, "learning_rate": 1.4144010807836412e-05, "loss": 1.0167503356933594, "mean_token_accuracy": 0.7612185761332512, "num_tokens": 1439198.0, "step": 710 }, { "entropy": 2.11173554956913, "epoch": 1.9481882831019304, "grad_norm": 6.451402187347412, "learning_rate": 1.3984010898462417e-05, "loss": 1.089035415649414, "mean_token_accuracy": 0.7369910277426243, "num_tokens": 1461226.0, "step": 720 }, { "entropy": 2.0723678693175316, "epoch": 1.9752793769048425, "grad_norm": 5.50106954574585, "learning_rate": 1.3822789289894316e-05, "loss": 0.9883082389831543, "mean_token_accuracy": 0.7898955499753356, "num_tokens": 1482366.0, "step": 730 }, { "entropy": 2.0618706647663902, "epoch": 2.0, "grad_norm": 50.42632293701172, "learning_rate": 1.3660395420829516e-05, "loss": 0.8657957077026367, "mean_token_accuracy": 0.7464919359716651, "num_tokens": 1500950.0, "step": 740 }, { "entropy": 2.050840379297733, "epoch": 2.027091093802912, "grad_norm": 6.361630439758301, "learning_rate": 1.3496879089439761e-05, "loss": 0.8690568923950195, "mean_token_accuracy": 0.7947060691192747, "num_tokens": 1519798.0, "step": 750 }, { "entropy": 1.926042178273201, "epoch": 2.0541821876058246, "grad_norm": 2.3748672008514404, "learning_rate": 1.3332290438100508e-05, "loss": 0.8486003875732422, "mean_token_accuracy": 0.8309563081711531, "num_tokens": 1539927.0, "step": 760 }, { "entropy": 1.8769470036029816, "epoch": 2.0812732814087367, "grad_norm": 8.954164505004883, "learning_rate": 1.3166679938014728e-05, "loss": 0.7576936244964599, "mean_token_accuracy": 0.8146512515842914, "num_tokens": 1560176.0, "step": 770 }, { "entropy": 1.8487665757536889, "epoch": 2.108364375211649, "grad_norm": 8.518715858459473, "learning_rate": 1.3000098373735885e-05, "loss": 0.9359015464782715, "mean_token_accuracy": 0.788595624268055, "num_tokens": 1579888.0, "step": 780 }, { "entropy": 1.8781982406973838, "epoch": 2.1354554690145613, "grad_norm": 5.680595397949219, "learning_rate": 1.283259682759484e-05, "loss": 0.9370273590087891, "mean_token_accuracy": 0.7608782526105642, "num_tokens": 1601141.0, "step": 790 }, { "entropy": 1.9456540763378143, "epoch": 2.162546562817474, "grad_norm": 5.94552755355835, "learning_rate": 1.266422666403539e-05, "loss": 0.9432417869567871, "mean_token_accuracy": 0.8288755964487791, "num_tokens": 1621542.0, "step": 800 }, { "epoch": 2.162546562817474, "eval_entropy": 1.9436165052466094, "eval_loss": 1.06016206741333, "eval_mean_token_accuracy": 0.7518258688505739, "eval_num_tokens": 1621542.0, "eval_runtime": 25.5171, "eval_samples_per_second": 20.065, "eval_steps_per_second": 10.032, "step": 800 }, { "entropy": 1.9728469848632812, "epoch": 2.189637656620386, "grad_norm": 7.825141906738281, "learning_rate": 1.2495039513863378e-05, "loss": 1.036830997467041, "mean_token_accuracy": 0.8224836468696595, "num_tokens": 1641245.0, "step": 810 }, { "entropy": 1.9231234237551689, "epoch": 2.2167287504232984, "grad_norm": 6.70737361907959, "learning_rate": 1.2325087258414039e-05, "loss": 0.7759229183197022, "mean_token_accuracy": 0.8049912886694074, "num_tokens": 1663067.0, "step": 820 }, { "entropy": 1.8155759632587434, "epoch": 2.2438198442262105, "grad_norm": 9.183692932128906, "learning_rate": 1.2154422013642575e-05, "loss": 0.8489904403686523, "mean_token_accuracy": 0.8039800453931093, "num_tokens": 1683171.0, "step": 830 }, { "entropy": 1.9373584493994713, "epoch": 2.270910938029123, "grad_norm": 6.903590679168701, "learning_rate": 1.1983096114142773e-05, "loss": 1.001230525970459, "mean_token_accuracy": 0.7758175190538168, "num_tokens": 1702798.0, "step": 840 }, { "entropy": 2.008491799235344, "epoch": 2.298002031832035, "grad_norm": 7.595852375030518, "learning_rate": 1.1811162097098559e-05, "loss": 0.9919692039489746, "mean_token_accuracy": 0.8151415549218655, "num_tokens": 1722315.0, "step": 850 }, { "entropy": 1.9535631239414215, "epoch": 2.3250931256349476, "grad_norm": 8.800715446472168, "learning_rate": 1.1638672686173453e-05, "loss": 0.7722007274627686, "mean_token_accuracy": 0.8053982924669981, "num_tokens": 1741922.0, "step": 860 }, { "entropy": 1.9666619777679444, "epoch": 2.3521842194378597, "grad_norm": 5.499095916748047, "learning_rate": 1.1465680775342821e-05, "loss": 1.0401187896728517, "mean_token_accuracy": 0.7628452027216553, "num_tokens": 1761561.0, "step": 870 }, { "entropy": 1.9506760001182557, "epoch": 2.3792753132407722, "grad_norm": 15.519598007202148, "learning_rate": 1.1292239412673906e-05, "loss": 0.9919161796569824, "mean_token_accuracy": 0.7912353215739131, "num_tokens": 1781403.0, "step": 880 }, { "entropy": 1.8824239298701286, "epoch": 2.4063664070436843, "grad_norm": 8.007031440734863, "learning_rate": 1.1118401784058612e-05, "loss": 0.8426601409912109, "mean_token_accuracy": 0.8043077282607556, "num_tokens": 1803471.0, "step": 890 }, { "entropy": 1.9203020244836808, "epoch": 2.433457500846597, "grad_norm": 8.088946342468262, "learning_rate": 1.0944221196904029e-05, "loss": 1.0317404747009278, "mean_token_accuracy": 0.7911908756941557, "num_tokens": 1823668.0, "step": 900 }, { "epoch": 2.433457500846597, "eval_entropy": 1.8476642882451415, "eval_loss": 1.102004051208496, "eval_mean_token_accuracy": 0.7586654123151675, "eval_num_tokens": 1823668.0, "eval_runtime": 25.5319, "eval_samples_per_second": 20.053, "eval_steps_per_second": 10.027, "step": 900 }, { "entropy": 1.8842667803168296, "epoch": 2.460548594649509, "grad_norm": 10.67811393737793, "learning_rate": 1.0769751063785661e-05, "loss": 0.7327501773834229, "mean_token_accuracy": 0.7824661247432232, "num_tokens": 1844175.0, "step": 910 }, { "entropy": 1.8312113255262374, "epoch": 2.4876396884524214, "grad_norm": 5.517256736755371, "learning_rate": 1.0595044886068457e-05, "loss": 0.6679872512817383, "mean_token_accuracy": 0.8325993716716766, "num_tokens": 1864323.0, "step": 920 }, { "entropy": 1.820173794031143, "epoch": 2.5147307822553335, "grad_norm": 5.745193958282471, "learning_rate": 1.0420156237500571e-05, "loss": 0.6937276363372803, "mean_token_accuracy": 0.8053716959431767, "num_tokens": 1884326.0, "step": 930 }, { "entropy": 1.8793843016028404, "epoch": 2.541821876058246, "grad_norm": 7.830550670623779, "learning_rate": 1.0245138747784953e-05, "loss": 0.8545784950256348, "mean_token_accuracy": 0.8472533781081438, "num_tokens": 1904095.0, "step": 940 }, { "entropy": 1.8013970047235488, "epoch": 2.568912969861158, "grad_norm": 6.052741527557373, "learning_rate": 1.007004608613375e-05, "loss": 0.7021704196929932, "mean_token_accuracy": 0.8472875323146581, "num_tokens": 1924391.0, "step": 950 }, { "entropy": 1.9338349267840385, "epoch": 2.59600406366407, "grad_norm": 12.163394927978516, "learning_rate": 9.89493194481064e-06, "loss": 0.9507933616638183, "mean_token_accuracy": 0.807798033207655, "num_tokens": 1944746.0, "step": 960 }, { "entropy": 1.879988330602646, "epoch": 2.6230951574669827, "grad_norm": 6.659127712249756, "learning_rate": 9.719850022666044e-06, "loss": 0.6338046550750732, "mean_token_accuracy": 0.8415262099355459, "num_tokens": 1967427.0, "step": 970 }, { "entropy": 1.890741939842701, "epoch": 2.6501862512698953, "grad_norm": 9.862802505493164, "learning_rate": 9.544854008670366e-06, "loss": 0.7429360389709473, "mean_token_accuracy": 0.8043466622009874, "num_tokens": 1986505.0, "step": 980 }, { "entropy": 1.8231979936361313, "epoch": 2.6772773450728073, "grad_norm": 11.50146198272705, "learning_rate": 9.369997565450214e-06, "loss": 1.0342053413391112, "mean_token_accuracy": 0.7860685650259256, "num_tokens": 2006357.0, "step": 990 }, { "entropy": 1.8516354262828827, "epoch": 2.7043684388757194, "grad_norm": 3.143589973449707, "learning_rate": 9.195334312832742e-06, "loss": 0.8172811508178711, "mean_token_accuracy": 0.8135180365294218, "num_tokens": 2026498.0, "step": 1000 }, { "epoch": 2.7043684388757194, "eval_entropy": 1.853846381418407, "eval_loss": 1.0932104587554932, "eval_mean_token_accuracy": 0.7503726394497789, "eval_num_tokens": 2026498.0, "eval_runtime": 25.4801, "eval_samples_per_second": 20.094, "eval_steps_per_second": 10.047, "step": 1000 }, { "entropy": 1.9358359456062317, "epoch": 2.731459532678632, "grad_norm": 5.799363136291504, "learning_rate": 9.020917811403104e-06, "loss": 0.7895758152008057, "mean_token_accuracy": 0.8083623085170984, "num_tokens": 2045459.0, "step": 1010 }, { "entropy": 1.9362391978502274, "epoch": 2.758550626481544, "grad_norm": 4.842373371124268, "learning_rate": 8.846801546080062e-06, "loss": 0.836983585357666, "mean_token_accuracy": 0.8126423776149749, "num_tokens": 2066518.0, "step": 1020 }, { "entropy": 1.91400406062603, "epoch": 2.7856417202844566, "grad_norm": 7.656473636627197, "learning_rate": 8.673038909714792e-06, "loss": 0.7076562881469727, "mean_token_accuracy": 0.8479138355702162, "num_tokens": 2086183.0, "step": 1030 }, { "entropy": 1.8541285216808319, "epoch": 2.8127328140873686, "grad_norm": 9.124068260192871, "learning_rate": 8.499683186717964e-06, "loss": 0.9584396362304688, "mean_token_accuracy": 0.7849915137514472, "num_tokens": 2107721.0, "step": 1040 }, { "entropy": 1.798606288433075, "epoch": 2.839823907890281, "grad_norm": 11.562939643859863, "learning_rate": 8.326787536720037e-06, "loss": 0.9054560661315918, "mean_token_accuracy": 0.7929567001760006, "num_tokens": 2130459.0, "step": 1050 }, { "entropy": 1.9321310743689537, "epoch": 2.8669150016931932, "grad_norm": 12.520683288574219, "learning_rate": 8.154404978269808e-06, "loss": 0.9787432670593261, "mean_token_accuracy": 0.7586101952940225, "num_tokens": 2150465.0, "step": 1060 }, { "entropy": 1.8978336572647094, "epoch": 2.8940060954961058, "grad_norm": 6.707414627075195, "learning_rate": 7.982588372576274e-06, "loss": 0.8695780754089355, "mean_token_accuracy": 0.8042063070461154, "num_tokens": 2171901.0, "step": 1070 }, { "entropy": 1.911924734711647, "epoch": 2.921097189299018, "grad_norm": 10.575072288513184, "learning_rate": 7.811390407298697e-06, "loss": 1.1379961013793944, "mean_token_accuracy": 0.7801183510571719, "num_tokens": 2192878.0, "step": 1080 }, { "entropy": 1.9139499440789223, "epoch": 2.9481882831019304, "grad_norm": 9.588115692138672, "learning_rate": 7.640863580389903e-06, "loss": 0.6681862354278565, "mean_token_accuracy": 0.8321586221456527, "num_tokens": 2212872.0, "step": 1090 }, { "entropy": 1.917321428656578, "epoch": 2.9752793769048425, "grad_norm": 8.42562484741211, "learning_rate": 7.47106018399776e-06, "loss": 1.0313225746154786, "mean_token_accuracy": 0.7394453713670373, "num_tokens": 2233656.0, "step": 1100 }, { "epoch": 2.9752793769048425, "eval_entropy": 1.8692557462491095, "eval_loss": 1.1177661418914795, "eval_mean_token_accuracy": 0.7488149127457291, "eval_num_tokens": 2233656.0, "eval_runtime": 25.4569, "eval_samples_per_second": 20.112, "eval_steps_per_second": 10.056, "step": 1100 }, { "entropy": 1.9485157532234714, "epoch": 3.0, "grad_norm": 20.587278366088867, "learning_rate": 7.3020322884297565e-06, "loss": 0.7162185668945312, "mean_token_accuracy": 0.8130205739034365, "num_tokens": 2251425.0, "step": 1110 }, { "entropy": 1.8808414414525032, "epoch": 3.027091093802912, "grad_norm": 9.604867935180664, "learning_rate": 7.1338317261856225e-06, "loss": 0.6537890911102295, "mean_token_accuracy": 0.8606590256094933, "num_tokens": 2270749.0, "step": 1120 }, { "entropy": 1.7552776366472245, "epoch": 3.0541821876058246, "grad_norm": 20.14252281188965, "learning_rate": 6.966510076062845e-06, "loss": 0.6271217823028564, "mean_token_accuracy": 0.8392207693308592, "num_tokens": 2289814.0, "step": 1130 }, { "entropy": 1.7204705789685248, "epoch": 3.0812732814087367, "grad_norm": 11.636978149414062, "learning_rate": 6.800118647340022e-06, "loss": 0.6068019866943359, "mean_token_accuracy": 0.8635438393801451, "num_tokens": 2310249.0, "step": 1140 }, { "entropy": 1.7508003085851669, "epoch": 3.108364375211649, "grad_norm": 12.074075698852539, "learning_rate": 6.634708464042827e-06, "loss": 0.43173890113830565, "mean_token_accuracy": 0.8833881586790084, "num_tokens": 2329569.0, "step": 1150 }, { "entropy": 1.7503153815865518, "epoch": 3.1354554690145613, "grad_norm": 12.822123527526855, "learning_rate": 6.470330249297472e-06, "loss": 0.5606254577636719, "mean_token_accuracy": 0.8595870833843946, "num_tokens": 2350193.0, "step": 1160 }, { "entropy": 1.7921119689941407, "epoch": 3.162546562817474, "grad_norm": 15.029194831848145, "learning_rate": 6.3070344097764265e-06, "loss": 0.775139856338501, "mean_token_accuracy": 0.8431978467851877, "num_tokens": 2369022.0, "step": 1170 }, { "entropy": 1.7634284302592278, "epoch": 3.189637656620386, "grad_norm": 10.424407958984375, "learning_rate": 6.144871020241197e-06, "loss": 0.6365249156951904, "mean_token_accuracy": 0.8474900238215923, "num_tokens": 2388527.0, "step": 1180 }, { "entropy": 1.7646004989743234, "epoch": 3.2167287504232984, "grad_norm": 8.618444442749023, "learning_rate": 5.98388980818684e-06, "loss": 0.8289416313171387, "mean_token_accuracy": 0.8227736797183752, "num_tokens": 2409237.0, "step": 1190 }, { "entropy": 1.737740470468998, "epoch": 3.2438198442262105, "grad_norm": 6.645010948181152, "learning_rate": 5.8241401385930395e-06, "loss": 0.39721031188964845, "mean_token_accuracy": 0.8825947981327772, "num_tokens": 2428916.0, "step": 1200 }, { "epoch": 3.2438198442262105, "eval_entropy": 1.7245915541425347, "eval_loss": 1.2651240825653076, "eval_mean_token_accuracy": 0.7416992684593424, "eval_num_tokens": 2428916.0, "eval_runtime": 25.525, "eval_samples_per_second": 20.059, "eval_steps_per_second": 10.029, "step": 1200 }, { "entropy": 1.7320396453142166, "epoch": 3.270910938029123, "grad_norm": 9.127442359924316, "learning_rate": 5.665670998786274e-06, "loss": 0.5321141719818115, "mean_token_accuracy": 0.8595851019024849, "num_tokens": 2448191.0, "step": 1210 }, { "entropy": 1.7059780359268188, "epoch": 3.298002031832035, "grad_norm": 4.298802375793457, "learning_rate": 5.508530983417855e-06, "loss": 0.7181911468505859, "mean_token_accuracy": 0.8558499291539192, "num_tokens": 2470698.0, "step": 1220 }, { "entropy": 1.7368447184562683, "epoch": 3.3250931256349476, "grad_norm": 8.62894344329834, "learning_rate": 5.352768279562315e-06, "loss": 0.5110462188720704, "mean_token_accuracy": 0.8599414020776749, "num_tokens": 2490082.0, "step": 1230 }, { "entropy": 1.7677990421652794, "epoch": 3.3521842194378597, "grad_norm": 10.864715576171875, "learning_rate": 5.198430651940846e-06, "loss": 0.8702507972717285, "mean_token_accuracy": 0.8074817329645156, "num_tokens": 2510650.0, "step": 1240 }, { "entropy": 1.7419419810175896, "epoch": 3.3792753132407722, "grad_norm": 17.168798446655273, "learning_rate": 5.0455654282742e-06, "loss": 0.6099933624267578, "mean_token_accuracy": 0.8637857645750046, "num_tokens": 2530169.0, "step": 1250 }, { "entropy": 1.718581235408783, "epoch": 3.4063664070436843, "grad_norm": 9.985060691833496, "learning_rate": 4.894219484769622e-06, "loss": 0.38284480571746826, "mean_token_accuracy": 0.894951194524765, "num_tokens": 2549783.0, "step": 1260 }, { "entropy": 1.7342086032032966, "epoch": 3.433457500846597, "grad_norm": 7.34379768371582, "learning_rate": 4.744439231746251e-06, "loss": 0.5211464881896972, "mean_token_accuracy": 0.8848932076245546, "num_tokens": 2569240.0, "step": 1270 }, { "entropy": 1.7445754528045654, "epoch": 3.460548594649509, "grad_norm": 12.614356994628906, "learning_rate": 4.596270599403338e-06, "loss": 0.7350710391998291, "mean_token_accuracy": 0.8188348516821862, "num_tokens": 2589517.0, "step": 1280 }, { "entropy": 1.6525848761200905, "epoch": 3.4876396884524214, "grad_norm": 10.50085163116455, "learning_rate": 4.449759023735749e-06, "loss": 0.36133971214294436, "mean_token_accuracy": 0.9022616557776928, "num_tokens": 2610330.0, "step": 1290 }, { "entropy": 1.695315808057785, "epoch": 3.5147307822553335, "grad_norm": 7.3657026290893555, "learning_rate": 4.30494943260098e-06, "loss": 0.8237950325012207, "mean_token_accuracy": 0.8609236305579543, "num_tokens": 2632100.0, "step": 1300 }, { "epoch": 3.5147307822553335, "eval_entropy": 1.7062555481679738, "eval_loss": 1.265852451324463, "eval_mean_token_accuracy": 0.7387107044924051, "eval_num_tokens": 2632100.0, "eval_runtime": 25.4553, "eval_samples_per_second": 20.114, "eval_steps_per_second": 10.057, "step": 1300 }, { "entropy": 1.7215346291661262, "epoch": 3.541821876058246, "grad_norm": 9.210244178771973, "learning_rate": 4.161886231942017e-06, "loss": 0.6864943027496337, "mean_token_accuracy": 0.8675076253712177, "num_tokens": 2652389.0, "step": 1310 }, { "entropy": 1.7494278416037559, "epoch": 3.568912969861158, "grad_norm": 12.154091835021973, "learning_rate": 4.020613292170211e-06, "loss": 0.672312593460083, "mean_token_accuracy": 0.8510223753750324, "num_tokens": 2672161.0, "step": 1320 }, { "entropy": 1.7348069936037063, "epoch": 3.59600406366407, "grad_norm": 10.369400978088379, "learning_rate": 3.8811739347124e-06, "loss": 0.4440812110900879, "mean_token_accuracy": 0.8849797431379557, "num_tokens": 2693004.0, "step": 1330 }, { "entropy": 1.721322275698185, "epoch": 3.6230951574669827, "grad_norm": 4.361479759216309, "learning_rate": 3.7436109187263693e-06, "loss": 0.52271409034729, "mean_token_accuracy": 0.8836568117141723, "num_tokens": 2712634.0, "step": 1340 }, { "entropy": 1.7014023318886757, "epoch": 3.6501862512698953, "grad_norm": 15.928149223327637, "learning_rate": 3.6079664279887427e-06, "loss": 0.7015122890472412, "mean_token_accuracy": 0.8756893876940012, "num_tokens": 2732861.0, "step": 1350 }, { "entropy": 1.7075004890561103, "epoch": 3.6772773450728073, "grad_norm": 14.396157264709473, "learning_rate": 3.4742820579592673e-06, "loss": 0.5177778720855712, "mean_token_accuracy": 0.8753840968012809, "num_tokens": 2752885.0, "step": 1360 }, { "entropy": 1.6834155157208444, "epoch": 3.7043684388757194, "grad_norm": 8.488550186157227, "learning_rate": 3.342598803025595e-06, "loss": 0.619942045211792, "mean_token_accuracy": 0.8745716098695994, "num_tokens": 2773651.0, "step": 1370 }, { "entropy": 1.7230923131108284, "epoch": 3.731459532678632, "grad_norm": 13.944185256958008, "learning_rate": 3.212957043932283e-06, "loss": 0.6659866809844971, "mean_token_accuracy": 0.8391641702502965, "num_tokens": 2794243.0, "step": 1380 }, { "entropy": 1.661913888156414, "epoch": 3.758550626481544, "grad_norm": 5.620434761047363, "learning_rate": 3.085396535398044e-06, "loss": 0.40467143058776855, "mean_token_accuracy": 0.8812628626823426, "num_tokens": 2815288.0, "step": 1390 }, { "entropy": 1.6734888523817062, "epoch": 3.7856417202844566, "grad_norm": 12.459346771240234, "learning_rate": 2.959956393924922e-06, "loss": 0.4842523574829102, "mean_token_accuracy": 0.8642897168174386, "num_tokens": 2835949.0, "step": 1400 }, { "epoch": 3.7856417202844566, "eval_entropy": 1.6953813284635544, "eval_loss": 1.3081457614898682, "eval_mean_token_accuracy": 0.7404504243750125, "eval_num_tokens": 2835949.0, "eval_runtime": 25.4537, "eval_samples_per_second": 20.115, "eval_steps_per_second": 10.057, "step": 1400 }, { "entropy": 1.7142169624567032, "epoch": 3.8127328140873686, "grad_norm": 19.3244571685791, "learning_rate": 2.8366750858032177e-06, "loss": 0.7156589031219482, "mean_token_accuracy": 0.8869716469198465, "num_tokens": 2856246.0, "step": 1410 }, { "entropy": 1.6850622862577438, "epoch": 3.839823907890281, "grad_norm": 15.101435661315918, "learning_rate": 2.7155904153157497e-06, "loss": 0.45338053703308107, "mean_token_accuracy": 0.8818465910851956, "num_tokens": 2877330.0, "step": 1420 }, { "entropy": 1.7075368210673332, "epoch": 3.8669150016931932, "grad_norm": 15.861879348754883, "learning_rate": 2.5967395131451723e-06, "loss": 0.5139744758605957, "mean_token_accuracy": 0.8527137745171786, "num_tokens": 2897344.0, "step": 1430 }, { "entropy": 1.6651010170578957, "epoch": 3.8940060954961058, "grad_norm": 15.302207946777344, "learning_rate": 2.4801588249878163e-06, "loss": 0.7968846797943115, "mean_token_accuracy": 0.8468474011868239, "num_tokens": 2919143.0, "step": 1440 }, { "entropy": 1.6404287233948707, "epoch": 3.921097189299018, "grad_norm": 10.076866149902344, "learning_rate": 2.365884100377611e-06, "loss": 0.4457272529602051, "mean_token_accuracy": 0.8820912927389145, "num_tokens": 2941599.0, "step": 1450 }, { "entropy": 1.6921194523572922, "epoch": 3.9481882831019304, "grad_norm": 10.407143592834473, "learning_rate": 2.2539503817234553e-06, "loss": 0.6064411640167237, "mean_token_accuracy": 0.8608082607388496, "num_tokens": 2961983.0, "step": 1460 }, { "entropy": 1.712096980214119, "epoch": 3.9752793769048425, "grad_norm": 10.601531028747559, "learning_rate": 2.144391993563446e-06, "loss": 0.503159761428833, "mean_token_accuracy": 0.8580688439309597, "num_tokens": 2982164.0, "step": 1470 }, { "entropy": 1.6592551649433294, "epoch": 4.0, "grad_norm": 21.362045288085938, "learning_rate": 2.0372425320392454e-06, "loss": 0.5836192607879639, "mean_token_accuracy": 0.8683291808383106, "num_tokens": 3001900.0, "step": 1480 }, { "entropy": 1.6971124514937401, "epoch": 4.0270910938029125, "grad_norm": 8.777483940124512, "learning_rate": 1.932534854593795e-06, "loss": 0.6050891876220703, "mean_token_accuracy": 0.8690009146928788, "num_tokens": 3023056.0, "step": 1490 }, { "entropy": 1.63857099711895, "epoch": 4.054182187605824, "grad_norm": 8.595149040222168, "learning_rate": 1.8303010698955803e-06, "loss": 0.4310460090637207, "mean_token_accuracy": 0.8924087427556515, "num_tokens": 3043490.0, "step": 1500 }, { "epoch": 4.054182187605824, "eval_entropy": 1.669337394181639, "eval_loss": 1.3523277044296265, "eval_mean_token_accuracy": 0.7376706907525659, "eval_num_tokens": 3043490.0, "eval_runtime": 25.4594, "eval_samples_per_second": 20.11, "eval_steps_per_second": 10.055, "step": 1500 }, { "entropy": 1.6625288650393486, "epoch": 4.081273281408737, "grad_norm": 12.073065757751465, "learning_rate": 1.7305725279924634e-06, "loss": 0.3827295541763306, "mean_token_accuracy": 0.8844121858477593, "num_tokens": 3064126.0, "step": 1510 }, { "entropy": 1.6116922572255135, "epoch": 4.108364375211649, "grad_norm": 5.359347820281982, "learning_rate": 1.6333798106982024e-06, "loss": 0.3580256700515747, "mean_token_accuracy": 0.9377022050321102, "num_tokens": 3083867.0, "step": 1520 }, { "entropy": 1.591383346915245, "epoch": 4.135455469014562, "grad_norm": 6.666597843170166, "learning_rate": 1.5387527222144861e-06, "loss": 0.43925886154174804, "mean_token_accuracy": 0.918615211546421, "num_tokens": 3103679.0, "step": 1530 }, { "entropy": 1.5715536609292031, "epoch": 4.162546562817473, "grad_norm": 9.182818412780762, "learning_rate": 1.446720279991496e-06, "loss": 0.30636699199676515, "mean_token_accuracy": 0.9238971933722496, "num_tokens": 3125843.0, "step": 1540 }, { "entropy": 1.6449363514781, "epoch": 4.189637656620386, "grad_norm": 7.822624206542969, "learning_rate": 1.3573107058296619e-06, "loss": 0.45112295150756837, "mean_token_accuracy": 0.8905558969825507, "num_tokens": 3144837.0, "step": 1550 }, { "entropy": 1.5784786254167558, "epoch": 4.216728750423298, "grad_norm": 11.84586238861084, "learning_rate": 1.270551417225443e-06, "loss": 0.4005408763885498, "mean_token_accuracy": 0.9311332777142525, "num_tokens": 3163882.0, "step": 1560 }, { "entropy": 1.5929084509611129, "epoch": 4.243819844226211, "grad_norm": 18.798683166503906, "learning_rate": 1.1864690189637306e-06, "loss": 0.5499368190765381, "mean_token_accuracy": 0.8895844966173172, "num_tokens": 3185313.0, "step": 1570 }, { "entropy": 1.6276163026690482, "epoch": 4.270910938029123, "grad_norm": 18.325300216674805, "learning_rate": 1.105089294959487e-06, "loss": 0.47011642456054686, "mean_token_accuracy": 0.8977843724191189, "num_tokens": 3206038.0, "step": 1580 }, { "entropy": 1.6390855327248572, "epoch": 4.298002031832035, "grad_norm": 16.15447235107422, "learning_rate": 1.0264372003510747e-06, "loss": 0.5724862575531006, "mean_token_accuracy": 0.8626310247927904, "num_tokens": 3225061.0, "step": 1590 }, { "entropy": 1.6146731659770013, "epoch": 4.325093125634948, "grad_norm": 5.743528366088867, "learning_rate": 9.5053685384777e-07, "loss": 0.6115519046783447, "mean_token_accuracy": 0.8991932325065136, "num_tokens": 3246376.0, "step": 1600 }, { "epoch": 4.325093125634948, "eval_entropy": 1.6513289087451994, "eval_loss": 1.399103045463562, "eval_mean_token_accuracy": 0.7364511488704011, "eval_num_tokens": 3246376.0, "eval_runtime": 25.4867, "eval_samples_per_second": 20.089, "eval_steps_per_second": 10.044, "step": 1600 }, { "entropy": 1.6438001811504364, "epoch": 4.35218421943786, "grad_norm": 10.316023826599121, "learning_rate": 8.774115303337305e-07, "loss": 0.3678164005279541, "mean_token_accuracy": 0.9086852367967367, "num_tokens": 3266626.0, "step": 1610 }, { "entropy": 1.6436322793364524, "epoch": 4.379275313240772, "grad_norm": 7.732473373413086, "learning_rate": 8.070836537307536e-07, "loss": 0.38886566162109376, "mean_token_accuracy": 0.9289665892720222, "num_tokens": 3285791.0, "step": 1620 }, { "entropy": 1.6396998748183251, "epoch": 4.406366407043684, "grad_norm": 15.49699592590332, "learning_rate": 7.395747901219474e-07, "loss": 0.3827892541885376, "mean_token_accuracy": 0.9125935144722461, "num_tokens": 3304914.0, "step": 1630 }, { "entropy": 1.6532684773206712, "epoch": 4.433457500846597, "grad_norm": 14.576912879943848, "learning_rate": 6.749056411385046e-07, "loss": 0.6813682079315185, "mean_token_accuracy": 0.8684317111968994, "num_tokens": 3324646.0, "step": 1640 }, { "entropy": 1.6200390428304672, "epoch": 4.460548594649509, "grad_norm": 18.16828727722168, "learning_rate": 6.130960376115147e-07, "loss": 0.38154261112213134, "mean_token_accuracy": 0.8886280782520771, "num_tokens": 3345568.0, "step": 1650 }, { "entropy": 1.6201925188302995, "epoch": 4.487639688452421, "grad_norm": 4.342578887939453, "learning_rate": 5.541649334908405e-07, "loss": 0.3788790464401245, "mean_token_accuracy": 0.891268914937973, "num_tokens": 3366108.0, "step": 1660 }, { "entropy": 1.6324064388871193, "epoch": 4.5147307822553335, "grad_norm": 10.33731460571289, "learning_rate": 4.981304000328702e-07, "loss": 0.491044807434082, "mean_token_accuracy": 0.9079089991748333, "num_tokens": 3386012.0, "step": 1670 }, { "entropy": 1.613644614815712, "epoch": 4.541821876058246, "grad_norm": 8.337615966796875, "learning_rate": 4.450096202589671e-07, "loss": 0.28208341598510744, "mean_token_accuracy": 0.9069402247667313, "num_tokens": 3406651.0, "step": 1680 }, { "entropy": 1.585978364944458, "epoch": 4.568912969861158, "grad_norm": 8.048723220825195, "learning_rate": 3.9481888368627764e-07, "loss": 0.27262258529663086, "mean_token_accuracy": 0.9263891167938709, "num_tokens": 3426691.0, "step": 1690 }, { "entropy": 1.6033645749092102, "epoch": 4.59600406366407, "grad_norm": 15.038307189941406, "learning_rate": 3.4757358133254207e-07, "loss": 0.6044834136962891, "mean_token_accuracy": 0.8724760405719281, "num_tokens": 3447608.0, "step": 1700 }, { "epoch": 4.59600406366407, "eval_entropy": 1.645897411275655, "eval_loss": 1.4024633169174194, "eval_mean_token_accuracy": 0.7368950636591762, "eval_num_tokens": 3447608.0, "eval_runtime": 25.5248, "eval_samples_per_second": 20.059, "eval_steps_per_second": 10.029, "step": 1700 }, { "entropy": 1.6228346675634384, "epoch": 4.623095157466983, "grad_norm": 13.567054748535156, "learning_rate": 3.032882009964322e-07, "loss": 0.4227153301239014, "mean_token_accuracy": 0.9056596923619509, "num_tokens": 3467735.0, "step": 1710 }, { "entropy": 1.617300546169281, "epoch": 4.650186251269895, "grad_norm": 14.03318977355957, "learning_rate": 2.619763228148664e-07, "loss": 0.35500648021698, "mean_token_accuracy": 0.9040526457130909, "num_tokens": 3487598.0, "step": 1720 }, { "entropy": 1.5993121460080146, "epoch": 4.677277345072808, "grad_norm": 9.692215919494629, "learning_rate": 2.236506150986395e-07, "loss": 0.44063520431518555, "mean_token_accuracy": 0.9209048740565777, "num_tokens": 3508359.0, "step": 1730 }, { "entropy": 1.6759715333580971, "epoch": 4.704368438875719, "grad_norm": 19.903579711914062, "learning_rate": 1.8832283044768585e-07, "loss": 0.4889723300933838, "mean_token_accuracy": 0.8778417184948921, "num_tokens": 3527446.0, "step": 1740 }, { "entropy": 1.6152383774518966, "epoch": 4.731459532678632, "grad_norm": 3.170473337173462, "learning_rate": 1.5600380214714216e-07, "loss": 0.4727470397949219, "mean_token_accuracy": 0.9017321106046439, "num_tokens": 3547726.0, "step": 1750 }, { "entropy": 1.6021659523248672, "epoch": 4.7585506264815445, "grad_norm": 20.662057876586914, "learning_rate": 1.2670344084530384e-07, "loss": 0.46443953514099123, "mean_token_accuracy": 0.8934749307110905, "num_tokens": 3567854.0, "step": 1760 }, { "entropy": 1.5918526247143745, "epoch": 4.785641720284456, "grad_norm": 10.510283470153809, "learning_rate": 1.0043073151452808e-07, "loss": 0.4407022476196289, "mean_token_accuracy": 0.9137253064662219, "num_tokens": 3589923.0, "step": 1770 }, { "entropy": 1.6411705940961838, "epoch": 4.812732814087369, "grad_norm": 15.203192710876465, "learning_rate": 7.719373069598246e-08, "loss": 0.49732284545898436, "mean_token_accuracy": 0.8905138060450554, "num_tokens": 3610920.0, "step": 1780 }, { "entropy": 1.623388308286667, "epoch": 4.839823907890281, "grad_norm": 12.377976417541504, "learning_rate": 5.6999564029103226e-08, "loss": 0.4741045475006104, "mean_token_accuracy": 0.9054140999913216, "num_tokens": 3630913.0, "step": 1790 }, { "entropy": 1.5931948989629745, "epoch": 4.866915001693194, "grad_norm": 7.101802825927734, "learning_rate": 3.98544240665133e-08, "loss": 0.4587404251098633, "mean_token_accuracy": 0.9269338101148605, "num_tokens": 3651374.0, "step": 1800 }, { "epoch": 4.866915001693194, "eval_entropy": 1.6439465275034308, "eval_loss": 1.4104795455932617, "eval_mean_token_accuracy": 0.736133792786859, "eval_num_tokens": 3651374.0, "eval_runtime": 25.4587, "eval_samples_per_second": 20.111, "eval_steps_per_second": 10.055, "step": 1800 }, { "entropy": 1.601736557483673, "epoch": 4.894006095496105, "grad_norm": 11.146471977233887, "learning_rate": 2.5763568375075655e-08, "loss": 0.5720036029815674, "mean_token_accuracy": 0.8911033194512129, "num_tokens": 3671445.0, "step": 1810 }, { "entropy": 1.60008362531662, "epoch": 4.921097189299018, "grad_norm": 21.521833419799805, "learning_rate": 1.473131792365301e-08, "loss": 0.37158544063568116, "mean_token_accuracy": 0.9116154242306947, "num_tokens": 3691881.0, "step": 1820 }, { "entropy": 1.6304287910461426, "epoch": 4.94818828310193, "grad_norm": 15.239692687988281, "learning_rate": 6.761055758083279e-09, "loss": 0.42179555892944337, "mean_token_accuracy": 0.8883754149079323, "num_tokens": 3711706.0, "step": 1830 }, { "entropy": 1.6515601187944413, "epoch": 4.975279376904843, "grad_norm": 11.510629653930664, "learning_rate": 1.8552259637627524e-09, "loss": 0.3710385799407959, "mean_token_accuracy": 0.9058502331376076, "num_tokens": 3733729.0, "step": 1840 }, { "entropy": 1.6298474122400153, "epoch": 5.0, "grad_norm": 8.197460174560547, "learning_rate": 1.5332916172283718e-11, "loss": 0.3809305429458618, "mean_token_accuracy": 0.9352603583303216, "num_tokens": 3752375.0, "step": 1850 }, { "epoch": 5.0, "eval_entropy": 1.6423234520480037, "eval_loss": 1.4100017547607422, "eval_mean_token_accuracy": 0.7342472999589518, "eval_num_tokens": 3752375.0, "eval_runtime": 25.4872, "eval_samples_per_second": 20.089, "eval_steps_per_second": 10.044, "step": 1850 }, { "epoch": 5.0, "step": 1850, "total_flos": 1.69605163656192e+17, "train_loss": 0.9120298720694877, "train_runtime": 3361.88, "train_samples_per_second": 4.392, "train_steps_per_second": 0.55 } ], "logging_steps": 10, "max_steps": 1850, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.69605163656192e+17, "train_batch_size": 1, "trial_name": null, "trial_params": null }