Instructions to use Jongbin-kr/llama-3.1-8b-instruct_SNI-domain-c_58325_ffn-only with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use Jongbin-kr/llama-3.1-8b-instruct_SNI-domain-c_58325_ffn-only with Transformers:
# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("Jongbin-kr/llama-3.1-8b-instruct_SNI-domain-c_58325_ffn-only", device_map="auto") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": 100, | |
| "best_metric": 0.9651781320571899, | |
| "best_model_checkpoint": "/data6/jongbinwon/evolving_MoE/checkpoints/sft_llama31_8b_sni_domain-c_58325_ffn_only_5ep/checkpoint-100", | |
| "epoch": 5.0, | |
| "eval_steps": 100, | |
| "global_step": 1850, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 1.723238617181778, | |
| "epoch": 0.027091093802912292, | |
| "grad_norm": 7.612579345703125, | |
| "learning_rate": 3.2142857142857147e-06, | |
| "loss": 2.066279411315918, | |
| "mean_token_accuracy": 0.448427795805037, | |
| "num_tokens": 21087.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 1.7370752662420272, | |
| "epoch": 0.054182187605824585, | |
| "grad_norm": 7.184020519256592, | |
| "learning_rate": 6.785714285714287e-06, | |
| "loss": 2.6899890899658203, | |
| "mean_token_accuracy": 0.42496111439540984, | |
| "num_tokens": 41335.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 1.843221677839756, | |
| "epoch": 0.08127328140873688, | |
| "grad_norm": 6.231059551239014, | |
| "learning_rate": 1.0357142857142859e-05, | |
| "loss": 2.398647117614746, | |
| "mean_token_accuracy": 0.5065225204452872, | |
| "num_tokens": 61686.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 1.9891791179776193, | |
| "epoch": 0.10836437521164917, | |
| "grad_norm": 4.975241184234619, | |
| "learning_rate": 1.3928571428571429e-05, | |
| "loss": 2.2226634979248048, | |
| "mean_token_accuracy": 0.6003633574582636, | |
| "num_tokens": 81480.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 2.2568055972456933, | |
| "epoch": 0.13545546901456146, | |
| "grad_norm": 1.7063878774642944, | |
| "learning_rate": 1.7500000000000002e-05, | |
| "loss": 2.1289892196655273, | |
| "mean_token_accuracy": 0.6060962343588472, | |
| "num_tokens": 102256.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 2.282596044242382, | |
| "epoch": 0.16254656281747376, | |
| "grad_norm": 4.551100254058838, | |
| "learning_rate": 1.9999862004036567e-05, | |
| "loss": 1.528597068786621, | |
| "mean_token_accuracy": 0.6501126736402512, | |
| "num_tokens": 120836.0, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 2.3089130371809006, | |
| "epoch": 0.18963765662038604, | |
| "grad_norm": 4.84531307220459, | |
| "learning_rate": 1.9997408848413494e-05, | |
| "loss": 1.4672578811645507, | |
| "mean_token_accuracy": 0.6635637952014803, | |
| "num_tokens": 142008.0, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 2.4036191523075106, | |
| "epoch": 0.21672875042329834, | |
| "grad_norm": 4.140300750732422, | |
| "learning_rate": 1.9991889981715696e-05, | |
| "loss": 1.7146993637084962, | |
| "mean_token_accuracy": 0.6447907727211714, | |
| "num_tokens": 162908.0, | |
| "step": 80 | |
| }, | |
| { | |
| "entropy": 2.402925634384155, | |
| "epoch": 0.24381984422621064, | |
| "grad_norm": 3.240445613861084, | |
| "learning_rate": 1.9983307096306773e-05, | |
| "loss": 1.5633929252624512, | |
| "mean_token_accuracy": 0.6392208762466908, | |
| "num_tokens": 183267.0, | |
| "step": 90 | |
| }, | |
| { | |
| "entropy": 2.254238374531269, | |
| "epoch": 0.2709109380291229, | |
| "grad_norm": 2.4666740894317627, | |
| "learning_rate": 1.997166282413338e-05, | |
| "loss": 1.3440716743469239, | |
| "mean_token_accuracy": 0.66012231297791, | |
| "num_tokens": 203918.0, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.2709109380291229, | |
| "eval_entropy": 2.094589021988213, | |
| "eval_loss": 0.9651781320571899, | |
| "eval_mean_token_accuracy": 0.764254976878874, | |
| "eval_num_tokens": 203918.0, | |
| "eval_runtime": 25.5717, | |
| "eval_samples_per_second": 20.022, | |
| "eval_steps_per_second": 10.011, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 2.216274145245552, | |
| "epoch": 0.2980020318320352, | |
| "grad_norm": 3.9435603618621826, | |
| "learning_rate": 1.995696073591817e-05, | |
| "loss": 1.493989849090576, | |
| "mean_token_accuracy": 0.6519980503246188, | |
| "num_tokens": 222513.0, | |
| "step": 110 | |
| }, | |
| { | |
| "entropy": 2.2828305318951605, | |
| "epoch": 0.3250931256349475, | |
| "grad_norm": 3.6630003452301025, | |
| "learning_rate": 1.9939205340064793e-05, | |
| "loss": 1.638005256652832, | |
| "mean_token_accuracy": 0.6362768037244677, | |
| "num_tokens": 240852.0, | |
| "step": 120 | |
| }, | |
| { | |
| "entropy": 2.2786295488476753, | |
| "epoch": 0.3521842194378598, | |
| "grad_norm": 4.0613274574279785, | |
| "learning_rate": 1.991840208127543e-05, | |
| "loss": 1.3484866142272949, | |
| "mean_token_accuracy": 0.708053832501173, | |
| "num_tokens": 260786.0, | |
| "step": 130 | |
| }, | |
| { | |
| "entropy": 2.239742587506771, | |
| "epoch": 0.37927531324077207, | |
| "grad_norm": 3.4148905277252197, | |
| "learning_rate": 1.989455733888115e-05, | |
| "loss": 1.4180074691772462, | |
| "mean_token_accuracy": 0.6825597375631333, | |
| "num_tokens": 280647.0, | |
| "step": 140 | |
| }, | |
| { | |
| "entropy": 2.224020117521286, | |
| "epoch": 0.4063664070436844, | |
| "grad_norm": 4.721391677856445, | |
| "learning_rate": 1.986767842488569e-05, | |
| "loss": 1.2252963066101075, | |
| "mean_token_accuracy": 0.6958539757877589, | |
| "num_tokens": 301192.0, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 2.1590186595916747, | |
| "epoch": 0.4334575008465967, | |
| "grad_norm": 3.9556772708892822, | |
| "learning_rate": 1.9837773581723215e-05, | |
| "loss": 1.5099032402038575, | |
| "mean_token_accuracy": 0.6419584900140762, | |
| "num_tokens": 321679.0, | |
| "step": 160 | |
| }, | |
| { | |
| "entropy": 2.2231348380446434, | |
| "epoch": 0.460548594649509, | |
| "grad_norm": 3.490177869796753, | |
| "learning_rate": 1.980485197973079e-05, | |
| "loss": 1.6476173400878906, | |
| "mean_token_accuracy": 0.6805331652984024, | |
| "num_tokens": 342221.0, | |
| "step": 170 | |
| }, | |
| { | |
| "entropy": 2.24891133159399, | |
| "epoch": 0.4876396884524213, | |
| "grad_norm": 4.099713325500488, | |
| "learning_rate": 1.9768923714336274e-05, | |
| "loss": 1.315092182159424, | |
| "mean_token_accuracy": 0.6847983291372657, | |
| "num_tokens": 362847.0, | |
| "step": 180 | |
| }, | |
| { | |
| "entropy": 2.1428863570094108, | |
| "epoch": 0.5147307822553335, | |
| "grad_norm": 3.966991901397705, | |
| "learning_rate": 1.9729999802962555e-05, | |
| "loss": 1.2681650161743163, | |
| "mean_token_accuracy": 0.7244645357131958, | |
| "num_tokens": 384086.0, | |
| "step": 190 | |
| }, | |
| { | |
| "entropy": 2.2040064856410027, | |
| "epoch": 0.5418218760582458, | |
| "grad_norm": 3.2430970668792725, | |
| "learning_rate": 1.9688092181649065e-05, | |
| "loss": 1.3249666213989257, | |
| "mean_token_accuracy": 0.722496079467237, | |
| "num_tokens": 404677.0, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.5418218760582458, | |
| "eval_entropy": 2.0920665017329156, | |
| "eval_loss": 0.9940700531005859, | |
| "eval_mean_token_accuracy": 0.757662381103728, | |
| "eval_num_tokens": 404677.0, | |
| "eval_runtime": 25.5435, | |
| "eval_samples_per_second": 20.044, | |
| "eval_steps_per_second": 10.022, | |
| "step": 200 | |
| }, | |
| { | |
| "entropy": 2.156522032618523, | |
| "epoch": 0.5689129698611581, | |
| "grad_norm": 4.980217933654785, | |
| "learning_rate": 1.964321370139157e-05, | |
| "loss": 1.298858070373535, | |
| "mean_token_accuracy": 0.7201794616878032, | |
| "num_tokens": 426644.0, | |
| "step": 210 | |
| }, | |
| { | |
| "entropy": 2.1643049642443657, | |
| "epoch": 0.5960040636640704, | |
| "grad_norm": 5.744068145751953, | |
| "learning_rate": 1.9595378124201402e-05, | |
| "loss": 1.2987921714782715, | |
| "mean_token_accuracy": 0.7069474339485169, | |
| "num_tokens": 446791.0, | |
| "step": 220 | |
| }, | |
| { | |
| "entropy": 2.177510863542557, | |
| "epoch": 0.6230951574669827, | |
| "grad_norm": 8.363221168518066, | |
| "learning_rate": 1.9544600118885356e-05, | |
| "loss": 1.4281065940856934, | |
| "mean_token_accuracy": 0.7097761157900095, | |
| "num_tokens": 466287.0, | |
| "step": 230 | |
| }, | |
| { | |
| "entropy": 2.2098993390798567, | |
| "epoch": 0.650186251269895, | |
| "grad_norm": 4.0296220779418945, | |
| "learning_rate": 1.9490895256547465e-05, | |
| "loss": 1.0510370254516601, | |
| "mean_token_accuracy": 0.7287774980068207, | |
| "num_tokens": 485912.0, | |
| "step": 240 | |
| }, | |
| { | |
| "entropy": 2.194219082593918, | |
| "epoch": 0.6772773450728073, | |
| "grad_norm": 4.584537982940674, | |
| "learning_rate": 1.9434280005814115e-05, | |
| "loss": 1.5170968055725098, | |
| "mean_token_accuracy": 0.6617882775142789, | |
| "num_tokens": 506698.0, | |
| "step": 250 | |
| }, | |
| { | |
| "entropy": 2.1990948766469955, | |
| "epoch": 0.7043684388757196, | |
| "grad_norm": 2.1026809215545654, | |
| "learning_rate": 1.9374771727783956e-05, | |
| "loss": 1.2185900688171387, | |
| "mean_token_accuracy": 0.6906542837619781, | |
| "num_tokens": 526063.0, | |
| "step": 260 | |
| }, | |
| { | |
| "entropy": 2.1788215398788453, | |
| "epoch": 0.731459532678632, | |
| "grad_norm": 3.8161611557006836, | |
| "learning_rate": 1.931238867070408e-05, | |
| "loss": 1.3875349044799805, | |
| "mean_token_accuracy": 0.7175548300147057, | |
| "num_tokens": 547940.0, | |
| "step": 270 | |
| }, | |
| { | |
| "entropy": 2.1797836825251578, | |
| "epoch": 0.7585506264815441, | |
| "grad_norm": 4.361836910247803, | |
| "learning_rate": 1.924714996437421e-05, | |
| "loss": 1.4559088706970216, | |
| "mean_token_accuracy": 0.6750684441998601, | |
| "num_tokens": 567784.0, | |
| "step": 280 | |
| }, | |
| { | |
| "entropy": 2.192278742790222, | |
| "epoch": 0.7856417202844564, | |
| "grad_norm": 5.223799705505371, | |
| "learning_rate": 1.9179075614280513e-05, | |
| "loss": 1.3970552444458009, | |
| "mean_token_accuracy": 0.7280023746192456, | |
| "num_tokens": 587559.0, | |
| "step": 290 | |
| }, | |
| { | |
| "entropy": 2.152565708756447, | |
| "epoch": 0.8127328140873687, | |
| "grad_norm": 4.498564720153809, | |
| "learning_rate": 1.9108186495460934e-05, | |
| "loss": 1.296685028076172, | |
| "mean_token_accuracy": 0.6948160078376532, | |
| "num_tokens": 608955.0, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.8127328140873687, | |
| "eval_entropy": 2.086765900719911, | |
| "eval_loss": 0.9978444576263428, | |
| "eval_mean_token_accuracy": 0.7629395253607072, | |
| "eval_num_tokens": 608955.0, | |
| "eval_runtime": 25.5161, | |
| "eval_samples_per_second": 20.066, | |
| "eval_steps_per_second": 10.033, | |
| "step": 300 | |
| }, | |
| { | |
| "entropy": 2.2242535188794137, | |
| "epoch": 0.839823907890281, | |
| "grad_norm": 4.154886245727539, | |
| "learning_rate": 1.9034504346103825e-05, | |
| "loss": 1.5084619522094727, | |
| "mean_token_accuracy": 0.699345251917839, | |
| "num_tokens": 629498.0, | |
| "step": 310 | |
| }, | |
| { | |
| "entropy": 2.2500312089920045, | |
| "epoch": 0.8669150016931934, | |
| "grad_norm": 3.7556686401367188, | |
| "learning_rate": 1.8958051760881938e-05, | |
| "loss": 1.3967250823974608, | |
| "mean_token_accuracy": 0.6777329007163644, | |
| "num_tokens": 648909.0, | |
| "step": 320 | |
| }, | |
| { | |
| "entropy": 2.270790347456932, | |
| "epoch": 0.8940060954961057, | |
| "grad_norm": 5.752708911895752, | |
| "learning_rate": 1.8878852184023754e-05, | |
| "loss": 1.2833734512329102, | |
| "mean_token_accuracy": 0.6765352768823505, | |
| "num_tokens": 667376.0, | |
| "step": 330 | |
| }, | |
| { | |
| "entropy": 2.1318136006593704, | |
| "epoch": 0.921097189299018, | |
| "grad_norm": 4.369615077972412, | |
| "learning_rate": 1.879692990212428e-05, | |
| "loss": 1.2982247352600098, | |
| "mean_token_accuracy": 0.7231215512380004, | |
| "num_tokens": 689776.0, | |
| "step": 340 | |
| }, | |
| { | |
| "entropy": 2.179507865011692, | |
| "epoch": 0.9481882831019303, | |
| "grad_norm": 3.208723783493042, | |
| "learning_rate": 1.8712310036697575e-05, | |
| "loss": 1.279671859741211, | |
| "mean_token_accuracy": 0.7093656450510025, | |
| "num_tokens": 710374.0, | |
| "step": 350 | |
| }, | |
| { | |
| "entropy": 2.1694433763623238, | |
| "epoch": 0.9752793769048426, | |
| "grad_norm": 6.71851110458374, | |
| "learning_rate": 1.8625018536473204e-05, | |
| "loss": 1.485358428955078, | |
| "mean_token_accuracy": 0.6655262919142843, | |
| "num_tokens": 731208.0, | |
| "step": 360 | |
| }, | |
| { | |
| "entropy": 2.1039708019935923, | |
| "epoch": 1.0, | |
| "grad_norm": 5.395904064178467, | |
| "learning_rate": 1.8535082169439057e-05, | |
| "loss": 1.3225526809692383, | |
| "mean_token_accuracy": 0.7076871527792656, | |
| "num_tokens": 750475.0, | |
| "step": 370 | |
| }, | |
| { | |
| "entropy": 2.1732485339045526, | |
| "epoch": 1.0270910938029123, | |
| "grad_norm": 3.098240852355957, | |
| "learning_rate": 1.844252851463292e-05, | |
| "loss": 1.514673614501953, | |
| "mean_token_accuracy": 0.7053313782438636, | |
| "num_tokens": 772399.0, | |
| "step": 380 | |
| }, | |
| { | |
| "entropy": 2.1763458222150804, | |
| "epoch": 1.0541821876058246, | |
| "grad_norm": 3.707331895828247, | |
| "learning_rate": 1.834738595368536e-05, | |
| "loss": 1.0740927696228026, | |
| "mean_token_accuracy": 0.7563056144863367, | |
| "num_tokens": 792378.0, | |
| "step": 390 | |
| }, | |
| { | |
| "entropy": 2.171446980535984, | |
| "epoch": 1.081273281408737, | |
| "grad_norm": 5.769153594970703, | |
| "learning_rate": 1.824968366211648e-05, | |
| "loss": 1.2906767845153808, | |
| "mean_token_accuracy": 0.7230573301203549, | |
| "num_tokens": 811796.0, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 1.081273281408737, | |
| "eval_entropy": 2.0477666831575334, | |
| "eval_loss": 1.0081422328948975, | |
| "eval_mean_token_accuracy": 0.7632476337021217, | |
| "eval_num_tokens": 811796.0, | |
| "eval_runtime": 25.4904, | |
| "eval_samples_per_second": 20.086, | |
| "eval_steps_per_second": 10.043, | |
| "step": 400 | |
| }, | |
| { | |
| "entropy": 2.1150058075785636, | |
| "epoch": 1.1083643752116492, | |
| "grad_norm": 4.51067590713501, | |
| "learning_rate": 1.8149451600389207e-05, | |
| "loss": 1.3508639335632324, | |
| "mean_token_accuracy": 0.7513733027502895, | |
| "num_tokens": 832769.0, | |
| "step": 410 | |
| }, | |
| { | |
| "entropy": 2.1037127494812013, | |
| "epoch": 1.1354554690145615, | |
| "grad_norm": 2.397596836090088, | |
| "learning_rate": 1.8046720504721938e-05, | |
| "loss": 1.0258020401000976, | |
| "mean_token_accuracy": 0.74247965849936, | |
| "num_tokens": 853670.0, | |
| "step": 420 | |
| }, | |
| { | |
| "entropy": 2.0551841765642167, | |
| "epoch": 1.1625465628174738, | |
| "grad_norm": 9.206628799438477, | |
| "learning_rate": 1.794152187766323e-05, | |
| "loss": 1.1884271621704101, | |
| "mean_token_accuracy": 0.7030579019337893, | |
| "num_tokens": 874009.0, | |
| "step": 430 | |
| }, | |
| { | |
| "entropy": 2.0734852880239485, | |
| "epoch": 1.1896376566203861, | |
| "grad_norm": 4.471444129943848, | |
| "learning_rate": 1.783388797843154e-05, | |
| "loss": 1.2394503593444823, | |
| "mean_token_accuracy": 0.7340864278376102, | |
| "num_tokens": 895613.0, | |
| "step": 440 | |
| }, | |
| { | |
| "entropy": 2.134996885061264, | |
| "epoch": 1.2167287504232984, | |
| "grad_norm": 6.01848840713501, | |
| "learning_rate": 1.77238518130229e-05, | |
| "loss": 1.227487850189209, | |
| "mean_token_accuracy": 0.7364656325429678, | |
| "num_tokens": 914468.0, | |
| "step": 450 | |
| }, | |
| { | |
| "entropy": 2.061158812046051, | |
| "epoch": 1.2438198442262107, | |
| "grad_norm": 12.69832992553711, | |
| "learning_rate": 1.761144712408965e-05, | |
| "loss": 1.221731185913086, | |
| "mean_token_accuracy": 0.7208205627277493, | |
| "num_tokens": 936076.0, | |
| "step": 460 | |
| }, | |
| { | |
| "entropy": 2.1015277206897736, | |
| "epoch": 1.270910938029123, | |
| "grad_norm": 3.7558536529541016, | |
| "learning_rate": 1.749670838059318e-05, | |
| "loss": 0.9690493583679199, | |
| "mean_token_accuracy": 0.7604702278971672, | |
| "num_tokens": 956253.0, | |
| "step": 470 | |
| }, | |
| { | |
| "entropy": 2.1128511682152746, | |
| "epoch": 1.298002031832035, | |
| "grad_norm": 7.6537275314331055, | |
| "learning_rate": 1.7379670767234045e-05, | |
| "loss": 1.0514067649841308, | |
| "mean_token_accuracy": 0.7440206557512283, | |
| "num_tokens": 976137.0, | |
| "step": 480 | |
| }, | |
| { | |
| "entropy": 2.106458379328251, | |
| "epoch": 1.3250931256349476, | |
| "grad_norm": 7.5504045486450195, | |
| "learning_rate": 1.7260370173662543e-05, | |
| "loss": 1.0261421203613281, | |
| "mean_token_accuracy": 0.7460719928145408, | |
| "num_tokens": 995767.0, | |
| "step": 490 | |
| }, | |
| { | |
| "entropy": 2.118429370224476, | |
| "epoch": 1.3521842194378597, | |
| "grad_norm": 4.931035995483398, | |
| "learning_rate": 1.7138843183473127e-05, | |
| "loss": 1.5636432647705079, | |
| "mean_token_accuracy": 0.7403618179261684, | |
| "num_tokens": 1015342.0, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 1.3521842194378597, | |
| "eval_entropy": 1.9999370207078755, | |
| "eval_loss": 1.032294511795044, | |
| "eval_mean_token_accuracy": 0.7589045927161351, | |
| "eval_num_tokens": 1015342.0, | |
| "eval_runtime": 25.5016, | |
| "eval_samples_per_second": 20.077, | |
| "eval_steps_per_second": 10.039, | |
| "step": 500 | |
| }, | |
| { | |
| "entropy": 2.124773620069027, | |
| "epoch": 1.379275313240772, | |
| "grad_norm": 10.168334007263184, | |
| "learning_rate": 1.7015127062986044e-05, | |
| "loss": 0.8846927642822265, | |
| "mean_token_accuracy": 0.7411885142326355, | |
| "num_tokens": 1034010.0, | |
| "step": 510 | |
| }, | |
| { | |
| "entropy": 2.0986449405550958, | |
| "epoch": 1.4063664070436843, | |
| "grad_norm": 6.97003698348999, | |
| "learning_rate": 1.6889259749819568e-05, | |
| "loss": 1.023176383972168, | |
| "mean_token_accuracy": 0.7303699310868979, | |
| "num_tokens": 1053408.0, | |
| "step": 520 | |
| }, | |
| { | |
| "entropy": 2.1111062809824945, | |
| "epoch": 1.4334575008465966, | |
| "grad_norm": 5.16034460067749, | |
| "learning_rate": 1.6761279841256437e-05, | |
| "loss": 1.3746380805969238, | |
| "mean_token_accuracy": 0.7154265632852912, | |
| "num_tokens": 1074316.0, | |
| "step": 530 | |
| }, | |
| { | |
| "entropy": 2.071941052377224, | |
| "epoch": 1.460548594649509, | |
| "grad_norm": 5.507922649383545, | |
| "learning_rate": 1.6631226582407954e-05, | |
| "loss": 1.3437743186950684, | |
| "mean_token_accuracy": 0.6885566545650363, | |
| "num_tokens": 1094208.0, | |
| "step": 540 | |
| }, | |
| { | |
| "entropy": 2.1154344886541367, | |
| "epoch": 1.4876396884524212, | |
| "grad_norm": 3.5610263347625732, | |
| "learning_rate": 1.649913985417946e-05, | |
| "loss": 1.1012388229370118, | |
| "mean_token_accuracy": 0.7634946122765541, | |
| "num_tokens": 1113777.0, | |
| "step": 550 | |
| }, | |
| { | |
| "entropy": 2.0671692818403242, | |
| "epoch": 1.5147307822553335, | |
| "grad_norm": 8.337108612060547, | |
| "learning_rate": 1.636506016104084e-05, | |
| "loss": 1.3132530212402345, | |
| "mean_token_accuracy": 0.7397821169346571, | |
| "num_tokens": 1133996.0, | |
| "step": 560 | |
| }, | |
| { | |
| "entropy": 2.0944964781403543, | |
| "epoch": 1.5418218760582458, | |
| "grad_norm": 7.714909076690674, | |
| "learning_rate": 1.6229028618605776e-05, | |
| "loss": 0.8892477035522461, | |
| "mean_token_accuracy": 0.7313346045091749, | |
| "num_tokens": 1154047.0, | |
| "step": 570 | |
| }, | |
| { | |
| "entropy": 2.0559984400868414, | |
| "epoch": 1.5689129698611581, | |
| "grad_norm": 6.229889392852783, | |
| "learning_rate": 1.609108694102366e-05, | |
| "loss": 0.9835987091064453, | |
| "mean_token_accuracy": 0.7751555263996124, | |
| "num_tokens": 1174616.0, | |
| "step": 580 | |
| }, | |
| { | |
| "entropy": 2.054904416203499, | |
| "epoch": 1.5960040636640704, | |
| "grad_norm": 3.5100467205047607, | |
| "learning_rate": 1.59512774281879e-05, | |
| "loss": 0.7898230075836181, | |
| "mean_token_accuracy": 0.7902765288949013, | |
| "num_tokens": 1194173.0, | |
| "step": 590 | |
| }, | |
| { | |
| "entropy": 2.0093825444579125, | |
| "epoch": 1.6230951574669827, | |
| "grad_norm": 5.0431742668151855, | |
| "learning_rate": 1.580964295276463e-05, | |
| "loss": 1.0017314910888673, | |
| "mean_token_accuracy": 0.7571999192237854, | |
| "num_tokens": 1214366.0, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 1.6230951574669827, | |
| "eval_entropy": 1.9694703868590295, | |
| "eval_loss": 1.0424904823303223, | |
| "eval_mean_token_accuracy": 0.7560218448052183, | |
| "eval_num_tokens": 1214366.0, | |
| "eval_runtime": 25.5499, | |
| "eval_samples_per_second": 20.039, | |
| "eval_steps_per_second": 10.02, | |
| "step": 600 | |
| }, | |
| { | |
| "entropy": 2.0107428073883056, | |
| "epoch": 1.650186251269895, | |
| "grad_norm": 7.987220287322998, | |
| "learning_rate": 1.5666226947045814e-05, | |
| "loss": 1.3089231491088866, | |
| "mean_token_accuracy": 0.7401313630864024, | |
| "num_tokens": 1236562.0, | |
| "step": 610 | |
| }, | |
| { | |
| "entropy": 2.046839062869549, | |
| "epoch": 1.6772773450728073, | |
| "grad_norm": 6.632065296173096, | |
| "learning_rate": 1.552107338963067e-05, | |
| "loss": 0.9845743179321289, | |
| "mean_token_accuracy": 0.755998631566763, | |
| "num_tokens": 1257112.0, | |
| "step": 620 | |
| }, | |
| { | |
| "entropy": 2.1148023292422296, | |
| "epoch": 1.7043684388757196, | |
| "grad_norm": 8.282198905944824, | |
| "learning_rate": 1.5374226791939628e-05, | |
| "loss": 1.3935293197631835, | |
| "mean_token_accuracy": 0.7302353219129145, | |
| "num_tokens": 1276577.0, | |
| "step": 630 | |
| }, | |
| { | |
| "entropy": 2.0933067336678506, | |
| "epoch": 1.731459532678632, | |
| "grad_norm": 5.363010406494141, | |
| "learning_rate": 1.5225732184564886e-05, | |
| "loss": 1.2860239028930665, | |
| "mean_token_accuracy": 0.7248616352677345, | |
| "num_tokens": 1296086.0, | |
| "step": 640 | |
| }, | |
| { | |
| "entropy": 2.1054985627532004, | |
| "epoch": 1.758550626481544, | |
| "grad_norm": 4.800771236419678, | |
| "learning_rate": 1.5075635103461731e-05, | |
| "loss": 1.2266152381896973, | |
| "mean_token_accuracy": 0.7662290595471859, | |
| "num_tokens": 1316442.0, | |
| "step": 650 | |
| }, | |
| { | |
| "entropy": 2.1522702112793923, | |
| "epoch": 1.7856417202844566, | |
| "grad_norm": 3.5823662281036377, | |
| "learning_rate": 1.4923981575984936e-05, | |
| "loss": 1.0100022315979005, | |
| "mean_token_accuracy": 0.7728497218340635, | |
| "num_tokens": 1337169.0, | |
| "step": 660 | |
| }, | |
| { | |
| "entropy": 2.1094584688544273, | |
| "epoch": 1.8127328140873686, | |
| "grad_norm": 5.589018821716309, | |
| "learning_rate": 1.4770818106774427e-05, | |
| "loss": 1.0324097633361817, | |
| "mean_token_accuracy": 0.7925379849970341, | |
| "num_tokens": 1357759.0, | |
| "step": 670 | |
| }, | |
| { | |
| "entropy": 2.182632897794247, | |
| "epoch": 1.8398239078902812, | |
| "grad_norm": 7.491511344909668, | |
| "learning_rate": 1.4616191663494619e-05, | |
| "loss": 1.3248936653137207, | |
| "mean_token_accuracy": 0.7274331038817763, | |
| "num_tokens": 1378191.0, | |
| "step": 680 | |
| }, | |
| { | |
| "entropy": 2.1101855129003524, | |
| "epoch": 1.8669150016931932, | |
| "grad_norm": 6.318648815155029, | |
| "learning_rate": 1.4460149662431749e-05, | |
| "loss": 1.054247760772705, | |
| "mean_token_accuracy": 0.7554519359022379, | |
| "num_tokens": 1397881.0, | |
| "step": 690 | |
| }, | |
| { | |
| "entropy": 2.096898023784161, | |
| "epoch": 1.8940060954961058, | |
| "grad_norm": 6.2741875648498535, | |
| "learning_rate": 1.430273995395365e-05, | |
| "loss": 1.0373686790466308, | |
| "mean_token_accuracy": 0.7596361611038447, | |
| "num_tokens": 1418877.0, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 1.8940060954961058, | |
| "eval_entropy": 2.013828214723617, | |
| "eval_loss": 1.0287954807281494, | |
| "eval_mean_token_accuracy": 0.7496589213842526, | |
| "eval_num_tokens": 1418877.0, | |
| "eval_runtime": 25.4995, | |
| "eval_samples_per_second": 20.079, | |
| "eval_steps_per_second": 10.039, | |
| "step": 700 | |
| }, | |
| { | |
| "entropy": 2.0728593289852144, | |
| "epoch": 1.9210971892990178, | |
| "grad_norm": 6.076820373535156, | |
| "learning_rate": 1.4144010807836412e-05, | |
| "loss": 1.0167503356933594, | |
| "mean_token_accuracy": 0.7612185761332512, | |
| "num_tokens": 1439198.0, | |
| "step": 710 | |
| }, | |
| { | |
| "entropy": 2.11173554956913, | |
| "epoch": 1.9481882831019304, | |
| "grad_norm": 6.451402187347412, | |
| "learning_rate": 1.3984010898462417e-05, | |
| "loss": 1.089035415649414, | |
| "mean_token_accuracy": 0.7369910277426243, | |
| "num_tokens": 1461226.0, | |
| "step": 720 | |
| }, | |
| { | |
| "entropy": 2.0723678693175316, | |
| "epoch": 1.9752793769048425, | |
| "grad_norm": 5.50106954574585, | |
| "learning_rate": 1.3822789289894316e-05, | |
| "loss": 0.9883082389831543, | |
| "mean_token_accuracy": 0.7898955499753356, | |
| "num_tokens": 1482366.0, | |
| "step": 730 | |
| }, | |
| { | |
| "entropy": 2.0618706647663902, | |
| "epoch": 2.0, | |
| "grad_norm": 50.42632293701172, | |
| "learning_rate": 1.3660395420829516e-05, | |
| "loss": 0.8657957077026367, | |
| "mean_token_accuracy": 0.7464919359716651, | |
| "num_tokens": 1500950.0, | |
| "step": 740 | |
| }, | |
| { | |
| "entropy": 2.050840379297733, | |
| "epoch": 2.027091093802912, | |
| "grad_norm": 6.361630439758301, | |
| "learning_rate": 1.3496879089439761e-05, | |
| "loss": 0.8690568923950195, | |
| "mean_token_accuracy": 0.7947060691192747, | |
| "num_tokens": 1519798.0, | |
| "step": 750 | |
| }, | |
| { | |
| "entropy": 1.926042178273201, | |
| "epoch": 2.0541821876058246, | |
| "grad_norm": 2.3748672008514404, | |
| "learning_rate": 1.3332290438100508e-05, | |
| "loss": 0.8486003875732422, | |
| "mean_token_accuracy": 0.8309563081711531, | |
| "num_tokens": 1539927.0, | |
| "step": 760 | |
| }, | |
| { | |
| "entropy": 1.8769470036029816, | |
| "epoch": 2.0812732814087367, | |
| "grad_norm": 8.954164505004883, | |
| "learning_rate": 1.3166679938014728e-05, | |
| "loss": 0.7576936244964599, | |
| "mean_token_accuracy": 0.8146512515842914, | |
| "num_tokens": 1560176.0, | |
| "step": 770 | |
| }, | |
| { | |
| "entropy": 1.8487665757536889, | |
| "epoch": 2.108364375211649, | |
| "grad_norm": 8.518715858459473, | |
| "learning_rate": 1.3000098373735885e-05, | |
| "loss": 0.9359015464782715, | |
| "mean_token_accuracy": 0.788595624268055, | |
| "num_tokens": 1579888.0, | |
| "step": 780 | |
| }, | |
| { | |
| "entropy": 1.8781982406973838, | |
| "epoch": 2.1354554690145613, | |
| "grad_norm": 5.680595397949219, | |
| "learning_rate": 1.283259682759484e-05, | |
| "loss": 0.9370273590087891, | |
| "mean_token_accuracy": 0.7608782526105642, | |
| "num_tokens": 1601141.0, | |
| "step": 790 | |
| }, | |
| { | |
| "entropy": 1.9456540763378143, | |
| "epoch": 2.162546562817474, | |
| "grad_norm": 5.94552755355835, | |
| "learning_rate": 1.266422666403539e-05, | |
| "loss": 0.9432417869567871, | |
| "mean_token_accuracy": 0.8288755964487791, | |
| "num_tokens": 1621542.0, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 2.162546562817474, | |
| "eval_entropy": 1.9436165052466094, | |
| "eval_loss": 1.06016206741333, | |
| "eval_mean_token_accuracy": 0.7518258688505739, | |
| "eval_num_tokens": 1621542.0, | |
| "eval_runtime": 25.5171, | |
| "eval_samples_per_second": 20.065, | |
| "eval_steps_per_second": 10.032, | |
| "step": 800 | |
| }, | |
| { | |
| "entropy": 1.9728469848632812, | |
| "epoch": 2.189637656620386, | |
| "grad_norm": 7.825141906738281, | |
| "learning_rate": 1.2495039513863378e-05, | |
| "loss": 1.036830997467041, | |
| "mean_token_accuracy": 0.8224836468696595, | |
| "num_tokens": 1641245.0, | |
| "step": 810 | |
| }, | |
| { | |
| "entropy": 1.9231234237551689, | |
| "epoch": 2.2167287504232984, | |
| "grad_norm": 6.70737361907959, | |
| "learning_rate": 1.2325087258414039e-05, | |
| "loss": 0.7759229183197022, | |
| "mean_token_accuracy": 0.8049912886694074, | |
| "num_tokens": 1663067.0, | |
| "step": 820 | |
| }, | |
| { | |
| "entropy": 1.8155759632587434, | |
| "epoch": 2.2438198442262105, | |
| "grad_norm": 9.183692932128906, | |
| "learning_rate": 1.2154422013642575e-05, | |
| "loss": 0.8489904403686523, | |
| "mean_token_accuracy": 0.8039800453931093, | |
| "num_tokens": 1683171.0, | |
| "step": 830 | |
| }, | |
| { | |
| "entropy": 1.9373584493994713, | |
| "epoch": 2.270910938029123, | |
| "grad_norm": 6.903590679168701, | |
| "learning_rate": 1.1983096114142773e-05, | |
| "loss": 1.001230525970459, | |
| "mean_token_accuracy": 0.7758175190538168, | |
| "num_tokens": 1702798.0, | |
| "step": 840 | |
| }, | |
| { | |
| "entropy": 2.008491799235344, | |
| "epoch": 2.298002031832035, | |
| "grad_norm": 7.595852375030518, | |
| "learning_rate": 1.1811162097098559e-05, | |
| "loss": 0.9919692039489746, | |
| "mean_token_accuracy": 0.8151415549218655, | |
| "num_tokens": 1722315.0, | |
| "step": 850 | |
| }, | |
| { | |
| "entropy": 1.9535631239414215, | |
| "epoch": 2.3250931256349476, | |
| "grad_norm": 8.800715446472168, | |
| "learning_rate": 1.1638672686173453e-05, | |
| "loss": 0.7722007274627686, | |
| "mean_token_accuracy": 0.8053982924669981, | |
| "num_tokens": 1741922.0, | |
| "step": 860 | |
| }, | |
| { | |
| "entropy": 1.9666619777679444, | |
| "epoch": 2.3521842194378597, | |
| "grad_norm": 5.499095916748047, | |
| "learning_rate": 1.1465680775342821e-05, | |
| "loss": 1.0401187896728517, | |
| "mean_token_accuracy": 0.7628452027216553, | |
| "num_tokens": 1761561.0, | |
| "step": 870 | |
| }, | |
| { | |
| "entropy": 1.9506760001182557, | |
| "epoch": 2.3792753132407722, | |
| "grad_norm": 15.519598007202148, | |
| "learning_rate": 1.1292239412673906e-05, | |
| "loss": 0.9919161796569824, | |
| "mean_token_accuracy": 0.7912353215739131, | |
| "num_tokens": 1781403.0, | |
| "step": 880 | |
| }, | |
| { | |
| "entropy": 1.8824239298701286, | |
| "epoch": 2.4063664070436843, | |
| "grad_norm": 8.007031440734863, | |
| "learning_rate": 1.1118401784058612e-05, | |
| "loss": 0.8426601409912109, | |
| "mean_token_accuracy": 0.8043077282607556, | |
| "num_tokens": 1803471.0, | |
| "step": 890 | |
| }, | |
| { | |
| "entropy": 1.9203020244836808, | |
| "epoch": 2.433457500846597, | |
| "grad_norm": 8.088946342468262, | |
| "learning_rate": 1.0944221196904029e-05, | |
| "loss": 1.0317404747009278, | |
| "mean_token_accuracy": 0.7911908756941557, | |
| "num_tokens": 1823668.0, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 2.433457500846597, | |
| "eval_entropy": 1.8476642882451415, | |
| "eval_loss": 1.102004051208496, | |
| "eval_mean_token_accuracy": 0.7586654123151675, | |
| "eval_num_tokens": 1823668.0, | |
| "eval_runtime": 25.5319, | |
| "eval_samples_per_second": 20.053, | |
| "eval_steps_per_second": 10.027, | |
| "step": 900 | |
| }, | |
| { | |
| "entropy": 1.8842667803168296, | |
| "epoch": 2.460548594649509, | |
| "grad_norm": 10.67811393737793, | |
| "learning_rate": 1.0769751063785661e-05, | |
| "loss": 0.7327501773834229, | |
| "mean_token_accuracy": 0.7824661247432232, | |
| "num_tokens": 1844175.0, | |
| "step": 910 | |
| }, | |
| { | |
| "entropy": 1.8312113255262374, | |
| "epoch": 2.4876396884524214, | |
| "grad_norm": 5.517256736755371, | |
| "learning_rate": 1.0595044886068457e-05, | |
| "loss": 0.6679872512817383, | |
| "mean_token_accuracy": 0.8325993716716766, | |
| "num_tokens": 1864323.0, | |
| "step": 920 | |
| }, | |
| { | |
| "entropy": 1.820173794031143, | |
| "epoch": 2.5147307822553335, | |
| "grad_norm": 5.745193958282471, | |
| "learning_rate": 1.0420156237500571e-05, | |
| "loss": 0.6937276363372803, | |
| "mean_token_accuracy": 0.8053716959431767, | |
| "num_tokens": 1884326.0, | |
| "step": 930 | |
| }, | |
| { | |
| "entropy": 1.8793843016028404, | |
| "epoch": 2.541821876058246, | |
| "grad_norm": 7.830550670623779, | |
| "learning_rate": 1.0245138747784953e-05, | |
| "loss": 0.8545784950256348, | |
| "mean_token_accuracy": 0.8472533781081438, | |
| "num_tokens": 1904095.0, | |
| "step": 940 | |
| }, | |
| { | |
| "entropy": 1.8013970047235488, | |
| "epoch": 2.568912969861158, | |
| "grad_norm": 6.052741527557373, | |
| "learning_rate": 1.007004608613375e-05, | |
| "loss": 0.7021704196929932, | |
| "mean_token_accuracy": 0.8472875323146581, | |
| "num_tokens": 1924391.0, | |
| "step": 950 | |
| }, | |
| { | |
| "entropy": 1.9338349267840385, | |
| "epoch": 2.59600406366407, | |
| "grad_norm": 12.163394927978516, | |
| "learning_rate": 9.89493194481064e-06, | |
| "loss": 0.9507933616638183, | |
| "mean_token_accuracy": 0.807798033207655, | |
| "num_tokens": 1944746.0, | |
| "step": 960 | |
| }, | |
| { | |
| "entropy": 1.879988330602646, | |
| "epoch": 2.6230951574669827, | |
| "grad_norm": 6.659127712249756, | |
| "learning_rate": 9.719850022666044e-06, | |
| "loss": 0.6338046550750732, | |
| "mean_token_accuracy": 0.8415262099355459, | |
| "num_tokens": 1967427.0, | |
| "step": 970 | |
| }, | |
| { | |
| "entropy": 1.890741939842701, | |
| "epoch": 2.6501862512698953, | |
| "grad_norm": 9.862802505493164, | |
| "learning_rate": 9.544854008670366e-06, | |
| "loss": 0.7429360389709473, | |
| "mean_token_accuracy": 0.8043466622009874, | |
| "num_tokens": 1986505.0, | |
| "step": 980 | |
| }, | |
| { | |
| "entropy": 1.8231979936361313, | |
| "epoch": 2.6772773450728073, | |
| "grad_norm": 11.50146198272705, | |
| "learning_rate": 9.369997565450214e-06, | |
| "loss": 1.0342053413391112, | |
| "mean_token_accuracy": 0.7860685650259256, | |
| "num_tokens": 2006357.0, | |
| "step": 990 | |
| }, | |
| { | |
| "entropy": 1.8516354262828827, | |
| "epoch": 2.7043684388757194, | |
| "grad_norm": 3.143589973449707, | |
| "learning_rate": 9.195334312832742e-06, | |
| "loss": 0.8172811508178711, | |
| "mean_token_accuracy": 0.8135180365294218, | |
| "num_tokens": 2026498.0, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 2.7043684388757194, | |
| "eval_entropy": 1.853846381418407, | |
| "eval_loss": 1.0932104587554932, | |
| "eval_mean_token_accuracy": 0.7503726394497789, | |
| "eval_num_tokens": 2026498.0, | |
| "eval_runtime": 25.4801, | |
| "eval_samples_per_second": 20.094, | |
| "eval_steps_per_second": 10.047, | |
| "step": 1000 | |
| }, | |
| { | |
| "entropy": 1.9358359456062317, | |
| "epoch": 2.731459532678632, | |
| "grad_norm": 5.799363136291504, | |
| "learning_rate": 9.020917811403104e-06, | |
| "loss": 0.7895758152008057, | |
| "mean_token_accuracy": 0.8083623085170984, | |
| "num_tokens": 2045459.0, | |
| "step": 1010 | |
| }, | |
| { | |
| "entropy": 1.9362391978502274, | |
| "epoch": 2.758550626481544, | |
| "grad_norm": 4.842373371124268, | |
| "learning_rate": 8.846801546080062e-06, | |
| "loss": 0.836983585357666, | |
| "mean_token_accuracy": 0.8126423776149749, | |
| "num_tokens": 2066518.0, | |
| "step": 1020 | |
| }, | |
| { | |
| "entropy": 1.91400406062603, | |
| "epoch": 2.7856417202844566, | |
| "grad_norm": 7.656473636627197, | |
| "learning_rate": 8.673038909714792e-06, | |
| "loss": 0.7076562881469727, | |
| "mean_token_accuracy": 0.8479138355702162, | |
| "num_tokens": 2086183.0, | |
| "step": 1030 | |
| }, | |
| { | |
| "entropy": 1.8541285216808319, | |
| "epoch": 2.8127328140873686, | |
| "grad_norm": 9.124068260192871, | |
| "learning_rate": 8.499683186717964e-06, | |
| "loss": 0.9584396362304688, | |
| "mean_token_accuracy": 0.7849915137514472, | |
| "num_tokens": 2107721.0, | |
| "step": 1040 | |
| }, | |
| { | |
| "entropy": 1.798606288433075, | |
| "epoch": 2.839823907890281, | |
| "grad_norm": 11.562939643859863, | |
| "learning_rate": 8.326787536720037e-06, | |
| "loss": 0.9054560661315918, | |
| "mean_token_accuracy": 0.7929567001760006, | |
| "num_tokens": 2130459.0, | |
| "step": 1050 | |
| }, | |
| { | |
| "entropy": 1.9321310743689537, | |
| "epoch": 2.8669150016931932, | |
| "grad_norm": 12.520683288574219, | |
| "learning_rate": 8.154404978269808e-06, | |
| "loss": 0.9787432670593261, | |
| "mean_token_accuracy": 0.7586101952940225, | |
| "num_tokens": 2150465.0, | |
| "step": 1060 | |
| }, | |
| { | |
| "entropy": 1.8978336572647094, | |
| "epoch": 2.8940060954961058, | |
| "grad_norm": 6.707414627075195, | |
| "learning_rate": 7.982588372576274e-06, | |
| "loss": 0.8695780754089355, | |
| "mean_token_accuracy": 0.8042063070461154, | |
| "num_tokens": 2171901.0, | |
| "step": 1070 | |
| }, | |
| { | |
| "entropy": 1.911924734711647, | |
| "epoch": 2.921097189299018, | |
| "grad_norm": 10.575072288513184, | |
| "learning_rate": 7.811390407298697e-06, | |
| "loss": 1.1379961013793944, | |
| "mean_token_accuracy": 0.7801183510571719, | |
| "num_tokens": 2192878.0, | |
| "step": 1080 | |
| }, | |
| { | |
| "entropy": 1.9139499440789223, | |
| "epoch": 2.9481882831019304, | |
| "grad_norm": 9.588115692138672, | |
| "learning_rate": 7.640863580389903e-06, | |
| "loss": 0.6681862354278565, | |
| "mean_token_accuracy": 0.8321586221456527, | |
| "num_tokens": 2212872.0, | |
| "step": 1090 | |
| }, | |
| { | |
| "entropy": 1.917321428656578, | |
| "epoch": 2.9752793769048425, | |
| "grad_norm": 8.42562484741211, | |
| "learning_rate": 7.47106018399776e-06, | |
| "loss": 1.0313225746154786, | |
| "mean_token_accuracy": 0.7394453713670373, | |
| "num_tokens": 2233656.0, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 2.9752793769048425, | |
| "eval_entropy": 1.8692557462491095, | |
| "eval_loss": 1.1177661418914795, | |
| "eval_mean_token_accuracy": 0.7488149127457291, | |
| "eval_num_tokens": 2233656.0, | |
| "eval_runtime": 25.4569, | |
| "eval_samples_per_second": 20.112, | |
| "eval_steps_per_second": 10.056, | |
| "step": 1100 | |
| }, | |
| { | |
| "entropy": 1.9485157532234714, | |
| "epoch": 3.0, | |
| "grad_norm": 20.587278366088867, | |
| "learning_rate": 7.3020322884297565e-06, | |
| "loss": 0.7162185668945312, | |
| "mean_token_accuracy": 0.8130205739034365, | |
| "num_tokens": 2251425.0, | |
| "step": 1110 | |
| }, | |
| { | |
| "entropy": 1.8808414414525032, | |
| "epoch": 3.027091093802912, | |
| "grad_norm": 9.604867935180664, | |
| "learning_rate": 7.1338317261856225e-06, | |
| "loss": 0.6537890911102295, | |
| "mean_token_accuracy": 0.8606590256094933, | |
| "num_tokens": 2270749.0, | |
| "step": 1120 | |
| }, | |
| { | |
| "entropy": 1.7552776366472245, | |
| "epoch": 3.0541821876058246, | |
| "grad_norm": 20.14252281188965, | |
| "learning_rate": 6.966510076062845e-06, | |
| "loss": 0.6271217823028564, | |
| "mean_token_accuracy": 0.8392207693308592, | |
| "num_tokens": 2289814.0, | |
| "step": 1130 | |
| }, | |
| { | |
| "entropy": 1.7204705789685248, | |
| "epoch": 3.0812732814087367, | |
| "grad_norm": 11.636978149414062, | |
| "learning_rate": 6.800118647340022e-06, | |
| "loss": 0.6068019866943359, | |
| "mean_token_accuracy": 0.8635438393801451, | |
| "num_tokens": 2310249.0, | |
| "step": 1140 | |
| }, | |
| { | |
| "entropy": 1.7508003085851669, | |
| "epoch": 3.108364375211649, | |
| "grad_norm": 12.074075698852539, | |
| "learning_rate": 6.634708464042827e-06, | |
| "loss": 0.43173890113830565, | |
| "mean_token_accuracy": 0.8833881586790084, | |
| "num_tokens": 2329569.0, | |
| "step": 1150 | |
| }, | |
| { | |
| "entropy": 1.7503153815865518, | |
| "epoch": 3.1354554690145613, | |
| "grad_norm": 12.822123527526855, | |
| "learning_rate": 6.470330249297472e-06, | |
| "loss": 0.5606254577636719, | |
| "mean_token_accuracy": 0.8595870833843946, | |
| "num_tokens": 2350193.0, | |
| "step": 1160 | |
| }, | |
| { | |
| "entropy": 1.7921119689941407, | |
| "epoch": 3.162546562817474, | |
| "grad_norm": 15.029194831848145, | |
| "learning_rate": 6.3070344097764265e-06, | |
| "loss": 0.775139856338501, | |
| "mean_token_accuracy": 0.8431978467851877, | |
| "num_tokens": 2369022.0, | |
| "step": 1170 | |
| }, | |
| { | |
| "entropy": 1.7634284302592278, | |
| "epoch": 3.189637656620386, | |
| "grad_norm": 10.424407958984375, | |
| "learning_rate": 6.144871020241197e-06, | |
| "loss": 0.6365249156951904, | |
| "mean_token_accuracy": 0.8474900238215923, | |
| "num_tokens": 2388527.0, | |
| "step": 1180 | |
| }, | |
| { | |
| "entropy": 1.7646004989743234, | |
| "epoch": 3.2167287504232984, | |
| "grad_norm": 8.618444442749023, | |
| "learning_rate": 5.98388980818684e-06, | |
| "loss": 0.8289416313171387, | |
| "mean_token_accuracy": 0.8227736797183752, | |
| "num_tokens": 2409237.0, | |
| "step": 1190 | |
| }, | |
| { | |
| "entropy": 1.737740470468998, | |
| "epoch": 3.2438198442262105, | |
| "grad_norm": 6.645010948181152, | |
| "learning_rate": 5.8241401385930395e-06, | |
| "loss": 0.39721031188964845, | |
| "mean_token_accuracy": 0.8825947981327772, | |
| "num_tokens": 2428916.0, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 3.2438198442262105, | |
| "eval_entropy": 1.7245915541425347, | |
| "eval_loss": 1.2651240825653076, | |
| "eval_mean_token_accuracy": 0.7416992684593424, | |
| "eval_num_tokens": 2428916.0, | |
| "eval_runtime": 25.525, | |
| "eval_samples_per_second": 20.059, | |
| "eval_steps_per_second": 10.029, | |
| "step": 1200 | |
| }, | |
| { | |
| "entropy": 1.7320396453142166, | |
| "epoch": 3.270910938029123, | |
| "grad_norm": 9.127442359924316, | |
| "learning_rate": 5.665670998786274e-06, | |
| "loss": 0.5321141719818115, | |
| "mean_token_accuracy": 0.8595851019024849, | |
| "num_tokens": 2448191.0, | |
| "step": 1210 | |
| }, | |
| { | |
| "entropy": 1.7059780359268188, | |
| "epoch": 3.298002031832035, | |
| "grad_norm": 4.298802375793457, | |
| "learning_rate": 5.508530983417855e-06, | |
| "loss": 0.7181911468505859, | |
| "mean_token_accuracy": 0.8558499291539192, | |
| "num_tokens": 2470698.0, | |
| "step": 1220 | |
| }, | |
| { | |
| "entropy": 1.7368447184562683, | |
| "epoch": 3.3250931256349476, | |
| "grad_norm": 8.62894344329834, | |
| "learning_rate": 5.352768279562315e-06, | |
| "loss": 0.5110462188720704, | |
| "mean_token_accuracy": 0.8599414020776749, | |
| "num_tokens": 2490082.0, | |
| "step": 1230 | |
| }, | |
| { | |
| "entropy": 1.7677990421652794, | |
| "epoch": 3.3521842194378597, | |
| "grad_norm": 10.864715576171875, | |
| "learning_rate": 5.198430651940846e-06, | |
| "loss": 0.8702507972717285, | |
| "mean_token_accuracy": 0.8074817329645156, | |
| "num_tokens": 2510650.0, | |
| "step": 1240 | |
| }, | |
| { | |
| "entropy": 1.7419419810175896, | |
| "epoch": 3.3792753132407722, | |
| "grad_norm": 17.168798446655273, | |
| "learning_rate": 5.0455654282742e-06, | |
| "loss": 0.6099933624267578, | |
| "mean_token_accuracy": 0.8637857645750046, | |
| "num_tokens": 2530169.0, | |
| "step": 1250 | |
| }, | |
| { | |
| "entropy": 1.718581235408783, | |
| "epoch": 3.4063664070436843, | |
| "grad_norm": 9.985060691833496, | |
| "learning_rate": 4.894219484769622e-06, | |
| "loss": 0.38284480571746826, | |
| "mean_token_accuracy": 0.894951194524765, | |
| "num_tokens": 2549783.0, | |
| "step": 1260 | |
| }, | |
| { | |
| "entropy": 1.7342086032032966, | |
| "epoch": 3.433457500846597, | |
| "grad_norm": 7.34379768371582, | |
| "learning_rate": 4.744439231746251e-06, | |
| "loss": 0.5211464881896972, | |
| "mean_token_accuracy": 0.8848932076245546, | |
| "num_tokens": 2569240.0, | |
| "step": 1270 | |
| }, | |
| { | |
| "entropy": 1.7445754528045654, | |
| "epoch": 3.460548594649509, | |
| "grad_norm": 12.614356994628906, | |
| "learning_rate": 4.596270599403338e-06, | |
| "loss": 0.7350710391998291, | |
| "mean_token_accuracy": 0.8188348516821862, | |
| "num_tokens": 2589517.0, | |
| "step": 1280 | |
| }, | |
| { | |
| "entropy": 1.6525848761200905, | |
| "epoch": 3.4876396884524214, | |
| "grad_norm": 10.50085163116455, | |
| "learning_rate": 4.449759023735749e-06, | |
| "loss": 0.36133971214294436, | |
| "mean_token_accuracy": 0.9022616557776928, | |
| "num_tokens": 2610330.0, | |
| "step": 1290 | |
| }, | |
| { | |
| "entropy": 1.695315808057785, | |
| "epoch": 3.5147307822553335, | |
| "grad_norm": 7.3657026290893555, | |
| "learning_rate": 4.30494943260098e-06, | |
| "loss": 0.8237950325012207, | |
| "mean_token_accuracy": 0.8609236305579543, | |
| "num_tokens": 2632100.0, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 3.5147307822553335, | |
| "eval_entropy": 1.7062555481679738, | |
| "eval_loss": 1.265852451324463, | |
| "eval_mean_token_accuracy": 0.7387107044924051, | |
| "eval_num_tokens": 2632100.0, | |
| "eval_runtime": 25.4553, | |
| "eval_samples_per_second": 20.114, | |
| "eval_steps_per_second": 10.057, | |
| "step": 1300 | |
| }, | |
| { | |
| "entropy": 1.7215346291661262, | |
| "epoch": 3.541821876058246, | |
| "grad_norm": 9.210244178771973, | |
| "learning_rate": 4.161886231942017e-06, | |
| "loss": 0.6864943027496337, | |
| "mean_token_accuracy": 0.8675076253712177, | |
| "num_tokens": 2652389.0, | |
| "step": 1310 | |
| }, | |
| { | |
| "entropy": 1.7494278416037559, | |
| "epoch": 3.568912969861158, | |
| "grad_norm": 12.154091835021973, | |
| "learning_rate": 4.020613292170211e-06, | |
| "loss": 0.672312593460083, | |
| "mean_token_accuracy": 0.8510223753750324, | |
| "num_tokens": 2672161.0, | |
| "step": 1320 | |
| }, | |
| { | |
| "entropy": 1.7348069936037063, | |
| "epoch": 3.59600406366407, | |
| "grad_norm": 10.369400978088379, | |
| "learning_rate": 3.8811739347124e-06, | |
| "loss": 0.4440812110900879, | |
| "mean_token_accuracy": 0.8849797431379557, | |
| "num_tokens": 2693004.0, | |
| "step": 1330 | |
| }, | |
| { | |
| "entropy": 1.721322275698185, | |
| "epoch": 3.6230951574669827, | |
| "grad_norm": 4.361479759216309, | |
| "learning_rate": 3.7436109187263693e-06, | |
| "loss": 0.52271409034729, | |
| "mean_token_accuracy": 0.8836568117141723, | |
| "num_tokens": 2712634.0, | |
| "step": 1340 | |
| }, | |
| { | |
| "entropy": 1.7014023318886757, | |
| "epoch": 3.6501862512698953, | |
| "grad_norm": 15.928149223327637, | |
| "learning_rate": 3.6079664279887427e-06, | |
| "loss": 0.7015122890472412, | |
| "mean_token_accuracy": 0.8756893876940012, | |
| "num_tokens": 2732861.0, | |
| "step": 1350 | |
| }, | |
| { | |
| "entropy": 1.7075004890561103, | |
| "epoch": 3.6772773450728073, | |
| "grad_norm": 14.396157264709473, | |
| "learning_rate": 3.4742820579592673e-06, | |
| "loss": 0.5177778720855712, | |
| "mean_token_accuracy": 0.8753840968012809, | |
| "num_tokens": 2752885.0, | |
| "step": 1360 | |
| }, | |
| { | |
| "entropy": 1.6834155157208444, | |
| "epoch": 3.7043684388757194, | |
| "grad_norm": 8.488550186157227, | |
| "learning_rate": 3.342598803025595e-06, | |
| "loss": 0.619942045211792, | |
| "mean_token_accuracy": 0.8745716098695994, | |
| "num_tokens": 2773651.0, | |
| "step": 1370 | |
| }, | |
| { | |
| "entropy": 1.7230923131108284, | |
| "epoch": 3.731459532678632, | |
| "grad_norm": 13.944185256958008, | |
| "learning_rate": 3.212957043932283e-06, | |
| "loss": 0.6659866809844971, | |
| "mean_token_accuracy": 0.8391641702502965, | |
| "num_tokens": 2794243.0, | |
| "step": 1380 | |
| }, | |
| { | |
| "entropy": 1.661913888156414, | |
| "epoch": 3.758550626481544, | |
| "grad_norm": 5.620434761047363, | |
| "learning_rate": 3.085396535398044e-06, | |
| "loss": 0.40467143058776855, | |
| "mean_token_accuracy": 0.8812628626823426, | |
| "num_tokens": 2815288.0, | |
| "step": 1390 | |
| }, | |
| { | |
| "entropy": 1.6734888523817062, | |
| "epoch": 3.7856417202844566, | |
| "grad_norm": 12.459346771240234, | |
| "learning_rate": 2.959956393924922e-06, | |
| "loss": 0.4842523574829102, | |
| "mean_token_accuracy": 0.8642897168174386, | |
| "num_tokens": 2835949.0, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 3.7856417202844566, | |
| "eval_entropy": 1.6953813284635544, | |
| "eval_loss": 1.3081457614898682, | |
| "eval_mean_token_accuracy": 0.7404504243750125, | |
| "eval_num_tokens": 2835949.0, | |
| "eval_runtime": 25.4537, | |
| "eval_samples_per_second": 20.115, | |
| "eval_steps_per_second": 10.057, | |
| "step": 1400 | |
| }, | |
| { | |
| "entropy": 1.7142169624567032, | |
| "epoch": 3.8127328140873686, | |
| "grad_norm": 19.3244571685791, | |
| "learning_rate": 2.8366750858032177e-06, | |
| "loss": 0.7156589031219482, | |
| "mean_token_accuracy": 0.8869716469198465, | |
| "num_tokens": 2856246.0, | |
| "step": 1410 | |
| }, | |
| { | |
| "entropy": 1.6850622862577438, | |
| "epoch": 3.839823907890281, | |
| "grad_norm": 15.101435661315918, | |
| "learning_rate": 2.7155904153157497e-06, | |
| "loss": 0.45338053703308107, | |
| "mean_token_accuracy": 0.8818465910851956, | |
| "num_tokens": 2877330.0, | |
| "step": 1420 | |
| }, | |
| { | |
| "entropy": 1.7075368210673332, | |
| "epoch": 3.8669150016931932, | |
| "grad_norm": 15.861879348754883, | |
| "learning_rate": 2.5967395131451723e-06, | |
| "loss": 0.5139744758605957, | |
| "mean_token_accuracy": 0.8527137745171786, | |
| "num_tokens": 2897344.0, | |
| "step": 1430 | |
| }, | |
| { | |
| "entropy": 1.6651010170578957, | |
| "epoch": 3.8940060954961058, | |
| "grad_norm": 15.302207946777344, | |
| "learning_rate": 2.4801588249878163e-06, | |
| "loss": 0.7968846797943115, | |
| "mean_token_accuracy": 0.8468474011868239, | |
| "num_tokens": 2919143.0, | |
| "step": 1440 | |
| }, | |
| { | |
| "entropy": 1.6404287233948707, | |
| "epoch": 3.921097189299018, | |
| "grad_norm": 10.076866149902344, | |
| "learning_rate": 2.365884100377611e-06, | |
| "loss": 0.4457272529602051, | |
| "mean_token_accuracy": 0.8820912927389145, | |
| "num_tokens": 2941599.0, | |
| "step": 1450 | |
| }, | |
| { | |
| "entropy": 1.6921194523572922, | |
| "epoch": 3.9481882831019304, | |
| "grad_norm": 10.407143592834473, | |
| "learning_rate": 2.2539503817234553e-06, | |
| "loss": 0.6064411640167237, | |
| "mean_token_accuracy": 0.8608082607388496, | |
| "num_tokens": 2961983.0, | |
| "step": 1460 | |
| }, | |
| { | |
| "entropy": 1.712096980214119, | |
| "epoch": 3.9752793769048425, | |
| "grad_norm": 10.601531028747559, | |
| "learning_rate": 2.144391993563446e-06, | |
| "loss": 0.503159761428833, | |
| "mean_token_accuracy": 0.8580688439309597, | |
| "num_tokens": 2982164.0, | |
| "step": 1470 | |
| }, | |
| { | |
| "entropy": 1.6592551649433294, | |
| "epoch": 4.0, | |
| "grad_norm": 21.362045288085938, | |
| "learning_rate": 2.0372425320392454e-06, | |
| "loss": 0.5836192607879639, | |
| "mean_token_accuracy": 0.8683291808383106, | |
| "num_tokens": 3001900.0, | |
| "step": 1480 | |
| }, | |
| { | |
| "entropy": 1.6971124514937401, | |
| "epoch": 4.0270910938029125, | |
| "grad_norm": 8.777483940124512, | |
| "learning_rate": 1.932534854593795e-06, | |
| "loss": 0.6050891876220703, | |
| "mean_token_accuracy": 0.8690009146928788, | |
| "num_tokens": 3023056.0, | |
| "step": 1490 | |
| }, | |
| { | |
| "entropy": 1.63857099711895, | |
| "epoch": 4.054182187605824, | |
| "grad_norm": 8.595149040222168, | |
| "learning_rate": 1.8303010698955803e-06, | |
| "loss": 0.4310460090637207, | |
| "mean_token_accuracy": 0.8924087427556515, | |
| "num_tokens": 3043490.0, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 4.054182187605824, | |
| "eval_entropy": 1.669337394181639, | |
| "eval_loss": 1.3523277044296265, | |
| "eval_mean_token_accuracy": 0.7376706907525659, | |
| "eval_num_tokens": 3043490.0, | |
| "eval_runtime": 25.4594, | |
| "eval_samples_per_second": 20.11, | |
| "eval_steps_per_second": 10.055, | |
| "step": 1500 | |
| }, | |
| { | |
| "entropy": 1.6625288650393486, | |
| "epoch": 4.081273281408737, | |
| "grad_norm": 12.073065757751465, | |
| "learning_rate": 1.7305725279924634e-06, | |
| "loss": 0.3827295541763306, | |
| "mean_token_accuracy": 0.8844121858477593, | |
| "num_tokens": 3064126.0, | |
| "step": 1510 | |
| }, | |
| { | |
| "entropy": 1.6116922572255135, | |
| "epoch": 4.108364375211649, | |
| "grad_norm": 5.359347820281982, | |
| "learning_rate": 1.6333798106982024e-06, | |
| "loss": 0.3580256700515747, | |
| "mean_token_accuracy": 0.9377022050321102, | |
| "num_tokens": 3083867.0, | |
| "step": 1520 | |
| }, | |
| { | |
| "entropy": 1.591383346915245, | |
| "epoch": 4.135455469014562, | |
| "grad_norm": 6.666597843170166, | |
| "learning_rate": 1.5387527222144861e-06, | |
| "loss": 0.43925886154174804, | |
| "mean_token_accuracy": 0.918615211546421, | |
| "num_tokens": 3103679.0, | |
| "step": 1530 | |
| }, | |
| { | |
| "entropy": 1.5715536609292031, | |
| "epoch": 4.162546562817473, | |
| "grad_norm": 9.182818412780762, | |
| "learning_rate": 1.446720279991496e-06, | |
| "loss": 0.30636699199676515, | |
| "mean_token_accuracy": 0.9238971933722496, | |
| "num_tokens": 3125843.0, | |
| "step": 1540 | |
| }, | |
| { | |
| "entropy": 1.6449363514781, | |
| "epoch": 4.189637656620386, | |
| "grad_norm": 7.822624206542969, | |
| "learning_rate": 1.3573107058296619e-06, | |
| "loss": 0.45112295150756837, | |
| "mean_token_accuracy": 0.8905558969825507, | |
| "num_tokens": 3144837.0, | |
| "step": 1550 | |
| }, | |
| { | |
| "entropy": 1.5784786254167558, | |
| "epoch": 4.216728750423298, | |
| "grad_norm": 11.84586238861084, | |
| "learning_rate": 1.270551417225443e-06, | |
| "loss": 0.4005408763885498, | |
| "mean_token_accuracy": 0.9311332777142525, | |
| "num_tokens": 3163882.0, | |
| "step": 1560 | |
| }, | |
| { | |
| "entropy": 1.5929084509611129, | |
| "epoch": 4.243819844226211, | |
| "grad_norm": 18.798683166503906, | |
| "learning_rate": 1.1864690189637306e-06, | |
| "loss": 0.5499368190765381, | |
| "mean_token_accuracy": 0.8895844966173172, | |
| "num_tokens": 3185313.0, | |
| "step": 1570 | |
| }, | |
| { | |
| "entropy": 1.6276163026690482, | |
| "epoch": 4.270910938029123, | |
| "grad_norm": 18.325300216674805, | |
| "learning_rate": 1.105089294959487e-06, | |
| "loss": 0.47011642456054686, | |
| "mean_token_accuracy": 0.8977843724191189, | |
| "num_tokens": 3206038.0, | |
| "step": 1580 | |
| }, | |
| { | |
| "entropy": 1.6390855327248572, | |
| "epoch": 4.298002031832035, | |
| "grad_norm": 16.15447235107422, | |
| "learning_rate": 1.0264372003510747e-06, | |
| "loss": 0.5724862575531006, | |
| "mean_token_accuracy": 0.8626310247927904, | |
| "num_tokens": 3225061.0, | |
| "step": 1590 | |
| }, | |
| { | |
| "entropy": 1.6146731659770013, | |
| "epoch": 4.325093125634948, | |
| "grad_norm": 5.743528366088867, | |
| "learning_rate": 9.5053685384777e-07, | |
| "loss": 0.6115519046783447, | |
| "mean_token_accuracy": 0.8991932325065136, | |
| "num_tokens": 3246376.0, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 4.325093125634948, | |
| "eval_entropy": 1.6513289087451994, | |
| "eval_loss": 1.399103045463562, | |
| "eval_mean_token_accuracy": 0.7364511488704011, | |
| "eval_num_tokens": 3246376.0, | |
| "eval_runtime": 25.4867, | |
| "eval_samples_per_second": 20.089, | |
| "eval_steps_per_second": 10.044, | |
| "step": 1600 | |
| }, | |
| { | |
| "entropy": 1.6438001811504364, | |
| "epoch": 4.35218421943786, | |
| "grad_norm": 10.316023826599121, | |
| "learning_rate": 8.774115303337305e-07, | |
| "loss": 0.3678164005279541, | |
| "mean_token_accuracy": 0.9086852367967367, | |
| "num_tokens": 3266626.0, | |
| "step": 1610 | |
| }, | |
| { | |
| "entropy": 1.6436322793364524, | |
| "epoch": 4.379275313240772, | |
| "grad_norm": 7.732473373413086, | |
| "learning_rate": 8.070836537307536e-07, | |
| "loss": 0.38886566162109376, | |
| "mean_token_accuracy": 0.9289665892720222, | |
| "num_tokens": 3285791.0, | |
| "step": 1620 | |
| }, | |
| { | |
| "entropy": 1.6396998748183251, | |
| "epoch": 4.406366407043684, | |
| "grad_norm": 15.49699592590332, | |
| "learning_rate": 7.395747901219474e-07, | |
| "loss": 0.3827892541885376, | |
| "mean_token_accuracy": 0.9125935144722461, | |
| "num_tokens": 3304914.0, | |
| "step": 1630 | |
| }, | |
| { | |
| "entropy": 1.6532684773206712, | |
| "epoch": 4.433457500846597, | |
| "grad_norm": 14.576912879943848, | |
| "learning_rate": 6.749056411385046e-07, | |
| "loss": 0.6813682079315185, | |
| "mean_token_accuracy": 0.8684317111968994, | |
| "num_tokens": 3324646.0, | |
| "step": 1640 | |
| }, | |
| { | |
| "entropy": 1.6200390428304672, | |
| "epoch": 4.460548594649509, | |
| "grad_norm": 18.16828727722168, | |
| "learning_rate": 6.130960376115147e-07, | |
| "loss": 0.38154261112213134, | |
| "mean_token_accuracy": 0.8886280782520771, | |
| "num_tokens": 3345568.0, | |
| "step": 1650 | |
| }, | |
| { | |
| "entropy": 1.6201925188302995, | |
| "epoch": 4.487639688452421, | |
| "grad_norm": 4.342578887939453, | |
| "learning_rate": 5.541649334908405e-07, | |
| "loss": 0.3788790464401245, | |
| "mean_token_accuracy": 0.891268914937973, | |
| "num_tokens": 3366108.0, | |
| "step": 1660 | |
| }, | |
| { | |
| "entropy": 1.6324064388871193, | |
| "epoch": 4.5147307822553335, | |
| "grad_norm": 10.33731460571289, | |
| "learning_rate": 4.981304000328702e-07, | |
| "loss": 0.491044807434082, | |
| "mean_token_accuracy": 0.9079089991748333, | |
| "num_tokens": 3386012.0, | |
| "step": 1670 | |
| }, | |
| { | |
| "entropy": 1.613644614815712, | |
| "epoch": 4.541821876058246, | |
| "grad_norm": 8.337615966796875, | |
| "learning_rate": 4.450096202589671e-07, | |
| "loss": 0.28208341598510744, | |
| "mean_token_accuracy": 0.9069402247667313, | |
| "num_tokens": 3406651.0, | |
| "step": 1680 | |
| }, | |
| { | |
| "entropy": 1.585978364944458, | |
| "epoch": 4.568912969861158, | |
| "grad_norm": 8.048723220825195, | |
| "learning_rate": 3.9481888368627764e-07, | |
| "loss": 0.27262258529663086, | |
| "mean_token_accuracy": 0.9263891167938709, | |
| "num_tokens": 3426691.0, | |
| "step": 1690 | |
| }, | |
| { | |
| "entropy": 1.6033645749092102, | |
| "epoch": 4.59600406366407, | |
| "grad_norm": 15.038307189941406, | |
| "learning_rate": 3.4757358133254207e-07, | |
| "loss": 0.6044834136962891, | |
| "mean_token_accuracy": 0.8724760405719281, | |
| "num_tokens": 3447608.0, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 4.59600406366407, | |
| "eval_entropy": 1.645897411275655, | |
| "eval_loss": 1.4024633169174194, | |
| "eval_mean_token_accuracy": 0.7368950636591762, | |
| "eval_num_tokens": 3447608.0, | |
| "eval_runtime": 25.5248, | |
| "eval_samples_per_second": 20.059, | |
| "eval_steps_per_second": 10.029, | |
| "step": 1700 | |
| }, | |
| { | |
| "entropy": 1.6228346675634384, | |
| "epoch": 4.623095157466983, | |
| "grad_norm": 13.567054748535156, | |
| "learning_rate": 3.032882009964322e-07, | |
| "loss": 0.4227153301239014, | |
| "mean_token_accuracy": 0.9056596923619509, | |
| "num_tokens": 3467735.0, | |
| "step": 1710 | |
| }, | |
| { | |
| "entropy": 1.617300546169281, | |
| "epoch": 4.650186251269895, | |
| "grad_norm": 14.03318977355957, | |
| "learning_rate": 2.619763228148664e-07, | |
| "loss": 0.35500648021698, | |
| "mean_token_accuracy": 0.9040526457130909, | |
| "num_tokens": 3487598.0, | |
| "step": 1720 | |
| }, | |
| { | |
| "entropy": 1.5993121460080146, | |
| "epoch": 4.677277345072808, | |
| "grad_norm": 9.692215919494629, | |
| "learning_rate": 2.236506150986395e-07, | |
| "loss": 0.44063520431518555, | |
| "mean_token_accuracy": 0.9209048740565777, | |
| "num_tokens": 3508359.0, | |
| "step": 1730 | |
| }, | |
| { | |
| "entropy": 1.6759715333580971, | |
| "epoch": 4.704368438875719, | |
| "grad_norm": 19.903579711914062, | |
| "learning_rate": 1.8832283044768585e-07, | |
| "loss": 0.4889723300933838, | |
| "mean_token_accuracy": 0.8778417184948921, | |
| "num_tokens": 3527446.0, | |
| "step": 1740 | |
| }, | |
| { | |
| "entropy": 1.6152383774518966, | |
| "epoch": 4.731459532678632, | |
| "grad_norm": 3.170473337173462, | |
| "learning_rate": 1.5600380214714216e-07, | |
| "loss": 0.4727470397949219, | |
| "mean_token_accuracy": 0.9017321106046439, | |
| "num_tokens": 3547726.0, | |
| "step": 1750 | |
| }, | |
| { | |
| "entropy": 1.6021659523248672, | |
| "epoch": 4.7585506264815445, | |
| "grad_norm": 20.662057876586914, | |
| "learning_rate": 1.2670344084530384e-07, | |
| "loss": 0.46443953514099123, | |
| "mean_token_accuracy": 0.8934749307110905, | |
| "num_tokens": 3567854.0, | |
| "step": 1760 | |
| }, | |
| { | |
| "entropy": 1.5918526247143745, | |
| "epoch": 4.785641720284456, | |
| "grad_norm": 10.510283470153809, | |
| "learning_rate": 1.0043073151452808e-07, | |
| "loss": 0.4407022476196289, | |
| "mean_token_accuracy": 0.9137253064662219, | |
| "num_tokens": 3589923.0, | |
| "step": 1770 | |
| }, | |
| { | |
| "entropy": 1.6411705940961838, | |
| "epoch": 4.812732814087369, | |
| "grad_norm": 15.203192710876465, | |
| "learning_rate": 7.719373069598246e-08, | |
| "loss": 0.49732284545898436, | |
| "mean_token_accuracy": 0.8905138060450554, | |
| "num_tokens": 3610920.0, | |
| "step": 1780 | |
| }, | |
| { | |
| "entropy": 1.623388308286667, | |
| "epoch": 4.839823907890281, | |
| "grad_norm": 12.377976417541504, | |
| "learning_rate": 5.6999564029103226e-08, | |
| "loss": 0.4741045475006104, | |
| "mean_token_accuracy": 0.9054140999913216, | |
| "num_tokens": 3630913.0, | |
| "step": 1790 | |
| }, | |
| { | |
| "entropy": 1.5931948989629745, | |
| "epoch": 4.866915001693194, | |
| "grad_norm": 7.101802825927734, | |
| "learning_rate": 3.98544240665133e-08, | |
| "loss": 0.4587404251098633, | |
| "mean_token_accuracy": 0.9269338101148605, | |
| "num_tokens": 3651374.0, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 4.866915001693194, | |
| "eval_entropy": 1.6439465275034308, | |
| "eval_loss": 1.4104795455932617, | |
| "eval_mean_token_accuracy": 0.736133792786859, | |
| "eval_num_tokens": 3651374.0, | |
| "eval_runtime": 25.4587, | |
| "eval_samples_per_second": 20.111, | |
| "eval_steps_per_second": 10.055, | |
| "step": 1800 | |
| }, | |
| { | |
| "entropy": 1.601736557483673, | |
| "epoch": 4.894006095496105, | |
| "grad_norm": 11.146471977233887, | |
| "learning_rate": 2.5763568375075655e-08, | |
| "loss": 0.5720036029815674, | |
| "mean_token_accuracy": 0.8911033194512129, | |
| "num_tokens": 3671445.0, | |
| "step": 1810 | |
| }, | |
| { | |
| "entropy": 1.60008362531662, | |
| "epoch": 4.921097189299018, | |
| "grad_norm": 21.521833419799805, | |
| "learning_rate": 1.473131792365301e-08, | |
| "loss": 0.37158544063568116, | |
| "mean_token_accuracy": 0.9116154242306947, | |
| "num_tokens": 3691881.0, | |
| "step": 1820 | |
| }, | |
| { | |
| "entropy": 1.6304287910461426, | |
| "epoch": 4.94818828310193, | |
| "grad_norm": 15.239692687988281, | |
| "learning_rate": 6.761055758083279e-09, | |
| "loss": 0.42179555892944337, | |
| "mean_token_accuracy": 0.8883754149079323, | |
| "num_tokens": 3711706.0, | |
| "step": 1830 | |
| }, | |
| { | |
| "entropy": 1.6515601187944413, | |
| "epoch": 4.975279376904843, | |
| "grad_norm": 11.510629653930664, | |
| "learning_rate": 1.8552259637627524e-09, | |
| "loss": 0.3710385799407959, | |
| "mean_token_accuracy": 0.9058502331376076, | |
| "num_tokens": 3733729.0, | |
| "step": 1840 | |
| }, | |
| { | |
| "entropy": 1.6298474122400153, | |
| "epoch": 5.0, | |
| "grad_norm": 8.197460174560547, | |
| "learning_rate": 1.5332916172283718e-11, | |
| "loss": 0.3809305429458618, | |
| "mean_token_accuracy": 0.9352603583303216, | |
| "num_tokens": 3752375.0, | |
| "step": 1850 | |
| }, | |
| { | |
| "epoch": 5.0, | |
| "eval_entropy": 1.6423234520480037, | |
| "eval_loss": 1.4100017547607422, | |
| "eval_mean_token_accuracy": 0.7342472999589518, | |
| "eval_num_tokens": 3752375.0, | |
| "eval_runtime": 25.4872, | |
| "eval_samples_per_second": 20.089, | |
| "eval_steps_per_second": 10.044, | |
| "step": 1850 | |
| }, | |
| { | |
| "epoch": 5.0, | |
| "step": 1850, | |
| "total_flos": 1.69605163656192e+17, | |
| "train_loss": 0.9120298720694877, | |
| "train_runtime": 3361.88, | |
| "train_samples_per_second": 4.392, | |
| "train_steps_per_second": 0.55 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 1850, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 5, | |
| "save_steps": 100, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.69605163656192e+17, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |