Instructions to use Jongbin-kr/llama-3.1-8b-instruct_SNI-ours-luca_ffn-only with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use Jongbin-kr/llama-3.1-8b-instruct_SNI-ours-luca_ffn-only with Transformers:
# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("Jongbin-kr/llama-3.1-8b-instruct_SNI-ours-luca_ffn-only", device_map="auto") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": 1600, | |
| "best_metric": 0.8140835165977478, | |
| "best_model_checkpoint": "/data6/jongbinwon/evolving_MoE/checkpoints/sft_llama31_8b_sni_ours-luca_ffn_only_5ep/checkpoint-1600", | |
| "epoch": 5.0, | |
| "eval_steps": 100, | |
| "global_step": 4280, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 1.7990853235125541, | |
| "epoch": 0.01168736303871439, | |
| "grad_norm": 2.2411153316497803, | |
| "learning_rate": 1.3953488372093025e-06, | |
| "loss": 2.221370887756348, | |
| "mean_token_accuracy": 0.4454644417390227, | |
| "num_tokens": 90886.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 1.7851194575428964, | |
| "epoch": 0.02337472607742878, | |
| "grad_norm": 5.774791240692139, | |
| "learning_rate": 2.9457364341085276e-06, | |
| "loss": 2.287215232849121, | |
| "mean_token_accuracy": 0.4802763115614653, | |
| "num_tokens": 193261.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 1.8645276561379434, | |
| "epoch": 0.03506208911614317, | |
| "grad_norm": 1.2933292388916016, | |
| "learning_rate": 4.4961240310077525e-06, | |
| "loss": 2.0796104431152345, | |
| "mean_token_accuracy": 0.5051111107692122, | |
| "num_tokens": 311331.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 1.8436205610632896, | |
| "epoch": 0.04674945215485756, | |
| "grad_norm": 5.532759666442871, | |
| "learning_rate": 6.046511627906977e-06, | |
| "loss": 2.019709587097168, | |
| "mean_token_accuracy": 0.48441268149763345, | |
| "num_tokens": 400148.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 1.828799621760845, | |
| "epoch": 0.05843681519357195, | |
| "grad_norm": 4.328863620758057, | |
| "learning_rate": 7.596899224806202e-06, | |
| "loss": 1.6759492874145507, | |
| "mean_token_accuracy": 0.6234621474519372, | |
| "num_tokens": 524126.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 1.9845396891236304, | |
| "epoch": 0.07012417823228634, | |
| "grad_norm": 4.902604579925537, | |
| "learning_rate": 9.147286821705427e-06, | |
| "loss": 1.6193151473999023, | |
| "mean_token_accuracy": 0.6227478144690395, | |
| "num_tokens": 604582.0, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 2.1635267987847326, | |
| "epoch": 0.08181154127100074, | |
| "grad_norm": 1.8905808925628662, | |
| "learning_rate": 1.0697674418604651e-05, | |
| "loss": 1.7636125564575196, | |
| "mean_token_accuracy": 0.6229628790169954, | |
| "num_tokens": 690297.0, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 2.20285327732563, | |
| "epoch": 0.09349890430971512, | |
| "grad_norm": 3.2167978286743164, | |
| "learning_rate": 1.2248062015503876e-05, | |
| "loss": 1.7089515686035157, | |
| "mean_token_accuracy": 0.6355361180379987, | |
| "num_tokens": 797131.0, | |
| "step": 80 | |
| }, | |
| { | |
| "entropy": 2.164117117226124, | |
| "epoch": 0.10518626734842951, | |
| "grad_norm": 1.2573010921478271, | |
| "learning_rate": 1.3798449612403102e-05, | |
| "loss": 1.563762092590332, | |
| "mean_token_accuracy": 0.6375745143741369, | |
| "num_tokens": 877794.0, | |
| "step": 90 | |
| }, | |
| { | |
| "entropy": 2.1955269888043403, | |
| "epoch": 0.1168736303871439, | |
| "grad_norm": 1.4883538484573364, | |
| "learning_rate": 1.5348837209302328e-05, | |
| "loss": 1.5268404960632325, | |
| "mean_token_accuracy": 0.6866611793637276, | |
| "num_tokens": 964357.0, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.1168736303871439, | |
| "eval_entropy": 2.211864855606109, | |
| "eval_loss": 0.972606360912323, | |
| "eval_mean_token_accuracy": 0.7656966285430826, | |
| "eval_num_tokens": 964357.0, | |
| "eval_runtime": 25.7541, | |
| "eval_samples_per_second": 19.88, | |
| "eval_steps_per_second": 9.94, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 2.14595272988081, | |
| "epoch": 0.12856099342585828, | |
| "grad_norm": 3.258664846420288, | |
| "learning_rate": 1.689922480620155e-05, | |
| "loss": 1.5449288368225098, | |
| "mean_token_accuracy": 0.692005117610097, | |
| "num_tokens": 1051056.0, | |
| "step": 110 | |
| }, | |
| { | |
| "entropy": 2.13690192848444, | |
| "epoch": 0.14024835646457268, | |
| "grad_norm": 3.329728841781616, | |
| "learning_rate": 1.8449612403100777e-05, | |
| "loss": 1.714167022705078, | |
| "mean_token_accuracy": 0.6207397798076272, | |
| "num_tokens": 1139127.0, | |
| "step": 120 | |
| }, | |
| { | |
| "entropy": 2.2397685661911964, | |
| "epoch": 0.15193571950328708, | |
| "grad_norm": 3.1570706367492676, | |
| "learning_rate": 2e-05, | |
| "loss": 1.4322842597961425, | |
| "mean_token_accuracy": 0.6956309005618095, | |
| "num_tokens": 1205809.0, | |
| "step": 130 | |
| }, | |
| { | |
| "entropy": 2.1315575197339056, | |
| "epoch": 0.16362308254200147, | |
| "grad_norm": 1.8168814182281494, | |
| "learning_rate": 1.99997136071245e-05, | |
| "loss": 1.304494285583496, | |
| "mean_token_accuracy": 0.6879714308306575, | |
| "num_tokens": 1313591.0, | |
| "step": 140 | |
| }, | |
| { | |
| "entropy": 2.2233649238944055, | |
| "epoch": 0.17531044558071585, | |
| "grad_norm": 0.8144795894622803, | |
| "learning_rate": 1.999885444490217e-05, | |
| "loss": 1.3845972061157226, | |
| "mean_token_accuracy": 0.6910346703603863, | |
| "num_tokens": 1412866.0, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 2.1577580630779267, | |
| "epoch": 0.18699780861943024, | |
| "grad_norm": 1.940482258796692, | |
| "learning_rate": 1.9997422562544592e-05, | |
| "loss": 1.390633773803711, | |
| "mean_token_accuracy": 0.6759929563850164, | |
| "num_tokens": 1508013.0, | |
| "step": 160 | |
| }, | |
| { | |
| "entropy": 2.083321948349476, | |
| "epoch": 0.19868517165814464, | |
| "grad_norm": 3.6317291259765625, | |
| "learning_rate": 1.9995418042067957e-05, | |
| "loss": 1.2338299751281738, | |
| "mean_token_accuracy": 0.7018413636833429, | |
| "num_tokens": 1596613.0, | |
| "step": 170 | |
| }, | |
| { | |
| "entropy": 2.053264130651951, | |
| "epoch": 0.21037253469685901, | |
| "grad_norm": 2.9840128421783447, | |
| "learning_rate": 1.9992840998288338e-05, | |
| "loss": 1.5092729568481444, | |
| "mean_token_accuracy": 0.6634657958522439, | |
| "num_tokens": 1705162.0, | |
| "step": 180 | |
| }, | |
| { | |
| "entropy": 2.105809884518385, | |
| "epoch": 0.2220598977355734, | |
| "grad_norm": 2.120786428451538, | |
| "learning_rate": 1.9989691578815128e-05, | |
| "loss": 1.3493456840515137, | |
| "mean_token_accuracy": 0.6496284365653991, | |
| "num_tokens": 1772797.0, | |
| "step": 190 | |
| }, | |
| { | |
| "entropy": 2.2239570677280427, | |
| "epoch": 0.2337472607742878, | |
| "grad_norm": 0.7451742887496948, | |
| "learning_rate": 1.998596996404259e-05, | |
| "loss": 1.510793972015381, | |
| "mean_token_accuracy": 0.6867920899763703, | |
| "num_tokens": 1858310.0, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.2337472607742878, | |
| "eval_entropy": 2.113139286637306, | |
| "eval_loss": 0.9217231273651123, | |
| "eval_mean_token_accuracy": 0.7753882835968398, | |
| "eval_num_tokens": 1858310.0, | |
| "eval_runtime": 25.7918, | |
| "eval_samples_per_second": 19.851, | |
| "eval_steps_per_second": 9.926, | |
| "step": 200 | |
| }, | |
| { | |
| "entropy": 2.0635509312152864, | |
| "epoch": 0.24543462381300218, | |
| "grad_norm": 2.845130681991577, | |
| "learning_rate": 1.9981676367139516e-05, | |
| "loss": 1.42849702835083, | |
| "mean_token_accuracy": 0.6870072908699513, | |
| "num_tokens": 1949074.0, | |
| "step": 210 | |
| }, | |
| { | |
| "entropy": 2.148236308991909, | |
| "epoch": 0.25712198685171656, | |
| "grad_norm": 1.786993145942688, | |
| "learning_rate": 1.9976811034037018e-05, | |
| "loss": 1.3782122611999512, | |
| "mean_token_accuracy": 0.6854639150202274, | |
| "num_tokens": 2034492.0, | |
| "step": 220 | |
| }, | |
| { | |
| "entropy": 2.029401682317257, | |
| "epoch": 0.268809349890431, | |
| "grad_norm": 2.152838706970215, | |
| "learning_rate": 1.9971374243414442e-05, | |
| "loss": 1.4339065551757812, | |
| "mean_token_accuracy": 0.6851927833631635, | |
| "num_tokens": 2120329.0, | |
| "step": 230 | |
| }, | |
| { | |
| "entropy": 2.187216105312109, | |
| "epoch": 0.28049671292914535, | |
| "grad_norm": 4.411855220794678, | |
| "learning_rate": 1.9965366306683407e-05, | |
| "loss": 1.5027010917663575, | |
| "mean_token_accuracy": 0.6676396857947111, | |
| "num_tokens": 2183929.0, | |
| "step": 240 | |
| }, | |
| { | |
| "entropy": 2.066372972726822, | |
| "epoch": 0.2921840759678597, | |
| "grad_norm": 2.8336033821105957, | |
| "learning_rate": 1.995878756796997e-05, | |
| "loss": 1.3935389518737793, | |
| "mean_token_accuracy": 0.7052215587347745, | |
| "num_tokens": 2271714.0, | |
| "step": 250 | |
| }, | |
| { | |
| "entropy": 2.146583802998066, | |
| "epoch": 0.30387143900657415, | |
| "grad_norm": 1.979851245880127, | |
| "learning_rate": 1.9951638404094914e-05, | |
| "loss": 1.4767843246459962, | |
| "mean_token_accuracy": 0.6532610202208161, | |
| "num_tokens": 2370958.0, | |
| "step": 260 | |
| }, | |
| { | |
| "entropy": 2.0532761082053184, | |
| "epoch": 0.3155588020452885, | |
| "grad_norm": 2.413297176361084, | |
| "learning_rate": 1.9943919224552154e-05, | |
| "loss": 1.4167465209960937, | |
| "mean_token_accuracy": 0.6672960091382265, | |
| "num_tokens": 2489860.0, | |
| "step": 270 | |
| }, | |
| { | |
| "entropy": 2.123379871249199, | |
| "epoch": 0.32724616508400295, | |
| "grad_norm": 3.317007541656494, | |
| "learning_rate": 1.9935630471485293e-05, | |
| "loss": 1.5103903770446778, | |
| "mean_token_accuracy": 0.6566739233210683, | |
| "num_tokens": 2582123.0, | |
| "step": 280 | |
| }, | |
| { | |
| "entropy": 2.0638687670230866, | |
| "epoch": 0.3389335281227173, | |
| "grad_norm": 3.5680251121520996, | |
| "learning_rate": 1.99267726196623e-05, | |
| "loss": 1.6115623474121095, | |
| "mean_token_accuracy": 0.6871760074049235, | |
| "num_tokens": 2689776.0, | |
| "step": 290 | |
| }, | |
| { | |
| "entropy": 2.124503730237484, | |
| "epoch": 0.3506208911614317, | |
| "grad_norm": 1.3090689182281494, | |
| "learning_rate": 1.9917346176448312e-05, | |
| "loss": 1.3552765846252441, | |
| "mean_token_accuracy": 0.6656280636787415, | |
| "num_tokens": 2795637.0, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.3506208911614317, | |
| "eval_entropy": 2.1001131371594965, | |
| "eval_loss": 0.9286051988601685, | |
| "eval_mean_token_accuracy": 0.7654476343886927, | |
| "eval_num_tokens": 2795637.0, | |
| "eval_runtime": 25.7115, | |
| "eval_samples_per_second": 19.913, | |
| "eval_steps_per_second": 9.957, | |
| "step": 300 | |
| }, | |
| { | |
| "entropy": 2.0987854704260824, | |
| "epoch": 0.3623082542001461, | |
| "grad_norm": 2.1889779567718506, | |
| "learning_rate": 1.990735168177655e-05, | |
| "loss": 1.4275793075561523, | |
| "mean_token_accuracy": 0.6943906715139747, | |
| "num_tokens": 2895858.0, | |
| "step": 310 | |
| }, | |
| { | |
| "entropy": 2.1431354597210883, | |
| "epoch": 0.3739956172388605, | |
| "grad_norm": 3.8745343685150146, | |
| "learning_rate": 1.9896789708117442e-05, | |
| "loss": 1.5244775772094727, | |
| "mean_token_accuracy": 0.6774675730615854, | |
| "num_tokens": 2973005.0, | |
| "step": 320 | |
| }, | |
| { | |
| "entropy": 2.036357672512531, | |
| "epoch": 0.38568298027757486, | |
| "grad_norm": 3.4766616821289062, | |
| "learning_rate": 1.988566086044578e-05, | |
| "loss": 1.2670412063598633, | |
| "mean_token_accuracy": 0.6847519468516111, | |
| "num_tokens": 3068261.0, | |
| "step": 330 | |
| }, | |
| { | |
| "entropy": 2.040398380160332, | |
| "epoch": 0.3973703433162893, | |
| "grad_norm": 2.0919291973114014, | |
| "learning_rate": 1.9873965776206103e-05, | |
| "loss": 1.2989651679992675, | |
| "mean_token_accuracy": 0.7239908363670111, | |
| "num_tokens": 3161452.0, | |
| "step": 340 | |
| }, | |
| { | |
| "entropy": 2.0912220269441604, | |
| "epoch": 0.40905770635500366, | |
| "grad_norm": 2.9482905864715576, | |
| "learning_rate": 1.9861705125276173e-05, | |
| "loss": 1.5268967628479004, | |
| "mean_token_accuracy": 0.6429461358115077, | |
| "num_tokens": 3240838.0, | |
| "step": 350 | |
| }, | |
| { | |
| "entropy": 2.08566821962595, | |
| "epoch": 0.42074506939371803, | |
| "grad_norm": 3.328305721282959, | |
| "learning_rate": 1.9848879609928606e-05, | |
| "loss": 1.4985569953918456, | |
| "mean_token_accuracy": 0.6740516029298306, | |
| "num_tokens": 3343139.0, | |
| "step": 360 | |
| }, | |
| { | |
| "entropy": 2.0485661208629606, | |
| "epoch": 0.43243243243243246, | |
| "grad_norm": 2.752358913421631, | |
| "learning_rate": 1.9835489964790646e-05, | |
| "loss": 1.4463869094848634, | |
| "mean_token_accuracy": 0.6743310626596213, | |
| "num_tokens": 3488879.0, | |
| "step": 370 | |
| }, | |
| { | |
| "entropy": 2.098214092850685, | |
| "epoch": 0.4441197954711468, | |
| "grad_norm": 2.8611302375793457, | |
| "learning_rate": 1.9821536956802087e-05, | |
| "loss": 1.2331249237060546, | |
| "mean_token_accuracy": 0.6835227191448212, | |
| "num_tokens": 3580970.0, | |
| "step": 380 | |
| }, | |
| { | |
| "entropy": 2.0741601526737212, | |
| "epoch": 0.4558071585098612, | |
| "grad_norm": 2.8654325008392334, | |
| "learning_rate": 1.9807021385171342e-05, | |
| "loss": 1.4935486793518067, | |
| "mean_token_accuracy": 0.6689293952658772, | |
| "num_tokens": 3685521.0, | |
| "step": 390 | |
| }, | |
| { | |
| "entropy": 2.0226009979844095, | |
| "epoch": 0.4674945215485756, | |
| "grad_norm": 2.5369250774383545, | |
| "learning_rate": 1.979194408132968e-05, | |
| "loss": 1.4667850494384767, | |
| "mean_token_accuracy": 0.6739391122013331, | |
| "num_tokens": 3777526.0, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.4674945215485756, | |
| "eval_entropy": 2.0862251897342503, | |
| "eval_loss": 0.8904886841773987, | |
| "eval_mean_token_accuracy": 0.7775540838483721, | |
| "eval_num_tokens": 3777526.0, | |
| "eval_runtime": 25.7601, | |
| "eval_samples_per_second": 19.876, | |
| "eval_steps_per_second": 9.938, | |
| "step": 400 | |
| }, | |
| { | |
| "entropy": 2.0925071969628335, | |
| "epoch": 0.47918188458729, | |
| "grad_norm": 2.5446367263793945, | |
| "learning_rate": 1.977630590888357e-05, | |
| "loss": 1.2959745407104493, | |
| "mean_token_accuracy": 0.6557210482656955, | |
| "num_tokens": 3887532.0, | |
| "step": 410 | |
| }, | |
| { | |
| "entropy": 2.0614023089408873, | |
| "epoch": 0.49086924762600437, | |
| "grad_norm": 2.8507156372070312, | |
| "learning_rate": 1.9760107763565253e-05, | |
| "loss": 1.6900123596191405, | |
| "mean_token_accuracy": 0.6901388188824058, | |
| "num_tokens": 3981875.0, | |
| "step": 420 | |
| }, | |
| { | |
| "entropy": 2.07640870064497, | |
| "epoch": 0.5025566106647188, | |
| "grad_norm": 3.148797035217285, | |
| "learning_rate": 1.974335057318141e-05, | |
| "loss": 1.308906650543213, | |
| "mean_token_accuracy": 0.7089092643931508, | |
| "num_tokens": 4130771.0, | |
| "step": 430 | |
| }, | |
| { | |
| "entropy": 2.093033117055893, | |
| "epoch": 0.5142439737034331, | |
| "grad_norm": 5.219605445861816, | |
| "learning_rate": 1.972603529756003e-05, | |
| "loss": 1.4210287094116212, | |
| "mean_token_accuracy": 0.6731326477602124, | |
| "num_tokens": 4205874.0, | |
| "step": 440 | |
| }, | |
| { | |
| "entropy": 2.074295262992382, | |
| "epoch": 0.5259313367421475, | |
| "grad_norm": 1.5453256368637085, | |
| "learning_rate": 1.9708162928495428e-05, | |
| "loss": 1.4468173027038573, | |
| "mean_token_accuracy": 0.6713122161105275, | |
| "num_tokens": 4305278.0, | |
| "step": 450 | |
| }, | |
| { | |
| "entropy": 2.07851143181324, | |
| "epoch": 0.537618699780862, | |
| "grad_norm": 3.1280317306518555, | |
| "learning_rate": 1.968973448969144e-05, | |
| "loss": 1.5542386054992676, | |
| "mean_token_accuracy": 0.6788748688995838, | |
| "num_tokens": 4400820.0, | |
| "step": 460 | |
| }, | |
| { | |
| "entropy": 2.1338010519742965, | |
| "epoch": 0.5493060628195763, | |
| "grad_norm": 1.1596672534942627, | |
| "learning_rate": 1.967075103670278e-05, | |
| "loss": 1.180473232269287, | |
| "mean_token_accuracy": 0.7129562532529234, | |
| "num_tokens": 4507701.0, | |
| "step": 470 | |
| }, | |
| { | |
| "entropy": 2.09687916636467, | |
| "epoch": 0.5609934258582907, | |
| "grad_norm": 0.918991208076477, | |
| "learning_rate": 1.965121365687458e-05, | |
| "loss": 1.3882193565368652, | |
| "mean_token_accuracy": 0.696927659586072, | |
| "num_tokens": 4595440.0, | |
| "step": 480 | |
| }, | |
| { | |
| "entropy": 2.0941593036055566, | |
| "epoch": 0.5726807888970051, | |
| "grad_norm": 5.741567611694336, | |
| "learning_rate": 1.9631123469280128e-05, | |
| "loss": 1.4642065048217774, | |
| "mean_token_accuracy": 0.677471567876637, | |
| "num_tokens": 4663837.0, | |
| "step": 490 | |
| }, | |
| { | |
| "entropy": 2.0082775235176085, | |
| "epoch": 0.5843681519357194, | |
| "grad_norm": 2.512613534927368, | |
| "learning_rate": 1.9610481624656735e-05, | |
| "loss": 1.3735533714294434, | |
| "mean_token_accuracy": 0.7022612497210503, | |
| "num_tokens": 4763735.0, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.5843681519357194, | |
| "eval_entropy": 2.0894607109948993, | |
| "eval_loss": 0.8765641450881958, | |
| "eval_mean_token_accuracy": 0.7788096551084891, | |
| "eval_num_tokens": 4763735.0, | |
| "eval_runtime": 25.7469, | |
| "eval_samples_per_second": 19.886, | |
| "eval_steps_per_second": 9.943, | |
| "step": 500 | |
| }, | |
| { | |
| "entropy": 2.1692290902137756, | |
| "epoch": 0.5960555149744339, | |
| "grad_norm": 6.56488561630249, | |
| "learning_rate": 1.9589289305339855e-05, | |
| "loss": 1.4895523071289063, | |
| "mean_token_accuracy": 0.6608639808371664, | |
| "num_tokens": 4844090.0, | |
| "step": 510 | |
| }, | |
| { | |
| "entropy": 2.1281642124056814, | |
| "epoch": 0.6077428780131483, | |
| "grad_norm": 3.018589496612549, | |
| "learning_rate": 1.9567547725195332e-05, | |
| "loss": 1.4966270446777343, | |
| "mean_token_accuracy": 0.6484380099922419, | |
| "num_tokens": 4920491.0, | |
| "step": 520 | |
| }, | |
| { | |
| "entropy": 2.1243520259857176, | |
| "epoch": 0.6194302410518627, | |
| "grad_norm": 2.680955171585083, | |
| "learning_rate": 1.9545258129549907e-05, | |
| "loss": 1.2731698036193848, | |
| "mean_token_accuracy": 0.7167170716449618, | |
| "num_tokens": 5009099.0, | |
| "step": 530 | |
| }, | |
| { | |
| "entropy": 2.12062511742115, | |
| "epoch": 0.631117604090577, | |
| "grad_norm": 3.617501735687256, | |
| "learning_rate": 1.9522421795119855e-05, | |
| "loss": 1.3531126022338866, | |
| "mean_token_accuracy": 0.6790495140478015, | |
| "num_tokens": 5100209.0, | |
| "step": 540 | |
| }, | |
| { | |
| "entropy": 2.0695104882121087, | |
| "epoch": 0.6428049671292915, | |
| "grad_norm": 5.214684963226318, | |
| "learning_rate": 1.949904002993787e-05, | |
| "loss": 1.3848544120788575, | |
| "mean_token_accuracy": 0.7135015401989222, | |
| "num_tokens": 5231468.0, | |
| "step": 550 | |
| }, | |
| { | |
| "entropy": 2.0666969910264017, | |
| "epoch": 0.6544923301680059, | |
| "grad_norm": 4.319680213928223, | |
| "learning_rate": 1.9475114173278148e-05, | |
| "loss": 1.3690484046936036, | |
| "mean_token_accuracy": 0.7302774161100387, | |
| "num_tokens": 5300693.0, | |
| "step": 560 | |
| }, | |
| { | |
| "entropy": 2.1146800026297567, | |
| "epoch": 0.6661796932067202, | |
| "grad_norm": 3.780644416809082, | |
| "learning_rate": 1.9450645595579666e-05, | |
| "loss": 1.179710865020752, | |
| "mean_token_accuracy": 0.7273235905915498, | |
| "num_tokens": 5401557.0, | |
| "step": 570 | |
| }, | |
| { | |
| "entropy": 2.043177145719528, | |
| "epoch": 0.6778670562454346, | |
| "grad_norm": 6.6399455070495605, | |
| "learning_rate": 1.942563569836769e-05, | |
| "loss": 1.2141715049743653, | |
| "mean_token_accuracy": 0.7330090440809727, | |
| "num_tokens": 5496384.0, | |
| "step": 580 | |
| }, | |
| { | |
| "entropy": 2.010530972480774, | |
| "epoch": 0.6895544192841491, | |
| "grad_norm": 3.6415085792541504, | |
| "learning_rate": 1.940008591417349e-05, | |
| "loss": 1.2549325942993164, | |
| "mean_token_accuracy": 0.70234549716115, | |
| "num_tokens": 5561552.0, | |
| "step": 590 | |
| }, | |
| { | |
| "entropy": 1.9972407937049865, | |
| "epoch": 0.7012417823228634, | |
| "grad_norm": 5.336333751678467, | |
| "learning_rate": 1.9373997706452305e-05, | |
| "loss": 1.350644016265869, | |
| "mean_token_accuracy": 0.6650068024173379, | |
| "num_tokens": 5658665.0, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.7012417823228634, | |
| "eval_entropy": 2.0355248344130814, | |
| "eval_loss": 0.8769533634185791, | |
| "eval_mean_token_accuracy": 0.7799202160676941, | |
| "eval_num_tokens": 5658665.0, | |
| "eval_runtime": 25.7308, | |
| "eval_samples_per_second": 19.898, | |
| "eval_steps_per_second": 9.949, | |
| "step": 600 | |
| }, | |
| { | |
| "entropy": 2.0349276438355446, | |
| "epoch": 0.7129291453615778, | |
| "grad_norm": 1.1815351247787476, | |
| "learning_rate": 1.93473725694995e-05, | |
| "loss": 1.2075778007507325, | |
| "mean_token_accuracy": 0.6925472240895033, | |
| "num_tokens": 5788127.0, | |
| "step": 610 | |
| }, | |
| { | |
| "entropy": 2.1003061309456825, | |
| "epoch": 0.7246165084002922, | |
| "grad_norm": 3.3525731563568115, | |
| "learning_rate": 1.9320212028364976e-05, | |
| "loss": 1.3541041374206544, | |
| "mean_token_accuracy": 0.6942416787147522, | |
| "num_tokens": 5869374.0, | |
| "step": 620 | |
| }, | |
| { | |
| "entropy": 1.997447171807289, | |
| "epoch": 0.7363038714390066, | |
| "grad_norm": 4.30350399017334, | |
| "learning_rate": 1.9292517638765837e-05, | |
| "loss": 1.1078848838806152, | |
| "mean_token_accuracy": 0.7255709297955036, | |
| "num_tokens": 5986947.0, | |
| "step": 630 | |
| }, | |
| { | |
| "entropy": 2.0404550701379778, | |
| "epoch": 0.747991234477721, | |
| "grad_norm": 3.701443672180176, | |
| "learning_rate": 1.926429098699725e-05, | |
| "loss": 1.5392901420593261, | |
| "mean_token_accuracy": 0.7062803871929646, | |
| "num_tokens": 6079821.0, | |
| "step": 640 | |
| }, | |
| { | |
| "entropy": 2.0202228128910065, | |
| "epoch": 0.7596785975164354, | |
| "grad_norm": 6.253220558166504, | |
| "learning_rate": 1.9235533689841612e-05, | |
| "loss": 1.5730666160583495, | |
| "mean_token_accuracy": 0.6577034238725901, | |
| "num_tokens": 6159034.0, | |
| "step": 650 | |
| }, | |
| { | |
| "entropy": 2.035487785935402, | |
| "epoch": 0.7713659605551497, | |
| "grad_norm": 4.312775611877441, | |
| "learning_rate": 1.9206247394475926e-05, | |
| "loss": 1.386094570159912, | |
| "mean_token_accuracy": 0.7041108455508948, | |
| "num_tokens": 6245774.0, | |
| "step": 660 | |
| }, | |
| { | |
| "entropy": 2.051509512960911, | |
| "epoch": 0.7830533235938641, | |
| "grad_norm": 1.9078806638717651, | |
| "learning_rate": 1.9176433778377463e-05, | |
| "loss": 1.471836471557617, | |
| "mean_token_accuracy": 0.6896713547408581, | |
| "num_tokens": 6322635.0, | |
| "step": 670 | |
| }, | |
| { | |
| "entropy": 2.0822817206382753, | |
| "epoch": 0.7947406866325786, | |
| "grad_norm": 4.861499786376953, | |
| "learning_rate": 1.9146094549227665e-05, | |
| "loss": 1.4575112342834473, | |
| "mean_token_accuracy": 0.6978994499891996, | |
| "num_tokens": 6408559.0, | |
| "step": 680 | |
| }, | |
| { | |
| "entropy": 2.0686106011271477, | |
| "epoch": 0.8064280496712929, | |
| "grad_norm": 1.1169753074645996, | |
| "learning_rate": 1.9115231444814356e-05, | |
| "loss": 1.2490267753601074, | |
| "mean_token_accuracy": 0.7142957296222449, | |
| "num_tokens": 6498026.0, | |
| "step": 690 | |
| }, | |
| { | |
| "entropy": 1.9760664150118827, | |
| "epoch": 0.8181154127100073, | |
| "grad_norm": 1.8441827297210693, | |
| "learning_rate": 1.9083846232932174e-05, | |
| "loss": 1.4654719352722168, | |
| "mean_token_accuracy": 0.7016753869131207, | |
| "num_tokens": 6570974.0, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 0.8181154127100073, | |
| "eval_entropy": 2.0254281694069505, | |
| "eval_loss": 0.8561184406280518, | |
| "eval_mean_token_accuracy": 0.7865645285928622, | |
| "eval_num_tokens": 6570974.0, | |
| "eval_runtime": 25.7483, | |
| "eval_samples_per_second": 19.885, | |
| "eval_steps_per_second": 9.942, | |
| "step": 700 | |
| }, | |
| { | |
| "entropy": 2.0727786898612974, | |
| "epoch": 0.8298027757487217, | |
| "grad_norm": 1.2925829887390137, | |
| "learning_rate": 1.9051940711281337e-05, | |
| "loss": 1.4354880332946778, | |
| "mean_token_accuracy": 0.6728816997259855, | |
| "num_tokens": 6653552.0, | |
| "step": 710 | |
| }, | |
| { | |
| "entropy": 2.0933717772364617, | |
| "epoch": 0.8414901387874361, | |
| "grad_norm": 2.684811592102051, | |
| "learning_rate": 1.9019516707364665e-05, | |
| "loss": 1.2576842308044434, | |
| "mean_token_accuracy": 0.7233169266954065, | |
| "num_tokens": 6763872.0, | |
| "step": 720 | |
| }, | |
| { | |
| "entropy": 2.0260725244879723, | |
| "epoch": 0.8531775018261505, | |
| "grad_norm": 3.0955469608306885, | |
| "learning_rate": 1.8986576078382897e-05, | |
| "loss": 1.1219220161437988, | |
| "mean_token_accuracy": 0.7308994717895985, | |
| "num_tokens": 6859512.0, | |
| "step": 730 | |
| }, | |
| { | |
| "entropy": 2.0424532502889634, | |
| "epoch": 0.8648648648648649, | |
| "grad_norm": 2.130910873413086, | |
| "learning_rate": 1.8953120711128328e-05, | |
| "loss": 1.3845118522644042, | |
| "mean_token_accuracy": 0.7046346709132194, | |
| "num_tokens": 6955559.0, | |
| "step": 740 | |
| }, | |
| { | |
| "entropy": 2.0079129934310913, | |
| "epoch": 0.8765522279035792, | |
| "grad_norm": 4.160308837890625, | |
| "learning_rate": 1.8919152521876723e-05, | |
| "loss": 1.374086284637451, | |
| "mean_token_accuracy": 0.7193431258201599, | |
| "num_tokens": 7043418.0, | |
| "step": 750 | |
| }, | |
| { | |
| "entropy": 1.9917357206344604, | |
| "epoch": 0.8882395909422937, | |
| "grad_norm": 2.2451999187469482, | |
| "learning_rate": 1.888467345627756e-05, | |
| "loss": 1.494250202178955, | |
| "mean_token_accuracy": 0.7015550900250673, | |
| "num_tokens": 7132570.0, | |
| "step": 760 | |
| }, | |
| { | |
| "entropy": 2.0734104439616203, | |
| "epoch": 0.8999269539810081, | |
| "grad_norm": 3.7219045162200928, | |
| "learning_rate": 1.8849685489242587e-05, | |
| "loss": 1.1162896156311035, | |
| "mean_token_accuracy": 0.7175393454730511, | |
| "num_tokens": 7206183.0, | |
| "step": 770 | |
| }, | |
| { | |
| "entropy": 1.945244801044464, | |
| "epoch": 0.9116143170197224, | |
| "grad_norm": 2.7573325634002686, | |
| "learning_rate": 1.88141906248327e-05, | |
| "loss": 1.2209875106811523, | |
| "mean_token_accuracy": 0.7243857584893704, | |
| "num_tokens": 7299435.0, | |
| "step": 780 | |
| }, | |
| { | |
| "entropy": 1.964235670864582, | |
| "epoch": 0.9233016800584368, | |
| "grad_norm": 3.2477715015411377, | |
| "learning_rate": 1.877819089614316e-05, | |
| "loss": 1.509469699859619, | |
| "mean_token_accuracy": 0.7052617512643338, | |
| "num_tokens": 7402956.0, | |
| "step": 790 | |
| }, | |
| { | |
| "entropy": 1.9679414376616478, | |
| "epoch": 0.9349890430971513, | |
| "grad_norm": 37.075477600097656, | |
| "learning_rate": 1.8741688365187126e-05, | |
| "loss": 1.4231921195983888, | |
| "mean_token_accuracy": 0.6835801653563977, | |
| "num_tokens": 7502241.0, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.9349890430971513, | |
| "eval_entropy": 1.9983236375264823, | |
| "eval_loss": 0.867080807685852, | |
| "eval_mean_token_accuracy": 0.7754522023024037, | |
| "eval_num_tokens": 7502241.0, | |
| "eval_runtime": 25.7531, | |
| "eval_samples_per_second": 19.881, | |
| "eval_steps_per_second": 9.941, | |
| "step": 800 | |
| }, | |
| { | |
| "entropy": 1.985922822356224, | |
| "epoch": 0.9466764061358656, | |
| "grad_norm": 3.3656697273254395, | |
| "learning_rate": 1.8704685122777564e-05, | |
| "loss": 1.2210535049438476, | |
| "mean_token_accuracy": 0.7048435021191836, | |
| "num_tokens": 7623320.0, | |
| "step": 810 | |
| }, | |
| { | |
| "entropy": 2.0612731352448463, | |
| "epoch": 0.95836376917458, | |
| "grad_norm": 1.0531134605407715, | |
| "learning_rate": 1.8667183288407468e-05, | |
| "loss": 1.1971052169799805, | |
| "mean_token_accuracy": 0.7166136829182506, | |
| "num_tokens": 7720440.0, | |
| "step": 820 | |
| }, | |
| { | |
| "entropy": 2.0148551099002363, | |
| "epoch": 0.9700511322132944, | |
| "grad_norm": 4.024211883544922, | |
| "learning_rate": 1.8629185010128478e-05, | |
| "loss": 1.3127185821533203, | |
| "mean_token_accuracy": 0.6342430572956801, | |
| "num_tokens": 7816747.0, | |
| "step": 830 | |
| }, | |
| { | |
| "entropy": 2.0382406994700433, | |
| "epoch": 0.9817384952520087, | |
| "grad_norm": 5.8077616691589355, | |
| "learning_rate": 1.8590692464427826e-05, | |
| "loss": 1.229036808013916, | |
| "mean_token_accuracy": 0.692909746337682, | |
| "num_tokens": 7911749.0, | |
| "step": 840 | |
| }, | |
| { | |
| "entropy": 2.017058402299881, | |
| "epoch": 0.9934258582907232, | |
| "grad_norm": 3.8182997703552246, | |
| "learning_rate": 1.8551707856103687e-05, | |
| "loss": 1.408517551422119, | |
| "mean_token_accuracy": 0.6882151458412409, | |
| "num_tokens": 8010735.0, | |
| "step": 850 | |
| }, | |
| { | |
| "entropy": 2.0180568664104905, | |
| "epoch": 1.0046749452154857, | |
| "grad_norm": 1.599541425704956, | |
| "learning_rate": 1.8512233418138874e-05, | |
| "loss": 1.306098175048828, | |
| "mean_token_accuracy": 0.6780746261794846, | |
| "num_tokens": 8118038.0, | |
| "step": 860 | |
| }, | |
| { | |
| "entropy": 2.0067124992609022, | |
| "epoch": 1.0163623082542002, | |
| "grad_norm": 5.67886209487915, | |
| "learning_rate": 1.8472271411572947e-05, | |
| "loss": 1.1671574592590332, | |
| "mean_token_accuracy": 0.713248742185533, | |
| "num_tokens": 8200543.0, | |
| "step": 870 | |
| }, | |
| { | |
| "entropy": 2.0012906357645988, | |
| "epoch": 1.0280496712929146, | |
| "grad_norm": 3.1922106742858887, | |
| "learning_rate": 1.84318241253727e-05, | |
| "loss": 1.4505293846130372, | |
| "mean_token_accuracy": 0.6957443349063397, | |
| "num_tokens": 8319764.0, | |
| "step": 880 | |
| }, | |
| { | |
| "entropy": 2.088476361334324, | |
| "epoch": 1.039737034331629, | |
| "grad_norm": 3.2191641330718994, | |
| "learning_rate": 1.839089387630105e-05, | |
| "loss": 1.237698459625244, | |
| "mean_token_accuracy": 0.7405852057039738, | |
| "num_tokens": 8418280.0, | |
| "step": 890 | |
| }, | |
| { | |
| "entropy": 1.9533416509628296, | |
| "epoch": 1.0514243973703432, | |
| "grad_norm": 4.920682430267334, | |
| "learning_rate": 1.8349483008784346e-05, | |
| "loss": 1.1894009590148926, | |
| "mean_token_accuracy": 0.7420405600219965, | |
| "num_tokens": 8537568.0, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 1.0514243973703432, | |
| "eval_entropy": 1.9681994300335646, | |
| "eval_loss": 0.8586333394050598, | |
| "eval_mean_token_accuracy": 0.7810589795699343, | |
| "eval_num_tokens": 8537568.0, | |
| "eval_runtime": 25.8055, | |
| "eval_samples_per_second": 19.841, | |
| "eval_steps_per_second": 9.92, | |
| "step": 900 | |
| }, | |
| { | |
| "entropy": 2.0434288874268534, | |
| "epoch": 1.0631117604090576, | |
| "grad_norm": 1.5615532398223877, | |
| "learning_rate": 1.830759389477807e-05, | |
| "loss": 1.116469383239746, | |
| "mean_token_accuracy": 0.7405070804059506, | |
| "num_tokens": 8648085.0, | |
| "step": 910 | |
| }, | |
| { | |
| "entropy": 2.041461481153965, | |
| "epoch": 1.074799123447772, | |
| "grad_norm": 5.930424213409424, | |
| "learning_rate": 1.8265228933630993e-05, | |
| "loss": 1.157538604736328, | |
| "mean_token_accuracy": 0.7226788546890021, | |
| "num_tokens": 8725616.0, | |
| "step": 920 | |
| }, | |
| { | |
| "entropy": 1.9450246095657349, | |
| "epoch": 1.0864864864864865, | |
| "grad_norm": 4.664083003997803, | |
| "learning_rate": 1.822239055194772e-05, | |
| "loss": 0.8936849594116211, | |
| "mean_token_accuracy": 0.7802880503237247, | |
| "num_tokens": 8832986.0, | |
| "step": 930 | |
| }, | |
| { | |
| "entropy": 1.937520469725132, | |
| "epoch": 1.098173849525201, | |
| "grad_norm": 8.443425178527832, | |
| "learning_rate": 1.8179081203449702e-05, | |
| "loss": 1.3640972137451173, | |
| "mean_token_accuracy": 0.6927296353504062, | |
| "num_tokens": 8899400.0, | |
| "step": 940 | |
| }, | |
| { | |
| "entropy": 2.0156847476959228, | |
| "epoch": 1.1098612125639153, | |
| "grad_norm": 1.6205108165740967, | |
| "learning_rate": 1.8135303368834724e-05, | |
| "loss": 1.4349061965942382, | |
| "mean_token_accuracy": 0.7307943589985371, | |
| "num_tokens": 8983629.0, | |
| "step": 950 | |
| }, | |
| { | |
| "entropy": 2.0066610902547835, | |
| "epoch": 1.1215485756026298, | |
| "grad_norm": 2.5834603309631348, | |
| "learning_rate": 1.8091059555634767e-05, | |
| "loss": 1.1831789016723633, | |
| "mean_token_accuracy": 0.7173672618344427, | |
| "num_tokens": 9075646.0, | |
| "step": 960 | |
| }, | |
| { | |
| "entropy": 1.9574484556913376, | |
| "epoch": 1.133235938641344, | |
| "grad_norm": 3.529022455215454, | |
| "learning_rate": 1.8046352298072408e-05, | |
| "loss": 1.2099827766418456, | |
| "mean_token_accuracy": 0.6975785996764898, | |
| "num_tokens": 9172845.0, | |
| "step": 970 | |
| }, | |
| { | |
| "entropy": 1.9960552796721458, | |
| "epoch": 1.1449233016800584, | |
| "grad_norm": 5.0720624923706055, | |
| "learning_rate": 1.800118415691566e-05, | |
| "loss": 1.5012150764465333, | |
| "mean_token_accuracy": 0.6908264242112636, | |
| "num_tokens": 9247772.0, | |
| "step": 980 | |
| }, | |
| { | |
| "entropy": 2.0457948252558706, | |
| "epoch": 1.1566106647187728, | |
| "grad_norm": 5.155003070831299, | |
| "learning_rate": 1.7955557719331286e-05, | |
| "loss": 1.232002353668213, | |
| "mean_token_accuracy": 0.7276268910616637, | |
| "num_tokens": 9335161.0, | |
| "step": 990 | |
| }, | |
| { | |
| "entropy": 1.926890704035759, | |
| "epoch": 1.1682980277574873, | |
| "grad_norm": 1.4542499780654907, | |
| "learning_rate": 1.790947559873662e-05, | |
| "loss": 1.5774466514587402, | |
| "mean_token_accuracy": 0.7076287779957056, | |
| "num_tokens": 9439634.0, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 1.1682980277574873, | |
| "eval_entropy": 1.9619915070943534, | |
| "eval_loss": 0.8459069728851318, | |
| "eval_mean_token_accuracy": 0.7854349086992443, | |
| "eval_num_tokens": 9439634.0, | |
| "eval_runtime": 25.7338, | |
| "eval_samples_per_second": 19.896, | |
| "eval_steps_per_second": 9.948, | |
| "step": 1000 | |
| }, | |
| { | |
| "entropy": 2.044060703366995, | |
| "epoch": 1.1799853907962017, | |
| "grad_norm": 6.555078506469727, | |
| "learning_rate": 1.7862940434649862e-05, | |
| "loss": 1.111758041381836, | |
| "mean_token_accuracy": 0.7634515274316073, | |
| "num_tokens": 9536599.0, | |
| "step": 1010 | |
| }, | |
| { | |
| "entropy": 2.0073146775364874, | |
| "epoch": 1.1916727538349159, | |
| "grad_norm": 5.614148139953613, | |
| "learning_rate": 1.7815954892538906e-05, | |
| "loss": 1.1583277702331543, | |
| "mean_token_accuracy": 0.7569285105913878, | |
| "num_tokens": 9624039.0, | |
| "step": 1020 | |
| }, | |
| { | |
| "entropy": 1.9390188187360764, | |
| "epoch": 1.2033601168736303, | |
| "grad_norm": 3.570732831954956, | |
| "learning_rate": 1.776852166366866e-05, | |
| "loss": 1.2342907905578613, | |
| "mean_token_accuracy": 0.7328513782471419, | |
| "num_tokens": 9731570.0, | |
| "step": 1030 | |
| }, | |
| { | |
| "entropy": 2.007731480896473, | |
| "epoch": 1.2150474799123447, | |
| "grad_norm": 4.624857425689697, | |
| "learning_rate": 1.772064346494688e-05, | |
| "loss": 1.1125083923339845, | |
| "mean_token_accuracy": 0.7398822195827961, | |
| "num_tokens": 9829159.0, | |
| "step": 1040 | |
| }, | |
| { | |
| "entropy": 1.95512465685606, | |
| "epoch": 1.2267348429510592, | |
| "grad_norm": 5.471255779266357, | |
| "learning_rate": 1.7672323038768566e-05, | |
| "loss": 1.1773574829101563, | |
| "mean_token_accuracy": 0.7350184928625823, | |
| "num_tokens": 9925525.0, | |
| "step": 1050 | |
| }, | |
| { | |
| "entropy": 1.9593760170042516, | |
| "epoch": 1.2384222059897736, | |
| "grad_norm": 3.174351930618286, | |
| "learning_rate": 1.7623563152858883e-05, | |
| "loss": 1.1755749702453613, | |
| "mean_token_accuracy": 0.7368000335991383, | |
| "num_tokens": 10010547.0, | |
| "step": 1060 | |
| }, | |
| { | |
| "entropy": 2.0089882522821427, | |
| "epoch": 1.250109569028488, | |
| "grad_norm": 3.5962374210357666, | |
| "learning_rate": 1.7574366600114613e-05, | |
| "loss": 1.5100272178649903, | |
| "mean_token_accuracy": 0.7163063116371632, | |
| "num_tokens": 10101289.0, | |
| "step": 1070 | |
| }, | |
| { | |
| "entropy": 2.0140527084469797, | |
| "epoch": 1.2617969320672024, | |
| "grad_norm": 4.1162309646606445, | |
| "learning_rate": 1.7524736198444197e-05, | |
| "loss": 1.170853614807129, | |
| "mean_token_accuracy": 0.7263667859137058, | |
| "num_tokens": 10233321.0, | |
| "step": 1080 | |
| }, | |
| { | |
| "entropy": 1.9484913617372512, | |
| "epoch": 1.2734842951059167, | |
| "grad_norm": 6.536661624908447, | |
| "learning_rate": 1.747467479060633e-05, | |
| "loss": 1.1337247848510743, | |
| "mean_token_accuracy": 0.7735978152602911, | |
| "num_tokens": 10303009.0, | |
| "step": 1090 | |
| }, | |
| { | |
| "entropy": 2.0198730982840063, | |
| "epoch": 1.285171658144631, | |
| "grad_norm": 3.4061622619628906, | |
| "learning_rate": 1.7424185244047116e-05, | |
| "loss": 1.0629566192626954, | |
| "mean_token_accuracy": 0.7369117736816406, | |
| "num_tokens": 10438680.0, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 1.285171658144631, | |
| "eval_entropy": 1.9863552912138402, | |
| "eval_loss": 0.8380774855613708, | |
| "eval_mean_token_accuracy": 0.7885139010613784, | |
| "eval_num_tokens": 10438680.0, | |
| "eval_runtime": 25.7827, | |
| "eval_samples_per_second": 19.858, | |
| "eval_steps_per_second": 9.929, | |
| "step": 1100 | |
| }, | |
| { | |
| "entropy": 1.9853825107216836, | |
| "epoch": 1.2968590211833455, | |
| "grad_norm": 1.8975157737731934, | |
| "learning_rate": 1.737327045073584e-05, | |
| "loss": 1.2073594093322755, | |
| "mean_token_accuracy": 0.7203539207577705, | |
| "num_tokens": 10535626.0, | |
| "step": 1110 | |
| }, | |
| { | |
| "entropy": 1.9051698848605156, | |
| "epoch": 1.30854638422206, | |
| "grad_norm": 4.080144882202148, | |
| "learning_rate": 1.7321933326999313e-05, | |
| "loss": 1.0707772254943848, | |
| "mean_token_accuracy": 0.7556315153837204, | |
| "num_tokens": 10653815.0, | |
| "step": 1120 | |
| }, | |
| { | |
| "entropy": 2.0398276120424272, | |
| "epoch": 1.3202337472607744, | |
| "grad_norm": 4.169946670532227, | |
| "learning_rate": 1.7270176813354836e-05, | |
| "loss": 1.1661772727966309, | |
| "mean_token_accuracy": 0.7467184342443943, | |
| "num_tokens": 10716426.0, | |
| "step": 1130 | |
| }, | |
| { | |
| "entropy": 1.9850704297423363, | |
| "epoch": 1.3319211102994886, | |
| "grad_norm": 4.181504726409912, | |
| "learning_rate": 1.7218003874341762e-05, | |
| "loss": 0.9917153358459473, | |
| "mean_token_accuracy": 0.7495910193771124, | |
| "num_tokens": 10814456.0, | |
| "step": 1140 | |
| }, | |
| { | |
| "entropy": 1.9728952266275883, | |
| "epoch": 1.343608473338203, | |
| "grad_norm": 1.9582622051239014, | |
| "learning_rate": 1.7165417498351695e-05, | |
| "loss": 1.1698190689086914, | |
| "mean_token_accuracy": 0.7205928053706885, | |
| "num_tokens": 10930887.0, | |
| "step": 1150 | |
| }, | |
| { | |
| "entropy": 1.9699254363775254, | |
| "epoch": 1.3552958363769174, | |
| "grad_norm": 2.080578327178955, | |
| "learning_rate": 1.711242069745732e-05, | |
| "loss": 1.0921939849853515, | |
| "mean_token_accuracy": 0.7728059090673923, | |
| "num_tokens": 11008746.0, | |
| "step": 1160 | |
| }, | |
| { | |
| "entropy": 1.9688927009701729, | |
| "epoch": 1.3669831994156318, | |
| "grad_norm": 9.23663330078125, | |
| "learning_rate": 1.705901650723988e-05, | |
| "loss": 1.3214816093444823, | |
| "mean_token_accuracy": 0.7266499204561114, | |
| "num_tokens": 11081881.0, | |
| "step": 1170 | |
| }, | |
| { | |
| "entropy": 1.9373602516949178, | |
| "epoch": 1.3786705624543463, | |
| "grad_norm": 3.493316173553467, | |
| "learning_rate": 1.7005207986615293e-05, | |
| "loss": 1.2887114524841308, | |
| "mean_token_accuracy": 0.7301527475938201, | |
| "num_tokens": 11170839.0, | |
| "step": 1180 | |
| }, | |
| { | |
| "entropy": 1.937132966518402, | |
| "epoch": 1.3903579254930607, | |
| "grad_norm": 3.835472583770752, | |
| "learning_rate": 1.6950998217658948e-05, | |
| "loss": 1.1458003997802735, | |
| "mean_token_accuracy": 0.7413250353187323, | |
| "num_tokens": 11265564.0, | |
| "step": 1190 | |
| }, | |
| { | |
| "entropy": 1.9563957542181014, | |
| "epoch": 1.4020452885317751, | |
| "grad_norm": 2.9280080795288086, | |
| "learning_rate": 1.6896390305429173e-05, | |
| "loss": 1.0155451774597168, | |
| "mean_token_accuracy": 0.7335030514746904, | |
| "num_tokens": 11345666.0, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 1.4020452885317751, | |
| "eval_entropy": 1.9168102419935167, | |
| "eval_loss": 0.8464275598526001, | |
| "eval_mean_token_accuracy": 0.7816579656209797, | |
| "eval_num_tokens": 11345666.0, | |
| "eval_runtime": 25.7925, | |
| "eval_samples_per_second": 19.851, | |
| "eval_steps_per_second": 9.925, | |
| "step": 1200 | |
| }, | |
| { | |
| "entropy": 1.9489586815237998, | |
| "epoch": 1.4137326515704893, | |
| "grad_norm": 4.470329284667969, | |
| "learning_rate": 1.6841387377789365e-05, | |
| "loss": 1.0874253273010255, | |
| "mean_token_accuracy": 0.7266624689102172, | |
| "num_tokens": 11441947.0, | |
| "step": 1210 | |
| }, | |
| { | |
| "entropy": 1.9251106187701226, | |
| "epoch": 1.4254200146092038, | |
| "grad_norm": 8.1526460647583, | |
| "learning_rate": 1.6785992585228842e-05, | |
| "loss": 1.1446887969970703, | |
| "mean_token_accuracy": 0.7407740101218223, | |
| "num_tokens": 11512448.0, | |
| "step": 1220 | |
| }, | |
| { | |
| "entropy": 1.8829301849007607, | |
| "epoch": 1.4371073776479182, | |
| "grad_norm": 3.5247323513031006, | |
| "learning_rate": 1.6730209100682398e-05, | |
| "loss": 1.1706348419189454, | |
| "mean_token_accuracy": 0.7307471681386233, | |
| "num_tokens": 11599060.0, | |
| "step": 1230 | |
| }, | |
| { | |
| "entropy": 1.8378908082842826, | |
| "epoch": 1.4487947406866326, | |
| "grad_norm": 5.84583854675293, | |
| "learning_rate": 1.6674040119348534e-05, | |
| "loss": 1.3138227462768555, | |
| "mean_token_accuracy": 0.7309050619602203, | |
| "num_tokens": 11696606.0, | |
| "step": 1240 | |
| }, | |
| { | |
| "entropy": 1.9146908812224865, | |
| "epoch": 1.460482103725347, | |
| "grad_norm": 3.2844982147216797, | |
| "learning_rate": 1.6617488858506478e-05, | |
| "loss": 1.1646804809570312, | |
| "mean_token_accuracy": 0.7578974604606629, | |
| "num_tokens": 11794942.0, | |
| "step": 1250 | |
| }, | |
| { | |
| "entropy": 1.9918838322162629, | |
| "epoch": 1.4721694667640612, | |
| "grad_norm": 4.6135406494140625, | |
| "learning_rate": 1.6560558557331857e-05, | |
| "loss": 1.2325959205627441, | |
| "mean_token_accuracy": 0.7542553246021271, | |
| "num_tokens": 11879297.0, | |
| "step": 1260 | |
| }, | |
| { | |
| "entropy": 1.9307655103504657, | |
| "epoch": 1.4838568298027757, | |
| "grad_norm": 3.894841194152832, | |
| "learning_rate": 1.6503252476711207e-05, | |
| "loss": 1.2438136100769044, | |
| "mean_token_accuracy": 0.7178509555757046, | |
| "num_tokens": 11956740.0, | |
| "step": 1270 | |
| }, | |
| { | |
| "entropy": 1.908846166729927, | |
| "epoch": 1.49554419284149, | |
| "grad_norm": 5.166774749755859, | |
| "learning_rate": 1.6445573899055173e-05, | |
| "loss": 1.2256482124328614, | |
| "mean_token_accuracy": 0.6992226783186197, | |
| "num_tokens": 12046253.0, | |
| "step": 1280 | |
| }, | |
| { | |
| "entropy": 1.8920038990676402, | |
| "epoch": 1.5072315558802045, | |
| "grad_norm": 6.3578901290893555, | |
| "learning_rate": 1.6387526128110497e-05, | |
| "loss": 1.1908625602722167, | |
| "mean_token_accuracy": 0.7180704873055219, | |
| "num_tokens": 12138688.0, | |
| "step": 1290 | |
| }, | |
| { | |
| "entropy": 1.8648209869861603, | |
| "epoch": 1.518918918918919, | |
| "grad_norm": 4.01393461227417, | |
| "learning_rate": 1.6329112488770783e-05, | |
| "loss": 0.9572369575500488, | |
| "mean_token_accuracy": 0.7382893675938249, | |
| "num_tokens": 12236933.0, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 1.518918918918919, | |
| "eval_entropy": 1.838359854184091, | |
| "eval_loss": 0.8447912931442261, | |
| "eval_mean_token_accuracy": 0.7861243971856311, | |
| "eval_num_tokens": 12236933.0, | |
| "eval_runtime": 25.7812, | |
| "eval_samples_per_second": 19.859, | |
| "eval_steps_per_second": 9.93, | |
| "step": 1300 | |
| }, | |
| { | |
| "entropy": 1.8808407828211784, | |
| "epoch": 1.5306062819576334, | |
| "grad_norm": 5.479897975921631, | |
| "learning_rate": 1.627033632688606e-05, | |
| "loss": 1.1945793151855468, | |
| "mean_token_accuracy": 0.7323504503816366, | |
| "num_tokens": 12323027.0, | |
| "step": 1310 | |
| }, | |
| { | |
| "entropy": 1.8892016053199767, | |
| "epoch": 1.5422936449963478, | |
| "grad_norm": 4.85045862197876, | |
| "learning_rate": 1.6211201009071134e-05, | |
| "loss": 1.0658716201782226, | |
| "mean_token_accuracy": 0.73037389498204, | |
| "num_tokens": 12412760.0, | |
| "step": 1320 | |
| }, | |
| { | |
| "entropy": 1.9150678791105746, | |
| "epoch": 1.5539810080350622, | |
| "grad_norm": 3.739926338195801, | |
| "learning_rate": 1.615170992251275e-05, | |
| "loss": 1.2553756713867188, | |
| "mean_token_accuracy": 0.7565023884177208, | |
| "num_tokens": 12499002.0, | |
| "step": 1330 | |
| }, | |
| { | |
| "entropy": 1.827857257425785, | |
| "epoch": 1.5656683710737764, | |
| "grad_norm": 1.824333667755127, | |
| "learning_rate": 1.6091866474775565e-05, | |
| "loss": 1.216816520690918, | |
| "mean_token_accuracy": 0.7362237356603145, | |
| "num_tokens": 12620786.0, | |
| "step": 1340 | |
| }, | |
| { | |
| "entropy": 1.9286083355545998, | |
| "epoch": 1.5773557341124909, | |
| "grad_norm": 4.209549903869629, | |
| "learning_rate": 1.6031674093607003e-05, | |
| "loss": 1.5620033264160156, | |
| "mean_token_accuracy": 0.7155494146049023, | |
| "num_tokens": 12694076.0, | |
| "step": 1350 | |
| }, | |
| { | |
| "entropy": 1.9999349035322667, | |
| "epoch": 1.5890430971512053, | |
| "grad_norm": 3.89644193649292, | |
| "learning_rate": 1.597113622674089e-05, | |
| "loss": 1.466843032836914, | |
| "mean_token_accuracy": 0.7301654836162925, | |
| "num_tokens": 12797729.0, | |
| "step": 1360 | |
| }, | |
| { | |
| "entropy": 1.928144982457161, | |
| "epoch": 1.6007304601899195, | |
| "grad_norm": 2.602468967437744, | |
| "learning_rate": 1.5910256341699978e-05, | |
| "loss": 0.9804810523986817, | |
| "mean_token_accuracy": 0.7682306554168463, | |
| "num_tokens": 12877532.0, | |
| "step": 1370 | |
| }, | |
| { | |
| "entropy": 1.9351914629340172, | |
| "epoch": 1.612417823228634, | |
| "grad_norm": 4.436489105224609, | |
| "learning_rate": 1.584903792559733e-05, | |
| "loss": 1.1732940673828125, | |
| "mean_token_accuracy": 0.7697132367640733, | |
| "num_tokens": 12954415.0, | |
| "step": 1380 | |
| }, | |
| { | |
| "entropy": 1.8640065513551236, | |
| "epoch": 1.6241051862673483, | |
| "grad_norm": 6.866170883178711, | |
| "learning_rate": 1.57874844849366e-05, | |
| "loss": 1.1950453758239745, | |
| "mean_token_accuracy": 0.7020724691450596, | |
| "num_tokens": 13092979.0, | |
| "step": 1390 | |
| }, | |
| { | |
| "entropy": 1.8486135482788086, | |
| "epoch": 1.6357925493060628, | |
| "grad_norm": 4.1101393699646, | |
| "learning_rate": 1.5725599545411157e-05, | |
| "loss": 1.1412214279174804, | |
| "mean_token_accuracy": 0.727515947446227, | |
| "num_tokens": 13217902.0, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 1.6357925493060628, | |
| "eval_entropy": 1.8418370359577239, | |
| "eval_loss": 0.845252513885498, | |
| "eval_mean_token_accuracy": 0.7928508168552071, | |
| "eval_num_tokens": 13217902.0, | |
| "eval_runtime": 25.7728, | |
| "eval_samples_per_second": 19.866, | |
| "eval_steps_per_second": 9.933, | |
| "step": 1400 | |
| }, | |
| { | |
| "entropy": 1.8421028837561608, | |
| "epoch": 1.6474799123447772, | |
| "grad_norm": 7.405350685119629, | |
| "learning_rate": 1.5663386651702154e-05, | |
| "loss": 1.2713269233703612, | |
| "mean_token_accuracy": 0.7393627911806107, | |
| "num_tokens": 13294277.0, | |
| "step": 1410 | |
| }, | |
| { | |
| "entropy": 1.9373707726597786, | |
| "epoch": 1.6591672753834916, | |
| "grad_norm": 7.983404159545898, | |
| "learning_rate": 1.5600849367275497e-05, | |
| "loss": 1.2371453285217284, | |
| "mean_token_accuracy": 0.7312075588852167, | |
| "num_tokens": 13384052.0, | |
| "step": 1420 | |
| }, | |
| { | |
| "entropy": 1.8757845029234885, | |
| "epoch": 1.670854638422206, | |
| "grad_norm": 3.276104688644409, | |
| "learning_rate": 1.553799127417773e-05, | |
| "loss": 0.8122424125671387, | |
| "mean_token_accuracy": 0.7491487618535757, | |
| "num_tokens": 13482557.0, | |
| "step": 1430 | |
| }, | |
| { | |
| "entropy": 1.8658230647444725, | |
| "epoch": 1.6825420014609205, | |
| "grad_norm": 3.2975077629089355, | |
| "learning_rate": 1.5474815972830863e-05, | |
| "loss": 1.08724946975708, | |
| "mean_token_accuracy": 0.7675337288528681, | |
| "num_tokens": 13588999.0, | |
| "step": 1440 | |
| }, | |
| { | |
| "entropy": 1.8781310148537158, | |
| "epoch": 1.694229364499635, | |
| "grad_norm": 4.919190883636475, | |
| "learning_rate": 1.5411327081826127e-05, | |
| "loss": 1.0564030647277831, | |
| "mean_token_accuracy": 0.7417909545823932, | |
| "num_tokens": 13672070.0, | |
| "step": 1450 | |
| }, | |
| { | |
| "entropy": 1.8797260642051696, | |
| "epoch": 1.705916727538349, | |
| "grad_norm": 5.827484607696533, | |
| "learning_rate": 1.5347528237716742e-05, | |
| "loss": 1.1392526626586914, | |
| "mean_token_accuracy": 0.7560544963926077, | |
| "num_tokens": 13768344.0, | |
| "step": 1460 | |
| }, | |
| { | |
| "entropy": 1.8342829935252667, | |
| "epoch": 1.7176040905770635, | |
| "grad_norm": 2.148158073425293, | |
| "learning_rate": 1.5283423094809597e-05, | |
| "loss": 1.4184009552001953, | |
| "mean_token_accuracy": 0.6963153561577201, | |
| "num_tokens": 13893709.0, | |
| "step": 1470 | |
| }, | |
| { | |
| "entropy": 1.9475776053965093, | |
| "epoch": 1.729291453615778, | |
| "grad_norm": 5.127400875091553, | |
| "learning_rate": 1.5219015324955924e-05, | |
| "loss": 1.114856243133545, | |
| "mean_token_accuracy": 0.7408701498061419, | |
| "num_tokens": 13993373.0, | |
| "step": 1480 | |
| }, | |
| { | |
| "entropy": 1.8672847002744675, | |
| "epoch": 1.7409788166544922, | |
| "grad_norm": 6.511949062347412, | |
| "learning_rate": 1.5154308617341007e-05, | |
| "loss": 1.3385598182678222, | |
| "mean_token_accuracy": 0.7226239118725062, | |
| "num_tokens": 14101381.0, | |
| "step": 1490 | |
| }, | |
| { | |
| "entropy": 1.8440473534166812, | |
| "epoch": 1.7526661796932066, | |
| "grad_norm": 4.361108303070068, | |
| "learning_rate": 1.5089306678272864e-05, | |
| "loss": 1.3698930740356445, | |
| "mean_token_accuracy": 0.7481454864144326, | |
| "num_tokens": 14191846.0, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 1.7526661796932066, | |
| "eval_entropy": 1.817938992753625, | |
| "eval_loss": 0.8368152379989624, | |
| "eval_mean_token_accuracy": 0.7905413492117077, | |
| "eval_num_tokens": 14191846.0, | |
| "eval_runtime": 25.7676, | |
| "eval_samples_per_second": 19.87, | |
| "eval_steps_per_second": 9.935, | |
| "step": 1500 | |
| }, | |
| { | |
| "entropy": 1.863508278131485, | |
| "epoch": 1.764353542731921, | |
| "grad_norm": 4.527868270874023, | |
| "learning_rate": 1.5024013230969936e-05, | |
| "loss": 1.376086139678955, | |
| "mean_token_accuracy": 0.7072158310562372, | |
| "num_tokens": 14263729.0, | |
| "step": 1510 | |
| }, | |
| { | |
| "entropy": 1.859600581228733, | |
| "epoch": 1.7760409057706354, | |
| "grad_norm": 4.358312606811523, | |
| "learning_rate": 1.4958432015347852e-05, | |
| "loss": 1.2642126083374023, | |
| "mean_token_accuracy": 0.7176427299156785, | |
| "num_tokens": 14339743.0, | |
| "step": 1520 | |
| }, | |
| { | |
| "entropy": 1.9863651104271411, | |
| "epoch": 1.7877282688093499, | |
| "grad_norm": 1.4887659549713135, | |
| "learning_rate": 1.48925667878052e-05, | |
| "loss": 1.329563045501709, | |
| "mean_token_accuracy": 0.6955630304291844, | |
| "num_tokens": 14424090.0, | |
| "step": 1530 | |
| }, | |
| { | |
| "entropy": 1.912637159973383, | |
| "epoch": 1.7994156318480643, | |
| "grad_norm": 6.545175552368164, | |
| "learning_rate": 1.4826421321008355e-05, | |
| "loss": 1.0352179527282714, | |
| "mean_token_accuracy": 0.746459336578846, | |
| "num_tokens": 14553405.0, | |
| "step": 1540 | |
| }, | |
| { | |
| "entropy": 1.8355502478778363, | |
| "epoch": 1.8111029948867787, | |
| "grad_norm": 6.896246433258057, | |
| "learning_rate": 1.475999940367541e-05, | |
| "loss": 1.0201452255249024, | |
| "mean_token_accuracy": 0.749504017457366, | |
| "num_tokens": 14622999.0, | |
| "step": 1550 | |
| }, | |
| { | |
| "entropy": 1.8898384764790535, | |
| "epoch": 1.8227903579254932, | |
| "grad_norm": 1.8590527772903442, | |
| "learning_rate": 1.4693304840359139e-05, | |
| "loss": 1.162650966644287, | |
| "mean_token_accuracy": 0.7342435199767351, | |
| "num_tokens": 14728271.0, | |
| "step": 1560 | |
| }, | |
| { | |
| "entropy": 1.9078960753977299, | |
| "epoch": 1.8344777209642076, | |
| "grad_norm": 1.8502728939056396, | |
| "learning_rate": 1.4626341451229103e-05, | |
| "loss": 1.347366714477539, | |
| "mean_token_accuracy": 0.7131027575582266, | |
| "num_tokens": 14823353.0, | |
| "step": 1570 | |
| }, | |
| { | |
| "entropy": 1.935336910188198, | |
| "epoch": 1.8461650840029218, | |
| "grad_norm": 5.908510208129883, | |
| "learning_rate": 1.455911307185281e-05, | |
| "loss": 1.2870336532592774, | |
| "mean_token_accuracy": 0.7339887302368879, | |
| "num_tokens": 14919875.0, | |
| "step": 1580 | |
| }, | |
| { | |
| "entropy": 1.9448796108365058, | |
| "epoch": 1.8578524470416362, | |
| "grad_norm": 2.0281429290771484, | |
| "learning_rate": 1.4491623552976042e-05, | |
| "loss": 1.3380470275878906, | |
| "mean_token_accuracy": 0.7136711545288563, | |
| "num_tokens": 15037434.0, | |
| "step": 1590 | |
| }, | |
| { | |
| "entropy": 1.9401104234158992, | |
| "epoch": 1.8695398100803506, | |
| "grad_norm": 2.0017759799957275, | |
| "learning_rate": 1.4423876760302266e-05, | |
| "loss": 1.1158767700195313, | |
| "mean_token_accuracy": 0.7537970876321196, | |
| "num_tokens": 15140025.0, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 1.8695398100803506, | |
| "eval_entropy": 1.9083105023019016, | |
| "eval_loss": 0.8140835165977478, | |
| "eval_mean_token_accuracy": 0.7952790177660063, | |
| "eval_num_tokens": 15140025.0, | |
| "eval_runtime": 25.7537, | |
| "eval_samples_per_second": 19.881, | |
| "eval_steps_per_second": 9.94, | |
| "step": 1600 | |
| }, | |
| { | |
| "entropy": 1.9709449693560601, | |
| "epoch": 1.881227173119065, | |
| "grad_norm": 7.711117267608643, | |
| "learning_rate": 1.4355876574271244e-05, | |
| "loss": 1.158623218536377, | |
| "mean_token_accuracy": 0.7596531298011542, | |
| "num_tokens": 15218216.0, | |
| "step": 1610 | |
| }, | |
| { | |
| "entropy": 1.8394018054008483, | |
| "epoch": 1.8929145361577793, | |
| "grad_norm": 2.468035936355591, | |
| "learning_rate": 1.4287626889836732e-05, | |
| "loss": 1.1825003623962402, | |
| "mean_token_accuracy": 0.7871152412146329, | |
| "num_tokens": 15306237.0, | |
| "step": 1620 | |
| }, | |
| { | |
| "entropy": 1.9042728692293167, | |
| "epoch": 1.9046018991964937, | |
| "grad_norm": 4.42598295211792, | |
| "learning_rate": 1.4219131616243407e-05, | |
| "loss": 1.2511362075805663, | |
| "mean_token_accuracy": 0.7355523742735386, | |
| "num_tokens": 15379172.0, | |
| "step": 1630 | |
| }, | |
| { | |
| "entropy": 1.8815034471452237, | |
| "epoch": 1.9162892622352081, | |
| "grad_norm": 5.948218822479248, | |
| "learning_rate": 1.4150394676802943e-05, | |
| "loss": 1.1002138137817383, | |
| "mean_token_accuracy": 0.7342391200363636, | |
| "num_tokens": 15466384.0, | |
| "step": 1640 | |
| }, | |
| { | |
| "entropy": 1.8593804724514484, | |
| "epoch": 1.9279766252739226, | |
| "grad_norm": 4.394277572631836, | |
| "learning_rate": 1.4081420008669286e-05, | |
| "loss": 1.074215030670166, | |
| "mean_token_accuracy": 0.7129569197073579, | |
| "num_tokens": 15567955.0, | |
| "step": 1650 | |
| }, | |
| { | |
| "entropy": 1.8384671002626418, | |
| "epoch": 1.939663988312637, | |
| "grad_norm": 4.205284118652344, | |
| "learning_rate": 1.4012211562613146e-05, | |
| "loss": 1.2773515701293945, | |
| "mean_token_accuracy": 0.7548876103013754, | |
| "num_tokens": 15670309.0, | |
| "step": 1660 | |
| }, | |
| { | |
| "entropy": 1.950037308782339, | |
| "epoch": 1.9513513513513514, | |
| "grad_norm": 4.259429931640625, | |
| "learning_rate": 1.3942773302795697e-05, | |
| "loss": 1.1189401626586915, | |
| "mean_token_accuracy": 0.7264496970921754, | |
| "num_tokens": 15759555.0, | |
| "step": 1670 | |
| }, | |
| { | |
| "entropy": 1.9171560436487198, | |
| "epoch": 1.9630387143900658, | |
| "grad_norm": 2.5676069259643555, | |
| "learning_rate": 1.3873109206541517e-05, | |
| "loss": 1.2681930541992188, | |
| "mean_token_accuracy": 0.727923545613885, | |
| "num_tokens": 15860587.0, | |
| "step": 1680 | |
| }, | |
| { | |
| "entropy": 1.9435059279203415, | |
| "epoch": 1.9747260774287803, | |
| "grad_norm": 4.799222469329834, | |
| "learning_rate": 1.3803223264110778e-05, | |
| "loss": 1.1749539375305176, | |
| "mean_token_accuracy": 0.7340441212058068, | |
| "num_tokens": 15960701.0, | |
| "step": 1690 | |
| }, | |
| { | |
| "entropy": 1.8940155997872352, | |
| "epoch": 1.9864134404674947, | |
| "grad_norm": 8.058248519897461, | |
| "learning_rate": 1.3733119478470685e-05, | |
| "loss": 1.1425342559814453, | |
| "mean_token_accuracy": 0.7671079862862825, | |
| "num_tokens": 16032922.0, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 1.9864134404674947, | |
| "eval_entropy": 1.8137257536873221, | |
| "eval_loss": 0.8239699602127075, | |
| "eval_mean_token_accuracy": 0.7964722405886278, | |
| "eval_num_tokens": 16032922.0, | |
| "eval_runtime": 25.7276, | |
| "eval_samples_per_second": 19.901, | |
| "eval_steps_per_second": 9.95, | |
| "step": 1700 | |
| }, | |
| { | |
| "entropy": 1.8432495191693306, | |
| "epoch": 1.998100803506209, | |
| "grad_norm": 4.412881374359131, | |
| "learning_rate": 1.3662801865066184e-05, | |
| "loss": 1.1190563201904298, | |
| "mean_token_accuracy": 0.7641295533627271, | |
| "num_tokens": 16127646.0, | |
| "step": 1710 | |
| }, | |
| { | |
| "entropy": 1.8858589382914754, | |
| "epoch": 2.0093498904309715, | |
| "grad_norm": 3.5278728008270264, | |
| "learning_rate": 1.3592274451589975e-05, | |
| "loss": 1.116040325164795, | |
| "mean_token_accuracy": 0.7860435471906291, | |
| "num_tokens": 16200737.0, | |
| "step": 1720 | |
| }, | |
| { | |
| "entropy": 1.862286825478077, | |
| "epoch": 2.021037253469686, | |
| "grad_norm": 3.7581899166107178, | |
| "learning_rate": 1.3521541277751808e-05, | |
| "loss": 1.330660915374756, | |
| "mean_token_accuracy": 0.7701560672372579, | |
| "num_tokens": 16288394.0, | |
| "step": 1730 | |
| }, | |
| { | |
| "entropy": 1.7247032955288888, | |
| "epoch": 2.0327246165084003, | |
| "grad_norm": 8.733301162719727, | |
| "learning_rate": 1.3450606395047094e-05, | |
| "loss": 1.012979507446289, | |
| "mean_token_accuracy": 0.7894353784620762, | |
| "num_tokens": 16414668.0, | |
| "step": 1740 | |
| }, | |
| { | |
| "entropy": 1.7075838804244996, | |
| "epoch": 2.0444119795471147, | |
| "grad_norm": 5.654486656188965, | |
| "learning_rate": 1.3379473866524841e-05, | |
| "loss": 0.8867033004760743, | |
| "mean_token_accuracy": 0.7954851593822241, | |
| "num_tokens": 16507494.0, | |
| "step": 1750 | |
| }, | |
| { | |
| "entropy": 1.69541003331542, | |
| "epoch": 2.056099342585829, | |
| "grad_norm": 3.9094533920288086, | |
| "learning_rate": 1.3308147766554921e-05, | |
| "loss": 1.1834484100341798, | |
| "mean_token_accuracy": 0.7346009539440275, | |
| "num_tokens": 16603593.0, | |
| "step": 1760 | |
| }, | |
| { | |
| "entropy": 1.776332788169384, | |
| "epoch": 2.0677867056245436, | |
| "grad_norm": 3.306637763977051, | |
| "learning_rate": 1.3236632180594713e-05, | |
| "loss": 0.9489650726318359, | |
| "mean_token_accuracy": 0.7801664341241121, | |
| "num_tokens": 16687410.0, | |
| "step": 1770 | |
| }, | |
| { | |
| "entropy": 1.7943820096552372, | |
| "epoch": 2.079474068663258, | |
| "grad_norm": 7.184858322143555, | |
| "learning_rate": 1.3164931204955073e-05, | |
| "loss": 1.0698629379272462, | |
| "mean_token_accuracy": 0.7857415523380041, | |
| "num_tokens": 16773739.0, | |
| "step": 1780 | |
| }, | |
| { | |
| "entropy": 1.7151453040540219, | |
| "epoch": 2.0911614317019724, | |
| "grad_norm": 7.096766471862793, | |
| "learning_rate": 1.3093048946565725e-05, | |
| "loss": 1.1096179008483886, | |
| "mean_token_accuracy": 0.7684622058644891, | |
| "num_tokens": 16871746.0, | |
| "step": 1790 | |
| }, | |
| { | |
| "entropy": 1.6890972763299943, | |
| "epoch": 2.1028487947406864, | |
| "grad_norm": 7.44707727432251, | |
| "learning_rate": 1.3020989522740001e-05, | |
| "loss": 1.0414841651916504, | |
| "mean_token_accuracy": 0.767111336812377, | |
| "num_tokens": 16942698.0, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 2.1028487947406864, | |
| "eval_entropy": 1.7094805547967553, | |
| "eval_loss": 0.8579376935958862, | |
| "eval_mean_token_accuracy": 0.7887821523472667, | |
| "eval_num_tokens": 16942698.0, | |
| "eval_runtime": 25.7606, | |
| "eval_samples_per_second": 19.875, | |
| "eval_steps_per_second": 9.938, | |
| "step": 1800 | |
| }, | |
| { | |
| "entropy": 1.7290698282420636, | |
| "epoch": 2.114536157779401, | |
| "grad_norm": 8.56005573272705, | |
| "learning_rate": 1.2948757060939019e-05, | |
| "loss": 0.8826337814331054, | |
| "mean_token_accuracy": 0.7914221476763487, | |
| "num_tokens": 17027656.0, | |
| "step": 1810 | |
| }, | |
| { | |
| "entropy": 1.8097689680755138, | |
| "epoch": 2.1262235208181153, | |
| "grad_norm": 4.438044548034668, | |
| "learning_rate": 1.2876355698535267e-05, | |
| "loss": 0.9441690444946289, | |
| "mean_token_accuracy": 0.7696551516652107, | |
| "num_tokens": 17153253.0, | |
| "step": 1820 | |
| }, | |
| { | |
| "entropy": 1.7344063587486744, | |
| "epoch": 2.1379108838568297, | |
| "grad_norm": 7.4073662757873535, | |
| "learning_rate": 1.2803789582575625e-05, | |
| "loss": 0.8094770431518554, | |
| "mean_token_accuracy": 0.8328897904604673, | |
| "num_tokens": 17238499.0, | |
| "step": 1830 | |
| }, | |
| { | |
| "entropy": 1.8003332495689393, | |
| "epoch": 2.149598246895544, | |
| "grad_norm": 2.58811354637146, | |
| "learning_rate": 1.2731062869543809e-05, | |
| "loss": 0.9070839881896973, | |
| "mean_token_accuracy": 0.7932946987450122, | |
| "num_tokens": 17315238.0, | |
| "step": 1840 | |
| }, | |
| { | |
| "entropy": 1.6319862693548202, | |
| "epoch": 2.1612856099342586, | |
| "grad_norm": 9.18846607208252, | |
| "learning_rate": 1.2658179725122315e-05, | |
| "loss": 0.8181050300598145, | |
| "mean_token_accuracy": 0.7743474829941988, | |
| "num_tokens": 17396825.0, | |
| "step": 1850 | |
| }, | |
| { | |
| "entropy": 1.6712466433644295, | |
| "epoch": 2.172972972972973, | |
| "grad_norm": 5.17325496673584, | |
| "learning_rate": 1.2585144323953806e-05, | |
| "loss": 1.1065648078918457, | |
| "mean_token_accuracy": 0.794865146651864, | |
| "num_tokens": 17477721.0, | |
| "step": 1860 | |
| }, | |
| { | |
| "entropy": 1.705952302366495, | |
| "epoch": 2.1846603360116874, | |
| "grad_norm": 3.063406467437744, | |
| "learning_rate": 1.2511960849401992e-05, | |
| "loss": 0.8904474258422852, | |
| "mean_token_accuracy": 0.8052191570401191, | |
| "num_tokens": 17574912.0, | |
| "step": 1870 | |
| }, | |
| { | |
| "entropy": 1.7243479125201702, | |
| "epoch": 2.196347699050402, | |
| "grad_norm": 4.745734691619873, | |
| "learning_rate": 1.2438633493312016e-05, | |
| "loss": 1.018042755126953, | |
| "mean_token_accuracy": 0.7697376435622573, | |
| "num_tokens": 17675398.0, | |
| "step": 1880 | |
| }, | |
| { | |
| "entropy": 1.7214707762002945, | |
| "epoch": 2.2080350620891163, | |
| "grad_norm": 7.520652770996094, | |
| "learning_rate": 1.2365166455770348e-05, | |
| "loss": 0.9177331924438477, | |
| "mean_token_accuracy": 0.8383358910679817, | |
| "num_tokens": 17774695.0, | |
| "step": 1890 | |
| }, | |
| { | |
| "entropy": 1.7210143111646174, | |
| "epoch": 2.2197224251278307, | |
| "grad_norm": 2.2790050506591797, | |
| "learning_rate": 1.2291563944864217e-05, | |
| "loss": 0.8777865409851074, | |
| "mean_token_accuracy": 0.7956211164593696, | |
| "num_tokens": 17846709.0, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 2.2197224251278307, | |
| "eval_entropy": 1.6415179804898798, | |
| "eval_loss": 0.8887978196144104, | |
| "eval_mean_token_accuracy": 0.7851445563137531, | |
| "eval_num_tokens": 17846709.0, | |
| "eval_runtime": 25.7621, | |
| "eval_samples_per_second": 19.874, | |
| "eval_steps_per_second": 9.937, | |
| "step": 1900 | |
| }, | |
| { | |
| "entropy": 1.766159813851118, | |
| "epoch": 2.231409788166545, | |
| "grad_norm": 8.775179862976074, | |
| "learning_rate": 1.2217830176440575e-05, | |
| "loss": 1.0922087669372558, | |
| "mean_token_accuracy": 0.8075018189847469, | |
| "num_tokens": 17942084.0, | |
| "step": 1910 | |
| }, | |
| { | |
| "entropy": 1.726970161497593, | |
| "epoch": 2.2430971512052595, | |
| "grad_norm": 8.528240203857422, | |
| "learning_rate": 1.2143969373864613e-05, | |
| "loss": 1.0563692092895507, | |
| "mean_token_accuracy": 0.8228851705789566, | |
| "num_tokens": 18034282.0, | |
| "step": 1920 | |
| }, | |
| { | |
| "entropy": 1.7479791216552258, | |
| "epoch": 2.2547845142439735, | |
| "grad_norm": 2.704474925994873, | |
| "learning_rate": 1.2069985767777853e-05, | |
| "loss": 1.0553196907043456, | |
| "mean_token_accuracy": 0.815582574903965, | |
| "num_tokens": 18155409.0, | |
| "step": 1930 | |
| }, | |
| { | |
| "entropy": 1.6536244474351407, | |
| "epoch": 2.266471877282688, | |
| "grad_norm": 10.785659790039062, | |
| "learning_rate": 1.199588359585584e-05, | |
| "loss": 0.9583339691162109, | |
| "mean_token_accuracy": 0.7827083263546228, | |
| "num_tokens": 18237737.0, | |
| "step": 1940 | |
| }, | |
| { | |
| "entropy": 1.7370208583772182, | |
| "epoch": 2.2781592403214024, | |
| "grad_norm": 6.897886276245117, | |
| "learning_rate": 1.1921667102565384e-05, | |
| "loss": 0.9463368415832519, | |
| "mean_token_accuracy": 0.7997389893978835, | |
| "num_tokens": 18327930.0, | |
| "step": 1950 | |
| }, | |
| { | |
| "entropy": 1.720282246917486, | |
| "epoch": 2.289846603360117, | |
| "grad_norm": 3.996598958969116, | |
| "learning_rate": 1.184734053892148e-05, | |
| "loss": 1.1193174362182616, | |
| "mean_token_accuracy": 0.7657456273213029, | |
| "num_tokens": 18423648.0, | |
| "step": 1960 | |
| }, | |
| { | |
| "entropy": 1.835063375532627, | |
| "epoch": 2.3015339663988312, | |
| "grad_norm": 5.055246829986572, | |
| "learning_rate": 1.1772908162243781e-05, | |
| "loss": 1.2491262435913086, | |
| "mean_token_accuracy": 0.76466054469347, | |
| "num_tokens": 18512229.0, | |
| "step": 1970 | |
| }, | |
| { | |
| "entropy": 1.7106602311134338, | |
| "epoch": 2.3132213294375457, | |
| "grad_norm": 5.09481954574585, | |
| "learning_rate": 1.1698374235912764e-05, | |
| "loss": 0.8167672157287598, | |
| "mean_token_accuracy": 0.815067458152771, | |
| "num_tokens": 18607065.0, | |
| "step": 1980 | |
| }, | |
| { | |
| "entropy": 1.7944564908742904, | |
| "epoch": 2.32490869247626, | |
| "grad_norm": 6.0724077224731445, | |
| "learning_rate": 1.1623743029125526e-05, | |
| "loss": 0.8526260375976562, | |
| "mean_token_accuracy": 0.774313784390688, | |
| "num_tokens": 18704091.0, | |
| "step": 1990 | |
| }, | |
| { | |
| "entropy": 1.6470934957265855, | |
| "epoch": 2.3365960555149745, | |
| "grad_norm": 10.5629301071167, | |
| "learning_rate": 1.154901881665125e-05, | |
| "loss": 0.9478482246398926, | |
| "mean_token_accuracy": 0.7888395514339208, | |
| "num_tokens": 18809808.0, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 2.3365960555149745, | |
| "eval_entropy": 1.664865046273917, | |
| "eval_loss": 0.8846761584281921, | |
| "eval_mean_token_accuracy": 0.7874117845203727, | |
| "eval_num_tokens": 18809808.0, | |
| "eval_runtime": 25.7239, | |
| "eval_samples_per_second": 19.904, | |
| "eval_steps_per_second": 9.952, | |
| "step": 2000 | |
| }, | |
| { | |
| "entropy": 1.688171324878931, | |
| "epoch": 2.348283418553689, | |
| "grad_norm": 9.02729606628418, | |
| "learning_rate": 1.1474205878586352e-05, | |
| "loss": 1.2155604362487793, | |
| "mean_token_accuracy": 0.7553981574252248, | |
| "num_tokens": 18897217.0, | |
| "step": 2010 | |
| }, | |
| { | |
| "entropy": 1.7721660077571868, | |
| "epoch": 2.3599707815924034, | |
| "grad_norm": 5.854802131652832, | |
| "learning_rate": 1.1399308500109326e-05, | |
| "loss": 0.8131728172302246, | |
| "mean_token_accuracy": 0.8193537637591362, | |
| "num_tokens": 18975705.0, | |
| "step": 2020 | |
| }, | |
| { | |
| "entropy": 1.7412988483905791, | |
| "epoch": 2.371658144631118, | |
| "grad_norm": 3.150503158569336, | |
| "learning_rate": 1.1324330971235284e-05, | |
| "loss": 1.047701072692871, | |
| "mean_token_accuracy": 0.800437244027853, | |
| "num_tokens": 19074509.0, | |
| "step": 2030 | |
| }, | |
| { | |
| "entropy": 1.7724151745438577, | |
| "epoch": 2.3833455076698318, | |
| "grad_norm": 4.939846038818359, | |
| "learning_rate": 1.1249277586570253e-05, | |
| "loss": 0.8570194244384766, | |
| "mean_token_accuracy": 0.8104645885527134, | |
| "num_tokens": 19213193.0, | |
| "step": 2040 | |
| }, | |
| { | |
| "entropy": 1.7081391178071499, | |
| "epoch": 2.395032870708546, | |
| "grad_norm": 13.442591667175293, | |
| "learning_rate": 1.1174152645065155e-05, | |
| "loss": 0.9962297439575195, | |
| "mean_token_accuracy": 0.7721560131758451, | |
| "num_tokens": 19318056.0, | |
| "step": 2050 | |
| }, | |
| { | |
| "entropy": 1.6723031967878341, | |
| "epoch": 2.4067202337472606, | |
| "grad_norm": 9.592318534851074, | |
| "learning_rate": 1.1098960449769596e-05, | |
| "loss": 1.1704561233520507, | |
| "mean_token_accuracy": 0.7990097958594561, | |
| "num_tokens": 19434190.0, | |
| "step": 2060 | |
| }, | |
| { | |
| "entropy": 1.6864351846277714, | |
| "epoch": 2.418407596785975, | |
| "grad_norm": 8.074052810668945, | |
| "learning_rate": 1.1023705307585381e-05, | |
| "loss": 0.9592673301696777, | |
| "mean_token_accuracy": 0.7668116193264722, | |
| "num_tokens": 19529901.0, | |
| "step": 2070 | |
| }, | |
| { | |
| "entropy": 1.7490323051810264, | |
| "epoch": 2.4300949598246895, | |
| "grad_norm": 2.452920436859131, | |
| "learning_rate": 1.0948391529019828e-05, | |
| "loss": 1.0507227897644043, | |
| "mean_token_accuracy": 0.8073636274784803, | |
| "num_tokens": 19623791.0, | |
| "step": 2080 | |
| }, | |
| { | |
| "entropy": 1.7456448063254357, | |
| "epoch": 2.441782322863404, | |
| "grad_norm": 7.240609645843506, | |
| "learning_rate": 1.0873023427938855e-05, | |
| "loss": 1.1253956794738769, | |
| "mean_token_accuracy": 0.7867503479123116, | |
| "num_tokens": 19713956.0, | |
| "step": 2090 | |
| }, | |
| { | |
| "entropy": 1.6924543783068657, | |
| "epoch": 2.4534696859021183, | |
| "grad_norm": 4.209897041320801, | |
| "learning_rate": 1.0797605321319899e-05, | |
| "loss": 0.868558406829834, | |
| "mean_token_accuracy": 0.7648149125277997, | |
| "num_tokens": 19808455.0, | |
| "step": 2100 | |
| }, | |
| { | |
| "epoch": 2.4534696859021183, | |
| "eval_entropy": 1.663283203728497, | |
| "eval_loss": 0.8835537433624268, | |
| "eval_mean_token_accuracy": 0.7884463180089369, | |
| "eval_num_tokens": 19808455.0, | |
| "eval_runtime": 25.7995, | |
| "eval_samples_per_second": 19.845, | |
| "eval_steps_per_second": 9.923, | |
| "step": 2100 | |
| }, | |
| { | |
| "entropy": 1.7139657579362393, | |
| "epoch": 2.4651570489408328, | |
| "grad_norm": 10.666122436523438, | |
| "learning_rate": 1.0722141529004646e-05, | |
| "loss": 0.9679533958435058, | |
| "mean_token_accuracy": 0.7547157764434814, | |
| "num_tokens": 19905431.0, | |
| "step": 2110 | |
| }, | |
| { | |
| "entropy": 1.718270693719387, | |
| "epoch": 2.476844411979547, | |
| "grad_norm": 7.6248908042907715, | |
| "learning_rate": 1.0646636373451593e-05, | |
| "loss": 1.0984148025512694, | |
| "mean_token_accuracy": 0.7684399399906396, | |
| "num_tokens": 19986159.0, | |
| "step": 2120 | |
| }, | |
| { | |
| "entropy": 1.7120233535766602, | |
| "epoch": 2.4885317750182616, | |
| "grad_norm": 2.2815515995025635, | |
| "learning_rate": 1.0571094179488456e-05, | |
| "loss": 0.988497257232666, | |
| "mean_token_accuracy": 0.8124069195240736, | |
| "num_tokens": 20060814.0, | |
| "step": 2130 | |
| }, | |
| { | |
| "entropy": 1.7328252077102662, | |
| "epoch": 2.500219138056976, | |
| "grad_norm": 4.041893482208252, | |
| "learning_rate": 1.0495519274064471e-05, | |
| "loss": 1.126350212097168, | |
| "mean_token_accuracy": 0.7363353008404374, | |
| "num_tokens": 20150562.0, | |
| "step": 2140 | |
| }, | |
| { | |
| "entropy": 1.6000701755285263, | |
| "epoch": 2.51190650109569, | |
| "grad_norm": 7.912816524505615, | |
| "learning_rate": 1.0419915986002534e-05, | |
| "loss": 1.274219799041748, | |
| "mean_token_accuracy": 0.7821881119161844, | |
| "num_tokens": 20263300.0, | |
| "step": 2150 | |
| }, | |
| { | |
| "entropy": 1.7800101920962335, | |
| "epoch": 2.523593864134405, | |
| "grad_norm": 4.959470272064209, | |
| "learning_rate": 1.0344288645751257e-05, | |
| "loss": 0.9354647636413574, | |
| "mean_token_accuracy": 0.7791614972054959, | |
| "num_tokens": 20340797.0, | |
| "step": 2160 | |
| }, | |
| { | |
| "entropy": 1.7066360771656037, | |
| "epoch": 2.535281227173119, | |
| "grad_norm": 3.610182523727417, | |
| "learning_rate": 1.0268641585136927e-05, | |
| "loss": 0.728416919708252, | |
| "mean_token_accuracy": 0.8194401554763318, | |
| "num_tokens": 20434070.0, | |
| "step": 2170 | |
| }, | |
| { | |
| "entropy": 1.780417773872614, | |
| "epoch": 2.5469685902118333, | |
| "grad_norm": 6.358795166015625, | |
| "learning_rate": 1.019297913711539e-05, | |
| "loss": 1.0019350051879883, | |
| "mean_token_accuracy": 0.7575782489031553, | |
| "num_tokens": 20518809.0, | |
| "step": 2180 | |
| }, | |
| { | |
| "entropy": 1.7431005448102952, | |
| "epoch": 2.5586559532505477, | |
| "grad_norm": 10.635919570922852, | |
| "learning_rate": 1.0117305635523849e-05, | |
| "loss": 1.125741958618164, | |
| "mean_token_accuracy": 0.7842472262680531, | |
| "num_tokens": 20640413.0, | |
| "step": 2190 | |
| }, | |
| { | |
| "entropy": 1.7685076668858528, | |
| "epoch": 2.570343316289262, | |
| "grad_norm": 10.567401885986328, | |
| "learning_rate": 1.0041625414832659e-05, | |
| "loss": 1.029182529449463, | |
| "mean_token_accuracy": 0.7735146172344685, | |
| "num_tokens": 20719301.0, | |
| "step": 2200 | |
| }, | |
| { | |
| "epoch": 2.570343316289262, | |
| "eval_entropy": 1.6802399228326976, | |
| "eval_loss": 0.8806448578834534, | |
| "eval_mean_token_accuracy": 0.7880933153210208, | |
| "eval_num_tokens": 20719301.0, | |
| "eval_runtime": 25.7639, | |
| "eval_samples_per_second": 19.873, | |
| "eval_steps_per_second": 9.936, | |
| "step": 2200 | |
| }, | |
| { | |
| "entropy": 1.7429690331220626, | |
| "epoch": 2.5820306793279766, | |
| "grad_norm": 4.979848861694336, | |
| "learning_rate": 9.965942809897021e-06, | |
| "loss": 1.078941535949707, | |
| "mean_token_accuracy": 0.8028537411242723, | |
| "num_tokens": 20814629.0, | |
| "step": 2210 | |
| }, | |
| { | |
| "entropy": 1.7465707987546921, | |
| "epoch": 2.593718042366691, | |
| "grad_norm": 2.9227752685546875, | |
| "learning_rate": 9.890262155708696e-06, | |
| "loss": 1.261153221130371, | |
| "mean_token_accuracy": 0.7378072213381529, | |
| "num_tokens": 20937052.0, | |
| "step": 2220 | |
| }, | |
| { | |
| "entropy": 1.7786902643740177, | |
| "epoch": 2.6054054054054054, | |
| "grad_norm": 7.268579959869385, | |
| "learning_rate": 9.814587787147735e-06, | |
| "loss": 0.8818110466003418, | |
| "mean_token_accuracy": 0.7982126645743847, | |
| "num_tokens": 21017553.0, | |
| "step": 2230 | |
| }, | |
| { | |
| "entropy": 1.7861275777220726, | |
| "epoch": 2.61709276844412, | |
| "grad_norm": 10.696455955505371, | |
| "learning_rate": 9.738924038734129e-06, | |
| "loss": 1.100949192047119, | |
| "mean_token_accuracy": 0.7710029076784849, | |
| "num_tokens": 21095809.0, | |
| "step": 2240 | |
| }, | |
| { | |
| "entropy": 1.7052608147263526, | |
| "epoch": 2.6287801314828343, | |
| "grad_norm": 10.710509300231934, | |
| "learning_rate": 9.663275244379576e-06, | |
| "loss": 0.953674030303955, | |
| "mean_token_accuracy": 0.7945627331733703, | |
| "num_tokens": 21189013.0, | |
| "step": 2250 | |
| }, | |
| { | |
| "entropy": 1.7925067514181137, | |
| "epoch": 2.6404674945215487, | |
| "grad_norm": 5.928650379180908, | |
| "learning_rate": 9.587645737139229e-06, | |
| "loss": 0.9999592781066895, | |
| "mean_token_accuracy": 0.7624824114143849, | |
| "num_tokens": 21268694.0, | |
| "step": 2260 | |
| }, | |
| { | |
| "entropy": 1.6451317243278027, | |
| "epoch": 2.652154857560263, | |
| "grad_norm": 7.02318000793457, | |
| "learning_rate": 9.512039848963494e-06, | |
| "loss": 0.8141751289367676, | |
| "mean_token_accuracy": 0.8069352146238089, | |
| "num_tokens": 21369367.0, | |
| "step": 2270 | |
| }, | |
| { | |
| "entropy": 1.6899416998028756, | |
| "epoch": 2.663842220598977, | |
| "grad_norm": 3.720379114151001, | |
| "learning_rate": 9.436461910449915e-06, | |
| "loss": 0.775752067565918, | |
| "mean_token_accuracy": 0.7989593021571636, | |
| "num_tokens": 21465668.0, | |
| "step": 2280 | |
| }, | |
| { | |
| "entropy": 1.6926493354141712, | |
| "epoch": 2.675529583637692, | |
| "grad_norm": 5.736570835113525, | |
| "learning_rate": 9.360916250595124e-06, | |
| "loss": 1.0607316970825196, | |
| "mean_token_accuracy": 0.739141751639545, | |
| "num_tokens": 21541115.0, | |
| "step": 2290 | |
| }, | |
| { | |
| "entropy": 1.713230238854885, | |
| "epoch": 2.687216946676406, | |
| "grad_norm": 5.054290294647217, | |
| "learning_rate": 9.285407196546862e-06, | |
| "loss": 0.9530890464782715, | |
| "mean_token_accuracy": 0.7673216979950667, | |
| "num_tokens": 21650967.0, | |
| "step": 2300 | |
| }, | |
| { | |
| "epoch": 2.687216946676406, | |
| "eval_entropy": 1.70094374101609, | |
| "eval_loss": 0.8739476799964905, | |
| "eval_mean_token_accuracy": 0.7821284044766799, | |
| "eval_num_tokens": 21650967.0, | |
| "eval_runtime": 25.7817, | |
| "eval_samples_per_second": 19.859, | |
| "eval_steps_per_second": 9.93, | |
| "step": 2300 | |
| }, | |
| { | |
| "entropy": 1.719686582684517, | |
| "epoch": 2.6989043097151204, | |
| "grad_norm": 3.380436897277832, | |
| "learning_rate": 9.209939073356165e-06, | |
| "loss": 0.8329605102539063, | |
| "mean_token_accuracy": 0.7897226478904485, | |
| "num_tokens": 21762612.0, | |
| "step": 2310 | |
| }, | |
| { | |
| "entropy": 1.699085582792759, | |
| "epoch": 2.710591672753835, | |
| "grad_norm": 6.518524646759033, | |
| "learning_rate": 9.134516203729588e-06, | |
| "loss": 1.0498428344726562, | |
| "mean_token_accuracy": 0.7732686188071967, | |
| "num_tokens": 21856022.0, | |
| "step": 2320 | |
| }, | |
| { | |
| "entropy": 1.7256886586546898, | |
| "epoch": 2.7222790357925493, | |
| "grad_norm": 7.4789910316467285, | |
| "learning_rate": 9.059142907781631e-06, | |
| "loss": 1.083822536468506, | |
| "mean_token_accuracy": 0.7466625854372978, | |
| "num_tokens": 21949955.0, | |
| "step": 2330 | |
| }, | |
| { | |
| "entropy": 1.6915680393576622, | |
| "epoch": 2.7339663988312637, | |
| "grad_norm": 12.511588096618652, | |
| "learning_rate": 8.983823502787294e-06, | |
| "loss": 0.9861274719238281, | |
| "mean_token_accuracy": 0.7604979265481233, | |
| "num_tokens": 22044621.0, | |
| "step": 2340 | |
| }, | |
| { | |
| "entropy": 1.6975976377725601, | |
| "epoch": 2.745653761869978, | |
| "grad_norm": 6.881553649902344, | |
| "learning_rate": 8.908562302934763e-06, | |
| "loss": 0.9918970108032227, | |
| "mean_token_accuracy": 0.8150558684021234, | |
| "num_tokens": 22167524.0, | |
| "step": 2350 | |
| }, | |
| { | |
| "entropy": 1.7521183386445045, | |
| "epoch": 2.7573411249086925, | |
| "grad_norm": 10.453824043273926, | |
| "learning_rate": 8.833363619078334e-06, | |
| "loss": 0.9284152030944824, | |
| "mean_token_accuracy": 0.7743912402540445, | |
| "num_tokens": 22247235.0, | |
| "step": 2360 | |
| }, | |
| { | |
| "entropy": 1.6890988066792487, | |
| "epoch": 2.769028487947407, | |
| "grad_norm": 8.435256004333496, | |
| "learning_rate": 8.758231758491467e-06, | |
| "loss": 0.9447514533996582, | |
| "mean_token_accuracy": 0.7803891401737928, | |
| "num_tokens": 22342825.0, | |
| "step": 2370 | |
| }, | |
| { | |
| "entropy": 1.7029536984860898, | |
| "epoch": 2.7807158509861214, | |
| "grad_norm": 5.541050910949707, | |
| "learning_rate": 8.683171024620072e-06, | |
| "loss": 0.8100149154663085, | |
| "mean_token_accuracy": 0.775150940194726, | |
| "num_tokens": 22438854.0, | |
| "step": 2380 | |
| }, | |
| { | |
| "entropy": 1.7363984808325768, | |
| "epoch": 2.7924032140248354, | |
| "grad_norm": 12.861689567565918, | |
| "learning_rate": 8.608185716836044e-06, | |
| "loss": 0.9886090278625488, | |
| "mean_token_accuracy": 0.8351553939282894, | |
| "num_tokens": 22547516.0, | |
| "step": 2390 | |
| }, | |
| { | |
| "entropy": 1.7828427016735078, | |
| "epoch": 2.8040905770635502, | |
| "grad_norm": 8.309239387512207, | |
| "learning_rate": 8.533280130190958e-06, | |
| "loss": 1.0228120803833007, | |
| "mean_token_accuracy": 0.7845853284001351, | |
| "num_tokens": 22633376.0, | |
| "step": 2400 | |
| }, | |
| { | |
| "epoch": 2.8040905770635502, | |
| "eval_entropy": 1.6970421387813985, | |
| "eval_loss": 0.8869515061378479, | |
| "eval_mean_token_accuracy": 0.7793418756918982, | |
| "eval_num_tokens": 22633376.0, | |
| "eval_runtime": 25.7702, | |
| "eval_samples_per_second": 19.868, | |
| "eval_steps_per_second": 9.934, | |
| "step": 2400 | |
| }, | |
| { | |
| "entropy": 1.7268100760877132, | |
| "epoch": 2.8157779401022642, | |
| "grad_norm": 5.987215995788574, | |
| "learning_rate": 8.458458555170085e-06, | |
| "loss": 1.002350425720215, | |
| "mean_token_accuracy": 0.7662376806139946, | |
| "num_tokens": 22735672.0, | |
| "step": 2410 | |
| }, | |
| { | |
| "entropy": 1.7254829376935958, | |
| "epoch": 2.8274653031409787, | |
| "grad_norm": 6.598609447479248, | |
| "learning_rate": 8.383725277446634e-06, | |
| "loss": 1.0801855087280274, | |
| "mean_token_accuracy": 0.769980538636446, | |
| "num_tokens": 22804845.0, | |
| "step": 2420 | |
| }, | |
| { | |
| "entropy": 1.7012818068265916, | |
| "epoch": 2.839152666179693, | |
| "grad_norm": 8.625926971435547, | |
| "learning_rate": 8.309084577636257e-06, | |
| "loss": 1.1284662246704102, | |
| "mean_token_accuracy": 0.7693151874467731, | |
| "num_tokens": 22904012.0, | |
| "step": 2430 | |
| }, | |
| { | |
| "entropy": 1.7061614483594894, | |
| "epoch": 2.8508400292184075, | |
| "grad_norm": 8.639177322387695, | |
| "learning_rate": 8.234540731051892e-06, | |
| "loss": 1.002232265472412, | |
| "mean_token_accuracy": 0.7625796541571617, | |
| "num_tokens": 23003911.0, | |
| "step": 2440 | |
| }, | |
| { | |
| "entropy": 1.7662774667143821, | |
| "epoch": 2.862527392257122, | |
| "grad_norm": 6.118652820587158, | |
| "learning_rate": 8.160098007458851e-06, | |
| "loss": 0.9007489204406738, | |
| "mean_token_accuracy": 0.8074061691761016, | |
| "num_tokens": 23096511.0, | |
| "step": 2450 | |
| }, | |
| { | |
| "entropy": 1.7794369161128998, | |
| "epoch": 2.8742147552958364, | |
| "grad_norm": 10.20056438446045, | |
| "learning_rate": 8.085760670830262e-06, | |
| "loss": 0.8909171104431153, | |
| "mean_token_accuracy": 0.7755695793777704, | |
| "num_tokens": 23195819.0, | |
| "step": 2460 | |
| }, | |
| { | |
| "entropy": 1.7722439236938954, | |
| "epoch": 2.885902118334551, | |
| "grad_norm": 8.229257583618164, | |
| "learning_rate": 8.011532979102857e-06, | |
| "loss": 0.9046154975891113, | |
| "mean_token_accuracy": 0.7934059891849756, | |
| "num_tokens": 23274150.0, | |
| "step": 2470 | |
| }, | |
| { | |
| "entropy": 1.6098609887063504, | |
| "epoch": 2.897589481373265, | |
| "grad_norm": 15.409244537353516, | |
| "learning_rate": 7.93741918393304e-06, | |
| "loss": 0.908391284942627, | |
| "mean_token_accuracy": 0.7439465187489986, | |
| "num_tokens": 23380413.0, | |
| "step": 2480 | |
| }, | |
| { | |
| "entropy": 1.730226568132639, | |
| "epoch": 2.9092768444119796, | |
| "grad_norm": 12.290626525878906, | |
| "learning_rate": 7.863423530453395e-06, | |
| "loss": 0.9404394149780273, | |
| "mean_token_accuracy": 0.7837304372340441, | |
| "num_tokens": 23487027.0, | |
| "step": 2490 | |
| }, | |
| { | |
| "entropy": 1.6866980507969855, | |
| "epoch": 2.920964207450694, | |
| "grad_norm": 5.37745475769043, | |
| "learning_rate": 7.789550257029523e-06, | |
| "loss": 1.0467060089111329, | |
| "mean_token_accuracy": 0.7495848417282105, | |
| "num_tokens": 23590403.0, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 2.920964207450694, | |
| "eval_entropy": 1.68139323964715, | |
| "eval_loss": 0.8828441500663757, | |
| "eval_mean_token_accuracy": 0.7800040470901877, | |
| "eval_num_tokens": 23590403.0, | |
| "eval_runtime": 25.7987, | |
| "eval_samples_per_second": 19.846, | |
| "eval_steps_per_second": 9.923, | |
| "step": 2500 | |
| }, | |
| { | |
| "entropy": 1.7866614565253258, | |
| "epoch": 2.9326515704894085, | |
| "grad_norm": 2.2976484298706055, | |
| "learning_rate": 7.715803595017257e-06, | |
| "loss": 1.1191862106323243, | |
| "mean_token_accuracy": 0.782800105586648, | |
| "num_tokens": 23680505.0, | |
| "step": 2510 | |
| }, | |
| { | |
| "entropy": 1.7942629598081112, | |
| "epoch": 2.9443389335281225, | |
| "grad_norm": 13.736532211303711, | |
| "learning_rate": 7.642187768520319e-06, | |
| "loss": 1.0881122589111327, | |
| "mean_token_accuracy": 0.7522706456482411, | |
| "num_tokens": 23766263.0, | |
| "step": 2520 | |
| }, | |
| { | |
| "entropy": 1.7226313956081867, | |
| "epoch": 2.9560262965668374, | |
| "grad_norm": 10.570932388305664, | |
| "learning_rate": 7.5687069941483585e-06, | |
| "loss": 1.1148384094238282, | |
| "mean_token_accuracy": 0.7997437044978142, | |
| "num_tokens": 23894715.0, | |
| "step": 2530 | |
| }, | |
| { | |
| "entropy": 1.6955727070569993, | |
| "epoch": 2.9677136596055513, | |
| "grad_norm": 8.713987350463867, | |
| "learning_rate": 7.495365480775416e-06, | |
| "loss": 1.1579767227172852, | |
| "mean_token_accuracy": 0.7260787479579449, | |
| "num_tokens": 23990029.0, | |
| "step": 2540 | |
| }, | |
| { | |
| "entropy": 1.733625952899456, | |
| "epoch": 2.9794010226442658, | |
| "grad_norm": 11.137775421142578, | |
| "learning_rate": 7.422167429298891e-06, | |
| "loss": 0.7303710460662842, | |
| "mean_token_accuracy": 0.7830865511670708, | |
| "num_tokens": 24052733.0, | |
| "step": 2550 | |
| }, | |
| { | |
| "entropy": 1.7853002369403839, | |
| "epoch": 2.99108838568298, | |
| "grad_norm": 8.832341194152832, | |
| "learning_rate": 7.349117032398861e-06, | |
| "loss": 1.0320300102233886, | |
| "mean_token_accuracy": 0.7854295775294304, | |
| "num_tokens": 24131387.0, | |
| "step": 2560 | |
| }, | |
| { | |
| "entropy": 1.680047945542769, | |
| "epoch": 3.002337472607743, | |
| "grad_norm": 3.1155483722686768, | |
| "learning_rate": 7.2762184742979716e-06, | |
| "loss": 0.981098747253418, | |
| "mean_token_accuracy": 0.7597046676394227, | |
| "num_tokens": 24225471.0, | |
| "step": 2570 | |
| }, | |
| { | |
| "entropy": 1.6457124210894107, | |
| "epoch": 3.0140248356464574, | |
| "grad_norm": 6.733229637145996, | |
| "learning_rate": 7.203475930521764e-06, | |
| "loss": 0.7696227073669434, | |
| "mean_token_accuracy": 0.8114039119333029, | |
| "num_tokens": 24337229.0, | |
| "step": 2580 | |
| }, | |
| { | |
| "entropy": 1.6516721569001676, | |
| "epoch": 3.025712198685172, | |
| "grad_norm": 12.687271118164062, | |
| "learning_rate": 7.1308935676594844e-06, | |
| "loss": 1.002864933013916, | |
| "mean_token_accuracy": 0.8272962253540754, | |
| "num_tokens": 24426815.0, | |
| "step": 2590 | |
| }, | |
| { | |
| "entropy": 1.5764148704707623, | |
| "epoch": 3.0373995617238863, | |
| "grad_norm": 4.2337965965271, | |
| "learning_rate": 7.058475543125464e-06, | |
| "loss": 0.9950182914733887, | |
| "mean_token_accuracy": 0.8472901705652476, | |
| "num_tokens": 24518098.0, | |
| "step": 2600 | |
| }, | |
| { | |
| "epoch": 3.0373995617238863, | |
| "eval_entropy": 1.5192026905715466, | |
| "eval_loss": 0.9768570065498352, | |
| "eval_mean_token_accuracy": 0.7759581801947206, | |
| "eval_num_tokens": 24518098.0, | |
| "eval_runtime": 25.8115, | |
| "eval_samples_per_second": 19.836, | |
| "eval_steps_per_second": 9.918, | |
| "step": 2600 | |
| }, | |
| { | |
| "entropy": 1.4608647428452968, | |
| "epoch": 3.0490869247626002, | |
| "grad_norm": 7.60485315322876, | |
| "learning_rate": 6.986226004920962e-06, | |
| "loss": 0.3722125768661499, | |
| "mean_token_accuracy": 0.8802612498402596, | |
| "num_tokens": 24614212.0, | |
| "step": 2610 | |
| }, | |
| { | |
| "entropy": 1.5466793723404408, | |
| "epoch": 3.0607742878013147, | |
| "grad_norm": 14.492239952087402, | |
| "learning_rate": 6.914149091396564e-06, | |
| "loss": 0.9616324424743652, | |
| "mean_token_accuracy": 0.8387265991419554, | |
| "num_tokens": 24717871.0, | |
| "step": 2620 | |
| }, | |
| { | |
| "entropy": 1.5104636751115321, | |
| "epoch": 3.072461650840029, | |
| "grad_norm": 8.65507984161377, | |
| "learning_rate": 6.84224893101519e-06, | |
| "loss": 0.8227140426635742, | |
| "mean_token_accuracy": 0.8016497645527124, | |
| "num_tokens": 24813638.0, | |
| "step": 2630 | |
| }, | |
| { | |
| "entropy": 1.680018126219511, | |
| "epoch": 3.0841490138787435, | |
| "grad_norm": 18.573421478271484, | |
| "learning_rate": 6.770529642115566e-06, | |
| "loss": 0.8232023239135742, | |
| "mean_token_accuracy": 0.8430277239531279, | |
| "num_tokens": 24889113.0, | |
| "step": 2640 | |
| }, | |
| { | |
| "entropy": 1.6211387872695924, | |
| "epoch": 3.095836376917458, | |
| "grad_norm": 3.3432164192199707, | |
| "learning_rate": 6.698995332676375e-06, | |
| "loss": 0.6491162776947021, | |
| "mean_token_accuracy": 0.8263424597680569, | |
| "num_tokens": 24965540.0, | |
| "step": 2650 | |
| }, | |
| { | |
| "entropy": 1.57953934520483, | |
| "epoch": 3.1075237399561724, | |
| "grad_norm": 3.0218794345855713, | |
| "learning_rate": 6.627650100080928e-06, | |
| "loss": 0.6824802398681641, | |
| "mean_token_accuracy": 0.8291381094604731, | |
| "num_tokens": 25071267.0, | |
| "step": 2660 | |
| }, | |
| { | |
| "entropy": 1.4782447293400764, | |
| "epoch": 3.119211102994887, | |
| "grad_norm": 13.621418952941895, | |
| "learning_rate": 6.556498030882485e-06, | |
| "loss": 0.6709208965301514, | |
| "mean_token_accuracy": 0.8171975061297416, | |
| "num_tokens": 25201220.0, | |
| "step": 2670 | |
| }, | |
| { | |
| "entropy": 1.5655394241213798, | |
| "epoch": 3.1308984660336012, | |
| "grad_norm": 6.171270847320557, | |
| "learning_rate": 6.485543200570192e-06, | |
| "loss": 0.6699509620666504, | |
| "mean_token_accuracy": 0.8511052500456572, | |
| "num_tokens": 25283391.0, | |
| "step": 2680 | |
| }, | |
| { | |
| "entropy": 1.5742544181644917, | |
| "epoch": 3.1425858290723157, | |
| "grad_norm": 4.907659530639648, | |
| "learning_rate": 6.414789673335626e-06, | |
| "loss": 1.000911808013916, | |
| "mean_token_accuracy": 0.8191284120082856, | |
| "num_tokens": 25385011.0, | |
| "step": 2690 | |
| }, | |
| { | |
| "entropy": 1.5648961946368218, | |
| "epoch": 3.15427319211103, | |
| "grad_norm": 12.09859848022461, | |
| "learning_rate": 6.344241501839999e-06, | |
| "loss": 0.8705298423767089, | |
| "mean_token_accuracy": 0.8365528151392937, | |
| "num_tokens": 25474280.0, | |
| "step": 2700 | |
| }, | |
| { | |
| "epoch": 3.15427319211103, | |
| "eval_entropy": 1.568035047966987, | |
| "eval_loss": 0.9648519158363342, | |
| "eval_mean_token_accuracy": 0.7773856642888859, | |
| "eval_num_tokens": 25474280.0, | |
| "eval_runtime": 25.7826, | |
| "eval_samples_per_second": 19.858, | |
| "eval_steps_per_second": 9.929, | |
| "step": 2700 | |
| }, | |
| { | |
| "entropy": 1.6122384697198868, | |
| "epoch": 3.1659605551497445, | |
| "grad_norm": 12.385276794433594, | |
| "learning_rate": 6.273902726982066e-06, | |
| "loss": 0.7094444751739502, | |
| "mean_token_accuracy": 0.8283845584839582, | |
| "num_tokens": 25574873.0, | |
| "step": 2710 | |
| }, | |
| { | |
| "entropy": 1.641030441969633, | |
| "epoch": 3.177647918188459, | |
| "grad_norm": 10.179749488830566, | |
| "learning_rate": 6.2037773776666134e-06, | |
| "loss": 0.8775361061096192, | |
| "mean_token_accuracy": 0.8321642322465778, | |
| "num_tokens": 25667810.0, | |
| "step": 2720 | |
| }, | |
| { | |
| "entropy": 1.5741927064955235, | |
| "epoch": 3.189335281227173, | |
| "grad_norm": 11.339288711547852, | |
| "learning_rate": 6.133869470573735e-06, | |
| "loss": 0.7079936981201171, | |
| "mean_token_accuracy": 0.8223622243851423, | |
| "num_tokens": 25750418.0, | |
| "step": 2730 | |
| }, | |
| { | |
| "entropy": 1.590510404109955, | |
| "epoch": 3.2010226442658873, | |
| "grad_norm": 12.17235279083252, | |
| "learning_rate": 6.064183009928734e-06, | |
| "loss": 0.5684170722961426, | |
| "mean_token_accuracy": 0.8493764363229275, | |
| "num_tokens": 25875234.0, | |
| "step": 2740 | |
| }, | |
| { | |
| "entropy": 1.6075891435146332, | |
| "epoch": 3.2127100073046018, | |
| "grad_norm": 6.357970714569092, | |
| "learning_rate": 5.99472198727278e-06, | |
| "loss": 0.7294750690460206, | |
| "mean_token_accuracy": 0.7975887570530176, | |
| "num_tokens": 25973055.0, | |
| "step": 2750 | |
| }, | |
| { | |
| "entropy": 1.5885420821607112, | |
| "epoch": 3.224397370343316, | |
| "grad_norm": 4.168971061706543, | |
| "learning_rate": 5.925490381234278e-06, | |
| "loss": 0.8555428504943847, | |
| "mean_token_accuracy": 0.8222704697400331, | |
| "num_tokens": 26065681.0, | |
| "step": 2760 | |
| }, | |
| { | |
| "entropy": 1.5862157940864563, | |
| "epoch": 3.2360847333820306, | |
| "grad_norm": 6.020169258117676, | |
| "learning_rate": 5.856492157300974e-06, | |
| "loss": 0.8058023452758789, | |
| "mean_token_accuracy": 0.8149345409125089, | |
| "num_tokens": 26174598.0, | |
| "step": 2770 | |
| }, | |
| { | |
| "entropy": 1.5975151896476745, | |
| "epoch": 3.247772096420745, | |
| "grad_norm": 5.6602559089660645, | |
| "learning_rate": 5.7877312675928135e-06, | |
| "loss": 1.0201630592346191, | |
| "mean_token_accuracy": 0.8364724058657884, | |
| "num_tokens": 26256744.0, | |
| "step": 2780 | |
| }, | |
| { | |
| "entropy": 1.503919642418623, | |
| "epoch": 3.2594594594594595, | |
| "grad_norm": 4.924138069152832, | |
| "learning_rate": 5.719211650635586e-06, | |
| "loss": 0.6068850994110108, | |
| "mean_token_accuracy": 0.8476374715566635, | |
| "num_tokens": 26346815.0, | |
| "step": 2790 | |
| }, | |
| { | |
| "entropy": 1.5372531875967979, | |
| "epoch": 3.271146822498174, | |
| "grad_norm": 4.390224933624268, | |
| "learning_rate": 5.650937231135318e-06, | |
| "loss": 0.46883220672607423, | |
| "mean_token_accuracy": 0.8634121883660555, | |
| "num_tokens": 26468118.0, | |
| "step": 2800 | |
| }, | |
| { | |
| "epoch": 3.271146822498174, | |
| "eval_entropy": 1.5128659757319838, | |
| "eval_loss": 0.9976800680160522, | |
| "eval_mean_token_accuracy": 0.7753782341023907, | |
| "eval_num_tokens": 26468118.0, | |
| "eval_runtime": 25.7109, | |
| "eval_samples_per_second": 19.914, | |
| "eval_steps_per_second": 9.957, | |
| "step": 2800 | |
| }, | |
| { | |
| "entropy": 1.605018461495638, | |
| "epoch": 3.2828341855368883, | |
| "grad_norm": 7.420022487640381, | |
| "learning_rate": 5.582911919753477e-06, | |
| "loss": 1.0460566520690917, | |
| "mean_token_accuracy": 0.8201792851090431, | |
| "num_tokens": 26567024.0, | |
| "step": 2810 | |
| }, | |
| { | |
| "entropy": 1.508357545733452, | |
| "epoch": 3.2945215485756028, | |
| "grad_norm": 12.932101249694824, | |
| "learning_rate": 5.515139612882967e-06, | |
| "loss": 0.6858778953552246, | |
| "mean_token_accuracy": 0.8464779894798994, | |
| "num_tokens": 26660259.0, | |
| "step": 2820 | |
| }, | |
| { | |
| "entropy": 1.598171342909336, | |
| "epoch": 3.306208911614317, | |
| "grad_norm": 4.748000144958496, | |
| "learning_rate": 5.447624192424952e-06, | |
| "loss": 0.8176912307739258, | |
| "mean_token_accuracy": 0.8116229582577944, | |
| "num_tokens": 26730113.0, | |
| "step": 2830 | |
| }, | |
| { | |
| "entropy": 1.588581071048975, | |
| "epoch": 3.317896274653031, | |
| "grad_norm": 5.392555236816406, | |
| "learning_rate": 5.38036952556652e-06, | |
| "loss": 0.6881934642791748, | |
| "mean_token_accuracy": 0.8470692213624715, | |
| "num_tokens": 26802049.0, | |
| "step": 2840 | |
| }, | |
| { | |
| "entropy": 1.5943341687321664, | |
| "epoch": 3.329583637691746, | |
| "grad_norm": 7.3894500732421875, | |
| "learning_rate": 5.313379464559152e-06, | |
| "loss": 0.7837345600128174, | |
| "mean_token_accuracy": 0.8450327418744564, | |
| "num_tokens": 26880166.0, | |
| "step": 2850 | |
| }, | |
| { | |
| "entropy": 1.587635388225317, | |
| "epoch": 3.34127100073046, | |
| "grad_norm": 10.771740913391113, | |
| "learning_rate": 5.24665784649809e-06, | |
| "loss": 0.5940907955169678, | |
| "mean_token_accuracy": 0.8424886263906955, | |
| "num_tokens": 27008877.0, | |
| "step": 2860 | |
| }, | |
| { | |
| "entropy": 1.560003275424242, | |
| "epoch": 3.3529583637691744, | |
| "grad_norm": 12.674657821655273, | |
| "learning_rate": 5.18020849310255e-06, | |
| "loss": 0.6514994144439697, | |
| "mean_token_accuracy": 0.866674953326583, | |
| "num_tokens": 27077965.0, | |
| "step": 2870 | |
| }, | |
| { | |
| "entropy": 1.5951070837676524, | |
| "epoch": 3.364645726807889, | |
| "grad_norm": 5.081298351287842, | |
| "learning_rate": 5.1140352104968036e-06, | |
| "loss": 0.7107437133789063, | |
| "mean_token_accuracy": 0.8551860637962818, | |
| "num_tokens": 27180562.0, | |
| "step": 2880 | |
| }, | |
| { | |
| "entropy": 1.6164423182606698, | |
| "epoch": 3.3763330898466033, | |
| "grad_norm": 9.870444297790527, | |
| "learning_rate": 5.048141788992196e-06, | |
| "loss": 0.7967389106750489, | |
| "mean_token_accuracy": 0.853261298686266, | |
| "num_tokens": 27282879.0, | |
| "step": 2890 | |
| }, | |
| { | |
| "entropy": 1.6636493735015392, | |
| "epoch": 3.3880204528853177, | |
| "grad_norm": 6.572866439819336, | |
| "learning_rate": 4.9825320028700095e-06, | |
| "loss": 0.9500320434570313, | |
| "mean_token_accuracy": 0.8208385236561299, | |
| "num_tokens": 27380404.0, | |
| "step": 2900 | |
| }, | |
| { | |
| "epoch": 3.3880204528853177, | |
| "eval_entropy": 1.5524416451808065, | |
| "eval_loss": 0.9850968718528748, | |
| "eval_mean_token_accuracy": 0.7797762223053724, | |
| "eval_num_tokens": 27380404.0, | |
| "eval_runtime": 25.7175, | |
| "eval_samples_per_second": 19.909, | |
| "eval_steps_per_second": 9.954, | |
| "step": 2900 | |
| }, | |
| { | |
| "entropy": 1.602518045157194, | |
| "epoch": 3.399707815924032, | |
| "grad_norm": 12.991669654846191, | |
| "learning_rate": 4.917209610165313e-06, | |
| "loss": 0.8542160987854004, | |
| "mean_token_accuracy": 0.8111366737633944, | |
| "num_tokens": 27466267.0, | |
| "step": 2910 | |
| }, | |
| { | |
| "entropy": 1.61616507768631, | |
| "epoch": 3.4113951789627466, | |
| "grad_norm": 16.112041473388672, | |
| "learning_rate": 4.852178352451684e-06, | |
| "loss": 0.7797205448150635, | |
| "mean_token_accuracy": 0.8485843721777201, | |
| "num_tokens": 27531040.0, | |
| "step": 2920 | |
| }, | |
| { | |
| "entropy": 1.6173233568668366, | |
| "epoch": 3.423082542001461, | |
| "grad_norm": 10.032934188842773, | |
| "learning_rate": 4.787441954626895e-06, | |
| "loss": 0.9266670227050782, | |
| "mean_token_accuracy": 0.8322351593524218, | |
| "num_tokens": 27633161.0, | |
| "step": 2930 | |
| }, | |
| { | |
| "entropy": 1.6111929923295976, | |
| "epoch": 3.4347699050401754, | |
| "grad_norm": 9.466462135314941, | |
| "learning_rate": 4.723004124699577e-06, | |
| "loss": 0.8797435760498047, | |
| "mean_token_accuracy": 0.8217988926917315, | |
| "num_tokens": 27736153.0, | |
| "step": 2940 | |
| }, | |
| { | |
| "entropy": 1.5657838113605975, | |
| "epoch": 3.44645726807889, | |
| "grad_norm": 15.69760799407959, | |
| "learning_rate": 4.658868553576805e-06, | |
| "loss": 0.9593112945556641, | |
| "mean_token_accuracy": 0.8162898249924183, | |
| "num_tokens": 27844716.0, | |
| "step": 2950 | |
| }, | |
| { | |
| "entropy": 1.6370114475488662, | |
| "epoch": 3.4581446311176043, | |
| "grad_norm": 4.239508628845215, | |
| "learning_rate": 4.5950389148527085e-06, | |
| "loss": 0.6190831184387207, | |
| "mean_token_accuracy": 0.8207410082221032, | |
| "num_tokens": 27938760.0, | |
| "step": 2960 | |
| }, | |
| { | |
| "entropy": 1.566064177453518, | |
| "epoch": 3.4698319941563183, | |
| "grad_norm": 8.937148094177246, | |
| "learning_rate": 4.531518864598047e-06, | |
| "loss": 0.9580602645874023, | |
| "mean_token_accuracy": 0.8286993879824877, | |
| "num_tokens": 28026597.0, | |
| "step": 2970 | |
| }, | |
| { | |
| "entropy": 1.5721587441861629, | |
| "epoch": 3.4815193571950327, | |
| "grad_norm": 6.707186222076416, | |
| "learning_rate": 4.468312041150786e-06, | |
| "loss": 0.7670645236968994, | |
| "mean_token_accuracy": 0.8451792266219854, | |
| "num_tokens": 28109861.0, | |
| "step": 2980 | |
| }, | |
| { | |
| "entropy": 1.6193489938974381, | |
| "epoch": 3.493206720233747, | |
| "grad_norm": 10.167534828186035, | |
| "learning_rate": 4.405422064907705e-06, | |
| "loss": 0.7182933807373046, | |
| "mean_token_accuracy": 0.8424388956278562, | |
| "num_tokens": 28174568.0, | |
| "step": 2990 | |
| }, | |
| { | |
| "entropy": 1.5938150033354759, | |
| "epoch": 3.5048940832724615, | |
| "grad_norm": 13.018750190734863, | |
| "learning_rate": 4.342852538117039e-06, | |
| "loss": 0.7092568874359131, | |
| "mean_token_accuracy": 0.79365440197289, | |
| "num_tokens": 28270921.0, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 3.5048940832724615, | |
| "eval_entropy": 1.5361103469040245, | |
| "eval_loss": 0.9802736639976501, | |
| "eval_mean_token_accuracy": 0.7784652556874789, | |
| "eval_num_tokens": 28270921.0, | |
| "eval_runtime": 25.7697, | |
| "eval_samples_per_second": 19.868, | |
| "eval_steps_per_second": 9.934, | |
| "step": 3000 | |
| }, | |
| { | |
| "entropy": 1.5311009913682938, | |
| "epoch": 3.516581446311176, | |
| "grad_norm": 7.245090961456299, | |
| "learning_rate": 4.28060704467212e-06, | |
| "loss": 0.7434425830841065, | |
| "mean_token_accuracy": 0.8339184015989304, | |
| "num_tokens": 28378122.0, | |
| "step": 3010 | |
| }, | |
| { | |
| "entropy": 1.4980362571775914, | |
| "epoch": 3.5282688093498904, | |
| "grad_norm": 17.133398056030273, | |
| "learning_rate": 4.218689149906121e-06, | |
| "loss": 0.8883539199829101, | |
| "mean_token_accuracy": 0.817000538855791, | |
| "num_tokens": 28529232.0, | |
| "step": 3020 | |
| }, | |
| { | |
| "entropy": 1.5714292883872987, | |
| "epoch": 3.539956172388605, | |
| "grad_norm": 19.717315673828125, | |
| "learning_rate": 4.157102400387833e-06, | |
| "loss": 0.7529812812805176, | |
| "mean_token_accuracy": 0.8267618060112, | |
| "num_tokens": 28635466.0, | |
| "step": 3030 | |
| }, | |
| { | |
| "entropy": 1.5960691340267659, | |
| "epoch": 3.5516435354273193, | |
| "grad_norm": 6.638236045837402, | |
| "learning_rate": 4.095850323718506e-06, | |
| "loss": 0.9807650566101074, | |
| "mean_token_accuracy": 0.7975058563053607, | |
| "num_tokens": 28713584.0, | |
| "step": 3040 | |
| }, | |
| { | |
| "entropy": 1.6240007340908051, | |
| "epoch": 3.5633308984660337, | |
| "grad_norm": 15.817234992980957, | |
| "learning_rate": 4.034936428329821e-06, | |
| "loss": 0.7442534923553467, | |
| "mean_token_accuracy": 0.8348729437217116, | |
| "num_tokens": 28786109.0, | |
| "step": 3050 | |
| }, | |
| { | |
| "entropy": 1.619672079384327, | |
| "epoch": 3.575018261504748, | |
| "grad_norm": 15.655887603759766, | |
| "learning_rate": 3.9743642032829025e-06, | |
| "loss": 0.6672632217407226, | |
| "mean_token_accuracy": 0.8341505564749241, | |
| "num_tokens": 28885318.0, | |
| "step": 3060 | |
| }, | |
| { | |
| "entropy": 1.57230226919055, | |
| "epoch": 3.5867056245434625, | |
| "grad_norm": 11.126214981079102, | |
| "learning_rate": 3.9141371180684925e-06, | |
| "loss": 0.7392642974853516, | |
| "mean_token_accuracy": 0.8424083676189185, | |
| "num_tokens": 29001941.0, | |
| "step": 3070 | |
| }, | |
| { | |
| "entropy": 1.6307076066732407, | |
| "epoch": 3.5983929875821765, | |
| "grad_norm": 18.03298568725586, | |
| "learning_rate": 3.854258622408224e-06, | |
| "loss": 0.7791270732879638, | |
| "mean_token_accuracy": 0.8376510888338089, | |
| "num_tokens": 29091052.0, | |
| "step": 3080 | |
| }, | |
| { | |
| "entropy": 1.626028150320053, | |
| "epoch": 3.6100803506208914, | |
| "grad_norm": 10.079829216003418, | |
| "learning_rate": 3.794732146056994e-06, | |
| "loss": 0.8839334487915039, | |
| "mean_token_accuracy": 0.8311299357563258, | |
| "num_tokens": 29176529.0, | |
| "step": 3090 | |
| }, | |
| { | |
| "entropy": 1.5933189503848553, | |
| "epoch": 3.6217677136596054, | |
| "grad_norm": 5.836792469024658, | |
| "learning_rate": 3.7355610986065603e-06, | |
| "loss": 0.8301555633544921, | |
| "mean_token_accuracy": 0.8122006464749575, | |
| "num_tokens": 29273688.0, | |
| "step": 3100 | |
| }, | |
| { | |
| "epoch": 3.6217677136596054, | |
| "eval_entropy": 1.5353019393514842, | |
| "eval_loss": 0.9783096313476562, | |
| "eval_mean_token_accuracy": 0.7775824166019447, | |
| "eval_num_tokens": 29273688.0, | |
| "eval_runtime": 25.7699, | |
| "eval_samples_per_second": 19.868, | |
| "eval_steps_per_second": 9.934, | |
| "step": 3100 | |
| }, | |
| { | |
| "entropy": 1.5506984524428844, | |
| "epoch": 3.63345507669832, | |
| "grad_norm": 13.009007453918457, | |
| "learning_rate": 3.6767488692901986e-06, | |
| "loss": 1.003788948059082, | |
| "mean_token_accuracy": 0.8538006644695997, | |
| "num_tokens": 29369843.0, | |
| "step": 3110 | |
| }, | |
| { | |
| "entropy": 1.6343820162117482, | |
| "epoch": 3.6451424397370342, | |
| "grad_norm": 12.708909034729004, | |
| "learning_rate": 3.6182988267886075e-06, | |
| "loss": 0.8828207015991211, | |
| "mean_token_accuracy": 0.8102234560996294, | |
| "num_tokens": 29472323.0, | |
| "step": 3120 | |
| }, | |
| { | |
| "entropy": 1.6717104703187942, | |
| "epoch": 3.6568298027757487, | |
| "grad_norm": 5.6012372970581055, | |
| "learning_rate": 3.560214319036939e-06, | |
| "loss": 0.9180915832519532, | |
| "mean_token_accuracy": 0.8062344901263714, | |
| "num_tokens": 29553235.0, | |
| "step": 3130 | |
| }, | |
| { | |
| "entropy": 1.6026974506676197, | |
| "epoch": 3.668517165814463, | |
| "grad_norm": 4.241550922393799, | |
| "learning_rate": 3.502498673033026e-06, | |
| "loss": 0.9951177597045898, | |
| "mean_token_accuracy": 0.8040497414767742, | |
| "num_tokens": 29657479.0, | |
| "step": 3140 | |
| }, | |
| { | |
| "entropy": 1.5968347743153573, | |
| "epoch": 3.6802045288531775, | |
| "grad_norm": 2.9298970699310303, | |
| "learning_rate": 3.4451551946468388e-06, | |
| "loss": 0.9118948936462402, | |
| "mean_token_accuracy": 0.8074416333809495, | |
| "num_tokens": 29761255.0, | |
| "step": 3150 | |
| }, | |
| { | |
| "entropy": 1.6103530064225198, | |
| "epoch": 3.691891891891892, | |
| "grad_norm": 9.836130142211914, | |
| "learning_rate": 3.3881871684311072e-06, | |
| "loss": 0.7951117992401123, | |
| "mean_token_accuracy": 0.8442521400749683, | |
| "num_tokens": 29834342.0, | |
| "step": 3160 | |
| }, | |
| { | |
| "entropy": 1.5771130241453648, | |
| "epoch": 3.7035792549306064, | |
| "grad_norm": 18.111557006835938, | |
| "learning_rate": 3.3315978574331965e-06, | |
| "loss": 0.835960865020752, | |
| "mean_token_accuracy": 0.8475918430835009, | |
| "num_tokens": 29913123.0, | |
| "step": 3170 | |
| }, | |
| { | |
| "entropy": 1.5974742673337459, | |
| "epoch": 3.715266617969321, | |
| "grad_norm": 4.7492356300354, | |
| "learning_rate": 3.27539050300821e-06, | |
| "loss": 0.5852916717529297, | |
| "mean_token_accuracy": 0.8310256112366915, | |
| "num_tokens": 30019110.0, | |
| "step": 3180 | |
| }, | |
| { | |
| "entropy": 1.572141046077013, | |
| "epoch": 3.726953981008035, | |
| "grad_norm": 16.682342529296875, | |
| "learning_rate": 3.2195683246333222e-06, | |
| "loss": 0.6440595626831055, | |
| "mean_token_accuracy": 0.8504274129867554, | |
| "num_tokens": 30130813.0, | |
| "step": 3190 | |
| }, | |
| { | |
| "entropy": 1.5826921932399274, | |
| "epoch": 3.7386413440467496, | |
| "grad_norm": 9.478453636169434, | |
| "learning_rate": 3.164134519723363e-06, | |
| "loss": 0.7726956367492676, | |
| "mean_token_accuracy": 0.8257674686610699, | |
| "num_tokens": 30213017.0, | |
| "step": 3200 | |
| }, | |
| { | |
| "epoch": 3.7386413440467496, | |
| "eval_entropy": 1.5459002966526896, | |
| "eval_loss": 0.986714243888855, | |
| "eval_mean_token_accuracy": 0.7754447851912118, | |
| "eval_num_tokens": 30213017.0, | |
| "eval_runtime": 25.7116, | |
| "eval_samples_per_second": 19.913, | |
| "eval_steps_per_second": 9.957, | |
| "step": 3200 | |
| }, | |
| { | |
| "entropy": 1.6052772656083107, | |
| "epoch": 3.7503287070854636, | |
| "grad_norm": 9.236588478088379, | |
| "learning_rate": 3.1090922634476963e-06, | |
| "loss": 0.9195019721984863, | |
| "mean_token_accuracy": 0.8050499334931374, | |
| "num_tokens": 30299301.0, | |
| "step": 3210 | |
| }, | |
| { | |
| "entropy": 1.641640916466713, | |
| "epoch": 3.7620160701241785, | |
| "grad_norm": 4.644353866577148, | |
| "learning_rate": 3.0544447085483254e-06, | |
| "loss": 0.8934274673461914, | |
| "mean_token_accuracy": 0.8232223711907863, | |
| "num_tokens": 30411060.0, | |
| "step": 3220 | |
| }, | |
| { | |
| "entropy": 1.654336377978325, | |
| "epoch": 3.7737034331628925, | |
| "grad_norm": 16.278533935546875, | |
| "learning_rate": 3.0001949851593303e-06, | |
| "loss": 0.5742102146148682, | |
| "mean_token_accuracy": 0.8475374035537243, | |
| "num_tokens": 30516903.0, | |
| "step": 3230 | |
| }, | |
| { | |
| "entropy": 1.616222647577524, | |
| "epoch": 3.785390796201607, | |
| "grad_norm": 8.386667251586914, | |
| "learning_rate": 2.9463462006275713e-06, | |
| "loss": 0.8853543281555176, | |
| "mean_token_accuracy": 0.8166571896523237, | |
| "num_tokens": 30604895.0, | |
| "step": 3240 | |
| }, | |
| { | |
| "entropy": 1.6252083383500575, | |
| "epoch": 3.7970781592403213, | |
| "grad_norm": 8.474164009094238, | |
| "learning_rate": 2.89290143933469e-06, | |
| "loss": 0.8446044921875, | |
| "mean_token_accuracy": 0.8179089311510325, | |
| "num_tokens": 30701843.0, | |
| "step": 3250 | |
| }, | |
| { | |
| "entropy": 1.5914750188589095, | |
| "epoch": 3.8087655222790358, | |
| "grad_norm": 18.274063110351562, | |
| "learning_rate": 2.839863762520465e-06, | |
| "loss": 0.949248218536377, | |
| "mean_token_accuracy": 0.8415104635059834, | |
| "num_tokens": 30818695.0, | |
| "step": 3260 | |
| }, | |
| { | |
| "entropy": 1.5075955897569657, | |
| "epoch": 3.82045288531775, | |
| "grad_norm": 13.18472957611084, | |
| "learning_rate": 2.787236208107447e-06, | |
| "loss": 0.7748193264007568, | |
| "mean_token_accuracy": 0.8260310523211956, | |
| "num_tokens": 30903136.0, | |
| "step": 3270 | |
| }, | |
| { | |
| "entropy": 1.5381855167448522, | |
| "epoch": 3.8321402483564646, | |
| "grad_norm": 9.492990493774414, | |
| "learning_rate": 2.7350217905269647e-06, | |
| "loss": 0.8508004188537598, | |
| "mean_token_accuracy": 0.8153258223086596, | |
| "num_tokens": 30996158.0, | |
| "step": 3280 | |
| }, | |
| { | |
| "entropy": 1.5866551384329797, | |
| "epoch": 3.843827611395179, | |
| "grad_norm": 2.584268093109131, | |
| "learning_rate": 2.6832235005464613e-06, | |
| "loss": 0.9541184425354003, | |
| "mean_token_accuracy": 0.8241108991205692, | |
| "num_tokens": 31110506.0, | |
| "step": 3290 | |
| }, | |
| { | |
| "entropy": 1.5242624171078205, | |
| "epoch": 3.8555149744338935, | |
| "grad_norm": 3.608710765838623, | |
| "learning_rate": 2.6318443050981724e-06, | |
| "loss": 0.7596922397613526, | |
| "mean_token_accuracy": 0.8370095491409302, | |
| "num_tokens": 31189416.0, | |
| "step": 3300 | |
| }, | |
| { | |
| "epoch": 3.8555149744338935, | |
| "eval_entropy": 1.5232528802007437, | |
| "eval_loss": 1.001417636871338, | |
| "eval_mean_token_accuracy": 0.7767663078266196, | |
| "eval_num_tokens": 31189416.0, | |
| "eval_runtime": 25.7771, | |
| "eval_samples_per_second": 19.863, | |
| "eval_steps_per_second": 9.931, | |
| "step": 3300 | |
| }, | |
| { | |
| "entropy": 1.6016543589532375, | |
| "epoch": 3.867202337472608, | |
| "grad_norm": 14.472838401794434, | |
| "learning_rate": 2.58088714710921e-06, | |
| "loss": 0.8808462142944335, | |
| "mean_token_accuracy": 0.8050676196813583, | |
| "num_tokens": 31281413.0, | |
| "step": 3310 | |
| }, | |
| { | |
| "entropy": 1.6534620575606822, | |
| "epoch": 3.878889700511322, | |
| "grad_norm": 9.369660377502441, | |
| "learning_rate": 2.530354945332971e-06, | |
| "loss": 0.9108871459960938, | |
| "mean_token_accuracy": 0.7937086772173643, | |
| "num_tokens": 31358593.0, | |
| "step": 3320 | |
| }, | |
| { | |
| "entropy": 1.5693632565438747, | |
| "epoch": 3.8905770635500367, | |
| "grad_norm": 13.68409538269043, | |
| "learning_rate": 2.4802505941819676e-06, | |
| "loss": 0.830049705505371, | |
| "mean_token_accuracy": 0.8499936047941447, | |
| "num_tokens": 31423709.0, | |
| "step": 3330 | |
| }, | |
| { | |
| "entropy": 1.662206082046032, | |
| "epoch": 3.9022644265887507, | |
| "grad_norm": 12.3108549118042, | |
| "learning_rate": 2.4305769635620437e-06, | |
| "loss": 0.8518457412719727, | |
| "mean_token_accuracy": 0.8457265257835388, | |
| "num_tokens": 31492140.0, | |
| "step": 3340 | |
| }, | |
| { | |
| "entropy": 1.598170468211174, | |
| "epoch": 3.913951789627465, | |
| "grad_norm": 10.65058422088623, | |
| "learning_rate": 2.38133689870798e-06, | |
| "loss": 0.8946051597595215, | |
| "mean_token_accuracy": 0.8331818394362926, | |
| "num_tokens": 31608730.0, | |
| "step": 3350 | |
| }, | |
| { | |
| "entropy": 1.5221158944070339, | |
| "epoch": 3.9256391526661796, | |
| "grad_norm": 14.990571975708008, | |
| "learning_rate": 2.332533220020532e-06, | |
| "loss": 0.740440034866333, | |
| "mean_token_accuracy": 0.8109488438814878, | |
| "num_tokens": 31699928.0, | |
| "step": 3360 | |
| }, | |
| { | |
| "entropy": 1.6108482152223587, | |
| "epoch": 3.937326515704894, | |
| "grad_norm": 8.693507194519043, | |
| "learning_rate": 2.2841687229048725e-06, | |
| "loss": 0.9768977165222168, | |
| "mean_token_accuracy": 0.7872534088790417, | |
| "num_tokens": 31780388.0, | |
| "step": 3370 | |
| }, | |
| { | |
| "entropy": 1.6088899463415145, | |
| "epoch": 3.9490138787436084, | |
| "grad_norm": 8.17825698852539, | |
| "learning_rate": 2.2362461776104782e-06, | |
| "loss": 0.7007026195526123, | |
| "mean_token_accuracy": 0.8478230189532041, | |
| "num_tokens": 31865549.0, | |
| "step": 3380 | |
| }, | |
| { | |
| "entropy": 1.6720139175653457, | |
| "epoch": 3.960701241782323, | |
| "grad_norm": 8.937295913696289, | |
| "learning_rate": 2.1887683290724614e-06, | |
| "loss": 0.9712643623352051, | |
| "mean_token_accuracy": 0.8152873106300831, | |
| "num_tokens": 31982142.0, | |
| "step": 3390 | |
| }, | |
| { | |
| "entropy": 1.5667199984192848, | |
| "epoch": 3.9723886048210373, | |
| "grad_norm": 14.313366889953613, | |
| "learning_rate": 2.14173789675434e-06, | |
| "loss": 0.6438870906829834, | |
| "mean_token_accuracy": 0.8526704031974077, | |
| "num_tokens": 32065588.0, | |
| "step": 3400 | |
| }, | |
| { | |
| "epoch": 3.9723886048210373, | |
| "eval_entropy": 1.5291059061419219, | |
| "eval_loss": 0.9952678084373474, | |
| "eval_mean_token_accuracy": 0.7729721296927892, | |
| "eval_num_tokens": 32065588.0, | |
| "eval_runtime": 25.733, | |
| "eval_samples_per_second": 19.897, | |
| "eval_steps_per_second": 9.948, | |
| "step": 3400 | |
| }, | |
| { | |
| "entropy": 1.6004819676280022, | |
| "epoch": 3.9840759678597517, | |
| "grad_norm": 6.698596477508545, | |
| "learning_rate": 2.095157574492256e-06, | |
| "loss": 0.7810785293579101, | |
| "mean_token_accuracy": 0.8351054944097995, | |
| "num_tokens": 32149132.0, | |
| "step": 3410 | |
| }, | |
| { | |
| "entropy": 1.585545502603054, | |
| "epoch": 3.995763330898466, | |
| "grad_norm": 11.226009368896484, | |
| "learning_rate": 2.0490300303407017e-06, | |
| "loss": 0.7629546165466309, | |
| "mean_token_accuracy": 0.8441075064241886, | |
| "num_tokens": 32236727.0, | |
| "step": 3420 | |
| }, | |
| { | |
| "entropy": 1.6049067532861387, | |
| "epoch": 4.007012417823229, | |
| "grad_norm": 12.657943725585938, | |
| "learning_rate": 2.003357906419675e-06, | |
| "loss": 0.9035828590393067, | |
| "mean_token_accuracy": 0.849897534429253, | |
| "num_tokens": 32332063.0, | |
| "step": 3430 | |
| }, | |
| { | |
| "entropy": 1.6062161587178707, | |
| "epoch": 4.018699780861943, | |
| "grad_norm": 5.047912120819092, | |
| "learning_rate": 1.9581438187633574e-06, | |
| "loss": 0.7564874649047851, | |
| "mean_token_accuracy": 0.8432585556060076, | |
| "num_tokens": 32435755.0, | |
| "step": 3440 | |
| }, | |
| { | |
| "entropy": 1.5072905823588372, | |
| "epoch": 4.030387143900658, | |
| "grad_norm": 9.871566772460938, | |
| "learning_rate": 1.9133903571702683e-06, | |
| "loss": 0.6225325584411621, | |
| "mean_token_accuracy": 0.8637531939893961, | |
| "num_tokens": 32562287.0, | |
| "step": 3450 | |
| }, | |
| { | |
| "entropy": 1.537027009576559, | |
| "epoch": 4.042074506939372, | |
| "grad_norm": 8.626612663269043, | |
| "learning_rate": 1.8691000850549113e-06, | |
| "loss": 0.8337360382080078, | |
| "mean_token_accuracy": 0.8501617223024368, | |
| "num_tokens": 32671873.0, | |
| "step": 3460 | |
| }, | |
| { | |
| "entropy": 1.51291029676795, | |
| "epoch": 4.053761869978087, | |
| "grad_norm": 9.0525541305542, | |
| "learning_rate": 1.8252755393009703e-06, | |
| "loss": 0.7315142631530762, | |
| "mean_token_accuracy": 0.8678522855043411, | |
| "num_tokens": 32758685.0, | |
| "step": 3470 | |
| }, | |
| { | |
| "entropy": 1.4968296751379966, | |
| "epoch": 4.065449233016801, | |
| "grad_norm": 17.39091682434082, | |
| "learning_rate": 1.781919230115976e-06, | |
| "loss": 0.7731627464294434, | |
| "mean_token_accuracy": 0.8328946858644486, | |
| "num_tokens": 32891368.0, | |
| "step": 3480 | |
| }, | |
| { | |
| "entropy": 1.5203113228082656, | |
| "epoch": 4.077136596055515, | |
| "grad_norm": 16.395082473754883, | |
| "learning_rate": 1.739033640887544e-06, | |
| "loss": 0.8280654907226562, | |
| "mean_token_accuracy": 0.85667341388762, | |
| "num_tokens": 32957112.0, | |
| "step": 3490 | |
| }, | |
| { | |
| "entropy": 1.482571394741535, | |
| "epoch": 4.0888239590942295, | |
| "grad_norm": 12.730628967285156, | |
| "learning_rate": 1.6966212280411132e-06, | |
| "loss": 0.631969404220581, | |
| "mean_token_accuracy": 0.8859272848814725, | |
| "num_tokens": 33043416.0, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 4.0888239590942295, | |
| "eval_entropy": 1.4247404006309807, | |
| "eval_loss": 1.082817792892456, | |
| "eval_mean_token_accuracy": 0.7681574639282189, | |
| "eval_num_tokens": 33043416.0, | |
| "eval_runtime": 25.7662, | |
| "eval_samples_per_second": 19.871, | |
| "eval_steps_per_second": 9.935, | |
| "step": 3500 | |
| }, | |
| { | |
| "entropy": 1.4882067143917084, | |
| "epoch": 4.1005113221329434, | |
| "grad_norm": 6.573575019836426, | |
| "learning_rate": 1.6546844208992608e-06, | |
| "loss": 0.5050776481628418, | |
| "mean_token_accuracy": 0.889410063624382, | |
| "num_tokens": 33130484.0, | |
| "step": 3510 | |
| }, | |
| { | |
| "entropy": 1.4168844483792782, | |
| "epoch": 4.112198685171658, | |
| "grad_norm": 6.81123685836792, | |
| "learning_rate": 1.6132256215425468e-06, | |
| "loss": 0.6945844173431397, | |
| "mean_token_accuracy": 0.847281289473176, | |
| "num_tokens": 33248127.0, | |
| "step": 3520 | |
| }, | |
| { | |
| "entropy": 1.4985774755477905, | |
| "epoch": 4.123886048210372, | |
| "grad_norm": 10.758625984191895, | |
| "learning_rate": 1.5722472046719206e-06, | |
| "loss": 0.6711455345153808, | |
| "mean_token_accuracy": 0.8636624123901129, | |
| "num_tokens": 33336070.0, | |
| "step": 3530 | |
| }, | |
| { | |
| "entropy": 1.4610992252826691, | |
| "epoch": 4.135573411249087, | |
| "grad_norm": 15.049446105957031, | |
| "learning_rate": 1.5317515174727072e-06, | |
| "loss": 0.802742862701416, | |
| "mean_token_accuracy": 0.8524734176695347, | |
| "num_tokens": 33453623.0, | |
| "step": 3540 | |
| }, | |
| { | |
| "entropy": 1.5617326445877553, | |
| "epoch": 4.147260774287801, | |
| "grad_norm": 11.841690063476562, | |
| "learning_rate": 1.4917408794801713e-06, | |
| "loss": 1.0538336753845214, | |
| "mean_token_accuracy": 0.855667357891798, | |
| "num_tokens": 33556725.0, | |
| "step": 3550 | |
| }, | |
| { | |
| "entropy": 1.4895190350711345, | |
| "epoch": 4.158948137326516, | |
| "grad_norm": 11.605788230895996, | |
| "learning_rate": 1.4522175824466456e-06, | |
| "loss": 0.410538911819458, | |
| "mean_token_accuracy": 0.8785954911261797, | |
| "num_tokens": 33640487.0, | |
| "step": 3560 | |
| }, | |
| { | |
| "entropy": 1.5349566243588924, | |
| "epoch": 4.17063550036523, | |
| "grad_norm": 9.695292472839355, | |
| "learning_rate": 1.413183890210269e-06, | |
| "loss": 0.7333604335784912, | |
| "mean_token_accuracy": 0.8444879058748483, | |
| "num_tokens": 33728729.0, | |
| "step": 3570 | |
| }, | |
| { | |
| "entropy": 1.5703273810446263, | |
| "epoch": 4.182322863403945, | |
| "grad_norm": 17.130413055419922, | |
| "learning_rate": 1.3746420385653114e-06, | |
| "loss": 0.8191527366638184, | |
| "mean_token_accuracy": 0.8597231294959784, | |
| "num_tokens": 33822770.0, | |
| "step": 3580 | |
| }, | |
| { | |
| "entropy": 1.4822659127414226, | |
| "epoch": 4.194010226442659, | |
| "grad_norm": 11.312241554260254, | |
| "learning_rate": 1.3365942351341154e-06, | |
| "loss": 0.6811165332794189, | |
| "mean_token_accuracy": 0.8470007635653019, | |
| "num_tokens": 33903162.0, | |
| "step": 3590 | |
| }, | |
| { | |
| "entropy": 1.4625447377562524, | |
| "epoch": 4.205697589481373, | |
| "grad_norm": 11.12173080444336, | |
| "learning_rate": 1.299042659240649e-06, | |
| "loss": 0.48247838020324707, | |
| "mean_token_accuracy": 0.8694281630218029, | |
| "num_tokens": 33985395.0, | |
| "step": 3600 | |
| }, | |
| { | |
| "epoch": 4.205697589481373, | |
| "eval_entropy": 1.4456222346052527, | |
| "eval_loss": 1.081959843635559, | |
| "eval_mean_token_accuracy": 0.7688928706920706, | |
| "eval_num_tokens": 33985395.0, | |
| "eval_runtime": 25.7644, | |
| "eval_samples_per_second": 19.872, | |
| "eval_steps_per_second": 9.936, | |
| "step": 3600 | |
| }, | |
| { | |
| "entropy": 1.4896874025464057, | |
| "epoch": 4.217384952520088, | |
| "grad_norm": 9.842438697814941, | |
| "learning_rate": 1.2619894617856742e-06, | |
| "loss": 0.4823128700256348, | |
| "mean_token_accuracy": 0.8850070510059596, | |
| "num_tokens": 34119058.0, | |
| "step": 3610 | |
| }, | |
| { | |
| "entropy": 1.509472121298313, | |
| "epoch": 4.229072315558802, | |
| "grad_norm": 7.054241180419922, | |
| "learning_rate": 1.22543676512354e-06, | |
| "loss": 0.455275821685791, | |
| "mean_token_accuracy": 0.8764534253627062, | |
| "num_tokens": 34204674.0, | |
| "step": 3620 | |
| }, | |
| { | |
| "entropy": 1.4993307389318944, | |
| "epoch": 4.240759678597517, | |
| "grad_norm": 13.102241516113281, | |
| "learning_rate": 1.1893866629406315e-06, | |
| "loss": 0.7743210792541504, | |
| "mean_token_accuracy": 0.8474247772246599, | |
| "num_tokens": 34306251.0, | |
| "step": 3630 | |
| }, | |
| { | |
| "entropy": 1.5021223098039627, | |
| "epoch": 4.2524470416362306, | |
| "grad_norm": 4.396280288696289, | |
| "learning_rate": 1.1538412201354288e-06, | |
| "loss": 0.8427865028381347, | |
| "mean_token_accuracy": 0.8311354946345091, | |
| "num_tokens": 34404230.0, | |
| "step": 3640 | |
| }, | |
| { | |
| "entropy": 1.4618444450199604, | |
| "epoch": 4.264134404674945, | |
| "grad_norm": 7.301538944244385, | |
| "learning_rate": 1.1188024727002534e-06, | |
| "loss": 0.47443537712097167, | |
| "mean_token_accuracy": 0.8778236124664545, | |
| "num_tokens": 34522556.0, | |
| "step": 3650 | |
| }, | |
| { | |
| "entropy": 1.5191793739795685, | |
| "epoch": 4.275821767713659, | |
| "grad_norm": 9.962055206298828, | |
| "learning_rate": 1.0842724276046256e-06, | |
| "loss": 0.7483959674835206, | |
| "mean_token_accuracy": 0.8579721502959728, | |
| "num_tokens": 34609804.0, | |
| "step": 3660 | |
| }, | |
| { | |
| "entropy": 1.5157171241939067, | |
| "epoch": 4.287509130752374, | |
| "grad_norm": 18.916194915771484, | |
| "learning_rate": 1.0502530626803298e-06, | |
| "loss": 0.9998998641967773, | |
| "mean_token_accuracy": 0.8502737872302533, | |
| "num_tokens": 34703516.0, | |
| "step": 3670 | |
| }, | |
| { | |
| "entropy": 1.4906326524913311, | |
| "epoch": 4.299196493791088, | |
| "grad_norm": 12.003247261047363, | |
| "learning_rate": 1.0167463265081167e-06, | |
| "loss": 0.5675338745117188, | |
| "mean_token_accuracy": 0.8700988806784153, | |
| "num_tokens": 34819893.0, | |
| "step": 3680 | |
| }, | |
| { | |
| "entropy": 1.4966869540512562, | |
| "epoch": 4.310883856829803, | |
| "grad_norm": 10.846487045288086, | |
| "learning_rate": 9.837541383060856e-07, | |
| "loss": 0.6726597785949707, | |
| "mean_token_accuracy": 0.8683340221643447, | |
| "num_tokens": 34895479.0, | |
| "step": 3690 | |
| }, | |
| { | |
| "entropy": 1.5521662652492523, | |
| "epoch": 4.322571219868517, | |
| "grad_norm": 3.344892740249634, | |
| "learning_rate": 9.512783878197706e-07, | |
| "loss": 0.9508964538574218, | |
| "mean_token_accuracy": 0.8919697389006614, | |
| "num_tokens": 34984093.0, | |
| "step": 3700 | |
| }, | |
| { | |
| "epoch": 4.322571219868517, | |
| "eval_entropy": 1.4454550298396498, | |
| "eval_loss": 1.091646432876587, | |
| "eval_mean_token_accuracy": 0.7666249158210121, | |
| "eval_num_tokens": 34984093.0, | |
| "eval_runtime": 25.7364, | |
| "eval_samples_per_second": 19.894, | |
| "eval_steps_per_second": 9.947, | |
| "step": 3700 | |
| }, | |
| { | |
| "entropy": 1.5254233829677104, | |
| "epoch": 4.334258582907232, | |
| "grad_norm": 14.212644577026367, | |
| "learning_rate": 9.193209352138821e-07, | |
| "loss": 0.7793136596679687, | |
| "mean_token_accuracy": 0.8753752745687962, | |
| "num_tokens": 35068569.0, | |
| "step": 3710 | |
| }, | |
| { | |
| "entropy": 1.5292565569281578, | |
| "epoch": 4.345945945945946, | |
| "grad_norm": 4.882772445678711, | |
| "learning_rate": 8.878836109657695e-07, | |
| "loss": 0.7594774723052978, | |
| "mean_token_accuracy": 0.862102884426713, | |
| "num_tokens": 35171062.0, | |
| "step": 3720 | |
| }, | |
| { | |
| "entropy": 1.5290693864226341, | |
| "epoch": 4.35763330898466, | |
| "grad_norm": 6.212003231048584, | |
| "learning_rate": 8.56968215760573e-07, | |
| "loss": 0.6331298828125, | |
| "mean_token_accuracy": 0.8548883602023125, | |
| "num_tokens": 35247873.0, | |
| "step": 3730 | |
| }, | |
| { | |
| "entropy": 1.5127065040171146, | |
| "epoch": 4.369320672023375, | |
| "grad_norm": 17.832643508911133, | |
| "learning_rate": 8.265765203880772e-07, | |
| "loss": 0.5699717998504639, | |
| "mean_token_accuracy": 0.8602051839232445, | |
| "num_tokens": 35348167.0, | |
| "step": 3740 | |
| }, | |
| { | |
| "entropy": 1.4995207540690898, | |
| "epoch": 4.381008035062089, | |
| "grad_norm": 5.200070381164551, | |
| "learning_rate": 7.967102656412862e-07, | |
| "loss": 0.8409076690673828, | |
| "mean_token_accuracy": 0.8699726138263941, | |
| "num_tokens": 35462236.0, | |
| "step": 3750 | |
| }, | |
| { | |
| "entropy": 1.5289938576519488, | |
| "epoch": 4.392695398100804, | |
| "grad_norm": 19.55994415283203, | |
| "learning_rate": 7.673711622167157e-07, | |
| "loss": 0.6666640758514404, | |
| "mean_token_accuracy": 0.859628439322114, | |
| "num_tokens": 35550776.0, | |
| "step": 3760 | |
| }, | |
| { | |
| "entropy": 1.5315737001597882, | |
| "epoch": 4.404382761139518, | |
| "grad_norm": 12.47616195678711, | |
| "learning_rate": 7.385608906164077e-07, | |
| "loss": 0.6564251899719238, | |
| "mean_token_accuracy": 0.8807011146098376, | |
| "num_tokens": 35638550.0, | |
| "step": 3770 | |
| }, | |
| { | |
| "entropy": 1.476715262979269, | |
| "epoch": 4.4160701241782325, | |
| "grad_norm": 7.14960241317749, | |
| "learning_rate": 7.102811010516664e-07, | |
| "loss": 0.757103967666626, | |
| "mean_token_accuracy": 0.8514522429555654, | |
| "num_tokens": 35754784.0, | |
| "step": 3780 | |
| }, | |
| { | |
| "entropy": 1.4561194486916065, | |
| "epoch": 4.4277574872169465, | |
| "grad_norm": 11.394071578979492, | |
| "learning_rate": 6.825334133485418e-07, | |
| "loss": 0.6637251853942872, | |
| "mean_token_accuracy": 0.8669286124408245, | |
| "num_tokens": 35867378.0, | |
| "step": 3790 | |
| }, | |
| { | |
| "entropy": 1.4877830192446708, | |
| "epoch": 4.439444850255661, | |
| "grad_norm": 15.398336410522461, | |
| "learning_rate": 6.553194168550459e-07, | |
| "loss": 0.690100908279419, | |
| "mean_token_accuracy": 0.8517809867858886, | |
| "num_tokens": 35952362.0, | |
| "step": 3800 | |
| }, | |
| { | |
| "epoch": 4.439444850255661, | |
| "eval_entropy": 1.4464607145637274, | |
| "eval_loss": 1.0888185501098633, | |
| "eval_mean_token_accuracy": 0.769485326425638, | |
| "eval_num_tokens": 35952362.0, | |
| "eval_runtime": 25.7253, | |
| "eval_samples_per_second": 19.903, | |
| "eval_steps_per_second": 9.951, | |
| "step": 3800 | |
| }, | |
| { | |
| "entropy": 1.5209308765828609, | |
| "epoch": 4.451132213294375, | |
| "grad_norm": 8.16495418548584, | |
| "learning_rate": 6.286406703501246e-07, | |
| "loss": 0.7843871593475342, | |
| "mean_token_accuracy": 0.8423004079610109, | |
| "num_tokens": 36016101.0, | |
| "step": 3810 | |
| }, | |
| { | |
| "entropy": 1.5262306325137616, | |
| "epoch": 4.46281957633309, | |
| "grad_norm": 18.60768699645996, | |
| "learning_rate": 6.024987019543593e-07, | |
| "loss": 0.8075613975524902, | |
| "mean_token_accuracy": 0.8136255025863648, | |
| "num_tokens": 36106339.0, | |
| "step": 3820 | |
| }, | |
| { | |
| "entropy": 1.5524603478610515, | |
| "epoch": 4.474506939371804, | |
| "grad_norm": 13.132192611694336, | |
| "learning_rate": 5.768950090424518e-07, | |
| "loss": 0.8062433242797852, | |
| "mean_token_accuracy": 0.8343270730227232, | |
| "num_tokens": 36203691.0, | |
| "step": 3830 | |
| }, | |
| { | |
| "entropy": 1.474081838876009, | |
| "epoch": 4.486194302410519, | |
| "grad_norm": 14.549166679382324, | |
| "learning_rate": 5.518310581574515e-07, | |
| "loss": 0.5784972667694092, | |
| "mean_token_accuracy": 0.8847128123044967, | |
| "num_tokens": 36274772.0, | |
| "step": 3840 | |
| }, | |
| { | |
| "entropy": 1.5090869426727296, | |
| "epoch": 4.497881665449233, | |
| "grad_norm": 11.738391876220703, | |
| "learning_rate": 5.273082849267474e-07, | |
| "loss": 0.9710038185119629, | |
| "mean_token_accuracy": 0.8665750682353973, | |
| "num_tokens": 36364248.0, | |
| "step": 3850 | |
| }, | |
| { | |
| "entropy": 1.575214620679617, | |
| "epoch": 4.509569028487947, | |
| "grad_norm": 12.552297592163086, | |
| "learning_rate": 5.033280939798502e-07, | |
| "loss": 0.6691967487335205, | |
| "mean_token_accuracy": 0.8502339717000723, | |
| "num_tokens": 36454192.0, | |
| "step": 3860 | |
| }, | |
| { | |
| "entropy": 1.540502169728279, | |
| "epoch": 4.521256391526662, | |
| "grad_norm": 10.250284194946289, | |
| "learning_rate": 4.798918588679269e-07, | |
| "loss": 0.7413430213928223, | |
| "mean_token_accuracy": 0.8937609244138003, | |
| "num_tokens": 36545450.0, | |
| "step": 3870 | |
| }, | |
| { | |
| "entropy": 1.4876162141561509, | |
| "epoch": 4.532943754565376, | |
| "grad_norm": 5.206379413604736, | |
| "learning_rate": 4.570009219851312e-07, | |
| "loss": 0.7229172229766846, | |
| "mean_token_accuracy": 0.8560761611908674, | |
| "num_tokens": 36647090.0, | |
| "step": 3880 | |
| }, | |
| { | |
| "entropy": 1.505126003175974, | |
| "epoch": 4.544631117604091, | |
| "grad_norm": 10.110809326171875, | |
| "learning_rate": 4.346565944917114e-07, | |
| "loss": 0.7667391777038575, | |
| "mean_token_accuracy": 0.8541755691170693, | |
| "num_tokens": 36758188.0, | |
| "step": 3890 | |
| }, | |
| { | |
| "entropy": 1.4865600690245628, | |
| "epoch": 4.556318480642805, | |
| "grad_norm": 4.7262043952941895, | |
| "learning_rate": 4.1286015623890674e-07, | |
| "loss": 0.5576696872711182, | |
| "mean_token_accuracy": 0.8558296959847211, | |
| "num_tokens": 36850488.0, | |
| "step": 3900 | |
| }, | |
| { | |
| "epoch": 4.556318480642805, | |
| "eval_entropy": 1.4396855637896806, | |
| "eval_loss": 1.0947682857513428, | |
| "eval_mean_token_accuracy": 0.7694231180357747, | |
| "eval_num_tokens": 36850488.0, | |
| "eval_runtime": 25.6913, | |
| "eval_samples_per_second": 19.929, | |
| "eval_steps_per_second": 9.964, | |
| "step": 3900 | |
| }, | |
| { | |
| "entropy": 1.4926868014037609, | |
| "epoch": 4.56800584368152, | |
| "grad_norm": 8.493346214294434, | |
| "learning_rate": 3.9161285569564114e-07, | |
| "loss": 0.4650919437408447, | |
| "mean_token_accuracy": 0.8972312148660422, | |
| "num_tokens": 36923777.0, | |
| "step": 3910 | |
| }, | |
| { | |
| "entropy": 1.522305753827095, | |
| "epoch": 4.579693206720234, | |
| "grad_norm": 16.466768264770508, | |
| "learning_rate": 3.709159098770165e-07, | |
| "loss": 0.7419657230377197, | |
| "mean_token_accuracy": 0.8645104166120291, | |
| "num_tokens": 37010882.0, | |
| "step": 3920 | |
| }, | |
| { | |
| "entropy": 1.5289164453744888, | |
| "epoch": 4.5913805697589485, | |
| "grad_norm": 5.047861099243164, | |
| "learning_rate": 3.507705042745979e-07, | |
| "loss": 0.7584509372711181, | |
| "mean_token_accuracy": 0.857337387278676, | |
| "num_tokens": 37082099.0, | |
| "step": 3930 | |
| }, | |
| { | |
| "entropy": 1.4429242953658103, | |
| "epoch": 4.6030679327976625, | |
| "grad_norm": 8.835667610168457, | |
| "learning_rate": 3.3117779278851294e-07, | |
| "loss": 0.4135472297668457, | |
| "mean_token_accuracy": 0.8845292035490274, | |
| "num_tokens": 37179248.0, | |
| "step": 3940 | |
| }, | |
| { | |
| "entropy": 1.5127482995390893, | |
| "epoch": 4.6147552958363764, | |
| "grad_norm": 8.691869735717773, | |
| "learning_rate": 3.121388976613582e-07, | |
| "loss": 0.5384024143218994, | |
| "mean_token_accuracy": 0.8384344112128019, | |
| "num_tokens": 37287234.0, | |
| "step": 3950 | |
| }, | |
| { | |
| "entropy": 1.4824551120400429, | |
| "epoch": 4.626442658875091, | |
| "grad_norm": 10.049670219421387, | |
| "learning_rate": 2.9365490941391626e-07, | |
| "loss": 0.754266881942749, | |
| "mean_token_accuracy": 0.8504394836723804, | |
| "num_tokens": 37395872.0, | |
| "step": 3960 | |
| }, | |
| { | |
| "entropy": 1.452832967787981, | |
| "epoch": 4.638130021913806, | |
| "grad_norm": 4.427601337432861, | |
| "learning_rate": 2.7572688678269897e-07, | |
| "loss": 0.5318255424499512, | |
| "mean_token_accuracy": 0.8919252689927817, | |
| "num_tokens": 37476568.0, | |
| "step": 3970 | |
| }, | |
| { | |
| "entropy": 1.5254285097122193, | |
| "epoch": 4.64981738495252, | |
| "grad_norm": 7.1622490882873535, | |
| "learning_rate": 2.5835585665929365e-07, | |
| "loss": 0.848170280456543, | |
| "mean_token_accuracy": 0.8709424588829279, | |
| "num_tokens": 37576587.0, | |
| "step": 3980 | |
| }, | |
| { | |
| "entropy": 1.561382431536913, | |
| "epoch": 4.661504747991234, | |
| "grad_norm": 6.549232482910156, | |
| "learning_rate": 2.415428140315579e-07, | |
| "loss": 0.6186144351959229, | |
| "mean_token_accuracy": 0.8826206211000681, | |
| "num_tokens": 37676313.0, | |
| "step": 3990 | |
| }, | |
| { | |
| "entropy": 1.4810091137886048, | |
| "epoch": 4.673192111029949, | |
| "grad_norm": 20.657800674438477, | |
| "learning_rate": 2.2528872192661312e-07, | |
| "loss": 0.5842293262481689, | |
| "mean_token_accuracy": 0.8619752835482359, | |
| "num_tokens": 37750057.0, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 4.673192111029949, | |
| "eval_entropy": 1.4375433966051787, | |
| "eval_loss": 1.097025990486145, | |
| "eval_mean_token_accuracy": 0.7680731810978614, | |
| "eval_num_tokens": 37750057.0, | |
| "eval_runtime": 25.7161, | |
| "eval_samples_per_second": 19.91, | |
| "eval_steps_per_second": 9.955, | |
| "step": 4000 | |
| }, | |
| { | |
| "entropy": 1.5436802476644516, | |
| "epoch": 4.684879474068663, | |
| "grad_norm": 6.413429260253906, | |
| "learning_rate": 2.095945113556963e-07, | |
| "loss": 0.7302318572998047, | |
| "mean_token_accuracy": 0.8568271558731795, | |
| "num_tokens": 37856446.0, | |
| "step": 4010 | |
| }, | |
| { | |
| "entropy": 1.4901932425796987, | |
| "epoch": 4.696566837107378, | |
| "grad_norm": 19.987340927124023, | |
| "learning_rate": 1.9446108126082607e-07, | |
| "loss": 0.6349533081054688, | |
| "mean_token_accuracy": 0.8936959408223629, | |
| "num_tokens": 37930806.0, | |
| "step": 4020 | |
| }, | |
| { | |
| "entropy": 1.4795681625604629, | |
| "epoch": 4.708254200146092, | |
| "grad_norm": 11.290853500366211, | |
| "learning_rate": 1.798892984633138e-07, | |
| "loss": 0.7728898525238037, | |
| "mean_token_accuracy": 0.8658060751855373, | |
| "num_tokens": 38020835.0, | |
| "step": 4030 | |
| }, | |
| { | |
| "entropy": 1.5635792575776577, | |
| "epoch": 4.719941563184807, | |
| "grad_norm": 10.672747611999512, | |
| "learning_rate": 1.6587999761411455e-07, | |
| "loss": 0.5687346458435059, | |
| "mean_token_accuracy": 0.8528085239231586, | |
| "num_tokens": 38104374.0, | |
| "step": 4040 | |
| }, | |
| { | |
| "entropy": 1.4602154590189458, | |
| "epoch": 4.731628926223521, | |
| "grad_norm": 23.16471290588379, | |
| "learning_rate": 1.5243398114602182e-07, | |
| "loss": 0.5822049140930176, | |
| "mean_token_accuracy": 0.8367134757339955, | |
| "num_tokens": 38222689.0, | |
| "step": 4050 | |
| }, | |
| { | |
| "entropy": 1.5052896670997142, | |
| "epoch": 4.743316289262236, | |
| "grad_norm": 16.241004943847656, | |
| "learning_rate": 1.395520192276967e-07, | |
| "loss": 0.8418606758117676, | |
| "mean_token_accuracy": 0.8202387966215611, | |
| "num_tokens": 38316782.0, | |
| "step": 4060 | |
| }, | |
| { | |
| "entropy": 1.531810101866722, | |
| "epoch": 4.75500365230095, | |
| "grad_norm": 7.349140644073486, | |
| "learning_rate": 1.2723484971956412e-07, | |
| "loss": 0.755488920211792, | |
| "mean_token_accuracy": 0.8450414523482322, | |
| "num_tokens": 38423124.0, | |
| "step": 4070 | |
| }, | |
| { | |
| "entropy": 1.584228988736868, | |
| "epoch": 4.7666910153396636, | |
| "grad_norm": 9.823003768920898, | |
| "learning_rate": 1.154831781315413e-07, | |
| "loss": 0.968692684173584, | |
| "mean_token_accuracy": 0.8501280307769775, | |
| "num_tokens": 38521407.0, | |
| "step": 4080 | |
| }, | |
| { | |
| "entropy": 1.5390350714325904, | |
| "epoch": 4.778378378378378, | |
| "grad_norm": 18.232288360595703, | |
| "learning_rate": 1.042976775826332e-07, | |
| "loss": 0.61814284324646, | |
| "mean_token_accuracy": 0.872353944554925, | |
| "num_tokens": 38624893.0, | |
| "step": 4090 | |
| }, | |
| { | |
| "entropy": 1.4646945357322694, | |
| "epoch": 4.790065741417092, | |
| "grad_norm": 15.621621131896973, | |
| "learning_rate": 9.367898876237347e-08, | |
| "loss": 0.6843422889709473, | |
| "mean_token_accuracy": 0.8493800751864911, | |
| "num_tokens": 38706684.0, | |
| "step": 4100 | |
| }, | |
| { | |
| "epoch": 4.790065741417092, | |
| "eval_entropy": 1.4424911779351532, | |
| "eval_loss": 1.0918210744857788, | |
| "eval_mean_token_accuracy": 0.7697787257493474, | |
| "eval_num_tokens": 38706684.0, | |
| "eval_runtime": 25.6921, | |
| "eval_samples_per_second": 19.928, | |
| "eval_steps_per_second": 9.964, | |
| "step": 4100 | |
| }, | |
| { | |
| "entropy": 1.4517256565392018, | |
| "epoch": 4.801753104455807, | |
| "grad_norm": 7.361289978027344, | |
| "learning_rate": 8.362771989412488e-08, | |
| "loss": 0.7133095264434814, | |
| "mean_token_accuracy": 0.8632656030356884, | |
| "num_tokens": 38787460.0, | |
| "step": 4110 | |
| }, | |
| { | |
| "entropy": 1.5199289210140705, | |
| "epoch": 4.813440467494521, | |
| "grad_norm": 3.967174768447876, | |
| "learning_rate": 7.414444670024834e-08, | |
| "loss": 0.9737075805664063, | |
| "mean_token_accuracy": 0.8513060834258794, | |
| "num_tokens": 38894866.0, | |
| "step": 4120 | |
| }, | |
| { | |
| "entropy": 1.5039781682193278, | |
| "epoch": 4.825127830533236, | |
| "grad_norm": 9.782380104064941, | |
| "learning_rate": 6.522971236911923e-08, | |
| "loss": 0.6163204193115235, | |
| "mean_token_accuracy": 0.8985051784664393, | |
| "num_tokens": 38997595.0, | |
| "step": 4130 | |
| }, | |
| { | |
| "entropy": 1.5199985206127167, | |
| "epoch": 4.83681519357195, | |
| "grad_norm": 3.506466865539551, | |
| "learning_rate": 5.688402752401567e-08, | |
| "loss": 0.9050114631652832, | |
| "mean_token_accuracy": 0.8055482944473624, | |
| "num_tokens": 39087395.0, | |
| "step": 4140 | |
| }, | |
| { | |
| "entropy": 1.4977469891309738, | |
| "epoch": 4.848502556610665, | |
| "grad_norm": 6.047015190124512, | |
| "learning_rate": 4.91078701938763e-08, | |
| "loss": 0.5338590145111084, | |
| "mean_token_accuracy": 0.8793411515653133, | |
| "num_tokens": 39189114.0, | |
| "step": 4150 | |
| }, | |
| { | |
| "entropy": 1.5504455424845218, | |
| "epoch": 4.860189919649379, | |
| "grad_norm": 16.04572105407715, | |
| "learning_rate": 4.190168578591114e-08, | |
| "loss": 0.8087006568908691, | |
| "mean_token_accuracy": 0.8372783213853836, | |
| "num_tokens": 39287245.0, | |
| "step": 4160 | |
| }, | |
| { | |
| "entropy": 1.4528725862503051, | |
| "epoch": 4.871877282688094, | |
| "grad_norm": 16.02657127380371, | |
| "learning_rate": 3.526588706009637e-08, | |
| "loss": 0.514737892150879, | |
| "mean_token_accuracy": 0.8511596038937569, | |
| "num_tokens": 39354897.0, | |
| "step": 4170 | |
| }, | |
| { | |
| "entropy": 1.4478582091629506, | |
| "epoch": 4.883564645726808, | |
| "grad_norm": 7.557652950286865, | |
| "learning_rate": 2.9200854105526645e-08, | |
| "loss": 0.6200026512145996, | |
| "mean_token_accuracy": 0.865429537370801, | |
| "num_tokens": 39418694.0, | |
| "step": 4180 | |
| }, | |
| { | |
| "entropy": 1.4812394805252551, | |
| "epoch": 4.895252008765523, | |
| "grad_norm": 4.643852710723877, | |
| "learning_rate": 2.37069343186469e-08, | |
| "loss": 0.8050068855285645, | |
| "mean_token_accuracy": 0.8574969913810492, | |
| "num_tokens": 39504790.0, | |
| "step": 4190 | |
| }, | |
| { | |
| "entropy": 1.4632190234959126, | |
| "epoch": 4.906939371804237, | |
| "grad_norm": 17.43656349182129, | |
| "learning_rate": 1.8784442383354972e-08, | |
| "loss": 0.579356050491333, | |
| "mean_token_accuracy": 0.8364833440631628, | |
| "num_tokens": 39588583.0, | |
| "step": 4200 | |
| }, | |
| { | |
| "epoch": 4.906939371804237, | |
| "eval_entropy": 1.4423961690627038, | |
| "eval_loss": 1.094377040863037, | |
| "eval_mean_token_accuracy": 0.7712554379249923, | |
| "eval_num_tokens": 39588583.0, | |
| "eval_runtime": 25.7381, | |
| "eval_samples_per_second": 19.893, | |
| "eval_steps_per_second": 9.946, | |
| "step": 4200 | |
| }, | |
| { | |
| "entropy": 1.4858237937092782, | |
| "epoch": 4.918626734842951, | |
| "grad_norm": 12.429141998291016, | |
| "learning_rate": 1.443366025297599e-08, | |
| "loss": 0.5480079650878906, | |
| "mean_token_accuracy": 0.8573607705533505, | |
| "num_tokens": 39691380.0, | |
| "step": 4210 | |
| }, | |
| { | |
| "entropy": 1.5240480951964854, | |
| "epoch": 4.9303140978816655, | |
| "grad_norm": 6.490242958068848, | |
| "learning_rate": 1.0654837134109752e-08, | |
| "loss": 0.557542085647583, | |
| "mean_token_accuracy": 0.8416418630629778, | |
| "num_tokens": 39792494.0, | |
| "step": 4220 | |
| }, | |
| { | |
| "entropy": 1.5179505512118339, | |
| "epoch": 4.9420014609203795, | |
| "grad_norm": 13.937246322631836, | |
| "learning_rate": 7.4481894723599236e-09, | |
| "loss": 0.6862639427185059, | |
| "mean_token_accuracy": 0.8709760889410972, | |
| "num_tokens": 39875847.0, | |
| "step": 4230 | |
| }, | |
| { | |
| "entropy": 1.5092324443161487, | |
| "epoch": 4.953688823959094, | |
| "grad_norm": 11.903735160827637, | |
| "learning_rate": 4.813900939936167e-09, | |
| "loss": 0.48588266372680666, | |
| "mean_token_accuracy": 0.8748119071125984, | |
| "num_tokens": 39982678.0, | |
| "step": 4240 | |
| }, | |
| { | |
| "entropy": 1.4981704361736774, | |
| "epoch": 4.965376186997808, | |
| "grad_norm": 9.157793045043945, | |
| "learning_rate": 2.7521224251303436e-09, | |
| "loss": 0.5891988754272461, | |
| "mean_token_accuracy": 0.8549117844551801, | |
| "num_tokens": 40075794.0, | |
| "step": 4250 | |
| }, | |
| { | |
| "entropy": 1.5046925134956837, | |
| "epoch": 4.977063550036523, | |
| "grad_norm": 4.12293815612793, | |
| "learning_rate": 1.2629720236800868e-09, | |
| "loss": 0.6233686447143555, | |
| "mean_token_accuracy": 0.8813595429062844, | |
| "num_tokens": 40165956.0, | |
| "step": 4260 | |
| }, | |
| { | |
| "entropy": 1.5573359951376915, | |
| "epoch": 4.988750913075237, | |
| "grad_norm": 12.11980152130127, | |
| "learning_rate": 3.4653503199866266e-10, | |
| "loss": 0.7357488155364991, | |
| "mean_token_accuracy": 0.8814769674092531, | |
| "num_tokens": 40246684.0, | |
| "step": 4270 | |
| }, | |
| { | |
| "entropy": 1.5398043293457526, | |
| "epoch": 5.0, | |
| "grad_norm": 5.443117618560791, | |
| "learning_rate": 2.8639422888776525e-12, | |
| "loss": 0.952604866027832, | |
| "mean_token_accuracy": 0.8546050163832578, | |
| "num_tokens": 40341950.0, | |
| "step": 4280 | |
| }, | |
| { | |
| "epoch": 5.0, | |
| "eval_entropy": 1.4426328076515347, | |
| "eval_loss": 1.0950794219970703, | |
| "eval_mean_token_accuracy": 0.7698450249736197, | |
| "eval_num_tokens": 40341950.0, | |
| "eval_runtime": 25.6899, | |
| "eval_samples_per_second": 19.93, | |
| "eval_steps_per_second": 9.965, | |
| "step": 4280 | |
| }, | |
| { | |
| "epoch": 5.0, | |
| "step": 4280, | |
| "total_flos": 1.8234326345207808e+18, | |
| "train_loss": 1.0279761601274258, | |
| "train_runtime": 15113.9351, | |
| "train_samples_per_second": 2.264, | |
| "train_steps_per_second": 0.283 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 4280, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 5, | |
| "save_steps": 100, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.8234326345207808e+18, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |