Instructions to use Jongbin-kr/llama-3.1-8b-instruct_lbox-statutory-element-matcher_fallback_ffn-only with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use Jongbin-kr/llama-3.1-8b-instruct_lbox-statutory-element-matcher_fallback_ffn-only with Transformers:
# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("Jongbin-kr/llama-3.1-8b-instruct_lbox-statutory-element-matcher_fallback_ffn-only", device_map="auto") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": 2000, | |
| "best_metric": 0.44610196352005005, | |
| "best_model_checkpoint": "/data6/jongbinwon/evolving_MoE/checkpoints/sft_llama31_8b_lbox_statutory-element-matcher_fallback_ffn_only_5ep_eval500/checkpoint-2000", | |
| "epoch": 5.0, | |
| "eval_steps": 500, | |
| "global_step": 6480, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 2.256485325098038, | |
| "epoch": 0.007720517274657402, | |
| "grad_norm": 7.307734489440918, | |
| "learning_rate": 9.230769230769232e-07, | |
| "loss": 2.06158504486084, | |
| "mean_token_accuracy": 0.6090951159596443, | |
| "num_tokens": 32810.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 2.284497153759003, | |
| "epoch": 0.015441034549314805, | |
| "grad_norm": 8.211675643920898, | |
| "learning_rate": 1.948717948717949e-06, | |
| "loss": 1.9772743225097655, | |
| "mean_token_accuracy": 0.6226175807416439, | |
| "num_tokens": 67674.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 2.2925585120916367, | |
| "epoch": 0.023161551823972205, | |
| "grad_norm": 14.34852123260498, | |
| "learning_rate": 2.9743589743589746e-06, | |
| "loss": 1.8409126281738282, | |
| "mean_token_accuracy": 0.6243047766387463, | |
| "num_tokens": 105820.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 2.257777214050293, | |
| "epoch": 0.03088206909862961, | |
| "grad_norm": 9.495259284973145, | |
| "learning_rate": 4.000000000000001e-06, | |
| "loss": 1.7386272430419922, | |
| "mean_token_accuracy": 0.6371752314269543, | |
| "num_tokens": 142765.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 2.2558146893978117, | |
| "epoch": 0.038602586373287014, | |
| "grad_norm": 4.8525285720825195, | |
| "learning_rate": 5.025641025641026e-06, | |
| "loss": 1.5439723968505858, | |
| "mean_token_accuracy": 0.6804775930941105, | |
| "num_tokens": 179804.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 2.3024860441684725, | |
| "epoch": 0.04632310364794441, | |
| "grad_norm": 4.64549446105957, | |
| "learning_rate": 6.051282051282051e-06, | |
| "loss": 1.251286220550537, | |
| "mean_token_accuracy": 0.7414289742708207, | |
| "num_tokens": 212054.0, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 2.3543750554323197, | |
| "epoch": 0.054043620922601815, | |
| "grad_norm": 3.5757696628570557, | |
| "learning_rate": 7.076923076923078e-06, | |
| "loss": 0.9379256248474122, | |
| "mean_token_accuracy": 0.7693132214248181, | |
| "num_tokens": 245935.0, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 2.3174787133932115, | |
| "epoch": 0.06176413819725922, | |
| "grad_norm": 4.677041530609131, | |
| "learning_rate": 8.102564102564103e-06, | |
| "loss": 1.0049633979797363, | |
| "mean_token_accuracy": 0.770514677464962, | |
| "num_tokens": 283556.0, | |
| "step": 80 | |
| }, | |
| { | |
| "entropy": 2.358958587050438, | |
| "epoch": 0.06948465547191662, | |
| "grad_norm": 3.2004008293151855, | |
| "learning_rate": 9.128205128205129e-06, | |
| "loss": 0.966558837890625, | |
| "mean_token_accuracy": 0.7766762919723987, | |
| "num_tokens": 319043.0, | |
| "step": 90 | |
| }, | |
| { | |
| "entropy": 2.3884228974580766, | |
| "epoch": 0.07720517274657403, | |
| "grad_norm": 4.562836647033691, | |
| "learning_rate": 1.0153846153846154e-05, | |
| "loss": 0.8094841003417969, | |
| "mean_token_accuracy": 0.8071015253663063, | |
| "num_tokens": 352565.0, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 2.367259520292282, | |
| "epoch": 0.08492569002123142, | |
| "grad_norm": 4.451163291931152, | |
| "learning_rate": 1.117948717948718e-05, | |
| "loss": 0.6964176177978516, | |
| "mean_token_accuracy": 0.829041276872158, | |
| "num_tokens": 385068.0, | |
| "step": 110 | |
| }, | |
| { | |
| "entropy": 2.348944702744484, | |
| "epoch": 0.09264620729588882, | |
| "grad_norm": 3.5486667156219482, | |
| "learning_rate": 1.2205128205128208e-05, | |
| "loss": 0.5524073600769043, | |
| "mean_token_accuracy": 0.8610983595252037, | |
| "num_tokens": 417434.0, | |
| "step": 120 | |
| }, | |
| { | |
| "entropy": 2.362921339273453, | |
| "epoch": 0.10036672457054623, | |
| "grad_norm": 3.7314867973327637, | |
| "learning_rate": 1.3230769230769231e-05, | |
| "loss": 0.524355697631836, | |
| "mean_token_accuracy": 0.862143586575985, | |
| "num_tokens": 451513.0, | |
| "step": 130 | |
| }, | |
| { | |
| "entropy": 2.3315255403518678, | |
| "epoch": 0.10808724184520363, | |
| "grad_norm": 3.9957523345947266, | |
| "learning_rate": 1.4256410256410258e-05, | |
| "loss": 0.5264537334442139, | |
| "mean_token_accuracy": 0.8657179176807404, | |
| "num_tokens": 488960.0, | |
| "step": 140 | |
| }, | |
| { | |
| "entropy": 2.272639125585556, | |
| "epoch": 0.11580775911986103, | |
| "grad_norm": 6.005861759185791, | |
| "learning_rate": 1.5282051282051282e-05, | |
| "loss": 0.5440045833587647, | |
| "mean_token_accuracy": 0.846938057243824, | |
| "num_tokens": 522139.0, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 2.355533537268639, | |
| "epoch": 0.12352827639451844, | |
| "grad_norm": 6.817739009857178, | |
| "learning_rate": 1.630769230769231e-05, | |
| "loss": 0.39336931705474854, | |
| "mean_token_accuracy": 0.9171057492494583, | |
| "num_tokens": 554659.0, | |
| "step": 160 | |
| }, | |
| { | |
| "entropy": 2.1675438672304153, | |
| "epoch": 0.13124879366917583, | |
| "grad_norm": 4.914283275604248, | |
| "learning_rate": 1.7333333333333336e-05, | |
| "loss": 0.49741554260253906, | |
| "mean_token_accuracy": 0.8793981537222862, | |
| "num_tokens": 595435.0, | |
| "step": 170 | |
| }, | |
| { | |
| "entropy": 2.2984329521656037, | |
| "epoch": 0.13896931094383325, | |
| "grad_norm": 6.025143623352051, | |
| "learning_rate": 1.835897435897436e-05, | |
| "loss": 0.3462223529815674, | |
| "mean_token_accuracy": 0.8944209352135658, | |
| "num_tokens": 628526.0, | |
| "step": 180 | |
| }, | |
| { | |
| "entropy": 2.3169893980026246, | |
| "epoch": 0.14668982821849064, | |
| "grad_norm": 5.91893196105957, | |
| "learning_rate": 1.9384615384615386e-05, | |
| "loss": 0.31524474620819093, | |
| "mean_token_accuracy": 0.9156093567609787, | |
| "num_tokens": 665610.0, | |
| "step": 190 | |
| }, | |
| { | |
| "entropy": 2.301328441500664, | |
| "epoch": 0.15441034549314805, | |
| "grad_norm": 3.231717109680176, | |
| "learning_rate": 1.9999980011554353e-05, | |
| "loss": 0.32752580642700196, | |
| "mean_token_accuracy": 0.910846720635891, | |
| "num_tokens": 706015.0, | |
| "step": 200 | |
| }, | |
| { | |
| "entropy": 2.273413100838661, | |
| "epoch": 0.16213086276780544, | |
| "grad_norm": 3.171372652053833, | |
| "learning_rate": 1.9999755142458468e-05, | |
| "loss": 0.37491621971130373, | |
| "mean_token_accuracy": 0.9038208425045013, | |
| "num_tokens": 742435.0, | |
| "step": 210 | |
| }, | |
| { | |
| "entropy": 2.2427696734666824, | |
| "epoch": 0.16985138004246284, | |
| "grad_norm": 6.08746337890625, | |
| "learning_rate": 1.9999280424346836e-05, | |
| "loss": 0.2458643436431885, | |
| "mean_token_accuracy": 0.9297083392739296, | |
| "num_tokens": 774452.0, | |
| "step": 220 | |
| }, | |
| { | |
| "entropy": 2.315064123272896, | |
| "epoch": 0.17757189731712025, | |
| "grad_norm": 6.792384147644043, | |
| "learning_rate": 1.9998555869080533e-05, | |
| "loss": 0.3388651132583618, | |
| "mean_token_accuracy": 0.9051751494407654, | |
| "num_tokens": 804925.0, | |
| "step": 230 | |
| }, | |
| { | |
| "entropy": 2.299090850353241, | |
| "epoch": 0.18529241459177764, | |
| "grad_norm": 6.4787468910217285, | |
| "learning_rate": 1.999758149476294e-05, | |
| "loss": 0.339692497253418, | |
| "mean_token_accuracy": 0.9080843642354012, | |
| "num_tokens": 845968.0, | |
| "step": 240 | |
| }, | |
| { | |
| "entropy": 2.280930459499359, | |
| "epoch": 0.19301293186643506, | |
| "grad_norm": 5.793071746826172, | |
| "learning_rate": 1.9996357325739306e-05, | |
| "loss": 0.27950329780578614, | |
| "mean_token_accuracy": 0.9254253804683685, | |
| "num_tokens": 879844.0, | |
| "step": 250 | |
| }, | |
| { | |
| "entropy": 2.2729754209518434, | |
| "epoch": 0.20073344914109245, | |
| "grad_norm": 7.555527687072754, | |
| "learning_rate": 1.999488339259612e-05, | |
| "loss": 0.30706956386566164, | |
| "mean_token_accuracy": 0.9272728309035301, | |
| "num_tokens": 913158.0, | |
| "step": 260 | |
| }, | |
| { | |
| "entropy": 2.267097595334053, | |
| "epoch": 0.20845396641574984, | |
| "grad_norm": 2.7754158973693848, | |
| "learning_rate": 1.9993159732160353e-05, | |
| "loss": 0.2901525735855103, | |
| "mean_token_accuracy": 0.9153242215514183, | |
| "num_tokens": 952998.0, | |
| "step": 270 | |
| }, | |
| { | |
| "entropy": 2.2886367619037626, | |
| "epoch": 0.21617448369040726, | |
| "grad_norm": 5.025292873382568, | |
| "learning_rate": 1.999118638749855e-05, | |
| "loss": 0.23909380435943603, | |
| "mean_token_accuracy": 0.9286381289362907, | |
| "num_tokens": 988029.0, | |
| "step": 280 | |
| }, | |
| { | |
| "entropy": 2.215249925851822, | |
| "epoch": 0.22389500096506465, | |
| "grad_norm": 2.3225855827331543, | |
| "learning_rate": 1.9988963407915743e-05, | |
| "loss": 0.24327101707458496, | |
| "mean_token_accuracy": 0.9352555975317955, | |
| "num_tokens": 1023017.0, | |
| "step": 290 | |
| }, | |
| { | |
| "entropy": 2.231352314352989, | |
| "epoch": 0.23161551823972207, | |
| "grad_norm": 3.9783694744110107, | |
| "learning_rate": 1.9986490848954213e-05, | |
| "loss": 0.28902668952941896, | |
| "mean_token_accuracy": 0.9245402902364731, | |
| "num_tokens": 1058144.0, | |
| "step": 300 | |
| }, | |
| { | |
| "entropy": 2.283156764507294, | |
| "epoch": 0.23933603551437946, | |
| "grad_norm": 4.462434768676758, | |
| "learning_rate": 1.9983768772392122e-05, | |
| "loss": 0.34264867305755614, | |
| "mean_token_accuracy": 0.9317045152187348, | |
| "num_tokens": 1089081.0, | |
| "step": 310 | |
| }, | |
| { | |
| "entropy": 2.184281289577484, | |
| "epoch": 0.24705655278903688, | |
| "grad_norm": 4.392584800720215, | |
| "learning_rate": 1.998079724624194e-05, | |
| "loss": 0.21626288890838624, | |
| "mean_token_accuracy": 0.9372277542948723, | |
| "num_tokens": 1128469.0, | |
| "step": 320 | |
| }, | |
| { | |
| "entropy": 2.2497308939695357, | |
| "epoch": 0.25477707006369427, | |
| "grad_norm": 4.71306848526001, | |
| "learning_rate": 1.997757634474878e-05, | |
| "loss": 0.18063234090805053, | |
| "mean_token_accuracy": 0.9538213908672333, | |
| "num_tokens": 1164636.0, | |
| "step": 330 | |
| }, | |
| { | |
| "entropy": 2.2387163996696473, | |
| "epoch": 0.26249758733835166, | |
| "grad_norm": 1.666062831878662, | |
| "learning_rate": 1.997410614838852e-05, | |
| "loss": 0.1772278666496277, | |
| "mean_token_accuracy": 0.9541213810443878, | |
| "num_tokens": 1198253.0, | |
| "step": 340 | |
| }, | |
| { | |
| "entropy": 2.2753040075302122, | |
| "epoch": 0.27021810461300905, | |
| "grad_norm": 3.6660280227661133, | |
| "learning_rate": 1.9970386743865794e-05, | |
| "loss": 0.191804039478302, | |
| "mean_token_accuracy": 0.9456240653991699, | |
| "num_tokens": 1230490.0, | |
| "step": 350 | |
| }, | |
| { | |
| "entropy": 2.2174918383359907, | |
| "epoch": 0.2779386218876665, | |
| "grad_norm": 6.83668851852417, | |
| "learning_rate": 1.9966418224111838e-05, | |
| "loss": 0.20989911556243895, | |
| "mean_token_accuracy": 0.9410885244607925, | |
| "num_tokens": 1267745.0, | |
| "step": 360 | |
| }, | |
| { | |
| "entropy": 2.219417518377304, | |
| "epoch": 0.2856591391623239, | |
| "grad_norm": 3.405336618423462, | |
| "learning_rate": 1.996220068828215e-05, | |
| "loss": 0.12719086408615113, | |
| "mean_token_accuracy": 0.9730818659067154, | |
| "num_tokens": 1303473.0, | |
| "step": 370 | |
| }, | |
| { | |
| "entropy": 2.2125363498926163, | |
| "epoch": 0.2933796564369813, | |
| "grad_norm": 4.977858066558838, | |
| "learning_rate": 1.995773424175403e-05, | |
| "loss": 0.23458333015441896, | |
| "mean_token_accuracy": 0.9394760414958, | |
| "num_tokens": 1338018.0, | |
| "step": 380 | |
| }, | |
| { | |
| "entropy": 2.2556005716323853, | |
| "epoch": 0.30110017371163866, | |
| "grad_norm": 4.019962787628174, | |
| "learning_rate": 1.9953018996123942e-05, | |
| "loss": 0.20530598163604735, | |
| "mean_token_accuracy": 0.9385380610823632, | |
| "num_tokens": 1373244.0, | |
| "step": 390 | |
| }, | |
| { | |
| "entropy": 2.2015073150396347, | |
| "epoch": 0.3088206909862961, | |
| "grad_norm": 2.728677749633789, | |
| "learning_rate": 1.9948055069204716e-05, | |
| "loss": 0.2082897901535034, | |
| "mean_token_accuracy": 0.9512322708964348, | |
| "num_tokens": 1407807.0, | |
| "step": 400 | |
| }, | |
| { | |
| "entropy": 2.273113363981247, | |
| "epoch": 0.3165412082609535, | |
| "grad_norm": 5.641965866088867, | |
| "learning_rate": 1.9942842585022607e-05, | |
| "loss": 0.16474014520645142, | |
| "mean_token_accuracy": 0.9578953236341476, | |
| "num_tokens": 1439941.0, | |
| "step": 410 | |
| }, | |
| { | |
| "entropy": 2.233418434858322, | |
| "epoch": 0.3242617255356109, | |
| "grad_norm": 1.6350418329238892, | |
| "learning_rate": 1.993738167381422e-05, | |
| "loss": 0.2152254104614258, | |
| "mean_token_accuracy": 0.9460450857877731, | |
| "num_tokens": 1476301.0, | |
| "step": 420 | |
| }, | |
| { | |
| "entropy": 2.2233593642711638, | |
| "epoch": 0.3319822428102683, | |
| "grad_norm": 5.32601261138916, | |
| "learning_rate": 1.9931672472023212e-05, | |
| "loss": 0.18065141439437865, | |
| "mean_token_accuracy": 0.9680908665060997, | |
| "num_tokens": 1514277.0, | |
| "step": 430 | |
| }, | |
| { | |
| "entropy": 2.13372061252594, | |
| "epoch": 0.33970276008492567, | |
| "grad_norm": 2.3526391983032227, | |
| "learning_rate": 1.992571512229693e-05, | |
| "loss": 0.19432415962219238, | |
| "mean_token_accuracy": 0.957370612025261, | |
| "num_tokens": 1552244.0, | |
| "step": 440 | |
| }, | |
| { | |
| "entropy": 2.2559954702854155, | |
| "epoch": 0.3474232773595831, | |
| "grad_norm": 4.275816440582275, | |
| "learning_rate": 1.9919509773482816e-05, | |
| "loss": 0.1578107237815857, | |
| "mean_token_accuracy": 0.9568435192108155, | |
| "num_tokens": 1589032.0, | |
| "step": 450 | |
| }, | |
| { | |
| "entropy": 2.1852520048618316, | |
| "epoch": 0.3551437946342405, | |
| "grad_norm": 4.293900489807129, | |
| "learning_rate": 1.991305658062469e-05, | |
| "loss": 0.23177709579467773, | |
| "mean_token_accuracy": 0.9536217465996742, | |
| "num_tokens": 1623926.0, | |
| "step": 460 | |
| }, | |
| { | |
| "entropy": 2.2606248050928115, | |
| "epoch": 0.3628643119088979, | |
| "grad_norm": 2.29001784324646, | |
| "learning_rate": 1.9906355704958895e-05, | |
| "loss": 0.17753545045852662, | |
| "mean_token_accuracy": 0.9497943684458733, | |
| "num_tokens": 1660932.0, | |
| "step": 470 | |
| }, | |
| { | |
| "entropy": 2.240851789712906, | |
| "epoch": 0.3705848291835553, | |
| "grad_norm": 6.091527462005615, | |
| "learning_rate": 1.989940731391024e-05, | |
| "loss": 0.1601572871208191, | |
| "mean_token_accuracy": 0.9648889541625977, | |
| "num_tokens": 1699168.0, | |
| "step": 480 | |
| }, | |
| { | |
| "entropy": 2.2124760150909424, | |
| "epoch": 0.3783053464582127, | |
| "grad_norm": 1.9111343622207642, | |
| "learning_rate": 1.9892211581087854e-05, | |
| "loss": 0.18850926160812378, | |
| "mean_token_accuracy": 0.950583329796791, | |
| "num_tokens": 1732169.0, | |
| "step": 490 | |
| }, | |
| { | |
| "entropy": 2.1586394786834715, | |
| "epoch": 0.3860258637328701, | |
| "grad_norm": 2.544804573059082, | |
| "learning_rate": 1.9884768686280807e-05, | |
| "loss": 0.16971189975738527, | |
| "mean_token_accuracy": 0.9592921108007431, | |
| "num_tokens": 1765074.0, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.3860258637328701, | |
| "eval_entropy": 2.1075005949851486, | |
| "eval_loss": 0.5422846674919128, | |
| "eval_mean_token_accuracy": 0.8941449357922673, | |
| "eval_num_tokens": 1765074.0, | |
| "eval_runtime": 988.7029, | |
| "eval_samples_per_second": 7.738, | |
| "eval_steps_per_second": 0.968, | |
| "step": 500 | |
| }, | |
| { | |
| "entropy": 2.2212108463048934, | |
| "epoch": 0.3937463810075275, | |
| "grad_norm": 5.165001392364502, | |
| "learning_rate": 1.9877078815453648e-05, | |
| "loss": 0.2070312023162842, | |
| "mean_token_accuracy": 0.9447736650705337, | |
| "num_tokens": 1803147.0, | |
| "step": 510 | |
| }, | |
| { | |
| "entropy": 2.1793356448411942, | |
| "epoch": 0.4014668982821849, | |
| "grad_norm": 3.1133415699005127, | |
| "learning_rate": 1.9869142160741748e-05, | |
| "loss": 0.15652704238891602, | |
| "mean_token_accuracy": 0.9599319085478782, | |
| "num_tokens": 1836681.0, | |
| "step": 520 | |
| }, | |
| { | |
| "entropy": 2.1871384173631667, | |
| "epoch": 0.4091874155568423, | |
| "grad_norm": 2.828554153442383, | |
| "learning_rate": 1.9860958920446503e-05, | |
| "loss": 0.18446458578109742, | |
| "mean_token_accuracy": 0.9459314718842506, | |
| "num_tokens": 1872127.0, | |
| "step": 530 | |
| }, | |
| { | |
| "entropy": 2.2149875700473785, | |
| "epoch": 0.4169079328314997, | |
| "grad_norm": 1.8423798084259033, | |
| "learning_rate": 1.985252929903037e-05, | |
| "loss": 0.1715518832206726, | |
| "mean_token_accuracy": 0.9680211797356606, | |
| "num_tokens": 1905318.0, | |
| "step": 540 | |
| }, | |
| { | |
| "entropy": 2.2457988798618316, | |
| "epoch": 0.42462845010615713, | |
| "grad_norm": 0.8942133188247681, | |
| "learning_rate": 1.9843853507111764e-05, | |
| "loss": 0.19799450635910035, | |
| "mean_token_accuracy": 0.954279862344265, | |
| "num_tokens": 1942161.0, | |
| "step": 550 | |
| }, | |
| { | |
| "entropy": 2.2178206920623778, | |
| "epoch": 0.4323489673808145, | |
| "grad_norm": 4.0149455070495605, | |
| "learning_rate": 1.9834931761459804e-05, | |
| "loss": 0.16577671766281127, | |
| "mean_token_accuracy": 0.9597131043672562, | |
| "num_tokens": 1977752.0, | |
| "step": 560 | |
| }, | |
| { | |
| "entropy": 2.2375432044267654, | |
| "epoch": 0.4400694846554719, | |
| "grad_norm": 2.153841495513916, | |
| "learning_rate": 1.9825764284988884e-05, | |
| "loss": 0.17870255708694457, | |
| "mean_token_accuracy": 0.9546808168292046, | |
| "num_tokens": 2012513.0, | |
| "step": 570 | |
| }, | |
| { | |
| "entropy": 2.25352583527565, | |
| "epoch": 0.4477900019301293, | |
| "grad_norm": 5.3909592628479, | |
| "learning_rate": 1.9816351306753112e-05, | |
| "loss": 0.10405315160751342, | |
| "mean_token_accuracy": 0.965131339430809, | |
| "num_tokens": 2046420.0, | |
| "step": 580 | |
| }, | |
| { | |
| "entropy": 2.154633605480194, | |
| "epoch": 0.45551051920478675, | |
| "grad_norm": 3.521245002746582, | |
| "learning_rate": 1.980669306194058e-05, | |
| "loss": 0.20279982089996337, | |
| "mean_token_accuracy": 0.9519533723592758, | |
| "num_tokens": 2084016.0, | |
| "step": 590 | |
| }, | |
| { | |
| "entropy": 2.186835992336273, | |
| "epoch": 0.46323103647944414, | |
| "grad_norm": 2.632781982421875, | |
| "learning_rate": 1.979678979186749e-05, | |
| "loss": 0.18113456964492797, | |
| "mean_token_accuracy": 0.9502775952219963, | |
| "num_tokens": 2117364.0, | |
| "step": 600 | |
| }, | |
| { | |
| "entropy": 2.189032417535782, | |
| "epoch": 0.4709515537541015, | |
| "grad_norm": 3.7245187759399414, | |
| "learning_rate": 1.9786641743972135e-05, | |
| "loss": 0.17686980962753296, | |
| "mean_token_accuracy": 0.9488097980618477, | |
| "num_tokens": 2151634.0, | |
| "step": 610 | |
| }, | |
| { | |
| "entropy": 2.2037782222032547, | |
| "epoch": 0.4786720710287589, | |
| "grad_norm": 4.016031742095947, | |
| "learning_rate": 1.9776249171808693e-05, | |
| "loss": 0.15398112535476685, | |
| "mean_token_accuracy": 0.9585451945662499, | |
| "num_tokens": 2187502.0, | |
| "step": 620 | |
| }, | |
| { | |
| "entropy": 2.124007895588875, | |
| "epoch": 0.4863925883034163, | |
| "grad_norm": 0.7118439078330994, | |
| "learning_rate": 1.9765612335040923e-05, | |
| "loss": 0.1368114948272705, | |
| "mean_token_accuracy": 0.9596732050180435, | |
| "num_tokens": 2219123.0, | |
| "step": 630 | |
| }, | |
| { | |
| "entropy": 2.1975839883089066, | |
| "epoch": 0.49411310557807375, | |
| "grad_norm": 7.007303714752197, | |
| "learning_rate": 1.9754731499435648e-05, | |
| "loss": 0.1872836470603943, | |
| "mean_token_accuracy": 0.953962279856205, | |
| "num_tokens": 2249877.0, | |
| "step": 640 | |
| }, | |
| { | |
| "entropy": 2.152134519815445, | |
| "epoch": 0.5018336228527311, | |
| "grad_norm": 5.597184658050537, | |
| "learning_rate": 1.9743606936856134e-05, | |
| "loss": 0.12075231075286866, | |
| "mean_token_accuracy": 0.9612849146127701, | |
| "num_tokens": 2290176.0, | |
| "step": 650 | |
| }, | |
| { | |
| "entropy": 2.168921798467636, | |
| "epoch": 0.5095541401273885, | |
| "grad_norm": 2.507140636444092, | |
| "learning_rate": 1.9732238925255282e-05, | |
| "loss": 0.17506990432739258, | |
| "mean_token_accuracy": 0.9573684856295586, | |
| "num_tokens": 2326102.0, | |
| "step": 660 | |
| }, | |
| { | |
| "entropy": 2.2062420308589936, | |
| "epoch": 0.5172746574020459, | |
| "grad_norm": 0.6417449116706848, | |
| "learning_rate": 1.9720627748668705e-05, | |
| "loss": 0.13540934324264525, | |
| "mean_token_accuracy": 0.9623032554984092, | |
| "num_tokens": 2360241.0, | |
| "step": 670 | |
| }, | |
| { | |
| "entropy": 2.078236073255539, | |
| "epoch": 0.5249951746767033, | |
| "grad_norm": 6.3616623878479, | |
| "learning_rate": 1.9708773697207608e-05, | |
| "loss": 0.15398894548416137, | |
| "mean_token_accuracy": 0.9607418894767761, | |
| "num_tokens": 2404406.0, | |
| "step": 680 | |
| }, | |
| { | |
| "entropy": 2.111809679865837, | |
| "epoch": 0.5327156919513607, | |
| "grad_norm": 6.101365089416504, | |
| "learning_rate": 1.969667706705155e-05, | |
| "loss": 0.21354906558990477, | |
| "mean_token_accuracy": 0.9489550918340683, | |
| "num_tokens": 2440018.0, | |
| "step": 690 | |
| }, | |
| { | |
| "entropy": 2.1686588764190673, | |
| "epoch": 0.5404362092260181, | |
| "grad_norm": 3.270843982696533, | |
| "learning_rate": 1.9684338160441045e-05, | |
| "loss": 0.14644697904586793, | |
| "mean_token_accuracy": 0.9603226110339165, | |
| "num_tokens": 2476784.0, | |
| "step": 700 | |
| }, | |
| { | |
| "entropy": 2.166987511515617, | |
| "epoch": 0.5481567265006756, | |
| "grad_norm": 4.874166965484619, | |
| "learning_rate": 1.9671757285670013e-05, | |
| "loss": 0.16295208930969238, | |
| "mean_token_accuracy": 0.9569882333278656, | |
| "num_tokens": 2512350.0, | |
| "step": 710 | |
| }, | |
| { | |
| "entropy": 2.252730244398117, | |
| "epoch": 0.555877243775333, | |
| "grad_norm": 3.095005512237549, | |
| "learning_rate": 1.9658934757078067e-05, | |
| "loss": 0.11499756574630737, | |
| "mean_token_accuracy": 0.9637171044945717, | |
| "num_tokens": 2541581.0, | |
| "step": 720 | |
| }, | |
| { | |
| "entropy": 2.1925143748521805, | |
| "epoch": 0.5635977610499904, | |
| "grad_norm": 2.961524486541748, | |
| "learning_rate": 1.9645870895042665e-05, | |
| "loss": 0.0865030288696289, | |
| "mean_token_accuracy": 0.9704707160592079, | |
| "num_tokens": 2575015.0, | |
| "step": 730 | |
| }, | |
| { | |
| "entropy": 2.1793641477823256, | |
| "epoch": 0.5713182783246478, | |
| "grad_norm": 3.9880712032318115, | |
| "learning_rate": 1.9632566025971114e-05, | |
| "loss": 0.1488552212715149, | |
| "mean_token_accuracy": 0.9751747816801071, | |
| "num_tokens": 2610061.0, | |
| "step": 740 | |
| }, | |
| { | |
| "entropy": 2.172965335845947, | |
| "epoch": 0.5790387955993052, | |
| "grad_norm": 5.618796348571777, | |
| "learning_rate": 1.9619020482292386e-05, | |
| "loss": 0.11244801282882691, | |
| "mean_token_accuracy": 0.9690556541085243, | |
| "num_tokens": 2645126.0, | |
| "step": 750 | |
| }, | |
| { | |
| "entropy": 2.114529776573181, | |
| "epoch": 0.5867593128739625, | |
| "grad_norm": 4.01426362991333, | |
| "learning_rate": 1.960523460244885e-05, | |
| "loss": 0.14911041259765626, | |
| "mean_token_accuracy": 0.9594126790761948, | |
| "num_tokens": 2683118.0, | |
| "step": 760 | |
| }, | |
| { | |
| "entropy": 2.2817918568849564, | |
| "epoch": 0.5944798301486199, | |
| "grad_norm": 3.577343225479126, | |
| "learning_rate": 1.959120873088779e-05, | |
| "loss": 0.17379360198974608, | |
| "mean_token_accuracy": 0.958151726424694, | |
| "num_tokens": 2717012.0, | |
| "step": 770 | |
| }, | |
| { | |
| "entropy": 2.2415023863315584, | |
| "epoch": 0.6022003474232773, | |
| "grad_norm": 0.9728232622146606, | |
| "learning_rate": 1.9576943218052813e-05, | |
| "loss": 0.16758315563201903, | |
| "mean_token_accuracy": 0.9584022372961044, | |
| "num_tokens": 2750233.0, | |
| "step": 780 | |
| }, | |
| { | |
| "entropy": 2.2567327469587326, | |
| "epoch": 0.6099208646979347, | |
| "grad_norm": 4.933441638946533, | |
| "learning_rate": 1.956243842037507e-05, | |
| "loss": 0.1237065315246582, | |
| "mean_token_accuracy": 0.9687949195504189, | |
| "num_tokens": 2784593.0, | |
| "step": 790 | |
| }, | |
| { | |
| "entropy": 2.1688129603862762, | |
| "epoch": 0.6176413819725922, | |
| "grad_norm": 0.3439030349254608, | |
| "learning_rate": 1.9547694700264387e-05, | |
| "loss": 0.12909990549087524, | |
| "mean_token_accuracy": 0.963108229637146, | |
| "num_tokens": 2828912.0, | |
| "step": 800 | |
| }, | |
| { | |
| "entropy": 2.2464480668306352, | |
| "epoch": 0.6253618992472496, | |
| "grad_norm": 1.731982946395874, | |
| "learning_rate": 1.953271242610017e-05, | |
| "loss": 0.13596073389053345, | |
| "mean_token_accuracy": 0.974192063510418, | |
| "num_tokens": 2864199.0, | |
| "step": 810 | |
| }, | |
| { | |
| "entropy": 2.2575213581323625, | |
| "epoch": 0.633082416521907, | |
| "grad_norm": 2.722280263900757, | |
| "learning_rate": 1.951749197222224e-05, | |
| "loss": 0.12859855890274047, | |
| "mean_token_accuracy": 0.9683046102523803, | |
| "num_tokens": 2902141.0, | |
| "step": 820 | |
| }, | |
| { | |
| "entropy": 2.182758465409279, | |
| "epoch": 0.6408029337965644, | |
| "grad_norm": 2.9258344173431396, | |
| "learning_rate": 1.9502033718921444e-05, | |
| "loss": 0.09067170023918152, | |
| "mean_token_accuracy": 0.9700423076748848, | |
| "num_tokens": 2941709.0, | |
| "step": 830 | |
| }, | |
| { | |
| "entropy": 2.1869940221309663, | |
| "epoch": 0.6485234510712218, | |
| "grad_norm": 1.2507781982421875, | |
| "learning_rate": 1.948633805243018e-05, | |
| "loss": 0.06829038262367249, | |
| "mean_token_accuracy": 0.9780937045812607, | |
| "num_tokens": 2976754.0, | |
| "step": 840 | |
| }, | |
| { | |
| "entropy": 2.240604591369629, | |
| "epoch": 0.6562439683458792, | |
| "grad_norm": 6.191175937652588, | |
| "learning_rate": 1.9470405364912737e-05, | |
| "loss": 0.1681974411010742, | |
| "mean_token_accuracy": 0.962010458111763, | |
| "num_tokens": 3013223.0, | |
| "step": 850 | |
| }, | |
| { | |
| "entropy": 2.1933089971542357, | |
| "epoch": 0.6639644856205366, | |
| "grad_norm": 3.580299139022827, | |
| "learning_rate": 1.945423605445548e-05, | |
| "loss": 0.14260369539260864, | |
| "mean_token_accuracy": 0.9581344783306122, | |
| "num_tokens": 3051770.0, | |
| "step": 860 | |
| }, | |
| { | |
| "entropy": 2.2846630066633224, | |
| "epoch": 0.671685002895194, | |
| "grad_norm": 0.303085058927536, | |
| "learning_rate": 1.943783052505694e-05, | |
| "loss": 0.10166503190994262, | |
| "mean_token_accuracy": 0.9790826007723809, | |
| "num_tokens": 3086529.0, | |
| "step": 870 | |
| }, | |
| { | |
| "entropy": 2.229181852936745, | |
| "epoch": 0.6794055201698513, | |
| "grad_norm": 3.7699837684631348, | |
| "learning_rate": 1.9421189186617692e-05, | |
| "loss": 0.09227925539016724, | |
| "mean_token_accuracy": 0.9764371633529663, | |
| "num_tokens": 3132264.0, | |
| "step": 880 | |
| }, | |
| { | |
| "entropy": 2.2480290710926054, | |
| "epoch": 0.6871260374445087, | |
| "grad_norm": 1.3305270671844482, | |
| "learning_rate": 1.9404312454930116e-05, | |
| "loss": 0.13547370433807374, | |
| "mean_token_accuracy": 0.9761623114347457, | |
| "num_tokens": 3168569.0, | |
| "step": 890 | |
| }, | |
| { | |
| "entropy": 2.174534446001053, | |
| "epoch": 0.6948465547191662, | |
| "grad_norm": 0.882283627986908, | |
| "learning_rate": 1.9387200751668018e-05, | |
| "loss": 0.12927967309951782, | |
| "mean_token_accuracy": 0.9645377054810524, | |
| "num_tokens": 3203700.0, | |
| "step": 900 | |
| }, | |
| { | |
| "entropy": 2.1783421456813814, | |
| "epoch": 0.7025670719938236, | |
| "grad_norm": 3.659027099609375, | |
| "learning_rate": 1.9369854504376092e-05, | |
| "loss": 0.08977473378181458, | |
| "mean_token_accuracy": 0.9750412046909332, | |
| "num_tokens": 3244225.0, | |
| "step": 910 | |
| }, | |
| { | |
| "entropy": 2.2626183718442916, | |
| "epoch": 0.710287589268481, | |
| "grad_norm": 0.5882543921470642, | |
| "learning_rate": 1.9352274146459223e-05, | |
| "loss": 0.13526970148086548, | |
| "mean_token_accuracy": 0.9642464354634285, | |
| "num_tokens": 3282163.0, | |
| "step": 920 | |
| }, | |
| { | |
| "entropy": 2.2082873970270156, | |
| "epoch": 0.7180081065431384, | |
| "grad_norm": 3.8217687606811523, | |
| "learning_rate": 1.9334460117171687e-05, | |
| "loss": 0.10937002897262574, | |
| "mean_token_accuracy": 0.9754633396863938, | |
| "num_tokens": 3316191.0, | |
| "step": 930 | |
| }, | |
| { | |
| "entropy": 2.177019494771957, | |
| "epoch": 0.7257286238177958, | |
| "grad_norm": 0.9711639881134033, | |
| "learning_rate": 1.931641286160615e-05, | |
| "loss": 0.12394155263900757, | |
| "mean_token_accuracy": 0.9672280788421631, | |
| "num_tokens": 3353504.0, | |
| "step": 940 | |
| }, | |
| { | |
| "entropy": 2.159817245602608, | |
| "epoch": 0.7334491410924532, | |
| "grad_norm": 3.0002224445343018, | |
| "learning_rate": 1.9298132830682553e-05, | |
| "loss": 0.07563741207122802, | |
| "mean_token_accuracy": 0.9817924559116363, | |
| "num_tokens": 3390473.0, | |
| "step": 950 | |
| }, | |
| { | |
| "entropy": 2.1697775393724443, | |
| "epoch": 0.7411696583671106, | |
| "grad_norm": 4.114264965057373, | |
| "learning_rate": 1.9279620481136854e-05, | |
| "loss": 0.10978723764419555, | |
| "mean_token_accuracy": 0.9763004094362259, | |
| "num_tokens": 3429080.0, | |
| "step": 960 | |
| }, | |
| { | |
| "entropy": 2.154700428247452, | |
| "epoch": 0.748890175641768, | |
| "grad_norm": 2.0637450218200684, | |
| "learning_rate": 1.9260876275509614e-05, | |
| "loss": 0.12881894111633302, | |
| "mean_token_accuracy": 0.9691078916192055, | |
| "num_tokens": 3472222.0, | |
| "step": 970 | |
| }, | |
| { | |
| "entropy": 2.1561296582221985, | |
| "epoch": 0.7566106929164254, | |
| "grad_norm": 5.698066711425781, | |
| "learning_rate": 1.924190068213443e-05, | |
| "loss": 0.12960790395736693, | |
| "mean_token_accuracy": 0.97647725045681, | |
| "num_tokens": 3517841.0, | |
| "step": 980 | |
| }, | |
| { | |
| "entropy": 2.2234013736248017, | |
| "epoch": 0.7643312101910829, | |
| "grad_norm": 2.6206040382385254, | |
| "learning_rate": 1.9222694175126242e-05, | |
| "loss": 0.09993091225624084, | |
| "mean_token_accuracy": 0.9791779488325119, | |
| "num_tokens": 3554442.0, | |
| "step": 990 | |
| }, | |
| { | |
| "entropy": 2.180557644367218, | |
| "epoch": 0.7720517274657402, | |
| "grad_norm": 0.4288350045681, | |
| "learning_rate": 1.920325723436949e-05, | |
| "loss": 0.18079398870468139, | |
| "mean_token_accuracy": 0.9695220619440079, | |
| "num_tokens": 3589489.0, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.7720517274657402, | |
| "eval_entropy": 2.093520096975185, | |
| "eval_loss": 0.45434409379959106, | |
| "eval_mean_token_accuracy": 0.9182380637155929, | |
| "eval_num_tokens": 3589489.0, | |
| "eval_runtime": 990.2181, | |
| "eval_samples_per_second": 7.727, | |
| "eval_steps_per_second": 0.966, | |
| "step": 1000 | |
| }, | |
| { | |
| "entropy": 2.2155666559934617, | |
| "epoch": 0.7797722447403976, | |
| "grad_norm": 2.715181589126587, | |
| "learning_rate": 1.9183590345506115e-05, | |
| "loss": 0.07064727544784546, | |
| "mean_token_accuracy": 0.9841662392020225, | |
| "num_tokens": 3622362.0, | |
| "step": 1010 | |
| }, | |
| { | |
| "entropy": 2.1746787667274474, | |
| "epoch": 0.787492762015055, | |
| "grad_norm": 3.680882692337036, | |
| "learning_rate": 1.916369399992344e-05, | |
| "loss": 0.06015622615814209, | |
| "mean_token_accuracy": 0.9877562940120697, | |
| "num_tokens": 3656283.0, | |
| "step": 1020 | |
| }, | |
| { | |
| "entropy": 2.174808195233345, | |
| "epoch": 0.7952132792897124, | |
| "grad_norm": 0.3832246959209442, | |
| "learning_rate": 1.9143568694741858e-05, | |
| "loss": 0.11039963960647584, | |
| "mean_token_accuracy": 0.9725030601024628, | |
| "num_tokens": 3695042.0, | |
| "step": 1030 | |
| }, | |
| { | |
| "entropy": 2.2529222846031187, | |
| "epoch": 0.8029337965643698, | |
| "grad_norm": 3.5047266483306885, | |
| "learning_rate": 1.9123214932802465e-05, | |
| "loss": 0.11572520732879639, | |
| "mean_token_accuracy": 0.9776080340147019, | |
| "num_tokens": 3730250.0, | |
| "step": 1040 | |
| }, | |
| { | |
| "entropy": 2.1754327774047852, | |
| "epoch": 0.8106543138390272, | |
| "grad_norm": 3.506120204925537, | |
| "learning_rate": 1.9102633222654444e-05, | |
| "loss": 0.11624773740768432, | |
| "mean_token_accuracy": 0.9673858731985092, | |
| "num_tokens": 3767790.0, | |
| "step": 1050 | |
| }, | |
| { | |
| "entropy": 2.2163166791200637, | |
| "epoch": 0.8183748311136846, | |
| "grad_norm": 1.1102652549743652, | |
| "learning_rate": 1.9081824078542394e-05, | |
| "loss": 0.07758398056030273, | |
| "mean_token_accuracy": 0.9816681414842605, | |
| "num_tokens": 3803270.0, | |
| "step": 1060 | |
| }, | |
| { | |
| "entropy": 2.25885391831398, | |
| "epoch": 0.826095348388342, | |
| "grad_norm": 0.5661072134971619, | |
| "learning_rate": 1.9060788020393456e-05, | |
| "loss": 0.0615719735622406, | |
| "mean_token_accuracy": 0.9828296527266502, | |
| "num_tokens": 3834164.0, | |
| "step": 1070 | |
| }, | |
| { | |
| "entropy": 2.1803546130657194, | |
| "epoch": 0.8338158656629994, | |
| "grad_norm": 2.040249824523926, | |
| "learning_rate": 1.903952557380435e-05, | |
| "loss": 0.11473102569580078, | |
| "mean_token_accuracy": 0.9657544881105423, | |
| "num_tokens": 3871534.0, | |
| "step": 1080 | |
| }, | |
| { | |
| "entropy": 2.1811802864074705, | |
| "epoch": 0.8415363829376569, | |
| "grad_norm": 1.413288950920105, | |
| "learning_rate": 1.9018037270028213e-05, | |
| "loss": 0.07572046518325806, | |
| "mean_token_accuracy": 0.9782123982906341, | |
| "num_tokens": 3910887.0, | |
| "step": 1090 | |
| }, | |
| { | |
| "entropy": 2.23103586435318, | |
| "epoch": 0.8492569002123143, | |
| "grad_norm": 2.4706242084503174, | |
| "learning_rate": 1.8996323645961352e-05, | |
| "loss": 0.04151468873023987, | |
| "mean_token_accuracy": 0.9870179295539856, | |
| "num_tokens": 3943008.0, | |
| "step": 1100 | |
| }, | |
| { | |
| "entropy": 2.227116122841835, | |
| "epoch": 0.8569774174869716, | |
| "grad_norm": 2.6038529872894287, | |
| "learning_rate": 1.8974385244129805e-05, | |
| "loss": 0.0946826159954071, | |
| "mean_token_accuracy": 0.9796450510621071, | |
| "num_tokens": 3976668.0, | |
| "step": 1110 | |
| }, | |
| { | |
| "entropy": 2.208661425113678, | |
| "epoch": 0.864697934761629, | |
| "grad_norm": 5.780674457550049, | |
| "learning_rate": 1.8952222612675812e-05, | |
| "loss": 0.10974045991897582, | |
| "mean_token_accuracy": 0.9706292197108268, | |
| "num_tokens": 4012874.0, | |
| "step": 1120 | |
| }, | |
| { | |
| "entropy": 2.23996858894825, | |
| "epoch": 0.8724184520362864, | |
| "grad_norm": 1.2360124588012695, | |
| "learning_rate": 1.892983630534409e-05, | |
| "loss": 0.08555867075920105, | |
| "mean_token_accuracy": 0.9800435766577721, | |
| "num_tokens": 4044180.0, | |
| "step": 1130 | |
| }, | |
| { | |
| "entropy": 2.2110779762268065, | |
| "epoch": 0.8801389693109438, | |
| "grad_norm": 0.4163481891155243, | |
| "learning_rate": 1.890722688146802e-05, | |
| "loss": 0.07701975107192993, | |
| "mean_token_accuracy": 0.9780819907784462, | |
| "num_tokens": 4081151.0, | |
| "step": 1140 | |
| }, | |
| { | |
| "entropy": 2.226836398243904, | |
| "epoch": 0.8878594865856012, | |
| "grad_norm": 2.713832378387451, | |
| "learning_rate": 1.888439490595567e-05, | |
| "loss": 0.08010860681533813, | |
| "mean_token_accuracy": 0.9822189897298813, | |
| "num_tokens": 4116353.0, | |
| "step": 1150 | |
| }, | |
| { | |
| "entropy": 2.27404500246048, | |
| "epoch": 0.8955800038602586, | |
| "grad_norm": 0.15923215448856354, | |
| "learning_rate": 1.886134094927567e-05, | |
| "loss": 0.059002858400344846, | |
| "mean_token_accuracy": 0.9816316947340965, | |
| "num_tokens": 4148097.0, | |
| "step": 1160 | |
| }, | |
| { | |
| "entropy": 2.2260487526655197, | |
| "epoch": 0.903300521134916, | |
| "grad_norm": 3.0013537406921387, | |
| "learning_rate": 1.8838065587442956e-05, | |
| "loss": 0.08235616087913514, | |
| "mean_token_accuracy": 0.9715940162539483, | |
| "num_tokens": 4180489.0, | |
| "step": 1170 | |
| }, | |
| { | |
| "entropy": 2.124008280038834, | |
| "epoch": 0.9110210384095735, | |
| "grad_norm": 1.1767276525497437, | |
| "learning_rate": 1.8814569402004394e-05, | |
| "loss": 0.1106486201286316, | |
| "mean_token_accuracy": 0.9688979595899582, | |
| "num_tokens": 4220747.0, | |
| "step": 1180 | |
| }, | |
| { | |
| "entropy": 2.221278077363968, | |
| "epoch": 0.9187415556842309, | |
| "grad_norm": 1.546454906463623, | |
| "learning_rate": 1.8790852980024244e-05, | |
| "loss": 0.1707722783088684, | |
| "mean_token_accuracy": 0.9663840562105179, | |
| "num_tokens": 4259405.0, | |
| "step": 1190 | |
| }, | |
| { | |
| "entropy": 2.204825773835182, | |
| "epoch": 0.9264620729588883, | |
| "grad_norm": 2.0527737140655518, | |
| "learning_rate": 1.876691691406948e-05, | |
| "loss": 0.08684939742088318, | |
| "mean_token_accuracy": 0.9769035264849663, | |
| "num_tokens": 4292496.0, | |
| "step": 1200 | |
| }, | |
| { | |
| "entropy": 2.208803045749664, | |
| "epoch": 0.9341825902335457, | |
| "grad_norm": 4.592103481292725, | |
| "learning_rate": 1.8742761802194997e-05, | |
| "loss": 0.06823323369026184, | |
| "mean_token_accuracy": 0.9814566165208817, | |
| "num_tokens": 4325427.0, | |
| "step": 1210 | |
| }, | |
| { | |
| "entropy": 2.1777720004320145, | |
| "epoch": 0.941903107508203, | |
| "grad_norm": 3.140316963195801, | |
| "learning_rate": 1.871838824792867e-05, | |
| "loss": 0.16060715913772583, | |
| "mean_token_accuracy": 0.9660079538822174, | |
| "num_tokens": 4360480.0, | |
| "step": 1220 | |
| }, | |
| { | |
| "entropy": 2.2344942808151247, | |
| "epoch": 0.9496236247828604, | |
| "grad_norm": 4.9994001388549805, | |
| "learning_rate": 1.869379686025626e-05, | |
| "loss": 0.12226022481918335, | |
| "mean_token_accuracy": 0.9707063496112823, | |
| "num_tokens": 4392487.0, | |
| "step": 1230 | |
| }, | |
| { | |
| "entropy": 2.1433703660964967, | |
| "epoch": 0.9573441420575178, | |
| "grad_norm": 3.475524425506592, | |
| "learning_rate": 1.8668988253606212e-05, | |
| "loss": 0.12414617538452148, | |
| "mean_token_accuracy": 0.9741201639175415, | |
| "num_tokens": 4431701.0, | |
| "step": 1240 | |
| }, | |
| { | |
| "entropy": 2.190104368329048, | |
| "epoch": 0.9650646593321752, | |
| "grad_norm": 3.5840330123901367, | |
| "learning_rate": 1.8643963047834307e-05, | |
| "loss": 0.08782102465629578, | |
| "mean_token_accuracy": 0.9735233366489411, | |
| "num_tokens": 4467444.0, | |
| "step": 1250 | |
| }, | |
| { | |
| "entropy": 2.2168781042098997, | |
| "epoch": 0.9727851766068326, | |
| "grad_norm": 3.597426176071167, | |
| "learning_rate": 1.861872186820815e-05, | |
| "loss": 0.14496043920516968, | |
| "mean_token_accuracy": 0.9721528425812721, | |
| "num_tokens": 4496929.0, | |
| "step": 1260 | |
| }, | |
| { | |
| "entropy": 2.2057291209697723, | |
| "epoch": 0.9805056938814901, | |
| "grad_norm": 2.3206138610839844, | |
| "learning_rate": 1.8593265345391577e-05, | |
| "loss": 0.10822974443435669, | |
| "mean_token_accuracy": 0.9689827769994735, | |
| "num_tokens": 4531085.0, | |
| "step": 1270 | |
| }, | |
| { | |
| "entropy": 2.1946437865495683, | |
| "epoch": 0.9882262111561475, | |
| "grad_norm": 0.37915700674057007, | |
| "learning_rate": 1.8567594115428875e-05, | |
| "loss": 0.11415959596633911, | |
| "mean_token_accuracy": 0.9744870230555535, | |
| "num_tokens": 4569312.0, | |
| "step": 1280 | |
| }, | |
| { | |
| "entropy": 2.2317381650209427, | |
| "epoch": 0.9959467284308049, | |
| "grad_norm": 3.852874279022217, | |
| "learning_rate": 1.8541708819728902e-05, | |
| "loss": 0.06760208606719971, | |
| "mean_token_accuracy": 0.9818901315331459, | |
| "num_tokens": 4605253.0, | |
| "step": 1290 | |
| }, | |
| { | |
| "entropy": 2.1512465928051925, | |
| "epoch": 1.003088206909863, | |
| "grad_norm": 1.6707713603973389, | |
| "learning_rate": 1.8515610105049067e-05, | |
| "loss": 0.07693768739700317, | |
| "mean_token_accuracy": 0.9778838012669537, | |
| "num_tokens": 4643503.0, | |
| "step": 1300 | |
| }, | |
| { | |
| "entropy": 2.1755835592746733, | |
| "epoch": 1.0108087241845203, | |
| "grad_norm": 2.118502378463745, | |
| "learning_rate": 1.8489298623479147e-05, | |
| "loss": 0.07816660404205322, | |
| "mean_token_accuracy": 0.9813061475753784, | |
| "num_tokens": 4675662.0, | |
| "step": 1310 | |
| }, | |
| { | |
| "entropy": 2.1576342791318894, | |
| "epoch": 1.0185292414591778, | |
| "grad_norm": 5.421299934387207, | |
| "learning_rate": 1.846277503242502e-05, | |
| "loss": 0.09433794617652894, | |
| "mean_token_accuracy": 0.9725943058729172, | |
| "num_tokens": 4712787.0, | |
| "step": 1320 | |
| }, | |
| { | |
| "entropy": 2.1679455935955048, | |
| "epoch": 1.026249758733835, | |
| "grad_norm": 3.022178888320923, | |
| "learning_rate": 1.8436039994592224e-05, | |
| "loss": 0.08787925839424134, | |
| "mean_token_accuracy": 0.9729105263948441, | |
| "num_tokens": 4755527.0, | |
| "step": 1330 | |
| }, | |
| { | |
| "entropy": 2.146326667070389, | |
| "epoch": 1.0339702760084926, | |
| "grad_norm": 4.420295715332031, | |
| "learning_rate": 1.8409094177969408e-05, | |
| "loss": 0.09245921969413758, | |
| "mean_token_accuracy": 0.9803972214460372, | |
| "num_tokens": 4793692.0, | |
| "step": 1340 | |
| }, | |
| { | |
| "entropy": 2.125700297951698, | |
| "epoch": 1.04169079328315, | |
| "grad_norm": 0.7011611461639404, | |
| "learning_rate": 1.8381938255811626e-05, | |
| "loss": 0.04192873239517212, | |
| "mean_token_accuracy": 0.9881086781620979, | |
| "num_tokens": 4825139.0, | |
| "step": 1350 | |
| }, | |
| { | |
| "entropy": 2.265898513793945, | |
| "epoch": 1.0494113105578073, | |
| "grad_norm": 2.0361523628234863, | |
| "learning_rate": 1.8354572906623537e-05, | |
| "loss": 0.05326482057571411, | |
| "mean_token_accuracy": 0.9820634126663208, | |
| "num_tokens": 4860219.0, | |
| "step": 1360 | |
| }, | |
| { | |
| "entropy": 2.249096092581749, | |
| "epoch": 1.0571318278324648, | |
| "grad_norm": 2.0669565200805664, | |
| "learning_rate": 1.832699881414244e-05, | |
| "loss": 0.07189119458198548, | |
| "mean_token_accuracy": 0.9756469547748565, | |
| "num_tokens": 4895924.0, | |
| "step": 1370 | |
| }, | |
| { | |
| "entropy": 2.136953499913216, | |
| "epoch": 1.0648523451071221, | |
| "grad_norm": 3.7083239555358887, | |
| "learning_rate": 1.8299216667321192e-05, | |
| "loss": 0.0377763956785202, | |
| "mean_token_accuracy": 0.993205739557743, | |
| "num_tokens": 4932774.0, | |
| "step": 1380 | |
| }, | |
| { | |
| "entropy": 2.1725950062274935, | |
| "epoch": 1.0725728623817796, | |
| "grad_norm": 3.3318490982055664, | |
| "learning_rate": 1.827122716031099e-05, | |
| "loss": 0.03515214920043945, | |
| "mean_token_accuracy": 0.9864067286252975, | |
| "num_tokens": 4968312.0, | |
| "step": 1390 | |
| }, | |
| { | |
| "entropy": 2.171587583422661, | |
| "epoch": 1.080293379656437, | |
| "grad_norm": 1.3849668502807617, | |
| "learning_rate": 1.8243030992444042e-05, | |
| "loss": 0.033025556802749635, | |
| "mean_token_accuracy": 0.9898627385497093, | |
| "num_tokens": 5005630.0, | |
| "step": 1400 | |
| }, | |
| { | |
| "entropy": 2.123317489027977, | |
| "epoch": 1.0880138969310944, | |
| "grad_norm": 3.8918912410736084, | |
| "learning_rate": 1.821462886821607e-05, | |
| "loss": 0.06294504404067994, | |
| "mean_token_accuracy": 0.9815075367689132, | |
| "num_tokens": 5045736.0, | |
| "step": 1410 | |
| }, | |
| { | |
| "entropy": 2.1403660237789155, | |
| "epoch": 1.0957344142057517, | |
| "grad_norm": 3.85695219039917, | |
| "learning_rate": 1.8186021497268733e-05, | |
| "loss": 0.06816688179969788, | |
| "mean_token_accuracy": 0.9811367645859719, | |
| "num_tokens": 5087978.0, | |
| "step": 1420 | |
| }, | |
| { | |
| "entropy": 2.1448576182126997, | |
| "epoch": 1.1034549314804092, | |
| "grad_norm": 4.700116157531738, | |
| "learning_rate": 1.8157209594371873e-05, | |
| "loss": 0.06470519304275513, | |
| "mean_token_accuracy": 0.9794086501002311, | |
| "num_tokens": 5123611.0, | |
| "step": 1430 | |
| }, | |
| { | |
| "entropy": 2.246442288160324, | |
| "epoch": 1.1111754487550667, | |
| "grad_norm": 0.8788654208183289, | |
| "learning_rate": 1.8128193879405684e-05, | |
| "loss": 0.06699486970901489, | |
| "mean_token_accuracy": 0.9850307568907738, | |
| "num_tokens": 5156527.0, | |
| "step": 1440 | |
| }, | |
| { | |
| "entropy": 2.0466793209314345, | |
| "epoch": 1.118895966029724, | |
| "grad_norm": 2.6347248554229736, | |
| "learning_rate": 1.8098975077342696e-05, | |
| "loss": 0.05093771815299988, | |
| "mean_token_accuracy": 0.9866293117403984, | |
| "num_tokens": 5194973.0, | |
| "step": 1450 | |
| }, | |
| { | |
| "entropy": 2.175449812412262, | |
| "epoch": 1.1266164833043815, | |
| "grad_norm": 3.3113977909088135, | |
| "learning_rate": 1.806955391822968e-05, | |
| "loss": 0.07722722887992858, | |
| "mean_token_accuracy": 0.9812873587012291, | |
| "num_tokens": 5232238.0, | |
| "step": 1460 | |
| }, | |
| { | |
| "entropy": 2.1114370614290237, | |
| "epoch": 1.1343370005790387, | |
| "grad_norm": 6.0895538330078125, | |
| "learning_rate": 1.8039931137169398e-05, | |
| "loss": 0.10581094026565552, | |
| "mean_token_accuracy": 0.9739348217844963, | |
| "num_tokens": 5269462.0, | |
| "step": 1470 | |
| }, | |
| { | |
| "entropy": 2.057721531391144, | |
| "epoch": 1.1420575178536962, | |
| "grad_norm": 2.163757085800171, | |
| "learning_rate": 1.801010747430224e-05, | |
| "loss": 0.08237841129302978, | |
| "mean_token_accuracy": 0.9800081118941307, | |
| "num_tokens": 5312511.0, | |
| "step": 1480 | |
| }, | |
| { | |
| "entropy": 2.2099882423877717, | |
| "epoch": 1.1497780351283535, | |
| "grad_norm": 2.940668821334839, | |
| "learning_rate": 1.798008367478774e-05, | |
| "loss": 0.09443849325180054, | |
| "mean_token_accuracy": 0.9783109456300736, | |
| "num_tokens": 5347633.0, | |
| "step": 1490 | |
| }, | |
| { | |
| "entropy": 2.179814171791077, | |
| "epoch": 1.157498552403011, | |
| "grad_norm": 5.941656589508057, | |
| "learning_rate": 1.7949860488785935e-05, | |
| "loss": 0.11362334489822387, | |
| "mean_token_accuracy": 0.9784113153815269, | |
| "num_tokens": 5382716.0, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 1.157498552403011, | |
| "eval_entropy": 2.067308218003316, | |
| "eval_loss": 0.4690878093242645, | |
| "eval_mean_token_accuracy": 0.9239271352283633, | |
| "eval_num_tokens": 5382716.0, | |
| "eval_runtime": 987.4621, | |
| "eval_samples_per_second": 7.748, | |
| "eval_steps_per_second": 0.969, | |
| "step": 1500 | |
| }, | |
| { | |
| "entropy": 2.1574917674064635, | |
| "epoch": 1.1652190696776685, | |
| "grad_norm": 2.5012035369873047, | |
| "learning_rate": 1.7919438671438647e-05, | |
| "loss": 0.05635004043579102, | |
| "mean_token_accuracy": 0.9867865487933158, | |
| "num_tokens": 5427436.0, | |
| "step": 1510 | |
| }, | |
| { | |
| "entropy": 2.1504832983016966, | |
| "epoch": 1.1729395869523258, | |
| "grad_norm": 1.0461984872817993, | |
| "learning_rate": 1.78888189828506e-05, | |
| "loss": 0.06930508613586425, | |
| "mean_token_accuracy": 0.9815816029906272, | |
| "num_tokens": 5465521.0, | |
| "step": 1520 | |
| }, | |
| { | |
| "entropy": 2.201800489425659, | |
| "epoch": 1.180660104226983, | |
| "grad_norm": 3.5174059867858887, | |
| "learning_rate": 1.7858002188070428e-05, | |
| "loss": 0.06647626757621765, | |
| "mean_token_accuracy": 0.9884074360132218, | |
| "num_tokens": 5503228.0, | |
| "step": 1530 | |
| }, | |
| { | |
| "entropy": 2.1449740499258043, | |
| "epoch": 1.1883806215016406, | |
| "grad_norm": 2.1373608112335205, | |
| "learning_rate": 1.7826989057071576e-05, | |
| "loss": 0.08340185880661011, | |
| "mean_token_accuracy": 0.9833342641592026, | |
| "num_tokens": 5538689.0, | |
| "step": 1540 | |
| }, | |
| { | |
| "entropy": 2.1393818974494936, | |
| "epoch": 1.196101138776298, | |
| "grad_norm": 1.0357944965362549, | |
| "learning_rate": 1.779578036473304e-05, | |
| "loss": 0.06295200586318969, | |
| "mean_token_accuracy": 0.9850618243217468, | |
| "num_tokens": 5576456.0, | |
| "step": 1550 | |
| }, | |
| { | |
| "entropy": 2.1823107868433, | |
| "epoch": 1.2038216560509554, | |
| "grad_norm": 4.965859413146973, | |
| "learning_rate": 1.7764376890820014e-05, | |
| "loss": 0.09606855511665344, | |
| "mean_token_accuracy": 0.9736377954483032, | |
| "num_tokens": 5612953.0, | |
| "step": 1560 | |
| }, | |
| { | |
| "entropy": 2.1806869179010393, | |
| "epoch": 1.2115421733256129, | |
| "grad_norm": 0.8930599093437195, | |
| "learning_rate": 1.773277941996442e-05, | |
| "loss": 0.10148507356643677, | |
| "mean_token_accuracy": 0.9760855048894882, | |
| "num_tokens": 5649420.0, | |
| "step": 1570 | |
| }, | |
| { | |
| "entropy": 2.153961244225502, | |
| "epoch": 1.2192626906002701, | |
| "grad_norm": 5.579773426055908, | |
| "learning_rate": 1.770098874164529e-05, | |
| "loss": 0.0607684850692749, | |
| "mean_token_accuracy": 0.9863114863634109, | |
| "num_tokens": 5684144.0, | |
| "step": 1580 | |
| }, | |
| { | |
| "entropy": 2.1722445487976074, | |
| "epoch": 1.2269832078749277, | |
| "grad_norm": 6.017771244049072, | |
| "learning_rate": 1.7669005650169036e-05, | |
| "loss": 0.09015928506851197, | |
| "mean_token_accuracy": 0.9817434221506118, | |
| "num_tokens": 5720234.0, | |
| "step": 1590 | |
| }, | |
| { | |
| "entropy": 2.2104188591241836, | |
| "epoch": 1.234703725149585, | |
| "grad_norm": 3.4765541553497314, | |
| "learning_rate": 1.7636830944649628e-05, | |
| "loss": 0.06509234309196472, | |
| "mean_token_accuracy": 0.9830342516303062, | |
| "num_tokens": 5757637.0, | |
| "step": 1600 | |
| }, | |
| { | |
| "entropy": 2.198525631427765, | |
| "epoch": 1.2424242424242424, | |
| "grad_norm": 3.086829662322998, | |
| "learning_rate": 1.760446542898859e-05, | |
| "loss": 0.08481130599975586, | |
| "mean_token_accuracy": 0.9725503459572792, | |
| "num_tokens": 5792399.0, | |
| "step": 1610 | |
| }, | |
| { | |
| "entropy": 2.157542425394058, | |
| "epoch": 1.2501447596989, | |
| "grad_norm": 3.6862778663635254, | |
| "learning_rate": 1.757190991185495e-05, | |
| "loss": 0.02577916383743286, | |
| "mean_token_accuracy": 0.9937169313430786, | |
| "num_tokens": 5830379.0, | |
| "step": 1620 | |
| }, | |
| { | |
| "entropy": 2.2169549256563186, | |
| "epoch": 1.2578652769735572, | |
| "grad_norm": 6.9190192222595215, | |
| "learning_rate": 1.7539165206665018e-05, | |
| "loss": 0.11887587308883667, | |
| "mean_token_accuracy": 0.9760968968272209, | |
| "num_tokens": 5863578.0, | |
| "step": 1630 | |
| }, | |
| { | |
| "entropy": 2.173180091381073, | |
| "epoch": 1.2655857942482147, | |
| "grad_norm": 1.0279117822647095, | |
| "learning_rate": 1.750623213156206e-05, | |
| "loss": 0.03408839702606201, | |
| "mean_token_accuracy": 0.9902668550610543, | |
| "num_tokens": 5899214.0, | |
| "step": 1640 | |
| }, | |
| { | |
| "entropy": 2.155381426215172, | |
| "epoch": 1.273306311522872, | |
| "grad_norm": 0.8708764910697937, | |
| "learning_rate": 1.747311150939587e-05, | |
| "loss": 0.05587180852890015, | |
| "mean_token_accuracy": 0.9896471053361893, | |
| "num_tokens": 5935324.0, | |
| "step": 1650 | |
| }, | |
| { | |
| "entropy": 2.2335609972476957, | |
| "epoch": 1.2810268287975295, | |
| "grad_norm": 0.13011370599269867, | |
| "learning_rate": 1.743980416770219e-05, | |
| "loss": 0.035541835427284243, | |
| "mean_token_accuracy": 0.9919782534241677, | |
| "num_tokens": 5966942.0, | |
| "step": 1660 | |
| }, | |
| { | |
| "entropy": 2.1988327890634536, | |
| "epoch": 1.2887473460721868, | |
| "grad_norm": 0.10344131290912628, | |
| "learning_rate": 1.7406310938682048e-05, | |
| "loss": 0.046973693370819095, | |
| "mean_token_accuracy": 0.9925320342183113, | |
| "num_tokens": 6008187.0, | |
| "step": 1670 | |
| }, | |
| { | |
| "entropy": 2.23958740234375, | |
| "epoch": 1.2964678633468443, | |
| "grad_norm": 0.11602122336626053, | |
| "learning_rate": 1.7372632659180973e-05, | |
| "loss": 0.07079730033874512, | |
| "mean_token_accuracy": 0.9836244836449624, | |
| "num_tokens": 6041987.0, | |
| "step": 1680 | |
| }, | |
| { | |
| "entropy": 2.216384118795395, | |
| "epoch": 1.3041883806215018, | |
| "grad_norm": 2.2172930240631104, | |
| "learning_rate": 1.7338770170668067e-05, | |
| "loss": 0.03326311707496643, | |
| "mean_token_accuracy": 0.9883291959762573, | |
| "num_tokens": 6075157.0, | |
| "step": 1690 | |
| }, | |
| { | |
| "entropy": 2.1252345502376557, | |
| "epoch": 1.311908897896159, | |
| "grad_norm": 5.477461338043213, | |
| "learning_rate": 1.7304724319214984e-05, | |
| "loss": 0.06135511994361877, | |
| "mean_token_accuracy": 0.9845748677849769, | |
| "num_tokens": 6109370.0, | |
| "step": 1700 | |
| }, | |
| { | |
| "entropy": 2.1932441532611846, | |
| "epoch": 1.3196294151708163, | |
| "grad_norm": 1.0600680112838745, | |
| "learning_rate": 1.7270495955474804e-05, | |
| "loss": 0.06867148280143738, | |
| "mean_token_accuracy": 0.9842336073517799, | |
| "num_tokens": 6145950.0, | |
| "step": 1710 | |
| }, | |
| { | |
| "entropy": 2.228517660498619, | |
| "epoch": 1.3273499324454738, | |
| "grad_norm": 5.043092727661133, | |
| "learning_rate": 1.7236085934660767e-05, | |
| "loss": 0.06131213903427124, | |
| "mean_token_accuracy": 0.9860150918364525, | |
| "num_tokens": 6179698.0, | |
| "step": 1720 | |
| }, | |
| { | |
| "entropy": 2.147132176160812, | |
| "epoch": 1.3350704497201313, | |
| "grad_norm": 5.398331642150879, | |
| "learning_rate": 1.7201495116524904e-05, | |
| "loss": 0.06988582611083985, | |
| "mean_token_accuracy": 0.981314155459404, | |
| "num_tokens": 6217407.0, | |
| "step": 1730 | |
| }, | |
| { | |
| "entropy": 2.1961726933717727, | |
| "epoch": 1.3427909669947886, | |
| "grad_norm": 0.382192462682724, | |
| "learning_rate": 1.7166724365336567e-05, | |
| "loss": 0.04062625765800476, | |
| "mean_token_accuracy": 0.990032197535038, | |
| "num_tokens": 6254526.0, | |
| "step": 1740 | |
| }, | |
| { | |
| "entropy": 2.1768340557813644, | |
| "epoch": 1.3505114842694461, | |
| "grad_norm": 0.16774038970470428, | |
| "learning_rate": 1.7131774549860826e-05, | |
| "loss": 0.04462065696716309, | |
| "mean_token_accuracy": 0.9879740357398987, | |
| "num_tokens": 6291562.0, | |
| "step": 1750 | |
| }, | |
| { | |
| "entropy": 2.2020132303237916, | |
| "epoch": 1.3582320015441034, | |
| "grad_norm": 0.23544009029865265, | |
| "learning_rate": 1.7096646543336762e-05, | |
| "loss": 0.06595144867897033, | |
| "mean_token_accuracy": 0.9833995521068573, | |
| "num_tokens": 6325477.0, | |
| "step": 1760 | |
| }, | |
| { | |
| "entropy": 2.2006499111652373, | |
| "epoch": 1.365952518818761, | |
| "grad_norm": 4.985975742340088, | |
| "learning_rate": 1.7061341223455644e-05, | |
| "loss": 0.05818561315536499, | |
| "mean_token_accuracy": 0.9816210448741913, | |
| "num_tokens": 6362473.0, | |
| "step": 1770 | |
| }, | |
| { | |
| "entropy": 2.243510177731514, | |
| "epoch": 1.3736730360934182, | |
| "grad_norm": 1.5532886981964111, | |
| "learning_rate": 1.7025859472339026e-05, | |
| "loss": 0.04559597373008728, | |
| "mean_token_accuracy": 0.9878525719046592, | |
| "num_tokens": 6397995.0, | |
| "step": 1780 | |
| }, | |
| { | |
| "entropy": 2.2276618093252183, | |
| "epoch": 1.3813935533680757, | |
| "grad_norm": 5.254858493804932, | |
| "learning_rate": 1.699020217651667e-05, | |
| "loss": 0.07693036198616028, | |
| "mean_token_accuracy": 0.9713233038783073, | |
| "num_tokens": 6435700.0, | |
| "step": 1790 | |
| }, | |
| { | |
| "entropy": 2.214624211192131, | |
| "epoch": 1.3891140706427332, | |
| "grad_norm": 1.3537747859954834, | |
| "learning_rate": 1.695437022690441e-05, | |
| "loss": 0.0476935863494873, | |
| "mean_token_accuracy": 0.9899505183100701, | |
| "num_tokens": 6470710.0, | |
| "step": 1800 | |
| }, | |
| { | |
| "entropy": 2.2236395120620727, | |
| "epoch": 1.3968345879173905, | |
| "grad_norm": 2.256129741668701, | |
| "learning_rate": 1.691836451878191e-05, | |
| "loss": 0.057245922088623044, | |
| "mean_token_accuracy": 0.9842681303620339, | |
| "num_tokens": 6504059.0, | |
| "step": 1810 | |
| }, | |
| { | |
| "entropy": 2.194809466600418, | |
| "epoch": 1.4045551051920477, | |
| "grad_norm": 2.1219875812530518, | |
| "learning_rate": 1.688218595177027e-05, | |
| "loss": 0.095030015707016, | |
| "mean_token_accuracy": 0.977275763452053, | |
| "num_tokens": 6544244.0, | |
| "step": 1820 | |
| }, | |
| { | |
| "entropy": 2.189770597219467, | |
| "epoch": 1.4122756224667052, | |
| "grad_norm": 2.9641566276550293, | |
| "learning_rate": 1.6845835429809555e-05, | |
| "loss": 0.03089151084423065, | |
| "mean_token_accuracy": 0.9881447196006775, | |
| "num_tokens": 6575887.0, | |
| "step": 1830 | |
| }, | |
| { | |
| "entropy": 2.275960248708725, | |
| "epoch": 1.4199961397413627, | |
| "grad_norm": 3.321671724319458, | |
| "learning_rate": 1.6809313861136226e-05, | |
| "loss": 0.07831167578697204, | |
| "mean_token_accuracy": 0.9799184516072273, | |
| "num_tokens": 6604723.0, | |
| "step": 1840 | |
| }, | |
| { | |
| "entropy": 2.126830631494522, | |
| "epoch": 1.42771665701602, | |
| "grad_norm": 2.0569241046905518, | |
| "learning_rate": 1.6772622158260418e-05, | |
| "loss": 0.06082758903503418, | |
| "mean_token_accuracy": 0.9850939080119133, | |
| "num_tokens": 6642777.0, | |
| "step": 1850 | |
| }, | |
| { | |
| "entropy": 2.176947274804115, | |
| "epoch": 1.4354371742906775, | |
| "grad_norm": 0.6401554346084595, | |
| "learning_rate": 1.6735761237943166e-05, | |
| "loss": 0.06684135794639587, | |
| "mean_token_accuracy": 0.987571682035923, | |
| "num_tokens": 6682558.0, | |
| "step": 1860 | |
| }, | |
| { | |
| "entropy": 2.2031300246715544, | |
| "epoch": 1.4431576915653348, | |
| "grad_norm": 2.8854594230651855, | |
| "learning_rate": 1.6698732021173487e-05, | |
| "loss": 0.09527165293693543, | |
| "mean_token_accuracy": 0.9732189521193504, | |
| "num_tokens": 6717269.0, | |
| "step": 1870 | |
| }, | |
| { | |
| "entropy": 2.1681358337402346, | |
| "epoch": 1.4508782088399923, | |
| "grad_norm": 2.4058427810668945, | |
| "learning_rate": 1.666153543314537e-05, | |
| "loss": 0.048515334725379944, | |
| "mean_token_accuracy": 0.9848218783736229, | |
| "num_tokens": 6750783.0, | |
| "step": 1880 | |
| }, | |
| { | |
| "entropy": 2.209766998887062, | |
| "epoch": 1.4585987261146496, | |
| "grad_norm": 2.2834815979003906, | |
| "learning_rate": 1.6624172403234665e-05, | |
| "loss": 0.10613754987716675, | |
| "mean_token_accuracy": 0.9813075616955758, | |
| "num_tokens": 6784045.0, | |
| "step": 1890 | |
| }, | |
| { | |
| "entropy": 2.160476252436638, | |
| "epoch": 1.466319243389307, | |
| "grad_norm": 3.1155428886413574, | |
| "learning_rate": 1.6586643864975855e-05, | |
| "loss": 0.07376494407653808, | |
| "mean_token_accuracy": 0.9834692224860191, | |
| "num_tokens": 6824477.0, | |
| "step": 1900 | |
| }, | |
| { | |
| "entropy": 2.1634534388780593, | |
| "epoch": 1.4740397606639646, | |
| "grad_norm": 0.3001392185688019, | |
| "learning_rate": 1.6548950756038732e-05, | |
| "loss": 0.02613011598587036, | |
| "mean_token_accuracy": 0.9920083448290825, | |
| "num_tokens": 6864508.0, | |
| "step": 1910 | |
| }, | |
| { | |
| "entropy": 2.2088223576545714, | |
| "epoch": 1.4817602779386219, | |
| "grad_norm": 0.03745020180940628, | |
| "learning_rate": 1.6511094018204973e-05, | |
| "loss": 0.04845433235168457, | |
| "mean_token_accuracy": 0.9827080830931664, | |
| "num_tokens": 6902920.0, | |
| "step": 1920 | |
| }, | |
| { | |
| "entropy": 2.2410172671079636, | |
| "epoch": 1.4894807952132794, | |
| "grad_norm": 4.202921390533447, | |
| "learning_rate": 1.6473074597344608e-05, | |
| "loss": 0.07904167175292968, | |
| "mean_token_accuracy": 0.9802842602133751, | |
| "num_tokens": 6934196.0, | |
| "step": 1930 | |
| }, | |
| { | |
| "entropy": 2.2144098430871964, | |
| "epoch": 1.4972013124879366, | |
| "grad_norm": 3.0965535640716553, | |
| "learning_rate": 1.6434893443392388e-05, | |
| "loss": 0.06525328755378723, | |
| "mean_token_accuracy": 0.9790870904922485, | |
| "num_tokens": 6975432.0, | |
| "step": 1940 | |
| }, | |
| { | |
| "entropy": 2.210488173365593, | |
| "epoch": 1.5049218297625941, | |
| "grad_norm": 1.5190048217773438, | |
| "learning_rate": 1.6396551510324043e-05, | |
| "loss": 0.048443767428398135, | |
| "mean_token_accuracy": 0.9841597318649292, | |
| "num_tokens": 7014183.0, | |
| "step": 1950 | |
| }, | |
| { | |
| "entropy": 2.2083949983119964, | |
| "epoch": 1.5126423470372514, | |
| "grad_norm": 3.4382431507110596, | |
| "learning_rate": 1.6358049756132447e-05, | |
| "loss": 0.050505822896957396, | |
| "mean_token_accuracy": 0.98332499563694, | |
| "num_tokens": 7048113.0, | |
| "step": 1960 | |
| }, | |
| { | |
| "entropy": 2.1718403518199922, | |
| "epoch": 1.520362864311909, | |
| "grad_norm": 4.148841381072998, | |
| "learning_rate": 1.6319389142803705e-05, | |
| "loss": 0.08080021142959595, | |
| "mean_token_accuracy": 0.9764597907662391, | |
| "num_tokens": 7082017.0, | |
| "step": 1970 | |
| }, | |
| { | |
| "entropy": 2.202728974819183, | |
| "epoch": 1.5280833815865664, | |
| "grad_norm": 1.0588070154190063, | |
| "learning_rate": 1.6280570636293084e-05, | |
| "loss": 0.06684384942054748, | |
| "mean_token_accuracy": 0.9894752979278565, | |
| "num_tokens": 7117299.0, | |
| "step": 1980 | |
| }, | |
| { | |
| "entropy": 2.1958726704120637, | |
| "epoch": 1.5358038988612237, | |
| "grad_norm": 1.6634799242019653, | |
| "learning_rate": 1.6241595206500897e-05, | |
| "loss": 0.06764208674430847, | |
| "mean_token_accuracy": 0.984419621527195, | |
| "num_tokens": 7153932.0, | |
| "step": 1990 | |
| }, | |
| { | |
| "entropy": 2.207414472103119, | |
| "epoch": 1.543524416135881, | |
| "grad_norm": 3.5081145763397217, | |
| "learning_rate": 1.6202463827248265e-05, | |
| "loss": 0.06235606074333191, | |
| "mean_token_accuracy": 0.9850886449217796, | |
| "num_tokens": 7187474.0, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 1.543524416135881, | |
| "eval_entropy": 2.09292504755058, | |
| "eval_loss": 0.44610196352005005, | |
| "eval_mean_token_accuracy": 0.9292889271036584, | |
| "eval_num_tokens": 7187474.0, | |
| "eval_runtime": 987.9783, | |
| "eval_samples_per_second": 7.744, | |
| "eval_steps_per_second": 0.969, | |
| "step": 2000 | |
| }, | |
| { | |
| "entropy": 2.1876722425222397, | |
| "epoch": 1.5512449334105385, | |
| "grad_norm": 2.9447176456451416, | |
| "learning_rate": 1.6163177476252787e-05, | |
| "loss": 0.1231013298034668, | |
| "mean_token_accuracy": 0.9771831795573235, | |
| "num_tokens": 7224686.0, | |
| "step": 2010 | |
| }, | |
| { | |
| "entropy": 2.2381023466587067, | |
| "epoch": 1.558965450685196, | |
| "grad_norm": 4.822196006774902, | |
| "learning_rate": 1.612373713510411e-05, | |
| "loss": 0.03697749674320221, | |
| "mean_token_accuracy": 0.9885532259941101, | |
| "num_tokens": 7259356.0, | |
| "step": 2020 | |
| }, | |
| { | |
| "entropy": 2.2796195298433304, | |
| "epoch": 1.5666859679598533, | |
| "grad_norm": 1.0182671546936035, | |
| "learning_rate": 1.608414378923941e-05, | |
| "loss": 0.05077391862869263, | |
| "mean_token_accuracy": 0.988129609823227, | |
| "num_tokens": 7289152.0, | |
| "step": 2030 | |
| }, | |
| { | |
| "entropy": 2.2358617722988128, | |
| "epoch": 1.5744064852345108, | |
| "grad_norm": 2.3968863487243652, | |
| "learning_rate": 1.6044398427918754e-05, | |
| "loss": 0.06050935983657837, | |
| "mean_token_accuracy": 0.9812897890806198, | |
| "num_tokens": 7325050.0, | |
| "step": 2040 | |
| }, | |
| { | |
| "entropy": 2.174675610661507, | |
| "epoch": 1.5821270025091683, | |
| "grad_norm": 0.130416139960289, | |
| "learning_rate": 1.60045020442004e-05, | |
| "loss": 0.057877928018569946, | |
| "mean_token_accuracy": 0.9885829269886017, | |
| "num_tokens": 7361592.0, | |
| "step": 2050 | |
| }, | |
| { | |
| "entropy": 2.2293392330408097, | |
| "epoch": 1.5898475197838255, | |
| "grad_norm": 1.2082692384719849, | |
| "learning_rate": 1.5964455634915975e-05, | |
| "loss": 0.07877171635627747, | |
| "mean_token_accuracy": 0.9803994312882424, | |
| "num_tokens": 7394992.0, | |
| "step": 2060 | |
| }, | |
| { | |
| "entropy": 2.1638178408145903, | |
| "epoch": 1.5975680370584828, | |
| "grad_norm": 0.13079890608787537, | |
| "learning_rate": 1.5924260200645574e-05, | |
| "loss": 0.03450520932674408, | |
| "mean_token_accuracy": 0.993475878238678, | |
| "num_tokens": 7426832.0, | |
| "step": 2070 | |
| }, | |
| { | |
| "entropy": 2.31286364197731, | |
| "epoch": 1.6052885543331403, | |
| "grad_norm": 1.7269318103790283, | |
| "learning_rate": 1.5883916745692766e-05, | |
| "loss": 0.04786880314350128, | |
| "mean_token_accuracy": 0.9854305148124695, | |
| "num_tokens": 7459101.0, | |
| "step": 2080 | |
| }, | |
| { | |
| "entropy": 2.181331729888916, | |
| "epoch": 1.6130090716077978, | |
| "grad_norm": 2.854979991912842, | |
| "learning_rate": 1.584342627805947e-05, | |
| "loss": 0.04439874291419983, | |
| "mean_token_accuracy": 0.9889310583472252, | |
| "num_tokens": 7498208.0, | |
| "step": 2090 | |
| }, | |
| { | |
| "entropy": 2.201298424601555, | |
| "epoch": 1.620729588882455, | |
| "grad_norm": 3.3388164043426514, | |
| "learning_rate": 1.5802789809420812e-05, | |
| "loss": 0.057651227712631224, | |
| "mean_token_accuracy": 0.9866861075162887, | |
| "num_tokens": 7531350.0, | |
| "step": 2100 | |
| }, | |
| { | |
| "entropy": 2.1975525587797167, | |
| "epoch": 1.6284501061571124, | |
| "grad_norm": 1.4861758947372437, | |
| "learning_rate": 1.5762008355099824e-05, | |
| "loss": 0.04551325440406799, | |
| "mean_token_accuracy": 0.9858617588877678, | |
| "num_tokens": 7571182.0, | |
| "step": 2110 | |
| }, | |
| { | |
| "entropy": 2.2160713732242585, | |
| "epoch": 1.6361706234317699, | |
| "grad_norm": 2.163928985595703, | |
| "learning_rate": 1.5721082934042077e-05, | |
| "loss": 0.055477970838546754, | |
| "mean_token_accuracy": 0.9858786046504975, | |
| "num_tokens": 7602483.0, | |
| "step": 2120 | |
| }, | |
| { | |
| "entropy": 2.2408920913934707, | |
| "epoch": 1.6438911407064274, | |
| "grad_norm": 0.31985145807266235, | |
| "learning_rate": 1.5680014568790224e-05, | |
| "loss": 0.04159039855003357, | |
| "mean_token_accuracy": 0.9852373600006104, | |
| "num_tokens": 7637929.0, | |
| "step": 2130 | |
| }, | |
| { | |
| "entropy": 2.2200376480817794, | |
| "epoch": 1.6516116579810847, | |
| "grad_norm": 0.9541903734207153, | |
| "learning_rate": 1.5638804285458453e-05, | |
| "loss": 0.08421515226364136, | |
| "mean_token_accuracy": 0.980931767821312, | |
| "num_tokens": 7672999.0, | |
| "step": 2140 | |
| }, | |
| { | |
| "entropy": 2.203143599629402, | |
| "epoch": 1.6593321752557422, | |
| "grad_norm": 1.1459593772888184, | |
| "learning_rate": 1.5597453113706854e-05, | |
| "loss": 0.06661672592163086, | |
| "mean_token_accuracy": 0.9839463055133819, | |
| "num_tokens": 7709356.0, | |
| "step": 2150 | |
| }, | |
| { | |
| "entropy": 2.1805380463600157, | |
| "epoch": 1.6670526925303997, | |
| "grad_norm": 1.9122540950775146, | |
| "learning_rate": 1.555596208671568e-05, | |
| "loss": 0.07211873531341553, | |
| "mean_token_accuracy": 0.9839503139257431, | |
| "num_tokens": 7743958.0, | |
| "step": 2160 | |
| }, | |
| { | |
| "entropy": 2.2309546947479246, | |
| "epoch": 1.674773209805057, | |
| "grad_norm": 0.19467999041080475, | |
| "learning_rate": 1.5514332241159535e-05, | |
| "loss": 0.02178901433944702, | |
| "mean_token_accuracy": 0.9955803573131561, | |
| "num_tokens": 7781564.0, | |
| "step": 2170 | |
| }, | |
| { | |
| "entropy": 2.212314310669899, | |
| "epoch": 1.6824937270797142, | |
| "grad_norm": 7.478359222412109, | |
| "learning_rate": 1.5472564617181487e-05, | |
| "loss": 0.0869008719921112, | |
| "mean_token_accuracy": 0.9849289789795875, | |
| "num_tokens": 7819885.0, | |
| "step": 2180 | |
| }, | |
| { | |
| "entropy": 2.2491566449403764, | |
| "epoch": 1.6902142443543717, | |
| "grad_norm": 6.772735118865967, | |
| "learning_rate": 1.543066025836706e-05, | |
| "loss": 0.07113047838211059, | |
| "mean_token_accuracy": 0.982619047164917, | |
| "num_tokens": 7851412.0, | |
| "step": 2190 | |
| }, | |
| { | |
| "entropy": 2.213401734828949, | |
| "epoch": 1.6979347616290292, | |
| "grad_norm": 4.968042373657227, | |
| "learning_rate": 1.5388620211718174e-05, | |
| "loss": 0.04826553165912628, | |
| "mean_token_accuracy": 0.9854778051376343, | |
| "num_tokens": 7887905.0, | |
| "step": 2200 | |
| }, | |
| { | |
| "entropy": 2.296232557296753, | |
| "epoch": 1.7056552789036865, | |
| "grad_norm": 1.3846877813339233, | |
| "learning_rate": 1.5346445527626973e-05, | |
| "loss": 0.07143614888191223, | |
| "mean_token_accuracy": 0.9899365901947021, | |
| "num_tokens": 7917823.0, | |
| "step": 2210 | |
| }, | |
| { | |
| "entropy": 2.150168251991272, | |
| "epoch": 1.7133757961783438, | |
| "grad_norm": 0.08897116035223007, | |
| "learning_rate": 1.5304137259849596e-05, | |
| "loss": 0.03860937356948853, | |
| "mean_token_accuracy": 0.98958979845047, | |
| "num_tokens": 7957105.0, | |
| "step": 2220 | |
| }, | |
| { | |
| "entropy": 2.1939960032701493, | |
| "epoch": 1.7210963134530015, | |
| "grad_norm": 1.8421629667282104, | |
| "learning_rate": 1.5261696465479823e-05, | |
| "loss": 0.034920766949653625, | |
| "mean_token_accuracy": 0.9868922352790832, | |
| "num_tokens": 7990604.0, | |
| "step": 2230 | |
| }, | |
| { | |
| "entropy": 2.248343914747238, | |
| "epoch": 1.7288168307276588, | |
| "grad_norm": 0.1955411583185196, | |
| "learning_rate": 1.52191242049227e-05, | |
| "loss": 0.026687222719192504, | |
| "mean_token_accuracy": 0.9909184098243713, | |
| "num_tokens": 8025473.0, | |
| "step": 2240 | |
| }, | |
| { | |
| "entropy": 2.176126691699028, | |
| "epoch": 1.736537348002316, | |
| "grad_norm": 3.4646553993225098, | |
| "learning_rate": 1.5176421541868003e-05, | |
| "loss": 0.041455024480819704, | |
| "mean_token_accuracy": 0.987688897550106, | |
| "num_tokens": 8063276.0, | |
| "step": 2250 | |
| }, | |
| { | |
| "entropy": 2.2357524156570436, | |
| "epoch": 1.7442578652769736, | |
| "grad_norm": 2.85046124458313, | |
| "learning_rate": 1.5133589543263693e-05, | |
| "loss": 0.029646474123001098, | |
| "mean_token_accuracy": 0.9920761302113533, | |
| "num_tokens": 8095731.0, | |
| "step": 2260 | |
| }, | |
| { | |
| "entropy": 2.230524700880051, | |
| "epoch": 1.751978382551631, | |
| "grad_norm": 0.2627425789833069, | |
| "learning_rate": 1.5090629279289247e-05, | |
| "loss": 0.05477217435836792, | |
| "mean_token_accuracy": 0.9860235080122948, | |
| "num_tokens": 8134788.0, | |
| "step": 2270 | |
| }, | |
| { | |
| "entropy": 2.232674279808998, | |
| "epoch": 1.7596988998262884, | |
| "grad_norm": 5.077950477600098, | |
| "learning_rate": 1.5047541823328913e-05, | |
| "loss": 0.039683285355567935, | |
| "mean_token_accuracy": 0.9911200389266014, | |
| "num_tokens": 8168847.0, | |
| "step": 2280 | |
| }, | |
| { | |
| "entropy": 2.1635669827461244, | |
| "epoch": 1.7674194171009456, | |
| "grad_norm": 5.3769731521606445, | |
| "learning_rate": 1.5004328251944898e-05, | |
| "loss": 0.06116831302642822, | |
| "mean_token_accuracy": 0.9856468245387078, | |
| "num_tokens": 8203225.0, | |
| "step": 2290 | |
| }, | |
| { | |
| "entropy": 2.2570940554142, | |
| "epoch": 1.7751399343756031, | |
| "grad_norm": 1.6257141828536987, | |
| "learning_rate": 1.4960989644850461e-05, | |
| "loss": 0.06121355891227722, | |
| "mean_token_accuracy": 0.9865431234240531, | |
| "num_tokens": 8235676.0, | |
| "step": 2300 | |
| }, | |
| { | |
| "entropy": 2.148748704791069, | |
| "epoch": 1.7828604516502606, | |
| "grad_norm": 1.410240650177002, | |
| "learning_rate": 1.4917527084882962e-05, | |
| "loss": 0.060073697566986085, | |
| "mean_token_accuracy": 0.9826793894171715, | |
| "num_tokens": 8271787.0, | |
| "step": 2310 | |
| }, | |
| { | |
| "entropy": 2.259695219993591, | |
| "epoch": 1.790580968924918, | |
| "grad_norm": 0.7643431425094604, | |
| "learning_rate": 1.4873941657976758e-05, | |
| "loss": 0.045375460386276247, | |
| "mean_token_accuracy": 0.991543410718441, | |
| "num_tokens": 8305741.0, | |
| "step": 2320 | |
| }, | |
| { | |
| "entropy": 2.2634156942367554, | |
| "epoch": 1.7983014861995754, | |
| "grad_norm": 1.8315523862838745, | |
| "learning_rate": 1.483023445313613e-05, | |
| "loss": 0.06367403268814087, | |
| "mean_token_accuracy": 0.9873386204242707, | |
| "num_tokens": 8339552.0, | |
| "step": 2330 | |
| }, | |
| { | |
| "entropy": 2.2267695903778075, | |
| "epoch": 1.806022003474233, | |
| "grad_norm": 0.7167631387710571, | |
| "learning_rate": 1.4786406562408018e-05, | |
| "loss": 0.04319778382778168, | |
| "mean_token_accuracy": 0.9907146960496902, | |
| "num_tokens": 8373748.0, | |
| "step": 2340 | |
| }, | |
| { | |
| "entropy": 2.2331454545259475, | |
| "epoch": 1.8137425207488902, | |
| "grad_norm": 0.07811649143695831, | |
| "learning_rate": 1.4742459080854776e-05, | |
| "loss": 0.07732252478599548, | |
| "mean_token_accuracy": 0.9835749432444573, | |
| "num_tokens": 8405602.0, | |
| "step": 2350 | |
| }, | |
| { | |
| "entropy": 2.206145229935646, | |
| "epoch": 1.8214630380235475, | |
| "grad_norm": 2.4456584453582764, | |
| "learning_rate": 1.4698393106526794e-05, | |
| "loss": 0.04599563479423523, | |
| "mean_token_accuracy": 0.9887336835265159, | |
| "num_tokens": 8440623.0, | |
| "step": 2360 | |
| }, | |
| { | |
| "entropy": 2.185474079847336, | |
| "epoch": 1.829183555298205, | |
| "grad_norm": 2.7905468940734863, | |
| "learning_rate": 1.4654209740435058e-05, | |
| "loss": 0.10312718152999878, | |
| "mean_token_accuracy": 0.9773416921496392, | |
| "num_tokens": 8478808.0, | |
| "step": 2370 | |
| }, | |
| { | |
| "entropy": 2.1824015408754347, | |
| "epoch": 1.8369040725728625, | |
| "grad_norm": 3.6272330284118652, | |
| "learning_rate": 1.4609910086523656e-05, | |
| "loss": 0.03959389925003052, | |
| "mean_token_accuracy": 0.988817447423935, | |
| "num_tokens": 8518513.0, | |
| "step": 2380 | |
| }, | |
| { | |
| "entropy": 2.2420704424381257, | |
| "epoch": 1.8446245898475198, | |
| "grad_norm": 2.7875003814697266, | |
| "learning_rate": 1.4565495251642177e-05, | |
| "loss": 0.03577028214931488, | |
| "mean_token_accuracy": 0.9905984789133072, | |
| "num_tokens": 8551680.0, | |
| "step": 2390 | |
| }, | |
| { | |
| "entropy": 2.2019168078899383, | |
| "epoch": 1.852345107122177, | |
| "grad_norm": 1.5845329761505127, | |
| "learning_rate": 1.4520966345518076e-05, | |
| "loss": 0.032679545879364016, | |
| "mean_token_accuracy": 0.9905828937888146, | |
| "num_tokens": 8586760.0, | |
| "step": 2400 | |
| }, | |
| { | |
| "entropy": 2.1899552077054976, | |
| "epoch": 1.8600656243968345, | |
| "grad_norm": 2.2608611583709717, | |
| "learning_rate": 1.447632448072893e-05, | |
| "loss": 0.06101080775260925, | |
| "mean_token_accuracy": 0.9878913164138794, | |
| "num_tokens": 8623094.0, | |
| "step": 2410 | |
| }, | |
| { | |
| "entropy": 2.147029626369476, | |
| "epoch": 1.867786141671492, | |
| "grad_norm": 5.116804122924805, | |
| "learning_rate": 1.443157077267465e-05, | |
| "loss": 0.06001234650611877, | |
| "mean_token_accuracy": 0.9865107357501983, | |
| "num_tokens": 8661163.0, | |
| "step": 2420 | |
| }, | |
| { | |
| "entropy": 2.226870185136795, | |
| "epoch": 1.8755066589461493, | |
| "grad_norm": 0.31566572189331055, | |
| "learning_rate": 1.4386706339549608e-05, | |
| "loss": 0.04123932719230652, | |
| "mean_token_accuracy": 0.9899785459041596, | |
| "num_tokens": 8692034.0, | |
| "step": 2430 | |
| }, | |
| { | |
| "entropy": 2.1588668793439867, | |
| "epoch": 1.8832271762208068, | |
| "grad_norm": 0.9417765140533447, | |
| "learning_rate": 1.4341732302314695e-05, | |
| "loss": 0.06338693499565125, | |
| "mean_token_accuracy": 0.9791759848594666, | |
| "num_tokens": 8727679.0, | |
| "step": 2440 | |
| }, | |
| { | |
| "entropy": 2.2481164067983626, | |
| "epoch": 1.8909476934954643, | |
| "grad_norm": 2.853949785232544, | |
| "learning_rate": 1.4296649784669317e-05, | |
| "loss": 0.040822142362594606, | |
| "mean_token_accuracy": 0.9924886748194695, | |
| "num_tokens": 8765739.0, | |
| "step": 2450 | |
| }, | |
| { | |
| "entropy": 2.16390860080719, | |
| "epoch": 1.8986682107701216, | |
| "grad_norm": 0.7499203681945801, | |
| "learning_rate": 1.4251459913023326e-05, | |
| "loss": 0.03524640500545502, | |
| "mean_token_accuracy": 0.9882998391985893, | |
| "num_tokens": 8800881.0, | |
| "step": 2460 | |
| }, | |
| { | |
| "entropy": 2.2302677065134047, | |
| "epoch": 1.9063887280447789, | |
| "grad_norm": 2.2339160442352295, | |
| "learning_rate": 1.4206163816468861e-05, | |
| "loss": 0.05475660562515259, | |
| "mean_token_accuracy": 0.9859271243214607, | |
| "num_tokens": 8831211.0, | |
| "step": 2470 | |
| }, | |
| { | |
| "entropy": 2.176157131791115, | |
| "epoch": 1.9141092453194364, | |
| "grad_norm": 2.105004072189331, | |
| "learning_rate": 1.416076262675215e-05, | |
| "loss": 0.054158592224121095, | |
| "mean_token_accuracy": 0.9859476014971733, | |
| "num_tokens": 8870055.0, | |
| "step": 2480 | |
| }, | |
| { | |
| "entropy": 2.1534419268369676, | |
| "epoch": 1.9218297625940939, | |
| "grad_norm": 1.5954450368881226, | |
| "learning_rate": 1.4115257478245223e-05, | |
| "loss": 0.03219989836215973, | |
| "mean_token_accuracy": 0.9903153285384179, | |
| "num_tokens": 8906260.0, | |
| "step": 2490 | |
| }, | |
| { | |
| "entropy": 2.219716268777847, | |
| "epoch": 1.9295502798687512, | |
| "grad_norm": 6.508073329925537, | |
| "learning_rate": 1.4069649507917578e-05, | |
| "loss": 0.08166940808296204, | |
| "mean_token_accuracy": 0.9832880064845085, | |
| "num_tokens": 8938492.0, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 1.9295502798687512, | |
| "eval_entropy": 2.09807589759149, | |
| "eval_loss": 0.4539739787578583, | |
| "eval_mean_token_accuracy": 0.9317483626687539, | |
| "eval_num_tokens": 8938492.0, | |
| "eval_runtime": 988.2689, | |
| "eval_samples_per_second": 7.742, | |
| "eval_steps_per_second": 0.968, | |
| "step": 2500 | |
| }, | |
| { | |
| "entropy": 2.234724909067154, | |
| "epoch": 1.9372707971434087, | |
| "grad_norm": 1.7193647623062134, | |
| "learning_rate": 1.4023939855307764e-05, | |
| "loss": 0.04806544184684754, | |
| "mean_token_accuracy": 0.9910022959113121, | |
| "num_tokens": 8972850.0, | |
| "step": 2510 | |
| }, | |
| { | |
| "entropy": 2.198562887310982, | |
| "epoch": 1.9449913144180662, | |
| "grad_norm": 2.7927255630493164, | |
| "learning_rate": 1.397812966249492e-05, | |
| "loss": 0.06402395963668824, | |
| "mean_token_accuracy": 0.9840932011604309, | |
| "num_tokens": 9012403.0, | |
| "step": 2520 | |
| }, | |
| { | |
| "entropy": 2.2336697190999986, | |
| "epoch": 1.9527118316927234, | |
| "grad_norm": 5.629129886627197, | |
| "learning_rate": 1.3932220074070236e-05, | |
| "loss": 0.052779823541641235, | |
| "mean_token_accuracy": 0.9856812432408333, | |
| "num_tokens": 9049223.0, | |
| "step": 2530 | |
| }, | |
| { | |
| "entropy": 2.1691229969263075, | |
| "epoch": 1.9604323489673807, | |
| "grad_norm": 0.12791520357131958, | |
| "learning_rate": 1.3886212237108334e-05, | |
| "loss": 0.040309852361679076, | |
| "mean_token_accuracy": 0.9888273656368256, | |
| "num_tokens": 9086187.0, | |
| "step": 2540 | |
| }, | |
| { | |
| "entropy": 2.2491596221923826, | |
| "epoch": 1.9681528662420382, | |
| "grad_norm": 0.4085298478603363, | |
| "learning_rate": 1.384010730113865e-05, | |
| "loss": 0.02160833030939102, | |
| "mean_token_accuracy": 0.9909946650266648, | |
| "num_tokens": 9121957.0, | |
| "step": 2550 | |
| }, | |
| { | |
| "entropy": 2.1770587384700777, | |
| "epoch": 1.9758733835166957, | |
| "grad_norm": 0.27961045503616333, | |
| "learning_rate": 1.3793906418116674e-05, | |
| "loss": 0.07575550675392151, | |
| "mean_token_accuracy": 0.9829989477992058, | |
| "num_tokens": 9154073.0, | |
| "step": 2560 | |
| }, | |
| { | |
| "entropy": 2.262489286065102, | |
| "epoch": 1.983593900791353, | |
| "grad_norm": 0.30133992433547974, | |
| "learning_rate": 1.3747610742395185e-05, | |
| "loss": 0.049575185775756835, | |
| "mean_token_accuracy": 0.9877225264906884, | |
| "num_tokens": 9184603.0, | |
| "step": 2570 | |
| }, | |
| { | |
| "entropy": 2.157144469022751, | |
| "epoch": 1.9913144180660103, | |
| "grad_norm": 1.7762395143508911, | |
| "learning_rate": 1.3701221430695411e-05, | |
| "loss": 0.07316330075263977, | |
| "mean_token_accuracy": 0.9852767020463944, | |
| "num_tokens": 9220584.0, | |
| "step": 2580 | |
| }, | |
| { | |
| "entropy": 2.183892551064491, | |
| "epoch": 1.9990349353406678, | |
| "grad_norm": 0.4974443316459656, | |
| "learning_rate": 1.3654739642078115e-05, | |
| "loss": 0.030621829628944396, | |
| "mean_token_accuracy": 0.9909188866615295, | |
| "num_tokens": 9257900.0, | |
| "step": 2590 | |
| }, | |
| { | |
| "entropy": 2.1523505900357223, | |
| "epoch": 2.006176413819726, | |
| "grad_norm": 1.002280354499817, | |
| "learning_rate": 1.3608166537914653e-05, | |
| "loss": 0.03308936357498169, | |
| "mean_token_accuracy": 0.9905776703679884, | |
| "num_tokens": 9287566.0, | |
| "step": 2600 | |
| }, | |
| { | |
| "entropy": 2.1786624640226364, | |
| "epoch": 2.0138969310943833, | |
| "grad_norm": 1.7228094339370728, | |
| "learning_rate": 1.3561503281857935e-05, | |
| "loss": 0.024886465072631835, | |
| "mean_token_accuracy": 0.9927895620465279, | |
| "num_tokens": 9322676.0, | |
| "step": 2610 | |
| }, | |
| { | |
| "entropy": 2.1957814037799834, | |
| "epoch": 2.0216174483690406, | |
| "grad_norm": 1.4911882877349854, | |
| "learning_rate": 1.3514751039813373e-05, | |
| "loss": 0.02856048047542572, | |
| "mean_token_accuracy": 0.9912378385663032, | |
| "num_tokens": 9355944.0, | |
| "step": 2620 | |
| }, | |
| { | |
| "entropy": 2.2170669615268705, | |
| "epoch": 2.0293379656436983, | |
| "grad_norm": 2.101999282836914, | |
| "learning_rate": 1.3467910979909737e-05, | |
| "loss": 0.02958173453807831, | |
| "mean_token_accuracy": 0.9899841129779816, | |
| "num_tokens": 9388310.0, | |
| "step": 2630 | |
| }, | |
| { | |
| "entropy": 2.2836335778236387, | |
| "epoch": 2.0370584829183556, | |
| "grad_norm": 1.5629916191101074, | |
| "learning_rate": 1.3420984272469966e-05, | |
| "loss": 0.024695934355258943, | |
| "mean_token_accuracy": 0.9935079053044319, | |
| "num_tokens": 9421384.0, | |
| "step": 2640 | |
| }, | |
| { | |
| "entropy": 2.1128551036119463, | |
| "epoch": 2.044779000193013, | |
| "grad_norm": 0.04739844426512718, | |
| "learning_rate": 1.337397208998194e-05, | |
| "loss": 0.008467760682106019, | |
| "mean_token_accuracy": 0.9983387798070907, | |
| "num_tokens": 9458111.0, | |
| "step": 2650 | |
| }, | |
| { | |
| "entropy": 2.1693550407886506, | |
| "epoch": 2.05249951746767, | |
| "grad_norm": 0.9237629771232605, | |
| "learning_rate": 1.3326875607069167e-05, | |
| "loss": 0.030665600299835206, | |
| "mean_token_accuracy": 0.9918258935213089, | |
| "num_tokens": 9496587.0, | |
| "step": 2660 | |
| }, | |
| { | |
| "entropy": 2.15002136528492, | |
| "epoch": 2.060220034742328, | |
| "grad_norm": 4.3934807777404785, | |
| "learning_rate": 1.3279696000461453e-05, | |
| "loss": 0.06771356463432313, | |
| "mean_token_accuracy": 0.9814038887619972, | |
| "num_tokens": 9533430.0, | |
| "step": 2670 | |
| }, | |
| { | |
| "entropy": 2.2125822573900225, | |
| "epoch": 2.067940552016985, | |
| "grad_norm": 0.43496638536453247, | |
| "learning_rate": 1.3232434448965492e-05, | |
| "loss": 0.020783789455890656, | |
| "mean_token_accuracy": 0.9934862002730369, | |
| "num_tokens": 9569158.0, | |
| "step": 2680 | |
| }, | |
| { | |
| "entropy": 2.1923176765441896, | |
| "epoch": 2.0756610692916424, | |
| "grad_norm": 0.4592268466949463, | |
| "learning_rate": 1.318509213343541e-05, | |
| "loss": 0.02032013237476349, | |
| "mean_token_accuracy": 0.996187499165535, | |
| "num_tokens": 9605532.0, | |
| "step": 2690 | |
| }, | |
| { | |
| "entropy": 2.2375913679599764, | |
| "epoch": 2.0833815865663, | |
| "grad_norm": 3.984872579574585, | |
| "learning_rate": 1.3137670236743258e-05, | |
| "loss": 0.05714105367660523, | |
| "mean_token_accuracy": 0.984250420331955, | |
| "num_tokens": 9637666.0, | |
| "step": 2700 | |
| }, | |
| { | |
| "entropy": 2.2166593253612517, | |
| "epoch": 2.0911021038409574, | |
| "grad_norm": 1.2222201824188232, | |
| "learning_rate": 1.3090169943749475e-05, | |
| "loss": 0.01319773644208908, | |
| "mean_token_accuracy": 0.9959829047322273, | |
| "num_tokens": 9671041.0, | |
| "step": 2710 | |
| }, | |
| { | |
| "entropy": 2.207410234212875, | |
| "epoch": 2.0988226211156147, | |
| "grad_norm": 2.778895139694214, | |
| "learning_rate": 1.3042592441273265e-05, | |
| "loss": 0.0495807558298111, | |
| "mean_token_accuracy": 0.9841275036334991, | |
| "num_tokens": 9709462.0, | |
| "step": 2720 | |
| }, | |
| { | |
| "entropy": 2.240642195940018, | |
| "epoch": 2.106543138390272, | |
| "grad_norm": 0.054825589060783386, | |
| "learning_rate": 1.2994938918062956e-05, | |
| "loss": 0.02018197178840637, | |
| "mean_token_accuracy": 0.9940782889723778, | |
| "num_tokens": 9743175.0, | |
| "step": 2730 | |
| }, | |
| { | |
| "entropy": 2.1023289799690246, | |
| "epoch": 2.1142636556649297, | |
| "grad_norm": 1.3066190481185913, | |
| "learning_rate": 1.2947210564766285e-05, | |
| "loss": 0.029668596386909486, | |
| "mean_token_accuracy": 0.9919564932584762, | |
| "num_tokens": 9780470.0, | |
| "step": 2740 | |
| }, | |
| { | |
| "entropy": 2.194093734025955, | |
| "epoch": 2.121984172939587, | |
| "grad_norm": 1.0239670276641846, | |
| "learning_rate": 1.289940857390066e-05, | |
| "loss": 0.031669008731842044, | |
| "mean_token_accuracy": 0.9926641970872879, | |
| "num_tokens": 9817526.0, | |
| "step": 2750 | |
| }, | |
| { | |
| "entropy": 2.2564922988414766, | |
| "epoch": 2.1297046902142442, | |
| "grad_norm": 1.27794349193573, | |
| "learning_rate": 1.2851534139823363e-05, | |
| "loss": 0.019582782685756684, | |
| "mean_token_accuracy": 0.995488366484642, | |
| "num_tokens": 9852050.0, | |
| "step": 2760 | |
| }, | |
| { | |
| "entropy": 2.185793325304985, | |
| "epoch": 2.137425207488902, | |
| "grad_norm": 0.7653716206550598, | |
| "learning_rate": 1.280358845870171e-05, | |
| "loss": 0.02054794430732727, | |
| "mean_token_accuracy": 0.9923271596431732, | |
| "num_tokens": 9892115.0, | |
| "step": 2770 | |
| }, | |
| { | |
| "entropy": 2.2001701056957246, | |
| "epoch": 2.1451457247635592, | |
| "grad_norm": 0.39544498920440674, | |
| "learning_rate": 1.2755572728483155e-05, | |
| "loss": 0.023257075250148772, | |
| "mean_token_accuracy": 0.9951051697134972, | |
| "num_tokens": 9931964.0, | |
| "step": 2780 | |
| }, | |
| { | |
| "entropy": 2.240946352481842, | |
| "epoch": 2.1528662420382165, | |
| "grad_norm": 0.26407626271247864, | |
| "learning_rate": 1.2707488148865363e-05, | |
| "loss": 0.013235661387443542, | |
| "mean_token_accuracy": 0.9952550038695336, | |
| "num_tokens": 9966565.0, | |
| "step": 2790 | |
| }, | |
| { | |
| "entropy": 2.2113855719566344, | |
| "epoch": 2.160586759312874, | |
| "grad_norm": 3.220576047897339, | |
| "learning_rate": 1.265933592126625e-05, | |
| "loss": 0.036707454919815065, | |
| "mean_token_accuracy": 0.991096867620945, | |
| "num_tokens": 9998961.0, | |
| "step": 2800 | |
| }, | |
| { | |
| "entropy": 2.190717473626137, | |
| "epoch": 2.1683072765875315, | |
| "grad_norm": 2.822577476501465, | |
| "learning_rate": 1.2611117248793936e-05, | |
| "loss": 0.03832524418830872, | |
| "mean_token_accuracy": 0.9897032305598259, | |
| "num_tokens": 10033957.0, | |
| "step": 2810 | |
| }, | |
| { | |
| "entropy": 2.14252789914608, | |
| "epoch": 2.176027793862189, | |
| "grad_norm": 1.2037594318389893, | |
| "learning_rate": 1.2562833336216706e-05, | |
| "loss": 0.030560973286628722, | |
| "mean_token_accuracy": 0.9927359268069267, | |
| "num_tokens": 10067990.0, | |
| "step": 2820 | |
| }, | |
| { | |
| "entropy": 2.169364756345749, | |
| "epoch": 2.183748311136846, | |
| "grad_norm": 0.36512044072151184, | |
| "learning_rate": 1.2514485389932904e-05, | |
| "loss": 0.024552282691001893, | |
| "mean_token_accuracy": 0.9914642333984375, | |
| "num_tokens": 10107375.0, | |
| "step": 2830 | |
| }, | |
| { | |
| "entropy": 2.215904402732849, | |
| "epoch": 2.1914688284115034, | |
| "grad_norm": 1.6125507354736328, | |
| "learning_rate": 1.2466074617940789e-05, | |
| "loss": 0.04732250571250916, | |
| "mean_token_accuracy": 0.9921780049800872, | |
| "num_tokens": 10141732.0, | |
| "step": 2840 | |
| }, | |
| { | |
| "entropy": 2.2249450385570526, | |
| "epoch": 2.199189345686161, | |
| "grad_norm": 1.7302135229110718, | |
| "learning_rate": 1.2417602229808351e-05, | |
| "loss": 0.017911496758460998, | |
| "mean_token_accuracy": 0.995235213637352, | |
| "num_tokens": 10178996.0, | |
| "step": 2850 | |
| }, | |
| { | |
| "entropy": 2.2548143804073333, | |
| "epoch": 2.2069098629608184, | |
| "grad_norm": 0.04718457907438278, | |
| "learning_rate": 1.236906943664309e-05, | |
| "loss": 0.047148984670639035, | |
| "mean_token_accuracy": 0.992178562283516, | |
| "num_tokens": 10214640.0, | |
| "step": 2860 | |
| }, | |
| { | |
| "entropy": 2.2417348712682723, | |
| "epoch": 2.2146303802354756, | |
| "grad_norm": 0.028584061190485954, | |
| "learning_rate": 1.2320477451061764e-05, | |
| "loss": 0.019759944081306456, | |
| "mean_token_accuracy": 0.9941247820854187, | |
| "num_tokens": 10251016.0, | |
| "step": 2870 | |
| }, | |
| { | |
| "entropy": 2.2414058953523637, | |
| "epoch": 2.2223508975101334, | |
| "grad_norm": 0.14690132439136505, | |
| "learning_rate": 1.227182748716007e-05, | |
| "loss": 0.02443784922361374, | |
| "mean_token_accuracy": 0.995506352186203, | |
| "num_tokens": 10292140.0, | |
| "step": 2880 | |
| }, | |
| { | |
| "entropy": 2.161432334780693, | |
| "epoch": 2.2300714147847907, | |
| "grad_norm": 1.1667348146438599, | |
| "learning_rate": 1.2223120760482334e-05, | |
| "loss": 0.059571588039398195, | |
| "mean_token_accuracy": 0.9856904774904252, | |
| "num_tokens": 10332661.0, | |
| "step": 2890 | |
| }, | |
| { | |
| "entropy": 2.201232245564461, | |
| "epoch": 2.237791932059448, | |
| "grad_norm": 0.03672393038868904, | |
| "learning_rate": 1.217435848799113e-05, | |
| "loss": 0.014521844685077667, | |
| "mean_token_accuracy": 0.9963999673724174, | |
| "num_tokens": 10369258.0, | |
| "step": 2900 | |
| }, | |
| { | |
| "entropy": 2.2226219087839127, | |
| "epoch": 2.245512449334105, | |
| "grad_norm": 0.8930593729019165, | |
| "learning_rate": 1.2125541888036865e-05, | |
| "loss": 0.022989581525325774, | |
| "mean_token_accuracy": 0.9940146535634995, | |
| "num_tokens": 10401439.0, | |
| "step": 2910 | |
| }, | |
| { | |
| "entropy": 2.2541381388902666, | |
| "epoch": 2.253232966608763, | |
| "grad_norm": 1.267367959022522, | |
| "learning_rate": 1.2076672180327354e-05, | |
| "loss": 0.04482119679450989, | |
| "mean_token_accuracy": 0.9880507871508598, | |
| "num_tokens": 10436132.0, | |
| "step": 2920 | |
| }, | |
| { | |
| "entropy": 2.254253861308098, | |
| "epoch": 2.26095348388342, | |
| "grad_norm": 2.6567845344543457, | |
| "learning_rate": 1.2027750585897325e-05, | |
| "loss": 0.03449807465076447, | |
| "mean_token_accuracy": 0.9864874675869941, | |
| "num_tokens": 10470241.0, | |
| "step": 2930 | |
| }, | |
| { | |
| "entropy": 2.1793852925300596, | |
| "epoch": 2.2686740011580775, | |
| "grad_norm": 0.10617174953222275, | |
| "learning_rate": 1.1978778327077932e-05, | |
| "loss": 0.01429850161075592, | |
| "mean_token_accuracy": 0.9945758923888206, | |
| "num_tokens": 10501127.0, | |
| "step": 2940 | |
| }, | |
| { | |
| "entropy": 2.1325310707092284, | |
| "epoch": 2.2763945184327348, | |
| "grad_norm": 1.1946356296539307, | |
| "learning_rate": 1.1929756627466207e-05, | |
| "loss": 0.05270189046859741, | |
| "mean_token_accuracy": 0.9898444160819053, | |
| "num_tokens": 10541230.0, | |
| "step": 2950 | |
| }, | |
| { | |
| "entropy": 2.1456130146980286, | |
| "epoch": 2.2841150357073925, | |
| "grad_norm": 0.13995744287967682, | |
| "learning_rate": 1.1880686711894476e-05, | |
| "loss": 0.02509075403213501, | |
| "mean_token_accuracy": 0.9976190477609634, | |
| "num_tokens": 10573896.0, | |
| "step": 2960 | |
| }, | |
| { | |
| "entropy": 2.2185772597789764, | |
| "epoch": 2.2918355529820498, | |
| "grad_norm": 0.05365545675158501, | |
| "learning_rate": 1.1831569806399773e-05, | |
| "loss": 0.06382806301116943, | |
| "mean_token_accuracy": 0.9850220456719398, | |
| "num_tokens": 10608069.0, | |
| "step": 2970 | |
| }, | |
| { | |
| "entropy": 2.2425498723983766, | |
| "epoch": 2.299556070256707, | |
| "grad_norm": 0.649382472038269, | |
| "learning_rate": 1.178240713819319e-05, | |
| "loss": 0.01412668377161026, | |
| "mean_token_accuracy": 0.994785113632679, | |
| "num_tokens": 10646749.0, | |
| "step": 2980 | |
| }, | |
| { | |
| "entropy": 2.191881862282753, | |
| "epoch": 2.3072765875313648, | |
| "grad_norm": 5.6314496994018555, | |
| "learning_rate": 1.173319993562924e-05, | |
| "loss": 0.04553419649600983, | |
| "mean_token_accuracy": 0.9872561976313591, | |
| "num_tokens": 10688044.0, | |
| "step": 2990 | |
| }, | |
| { | |
| "entropy": 2.15625539124012, | |
| "epoch": 2.314997104806022, | |
| "grad_norm": 1.1487791538238525, | |
| "learning_rate": 1.1683949428175137e-05, | |
| "loss": 0.03611789345741272, | |
| "mean_token_accuracy": 0.9944777116179466, | |
| "num_tokens": 10723778.0, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 2.314997104806022, | |
| "eval_entropy": 2.0888531302708193, | |
| "eval_loss": 0.46160778403282166, | |
| "eval_mean_token_accuracy": 0.9338101559671862, | |
| "eval_num_tokens": 10723778.0, | |
| "eval_runtime": 988.0337, | |
| "eval_samples_per_second": 7.744, | |
| "eval_steps_per_second": 0.969, | |
| "step": 3000 | |
| }, | |
| { | |
| "entropy": 2.217298111319542, | |
| "epoch": 2.3227176220806793, | |
| "grad_norm": 0.7061363458633423, | |
| "learning_rate": 1.1634656846380088e-05, | |
| "loss": 0.02380364537239075, | |
| "mean_token_accuracy": 0.9964717343449593, | |
| "num_tokens": 10761784.0, | |
| "step": 3010 | |
| }, | |
| { | |
| "entropy": 2.2075847864151, | |
| "epoch": 2.330438139355337, | |
| "grad_norm": 5.256769180297852, | |
| "learning_rate": 1.1585323421844563e-05, | |
| "loss": 0.020036756992340088, | |
| "mean_token_accuracy": 0.9942559063434601, | |
| "num_tokens": 10799548.0, | |
| "step": 3020 | |
| }, | |
| { | |
| "entropy": 2.2639325708150864, | |
| "epoch": 2.3381586566299943, | |
| "grad_norm": 1.2079206705093384, | |
| "learning_rate": 1.1535950387189491e-05, | |
| "loss": 0.026534247398376464, | |
| "mean_token_accuracy": 0.9935628846287727, | |
| "num_tokens": 10834454.0, | |
| "step": 3030 | |
| }, | |
| { | |
| "entropy": 2.2246354073286057, | |
| "epoch": 2.3458791739046516, | |
| "grad_norm": 4.4090070724487305, | |
| "learning_rate": 1.1486538976025494e-05, | |
| "loss": 0.03687326312065124, | |
| "mean_token_accuracy": 0.9897530093789101, | |
| "num_tokens": 10870495.0, | |
| "step": 3040 | |
| }, | |
| { | |
| "entropy": 2.264278048276901, | |
| "epoch": 2.353599691179309, | |
| "grad_norm": 1.5192763805389404, | |
| "learning_rate": 1.1437090422922048e-05, | |
| "loss": 0.03048618733882904, | |
| "mean_token_accuracy": 0.9923379093408584, | |
| "num_tokens": 10905172.0, | |
| "step": 3050 | |
| }, | |
| { | |
| "entropy": 2.2067640751600264, | |
| "epoch": 2.361320208453966, | |
| "grad_norm": 3.1806492805480957, | |
| "learning_rate": 1.1387605963376634e-05, | |
| "loss": 0.026115420460700988, | |
| "mean_token_accuracy": 0.993264289200306, | |
| "num_tokens": 10944797.0, | |
| "step": 3060 | |
| }, | |
| { | |
| "entropy": 2.191044235229492, | |
| "epoch": 2.369040725728624, | |
| "grad_norm": 0.313163161277771, | |
| "learning_rate": 1.1338086833783879e-05, | |
| "loss": 0.022575947642326354, | |
| "mean_token_accuracy": 0.9924851134419441, | |
| "num_tokens": 10981103.0, | |
| "step": 3070 | |
| }, | |
| { | |
| "entropy": 2.2448153853416444, | |
| "epoch": 2.376761243003281, | |
| "grad_norm": 0.07588159292936325, | |
| "learning_rate": 1.1288534271404654e-05, | |
| "loss": 0.02497773468494415, | |
| "mean_token_accuracy": 0.9956817016005516, | |
| "num_tokens": 11012602.0, | |
| "step": 3080 | |
| }, | |
| { | |
| "entropy": 2.1922047078609466, | |
| "epoch": 2.3844817602779385, | |
| "grad_norm": 4.014681339263916, | |
| "learning_rate": 1.1238949514335171e-05, | |
| "loss": 0.04230898320674896, | |
| "mean_token_accuracy": 0.9890714272856712, | |
| "num_tokens": 11049617.0, | |
| "step": 3090 | |
| }, | |
| { | |
| "entropy": 2.2160174280405043, | |
| "epoch": 2.392202277552596, | |
| "grad_norm": 0.2612691819667816, | |
| "learning_rate": 1.1189333801476043e-05, | |
| "loss": 0.027991071343421936, | |
| "mean_token_accuracy": 0.9910157874226571, | |
| "num_tokens": 11083167.0, | |
| "step": 3100 | |
| }, | |
| { | |
| "entropy": 2.1471309036016466, | |
| "epoch": 2.3999227948272535, | |
| "grad_norm": 0.20606683194637299, | |
| "learning_rate": 1.1139688372501322e-05, | |
| "loss": 0.008393615484237671, | |
| "mean_token_accuracy": 0.9982551485300064, | |
| "num_tokens": 11120707.0, | |
| "step": 3110 | |
| }, | |
| { | |
| "entropy": 2.2330644577741623, | |
| "epoch": 2.4076433121019107, | |
| "grad_norm": 3.892418622970581, | |
| "learning_rate": 1.109001446782754e-05, | |
| "loss": 0.0618414044380188, | |
| "mean_token_accuracy": 0.9849733024835586, | |
| "num_tokens": 11152504.0, | |
| "step": 3120 | |
| }, | |
| { | |
| "entropy": 2.1754608184099196, | |
| "epoch": 2.4153638293765685, | |
| "grad_norm": 2.0742340087890625, | |
| "learning_rate": 1.1040313328582704e-05, | |
| "loss": 0.04327288269996643, | |
| "mean_token_accuracy": 0.9893003240227699, | |
| "num_tokens": 11186267.0, | |
| "step": 3130 | |
| }, | |
| { | |
| "entropy": 2.1819115340709687, | |
| "epoch": 2.4230843466512257, | |
| "grad_norm": 0.9018492102622986, | |
| "learning_rate": 1.0990586196575294e-05, | |
| "loss": 0.02030205577611923, | |
| "mean_token_accuracy": 0.9951718047261238, | |
| "num_tokens": 11221627.0, | |
| "step": 3140 | |
| }, | |
| { | |
| "entropy": 2.2373082458972933, | |
| "epoch": 2.430804863925883, | |
| "grad_norm": 0.7242811918258667, | |
| "learning_rate": 1.0940834314263233e-05, | |
| "loss": 0.030833426117897033, | |
| "mean_token_accuracy": 0.9951138079166413, | |
| "num_tokens": 11257677.0, | |
| "step": 3150 | |
| }, | |
| { | |
| "entropy": 2.2836509525775908, | |
| "epoch": 2.4385253812005403, | |
| "grad_norm": 0.30014318227767944, | |
| "learning_rate": 1.089105892472284e-05, | |
| "loss": 0.02001524865627289, | |
| "mean_token_accuracy": 0.9914347141981125, | |
| "num_tokens": 11292106.0, | |
| "step": 3160 | |
| }, | |
| { | |
| "entropy": 2.139942041039467, | |
| "epoch": 2.446245898475198, | |
| "grad_norm": 0.8197279572486877, | |
| "learning_rate": 1.0841261271617773e-05, | |
| "loss": 0.06748307943344116, | |
| "mean_token_accuracy": 0.988334609568119, | |
| "num_tokens": 11327418.0, | |
| "step": 3170 | |
| }, | |
| { | |
| "entropy": 2.213589632511139, | |
| "epoch": 2.4539664157498553, | |
| "grad_norm": 0.3989240229129791, | |
| "learning_rate": 1.0791442599167962e-05, | |
| "loss": 0.023147647082805634, | |
| "mean_token_accuracy": 0.9967875018715858, | |
| "num_tokens": 11361726.0, | |
| "step": 3180 | |
| }, | |
| { | |
| "entropy": 2.256254014372826, | |
| "epoch": 2.4616869330245126, | |
| "grad_norm": 1.1078554391860962, | |
| "learning_rate": 1.0741604152118515e-05, | |
| "loss": 0.029124677181243896, | |
| "mean_token_accuracy": 0.9931992501020431, | |
| "num_tokens": 11398586.0, | |
| "step": 3190 | |
| }, | |
| { | |
| "entropy": 2.165381821990013, | |
| "epoch": 2.46940745029917, | |
| "grad_norm": 1.1475622653961182, | |
| "learning_rate": 1.0691747175708611e-05, | |
| "loss": 0.028723520040512086, | |
| "mean_token_accuracy": 0.990369887650013, | |
| "num_tokens": 11432096.0, | |
| "step": 3200 | |
| }, | |
| { | |
| "entropy": 2.222157561779022, | |
| "epoch": 2.4771279675738276, | |
| "grad_norm": 0.06832505017518997, | |
| "learning_rate": 1.0641872915640406e-05, | |
| "loss": 0.04921720027923584, | |
| "mean_token_accuracy": 0.9877250343561172, | |
| "num_tokens": 11470784.0, | |
| "step": 3210 | |
| }, | |
| { | |
| "entropy": 2.2426993161439897, | |
| "epoch": 2.484848484848485, | |
| "grad_norm": 4.916550159454346, | |
| "learning_rate": 1.0591982618047889e-05, | |
| "loss": 0.06242421865463257, | |
| "mean_token_accuracy": 0.9849206641316414, | |
| "num_tokens": 11502948.0, | |
| "step": 3220 | |
| }, | |
| { | |
| "entropy": 2.197218120098114, | |
| "epoch": 2.492569002123142, | |
| "grad_norm": 2.124483346939087, | |
| "learning_rate": 1.0542077529465758e-05, | |
| "loss": 0.016325852274894713, | |
| "mean_token_accuracy": 0.9951209232211113, | |
| "num_tokens": 11539468.0, | |
| "step": 3230 | |
| }, | |
| { | |
| "entropy": 2.2902637124061584, | |
| "epoch": 2.5002895193978, | |
| "grad_norm": 0.08580861240625381, | |
| "learning_rate": 1.049215889679827e-05, | |
| "loss": 0.015471380949020386, | |
| "mean_token_accuracy": 0.9910388752818108, | |
| "num_tokens": 11569402.0, | |
| "step": 3240 | |
| }, | |
| { | |
| "entropy": 2.218478021025658, | |
| "epoch": 2.508010036672457, | |
| "grad_norm": 3.2291533946990967, | |
| "learning_rate": 1.0442227967288087e-05, | |
| "loss": 0.023704257607460023, | |
| "mean_token_accuracy": 0.9939404681324959, | |
| "num_tokens": 11605925.0, | |
| "step": 3250 | |
| }, | |
| { | |
| "entropy": 2.1201782315969466, | |
| "epoch": 2.5157305539471144, | |
| "grad_norm": 2.169576406478882, | |
| "learning_rate": 1.0392285988485118e-05, | |
| "loss": 0.032733604311943054, | |
| "mean_token_accuracy": 0.9920709192752838, | |
| "num_tokens": 11643802.0, | |
| "step": 3260 | |
| }, | |
| { | |
| "entropy": 2.2365442246198652, | |
| "epoch": 2.5234510712217717, | |
| "grad_norm": 0.022659538313746452, | |
| "learning_rate": 1.0342334208215343e-05, | |
| "loss": 0.019719691574573518, | |
| "mean_token_accuracy": 0.9956497728824616, | |
| "num_tokens": 11678574.0, | |
| "step": 3270 | |
| }, | |
| { | |
| "entropy": 2.258416032791138, | |
| "epoch": 2.5311715884964294, | |
| "grad_norm": 1.1894478797912598, | |
| "learning_rate": 1.0292373874549632e-05, | |
| "loss": 0.027323293685913085, | |
| "mean_token_accuracy": 0.9939205542206764, | |
| "num_tokens": 11709479.0, | |
| "step": 3280 | |
| }, | |
| { | |
| "entropy": 2.2412182718515394, | |
| "epoch": 2.5388921057710867, | |
| "grad_norm": 0.7658277153968811, | |
| "learning_rate": 1.0242406235772573e-05, | |
| "loss": 0.036611801385879515, | |
| "mean_token_accuracy": 0.9948377966880798, | |
| "num_tokens": 11747308.0, | |
| "step": 3290 | |
| }, | |
| { | |
| "entropy": 2.206353172659874, | |
| "epoch": 2.546612623045744, | |
| "grad_norm": 4.169549942016602, | |
| "learning_rate": 1.0192432540351269e-05, | |
| "loss": 0.023987260460853577, | |
| "mean_token_accuracy": 0.992442001402378, | |
| "num_tokens": 11779775.0, | |
| "step": 3300 | |
| }, | |
| { | |
| "entropy": 2.174012392759323, | |
| "epoch": 2.5543331403204013, | |
| "grad_norm": 1.4817591905593872, | |
| "learning_rate": 1.0142454036904154e-05, | |
| "loss": 0.014469130337238312, | |
| "mean_token_accuracy": 0.997749999165535, | |
| "num_tokens": 11813976.0, | |
| "step": 3310 | |
| }, | |
| { | |
| "entropy": 2.1796777188777923, | |
| "epoch": 2.562053657595059, | |
| "grad_norm": 0.08421381562948227, | |
| "learning_rate": 1.0092471974169802e-05, | |
| "loss": 0.02185429334640503, | |
| "mean_token_accuracy": 0.9927170544862747, | |
| "num_tokens": 11849438.0, | |
| "step": 3320 | |
| }, | |
| { | |
| "entropy": 2.2282682776451113, | |
| "epoch": 2.5697741748697163, | |
| "grad_norm": 0.30909499526023865, | |
| "learning_rate": 1.0042487600975699e-05, | |
| "loss": 0.03119277358055115, | |
| "mean_token_accuracy": 0.9929424881935119, | |
| "num_tokens": 11883486.0, | |
| "step": 3330 | |
| }, | |
| { | |
| "entropy": 2.2394611954689028, | |
| "epoch": 2.5774946921443735, | |
| "grad_norm": 0.10575172305107117, | |
| "learning_rate": 9.992502166207077e-06, | |
| "loss": 0.009619663655757903, | |
| "mean_token_accuracy": 0.9981060609221458, | |
| "num_tokens": 11920020.0, | |
| "step": 3340 | |
| }, | |
| { | |
| "entropy": 2.201454371213913, | |
| "epoch": 2.5852152094190313, | |
| "grad_norm": 5.886312484741211, | |
| "learning_rate": 9.94251691877568e-06, | |
| "loss": 0.025818082690238952, | |
| "mean_token_accuracy": 0.9924077332019806, | |
| "num_tokens": 11955168.0, | |
| "step": 3350 | |
| }, | |
| { | |
| "entropy": 2.1938006192445756, | |
| "epoch": 2.5929357266936885, | |
| "grad_norm": 0.12290452420711517, | |
| "learning_rate": 9.892533107588577e-06, | |
| "loss": 0.01246689334511757, | |
| "mean_token_accuracy": 0.9964157700538635, | |
| "num_tokens": 11994023.0, | |
| "step": 3360 | |
| }, | |
| { | |
| "entropy": 2.192418694496155, | |
| "epoch": 2.600656243968346, | |
| "grad_norm": 0.488265722990036, | |
| "learning_rate": 9.842551981516952e-06, | |
| "loss": 0.018000373244285585, | |
| "mean_token_accuracy": 0.9964497670531273, | |
| "num_tokens": 12028712.0, | |
| "step": 3370 | |
| }, | |
| { | |
| "entropy": 2.268085116147995, | |
| "epoch": 2.6083767612430035, | |
| "grad_norm": 0.14518892765045166, | |
| "learning_rate": 9.792574789364893e-06, | |
| "loss": 0.020170669257640838, | |
| "mean_token_accuracy": 0.9963870957493782, | |
| "num_tokens": 12059526.0, | |
| "step": 3380 | |
| }, | |
| { | |
| "entropy": 2.2167040795087813, | |
| "epoch": 2.616097278517661, | |
| "grad_norm": 1.522740125656128, | |
| "learning_rate": 9.742602779838209e-06, | |
| "loss": 0.016399385035037996, | |
| "mean_token_accuracy": 0.9955128505825996, | |
| "num_tokens": 12097085.0, | |
| "step": 3390 | |
| }, | |
| { | |
| "entropy": 2.295898801088333, | |
| "epoch": 2.623817795792318, | |
| "grad_norm": 4.225417613983154, | |
| "learning_rate": 9.69263720151321e-06, | |
| "loss": 0.029479607939720154, | |
| "mean_token_accuracy": 0.9938596487045288, | |
| "num_tokens": 12129924.0, | |
| "step": 3400 | |
| }, | |
| { | |
| "entropy": 2.280335706472397, | |
| "epoch": 2.6315383130669754, | |
| "grad_norm": 1.20139741897583, | |
| "learning_rate": 9.64267930280552e-06, | |
| "loss": 0.050666403770446775, | |
| "mean_token_accuracy": 0.9906869053840637, | |
| "num_tokens": 12161521.0, | |
| "step": 3410 | |
| }, | |
| { | |
| "entropy": 2.224092537164688, | |
| "epoch": 2.6392588303416327, | |
| "grad_norm": 1.7901499271392822, | |
| "learning_rate": 9.592730331938882e-06, | |
| "loss": 0.03357548415660858, | |
| "mean_token_accuracy": 0.9925102308392525, | |
| "num_tokens": 12197782.0, | |
| "step": 3420 | |
| }, | |
| { | |
| "entropy": 2.2111442536115646, | |
| "epoch": 2.6469793476162904, | |
| "grad_norm": 1.5995413064956665, | |
| "learning_rate": 9.542791536913985e-06, | |
| "loss": 0.027673259377479553, | |
| "mean_token_accuracy": 0.9946150794625283, | |
| "num_tokens": 12233888.0, | |
| "step": 3430 | |
| }, | |
| { | |
| "entropy": 2.2556965053081512, | |
| "epoch": 2.6546998648909477, | |
| "grad_norm": 3.171156644821167, | |
| "learning_rate": 9.492864165477246e-06, | |
| "loss": 0.019532108306884767, | |
| "mean_token_accuracy": 0.9935697302222252, | |
| "num_tokens": 12267840.0, | |
| "step": 3440 | |
| }, | |
| { | |
| "entropy": 2.1733025908470154, | |
| "epoch": 2.662420382165605, | |
| "grad_norm": 0.10952026396989822, | |
| "learning_rate": 9.442949465089679e-06, | |
| "loss": 0.04825982451438904, | |
| "mean_token_accuracy": 0.9895769953727722, | |
| "num_tokens": 12303601.0, | |
| "step": 3450 | |
| }, | |
| { | |
| "entropy": 2.239233008027077, | |
| "epoch": 2.6701408994402627, | |
| "grad_norm": 0.07487324625253677, | |
| "learning_rate": 9.393048682895698e-06, | |
| "loss": 0.051196861267089847, | |
| "mean_token_accuracy": 0.983622993528843, | |
| "num_tokens": 12340150.0, | |
| "step": 3460 | |
| }, | |
| { | |
| "entropy": 2.2360308557748794, | |
| "epoch": 2.67786141671492, | |
| "grad_norm": 2.012169122695923, | |
| "learning_rate": 9.34316306569196e-06, | |
| "loss": 0.01992444396018982, | |
| "mean_token_accuracy": 0.9927385210990906, | |
| "num_tokens": 12380777.0, | |
| "step": 3470 | |
| }, | |
| { | |
| "entropy": 2.235995998978615, | |
| "epoch": 2.6855819339895772, | |
| "grad_norm": 0.08367231488227844, | |
| "learning_rate": 9.293293859896224e-06, | |
| "loss": 0.018683603405952452, | |
| "mean_token_accuracy": 0.9944416150450707, | |
| "num_tokens": 12424408.0, | |
| "step": 3480 | |
| }, | |
| { | |
| "entropy": 2.202517831325531, | |
| "epoch": 2.693302451264235, | |
| "grad_norm": 0.12537157535552979, | |
| "learning_rate": 9.243442311516194e-06, | |
| "loss": 0.035655727982521056, | |
| "mean_token_accuracy": 0.9909148395061493, | |
| "num_tokens": 12459199.0, | |
| "step": 3490 | |
| }, | |
| { | |
| "entropy": 2.216241243481636, | |
| "epoch": 2.7010229685388922, | |
| "grad_norm": 2.079157590866089, | |
| "learning_rate": 9.193609666118403e-06, | |
| "loss": 0.02550240755081177, | |
| "mean_token_accuracy": 0.9924755334854126, | |
| "num_tokens": 12492382.0, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 2.7010229685388922, | |
| "eval_entropy": 2.08757205492775, | |
| "eval_loss": 0.46482330560684204, | |
| "eval_mean_token_accuracy": 0.9347644107593389, | |
| "eval_num_tokens": 12492382.0, | |
| "eval_runtime": 987.4485, | |
| "eval_samples_per_second": 7.748, | |
| "eval_steps_per_second": 0.969, | |
| "step": 3500 | |
| }, | |
| { | |
| "entropy": 2.1927063912153244, | |
| "epoch": 2.7087434858135495, | |
| "grad_norm": 4.612570285797119, | |
| "learning_rate": 9.143797168797074e-06, | |
| "loss": 0.020228767395019533, | |
| "mean_token_accuracy": 0.9914082810282707, | |
| "num_tokens": 12530445.0, | |
| "step": 3510 | |
| }, | |
| { | |
| "entropy": 2.2404502600431444, | |
| "epoch": 2.716464003088207, | |
| "grad_norm": 2.8573319911956787, | |
| "learning_rate": 9.094006064143023e-06, | |
| "loss": 0.031410235166549685, | |
| "mean_token_accuracy": 0.9914770245552063, | |
| "num_tokens": 12564152.0, | |
| "step": 3520 | |
| }, | |
| { | |
| "entropy": 2.1382099032402038, | |
| "epoch": 2.724184520362864, | |
| "grad_norm": 3.369036912918091, | |
| "learning_rate": 9.04423759621257e-06, | |
| "loss": 0.048682579398155214, | |
| "mean_token_accuracy": 0.9871285542845726, | |
| "num_tokens": 12601866.0, | |
| "step": 3530 | |
| }, | |
| { | |
| "entropy": 2.2182486951351166, | |
| "epoch": 2.731905037637522, | |
| "grad_norm": 0.04350515827536583, | |
| "learning_rate": 8.994493008496426e-06, | |
| "loss": 0.037138843536376955, | |
| "mean_token_accuracy": 0.9921187847852707, | |
| "num_tokens": 12636504.0, | |
| "step": 3540 | |
| }, | |
| { | |
| "entropy": 2.238505133986473, | |
| "epoch": 2.739625554912179, | |
| "grad_norm": 0.463403582572937, | |
| "learning_rate": 8.944773543888657e-06, | |
| "loss": 0.017538127303123475, | |
| "mean_token_accuracy": 0.9944233506917953, | |
| "num_tokens": 12671889.0, | |
| "step": 3550 | |
| }, | |
| { | |
| "entropy": 2.2769761711359022, | |
| "epoch": 2.7473460721868364, | |
| "grad_norm": 1.676416277885437, | |
| "learning_rate": 8.895080444655606e-06, | |
| "loss": 0.028448593616485596, | |
| "mean_token_accuracy": 0.9939671754837036, | |
| "num_tokens": 12707437.0, | |
| "step": 3560 | |
| }, | |
| { | |
| "entropy": 2.2299616605043413, | |
| "epoch": 2.755066589461494, | |
| "grad_norm": 0.42011213302612305, | |
| "learning_rate": 8.845414952404878e-06, | |
| "loss": 0.022680895030498506, | |
| "mean_token_accuracy": 0.9940501064062118, | |
| "num_tokens": 12741280.0, | |
| "step": 3570 | |
| }, | |
| { | |
| "entropy": 2.1800275564193727, | |
| "epoch": 2.7627871067361514, | |
| "grad_norm": 3.0085341930389404, | |
| "learning_rate": 8.79577830805428e-06, | |
| "loss": 0.04312008917331696, | |
| "mean_token_accuracy": 0.9904634907841683, | |
| "num_tokens": 12777520.0, | |
| "step": 3580 | |
| }, | |
| { | |
| "entropy": 2.121428969502449, | |
| "epoch": 2.7705076240108086, | |
| "grad_norm": 0.18500223755836487, | |
| "learning_rate": 8.746171751800862e-06, | |
| "loss": 0.010257864743471146, | |
| "mean_token_accuracy": 0.9983589738607407, | |
| "num_tokens": 12811089.0, | |
| "step": 3590 | |
| }, | |
| { | |
| "entropy": 2.1989814430475234, | |
| "epoch": 2.7782281412854664, | |
| "grad_norm": 0.542945146560669, | |
| "learning_rate": 8.696596523089897e-06, | |
| "loss": 0.00803714692592621, | |
| "mean_token_accuracy": 0.998145604133606, | |
| "num_tokens": 12846203.0, | |
| "step": 3600 | |
| }, | |
| { | |
| "entropy": 2.231951543688774, | |
| "epoch": 2.7859486585601236, | |
| "grad_norm": 0.2957513928413391, | |
| "learning_rate": 8.647053860583921e-06, | |
| "loss": 0.020568850636482238, | |
| "mean_token_accuracy": 0.9942832916975022, | |
| "num_tokens": 12881146.0, | |
| "step": 3610 | |
| }, | |
| { | |
| "entropy": 2.2153997004032133, | |
| "epoch": 2.793669175834781, | |
| "grad_norm": 4.239973545074463, | |
| "learning_rate": 8.597545002131792e-06, | |
| "loss": 0.01559099406003952, | |
| "mean_token_accuracy": 0.99518121778965, | |
| "num_tokens": 12920233.0, | |
| "step": 3620 | |
| }, | |
| { | |
| "entropy": 2.257417145371437, | |
| "epoch": 2.801389693109438, | |
| "grad_norm": 3.4071872234344482, | |
| "learning_rate": 8.548071184737756e-06, | |
| "loss": 0.020855729281902314, | |
| "mean_token_accuracy": 0.9936988726258278, | |
| "num_tokens": 12952742.0, | |
| "step": 3630 | |
| }, | |
| { | |
| "entropy": 2.1990304440259933, | |
| "epoch": 2.8091102103840955, | |
| "grad_norm": 6.179783344268799, | |
| "learning_rate": 8.498633644530535e-06, | |
| "loss": 0.03551109731197357, | |
| "mean_token_accuracy": 0.9895797207951545, | |
| "num_tokens": 12987526.0, | |
| "step": 3640 | |
| }, | |
| { | |
| "entropy": 2.2407626271247865, | |
| "epoch": 2.816830727658753, | |
| "grad_norm": 2.062673568725586, | |
| "learning_rate": 8.449233616732453e-06, | |
| "loss": 0.026538869738578795, | |
| "mean_token_accuracy": 0.9921577915549278, | |
| "num_tokens": 13025654.0, | |
| "step": 3650 | |
| }, | |
| { | |
| "entropy": 2.234692195057869, | |
| "epoch": 2.8245512449334105, | |
| "grad_norm": 2.2553117275238037, | |
| "learning_rate": 8.399872335628564e-06, | |
| "loss": 0.017977765202522276, | |
| "mean_token_accuracy": 0.9920303016901016, | |
| "num_tokens": 13062506.0, | |
| "step": 3660 | |
| }, | |
| { | |
| "entropy": 2.2229584991931914, | |
| "epoch": 2.8322717622080678, | |
| "grad_norm": 2.068716287612915, | |
| "learning_rate": 8.35055103453582e-06, | |
| "loss": 0.026064303517341614, | |
| "mean_token_accuracy": 0.9947251975536346, | |
| "num_tokens": 13097457.0, | |
| "step": 3670 | |
| }, | |
| { | |
| "entropy": 2.1777986973524093, | |
| "epoch": 2.8399922794827255, | |
| "grad_norm": 0.49508559703826904, | |
| "learning_rate": 8.301270945772245e-06, | |
| "loss": 0.01860121488571167, | |
| "mean_token_accuracy": 0.9952414557337761, | |
| "num_tokens": 13132851.0, | |
| "step": 3680 | |
| }, | |
| { | |
| "entropy": 2.233269226551056, | |
| "epoch": 2.8477127967573828, | |
| "grad_norm": 0.03142388164997101, | |
| "learning_rate": 8.252033300626154e-06, | |
| "loss": 0.03146423697471619, | |
| "mean_token_accuracy": 0.9943786114454269, | |
| "num_tokens": 13165995.0, | |
| "step": 3690 | |
| }, | |
| { | |
| "entropy": 2.2296706050634385, | |
| "epoch": 2.85543331403204, | |
| "grad_norm": 0.21639715135097504, | |
| "learning_rate": 8.202839329325396e-06, | |
| "loss": 0.019184540212154388, | |
| "mean_token_accuracy": 0.9943373009562493, | |
| "num_tokens": 13203076.0, | |
| "step": 3700 | |
| }, | |
| { | |
| "entropy": 2.196987953782082, | |
| "epoch": 2.8631538313066978, | |
| "grad_norm": 0.4990762770175934, | |
| "learning_rate": 8.153690261006586e-06, | |
| "loss": 0.025900739431381225, | |
| "mean_token_accuracy": 0.9961180582642555, | |
| "num_tokens": 13242240.0, | |
| "step": 3710 | |
| }, | |
| { | |
| "entropy": 2.2462848991155626, | |
| "epoch": 2.870874348581355, | |
| "grad_norm": 2.7010302543640137, | |
| "learning_rate": 8.104587323684435e-06, | |
| "loss": 0.03213064074516296, | |
| "mean_token_accuracy": 0.9937118411064148, | |
| "num_tokens": 13278586.0, | |
| "step": 3720 | |
| }, | |
| { | |
| "entropy": 2.2904939532279966, | |
| "epoch": 2.8785948658560123, | |
| "grad_norm": 0.5824764370918274, | |
| "learning_rate": 8.05553174422104e-06, | |
| "loss": 0.04053815901279449, | |
| "mean_token_accuracy": 0.9919193282723426, | |
| "num_tokens": 13313746.0, | |
| "step": 3730 | |
| }, | |
| { | |
| "entropy": 2.2101560860872267, | |
| "epoch": 2.8863153831306696, | |
| "grad_norm": 0.2210099995136261, | |
| "learning_rate": 8.006524748295234e-06, | |
| "loss": 0.01130208745598793, | |
| "mean_token_accuracy": 0.998863635957241, | |
| "num_tokens": 13354478.0, | |
| "step": 3740 | |
| }, | |
| { | |
| "entropy": 2.2668700993061064, | |
| "epoch": 2.8940359004053273, | |
| "grad_norm": 0.10139039158821106, | |
| "learning_rate": 7.95756756037197e-06, | |
| "loss": 0.030500581860542296, | |
| "mean_token_accuracy": 0.992310605943203, | |
| "num_tokens": 13386730.0, | |
| "step": 3750 | |
| }, | |
| { | |
| "entropy": 2.3063734799623488, | |
| "epoch": 2.9017564176799846, | |
| "grad_norm": 1.5737172365188599, | |
| "learning_rate": 7.908661403671721e-06, | |
| "loss": 0.04344950020313263, | |
| "mean_token_accuracy": 0.9915585055947304, | |
| "num_tokens": 13418333.0, | |
| "step": 3760 | |
| }, | |
| { | |
| "entropy": 2.1441037923097612, | |
| "epoch": 2.909476934954642, | |
| "grad_norm": 0.03719672933220863, | |
| "learning_rate": 7.859807500139922e-06, | |
| "loss": 0.02446196973323822, | |
| "mean_token_accuracy": 0.9906012058258057, | |
| "num_tokens": 13457112.0, | |
| "step": 3770 | |
| }, | |
| { | |
| "entropy": 2.2902497231960295, | |
| "epoch": 2.917197452229299, | |
| "grad_norm": 4.060549736022949, | |
| "learning_rate": 7.811007070416425e-06, | |
| "loss": 0.03251109719276428, | |
| "mean_token_accuracy": 0.987868283689022, | |
| "num_tokens": 13492524.0, | |
| "step": 3780 | |
| }, | |
| { | |
| "entropy": 2.2127520233392715, | |
| "epoch": 2.924917969503957, | |
| "grad_norm": 0.7151080369949341, | |
| "learning_rate": 7.762261333805026e-06, | |
| "loss": 0.029196158051490784, | |
| "mean_token_accuracy": 0.9946857452392578, | |
| "num_tokens": 13528544.0, | |
| "step": 3790 | |
| }, | |
| { | |
| "entropy": 2.162434884905815, | |
| "epoch": 2.932638486778614, | |
| "grad_norm": 0.06961432099342346, | |
| "learning_rate": 7.713571508242981e-06, | |
| "loss": 0.026906999945640563, | |
| "mean_token_accuracy": 0.9946787610650063, | |
| "num_tokens": 13567498.0, | |
| "step": 3800 | |
| }, | |
| { | |
| "entropy": 2.246299198269844, | |
| "epoch": 2.9403590040532714, | |
| "grad_norm": 3.7265074253082275, | |
| "learning_rate": 7.664938810270566e-06, | |
| "loss": 0.029045966267585755, | |
| "mean_token_accuracy": 0.9936078891158104, | |
| "num_tokens": 13602625.0, | |
| "step": 3810 | |
| }, | |
| { | |
| "entropy": 2.2388866275548933, | |
| "epoch": 2.948079521327929, | |
| "grad_norm": 0.24144315719604492, | |
| "learning_rate": 7.616364455000714e-06, | |
| "loss": 0.014337979257106781, | |
| "mean_token_accuracy": 0.9960026681423187, | |
| "num_tokens": 13641679.0, | |
| "step": 3820 | |
| }, | |
| { | |
| "entropy": 2.188111361861229, | |
| "epoch": 2.9558000386025864, | |
| "grad_norm": 6.046823501586914, | |
| "learning_rate": 7.567849656088628e-06, | |
| "loss": 0.03005032241344452, | |
| "mean_token_accuracy": 0.9918044999241828, | |
| "num_tokens": 13683014.0, | |
| "step": 3830 | |
| }, | |
| { | |
| "entropy": 2.204224619269371, | |
| "epoch": 2.9635205558772437, | |
| "grad_norm": 5.8294453620910645, | |
| "learning_rate": 7.519395625701462e-06, | |
| "loss": 0.038737067580223085, | |
| "mean_token_accuracy": 0.9885923460125923, | |
| "num_tokens": 13718071.0, | |
| "step": 3840 | |
| }, | |
| { | |
| "entropy": 2.2484711676836016, | |
| "epoch": 2.9712410731519014, | |
| "grad_norm": 9.640524864196777, | |
| "learning_rate": 7.471003574488041e-06, | |
| "loss": 0.028097692131996154, | |
| "mean_token_accuracy": 0.9957665964961052, | |
| "num_tokens": 13751151.0, | |
| "step": 3850 | |
| }, | |
| { | |
| "entropy": 2.2508881419897078, | |
| "epoch": 2.9789615904265587, | |
| "grad_norm": 0.10017109662294388, | |
| "learning_rate": 7.422674711548605e-06, | |
| "loss": 0.01202818676829338, | |
| "mean_token_accuracy": 0.9953813180327415, | |
| "num_tokens": 13791068.0, | |
| "step": 3860 | |
| }, | |
| { | |
| "entropy": 2.2337160974740984, | |
| "epoch": 2.986682107701216, | |
| "grad_norm": 0.043931517750024796, | |
| "learning_rate": 7.374410244404613e-06, | |
| "loss": 0.009058024734258652, | |
| "mean_token_accuracy": 0.9986373543739319, | |
| "num_tokens": 13829239.0, | |
| "step": 3870 | |
| }, | |
| { | |
| "entropy": 2.1862533658742906, | |
| "epoch": 2.9944026249758733, | |
| "grad_norm": 0.072396419942379, | |
| "learning_rate": 7.326211378968542e-06, | |
| "loss": 0.012882831692695617, | |
| "mean_token_accuracy": 0.9978046581149101, | |
| "num_tokens": 13868022.0, | |
| "step": 3880 | |
| }, | |
| { | |
| "entropy": 2.1555983053671346, | |
| "epoch": 3.0015441034549313, | |
| "grad_norm": 0.04370846599340439, | |
| "learning_rate": 7.278079319513793e-06, | |
| "loss": 0.03105989098548889, | |
| "mean_token_accuracy": 0.9914975681820432, | |
| "num_tokens": 13899213.0, | |
| "step": 3890 | |
| }, | |
| { | |
| "entropy": 2.2709316343069075, | |
| "epoch": 3.009264620729589, | |
| "grad_norm": 0.431661456823349, | |
| "learning_rate": 7.230015268644588e-06, | |
| "loss": 0.015339791774749756, | |
| "mean_token_accuracy": 0.9981125354766845, | |
| "num_tokens": 13935501.0, | |
| "step": 3900 | |
| }, | |
| { | |
| "entropy": 2.1740885227918625, | |
| "epoch": 3.0169851380042463, | |
| "grad_norm": 0.2746732234954834, | |
| "learning_rate": 7.182020427265902e-06, | |
| "loss": 0.0041766297072172165, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 13974859.0, | |
| "step": 3910 | |
| }, | |
| { | |
| "entropy": 2.2257029473781587, | |
| "epoch": 3.0247056552789036, | |
| "grad_norm": 2.3247573375701904, | |
| "learning_rate": 7.134095994553489e-06, | |
| "loss": 0.01182505115866661, | |
| "mean_token_accuracy": 0.9958305478096008, | |
| "num_tokens": 14011902.0, | |
| "step": 3920 | |
| }, | |
| { | |
| "entropy": 2.198028963804245, | |
| "epoch": 3.0324261725535613, | |
| "grad_norm": 0.07981577515602112, | |
| "learning_rate": 7.086243167923905e-06, | |
| "loss": 0.022176089882850646, | |
| "mean_token_accuracy": 0.9963392838835716, | |
| "num_tokens": 14046566.0, | |
| "step": 3930 | |
| }, | |
| { | |
| "entropy": 2.242706462740898, | |
| "epoch": 3.0401466898282186, | |
| "grad_norm": 0.02186143584549427, | |
| "learning_rate": 7.038463143004591e-06, | |
| "loss": 0.012292072176933289, | |
| "mean_token_accuracy": 0.9961706340312958, | |
| "num_tokens": 14079313.0, | |
| "step": 3940 | |
| }, | |
| { | |
| "entropy": 2.241307318210602, | |
| "epoch": 3.047867207102876, | |
| "grad_norm": 0.0767030119895935, | |
| "learning_rate": 6.990757113603992e-06, | |
| "loss": 0.007230133563280105, | |
| "mean_token_accuracy": 0.9980000004172325, | |
| "num_tokens": 14117695.0, | |
| "step": 3950 | |
| }, | |
| { | |
| "entropy": 2.210197499394417, | |
| "epoch": 3.055587724377533, | |
| "grad_norm": 0.13448522984981537, | |
| "learning_rate": 6.943126271681747e-06, | |
| "loss": 0.018068452179431916, | |
| "mean_token_accuracy": 0.9969620048999787, | |
| "num_tokens": 14153987.0, | |
| "step": 3960 | |
| }, | |
| { | |
| "entropy": 2.253513675928116, | |
| "epoch": 3.063308241652191, | |
| "grad_norm": 3.672414541244507, | |
| "learning_rate": 6.895571807318897e-06, | |
| "loss": 0.023470789194107056, | |
| "mean_token_accuracy": 0.9966314926743507, | |
| "num_tokens": 14185621.0, | |
| "step": 3970 | |
| }, | |
| { | |
| "entropy": 2.2444525837898253, | |
| "epoch": 3.071028758926848, | |
| "grad_norm": 0.12743113934993744, | |
| "learning_rate": 6.848094908688139e-06, | |
| "loss": 0.012810063362121583, | |
| "mean_token_accuracy": 0.9977913543581962, | |
| "num_tokens": 14219216.0, | |
| "step": 3980 | |
| }, | |
| { | |
| "entropy": 2.2262933045625686, | |
| "epoch": 3.0787492762015054, | |
| "grad_norm": 3.4074060916900635, | |
| "learning_rate": 6.8006967620241615e-06, | |
| "loss": 0.025683704018592834, | |
| "mean_token_accuracy": 0.9924832716584205, | |
| "num_tokens": 14257742.0, | |
| "step": 3990 | |
| }, | |
| { | |
| "entropy": 2.261911395192146, | |
| "epoch": 3.086469793476163, | |
| "grad_norm": 0.056527040898799896, | |
| "learning_rate": 6.753378551593992e-06, | |
| "loss": 0.003825421258807182, | |
| "mean_token_accuracy": 0.9986842110753059, | |
| "num_tokens": 14291203.0, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 3.086469793476163, | |
| "eval_entropy": 2.1145772489260732, | |
| "eval_loss": 0.4855208396911621, | |
| "eval_mean_token_accuracy": 0.9354811434088082, | |
| "eval_num_tokens": 14291203.0, | |
| "eval_runtime": 989.2063, | |
| "eval_samples_per_second": 7.734, | |
| "eval_steps_per_second": 0.967, | |
| "step": 4000 | |
| }, | |
| { | |
| "entropy": 2.2831456065177917, | |
| "epoch": 3.0941903107508204, | |
| "grad_norm": 0.058800771832466125, | |
| "learning_rate": 6.70614145966741e-06, | |
| "loss": 0.013551701605319978, | |
| "mean_token_accuracy": 0.9963570073246956, | |
| "num_tokens": 14322403.0, | |
| "step": 4010 | |
| }, | |
| { | |
| "entropy": 2.2009116262197495, | |
| "epoch": 3.1019108280254777, | |
| "grad_norm": 0.09004119783639908, | |
| "learning_rate": 6.658986666487406e-06, | |
| "loss": 0.012571512162685395, | |
| "mean_token_accuracy": 0.9967614203691483, | |
| "num_tokens": 14363415.0, | |
| "step": 4020 | |
| }, | |
| { | |
| "entropy": 2.183881738781929, | |
| "epoch": 3.109631345300135, | |
| "grad_norm": 0.030173663049936295, | |
| "learning_rate": 6.611915350240694e-06, | |
| "loss": 0.006261659413576126, | |
| "mean_token_accuracy": 0.9986278191208839, | |
| "num_tokens": 14402620.0, | |
| "step": 4030 | |
| }, | |
| { | |
| "entropy": 2.2086421698331833, | |
| "epoch": 3.1173518625747927, | |
| "grad_norm": 0.12183760106563568, | |
| "learning_rate": 6.56492868702828e-06, | |
| "loss": 0.013231892883777619, | |
| "mean_token_accuracy": 0.995246222615242, | |
| "num_tokens": 14436242.0, | |
| "step": 4040 | |
| }, | |
| { | |
| "entropy": 2.1381252884864805, | |
| "epoch": 3.12507237984945, | |
| "grad_norm": 2.105003833770752, | |
| "learning_rate": 6.51802785083606e-06, | |
| "loss": 0.025765135884284973, | |
| "mean_token_accuracy": 0.9932129815220833, | |
| "num_tokens": 14476123.0, | |
| "step": 4050 | |
| }, | |
| { | |
| "entropy": 2.22107275724411, | |
| "epoch": 3.1327928971241072, | |
| "grad_norm": 0.8158308863639832, | |
| "learning_rate": 6.471214013505507e-06, | |
| "loss": 0.01576409637928009, | |
| "mean_token_accuracy": 0.9953061327338218, | |
| "num_tokens": 14507443.0, | |
| "step": 4060 | |
| }, | |
| { | |
| "entropy": 2.2192520588636397, | |
| "epoch": 3.1405134143987645, | |
| "grad_norm": 4.943661212921143, | |
| "learning_rate": 6.42448834470438e-06, | |
| "loss": 0.013656246662139892, | |
| "mean_token_accuracy": 0.9962772980332375, | |
| "num_tokens": 14540908.0, | |
| "step": 4070 | |
| }, | |
| { | |
| "entropy": 2.2019663602113724, | |
| "epoch": 3.1482339316734222, | |
| "grad_norm": 0.011873590759932995, | |
| "learning_rate": 6.3778520118974975e-06, | |
| "loss": 0.004965296760201454, | |
| "mean_token_accuracy": 0.99921875, | |
| "num_tokens": 14577340.0, | |
| "step": 4080 | |
| }, | |
| { | |
| "entropy": 2.2791995286941527, | |
| "epoch": 3.1559544489480795, | |
| "grad_norm": 0.24833594262599945, | |
| "learning_rate": 6.331306180317577e-06, | |
| "loss": 0.016860713064670563, | |
| "mean_token_accuracy": 0.9945571333169937, | |
| "num_tokens": 14612020.0, | |
| "step": 4090 | |
| }, | |
| { | |
| "entropy": 2.2642083793878554, | |
| "epoch": 3.163674966222737, | |
| "grad_norm": 4.699156284332275, | |
| "learning_rate": 6.284852012936118e-06, | |
| "loss": 0.01841319501399994, | |
| "mean_token_accuracy": 0.9952612414956092, | |
| "num_tokens": 14641945.0, | |
| "step": 4100 | |
| }, | |
| { | |
| "entropy": 2.2173303991556166, | |
| "epoch": 3.1713954834973945, | |
| "grad_norm": 3.3025972843170166, | |
| "learning_rate": 6.238490670434338e-06, | |
| "loss": 0.019408072531223296, | |
| "mean_token_accuracy": 0.9971791654825211, | |
| "num_tokens": 14675381.0, | |
| "step": 4110 | |
| }, | |
| { | |
| "entropy": 2.1818405985832214, | |
| "epoch": 3.179116000772052, | |
| "grad_norm": 0.2685317099094391, | |
| "learning_rate": 6.192223311174179e-06, | |
| "loss": 0.02000413089990616, | |
| "mean_token_accuracy": 0.9951157197356224, | |
| "num_tokens": 14713258.0, | |
| "step": 4120 | |
| }, | |
| { | |
| "entropy": 2.2165157198905945, | |
| "epoch": 3.186836518046709, | |
| "grad_norm": 3.8232998847961426, | |
| "learning_rate": 6.146051091169367e-06, | |
| "loss": 0.01722181886434555, | |
| "mean_token_accuracy": 0.9972248584032058, | |
| "num_tokens": 14749403.0, | |
| "step": 4130 | |
| }, | |
| { | |
| "entropy": 2.2096123516559603, | |
| "epoch": 3.1945570353213664, | |
| "grad_norm": 0.10278035700321198, | |
| "learning_rate": 6.099975164056524e-06, | |
| "loss": 0.006322793662548065, | |
| "mean_token_accuracy": 0.9983333334326744, | |
| "num_tokens": 14785151.0, | |
| "step": 4140 | |
| }, | |
| { | |
| "entropy": 2.1967154651880265, | |
| "epoch": 3.202277552596024, | |
| "grad_norm": 1.6875110864639282, | |
| "learning_rate": 6.053996681066334e-06, | |
| "loss": 0.02624501585960388, | |
| "mean_token_accuracy": 0.9960680216550827, | |
| "num_tokens": 14819187.0, | |
| "step": 4150 | |
| }, | |
| { | |
| "entropy": 2.2883317291736605, | |
| "epoch": 3.2099980698706814, | |
| "grad_norm": 0.17266136407852173, | |
| "learning_rate": 6.008116790994805e-06, | |
| "loss": 0.01184847354888916, | |
| "mean_token_accuracy": 0.9966648116707801, | |
| "num_tokens": 14851008.0, | |
| "step": 4160 | |
| }, | |
| { | |
| "entropy": 2.185150256752968, | |
| "epoch": 3.2177185871453386, | |
| "grad_norm": 1.444366693496704, | |
| "learning_rate": 5.962336640174545e-06, | |
| "loss": 0.015763652324676514, | |
| "mean_token_accuracy": 0.9958777576684952, | |
| "num_tokens": 14887540.0, | |
| "step": 4170 | |
| }, | |
| { | |
| "entropy": 2.2751846730709078, | |
| "epoch": 3.225439104419996, | |
| "grad_norm": 0.21020469069480896, | |
| "learning_rate": 5.916657372446117e-06, | |
| "loss": 0.006749919056892395, | |
| "mean_token_accuracy": 0.9985294118523598, | |
| "num_tokens": 14922146.0, | |
| "step": 4180 | |
| }, | |
| { | |
| "entropy": 2.1631966710090635, | |
| "epoch": 3.2331596216946537, | |
| "grad_norm": 0.33755046129226685, | |
| "learning_rate": 5.8710801291294815e-06, | |
| "loss": 0.03264306783676148, | |
| "mean_token_accuracy": 0.9941071435809136, | |
| "num_tokens": 14958922.0, | |
| "step": 4190 | |
| }, | |
| { | |
| "entropy": 2.2516215592622757, | |
| "epoch": 3.240880138969311, | |
| "grad_norm": 0.3011329174041748, | |
| "learning_rate": 5.825606048995459e-06, | |
| "loss": 0.008013246208429336, | |
| "mean_token_accuracy": 0.9982007578015327, | |
| "num_tokens": 14995286.0, | |
| "step": 4200 | |
| }, | |
| { | |
| "entropy": 2.231572899222374, | |
| "epoch": 3.248600656243968, | |
| "grad_norm": 2.2834465503692627, | |
| "learning_rate": 5.780236268237286e-06, | |
| "loss": 0.015553775429725646, | |
| "mean_token_accuracy": 0.9944224849343299, | |
| "num_tokens": 15031929.0, | |
| "step": 4210 | |
| }, | |
| { | |
| "entropy": 2.2093691408634184, | |
| "epoch": 3.256321173518626, | |
| "grad_norm": 0.22805458307266235, | |
| "learning_rate": 5.7349719204422214e-06, | |
| "loss": 0.011248494684696197, | |
| "mean_token_accuracy": 0.9973071217536926, | |
| "num_tokens": 15072819.0, | |
| "step": 4220 | |
| }, | |
| { | |
| "entropy": 2.22184799015522, | |
| "epoch": 3.264041690793283, | |
| "grad_norm": 0.4345404803752899, | |
| "learning_rate": 5.689814136563241e-06, | |
| "loss": 0.006262413412332535, | |
| "mean_token_accuracy": 0.998863635957241, | |
| "num_tokens": 15108990.0, | |
| "step": 4230 | |
| }, | |
| { | |
| "entropy": 2.2079828560352324, | |
| "epoch": 3.2717622080679405, | |
| "grad_norm": 0.5222209095954895, | |
| "learning_rate": 5.644764044890752e-06, | |
| "loss": 0.013622181117534637, | |
| "mean_token_accuracy": 0.9969899669289589, | |
| "num_tokens": 15141615.0, | |
| "step": 4240 | |
| }, | |
| { | |
| "entropy": 2.149238818883896, | |
| "epoch": 3.2794827253425978, | |
| "grad_norm": 2.1469385623931885, | |
| "learning_rate": 5.599822771024419e-06, | |
| "loss": 0.015719014406204223, | |
| "mean_token_accuracy": 0.9969118013978004, | |
| "num_tokens": 15180770.0, | |
| "step": 4250 | |
| }, | |
| { | |
| "entropy": 2.241379123926163, | |
| "epoch": 3.2872032426172555, | |
| "grad_norm": 0.027104590088129044, | |
| "learning_rate": 5.554991437845048e-06, | |
| "loss": 0.0024414468556642533, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 15211585.0, | |
| "step": 4260 | |
| }, | |
| { | |
| "entropy": 2.1398084282875063, | |
| "epoch": 3.2949237598919128, | |
| "grad_norm": 0.11109408736228943, | |
| "learning_rate": 5.510271165486509e-06, | |
| "loss": 0.006358934193849563, | |
| "mean_token_accuracy": 0.9989583328366279, | |
| "num_tokens": 15248698.0, | |
| "step": 4270 | |
| }, | |
| { | |
| "entropy": 2.2906727343797684, | |
| "epoch": 3.30264427716657, | |
| "grad_norm": 0.28413844108581543, | |
| "learning_rate": 5.465663071307762e-06, | |
| "loss": 0.012974724173545837, | |
| "mean_token_accuracy": 0.9986111104488373, | |
| "num_tokens": 15280972.0, | |
| "step": 4280 | |
| }, | |
| { | |
| "entropy": 2.236059454083443, | |
| "epoch": 3.3103647944412273, | |
| "grad_norm": 0.6353345513343811, | |
| "learning_rate": 5.421168269864947e-06, | |
| "loss": 0.010030826926231385, | |
| "mean_token_accuracy": 0.9976310476660728, | |
| "num_tokens": 15318573.0, | |
| "step": 4290 | |
| }, | |
| { | |
| "entropy": 2.277936393022537, | |
| "epoch": 3.318085311715885, | |
| "grad_norm": 0.15945784747600555, | |
| "learning_rate": 5.376787872883518e-06, | |
| "loss": 0.02424613982439041, | |
| "mean_token_accuracy": 0.9960007324814797, | |
| "num_tokens": 15349593.0, | |
| "step": 4300 | |
| }, | |
| { | |
| "entropy": 2.1999513030052187, | |
| "epoch": 3.3258058289905423, | |
| "grad_norm": 0.8073568344116211, | |
| "learning_rate": 5.332522989230474e-06, | |
| "loss": 0.014913980662822724, | |
| "mean_token_accuracy": 0.9958407923579216, | |
| "num_tokens": 15384204.0, | |
| "step": 4310 | |
| }, | |
| { | |
| "entropy": 2.273113438487053, | |
| "epoch": 3.3335263462651996, | |
| "grad_norm": 0.010039719752967358, | |
| "learning_rate": 5.288374724886656e-06, | |
| "loss": 0.008377297222614289, | |
| "mean_token_accuracy": 0.9974475517868996, | |
| "num_tokens": 15419086.0, | |
| "step": 4320 | |
| }, | |
| { | |
| "entropy": 2.123158890008926, | |
| "epoch": 3.3412468635398573, | |
| "grad_norm": 0.423715204000473, | |
| "learning_rate": 5.2443441829191175e-06, | |
| "loss": 0.018509870767593382, | |
| "mean_token_accuracy": 0.9957080200314522, | |
| "num_tokens": 15456863.0, | |
| "step": 4330 | |
| }, | |
| { | |
| "entropy": 2.177235481142998, | |
| "epoch": 3.3489673808145146, | |
| "grad_norm": 0.035253945738077164, | |
| "learning_rate": 5.200432463453552e-06, | |
| "loss": 0.012387002259492874, | |
| "mean_token_accuracy": 0.9969292849302291, | |
| "num_tokens": 15494675.0, | |
| "step": 4340 | |
| }, | |
| { | |
| "entropy": 2.1819762349128724, | |
| "epoch": 3.356687898089172, | |
| "grad_norm": 0.7576441764831543, | |
| "learning_rate": 5.1566406636468085e-06, | |
| "loss": 0.028994646668434144, | |
| "mean_token_accuracy": 0.9916816547513008, | |
| "num_tokens": 15529963.0, | |
| "step": 4350 | |
| }, | |
| { | |
| "entropy": 2.1758675992488863, | |
| "epoch": 3.3644084153638296, | |
| "grad_norm": 0.2250443994998932, | |
| "learning_rate": 5.112969877659493e-06, | |
| "loss": 0.004997969418764114, | |
| "mean_token_accuracy": 0.9987468659877777, | |
| "num_tokens": 15564461.0, | |
| "step": 4360 | |
| }, | |
| { | |
| "entropy": 2.239803743362427, | |
| "epoch": 3.372128932638487, | |
| "grad_norm": 0.1805865317583084, | |
| "learning_rate": 5.06942119662861e-06, | |
| "loss": 0.005810170248150825, | |
| "mean_token_accuracy": 0.9986111104488373, | |
| "num_tokens": 15598051.0, | |
| "step": 4370 | |
| }, | |
| { | |
| "entropy": 2.125052031874657, | |
| "epoch": 3.379849449913144, | |
| "grad_norm": 4.371738433837891, | |
| "learning_rate": 5.02599570864031e-06, | |
| "loss": 0.015517064929008484, | |
| "mean_token_accuracy": 0.9934965163469315, | |
| "num_tokens": 15637669.0, | |
| "step": 4380 | |
| }, | |
| { | |
| "entropy": 2.2460622638463974, | |
| "epoch": 3.3875699671878015, | |
| "grad_norm": 0.18027924001216888, | |
| "learning_rate": 4.982694498702702e-06, | |
| "loss": 0.005739504098892212, | |
| "mean_token_accuracy": 0.9993750005960464, | |
| "num_tokens": 15670862.0, | |
| "step": 4390 | |
| }, | |
| { | |
| "entropy": 2.213028836250305, | |
| "epoch": 3.3952904844624587, | |
| "grad_norm": 1.9674371480941772, | |
| "learning_rate": 4.939518648718746e-06, | |
| "loss": 0.012049780786037445, | |
| "mean_token_accuracy": 0.9981812179088593, | |
| "num_tokens": 15706922.0, | |
| "step": 4400 | |
| }, | |
| { | |
| "entropy": 2.2505041897296905, | |
| "epoch": 3.4030110017371165, | |
| "grad_norm": 1.6243531703948975, | |
| "learning_rate": 4.896469237459228e-06, | |
| "loss": 0.003813191503286362, | |
| "mean_token_accuracy": 0.999074074625969, | |
| "num_tokens": 15745049.0, | |
| "step": 4410 | |
| }, | |
| { | |
| "entropy": 2.102014201879501, | |
| "epoch": 3.4107315190117737, | |
| "grad_norm": 2.138728618621826, | |
| "learning_rate": 4.853547340535775e-06, | |
| "loss": 0.014606839418411255, | |
| "mean_token_accuracy": 0.998145604133606, | |
| "num_tokens": 15782169.0, | |
| "step": 4420 | |
| }, | |
| { | |
| "entropy": 2.166767033934593, | |
| "epoch": 3.418452036286431, | |
| "grad_norm": 0.09994740039110184, | |
| "learning_rate": 4.810754030374024e-06, | |
| "loss": 0.022449350357055663, | |
| "mean_token_accuracy": 0.9930004492402077, | |
| "num_tokens": 15819096.0, | |
| "step": 4430 | |
| }, | |
| { | |
| "entropy": 2.1858236521482466, | |
| "epoch": 3.4261725535610887, | |
| "grad_norm": 0.3162212073802948, | |
| "learning_rate": 4.768090376186797e-06, | |
| "loss": 0.023777911067008974, | |
| "mean_token_accuracy": 0.9946548566222191, | |
| "num_tokens": 15862846.0, | |
| "step": 4440 | |
| }, | |
| { | |
| "entropy": 2.189643532037735, | |
| "epoch": 3.433893070835746, | |
| "grad_norm": 0.39837151765823364, | |
| "learning_rate": 4.72555744394739e-06, | |
| "loss": 0.018805976212024688, | |
| "mean_token_accuracy": 0.9932140588760376, | |
| "num_tokens": 15904709.0, | |
| "step": 4450 | |
| }, | |
| { | |
| "entropy": 2.2112290412187576, | |
| "epoch": 3.4416135881104033, | |
| "grad_norm": 0.025752931833267212, | |
| "learning_rate": 4.68315629636296e-06, | |
| "loss": 0.0037055592983961105, | |
| "mean_token_accuracy": 0.9986111104488373, | |
| "num_tokens": 15940870.0, | |
| "step": 4460 | |
| }, | |
| { | |
| "entropy": 2.195486468076706, | |
| "epoch": 3.449334105385061, | |
| "grad_norm": 3.4531970024108887, | |
| "learning_rate": 4.64088799284794e-06, | |
| "loss": 0.009186282008886337, | |
| "mean_token_accuracy": 0.996559077501297, | |
| "num_tokens": 15977007.0, | |
| "step": 4470 | |
| }, | |
| { | |
| "entropy": 2.2477256029844286, | |
| "epoch": 3.4570546226597183, | |
| "grad_norm": 0.017128420993685722, | |
| "learning_rate": 4.598753589497595e-06, | |
| "loss": 0.034723791480064395, | |
| "mean_token_accuracy": 0.990346123278141, | |
| "num_tokens": 16010302.0, | |
| "step": 4480 | |
| }, | |
| { | |
| "entropy": 2.266435816884041, | |
| "epoch": 3.4647751399343756, | |
| "grad_norm": 0.011056693270802498, | |
| "learning_rate": 4.5567541390616165e-06, | |
| "loss": 0.020518609881401063, | |
| "mean_token_accuracy": 0.994847884774208, | |
| "num_tokens": 16045264.0, | |
| "step": 4490 | |
| }, | |
| { | |
| "entropy": 2.2363200038671494, | |
| "epoch": 3.472495657209033, | |
| "grad_norm": 0.28764382004737854, | |
| "learning_rate": 4.514890690917844e-06, | |
| "loss": 0.030601662397384644, | |
| "mean_token_accuracy": 0.9958360910415649, | |
| "num_tokens": 16084354.0, | |
| "step": 4500 | |
| }, | |
| { | |
| "epoch": 3.472495657209033, | |
| "eval_entropy": 2.094737304290883, | |
| "eval_loss": 0.49774986505508423, | |
| "eval_mean_token_accuracy": 0.9358505434127935, | |
| "eval_num_tokens": 16084354.0, | |
| "eval_runtime": 987.909, | |
| "eval_samples_per_second": 7.745, | |
| "eval_steps_per_second": 0.969, | |
| "step": 4500 | |
| }, | |
| { | |
| "entropy": 2.167369270324707, | |
| "epoch": 3.4802161744836906, | |
| "grad_norm": 0.8214945793151855, | |
| "learning_rate": 4.473164291046016e-06, | |
| "loss": 0.0059088427573442456, | |
| "mean_token_accuracy": 0.9981317937374115, | |
| "num_tokens": 16120147.0, | |
| "step": 4510 | |
| }, | |
| { | |
| "entropy": 2.227228084206581, | |
| "epoch": 3.487936691758348, | |
| "grad_norm": 0.32604676485061646, | |
| "learning_rate": 4.431575982001651e-06, | |
| "loss": 0.011142008751630784, | |
| "mean_token_accuracy": 0.9969166651368141, | |
| "num_tokens": 16153451.0, | |
| "step": 4520 | |
| }, | |
| { | |
| "entropy": 2.2228987962007523, | |
| "epoch": 3.495657209033005, | |
| "grad_norm": 4.1868085861206055, | |
| "learning_rate": 4.390126802890008e-06, | |
| "loss": 0.021856479346752167, | |
| "mean_token_accuracy": 0.9982320085167885, | |
| "num_tokens": 16189202.0, | |
| "step": 4530 | |
| }, | |
| { | |
| "entropy": 2.173022910952568, | |
| "epoch": 3.5033777263076624, | |
| "grad_norm": 1.626468539237976, | |
| "learning_rate": 4.348817789340102e-06, | |
| "loss": 0.006640783697366715, | |
| "mean_token_accuracy": 0.9993055552244187, | |
| "num_tokens": 16229153.0, | |
| "step": 4540 | |
| }, | |
| { | |
| "entropy": 2.2181044608354568, | |
| "epoch": 3.51109824358232, | |
| "grad_norm": 0.957091748714447, | |
| "learning_rate": 4.307649973478838e-06, | |
| "loss": 0.021261365711688997, | |
| "mean_token_accuracy": 0.9973930478096008, | |
| "num_tokens": 16261419.0, | |
| "step": 4550 | |
| }, | |
| { | |
| "entropy": 2.163629150390625, | |
| "epoch": 3.5188187608569774, | |
| "grad_norm": 3.54240083694458, | |
| "learning_rate": 4.266624383905238e-06, | |
| "loss": 0.014290031790733338, | |
| "mean_token_accuracy": 0.9942340418696404, | |
| "num_tokens": 16297418.0, | |
| "step": 4560 | |
| }, | |
| { | |
| "entropy": 2.165030711889267, | |
| "epoch": 3.5265392781316347, | |
| "grad_norm": 0.8268080353736877, | |
| "learning_rate": 4.225742045664713e-06, | |
| "loss": 0.013842463493347168, | |
| "mean_token_accuracy": 0.9971296295523644, | |
| "num_tokens": 16333646.0, | |
| "step": 4570 | |
| }, | |
| { | |
| "entropy": 2.2287199676036833, | |
| "epoch": 3.5342597954062924, | |
| "grad_norm": 0.16437366604804993, | |
| "learning_rate": 4.1850039802234754e-06, | |
| "loss": 0.0037029199302196503, | |
| "mean_token_accuracy": 0.9989583328366279, | |
| "num_tokens": 16367085.0, | |
| "step": 4580 | |
| }, | |
| { | |
| "entropy": 2.2051072388887407, | |
| "epoch": 3.5419803126809497, | |
| "grad_norm": 0.2944578528404236, | |
| "learning_rate": 4.144411205442996e-06, | |
| "loss": 0.022799597680568696, | |
| "mean_token_accuracy": 0.995043994486332, | |
| "num_tokens": 16403393.0, | |
| "step": 4590 | |
| }, | |
| { | |
| "entropy": 2.192304465174675, | |
| "epoch": 3.549700829955607, | |
| "grad_norm": 3.0054590702056885, | |
| "learning_rate": 4.103964735554602e-06, | |
| "loss": 0.031678736209869385, | |
| "mean_token_accuracy": 0.9951188251376152, | |
| "num_tokens": 16438181.0, | |
| "step": 4600 | |
| }, | |
| { | |
| "entropy": 2.24237465262413, | |
| "epoch": 3.5574213472302643, | |
| "grad_norm": 3.488093376159668, | |
| "learning_rate": 4.063665581134101e-06, | |
| "loss": 0.016337577998638154, | |
| "mean_token_accuracy": 0.9961950778961182, | |
| "num_tokens": 16474359.0, | |
| "step": 4610 | |
| }, | |
| { | |
| "entropy": 2.1587339490652084, | |
| "epoch": 3.565141864504922, | |
| "grad_norm": 0.4733858108520508, | |
| "learning_rate": 4.023514749076553e-06, | |
| "loss": 0.022992467880249022, | |
| "mean_token_accuracy": 0.9947966426610947, | |
| "num_tokens": 16508074.0, | |
| "step": 4620 | |
| }, | |
| { | |
| "entropy": 2.2088340640068056, | |
| "epoch": 3.5728623817795793, | |
| "grad_norm": 0.09064114093780518, | |
| "learning_rate": 3.983513242571113e-06, | |
| "loss": 0.024549849331378937, | |
| "mean_token_accuracy": 0.9951631486415863, | |
| "num_tokens": 16545666.0, | |
| "step": 4630 | |
| }, | |
| { | |
| "entropy": 2.1512410193681717, | |
| "epoch": 3.5805828990542365, | |
| "grad_norm": 0.4027511179447174, | |
| "learning_rate": 3.943662061075957e-06, | |
| "loss": 0.008296293765306472, | |
| "mean_token_accuracy": 0.9972971126437187, | |
| "num_tokens": 16582524.0, | |
| "step": 4640 | |
| }, | |
| { | |
| "entropy": 2.2184607803821565, | |
| "epoch": 3.588303416328894, | |
| "grad_norm": 0.21228182315826416, | |
| "learning_rate": 3.903962200293305e-06, | |
| "loss": 0.006698296964168548, | |
| "mean_token_accuracy": 0.9988095238804817, | |
| "num_tokens": 16619971.0, | |
| "step": 4650 | |
| }, | |
| { | |
| "entropy": 2.1930524677038195, | |
| "epoch": 3.5960239336035515, | |
| "grad_norm": 0.12852530181407928, | |
| "learning_rate": 3.86441465214457e-06, | |
| "loss": 0.019022318720817565, | |
| "mean_token_accuracy": 0.9959166675806046, | |
| "num_tokens": 16655670.0, | |
| "step": 4660 | |
| }, | |
| { | |
| "entropy": 2.2068610817193983, | |
| "epoch": 3.603744450878209, | |
| "grad_norm": 0.11005378514528275, | |
| "learning_rate": 3.825020404745539e-06, | |
| "loss": 0.02366378754377365, | |
| "mean_token_accuracy": 0.9947434559464454, | |
| "num_tokens": 16692946.0, | |
| "step": 4670 | |
| }, | |
| { | |
| "entropy": 2.158995199203491, | |
| "epoch": 3.611464968152866, | |
| "grad_norm": 0.06957825273275375, | |
| "learning_rate": 3.785780442381708e-06, | |
| "loss": 0.006554947793483734, | |
| "mean_token_accuracy": 0.9985294118523598, | |
| "num_tokens": 16728342.0, | |
| "step": 4680 | |
| }, | |
| { | |
| "entropy": 2.201757091283798, | |
| "epoch": 3.619185485427524, | |
| "grad_norm": 0.013743036426603794, | |
| "learning_rate": 3.746695745483676e-06, | |
| "loss": 0.022013702988624574, | |
| "mean_token_accuracy": 0.9964899107813835, | |
| "num_tokens": 16765997.0, | |
| "step": 4690 | |
| }, | |
| { | |
| "entropy": 2.189955911040306, | |
| "epoch": 3.626906002702181, | |
| "grad_norm": 1.3227832317352295, | |
| "learning_rate": 3.7077672906026674e-06, | |
| "loss": 0.009854133427143096, | |
| "mean_token_accuracy": 0.9972507312893868, | |
| "num_tokens": 16806476.0, | |
| "step": 4700 | |
| }, | |
| { | |
| "entropy": 2.2155461460351944, | |
| "epoch": 3.6346265199768384, | |
| "grad_norm": 0.07080277055501938, | |
| "learning_rate": 3.66899605038611e-06, | |
| "loss": 0.018130703270435332, | |
| "mean_token_accuracy": 0.9930429771542549, | |
| "num_tokens": 16839996.0, | |
| "step": 4710 | |
| }, | |
| { | |
| "entropy": 2.2547535479068754, | |
| "epoch": 3.642347037251496, | |
| "grad_norm": 0.03352458029985428, | |
| "learning_rate": 3.6303829935533387e-06, | |
| "loss": 0.023316796123981475, | |
| "mean_token_accuracy": 0.9934576332569123, | |
| "num_tokens": 16870710.0, | |
| "step": 4720 | |
| }, | |
| { | |
| "entropy": 2.2180339872837065, | |
| "epoch": 3.6500675545261534, | |
| "grad_norm": 0.08932402729988098, | |
| "learning_rate": 3.5919290848714083e-06, | |
| "loss": 0.019556549191474915, | |
| "mean_token_accuracy": 0.9943825855851174, | |
| "num_tokens": 16905867.0, | |
| "step": 4730 | |
| }, | |
| { | |
| "entropy": 2.25754671394825, | |
| "epoch": 3.6577880718008107, | |
| "grad_norm": 0.36979636549949646, | |
| "learning_rate": 3.5536352851309654e-06, | |
| "loss": 0.010746852308511735, | |
| "mean_token_accuracy": 0.9972794115543365, | |
| "num_tokens": 16942946.0, | |
| "step": 4740 | |
| }, | |
| { | |
| "entropy": 2.173688989877701, | |
| "epoch": 3.665508589075468, | |
| "grad_norm": 0.9019256830215454, | |
| "learning_rate": 3.5155025511222553e-06, | |
| "loss": 0.013900287449359894, | |
| "mean_token_accuracy": 0.9956018269062042, | |
| "num_tokens": 16982691.0, | |
| "step": 4750 | |
| }, | |
| { | |
| "entropy": 2.186745339632034, | |
| "epoch": 3.6732291063501252, | |
| "grad_norm": 1.9558967351913452, | |
| "learning_rate": 3.4775318356112085e-06, | |
| "loss": 0.0026500292122364046, | |
| "mean_token_accuracy": 0.9984375, | |
| "num_tokens": 17014619.0, | |
| "step": 4760 | |
| }, | |
| { | |
| "entropy": 2.190760698914528, | |
| "epoch": 3.680949623624783, | |
| "grad_norm": 0.6850957274436951, | |
| "learning_rate": 3.439724087315649e-06, | |
| "loss": 0.008563292026519776, | |
| "mean_token_accuracy": 0.997857142984867, | |
| "num_tokens": 17049479.0, | |
| "step": 4770 | |
| }, | |
| { | |
| "entropy": 2.2078921467065813, | |
| "epoch": 3.6886701408994402, | |
| "grad_norm": 0.48178425431251526, | |
| "learning_rate": 3.4020802508815844e-06, | |
| "loss": 0.00671912282705307, | |
| "mean_token_accuracy": 0.9985702604055404, | |
| "num_tokens": 17084774.0, | |
| "step": 4780 | |
| }, | |
| { | |
| "entropy": 2.199252927303314, | |
| "epoch": 3.6963906581740975, | |
| "grad_norm": 3.1879372596740723, | |
| "learning_rate": 3.3646012668595797e-06, | |
| "loss": 0.012920960783958435, | |
| "mean_token_accuracy": 0.9954613089561463, | |
| "num_tokens": 17118756.0, | |
| "step": 4790 | |
| }, | |
| { | |
| "entropy": 2.192939519882202, | |
| "epoch": 3.7041111754487552, | |
| "grad_norm": 3.9493212699890137, | |
| "learning_rate": 3.3272880716812994e-06, | |
| "loss": 0.010051518678665161, | |
| "mean_token_accuracy": 0.996506179869175, | |
| "num_tokens": 17151694.0, | |
| "step": 4800 | |
| }, | |
| { | |
| "entropy": 2.2035789877176284, | |
| "epoch": 3.7118316927234125, | |
| "grad_norm": 0.0355636328458786, | |
| "learning_rate": 3.2901415976360773e-06, | |
| "loss": 0.012046564370393753, | |
| "mean_token_accuracy": 0.9979532152414322, | |
| "num_tokens": 17188300.0, | |
| "step": 4810 | |
| }, | |
| { | |
| "entropy": 2.265298753976822, | |
| "epoch": 3.71955220999807, | |
| "grad_norm": 0.5305169224739075, | |
| "learning_rate": 3.2531627728476357e-06, | |
| "loss": 0.015401627123355865, | |
| "mean_token_accuracy": 0.9960317447781563, | |
| "num_tokens": 17226628.0, | |
| "step": 4820 | |
| }, | |
| { | |
| "entropy": 2.235144093632698, | |
| "epoch": 3.7272727272727275, | |
| "grad_norm": 1.9314122200012207, | |
| "learning_rate": 3.2163525212509008e-06, | |
| "loss": 0.012413406372070312, | |
| "mean_token_accuracy": 0.9970962628722191, | |
| "num_tokens": 17261288.0, | |
| "step": 4830 | |
| }, | |
| { | |
| "entropy": 2.1957934617996218, | |
| "epoch": 3.734993244547385, | |
| "grad_norm": 0.05546269565820694, | |
| "learning_rate": 3.1797117625689024e-06, | |
| "loss": 0.00331185944378376, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 17296586.0, | |
| "step": 4840 | |
| }, | |
| { | |
| "entropy": 2.2121754467487333, | |
| "epoch": 3.742713761822042, | |
| "grad_norm": 0.16634555160999298, | |
| "learning_rate": 3.1432414122898057e-06, | |
| "loss": 0.01630573719739914, | |
| "mean_token_accuracy": 0.99408238530159, | |
| "num_tokens": 17330163.0, | |
| "step": 4850 | |
| }, | |
| { | |
| "entropy": 2.2177652209997176, | |
| "epoch": 3.7504342790966994, | |
| "grad_norm": 0.054232124239206314, | |
| "learning_rate": 3.1069423816440324e-06, | |
| "loss": 0.005872461199760437, | |
| "mean_token_accuracy": 0.9970823854207993, | |
| "num_tokens": 17364167.0, | |
| "step": 4860 | |
| }, | |
| { | |
| "entropy": 2.2218244522809982, | |
| "epoch": 3.7581547963713566, | |
| "grad_norm": 0.05728960037231445, | |
| "learning_rate": 3.070815577581505e-06, | |
| "loss": 0.023728246986865997, | |
| "mean_token_accuracy": 0.994246032834053, | |
| "num_tokens": 17396732.0, | |
| "step": 4870 | |
| }, | |
| { | |
| "entropy": 2.270163568854332, | |
| "epoch": 3.7658753136460144, | |
| "grad_norm": 2.1181461811065674, | |
| "learning_rate": 3.0348619027489656e-06, | |
| "loss": 0.013901802897453307, | |
| "mean_token_accuracy": 0.9959643810987473, | |
| "num_tokens": 17433024.0, | |
| "step": 4880 | |
| }, | |
| { | |
| "entropy": 2.194043418765068, | |
| "epoch": 3.7735958309206716, | |
| "grad_norm": 0.1262357532978058, | |
| "learning_rate": 2.9990822554674325e-06, | |
| "loss": 0.009613892436027527, | |
| "mean_token_accuracy": 0.9968301028013229, | |
| "num_tokens": 17472584.0, | |
| "step": 4890 | |
| }, | |
| { | |
| "entropy": 2.2226660668849947, | |
| "epoch": 3.781316348195329, | |
| "grad_norm": 0.12729032337665558, | |
| "learning_rate": 2.9634775297097693e-06, | |
| "loss": 0.0013892247341573238, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 17509334.0, | |
| "step": 4900 | |
| }, | |
| { | |
| "entropy": 2.2277002543210984, | |
| "epoch": 3.7890368654699866, | |
| "grad_norm": 0.04032934457063675, | |
| "learning_rate": 2.928048615078324e-06, | |
| "loss": 0.008014556765556336, | |
| "mean_token_accuracy": 0.9958013474941254, | |
| "num_tokens": 17551004.0, | |
| "step": 4910 | |
| }, | |
| { | |
| "entropy": 2.23101692199707, | |
| "epoch": 3.796757382744644, | |
| "grad_norm": 0.05918664112687111, | |
| "learning_rate": 2.8927963967827124e-06, | |
| "loss": 0.011012130230665208, | |
| "mean_token_accuracy": 0.9966880336403847, | |
| "num_tokens": 17590813.0, | |
| "step": 4920 | |
| }, | |
| { | |
| "entropy": 2.309200382232666, | |
| "epoch": 3.804477900019301, | |
| "grad_norm": 0.039273522794246674, | |
| "learning_rate": 2.8577217556177115e-06, | |
| "loss": 0.010339566320180894, | |
| "mean_token_accuracy": 0.9992424249649048, | |
| "num_tokens": 17622252.0, | |
| "step": 4930 | |
| }, | |
| { | |
| "entropy": 2.2433013200759886, | |
| "epoch": 3.812198417293959, | |
| "grad_norm": 0.3272627294063568, | |
| "learning_rate": 2.8228255679412353e-06, | |
| "loss": 0.009843137860298157, | |
| "mean_token_accuracy": 0.99921875, | |
| "num_tokens": 17662561.0, | |
| "step": 4940 | |
| }, | |
| { | |
| "entropy": 2.2392791122198106, | |
| "epoch": 3.819918934568616, | |
| "grad_norm": 0.038887813687324524, | |
| "learning_rate": 2.7881087056524468e-06, | |
| "loss": 0.008080794662237167, | |
| "mean_token_accuracy": 0.9986842110753059, | |
| "num_tokens": 17694695.0, | |
| "step": 4950 | |
| }, | |
| { | |
| "entropy": 2.2464512795209886, | |
| "epoch": 3.8276394518432735, | |
| "grad_norm": 0.4352750778198242, | |
| "learning_rate": 2.7535720361699703e-06, | |
| "loss": 0.006981483101844788, | |
| "mean_token_accuracy": 0.9978636354207993, | |
| "num_tokens": 17726808.0, | |
| "step": 4960 | |
| }, | |
| { | |
| "entropy": 2.2429711014032363, | |
| "epoch": 3.8353599691179308, | |
| "grad_norm": 3.1303551197052, | |
| "learning_rate": 2.7192164224102267e-06, | |
| "loss": 0.009275702387094497, | |
| "mean_token_accuracy": 0.9982230380177498, | |
| "num_tokens": 17763685.0, | |
| "step": 4970 | |
| }, | |
| { | |
| "entropy": 2.167110252380371, | |
| "epoch": 3.843080486392588, | |
| "grad_norm": 3.1086466312408447, | |
| "learning_rate": 2.6850427227658625e-06, | |
| "loss": 0.01786840558052063, | |
| "mean_token_accuracy": 0.9957186207175255, | |
| "num_tokens": 17800532.0, | |
| "step": 4980 | |
| }, | |
| { | |
| "entropy": 2.202439108490944, | |
| "epoch": 3.8508010036672458, | |
| "grad_norm": 0.03255437687039375, | |
| "learning_rate": 2.6510517910843014e-06, | |
| "loss": 0.014580619335174561, | |
| "mean_token_accuracy": 0.9978412076830864, | |
| "num_tokens": 17836043.0, | |
| "step": 4990 | |
| }, | |
| { | |
| "entropy": 2.2670375287532805, | |
| "epoch": 3.858521520941903, | |
| "grad_norm": 0.09342753142118454, | |
| "learning_rate": 2.617244476646429e-06, | |
| "loss": 0.01826583743095398, | |
| "mean_token_accuracy": 0.9961647734045982, | |
| "num_tokens": 17872352.0, | |
| "step": 5000 | |
| }, | |
| { | |
| "epoch": 3.858521520941903, | |
| "eval_entropy": 2.0908612560951845, | |
| "eval_loss": 0.507649302482605, | |
| "eval_mean_token_accuracy": 0.9354228066551025, | |
| "eval_num_tokens": 17872352.0, | |
| "eval_runtime": 987.5554, | |
| "eval_samples_per_second": 7.747, | |
| "eval_steps_per_second": 0.969, | |
| "step": 5000 | |
| }, | |
| { | |
| "entropy": 2.1657870292663572, | |
| "epoch": 3.8662420382165603, | |
| "grad_norm": 0.19421711564064026, | |
| "learning_rate": 2.5836216241453473e-06, | |
| "loss": 0.014168056845664977, | |
| "mean_token_accuracy": 0.9971320345997811, | |
| "num_tokens": 17912375.0, | |
| "step": 5010 | |
| }, | |
| { | |
| "entropy": 2.1820801228284834, | |
| "epoch": 3.873962555491218, | |
| "grad_norm": 1.4638241529464722, | |
| "learning_rate": 2.5501840736652884e-06, | |
| "loss": 0.008419310301542282, | |
| "mean_token_accuracy": 0.9989999994635582, | |
| "num_tokens": 17950474.0, | |
| "step": 5020 | |
| }, | |
| { | |
| "entropy": 2.2266716092824934, | |
| "epoch": 3.8816830727658753, | |
| "grad_norm": 0.12025623768568039, | |
| "learning_rate": 2.5169326606606127e-06, | |
| "loss": 0.004219979792833328, | |
| "mean_token_accuracy": 0.9989130437374115, | |
| "num_tokens": 17983123.0, | |
| "step": 5030 | |
| }, | |
| { | |
| "entropy": 2.23225157558918, | |
| "epoch": 3.8894035900405326, | |
| "grad_norm": 2.4465901851654053, | |
| "learning_rate": 2.4838682159349504e-06, | |
| "loss": 0.01536642462015152, | |
| "mean_token_accuracy": 0.9948759660124779, | |
| "num_tokens": 18016866.0, | |
| "step": 5040 | |
| }, | |
| { | |
| "entropy": 2.2503413647413253, | |
| "epoch": 3.8971241073151903, | |
| "grad_norm": 0.26093390583992004, | |
| "learning_rate": 2.4509915656204242e-06, | |
| "loss": 0.018379612267017363, | |
| "mean_token_accuracy": 0.9953591957688331, | |
| "num_tokens": 18050369.0, | |
| "step": 5050 | |
| }, | |
| { | |
| "entropy": 2.346876162290573, | |
| "epoch": 3.9048446245898476, | |
| "grad_norm": 0.04715586453676224, | |
| "learning_rate": 2.418303531157017e-06, | |
| "loss": 0.006166347116231918, | |
| "mean_token_accuracy": 0.9976365551352501, | |
| "num_tokens": 18085766.0, | |
| "step": 5060 | |
| }, | |
| { | |
| "entropy": 2.2075785368680956, | |
| "epoch": 3.912565141864505, | |
| "grad_norm": 0.06558074057102203, | |
| "learning_rate": 2.3858049292720565e-06, | |
| "loss": 0.010641612112522125, | |
| "mean_token_accuracy": 0.9973457798361778, | |
| "num_tokens": 18118325.0, | |
| "step": 5070 | |
| }, | |
| { | |
| "entropy": 2.1510800033807755, | |
| "epoch": 3.920285659139162, | |
| "grad_norm": 2.4715569019317627, | |
| "learning_rate": 2.353496571959791e-06, | |
| "loss": 0.008443721383810044, | |
| "mean_token_accuracy": 0.9969614043831825, | |
| "num_tokens": 18155458.0, | |
| "step": 5080 | |
| }, | |
| { | |
| "entropy": 2.219439336657524, | |
| "epoch": 3.92800617641382, | |
| "grad_norm": 0.02134764939546585, | |
| "learning_rate": 2.3213792664611123e-06, | |
| "loss": 0.020188172161579133, | |
| "mean_token_accuracy": 0.9954755708575249, | |
| "num_tokens": 18188388.0, | |
| "step": 5090 | |
| }, | |
| { | |
| "entropy": 2.1883194625377653, | |
| "epoch": 3.935726693688477, | |
| "grad_norm": 0.009646475315093994, | |
| "learning_rate": 2.289453815243391e-06, | |
| "loss": 0.009002915769815444, | |
| "mean_token_accuracy": 0.9987499997019768, | |
| "num_tokens": 18228648.0, | |
| "step": 5100 | |
| }, | |
| { | |
| "entropy": 2.1794584810733797, | |
| "epoch": 3.9434472109631344, | |
| "grad_norm": 0.06897470355033875, | |
| "learning_rate": 2.2577210159804107e-06, | |
| "loss": 0.01597502678632736, | |
| "mean_token_accuracy": 0.9932748913764954, | |
| "num_tokens": 18267139.0, | |
| "step": 5110 | |
| }, | |
| { | |
| "entropy": 2.217776373028755, | |
| "epoch": 3.9511677282377917, | |
| "grad_norm": 3.1233739852905273, | |
| "learning_rate": 2.226181661532455e-06, | |
| "loss": 0.02588752806186676, | |
| "mean_token_accuracy": 0.993584081530571, | |
| "num_tokens": 18305735.0, | |
| "step": 5120 | |
| }, | |
| { | |
| "entropy": 2.188844358921051, | |
| "epoch": 3.9588882455124494, | |
| "grad_norm": 0.6708783507347107, | |
| "learning_rate": 2.1948365399264802e-06, | |
| "loss": 0.014759351313114167, | |
| "mean_token_accuracy": 0.9980769217014313, | |
| "num_tokens": 18339445.0, | |
| "step": 5130 | |
| }, | |
| { | |
| "entropy": 2.1940950095653533, | |
| "epoch": 3.9666087627871067, | |
| "grad_norm": 0.0733635202050209, | |
| "learning_rate": 2.163686434336448e-06, | |
| "loss": 0.015484817326068878, | |
| "mean_token_accuracy": 0.9958730831742286, | |
| "num_tokens": 18372350.0, | |
| "step": 5140 | |
| }, | |
| { | |
| "entropy": 2.249452704191208, | |
| "epoch": 3.974329280061764, | |
| "grad_norm": 0.0156388096511364, | |
| "learning_rate": 2.1327321230637355e-06, | |
| "loss": 0.02897282540798187, | |
| "mean_token_accuracy": 0.994414983689785, | |
| "num_tokens": 18408315.0, | |
| "step": 5150 | |
| }, | |
| { | |
| "entropy": 2.2180632591247558, | |
| "epoch": 3.9820497973364217, | |
| "grad_norm": 0.5558152794837952, | |
| "learning_rate": 2.101974379517697e-06, | |
| "loss": 0.0015709832310676574, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 18441147.0, | |
| "step": 5160 | |
| }, | |
| { | |
| "entropy": 2.251400685310364, | |
| "epoch": 3.989770314611079, | |
| "grad_norm": 0.07538606226444244, | |
| "learning_rate": 2.071413972196351e-06, | |
| "loss": 0.010088697820901871, | |
| "mean_token_accuracy": 0.9971969693899154, | |
| "num_tokens": 18477218.0, | |
| "step": 5170 | |
| }, | |
| { | |
| "entropy": 2.265915700793266, | |
| "epoch": 3.9974908318857363, | |
| "grad_norm": 0.07861519604921341, | |
| "learning_rate": 2.04105166466716e-06, | |
| "loss": 0.013128484785556793, | |
| "mean_token_accuracy": 0.9976960763335228, | |
| "num_tokens": 18513822.0, | |
| "step": 5180 | |
| }, | |
| { | |
| "entropy": 2.2155757626971684, | |
| "epoch": 4.004632310364794, | |
| "grad_norm": 0.15793584287166595, | |
| "learning_rate": 2.0108882155479602e-06, | |
| "loss": 0.014671583473682404, | |
| "mean_token_accuracy": 0.9959569025684047, | |
| "num_tokens": 18544084.0, | |
| "step": 5190 | |
| }, | |
| { | |
| "entropy": 2.216670718789101, | |
| "epoch": 4.012352827639452, | |
| "grad_norm": 0.10165757685899734, | |
| "learning_rate": 1.9809243784880215e-06, | |
| "loss": 0.001284267660230398, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 18579882.0, | |
| "step": 5200 | |
| }, | |
| { | |
| "entropy": 2.1769883900880815, | |
| "epoch": 4.020073344914109, | |
| "grad_norm": 0.02957017533481121, | |
| "learning_rate": 1.9511609021491895e-06, | |
| "loss": 0.003650863468647003, | |
| "mean_token_accuracy": 0.9989999994635582, | |
| "num_tokens": 18615819.0, | |
| "step": 5210 | |
| }, | |
| { | |
| "entropy": 2.237304484844208, | |
| "epoch": 4.027793862188767, | |
| "grad_norm": 0.22377407550811768, | |
| "learning_rate": 1.921598530187202e-06, | |
| "loss": 0.0013460190035402774, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 18649294.0, | |
| "step": 5220 | |
| }, | |
| { | |
| "entropy": 2.2296341180801393, | |
| "epoch": 4.035514379463424, | |
| "grad_norm": 0.028993308544158936, | |
| "learning_rate": 1.8922380012330943e-06, | |
| "loss": 0.001667243242263794, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 18686007.0, | |
| "step": 5230 | |
| }, | |
| { | |
| "entropy": 2.258844423294067, | |
| "epoch": 4.043234896738081, | |
| "grad_norm": 0.047745853662490845, | |
| "learning_rate": 1.8630800488747625e-06, | |
| "loss": 0.005907272547483444, | |
| "mean_token_accuracy": 0.9991935476660728, | |
| "num_tokens": 18718290.0, | |
| "step": 5240 | |
| }, | |
| { | |
| "entropy": 2.2396200627088545, | |
| "epoch": 4.050955414012739, | |
| "grad_norm": 0.11687777936458588, | |
| "learning_rate": 1.8341254016386102e-06, | |
| "loss": 0.011040620505809784, | |
| "mean_token_accuracy": 0.9929608583450318, | |
| "num_tokens": 18758891.0, | |
| "step": 5250 | |
| }, | |
| { | |
| "entropy": 2.2722030729055405, | |
| "epoch": 4.058675931287397, | |
| "grad_norm": 1.0893008708953857, | |
| "learning_rate": 1.8053747829713618e-06, | |
| "loss": 0.0026631668210029603, | |
| "mean_token_accuracy": 0.998863635957241, | |
| "num_tokens": 18791486.0, | |
| "step": 5260 | |
| }, | |
| { | |
| "entropy": 2.2243568778038023, | |
| "epoch": 4.066396448562053, | |
| "grad_norm": 0.028796734288334846, | |
| "learning_rate": 1.7768289112219883e-06, | |
| "loss": 0.005374731123447418, | |
| "mean_token_accuracy": 0.9990384608507157, | |
| "num_tokens": 18825388.0, | |
| "step": 5270 | |
| }, | |
| { | |
| "entropy": 2.172247883677483, | |
| "epoch": 4.074116965836711, | |
| "grad_norm": 0.03655334934592247, | |
| "learning_rate": 1.7484884996237472e-06, | |
| "loss": 0.0015311230905354022, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 18863479.0, | |
| "step": 5280 | |
| }, | |
| { | |
| "entropy": 2.1923954993486405, | |
| "epoch": 4.081837483111369, | |
| "grad_norm": 0.11251391470432281, | |
| "learning_rate": 1.7203542562763699e-06, | |
| "loss": 0.0013637151569128036, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 18899886.0, | |
| "step": 5290 | |
| }, | |
| { | |
| "entropy": 2.1101179629564286, | |
| "epoch": 4.089558000386026, | |
| "grad_norm": 0.019721994176506996, | |
| "learning_rate": 1.6924268841283731e-06, | |
| "loss": 0.005000091716647148, | |
| "mean_token_accuracy": 0.9991935476660728, | |
| "num_tokens": 18943812.0, | |
| "step": 5300 | |
| }, | |
| { | |
| "entropy": 2.2096335530281066, | |
| "epoch": 4.097278517660683, | |
| "grad_norm": 0.3568638563156128, | |
| "learning_rate": 1.6647070809594846e-06, | |
| "loss": 0.010236522555351258, | |
| "mean_token_accuracy": 0.99627845287323, | |
| "num_tokens": 18976301.0, | |
| "step": 5310 | |
| }, | |
| { | |
| "entropy": 2.2267425060272217, | |
| "epoch": 4.10499903493534, | |
| "grad_norm": 0.1415398120880127, | |
| "learning_rate": 1.6371955393632177e-06, | |
| "loss": 0.012716498970985413, | |
| "mean_token_accuracy": 0.997547847032547, | |
| "num_tokens": 19015300.0, | |
| "step": 5320 | |
| }, | |
| { | |
| "entropy": 2.2259861052036287, | |
| "epoch": 4.112719552209998, | |
| "grad_norm": 0.0552356131374836, | |
| "learning_rate": 1.60989294672956e-06, | |
| "loss": 0.00908339098095894, | |
| "mean_token_accuracy": 0.9977884605526924, | |
| "num_tokens": 19051745.0, | |
| "step": 5330 | |
| }, | |
| { | |
| "entropy": 2.2949888169765473, | |
| "epoch": 4.120440069484656, | |
| "grad_norm": 0.13113631308078766, | |
| "learning_rate": 1.5827999852278097e-06, | |
| "loss": 0.0018477724865078927, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 19083371.0, | |
| "step": 5340 | |
| }, | |
| { | |
| "entropy": 2.2030975073575974, | |
| "epoch": 4.1281605867593125, | |
| "grad_norm": 2.422152280807495, | |
| "learning_rate": 1.5559173317895148e-06, | |
| "loss": 0.005163485929369926, | |
| "mean_token_accuracy": 0.9991379305720329, | |
| "num_tokens": 19119667.0, | |
| "step": 5350 | |
| }, | |
| { | |
| "entropy": 2.203478366136551, | |
| "epoch": 4.13588110403397, | |
| "grad_norm": 0.4935871362686157, | |
| "learning_rate": 1.5292456580915703e-06, | |
| "loss": 0.0074889764189720156, | |
| "mean_token_accuracy": 0.9986068099737168, | |
| "num_tokens": 19158058.0, | |
| "step": 5360 | |
| }, | |
| { | |
| "entropy": 2.176115852594376, | |
| "epoch": 4.143601621308628, | |
| "grad_norm": 0.047461602836847305, | |
| "learning_rate": 1.5027856305394416e-06, | |
| "loss": 0.01174907609820366, | |
| "mean_token_accuracy": 0.9964136898517608, | |
| "num_tokens": 19191330.0, | |
| "step": 5370 | |
| }, | |
| { | |
| "entropy": 2.3252247244119646, | |
| "epoch": 4.151322138583285, | |
| "grad_norm": 0.07587450742721558, | |
| "learning_rate": 1.4765379102504973e-06, | |
| "loss": 0.004352330043911934, | |
| "mean_token_accuracy": 0.9991935476660728, | |
| "num_tokens": 19223065.0, | |
| "step": 5380 | |
| }, | |
| { | |
| "entropy": 2.2030561834573748, | |
| "epoch": 4.1590426558579425, | |
| "grad_norm": 0.0413011871278286, | |
| "learning_rate": 1.4505031530375024e-06, | |
| "loss": 0.0010141530074179173, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 19258355.0, | |
| "step": 5390 | |
| }, | |
| { | |
| "entropy": 2.172553300857544, | |
| "epoch": 4.1667631731326, | |
| "grad_norm": 0.016729436814785004, | |
| "learning_rate": 1.424682009392232e-06, | |
| "loss": 0.008941520750522614, | |
| "mean_token_accuracy": 0.997578963637352, | |
| "num_tokens": 19293261.0, | |
| "step": 5400 | |
| }, | |
| { | |
| "entropy": 2.225874611735344, | |
| "epoch": 4.174483690407257, | |
| "grad_norm": 0.11103388667106628, | |
| "learning_rate": 1.399075124469217e-06, | |
| "loss": 0.004546413570642472, | |
| "mean_token_accuracy": 0.99921875, | |
| "num_tokens": 19327624.0, | |
| "step": 5410 | |
| }, | |
| { | |
| "entropy": 2.167690780758858, | |
| "epoch": 4.182204207681915, | |
| "grad_norm": 2.885631799697876, | |
| "learning_rate": 1.3736831380696224e-06, | |
| "loss": 0.01201588660478592, | |
| "mean_token_accuracy": 0.9971944436430931, | |
| "num_tokens": 19362087.0, | |
| "step": 5420 | |
| }, | |
| { | |
| "entropy": 2.269624611735344, | |
| "epoch": 4.1899247249565725, | |
| "grad_norm": 0.44468164443969727, | |
| "learning_rate": 1.3485066846252615e-06, | |
| "loss": 0.009978090226650239, | |
| "mean_token_accuracy": 0.9983333334326744, | |
| "num_tokens": 19396605.0, | |
| "step": 5430 | |
| }, | |
| { | |
| "entropy": 2.2737204790115357, | |
| "epoch": 4.197645242231229, | |
| "grad_norm": 0.1409270316362381, | |
| "learning_rate": 1.323546393182752e-06, | |
| "loss": 0.008260860294103622, | |
| "mean_token_accuracy": 0.9979480162262917, | |
| "num_tokens": 19434246.0, | |
| "step": 5440 | |
| }, | |
| { | |
| "entropy": 2.2025551408529283, | |
| "epoch": 4.205365759505887, | |
| "grad_norm": 2.0743470191955566, | |
| "learning_rate": 1.2988028873877867e-06, | |
| "loss": 0.007827727496623993, | |
| "mean_token_accuracy": 0.9981812179088593, | |
| "num_tokens": 19472258.0, | |
| "step": 5450 | |
| }, | |
| { | |
| "entropy": 2.0870246827602386, | |
| "epoch": 4.213086276780544, | |
| "grad_norm": 0.0854920968413353, | |
| "learning_rate": 1.2742767854695603e-06, | |
| "loss": 0.001750888116657734, | |
| "mean_token_accuracy": 0.9986111104488373, | |
| "num_tokens": 19515091.0, | |
| "step": 5460 | |
| }, | |
| { | |
| "entropy": 2.2541315644979476, | |
| "epoch": 4.220806794055202, | |
| "grad_norm": 0.050843846052885056, | |
| "learning_rate": 1.2499687002253214e-06, | |
| "loss": 0.012310877442359924, | |
| "mean_token_accuracy": 0.9966666668653488, | |
| "num_tokens": 19550438.0, | |
| "step": 5470 | |
| }, | |
| { | |
| "entropy": 2.281228691339493, | |
| "epoch": 4.228527311329859, | |
| "grad_norm": 0.10463957488536835, | |
| "learning_rate": 1.2258792390050589e-06, | |
| "loss": 0.009670499712228775, | |
| "mean_token_accuracy": 0.9984359726309776, | |
| "num_tokens": 19587460.0, | |
| "step": 5480 | |
| }, | |
| { | |
| "entropy": 2.19995211660862, | |
| "epoch": 4.236247828604516, | |
| "grad_norm": 0.029270397499203682, | |
| "learning_rate": 1.2020090036963272e-06, | |
| "loss": 0.0012936697341501713, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 19622266.0, | |
| "step": 5490 | |
| }, | |
| { | |
| "entropy": 2.2033345282077788, | |
| "epoch": 4.243968345879174, | |
| "grad_norm": 0.2233721911907196, | |
| "learning_rate": 1.1783585907092077e-06, | |
| "loss": 0.011895059794187545, | |
| "mean_token_accuracy": 0.9973854154348374, | |
| "num_tokens": 19661206.0, | |
| "step": 5500 | |
| }, | |
| { | |
| "epoch": 4.243968345879174, | |
| "eval_entropy": 2.1031606457699303, | |
| "eval_loss": 0.5105812549591064, | |
| "eval_mean_token_accuracy": 0.93590848367416, | |
| "eval_num_tokens": 19661206.0, | |
| "eval_runtime": 987.4206, | |
| "eval_samples_per_second": 7.748, | |
| "eval_steps_per_second": 0.969, | |
| "step": 5500 | |
| }, | |
| { | |
| "entropy": 2.166568320989609, | |
| "epoch": 4.251688863153832, | |
| "grad_norm": 0.06564086675643921, | |
| "learning_rate": 1.1549285909614138e-06, | |
| "loss": 0.0009026847779750824, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 19698305.0, | |
| "step": 5510 | |
| }, | |
| { | |
| "entropy": 2.2002768576145173, | |
| "epoch": 4.2594093804284885, | |
| "grad_norm": 0.12140869349241257, | |
| "learning_rate": 1.131719589863516e-06, | |
| "loss": 0.0019102182239294052, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 19734728.0, | |
| "step": 5520 | |
| }, | |
| { | |
| "entropy": 2.2461003422737122, | |
| "epoch": 4.267129897703146, | |
| "grad_norm": 0.06065747141838074, | |
| "learning_rate": 1.1087321673043184e-06, | |
| "loss": 0.010919121652841568, | |
| "mean_token_accuracy": 0.9966435179114341, | |
| "num_tokens": 19766601.0, | |
| "step": 5530 | |
| }, | |
| { | |
| "entropy": 2.21742702126503, | |
| "epoch": 4.274850414977804, | |
| "grad_norm": 0.31923985481262207, | |
| "learning_rate": 1.0859668976363802e-06, | |
| "loss": 0.004073232784867287, | |
| "mean_token_accuracy": 0.9993055552244187, | |
| "num_tokens": 19799159.0, | |
| "step": 5540 | |
| }, | |
| { | |
| "entropy": 2.195229309797287, | |
| "epoch": 4.282570932252461, | |
| "grad_norm": 0.03684071823954582, | |
| "learning_rate": 1.063424349661647e-06, | |
| "loss": 0.0008944393135607243, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 19833600.0, | |
| "step": 5550 | |
| }, | |
| { | |
| "entropy": 2.204106843471527, | |
| "epoch": 4.2902914495271185, | |
| "grad_norm": 0.054600995033979416, | |
| "learning_rate": 1.0411050866172512e-06, | |
| "loss": 0.013252517580986023, | |
| "mean_token_accuracy": 0.9959087640047073, | |
| "num_tokens": 19878221.0, | |
| "step": 5560 | |
| }, | |
| { | |
| "entropy": 2.2110326796770097, | |
| "epoch": 4.298011966801775, | |
| "grad_norm": 1.9496335983276367, | |
| "learning_rate": 1.0190096661614424e-06, | |
| "loss": 0.019130887091159822, | |
| "mean_token_accuracy": 0.9931336134672165, | |
| "num_tokens": 19907682.0, | |
| "step": 5570 | |
| }, | |
| { | |
| "entropy": 2.2047807425260544, | |
| "epoch": 4.305732484076433, | |
| "grad_norm": 0.13513988256454468, | |
| "learning_rate": 9.971386403596417e-07, | |
| "loss": 0.008160575479269027, | |
| "mean_token_accuracy": 0.9981125354766845, | |
| "num_tokens": 19942095.0, | |
| "step": 5580 | |
| }, | |
| { | |
| "entropy": 2.188329595327377, | |
| "epoch": 4.313453001351091, | |
| "grad_norm": 1.0191106796264648, | |
| "learning_rate": 9.75492555670655e-07, | |
| "loss": 0.0053262699395418165, | |
| "mean_token_accuracy": 0.9979999989271164, | |
| "num_tokens": 19984249.0, | |
| "step": 5590 | |
| }, | |
| { | |
| "entropy": 2.2830605089664457, | |
| "epoch": 4.321173518625748, | |
| "grad_norm": 0.13544659316539764, | |
| "learning_rate": 9.540719529330212e-07, | |
| "loss": 0.007930701971054077, | |
| "mean_token_accuracy": 0.9986089944839478, | |
| "num_tokens": 20016851.0, | |
| "step": 5600 | |
| }, | |
| { | |
| "entropy": 2.222521474957466, | |
| "epoch": 4.328894035900405, | |
| "grad_norm": 0.042033832520246506, | |
| "learning_rate": 9.328773673514979e-07, | |
| "loss": 0.009003970026969909, | |
| "mean_token_accuracy": 0.9984122976660729, | |
| "num_tokens": 20049220.0, | |
| "step": 5610 | |
| }, | |
| { | |
| "entropy": 2.2348962247371675, | |
| "epoch": 4.336614553175063, | |
| "grad_norm": 0.030303576961159706, | |
| "learning_rate": 9.119093284836855e-07, | |
| "loss": 0.008937902003526687, | |
| "mean_token_accuracy": 0.9973191484808922, | |
| "num_tokens": 20082476.0, | |
| "step": 5620 | |
| }, | |
| { | |
| "entropy": 2.1816387206315992, | |
| "epoch": 4.34433507044972, | |
| "grad_norm": 0.06456495821475983, | |
| "learning_rate": 8.911683602267973e-07, | |
| "loss": 0.012813526391983032, | |
| "mean_token_accuracy": 0.9954789370298386, | |
| "num_tokens": 20120303.0, | |
| "step": 5630 | |
| }, | |
| { | |
| "entropy": 2.1896758466959, | |
| "epoch": 4.352055587724378, | |
| "grad_norm": 0.10599888116121292, | |
| "learning_rate": 8.706549808045761e-07, | |
| "loss": 0.02139887660741806, | |
| "mean_token_accuracy": 0.9958462625741958, | |
| "num_tokens": 20156756.0, | |
| "step": 5640 | |
| }, | |
| { | |
| "entropy": 2.2255977392196655, | |
| "epoch": 4.359776104999035, | |
| "grad_norm": 0.27150967717170715, | |
| "learning_rate": 8.503697027543368e-07, | |
| "loss": 0.004352736845612526, | |
| "mean_token_accuracy": 0.9980769231915474, | |
| "num_tokens": 20192296.0, | |
| "step": 5650 | |
| }, | |
| { | |
| "entropy": 2.22255657017231, | |
| "epoch": 4.367496622273692, | |
| "grad_norm": 0.11026787757873535, | |
| "learning_rate": 8.303130329141629e-07, | |
| "loss": 0.0016281832009553908, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 20226479.0, | |
| "step": 5660 | |
| }, | |
| { | |
| "entropy": 2.246255025267601, | |
| "epoch": 4.37521713954835, | |
| "grad_norm": 0.46250292658805847, | |
| "learning_rate": 8.104854724102495e-07, | |
| "loss": 0.011007238179445267, | |
| "mean_token_accuracy": 0.9953571423888207, | |
| "num_tokens": 20270096.0, | |
| "step": 5670 | |
| }, | |
| { | |
| "entropy": 2.1503868639469146, | |
| "epoch": 4.382937656823007, | |
| "grad_norm": 0.04919159784913063, | |
| "learning_rate": 7.908875166443741e-07, | |
| "loss": 0.004710817709565163, | |
| "mean_token_accuracy": 0.9985272988677025, | |
| "num_tokens": 20305299.0, | |
| "step": 5680 | |
| }, | |
| { | |
| "entropy": 2.2465969413518905, | |
| "epoch": 4.3906581740976645, | |
| "grad_norm": 0.17782022058963776, | |
| "learning_rate": 7.715196552815219e-07, | |
| "loss": 0.003526587411761284, | |
| "mean_token_accuracy": 0.9982142850756646, | |
| "num_tokens": 20342660.0, | |
| "step": 5690 | |
| }, | |
| { | |
| "entropy": 2.197134277224541, | |
| "epoch": 4.398378691372322, | |
| "grad_norm": 0.2121172547340393, | |
| "learning_rate": 7.5238237223765e-07, | |
| "loss": 0.004980428516864777, | |
| "mean_token_accuracy": 0.9987499997019768, | |
| "num_tokens": 20375889.0, | |
| "step": 5700 | |
| }, | |
| { | |
| "entropy": 2.220217686891556, | |
| "epoch": 4.406099208646979, | |
| "grad_norm": 0.34957343339920044, | |
| "learning_rate": 7.334761456676021e-07, | |
| "loss": 0.004869958385825157, | |
| "mean_token_accuracy": 0.9981249988079071, | |
| "num_tokens": 20410586.0, | |
| "step": 5710 | |
| }, | |
| { | |
| "entropy": 2.244478589296341, | |
| "epoch": 4.413819725921637, | |
| "grad_norm": 0.10005008429288864, | |
| "learning_rate": 7.148014479531551e-07, | |
| "loss": 0.003159433975815773, | |
| "mean_token_accuracy": 0.998863635957241, | |
| "num_tokens": 20445560.0, | |
| "step": 5720 | |
| }, | |
| { | |
| "entropy": 2.2202999114990236, | |
| "epoch": 4.4215402431962945, | |
| "grad_norm": 0.05696292221546173, | |
| "learning_rate": 6.963587456912157e-07, | |
| "loss": 0.003368407115340233, | |
| "mean_token_accuracy": 0.99921875, | |
| "num_tokens": 20479977.0, | |
| "step": 5730 | |
| }, | |
| { | |
| "entropy": 2.2504466265439986, | |
| "epoch": 4.429260760470951, | |
| "grad_norm": 0.15865400433540344, | |
| "learning_rate": 6.781484996821697e-07, | |
| "loss": 0.003355879709124565, | |
| "mean_token_accuracy": 0.9971590921282768, | |
| "num_tokens": 20515597.0, | |
| "step": 5740 | |
| }, | |
| { | |
| "entropy": 2.2659272760152818, | |
| "epoch": 4.436981277745609, | |
| "grad_norm": 0.07037786394357681, | |
| "learning_rate": 6.601711649183628e-07, | |
| "loss": 0.0016187068074941635, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 20552502.0, | |
| "step": 5750 | |
| }, | |
| { | |
| "entropy": 2.3120163559913633, | |
| "epoch": 4.444701795020267, | |
| "grad_norm": 0.19772270321846008, | |
| "learning_rate": 6.42427190572732e-07, | |
| "loss": 0.0062440957874059675, | |
| "mean_token_accuracy": 0.9991666659712791, | |
| "num_tokens": 20586728.0, | |
| "step": 5760 | |
| }, | |
| { | |
| "entropy": 2.258056941628456, | |
| "epoch": 4.452422312294924, | |
| "grad_norm": 0.2031521052122116, | |
| "learning_rate": 6.249170199875832e-07, | |
| "loss": 0.006161601468920708, | |
| "mean_token_accuracy": 0.9992647051811219, | |
| "num_tokens": 20620711.0, | |
| "step": 5770 | |
| }, | |
| { | |
| "entropy": 2.259738165140152, | |
| "epoch": 4.460142829569581, | |
| "grad_norm": 0.02412845566868782, | |
| "learning_rate": 6.07641090663521e-07, | |
| "loss": 0.0021015578880906106, | |
| "mean_token_accuracy": 0.9991071432828903, | |
| "num_tokens": 20651230.0, | |
| "step": 5780 | |
| }, | |
| { | |
| "entropy": 2.247869810461998, | |
| "epoch": 4.467863346844238, | |
| "grad_norm": 0.11743807792663574, | |
| "learning_rate": 5.905998342485086e-07, | |
| "loss": 0.008077496290206909, | |
| "mean_token_accuracy": 0.998356680572033, | |
| "num_tokens": 20683130.0, | |
| "step": 5790 | |
| }, | |
| { | |
| "entropy": 2.249860090017319, | |
| "epoch": 4.475583864118896, | |
| "grad_norm": 4.197149276733398, | |
| "learning_rate": 5.737936765270813e-07, | |
| "loss": 0.011671672016382218, | |
| "mean_token_accuracy": 0.9986111104488373, | |
| "num_tokens": 20722216.0, | |
| "step": 5800 | |
| }, | |
| { | |
| "entropy": 2.2498649269342423, | |
| "epoch": 4.483304381393554, | |
| "grad_norm": 0.130318745970726, | |
| "learning_rate": 5.572230374097231e-07, | |
| "loss": 0.004165193811058998, | |
| "mean_token_accuracy": 0.9988095238804817, | |
| "num_tokens": 20758556.0, | |
| "step": 5810 | |
| }, | |
| { | |
| "entropy": 2.172873851656914, | |
| "epoch": 4.49102489866821, | |
| "grad_norm": 0.1512354016304016, | |
| "learning_rate": 5.408883309223556e-07, | |
| "loss": 0.010192253440618516, | |
| "mean_token_accuracy": 0.997826087474823, | |
| "num_tokens": 20797172.0, | |
| "step": 5820 | |
| }, | |
| { | |
| "entropy": 2.2314586699008943, | |
| "epoch": 4.498745415942868, | |
| "grad_norm": 0.23559877276420593, | |
| "learning_rate": 5.247899651960064e-07, | |
| "loss": 0.009908857196569443, | |
| "mean_token_accuracy": 0.9950735285878182, | |
| "num_tokens": 20832728.0, | |
| "step": 5830 | |
| }, | |
| { | |
| "entropy": 2.219519907236099, | |
| "epoch": 4.506465933217526, | |
| "grad_norm": 0.054366808384656906, | |
| "learning_rate": 5.089283424566094e-07, | |
| "loss": 0.016809307038784027, | |
| "mean_token_accuracy": 0.9969444438815117, | |
| "num_tokens": 20868737.0, | |
| "step": 5840 | |
| }, | |
| { | |
| "entropy": 2.258474165201187, | |
| "epoch": 4.514186450492183, | |
| "grad_norm": 0.20110376179218292, | |
| "learning_rate": 4.933038590149508e-07, | |
| "loss": 0.0023351117968559267, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 20904237.0, | |
| "step": 5850 | |
| }, | |
| { | |
| "entropy": 2.2490910053253175, | |
| "epoch": 4.52190696776684, | |
| "grad_norm": 0.06749659776687622, | |
| "learning_rate": 4.77916905256769e-07, | |
| "loss": 0.0015241201967000962, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 20938015.0, | |
| "step": 5860 | |
| }, | |
| { | |
| "entropy": 2.2541816264390944, | |
| "epoch": 4.529627485041498, | |
| "grad_norm": 0.07041777670383453, | |
| "learning_rate": 4.627678656330026e-07, | |
| "loss": 0.003881530836224556, | |
| "mean_token_accuracy": 0.9989999994635582, | |
| "num_tokens": 20971752.0, | |
| "step": 5870 | |
| }, | |
| { | |
| "entropy": 2.225889188051224, | |
| "epoch": 4.537348002316155, | |
| "grad_norm": 0.04327480122447014, | |
| "learning_rate": 4.478571186501857e-07, | |
| "loss": 0.013946136832237244, | |
| "mean_token_accuracy": 0.9973797842860221, | |
| "num_tokens": 21005854.0, | |
| "step": 5880 | |
| }, | |
| { | |
| "entropy": 2.2675861060619353, | |
| "epoch": 4.545068519590813, | |
| "grad_norm": 1.7059868574142456, | |
| "learning_rate": 4.3318503686098577e-07, | |
| "loss": 0.0015708981081843376, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 21041256.0, | |
| "step": 5890 | |
| }, | |
| { | |
| "entropy": 2.2442140936851502, | |
| "epoch": 4.5527890368654695, | |
| "grad_norm": 0.06668271869421005, | |
| "learning_rate": 4.1875198685489613e-07, | |
| "loss": 0.0081165112555027, | |
| "mean_token_accuracy": 0.9988095238804817, | |
| "num_tokens": 21073826.0, | |
| "step": 5900 | |
| }, | |
| { | |
| "entropy": 2.238309305906296, | |
| "epoch": 4.560509554140127, | |
| "grad_norm": 0.022307725623250008, | |
| "learning_rate": 4.04558329249084e-07, | |
| "loss": 0.006697001308202744, | |
| "mean_token_accuracy": 0.998863635957241, | |
| "num_tokens": 21110342.0, | |
| "step": 5910 | |
| }, | |
| { | |
| "entropy": 2.200860995054245, | |
| "epoch": 4.568230071414785, | |
| "grad_norm": 0.17545939981937408, | |
| "learning_rate": 3.906044186793689e-07, | |
| "loss": 0.004396386817097664, | |
| "mean_token_accuracy": 0.9992647051811219, | |
| "num_tokens": 21147596.0, | |
| "step": 5920 | |
| }, | |
| { | |
| "entropy": 2.24030060172081, | |
| "epoch": 4.575950588689442, | |
| "grad_norm": 0.06349517405033112, | |
| "learning_rate": 3.768906037913689e-07, | |
| "loss": 0.010619433969259262, | |
| "mean_token_accuracy": 0.9960175439715385, | |
| "num_tokens": 21181840.0, | |
| "step": 5930 | |
| }, | |
| { | |
| "entropy": 2.1731992214918137, | |
| "epoch": 4.5836711059640995, | |
| "grad_norm": 0.07084771990776062, | |
| "learning_rate": 3.6341722723179264e-07, | |
| "loss": 0.007943939417600632, | |
| "mean_token_accuracy": 0.9991379305720329, | |
| "num_tokens": 21215224.0, | |
| "step": 5940 | |
| }, | |
| { | |
| "entropy": 2.2863466501235963, | |
| "epoch": 4.591391623238757, | |
| "grad_norm": 0.044842347502708435, | |
| "learning_rate": 3.501846256398689e-07, | |
| "loss": 0.013139717280864716, | |
| "mean_token_accuracy": 0.9968560606241226, | |
| "num_tokens": 21248186.0, | |
| "step": 5950 | |
| }, | |
| { | |
| "entropy": 2.208678925037384, | |
| "epoch": 4.599112140513414, | |
| "grad_norm": 0.14837071299552917, | |
| "learning_rate": 3.371931296389397e-07, | |
| "loss": 0.0007539391051977872, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 21282267.0, | |
| "step": 5960 | |
| }, | |
| { | |
| "entropy": 2.2153519988059998, | |
| "epoch": 4.606832657788072, | |
| "grad_norm": 2.5055654048919678, | |
| "learning_rate": 3.2444306382820256e-07, | |
| "loss": 0.03023122251033783, | |
| "mean_token_accuracy": 0.9947824060916901, | |
| "num_tokens": 21315323.0, | |
| "step": 5970 | |
| }, | |
| { | |
| "entropy": 2.2592311084270476, | |
| "epoch": 4.6145531750627296, | |
| "grad_norm": 0.1265610009431839, | |
| "learning_rate": 3.119347467745992e-07, | |
| "loss": 0.001410143543034792, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 21353041.0, | |
| "step": 5980 | |
| }, | |
| { | |
| "entropy": 2.2527008682489393, | |
| "epoch": 4.622273692337386, | |
| "grad_norm": 0.589449405670166, | |
| "learning_rate": 2.99668491004852e-07, | |
| "loss": 0.005680891871452332, | |
| "mean_token_accuracy": 0.9983333334326744, | |
| "num_tokens": 21386776.0, | |
| "step": 5990 | |
| }, | |
| { | |
| "entropy": 2.2103109836578367, | |
| "epoch": 4.629994209612044, | |
| "grad_norm": 1.9735628366470337, | |
| "learning_rate": 2.876446029976554e-07, | |
| "loss": 0.005637718737125397, | |
| "mean_token_accuracy": 0.9986278191208839, | |
| "num_tokens": 21422729.0, | |
| "step": 6000 | |
| }, | |
| { | |
| "epoch": 4.629994209612044, | |
| "eval_entropy": 2.1154677377100897, | |
| "eval_loss": 0.5169965028762817, | |
| "eval_mean_token_accuracy": 0.9358510735640332, | |
| "eval_num_tokens": 21422729.0, | |
| "eval_runtime": 988.4165, | |
| "eval_samples_per_second": 7.741, | |
| "eval_steps_per_second": 0.968, | |
| "step": 6000 | |
| }, | |
| { | |
| "entropy": 2.227972522377968, | |
| "epoch": 4.637714726886701, | |
| "grad_norm": 1.7792558670043945, | |
| "learning_rate": 2.7586338317602713e-07, | |
| "loss": 0.006323382258415222, | |
| "mean_token_accuracy": 0.99921875, | |
| "num_tokens": 21457481.0, | |
| "step": 6010 | |
| }, | |
| { | |
| "entropy": 2.286092558503151, | |
| "epoch": 4.645435244161359, | |
| "grad_norm": 0.7590512037277222, | |
| "learning_rate": 2.6432512589979144e-07, | |
| "loss": 0.006863045692443848, | |
| "mean_token_accuracy": 0.998242424428463, | |
| "num_tokens": 21491657.0, | |
| "step": 6020 | |
| }, | |
| { | |
| "entropy": 2.1695028364658357, | |
| "epoch": 4.653155761436016, | |
| "grad_norm": 3.8523592948913574, | |
| "learning_rate": 2.530301194582296e-07, | |
| "loss": 0.005904960632324219, | |
| "mean_token_accuracy": 0.9977777764201164, | |
| "num_tokens": 21531112.0, | |
| "step": 6030 | |
| }, | |
| { | |
| "entropy": 2.2056106328964233, | |
| "epoch": 4.660876278710674, | |
| "grad_norm": 0.10862927883863449, | |
| "learning_rate": 2.41978646062877e-07, | |
| "loss": 0.0022114580497145653, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 21567253.0, | |
| "step": 6040 | |
| }, | |
| { | |
| "entropy": 2.2164981573820115, | |
| "epoch": 4.668596795985331, | |
| "grad_norm": 0.3193495273590088, | |
| "learning_rate": 2.3117098184046837e-07, | |
| "loss": 0.007381512224674225, | |
| "mean_token_accuracy": 0.9967272713780403, | |
| "num_tokens": 21608628.0, | |
| "step": 6050 | |
| }, | |
| { | |
| "entropy": 2.1946250647306442, | |
| "epoch": 4.676317313259989, | |
| "grad_norm": 0.02586934342980385, | |
| "learning_rate": 2.206073968260436e-07, | |
| "loss": 0.006831285357475281, | |
| "mean_token_accuracy": 0.9986111104488373, | |
| "num_tokens": 21644056.0, | |
| "step": 6060 | |
| }, | |
| { | |
| "entropy": 2.2137088149785997, | |
| "epoch": 4.6840378305346455, | |
| "grad_norm": 0.05132552608847618, | |
| "learning_rate": 2.1028815495619526e-07, | |
| "loss": 0.0044960763305425646, | |
| "mean_token_accuracy": 0.999074074625969, | |
| "num_tokens": 21681633.0, | |
| "step": 6070 | |
| }, | |
| { | |
| "entropy": 2.2435118734836577, | |
| "epoch": 4.691758347809303, | |
| "grad_norm": 0.0880841463804245, | |
| "learning_rate": 2.002135140624828e-07, | |
| "loss": 0.010966504365205765, | |
| "mean_token_accuracy": 0.9978095233440399, | |
| "num_tokens": 21720250.0, | |
| "step": 6080 | |
| }, | |
| { | |
| "entropy": 2.2539133608341215, | |
| "epoch": 4.699478865083961, | |
| "grad_norm": 0.03336416557431221, | |
| "learning_rate": 1.9038372586497766e-07, | |
| "loss": 0.0027033800259232523, | |
| "mean_token_accuracy": 0.9980000004172325, | |
| "num_tokens": 21756172.0, | |
| "step": 6090 | |
| }, | |
| { | |
| "entropy": 2.171377721428871, | |
| "epoch": 4.707199382358618, | |
| "grad_norm": 0.02603979967534542, | |
| "learning_rate": 1.8079903596598504e-07, | |
| "loss": 0.015214832127094268, | |
| "mean_token_accuracy": 0.9969905868172646, | |
| "num_tokens": 21797144.0, | |
| "step": 6100 | |
| }, | |
| { | |
| "entropy": 2.2282418727874758, | |
| "epoch": 4.7149198996332755, | |
| "grad_norm": 0.02482684515416622, | |
| "learning_rate": 1.714596838439031e-07, | |
| "loss": 0.0006937965285032987, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 21833771.0, | |
| "step": 6110 | |
| }, | |
| { | |
| "entropy": 2.271139058470726, | |
| "epoch": 4.722640416907932, | |
| "grad_norm": 0.041452571749687195, | |
| "learning_rate": 1.6236590284723796e-07, | |
| "loss": 0.0011482076719403268, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 21866597.0, | |
| "step": 6120 | |
| }, | |
| { | |
| "entropy": 2.179414650797844, | |
| "epoch": 4.73036093418259, | |
| "grad_norm": 0.09968980401754379, | |
| "learning_rate": 1.535179201887782e-07, | |
| "loss": 0.008539145439863205, | |
| "mean_token_accuracy": 0.9981481477618217, | |
| "num_tokens": 21901353.0, | |
| "step": 6130 | |
| }, | |
| { | |
| "entropy": 2.2338360488414764, | |
| "epoch": 4.738081451457248, | |
| "grad_norm": 3.942858934402466, | |
| "learning_rate": 1.4491595693991056e-07, | |
| "loss": 0.008534059673547745, | |
| "mean_token_accuracy": 0.9989583328366279, | |
| "num_tokens": 21936884.0, | |
| "step": 6140 | |
| }, | |
| { | |
| "entropy": 2.24261232316494, | |
| "epoch": 4.7458019687319055, | |
| "grad_norm": 0.16906267404556274, | |
| "learning_rate": 1.3656022802510326e-07, | |
| "loss": 0.018931737542152403, | |
| "mean_token_accuracy": 0.9983006909489631, | |
| "num_tokens": 21971041.0, | |
| "step": 6150 | |
| }, | |
| { | |
| "entropy": 2.305382552742958, | |
| "epoch": 4.753522486006562, | |
| "grad_norm": 0.04022558033466339, | |
| "learning_rate": 1.2845094221653475e-07, | |
| "loss": 0.006191138923168182, | |
| "mean_token_accuracy": 0.9983004376292228, | |
| "num_tokens": 22001583.0, | |
| "step": 6160 | |
| }, | |
| { | |
| "entropy": 2.304952707886696, | |
| "epoch": 4.76124300328122, | |
| "grad_norm": 0.0716034322977066, | |
| "learning_rate": 1.2058830212887117e-07, | |
| "loss": 0.014426815509796142, | |
| "mean_token_accuracy": 0.9962768808007241, | |
| "num_tokens": 22036327.0, | |
| "step": 6170 | |
| }, | |
| { | |
| "entropy": 2.2286325991153717, | |
| "epoch": 4.768963520555877, | |
| "grad_norm": 0.08237482607364655, | |
| "learning_rate": 1.129725042142138e-07, | |
| "loss": 0.006697164475917816, | |
| "mean_token_accuracy": 0.9982928246259689, | |
| "num_tokens": 22071393.0, | |
| "step": 6180 | |
| }, | |
| { | |
| "entropy": 2.2289715498685836, | |
| "epoch": 4.776684037830535, | |
| "grad_norm": 0.09096929430961609, | |
| "learning_rate": 1.0560373875718177e-07, | |
| "loss": 0.0037596296519041062, | |
| "mean_token_accuracy": 0.9989999994635582, | |
| "num_tokens": 22105599.0, | |
| "step": 6190 | |
| }, | |
| { | |
| "entropy": 2.226081871986389, | |
| "epoch": 4.784404555105192, | |
| "grad_norm": 1.364410400390625, | |
| "learning_rate": 9.848218987016267e-08, | |
| "loss": 0.004093809798359871, | |
| "mean_token_accuracy": 0.9989999994635582, | |
| "num_tokens": 22144292.0, | |
| "step": 6200 | |
| }, | |
| { | |
| "entropy": 2.3211822539567946, | |
| "epoch": 4.792125072379849, | |
| "grad_norm": 0.08333883434534073, | |
| "learning_rate": 9.160803548871277e-08, | |
| "loss": 0.0013872952200472354, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 22173297.0, | |
| "step": 6210 | |
| }, | |
| { | |
| "entropy": 2.181807669997215, | |
| "epoch": 4.799845589654507, | |
| "grad_norm": 0.08239463716745377, | |
| "learning_rate": 8.498144736710734e-08, | |
| "loss": 0.024519316852092743, | |
| "mean_token_accuracy": 0.99544607847929, | |
| "num_tokens": 22213011.0, | |
| "step": 6220 | |
| }, | |
| { | |
| "entropy": 2.1619095504283905, | |
| "epoch": 4.807566106929165, | |
| "grad_norm": 0.39841601252555847, | |
| "learning_rate": 7.860259107405288e-08, | |
| "loss": 0.0010081185027956963, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 22247236.0, | |
| "step": 6230 | |
| }, | |
| { | |
| "entropy": 2.2368269830942156, | |
| "epoch": 4.8152866242038215, | |
| "grad_norm": 0.07764973491430283, | |
| "learning_rate": 7.24716259885483e-08, | |
| "loss": 0.026798546314239502, | |
| "mean_token_accuracy": 0.9924574360251427, | |
| "num_tokens": 22288494.0, | |
| "step": 6240 | |
| }, | |
| { | |
| "entropy": 2.245153045654297, | |
| "epoch": 4.823007141478479, | |
| "grad_norm": 0.26748162508010864, | |
| "learning_rate": 6.658870529590355e-08, | |
| "loss": 0.00493730865418911, | |
| "mean_token_accuracy": 0.999074074625969, | |
| "num_tokens": 22326075.0, | |
| "step": 6250 | |
| }, | |
| { | |
| "entropy": 2.219322806596756, | |
| "epoch": 4.830727658753137, | |
| "grad_norm": 0.04285896196961403, | |
| "learning_rate": 6.095397598391284e-08, | |
| "loss": 0.008515120297670365, | |
| "mean_token_accuracy": 0.9957702025771141, | |
| "num_tokens": 22368028.0, | |
| "step": 6260 | |
| }, | |
| { | |
| "entropy": 2.247615697979927, | |
| "epoch": 4.838448176027794, | |
| "grad_norm": 1.9107056856155396, | |
| "learning_rate": 5.556757883917851e-08, | |
| "loss": 0.0032505668699741364, | |
| "mean_token_accuracy": 0.9991379305720329, | |
| "num_tokens": 22406097.0, | |
| "step": 6270 | |
| }, | |
| { | |
| "entropy": 2.205378809571266, | |
| "epoch": 4.8461686933024515, | |
| "grad_norm": 2.558126211166382, | |
| "learning_rate": 5.0429648443601765e-08, | |
| "loss": 0.01382438838481903, | |
| "mean_token_accuracy": 0.9963152587413788, | |
| "num_tokens": 22447091.0, | |
| "step": 6280 | |
| }, | |
| { | |
| "entropy": 2.1460685402154924, | |
| "epoch": 4.853889210577108, | |
| "grad_norm": 0.6871592998504639, | |
| "learning_rate": 4.55403131710086e-08, | |
| "loss": 0.0034082386642694472, | |
| "mean_token_accuracy": 0.9983333334326744, | |
| "num_tokens": 22482163.0, | |
| "step": 6290 | |
| }, | |
| { | |
| "entropy": 2.1781392335891723, | |
| "epoch": 4.861609727851766, | |
| "grad_norm": 0.03307396173477173, | |
| "learning_rate": 4.089969518395243e-08, | |
| "loss": 0.0009966903366148473, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 22521045.0, | |
| "step": 6300 | |
| }, | |
| { | |
| "entropy": 2.276013654470444, | |
| "epoch": 4.869330245126424, | |
| "grad_norm": 0.35160934925079346, | |
| "learning_rate": 3.650791043065427e-08, | |
| "loss": 0.0020426543429493903, | |
| "mean_token_accuracy": 0.999074074625969, | |
| "num_tokens": 22554853.0, | |
| "step": 6310 | |
| }, | |
| { | |
| "entropy": 2.253162696957588, | |
| "epoch": 4.877050762401081, | |
| "grad_norm": 0.1488099992275238, | |
| "learning_rate": 3.236506864211286e-08, | |
| "loss": 0.007266855984926224, | |
| "mean_token_accuracy": 0.9969222694635391, | |
| "num_tokens": 22590884.0, | |
| "step": 6320 | |
| }, | |
| { | |
| "entropy": 2.27145434319973, | |
| "epoch": 4.884771279675738, | |
| "grad_norm": 3.7629544734954834, | |
| "learning_rate": 2.847127332935573e-08, | |
| "loss": 0.01586032509803772, | |
| "mean_token_accuracy": 0.995819628238678, | |
| "num_tokens": 22623671.0, | |
| "step": 6330 | |
| }, | |
| { | |
| "entropy": 2.236271634697914, | |
| "epoch": 4.892491796950396, | |
| "grad_norm": 0.6222274303436279, | |
| "learning_rate": 2.482662178085682e-08, | |
| "loss": 0.012338303774595261, | |
| "mean_token_accuracy": 0.9965226069092751, | |
| "num_tokens": 22658331.0, | |
| "step": 6340 | |
| }, | |
| { | |
| "entropy": 2.197663214802742, | |
| "epoch": 4.900212314225053, | |
| "grad_norm": 0.11816233396530151, | |
| "learning_rate": 2.143120506010843e-08, | |
| "loss": 0.008864825218915939, | |
| "mean_token_accuracy": 0.9983317211270333, | |
| "num_tokens": 22697599.0, | |
| "step": 6350 | |
| }, | |
| { | |
| "entropy": 2.2309891253709795, | |
| "epoch": 4.907932831499711, | |
| "grad_norm": 1.5716471672058105, | |
| "learning_rate": 1.8285108003338603e-08, | |
| "loss": 0.007599858939647675, | |
| "mean_token_accuracy": 0.9981518805027008, | |
| "num_tokens": 22730261.0, | |
| "step": 6360 | |
| }, | |
| { | |
| "entropy": 2.225965863466263, | |
| "epoch": 4.915653348774368, | |
| "grad_norm": 0.03380768746137619, | |
| "learning_rate": 1.538840921739837e-08, | |
| "loss": 0.0017374027520418167, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 22768240.0, | |
| "step": 6370 | |
| }, | |
| { | |
| "entropy": 2.2355996876955033, | |
| "epoch": 4.923373866049025, | |
| "grad_norm": 0.04010441154241562, | |
| "learning_rate": 1.2741181077793319e-08, | |
| "loss": 0.0016989083960652351, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 22803213.0, | |
| "step": 6380 | |
| }, | |
| { | |
| "entropy": 2.2543944001197813, | |
| "epoch": 4.931094383323683, | |
| "grad_norm": 0.22062981128692627, | |
| "learning_rate": 1.0343489726878375e-08, | |
| "loss": 0.008954495936632157, | |
| "mean_token_accuracy": 0.9964285716414452, | |
| "num_tokens": 22833895.0, | |
| "step": 6390 | |
| }, | |
| { | |
| "entropy": 2.2120563268661497, | |
| "epoch": 4.93881490059834, | |
| "grad_norm": 0.09145352989435196, | |
| "learning_rate": 8.195395072201352e-09, | |
| "loss": 0.0006910903844982386, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 22872270.0, | |
| "step": 6400 | |
| }, | |
| { | |
| "entropy": 2.263408675789833, | |
| "epoch": 4.946535417872997, | |
| "grad_norm": 0.17131362855434418, | |
| "learning_rate": 6.2969507850108025e-09, | |
| "loss": 0.007691174000501633, | |
| "mean_token_accuracy": 0.998504464328289, | |
| "num_tokens": 22906940.0, | |
| "step": 6410 | |
| }, | |
| { | |
| "entropy": 2.201318547129631, | |
| "epoch": 4.954255935147655, | |
| "grad_norm": 2.934361696243286, | |
| "learning_rate": 4.648204298912662e-09, | |
| "loss": 0.005105702206492424, | |
| "mean_token_accuracy": 0.9974216759204865, | |
| "num_tokens": 22943748.0, | |
| "step": 6420 | |
| }, | |
| { | |
| "entropy": 2.2332019776105883, | |
| "epoch": 4.961976452422312, | |
| "grad_norm": 0.023339014500379562, | |
| "learning_rate": 3.249196808683408e-09, | |
| "loss": 0.008095689117908478, | |
| "mean_token_accuracy": 0.9983243241906166, | |
| "num_tokens": 22977903.0, | |
| "step": 6430 | |
| }, | |
| { | |
| "entropy": 2.242179808020592, | |
| "epoch": 4.96969696969697, | |
| "grad_norm": 0.043394219130277634, | |
| "learning_rate": 2.0999632692431104e-09, | |
| "loss": 0.0013438466936349868, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 23011768.0, | |
| "step": 6440 | |
| }, | |
| { | |
| "entropy": 2.2419181168079376, | |
| "epoch": 4.9774174869716274, | |
| "grad_norm": 0.046509750187397, | |
| "learning_rate": 1.2005323947816839e-09, | |
| "loss": 0.008913324773311615, | |
| "mean_token_accuracy": 0.9981812179088593, | |
| "num_tokens": 23047974.0, | |
| "step": 6450 | |
| }, | |
| { | |
| "entropy": 2.259080970287323, | |
| "epoch": 4.985138004246284, | |
| "grad_norm": 2.01216197013855, | |
| "learning_rate": 5.509266580416839e-10, | |
| "loss": 0.0047379877418279644, | |
| "mean_token_accuracy": 0.9958045974373817, | |
| "num_tokens": 23081068.0, | |
| "step": 6460 | |
| }, | |
| { | |
| "entropy": 2.214487534761429, | |
| "epoch": 4.992858521520942, | |
| "grad_norm": 1.7724125385284424, | |
| "learning_rate": 1.5116228975653457e-10, | |
| "loss": 0.007440639287233352, | |
| "mean_token_accuracy": 0.9989130437374115, | |
| "num_tokens": 23120802.0, | |
| "step": 6470 | |
| }, | |
| { | |
| "entropy": 2.282172141848384, | |
| "epoch": 5.0, | |
| "grad_norm": 0.03656819462776184, | |
| "learning_rate": 1.2492782430761908e-12, | |
| "loss": 0.006634878367185593, | |
| "mean_token_accuracy": 0.9977477482847266, | |
| "num_tokens": 23154615.0, | |
| "step": 6480 | |
| }, | |
| { | |
| "epoch": 5.0, | |
| "eval_entropy": 2.1159368567830468, | |
| "eval_loss": 0.517891526222229, | |
| "eval_mean_token_accuracy": 0.9358265156407092, | |
| "eval_num_tokens": 23154615.0, | |
| "eval_runtime": 988.2948, | |
| "eval_samples_per_second": 7.742, | |
| "eval_steps_per_second": 0.968, | |
| "step": 6480 | |
| }, | |
| { | |
| "epoch": 5.0, | |
| "step": 6480, | |
| "total_flos": 1.3561958615698637e+18, | |
| "train_loss": 0.07709400485848927, | |
| "train_runtime": 23143.6512, | |
| "train_samples_per_second": 2.239, | |
| "train_steps_per_second": 0.28 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 6480, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 5, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.3561958615698637e+18, | |
| "train_batch_size": 2, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |