Instructions to use Jongbin-kr/llama-3.1-8b-instruct_lbox-legal-nomenclature-purist_ffn-only with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use Jongbin-kr/llama-3.1-8b-instruct_lbox-legal-nomenclature-purist_ffn-only with Transformers:
# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("Jongbin-kr/llama-3.1-8b-instruct_lbox-legal-nomenclature-purist_ffn-only", device_map="auto") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": 1500, | |
| "best_metric": 0.6151674389839172, | |
| "best_model_checkpoint": "/data6/jongbinwon/evolving_MoE/checkpoints/sft_llama31_8b_lbox_legal-nomenclature-purist_ffn_only_5ep_eval500/checkpoint-1500", | |
| "epoch": 5.0, | |
| "eval_steps": 500, | |
| "global_step": 4025, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 2.2218834400177, | |
| "epoch": 0.012422360248447204, | |
| "grad_norm": 5.412133693695068, | |
| "learning_rate": 1.4876033057851241e-06, | |
| "loss": 1.720897102355957, | |
| "mean_token_accuracy": 0.6472304485738277, | |
| "num_tokens": 45328.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 2.2021790027618406, | |
| "epoch": 0.024844720496894408, | |
| "grad_norm": 6.844479084014893, | |
| "learning_rate": 3.1404958677685953e-06, | |
| "loss": 2.003491973876953, | |
| "mean_token_accuracy": 0.613143677636981, | |
| "num_tokens": 90713.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 2.260706987977028, | |
| "epoch": 0.037267080745341616, | |
| "grad_norm": 8.312433242797852, | |
| "learning_rate": 4.793388429752067e-06, | |
| "loss": 1.9829626083374023, | |
| "mean_token_accuracy": 0.5876670200377703, | |
| "num_tokens": 133436.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 2.277198740839958, | |
| "epoch": 0.049689440993788817, | |
| "grad_norm": 4.128373622894287, | |
| "learning_rate": 6.446280991735537e-06, | |
| "loss": 1.683332633972168, | |
| "mean_token_accuracy": 0.6403063053265214, | |
| "num_tokens": 173768.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 2.275305709242821, | |
| "epoch": 0.062111801242236024, | |
| "grad_norm": 3.860987424850464, | |
| "learning_rate": 8.099173553719009e-06, | |
| "loss": 1.4613001823425293, | |
| "mean_token_accuracy": 0.6954401664435863, | |
| "num_tokens": 216454.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 2.226709768176079, | |
| "epoch": 0.07453416149068323, | |
| "grad_norm": 3.2089221477508545, | |
| "learning_rate": 9.75206611570248e-06, | |
| "loss": 1.0452740669250489, | |
| "mean_token_accuracy": 0.8045810982584953, | |
| "num_tokens": 261427.0, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 2.293886032700539, | |
| "epoch": 0.08695652173913043, | |
| "grad_norm": 6.784758567810059, | |
| "learning_rate": 1.1404958677685952e-05, | |
| "loss": 0.9967960357666016, | |
| "mean_token_accuracy": 0.7896769121289253, | |
| "num_tokens": 303808.0, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 2.306024971604347, | |
| "epoch": 0.09937888198757763, | |
| "grad_norm": 6.519183158874512, | |
| "learning_rate": 1.3057851239669424e-05, | |
| "loss": 0.8302921295166016, | |
| "mean_token_accuracy": 0.7989890590310097, | |
| "num_tokens": 350862.0, | |
| "step": 80 | |
| }, | |
| { | |
| "entropy": 2.2958358585834504, | |
| "epoch": 0.11180124223602485, | |
| "grad_norm": 3.592912197113037, | |
| "learning_rate": 1.4710743801652893e-05, | |
| "loss": 0.639973497390747, | |
| "mean_token_accuracy": 0.8467254146933556, | |
| "num_tokens": 395570.0, | |
| "step": 90 | |
| }, | |
| { | |
| "entropy": 2.326699784398079, | |
| "epoch": 0.12422360248447205, | |
| "grad_norm": 4.474846839904785, | |
| "learning_rate": 1.6363636363636366e-05, | |
| "loss": 0.6599883079528809, | |
| "mean_token_accuracy": 0.8683099627494812, | |
| "num_tokens": 433623.0, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 2.1977039337158204, | |
| "epoch": 0.13664596273291926, | |
| "grad_norm": 3.3706459999084473, | |
| "learning_rate": 1.8016528925619837e-05, | |
| "loss": 0.4734317779541016, | |
| "mean_token_accuracy": 0.8930498465895653, | |
| "num_tokens": 482905.0, | |
| "step": 110 | |
| }, | |
| { | |
| "entropy": 2.1412303030490873, | |
| "epoch": 0.14906832298136646, | |
| "grad_norm": 7.407418251037598, | |
| "learning_rate": 1.9669421487603307e-05, | |
| "loss": 0.49360313415527346, | |
| "mean_token_accuracy": 0.880374065041542, | |
| "num_tokens": 530860.0, | |
| "step": 120 | |
| }, | |
| { | |
| "entropy": 2.1529846519231794, | |
| "epoch": 0.16149068322981366, | |
| "grad_norm": 4.532316207885742, | |
| "learning_rate": 1.9999792781461744e-05, | |
| "loss": 0.3332545757293701, | |
| "mean_token_accuracy": 0.9231329143047333, | |
| "num_tokens": 573626.0, | |
| "step": 130 | |
| }, | |
| { | |
| "entropy": 2.164460891485214, | |
| "epoch": 0.17391304347826086, | |
| "grad_norm": 4.046708583831787, | |
| "learning_rate": 1.9998950970868584e-05, | |
| "loss": 0.353117036819458, | |
| "mean_token_accuracy": 0.9148650147020817, | |
| "num_tokens": 615581.0, | |
| "step": 140 | |
| }, | |
| { | |
| "entropy": 2.0522007673978804, | |
| "epoch": 0.18633540372670807, | |
| "grad_norm": 6.083385944366455, | |
| "learning_rate": 1.9997461671531945e-05, | |
| "loss": 0.29966306686401367, | |
| "mean_token_accuracy": 0.9333024516701698, | |
| "num_tokens": 667334.0, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 2.215573158860207, | |
| "epoch": 0.19875776397515527, | |
| "grad_norm": 5.368868827819824, | |
| "learning_rate": 1.9995324979892407e-05, | |
| "loss": 0.39634816646575927, | |
| "mean_token_accuracy": 0.8946829706430435, | |
| "num_tokens": 705094.0, | |
| "step": 160 | |
| }, | |
| { | |
| "entropy": 2.1504065871238707, | |
| "epoch": 0.2111801242236025, | |
| "grad_norm": 1.7437018156051636, | |
| "learning_rate": 1.9992541034312862e-05, | |
| "loss": 0.2833492517471313, | |
| "mean_token_accuracy": 0.9131577238440514, | |
| "num_tokens": 752206.0, | |
| "step": 170 | |
| }, | |
| { | |
| "entropy": 2.067841339111328, | |
| "epoch": 0.2236024844720497, | |
| "grad_norm": 7.387396812438965, | |
| "learning_rate": 1.9989110015069562e-05, | |
| "loss": 0.2200930118560791, | |
| "mean_token_accuracy": 0.9420874312520027, | |
| "num_tokens": 802186.0, | |
| "step": 180 | |
| }, | |
| { | |
| "entropy": 2.022136354446411, | |
| "epoch": 0.2360248447204969, | |
| "grad_norm": 5.731217861175537, | |
| "learning_rate": 1.9985032144340452e-05, | |
| "loss": 0.30328352451324464, | |
| "mean_token_accuracy": 0.9335977420210838, | |
| "num_tokens": 849350.0, | |
| "step": 190 | |
| }, | |
| { | |
| "entropy": 2.0770725339651106, | |
| "epoch": 0.2484472049689441, | |
| "grad_norm": 3.3734312057495117, | |
| "learning_rate": 1.9980307686190764e-05, | |
| "loss": 0.2324429988861084, | |
| "mean_token_accuracy": 0.9344113290309906, | |
| "num_tokens": 896011.0, | |
| "step": 200 | |
| }, | |
| { | |
| "entropy": 2.0887098640203474, | |
| "epoch": 0.2608695652173913, | |
| "grad_norm": 4.338788032531738, | |
| "learning_rate": 1.997493694655595e-05, | |
| "loss": 0.2637628078460693, | |
| "mean_token_accuracy": 0.9405189320445061, | |
| "num_tokens": 938272.0, | |
| "step": 210 | |
| }, | |
| { | |
| "entropy": 2.057726114988327, | |
| "epoch": 0.2732919254658385, | |
| "grad_norm": 7.423470973968506, | |
| "learning_rate": 1.9968920273221833e-05, | |
| "loss": 0.245102596282959, | |
| "mean_token_accuracy": 0.934748524427414, | |
| "num_tokens": 985910.0, | |
| "step": 220 | |
| }, | |
| { | |
| "entropy": 2.0852247208356856, | |
| "epoch": 0.2857142857142857, | |
| "grad_norm": 4.9054999351501465, | |
| "learning_rate": 1.996225805580211e-05, | |
| "loss": 0.16561169624328614, | |
| "mean_token_accuracy": 0.9549386024475097, | |
| "num_tokens": 1026611.0, | |
| "step": 230 | |
| }, | |
| { | |
| "entropy": 2.1346270740032196, | |
| "epoch": 0.2981366459627329, | |
| "grad_norm": 0.8074743151664734, | |
| "learning_rate": 1.9954950725713117e-05, | |
| "loss": 0.2407538890838623, | |
| "mean_token_accuracy": 0.944537715613842, | |
| "num_tokens": 1071660.0, | |
| "step": 240 | |
| }, | |
| { | |
| "entropy": 2.122556984424591, | |
| "epoch": 0.3105590062111801, | |
| "grad_norm": 0.8064472079277039, | |
| "learning_rate": 1.9946998756145894e-05, | |
| "loss": 0.14700745344161986, | |
| "mean_token_accuracy": 0.968578913807869, | |
| "num_tokens": 1120556.0, | |
| "step": 250 | |
| }, | |
| { | |
| "entropy": 2.107454228401184, | |
| "epoch": 0.32298136645962733, | |
| "grad_norm": 4.961323261260986, | |
| "learning_rate": 1.993840266203553e-05, | |
| "loss": 0.19659453630447388, | |
| "mean_token_accuracy": 0.9422186747193336, | |
| "num_tokens": 1162755.0, | |
| "step": 260 | |
| }, | |
| { | |
| "entropy": 2.1008795320987703, | |
| "epoch": 0.33540372670807456, | |
| "grad_norm": 4.268195152282715, | |
| "learning_rate": 1.9929163000027848e-05, | |
| "loss": 0.19777419567108154, | |
| "mean_token_accuracy": 0.9608424186706543, | |
| "num_tokens": 1212228.0, | |
| "step": 270 | |
| }, | |
| { | |
| "entropy": 2.0714638978242874, | |
| "epoch": 0.34782608695652173, | |
| "grad_norm": 4.130878925323486, | |
| "learning_rate": 1.9919280368443316e-05, | |
| "loss": 0.1941136121749878, | |
| "mean_token_accuracy": 0.9510379567742347, | |
| "num_tokens": 1258377.0, | |
| "step": 280 | |
| }, | |
| { | |
| "entropy": 2.146782675385475, | |
| "epoch": 0.36024844720496896, | |
| "grad_norm": 8.89709758758545, | |
| "learning_rate": 1.9908755407238342e-05, | |
| "loss": 0.175544273853302, | |
| "mean_token_accuracy": 0.9587054386734962, | |
| "num_tokens": 1298826.0, | |
| "step": 290 | |
| }, | |
| { | |
| "entropy": 2.1432328313589095, | |
| "epoch": 0.37267080745341613, | |
| "grad_norm": 2.826094150543213, | |
| "learning_rate": 1.9897588797963818e-05, | |
| "loss": 0.19219242334365844, | |
| "mean_token_accuracy": 0.9561588227748871, | |
| "num_tokens": 1339864.0, | |
| "step": 300 | |
| }, | |
| { | |
| "entropy": 2.1786401599645613, | |
| "epoch": 0.38509316770186336, | |
| "grad_norm": 2.988393545150757, | |
| "learning_rate": 1.9885781263720977e-05, | |
| "loss": 0.15490752458572388, | |
| "mean_token_accuracy": 0.952945676445961, | |
| "num_tokens": 1382819.0, | |
| "step": 310 | |
| }, | |
| { | |
| "entropy": 2.150338906049728, | |
| "epoch": 0.39751552795031053, | |
| "grad_norm": 3.8469715118408203, | |
| "learning_rate": 1.9873333569114578e-05, | |
| "loss": 0.11064722537994384, | |
| "mean_token_accuracy": 0.9639346539974213, | |
| "num_tokens": 1428235.0, | |
| "step": 320 | |
| }, | |
| { | |
| "entropy": 2.0485803872346877, | |
| "epoch": 0.40993788819875776, | |
| "grad_norm": 3.4940409660339355, | |
| "learning_rate": 1.9860246520203393e-05, | |
| "loss": 0.12654770612716676, | |
| "mean_token_accuracy": 0.9720151156187058, | |
| "num_tokens": 1475653.0, | |
| "step": 330 | |
| }, | |
| { | |
| "entropy": 2.0982570886611938, | |
| "epoch": 0.422360248447205, | |
| "grad_norm": 9.01036262512207, | |
| "learning_rate": 1.984652096444801e-05, | |
| "loss": 0.17338567972183228, | |
| "mean_token_accuracy": 0.9567379966378212, | |
| "num_tokens": 1522587.0, | |
| "step": 340 | |
| }, | |
| { | |
| "entropy": 2.037535387277603, | |
| "epoch": 0.43478260869565216, | |
| "grad_norm": 6.306981563568115, | |
| "learning_rate": 1.9832157790655947e-05, | |
| "loss": 0.15461095571517944, | |
| "mean_token_accuracy": 0.9642502069473267, | |
| "num_tokens": 1570146.0, | |
| "step": 350 | |
| }, | |
| { | |
| "entropy": 2.0148197203874587, | |
| "epoch": 0.4472049689440994, | |
| "grad_norm": 5.378430366516113, | |
| "learning_rate": 1.9817157928924123e-05, | |
| "loss": 0.10572208166122436, | |
| "mean_token_accuracy": 0.9662203952670098, | |
| "num_tokens": 1619006.0, | |
| "step": 360 | |
| }, | |
| { | |
| "entropy": 2.1017101377248766, | |
| "epoch": 0.45962732919254656, | |
| "grad_norm": 4.263245582580566, | |
| "learning_rate": 1.980152235057858e-05, | |
| "loss": 0.2266246795654297, | |
| "mean_token_accuracy": 0.9508525714278221, | |
| "num_tokens": 1666344.0, | |
| "step": 370 | |
| }, | |
| { | |
| "entropy": 2.1142481714487076, | |
| "epoch": 0.4720496894409938, | |
| "grad_norm": 1.6734673976898193, | |
| "learning_rate": 1.9785252068111634e-05, | |
| "loss": 0.141499662399292, | |
| "mean_token_accuracy": 0.9647441744804383, | |
| "num_tokens": 1707202.0, | |
| "step": 380 | |
| }, | |
| { | |
| "entropy": 2.0245371520519257, | |
| "epoch": 0.484472049689441, | |
| "grad_norm": 1.1180492639541626, | |
| "learning_rate": 1.976834813511629e-05, | |
| "loss": 0.07580887675285339, | |
| "mean_token_accuracy": 0.9793496742844582, | |
| "num_tokens": 1752612.0, | |
| "step": 390 | |
| }, | |
| { | |
| "entropy": 2.174392205476761, | |
| "epoch": 0.4968944099378882, | |
| "grad_norm": 6.994105815887451, | |
| "learning_rate": 1.9750811646218008e-05, | |
| "loss": 0.11529726982116699, | |
| "mean_token_accuracy": 0.9770008429884911, | |
| "num_tokens": 1787340.0, | |
| "step": 400 | |
| }, | |
| { | |
| "entropy": 2.093138635158539, | |
| "epoch": 0.5093167701863354, | |
| "grad_norm": 6.234873294830322, | |
| "learning_rate": 1.9732643737003827e-05, | |
| "loss": 0.1870105028152466, | |
| "mean_token_accuracy": 0.9562314331531525, | |
| "num_tokens": 1832755.0, | |
| "step": 410 | |
| }, | |
| { | |
| "entropy": 2.0406362146139143, | |
| "epoch": 0.5217391304347826, | |
| "grad_norm": 6.59069299697876, | |
| "learning_rate": 1.9713845583948838e-05, | |
| "loss": 0.12588831186294555, | |
| "mean_token_accuracy": 0.9748386725783348, | |
| "num_tokens": 1877258.0, | |
| "step": 420 | |
| }, | |
| { | |
| "entropy": 2.0712024956941604, | |
| "epoch": 0.5341614906832298, | |
| "grad_norm": 1.3715144395828247, | |
| "learning_rate": 1.9694418404339985e-05, | |
| "loss": 0.14443048238754272, | |
| "mean_token_accuracy": 0.96854527592659, | |
| "num_tokens": 1926633.0, | |
| "step": 430 | |
| }, | |
| { | |
| "entropy": 2.120563179254532, | |
| "epoch": 0.546583850931677, | |
| "grad_norm": 0.8505068421363831, | |
| "learning_rate": 1.9674363456197252e-05, | |
| "loss": 0.10405553579330444, | |
| "mean_token_accuracy": 0.9761933490633965, | |
| "num_tokens": 1968058.0, | |
| "step": 440 | |
| }, | |
| { | |
| "entropy": 2.1187560498714446, | |
| "epoch": 0.5590062111801242, | |
| "grad_norm": 0.2388964146375656, | |
| "learning_rate": 1.965368203819219e-05, | |
| "loss": 0.12412438392639161, | |
| "mean_token_accuracy": 0.9798449590802193, | |
| "num_tokens": 2011757.0, | |
| "step": 450 | |
| }, | |
| { | |
| "entropy": 2.079404717683792, | |
| "epoch": 0.5714285714285714, | |
| "grad_norm": 6.426936149597168, | |
| "learning_rate": 1.963237548956382e-05, | |
| "loss": 0.13763257265090942, | |
| "mean_token_accuracy": 0.9699526458978653, | |
| "num_tokens": 2056687.0, | |
| "step": 460 | |
| }, | |
| { | |
| "entropy": 2.1087421059608458, | |
| "epoch": 0.5838509316770186, | |
| "grad_norm": 5.350924968719482, | |
| "learning_rate": 1.9610445190031927e-05, | |
| "loss": 0.17600059509277344, | |
| "mean_token_accuracy": 0.9602105036377907, | |
| "num_tokens": 2107909.0, | |
| "step": 470 | |
| }, | |
| { | |
| "entropy": 2.1104681938886642, | |
| "epoch": 0.5962732919254659, | |
| "grad_norm": 4.915591239929199, | |
| "learning_rate": 1.9587892559707687e-05, | |
| "loss": 0.14593877792358398, | |
| "mean_token_accuracy": 0.9634651705622673, | |
| "num_tokens": 2152714.0, | |
| "step": 480 | |
| }, | |
| { | |
| "entropy": 2.0843971610069274, | |
| "epoch": 0.6086956521739131, | |
| "grad_norm": 5.020099639892578, | |
| "learning_rate": 1.9564719059001735e-05, | |
| "loss": 0.09503247737884521, | |
| "mean_token_accuracy": 0.9802449300885201, | |
| "num_tokens": 2199372.0, | |
| "step": 490 | |
| }, | |
| { | |
| "entropy": 2.117968979477882, | |
| "epoch": 0.6211180124223602, | |
| "grad_norm": 6.113184928894043, | |
| "learning_rate": 1.9540926188529567e-05, | |
| "loss": 0.06596333384513856, | |
| "mean_token_accuracy": 0.9794966623187065, | |
| "num_tokens": 2240337.0, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.6211180124223602, | |
| "eval_entropy": 1.9857167843865502, | |
| "eval_loss": 0.6501790285110474, | |
| "eval_mean_token_accuracy": 0.8782477229366482, | |
| "eval_num_tokens": 2240337.0, | |
| "eval_runtime": 1016.9781, | |
| "eval_samples_per_second": 7.523, | |
| "eval_steps_per_second": 0.941, | |
| "step": 500 | |
| }, | |
| { | |
| "entropy": 2.1537328869104386, | |
| "epoch": 0.6335403726708074, | |
| "grad_norm": 1.456288456916809, | |
| "learning_rate": 1.9516515489014394e-05, | |
| "loss": 0.13476414680480958, | |
| "mean_token_accuracy": 0.9724704563617707, | |
| "num_tokens": 2278433.0, | |
| "step": 510 | |
| }, | |
| { | |
| "entropy": 2.1237567752599715, | |
| "epoch": 0.6459627329192547, | |
| "grad_norm": 7.178049564361572, | |
| "learning_rate": 1.9491488541187356e-05, | |
| "loss": 0.14870620965957643, | |
| "mean_token_accuracy": 0.9673199355602264, | |
| "num_tokens": 2325326.0, | |
| "step": 520 | |
| }, | |
| { | |
| "entropy": 2.0662467658519743, | |
| "epoch": 0.6583850931677019, | |
| "grad_norm": 4.662649154663086, | |
| "learning_rate": 1.946584696568516e-05, | |
| "loss": 0.06994055509567261, | |
| "mean_token_accuracy": 0.9829941034317017, | |
| "num_tokens": 2369447.0, | |
| "step": 530 | |
| }, | |
| { | |
| "entropy": 2.123342525959015, | |
| "epoch": 0.6708074534161491, | |
| "grad_norm": 3.5230398178100586, | |
| "learning_rate": 1.9439592422945147e-05, | |
| "loss": 0.12530711889266968, | |
| "mean_token_accuracy": 0.968981710076332, | |
| "num_tokens": 2414329.0, | |
| "step": 540 | |
| }, | |
| { | |
| "entropy": 2.109190860390663, | |
| "epoch": 0.6832298136645962, | |
| "grad_norm": 5.585573673248291, | |
| "learning_rate": 1.9412726613097747e-05, | |
| "loss": 0.07817915678024293, | |
| "mean_token_accuracy": 0.9775777757167816, | |
| "num_tokens": 2460847.0, | |
| "step": 550 | |
| }, | |
| { | |
| "entropy": 2.144969728589058, | |
| "epoch": 0.6956521739130435, | |
| "grad_norm": 4.607976913452148, | |
| "learning_rate": 1.9385251275856413e-05, | |
| "loss": 0.08262240886688232, | |
| "mean_token_accuracy": 0.9754370078444481, | |
| "num_tokens": 2501095.0, | |
| "step": 560 | |
| }, | |
| { | |
| "entropy": 2.1769137263298033, | |
| "epoch": 0.7080745341614907, | |
| "grad_norm": 1.4531834125518799, | |
| "learning_rate": 1.9357168190404937e-05, | |
| "loss": 0.08149978518486023, | |
| "mean_token_accuracy": 0.9809109061956406, | |
| "num_tokens": 2545700.0, | |
| "step": 570 | |
| }, | |
| { | |
| "entropy": 2.121944713592529, | |
| "epoch": 0.7204968944099379, | |
| "grad_norm": 0.1272820085287094, | |
| "learning_rate": 1.932847917528227e-05, | |
| "loss": 0.09725183248519897, | |
| "mean_token_accuracy": 0.9799433529376984, | |
| "num_tokens": 2587599.0, | |
| "step": 580 | |
| }, | |
| { | |
| "entropy": 2.0991091817617415, | |
| "epoch": 0.7329192546583851, | |
| "grad_norm": 4.6163530349731445, | |
| "learning_rate": 1.9299186088264728e-05, | |
| "loss": 0.07552647590637207, | |
| "mean_token_accuracy": 0.9778737679123879, | |
| "num_tokens": 2632497.0, | |
| "step": 590 | |
| }, | |
| { | |
| "entropy": 2.1005853712558746, | |
| "epoch": 0.7453416149068323, | |
| "grad_norm": 4.137128829956055, | |
| "learning_rate": 1.9269290826245713e-05, | |
| "loss": 0.09553526043891906, | |
| "mean_token_accuracy": 0.9701759338378906, | |
| "num_tokens": 2677204.0, | |
| "step": 600 | |
| }, | |
| { | |
| "entropy": 2.1062012016773224, | |
| "epoch": 0.7577639751552795, | |
| "grad_norm": 1.1038886308670044, | |
| "learning_rate": 1.9238795325112867e-05, | |
| "loss": 0.08808867931365967, | |
| "mean_token_accuracy": 0.9731768816709518, | |
| "num_tokens": 2726745.0, | |
| "step": 610 | |
| }, | |
| { | |
| "entropy": 2.1135039806365965, | |
| "epoch": 0.7701863354037267, | |
| "grad_norm": 2.838488817214966, | |
| "learning_rate": 1.9207701559622724e-05, | |
| "loss": 0.05545814037322998, | |
| "mean_token_accuracy": 0.9834772542119026, | |
| "num_tokens": 2767898.0, | |
| "step": 620 | |
| }, | |
| { | |
| "entropy": 2.056372728943825, | |
| "epoch": 0.782608695652174, | |
| "grad_norm": 7.393406391143799, | |
| "learning_rate": 1.9176011543272815e-05, | |
| "loss": 0.11480764150619507, | |
| "mean_token_accuracy": 0.9796148985624313, | |
| "num_tokens": 2812697.0, | |
| "step": 630 | |
| }, | |
| { | |
| "entropy": 2.0691574245691298, | |
| "epoch": 0.7950310559006211, | |
| "grad_norm": 6.208304405212402, | |
| "learning_rate": 1.91437273281713e-05, | |
| "loss": 0.11305643320083618, | |
| "mean_token_accuracy": 0.974467147886753, | |
| "num_tokens": 2855947.0, | |
| "step": 640 | |
| }, | |
| { | |
| "entropy": 2.0940282166004183, | |
| "epoch": 0.8074534161490683, | |
| "grad_norm": 1.7314088344573975, | |
| "learning_rate": 1.9110851004904076e-05, | |
| "loss": 0.13724110126495362, | |
| "mean_token_accuracy": 0.9700473248958588, | |
| "num_tokens": 2906029.0, | |
| "step": 650 | |
| }, | |
| { | |
| "entropy": 2.0931085854768754, | |
| "epoch": 0.8198757763975155, | |
| "grad_norm": 2.535383939743042, | |
| "learning_rate": 1.9077384702399396e-05, | |
| "loss": 0.06062517762184143, | |
| "mean_token_accuracy": 0.9809448182582855, | |
| "num_tokens": 2952756.0, | |
| "step": 660 | |
| }, | |
| { | |
| "entropy": 2.0389942497015, | |
| "epoch": 0.8322981366459627, | |
| "grad_norm": 2.38712739944458, | |
| "learning_rate": 1.9043330587790016e-05, | |
| "loss": 0.07465954422950745, | |
| "mean_token_accuracy": 0.9777025073766709, | |
| "num_tokens": 2996532.0, | |
| "step": 670 | |
| }, | |
| { | |
| "entropy": 2.017015664279461, | |
| "epoch": 0.84472049689441, | |
| "grad_norm": 2.4707024097442627, | |
| "learning_rate": 1.9008690866272856e-05, | |
| "loss": 0.09084809422492982, | |
| "mean_token_accuracy": 0.9794181376695633, | |
| "num_tokens": 3043785.0, | |
| "step": 680 | |
| }, | |
| { | |
| "entropy": 2.059348088502884, | |
| "epoch": 0.8571428571428571, | |
| "grad_norm": 5.584771156311035, | |
| "learning_rate": 1.89734677809662e-05, | |
| "loss": 0.04494470953941345, | |
| "mean_token_accuracy": 0.9811143398284912, | |
| "num_tokens": 3087397.0, | |
| "step": 690 | |
| }, | |
| { | |
| "entropy": 2.100178116559982, | |
| "epoch": 0.8695652173913043, | |
| "grad_norm": 9.014580726623535, | |
| "learning_rate": 1.8937663612764446e-05, | |
| "loss": 0.05163530111312866, | |
| "mean_token_accuracy": 0.9877288997173309, | |
| "num_tokens": 3132304.0, | |
| "step": 700 | |
| }, | |
| { | |
| "entropy": 2.0874249041080475, | |
| "epoch": 0.8819875776397516, | |
| "grad_norm": 3.579822540283203, | |
| "learning_rate": 1.8901280680190405e-05, | |
| "loss": 0.3258012533187866, | |
| "mean_token_accuracy": 0.955612650513649, | |
| "num_tokens": 3174559.0, | |
| "step": 710 | |
| }, | |
| { | |
| "entropy": 2.0551782071590425, | |
| "epoch": 0.8944099378881988, | |
| "grad_norm": 4.217214107513428, | |
| "learning_rate": 1.8864321339245148e-05, | |
| "loss": 0.10493965148925781, | |
| "mean_token_accuracy": 0.9790847629308701, | |
| "num_tokens": 3218648.0, | |
| "step": 720 | |
| }, | |
| { | |
| "entropy": 2.1269098341465, | |
| "epoch": 0.906832298136646, | |
| "grad_norm": 3.0778424739837646, | |
| "learning_rate": 1.8826787983255474e-05, | |
| "loss": 0.07121096849441529, | |
| "mean_token_accuracy": 0.9841245651245117, | |
| "num_tokens": 3258619.0, | |
| "step": 730 | |
| }, | |
| { | |
| "entropy": 2.196052446961403, | |
| "epoch": 0.9192546583850931, | |
| "grad_norm": 1.9955366849899292, | |
| "learning_rate": 1.87886830427189e-05, | |
| "loss": 0.07663369774818421, | |
| "mean_token_accuracy": 0.9771979004144669, | |
| "num_tokens": 3299305.0, | |
| "step": 740 | |
| }, | |
| { | |
| "entropy": 2.1504336088895797, | |
| "epoch": 0.9316770186335404, | |
| "grad_norm": 0.28726229071617126, | |
| "learning_rate": 1.8750008985146277e-05, | |
| "loss": 0.09686735272407532, | |
| "mean_token_accuracy": 0.9818914562463761, | |
| "num_tokens": 3341352.0, | |
| "step": 750 | |
| }, | |
| { | |
| "entropy": 2.124210861325264, | |
| "epoch": 0.9440993788819876, | |
| "grad_norm": 0.5584977269172668, | |
| "learning_rate": 1.8710768314902018e-05, | |
| "loss": 0.041911613941192624, | |
| "mean_token_accuracy": 0.9888250693678856, | |
| "num_tokens": 3388572.0, | |
| "step": 760 | |
| }, | |
| { | |
| "entropy": 2.162134176492691, | |
| "epoch": 0.9565217391304348, | |
| "grad_norm": 0.7624562382698059, | |
| "learning_rate": 1.867096357304191e-05, | |
| "loss": 0.06633872389793397, | |
| "mean_token_accuracy": 0.9857817873358726, | |
| "num_tokens": 3431740.0, | |
| "step": 770 | |
| }, | |
| { | |
| "entropy": 2.1005555152893067, | |
| "epoch": 0.968944099378882, | |
| "grad_norm": 2.72621750831604, | |
| "learning_rate": 1.8630597337148582e-05, | |
| "loss": 0.04687671065330505, | |
| "mean_token_accuracy": 0.9858215063810348, | |
| "num_tokens": 3483799.0, | |
| "step": 780 | |
| }, | |
| { | |
| "entropy": 2.0882847398519515, | |
| "epoch": 0.9813664596273292, | |
| "grad_norm": 1.5134168863296509, | |
| "learning_rate": 1.8589672221164578e-05, | |
| "loss": 0.05004507303237915, | |
| "mean_token_accuracy": 0.9874317914247512, | |
| "num_tokens": 3530053.0, | |
| "step": 790 | |
| }, | |
| { | |
| "entropy": 2.097977989912033, | |
| "epoch": 0.9937888198757764, | |
| "grad_norm": 0.2564803659915924, | |
| "learning_rate": 1.85481908752231e-05, | |
| "loss": 0.0792747676372528, | |
| "mean_token_accuracy": 0.9824414849281311, | |
| "num_tokens": 3581288.0, | |
| "step": 800 | |
| }, | |
| { | |
| "entropy": 2.081494650244713, | |
| "epoch": 1.0062111801242235, | |
| "grad_norm": 1.7785015106201172, | |
| "learning_rate": 1.8506155985476386e-05, | |
| "loss": 0.058735990524291994, | |
| "mean_token_accuracy": 0.9833749994635582, | |
| "num_tokens": 3629656.0, | |
| "step": 810 | |
| }, | |
| { | |
| "entropy": 2.0798818826675416, | |
| "epoch": 1.0186335403726707, | |
| "grad_norm": 0.17327219247817993, | |
| "learning_rate": 1.8463570273921777e-05, | |
| "loss": 0.012010685354471206, | |
| "mean_token_accuracy": 0.9959963768720627, | |
| "num_tokens": 3676785.0, | |
| "step": 820 | |
| }, | |
| { | |
| "entropy": 2.0705758064985273, | |
| "epoch": 1.031055900621118, | |
| "grad_norm": 0.6708211898803711, | |
| "learning_rate": 1.8420436498225446e-05, | |
| "loss": 0.029526194930076598, | |
| "mean_token_accuracy": 0.9904356062412262, | |
| "num_tokens": 3719647.0, | |
| "step": 830 | |
| }, | |
| { | |
| "entropy": 2.083918330073357, | |
| "epoch": 1.0434782608695652, | |
| "grad_norm": 0.1544179767370224, | |
| "learning_rate": 1.8376757451543827e-05, | |
| "loss": 0.05709845423698425, | |
| "mean_token_accuracy": 0.9897336810827255, | |
| "num_tokens": 3762547.0, | |
| "step": 840 | |
| }, | |
| { | |
| "entropy": 2.110027256608009, | |
| "epoch": 1.0559006211180124, | |
| "grad_norm": 4.642289161682129, | |
| "learning_rate": 1.8332535962342738e-05, | |
| "loss": 0.03640684187412262, | |
| "mean_token_accuracy": 0.9888481795787811, | |
| "num_tokens": 3804605.0, | |
| "step": 850 | |
| }, | |
| { | |
| "entropy": 2.0938026130199434, | |
| "epoch": 1.0683229813664596, | |
| "grad_norm": 0.21419347822666168, | |
| "learning_rate": 1.828777489421423e-05, | |
| "loss": 0.03816946446895599, | |
| "mean_token_accuracy": 0.9911127641797066, | |
| "num_tokens": 3848041.0, | |
| "step": 860 | |
| }, | |
| { | |
| "entropy": 2.024568662047386, | |
| "epoch": 1.0807453416149069, | |
| "grad_norm": 3.198349952697754, | |
| "learning_rate": 1.824247714569114e-05, | |
| "loss": 0.10569311380386352, | |
| "mean_token_accuracy": 0.9802387565374374, | |
| "num_tokens": 3892052.0, | |
| "step": 870 | |
| }, | |
| { | |
| "entropy": 2.046171006560326, | |
| "epoch": 1.093167701863354, | |
| "grad_norm": 3.6660497188568115, | |
| "learning_rate": 1.8196645650059407e-05, | |
| "loss": 0.03053833544254303, | |
| "mean_token_accuracy": 0.9916201144456863, | |
| "num_tokens": 3940927.0, | |
| "step": 880 | |
| }, | |
| { | |
| "entropy": 2.0361697018146514, | |
| "epoch": 1.1055900621118013, | |
| "grad_norm": 1.2115179300308228, | |
| "learning_rate": 1.8150283375168112e-05, | |
| "loss": 0.08387028574943542, | |
| "mean_token_accuracy": 0.9851482644677162, | |
| "num_tokens": 3985643.0, | |
| "step": 890 | |
| }, | |
| { | |
| "entropy": 2.06917799115181, | |
| "epoch": 1.1180124223602483, | |
| "grad_norm": 1.0747365951538086, | |
| "learning_rate": 1.810339332323732e-05, | |
| "loss": 0.030901220440864564, | |
| "mean_token_accuracy": 0.9925313547253609, | |
| "num_tokens": 4026723.0, | |
| "step": 900 | |
| }, | |
| { | |
| "entropy": 2.0700403451919556, | |
| "epoch": 1.1304347826086956, | |
| "grad_norm": 2.125000238418579, | |
| "learning_rate": 1.8055978530663632e-05, | |
| "loss": 0.06523830890655517, | |
| "mean_token_accuracy": 0.9856161668896675, | |
| "num_tokens": 4068487.0, | |
| "step": 910 | |
| }, | |
| { | |
| "entropy": 2.0906931340694426, | |
| "epoch": 1.1428571428571428, | |
| "grad_norm": 0.4668339788913727, | |
| "learning_rate": 1.8008042067823584e-05, | |
| "loss": 0.020703746378421782, | |
| "mean_token_accuracy": 0.9917388156056404, | |
| "num_tokens": 4111658.0, | |
| "step": 920 | |
| }, | |
| { | |
| "entropy": 2.04544812142849, | |
| "epoch": 1.15527950310559, | |
| "grad_norm": 0.5313199758529663, | |
| "learning_rate": 1.7959587038874826e-05, | |
| "loss": 0.05440770983695984, | |
| "mean_token_accuracy": 0.9829235851764679, | |
| "num_tokens": 4155785.0, | |
| "step": 930 | |
| }, | |
| { | |
| "entropy": 2.0342077732086183, | |
| "epoch": 1.1677018633540373, | |
| "grad_norm": 6.212786674499512, | |
| "learning_rate": 1.791061658155509e-05, | |
| "loss": 0.04542175531387329, | |
| "mean_token_accuracy": 0.9873297110199928, | |
| "num_tokens": 4203227.0, | |
| "step": 940 | |
| }, | |
| { | |
| "entropy": 2.063344043493271, | |
| "epoch": 1.1801242236024845, | |
| "grad_norm": 2.8781256675720215, | |
| "learning_rate": 1.786113386697903e-05, | |
| "loss": 0.02678465247154236, | |
| "mean_token_accuracy": 0.9917070686817169, | |
| "num_tokens": 4246203.0, | |
| "step": 950 | |
| }, | |
| { | |
| "entropy": 2.0039207309484484, | |
| "epoch": 1.1925465838509317, | |
| "grad_norm": 4.898998737335205, | |
| "learning_rate": 1.7811142099432847e-05, | |
| "loss": 0.03269885778427124, | |
| "mean_token_accuracy": 0.9882596805691719, | |
| "num_tokens": 4293923.0, | |
| "step": 960 | |
| }, | |
| { | |
| "entropy": 2.1546689569950104, | |
| "epoch": 1.204968944099379, | |
| "grad_norm": 0.16982388496398926, | |
| "learning_rate": 1.7760644516166815e-05, | |
| "loss": 0.01413324624300003, | |
| "mean_token_accuracy": 0.9912873223423958, | |
| "num_tokens": 4329772.0, | |
| "step": 970 | |
| }, | |
| { | |
| "entropy": 2.052805933356285, | |
| "epoch": 1.2173913043478262, | |
| "grad_norm": 7.0196027755737305, | |
| "learning_rate": 1.7709644387185646e-05, | |
| "loss": 0.05414450168609619, | |
| "mean_token_accuracy": 0.9854385688900947, | |
| "num_tokens": 4377093.0, | |
| "step": 980 | |
| }, | |
| { | |
| "entropy": 1.9994864210486412, | |
| "epoch": 1.2298136645962732, | |
| "grad_norm": 3.947655439376831, | |
| "learning_rate": 1.765814501503672e-05, | |
| "loss": 0.05991327166557312, | |
| "mean_token_accuracy": 0.9902179941534996, | |
| "num_tokens": 4424964.0, | |
| "step": 990 | |
| }, | |
| { | |
| "entropy": 2.0789844542741776, | |
| "epoch": 1.2422360248447206, | |
| "grad_norm": 0.5713167786598206, | |
| "learning_rate": 1.760614973459626e-05, | |
| "loss": 0.016869233548641206, | |
| "mean_token_accuracy": 0.9927510812878608, | |
| "num_tokens": 4470312.0, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 1.2422360248447206, | |
| "eval_entropy": 1.93758956541462, | |
| "eval_loss": 0.6518564820289612, | |
| "eval_mean_token_accuracy": 0.8916452462894914, | |
| "eval_num_tokens": 4470312.0, | |
| "eval_runtime": 1016.5304, | |
| "eval_samples_per_second": 7.527, | |
| "eval_steps_per_second": 0.941, | |
| "step": 1000 | |
| }, | |
| { | |
| "entropy": 2.0249680817127227, | |
| "epoch": 1.2546583850931676, | |
| "grad_norm": 0.23046031594276428, | |
| "learning_rate": 1.7553661912853348e-05, | |
| "loss": 0.1257791757583618, | |
| "mean_token_accuracy": 0.9823350816965103, | |
| "num_tokens": 4514663.0, | |
| "step": 1010 | |
| }, | |
| { | |
| "entropy": 2.073505198955536, | |
| "epoch": 1.2670807453416149, | |
| "grad_norm": 1.52617609500885, | |
| "learning_rate": 1.7500684948691917e-05, | |
| "loss": 0.058462345600128175, | |
| "mean_token_accuracy": 0.9881463676691056, | |
| "num_tokens": 4556354.0, | |
| "step": 1020 | |
| }, | |
| { | |
| "entropy": 2.068504738807678, | |
| "epoch": 1.279503105590062, | |
| "grad_norm": 4.715869426727295, | |
| "learning_rate": 1.7447222272670634e-05, | |
| "loss": 0.07855769991874695, | |
| "mean_token_accuracy": 0.9773707166314125, | |
| "num_tokens": 4598771.0, | |
| "step": 1030 | |
| }, | |
| { | |
| "entropy": 2.019624277949333, | |
| "epoch": 1.2919254658385093, | |
| "grad_norm": 0.7180259227752686, | |
| "learning_rate": 1.7393277346800766e-05, | |
| "loss": 0.03097618222236633, | |
| "mean_token_accuracy": 0.9947341948747634, | |
| "num_tokens": 4645010.0, | |
| "step": 1040 | |
| }, | |
| { | |
| "entropy": 2.0088700890541076, | |
| "epoch": 1.3043478260869565, | |
| "grad_norm": 1.9578375816345215, | |
| "learning_rate": 1.7338853664321993e-05, | |
| "loss": 0.02723775804042816, | |
| "mean_token_accuracy": 0.9935153171420097, | |
| "num_tokens": 4694582.0, | |
| "step": 1050 | |
| }, | |
| { | |
| "entropy": 1.9856946557760238, | |
| "epoch": 1.3167701863354038, | |
| "grad_norm": 5.278125286102295, | |
| "learning_rate": 1.7283954749476195e-05, | |
| "loss": 0.11669650077819824, | |
| "mean_token_accuracy": 0.9793488040566445, | |
| "num_tokens": 4751436.0, | |
| "step": 1060 | |
| }, | |
| { | |
| "entropy": 1.9670168876647949, | |
| "epoch": 1.329192546583851, | |
| "grad_norm": 0.20898965001106262, | |
| "learning_rate": 1.7228584157279242e-05, | |
| "loss": 0.08815430998802185, | |
| "mean_token_accuracy": 0.9805598288774491, | |
| "num_tokens": 4798385.0, | |
| "step": 1070 | |
| }, | |
| { | |
| "entropy": 1.9559540659189225, | |
| "epoch": 1.341614906832298, | |
| "grad_norm": 8.317994117736816, | |
| "learning_rate": 1.7172745473290788e-05, | |
| "loss": 0.08126496076583863, | |
| "mean_token_accuracy": 0.9816830947995185, | |
| "num_tokens": 4848403.0, | |
| "step": 1080 | |
| }, | |
| { | |
| "entropy": 2.0961306214332582, | |
| "epoch": 1.3540372670807455, | |
| "grad_norm": 6.840373516082764, | |
| "learning_rate": 1.711644231338208e-05, | |
| "loss": 0.07558760643005372, | |
| "mean_token_accuracy": 0.9923902451992035, | |
| "num_tokens": 4892092.0, | |
| "step": 1090 | |
| }, | |
| { | |
| "entropy": 2.113238129019737, | |
| "epoch": 1.3664596273291925, | |
| "grad_norm": 0.18261918425559998, | |
| "learning_rate": 1.705967832350182e-05, | |
| "loss": 0.060640227794647214, | |
| "mean_token_accuracy": 0.9944021731615067, | |
| "num_tokens": 4934584.0, | |
| "step": 1100 | |
| }, | |
| { | |
| "entropy": 2.1218963980674745, | |
| "epoch": 1.3788819875776397, | |
| "grad_norm": 0.24410933256149292, | |
| "learning_rate": 1.700245717944005e-05, | |
| "loss": 0.034927898645401, | |
| "mean_token_accuracy": 0.9925606638193131, | |
| "num_tokens": 4970933.0, | |
| "step": 1110 | |
| }, | |
| { | |
| "entropy": 2.0433398693799973, | |
| "epoch": 1.391304347826087, | |
| "grad_norm": 1.8514246940612793, | |
| "learning_rate": 1.6944782586590148e-05, | |
| "loss": 0.028316974639892578, | |
| "mean_token_accuracy": 0.9947910204529762, | |
| "num_tokens": 5016657.0, | |
| "step": 1120 | |
| }, | |
| { | |
| "entropy": 2.041057598590851, | |
| "epoch": 1.4037267080745341, | |
| "grad_norm": 4.287439823150635, | |
| "learning_rate": 1.6886658279708867e-05, | |
| "loss": 0.062076061964035034, | |
| "mean_token_accuracy": 0.9811025738716126, | |
| "num_tokens": 5056567.0, | |
| "step": 1130 | |
| }, | |
| { | |
| "entropy": 2.054543226957321, | |
| "epoch": 1.4161490683229814, | |
| "grad_norm": 0.31882035732269287, | |
| "learning_rate": 1.682808802267449e-05, | |
| "loss": 0.019540122151374816, | |
| "mean_token_accuracy": 0.9918297097086907, | |
| "num_tokens": 5103165.0, | |
| "step": 1140 | |
| }, | |
| { | |
| "entropy": 2.054564669728279, | |
| "epoch": 1.4285714285714286, | |
| "grad_norm": 3.7651987075805664, | |
| "learning_rate": 1.6769075608243097e-05, | |
| "loss": 0.04563193917274475, | |
| "mean_token_accuracy": 0.9891414448618889, | |
| "num_tokens": 5146669.0, | |
| "step": 1150 | |
| }, | |
| { | |
| "entropy": 2.067859849333763, | |
| "epoch": 1.4409937888198758, | |
| "grad_norm": 3.467146158218384, | |
| "learning_rate": 1.6709624857802977e-05, | |
| "loss": 0.02285553514957428, | |
| "mean_token_accuracy": 0.989309212565422, | |
| "num_tokens": 5185720.0, | |
| "step": 1160 | |
| }, | |
| { | |
| "entropy": 2.080258083343506, | |
| "epoch": 1.453416149068323, | |
| "grad_norm": 2.778151273727417, | |
| "learning_rate": 1.6649739621127147e-05, | |
| "loss": 0.09717610478401184, | |
| "mean_token_accuracy": 0.9798510074615479, | |
| "num_tokens": 5227106.0, | |
| "step": 1170 | |
| }, | |
| { | |
| "entropy": 2.0795232325792314, | |
| "epoch": 1.4658385093167703, | |
| "grad_norm": 2.489095449447632, | |
| "learning_rate": 1.658942377612408e-05, | |
| "loss": 0.036468693614006044, | |
| "mean_token_accuracy": 0.9870076581835747, | |
| "num_tokens": 5275477.0, | |
| "step": 1180 | |
| }, | |
| { | |
| "entropy": 2.0572758257389068, | |
| "epoch": 1.4782608695652173, | |
| "grad_norm": 4.842057228088379, | |
| "learning_rate": 1.6528681228586574e-05, | |
| "loss": 0.04591853022575378, | |
| "mean_token_accuracy": 0.9935535579919815, | |
| "num_tokens": 5317541.0, | |
| "step": 1190 | |
| }, | |
| { | |
| "entropy": 2.0386213317513464, | |
| "epoch": 1.4906832298136645, | |
| "grad_norm": 0.03853341192007065, | |
| "learning_rate": 1.646751591193883e-05, | |
| "loss": 0.04719167649745941, | |
| "mean_token_accuracy": 0.9895795121788978, | |
| "num_tokens": 5364639.0, | |
| "step": 1200 | |
| }, | |
| { | |
| "entropy": 2.109779354929924, | |
| "epoch": 1.5031055900621118, | |
| "grad_norm": 0.3504042327404022, | |
| "learning_rate": 1.6405931786981753e-05, | |
| "loss": 0.01679493337869644, | |
| "mean_token_accuracy": 0.9948511898517609, | |
| "num_tokens": 5411310.0, | |
| "step": 1210 | |
| }, | |
| { | |
| "entropy": 2.0733531206846236, | |
| "epoch": 1.515527950310559, | |
| "grad_norm": 0.05558984726667404, | |
| "learning_rate": 1.6343932841636455e-05, | |
| "loss": 0.021465454995632172, | |
| "mean_token_accuracy": 0.9935497388243675, | |
| "num_tokens": 5453104.0, | |
| "step": 1220 | |
| }, | |
| { | |
| "entropy": 2.010223825275898, | |
| "epoch": 1.5279503105590062, | |
| "grad_norm": 0.0882689356803894, | |
| "learning_rate": 1.6281523090686023e-05, | |
| "loss": 0.045790371298789975, | |
| "mean_token_accuracy": 0.99332015812397, | |
| "num_tokens": 5504433.0, | |
| "step": 1230 | |
| }, | |
| { | |
| "entropy": 2.0213984131813048, | |
| "epoch": 1.5403726708074534, | |
| "grad_norm": 8.743528366088867, | |
| "learning_rate": 1.6218706575515534e-05, | |
| "loss": 0.03466806411743164, | |
| "mean_token_accuracy": 0.9918604284524918, | |
| "num_tokens": 5549172.0, | |
| "step": 1240 | |
| }, | |
| { | |
| "entropy": 2.0573623061180113, | |
| "epoch": 1.5527950310559007, | |
| "grad_norm": 0.21996565163135529, | |
| "learning_rate": 1.615548736385034e-05, | |
| "loss": 0.024254243075847625, | |
| "mean_token_accuracy": 0.9923801437020302, | |
| "num_tokens": 5595856.0, | |
| "step": 1250 | |
| }, | |
| { | |
| "entropy": 1.9642501085996629, | |
| "epoch": 1.5652173913043477, | |
| "grad_norm": 2.733859062194824, | |
| "learning_rate": 1.6091869549492702e-05, | |
| "loss": 0.050705951452255246, | |
| "mean_token_accuracy": 0.9870995670557022, | |
| "num_tokens": 5645176.0, | |
| "step": 1260 | |
| }, | |
| { | |
| "entropy": 2.0747433573007585, | |
| "epoch": 1.5776397515527951, | |
| "grad_norm": 1.6149920225143433, | |
| "learning_rate": 1.602785725205663e-05, | |
| "loss": 0.06673233509063721, | |
| "mean_token_accuracy": 0.9812404677271843, | |
| "num_tokens": 5690486.0, | |
| "step": 1270 | |
| }, | |
| { | |
| "entropy": 2.0146251261234283, | |
| "epoch": 1.5900621118012421, | |
| "grad_norm": 3.433781623840332, | |
| "learning_rate": 1.5963454616701187e-05, | |
| "loss": 0.04578670859336853, | |
| "mean_token_accuracy": 0.989951391518116, | |
| "num_tokens": 5735853.0, | |
| "step": 1280 | |
| }, | |
| { | |
| "entropy": 1.9809163212776184, | |
| "epoch": 1.6024844720496896, | |
| "grad_norm": 0.1651136875152588, | |
| "learning_rate": 1.589866581386199e-05, | |
| "loss": 0.009565576910972595, | |
| "mean_token_accuracy": 0.9978349670767784, | |
| "num_tokens": 5782323.0, | |
| "step": 1290 | |
| }, | |
| { | |
| "entropy": 2.0274841606616976, | |
| "epoch": 1.6149068322981366, | |
| "grad_norm": 1.8124768733978271, | |
| "learning_rate": 1.5833495038981215e-05, | |
| "loss": 0.019991911947727203, | |
| "mean_token_accuracy": 0.9955646678805351, | |
| "num_tokens": 5827941.0, | |
| "step": 1300 | |
| }, | |
| { | |
| "entropy": 2.0407049506902695, | |
| "epoch": 1.6273291925465838, | |
| "grad_norm": 5.722525119781494, | |
| "learning_rate": 1.5767946512235885e-05, | |
| "loss": 0.06694766879081726, | |
| "mean_token_accuracy": 0.9827992141246795, | |
| "num_tokens": 5869720.0, | |
| "step": 1310 | |
| }, | |
| { | |
| "entropy": 2.054254913330078, | |
| "epoch": 1.639751552795031, | |
| "grad_norm": 0.08413979411125183, | |
| "learning_rate": 1.5702024478264596e-05, | |
| "loss": 0.02567650079727173, | |
| "mean_token_accuracy": 0.9888634070754051, | |
| "num_tokens": 5915859.0, | |
| "step": 1320 | |
| }, | |
| { | |
| "entropy": 1.986069232225418, | |
| "epoch": 1.6521739130434783, | |
| "grad_norm": 3.2810375690460205, | |
| "learning_rate": 1.5635733205892653e-05, | |
| "loss": 0.028512659668922424, | |
| "mean_token_accuracy": 0.9913915023207664, | |
| "num_tokens": 5962619.0, | |
| "step": 1330 | |
| }, | |
| { | |
| "entropy": 2.0707494646310804, | |
| "epoch": 1.6645962732919255, | |
| "grad_norm": 0.07080954313278198, | |
| "learning_rate": 1.5569076987855645e-05, | |
| "loss": 0.022223152220249176, | |
| "mean_token_accuracy": 0.9936053708195687, | |
| "num_tokens": 6005344.0, | |
| "step": 1340 | |
| }, | |
| { | |
| "entropy": 2.025489088892937, | |
| "epoch": 1.6770186335403725, | |
| "grad_norm": 5.966955661773682, | |
| "learning_rate": 1.5502060140521454e-05, | |
| "loss": 0.02077590525150299, | |
| "mean_token_accuracy": 0.9918732196092606, | |
| "num_tokens": 6048095.0, | |
| "step": 1350 | |
| }, | |
| { | |
| "entropy": 2.0773544281721117, | |
| "epoch": 1.68944099378882, | |
| "grad_norm": 3.3871872425079346, | |
| "learning_rate": 1.543468700361076e-05, | |
| "loss": 0.05042000412940979, | |
| "mean_token_accuracy": 0.9922097563743592, | |
| "num_tokens": 6091599.0, | |
| "step": 1360 | |
| }, | |
| { | |
| "entropy": 2.0988358676433565, | |
| "epoch": 1.701863354037267, | |
| "grad_norm": 2.538235902786255, | |
| "learning_rate": 1.536696193991601e-05, | |
| "loss": 0.03595686256885529, | |
| "mean_token_accuracy": 0.9918700397014618, | |
| "num_tokens": 6130885.0, | |
| "step": 1370 | |
| }, | |
| { | |
| "entropy": 2.120113742351532, | |
| "epoch": 1.7142857142857144, | |
| "grad_norm": 1.560457706451416, | |
| "learning_rate": 1.5298889335018895e-05, | |
| "loss": 0.007060723751783371, | |
| "mean_token_accuracy": 0.9989130437374115, | |
| "num_tokens": 6177827.0, | |
| "step": 1380 | |
| }, | |
| { | |
| "entropy": 2.1228767782449722, | |
| "epoch": 1.7267080745341614, | |
| "grad_norm": 0.20773983001708984, | |
| "learning_rate": 1.5230473597006384e-05, | |
| "loss": 0.0372874915599823, | |
| "mean_token_accuracy": 0.9817194625735283, | |
| "num_tokens": 6219816.0, | |
| "step": 1390 | |
| }, | |
| { | |
| "entropy": 2.0721586614847185, | |
| "epoch": 1.7391304347826086, | |
| "grad_norm": 0.2652308940887451, | |
| "learning_rate": 1.5161719156185253e-05, | |
| "loss": 0.04619762003421783, | |
| "mean_token_accuracy": 0.9939772725105286, | |
| "num_tokens": 6267673.0, | |
| "step": 1400 | |
| }, | |
| { | |
| "entropy": 2.052675449848175, | |
| "epoch": 1.7515527950310559, | |
| "grad_norm": 0.06336406618356705, | |
| "learning_rate": 1.5092630464795202e-05, | |
| "loss": 0.03301122784614563, | |
| "mean_token_accuracy": 0.9891937226057053, | |
| "num_tokens": 6314073.0, | |
| "step": 1410 | |
| }, | |
| { | |
| "entropy": 2.1229291677474977, | |
| "epoch": 1.763975155279503, | |
| "grad_norm": 2.1714088916778564, | |
| "learning_rate": 1.5023211996720558e-05, | |
| "loss": 0.008769268542528153, | |
| "mean_token_accuracy": 0.9979967936873436, | |
| "num_tokens": 6352274.0, | |
| "step": 1420 | |
| }, | |
| { | |
| "entropy": 2.1219181925058366, | |
| "epoch": 1.7763975155279503, | |
| "grad_norm": 2.3357884883880615, | |
| "learning_rate": 1.4953468247200542e-05, | |
| "loss": 0.031093907356262208, | |
| "mean_token_accuracy": 0.9895014673471451, | |
| "num_tokens": 6393662.0, | |
| "step": 1430 | |
| }, | |
| { | |
| "entropy": 2.0373534232378008, | |
| "epoch": 1.7888198757763976, | |
| "grad_norm": 0.3844815790653229, | |
| "learning_rate": 1.4883403732538208e-05, | |
| "loss": 0.026946166157722475, | |
| "mean_token_accuracy": 0.9952634528279305, | |
| "num_tokens": 6445853.0, | |
| "step": 1440 | |
| }, | |
| { | |
| "entropy": 2.100069361925125, | |
| "epoch": 1.8012422360248448, | |
| "grad_norm": 5.393243789672852, | |
| "learning_rate": 1.4813022989807964e-05, | |
| "loss": 0.061344707012176515, | |
| "mean_token_accuracy": 0.9873241350054741, | |
| "num_tokens": 6491025.0, | |
| "step": 1450 | |
| }, | |
| { | |
| "entropy": 2.137248122692108, | |
| "epoch": 1.8136645962732918, | |
| "grad_norm": 0.07023269683122635, | |
| "learning_rate": 1.4742330576561776e-05, | |
| "loss": 0.06469428539276123, | |
| "mean_token_accuracy": 0.9903487995266914, | |
| "num_tokens": 6530707.0, | |
| "step": 1460 | |
| }, | |
| { | |
| "entropy": 2.121686002612114, | |
| "epoch": 1.8260869565217392, | |
| "grad_norm": 4.548147201538086, | |
| "learning_rate": 1.4671331070534046e-05, | |
| "loss": 0.01620122790336609, | |
| "mean_token_accuracy": 0.9988372087478637, | |
| "num_tokens": 6576494.0, | |
| "step": 1470 | |
| }, | |
| { | |
| "entropy": 2.0570311337709426, | |
| "epoch": 1.8385093167701863, | |
| "grad_norm": 0.04442490264773369, | |
| "learning_rate": 1.4600029069345171e-05, | |
| "loss": 0.013120083510875702, | |
| "mean_token_accuracy": 0.9956349208950996, | |
| "num_tokens": 6619890.0, | |
| "step": 1480 | |
| }, | |
| { | |
| "entropy": 2.1113452911376953, | |
| "epoch": 1.8509316770186337, | |
| "grad_norm": 1.212381362915039, | |
| "learning_rate": 1.4528429190203826e-05, | |
| "loss": 0.04590463638305664, | |
| "mean_token_accuracy": 0.9906466111540795, | |
| "num_tokens": 6662456.0, | |
| "step": 1490 | |
| }, | |
| { | |
| "entropy": 2.039040079712868, | |
| "epoch": 1.8633540372670807, | |
| "grad_norm": 0.4518345594406128, | |
| "learning_rate": 1.445653606960797e-05, | |
| "loss": 0.022520086169242857, | |
| "mean_token_accuracy": 0.9937344387173652, | |
| "num_tokens": 6709587.0, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 1.8633540372670807, | |
| "eval_entropy": 1.9391227429937046, | |
| "eval_loss": 0.6151674389839172, | |
| "eval_mean_token_accuracy": 0.9007952373976992, | |
| "eval_num_tokens": 6709587.0, | |
| "eval_runtime": 1015.8442, | |
| "eval_samples_per_second": 7.532, | |
| "eval_steps_per_second": 0.942, | |
| "step": 1500 | |
| }, | |
| { | |
| "entropy": 2.117081579566002, | |
| "epoch": 1.875776397515528, | |
| "grad_norm": 0.06551311165094376, | |
| "learning_rate": 1.4384354363044611e-05, | |
| "loss": 0.051976734399795534, | |
| "mean_token_accuracy": 0.9881994038820267, | |
| "num_tokens": 6750511.0, | |
| "step": 1510 | |
| }, | |
| { | |
| "entropy": 2.098040521144867, | |
| "epoch": 1.8881987577639752, | |
| "grad_norm": 0.423195481300354, | |
| "learning_rate": 1.4311888744688331e-05, | |
| "loss": 0.023100055754184723, | |
| "mean_token_accuracy": 0.996203102171421, | |
| "num_tokens": 6789920.0, | |
| "step": 1520 | |
| }, | |
| { | |
| "entropy": 2.061115252971649, | |
| "epoch": 1.9006211180124224, | |
| "grad_norm": 6.247063636779785, | |
| "learning_rate": 1.423914390709861e-05, | |
| "loss": 0.0642433762550354, | |
| "mean_token_accuracy": 0.9834059119224549, | |
| "num_tokens": 6832649.0, | |
| "step": 1530 | |
| }, | |
| { | |
| "entropy": 2.0606234312057494, | |
| "epoch": 1.9130434782608696, | |
| "grad_norm": 0.05942244082689285, | |
| "learning_rate": 1.4166124560915957e-05, | |
| "loss": 0.015473641455173492, | |
| "mean_token_accuracy": 0.9945833340287209, | |
| "num_tokens": 6877860.0, | |
| "step": 1540 | |
| }, | |
| { | |
| "entropy": 2.1109096825122835, | |
| "epoch": 1.9254658385093166, | |
| "grad_norm": 3.235588788986206, | |
| "learning_rate": 1.4092835434556866e-05, | |
| "loss": 0.043846017122268675, | |
| "mean_token_accuracy": 0.9893042847514153, | |
| "num_tokens": 6928094.0, | |
| "step": 1550 | |
| }, | |
| { | |
| "entropy": 2.012011078000069, | |
| "epoch": 1.937888198757764, | |
| "grad_norm": 3.570309638977051, | |
| "learning_rate": 1.4019281273907627e-05, | |
| "loss": 0.010611482709646226, | |
| "mean_token_accuracy": 0.9952083334326745, | |
| "num_tokens": 6978174.0, | |
| "step": 1560 | |
| }, | |
| { | |
| "entropy": 2.0667447626590727, | |
| "epoch": 1.950310559006211, | |
| "grad_norm": 2.992898464202881, | |
| "learning_rate": 1.394546684201701e-05, | |
| "loss": 0.020136520266532898, | |
| "mean_token_accuracy": 0.9959304377436637, | |
| "num_tokens": 7027412.0, | |
| "step": 1570 | |
| }, | |
| { | |
| "entropy": 2.1080401957035066, | |
| "epoch": 1.9627329192546585, | |
| "grad_norm": 0.05407049506902695, | |
| "learning_rate": 1.3871396918787812e-05, | |
| "loss": 0.016931670904159545, | |
| "mean_token_accuracy": 0.9919893622398377, | |
| "num_tokens": 7074053.0, | |
| "step": 1580 | |
| }, | |
| { | |
| "entropy": 2.0816223949193953, | |
| "epoch": 1.9751552795031055, | |
| "grad_norm": 0.11757466942071915, | |
| "learning_rate": 1.3797076300667345e-05, | |
| "loss": 0.02696256935596466, | |
| "mean_token_accuracy": 0.9966979950666428, | |
| "num_tokens": 7119277.0, | |
| "step": 1590 | |
| }, | |
| { | |
| "entropy": 2.0723426222801207, | |
| "epoch": 1.9875776397515528, | |
| "grad_norm": 0.9365509748458862, | |
| "learning_rate": 1.3722509800336838e-05, | |
| "loss": 0.012552569806575774, | |
| "mean_token_accuracy": 0.9961967542767525, | |
| "num_tokens": 7168606.0, | |
| "step": 1600 | |
| }, | |
| { | |
| "entropy": 2.086591383814812, | |
| "epoch": 2.0, | |
| "grad_norm": 0.20105956494808197, | |
| "learning_rate": 1.3647702246399787e-05, | |
| "loss": 0.02122708112001419, | |
| "mean_token_accuracy": 0.9936253562569618, | |
| "num_tokens": 7207712.0, | |
| "step": 1610 | |
| }, | |
| { | |
| "entropy": 2.0814583867788317, | |
| "epoch": 2.012422360248447, | |
| "grad_norm": 3.1069884300231934, | |
| "learning_rate": 1.3572658483069275e-05, | |
| "loss": 0.023302927613258362, | |
| "mean_token_accuracy": 0.9970308855175972, | |
| "num_tokens": 7254589.0, | |
| "step": 1620 | |
| }, | |
| { | |
| "entropy": 2.125543528795242, | |
| "epoch": 2.0248447204968945, | |
| "grad_norm": 0.14501716196537018, | |
| "learning_rate": 1.3497383369854277e-05, | |
| "loss": 0.02721119225025177, | |
| "mean_token_accuracy": 0.9959090918302536, | |
| "num_tokens": 7295210.0, | |
| "step": 1630 | |
| }, | |
| { | |
| "entropy": 2.0380464106798173, | |
| "epoch": 2.0372670807453415, | |
| "grad_norm": 0.07213692367076874, | |
| "learning_rate": 1.3421881781244995e-05, | |
| "loss": 0.0014440644532442092, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 7343229.0, | |
| "step": 1640 | |
| }, | |
| { | |
| "entropy": 2.0552190840244293, | |
| "epoch": 2.049689440993789, | |
| "grad_norm": 0.29290318489074707, | |
| "learning_rate": 1.3346158606397182e-05, | |
| "loss": 0.024383768439292908, | |
| "mean_token_accuracy": 0.9936682999134063, | |
| "num_tokens": 7388308.0, | |
| "step": 1650 | |
| }, | |
| { | |
| "entropy": 1.9938734024763107, | |
| "epoch": 2.062111801242236, | |
| "grad_norm": 0.05942467227578163, | |
| "learning_rate": 1.327021874881557e-05, | |
| "loss": 0.0024633878841996194, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 7439948.0, | |
| "step": 1660 | |
| }, | |
| { | |
| "entropy": 2.086641189455986, | |
| "epoch": 2.0745341614906834, | |
| "grad_norm": 1.3043140172958374, | |
| "learning_rate": 1.3194067126036317e-05, | |
| "loss": 0.02244780957698822, | |
| "mean_token_accuracy": 0.9969155848026275, | |
| "num_tokens": 7486497.0, | |
| "step": 1670 | |
| }, | |
| { | |
| "entropy": 2.07209207713604, | |
| "epoch": 2.0869565217391304, | |
| "grad_norm": 0.6853761672973633, | |
| "learning_rate": 1.3117708669308577e-05, | |
| "loss": 0.013260528445243835, | |
| "mean_token_accuracy": 0.9945779204368591, | |
| "num_tokens": 7527807.0, | |
| "step": 1680 | |
| }, | |
| { | |
| "entropy": 2.0046075344085694, | |
| "epoch": 2.099378881987578, | |
| "grad_norm": 0.18696783483028412, | |
| "learning_rate": 1.3041148323275182e-05, | |
| "loss": 0.0024597344920039175, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 7583037.0, | |
| "step": 1690 | |
| }, | |
| { | |
| "entropy": 2.011264589428902, | |
| "epoch": 2.111801242236025, | |
| "grad_norm": 3.760758399963379, | |
| "learning_rate": 1.2964391045652431e-05, | |
| "loss": 0.024358910322189332, | |
| "mean_token_accuracy": 0.9940446645021439, | |
| "num_tokens": 7627313.0, | |
| "step": 1700 | |
| }, | |
| { | |
| "entropy": 2.1516319900751113, | |
| "epoch": 2.124223602484472, | |
| "grad_norm": 4.213773250579834, | |
| "learning_rate": 1.2887441806909071e-05, | |
| "loss": 0.008242494612932205, | |
| "mean_token_accuracy": 0.9970352560281753, | |
| "num_tokens": 7665191.0, | |
| "step": 1710 | |
| }, | |
| { | |
| "entropy": 2.134421792626381, | |
| "epoch": 2.1366459627329193, | |
| "grad_norm": 0.34656691551208496, | |
| "learning_rate": 1.281030558994441e-05, | |
| "loss": 0.003566844016313553, | |
| "mean_token_accuracy": 0.9993055552244187, | |
| "num_tokens": 7704708.0, | |
| "step": 1720 | |
| }, | |
| { | |
| "entropy": 2.086806279420853, | |
| "epoch": 2.1490683229813663, | |
| "grad_norm": 0.5496445298194885, | |
| "learning_rate": 1.2732987389765659e-05, | |
| "loss": 0.011695029586553574, | |
| "mean_token_accuracy": 0.9959415584802628, | |
| "num_tokens": 7750499.0, | |
| "step": 1730 | |
| }, | |
| { | |
| "entropy": 2.025625595450401, | |
| "epoch": 2.1614906832298137, | |
| "grad_norm": 4.21989631652832, | |
| "learning_rate": 1.2655492213164468e-05, | |
| "loss": 0.00867307037115097, | |
| "mean_token_accuracy": 0.9970328286290169, | |
| "num_tokens": 7797939.0, | |
| "step": 1740 | |
| }, | |
| { | |
| "entropy": 2.0385482728481295, | |
| "epoch": 2.1739130434782608, | |
| "grad_norm": 0.4632386565208435, | |
| "learning_rate": 1.2577825078392727e-05, | |
| "loss": 0.02321777492761612, | |
| "mean_token_accuracy": 0.992535850405693, | |
| "num_tokens": 7849330.0, | |
| "step": 1750 | |
| }, | |
| { | |
| "entropy": 1.9963646829128265, | |
| "epoch": 2.186335403726708, | |
| "grad_norm": 0.42986103892326355, | |
| "learning_rate": 1.249999101483758e-05, | |
| "loss": 0.005663960799574852, | |
| "mean_token_accuracy": 0.997916667163372, | |
| "num_tokens": 7896007.0, | |
| "step": 1760 | |
| }, | |
| { | |
| "entropy": 2.06232088804245, | |
| "epoch": 2.198757763975155, | |
| "grad_norm": 1.872363567352295, | |
| "learning_rate": 1.2421995062695758e-05, | |
| "loss": 0.004401819780468941, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 7940343.0, | |
| "step": 1770 | |
| }, | |
| { | |
| "entropy": 2.102313169836998, | |
| "epoch": 2.2111801242236027, | |
| "grad_norm": 0.025104807689785957, | |
| "learning_rate": 1.2343842272647202e-05, | |
| "loss": 0.005491552874445915, | |
| "mean_token_accuracy": 0.9980357140302658, | |
| "num_tokens": 7986234.0, | |
| "step": 1780 | |
| }, | |
| { | |
| "entropy": 2.112947568297386, | |
| "epoch": 2.2236024844720497, | |
| "grad_norm": 2.1959307193756104, | |
| "learning_rate": 1.2265537705527983e-05, | |
| "loss": 0.026379427313804625, | |
| "mean_token_accuracy": 0.9976111099123954, | |
| "num_tokens": 8026988.0, | |
| "step": 1790 | |
| }, | |
| { | |
| "entropy": 2.0979381293058394, | |
| "epoch": 2.2360248447204967, | |
| "grad_norm": 1.1758487224578857, | |
| "learning_rate": 1.2187086432002614e-05, | |
| "loss": 0.03560973107814789, | |
| "mean_token_accuracy": 0.9908891677856445, | |
| "num_tokens": 8066827.0, | |
| "step": 1800 | |
| }, | |
| { | |
| "entropy": 2.054467257857323, | |
| "epoch": 2.248447204968944, | |
| "grad_norm": 2.9439423084259033, | |
| "learning_rate": 1.2108493532235665e-05, | |
| "loss": 0.011456061899662019, | |
| "mean_token_accuracy": 0.9971509978175164, | |
| "num_tokens": 8111916.0, | |
| "step": 1810 | |
| }, | |
| { | |
| "entropy": 2.1217318147420885, | |
| "epoch": 2.260869565217391, | |
| "grad_norm": 0.04024887830018997, | |
| "learning_rate": 1.2029764095562817e-05, | |
| "loss": 0.006869207322597504, | |
| "mean_token_accuracy": 0.9985430747270584, | |
| "num_tokens": 8150510.0, | |
| "step": 1820 | |
| }, | |
| { | |
| "entropy": 2.039259508252144, | |
| "epoch": 2.2732919254658386, | |
| "grad_norm": 0.028114071115851402, | |
| "learning_rate": 1.1950903220161286e-05, | |
| "loss": 0.012260539829730988, | |
| "mean_token_accuracy": 0.996547618508339, | |
| "num_tokens": 8201549.0, | |
| "step": 1830 | |
| }, | |
| { | |
| "entropy": 2.029066079854965, | |
| "epoch": 2.2857142857142856, | |
| "grad_norm": 0.17401359975337982, | |
| "learning_rate": 1.1871916012719686e-05, | |
| "loss": 0.005470449849963188, | |
| "mean_token_accuracy": 0.9954545453190804, | |
| "num_tokens": 8246986.0, | |
| "step": 1840 | |
| }, | |
| { | |
| "entropy": 2.0671174854040144, | |
| "epoch": 2.298136645962733, | |
| "grad_norm": 0.01771964691579342, | |
| "learning_rate": 1.1792807588107358e-05, | |
| "loss": 0.008678821474313736, | |
| "mean_token_accuracy": 0.9980823859572411, | |
| "num_tokens": 8293655.0, | |
| "step": 1850 | |
| }, | |
| { | |
| "entropy": 2.044488273561001, | |
| "epoch": 2.31055900621118, | |
| "grad_norm": 0.19449250400066376, | |
| "learning_rate": 1.1713583069043134e-05, | |
| "loss": 0.00978265181183815, | |
| "mean_token_accuracy": 0.9980962634086609, | |
| "num_tokens": 8340795.0, | |
| "step": 1860 | |
| }, | |
| { | |
| "entropy": 2.060883978009224, | |
| "epoch": 2.3229813664596275, | |
| "grad_norm": 0.533935010433197, | |
| "learning_rate": 1.1634247585763617e-05, | |
| "loss": 0.020505291223526, | |
| "mean_token_accuracy": 0.996217104792595, | |
| "num_tokens": 8381916.0, | |
| "step": 1870 | |
| }, | |
| { | |
| "entropy": 2.085965710878372, | |
| "epoch": 2.3354037267080745, | |
| "grad_norm": 0.0371839813888073, | |
| "learning_rate": 1.1554806275690977e-05, | |
| "loss": 0.04419526159763336, | |
| "mean_token_accuracy": 0.9922267541289329, | |
| "num_tokens": 8426453.0, | |
| "step": 1880 | |
| }, | |
| { | |
| "entropy": 2.062951362133026, | |
| "epoch": 2.3478260869565215, | |
| "grad_norm": 0.05953945219516754, | |
| "learning_rate": 1.1475264283100271e-05, | |
| "loss": 0.0023886462673544883, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 8474710.0, | |
| "step": 1890 | |
| }, | |
| { | |
| "entropy": 2.0459433823823927, | |
| "epoch": 2.360248447204969, | |
| "grad_norm": 2.6267354488372803, | |
| "learning_rate": 1.1395626758786311e-05, | |
| "loss": 0.0284033864736557, | |
| "mean_token_accuracy": 0.9925563052296639, | |
| "num_tokens": 8523232.0, | |
| "step": 1900 | |
| }, | |
| { | |
| "entropy": 2.0337260574102403, | |
| "epoch": 2.372670807453416, | |
| "grad_norm": 0.008924540132284164, | |
| "learning_rate": 1.131589885973014e-05, | |
| "loss": 0.02596815228462219, | |
| "mean_token_accuracy": 0.9954166665673256, | |
| "num_tokens": 8567783.0, | |
| "step": 1910 | |
| }, | |
| { | |
| "entropy": 2.083550325036049, | |
| "epoch": 2.3850931677018634, | |
| "grad_norm": 3.9523518085479736, | |
| "learning_rate": 1.1236085748765065e-05, | |
| "loss": 0.021181216835975646, | |
| "mean_token_accuracy": 0.9891853407025337, | |
| "num_tokens": 8609451.0, | |
| "step": 1920 | |
| }, | |
| { | |
| "entropy": 2.1075416803359985, | |
| "epoch": 2.3975155279503104, | |
| "grad_norm": 5.226478576660156, | |
| "learning_rate": 1.1156192594242359e-05, | |
| "loss": 0.029014191031455992, | |
| "mean_token_accuracy": 0.9930989995598793, | |
| "num_tokens": 8650617.0, | |
| "step": 1930 | |
| }, | |
| { | |
| "entropy": 2.074365347623825, | |
| "epoch": 2.409937888198758, | |
| "grad_norm": 0.37940314412117004, | |
| "learning_rate": 1.1076224569696566e-05, | |
| "loss": 0.008748483657836915, | |
| "mean_token_accuracy": 0.9977179482579231, | |
| "num_tokens": 8693151.0, | |
| "step": 1940 | |
| }, | |
| { | |
| "entropy": 2.066782546043396, | |
| "epoch": 2.422360248447205, | |
| "grad_norm": 1.8503516912460327, | |
| "learning_rate": 1.0996186853510483e-05, | |
| "loss": 0.02327302247285843, | |
| "mean_token_accuracy": 0.995456175506115, | |
| "num_tokens": 8736089.0, | |
| "step": 1950 | |
| }, | |
| { | |
| "entropy": 2.0815196603536608, | |
| "epoch": 2.4347826086956523, | |
| "grad_norm": 0.10152150690555573, | |
| "learning_rate": 1.091608462857984e-05, | |
| "loss": 0.01696925759315491, | |
| "mean_token_accuracy": 0.9941277459263802, | |
| "num_tokens": 8779773.0, | |
| "step": 1960 | |
| }, | |
| { | |
| "entropy": 2.0931368678808213, | |
| "epoch": 2.4472049689440993, | |
| "grad_norm": 0.5757278800010681, | |
| "learning_rate": 1.0835923081977673e-05, | |
| "loss": 0.008439820259809494, | |
| "mean_token_accuracy": 0.9977225676178932, | |
| "num_tokens": 8824281.0, | |
| "step": 1970 | |
| }, | |
| { | |
| "entropy": 2.092051011323929, | |
| "epoch": 2.4596273291925463, | |
| "grad_norm": 2.9547672271728516, | |
| "learning_rate": 1.0755707404618432e-05, | |
| "loss": 0.014160393178462983, | |
| "mean_token_accuracy": 0.9984834551811218, | |
| "num_tokens": 8871263.0, | |
| "step": 1980 | |
| }, | |
| { | |
| "entropy": 2.1631635636091233, | |
| "epoch": 2.472049689440994, | |
| "grad_norm": 0.1473511904478073, | |
| "learning_rate": 1.0675442790921845e-05, | |
| "loss": 0.004312780871987343, | |
| "mean_token_accuracy": 0.9966666668653488, | |
| "num_tokens": 8912516.0, | |
| "step": 1990 | |
| }, | |
| { | |
| "entropy": 2.0735503882169724, | |
| "epoch": 2.4844720496894412, | |
| "grad_norm": 0.07361020892858505, | |
| "learning_rate": 1.0595134438476535e-05, | |
| "loss": 0.009844847768545151, | |
| "mean_token_accuracy": 0.9948893085122108, | |
| "num_tokens": 8957449.0, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 2.4844720496894412, | |
| "eval_entropy": 1.9350422568455758, | |
| "eval_loss": 0.6755263209342957, | |
| "eval_mean_token_accuracy": 0.900690189349614, | |
| "eval_num_tokens": 8957449.0, | |
| "eval_runtime": 1016.7085, | |
| "eval_samples_per_second": 7.525, | |
| "eval_steps_per_second": 0.941, | |
| "step": 2000 | |
| }, | |
| { | |
| "entropy": 1.9889907732605934, | |
| "epoch": 2.4968944099378882, | |
| "grad_norm": 0.042838554829359055, | |
| "learning_rate": 1.0514787547703466e-05, | |
| "loss": 0.003820537030696869, | |
| "mean_token_accuracy": 0.9974747464060784, | |
| "num_tokens": 9004148.0, | |
| "step": 2010 | |
| }, | |
| { | |
| "entropy": 1.994002103805542, | |
| "epoch": 2.5093167701863353, | |
| "grad_norm": 0.008305537514388561, | |
| "learning_rate": 1.0434407321519174e-05, | |
| "loss": 0.00935748741030693, | |
| "mean_token_accuracy": 0.9960200980305671, | |
| "num_tokens": 9052196.0, | |
| "step": 2020 | |
| }, | |
| { | |
| "entropy": 2.0162607550621034, | |
| "epoch": 2.5217391304347827, | |
| "grad_norm": 1.709023118019104, | |
| "learning_rate": 1.0353998964998852e-05, | |
| "loss": 0.01086588203907013, | |
| "mean_token_accuracy": 0.9958574876189232, | |
| "num_tokens": 9095641.0, | |
| "step": 2030 | |
| }, | |
| { | |
| "entropy": 2.0208642780780792, | |
| "epoch": 2.5341614906832297, | |
| "grad_norm": 1.5418806076049805, | |
| "learning_rate": 1.027356768503929e-05, | |
| "loss": 0.0025530509650707246, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 9142325.0, | |
| "step": 2040 | |
| }, | |
| { | |
| "entropy": 1.988822239637375, | |
| "epoch": 2.546583850931677, | |
| "grad_norm": 0.02914745733141899, | |
| "learning_rate": 1.0193118690021699e-05, | |
| "loss": 0.01600893437862396, | |
| "mean_token_accuracy": 0.9974712640047073, | |
| "num_tokens": 9187635.0, | |
| "step": 2050 | |
| }, | |
| { | |
| "entropy": 2.1130143284797667, | |
| "epoch": 2.559006211180124, | |
| "grad_norm": 0.18256570398807526, | |
| "learning_rate": 1.0112657189474453e-05, | |
| "loss": 0.005916472524404526, | |
| "mean_token_accuracy": 0.9978422611951828, | |
| "num_tokens": 9230956.0, | |
| "step": 2060 | |
| }, | |
| { | |
| "entropy": 2.0859414279460906, | |
| "epoch": 2.571428571428571, | |
| "grad_norm": 0.028967536985874176, | |
| "learning_rate": 1.003218839373571e-05, | |
| "loss": 0.013482299447059632, | |
| "mean_token_accuracy": 0.9957247704267502, | |
| "num_tokens": 9272039.0, | |
| "step": 2070 | |
| }, | |
| { | |
| "entropy": 2.018462461233139, | |
| "epoch": 2.5838509316770186, | |
| "grad_norm": 0.3704102337360382, | |
| "learning_rate": 9.95171751361605e-06, | |
| "loss": 0.01167006641626358, | |
| "mean_token_accuracy": 0.9949074074625969, | |
| "num_tokens": 9316072.0, | |
| "step": 2080 | |
| }, | |
| { | |
| "entropy": 2.115574726462364, | |
| "epoch": 2.596273291925466, | |
| "grad_norm": 0.4194943904876709, | |
| "learning_rate": 9.87124976006102e-06, | |
| "loss": 0.0006253823637962341, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 9354792.0, | |
| "step": 2090 | |
| }, | |
| { | |
| "entropy": 2.0909915775060655, | |
| "epoch": 2.608695652173913, | |
| "grad_norm": 0.0066429125145077705, | |
| "learning_rate": 9.790790343813704e-06, | |
| "loss": 0.003978141024708748, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 9396911.0, | |
| "step": 2100 | |
| }, | |
| { | |
| "entropy": 2.0067518442869186, | |
| "epoch": 2.62111801242236, | |
| "grad_norm": 0.008789177983999252, | |
| "learning_rate": 9.710344475077305e-06, | |
| "loss": 0.01789900064468384, | |
| "mean_token_accuracy": 0.9949579834938049, | |
| "num_tokens": 9442756.0, | |
| "step": 2110 | |
| }, | |
| { | |
| "entropy": 2.0730466544628143, | |
| "epoch": 2.6335403726708075, | |
| "grad_norm": 1.8757554292678833, | |
| "learning_rate": 9.629917363177737e-06, | |
| "loss": 0.005894383788108826, | |
| "mean_token_accuracy": 0.9960317462682724, | |
| "num_tokens": 9488065.0, | |
| "step": 2120 | |
| }, | |
| { | |
| "entropy": 2.007842016220093, | |
| "epoch": 2.6459627329192545, | |
| "grad_norm": 3.2601473331451416, | |
| "learning_rate": 9.549514216226312e-06, | |
| "loss": 0.009530902653932572, | |
| "mean_token_accuracy": 0.994273892045021, | |
| "num_tokens": 9537549.0, | |
| "step": 2130 | |
| }, | |
| { | |
| "entropy": 2.005715015530586, | |
| "epoch": 2.658385093167702, | |
| "grad_norm": 0.08396615087985992, | |
| "learning_rate": 9.469140240782478e-06, | |
| "loss": 0.015502755343914033, | |
| "mean_token_accuracy": 0.995985135436058, | |
| "num_tokens": 9583324.0, | |
| "step": 2140 | |
| }, | |
| { | |
| "entropy": 2.0230127543210985, | |
| "epoch": 2.670807453416149, | |
| "grad_norm": 0.5364155173301697, | |
| "learning_rate": 9.388800641516644e-06, | |
| "loss": 0.011524485051631927, | |
| "mean_token_accuracy": 0.996875, | |
| "num_tokens": 9631667.0, | |
| "step": 2150 | |
| }, | |
| { | |
| "entropy": 2.0623193353414537, | |
| "epoch": 2.683229813664596, | |
| "grad_norm": 0.01238600630313158, | |
| "learning_rate": 9.308500620873188e-06, | |
| "loss": 0.005700193718075753, | |
| "mean_token_accuracy": 0.999074074625969, | |
| "num_tokens": 9675409.0, | |
| "step": 2160 | |
| }, | |
| { | |
| "entropy": 2.082617163658142, | |
| "epoch": 2.6956521739130435, | |
| "grad_norm": 0.019543716683983803, | |
| "learning_rate": 9.228245378733537e-06, | |
| "loss": 0.0012947741895914077, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 9715733.0, | |
| "step": 2170 | |
| }, | |
| { | |
| "entropy": 2.0438971281051637, | |
| "epoch": 2.708074534161491, | |
| "grad_norm": 0.23991966247558594, | |
| "learning_rate": 9.14804011207946e-06, | |
| "loss": 0.019262537360191345, | |
| "mean_token_accuracy": 0.9976934522390366, | |
| "num_tokens": 9758850.0, | |
| "step": 2180 | |
| }, | |
| { | |
| "entropy": 2.0186645179986953, | |
| "epoch": 2.720496894409938, | |
| "grad_norm": 0.11839921772480011, | |
| "learning_rate": 9.067890014656532e-06, | |
| "loss": 0.0051767569035291675, | |
| "mean_token_accuracy": 0.9959722220897674, | |
| "num_tokens": 9802740.0, | |
| "step": 2190 | |
| }, | |
| { | |
| "entropy": 2.072070962190628, | |
| "epoch": 2.732919254658385, | |
| "grad_norm": 0.22388368844985962, | |
| "learning_rate": 8.987800276637797e-06, | |
| "loss": 0.001911316066980362, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 9842183.0, | |
| "step": 2200 | |
| }, | |
| { | |
| "entropy": 2.036952206492424, | |
| "epoch": 2.7453416149068324, | |
| "grad_norm": 0.08417179435491562, | |
| "learning_rate": 8.907776084287694e-06, | |
| "loss": 0.00783902257680893, | |
| "mean_token_accuracy": 0.9991071432828903, | |
| "num_tokens": 9884991.0, | |
| "step": 2210 | |
| }, | |
| { | |
| "entropy": 2.0813712805509565, | |
| "epoch": 2.7577639751552794, | |
| "grad_norm": 0.24930235743522644, | |
| "learning_rate": 8.82782261962621e-06, | |
| "loss": 0.006542463600635528, | |
| "mean_token_accuracy": 0.996547618508339, | |
| "num_tokens": 9931116.0, | |
| "step": 2220 | |
| }, | |
| { | |
| "entropy": 2.0320400312542914, | |
| "epoch": 2.770186335403727, | |
| "grad_norm": 0.013318363577127457, | |
| "learning_rate": 8.747945060093314e-06, | |
| "loss": 0.032293641567230226, | |
| "mean_token_accuracy": 0.9961111098527908, | |
| "num_tokens": 9980491.0, | |
| "step": 2230 | |
| }, | |
| { | |
| "entropy": 2.023380008339882, | |
| "epoch": 2.782608695652174, | |
| "grad_norm": 0.011369063518941402, | |
| "learning_rate": 8.668148578213676e-06, | |
| "loss": 0.00727204903960228, | |
| "mean_token_accuracy": 0.9980769231915474, | |
| "num_tokens": 10024209.0, | |
| "step": 2240 | |
| }, | |
| { | |
| "entropy": 2.031138223409653, | |
| "epoch": 2.795031055900621, | |
| "grad_norm": 0.004001646768301725, | |
| "learning_rate": 8.58843834126174e-06, | |
| "loss": 0.003158881887793541, | |
| "mean_token_accuracy": 0.9983333334326744, | |
| "num_tokens": 10071568.0, | |
| "step": 2250 | |
| }, | |
| { | |
| "entropy": 2.1424681723117827, | |
| "epoch": 2.8074534161490683, | |
| "grad_norm": 0.030468905344605446, | |
| "learning_rate": 8.508819510927102e-06, | |
| "loss": 0.015948720276355743, | |
| "mean_token_accuracy": 0.9942139357328414, | |
| "num_tokens": 10114689.0, | |
| "step": 2260 | |
| }, | |
| { | |
| "entropy": 2.0369500696659086, | |
| "epoch": 2.8198757763975157, | |
| "grad_norm": 2.443307638168335, | |
| "learning_rate": 8.429297242980255e-06, | |
| "loss": 0.011675138771533967, | |
| "mean_token_accuracy": 0.9984375, | |
| "num_tokens": 10160564.0, | |
| "step": 2270 | |
| }, | |
| { | |
| "entropy": 2.0784898310899735, | |
| "epoch": 2.8322981366459627, | |
| "grad_norm": 0.014572578482329845, | |
| "learning_rate": 8.349876686938735e-06, | |
| "loss": 0.001237300131469965, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 10202481.0, | |
| "step": 2280 | |
| }, | |
| { | |
| "entropy": 2.0724748879671098, | |
| "epoch": 2.8447204968944098, | |
| "grad_norm": 0.029409846290946007, | |
| "learning_rate": 8.270562985733652e-06, | |
| "loss": 0.04003585875034332, | |
| "mean_token_accuracy": 0.9918279573321342, | |
| "num_tokens": 10250012.0, | |
| "step": 2290 | |
| }, | |
| { | |
| "entropy": 2.0165867626667024, | |
| "epoch": 2.857142857142857, | |
| "grad_norm": 0.36708053946495056, | |
| "learning_rate": 8.191361275376665e-06, | |
| "loss": 0.02690470814704895, | |
| "mean_token_accuracy": 0.9901388883590698, | |
| "num_tokens": 10298016.0, | |
| "step": 2300 | |
| }, | |
| { | |
| "entropy": 2.0692808449268343, | |
| "epoch": 2.869565217391304, | |
| "grad_norm": 0.198243647813797, | |
| "learning_rate": 8.112276684627385e-06, | |
| "loss": 0.0325189471244812, | |
| "mean_token_accuracy": 0.9981678783893585, | |
| "num_tokens": 10340662.0, | |
| "step": 2310 | |
| }, | |
| { | |
| "entropy": 2.0979644536972044, | |
| "epoch": 2.8819875776397517, | |
| "grad_norm": 0.03836897015571594, | |
| "learning_rate": 8.033314334661269e-06, | |
| "loss": 0.002577725984156132, | |
| "mean_token_accuracy": 0.9991379305720329, | |
| "num_tokens": 10381673.0, | |
| "step": 2320 | |
| }, | |
| { | |
| "entropy": 2.0282706737518312, | |
| "epoch": 2.8944099378881987, | |
| "grad_norm": 0.22129732370376587, | |
| "learning_rate": 7.954479338737995e-06, | |
| "loss": 0.000719859404489398, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 10426947.0, | |
| "step": 2330 | |
| }, | |
| { | |
| "entropy": 2.023343104124069, | |
| "epoch": 2.906832298136646, | |
| "grad_norm": 0.00921141728758812, | |
| "learning_rate": 7.875776801870326e-06, | |
| "loss": 0.005170207470655441, | |
| "mean_token_accuracy": 0.9991935476660728, | |
| "num_tokens": 10473441.0, | |
| "step": 2340 | |
| }, | |
| { | |
| "entropy": 2.061341863870621, | |
| "epoch": 2.919254658385093, | |
| "grad_norm": 0.01563173718750477, | |
| "learning_rate": 7.797211820493573e-06, | |
| "loss": 0.004035498574376106, | |
| "mean_token_accuracy": 0.999074074625969, | |
| "num_tokens": 10516464.0, | |
| "step": 2350 | |
| }, | |
| { | |
| "entropy": 2.0794942557811735, | |
| "epoch": 2.9316770186335406, | |
| "grad_norm": 0.9282295107841492, | |
| "learning_rate": 7.718789482135534e-06, | |
| "loss": 0.0026351150125265123, | |
| "mean_token_accuracy": 0.9982142850756646, | |
| "num_tokens": 10557903.0, | |
| "step": 2360 | |
| }, | |
| { | |
| "entropy": 2.0855711489915847, | |
| "epoch": 2.9440993788819876, | |
| "grad_norm": 0.0810675099492073, | |
| "learning_rate": 7.640514865087078e-06, | |
| "loss": 0.01579228788614273, | |
| "mean_token_accuracy": 0.9981518805027008, | |
| "num_tokens": 10602244.0, | |
| "step": 2370 | |
| }, | |
| { | |
| "entropy": 2.053683337569237, | |
| "epoch": 2.9565217391304346, | |
| "grad_norm": 0.029188042506575584, | |
| "learning_rate": 7.562393038073261e-06, | |
| "loss": 0.008064876496791839, | |
| "mean_token_accuracy": 0.9988095238804817, | |
| "num_tokens": 10649252.0, | |
| "step": 2380 | |
| }, | |
| { | |
| "entropy": 2.056939309835434, | |
| "epoch": 2.968944099378882, | |
| "grad_norm": 0.6217600703239441, | |
| "learning_rate": 7.484429059925136e-06, | |
| "loss": 0.015889519453048707, | |
| "mean_token_accuracy": 0.9950148805975914, | |
| "num_tokens": 10691331.0, | |
| "step": 2390 | |
| }, | |
| { | |
| "entropy": 2.070336791872978, | |
| "epoch": 2.981366459627329, | |
| "grad_norm": 0.006842709146440029, | |
| "learning_rate": 7.4066279792521426e-06, | |
| "loss": 0.02249635010957718, | |
| "mean_token_accuracy": 0.9986013993620872, | |
| "num_tokens": 10740010.0, | |
| "step": 2400 | |
| }, | |
| { | |
| "entropy": 2.008762276172638, | |
| "epoch": 2.9937888198757765, | |
| "grad_norm": 0.22063793241977692, | |
| "learning_rate": 7.328994834115181e-06, | |
| "loss": 0.0008781224489212037, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 10791873.0, | |
| "step": 2410 | |
| }, | |
| { | |
| "entropy": 2.039086303114891, | |
| "epoch": 3.0062111801242235, | |
| "grad_norm": 0.1856115162372589, | |
| "learning_rate": 7.251534651700385e-06, | |
| "loss": 0.0043528910726308824, | |
| "mean_token_accuracy": 0.998863635957241, | |
| "num_tokens": 10833476.0, | |
| "step": 2420 | |
| }, | |
| { | |
| "entropy": 2.07568744122982, | |
| "epoch": 3.018633540372671, | |
| "grad_norm": 0.6048936247825623, | |
| "learning_rate": 7.174252447993556e-06, | |
| "loss": 0.0008312862366437912, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 10873478.0, | |
| "step": 2430 | |
| }, | |
| { | |
| "entropy": 2.0069006264209746, | |
| "epoch": 3.031055900621118, | |
| "grad_norm": 0.08963524550199509, | |
| "learning_rate": 7.097153227455379e-06, | |
| "loss": 0.002857883274555206, | |
| "mean_token_accuracy": 0.9964460790157318, | |
| "num_tokens": 10922316.0, | |
| "step": 2440 | |
| }, | |
| { | |
| "entropy": 2.0665270179510116, | |
| "epoch": 3.0434782608695654, | |
| "grad_norm": 0.07428019493818283, | |
| "learning_rate": 7.020241982697331e-06, | |
| "loss": 0.0018186111003160477, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 10970389.0, | |
| "step": 2450 | |
| }, | |
| { | |
| "entropy": 2.030388182401657, | |
| "epoch": 3.0559006211180124, | |
| "grad_norm": 0.049276646226644516, | |
| "learning_rate": 6.9435236941584005e-06, | |
| "loss": 0.003922026976943016, | |
| "mean_token_accuracy": 0.998863635957241, | |
| "num_tokens": 11020380.0, | |
| "step": 2460 | |
| }, | |
| { | |
| "entropy": 2.117271861433983, | |
| "epoch": 3.0683229813664594, | |
| "grad_norm": 0.027438754215836525, | |
| "learning_rate": 6.867003329782566e-06, | |
| "loss": 0.00299711711704731, | |
| "mean_token_accuracy": 0.9977272734045982, | |
| "num_tokens": 11063998.0, | |
| "step": 2470 | |
| }, | |
| { | |
| "entropy": 2.1177933365106583, | |
| "epoch": 3.080745341614907, | |
| "grad_norm": 0.22324837744235992, | |
| "learning_rate": 6.7906858446970894e-06, | |
| "loss": 0.0014256440103054047, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 11107505.0, | |
| "step": 2480 | |
| }, | |
| { | |
| "entropy": 2.1208660274744036, | |
| "epoch": 3.093167701863354, | |
| "grad_norm": 0.13765057921409607, | |
| "learning_rate": 6.714576180891653e-06, | |
| "loss": 0.002962992340326309, | |
| "mean_token_accuracy": 0.9984375, | |
| "num_tokens": 11150906.0, | |
| "step": 2490 | |
| }, | |
| { | |
| "entropy": 2.096135729551315, | |
| "epoch": 3.1055900621118013, | |
| "grad_norm": 0.0484640933573246, | |
| "learning_rate": 6.638679266898334e-06, | |
| "loss": 0.0032801639288663866, | |
| "mean_token_accuracy": 0.9989583328366279, | |
| "num_tokens": 11190221.0, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 3.1055900621118013, | |
| "eval_entropy": 1.9245576005246074, | |
| "eval_loss": 0.7179387211799622, | |
| "eval_mean_token_accuracy": 0.903106996071376, | |
| "eval_num_tokens": 11190221.0, | |
| "eval_runtime": 1015.9223, | |
| "eval_samples_per_second": 7.531, | |
| "eval_steps_per_second": 0.942, | |
| "step": 2500 | |
| }, | |
| { | |
| "entropy": 2.065633365511894, | |
| "epoch": 3.1180124223602483, | |
| "grad_norm": 0.004022596403956413, | |
| "learning_rate": 6.56300001747245e-06, | |
| "loss": 0.011902575939893722, | |
| "mean_token_accuracy": 0.9991935476660728, | |
| "num_tokens": 11233858.0, | |
| "step": 2510 | |
| }, | |
| { | |
| "entropy": 2.0493174642324448, | |
| "epoch": 3.130434782608696, | |
| "grad_norm": 0.004140094853937626, | |
| "learning_rate": 6.48754333327431e-06, | |
| "loss": 0.011013699322938919, | |
| "mean_token_accuracy": 0.9991935476660728, | |
| "num_tokens": 11278738.0, | |
| "step": 2520 | |
| }, | |
| { | |
| "entropy": 2.1025405555963514, | |
| "epoch": 3.142857142857143, | |
| "grad_norm": 0.008452140726149082, | |
| "learning_rate": 6.412314100551854e-06, | |
| "loss": 0.004581971466541291, | |
| "mean_token_accuracy": 0.9978349670767784, | |
| "num_tokens": 11318888.0, | |
| "step": 2530 | |
| }, | |
| { | |
| "entropy": 1.9467100128531456, | |
| "epoch": 3.1552795031055902, | |
| "grad_norm": 0.04429563507437706, | |
| "learning_rate": 6.337317190824257e-06, | |
| "loss": 0.00039558070711791514, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 11369254.0, | |
| "step": 2540 | |
| }, | |
| { | |
| "entropy": 2.0959424555301664, | |
| "epoch": 3.1677018633540373, | |
| "grad_norm": 0.08045872300863266, | |
| "learning_rate": 6.262557460566465e-06, | |
| "loss": 0.014682823419570923, | |
| "mean_token_accuracy": 0.9972435891628265, | |
| "num_tokens": 11409789.0, | |
| "step": 2550 | |
| }, | |
| { | |
| "entropy": 2.1395619392395018, | |
| "epoch": 3.1801242236024843, | |
| "grad_norm": 0.009005514904856682, | |
| "learning_rate": 6.188039750894707e-06, | |
| "loss": 0.0013207459822297096, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 11448078.0, | |
| "step": 2560 | |
| }, | |
| { | |
| "entropy": 1.9897212505340576, | |
| "epoch": 3.1925465838509317, | |
| "grad_norm": 0.06040625274181366, | |
| "learning_rate": 6.113768887252998e-06, | |
| "loss": 0.00110345296561718, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 11495538.0, | |
| "step": 2570 | |
| }, | |
| { | |
| "entropy": 2.042201852798462, | |
| "epoch": 3.2049689440993787, | |
| "grad_norm": 3.705784559249878, | |
| "learning_rate": 6.039749679100688e-06, | |
| "loss": 0.005044905096292495, | |
| "mean_token_accuracy": 0.998863635957241, | |
| "num_tokens": 11541174.0, | |
| "step": 2580 | |
| }, | |
| { | |
| "entropy": 2.0282586336135866, | |
| "epoch": 3.217391304347826, | |
| "grad_norm": 0.07588481903076172, | |
| "learning_rate": 5.965986919601e-06, | |
| "loss": 0.013422471284866334, | |
| "mean_token_accuracy": 0.9941584974527359, | |
| "num_tokens": 11588423.0, | |
| "step": 2590 | |
| }, | |
| { | |
| "entropy": 2.0026851534843444, | |
| "epoch": 3.229813664596273, | |
| "grad_norm": 0.08241789042949677, | |
| "learning_rate": 5.892485385310656e-06, | |
| "loss": 0.0002885764231905341, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 11634579.0, | |
| "step": 2600 | |
| }, | |
| { | |
| "entropy": 2.003785479068756, | |
| "epoch": 3.2422360248447206, | |
| "grad_norm": 0.049002643674612045, | |
| "learning_rate": 5.819249835870567e-06, | |
| "loss": 0.0014354961924254895, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 11680204.0, | |
| "step": 2610 | |
| }, | |
| { | |
| "entropy": 2.040288230776787, | |
| "epoch": 3.2546583850931676, | |
| "grad_norm": 0.01789112761616707, | |
| "learning_rate": 5.746285013697608e-06, | |
| "loss": 0.002602299861609936, | |
| "mean_token_accuracy": 0.999285714328289, | |
| "num_tokens": 11725405.0, | |
| "step": 2620 | |
| }, | |
| { | |
| "entropy": 2.039785459637642, | |
| "epoch": 3.267080745341615, | |
| "grad_norm": 0.004627231974154711, | |
| "learning_rate": 5.6735956436775405e-06, | |
| "loss": 0.0003787399735301733, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 11775017.0, | |
| "step": 2630 | |
| }, | |
| { | |
| "entropy": 2.0185125142335893, | |
| "epoch": 3.279503105590062, | |
| "grad_norm": 0.016168462112545967, | |
| "learning_rate": 5.6011864328590335e-06, | |
| "loss": 0.008351743221282959, | |
| "mean_token_accuracy": 0.9994186043739319, | |
| "num_tokens": 11823310.0, | |
| "step": 2640 | |
| }, | |
| { | |
| "entropy": 2.0066159784793856, | |
| "epoch": 3.291925465838509, | |
| "grad_norm": 0.03235394135117531, | |
| "learning_rate": 5.529062070148859e-06, | |
| "loss": 0.005417406931519509, | |
| "mean_token_accuracy": 0.9986842110753059, | |
| "num_tokens": 11871941.0, | |
| "step": 2650 | |
| }, | |
| { | |
| "entropy": 2.051735845208168, | |
| "epoch": 3.3043478260869565, | |
| "grad_norm": 0.003987879958003759, | |
| "learning_rate": 5.457227226008265e-06, | |
| "loss": 0.0012644742615520953, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 11917677.0, | |
| "step": 2660 | |
| }, | |
| { | |
| "entropy": 2.0791384488344193, | |
| "epoch": 3.3167701863354035, | |
| "grad_norm": 0.013546639122068882, | |
| "learning_rate": 5.385686552150517e-06, | |
| "loss": 0.0003978293854743242, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 11962426.0, | |
| "step": 2670 | |
| }, | |
| { | |
| "entropy": 2.1187647074460982, | |
| "epoch": 3.329192546583851, | |
| "grad_norm": 2.911365509033203, | |
| "learning_rate": 5.3144446812397045e-06, | |
| "loss": 0.0044805873185396194, | |
| "mean_token_accuracy": 0.9989583328366279, | |
| "num_tokens": 12002806.0, | |
| "step": 2680 | |
| }, | |
| { | |
| "entropy": 2.085233438014984, | |
| "epoch": 3.341614906832298, | |
| "grad_norm": 0.021008091047406197, | |
| "learning_rate": 5.243506226590722e-06, | |
| "loss": 0.0006675105541944504, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 12043773.0, | |
| "step": 2690 | |
| }, | |
| { | |
| "entropy": 2.0027647256851195, | |
| "epoch": 3.3540372670807455, | |
| "grad_norm": 0.011667752638459206, | |
| "learning_rate": 5.172875781870552e-06, | |
| "loss": 0.014550222456455231, | |
| "mean_token_accuracy": 0.9954166665673256, | |
| "num_tokens": 12087817.0, | |
| "step": 2700 | |
| }, | |
| { | |
| "entropy": 2.0871587693691254, | |
| "epoch": 3.3664596273291925, | |
| "grad_norm": 0.00429825484752655, | |
| "learning_rate": 5.102557920800772e-06, | |
| "loss": 0.016400189697742464, | |
| "mean_token_accuracy": 0.997826087474823, | |
| "num_tokens": 12130292.0, | |
| "step": 2710 | |
| }, | |
| { | |
| "entropy": 2.058573919534683, | |
| "epoch": 3.37888198757764, | |
| "grad_norm": 0.013374663889408112, | |
| "learning_rate": 5.0325571968614105e-06, | |
| "loss": 0.0003040991257876158, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 12174087.0, | |
| "step": 2720 | |
| }, | |
| { | |
| "entropy": 1.9985705226659776, | |
| "epoch": 3.391304347826087, | |
| "grad_norm": 0.0736985132098198, | |
| "learning_rate": 4.962878142996065e-06, | |
| "loss": 0.0008327001705765724, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 12217953.0, | |
| "step": 2730 | |
| }, | |
| { | |
| "entropy": 2.071951040625572, | |
| "epoch": 3.403726708074534, | |
| "grad_norm": 0.2610735297203064, | |
| "learning_rate": 4.893525271318372e-06, | |
| "loss": 0.001319923996925354, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 12257621.0, | |
| "step": 2740 | |
| }, | |
| { | |
| "entropy": 2.0868619114160536, | |
| "epoch": 3.4161490683229814, | |
| "grad_norm": 0.004669727757573128, | |
| "learning_rate": 4.824503072819828e-06, | |
| "loss": 0.003249622881412506, | |
| "mean_token_accuracy": 0.9991666659712791, | |
| "num_tokens": 12296512.0, | |
| "step": 2750 | |
| }, | |
| { | |
| "entropy": 2.0636314779520033, | |
| "epoch": 3.4285714285714284, | |
| "grad_norm": 0.09974928945302963, | |
| "learning_rate": 4.755816017078956e-06, | |
| "loss": 0.0005484614055603742, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 12341650.0, | |
| "step": 2760 | |
| }, | |
| { | |
| "entropy": 2.1476096123456956, | |
| "epoch": 3.440993788819876, | |
| "grad_norm": 0.0051970030181109905, | |
| "learning_rate": 4.6874685519718945e-06, | |
| "loss": 0.00029311692342162134, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 12382945.0, | |
| "step": 2770 | |
| }, | |
| { | |
| "entropy": 2.146159088611603, | |
| "epoch": 3.453416149068323, | |
| "grad_norm": 0.0212989691644907, | |
| "learning_rate": 4.619465103384363e-06, | |
| "loss": 0.0007739394437521696, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 12417675.0, | |
| "step": 2780 | |
| }, | |
| { | |
| "entropy": 2.021345466375351, | |
| "epoch": 3.4658385093167703, | |
| "grad_norm": 0.01701529510319233, | |
| "learning_rate": 4.55181007492506e-06, | |
| "loss": 0.0006289692129939795, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 12462562.0, | |
| "step": 2790 | |
| }, | |
| { | |
| "entropy": 1.9724286824464798, | |
| "epoch": 3.4782608695652173, | |
| "grad_norm": 0.010893910191953182, | |
| "learning_rate": 4.484507847640511e-06, | |
| "loss": 0.0014305679127573968, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 12517887.0, | |
| "step": 2800 | |
| }, | |
| { | |
| "entropy": 2.0382672011852265, | |
| "epoch": 3.4906832298136647, | |
| "grad_norm": 0.0061012133955955505, | |
| "learning_rate": 4.417562779731355e-06, | |
| "loss": 0.00024020741693675518, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 12563405.0, | |
| "step": 2810 | |
| }, | |
| { | |
| "entropy": 2.004192039370537, | |
| "epoch": 3.5031055900621118, | |
| "grad_norm": 0.00254402169957757, | |
| "learning_rate": 4.3509792062701464e-06, | |
| "loss": 0.0012421167455613613, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 12612757.0, | |
| "step": 2820 | |
| }, | |
| { | |
| "entropy": 2.0766816467046736, | |
| "epoch": 3.5155279503105588, | |
| "grad_norm": 0.01933353766798973, | |
| "learning_rate": 4.284761438920624e-06, | |
| "loss": 0.001632862538099289, | |
| "mean_token_accuracy": 0.998863635957241, | |
| "num_tokens": 12659014.0, | |
| "step": 2830 | |
| }, | |
| { | |
| "entropy": 2.03719719350338, | |
| "epoch": 3.527950310559006, | |
| "grad_norm": 0.16155198216438293, | |
| "learning_rate": 4.218913765658507e-06, | |
| "loss": 0.006846483051776886, | |
| "mean_token_accuracy": 0.996354167163372, | |
| "num_tokens": 12705485.0, | |
| "step": 2840 | |
| }, | |
| { | |
| "entropy": 2.0722499549388886, | |
| "epoch": 3.5403726708074537, | |
| "grad_norm": 0.00480568828061223, | |
| "learning_rate": 4.153440450493823e-06, | |
| "loss": 0.0002258694963529706, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 12749166.0, | |
| "step": 2850 | |
| }, | |
| { | |
| "entropy": 2.076261229813099, | |
| "epoch": 3.5527950310559007, | |
| "grad_norm": 0.0019834646955132484, | |
| "learning_rate": 4.088345733194793e-06, | |
| "loss": 0.005384958907961845, | |
| "mean_token_accuracy": 0.9977272734045982, | |
| "num_tokens": 12791428.0, | |
| "step": 2860 | |
| }, | |
| { | |
| "entropy": 2.0420318722724913, | |
| "epoch": 3.5652173913043477, | |
| "grad_norm": 0.022317076101899147, | |
| "learning_rate": 4.0236338290132795e-06, | |
| "loss": 0.0007763313595205545, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 12836185.0, | |
| "step": 2870 | |
| }, | |
| { | |
| "entropy": 2.111663815379143, | |
| "epoch": 3.577639751552795, | |
| "grad_norm": 0.05490420013666153, | |
| "learning_rate": 3.959308928411828e-06, | |
| "loss": 0.0033809009939432142, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 12876251.0, | |
| "step": 2880 | |
| }, | |
| { | |
| "entropy": 2.06292268037796, | |
| "epoch": 3.590062111801242, | |
| "grad_norm": 0.024032561108469963, | |
| "learning_rate": 3.895375196792308e-06, | |
| "loss": 0.0003204423002898693, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 12921471.0, | |
| "step": 2890 | |
| }, | |
| { | |
| "entropy": 2.058139744400978, | |
| "epoch": 3.6024844720496896, | |
| "grad_norm": 0.08312931656837463, | |
| "learning_rate": 3.83183677422618e-06, | |
| "loss": 0.004134120792150498, | |
| "mean_token_accuracy": 0.9991935476660728, | |
| "num_tokens": 12963024.0, | |
| "step": 2900 | |
| }, | |
| { | |
| "entropy": 2.0561121970415117, | |
| "epoch": 3.6149068322981366, | |
| "grad_norm": 0.007939224131405354, | |
| "learning_rate": 3.768697775186403e-06, | |
| "loss": 0.003024405241012573, | |
| "mean_token_accuracy": 0.99921875, | |
| "num_tokens": 13006957.0, | |
| "step": 2910 | |
| }, | |
| { | |
| "entropy": 1.9855820834636688, | |
| "epoch": 3.6273291925465836, | |
| "grad_norm": 0.04352085292339325, | |
| "learning_rate": 3.705962288281e-06, | |
| "loss": 0.0003980351146310568, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 13062006.0, | |
| "step": 2920 | |
| }, | |
| { | |
| "entropy": 2.038356375694275, | |
| "epoch": 3.639751552795031, | |
| "grad_norm": 1.2225877046585083, | |
| "learning_rate": 3.643634375988293e-06, | |
| "loss": 0.008960984647274017, | |
| "mean_token_accuracy": 0.997916667163372, | |
| "num_tokens": 13105926.0, | |
| "step": 2930 | |
| }, | |
| { | |
| "entropy": 1.966392880678177, | |
| "epoch": 3.6521739130434785, | |
| "grad_norm": 3.6292645931243896, | |
| "learning_rate": 3.5817180743938475e-06, | |
| "loss": 0.02723119258880615, | |
| "mean_token_accuracy": 0.9982826575636864, | |
| "num_tokens": 13155505.0, | |
| "step": 2940 | |
| }, | |
| { | |
| "entropy": 2.0349768072366716, | |
| "epoch": 3.6645962732919255, | |
| "grad_norm": 0.004916434641927481, | |
| "learning_rate": 3.5202173929290873e-06, | |
| "loss": 0.0003408062970265746, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 13200787.0, | |
| "step": 2950 | |
| }, | |
| { | |
| "entropy": 2.0228754550218584, | |
| "epoch": 3.6770186335403725, | |
| "grad_norm": 0.005172870121896267, | |
| "learning_rate": 3.459136314111691e-06, | |
| "loss": 0.007737810164690018, | |
| "mean_token_accuracy": 0.9944444447755814, | |
| "num_tokens": 13250267.0, | |
| "step": 2960 | |
| }, | |
| { | |
| "entropy": 1.975671073794365, | |
| "epoch": 3.68944099378882, | |
| "grad_norm": 0.013639900833368301, | |
| "learning_rate": 3.398478793287682e-06, | |
| "loss": 0.0017875196412205697, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 13291524.0, | |
| "step": 2970 | |
| }, | |
| { | |
| "entropy": 2.1133328646421434, | |
| "epoch": 3.701863354037267, | |
| "grad_norm": 0.16240786015987396, | |
| "learning_rate": 3.3382487583753086e-06, | |
| "loss": 0.0020084600895643235, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 13330874.0, | |
| "step": 2980 | |
| }, | |
| { | |
| "entropy": 2.015983095765114, | |
| "epoch": 3.7142857142857144, | |
| "grad_norm": 0.005457151681184769, | |
| "learning_rate": 3.2784501096106737e-06, | |
| "loss": 0.0006346395704895258, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 13376639.0, | |
| "step": 2990 | |
| }, | |
| { | |
| "entropy": 2.1352883040905, | |
| "epoch": 3.7267080745341614, | |
| "grad_norm": 0.026707326993346214, | |
| "learning_rate": 3.2190867192951893e-06, | |
| "loss": 0.0002277535619214177, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 13416860.0, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 3.7267080745341614, | |
| "eval_entropy": 1.915783873296955, | |
| "eval_loss": 0.7208165526390076, | |
| "eval_mean_token_accuracy": 0.9051754110908309, | |
| "eval_num_tokens": 13416860.0, | |
| "eval_runtime": 1014.7668, | |
| "eval_samples_per_second": 7.54, | |
| "eval_steps_per_second": 0.943, | |
| "step": 3000 | |
| }, | |
| { | |
| "entropy": 2.035184735059738, | |
| "epoch": 3.7391304347826084, | |
| "grad_norm": 0.012916711159050465, | |
| "learning_rate": 3.1601624315448167e-06, | |
| "loss": 0.00808061882853508, | |
| "mean_token_accuracy": 0.9990384608507157, | |
| "num_tokens": 13462523.0, | |
| "step": 3010 | |
| }, | |
| { | |
| "entropy": 2.057391199469566, | |
| "epoch": 3.751552795031056, | |
| "grad_norm": 0.15162841975688934, | |
| "learning_rate": 3.101681062041134e-06, | |
| "loss": 0.00021725615952163934, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 13511406.0, | |
| "step": 3020 | |
| }, | |
| { | |
| "entropy": 1.9883357465267182, | |
| "epoch": 3.7639751552795033, | |
| "grad_norm": 0.015947408974170685, | |
| "learning_rate": 3.043646397784259e-06, | |
| "loss": 0.0025760218501091003, | |
| "mean_token_accuracy": 0.9993243247270585, | |
| "num_tokens": 13557519.0, | |
| "step": 3030 | |
| }, | |
| { | |
| "entropy": 2.048056635260582, | |
| "epoch": 3.7763975155279503, | |
| "grad_norm": 0.03572254627943039, | |
| "learning_rate": 2.9860621968476002e-06, | |
| "loss": 0.005737992003560066, | |
| "mean_token_accuracy": 0.9991071432828903, | |
| "num_tokens": 13603619.0, | |
| "step": 3040 | |
| }, | |
| { | |
| "entropy": 2.0730544537305833, | |
| "epoch": 3.7888198757763973, | |
| "grad_norm": 0.03662121668457985, | |
| "learning_rate": 2.9289321881345257e-06, | |
| "loss": 0.005768216773867607, | |
| "mean_token_accuracy": 0.9980555549263954, | |
| "num_tokens": 13645212.0, | |
| "step": 3050 | |
| }, | |
| { | |
| "entropy": 2.042172911763191, | |
| "epoch": 3.801242236024845, | |
| "grad_norm": 0.0020903616677969694, | |
| "learning_rate": 2.8722600711368777e-06, | |
| "loss": 0.006000512093305588, | |
| "mean_token_accuracy": 0.9989130437374115, | |
| "num_tokens": 13691056.0, | |
| "step": 3060 | |
| }, | |
| { | |
| "entropy": 2.059427934885025, | |
| "epoch": 3.813664596273292, | |
| "grad_norm": 0.002584670437499881, | |
| "learning_rate": 2.816049515695417e-06, | |
| "loss": 0.00038500460796058177, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 13737184.0, | |
| "step": 3070 | |
| }, | |
| { | |
| "entropy": 2.03760521709919, | |
| "epoch": 3.8260869565217392, | |
| "grad_norm": 0.0522318035364151, | |
| "learning_rate": 2.7603041617621783e-06, | |
| "loss": 0.0009485245682299137, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 13783959.0, | |
| "step": 3080 | |
| }, | |
| { | |
| "entropy": 2.054546761512756, | |
| "epoch": 3.8385093167701863, | |
| "grad_norm": 0.009271272458136082, | |
| "learning_rate": 2.705027619164754e-06, | |
| "loss": 0.015048840641975402, | |
| "mean_token_accuracy": 0.9980769231915474, | |
| "num_tokens": 13829252.0, | |
| "step": 3090 | |
| }, | |
| { | |
| "entropy": 2.0164424657821653, | |
| "epoch": 3.8509316770186337, | |
| "grad_norm": 0.059004366397857666, | |
| "learning_rate": 2.6502234673725557e-06, | |
| "loss": 0.003549148514866829, | |
| "mean_token_accuracy": 0.9986111104488373, | |
| "num_tokens": 13877928.0, | |
| "step": 3100 | |
| }, | |
| { | |
| "entropy": 2.0387689799070357, | |
| "epoch": 3.8633540372670807, | |
| "grad_norm": 0.025626162067055702, | |
| "learning_rate": 2.5958952552650098e-06, | |
| "loss": 0.007682383060455322, | |
| "mean_token_accuracy": 0.9977481618523598, | |
| "num_tokens": 13922021.0, | |
| "step": 3110 | |
| }, | |
| { | |
| "entropy": 2.0456499844789504, | |
| "epoch": 3.875776397515528, | |
| "grad_norm": 2.543144702911377, | |
| "learning_rate": 2.542046500901748e-06, | |
| "loss": 0.0031697705388069155, | |
| "mean_token_accuracy": 0.9987499997019768, | |
| "num_tokens": 13962985.0, | |
| "step": 3120 | |
| }, | |
| { | |
| "entropy": 2.001152551174164, | |
| "epoch": 3.888198757763975, | |
| "grad_norm": 0.009251217357814312, | |
| "learning_rate": 2.4886806912948034e-06, | |
| "loss": 0.00028319426346570256, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 14005018.0, | |
| "step": 3130 | |
| }, | |
| { | |
| "entropy": 2.0633739441633225, | |
| "epoch": 3.900621118012422, | |
| "grad_norm": 0.005275467410683632, | |
| "learning_rate": 2.435801282182787e-06, | |
| "loss": 0.000858756247907877, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 14050239.0, | |
| "step": 3140 | |
| }, | |
| { | |
| "entropy": 1.9629602044820786, | |
| "epoch": 3.9130434782608696, | |
| "grad_norm": 0.004018905572593212, | |
| "learning_rate": 2.383411697807131e-06, | |
| "loss": 0.01187501847743988, | |
| "mean_token_accuracy": 0.9989999994635582, | |
| "num_tokens": 14099540.0, | |
| "step": 3150 | |
| }, | |
| { | |
| "entropy": 2.03657703101635, | |
| "epoch": 3.9254658385093166, | |
| "grad_norm": 0.01581091806292534, | |
| "learning_rate": 2.331515330690336e-06, | |
| "loss": 0.0036426626145839693, | |
| "mean_token_accuracy": 0.9983574882149696, | |
| "num_tokens": 14143941.0, | |
| "step": 3160 | |
| }, | |
| { | |
| "entropy": 2.0609166443347933, | |
| "epoch": 3.937888198757764, | |
| "grad_norm": 0.07055187225341797, | |
| "learning_rate": 2.2801155414162933e-06, | |
| "loss": 0.0006878064014017582, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 14183855.0, | |
| "step": 3170 | |
| }, | |
| { | |
| "entropy": 2.039751389622688, | |
| "epoch": 3.950310559006211, | |
| "grad_norm": 0.015817873179912567, | |
| "learning_rate": 2.229215658412658e-06, | |
| "loss": 0.011930423974990844, | |
| "mean_token_accuracy": 0.9987499997019768, | |
| "num_tokens": 14230427.0, | |
| "step": 3180 | |
| }, | |
| { | |
| "entropy": 2.013304165005684, | |
| "epoch": 3.9627329192546585, | |
| "grad_norm": 0.010246982797980309, | |
| "learning_rate": 2.178818977735326e-06, | |
| "loss": 0.0027476778253912927, | |
| "mean_token_accuracy": 0.9993902444839478, | |
| "num_tokens": 14280167.0, | |
| "step": 3190 | |
| }, | |
| { | |
| "entropy": 2.027267241477966, | |
| "epoch": 3.9751552795031055, | |
| "grad_norm": 0.009065949358046055, | |
| "learning_rate": 2.1289287628549904e-06, | |
| "loss": 0.003876122832298279, | |
| "mean_token_accuracy": 0.9989583328366279, | |
| "num_tokens": 14327872.0, | |
| "step": 3200 | |
| }, | |
| { | |
| "entropy": 2.0841051936149597, | |
| "epoch": 3.987577639751553, | |
| "grad_norm": 0.2582933306694031, | |
| "learning_rate": 2.0795482444458115e-06, | |
| "loss": 0.0015949519351124764, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 14374685.0, | |
| "step": 3210 | |
| }, | |
| { | |
| "entropy": 2.077771583199501, | |
| "epoch": 4.0, | |
| "grad_norm": 0.056201014667749405, | |
| "learning_rate": 2.0306806201762175e-06, | |
| "loss": 0.0005105304066091776, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 14415424.0, | |
| "step": 3220 | |
| }, | |
| { | |
| "entropy": 2.032339036464691, | |
| "epoch": 4.012422360248447, | |
| "grad_norm": 0.16235826909542084, | |
| "learning_rate": 1.9823290545018312e-06, | |
| "loss": 0.0008465294726192951, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 14462619.0, | |
| "step": 3230 | |
| }, | |
| { | |
| "entropy": 1.992909598350525, | |
| "epoch": 4.024844720496894, | |
| "grad_norm": 0.0017087548039853573, | |
| "learning_rate": 1.934496678460559e-06, | |
| "loss": 0.0006027131807059049, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 14507986.0, | |
| "step": 3240 | |
| }, | |
| { | |
| "entropy": 2.0650244295597076, | |
| "epoch": 4.037267080745342, | |
| "grad_norm": 0.0353049673140049, | |
| "learning_rate": 1.8871865894698338e-06, | |
| "loss": 0.00022105511743575335, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 14549567.0, | |
| "step": 3250 | |
| }, | |
| { | |
| "entropy": 2.0139154732227325, | |
| "epoch": 4.049689440993789, | |
| "grad_norm": 0.021216459572315216, | |
| "learning_rate": 1.8404018511260447e-06, | |
| "loss": 0.001208197418600321, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 14596321.0, | |
| "step": 3260 | |
| }, | |
| { | |
| "entropy": 2.0900548338890075, | |
| "epoch": 4.062111801242236, | |
| "grad_norm": 0.04834829643368721, | |
| "learning_rate": 1.7941454930061487e-06, | |
| "loss": 0.00025239353999495506, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 14638834.0, | |
| "step": 3270 | |
| }, | |
| { | |
| "entropy": 2.0481355130672454, | |
| "epoch": 4.074534161490683, | |
| "grad_norm": 0.0905168354511261, | |
| "learning_rate": 1.7484205104714824e-06, | |
| "loss": 0.004746239632368088, | |
| "mean_token_accuracy": 0.9990384608507157, | |
| "num_tokens": 14681585.0, | |
| "step": 3280 | |
| }, | |
| { | |
| "entropy": 2.0373184353113176, | |
| "epoch": 4.086956521739131, | |
| "grad_norm": 0.03823855146765709, | |
| "learning_rate": 1.703229864473811e-06, | |
| "loss": 0.00025348488707095386, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 14730043.0, | |
| "step": 3290 | |
| }, | |
| { | |
| "entropy": 2.0669949412345887, | |
| "epoch": 4.099378881987578, | |
| "grad_norm": 0.030003461986780167, | |
| "learning_rate": 1.6585764813635751e-06, | |
| "loss": 0.00018225166713818907, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 14772600.0, | |
| "step": 3300 | |
| }, | |
| { | |
| "entropy": 2.0379785656929017, | |
| "epoch": 4.111801242236025, | |
| "grad_norm": 0.005713196471333504, | |
| "learning_rate": 1.6144632527004033e-06, | |
| "loss": 0.0003649190068244934, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 14819632.0, | |
| "step": 3310 | |
| }, | |
| { | |
| "entropy": 2.0793015539646147, | |
| "epoch": 4.124223602484472, | |
| "grad_norm": 0.022466011345386505, | |
| "learning_rate": 1.5708930350658535e-06, | |
| "loss": 0.0008130665868520736, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 14866352.0, | |
| "step": 3320 | |
| }, | |
| { | |
| "entropy": 2.0861439973115923, | |
| "epoch": 4.136645962732919, | |
| "grad_norm": 0.04154065251350403, | |
| "learning_rate": 1.5278686498784512e-06, | |
| "loss": 0.0001728469622321427, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 14907444.0, | |
| "step": 3330 | |
| }, | |
| { | |
| "entropy": 1.9659110337495804, | |
| "epoch": 4.149068322981367, | |
| "grad_norm": 0.004008583724498749, | |
| "learning_rate": 1.4853928832109732e-06, | |
| "loss": 0.0005395710468292236, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 14958978.0, | |
| "step": 3340 | |
| }, | |
| { | |
| "entropy": 2.025330847501755, | |
| "epoch": 4.161490683229814, | |
| "grad_norm": 0.01808677799999714, | |
| "learning_rate": 1.4434684856100377e-06, | |
| "loss": 0.00026113332714885475, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 15001022.0, | |
| "step": 3350 | |
| }, | |
| { | |
| "entropy": 2.077262428402901, | |
| "epoch": 4.173913043478261, | |
| "grad_norm": 0.05431155487895012, | |
| "learning_rate": 1.402098171917996e-06, | |
| "loss": 0.0004729252308607101, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 15045200.0, | |
| "step": 3360 | |
| }, | |
| { | |
| "entropy": 2.028971680998802, | |
| "epoch": 4.186335403726708, | |
| "grad_norm": 0.03370862826704979, | |
| "learning_rate": 1.3612846210971153e-06, | |
| "loss": 0.0006381514482200146, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 15087961.0, | |
| "step": 3370 | |
| }, | |
| { | |
| "entropy": 2.0537871956825255, | |
| "epoch": 4.198757763975156, | |
| "grad_norm": 0.007738613057881594, | |
| "learning_rate": 1.3210304760561233e-06, | |
| "loss": 0.00116888377815485, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 15130072.0, | |
| "step": 3380 | |
| }, | |
| { | |
| "entropy": 2.092353865504265, | |
| "epoch": 4.211180124223603, | |
| "grad_norm": 0.049626674503088, | |
| "learning_rate": 1.281338343479045e-06, | |
| "loss": 0.00019769035279750823, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 15172731.0, | |
| "step": 3390 | |
| }, | |
| { | |
| "entropy": 2.024295452237129, | |
| "epoch": 4.22360248447205, | |
| "grad_norm": 0.0875379741191864, | |
| "learning_rate": 1.2422107936564175e-06, | |
| "loss": 0.0004914845339953899, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 15218529.0, | |
| "step": 3400 | |
| }, | |
| { | |
| "entropy": 2.0535459727048875, | |
| "epoch": 4.236024844720497, | |
| "grad_norm": 0.015673642978072166, | |
| "learning_rate": 1.2036503603188464e-06, | |
| "loss": 0.0002709951251745224, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 15262145.0, | |
| "step": 3410 | |
| }, | |
| { | |
| "entropy": 2.0593578845262526, | |
| "epoch": 4.248447204968944, | |
| "grad_norm": 0.045476797968149185, | |
| "learning_rate": 1.1656595404729232e-06, | |
| "loss": 0.0018097426742315291, | |
| "mean_token_accuracy": 0.9991666659712791, | |
| "num_tokens": 15312132.0, | |
| "step": 3420 | |
| }, | |
| { | |
| "entropy": 1.9848116040229797, | |
| "epoch": 4.260869565217392, | |
| "grad_norm": 0.0017723346827551723, | |
| "learning_rate": 1.1282407942395435e-06, | |
| "loss": 0.00026819088961929085, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 15355648.0, | |
| "step": 3430 | |
| }, | |
| { | |
| "entropy": 2.0672077775001525, | |
| "epoch": 4.273291925465839, | |
| "grad_norm": 0.01810125634074211, | |
| "learning_rate": 1.091396544694594e-06, | |
| "loss": 0.001546621322631836, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 15402566.0, | |
| "step": 3440 | |
| }, | |
| { | |
| "entropy": 2.103651860356331, | |
| "epoch": 4.285714285714286, | |
| "grad_norm": 0.013126119039952755, | |
| "learning_rate": 1.0551291777120465e-06, | |
| "loss": 0.0008613715879619121, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 15445576.0, | |
| "step": 3450 | |
| }, | |
| { | |
| "entropy": 2.0706649154424666, | |
| "epoch": 4.298136645962733, | |
| "grad_norm": 0.013539963401854038, | |
| "learning_rate": 1.019441041809449e-06, | |
| "loss": 0.00020982269197702407, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 15491988.0, | |
| "step": 3460 | |
| }, | |
| { | |
| "entropy": 2.0074143022298814, | |
| "epoch": 4.3105590062111805, | |
| "grad_norm": 0.005376921966671944, | |
| "learning_rate": 9.84334447995865e-07, | |
| "loss": 0.0008014158345758915, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 15536316.0, | |
| "step": 3470 | |
| }, | |
| { | |
| "entropy": 1.9699030220508575, | |
| "epoch": 4.3229813664596275, | |
| "grad_norm": 0.2335580438375473, | |
| "learning_rate": 9.498116696222049e-07, | |
| "loss": 0.0008583088405430317, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 15586522.0, | |
| "step": 3480 | |
| }, | |
| { | |
| "entropy": 2.0634532988071443, | |
| "epoch": 4.3354037267080745, | |
| "grad_norm": 0.07481986284255981, | |
| "learning_rate": 9.15874942234024e-07, | |
| "loss": 0.00037952899001538756, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 15630922.0, | |
| "step": 3490 | |
| }, | |
| { | |
| "entropy": 2.027003452181816, | |
| "epoch": 4.3478260869565215, | |
| "grad_norm": 0.004738735035061836, | |
| "learning_rate": 8.82526463426756e-07, | |
| "loss": 0.00023144190199673176, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 15676612.0, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 4.3478260869565215, | |
| "eval_entropy": 1.9058150294681577, | |
| "eval_loss": 0.7377180457115173, | |
| "eval_mean_token_accuracy": 0.9048938154551427, | |
| "eval_num_tokens": 15676612.0, | |
| "eval_runtime": 1014.9198, | |
| "eval_samples_per_second": 7.539, | |
| "eval_steps_per_second": 0.943, | |
| "step": 3500 | |
| }, | |
| { | |
| "entropy": 2.028341743350029, | |
| "epoch": 4.3602484472049685, | |
| "grad_norm": 0.33282777667045593, | |
| "learning_rate": 8.497683927033995e-07, | |
| "loss": 0.0004219844937324524, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 15725206.0, | |
| "step": 3510 | |
| }, | |
| { | |
| "entropy": 2.0083132714033125, | |
| "epoch": 4.372670807453416, | |
| "grad_norm": 0.007023821119219065, | |
| "learning_rate": 8.176028513346879e-07, | |
| "loss": 0.002606554329395294, | |
| "mean_token_accuracy": 0.9994897961616516, | |
| "num_tokens": 15770344.0, | |
| "step": 3520 | |
| }, | |
| { | |
| "entropy": 2.085210156440735, | |
| "epoch": 4.385093167701863, | |
| "grad_norm": 0.009783482179045677, | |
| "learning_rate": 7.860319222217206e-07, | |
| "loss": 0.0017641620710492135, | |
| "mean_token_accuracy": 0.9994565218687057, | |
| "num_tokens": 15811072.0, | |
| "step": 3530 | |
| }, | |
| { | |
| "entropy": 2.037967327237129, | |
| "epoch": 4.39751552795031, | |
| "grad_norm": 0.011295588687062263, | |
| "learning_rate": 7.550576497610829e-07, | |
| "loss": 0.00024796819780021907, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 15858282.0, | |
| "step": 3540 | |
| }, | |
| { | |
| "entropy": 2.0281506925821304, | |
| "epoch": 4.409937888198757, | |
| "grad_norm": 0.015403630211949348, | |
| "learning_rate": 7.246820397124598e-07, | |
| "loss": 0.0002571480348706245, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 15901251.0, | |
| "step": 3550 | |
| }, | |
| { | |
| "entropy": 2.0923985958099367, | |
| "epoch": 4.422360248447205, | |
| "grad_norm": 0.005905622150748968, | |
| "learning_rate": 6.949070590687567e-07, | |
| "loss": 0.0010250438004732131, | |
| "mean_token_accuracy": 0.997916667163372, | |
| "num_tokens": 15942361.0, | |
| "step": 3560 | |
| }, | |
| { | |
| "entropy": 2.0730757504701613, | |
| "epoch": 4.434782608695652, | |
| "grad_norm": 0.007940849289298058, | |
| "learning_rate": 6.65734635928711e-07, | |
| "loss": 0.00019977029878646136, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 15990201.0, | |
| "step": 3570 | |
| }, | |
| { | |
| "entropy": 1.9941458642482757, | |
| "epoch": 4.447204968944099, | |
| "grad_norm": 0.005438764579594135, | |
| "learning_rate": 6.37166659372056e-07, | |
| "loss": 0.0002368162851780653, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 16034717.0, | |
| "step": 3580 | |
| }, | |
| { | |
| "entropy": 2.049195554852486, | |
| "epoch": 4.459627329192546, | |
| "grad_norm": 0.003918728791177273, | |
| "learning_rate": 6.092049793371802e-07, | |
| "loss": 0.00024126945063471795, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 16077494.0, | |
| "step": 3590 | |
| }, | |
| { | |
| "entropy": 2.0372196793556214, | |
| "epoch": 4.472049689440993, | |
| "grad_norm": 0.007525778375566006, | |
| "learning_rate": 5.818514065013358e-07, | |
| "loss": 0.00033768313005566597, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 16121475.0, | |
| "step": 3600 | |
| }, | |
| { | |
| "entropy": 2.013162526488304, | |
| "epoch": 4.484472049689441, | |
| "grad_norm": 0.010637825354933739, | |
| "learning_rate": 5.551077121633875e-07, | |
| "loss": 0.00017051056493073703, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 16161482.0, | |
| "step": 3610 | |
| }, | |
| { | |
| "entropy": 2.000212600827217, | |
| "epoch": 4.496894409937888, | |
| "grad_norm": 0.007012031972408295, | |
| "learning_rate": 5.289756281291114e-07, | |
| "loss": 0.001262835692614317, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 16203394.0, | |
| "step": 3620 | |
| }, | |
| { | |
| "entropy": 2.066090244054794, | |
| "epoch": 4.509316770186335, | |
| "grad_norm": 0.01005527563393116, | |
| "learning_rate": 5.034568465990497e-07, | |
| "loss": 0.00016053561121225356, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 16243079.0, | |
| "step": 3630 | |
| }, | |
| { | |
| "entropy": 2.080022472143173, | |
| "epoch": 4.521739130434782, | |
| "grad_norm": 0.02030208148062229, | |
| "learning_rate": 4.785530200589327e-07, | |
| "loss": 0.0015855986624956132, | |
| "mean_token_accuracy": 0.9983333334326744, | |
| "num_tokens": 16289416.0, | |
| "step": 3640 | |
| }, | |
| { | |
| "entropy": 2.0235850870609284, | |
| "epoch": 4.53416149068323, | |
| "grad_norm": 0.017586492002010345, | |
| "learning_rate": 4.5426576117266643e-07, | |
| "loss": 0.00019510933198034762, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 16337150.0, | |
| "step": 3650 | |
| }, | |
| { | |
| "entropy": 2.036457586288452, | |
| "epoch": 4.546583850931677, | |
| "grad_norm": 0.003649574238806963, | |
| "learning_rate": 4.305966426779118e-07, | |
| "loss": 0.013864995539188385, | |
| "mean_token_accuracy": 0.997054597735405, | |
| "num_tokens": 16382104.0, | |
| "step": 3660 | |
| }, | |
| { | |
| "entropy": 2.098330682516098, | |
| "epoch": 4.559006211180124, | |
| "grad_norm": 0.010212893597781658, | |
| "learning_rate": 4.0754719728423267e-07, | |
| "loss": 0.0013746877200901508, | |
| "mean_token_accuracy": 0.9991379305720329, | |
| "num_tokens": 16422099.0, | |
| "step": 3670 | |
| }, | |
| { | |
| "entropy": 2.076760244369507, | |
| "epoch": 4.571428571428571, | |
| "grad_norm": 0.25979042053222656, | |
| "learning_rate": 3.85118917573849e-07, | |
| "loss": 0.000352576794102788, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 16463092.0, | |
| "step": 3680 | |
| }, | |
| { | |
| "entropy": 2.0827836245298386, | |
| "epoch": 4.583850931677018, | |
| "grad_norm": 0.02301006019115448, | |
| "learning_rate": 3.6331325590498344e-07, | |
| "loss": 0.0007054576650261879, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 16505380.0, | |
| "step": 3690 | |
| }, | |
| { | |
| "entropy": 2.047082948684692, | |
| "epoch": 4.596273291925466, | |
| "grad_norm": 0.004036522004753351, | |
| "learning_rate": 3.4213162431780964e-07, | |
| "loss": 0.00014299721224233508, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 16551379.0, | |
| "step": 3700 | |
| }, | |
| { | |
| "entropy": 2.0353837430477144, | |
| "epoch": 4.608695652173913, | |
| "grad_norm": 0.015464823693037033, | |
| "learning_rate": 3.2157539444301667e-07, | |
| "loss": 0.00044039799831807613, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 16590736.0, | |
| "step": 3710 | |
| }, | |
| { | |
| "entropy": 2.035485503077507, | |
| "epoch": 4.62111801242236, | |
| "grad_norm": 0.023447539657354355, | |
| "learning_rate": 3.0164589741298986e-07, | |
| "loss": 0.0002818571170791984, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 16633530.0, | |
| "step": 3720 | |
| }, | |
| { | |
| "entropy": 2.044951635599136, | |
| "epoch": 4.633540372670807, | |
| "grad_norm": 0.0037932603154331446, | |
| "learning_rate": 2.823444237756123e-07, | |
| "loss": 0.00026586204767227174, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 16678584.0, | |
| "step": 3730 | |
| }, | |
| { | |
| "entropy": 2.0412946969270704, | |
| "epoch": 4.645962732919255, | |
| "grad_norm": 0.04193413257598877, | |
| "learning_rate": 2.636722234106903e-07, | |
| "loss": 0.00031464963685721157, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 16723346.0, | |
| "step": 3740 | |
| }, | |
| { | |
| "entropy": 2.037806236743927, | |
| "epoch": 4.658385093167702, | |
| "grad_norm": 0.008879466913640499, | |
| "learning_rate": 2.4563050544901935e-07, | |
| "loss": 0.0008394073694944382, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 16766309.0, | |
| "step": 3750 | |
| }, | |
| { | |
| "entropy": 2.0403653383255005, | |
| "epoch": 4.670807453416149, | |
| "grad_norm": 0.004407000727951527, | |
| "learning_rate": 2.282204381940889e-07, | |
| "loss": 0.000280851754359901, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 16809072.0, | |
| "step": 3760 | |
| }, | |
| { | |
| "entropy": 2.0514664113521577, | |
| "epoch": 4.683229813664596, | |
| "grad_norm": 2.2006642818450928, | |
| "learning_rate": 2.1144314904642194e-07, | |
| "loss": 0.007948150485754013, | |
| "mean_token_accuracy": 0.9976576581597328, | |
| "num_tokens": 16851980.0, | |
| "step": 3770 | |
| }, | |
| { | |
| "entropy": 2.1021973162889482, | |
| "epoch": 4.695652173913043, | |
| "grad_norm": 0.0551968514919281, | |
| "learning_rate": 1.9529972443057542e-07, | |
| "loss": 0.00034392224624753, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 16893309.0, | |
| "step": 3780 | |
| }, | |
| { | |
| "entropy": 2.0802121639251707, | |
| "epoch": 4.708074534161491, | |
| "grad_norm": 0.022165654227137566, | |
| "learning_rate": 1.7979120972478448e-07, | |
| "loss": 0.0012221145443618298, | |
| "mean_token_accuracy": 0.9989130437374115, | |
| "num_tokens": 16936398.0, | |
| "step": 3790 | |
| }, | |
| { | |
| "entropy": 1.9913864940404893, | |
| "epoch": 4.720496894409938, | |
| "grad_norm": 0.0038369097746908665, | |
| "learning_rate": 1.6491860919326863e-07, | |
| "loss": 0.0035387083888053896, | |
| "mean_token_accuracy": 0.9991935476660728, | |
| "num_tokens": 16983474.0, | |
| "step": 3800 | |
| }, | |
| { | |
| "entropy": 2.0697665393352507, | |
| "epoch": 4.732919254658385, | |
| "grad_norm": 0.10980178415775299, | |
| "learning_rate": 1.5068288592120284e-07, | |
| "loss": 0.0024135053157806397, | |
| "mean_token_accuracy": 0.9986111104488373, | |
| "num_tokens": 17023077.0, | |
| "step": 3810 | |
| }, | |
| { | |
| "entropy": 2.023961767554283, | |
| "epoch": 4.745341614906832, | |
| "grad_norm": 0.016840871423482895, | |
| "learning_rate": 1.3708496175234732e-07, | |
| "loss": 0.00022674815263599158, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 17071372.0, | |
| "step": 3820 | |
| }, | |
| { | |
| "entropy": 2.021743801236153, | |
| "epoch": 4.75776397515528, | |
| "grad_norm": 0.019546369090676308, | |
| "learning_rate": 1.241257172293575e-07, | |
| "loss": 0.0004151566419750452, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 17118417.0, | |
| "step": 3830 | |
| }, | |
| { | |
| "entropy": 1.9979822367429734, | |
| "epoch": 4.770186335403727, | |
| "grad_norm": 0.012950404547154903, | |
| "learning_rate": 1.1180599153676086e-07, | |
| "loss": 0.0011697439476847649, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 17165083.0, | |
| "step": 3840 | |
| }, | |
| { | |
| "entropy": 2.03771687746048, | |
| "epoch": 4.782608695652174, | |
| "grad_norm": 0.002949357498437166, | |
| "learning_rate": 1.0012658244661799e-07, | |
| "loss": 0.0001900658942759037, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 17210230.0, | |
| "step": 3850 | |
| }, | |
| { | |
| "entropy": 2.0459833204746247, | |
| "epoch": 4.795031055900621, | |
| "grad_norm": 0.02009522169828415, | |
| "learning_rate": 8.908824626685853e-08, | |
| "loss": 0.001738494448363781, | |
| "mean_token_accuracy": 0.9992424249649048, | |
| "num_tokens": 17257379.0, | |
| "step": 3860 | |
| }, | |
| { | |
| "entropy": 2.0705668896436693, | |
| "epoch": 4.807453416149068, | |
| "grad_norm": 0.06382288783788681, | |
| "learning_rate": 7.869169779230911e-08, | |
| "loss": 0.0019037414342164994, | |
| "mean_token_accuracy": 0.9986111104488373, | |
| "num_tokens": 17303678.0, | |
| "step": 3870 | |
| }, | |
| { | |
| "entropy": 2.0258702844381333, | |
| "epoch": 4.819875776397516, | |
| "grad_norm": 0.012522595003247261, | |
| "learning_rate": 6.893761025840607e-08, | |
| "loss": 0.003264884650707245, | |
| "mean_token_accuracy": 0.9989130437374115, | |
| "num_tokens": 17353254.0, | |
| "step": 3880 | |
| }, | |
| { | |
| "entropy": 2.001204323768616, | |
| "epoch": 4.832298136645963, | |
| "grad_norm": 0.0486503429710865, | |
| "learning_rate": 5.982661529759459e-08, | |
| "loss": 0.002944428473711014, | |
| "mean_token_accuracy": 0.9977272734045982, | |
| "num_tokens": 17395502.0, | |
| "step": 3890 | |
| }, | |
| { | |
| "entropy": 1.9402426928281784, | |
| "epoch": 4.84472049689441, | |
| "grad_norm": 0.004425989929586649, | |
| "learning_rate": 5.135930289843716e-08, | |
| "loss": 0.0007586335297673941, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 17449789.0, | |
| "step": 3900 | |
| }, | |
| { | |
| "entropy": 2.047208711504936, | |
| "epoch": 4.857142857142857, | |
| "grad_norm": 0.4375987946987152, | |
| "learning_rate": 4.353622136739844e-08, | |
| "loss": 0.0035171639174222946, | |
| "mean_token_accuracy": 0.9985294118523598, | |
| "num_tokens": 17494196.0, | |
| "step": 3910 | |
| }, | |
| { | |
| "entropy": 2.005463221669197, | |
| "epoch": 4.869565217391305, | |
| "grad_norm": 0.02442975342273712, | |
| "learning_rate": 3.6357877293342615e-08, | |
| "loss": 0.0002247157972306013, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 17540344.0, | |
| "step": 3920 | |
| }, | |
| { | |
| "entropy": 2.066293877363205, | |
| "epoch": 4.881987577639752, | |
| "grad_norm": 0.038806382566690445, | |
| "learning_rate": 2.982473551473297e-08, | |
| "loss": 0.0010721116326749326, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 17579881.0, | |
| "step": 3930 | |
| }, | |
| { | |
| "entropy": 1.9953967750072479, | |
| "epoch": 4.894409937888199, | |
| "grad_norm": 0.030400315299630165, | |
| "learning_rate": 2.3937219089524843e-08, | |
| "loss": 0.0002892194781452417, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 17628781.0, | |
| "step": 3940 | |
| }, | |
| { | |
| "entropy": 2.031711795926094, | |
| "epoch": 4.906832298136646, | |
| "grad_norm": 0.037453047931194305, | |
| "learning_rate": 1.8695709267774197e-08, | |
| "loss": 0.00017593621741980315, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 17676511.0, | |
| "step": 3950 | |
| }, | |
| { | |
| "entropy": 2.035673101246357, | |
| "epoch": 4.919254658385093, | |
| "grad_norm": 0.12591120600700378, | |
| "learning_rate": 1.410054546694739e-08, | |
| "loss": 0.006961337476968765, | |
| "mean_token_accuracy": 0.9986842110753059, | |
| "num_tokens": 17715980.0, | |
| "step": 3960 | |
| }, | |
| { | |
| "entropy": 2.0690086662769316, | |
| "epoch": 4.931677018633541, | |
| "grad_norm": 0.00455585028976202, | |
| "learning_rate": 1.0152025249943187e-08, | |
| "loss": 0.0008870340883731842, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 17757285.0, | |
| "step": 3970 | |
| }, | |
| { | |
| "entropy": 1.9871522605419158, | |
| "epoch": 4.944099378881988, | |
| "grad_norm": 0.04197465628385544, | |
| "learning_rate": 6.850404305823732e-09, | |
| "loss": 0.0005288542248308659, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 17806632.0, | |
| "step": 3980 | |
| }, | |
| { | |
| "entropy": 2.0136446237564085, | |
| "epoch": 4.956521739130435, | |
| "grad_norm": 0.00905593391507864, | |
| "learning_rate": 4.195896433255575e-09, | |
| "loss": 0.0002543700160458684, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 17857937.0, | |
| "step": 3990 | |
| }, | |
| { | |
| "entropy": 2.014116221666336, | |
| "epoch": 4.9689440993788825, | |
| "grad_norm": 0.1457187533378601, | |
| "learning_rate": 2.1886735266696268e-09, | |
| "loss": 0.00390925370156765, | |
| "mean_token_accuracy": 0.9984375, | |
| "num_tokens": 17901151.0, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 4.9689440993788825, | |
| "eval_entropy": 1.9050748003189342, | |
| "eval_loss": 0.7378253936767578, | |
| "eval_mean_token_accuracy": 0.9051745814838629, | |
| "eval_num_tokens": 17901151.0, | |
| "eval_runtime": 1014.6596, | |
| "eval_samples_per_second": 7.54, | |
| "eval_steps_per_second": 0.943, | |
| "step": 4000 | |
| }, | |
| { | |
| "entropy": 2.0390416413545607, | |
| "epoch": 4.9813664596273295, | |
| "grad_norm": 0.013149413280189037, | |
| "learning_rate": 8.288655651234045e-10, | |
| "loss": 0.0001981796929612756, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 17946275.0, | |
| "step": 4010 | |
| }, | |
| { | |
| "entropy": 2.0683668941259383, | |
| "epoch": 4.9937888198757765, | |
| "grad_norm": 0.027039172127842903, | |
| "learning_rate": 1.1656060388998136e-10, | |
| "loss": 0.0002283555455505848, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 17994096.0, | |
| "step": 4020 | |
| }, | |
| { | |
| "epoch": 5.0, | |
| "eval_entropy": 1.9048992476368647, | |
| "eval_loss": 0.7375593781471252, | |
| "eval_mean_token_accuracy": 0.9050571202235287, | |
| "eval_num_tokens": 18019280.0, | |
| "eval_runtime": 1015.1336, | |
| "eval_samples_per_second": 7.537, | |
| "eval_steps_per_second": 0.943, | |
| "step": 4025 | |
| }, | |
| { | |
| "epoch": 5.0, | |
| "step": 4025, | |
| "total_flos": 1.0590717965324943e+18, | |
| "train_loss": 0.07133869599467085, | |
| "train_runtime": 16940.0407, | |
| "train_samples_per_second": 1.901, | |
| "train_steps_per_second": 0.238 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 4025, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 5, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.0590717965324943e+18, | |
| "train_batch_size": 2, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |