Instructions to use Jongbin-kr/llama-3.1-8b-instruct_lbox-legal-provision-auditor_fallback_ffn-only with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use Jongbin-kr/llama-3.1-8b-instruct_lbox-legal-provision-auditor_fallback_ffn-only with Transformers:
# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("Jongbin-kr/llama-3.1-8b-instruct_lbox-legal-provision-auditor_fallback_ffn-only", device_map="auto") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": 1500, | |
| "best_metric": 0.4876999855041504, | |
| "best_model_checkpoint": "/data6/jongbinwon/evolving_MoE/checkpoints/sft_llama31_8b_lbox_legal-provision-auditor_fallback_ffn_only_5ep_eval500/checkpoint-1500", | |
| "epoch": 5.0, | |
| "eval_steps": 500, | |
| "global_step": 3520, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 2.302528735995293, | |
| "epoch": 0.014214641080312722, | |
| "grad_norm": 4.828892707824707, | |
| "learning_rate": 1.6981132075471698e-06, | |
| "loss": 1.3984100341796875, | |
| "mean_token_accuracy": 0.6857675366103649, | |
| "num_tokens": 34855.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 2.2492430746555327, | |
| "epoch": 0.028429282160625444, | |
| "grad_norm": 3.5804924964904785, | |
| "learning_rate": 3.5849056603773586e-06, | |
| "loss": 1.4428706169128418, | |
| "mean_token_accuracy": 0.6913674481213092, | |
| "num_tokens": 75959.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 2.3167720407247545, | |
| "epoch": 0.042643923240938165, | |
| "grad_norm": 8.852733612060547, | |
| "learning_rate": 5.4716981132075475e-06, | |
| "loss": 1.5378618240356445, | |
| "mean_token_accuracy": 0.6808141805231571, | |
| "num_tokens": 111800.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 2.233737552165985, | |
| "epoch": 0.05685856432125089, | |
| "grad_norm": 4.612252712249756, | |
| "learning_rate": 7.358490566037736e-06, | |
| "loss": 1.1216099739074707, | |
| "mean_token_accuracy": 0.7186247147619724, | |
| "num_tokens": 147472.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 2.27722809612751, | |
| "epoch": 0.07107320540156362, | |
| "grad_norm": 3.0993638038635254, | |
| "learning_rate": 9.245283018867926e-06, | |
| "loss": 1.022943115234375, | |
| "mean_token_accuracy": 0.7546420469880104, | |
| "num_tokens": 190518.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 2.336320897936821, | |
| "epoch": 0.08528784648187633, | |
| "grad_norm": 3.466336965560913, | |
| "learning_rate": 1.1132075471698115e-05, | |
| "loss": 0.9197140693664551, | |
| "mean_token_accuracy": 0.7917306423187256, | |
| "num_tokens": 226599.0, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 2.3224798500537873, | |
| "epoch": 0.09950248756218906, | |
| "grad_norm": 2.5745620727539062, | |
| "learning_rate": 1.3018867924528303e-05, | |
| "loss": 0.7570995807647705, | |
| "mean_token_accuracy": 0.8374421924352646, | |
| "num_tokens": 267416.0, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 2.26705806851387, | |
| "epoch": 0.11371712864250177, | |
| "grad_norm": 3.452971935272217, | |
| "learning_rate": 1.4905660377358491e-05, | |
| "loss": 0.5703647136688232, | |
| "mean_token_accuracy": 0.8376004211604595, | |
| "num_tokens": 306250.0, | |
| "step": 80 | |
| }, | |
| { | |
| "entropy": 2.341897654533386, | |
| "epoch": 0.1279317697228145, | |
| "grad_norm": 4.118662357330322, | |
| "learning_rate": 1.679245283018868e-05, | |
| "loss": 0.5330170631408692, | |
| "mean_token_accuracy": 0.8682203203439712, | |
| "num_tokens": 341963.0, | |
| "step": 90 | |
| }, | |
| { | |
| "entropy": 2.2404198199510574, | |
| "epoch": 0.14214641080312723, | |
| "grad_norm": 5.807668209075928, | |
| "learning_rate": 1.867924528301887e-05, | |
| "loss": 0.40104899406433103, | |
| "mean_token_accuracy": 0.8837951421737671, | |
| "num_tokens": 378822.0, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 2.294436663389206, | |
| "epoch": 0.15636105188343993, | |
| "grad_norm": 4.4703288078308105, | |
| "learning_rate": 1.99999618947382e-05, | |
| "loss": 0.40310959815979003, | |
| "mean_token_accuracy": 0.8891363501548767, | |
| "num_tokens": 414530.0, | |
| "step": 110 | |
| }, | |
| { | |
| "entropy": 2.2652417331933976, | |
| "epoch": 0.17057569296375266, | |
| "grad_norm": 3.5225493907928467, | |
| "learning_rate": 1.999928447594037e-05, | |
| "loss": 0.32140042781829836, | |
| "mean_token_accuracy": 0.9204763844609261, | |
| "num_tokens": 449719.0, | |
| "step": 120 | |
| }, | |
| { | |
| "entropy": 2.1712214767932894, | |
| "epoch": 0.1847903340440654, | |
| "grad_norm": 4.550766468048096, | |
| "learning_rate": 1.999776033957351e-05, | |
| "loss": 0.3288241147994995, | |
| "mean_token_accuracy": 0.9241611689329148, | |
| "num_tokens": 487297.0, | |
| "step": 130 | |
| }, | |
| { | |
| "entropy": 2.2248219311237336, | |
| "epoch": 0.19900497512437812, | |
| "grad_norm": 3.3866801261901855, | |
| "learning_rate": 1.999538961469817e-05, | |
| "loss": 0.1645406723022461, | |
| "mean_token_accuracy": 0.9473418429493904, | |
| "num_tokens": 522381.0, | |
| "step": 140 | |
| }, | |
| { | |
| "entropy": 2.2194749146699904, | |
| "epoch": 0.21321961620469082, | |
| "grad_norm": 5.862302303314209, | |
| "learning_rate": 1.9992172502062152e-05, | |
| "loss": 0.27917327880859377, | |
| "mean_token_accuracy": 0.919804471731186, | |
| "num_tokens": 561254.0, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 2.1698070406913756, | |
| "epoch": 0.22743425728500355, | |
| "grad_norm": 4.744441032409668, | |
| "learning_rate": 1.998810927408352e-05, | |
| "loss": 0.25531325340270994, | |
| "mean_token_accuracy": 0.9192116089165211, | |
| "num_tokens": 602617.0, | |
| "step": 160 | |
| }, | |
| { | |
| "entropy": 2.2647796124219894, | |
| "epoch": 0.24164889836531628, | |
| "grad_norm": 7.122901439666748, | |
| "learning_rate": 1.9983200274827553e-05, | |
| "loss": 0.2522935390472412, | |
| "mean_token_accuracy": 0.9494201198220253, | |
| "num_tokens": 637932.0, | |
| "step": 170 | |
| }, | |
| { | |
| "entropy": 2.1525828033685683, | |
| "epoch": 0.255863539445629, | |
| "grad_norm": 3.150447130203247, | |
| "learning_rate": 1.9977445919977577e-05, | |
| "loss": 0.18792203664779664, | |
| "mean_token_accuracy": 0.939947709441185, | |
| "num_tokens": 675271.0, | |
| "step": 180 | |
| }, | |
| { | |
| "entropy": 2.2198438853025437, | |
| "epoch": 0.27007818052594174, | |
| "grad_norm": 4.385933876037598, | |
| "learning_rate": 1.99708466967998e-05, | |
| "loss": 0.12581338882446289, | |
| "mean_token_accuracy": 0.9572400227189064, | |
| "num_tokens": 710422.0, | |
| "step": 190 | |
| }, | |
| { | |
| "entropy": 2.2473688989877703, | |
| "epoch": 0.28429282160625446, | |
| "grad_norm": 0.7782599925994873, | |
| "learning_rate": 1.9963403164102023e-05, | |
| "loss": 0.16216881275177003, | |
| "mean_token_accuracy": 0.9525286003947258, | |
| "num_tokens": 746633.0, | |
| "step": 200 | |
| }, | |
| { | |
| "entropy": 2.2106005609035493, | |
| "epoch": 0.29850746268656714, | |
| "grad_norm": 3.868602991104126, | |
| "learning_rate": 1.9955115952186337e-05, | |
| "loss": 0.32397260665893557, | |
| "mean_token_accuracy": 0.9184088215231896, | |
| "num_tokens": 780855.0, | |
| "step": 210 | |
| }, | |
| { | |
| "entropy": 2.161737409234047, | |
| "epoch": 0.31272210376687987, | |
| "grad_norm": 6.2161784172058105, | |
| "learning_rate": 1.994598576279575e-05, | |
| "loss": 0.147584068775177, | |
| "mean_token_accuracy": 0.9548472836613655, | |
| "num_tokens": 820662.0, | |
| "step": 220 | |
| }, | |
| { | |
| "entropy": 2.2137836784124376, | |
| "epoch": 0.3269367448471926, | |
| "grad_norm": 5.454526901245117, | |
| "learning_rate": 1.9936013369054748e-05, | |
| "loss": 0.19472339153289794, | |
| "mean_token_accuracy": 0.9331202074885369, | |
| "num_tokens": 859624.0, | |
| "step": 230 | |
| }, | |
| { | |
| "entropy": 2.2511601120233538, | |
| "epoch": 0.3411513859275053, | |
| "grad_norm": 3.353757381439209, | |
| "learning_rate": 1.9925199615403857e-05, | |
| "loss": 0.10179495811462402, | |
| "mean_token_accuracy": 0.9729527950286865, | |
| "num_tokens": 895936.0, | |
| "step": 240 | |
| }, | |
| { | |
| "entropy": 2.2046679228544237, | |
| "epoch": 0.35536602700781805, | |
| "grad_norm": 5.455029487609863, | |
| "learning_rate": 1.9913545417528125e-05, | |
| "loss": 0.15011273622512816, | |
| "mean_token_accuracy": 0.9702284231781959, | |
| "num_tokens": 935793.0, | |
| "step": 250 | |
| }, | |
| { | |
| "entropy": 2.181716701388359, | |
| "epoch": 0.3695806680881308, | |
| "grad_norm": 1.6833304166793823, | |
| "learning_rate": 1.9901051762279557e-05, | |
| "loss": 0.11941384077072144, | |
| "mean_token_accuracy": 0.9655464366078377, | |
| "num_tokens": 973498.0, | |
| "step": 260 | |
| }, | |
| { | |
| "entropy": 2.164376962184906, | |
| "epoch": 0.3837953091684435, | |
| "grad_norm": 2.3306143283843994, | |
| "learning_rate": 1.9887719707593602e-05, | |
| "loss": 0.09658043384552002, | |
| "mean_token_accuracy": 0.9760609611868858, | |
| "num_tokens": 1009556.0, | |
| "step": 270 | |
| }, | |
| { | |
| "entropy": 2.087420853972435, | |
| "epoch": 0.39800995024875624, | |
| "grad_norm": 4.12304162979126, | |
| "learning_rate": 1.9873550382399528e-05, | |
| "loss": 0.07825971841812134, | |
| "mean_token_accuracy": 0.9765635132789612, | |
| "num_tokens": 1052914.0, | |
| "step": 280 | |
| }, | |
| { | |
| "entropy": 2.1707926601171494, | |
| "epoch": 0.41222459132906897, | |
| "grad_norm": 3.697993516921997, | |
| "learning_rate": 1.985854498652484e-05, | |
| "loss": 0.14083361625671387, | |
| "mean_token_accuracy": 0.9513696759939194, | |
| "num_tokens": 1092296.0, | |
| "step": 290 | |
| }, | |
| { | |
| "entropy": 2.1313129723072053, | |
| "epoch": 0.42643923240938164, | |
| "grad_norm": 3.0543739795684814, | |
| "learning_rate": 1.9842704790593695e-05, | |
| "loss": 0.12360785007476807, | |
| "mean_token_accuracy": 0.9688008055090904, | |
| "num_tokens": 1129248.0, | |
| "step": 300 | |
| }, | |
| { | |
| "entropy": 2.2083891183137894, | |
| "epoch": 0.44065387348969437, | |
| "grad_norm": 2.8632559776306152, | |
| "learning_rate": 1.982603113591928e-05, | |
| "loss": 0.1391190767288208, | |
| "mean_token_accuracy": 0.9566407799720764, | |
| "num_tokens": 1166255.0, | |
| "step": 310 | |
| }, | |
| { | |
| "entropy": 2.2131824254989625, | |
| "epoch": 0.4548685145700071, | |
| "grad_norm": 3.9666574001312256, | |
| "learning_rate": 1.9808525434390253e-05, | |
| "loss": 0.11147340536117553, | |
| "mean_token_accuracy": 0.9667007446289062, | |
| "num_tokens": 1201734.0, | |
| "step": 320 | |
| }, | |
| { | |
| "entropy": 2.224493718147278, | |
| "epoch": 0.4690831556503198, | |
| "grad_norm": 5.834049224853516, | |
| "learning_rate": 1.9790189168351185e-05, | |
| "loss": 0.17519290447235109, | |
| "mean_token_accuracy": 0.9621825873851776, | |
| "num_tokens": 1240835.0, | |
| "step": 330 | |
| }, | |
| { | |
| "entropy": 2.1801333963871, | |
| "epoch": 0.48329779673063256, | |
| "grad_norm": 0.8749763369560242, | |
| "learning_rate": 1.977102389047704e-05, | |
| "loss": 0.10031602382659913, | |
| "mean_token_accuracy": 0.9667783200740814, | |
| "num_tokens": 1276270.0, | |
| "step": 340 | |
| }, | |
| { | |
| "entropy": 2.1437912434339523, | |
| "epoch": 0.4975124378109453, | |
| "grad_norm": 3.661072254180908, | |
| "learning_rate": 1.9751031223641678e-05, | |
| "loss": 0.11026780605316162, | |
| "mean_token_accuracy": 0.9699726045131684, | |
| "num_tokens": 1313238.0, | |
| "step": 350 | |
| }, | |
| { | |
| "entropy": 2.1523136287927627, | |
| "epoch": 0.511727078891258, | |
| "grad_norm": 2.049119472503662, | |
| "learning_rate": 1.9730212860780467e-05, | |
| "loss": 0.14013859033584594, | |
| "mean_token_accuracy": 0.9650743275880813, | |
| "num_tokens": 1347519.0, | |
| "step": 360 | |
| }, | |
| { | |
| "entropy": 2.145729649066925, | |
| "epoch": 0.5259417199715707, | |
| "grad_norm": 2.146339178085327, | |
| "learning_rate": 1.9708570564746896e-05, | |
| "loss": 0.11286178827285767, | |
| "mean_token_accuracy": 0.963935986161232, | |
| "num_tokens": 1388152.0, | |
| "step": 370 | |
| }, | |
| { | |
| "entropy": 2.2653285562992096, | |
| "epoch": 0.5401563610518835, | |
| "grad_norm": 4.600983619689941, | |
| "learning_rate": 1.968610616816333e-05, | |
| "loss": 0.11360809803009034, | |
| "mean_token_accuracy": 0.9642397537827492, | |
| "num_tokens": 1426842.0, | |
| "step": 380 | |
| }, | |
| { | |
| "entropy": 2.229273745417595, | |
| "epoch": 0.5543710021321961, | |
| "grad_norm": 3.0675880908966064, | |
| "learning_rate": 1.9662821573265795e-05, | |
| "loss": 0.09846517443656921, | |
| "mean_token_accuracy": 0.97640630453825, | |
| "num_tokens": 1464251.0, | |
| "step": 390 | |
| }, | |
| { | |
| "entropy": 2.1834677189588545, | |
| "epoch": 0.5685856432125089, | |
| "grad_norm": 0.2358260601758957, | |
| "learning_rate": 1.9638718751742935e-05, | |
| "loss": 0.17364193201065065, | |
| "mean_token_accuracy": 0.9615416027605533, | |
| "num_tokens": 1500366.0, | |
| "step": 400 | |
| }, | |
| { | |
| "entropy": 2.173251363635063, | |
| "epoch": 0.5828002842928216, | |
| "grad_norm": 2.5061397552490234, | |
| "learning_rate": 1.9613799744569034e-05, | |
| "loss": 0.06473902463912964, | |
| "mean_token_accuracy": 0.9774620115756989, | |
| "num_tokens": 1534494.0, | |
| "step": 410 | |
| }, | |
| { | |
| "entropy": 2.2588789045810698, | |
| "epoch": 0.5970149253731343, | |
| "grad_norm": 3.6076488494873047, | |
| "learning_rate": 1.9588066661831182e-05, | |
| "loss": 0.15726373195648194, | |
| "mean_token_accuracy": 0.9641035035252571, | |
| "num_tokens": 1567343.0, | |
| "step": 420 | |
| }, | |
| { | |
| "entropy": 2.2106437146663667, | |
| "epoch": 0.6112295664534471, | |
| "grad_norm": 2.65738582611084, | |
| "learning_rate": 1.9561521682550628e-05, | |
| "loss": 0.09528368711471558, | |
| "mean_token_accuracy": 0.9648209795355797, | |
| "num_tokens": 1604518.0, | |
| "step": 430 | |
| }, | |
| { | |
| "entropy": 2.146402803063393, | |
| "epoch": 0.6254442075337597, | |
| "grad_norm": 2.8459908962249756, | |
| "learning_rate": 1.9534167054498235e-05, | |
| "loss": 0.08731676936149597, | |
| "mean_token_accuracy": 0.9775180697441102, | |
| "num_tokens": 1646302.0, | |
| "step": 440 | |
| }, | |
| { | |
| "entropy": 2.2472924411296846, | |
| "epoch": 0.6396588486140725, | |
| "grad_norm": 3.0984578132629395, | |
| "learning_rate": 1.950600509400416e-05, | |
| "loss": 0.07982758283615113, | |
| "mean_token_accuracy": 0.9743791311979294, | |
| "num_tokens": 1680467.0, | |
| "step": 450 | |
| }, | |
| { | |
| "entropy": 2.2500401556491854, | |
| "epoch": 0.6538734896943852, | |
| "grad_norm": 2.5706655979156494, | |
| "learning_rate": 1.9477038185761702e-05, | |
| "loss": 0.06145578622817993, | |
| "mean_token_accuracy": 0.9790576353669167, | |
| "num_tokens": 1715967.0, | |
| "step": 460 | |
| }, | |
| { | |
| "entropy": 2.2013922423124312, | |
| "epoch": 0.668088130774698, | |
| "grad_norm": 1.9893447160720825, | |
| "learning_rate": 1.9447268782625387e-05, | |
| "loss": 0.08759456276893615, | |
| "mean_token_accuracy": 0.9817471817135811, | |
| "num_tokens": 1750750.0, | |
| "step": 470 | |
| }, | |
| { | |
| "entropy": 2.190236097574234, | |
| "epoch": 0.6823027718550106, | |
| "grad_norm": 4.424774646759033, | |
| "learning_rate": 1.941669940540325e-05, | |
| "loss": 0.11516692638397216, | |
| "mean_token_accuracy": 0.9682943612337113, | |
| "num_tokens": 1790273.0, | |
| "step": 480 | |
| }, | |
| { | |
| "entropy": 2.19307736158371, | |
| "epoch": 0.6965174129353234, | |
| "grad_norm": 2.920266628265381, | |
| "learning_rate": 1.938533264264338e-05, | |
| "loss": 0.15450884103775026, | |
| "mean_token_accuracy": 0.9700801074504852, | |
| "num_tokens": 1830020.0, | |
| "step": 490 | |
| }, | |
| { | |
| "entropy": 2.178431448340416, | |
| "epoch": 0.7107320540156361, | |
| "grad_norm": 0.9854955673217773, | |
| "learning_rate": 1.935317115041474e-05, | |
| "loss": 0.12481092214584351, | |
| "mean_token_accuracy": 0.9689489394426346, | |
| "num_tokens": 1866987.0, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.7107320540156361, | |
| "eval_entropy": 2.0971352836056814, | |
| "eval_loss": 0.5259134769439697, | |
| "eval_mean_token_accuracy": 0.8965634148696373, | |
| "eval_num_tokens": 1866987.0, | |
| "eval_runtime": 989.6656, | |
| "eval_samples_per_second": 7.731, | |
| "eval_steps_per_second": 0.967, | |
| "step": 500 | |
| }, | |
| { | |
| "entropy": 2.26279539167881, | |
| "epoch": 0.7249466950959488, | |
| "grad_norm": 1.328014612197876, | |
| "learning_rate": 1.932021765208224e-05, | |
| "loss": 0.12206135988235474, | |
| "mean_token_accuracy": 0.9650760263204574, | |
| "num_tokens": 1902204.0, | |
| "step": 510 | |
| }, | |
| { | |
| "entropy": 2.2842482030391693, | |
| "epoch": 0.7391613361762616, | |
| "grad_norm": 0.994979739189148, | |
| "learning_rate": 1.9286474938076146e-05, | |
| "loss": 0.10036804676055908, | |
| "mean_token_accuracy": 0.9778882250189781, | |
| "num_tokens": 1934799.0, | |
| "step": 520 | |
| }, | |
| { | |
| "entropy": 2.257565715909004, | |
| "epoch": 0.7533759772565742, | |
| "grad_norm": 2.4604053497314453, | |
| "learning_rate": 1.9251945865655784e-05, | |
| "loss": 0.1240536093711853, | |
| "mean_token_accuracy": 0.9661274179816246, | |
| "num_tokens": 1969249.0, | |
| "step": 530 | |
| }, | |
| { | |
| "entropy": 2.2129929661750793, | |
| "epoch": 0.767590618336887, | |
| "grad_norm": 3.858069896697998, | |
| "learning_rate": 1.9216633358667582e-05, | |
| "loss": 0.06604821681976318, | |
| "mean_token_accuracy": 0.9817861035466194, | |
| "num_tokens": 2003001.0, | |
| "step": 540 | |
| }, | |
| { | |
| "entropy": 2.1791742712259294, | |
| "epoch": 0.7818052594171997, | |
| "grad_norm": 4.455066204071045, | |
| "learning_rate": 1.91805404072975e-05, | |
| "loss": 0.14240108728408812, | |
| "mean_token_accuracy": 0.9565647065639495, | |
| "num_tokens": 2039690.0, | |
| "step": 550 | |
| }, | |
| { | |
| "entropy": 2.2445179164409637, | |
| "epoch": 0.7960199004975125, | |
| "grad_norm": 1.3273934125900269, | |
| "learning_rate": 1.914367006781783e-05, | |
| "loss": 0.09953938722610474, | |
| "mean_token_accuracy": 0.9738000154495239, | |
| "num_tokens": 2075587.0, | |
| "step": 560 | |
| }, | |
| { | |
| "entropy": 2.201731264591217, | |
| "epoch": 0.8102345415778252, | |
| "grad_norm": 3.3293604850769043, | |
| "learning_rate": 1.9106025462328392e-05, | |
| "loss": 0.07859283089637756, | |
| "mean_token_accuracy": 0.9805291876196861, | |
| "num_tokens": 2108460.0, | |
| "step": 570 | |
| }, | |
| { | |
| "entropy": 2.2557914018630982, | |
| "epoch": 0.8244491826581379, | |
| "grad_norm": 1.1793880462646484, | |
| "learning_rate": 1.9067609778492147e-05, | |
| "loss": 0.03049740493297577, | |
| "mean_token_accuracy": 0.9910580679774285, | |
| "num_tokens": 2143684.0, | |
| "step": 580 | |
| }, | |
| { | |
| "entropy": 2.159291934967041, | |
| "epoch": 0.8386638237384506, | |
| "grad_norm": 1.225790023803711, | |
| "learning_rate": 1.90284262692653e-05, | |
| "loss": 0.06553000211715698, | |
| "mean_token_accuracy": 0.9782250091433525, | |
| "num_tokens": 2178600.0, | |
| "step": 590 | |
| }, | |
| { | |
| "entropy": 2.171927785873413, | |
| "epoch": 0.8528784648187633, | |
| "grad_norm": 3.7838656902313232, | |
| "learning_rate": 1.8988478252621823e-05, | |
| "loss": 0.06374742388725281, | |
| "mean_token_accuracy": 0.9801983863115311, | |
| "num_tokens": 2217809.0, | |
| "step": 600 | |
| }, | |
| { | |
| "entropy": 2.1900578796863557, | |
| "epoch": 0.8670931058990761, | |
| "grad_norm": 2.7667667865753174, | |
| "learning_rate": 1.8947769111272513e-05, | |
| "loss": 0.07156231999397278, | |
| "mean_token_accuracy": 0.9831789165735245, | |
| "num_tokens": 2255894.0, | |
| "step": 610 | |
| }, | |
| { | |
| "entropy": 2.188087573647499, | |
| "epoch": 0.8813077469793887, | |
| "grad_norm": 1.352272391319275, | |
| "learning_rate": 1.890630229237855e-05, | |
| "loss": 0.07383124232292175, | |
| "mean_token_accuracy": 0.9796638250350952, | |
| "num_tokens": 2290515.0, | |
| "step": 620 | |
| }, | |
| { | |
| "entropy": 2.2202280551195144, | |
| "epoch": 0.8955223880597015, | |
| "grad_norm": 3.82440447807312, | |
| "learning_rate": 1.8864081307259575e-05, | |
| "loss": 0.07150052189826965, | |
| "mean_token_accuracy": 0.9653487637639045, | |
| "num_tokens": 2328545.0, | |
| "step": 630 | |
| }, | |
| { | |
| "entropy": 2.199204143881798, | |
| "epoch": 0.9097370291400142, | |
| "grad_norm": 2.0685250759124756, | |
| "learning_rate": 1.8821109731096397e-05, | |
| "loss": 0.061190438270568845, | |
| "mean_token_accuracy": 0.9833000719547271, | |
| "num_tokens": 2362975.0, | |
| "step": 640 | |
| }, | |
| { | |
| "entropy": 2.2430183798074723, | |
| "epoch": 0.923951670220327, | |
| "grad_norm": 1.4594024419784546, | |
| "learning_rate": 1.877739120262822e-05, | |
| "loss": 0.05861002206802368, | |
| "mean_token_accuracy": 0.9801960617303849, | |
| "num_tokens": 2397300.0, | |
| "step": 650 | |
| }, | |
| { | |
| "entropy": 2.2240359395742417, | |
| "epoch": 0.9381663113006397, | |
| "grad_norm": 3.5333290100097656, | |
| "learning_rate": 1.8732929423844554e-05, | |
| "loss": 0.05537862181663513, | |
| "mean_token_accuracy": 0.9790173918008804, | |
| "num_tokens": 2430581.0, | |
| "step": 660 | |
| }, | |
| { | |
| "entropy": 2.2369117051362992, | |
| "epoch": 0.9523809523809523, | |
| "grad_norm": 5.941117286682129, | |
| "learning_rate": 1.8687728159671705e-05, | |
| "loss": 0.1064723014831543, | |
| "mean_token_accuracy": 0.9709701180458069, | |
| "num_tokens": 2468425.0, | |
| "step": 670 | |
| }, | |
| { | |
| "entropy": 2.2235177606344223, | |
| "epoch": 0.9665955934612651, | |
| "grad_norm": 1.9442089796066284, | |
| "learning_rate": 1.8641791237654e-05, | |
| "loss": 0.09505320787429809, | |
| "mean_token_accuracy": 0.9777823403477669, | |
| "num_tokens": 2506372.0, | |
| "step": 680 | |
| }, | |
| { | |
| "entropy": 2.189699539542198, | |
| "epoch": 0.9808102345415778, | |
| "grad_norm": 1.7199773788452148, | |
| "learning_rate": 1.8595122547629654e-05, | |
| "loss": 0.08579087853431702, | |
| "mean_token_accuracy": 0.981938436627388, | |
| "num_tokens": 2544255.0, | |
| "step": 690 | |
| }, | |
| { | |
| "entropy": 2.203128972649574, | |
| "epoch": 0.9950248756218906, | |
| "grad_norm": 1.9164578914642334, | |
| "learning_rate": 1.854772604140141e-05, | |
| "loss": 0.054469770193099974, | |
| "mean_token_accuracy": 0.9730748474597931, | |
| "num_tokens": 2584451.0, | |
| "step": 700 | |
| }, | |
| { | |
| "entropy": 2.187663435935974, | |
| "epoch": 1.0085287846481876, | |
| "grad_norm": 2.734229803085327, | |
| "learning_rate": 1.8499605732401897e-05, | |
| "loss": 0.03613282144069672, | |
| "mean_token_accuracy": 0.9859623281579268, | |
| "num_tokens": 2618160.0, | |
| "step": 710 | |
| }, | |
| { | |
| "entropy": 2.2002769261598587, | |
| "epoch": 1.0227434257285004, | |
| "grad_norm": 3.451009750366211, | |
| "learning_rate": 1.8450765695353765e-05, | |
| "loss": 0.05161011219024658, | |
| "mean_token_accuracy": 0.9848280772566795, | |
| "num_tokens": 2656683.0, | |
| "step": 720 | |
| }, | |
| { | |
| "entropy": 2.1792144656181334, | |
| "epoch": 1.036958066808813, | |
| "grad_norm": 2.6109533309936523, | |
| "learning_rate": 1.840121006592468e-05, | |
| "loss": 0.05695715546607971, | |
| "mean_token_accuracy": 0.9819708660244941, | |
| "num_tokens": 2693571.0, | |
| "step": 730 | |
| }, | |
| { | |
| "entropy": 2.168749713897705, | |
| "epoch": 1.0511727078891258, | |
| "grad_norm": 2.983471155166626, | |
| "learning_rate": 1.8350943040377104e-05, | |
| "loss": 0.04387234449386597, | |
| "mean_token_accuracy": 0.9895394578576088, | |
| "num_tokens": 2734066.0, | |
| "step": 740 | |
| }, | |
| { | |
| "entropy": 2.150976684689522, | |
| "epoch": 1.0653873489694385, | |
| "grad_norm": 4.730701923370361, | |
| "learning_rate": 1.829996887521297e-05, | |
| "loss": 0.08097095489501953, | |
| "mean_token_accuracy": 0.9824510410428047, | |
| "num_tokens": 2773575.0, | |
| "step": 750 | |
| }, | |
| { | |
| "entropy": 2.202870362997055, | |
| "epoch": 1.0796019900497513, | |
| "grad_norm": 0.6767167448997498, | |
| "learning_rate": 1.8248291886813245e-05, | |
| "loss": 0.045699647068977355, | |
| "mean_token_accuracy": 0.9877486750483513, | |
| "num_tokens": 2809884.0, | |
| "step": 760 | |
| }, | |
| { | |
| "entropy": 2.1357246190309525, | |
| "epoch": 1.0938166311300639, | |
| "grad_norm": 4.62387752532959, | |
| "learning_rate": 1.8195916451072427e-05, | |
| "loss": 0.09070175290107726, | |
| "mean_token_accuracy": 0.978462915122509, | |
| "num_tokens": 2849476.0, | |
| "step": 770 | |
| }, | |
| { | |
| "entropy": 2.157443994283676, | |
| "epoch": 1.1080312722103767, | |
| "grad_norm": 0.9505185484886169, | |
| "learning_rate": 1.8142847003028025e-05, | |
| "loss": 0.11641521453857422, | |
| "mean_token_accuracy": 0.9711179152131081, | |
| "num_tokens": 2885597.0, | |
| "step": 780 | |
| }, | |
| { | |
| "entropy": 2.19150624871254, | |
| "epoch": 1.1222459132906895, | |
| "grad_norm": 0.48967626690864563, | |
| "learning_rate": 1.8089088036484982e-05, | |
| "loss": 0.0332806795835495, | |
| "mean_token_accuracy": 0.9921609848737717, | |
| "num_tokens": 2921138.0, | |
| "step": 790 | |
| }, | |
| { | |
| "entropy": 2.2178327053785325, | |
| "epoch": 1.136460554371002, | |
| "grad_norm": 1.6019129753112793, | |
| "learning_rate": 1.8034644103635168e-05, | |
| "loss": 0.044434782862663266, | |
| "mean_token_accuracy": 0.9820729941129684, | |
| "num_tokens": 2954764.0, | |
| "step": 800 | |
| }, | |
| { | |
| "entropy": 2.164334940910339, | |
| "epoch": 1.1506751954513148, | |
| "grad_norm": 0.8724451661109924, | |
| "learning_rate": 1.7979519814671892e-05, | |
| "loss": 0.03360059857368469, | |
| "mean_token_accuracy": 0.9849594548344612, | |
| "num_tokens": 2986877.0, | |
| "step": 810 | |
| }, | |
| { | |
| "entropy": 2.1950933396816255, | |
| "epoch": 1.1648898365316276, | |
| "grad_norm": 4.613320350646973, | |
| "learning_rate": 1.7923719837399548e-05, | |
| "loss": 0.04860695898532867, | |
| "mean_token_accuracy": 0.9842689201235771, | |
| "num_tokens": 3022958.0, | |
| "step": 820 | |
| }, | |
| { | |
| "entropy": 2.228426894545555, | |
| "epoch": 1.1791044776119404, | |
| "grad_norm": 3.380880355834961, | |
| "learning_rate": 1.786724889683833e-05, | |
| "loss": 0.0661603033542633, | |
| "mean_token_accuracy": 0.9793119549751281, | |
| "num_tokens": 3058741.0, | |
| "step": 830 | |
| }, | |
| { | |
| "entropy": 2.1500797808170318, | |
| "epoch": 1.193319118692253, | |
| "grad_norm": 2.8803505897521973, | |
| "learning_rate": 1.7810111774824145e-05, | |
| "loss": 0.0518546998500824, | |
| "mean_token_accuracy": 0.9858181729912758, | |
| "num_tokens": 3097002.0, | |
| "step": 840 | |
| }, | |
| { | |
| "entropy": 2.134665223956108, | |
| "epoch": 1.2075337597725657, | |
| "grad_norm": 1.3723540306091309, | |
| "learning_rate": 1.7752313309603686e-05, | |
| "loss": 0.0568238615989685, | |
| "mean_token_accuracy": 0.9837430208921433, | |
| "num_tokens": 3135350.0, | |
| "step": 850 | |
| }, | |
| { | |
| "entropy": 2.1059677451848984, | |
| "epoch": 1.2217484008528785, | |
| "grad_norm": 0.2232239991426468, | |
| "learning_rate": 1.7693858395424743e-05, | |
| "loss": 0.029073348641395567, | |
| "mean_token_accuracy": 0.9910536676645278, | |
| "num_tokens": 3175892.0, | |
| "step": 860 | |
| }, | |
| { | |
| "entropy": 2.0856614857912064, | |
| "epoch": 1.235963041933191, | |
| "grad_norm": 3.187932252883911, | |
| "learning_rate": 1.7634751982121772e-05, | |
| "loss": 0.062130671739578244, | |
| "mean_token_accuracy": 0.9819218471646309, | |
| "num_tokens": 3218003.0, | |
| "step": 870 | |
| }, | |
| { | |
| "entropy": 2.151488536596298, | |
| "epoch": 1.2501776830135038, | |
| "grad_norm": 1.0572253465652466, | |
| "learning_rate": 1.7574999074696747e-05, | |
| "loss": 0.024734890460968016, | |
| "mean_token_accuracy": 0.9933405518531799, | |
| "num_tokens": 3255955.0, | |
| "step": 880 | |
| }, | |
| { | |
| "entropy": 2.1391431748867036, | |
| "epoch": 1.2643923240938166, | |
| "grad_norm": 0.6491001844406128, | |
| "learning_rate": 1.7514604732895364e-05, | |
| "loss": 0.015290029346942902, | |
| "mean_token_accuracy": 0.9944353476166725, | |
| "num_tokens": 3290879.0, | |
| "step": 890 | |
| }, | |
| { | |
| "entropy": 2.159931790828705, | |
| "epoch": 1.2786069651741294, | |
| "grad_norm": 0.36106443405151367, | |
| "learning_rate": 1.7453574070778572e-05, | |
| "loss": 0.023708008229732513, | |
| "mean_token_accuracy": 0.9893430173397064, | |
| "num_tokens": 3325818.0, | |
| "step": 900 | |
| }, | |
| { | |
| "entropy": 2.2356686383485793, | |
| "epoch": 1.2928216062544422, | |
| "grad_norm": 0.3880334794521332, | |
| "learning_rate": 1.7391912256289535e-05, | |
| "loss": 0.047500818967819214, | |
| "mean_token_accuracy": 0.9906172767281533, | |
| "num_tokens": 3361101.0, | |
| "step": 910 | |
| }, | |
| { | |
| "entropy": 2.1481542110443117, | |
| "epoch": 1.3070362473347548, | |
| "grad_norm": 1.1337789297103882, | |
| "learning_rate": 1.7329624510816016e-05, | |
| "loss": 0.06250383257865906, | |
| "mean_token_accuracy": 0.986290380358696, | |
| "num_tokens": 3398228.0, | |
| "step": 920 | |
| }, | |
| { | |
| "entropy": 2.199899733066559, | |
| "epoch": 1.3212508884150675, | |
| "grad_norm": 7.506823539733887, | |
| "learning_rate": 1.7266716108748265e-05, | |
| "loss": 0.05416156649589539, | |
| "mean_token_accuracy": 0.9795574441552162, | |
| "num_tokens": 3434391.0, | |
| "step": 930 | |
| }, | |
| { | |
| "entropy": 2.1505257695913316, | |
| "epoch": 1.33546552949538, | |
| "grad_norm": 2.8287599086761475, | |
| "learning_rate": 1.720319237703236e-05, | |
| "loss": 0.03884570896625519, | |
| "mean_token_accuracy": 0.9827989488840103, | |
| "num_tokens": 3476252.0, | |
| "step": 940 | |
| }, | |
| { | |
| "entropy": 2.260223591327667, | |
| "epoch": 1.349680170575693, | |
| "grad_norm": 4.396107196807861, | |
| "learning_rate": 1.713905869471915e-05, | |
| "loss": 0.08108161687850952, | |
| "mean_token_accuracy": 0.9792245835065841, | |
| "num_tokens": 3511513.0, | |
| "step": 950 | |
| }, | |
| { | |
| "entropy": 2.1618774831295013, | |
| "epoch": 1.3638948116560057, | |
| "grad_norm": 2.1915652751922607, | |
| "learning_rate": 1.7074320492508776e-05, | |
| "loss": 0.03704064786434173, | |
| "mean_token_accuracy": 0.9879031211137772, | |
| "num_tokens": 3547869.0, | |
| "step": 960 | |
| }, | |
| { | |
| "entropy": 2.2029319226741793, | |
| "epoch": 1.3781094527363185, | |
| "grad_norm": 1.989353060722351, | |
| "learning_rate": 1.70089832522908e-05, | |
| "loss": 0.04472963809967041, | |
| "mean_token_accuracy": 0.9839362189173698, | |
| "num_tokens": 3582370.0, | |
| "step": 970 | |
| }, | |
| { | |
| "entropy": 2.1237045884132386, | |
| "epoch": 1.3923240938166312, | |
| "grad_norm": 2.7585880756378174, | |
| "learning_rate": 1.6943052506680014e-05, | |
| "loss": 0.017387883365154268, | |
| "mean_token_accuracy": 0.995327465236187, | |
| "num_tokens": 3620986.0, | |
| "step": 980 | |
| }, | |
| { | |
| "entropy": 2.1093700736761094, | |
| "epoch": 1.4065387348969438, | |
| "grad_norm": 0.8583207130432129, | |
| "learning_rate": 1.6876533838547954e-05, | |
| "loss": 0.04421250224113464, | |
| "mean_token_accuracy": 0.9878856271505356, | |
| "num_tokens": 3657882.0, | |
| "step": 990 | |
| }, | |
| { | |
| "entropy": 2.0695310294628144, | |
| "epoch": 1.4207533759772566, | |
| "grad_norm": 0.020872101187705994, | |
| "learning_rate": 1.6809432880550142e-05, | |
| "loss": 0.015215454995632172, | |
| "mean_token_accuracy": 0.9934112429618835, | |
| "num_tokens": 3694203.0, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 1.4207533759772566, | |
| "eval_entropy": 1.996728012305193, | |
| "eval_loss": 0.5132695436477661, | |
| "eval_mean_token_accuracy": 0.912858964382917, | |
| "eval_num_tokens": 3694203.0, | |
| "eval_runtime": 988.7535, | |
| "eval_samples_per_second": 7.738, | |
| "eval_steps_per_second": 0.968, | |
| "step": 1000 | |
| }, | |
| { | |
| "entropy": 2.193378761410713, | |
| "epoch": 1.4349680170575694, | |
| "grad_norm": 1.7698736190795898, | |
| "learning_rate": 1.6741755314649148e-05, | |
| "loss": 0.05021881461143494, | |
| "mean_token_accuracy": 0.9833689332008362, | |
| "num_tokens": 3727853.0, | |
| "step": 1010 | |
| }, | |
| { | |
| "entropy": 2.1755041390657426, | |
| "epoch": 1.449182658137882, | |
| "grad_norm": 8.36669921875, | |
| "learning_rate": 1.6673506871633422e-05, | |
| "loss": 0.07425625920295716, | |
| "mean_token_accuracy": 0.9873648002743721, | |
| "num_tokens": 3761837.0, | |
| "step": 1020 | |
| }, | |
| { | |
| "entropy": 2.2001064866781235, | |
| "epoch": 1.4633972992181947, | |
| "grad_norm": 3.99029278755188, | |
| "learning_rate": 1.6604693330632055e-05, | |
| "loss": 0.060235065221786496, | |
| "mean_token_accuracy": 0.9781348332762718, | |
| "num_tokens": 3798914.0, | |
| "step": 1030 | |
| }, | |
| { | |
| "entropy": 2.121982756257057, | |
| "epoch": 1.4776119402985075, | |
| "grad_norm": 0.9836737513542175, | |
| "learning_rate": 1.6535320518625394e-05, | |
| "loss": 0.02696731984615326, | |
| "mean_token_accuracy": 0.9905053526163101, | |
| "num_tokens": 3838355.0, | |
| "step": 1040 | |
| }, | |
| { | |
| "entropy": 2.170503485202789, | |
| "epoch": 1.4918265813788203, | |
| "grad_norm": 1.3061282634735107, | |
| "learning_rate": 1.6465394309951643e-05, | |
| "loss": 0.03811564743518829, | |
| "mean_token_accuracy": 0.9868202403187751, | |
| "num_tokens": 3873118.0, | |
| "step": 1050 | |
| }, | |
| { | |
| "entropy": 2.184956783056259, | |
| "epoch": 1.5060412224591329, | |
| "grad_norm": 0.16141857206821442, | |
| "learning_rate": 1.639492062580941e-05, | |
| "loss": 0.02506377696990967, | |
| "mean_token_accuracy": 0.9951693743467331, | |
| "num_tokens": 3907762.0, | |
| "step": 1060 | |
| }, | |
| { | |
| "entropy": 2.2151595264673234, | |
| "epoch": 1.5202558635394456, | |
| "grad_norm": 1.2822521924972534, | |
| "learning_rate": 1.6323905433756348e-05, | |
| "loss": 0.04546615481376648, | |
| "mean_token_accuracy": 0.9900464177131653, | |
| "num_tokens": 3942498.0, | |
| "step": 1070 | |
| }, | |
| { | |
| "entropy": 2.2206559479236603, | |
| "epoch": 1.5344705046197582, | |
| "grad_norm": 1.1591120958328247, | |
| "learning_rate": 1.6252354747203804e-05, | |
| "loss": 0.0512237548828125, | |
| "mean_token_accuracy": 0.9911876812577247, | |
| "num_tokens": 3974758.0, | |
| "step": 1080 | |
| }, | |
| { | |
| "entropy": 2.1994840264320374, | |
| "epoch": 1.548685145700071, | |
| "grad_norm": 1.1228119134902954, | |
| "learning_rate": 1.6180274624907637e-05, | |
| "loss": 0.052582383155822754, | |
| "mean_token_accuracy": 0.9877693071961403, | |
| "num_tokens": 4010393.0, | |
| "step": 1090 | |
| }, | |
| { | |
| "entropy": 2.2292975306510927, | |
| "epoch": 1.5628997867803838, | |
| "grad_norm": 4.671175479888916, | |
| "learning_rate": 1.6107671170455164e-05, | |
| "loss": 0.037269750237464906, | |
| "mean_token_accuracy": 0.9906544610857964, | |
| "num_tokens": 4042491.0, | |
| "step": 1100 | |
| }, | |
| { | |
| "entropy": 2.1922069817781447, | |
| "epoch": 1.5771144278606966, | |
| "grad_norm": 0.815264105796814, | |
| "learning_rate": 1.603455053174833e-05, | |
| "loss": 0.05773057341575623, | |
| "mean_token_accuracy": 0.9827793538570404, | |
| "num_tokens": 4082169.0, | |
| "step": 1110 | |
| }, | |
| { | |
| "entropy": 2.1343121081590652, | |
| "epoch": 1.5913290689410093, | |
| "grad_norm": 1.9564604759216309, | |
| "learning_rate": 1.5960918900483112e-05, | |
| "loss": 0.06395858526229858, | |
| "mean_token_accuracy": 0.9741567522287369, | |
| "num_tokens": 4120949.0, | |
| "step": 1120 | |
| }, | |
| { | |
| "entropy": 2.116546794772148, | |
| "epoch": 1.6055437100213221, | |
| "grad_norm": 0.6864196062088013, | |
| "learning_rate": 1.5886782511625216e-05, | |
| "loss": 0.035008615255355834, | |
| "mean_token_accuracy": 0.9885725691914559, | |
| "num_tokens": 4155338.0, | |
| "step": 1130 | |
| }, | |
| { | |
| "entropy": 2.101371333003044, | |
| "epoch": 1.6197583511016347, | |
| "grad_norm": 2.144096851348877, | |
| "learning_rate": 1.5812147642882126e-05, | |
| "loss": 0.05081506371498108, | |
| "mean_token_accuracy": 0.9900156706571579, | |
| "num_tokens": 4193065.0, | |
| "step": 1140 | |
| }, | |
| { | |
| "entropy": 2.1167595058679582, | |
| "epoch": 1.6339729921819472, | |
| "grad_norm": 3.001270055770874, | |
| "learning_rate": 1.57370206141715e-05, | |
| "loss": 0.029940304160118104, | |
| "mean_token_accuracy": 0.9919799283146858, | |
| "num_tokens": 4233177.0, | |
| "step": 1150 | |
| }, | |
| { | |
| "entropy": 2.1953104764223097, | |
| "epoch": 1.64818763326226, | |
| "grad_norm": 0.5304042100906372, | |
| "learning_rate": 1.5661407787086052e-05, | |
| "loss": 0.04557282626628876, | |
| "mean_token_accuracy": 0.9914614632725716, | |
| "num_tokens": 4270719.0, | |
| "step": 1160 | |
| }, | |
| { | |
| "entropy": 2.195063552260399, | |
| "epoch": 1.6624022743425728, | |
| "grad_norm": 2.064101219177246, | |
| "learning_rate": 1.5585315564354816e-05, | |
| "loss": 0.02791608273983002, | |
| "mean_token_accuracy": 0.9903463527560235, | |
| "num_tokens": 4307326.0, | |
| "step": 1170 | |
| }, | |
| { | |
| "entropy": 2.160296180844307, | |
| "epoch": 1.6766169154228856, | |
| "grad_norm": 0.20038703083992004, | |
| "learning_rate": 1.5508750389301018e-05, | |
| "loss": 0.018147528171539307, | |
| "mean_token_accuracy": 0.9959616541862488, | |
| "num_tokens": 4342167.0, | |
| "step": 1180 | |
| }, | |
| { | |
| "entropy": 2.0997723072767256, | |
| "epoch": 1.6908315565031984, | |
| "grad_norm": 0.4269106388092041, | |
| "learning_rate": 1.5431718745296446e-05, | |
| "loss": 0.031970590353012085, | |
| "mean_token_accuracy": 0.9925994470715522, | |
| "num_tokens": 4378382.0, | |
| "step": 1190 | |
| }, | |
| { | |
| "entropy": 2.15362486243248, | |
| "epoch": 1.7050461975835112, | |
| "grad_norm": 1.4277267456054688, | |
| "learning_rate": 1.5354227155212455e-05, | |
| "loss": 0.03519009053707123, | |
| "mean_token_accuracy": 0.9948211744427681, | |
| "num_tokens": 4412402.0, | |
| "step": 1200 | |
| }, | |
| { | |
| "entropy": 2.1371404409408568, | |
| "epoch": 1.7192608386638237, | |
| "grad_norm": 2.0894289016723633, | |
| "learning_rate": 1.527628218086765e-05, | |
| "loss": 0.05730880498886108, | |
| "mean_token_accuracy": 0.9833267420530319, | |
| "num_tokens": 4448245.0, | |
| "step": 1210 | |
| }, | |
| { | |
| "entropy": 2.1023225128650664, | |
| "epoch": 1.7334754797441365, | |
| "grad_norm": 3.533341407775879, | |
| "learning_rate": 1.5197890422472204e-05, | |
| "loss": 0.039241823554039004, | |
| "mean_token_accuracy": 0.9856926873326302, | |
| "num_tokens": 4483857.0, | |
| "step": 1220 | |
| }, | |
| { | |
| "entropy": 2.0918066024780275, | |
| "epoch": 1.747690120824449, | |
| "grad_norm": 1.4843463897705078, | |
| "learning_rate": 1.5119058518068994e-05, | |
| "loss": 0.03128263652324677, | |
| "mean_token_accuracy": 0.9900650411844254, | |
| "num_tokens": 4525449.0, | |
| "step": 1230 | |
| }, | |
| { | |
| "entropy": 2.1807575821876526, | |
| "epoch": 1.7619047619047619, | |
| "grad_norm": 2.492711305618286, | |
| "learning_rate": 1.5039793142971501e-05, | |
| "loss": 0.061214137077331546, | |
| "mean_token_accuracy": 0.9877642571926117, | |
| "num_tokens": 4564889.0, | |
| "step": 1240 | |
| }, | |
| { | |
| "entropy": 2.13520385324955, | |
| "epoch": 1.7761194029850746, | |
| "grad_norm": 0.8968533873558044, | |
| "learning_rate": 1.496010100919856e-05, | |
| "loss": 0.04278126358985901, | |
| "mean_token_accuracy": 0.9871073856949806, | |
| "num_tokens": 4601655.0, | |
| "step": 1250 | |
| }, | |
| { | |
| "entropy": 2.135896974802017, | |
| "epoch": 1.7903340440653874, | |
| "grad_norm": 0.5659345388412476, | |
| "learning_rate": 1.4879988864905992e-05, | |
| "loss": 0.039053690433502194, | |
| "mean_token_accuracy": 0.990781481564045, | |
| "num_tokens": 4637400.0, | |
| "step": 1260 | |
| }, | |
| { | |
| "entropy": 2.14559406042099, | |
| "epoch": 1.8045486851457002, | |
| "grad_norm": 1.262707233428955, | |
| "learning_rate": 1.4799463493815199e-05, | |
| "loss": 0.05618187189102173, | |
| "mean_token_accuracy": 0.9844638153910636, | |
| "num_tokens": 4675200.0, | |
| "step": 1270 | |
| }, | |
| { | |
| "entropy": 2.130327156186104, | |
| "epoch": 1.8187633262260128, | |
| "grad_norm": 1.905463457107544, | |
| "learning_rate": 1.4718531714638719e-05, | |
| "loss": 0.03753847479820251, | |
| "mean_token_accuracy": 0.9798910677433014, | |
| "num_tokens": 4712415.0, | |
| "step": 1280 | |
| }, | |
| { | |
| "entropy": 2.061409738659859, | |
| "epoch": 1.8329779673063256, | |
| "grad_norm": 2.095902681350708, | |
| "learning_rate": 1.4637200380502842e-05, | |
| "loss": 0.04141142666339874, | |
| "mean_token_accuracy": 0.984546284377575, | |
| "num_tokens": 4752936.0, | |
| "step": 1290 | |
| }, | |
| { | |
| "entropy": 2.12393804192543, | |
| "epoch": 1.8471926083866381, | |
| "grad_norm": 2.4633586406707764, | |
| "learning_rate": 1.4555476378367304e-05, | |
| "loss": 0.03877743482589722, | |
| "mean_token_accuracy": 0.98830596357584, | |
| "num_tokens": 4789364.0, | |
| "step": 1300 | |
| }, | |
| { | |
| "entropy": 2.1741877257823945, | |
| "epoch": 1.861407249466951, | |
| "grad_norm": 0.22966082394123077, | |
| "learning_rate": 1.4473366628442093e-05, | |
| "loss": 0.06458597779273986, | |
| "mean_token_accuracy": 0.9805670469999314, | |
| "num_tokens": 4825122.0, | |
| "step": 1310 | |
| }, | |
| { | |
| "entropy": 2.2013738095760345, | |
| "epoch": 1.8756218905472637, | |
| "grad_norm": 0.31942903995513916, | |
| "learning_rate": 1.4390878083601498e-05, | |
| "loss": 0.012605372071266174, | |
| "mean_token_accuracy": 0.9942255452275276, | |
| "num_tokens": 4856314.0, | |
| "step": 1320 | |
| }, | |
| { | |
| "entropy": 2.1380729913711547, | |
| "epoch": 1.8898365316275765, | |
| "grad_norm": 1.0672839879989624, | |
| "learning_rate": 1.4308017728795322e-05, | |
| "loss": 0.019631707668304445, | |
| "mean_token_accuracy": 0.9956912875175477, | |
| "num_tokens": 4894480.0, | |
| "step": 1330 | |
| }, | |
| { | |
| "entropy": 2.144209420681, | |
| "epoch": 1.9040511727078893, | |
| "grad_norm": 3.408994674682617, | |
| "learning_rate": 1.4224792580457431e-05, | |
| "loss": 0.07080478072166443, | |
| "mean_token_accuracy": 0.9856290057301521, | |
| "num_tokens": 4928079.0, | |
| "step": 1340 | |
| }, | |
| { | |
| "entropy": 2.127260631322861, | |
| "epoch": 1.9182658137882018, | |
| "grad_norm": 1.3405135869979858, | |
| "learning_rate": 1.4141209685911603e-05, | |
| "loss": 0.03551123440265656, | |
| "mean_token_accuracy": 0.9912566438317298, | |
| "num_tokens": 4966874.0, | |
| "step": 1350 | |
| }, | |
| { | |
| "entropy": 2.057062420248985, | |
| "epoch": 1.9324804548685146, | |
| "grad_norm": 2.4303998947143555, | |
| "learning_rate": 1.4057276122774784e-05, | |
| "loss": 0.025794893503189087, | |
| "mean_token_accuracy": 0.9910008162260056, | |
| "num_tokens": 5014153.0, | |
| "step": 1360 | |
| }, | |
| { | |
| "entropy": 2.0976122200489042, | |
| "epoch": 1.9466950959488272, | |
| "grad_norm": 0.975439727306366, | |
| "learning_rate": 1.3972998998357778e-05, | |
| "loss": 0.057805228233337405, | |
| "mean_token_accuracy": 0.9882346078753471, | |
| "num_tokens": 5050370.0, | |
| "step": 1370 | |
| }, | |
| { | |
| "entropy": 2.12088503241539, | |
| "epoch": 1.96090973702914, | |
| "grad_norm": 2.241792917251587, | |
| "learning_rate": 1.38883854490634e-05, | |
| "loss": 0.02719011902809143, | |
| "mean_token_accuracy": 0.9968120694160462, | |
| "num_tokens": 5089198.0, | |
| "step": 1380 | |
| }, | |
| { | |
| "entropy": 2.186630555987358, | |
| "epoch": 1.9751243781094527, | |
| "grad_norm": 0.02887093275785446, | |
| "learning_rate": 1.380344263978219e-05, | |
| "loss": 0.02653237581253052, | |
| "mean_token_accuracy": 0.9873360604047775, | |
| "num_tokens": 5125154.0, | |
| "step": 1390 | |
| }, | |
| { | |
| "entropy": 2.0880779802799223, | |
| "epoch": 1.9893390191897655, | |
| "grad_norm": 0.06101665645837784, | |
| "learning_rate": 1.371817776328571e-05, | |
| "loss": 0.017497384548187257, | |
| "mean_token_accuracy": 0.9919103473424912, | |
| "num_tokens": 5165570.0, | |
| "step": 1400 | |
| }, | |
| { | |
| "entropy": 2.1103323039255644, | |
| "epoch": 2.0028429282160625, | |
| "grad_norm": 2.5834667682647705, | |
| "learning_rate": 1.3632598039617459e-05, | |
| "loss": 0.028596514463424684, | |
| "mean_token_accuracy": 0.9918049009222734, | |
| "num_tokens": 5200022.0, | |
| "step": 1410 | |
| }, | |
| { | |
| "entropy": 2.080328956246376, | |
| "epoch": 2.0170575692963753, | |
| "grad_norm": 2.0883054733276367, | |
| "learning_rate": 1.3546710715481528e-05, | |
| "loss": 0.010676021128892899, | |
| "mean_token_accuracy": 0.9944428727030754, | |
| "num_tokens": 5239050.0, | |
| "step": 1420 | |
| }, | |
| { | |
| "entropy": 2.11694977581501, | |
| "epoch": 2.031272210376688, | |
| "grad_norm": 0.6384166479110718, | |
| "learning_rate": 1.346052306362892e-05, | |
| "loss": 0.031712406873703004, | |
| "mean_token_accuracy": 0.99215517193079, | |
| "num_tokens": 5278603.0, | |
| "step": 1430 | |
| }, | |
| { | |
| "entropy": 2.1320772975683213, | |
| "epoch": 2.045486851457001, | |
| "grad_norm": 0.04183308035135269, | |
| "learning_rate": 1.3374042382241743e-05, | |
| "loss": 0.024064309895038605, | |
| "mean_token_accuracy": 0.9902747467160224, | |
| "num_tokens": 5312650.0, | |
| "step": 1440 | |
| }, | |
| { | |
| "entropy": 2.133982640504837, | |
| "epoch": 2.0597014925373136, | |
| "grad_norm": 1.4074985980987549, | |
| "learning_rate": 1.3287275994315211e-05, | |
| "loss": 0.017666606605052947, | |
| "mean_token_accuracy": 0.9940287739038467, | |
| "num_tokens": 5346534.0, | |
| "step": 1450 | |
| }, | |
| { | |
| "entropy": 2.1367667734622957, | |
| "epoch": 2.073916133617626, | |
| "grad_norm": 1.0920348167419434, | |
| "learning_rate": 1.3200231247037534e-05, | |
| "loss": 0.010746689885854721, | |
| "mean_token_accuracy": 0.9960371211171151, | |
| "num_tokens": 5384670.0, | |
| "step": 1460 | |
| }, | |
| { | |
| "entropy": 2.133867809176445, | |
| "epoch": 2.0881307746979387, | |
| "grad_norm": 1.6067408323287964, | |
| "learning_rate": 1.3112915511167792e-05, | |
| "loss": 0.036738994717597964, | |
| "mean_token_accuracy": 0.988915441930294, | |
| "num_tokens": 5420443.0, | |
| "step": 1470 | |
| }, | |
| { | |
| "entropy": 2.174367681145668, | |
| "epoch": 2.1023454157782515, | |
| "grad_norm": 0.5817322134971619, | |
| "learning_rate": 1.3025336180411783e-05, | |
| "loss": 0.018730011582374573, | |
| "mean_token_accuracy": 0.9928426295518875, | |
| "num_tokens": 5455408.0, | |
| "step": 1480 | |
| }, | |
| { | |
| "entropy": 2.1845018327236176, | |
| "epoch": 2.1165600568585643, | |
| "grad_norm": 0.9014100432395935, | |
| "learning_rate": 1.2937500670795941e-05, | |
| "loss": 0.008142998069524765, | |
| "mean_token_accuracy": 0.9969136103987694, | |
| "num_tokens": 5486597.0, | |
| "step": 1490 | |
| }, | |
| { | |
| "entropy": 2.1422977685928344, | |
| "epoch": 2.130774697938877, | |
| "grad_norm": 0.015557660721242428, | |
| "learning_rate": 1.2849416420039378e-05, | |
| "loss": 0.029416123032569887, | |
| "mean_token_accuracy": 0.9883611053228378, | |
| "num_tokens": 5523135.0, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 2.130774697938877, | |
| "eval_entropy": 2.012462474460263, | |
| "eval_loss": 0.4876999855041504, | |
| "eval_mean_token_accuracy": 0.9161205261229473, | |
| "eval_num_tokens": 5523135.0, | |
| "eval_runtime": 989.9438, | |
| "eval_samples_per_second": 7.729, | |
| "eval_steps_per_second": 0.967, | |
| "step": 1500 | |
| }, | |
| { | |
| "entropy": 2.153908830881119, | |
| "epoch": 2.14498933901919, | |
| "grad_norm": 0.4453883767127991, | |
| "learning_rate": 1.276109088692405e-05, | |
| "loss": 0.016275449097156523, | |
| "mean_token_accuracy": 0.9947501629590988, | |
| "num_tokens": 5561113.0, | |
| "step": 1510 | |
| }, | |
| { | |
| "entropy": 2.1447213143110275, | |
| "epoch": 2.1592039800995027, | |
| "grad_norm": 0.09290453791618347, | |
| "learning_rate": 1.267253155066318e-05, | |
| "loss": 0.0074017919600009915, | |
| "mean_token_accuracy": 0.9969444438815117, | |
| "num_tokens": 5602031.0, | |
| "step": 1520 | |
| }, | |
| { | |
| "entropy": 2.1633759051561356, | |
| "epoch": 2.173418621179815, | |
| "grad_norm": 0.0523543544113636, | |
| "learning_rate": 1.2583745910267935e-05, | |
| "loss": 0.010185372829437257, | |
| "mean_token_accuracy": 0.9974342107772827, | |
| "num_tokens": 5644054.0, | |
| "step": 1530 | |
| }, | |
| { | |
| "entropy": 2.1849102139472962, | |
| "epoch": 2.1876332622601278, | |
| "grad_norm": 1.58631432056427, | |
| "learning_rate": 1.2494741483912414e-05, | |
| "loss": 0.025118106603622438, | |
| "mean_token_accuracy": 0.9866239562630653, | |
| "num_tokens": 5679892.0, | |
| "step": 1540 | |
| }, | |
| { | |
| "entropy": 2.0871244966983795, | |
| "epoch": 2.2018479033404406, | |
| "grad_norm": 0.07445530593395233, | |
| "learning_rate": 1.2405525808297041e-05, | |
| "loss": 0.012176018953323365, | |
| "mean_token_accuracy": 0.9966624140739441, | |
| "num_tokens": 5719192.0, | |
| "step": 1550 | |
| }, | |
| { | |
| "entropy": 2.1434724926948547, | |
| "epoch": 2.2160625444207533, | |
| "grad_norm": 0.22022129595279694, | |
| "learning_rate": 1.2316106438010363e-05, | |
| "loss": 0.011503981798887253, | |
| "mean_token_accuracy": 0.9932158127427101, | |
| "num_tokens": 5754586.0, | |
| "step": 1560 | |
| }, | |
| { | |
| "entropy": 2.1378200381994246, | |
| "epoch": 2.230277185501066, | |
| "grad_norm": 0.2574051022529602, | |
| "learning_rate": 1.2226490944889344e-05, | |
| "loss": 0.016648434102535248, | |
| "mean_token_accuracy": 0.99627845287323, | |
| "num_tokens": 5790164.0, | |
| "step": 1570 | |
| }, | |
| { | |
| "entropy": 2.1425430297851564, | |
| "epoch": 2.244491826581379, | |
| "grad_norm": 0.07441271096467972, | |
| "learning_rate": 1.2136686917378207e-05, | |
| "loss": 0.011707275360822677, | |
| "mean_token_accuracy": 0.9969677910208702, | |
| "num_tokens": 5826790.0, | |
| "step": 1580 | |
| }, | |
| { | |
| "entropy": 2.145805537700653, | |
| "epoch": 2.2587064676616917, | |
| "grad_norm": 0.025231340900063515, | |
| "learning_rate": 1.204670195988585e-05, | |
| "loss": 0.015510520339012146, | |
| "mean_token_accuracy": 0.9958001673221588, | |
| "num_tokens": 5864353.0, | |
| "step": 1590 | |
| }, | |
| { | |
| "entropy": 2.12614686191082, | |
| "epoch": 2.272921108742004, | |
| "grad_norm": 4.177783012390137, | |
| "learning_rate": 1.1956543692141925e-05, | |
| "loss": 0.02458135187625885, | |
| "mean_token_accuracy": 0.994461864233017, | |
| "num_tokens": 5901111.0, | |
| "step": 1600 | |
| }, | |
| { | |
| "entropy": 2.199042108654976, | |
| "epoch": 2.287135749822317, | |
| "grad_norm": 0.387260764837265, | |
| "learning_rate": 1.1866219748551627e-05, | |
| "loss": 0.027851936221122742, | |
| "mean_token_accuracy": 0.9944206327199936, | |
| "num_tokens": 5938751.0, | |
| "step": 1610 | |
| }, | |
| { | |
| "entropy": 2.1385419756174087, | |
| "epoch": 2.3013503909026296, | |
| "grad_norm": 1.4362543821334839, | |
| "learning_rate": 1.177573777754921e-05, | |
| "loss": 0.029392656683921815, | |
| "mean_token_accuracy": 0.9920833334326744, | |
| "num_tokens": 5975587.0, | |
| "step": 1620 | |
| }, | |
| { | |
| "entropy": 2.1314716190099716, | |
| "epoch": 2.3155650319829424, | |
| "grad_norm": 2.3883039951324463, | |
| "learning_rate": 1.1685105440950351e-05, | |
| "loss": 0.015017279982566833, | |
| "mean_token_accuracy": 0.9914116650819779, | |
| "num_tokens": 6011431.0, | |
| "step": 1630 | |
| }, | |
| { | |
| "entropy": 2.113403910398483, | |
| "epoch": 2.329779673063255, | |
| "grad_norm": 0.17976875603199005, | |
| "learning_rate": 1.1594330413303354e-05, | |
| "loss": 0.0052622310817241665, | |
| "mean_token_accuracy": 0.9989999994635582, | |
| "num_tokens": 6051027.0, | |
| "step": 1640 | |
| }, | |
| { | |
| "entropy": 2.1885013312101362, | |
| "epoch": 2.343994314143568, | |
| "grad_norm": 2.1475982666015625, | |
| "learning_rate": 1.1503420381239288e-05, | |
| "loss": 0.049869978427886964, | |
| "mean_token_accuracy": 0.9862573102116585, | |
| "num_tokens": 6086770.0, | |
| "step": 1650 | |
| }, | |
| { | |
| "entropy": 2.154399809241295, | |
| "epoch": 2.3582089552238807, | |
| "grad_norm": 0.7839910984039307, | |
| "learning_rate": 1.1412383042821103e-05, | |
| "loss": 0.012508201599121093, | |
| "mean_token_accuracy": 0.9969967931509018, | |
| "num_tokens": 6120066.0, | |
| "step": 1660 | |
| }, | |
| { | |
| "entropy": 2.1582394361495973, | |
| "epoch": 2.372423596304193, | |
| "grad_norm": 0.127841517329216, | |
| "learning_rate": 1.1321226106891774e-05, | |
| "loss": 0.03399866819381714, | |
| "mean_token_accuracy": 0.9926647707819939, | |
| "num_tokens": 6155122.0, | |
| "step": 1670 | |
| }, | |
| { | |
| "entropy": 2.1920375645160677, | |
| "epoch": 2.386638237384506, | |
| "grad_norm": 0.5719994306564331, | |
| "learning_rate": 1.1229957292421532e-05, | |
| "loss": 0.01301535964012146, | |
| "mean_token_accuracy": 0.9950501263141632, | |
| "num_tokens": 6189949.0, | |
| "step": 1680 | |
| }, | |
| { | |
| "entropy": 2.1470602810382844, | |
| "epoch": 2.4008528784648187, | |
| "grad_norm": 0.01053235400468111, | |
| "learning_rate": 1.1138584327854236e-05, | |
| "loss": 0.006975927203893661, | |
| "mean_token_accuracy": 0.9970934271812439, | |
| "num_tokens": 6227742.0, | |
| "step": 1690 | |
| }, | |
| { | |
| "entropy": 2.164599558711052, | |
| "epoch": 2.4150675195451314, | |
| "grad_norm": 4.409539699554443, | |
| "learning_rate": 1.1047114950452946e-05, | |
| "loss": 0.03146063089370728, | |
| "mean_token_accuracy": 0.9898314952850342, | |
| "num_tokens": 6261770.0, | |
| "step": 1700 | |
| }, | |
| { | |
| "entropy": 2.097541519999504, | |
| "epoch": 2.429282160625444, | |
| "grad_norm": 0.33211779594421387, | |
| "learning_rate": 1.0955556905644758e-05, | |
| "loss": 0.015510906279087067, | |
| "mean_token_accuracy": 0.9964471086859703, | |
| "num_tokens": 6302590.0, | |
| "step": 1710 | |
| }, | |
| { | |
| "entropy": 2.110760509967804, | |
| "epoch": 2.443496801705757, | |
| "grad_norm": 0.07505965232849121, | |
| "learning_rate": 1.0863917946364924e-05, | |
| "loss": 0.020162013173103333, | |
| "mean_token_accuracy": 0.9964295968413353, | |
| "num_tokens": 6342274.0, | |
| "step": 1720 | |
| }, | |
| { | |
| "entropy": 2.2031593352556227, | |
| "epoch": 2.45771144278607, | |
| "grad_norm": 0.1552923619747162, | |
| "learning_rate": 1.0772205832400357e-05, | |
| "loss": 0.021290890872478485, | |
| "mean_token_accuracy": 0.9951711297035217, | |
| "num_tokens": 6374676.0, | |
| "step": 1730 | |
| }, | |
| { | |
| "entropy": 2.1717267662286757, | |
| "epoch": 2.471926083866382, | |
| "grad_norm": 0.05812852829694748, | |
| "learning_rate": 1.0680428329732552e-05, | |
| "loss": 0.016620045900344847, | |
| "mean_token_accuracy": 0.9949463814496994, | |
| "num_tokens": 6411553.0, | |
| "step": 1740 | |
| }, | |
| { | |
| "entropy": 2.145307409763336, | |
| "epoch": 2.486140724946695, | |
| "grad_norm": 0.14837434887886047, | |
| "learning_rate": 1.0588593209879973e-05, | |
| "loss": 0.01613246649503708, | |
| "mean_token_accuracy": 0.9933097556233406, | |
| "num_tokens": 6445362.0, | |
| "step": 1750 | |
| }, | |
| { | |
| "entropy": 2.1177578270435333, | |
| "epoch": 2.5003553660270077, | |
| "grad_norm": 0.11420247703790665, | |
| "learning_rate": 1.0496708249239988e-05, | |
| "loss": 0.01733055114746094, | |
| "mean_token_accuracy": 0.9933325245976448, | |
| "num_tokens": 6480042.0, | |
| "step": 1760 | |
| }, | |
| { | |
| "entropy": 2.0375625282526015, | |
| "epoch": 2.5145700071073205, | |
| "grad_norm": 1.124937891960144, | |
| "learning_rate": 1.0404781228430365e-05, | |
| "loss": 0.014401055872440338, | |
| "mean_token_accuracy": 0.99840377420187, | |
| "num_tokens": 6523509.0, | |
| "step": 1770 | |
| }, | |
| { | |
| "entropy": 2.061618319153786, | |
| "epoch": 2.5287846481876333, | |
| "grad_norm": 2.1306679248809814, | |
| "learning_rate": 1.0312819931630438e-05, | |
| "loss": 0.011978740990161895, | |
| "mean_token_accuracy": 0.9983922109007836, | |
| "num_tokens": 6564762.0, | |
| "step": 1780 | |
| }, | |
| { | |
| "entropy": 2.144868162274361, | |
| "epoch": 2.542999289267946, | |
| "grad_norm": 2.329023599624634, | |
| "learning_rate": 1.022083214592196e-05, | |
| "loss": 0.015902377665042877, | |
| "mean_token_accuracy": 0.9979761898517608, | |
| "num_tokens": 6604633.0, | |
| "step": 1790 | |
| }, | |
| { | |
| "entropy": 2.1159115850925447, | |
| "epoch": 2.557213930348259, | |
| "grad_norm": 1.4145407676696777, | |
| "learning_rate": 1.0128825660629709e-05, | |
| "loss": 0.020478679239749907, | |
| "mean_token_accuracy": 0.9979009658098221, | |
| "num_tokens": 6641133.0, | |
| "step": 1800 | |
| }, | |
| { | |
| "entropy": 2.0676650613546372, | |
| "epoch": 2.571428571428571, | |
| "grad_norm": 0.48140275478363037, | |
| "learning_rate": 1.0036808266661893e-05, | |
| "loss": 0.022186580300331115, | |
| "mean_token_accuracy": 0.9940819069743156, | |
| "num_tokens": 6682211.0, | |
| "step": 1810 | |
| }, | |
| { | |
| "entropy": 2.12384712100029, | |
| "epoch": 2.5856432125088844, | |
| "grad_norm": 2.0902743339538574, | |
| "learning_rate": 9.944787755850455e-06, | |
| "loss": 0.01327282041311264, | |
| "mean_token_accuracy": 0.9970363482832909, | |
| "num_tokens": 6720217.0, | |
| "step": 1820 | |
| }, | |
| { | |
| "entropy": 2.152281162142754, | |
| "epoch": 2.5998578535891967, | |
| "grad_norm": 0.4297999441623688, | |
| "learning_rate": 9.852771920291257e-06, | |
| "loss": 0.00764169842004776, | |
| "mean_token_accuracy": 0.9964661106467247, | |
| "num_tokens": 6755330.0, | |
| "step": 1830 | |
| }, | |
| { | |
| "entropy": 2.133743789792061, | |
| "epoch": 2.6140724946695095, | |
| "grad_norm": 1.7086399793624878, | |
| "learning_rate": 9.760768551684272e-06, | |
| "loss": 0.014149065315723418, | |
| "mean_token_accuracy": 0.9932047992944717, | |
| "num_tokens": 6789704.0, | |
| "step": 1840 | |
| }, | |
| { | |
| "entropy": 2.220897752046585, | |
| "epoch": 2.6282871357498223, | |
| "grad_norm": 0.37043172121047974, | |
| "learning_rate": 9.668785440673802e-06, | |
| "loss": 0.010798779129981995, | |
| "mean_token_accuracy": 0.9927522420883179, | |
| "num_tokens": 6829906.0, | |
| "step": 1850 | |
| }, | |
| { | |
| "entropy": 2.1690511107444763, | |
| "epoch": 2.642501776830135, | |
| "grad_norm": 3.446093797683716, | |
| "learning_rate": 9.576830376188779e-06, | |
| "loss": 0.011588881909847259, | |
| "mean_token_accuracy": 0.9942647039890289, | |
| "num_tokens": 6862241.0, | |
| "step": 1860 | |
| }, | |
| { | |
| "entropy": 2.104657456278801, | |
| "epoch": 2.656716417910448, | |
| "grad_norm": 6.990153789520264, | |
| "learning_rate": 9.484911144783216e-06, | |
| "loss": 0.031561356782913205, | |
| "mean_token_accuracy": 0.9918665274977684, | |
| "num_tokens": 6902231.0, | |
| "step": 1870 | |
| }, | |
| { | |
| "entropy": 2.099566176533699, | |
| "epoch": 2.67093105899076, | |
| "grad_norm": 1.5687507390975952, | |
| "learning_rate": 9.393035529976857e-06, | |
| "loss": 0.03302261531352997, | |
| "mean_token_accuracy": 0.994696919620037, | |
| "num_tokens": 6943523.0, | |
| "step": 1880 | |
| }, | |
| { | |
| "entropy": 2.0341563537716865, | |
| "epoch": 2.6851457000710734, | |
| "grad_norm": 0.01727372594177723, | |
| "learning_rate": 9.301211311596091e-06, | |
| "loss": 0.009831630438566209, | |
| "mean_token_accuracy": 0.9966520965099335, | |
| "num_tokens": 6980909.0, | |
| "step": 1890 | |
| }, | |
| { | |
| "entropy": 2.142310842871666, | |
| "epoch": 2.699360341151386, | |
| "grad_norm": 2.9104232788085938, | |
| "learning_rate": 9.209446265115162e-06, | |
| "loss": 0.012867218255996704, | |
| "mean_token_accuracy": 0.9898214012384414, | |
| "num_tokens": 7017337.0, | |
| "step": 1900 | |
| }, | |
| { | |
| "entropy": 2.1923003911972048, | |
| "epoch": 2.7135749822316986, | |
| "grad_norm": 0.02433944121003151, | |
| "learning_rate": 9.117748160997786e-06, | |
| "loss": 0.006733021140098572, | |
| "mean_token_accuracy": 0.9975520834326744, | |
| "num_tokens": 7055337.0, | |
| "step": 1910 | |
| }, | |
| { | |
| "entropy": 2.1514430910348894, | |
| "epoch": 2.7277896233120114, | |
| "grad_norm": 0.08054083585739136, | |
| "learning_rate": 9.026124764039123e-06, | |
| "loss": 0.03414789140224457, | |
| "mean_token_accuracy": 0.9952777773141861, | |
| "num_tokens": 7091211.0, | |
| "step": 1920 | |
| }, | |
| { | |
| "entropy": 2.072894513607025, | |
| "epoch": 2.742004264392324, | |
| "grad_norm": 1.8925641775131226, | |
| "learning_rate": 8.934583832708305e-06, | |
| "loss": 0.010989753156900406, | |
| "mean_token_accuracy": 0.9934895843267441, | |
| "num_tokens": 7126267.0, | |
| "step": 1930 | |
| }, | |
| { | |
| "entropy": 2.0974434345960615, | |
| "epoch": 2.756218905472637, | |
| "grad_norm": 4.07625675201416, | |
| "learning_rate": 8.843133118491456e-06, | |
| "loss": 0.036723607778549196, | |
| "mean_token_accuracy": 0.9936398908495903, | |
| "num_tokens": 7162232.0, | |
| "step": 1940 | |
| }, | |
| { | |
| "entropy": 2.1628644078969956, | |
| "epoch": 2.7704335465529493, | |
| "grad_norm": 0.19412127137184143, | |
| "learning_rate": 8.751780365235308e-06, | |
| "loss": 0.016048797965049745, | |
| "mean_token_accuracy": 0.9971778348088265, | |
| "num_tokens": 7199909.0, | |
| "step": 1950 | |
| }, | |
| { | |
| "entropy": 2.091540029644966, | |
| "epoch": 2.7846481876332625, | |
| "grad_norm": 3.252357006072998, | |
| "learning_rate": 8.660533308491476e-06, | |
| "loss": 0.047638151049613955, | |
| "mean_token_accuracy": 0.9874005153775215, | |
| "num_tokens": 7236809.0, | |
| "step": 1960 | |
| }, | |
| { | |
| "entropy": 2.1849084466695787, | |
| "epoch": 2.798862828713575, | |
| "grad_norm": 0.08695745468139648, | |
| "learning_rate": 8.569399674861426e-06, | |
| "loss": 0.02756718695163727, | |
| "mean_token_accuracy": 0.9911953061819077, | |
| "num_tokens": 7274060.0, | |
| "step": 1970 | |
| }, | |
| { | |
| "entropy": 2.1544810086488724, | |
| "epoch": 2.8130774697938876, | |
| "grad_norm": 1.6851823329925537, | |
| "learning_rate": 8.478387181342195e-06, | |
| "loss": 0.018534281849861146, | |
| "mean_token_accuracy": 0.9929023250937462, | |
| "num_tokens": 7314220.0, | |
| "step": 1980 | |
| }, | |
| { | |
| "entropy": 2.131257200241089, | |
| "epoch": 2.8272921108742004, | |
| "grad_norm": 2.3103678226470947, | |
| "learning_rate": 8.387503534672947e-06, | |
| "loss": 0.008499032258987427, | |
| "mean_token_accuracy": 0.9965438395738602, | |
| "num_tokens": 7345637.0, | |
| "step": 1990 | |
| }, | |
| { | |
| "entropy": 2.13298476934433, | |
| "epoch": 2.841506751954513, | |
| "grad_norm": 0.1992063820362091, | |
| "learning_rate": 8.29675643068237e-06, | |
| "loss": 0.010052156448364259, | |
| "mean_token_accuracy": 0.9935064926743508, | |
| "num_tokens": 7381711.0, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 2.841506751954513, | |
| "eval_entropy": 1.9877975619823331, | |
| "eval_loss": 0.5002052187919617, | |
| "eval_mean_token_accuracy": 0.917853237257233, | |
| "eval_num_tokens": 7381711.0, | |
| "eval_runtime": 989.2063, | |
| "eval_samples_per_second": 7.734, | |
| "eval_steps_per_second": 0.967, | |
| "step": 2000 | |
| }, | |
| { | |
| "entropy": 2.1357434511184694, | |
| "epoch": 2.855721393034826, | |
| "grad_norm": 0.24105560779571533, | |
| "learning_rate": 8.206153553637029e-06, | |
| "loss": 0.014637093245983123, | |
| "mean_token_accuracy": 0.992483814060688, | |
| "num_tokens": 7420253.0, | |
| "step": 2010 | |
| }, | |
| { | |
| "entropy": 2.0427623748779298, | |
| "epoch": 2.8699360341151388, | |
| "grad_norm": 0.04688866436481476, | |
| "learning_rate": 8.115702575590651e-06, | |
| "loss": 0.0197280153632164, | |
| "mean_token_accuracy": 0.9940960317850113, | |
| "num_tokens": 7459527.0, | |
| "step": 2020 | |
| }, | |
| { | |
| "entropy": 2.107358440756798, | |
| "epoch": 2.8841506751954515, | |
| "grad_norm": 2.001885414123535, | |
| "learning_rate": 8.0254111557345e-06, | |
| "loss": 0.012085244059562683, | |
| "mean_token_accuracy": 0.9920702204108238, | |
| "num_tokens": 7492452.0, | |
| "step": 2030 | |
| }, | |
| { | |
| "entropy": 2.117280828952789, | |
| "epoch": 2.898365316275764, | |
| "grad_norm": 1.2196354866027832, | |
| "learning_rate": 7.935286939748793e-06, | |
| "loss": 0.019286631047725676, | |
| "mean_token_accuracy": 0.9929364129900933, | |
| "num_tokens": 7527373.0, | |
| "step": 2040 | |
| }, | |
| { | |
| "entropy": 2.098222628235817, | |
| "epoch": 2.9125799573560767, | |
| "grad_norm": 3.9219210147857666, | |
| "learning_rate": 7.845337559155285e-06, | |
| "loss": 0.01666049212217331, | |
| "mean_token_accuracy": 0.9912658214569092, | |
| "num_tokens": 7563275.0, | |
| "step": 2050 | |
| }, | |
| { | |
| "entropy": 2.1345431208610535, | |
| "epoch": 2.9267945984363894, | |
| "grad_norm": 0.32143792510032654, | |
| "learning_rate": 7.755570630671061e-06, | |
| "loss": 0.005718830227851868, | |
| "mean_token_accuracy": 0.9963970810174942, | |
| "num_tokens": 7597282.0, | |
| "step": 2060 | |
| }, | |
| { | |
| "entropy": 2.1360646575689315, | |
| "epoch": 2.9410092395167022, | |
| "grad_norm": 0.2594122886657715, | |
| "learning_rate": 7.665993755563563e-06, | |
| "loss": 0.014417172968387603, | |
| "mean_token_accuracy": 0.9959156066179276, | |
| "num_tokens": 7634208.0, | |
| "step": 2070 | |
| }, | |
| { | |
| "entropy": 2.1297189712524416, | |
| "epoch": 2.955223880597015, | |
| "grad_norm": 0.9254517555236816, | |
| "learning_rate": 7.576614519006913e-06, | |
| "loss": 0.022011277079582215, | |
| "mean_token_accuracy": 0.9956810921430588, | |
| "num_tokens": 7671271.0, | |
| "step": 2080 | |
| }, | |
| { | |
| "entropy": 2.2322384238243105, | |
| "epoch": 2.969438521677328, | |
| "grad_norm": 0.7473764419555664, | |
| "learning_rate": 7.487440489439646e-06, | |
| "loss": 0.010099399834871292, | |
| "mean_token_accuracy": 0.9970263168215752, | |
| "num_tokens": 7708380.0, | |
| "step": 2090 | |
| }, | |
| { | |
| "entropy": 2.11426265835762, | |
| "epoch": 2.9836531627576406, | |
| "grad_norm": 1.4097167253494263, | |
| "learning_rate": 7.39847921792381e-06, | |
| "loss": 0.023269766569137575, | |
| "mean_token_accuracy": 0.9920061439275741, | |
| "num_tokens": 7745868.0, | |
| "step": 2100 | |
| }, | |
| { | |
| "entropy": 2.116123300790787, | |
| "epoch": 2.997867803837953, | |
| "grad_norm": 1.8534623384475708, | |
| "learning_rate": 7.3097382375055645e-06, | |
| "loss": 0.017223817110061646, | |
| "mean_token_accuracy": 0.9949802815914154, | |
| "num_tokens": 7784384.0, | |
| "step": 2110 | |
| }, | |
| { | |
| "entropy": 2.094560576112647, | |
| "epoch": 3.0113717128642503, | |
| "grad_norm": 0.17719678580760956, | |
| "learning_rate": 7.221225062577313e-06, | |
| "loss": 0.0034023601561784743, | |
| "mean_token_accuracy": 0.996572312555815, | |
| "num_tokens": 7819286.0, | |
| "step": 2120 | |
| }, | |
| { | |
| "entropy": 2.0749322682619096, | |
| "epoch": 3.025586353944563, | |
| "grad_norm": 1.9489033222198486, | |
| "learning_rate": 7.13294718824137e-06, | |
| "loss": 0.0044484566897153854, | |
| "mean_token_accuracy": 0.9989130437374115, | |
| "num_tokens": 7856218.0, | |
| "step": 2130 | |
| }, | |
| { | |
| "entropy": 2.1713985592126845, | |
| "epoch": 3.0398009950248754, | |
| "grad_norm": 0.5477708578109741, | |
| "learning_rate": 7.0449120896753235e-06, | |
| "loss": 0.018094585835933687, | |
| "mean_token_accuracy": 0.993584257364273, | |
| "num_tokens": 7894029.0, | |
| "step": 2140 | |
| }, | |
| { | |
| "entropy": 2.1583692967891692, | |
| "epoch": 3.0540156361051882, | |
| "grad_norm": 0.023213613778352737, | |
| "learning_rate": 6.957127221499028e-06, | |
| "loss": 0.0034131985157728195, | |
| "mean_token_accuracy": 0.998275862634182, | |
| "num_tokens": 7932128.0, | |
| "step": 2150 | |
| }, | |
| { | |
| "entropy": 2.0848151594400406, | |
| "epoch": 3.068230277185501, | |
| "grad_norm": 2.0892016887664795, | |
| "learning_rate": 6.8696000171433855e-06, | |
| "loss": 0.004784305021166802, | |
| "mean_token_accuracy": 0.9977272734045982, | |
| "num_tokens": 7970397.0, | |
| "step": 2160 | |
| }, | |
| { | |
| "entropy": 2.162716430425644, | |
| "epoch": 3.082444918265814, | |
| "grad_norm": 0.043601471930742264, | |
| "learning_rate": 6.782337888220882e-06, | |
| "loss": 0.0022532181814312936, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 8003756.0, | |
| "step": 2170 | |
| }, | |
| { | |
| "entropy": 2.127812659740448, | |
| "epoch": 3.0966595593461266, | |
| "grad_norm": 2.6567702293395996, | |
| "learning_rate": 6.6953482238980025e-06, | |
| "loss": 0.01237870380282402, | |
| "mean_token_accuracy": 0.9954761907458305, | |
| "num_tokens": 8042391.0, | |
| "step": 2180 | |
| }, | |
| { | |
| "entropy": 2.146624502539635, | |
| "epoch": 3.1108742004264394, | |
| "grad_norm": 0.00613620039075613, | |
| "learning_rate": 6.608638390269515e-06, | |
| "loss": 0.008086169511079789, | |
| "mean_token_accuracy": 0.9950213670730591, | |
| "num_tokens": 8078287.0, | |
| "step": 2190 | |
| }, | |
| { | |
| "entropy": 2.1586718261241913, | |
| "epoch": 3.125088841506752, | |
| "grad_norm": 0.022575080394744873, | |
| "learning_rate": 6.52221572973474e-06, | |
| "loss": 0.011718825995922088, | |
| "mean_token_accuracy": 0.9970158591866494, | |
| "num_tokens": 8114492.0, | |
| "step": 2200 | |
| }, | |
| { | |
| "entropy": 2.125586226582527, | |
| "epoch": 3.1393034825870645, | |
| "grad_norm": 2.4398252964019775, | |
| "learning_rate": 6.436087560375803e-06, | |
| "loss": 0.013633471727371217, | |
| "mean_token_accuracy": 0.9931770831346511, | |
| "num_tokens": 8152042.0, | |
| "step": 2210 | |
| }, | |
| { | |
| "entropy": 2.1403322517871857, | |
| "epoch": 3.1535181236673773, | |
| "grad_norm": 0.058475561439991, | |
| "learning_rate": 6.350261175337975e-06, | |
| "loss": 0.005073773115873337, | |
| "mean_token_accuracy": 0.9981249988079071, | |
| "num_tokens": 8188952.0, | |
| "step": 2220 | |
| }, | |
| { | |
| "entropy": 2.0997527480125426, | |
| "epoch": 3.16773276474769, | |
| "grad_norm": 0.3422115445137024, | |
| "learning_rate": 6.264743842212073e-06, | |
| "loss": 0.010538970679044723, | |
| "mean_token_accuracy": 0.9965603098273277, | |
| "num_tokens": 8230647.0, | |
| "step": 2230 | |
| }, | |
| { | |
| "entropy": 2.1392576456069947, | |
| "epoch": 3.181947405828003, | |
| "grad_norm": 0.07745851576328278, | |
| "learning_rate": 6.179542802419079e-06, | |
| "loss": 0.007439323514699936, | |
| "mean_token_accuracy": 0.9988435551524162, | |
| "num_tokens": 8264608.0, | |
| "step": 2240 | |
| }, | |
| { | |
| "entropy": 2.190061104297638, | |
| "epoch": 3.1961620469083156, | |
| "grad_norm": 0.027518633753061295, | |
| "learning_rate": 6.094665270596948e-06, | |
| "loss": 0.011635781824588775, | |
| "mean_token_accuracy": 0.9935132578015328, | |
| "num_tokens": 8300407.0, | |
| "step": 2250 | |
| }, | |
| { | |
| "entropy": 2.2294768542051315, | |
| "epoch": 3.2103766879886284, | |
| "grad_norm": 0.0750473290681839, | |
| "learning_rate": 6.0101184339896865e-06, | |
| "loss": 0.00671888142824173, | |
| "mean_token_accuracy": 0.9962439998984337, | |
| "num_tokens": 8334944.0, | |
| "step": 2260 | |
| }, | |
| { | |
| "entropy": 2.197703164815903, | |
| "epoch": 3.224591329068941, | |
| "grad_norm": 0.12029851227998734, | |
| "learning_rate": 5.925909451838747e-06, | |
| "loss": 0.009523383527994155, | |
| "mean_token_accuracy": 0.9985777243971825, | |
| "num_tokens": 8376905.0, | |
| "step": 2270 | |
| }, | |
| { | |
| "entropy": 2.123885232210159, | |
| "epoch": 3.2388059701492535, | |
| "grad_norm": 0.2749768793582916, | |
| "learning_rate": 5.842045454776816e-06, | |
| "loss": 0.021079175174236298, | |
| "mean_token_accuracy": 0.9924706354737282, | |
| "num_tokens": 8416108.0, | |
| "step": 2280 | |
| }, | |
| { | |
| "entropy": 2.090131178498268, | |
| "epoch": 3.2530206112295663, | |
| "grad_norm": 0.14854082465171814, | |
| "learning_rate": 5.758533544223986e-06, | |
| "loss": 0.007670293003320694, | |
| "mean_token_accuracy": 0.99760522544384, | |
| "num_tokens": 8454009.0, | |
| "step": 2290 | |
| }, | |
| { | |
| "entropy": 2.0772017776966094, | |
| "epoch": 3.267235252309879, | |
| "grad_norm": 0.08492118865251541, | |
| "learning_rate": 5.675380791786435e-06, | |
| "loss": 0.0015875270590186119, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 8497359.0, | |
| "step": 2300 | |
| }, | |
| { | |
| "entropy": 2.1499790489673614, | |
| "epoch": 3.281449893390192, | |
| "grad_norm": 0.8910402059555054, | |
| "learning_rate": 5.592594238657621e-06, | |
| "loss": 0.0036219201982021334, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 8535043.0, | |
| "step": 2310 | |
| }, | |
| { | |
| "entropy": 2.1721325367689133, | |
| "epoch": 3.2956645344705047, | |
| "grad_norm": 0.018208418041467667, | |
| "learning_rate": 5.510180895022032e-06, | |
| "loss": 0.000674342131242156, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 8572631.0, | |
| "step": 2320 | |
| }, | |
| { | |
| "entropy": 2.15026940703392, | |
| "epoch": 3.3098791755508175, | |
| "grad_norm": 0.008994768373668194, | |
| "learning_rate": 5.4281477394616146e-06, | |
| "loss": 0.005390065908432007, | |
| "mean_token_accuracy": 0.9979166656732559, | |
| "num_tokens": 8607328.0, | |
| "step": 2330 | |
| }, | |
| { | |
| "entropy": 2.1503446727991102, | |
| "epoch": 3.3240938166311302, | |
| "grad_norm": 0.19059528410434723, | |
| "learning_rate": 5.346501718364793e-06, | |
| "loss": 0.011236748844385146, | |
| "mean_token_accuracy": 0.9974877446889877, | |
| "num_tokens": 8646346.0, | |
| "step": 2340 | |
| }, | |
| { | |
| "entropy": 2.2072229474782943, | |
| "epoch": 3.3383084577114426, | |
| "grad_norm": 0.3965470492839813, | |
| "learning_rate": 5.265249745338307e-06, | |
| "loss": 0.019204550981521608, | |
| "mean_token_accuracy": 0.9955678090453148, | |
| "num_tokens": 8679667.0, | |
| "step": 2350 | |
| }, | |
| { | |
| "entropy": 2.131696742773056, | |
| "epoch": 3.3525230987917554, | |
| "grad_norm": 0.028842760249972343, | |
| "learning_rate": 5.184398700621765e-06, | |
| "loss": 0.002106231637299061, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 8715830.0, | |
| "step": 2360 | |
| }, | |
| { | |
| "entropy": 2.1438046902418137, | |
| "epoch": 3.366737739872068, | |
| "grad_norm": 0.04236413538455963, | |
| "learning_rate": 5.10395543050503e-06, | |
| "loss": 0.029832398891448973, | |
| "mean_token_accuracy": 0.9930059522390365, | |
| "num_tokens": 8753194.0, | |
| "step": 2370 | |
| }, | |
| { | |
| "entropy": 2.108007326722145, | |
| "epoch": 3.380952380952381, | |
| "grad_norm": 0.11014021933078766, | |
| "learning_rate": 5.023926746748524e-06, | |
| "loss": 0.009075208753347396, | |
| "mean_token_accuracy": 0.9928571417927742, | |
| "num_tokens": 8792099.0, | |
| "step": 2380 | |
| }, | |
| { | |
| "entropy": 2.181051468849182, | |
| "epoch": 3.3951670220326937, | |
| "grad_norm": 0.0077524553053081036, | |
| "learning_rate": 4.944319426006381e-06, | |
| "loss": 0.009630301594734192, | |
| "mean_token_accuracy": 0.9973286435008049, | |
| "num_tokens": 8824763.0, | |
| "step": 2390 | |
| }, | |
| { | |
| "entropy": 2.0720641285181047, | |
| "epoch": 3.4093816631130065, | |
| "grad_norm": 0.05514072626829147, | |
| "learning_rate": 4.865140209252649e-06, | |
| "loss": 0.013563276827335357, | |
| "mean_token_accuracy": 0.9977705627679825, | |
| "num_tokens": 8863036.0, | |
| "step": 2400 | |
| }, | |
| { | |
| "entropy": 2.13643596470356, | |
| "epoch": 3.4235963041933193, | |
| "grad_norm": 3.3827261924743652, | |
| "learning_rate": 4.786395801210452e-06, | |
| "loss": 0.0168175533413887, | |
| "mean_token_accuracy": 0.9946783423423767, | |
| "num_tokens": 8896699.0, | |
| "step": 2410 | |
| }, | |
| { | |
| "entropy": 2.1522935539484025, | |
| "epoch": 3.4378109452736316, | |
| "grad_norm": 0.06272371113300323, | |
| "learning_rate": 4.708092869784273e-06, | |
| "loss": 0.006873990595340729, | |
| "mean_token_accuracy": 0.9995901644229889, | |
| "num_tokens": 8932246.0, | |
| "step": 2420 | |
| }, | |
| { | |
| "entropy": 2.127246394753456, | |
| "epoch": 3.4520255863539444, | |
| "grad_norm": 0.010775122791528702, | |
| "learning_rate": 4.630238045495318e-06, | |
| "loss": 0.0019115816801786422, | |
| "mean_token_accuracy": 0.9992424249649048, | |
| "num_tokens": 8968550.0, | |
| "step": 2430 | |
| }, | |
| { | |
| "entropy": 2.167269319295883, | |
| "epoch": 3.466240227434257, | |
| "grad_norm": 0.46379631757736206, | |
| "learning_rate": 4.552837920920057e-06, | |
| "loss": 0.0013112064450979232, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 9004264.0, | |
| "step": 2440 | |
| }, | |
| { | |
| "entropy": 2.1489324510097503, | |
| "epoch": 3.48045486851457, | |
| "grad_norm": 0.6207188963890076, | |
| "learning_rate": 4.475899050131985e-06, | |
| "loss": 0.006231657788157463, | |
| "mean_token_accuracy": 0.9964285716414452, | |
| "num_tokens": 9040079.0, | |
| "step": 2450 | |
| }, | |
| { | |
| "entropy": 2.183499825000763, | |
| "epoch": 3.4946695095948828, | |
| "grad_norm": 0.07879038900136948, | |
| "learning_rate": 4.399427948146624e-06, | |
| "loss": 0.020220884680747987, | |
| "mean_token_accuracy": 0.9945031389594078, | |
| "num_tokens": 9077997.0, | |
| "step": 2460 | |
| }, | |
| { | |
| "entropy": 2.211496871709824, | |
| "epoch": 3.5088841506751955, | |
| "grad_norm": 0.12836432456970215, | |
| "learning_rate": 4.3234310903698695e-06, | |
| "loss": 0.006491854786872864, | |
| "mean_token_accuracy": 0.9995098039507866, | |
| "num_tokens": 9115310.0, | |
| "step": 2470 | |
| }, | |
| { | |
| "entropy": 2.176717010140419, | |
| "epoch": 3.5230987917555083, | |
| "grad_norm": 0.8318957090377808, | |
| "learning_rate": 4.247914912049635e-06, | |
| "loss": 0.0016323558986186982, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 9152231.0, | |
| "step": 2480 | |
| }, | |
| { | |
| "entropy": 2.2198712468147277, | |
| "epoch": 3.5373134328358207, | |
| "grad_norm": 2.0839056968688965, | |
| "learning_rate": 4.172885807730972e-06, | |
| "loss": 0.009627557545900344, | |
| "mean_token_accuracy": 0.9967328533530235, | |
| "num_tokens": 9188384.0, | |
| "step": 2490 | |
| }, | |
| { | |
| "entropy": 2.215090864896774, | |
| "epoch": 3.5515280739161335, | |
| "grad_norm": 0.1644526720046997, | |
| "learning_rate": 4.0983501307145466e-06, | |
| "loss": 0.007908221334218979, | |
| "mean_token_accuracy": 0.996194276213646, | |
| "num_tokens": 9225015.0, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 3.5515280739161335, | |
| "eval_entropy": 2.025349033040811, | |
| "eval_loss": 0.543056845664978, | |
| "eval_mean_token_accuracy": 0.9176541126509321, | |
| "eval_num_tokens": 9225015.0, | |
| "eval_runtime": 989.9838, | |
| "eval_samples_per_second": 7.728, | |
| "eval_steps_per_second": 0.967, | |
| "step": 2500 | |
| }, | |
| { | |
| "entropy": 2.1734833300113676, | |
| "epoch": 3.5657427149964462, | |
| "grad_norm": 0.6722556352615356, | |
| "learning_rate": 4.024314192518691e-06, | |
| "loss": 0.005212902277708054, | |
| "mean_token_accuracy": 0.9996875002980232, | |
| "num_tokens": 9260855.0, | |
| "step": 2510 | |
| }, | |
| { | |
| "entropy": 2.1916033893823625, | |
| "epoch": 3.579957356076759, | |
| "grad_norm": 0.46904346346855164, | |
| "learning_rate": 3.950784262344947e-06, | |
| "loss": 0.005123495310544968, | |
| "mean_token_accuracy": 0.996708333492279, | |
| "num_tokens": 9300640.0, | |
| "step": 2520 | |
| }, | |
| { | |
| "entropy": 2.1783609628677367, | |
| "epoch": 3.594171997157072, | |
| "grad_norm": 0.6677644848823547, | |
| "learning_rate": 3.877766566547186e-06, | |
| "loss": 0.008107519149780274, | |
| "mean_token_accuracy": 0.9955555558204651, | |
| "num_tokens": 9336822.0, | |
| "step": 2530 | |
| }, | |
| { | |
| "entropy": 2.1903655380010605, | |
| "epoch": 3.6083866382373846, | |
| "grad_norm": 0.030927782878279686, | |
| "learning_rate": 3.8052672881044173e-06, | |
| "loss": 0.005363395810127259, | |
| "mean_token_accuracy": 0.9973389357328415, | |
| "num_tokens": 9370145.0, | |
| "step": 2540 | |
| }, | |
| { | |
| "entropy": 2.136083886027336, | |
| "epoch": 3.6226012793176974, | |
| "grad_norm": 0.14145703613758087, | |
| "learning_rate": 3.7332925660971774e-06, | |
| "loss": 0.001963794231414795, | |
| "mean_token_accuracy": 0.9993055552244187, | |
| "num_tokens": 9405831.0, | |
| "step": 2550 | |
| }, | |
| { | |
| "entropy": 2.1727351754903794, | |
| "epoch": 3.6368159203980097, | |
| "grad_norm": 0.06443420052528381, | |
| "learning_rate": 3.661848495187724e-06, | |
| "loss": 0.009727256000041961, | |
| "mean_token_accuracy": 0.9967490404844284, | |
| "num_tokens": 9442595.0, | |
| "step": 2560 | |
| }, | |
| { | |
| "entropy": 2.180554246902466, | |
| "epoch": 3.651030561478323, | |
| "grad_norm": 0.22529654204845428, | |
| "learning_rate": 3.5909411251039295e-06, | |
| "loss": 0.0030778197571635245, | |
| "mean_token_accuracy": 0.9995098039507866, | |
| "num_tokens": 9474871.0, | |
| "step": 2570 | |
| }, | |
| { | |
| "entropy": 2.1319134652614595, | |
| "epoch": 3.6652452025586353, | |
| "grad_norm": 0.046728238463401794, | |
| "learning_rate": 3.520576460127019e-06, | |
| "loss": 0.0027088303118944167, | |
| "mean_token_accuracy": 0.9994047611951828, | |
| "num_tokens": 9513525.0, | |
| "step": 2580 | |
| }, | |
| { | |
| "entropy": 2.1576041877269745, | |
| "epoch": 3.679459843638948, | |
| "grad_norm": 0.009525112807750702, | |
| "learning_rate": 3.450760458583132e-06, | |
| "loss": 0.005883176624774933, | |
| "mean_token_accuracy": 0.9987936049699784, | |
| "num_tokens": 9546650.0, | |
| "step": 2590 | |
| }, | |
| { | |
| "entropy": 2.164761394262314, | |
| "epoch": 3.693674484719261, | |
| "grad_norm": 5.105481147766113, | |
| "learning_rate": 3.3814990323387886e-06, | |
| "loss": 0.011438134312629699, | |
| "mean_token_accuracy": 0.994793213903904, | |
| "num_tokens": 9584618.0, | |
| "step": 2600 | |
| }, | |
| { | |
| "entropy": 2.212935158610344, | |
| "epoch": 3.7078891257995736, | |
| "grad_norm": 0.10164128243923187, | |
| "learning_rate": 3.3127980463002852e-06, | |
| "loss": 0.015480761229991914, | |
| "mean_token_accuracy": 0.9978535354137421, | |
| "num_tokens": 9621145.0, | |
| "step": 2610 | |
| }, | |
| { | |
| "entropy": 2.1630167931318285, | |
| "epoch": 3.7221037668798864, | |
| "grad_norm": 0.04091818630695343, | |
| "learning_rate": 3.244663317917056e-06, | |
| "loss": 0.003573558479547501, | |
| "mean_token_accuracy": 0.9988095238804817, | |
| "num_tokens": 9660623.0, | |
| "step": 2620 | |
| }, | |
| { | |
| "entropy": 2.18853420317173, | |
| "epoch": 3.7363184079601988, | |
| "grad_norm": 0.29761549830436707, | |
| "learning_rate": 3.177100616689085e-06, | |
| "loss": 0.002430788241326809, | |
| "mean_token_accuracy": 0.9977272734045982, | |
| "num_tokens": 9693952.0, | |
| "step": 2630 | |
| }, | |
| { | |
| "entropy": 2.1519277811050417, | |
| "epoch": 3.750533049040512, | |
| "grad_norm": 1.4869977235794067, | |
| "learning_rate": 3.1101156636783424e-06, | |
| "loss": 0.012232684344053269, | |
| "mean_token_accuracy": 0.9964350983500481, | |
| "num_tokens": 9732781.0, | |
| "step": 2640 | |
| }, | |
| { | |
| "entropy": 2.11678723692894, | |
| "epoch": 3.7647476901208243, | |
| "grad_norm": 0.009623765014111996, | |
| "learning_rate": 3.0437141310243436e-06, | |
| "loss": 0.004782317578792572, | |
| "mean_token_accuracy": 0.9982051268219948, | |
| "num_tokens": 9773807.0, | |
| "step": 2650 | |
| }, | |
| { | |
| "entropy": 2.177131649851799, | |
| "epoch": 3.778962331201137, | |
| "grad_norm": 0.05591592937707901, | |
| "learning_rate": 2.977901641463833e-06, | |
| "loss": 0.0022820821031928062, | |
| "mean_token_accuracy": 0.9993243247270585, | |
| "num_tokens": 9806829.0, | |
| "step": 2660 | |
| }, | |
| { | |
| "entropy": 2.0982068300247194, | |
| "epoch": 3.79317697228145, | |
| "grad_norm": 0.04154813662171364, | |
| "learning_rate": 2.9126837678546814e-06, | |
| "loss": 0.003840605542063713, | |
| "mean_token_accuracy": 0.9989583343267441, | |
| "num_tokens": 9848588.0, | |
| "step": 2670 | |
| }, | |
| { | |
| "entropy": 2.177445635199547, | |
| "epoch": 3.8073916133617627, | |
| "grad_norm": 0.40800824761390686, | |
| "learning_rate": 2.8480660327039834e-06, | |
| "loss": 0.024874459207057952, | |
| "mean_token_accuracy": 0.9968070656061172, | |
| "num_tokens": 9882298.0, | |
| "step": 2680 | |
| }, | |
| { | |
| "entropy": 2.1979396522045134, | |
| "epoch": 3.8216062544420755, | |
| "grad_norm": 2.1369435787200928, | |
| "learning_rate": 2.7840539077004026e-06, | |
| "loss": 0.006149508431553841, | |
| "mean_token_accuracy": 0.995833334326744, | |
| "num_tokens": 9917403.0, | |
| "step": 2690 | |
| }, | |
| { | |
| "entropy": 2.2291352182626722, | |
| "epoch": 3.835820895522388, | |
| "grad_norm": 0.48058605194091797, | |
| "learning_rate": 2.7206528132508813e-06, | |
| "loss": 0.012438727915287018, | |
| "mean_token_accuracy": 0.9970117837190628, | |
| "num_tokens": 9953432.0, | |
| "step": 2700 | |
| }, | |
| { | |
| "entropy": 2.148913612961769, | |
| "epoch": 3.850035536602701, | |
| "grad_norm": 0.5231387615203857, | |
| "learning_rate": 2.657868118021608e-06, | |
| "loss": 0.002489854209125042, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 9987465.0, | |
| "step": 2710 | |
| }, | |
| { | |
| "entropy": 2.183783236145973, | |
| "epoch": 3.8642501776830134, | |
| "grad_norm": 0.08354540169239044, | |
| "learning_rate": 2.5957051384834443e-06, | |
| "loss": 0.025581926107406616, | |
| "mean_token_accuracy": 0.9913469970226287, | |
| "num_tokens": 10024663.0, | |
| "step": 2720 | |
| }, | |
| { | |
| "entropy": 2.206176847219467, | |
| "epoch": 3.878464818763326, | |
| "grad_norm": 0.09456467628479004, | |
| "learning_rate": 2.534169138461725e-06, | |
| "loss": 0.0029037076979875564, | |
| "mean_token_accuracy": 0.9985294118523598, | |
| "num_tokens": 10059420.0, | |
| "step": 2730 | |
| }, | |
| { | |
| "entropy": 2.152846413850784, | |
| "epoch": 3.892679459843639, | |
| "grad_norm": 0.38944724202156067, | |
| "learning_rate": 2.473265328690514e-06, | |
| "loss": 0.008512056618928909, | |
| "mean_token_accuracy": 0.9977964743971824, | |
| "num_tokens": 10099303.0, | |
| "step": 2740 | |
| }, | |
| { | |
| "entropy": 2.1975372284650803, | |
| "epoch": 3.9068941009239517, | |
| "grad_norm": 1.185078740119934, | |
| "learning_rate": 2.412998866371411e-06, | |
| "loss": 0.00427936352789402, | |
| "mean_token_accuracy": 0.9974374994635582, | |
| "num_tokens": 10135013.0, | |
| "step": 2750 | |
| }, | |
| { | |
| "entropy": 2.193510928750038, | |
| "epoch": 3.9211087420042645, | |
| "grad_norm": 0.5688725709915161, | |
| "learning_rate": 2.3533748547368008e-06, | |
| "loss": 0.009441718459129333, | |
| "mean_token_accuracy": 0.9988095238804817, | |
| "num_tokens": 10171217.0, | |
| "step": 2760 | |
| }, | |
| { | |
| "entropy": 2.063158482313156, | |
| "epoch": 3.935323383084577, | |
| "grad_norm": 0.39150136709213257, | |
| "learning_rate": 2.294398342617765e-06, | |
| "loss": 0.006837107241153717, | |
| "mean_token_accuracy": 0.9970514938235283, | |
| "num_tokens": 10211084.0, | |
| "step": 2770 | |
| }, | |
| { | |
| "entropy": 2.1779229074716566, | |
| "epoch": 3.94953802416489, | |
| "grad_norm": 0.06802282482385635, | |
| "learning_rate": 2.2360743240165283e-06, | |
| "loss": 0.0037012625485658645, | |
| "mean_token_accuracy": 0.9991379305720329, | |
| "num_tokens": 10248579.0, | |
| "step": 2780 | |
| }, | |
| { | |
| "entropy": 2.099555331468582, | |
| "epoch": 3.9637526652452024, | |
| "grad_norm": 0.10486733913421631, | |
| "learning_rate": 2.1784077376835964e-06, | |
| "loss": 0.0013088119216263295, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 10288496.0, | |
| "step": 2790 | |
| }, | |
| { | |
| "entropy": 2.1688816130161284, | |
| "epoch": 3.977967306325515, | |
| "grad_norm": 0.016996540129184723, | |
| "learning_rate": 2.1214034666995452e-06, | |
| "loss": 0.02126392424106598, | |
| "mean_token_accuracy": 0.9912162214517594, | |
| "num_tokens": 10325933.0, | |
| "step": 2800 | |
| }, | |
| { | |
| "entropy": 2.1608937054872515, | |
| "epoch": 3.992181947405828, | |
| "grad_norm": 0.06427384167909622, | |
| "learning_rate": 2.065066338061533e-06, | |
| "loss": 0.0059285745024681095, | |
| "mean_token_accuracy": 0.9981752723455429, | |
| "num_tokens": 10366910.0, | |
| "step": 2810 | |
| }, | |
| { | |
| "entropy": 2.196948136153974, | |
| "epoch": 4.005685856432125, | |
| "grad_norm": 0.11280222237110138, | |
| "learning_rate": 2.0094011222745647e-06, | |
| "loss": 0.0018585361540317535, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 10401852.0, | |
| "step": 2820 | |
| }, | |
| { | |
| "entropy": 2.1833971083164214, | |
| "epoch": 4.019900497512438, | |
| "grad_norm": 0.047356266528367996, | |
| "learning_rate": 1.9544125329475237e-06, | |
| "loss": 0.0012251741252839565, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 10439032.0, | |
| "step": 2830 | |
| }, | |
| { | |
| "entropy": 2.2034851729869844, | |
| "epoch": 4.0341151385927505, | |
| "grad_norm": 0.20847798883914948, | |
| "learning_rate": 1.900105226394051e-06, | |
| "loss": 0.004868442937731743, | |
| "mean_token_accuracy": 0.9994186043739319, | |
| "num_tokens": 10473983.0, | |
| "step": 2840 | |
| }, | |
| { | |
| "entropy": 2.17997325360775, | |
| "epoch": 4.048329779673063, | |
| "grad_norm": 1.2543761730194092, | |
| "learning_rate": 1.846483801238248e-06, | |
| "loss": 0.000993065070360899, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 10506963.0, | |
| "step": 2850 | |
| }, | |
| { | |
| "entropy": 2.14132858812809, | |
| "epoch": 4.062544420753376, | |
| "grad_norm": 0.2019268274307251, | |
| "learning_rate": 1.7935527980252799e-06, | |
| "loss": 0.0016139384359121322, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 10546928.0, | |
| "step": 2860 | |
| }, | |
| { | |
| "entropy": 2.1205300956964495, | |
| "epoch": 4.076759061833688, | |
| "grad_norm": 0.006392813287675381, | |
| "learning_rate": 1.7413166988368802e-06, | |
| "loss": 0.005241365730762481, | |
| "mean_token_accuracy": 0.99921875, | |
| "num_tokens": 10588651.0, | |
| "step": 2870 | |
| }, | |
| { | |
| "entropy": 2.1647232592105867, | |
| "epoch": 4.090973702914002, | |
| "grad_norm": 0.06546484678983688, | |
| "learning_rate": 1.6897799269118398e-06, | |
| "loss": 0.0012532318010926246, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 10628469.0, | |
| "step": 2880 | |
| }, | |
| { | |
| "entropy": 2.173341378569603, | |
| "epoch": 4.105188343994314, | |
| "grad_norm": 0.0864807739853859, | |
| "learning_rate": 1.6389468462714387e-06, | |
| "loss": 0.0024954590946435927, | |
| "mean_token_accuracy": 0.9988857284188271, | |
| "num_tokens": 10665691.0, | |
| "step": 2890 | |
| }, | |
| { | |
| "entropy": 2.0994014710187914, | |
| "epoch": 4.119402985074627, | |
| "grad_norm": 0.007347598671913147, | |
| "learning_rate": 1.5888217613499101e-06, | |
| "loss": 0.0006663267500698567, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 10705041.0, | |
| "step": 2900 | |
| }, | |
| { | |
| "entropy": 2.1861185312271116, | |
| "epoch": 4.1336176261549396, | |
| "grad_norm": 0.1270337551832199, | |
| "learning_rate": 1.5394089166299718e-06, | |
| "loss": 0.006704054027795792, | |
| "mean_token_accuracy": 0.9972916662693023, | |
| "num_tokens": 10738994.0, | |
| "step": 2910 | |
| }, | |
| { | |
| "entropy": 2.115477886795998, | |
| "epoch": 4.147832267235252, | |
| "grad_norm": 0.13763725757598877, | |
| "learning_rate": 1.4907124962833808e-06, | |
| "loss": 0.004347409680485725, | |
| "mean_token_accuracy": 0.9986842110753059, | |
| "num_tokens": 10776182.0, | |
| "step": 2920 | |
| }, | |
| { | |
| "entropy": 2.195647644996643, | |
| "epoch": 4.162046908315565, | |
| "grad_norm": 0.06850487738847733, | |
| "learning_rate": 1.4427366238166517e-06, | |
| "loss": 0.004155668616294861, | |
| "mean_token_accuracy": 0.9984969049692154, | |
| "num_tokens": 10816150.0, | |
| "step": 2930 | |
| }, | |
| { | |
| "entropy": 2.1906051248311997, | |
| "epoch": 4.1762615493958775, | |
| "grad_norm": 0.01908433809876442, | |
| "learning_rate": 1.3954853617218745e-06, | |
| "loss": 0.013761062920093537, | |
| "mean_token_accuracy": 0.9947195380926133, | |
| "num_tokens": 10852408.0, | |
| "step": 2940 | |
| }, | |
| { | |
| "entropy": 2.1659664869308473, | |
| "epoch": 4.190476190476191, | |
| "grad_norm": 0.031739577651023865, | |
| "learning_rate": 1.3489627111327187e-06, | |
| "loss": 0.003443429246544838, | |
| "mean_token_accuracy": 0.9993902444839478, | |
| "num_tokens": 10887520.0, | |
| "step": 2950 | |
| }, | |
| { | |
| "entropy": 2.2092543095350266, | |
| "epoch": 4.204690831556503, | |
| "grad_norm": 0.048356492072343826, | |
| "learning_rate": 1.3031726114856202e-06, | |
| "loss": 0.0038285456597805024, | |
| "mean_token_accuracy": 0.9986111104488373, | |
| "num_tokens": 10921960.0, | |
| "step": 2960 | |
| }, | |
| { | |
| "entropy": 2.1533284068107603, | |
| "epoch": 4.218905472636816, | |
| "grad_norm": 1.2027009725570679, | |
| "learning_rate": 1.2581189401862036e-06, | |
| "loss": 0.007209320366382599, | |
| "mean_token_accuracy": 0.9953348532319068, | |
| "num_tokens": 10957277.0, | |
| "step": 2970 | |
| }, | |
| { | |
| "entropy": 2.162069135904312, | |
| "epoch": 4.233120113717129, | |
| "grad_norm": 0.021080689504742622, | |
| "learning_rate": 1.2138055122809522e-06, | |
| "loss": 0.0012023065239191056, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 10989161.0, | |
| "step": 2980 | |
| }, | |
| { | |
| "entropy": 2.1910412877798082, | |
| "epoch": 4.247334754797441, | |
| "grad_norm": 0.4471619427204132, | |
| "learning_rate": 1.170236080134145e-06, | |
| "loss": 0.004197989776730538, | |
| "mean_token_accuracy": 0.9975662842392922, | |
| "num_tokens": 11024450.0, | |
| "step": 2990 | |
| }, | |
| { | |
| "entropy": 2.185595816373825, | |
| "epoch": 4.261549395877754, | |
| "grad_norm": 0.42085593938827515, | |
| "learning_rate": 1.127414333110135e-06, | |
| "loss": 0.004017576575279236, | |
| "mean_token_accuracy": 0.9978968247771263, | |
| "num_tokens": 11059337.0, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 4.261549395877754, | |
| "eval_entropy": 2.021736085601735, | |
| "eval_loss": 0.5579360127449036, | |
| "eval_mean_token_accuracy": 0.9177084487309152, | |
| "eval_num_tokens": 11059337.0, | |
| "eval_runtime": 989.3713, | |
| "eval_samples_per_second": 7.733, | |
| "eval_steps_per_second": 0.967, | |
| "step": 3000 | |
| }, | |
| { | |
| "entropy": 2.087850275635719, | |
| "epoch": 4.2757640369580665, | |
| "grad_norm": 0.043584469705820084, | |
| "learning_rate": 1.0853438972609299e-06, | |
| "loss": 0.0032962791621685026, | |
| "mean_token_accuracy": 0.9983258932828903, | |
| "num_tokens": 11099908.0, | |
| "step": 3010 | |
| }, | |
| { | |
| "entropy": 2.217186596989632, | |
| "epoch": 4.28997867803838, | |
| "grad_norm": 0.0054810852743685246, | |
| "learning_rate": 1.0440283350191483e-06, | |
| "loss": 0.005877744778990746, | |
| "mean_token_accuracy": 0.9971874997019767, | |
| "num_tokens": 11137291.0, | |
| "step": 3020 | |
| }, | |
| { | |
| "entropy": 2.2094817072153092, | |
| "epoch": 4.304193319118692, | |
| "grad_norm": 0.06918873637914658, | |
| "learning_rate": 1.0034711448963563e-06, | |
| "loss": 0.0013420137576758862, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 11171023.0, | |
| "step": 3030 | |
| }, | |
| { | |
| "entropy": 2.2051640689373015, | |
| "epoch": 4.318407960199005, | |
| "grad_norm": 0.10377147048711777, | |
| "learning_rate": 9.636757611868297e-07, | |
| "loss": 0.005501218512654305, | |
| "mean_token_accuracy": 0.9981210514903068, | |
| "num_tokens": 11207280.0, | |
| "step": 3040 | |
| }, | |
| { | |
| "entropy": 2.1432130724191665, | |
| "epoch": 4.332622601279318, | |
| "grad_norm": 0.8852893114089966, | |
| "learning_rate": 9.246455536767407e-07, | |
| "loss": 0.002229997143149376, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 11242611.0, | |
| "step": 3050 | |
| }, | |
| { | |
| "entropy": 2.118473994731903, | |
| "epoch": 4.34683724235963, | |
| "grad_norm": 0.2849883735179901, | |
| "learning_rate": 8.863838273588121e-07, | |
| "loss": 0.004777782037854195, | |
| "mean_token_accuracy": 0.9995192304253578, | |
| "num_tokens": 11278511.0, | |
| "step": 3060 | |
| }, | |
| { | |
| "entropy": 2.1805112212896347, | |
| "epoch": 4.361051883439943, | |
| "grad_norm": 0.17783457040786743, | |
| "learning_rate": 8.48893822152459e-07, | |
| "loss": 0.0011253532022237778, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 11314397.0, | |
| "step": 3070 | |
| }, | |
| { | |
| "entropy": 2.1570386826992034, | |
| "epoch": 4.3752665245202556, | |
| "grad_norm": 2.8052237033843994, | |
| "learning_rate": 8.121787126294323e-07, | |
| "loss": 0.002880261279642582, | |
| "mean_token_accuracy": 0.9989999994635582, | |
| "num_tokens": 11350741.0, | |
| "step": 3080 | |
| }, | |
| { | |
| "entropy": 2.215659800171852, | |
| "epoch": 4.389481165600569, | |
| "grad_norm": 0.16840478777885437, | |
| "learning_rate": 7.762416077450175e-07, | |
| "loss": 0.0009297240525484085, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 11384917.0, | |
| "step": 3090 | |
| }, | |
| { | |
| "entropy": 2.0968218415975572, | |
| "epoch": 4.403695806680881, | |
| "grad_norm": 0.037575576454401016, | |
| "learning_rate": 7.410855505747583e-07, | |
| "loss": 0.0018225666135549545, | |
| "mean_token_accuracy": 0.9982142850756646, | |
| "num_tokens": 11425676.0, | |
| "step": 3100 | |
| }, | |
| { | |
| "entropy": 2.1322130650281905, | |
| "epoch": 4.417910447761194, | |
| "grad_norm": 0.4404691159725189, | |
| "learning_rate": 7.067135180567919e-07, | |
| "loss": 0.0013419835828244685, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 11463704.0, | |
| "step": 3110 | |
| }, | |
| { | |
| "entropy": 2.2044524610042573, | |
| "epoch": 4.432125088841507, | |
| "grad_norm": 0.9155864119529724, | |
| "learning_rate": 6.731284207397548e-07, | |
| "loss": 0.0015116781927645207, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 11496950.0, | |
| "step": 3120 | |
| }, | |
| { | |
| "entropy": 2.161736896634102, | |
| "epoch": 4.446339729921819, | |
| "grad_norm": 2.8296735286712646, | |
| "learning_rate": 6.403331025363312e-07, | |
| "loss": 0.0043445445597171785, | |
| "mean_token_accuracy": 0.997027014195919, | |
| "num_tokens": 11534916.0, | |
| "step": 3130 | |
| }, | |
| { | |
| "entropy": 2.123622697591782, | |
| "epoch": 4.460554371002132, | |
| "grad_norm": 0.8704050183296204, | |
| "learning_rate": 6.083303404824381e-07, | |
| "loss": 0.00419679544866085, | |
| "mean_token_accuracy": 0.9993589743971825, | |
| "num_tokens": 11575692.0, | |
| "step": 3140 | |
| }, | |
| { | |
| "entropy": 2.1255591422319413, | |
| "epoch": 4.474769012082445, | |
| "grad_norm": 2.5488767623901367, | |
| "learning_rate": 5.771228445020627e-07, | |
| "loss": 0.004947403818368912, | |
| "mean_token_accuracy": 0.9964460790157318, | |
| "num_tokens": 11613906.0, | |
| "step": 3150 | |
| }, | |
| { | |
| "entropy": 2.169129991531372, | |
| "epoch": 4.488983653162758, | |
| "grad_norm": 0.05024200305342674, | |
| "learning_rate": 5.467132571778011e-07, | |
| "loss": 0.0006448611617088318, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 11648392.0, | |
| "step": 3160 | |
| }, | |
| { | |
| "entropy": 2.103648892045021, | |
| "epoch": 4.50319829424307, | |
| "grad_norm": 0.018968380987644196, | |
| "learning_rate": 5.171041535270894e-07, | |
| "loss": 0.0005233283154666424, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 11691399.0, | |
| "step": 3170 | |
| }, | |
| { | |
| "entropy": 2.1431118875741957, | |
| "epoch": 4.517412935323383, | |
| "grad_norm": 0.0916331559419632, | |
| "learning_rate": 4.88298040784152e-07, | |
| "loss": 0.004345014318823814, | |
| "mean_token_accuracy": 0.9971717178821564, | |
| "num_tokens": 11725157.0, | |
| "step": 3180 | |
| }, | |
| { | |
| "entropy": 2.1765580475330353, | |
| "epoch": 4.531627576403696, | |
| "grad_norm": 0.02908848598599434, | |
| "learning_rate": 4.6029735818769907e-07, | |
| "loss": 0.0040725283324718475, | |
| "mean_token_accuracy": 0.9995192304253578, | |
| "num_tokens": 11765063.0, | |
| "step": 3190 | |
| }, | |
| { | |
| "entropy": 2.199541613459587, | |
| "epoch": 4.545842217484008, | |
| "grad_norm": 0.5352857708930969, | |
| "learning_rate": 4.331044767743708e-07, | |
| "loss": 0.0021973950788378716, | |
| "mean_token_accuracy": 0.9989583328366279, | |
| "num_tokens": 11801966.0, | |
| "step": 3200 | |
| }, | |
| { | |
| "entropy": 2.165239670872688, | |
| "epoch": 4.560056858564321, | |
| "grad_norm": 0.021813327446579933, | |
| "learning_rate": 4.067216991779721e-07, | |
| "loss": 0.002202248200774193, | |
| "mean_token_accuracy": 0.9996031746268272, | |
| "num_tokens": 11842437.0, | |
| "step": 3210 | |
| }, | |
| { | |
| "entropy": 2.149556291103363, | |
| "epoch": 4.574271499644634, | |
| "grad_norm": 0.012352075427770615, | |
| "learning_rate": 3.811512594344857e-07, | |
| "loss": 0.004862933605909348, | |
| "mean_token_accuracy": 0.9995098039507866, | |
| "num_tokens": 11881004.0, | |
| "step": 3220 | |
| }, | |
| { | |
| "entropy": 2.1413369357585905, | |
| "epoch": 4.588486140724947, | |
| "grad_norm": 0.04668094962835312, | |
| "learning_rate": 3.5639532279289845e-07, | |
| "loss": 0.003514312207698822, | |
| "mean_token_accuracy": 0.9972222223877907, | |
| "num_tokens": 11918795.0, | |
| "step": 3230 | |
| }, | |
| { | |
| "entropy": 2.1386821925640107, | |
| "epoch": 4.602700781805259, | |
| "grad_norm": 0.03126770630478859, | |
| "learning_rate": 3.3245598553184986e-07, | |
| "loss": 0.004513117671012879, | |
| "mean_token_accuracy": 0.9995614036917686, | |
| "num_tokens": 11952525.0, | |
| "step": 3240 | |
| }, | |
| { | |
| "entropy": 2.127019727230072, | |
| "epoch": 4.616915422885572, | |
| "grad_norm": 0.33939263224601746, | |
| "learning_rate": 3.0933527478213545e-07, | |
| "loss": 0.005397439002990723, | |
| "mean_token_accuracy": 0.9990074694156647, | |
| "num_tokens": 11991456.0, | |
| "step": 3250 | |
| }, | |
| { | |
| "entropy": 2.2128841817378997, | |
| "epoch": 4.631130063965885, | |
| "grad_norm": 0.6997547149658203, | |
| "learning_rate": 2.870351483550382e-07, | |
| "loss": 0.0022805359214544295, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 12024144.0, | |
| "step": 3260 | |
| }, | |
| { | |
| "entropy": 2.096145638823509, | |
| "epoch": 4.645344705046197, | |
| "grad_norm": 0.11305858194828033, | |
| "learning_rate": 2.655574945765571e-07, | |
| "loss": 0.012231498956680298, | |
| "mean_token_accuracy": 0.9988888889551163, | |
| "num_tokens": 12062762.0, | |
| "step": 3270 | |
| }, | |
| { | |
| "entropy": 2.0828854560852053, | |
| "epoch": 4.65955934612651, | |
| "grad_norm": 0.025230111554265022, | |
| "learning_rate": 2.4490413212750475e-07, | |
| "loss": 0.002871591970324516, | |
| "mean_token_accuracy": 0.9985294118523598, | |
| "num_tokens": 12100824.0, | |
| "step": 3280 | |
| }, | |
| { | |
| "entropy": 2.1890225172042848, | |
| "epoch": 4.673773987206823, | |
| "grad_norm": 0.08814139664173126, | |
| "learning_rate": 2.2507680988949843e-07, | |
| "loss": 0.004444138705730438, | |
| "mean_token_accuracy": 0.9988095238804817, | |
| "num_tokens": 12138713.0, | |
| "step": 3290 | |
| }, | |
| { | |
| "entropy": 2.168518990278244, | |
| "epoch": 4.687988628287136, | |
| "grad_norm": 0.01869502291083336, | |
| "learning_rate": 2.0607720679688193e-07, | |
| "loss": 0.0033570095896720887, | |
| "mean_token_accuracy": 0.9983983993530273, | |
| "num_tokens": 12175435.0, | |
| "step": 3300 | |
| }, | |
| { | |
| "entropy": 2.165831074118614, | |
| "epoch": 4.702203269367448, | |
| "grad_norm": 0.10159584879875183, | |
| "learning_rate": 1.8790693169454365e-07, | |
| "loss": 0.002022952027618885, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 12211650.0, | |
| "step": 3310 | |
| }, | |
| { | |
| "entropy": 2.0869997441768646, | |
| "epoch": 4.7164179104477615, | |
| "grad_norm": 1.7387880086898804, | |
| "learning_rate": 1.7056752320169346e-07, | |
| "loss": 0.002982720918953419, | |
| "mean_token_accuracy": 0.9994565218687057, | |
| "num_tokens": 12249287.0, | |
| "step": 3320 | |
| }, | |
| { | |
| "entropy": 2.1755292028188706, | |
| "epoch": 4.730632551528074, | |
| "grad_norm": 0.04950045421719551, | |
| "learning_rate": 1.5406044958156896e-07, | |
| "loss": 0.0011815003119409085, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 12286730.0, | |
| "step": 3330 | |
| }, | |
| { | |
| "entropy": 2.1790402829647064, | |
| "epoch": 4.744847192608386, | |
| "grad_norm": 0.20007754862308502, | |
| "learning_rate": 1.383871086171107e-07, | |
| "loss": 0.001237096171826124, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 12322652.0, | |
| "step": 3340 | |
| }, | |
| { | |
| "entropy": 2.207217875123024, | |
| "epoch": 4.759061833688699, | |
| "grad_norm": 1.2678426504135132, | |
| "learning_rate": 1.2354882749259778e-07, | |
| "loss": 0.012135348469018935, | |
| "mean_token_accuracy": 0.9962175503373146, | |
| "num_tokens": 12357845.0, | |
| "step": 3350 | |
| }, | |
| { | |
| "entropy": 2.1616628229618073, | |
| "epoch": 4.773276474769012, | |
| "grad_norm": 0.07163197547197342, | |
| "learning_rate": 1.0954686268126457e-07, | |
| "loss": 0.0008528068661689759, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 12395670.0, | |
| "step": 3360 | |
| }, | |
| { | |
| "entropy": 2.153119242191315, | |
| "epoch": 4.787491115849325, | |
| "grad_norm": 0.07595377415418625, | |
| "learning_rate": 9.638239983890907e-08, | |
| "loss": 0.002039765752851963, | |
| "mean_token_accuracy": 0.999074074625969, | |
| "num_tokens": 12430518.0, | |
| "step": 3370 | |
| }, | |
| { | |
| "entropy": 2.1775210916996004, | |
| "epoch": 4.801705756929637, | |
| "grad_norm": 0.041752155870199203, | |
| "learning_rate": 8.405655370349209e-08, | |
| "loss": 0.005490196123719216, | |
| "mean_token_accuracy": 0.9972794115543365, | |
| "num_tokens": 12468421.0, | |
| "step": 3380 | |
| }, | |
| { | |
| "entropy": 2.1661739617586138, | |
| "epoch": 4.8159203980099505, | |
| "grad_norm": 1.1951086521148682, | |
| "learning_rate": 7.257036800074169e-08, | |
| "loss": 0.004392094537615776, | |
| "mean_token_accuracy": 0.9986564621329308, | |
| "num_tokens": 12505399.0, | |
| "step": 3390 | |
| }, | |
| { | |
| "entropy": 2.1709176123142244, | |
| "epoch": 4.830135039090263, | |
| "grad_norm": 0.009752362966537476, | |
| "learning_rate": 6.192481535577389e-08, | |
| "loss": 0.00032480861991643903, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 12537999.0, | |
| "step": 3400 | |
| }, | |
| { | |
| "entropy": 2.0440476834774017, | |
| "epoch": 4.844349680170575, | |
| "grad_norm": 0.033612970262765884, | |
| "learning_rate": 5.2120797210736264e-08, | |
| "loss": 0.002183059975504875, | |
| "mean_token_accuracy": 0.9984375, | |
| "num_tokens": 12580299.0, | |
| "step": 3410 | |
| }, | |
| { | |
| "entropy": 2.155395808815956, | |
| "epoch": 4.858564321250888, | |
| "grad_norm": 0.09350975602865219, | |
| "learning_rate": 4.315914374847019e-08, | |
| "loss": 0.0005531907547265292, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 12613080.0, | |
| "step": 3420 | |
| }, | |
| { | |
| "entropy": 2.1979628175497057, | |
| "epoch": 4.872778962331201, | |
| "grad_norm": 0.04874487593770027, | |
| "learning_rate": 3.504061382221702e-08, | |
| "loss": 0.0024951497092843057, | |
| "mean_token_accuracy": 0.9986111104488373, | |
| "num_tokens": 12650712.0, | |
| "step": 3430 | |
| }, | |
| { | |
| "entropy": 2.1535072445869448, | |
| "epoch": 4.886993603411514, | |
| "grad_norm": 0.08149798959493637, | |
| "learning_rate": 2.776589489136061e-08, | |
| "loss": 0.0022866273298859595, | |
| "mean_token_accuracy": 0.9977481618523598, | |
| "num_tokens": 12686728.0, | |
| "step": 3440 | |
| }, | |
| { | |
| "entropy": 2.173008641600609, | |
| "epoch": 4.901208244491826, | |
| "grad_norm": 0.058297913521528244, | |
| "learning_rate": 2.1335602963207247e-08, | |
| "loss": 0.0012641225941479207, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 12724571.0, | |
| "step": 3450 | |
| }, | |
| { | |
| "entropy": 2.1928866147994994, | |
| "epoch": 4.91542288557214, | |
| "grad_norm": 0.05695611238479614, | |
| "learning_rate": 1.5750282540835105e-08, | |
| "loss": 0.007882739603519439, | |
| "mean_token_accuracy": 0.99921875, | |
| "num_tokens": 12761233.0, | |
| "step": 3460 | |
| }, | |
| { | |
| "entropy": 2.1840217113494873, | |
| "epoch": 4.929637526652452, | |
| "grad_norm": 0.005757441744208336, | |
| "learning_rate": 1.1010406576976718e-08, | |
| "loss": 0.0078007526695728305, | |
| "mean_token_accuracy": 0.9985565349459649, | |
| "num_tokens": 12795491.0, | |
| "step": 3470 | |
| }, | |
| { | |
| "entropy": 2.090686786174774, | |
| "epoch": 4.943852167732764, | |
| "grad_norm": 0.20968373119831085, | |
| "learning_rate": 7.116376433975447e-09, | |
| "loss": 0.002710508555173874, | |
| "mean_token_accuracy": 0.9993243247270585, | |
| "num_tokens": 12837878.0, | |
| "step": 3480 | |
| }, | |
| { | |
| "entropy": 2.202594816684723, | |
| "epoch": 4.9580668088130775, | |
| "grad_norm": 0.15738585591316223, | |
| "learning_rate": 4.068521849800444e-09, | |
| "loss": 0.005096424371004105, | |
| "mean_token_accuracy": 0.9977618142962456, | |
| "num_tokens": 12872699.0, | |
| "step": 3490 | |
| }, | |
| { | |
| "entropy": 2.177238318324089, | |
| "epoch": 4.97228144989339, | |
| "grad_norm": 0.026785463094711304, | |
| "learning_rate": 1.8671009101189908e-09, | |
| "loss": 0.0019810071215033533, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 12909138.0, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 4.97228144989339, | |
| "eval_entropy": 2.019442914670787, | |
| "eval_loss": 0.5660073757171631, | |
| "eval_mean_token_accuracy": 0.9171707378534937, | |
| "eval_num_tokens": 12909138.0, | |
| "eval_runtime": 991.6327, | |
| "eval_samples_per_second": 7.716, | |
| "eval_steps_per_second": 0.965, | |
| "step": 3500 | |
| }, | |
| { | |
| "entropy": 2.0914847373962404, | |
| "epoch": 4.986496090973703, | |
| "grad_norm": 0.7345014214515686, | |
| "learning_rate": 5.123000264484201e-10, | |
| "loss": 0.004509637877345085, | |
| "mean_token_accuracy": 0.9989583328366279, | |
| "num_tokens": 12949603.0, | |
| "step": 3510 | |
| }, | |
| { | |
| "entropy": 2.209040698252226, | |
| "epoch": 5.0, | |
| "grad_norm": 0.0030606593936681747, | |
| "learning_rate": 4.233920367635591e-12, | |
| "loss": 0.00112865949049592, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 12980625.0, | |
| "step": 3520 | |
| }, | |
| { | |
| "epoch": 5.0, | |
| "eval_entropy": 2.0196086888278417, | |
| "eval_loss": 0.5659698247909546, | |
| "eval_mean_token_accuracy": 0.917177452126765, | |
| "eval_num_tokens": 12980625.0, | |
| "eval_runtime": 991.6, | |
| "eval_samples_per_second": 7.716, | |
| "eval_steps_per_second": 0.965, | |
| "step": 3520 | |
| }, | |
| { | |
| "epoch": 5.0, | |
| "step": 3520, | |
| "total_flos": 7.537641057884897e+17, | |
| "train_loss": 0.06495461261630144, | |
| "train_runtime": 13504.3879, | |
| "train_samples_per_second": 2.083, | |
| "train_steps_per_second": 0.261 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 3520, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 5, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 7.537641057884897e+17, | |
| "train_batch_size": 2, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |