Text Generation
Transformers
Safetensors
English
svg
text-to-svg
qwen2
qlora
lora
fine-tuning
code-generation
Instructions to use kaleidoscopicwhether/svg-gen-weights with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use kaleidoscopicwhether/svg-gen-weights with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="kaleidoscopicwhether/svg-gen-weights")# pip install -U transformers accelerate # Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("kaleidoscopicwhether/svg-gen-weights", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use kaleidoscopicwhether/svg-gen-weights with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "kaleidoscopicwhether/svg-gen-weights" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "kaleidoscopicwhether/svg-gen-weights", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker
docker model run hf.co/kaleidoscopicwhether/svg-gen-weights
- SGLang
How to use kaleidoscopicwhether/svg-gen-weights with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "kaleidoscopicwhether/svg-gen-weights" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "kaleidoscopicwhether/svg-gen-weights", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "kaleidoscopicwhether/svg-gen-weights" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "kaleidoscopicwhether/svg-gen-weights", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }' - Docker Model Runner
How to use kaleidoscopicwhether/svg-gen-weights with Docker Model Runner:
docker model run hf.co/kaleidoscopicwhether/svg-gen-weights
Download refined-7000/trainer_state.json from kaleidoscopicwhether/svg-gen-weights: direct link, hf CLI and curl.
- Browser
- Download file 208 kB
-
https://huggingface.co/kaleidoscopicwhether/svg-gen-weights/resolve/b8eebdb6b72f2b9247f966ec9cf4eed2d08b1a44/refined-7000/trainer_state.json
- Command line
-
hf download hf://kaleidoscopicwhether/svg-gen-weights@b8eebdb6b72f2b9247f966ec9cf4eed2d08b1a44/refined-7000/trainer_state.json
-
curl -L -o trainer_state.json https://huggingface.co/kaleidoscopicwhether/svg-gen-weights/resolve/b8eebdb6b72f2b9247f966ec9cf4eed2d08b1a44/refined-7000/trainer_state.json
208 kB
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 1.2455734495951596, | |
| "eval_steps": 500, | |
| "global_step": 7000, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 0.32860654294490815, | |
| "epoch": 0.001779517750689563, | |
| "grad_norm": 0.66015625, | |
| "learning_rate": 8.021390374331552e-08, | |
| "loss": 0.3451235294342041, | |
| "mean_token_accuracy": 0.8844113677740097, | |
| "num_tokens": 57266.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 0.36775331050157545, | |
| "epoch": 0.003559035501379126, | |
| "grad_norm": 0.8203125, | |
| "learning_rate": 1.6934046345811053e-07, | |
| "loss": 0.37715222835540774, | |
| "mean_token_accuracy": 0.8700783222913742, | |
| "num_tokens": 121757.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 0.3367079794406891, | |
| "epoch": 0.005338553252068689, | |
| "grad_norm": 0.609375, | |
| "learning_rate": 2.584670231729056e-07, | |
| "loss": 0.3503671169281006, | |
| "mean_token_accuracy": 0.8846798032522202, | |
| "num_tokens": 183469.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 0.3625075250864029, | |
| "epoch": 0.007118071002758252, | |
| "grad_norm": 0.84765625, | |
| "learning_rate": 3.4759358288770056e-07, | |
| "loss": 0.3748985767364502, | |
| "mean_token_accuracy": 0.8714122384786606, | |
| "num_tokens": 246046.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 0.38094038516283035, | |
| "epoch": 0.008897588753447816, | |
| "grad_norm": 0.609375, | |
| "learning_rate": 4.367201426024956e-07, | |
| "loss": 0.3928072452545166, | |
| "mean_token_accuracy": 0.8651866286993026, | |
| "num_tokens": 307119.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 0.3649078577756882, | |
| "epoch": 0.010677106504137378, | |
| "grad_norm": 0.8359375, | |
| "learning_rate": 5.258467023172906e-07, | |
| "loss": 0.3773404598236084, | |
| "mean_token_accuracy": 0.8724571585655212, | |
| "num_tokens": 364099.0, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 0.3137588031589985, | |
| "epoch": 0.012456624254826942, | |
| "grad_norm": 0.671875, | |
| "learning_rate": 6.149732620320856e-07, | |
| "loss": 0.3299793481826782, | |
| "mean_token_accuracy": 0.8907061606645584, | |
| "num_tokens": 427925.0, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 0.3294053204357624, | |
| "epoch": 0.014236142005516504, | |
| "grad_norm": 0.70703125, | |
| "learning_rate": 7.040998217468806e-07, | |
| "loss": 0.33570303916931155, | |
| "mean_token_accuracy": 0.8864214718341827, | |
| "num_tokens": 490456.0, | |
| "step": 80 | |
| }, | |
| { | |
| "entropy": 0.314082407951355, | |
| "epoch": 0.016015659756206068, | |
| "grad_norm": 0.734375, | |
| "learning_rate": 7.932263814616756e-07, | |
| "loss": 0.32135210037231443, | |
| "mean_token_accuracy": 0.8916998952627182, | |
| "num_tokens": 552812.0, | |
| "step": 90 | |
| }, | |
| { | |
| "entropy": 0.33767677322030065, | |
| "epoch": 0.017795177506895632, | |
| "grad_norm": 0.77734375, | |
| "learning_rate": 8.823529411764707e-07, | |
| "loss": 0.35642199516296386, | |
| "mean_token_accuracy": 0.8808052331209183, | |
| "num_tokens": 610036.0, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 0.33305957317352297, | |
| "epoch": 0.019574695257585196, | |
| "grad_norm": 0.8046875, | |
| "learning_rate": 9.714795008912657e-07, | |
| "loss": 0.34201273918151853, | |
| "mean_token_accuracy": 0.8846908867359161, | |
| "num_tokens": 674910.0, | |
| "step": 110 | |
| }, | |
| { | |
| "entropy": 0.3495964154601097, | |
| "epoch": 0.021354213008274756, | |
| "grad_norm": 0.65234375, | |
| "learning_rate": 1.0606060606060608e-06, | |
| "loss": 0.35735392570495605, | |
| "mean_token_accuracy": 0.8776104301214218, | |
| "num_tokens": 739088.0, | |
| "step": 120 | |
| }, | |
| { | |
| "entropy": 0.32690695077180865, | |
| "epoch": 0.02313373075896432, | |
| "grad_norm": 0.703125, | |
| "learning_rate": 1.1497326203208558e-06, | |
| "loss": 0.33275294303894043, | |
| "mean_token_accuracy": 0.8853529244661331, | |
| "num_tokens": 797045.0, | |
| "step": 130 | |
| }, | |
| { | |
| "entropy": 0.3199396960437298, | |
| "epoch": 0.024913248509653884, | |
| "grad_norm": 0.71484375, | |
| "learning_rate": 1.2388591800356508e-06, | |
| "loss": 0.33289413452148436, | |
| "mean_token_accuracy": 0.8884731292724609, | |
| "num_tokens": 861148.0, | |
| "step": 140 | |
| }, | |
| { | |
| "entropy": 0.36166896000504495, | |
| "epoch": 0.026692766260343448, | |
| "grad_norm": 0.6953125, | |
| "learning_rate": 1.3279857397504459e-06, | |
| "loss": 0.3732253074645996, | |
| "mean_token_accuracy": 0.8727149099111557, | |
| "num_tokens": 922387.0, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 0.3397223137319088, | |
| "epoch": 0.02847228401103301, | |
| "grad_norm": 0.69140625, | |
| "learning_rate": 1.4171122994652409e-06, | |
| "loss": 0.3498528480529785, | |
| "mean_token_accuracy": 0.8799682438373566, | |
| "num_tokens": 989442.0, | |
| "step": 160 | |
| }, | |
| { | |
| "entropy": 0.4018726907670498, | |
| "epoch": 0.030251801761722572, | |
| "grad_norm": 0.67578125, | |
| "learning_rate": 1.506238859180036e-06, | |
| "loss": 0.41373891830444337, | |
| "mean_token_accuracy": 0.8603814005851745, | |
| "num_tokens": 1052200.0, | |
| "step": 170 | |
| }, | |
| { | |
| "entropy": 0.3689358413219452, | |
| "epoch": 0.032031319512412136, | |
| "grad_norm": 0.7109375, | |
| "learning_rate": 1.595365418894831e-06, | |
| "loss": 0.3795238256454468, | |
| "mean_token_accuracy": 0.8720099329948425, | |
| "num_tokens": 1117114.0, | |
| "step": 180 | |
| }, | |
| { | |
| "entropy": 0.336656229197979, | |
| "epoch": 0.033810837263101697, | |
| "grad_norm": 0.85546875, | |
| "learning_rate": 1.684491978609626e-06, | |
| "loss": 0.34227771759033204, | |
| "mean_token_accuracy": 0.8847573012113571, | |
| "num_tokens": 1176991.0, | |
| "step": 190 | |
| }, | |
| { | |
| "entropy": 0.3449875839054585, | |
| "epoch": 0.035590355013791264, | |
| "grad_norm": 0.68359375, | |
| "learning_rate": 1.7736185383244208e-06, | |
| "loss": 0.35102674961090086, | |
| "mean_token_accuracy": 0.8801533132791519, | |
| "num_tokens": 1240161.0, | |
| "step": 200 | |
| }, | |
| { | |
| "entropy": 0.34684649407863616, | |
| "epoch": 0.037369872764480824, | |
| "grad_norm": 0.76171875, | |
| "learning_rate": 1.8627450980392158e-06, | |
| "loss": 0.35135159492492674, | |
| "mean_token_accuracy": 0.8800874263048172, | |
| "num_tokens": 1301036.0, | |
| "step": 210 | |
| }, | |
| { | |
| "entropy": 0.34509315714240074, | |
| "epoch": 0.03914939051517039, | |
| "grad_norm": 0.890625, | |
| "learning_rate": 1.951871657754011e-06, | |
| "loss": 0.35075480937957765, | |
| "mean_token_accuracy": 0.8830925613641739, | |
| "num_tokens": 1359434.0, | |
| "step": 220 | |
| }, | |
| { | |
| "entropy": 0.3258862540125847, | |
| "epoch": 0.04092890826585995, | |
| "grad_norm": 0.62109375, | |
| "learning_rate": 2.040998217468806e-06, | |
| "loss": 0.33036489486694337, | |
| "mean_token_accuracy": 0.8877994000911713, | |
| "num_tokens": 1421932.0, | |
| "step": 230 | |
| }, | |
| { | |
| "entropy": 0.36866824701428413, | |
| "epoch": 0.04270842601654951, | |
| "grad_norm": 0.78125, | |
| "learning_rate": 2.130124777183601e-06, | |
| "loss": 0.3781815767288208, | |
| "mean_token_accuracy": 0.872001588344574, | |
| "num_tokens": 1478613.0, | |
| "step": 240 | |
| }, | |
| { | |
| "entropy": 0.34916575253009796, | |
| "epoch": 0.04448794376723908, | |
| "grad_norm": 0.703125, | |
| "learning_rate": 2.219251336898396e-06, | |
| "loss": 0.35482115745544435, | |
| "mean_token_accuracy": 0.8789272099733353, | |
| "num_tokens": 1543219.0, | |
| "step": 250 | |
| }, | |
| { | |
| "entropy": 0.3428291827440262, | |
| "epoch": 0.04626746151792864, | |
| "grad_norm": 0.75390625, | |
| "learning_rate": 2.308377896613191e-06, | |
| "loss": 0.34780704975128174, | |
| "mean_token_accuracy": 0.8816773295402527, | |
| "num_tokens": 1603739.0, | |
| "step": 260 | |
| }, | |
| { | |
| "entropy": 0.3357290215790272, | |
| "epoch": 0.04804697926861821, | |
| "grad_norm": 0.71875, | |
| "learning_rate": 2.397504456327986e-06, | |
| "loss": 0.34503133296966554, | |
| "mean_token_accuracy": 0.883594223856926, | |
| "num_tokens": 1664090.0, | |
| "step": 270 | |
| }, | |
| { | |
| "entropy": 0.33964226990938184, | |
| "epoch": 0.04982649701930777, | |
| "grad_norm": 0.6796875, | |
| "learning_rate": 2.486631016042781e-06, | |
| "loss": 0.3491342782974243, | |
| "mean_token_accuracy": 0.8842448592185974, | |
| "num_tokens": 1721928.0, | |
| "step": 280 | |
| }, | |
| { | |
| "entropy": 0.36515090987086296, | |
| "epoch": 0.05160601476999733, | |
| "grad_norm": 0.76171875, | |
| "learning_rate": 2.575757575757576e-06, | |
| "loss": 0.36740152835845946, | |
| "mean_token_accuracy": 0.8746822863817215, | |
| "num_tokens": 1783971.0, | |
| "step": 290 | |
| }, | |
| { | |
| "entropy": 0.35400829613208773, | |
| "epoch": 0.053385532520686896, | |
| "grad_norm": 0.58203125, | |
| "learning_rate": 2.664884135472371e-06, | |
| "loss": 0.35753028392791747, | |
| "mean_token_accuracy": 0.8779943257570266, | |
| "num_tokens": 1845602.0, | |
| "step": 300 | |
| }, | |
| { | |
| "entropy": 0.33071010187268257, | |
| "epoch": 0.055165050271376456, | |
| "grad_norm": 0.72265625, | |
| "learning_rate": 2.754010695187166e-06, | |
| "loss": 0.3346755027770996, | |
| "mean_token_accuracy": 0.8866520315408707, | |
| "num_tokens": 1906484.0, | |
| "step": 310 | |
| }, | |
| { | |
| "entropy": 0.3566290229558945, | |
| "epoch": 0.05694456802206602, | |
| "grad_norm": 1.015625, | |
| "learning_rate": 2.843137254901961e-06, | |
| "loss": 0.35546977519989015, | |
| "mean_token_accuracy": 0.8784496366977692, | |
| "num_tokens": 1972526.0, | |
| "step": 320 | |
| }, | |
| { | |
| "entropy": 0.3694092400372028, | |
| "epoch": 0.058724085772755584, | |
| "grad_norm": 0.8515625, | |
| "learning_rate": 2.9322638146167557e-06, | |
| "loss": 0.3756656885147095, | |
| "mean_token_accuracy": 0.8704883366823196, | |
| "num_tokens": 2035521.0, | |
| "step": 330 | |
| }, | |
| { | |
| "entropy": 0.32793279364705086, | |
| "epoch": 0.060503603523445144, | |
| "grad_norm": 0.74609375, | |
| "learning_rate": 3.0213903743315507e-06, | |
| "loss": 0.3240004539489746, | |
| "mean_token_accuracy": 0.8898506164550781, | |
| "num_tokens": 2097013.0, | |
| "step": 340 | |
| }, | |
| { | |
| "entropy": 0.3634592294692993, | |
| "epoch": 0.06228312127413471, | |
| "grad_norm": 0.66796875, | |
| "learning_rate": 3.1105169340463458e-06, | |
| "loss": 0.3696018695831299, | |
| "mean_token_accuracy": 0.8732749789953231, | |
| "num_tokens": 2162178.0, | |
| "step": 350 | |
| }, | |
| { | |
| "entropy": 0.36352587342262266, | |
| "epoch": 0.06406263902482427, | |
| "grad_norm": 0.6640625, | |
| "learning_rate": 3.1996434937611408e-06, | |
| "loss": 0.36823832988739014, | |
| "mean_token_accuracy": 0.8757654964923859, | |
| "num_tokens": 2222991.0, | |
| "step": 360 | |
| }, | |
| { | |
| "entropy": 0.3474710017442703, | |
| "epoch": 0.06584215677551383, | |
| "grad_norm": 0.71484375, | |
| "learning_rate": 3.288770053475936e-06, | |
| "loss": 0.3531644821166992, | |
| "mean_token_accuracy": 0.8808708101511001, | |
| "num_tokens": 2282984.0, | |
| "step": 370 | |
| }, | |
| { | |
| "entropy": 0.3589304000139236, | |
| "epoch": 0.06762167452620339, | |
| "grad_norm": 0.84375, | |
| "learning_rate": 3.377896613190731e-06, | |
| "loss": 0.3596966028213501, | |
| "mean_token_accuracy": 0.8770811855792999, | |
| "num_tokens": 2346621.0, | |
| "step": 380 | |
| }, | |
| { | |
| "entropy": 0.3583641618490219, | |
| "epoch": 0.06940119227689297, | |
| "grad_norm": 0.703125, | |
| "learning_rate": 3.467023172905526e-06, | |
| "loss": 0.363906717300415, | |
| "mean_token_accuracy": 0.8765266954898834, | |
| "num_tokens": 2408410.0, | |
| "step": 390 | |
| }, | |
| { | |
| "entropy": 0.32061812058091166, | |
| "epoch": 0.07118071002758253, | |
| "grad_norm": 0.75390625, | |
| "learning_rate": 3.556149732620321e-06, | |
| "loss": 0.31879429817199706, | |
| "mean_token_accuracy": 0.8910367012023925, | |
| "num_tokens": 2470599.0, | |
| "step": 400 | |
| }, | |
| { | |
| "entropy": 0.33497466519474983, | |
| "epoch": 0.07296022777827209, | |
| "grad_norm": 0.59375, | |
| "learning_rate": 3.645276292335116e-06, | |
| "loss": 0.3321577310562134, | |
| "mean_token_accuracy": 0.8880389362573624, | |
| "num_tokens": 2532757.0, | |
| "step": 410 | |
| }, | |
| { | |
| "entropy": 0.3281519956886768, | |
| "epoch": 0.07473974552896165, | |
| "grad_norm": 0.72265625, | |
| "learning_rate": 3.734402852049911e-06, | |
| "loss": 0.3272218704223633, | |
| "mean_token_accuracy": 0.886707216501236, | |
| "num_tokens": 2594001.0, | |
| "step": 420 | |
| }, | |
| { | |
| "entropy": 0.37212703600525854, | |
| "epoch": 0.07651926327965121, | |
| "grad_norm": 0.6875, | |
| "learning_rate": 3.8235294117647055e-06, | |
| "loss": 0.373236083984375, | |
| "mean_token_accuracy": 0.8709172129631042, | |
| "num_tokens": 2660336.0, | |
| "step": 430 | |
| }, | |
| { | |
| "entropy": 0.3637304425239563, | |
| "epoch": 0.07829878103034078, | |
| "grad_norm": 0.8125, | |
| "learning_rate": 3.9126559714795006e-06, | |
| "loss": 0.3628222942352295, | |
| "mean_token_accuracy": 0.8746890932321548, | |
| "num_tokens": 2718351.0, | |
| "step": 440 | |
| }, | |
| { | |
| "entropy": 0.362768467515707, | |
| "epoch": 0.08007829878103034, | |
| "grad_norm": 0.63671875, | |
| "learning_rate": 4.0017825311942964e-06, | |
| "loss": 0.36104235649108884, | |
| "mean_token_accuracy": 0.878073325753212, | |
| "num_tokens": 2782962.0, | |
| "step": 450 | |
| }, | |
| { | |
| "entropy": 0.36855516135692595, | |
| "epoch": 0.0818578165317199, | |
| "grad_norm": 0.91015625, | |
| "learning_rate": 4.0909090909090915e-06, | |
| "loss": 0.3710012435913086, | |
| "mean_token_accuracy": 0.8736769735813141, | |
| "num_tokens": 2843229.0, | |
| "step": 460 | |
| }, | |
| { | |
| "entropy": 0.3541841976344585, | |
| "epoch": 0.08363733428240946, | |
| "grad_norm": 0.703125, | |
| "learning_rate": 4.1800356506238865e-06, | |
| "loss": 0.349487829208374, | |
| "mean_token_accuracy": 0.8802689701318741, | |
| "num_tokens": 2901459.0, | |
| "step": 470 | |
| }, | |
| { | |
| "entropy": 0.31983906850218774, | |
| "epoch": 0.08541685203309902, | |
| "grad_norm": 0.70703125, | |
| "learning_rate": 4.2691622103386815e-06, | |
| "loss": 0.32067289352416994, | |
| "mean_token_accuracy": 0.8906120359897614, | |
| "num_tokens": 2960388.0, | |
| "step": 480 | |
| }, | |
| { | |
| "entropy": 0.352615787088871, | |
| "epoch": 0.0871963697837886, | |
| "grad_norm": 0.65234375, | |
| "learning_rate": 4.3582887700534766e-06, | |
| "loss": 0.35637969970703126, | |
| "mean_token_accuracy": 0.8778968840837479, | |
| "num_tokens": 3025772.0, | |
| "step": 490 | |
| }, | |
| { | |
| "entropy": 0.3554725505411625, | |
| "epoch": 0.08897588753447816, | |
| "grad_norm": 0.53125, | |
| "learning_rate": 4.447415329768272e-06, | |
| "loss": 0.35056004524230955, | |
| "mean_token_accuracy": 0.8800348669290543, | |
| "num_tokens": 3087850.0, | |
| "step": 500 | |
| }, | |
| { | |
| "entropy": 0.38325470089912417, | |
| "epoch": 0.09075540528516772, | |
| "grad_norm": 0.7109375, | |
| "learning_rate": 4.536541889483067e-06, | |
| "loss": 0.3831326007843018, | |
| "mean_token_accuracy": 0.8683792471885681, | |
| "num_tokens": 3150214.0, | |
| "step": 510 | |
| }, | |
| { | |
| "entropy": 0.36651182398200033, | |
| "epoch": 0.09253492303585728, | |
| "grad_norm": 0.734375, | |
| "learning_rate": 4.625668449197862e-06, | |
| "loss": 0.37067341804504395, | |
| "mean_token_accuracy": 0.8725595206022263, | |
| "num_tokens": 3211406.0, | |
| "step": 520 | |
| }, | |
| { | |
| "entropy": 0.3612689882516861, | |
| "epoch": 0.09431444078654684, | |
| "grad_norm": 0.703125, | |
| "learning_rate": 4.714795008912657e-06, | |
| "loss": 0.3517920970916748, | |
| "mean_token_accuracy": 0.8764923334121704, | |
| "num_tokens": 3269507.0, | |
| "step": 530 | |
| }, | |
| { | |
| "entropy": 0.3587156981229782, | |
| "epoch": 0.09609395853723642, | |
| "grad_norm": 0.5859375, | |
| "learning_rate": 4.803921568627452e-06, | |
| "loss": 0.35204501152038575, | |
| "mean_token_accuracy": 0.8772314876317978, | |
| "num_tokens": 3333240.0, | |
| "step": 540 | |
| }, | |
| { | |
| "entropy": 0.3636198118329048, | |
| "epoch": 0.09787347628792598, | |
| "grad_norm": 0.76953125, | |
| "learning_rate": 4.893048128342247e-06, | |
| "loss": 0.367664098739624, | |
| "mean_token_accuracy": 0.874831223487854, | |
| "num_tokens": 3392208.0, | |
| "step": 550 | |
| }, | |
| { | |
| "entropy": 0.3718460865318775, | |
| "epoch": 0.09965299403861554, | |
| "grad_norm": 0.62890625, | |
| "learning_rate": 4.982174688057042e-06, | |
| "loss": 0.3703943729400635, | |
| "mean_token_accuracy": 0.8717885941267014, | |
| "num_tokens": 3453138.0, | |
| "step": 560 | |
| }, | |
| { | |
| "entropy": 0.37602192610502244, | |
| "epoch": 0.1014325117893051, | |
| "grad_norm": 0.734375, | |
| "learning_rate": 4.999993076457557e-06, | |
| "loss": 0.37216212749481203, | |
| "mean_token_accuracy": 0.8720100283622741, | |
| "num_tokens": 3514781.0, | |
| "step": 570 | |
| }, | |
| { | |
| "entropy": 0.31663130819797514, | |
| "epoch": 0.10321202953999466, | |
| "grad_norm": 0.6171875, | |
| "learning_rate": 4.9999649496321045e-06, | |
| "loss": 0.3179504871368408, | |
| "mean_token_accuracy": 0.8921509385108948, | |
| "num_tokens": 3577891.0, | |
| "step": 580 | |
| }, | |
| { | |
| "entropy": 0.3112894132733345, | |
| "epoch": 0.10499154729068423, | |
| "grad_norm": 0.70703125, | |
| "learning_rate": 4.999915187045475e-06, | |
| "loss": 0.3026210069656372, | |
| "mean_token_accuracy": 0.8973556339740754, | |
| "num_tokens": 3639917.0, | |
| "step": 590 | |
| }, | |
| { | |
| "entropy": 0.33959473818540575, | |
| "epoch": 0.10677106504137379, | |
| "grad_norm": 0.80078125, | |
| "learning_rate": 4.999843789128336e-06, | |
| "loss": 0.33784701824188235, | |
| "mean_token_accuracy": 0.885186767578125, | |
| "num_tokens": 3698607.0, | |
| "step": 600 | |
| }, | |
| { | |
| "entropy": 0.37242047637701037, | |
| "epoch": 0.10855058279206335, | |
| "grad_norm": 0.88671875, | |
| "learning_rate": 4.999750756498594e-06, | |
| "loss": 0.36487655639648436, | |
| "mean_token_accuracy": 0.8730682343244552, | |
| "num_tokens": 3762523.0, | |
| "step": 610 | |
| }, | |
| { | |
| "entropy": 0.3216068513691425, | |
| "epoch": 0.11033010054275291, | |
| "grad_norm": 0.72265625, | |
| "learning_rate": 4.999636089961392e-06, | |
| "loss": 0.3243628978729248, | |
| "mean_token_accuracy": 0.8880964249372483, | |
| "num_tokens": 3824182.0, | |
| "step": 620 | |
| }, | |
| { | |
| "entropy": 0.32486376315355303, | |
| "epoch": 0.11210961829344247, | |
| "grad_norm": 0.6484375, | |
| "learning_rate": 4.999499790509106e-06, | |
| "loss": 0.3245402336120605, | |
| "mean_token_accuracy": 0.8889100551605225, | |
| "num_tokens": 3885170.0, | |
| "step": 630 | |
| }, | |
| { | |
| "entropy": 0.3441788099706173, | |
| "epoch": 0.11388913604413203, | |
| "grad_norm": 0.62890625, | |
| "learning_rate": 4.999341859321326e-06, | |
| "loss": 0.34557857513427737, | |
| "mean_token_accuracy": 0.8842501014471054, | |
| "num_tokens": 3948373.0, | |
| "step": 640 | |
| }, | |
| { | |
| "entropy": 0.38801722079515455, | |
| "epoch": 0.11566865379482161, | |
| "grad_norm": 0.71875, | |
| "learning_rate": 4.99916229776486e-06, | |
| "loss": 0.3799426078796387, | |
| "mean_token_accuracy": 0.8673164427280426, | |
| "num_tokens": 4011902.0, | |
| "step": 650 | |
| }, | |
| { | |
| "entropy": 0.3308356985449791, | |
| "epoch": 0.11744817154551117, | |
| "grad_norm": 0.59765625, | |
| "learning_rate": 4.998961107393706e-06, | |
| "loss": 0.33188343048095703, | |
| "mean_token_accuracy": 0.8888141304254532, | |
| "num_tokens": 4072647.0, | |
| "step": 660 | |
| }, | |
| { | |
| "entropy": 0.3120661698281765, | |
| "epoch": 0.11922768929620073, | |
| "grad_norm": 0.66015625, | |
| "learning_rate": 4.998738289949054e-06, | |
| "loss": 0.3126791000366211, | |
| "mean_token_accuracy": 0.8948039174079895, | |
| "num_tokens": 4133439.0, | |
| "step": 670 | |
| }, | |
| { | |
| "entropy": 0.33610115870833396, | |
| "epoch": 0.12100720704689029, | |
| "grad_norm": 0.6171875, | |
| "learning_rate": 4.99849384735926e-06, | |
| "loss": 0.3356921911239624, | |
| "mean_token_accuracy": 0.8878594189882278, | |
| "num_tokens": 4195834.0, | |
| "step": 680 | |
| }, | |
| { | |
| "entropy": 0.34462174475193025, | |
| "epoch": 0.12278672479757985, | |
| "grad_norm": 0.7109375, | |
| "learning_rate": 4.998227781739834e-06, | |
| "loss": 0.35248551368713377, | |
| "mean_token_accuracy": 0.8806085497140884, | |
| "num_tokens": 4258965.0, | |
| "step": 690 | |
| }, | |
| { | |
| "entropy": 0.30714038833975793, | |
| "epoch": 0.12456624254826942, | |
| "grad_norm": 0.6171875, | |
| "learning_rate": 4.997940095393421e-06, | |
| "loss": 0.3035902500152588, | |
| "mean_token_accuracy": 0.8958918929100037, | |
| "num_tokens": 4321451.0, | |
| "step": 700 | |
| }, | |
| { | |
| "entropy": 0.3459739051759243, | |
| "epoch": 0.12634576029895897, | |
| "grad_norm": 0.71875, | |
| "learning_rate": 4.9976307908097825e-06, | |
| "loss": 0.3412956476211548, | |
| "mean_token_accuracy": 0.8821541339159011, | |
| "num_tokens": 4382544.0, | |
| "step": 710 | |
| }, | |
| { | |
| "entropy": 0.34615052714943884, | |
| "epoch": 0.12812527804964854, | |
| "grad_norm": 0.625, | |
| "learning_rate": 4.997299870665771e-06, | |
| "loss": 0.34567866325378416, | |
| "mean_token_accuracy": 0.8812555313110352, | |
| "num_tokens": 4447104.0, | |
| "step": 720 | |
| }, | |
| { | |
| "entropy": 0.31227469965815546, | |
| "epoch": 0.12990479580033812, | |
| "grad_norm": 0.60546875, | |
| "learning_rate": 4.9969473378253096e-06, | |
| "loss": 0.3131171703338623, | |
| "mean_token_accuracy": 0.8943297117948532, | |
| "num_tokens": 4509464.0, | |
| "step": 730 | |
| }, | |
| { | |
| "entropy": 0.33893360793590543, | |
| "epoch": 0.13168431355102767, | |
| "grad_norm": 0.67578125, | |
| "learning_rate": 4.996573195339369e-06, | |
| "loss": 0.3371562480926514, | |
| "mean_token_accuracy": 0.8841905981302262, | |
| "num_tokens": 4572522.0, | |
| "step": 740 | |
| }, | |
| { | |
| "entropy": 0.3381062112748623, | |
| "epoch": 0.13346383130171724, | |
| "grad_norm": 0.69140625, | |
| "learning_rate": 4.996177446445938e-06, | |
| "loss": 0.3396785020828247, | |
| "mean_token_accuracy": 0.8838836699724197, | |
| "num_tokens": 4634676.0, | |
| "step": 750 | |
| }, | |
| { | |
| "entropy": 0.34179429709911346, | |
| "epoch": 0.13524334905240679, | |
| "grad_norm": 0.6875, | |
| "learning_rate": 4.995760094569994e-06, | |
| "loss": 0.3441832780838013, | |
| "mean_token_accuracy": 0.8860727399587631, | |
| "num_tokens": 4694079.0, | |
| "step": 760 | |
| }, | |
| { | |
| "entropy": 0.3321096934378147, | |
| "epoch": 0.13702286680309636, | |
| "grad_norm": 0.78125, | |
| "learning_rate": 4.995321143323479e-06, | |
| "loss": 0.32719078063964846, | |
| "mean_token_accuracy": 0.8888979554176331, | |
| "num_tokens": 4755795.0, | |
| "step": 770 | |
| }, | |
| { | |
| "entropy": 0.3038732573390007, | |
| "epoch": 0.13880238455378593, | |
| "grad_norm": 0.56640625, | |
| "learning_rate": 4.9948605965052645e-06, | |
| "loss": 0.30793750286102295, | |
| "mean_token_accuracy": 0.8963340222835541, | |
| "num_tokens": 4818297.0, | |
| "step": 780 | |
| }, | |
| { | |
| "entropy": 0.3286074362695217, | |
| "epoch": 0.14058190230447548, | |
| "grad_norm": 0.65234375, | |
| "learning_rate": 4.9943784581011175e-06, | |
| "loss": 0.32923245429992676, | |
| "mean_token_accuracy": 0.8867094904184342, | |
| "num_tokens": 4879989.0, | |
| "step": 790 | |
| }, | |
| { | |
| "entropy": 0.32576177939772605, | |
| "epoch": 0.14236142005516506, | |
| "grad_norm": 0.671875, | |
| "learning_rate": 4.99387473228367e-06, | |
| "loss": 0.3253772735595703, | |
| "mean_token_accuracy": 0.8897351205348969, | |
| "num_tokens": 4938072.0, | |
| "step": 800 | |
| }, | |
| { | |
| "entropy": 0.34196730256080626, | |
| "epoch": 0.1441409378058546, | |
| "grad_norm": 0.70703125, | |
| "learning_rate": 4.99334942341238e-06, | |
| "loss": 0.3411428213119507, | |
| "mean_token_accuracy": 0.8838056415319443, | |
| "num_tokens": 5003090.0, | |
| "step": 810 | |
| }, | |
| { | |
| "entropy": 0.32348892390727996, | |
| "epoch": 0.14592045555654418, | |
| "grad_norm": 0.8515625, | |
| "learning_rate": 4.992802536033493e-06, | |
| "loss": 0.3214717388153076, | |
| "mean_token_accuracy": 0.8909420162439347, | |
| "num_tokens": 5062779.0, | |
| "step": 820 | |
| }, | |
| { | |
| "entropy": 0.31705158203840256, | |
| "epoch": 0.14769997330723375, | |
| "grad_norm": 0.65625, | |
| "learning_rate": 4.992234074880007e-06, | |
| "loss": 0.31249897480010985, | |
| "mean_token_accuracy": 0.8924014419317245, | |
| "num_tokens": 5125993.0, | |
| "step": 830 | |
| }, | |
| { | |
| "entropy": 0.33678495436906813, | |
| "epoch": 0.1494794910579233, | |
| "grad_norm": 0.75, | |
| "learning_rate": 4.991644044871624e-06, | |
| "loss": 0.3350341320037842, | |
| "mean_token_accuracy": 0.886579817533493, | |
| "num_tokens": 5185153.0, | |
| "step": 840 | |
| }, | |
| { | |
| "entropy": 0.3404834918677807, | |
| "epoch": 0.15125900880861287, | |
| "grad_norm": 0.71875, | |
| "learning_rate": 4.991032451114718e-06, | |
| "loss": 0.33901474475860593, | |
| "mean_token_accuracy": 0.8847116142511368, | |
| "num_tokens": 5243157.0, | |
| "step": 850 | |
| }, | |
| { | |
| "entropy": 0.34688328504562377, | |
| "epoch": 0.15303852655930242, | |
| "grad_norm": 0.765625, | |
| "learning_rate": 4.99039929890228e-06, | |
| "loss": 0.3511410474777222, | |
| "mean_token_accuracy": 0.8813301533460617, | |
| "num_tokens": 5304289.0, | |
| "step": 860 | |
| }, | |
| { | |
| "entropy": 0.3682398319244385, | |
| "epoch": 0.154818044309992, | |
| "grad_norm": 0.8671875, | |
| "learning_rate": 4.98974459371388e-06, | |
| "loss": 0.3656897783279419, | |
| "mean_token_accuracy": 0.8737188547849655, | |
| "num_tokens": 5363495.0, | |
| "step": 870 | |
| }, | |
| { | |
| "entropy": 0.32507713288068774, | |
| "epoch": 0.15659756206068157, | |
| "grad_norm": 0.6875, | |
| "learning_rate": 4.989068341215614e-06, | |
| "loss": 0.3258590459823608, | |
| "mean_token_accuracy": 0.8897632241249085, | |
| "num_tokens": 5424926.0, | |
| "step": 880 | |
| }, | |
| { | |
| "entropy": 0.3301582373678684, | |
| "epoch": 0.1583770798113711, | |
| "grad_norm": 0.671875, | |
| "learning_rate": 4.988370547260061e-06, | |
| "loss": 0.32994065284729, | |
| "mean_token_accuracy": 0.8885752320289612, | |
| "num_tokens": 5484660.0, | |
| "step": 890 | |
| }, | |
| { | |
| "entropy": 0.34138462543487547, | |
| "epoch": 0.1601565975620607, | |
| "grad_norm": 0.8671875, | |
| "learning_rate": 4.987651217886224e-06, | |
| "loss": 0.34539155960083007, | |
| "mean_token_accuracy": 0.8832982778549194, | |
| "num_tokens": 5545675.0, | |
| "step": 900 | |
| }, | |
| { | |
| "entropy": 0.36235514357686044, | |
| "epoch": 0.16193611531275023, | |
| "grad_norm": 0.625, | |
| "learning_rate": 4.9869103593194894e-06, | |
| "loss": 0.363956618309021, | |
| "mean_token_accuracy": 0.875393170118332, | |
| "num_tokens": 5610896.0, | |
| "step": 910 | |
| }, | |
| { | |
| "entropy": 0.36212055906653406, | |
| "epoch": 0.1637156330634398, | |
| "grad_norm": 0.56640625, | |
| "learning_rate": 4.986147977971561e-06, | |
| "loss": 0.36235148906707765, | |
| "mean_token_accuracy": 0.8764902263879776, | |
| "num_tokens": 5674734.0, | |
| "step": 920 | |
| }, | |
| { | |
| "entropy": 0.3347547046840191, | |
| "epoch": 0.16549515081412938, | |
| "grad_norm": 0.74609375, | |
| "learning_rate": 4.9853640804404104e-06, | |
| "loss": 0.3336197376251221, | |
| "mean_token_accuracy": 0.8846198499202729, | |
| "num_tokens": 5736887.0, | |
| "step": 930 | |
| }, | |
| { | |
| "entropy": 0.35137743279337885, | |
| "epoch": 0.16727466856481893, | |
| "grad_norm": 0.765625, | |
| "learning_rate": 4.984558673510222e-06, | |
| "loss": 0.3512239694595337, | |
| "mean_token_accuracy": 0.8809666991233825, | |
| "num_tokens": 5800431.0, | |
| "step": 940 | |
| }, | |
| { | |
| "entropy": 0.36991714164614675, | |
| "epoch": 0.1690541863155085, | |
| "grad_norm": 0.578125, | |
| "learning_rate": 4.983731764151331e-06, | |
| "loss": 0.3648236751556396, | |
| "mean_token_accuracy": 0.872578826546669, | |
| "num_tokens": 5864625.0, | |
| "step": 950 | |
| }, | |
| { | |
| "entropy": 0.372380468249321, | |
| "epoch": 0.17083370406619805, | |
| "grad_norm": 0.625, | |
| "learning_rate": 4.982883359520161e-06, | |
| "loss": 0.3735220432281494, | |
| "mean_token_accuracy": 0.8743737578392029, | |
| "num_tokens": 5925995.0, | |
| "step": 960 | |
| }, | |
| { | |
| "entropy": 0.3446674205362797, | |
| "epoch": 0.17261322181688762, | |
| "grad_norm": 0.8203125, | |
| "learning_rate": 4.982013466959168e-06, | |
| "loss": 0.342392635345459, | |
| "mean_token_accuracy": 0.8822812139987946, | |
| "num_tokens": 5986238.0, | |
| "step": 970 | |
| }, | |
| { | |
| "entropy": 0.3643321067094803, | |
| "epoch": 0.1743927395675772, | |
| "grad_norm": 0.6953125, | |
| "learning_rate": 4.981122093996773e-06, | |
| "loss": 0.3641793727874756, | |
| "mean_token_accuracy": 0.8761126190423966, | |
| "num_tokens": 6050464.0, | |
| "step": 980 | |
| }, | |
| { | |
| "entropy": 0.3827708475291729, | |
| "epoch": 0.17617225731826675, | |
| "grad_norm": 0.80859375, | |
| "learning_rate": 4.980209248347298e-06, | |
| "loss": 0.3844141483306885, | |
| "mean_token_accuracy": 0.8680972456932068, | |
| "num_tokens": 6114918.0, | |
| "step": 990 | |
| }, | |
| { | |
| "entropy": 0.37099524289369584, | |
| "epoch": 0.17795177506895632, | |
| "grad_norm": 0.6953125, | |
| "learning_rate": 4.979274937910895e-06, | |
| "loss": 0.3674487829208374, | |
| "mean_token_accuracy": 0.8729879707098007, | |
| "num_tokens": 6177018.0, | |
| "step": 1000 | |
| }, | |
| { | |
| "entropy": 0.3705143555998802, | |
| "epoch": 0.17973129281964587, | |
| "grad_norm": 0.62890625, | |
| "learning_rate": 4.978319170773488e-06, | |
| "loss": 0.3721202850341797, | |
| "mean_token_accuracy": 0.8721451342105866, | |
| "num_tokens": 6242740.0, | |
| "step": 1010 | |
| }, | |
| { | |
| "entropy": 0.3682974562048912, | |
| "epoch": 0.18151081057033544, | |
| "grad_norm": 0.63671875, | |
| "learning_rate": 4.977341955206689e-06, | |
| "loss": 0.3687538385391235, | |
| "mean_token_accuracy": 0.8741728305816651, | |
| "num_tokens": 6301824.0, | |
| "step": 1020 | |
| }, | |
| { | |
| "entropy": 0.36520232632756233, | |
| "epoch": 0.18329032832102501, | |
| "grad_norm": 0.69140625, | |
| "learning_rate": 4.976343299667741e-06, | |
| "loss": 0.3612216949462891, | |
| "mean_token_accuracy": 0.8743625104427337, | |
| "num_tokens": 6365400.0, | |
| "step": 1030 | |
| }, | |
| { | |
| "entropy": 0.3570800118148327, | |
| "epoch": 0.18506984607171456, | |
| "grad_norm": 0.7109375, | |
| "learning_rate": 4.9753232127994335e-06, | |
| "loss": 0.36236867904663084, | |
| "mean_token_accuracy": 0.8769843101501464, | |
| "num_tokens": 6425106.0, | |
| "step": 1040 | |
| }, | |
| { | |
| "entropy": 0.3267357312142849, | |
| "epoch": 0.18684936382240414, | |
| "grad_norm": 0.8359375, | |
| "learning_rate": 4.97428170343003e-06, | |
| "loss": 0.32154016494750975, | |
| "mean_token_accuracy": 0.8914269268512726, | |
| "num_tokens": 6483594.0, | |
| "step": 1050 | |
| }, | |
| { | |
| "entropy": 0.3283110834658146, | |
| "epoch": 0.18862888157309368, | |
| "grad_norm": 0.62890625, | |
| "learning_rate": 4.9732187805732e-06, | |
| "loss": 0.33000481128692627, | |
| "mean_token_accuracy": 0.8866576731204987, | |
| "num_tokens": 6543496.0, | |
| "step": 1060 | |
| }, | |
| { | |
| "entropy": 0.32734011188149453, | |
| "epoch": 0.19040839932378326, | |
| "grad_norm": 0.7265625, | |
| "learning_rate": 4.972134453427927e-06, | |
| "loss": 0.32063271999359133, | |
| "mean_token_accuracy": 0.8897162199020385, | |
| "num_tokens": 6604883.0, | |
| "step": 1070 | |
| }, | |
| { | |
| "entropy": 0.349535646289587, | |
| "epoch": 0.19218791707447283, | |
| "grad_norm": 0.64453125, | |
| "learning_rate": 4.971028731378442e-06, | |
| "loss": 0.3478975772857666, | |
| "mean_token_accuracy": 0.8818371266126632, | |
| "num_tokens": 6667036.0, | |
| "step": 1080 | |
| }, | |
| { | |
| "entropy": 0.3681590139865875, | |
| "epoch": 0.19396743482516238, | |
| "grad_norm": 0.68359375, | |
| "learning_rate": 4.969901623994134e-06, | |
| "loss": 0.3665482997894287, | |
| "mean_token_accuracy": 0.8735427498817444, | |
| "num_tokens": 6728877.0, | |
| "step": 1090 | |
| }, | |
| { | |
| "entropy": 0.355544650554657, | |
| "epoch": 0.19574695257585195, | |
| "grad_norm": 0.64453125, | |
| "learning_rate": 4.96875314102947e-06, | |
| "loss": 0.3588836908340454, | |
| "mean_token_accuracy": 0.8779933214187622, | |
| "num_tokens": 6794282.0, | |
| "step": 1100 | |
| }, | |
| { | |
| "entropy": 0.3351004049181938, | |
| "epoch": 0.1975264703265415, | |
| "grad_norm": 0.65625, | |
| "learning_rate": 4.96758329242391e-06, | |
| "loss": 0.3310875415802002, | |
| "mean_token_accuracy": 0.8859479904174805, | |
| "num_tokens": 6855987.0, | |
| "step": 1110 | |
| }, | |
| { | |
| "entropy": 0.33845237344503404, | |
| "epoch": 0.19930598807723107, | |
| "grad_norm": 0.69921875, | |
| "learning_rate": 4.966392088301824e-06, | |
| "loss": 0.3350287199020386, | |
| "mean_token_accuracy": 0.8866452574729919, | |
| "num_tokens": 6913703.0, | |
| "step": 1120 | |
| }, | |
| { | |
| "entropy": 0.35912709310650826, | |
| "epoch": 0.20108550582792065, | |
| "grad_norm": 0.64453125, | |
| "learning_rate": 4.965179538972398e-06, | |
| "loss": 0.3584477424621582, | |
| "mean_token_accuracy": 0.8762081295251847, | |
| "num_tokens": 6975679.0, | |
| "step": 1130 | |
| }, | |
| { | |
| "entropy": 0.3545367069542408, | |
| "epoch": 0.2028650235786102, | |
| "grad_norm": 0.60546875, | |
| "learning_rate": 4.96394565492955e-06, | |
| "loss": 0.3520219326019287, | |
| "mean_token_accuracy": 0.879888191819191, | |
| "num_tokens": 7041387.0, | |
| "step": 1140 | |
| }, | |
| { | |
| "entropy": 0.32186701744794843, | |
| "epoch": 0.20464454132929977, | |
| "grad_norm": 0.84765625, | |
| "learning_rate": 4.9626904468518375e-06, | |
| "loss": 0.32150495052337646, | |
| "mean_token_accuracy": 0.8912828594446183, | |
| "num_tokens": 7099844.0, | |
| "step": 1150 | |
| }, | |
| { | |
| "entropy": 0.3193527065217495, | |
| "epoch": 0.2064240590799893, | |
| "grad_norm": 0.69921875, | |
| "learning_rate": 4.9614139256023675e-06, | |
| "loss": 0.3173349380493164, | |
| "mean_token_accuracy": 0.8930199146270752, | |
| "num_tokens": 7161967.0, | |
| "step": 1160 | |
| }, | |
| { | |
| "entropy": 0.3055750854313374, | |
| "epoch": 0.2082035768306789, | |
| "grad_norm": 0.71875, | |
| "learning_rate": 4.960116102228698e-06, | |
| "loss": 0.30236110687255857, | |
| "mean_token_accuracy": 0.8975043594837189, | |
| "num_tokens": 7226293.0, | |
| "step": 1170 | |
| }, | |
| { | |
| "entropy": 0.359158656001091, | |
| "epoch": 0.20998309458136846, | |
| "grad_norm": 0.703125, | |
| "learning_rate": 4.958796987962744e-06, | |
| "loss": 0.3596051216125488, | |
| "mean_token_accuracy": 0.8766287654638291, | |
| "num_tokens": 7288533.0, | |
| "step": 1180 | |
| }, | |
| { | |
| "entropy": 0.35056099519133566, | |
| "epoch": 0.211762612332058, | |
| "grad_norm": 0.765625, | |
| "learning_rate": 4.957456594220683e-06, | |
| "loss": 0.3551358222961426, | |
| "mean_token_accuracy": 0.8771712720394135, | |
| "num_tokens": 7348922.0, | |
| "step": 1190 | |
| }, | |
| { | |
| "entropy": 0.363479994982481, | |
| "epoch": 0.21354213008274758, | |
| "grad_norm": 0.7578125, | |
| "learning_rate": 4.9560949326028525e-06, | |
| "loss": 0.36165242195129393, | |
| "mean_token_accuracy": 0.8759845823049546, | |
| "num_tokens": 7411538.0, | |
| "step": 1200 | |
| }, | |
| { | |
| "entropy": 0.3278110012412071, | |
| "epoch": 0.21532164783343713, | |
| "grad_norm": 0.69140625, | |
| "learning_rate": 4.9547120148936536e-06, | |
| "loss": 0.3194319486618042, | |
| "mean_token_accuracy": 0.8892217814922333, | |
| "num_tokens": 7470626.0, | |
| "step": 1210 | |
| }, | |
| { | |
| "entropy": 0.3295983076095581, | |
| "epoch": 0.2171011655841267, | |
| "grad_norm": 0.640625, | |
| "learning_rate": 4.953307853061442e-06, | |
| "loss": 0.3254989147186279, | |
| "mean_token_accuracy": 0.8889990836381912, | |
| "num_tokens": 7532623.0, | |
| "step": 1220 | |
| }, | |
| { | |
| "entropy": 0.32711055055260657, | |
| "epoch": 0.21888068333481628, | |
| "grad_norm": 0.765625, | |
| "learning_rate": 4.951882459258436e-06, | |
| "loss": 0.3261944055557251, | |
| "mean_token_accuracy": 0.890270671248436, | |
| "num_tokens": 7591039.0, | |
| "step": 1230 | |
| }, | |
| { | |
| "entropy": 0.34457680508494376, | |
| "epoch": 0.22066020108550582, | |
| "grad_norm": 0.67578125, | |
| "learning_rate": 4.950435845820597e-06, | |
| "loss": 0.3495792865753174, | |
| "mean_token_accuracy": 0.8818086802959442, | |
| "num_tokens": 7653227.0, | |
| "step": 1240 | |
| }, | |
| { | |
| "entropy": 0.36603510081768037, | |
| "epoch": 0.2224397188361954, | |
| "grad_norm": 1.0703125, | |
| "learning_rate": 4.948968025267534e-06, | |
| "loss": 0.37048428058624266, | |
| "mean_token_accuracy": 0.8737892299890518, | |
| "num_tokens": 7717371.0, | |
| "step": 1250 | |
| }, | |
| { | |
| "entropy": 0.3249411962926388, | |
| "epoch": 0.22421923658688495, | |
| "grad_norm": 0.6328125, | |
| "learning_rate": 4.947479010302394e-06, | |
| "loss": 0.31585373878479006, | |
| "mean_token_accuracy": 0.8901617139577865, | |
| "num_tokens": 7779979.0, | |
| "step": 1260 | |
| }, | |
| { | |
| "entropy": 0.3602518759667873, | |
| "epoch": 0.22599875433757452, | |
| "grad_norm": 0.6875, | |
| "learning_rate": 4.945968813811743e-06, | |
| "loss": 0.35553271770477296, | |
| "mean_token_accuracy": 0.8786407887935639, | |
| "num_tokens": 7841977.0, | |
| "step": 1270 | |
| }, | |
| { | |
| "entropy": 0.3251481633633375, | |
| "epoch": 0.22777827208826407, | |
| "grad_norm": 0.68359375, | |
| "learning_rate": 4.944437448865468e-06, | |
| "loss": 0.3293075799942017, | |
| "mean_token_accuracy": 0.8870137929916382, | |
| "num_tokens": 7902777.0, | |
| "step": 1280 | |
| }, | |
| { | |
| "entropy": 0.32949518635869024, | |
| "epoch": 0.22955778983895364, | |
| "grad_norm": 0.6796875, | |
| "learning_rate": 4.94288492871665e-06, | |
| "loss": 0.3253596544265747, | |
| "mean_token_accuracy": 0.8879867672920227, | |
| "num_tokens": 7958535.0, | |
| "step": 1290 | |
| }, | |
| { | |
| "entropy": 0.3546779818832874, | |
| "epoch": 0.23133730758964322, | |
| "grad_norm": 0.72265625, | |
| "learning_rate": 4.941311266801462e-06, | |
| "loss": 0.35248827934265137, | |
| "mean_token_accuracy": 0.8797136694192886, | |
| "num_tokens": 8020338.0, | |
| "step": 1300 | |
| }, | |
| { | |
| "entropy": 0.35714430510997774, | |
| "epoch": 0.23311682534033276, | |
| "grad_norm": 0.61328125, | |
| "learning_rate": 4.939716476739042e-06, | |
| "loss": 0.36020400524139407, | |
| "mean_token_accuracy": 0.8753003060817719, | |
| "num_tokens": 8089684.0, | |
| "step": 1310 | |
| }, | |
| { | |
| "entropy": 0.34758463129401207, | |
| "epoch": 0.23489634309102234, | |
| "grad_norm": 0.55078125, | |
| "learning_rate": 4.938100572331384e-06, | |
| "loss": 0.34348084926605227, | |
| "mean_token_accuracy": 0.8812217116355896, | |
| "num_tokens": 8150210.0, | |
| "step": 1320 | |
| }, | |
| { | |
| "entropy": 0.3492201082408428, | |
| "epoch": 0.23667586084171188, | |
| "grad_norm": 0.7734375, | |
| "learning_rate": 4.936463567563212e-06, | |
| "loss": 0.3508707284927368, | |
| "mean_token_accuracy": 0.8796630859375, | |
| "num_tokens": 8213931.0, | |
| "step": 1330 | |
| }, | |
| { | |
| "entropy": 0.2918191090226173, | |
| "epoch": 0.23845537859240146, | |
| "grad_norm": 0.609375, | |
| "learning_rate": 4.934805476601863e-06, | |
| "loss": 0.28566529750823977, | |
| "mean_token_accuracy": 0.9024482190608978, | |
| "num_tokens": 8274417.0, | |
| "step": 1340 | |
| }, | |
| { | |
| "entropy": 0.34032377898693084, | |
| "epoch": 0.24023489634309103, | |
| "grad_norm": 0.7578125, | |
| "learning_rate": 4.933126313797162e-06, | |
| "loss": 0.3370128870010376, | |
| "mean_token_accuracy": 0.8844573050737381, | |
| "num_tokens": 8336511.0, | |
| "step": 1350 | |
| }, | |
| { | |
| "entropy": 0.34856711626052855, | |
| "epoch": 0.24201441409378058, | |
| "grad_norm": 0.7734375, | |
| "learning_rate": 4.931426093681299e-06, | |
| "loss": 0.34914212226867675, | |
| "mean_token_accuracy": 0.8811052054166794, | |
| "num_tokens": 8394584.0, | |
| "step": 1360 | |
| }, | |
| { | |
| "entropy": 0.344535905867815, | |
| "epoch": 0.24379393184447015, | |
| "grad_norm": 0.734375, | |
| "learning_rate": 4.929704830968701e-06, | |
| "loss": 0.3417734384536743, | |
| "mean_token_accuracy": 0.8823099106550216, | |
| "num_tokens": 8456951.0, | |
| "step": 1370 | |
| }, | |
| { | |
| "entropy": 0.3138051092624664, | |
| "epoch": 0.2455734495951597, | |
| "grad_norm": 0.6640625, | |
| "learning_rate": 4.92796254055591e-06, | |
| "loss": 0.3099043369293213, | |
| "mean_token_accuracy": 0.8950312793254852, | |
| "num_tokens": 8517822.0, | |
| "step": 1380 | |
| }, | |
| { | |
| "entropy": 0.3473027817904949, | |
| "epoch": 0.24735296734584927, | |
| "grad_norm": 0.7265625, | |
| "learning_rate": 4.9261992375214505e-06, | |
| "loss": 0.3471287488937378, | |
| "mean_token_accuracy": 0.8811825692653656, | |
| "num_tokens": 8577748.0, | |
| "step": 1390 | |
| }, | |
| { | |
| "entropy": 0.32695212215185165, | |
| "epoch": 0.24913248509653885, | |
| "grad_norm": 0.65625, | |
| "learning_rate": 4.924414937125696e-06, | |
| "loss": 0.32487173080444337, | |
| "mean_token_accuracy": 0.8902322620153427, | |
| "num_tokens": 8638315.0, | |
| "step": 1400 | |
| }, | |
| { | |
| "entropy": 0.32407406345009804, | |
| "epoch": 0.2509120028472284, | |
| "grad_norm": 0.73828125, | |
| "learning_rate": 4.9226096548107424e-06, | |
| "loss": 0.323284649848938, | |
| "mean_token_accuracy": 0.8886490374803543, | |
| "num_tokens": 8702290.0, | |
| "step": 1410 | |
| }, | |
| { | |
| "entropy": 0.3179707109928131, | |
| "epoch": 0.25269152059791794, | |
| "grad_norm": 0.7578125, | |
| "learning_rate": 4.9207834062002705e-06, | |
| "loss": 0.31603007316589354, | |
| "mean_token_accuracy": 0.8939002990722656, | |
| "num_tokens": 8765012.0, | |
| "step": 1420 | |
| }, | |
| { | |
| "entropy": 0.34799565374851227, | |
| "epoch": 0.2544710383486075, | |
| "grad_norm": 0.6796875, | |
| "learning_rate": 4.918936207099415e-06, | |
| "loss": 0.345632004737854, | |
| "mean_token_accuracy": 0.8794914275407791, | |
| "num_tokens": 8824255.0, | |
| "step": 1430 | |
| }, | |
| { | |
| "entropy": 0.33373049572110175, | |
| "epoch": 0.2562505560992971, | |
| "grad_norm": 0.7265625, | |
| "learning_rate": 4.917068073494623e-06, | |
| "loss": 0.33630125522613524, | |
| "mean_token_accuracy": 0.8856493443250656, | |
| "num_tokens": 8886872.0, | |
| "step": 1440 | |
| }, | |
| { | |
| "entropy": 0.3084383949637413, | |
| "epoch": 0.25803007384998666, | |
| "grad_norm": 0.796875, | |
| "learning_rate": 4.915179021553517e-06, | |
| "loss": 0.30646114349365233, | |
| "mean_token_accuracy": 0.8949905663728714, | |
| "num_tokens": 8948591.0, | |
| "step": 1450 | |
| }, | |
| { | |
| "entropy": 0.35163264274597167, | |
| "epoch": 0.25980959160067624, | |
| "grad_norm": 0.5390625, | |
| "learning_rate": 4.913269067624759e-06, | |
| "loss": 0.3483644247055054, | |
| "mean_token_accuracy": 0.8794255912303924, | |
| "num_tokens": 9013038.0, | |
| "step": 1460 | |
| }, | |
| { | |
| "entropy": 0.34737343341112137, | |
| "epoch": 0.26158910935136576, | |
| "grad_norm": 0.7734375, | |
| "learning_rate": 4.911338228237902e-06, | |
| "loss": 0.349657940864563, | |
| "mean_token_accuracy": 0.8800763636827469, | |
| "num_tokens": 9077200.0, | |
| "step": 1470 | |
| }, | |
| { | |
| "entropy": 0.35392927601933477, | |
| "epoch": 0.26336862710205533, | |
| "grad_norm": 0.80078125, | |
| "learning_rate": 4.9093865201032535e-06, | |
| "loss": 0.34874787330627444, | |
| "mean_token_accuracy": 0.8790768623352051, | |
| "num_tokens": 9139270.0, | |
| "step": 1480 | |
| }, | |
| { | |
| "entropy": 0.34402855336666105, | |
| "epoch": 0.2651481448527449, | |
| "grad_norm": 0.78515625, | |
| "learning_rate": 4.907413960111724e-06, | |
| "loss": 0.3440460443496704, | |
| "mean_token_accuracy": 0.8829056441783905, | |
| "num_tokens": 9198774.0, | |
| "step": 1490 | |
| }, | |
| { | |
| "entropy": 0.31694235652685165, | |
| "epoch": 0.2669276626034345, | |
| "grad_norm": 0.59375, | |
| "learning_rate": 4.905420565334691e-06, | |
| "loss": 0.316249942779541, | |
| "mean_token_accuracy": 0.8927689224481583, | |
| "num_tokens": 9261123.0, | |
| "step": 1500 | |
| }, | |
| { | |
| "entropy": 0.34790945053100586, | |
| "epoch": 0.26870718035412405, | |
| "grad_norm": 0.7109375, | |
| "learning_rate": 4.90340635302384e-06, | |
| "loss": 0.34010930061340333, | |
| "mean_token_accuracy": 0.8813382595777511, | |
| "num_tokens": 9323313.0, | |
| "step": 1510 | |
| }, | |
| { | |
| "entropy": 0.32182413190603254, | |
| "epoch": 0.27048669810481357, | |
| "grad_norm": 0.58203125, | |
| "learning_rate": 4.901371340611022e-06, | |
| "loss": 0.3174512147903442, | |
| "mean_token_accuracy": 0.8898768603801728, | |
| "num_tokens": 9385000.0, | |
| "step": 1520 | |
| }, | |
| { | |
| "entropy": 0.3206692963838577, | |
| "epoch": 0.27226621585550315, | |
| "grad_norm": 0.65234375, | |
| "learning_rate": 4.899315545708101e-06, | |
| "loss": 0.3174994468688965, | |
| "mean_token_accuracy": 0.8910428583621979, | |
| "num_tokens": 9446100.0, | |
| "step": 1530 | |
| }, | |
| { | |
| "entropy": 0.3739303767681122, | |
| "epoch": 0.2740457336061927, | |
| "grad_norm": 0.81640625, | |
| "learning_rate": 4.897238986106802e-06, | |
| "loss": 0.3766570329666138, | |
| "mean_token_accuracy": 0.871484300494194, | |
| "num_tokens": 9507018.0, | |
| "step": 1540 | |
| }, | |
| { | |
| "entropy": 0.3343030124902725, | |
| "epoch": 0.2758252513568823, | |
| "grad_norm": 0.65625, | |
| "learning_rate": 4.895141679778555e-06, | |
| "loss": 0.3347424030303955, | |
| "mean_token_accuracy": 0.8854434341192245, | |
| "num_tokens": 9570809.0, | |
| "step": 1550 | |
| }, | |
| { | |
| "entropy": 0.33370912820100784, | |
| "epoch": 0.27760476910757187, | |
| "grad_norm": 0.82421875, | |
| "learning_rate": 4.893023644874342e-06, | |
| "loss": 0.3346064805984497, | |
| "mean_token_accuracy": 0.88556567132473, | |
| "num_tokens": 9631113.0, | |
| "step": 1560 | |
| }, | |
| { | |
| "entropy": 0.32370079308748245, | |
| "epoch": 0.2793842868582614, | |
| "grad_norm": 0.68359375, | |
| "learning_rate": 4.8908848997245406e-06, | |
| "loss": 0.3189136028289795, | |
| "mean_token_accuracy": 0.8896129339933395, | |
| "num_tokens": 9692380.0, | |
| "step": 1570 | |
| }, | |
| { | |
| "entropy": 0.3607430763542652, | |
| "epoch": 0.28116380460895096, | |
| "grad_norm": 0.73046875, | |
| "learning_rate": 4.8887254628387605e-06, | |
| "loss": 0.36515631675720217, | |
| "mean_token_accuracy": 0.8758651137351989, | |
| "num_tokens": 9752341.0, | |
| "step": 1580 | |
| }, | |
| { | |
| "entropy": 0.3484156712889671, | |
| "epoch": 0.28294332235964054, | |
| "grad_norm": 0.83984375, | |
| "learning_rate": 4.886545352905689e-06, | |
| "loss": 0.34550859928131106, | |
| "mean_token_accuracy": 0.880357900261879, | |
| "num_tokens": 9812558.0, | |
| "step": 1590 | |
| }, | |
| { | |
| "entropy": 0.3640738561749458, | |
| "epoch": 0.2847228401103301, | |
| "grad_norm": 0.703125, | |
| "learning_rate": 4.884344588792926e-06, | |
| "loss": 0.3594943046569824, | |
| "mean_token_accuracy": 0.8773774594068527, | |
| "num_tokens": 9874489.0, | |
| "step": 1600 | |
| }, | |
| { | |
| "entropy": 0.32436888590455054, | |
| "epoch": 0.2865023578610197, | |
| "grad_norm": 0.76953125, | |
| "learning_rate": 4.8821231895468194e-06, | |
| "loss": 0.3241907835006714, | |
| "mean_token_accuracy": 0.8908619105815887, | |
| "num_tokens": 9935280.0, | |
| "step": 1610 | |
| }, | |
| { | |
| "entropy": 0.3490560226142406, | |
| "epoch": 0.2882818756117092, | |
| "grad_norm": 0.65234375, | |
| "learning_rate": 4.879881174392304e-06, | |
| "loss": 0.3519246578216553, | |
| "mean_token_accuracy": 0.8806601613759995, | |
| "num_tokens": 9999329.0, | |
| "step": 1620 | |
| }, | |
| { | |
| "entropy": 0.3112804345786572, | |
| "epoch": 0.2900613933623988, | |
| "grad_norm": 0.7890625, | |
| "learning_rate": 4.877618562732737e-06, | |
| "loss": 0.309645938873291, | |
| "mean_token_accuracy": 0.8948357462882995, | |
| "num_tokens": 10059956.0, | |
| "step": 1630 | |
| }, | |
| { | |
| "entropy": 0.35570081174373624, | |
| "epoch": 0.29184091111308835, | |
| "grad_norm": 0.66015625, | |
| "learning_rate": 4.87533537414972e-06, | |
| "loss": 0.35082881450653075, | |
| "mean_token_accuracy": 0.8796282052993775, | |
| "num_tokens": 10125774.0, | |
| "step": 1640 | |
| }, | |
| { | |
| "entropy": 0.33492894992232325, | |
| "epoch": 0.2936204288637779, | |
| "grad_norm": 0.69921875, | |
| "learning_rate": 4.873031628402941e-06, | |
| "loss": 0.33243823051452637, | |
| "mean_token_accuracy": 0.8872773289680481, | |
| "num_tokens": 10180596.0, | |
| "step": 1650 | |
| }, | |
| { | |
| "entropy": 0.34505835101008414, | |
| "epoch": 0.2953999466144675, | |
| "grad_norm": 0.58203125, | |
| "learning_rate": 4.870707345429995e-06, | |
| "loss": 0.3442118167877197, | |
| "mean_token_accuracy": 0.8813025206327438, | |
| "num_tokens": 10243696.0, | |
| "step": 1660 | |
| }, | |
| { | |
| "entropy": 0.3607618987560272, | |
| "epoch": 0.297179464365157, | |
| "grad_norm": 0.6953125, | |
| "learning_rate": 4.868362545346218e-06, | |
| "loss": 0.3578464984893799, | |
| "mean_token_accuracy": 0.8750995457172394, | |
| "num_tokens": 10307824.0, | |
| "step": 1670 | |
| }, | |
| { | |
| "entropy": 0.3360280990600586, | |
| "epoch": 0.2989589821158466, | |
| "grad_norm": 0.828125, | |
| "learning_rate": 4.8659972484445075e-06, | |
| "loss": 0.3439199209213257, | |
| "mean_token_accuracy": 0.8848895847797393, | |
| "num_tokens": 10371246.0, | |
| "step": 1680 | |
| }, | |
| { | |
| "entropy": 0.35932715237140656, | |
| "epoch": 0.30073849986653617, | |
| "grad_norm": 0.75, | |
| "learning_rate": 4.86361147519515e-06, | |
| "loss": 0.3583080768585205, | |
| "mean_token_accuracy": 0.8771767407655716, | |
| "num_tokens": 10435217.0, | |
| "step": 1690 | |
| }, | |
| { | |
| "entropy": 0.2974402904510498, | |
| "epoch": 0.30251801761722574, | |
| "grad_norm": 0.6640625, | |
| "learning_rate": 4.861205246245644e-06, | |
| "loss": 0.293239951133728, | |
| "mean_token_accuracy": 0.9000806957483292, | |
| "num_tokens": 10497897.0, | |
| "step": 1700 | |
| }, | |
| { | |
| "entropy": 0.31142097115516665, | |
| "epoch": 0.3042975353679153, | |
| "grad_norm": 0.6953125, | |
| "learning_rate": 4.858778582420518e-06, | |
| "loss": 0.3049384355545044, | |
| "mean_token_accuracy": 0.8945723801851273, | |
| "num_tokens": 10557156.0, | |
| "step": 1710 | |
| }, | |
| { | |
| "entropy": 0.34288675934076307, | |
| "epoch": 0.30607705311860484, | |
| "grad_norm": 0.70703125, | |
| "learning_rate": 4.856331504721155e-06, | |
| "loss": 0.3384895324707031, | |
| "mean_token_accuracy": 0.8817587107419967, | |
| "num_tokens": 10620371.0, | |
| "step": 1720 | |
| }, | |
| { | |
| "entropy": 0.3216023348271847, | |
| "epoch": 0.3078565708692944, | |
| "grad_norm": 0.73046875, | |
| "learning_rate": 4.853864034325607e-06, | |
| "loss": 0.32592010498046875, | |
| "mean_token_accuracy": 0.8908518970012664, | |
| "num_tokens": 10683261.0, | |
| "step": 1730 | |
| }, | |
| { | |
| "entropy": 0.35577383637428284, | |
| "epoch": 0.309636088619984, | |
| "grad_norm": 0.734375, | |
| "learning_rate": 4.851376192588414e-06, | |
| "loss": 0.3577617406845093, | |
| "mean_token_accuracy": 0.8777815222740173, | |
| "num_tokens": 10742889.0, | |
| "step": 1740 | |
| }, | |
| { | |
| "entropy": 0.3348899021744728, | |
| "epoch": 0.31141560637067356, | |
| "grad_norm": 0.78515625, | |
| "learning_rate": 4.848868001040418e-06, | |
| "loss": 0.3364445447921753, | |
| "mean_token_accuracy": 0.8849860787391662, | |
| "num_tokens": 10803959.0, | |
| "step": 1750 | |
| }, | |
| { | |
| "entropy": 0.36029330268502235, | |
| "epoch": 0.31319512412136313, | |
| "grad_norm": 0.63671875, | |
| "learning_rate": 4.8463394813885756e-06, | |
| "loss": 0.36600594520568847, | |
| "mean_token_accuracy": 0.8759031504392624, | |
| "num_tokens": 10865189.0, | |
| "step": 1760 | |
| }, | |
| { | |
| "entropy": 0.3618343710899353, | |
| "epoch": 0.31497464187205265, | |
| "grad_norm": 0.69140625, | |
| "learning_rate": 4.843790655515773e-06, | |
| "loss": 0.3588868141174316, | |
| "mean_token_accuracy": 0.8754674553871155, | |
| "num_tokens": 10925462.0, | |
| "step": 1770 | |
| }, | |
| { | |
| "entropy": 0.36530629023909567, | |
| "epoch": 0.3167541596227422, | |
| "grad_norm": 0.77734375, | |
| "learning_rate": 4.8412215454806345e-06, | |
| "loss": 0.36326096057891843, | |
| "mean_token_accuracy": 0.8759878039360046, | |
| "num_tokens": 10989818.0, | |
| "step": 1780 | |
| }, | |
| { | |
| "entropy": 0.3431604079902172, | |
| "epoch": 0.3185336773734318, | |
| "grad_norm": 0.70703125, | |
| "learning_rate": 4.8386321735173324e-06, | |
| "loss": 0.3438584804534912, | |
| "mean_token_accuracy": 0.8816794931888581, | |
| "num_tokens": 11054712.0, | |
| "step": 1790 | |
| }, | |
| { | |
| "entropy": 0.32236423939466474, | |
| "epoch": 0.3203131951241214, | |
| "grad_norm": 0.69921875, | |
| "learning_rate": 4.836022562035395e-06, | |
| "loss": 0.3194507837295532, | |
| "mean_token_accuracy": 0.8921084225177764, | |
| "num_tokens": 11112487.0, | |
| "step": 1800 | |
| }, | |
| { | |
| "entropy": 0.3170651212334633, | |
| "epoch": 0.32209271287481095, | |
| "grad_norm": 0.64453125, | |
| "learning_rate": 4.83339273361951e-06, | |
| "loss": 0.31370131969451903, | |
| "mean_token_accuracy": 0.8926311641931534, | |
| "num_tokens": 11175011.0, | |
| "step": 1810 | |
| }, | |
| { | |
| "entropy": 0.3304481156170368, | |
| "epoch": 0.32387223062550047, | |
| "grad_norm": 0.734375, | |
| "learning_rate": 4.8307427110293325e-06, | |
| "loss": 0.3290146827697754, | |
| "mean_token_accuracy": 0.8859521239995957, | |
| "num_tokens": 11236945.0, | |
| "step": 1820 | |
| }, | |
| { | |
| "entropy": 0.32613271959125995, | |
| "epoch": 0.32565174837619004, | |
| "grad_norm": 0.65234375, | |
| "learning_rate": 4.828072517199287e-06, | |
| "loss": 0.3214689016342163, | |
| "mean_token_accuracy": 0.8889310687780381, | |
| "num_tokens": 11299519.0, | |
| "step": 1830 | |
| }, | |
| { | |
| "entropy": 0.35464286953210833, | |
| "epoch": 0.3274312661268796, | |
| "grad_norm": 0.79296875, | |
| "learning_rate": 4.825382175238368e-06, | |
| "loss": 0.35498120784759524, | |
| "mean_token_accuracy": 0.8811011373996734, | |
| "num_tokens": 11362133.0, | |
| "step": 1840 | |
| }, | |
| { | |
| "entropy": 0.29642984345555307, | |
| "epoch": 0.3292107838775692, | |
| "grad_norm": 0.64453125, | |
| "learning_rate": 4.822671708429939e-06, | |
| "loss": 0.29105377197265625, | |
| "mean_token_accuracy": 0.8990860164165497, | |
| "num_tokens": 11424316.0, | |
| "step": 1850 | |
| }, | |
| { | |
| "entropy": 0.3403557002544403, | |
| "epoch": 0.33099030162825877, | |
| "grad_norm": 0.73828125, | |
| "learning_rate": 4.8199411402315356e-06, | |
| "loss": 0.3408710479736328, | |
| "mean_token_accuracy": 0.8846672475337982, | |
| "num_tokens": 11486315.0, | |
| "step": 1860 | |
| }, | |
| { | |
| "entropy": 0.3180378496646881, | |
| "epoch": 0.3327698193789483, | |
| "grad_norm": 0.6640625, | |
| "learning_rate": 4.817190494274657e-06, | |
| "loss": 0.3142568588256836, | |
| "mean_token_accuracy": 0.8923665642738342, | |
| "num_tokens": 11549450.0, | |
| "step": 1870 | |
| }, | |
| { | |
| "entropy": 0.32088752835989, | |
| "epoch": 0.33454933712963786, | |
| "grad_norm": 0.68359375, | |
| "learning_rate": 4.814419794364564e-06, | |
| "loss": 0.3167176008224487, | |
| "mean_token_accuracy": 0.891901296377182, | |
| "num_tokens": 11612826.0, | |
| "step": 1880 | |
| }, | |
| { | |
| "entropy": 0.36671468392014506, | |
| "epoch": 0.33632885488032743, | |
| "grad_norm": 0.7578125, | |
| "learning_rate": 4.811629064480075e-06, | |
| "loss": 0.36075901985168457, | |
| "mean_token_accuracy": 0.876639899611473, | |
| "num_tokens": 11675070.0, | |
| "step": 1890 | |
| }, | |
| { | |
| "entropy": 0.34355204179883003, | |
| "epoch": 0.338108372631017, | |
| "grad_norm": 0.64453125, | |
| "learning_rate": 4.808818328773352e-06, | |
| "loss": 0.3493661642074585, | |
| "mean_token_accuracy": 0.8810931831598282, | |
| "num_tokens": 11736677.0, | |
| "step": 1900 | |
| }, | |
| { | |
| "entropy": 0.2997708685696125, | |
| "epoch": 0.3398878903817066, | |
| "grad_norm": 0.734375, | |
| "learning_rate": 4.805987611569703e-06, | |
| "loss": 0.2969873666763306, | |
| "mean_token_accuracy": 0.897605162858963, | |
| "num_tokens": 11796727.0, | |
| "step": 1910 | |
| }, | |
| { | |
| "entropy": 0.3368371590971947, | |
| "epoch": 0.3416674081323961, | |
| "grad_norm": 0.703125, | |
| "learning_rate": 4.803136937367355e-06, | |
| "loss": 0.3345362901687622, | |
| "mean_token_accuracy": 0.8849462300539017, | |
| "num_tokens": 11859918.0, | |
| "step": 1920 | |
| }, | |
| { | |
| "entropy": 0.3323399655520916, | |
| "epoch": 0.3434469258830857, | |
| "grad_norm": 0.6796875, | |
| "learning_rate": 4.800266330837259e-06, | |
| "loss": 0.3346291780471802, | |
| "mean_token_accuracy": 0.8846285611391067, | |
| "num_tokens": 11920786.0, | |
| "step": 1930 | |
| }, | |
| { | |
| "entropy": 0.3304636083543301, | |
| "epoch": 0.34522644363377525, | |
| "grad_norm": 0.78125, | |
| "learning_rate": 4.797375816822867e-06, | |
| "loss": 0.3262585401535034, | |
| "mean_token_accuracy": 0.8881859093904495, | |
| "num_tokens": 11983317.0, | |
| "step": 1940 | |
| }, | |
| { | |
| "entropy": 0.3276805475354195, | |
| "epoch": 0.3470059613844648, | |
| "grad_norm": 0.6328125, | |
| "learning_rate": 4.794465420339917e-06, | |
| "loss": 0.32562100887298584, | |
| "mean_token_accuracy": 0.888521808385849, | |
| "num_tokens": 12042733.0, | |
| "step": 1950 | |
| }, | |
| { | |
| "entropy": 0.3643137916922569, | |
| "epoch": 0.3487854791351544, | |
| "grad_norm": 0.91796875, | |
| "learning_rate": 4.7915351665762175e-06, | |
| "loss": 0.3611361742019653, | |
| "mean_token_accuracy": 0.8770559310913086, | |
| "num_tokens": 12107954.0, | |
| "step": 1960 | |
| }, | |
| { | |
| "entropy": 0.322842388600111, | |
| "epoch": 0.3505649968858439, | |
| "grad_norm": 0.71875, | |
| "learning_rate": 4.788585080891436e-06, | |
| "loss": 0.32277095317840576, | |
| "mean_token_accuracy": 0.8917052149772644, | |
| "num_tokens": 12170705.0, | |
| "step": 1970 | |
| }, | |
| { | |
| "entropy": 0.3010896898806095, | |
| "epoch": 0.3523445146365335, | |
| "grad_norm": 0.796875, | |
| "learning_rate": 4.785615188816868e-06, | |
| "loss": 0.29806530475616455, | |
| "mean_token_accuracy": 0.898258626461029, | |
| "num_tokens": 12230139.0, | |
| "step": 1980 | |
| }, | |
| { | |
| "entropy": 0.33999730944633483, | |
| "epoch": 0.35412403238722306, | |
| "grad_norm": 0.703125, | |
| "learning_rate": 4.782625516055225e-06, | |
| "loss": 0.3457479000091553, | |
| "mean_token_accuracy": 0.8819954574108124, | |
| "num_tokens": 12288706.0, | |
| "step": 1990 | |
| }, | |
| { | |
| "entropy": 0.3374386131763458, | |
| "epoch": 0.35590355013791264, | |
| "grad_norm": 0.6953125, | |
| "learning_rate": 4.779616088480407e-06, | |
| "loss": 0.33816487789154054, | |
| "mean_token_accuracy": 0.8848948627710342, | |
| "num_tokens": 12352721.0, | |
| "step": 2000 | |
| }, | |
| { | |
| "entropy": 0.33378071039915086, | |
| "epoch": 0.3576830678886022, | |
| "grad_norm": 0.609375, | |
| "learning_rate": 4.7765869321372835e-06, | |
| "loss": 0.33910431861877444, | |
| "mean_token_accuracy": 0.885414770245552, | |
| "num_tokens": 12416793.0, | |
| "step": 2010 | |
| }, | |
| { | |
| "entropy": 0.3014608107507229, | |
| "epoch": 0.35946258563929173, | |
| "grad_norm": 0.56640625, | |
| "learning_rate": 4.773538073241462e-06, | |
| "loss": 0.2963795900344849, | |
| "mean_token_accuracy": 0.8973739951848984, | |
| "num_tokens": 12477711.0, | |
| "step": 2020 | |
| }, | |
| { | |
| "entropy": 0.36168904006481173, | |
| "epoch": 0.3612421033899813, | |
| "grad_norm": 0.60546875, | |
| "learning_rate": 4.770469538179064e-06, | |
| "loss": 0.36448278427124026, | |
| "mean_token_accuracy": 0.8764183282852173, | |
| "num_tokens": 12540647.0, | |
| "step": 2030 | |
| }, | |
| { | |
| "entropy": 0.32982706353068353, | |
| "epoch": 0.3630216211406709, | |
| "grad_norm": 0.625, | |
| "learning_rate": 4.767381353506502e-06, | |
| "loss": 0.325534462928772, | |
| "mean_token_accuracy": 0.8867161482572555, | |
| "num_tokens": 12605247.0, | |
| "step": 2040 | |
| }, | |
| { | |
| "entropy": 0.3257120668888092, | |
| "epoch": 0.36480113889136045, | |
| "grad_norm": 0.80859375, | |
| "learning_rate": 4.764273545950238e-06, | |
| "loss": 0.31893894672393797, | |
| "mean_token_accuracy": 0.8895520359277725, | |
| "num_tokens": 12666134.0, | |
| "step": 2050 | |
| }, | |
| { | |
| "entropy": 0.3204114593565464, | |
| "epoch": 0.36658065664205003, | |
| "grad_norm": 0.62109375, | |
| "learning_rate": 4.7611461424065656e-06, | |
| "loss": 0.31681921482086184, | |
| "mean_token_accuracy": 0.8899898082017899, | |
| "num_tokens": 12726580.0, | |
| "step": 2060 | |
| }, | |
| { | |
| "entropy": 0.3290185458958149, | |
| "epoch": 0.36836017439273955, | |
| "grad_norm": 0.72265625, | |
| "learning_rate": 4.757999169941363e-06, | |
| "loss": 0.3259589433670044, | |
| "mean_token_accuracy": 0.8893360406160354, | |
| "num_tokens": 12787363.0, | |
| "step": 2070 | |
| }, | |
| { | |
| "entropy": 0.3067683823406696, | |
| "epoch": 0.3701396921434291, | |
| "grad_norm": 0.69140625, | |
| "learning_rate": 4.754832655789872e-06, | |
| "loss": 0.30571494102478025, | |
| "mean_token_accuracy": 0.8958559095859527, | |
| "num_tokens": 12849394.0, | |
| "step": 2080 | |
| }, | |
| { | |
| "entropy": 0.3627448983490467, | |
| "epoch": 0.3719192098941187, | |
| "grad_norm": 0.84765625, | |
| "learning_rate": 4.751646627356453e-06, | |
| "loss": 0.3650702953338623, | |
| "mean_token_accuracy": 0.8756417125463486, | |
| "num_tokens": 12912253.0, | |
| "step": 2090 | |
| }, | |
| { | |
| "entropy": 0.3356044813990593, | |
| "epoch": 0.37369872764480827, | |
| "grad_norm": 0.8203125, | |
| "learning_rate": 4.748441112214354e-06, | |
| "loss": 0.33072652816772463, | |
| "mean_token_accuracy": 0.8876396358013153, | |
| "num_tokens": 12973236.0, | |
| "step": 2100 | |
| }, | |
| { | |
| "entropy": 0.3378177247941494, | |
| "epoch": 0.37547824539549784, | |
| "grad_norm": 0.62109375, | |
| "learning_rate": 4.745216138105467e-06, | |
| "loss": 0.3320824861526489, | |
| "mean_token_accuracy": 0.885038748383522, | |
| "num_tokens": 13037769.0, | |
| "step": 2110 | |
| }, | |
| { | |
| "entropy": 0.32784045711159704, | |
| "epoch": 0.37725776314618736, | |
| "grad_norm": 0.703125, | |
| "learning_rate": 4.741971732940093e-06, | |
| "loss": 0.3262526273727417, | |
| "mean_token_accuracy": 0.8874519556760788, | |
| "num_tokens": 13103269.0, | |
| "step": 2120 | |
| }, | |
| { | |
| "entropy": 0.35600380823016164, | |
| "epoch": 0.37903728089687694, | |
| "grad_norm": 0.65234375, | |
| "learning_rate": 4.7387079247966925e-06, | |
| "loss": 0.35632810592651365, | |
| "mean_token_accuracy": 0.8786388874053955, | |
| "num_tokens": 13166803.0, | |
| "step": 2130 | |
| }, | |
| { | |
| "entropy": 0.31510523036122323, | |
| "epoch": 0.3808167986475665, | |
| "grad_norm": 0.6640625, | |
| "learning_rate": 4.735424741921654e-06, | |
| "loss": 0.3125915050506592, | |
| "mean_token_accuracy": 0.8931266248226166, | |
| "num_tokens": 13230802.0, | |
| "step": 2140 | |
| }, | |
| { | |
| "entropy": 0.32619678899645804, | |
| "epoch": 0.3825963163982561, | |
| "grad_norm": 0.81640625, | |
| "learning_rate": 4.732122212729039e-06, | |
| "loss": 0.3222477674484253, | |
| "mean_token_accuracy": 0.8893245726823806, | |
| "num_tokens": 13294534.0, | |
| "step": 2150 | |
| }, | |
| { | |
| "entropy": 0.34208337068557737, | |
| "epoch": 0.38437583414894566, | |
| "grad_norm": 0.6484375, | |
| "learning_rate": 4.728800365800341e-06, | |
| "loss": 0.3393446922302246, | |
| "mean_token_accuracy": 0.8847091794013977, | |
| "num_tokens": 13355210.0, | |
| "step": 2160 | |
| }, | |
| { | |
| "entropy": 0.33942179977893827, | |
| "epoch": 0.3861553518996352, | |
| "grad_norm": 0.72265625, | |
| "learning_rate": 4.725459229884238e-06, | |
| "loss": 0.3375351667404175, | |
| "mean_token_accuracy": 0.883438703417778, | |
| "num_tokens": 13420601.0, | |
| "step": 2170 | |
| }, | |
| { | |
| "entropy": 0.30322944521903994, | |
| "epoch": 0.38793486965032475, | |
| "grad_norm": 0.65234375, | |
| "learning_rate": 4.722098833896343e-06, | |
| "loss": 0.3069580554962158, | |
| "mean_token_accuracy": 0.8947730034589767, | |
| "num_tokens": 13481796.0, | |
| "step": 2180 | |
| }, | |
| { | |
| "entropy": 0.37797256261110307, | |
| "epoch": 0.38971438740101433, | |
| "grad_norm": 0.71875, | |
| "learning_rate": 4.718719206918954e-06, | |
| "loss": 0.36962873935699464, | |
| "mean_token_accuracy": 0.8755796402692795, | |
| "num_tokens": 13544611.0, | |
| "step": 2190 | |
| }, | |
| { | |
| "entropy": 0.3616977885365486, | |
| "epoch": 0.3914939051517039, | |
| "grad_norm": 0.82421875, | |
| "learning_rate": 4.715320378200803e-06, | |
| "loss": 0.3612029790878296, | |
| "mean_token_accuracy": 0.874288335442543, | |
| "num_tokens": 13604484.0, | |
| "step": 2200 | |
| }, | |
| { | |
| "entropy": 0.3246965654194355, | |
| "epoch": 0.3932734229023935, | |
| "grad_norm": 0.59765625, | |
| "learning_rate": 4.711902377156798e-06, | |
| "loss": 0.3220320463180542, | |
| "mean_token_accuracy": 0.8902679353952407, | |
| "num_tokens": 13669912.0, | |
| "step": 2210 | |
| }, | |
| { | |
| "entropy": 0.375099565833807, | |
| "epoch": 0.395052940653083, | |
| "grad_norm": 0.66796875, | |
| "learning_rate": 4.708465233367777e-06, | |
| "loss": 0.37962148189544676, | |
| "mean_token_accuracy": 0.8704522967338562, | |
| "num_tokens": 13736265.0, | |
| "step": 2220 | |
| }, | |
| { | |
| "entropy": 0.37368070855736735, | |
| "epoch": 0.39683245840377257, | |
| "grad_norm": 0.79296875, | |
| "learning_rate": 4.705008976580247e-06, | |
| "loss": 0.3727264404296875, | |
| "mean_token_accuracy": 0.8689195603132248, | |
| "num_tokens": 13797250.0, | |
| "step": 2230 | |
| }, | |
| { | |
| "entropy": 0.3215997591614723, | |
| "epoch": 0.39861197615446214, | |
| "grad_norm": 0.6640625, | |
| "learning_rate": 4.701533636706124e-06, | |
| "loss": 0.3224519968032837, | |
| "mean_token_accuracy": 0.8890083611011506, | |
| "num_tokens": 13862266.0, | |
| "step": 2240 | |
| }, | |
| { | |
| "entropy": 0.3506476566195488, | |
| "epoch": 0.4003914939051517, | |
| "grad_norm": 0.68359375, | |
| "learning_rate": 4.698039243822481e-06, | |
| "loss": 0.3483339548110962, | |
| "mean_token_accuracy": 0.8795241922140121, | |
| "num_tokens": 13926771.0, | |
| "step": 2250 | |
| }, | |
| { | |
| "entropy": 0.33235198333859445, | |
| "epoch": 0.4021710116558413, | |
| "grad_norm": 0.59765625, | |
| "learning_rate": 4.694525828171281e-06, | |
| "loss": 0.3273125886917114, | |
| "mean_token_accuracy": 0.8862265437841416, | |
| "num_tokens": 13993142.0, | |
| "step": 2260 | |
| }, | |
| { | |
| "entropy": 0.35915780141949655, | |
| "epoch": 0.4039505294065308, | |
| "grad_norm": 0.734375, | |
| "learning_rate": 4.6909934201591184e-06, | |
| "loss": 0.35993571281433107, | |
| "mean_token_accuracy": 0.8785275846719742, | |
| "num_tokens": 14052491.0, | |
| "step": 2270 | |
| }, | |
| { | |
| "entropy": 0.33777954429388046, | |
| "epoch": 0.4057300471572204, | |
| "grad_norm": 0.7421875, | |
| "learning_rate": 4.6874420503569575e-06, | |
| "loss": 0.33431210517883303, | |
| "mean_token_accuracy": 0.8869676649570465, | |
| "num_tokens": 14112054.0, | |
| "step": 2280 | |
| }, | |
| { | |
| "entropy": 0.31359959170222285, | |
| "epoch": 0.40750956490790996, | |
| "grad_norm": 0.6484375, | |
| "learning_rate": 4.683871749499864e-06, | |
| "loss": 0.3128647327423096, | |
| "mean_token_accuracy": 0.8942294299602509, | |
| "num_tokens": 14175033.0, | |
| "step": 2290 | |
| }, | |
| { | |
| "entropy": 0.32013130038976667, | |
| "epoch": 0.40928908265859953, | |
| "grad_norm": 0.63671875, | |
| "learning_rate": 4.680282548486742e-06, | |
| "loss": 0.3196382761001587, | |
| "mean_token_accuracy": 0.8907700449228286, | |
| "num_tokens": 14234117.0, | |
| "step": 2300 | |
| }, | |
| { | |
| "entropy": 0.3417303442955017, | |
| "epoch": 0.4110686004092891, | |
| "grad_norm": 0.62109375, | |
| "learning_rate": 4.676674478380066e-06, | |
| "loss": 0.3371849060058594, | |
| "mean_token_accuracy": 0.8831853270530701, | |
| "num_tokens": 14298400.0, | |
| "step": 2310 | |
| }, | |
| { | |
| "entropy": 0.33982564583420755, | |
| "epoch": 0.4128481181599786, | |
| "grad_norm": 0.6953125, | |
| "learning_rate": 4.673047570405609e-06, | |
| "loss": 0.33302271366119385, | |
| "mean_token_accuracy": 0.8834989935159683, | |
| "num_tokens": 14361094.0, | |
| "step": 2320 | |
| }, | |
| { | |
| "entropy": 0.35221932679414747, | |
| "epoch": 0.4146276359106682, | |
| "grad_norm": 0.671875, | |
| "learning_rate": 4.6694018559521796e-06, | |
| "loss": 0.35496861934661866, | |
| "mean_token_accuracy": 0.8796357780694961, | |
| "num_tokens": 14421632.0, | |
| "step": 2330 | |
| }, | |
| { | |
| "entropy": 0.3150657020509243, | |
| "epoch": 0.4164071536613578, | |
| "grad_norm": 0.60546875, | |
| "learning_rate": 4.665737366571341e-06, | |
| "loss": 0.3148441553115845, | |
| "mean_token_accuracy": 0.8918822050094605, | |
| "num_tokens": 14483051.0, | |
| "step": 2340 | |
| }, | |
| { | |
| "entropy": 0.34267506673932074, | |
| "epoch": 0.41818667141204735, | |
| "grad_norm": 0.80859375, | |
| "learning_rate": 4.662054133977147e-06, | |
| "loss": 0.3419042110443115, | |
| "mean_token_accuracy": 0.8835701435804367, | |
| "num_tokens": 14541783.0, | |
| "step": 2350 | |
| }, | |
| { | |
| "entropy": 0.3517219446599483, | |
| "epoch": 0.4199661891627369, | |
| "grad_norm": 0.58984375, | |
| "learning_rate": 4.658352190045857e-06, | |
| "loss": 0.34955906867980957, | |
| "mean_token_accuracy": 0.8798441886901855, | |
| "num_tokens": 14608101.0, | |
| "step": 2360 | |
| }, | |
| { | |
| "entropy": 0.33628078177571297, | |
| "epoch": 0.42174570691342644, | |
| "grad_norm": 0.7265625, | |
| "learning_rate": 4.654631566815675e-06, | |
| "loss": 0.33331050872802737, | |
| "mean_token_accuracy": 0.8875288605690003, | |
| "num_tokens": 14672300.0, | |
| "step": 2370 | |
| }, | |
| { | |
| "entropy": 0.34784219712018966, | |
| "epoch": 0.423525224664116, | |
| "grad_norm": 0.7734375, | |
| "learning_rate": 4.650892296486454e-06, | |
| "loss": 0.34494025707244874, | |
| "mean_token_accuracy": 0.8826894581317901, | |
| "num_tokens": 14739049.0, | |
| "step": 2380 | |
| }, | |
| { | |
| "entropy": 0.31349107101559637, | |
| "epoch": 0.4253047424148056, | |
| "grad_norm": 0.75, | |
| "learning_rate": 4.647134411419435e-06, | |
| "loss": 0.30893611907958984, | |
| "mean_token_accuracy": 0.894053453207016, | |
| "num_tokens": 14799652.0, | |
| "step": 2390 | |
| }, | |
| { | |
| "entropy": 0.31107454001903534, | |
| "epoch": 0.42708426016549517, | |
| "grad_norm": 0.640625, | |
| "learning_rate": 4.643357944136954e-06, | |
| "loss": 0.30599660873413087, | |
| "mean_token_accuracy": 0.8955994427204133, | |
| "num_tokens": 14862081.0, | |
| "step": 2400 | |
| }, | |
| { | |
| "entropy": 0.32137037217617037, | |
| "epoch": 0.42886377791618474, | |
| "grad_norm": 0.65234375, | |
| "learning_rate": 4.639562927322167e-06, | |
| "loss": 0.31426043510437013, | |
| "mean_token_accuracy": 0.8908123165369034, | |
| "num_tokens": 14922114.0, | |
| "step": 2410 | |
| }, | |
| { | |
| "entropy": 0.3783827170729637, | |
| "epoch": 0.43064329566687426, | |
| "grad_norm": 1.046875, | |
| "learning_rate": 4.635749393818766e-06, | |
| "loss": 0.3785280704498291, | |
| "mean_token_accuracy": 0.8671023696660995, | |
| "num_tokens": 14981989.0, | |
| "step": 2420 | |
| }, | |
| { | |
| "entropy": 0.3020849697291851, | |
| "epoch": 0.43242281341756383, | |
| "grad_norm": 0.6484375, | |
| "learning_rate": 4.631917376630693e-06, | |
| "loss": 0.3003643035888672, | |
| "mean_token_accuracy": 0.8966308385133743, | |
| "num_tokens": 15045741.0, | |
| "step": 2430 | |
| }, | |
| { | |
| "entropy": 0.33625991865992544, | |
| "epoch": 0.4342023311682534, | |
| "grad_norm": 0.76953125, | |
| "learning_rate": 4.628066908921857e-06, | |
| "loss": 0.3332212924957275, | |
| "mean_token_accuracy": 0.8874284863471985, | |
| "num_tokens": 15107475.0, | |
| "step": 2440 | |
| }, | |
| { | |
| "entropy": 0.3250188946723938, | |
| "epoch": 0.435981848918943, | |
| "grad_norm": 0.6015625, | |
| "learning_rate": 4.624198024015845e-06, | |
| "loss": 0.31891090869903566, | |
| "mean_token_accuracy": 0.8898184031248093, | |
| "num_tokens": 15170569.0, | |
| "step": 2450 | |
| }, | |
| { | |
| "entropy": 0.315492145717144, | |
| "epoch": 0.43776136666963256, | |
| "grad_norm": 0.61328125, | |
| "learning_rate": 4.620310755395635e-06, | |
| "loss": 0.31747214794158934, | |
| "mean_token_accuracy": 0.8928862988948822, | |
| "num_tokens": 15233058.0, | |
| "step": 2460 | |
| }, | |
| { | |
| "entropy": 0.31702224239706994, | |
| "epoch": 0.4395408844203221, | |
| "grad_norm": 0.609375, | |
| "learning_rate": 4.616405136703304e-06, | |
| "loss": 0.31056358814239504, | |
| "mean_token_accuracy": 0.8953319102525711, | |
| "num_tokens": 15294510.0, | |
| "step": 2470 | |
| }, | |
| { | |
| "entropy": 0.31886664032936096, | |
| "epoch": 0.44132040217101165, | |
| "grad_norm": 0.6953125, | |
| "learning_rate": 4.612481201739738e-06, | |
| "loss": 0.31690473556518556, | |
| "mean_token_accuracy": 0.8920366615056992, | |
| "num_tokens": 15357028.0, | |
| "step": 2480 | |
| }, | |
| { | |
| "entropy": 0.34460915327072145, | |
| "epoch": 0.4430999199217012, | |
| "grad_norm": 0.6015625, | |
| "learning_rate": 4.6085389844643434e-06, | |
| "loss": 0.34269492626190184, | |
| "mean_token_accuracy": 0.8818275421857834, | |
| "num_tokens": 15424295.0, | |
| "step": 2490 | |
| }, | |
| { | |
| "entropy": 0.33869500681757925, | |
| "epoch": 0.4448794376723908, | |
| "grad_norm": 0.65234375, | |
| "learning_rate": 4.604578518994746e-06, | |
| "loss": 0.338638162612915, | |
| "mean_token_accuracy": 0.8851386606693268, | |
| "num_tokens": 15484373.0, | |
| "step": 2500 | |
| }, | |
| { | |
| "entropy": 0.3630241386592388, | |
| "epoch": 0.4466589554230804, | |
| "grad_norm": 0.84375, | |
| "learning_rate": 4.600599839606501e-06, | |
| "loss": 0.35610802173614503, | |
| "mean_token_accuracy": 0.8770470976829529, | |
| "num_tokens": 15545790.0, | |
| "step": 2510 | |
| }, | |
| { | |
| "entropy": 0.3436386063694954, | |
| "epoch": 0.4484384731737699, | |
| "grad_norm": 0.8046875, | |
| "learning_rate": 4.596602980732794e-06, | |
| "loss": 0.34070501327514646, | |
| "mean_token_accuracy": 0.8828610718250275, | |
| "num_tokens": 15607013.0, | |
| "step": 2520 | |
| }, | |
| { | |
| "entropy": 0.32435066625475883, | |
| "epoch": 0.45021799092445947, | |
| "grad_norm": 0.75, | |
| "learning_rate": 4.592587976964142e-06, | |
| "loss": 0.32359211444854735, | |
| "mean_token_accuracy": 0.8887916415929794, | |
| "num_tokens": 15672028.0, | |
| "step": 2530 | |
| }, | |
| { | |
| "entropy": 0.3171756863594055, | |
| "epoch": 0.45199750867514904, | |
| "grad_norm": 0.66796875, | |
| "learning_rate": 4.588554863048099e-06, | |
| "loss": 0.31291513442993163, | |
| "mean_token_accuracy": 0.8936502784490585, | |
| "num_tokens": 15732768.0, | |
| "step": 2540 | |
| }, | |
| { | |
| "entropy": 0.3241963624954224, | |
| "epoch": 0.4537770264258386, | |
| "grad_norm": 0.75, | |
| "learning_rate": 4.584503673888949e-06, | |
| "loss": 0.3263869047164917, | |
| "mean_token_accuracy": 0.8885355502367019, | |
| "num_tokens": 15793888.0, | |
| "step": 2550 | |
| }, | |
| { | |
| "entropy": 0.3024554118514061, | |
| "epoch": 0.45555654417652813, | |
| "grad_norm": 0.6875, | |
| "learning_rate": 4.580434444547409e-06, | |
| "loss": 0.3018280267715454, | |
| "mean_token_accuracy": 0.8975428372621537, | |
| "num_tokens": 15852425.0, | |
| "step": 2560 | |
| }, | |
| { | |
| "entropy": 0.3554363906383514, | |
| "epoch": 0.4573360619272177, | |
| "grad_norm": 0.84375, | |
| "learning_rate": 4.5763472102403215e-06, | |
| "loss": 0.3512598514556885, | |
| "mean_token_accuracy": 0.8808555275201797, | |
| "num_tokens": 15914089.0, | |
| "step": 2570 | |
| }, | |
| { | |
| "entropy": 0.3259240105748177, | |
| "epoch": 0.4591155796779073, | |
| "grad_norm": 0.76171875, | |
| "learning_rate": 4.572242006340352e-06, | |
| "loss": 0.3269521236419678, | |
| "mean_token_accuracy": 0.8882152527570725, | |
| "num_tokens": 15973461.0, | |
| "step": 2580 | |
| }, | |
| { | |
| "entropy": 0.3012853354215622, | |
| "epoch": 0.46089509742859686, | |
| "grad_norm": 0.67578125, | |
| "learning_rate": 4.568118868375686e-06, | |
| "loss": 0.3029595375061035, | |
| "mean_token_accuracy": 0.8964558213949203, | |
| "num_tokens": 16033625.0, | |
| "step": 2590 | |
| }, | |
| { | |
| "entropy": 0.35047017931938174, | |
| "epoch": 0.46267461517928643, | |
| "grad_norm": 0.88671875, | |
| "learning_rate": 4.563977832029712e-06, | |
| "loss": 0.35230581760406493, | |
| "mean_token_accuracy": 0.878894105553627, | |
| "num_tokens": 16094362.0, | |
| "step": 2600 | |
| }, | |
| { | |
| "entropy": 0.30704435482621195, | |
| "epoch": 0.46445413292997595, | |
| "grad_norm": 0.66015625, | |
| "learning_rate": 4.5598189331407234e-06, | |
| "loss": 0.3074403524398804, | |
| "mean_token_accuracy": 0.8958454251289367, | |
| "num_tokens": 16156232.0, | |
| "step": 2610 | |
| }, | |
| { | |
| "entropy": 0.3590959653258324, | |
| "epoch": 0.4662336506806655, | |
| "grad_norm": 0.58984375, | |
| "learning_rate": 4.555642207701602e-06, | |
| "loss": 0.36126687526702883, | |
| "mean_token_accuracy": 0.8771416783332825, | |
| "num_tokens": 16217082.0, | |
| "step": 2620 | |
| }, | |
| { | |
| "entropy": 0.33900789022445676, | |
| "epoch": 0.4680131684313551, | |
| "grad_norm": 0.75, | |
| "learning_rate": 4.551447691859507e-06, | |
| "loss": 0.33671634197235106, | |
| "mean_token_accuracy": 0.8847041338682174, | |
| "num_tokens": 16274330.0, | |
| "step": 2630 | |
| }, | |
| { | |
| "entropy": 0.3191348910331726, | |
| "epoch": 0.46979268618204467, | |
| "grad_norm": 0.88671875, | |
| "learning_rate": 4.5472354219155654e-06, | |
| "loss": 0.31302542686462403, | |
| "mean_token_accuracy": 0.8915578126907349, | |
| "num_tokens": 16331223.0, | |
| "step": 2640 | |
| }, | |
| { | |
| "entropy": 0.351291561871767, | |
| "epoch": 0.47157220393273425, | |
| "grad_norm": 0.7890625, | |
| "learning_rate": 4.5430054343245555e-06, | |
| "loss": 0.34546680450439454, | |
| "mean_token_accuracy": 0.8808116346597672, | |
| "num_tokens": 16395174.0, | |
| "step": 2650 | |
| }, | |
| { | |
| "entropy": 0.3154144696891308, | |
| "epoch": 0.47335172168342377, | |
| "grad_norm": 0.61328125, | |
| "learning_rate": 4.538757765694591e-06, | |
| "loss": 0.31420135498046875, | |
| "mean_token_accuracy": 0.8921685576438904, | |
| "num_tokens": 16458721.0, | |
| "step": 2660 | |
| }, | |
| { | |
| "entropy": 0.2940688617527485, | |
| "epoch": 0.47513123943411334, | |
| "grad_norm": 0.6796875, | |
| "learning_rate": 4.534492452786804e-06, | |
| "loss": 0.2899198532104492, | |
| "mean_token_accuracy": 0.9009364068508148, | |
| "num_tokens": 16517232.0, | |
| "step": 2670 | |
| }, | |
| { | |
| "entropy": 0.30826053619384763, | |
| "epoch": 0.4769107571848029, | |
| "grad_norm": 0.609375, | |
| "learning_rate": 4.530209532515029e-06, | |
| "loss": 0.30183231830596924, | |
| "mean_token_accuracy": 0.8953039288520813, | |
| "num_tokens": 16577813.0, | |
| "step": 2680 | |
| }, | |
| { | |
| "entropy": 0.34231879040598867, | |
| "epoch": 0.4786902749354925, | |
| "grad_norm": 0.625, | |
| "learning_rate": 4.525909041945481e-06, | |
| "loss": 0.3440409660339355, | |
| "mean_token_accuracy": 0.8828630119562149, | |
| "num_tokens": 16640559.0, | |
| "step": 2690 | |
| }, | |
| { | |
| "entropy": 0.3318951167166233, | |
| "epoch": 0.48046979268618206, | |
| "grad_norm": 0.80859375, | |
| "learning_rate": 4.521591018296438e-06, | |
| "loss": 0.33158555030822756, | |
| "mean_token_accuracy": 0.887498813867569, | |
| "num_tokens": 16698916.0, | |
| "step": 2700 | |
| }, | |
| { | |
| "entropy": 0.33077102825045585, | |
| "epoch": 0.4822493104368716, | |
| "grad_norm": 0.72265625, | |
| "learning_rate": 4.5172554989379146e-06, | |
| "loss": 0.3289660453796387, | |
| "mean_token_accuracy": 0.8876483112573623, | |
| "num_tokens": 16758734.0, | |
| "step": 2710 | |
| }, | |
| { | |
| "entropy": 0.31145247370004653, | |
| "epoch": 0.48402882818756116, | |
| "grad_norm": 0.625, | |
| "learning_rate": 4.512902521391342e-06, | |
| "loss": 0.30768885612487795, | |
| "mean_token_accuracy": 0.895361065864563, | |
| "num_tokens": 16821053.0, | |
| "step": 2720 | |
| }, | |
| { | |
| "entropy": 0.3322932541370392, | |
| "epoch": 0.48580834593825073, | |
| "grad_norm": 0.59765625, | |
| "learning_rate": 4.50853212332924e-06, | |
| "loss": 0.33010575771331785, | |
| "mean_token_accuracy": 0.8861605077981949, | |
| "num_tokens": 16880403.0, | |
| "step": 2730 | |
| }, | |
| { | |
| "entropy": 0.3375461004674435, | |
| "epoch": 0.4875878636889403, | |
| "grad_norm": 0.57421875, | |
| "learning_rate": 4.5041443425748956e-06, | |
| "loss": 0.33987059593200686, | |
| "mean_token_accuracy": 0.885013970732689, | |
| "num_tokens": 16944196.0, | |
| "step": 2740 | |
| }, | |
| { | |
| "entropy": 0.3545444868505001, | |
| "epoch": 0.4893673814396299, | |
| "grad_norm": 0.78125, | |
| "learning_rate": 4.4997392171020325e-06, | |
| "loss": 0.3545894384384155, | |
| "mean_token_accuracy": 0.8798752963542938, | |
| "num_tokens": 17005398.0, | |
| "step": 2750 | |
| }, | |
| { | |
| "entropy": 0.30588506162166595, | |
| "epoch": 0.4911468991903194, | |
| "grad_norm": 0.62109375, | |
| "learning_rate": 4.49531678503448e-06, | |
| "loss": 0.30497701168060304, | |
| "mean_token_accuracy": 0.8962134778499603, | |
| "num_tokens": 17066435.0, | |
| "step": 2760 | |
| }, | |
| { | |
| "entropy": 0.3045385979115963, | |
| "epoch": 0.49292641694100897, | |
| "grad_norm": 0.68359375, | |
| "learning_rate": 4.49087708464585e-06, | |
| "loss": 0.3027324199676514, | |
| "mean_token_accuracy": 0.8975372821092605, | |
| "num_tokens": 17129332.0, | |
| "step": 2770 | |
| }, | |
| { | |
| "entropy": 0.3161292657256126, | |
| "epoch": 0.49470593469169855, | |
| "grad_norm": 0.71875, | |
| "learning_rate": 4.486420154359199e-06, | |
| "loss": 0.31549763679504395, | |
| "mean_token_accuracy": 0.8915608644485473, | |
| "num_tokens": 17192133.0, | |
| "step": 2780 | |
| }, | |
| { | |
| "entropy": 0.31189642772078513, | |
| "epoch": 0.4964854524423881, | |
| "grad_norm": 0.69921875, | |
| "learning_rate": 4.481946032746701e-06, | |
| "loss": 0.3085655927658081, | |
| "mean_token_accuracy": 0.8947380036115646, | |
| "num_tokens": 17254788.0, | |
| "step": 2790 | |
| }, | |
| { | |
| "entropy": 0.33163716197013854, | |
| "epoch": 0.4982649701930777, | |
| "grad_norm": 0.8125, | |
| "learning_rate": 4.477454758529308e-06, | |
| "loss": 0.3342583417892456, | |
| "mean_token_accuracy": 0.8849562466144562, | |
| "num_tokens": 17317312.0, | |
| "step": 2800 | |
| }, | |
| { | |
| "entropy": 0.3500364273786545, | |
| "epoch": 0.5000444879437672, | |
| "grad_norm": 0.67578125, | |
| "learning_rate": 4.472946370576421e-06, | |
| "loss": 0.35043671131134035, | |
| "mean_token_accuracy": 0.8790032923221588, | |
| "num_tokens": 17379955.0, | |
| "step": 2810 | |
| }, | |
| { | |
| "entropy": 0.3339493066072464, | |
| "epoch": 0.5018240056944568, | |
| "grad_norm": 0.7421875, | |
| "learning_rate": 4.468420907905548e-06, | |
| "loss": 0.3300433874130249, | |
| "mean_token_accuracy": 0.8858879506587982, | |
| "num_tokens": 17444416.0, | |
| "step": 2820 | |
| }, | |
| { | |
| "entropy": 0.3093738153576851, | |
| "epoch": 0.5036035234451464, | |
| "grad_norm": 0.6640625, | |
| "learning_rate": 4.46387840968197e-06, | |
| "loss": 0.3013624906539917, | |
| "mean_token_accuracy": 0.8952651113271713, | |
| "num_tokens": 17509101.0, | |
| "step": 2830 | |
| }, | |
| { | |
| "entropy": 0.33546592220664023, | |
| "epoch": 0.5053830411958359, | |
| "grad_norm": 0.88671875, | |
| "learning_rate": 4.4593189152184014e-06, | |
| "loss": 0.3282387971878052, | |
| "mean_token_accuracy": 0.8882806301116943, | |
| "num_tokens": 17567390.0, | |
| "step": 2840 | |
| }, | |
| { | |
| "entropy": 0.3365064963698387, | |
| "epoch": 0.5071625589465255, | |
| "grad_norm": 0.76953125, | |
| "learning_rate": 4.454742463974648e-06, | |
| "loss": 0.3341943025588989, | |
| "mean_token_accuracy": 0.8837945908308029, | |
| "num_tokens": 17631044.0, | |
| "step": 2850 | |
| }, | |
| { | |
| "entropy": 0.32098233252763747, | |
| "epoch": 0.508942076697215, | |
| "grad_norm": 0.73828125, | |
| "learning_rate": 4.450149095557268e-06, | |
| "loss": 0.31779956817626953, | |
| "mean_token_accuracy": 0.889788419008255, | |
| "num_tokens": 17693352.0, | |
| "step": 2860 | |
| }, | |
| { | |
| "entropy": 0.32383744418621063, | |
| "epoch": 0.5107215944479047, | |
| "grad_norm": 0.73046875, | |
| "learning_rate": 4.445538849719227e-06, | |
| "loss": 0.31950232982635496, | |
| "mean_token_accuracy": 0.8892173141241073, | |
| "num_tokens": 17756334.0, | |
| "step": 2870 | |
| }, | |
| { | |
| "entropy": 0.3242351822555065, | |
| "epoch": 0.5125011121985942, | |
| "grad_norm": 0.75390625, | |
| "learning_rate": 4.440911766359557e-06, | |
| "loss": 0.32260258197784425, | |
| "mean_token_accuracy": 0.8905003130435943, | |
| "num_tokens": 17815619.0, | |
| "step": 2880 | |
| }, | |
| { | |
| "entropy": 0.34278836399316787, | |
| "epoch": 0.5142806299492837, | |
| "grad_norm": 0.7890625, | |
| "learning_rate": 4.436267885523007e-06, | |
| "loss": 0.3431732416152954, | |
| "mean_token_accuracy": 0.8825717777013778, | |
| "num_tokens": 17874822.0, | |
| "step": 2890 | |
| }, | |
| { | |
| "entropy": 0.3369047962129116, | |
| "epoch": 0.5160601476999733, | |
| "grad_norm": 0.7265625, | |
| "learning_rate": 4.431607247399698e-06, | |
| "loss": 0.34291141033172606, | |
| "mean_token_accuracy": 0.8822033911943435, | |
| "num_tokens": 17935388.0, | |
| "step": 2900 | |
| }, | |
| { | |
| "entropy": 0.3206785574555397, | |
| "epoch": 0.5178396654506628, | |
| "grad_norm": 0.60546875, | |
| "learning_rate": 4.426929892324777e-06, | |
| "loss": 0.3195641279220581, | |
| "mean_token_accuracy": 0.8898243546485901, | |
| "num_tokens": 17997547.0, | |
| "step": 2910 | |
| }, | |
| { | |
| "entropy": 0.3480710357427597, | |
| "epoch": 0.5196191832013525, | |
| "grad_norm": 0.84375, | |
| "learning_rate": 4.422235860778069e-06, | |
| "loss": 0.34496591091156004, | |
| "mean_token_accuracy": 0.8791915744543075, | |
| "num_tokens": 18058189.0, | |
| "step": 2920 | |
| }, | |
| { | |
| "entropy": 0.33354608416557313, | |
| "epoch": 0.521398700952042, | |
| "grad_norm": 0.859375, | |
| "learning_rate": 4.4175251933837185e-06, | |
| "loss": 0.3351024866104126, | |
| "mean_token_accuracy": 0.886347496509552, | |
| "num_tokens": 18121362.0, | |
| "step": 2930 | |
| }, | |
| { | |
| "entropy": 0.3292862832546234, | |
| "epoch": 0.5231782187027315, | |
| "grad_norm": 0.640625, | |
| "learning_rate": 4.412797930909849e-06, | |
| "loss": 0.32676169872283933, | |
| "mean_token_accuracy": 0.88723985850811, | |
| "num_tokens": 18184621.0, | |
| "step": 2940 | |
| }, | |
| { | |
| "entropy": 0.2951918601989746, | |
| "epoch": 0.5249577364534211, | |
| "grad_norm": 0.6640625, | |
| "learning_rate": 4.408054114268202e-06, | |
| "loss": 0.2963052034378052, | |
| "mean_token_accuracy": 0.9016390770673752, | |
| "num_tokens": 18243303.0, | |
| "step": 2950 | |
| }, | |
| { | |
| "entropy": 0.3430948376655579, | |
| "epoch": 0.5267372542041107, | |
| "grad_norm": 0.65234375, | |
| "learning_rate": 4.403293784513788e-06, | |
| "loss": 0.34618875980377195, | |
| "mean_token_accuracy": 0.8814037412405014, | |
| "num_tokens": 18307450.0, | |
| "step": 2960 | |
| }, | |
| { | |
| "entropy": 0.3350948102772236, | |
| "epoch": 0.5285167719548003, | |
| "grad_norm": 0.7109375, | |
| "learning_rate": 4.398516982844526e-06, | |
| "loss": 0.3327265501022339, | |
| "mean_token_accuracy": 0.8859294772148132, | |
| "num_tokens": 18370995.0, | |
| "step": 2970 | |
| }, | |
| { | |
| "entropy": 0.3445021383464336, | |
| "epoch": 0.5302962897054898, | |
| "grad_norm": 0.8671875, | |
| "learning_rate": 4.393723750600892e-06, | |
| "loss": 0.3372231721878052, | |
| "mean_token_accuracy": 0.8843325912952423, | |
| "num_tokens": 18435798.0, | |
| "step": 2980 | |
| }, | |
| { | |
| "entropy": 0.3483050562441349, | |
| "epoch": 0.5320758074561793, | |
| "grad_norm": 0.65625, | |
| "learning_rate": 4.388914129265559e-06, | |
| "loss": 0.3432689905166626, | |
| "mean_token_accuracy": 0.8827427834272384, | |
| "num_tokens": 18493487.0, | |
| "step": 2990 | |
| }, | |
| { | |
| "entropy": 0.3505037516355515, | |
| "epoch": 0.533855325206869, | |
| "grad_norm": 0.6796875, | |
| "learning_rate": 4.384088160463038e-06, | |
| "loss": 0.34547269344329834, | |
| "mean_token_accuracy": 0.8785193890333176, | |
| "num_tokens": 18554456.0, | |
| "step": 3000 | |
| }, | |
| { | |
| "entropy": 0.29410420432686807, | |
| "epoch": 0.5356348429575585, | |
| "grad_norm": 0.72265625, | |
| "learning_rate": 4.379245885959319e-06, | |
| "loss": 0.28923351764678956, | |
| "mean_token_accuracy": 0.9004590451717377, | |
| "num_tokens": 18615158.0, | |
| "step": 3010 | |
| }, | |
| { | |
| "entropy": 0.32648345828056335, | |
| "epoch": 0.5374143607082481, | |
| "grad_norm": 0.6796875, | |
| "learning_rate": 4.374387347661505e-06, | |
| "loss": 0.3262840747833252, | |
| "mean_token_accuracy": 0.8869497299194335, | |
| "num_tokens": 18679569.0, | |
| "step": 3020 | |
| }, | |
| { | |
| "entropy": 0.32210521027445793, | |
| "epoch": 0.5391938784589376, | |
| "grad_norm": 0.61328125, | |
| "learning_rate": 4.3695125876174585e-06, | |
| "loss": 0.32357451915740965, | |
| "mean_token_accuracy": 0.889242309331894, | |
| "num_tokens": 18739067.0, | |
| "step": 3030 | |
| }, | |
| { | |
| "entropy": 0.3057173080742359, | |
| "epoch": 0.5409733962096271, | |
| "grad_norm": 0.6875, | |
| "learning_rate": 4.364621648015426e-06, | |
| "loss": 0.30181748867034913, | |
| "mean_token_accuracy": 0.8964877933263778, | |
| "num_tokens": 18801368.0, | |
| "step": 3040 | |
| }, | |
| { | |
| "entropy": 0.31124183610081674, | |
| "epoch": 0.5427529139603168, | |
| "grad_norm": 0.66796875, | |
| "learning_rate": 4.359714571183681e-06, | |
| "loss": 0.3111163854598999, | |
| "mean_token_accuracy": 0.8926129817962647, | |
| "num_tokens": 18865333.0, | |
| "step": 3050 | |
| }, | |
| { | |
| "entropy": 0.3583334222435951, | |
| "epoch": 0.5445324317110063, | |
| "grad_norm": 0.765625, | |
| "learning_rate": 4.354791399590158e-06, | |
| "loss": 0.35573246479034426, | |
| "mean_token_accuracy": 0.8774722367525101, | |
| "num_tokens": 18928216.0, | |
| "step": 3060 | |
| }, | |
| { | |
| "entropy": 0.3551542639732361, | |
| "epoch": 0.5463119494616959, | |
| "grad_norm": 0.69921875, | |
| "learning_rate": 4.34985217584208e-06, | |
| "loss": 0.3499234914779663, | |
| "mean_token_accuracy": 0.8821368932723999, | |
| "num_tokens": 18987689.0, | |
| "step": 3070 | |
| }, | |
| { | |
| "entropy": 0.3471884004771709, | |
| "epoch": 0.5480914672123854, | |
| "grad_norm": 0.76953125, | |
| "learning_rate": 4.344896942685592e-06, | |
| "loss": 0.35027542114257815, | |
| "mean_token_accuracy": 0.881121426820755, | |
| "num_tokens": 19051537.0, | |
| "step": 3080 | |
| }, | |
| { | |
| "entropy": 0.3326264344155788, | |
| "epoch": 0.549870984963075, | |
| "grad_norm": 0.82421875, | |
| "learning_rate": 4.339925743005391e-06, | |
| "loss": 0.33079872131347654, | |
| "mean_token_accuracy": 0.8863648146390914, | |
| "num_tokens": 19111444.0, | |
| "step": 3090 | |
| }, | |
| { | |
| "entropy": 0.3462922558188438, | |
| "epoch": 0.5516505027137646, | |
| "grad_norm": 0.63671875, | |
| "learning_rate": 4.3349386198243556e-06, | |
| "loss": 0.3462101697921753, | |
| "mean_token_accuracy": 0.881612503528595, | |
| "num_tokens": 19175084.0, | |
| "step": 3100 | |
| }, | |
| { | |
| "entropy": 0.35192776694893835, | |
| "epoch": 0.5534300204644541, | |
| "grad_norm": 0.80078125, | |
| "learning_rate": 4.329935616303176e-06, | |
| "loss": 0.3500053882598877, | |
| "mean_token_accuracy": 0.8800609886646271, | |
| "num_tokens": 19237412.0, | |
| "step": 3110 | |
| }, | |
| { | |
| "entropy": 0.3505033880472183, | |
| "epoch": 0.5552095382151437, | |
| "grad_norm": 0.734375, | |
| "learning_rate": 4.324916775739972e-06, | |
| "loss": 0.3427066087722778, | |
| "mean_token_accuracy": 0.881499120593071, | |
| "num_tokens": 19295476.0, | |
| "step": 3120 | |
| }, | |
| { | |
| "entropy": 0.3452603377401829, | |
| "epoch": 0.5569890559658333, | |
| "grad_norm": 0.73828125, | |
| "learning_rate": 4.319882141569928e-06, | |
| "loss": 0.3466400861740112, | |
| "mean_token_accuracy": 0.8815207093954086, | |
| "num_tokens": 19355942.0, | |
| "step": 3130 | |
| }, | |
| { | |
| "entropy": 0.2858357109129429, | |
| "epoch": 0.5587685737165228, | |
| "grad_norm": 0.640625, | |
| "learning_rate": 4.3148317573649125e-06, | |
| "loss": 0.2855920553207397, | |
| "mean_token_accuracy": 0.9025433659553528, | |
| "num_tokens": 19416066.0, | |
| "step": 3140 | |
| }, | |
| { | |
| "entropy": 0.33637115359306335, | |
| "epoch": 0.5605480914672124, | |
| "grad_norm": 0.671875, | |
| "learning_rate": 4.3097656668331e-06, | |
| "loss": 0.33633320331573485, | |
| "mean_token_accuracy": 0.8851213961839676, | |
| "num_tokens": 19475246.0, | |
| "step": 3150 | |
| }, | |
| { | |
| "entropy": 0.32475576996803285, | |
| "epoch": 0.5623276092179019, | |
| "grad_norm": 0.7578125, | |
| "learning_rate": 4.3046839138185955e-06, | |
| "loss": 0.3261857986450195, | |
| "mean_token_accuracy": 0.8883878320455552, | |
| "num_tokens": 19536069.0, | |
| "step": 3160 | |
| }, | |
| { | |
| "entropy": 0.32688385173678397, | |
| "epoch": 0.5641071269685916, | |
| "grad_norm": 0.6953125, | |
| "learning_rate": 4.299586542301053e-06, | |
| "loss": 0.32369470596313477, | |
| "mean_token_accuracy": 0.8877399653196335, | |
| "num_tokens": 19597263.0, | |
| "step": 3170 | |
| }, | |
| { | |
| "entropy": 0.32857562229037285, | |
| "epoch": 0.5658866447192811, | |
| "grad_norm": 0.796875, | |
| "learning_rate": 4.294473596395296e-06, | |
| "loss": 0.3317885875701904, | |
| "mean_token_accuracy": 0.889950966835022, | |
| "num_tokens": 19659533.0, | |
| "step": 3180 | |
| }, | |
| { | |
| "entropy": 0.3587916135787964, | |
| "epoch": 0.5676661624699706, | |
| "grad_norm": 0.78125, | |
| "learning_rate": 4.2893451203509375e-06, | |
| "loss": 0.3553422451019287, | |
| "mean_token_accuracy": 0.8782511681318284, | |
| "num_tokens": 19717502.0, | |
| "step": 3190 | |
| }, | |
| { | |
| "entropy": 0.3406700178980827, | |
| "epoch": 0.5694456802206602, | |
| "grad_norm": 0.69140625, | |
| "learning_rate": 4.284201158551992e-06, | |
| "loss": 0.33574848175048827, | |
| "mean_token_accuracy": 0.8840092897415162, | |
| "num_tokens": 19781706.0, | |
| "step": 3200 | |
| }, | |
| { | |
| "entropy": 0.335107384622097, | |
| "epoch": 0.5712251979713497, | |
| "grad_norm": 0.65625, | |
| "learning_rate": 4.279041755516493e-06, | |
| "loss": 0.32921667098999025, | |
| "mean_token_accuracy": 0.8867899179458618, | |
| "num_tokens": 19841681.0, | |
| "step": 3210 | |
| }, | |
| { | |
| "entropy": 0.3081793308258057, | |
| "epoch": 0.5730047157220394, | |
| "grad_norm": 0.62890625, | |
| "learning_rate": 4.273866955896113e-06, | |
| "loss": 0.30739941596984866, | |
| "mean_token_accuracy": 0.8965465784072876, | |
| "num_tokens": 19898326.0, | |
| "step": 3220 | |
| }, | |
| { | |
| "entropy": 0.34780475571751596, | |
| "epoch": 0.5747842334727289, | |
| "grad_norm": 0.6953125, | |
| "learning_rate": 4.268676804475772e-06, | |
| "loss": 0.3460541248321533, | |
| "mean_token_accuracy": 0.8816146969795227, | |
| "num_tokens": 19956482.0, | |
| "step": 3230 | |
| }, | |
| { | |
| "entropy": 0.36232799142599104, | |
| "epoch": 0.5765637512234184, | |
| "grad_norm": 0.8125, | |
| "learning_rate": 4.2634713461732495e-06, | |
| "loss": 0.35634894371032716, | |
| "mean_token_accuracy": 0.8750342965126038, | |
| "num_tokens": 20016435.0, | |
| "step": 3240 | |
| }, | |
| { | |
| "entropy": 0.3187406860291958, | |
| "epoch": 0.578343268974108, | |
| "grad_norm": 0.640625, | |
| "learning_rate": 4.258250626038799e-06, | |
| "loss": 0.3180917978286743, | |
| "mean_token_accuracy": 0.8902105063199997, | |
| "num_tokens": 20080092.0, | |
| "step": 3250 | |
| }, | |
| { | |
| "entropy": 0.3615705005824566, | |
| "epoch": 0.5801227867247976, | |
| "grad_norm": 0.76953125, | |
| "learning_rate": 4.2530146892547545e-06, | |
| "loss": 0.3651046991348267, | |
| "mean_token_accuracy": 0.8766989678144455, | |
| "num_tokens": 20144099.0, | |
| "step": 3260 | |
| }, | |
| { | |
| "entropy": 0.33297630175948145, | |
| "epoch": 0.5819023044754872, | |
| "grad_norm": 0.7890625, | |
| "learning_rate": 4.2477635811351426e-06, | |
| "loss": 0.33105955123901365, | |
| "mean_token_accuracy": 0.886493194103241, | |
| "num_tokens": 20206312.0, | |
| "step": 3270 | |
| }, | |
| { | |
| "entropy": 0.3028066374361515, | |
| "epoch": 0.5836818222261767, | |
| "grad_norm": 0.75, | |
| "learning_rate": 4.242497347125289e-06, | |
| "loss": 0.2985677242279053, | |
| "mean_token_accuracy": 0.897066456079483, | |
| "num_tokens": 20269053.0, | |
| "step": 3280 | |
| }, | |
| { | |
| "entropy": 0.3160752020776272, | |
| "epoch": 0.5854613399768662, | |
| "grad_norm": 0.75, | |
| "learning_rate": 4.2372160328014266e-06, | |
| "loss": 0.3144646644592285, | |
| "mean_token_accuracy": 0.8949336677789688, | |
| "num_tokens": 20334519.0, | |
| "step": 3290 | |
| }, | |
| { | |
| "entropy": 0.3503792636096478, | |
| "epoch": 0.5872408577275559, | |
| "grad_norm": 0.78515625, | |
| "learning_rate": 4.231919683870296e-06, | |
| "loss": 0.3507127046585083, | |
| "mean_token_accuracy": 0.8792561978101731, | |
| "num_tokens": 20396780.0, | |
| "step": 3300 | |
| }, | |
| { | |
| "entropy": 0.32902468293905257, | |
| "epoch": 0.5890203754782454, | |
| "grad_norm": 0.8671875, | |
| "learning_rate": 4.2266083461687585e-06, | |
| "loss": 0.32418806552886964, | |
| "mean_token_accuracy": 0.8885544329881668, | |
| "num_tokens": 20456450.0, | |
| "step": 3310 | |
| }, | |
| { | |
| "entropy": 0.3679012328386307, | |
| "epoch": 0.590799893228935, | |
| "grad_norm": 0.7578125, | |
| "learning_rate": 4.2212820656633905e-06, | |
| "loss": 0.36230764389038084, | |
| "mean_token_accuracy": 0.8737878859043121, | |
| "num_tokens": 20517396.0, | |
| "step": 3320 | |
| }, | |
| { | |
| "entropy": 0.3137190110981464, | |
| "epoch": 0.5925794109796245, | |
| "grad_norm": 0.68359375, | |
| "learning_rate": 4.215940888450092e-06, | |
| "loss": 0.31717281341552733, | |
| "mean_token_accuracy": 0.8932360798120499, | |
| "num_tokens": 20577570.0, | |
| "step": 3330 | |
| }, | |
| { | |
| "entropy": 0.3405553102493286, | |
| "epoch": 0.594358928730314, | |
| "grad_norm": 0.64453125, | |
| "learning_rate": 4.2105848607536845e-06, | |
| "loss": 0.33839738368988037, | |
| "mean_token_accuracy": 0.8822631210088729, | |
| "num_tokens": 20642806.0, | |
| "step": 3340 | |
| }, | |
| { | |
| "entropy": 0.33166978135704994, | |
| "epoch": 0.5961384464810037, | |
| "grad_norm": 0.68359375, | |
| "learning_rate": 4.2052140289275126e-06, | |
| "loss": 0.32867019176483153, | |
| "mean_token_accuracy": 0.8865305632352829, | |
| "num_tokens": 20705203.0, | |
| "step": 3350 | |
| }, | |
| { | |
| "entropy": 0.3391012966632843, | |
| "epoch": 0.5979179642316932, | |
| "grad_norm": 0.6015625, | |
| "learning_rate": 4.199828439453042e-06, | |
| "loss": 0.3397333860397339, | |
| "mean_token_accuracy": 0.881675910949707, | |
| "num_tokens": 20765845.0, | |
| "step": 3360 | |
| }, | |
| { | |
| "entropy": 0.30641280487179756, | |
| "epoch": 0.5996974819823828, | |
| "grad_norm": 0.59765625, | |
| "learning_rate": 4.194428138939458e-06, | |
| "loss": 0.3074562311172485, | |
| "mean_token_accuracy": 0.896448427438736, | |
| "num_tokens": 20828070.0, | |
| "step": 3370 | |
| }, | |
| { | |
| "entropy": 0.3260988719761372, | |
| "epoch": 0.6014769997330723, | |
| "grad_norm": 0.88671875, | |
| "learning_rate": 4.189013174123259e-06, | |
| "loss": 0.3167697906494141, | |
| "mean_token_accuracy": 0.8922264486551285, | |
| "num_tokens": 20889620.0, | |
| "step": 3380 | |
| }, | |
| { | |
| "entropy": 0.3060282714664936, | |
| "epoch": 0.6032565174837619, | |
| "grad_norm": 0.6015625, | |
| "learning_rate": 4.183583591867858e-06, | |
| "loss": 0.3049851179122925, | |
| "mean_token_accuracy": 0.896173644065857, | |
| "num_tokens": 20946553.0, | |
| "step": 3390 | |
| }, | |
| { | |
| "entropy": 0.3040558986365795, | |
| "epoch": 0.6050360352344515, | |
| "grad_norm": 0.69921875, | |
| "learning_rate": 4.17813943916317e-06, | |
| "loss": 0.3029818296432495, | |
| "mean_token_accuracy": 0.896300557255745, | |
| "num_tokens": 21009161.0, | |
| "step": 3400 | |
| }, | |
| { | |
| "entropy": 0.3222613945603371, | |
| "epoch": 0.606815552985141, | |
| "grad_norm": 0.66796875, | |
| "learning_rate": 4.172680763125212e-06, | |
| "loss": 0.32582573890686034, | |
| "mean_token_accuracy": 0.889011001586914, | |
| "num_tokens": 21070400.0, | |
| "step": 3410 | |
| }, | |
| { | |
| "entropy": 0.32724867165088656, | |
| "epoch": 0.6085950707358306, | |
| "grad_norm": 0.6953125, | |
| "learning_rate": 4.167207610995691e-06, | |
| "loss": 0.3263880491256714, | |
| "mean_token_accuracy": 0.8889974474906921, | |
| "num_tokens": 21132193.0, | |
| "step": 3420 | |
| }, | |
| { | |
| "entropy": 0.3585047386586666, | |
| "epoch": 0.6103745884865202, | |
| "grad_norm": 0.8125, | |
| "learning_rate": 4.161720030141595e-06, | |
| "loss": 0.3584728717803955, | |
| "mean_token_accuracy": 0.8756175965070725, | |
| "num_tokens": 21192437.0, | |
| "step": 3430 | |
| }, | |
| { | |
| "entropy": 0.3226370632648468, | |
| "epoch": 0.6121541062372097, | |
| "grad_norm": 0.734375, | |
| "learning_rate": 4.156218068054785e-06, | |
| "loss": 0.31595520973205565, | |
| "mean_token_accuracy": 0.8923990041017532, | |
| "num_tokens": 21254137.0, | |
| "step": 3440 | |
| }, | |
| { | |
| "entropy": 0.306988450884819, | |
| "epoch": 0.6139336239878993, | |
| "grad_norm": 0.72265625, | |
| "learning_rate": 4.150701772351586e-06, | |
| "loss": 0.3028196096420288, | |
| "mean_token_accuracy": 0.8970669984817505, | |
| "num_tokens": 21313770.0, | |
| "step": 3450 | |
| }, | |
| { | |
| "entropy": 0.32845938503742217, | |
| "epoch": 0.6157131417385888, | |
| "grad_norm": 0.73828125, | |
| "learning_rate": 4.145171190772367e-06, | |
| "loss": 0.32838926315307615, | |
| "mean_token_accuracy": 0.8893208533525467, | |
| "num_tokens": 21372296.0, | |
| "step": 3460 | |
| }, | |
| { | |
| "entropy": 0.32188113778829575, | |
| "epoch": 0.6174926594892785, | |
| "grad_norm": 0.94140625, | |
| "learning_rate": 4.139626371181138e-06, | |
| "loss": 0.3162687301635742, | |
| "mean_token_accuracy": 0.8913774728775025, | |
| "num_tokens": 21433382.0, | |
| "step": 3470 | |
| }, | |
| { | |
| "entropy": 0.35295322388410566, | |
| "epoch": 0.619272177239968, | |
| "grad_norm": 0.69140625, | |
| "learning_rate": 4.134067361565128e-06, | |
| "loss": 0.3582089185714722, | |
| "mean_token_accuracy": 0.878473910689354, | |
| "num_tokens": 21496318.0, | |
| "step": 3480 | |
| }, | |
| { | |
| "entropy": 0.3337127357721329, | |
| "epoch": 0.6210516949906575, | |
| "grad_norm": 0.8359375, | |
| "learning_rate": 4.128494210034374e-06, | |
| "loss": 0.33816502094268797, | |
| "mean_token_accuracy": 0.8863029271364212, | |
| "num_tokens": 21555666.0, | |
| "step": 3490 | |
| }, | |
| { | |
| "entropy": 0.325682258605957, | |
| "epoch": 0.6228312127413471, | |
| "grad_norm": 0.703125, | |
| "learning_rate": 4.1229069648213e-06, | |
| "loss": 0.325277304649353, | |
| "mean_token_accuracy": 0.887930378317833, | |
| "num_tokens": 21616062.0, | |
| "step": 3500 | |
| }, | |
| { | |
| "entropy": 0.3299191676080227, | |
| "epoch": 0.6246107304920366, | |
| "grad_norm": 0.671875, | |
| "learning_rate": 4.117305674280308e-06, | |
| "loss": 0.32916214466094973, | |
| "mean_token_accuracy": 0.8882404506206513, | |
| "num_tokens": 21682052.0, | |
| "step": 3510 | |
| }, | |
| { | |
| "entropy": 0.30750582069158555, | |
| "epoch": 0.6263902482427263, | |
| "grad_norm": 0.6953125, | |
| "learning_rate": 4.111690386887351e-06, | |
| "loss": 0.3015623092651367, | |
| "mean_token_accuracy": 0.8977977722883225, | |
| "num_tokens": 21747759.0, | |
| "step": 3520 | |
| }, | |
| { | |
| "entropy": 0.30353686213493347, | |
| "epoch": 0.6281697659934158, | |
| "grad_norm": 0.61328125, | |
| "learning_rate": 4.106061151239516e-06, | |
| "loss": 0.30034866333007815, | |
| "mean_token_accuracy": 0.8972961157560349, | |
| "num_tokens": 21812103.0, | |
| "step": 3530 | |
| }, | |
| { | |
| "entropy": 0.36687018126249316, | |
| "epoch": 0.6299492837441053, | |
| "grad_norm": 0.74609375, | |
| "learning_rate": 4.1004180160546055e-06, | |
| "loss": 0.37118489742279054, | |
| "mean_token_accuracy": 0.8741149574518203, | |
| "num_tokens": 21869766.0, | |
| "step": 3540 | |
| }, | |
| { | |
| "entropy": 0.33901830613613126, | |
| "epoch": 0.6317288014947949, | |
| "grad_norm": 0.6484375, | |
| "learning_rate": 4.094761030170715e-06, | |
| "loss": 0.336282753944397, | |
| "mean_token_accuracy": 0.8839475184679031, | |
| "num_tokens": 21931834.0, | |
| "step": 3550 | |
| }, | |
| { | |
| "entropy": 0.3397719688713551, | |
| "epoch": 0.6335083192454845, | |
| "grad_norm": 0.70703125, | |
| "learning_rate": 4.089090242545808e-06, | |
| "loss": 0.3386350393295288, | |
| "mean_token_accuracy": 0.8843063890933991, | |
| "num_tokens": 21995067.0, | |
| "step": 3560 | |
| }, | |
| { | |
| "entropy": 0.3309327274560928, | |
| "epoch": 0.6352878369961741, | |
| "grad_norm": 0.734375, | |
| "learning_rate": 4.083405702257297e-06, | |
| "loss": 0.3225497007369995, | |
| "mean_token_accuracy": 0.8881833463907242, | |
| "num_tokens": 22054290.0, | |
| "step": 3570 | |
| }, | |
| { | |
| "entropy": 0.3295432783663273, | |
| "epoch": 0.6370673547468636, | |
| "grad_norm": 0.73046875, | |
| "learning_rate": 4.077707458501612e-06, | |
| "loss": 0.32772934436798096, | |
| "mean_token_accuracy": 0.8876502782106399, | |
| "num_tokens": 22116730.0, | |
| "step": 3580 | |
| }, | |
| { | |
| "entropy": 0.3413019098341465, | |
| "epoch": 0.6388468724975531, | |
| "grad_norm": 0.66796875, | |
| "learning_rate": 4.071995560593782e-06, | |
| "loss": 0.3373931884765625, | |
| "mean_token_accuracy": 0.8832113146781921, | |
| "num_tokens": 22181281.0, | |
| "step": 3590 | |
| }, | |
| { | |
| "entropy": 0.3315641477704048, | |
| "epoch": 0.6406263902482427, | |
| "grad_norm": 0.65234375, | |
| "learning_rate": 4.066270057967005e-06, | |
| "loss": 0.3335767984390259, | |
| "mean_token_accuracy": 0.8852315068244934, | |
| "num_tokens": 22239291.0, | |
| "step": 3600 | |
| }, | |
| { | |
| "entropy": 0.30818153321743014, | |
| "epoch": 0.6424059079989323, | |
| "grad_norm": 0.796875, | |
| "learning_rate": 4.0605310001722155e-06, | |
| "loss": 0.3102595329284668, | |
| "mean_token_accuracy": 0.8932688593864441, | |
| "num_tokens": 22298699.0, | |
| "step": 3610 | |
| }, | |
| { | |
| "entropy": 0.3046887829899788, | |
| "epoch": 0.6441854257496219, | |
| "grad_norm": 0.73828125, | |
| "learning_rate": 4.0547784368776666e-06, | |
| "loss": 0.2986630439758301, | |
| "mean_token_accuracy": 0.8963529616594315, | |
| "num_tokens": 22360451.0, | |
| "step": 3620 | |
| }, | |
| { | |
| "entropy": 0.3371388889849186, | |
| "epoch": 0.6459649435003114, | |
| "grad_norm": 0.640625, | |
| "learning_rate": 4.0490124178684884e-06, | |
| "loss": 0.3359856367111206, | |
| "mean_token_accuracy": 0.8856187671422958, | |
| "num_tokens": 22416934.0, | |
| "step": 3630 | |
| }, | |
| { | |
| "entropy": 0.31443329676985743, | |
| "epoch": 0.6477444612510009, | |
| "grad_norm": 0.66796875, | |
| "learning_rate": 4.043232993046265e-06, | |
| "loss": 0.31395664215087893, | |
| "mean_token_accuracy": 0.8952710539102554, | |
| "num_tokens": 22477940.0, | |
| "step": 3640 | |
| }, | |
| { | |
| "entropy": 0.3266920395195484, | |
| "epoch": 0.6495239790016906, | |
| "grad_norm": 0.7734375, | |
| "learning_rate": 4.037440212428601e-06, | |
| "loss": 0.32647788524627686, | |
| "mean_token_accuracy": 0.8875341802835465, | |
| "num_tokens": 22535467.0, | |
| "step": 3650 | |
| }, | |
| { | |
| "entropy": 0.31038401648402214, | |
| "epoch": 0.6513034967523801, | |
| "grad_norm": 0.6875, | |
| "learning_rate": 4.031634126148685e-06, | |
| "loss": 0.30870542526245115, | |
| "mean_token_accuracy": 0.8950846582651139, | |
| "num_tokens": 22597159.0, | |
| "step": 3660 | |
| }, | |
| { | |
| "entropy": 0.34023172184824946, | |
| "epoch": 0.6530830145030697, | |
| "grad_norm": 0.6953125, | |
| "learning_rate": 4.02581478445486e-06, | |
| "loss": 0.3395744562149048, | |
| "mean_token_accuracy": 0.882710126042366, | |
| "num_tokens": 22654707.0, | |
| "step": 3670 | |
| }, | |
| { | |
| "entropy": 0.3239851281046867, | |
| "epoch": 0.6548625322537592, | |
| "grad_norm": 0.734375, | |
| "learning_rate": 4.019982237710188e-06, | |
| "loss": 0.3222635507583618, | |
| "mean_token_accuracy": 0.8885346949100494, | |
| "num_tokens": 22718419.0, | |
| "step": 3680 | |
| }, | |
| { | |
| "entropy": 0.3419245183467865, | |
| "epoch": 0.6566420500044488, | |
| "grad_norm": 0.65234375, | |
| "learning_rate": 4.014136536392012e-06, | |
| "loss": 0.33691384792327883, | |
| "mean_token_accuracy": 0.8838605612516404, | |
| "num_tokens": 22780931.0, | |
| "step": 3690 | |
| }, | |
| { | |
| "entropy": 0.32166584208607674, | |
| "epoch": 0.6584215677551384, | |
| "grad_norm": 0.7890625, | |
| "learning_rate": 4.0082777310915185e-06, | |
| "loss": 0.3230660200119019, | |
| "mean_token_accuracy": 0.8908147662878036, | |
| "num_tokens": 22842333.0, | |
| "step": 3700 | |
| }, | |
| { | |
| "entropy": 0.36541558504104615, | |
| "epoch": 0.6602010855058279, | |
| "grad_norm": 0.79296875, | |
| "learning_rate": 4.0024058725133055e-06, | |
| "loss": 0.3722693920135498, | |
| "mean_token_accuracy": 0.8736053824424743, | |
| "num_tokens": 22901858.0, | |
| "step": 3710 | |
| }, | |
| { | |
| "entropy": 0.30781840458512305, | |
| "epoch": 0.6619806032565175, | |
| "grad_norm": 0.640625, | |
| "learning_rate": 3.9965210114749355e-06, | |
| "loss": 0.30644729137420657, | |
| "mean_token_accuracy": 0.8949850857257843, | |
| "num_tokens": 22966668.0, | |
| "step": 3720 | |
| }, | |
| { | |
| "entropy": 0.3038733199238777, | |
| "epoch": 0.663760121007207, | |
| "grad_norm": 0.69921875, | |
| "learning_rate": 3.990623198906504e-06, | |
| "loss": 0.2997271537780762, | |
| "mean_token_accuracy": 0.8962586522102356, | |
| "num_tokens": 23033011.0, | |
| "step": 3730 | |
| }, | |
| { | |
| "entropy": 0.32676763385534285, | |
| "epoch": 0.6655396387578966, | |
| "grad_norm": 0.74609375, | |
| "learning_rate": 3.98471248585019e-06, | |
| "loss": 0.32193775177001954, | |
| "mean_token_accuracy": 0.8890910476446152, | |
| "num_tokens": 23093283.0, | |
| "step": 3740 | |
| }, | |
| { | |
| "entropy": 0.3167137444019318, | |
| "epoch": 0.6673191565085862, | |
| "grad_norm": 0.57421875, | |
| "learning_rate": 3.978788923459823e-06, | |
| "loss": 0.30832436084747317, | |
| "mean_token_accuracy": 0.8933327436447144, | |
| "num_tokens": 23155470.0, | |
| "step": 3750 | |
| }, | |
| { | |
| "entropy": 0.3385638728737831, | |
| "epoch": 0.6690986742592757, | |
| "grad_norm": 0.75390625, | |
| "learning_rate": 3.972852563000433e-06, | |
| "loss": 0.3368804931640625, | |
| "mean_token_accuracy": 0.8830694049596787, | |
| "num_tokens": 23217613.0, | |
| "step": 3760 | |
| }, | |
| { | |
| "entropy": 0.3112606145441532, | |
| "epoch": 0.6708781920099653, | |
| "grad_norm": 0.72265625, | |
| "learning_rate": 3.966903455847813e-06, | |
| "loss": 0.3110343456268311, | |
| "mean_token_accuracy": 0.8946603268384934, | |
| "num_tokens": 23277745.0, | |
| "step": 3770 | |
| }, | |
| { | |
| "entropy": 0.31338492035865784, | |
| "epoch": 0.6726577097606549, | |
| "grad_norm": 0.87890625, | |
| "learning_rate": 3.960941653488066e-06, | |
| "loss": 0.3175248622894287, | |
| "mean_token_accuracy": 0.8909559309482574, | |
| "num_tokens": 23339562.0, | |
| "step": 3780 | |
| }, | |
| { | |
| "entropy": 0.32489819154143335, | |
| "epoch": 0.6744372275113444, | |
| "grad_norm": 0.90625, | |
| "learning_rate": 3.954967207517171e-06, | |
| "loss": 0.32114262580871583, | |
| "mean_token_accuracy": 0.8926512032747269, | |
| "num_tokens": 23398984.0, | |
| "step": 3790 | |
| }, | |
| { | |
| "entropy": 0.3049692437052727, | |
| "epoch": 0.676216745262034, | |
| "grad_norm": 0.6484375, | |
| "learning_rate": 3.948980169640527e-06, | |
| "loss": 0.30400891304016114, | |
| "mean_token_accuracy": 0.8963852822780609, | |
| "num_tokens": 23464189.0, | |
| "step": 3800 | |
| }, | |
| { | |
| "entropy": 0.337682131677866, | |
| "epoch": 0.6779962630127235, | |
| "grad_norm": 0.75, | |
| "learning_rate": 3.942980591672508e-06, | |
| "loss": 0.3370924711227417, | |
| "mean_token_accuracy": 0.8845021963119507, | |
| "num_tokens": 23524844.0, | |
| "step": 3810 | |
| }, | |
| { | |
| "entropy": 0.3525546632707119, | |
| "epoch": 0.6797757807634132, | |
| "grad_norm": 0.75, | |
| "learning_rate": 3.936968525536018e-06, | |
| "loss": 0.34533052444458007, | |
| "mean_token_accuracy": 0.8810445040464401, | |
| "num_tokens": 23583864.0, | |
| "step": 3820 | |
| }, | |
| { | |
| "entropy": 0.30110328197479247, | |
| "epoch": 0.6815552985141027, | |
| "grad_norm": 0.67578125, | |
| "learning_rate": 3.930944023262036e-06, | |
| "loss": 0.30220918655395507, | |
| "mean_token_accuracy": 0.8982021152973175, | |
| "num_tokens": 23639815.0, | |
| "step": 3830 | |
| }, | |
| { | |
| "entropy": 0.2872416265308857, | |
| "epoch": 0.6833348162647922, | |
| "grad_norm": 0.62890625, | |
| "learning_rate": 3.92490713698917e-06, | |
| "loss": 0.28027145862579345, | |
| "mean_token_accuracy": 0.9027018517255783, | |
| "num_tokens": 23701469.0, | |
| "step": 3840 | |
| }, | |
| { | |
| "entropy": 0.2994592718780041, | |
| "epoch": 0.6851143340154818, | |
| "grad_norm": 0.625, | |
| "learning_rate": 3.918857918963205e-06, | |
| "loss": 0.29978432655334475, | |
| "mean_token_accuracy": 0.8961022108793258, | |
| "num_tokens": 23761184.0, | |
| "step": 3850 | |
| }, | |
| { | |
| "entropy": 0.2943257696926594, | |
| "epoch": 0.6868938517661713, | |
| "grad_norm": 0.6328125, | |
| "learning_rate": 3.91279642153665e-06, | |
| "loss": 0.2968342065811157, | |
| "mean_token_accuracy": 0.8990596324205399, | |
| "num_tokens": 23825810.0, | |
| "step": 3860 | |
| }, | |
| { | |
| "entropy": 0.3054063245654106, | |
| "epoch": 0.688673369516861, | |
| "grad_norm": 0.8125, | |
| "learning_rate": 3.906722697168283e-06, | |
| "loss": 0.3054715394973755, | |
| "mean_token_accuracy": 0.8957457602024078, | |
| "num_tokens": 23886899.0, | |
| "step": 3870 | |
| }, | |
| { | |
| "entropy": 0.3069253176450729, | |
| "epoch": 0.6904528872675505, | |
| "grad_norm": 0.7421875, | |
| "learning_rate": 3.900636798422704e-06, | |
| "loss": 0.30714099407196044, | |
| "mean_token_accuracy": 0.8971534937620163, | |
| "num_tokens": 23951450.0, | |
| "step": 3880 | |
| }, | |
| { | |
| "entropy": 0.34227139353752134, | |
| "epoch": 0.69223240501824, | |
| "grad_norm": 0.609375, | |
| "learning_rate": 3.894538777969868e-06, | |
| "loss": 0.3442659854888916, | |
| "mean_token_accuracy": 0.8816527515649796, | |
| "num_tokens": 24014942.0, | |
| "step": 3890 | |
| }, | |
| { | |
| "entropy": 0.3324007302522659, | |
| "epoch": 0.6940119227689296, | |
| "grad_norm": 0.67578125, | |
| "learning_rate": 3.888428688584643e-06, | |
| "loss": 0.33266706466674806, | |
| "mean_token_accuracy": 0.885134294629097, | |
| "num_tokens": 24079036.0, | |
| "step": 3900 | |
| }, | |
| { | |
| "entropy": 0.3650533989071846, | |
| "epoch": 0.6957914405196192, | |
| "grad_norm": 0.80078125, | |
| "learning_rate": 3.882306583146346e-06, | |
| "loss": 0.3684395790100098, | |
| "mean_token_accuracy": 0.8742841720581055, | |
| "num_tokens": 24140680.0, | |
| "step": 3910 | |
| }, | |
| { | |
| "entropy": 0.3513684146106243, | |
| "epoch": 0.6975709582703088, | |
| "grad_norm": 0.71875, | |
| "learning_rate": 3.876172514638281e-06, | |
| "loss": 0.3528375387191772, | |
| "mean_token_accuracy": 0.8802893698215485, | |
| "num_tokens": 24203706.0, | |
| "step": 3920 | |
| }, | |
| { | |
| "entropy": 0.3140840381383896, | |
| "epoch": 0.6993504760209983, | |
| "grad_norm": 0.62109375, | |
| "learning_rate": 3.87002653614729e-06, | |
| "loss": 0.3071706295013428, | |
| "mean_token_accuracy": 0.8948991298675537, | |
| "num_tokens": 24266861.0, | |
| "step": 3930 | |
| }, | |
| { | |
| "entropy": 0.3299639403820038, | |
| "epoch": 0.7011299937716878, | |
| "grad_norm": 0.671875, | |
| "learning_rate": 3.863868700863288e-06, | |
| "loss": 0.32673211097717286, | |
| "mean_token_accuracy": 0.8864569872617721, | |
| "num_tokens": 24327990.0, | |
| "step": 3940 | |
| }, | |
| { | |
| "entropy": 0.3226359970867634, | |
| "epoch": 0.7029095115223775, | |
| "grad_norm": 0.81640625, | |
| "learning_rate": 3.857699062078804e-06, | |
| "loss": 0.3210404396057129, | |
| "mean_token_accuracy": 0.8895397961139679, | |
| "num_tokens": 24388902.0, | |
| "step": 3950 | |
| }, | |
| { | |
| "entropy": 0.3161041624844074, | |
| "epoch": 0.704689029273067, | |
| "grad_norm": 0.65625, | |
| "learning_rate": 3.851517673188519e-06, | |
| "loss": 0.31977477073669436, | |
| "mean_token_accuracy": 0.8913398414850235, | |
| "num_tokens": 24446067.0, | |
| "step": 3960 | |
| }, | |
| { | |
| "entropy": 0.34715538620948794, | |
| "epoch": 0.7064685470237566, | |
| "grad_norm": 0.9453125, | |
| "learning_rate": 3.8453245876888044e-06, | |
| "loss": 0.3476161003112793, | |
| "mean_token_accuracy": 0.8798853307962418, | |
| "num_tokens": 24505474.0, | |
| "step": 3970 | |
| }, | |
| { | |
| "entropy": 0.3011615663766861, | |
| "epoch": 0.7082480647744461, | |
| "grad_norm": 0.6484375, | |
| "learning_rate": 3.839119859177258e-06, | |
| "loss": 0.30338754653930666, | |
| "mean_token_accuracy": 0.8970853149890899, | |
| "num_tokens": 24568893.0, | |
| "step": 3980 | |
| }, | |
| { | |
| "entropy": 0.33798819556832316, | |
| "epoch": 0.7100275825251356, | |
| "grad_norm": 0.7578125, | |
| "learning_rate": 3.832903541352244e-06, | |
| "loss": 0.33394012451171873, | |
| "mean_token_accuracy": 0.8847744941711426, | |
| "num_tokens": 24632259.0, | |
| "step": 3990 | |
| }, | |
| { | |
| "entropy": 0.31967905536293983, | |
| "epoch": 0.7118071002758253, | |
| "grad_norm": 0.8984375, | |
| "learning_rate": 3.8266756880124235e-06, | |
| "loss": 0.3112222671508789, | |
| "mean_token_accuracy": 0.8920404791831971, | |
| "num_tokens": 24689863.0, | |
| "step": 4000 | |
| }, | |
| { | |
| "entropy": 0.3319928146898746, | |
| "epoch": 0.7135866180265148, | |
| "grad_norm": 0.6640625, | |
| "learning_rate": 3.82043635305629e-06, | |
| "loss": 0.3272392749786377, | |
| "mean_token_accuracy": 0.8864372938871383, | |
| "num_tokens": 24752713.0, | |
| "step": 4010 | |
| }, | |
| { | |
| "entropy": 0.3551741100847721, | |
| "epoch": 0.7153661357772044, | |
| "grad_norm": 0.7734375, | |
| "learning_rate": 3.814185590481707e-06, | |
| "loss": 0.35248637199401855, | |
| "mean_token_accuracy": 0.8810664594173432, | |
| "num_tokens": 24815372.0, | |
| "step": 4020 | |
| }, | |
| { | |
| "entropy": 0.30468909814953804, | |
| "epoch": 0.717145653527894, | |
| "grad_norm": 0.7734375, | |
| "learning_rate": 3.8079234543854336e-06, | |
| "loss": 0.30545387268066404, | |
| "mean_token_accuracy": 0.8962846666574478, | |
| "num_tokens": 24877287.0, | |
| "step": 4030 | |
| }, | |
| { | |
| "entropy": 0.3263218976557255, | |
| "epoch": 0.7189251712785835, | |
| "grad_norm": 0.73046875, | |
| "learning_rate": 3.801649998962663e-06, | |
| "loss": 0.31722159385681153, | |
| "mean_token_accuracy": 0.8882788389921188, | |
| "num_tokens": 24936354.0, | |
| "step": 4040 | |
| }, | |
| { | |
| "entropy": 0.3239417590200901, | |
| "epoch": 0.7207046890292731, | |
| "grad_norm": 0.7734375, | |
| "learning_rate": 3.7953652785065487e-06, | |
| "loss": 0.3198636770248413, | |
| "mean_token_accuracy": 0.8894559621810914, | |
| "num_tokens": 24996114.0, | |
| "step": 4050 | |
| }, | |
| { | |
| "entropy": 0.3504368454217911, | |
| "epoch": 0.7224842067799626, | |
| "grad_norm": 0.640625, | |
| "learning_rate": 3.789069347407739e-06, | |
| "loss": 0.35796384811401366, | |
| "mean_token_accuracy": 0.8786458790302276, | |
| "num_tokens": 25059291.0, | |
| "step": 4060 | |
| }, | |
| { | |
| "entropy": 0.35010237619280815, | |
| "epoch": 0.7242637245306522, | |
| "grad_norm": 0.80078125, | |
| "learning_rate": 3.7827622601539016e-06, | |
| "loss": 0.34798645973205566, | |
| "mean_token_accuracy": 0.8807581603527069, | |
| "num_tokens": 25119238.0, | |
| "step": 4070 | |
| }, | |
| { | |
| "entropy": 0.3162467695772648, | |
| "epoch": 0.7260432422813418, | |
| "grad_norm": 0.84765625, | |
| "learning_rate": 3.7764440713292555e-06, | |
| "loss": 0.31048390865325926, | |
| "mean_token_accuracy": 0.8938262403011322, | |
| "num_tokens": 25180932.0, | |
| "step": 4080 | |
| }, | |
| { | |
| "entropy": 0.3140152879059315, | |
| "epoch": 0.7278227600320313, | |
| "grad_norm": 0.55078125, | |
| "learning_rate": 3.770114835614097e-06, | |
| "loss": 0.3161914587020874, | |
| "mean_token_accuracy": 0.8915384441614151, | |
| "num_tokens": 25240081.0, | |
| "step": 4090 | |
| }, | |
| { | |
| "entropy": 0.31884549781680105, | |
| "epoch": 0.7296022777827209, | |
| "grad_norm": 0.6171875, | |
| "learning_rate": 3.7637746077843273e-06, | |
| "loss": 0.31565608978271487, | |
| "mean_token_accuracy": 0.8926081418991089, | |
| "num_tokens": 25300196.0, | |
| "step": 4100 | |
| }, | |
| { | |
| "entropy": 0.33241346701979635, | |
| "epoch": 0.7313817955334104, | |
| "grad_norm": 0.63671875, | |
| "learning_rate": 3.7574234427109774e-06, | |
| "loss": 0.333846378326416, | |
| "mean_token_accuracy": 0.8856494903564454, | |
| "num_tokens": 25360762.0, | |
| "step": 4110 | |
| }, | |
| { | |
| "entropy": 0.3315878137946129, | |
| "epoch": 0.7331613132841001, | |
| "grad_norm": 0.734375, | |
| "learning_rate": 3.7510613953597343e-06, | |
| "loss": 0.32794604301452634, | |
| "mean_token_accuracy": 0.8877955853939057, | |
| "num_tokens": 25419740.0, | |
| "step": 4120 | |
| }, | |
| { | |
| "entropy": 0.317806626111269, | |
| "epoch": 0.7349408310347896, | |
| "grad_norm": 0.6328125, | |
| "learning_rate": 3.744688520790465e-06, | |
| "loss": 0.3192422389984131, | |
| "mean_token_accuracy": 0.8906554162502289, | |
| "num_tokens": 25483111.0, | |
| "step": 4130 | |
| }, | |
| { | |
| "entropy": 0.3256954029202461, | |
| "epoch": 0.7367203487854791, | |
| "grad_norm": 0.66015625, | |
| "learning_rate": 3.7383048741567383e-06, | |
| "loss": 0.32516562938690186, | |
| "mean_token_accuracy": 0.8903594017028809, | |
| "num_tokens": 25545176.0, | |
| "step": 4140 | |
| }, | |
| { | |
| "entropy": 0.31130014136433604, | |
| "epoch": 0.7384998665361687, | |
| "grad_norm": 0.59765625, | |
| "learning_rate": 3.731910510705353e-06, | |
| "loss": 0.3101987361907959, | |
| "mean_token_accuracy": 0.8940740615129471, | |
| "num_tokens": 25610028.0, | |
| "step": 4150 | |
| }, | |
| { | |
| "entropy": 0.32270723208785057, | |
| "epoch": 0.7402793842868582, | |
| "grad_norm": 0.67578125, | |
| "learning_rate": 3.725505485775851e-06, | |
| "loss": 0.32242374420166015, | |
| "mean_token_accuracy": 0.8896411061286926, | |
| "num_tokens": 25675325.0, | |
| "step": 4160 | |
| }, | |
| { | |
| "entropy": 0.29772440120577814, | |
| "epoch": 0.7420589020375479, | |
| "grad_norm": 0.78125, | |
| "learning_rate": 3.7190898548000463e-06, | |
| "loss": 0.2905465364456177, | |
| "mean_token_accuracy": 0.8987115979194641, | |
| "num_tokens": 25733221.0, | |
| "step": 4170 | |
| }, | |
| { | |
| "entropy": 0.324229471385479, | |
| "epoch": 0.7438384197882374, | |
| "grad_norm": 0.76171875, | |
| "learning_rate": 3.7126636733015402e-06, | |
| "loss": 0.31509127616882326, | |
| "mean_token_accuracy": 0.890700826048851, | |
| "num_tokens": 25791510.0, | |
| "step": 4180 | |
| }, | |
| { | |
| "entropy": 0.31010851040482523, | |
| "epoch": 0.7456179375389269, | |
| "grad_norm": 0.76953125, | |
| "learning_rate": 3.706226996895245e-06, | |
| "loss": 0.3099569797515869, | |
| "mean_token_accuracy": 0.8941543817520141, | |
| "num_tokens": 25849466.0, | |
| "step": 4190 | |
| }, | |
| { | |
| "entropy": 0.34313676729798315, | |
| "epoch": 0.7473974552896165, | |
| "grad_norm": 0.6640625, | |
| "learning_rate": 3.6997798812868984e-06, | |
| "loss": 0.34426915645599365, | |
| "mean_token_accuracy": 0.8824651181697846, | |
| "num_tokens": 25910712.0, | |
| "step": 4200 | |
| }, | |
| { | |
| "entropy": 0.32774877846240996, | |
| "epoch": 0.7491769730403061, | |
| "grad_norm": 0.734375, | |
| "learning_rate": 3.6933223822725845e-06, | |
| "loss": 0.32100906372070315, | |
| "mean_token_accuracy": 0.8894315391778946, | |
| "num_tokens": 25968550.0, | |
| "step": 4210 | |
| }, | |
| { | |
| "entropy": 0.3336882501840591, | |
| "epoch": 0.7509564907909957, | |
| "grad_norm": 0.66015625, | |
| "learning_rate": 3.686854555738249e-06, | |
| "loss": 0.33437650203704833, | |
| "mean_token_accuracy": 0.8851233959197998, | |
| "num_tokens": 26033600.0, | |
| "step": 4220 | |
| }, | |
| { | |
| "entropy": 0.2877236850559711, | |
| "epoch": 0.7527360085416852, | |
| "grad_norm": 0.6796875, | |
| "learning_rate": 3.680376457659217e-06, | |
| "loss": 0.2838925361633301, | |
| "mean_token_accuracy": 0.9029829859733581, | |
| "num_tokens": 26095581.0, | |
| "step": 4230 | |
| }, | |
| { | |
| "entropy": 0.35029785335063934, | |
| "epoch": 0.7545155262923747, | |
| "grad_norm": 0.703125, | |
| "learning_rate": 3.6738881440997075e-06, | |
| "loss": 0.35119309425354006, | |
| "mean_token_accuracy": 0.8788535237312317, | |
| "num_tokens": 26160217.0, | |
| "step": 4240 | |
| }, | |
| { | |
| "entropy": 0.29809832498431205, | |
| "epoch": 0.7562950440430644, | |
| "grad_norm": 0.62890625, | |
| "learning_rate": 3.667389671212349e-06, | |
| "loss": 0.29252660274505615, | |
| "mean_token_accuracy": 0.8990640878677368, | |
| "num_tokens": 26221654.0, | |
| "step": 4250 | |
| }, | |
| { | |
| "entropy": 0.31378084495663644, | |
| "epoch": 0.7580745617937539, | |
| "grad_norm": 0.67578125, | |
| "learning_rate": 3.660881095237693e-06, | |
| "loss": 0.31973769664764407, | |
| "mean_token_accuracy": 0.8927627056837082, | |
| "num_tokens": 26284680.0, | |
| "step": 4260 | |
| }, | |
| { | |
| "entropy": 0.321271962672472, | |
| "epoch": 0.7598540795444435, | |
| "grad_norm": 0.6953125, | |
| "learning_rate": 3.654362472503727e-06, | |
| "loss": 0.31966218948364256, | |
| "mean_token_accuracy": 0.8886021912097931, | |
| "num_tokens": 26345881.0, | |
| "step": 4270 | |
| }, | |
| { | |
| "entropy": 0.33760534003376963, | |
| "epoch": 0.761633597295133, | |
| "grad_norm": 0.69140625, | |
| "learning_rate": 3.647833859425388e-06, | |
| "loss": 0.3323702096939087, | |
| "mean_token_accuracy": 0.8835799127817154, | |
| "num_tokens": 26409130.0, | |
| "step": 4280 | |
| }, | |
| { | |
| "entropy": 0.3086083874106407, | |
| "epoch": 0.7634131150458225, | |
| "grad_norm": 0.64453125, | |
| "learning_rate": 3.6412953125040732e-06, | |
| "loss": 0.3090954303741455, | |
| "mean_token_accuracy": 0.8938497513532638, | |
| "num_tokens": 26470803.0, | |
| "step": 4290 | |
| }, | |
| { | |
| "entropy": 0.32356909438967707, | |
| "epoch": 0.7651926327965122, | |
| "grad_norm": 0.6640625, | |
| "learning_rate": 3.6347468883271537e-06, | |
| "loss": 0.32223284244537354, | |
| "mean_token_accuracy": 0.889476266503334, | |
| "num_tokens": 26529276.0, | |
| "step": 4300 | |
| }, | |
| { | |
| "entropy": 0.3197473108768463, | |
| "epoch": 0.7669721505472017, | |
| "grad_norm": 0.703125, | |
| "learning_rate": 3.628188643567478e-06, | |
| "loss": 0.3182904958724976, | |
| "mean_token_accuracy": 0.8886691510677338, | |
| "num_tokens": 26596912.0, | |
| "step": 4310 | |
| }, | |
| { | |
| "entropy": 0.3812053255736828, | |
| "epoch": 0.7687516682978913, | |
| "grad_norm": 0.8671875, | |
| "learning_rate": 3.62162063498289e-06, | |
| "loss": 0.38285183906555176, | |
| "mean_token_accuracy": 0.8679445266723633, | |
| "num_tokens": 26654254.0, | |
| "step": 4320 | |
| }, | |
| { | |
| "entropy": 0.31078105270862577, | |
| "epoch": 0.7705311860485808, | |
| "grad_norm": 0.7734375, | |
| "learning_rate": 3.615042919415734e-06, | |
| "loss": 0.3132502794265747, | |
| "mean_token_accuracy": 0.8936162561178207, | |
| "num_tokens": 26716103.0, | |
| "step": 4330 | |
| }, | |
| { | |
| "entropy": 0.3245044894516468, | |
| "epoch": 0.7723107037992704, | |
| "grad_norm": 0.7890625, | |
| "learning_rate": 3.608455553792359e-06, | |
| "loss": 0.3191309690475464, | |
| "mean_token_accuracy": 0.8891146034002304, | |
| "num_tokens": 26779123.0, | |
| "step": 4340 | |
| }, | |
| { | |
| "entropy": 0.3174907624721527, | |
| "epoch": 0.77409022154996, | |
| "grad_norm": 0.68359375, | |
| "learning_rate": 3.601858595122633e-06, | |
| "loss": 0.3181204319000244, | |
| "mean_token_accuracy": 0.8935631543397904, | |
| "num_tokens": 26839576.0, | |
| "step": 4350 | |
| }, | |
| { | |
| "entropy": 0.31885271072387694, | |
| "epoch": 0.7758697393006495, | |
| "grad_norm": 0.765625, | |
| "learning_rate": 3.5952521004994458e-06, | |
| "loss": 0.32184107303619386, | |
| "mean_token_accuracy": 0.8902066498994827, | |
| "num_tokens": 26895201.0, | |
| "step": 4360 | |
| }, | |
| { | |
| "entropy": 0.3231876604259014, | |
| "epoch": 0.7776492570513391, | |
| "grad_norm": 0.78515625, | |
| "learning_rate": 3.5886361270982144e-06, | |
| "loss": 0.32304935455322265, | |
| "mean_token_accuracy": 0.890093806385994, | |
| "num_tokens": 26953882.0, | |
| "step": 4370 | |
| }, | |
| { | |
| "entropy": 0.3525890067219734, | |
| "epoch": 0.7794287748020287, | |
| "grad_norm": 0.75390625, | |
| "learning_rate": 3.58201073217639e-06, | |
| "loss": 0.3533541917800903, | |
| "mean_token_accuracy": 0.878669023513794, | |
| "num_tokens": 27017056.0, | |
| "step": 4380 | |
| }, | |
| { | |
| "entropy": 0.3424542315304279, | |
| "epoch": 0.7812082925527182, | |
| "grad_norm": 0.68359375, | |
| "learning_rate": 3.5753759730729622e-06, | |
| "loss": 0.3435798406600952, | |
| "mean_token_accuracy": 0.8808376550674438, | |
| "num_tokens": 27082739.0, | |
| "step": 4390 | |
| }, | |
| { | |
| "entropy": 0.32165568247437476, | |
| "epoch": 0.7829878103034078, | |
| "grad_norm": 0.74609375, | |
| "learning_rate": 3.5687319072079598e-06, | |
| "loss": 0.32462856769561765, | |
| "mean_token_accuracy": 0.8899737745523453, | |
| "num_tokens": 27146140.0, | |
| "step": 4400 | |
| }, | |
| { | |
| "entropy": 0.3195482023060322, | |
| "epoch": 0.7847673280540973, | |
| "grad_norm": 0.8515625, | |
| "learning_rate": 3.562078592081959e-06, | |
| "loss": 0.316646146774292, | |
| "mean_token_accuracy": 0.889157748222351, | |
| "num_tokens": 27209934.0, | |
| "step": 4410 | |
| }, | |
| { | |
| "entropy": 0.3287908561527729, | |
| "epoch": 0.786546845804787, | |
| "grad_norm": 0.640625, | |
| "learning_rate": 3.5554160852755814e-06, | |
| "loss": 0.31769742965698244, | |
| "mean_token_accuracy": 0.8902658313512802, | |
| "num_tokens": 27272543.0, | |
| "step": 4420 | |
| }, | |
| { | |
| "entropy": 0.3061469428241253, | |
| "epoch": 0.7883263635554765, | |
| "grad_norm": 0.66796875, | |
| "learning_rate": 3.5487444444489976e-06, | |
| "loss": 0.3056464433670044, | |
| "mean_token_accuracy": 0.8966052442789078, | |
| "num_tokens": 27332924.0, | |
| "step": 4430 | |
| }, | |
| { | |
| "entropy": 0.3140795312821865, | |
| "epoch": 0.790105881306166, | |
| "grad_norm": 0.625, | |
| "learning_rate": 3.5420637273414294e-06, | |
| "loss": 0.31083250045776367, | |
| "mean_token_accuracy": 0.8935318052768707, | |
| "num_tokens": 27398649.0, | |
| "step": 4440 | |
| }, | |
| { | |
| "entropy": 0.320087730884552, | |
| "epoch": 0.7918853990568556, | |
| "grad_norm": 0.62109375, | |
| "learning_rate": 3.5353739917706465e-06, | |
| "loss": 0.31650235652923586, | |
| "mean_token_accuracy": 0.8917651563882828, | |
| "num_tokens": 27463481.0, | |
| "step": 4450 | |
| }, | |
| { | |
| "entropy": 0.30691038966178896, | |
| "epoch": 0.7936649168075451, | |
| "grad_norm": 0.68359375, | |
| "learning_rate": 3.528675295632468e-06, | |
| "loss": 0.3032836437225342, | |
| "mean_token_accuracy": 0.8962341576814652, | |
| "num_tokens": 27525465.0, | |
| "step": 4460 | |
| }, | |
| { | |
| "entropy": 0.292752119153738, | |
| "epoch": 0.7954444345582348, | |
| "grad_norm": 0.6953125, | |
| "learning_rate": 3.521967696900265e-06, | |
| "loss": 0.2833605527877808, | |
| "mean_token_accuracy": 0.9019985139369965, | |
| "num_tokens": 27583912.0, | |
| "step": 4470 | |
| }, | |
| { | |
| "entropy": 0.31720383539795877, | |
| "epoch": 0.7972239523089243, | |
| "grad_norm": 0.671875, | |
| "learning_rate": 3.515251253624452e-06, | |
| "loss": 0.3143874406814575, | |
| "mean_token_accuracy": 0.8920644462108612, | |
| "num_tokens": 27643989.0, | |
| "step": 4480 | |
| }, | |
| { | |
| "entropy": 0.3354278527200222, | |
| "epoch": 0.7990034700596138, | |
| "grad_norm": 0.88671875, | |
| "learning_rate": 3.508526023931988e-06, | |
| "loss": 0.33093791007995604, | |
| "mean_token_accuracy": 0.8850998103618621, | |
| "num_tokens": 27707096.0, | |
| "step": 4490 | |
| }, | |
| { | |
| "entropy": 0.32125698402523994, | |
| "epoch": 0.8007829878103034, | |
| "grad_norm": 0.7734375, | |
| "learning_rate": 3.501792066025876e-06, | |
| "loss": 0.3226289749145508, | |
| "mean_token_accuracy": 0.8903116554021835, | |
| "num_tokens": 27770400.0, | |
| "step": 4500 | |
| }, | |
| { | |
| "entropy": 0.3024943955242634, | |
| "epoch": 0.802562505560993, | |
| "grad_norm": 0.7421875, | |
| "learning_rate": 3.495049438184653e-06, | |
| "loss": 0.2999032735824585, | |
| "mean_token_accuracy": 0.8976153939962387, | |
| "num_tokens": 27833252.0, | |
| "step": 4510 | |
| }, | |
| { | |
| "entropy": 0.32913830801844596, | |
| "epoch": 0.8043420233116826, | |
| "grad_norm": 0.7578125, | |
| "learning_rate": 3.4882981987618936e-06, | |
| "loss": 0.32823073863983154, | |
| "mean_token_accuracy": 0.885203304886818, | |
| "num_tokens": 27893214.0, | |
| "step": 4520 | |
| }, | |
| { | |
| "entropy": 0.2997400566935539, | |
| "epoch": 0.8061215410623721, | |
| "grad_norm": 0.66015625, | |
| "learning_rate": 3.4815384061856982e-06, | |
| "loss": 0.29881627559661866, | |
| "mean_token_accuracy": 0.8972623527050019, | |
| "num_tokens": 27953564.0, | |
| "step": 4530 | |
| }, | |
| { | |
| "entropy": 0.3361620880663395, | |
| "epoch": 0.8079010588130616, | |
| "grad_norm": 0.625, | |
| "learning_rate": 3.4747701189581882e-06, | |
| "loss": 0.3341663360595703, | |
| "mean_token_accuracy": 0.8846073895692825, | |
| "num_tokens": 28017405.0, | |
| "step": 4540 | |
| }, | |
| { | |
| "entropy": 0.3635567151010036, | |
| "epoch": 0.8096805765637513, | |
| "grad_norm": 0.83203125, | |
| "learning_rate": 3.467993395655006e-06, | |
| "loss": 0.36700680255889895, | |
| "mean_token_accuracy": 0.8747879892587662, | |
| "num_tokens": 28077105.0, | |
| "step": 4550 | |
| }, | |
| { | |
| "entropy": 0.31662830635905265, | |
| "epoch": 0.8114600943144408, | |
| "grad_norm": 0.71484375, | |
| "learning_rate": 3.4612082949247984e-06, | |
| "loss": 0.31666059494018556, | |
| "mean_token_accuracy": 0.8936580032110214, | |
| "num_tokens": 28135946.0, | |
| "step": 4560 | |
| }, | |
| { | |
| "entropy": 0.3208633802831173, | |
| "epoch": 0.8132396120651304, | |
| "grad_norm": 0.671875, | |
| "learning_rate": 3.4544148754887174e-06, | |
| "loss": 0.3186974048614502, | |
| "mean_token_accuracy": 0.8887600839138031, | |
| "num_tokens": 28199470.0, | |
| "step": 4570 | |
| }, | |
| { | |
| "entropy": 0.3209241934120655, | |
| "epoch": 0.8150191298158199, | |
| "grad_norm": 0.71484375, | |
| "learning_rate": 3.4476131961399072e-06, | |
| "loss": 0.31809191703796386, | |
| "mean_token_accuracy": 0.8910164386034012, | |
| "num_tokens": 28258317.0, | |
| "step": 4580 | |
| }, | |
| { | |
| "entropy": 0.273921088129282, | |
| "epoch": 0.8167986475665094, | |
| "grad_norm": 0.58203125, | |
| "learning_rate": 3.440803315742997e-06, | |
| "loss": 0.27063875198364257, | |
| "mean_token_accuracy": 0.9077308356761933, | |
| "num_tokens": 28317331.0, | |
| "step": 4590 | |
| }, | |
| { | |
| "entropy": 0.3269231304526329, | |
| "epoch": 0.8185781653171991, | |
| "grad_norm": 0.703125, | |
| "learning_rate": 3.4339852932335913e-06, | |
| "loss": 0.32116925716400146, | |
| "mean_token_accuracy": 0.8885051965713501, | |
| "num_tokens": 28377310.0, | |
| "step": 4600 | |
| }, | |
| { | |
| "entropy": 0.34382307529449463, | |
| "epoch": 0.8203576830678886, | |
| "grad_norm": 0.6953125, | |
| "learning_rate": 3.42715918761776e-06, | |
| "loss": 0.33684279918670657, | |
| "mean_token_accuracy": 0.8819504231214523, | |
| "num_tokens": 28439237.0, | |
| "step": 4610 | |
| }, | |
| { | |
| "entropy": 0.34571648091077806, | |
| "epoch": 0.8221372008185782, | |
| "grad_norm": 0.67578125, | |
| "learning_rate": 3.4203250579715293e-06, | |
| "loss": 0.34270668029785156, | |
| "mean_token_accuracy": 0.8804600208997726, | |
| "num_tokens": 28503776.0, | |
| "step": 4620 | |
| }, | |
| { | |
| "entropy": 0.3633879840373993, | |
| "epoch": 0.8239167185692677, | |
| "grad_norm": 0.72265625, | |
| "learning_rate": 3.413482963440365e-06, | |
| "loss": 0.36074531078338623, | |
| "mean_token_accuracy": 0.8749166995286941, | |
| "num_tokens": 28566682.0, | |
| "step": 4630 | |
| }, | |
| { | |
| "entropy": 0.33480159640312196, | |
| "epoch": 0.8256962363199573, | |
| "grad_norm": 0.6640625, | |
| "learning_rate": 3.4066329632386676e-06, | |
| "loss": 0.3376650810241699, | |
| "mean_token_accuracy": 0.8848024159669876, | |
| "num_tokens": 28627306.0, | |
| "step": 4640 | |
| }, | |
| { | |
| "entropy": 0.33422539532184603, | |
| "epoch": 0.8274757540706469, | |
| "grad_norm": 0.71484375, | |
| "learning_rate": 3.3997751166492554e-06, | |
| "loss": 0.3305016756057739, | |
| "mean_token_accuracy": 0.8843177795410156, | |
| "num_tokens": 28688008.0, | |
| "step": 4650 | |
| }, | |
| { | |
| "entropy": 0.3220311067998409, | |
| "epoch": 0.8292552718213364, | |
| "grad_norm": 0.640625, | |
| "learning_rate": 3.3929094830228525e-06, | |
| "loss": 0.3276401996612549, | |
| "mean_token_accuracy": 0.8901763200759888, | |
| "num_tokens": 28749007.0, | |
| "step": 4660 | |
| }, | |
| { | |
| "entropy": 0.3371203623712063, | |
| "epoch": 0.831034789572026, | |
| "grad_norm": 0.67578125, | |
| "learning_rate": 3.3860361217775766e-06, | |
| "loss": 0.33961422443389894, | |
| "mean_token_accuracy": 0.8825581848621369, | |
| "num_tokens": 28813793.0, | |
| "step": 4670 | |
| }, | |
| { | |
| "entropy": 0.3083579756319523, | |
| "epoch": 0.8328143073227156, | |
| "grad_norm": 0.640625, | |
| "learning_rate": 3.379155092398423e-06, | |
| "loss": 0.3052903890609741, | |
| "mean_token_accuracy": 0.896553099155426, | |
| "num_tokens": 28877353.0, | |
| "step": 4680 | |
| }, | |
| { | |
| "entropy": 0.30851706936955453, | |
| "epoch": 0.8345938250734051, | |
| "grad_norm": 0.80078125, | |
| "learning_rate": 3.3722664544367484e-06, | |
| "loss": 0.3021129369735718, | |
| "mean_token_accuracy": 0.8970968216657639, | |
| "num_tokens": 28938324.0, | |
| "step": 4690 | |
| }, | |
| { | |
| "entropy": 0.3352122865617275, | |
| "epoch": 0.8363733428240947, | |
| "grad_norm": 0.6484375, | |
| "learning_rate": 3.36537026750976e-06, | |
| "loss": 0.3348966121673584, | |
| "mean_token_accuracy": 0.88336381316185, | |
| "num_tokens": 29004097.0, | |
| "step": 4700 | |
| }, | |
| { | |
| "entropy": 0.3120702989399433, | |
| "epoch": 0.8381528605747842, | |
| "grad_norm": 0.67578125, | |
| "learning_rate": 3.358466591299996e-06, | |
| "loss": 0.30483720302581785, | |
| "mean_token_accuracy": 0.8936588197946549, | |
| "num_tokens": 29065784.0, | |
| "step": 4710 | |
| }, | |
| { | |
| "entropy": 0.3325718879699707, | |
| "epoch": 0.8399323783254738, | |
| "grad_norm": 0.79296875, | |
| "learning_rate": 3.3515554855548096e-06, | |
| "loss": 0.32906949520111084, | |
| "mean_token_accuracy": 0.8850819796323777, | |
| "num_tokens": 29127736.0, | |
| "step": 4720 | |
| }, | |
| { | |
| "entropy": 0.3285450778901577, | |
| "epoch": 0.8417118960761634, | |
| "grad_norm": 0.671875, | |
| "learning_rate": 3.3446370100858522e-06, | |
| "loss": 0.3254601716995239, | |
| "mean_token_accuracy": 0.8865422040224076, | |
| "num_tokens": 29190177.0, | |
| "step": 4730 | |
| }, | |
| { | |
| "entropy": 0.28994656801223756, | |
| "epoch": 0.8434914138268529, | |
| "grad_norm": 0.7421875, | |
| "learning_rate": 3.3377112247685573e-06, | |
| "loss": 0.28107192516326907, | |
| "mean_token_accuracy": 0.9041391044855118, | |
| "num_tokens": 29250031.0, | |
| "step": 4740 | |
| }, | |
| { | |
| "entropy": 0.3076285161077976, | |
| "epoch": 0.8452709315775425, | |
| "grad_norm": 0.66015625, | |
| "learning_rate": 3.330778189541619e-06, | |
| "loss": 0.30392696857452395, | |
| "mean_token_accuracy": 0.8945790320634842, | |
| "num_tokens": 29309661.0, | |
| "step": 4750 | |
| }, | |
| { | |
| "entropy": 0.33427241295576093, | |
| "epoch": 0.847050449328232, | |
| "grad_norm": 0.83203125, | |
| "learning_rate": 3.3238379644064783e-06, | |
| "loss": 0.33776178359985354, | |
| "mean_token_accuracy": 0.8858144342899322, | |
| "num_tokens": 29371802.0, | |
| "step": 4760 | |
| }, | |
| { | |
| "entropy": 0.3116602420806885, | |
| "epoch": 0.8488299670789217, | |
| "grad_norm": 0.625, | |
| "learning_rate": 3.3168906094267967e-06, | |
| "loss": 0.3052891492843628, | |
| "mean_token_accuracy": 0.8943425059318543, | |
| "num_tokens": 29434948.0, | |
| "step": 4770 | |
| }, | |
| { | |
| "entropy": 0.32457049414515493, | |
| "epoch": 0.8506094848296112, | |
| "grad_norm": 0.7421875, | |
| "learning_rate": 3.3099361847279437e-06, | |
| "loss": 0.33092737197875977, | |
| "mean_token_accuracy": 0.8910484194755555, | |
| "num_tokens": 29494725.0, | |
| "step": 4780 | |
| }, | |
| { | |
| "entropy": 0.302114712446928, | |
| "epoch": 0.8523890025803007, | |
| "grad_norm": 0.828125, | |
| "learning_rate": 3.302974750496471e-06, | |
| "loss": 0.30364136695861815, | |
| "mean_token_accuracy": 0.8976742386817932, | |
| "num_tokens": 29554456.0, | |
| "step": 4790 | |
| }, | |
| { | |
| "entropy": 0.3033088490366936, | |
| "epoch": 0.8541685203309903, | |
| "grad_norm": 0.79296875, | |
| "learning_rate": 3.2960063669795956e-06, | |
| "loss": 0.29857096672058103, | |
| "mean_token_accuracy": 0.898243761062622, | |
| "num_tokens": 29614042.0, | |
| "step": 4800 | |
| }, | |
| { | |
| "entropy": 0.3380900904536247, | |
| "epoch": 0.8559480380816799, | |
| "grad_norm": 0.85546875, | |
| "learning_rate": 3.289031094484675e-06, | |
| "loss": 0.3389381170272827, | |
| "mean_token_accuracy": 0.8845224976539612, | |
| "num_tokens": 29677174.0, | |
| "step": 4810 | |
| }, | |
| { | |
| "entropy": 0.3290810391306877, | |
| "epoch": 0.8577275558323695, | |
| "grad_norm": 0.81640625, | |
| "learning_rate": 3.2820489933786875e-06, | |
| "loss": 0.33188159465789796, | |
| "mean_token_accuracy": 0.8866541266441346, | |
| "num_tokens": 29736691.0, | |
| "step": 4820 | |
| }, | |
| { | |
| "entropy": 0.2920307211577892, | |
| "epoch": 0.859507073583059, | |
| "grad_norm": 0.78515625, | |
| "learning_rate": 3.275060124087709e-06, | |
| "loss": 0.29009830951690674, | |
| "mean_token_accuracy": 0.9002358585596084, | |
| "num_tokens": 29798516.0, | |
| "step": 4830 | |
| }, | |
| { | |
| "entropy": 0.29397579804062846, | |
| "epoch": 0.8612865913337485, | |
| "grad_norm": 0.7421875, | |
| "learning_rate": 3.26806454709639e-06, | |
| "loss": 0.2932556629180908, | |
| "mean_token_accuracy": 0.8990721523761749, | |
| "num_tokens": 29862063.0, | |
| "step": 4840 | |
| }, | |
| { | |
| "entropy": 0.3458250969648361, | |
| "epoch": 0.8630661090844381, | |
| "grad_norm": 0.734375, | |
| "learning_rate": 3.2610623229474338e-06, | |
| "loss": 0.3443866968154907, | |
| "mean_token_accuracy": 0.8816304355859756, | |
| "num_tokens": 29923575.0, | |
| "step": 4850 | |
| }, | |
| { | |
| "entropy": 0.36488995850086214, | |
| "epoch": 0.8648456268351277, | |
| "grad_norm": 0.7890625, | |
| "learning_rate": 3.2540535122410688e-06, | |
| "loss": 0.36513805389404297, | |
| "mean_token_accuracy": 0.8745848000049591, | |
| "num_tokens": 29986708.0, | |
| "step": 4860 | |
| }, | |
| { | |
| "entropy": 0.3534575715661049, | |
| "epoch": 0.8666251445858173, | |
| "grad_norm": 0.5859375, | |
| "learning_rate": 3.2470381756345277e-06, | |
| "loss": 0.35421276092529297, | |
| "mean_token_accuracy": 0.8764419466257095, | |
| "num_tokens": 30049680.0, | |
| "step": 4870 | |
| }, | |
| { | |
| "entropy": 0.3211802035570145, | |
| "epoch": 0.8684046623365068, | |
| "grad_norm": 0.7265625, | |
| "learning_rate": 3.2400163738415203e-06, | |
| "loss": 0.3255388498306274, | |
| "mean_token_accuracy": 0.8901415437459945, | |
| "num_tokens": 30111870.0, | |
| "step": 4880 | |
| }, | |
| { | |
| "entropy": 0.35184849202632906, | |
| "epoch": 0.8701841800871963, | |
| "grad_norm": 0.7421875, | |
| "learning_rate": 3.232988167631709e-06, | |
| "loss": 0.34560813903808596, | |
| "mean_token_accuracy": 0.8822193145751953, | |
| "num_tokens": 30169341.0, | |
| "step": 4890 | |
| }, | |
| { | |
| "entropy": 0.3080457031726837, | |
| "epoch": 0.871963697837886, | |
| "grad_norm": 0.8671875, | |
| "learning_rate": 3.2259536178301837e-06, | |
| "loss": 0.3061460018157959, | |
| "mean_token_accuracy": 0.8952270209789276, | |
| "num_tokens": 30231620.0, | |
| "step": 4900 | |
| }, | |
| { | |
| "entropy": 0.29343165159225465, | |
| "epoch": 0.8737432155885755, | |
| "grad_norm": 0.69921875, | |
| "learning_rate": 3.2189127853169334e-06, | |
| "loss": 0.2953195571899414, | |
| "mean_token_accuracy": 0.8999059438705445, | |
| "num_tokens": 30290449.0, | |
| "step": 4910 | |
| }, | |
| { | |
| "entropy": 0.33980847895145416, | |
| "epoch": 0.8755227333392651, | |
| "grad_norm": 0.765625, | |
| "learning_rate": 3.2118657310263203e-06, | |
| "loss": 0.3384739398956299, | |
| "mean_token_accuracy": 0.8851828873157501, | |
| "num_tokens": 30349145.0, | |
| "step": 4920 | |
| }, | |
| { | |
| "entropy": 0.2769637621939182, | |
| "epoch": 0.8773022510899546, | |
| "grad_norm": 0.671875, | |
| "learning_rate": 3.204812515946554e-06, | |
| "loss": 0.27285265922546387, | |
| "mean_token_accuracy": 0.9055190175771713, | |
| "num_tokens": 30410943.0, | |
| "step": 4930 | |
| }, | |
| { | |
| "entropy": 0.3305617295205593, | |
| "epoch": 0.8790817688406442, | |
| "grad_norm": 0.7421875, | |
| "learning_rate": 3.19775320111916e-06, | |
| "loss": 0.3289092302322388, | |
| "mean_token_accuracy": 0.8878835290670395, | |
| "num_tokens": 30471247.0, | |
| "step": 4940 | |
| }, | |
| { | |
| "entropy": 0.3315125398337841, | |
| "epoch": 0.8808612865913338, | |
| "grad_norm": 0.84765625, | |
| "learning_rate": 3.190687847638455e-06, | |
| "loss": 0.33691017627716063, | |
| "mean_token_accuracy": 0.885476291179657, | |
| "num_tokens": 30528743.0, | |
| "step": 4950 | |
| }, | |
| { | |
| "entropy": 0.3292131364345551, | |
| "epoch": 0.8826408043420233, | |
| "grad_norm": 0.70703125, | |
| "learning_rate": 3.183616516651017e-06, | |
| "loss": 0.3279974937438965, | |
| "mean_token_accuracy": 0.8860602885484695, | |
| "num_tokens": 30593102.0, | |
| "step": 4960 | |
| }, | |
| { | |
| "entropy": 0.31235293224453925, | |
| "epoch": 0.8844203220927129, | |
| "grad_norm": 0.75, | |
| "learning_rate": 3.1765392693551554e-06, | |
| "loss": 0.3092717170715332, | |
| "mean_token_accuracy": 0.8939553201198578, | |
| "num_tokens": 30656297.0, | |
| "step": 4970 | |
| }, | |
| { | |
| "entropy": 0.32466802522540095, | |
| "epoch": 0.8861998398434024, | |
| "grad_norm": 0.70703125, | |
| "learning_rate": 3.1694561670003814e-06, | |
| "loss": 0.32361798286437987, | |
| "mean_token_accuracy": 0.8885882467031478, | |
| "num_tokens": 30718179.0, | |
| "step": 4980 | |
| }, | |
| { | |
| "entropy": 0.3157695658504963, | |
| "epoch": 0.887979357594092, | |
| "grad_norm": 0.8203125, | |
| "learning_rate": 3.162367270886878e-06, | |
| "loss": 0.31475324630737306, | |
| "mean_token_accuracy": 0.8932778269052506, | |
| "num_tokens": 30777551.0, | |
| "step": 4990 | |
| }, | |
| { | |
| "entropy": 0.3407856084406376, | |
| "epoch": 0.8897588753447816, | |
| "grad_norm": 0.8046875, | |
| "learning_rate": 3.1552726423649727e-06, | |
| "loss": 0.34217305183410646, | |
| "mean_token_accuracy": 0.8833808153867722, | |
| "num_tokens": 30838659.0, | |
| "step": 5000 | |
| }, | |
| { | |
| "entropy": 0.316268477588892, | |
| "epoch": 0.8915383930954711, | |
| "grad_norm": 0.8359375, | |
| "learning_rate": 3.1481723428346002e-06, | |
| "loss": 0.3134847402572632, | |
| "mean_token_accuracy": 0.8923056960105896, | |
| "num_tokens": 30900473.0, | |
| "step": 5010 | |
| }, | |
| { | |
| "entropy": 0.33296806216239927, | |
| "epoch": 0.8933179108461607, | |
| "grad_norm": 0.66015625, | |
| "learning_rate": 3.141066433744776e-06, | |
| "loss": 0.3330418109893799, | |
| "mean_token_accuracy": 0.8851635575294494, | |
| "num_tokens": 30962254.0, | |
| "step": 5020 | |
| }, | |
| { | |
| "entropy": 0.3682249844074249, | |
| "epoch": 0.8950974285968503, | |
| "grad_norm": 0.79296875, | |
| "learning_rate": 3.1339549765930642e-06, | |
| "loss": 0.3663476943969727, | |
| "mean_token_accuracy": 0.8738820075988769, | |
| "num_tokens": 31026440.0, | |
| "step": 5030 | |
| }, | |
| { | |
| "entropy": 0.33433615118265153, | |
| "epoch": 0.8968769463475398, | |
| "grad_norm": 0.8046875, | |
| "learning_rate": 3.1268380329250415e-06, | |
| "loss": 0.33242876529693605, | |
| "mean_token_accuracy": 0.8840222060680389, | |
| "num_tokens": 31089983.0, | |
| "step": 5040 | |
| }, | |
| { | |
| "entropy": 0.32239319905638697, | |
| "epoch": 0.8986564640982294, | |
| "grad_norm": 0.67578125, | |
| "learning_rate": 3.1197156643337704e-06, | |
| "loss": 0.32181596755981445, | |
| "mean_token_accuracy": 0.8900126188993454, | |
| "num_tokens": 31150387.0, | |
| "step": 5050 | |
| }, | |
| { | |
| "entropy": 0.3059133619070053, | |
| "epoch": 0.9004359818489189, | |
| "grad_norm": 0.73046875, | |
| "learning_rate": 3.11258793245926e-06, | |
| "loss": 0.3009922742843628, | |
| "mean_token_accuracy": 0.8963076531887054, | |
| "num_tokens": 31211896.0, | |
| "step": 5060 | |
| }, | |
| { | |
| "entropy": 0.31035120561718943, | |
| "epoch": 0.9022154995996086, | |
| "grad_norm": 0.58203125, | |
| "learning_rate": 3.1054548989879384e-06, | |
| "loss": 0.3091509580612183, | |
| "mean_token_accuracy": 0.8934770673513412, | |
| "num_tokens": 31276154.0, | |
| "step": 5070 | |
| }, | |
| { | |
| "entropy": 0.3153481140732765, | |
| "epoch": 0.9039950173502981, | |
| "grad_norm": 0.85546875, | |
| "learning_rate": 3.0983166256521143e-06, | |
| "loss": 0.31192855834960936, | |
| "mean_token_accuracy": 0.8923483729362488, | |
| "num_tokens": 31340158.0, | |
| "step": 5080 | |
| }, | |
| { | |
| "entropy": 0.3468318752944469, | |
| "epoch": 0.9057745351009876, | |
| "grad_norm": 0.71875, | |
| "learning_rate": 3.091173174229443e-06, | |
| "loss": 0.3485881805419922, | |
| "mean_token_accuracy": 0.8794867992401123, | |
| "num_tokens": 31401561.0, | |
| "step": 5090 | |
| }, | |
| { | |
| "entropy": 0.31567842736840246, | |
| "epoch": 0.9075540528516772, | |
| "grad_norm": 0.66015625, | |
| "learning_rate": 3.0840246065423973e-06, | |
| "loss": 0.31265921592712403, | |
| "mean_token_accuracy": 0.8923265129327774, | |
| "num_tokens": 31466614.0, | |
| "step": 5100 | |
| }, | |
| { | |
| "entropy": 0.32619010731577874, | |
| "epoch": 0.9093335706023667, | |
| "grad_norm": 0.69140625, | |
| "learning_rate": 3.0768709844577242e-06, | |
| "loss": 0.32789175510406493, | |
| "mean_token_accuracy": 0.8868863344192505, | |
| "num_tokens": 31531831.0, | |
| "step": 5110 | |
| }, | |
| { | |
| "entropy": 0.33005650117993357, | |
| "epoch": 0.9111130883530563, | |
| "grad_norm": 0.6796875, | |
| "learning_rate": 3.069712369885916e-06, | |
| "loss": 0.33037724494934084, | |
| "mean_token_accuracy": 0.8874419242143631, | |
| "num_tokens": 31591886.0, | |
| "step": 5120 | |
| }, | |
| { | |
| "entropy": 0.3145495943725109, | |
| "epoch": 0.9128926061037459, | |
| "grad_norm": 0.62109375, | |
| "learning_rate": 3.0625488247806713e-06, | |
| "loss": 0.3168666362762451, | |
| "mean_token_accuracy": 0.8938749313354493, | |
| "num_tokens": 31654824.0, | |
| "step": 5130 | |
| }, | |
| { | |
| "entropy": 0.31578297838568686, | |
| "epoch": 0.9146721238544354, | |
| "grad_norm": 0.85546875, | |
| "learning_rate": 3.0553804111383584e-06, | |
| "loss": 0.3153775453567505, | |
| "mean_token_accuracy": 0.8912237852811813, | |
| "num_tokens": 31715305.0, | |
| "step": 5140 | |
| }, | |
| { | |
| "entropy": 0.31291085556149484, | |
| "epoch": 0.916451641605125, | |
| "grad_norm": 0.6171875, | |
| "learning_rate": 3.0482071909974837e-06, | |
| "loss": 0.30238804817199705, | |
| "mean_token_accuracy": 0.8952312111854553, | |
| "num_tokens": 31778897.0, | |
| "step": 5150 | |
| }, | |
| { | |
| "entropy": 0.3241974800825119, | |
| "epoch": 0.9182311593558146, | |
| "grad_norm": 0.80078125, | |
| "learning_rate": 3.0410292264381474e-06, | |
| "loss": 0.32109644412994387, | |
| "mean_token_accuracy": 0.8890012890100479, | |
| "num_tokens": 31842213.0, | |
| "step": 5160 | |
| }, | |
| { | |
| "entropy": 0.316234128177166, | |
| "epoch": 0.9200106771065041, | |
| "grad_norm": 0.71875, | |
| "learning_rate": 3.0338465795815116e-06, | |
| "loss": 0.31609477996826174, | |
| "mean_token_accuracy": 0.8918006688356399, | |
| "num_tokens": 31905718.0, | |
| "step": 5170 | |
| }, | |
| { | |
| "entropy": 0.363042201846838, | |
| "epoch": 0.9217901948571937, | |
| "grad_norm": 0.73828125, | |
| "learning_rate": 3.02665931258926e-06, | |
| "loss": 0.3673147916793823, | |
| "mean_token_accuracy": 0.8740256160497666, | |
| "num_tokens": 31969774.0, | |
| "step": 5180 | |
| }, | |
| { | |
| "entropy": 0.36331501603126526, | |
| "epoch": 0.9235697126078832, | |
| "grad_norm": 0.8984375, | |
| "learning_rate": 3.0194674876630616e-06, | |
| "loss": 0.35879006385803225, | |
| "mean_token_accuracy": 0.875640943646431, | |
| "num_tokens": 32029550.0, | |
| "step": 5190 | |
| }, | |
| { | |
| "entropy": 0.3422251008450985, | |
| "epoch": 0.9253492303585729, | |
| "grad_norm": 0.765625, | |
| "learning_rate": 3.0122711670440326e-06, | |
| "loss": 0.3336863279342651, | |
| "mean_token_accuracy": 0.8831895589828491, | |
| "num_tokens": 32089119.0, | |
| "step": 5200 | |
| }, | |
| { | |
| "entropy": 0.32116865143179896, | |
| "epoch": 0.9271287481092624, | |
| "grad_norm": 0.80078125, | |
| "learning_rate": 3.0050704130121955e-06, | |
| "loss": 0.31827397346496583, | |
| "mean_token_accuracy": 0.8888093143701553, | |
| "num_tokens": 32151585.0, | |
| "step": 5210 | |
| }, | |
| { | |
| "entropy": 0.35903649777173996, | |
| "epoch": 0.9289082658599519, | |
| "grad_norm": 0.68359375, | |
| "learning_rate": 2.99786528788594e-06, | |
| "loss": 0.35434813499450685, | |
| "mean_token_accuracy": 0.8781492948532105, | |
| "num_tokens": 32211905.0, | |
| "step": 5220 | |
| }, | |
| { | |
| "entropy": 0.32957206293940544, | |
| "epoch": 0.9306877836106415, | |
| "grad_norm": 0.71484375, | |
| "learning_rate": 2.99065585402149e-06, | |
| "loss": 0.3254066228866577, | |
| "mean_token_accuracy": 0.885261994600296, | |
| "num_tokens": 32269838.0, | |
| "step": 5230 | |
| }, | |
| { | |
| "entropy": 0.3350566834211349, | |
| "epoch": 0.932467301361331, | |
| "grad_norm": 0.734375, | |
| "learning_rate": 2.983442173812354e-06, | |
| "loss": 0.3390789031982422, | |
| "mean_token_accuracy": 0.8853450924158096, | |
| "num_tokens": 32330761.0, | |
| "step": 5240 | |
| }, | |
| { | |
| "entropy": 0.3244143448770046, | |
| "epoch": 0.9342468191120207, | |
| "grad_norm": 0.69140625, | |
| "learning_rate": 2.9762243096887928e-06, | |
| "loss": 0.3215372562408447, | |
| "mean_token_accuracy": 0.89001205265522, | |
| "num_tokens": 32390930.0, | |
| "step": 5250 | |
| }, | |
| { | |
| "entropy": 0.3136039458215237, | |
| "epoch": 0.9360263368627102, | |
| "grad_norm": 0.640625, | |
| "learning_rate": 2.969002324117276e-06, | |
| "loss": 0.30731494426727296, | |
| "mean_token_accuracy": 0.8921667337417603, | |
| "num_tokens": 32454361.0, | |
| "step": 5260 | |
| }, | |
| { | |
| "entropy": 0.31152409985661506, | |
| "epoch": 0.9378058546133997, | |
| "grad_norm": 0.69140625, | |
| "learning_rate": 2.961776279599941e-06, | |
| "loss": 0.31525585651397703, | |
| "mean_token_accuracy": 0.8938525497913361, | |
| "num_tokens": 32515497.0, | |
| "step": 5270 | |
| }, | |
| { | |
| "entropy": 0.3264880500733852, | |
| "epoch": 0.9395853723640893, | |
| "grad_norm": 0.8125, | |
| "learning_rate": 2.9545462386740553e-06, | |
| "loss": 0.3251985549926758, | |
| "mean_token_accuracy": 0.8883378058671951, | |
| "num_tokens": 32578453.0, | |
| "step": 5280 | |
| }, | |
| { | |
| "entropy": 0.3283020846545696, | |
| "epoch": 0.9413648901147789, | |
| "grad_norm": 0.75, | |
| "learning_rate": 2.947312263911471e-06, | |
| "loss": 0.3329939365386963, | |
| "mean_token_accuracy": 0.8853492170572281, | |
| "num_tokens": 32643555.0, | |
| "step": 5290 | |
| }, | |
| { | |
| "entropy": 0.31003125831484796, | |
| "epoch": 0.9431444078654685, | |
| "grad_norm": 0.65234375, | |
| "learning_rate": 2.9400744179180857e-06, | |
| "loss": 0.3083526372909546, | |
| "mean_token_accuracy": 0.8943161189556121, | |
| "num_tokens": 32705844.0, | |
| "step": 5300 | |
| }, | |
| { | |
| "entropy": 0.28054061383008955, | |
| "epoch": 0.944923925616158, | |
| "grad_norm": 0.66015625, | |
| "learning_rate": 2.9328327633333016e-06, | |
| "loss": 0.27966985702514646, | |
| "mean_token_accuracy": 0.9065906196832657, | |
| "num_tokens": 32765682.0, | |
| "step": 5310 | |
| }, | |
| { | |
| "entropy": 0.33282921388745307, | |
| "epoch": 0.9467034433668475, | |
| "grad_norm": 0.640625, | |
| "learning_rate": 2.925587362829479e-06, | |
| "loss": 0.3254220962524414, | |
| "mean_token_accuracy": 0.8870999902486801, | |
| "num_tokens": 32828237.0, | |
| "step": 5320 | |
| }, | |
| { | |
| "entropy": 0.35021237581968306, | |
| "epoch": 0.9484829611175372, | |
| "grad_norm": 0.6875, | |
| "learning_rate": 2.918338279111402e-06, | |
| "loss": 0.3531177520751953, | |
| "mean_token_accuracy": 0.8790487974882126, | |
| "num_tokens": 32892656.0, | |
| "step": 5330 | |
| }, | |
| { | |
| "entropy": 0.29660406410694123, | |
| "epoch": 0.9502624788682267, | |
| "grad_norm": 0.71875, | |
| "learning_rate": 2.9110855749157247e-06, | |
| "loss": 0.2960149049758911, | |
| "mean_token_accuracy": 0.8969713002443314, | |
| "num_tokens": 32956743.0, | |
| "step": 5340 | |
| }, | |
| { | |
| "entropy": 0.31396700665354726, | |
| "epoch": 0.9520419966189163, | |
| "grad_norm": 0.7265625, | |
| "learning_rate": 2.9038293130104397e-06, | |
| "loss": 0.3152457237243652, | |
| "mean_token_accuracy": 0.8920667231082916, | |
| "num_tokens": 33019791.0, | |
| "step": 5350 | |
| }, | |
| { | |
| "entropy": 0.3239952839910984, | |
| "epoch": 0.9538215143696058, | |
| "grad_norm": 0.671875, | |
| "learning_rate": 2.8965695561943263e-06, | |
| "loss": 0.32175612449645996, | |
| "mean_token_accuracy": 0.8889258235692978, | |
| "num_tokens": 33086397.0, | |
| "step": 5360 | |
| }, | |
| { | |
| "entropy": 0.3190963797271252, | |
| "epoch": 0.9556010321202953, | |
| "grad_norm": 0.73828125, | |
| "learning_rate": 2.889306367296411e-06, | |
| "loss": 0.3171302080154419, | |
| "mean_token_accuracy": 0.8905750632286071, | |
| "num_tokens": 33150014.0, | |
| "step": 5370 | |
| }, | |
| { | |
| "entropy": 0.31850261464715, | |
| "epoch": 0.957380549870985, | |
| "grad_norm": 0.6875, | |
| "learning_rate": 2.882039809175424e-06, | |
| "loss": 0.3195357799530029, | |
| "mean_token_accuracy": 0.890536653995514, | |
| "num_tokens": 33211415.0, | |
| "step": 5380 | |
| }, | |
| { | |
| "entropy": 0.31150018870830537, | |
| "epoch": 0.9591600676216745, | |
| "grad_norm": 0.859375, | |
| "learning_rate": 2.8747699447192536e-06, | |
| "loss": 0.31338660717010497, | |
| "mean_token_accuracy": 0.8935931742191314, | |
| "num_tokens": 33273358.0, | |
| "step": 5390 | |
| }, | |
| { | |
| "entropy": 0.3056714966893196, | |
| "epoch": 0.9609395853723641, | |
| "grad_norm": 0.59375, | |
| "learning_rate": 2.8674968368444004e-06, | |
| "loss": 0.3025672435760498, | |
| "mean_token_accuracy": 0.8964046210050582, | |
| "num_tokens": 33336869.0, | |
| "step": 5400 | |
| }, | |
| { | |
| "entropy": 0.31171972677111626, | |
| "epoch": 0.9627191031230536, | |
| "grad_norm": 0.66796875, | |
| "learning_rate": 2.86022054849544e-06, | |
| "loss": 0.3139855146408081, | |
| "mean_token_accuracy": 0.8938859939575196, | |
| "num_tokens": 33394715.0, | |
| "step": 5410 | |
| }, | |
| { | |
| "entropy": 0.3110303595662117, | |
| "epoch": 0.9644986208737432, | |
| "grad_norm": 0.703125, | |
| "learning_rate": 2.852941142644467e-06, | |
| "loss": 0.3146480083465576, | |
| "mean_token_accuracy": 0.8919815003871918, | |
| "num_tokens": 33455275.0, | |
| "step": 5420 | |
| }, | |
| { | |
| "entropy": 0.3318745605647564, | |
| "epoch": 0.9662781386244328, | |
| "grad_norm": 0.67578125, | |
| "learning_rate": 2.845658682290562e-06, | |
| "loss": 0.33428895473480225, | |
| "mean_token_accuracy": 0.8868581712245941, | |
| "num_tokens": 33521328.0, | |
| "step": 5430 | |
| }, | |
| { | |
| "entropy": 0.32524766102433206, | |
| "epoch": 0.9680576563751223, | |
| "grad_norm": 0.890625, | |
| "learning_rate": 2.8383732304592353e-06, | |
| "loss": 0.32019040584564207, | |
| "mean_token_accuracy": 0.8889807224273681, | |
| "num_tokens": 33582622.0, | |
| "step": 5440 | |
| }, | |
| { | |
| "entropy": 0.31952634900808335, | |
| "epoch": 0.9698371741258119, | |
| "grad_norm": 0.62890625, | |
| "learning_rate": 2.8310848502018913e-06, | |
| "loss": 0.3131838798522949, | |
| "mean_token_accuracy": 0.8926309943199158, | |
| "num_tokens": 33641393.0, | |
| "step": 5450 | |
| }, | |
| { | |
| "entropy": 0.3325915150344372, | |
| "epoch": 0.9716166918765015, | |
| "grad_norm": 0.703125, | |
| "learning_rate": 2.8237936045952753e-06, | |
| "loss": 0.33072264194488527, | |
| "mean_token_accuracy": 0.886261397600174, | |
| "num_tokens": 33697688.0, | |
| "step": 5460 | |
| }, | |
| { | |
| "entropy": 0.3559048496186733, | |
| "epoch": 0.973396209627191, | |
| "grad_norm": 0.85546875, | |
| "learning_rate": 2.8164995567409303e-06, | |
| "loss": 0.361460542678833, | |
| "mean_token_accuracy": 0.8776622712612152, | |
| "num_tokens": 33759995.0, | |
| "step": 5470 | |
| }, | |
| { | |
| "entropy": 0.3113952338695526, | |
| "epoch": 0.9751757273778806, | |
| "grad_norm": 0.671875, | |
| "learning_rate": 2.809202769764655e-06, | |
| "loss": 0.31021485328674314, | |
| "mean_token_accuracy": 0.8931919723749161, | |
| "num_tokens": 33827541.0, | |
| "step": 5480 | |
| }, | |
| { | |
| "entropy": 0.32099704146385194, | |
| "epoch": 0.9769552451285701, | |
| "grad_norm": 0.765625, | |
| "learning_rate": 2.8019033068159483e-06, | |
| "loss": 0.31149590015411377, | |
| "mean_token_accuracy": 0.890517508983612, | |
| "num_tokens": 33884287.0, | |
| "step": 5490 | |
| }, | |
| { | |
| "entropy": 0.32434547394514085, | |
| "epoch": 0.9787347628792598, | |
| "grad_norm": 0.87109375, | |
| "learning_rate": 2.7946012310674723e-06, | |
| "loss": 0.3216128349304199, | |
| "mean_token_accuracy": 0.8901405483484268, | |
| "num_tokens": 33943895.0, | |
| "step": 5500 | |
| }, | |
| { | |
| "entropy": 0.38828401267528534, | |
| "epoch": 0.9805142806299493, | |
| "grad_norm": 0.7109375, | |
| "learning_rate": 2.7872966057145e-06, | |
| "loss": 0.38836209774017333, | |
| "mean_token_accuracy": 0.8656457990407944, | |
| "num_tokens": 34005669.0, | |
| "step": 5510 | |
| }, | |
| { | |
| "entropy": 0.3450230464339256, | |
| "epoch": 0.9822937983806388, | |
| "grad_norm": 0.8984375, | |
| "learning_rate": 2.7799894939743682e-06, | |
| "loss": 0.3446993112564087, | |
| "mean_token_accuracy": 0.8808085441589355, | |
| "num_tokens": 34067528.0, | |
| "step": 5520 | |
| }, | |
| { | |
| "entropy": 0.32642928287386896, | |
| "epoch": 0.9840733161313284, | |
| "grad_norm": 0.6171875, | |
| "learning_rate": 2.7726799590859336e-06, | |
| "loss": 0.3271129608154297, | |
| "mean_token_accuracy": 0.8889746874570846, | |
| "num_tokens": 34128047.0, | |
| "step": 5530 | |
| }, | |
| { | |
| "entropy": 0.2980583220720291, | |
| "epoch": 0.9858528338820179, | |
| "grad_norm": 0.6015625, | |
| "learning_rate": 2.7653680643090247e-06, | |
| "loss": 0.2943974256515503, | |
| "mean_token_accuracy": 0.8994252145290375, | |
| "num_tokens": 34189618.0, | |
| "step": 5540 | |
| }, | |
| { | |
| "entropy": 0.3192008055746555, | |
| "epoch": 0.9876323516327076, | |
| "grad_norm": 0.734375, | |
| "learning_rate": 2.758053872923891e-06, | |
| "loss": 0.3172843217849731, | |
| "mean_token_accuracy": 0.8905525475740432, | |
| "num_tokens": 34255450.0, | |
| "step": 5550 | |
| }, | |
| { | |
| "entropy": 0.319820112735033, | |
| "epoch": 0.9894118693833971, | |
| "grad_norm": 0.7265625, | |
| "learning_rate": 2.7507374482306603e-06, | |
| "loss": 0.316086483001709, | |
| "mean_token_accuracy": 0.8913855284452439, | |
| "num_tokens": 34316630.0, | |
| "step": 5560 | |
| }, | |
| { | |
| "entropy": 0.3039404682815075, | |
| "epoch": 0.9911913871340866, | |
| "grad_norm": 0.73828125, | |
| "learning_rate": 2.7434188535487867e-06, | |
| "loss": 0.3039390563964844, | |
| "mean_token_accuracy": 0.8969542562961579, | |
| "num_tokens": 34381262.0, | |
| "step": 5570 | |
| }, | |
| { | |
| "entropy": 0.29476389065384867, | |
| "epoch": 0.9929709048847762, | |
| "grad_norm": 0.65234375, | |
| "learning_rate": 2.7360981522165046e-06, | |
| "loss": 0.292004656791687, | |
| "mean_token_accuracy": 0.9019516199827194, | |
| "num_tokens": 34443316.0, | |
| "step": 5580 | |
| }, | |
| { | |
| "entropy": 0.3337429530918598, | |
| "epoch": 0.9947504226354658, | |
| "grad_norm": 0.78515625, | |
| "learning_rate": 2.728775407590282e-06, | |
| "loss": 0.3344456911087036, | |
| "mean_token_accuracy": 0.8843173295259475, | |
| "num_tokens": 34506285.0, | |
| "step": 5590 | |
| }, | |
| { | |
| "entropy": 0.32889760509133337, | |
| "epoch": 0.9965299403861554, | |
| "grad_norm": 0.73828125, | |
| "learning_rate": 2.721450683044267e-06, | |
| "loss": 0.3343979835510254, | |
| "mean_token_accuracy": 0.8854986250400543, | |
| "num_tokens": 34570179.0, | |
| "step": 5600 | |
| }, | |
| { | |
| "entropy": 0.3538062654435635, | |
| "epoch": 0.9983094581368449, | |
| "grad_norm": 0.80078125, | |
| "learning_rate": 2.714124041969746e-06, | |
| "loss": 0.3547967910766602, | |
| "mean_token_accuracy": 0.8770895808935165, | |
| "num_tokens": 34634240.0, | |
| "step": 5610 | |
| }, | |
| { | |
| "entropy": 0.3326169644531451, | |
| "epoch": 1.0, | |
| "grad_norm": 1.1640625, | |
| "learning_rate": 2.706795547774589e-06, | |
| "loss": 0.33385910987854006, | |
| "mean_token_accuracy": 0.8873269903032404, | |
| "num_tokens": 34692012.0, | |
| "step": 5620 | |
| }, | |
| { | |
| "entropy": 0.34083987325429915, | |
| "epoch": 1.0017795177506896, | |
| "grad_norm": 0.875, | |
| "learning_rate": 2.699465263882708e-06, | |
| "loss": 0.33701329231262206, | |
| "mean_token_accuracy": 0.882954615354538, | |
| "num_tokens": 34751142.0, | |
| "step": 5630 | |
| }, | |
| { | |
| "entropy": 0.3176037408411503, | |
| "epoch": 1.003559035501379, | |
| "grad_norm": 0.7109375, | |
| "learning_rate": 2.6921332537334995e-06, | |
| "loss": 0.31018331050872805, | |
| "mean_token_accuracy": 0.89184690117836, | |
| "num_tokens": 34815015.0, | |
| "step": 5640 | |
| }, | |
| { | |
| "entropy": 0.32635784670710566, | |
| "epoch": 1.0053385532520687, | |
| "grad_norm": 0.6171875, | |
| "learning_rate": 2.684799580781301e-06, | |
| "loss": 0.3245363712310791, | |
| "mean_token_accuracy": 0.889178654551506, | |
| "num_tokens": 34875682.0, | |
| "step": 5650 | |
| }, | |
| { | |
| "entropy": 0.3262045428156853, | |
| "epoch": 1.0071180710027583, | |
| "grad_norm": 0.71875, | |
| "learning_rate": 2.6774643084948416e-06, | |
| "loss": 0.32026770114898684, | |
| "mean_token_accuracy": 0.8906201630830765, | |
| "num_tokens": 34936388.0, | |
| "step": 5660 | |
| }, | |
| { | |
| "entropy": 0.3156457729637623, | |
| "epoch": 1.008897588753448, | |
| "grad_norm": 0.671875, | |
| "learning_rate": 2.6701275003566905e-06, | |
| "loss": 0.3158827066421509, | |
| "mean_token_accuracy": 0.890359628200531, | |
| "num_tokens": 34998803.0, | |
| "step": 5670 | |
| }, | |
| { | |
| "entropy": 0.33784292116761205, | |
| "epoch": 1.0106771065041373, | |
| "grad_norm": 0.71875, | |
| "learning_rate": 2.6627892198627104e-06, | |
| "loss": 0.33698952198028564, | |
| "mean_token_accuracy": 0.8842770218849182, | |
| "num_tokens": 35058269.0, | |
| "step": 5680 | |
| }, | |
| { | |
| "entropy": 0.3404016703367233, | |
| "epoch": 1.012456624254827, | |
| "grad_norm": 0.65234375, | |
| "learning_rate": 2.6554495305215045e-06, | |
| "loss": 0.34072854518890383, | |
| "mean_token_accuracy": 0.8847543150186539, | |
| "num_tokens": 35125401.0, | |
| "step": 5690 | |
| }, | |
| { | |
| "entropy": 0.316736675798893, | |
| "epoch": 1.0142361420055166, | |
| "grad_norm": 0.66796875, | |
| "learning_rate": 2.6481084958538695e-06, | |
| "loss": 0.31809291839599607, | |
| "mean_token_accuracy": 0.8899137407541275, | |
| "num_tokens": 35187010.0, | |
| "step": 5700 | |
| }, | |
| { | |
| "entropy": 0.31172519326210024, | |
| "epoch": 1.016015659756206, | |
| "grad_norm": 0.74609375, | |
| "learning_rate": 2.6407661793922466e-06, | |
| "loss": 0.30487895011901855, | |
| "mean_token_accuracy": 0.895835679769516, | |
| "num_tokens": 35249055.0, | |
| "step": 5710 | |
| }, | |
| { | |
| "entropy": 0.322640036046505, | |
| "epoch": 1.0177951775068956, | |
| "grad_norm": 0.65625, | |
| "learning_rate": 2.6334226446801675e-06, | |
| "loss": 0.3133616209030151, | |
| "mean_token_accuracy": 0.8907902717590332, | |
| "num_tokens": 35311776.0, | |
| "step": 5720 | |
| }, | |
| { | |
| "entropy": 0.30626519620418546, | |
| "epoch": 1.0195746952575853, | |
| "grad_norm": 0.7890625, | |
| "learning_rate": 2.626077955271709e-06, | |
| "loss": 0.30397911071777345, | |
| "mean_token_accuracy": 0.8964751362800598, | |
| "num_tokens": 35371736.0, | |
| "step": 5730 | |
| }, | |
| { | |
| "entropy": 0.3391783103346825, | |
| "epoch": 1.0213542130082747, | |
| "grad_norm": 0.77734375, | |
| "learning_rate": 2.618732174730941e-06, | |
| "loss": 0.33878111839294434, | |
| "mean_token_accuracy": 0.8837409794330597, | |
| "num_tokens": 35427751.0, | |
| "step": 5740 | |
| }, | |
| { | |
| "entropy": 0.3252422705292702, | |
| "epoch": 1.0231337307589643, | |
| "grad_norm": 0.7578125, | |
| "learning_rate": 2.611385366631376e-06, | |
| "loss": 0.31556589603424073, | |
| "mean_token_accuracy": 0.8910249531269073, | |
| "num_tokens": 35483783.0, | |
| "step": 5750 | |
| }, | |
| { | |
| "entropy": 0.3271099664270878, | |
| "epoch": 1.024913248509654, | |
| "grad_norm": 0.921875, | |
| "learning_rate": 2.604037594555419e-06, | |
| "loss": 0.327379035949707, | |
| "mean_token_accuracy": 0.8876970559358597, | |
| "num_tokens": 35544288.0, | |
| "step": 5760 | |
| }, | |
| { | |
| "entropy": 0.2963846907019615, | |
| "epoch": 1.0266927662603433, | |
| "grad_norm": 0.6640625, | |
| "learning_rate": 2.5966889220938185e-06, | |
| "loss": 0.29484057426452637, | |
| "mean_token_accuracy": 0.8992130428552627, | |
| "num_tokens": 35609505.0, | |
| "step": 5770 | |
| }, | |
| { | |
| "entropy": 0.3000890247523785, | |
| "epoch": 1.028472284011033, | |
| "grad_norm": 0.76171875, | |
| "learning_rate": 2.589339412845116e-06, | |
| "loss": 0.29627208709716796, | |
| "mean_token_accuracy": 0.8975471526384353, | |
| "num_tokens": 35672460.0, | |
| "step": 5780 | |
| }, | |
| { | |
| "entropy": 0.32139924764633176, | |
| "epoch": 1.0302518017617226, | |
| "grad_norm": 0.68359375, | |
| "learning_rate": 2.581989130415093e-06, | |
| "loss": 0.31838669776916506, | |
| "mean_token_accuracy": 0.8897950440645218, | |
| "num_tokens": 35736833.0, | |
| "step": 5790 | |
| }, | |
| { | |
| "entropy": 0.3406783610582352, | |
| "epoch": 1.0320313195124122, | |
| "grad_norm": 0.74609375, | |
| "learning_rate": 2.574638138416224e-06, | |
| "loss": 0.3328117847442627, | |
| "mean_token_accuracy": 0.8851494818925858, | |
| "num_tokens": 35800085.0, | |
| "step": 5800 | |
| }, | |
| { | |
| "entropy": 0.3248604856431484, | |
| "epoch": 1.0338108372631016, | |
| "grad_norm": 0.7109375, | |
| "learning_rate": 2.567286500467124e-06, | |
| "loss": 0.3253867864608765, | |
| "mean_token_accuracy": 0.8891596347093582, | |
| "num_tokens": 35862528.0, | |
| "step": 5810 | |
| }, | |
| { | |
| "entropy": 0.3194640681147575, | |
| "epoch": 1.0355903550137913, | |
| "grad_norm": 0.72265625, | |
| "learning_rate": 2.559934280191997e-06, | |
| "loss": 0.31677422523498533, | |
| "mean_token_accuracy": 0.8909268170595169, | |
| "num_tokens": 35923252.0, | |
| "step": 5820 | |
| }, | |
| { | |
| "entropy": 0.3379687383770943, | |
| "epoch": 1.037369872764481, | |
| "grad_norm": 0.6328125, | |
| "learning_rate": 2.5525815412200894e-06, | |
| "loss": 0.3359971046447754, | |
| "mean_token_accuracy": 0.8852140247821808, | |
| "num_tokens": 35984416.0, | |
| "step": 5830 | |
| }, | |
| { | |
| "entropy": 0.30308631584048273, | |
| "epoch": 1.0391493905151703, | |
| "grad_norm": 0.7421875, | |
| "learning_rate": 2.545228347185134e-06, | |
| "loss": 0.29819297790527344, | |
| "mean_token_accuracy": 0.8974331319332123, | |
| "num_tokens": 36047352.0, | |
| "step": 5840 | |
| }, | |
| { | |
| "entropy": 0.29114886596798895, | |
| "epoch": 1.04092890826586, | |
| "grad_norm": 0.6875, | |
| "learning_rate": 2.537874761724804e-06, | |
| "loss": 0.2821171283721924, | |
| "mean_token_accuracy": 0.9028494268655777, | |
| "num_tokens": 36106156.0, | |
| "step": 5850 | |
| }, | |
| { | |
| "entropy": 0.30400493890047076, | |
| "epoch": 1.0427084260165496, | |
| "grad_norm": 0.796875, | |
| "learning_rate": 2.5305208484801584e-06, | |
| "loss": 0.30085320472717286, | |
| "mean_token_accuracy": 0.8987132161855698, | |
| "num_tokens": 36168229.0, | |
| "step": 5860 | |
| }, | |
| { | |
| "entropy": 0.3301976449787617, | |
| "epoch": 1.0444879437672392, | |
| "grad_norm": 0.73828125, | |
| "learning_rate": 2.523166671095094e-06, | |
| "loss": 0.3351378679275513, | |
| "mean_token_accuracy": 0.8854980170726776, | |
| "num_tokens": 36232169.0, | |
| "step": 5870 | |
| }, | |
| { | |
| "entropy": 0.30894535407423973, | |
| "epoch": 1.0462674615179286, | |
| "grad_norm": 0.5546875, | |
| "learning_rate": 2.515812293215794e-06, | |
| "loss": 0.304299521446228, | |
| "mean_token_accuracy": 0.8937274575233459, | |
| "num_tokens": 36294608.0, | |
| "step": 5880 | |
| }, | |
| { | |
| "entropy": 0.3305805541574955, | |
| "epoch": 1.0480469792686182, | |
| "grad_norm": 0.73828125, | |
| "learning_rate": 2.508457778490175e-06, | |
| "loss": 0.3294157266616821, | |
| "mean_token_accuracy": 0.8851876139640809, | |
| "num_tokens": 36360386.0, | |
| "step": 5890 | |
| }, | |
| { | |
| "entropy": 0.32959619238972665, | |
| "epoch": 1.0498264970193079, | |
| "grad_norm": 0.71875, | |
| "learning_rate": 2.50110319056734e-06, | |
| "loss": 0.3228970289230347, | |
| "mean_token_accuracy": 0.8861234545707702, | |
| "num_tokens": 36422208.0, | |
| "step": 5900 | |
| }, | |
| { | |
| "entropy": 0.3291837781667709, | |
| "epoch": 1.0516060147699973, | |
| "grad_norm": 0.76171875, | |
| "learning_rate": 2.493748593097024e-06, | |
| "loss": 0.3229544639587402, | |
| "mean_token_accuracy": 0.8892482191324234, | |
| "num_tokens": 36481528.0, | |
| "step": 5910 | |
| }, | |
| { | |
| "entropy": 0.3166023068130016, | |
| "epoch": 1.053385532520687, | |
| "grad_norm": 0.67578125, | |
| "learning_rate": 2.486394049729045e-06, | |
| "loss": 0.3133046865463257, | |
| "mean_token_accuracy": 0.8923086404800415, | |
| "num_tokens": 36543019.0, | |
| "step": 5920 | |
| }, | |
| { | |
| "entropy": 0.32730976268649103, | |
| "epoch": 1.0551650502713765, | |
| "grad_norm": 0.76171875, | |
| "learning_rate": 2.4790396241127533e-06, | |
| "loss": 0.33183271884918214, | |
| "mean_token_accuracy": 0.8874736070632935, | |
| "num_tokens": 36607552.0, | |
| "step": 5930 | |
| }, | |
| { | |
| "entropy": 0.323318800330162, | |
| "epoch": 1.056944568022066, | |
| "grad_norm": 0.7109375, | |
| "learning_rate": 2.4716853798964793e-06, | |
| "loss": 0.3239744663238525, | |
| "mean_token_accuracy": 0.8901706904172897, | |
| "num_tokens": 36670619.0, | |
| "step": 5940 | |
| }, | |
| { | |
| "entropy": 0.3111228793859482, | |
| "epoch": 1.0587240857727556, | |
| "grad_norm": 0.65234375, | |
| "learning_rate": 2.464331380726985e-06, | |
| "loss": 0.3095929384231567, | |
| "mean_token_accuracy": 0.89564750790596, | |
| "num_tokens": 36734727.0, | |
| "step": 5950 | |
| }, | |
| { | |
| "entropy": 0.31210684925317767, | |
| "epoch": 1.0605036035234452, | |
| "grad_norm": 0.81640625, | |
| "learning_rate": 2.456977690248909e-06, | |
| "loss": 0.3053849458694458, | |
| "mean_token_accuracy": 0.8959574043750763, | |
| "num_tokens": 36792968.0, | |
| "step": 5960 | |
| }, | |
| { | |
| "entropy": 0.30364991426467897, | |
| "epoch": 1.0622831212741346, | |
| "grad_norm": 0.7421875, | |
| "learning_rate": 2.4496243721042208e-06, | |
| "loss": 0.2973085880279541, | |
| "mean_token_accuracy": 0.8975523322820663, | |
| "num_tokens": 36855369.0, | |
| "step": 5970 | |
| }, | |
| { | |
| "entropy": 0.3433017261326313, | |
| "epoch": 1.0640626390248242, | |
| "grad_norm": 0.796875, | |
| "learning_rate": 2.442271489931667e-06, | |
| "loss": 0.3419850587844849, | |
| "mean_token_accuracy": 0.8831979781389236, | |
| "num_tokens": 36919536.0, | |
| "step": 5980 | |
| }, | |
| { | |
| "entropy": 0.34219980239868164, | |
| "epoch": 1.0658421567755139, | |
| "grad_norm": 0.6328125, | |
| "learning_rate": 2.4349191073662203e-06, | |
| "loss": 0.343482518196106, | |
| "mean_token_accuracy": 0.8828152269124985, | |
| "num_tokens": 36977572.0, | |
| "step": 5990 | |
| }, | |
| { | |
| "entropy": 0.32711869329214094, | |
| "epoch": 1.0676216745262035, | |
| "grad_norm": 0.73046875, | |
| "learning_rate": 2.427567288038531e-06, | |
| "loss": 0.31664719581604006, | |
| "mean_token_accuracy": 0.8899913311004639, | |
| "num_tokens": 37034892.0, | |
| "step": 6000 | |
| }, | |
| { | |
| "entropy": 0.32893837317824365, | |
| "epoch": 1.069401192276893, | |
| "grad_norm": 0.6875, | |
| "learning_rate": 2.4202160955743724e-06, | |
| "loss": 0.3295586585998535, | |
| "mean_token_accuracy": 0.8879793435335159, | |
| "num_tokens": 37097176.0, | |
| "step": 6010 | |
| }, | |
| { | |
| "entropy": 0.3367379605770111, | |
| "epoch": 1.0711807100275825, | |
| "grad_norm": 0.91796875, | |
| "learning_rate": 2.412865593594096e-06, | |
| "loss": 0.3332340240478516, | |
| "mean_token_accuracy": 0.8856563240289688, | |
| "num_tokens": 37161600.0, | |
| "step": 6020 | |
| }, | |
| { | |
| "entropy": 0.3031110964715481, | |
| "epoch": 1.0729602277782722, | |
| "grad_norm": 0.65234375, | |
| "learning_rate": 2.405515845712075e-06, | |
| "loss": 0.30210416316986083, | |
| "mean_token_accuracy": 0.8974428921937943, | |
| "num_tokens": 37226164.0, | |
| "step": 6030 | |
| }, | |
| { | |
| "entropy": 0.32815868556499483, | |
| "epoch": 1.0747397455289616, | |
| "grad_norm": 0.80078125, | |
| "learning_rate": 2.398166915536157e-06, | |
| "loss": 0.32607159614562986, | |
| "mean_token_accuracy": 0.8879486858844757, | |
| "num_tokens": 37289293.0, | |
| "step": 6040 | |
| }, | |
| { | |
| "entropy": 0.3376390390098095, | |
| "epoch": 1.0765192632796512, | |
| "grad_norm": 0.59375, | |
| "learning_rate": 2.3908188666671135e-06, | |
| "loss": 0.33508734703063964, | |
| "mean_token_accuracy": 0.8841046899557113, | |
| "num_tokens": 37353443.0, | |
| "step": 6050 | |
| }, | |
| { | |
| "entropy": 0.35702595561742784, | |
| "epoch": 1.0782987810303408, | |
| "grad_norm": 0.83203125, | |
| "learning_rate": 2.3834717626980877e-06, | |
| "loss": 0.35306107997894287, | |
| "mean_token_accuracy": 0.8776964634656906, | |
| "num_tokens": 37412995.0, | |
| "step": 6060 | |
| }, | |
| { | |
| "entropy": 0.3332983210682869, | |
| "epoch": 1.0800782987810305, | |
| "grad_norm": 0.734375, | |
| "learning_rate": 2.3761256672140465e-06, | |
| "loss": 0.3324312925338745, | |
| "mean_token_accuracy": 0.8848207086324692, | |
| "num_tokens": 37477809.0, | |
| "step": 6070 | |
| }, | |
| { | |
| "entropy": 0.35875064730644224, | |
| "epoch": 1.0818578165317199, | |
| "grad_norm": 0.8203125, | |
| "learning_rate": 2.3687806437912273e-06, | |
| "loss": 0.35025925636291505, | |
| "mean_token_accuracy": 0.8765045911073684, | |
| "num_tokens": 37538884.0, | |
| "step": 6080 | |
| }, | |
| { | |
| "entropy": 0.33794180378317834, | |
| "epoch": 1.0836373342824095, | |
| "grad_norm": 0.78125, | |
| "learning_rate": 2.361436755996592e-06, | |
| "loss": 0.34279372692108157, | |
| "mean_token_accuracy": 0.883757570385933, | |
| "num_tokens": 37600439.0, | |
| "step": 6090 | |
| }, | |
| { | |
| "entropy": 0.3118018746376038, | |
| "epoch": 1.0854168520330991, | |
| "grad_norm": 0.6796875, | |
| "learning_rate": 2.3540940673872696e-06, | |
| "loss": 0.3126061916351318, | |
| "mean_token_accuracy": 0.8942352592945099, | |
| "num_tokens": 37661336.0, | |
| "step": 6100 | |
| }, | |
| { | |
| "entropy": 0.3113993749022484, | |
| "epoch": 1.0871963697837885, | |
| "grad_norm": 0.8203125, | |
| "learning_rate": 2.3467526415100178e-06, | |
| "loss": 0.3139824628829956, | |
| "mean_token_accuracy": 0.8922016888856887, | |
| "num_tokens": 37728551.0, | |
| "step": 6110 | |
| }, | |
| { | |
| "entropy": 0.3283416323363781, | |
| "epoch": 1.0889758875344782, | |
| "grad_norm": 0.60546875, | |
| "learning_rate": 2.3394125419006587e-06, | |
| "loss": 0.3245725154876709, | |
| "mean_token_accuracy": 0.8882441699504853, | |
| "num_tokens": 37793043.0, | |
| "step": 6120 | |
| }, | |
| { | |
| "entropy": 0.3583234764635563, | |
| "epoch": 1.0907554052851678, | |
| "grad_norm": 0.69140625, | |
| "learning_rate": 2.3320738320835416e-06, | |
| "loss": 0.36160922050476074, | |
| "mean_token_accuracy": 0.8759530246257782, | |
| "num_tokens": 37854109.0, | |
| "step": 6130 | |
| }, | |
| { | |
| "entropy": 0.326777271181345, | |
| "epoch": 1.0925349230358572, | |
| "grad_norm": 0.6484375, | |
| "learning_rate": 2.3247365755709868e-06, | |
| "loss": 0.3250066518783569, | |
| "mean_token_accuracy": 0.8864477127790451, | |
| "num_tokens": 37918872.0, | |
| "step": 6140 | |
| }, | |
| { | |
| "entropy": 0.3246280372142792, | |
| "epoch": 1.0943144407865468, | |
| "grad_norm": 0.7890625, | |
| "learning_rate": 2.3174008358627338e-06, | |
| "loss": 0.31370522975921633, | |
| "mean_token_accuracy": 0.8921600759029389, | |
| "num_tokens": 37975481.0, | |
| "step": 6150 | |
| }, | |
| { | |
| "entropy": 0.32454342022538185, | |
| "epoch": 1.0960939585372365, | |
| "grad_norm": 0.61328125, | |
| "learning_rate": 2.310066676445401e-06, | |
| "loss": 0.3222689628601074, | |
| "mean_token_accuracy": 0.889724725484848, | |
| "num_tokens": 38037049.0, | |
| "step": 6160 | |
| }, | |
| { | |
| "entropy": 0.33545268774032594, | |
| "epoch": 1.0978734762879259, | |
| "grad_norm": 0.70703125, | |
| "learning_rate": 2.3027341607919244e-06, | |
| "loss": 0.3306859493255615, | |
| "mean_token_accuracy": 0.8836951851844788, | |
| "num_tokens": 38104511.0, | |
| "step": 6170 | |
| }, | |
| { | |
| "entropy": 0.2989437818527222, | |
| "epoch": 1.0996529940386155, | |
| "grad_norm": 0.58984375, | |
| "learning_rate": 2.2954033523610177e-06, | |
| "loss": 0.29660825729370116, | |
| "mean_token_accuracy": 0.8997817754745483, | |
| "num_tokens": 38164188.0, | |
| "step": 6180 | |
| }, | |
| { | |
| "entropy": 0.3101610042154789, | |
| "epoch": 1.1014325117893051, | |
| "grad_norm": 0.69921875, | |
| "learning_rate": 2.288074314596618e-06, | |
| "loss": 0.3052619218826294, | |
| "mean_token_accuracy": 0.8945633232593536, | |
| "num_tokens": 38225871.0, | |
| "step": 6190 | |
| }, | |
| { | |
| "entropy": 0.32951446026563647, | |
| "epoch": 1.1032120295399948, | |
| "grad_norm": 0.71875, | |
| "learning_rate": 2.280747110927339e-06, | |
| "loss": 0.32285799980163576, | |
| "mean_token_accuracy": 0.8895534485578537, | |
| "num_tokens": 38286977.0, | |
| "step": 6200 | |
| }, | |
| { | |
| "entropy": 0.3137095712125301, | |
| "epoch": 1.1049915472906842, | |
| "grad_norm": 0.68359375, | |
| "learning_rate": 2.2734218047659228e-06, | |
| "loss": 0.3120196104049683, | |
| "mean_token_accuracy": 0.8928256899118423, | |
| "num_tokens": 38351039.0, | |
| "step": 6210 | |
| }, | |
| { | |
| "entropy": 0.27707975208759306, | |
| "epoch": 1.1067710650413738, | |
| "grad_norm": 0.6328125, | |
| "learning_rate": 2.2660984595086854e-06, | |
| "loss": 0.2751126766204834, | |
| "mean_token_accuracy": 0.9059015125036239, | |
| "num_tokens": 38411819.0, | |
| "step": 6220 | |
| }, | |
| { | |
| "entropy": 0.3230294272303581, | |
| "epoch": 1.1085505827920634, | |
| "grad_norm": 0.640625, | |
| "learning_rate": 2.2587771385349773e-06, | |
| "loss": 0.32492067813873293, | |
| "mean_token_accuracy": 0.8876459985971451, | |
| "num_tokens": 38478403.0, | |
| "step": 6230 | |
| }, | |
| { | |
| "entropy": 0.29877011850476265, | |
| "epoch": 1.1103301005427528, | |
| "grad_norm": 0.73828125, | |
| "learning_rate": 2.251457905206626e-06, | |
| "loss": 0.2946697473526001, | |
| "mean_token_accuracy": 0.8977464884519577, | |
| "num_tokens": 38540442.0, | |
| "step": 6240 | |
| }, | |
| { | |
| "entropy": 0.32962229996919634, | |
| "epoch": 1.1121096182934425, | |
| "grad_norm": 0.80859375, | |
| "learning_rate": 2.244140822867395e-06, | |
| "loss": 0.32636442184448244, | |
| "mean_token_accuracy": 0.8879129558801651, | |
| "num_tokens": 38603107.0, | |
| "step": 6250 | |
| }, | |
| { | |
| "entropy": 0.3100545838475227, | |
| "epoch": 1.113889136044132, | |
| "grad_norm": 0.82421875, | |
| "learning_rate": 2.236825954842429e-06, | |
| "loss": 0.3090749502182007, | |
| "mean_token_accuracy": 0.8943884193897247, | |
| "num_tokens": 38666429.0, | |
| "step": 6260 | |
| }, | |
| { | |
| "entropy": 0.3000672958791256, | |
| "epoch": 1.1156686537948217, | |
| "grad_norm": 0.7109375, | |
| "learning_rate": 2.2295133644377117e-06, | |
| "loss": 0.2905374526977539, | |
| "mean_token_accuracy": 0.8999047011137009, | |
| "num_tokens": 38724133.0, | |
| "step": 6270 | |
| }, | |
| { | |
| "entropy": 0.3060581274330616, | |
| "epoch": 1.1174481715455111, | |
| "grad_norm": 0.59765625, | |
| "learning_rate": 2.2222031149395126e-06, | |
| "loss": 0.30127696990966796, | |
| "mean_token_accuracy": 0.8966281563043594, | |
| "num_tokens": 38788427.0, | |
| "step": 6280 | |
| }, | |
| { | |
| "entropy": 0.3509036287665367, | |
| "epoch": 1.1192276892962008, | |
| "grad_norm": 0.640625, | |
| "learning_rate": 2.2148952696138455e-06, | |
| "loss": 0.3526886224746704, | |
| "mean_token_accuracy": 0.8783241659402847, | |
| "num_tokens": 38853368.0, | |
| "step": 6290 | |
| }, | |
| { | |
| "entropy": 0.3256737247109413, | |
| "epoch": 1.1210072070468904, | |
| "grad_norm": 0.6796875, | |
| "learning_rate": 2.207589891705915e-06, | |
| "loss": 0.32360138893127444, | |
| "mean_token_accuracy": 0.8878955036401749, | |
| "num_tokens": 38913590.0, | |
| "step": 6300 | |
| }, | |
| { | |
| "entropy": 0.3029537916183472, | |
| "epoch": 1.1227867247975798, | |
| "grad_norm": 0.68359375, | |
| "learning_rate": 2.2002870444395715e-06, | |
| "loss": 0.29504833221435545, | |
| "mean_token_accuracy": 0.8991098433732987, | |
| "num_tokens": 38975107.0, | |
| "step": 6310 | |
| }, | |
| { | |
| "entropy": 0.3361328311264515, | |
| "epoch": 1.1245662425482694, | |
| "grad_norm": 0.73046875, | |
| "learning_rate": 2.192986791016766e-06, | |
| "loss": 0.3358842611312866, | |
| "mean_token_accuracy": 0.8838304698467254, | |
| "num_tokens": 39037487.0, | |
| "step": 6320 | |
| }, | |
| { | |
| "entropy": 0.29630220159888265, | |
| "epoch": 1.126345760298959, | |
| "grad_norm": 0.70703125, | |
| "learning_rate": 2.1856891946169984e-06, | |
| "loss": 0.2963985204696655, | |
| "mean_token_accuracy": 0.8989090889692306, | |
| "num_tokens": 39101184.0, | |
| "step": 6330 | |
| }, | |
| { | |
| "entropy": 0.3168186888098717, | |
| "epoch": 1.1281252780496485, | |
| "grad_norm": 0.65625, | |
| "learning_rate": 2.178394318396778e-06, | |
| "loss": 0.3151972770690918, | |
| "mean_token_accuracy": 0.8931846141815185, | |
| "num_tokens": 39159619.0, | |
| "step": 6340 | |
| }, | |
| { | |
| "entropy": 0.34394366517663, | |
| "epoch": 1.129904795800338, | |
| "grad_norm": 0.68359375, | |
| "learning_rate": 2.1711022254890664e-06, | |
| "loss": 0.3381487846374512, | |
| "mean_token_accuracy": 0.8816323518753052, | |
| "num_tokens": 39223655.0, | |
| "step": 6350 | |
| }, | |
| { | |
| "entropy": 0.30923732444643975, | |
| "epoch": 1.1316843135510277, | |
| "grad_norm": 0.5859375, | |
| "learning_rate": 2.163812979002743e-06, | |
| "loss": 0.302240777015686, | |
| "mean_token_accuracy": 0.8958666861057282, | |
| "num_tokens": 39285415.0, | |
| "step": 6360 | |
| }, | |
| { | |
| "entropy": 0.3678409859538078, | |
| "epoch": 1.1334638313017171, | |
| "grad_norm": 0.6640625, | |
| "learning_rate": 2.1565266420220507e-06, | |
| "loss": 0.3646035432815552, | |
| "mean_token_accuracy": 0.8739933013916016, | |
| "num_tokens": 39349189.0, | |
| "step": 6370 | |
| }, | |
| { | |
| "entropy": 0.31284826546907424, | |
| "epoch": 1.1352433490524068, | |
| "grad_norm": 0.8359375, | |
| "learning_rate": 2.149243277606051e-06, | |
| "loss": 0.3076478958129883, | |
| "mean_token_accuracy": 0.8938501566648483, | |
| "num_tokens": 39409463.0, | |
| "step": 6380 | |
| }, | |
| { | |
| "entropy": 0.307619209587574, | |
| "epoch": 1.1370228668030964, | |
| "grad_norm": 0.73828125, | |
| "learning_rate": 2.141962948788083e-06, | |
| "loss": 0.30543687343597414, | |
| "mean_token_accuracy": 0.8956003308296203, | |
| "num_tokens": 39467854.0, | |
| "step": 6390 | |
| }, | |
| { | |
| "entropy": 0.3098882667720318, | |
| "epoch": 1.138802384553786, | |
| "grad_norm": 0.765625, | |
| "learning_rate": 2.1346857185752096e-06, | |
| "loss": 0.3102999687194824, | |
| "mean_token_accuracy": 0.8944849371910095, | |
| "num_tokens": 39525795.0, | |
| "step": 6400 | |
| }, | |
| { | |
| "entropy": 0.2952044025063515, | |
| "epoch": 1.1405819023044754, | |
| "grad_norm": 0.734375, | |
| "learning_rate": 2.1274116499476824e-06, | |
| "loss": 0.2934947729110718, | |
| "mean_token_accuracy": 0.8995626121759415, | |
| "num_tokens": 39583763.0, | |
| "step": 6410 | |
| }, | |
| { | |
| "entropy": 0.3159428730607033, | |
| "epoch": 1.142361420055165, | |
| "grad_norm": 0.72265625, | |
| "learning_rate": 2.1201408058583865e-06, | |
| "loss": 0.31551992893218994, | |
| "mean_token_accuracy": 0.8904787719249725, | |
| "num_tokens": 39643269.0, | |
| "step": 6420 | |
| }, | |
| { | |
| "entropy": 0.33396480455994604, | |
| "epoch": 1.1441409378058547, | |
| "grad_norm": 0.8125, | |
| "learning_rate": 2.1128732492323026e-06, | |
| "loss": 0.3312607526779175, | |
| "mean_token_accuracy": 0.8864463776350021, | |
| "num_tokens": 39703376.0, | |
| "step": 6430 | |
| }, | |
| { | |
| "entropy": 0.3289263263344765, | |
| "epoch": 1.145920455556544, | |
| "grad_norm": 0.7265625, | |
| "learning_rate": 2.1056090429659633e-06, | |
| "loss": 0.319482159614563, | |
| "mean_token_accuracy": 0.8892025262117386, | |
| "num_tokens": 39761148.0, | |
| "step": 6440 | |
| }, | |
| { | |
| "entropy": 0.34634201899170874, | |
| "epoch": 1.1476999733072337, | |
| "grad_norm": 0.71875, | |
| "learning_rate": 2.098348249926899e-06, | |
| "loss": 0.34150454998016355, | |
| "mean_token_accuracy": 0.8812961906194687, | |
| "num_tokens": 39824102.0, | |
| "step": 6450 | |
| }, | |
| { | |
| "entropy": 0.35739881843328475, | |
| "epoch": 1.1494794910579234, | |
| "grad_norm": 0.7421875, | |
| "learning_rate": 2.091090932953107e-06, | |
| "loss": 0.3544684171676636, | |
| "mean_token_accuracy": 0.8776734083890915, | |
| "num_tokens": 39885718.0, | |
| "step": 6460 | |
| }, | |
| { | |
| "entropy": 0.3311047166585922, | |
| "epoch": 1.151259008808613, | |
| "grad_norm": 0.8359375, | |
| "learning_rate": 2.083837154852497e-06, | |
| "loss": 0.3287468433380127, | |
| "mean_token_accuracy": 0.8868994563817978, | |
| "num_tokens": 39943999.0, | |
| "step": 6470 | |
| }, | |
| { | |
| "entropy": 0.3139263138175011, | |
| "epoch": 1.1530385265593024, | |
| "grad_norm": 0.578125, | |
| "learning_rate": 2.0765869784023543e-06, | |
| "loss": 0.3099213600158691, | |
| "mean_token_accuracy": 0.8930840253829956, | |
| "num_tokens": 40004250.0, | |
| "step": 6480 | |
| }, | |
| { | |
| "entropy": 0.33958385288715365, | |
| "epoch": 1.154818044309992, | |
| "grad_norm": 0.6328125, | |
| "learning_rate": 2.0693404663487928e-06, | |
| "loss": 0.3395709037780762, | |
| "mean_token_accuracy": 0.8818017035722733, | |
| "num_tokens": 40064625.0, | |
| "step": 6490 | |
| }, | |
| { | |
| "entropy": 0.34563273191452026, | |
| "epoch": 1.1565975620606816, | |
| "grad_norm": 0.765625, | |
| "learning_rate": 2.0620976814062134e-06, | |
| "loss": 0.34551825523376467, | |
| "mean_token_accuracy": 0.879336616396904, | |
| "num_tokens": 40129998.0, | |
| "step": 6500 | |
| }, | |
| { | |
| "entropy": 0.30890574902296064, | |
| "epoch": 1.158377079811371, | |
| "grad_norm": 0.6171875, | |
| "learning_rate": 2.054858686256761e-06, | |
| "loss": 0.30577223300933837, | |
| "mean_token_accuracy": 0.8946483492851257, | |
| "num_tokens": 40193108.0, | |
| "step": 6510 | |
| }, | |
| { | |
| "entropy": 0.3264366887509823, | |
| "epoch": 1.1601565975620607, | |
| "grad_norm": 0.76953125, | |
| "learning_rate": 2.047623543549782e-06, | |
| "loss": 0.3218709945678711, | |
| "mean_token_accuracy": 0.8891184568405152, | |
| "num_tokens": 40255486.0, | |
| "step": 6520 | |
| }, | |
| { | |
| "entropy": 0.29533035308122635, | |
| "epoch": 1.1619361153127503, | |
| "grad_norm": 0.63671875, | |
| "learning_rate": 2.040392315901283e-06, | |
| "loss": 0.293083930015564, | |
| "mean_token_accuracy": 0.9001254260540008, | |
| "num_tokens": 40322435.0, | |
| "step": 6530 | |
| }, | |
| { | |
| "entropy": 0.3199417270720005, | |
| "epoch": 1.1637156330634397, | |
| "grad_norm": 0.67578125, | |
| "learning_rate": 2.0331650658933856e-06, | |
| "loss": 0.31435399055480956, | |
| "mean_token_accuracy": 0.890678858757019, | |
| "num_tokens": 40383302.0, | |
| "step": 6540 | |
| }, | |
| { | |
| "entropy": 0.2874578669667244, | |
| "epoch": 1.1654951508141294, | |
| "grad_norm": 0.6328125, | |
| "learning_rate": 2.02594185607379e-06, | |
| "loss": 0.2868461847305298, | |
| "mean_token_accuracy": 0.9027261883020401, | |
| "num_tokens": 40446325.0, | |
| "step": 6550 | |
| }, | |
| { | |
| "entropy": 0.30375232845544814, | |
| "epoch": 1.167274668564819, | |
| "grad_norm": 0.75, | |
| "learning_rate": 2.0187227489552293e-06, | |
| "loss": 0.3025736093521118, | |
| "mean_token_accuracy": 0.8987367808818817, | |
| "num_tokens": 40504507.0, | |
| "step": 6560 | |
| }, | |
| { | |
| "entropy": 0.3401374787092209, | |
| "epoch": 1.1690541863155084, | |
| "grad_norm": 0.640625, | |
| "learning_rate": 2.011507807014931e-06, | |
| "loss": 0.3411766767501831, | |
| "mean_token_accuracy": 0.883126625418663, | |
| "num_tokens": 40571347.0, | |
| "step": 6570 | |
| }, | |
| { | |
| "entropy": 0.32674640119075776, | |
| "epoch": 1.170833704066198, | |
| "grad_norm": 0.83203125, | |
| "learning_rate": 2.004297092694073e-06, | |
| "loss": 0.32173776626586914, | |
| "mean_token_accuracy": 0.8902782052755356, | |
| "num_tokens": 40635171.0, | |
| "step": 6580 | |
| }, | |
| { | |
| "entropy": 0.33782247379422187, | |
| "epoch": 1.1726132218168877, | |
| "grad_norm": 0.625, | |
| "learning_rate": 1.9970906683972495e-06, | |
| "loss": 0.3345970153808594, | |
| "mean_token_accuracy": 0.88412746489048, | |
| "num_tokens": 40695653.0, | |
| "step": 6590 | |
| }, | |
| { | |
| "entropy": 0.30329259261488917, | |
| "epoch": 1.1743927395675773, | |
| "grad_norm": 0.69921875, | |
| "learning_rate": 1.989888596491924e-06, | |
| "loss": 0.3029667139053345, | |
| "mean_token_accuracy": 0.8961463123559952, | |
| "num_tokens": 40754688.0, | |
| "step": 6600 | |
| }, | |
| { | |
| "entropy": 0.36512257158756256, | |
| "epoch": 1.1761722573182667, | |
| "grad_norm": 0.69140625, | |
| "learning_rate": 1.9826909393078935e-06, | |
| "loss": 0.3695381641387939, | |
| "mean_token_accuracy": 0.8735969066619873, | |
| "num_tokens": 40821556.0, | |
| "step": 6610 | |
| }, | |
| { | |
| "entropy": 0.31008799448609353, | |
| "epoch": 1.1779517750689563, | |
| "grad_norm": 0.703125, | |
| "learning_rate": 1.9754977591367492e-06, | |
| "loss": 0.3019032716751099, | |
| "mean_token_accuracy": 0.8952760756015777, | |
| "num_tokens": 40884928.0, | |
| "step": 6620 | |
| }, | |
| { | |
| "entropy": 0.3640871949493885, | |
| "epoch": 1.179731292819646, | |
| "grad_norm": 0.796875, | |
| "learning_rate": 1.9683091182313324e-06, | |
| "loss": 0.36536407470703125, | |
| "mean_token_accuracy": 0.875368058681488, | |
| "num_tokens": 40944659.0, | |
| "step": 6630 | |
| }, | |
| { | |
| "entropy": 0.33483156710863116, | |
| "epoch": 1.1815108105703354, | |
| "grad_norm": 0.66015625, | |
| "learning_rate": 1.961125078805206e-06, | |
| "loss": 0.33205399513244627, | |
| "mean_token_accuracy": 0.8878760695457458, | |
| "num_tokens": 41002215.0, | |
| "step": 6640 | |
| }, | |
| { | |
| "entropy": 0.29913138821721075, | |
| "epoch": 1.183290328321025, | |
| "grad_norm": 0.6796875, | |
| "learning_rate": 1.9539457030321025e-06, | |
| "loss": 0.29441983699798585, | |
| "mean_token_accuracy": 0.898381170630455, | |
| "num_tokens": 41065329.0, | |
| "step": 6650 | |
| }, | |
| { | |
| "entropy": 0.31198590248823166, | |
| "epoch": 1.1850698460717146, | |
| "grad_norm": 0.6328125, | |
| "learning_rate": 1.9467710530454006e-06, | |
| "loss": 0.31163022518157957, | |
| "mean_token_accuracy": 0.8926221162080765, | |
| "num_tokens": 41129482.0, | |
| "step": 6660 | |
| }, | |
| { | |
| "entropy": 0.31377198696136477, | |
| "epoch": 1.1868493638224042, | |
| "grad_norm": 0.74609375, | |
| "learning_rate": 1.9396011909375735e-06, | |
| "loss": 0.313322925567627, | |
| "mean_token_accuracy": 0.8929570287466049, | |
| "num_tokens": 41192565.0, | |
| "step": 6670 | |
| }, | |
| { | |
| "entropy": 0.3046662501990795, | |
| "epoch": 1.1886288815730937, | |
| "grad_norm": 0.65234375, | |
| "learning_rate": 1.932436178759661e-06, | |
| "loss": 0.3024745464324951, | |
| "mean_token_accuracy": 0.8961217939853668, | |
| "num_tokens": 41257591.0, | |
| "step": 6680 | |
| }, | |
| { | |
| "entropy": 0.34900614991784096, | |
| "epoch": 1.1904083993237833, | |
| "grad_norm": 0.83984375, | |
| "learning_rate": 1.9252760785207324e-06, | |
| "loss": 0.34831223487854, | |
| "mean_token_accuracy": 0.8796100854873657, | |
| "num_tokens": 41320472.0, | |
| "step": 6690 | |
| }, | |
| { | |
| "entropy": 0.31406684070825575, | |
| "epoch": 1.192187917074473, | |
| "grad_norm": 0.671875, | |
| "learning_rate": 1.9181209521873405e-06, | |
| "loss": 0.3106688976287842, | |
| "mean_token_accuracy": 0.8927657037973404, | |
| "num_tokens": 41381552.0, | |
| "step": 6700 | |
| }, | |
| { | |
| "entropy": 0.3064426273107529, | |
| "epoch": 1.1939674348251623, | |
| "grad_norm": 0.82421875, | |
| "learning_rate": 1.9109708616829975e-06, | |
| "loss": 0.3076400995254517, | |
| "mean_token_accuracy": 0.897218656539917, | |
| "num_tokens": 41440632.0, | |
| "step": 6710 | |
| }, | |
| { | |
| "entropy": 0.32711833491921427, | |
| "epoch": 1.195746952575852, | |
| "grad_norm": 0.66015625, | |
| "learning_rate": 1.9038258688876297e-06, | |
| "loss": 0.32924935817718504, | |
| "mean_token_accuracy": 0.8895014435052871, | |
| "num_tokens": 41498181.0, | |
| "step": 6720 | |
| }, | |
| { | |
| "entropy": 0.34585118368268014, | |
| "epoch": 1.1975264703265416, | |
| "grad_norm": 0.7421875, | |
| "learning_rate": 1.896686035637048e-06, | |
| "loss": 0.3470535039901733, | |
| "mean_token_accuracy": 0.8832247287034989, | |
| "num_tokens": 41559623.0, | |
| "step": 6730 | |
| }, | |
| { | |
| "entropy": 0.3303426906466484, | |
| "epoch": 1.199305988077231, | |
| "grad_norm": 0.79296875, | |
| "learning_rate": 1.8895514237224092e-06, | |
| "loss": 0.3249280691146851, | |
| "mean_token_accuracy": 0.8877619624137878, | |
| "num_tokens": 41618891.0, | |
| "step": 6740 | |
| }, | |
| { | |
| "entropy": 0.32443070858716966, | |
| "epoch": 1.2010855058279206, | |
| "grad_norm": 0.84375, | |
| "learning_rate": 1.8824220948896826e-06, | |
| "loss": 0.32383227348327637, | |
| "mean_token_accuracy": 0.8884406238794327, | |
| "num_tokens": 41678285.0, | |
| "step": 6750 | |
| }, | |
| { | |
| "entropy": 0.2969959333539009, | |
| "epoch": 1.2028650235786102, | |
| "grad_norm": 0.75390625, | |
| "learning_rate": 1.8752981108391166e-06, | |
| "loss": 0.2915003538131714, | |
| "mean_token_accuracy": 0.9006586492061615, | |
| "num_tokens": 41741225.0, | |
| "step": 6760 | |
| }, | |
| { | |
| "entropy": 0.3364593803882599, | |
| "epoch": 1.2046445413292997, | |
| "grad_norm": 0.5703125, | |
| "learning_rate": 1.8681795332247017e-06, | |
| "loss": 0.3352673053741455, | |
| "mean_token_accuracy": 0.8840632468461991, | |
| "num_tokens": 41805087.0, | |
| "step": 6770 | |
| }, | |
| { | |
| "entropy": 0.3422845914959908, | |
| "epoch": 1.2064240590799893, | |
| "grad_norm": 0.78125, | |
| "learning_rate": 1.8610664236536402e-06, | |
| "loss": 0.34624130725860597, | |
| "mean_token_accuracy": 0.8821140199899673, | |
| "num_tokens": 41866921.0, | |
| "step": 6780 | |
| }, | |
| { | |
| "entropy": 0.3141391173005104, | |
| "epoch": 1.208203576830679, | |
| "grad_norm": 0.7265625, | |
| "learning_rate": 1.8539588436858102e-06, | |
| "loss": 0.31454594135284425, | |
| "mean_token_accuracy": 0.8926339834928513, | |
| "num_tokens": 41927523.0, | |
| "step": 6790 | |
| }, | |
| { | |
| "entropy": 0.34032327979803084, | |
| "epoch": 1.2099830945813685, | |
| "grad_norm": 0.72265625, | |
| "learning_rate": 1.846856854833237e-06, | |
| "loss": 0.3403328418731689, | |
| "mean_token_accuracy": 0.8833697289228439, | |
| "num_tokens": 41990832.0, | |
| "step": 6800 | |
| }, | |
| { | |
| "entropy": 0.3438625819981098, | |
| "epoch": 1.211762612332058, | |
| "grad_norm": 0.828125, | |
| "learning_rate": 1.839760518559554e-06, | |
| "loss": 0.34128901958465574, | |
| "mean_token_accuracy": 0.8833727329969406, | |
| "num_tokens": 42051254.0, | |
| "step": 6810 | |
| }, | |
| { | |
| "entropy": 0.31954195946455, | |
| "epoch": 1.2135421300827476, | |
| "grad_norm": 0.76953125, | |
| "learning_rate": 1.8326698962794793e-06, | |
| "loss": 0.3154443264007568, | |
| "mean_token_accuracy": 0.8895681113004684, | |
| "num_tokens": 42112870.0, | |
| "step": 6820 | |
| }, | |
| { | |
| "entropy": 0.33622306734323504, | |
| "epoch": 1.2153216478334372, | |
| "grad_norm": 0.703125, | |
| "learning_rate": 1.825585049358275e-06, | |
| "loss": 0.33228607177734376, | |
| "mean_token_accuracy": 0.8831908792257309, | |
| "num_tokens": 42170199.0, | |
| "step": 6830 | |
| }, | |
| { | |
| "entropy": 0.3599790006875992, | |
| "epoch": 1.2171011655841266, | |
| "grad_norm": 0.796875, | |
| "learning_rate": 1.8185060391112248e-06, | |
| "loss": 0.3648702383041382, | |
| "mean_token_accuracy": 0.8752429783344269, | |
| "num_tokens": 42230091.0, | |
| "step": 6840 | |
| }, | |
| { | |
| "entropy": 0.33258122578263283, | |
| "epoch": 1.2188806833348163, | |
| "grad_norm": 0.6640625, | |
| "learning_rate": 1.8114329268030973e-06, | |
| "loss": 0.32865903377532957, | |
| "mean_token_accuracy": 0.8861372381448746, | |
| "num_tokens": 42292308.0, | |
| "step": 6850 | |
| }, | |
| { | |
| "entropy": 0.33804669305682183, | |
| "epoch": 1.2206602010855059, | |
| "grad_norm": 0.71875, | |
| "learning_rate": 1.8043657736476177e-06, | |
| "loss": 0.3403555631637573, | |
| "mean_token_accuracy": 0.882288470864296, | |
| "num_tokens": 42358315.0, | |
| "step": 6860 | |
| }, | |
| { | |
| "entropy": 0.30098615810275076, | |
| "epoch": 1.2224397188361955, | |
| "grad_norm": 0.61328125, | |
| "learning_rate": 1.79730464080694e-06, | |
| "loss": 0.29600207805633544, | |
| "mean_token_accuracy": 0.8975545167922974, | |
| "num_tokens": 42420777.0, | |
| "step": 6870 | |
| }, | |
| { | |
| "entropy": 0.3088440358638763, | |
| "epoch": 1.224219236586885, | |
| "grad_norm": 0.6640625, | |
| "learning_rate": 1.790249589391112e-06, | |
| "loss": 0.30383594036102296, | |
| "mean_token_accuracy": 0.896770778298378, | |
| "num_tokens": 42479025.0, | |
| "step": 6880 | |
| }, | |
| { | |
| "entropy": 0.3324041463434696, | |
| "epoch": 1.2259987543375745, | |
| "grad_norm": 0.7421875, | |
| "learning_rate": 1.7832006804575558e-06, | |
| "loss": 0.32544784545898436, | |
| "mean_token_accuracy": 0.8882332682609558, | |
| "num_tokens": 42542454.0, | |
| "step": 6890 | |
| }, | |
| { | |
| "entropy": 0.29980617538094523, | |
| "epoch": 1.2277782720882642, | |
| "grad_norm": 0.69140625, | |
| "learning_rate": 1.7761579750105275e-06, | |
| "loss": 0.2965404987335205, | |
| "mean_token_accuracy": 0.8998603194952011, | |
| "num_tokens": 42603036.0, | |
| "step": 6900 | |
| }, | |
| { | |
| "entropy": 0.33238585740327836, | |
| "epoch": 1.2295577898389536, | |
| "grad_norm": 0.83984375, | |
| "learning_rate": 1.7691215340006013e-06, | |
| "loss": 0.3291919231414795, | |
| "mean_token_accuracy": 0.8872955650091171, | |
| "num_tokens": 42663636.0, | |
| "step": 6910 | |
| }, | |
| { | |
| "entropy": 0.3531717598438263, | |
| "epoch": 1.2313373075896432, | |
| "grad_norm": 0.7421875, | |
| "learning_rate": 1.7620914183241343e-06, | |
| "loss": 0.35305089950561525, | |
| "mean_token_accuracy": 0.8783060044050217, | |
| "num_tokens": 42725283.0, | |
| "step": 6920 | |
| }, | |
| { | |
| "entropy": 0.2961632959544659, | |
| "epoch": 1.2331168253403328, | |
| "grad_norm": 0.6796875, | |
| "learning_rate": 1.7550676888227384e-06, | |
| "loss": 0.289636492729187, | |
| "mean_token_accuracy": 0.9009805649518967, | |
| "num_tokens": 42782049.0, | |
| "step": 6930 | |
| }, | |
| { | |
| "entropy": 0.31958863213658334, | |
| "epoch": 1.2348963430910223, | |
| "grad_norm": 0.65234375, | |
| "learning_rate": 1.7480504062827624e-06, | |
| "loss": 0.3198336362838745, | |
| "mean_token_accuracy": 0.8904768764972687, | |
| "num_tokens": 42846369.0, | |
| "step": 6940 | |
| }, | |
| { | |
| "entropy": 0.2919312186539173, | |
| "epoch": 1.2366758608417119, | |
| "grad_norm": 0.66015625, | |
| "learning_rate": 1.741039631434755e-06, | |
| "loss": 0.29471306800842284, | |
| "mean_token_accuracy": 0.9014884948730468, | |
| "num_tokens": 42904504.0, | |
| "step": 6950 | |
| }, | |
| { | |
| "entropy": 0.3211238384246826, | |
| "epoch": 1.2384553785924015, | |
| "grad_norm": 0.71875, | |
| "learning_rate": 1.7340354249529485e-06, | |
| "loss": 0.31960334777832033, | |
| "mean_token_accuracy": 0.8921381384134293, | |
| "num_tokens": 42962870.0, | |
| "step": 6960 | |
| }, | |
| { | |
| "entropy": 0.31605843752622603, | |
| "epoch": 1.240234896343091, | |
| "grad_norm": 0.859375, | |
| "learning_rate": 1.7270378474547268e-06, | |
| "loss": 0.31270034313201905, | |
| "mean_token_accuracy": 0.8933271408081055, | |
| "num_tokens": 43021493.0, | |
| "step": 6970 | |
| }, | |
| { | |
| "entropy": 0.3293205611407757, | |
| "epoch": 1.2420144140937805, | |
| "grad_norm": 0.71484375, | |
| "learning_rate": 1.7200469595001063e-06, | |
| "loss": 0.33206079006195066, | |
| "mean_token_accuracy": 0.887144660949707, | |
| "num_tokens": 43083781.0, | |
| "step": 6980 | |
| }, | |
| { | |
| "entropy": 0.3170642703771591, | |
| "epoch": 1.2437939318444702, | |
| "grad_norm": 0.828125, | |
| "learning_rate": 1.7130628215912088e-06, | |
| "loss": 0.31469810009002686, | |
| "mean_token_accuracy": 0.8914343833923339, | |
| "num_tokens": 43144172.0, | |
| "step": 6990 | |
| }, | |
| { | |
| "entropy": 0.3084431208670139, | |
| "epoch": 1.2455734495951596, | |
| "grad_norm": 0.63671875, | |
| "learning_rate": 1.7060854941717359e-06, | |
| "loss": 0.3069377660751343, | |
| "mean_token_accuracy": 0.8941071331501007, | |
| "num_tokens": 43211876.0, | |
| "step": 7000 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 11240, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 2, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 4.391328755503104e+17, | |
| "train_batch_size": 4, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |