Text Generation
PEFT
Safetensors
Transformers
English
lora
sft
trl
conversational
Eval Results (legacy)
Instructions to use loris3/OLMo-2-0425-1B_tulu-3-sft-olmo-2-mixture-0225_lr0.0001_seed42 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use loris3/OLMo-2-0425-1B_tulu-3-sft-olmo-2-mixture-0225_lr0.0001_seed42 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("allenai/OLMo-2-0425-1B") model = PeftModel.from_pretrained(base_model, "loris3/OLMo-2-0425-1B_tulu-3-sft-olmo-2-mixture-0225_lr0.0001_seed42") - Transformers
How to use loris3/OLMo-2-0425-1B_tulu-3-sft-olmo-2-mixture-0225_lr0.0001_seed42 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="loris3/OLMo-2-0425-1B_tulu-3-sft-olmo-2-mixture-0225_lr0.0001_seed42") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("loris3/OLMo-2-0425-1B_tulu-3-sft-olmo-2-mixture-0225_lr0.0001_seed42", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use loris3/OLMo-2-0425-1B_tulu-3-sft-olmo-2-mixture-0225_lr0.0001_seed42 with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "loris3/OLMo-2-0425-1B_tulu-3-sft-olmo-2-mixture-0225_lr0.0001_seed42" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "loris3/OLMo-2-0425-1B_tulu-3-sft-olmo-2-mixture-0225_lr0.0001_seed42", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/loris3/OLMo-2-0425-1B_tulu-3-sft-olmo-2-mixture-0225_lr0.0001_seed42
- SGLang
How to use loris3/OLMo-2-0425-1B_tulu-3-sft-olmo-2-mixture-0225_lr0.0001_seed42 with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "loris3/OLMo-2-0425-1B_tulu-3-sft-olmo-2-mixture-0225_lr0.0001_seed42" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "loris3/OLMo-2-0425-1B_tulu-3-sft-olmo-2-mixture-0225_lr0.0001_seed42", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "loris3/OLMo-2-0425-1B_tulu-3-sft-olmo-2-mixture-0225_lr0.0001_seed42" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "loris3/OLMo-2-0425-1B_tulu-3-sft-olmo-2-mixture-0225_lr0.0001_seed42", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use loris3/OLMo-2-0425-1B_tulu-3-sft-olmo-2-mixture-0225_lr0.0001_seed42 with Docker Model Runner:
docker model run hf.co/loris3/OLMo-2-0425-1B_tulu-3-sft-olmo-2-mixture-0225_lr0.0001_seed42
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 1.0, | |
| "eval_steps": 500, | |
| "global_step": 6767, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 1.5304893136024476, | |
| "epoch": 0.001477814312631618, | |
| "grad_norm": 0.11065268516540527, | |
| "learning_rate": 9.98670016255357e-05, | |
| "loss": 1.2253, | |
| "mean_token_accuracy": 0.713296040892601, | |
| "num_tokens": 634372.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 1.5232050925493241, | |
| "epoch": 0.002955628625263236, | |
| "grad_norm": 0.11062215268611908, | |
| "learning_rate": 9.971922565390867e-05, | |
| "loss": 1.1733, | |
| "mean_token_accuracy": 0.7147852033376694, | |
| "num_tokens": 1272340.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 1.4792076826095581, | |
| "epoch": 0.004433442937894854, | |
| "grad_norm": 0.1127617210149765, | |
| "learning_rate": 9.957144968228167e-05, | |
| "loss": 1.1469, | |
| "mean_token_accuracy": 0.7173507429659367, | |
| "num_tokens": 1904586.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 1.4591812424361705, | |
| "epoch": 0.005911257250526472, | |
| "grad_norm": 0.06614726036787033, | |
| "learning_rate": 9.942367371065465e-05, | |
| "loss": 1.131, | |
| "mean_token_accuracy": 0.7204256772994995, | |
| "num_tokens": 2533557.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 1.42888495773077, | |
| "epoch": 0.007389071563158089, | |
| "grad_norm": 0.054086439311504364, | |
| "learning_rate": 9.927589773902763e-05, | |
| "loss": 1.0564, | |
| "mean_token_accuracy": 0.7316170297563076, | |
| "num_tokens": 3159795.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 1.3907018028199674, | |
| "epoch": 0.008866885875789708, | |
| "grad_norm": 0.05579997971653938, | |
| "learning_rate": 9.912812176740062e-05, | |
| "loss": 1.0595, | |
| "mean_token_accuracy": 0.7346745491027832, | |
| "num_tokens": 3787086.0, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 1.4462938398122787, | |
| "epoch": 0.010344700188421325, | |
| "grad_norm": 0.06100340187549591, | |
| "learning_rate": 9.898034579577361e-05, | |
| "loss": 1.1241, | |
| "mean_token_accuracy": 0.7200969859957695, | |
| "num_tokens": 4404928.0, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 1.443135815113783, | |
| "epoch": 0.011822514501052943, | |
| "grad_norm": 0.05758308619260788, | |
| "learning_rate": 9.88325698241466e-05, | |
| "loss": 1.1179, | |
| "mean_token_accuracy": 0.7207777500152588, | |
| "num_tokens": 5055890.0, | |
| "step": 80 | |
| }, | |
| { | |
| "entropy": 1.4378912061452866, | |
| "epoch": 0.01330032881368456, | |
| "grad_norm": 0.0707370936870575, | |
| "learning_rate": 9.868479385251959e-05, | |
| "loss": 1.1078, | |
| "mean_token_accuracy": 0.7260331742465496, | |
| "num_tokens": 5694020.0, | |
| "step": 90 | |
| }, | |
| { | |
| "entropy": 1.4321013674139977, | |
| "epoch": 0.014778143126316179, | |
| "grad_norm": 0.06243390962481499, | |
| "learning_rate": 9.853701788089256e-05, | |
| "loss": 1.101, | |
| "mean_token_accuracy": 0.7271535098552704, | |
| "num_tokens": 6330552.0, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 1.3873297058045864, | |
| "epoch": 0.016255957438947796, | |
| "grad_norm": 0.06713827699422836, | |
| "learning_rate": 9.838924190926556e-05, | |
| "loss": 1.0808, | |
| "mean_token_accuracy": 0.7296842932701111, | |
| "num_tokens": 6969739.0, | |
| "step": 110 | |
| }, | |
| { | |
| "entropy": 1.4041674077510833, | |
| "epoch": 0.017733771751579416, | |
| "grad_norm": 0.06167087331414223, | |
| "learning_rate": 9.824146593763854e-05, | |
| "loss": 1.0935, | |
| "mean_token_accuracy": 0.7287170954048634, | |
| "num_tokens": 7599906.0, | |
| "step": 120 | |
| }, | |
| { | |
| "entropy": 1.4082320772111416, | |
| "epoch": 0.01921158606421103, | |
| "grad_norm": 0.06408118456602097, | |
| "learning_rate": 9.809368996601153e-05, | |
| "loss": 1.0725, | |
| "mean_token_accuracy": 0.7312771216034889, | |
| "num_tokens": 8240783.0, | |
| "step": 130 | |
| }, | |
| { | |
| "entropy": 1.438713125884533, | |
| "epoch": 0.02068940037684265, | |
| "grad_norm": 0.07518143951892853, | |
| "learning_rate": 9.794591399438452e-05, | |
| "loss": 1.1073, | |
| "mean_token_accuracy": 0.721763364970684, | |
| "num_tokens": 8861604.0, | |
| "step": 140 | |
| }, | |
| { | |
| "entropy": 1.40254572853446, | |
| "epoch": 0.022167214689474267, | |
| "grad_norm": 0.07152130454778671, | |
| "learning_rate": 9.77981380227575e-05, | |
| "loss": 1.0691, | |
| "mean_token_accuracy": 0.7301274545490741, | |
| "num_tokens": 9519424.0, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 1.4247990146279335, | |
| "epoch": 0.023645029002105886, | |
| "grad_norm": 0.06787216663360596, | |
| "learning_rate": 9.765036205113049e-05, | |
| "loss": 1.1106, | |
| "mean_token_accuracy": 0.7254596322774887, | |
| "num_tokens": 10149741.0, | |
| "step": 160 | |
| }, | |
| { | |
| "entropy": 1.3974801175296307, | |
| "epoch": 0.025122843314737502, | |
| "grad_norm": 0.07307117432355881, | |
| "learning_rate": 9.750258607950348e-05, | |
| "loss": 1.0634, | |
| "mean_token_accuracy": 0.7332775875926018, | |
| "num_tokens": 10782594.0, | |
| "step": 170 | |
| }, | |
| { | |
| "entropy": 1.3781036920845509, | |
| "epoch": 0.02660065762736912, | |
| "grad_norm": 0.07379572093486786, | |
| "learning_rate": 9.735481010787646e-05, | |
| "loss": 1.06, | |
| "mean_token_accuracy": 0.731862985342741, | |
| "num_tokens": 11421889.0, | |
| "step": 180 | |
| }, | |
| { | |
| "entropy": 1.3866104505956174, | |
| "epoch": 0.028078471940000738, | |
| "grad_norm": 0.06865496188402176, | |
| "learning_rate": 9.720703413624946e-05, | |
| "loss": 1.0457, | |
| "mean_token_accuracy": 0.7345983348786831, | |
| "num_tokens": 12037438.0, | |
| "step": 190 | |
| }, | |
| { | |
| "entropy": 1.3649713568389417, | |
| "epoch": 0.029556286252632357, | |
| "grad_norm": 0.08302357792854309, | |
| "learning_rate": 9.705925816462243e-05, | |
| "loss": 1.0281, | |
| "mean_token_accuracy": 0.7428084775805474, | |
| "num_tokens": 12668446.0, | |
| "step": 200 | |
| }, | |
| { | |
| "entropy": 1.3744140148162842, | |
| "epoch": 0.031034100565263973, | |
| "grad_norm": 0.07769942283630371, | |
| "learning_rate": 9.691148219299543e-05, | |
| "loss": 1.0554, | |
| "mean_token_accuracy": 0.734387868642807, | |
| "num_tokens": 13293305.0, | |
| "step": 210 | |
| }, | |
| { | |
| "entropy": 1.4095868960022926, | |
| "epoch": 0.03251191487789559, | |
| "grad_norm": 0.06871581077575684, | |
| "learning_rate": 9.676370622136841e-05, | |
| "loss": 1.074, | |
| "mean_token_accuracy": 0.7270821079611778, | |
| "num_tokens": 13924324.0, | |
| "step": 220 | |
| }, | |
| { | |
| "entropy": 1.3864221736788749, | |
| "epoch": 0.03398972919052721, | |
| "grad_norm": 0.07095455378293991, | |
| "learning_rate": 9.66159302497414e-05, | |
| "loss": 1.0347, | |
| "mean_token_accuracy": 0.7366894610226155, | |
| "num_tokens": 14541764.0, | |
| "step": 230 | |
| }, | |
| { | |
| "entropy": 1.4184685163199902, | |
| "epoch": 0.03546754350315883, | |
| "grad_norm": 0.07504931837320328, | |
| "learning_rate": 9.646815427811438e-05, | |
| "loss": 1.0532, | |
| "mean_token_accuracy": 0.7369042620062828, | |
| "num_tokens": 15187630.0, | |
| "step": 240 | |
| }, | |
| { | |
| "entropy": 1.4156867913901805, | |
| "epoch": 0.03694535781579045, | |
| "grad_norm": 0.0802634209394455, | |
| "learning_rate": 9.632037830648737e-05, | |
| "loss": 1.1036, | |
| "mean_token_accuracy": 0.7283115215599537, | |
| "num_tokens": 15846809.0, | |
| "step": 250 | |
| }, | |
| { | |
| "entropy": 1.4105734363198281, | |
| "epoch": 0.03842317212842206, | |
| "grad_norm": 0.07708612084388733, | |
| "learning_rate": 9.617260233486035e-05, | |
| "loss": 1.0768, | |
| "mean_token_accuracy": 0.7296842828392982, | |
| "num_tokens": 16478085.0, | |
| "step": 260 | |
| }, | |
| { | |
| "entropy": 1.382845190167427, | |
| "epoch": 0.03990098644105368, | |
| "grad_norm": 0.08279397338628769, | |
| "learning_rate": 9.602482636323335e-05, | |
| "loss": 1.0515, | |
| "mean_token_accuracy": 0.7347821459174156, | |
| "num_tokens": 17128735.0, | |
| "step": 270 | |
| }, | |
| { | |
| "entropy": 1.4158720895648003, | |
| "epoch": 0.0413788007536853, | |
| "grad_norm": 0.092226542532444, | |
| "learning_rate": 9.587705039160632e-05, | |
| "loss": 1.0609, | |
| "mean_token_accuracy": 0.7326413303613662, | |
| "num_tokens": 17746687.0, | |
| "step": 280 | |
| }, | |
| { | |
| "entropy": 1.3976521752774715, | |
| "epoch": 0.04285661506631692, | |
| "grad_norm": 0.08918865770101547, | |
| "learning_rate": 9.572927441997933e-05, | |
| "loss": 1.0683, | |
| "mean_token_accuracy": 0.7294273987412453, | |
| "num_tokens": 18363963.0, | |
| "step": 290 | |
| }, | |
| { | |
| "entropy": 1.4044050514698028, | |
| "epoch": 0.044334429378948534, | |
| "grad_norm": 0.08644465357065201, | |
| "learning_rate": 9.55814984483523e-05, | |
| "loss": 1.0634, | |
| "mean_token_accuracy": 0.7320508249104023, | |
| "num_tokens": 18993450.0, | |
| "step": 300 | |
| }, | |
| { | |
| "entropy": 1.380122570693493, | |
| "epoch": 0.04581224369158015, | |
| "grad_norm": 0.08921512216329575, | |
| "learning_rate": 9.543372247672529e-05, | |
| "loss": 1.0261, | |
| "mean_token_accuracy": 0.7378858976066113, | |
| "num_tokens": 19620523.0, | |
| "step": 310 | |
| }, | |
| { | |
| "entropy": 1.3815103709697723, | |
| "epoch": 0.04729005800421177, | |
| "grad_norm": 0.08035629242658615, | |
| "learning_rate": 9.528594650509828e-05, | |
| "loss": 1.0659, | |
| "mean_token_accuracy": 0.7323430612683296, | |
| "num_tokens": 20229672.0, | |
| "step": 320 | |
| }, | |
| { | |
| "entropy": 1.4161942921578885, | |
| "epoch": 0.04876787231684339, | |
| "grad_norm": 0.09145661443471909, | |
| "learning_rate": 9.513817053347127e-05, | |
| "loss": 1.0993, | |
| "mean_token_accuracy": 0.7256109490990639, | |
| "num_tokens": 20856211.0, | |
| "step": 330 | |
| }, | |
| { | |
| "entropy": 1.3907759122550487, | |
| "epoch": 0.050245686629475005, | |
| "grad_norm": 0.08255486935377121, | |
| "learning_rate": 9.499039456184425e-05, | |
| "loss": 1.0525, | |
| "mean_token_accuracy": 0.7357108578085899, | |
| "num_tokens": 21467622.0, | |
| "step": 340 | |
| }, | |
| { | |
| "entropy": 1.375921645760536, | |
| "epoch": 0.05172350094210663, | |
| "grad_norm": 0.08248364925384521, | |
| "learning_rate": 9.484261859021724e-05, | |
| "loss": 1.0306, | |
| "mean_token_accuracy": 0.7383193828165531, | |
| "num_tokens": 22109771.0, | |
| "step": 350 | |
| }, | |
| { | |
| "entropy": 1.3706233829259873, | |
| "epoch": 0.05320131525473824, | |
| "grad_norm": 0.08424954116344452, | |
| "learning_rate": 9.469484261859022e-05, | |
| "loss": 1.0289, | |
| "mean_token_accuracy": 0.7390523985028267, | |
| "num_tokens": 22717652.0, | |
| "step": 360 | |
| }, | |
| { | |
| "entropy": 1.392815312743187, | |
| "epoch": 0.05467912956736986, | |
| "grad_norm": 0.09112072736024857, | |
| "learning_rate": 9.454706664696322e-05, | |
| "loss": 1.0619, | |
| "mean_token_accuracy": 0.7333372481167316, | |
| "num_tokens": 23324578.0, | |
| "step": 370 | |
| }, | |
| { | |
| "entropy": 1.3739952459931373, | |
| "epoch": 0.056156943880001475, | |
| "grad_norm": 0.08004885166883469, | |
| "learning_rate": 9.439929067533619e-05, | |
| "loss": 1.0574, | |
| "mean_token_accuracy": 0.730328020453453, | |
| "num_tokens": 23957383.0, | |
| "step": 380 | |
| }, | |
| { | |
| "entropy": 1.3788554146885872, | |
| "epoch": 0.0576347581926331, | |
| "grad_norm": 0.08307195454835892, | |
| "learning_rate": 9.425151470370918e-05, | |
| "loss": 1.0637, | |
| "mean_token_accuracy": 0.7303956717252731, | |
| "num_tokens": 24585296.0, | |
| "step": 390 | |
| }, | |
| { | |
| "entropy": 1.4142395369708538, | |
| "epoch": 0.059112572505264714, | |
| "grad_norm": 0.08236826956272125, | |
| "learning_rate": 9.410373873208217e-05, | |
| "loss": 1.1018, | |
| "mean_token_accuracy": 0.7251050278544426, | |
| "num_tokens": 25217211.0, | |
| "step": 400 | |
| }, | |
| { | |
| "entropy": 1.3920598179101944, | |
| "epoch": 0.06059038681789633, | |
| "grad_norm": 0.0988270491361618, | |
| "learning_rate": 9.395596276045516e-05, | |
| "loss": 1.0377, | |
| "mean_token_accuracy": 0.7389338552951813, | |
| "num_tokens": 25844862.0, | |
| "step": 410 | |
| }, | |
| { | |
| "entropy": 1.3850713059306146, | |
| "epoch": 0.062068201130527946, | |
| "grad_norm": 0.08349768072366714, | |
| "learning_rate": 9.380818678882815e-05, | |
| "loss": 1.0655, | |
| "mean_token_accuracy": 0.7277355805039406, | |
| "num_tokens": 26460555.0, | |
| "step": 420 | |
| }, | |
| { | |
| "entropy": 1.3950319290161133, | |
| "epoch": 0.06354601544315956, | |
| "grad_norm": 0.08391372114419937, | |
| "learning_rate": 9.366041081720113e-05, | |
| "loss": 1.0581, | |
| "mean_token_accuracy": 0.7355390675365925, | |
| "num_tokens": 27086147.0, | |
| "step": 430 | |
| }, | |
| { | |
| "entropy": 1.4254113271832467, | |
| "epoch": 0.06502382975579118, | |
| "grad_norm": 0.09792959690093994, | |
| "learning_rate": 9.351263484557411e-05, | |
| "loss": 1.1253, | |
| "mean_token_accuracy": 0.7227410763502121, | |
| "num_tokens": 27710680.0, | |
| "step": 440 | |
| }, | |
| { | |
| "entropy": 1.3752116419374942, | |
| "epoch": 0.06650164406842281, | |
| "grad_norm": 0.08181757479906082, | |
| "learning_rate": 9.33648588739471e-05, | |
| "loss": 1.0463, | |
| "mean_token_accuracy": 0.7353246711194515, | |
| "num_tokens": 28340440.0, | |
| "step": 450 | |
| }, | |
| { | |
| "entropy": 1.3917047053575515, | |
| "epoch": 0.06797945838105442, | |
| "grad_norm": 0.09203750640153885, | |
| "learning_rate": 9.321708290232009e-05, | |
| "loss": 1.0624, | |
| "mean_token_accuracy": 0.7348892599344253, | |
| "num_tokens": 28966719.0, | |
| "step": 460 | |
| }, | |
| { | |
| "entropy": 1.3774724885821343, | |
| "epoch": 0.06945727269368604, | |
| "grad_norm": 0.09953095763921738, | |
| "learning_rate": 9.306930693069307e-05, | |
| "loss": 1.0465, | |
| "mean_token_accuracy": 0.7373659625649452, | |
| "num_tokens": 29611234.0, | |
| "step": 470 | |
| }, | |
| { | |
| "entropy": 1.3991491951048374, | |
| "epoch": 0.07093508700631766, | |
| "grad_norm": 0.08594824373722076, | |
| "learning_rate": 9.292153095906606e-05, | |
| "loss": 1.0644, | |
| "mean_token_accuracy": 0.7328724160790443, | |
| "num_tokens": 30246408.0, | |
| "step": 480 | |
| }, | |
| { | |
| "entropy": 1.373952978104353, | |
| "epoch": 0.07241290131894927, | |
| "grad_norm": 0.0813300833106041, | |
| "learning_rate": 9.277375498743905e-05, | |
| "loss": 1.0897, | |
| "mean_token_accuracy": 0.7270603954792023, | |
| "num_tokens": 30893806.0, | |
| "step": 490 | |
| }, | |
| { | |
| "entropy": 1.3723024994134903, | |
| "epoch": 0.0738907156315809, | |
| "grad_norm": 0.07812219113111496, | |
| "learning_rate": 9.262597901581204e-05, | |
| "loss": 1.0173, | |
| "mean_token_accuracy": 0.7398755483329296, | |
| "num_tokens": 31532529.0, | |
| "step": 500 | |
| }, | |
| { | |
| "entropy": 1.338401772081852, | |
| "epoch": 0.0753685299442125, | |
| "grad_norm": 0.08471836894750595, | |
| "learning_rate": 9.247820304418501e-05, | |
| "loss": 1.0197, | |
| "mean_token_accuracy": 0.7419663660228253, | |
| "num_tokens": 32174902.0, | |
| "step": 510 | |
| }, | |
| { | |
| "entropy": 1.4127553194761275, | |
| "epoch": 0.07684634425684413, | |
| "grad_norm": 0.09702274203300476, | |
| "learning_rate": 9.2330427072558e-05, | |
| "loss": 1.0963, | |
| "mean_token_accuracy": 0.7259891100227833, | |
| "num_tokens": 32792820.0, | |
| "step": 520 | |
| }, | |
| { | |
| "entropy": 1.3952218279242516, | |
| "epoch": 0.07832415856947575, | |
| "grad_norm": 0.08955958485603333, | |
| "learning_rate": 9.218265110093099e-05, | |
| "loss": 1.0803, | |
| "mean_token_accuracy": 0.7294512584805488, | |
| "num_tokens": 33434685.0, | |
| "step": 530 | |
| }, | |
| { | |
| "entropy": 1.352259347587824, | |
| "epoch": 0.07980197288210736, | |
| "grad_norm": 0.08365257829427719, | |
| "learning_rate": 9.203487512930398e-05, | |
| "loss": 1.039, | |
| "mean_token_accuracy": 0.7357416793704032, | |
| "num_tokens": 34085251.0, | |
| "step": 540 | |
| }, | |
| { | |
| "entropy": 1.3604788549244404, | |
| "epoch": 0.08127978719473898, | |
| "grad_norm": 0.08095045387744904, | |
| "learning_rate": 9.188709915767697e-05, | |
| "loss": 1.0577, | |
| "mean_token_accuracy": 0.7318811133503914, | |
| "num_tokens": 34722551.0, | |
| "step": 550 | |
| }, | |
| { | |
| "entropy": 1.3773885890841484, | |
| "epoch": 0.0827576015073706, | |
| "grad_norm": 0.10368340462446213, | |
| "learning_rate": 9.173932318604995e-05, | |
| "loss": 1.0496, | |
| "mean_token_accuracy": 0.7356349483132363, | |
| "num_tokens": 35339209.0, | |
| "step": 560 | |
| }, | |
| { | |
| "entropy": 1.3895627804100514, | |
| "epoch": 0.08423541582000221, | |
| "grad_norm": 0.09198153764009476, | |
| "learning_rate": 9.159154721442293e-05, | |
| "loss": 1.067, | |
| "mean_token_accuracy": 0.7346835978329181, | |
| "num_tokens": 35979698.0, | |
| "step": 570 | |
| }, | |
| { | |
| "entropy": 1.4322662442922591, | |
| "epoch": 0.08571323013263384, | |
| "grad_norm": 0.09510086476802826, | |
| "learning_rate": 9.144377124279593e-05, | |
| "loss": 1.0945, | |
| "mean_token_accuracy": 0.7262316733598709, | |
| "num_tokens": 36595329.0, | |
| "step": 580 | |
| }, | |
| { | |
| "entropy": 1.350172371417284, | |
| "epoch": 0.08719104444526546, | |
| "grad_norm": 0.08246901631355286, | |
| "learning_rate": 9.12959952711689e-05, | |
| "loss": 0.9963, | |
| "mean_token_accuracy": 0.7426011696457863, | |
| "num_tokens": 37217852.0, | |
| "step": 590 | |
| }, | |
| { | |
| "entropy": 1.3493722938001156, | |
| "epoch": 0.08866885875789707, | |
| "grad_norm": 0.08438783884048462, | |
| "learning_rate": 9.114821929954191e-05, | |
| "loss": 1.0137, | |
| "mean_token_accuracy": 0.7415332272648811, | |
| "num_tokens": 37854800.0, | |
| "step": 600 | |
| }, | |
| { | |
| "entropy": 1.389697627723217, | |
| "epoch": 0.09014667307052869, | |
| "grad_norm": 0.09821821004152298, | |
| "learning_rate": 9.100044332791488e-05, | |
| "loss": 1.0249, | |
| "mean_token_accuracy": 0.7392405845224858, | |
| "num_tokens": 38471395.0, | |
| "step": 610 | |
| }, | |
| { | |
| "entropy": 1.4111714124679566, | |
| "epoch": 0.0916244873831603, | |
| "grad_norm": 0.09100645780563354, | |
| "learning_rate": 9.085266735628787e-05, | |
| "loss": 1.1025, | |
| "mean_token_accuracy": 0.7256681717932224, | |
| "num_tokens": 39096618.0, | |
| "step": 620 | |
| }, | |
| { | |
| "entropy": 1.3662530906498431, | |
| "epoch": 0.09310230169579192, | |
| "grad_norm": 0.13060341775417328, | |
| "learning_rate": 9.070489138466086e-05, | |
| "loss": 1.0629, | |
| "mean_token_accuracy": 0.7316286444664002, | |
| "num_tokens": 39703580.0, | |
| "step": 630 | |
| }, | |
| { | |
| "entropy": 1.3668909780681133, | |
| "epoch": 0.09458011600842355, | |
| "grad_norm": 0.10613272339105606, | |
| "learning_rate": 9.055711541303385e-05, | |
| "loss": 1.0375, | |
| "mean_token_accuracy": 0.7359757006168366, | |
| "num_tokens": 40343514.0, | |
| "step": 640 | |
| }, | |
| { | |
| "entropy": 1.3518067069351674, | |
| "epoch": 0.09605793032105515, | |
| "grad_norm": 0.08057314902544022, | |
| "learning_rate": 9.040933944140682e-05, | |
| "loss": 1.0281, | |
| "mean_token_accuracy": 0.7392694905400277, | |
| "num_tokens": 40973391.0, | |
| "step": 650 | |
| }, | |
| { | |
| "entropy": 1.3239390894770622, | |
| "epoch": 0.09753574463368678, | |
| "grad_norm": 0.08244802802801132, | |
| "learning_rate": 9.026156346977982e-05, | |
| "loss": 1.0276, | |
| "mean_token_accuracy": 0.7396696552634239, | |
| "num_tokens": 41623645.0, | |
| "step": 660 | |
| }, | |
| { | |
| "entropy": 1.3552034579217433, | |
| "epoch": 0.0990135589463184, | |
| "grad_norm": 0.08738582581281662, | |
| "learning_rate": 9.01137874981528e-05, | |
| "loss": 1.0264, | |
| "mean_token_accuracy": 0.7368874847888947, | |
| "num_tokens": 42279334.0, | |
| "step": 670 | |
| }, | |
| { | |
| "entropy": 1.3737920597195625, | |
| "epoch": 0.10049137325895001, | |
| "grad_norm": 0.09264443069696426, | |
| "learning_rate": 8.99660115265258e-05, | |
| "loss": 1.0064, | |
| "mean_token_accuracy": 0.7462978705763816, | |
| "num_tokens": 42882194.0, | |
| "step": 680 | |
| }, | |
| { | |
| "entropy": 1.3388465084135532, | |
| "epoch": 0.10196918757158163, | |
| "grad_norm": 0.09516231715679169, | |
| "learning_rate": 8.981823555489877e-05, | |
| "loss": 1.0386, | |
| "mean_token_accuracy": 0.7378973692655564, | |
| "num_tokens": 43529617.0, | |
| "step": 690 | |
| }, | |
| { | |
| "entropy": 1.3471161246299743, | |
| "epoch": 0.10344700188421325, | |
| "grad_norm": 0.08873550593852997, | |
| "learning_rate": 8.967045958327176e-05, | |
| "loss": 1.0281, | |
| "mean_token_accuracy": 0.7418588995933533, | |
| "num_tokens": 44181958.0, | |
| "step": 700 | |
| }, | |
| { | |
| "entropy": 1.3766934528946877, | |
| "epoch": 0.10492481619684486, | |
| "grad_norm": 0.08453412353992462, | |
| "learning_rate": 8.952268361164475e-05, | |
| "loss": 1.0681, | |
| "mean_token_accuracy": 0.729092076420784, | |
| "num_tokens": 44820009.0, | |
| "step": 710 | |
| }, | |
| { | |
| "entropy": 1.3845791950821877, | |
| "epoch": 0.10640263050947649, | |
| "grad_norm": 0.09360987693071365, | |
| "learning_rate": 8.937490764001774e-05, | |
| "loss": 1.0586, | |
| "mean_token_accuracy": 0.7347254164516925, | |
| "num_tokens": 45452740.0, | |
| "step": 720 | |
| }, | |
| { | |
| "entropy": 1.3411042720079422, | |
| "epoch": 0.1078804448221081, | |
| "grad_norm": 0.09737925231456757, | |
| "learning_rate": 8.922713166839073e-05, | |
| "loss": 1.0474, | |
| "mean_token_accuracy": 0.7368136189877987, | |
| "num_tokens": 46073470.0, | |
| "step": 730 | |
| }, | |
| { | |
| "entropy": 1.3904819071292878, | |
| "epoch": 0.10935825913473972, | |
| "grad_norm": 0.09909042716026306, | |
| "learning_rate": 8.907935569676372e-05, | |
| "loss": 1.0606, | |
| "mean_token_accuracy": 0.7374630443751812, | |
| "num_tokens": 46711803.0, | |
| "step": 740 | |
| }, | |
| { | |
| "entropy": 1.3583513878285884, | |
| "epoch": 0.11083607344737134, | |
| "grad_norm": 0.09460269659757614, | |
| "learning_rate": 8.893157972513669e-05, | |
| "loss": 1.0488, | |
| "mean_token_accuracy": 0.7376768283545971, | |
| "num_tokens": 47331676.0, | |
| "step": 750 | |
| }, | |
| { | |
| "entropy": 1.3419748917222023, | |
| "epoch": 0.11231388776000295, | |
| "grad_norm": 0.09834811091423035, | |
| "learning_rate": 8.878380375350969e-05, | |
| "loss": 1.008, | |
| "mean_token_accuracy": 0.7432084485888482, | |
| "num_tokens": 47958777.0, | |
| "step": 760 | |
| }, | |
| { | |
| "entropy": 1.3798519670963287, | |
| "epoch": 0.11379170207263457, | |
| "grad_norm": 0.08785253763198853, | |
| "learning_rate": 8.863602778188267e-05, | |
| "loss": 1.0598, | |
| "mean_token_accuracy": 0.7317903161048889, | |
| "num_tokens": 48582722.0, | |
| "step": 770 | |
| }, | |
| { | |
| "entropy": 1.3471085391938686, | |
| "epoch": 0.1152695163852662, | |
| "grad_norm": 0.08993726968765259, | |
| "learning_rate": 8.848825181025565e-05, | |
| "loss": 1.0392, | |
| "mean_token_accuracy": 0.7386498197913169, | |
| "num_tokens": 49199116.0, | |
| "step": 780 | |
| }, | |
| { | |
| "entropy": 1.3162727653980255, | |
| "epoch": 0.1167473306978978, | |
| "grad_norm": 0.09954085201025009, | |
| "learning_rate": 8.834047583862864e-05, | |
| "loss": 1.0419, | |
| "mean_token_accuracy": 0.7357384979724884, | |
| "num_tokens": 49811957.0, | |
| "step": 790 | |
| }, | |
| { | |
| "entropy": 1.383530154824257, | |
| "epoch": 0.11822514501052943, | |
| "grad_norm": 0.09826408326625824, | |
| "learning_rate": 8.819269986700163e-05, | |
| "loss": 1.0666, | |
| "mean_token_accuracy": 0.7305501982569694, | |
| "num_tokens": 50440552.0, | |
| "step": 800 | |
| }, | |
| { | |
| "entropy": 1.3697494626045228, | |
| "epoch": 0.11970295932316105, | |
| "grad_norm": 0.10563326627016068, | |
| "learning_rate": 8.804492389537462e-05, | |
| "loss": 1.0523, | |
| "mean_token_accuracy": 0.7350135810673237, | |
| "num_tokens": 51061803.0, | |
| "step": 810 | |
| }, | |
| { | |
| "entropy": 1.341452068090439, | |
| "epoch": 0.12118077363579266, | |
| "grad_norm": 0.09023787081241608, | |
| "learning_rate": 8.789714792374761e-05, | |
| "loss": 1.0403, | |
| "mean_token_accuracy": 0.7364256352186203, | |
| "num_tokens": 51701844.0, | |
| "step": 820 | |
| }, | |
| { | |
| "entropy": 1.3256843224167825, | |
| "epoch": 0.12265858794842428, | |
| "grad_norm": 0.10398595035076141, | |
| "learning_rate": 8.774937195212058e-05, | |
| "loss": 1.0393, | |
| "mean_token_accuracy": 0.7345196448266507, | |
| "num_tokens": 52321057.0, | |
| "step": 830 | |
| }, | |
| { | |
| "entropy": 1.335525282472372, | |
| "epoch": 0.12413640226105589, | |
| "grad_norm": 0.11134184151887894, | |
| "learning_rate": 8.760159598049358e-05, | |
| "loss": 1.0162, | |
| "mean_token_accuracy": 0.7412177242338658, | |
| "num_tokens": 52951518.0, | |
| "step": 840 | |
| }, | |
| { | |
| "entropy": 1.336845152825117, | |
| "epoch": 0.12561421657368751, | |
| "grad_norm": 0.086946502327919, | |
| "learning_rate": 8.745382000886656e-05, | |
| "loss": 1.0416, | |
| "mean_token_accuracy": 0.7366455979645252, | |
| "num_tokens": 53573218.0, | |
| "step": 850 | |
| }, | |
| { | |
| "entropy": 1.3725450590252877, | |
| "epoch": 0.12709203088631912, | |
| "grad_norm": 0.09215516597032547, | |
| "learning_rate": 8.730604403723956e-05, | |
| "loss": 1.0459, | |
| "mean_token_accuracy": 0.7342949628829956, | |
| "num_tokens": 54222656.0, | |
| "step": 860 | |
| }, | |
| { | |
| "entropy": 1.354390736669302, | |
| "epoch": 0.12856984519895076, | |
| "grad_norm": 0.10038048028945923, | |
| "learning_rate": 8.715826806561254e-05, | |
| "loss": 1.0333, | |
| "mean_token_accuracy": 0.7372442290186882, | |
| "num_tokens": 54842980.0, | |
| "step": 870 | |
| }, | |
| { | |
| "entropy": 1.3338057577610016, | |
| "epoch": 0.13004765951158237, | |
| "grad_norm": 0.10332565754652023, | |
| "learning_rate": 8.701049209398552e-05, | |
| "loss": 1.0016, | |
| "mean_token_accuracy": 0.743568442761898, | |
| "num_tokens": 55470934.0, | |
| "step": 880 | |
| }, | |
| { | |
| "entropy": 1.3483957901597023, | |
| "epoch": 0.13152547382421398, | |
| "grad_norm": 0.10096542537212372, | |
| "learning_rate": 8.686271612235851e-05, | |
| "loss": 1.0178, | |
| "mean_token_accuracy": 0.7382646299898624, | |
| "num_tokens": 56098516.0, | |
| "step": 890 | |
| }, | |
| { | |
| "entropy": 1.355156985670328, | |
| "epoch": 0.13300328813684562, | |
| "grad_norm": 0.09177613258361816, | |
| "learning_rate": 8.67149401507315e-05, | |
| "loss": 1.0531, | |
| "mean_token_accuracy": 0.7352131024003029, | |
| "num_tokens": 56730521.0, | |
| "step": 900 | |
| }, | |
| { | |
| "entropy": 1.3612438417971133, | |
| "epoch": 0.13448110244947722, | |
| "grad_norm": 0.10380206257104874, | |
| "learning_rate": 8.656716417910447e-05, | |
| "loss": 1.0372, | |
| "mean_token_accuracy": 0.7388299435377121, | |
| "num_tokens": 57365578.0, | |
| "step": 910 | |
| }, | |
| { | |
| "entropy": 1.3525446981191636, | |
| "epoch": 0.13595891676210883, | |
| "grad_norm": 0.1035575270652771, | |
| "learning_rate": 8.641938820747746e-05, | |
| "loss": 1.0256, | |
| "mean_token_accuracy": 0.7397286184132099, | |
| "num_tokens": 57981896.0, | |
| "step": 920 | |
| }, | |
| { | |
| "entropy": 1.3687459766864776, | |
| "epoch": 0.13743673107474047, | |
| "grad_norm": 0.11620025336742401, | |
| "learning_rate": 8.627161223585045e-05, | |
| "loss": 1.0773, | |
| "mean_token_accuracy": 0.7295577853918076, | |
| "num_tokens": 58623803.0, | |
| "step": 930 | |
| }, | |
| { | |
| "entropy": 1.2970949046313762, | |
| "epoch": 0.13891454538737208, | |
| "grad_norm": 0.12642642855644226, | |
| "learning_rate": 8.612383626422344e-05, | |
| "loss": 1.0003, | |
| "mean_token_accuracy": 0.7444492764770985, | |
| "num_tokens": 59257549.0, | |
| "step": 940 | |
| }, | |
| { | |
| "entropy": 1.3647193409502507, | |
| "epoch": 0.1403923597000037, | |
| "grad_norm": 0.09129887074232101, | |
| "learning_rate": 8.597606029259643e-05, | |
| "loss": 1.0544, | |
| "mean_token_accuracy": 0.7329595319926738, | |
| "num_tokens": 59904795.0, | |
| "step": 950 | |
| }, | |
| { | |
| "entropy": 1.3711084038019181, | |
| "epoch": 0.14187017401263533, | |
| "grad_norm": 0.09745678305625916, | |
| "learning_rate": 8.582828432096942e-05, | |
| "loss": 1.0401, | |
| "mean_token_accuracy": 0.7385488845407963, | |
| "num_tokens": 60540321.0, | |
| "step": 960 | |
| }, | |
| { | |
| "entropy": 1.3561458587646484, | |
| "epoch": 0.14334798832526693, | |
| "grad_norm": 0.08693372458219528, | |
| "learning_rate": 8.56805083493424e-05, | |
| "loss": 1.0711, | |
| "mean_token_accuracy": 0.7356758877635002, | |
| "num_tokens": 61168133.0, | |
| "step": 970 | |
| }, | |
| { | |
| "entropy": 1.3305564433336259, | |
| "epoch": 0.14482580263789854, | |
| "grad_norm": 0.10192687809467316, | |
| "learning_rate": 8.553273237771538e-05, | |
| "loss": 1.0222, | |
| "mean_token_accuracy": 0.739366453140974, | |
| "num_tokens": 61824608.0, | |
| "step": 980 | |
| }, | |
| { | |
| "entropy": 1.3484657399356366, | |
| "epoch": 0.14630361695053015, | |
| "grad_norm": 0.09656958281993866, | |
| "learning_rate": 8.538495640608838e-05, | |
| "loss": 1.0313, | |
| "mean_token_accuracy": 0.7386878840625286, | |
| "num_tokens": 62461355.0, | |
| "step": 990 | |
| }, | |
| { | |
| "entropy": 1.3336199022829534, | |
| "epoch": 0.1477814312631618, | |
| "grad_norm": 0.10654303431510925, | |
| "learning_rate": 8.523718043446136e-05, | |
| "loss": 1.0015, | |
| "mean_token_accuracy": 0.746137623488903, | |
| "num_tokens": 63078401.0, | |
| "step": 1000 | |
| }, | |
| { | |
| "entropy": 1.3014978118240834, | |
| "epoch": 0.1492592455757934, | |
| "grad_norm": 0.09964130073785782, | |
| "learning_rate": 8.508940446283434e-05, | |
| "loss": 1.0191, | |
| "mean_token_accuracy": 0.7417861059308052, | |
| "num_tokens": 63718537.0, | |
| "step": 1010 | |
| }, | |
| { | |
| "entropy": 1.3399860113859177, | |
| "epoch": 0.150737059888425, | |
| "grad_norm": 0.08968862146139145, | |
| "learning_rate": 8.494162849120733e-05, | |
| "loss": 1.0047, | |
| "mean_token_accuracy": 0.7455361634492874, | |
| "num_tokens": 64338633.0, | |
| "step": 1020 | |
| }, | |
| { | |
| "entropy": 1.3182545930147171, | |
| "epoch": 0.15221487420105664, | |
| "grad_norm": 0.0899863988161087, | |
| "learning_rate": 8.479385251958032e-05, | |
| "loss": 1.0171, | |
| "mean_token_accuracy": 0.7432848289608955, | |
| "num_tokens": 64961975.0, | |
| "step": 1030 | |
| }, | |
| { | |
| "entropy": 1.353651513904333, | |
| "epoch": 0.15369268851368825, | |
| "grad_norm": 0.09297753125429153, | |
| "learning_rate": 8.46460765479533e-05, | |
| "loss": 1.0514, | |
| "mean_token_accuracy": 0.7368421874940395, | |
| "num_tokens": 65609630.0, | |
| "step": 1040 | |
| }, | |
| { | |
| "entropy": 1.3273244500160217, | |
| "epoch": 0.15517050282631986, | |
| "grad_norm": 0.09529486298561096, | |
| "learning_rate": 8.44983005763263e-05, | |
| "loss": 1.009, | |
| "mean_token_accuracy": 0.7426021553575992, | |
| "num_tokens": 66245650.0, | |
| "step": 1050 | |
| }, | |
| { | |
| "entropy": 1.368097710609436, | |
| "epoch": 0.1566483171389515, | |
| "grad_norm": 0.09293153882026672, | |
| "learning_rate": 8.435052460469927e-05, | |
| "loss": 1.0697, | |
| "mean_token_accuracy": 0.7321919746696949, | |
| "num_tokens": 66863639.0, | |
| "step": 1060 | |
| }, | |
| { | |
| "entropy": 1.3512376546859741, | |
| "epoch": 0.1581261314515831, | |
| "grad_norm": 0.1249411553144455, | |
| "learning_rate": 8.420274863307227e-05, | |
| "loss": 1.0413, | |
| "mean_token_accuracy": 0.7379166707396507, | |
| "num_tokens": 67510835.0, | |
| "step": 1070 | |
| }, | |
| { | |
| "entropy": 1.361113614588976, | |
| "epoch": 0.15960394576421472, | |
| "grad_norm": 0.10599677264690399, | |
| "learning_rate": 8.405497266144525e-05, | |
| "loss": 1.0077, | |
| "mean_token_accuracy": 0.7425113163888455, | |
| "num_tokens": 68137204.0, | |
| "step": 1080 | |
| }, | |
| { | |
| "entropy": 1.3219519801437856, | |
| "epoch": 0.16108176007684635, | |
| "grad_norm": 0.10219158232212067, | |
| "learning_rate": 8.390719668981824e-05, | |
| "loss": 0.999, | |
| "mean_token_accuracy": 0.7453721314668655, | |
| "num_tokens": 68763413.0, | |
| "step": 1090 | |
| }, | |
| { | |
| "entropy": 1.3573527745902538, | |
| "epoch": 0.16255957438947796, | |
| "grad_norm": 0.1045592650771141, | |
| "learning_rate": 8.375942071819122e-05, | |
| "loss": 1.0636, | |
| "mean_token_accuracy": 0.72975370362401, | |
| "num_tokens": 69390107.0, | |
| "step": 1100 | |
| }, | |
| { | |
| "entropy": 1.3573613107204436, | |
| "epoch": 0.16403738870210957, | |
| "grad_norm": 0.10745666921138763, | |
| "learning_rate": 8.361164474656421e-05, | |
| "loss": 1.0349, | |
| "mean_token_accuracy": 0.7413250155746937, | |
| "num_tokens": 70010525.0, | |
| "step": 1110 | |
| }, | |
| { | |
| "entropy": 1.3403134599328042, | |
| "epoch": 0.1655152030147412, | |
| "grad_norm": 0.0995827317237854, | |
| "learning_rate": 8.34638687749372e-05, | |
| "loss": 1.0021, | |
| "mean_token_accuracy": 0.7438825242221355, | |
| "num_tokens": 70632944.0, | |
| "step": 1120 | |
| }, | |
| { | |
| "entropy": 1.3671005301177501, | |
| "epoch": 0.16699301732737282, | |
| "grad_norm": 0.0887172594666481, | |
| "learning_rate": 8.331609280331019e-05, | |
| "loss": 1.0582, | |
| "mean_token_accuracy": 0.7311254240572452, | |
| "num_tokens": 71257165.0, | |
| "step": 1130 | |
| }, | |
| { | |
| "entropy": 1.3606456398963929, | |
| "epoch": 0.16847083164000443, | |
| "grad_norm": 0.1006636694073677, | |
| "learning_rate": 8.316831683168316e-05, | |
| "loss": 1.0574, | |
| "mean_token_accuracy": 0.7363891862332821, | |
| "num_tokens": 71875620.0, | |
| "step": 1140 | |
| }, | |
| { | |
| "entropy": 1.3795763775706291, | |
| "epoch": 0.16994864595263606, | |
| "grad_norm": 0.09867120534181595, | |
| "learning_rate": 8.302054086005617e-05, | |
| "loss": 1.0769, | |
| "mean_token_accuracy": 0.7298023782670497, | |
| "num_tokens": 72504275.0, | |
| "step": 1150 | |
| }, | |
| { | |
| "entropy": 1.3562307357788086, | |
| "epoch": 0.17142646026526767, | |
| "grad_norm": 0.09309513121843338, | |
| "learning_rate": 8.287276488842914e-05, | |
| "loss": 1.0693, | |
| "mean_token_accuracy": 0.7304324097931385, | |
| "num_tokens": 73126833.0, | |
| "step": 1160 | |
| }, | |
| { | |
| "entropy": 1.3621578849852085, | |
| "epoch": 0.17290427457789928, | |
| "grad_norm": 0.09566682577133179, | |
| "learning_rate": 8.272498891680214e-05, | |
| "loss": 1.0251, | |
| "mean_token_accuracy": 0.7400626718997956, | |
| "num_tokens": 73752404.0, | |
| "step": 1170 | |
| }, | |
| { | |
| "entropy": 1.4058452486991881, | |
| "epoch": 0.17438208889053092, | |
| "grad_norm": 0.11750762909650803, | |
| "learning_rate": 8.257721294517512e-05, | |
| "loss": 1.0742, | |
| "mean_token_accuracy": 0.7272376365959644, | |
| "num_tokens": 74362684.0, | |
| "step": 1180 | |
| }, | |
| { | |
| "entropy": 1.3896878361701965, | |
| "epoch": 0.17585990320316253, | |
| "grad_norm": 0.09952221810817719, | |
| "learning_rate": 8.24294369735481e-05, | |
| "loss": 1.0586, | |
| "mean_token_accuracy": 0.7340771615505218, | |
| "num_tokens": 75002180.0, | |
| "step": 1190 | |
| }, | |
| { | |
| "entropy": 1.3103776380419732, | |
| "epoch": 0.17733771751579414, | |
| "grad_norm": 0.10058079659938812, | |
| "learning_rate": 8.228166100192109e-05, | |
| "loss": 1.0286, | |
| "mean_token_accuracy": 0.7388425670564175, | |
| "num_tokens": 75614482.0, | |
| "step": 1200 | |
| }, | |
| { | |
| "entropy": 1.3207942619919777, | |
| "epoch": 0.17881553182842574, | |
| "grad_norm": 0.10897091031074524, | |
| "learning_rate": 8.213388503029408e-05, | |
| "loss": 1.0062, | |
| "mean_token_accuracy": 0.7426742933690548, | |
| "num_tokens": 76233339.0, | |
| "step": 1210 | |
| }, | |
| { | |
| "entropy": 1.3723637834191322, | |
| "epoch": 0.18029334614105738, | |
| "grad_norm": 0.10692214965820312, | |
| "learning_rate": 8.198610905866706e-05, | |
| "loss": 1.0752, | |
| "mean_token_accuracy": 0.7321088790893555, | |
| "num_tokens": 76859078.0, | |
| "step": 1220 | |
| }, | |
| { | |
| "entropy": 1.3349768593907356, | |
| "epoch": 0.181771160453689, | |
| "grad_norm": 0.09243787080049515, | |
| "learning_rate": 8.183833308704006e-05, | |
| "loss": 1.0172, | |
| "mean_token_accuracy": 0.7384184874594212, | |
| "num_tokens": 77465601.0, | |
| "step": 1230 | |
| }, | |
| { | |
| "entropy": 1.3455742478370667, | |
| "epoch": 0.1832489747663206, | |
| "grad_norm": 0.10957092046737671, | |
| "learning_rate": 8.169055711541303e-05, | |
| "loss": 1.0392, | |
| "mean_token_accuracy": 0.7363815769553185, | |
| "num_tokens": 78100003.0, | |
| "step": 1240 | |
| }, | |
| { | |
| "entropy": 1.319041520357132, | |
| "epoch": 0.18472678907895224, | |
| "grad_norm": 0.11203034967184067, | |
| "learning_rate": 8.154278114378603e-05, | |
| "loss": 0.9958, | |
| "mean_token_accuracy": 0.7451054699718952, | |
| "num_tokens": 78730233.0, | |
| "step": 1250 | |
| }, | |
| { | |
| "entropy": 1.3591867417097092, | |
| "epoch": 0.18620460339158384, | |
| "grad_norm": 0.09445121139287949, | |
| "learning_rate": 8.139500517215901e-05, | |
| "loss": 1.0607, | |
| "mean_token_accuracy": 0.7338679365813732, | |
| "num_tokens": 79369952.0, | |
| "step": 1260 | |
| }, | |
| { | |
| "entropy": 1.361959970742464, | |
| "epoch": 0.18768241770421545, | |
| "grad_norm": 0.10090041160583496, | |
| "learning_rate": 8.1247229200532e-05, | |
| "loss": 1.033, | |
| "mean_token_accuracy": 0.7382201731204987, | |
| "num_tokens": 79991924.0, | |
| "step": 1270 | |
| }, | |
| { | |
| "entropy": 1.3733899019658566, | |
| "epoch": 0.1891602320168471, | |
| "grad_norm": 0.11175256967544556, | |
| "learning_rate": 8.109945322890499e-05, | |
| "loss": 1.0614, | |
| "mean_token_accuracy": 0.7336510412395001, | |
| "num_tokens": 80624605.0, | |
| "step": 1280 | |
| }, | |
| { | |
| "entropy": 1.3171687975525856, | |
| "epoch": 0.1906380463294787, | |
| "grad_norm": 0.09502006322145462, | |
| "learning_rate": 8.095167725727797e-05, | |
| "loss": 1.0089, | |
| "mean_token_accuracy": 0.7437012106180191, | |
| "num_tokens": 81246229.0, | |
| "step": 1290 | |
| }, | |
| { | |
| "entropy": 1.3213663816452026, | |
| "epoch": 0.1921158606421103, | |
| "grad_norm": 0.09498457610607147, | |
| "learning_rate": 8.080390128565096e-05, | |
| "loss": 1.0026, | |
| "mean_token_accuracy": 0.7472335807979107, | |
| "num_tokens": 81888427.0, | |
| "step": 1300 | |
| }, | |
| { | |
| "entropy": 1.34869996458292, | |
| "epoch": 0.19359367495474195, | |
| "grad_norm": 0.11866965889930725, | |
| "learning_rate": 8.065612531402395e-05, | |
| "loss": 1.0224, | |
| "mean_token_accuracy": 0.740996740013361, | |
| "num_tokens": 82510238.0, | |
| "step": 1310 | |
| }, | |
| { | |
| "entropy": 1.3141113609075545, | |
| "epoch": 0.19507148926737355, | |
| "grad_norm": 0.11258051544427872, | |
| "learning_rate": 8.050834934239692e-05, | |
| "loss": 0.9994, | |
| "mean_token_accuracy": 0.7447339169681072, | |
| "num_tokens": 83147811.0, | |
| "step": 1320 | |
| }, | |
| { | |
| "entropy": 1.3105146937072276, | |
| "epoch": 0.19654930358000516, | |
| "grad_norm": 0.1201222687959671, | |
| "learning_rate": 8.036057337076993e-05, | |
| "loss": 1.015, | |
| "mean_token_accuracy": 0.7396009095013142, | |
| "num_tokens": 83783269.0, | |
| "step": 1330 | |
| }, | |
| { | |
| "entropy": 1.3794904358685016, | |
| "epoch": 0.1980271178926368, | |
| "grad_norm": 0.11637024581432343, | |
| "learning_rate": 8.02127973991429e-05, | |
| "loss": 1.0717, | |
| "mean_token_accuracy": 0.7308213971555233, | |
| "num_tokens": 84434671.0, | |
| "step": 1340 | |
| }, | |
| { | |
| "entropy": 1.3391420371830463, | |
| "epoch": 0.1995049322052684, | |
| "grad_norm": 0.10482585430145264, | |
| "learning_rate": 8.006502142751589e-05, | |
| "loss": 1.0063, | |
| "mean_token_accuracy": 0.7450359672307968, | |
| "num_tokens": 85051200.0, | |
| "step": 1350 | |
| }, | |
| { | |
| "entropy": 1.3461947545409203, | |
| "epoch": 0.20098274651790002, | |
| "grad_norm": 0.10634397715330124, | |
| "learning_rate": 7.991724545588888e-05, | |
| "loss": 1.0521, | |
| "mean_token_accuracy": 0.7360609002411366, | |
| "num_tokens": 85686910.0, | |
| "step": 1360 | |
| }, | |
| { | |
| "entropy": 1.328591948747635, | |
| "epoch": 0.20246056083053166, | |
| "grad_norm": 0.10722459852695465, | |
| "learning_rate": 7.976946948426187e-05, | |
| "loss": 1.0035, | |
| "mean_token_accuracy": 0.7449103698134423, | |
| "num_tokens": 86309849.0, | |
| "step": 1370 | |
| }, | |
| { | |
| "entropy": 1.3918874174356461, | |
| "epoch": 0.20393837514316326, | |
| "grad_norm": 0.1124623566865921, | |
| "learning_rate": 7.962169351263485e-05, | |
| "loss": 1.0747, | |
| "mean_token_accuracy": 0.7297042839229106, | |
| "num_tokens": 86946736.0, | |
| "step": 1380 | |
| }, | |
| { | |
| "entropy": 1.3307641319930554, | |
| "epoch": 0.20541618945579487, | |
| "grad_norm": 0.10401839017868042, | |
| "learning_rate": 7.947391754100784e-05, | |
| "loss": 1.0247, | |
| "mean_token_accuracy": 0.7394670993089676, | |
| "num_tokens": 87587364.0, | |
| "step": 1390 | |
| }, | |
| { | |
| "entropy": 1.3134734809398652, | |
| "epoch": 0.2068940037684265, | |
| "grad_norm": 0.1127687469124794, | |
| "learning_rate": 7.932614156938082e-05, | |
| "loss": 0.977, | |
| "mean_token_accuracy": 0.7489233329892159, | |
| "num_tokens": 88201969.0, | |
| "step": 1400 | |
| }, | |
| { | |
| "entropy": 1.321236951649189, | |
| "epoch": 0.20837181808105812, | |
| "grad_norm": 0.1230587363243103, | |
| "learning_rate": 7.91783655977538e-05, | |
| "loss": 1.0014, | |
| "mean_token_accuracy": 0.7438783705234527, | |
| "num_tokens": 88841442.0, | |
| "step": 1410 | |
| }, | |
| { | |
| "entropy": 1.3525510422885418, | |
| "epoch": 0.20984963239368973, | |
| "grad_norm": 0.11645467579364777, | |
| "learning_rate": 7.90305896261268e-05, | |
| "loss": 1.0365, | |
| "mean_token_accuracy": 0.7380785860121251, | |
| "num_tokens": 89460444.0, | |
| "step": 1420 | |
| }, | |
| { | |
| "entropy": 1.3169463470578193, | |
| "epoch": 0.21132744670632134, | |
| "grad_norm": 0.09807448834180832, | |
| "learning_rate": 7.888281365449978e-05, | |
| "loss": 1.0151, | |
| "mean_token_accuracy": 0.7428149476647377, | |
| "num_tokens": 90085094.0, | |
| "step": 1430 | |
| }, | |
| { | |
| "entropy": 1.3019375145435332, | |
| "epoch": 0.21280526101895297, | |
| "grad_norm": 0.0929834321141243, | |
| "learning_rate": 7.873503768287277e-05, | |
| "loss": 0.9708, | |
| "mean_token_accuracy": 0.7490074157714843, | |
| "num_tokens": 90721323.0, | |
| "step": 1440 | |
| }, | |
| { | |
| "entropy": 1.3838747300207614, | |
| "epoch": 0.21428307533158458, | |
| "grad_norm": 0.12123925238847733, | |
| "learning_rate": 7.858726171124576e-05, | |
| "loss": 1.0593, | |
| "mean_token_accuracy": 0.7317282311618328, | |
| "num_tokens": 91347998.0, | |
| "step": 1450 | |
| }, | |
| { | |
| "entropy": 1.3161128632724286, | |
| "epoch": 0.2157608896442162, | |
| "grad_norm": 0.0967702642083168, | |
| "learning_rate": 7.843948573961875e-05, | |
| "loss": 1.0023, | |
| "mean_token_accuracy": 0.745752614736557, | |
| "num_tokens": 91987480.0, | |
| "step": 1460 | |
| }, | |
| { | |
| "entropy": 1.358607316762209, | |
| "epoch": 0.21723870395684783, | |
| "grad_norm": 0.09103115648031235, | |
| "learning_rate": 7.829170976799172e-05, | |
| "loss": 1.0225, | |
| "mean_token_accuracy": 0.7394160240888595, | |
| "num_tokens": 92606958.0, | |
| "step": 1470 | |
| }, | |
| { | |
| "entropy": 1.2861947104334832, | |
| "epoch": 0.21871651826947944, | |
| "grad_norm": 0.09953464567661285, | |
| "learning_rate": 7.814393379636471e-05, | |
| "loss": 1.0021, | |
| "mean_token_accuracy": 0.7471014529466629, | |
| "num_tokens": 93241419.0, | |
| "step": 1480 | |
| }, | |
| { | |
| "entropy": 1.348529851436615, | |
| "epoch": 0.22019433258211105, | |
| "grad_norm": 0.11342471837997437, | |
| "learning_rate": 7.79961578247377e-05, | |
| "loss": 1.0311, | |
| "mean_token_accuracy": 0.741535271704197, | |
| "num_tokens": 93852674.0, | |
| "step": 1490 | |
| }, | |
| { | |
| "entropy": 1.3192447304725647, | |
| "epoch": 0.22167214689474268, | |
| "grad_norm": 0.09268448501825333, | |
| "learning_rate": 7.784838185311069e-05, | |
| "loss": 1.0193, | |
| "mean_token_accuracy": 0.7420137017965317, | |
| "num_tokens": 94457071.0, | |
| "step": 1500 | |
| }, | |
| { | |
| "entropy": 1.2933300271630288, | |
| "epoch": 0.2231499612073743, | |
| "grad_norm": 0.11778298020362854, | |
| "learning_rate": 7.770060588148367e-05, | |
| "loss": 1.0038, | |
| "mean_token_accuracy": 0.7440440624952316, | |
| "num_tokens": 95096857.0, | |
| "step": 1510 | |
| }, | |
| { | |
| "entropy": 1.3399901308119297, | |
| "epoch": 0.2246277755200059, | |
| "grad_norm": 0.10314805060625076, | |
| "learning_rate": 7.755282990985666e-05, | |
| "loss": 1.0432, | |
| "mean_token_accuracy": 0.7347467452287674, | |
| "num_tokens": 95710251.0, | |
| "step": 1520 | |
| }, | |
| { | |
| "entropy": 1.3574152827262878, | |
| "epoch": 0.22610558983263754, | |
| "grad_norm": 0.09815168380737305, | |
| "learning_rate": 7.740505393822964e-05, | |
| "loss": 1.0236, | |
| "mean_token_accuracy": 0.7383907742798328, | |
| "num_tokens": 96349869.0, | |
| "step": 1530 | |
| }, | |
| { | |
| "entropy": 1.3190400637686253, | |
| "epoch": 0.22758340414526915, | |
| "grad_norm": 0.10603173822164536, | |
| "learning_rate": 7.725727796660264e-05, | |
| "loss": 0.9934, | |
| "mean_token_accuracy": 0.7460605546832084, | |
| "num_tokens": 96970099.0, | |
| "step": 1540 | |
| }, | |
| { | |
| "entropy": 1.3596270292997361, | |
| "epoch": 0.22906121845790076, | |
| "grad_norm": 0.11921924352645874, | |
| "learning_rate": 7.710950199497561e-05, | |
| "loss": 1.0268, | |
| "mean_token_accuracy": 0.7397349782288074, | |
| "num_tokens": 97582834.0, | |
| "step": 1550 | |
| }, | |
| { | |
| "entropy": 1.3366517312824726, | |
| "epoch": 0.2305390327705324, | |
| "grad_norm": 0.09995236247777939, | |
| "learning_rate": 7.696172602334862e-05, | |
| "loss": 1.0421, | |
| "mean_token_accuracy": 0.7388435758650302, | |
| "num_tokens": 98206744.0, | |
| "step": 1560 | |
| }, | |
| { | |
| "entropy": 1.3542730413377284, | |
| "epoch": 0.232016847083164, | |
| "grad_norm": 0.11093679815530777, | |
| "learning_rate": 7.681395005172159e-05, | |
| "loss": 1.0324, | |
| "mean_token_accuracy": 0.736759950965643, | |
| "num_tokens": 98822084.0, | |
| "step": 1570 | |
| }, | |
| { | |
| "entropy": 1.3538315087556838, | |
| "epoch": 0.2334946613957956, | |
| "grad_norm": 0.10785405337810516, | |
| "learning_rate": 7.666617408009458e-05, | |
| "loss": 1.0234, | |
| "mean_token_accuracy": 0.7402111329138279, | |
| "num_tokens": 99448192.0, | |
| "step": 1580 | |
| }, | |
| { | |
| "entropy": 1.3442205354571342, | |
| "epoch": 0.23497247570842725, | |
| "grad_norm": 0.10176731646060944, | |
| "learning_rate": 7.651839810846757e-05, | |
| "loss": 1.0359, | |
| "mean_token_accuracy": 0.7362779274582862, | |
| "num_tokens": 100103673.0, | |
| "step": 1590 | |
| }, | |
| { | |
| "entropy": 1.3559410147368909, | |
| "epoch": 0.23645029002105886, | |
| "grad_norm": 0.10286710411310196, | |
| "learning_rate": 7.637062213684055e-05, | |
| "loss": 1.0519, | |
| "mean_token_accuracy": 0.7352492958307266, | |
| "num_tokens": 100738247.0, | |
| "step": 1600 | |
| }, | |
| { | |
| "entropy": 1.3641400419175624, | |
| "epoch": 0.23792810433369047, | |
| "grad_norm": 0.10766908526420593, | |
| "learning_rate": 7.622284616521353e-05, | |
| "loss": 1.0449, | |
| "mean_token_accuracy": 0.7377994388341904, | |
| "num_tokens": 101354199.0, | |
| "step": 1610 | |
| }, | |
| { | |
| "entropy": 1.3450035892426968, | |
| "epoch": 0.2394059186463221, | |
| "grad_norm": 0.10041961818933487, | |
| "learning_rate": 7.607507019358653e-05, | |
| "loss": 1.0217, | |
| "mean_token_accuracy": 0.7392164841294289, | |
| "num_tokens": 101991436.0, | |
| "step": 1620 | |
| }, | |
| { | |
| "entropy": 1.3661194667220116, | |
| "epoch": 0.2408837329589537, | |
| "grad_norm": 0.12022734433412552, | |
| "learning_rate": 7.59272942219595e-05, | |
| "loss": 1.0655, | |
| "mean_token_accuracy": 0.7299047157168388, | |
| "num_tokens": 102597689.0, | |
| "step": 1630 | |
| }, | |
| { | |
| "entropy": 1.35709098726511, | |
| "epoch": 0.24236154727158532, | |
| "grad_norm": 0.10375872999429703, | |
| "learning_rate": 7.577951825033251e-05, | |
| "loss": 1.0283, | |
| "mean_token_accuracy": 0.7381139561533928, | |
| "num_tokens": 103230722.0, | |
| "step": 1640 | |
| }, | |
| { | |
| "entropy": 1.3297756418585778, | |
| "epoch": 0.24383936158421693, | |
| "grad_norm": 0.10695882141590118, | |
| "learning_rate": 7.563174227870548e-05, | |
| "loss": 1.0368, | |
| "mean_token_accuracy": 0.7364217408001423, | |
| "num_tokens": 103860203.0, | |
| "step": 1650 | |
| }, | |
| { | |
| "entropy": 1.3703177645802498, | |
| "epoch": 0.24531717589684857, | |
| "grad_norm": 0.10709354281425476, | |
| "learning_rate": 7.548396630707847e-05, | |
| "loss": 1.0388, | |
| "mean_token_accuracy": 0.7379512034356595, | |
| "num_tokens": 104484571.0, | |
| "step": 1660 | |
| }, | |
| { | |
| "entropy": 1.3768685176968574, | |
| "epoch": 0.24679499020948018, | |
| "grad_norm": 0.12744958698749542, | |
| "learning_rate": 7.533619033545146e-05, | |
| "loss": 1.0563, | |
| "mean_token_accuracy": 0.7327473036944866, | |
| "num_tokens": 105093868.0, | |
| "step": 1670 | |
| }, | |
| { | |
| "entropy": 1.377336809784174, | |
| "epoch": 0.24827280452211178, | |
| "grad_norm": 0.10518407076597214, | |
| "learning_rate": 7.518841436382445e-05, | |
| "loss": 1.0808, | |
| "mean_token_accuracy": 0.733013579249382, | |
| "num_tokens": 105714000.0, | |
| "step": 1680 | |
| }, | |
| { | |
| "entropy": 1.3496724091470242, | |
| "epoch": 0.24975061883474342, | |
| "grad_norm": 0.1317768543958664, | |
| "learning_rate": 7.504063839219744e-05, | |
| "loss": 0.9933, | |
| "mean_token_accuracy": 0.7478909485042096, | |
| "num_tokens": 106346942.0, | |
| "step": 1690 | |
| }, | |
| { | |
| "entropy": 1.3175810858607293, | |
| "epoch": 0.25122843314737503, | |
| "grad_norm": 0.11672790348529816, | |
| "learning_rate": 7.489286242057042e-05, | |
| "loss": 1.0113, | |
| "mean_token_accuracy": 0.7453901283442974, | |
| "num_tokens": 106981893.0, | |
| "step": 1700 | |
| }, | |
| { | |
| "entropy": 1.3557366229593755, | |
| "epoch": 0.25270624746000664, | |
| "grad_norm": 0.0951073095202446, | |
| "learning_rate": 7.47450864489434e-05, | |
| "loss": 1.0431, | |
| "mean_token_accuracy": 0.7352614618837834, | |
| "num_tokens": 107616980.0, | |
| "step": 1710 | |
| }, | |
| { | |
| "entropy": 1.3488038405776024, | |
| "epoch": 0.25418406177263825, | |
| "grad_norm": 0.09690382331609726, | |
| "learning_rate": 7.45973104773164e-05, | |
| "loss": 1.0433, | |
| "mean_token_accuracy": 0.7353552646934987, | |
| "num_tokens": 108240730.0, | |
| "step": 1720 | |
| }, | |
| { | |
| "entropy": 1.318380505591631, | |
| "epoch": 0.2556618760852699, | |
| "grad_norm": 0.10357276350259781, | |
| "learning_rate": 7.444953450568937e-05, | |
| "loss": 1.0115, | |
| "mean_token_accuracy": 0.7435870662331581, | |
| "num_tokens": 108881320.0, | |
| "step": 1730 | |
| }, | |
| { | |
| "entropy": 1.317159901559353, | |
| "epoch": 0.2571396903979015, | |
| "grad_norm": 0.09926076978445053, | |
| "learning_rate": 7.430175853406236e-05, | |
| "loss": 0.996, | |
| "mean_token_accuracy": 0.7481661081314087, | |
| "num_tokens": 109516511.0, | |
| "step": 1740 | |
| }, | |
| { | |
| "entropy": 1.3350887671113014, | |
| "epoch": 0.25861750471053313, | |
| "grad_norm": 0.1110028401017189, | |
| "learning_rate": 7.415398256243535e-05, | |
| "loss": 1.0047, | |
| "mean_token_accuracy": 0.7430928081274033, | |
| "num_tokens": 110150208.0, | |
| "step": 1750 | |
| }, | |
| { | |
| "entropy": 1.3338087685406208, | |
| "epoch": 0.26009531902316474, | |
| "grad_norm": 0.1074734628200531, | |
| "learning_rate": 7.400620659080834e-05, | |
| "loss": 1.0192, | |
| "mean_token_accuracy": 0.7407279655337333, | |
| "num_tokens": 110778288.0, | |
| "step": 1760 | |
| }, | |
| { | |
| "entropy": 1.3606950506567954, | |
| "epoch": 0.26157313333579635, | |
| "grad_norm": 0.10617410391569138, | |
| "learning_rate": 7.385843061918133e-05, | |
| "loss": 1.0346, | |
| "mean_token_accuracy": 0.7412132248282433, | |
| "num_tokens": 111406540.0, | |
| "step": 1770 | |
| }, | |
| { | |
| "entropy": 1.3470192208886147, | |
| "epoch": 0.26305094764842796, | |
| "grad_norm": 0.08930668979883194, | |
| "learning_rate": 7.371065464755432e-05, | |
| "loss": 1.0349, | |
| "mean_token_accuracy": 0.7382924191653728, | |
| "num_tokens": 112046988.0, | |
| "step": 1780 | |
| }, | |
| { | |
| "entropy": 1.3257930040359498, | |
| "epoch": 0.26452876196105957, | |
| "grad_norm": 0.11683688312768936, | |
| "learning_rate": 7.356287867592729e-05, | |
| "loss": 0.9749, | |
| "mean_token_accuracy": 0.7466934151947499, | |
| "num_tokens": 112662431.0, | |
| "step": 1790 | |
| }, | |
| { | |
| "entropy": 1.3634838439524173, | |
| "epoch": 0.26600657627369123, | |
| "grad_norm": 0.113424152135849, | |
| "learning_rate": 7.341510270430029e-05, | |
| "loss": 1.0636, | |
| "mean_token_accuracy": 0.73306784927845, | |
| "num_tokens": 113273230.0, | |
| "step": 1800 | |
| }, | |
| { | |
| "entropy": 1.3364275880157948, | |
| "epoch": 0.26748439058632284, | |
| "grad_norm": 0.09862840175628662, | |
| "learning_rate": 7.326732673267327e-05, | |
| "loss": 1.0085, | |
| "mean_token_accuracy": 0.7427501030266285, | |
| "num_tokens": 113909313.0, | |
| "step": 1810 | |
| }, | |
| { | |
| "entropy": 1.3659813731908799, | |
| "epoch": 0.26896220489895445, | |
| "grad_norm": 0.12104249000549316, | |
| "learning_rate": 7.311955076104627e-05, | |
| "loss": 1.0439, | |
| "mean_token_accuracy": 0.7362107425928116, | |
| "num_tokens": 114514504.0, | |
| "step": 1820 | |
| }, | |
| { | |
| "entropy": 1.328355757892132, | |
| "epoch": 0.27044001921158606, | |
| "grad_norm": 0.11729808896780014, | |
| "learning_rate": 7.297177478941924e-05, | |
| "loss": 0.9775, | |
| "mean_token_accuracy": 0.7475184448063373, | |
| "num_tokens": 115140702.0, | |
| "step": 1830 | |
| }, | |
| { | |
| "entropy": 1.3406167194247245, | |
| "epoch": 0.27191783352421767, | |
| "grad_norm": 0.09913574159145355, | |
| "learning_rate": 7.282399881779223e-05, | |
| "loss": 1.0179, | |
| "mean_token_accuracy": 0.7432191327214241, | |
| "num_tokens": 115755068.0, | |
| "step": 1840 | |
| }, | |
| { | |
| "entropy": 1.3977623000741004, | |
| "epoch": 0.2733956478368493, | |
| "grad_norm": 0.0984942838549614, | |
| "learning_rate": 7.267622284616522e-05, | |
| "loss": 1.0822, | |
| "mean_token_accuracy": 0.7289882197976112, | |
| "num_tokens": 116354942.0, | |
| "step": 1850 | |
| }, | |
| { | |
| "entropy": 1.3664689101278782, | |
| "epoch": 0.27487346214948094, | |
| "grad_norm": 0.10869049280881882, | |
| "learning_rate": 7.252844687453821e-05, | |
| "loss": 1.0238, | |
| "mean_token_accuracy": 0.7409933775663375, | |
| "num_tokens": 116988534.0, | |
| "step": 1860 | |
| }, | |
| { | |
| "entropy": 1.315875554829836, | |
| "epoch": 0.27635127646211255, | |
| "grad_norm": 0.12993551790714264, | |
| "learning_rate": 7.238067090291118e-05, | |
| "loss": 0.9935, | |
| "mean_token_accuracy": 0.7480652235448361, | |
| "num_tokens": 117641953.0, | |
| "step": 1870 | |
| }, | |
| { | |
| "entropy": 1.2959641508758069, | |
| "epoch": 0.27782909077474416, | |
| "grad_norm": 0.09623228758573532, | |
| "learning_rate": 7.223289493128419e-05, | |
| "loss": 0.9943, | |
| "mean_token_accuracy": 0.7439824365079403, | |
| "num_tokens": 118256692.0, | |
| "step": 1880 | |
| }, | |
| { | |
| "entropy": 1.371036985516548, | |
| "epoch": 0.27930690508737577, | |
| "grad_norm": 0.11579816788434982, | |
| "learning_rate": 7.208511895965716e-05, | |
| "loss": 1.0556, | |
| "mean_token_accuracy": 0.7361032791435719, | |
| "num_tokens": 118891210.0, | |
| "step": 1890 | |
| }, | |
| { | |
| "entropy": 1.3036040149629116, | |
| "epoch": 0.2807847194000074, | |
| "grad_norm": 0.12691327929496765, | |
| "learning_rate": 7.193734298803015e-05, | |
| "loss": 0.9843, | |
| "mean_token_accuracy": 0.7478345915675163, | |
| "num_tokens": 119504239.0, | |
| "step": 1900 | |
| }, | |
| { | |
| "entropy": 1.3748640805482863, | |
| "epoch": 0.282262533712639, | |
| "grad_norm": 0.10164857655763626, | |
| "learning_rate": 7.178956701640314e-05, | |
| "loss": 1.0413, | |
| "mean_token_accuracy": 0.7376060217618943, | |
| "num_tokens": 120143691.0, | |
| "step": 1910 | |
| }, | |
| { | |
| "entropy": 1.361726462095976, | |
| "epoch": 0.28374034802527065, | |
| "grad_norm": 0.14407841861248016, | |
| "learning_rate": 7.164179104477612e-05, | |
| "loss": 1.0475, | |
| "mean_token_accuracy": 0.7337219528853893, | |
| "num_tokens": 120768595.0, | |
| "step": 1920 | |
| }, | |
| { | |
| "entropy": 1.3406222008168698, | |
| "epoch": 0.28521816233790226, | |
| "grad_norm": 0.12444034963846207, | |
| "learning_rate": 7.149401507314911e-05, | |
| "loss": 1.0261, | |
| "mean_token_accuracy": 0.7425919137895107, | |
| "num_tokens": 121398440.0, | |
| "step": 1930 | |
| }, | |
| { | |
| "entropy": 1.3530367895960809, | |
| "epoch": 0.28669597665053387, | |
| "grad_norm": 0.11323665827512741, | |
| "learning_rate": 7.13462391015221e-05, | |
| "loss": 1.03, | |
| "mean_token_accuracy": 0.7408431887626648, | |
| "num_tokens": 122014717.0, | |
| "step": 1940 | |
| }, | |
| { | |
| "entropy": 1.3645049922168255, | |
| "epoch": 0.2881737909631655, | |
| "grad_norm": 0.11987091600894928, | |
| "learning_rate": 7.119846312989509e-05, | |
| "loss": 1.0452, | |
| "mean_token_accuracy": 0.7358455255627632, | |
| "num_tokens": 122641856.0, | |
| "step": 1950 | |
| }, | |
| { | |
| "entropy": 1.3496552132070065, | |
| "epoch": 0.2896516052757971, | |
| "grad_norm": 0.11011224240064621, | |
| "learning_rate": 7.105068715826806e-05, | |
| "loss": 1.0348, | |
| "mean_token_accuracy": 0.7365316428244114, | |
| "num_tokens": 123259881.0, | |
| "step": 1960 | |
| }, | |
| { | |
| "entropy": 1.3554118975996972, | |
| "epoch": 0.2911294195884287, | |
| "grad_norm": 0.10278936475515366, | |
| "learning_rate": 7.090291118664105e-05, | |
| "loss": 1.0429, | |
| "mean_token_accuracy": 0.734364154189825, | |
| "num_tokens": 123883169.0, | |
| "step": 1970 | |
| }, | |
| { | |
| "entropy": 1.3658627800643444, | |
| "epoch": 0.2926072339010603, | |
| "grad_norm": 0.11712102591991425, | |
| "learning_rate": 7.075513521501404e-05, | |
| "loss": 1.0508, | |
| "mean_token_accuracy": 0.7375255465507508, | |
| "num_tokens": 124499574.0, | |
| "step": 1980 | |
| }, | |
| { | |
| "entropy": 1.3808431923389435, | |
| "epoch": 0.29408504821369197, | |
| "grad_norm": 0.12582142651081085, | |
| "learning_rate": 7.060735924338703e-05, | |
| "loss": 1.0752, | |
| "mean_token_accuracy": 0.7313126713037491, | |
| "num_tokens": 125126498.0, | |
| "step": 1990 | |
| }, | |
| { | |
| "entropy": 1.2969964474439621, | |
| "epoch": 0.2955628625263236, | |
| "grad_norm": 0.10375986248254776, | |
| "learning_rate": 7.045958327176002e-05, | |
| "loss": 1.0082, | |
| "mean_token_accuracy": 0.7448927208781242, | |
| "num_tokens": 125753238.0, | |
| "step": 2000 | |
| }, | |
| { | |
| "entropy": 1.3703055553138257, | |
| "epoch": 0.2970406768389552, | |
| "grad_norm": 0.11782936006784439, | |
| "learning_rate": 7.0311807300133e-05, | |
| "loss": 1.0193, | |
| "mean_token_accuracy": 0.7416508063673973, | |
| "num_tokens": 126374538.0, | |
| "step": 2010 | |
| }, | |
| { | |
| "entropy": 1.3585199259221554, | |
| "epoch": 0.2985184911515868, | |
| "grad_norm": 0.12770617008209229, | |
| "learning_rate": 7.016403132850598e-05, | |
| "loss": 1.0288, | |
| "mean_token_accuracy": 0.740058358758688, | |
| "num_tokens": 126994217.0, | |
| "step": 2020 | |
| }, | |
| { | |
| "entropy": 1.3496723629534244, | |
| "epoch": 0.2999963054642184, | |
| "grad_norm": 0.09809058904647827, | |
| "learning_rate": 7.001625535687898e-05, | |
| "loss": 1.0035, | |
| "mean_token_accuracy": 0.7450730398297309, | |
| "num_tokens": 127635972.0, | |
| "step": 2030 | |
| }, | |
| { | |
| "entropy": 1.3468332551419735, | |
| "epoch": 0.30147411977685, | |
| "grad_norm": 0.1129288524389267, | |
| "learning_rate": 6.986847938525196e-05, | |
| "loss": 1.018, | |
| "mean_token_accuracy": 0.7407178491353988, | |
| "num_tokens": 128259337.0, | |
| "step": 2040 | |
| }, | |
| { | |
| "entropy": 1.3580288112163543, | |
| "epoch": 0.3029519340894817, | |
| "grad_norm": 0.107613705098629, | |
| "learning_rate": 6.972070341362494e-05, | |
| "loss": 1.0521, | |
| "mean_token_accuracy": 0.7362593986093998, | |
| "num_tokens": 128878282.0, | |
| "step": 2050 | |
| }, | |
| { | |
| "entropy": 1.3525773376226424, | |
| "epoch": 0.3044297484021133, | |
| "grad_norm": 0.11789864301681519, | |
| "learning_rate": 6.957292744199793e-05, | |
| "loss": 1.0227, | |
| "mean_token_accuracy": 0.7409359261393547, | |
| "num_tokens": 129496376.0, | |
| "step": 2060 | |
| }, | |
| { | |
| "entropy": 1.3889159947633742, | |
| "epoch": 0.3059075627147449, | |
| "grad_norm": 0.10157744586467743, | |
| "learning_rate": 6.942515147037092e-05, | |
| "loss": 1.0735, | |
| "mean_token_accuracy": 0.7293846361339092, | |
| "num_tokens": 130133618.0, | |
| "step": 2070 | |
| }, | |
| { | |
| "entropy": 1.3392279900610446, | |
| "epoch": 0.3073853770273765, | |
| "grad_norm": 0.09857992082834244, | |
| "learning_rate": 6.927737549874391e-05, | |
| "loss": 1.0034, | |
| "mean_token_accuracy": 0.7396849572658539, | |
| "num_tokens": 130775922.0, | |
| "step": 2080 | |
| }, | |
| { | |
| "entropy": 1.354237724840641, | |
| "epoch": 0.3088631913400081, | |
| "grad_norm": 0.11697685718536377, | |
| "learning_rate": 6.91295995271169e-05, | |
| "loss": 1.0398, | |
| "mean_token_accuracy": 0.7384343758225441, | |
| "num_tokens": 131421760.0, | |
| "step": 2090 | |
| }, | |
| { | |
| "entropy": 1.3637243047356606, | |
| "epoch": 0.3103410056526397, | |
| "grad_norm": 0.10802293568849564, | |
| "learning_rate": 6.898182355548987e-05, | |
| "loss": 1.0496, | |
| "mean_token_accuracy": 0.7360463313758373, | |
| "num_tokens": 132027760.0, | |
| "step": 2100 | |
| }, | |
| { | |
| "entropy": 1.3234611213207246, | |
| "epoch": 0.3118188199652714, | |
| "grad_norm": 0.11391324549913406, | |
| "learning_rate": 6.883404758386287e-05, | |
| "loss": 0.9698, | |
| "mean_token_accuracy": 0.7520683214068413, | |
| "num_tokens": 132638973.0, | |
| "step": 2110 | |
| }, | |
| { | |
| "entropy": 1.327374517172575, | |
| "epoch": 0.313296634277903, | |
| "grad_norm": 0.0961180180311203, | |
| "learning_rate": 6.868627161223585e-05, | |
| "loss": 0.9911, | |
| "mean_token_accuracy": 0.7429872818291188, | |
| "num_tokens": 133269852.0, | |
| "step": 2120 | |
| }, | |
| { | |
| "entropy": 1.3173839271068573, | |
| "epoch": 0.3147744485905346, | |
| "grad_norm": 0.10153747349977493, | |
| "learning_rate": 6.853849564060884e-05, | |
| "loss": 1.0188, | |
| "mean_token_accuracy": 0.7429009906947612, | |
| "num_tokens": 133902116.0, | |
| "step": 2130 | |
| }, | |
| { | |
| "entropy": 1.3764125563204288, | |
| "epoch": 0.3162522629031662, | |
| "grad_norm": 0.10402517765760422, | |
| "learning_rate": 6.839071966898183e-05, | |
| "loss": 1.0249, | |
| "mean_token_accuracy": 0.7386217057704926, | |
| "num_tokens": 134527984.0, | |
| "step": 2140 | |
| }, | |
| { | |
| "entropy": 1.3320019409060477, | |
| "epoch": 0.3177300772157978, | |
| "grad_norm": 0.13321658968925476, | |
| "learning_rate": 6.824294369735481e-05, | |
| "loss": 1.0181, | |
| "mean_token_accuracy": 0.7429975025355816, | |
| "num_tokens": 135171015.0, | |
| "step": 2150 | |
| }, | |
| { | |
| "entropy": 1.323284325748682, | |
| "epoch": 0.31920789152842943, | |
| "grad_norm": 0.11596138030290604, | |
| "learning_rate": 6.80951677257278e-05, | |
| "loss": 0.9763, | |
| "mean_token_accuracy": 0.7492162629961967, | |
| "num_tokens": 135802769.0, | |
| "step": 2160 | |
| }, | |
| { | |
| "entropy": 1.3504845738410949, | |
| "epoch": 0.3206857058410611, | |
| "grad_norm": 0.11453942209482193, | |
| "learning_rate": 6.794739175410079e-05, | |
| "loss": 1.0587, | |
| "mean_token_accuracy": 0.7336528770625591, | |
| "num_tokens": 136428189.0, | |
| "step": 2170 | |
| }, | |
| { | |
| "entropy": 1.3354684211313725, | |
| "epoch": 0.3221635201536927, | |
| "grad_norm": 0.1275642067193985, | |
| "learning_rate": 6.779961578247376e-05, | |
| "loss": 1.0044, | |
| "mean_token_accuracy": 0.7408880606293679, | |
| "num_tokens": 137070498.0, | |
| "step": 2180 | |
| }, | |
| { | |
| "entropy": 1.368819622695446, | |
| "epoch": 0.3236413344663243, | |
| "grad_norm": 0.12235371768474579, | |
| "learning_rate": 6.765183981084677e-05, | |
| "loss": 1.0535, | |
| "mean_token_accuracy": 0.7341696232557297, | |
| "num_tokens": 137679641.0, | |
| "step": 2190 | |
| }, | |
| { | |
| "entropy": 1.3225167870521546, | |
| "epoch": 0.3251191487789559, | |
| "grad_norm": 0.09812725335359573, | |
| "learning_rate": 6.750406383921974e-05, | |
| "loss": 1.0252, | |
| "mean_token_accuracy": 0.7395187027752399, | |
| "num_tokens": 138336216.0, | |
| "step": 2200 | |
| }, | |
| { | |
| "entropy": 1.367988857626915, | |
| "epoch": 0.32659696309158753, | |
| "grad_norm": 0.12514571845531464, | |
| "learning_rate": 6.735628786759274e-05, | |
| "loss": 1.0716, | |
| "mean_token_accuracy": 0.7310583747923374, | |
| "num_tokens": 138963175.0, | |
| "step": 2210 | |
| }, | |
| { | |
| "entropy": 1.3490555189549922, | |
| "epoch": 0.32807477740421914, | |
| "grad_norm": 0.12653544545173645, | |
| "learning_rate": 6.720851189596572e-05, | |
| "loss": 1.063, | |
| "mean_token_accuracy": 0.7345262944698334, | |
| "num_tokens": 139600194.0, | |
| "step": 2220 | |
| }, | |
| { | |
| "entropy": 1.3446317560970784, | |
| "epoch": 0.32955259171685075, | |
| "grad_norm": 0.10482878983020782, | |
| "learning_rate": 6.70607359243387e-05, | |
| "loss": 1.0391, | |
| "mean_token_accuracy": 0.7383916914463043, | |
| "num_tokens": 140237377.0, | |
| "step": 2230 | |
| }, | |
| { | |
| "entropy": 1.3320685289800167, | |
| "epoch": 0.3310304060294824, | |
| "grad_norm": 0.10686700791120529, | |
| "learning_rate": 6.69129599527117e-05, | |
| "loss": 1.0304, | |
| "mean_token_accuracy": 0.737852866947651, | |
| "num_tokens": 140853893.0, | |
| "step": 2240 | |
| }, | |
| { | |
| "entropy": 1.3207725331187248, | |
| "epoch": 0.332508220342114, | |
| "grad_norm": 0.10360251367092133, | |
| "learning_rate": 6.676518398108468e-05, | |
| "loss": 1.0, | |
| "mean_token_accuracy": 0.7466425992548466, | |
| "num_tokens": 141471387.0, | |
| "step": 2250 | |
| }, | |
| { | |
| "entropy": 1.3336294353008271, | |
| "epoch": 0.33398603465474563, | |
| "grad_norm": 0.12046889215707779, | |
| "learning_rate": 6.661740800945766e-05, | |
| "loss": 1.0763, | |
| "mean_token_accuracy": 0.7299591615796089, | |
| "num_tokens": 142102862.0, | |
| "step": 2260 | |
| }, | |
| { | |
| "entropy": 1.3241831846535206, | |
| "epoch": 0.33546384896737724, | |
| "grad_norm": 0.11208558082580566, | |
| "learning_rate": 6.646963203783066e-05, | |
| "loss": 1.0077, | |
| "mean_token_accuracy": 0.7427926994860172, | |
| "num_tokens": 142712641.0, | |
| "step": 2270 | |
| }, | |
| { | |
| "entropy": 1.2987228810787201, | |
| "epoch": 0.33694166328000885, | |
| "grad_norm": 0.10891300439834595, | |
| "learning_rate": 6.632185606620363e-05, | |
| "loss": 1.0021, | |
| "mean_token_accuracy": 0.746040652692318, | |
| "num_tokens": 143357692.0, | |
| "step": 2280 | |
| }, | |
| { | |
| "entropy": 1.3333717592060566, | |
| "epoch": 0.33841947759264046, | |
| "grad_norm": 0.107634037733078, | |
| "learning_rate": 6.617408009457664e-05, | |
| "loss": 1.0051, | |
| "mean_token_accuracy": 0.7442885607481002, | |
| "num_tokens": 143990646.0, | |
| "step": 2290 | |
| }, | |
| { | |
| "entropy": 1.370392120629549, | |
| "epoch": 0.3398972919052721, | |
| "grad_norm": 0.10865243524312973, | |
| "learning_rate": 6.602630412294961e-05, | |
| "loss": 1.0692, | |
| "mean_token_accuracy": 0.7315164700150489, | |
| "num_tokens": 144619931.0, | |
| "step": 2300 | |
| }, | |
| { | |
| "entropy": 1.3540328681468963, | |
| "epoch": 0.34137510621790373, | |
| "grad_norm": 0.1158401146531105, | |
| "learning_rate": 6.58785281513226e-05, | |
| "loss": 1.0555, | |
| "mean_token_accuracy": 0.7361217260360717, | |
| "num_tokens": 145241748.0, | |
| "step": 2310 | |
| }, | |
| { | |
| "entropy": 1.3016823388636112, | |
| "epoch": 0.34285292053053534, | |
| "grad_norm": 0.11778155714273453, | |
| "learning_rate": 6.573075217969559e-05, | |
| "loss": 0.9845, | |
| "mean_token_accuracy": 0.747497683763504, | |
| "num_tokens": 145871775.0, | |
| "step": 2320 | |
| }, | |
| { | |
| "entropy": 1.32976598367095, | |
| "epoch": 0.34433073484316695, | |
| "grad_norm": 0.11029067635536194, | |
| "learning_rate": 6.558297620806857e-05, | |
| "loss": 1.0369, | |
| "mean_token_accuracy": 0.7379365123808383, | |
| "num_tokens": 146520142.0, | |
| "step": 2330 | |
| }, | |
| { | |
| "entropy": 1.3770955115556718, | |
| "epoch": 0.34580854915579856, | |
| "grad_norm": 0.15313439071178436, | |
| "learning_rate": 6.543520023644156e-05, | |
| "loss": 1.0408, | |
| "mean_token_accuracy": 0.7377210259437561, | |
| "num_tokens": 147155097.0, | |
| "step": 2340 | |
| }, | |
| { | |
| "entropy": 1.3539579182863235, | |
| "epoch": 0.34728636346843017, | |
| "grad_norm": 0.1262284517288208, | |
| "learning_rate": 6.528742426481455e-05, | |
| "loss": 1.0508, | |
| "mean_token_accuracy": 0.7372145742177963, | |
| "num_tokens": 147790753.0, | |
| "step": 2350 | |
| }, | |
| { | |
| "entropy": 1.3089107267558575, | |
| "epoch": 0.34876417778106183, | |
| "grad_norm": 0.11003509908914566, | |
| "learning_rate": 6.513964829318753e-05, | |
| "loss": 0.9973, | |
| "mean_token_accuracy": 0.7451998688280582, | |
| "num_tokens": 148415446.0, | |
| "step": 2360 | |
| }, | |
| { | |
| "entropy": 1.3680420733988286, | |
| "epoch": 0.35024199209369344, | |
| "grad_norm": 0.11607158184051514, | |
| "learning_rate": 6.499187232156051e-05, | |
| "loss": 1.0203, | |
| "mean_token_accuracy": 0.7391661629080772, | |
| "num_tokens": 149047857.0, | |
| "step": 2370 | |
| }, | |
| { | |
| "entropy": 1.326318697631359, | |
| "epoch": 0.35171980640632505, | |
| "grad_norm": 0.1115611344575882, | |
| "learning_rate": 6.48440963499335e-05, | |
| "loss": 1.0044, | |
| "mean_token_accuracy": 0.7440035976469517, | |
| "num_tokens": 149677919.0, | |
| "step": 2380 | |
| }, | |
| { | |
| "entropy": 1.3716378539800644, | |
| "epoch": 0.35319762071895666, | |
| "grad_norm": 0.1267595738172531, | |
| "learning_rate": 6.469632037830649e-05, | |
| "loss": 1.0311, | |
| "mean_token_accuracy": 0.7415719844400883, | |
| "num_tokens": 150307607.0, | |
| "step": 2390 | |
| }, | |
| { | |
| "entropy": 1.3206391848623753, | |
| "epoch": 0.35467543503158827, | |
| "grad_norm": 0.11261120438575745, | |
| "learning_rate": 6.454854440667948e-05, | |
| "loss": 0.9928, | |
| "mean_token_accuracy": 0.7469543524086475, | |
| "num_tokens": 150954542.0, | |
| "step": 2400 | |
| }, | |
| { | |
| "entropy": 1.2988264113664627, | |
| "epoch": 0.3561532493442199, | |
| "grad_norm": 0.10469997674226761, | |
| "learning_rate": 6.440076843505247e-05, | |
| "loss": 0.9561, | |
| "mean_token_accuracy": 0.7532316006720066, | |
| "num_tokens": 151578422.0, | |
| "step": 2410 | |
| }, | |
| { | |
| "entropy": 1.3059771910309792, | |
| "epoch": 0.3576310636568515, | |
| "grad_norm": 0.10764110833406448, | |
| "learning_rate": 6.425299246342546e-05, | |
| "loss": 0.9763, | |
| "mean_token_accuracy": 0.74577169790864, | |
| "num_tokens": 152201507.0, | |
| "step": 2420 | |
| }, | |
| { | |
| "entropy": 1.348013310134411, | |
| "epoch": 0.35910887796948315, | |
| "grad_norm": 0.11025828123092651, | |
| "learning_rate": 6.410521649179843e-05, | |
| "loss": 1.0416, | |
| "mean_token_accuracy": 0.7364607952535153, | |
| "num_tokens": 152826167.0, | |
| "step": 2430 | |
| }, | |
| { | |
| "entropy": 1.358570785820484, | |
| "epoch": 0.36058669228211476, | |
| "grad_norm": 0.11537870019674301, | |
| "learning_rate": 6.395744052017142e-05, | |
| "loss": 1.0328, | |
| "mean_token_accuracy": 0.7381561897695065, | |
| "num_tokens": 153452977.0, | |
| "step": 2440 | |
| }, | |
| { | |
| "entropy": 1.290497499704361, | |
| "epoch": 0.36206450659474637, | |
| "grad_norm": 0.11319958418607712, | |
| "learning_rate": 6.38096645485444e-05, | |
| "loss": 0.9724, | |
| "mean_token_accuracy": 0.7475843630731106, | |
| "num_tokens": 154081881.0, | |
| "step": 2450 | |
| }, | |
| { | |
| "entropy": 1.3434569776058196, | |
| "epoch": 0.363542320907378, | |
| "grad_norm": 0.11890029907226562, | |
| "learning_rate": 6.36618885769174e-05, | |
| "loss": 1.0237, | |
| "mean_token_accuracy": 0.7408385023474693, | |
| "num_tokens": 154696692.0, | |
| "step": 2460 | |
| }, | |
| { | |
| "entropy": 1.3663389906287193, | |
| "epoch": 0.3650201352200096, | |
| "grad_norm": 0.10306631773710251, | |
| "learning_rate": 6.351411260529038e-05, | |
| "loss": 1.0883, | |
| "mean_token_accuracy": 0.7281133748590947, | |
| "num_tokens": 155326807.0, | |
| "step": 2470 | |
| }, | |
| { | |
| "entropy": 1.3352325096726418, | |
| "epoch": 0.3664979495326412, | |
| "grad_norm": 0.13469462096691132, | |
| "learning_rate": 6.336633663366337e-05, | |
| "loss": 1.0129, | |
| "mean_token_accuracy": 0.7416555799543858, | |
| "num_tokens": 155963544.0, | |
| "step": 2480 | |
| }, | |
| { | |
| "entropy": 1.3298554822802544, | |
| "epoch": 0.36797576384527286, | |
| "grad_norm": 0.13767758011817932, | |
| "learning_rate": 6.321856066203635e-05, | |
| "loss": 1.0151, | |
| "mean_token_accuracy": 0.7417769074440003, | |
| "num_tokens": 156583390.0, | |
| "step": 2490 | |
| }, | |
| { | |
| "entropy": 1.3384235605597496, | |
| "epoch": 0.36945357815790447, | |
| "grad_norm": 0.10280942171812057, | |
| "learning_rate": 6.307078469040935e-05, | |
| "loss": 1.0067, | |
| "mean_token_accuracy": 0.7415686272084713, | |
| "num_tokens": 157208767.0, | |
| "step": 2500 | |
| }, | |
| { | |
| "entropy": 1.3747689306735993, | |
| "epoch": 0.3709313924705361, | |
| "grad_norm": 0.11320924013853073, | |
| "learning_rate": 6.292300871878232e-05, | |
| "loss": 1.0687, | |
| "mean_token_accuracy": 0.7295591056346893, | |
| "num_tokens": 157830935.0, | |
| "step": 2510 | |
| }, | |
| { | |
| "entropy": 1.3555556759238243, | |
| "epoch": 0.3724092067831677, | |
| "grad_norm": 0.11231453716754913, | |
| "learning_rate": 6.277523274715531e-05, | |
| "loss": 1.0142, | |
| "mean_token_accuracy": 0.7398925371468067, | |
| "num_tokens": 158458326.0, | |
| "step": 2520 | |
| }, | |
| { | |
| "entropy": 1.3142734497785569, | |
| "epoch": 0.3738870210957993, | |
| "grad_norm": 0.12294314801692963, | |
| "learning_rate": 6.26274567755283e-05, | |
| "loss": 0.9793, | |
| "mean_token_accuracy": 0.7500525377690792, | |
| "num_tokens": 159116266.0, | |
| "step": 2530 | |
| }, | |
| { | |
| "entropy": 1.3187284499406815, | |
| "epoch": 0.3753648354084309, | |
| "grad_norm": 0.13975459337234497, | |
| "learning_rate": 6.247968080390129e-05, | |
| "loss": 0.9913, | |
| "mean_token_accuracy": 0.747199397534132, | |
| "num_tokens": 159751512.0, | |
| "step": 2540 | |
| }, | |
| { | |
| "entropy": 1.3505188934504986, | |
| "epoch": 0.3768426497210626, | |
| "grad_norm": 0.11873970925807953, | |
| "learning_rate": 6.233190483227428e-05, | |
| "loss": 1.0392, | |
| "mean_token_accuracy": 0.7385047681629657, | |
| "num_tokens": 160382970.0, | |
| "step": 2550 | |
| }, | |
| { | |
| "entropy": 1.3201254040002823, | |
| "epoch": 0.3783204640336942, | |
| "grad_norm": 0.14079681038856506, | |
| "learning_rate": 6.218412886064726e-05, | |
| "loss": 0.9961, | |
| "mean_token_accuracy": 0.746822776645422, | |
| "num_tokens": 161016940.0, | |
| "step": 2560 | |
| }, | |
| { | |
| "entropy": 1.3438078887760638, | |
| "epoch": 0.3797982783463258, | |
| "grad_norm": 0.10927737504243851, | |
| "learning_rate": 6.203635288902024e-05, | |
| "loss": 1.0477, | |
| "mean_token_accuracy": 0.732993096858263, | |
| "num_tokens": 161651492.0, | |
| "step": 2570 | |
| }, | |
| { | |
| "entropy": 1.3874997161328793, | |
| "epoch": 0.3812760926589574, | |
| "grad_norm": 0.11553368717432022, | |
| "learning_rate": 6.188857691739324e-05, | |
| "loss": 1.0577, | |
| "mean_token_accuracy": 0.7329879857599735, | |
| "num_tokens": 162317869.0, | |
| "step": 2580 | |
| }, | |
| { | |
| "entropy": 1.369983048737049, | |
| "epoch": 0.382753906971589, | |
| "grad_norm": 0.10490620881319046, | |
| "learning_rate": 6.174080094576621e-05, | |
| "loss": 1.0611, | |
| "mean_token_accuracy": 0.7350798234343529, | |
| "num_tokens": 162956671.0, | |
| "step": 2590 | |
| }, | |
| { | |
| "entropy": 1.3504191115498543, | |
| "epoch": 0.3842317212842206, | |
| "grad_norm": 0.12128763645887375, | |
| "learning_rate": 6.159302497413922e-05, | |
| "loss": 1.0338, | |
| "mean_token_accuracy": 0.7371863946318626, | |
| "num_tokens": 163576216.0, | |
| "step": 2600 | |
| }, | |
| { | |
| "entropy": 1.2979571580886842, | |
| "epoch": 0.3857095355968523, | |
| "grad_norm": 0.10547712445259094, | |
| "learning_rate": 6.144524900251219e-05, | |
| "loss": 0.9993, | |
| "mean_token_accuracy": 0.7470176264643669, | |
| "num_tokens": 164191471.0, | |
| "step": 2610 | |
| }, | |
| { | |
| "entropy": 1.299732106924057, | |
| "epoch": 0.3871873499094839, | |
| "grad_norm": 0.10867074877023697, | |
| "learning_rate": 6.129747303088518e-05, | |
| "loss": 0.9935, | |
| "mean_token_accuracy": 0.7457987800240516, | |
| "num_tokens": 164825405.0, | |
| "step": 2620 | |
| }, | |
| { | |
| "entropy": 1.347513662278652, | |
| "epoch": 0.3886651642221155, | |
| "grad_norm": 0.10699914395809174, | |
| "learning_rate": 6.114969705925817e-05, | |
| "loss": 1.0376, | |
| "mean_token_accuracy": 0.7393544964492321, | |
| "num_tokens": 165469743.0, | |
| "step": 2630 | |
| }, | |
| { | |
| "entropy": 1.3306864887475967, | |
| "epoch": 0.3901429785347471, | |
| "grad_norm": 0.11511126160621643, | |
| "learning_rate": 6.1001921087631156e-05, | |
| "loss": 1.019, | |
| "mean_token_accuracy": 0.7381970398128033, | |
| "num_tokens": 166089598.0, | |
| "step": 2640 | |
| }, | |
| { | |
| "entropy": 1.3333285301923752, | |
| "epoch": 0.3916207928473787, | |
| "grad_norm": 0.11367027461528778, | |
| "learning_rate": 6.085414511600414e-05, | |
| "loss": 0.997, | |
| "mean_token_accuracy": 0.7467053011059761, | |
| "num_tokens": 166717021.0, | |
| "step": 2650 | |
| }, | |
| { | |
| "entropy": 1.3339226961135864, | |
| "epoch": 0.3930986071600103, | |
| "grad_norm": 0.11065942049026489, | |
| "learning_rate": 6.0706369144377126e-05, | |
| "loss": 1.004, | |
| "mean_token_accuracy": 0.7448596432805061, | |
| "num_tokens": 167341286.0, | |
| "step": 2660 | |
| }, | |
| { | |
| "entropy": 1.3062518246471881, | |
| "epoch": 0.39457642147264194, | |
| "grad_norm": 0.12307227402925491, | |
| "learning_rate": 6.0558593172750114e-05, | |
| "loss": 0.985, | |
| "mean_token_accuracy": 0.7469465628266334, | |
| "num_tokens": 167969100.0, | |
| "step": 2670 | |
| }, | |
| { | |
| "entropy": 1.3655583813786507, | |
| "epoch": 0.3960542357852736, | |
| "grad_norm": 0.10138296335935593, | |
| "learning_rate": 6.04108172011231e-05, | |
| "loss": 1.0372, | |
| "mean_token_accuracy": 0.739393538236618, | |
| "num_tokens": 168608314.0, | |
| "step": 2680 | |
| }, | |
| { | |
| "entropy": 1.2950063794851303, | |
| "epoch": 0.3975320500979052, | |
| "grad_norm": 0.11317243427038193, | |
| "learning_rate": 6.0263041229496084e-05, | |
| "loss": 0.9429, | |
| "mean_token_accuracy": 0.7571868598461151, | |
| "num_tokens": 169227402.0, | |
| "step": 2690 | |
| }, | |
| { | |
| "entropy": 1.3435308299958706, | |
| "epoch": 0.3990098644105368, | |
| "grad_norm": 0.11763688176870346, | |
| "learning_rate": 6.011526525786907e-05, | |
| "loss": 1.0319, | |
| "mean_token_accuracy": 0.739401226490736, | |
| "num_tokens": 169846401.0, | |
| "step": 2700 | |
| }, | |
| { | |
| "entropy": 1.3442980594933034, | |
| "epoch": 0.4004876787231684, | |
| "grad_norm": 0.10513842850923538, | |
| "learning_rate": 5.996748928624206e-05, | |
| "loss": 0.9871, | |
| "mean_token_accuracy": 0.7463423803448677, | |
| "num_tokens": 170476608.0, | |
| "step": 2710 | |
| }, | |
| { | |
| "entropy": 1.343531072884798, | |
| "epoch": 0.40196549303580004, | |
| "grad_norm": 0.11001633107662201, | |
| "learning_rate": 5.981971331461504e-05, | |
| "loss": 1.0192, | |
| "mean_token_accuracy": 0.7424076452851296, | |
| "num_tokens": 171098245.0, | |
| "step": 2720 | |
| }, | |
| { | |
| "entropy": 1.3884330071508884, | |
| "epoch": 0.40344330734843165, | |
| "grad_norm": 0.11198286712169647, | |
| "learning_rate": 5.9671937342988037e-05, | |
| "loss": 1.0602, | |
| "mean_token_accuracy": 0.7355059400200844, | |
| "num_tokens": 171723965.0, | |
| "step": 2730 | |
| }, | |
| { | |
| "entropy": 1.3671185605227947, | |
| "epoch": 0.4049211216610633, | |
| "grad_norm": 0.11801856756210327, | |
| "learning_rate": 5.952416137136102e-05, | |
| "loss": 1.0268, | |
| "mean_token_accuracy": 0.7393461734056472, | |
| "num_tokens": 172347061.0, | |
| "step": 2740 | |
| }, | |
| { | |
| "entropy": 1.323919515311718, | |
| "epoch": 0.4063989359736949, | |
| "grad_norm": 0.11580619215965271, | |
| "learning_rate": 5.9376385399734e-05, | |
| "loss": 1.0054, | |
| "mean_token_accuracy": 0.7442776501178742, | |
| "num_tokens": 172982062.0, | |
| "step": 2750 | |
| }, | |
| { | |
| "entropy": 1.3789773643016816, | |
| "epoch": 0.40787675028632653, | |
| "grad_norm": 0.10008373856544495, | |
| "learning_rate": 5.9228609428106994e-05, | |
| "loss": 1.0165, | |
| "mean_token_accuracy": 0.7394210025668144, | |
| "num_tokens": 173615266.0, | |
| "step": 2760 | |
| }, | |
| { | |
| "entropy": 1.326123160123825, | |
| "epoch": 0.40935456459895814, | |
| "grad_norm": 0.12968984246253967, | |
| "learning_rate": 5.9080833456479976e-05, | |
| "loss": 1.0073, | |
| "mean_token_accuracy": 0.7445714198052883, | |
| "num_tokens": 174247388.0, | |
| "step": 2770 | |
| }, | |
| { | |
| "entropy": 1.3163345210254191, | |
| "epoch": 0.41083237891158975, | |
| "grad_norm": 0.10620130598545074, | |
| "learning_rate": 5.893305748485296e-05, | |
| "loss": 1.0153, | |
| "mean_token_accuracy": 0.7422694250941276, | |
| "num_tokens": 174887319.0, | |
| "step": 2780 | |
| }, | |
| { | |
| "entropy": 1.276471631973982, | |
| "epoch": 0.41231019322422136, | |
| "grad_norm": 0.11546126008033752, | |
| "learning_rate": 5.878528151322595e-05, | |
| "loss": 0.956, | |
| "mean_token_accuracy": 0.7540316492319107, | |
| "num_tokens": 175521599.0, | |
| "step": 2790 | |
| }, | |
| { | |
| "entropy": 1.3033716894686223, | |
| "epoch": 0.413788007536853, | |
| "grad_norm": 0.11271125823259354, | |
| "learning_rate": 5.8637505541598934e-05, | |
| "loss": 0.9837, | |
| "mean_token_accuracy": 0.7463239781558514, | |
| "num_tokens": 176139684.0, | |
| "step": 2800 | |
| }, | |
| { | |
| "entropy": 1.334360421448946, | |
| "epoch": 0.41526582184948463, | |
| "grad_norm": 0.110804982483387, | |
| "learning_rate": 5.848972956997193e-05, | |
| "loss": 1.0242, | |
| "mean_token_accuracy": 0.7349204763770103, | |
| "num_tokens": 176749358.0, | |
| "step": 2810 | |
| }, | |
| { | |
| "entropy": 1.3180787444114686, | |
| "epoch": 0.41674363616211624, | |
| "grad_norm": 0.11518800258636475, | |
| "learning_rate": 5.834195359834491e-05, | |
| "loss": 0.9923, | |
| "mean_token_accuracy": 0.747980859130621, | |
| "num_tokens": 177363939.0, | |
| "step": 2820 | |
| }, | |
| { | |
| "entropy": 1.3395656317472457, | |
| "epoch": 0.41822145047474785, | |
| "grad_norm": 0.10945259779691696, | |
| "learning_rate": 5.819417762671789e-05, | |
| "loss": 1.0213, | |
| "mean_token_accuracy": 0.7422494500875473, | |
| "num_tokens": 177989786.0, | |
| "step": 2830 | |
| }, | |
| { | |
| "entropy": 1.3470888301730155, | |
| "epoch": 0.41969926478737946, | |
| "grad_norm": 0.14387215673923492, | |
| "learning_rate": 5.804640165509089e-05, | |
| "loss": 1.0387, | |
| "mean_token_accuracy": 0.7359960667788983, | |
| "num_tokens": 178631952.0, | |
| "step": 2840 | |
| }, | |
| { | |
| "entropy": 1.3248698562383652, | |
| "epoch": 0.42117707910001106, | |
| "grad_norm": 0.12421754747629166, | |
| "learning_rate": 5.789862568346387e-05, | |
| "loss": 1.0008, | |
| "mean_token_accuracy": 0.7468325570225716, | |
| "num_tokens": 179267882.0, | |
| "step": 2850 | |
| }, | |
| { | |
| "entropy": 1.3252468392252923, | |
| "epoch": 0.4226548934126427, | |
| "grad_norm": 0.12913116812705994, | |
| "learning_rate": 5.775084971183686e-05, | |
| "loss": 0.9956, | |
| "mean_token_accuracy": 0.7422256797552109, | |
| "num_tokens": 179898670.0, | |
| "step": 2860 | |
| }, | |
| { | |
| "entropy": 1.3273553922772408, | |
| "epoch": 0.42413270772527434, | |
| "grad_norm": 0.1182723343372345, | |
| "learning_rate": 5.7603073740209845e-05, | |
| "loss": 1.0077, | |
| "mean_token_accuracy": 0.745375657826662, | |
| "num_tokens": 180555347.0, | |
| "step": 2870 | |
| }, | |
| { | |
| "entropy": 1.2914891712367536, | |
| "epoch": 0.42561052203790595, | |
| "grad_norm": 0.10932762920856476, | |
| "learning_rate": 5.7455297768582826e-05, | |
| "loss": 1.014, | |
| "mean_token_accuracy": 0.7426045201718807, | |
| "num_tokens": 181201294.0, | |
| "step": 2880 | |
| }, | |
| { | |
| "entropy": 1.3286943525075912, | |
| "epoch": 0.42708833635053756, | |
| "grad_norm": 0.11981204897165298, | |
| "learning_rate": 5.730752179695582e-05, | |
| "loss": 1.0206, | |
| "mean_token_accuracy": 0.7393959686160088, | |
| "num_tokens": 181830863.0, | |
| "step": 2890 | |
| }, | |
| { | |
| "entropy": 1.3407499633729458, | |
| "epoch": 0.42856615066316917, | |
| "grad_norm": 0.10789301991462708, | |
| "learning_rate": 5.71597458253288e-05, | |
| "loss": 1.018, | |
| "mean_token_accuracy": 0.741955791413784, | |
| "num_tokens": 182462480.0, | |
| "step": 2900 | |
| }, | |
| { | |
| "entropy": 1.3357246771454812, | |
| "epoch": 0.4300439649758008, | |
| "grad_norm": 0.12831929326057434, | |
| "learning_rate": 5.7011969853701784e-05, | |
| "loss": 1.0442, | |
| "mean_token_accuracy": 0.7360114604234695, | |
| "num_tokens": 183084422.0, | |
| "step": 2910 | |
| }, | |
| { | |
| "entropy": 1.299278263002634, | |
| "epoch": 0.4315217792884324, | |
| "grad_norm": 0.1147497147321701, | |
| "learning_rate": 5.686419388207478e-05, | |
| "loss": 0.9936, | |
| "mean_token_accuracy": 0.7489165782928466, | |
| "num_tokens": 183718870.0, | |
| "step": 2920 | |
| }, | |
| { | |
| "entropy": 1.3196597643196584, | |
| "epoch": 0.43299959360106405, | |
| "grad_norm": 0.10116377472877502, | |
| "learning_rate": 5.671641791044776e-05, | |
| "loss": 1.0105, | |
| "mean_token_accuracy": 0.7411533951759338, | |
| "num_tokens": 184342140.0, | |
| "step": 2930 | |
| }, | |
| { | |
| "entropy": 1.34343186840415, | |
| "epoch": 0.43447740791369566, | |
| "grad_norm": 0.12002977728843689, | |
| "learning_rate": 5.6568641938820756e-05, | |
| "loss": 1.0508, | |
| "mean_token_accuracy": 0.7358109518885613, | |
| "num_tokens": 184959915.0, | |
| "step": 2940 | |
| }, | |
| { | |
| "entropy": 1.3466629028320312, | |
| "epoch": 0.43595522222632727, | |
| "grad_norm": 0.10612580180168152, | |
| "learning_rate": 5.642086596719374e-05, | |
| "loss": 1.0546, | |
| "mean_token_accuracy": 0.732919916510582, | |
| "num_tokens": 185596121.0, | |
| "step": 2950 | |
| }, | |
| { | |
| "entropy": 1.384493639320135, | |
| "epoch": 0.4374330365389589, | |
| "grad_norm": 0.11402401328086853, | |
| "learning_rate": 5.627308999556672e-05, | |
| "loss": 1.0618, | |
| "mean_token_accuracy": 0.7344385020434856, | |
| "num_tokens": 186237747.0, | |
| "step": 2960 | |
| }, | |
| { | |
| "entropy": 1.3325828693807125, | |
| "epoch": 0.4389108508515905, | |
| "grad_norm": 0.11494413763284683, | |
| "learning_rate": 5.6125314023939714e-05, | |
| "loss": 1.067, | |
| "mean_token_accuracy": 0.7311987280845642, | |
| "num_tokens": 186859181.0, | |
| "step": 2970 | |
| }, | |
| { | |
| "entropy": 1.3028566606342793, | |
| "epoch": 0.4403886651642221, | |
| "grad_norm": 0.11112917959690094, | |
| "learning_rate": 5.5977538052312695e-05, | |
| "loss": 0.9694, | |
| "mean_token_accuracy": 0.7484906904399395, | |
| "num_tokens": 187507475.0, | |
| "step": 2980 | |
| }, | |
| { | |
| "entropy": 1.3332383722066878, | |
| "epoch": 0.44186647947685376, | |
| "grad_norm": 0.12574991583824158, | |
| "learning_rate": 5.582976208068569e-05, | |
| "loss": 1.0308, | |
| "mean_token_accuracy": 0.7397411569952965, | |
| "num_tokens": 188138462.0, | |
| "step": 2990 | |
| }, | |
| { | |
| "entropy": 1.3662227645516396, | |
| "epoch": 0.44334429378948537, | |
| "grad_norm": 0.12452980130910873, | |
| "learning_rate": 5.568198610905867e-05, | |
| "loss": 1.0462, | |
| "mean_token_accuracy": 0.7339240312576294, | |
| "num_tokens": 188757427.0, | |
| "step": 3000 | |
| }, | |
| { | |
| "entropy": 1.3738774508237839, | |
| "epoch": 0.444822108102117, | |
| "grad_norm": 0.12353511899709702, | |
| "learning_rate": 5.553421013743165e-05, | |
| "loss": 1.0545, | |
| "mean_token_accuracy": 0.7342685110867023, | |
| "num_tokens": 189384207.0, | |
| "step": 3010 | |
| }, | |
| { | |
| "entropy": 1.3274571530520916, | |
| "epoch": 0.4462999224147486, | |
| "grad_norm": 0.1116141825914383, | |
| "learning_rate": 5.538643416580465e-05, | |
| "loss": 0.9787, | |
| "mean_token_accuracy": 0.7479172520339489, | |
| "num_tokens": 190024832.0, | |
| "step": 3020 | |
| }, | |
| { | |
| "entropy": 1.294634611159563, | |
| "epoch": 0.4477777367273802, | |
| "grad_norm": 0.10204346477985382, | |
| "learning_rate": 5.523865819417763e-05, | |
| "loss": 0.9898, | |
| "mean_token_accuracy": 0.7439772725105286, | |
| "num_tokens": 190647129.0, | |
| "step": 3030 | |
| }, | |
| { | |
| "entropy": 1.3052165731787682, | |
| "epoch": 0.4492555510400118, | |
| "grad_norm": 0.11496242135763168, | |
| "learning_rate": 5.509088222255061e-05, | |
| "loss": 0.9795, | |
| "mean_token_accuracy": 0.7487292625010014, | |
| "num_tokens": 191248869.0, | |
| "step": 3040 | |
| }, | |
| { | |
| "entropy": 1.3516557164490224, | |
| "epoch": 0.45073336535264347, | |
| "grad_norm": 0.10153250396251678, | |
| "learning_rate": 5.4943106250923606e-05, | |
| "loss": 1.021, | |
| "mean_token_accuracy": 0.7397518754005432, | |
| "num_tokens": 191884174.0, | |
| "step": 3050 | |
| }, | |
| { | |
| "entropy": 1.3404523707926272, | |
| "epoch": 0.4522111796652751, | |
| "grad_norm": 0.12902577221393585, | |
| "learning_rate": 5.479533027929659e-05, | |
| "loss": 1.0308, | |
| "mean_token_accuracy": 0.7386652678251266, | |
| "num_tokens": 192490961.0, | |
| "step": 3060 | |
| }, | |
| { | |
| "entropy": 1.3242835983633996, | |
| "epoch": 0.4536889939779067, | |
| "grad_norm": 0.11308476328849792, | |
| "learning_rate": 5.464755430766958e-05, | |
| "loss": 1.0502, | |
| "mean_token_accuracy": 0.7358929142355919, | |
| "num_tokens": 193087055.0, | |
| "step": 3070 | |
| }, | |
| { | |
| "entropy": 1.3779341116547585, | |
| "epoch": 0.4551668082905383, | |
| "grad_norm": 0.1298595815896988, | |
| "learning_rate": 5.4499778336042564e-05, | |
| "loss": 1.0506, | |
| "mean_token_accuracy": 0.7345085546374321, | |
| "num_tokens": 193712926.0, | |
| "step": 3080 | |
| }, | |
| { | |
| "entropy": 1.3581049352884293, | |
| "epoch": 0.4566446226031699, | |
| "grad_norm": 0.11287155002355576, | |
| "learning_rate": 5.4352002364415545e-05, | |
| "loss": 1.0258, | |
| "mean_token_accuracy": 0.737793606519699, | |
| "num_tokens": 194352679.0, | |
| "step": 3090 | |
| }, | |
| { | |
| "entropy": 1.3133333794772626, | |
| "epoch": 0.4581224369158015, | |
| "grad_norm": 0.11862477660179138, | |
| "learning_rate": 5.420422639278854e-05, | |
| "loss": 1.0119, | |
| "mean_token_accuracy": 0.742002834379673, | |
| "num_tokens": 194979080.0, | |
| "step": 3100 | |
| }, | |
| { | |
| "entropy": 1.3262240797281266, | |
| "epoch": 0.4596002512284331, | |
| "grad_norm": 0.11039308458566666, | |
| "learning_rate": 5.405645042116152e-05, | |
| "loss": 1.004, | |
| "mean_token_accuracy": 0.7448594368994236, | |
| "num_tokens": 195599027.0, | |
| "step": 3110 | |
| }, | |
| { | |
| "entropy": 1.3526733674108982, | |
| "epoch": 0.4610780655410648, | |
| "grad_norm": 0.12351663410663605, | |
| "learning_rate": 5.390867444953451e-05, | |
| "loss": 1.025, | |
| "mean_token_accuracy": 0.7385124079883099, | |
| "num_tokens": 196222237.0, | |
| "step": 3120 | |
| }, | |
| { | |
| "entropy": 1.3755785167217254, | |
| "epoch": 0.4625558798536964, | |
| "grad_norm": 0.11777998507022858, | |
| "learning_rate": 5.37608984779075e-05, | |
| "loss": 1.0615, | |
| "mean_token_accuracy": 0.7338152408599854, | |
| "num_tokens": 196849072.0, | |
| "step": 3130 | |
| }, | |
| { | |
| "entropy": 1.2873252600431442, | |
| "epoch": 0.464033694166328, | |
| "grad_norm": 0.1119779720902443, | |
| "learning_rate": 5.361312250628048e-05, | |
| "loss": 0.9939, | |
| "mean_token_accuracy": 0.7457574985921382, | |
| "num_tokens": 197479996.0, | |
| "step": 3140 | |
| }, | |
| { | |
| "entropy": 1.3290088526904582, | |
| "epoch": 0.4655115084789596, | |
| "grad_norm": 0.10185403376817703, | |
| "learning_rate": 5.346534653465347e-05, | |
| "loss": 0.9982, | |
| "mean_token_accuracy": 0.745093023777008, | |
| "num_tokens": 198114198.0, | |
| "step": 3150 | |
| }, | |
| { | |
| "entropy": 1.3040216162800788, | |
| "epoch": 0.4669893227915912, | |
| "grad_norm": 0.12758901715278625, | |
| "learning_rate": 5.3317570563026456e-05, | |
| "loss": 0.9908, | |
| "mean_token_accuracy": 0.7469444774091244, | |
| "num_tokens": 198744871.0, | |
| "step": 3160 | |
| }, | |
| { | |
| "entropy": 1.3350887216627598, | |
| "epoch": 0.46846713710422283, | |
| "grad_norm": 0.12365201860666275, | |
| "learning_rate": 5.316979459139944e-05, | |
| "loss": 1.029, | |
| "mean_token_accuracy": 0.7377054400742054, | |
| "num_tokens": 199368679.0, | |
| "step": 3170 | |
| }, | |
| { | |
| "entropy": 1.3086614586412906, | |
| "epoch": 0.4699449514168545, | |
| "grad_norm": 0.12184581160545349, | |
| "learning_rate": 5.3022018619772426e-05, | |
| "loss": 1.0208, | |
| "mean_token_accuracy": 0.7402149192988873, | |
| "num_tokens": 199988730.0, | |
| "step": 3180 | |
| }, | |
| { | |
| "entropy": 1.338922818750143, | |
| "epoch": 0.4714227657294861, | |
| "grad_norm": 0.11584389209747314, | |
| "learning_rate": 5.2874242648145414e-05, | |
| "loss": 1.0249, | |
| "mean_token_accuracy": 0.7406525187194347, | |
| "num_tokens": 200601443.0, | |
| "step": 3190 | |
| }, | |
| { | |
| "entropy": 1.3665964484214783, | |
| "epoch": 0.4729005800421177, | |
| "grad_norm": 0.11363598704338074, | |
| "learning_rate": 5.27264666765184e-05, | |
| "loss": 1.0536, | |
| "mean_token_accuracy": 0.7332972958683968, | |
| "num_tokens": 201253526.0, | |
| "step": 3200 | |
| }, | |
| { | |
| "entropy": 1.363574294000864, | |
| "epoch": 0.4743783943547493, | |
| "grad_norm": 0.1246991977095604, | |
| "learning_rate": 5.2578690704891384e-05, | |
| "loss": 1.0539, | |
| "mean_token_accuracy": 0.7336206682026386, | |
| "num_tokens": 201889341.0, | |
| "step": 3210 | |
| }, | |
| { | |
| "entropy": 1.3425316251814365, | |
| "epoch": 0.47585620866738093, | |
| "grad_norm": 0.11345670372247696, | |
| "learning_rate": 5.243091473326437e-05, | |
| "loss": 1.036, | |
| "mean_token_accuracy": 0.7365034572780133, | |
| "num_tokens": 202529041.0, | |
| "step": 3220 | |
| }, | |
| { | |
| "entropy": 1.3099669203162194, | |
| "epoch": 0.47733402298001254, | |
| "grad_norm": 0.11768782883882523, | |
| "learning_rate": 5.228313876163736e-05, | |
| "loss": 1.0065, | |
| "mean_token_accuracy": 0.7445768341422081, | |
| "num_tokens": 203154925.0, | |
| "step": 3230 | |
| }, | |
| { | |
| "entropy": 1.3240293197333812, | |
| "epoch": 0.4788118372926442, | |
| "grad_norm": 0.12721501290798187, | |
| "learning_rate": 5.213536279001034e-05, | |
| "loss": 0.9708, | |
| "mean_token_accuracy": 0.7518071658909321, | |
| "num_tokens": 203799822.0, | |
| "step": 3240 | |
| }, | |
| { | |
| "entropy": 1.3182805471122265, | |
| "epoch": 0.4802896516052758, | |
| "grad_norm": 0.13314363360404968, | |
| "learning_rate": 5.198758681838334e-05, | |
| "loss": 0.989, | |
| "mean_token_accuracy": 0.7485011011362076, | |
| "num_tokens": 204427998.0, | |
| "step": 3250 | |
| }, | |
| { | |
| "entropy": 1.3208178155124188, | |
| "epoch": 0.4817674659179074, | |
| "grad_norm": 0.10576171427965164, | |
| "learning_rate": 5.183981084675632e-05, | |
| "loss": 1.0116, | |
| "mean_token_accuracy": 0.7418395794928074, | |
| "num_tokens": 205083218.0, | |
| "step": 3260 | |
| }, | |
| { | |
| "entropy": 1.366914363950491, | |
| "epoch": 0.48324528023053903, | |
| "grad_norm": 0.10938998311758041, | |
| "learning_rate": 5.16920348751293e-05, | |
| "loss": 1.0495, | |
| "mean_token_accuracy": 0.7358329579234123, | |
| "num_tokens": 205713942.0, | |
| "step": 3270 | |
| }, | |
| { | |
| "entropy": 1.3152115523815155, | |
| "epoch": 0.48472309454317064, | |
| "grad_norm": 0.1116151288151741, | |
| "learning_rate": 5.1544258903502295e-05, | |
| "loss": 1.0067, | |
| "mean_token_accuracy": 0.7463385559618473, | |
| "num_tokens": 206352602.0, | |
| "step": 3280 | |
| }, | |
| { | |
| "entropy": 1.34514739215374, | |
| "epoch": 0.48620090885580225, | |
| "grad_norm": 0.10949606448411942, | |
| "learning_rate": 5.1396482931875276e-05, | |
| "loss": 1.0212, | |
| "mean_token_accuracy": 0.7405461743474007, | |
| "num_tokens": 207004780.0, | |
| "step": 3290 | |
| }, | |
| { | |
| "entropy": 1.3107164040207864, | |
| "epoch": 0.48767872316843386, | |
| "grad_norm": 0.12132346630096436, | |
| "learning_rate": 5.124870696024826e-05, | |
| "loss": 0.9977, | |
| "mean_token_accuracy": 0.7398034170269966, | |
| "num_tokens": 207631812.0, | |
| "step": 3300 | |
| }, | |
| { | |
| "entropy": 1.337456651031971, | |
| "epoch": 0.4891565374810655, | |
| "grad_norm": 0.10723264515399933, | |
| "learning_rate": 5.110093098862125e-05, | |
| "loss": 1.0045, | |
| "mean_token_accuracy": 0.7424529060721398, | |
| "num_tokens": 208270670.0, | |
| "step": 3310 | |
| }, | |
| { | |
| "entropy": 1.3590418472886086, | |
| "epoch": 0.49063435179369713, | |
| "grad_norm": 0.1069742813706398, | |
| "learning_rate": 5.0953155016994234e-05, | |
| "loss": 1.0674, | |
| "mean_token_accuracy": 0.7290687002241611, | |
| "num_tokens": 208920781.0, | |
| "step": 3320 | |
| }, | |
| { | |
| "entropy": 1.3540847443044186, | |
| "epoch": 0.49211216610632874, | |
| "grad_norm": 0.11442390084266663, | |
| "learning_rate": 5.080537904536723e-05, | |
| "loss": 1.0385, | |
| "mean_token_accuracy": 0.7392103366553784, | |
| "num_tokens": 209536141.0, | |
| "step": 3330 | |
| }, | |
| { | |
| "entropy": 1.3643196202814578, | |
| "epoch": 0.49358998041896035, | |
| "grad_norm": 0.12627092003822327, | |
| "learning_rate": 5.065760307374021e-05, | |
| "loss": 1.0249, | |
| "mean_token_accuracy": 0.7383069723844529, | |
| "num_tokens": 210149369.0, | |
| "step": 3340 | |
| }, | |
| { | |
| "entropy": 1.3445673748850822, | |
| "epoch": 0.49506779473159196, | |
| "grad_norm": 0.10701033473014832, | |
| "learning_rate": 5.050982710211319e-05, | |
| "loss": 1.0357, | |
| "mean_token_accuracy": 0.7391380302608013, | |
| "num_tokens": 210762484.0, | |
| "step": 3350 | |
| }, | |
| { | |
| "entropy": 1.318381641060114, | |
| "epoch": 0.49654560904422357, | |
| "grad_norm": 0.12191876024007797, | |
| "learning_rate": 5.036205113048619e-05, | |
| "loss": 0.992, | |
| "mean_token_accuracy": 0.7471228286623954, | |
| "num_tokens": 211400973.0, | |
| "step": 3360 | |
| }, | |
| { | |
| "entropy": 1.3595143400132657, | |
| "epoch": 0.49802342335685523, | |
| "grad_norm": 0.14100560545921326, | |
| "learning_rate": 5.021427515885917e-05, | |
| "loss": 1.0524, | |
| "mean_token_accuracy": 0.7343139186501503, | |
| "num_tokens": 212028494.0, | |
| "step": 3370 | |
| }, | |
| { | |
| "entropy": 1.3375087425112724, | |
| "epoch": 0.49950123766948684, | |
| "grad_norm": 0.11061199009418488, | |
| "learning_rate": 5.0066499187232164e-05, | |
| "loss": 1.0043, | |
| "mean_token_accuracy": 0.7437618337571621, | |
| "num_tokens": 212667189.0, | |
| "step": 3380 | |
| }, | |
| { | |
| "entropy": 1.3430921614170075, | |
| "epoch": 0.5009790519821185, | |
| "grad_norm": 0.11417815834283829, | |
| "learning_rate": 4.9918723215605145e-05, | |
| "loss": 1.0105, | |
| "mean_token_accuracy": 0.7393266052007675, | |
| "num_tokens": 213296769.0, | |
| "step": 3390 | |
| }, | |
| { | |
| "entropy": 1.3418936803936958, | |
| "epoch": 0.5024568662947501, | |
| "grad_norm": 0.12051557004451752, | |
| "learning_rate": 4.9770947243978133e-05, | |
| "loss": 1.0411, | |
| "mean_token_accuracy": 0.7347103841602802, | |
| "num_tokens": 213917765.0, | |
| "step": 3400 | |
| }, | |
| { | |
| "entropy": 1.3763892143964767, | |
| "epoch": 0.5039346806073817, | |
| "grad_norm": 0.1224110797047615, | |
| "learning_rate": 4.9623171272351115e-05, | |
| "loss": 1.0732, | |
| "mean_token_accuracy": 0.7312706559896469, | |
| "num_tokens": 214547796.0, | |
| "step": 3410 | |
| }, | |
| { | |
| "entropy": 1.332948635518551, | |
| "epoch": 0.5054124949200133, | |
| "grad_norm": 0.13498088717460632, | |
| "learning_rate": 4.94753953007241e-05, | |
| "loss": 1.0243, | |
| "mean_token_accuracy": 0.7391216315329074, | |
| "num_tokens": 215178078.0, | |
| "step": 3420 | |
| }, | |
| { | |
| "entropy": 1.3343242034316063, | |
| "epoch": 0.5068903092326449, | |
| "grad_norm": 0.10605301707983017, | |
| "learning_rate": 4.932761932909709e-05, | |
| "loss": 1.0012, | |
| "mean_token_accuracy": 0.7469499759376049, | |
| "num_tokens": 215832232.0, | |
| "step": 3430 | |
| }, | |
| { | |
| "entropy": 1.3277502968907355, | |
| "epoch": 0.5083681235452765, | |
| "grad_norm": 0.130407452583313, | |
| "learning_rate": 4.917984335747008e-05, | |
| "loss": 1.0263, | |
| "mean_token_accuracy": 0.7371391884982585, | |
| "num_tokens": 216462370.0, | |
| "step": 3440 | |
| }, | |
| { | |
| "entropy": 1.3561268150806427, | |
| "epoch": 0.5098459378579081, | |
| "grad_norm": 0.11962781101465225, | |
| "learning_rate": 4.903206738584307e-05, | |
| "loss": 1.0359, | |
| "mean_token_accuracy": 0.7392862103879452, | |
| "num_tokens": 217087857.0, | |
| "step": 3450 | |
| }, | |
| { | |
| "entropy": 1.328464537113905, | |
| "epoch": 0.5113237521705398, | |
| "grad_norm": 0.12519234418869019, | |
| "learning_rate": 4.888429141421605e-05, | |
| "loss": 1.0324, | |
| "mean_token_accuracy": 0.7398794747889041, | |
| "num_tokens": 217708160.0, | |
| "step": 3460 | |
| }, | |
| { | |
| "entropy": 1.3790725782513618, | |
| "epoch": 0.5128015664831714, | |
| "grad_norm": 0.12732987105846405, | |
| "learning_rate": 4.873651544258904e-05, | |
| "loss": 1.0761, | |
| "mean_token_accuracy": 0.7279979415237904, | |
| "num_tokens": 218321702.0, | |
| "step": 3470 | |
| }, | |
| { | |
| "entropy": 1.4037544824182988, | |
| "epoch": 0.514279380795803, | |
| "grad_norm": 0.11995565891265869, | |
| "learning_rate": 4.8588739470962026e-05, | |
| "loss": 1.0948, | |
| "mean_token_accuracy": 0.7246852949261665, | |
| "num_tokens": 218935590.0, | |
| "step": 3480 | |
| }, | |
| { | |
| "entropy": 1.326191857457161, | |
| "epoch": 0.5157571951084347, | |
| "grad_norm": 0.1153104230761528, | |
| "learning_rate": 4.8440963499335014e-05, | |
| "loss": 1.0094, | |
| "mean_token_accuracy": 0.7434732802212238, | |
| "num_tokens": 219569838.0, | |
| "step": 3490 | |
| }, | |
| { | |
| "entropy": 1.3592430077493192, | |
| "epoch": 0.5172350094210663, | |
| "grad_norm": 0.13453197479248047, | |
| "learning_rate": 4.8293187527707996e-05, | |
| "loss": 1.048, | |
| "mean_token_accuracy": 0.7330381028354168, | |
| "num_tokens": 220185249.0, | |
| "step": 3500 | |
| }, | |
| { | |
| "entropy": 1.3487900651991367, | |
| "epoch": 0.5187128237336979, | |
| "grad_norm": 0.13040119409561157, | |
| "learning_rate": 4.8145411556080984e-05, | |
| "loss": 1.0152, | |
| "mean_token_accuracy": 0.7400082737207413, | |
| "num_tokens": 220811253.0, | |
| "step": 3510 | |
| }, | |
| { | |
| "entropy": 1.3602138139307498, | |
| "epoch": 0.5201906380463295, | |
| "grad_norm": 0.11324775218963623, | |
| "learning_rate": 4.799763558445397e-05, | |
| "loss": 1.067, | |
| "mean_token_accuracy": 0.7322800144553184, | |
| "num_tokens": 221436414.0, | |
| "step": 3520 | |
| }, | |
| { | |
| "entropy": 1.3038682721555233, | |
| "epoch": 0.5216684523589611, | |
| "grad_norm": 0.11579470336437225, | |
| "learning_rate": 4.784985961282696e-05, | |
| "loss": 1.01, | |
| "mean_token_accuracy": 0.74277663230896, | |
| "num_tokens": 222059865.0, | |
| "step": 3530 | |
| }, | |
| { | |
| "entropy": 1.3233835257589817, | |
| "epoch": 0.5231462666715927, | |
| "grad_norm": 0.1281614601612091, | |
| "learning_rate": 4.770208364119994e-05, | |
| "loss": 1.0014, | |
| "mean_token_accuracy": 0.7457077689468861, | |
| "num_tokens": 222689051.0, | |
| "step": 3540 | |
| }, | |
| { | |
| "entropy": 1.3150438368320465, | |
| "epoch": 0.5246240809842243, | |
| "grad_norm": 0.13878072798252106, | |
| "learning_rate": 4.755430766957293e-05, | |
| "loss": 0.9982, | |
| "mean_token_accuracy": 0.7474694885313511, | |
| "num_tokens": 223298231.0, | |
| "step": 3550 | |
| }, | |
| { | |
| "entropy": 1.32702829092741, | |
| "epoch": 0.5261018952968559, | |
| "grad_norm": 0.10749702155590057, | |
| "learning_rate": 4.740653169794592e-05, | |
| "loss": 1.0136, | |
| "mean_token_accuracy": 0.7439944848418236, | |
| "num_tokens": 223925912.0, | |
| "step": 3560 | |
| }, | |
| { | |
| "entropy": 1.3148509785532951, | |
| "epoch": 0.5275797096094875, | |
| "grad_norm": 0.12064609676599503, | |
| "learning_rate": 4.7258755726318906e-05, | |
| "loss": 0.9995, | |
| "mean_token_accuracy": 0.7481425099074841, | |
| "num_tokens": 224571805.0, | |
| "step": 3570 | |
| }, | |
| { | |
| "entropy": 1.335060080140829, | |
| "epoch": 0.5290575239221191, | |
| "grad_norm": 0.13102136552333832, | |
| "learning_rate": 4.7110979754691895e-05, | |
| "loss": 0.9936, | |
| "mean_token_accuracy": 0.7448404133319855, | |
| "num_tokens": 225205299.0, | |
| "step": 3580 | |
| }, | |
| { | |
| "entropy": 1.3563662871718407, | |
| "epoch": 0.5305353382347509, | |
| "grad_norm": 0.12292468547821045, | |
| "learning_rate": 4.6963203783064876e-05, | |
| "loss": 1.0358, | |
| "mean_token_accuracy": 0.737770852446556, | |
| "num_tokens": 225832363.0, | |
| "step": 3590 | |
| }, | |
| { | |
| "entropy": 1.3766466073691845, | |
| "epoch": 0.5320131525473825, | |
| "grad_norm": 0.12831763923168182, | |
| "learning_rate": 4.6815427811437864e-05, | |
| "loss": 1.0347, | |
| "mean_token_accuracy": 0.7354536131024361, | |
| "num_tokens": 226465263.0, | |
| "step": 3600 | |
| }, | |
| { | |
| "entropy": 1.3112281516194344, | |
| "epoch": 0.5334909668600141, | |
| "grad_norm": 0.11866694688796997, | |
| "learning_rate": 4.666765183981085e-05, | |
| "loss": 0.9589, | |
| "mean_token_accuracy": 0.7530772976577282, | |
| "num_tokens": 227102673.0, | |
| "step": 3610 | |
| }, | |
| { | |
| "entropy": 1.3011863119900227, | |
| "epoch": 0.5349687811726457, | |
| "grad_norm": 0.1284829080104828, | |
| "learning_rate": 4.651987586818384e-05, | |
| "loss": 1.0065, | |
| "mean_token_accuracy": 0.7439219027757644, | |
| "num_tokens": 227738382.0, | |
| "step": 3620 | |
| }, | |
| { | |
| "entropy": 1.3390570774674415, | |
| "epoch": 0.5364465954852773, | |
| "grad_norm": 0.1170494556427002, | |
| "learning_rate": 4.637209989655682e-05, | |
| "loss": 0.9984, | |
| "mean_token_accuracy": 0.7461878538131714, | |
| "num_tokens": 228356674.0, | |
| "step": 3630 | |
| }, | |
| { | |
| "entropy": 1.3583289809525012, | |
| "epoch": 0.5379244097979089, | |
| "grad_norm": 0.14735782146453857, | |
| "learning_rate": 4.622432392492981e-05, | |
| "loss": 1.0268, | |
| "mean_token_accuracy": 0.7402130104601383, | |
| "num_tokens": 228974148.0, | |
| "step": 3640 | |
| }, | |
| { | |
| "entropy": 1.3334741026163102, | |
| "epoch": 0.5394022241105405, | |
| "grad_norm": 0.12460874766111374, | |
| "learning_rate": 4.60765479533028e-05, | |
| "loss": 1.0129, | |
| "mean_token_accuracy": 0.7437016226351261, | |
| "num_tokens": 229613351.0, | |
| "step": 3650 | |
| }, | |
| { | |
| "entropy": 1.3233090750873089, | |
| "epoch": 0.5408800384231721, | |
| "grad_norm": 0.10226025432348251, | |
| "learning_rate": 4.592877198167578e-05, | |
| "loss": 1.0117, | |
| "mean_token_accuracy": 0.7429285898804665, | |
| "num_tokens": 230255532.0, | |
| "step": 3660 | |
| }, | |
| { | |
| "entropy": 1.3184999868273735, | |
| "epoch": 0.5423578527358037, | |
| "grad_norm": 0.13753961026668549, | |
| "learning_rate": 4.578099601004877e-05, | |
| "loss": 1.0017, | |
| "mean_token_accuracy": 0.7435905501246453, | |
| "num_tokens": 230863024.0, | |
| "step": 3670 | |
| }, | |
| { | |
| "entropy": 1.3815899774432183, | |
| "epoch": 0.5438356670484353, | |
| "grad_norm": 0.12502948939800262, | |
| "learning_rate": 4.563322003842175e-05, | |
| "loss": 1.0751, | |
| "mean_token_accuracy": 0.7307036370038986, | |
| "num_tokens": 231506246.0, | |
| "step": 3680 | |
| }, | |
| { | |
| "entropy": 1.3200243420898914, | |
| "epoch": 0.5453134813610669, | |
| "grad_norm": 0.11456853896379471, | |
| "learning_rate": 4.548544406679474e-05, | |
| "loss": 1.0021, | |
| "mean_token_accuracy": 0.7433114424347878, | |
| "num_tokens": 232141778.0, | |
| "step": 3690 | |
| }, | |
| { | |
| "entropy": 1.297838745266199, | |
| "epoch": 0.5467912956736986, | |
| "grad_norm": 0.13101966679096222, | |
| "learning_rate": 4.5337668095167727e-05, | |
| "loss": 0.9982, | |
| "mean_token_accuracy": 0.7433498427271843, | |
| "num_tokens": 232801815.0, | |
| "step": 3700 | |
| }, | |
| { | |
| "entropy": 1.318327071517706, | |
| "epoch": 0.5482691099863303, | |
| "grad_norm": 0.14819857478141785, | |
| "learning_rate": 4.5189892123540715e-05, | |
| "loss": 1.0394, | |
| "mean_token_accuracy": 0.7365592263638974, | |
| "num_tokens": 233411245.0, | |
| "step": 3710 | |
| }, | |
| { | |
| "entropy": 1.3289685495197774, | |
| "epoch": 0.5497469242989619, | |
| "grad_norm": 0.1170542910695076, | |
| "learning_rate": 4.5042116151913696e-05, | |
| "loss": 0.9804, | |
| "mean_token_accuracy": 0.7477963097393513, | |
| "num_tokens": 234055712.0, | |
| "step": 3720 | |
| }, | |
| { | |
| "entropy": 1.3513706095516682, | |
| "epoch": 0.5512247386115935, | |
| "grad_norm": 0.1407993584871292, | |
| "learning_rate": 4.4894340180286684e-05, | |
| "loss": 1.0105, | |
| "mean_token_accuracy": 0.7453994438052177, | |
| "num_tokens": 234656067.0, | |
| "step": 3730 | |
| }, | |
| { | |
| "entropy": 1.3192792139947414, | |
| "epoch": 0.5527025529242251, | |
| "grad_norm": 0.11902996152639389, | |
| "learning_rate": 4.474656420865967e-05, | |
| "loss": 1.0293, | |
| "mean_token_accuracy": 0.7379258319735527, | |
| "num_tokens": 235276644.0, | |
| "step": 3740 | |
| }, | |
| { | |
| "entropy": 1.3451191641390323, | |
| "epoch": 0.5541803672368567, | |
| "grad_norm": 0.1200229600071907, | |
| "learning_rate": 4.459878823703266e-05, | |
| "loss": 1.0129, | |
| "mean_token_accuracy": 0.7419077165424823, | |
| "num_tokens": 235915640.0, | |
| "step": 3750 | |
| }, | |
| { | |
| "entropy": 1.341741495579481, | |
| "epoch": 0.5556581815494883, | |
| "grad_norm": 0.10994552075862885, | |
| "learning_rate": 4.445101226540564e-05, | |
| "loss": 1.051, | |
| "mean_token_accuracy": 0.7377764590084552, | |
| "num_tokens": 236568402.0, | |
| "step": 3760 | |
| }, | |
| { | |
| "entropy": 1.313062135130167, | |
| "epoch": 0.5571359958621199, | |
| "grad_norm": 0.10962233692407608, | |
| "learning_rate": 4.430323629377863e-05, | |
| "loss": 1.0147, | |
| "mean_token_accuracy": 0.7424600318074226, | |
| "num_tokens": 237197416.0, | |
| "step": 3770 | |
| }, | |
| { | |
| "entropy": 1.3273049861192703, | |
| "epoch": 0.5586138101747515, | |
| "grad_norm": 0.12473728507757187, | |
| "learning_rate": 4.415546032215162e-05, | |
| "loss": 1.0511, | |
| "mean_token_accuracy": 0.7336776547133923, | |
| "num_tokens": 237829704.0, | |
| "step": 3780 | |
| }, | |
| { | |
| "entropy": 1.3306392684578896, | |
| "epoch": 0.5600916244873831, | |
| "grad_norm": 0.11905784904956818, | |
| "learning_rate": 4.400768435052461e-05, | |
| "loss": 1.043, | |
| "mean_token_accuracy": 0.7365007124841213, | |
| "num_tokens": 238457474.0, | |
| "step": 3790 | |
| }, | |
| { | |
| "entropy": 1.3824568182229995, | |
| "epoch": 0.5615694388000148, | |
| "grad_norm": 0.12441007047891617, | |
| "learning_rate": 4.385990837889759e-05, | |
| "loss": 1.0776, | |
| "mean_token_accuracy": 0.7283789575099945, | |
| "num_tokens": 239098164.0, | |
| "step": 3800 | |
| }, | |
| { | |
| "entropy": 1.3517411895096303, | |
| "epoch": 0.5630472531126464, | |
| "grad_norm": 0.10452092438936234, | |
| "learning_rate": 4.371213240727058e-05, | |
| "loss": 1.0472, | |
| "mean_token_accuracy": 0.7371180124580861, | |
| "num_tokens": 239752501.0, | |
| "step": 3810 | |
| }, | |
| { | |
| "entropy": 1.3083030074834823, | |
| "epoch": 0.564525067425278, | |
| "grad_norm": 0.14152932167053223, | |
| "learning_rate": 4.3564356435643565e-05, | |
| "loss": 0.995, | |
| "mean_token_accuracy": 0.7436737760901451, | |
| "num_tokens": 240384011.0, | |
| "step": 3820 | |
| }, | |
| { | |
| "entropy": 1.3285958595573901, | |
| "epoch": 0.5660028817379096, | |
| "grad_norm": 0.11274420469999313, | |
| "learning_rate": 4.341658046401655e-05, | |
| "loss": 1.0192, | |
| "mean_token_accuracy": 0.738641119748354, | |
| "num_tokens": 240999874.0, | |
| "step": 3830 | |
| }, | |
| { | |
| "entropy": 1.2800329469144345, | |
| "epoch": 0.5674806960505413, | |
| "grad_norm": 0.11731458455324173, | |
| "learning_rate": 4.326880449238954e-05, | |
| "loss": 0.9824, | |
| "mean_token_accuracy": 0.7487463176250457, | |
| "num_tokens": 241640956.0, | |
| "step": 3840 | |
| }, | |
| { | |
| "entropy": 1.3452030673623085, | |
| "epoch": 0.5689585103631729, | |
| "grad_norm": 0.1167834997177124, | |
| "learning_rate": 4.312102852076252e-05, | |
| "loss": 1.0232, | |
| "mean_token_accuracy": 0.7404698729515076, | |
| "num_tokens": 242279933.0, | |
| "step": 3850 | |
| }, | |
| { | |
| "entropy": 1.3529712542891503, | |
| "epoch": 0.5704363246758045, | |
| "grad_norm": 0.1278751939535141, | |
| "learning_rate": 4.297325254913551e-05, | |
| "loss": 0.9995, | |
| "mean_token_accuracy": 0.7444183379411697, | |
| "num_tokens": 242922498.0, | |
| "step": 3860 | |
| }, | |
| { | |
| "entropy": 1.3116788499057292, | |
| "epoch": 0.5719141389884361, | |
| "grad_norm": 0.10567767918109894, | |
| "learning_rate": 4.28254765775085e-05, | |
| "loss": 1.0132, | |
| "mean_token_accuracy": 0.7404111728072167, | |
| "num_tokens": 243533542.0, | |
| "step": 3870 | |
| }, | |
| { | |
| "entropy": 1.3166671507060528, | |
| "epoch": 0.5733919533010677, | |
| "grad_norm": 0.1134534403681755, | |
| "learning_rate": 4.267770060588149e-05, | |
| "loss": 0.9807, | |
| "mean_token_accuracy": 0.7477494470775128, | |
| "num_tokens": 244160728.0, | |
| "step": 3880 | |
| }, | |
| { | |
| "entropy": 1.2959009833633899, | |
| "epoch": 0.5748697676136993, | |
| "grad_norm": 0.13303719460964203, | |
| "learning_rate": 4.252992463425447e-05, | |
| "loss": 0.9538, | |
| "mean_token_accuracy": 0.7553890861570836, | |
| "num_tokens": 244784452.0, | |
| "step": 3890 | |
| }, | |
| { | |
| "entropy": 1.3435784846544265, | |
| "epoch": 0.576347581926331, | |
| "grad_norm": 0.11970516294240952, | |
| "learning_rate": 4.238214866262746e-05, | |
| "loss": 1.044, | |
| "mean_token_accuracy": 0.7328359387814999, | |
| "num_tokens": 245415471.0, | |
| "step": 3900 | |
| }, | |
| { | |
| "entropy": 1.3250922329723835, | |
| "epoch": 0.5778253962389626, | |
| "grad_norm": 0.14801903069019318, | |
| "learning_rate": 4.2234372691000446e-05, | |
| "loss": 1.0151, | |
| "mean_token_accuracy": 0.7450727418065071, | |
| "num_tokens": 246051773.0, | |
| "step": 3910 | |
| }, | |
| { | |
| "entropy": 1.3530432641506196, | |
| "epoch": 0.5793032105515942, | |
| "grad_norm": 0.13875193893909454, | |
| "learning_rate": 4.2086596719373434e-05, | |
| "loss": 1.0107, | |
| "mean_token_accuracy": 0.7407213382422924, | |
| "num_tokens": 246673030.0, | |
| "step": 3920 | |
| }, | |
| { | |
| "entropy": 1.3028004743158816, | |
| "epoch": 0.5807810248642258, | |
| "grad_norm": 0.12098074704408646, | |
| "learning_rate": 4.1938820747746415e-05, | |
| "loss": 0.9957, | |
| "mean_token_accuracy": 0.7456411838531494, | |
| "num_tokens": 247301114.0, | |
| "step": 3930 | |
| }, | |
| { | |
| "entropy": 1.3270177111029624, | |
| "epoch": 0.5822588391768574, | |
| "grad_norm": 0.12103700637817383, | |
| "learning_rate": 4.1791044776119404e-05, | |
| "loss": 1.0168, | |
| "mean_token_accuracy": 0.7393665313720703, | |
| "num_tokens": 247925288.0, | |
| "step": 3940 | |
| }, | |
| { | |
| "entropy": 1.3316473290324211, | |
| "epoch": 0.583736653489489, | |
| "grad_norm": 0.11334571242332458, | |
| "learning_rate": 4.164326880449239e-05, | |
| "loss": 1.0246, | |
| "mean_token_accuracy": 0.7398273125290871, | |
| "num_tokens": 248563570.0, | |
| "step": 3950 | |
| }, | |
| { | |
| "entropy": 1.3447592370212078, | |
| "epoch": 0.5852144678021206, | |
| "grad_norm": 0.14425861835479736, | |
| "learning_rate": 4.149549283286538e-05, | |
| "loss": 1.0188, | |
| "mean_token_accuracy": 0.7414998419582843, | |
| "num_tokens": 249187118.0, | |
| "step": 3960 | |
| }, | |
| { | |
| "entropy": 1.3157505065202713, | |
| "epoch": 0.5866922821147523, | |
| "grad_norm": 0.1253083348274231, | |
| "learning_rate": 4.134771686123837e-05, | |
| "loss": 1.006, | |
| "mean_token_accuracy": 0.7437942959368229, | |
| "num_tokens": 249818795.0, | |
| "step": 3970 | |
| }, | |
| { | |
| "entropy": 1.3160997398197651, | |
| "epoch": 0.5881700964273839, | |
| "grad_norm": 0.14071162045001984, | |
| "learning_rate": 4.119994088961135e-05, | |
| "loss": 0.9944, | |
| "mean_token_accuracy": 0.7446533113718032, | |
| "num_tokens": 250442743.0, | |
| "step": 3980 | |
| }, | |
| { | |
| "entropy": 1.3181477546691895, | |
| "epoch": 0.5896479107400155, | |
| "grad_norm": 0.11922013759613037, | |
| "learning_rate": 4.105216491798434e-05, | |
| "loss": 1.0151, | |
| "mean_token_accuracy": 0.7434865787625313, | |
| "num_tokens": 251070828.0, | |
| "step": 3990 | |
| }, | |
| { | |
| "entropy": 1.3841412678360938, | |
| "epoch": 0.5911257250526472, | |
| "grad_norm": 0.12561756372451782, | |
| "learning_rate": 4.0904388946357326e-05, | |
| "loss": 1.0471, | |
| "mean_token_accuracy": 0.7363124743103981, | |
| "num_tokens": 251720365.0, | |
| "step": 4000 | |
| }, | |
| { | |
| "entropy": 1.3293801605701447, | |
| "epoch": 0.5926035393652788, | |
| "grad_norm": 0.12026660889387131, | |
| "learning_rate": 4.0756612974730315e-05, | |
| "loss": 0.9991, | |
| "mean_token_accuracy": 0.7464115582406521, | |
| "num_tokens": 252352493.0, | |
| "step": 4010 | |
| }, | |
| { | |
| "entropy": 1.3253483653068543, | |
| "epoch": 0.5940813536779104, | |
| "grad_norm": 0.1290450245141983, | |
| "learning_rate": 4.0608837003103296e-05, | |
| "loss": 0.9906, | |
| "mean_token_accuracy": 0.7443468227982522, | |
| "num_tokens": 252987335.0, | |
| "step": 4020 | |
| }, | |
| { | |
| "entropy": 1.274603036046028, | |
| "epoch": 0.595559167990542, | |
| "grad_norm": 0.1409289687871933, | |
| "learning_rate": 4.0461061031476284e-05, | |
| "loss": 0.9387, | |
| "mean_token_accuracy": 0.7586248151957988, | |
| "num_tokens": 253608440.0, | |
| "step": 4030 | |
| }, | |
| { | |
| "entropy": 1.346203289180994, | |
| "epoch": 0.5970369823031736, | |
| "grad_norm": 0.1403258740901947, | |
| "learning_rate": 4.031328505984927e-05, | |
| "loss": 1.0569, | |
| "mean_token_accuracy": 0.7334101386368275, | |
| "num_tokens": 254234368.0, | |
| "step": 4040 | |
| }, | |
| { | |
| "entropy": 1.3868733286857604, | |
| "epoch": 0.5985147966158052, | |
| "grad_norm": 0.12271698564291, | |
| "learning_rate": 4.016550908822226e-05, | |
| "loss": 1.0244, | |
| "mean_token_accuracy": 0.7363365158438683, | |
| "num_tokens": 254853431.0, | |
| "step": 4050 | |
| }, | |
| { | |
| "entropy": 1.363221886754036, | |
| "epoch": 0.5999926109284368, | |
| "grad_norm": 0.12163551896810532, | |
| "learning_rate": 4.001773311659525e-05, | |
| "loss": 1.074, | |
| "mean_token_accuracy": 0.7314470805227756, | |
| "num_tokens": 255453933.0, | |
| "step": 4060 | |
| }, | |
| { | |
| "entropy": 1.3116975866258145, | |
| "epoch": 0.6014704252410684, | |
| "grad_norm": 0.13113334774971008, | |
| "learning_rate": 3.986995714496823e-05, | |
| "loss": 0.9968, | |
| "mean_token_accuracy": 0.745627174526453, | |
| "num_tokens": 256080906.0, | |
| "step": 4070 | |
| }, | |
| { | |
| "entropy": 1.351020661741495, | |
| "epoch": 0.6029482395537, | |
| "grad_norm": 0.11195094883441925, | |
| "learning_rate": 3.972218117334122e-05, | |
| "loss": 1.0541, | |
| "mean_token_accuracy": 0.7320830643177032, | |
| "num_tokens": 256708275.0, | |
| "step": 4080 | |
| }, | |
| { | |
| "entropy": 1.306433204561472, | |
| "epoch": 0.6044260538663317, | |
| "grad_norm": 0.1212775856256485, | |
| "learning_rate": 3.957440520171421e-05, | |
| "loss": 0.9957, | |
| "mean_token_accuracy": 0.745367382466793, | |
| "num_tokens": 257354229.0, | |
| "step": 4090 | |
| }, | |
| { | |
| "entropy": 1.2912617072463035, | |
| "epoch": 0.6059038681789634, | |
| "grad_norm": 0.12214183807373047, | |
| "learning_rate": 3.9426629230087195e-05, | |
| "loss": 0.9587, | |
| "mean_token_accuracy": 0.7531531445682049, | |
| "num_tokens": 257972018.0, | |
| "step": 4100 | |
| }, | |
| { | |
| "entropy": 1.316209364682436, | |
| "epoch": 0.607381682491595, | |
| "grad_norm": 0.11024002730846405, | |
| "learning_rate": 3.927885325846018e-05, | |
| "loss": 1.0043, | |
| "mean_token_accuracy": 0.7449470959603787, | |
| "num_tokens": 258607359.0, | |
| "step": 4110 | |
| }, | |
| { | |
| "entropy": 1.2945946514606477, | |
| "epoch": 0.6088594968042266, | |
| "grad_norm": 0.1317119598388672, | |
| "learning_rate": 3.9131077286833165e-05, | |
| "loss": 0.9916, | |
| "mean_token_accuracy": 0.7498336635529995, | |
| "num_tokens": 259236898.0, | |
| "step": 4120 | |
| }, | |
| { | |
| "entropy": 1.3261870265007019, | |
| "epoch": 0.6103373111168582, | |
| "grad_norm": 0.11150126159191132, | |
| "learning_rate": 3.898330131520615e-05, | |
| "loss": 0.9936, | |
| "mean_token_accuracy": 0.7454674303531647, | |
| "num_tokens": 259865457.0, | |
| "step": 4130 | |
| }, | |
| { | |
| "entropy": 1.3262874715030193, | |
| "epoch": 0.6118151254294898, | |
| "grad_norm": 0.12116798758506775, | |
| "learning_rate": 3.8835525343579135e-05, | |
| "loss": 0.9764, | |
| "mean_token_accuracy": 0.748883631825447, | |
| "num_tokens": 260478748.0, | |
| "step": 4140 | |
| }, | |
| { | |
| "entropy": 1.3318323902785778, | |
| "epoch": 0.6132929397421214, | |
| "grad_norm": 0.11874970048666, | |
| "learning_rate": 3.868774937195212e-05, | |
| "loss": 0.9869, | |
| "mean_token_accuracy": 0.7489691562950611, | |
| "num_tokens": 261109091.0, | |
| "step": 4150 | |
| }, | |
| { | |
| "entropy": 1.294984768331051, | |
| "epoch": 0.614770754054753, | |
| "grad_norm": 0.13271567225456238, | |
| "learning_rate": 3.853997340032511e-05, | |
| "loss": 0.9784, | |
| "mean_token_accuracy": 0.7473281040787697, | |
| "num_tokens": 261729703.0, | |
| "step": 4160 | |
| }, | |
| { | |
| "entropy": 1.3404998533427714, | |
| "epoch": 0.6162485683673846, | |
| "grad_norm": 0.11501745134592056, | |
| "learning_rate": 3.839219742869809e-05, | |
| "loss": 1.032, | |
| "mean_token_accuracy": 0.7398579135537148, | |
| "num_tokens": 262345918.0, | |
| "step": 4170 | |
| }, | |
| { | |
| "entropy": 1.2984641678631306, | |
| "epoch": 0.6177263826800162, | |
| "grad_norm": 0.10657823830842972, | |
| "learning_rate": 3.824442145707108e-05, | |
| "loss": 0.9972, | |
| "mean_token_accuracy": 0.7439127787947655, | |
| "num_tokens": 262993350.0, | |
| "step": 4180 | |
| }, | |
| { | |
| "entropy": 1.3517408087849616, | |
| "epoch": 0.6192041969926478, | |
| "grad_norm": 0.13800758123397827, | |
| "learning_rate": 3.809664548544407e-05, | |
| "loss": 1.033, | |
| "mean_token_accuracy": 0.736748181283474, | |
| "num_tokens": 263615371.0, | |
| "step": 4190 | |
| }, | |
| { | |
| "entropy": 1.3334587171673775, | |
| "epoch": 0.6206820113052794, | |
| "grad_norm": 0.12172678112983704, | |
| "learning_rate": 3.794886951381705e-05, | |
| "loss": 1.0111, | |
| "mean_token_accuracy": 0.7427098996937275, | |
| "num_tokens": 264234097.0, | |
| "step": 4200 | |
| }, | |
| { | |
| "entropy": 1.362929881364107, | |
| "epoch": 0.622159825617911, | |
| "grad_norm": 0.13081179559230804, | |
| "learning_rate": 3.780109354219004e-05, | |
| "loss": 1.0356, | |
| "mean_token_accuracy": 0.7373303383588791, | |
| "num_tokens": 264863344.0, | |
| "step": 4210 | |
| }, | |
| { | |
| "entropy": 1.315098512172699, | |
| "epoch": 0.6236376399305428, | |
| "grad_norm": 0.11723612248897552, | |
| "learning_rate": 3.765331757056303e-05, | |
| "loss": 0.9869, | |
| "mean_token_accuracy": 0.7490851148962975, | |
| "num_tokens": 265499451.0, | |
| "step": 4220 | |
| }, | |
| { | |
| "entropy": 1.3551609128713609, | |
| "epoch": 0.6251154542431744, | |
| "grad_norm": 0.1283220797777176, | |
| "learning_rate": 3.7505541598936015e-05, | |
| "loss": 1.0368, | |
| "mean_token_accuracy": 0.7416560888290405, | |
| "num_tokens": 266130209.0, | |
| "step": 4230 | |
| }, | |
| { | |
| "entropy": 1.2948666542768479, | |
| "epoch": 0.626593268555806, | |
| "grad_norm": 0.13036693632602692, | |
| "learning_rate": 3.7357765627309e-05, | |
| "loss": 0.9835, | |
| "mean_token_accuracy": 0.7474061094224453, | |
| "num_tokens": 266763275.0, | |
| "step": 4240 | |
| }, | |
| { | |
| "entropy": 1.328162982314825, | |
| "epoch": 0.6280710828684376, | |
| "grad_norm": 0.12736549973487854, | |
| "learning_rate": 3.7209989655681985e-05, | |
| "loss": 0.9843, | |
| "mean_token_accuracy": 0.746946319192648, | |
| "num_tokens": 267392042.0, | |
| "step": 4250 | |
| }, | |
| { | |
| "entropy": 1.327622577548027, | |
| "epoch": 0.6295488971810692, | |
| "grad_norm": 0.13731716573238373, | |
| "learning_rate": 3.706221368405497e-05, | |
| "loss": 1.021, | |
| "mean_token_accuracy": 0.7412622094154357, | |
| "num_tokens": 268035196.0, | |
| "step": 4260 | |
| }, | |
| { | |
| "entropy": 1.3403167374432088, | |
| "epoch": 0.6310267114937008, | |
| "grad_norm": 0.1264178305864334, | |
| "learning_rate": 3.691443771242796e-05, | |
| "loss": 1.0396, | |
| "mean_token_accuracy": 0.7385567761957645, | |
| "num_tokens": 268641369.0, | |
| "step": 4270 | |
| }, | |
| { | |
| "entropy": 1.3581008620560169, | |
| "epoch": 0.6325045258063324, | |
| "grad_norm": 0.11115839332342148, | |
| "learning_rate": 3.676666174080094e-05, | |
| "loss": 1.0449, | |
| "mean_token_accuracy": 0.7357151411473751, | |
| "num_tokens": 269273142.0, | |
| "step": 4280 | |
| }, | |
| { | |
| "entropy": 1.2959826327860355, | |
| "epoch": 0.633982340118964, | |
| "grad_norm": 0.11848369240760803, | |
| "learning_rate": 3.661888576917393e-05, | |
| "loss": 0.9854, | |
| "mean_token_accuracy": 0.7469957664608955, | |
| "num_tokens": 269905326.0, | |
| "step": 4290 | |
| }, | |
| { | |
| "entropy": 1.3228461749851703, | |
| "epoch": 0.6354601544315956, | |
| "grad_norm": 0.12460760027170181, | |
| "learning_rate": 3.647110979754692e-05, | |
| "loss": 1.0073, | |
| "mean_token_accuracy": 0.7444317832589149, | |
| "num_tokens": 270545604.0, | |
| "step": 4300 | |
| }, | |
| { | |
| "entropy": 1.3390370070934297, | |
| "epoch": 0.6369379687442273, | |
| "grad_norm": 0.12076804786920547, | |
| "learning_rate": 3.632333382591991e-05, | |
| "loss": 1.0032, | |
| "mean_token_accuracy": 0.7412038818001747, | |
| "num_tokens": 271168533.0, | |
| "step": 4310 | |
| }, | |
| { | |
| "entropy": 1.3059133537113667, | |
| "epoch": 0.6384157830568589, | |
| "grad_norm": 0.11399949342012405, | |
| "learning_rate": 3.6175557854292896e-05, | |
| "loss": 0.9894, | |
| "mean_token_accuracy": 0.7461211532354355, | |
| "num_tokens": 271784029.0, | |
| "step": 4320 | |
| }, | |
| { | |
| "entropy": 1.3515030421316623, | |
| "epoch": 0.6398935973694905, | |
| "grad_norm": 0.15675301849842072, | |
| "learning_rate": 3.602778188266588e-05, | |
| "loss": 1.0325, | |
| "mean_token_accuracy": 0.7383571431040764, | |
| "num_tokens": 272407600.0, | |
| "step": 4330 | |
| }, | |
| { | |
| "entropy": 1.2898739270865918, | |
| "epoch": 0.6413714116821222, | |
| "grad_norm": 0.11768002063035965, | |
| "learning_rate": 3.5880005911038866e-05, | |
| "loss": 0.9787, | |
| "mean_token_accuracy": 0.7501869194209576, | |
| "num_tokens": 273036432.0, | |
| "step": 4340 | |
| }, | |
| { | |
| "entropy": 1.3185631178319455, | |
| "epoch": 0.6428492259947538, | |
| "grad_norm": 0.13108837604522705, | |
| "learning_rate": 3.5732229939411854e-05, | |
| "loss": 1.0022, | |
| "mean_token_accuracy": 0.7421830080449581, | |
| "num_tokens": 273649995.0, | |
| "step": 4350 | |
| }, | |
| { | |
| "entropy": 1.3045101426541805, | |
| "epoch": 0.6443270403073854, | |
| "grad_norm": 0.1088869646191597, | |
| "learning_rate": 3.558445396778484e-05, | |
| "loss": 0.9989, | |
| "mean_token_accuracy": 0.7463624097406865, | |
| "num_tokens": 274299257.0, | |
| "step": 4360 | |
| }, | |
| { | |
| "entropy": 1.3702871024608612, | |
| "epoch": 0.645804854620017, | |
| "grad_norm": 0.12465790659189224, | |
| "learning_rate": 3.5436677996157824e-05, | |
| "loss": 1.016, | |
| "mean_token_accuracy": 0.7393311135470867, | |
| "num_tokens": 274950163.0, | |
| "step": 4370 | |
| }, | |
| { | |
| "entropy": 1.296142727136612, | |
| "epoch": 0.6472826689326486, | |
| "grad_norm": 0.12053404748439789, | |
| "learning_rate": 3.528890202453081e-05, | |
| "loss": 0.97, | |
| "mean_token_accuracy": 0.749032299220562, | |
| "num_tokens": 275586098.0, | |
| "step": 4380 | |
| }, | |
| { | |
| "entropy": 1.3169789105653762, | |
| "epoch": 0.6487604832452802, | |
| "grad_norm": 0.1511235386133194, | |
| "learning_rate": 3.51411260529038e-05, | |
| "loss": 1.0044, | |
| "mean_token_accuracy": 0.7442675150930882, | |
| "num_tokens": 276221733.0, | |
| "step": 4390 | |
| }, | |
| { | |
| "entropy": 1.3407318077981472, | |
| "epoch": 0.6502382975579118, | |
| "grad_norm": 0.11825191974639893, | |
| "learning_rate": 3.499335008127679e-05, | |
| "loss": 1.0401, | |
| "mean_token_accuracy": 0.7368831485509872, | |
| "num_tokens": 276851809.0, | |
| "step": 4400 | |
| }, | |
| { | |
| "entropy": 1.3613334082067012, | |
| "epoch": 0.6517161118705435, | |
| "grad_norm": 0.12834398448467255, | |
| "learning_rate": 3.484557410964977e-05, | |
| "loss": 1.0636, | |
| "mean_token_accuracy": 0.7363037653267384, | |
| "num_tokens": 277486603.0, | |
| "step": 4410 | |
| }, | |
| { | |
| "entropy": 1.3078240409493447, | |
| "epoch": 0.6531939261831751, | |
| "grad_norm": 0.1147545874118805, | |
| "learning_rate": 3.469779813802276e-05, | |
| "loss": 1.0033, | |
| "mean_token_accuracy": 0.745844904333353, | |
| "num_tokens": 278106864.0, | |
| "step": 4420 | |
| }, | |
| { | |
| "entropy": 1.3462509505450726, | |
| "epoch": 0.6546717404958067, | |
| "grad_norm": 0.11914671957492828, | |
| "learning_rate": 3.4550022166395746e-05, | |
| "loss": 1.0053, | |
| "mean_token_accuracy": 0.7413943104445935, | |
| "num_tokens": 278739591.0, | |
| "step": 4430 | |
| }, | |
| { | |
| "entropy": 1.3763988889753818, | |
| "epoch": 0.6561495548084383, | |
| "grad_norm": 0.13147027790546417, | |
| "learning_rate": 3.4402246194768734e-05, | |
| "loss": 1.0524, | |
| "mean_token_accuracy": 0.7353928349912167, | |
| "num_tokens": 279376457.0, | |
| "step": 4440 | |
| }, | |
| { | |
| "entropy": 1.3218246966600418, | |
| "epoch": 0.6576273691210699, | |
| "grad_norm": 0.12028536945581436, | |
| "learning_rate": 3.425447022314172e-05, | |
| "loss": 1.0124, | |
| "mean_token_accuracy": 0.7395353779196739, | |
| "num_tokens": 279998105.0, | |
| "step": 4450 | |
| }, | |
| { | |
| "entropy": 1.3321923702955245, | |
| "epoch": 0.6591051834337015, | |
| "grad_norm": 0.13767987489700317, | |
| "learning_rate": 3.4106694251514704e-05, | |
| "loss": 1.0312, | |
| "mean_token_accuracy": 0.7353999748826027, | |
| "num_tokens": 280605980.0, | |
| "step": 4460 | |
| }, | |
| { | |
| "entropy": 1.338740762323141, | |
| "epoch": 0.6605829977463332, | |
| "grad_norm": 0.10273656249046326, | |
| "learning_rate": 3.395891827988769e-05, | |
| "loss": 1.0141, | |
| "mean_token_accuracy": 0.74061214402318, | |
| "num_tokens": 281240224.0, | |
| "step": 4470 | |
| }, | |
| { | |
| "entropy": 1.32241290807724, | |
| "epoch": 0.6620608120589648, | |
| "grad_norm": 0.142890065908432, | |
| "learning_rate": 3.381114230826068e-05, | |
| "loss": 0.9966, | |
| "mean_token_accuracy": 0.7456200569868088, | |
| "num_tokens": 281855831.0, | |
| "step": 4480 | |
| }, | |
| { | |
| "entropy": 1.3304771170020104, | |
| "epoch": 0.6635386263715964, | |
| "grad_norm": 0.1134033054113388, | |
| "learning_rate": 3.366336633663367e-05, | |
| "loss": 1.0015, | |
| "mean_token_accuracy": 0.7453427657485008, | |
| "num_tokens": 282485498.0, | |
| "step": 4490 | |
| }, | |
| { | |
| "entropy": 1.32518659979105, | |
| "epoch": 0.665016440684228, | |
| "grad_norm": 0.13597334921360016, | |
| "learning_rate": 3.351559036500665e-05, | |
| "loss": 1.0019, | |
| "mean_token_accuracy": 0.7464072823524475, | |
| "num_tokens": 283100980.0, | |
| "step": 4500 | |
| }, | |
| { | |
| "entropy": 1.3376376338303089, | |
| "epoch": 0.6664942549968597, | |
| "grad_norm": 0.12421192973852158, | |
| "learning_rate": 3.336781439337964e-05, | |
| "loss": 1.0566, | |
| "mean_token_accuracy": 0.735713567584753, | |
| "num_tokens": 283715839.0, | |
| "step": 4510 | |
| }, | |
| { | |
| "entropy": 1.3360460251569748, | |
| "epoch": 0.6679720693094913, | |
| "grad_norm": 0.1386958807706833, | |
| "learning_rate": 3.322003842175263e-05, | |
| "loss": 1.0178, | |
| "mean_token_accuracy": 0.7404295057058334, | |
| "num_tokens": 284345527.0, | |
| "step": 4520 | |
| }, | |
| { | |
| "entropy": 1.2704548306763173, | |
| "epoch": 0.6694498836221229, | |
| "grad_norm": 0.10363002866506577, | |
| "learning_rate": 3.3072262450125615e-05, | |
| "loss": 0.9487, | |
| "mean_token_accuracy": 0.7572251930832863, | |
| "num_tokens": 284968115.0, | |
| "step": 4530 | |
| }, | |
| { | |
| "entropy": 1.3422211334109306, | |
| "epoch": 0.6709276979347545, | |
| "grad_norm": 0.14423802495002747, | |
| "learning_rate": 3.2924486478498597e-05, | |
| "loss": 1.0459, | |
| "mean_token_accuracy": 0.7374594822525978, | |
| "num_tokens": 285590307.0, | |
| "step": 4540 | |
| }, | |
| { | |
| "entropy": 1.371665420383215, | |
| "epoch": 0.6724055122473861, | |
| "grad_norm": 0.12783068418502808, | |
| "learning_rate": 3.2776710506871585e-05, | |
| "loss": 1.0502, | |
| "mean_token_accuracy": 0.7360943183302879, | |
| "num_tokens": 286201394.0, | |
| "step": 4550 | |
| }, | |
| { | |
| "entropy": 1.3077406004071235, | |
| "epoch": 0.6738833265600177, | |
| "grad_norm": 0.12808766961097717, | |
| "learning_rate": 3.262893453524457e-05, | |
| "loss": 1.0083, | |
| "mean_token_accuracy": 0.7429508715867996, | |
| "num_tokens": 286835325.0, | |
| "step": 4560 | |
| }, | |
| { | |
| "entropy": 1.364883267134428, | |
| "epoch": 0.6753611408726493, | |
| "grad_norm": 0.1129937618970871, | |
| "learning_rate": 3.248115856361756e-05, | |
| "loss": 1.0738, | |
| "mean_token_accuracy": 0.7299041479825974, | |
| "num_tokens": 287480242.0, | |
| "step": 4570 | |
| }, | |
| { | |
| "entropy": 1.3169206887483598, | |
| "epoch": 0.6768389551852809, | |
| "grad_norm": 0.12290552258491516, | |
| "learning_rate": 3.233338259199055e-05, | |
| "loss": 1.0174, | |
| "mean_token_accuracy": 0.7412481807172299, | |
| "num_tokens": 288132348.0, | |
| "step": 4580 | |
| }, | |
| { | |
| "entropy": 1.3177730686962605, | |
| "epoch": 0.6783167694979126, | |
| "grad_norm": 0.1399271935224533, | |
| "learning_rate": 3.218560662036353e-05, | |
| "loss": 1.0184, | |
| "mean_token_accuracy": 0.740997476130724, | |
| "num_tokens": 288738626.0, | |
| "step": 4590 | |
| }, | |
| { | |
| "entropy": 1.331467841565609, | |
| "epoch": 0.6797945838105443, | |
| "grad_norm": 0.12841732800006866, | |
| "learning_rate": 3.203783064873652e-05, | |
| "loss": 0.9855, | |
| "mean_token_accuracy": 0.7499361656606197, | |
| "num_tokens": 289372236.0, | |
| "step": 4600 | |
| }, | |
| { | |
| "entropy": 1.3721258901059628, | |
| "epoch": 0.6812723981231759, | |
| "grad_norm": 0.12660683691501617, | |
| "learning_rate": 3.189005467710951e-05, | |
| "loss": 1.0779, | |
| "mean_token_accuracy": 0.7270358420908452, | |
| "num_tokens": 289973137.0, | |
| "step": 4610 | |
| }, | |
| { | |
| "entropy": 1.3067141421139241, | |
| "epoch": 0.6827502124358075, | |
| "grad_norm": 0.11172041296958923, | |
| "learning_rate": 3.174227870548249e-05, | |
| "loss": 0.9463, | |
| "mean_token_accuracy": 0.7545724369585514, | |
| "num_tokens": 290621450.0, | |
| "step": 4620 | |
| }, | |
| { | |
| "entropy": 1.3762259379029274, | |
| "epoch": 0.6842280267484391, | |
| "grad_norm": 0.11443869769573212, | |
| "learning_rate": 3.159450273385548e-05, | |
| "loss": 1.0864, | |
| "mean_token_accuracy": 0.7282682999968528, | |
| "num_tokens": 291255096.0, | |
| "step": 4630 | |
| }, | |
| { | |
| "entropy": 1.354401236027479, | |
| "epoch": 0.6857058410610707, | |
| "grad_norm": 0.13201551139354706, | |
| "learning_rate": 3.1446726762228465e-05, | |
| "loss": 1.0235, | |
| "mean_token_accuracy": 0.7380030490458012, | |
| "num_tokens": 291876041.0, | |
| "step": 4640 | |
| }, | |
| { | |
| "entropy": 1.2984419390559196, | |
| "epoch": 0.6871836553737023, | |
| "grad_norm": 0.11332850158214569, | |
| "learning_rate": 3.129895079060145e-05, | |
| "loss": 1.0052, | |
| "mean_token_accuracy": 0.7450248651206494, | |
| "num_tokens": 292514791.0, | |
| "step": 4650 | |
| }, | |
| { | |
| "entropy": 1.332960170507431, | |
| "epoch": 0.6886614696863339, | |
| "grad_norm": 0.13389021158218384, | |
| "learning_rate": 3.1151174818974435e-05, | |
| "loss": 0.9958, | |
| "mean_token_accuracy": 0.7439567111432552, | |
| "num_tokens": 293148361.0, | |
| "step": 4660 | |
| }, | |
| { | |
| "entropy": 1.3010660000145435, | |
| "epoch": 0.6901392839989655, | |
| "grad_norm": 0.12451417744159698, | |
| "learning_rate": 3.100339884734742e-05, | |
| "loss": 0.9849, | |
| "mean_token_accuracy": 0.7485992729663848, | |
| "num_tokens": 293773190.0, | |
| "step": 4670 | |
| }, | |
| { | |
| "entropy": 1.3693323209881783, | |
| "epoch": 0.6916170983115971, | |
| "grad_norm": 0.14361348748207092, | |
| "learning_rate": 3.0855622875720405e-05, | |
| "loss": 1.0616, | |
| "mean_token_accuracy": 0.7298278719186783, | |
| "num_tokens": 294388572.0, | |
| "step": 4680 | |
| }, | |
| { | |
| "entropy": 1.3226823516190052, | |
| "epoch": 0.6930949126242287, | |
| "grad_norm": 0.12352283298969269, | |
| "learning_rate": 3.070784690409339e-05, | |
| "loss": 1.016, | |
| "mean_token_accuracy": 0.739595515280962, | |
| "num_tokens": 295015634.0, | |
| "step": 4690 | |
| }, | |
| { | |
| "entropy": 1.3062335178256035, | |
| "epoch": 0.6945727269368603, | |
| "grad_norm": 0.11143922060728073, | |
| "learning_rate": 3.056007093246638e-05, | |
| "loss": 0.9872, | |
| "mean_token_accuracy": 0.7466958984732628, | |
| "num_tokens": 295654251.0, | |
| "step": 4700 | |
| }, | |
| { | |
| "entropy": 1.2809455893933772, | |
| "epoch": 0.696050541249492, | |
| "grad_norm": 0.10888683795928955, | |
| "learning_rate": 3.0412294960839373e-05, | |
| "loss": 0.9587, | |
| "mean_token_accuracy": 0.7509395398199559, | |
| "num_tokens": 296290910.0, | |
| "step": 4710 | |
| }, | |
| { | |
| "entropy": 1.3530108958482743, | |
| "epoch": 0.6975283555621237, | |
| "grad_norm": 0.1329011619091034, | |
| "learning_rate": 3.0264518989212354e-05, | |
| "loss": 1.0061, | |
| "mean_token_accuracy": 0.7433172650635242, | |
| "num_tokens": 296909724.0, | |
| "step": 4720 | |
| }, | |
| { | |
| "entropy": 1.3416468262672425, | |
| "epoch": 0.6990061698747553, | |
| "grad_norm": 0.11271080374717712, | |
| "learning_rate": 3.0116743017585343e-05, | |
| "loss": 1.0143, | |
| "mean_token_accuracy": 0.7415925867855548, | |
| "num_tokens": 297535996.0, | |
| "step": 4730 | |
| }, | |
| { | |
| "entropy": 1.3463890179991722, | |
| "epoch": 0.7004839841873869, | |
| "grad_norm": 0.14932890236377716, | |
| "learning_rate": 2.996896704595833e-05, | |
| "loss": 1.0562, | |
| "mean_token_accuracy": 0.732879837602377, | |
| "num_tokens": 298163564.0, | |
| "step": 4740 | |
| }, | |
| { | |
| "entropy": 1.3371880792081356, | |
| "epoch": 0.7019617985000185, | |
| "grad_norm": 0.14559057354927063, | |
| "learning_rate": 2.9821191074331316e-05, | |
| "loss": 1.0516, | |
| "mean_token_accuracy": 0.7364227913320065, | |
| "num_tokens": 298794213.0, | |
| "step": 4750 | |
| }, | |
| { | |
| "entropy": 1.3115318283438682, | |
| "epoch": 0.7034396128126501, | |
| "grad_norm": 0.12408871203660965, | |
| "learning_rate": 2.96734151027043e-05, | |
| "loss": 1.011, | |
| "mean_token_accuracy": 0.7429202817380428, | |
| "num_tokens": 299435315.0, | |
| "step": 4760 | |
| }, | |
| { | |
| "entropy": 1.323327000439167, | |
| "epoch": 0.7049174271252817, | |
| "grad_norm": 0.1299198865890503, | |
| "learning_rate": 2.952563913107729e-05, | |
| "loss": 1.0114, | |
| "mean_token_accuracy": 0.741088104993105, | |
| "num_tokens": 300060042.0, | |
| "step": 4770 | |
| }, | |
| { | |
| "entropy": 1.3446701981127263, | |
| "epoch": 0.7063952414379133, | |
| "grad_norm": 0.14076866209506989, | |
| "learning_rate": 2.9377863159450274e-05, | |
| "loss": 0.9905, | |
| "mean_token_accuracy": 0.7466110914945603, | |
| "num_tokens": 300651338.0, | |
| "step": 4780 | |
| }, | |
| { | |
| "entropy": 1.3259353674948215, | |
| "epoch": 0.7078730557505449, | |
| "grad_norm": 0.10263624042272568, | |
| "learning_rate": 2.9230087187823262e-05, | |
| "loss": 1.0346, | |
| "mean_token_accuracy": 0.7375701159238816, | |
| "num_tokens": 301304034.0, | |
| "step": 4790 | |
| }, | |
| { | |
| "entropy": 1.3674908801913261, | |
| "epoch": 0.7093508700631765, | |
| "grad_norm": 0.12330764532089233, | |
| "learning_rate": 2.9082311216196247e-05, | |
| "loss": 1.0602, | |
| "mean_token_accuracy": 0.7365720339119435, | |
| "num_tokens": 301923306.0, | |
| "step": 4800 | |
| }, | |
| { | |
| "entropy": 1.3329905986785888, | |
| "epoch": 0.7108286843758082, | |
| "grad_norm": 0.134576216340065, | |
| "learning_rate": 2.893453524456923e-05, | |
| "loss": 1.0265, | |
| "mean_token_accuracy": 0.7412666134536267, | |
| "num_tokens": 302545691.0, | |
| "step": 4810 | |
| }, | |
| { | |
| "entropy": 1.3309357464313507, | |
| "epoch": 0.7123064986884398, | |
| "grad_norm": 0.12007878720760345, | |
| "learning_rate": 2.878675927294222e-05, | |
| "loss": 0.9783, | |
| "mean_token_accuracy": 0.745373184978962, | |
| "num_tokens": 303181147.0, | |
| "step": 4820 | |
| }, | |
| { | |
| "entropy": 1.3643394075334072, | |
| "epoch": 0.7137843130010714, | |
| "grad_norm": 0.136694073677063, | |
| "learning_rate": 2.8638983301315208e-05, | |
| "loss": 1.03, | |
| "mean_token_accuracy": 0.7360346958041191, | |
| "num_tokens": 303772203.0, | |
| "step": 4830 | |
| }, | |
| { | |
| "entropy": 1.2909266255795955, | |
| "epoch": 0.715262127313703, | |
| "grad_norm": 0.1237269937992096, | |
| "learning_rate": 2.8491207329688196e-05, | |
| "loss": 0.9847, | |
| "mean_token_accuracy": 0.7457400150597095, | |
| "num_tokens": 304400205.0, | |
| "step": 4840 | |
| }, | |
| { | |
| "entropy": 1.318508828431368, | |
| "epoch": 0.7167399416263347, | |
| "grad_norm": 0.1296572983264923, | |
| "learning_rate": 2.8343431358061178e-05, | |
| "loss": 0.9943, | |
| "mean_token_accuracy": 0.7424058385193348, | |
| "num_tokens": 305034154.0, | |
| "step": 4850 | |
| }, | |
| { | |
| "entropy": 1.3280914664268493, | |
| "epoch": 0.7182177559389663, | |
| "grad_norm": 0.10831849277019501, | |
| "learning_rate": 2.8195655386434166e-05, | |
| "loss": 1.0024, | |
| "mean_token_accuracy": 0.7443806000053883, | |
| "num_tokens": 305660112.0, | |
| "step": 4860 | |
| }, | |
| { | |
| "entropy": 1.345757918804884, | |
| "epoch": 0.7196955702515979, | |
| "grad_norm": 0.15830285847187042, | |
| "learning_rate": 2.8047879414807154e-05, | |
| "loss": 1.0241, | |
| "mean_token_accuracy": 0.7413417495787143, | |
| "num_tokens": 306284169.0, | |
| "step": 4870 | |
| }, | |
| { | |
| "entropy": 1.326023256033659, | |
| "epoch": 0.7211733845642295, | |
| "grad_norm": 0.12437301874160767, | |
| "learning_rate": 2.7900103443180143e-05, | |
| "loss": 1.0236, | |
| "mean_token_accuracy": 0.7441856421530246, | |
| "num_tokens": 306925573.0, | |
| "step": 4880 | |
| }, | |
| { | |
| "entropy": 1.3403374791145324, | |
| "epoch": 0.7226511988768611, | |
| "grad_norm": 0.14862604439258575, | |
| "learning_rate": 2.7752327471553124e-05, | |
| "loss": 1.0126, | |
| "mean_token_accuracy": 0.7417874552309514, | |
| "num_tokens": 307552556.0, | |
| "step": 4890 | |
| }, | |
| { | |
| "entropy": 1.3029513664543628, | |
| "epoch": 0.7241290131894927, | |
| "grad_norm": 0.14984281361103058, | |
| "learning_rate": 2.7604551499926112e-05, | |
| "loss": 0.9913, | |
| "mean_token_accuracy": 0.7468802168965339, | |
| "num_tokens": 308192975.0, | |
| "step": 4900 | |
| }, | |
| { | |
| "entropy": 1.323684511333704, | |
| "epoch": 0.7256068275021244, | |
| "grad_norm": 0.16719244420528412, | |
| "learning_rate": 2.74567755282991e-05, | |
| "loss": 1.014, | |
| "mean_token_accuracy": 0.7450279243290424, | |
| "num_tokens": 308790136.0, | |
| "step": 4910 | |
| }, | |
| { | |
| "entropy": 1.3346189700067044, | |
| "epoch": 0.727084641814756, | |
| "grad_norm": 0.13141213357448578, | |
| "learning_rate": 2.730899955667209e-05, | |
| "loss": 1.051, | |
| "mean_token_accuracy": 0.7325736321508884, | |
| "num_tokens": 309412957.0, | |
| "step": 4920 | |
| }, | |
| { | |
| "entropy": 1.307160697877407, | |
| "epoch": 0.7285624561273876, | |
| "grad_norm": 0.1185912936925888, | |
| "learning_rate": 2.716122358504507e-05, | |
| "loss": 0.9784, | |
| "mean_token_accuracy": 0.7491277985274791, | |
| "num_tokens": 310040700.0, | |
| "step": 4930 | |
| }, | |
| { | |
| "entropy": 1.3605231955647468, | |
| "epoch": 0.7300402704400192, | |
| "grad_norm": 0.11863730102777481, | |
| "learning_rate": 2.701344761341806e-05, | |
| "loss": 1.0576, | |
| "mean_token_accuracy": 0.7326734766364098, | |
| "num_tokens": 310657828.0, | |
| "step": 4940 | |
| }, | |
| { | |
| "entropy": 1.299007173627615, | |
| "epoch": 0.7315180847526508, | |
| "grad_norm": 0.11598937213420868, | |
| "learning_rate": 2.6865671641791047e-05, | |
| "loss": 0.9913, | |
| "mean_token_accuracy": 0.749681244045496, | |
| "num_tokens": 311288566.0, | |
| "step": 4950 | |
| }, | |
| { | |
| "entropy": 1.2920017048716546, | |
| "epoch": 0.7329958990652824, | |
| "grad_norm": 0.12922370433807373, | |
| "learning_rate": 2.6717895670164035e-05, | |
| "loss": 0.9955, | |
| "mean_token_accuracy": 0.7468885749578476, | |
| "num_tokens": 311933827.0, | |
| "step": 4960 | |
| }, | |
| { | |
| "entropy": 1.3599808380007743, | |
| "epoch": 0.7344737133779141, | |
| "grad_norm": 0.12107284367084503, | |
| "learning_rate": 2.6570119698537023e-05, | |
| "loss": 1.0425, | |
| "mean_token_accuracy": 0.7379572823643684, | |
| "num_tokens": 312558228.0, | |
| "step": 4970 | |
| }, | |
| { | |
| "entropy": 1.3698449276387692, | |
| "epoch": 0.7359515276905457, | |
| "grad_norm": 0.11487340927124023, | |
| "learning_rate": 2.6422343726910005e-05, | |
| "loss": 1.0617, | |
| "mean_token_accuracy": 0.7336210198700428, | |
| "num_tokens": 313183926.0, | |
| "step": 4980 | |
| }, | |
| { | |
| "entropy": 1.346721203625202, | |
| "epoch": 0.7374293420031773, | |
| "grad_norm": 0.1212073564529419, | |
| "learning_rate": 2.6274567755282993e-05, | |
| "loss": 1.0296, | |
| "mean_token_accuracy": 0.739198499917984, | |
| "num_tokens": 313820949.0, | |
| "step": 4990 | |
| }, | |
| { | |
| "entropy": 1.3611103758215903, | |
| "epoch": 0.7389071563158089, | |
| "grad_norm": 0.12863674759864807, | |
| "learning_rate": 2.612679178365598e-05, | |
| "loss": 1.0377, | |
| "mean_token_accuracy": 0.7381574101746082, | |
| "num_tokens": 314436283.0, | |
| "step": 5000 | |
| }, | |
| { | |
| "entropy": 1.325782622396946, | |
| "epoch": 0.7403849706284406, | |
| "grad_norm": 0.118117555975914, | |
| "learning_rate": 2.5979015812028966e-05, | |
| "loss": 1.0518, | |
| "mean_token_accuracy": 0.7347126387059688, | |
| "num_tokens": 315058652.0, | |
| "step": 5010 | |
| }, | |
| { | |
| "entropy": 1.3325309082865715, | |
| "epoch": 0.7418627849410722, | |
| "grad_norm": 0.12454936653375626, | |
| "learning_rate": 2.583123984040195e-05, | |
| "loss": 1.0319, | |
| "mean_token_accuracy": 0.7397500842809677, | |
| "num_tokens": 315701496.0, | |
| "step": 5020 | |
| }, | |
| { | |
| "entropy": 1.2837858386337757, | |
| "epoch": 0.7433405992537038, | |
| "grad_norm": 0.12542617321014404, | |
| "learning_rate": 2.568346386877494e-05, | |
| "loss": 0.9858, | |
| "mean_token_accuracy": 0.7501832038164139, | |
| "num_tokens": 316331247.0, | |
| "step": 5030 | |
| }, | |
| { | |
| "entropy": 1.3427621588110923, | |
| "epoch": 0.7448184135663354, | |
| "grad_norm": 0.12836028635501862, | |
| "learning_rate": 2.5535687897147924e-05, | |
| "loss": 1.038, | |
| "mean_token_accuracy": 0.7358950592577458, | |
| "num_tokens": 316946786.0, | |
| "step": 5040 | |
| }, | |
| { | |
| "entropy": 1.3334973461925983, | |
| "epoch": 0.746296227878967, | |
| "grad_norm": 0.14334280788898468, | |
| "learning_rate": 2.5387911925520912e-05, | |
| "loss": 1.0219, | |
| "mean_token_accuracy": 0.7420683093369007, | |
| "num_tokens": 317590282.0, | |
| "step": 5050 | |
| }, | |
| { | |
| "entropy": 1.316165641695261, | |
| "epoch": 0.7477740421915986, | |
| "grad_norm": 0.1569705754518509, | |
| "learning_rate": 2.5240135953893894e-05, | |
| "loss": 1.006, | |
| "mean_token_accuracy": 0.7437090836465359, | |
| "num_tokens": 318210626.0, | |
| "step": 5060 | |
| }, | |
| { | |
| "entropy": 1.3033836044371128, | |
| "epoch": 0.7492518565042302, | |
| "grad_norm": 0.10642680525779724, | |
| "learning_rate": 2.5092359982266882e-05, | |
| "loss": 0.9893, | |
| "mean_token_accuracy": 0.7470180414617061, | |
| "num_tokens": 318831662.0, | |
| "step": 5070 | |
| }, | |
| { | |
| "entropy": 1.3135450080037117, | |
| "epoch": 0.7507296708168618, | |
| "grad_norm": 0.1242324709892273, | |
| "learning_rate": 2.494458401063987e-05, | |
| "loss": 0.9842, | |
| "mean_token_accuracy": 0.748679618537426, | |
| "num_tokens": 319460678.0, | |
| "step": 5080 | |
| }, | |
| { | |
| "entropy": 1.3217751324176787, | |
| "epoch": 0.7522074851294934, | |
| "grad_norm": 0.1090734452009201, | |
| "learning_rate": 2.479680803901286e-05, | |
| "loss": 0.9882, | |
| "mean_token_accuracy": 0.7465294934809208, | |
| "num_tokens": 320080140.0, | |
| "step": 5090 | |
| }, | |
| { | |
| "entropy": 1.3406529314815998, | |
| "epoch": 0.7536852994421251, | |
| "grad_norm": 0.12375643849372864, | |
| "learning_rate": 2.4649032067385843e-05, | |
| "loss": 1.0267, | |
| "mean_token_accuracy": 0.7397718273103238, | |
| "num_tokens": 320705386.0, | |
| "step": 5100 | |
| }, | |
| { | |
| "entropy": 1.3804366782307624, | |
| "epoch": 0.7551631137547568, | |
| "grad_norm": 0.13206851482391357, | |
| "learning_rate": 2.450125609575883e-05, | |
| "loss": 1.0535, | |
| "mean_token_accuracy": 0.736749055236578, | |
| "num_tokens": 321347044.0, | |
| "step": 5110 | |
| }, | |
| { | |
| "entropy": 1.3584469094872476, | |
| "epoch": 0.7566409280673884, | |
| "grad_norm": 0.10561691224575043, | |
| "learning_rate": 2.4353480124131816e-05, | |
| "loss": 1.0408, | |
| "mean_token_accuracy": 0.7360177867114543, | |
| "num_tokens": 321978971.0, | |
| "step": 5120 | |
| }, | |
| { | |
| "entropy": 1.306953214108944, | |
| "epoch": 0.75811874238002, | |
| "grad_norm": 0.12143130600452423, | |
| "learning_rate": 2.4205704152504805e-05, | |
| "loss": 0.9998, | |
| "mean_token_accuracy": 0.7445025816559792, | |
| "num_tokens": 322613865.0, | |
| "step": 5130 | |
| }, | |
| { | |
| "entropy": 1.3641792319715023, | |
| "epoch": 0.7595965566926516, | |
| "grad_norm": 0.12223450094461441, | |
| "learning_rate": 2.405792818087779e-05, | |
| "loss": 1.0387, | |
| "mean_token_accuracy": 0.7379502311348916, | |
| "num_tokens": 323247464.0, | |
| "step": 5140 | |
| }, | |
| { | |
| "entropy": 1.3081051871180533, | |
| "epoch": 0.7610743710052832, | |
| "grad_norm": 0.13382208347320557, | |
| "learning_rate": 2.3910152209250778e-05, | |
| "loss": 1.0069, | |
| "mean_token_accuracy": 0.742257046699524, | |
| "num_tokens": 323867041.0, | |
| "step": 5150 | |
| }, | |
| { | |
| "entropy": 1.3398429796099662, | |
| "epoch": 0.7625521853179148, | |
| "grad_norm": 0.11734897643327713, | |
| "learning_rate": 2.3762376237623762e-05, | |
| "loss": 1.0501, | |
| "mean_token_accuracy": 0.7373069517314434, | |
| "num_tokens": 324503667.0, | |
| "step": 5160 | |
| }, | |
| { | |
| "entropy": 1.2856581561267375, | |
| "epoch": 0.7640299996305464, | |
| "grad_norm": 0.11487198621034622, | |
| "learning_rate": 2.361460026599675e-05, | |
| "loss": 0.9925, | |
| "mean_token_accuracy": 0.7459338754415512, | |
| "num_tokens": 325152511.0, | |
| "step": 5170 | |
| }, | |
| { | |
| "entropy": 1.3095781721174717, | |
| "epoch": 0.765507813943178, | |
| "grad_norm": 0.11295847594738007, | |
| "learning_rate": 2.3466824294369736e-05, | |
| "loss": 0.9761, | |
| "mean_token_accuracy": 0.7487106472253799, | |
| "num_tokens": 325773003.0, | |
| "step": 5180 | |
| }, | |
| { | |
| "entropy": 1.3086177356541158, | |
| "epoch": 0.7669856282558096, | |
| "grad_norm": 0.1418120115995407, | |
| "learning_rate": 2.3319048322742724e-05, | |
| "loss": 1.009, | |
| "mean_token_accuracy": 0.7405801028013229, | |
| "num_tokens": 326416846.0, | |
| "step": 5190 | |
| }, | |
| { | |
| "entropy": 1.3360229194164277, | |
| "epoch": 0.7684634425684412, | |
| "grad_norm": 0.1305115967988968, | |
| "learning_rate": 2.3171272351115712e-05, | |
| "loss": 1.0385, | |
| "mean_token_accuracy": 0.7389066144824028, | |
| "num_tokens": 327049923.0, | |
| "step": 5200 | |
| }, | |
| { | |
| "entropy": 1.3275974862277509, | |
| "epoch": 0.7699412568810728, | |
| "grad_norm": 0.1303836554288864, | |
| "learning_rate": 2.3023496379488697e-05, | |
| "loss": 0.9939, | |
| "mean_token_accuracy": 0.7476765356957913, | |
| "num_tokens": 327690605.0, | |
| "step": 5210 | |
| }, | |
| { | |
| "entropy": 1.307869978994131, | |
| "epoch": 0.7714190711937046, | |
| "grad_norm": 0.12129199504852295, | |
| "learning_rate": 2.2875720407861685e-05, | |
| "loss": 0.9909, | |
| "mean_token_accuracy": 0.7462148115038871, | |
| "num_tokens": 328317712.0, | |
| "step": 5220 | |
| }, | |
| { | |
| "entropy": 1.3123974323272705, | |
| "epoch": 0.7728968855063362, | |
| "grad_norm": 0.11937498301267624, | |
| "learning_rate": 2.272794443623467e-05, | |
| "loss": 1.003, | |
| "mean_token_accuracy": 0.7446192368865013, | |
| "num_tokens": 328941674.0, | |
| "step": 5230 | |
| }, | |
| { | |
| "entropy": 1.3761452838778496, | |
| "epoch": 0.7743746998189678, | |
| "grad_norm": 0.10988405346870422, | |
| "learning_rate": 2.2580168464607658e-05, | |
| "loss": 1.0635, | |
| "mean_token_accuracy": 0.734012907743454, | |
| "num_tokens": 329584137.0, | |
| "step": 5240 | |
| }, | |
| { | |
| "entropy": 1.2854306407272815, | |
| "epoch": 0.7758525141315994, | |
| "grad_norm": 0.1544429361820221, | |
| "learning_rate": 2.2432392492980643e-05, | |
| "loss": 0.9576, | |
| "mean_token_accuracy": 0.7528227671980858, | |
| "num_tokens": 330220795.0, | |
| "step": 5250 | |
| }, | |
| { | |
| "entropy": 1.304028608649969, | |
| "epoch": 0.777330328444231, | |
| "grad_norm": 0.12517547607421875, | |
| "learning_rate": 2.2284616521353628e-05, | |
| "loss": 0.9754, | |
| "mean_token_accuracy": 0.7507062517106533, | |
| "num_tokens": 330845075.0, | |
| "step": 5260 | |
| }, | |
| { | |
| "entropy": 1.3103728748857975, | |
| "epoch": 0.7788081427568626, | |
| "grad_norm": 0.13300468027591705, | |
| "learning_rate": 2.2136840549726616e-05, | |
| "loss": 0.9936, | |
| "mean_token_accuracy": 0.7502763822674752, | |
| "num_tokens": 331461903.0, | |
| "step": 5270 | |
| }, | |
| { | |
| "entropy": 1.3418636083602906, | |
| "epoch": 0.7802859570694942, | |
| "grad_norm": 0.10688610374927521, | |
| "learning_rate": 2.19890645780996e-05, | |
| "loss": 1.0603, | |
| "mean_token_accuracy": 0.7354485787451267, | |
| "num_tokens": 332098250.0, | |
| "step": 5280 | |
| }, | |
| { | |
| "entropy": 1.3413996249437332, | |
| "epoch": 0.7817637713821258, | |
| "grad_norm": 0.11547284573316574, | |
| "learning_rate": 2.1841288606472586e-05, | |
| "loss": 1.0183, | |
| "mean_token_accuracy": 0.7401676058769227, | |
| "num_tokens": 332738973.0, | |
| "step": 5290 | |
| }, | |
| { | |
| "entropy": 1.2956015571951867, | |
| "epoch": 0.7832415856947574, | |
| "grad_norm": 0.14867275953292847, | |
| "learning_rate": 2.1693512634845574e-05, | |
| "loss": 0.9968, | |
| "mean_token_accuracy": 0.7482645206153393, | |
| "num_tokens": 333374842.0, | |
| "step": 5300 | |
| }, | |
| { | |
| "entropy": 1.3352750092744827, | |
| "epoch": 0.784719400007389, | |
| "grad_norm": 0.12308944761753082, | |
| "learning_rate": 2.154573666321856e-05, | |
| "loss": 1.0076, | |
| "mean_token_accuracy": 0.7402734778821468, | |
| "num_tokens": 333996081.0, | |
| "step": 5310 | |
| }, | |
| { | |
| "entropy": 1.3263126194477082, | |
| "epoch": 0.7861972143200207, | |
| "grad_norm": 0.12351057678461075, | |
| "learning_rate": 2.1397960691591547e-05, | |
| "loss": 1.0328, | |
| "mean_token_accuracy": 0.7401689246296883, | |
| "num_tokens": 334631011.0, | |
| "step": 5320 | |
| }, | |
| { | |
| "entropy": 1.3505345225334167, | |
| "epoch": 0.7876750286326523, | |
| "grad_norm": 0.11376931518316269, | |
| "learning_rate": 2.1250184719964535e-05, | |
| "loss": 1.0127, | |
| "mean_token_accuracy": 0.7426583305001259, | |
| "num_tokens": 335261549.0, | |
| "step": 5330 | |
| }, | |
| { | |
| "entropy": 1.3594610929489135, | |
| "epoch": 0.7891528429452839, | |
| "grad_norm": 0.12028499692678452, | |
| "learning_rate": 2.110240874833752e-05, | |
| "loss": 1.041, | |
| "mean_token_accuracy": 0.7349088214337826, | |
| "num_tokens": 335894829.0, | |
| "step": 5340 | |
| }, | |
| { | |
| "entropy": 1.3063403144478798, | |
| "epoch": 0.7906306572579156, | |
| "grad_norm": 0.11505310237407684, | |
| "learning_rate": 2.095463277671051e-05, | |
| "loss": 0.9889, | |
| "mean_token_accuracy": 0.7459150403738022, | |
| "num_tokens": 336534149.0, | |
| "step": 5350 | |
| }, | |
| { | |
| "entropy": 1.2942039281129838, | |
| "epoch": 0.7921084715705472, | |
| "grad_norm": 0.12102124094963074, | |
| "learning_rate": 2.0806856805083493e-05, | |
| "loss": 1.0047, | |
| "mean_token_accuracy": 0.7467892125248909, | |
| "num_tokens": 337167728.0, | |
| "step": 5360 | |
| }, | |
| { | |
| "entropy": 1.3099549762904643, | |
| "epoch": 0.7935862858831788, | |
| "grad_norm": 0.12091784179210663, | |
| "learning_rate": 2.065908083345648e-05, | |
| "loss": 0.9749, | |
| "mean_token_accuracy": 0.7508032590150833, | |
| "num_tokens": 337792094.0, | |
| "step": 5370 | |
| }, | |
| { | |
| "entropy": 1.3193748205900193, | |
| "epoch": 0.7950641001958104, | |
| "grad_norm": 0.12178395688533783, | |
| "learning_rate": 2.0511304861829467e-05, | |
| "loss": 0.9837, | |
| "mean_token_accuracy": 0.744479450583458, | |
| "num_tokens": 338402403.0, | |
| "step": 5380 | |
| }, | |
| { | |
| "entropy": 1.2912467263638974, | |
| "epoch": 0.796541914508442, | |
| "grad_norm": 0.11095555126667023, | |
| "learning_rate": 2.0363528890202455e-05, | |
| "loss": 0.9777, | |
| "mean_token_accuracy": 0.7510395921766758, | |
| "num_tokens": 339051452.0, | |
| "step": 5390 | |
| }, | |
| { | |
| "entropy": 1.3539048105478286, | |
| "epoch": 0.7980197288210736, | |
| "grad_norm": 0.11416377872228622, | |
| "learning_rate": 2.021575291857544e-05, | |
| "loss": 1.0417, | |
| "mean_token_accuracy": 0.7391513310372829, | |
| "num_tokens": 339688617.0, | |
| "step": 5400 | |
| }, | |
| { | |
| "entropy": 1.3722274094820022, | |
| "epoch": 0.7994975431337052, | |
| "grad_norm": 0.13663271069526672, | |
| "learning_rate": 2.0067976946948428e-05, | |
| "loss": 1.0616, | |
| "mean_token_accuracy": 0.7323425568640232, | |
| "num_tokens": 340327723.0, | |
| "step": 5410 | |
| }, | |
| { | |
| "entropy": 1.3680840730667114, | |
| "epoch": 0.8009753574463369, | |
| "grad_norm": 0.12302777916193008, | |
| "learning_rate": 1.9920200975321413e-05, | |
| "loss": 1.0086, | |
| "mean_token_accuracy": 0.7418931379914284, | |
| "num_tokens": 340943329.0, | |
| "step": 5420 | |
| }, | |
| { | |
| "entropy": 1.3484257988631725, | |
| "epoch": 0.8024531717589685, | |
| "grad_norm": 0.14521946012973785, | |
| "learning_rate": 1.97724250036944e-05, | |
| "loss": 1.0415, | |
| "mean_token_accuracy": 0.7372381918132305, | |
| "num_tokens": 341583436.0, | |
| "step": 5430 | |
| }, | |
| { | |
| "entropy": 1.3435696944594384, | |
| "epoch": 0.8039309860716001, | |
| "grad_norm": 0.13386188447475433, | |
| "learning_rate": 1.962464903206739e-05, | |
| "loss": 1.0508, | |
| "mean_token_accuracy": 0.7391325704753399, | |
| "num_tokens": 342215207.0, | |
| "step": 5440 | |
| }, | |
| { | |
| "entropy": 1.3138762816786766, | |
| "epoch": 0.8054088003842317, | |
| "grad_norm": 0.13170363008975983, | |
| "learning_rate": 1.9476873060440374e-05, | |
| "loss": 0.9789, | |
| "mean_token_accuracy": 0.7494944863021373, | |
| "num_tokens": 342842134.0, | |
| "step": 5450 | |
| }, | |
| { | |
| "entropy": 1.3419123955070973, | |
| "epoch": 0.8068866146968633, | |
| "grad_norm": 0.1314888894557953, | |
| "learning_rate": 1.9329097088813362e-05, | |
| "loss": 1.0312, | |
| "mean_token_accuracy": 0.7364721618592739, | |
| "num_tokens": 343466230.0, | |
| "step": 5460 | |
| }, | |
| { | |
| "entropy": 1.3453618548810482, | |
| "epoch": 0.808364429009495, | |
| "grad_norm": 0.11651881039142609, | |
| "learning_rate": 1.9181321117186347e-05, | |
| "loss": 1.0159, | |
| "mean_token_accuracy": 0.7454579032957553, | |
| "num_tokens": 344096356.0, | |
| "step": 5470 | |
| }, | |
| { | |
| "entropy": 1.2968750067055226, | |
| "epoch": 0.8098422433221266, | |
| "grad_norm": 0.13125477731227875, | |
| "learning_rate": 1.9033545145559335e-05, | |
| "loss": 0.9813, | |
| "mean_token_accuracy": 0.7480554945766926, | |
| "num_tokens": 344723865.0, | |
| "step": 5480 | |
| }, | |
| { | |
| "entropy": 1.3539662800729275, | |
| "epoch": 0.8113200576347582, | |
| "grad_norm": 0.11619358509778976, | |
| "learning_rate": 1.888576917393232e-05, | |
| "loss": 1.0111, | |
| "mean_token_accuracy": 0.7425602056086064, | |
| "num_tokens": 345334991.0, | |
| "step": 5490 | |
| }, | |
| { | |
| "entropy": 1.335629913955927, | |
| "epoch": 0.8127978719473898, | |
| "grad_norm": 0.14460872113704681, | |
| "learning_rate": 1.8737993202305305e-05, | |
| "loss": 1.0497, | |
| "mean_token_accuracy": 0.7352975860238076, | |
| "num_tokens": 345982288.0, | |
| "step": 5500 | |
| }, | |
| { | |
| "entropy": 1.3496653221547603, | |
| "epoch": 0.8142756862600214, | |
| "grad_norm": 0.12175831943750381, | |
| "learning_rate": 1.8590217230678293e-05, | |
| "loss": 1.0396, | |
| "mean_token_accuracy": 0.7365844771265984, | |
| "num_tokens": 346595072.0, | |
| "step": 5510 | |
| }, | |
| { | |
| "entropy": 1.341681607067585, | |
| "epoch": 0.8157535005726531, | |
| "grad_norm": 0.12488234788179398, | |
| "learning_rate": 1.8442441259051278e-05, | |
| "loss": 1.0372, | |
| "mean_token_accuracy": 0.7352021165192127, | |
| "num_tokens": 347209675.0, | |
| "step": 5520 | |
| }, | |
| { | |
| "entropy": 1.337549727410078, | |
| "epoch": 0.8172313148852847, | |
| "grad_norm": 0.12194401770830154, | |
| "learning_rate": 1.8294665287424263e-05, | |
| "loss": 1.0578, | |
| "mean_token_accuracy": 0.7347122609615326, | |
| "num_tokens": 347835705.0, | |
| "step": 5530 | |
| }, | |
| { | |
| "entropy": 1.303477893769741, | |
| "epoch": 0.8187091291979163, | |
| "grad_norm": 0.12405266612768173, | |
| "learning_rate": 1.814688931579725e-05, | |
| "loss": 0.9994, | |
| "mean_token_accuracy": 0.7478441722691059, | |
| "num_tokens": 348468668.0, | |
| "step": 5540 | |
| }, | |
| { | |
| "entropy": 1.3249061562120914, | |
| "epoch": 0.8201869435105479, | |
| "grad_norm": 0.12435730546712875, | |
| "learning_rate": 1.7999113344170236e-05, | |
| "loss": 1.0061, | |
| "mean_token_accuracy": 0.7447381973266601, | |
| "num_tokens": 349081142.0, | |
| "step": 5550 | |
| }, | |
| { | |
| "entropy": 1.35750472843647, | |
| "epoch": 0.8216647578231795, | |
| "grad_norm": 0.1328584998846054, | |
| "learning_rate": 1.7851337372543224e-05, | |
| "loss": 1.0088, | |
| "mean_token_accuracy": 0.7452337816357613, | |
| "num_tokens": 349720126.0, | |
| "step": 5560 | |
| }, | |
| { | |
| "entropy": 1.3538759835064411, | |
| "epoch": 0.8231425721358111, | |
| "grad_norm": 0.14198720455169678, | |
| "learning_rate": 1.7703561400916213e-05, | |
| "loss": 1.0484, | |
| "mean_token_accuracy": 0.7349992088973523, | |
| "num_tokens": 350359275.0, | |
| "step": 5570 | |
| }, | |
| { | |
| "entropy": 1.311447235196829, | |
| "epoch": 0.8246203864484427, | |
| "grad_norm": 0.12205838412046432, | |
| "learning_rate": 1.7555785429289197e-05, | |
| "loss": 0.9965, | |
| "mean_token_accuracy": 0.7460118442773819, | |
| "num_tokens": 350982085.0, | |
| "step": 5580 | |
| }, | |
| { | |
| "entropy": 1.2985078655183315, | |
| "epoch": 0.8260982007610743, | |
| "grad_norm": 0.13054905831813812, | |
| "learning_rate": 1.7408009457662186e-05, | |
| "loss": 0.9652, | |
| "mean_token_accuracy": 0.750285355746746, | |
| "num_tokens": 351617043.0, | |
| "step": 5590 | |
| }, | |
| { | |
| "entropy": 1.3172591648995877, | |
| "epoch": 0.827576015073706, | |
| "grad_norm": 0.12170116603374481, | |
| "learning_rate": 1.726023348603517e-05, | |
| "loss": 1.0071, | |
| "mean_token_accuracy": 0.7436146058142186, | |
| "num_tokens": 352229355.0, | |
| "step": 5600 | |
| }, | |
| { | |
| "entropy": 1.3304045237600803, | |
| "epoch": 0.8290538293863376, | |
| "grad_norm": 0.11743824183940887, | |
| "learning_rate": 1.711245751440816e-05, | |
| "loss": 1.0279, | |
| "mean_token_accuracy": 0.7404954940080642, | |
| "num_tokens": 352870287.0, | |
| "step": 5610 | |
| }, | |
| { | |
| "entropy": 1.3662690348923205, | |
| "epoch": 0.8305316436989693, | |
| "grad_norm": 0.124085433781147, | |
| "learning_rate": 1.6964681542781144e-05, | |
| "loss": 1.0623, | |
| "mean_token_accuracy": 0.7310058616101742, | |
| "num_tokens": 353530069.0, | |
| "step": 5620 | |
| }, | |
| { | |
| "entropy": 1.3515878789126874, | |
| "epoch": 0.8320094580116009, | |
| "grad_norm": 0.13237376511096954, | |
| "learning_rate": 1.6816905571154132e-05, | |
| "loss": 1.0463, | |
| "mean_token_accuracy": 0.7363075397908687, | |
| "num_tokens": 354147357.0, | |
| "step": 5630 | |
| }, | |
| { | |
| "entropy": 1.3044847965240478, | |
| "epoch": 0.8334872723242325, | |
| "grad_norm": 0.13815967738628387, | |
| "learning_rate": 1.6669129599527117e-05, | |
| "loss": 0.9782, | |
| "mean_token_accuracy": 0.7475894182920456, | |
| "num_tokens": 354795962.0, | |
| "step": 5640 | |
| }, | |
| { | |
| "entropy": 1.3666689321398735, | |
| "epoch": 0.8349650866368641, | |
| "grad_norm": 0.14314478635787964, | |
| "learning_rate": 1.6521353627900105e-05, | |
| "loss": 1.0065, | |
| "mean_token_accuracy": 0.7443801440298558, | |
| "num_tokens": 355417931.0, | |
| "step": 5650 | |
| }, | |
| { | |
| "entropy": 1.29787110760808, | |
| "epoch": 0.8364429009494957, | |
| "grad_norm": 0.13985678553581238, | |
| "learning_rate": 1.637357765627309e-05, | |
| "loss": 1.001, | |
| "mean_token_accuracy": 0.7457695990800858, | |
| "num_tokens": 356053286.0, | |
| "step": 5660 | |
| }, | |
| { | |
| "entropy": 1.341988889873028, | |
| "epoch": 0.8379207152621273, | |
| "grad_norm": 0.10513360053300858, | |
| "learning_rate": 1.6225801684646078e-05, | |
| "loss": 1.0067, | |
| "mean_token_accuracy": 0.7454051755368709, | |
| "num_tokens": 356690487.0, | |
| "step": 5670 | |
| }, | |
| { | |
| "entropy": 1.2974316738545895, | |
| "epoch": 0.8393985295747589, | |
| "grad_norm": 0.12444105744361877, | |
| "learning_rate": 1.6078025713019063e-05, | |
| "loss": 0.9723, | |
| "mean_token_accuracy": 0.7503290168941021, | |
| "num_tokens": 357328781.0, | |
| "step": 5680 | |
| }, | |
| { | |
| "entropy": 1.3582345850765705, | |
| "epoch": 0.8408763438873905, | |
| "grad_norm": 0.14589613676071167, | |
| "learning_rate": 1.593024974139205e-05, | |
| "loss": 1.0331, | |
| "mean_token_accuracy": 0.7437467984855175, | |
| "num_tokens": 357932412.0, | |
| "step": 5690 | |
| }, | |
| { | |
| "entropy": 1.3196044340729713, | |
| "epoch": 0.8423541582000221, | |
| "grad_norm": 0.11677612364292145, | |
| "learning_rate": 1.578247376976504e-05, | |
| "loss": 1.0183, | |
| "mean_token_accuracy": 0.7420541405677795, | |
| "num_tokens": 358551724.0, | |
| "step": 5700 | |
| }, | |
| { | |
| "entropy": 1.3120089799165726, | |
| "epoch": 0.8438319725126537, | |
| "grad_norm": 0.11075033247470856, | |
| "learning_rate": 1.5634697798138024e-05, | |
| "loss": 1.0223, | |
| "mean_token_accuracy": 0.7393298916518688, | |
| "num_tokens": 359189473.0, | |
| "step": 5710 | |
| }, | |
| { | |
| "entropy": 1.3048913300037384, | |
| "epoch": 0.8453097868252853, | |
| "grad_norm": 0.11959829181432724, | |
| "learning_rate": 1.5486921826511013e-05, | |
| "loss": 0.9943, | |
| "mean_token_accuracy": 0.7476891838014126, | |
| "num_tokens": 359808597.0, | |
| "step": 5720 | |
| }, | |
| { | |
| "entropy": 1.319146555662155, | |
| "epoch": 0.8467876011379171, | |
| "grad_norm": 0.13747940957546234, | |
| "learning_rate": 1.5339145854883997e-05, | |
| "loss": 0.9898, | |
| "mean_token_accuracy": 0.7491352930665016, | |
| "num_tokens": 360422994.0, | |
| "step": 5730 | |
| }, | |
| { | |
| "entropy": 1.3594556599855423, | |
| "epoch": 0.8482654154505487, | |
| "grad_norm": 0.1400456726551056, | |
| "learning_rate": 1.5191369883256984e-05, | |
| "loss": 1.0597, | |
| "mean_token_accuracy": 0.7335585907101632, | |
| "num_tokens": 361051901.0, | |
| "step": 5740 | |
| }, | |
| { | |
| "entropy": 1.3374354548752307, | |
| "epoch": 0.8497432297631803, | |
| "grad_norm": 0.11757944524288177, | |
| "learning_rate": 1.5043593911629969e-05, | |
| "loss": 1.0002, | |
| "mean_token_accuracy": 0.7453118711709976, | |
| "num_tokens": 361656024.0, | |
| "step": 5750 | |
| }, | |
| { | |
| "entropy": 1.3467597417533397, | |
| "epoch": 0.8512210440758119, | |
| "grad_norm": 0.11548870801925659, | |
| "learning_rate": 1.4895817940002957e-05, | |
| "loss": 0.9984, | |
| "mean_token_accuracy": 0.7451724961400032, | |
| "num_tokens": 362279059.0, | |
| "step": 5760 | |
| }, | |
| { | |
| "entropy": 1.311734914034605, | |
| "epoch": 0.8526988583884435, | |
| "grad_norm": 0.12405215948820114, | |
| "learning_rate": 1.4748041968375942e-05, | |
| "loss": 0.9799, | |
| "mean_token_accuracy": 0.7475904323160648, | |
| "num_tokens": 362895039.0, | |
| "step": 5770 | |
| }, | |
| { | |
| "entropy": 1.3386250838637352, | |
| "epoch": 0.8541766727010751, | |
| "grad_norm": 0.11085474491119385, | |
| "learning_rate": 1.460026599674893e-05, | |
| "loss": 1.007, | |
| "mean_token_accuracy": 0.7426138609647751, | |
| "num_tokens": 363529667.0, | |
| "step": 5780 | |
| }, | |
| { | |
| "entropy": 1.2939353726804257, | |
| "epoch": 0.8556544870137067, | |
| "grad_norm": 0.1114809662103653, | |
| "learning_rate": 1.4452490025121915e-05, | |
| "loss": 0.9734, | |
| "mean_token_accuracy": 0.750145249813795, | |
| "num_tokens": 364166145.0, | |
| "step": 5790 | |
| }, | |
| { | |
| "entropy": 1.3184495568275452, | |
| "epoch": 0.8571323013263383, | |
| "grad_norm": 0.1334013044834137, | |
| "learning_rate": 1.4304714053494903e-05, | |
| "loss": 1.0102, | |
| "mean_token_accuracy": 0.7411141104996204, | |
| "num_tokens": 364793121.0, | |
| "step": 5800 | |
| }, | |
| { | |
| "entropy": 1.3013493582606315, | |
| "epoch": 0.8586101156389699, | |
| "grad_norm": 0.11250706017017365, | |
| "learning_rate": 1.4156938081867888e-05, | |
| "loss": 0.9828, | |
| "mean_token_accuracy": 0.7467548877000809, | |
| "num_tokens": 365405557.0, | |
| "step": 5810 | |
| }, | |
| { | |
| "entropy": 1.327430461347103, | |
| "epoch": 0.8600879299516015, | |
| "grad_norm": 0.11568532884120941, | |
| "learning_rate": 1.4009162110240875e-05, | |
| "loss": 1.0218, | |
| "mean_token_accuracy": 0.7415443785488606, | |
| "num_tokens": 366044419.0, | |
| "step": 5820 | |
| }, | |
| { | |
| "entropy": 1.3481206871569156, | |
| "epoch": 0.8615657442642332, | |
| "grad_norm": 0.1371099203824997, | |
| "learning_rate": 1.3861386138613863e-05, | |
| "loss": 1.0439, | |
| "mean_token_accuracy": 0.7366217412054539, | |
| "num_tokens": 366690356.0, | |
| "step": 5830 | |
| }, | |
| { | |
| "entropy": 1.2569597400724888, | |
| "epoch": 0.8630435585768648, | |
| "grad_norm": 0.12688647210597992, | |
| "learning_rate": 1.3713610166986848e-05, | |
| "loss": 0.9435, | |
| "mean_token_accuracy": 0.7563542760908604, | |
| "num_tokens": 367315374.0, | |
| "step": 5840 | |
| }, | |
| { | |
| "entropy": 1.3336492694914341, | |
| "epoch": 0.8645213728894965, | |
| "grad_norm": 0.11842428147792816, | |
| "learning_rate": 1.3565834195359836e-05, | |
| "loss": 1.0233, | |
| "mean_token_accuracy": 0.7392323285341262, | |
| "num_tokens": 367958263.0, | |
| "step": 5850 | |
| }, | |
| { | |
| "entropy": 1.3464648641645909, | |
| "epoch": 0.8659991872021281, | |
| "grad_norm": 0.12313079833984375, | |
| "learning_rate": 1.341805822373282e-05, | |
| "loss": 1.0314, | |
| "mean_token_accuracy": 0.7396592818200588, | |
| "num_tokens": 368585660.0, | |
| "step": 5860 | |
| }, | |
| { | |
| "entropy": 1.3324293851852418, | |
| "epoch": 0.8674770015147597, | |
| "grad_norm": 0.11911337077617645, | |
| "learning_rate": 1.3270282252105809e-05, | |
| "loss": 0.9976, | |
| "mean_token_accuracy": 0.7445396453142166, | |
| "num_tokens": 369187809.0, | |
| "step": 5870 | |
| }, | |
| { | |
| "entropy": 1.3276281908154488, | |
| "epoch": 0.8689548158273913, | |
| "grad_norm": 0.12972944974899292, | |
| "learning_rate": 1.3122506280478794e-05, | |
| "loss": 1.0233, | |
| "mean_token_accuracy": 0.7407662458717823, | |
| "num_tokens": 369827636.0, | |
| "step": 5880 | |
| }, | |
| { | |
| "entropy": 1.3578208431601524, | |
| "epoch": 0.8704326301400229, | |
| "grad_norm": 0.1402665674686432, | |
| "learning_rate": 1.2974730308851782e-05, | |
| "loss": 1.0443, | |
| "mean_token_accuracy": 0.737098440527916, | |
| "num_tokens": 370449924.0, | |
| "step": 5890 | |
| }, | |
| { | |
| "entropy": 1.3040969766676427, | |
| "epoch": 0.8719104444526545, | |
| "grad_norm": 0.13990390300750732, | |
| "learning_rate": 1.2826954337224767e-05, | |
| "loss": 0.9881, | |
| "mean_token_accuracy": 0.7464100919663906, | |
| "num_tokens": 371084999.0, | |
| "step": 5900 | |
| }, | |
| { | |
| "entropy": 1.3430166877806187, | |
| "epoch": 0.8733882587652861, | |
| "grad_norm": 0.12417089194059372, | |
| "learning_rate": 1.2679178365597755e-05, | |
| "loss": 1.0457, | |
| "mean_token_accuracy": 0.7370161950588227, | |
| "num_tokens": 371692543.0, | |
| "step": 5910 | |
| }, | |
| { | |
| "entropy": 1.290044216811657, | |
| "epoch": 0.8748660730779177, | |
| "grad_norm": 0.14069810509681702, | |
| "learning_rate": 1.253140239397074e-05, | |
| "loss": 0.9783, | |
| "mean_token_accuracy": 0.7515232928097249, | |
| "num_tokens": 372320963.0, | |
| "step": 5920 | |
| }, | |
| { | |
| "entropy": 1.3472790539264679, | |
| "epoch": 0.8763438873905494, | |
| "grad_norm": 0.13290193676948547, | |
| "learning_rate": 1.2383626422343728e-05, | |
| "loss": 1.0224, | |
| "mean_token_accuracy": 0.7405038736760616, | |
| "num_tokens": 372949904.0, | |
| "step": 5930 | |
| }, | |
| { | |
| "entropy": 1.387679138034582, | |
| "epoch": 0.877821701703181, | |
| "grad_norm": 0.1314118653535843, | |
| "learning_rate": 1.2235850450716715e-05, | |
| "loss": 1.0422, | |
| "mean_token_accuracy": 0.7353745914995671, | |
| "num_tokens": 373573571.0, | |
| "step": 5940 | |
| }, | |
| { | |
| "entropy": 1.3165842115879058, | |
| "epoch": 0.8792995160158126, | |
| "grad_norm": 0.11947722733020782, | |
| "learning_rate": 1.20880744790897e-05, | |
| "loss": 1.0213, | |
| "mean_token_accuracy": 0.7407660990953445, | |
| "num_tokens": 374212664.0, | |
| "step": 5950 | |
| }, | |
| { | |
| "entropy": 1.3107740238308907, | |
| "epoch": 0.8807773303284442, | |
| "grad_norm": 0.14857317507266998, | |
| "learning_rate": 1.1940298507462686e-05, | |
| "loss": 0.9913, | |
| "mean_token_accuracy": 0.7447304286062717, | |
| "num_tokens": 374849824.0, | |
| "step": 5960 | |
| }, | |
| { | |
| "entropy": 1.2946119613945484, | |
| "epoch": 0.8822551446410758, | |
| "grad_norm": 0.13196992874145508, | |
| "learning_rate": 1.1792522535835673e-05, | |
| "loss": 0.9996, | |
| "mean_token_accuracy": 0.7443319000303745, | |
| "num_tokens": 375459391.0, | |
| "step": 5970 | |
| }, | |
| { | |
| "entropy": 1.3312421210110188, | |
| "epoch": 0.8837329589537075, | |
| "grad_norm": 0.12250470370054245, | |
| "learning_rate": 1.164474656420866e-05, | |
| "loss": 1.0011, | |
| "mean_token_accuracy": 0.7444459736347199, | |
| "num_tokens": 376092015.0, | |
| "step": 5980 | |
| }, | |
| { | |
| "entropy": 1.3092619471251965, | |
| "epoch": 0.8852107732663391, | |
| "grad_norm": 0.12348251789808273, | |
| "learning_rate": 1.1496970592581646e-05, | |
| "loss": 0.9884, | |
| "mean_token_accuracy": 0.7462313294410705, | |
| "num_tokens": 376707987.0, | |
| "step": 5990 | |
| }, | |
| { | |
| "entropy": 1.397826074063778, | |
| "epoch": 0.8866885875789707, | |
| "grad_norm": 0.12798164784908295, | |
| "learning_rate": 1.1349194620954632e-05, | |
| "loss": 1.0543, | |
| "mean_token_accuracy": 0.7346052847802639, | |
| "num_tokens": 377331029.0, | |
| "step": 6000 | |
| }, | |
| { | |
| "entropy": 1.3334910348057747, | |
| "epoch": 0.8881664018916023, | |
| "grad_norm": 0.14080867171287537, | |
| "learning_rate": 1.120141864932762e-05, | |
| "loss": 1.0309, | |
| "mean_token_accuracy": 0.7391007460653782, | |
| "num_tokens": 377965284.0, | |
| "step": 6010 | |
| }, | |
| { | |
| "entropy": 1.3450474232435226, | |
| "epoch": 0.889644216204234, | |
| "grad_norm": 0.11858553439378738, | |
| "learning_rate": 1.1053642677700607e-05, | |
| "loss": 1.042, | |
| "mean_token_accuracy": 0.7341104723513127, | |
| "num_tokens": 378583371.0, | |
| "step": 6020 | |
| }, | |
| { | |
| "entropy": 1.3471639886498452, | |
| "epoch": 0.8911220305168656, | |
| "grad_norm": 0.13958533108234406, | |
| "learning_rate": 1.0905866706073594e-05, | |
| "loss": 1.0176, | |
| "mean_token_accuracy": 0.7405742652714252, | |
| "num_tokens": 379206751.0, | |
| "step": 6030 | |
| }, | |
| { | |
| "entropy": 1.273489784449339, | |
| "epoch": 0.8925998448294972, | |
| "grad_norm": 0.12688973546028137, | |
| "learning_rate": 1.075809073444658e-05, | |
| "loss": 0.9973, | |
| "mean_token_accuracy": 0.746940103918314, | |
| "num_tokens": 379823103.0, | |
| "step": 6040 | |
| }, | |
| { | |
| "entropy": 1.3041085593402386, | |
| "epoch": 0.8940776591421288, | |
| "grad_norm": 0.14143548905849457, | |
| "learning_rate": 1.0610314762819567e-05, | |
| "loss": 0.9935, | |
| "mean_token_accuracy": 0.7468664824962616, | |
| "num_tokens": 380456382.0, | |
| "step": 6050 | |
| }, | |
| { | |
| "entropy": 1.3105453439056873, | |
| "epoch": 0.8955554734547604, | |
| "grad_norm": 0.13660714030265808, | |
| "learning_rate": 1.0462538791192553e-05, | |
| "loss": 1.0131, | |
| "mean_token_accuracy": 0.7412443704903126, | |
| "num_tokens": 381085757.0, | |
| "step": 6060 | |
| }, | |
| { | |
| "entropy": 1.3188693232834339, | |
| "epoch": 0.897033287767392, | |
| "grad_norm": 0.11770734935998917, | |
| "learning_rate": 1.0314762819565538e-05, | |
| "loss": 1.0092, | |
| "mean_token_accuracy": 0.7430628970265388, | |
| "num_tokens": 381703256.0, | |
| "step": 6070 | |
| }, | |
| { | |
| "entropy": 1.3571228340268136, | |
| "epoch": 0.8985111020800236, | |
| "grad_norm": 0.11014366149902344, | |
| "learning_rate": 1.0166986847938525e-05, | |
| "loss": 1.0352, | |
| "mean_token_accuracy": 0.7394863232970238, | |
| "num_tokens": 382342240.0, | |
| "step": 6080 | |
| }, | |
| { | |
| "entropy": 1.291709552705288, | |
| "epoch": 0.8999889163926552, | |
| "grad_norm": 0.1261245310306549, | |
| "learning_rate": 1.0019210876311511e-05, | |
| "loss": 0.9984, | |
| "mean_token_accuracy": 0.7418771781027317, | |
| "num_tokens": 382950230.0, | |
| "step": 6090 | |
| }, | |
| { | |
| "entropy": 1.3168196886777879, | |
| "epoch": 0.9014667307052869, | |
| "grad_norm": 0.1314990222454071, | |
| "learning_rate": 9.871434904684498e-06, | |
| "loss": 0.9979, | |
| "mean_token_accuracy": 0.7453989803791046, | |
| "num_tokens": 383580783.0, | |
| "step": 6100 | |
| }, | |
| { | |
| "entropy": 1.305882962793112, | |
| "epoch": 0.9029445450179185, | |
| "grad_norm": 0.13268327713012695, | |
| "learning_rate": 9.723658933057484e-06, | |
| "loss": 0.9762, | |
| "mean_token_accuracy": 0.7521377936005592, | |
| "num_tokens": 384220360.0, | |
| "step": 6110 | |
| }, | |
| { | |
| "entropy": 1.3119835503399373, | |
| "epoch": 0.9044223593305502, | |
| "grad_norm": 0.11007312685251236, | |
| "learning_rate": 9.575882961430471e-06, | |
| "loss": 0.992, | |
| "mean_token_accuracy": 0.7449328310787677, | |
| "num_tokens": 384876317.0, | |
| "step": 6120 | |
| }, | |
| { | |
| "entropy": 1.316799872368574, | |
| "epoch": 0.9059001736431818, | |
| "grad_norm": 0.11126253753900528, | |
| "learning_rate": 9.42810698980346e-06, | |
| "loss": 1.0005, | |
| "mean_token_accuracy": 0.7466472007334233, | |
| "num_tokens": 385507421.0, | |
| "step": 6130 | |
| }, | |
| { | |
| "entropy": 1.3008616276085376, | |
| "epoch": 0.9073779879558134, | |
| "grad_norm": 0.15056948363780975, | |
| "learning_rate": 9.280331018176446e-06, | |
| "loss": 0.9871, | |
| "mean_token_accuracy": 0.7503829054534435, | |
| "num_tokens": 386141541.0, | |
| "step": 6140 | |
| }, | |
| { | |
| "entropy": 1.3190543949604034, | |
| "epoch": 0.908855802268445, | |
| "grad_norm": 0.13507477939128876, | |
| "learning_rate": 9.132555046549432e-06, | |
| "loss": 1.0206, | |
| "mean_token_accuracy": 0.7397508636116982, | |
| "num_tokens": 386770965.0, | |
| "step": 6150 | |
| }, | |
| { | |
| "entropy": 1.3303886882960796, | |
| "epoch": 0.9103336165810766, | |
| "grad_norm": 0.13336560130119324, | |
| "learning_rate": 8.984779074922419e-06, | |
| "loss": 1.0036, | |
| "mean_token_accuracy": 0.7444213129580021, | |
| "num_tokens": 387391128.0, | |
| "step": 6160 | |
| }, | |
| { | |
| "entropy": 1.34616384729743, | |
| "epoch": 0.9118114308937082, | |
| "grad_norm": 0.11870578676462173, | |
| "learning_rate": 8.837003103295405e-06, | |
| "loss": 1.0254, | |
| "mean_token_accuracy": 0.7389769002795219, | |
| "num_tokens": 388027333.0, | |
| "step": 6170 | |
| }, | |
| { | |
| "entropy": 1.3144830591976642, | |
| "epoch": 0.9132892452063398, | |
| "grad_norm": 0.11620783060789108, | |
| "learning_rate": 8.689227131668392e-06, | |
| "loss": 0.9837, | |
| "mean_token_accuracy": 0.7497315384447575, | |
| "num_tokens": 388637565.0, | |
| "step": 6180 | |
| }, | |
| { | |
| "entropy": 1.3189754135906697, | |
| "epoch": 0.9147670595189714, | |
| "grad_norm": 0.12029609084129333, | |
| "learning_rate": 8.541451160041377e-06, | |
| "loss": 1.0037, | |
| "mean_token_accuracy": 0.7476396732032299, | |
| "num_tokens": 389268613.0, | |
| "step": 6190 | |
| }, | |
| { | |
| "entropy": 1.3421682931482792, | |
| "epoch": 0.916244873831603, | |
| "grad_norm": 0.14239317178726196, | |
| "learning_rate": 8.393675188414363e-06, | |
| "loss": 1.0176, | |
| "mean_token_accuracy": 0.741797874122858, | |
| "num_tokens": 389892611.0, | |
| "step": 6200 | |
| }, | |
| { | |
| "entropy": 1.322981870174408, | |
| "epoch": 0.9177226881442346, | |
| "grad_norm": 0.15327249467372894, | |
| "learning_rate": 8.24589921678735e-06, | |
| "loss": 1.0255, | |
| "mean_token_accuracy": 0.7384318143129349, | |
| "num_tokens": 390521207.0, | |
| "step": 6210 | |
| }, | |
| { | |
| "entropy": 1.3384942390024661, | |
| "epoch": 0.9192005024568662, | |
| "grad_norm": 0.12492629140615463, | |
| "learning_rate": 8.098123245160337e-06, | |
| "loss": 1.0238, | |
| "mean_token_accuracy": 0.7415454059839248, | |
| "num_tokens": 391153462.0, | |
| "step": 6220 | |
| }, | |
| { | |
| "entropy": 1.3131339251995087, | |
| "epoch": 0.920678316769498, | |
| "grad_norm": 0.12154535204172134, | |
| "learning_rate": 7.950347273533323e-06, | |
| "loss": 0.9874, | |
| "mean_token_accuracy": 0.7472625941038131, | |
| "num_tokens": 391788123.0, | |
| "step": 6230 | |
| }, | |
| { | |
| "entropy": 1.3672856733202934, | |
| "epoch": 0.9221561310821296, | |
| "grad_norm": 0.1145540326833725, | |
| "learning_rate": 7.80257130190631e-06, | |
| "loss": 1.0455, | |
| "mean_token_accuracy": 0.7358811512589455, | |
| "num_tokens": 392425329.0, | |
| "step": 6240 | |
| }, | |
| { | |
| "entropy": 1.326454308629036, | |
| "epoch": 0.9236339453947612, | |
| "grad_norm": 0.11543665081262589, | |
| "learning_rate": 7.654795330279296e-06, | |
| "loss": 1.0106, | |
| "mean_token_accuracy": 0.7414052963256836, | |
| "num_tokens": 393048401.0, | |
| "step": 6250 | |
| }, | |
| { | |
| "entropy": 1.315993483364582, | |
| "epoch": 0.9251117597073928, | |
| "grad_norm": 0.1304856389760971, | |
| "learning_rate": 7.507019358652284e-06, | |
| "loss": 0.9989, | |
| "mean_token_accuracy": 0.7430017247796059, | |
| "num_tokens": 393676756.0, | |
| "step": 6260 | |
| }, | |
| { | |
| "entropy": 1.3197014026343823, | |
| "epoch": 0.9265895740200244, | |
| "grad_norm": 0.11181900650262833, | |
| "learning_rate": 7.359243387025271e-06, | |
| "loss": 0.9951, | |
| "mean_token_accuracy": 0.7460963025689125, | |
| "num_tokens": 394309847.0, | |
| "step": 6270 | |
| }, | |
| { | |
| "entropy": 1.358003605902195, | |
| "epoch": 0.928067388332656, | |
| "grad_norm": 0.12269277125597, | |
| "learning_rate": 7.211467415398257e-06, | |
| "loss": 1.0359, | |
| "mean_token_accuracy": 0.7356663353741169, | |
| "num_tokens": 394936407.0, | |
| "step": 6280 | |
| }, | |
| { | |
| "entropy": 1.3280733123421669, | |
| "epoch": 0.9295452026452876, | |
| "grad_norm": 0.1313636302947998, | |
| "learning_rate": 7.063691443771243e-06, | |
| "loss": 0.9818, | |
| "mean_token_accuracy": 0.7464911125600338, | |
| "num_tokens": 395548910.0, | |
| "step": 6290 | |
| }, | |
| { | |
| "entropy": 1.3259168773889543, | |
| "epoch": 0.9310230169579192, | |
| "grad_norm": 0.1302233338356018, | |
| "learning_rate": 6.91591547214423e-06, | |
| "loss": 1.0413, | |
| "mean_token_accuracy": 0.7370544657111168, | |
| "num_tokens": 396165852.0, | |
| "step": 6300 | |
| }, | |
| { | |
| "entropy": 1.318706451356411, | |
| "epoch": 0.9325008312705508, | |
| "grad_norm": 0.11792853474617004, | |
| "learning_rate": 6.768139500517216e-06, | |
| "loss": 1.007, | |
| "mean_token_accuracy": 0.7420048147439957, | |
| "num_tokens": 396809254.0, | |
| "step": 6310 | |
| }, | |
| { | |
| "entropy": 1.2917353048920632, | |
| "epoch": 0.9339786455831824, | |
| "grad_norm": 0.12031566351652145, | |
| "learning_rate": 6.620363528890203e-06, | |
| "loss": 1.0291, | |
| "mean_token_accuracy": 0.7431467622518539, | |
| "num_tokens": 397438624.0, | |
| "step": 6320 | |
| }, | |
| { | |
| "entropy": 1.302623900771141, | |
| "epoch": 0.935456459895814, | |
| "grad_norm": 0.15024085342884064, | |
| "learning_rate": 6.472587557263189e-06, | |
| "loss": 0.96, | |
| "mean_token_accuracy": 0.7524841710925102, | |
| "num_tokens": 398058880.0, | |
| "step": 6330 | |
| }, | |
| { | |
| "entropy": 1.3265319362282753, | |
| "epoch": 0.9369342742084457, | |
| "grad_norm": 0.1818179488182068, | |
| "learning_rate": 6.324811585636176e-06, | |
| "loss": 0.9912, | |
| "mean_token_accuracy": 0.7462624236941338, | |
| "num_tokens": 398684141.0, | |
| "step": 6340 | |
| }, | |
| { | |
| "entropy": 1.3446454957127572, | |
| "epoch": 0.9384120885210774, | |
| "grad_norm": 0.12499760836362839, | |
| "learning_rate": 6.1770356140091625e-06, | |
| "loss": 1.0382, | |
| "mean_token_accuracy": 0.7400866918265819, | |
| "num_tokens": 399325710.0, | |
| "step": 6350 | |
| }, | |
| { | |
| "entropy": 1.3342131525278091, | |
| "epoch": 0.939889902833709, | |
| "grad_norm": 0.1248583048582077, | |
| "learning_rate": 6.029259642382149e-06, | |
| "loss": 1.0107, | |
| "mean_token_accuracy": 0.744459693133831, | |
| "num_tokens": 399955089.0, | |
| "step": 6360 | |
| }, | |
| { | |
| "entropy": 1.3489103883504867, | |
| "epoch": 0.9413677171463406, | |
| "grad_norm": 0.1461644023656845, | |
| "learning_rate": 5.881483670755136e-06, | |
| "loss": 1.0282, | |
| "mean_token_accuracy": 0.7392531536519528, | |
| "num_tokens": 400551267.0, | |
| "step": 6370 | |
| }, | |
| { | |
| "entropy": 1.3305791199207306, | |
| "epoch": 0.9428455314589722, | |
| "grad_norm": 0.14220687747001648, | |
| "learning_rate": 5.733707699128122e-06, | |
| "loss": 0.996, | |
| "mean_token_accuracy": 0.7464814051985741, | |
| "num_tokens": 401184838.0, | |
| "step": 6380 | |
| }, | |
| { | |
| "entropy": 1.3437370270490647, | |
| "epoch": 0.9443233457716038, | |
| "grad_norm": 0.1341477781534195, | |
| "learning_rate": 5.585931727501109e-06, | |
| "loss": 1.057, | |
| "mean_token_accuracy": 0.733926995843649, | |
| "num_tokens": 401844712.0, | |
| "step": 6390 | |
| }, | |
| { | |
| "entropy": 1.3399671465158463, | |
| "epoch": 0.9458011600842354, | |
| "grad_norm": 0.15581178665161133, | |
| "learning_rate": 5.438155755874095e-06, | |
| "loss": 1.0176, | |
| "mean_token_accuracy": 0.7400895021855831, | |
| "num_tokens": 402467237.0, | |
| "step": 6400 | |
| }, | |
| { | |
| "entropy": 1.3379587285220622, | |
| "epoch": 0.947278974396867, | |
| "grad_norm": 0.12707367539405823, | |
| "learning_rate": 5.290379784247081e-06, | |
| "loss": 1.0414, | |
| "mean_token_accuracy": 0.7374955870211124, | |
| "num_tokens": 403090540.0, | |
| "step": 6410 | |
| }, | |
| { | |
| "entropy": 1.2975156359374522, | |
| "epoch": 0.9487567887094986, | |
| "grad_norm": 0.14274674654006958, | |
| "learning_rate": 5.142603812620068e-06, | |
| "loss": 0.9858, | |
| "mean_token_accuracy": 0.746936984360218, | |
| "num_tokens": 403728117.0, | |
| "step": 6420 | |
| }, | |
| { | |
| "entropy": 1.3399316541850568, | |
| "epoch": 0.9502346030221303, | |
| "grad_norm": 0.11993175745010376, | |
| "learning_rate": 4.994827840993055e-06, | |
| "loss": 1.0539, | |
| "mean_token_accuracy": 0.7339481048285961, | |
| "num_tokens": 404362378.0, | |
| "step": 6430 | |
| }, | |
| { | |
| "entropy": 1.3567871250212193, | |
| "epoch": 0.9517124173347619, | |
| "grad_norm": 0.13137640058994293, | |
| "learning_rate": 4.847051869366041e-06, | |
| "loss": 1.0134, | |
| "mean_token_accuracy": 0.7401178866624832, | |
| "num_tokens": 404968979.0, | |
| "step": 6440 | |
| }, | |
| { | |
| "entropy": 1.2970522359013557, | |
| "epoch": 0.9531902316473935, | |
| "grad_norm": 0.1552589386701584, | |
| "learning_rate": 4.699275897739028e-06, | |
| "loss": 1.0104, | |
| "mean_token_accuracy": 0.7441655330359935, | |
| "num_tokens": 405603503.0, | |
| "step": 6450 | |
| }, | |
| { | |
| "entropy": 1.3546797879040242, | |
| "epoch": 0.9546680459600251, | |
| "grad_norm": 0.14361603558063507, | |
| "learning_rate": 4.5514999261120145e-06, | |
| "loss": 1.032, | |
| "mean_token_accuracy": 0.7376946985721589, | |
| "num_tokens": 406213712.0, | |
| "step": 6460 | |
| }, | |
| { | |
| "entropy": 1.3317971237003803, | |
| "epoch": 0.9561458602726567, | |
| "grad_norm": 0.13018253445625305, | |
| "learning_rate": 4.403723954485001e-06, | |
| "loss": 1.023, | |
| "mean_token_accuracy": 0.7395760633051396, | |
| "num_tokens": 406839355.0, | |
| "step": 6470 | |
| }, | |
| { | |
| "entropy": 1.320752915740013, | |
| "epoch": 0.9576236745852884, | |
| "grad_norm": 0.14429272711277008, | |
| "learning_rate": 4.255947982857988e-06, | |
| "loss": 1.0303, | |
| "mean_token_accuracy": 0.7379327312111854, | |
| "num_tokens": 407463490.0, | |
| "step": 6480 | |
| }, | |
| { | |
| "entropy": 1.3293151132762433, | |
| "epoch": 0.95910148889792, | |
| "grad_norm": 0.14717073738574982, | |
| "learning_rate": 4.108172011230974e-06, | |
| "loss": 1.0349, | |
| "mean_token_accuracy": 0.7367990806698799, | |
| "num_tokens": 408097068.0, | |
| "step": 6490 | |
| }, | |
| { | |
| "entropy": 1.331135530769825, | |
| "epoch": 0.9605793032105516, | |
| "grad_norm": 0.11680871248245239, | |
| "learning_rate": 3.960396039603961e-06, | |
| "loss": 0.9621, | |
| "mean_token_accuracy": 0.7536611042916774, | |
| "num_tokens": 408727501.0, | |
| "step": 6500 | |
| }, | |
| { | |
| "entropy": 1.3335068613290786, | |
| "epoch": 0.9620571175231832, | |
| "grad_norm": 0.12730862200260162, | |
| "learning_rate": 3.8126200679769472e-06, | |
| "loss": 1.0009, | |
| "mean_token_accuracy": 0.7442542344331742, | |
| "num_tokens": 409342096.0, | |
| "step": 6510 | |
| }, | |
| { | |
| "entropy": 1.3465422734618187, | |
| "epoch": 0.9635349318358148, | |
| "grad_norm": 0.12591826915740967, | |
| "learning_rate": 3.6648440963499334e-06, | |
| "loss": 1.0322, | |
| "mean_token_accuracy": 0.7379855334758758, | |
| "num_tokens": 409962385.0, | |
| "step": 6520 | |
| }, | |
| { | |
| "entropy": 1.3209969684481622, | |
| "epoch": 0.9650127461484465, | |
| "grad_norm": 0.15221069753170013, | |
| "learning_rate": 3.51706812472292e-06, | |
| "loss": 1.0181, | |
| "mean_token_accuracy": 0.7421333439648151, | |
| "num_tokens": 410586430.0, | |
| "step": 6530 | |
| }, | |
| { | |
| "entropy": 1.3481736958026886, | |
| "epoch": 0.9664905604610781, | |
| "grad_norm": 0.13732363283634186, | |
| "learning_rate": 3.369292153095907e-06, | |
| "loss": 1.0244, | |
| "mean_token_accuracy": 0.7434548750519753, | |
| "num_tokens": 411223657.0, | |
| "step": 6540 | |
| }, | |
| { | |
| "entropy": 1.3392292201519012, | |
| "epoch": 0.9679683747737097, | |
| "grad_norm": 0.12541285157203674, | |
| "learning_rate": 3.2215161814688934e-06, | |
| "loss": 1.0192, | |
| "mean_token_accuracy": 0.7393275678157807, | |
| "num_tokens": 411859272.0, | |
| "step": 6550 | |
| }, | |
| { | |
| "entropy": 1.3101726002991199, | |
| "epoch": 0.9694461890863413, | |
| "grad_norm": 0.10930298268795013, | |
| "learning_rate": 3.07374020984188e-06, | |
| "loss": 1.0097, | |
| "mean_token_accuracy": 0.7414973556995392, | |
| "num_tokens": 412496331.0, | |
| "step": 6560 | |
| }, | |
| { | |
| "entropy": 1.3522985130548477, | |
| "epoch": 0.9709240033989729, | |
| "grad_norm": 0.13447479903697968, | |
| "learning_rate": 2.9259642382148665e-06, | |
| "loss": 1.0346, | |
| "mean_token_accuracy": 0.73828229829669, | |
| "num_tokens": 413120546.0, | |
| "step": 6570 | |
| }, | |
| { | |
| "entropy": 1.2919812560081483, | |
| "epoch": 0.9724018177116045, | |
| "grad_norm": 0.14952851831912994, | |
| "learning_rate": 2.7781882665878527e-06, | |
| "loss": 0.9998, | |
| "mean_token_accuracy": 0.7462430857121944, | |
| "num_tokens": 413742172.0, | |
| "step": 6580 | |
| }, | |
| { | |
| "entropy": 1.3318934828042983, | |
| "epoch": 0.9738796320242361, | |
| "grad_norm": 0.11794450879096985, | |
| "learning_rate": 2.6304122949608396e-06, | |
| "loss": 0.9887, | |
| "mean_token_accuracy": 0.7482388496398926, | |
| "num_tokens": 414377151.0, | |
| "step": 6590 | |
| }, | |
| { | |
| "entropy": 1.3362335205078124, | |
| "epoch": 0.9753574463368677, | |
| "grad_norm": 0.12264854460954666, | |
| "learning_rate": 2.482636323333826e-06, | |
| "loss": 1.0208, | |
| "mean_token_accuracy": 0.7401559479534626, | |
| "num_tokens": 415003989.0, | |
| "step": 6600 | |
| }, | |
| { | |
| "entropy": 1.3305308662354947, | |
| "epoch": 0.9768352606494994, | |
| "grad_norm": 0.12668278813362122, | |
| "learning_rate": 2.3348603517068123e-06, | |
| "loss": 1.0175, | |
| "mean_token_accuracy": 0.7412903062999249, | |
| "num_tokens": 415627030.0, | |
| "step": 6610 | |
| }, | |
| { | |
| "entropy": 1.3603860966861248, | |
| "epoch": 0.978313074962131, | |
| "grad_norm": 0.1706349104642868, | |
| "learning_rate": 2.1870843800797993e-06, | |
| "loss": 1.0188, | |
| "mean_token_accuracy": 0.7400363579392433, | |
| "num_tokens": 416249214.0, | |
| "step": 6620 | |
| }, | |
| { | |
| "entropy": 1.2988179348409177, | |
| "epoch": 0.9797908892747627, | |
| "grad_norm": 0.1084231287240982, | |
| "learning_rate": 2.039308408452786e-06, | |
| "loss": 0.9846, | |
| "mean_token_accuracy": 0.7490782260894775, | |
| "num_tokens": 416888232.0, | |
| "step": 6630 | |
| }, | |
| { | |
| "entropy": 1.3416281372308732, | |
| "epoch": 0.9812687035873943, | |
| "grad_norm": 0.12165848165750504, | |
| "learning_rate": 1.8915324368257721e-06, | |
| "loss": 1.0264, | |
| "mean_token_accuracy": 0.7411201991140842, | |
| "num_tokens": 417532769.0, | |
| "step": 6640 | |
| }, | |
| { | |
| "entropy": 1.3082506984472275, | |
| "epoch": 0.9827465179000259, | |
| "grad_norm": 0.13222621381282806, | |
| "learning_rate": 1.743756465198759e-06, | |
| "loss": 1.0191, | |
| "mean_token_accuracy": 0.7411255031824112, | |
| "num_tokens": 418139140.0, | |
| "step": 6650 | |
| }, | |
| { | |
| "entropy": 1.3012041598558426, | |
| "epoch": 0.9842243322126575, | |
| "grad_norm": 0.11624795943498611, | |
| "learning_rate": 1.5959804935717452e-06, | |
| "loss": 0.9675, | |
| "mean_token_accuracy": 0.7475118458271026, | |
| "num_tokens": 418779044.0, | |
| "step": 6660 | |
| }, | |
| { | |
| "entropy": 1.3229439944028853, | |
| "epoch": 0.9857021465252891, | |
| "grad_norm": 0.11832401156425476, | |
| "learning_rate": 1.448204521944732e-06, | |
| "loss": 1.0234, | |
| "mean_token_accuracy": 0.7409940011799335, | |
| "num_tokens": 419402275.0, | |
| "step": 6670 | |
| }, | |
| { | |
| "entropy": 1.3145242296159267, | |
| "epoch": 0.9871799608379207, | |
| "grad_norm": 0.1508401483297348, | |
| "learning_rate": 1.3004285503177183e-06, | |
| "loss": 1.0033, | |
| "mean_token_accuracy": 0.7469310745596885, | |
| "num_tokens": 420035670.0, | |
| "step": 6680 | |
| }, | |
| { | |
| "entropy": 1.3349422916769982, | |
| "epoch": 0.9886577751505523, | |
| "grad_norm": 0.11081361770629883, | |
| "learning_rate": 1.1526525786907049e-06, | |
| "loss": 1.0172, | |
| "mean_token_accuracy": 0.7441619426012039, | |
| "num_tokens": 420664552.0, | |
| "step": 6690 | |
| }, | |
| { | |
| "entropy": 1.3269589990377426, | |
| "epoch": 0.9901355894631839, | |
| "grad_norm": 0.12207167595624924, | |
| "learning_rate": 1.0048766070636914e-06, | |
| "loss": 0.9956, | |
| "mean_token_accuracy": 0.7472774274647236, | |
| "num_tokens": 421282279.0, | |
| "step": 6700 | |
| }, | |
| { | |
| "entropy": 1.333425833284855, | |
| "epoch": 0.9916134037758155, | |
| "grad_norm": 0.13097155094146729, | |
| "learning_rate": 8.57100635436678e-07, | |
| "loss": 1.0249, | |
| "mean_token_accuracy": 0.7411559447646141, | |
| "num_tokens": 421937485.0, | |
| "step": 6710 | |
| }, | |
| { | |
| "entropy": 1.3138896457850933, | |
| "epoch": 0.9930912180884471, | |
| "grad_norm": 0.13285258412361145, | |
| "learning_rate": 7.093246638096645e-07, | |
| "loss": 0.9895, | |
| "mean_token_accuracy": 0.7485101237893105, | |
| "num_tokens": 422571737.0, | |
| "step": 6720 | |
| }, | |
| { | |
| "entropy": 1.3141452640295028, | |
| "epoch": 0.9945690324010789, | |
| "grad_norm": 0.13225366175174713, | |
| "learning_rate": 5.615486921826512e-07, | |
| "loss": 0.997, | |
| "mean_token_accuracy": 0.7434104166924953, | |
| "num_tokens": 423175530.0, | |
| "step": 6730 | |
| }, | |
| { | |
| "entropy": 1.3531743980944158, | |
| "epoch": 0.9960468467137105, | |
| "grad_norm": 0.1212967187166214, | |
| "learning_rate": 4.137727205556377e-07, | |
| "loss": 1.0355, | |
| "mean_token_accuracy": 0.7384961448609829, | |
| "num_tokens": 423790165.0, | |
| "step": 6740 | |
| }, | |
| { | |
| "entropy": 1.3025728791952134, | |
| "epoch": 0.9975246610263421, | |
| "grad_norm": 0.11449871957302094, | |
| "learning_rate": 2.659967489286242e-07, | |
| "loss": 0.9571, | |
| "mean_token_accuracy": 0.7524913243949414, | |
| "num_tokens": 424454409.0, | |
| "step": 6750 | |
| }, | |
| { | |
| "entropy": 1.3502368345856666, | |
| "epoch": 0.9990024753389737, | |
| "grad_norm": 0.12098908424377441, | |
| "learning_rate": 1.1822077730161076e-07, | |
| "loss": 1.014, | |
| "mean_token_accuracy": 0.7402893081307411, | |
| "num_tokens": 425085104.0, | |
| "step": 6760 | |
| }, | |
| { | |
| "entropy": 1.3184739925243236, | |
| "epoch": 1.0, | |
| "mean_token_accuracy": 0.742160533313398, | |
| "num_tokens": 425500240.0, | |
| "step": 6767, | |
| "total_flos": 5.682410639176237e+18, | |
| "train_loss": 1.024258090594644, | |
| "train_runtime": 7062.5815, | |
| "train_samples_per_second": 122.638, | |
| "train_steps_per_second": 0.958 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 6767, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 1, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 5.682410639176237e+18, | |
| "train_batch_size": 4, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |