Text Generation
Transformers
Safetensors
qwen2_moe
Generated from Trainer
open-r1
trl
sft
conversational
Instructions to use HectorHe/Qwen1.5-MOE-aux-free-sft-math7k-1e-4-gamma-3epoch with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use HectorHe/Qwen1.5-MOE-aux-free-sft-math7k-1e-4-gamma-3epoch with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="HectorHe/Qwen1.5-MOE-aux-free-sft-math7k-1e-4-gamma-3epoch") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoTokenizer, AutoModelForCausalLM tokenizer = AutoTokenizer.from_pretrained("HectorHe/Qwen1.5-MOE-aux-free-sft-math7k-1e-4-gamma-3epoch") model = AutoModelForCausalLM.from_pretrained("HectorHe/Qwen1.5-MOE-aux-free-sft-math7k-1e-4-gamma-3epoch", device_map="auto") messages = [ {"role": "user", "content": "Who are you?"}, ] inputs = tokenizer.apply_chat_template( messages, add_generation_prompt=True, tokenize=True, return_dict=True, return_tensors="pt", ).to(model.device) outputs = model.generate(**inputs, max_new_tokens=40) print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:])) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use HectorHe/Qwen1.5-MOE-aux-free-sft-math7k-1e-4-gamma-3epoch with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "HectorHe/Qwen1.5-MOE-aux-free-sft-math7k-1e-4-gamma-3epoch" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "HectorHe/Qwen1.5-MOE-aux-free-sft-math7k-1e-4-gamma-3epoch", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/HectorHe/Qwen1.5-MOE-aux-free-sft-math7k-1e-4-gamma-3epoch
- SGLang
How to use HectorHe/Qwen1.5-MOE-aux-free-sft-math7k-1e-4-gamma-3epoch with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "HectorHe/Qwen1.5-MOE-aux-free-sft-math7k-1e-4-gamma-3epoch" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "HectorHe/Qwen1.5-MOE-aux-free-sft-math7k-1e-4-gamma-3epoch", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "HectorHe/Qwen1.5-MOE-aux-free-sft-math7k-1e-4-gamma-3epoch" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "HectorHe/Qwen1.5-MOE-aux-free-sft-math7k-1e-4-gamma-3epoch", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use HectorHe/Qwen1.5-MOE-aux-free-sft-math7k-1e-4-gamma-3epoch with Docker Model Runner:
docker model run hf.co/HectorHe/Qwen1.5-MOE-aux-free-sft-math7k-1e-4-gamma-3epoch
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 3.0, | |
| "eval_steps": 500, | |
| "global_step": 645, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.004651162790697674, | |
| "grad_norm": 19.568607330322266, | |
| "learning_rate": 0.0, | |
| "loss": 0.842, | |
| "mean_token_accuracy": 0.8234314918518066, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 0.009302325581395349, | |
| "grad_norm": 21.537723541259766, | |
| "learning_rate": 1.5384615384615387e-07, | |
| "loss": 0.8778, | |
| "mean_token_accuracy": 0.8231534361839294, | |
| "step": 2 | |
| }, | |
| { | |
| "epoch": 0.013953488372093023, | |
| "grad_norm": 19.284854888916016, | |
| "learning_rate": 3.0769230769230774e-07, | |
| "loss": 0.8509, | |
| "mean_token_accuracy": 0.8327401876449585, | |
| "step": 3 | |
| }, | |
| { | |
| "epoch": 0.018604651162790697, | |
| "grad_norm": 18.94418716430664, | |
| "learning_rate": 4.615384615384616e-07, | |
| "loss": 0.8236, | |
| "mean_token_accuracy": 0.8300436735153198, | |
| "step": 4 | |
| }, | |
| { | |
| "epoch": 0.023255813953488372, | |
| "grad_norm": 22.949390411376953, | |
| "learning_rate": 6.153846153846155e-07, | |
| "loss": 0.9618, | |
| "mean_token_accuracy": 0.8052875399589539, | |
| "step": 5 | |
| }, | |
| { | |
| "epoch": 0.027906976744186046, | |
| "grad_norm": 22.52558135986328, | |
| "learning_rate": 7.692307692307694e-07, | |
| "loss": 0.8629, | |
| "mean_token_accuracy": 0.8194347620010376, | |
| "step": 6 | |
| }, | |
| { | |
| "epoch": 0.03255813953488372, | |
| "grad_norm": 21.534772872924805, | |
| "learning_rate": 9.230769230769232e-07, | |
| "loss": 0.9071, | |
| "mean_token_accuracy": 0.8167065978050232, | |
| "step": 7 | |
| }, | |
| { | |
| "epoch": 0.037209302325581395, | |
| "grad_norm": 15.813007354736328, | |
| "learning_rate": 1.076923076923077e-06, | |
| "loss": 0.8068, | |
| "mean_token_accuracy": 0.8270938992500305, | |
| "step": 8 | |
| }, | |
| { | |
| "epoch": 0.04186046511627907, | |
| "grad_norm": 14.425293922424316, | |
| "learning_rate": 1.230769230769231e-06, | |
| "loss": 0.7203, | |
| "mean_token_accuracy": 0.8420020937919617, | |
| "step": 9 | |
| }, | |
| { | |
| "epoch": 0.046511627906976744, | |
| "grad_norm": 15.85297966003418, | |
| "learning_rate": 1.3846153846153848e-06, | |
| "loss": 0.7537, | |
| "mean_token_accuracy": 0.8397467732429504, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.05116279069767442, | |
| "grad_norm": 15.877695083618164, | |
| "learning_rate": 1.5384615384615387e-06, | |
| "loss": 0.7201, | |
| "mean_token_accuracy": 0.8532203435897827, | |
| "step": 11 | |
| }, | |
| { | |
| "epoch": 0.05581395348837209, | |
| "grad_norm": 11.435991287231445, | |
| "learning_rate": 1.6923076923076926e-06, | |
| "loss": 0.6885, | |
| "mean_token_accuracy": 0.8493710160255432, | |
| "step": 12 | |
| }, | |
| { | |
| "epoch": 0.06046511627906977, | |
| "grad_norm": 11.014802932739258, | |
| "learning_rate": 1.8461538461538465e-06, | |
| "loss": 0.6633, | |
| "mean_token_accuracy": 0.8415761590003967, | |
| "step": 13 | |
| }, | |
| { | |
| "epoch": 0.06511627906976744, | |
| "grad_norm": 9.7716064453125, | |
| "learning_rate": 2.0000000000000003e-06, | |
| "loss": 0.6095, | |
| "mean_token_accuracy": 0.8588042855262756, | |
| "step": 14 | |
| }, | |
| { | |
| "epoch": 0.06976744186046512, | |
| "grad_norm": 9.165430068969727, | |
| "learning_rate": 2.153846153846154e-06, | |
| "loss": 0.5607, | |
| "mean_token_accuracy": 0.8693761229515076, | |
| "step": 15 | |
| }, | |
| { | |
| "epoch": 0.07441860465116279, | |
| "grad_norm": 10.080243110656738, | |
| "learning_rate": 2.307692307692308e-06, | |
| "loss": 0.5113, | |
| "mean_token_accuracy": 0.8672978281974792, | |
| "step": 16 | |
| }, | |
| { | |
| "epoch": 0.07906976744186046, | |
| "grad_norm": 10.527639389038086, | |
| "learning_rate": 2.461538461538462e-06, | |
| "loss": 0.4415, | |
| "mean_token_accuracy": 0.8862723708152771, | |
| "step": 17 | |
| }, | |
| { | |
| "epoch": 0.08372093023255814, | |
| "grad_norm": 7.268032073974609, | |
| "learning_rate": 2.615384615384616e-06, | |
| "loss": 0.4505, | |
| "mean_token_accuracy": 0.8736571073532104, | |
| "step": 18 | |
| }, | |
| { | |
| "epoch": 0.08837209302325581, | |
| "grad_norm": 7.092712879180908, | |
| "learning_rate": 2.7692307692307697e-06, | |
| "loss": 0.4496, | |
| "mean_token_accuracy": 0.8755980730056763, | |
| "step": 19 | |
| }, | |
| { | |
| "epoch": 0.09302325581395349, | |
| "grad_norm": 4.317747592926025, | |
| "learning_rate": 2.9230769230769236e-06, | |
| "loss": 0.3947, | |
| "mean_token_accuracy": 0.8856920599937439, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.09767441860465116, | |
| "grad_norm": 4.245256423950195, | |
| "learning_rate": 3.0769230769230774e-06, | |
| "loss": 0.4397, | |
| "mean_token_accuracy": 0.8684402108192444, | |
| "step": 21 | |
| }, | |
| { | |
| "epoch": 0.10232558139534884, | |
| "grad_norm": 3.8611507415771484, | |
| "learning_rate": 3.2307692307692313e-06, | |
| "loss": 0.3792, | |
| "mean_token_accuracy": 0.8823331594467163, | |
| "step": 22 | |
| }, | |
| { | |
| "epoch": 0.10697674418604651, | |
| "grad_norm": 4.211703300476074, | |
| "learning_rate": 3.384615384615385e-06, | |
| "loss": 0.3552, | |
| "mean_token_accuracy": 0.8943809270858765, | |
| "step": 23 | |
| }, | |
| { | |
| "epoch": 0.11162790697674418, | |
| "grad_norm": 3.5800399780273438, | |
| "learning_rate": 3.538461538461539e-06, | |
| "loss": 0.3806, | |
| "mean_token_accuracy": 0.8816819787025452, | |
| "step": 24 | |
| }, | |
| { | |
| "epoch": 0.11627906976744186, | |
| "grad_norm": 3.5746443271636963, | |
| "learning_rate": 3.692307692307693e-06, | |
| "loss": 0.3583, | |
| "mean_token_accuracy": 0.8919854164123535, | |
| "step": 25 | |
| }, | |
| { | |
| "epoch": 0.12093023255813953, | |
| "grad_norm": 3.409257411956787, | |
| "learning_rate": 3.846153846153847e-06, | |
| "loss": 0.343, | |
| "mean_token_accuracy": 0.8980305790901184, | |
| "step": 26 | |
| }, | |
| { | |
| "epoch": 0.12558139534883722, | |
| "grad_norm": 3.196232318878174, | |
| "learning_rate": 4.000000000000001e-06, | |
| "loss": 0.3653, | |
| "mean_token_accuracy": 0.8912448883056641, | |
| "step": 27 | |
| }, | |
| { | |
| "epoch": 0.13023255813953488, | |
| "grad_norm": 3.6028528213500977, | |
| "learning_rate": 4.1538461538461545e-06, | |
| "loss": 0.3653, | |
| "mean_token_accuracy": 0.8908067345619202, | |
| "step": 28 | |
| }, | |
| { | |
| "epoch": 0.13488372093023257, | |
| "grad_norm": 3.0673670768737793, | |
| "learning_rate": 4.307692307692308e-06, | |
| "loss": 0.3824, | |
| "mean_token_accuracy": 0.8820690512657166, | |
| "step": 29 | |
| }, | |
| { | |
| "epoch": 0.13953488372093023, | |
| "grad_norm": 3.353994369506836, | |
| "learning_rate": 4.461538461538462e-06, | |
| "loss": 0.3762, | |
| "mean_token_accuracy": 0.881018877029419, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.14418604651162792, | |
| "grad_norm": 3.5132193565368652, | |
| "learning_rate": 4.615384615384616e-06, | |
| "loss": 0.3993, | |
| "mean_token_accuracy": 0.8744673132896423, | |
| "step": 31 | |
| }, | |
| { | |
| "epoch": 0.14883720930232558, | |
| "grad_norm": 3.0335817337036133, | |
| "learning_rate": 4.76923076923077e-06, | |
| "loss": 0.3241, | |
| "mean_token_accuracy": 0.8991076350212097, | |
| "step": 32 | |
| }, | |
| { | |
| "epoch": 0.15348837209302327, | |
| "grad_norm": 3.8447790145874023, | |
| "learning_rate": 4.923076923076924e-06, | |
| "loss": 0.356, | |
| "mean_token_accuracy": 0.8917796015739441, | |
| "step": 33 | |
| }, | |
| { | |
| "epoch": 0.15813953488372093, | |
| "grad_norm": 2.874586820602417, | |
| "learning_rate": 5.076923076923077e-06, | |
| "loss": 0.3098, | |
| "mean_token_accuracy": 0.903138279914856, | |
| "step": 34 | |
| }, | |
| { | |
| "epoch": 0.16279069767441862, | |
| "grad_norm": 3.0539486408233643, | |
| "learning_rate": 5.230769230769232e-06, | |
| "loss": 0.3544, | |
| "mean_token_accuracy": 0.8905218243598938, | |
| "step": 35 | |
| }, | |
| { | |
| "epoch": 0.16744186046511628, | |
| "grad_norm": 2.976952314376831, | |
| "learning_rate": 5.384615384615385e-06, | |
| "loss": 0.3361, | |
| "mean_token_accuracy": 0.8934714198112488, | |
| "step": 36 | |
| }, | |
| { | |
| "epoch": 0.17209302325581396, | |
| "grad_norm": 3.0622878074645996, | |
| "learning_rate": 5.538461538461539e-06, | |
| "loss": 0.3236, | |
| "mean_token_accuracy": 0.8999074697494507, | |
| "step": 37 | |
| }, | |
| { | |
| "epoch": 0.17674418604651163, | |
| "grad_norm": 3.257957935333252, | |
| "learning_rate": 5.692307692307692e-06, | |
| "loss": 0.343, | |
| "mean_token_accuracy": 0.8923910856246948, | |
| "step": 38 | |
| }, | |
| { | |
| "epoch": 0.1813953488372093, | |
| "grad_norm": 3.007553815841675, | |
| "learning_rate": 5.846153846153847e-06, | |
| "loss": 0.3164, | |
| "mean_token_accuracy": 0.9010202288627625, | |
| "step": 39 | |
| }, | |
| { | |
| "epoch": 0.18604651162790697, | |
| "grad_norm": 2.944952964782715, | |
| "learning_rate": 6e-06, | |
| "loss": 0.3467, | |
| "mean_token_accuracy": 0.8913513422012329, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.19069767441860466, | |
| "grad_norm": 2.9425339698791504, | |
| "learning_rate": 6.153846153846155e-06, | |
| "loss": 0.338, | |
| "mean_token_accuracy": 0.9000540375709534, | |
| "step": 41 | |
| }, | |
| { | |
| "epoch": 0.19534883720930232, | |
| "grad_norm": 3.1975269317626953, | |
| "learning_rate": 6.307692307692308e-06, | |
| "loss": 0.3408, | |
| "mean_token_accuracy": 0.898595929145813, | |
| "step": 42 | |
| }, | |
| { | |
| "epoch": 0.2, | |
| "grad_norm": 3.0284111499786377, | |
| "learning_rate": 6.461538461538463e-06, | |
| "loss": 0.3112, | |
| "mean_token_accuracy": 0.9032689929008484, | |
| "step": 43 | |
| }, | |
| { | |
| "epoch": 0.20465116279069767, | |
| "grad_norm": 2.8465347290039062, | |
| "learning_rate": 6.615384615384616e-06, | |
| "loss": 0.3387, | |
| "mean_token_accuracy": 0.9016018509864807, | |
| "step": 44 | |
| }, | |
| { | |
| "epoch": 0.20930232558139536, | |
| "grad_norm": 3.0937321186065674, | |
| "learning_rate": 6.76923076923077e-06, | |
| "loss": 0.3037, | |
| "mean_token_accuracy": 0.906658947467804, | |
| "step": 45 | |
| }, | |
| { | |
| "epoch": 0.21395348837209302, | |
| "grad_norm": 2.862903118133545, | |
| "learning_rate": 6.923076923076923e-06, | |
| "loss": 0.3115, | |
| "mean_token_accuracy": 0.9050519466400146, | |
| "step": 46 | |
| }, | |
| { | |
| "epoch": 0.2186046511627907, | |
| "grad_norm": 2.914771318435669, | |
| "learning_rate": 7.076923076923078e-06, | |
| "loss": 0.317, | |
| "mean_token_accuracy": 0.9020901918411255, | |
| "step": 47 | |
| }, | |
| { | |
| "epoch": 0.22325581395348837, | |
| "grad_norm": 2.9237124919891357, | |
| "learning_rate": 7.230769230769231e-06, | |
| "loss": 0.3292, | |
| "mean_token_accuracy": 0.9041584730148315, | |
| "step": 48 | |
| }, | |
| { | |
| "epoch": 0.22790697674418606, | |
| "grad_norm": 2.9312398433685303, | |
| "learning_rate": 7.384615384615386e-06, | |
| "loss": 0.3202, | |
| "mean_token_accuracy": 0.9016806483268738, | |
| "step": 49 | |
| }, | |
| { | |
| "epoch": 0.23255813953488372, | |
| "grad_norm": 2.9532058238983154, | |
| "learning_rate": 7.538461538461539e-06, | |
| "loss": 0.3293, | |
| "mean_token_accuracy": 0.9001582264900208, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.2372093023255814, | |
| "grad_norm": 3.0990428924560547, | |
| "learning_rate": 7.692307692307694e-06, | |
| "loss": 0.3411, | |
| "mean_token_accuracy": 0.8866774439811707, | |
| "step": 51 | |
| }, | |
| { | |
| "epoch": 0.24186046511627907, | |
| "grad_norm": 2.87052059173584, | |
| "learning_rate": 7.846153846153847e-06, | |
| "loss": 0.3395, | |
| "mean_token_accuracy": 0.8905250430107117, | |
| "step": 52 | |
| }, | |
| { | |
| "epoch": 0.24651162790697675, | |
| "grad_norm": 3.011493682861328, | |
| "learning_rate": 8.000000000000001e-06, | |
| "loss": 0.3261, | |
| "mean_token_accuracy": 0.899782121181488, | |
| "step": 53 | |
| }, | |
| { | |
| "epoch": 0.25116279069767444, | |
| "grad_norm": 2.943223237991333, | |
| "learning_rate": 8.153846153846154e-06, | |
| "loss": 0.3414, | |
| "mean_token_accuracy": 0.8933002352714539, | |
| "step": 54 | |
| }, | |
| { | |
| "epoch": 0.2558139534883721, | |
| "grad_norm": 2.8687915802001953, | |
| "learning_rate": 8.307692307692309e-06, | |
| "loss": 0.3425, | |
| "mean_token_accuracy": 0.8924914598464966, | |
| "step": 55 | |
| }, | |
| { | |
| "epoch": 0.26046511627906976, | |
| "grad_norm": 2.947930335998535, | |
| "learning_rate": 8.461538461538462e-06, | |
| "loss": 0.3338, | |
| "mean_token_accuracy": 0.8992005586624146, | |
| "step": 56 | |
| }, | |
| { | |
| "epoch": 0.2651162790697674, | |
| "grad_norm": 2.625805616378784, | |
| "learning_rate": 8.615384615384617e-06, | |
| "loss": 0.2921, | |
| "mean_token_accuracy": 0.9067084193229675, | |
| "step": 57 | |
| }, | |
| { | |
| "epoch": 0.26976744186046514, | |
| "grad_norm": 2.7415740489959717, | |
| "learning_rate": 8.76923076923077e-06, | |
| "loss": 0.3208, | |
| "mean_token_accuracy": 0.8967901468276978, | |
| "step": 58 | |
| }, | |
| { | |
| "epoch": 0.2744186046511628, | |
| "grad_norm": 3.0610153675079346, | |
| "learning_rate": 8.923076923076925e-06, | |
| "loss": 0.3079, | |
| "mean_token_accuracy": 0.9053909182548523, | |
| "step": 59 | |
| }, | |
| { | |
| "epoch": 0.27906976744186046, | |
| "grad_norm": 2.8837437629699707, | |
| "learning_rate": 9.076923076923078e-06, | |
| "loss": 0.3223, | |
| "mean_token_accuracy": 0.8960626721382141, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.2837209302325581, | |
| "grad_norm": 3.0495381355285645, | |
| "learning_rate": 9.230769230769232e-06, | |
| "loss": 0.3543, | |
| "mean_token_accuracy": 0.8843302726745605, | |
| "step": 61 | |
| }, | |
| { | |
| "epoch": 0.28837209302325584, | |
| "grad_norm": 3.0705480575561523, | |
| "learning_rate": 9.384615384615385e-06, | |
| "loss": 0.3536, | |
| "mean_token_accuracy": 0.8863232731819153, | |
| "step": 62 | |
| }, | |
| { | |
| "epoch": 0.2930232558139535, | |
| "grad_norm": 2.8244340419769287, | |
| "learning_rate": 9.53846153846154e-06, | |
| "loss": 0.3214, | |
| "mean_token_accuracy": 0.900137722492218, | |
| "step": 63 | |
| }, | |
| { | |
| "epoch": 0.29767441860465116, | |
| "grad_norm": 2.8263750076293945, | |
| "learning_rate": 9.692307692307693e-06, | |
| "loss": 0.3219, | |
| "mean_token_accuracy": 0.8964273929595947, | |
| "step": 64 | |
| }, | |
| { | |
| "epoch": 0.3023255813953488, | |
| "grad_norm": 3.0754854679107666, | |
| "learning_rate": 9.846153846153848e-06, | |
| "loss": 0.3427, | |
| "mean_token_accuracy": 0.8874080181121826, | |
| "step": 65 | |
| }, | |
| { | |
| "epoch": 0.30697674418604654, | |
| "grad_norm": 2.6351478099823, | |
| "learning_rate": 1e-05, | |
| "loss": 0.3105, | |
| "mean_token_accuracy": 0.8933923840522766, | |
| "step": 66 | |
| }, | |
| { | |
| "epoch": 0.3116279069767442, | |
| "grad_norm": 2.8327081203460693, | |
| "learning_rate": 9.999933987646821e-06, | |
| "loss": 0.3296, | |
| "mean_token_accuracy": 0.8912156224250793, | |
| "step": 67 | |
| }, | |
| { | |
| "epoch": 0.31627906976744186, | |
| "grad_norm": 2.7764129638671875, | |
| "learning_rate": 9.99973595252401e-06, | |
| "loss": 0.2963, | |
| "mean_token_accuracy": 0.9016897082328796, | |
| "step": 68 | |
| }, | |
| { | |
| "epoch": 0.3209302325581395, | |
| "grad_norm": 2.8871490955352783, | |
| "learning_rate": 9.999405900441683e-06, | |
| "loss": 0.3152, | |
| "mean_token_accuracy": 0.8972193002700806, | |
| "step": 69 | |
| }, | |
| { | |
| "epoch": 0.32558139534883723, | |
| "grad_norm": 2.9388067722320557, | |
| "learning_rate": 9.998943841083179e-06, | |
| "loss": 0.3187, | |
| "mean_token_accuracy": 0.8915014863014221, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.3302325581395349, | |
| "grad_norm": 2.861207962036133, | |
| "learning_rate": 9.99834978800478e-06, | |
| "loss": 0.3152, | |
| "mean_token_accuracy": 0.8957569599151611, | |
| "step": 71 | |
| }, | |
| { | |
| "epoch": 0.33488372093023255, | |
| "grad_norm": 2.725429058074951, | |
| "learning_rate": 9.997623758635298e-06, | |
| "loss": 0.3155, | |
| "mean_token_accuracy": 0.8980090618133545, | |
| "step": 72 | |
| }, | |
| { | |
| "epoch": 0.3395348837209302, | |
| "grad_norm": 2.838580369949341, | |
| "learning_rate": 9.996765774275587e-06, | |
| "loss": 0.3398, | |
| "mean_token_accuracy": 0.8817829489707947, | |
| "step": 73 | |
| }, | |
| { | |
| "epoch": 0.34418604651162793, | |
| "grad_norm": 2.6265110969543457, | |
| "learning_rate": 9.995775860097897e-06, | |
| "loss": 0.2922, | |
| "mean_token_accuracy": 0.8991727232933044, | |
| "step": 74 | |
| }, | |
| { | |
| "epoch": 0.3488372093023256, | |
| "grad_norm": 2.9625837802886963, | |
| "learning_rate": 9.994654045145142e-06, | |
| "loss": 0.3265, | |
| "mean_token_accuracy": 0.8913161158561707, | |
| "step": 75 | |
| }, | |
| { | |
| "epoch": 0.35348837209302325, | |
| "grad_norm": 2.6737451553344727, | |
| "learning_rate": 9.993400362330058e-06, | |
| "loss": 0.293, | |
| "mean_token_accuracy": 0.9017840027809143, | |
| "step": 76 | |
| }, | |
| { | |
| "epoch": 0.3581395348837209, | |
| "grad_norm": 2.600137710571289, | |
| "learning_rate": 9.992014848434221e-06, | |
| "loss": 0.3134, | |
| "mean_token_accuracy": 0.8939000368118286, | |
| "step": 77 | |
| }, | |
| { | |
| "epoch": 0.3627906976744186, | |
| "grad_norm": 2.5492331981658936, | |
| "learning_rate": 9.990497544106981e-06, | |
| "loss": 0.278, | |
| "mean_token_accuracy": 0.905031681060791, | |
| "step": 78 | |
| }, | |
| { | |
| "epoch": 0.3674418604651163, | |
| "grad_norm": 2.828934669494629, | |
| "learning_rate": 9.988848493864259e-06, | |
| "loss": 0.3139, | |
| "mean_token_accuracy": 0.8893573880195618, | |
| "step": 79 | |
| }, | |
| { | |
| "epoch": 0.37209302325581395, | |
| "grad_norm": 2.4408745765686035, | |
| "learning_rate": 9.987067746087251e-06, | |
| "loss": 0.3349, | |
| "mean_token_accuracy": 0.8832064867019653, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.3767441860465116, | |
| "grad_norm": 2.7932300567626953, | |
| "learning_rate": 9.985155353021004e-06, | |
| "loss": 0.2888, | |
| "mean_token_accuracy": 0.9002993106842041, | |
| "step": 81 | |
| }, | |
| { | |
| "epoch": 0.3813953488372093, | |
| "grad_norm": 2.693359613418579, | |
| "learning_rate": 9.983111370772877e-06, | |
| "loss": 0.2828, | |
| "mean_token_accuracy": 0.9031432867050171, | |
| "step": 82 | |
| }, | |
| { | |
| "epoch": 0.386046511627907, | |
| "grad_norm": 2.4886722564697266, | |
| "learning_rate": 9.980935859310907e-06, | |
| "loss": 0.2906, | |
| "mean_token_accuracy": 0.9039763808250427, | |
| "step": 83 | |
| }, | |
| { | |
| "epoch": 0.39069767441860465, | |
| "grad_norm": 2.453582525253296, | |
| "learning_rate": 9.97862888246204e-06, | |
| "loss": 0.3303, | |
| "mean_token_accuracy": 0.8835755586624146, | |
| "step": 84 | |
| }, | |
| { | |
| "epoch": 0.3953488372093023, | |
| "grad_norm": 2.423192024230957, | |
| "learning_rate": 9.976190507910265e-06, | |
| "loss": 0.3036, | |
| "mean_token_accuracy": 0.8907879590988159, | |
| "step": 85 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "grad_norm": 2.716904878616333, | |
| "learning_rate": 9.97362080719462e-06, | |
| "loss": 0.333, | |
| "mean_token_accuracy": 0.8917351365089417, | |
| "step": 86 | |
| }, | |
| { | |
| "epoch": 0.4046511627906977, | |
| "grad_norm": 2.4398062229156494, | |
| "learning_rate": 9.970919855707103e-06, | |
| "loss": 0.3071, | |
| "mean_token_accuracy": 0.8877987861633301, | |
| "step": 87 | |
| }, | |
| { | |
| "epoch": 0.40930232558139534, | |
| "grad_norm": 2.614738941192627, | |
| "learning_rate": 9.968087732690452e-06, | |
| "loss": 0.3566, | |
| "mean_token_accuracy": 0.8800138831138611, | |
| "step": 88 | |
| }, | |
| { | |
| "epoch": 0.413953488372093, | |
| "grad_norm": 2.467711925506592, | |
| "learning_rate": 9.965124521235827e-06, | |
| "loss": 0.305, | |
| "mean_token_accuracy": 0.9028013944625854, | |
| "step": 89 | |
| }, | |
| { | |
| "epoch": 0.4186046511627907, | |
| "grad_norm": 2.5902044773101807, | |
| "learning_rate": 9.962030308280363e-06, | |
| "loss": 0.2639, | |
| "mean_token_accuracy": 0.9111554026603699, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.4232558139534884, | |
| "grad_norm": 2.4866185188293457, | |
| "learning_rate": 9.958805184604631e-06, | |
| "loss": 0.2698, | |
| "mean_token_accuracy": 0.9070945978164673, | |
| "step": 91 | |
| }, | |
| { | |
| "epoch": 0.42790697674418604, | |
| "grad_norm": 2.5046956539154053, | |
| "learning_rate": 9.955449244829966e-06, | |
| "loss": 0.322, | |
| "mean_token_accuracy": 0.8915765881538391, | |
| "step": 92 | |
| }, | |
| { | |
| "epoch": 0.4325581395348837, | |
| "grad_norm": 2.4573545455932617, | |
| "learning_rate": 9.95196258741569e-06, | |
| "loss": 0.2948, | |
| "mean_token_accuracy": 0.898975133895874, | |
| "step": 93 | |
| }, | |
| { | |
| "epoch": 0.4372093023255814, | |
| "grad_norm": 2.4542694091796875, | |
| "learning_rate": 9.948345314656234e-06, | |
| "loss": 0.3093, | |
| "mean_token_accuracy": 0.896518349647522, | |
| "step": 94 | |
| }, | |
| { | |
| "epoch": 0.4418604651162791, | |
| "grad_norm": 2.5495047569274902, | |
| "learning_rate": 9.94459753267812e-06, | |
| "loss": 0.3092, | |
| "mean_token_accuracy": 0.8926985263824463, | |
| "step": 95 | |
| }, | |
| { | |
| "epoch": 0.44651162790697674, | |
| "grad_norm": 2.413846015930176, | |
| "learning_rate": 9.94071935143687e-06, | |
| "loss": 0.292, | |
| "mean_token_accuracy": 0.9006398916244507, | |
| "step": 96 | |
| }, | |
| { | |
| "epoch": 0.4511627906976744, | |
| "grad_norm": 2.5379788875579834, | |
| "learning_rate": 9.936710884713752e-06, | |
| "loss": 0.2552, | |
| "mean_token_accuracy": 0.9097174406051636, | |
| "step": 97 | |
| }, | |
| { | |
| "epoch": 0.4558139534883721, | |
| "grad_norm": 2.4800572395324707, | |
| "learning_rate": 9.932572250112469e-06, | |
| "loss": 0.3124, | |
| "mean_token_accuracy": 0.8870939016342163, | |
| "step": 98 | |
| }, | |
| { | |
| "epoch": 0.4604651162790698, | |
| "grad_norm": 2.299506425857544, | |
| "learning_rate": 9.92830356905569e-06, | |
| "loss": 0.2613, | |
| "mean_token_accuracy": 0.9084261059761047, | |
| "step": 99 | |
| }, | |
| { | |
| "epoch": 0.46511627906976744, | |
| "grad_norm": 2.372338056564331, | |
| "learning_rate": 9.923904966781496e-06, | |
| "loss": 0.3313, | |
| "mean_token_accuracy": 0.8863078951835632, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.4697674418604651, | |
| "grad_norm": 2.4246954917907715, | |
| "learning_rate": 9.919376572339703e-06, | |
| "loss": 0.3164, | |
| "mean_token_accuracy": 0.8909768462181091, | |
| "step": 101 | |
| }, | |
| { | |
| "epoch": 0.4744186046511628, | |
| "grad_norm": 2.382747173309326, | |
| "learning_rate": 9.914718518588076e-06, | |
| "loss": 0.312, | |
| "mean_token_accuracy": 0.8973370790481567, | |
| "step": 102 | |
| }, | |
| { | |
| "epoch": 0.4790697674418605, | |
| "grad_norm": 2.20865797996521, | |
| "learning_rate": 9.909930942188436e-06, | |
| "loss": 0.3017, | |
| "mean_token_accuracy": 0.8977475166320801, | |
| "step": 103 | |
| }, | |
| { | |
| "epoch": 0.48372093023255813, | |
| "grad_norm": 2.2108991146087646, | |
| "learning_rate": 9.905013983602639e-06, | |
| "loss": 0.2822, | |
| "mean_token_accuracy": 0.9046753644943237, | |
| "step": 104 | |
| }, | |
| { | |
| "epoch": 0.4883720930232558, | |
| "grad_norm": 2.45776104927063, | |
| "learning_rate": 9.899967787088468e-06, | |
| "loss": 0.3172, | |
| "mean_token_accuracy": 0.8890208005905151, | |
| "step": 105 | |
| }, | |
| { | |
| "epoch": 0.4930232558139535, | |
| "grad_norm": 2.4246809482574463, | |
| "learning_rate": 9.89479250069539e-06, | |
| "loss": 0.2847, | |
| "mean_token_accuracy": 0.9031876921653748, | |
| "step": 106 | |
| }, | |
| { | |
| "epoch": 0.49767441860465117, | |
| "grad_norm": 2.4469594955444336, | |
| "learning_rate": 9.889488276260222e-06, | |
| "loss": 0.3474, | |
| "mean_token_accuracy": 0.8859800100326538, | |
| "step": 107 | |
| }, | |
| { | |
| "epoch": 0.5023255813953489, | |
| "grad_norm": 2.5260751247406006, | |
| "learning_rate": 9.88405526940267e-06, | |
| "loss": 0.3265, | |
| "mean_token_accuracy": 0.884105384349823, | |
| "step": 108 | |
| }, | |
| { | |
| "epoch": 0.5069767441860465, | |
| "grad_norm": 2.5180299282073975, | |
| "learning_rate": 9.87849363952076e-06, | |
| "loss": 0.2824, | |
| "mean_token_accuracy": 0.9007551074028015, | |
| "step": 109 | |
| }, | |
| { | |
| "epoch": 0.5116279069767442, | |
| "grad_norm": 2.5075199604034424, | |
| "learning_rate": 9.872803549786177e-06, | |
| "loss": 0.2946, | |
| "mean_token_accuracy": 0.8951205611228943, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 0.5162790697674419, | |
| "grad_norm": 2.4692704677581787, | |
| "learning_rate": 9.866985167139453e-06, | |
| "loss": 0.3182, | |
| "mean_token_accuracy": 0.8877219557762146, | |
| "step": 111 | |
| }, | |
| { | |
| "epoch": 0.5209302325581395, | |
| "grad_norm": 2.3963942527770996, | |
| "learning_rate": 9.861038662285093e-06, | |
| "loss": 0.2969, | |
| "mean_token_accuracy": 0.8966950178146362, | |
| "step": 112 | |
| }, | |
| { | |
| "epoch": 0.5255813953488372, | |
| "grad_norm": 2.3317747116088867, | |
| "learning_rate": 9.854964209686555e-06, | |
| "loss": 0.3333, | |
| "mean_token_accuracy": 0.891633927822113, | |
| "step": 113 | |
| }, | |
| { | |
| "epoch": 0.5302325581395348, | |
| "grad_norm": 2.317647933959961, | |
| "learning_rate": 9.848761987561132e-06, | |
| "loss": 0.3076, | |
| "mean_token_accuracy": 0.8995808362960815, | |
| "step": 114 | |
| }, | |
| { | |
| "epoch": 0.5348837209302325, | |
| "grad_norm": 2.637216567993164, | |
| "learning_rate": 9.842432177874725e-06, | |
| "loss": 0.3078, | |
| "mean_token_accuracy": 0.8890925645828247, | |
| "step": 115 | |
| }, | |
| { | |
| "epoch": 0.5395348837209303, | |
| "grad_norm": 2.7842369079589844, | |
| "learning_rate": 9.835974966336504e-06, | |
| "loss": 0.3121, | |
| "mean_token_accuracy": 0.8958715796470642, | |
| "step": 116 | |
| }, | |
| { | |
| "epoch": 0.5441860465116279, | |
| "grad_norm": 2.725388288497925, | |
| "learning_rate": 9.82939054239346e-06, | |
| "loss": 0.3233, | |
| "mean_token_accuracy": 0.8867715001106262, | |
| "step": 117 | |
| }, | |
| { | |
| "epoch": 0.5488372093023256, | |
| "grad_norm": 2.2746381759643555, | |
| "learning_rate": 9.822679099224844e-06, | |
| "loss": 0.2699, | |
| "mean_token_accuracy": 0.9086083769798279, | |
| "step": 118 | |
| }, | |
| { | |
| "epoch": 0.5534883720930233, | |
| "grad_norm": 2.4101691246032715, | |
| "learning_rate": 9.815840833736508e-06, | |
| "loss": 0.26, | |
| "mean_token_accuracy": 0.9082334637641907, | |
| "step": 119 | |
| }, | |
| { | |
| "epoch": 0.5581395348837209, | |
| "grad_norm": 2.3375160694122314, | |
| "learning_rate": 9.808875946555109e-06, | |
| "loss": 0.2658, | |
| "mean_token_accuracy": 0.9081822633743286, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 0.5627906976744186, | |
| "grad_norm": 2.2656409740448, | |
| "learning_rate": 9.801784642022254e-06, | |
| "loss": 0.2374, | |
| "mean_token_accuracy": 0.9136148691177368, | |
| "step": 121 | |
| }, | |
| { | |
| "epoch": 0.5674418604651162, | |
| "grad_norm": 2.5492942333221436, | |
| "learning_rate": 9.794567128188466e-06, | |
| "loss": 0.3194, | |
| "mean_token_accuracy": 0.8901216983795166, | |
| "step": 122 | |
| }, | |
| { | |
| "epoch": 0.5720930232558139, | |
| "grad_norm": 2.8390772342681885, | |
| "learning_rate": 9.787223616807118e-06, | |
| "loss": 0.3522, | |
| "mean_token_accuracy": 0.8756738901138306, | |
| "step": 123 | |
| }, | |
| { | |
| "epoch": 0.5767441860465117, | |
| "grad_norm": 2.3636889457702637, | |
| "learning_rate": 9.779754323328192e-06, | |
| "loss": 0.3166, | |
| "mean_token_accuracy": 0.8895965814590454, | |
| "step": 124 | |
| }, | |
| { | |
| "epoch": 0.5813953488372093, | |
| "grad_norm": 2.4303550720214844, | |
| "learning_rate": 9.772159466891971e-06, | |
| "loss": 0.2507, | |
| "mean_token_accuracy": 0.9103531241416931, | |
| "step": 125 | |
| }, | |
| { | |
| "epoch": 0.586046511627907, | |
| "grad_norm": 3.1228110790252686, | |
| "learning_rate": 9.764439270322612e-06, | |
| "loss": 0.3337, | |
| "mean_token_accuracy": 0.8896551728248596, | |
| "step": 126 | |
| }, | |
| { | |
| "epoch": 0.5906976744186047, | |
| "grad_norm": 2.389329433441162, | |
| "learning_rate": 9.756593960121598e-06, | |
| "loss": 0.2601, | |
| "mean_token_accuracy": 0.912638783454895, | |
| "step": 127 | |
| }, | |
| { | |
| "epoch": 0.5953488372093023, | |
| "grad_norm": 2.473677635192871, | |
| "learning_rate": 9.748623766461101e-06, | |
| "loss": 0.3098, | |
| "mean_token_accuracy": 0.89825040102005, | |
| "step": 128 | |
| }, | |
| { | |
| "epoch": 0.6, | |
| "grad_norm": 2.882704973220825, | |
| "learning_rate": 9.740528923177227e-06, | |
| "loss": 0.3681, | |
| "mean_token_accuracy": 0.8829707503318787, | |
| "step": 129 | |
| }, | |
| { | |
| "epoch": 0.6046511627906976, | |
| "grad_norm": 2.7584638595581055, | |
| "learning_rate": 9.732309667763158e-06, | |
| "loss": 0.295, | |
| "mean_token_accuracy": 0.8920313119888306, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 0.6093023255813953, | |
| "grad_norm": 2.507779121398926, | |
| "learning_rate": 9.723966241362178e-06, | |
| "loss": 0.2819, | |
| "mean_token_accuracy": 0.9021470546722412, | |
| "step": 131 | |
| }, | |
| { | |
| "epoch": 0.6139534883720931, | |
| "grad_norm": 2.3873088359832764, | |
| "learning_rate": 9.7154988887606e-06, | |
| "loss": 0.2841, | |
| "mean_token_accuracy": 0.8999173045158386, | |
| "step": 132 | |
| }, | |
| { | |
| "epoch": 0.6186046511627907, | |
| "grad_norm": 2.327904224395752, | |
| "learning_rate": 9.706907858380593e-06, | |
| "loss": 0.3182, | |
| "mean_token_accuracy": 0.8869202733039856, | |
| "step": 133 | |
| }, | |
| { | |
| "epoch": 0.6232558139534884, | |
| "grad_norm": 2.4665448665618896, | |
| "learning_rate": 9.69819340227288e-06, | |
| "loss": 0.3211, | |
| "mean_token_accuracy": 0.8939599394798279, | |
| "step": 134 | |
| }, | |
| { | |
| "epoch": 0.627906976744186, | |
| "grad_norm": 2.293694019317627, | |
| "learning_rate": 9.68935577610935e-06, | |
| "loss": 0.3098, | |
| "mean_token_accuracy": 0.8957222700119019, | |
| "step": 135 | |
| }, | |
| { | |
| "epoch": 0.6325581395348837, | |
| "grad_norm": 2.5069773197174072, | |
| "learning_rate": 9.680395239175563e-06, | |
| "loss": 0.3054, | |
| "mean_token_accuracy": 0.8952414393424988, | |
| "step": 136 | |
| }, | |
| { | |
| "epoch": 0.6372093023255814, | |
| "grad_norm": 2.3153645992279053, | |
| "learning_rate": 9.671312054363126e-06, | |
| "loss": 0.2976, | |
| "mean_token_accuracy": 0.899829626083374, | |
| "step": 137 | |
| }, | |
| { | |
| "epoch": 0.641860465116279, | |
| "grad_norm": 2.233323812484741, | |
| "learning_rate": 9.662106488162001e-06, | |
| "loss": 0.3034, | |
| "mean_token_accuracy": 0.8928571343421936, | |
| "step": 138 | |
| }, | |
| { | |
| "epoch": 0.6465116279069767, | |
| "grad_norm": 2.3756513595581055, | |
| "learning_rate": 9.652778810652669e-06, | |
| "loss": 0.284, | |
| "mean_token_accuracy": 0.9001284837722778, | |
| "step": 139 | |
| }, | |
| { | |
| "epoch": 0.6511627906976745, | |
| "grad_norm": 2.373886823654175, | |
| "learning_rate": 9.643329295498215e-06, | |
| "loss": 0.3215, | |
| "mean_token_accuracy": 0.890358567237854, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 0.6558139534883721, | |
| "grad_norm": 2.4615867137908936, | |
| "learning_rate": 9.633758219936299e-06, | |
| "loss": 0.3237, | |
| "mean_token_accuracy": 0.8895444273948669, | |
| "step": 141 | |
| }, | |
| { | |
| "epoch": 0.6604651162790698, | |
| "grad_norm": 2.5071775913238525, | |
| "learning_rate": 9.624065864771017e-06, | |
| "loss": 0.2943, | |
| "mean_token_accuracy": 0.9009695053100586, | |
| "step": 142 | |
| }, | |
| { | |
| "epoch": 0.6651162790697674, | |
| "grad_norm": 2.4051311016082764, | |
| "learning_rate": 9.614252514364671e-06, | |
| "loss": 0.282, | |
| "mean_token_accuracy": 0.8996679186820984, | |
| "step": 143 | |
| }, | |
| { | |
| "epoch": 0.6697674418604651, | |
| "grad_norm": 2.5493178367614746, | |
| "learning_rate": 9.604318456629415e-06, | |
| "loss": 0.363, | |
| "mean_token_accuracy": 0.8800684213638306, | |
| "step": 144 | |
| }, | |
| { | |
| "epoch": 0.6744186046511628, | |
| "grad_norm": 2.582982301712036, | |
| "learning_rate": 9.594263983018818e-06, | |
| "loss": 0.3378, | |
| "mean_token_accuracy": 0.8826906085014343, | |
| "step": 145 | |
| }, | |
| { | |
| "epoch": 0.6790697674418604, | |
| "grad_norm": 2.471052885055542, | |
| "learning_rate": 9.584089388519307e-06, | |
| "loss": 0.3545, | |
| "mean_token_accuracy": 0.8743756413459778, | |
| "step": 146 | |
| }, | |
| { | |
| "epoch": 0.6837209302325581, | |
| "grad_norm": 2.5069751739501953, | |
| "learning_rate": 9.573794971641518e-06, | |
| "loss": 0.2964, | |
| "mean_token_accuracy": 0.8944962024688721, | |
| "step": 147 | |
| }, | |
| { | |
| "epoch": 0.6883720930232559, | |
| "grad_norm": 2.7452809810638428, | |
| "learning_rate": 9.563381034411529e-06, | |
| "loss": 0.2885, | |
| "mean_token_accuracy": 0.9012883305549622, | |
| "step": 148 | |
| }, | |
| { | |
| "epoch": 0.6930232558139535, | |
| "grad_norm": 2.500969886779785, | |
| "learning_rate": 9.55284788236201e-06, | |
| "loss": 0.3279, | |
| "mean_token_accuracy": 0.8895537853240967, | |
| "step": 149 | |
| }, | |
| { | |
| "epoch": 0.6976744186046512, | |
| "grad_norm": 2.6518476009368896, | |
| "learning_rate": 9.542195824523251e-06, | |
| "loss": 0.2993, | |
| "mean_token_accuracy": 0.895342230796814, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.7023255813953488, | |
| "grad_norm": 2.216704845428467, | |
| "learning_rate": 9.531425173414095e-06, | |
| "loss": 0.2912, | |
| "mean_token_accuracy": 0.8971017003059387, | |
| "step": 151 | |
| }, | |
| { | |
| "epoch": 0.7069767441860465, | |
| "grad_norm": 2.8981404304504395, | |
| "learning_rate": 9.520536245032783e-06, | |
| "loss": 0.3483, | |
| "mean_token_accuracy": 0.8798250555992126, | |
| "step": 152 | |
| }, | |
| { | |
| "epoch": 0.7116279069767442, | |
| "grad_norm": 2.808007001876831, | |
| "learning_rate": 9.509529358847655e-06, | |
| "loss": 0.3235, | |
| "mean_token_accuracy": 0.8890100121498108, | |
| "step": 153 | |
| }, | |
| { | |
| "epoch": 0.7162790697674418, | |
| "grad_norm": 2.2912731170654297, | |
| "learning_rate": 9.498404837787811e-06, | |
| "loss": 0.2957, | |
| "mean_token_accuracy": 0.8959488868713379, | |
| "step": 154 | |
| }, | |
| { | |
| "epoch": 0.7209302325581395, | |
| "grad_norm": 2.1323370933532715, | |
| "learning_rate": 9.48716300823361e-06, | |
| "loss": 0.2722, | |
| "mean_token_accuracy": 0.9088647961616516, | |
| "step": 155 | |
| }, | |
| { | |
| "epoch": 0.7255813953488373, | |
| "grad_norm": 2.3741555213928223, | |
| "learning_rate": 9.475804200007104e-06, | |
| "loss": 0.2523, | |
| "mean_token_accuracy": 0.9077244400978088, | |
| "step": 156 | |
| }, | |
| { | |
| "epoch": 0.7302325581395349, | |
| "grad_norm": 2.571829080581665, | |
| "learning_rate": 9.464328746362367e-06, | |
| "loss": 0.3139, | |
| "mean_token_accuracy": 0.8919800519943237, | |
| "step": 157 | |
| }, | |
| { | |
| "epoch": 0.7348837209302326, | |
| "grad_norm": 2.3718228340148926, | |
| "learning_rate": 9.452736983975708e-06, | |
| "loss": 0.3006, | |
| "mean_token_accuracy": 0.9011486172676086, | |
| "step": 158 | |
| }, | |
| { | |
| "epoch": 0.7395348837209302, | |
| "grad_norm": 2.3102355003356934, | |
| "learning_rate": 9.441029252935804e-06, | |
| "loss": 0.3169, | |
| "mean_token_accuracy": 0.8904637098312378, | |
| "step": 159 | |
| }, | |
| { | |
| "epoch": 0.7441860465116279, | |
| "grad_norm": 2.3063647747039795, | |
| "learning_rate": 9.429205896733705e-06, | |
| "loss": 0.3344, | |
| "mean_token_accuracy": 0.885936975479126, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 0.7488372093023256, | |
| "grad_norm": 2.2388534545898438, | |
| "learning_rate": 9.417267262252775e-06, | |
| "loss": 0.2618, | |
| "mean_token_accuracy": 0.9093095064163208, | |
| "step": 161 | |
| }, | |
| { | |
| "epoch": 0.7534883720930232, | |
| "grad_norm": 2.311589241027832, | |
| "learning_rate": 9.405213699758507e-06, | |
| "loss": 0.2951, | |
| "mean_token_accuracy": 0.9044934511184692, | |
| "step": 162 | |
| }, | |
| { | |
| "epoch": 0.7581395348837209, | |
| "grad_norm": 2.6392147541046143, | |
| "learning_rate": 9.393045562888245e-06, | |
| "loss": 0.3072, | |
| "mean_token_accuracy": 0.8980139493942261, | |
| "step": 163 | |
| }, | |
| { | |
| "epoch": 0.7627906976744186, | |
| "grad_norm": 2.4263360500335693, | |
| "learning_rate": 9.380763208640809e-06, | |
| "loss": 0.3182, | |
| "mean_token_accuracy": 0.89084792137146, | |
| "step": 164 | |
| }, | |
| { | |
| "epoch": 0.7674418604651163, | |
| "grad_norm": 2.5029895305633545, | |
| "learning_rate": 9.368366997366027e-06, | |
| "loss": 0.3163, | |
| "mean_token_accuracy": 0.8866799473762512, | |
| "step": 165 | |
| }, | |
| { | |
| "epoch": 0.772093023255814, | |
| "grad_norm": 2.336146593093872, | |
| "learning_rate": 9.355857292754152e-06, | |
| "loss": 0.3092, | |
| "mean_token_accuracy": 0.8928571343421936, | |
| "step": 166 | |
| }, | |
| { | |
| "epoch": 0.7767441860465116, | |
| "grad_norm": 2.218172550201416, | |
| "learning_rate": 9.343234461825204e-06, | |
| "loss": 0.2906, | |
| "mean_token_accuracy": 0.9058730006217957, | |
| "step": 167 | |
| }, | |
| { | |
| "epoch": 0.7813953488372093, | |
| "grad_norm": 2.5669257640838623, | |
| "learning_rate": 9.330498874918191e-06, | |
| "loss": 0.3321, | |
| "mean_token_accuracy": 0.8863449096679688, | |
| "step": 168 | |
| }, | |
| { | |
| "epoch": 0.786046511627907, | |
| "grad_norm": 2.513970136642456, | |
| "learning_rate": 9.317650905680254e-06, | |
| "loss": 0.2676, | |
| "mean_token_accuracy": 0.9085434675216675, | |
| "step": 169 | |
| }, | |
| { | |
| "epoch": 0.7906976744186046, | |
| "grad_norm": 2.1640465259552, | |
| "learning_rate": 9.304690931055694e-06, | |
| "loss": 0.274, | |
| "mean_token_accuracy": 0.9004696607589722, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 0.7953488372093023, | |
| "grad_norm": 2.511218547821045, | |
| "learning_rate": 9.29161933127492e-06, | |
| "loss": 0.3194, | |
| "mean_token_accuracy": 0.8944977521896362, | |
| "step": 171 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "grad_norm": 2.421499252319336, | |
| "learning_rate": 9.278436489843298e-06, | |
| "loss": 0.2887, | |
| "mean_token_accuracy": 0.9034446477890015, | |
| "step": 172 | |
| }, | |
| { | |
| "epoch": 0.8046511627906977, | |
| "grad_norm": 2.588841199874878, | |
| "learning_rate": 9.265142793529883e-06, | |
| "loss": 0.3064, | |
| "mean_token_accuracy": 0.8959047198295593, | |
| "step": 173 | |
| }, | |
| { | |
| "epoch": 0.8093023255813954, | |
| "grad_norm": 2.45721435546875, | |
| "learning_rate": 9.251738632356086e-06, | |
| "loss": 0.2945, | |
| "mean_token_accuracy": 0.8972444534301758, | |
| "step": 174 | |
| }, | |
| { | |
| "epoch": 0.813953488372093, | |
| "grad_norm": 2.337759256362915, | |
| "learning_rate": 9.238224399584232e-06, | |
| "loss": 0.3035, | |
| "mean_token_accuracy": 0.8876973390579224, | |
| "step": 175 | |
| }, | |
| { | |
| "epoch": 0.8186046511627907, | |
| "grad_norm": 2.4137725830078125, | |
| "learning_rate": 9.224600491706009e-06, | |
| "loss": 0.2831, | |
| "mean_token_accuracy": 0.9046387076377869, | |
| "step": 176 | |
| }, | |
| { | |
| "epoch": 0.8232558139534883, | |
| "grad_norm": 2.3806352615356445, | |
| "learning_rate": 9.210867308430847e-06, | |
| "loss": 0.3307, | |
| "mean_token_accuracy": 0.8875255584716797, | |
| "step": 177 | |
| }, | |
| { | |
| "epoch": 0.827906976744186, | |
| "grad_norm": 2.5038254261016846, | |
| "learning_rate": 9.197025252674192e-06, | |
| "loss": 0.2855, | |
| "mean_token_accuracy": 0.9022055268287659, | |
| "step": 178 | |
| }, | |
| { | |
| "epoch": 0.8325581395348837, | |
| "grad_norm": 2.2400872707366943, | |
| "learning_rate": 9.183074730545674e-06, | |
| "loss": 0.3032, | |
| "mean_token_accuracy": 0.8980777859687805, | |
| "step": 179 | |
| }, | |
| { | |
| "epoch": 0.8372093023255814, | |
| "grad_norm": 2.3404793739318848, | |
| "learning_rate": 9.169016151337202e-06, | |
| "loss": 0.2941, | |
| "mean_token_accuracy": 0.8985650539398193, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 0.8418604651162791, | |
| "grad_norm": 2.398179769515991, | |
| "learning_rate": 9.15484992751095e-06, | |
| "loss": 0.2971, | |
| "mean_token_accuracy": 0.8980716466903687, | |
| "step": 181 | |
| }, | |
| { | |
| "epoch": 0.8465116279069768, | |
| "grad_norm": 2.3488447666168213, | |
| "learning_rate": 9.140576474687263e-06, | |
| "loss": 0.3054, | |
| "mean_token_accuracy": 0.897182822227478, | |
| "step": 182 | |
| }, | |
| { | |
| "epoch": 0.8511627906976744, | |
| "grad_norm": 2.7520530223846436, | |
| "learning_rate": 9.126196211632456e-06, | |
| "loss": 0.3154, | |
| "mean_token_accuracy": 0.8900938034057617, | |
| "step": 183 | |
| }, | |
| { | |
| "epoch": 0.8558139534883721, | |
| "grad_norm": 2.515666961669922, | |
| "learning_rate": 9.11170956024653e-06, | |
| "loss": 0.3116, | |
| "mean_token_accuracy": 0.8922144770622253, | |
| "step": 184 | |
| }, | |
| { | |
| "epoch": 0.8604651162790697, | |
| "grad_norm": 2.2675559520721436, | |
| "learning_rate": 9.097116945550794e-06, | |
| "loss": 0.2906, | |
| "mean_token_accuracy": 0.8984547257423401, | |
| "step": 185 | |
| }, | |
| { | |
| "epoch": 0.8651162790697674, | |
| "grad_norm": 2.3091530799865723, | |
| "learning_rate": 9.082418795675397e-06, | |
| "loss": 0.3165, | |
| "mean_token_accuracy": 0.8925065398216248, | |
| "step": 186 | |
| }, | |
| { | |
| "epoch": 0.8697674418604651, | |
| "grad_norm": 2.641993284225464, | |
| "learning_rate": 9.067615541846768e-06, | |
| "loss": 0.2755, | |
| "mean_token_accuracy": 0.8972795009613037, | |
| "step": 187 | |
| }, | |
| { | |
| "epoch": 0.8744186046511628, | |
| "grad_norm": 2.2171666622161865, | |
| "learning_rate": 9.052707618374958e-06, | |
| "loss": 0.2995, | |
| "mean_token_accuracy": 0.8997421264648438, | |
| "step": 188 | |
| }, | |
| { | |
| "epoch": 0.8790697674418605, | |
| "grad_norm": 2.160520553588867, | |
| "learning_rate": 9.037695462640908e-06, | |
| "loss": 0.2758, | |
| "mean_token_accuracy": 0.9074592590332031, | |
| "step": 189 | |
| }, | |
| { | |
| "epoch": 0.8837209302325582, | |
| "grad_norm": 2.49261212348938, | |
| "learning_rate": 9.022579515083601e-06, | |
| "loss": 0.2951, | |
| "mean_token_accuracy": 0.8942018151283264, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 0.8883720930232558, | |
| "grad_norm": 2.5129523277282715, | |
| "learning_rate": 9.007360219187163e-06, | |
| "loss": 0.3419, | |
| "mean_token_accuracy": 0.8804105520248413, | |
| "step": 191 | |
| }, | |
| { | |
| "epoch": 0.8930232558139535, | |
| "grad_norm": 2.299142360687256, | |
| "learning_rate": 8.99203802146783e-06, | |
| "loss": 0.254, | |
| "mean_token_accuracy": 0.9106271862983704, | |
| "step": 192 | |
| }, | |
| { | |
| "epoch": 0.8976744186046511, | |
| "grad_norm": 2.291740655899048, | |
| "learning_rate": 8.976613371460856e-06, | |
| "loss": 0.3024, | |
| "mean_token_accuracy": 0.8975442051887512, | |
| "step": 193 | |
| }, | |
| { | |
| "epoch": 0.9023255813953488, | |
| "grad_norm": 2.278927803039551, | |
| "learning_rate": 8.961086721707331e-06, | |
| "loss": 0.2812, | |
| "mean_token_accuracy": 0.9085345268249512, | |
| "step": 194 | |
| }, | |
| { | |
| "epoch": 0.9069767441860465, | |
| "grad_norm": 2.2824349403381348, | |
| "learning_rate": 8.945458527740892e-06, | |
| "loss": 0.2813, | |
| "mean_token_accuracy": 0.9089676141738892, | |
| "step": 195 | |
| }, | |
| { | |
| "epoch": 0.9116279069767442, | |
| "grad_norm": 2.3400731086730957, | |
| "learning_rate": 8.929729248074364e-06, | |
| "loss": 0.3127, | |
| "mean_token_accuracy": 0.8936736583709717, | |
| "step": 196 | |
| }, | |
| { | |
| "epoch": 0.9162790697674419, | |
| "grad_norm": 2.4384615421295166, | |
| "learning_rate": 8.913899344186312e-06, | |
| "loss": 0.2703, | |
| "mean_token_accuracy": 0.9109355211257935, | |
| "step": 197 | |
| }, | |
| { | |
| "epoch": 0.9209302325581395, | |
| "grad_norm": 2.4058189392089844, | |
| "learning_rate": 8.897969280507494e-06, | |
| "loss": 0.2786, | |
| "mean_token_accuracy": 0.9076216816902161, | |
| "step": 198 | |
| }, | |
| { | |
| "epoch": 0.9255813953488372, | |
| "grad_norm": 2.4712047576904297, | |
| "learning_rate": 8.881939524407238e-06, | |
| "loss": 0.3093, | |
| "mean_token_accuracy": 0.8929236531257629, | |
| "step": 199 | |
| }, | |
| { | |
| "epoch": 0.9302325581395349, | |
| "grad_norm": 2.4457972049713135, | |
| "learning_rate": 8.86581054617973e-06, | |
| "loss": 0.2869, | |
| "mean_token_accuracy": 0.9015862345695496, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.9348837209302325, | |
| "grad_norm": 2.3394265174865723, | |
| "learning_rate": 8.849582819030217e-06, | |
| "loss": 0.3105, | |
| "mean_token_accuracy": 0.8978766202926636, | |
| "step": 201 | |
| }, | |
| { | |
| "epoch": 0.9395348837209302, | |
| "grad_norm": 2.4344286918640137, | |
| "learning_rate": 8.833256819061126e-06, | |
| "loss": 0.2751, | |
| "mean_token_accuracy": 0.9041284918785095, | |
| "step": 202 | |
| }, | |
| { | |
| "epoch": 0.9441860465116279, | |
| "grad_norm": 2.8893260955810547, | |
| "learning_rate": 8.81683302525809e-06, | |
| "loss": 0.2994, | |
| "mean_token_accuracy": 0.8973665237426758, | |
| "step": 203 | |
| }, | |
| { | |
| "epoch": 0.9488372093023256, | |
| "grad_norm": 2.1813788414001465, | |
| "learning_rate": 8.800311919475902e-06, | |
| "loss": 0.2622, | |
| "mean_token_accuracy": 0.9018022418022156, | |
| "step": 204 | |
| }, | |
| { | |
| "epoch": 0.9534883720930233, | |
| "grad_norm": 2.0994787216186523, | |
| "learning_rate": 8.783693986424365e-06, | |
| "loss": 0.2628, | |
| "mean_token_accuracy": 0.9057013988494873, | |
| "step": 205 | |
| }, | |
| { | |
| "epoch": 0.958139534883721, | |
| "grad_norm": 2.2232422828674316, | |
| "learning_rate": 8.76697971365409e-06, | |
| "loss": 0.2909, | |
| "mean_token_accuracy": 0.8990663290023804, | |
| "step": 206 | |
| }, | |
| { | |
| "epoch": 0.9627906976744186, | |
| "grad_norm": 2.5452654361724854, | |
| "learning_rate": 8.750169591542177e-06, | |
| "loss": 0.3163, | |
| "mean_token_accuracy": 0.8898491859436035, | |
| "step": 207 | |
| }, | |
| { | |
| "epoch": 0.9674418604651163, | |
| "grad_norm": 2.470062017440796, | |
| "learning_rate": 8.733264113277832e-06, | |
| "loss": 0.2819, | |
| "mean_token_accuracy": 0.9040852785110474, | |
| "step": 208 | |
| }, | |
| { | |
| "epoch": 0.9720930232558139, | |
| "grad_norm": 2.2468132972717285, | |
| "learning_rate": 8.716263774847902e-06, | |
| "loss": 0.2656, | |
| "mean_token_accuracy": 0.9133898019790649, | |
| "step": 209 | |
| }, | |
| { | |
| "epoch": 0.9767441860465116, | |
| "grad_norm": 2.0833487510681152, | |
| "learning_rate": 8.69916907502232e-06, | |
| "loss": 0.2786, | |
| "mean_token_accuracy": 0.9064552187919617, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 0.9813953488372092, | |
| "grad_norm": 2.21199369430542, | |
| "learning_rate": 8.681980515339464e-06, | |
| "loss": 0.2723, | |
| "mean_token_accuracy": 0.906145453453064, | |
| "step": 211 | |
| }, | |
| { | |
| "epoch": 0.986046511627907, | |
| "grad_norm": 2.214639663696289, | |
| "learning_rate": 8.664698600091462e-06, | |
| "loss": 0.2998, | |
| "mean_token_accuracy": 0.897372841835022, | |
| "step": 212 | |
| }, | |
| { | |
| "epoch": 0.9906976744186047, | |
| "grad_norm": 2.201284408569336, | |
| "learning_rate": 8.64732383630937e-06, | |
| "loss": 0.2632, | |
| "mean_token_accuracy": 0.9081220030784607, | |
| "step": 213 | |
| }, | |
| { | |
| "epoch": 0.9953488372093023, | |
| "grad_norm": 2.226452112197876, | |
| "learning_rate": 8.629856733748325e-06, | |
| "loss": 0.3033, | |
| "mean_token_accuracy": 0.8968695402145386, | |
| "step": 214 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 2.1136155128479004, | |
| "learning_rate": 8.612297804872562e-06, | |
| "loss": 0.2636, | |
| "mean_token_accuracy": 0.9030256271362305, | |
| "step": 215 | |
| }, | |
| { | |
| "epoch": 1.0046511627906978, | |
| "grad_norm": 3.3606746196746826, | |
| "learning_rate": 8.594647564840407e-06, | |
| "loss": 0.1513, | |
| "mean_token_accuracy": 0.9528185129165649, | |
| "step": 216 | |
| }, | |
| { | |
| "epoch": 1.0093023255813953, | |
| "grad_norm": 2.7589690685272217, | |
| "learning_rate": 8.57690653148913e-06, | |
| "loss": 0.1725, | |
| "mean_token_accuracy": 0.938120424747467, | |
| "step": 217 | |
| }, | |
| { | |
| "epoch": 1.013953488372093, | |
| "grad_norm": 2.593282461166382, | |
| "learning_rate": 8.559075225319786e-06, | |
| "loss": 0.1453, | |
| "mean_token_accuracy": 0.9510069489479065, | |
| "step": 218 | |
| }, | |
| { | |
| "epoch": 1.0186046511627906, | |
| "grad_norm": 2.1907403469085693, | |
| "learning_rate": 8.54115416948192e-06, | |
| "loss": 0.1453, | |
| "mean_token_accuracy": 0.9506734013557434, | |
| "step": 219 | |
| }, | |
| { | |
| "epoch": 1.0232558139534884, | |
| "grad_norm": 2.0132081508636475, | |
| "learning_rate": 8.523143889758228e-06, | |
| "loss": 0.1195, | |
| "mean_token_accuracy": 0.9594102501869202, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 1.027906976744186, | |
| "grad_norm": 1.8184553384780884, | |
| "learning_rate": 8.505044914549131e-06, | |
| "loss": 0.1504, | |
| "mean_token_accuracy": 0.945387601852417, | |
| "step": 221 | |
| }, | |
| { | |
| "epoch": 1.0325581395348837, | |
| "grad_norm": 2.0166773796081543, | |
| "learning_rate": 8.48685777485727e-06, | |
| "loss": 0.1271, | |
| "mean_token_accuracy": 0.95333331823349, | |
| "step": 222 | |
| }, | |
| { | |
| "epoch": 1.0372093023255813, | |
| "grad_norm": 2.1910595893859863, | |
| "learning_rate": 8.46858300427193e-06, | |
| "loss": 0.1377, | |
| "mean_token_accuracy": 0.954576849937439, | |
| "step": 223 | |
| }, | |
| { | |
| "epoch": 1.041860465116279, | |
| "grad_norm": 2.6961281299591064, | |
| "learning_rate": 8.450221138953383e-06, | |
| "loss": 0.128, | |
| "mean_token_accuracy": 0.951163649559021, | |
| "step": 224 | |
| }, | |
| { | |
| "epoch": 1.0465116279069768, | |
| "grad_norm": 2.3894295692443848, | |
| "learning_rate": 8.431772717617154e-06, | |
| "loss": 0.1398, | |
| "mean_token_accuracy": 0.9508081674575806, | |
| "step": 225 | |
| }, | |
| { | |
| "epoch": 1.0511627906976744, | |
| "grad_norm": 2.134735345840454, | |
| "learning_rate": 8.413238281518225e-06, | |
| "loss": 0.1235, | |
| "mean_token_accuracy": 0.9533866047859192, | |
| "step": 226 | |
| }, | |
| { | |
| "epoch": 1.0558139534883721, | |
| "grad_norm": 2.099576711654663, | |
| "learning_rate": 8.394618374435148e-06, | |
| "loss": 0.1474, | |
| "mean_token_accuracy": 0.9495023488998413, | |
| "step": 227 | |
| }, | |
| { | |
| "epoch": 1.0604651162790697, | |
| "grad_norm": 2.013437509536743, | |
| "learning_rate": 8.375913542654093e-06, | |
| "loss": 0.1406, | |
| "mean_token_accuracy": 0.9510268568992615, | |
| "step": 228 | |
| }, | |
| { | |
| "epoch": 1.0651162790697675, | |
| "grad_norm": 2.3148350715637207, | |
| "learning_rate": 8.357124334952818e-06, | |
| "loss": 0.1454, | |
| "mean_token_accuracy": 0.9502067565917969, | |
| "step": 229 | |
| }, | |
| { | |
| "epoch": 1.069767441860465, | |
| "grad_norm": 1.961985468864441, | |
| "learning_rate": 8.33825130258458e-06, | |
| "loss": 0.1278, | |
| "mean_token_accuracy": 0.9549334645271301, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 1.0744186046511628, | |
| "grad_norm": 1.8867031335830688, | |
| "learning_rate": 8.319294999261941e-06, | |
| "loss": 0.1226, | |
| "mean_token_accuracy": 0.9560340046882629, | |
| "step": 231 | |
| }, | |
| { | |
| "epoch": 1.0790697674418606, | |
| "grad_norm": 1.8320002555847168, | |
| "learning_rate": 8.300255981140544e-06, | |
| "loss": 0.1202, | |
| "mean_token_accuracy": 0.9573019742965698, | |
| "step": 232 | |
| }, | |
| { | |
| "epoch": 1.083720930232558, | |
| "grad_norm": 2.1686620712280273, | |
| "learning_rate": 8.281134806802783e-06, | |
| "loss": 0.1502, | |
| "mean_token_accuracy": 0.9432587027549744, | |
| "step": 233 | |
| }, | |
| { | |
| "epoch": 1.0883720930232559, | |
| "grad_norm": 1.9972004890441895, | |
| "learning_rate": 8.261932037241418e-06, | |
| "loss": 0.1627, | |
| "mean_token_accuracy": 0.94051593542099, | |
| "step": 234 | |
| }, | |
| { | |
| "epoch": 1.0930232558139534, | |
| "grad_norm": 2.0510964393615723, | |
| "learning_rate": 8.242648235843123e-06, | |
| "loss": 0.1557, | |
| "mean_token_accuracy": 0.9502580761909485, | |
| "step": 235 | |
| }, | |
| { | |
| "epoch": 1.0976744186046512, | |
| "grad_norm": 1.992247462272644, | |
| "learning_rate": 8.223283968371945e-06, | |
| "loss": 0.1296, | |
| "mean_token_accuracy": 0.9547486305236816, | |
| "step": 236 | |
| }, | |
| { | |
| "epoch": 1.1023255813953488, | |
| "grad_norm": 2.0515332221984863, | |
| "learning_rate": 8.203839802952708e-06, | |
| "loss": 0.1311, | |
| "mean_token_accuracy": 0.9554937481880188, | |
| "step": 237 | |
| }, | |
| { | |
| "epoch": 1.1069767441860465, | |
| "grad_norm": 1.8534224033355713, | |
| "learning_rate": 8.184316310054355e-06, | |
| "loss": 0.1354, | |
| "mean_token_accuracy": 0.9514824748039246, | |
| "step": 238 | |
| }, | |
| { | |
| "epoch": 1.1116279069767443, | |
| "grad_norm": 2.0729804039001465, | |
| "learning_rate": 8.164714062473201e-06, | |
| "loss": 0.1397, | |
| "mean_token_accuracy": 0.9531170129776001, | |
| "step": 239 | |
| }, | |
| { | |
| "epoch": 1.1162790697674418, | |
| "grad_norm": 1.9124263525009155, | |
| "learning_rate": 8.14503363531613e-06, | |
| "loss": 0.1197, | |
| "mean_token_accuracy": 0.9569715857505798, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 1.1209302325581396, | |
| "grad_norm": 1.9606989622116089, | |
| "learning_rate": 8.125275605983725e-06, | |
| "loss": 0.1273, | |
| "mean_token_accuracy": 0.9557822942733765, | |
| "step": 241 | |
| }, | |
| { | |
| "epoch": 1.1255813953488372, | |
| "grad_norm": 2.081315755844116, | |
| "learning_rate": 8.10544055415332e-06, | |
| "loss": 0.1401, | |
| "mean_token_accuracy": 0.9516574740409851, | |
| "step": 242 | |
| }, | |
| { | |
| "epoch": 1.130232558139535, | |
| "grad_norm": 1.9782904386520386, | |
| "learning_rate": 8.085529061762007e-06, | |
| "loss": 0.1328, | |
| "mean_token_accuracy": 0.9561711549758911, | |
| "step": 243 | |
| }, | |
| { | |
| "epoch": 1.1348837209302325, | |
| "grad_norm": 2.144768238067627, | |
| "learning_rate": 8.065541712989546e-06, | |
| "loss": 0.1337, | |
| "mean_token_accuracy": 0.9531194567680359, | |
| "step": 244 | |
| }, | |
| { | |
| "epoch": 1.1395348837209303, | |
| "grad_norm": 1.9130630493164062, | |
| "learning_rate": 8.04547909424124e-06, | |
| "loss": 0.1402, | |
| "mean_token_accuracy": 0.9525547623634338, | |
| "step": 245 | |
| }, | |
| { | |
| "epoch": 1.1441860465116278, | |
| "grad_norm": 2.034174919128418, | |
| "learning_rate": 8.025341794130722e-06, | |
| "loss": 0.1402, | |
| "mean_token_accuracy": 0.947668731212616, | |
| "step": 246 | |
| }, | |
| { | |
| "epoch": 1.1488372093023256, | |
| "grad_norm": 1.8769278526306152, | |
| "learning_rate": 8.005130403462687e-06, | |
| "loss": 0.12, | |
| "mean_token_accuracy": 0.9560899138450623, | |
| "step": 247 | |
| }, | |
| { | |
| "epoch": 1.1534883720930234, | |
| "grad_norm": 1.8356506824493408, | |
| "learning_rate": 7.98484551521556e-06, | |
| "loss": 0.1351, | |
| "mean_token_accuracy": 0.9524879455566406, | |
| "step": 248 | |
| }, | |
| { | |
| "epoch": 1.158139534883721, | |
| "grad_norm": 2.1841554641723633, | |
| "learning_rate": 7.964487724524105e-06, | |
| "loss": 0.1522, | |
| "mean_token_accuracy": 0.9461566209793091, | |
| "step": 249 | |
| }, | |
| { | |
| "epoch": 1.1627906976744187, | |
| "grad_norm": 1.7897896766662598, | |
| "learning_rate": 7.944057628661948e-06, | |
| "loss": 0.1304, | |
| "mean_token_accuracy": 0.9538383483886719, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 1.1674418604651162, | |
| "grad_norm": 1.7146762609481812, | |
| "learning_rate": 7.923555827024069e-06, | |
| "loss": 0.1236, | |
| "mean_token_accuracy": 0.9551189541816711, | |
| "step": 251 | |
| }, | |
| { | |
| "epoch": 1.172093023255814, | |
| "grad_norm": 1.9337011575698853, | |
| "learning_rate": 7.902982921109215e-06, | |
| "loss": 0.1395, | |
| "mean_token_accuracy": 0.950564980506897, | |
| "step": 252 | |
| }, | |
| { | |
| "epoch": 1.1767441860465115, | |
| "grad_norm": 2.312887668609619, | |
| "learning_rate": 7.882339514502236e-06, | |
| "loss": 0.1599, | |
| "mean_token_accuracy": 0.9496940970420837, | |
| "step": 253 | |
| }, | |
| { | |
| "epoch": 1.1813953488372093, | |
| "grad_norm": 2.0187339782714844, | |
| "learning_rate": 7.861626212856404e-06, | |
| "loss": 0.1197, | |
| "mean_token_accuracy": 0.9586181640625, | |
| "step": 254 | |
| }, | |
| { | |
| "epoch": 1.1860465116279069, | |
| "grad_norm": 1.9361454248428345, | |
| "learning_rate": 7.840843623875621e-06, | |
| "loss": 0.1398, | |
| "mean_token_accuracy": 0.9482730031013489, | |
| "step": 255 | |
| }, | |
| { | |
| "epoch": 1.1906976744186046, | |
| "grad_norm": 1.932745099067688, | |
| "learning_rate": 7.8199923572966e-06, | |
| "loss": 0.137, | |
| "mean_token_accuracy": 0.9541915655136108, | |
| "step": 256 | |
| }, | |
| { | |
| "epoch": 1.1953488372093024, | |
| "grad_norm": 1.8732504844665527, | |
| "learning_rate": 7.799073024870972e-06, | |
| "loss": 0.1311, | |
| "mean_token_accuracy": 0.9530263543128967, | |
| "step": 257 | |
| }, | |
| { | |
| "epoch": 1.2, | |
| "grad_norm": 1.8641448020935059, | |
| "learning_rate": 7.778086240347343e-06, | |
| "loss": 0.1301, | |
| "mean_token_accuracy": 0.9536779522895813, | |
| "step": 258 | |
| }, | |
| { | |
| "epoch": 1.2046511627906977, | |
| "grad_norm": 1.8090254068374634, | |
| "learning_rate": 7.757032619453285e-06, | |
| "loss": 0.1179, | |
| "mean_token_accuracy": 0.9588613510131836, | |
| "step": 259 | |
| }, | |
| { | |
| "epoch": 1.2093023255813953, | |
| "grad_norm": 1.9466335773468018, | |
| "learning_rate": 7.735912779877266e-06, | |
| "loss": 0.1432, | |
| "mean_token_accuracy": 0.9497014880180359, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 1.213953488372093, | |
| "grad_norm": 2.1102936267852783, | |
| "learning_rate": 7.714727341250533e-06, | |
| "loss": 0.1516, | |
| "mean_token_accuracy": 0.9480257034301758, | |
| "step": 261 | |
| }, | |
| { | |
| "epoch": 1.2186046511627908, | |
| "grad_norm": 1.830043911933899, | |
| "learning_rate": 7.693476925128937e-06, | |
| "loss": 0.1471, | |
| "mean_token_accuracy": 0.9475498795509338, | |
| "step": 262 | |
| }, | |
| { | |
| "epoch": 1.2232558139534884, | |
| "grad_norm": 1.9706553220748901, | |
| "learning_rate": 7.672162154974686e-06, | |
| "loss": 0.1441, | |
| "mean_token_accuracy": 0.9502365589141846, | |
| "step": 263 | |
| }, | |
| { | |
| "epoch": 1.2279069767441861, | |
| "grad_norm": 1.7491787672042847, | |
| "learning_rate": 7.650783656138065e-06, | |
| "loss": 0.1379, | |
| "mean_token_accuracy": 0.9508991241455078, | |
| "step": 264 | |
| }, | |
| { | |
| "epoch": 1.2325581395348837, | |
| "grad_norm": 1.9815034866333008, | |
| "learning_rate": 7.629342055839077e-06, | |
| "loss": 0.1638, | |
| "mean_token_accuracy": 0.9426482915878296, | |
| "step": 265 | |
| }, | |
| { | |
| "epoch": 1.2372093023255815, | |
| "grad_norm": 2.0385522842407227, | |
| "learning_rate": 7.607837983149057e-06, | |
| "loss": 0.1593, | |
| "mean_token_accuracy": 0.9459502696990967, | |
| "step": 266 | |
| }, | |
| { | |
| "epoch": 1.241860465116279, | |
| "grad_norm": 2.1366653442382812, | |
| "learning_rate": 7.586272068972196e-06, | |
| "loss": 0.1831, | |
| "mean_token_accuracy": 0.9355138540267944, | |
| "step": 267 | |
| }, | |
| { | |
| "epoch": 1.2465116279069768, | |
| "grad_norm": 1.7888002395629883, | |
| "learning_rate": 7.564644946027049e-06, | |
| "loss": 0.1226, | |
| "mean_token_accuracy": 0.9529392123222351, | |
| "step": 268 | |
| }, | |
| { | |
| "epoch": 1.2511627906976743, | |
| "grad_norm": 2.0460989475250244, | |
| "learning_rate": 7.5429572488279615e-06, | |
| "loss": 0.1344, | |
| "mean_token_accuracy": 0.9502557516098022, | |
| "step": 269 | |
| }, | |
| { | |
| "epoch": 1.255813953488372, | |
| "grad_norm": 1.8217569589614868, | |
| "learning_rate": 7.521209613666457e-06, | |
| "loss": 0.1224, | |
| "mean_token_accuracy": 0.9609270095825195, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 1.2604651162790699, | |
| "grad_norm": 1.8216779232025146, | |
| "learning_rate": 7.499402678592568e-06, | |
| "loss": 0.1362, | |
| "mean_token_accuracy": 0.9506351351737976, | |
| "step": 271 | |
| }, | |
| { | |
| "epoch": 1.2651162790697674, | |
| "grad_norm": 1.7524104118347168, | |
| "learning_rate": 7.477537083396114e-06, | |
| "loss": 0.1204, | |
| "mean_token_accuracy": 0.9553118348121643, | |
| "step": 272 | |
| }, | |
| { | |
| "epoch": 1.2697674418604652, | |
| "grad_norm": 1.975805640220642, | |
| "learning_rate": 7.45561346958794e-06, | |
| "loss": 0.1201, | |
| "mean_token_accuracy": 0.9567315578460693, | |
| "step": 273 | |
| }, | |
| { | |
| "epoch": 1.2744186046511627, | |
| "grad_norm": 1.6656185388565063, | |
| "learning_rate": 7.433632480381083e-06, | |
| "loss": 0.1097, | |
| "mean_token_accuracy": 0.9608015418052673, | |
| "step": 274 | |
| }, | |
| { | |
| "epoch": 1.2790697674418605, | |
| "grad_norm": 1.9660391807556152, | |
| "learning_rate": 7.4115947606719105e-06, | |
| "loss": 0.136, | |
| "mean_token_accuracy": 0.9484320282936096, | |
| "step": 275 | |
| }, | |
| { | |
| "epoch": 1.283720930232558, | |
| "grad_norm": 1.9652019739151, | |
| "learning_rate": 7.389500957021192e-06, | |
| "loss": 0.1188, | |
| "mean_token_accuracy": 0.9587832689285278, | |
| "step": 276 | |
| }, | |
| { | |
| "epoch": 1.2883720930232558, | |
| "grad_norm": 2.1324007511138916, | |
| "learning_rate": 7.367351717635136e-06, | |
| "loss": 0.1426, | |
| "mean_token_accuracy": 0.9486826062202454, | |
| "step": 277 | |
| }, | |
| { | |
| "epoch": 1.2930232558139534, | |
| "grad_norm": 2.0965774059295654, | |
| "learning_rate": 7.345147692346373e-06, | |
| "loss": 0.1353, | |
| "mean_token_accuracy": 0.9534883499145508, | |
| "step": 278 | |
| }, | |
| { | |
| "epoch": 1.2976744186046512, | |
| "grad_norm": 1.8807930946350098, | |
| "learning_rate": 7.3228895325948835e-06, | |
| "loss": 0.1245, | |
| "mean_token_accuracy": 0.9569152593612671, | |
| "step": 279 | |
| }, | |
| { | |
| "epoch": 1.302325581395349, | |
| "grad_norm": 1.9116649627685547, | |
| "learning_rate": 7.3005778914088895e-06, | |
| "loss": 0.1232, | |
| "mean_token_accuracy": 0.9569117426872253, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 1.3069767441860465, | |
| "grad_norm": 2.0371623039245605, | |
| "learning_rate": 7.278213423385701e-06, | |
| "loss": 0.146, | |
| "mean_token_accuracy": 0.9478211998939514, | |
| "step": 281 | |
| }, | |
| { | |
| "epoch": 1.3116279069767443, | |
| "grad_norm": 2.396204710006714, | |
| "learning_rate": 7.255796784672496e-06, | |
| "loss": 0.1844, | |
| "mean_token_accuracy": 0.9387242794036865, | |
| "step": 282 | |
| }, | |
| { | |
| "epoch": 1.3162790697674418, | |
| "grad_norm": 1.8520818948745728, | |
| "learning_rate": 7.233328632947087e-06, | |
| "loss": 0.1248, | |
| "mean_token_accuracy": 0.9575390219688416, | |
| "step": 283 | |
| }, | |
| { | |
| "epoch": 1.3209302325581396, | |
| "grad_norm": 4.048036575317383, | |
| "learning_rate": 7.210809627398615e-06, | |
| "loss": 0.1537, | |
| "mean_token_accuracy": 0.9447412490844727, | |
| "step": 284 | |
| }, | |
| { | |
| "epoch": 1.3255813953488373, | |
| "grad_norm": 1.67165207862854, | |
| "learning_rate": 7.188240428708211e-06, | |
| "loss": 0.1078, | |
| "mean_token_accuracy": 0.9622266292572021, | |
| "step": 285 | |
| }, | |
| { | |
| "epoch": 1.330232558139535, | |
| "grad_norm": 1.8730194568634033, | |
| "learning_rate": 7.165621699029615e-06, | |
| "loss": 0.1453, | |
| "mean_token_accuracy": 0.9500071406364441, | |
| "step": 286 | |
| }, | |
| { | |
| "epoch": 1.3348837209302324, | |
| "grad_norm": 1.767138123512268, | |
| "learning_rate": 7.1429541019697505e-06, | |
| "loss": 0.1418, | |
| "mean_token_accuracy": 0.9493996500968933, | |
| "step": 287 | |
| }, | |
| { | |
| "epoch": 1.3395348837209302, | |
| "grad_norm": 2.1134703159332275, | |
| "learning_rate": 7.120238302569245e-06, | |
| "loss": 0.1547, | |
| "mean_token_accuracy": 0.9479333758354187, | |
| "step": 288 | |
| }, | |
| { | |
| "epoch": 1.344186046511628, | |
| "grad_norm": 2.0318989753723145, | |
| "learning_rate": 7.097474967282936e-06, | |
| "loss": 0.1399, | |
| "mean_token_accuracy": 0.9505158066749573, | |
| "step": 289 | |
| }, | |
| { | |
| "epoch": 1.3488372093023255, | |
| "grad_norm": 2.1438822746276855, | |
| "learning_rate": 7.0746647639602994e-06, | |
| "loss": 0.146, | |
| "mean_token_accuracy": 0.9493649005889893, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 1.3534883720930233, | |
| "grad_norm": 2.045762777328491, | |
| "learning_rate": 7.051808361825867e-06, | |
| "loss": 0.1546, | |
| "mean_token_accuracy": 0.9482935070991516, | |
| "step": 291 | |
| }, | |
| { | |
| "epoch": 1.3581395348837209, | |
| "grad_norm": 2.4444692134857178, | |
| "learning_rate": 7.028906431459593e-06, | |
| "loss": 0.163, | |
| "mean_token_accuracy": 0.9413919448852539, | |
| "step": 292 | |
| }, | |
| { | |
| "epoch": 1.3627906976744186, | |
| "grad_norm": 2.065103769302368, | |
| "learning_rate": 7.0059596447771714e-06, | |
| "loss": 0.1445, | |
| "mean_token_accuracy": 0.9467507600784302, | |
| "step": 293 | |
| }, | |
| { | |
| "epoch": 1.3674418604651164, | |
| "grad_norm": 1.9953572750091553, | |
| "learning_rate": 6.982968675010332e-06, | |
| "loss": 0.1237, | |
| "mean_token_accuracy": 0.9579423666000366, | |
| "step": 294 | |
| }, | |
| { | |
| "epoch": 1.372093023255814, | |
| "grad_norm": 1.9525924921035767, | |
| "learning_rate": 6.959934196687079e-06, | |
| "loss": 0.1462, | |
| "mean_token_accuracy": 0.9512315988540649, | |
| "step": 295 | |
| }, | |
| { | |
| "epoch": 1.3767441860465115, | |
| "grad_norm": 2.0204193592071533, | |
| "learning_rate": 6.93685688561191e-06, | |
| "loss": 0.147, | |
| "mean_token_accuracy": 0.9485055804252625, | |
| "step": 296 | |
| }, | |
| { | |
| "epoch": 1.3813953488372093, | |
| "grad_norm": 2.029042959213257, | |
| "learning_rate": 6.913737418845985e-06, | |
| "loss": 0.1403, | |
| "mean_token_accuracy": 0.9497275352478027, | |
| "step": 297 | |
| }, | |
| { | |
| "epoch": 1.386046511627907, | |
| "grad_norm": 1.9784486293792725, | |
| "learning_rate": 6.890576474687264e-06, | |
| "loss": 0.1365, | |
| "mean_token_accuracy": 0.9519021511077881, | |
| "step": 298 | |
| }, | |
| { | |
| "epoch": 1.3906976744186046, | |
| "grad_norm": 1.9087692499160767, | |
| "learning_rate": 6.8673747326506e-06, | |
| "loss": 0.1382, | |
| "mean_token_accuracy": 0.9500246644020081, | |
| "step": 299 | |
| }, | |
| { | |
| "epoch": 1.3953488372093024, | |
| "grad_norm": 1.8645182847976685, | |
| "learning_rate": 6.8441328734478115e-06, | |
| "loss": 0.133, | |
| "mean_token_accuracy": 0.9523329734802246, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 1.4, | |
| "grad_norm": 1.7279090881347656, | |
| "learning_rate": 6.820851578967708e-06, | |
| "loss": 0.1288, | |
| "mean_token_accuracy": 0.9540249109268188, | |
| "step": 301 | |
| }, | |
| { | |
| "epoch": 1.4046511627906977, | |
| "grad_norm": 1.8317281007766724, | |
| "learning_rate": 6.797531532256079e-06, | |
| "loss": 0.1435, | |
| "mean_token_accuracy": 0.947135865688324, | |
| "step": 302 | |
| }, | |
| { | |
| "epoch": 1.4093023255813955, | |
| "grad_norm": 1.9698084592819214, | |
| "learning_rate": 6.774173417495667e-06, | |
| "loss": 0.1512, | |
| "mean_token_accuracy": 0.9412643313407898, | |
| "step": 303 | |
| }, | |
| { | |
| "epoch": 1.413953488372093, | |
| "grad_norm": 1.7703008651733398, | |
| "learning_rate": 6.750777919986075e-06, | |
| "loss": 0.1383, | |
| "mean_token_accuracy": 0.9496229290962219, | |
| "step": 304 | |
| }, | |
| { | |
| "epoch": 1.4186046511627908, | |
| "grad_norm": 1.9811159372329712, | |
| "learning_rate": 6.727345726123684e-06, | |
| "loss": 0.1715, | |
| "mean_token_accuracy": 0.9391480684280396, | |
| "step": 305 | |
| }, | |
| { | |
| "epoch": 1.4232558139534883, | |
| "grad_norm": 1.7490876913070679, | |
| "learning_rate": 6.703877523381495e-06, | |
| "loss": 0.1267, | |
| "mean_token_accuracy": 0.9528796076774597, | |
| "step": 306 | |
| }, | |
| { | |
| "epoch": 1.427906976744186, | |
| "grad_norm": 1.9982609748840332, | |
| "learning_rate": 6.680374000288968e-06, | |
| "loss": 0.1325, | |
| "mean_token_accuracy": 0.9569318890571594, | |
| "step": 307 | |
| }, | |
| { | |
| "epoch": 1.4325581395348836, | |
| "grad_norm": 1.940192461013794, | |
| "learning_rate": 6.656835846411824e-06, | |
| "loss": 0.1466, | |
| "mean_token_accuracy": 0.9504638314247131, | |
| "step": 308 | |
| }, | |
| { | |
| "epoch": 1.4372093023255814, | |
| "grad_norm": 2.010435104370117, | |
| "learning_rate": 6.633263752331808e-06, | |
| "loss": 0.1462, | |
| "mean_token_accuracy": 0.9526048302650452, | |
| "step": 309 | |
| }, | |
| { | |
| "epoch": 1.441860465116279, | |
| "grad_norm": 1.848711371421814, | |
| "learning_rate": 6.609658409626431e-06, | |
| "loss": 0.1356, | |
| "mean_token_accuracy": 0.9486258625984192, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 1.4465116279069767, | |
| "grad_norm": 1.9631938934326172, | |
| "learning_rate": 6.586020510848676e-06, | |
| "loss": 0.1161, | |
| "mean_token_accuracy": 0.9588515162467957, | |
| "step": 311 | |
| }, | |
| { | |
| "epoch": 1.4511627906976745, | |
| "grad_norm": 2.154928207397461, | |
| "learning_rate": 6.562350749506691e-06, | |
| "loss": 0.1685, | |
| "mean_token_accuracy": 0.9434839487075806, | |
| "step": 312 | |
| }, | |
| { | |
| "epoch": 1.455813953488372, | |
| "grad_norm": 1.8358088731765747, | |
| "learning_rate": 6.538649820043427e-06, | |
| "loss": 0.1409, | |
| "mean_token_accuracy": 0.9509722590446472, | |
| "step": 313 | |
| }, | |
| { | |
| "epoch": 1.4604651162790698, | |
| "grad_norm": 1.9285755157470703, | |
| "learning_rate": 6.514918417816275e-06, | |
| "loss": 0.1319, | |
| "mean_token_accuracy": 0.9517412781715393, | |
| "step": 314 | |
| }, | |
| { | |
| "epoch": 1.4651162790697674, | |
| "grad_norm": 1.847544550895691, | |
| "learning_rate": 6.4911572390766575e-06, | |
| "loss": 0.1345, | |
| "mean_token_accuracy": 0.9501661062240601, | |
| "step": 315 | |
| }, | |
| { | |
| "epoch": 1.4697674418604652, | |
| "grad_norm": 2.1781485080718994, | |
| "learning_rate": 6.46736698094961e-06, | |
| "loss": 0.165, | |
| "mean_token_accuracy": 0.9442425966262817, | |
| "step": 316 | |
| }, | |
| { | |
| "epoch": 1.474418604651163, | |
| "grad_norm": 2.6374707221984863, | |
| "learning_rate": 6.443548341413316e-06, | |
| "loss": 0.1405, | |
| "mean_token_accuracy": 0.948967695236206, | |
| "step": 317 | |
| }, | |
| { | |
| "epoch": 1.4790697674418605, | |
| "grad_norm": 1.8847520351409912, | |
| "learning_rate": 6.419702019278643e-06, | |
| "loss": 0.1415, | |
| "mean_token_accuracy": 0.9527637958526611, | |
| "step": 318 | |
| }, | |
| { | |
| "epoch": 1.483720930232558, | |
| "grad_norm": 2.0058882236480713, | |
| "learning_rate": 6.3958287141686294e-06, | |
| "loss": 0.1419, | |
| "mean_token_accuracy": 0.948972225189209, | |
| "step": 319 | |
| }, | |
| { | |
| "epoch": 1.4883720930232558, | |
| "grad_norm": 1.837763786315918, | |
| "learning_rate": 6.371929126497963e-06, | |
| "loss": 0.119, | |
| "mean_token_accuracy": 0.9574694037437439, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 1.4930232558139536, | |
| "grad_norm": 1.9148606061935425, | |
| "learning_rate": 6.348003957452433e-06, | |
| "loss": 0.1352, | |
| "mean_token_accuracy": 0.9492248296737671, | |
| "step": 321 | |
| }, | |
| { | |
| "epoch": 1.4976744186046511, | |
| "grad_norm": 1.9753315448760986, | |
| "learning_rate": 6.324053908968353e-06, | |
| "loss": 0.1364, | |
| "mean_token_accuracy": 0.9513832330703735, | |
| "step": 322 | |
| }, | |
| { | |
| "epoch": 1.5023255813953489, | |
| "grad_norm": 1.8429263830184937, | |
| "learning_rate": 6.300079683711973e-06, | |
| "loss": 0.1237, | |
| "mean_token_accuracy": 0.9562457203865051, | |
| "step": 323 | |
| }, | |
| { | |
| "epoch": 1.5069767441860464, | |
| "grad_norm": 1.7931606769561768, | |
| "learning_rate": 6.276081985058857e-06, | |
| "loss": 0.1089, | |
| "mean_token_accuracy": 0.9609548449516296, | |
| "step": 324 | |
| }, | |
| { | |
| "epoch": 1.5116279069767442, | |
| "grad_norm": 1.9909682273864746, | |
| "learning_rate": 6.2520615170732555e-06, | |
| "loss": 0.1365, | |
| "mean_token_accuracy": 0.9544373154640198, | |
| "step": 325 | |
| }, | |
| { | |
| "epoch": 1.516279069767442, | |
| "grad_norm": 2.083770990371704, | |
| "learning_rate": 6.228018984487443e-06, | |
| "loss": 0.1527, | |
| "mean_token_accuracy": 0.9463026523590088, | |
| "step": 326 | |
| }, | |
| { | |
| "epoch": 1.5209302325581395, | |
| "grad_norm": 2.060635805130005, | |
| "learning_rate": 6.20395509268104e-06, | |
| "loss": 0.1416, | |
| "mean_token_accuracy": 0.9506000876426697, | |
| "step": 327 | |
| }, | |
| { | |
| "epoch": 1.525581395348837, | |
| "grad_norm": 2.266390323638916, | |
| "learning_rate": 6.179870547660326e-06, | |
| "loss": 0.1769, | |
| "mean_token_accuracy": 0.9442271590232849, | |
| "step": 328 | |
| }, | |
| { | |
| "epoch": 1.5302325581395348, | |
| "grad_norm": 1.9692381620407104, | |
| "learning_rate": 6.15576605603752e-06, | |
| "loss": 0.1344, | |
| "mean_token_accuracy": 0.9521507024765015, | |
| "step": 329 | |
| }, | |
| { | |
| "epoch": 1.5348837209302326, | |
| "grad_norm": 1.6992781162261963, | |
| "learning_rate": 6.13164232501005e-06, | |
| "loss": 0.1169, | |
| "mean_token_accuracy": 0.9589894413948059, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 1.5395348837209304, | |
| "grad_norm": 1.78009831905365, | |
| "learning_rate": 6.107500062339806e-06, | |
| "loss": 0.1232, | |
| "mean_token_accuracy": 0.9531930088996887, | |
| "step": 331 | |
| }, | |
| { | |
| "epoch": 1.544186046511628, | |
| "grad_norm": 1.8769017457962036, | |
| "learning_rate": 6.083339976332375e-06, | |
| "loss": 0.1308, | |
| "mean_token_accuracy": 0.9528769850730896, | |
| "step": 332 | |
| }, | |
| { | |
| "epoch": 1.5488372093023255, | |
| "grad_norm": 1.9236352443695068, | |
| "learning_rate": 6.05916277581626e-06, | |
| "loss": 0.1425, | |
| "mean_token_accuracy": 0.9482171535491943, | |
| "step": 333 | |
| }, | |
| { | |
| "epoch": 1.5534883720930233, | |
| "grad_norm": 1.9040541648864746, | |
| "learning_rate": 6.034969170122079e-06, | |
| "loss": 0.1294, | |
| "mean_token_accuracy": 0.9605388045310974, | |
| "step": 334 | |
| }, | |
| { | |
| "epoch": 1.558139534883721, | |
| "grad_norm": 1.9620603322982788, | |
| "learning_rate": 6.010759869061768e-06, | |
| "loss": 0.1617, | |
| "mean_token_accuracy": 0.9422249794006348, | |
| "step": 335 | |
| }, | |
| { | |
| "epoch": 1.5627906976744186, | |
| "grad_norm": 1.784496784210205, | |
| "learning_rate": 5.986535582907739e-06, | |
| "loss": 0.1198, | |
| "mean_token_accuracy": 0.957058310508728, | |
| "step": 336 | |
| }, | |
| { | |
| "epoch": 1.5674418604651161, | |
| "grad_norm": 1.819798231124878, | |
| "learning_rate": 5.96229702237205e-06, | |
| "loss": 0.1157, | |
| "mean_token_accuracy": 0.9596412777900696, | |
| "step": 337 | |
| }, | |
| { | |
| "epoch": 1.572093023255814, | |
| "grad_norm": 1.9021272659301758, | |
| "learning_rate": 5.938044898585555e-06, | |
| "loss": 0.1374, | |
| "mean_token_accuracy": 0.9488742351531982, | |
| "step": 338 | |
| }, | |
| { | |
| "epoch": 1.5767441860465117, | |
| "grad_norm": 1.9908572435379028, | |
| "learning_rate": 5.913779923077035e-06, | |
| "loss": 0.1597, | |
| "mean_token_accuracy": 0.9456487894058228, | |
| "step": 339 | |
| }, | |
| { | |
| "epoch": 1.5813953488372094, | |
| "grad_norm": 1.9344072341918945, | |
| "learning_rate": 5.889502807752329e-06, | |
| "loss": 0.152, | |
| "mean_token_accuracy": 0.9439780712127686, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 1.586046511627907, | |
| "grad_norm": 1.9438843727111816, | |
| "learning_rate": 5.865214264873441e-06, | |
| "loss": 0.1355, | |
| "mean_token_accuracy": 0.9536268711090088, | |
| "step": 341 | |
| }, | |
| { | |
| "epoch": 1.5906976744186045, | |
| "grad_norm": 1.8337723016738892, | |
| "learning_rate": 5.840915007037648e-06, | |
| "loss": 0.1248, | |
| "mean_token_accuracy": 0.9561098217964172, | |
| "step": 342 | |
| }, | |
| { | |
| "epoch": 1.5953488372093023, | |
| "grad_norm": 2.127720594406128, | |
| "learning_rate": 5.816605747156588e-06, | |
| "loss": 0.1514, | |
| "mean_token_accuracy": 0.9452188014984131, | |
| "step": 343 | |
| }, | |
| { | |
| "epoch": 1.6, | |
| "grad_norm": 1.8010351657867432, | |
| "learning_rate": 5.792287198435349e-06, | |
| "loss": 0.1372, | |
| "mean_token_accuracy": 0.9540988802909851, | |
| "step": 344 | |
| }, | |
| { | |
| "epoch": 1.6046511627906976, | |
| "grad_norm": 1.8526756763458252, | |
| "learning_rate": 5.767960074351545e-06, | |
| "loss": 0.1394, | |
| "mean_token_accuracy": 0.953599214553833, | |
| "step": 345 | |
| }, | |
| { | |
| "epoch": 1.6093023255813952, | |
| "grad_norm": 1.8736450672149658, | |
| "learning_rate": 5.74362508863438e-06, | |
| "loss": 0.1274, | |
| "mean_token_accuracy": 0.953865110874176, | |
| "step": 346 | |
| }, | |
| { | |
| "epoch": 1.613953488372093, | |
| "grad_norm": 2.073957920074463, | |
| "learning_rate": 5.719282955243705e-06, | |
| "loss": 0.1559, | |
| "mean_token_accuracy": 0.9409741163253784, | |
| "step": 347 | |
| }, | |
| { | |
| "epoch": 1.6186046511627907, | |
| "grad_norm": 2.255732536315918, | |
| "learning_rate": 5.69493438834908e-06, | |
| "loss": 0.1601, | |
| "mean_token_accuracy": 0.9462425708770752, | |
| "step": 348 | |
| }, | |
| { | |
| "epoch": 1.6232558139534885, | |
| "grad_norm": 2.0009047985076904, | |
| "learning_rate": 5.670580102308816e-06, | |
| "loss": 0.1326, | |
| "mean_token_accuracy": 0.9542755484580994, | |
| "step": 349 | |
| }, | |
| { | |
| "epoch": 1.627906976744186, | |
| "grad_norm": 1.8203014135360718, | |
| "learning_rate": 5.646220811649013e-06, | |
| "loss": 0.1201, | |
| "mean_token_accuracy": 0.9584925174713135, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 1.6325581395348836, | |
| "grad_norm": 2.1540281772613525, | |
| "learning_rate": 5.6218572310426065e-06, | |
| "loss": 0.1561, | |
| "mean_token_accuracy": 0.9470699429512024, | |
| "step": 351 | |
| }, | |
| { | |
| "epoch": 1.6372093023255814, | |
| "grad_norm": 1.8674291372299194, | |
| "learning_rate": 5.59749007528839e-06, | |
| "loss": 0.1381, | |
| "mean_token_accuracy": 0.9516509175300598, | |
| "step": 352 | |
| }, | |
| { | |
| "epoch": 1.6418604651162791, | |
| "grad_norm": 1.9634373188018799, | |
| "learning_rate": 5.573120059290047e-06, | |
| "loss": 0.142, | |
| "mean_token_accuracy": 0.9484654664993286, | |
| "step": 353 | |
| }, | |
| { | |
| "epoch": 1.6465116279069767, | |
| "grad_norm": 1.9212641716003418, | |
| "learning_rate": 5.5487478980351805e-06, | |
| "loss": 0.1452, | |
| "mean_token_accuracy": 0.9457268714904785, | |
| "step": 354 | |
| }, | |
| { | |
| "epoch": 1.6511627906976745, | |
| "grad_norm": 1.8786492347717285, | |
| "learning_rate": 5.524374306574331e-06, | |
| "loss": 0.1186, | |
| "mean_token_accuracy": 0.9576781392097473, | |
| "step": 355 | |
| }, | |
| { | |
| "epoch": 1.655813953488372, | |
| "grad_norm": 1.8229862451553345, | |
| "learning_rate": 5.500000000000001e-06, | |
| "loss": 0.1398, | |
| "mean_token_accuracy": 0.9506021738052368, | |
| "step": 356 | |
| }, | |
| { | |
| "epoch": 1.6604651162790698, | |
| "grad_norm": 1.99154531955719, | |
| "learning_rate": 5.47562569342567e-06, | |
| "loss": 0.1332, | |
| "mean_token_accuracy": 0.9508275985717773, | |
| "step": 357 | |
| }, | |
| { | |
| "epoch": 1.6651162790697676, | |
| "grad_norm": 1.8731307983398438, | |
| "learning_rate": 5.451252101964821e-06, | |
| "loss": 0.1318, | |
| "mean_token_accuracy": 0.9521738886833191, | |
| "step": 358 | |
| }, | |
| { | |
| "epoch": 1.669767441860465, | |
| "grad_norm": 2.3059403896331787, | |
| "learning_rate": 5.426879940709956e-06, | |
| "loss": 0.1782, | |
| "mean_token_accuracy": 0.9378255605697632, | |
| "step": 359 | |
| }, | |
| { | |
| "epoch": 1.6744186046511627, | |
| "grad_norm": 1.8346630334854126, | |
| "learning_rate": 5.402509924711612e-06, | |
| "loss": 0.1248, | |
| "mean_token_accuracy": 0.9567375779151917, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 1.6790697674418604, | |
| "grad_norm": 2.249401569366455, | |
| "learning_rate": 5.378142768957396e-06, | |
| "loss": 0.165, | |
| "mean_token_accuracy": 0.9445608258247375, | |
| "step": 361 | |
| }, | |
| { | |
| "epoch": 1.6837209302325582, | |
| "grad_norm": 2.1428322792053223, | |
| "learning_rate": 5.353779188350989e-06, | |
| "loss": 0.1536, | |
| "mean_token_accuracy": 0.9398339986801147, | |
| "step": 362 | |
| }, | |
| { | |
| "epoch": 1.688372093023256, | |
| "grad_norm": 1.8637951612472534, | |
| "learning_rate": 5.329419897691187e-06, | |
| "loss": 0.1284, | |
| "mean_token_accuracy": 0.9572995901107788, | |
| "step": 363 | |
| }, | |
| { | |
| "epoch": 1.6930232558139535, | |
| "grad_norm": 2.081277847290039, | |
| "learning_rate": 5.305065611650921e-06, | |
| "loss": 0.1269, | |
| "mean_token_accuracy": 0.9535707831382751, | |
| "step": 364 | |
| }, | |
| { | |
| "epoch": 1.697674418604651, | |
| "grad_norm": 1.8109171390533447, | |
| "learning_rate": 5.280717044756298e-06, | |
| "loss": 0.1332, | |
| "mean_token_accuracy": 0.9521582722663879, | |
| "step": 365 | |
| }, | |
| { | |
| "epoch": 1.7023255813953488, | |
| "grad_norm": 1.8539905548095703, | |
| "learning_rate": 5.256374911365621e-06, | |
| "loss": 0.141, | |
| "mean_token_accuracy": 0.948835015296936, | |
| "step": 366 | |
| }, | |
| { | |
| "epoch": 1.7069767441860466, | |
| "grad_norm": 1.6707813739776611, | |
| "learning_rate": 5.232039925648457e-06, | |
| "loss": 0.1112, | |
| "mean_token_accuracy": 0.9606493711471558, | |
| "step": 367 | |
| }, | |
| { | |
| "epoch": 1.7116279069767442, | |
| "grad_norm": 1.7835884094238281, | |
| "learning_rate": 5.207712801564652e-06, | |
| "loss": 0.1217, | |
| "mean_token_accuracy": 0.9547820687294006, | |
| "step": 368 | |
| }, | |
| { | |
| "epoch": 1.7162790697674417, | |
| "grad_norm": 1.926405668258667, | |
| "learning_rate": 5.1833942528434145e-06, | |
| "loss": 0.1283, | |
| "mean_token_accuracy": 0.954860508441925, | |
| "step": 369 | |
| }, | |
| { | |
| "epoch": 1.7209302325581395, | |
| "grad_norm": 1.9628880023956299, | |
| "learning_rate": 5.159084992962354e-06, | |
| "loss": 0.1176, | |
| "mean_token_accuracy": 0.9579154849052429, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 1.7255813953488373, | |
| "grad_norm": 1.838537335395813, | |
| "learning_rate": 5.13478573512656e-06, | |
| "loss": 0.1516, | |
| "mean_token_accuracy": 0.9484519958496094, | |
| "step": 371 | |
| }, | |
| { | |
| "epoch": 1.730232558139535, | |
| "grad_norm": 1.7399450540542603, | |
| "learning_rate": 5.110497192247671e-06, | |
| "loss": 0.1274, | |
| "mean_token_accuracy": 0.9532235264778137, | |
| "step": 372 | |
| }, | |
| { | |
| "epoch": 1.7348837209302326, | |
| "grad_norm": 1.798194169998169, | |
| "learning_rate": 5.086220076922965e-06, | |
| "loss": 0.1225, | |
| "mean_token_accuracy": 0.9570792317390442, | |
| "step": 373 | |
| }, | |
| { | |
| "epoch": 1.7395348837209301, | |
| "grad_norm": 2.0451667308807373, | |
| "learning_rate": 5.061955101414448e-06, | |
| "loss": 0.1517, | |
| "mean_token_accuracy": 0.9501442909240723, | |
| "step": 374 | |
| }, | |
| { | |
| "epoch": 1.744186046511628, | |
| "grad_norm": 1.874577522277832, | |
| "learning_rate": 5.0377029776279514e-06, | |
| "loss": 0.1227, | |
| "mean_token_accuracy": 0.9561297297477722, | |
| "step": 375 | |
| }, | |
| { | |
| "epoch": 1.7488372093023257, | |
| "grad_norm": 1.733536958694458, | |
| "learning_rate": 5.013464417092263e-06, | |
| "loss": 0.1146, | |
| "mean_token_accuracy": 0.9611798524856567, | |
| "step": 376 | |
| }, | |
| { | |
| "epoch": 1.7534883720930232, | |
| "grad_norm": 1.8131812810897827, | |
| "learning_rate": 4.989240130938232e-06, | |
| "loss": 0.1218, | |
| "mean_token_accuracy": 0.9619940519332886, | |
| "step": 377 | |
| }, | |
| { | |
| "epoch": 1.7581395348837208, | |
| "grad_norm": 1.9327350854873657, | |
| "learning_rate": 4.9650308298779215e-06, | |
| "loss": 0.1452, | |
| "mean_token_accuracy": 0.9495870471000671, | |
| "step": 378 | |
| }, | |
| { | |
| "epoch": 1.7627906976744185, | |
| "grad_norm": 1.914912223815918, | |
| "learning_rate": 4.940837224183742e-06, | |
| "loss": 0.1221, | |
| "mean_token_accuracy": 0.956214189529419, | |
| "step": 379 | |
| }, | |
| { | |
| "epoch": 1.7674418604651163, | |
| "grad_norm": 1.8603955507278442, | |
| "learning_rate": 4.916660023667627e-06, | |
| "loss": 0.1394, | |
| "mean_token_accuracy": 0.9508364796638489, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 1.772093023255814, | |
| "grad_norm": 2.003020763397217, | |
| "learning_rate": 4.892499937660195e-06, | |
| "loss": 0.1318, | |
| "mean_token_accuracy": 0.951373815536499, | |
| "step": 381 | |
| }, | |
| { | |
| "epoch": 1.7767441860465116, | |
| "grad_norm": 2.2919867038726807, | |
| "learning_rate": 4.8683576749899505e-06, | |
| "loss": 0.1521, | |
| "mean_token_accuracy": 0.9484791159629822, | |
| "step": 382 | |
| }, | |
| { | |
| "epoch": 1.7813953488372092, | |
| "grad_norm": 1.9706724882125854, | |
| "learning_rate": 4.844233943962481e-06, | |
| "loss": 0.1103, | |
| "mean_token_accuracy": 0.9585579037666321, | |
| "step": 383 | |
| }, | |
| { | |
| "epoch": 1.786046511627907, | |
| "grad_norm": 1.9017114639282227, | |
| "learning_rate": 4.820129452339676e-06, | |
| "loss": 0.1439, | |
| "mean_token_accuracy": 0.9472662806510925, | |
| "step": 384 | |
| }, | |
| { | |
| "epoch": 1.7906976744186047, | |
| "grad_norm": 1.9794905185699463, | |
| "learning_rate": 4.796044907318961e-06, | |
| "loss": 0.137, | |
| "mean_token_accuracy": 0.9533417224884033, | |
| "step": 385 | |
| }, | |
| { | |
| "epoch": 1.7953488372093023, | |
| "grad_norm": 2.379739284515381, | |
| "learning_rate": 4.771981015512559e-06, | |
| "loss": 0.1763, | |
| "mean_token_accuracy": 0.9416927695274353, | |
| "step": 386 | |
| }, | |
| { | |
| "epoch": 1.8, | |
| "grad_norm": 1.9658362865447998, | |
| "learning_rate": 4.747938482926746e-06, | |
| "loss": 0.1481, | |
| "mean_token_accuracy": 0.9476566314697266, | |
| "step": 387 | |
| }, | |
| { | |
| "epoch": 1.8046511627906976, | |
| "grad_norm": 1.9675973653793335, | |
| "learning_rate": 4.723918014941144e-06, | |
| "loss": 0.1353, | |
| "mean_token_accuracy": 0.9520778656005859, | |
| "step": 388 | |
| }, | |
| { | |
| "epoch": 1.8093023255813954, | |
| "grad_norm": 1.9576362371444702, | |
| "learning_rate": 4.69992031628803e-06, | |
| "loss": 0.1286, | |
| "mean_token_accuracy": 0.9561353921890259, | |
| "step": 389 | |
| }, | |
| { | |
| "epoch": 1.8139534883720931, | |
| "grad_norm": 1.9920960664749146, | |
| "learning_rate": 4.675946091031648e-06, | |
| "loss": 0.1359, | |
| "mean_token_accuracy": 0.9533660411834717, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 1.8186046511627907, | |
| "grad_norm": 1.902557134628296, | |
| "learning_rate": 4.65199604254757e-06, | |
| "loss": 0.13, | |
| "mean_token_accuracy": 0.9536868929862976, | |
| "step": 391 | |
| }, | |
| { | |
| "epoch": 1.8232558139534882, | |
| "grad_norm": 1.7443137168884277, | |
| "learning_rate": 4.628070873502038e-06, | |
| "loss": 0.1346, | |
| "mean_token_accuracy": 0.9529221057891846, | |
| "step": 392 | |
| }, | |
| { | |
| "epoch": 1.827906976744186, | |
| "grad_norm": 1.5767067670822144, | |
| "learning_rate": 4.604171285831373e-06, | |
| "loss": 0.1128, | |
| "mean_token_accuracy": 0.9544422626495361, | |
| "step": 393 | |
| }, | |
| { | |
| "epoch": 1.8325581395348838, | |
| "grad_norm": 2.047105312347412, | |
| "learning_rate": 4.5802979807213585e-06, | |
| "loss": 0.1516, | |
| "mean_token_accuracy": 0.9372674226760864, | |
| "step": 394 | |
| }, | |
| { | |
| "epoch": 1.8372093023255816, | |
| "grad_norm": 1.8142563104629517, | |
| "learning_rate": 4.556451658586687e-06, | |
| "loss": 0.1226, | |
| "mean_token_accuracy": 0.9564979076385498, | |
| "step": 395 | |
| }, | |
| { | |
| "epoch": 1.841860465116279, | |
| "grad_norm": 1.9213443994522095, | |
| "learning_rate": 4.532633019050392e-06, | |
| "loss": 0.1438, | |
| "mean_token_accuracy": 0.9534309506416321, | |
| "step": 396 | |
| }, | |
| { | |
| "epoch": 1.8465116279069766, | |
| "grad_norm": 1.772811770439148, | |
| "learning_rate": 4.508842760923344e-06, | |
| "loss": 0.1358, | |
| "mean_token_accuracy": 0.9528013467788696, | |
| "step": 397 | |
| }, | |
| { | |
| "epoch": 1.8511627906976744, | |
| "grad_norm": 1.880860447883606, | |
| "learning_rate": 4.4850815821837265e-06, | |
| "loss": 0.1345, | |
| "mean_token_accuracy": 0.9486945271492004, | |
| "step": 398 | |
| }, | |
| { | |
| "epoch": 1.8558139534883722, | |
| "grad_norm": 2.0496411323547363, | |
| "learning_rate": 4.4613501799565755e-06, | |
| "loss": 0.1429, | |
| "mean_token_accuracy": 0.9489778876304626, | |
| "step": 399 | |
| }, | |
| { | |
| "epoch": 1.8604651162790697, | |
| "grad_norm": 1.9374741315841675, | |
| "learning_rate": 4.43764925049331e-06, | |
| "loss": 0.131, | |
| "mean_token_accuracy": 0.9518900513648987, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 1.8651162790697673, | |
| "grad_norm": 1.947840929031372, | |
| "learning_rate": 4.413979489151326e-06, | |
| "loss": 0.1399, | |
| "mean_token_accuracy": 0.9489177465438843, | |
| "step": 401 | |
| }, | |
| { | |
| "epoch": 1.869767441860465, | |
| "grad_norm": 2.468381643295288, | |
| "learning_rate": 4.3903415903735725e-06, | |
| "loss": 0.1656, | |
| "mean_token_accuracy": 0.9420523643493652, | |
| "step": 402 | |
| }, | |
| { | |
| "epoch": 1.8744186046511628, | |
| "grad_norm": 1.9637192487716675, | |
| "learning_rate": 4.366736247668194e-06, | |
| "loss": 0.1214, | |
| "mean_token_accuracy": 0.9539300203323364, | |
| "step": 403 | |
| }, | |
| { | |
| "epoch": 1.8790697674418606, | |
| "grad_norm": 1.993908405303955, | |
| "learning_rate": 4.343164153588176e-06, | |
| "loss": 0.1413, | |
| "mean_token_accuracy": 0.95000821352005, | |
| "step": 404 | |
| }, | |
| { | |
| "epoch": 1.8837209302325582, | |
| "grad_norm": 2.0856027603149414, | |
| "learning_rate": 4.3196259997110326e-06, | |
| "loss": 0.142, | |
| "mean_token_accuracy": 0.949593186378479, | |
| "step": 405 | |
| }, | |
| { | |
| "epoch": 1.8883720930232557, | |
| "grad_norm": 1.7070889472961426, | |
| "learning_rate": 4.296122476618507e-06, | |
| "loss": 0.1247, | |
| "mean_token_accuracy": 0.9530761241912842, | |
| "step": 406 | |
| }, | |
| { | |
| "epoch": 1.8930232558139535, | |
| "grad_norm": 1.9810974597930908, | |
| "learning_rate": 4.2726542738763185e-06, | |
| "loss": 0.1164, | |
| "mean_token_accuracy": 0.9563318490982056, | |
| "step": 407 | |
| }, | |
| { | |
| "epoch": 1.8976744186046512, | |
| "grad_norm": 2.0617589950561523, | |
| "learning_rate": 4.249222080013927e-06, | |
| "loss": 0.1543, | |
| "mean_token_accuracy": 0.9469596743583679, | |
| "step": 408 | |
| }, | |
| { | |
| "epoch": 1.9023255813953488, | |
| "grad_norm": 1.9862779378890991, | |
| "learning_rate": 4.2258265825043365e-06, | |
| "loss": 0.1297, | |
| "mean_token_accuracy": 0.9529111385345459, | |
| "step": 409 | |
| }, | |
| { | |
| "epoch": 1.9069767441860463, | |
| "grad_norm": 1.9495517015457153, | |
| "learning_rate": 4.202468467743922e-06, | |
| "loss": 0.1348, | |
| "mean_token_accuracy": 0.9511424899101257, | |
| "step": 410 | |
| }, | |
| { | |
| "epoch": 1.9116279069767441, | |
| "grad_norm": 1.9612817764282227, | |
| "learning_rate": 4.1791484210322945e-06, | |
| "loss": 0.1424, | |
| "mean_token_accuracy": 0.9513311982154846, | |
| "step": 411 | |
| }, | |
| { | |
| "epoch": 1.916279069767442, | |
| "grad_norm": 1.9220209121704102, | |
| "learning_rate": 4.15586712655219e-06, | |
| "loss": 0.1338, | |
| "mean_token_accuracy": 0.9528619647026062, | |
| "step": 412 | |
| }, | |
| { | |
| "epoch": 1.9209302325581397, | |
| "grad_norm": 1.9853949546813965, | |
| "learning_rate": 4.1326252673494006e-06, | |
| "loss": 0.1367, | |
| "mean_token_accuracy": 0.9542078971862793, | |
| "step": 413 | |
| }, | |
| { | |
| "epoch": 1.9255813953488372, | |
| "grad_norm": 1.8623827695846558, | |
| "learning_rate": 4.109423525312738e-06, | |
| "loss": 0.1306, | |
| "mean_token_accuracy": 0.9558945298194885, | |
| "step": 414 | |
| }, | |
| { | |
| "epoch": 1.9302325581395348, | |
| "grad_norm": 2.083481550216675, | |
| "learning_rate": 4.086262581154015e-06, | |
| "loss": 0.1253, | |
| "mean_token_accuracy": 0.9526870846748352, | |
| "step": 415 | |
| }, | |
| { | |
| "epoch": 1.9348837209302325, | |
| "grad_norm": 1.816807508468628, | |
| "learning_rate": 4.0631431143880915e-06, | |
| "loss": 0.1352, | |
| "mean_token_accuracy": 0.9498327970504761, | |
| "step": 416 | |
| }, | |
| { | |
| "epoch": 1.9395348837209303, | |
| "grad_norm": 1.9113500118255615, | |
| "learning_rate": 4.040065803312921e-06, | |
| "loss": 0.1358, | |
| "mean_token_accuracy": 0.948095440864563, | |
| "step": 417 | |
| }, | |
| { | |
| "epoch": 1.9441860465116279, | |
| "grad_norm": 1.7576724290847778, | |
| "learning_rate": 4.017031324989669e-06, | |
| "loss": 0.1135, | |
| "mean_token_accuracy": 0.9590513706207275, | |
| "step": 418 | |
| }, | |
| { | |
| "epoch": 1.9488372093023256, | |
| "grad_norm": 2.2163145542144775, | |
| "learning_rate": 3.994040355222828e-06, | |
| "loss": 0.1438, | |
| "mean_token_accuracy": 0.9499019384384155, | |
| "step": 419 | |
| }, | |
| { | |
| "epoch": 1.9534883720930232, | |
| "grad_norm": 1.9273474216461182, | |
| "learning_rate": 3.971093568540408e-06, | |
| "loss": 0.1365, | |
| "mean_token_accuracy": 0.9528368711471558, | |
| "step": 420 | |
| }, | |
| { | |
| "epoch": 1.958139534883721, | |
| "grad_norm": 1.855919361114502, | |
| "learning_rate": 3.948191638174135e-06, | |
| "loss": 0.1321, | |
| "mean_token_accuracy": 0.9499024152755737, | |
| "step": 421 | |
| }, | |
| { | |
| "epoch": 1.9627906976744187, | |
| "grad_norm": 2.040865659713745, | |
| "learning_rate": 3.925335236039702e-06, | |
| "loss": 0.1394, | |
| "mean_token_accuracy": 0.9538987874984741, | |
| "step": 422 | |
| }, | |
| { | |
| "epoch": 1.9674418604651163, | |
| "grad_norm": 1.827325701713562, | |
| "learning_rate": 3.902525032717067e-06, | |
| "loss": 0.1056, | |
| "mean_token_accuracy": 0.9614977240562439, | |
| "step": 423 | |
| }, | |
| { | |
| "epoch": 1.9720930232558138, | |
| "grad_norm": 1.778291940689087, | |
| "learning_rate": 3.879761697430756e-06, | |
| "loss": 0.1247, | |
| "mean_token_accuracy": 0.9552616477012634, | |
| "step": 424 | |
| }, | |
| { | |
| "epoch": 1.9767441860465116, | |
| "grad_norm": 1.7589936256408691, | |
| "learning_rate": 3.8570458980302526e-06, | |
| "loss": 0.1262, | |
| "mean_token_accuracy": 0.9544051885604858, | |
| "step": 425 | |
| }, | |
| { | |
| "epoch": 1.9813953488372094, | |
| "grad_norm": 1.8840413093566895, | |
| "learning_rate": 3.834378300970385e-06, | |
| "loss": 0.1317, | |
| "mean_token_accuracy": 0.9542329907417297, | |
| "step": 426 | |
| }, | |
| { | |
| "epoch": 1.9860465116279071, | |
| "grad_norm": 2.0406875610351562, | |
| "learning_rate": 3.811759571291792e-06, | |
| "loss": 0.1298, | |
| "mean_token_accuracy": 0.9538700580596924, | |
| "step": 427 | |
| }, | |
| { | |
| "epoch": 1.9906976744186047, | |
| "grad_norm": 1.8465980291366577, | |
| "learning_rate": 3.789190372601387e-06, | |
| "loss": 0.1456, | |
| "mean_token_accuracy": 0.9468926787376404, | |
| "step": 428 | |
| }, | |
| { | |
| "epoch": 1.9953488372093022, | |
| "grad_norm": 1.9541380405426025, | |
| "learning_rate": 3.7666713670529153e-06, | |
| "loss": 0.1409, | |
| "mean_token_accuracy": 0.9509699940681458, | |
| "step": 429 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "grad_norm": 1.4541330337524414, | |
| "learning_rate": 3.7442032153275053e-06, | |
| "loss": 0.0761, | |
| "mean_token_accuracy": 0.9719982743263245, | |
| "step": 430 | |
| }, | |
| { | |
| "epoch": 2.0046511627906978, | |
| "grad_norm": 1.672062635421753, | |
| "learning_rate": 3.7217865766143014e-06, | |
| "loss": 0.0524, | |
| "mean_token_accuracy": 0.984748363494873, | |
| "step": 431 | |
| }, | |
| { | |
| "epoch": 2.0093023255813955, | |
| "grad_norm": 1.4939134120941162, | |
| "learning_rate": 3.6994221085911107e-06, | |
| "loss": 0.0544, | |
| "mean_token_accuracy": 0.9857293963432312, | |
| "step": 432 | |
| }, | |
| { | |
| "epoch": 2.013953488372093, | |
| "grad_norm": 1.3394852876663208, | |
| "learning_rate": 3.6771104674051184e-06, | |
| "loss": 0.0461, | |
| "mean_token_accuracy": 0.9873949289321899, | |
| "step": 433 | |
| }, | |
| { | |
| "epoch": 2.0186046511627906, | |
| "grad_norm": 1.4517439603805542, | |
| "learning_rate": 3.654852307653628e-06, | |
| "loss": 0.048, | |
| "mean_token_accuracy": 0.9845333099365234, | |
| "step": 434 | |
| }, | |
| { | |
| "epoch": 2.0232558139534884, | |
| "grad_norm": 1.157000184059143, | |
| "learning_rate": 3.6326482823648656e-06, | |
| "loss": 0.0412, | |
| "mean_token_accuracy": 0.9895949363708496, | |
| "step": 435 | |
| }, | |
| { | |
| "epoch": 2.027906976744186, | |
| "grad_norm": 1.5402953624725342, | |
| "learning_rate": 3.6104990429788102e-06, | |
| "loss": 0.0387, | |
| "mean_token_accuracy": 0.9885908365249634, | |
| "step": 436 | |
| }, | |
| { | |
| "epoch": 2.0325581395348835, | |
| "grad_norm": 1.3295921087265015, | |
| "learning_rate": 3.588405239328091e-06, | |
| "loss": 0.0485, | |
| "mean_token_accuracy": 0.9842379093170166, | |
| "step": 437 | |
| }, | |
| { | |
| "epoch": 2.0372093023255813, | |
| "grad_norm": 1.5409480333328247, | |
| "learning_rate": 3.5663675196189184e-06, | |
| "loss": 0.0452, | |
| "mean_token_accuracy": 0.9862408638000488, | |
| "step": 438 | |
| }, | |
| { | |
| "epoch": 2.041860465116279, | |
| "grad_norm": 1.2995237112045288, | |
| "learning_rate": 3.5443865304120607e-06, | |
| "loss": 0.0361, | |
| "mean_token_accuracy": 0.9853552579879761, | |
| "step": 439 | |
| }, | |
| { | |
| "epoch": 2.046511627906977, | |
| "grad_norm": 1.1838889122009277, | |
| "learning_rate": 3.522462916603887e-06, | |
| "loss": 0.0394, | |
| "mean_token_accuracy": 0.9879562258720398, | |
| "step": 440 | |
| }, | |
| { | |
| "epoch": 2.0511627906976746, | |
| "grad_norm": 1.304025411605835, | |
| "learning_rate": 3.500597321407435e-06, | |
| "loss": 0.0313, | |
| "mean_token_accuracy": 0.9885208010673523, | |
| "step": 441 | |
| }, | |
| { | |
| "epoch": 2.055813953488372, | |
| "grad_norm": 1.6431220769882202, | |
| "learning_rate": 3.478790386333546e-06, | |
| "loss": 0.0471, | |
| "mean_token_accuracy": 0.9840630292892456, | |
| "step": 442 | |
| }, | |
| { | |
| "epoch": 2.0604651162790697, | |
| "grad_norm": 2.0246262550354004, | |
| "learning_rate": 3.45704275117204e-06, | |
| "loss": 0.0614, | |
| "mean_token_accuracy": 0.9822935461997986, | |
| "step": 443 | |
| }, | |
| { | |
| "epoch": 2.0651162790697675, | |
| "grad_norm": 1.8200246095657349, | |
| "learning_rate": 3.435355053972953e-06, | |
| "loss": 0.0488, | |
| "mean_token_accuracy": 0.9845336079597473, | |
| "step": 444 | |
| }, | |
| { | |
| "epoch": 2.0697674418604652, | |
| "grad_norm": 2.0698256492614746, | |
| "learning_rate": 3.4137279310278054e-06, | |
| "loss": 0.0624, | |
| "mean_token_accuracy": 0.9742683172225952, | |
| "step": 445 | |
| }, | |
| { | |
| "epoch": 2.0744186046511626, | |
| "grad_norm": 1.9601695537567139, | |
| "learning_rate": 3.392162016850945e-06, | |
| "loss": 0.054, | |
| "mean_token_accuracy": 0.9828470945358276, | |
| "step": 446 | |
| }, | |
| { | |
| "epoch": 2.0790697674418603, | |
| "grad_norm": 1.7648512125015259, | |
| "learning_rate": 3.3706579441609224e-06, | |
| "loss": 0.0512, | |
| "mean_token_accuracy": 0.9847809672355652, | |
| "step": 447 | |
| }, | |
| { | |
| "epoch": 2.083720930232558, | |
| "grad_norm": 2.1309351921081543, | |
| "learning_rate": 3.3492163438619362e-06, | |
| "loss": 0.0499, | |
| "mean_token_accuracy": 0.9843156933784485, | |
| "step": 448 | |
| }, | |
| { | |
| "epoch": 2.088372093023256, | |
| "grad_norm": 1.4552912712097168, | |
| "learning_rate": 3.327837845025315e-06, | |
| "loss": 0.0471, | |
| "mean_token_accuracy": 0.9860197305679321, | |
| "step": 449 | |
| }, | |
| { | |
| "epoch": 2.0930232558139537, | |
| "grad_norm": 1.743163824081421, | |
| "learning_rate": 3.3065230748710646e-06, | |
| "loss": 0.0502, | |
| "mean_token_accuracy": 0.984899640083313, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 2.097674418604651, | |
| "grad_norm": 1.6881510019302368, | |
| "learning_rate": 3.2852726587494673e-06, | |
| "loss": 0.0457, | |
| "mean_token_accuracy": 0.9868685007095337, | |
| "step": 451 | |
| }, | |
| { | |
| "epoch": 2.1023255813953488, | |
| "grad_norm": 1.7363135814666748, | |
| "learning_rate": 3.2640872201227364e-06, | |
| "loss": 0.053, | |
| "mean_token_accuracy": 0.9822916388511658, | |
| "step": 452 | |
| }, | |
| { | |
| "epoch": 2.1069767441860465, | |
| "grad_norm": 1.500846266746521, | |
| "learning_rate": 3.242967380546717e-06, | |
| "loss": 0.047, | |
| "mean_token_accuracy": 0.9842950105667114, | |
| "step": 453 | |
| }, | |
| { | |
| "epoch": 2.1116279069767443, | |
| "grad_norm": 1.7576566934585571, | |
| "learning_rate": 3.221913759652657e-06, | |
| "loss": 0.0488, | |
| "mean_token_accuracy": 0.9847888350486755, | |
| "step": 454 | |
| }, | |
| { | |
| "epoch": 2.116279069767442, | |
| "grad_norm": 1.6291195154190063, | |
| "learning_rate": 3.20092697512903e-06, | |
| "loss": 0.0483, | |
| "mean_token_accuracy": 0.9865509271621704, | |
| "step": 455 | |
| }, | |
| { | |
| "epoch": 2.1209302325581394, | |
| "grad_norm": 1.565114974975586, | |
| "learning_rate": 3.180007642703402e-06, | |
| "loss": 0.0439, | |
| "mean_token_accuracy": 0.9828610420227051, | |
| "step": 456 | |
| }, | |
| { | |
| "epoch": 2.125581395348837, | |
| "grad_norm": 1.3543715476989746, | |
| "learning_rate": 3.1591563761243816e-06, | |
| "loss": 0.0406, | |
| "mean_token_accuracy": 0.9870887994766235, | |
| "step": 457 | |
| }, | |
| { | |
| "epoch": 2.130232558139535, | |
| "grad_norm": 1.4812368154525757, | |
| "learning_rate": 3.138373787143598e-06, | |
| "loss": 0.0424, | |
| "mean_token_accuracy": 0.9881157279014587, | |
| "step": 458 | |
| }, | |
| { | |
| "epoch": 2.1348837209302327, | |
| "grad_norm": 1.2913554906845093, | |
| "learning_rate": 3.1176604854977665e-06, | |
| "loss": 0.0393, | |
| "mean_token_accuracy": 0.988473653793335, | |
| "step": 459 | |
| }, | |
| { | |
| "epoch": 2.13953488372093, | |
| "grad_norm": 1.317392349243164, | |
| "learning_rate": 3.0970170788907878e-06, | |
| "loss": 0.0388, | |
| "mean_token_accuracy": 0.9886342883110046, | |
| "step": 460 | |
| }, | |
| { | |
| "epoch": 2.144186046511628, | |
| "grad_norm": 1.1565263271331787, | |
| "learning_rate": 3.076444172975932e-06, | |
| "loss": 0.0383, | |
| "mean_token_accuracy": 0.9860601425170898, | |
| "step": 461 | |
| }, | |
| { | |
| "epoch": 2.1488372093023256, | |
| "grad_norm": 1.3981534242630005, | |
| "learning_rate": 3.055942371338052e-06, | |
| "loss": 0.0473, | |
| "mean_token_accuracy": 0.9850096106529236, | |
| "step": 462 | |
| }, | |
| { | |
| "epoch": 2.1534883720930234, | |
| "grad_norm": 1.1593438386917114, | |
| "learning_rate": 3.035512275475896e-06, | |
| "loss": 0.038, | |
| "mean_token_accuracy": 0.987267017364502, | |
| "step": 463 | |
| }, | |
| { | |
| "epoch": 2.158139534883721, | |
| "grad_norm": 1.4584743976593018, | |
| "learning_rate": 3.0151544847844385e-06, | |
| "loss": 0.0457, | |
| "mean_token_accuracy": 0.9883371591567993, | |
| "step": 464 | |
| }, | |
| { | |
| "epoch": 2.1627906976744184, | |
| "grad_norm": 1.349255084991455, | |
| "learning_rate": 2.994869596537316e-06, | |
| "loss": 0.0386, | |
| "mean_token_accuracy": 0.9858284592628479, | |
| "step": 465 | |
| }, | |
| { | |
| "epoch": 2.167441860465116, | |
| "grad_norm": 1.4808646440505981, | |
| "learning_rate": 2.9746582058692803e-06, | |
| "loss": 0.0419, | |
| "mean_token_accuracy": 0.9876099228858948, | |
| "step": 466 | |
| }, | |
| { | |
| "epoch": 2.172093023255814, | |
| "grad_norm": 1.5003681182861328, | |
| "learning_rate": 2.954520905758762e-06, | |
| "loss": 0.0437, | |
| "mean_token_accuracy": 0.9860689640045166, | |
| "step": 467 | |
| }, | |
| { | |
| "epoch": 2.1767441860465118, | |
| "grad_norm": 1.2506943941116333, | |
| "learning_rate": 2.934458287010455e-06, | |
| "loss": 0.0327, | |
| "mean_token_accuracy": 0.9890545606613159, | |
| "step": 468 | |
| }, | |
| { | |
| "epoch": 2.181395348837209, | |
| "grad_norm": 1.4070329666137695, | |
| "learning_rate": 2.9144709382379955e-06, | |
| "loss": 0.0429, | |
| "mean_token_accuracy": 0.9838380813598633, | |
| "step": 469 | |
| }, | |
| { | |
| "epoch": 2.186046511627907, | |
| "grad_norm": 1.844129204750061, | |
| "learning_rate": 2.894559445846682e-06, | |
| "loss": 0.0488, | |
| "mean_token_accuracy": 0.9844542741775513, | |
| "step": 470 | |
| }, | |
| { | |
| "epoch": 2.1906976744186046, | |
| "grad_norm": 1.729974389076233, | |
| "learning_rate": 2.8747243940162774e-06, | |
| "loss": 0.0565, | |
| "mean_token_accuracy": 0.9824362397193909, | |
| "step": 471 | |
| }, | |
| { | |
| "epoch": 2.1953488372093024, | |
| "grad_norm": 1.6033308506011963, | |
| "learning_rate": 2.854966364683872e-06, | |
| "loss": 0.0338, | |
| "mean_token_accuracy": 0.9885597825050354, | |
| "step": 472 | |
| }, | |
| { | |
| "epoch": 2.2, | |
| "grad_norm": 1.332747459411621, | |
| "learning_rate": 2.835285937526801e-06, | |
| "loss": 0.044, | |
| "mean_token_accuracy": 0.9859412908554077, | |
| "step": 473 | |
| }, | |
| { | |
| "epoch": 2.2046511627906975, | |
| "grad_norm": 1.7800264358520508, | |
| "learning_rate": 2.8156836899456475e-06, | |
| "loss": 0.0487, | |
| "mean_token_accuracy": 0.9829608201980591, | |
| "step": 474 | |
| }, | |
| { | |
| "epoch": 2.2093023255813953, | |
| "grad_norm": 1.664980173110962, | |
| "learning_rate": 2.796160197047294e-06, | |
| "loss": 0.0464, | |
| "mean_token_accuracy": 0.9837183952331543, | |
| "step": 475 | |
| }, | |
| { | |
| "epoch": 2.213953488372093, | |
| "grad_norm": 1.2077975273132324, | |
| "learning_rate": 2.7767160316280583e-06, | |
| "loss": 0.0303, | |
| "mean_token_accuracy": 0.9894075989723206, | |
| "step": 476 | |
| }, | |
| { | |
| "epoch": 2.218604651162791, | |
| "grad_norm": 1.418182373046875, | |
| "learning_rate": 2.757351764156877e-06, | |
| "loss": 0.0395, | |
| "mean_token_accuracy": 0.9862279891967773, | |
| "step": 477 | |
| }, | |
| { | |
| "epoch": 2.2232558139534886, | |
| "grad_norm": 1.4983257055282593, | |
| "learning_rate": 2.7380679627585817e-06, | |
| "loss": 0.0444, | |
| "mean_token_accuracy": 0.9853575825691223, | |
| "step": 478 | |
| }, | |
| { | |
| "epoch": 2.227906976744186, | |
| "grad_norm": 1.423553466796875, | |
| "learning_rate": 2.718865193197218e-06, | |
| "loss": 0.0409, | |
| "mean_token_accuracy": 0.9856008887290955, | |
| "step": 479 | |
| }, | |
| { | |
| "epoch": 2.2325581395348837, | |
| "grad_norm": 1.4247428178787231, | |
| "learning_rate": 2.699744018859457e-06, | |
| "loss": 0.0462, | |
| "mean_token_accuracy": 0.9839481115341187, | |
| "step": 480 | |
| }, | |
| { | |
| "epoch": 2.2372093023255815, | |
| "grad_norm": 1.2295563220977783, | |
| "learning_rate": 2.680705000738061e-06, | |
| "loss": 0.0368, | |
| "mean_token_accuracy": 0.9896710515022278, | |
| "step": 481 | |
| }, | |
| { | |
| "epoch": 2.2418604651162792, | |
| "grad_norm": 1.374080777168274, | |
| "learning_rate": 2.661748697415423e-06, | |
| "loss": 0.0409, | |
| "mean_token_accuracy": 0.9884670972824097, | |
| "step": 482 | |
| }, | |
| { | |
| "epoch": 2.2465116279069766, | |
| "grad_norm": 1.4290623664855957, | |
| "learning_rate": 2.642875665047182e-06, | |
| "loss": 0.049, | |
| "mean_token_accuracy": 0.9858566522598267, | |
| "step": 483 | |
| }, | |
| { | |
| "epoch": 2.2511627906976743, | |
| "grad_norm": 1.8040648698806763, | |
| "learning_rate": 2.6240864573459095e-06, | |
| "loss": 0.053, | |
| "mean_token_accuracy": 0.9802747368812561, | |
| "step": 484 | |
| }, | |
| { | |
| "epoch": 2.255813953488372, | |
| "grad_norm": 1.3592660427093506, | |
| "learning_rate": 2.6053816255648543e-06, | |
| "loss": 0.0326, | |
| "mean_token_accuracy": 0.9880083203315735, | |
| "step": 485 | |
| }, | |
| { | |
| "epoch": 2.26046511627907, | |
| "grad_norm": 1.4660333395004272, | |
| "learning_rate": 2.586761718481776e-06, | |
| "loss": 0.0431, | |
| "mean_token_accuracy": 0.9855907559394836, | |
| "step": 486 | |
| }, | |
| { | |
| "epoch": 2.265116279069767, | |
| "grad_norm": 1.5499329566955566, | |
| "learning_rate": 2.5682272823828474e-06, | |
| "loss": 0.0447, | |
| "mean_token_accuracy": 0.9844789505004883, | |
| "step": 487 | |
| }, | |
| { | |
| "epoch": 2.269767441860465, | |
| "grad_norm": 1.3596184253692627, | |
| "learning_rate": 2.5497788610466177e-06, | |
| "loss": 0.0372, | |
| "mean_token_accuracy": 0.9874828457832336, | |
| "step": 488 | |
| }, | |
| { | |
| "epoch": 2.2744186046511627, | |
| "grad_norm": 1.2610822916030884, | |
| "learning_rate": 2.53141699572807e-06, | |
| "loss": 0.038, | |
| "mean_token_accuracy": 0.9895055294036865, | |
| "step": 489 | |
| }, | |
| { | |
| "epoch": 2.2790697674418605, | |
| "grad_norm": 1.4940454959869385, | |
| "learning_rate": 2.5131422251427313e-06, | |
| "loss": 0.043, | |
| "mean_token_accuracy": 0.986737847328186, | |
| "step": 490 | |
| }, | |
| { | |
| "epoch": 2.2837209302325583, | |
| "grad_norm": 1.3737494945526123, | |
| "learning_rate": 2.4949550854508713e-06, | |
| "loss": 0.0368, | |
| "mean_token_accuracy": 0.9881452918052673, | |
| "step": 491 | |
| }, | |
| { | |
| "epoch": 2.2883720930232556, | |
| "grad_norm": 1.7707860469818115, | |
| "learning_rate": 2.476856110241773e-06, | |
| "loss": 0.0394, | |
| "mean_token_accuracy": 0.9883301854133606, | |
| "step": 492 | |
| }, | |
| { | |
| "epoch": 2.2930232558139534, | |
| "grad_norm": 1.5083131790161133, | |
| "learning_rate": 2.458845830518082e-06, | |
| "loss": 0.0469, | |
| "mean_token_accuracy": 0.9832764863967896, | |
| "step": 493 | |
| }, | |
| { | |
| "epoch": 2.297674418604651, | |
| "grad_norm": 1.5373071432113647, | |
| "learning_rate": 2.440924774680215e-06, | |
| "loss": 0.0469, | |
| "mean_token_accuracy": 0.9855247139930725, | |
| "step": 494 | |
| }, | |
| { | |
| "epoch": 2.302325581395349, | |
| "grad_norm": 1.5899007320404053, | |
| "learning_rate": 2.4230934685108707e-06, | |
| "loss": 0.0445, | |
| "mean_token_accuracy": 0.9864286780357361, | |
| "step": 495 | |
| }, | |
| { | |
| "epoch": 2.3069767441860467, | |
| "grad_norm": 1.281482219696045, | |
| "learning_rate": 2.405352435159595e-06, | |
| "loss": 0.0404, | |
| "mean_token_accuracy": 0.985908567905426, | |
| "step": 496 | |
| }, | |
| { | |
| "epoch": 2.311627906976744, | |
| "grad_norm": 1.8610132932662964, | |
| "learning_rate": 2.3877021951274374e-06, | |
| "loss": 0.0598, | |
| "mean_token_accuracy": 0.9820767641067505, | |
| "step": 497 | |
| }, | |
| { | |
| "epoch": 2.316279069767442, | |
| "grad_norm": 1.4103353023529053, | |
| "learning_rate": 2.3701432662516772e-06, | |
| "loss": 0.0396, | |
| "mean_token_accuracy": 0.9848379492759705, | |
| "step": 498 | |
| }, | |
| { | |
| "epoch": 2.3209302325581396, | |
| "grad_norm": 1.7032541036605835, | |
| "learning_rate": 2.3526761636906313e-06, | |
| "loss": 0.0436, | |
| "mean_token_accuracy": 0.9844515919685364, | |
| "step": 499 | |
| }, | |
| { | |
| "epoch": 2.3255813953488373, | |
| "grad_norm": 1.4253147840499878, | |
| "learning_rate": 2.3353013999085402e-06, | |
| "loss": 0.0452, | |
| "mean_token_accuracy": 0.9855325818061829, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 2.330232558139535, | |
| "grad_norm": 1.3063850402832031, | |
| "learning_rate": 2.3180194846605367e-06, | |
| "loss": 0.0353, | |
| "mean_token_accuracy": 0.9888969659805298, | |
| "step": 501 | |
| }, | |
| { | |
| "epoch": 2.3348837209302324, | |
| "grad_norm": 1.183137059211731, | |
| "learning_rate": 2.300830924977683e-06, | |
| "loss": 0.03, | |
| "mean_token_accuracy": 0.9909448623657227, | |
| "step": 502 | |
| }, | |
| { | |
| "epoch": 2.33953488372093, | |
| "grad_norm": 1.4097849130630493, | |
| "learning_rate": 2.283736225152099e-06, | |
| "loss": 0.0404, | |
| "mean_token_accuracy": 0.9841188788414001, | |
| "step": 503 | |
| }, | |
| { | |
| "epoch": 2.344186046511628, | |
| "grad_norm": 1.1793756484985352, | |
| "learning_rate": 2.26673588672217e-06, | |
| "loss": 0.0299, | |
| "mean_token_accuracy": 0.9909354448318481, | |
| "step": 504 | |
| }, | |
| { | |
| "epoch": 2.3488372093023258, | |
| "grad_norm": 1.328304648399353, | |
| "learning_rate": 2.249830408457826e-06, | |
| "loss": 0.0384, | |
| "mean_token_accuracy": 0.9873096346855164, | |
| "step": 505 | |
| }, | |
| { | |
| "epoch": 2.353488372093023, | |
| "grad_norm": 1.3120323419570923, | |
| "learning_rate": 2.2330202863459123e-06, | |
| "loss": 0.0375, | |
| "mean_token_accuracy": 0.9867841601371765, | |
| "step": 506 | |
| }, | |
| { | |
| "epoch": 2.358139534883721, | |
| "grad_norm": 1.3818902969360352, | |
| "learning_rate": 2.2163060135756364e-06, | |
| "loss": 0.0459, | |
| "mean_token_accuracy": 0.985027551651001, | |
| "step": 507 | |
| }, | |
| { | |
| "epoch": 2.3627906976744186, | |
| "grad_norm": 1.4502382278442383, | |
| "learning_rate": 2.1996880805241e-06, | |
| "loss": 0.0504, | |
| "mean_token_accuracy": 0.9835244417190552, | |
| "step": 508 | |
| }, | |
| { | |
| "epoch": 2.3674418604651164, | |
| "grad_norm": 1.435464859008789, | |
| "learning_rate": 2.1831669747419093e-06, | |
| "loss": 0.0442, | |
| "mean_token_accuracy": 0.9855555295944214, | |
| "step": 509 | |
| }, | |
| { | |
| "epoch": 2.3720930232558137, | |
| "grad_norm": 1.2933567762374878, | |
| "learning_rate": 2.166743180938875e-06, | |
| "loss": 0.0392, | |
| "mean_token_accuracy": 0.9858629703521729, | |
| "step": 510 | |
| }, | |
| { | |
| "epoch": 2.3767441860465115, | |
| "grad_norm": 1.3595428466796875, | |
| "learning_rate": 2.150417180969784e-06, | |
| "loss": 0.0466, | |
| "mean_token_accuracy": 0.9843334555625916, | |
| "step": 511 | |
| }, | |
| { | |
| "epoch": 2.3813953488372093, | |
| "grad_norm": 1.5175772905349731, | |
| "learning_rate": 2.1341894538202726e-06, | |
| "loss": 0.0469, | |
| "mean_token_accuracy": 0.9825721979141235, | |
| "step": 512 | |
| }, | |
| { | |
| "epoch": 2.386046511627907, | |
| "grad_norm": 1.3737074136734009, | |
| "learning_rate": 2.1180604755927646e-06, | |
| "loss": 0.0452, | |
| "mean_token_accuracy": 0.9853906631469727, | |
| "step": 513 | |
| }, | |
| { | |
| "epoch": 2.390697674418605, | |
| "grad_norm": 1.5613442659378052, | |
| "learning_rate": 2.102030719492508e-06, | |
| "loss": 0.0404, | |
| "mean_token_accuracy": 0.9870796799659729, | |
| "step": 514 | |
| }, | |
| { | |
| "epoch": 2.395348837209302, | |
| "grad_norm": 1.5499093532562256, | |
| "learning_rate": 2.086100655813688e-06, | |
| "loss": 0.0497, | |
| "mean_token_accuracy": 0.9838182330131531, | |
| "step": 515 | |
| }, | |
| { | |
| "epoch": 2.4, | |
| "grad_norm": 1.4529976844787598, | |
| "learning_rate": 2.0702707519256365e-06, | |
| "loss": 0.038, | |
| "mean_token_accuracy": 0.9871166944503784, | |
| "step": 516 | |
| }, | |
| { | |
| "epoch": 2.4046511627906977, | |
| "grad_norm": 1.3648254871368408, | |
| "learning_rate": 2.0545414722591096e-06, | |
| "loss": 0.0282, | |
| "mean_token_accuracy": 0.9895697236061096, | |
| "step": 517 | |
| }, | |
| { | |
| "epoch": 2.4093023255813955, | |
| "grad_norm": 1.286002278327942, | |
| "learning_rate": 2.03891327829267e-06, | |
| "loss": 0.0362, | |
| "mean_token_accuracy": 0.9883317351341248, | |
| "step": 518 | |
| }, | |
| { | |
| "epoch": 2.4139534883720932, | |
| "grad_norm": 1.480312705039978, | |
| "learning_rate": 2.0233866285391455e-06, | |
| "loss": 0.0402, | |
| "mean_token_accuracy": 0.9887310266494751, | |
| "step": 519 | |
| }, | |
| { | |
| "epoch": 2.4186046511627906, | |
| "grad_norm": 1.3333568572998047, | |
| "learning_rate": 2.0079619785321713e-06, | |
| "loss": 0.0376, | |
| "mean_token_accuracy": 0.9858761429786682, | |
| "step": 520 | |
| }, | |
| { | |
| "epoch": 2.4232558139534883, | |
| "grad_norm": 1.8251371383666992, | |
| "learning_rate": 1.992639780812838e-06, | |
| "loss": 0.0496, | |
| "mean_token_accuracy": 0.9830413460731506, | |
| "step": 521 | |
| }, | |
| { | |
| "epoch": 2.427906976744186, | |
| "grad_norm": 1.3543392419815063, | |
| "learning_rate": 1.9774204849164004e-06, | |
| "loss": 0.0388, | |
| "mean_token_accuracy": 0.9868179559707642, | |
| "step": 522 | |
| }, | |
| { | |
| "epoch": 2.432558139534884, | |
| "grad_norm": 1.6293071508407593, | |
| "learning_rate": 1.9623045373590955e-06, | |
| "loss": 0.0474, | |
| "mean_token_accuracy": 0.98483806848526, | |
| "step": 523 | |
| }, | |
| { | |
| "epoch": 2.4372093023255816, | |
| "grad_norm": 1.60429048538208, | |
| "learning_rate": 1.9472923816250427e-06, | |
| "loss": 0.0543, | |
| "mean_token_accuracy": 0.9808722138404846, | |
| "step": 524 | |
| }, | |
| { | |
| "epoch": 2.441860465116279, | |
| "grad_norm": 1.6416536569595337, | |
| "learning_rate": 1.9323844581532334e-06, | |
| "loss": 0.053, | |
| "mean_token_accuracy": 0.982349157333374, | |
| "step": 525 | |
| }, | |
| { | |
| "epoch": 2.4465116279069767, | |
| "grad_norm": 1.429345965385437, | |
| "learning_rate": 1.9175812043246034e-06, | |
| "loss": 0.0446, | |
| "mean_token_accuracy": 0.9842494130134583, | |
| "step": 526 | |
| }, | |
| { | |
| "epoch": 2.4511627906976745, | |
| "grad_norm": 1.3102144002914429, | |
| "learning_rate": 1.9028830544492074e-06, | |
| "loss": 0.0468, | |
| "mean_token_accuracy": 0.986748218536377, | |
| "step": 527 | |
| }, | |
| { | |
| "epoch": 2.4558139534883723, | |
| "grad_norm": 1.4732224941253662, | |
| "learning_rate": 1.8882904397534705e-06, | |
| "loss": 0.0498, | |
| "mean_token_accuracy": 0.9829692840576172, | |
| "step": 528 | |
| }, | |
| { | |
| "epoch": 2.4604651162790696, | |
| "grad_norm": 1.5619550943374634, | |
| "learning_rate": 1.8738037883675445e-06, | |
| "loss": 0.0437, | |
| "mean_token_accuracy": 0.985709011554718, | |
| "step": 529 | |
| }, | |
| { | |
| "epoch": 2.4651162790697674, | |
| "grad_norm": 1.7753974199295044, | |
| "learning_rate": 1.8594235253127373e-06, | |
| "loss": 0.0456, | |
| "mean_token_accuracy": 0.9833365678787231, | |
| "step": 530 | |
| }, | |
| { | |
| "epoch": 2.469767441860465, | |
| "grad_norm": 2.730788230895996, | |
| "learning_rate": 1.8451500724890509e-06, | |
| "loss": 0.0539, | |
| "mean_token_accuracy": 0.9825479984283447, | |
| "step": 531 | |
| }, | |
| { | |
| "epoch": 2.474418604651163, | |
| "grad_norm": 1.3585683107376099, | |
| "learning_rate": 1.8309838486627995e-06, | |
| "loss": 0.0382, | |
| "mean_token_accuracy": 0.9866841435432434, | |
| "step": 532 | |
| }, | |
| { | |
| "epoch": 2.4790697674418603, | |
| "grad_norm": 1.2621618509292603, | |
| "learning_rate": 1.816925269454327e-06, | |
| "loss": 0.036, | |
| "mean_token_accuracy": 0.9900875687599182, | |
| "step": 533 | |
| }, | |
| { | |
| "epoch": 2.483720930232558, | |
| "grad_norm": 1.179105281829834, | |
| "learning_rate": 1.8029747473258092e-06, | |
| "loss": 0.0375, | |
| "mean_token_accuracy": 0.9860317707061768, | |
| "step": 534 | |
| }, | |
| { | |
| "epoch": 2.488372093023256, | |
| "grad_norm": 1.4229761362075806, | |
| "learning_rate": 1.789132691569153e-06, | |
| "loss": 0.044, | |
| "mean_token_accuracy": 0.9868127703666687, | |
| "step": 535 | |
| }, | |
| { | |
| "epoch": 2.4930232558139536, | |
| "grad_norm": 1.4325740337371826, | |
| "learning_rate": 1.7753995082939932e-06, | |
| "loss": 0.0396, | |
| "mean_token_accuracy": 0.9883702397346497, | |
| "step": 536 | |
| }, | |
| { | |
| "epoch": 2.4976744186046513, | |
| "grad_norm": 1.7136763334274292, | |
| "learning_rate": 1.7617756004157693e-06, | |
| "loss": 0.0449, | |
| "mean_token_accuracy": 0.9851675629615784, | |
| "step": 537 | |
| }, | |
| { | |
| "epoch": 2.5023255813953487, | |
| "grad_norm": 1.3397361040115356, | |
| "learning_rate": 1.7482613676439153e-06, | |
| "loss": 0.0332, | |
| "mean_token_accuracy": 0.9883018136024475, | |
| "step": 538 | |
| }, | |
| { | |
| "epoch": 2.5069767441860464, | |
| "grad_norm": 1.3754647970199585, | |
| "learning_rate": 1.7348572064701188e-06, | |
| "loss": 0.0408, | |
| "mean_token_accuracy": 0.9865552186965942, | |
| "step": 539 | |
| }, | |
| { | |
| "epoch": 2.511627906976744, | |
| "grad_norm": 1.7942336797714233, | |
| "learning_rate": 1.721563510156704e-06, | |
| "loss": 0.0473, | |
| "mean_token_accuracy": 0.9843230247497559, | |
| "step": 540 | |
| }, | |
| { | |
| "epoch": 2.516279069767442, | |
| "grad_norm": 1.3669971227645874, | |
| "learning_rate": 1.7083806687250795e-06, | |
| "loss": 0.0397, | |
| "mean_token_accuracy": 0.9862712621688843, | |
| "step": 541 | |
| }, | |
| { | |
| "epoch": 2.5209302325581397, | |
| "grad_norm": 1.8536146879196167, | |
| "learning_rate": 1.6953090689443074e-06, | |
| "loss": 0.0508, | |
| "mean_token_accuracy": 0.9839886426925659, | |
| "step": 542 | |
| }, | |
| { | |
| "epoch": 2.525581395348837, | |
| "grad_norm": 1.4202018976211548, | |
| "learning_rate": 1.6823490943197473e-06, | |
| "loss": 0.043, | |
| "mean_token_accuracy": 0.9865095615386963, | |
| "step": 543 | |
| }, | |
| { | |
| "epoch": 2.530232558139535, | |
| "grad_norm": 1.3330633640289307, | |
| "learning_rate": 1.6695011250818094e-06, | |
| "loss": 0.0366, | |
| "mean_token_accuracy": 0.9892926812171936, | |
| "step": 544 | |
| }, | |
| { | |
| "epoch": 2.5348837209302326, | |
| "grad_norm": 1.459529995918274, | |
| "learning_rate": 1.6567655381747976e-06, | |
| "loss": 0.0358, | |
| "mean_token_accuracy": 0.9880861043930054, | |
| "step": 545 | |
| }, | |
| { | |
| "epoch": 2.5395348837209304, | |
| "grad_norm": 1.371484637260437, | |
| "learning_rate": 1.6441427072458493e-06, | |
| "loss": 0.0362, | |
| "mean_token_accuracy": 0.986931324005127, | |
| "step": 546 | |
| }, | |
| { | |
| "epoch": 2.544186046511628, | |
| "grad_norm": 1.6280467510223389, | |
| "learning_rate": 1.6316330026339743e-06, | |
| "loss": 0.0513, | |
| "mean_token_accuracy": 0.9837538599967957, | |
| "step": 547 | |
| }, | |
| { | |
| "epoch": 2.5488372093023255, | |
| "grad_norm": 1.2390743494033813, | |
| "learning_rate": 1.6192367913591916e-06, | |
| "loss": 0.043, | |
| "mean_token_accuracy": 0.9854939579963684, | |
| "step": 548 | |
| }, | |
| { | |
| "epoch": 2.5534883720930233, | |
| "grad_norm": 1.5508155822753906, | |
| "learning_rate": 1.6069544371117556e-06, | |
| "loss": 0.0441, | |
| "mean_token_accuracy": 0.9845935702323914, | |
| "step": 549 | |
| }, | |
| { | |
| "epoch": 2.558139534883721, | |
| "grad_norm": 1.206674575805664, | |
| "learning_rate": 1.5947863002414938e-06, | |
| "loss": 0.0374, | |
| "mean_token_accuracy": 0.9881819486618042, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 2.5627906976744184, | |
| "grad_norm": 1.4385532140731812, | |
| "learning_rate": 1.5827327377472262e-06, | |
| "loss": 0.0393, | |
| "mean_token_accuracy": 0.9884690642356873, | |
| "step": 551 | |
| }, | |
| { | |
| "epoch": 2.567441860465116, | |
| "grad_norm": 1.3227328062057495, | |
| "learning_rate": 1.5707941032662967e-06, | |
| "loss": 0.0433, | |
| "mean_token_accuracy": 0.9855563640594482, | |
| "step": 552 | |
| }, | |
| { | |
| "epoch": 2.572093023255814, | |
| "grad_norm": 1.3581526279449463, | |
| "learning_rate": 1.558970747064198e-06, | |
| "loss": 0.0414, | |
| "mean_token_accuracy": 0.9869475960731506, | |
| "step": 553 | |
| }, | |
| { | |
| "epoch": 2.5767441860465117, | |
| "grad_norm": 1.4792921543121338, | |
| "learning_rate": 1.5472630160242921e-06, | |
| "loss": 0.0434, | |
| "mean_token_accuracy": 0.9850654602050781, | |
| "step": 554 | |
| }, | |
| { | |
| "epoch": 2.5813953488372094, | |
| "grad_norm": 1.4469318389892578, | |
| "learning_rate": 1.5356712536376345e-06, | |
| "loss": 0.0451, | |
| "mean_token_accuracy": 0.9870730638504028, | |
| "step": 555 | |
| }, | |
| { | |
| "epoch": 2.5860465116279068, | |
| "grad_norm": 1.2094733715057373, | |
| "learning_rate": 1.5241957999928974e-06, | |
| "loss": 0.0324, | |
| "mean_token_accuracy": 0.9892438054084778, | |
| "step": 556 | |
| }, | |
| { | |
| "epoch": 2.5906976744186045, | |
| "grad_norm": 1.3837049007415771, | |
| "learning_rate": 1.5128369917663924e-06, | |
| "loss": 0.0358, | |
| "mean_token_accuracy": 0.9864327311515808, | |
| "step": 557 | |
| }, | |
| { | |
| "epoch": 2.5953488372093023, | |
| "grad_norm": 1.5193039178848267, | |
| "learning_rate": 1.5015951622121896e-06, | |
| "loss": 0.0435, | |
| "mean_token_accuracy": 0.9854939579963684, | |
| "step": 558 | |
| }, | |
| { | |
| "epoch": 2.6, | |
| "grad_norm": 1.5376842021942139, | |
| "learning_rate": 1.490470641152345e-06, | |
| "loss": 0.0397, | |
| "mean_token_accuracy": 0.9855803847312927, | |
| "step": 559 | |
| }, | |
| { | |
| "epoch": 2.604651162790698, | |
| "grad_norm": 1.2507169246673584, | |
| "learning_rate": 1.4794637549672182e-06, | |
| "loss": 0.0394, | |
| "mean_token_accuracy": 0.9875136017799377, | |
| "step": 560 | |
| }, | |
| { | |
| "epoch": 2.609302325581395, | |
| "grad_norm": 2.15098237991333, | |
| "learning_rate": 1.4685748265859043e-06, | |
| "loss": 0.0272, | |
| "mean_token_accuracy": 0.9911127090454102, | |
| "step": 561 | |
| }, | |
| { | |
| "epoch": 2.613953488372093, | |
| "grad_norm": 1.8859761953353882, | |
| "learning_rate": 1.457804175476751e-06, | |
| "loss": 0.0417, | |
| "mean_token_accuracy": 0.9860853552818298, | |
| "step": 562 | |
| }, | |
| { | |
| "epoch": 2.6186046511627907, | |
| "grad_norm": 1.0621025562286377, | |
| "learning_rate": 1.447152117637992e-06, | |
| "loss": 0.029, | |
| "mean_token_accuracy": 0.9893219470977783, | |
| "step": 563 | |
| }, | |
| { | |
| "epoch": 2.6232558139534885, | |
| "grad_norm": 1.4596385955810547, | |
| "learning_rate": 1.436618965588472e-06, | |
| "loss": 0.0362, | |
| "mean_token_accuracy": 0.9889196753501892, | |
| "step": 564 | |
| }, | |
| { | |
| "epoch": 2.6279069767441863, | |
| "grad_norm": 1.2926936149597168, | |
| "learning_rate": 1.4262050283584836e-06, | |
| "loss": 0.0339, | |
| "mean_token_accuracy": 0.9875206351280212, | |
| "step": 565 | |
| }, | |
| { | |
| "epoch": 2.6325581395348836, | |
| "grad_norm": 1.6519856452941895, | |
| "learning_rate": 1.4159106114806943e-06, | |
| "loss": 0.0417, | |
| "mean_token_accuracy": 0.9887183308601379, | |
| "step": 566 | |
| }, | |
| { | |
| "epoch": 2.6372093023255814, | |
| "grad_norm": 1.3822687864303589, | |
| "learning_rate": 1.4057360169811832e-06, | |
| "loss": 0.0434, | |
| "mean_token_accuracy": 0.9820433259010315, | |
| "step": 567 | |
| }, | |
| { | |
| "epoch": 2.641860465116279, | |
| "grad_norm": 1.1875125169754028, | |
| "learning_rate": 1.3956815433705861e-06, | |
| "loss": 0.0314, | |
| "mean_token_accuracy": 0.9890307784080505, | |
| "step": 568 | |
| }, | |
| { | |
| "epoch": 2.6465116279069765, | |
| "grad_norm": 1.4650956392288208, | |
| "learning_rate": 1.3857474856353299e-06, | |
| "loss": 0.0386, | |
| "mean_token_accuracy": 0.9873239398002625, | |
| "step": 569 | |
| }, | |
| { | |
| "epoch": 2.6511627906976747, | |
| "grad_norm": 1.372135043144226, | |
| "learning_rate": 1.3759341352289832e-06, | |
| "loss": 0.04, | |
| "mean_token_accuracy": 0.986075758934021, | |
| "step": 570 | |
| }, | |
| { | |
| "epoch": 2.655813953488372, | |
| "grad_norm": 1.750218391418457, | |
| "learning_rate": 1.3662417800637023e-06, | |
| "loss": 0.045, | |
| "mean_token_accuracy": 0.983469545841217, | |
| "step": 571 | |
| }, | |
| { | |
| "epoch": 2.66046511627907, | |
| "grad_norm": 1.452467679977417, | |
| "learning_rate": 1.3566707045017867e-06, | |
| "loss": 0.0419, | |
| "mean_token_accuracy": 0.9870980978012085, | |
| "step": 572 | |
| }, | |
| { | |
| "epoch": 2.6651162790697676, | |
| "grad_norm": 1.6090556383132935, | |
| "learning_rate": 1.3472211893473327e-06, | |
| "loss": 0.0424, | |
| "mean_token_accuracy": 0.9856728315353394, | |
| "step": 573 | |
| }, | |
| { | |
| "epoch": 2.669767441860465, | |
| "grad_norm": 1.2582389116287231, | |
| "learning_rate": 1.3378935118380004e-06, | |
| "loss": 0.0362, | |
| "mean_token_accuracy": 0.9885410070419312, | |
| "step": 574 | |
| }, | |
| { | |
| "epoch": 2.6744186046511627, | |
| "grad_norm": 1.1907209157943726, | |
| "learning_rate": 1.3286879456368746e-06, | |
| "loss": 0.0362, | |
| "mean_token_accuracy": 0.9901633858680725, | |
| "step": 575 | |
| }, | |
| { | |
| "epoch": 2.6790697674418604, | |
| "grad_norm": 1.3772821426391602, | |
| "learning_rate": 1.319604760824439e-06, | |
| "loss": 0.0359, | |
| "mean_token_accuracy": 0.9875583052635193, | |
| "step": 576 | |
| }, | |
| { | |
| "epoch": 2.683720930232558, | |
| "grad_norm": 1.8042019605636597, | |
| "learning_rate": 1.31064422389065e-06, | |
| "loss": 0.0427, | |
| "mean_token_accuracy": 0.9862815737724304, | |
| "step": 577 | |
| }, | |
| { | |
| "epoch": 2.688372093023256, | |
| "grad_norm": 1.514086127281189, | |
| "learning_rate": 1.3018065977271215e-06, | |
| "loss": 0.04, | |
| "mean_token_accuracy": 0.9870296120643616, | |
| "step": 578 | |
| }, | |
| { | |
| "epoch": 2.6930232558139533, | |
| "grad_norm": 1.702939510345459, | |
| "learning_rate": 1.293092141619407e-06, | |
| "loss": 0.0425, | |
| "mean_token_accuracy": 0.9871666431427002, | |
| "step": 579 | |
| }, | |
| { | |
| "epoch": 2.697674418604651, | |
| "grad_norm": 1.2727701663970947, | |
| "learning_rate": 1.2845011112394e-06, | |
| "loss": 0.0283, | |
| "mean_token_accuracy": 0.9897069334983826, | |
| "step": 580 | |
| }, | |
| { | |
| "epoch": 2.702325581395349, | |
| "grad_norm": 1.6455163955688477, | |
| "learning_rate": 1.276033758637823e-06, | |
| "loss": 0.0434, | |
| "mean_token_accuracy": 0.9873374104499817, | |
| "step": 581 | |
| }, | |
| { | |
| "epoch": 2.7069767441860466, | |
| "grad_norm": 1.336192011833191, | |
| "learning_rate": 1.2676903322368423e-06, | |
| "loss": 0.0396, | |
| "mean_token_accuracy": 0.9881370067596436, | |
| "step": 582 | |
| }, | |
| { | |
| "epoch": 2.7116279069767444, | |
| "grad_norm": 1.4228109121322632, | |
| "learning_rate": 1.2594710768227734e-06, | |
| "loss": 0.0382, | |
| "mean_token_accuracy": 0.9871864318847656, | |
| "step": 583 | |
| }, | |
| { | |
| "epoch": 2.7162790697674417, | |
| "grad_norm": 1.6291853189468384, | |
| "learning_rate": 1.2513762335389004e-06, | |
| "loss": 0.0449, | |
| "mean_token_accuracy": 0.9863990545272827, | |
| "step": 584 | |
| }, | |
| { | |
| "epoch": 2.7209302325581395, | |
| "grad_norm": 1.453303337097168, | |
| "learning_rate": 1.2434060398784039e-06, | |
| "loss": 0.0382, | |
| "mean_token_accuracy": 0.9885407090187073, | |
| "step": 585 | |
| }, | |
| { | |
| "epoch": 2.7255813953488373, | |
| "grad_norm": 1.9516953229904175, | |
| "learning_rate": 1.2355607296773896e-06, | |
| "loss": 0.0518, | |
| "mean_token_accuracy": 0.9837234616279602, | |
| "step": 586 | |
| }, | |
| { | |
| "epoch": 2.730232558139535, | |
| "grad_norm": 1.5732613801956177, | |
| "learning_rate": 1.2278405331080296e-06, | |
| "loss": 0.0454, | |
| "mean_token_accuracy": 0.9859471321105957, | |
| "step": 587 | |
| }, | |
| { | |
| "epoch": 2.734883720930233, | |
| "grad_norm": 1.4327545166015625, | |
| "learning_rate": 1.2202456766718092e-06, | |
| "loss": 0.0406, | |
| "mean_token_accuracy": 0.9854802489280701, | |
| "step": 588 | |
| }, | |
| { | |
| "epoch": 2.73953488372093, | |
| "grad_norm": 1.2686004638671875, | |
| "learning_rate": 1.212776383192883e-06, | |
| "loss": 0.0377, | |
| "mean_token_accuracy": 0.9876318573951721, | |
| "step": 589 | |
| }, | |
| { | |
| "epoch": 2.744186046511628, | |
| "grad_norm": 1.2385032176971436, | |
| "learning_rate": 1.2054328718115336e-06, | |
| "loss": 0.0358, | |
| "mean_token_accuracy": 0.9881836175918579, | |
| "step": 590 | |
| }, | |
| { | |
| "epoch": 2.7488372093023257, | |
| "grad_norm": 1.3771368265151978, | |
| "learning_rate": 1.1982153579777483e-06, | |
| "loss": 0.0311, | |
| "mean_token_accuracy": 0.9888147115707397, | |
| "step": 591 | |
| }, | |
| { | |
| "epoch": 2.753488372093023, | |
| "grad_norm": 1.4716222286224365, | |
| "learning_rate": 1.1911240534448899e-06, | |
| "loss": 0.0415, | |
| "mean_token_accuracy": 0.9859079718589783, | |
| "step": 592 | |
| }, | |
| { | |
| "epoch": 2.7581395348837208, | |
| "grad_norm": 1.3605318069458008, | |
| "learning_rate": 1.1841591662634943e-06, | |
| "loss": 0.0387, | |
| "mean_token_accuracy": 0.9877007007598877, | |
| "step": 593 | |
| }, | |
| { | |
| "epoch": 2.7627906976744185, | |
| "grad_norm": 1.2023953199386597, | |
| "learning_rate": 1.1773209007751562e-06, | |
| "loss": 0.0356, | |
| "mean_token_accuracy": 0.9872262477874756, | |
| "step": 594 | |
| }, | |
| { | |
| "epoch": 2.7674418604651163, | |
| "grad_norm": 1.6226835250854492, | |
| "learning_rate": 1.1706094576065416e-06, | |
| "loss": 0.0532, | |
| "mean_token_accuracy": 0.9829424023628235, | |
| "step": 595 | |
| }, | |
| { | |
| "epoch": 2.772093023255814, | |
| "grad_norm": 1.4002608060836792, | |
| "learning_rate": 1.164025033663497e-06, | |
| "loss": 0.0353, | |
| "mean_token_accuracy": 0.9847367405891418, | |
| "step": 596 | |
| }, | |
| { | |
| "epoch": 2.7767441860465114, | |
| "grad_norm": 1.3633453845977783, | |
| "learning_rate": 1.1575678221252763e-06, | |
| "loss": 0.0438, | |
| "mean_token_accuracy": 0.9867115020751953, | |
| "step": 597 | |
| }, | |
| { | |
| "epoch": 2.781395348837209, | |
| "grad_norm": 1.5677367448806763, | |
| "learning_rate": 1.1512380124388695e-06, | |
| "loss": 0.0463, | |
| "mean_token_accuracy": 0.9877669811248779, | |
| "step": 598 | |
| }, | |
| { | |
| "epoch": 2.786046511627907, | |
| "grad_norm": 1.2627447843551636, | |
| "learning_rate": 1.1450357903134463e-06, | |
| "loss": 0.0335, | |
| "mean_token_accuracy": 0.9894976615905762, | |
| "step": 599 | |
| }, | |
| { | |
| "epoch": 2.7906976744186047, | |
| "grad_norm": 1.5455451011657715, | |
| "learning_rate": 1.1389613377149086e-06, | |
| "loss": 0.0386, | |
| "mean_token_accuracy": 0.9879539012908936, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 2.7953488372093025, | |
| "grad_norm": 1.4009506702423096, | |
| "learning_rate": 1.1330148328605484e-06, | |
| "loss": 0.0427, | |
| "mean_token_accuracy": 0.9870668053627014, | |
| "step": 601 | |
| }, | |
| { | |
| "epoch": 2.8, | |
| "grad_norm": 1.3464657068252563, | |
| "learning_rate": 1.127196450213825e-06, | |
| "loss": 0.0365, | |
| "mean_token_accuracy": 0.987594485282898, | |
| "step": 602 | |
| }, | |
| { | |
| "epoch": 2.8046511627906976, | |
| "grad_norm": 1.0960040092468262, | |
| "learning_rate": 1.1215063604792396e-06, | |
| "loss": 0.029, | |
| "mean_token_accuracy": 0.9886877536773682, | |
| "step": 603 | |
| }, | |
| { | |
| "epoch": 2.8093023255813954, | |
| "grad_norm": 1.5224353075027466, | |
| "learning_rate": 1.1159447305973313e-06, | |
| "loss": 0.0325, | |
| "mean_token_accuracy": 0.9881473183631897, | |
| "step": 604 | |
| }, | |
| { | |
| "epoch": 2.813953488372093, | |
| "grad_norm": 1.3734958171844482, | |
| "learning_rate": 1.1105117237397777e-06, | |
| "loss": 0.0353, | |
| "mean_token_accuracy": 0.9883147478103638, | |
| "step": 605 | |
| }, | |
| { | |
| "epoch": 2.818604651162791, | |
| "grad_norm": 1.2656145095825195, | |
| "learning_rate": 1.1052074993046102e-06, | |
| "loss": 0.0295, | |
| "mean_token_accuracy": 0.9899190068244934, | |
| "step": 606 | |
| }, | |
| { | |
| "epoch": 2.8232558139534882, | |
| "grad_norm": 1.465860366821289, | |
| "learning_rate": 1.100032212911533e-06, | |
| "loss": 0.0337, | |
| "mean_token_accuracy": 0.9888620972633362, | |
| "step": 607 | |
| }, | |
| { | |
| "epoch": 2.827906976744186, | |
| "grad_norm": 1.199744701385498, | |
| "learning_rate": 1.0949860163973616e-06, | |
| "loss": 0.0362, | |
| "mean_token_accuracy": 0.9871125817298889, | |
| "step": 608 | |
| }, | |
| { | |
| "epoch": 2.832558139534884, | |
| "grad_norm": 1.412898302078247, | |
| "learning_rate": 1.0900690578115643e-06, | |
| "loss": 0.039, | |
| "mean_token_accuracy": 0.9859204888343811, | |
| "step": 609 | |
| }, | |
| { | |
| "epoch": 2.8372093023255816, | |
| "grad_norm": 1.5508508682250977, | |
| "learning_rate": 1.0852814814119238e-06, | |
| "loss": 0.0381, | |
| "mean_token_accuracy": 0.9879411458969116, | |
| "step": 610 | |
| }, | |
| { | |
| "epoch": 2.8418604651162793, | |
| "grad_norm": 1.1056880950927734, | |
| "learning_rate": 1.0806234276602984e-06, | |
| "loss": 0.0256, | |
| "mean_token_accuracy": 0.9905292391777039, | |
| "step": 611 | |
| }, | |
| { | |
| "epoch": 2.8465116279069766, | |
| "grad_norm": 1.3313640356063843, | |
| "learning_rate": 1.0760950332185055e-06, | |
| "loss": 0.0396, | |
| "mean_token_accuracy": 0.9873005747795105, | |
| "step": 612 | |
| }, | |
| { | |
| "epoch": 2.8511627906976744, | |
| "grad_norm": 1.2394826412200928, | |
| "learning_rate": 1.071696430944311e-06, | |
| "loss": 0.0377, | |
| "mean_token_accuracy": 0.9883508086204529, | |
| "step": 613 | |
| }, | |
| { | |
| "epoch": 2.855813953488372, | |
| "grad_norm": 1.625504732131958, | |
| "learning_rate": 1.0674277498875325e-06, | |
| "loss": 0.0412, | |
| "mean_token_accuracy": 0.9862161874771118, | |
| "step": 614 | |
| }, | |
| { | |
| "epoch": 2.8604651162790695, | |
| "grad_norm": 1.3687355518341064, | |
| "learning_rate": 1.0632891152862493e-06, | |
| "loss": 0.0366, | |
| "mean_token_accuracy": 0.9883472919464111, | |
| "step": 615 | |
| }, | |
| { | |
| "epoch": 2.8651162790697673, | |
| "grad_norm": 1.2722115516662598, | |
| "learning_rate": 1.0592806485631326e-06, | |
| "loss": 0.0398, | |
| "mean_token_accuracy": 0.98876953125, | |
| "step": 616 | |
| }, | |
| { | |
| "epoch": 2.869767441860465, | |
| "grad_norm": 1.371472716331482, | |
| "learning_rate": 1.0554024673218808e-06, | |
| "loss": 0.038, | |
| "mean_token_accuracy": 0.988584041595459, | |
| "step": 617 | |
| }, | |
| { | |
| "epoch": 2.874418604651163, | |
| "grad_norm": 1.2753393650054932, | |
| "learning_rate": 1.0516546853437686e-06, | |
| "loss": 0.034, | |
| "mean_token_accuracy": 0.9887096881866455, | |
| "step": 618 | |
| }, | |
| { | |
| "epoch": 2.8790697674418606, | |
| "grad_norm": 1.1802083253860474, | |
| "learning_rate": 1.0480374125843114e-06, | |
| "loss": 0.0309, | |
| "mean_token_accuracy": 0.9907568693161011, | |
| "step": 619 | |
| }, | |
| { | |
| "epoch": 2.883720930232558, | |
| "grad_norm": 1.4220918416976929, | |
| "learning_rate": 1.0445507551700356e-06, | |
| "loss": 0.0351, | |
| "mean_token_accuracy": 0.9894335865974426, | |
| "step": 620 | |
| }, | |
| { | |
| "epoch": 2.8883720930232557, | |
| "grad_norm": 1.5494638681411743, | |
| "learning_rate": 1.0411948153953696e-06, | |
| "loss": 0.0432, | |
| "mean_token_accuracy": 0.9865436553955078, | |
| "step": 621 | |
| }, | |
| { | |
| "epoch": 2.8930232558139535, | |
| "grad_norm": 1.4016937017440796, | |
| "learning_rate": 1.0379696917196378e-06, | |
| "loss": 0.0437, | |
| "mean_token_accuracy": 0.9852824807167053, | |
| "step": 622 | |
| }, | |
| { | |
| "epoch": 2.8976744186046512, | |
| "grad_norm": 1.4522273540496826, | |
| "learning_rate": 1.0348754787641751e-06, | |
| "loss": 0.0327, | |
| "mean_token_accuracy": 0.990084171295166, | |
| "step": 623 | |
| }, | |
| { | |
| "epoch": 2.902325581395349, | |
| "grad_norm": 1.0468897819519043, | |
| "learning_rate": 1.031912267309549e-06, | |
| "loss": 0.028, | |
| "mean_token_accuracy": 0.9912704825401306, | |
| "step": 624 | |
| }, | |
| { | |
| "epoch": 2.9069767441860463, | |
| "grad_norm": 1.261525273323059, | |
| "learning_rate": 1.029080144292899e-06, | |
| "loss": 0.0305, | |
| "mean_token_accuracy": 0.9909120202064514, | |
| "step": 625 | |
| }, | |
| { | |
| "epoch": 2.911627906976744, | |
| "grad_norm": 1.5641429424285889, | |
| "learning_rate": 1.026379192805382e-06, | |
| "loss": 0.0392, | |
| "mean_token_accuracy": 0.988041341304779, | |
| "step": 626 | |
| }, | |
| { | |
| "epoch": 2.916279069767442, | |
| "grad_norm": 1.3897089958190918, | |
| "learning_rate": 1.0238094920897374e-06, | |
| "loss": 0.0376, | |
| "mean_token_accuracy": 0.9882210493087769, | |
| "step": 627 | |
| }, | |
| { | |
| "epoch": 2.9209302325581397, | |
| "grad_norm": 1.2228623628616333, | |
| "learning_rate": 1.0213711175379614e-06, | |
| "loss": 0.0319, | |
| "mean_token_accuracy": 0.9905972480773926, | |
| "step": 628 | |
| }, | |
| { | |
| "epoch": 2.9255813953488374, | |
| "grad_norm": 1.4966614246368408, | |
| "learning_rate": 1.0190641406890946e-06, | |
| "loss": 0.0329, | |
| "mean_token_accuracy": 0.9902123808860779, | |
| "step": 629 | |
| }, | |
| { | |
| "epoch": 2.9302325581395348, | |
| "grad_norm": 1.29335355758667, | |
| "learning_rate": 1.0168886292271246e-06, | |
| "loss": 0.0286, | |
| "mean_token_accuracy": 0.9905264973640442, | |
| "step": 630 | |
| }, | |
| { | |
| "epoch": 2.9348837209302325, | |
| "grad_norm": 1.2947627305984497, | |
| "learning_rate": 1.0148446469789979e-06, | |
| "loss": 0.0302, | |
| "mean_token_accuracy": 0.9908397197723389, | |
| "step": 631 | |
| }, | |
| { | |
| "epoch": 2.9395348837209303, | |
| "grad_norm": 1.5221575498580933, | |
| "learning_rate": 1.0129322539127494e-06, | |
| "loss": 0.0436, | |
| "mean_token_accuracy": 0.9851784706115723, | |
| "step": 632 | |
| }, | |
| { | |
| "epoch": 2.9441860465116276, | |
| "grad_norm": 1.3887416124343872, | |
| "learning_rate": 1.011151506135742e-06, | |
| "loss": 0.0351, | |
| "mean_token_accuracy": 0.9892547726631165, | |
| "step": 633 | |
| }, | |
| { | |
| "epoch": 2.948837209302326, | |
| "grad_norm": 1.3253393173217773, | |
| "learning_rate": 1.0095024558930204e-06, | |
| "loss": 0.04, | |
| "mean_token_accuracy": 0.9875065088272095, | |
| "step": 634 | |
| }, | |
| { | |
| "epoch": 2.953488372093023, | |
| "grad_norm": 1.4894226789474487, | |
| "learning_rate": 1.0079851515657794e-06, | |
| "loss": 0.0497, | |
| "mean_token_accuracy": 0.9831249713897705, | |
| "step": 635 | |
| }, | |
| { | |
| "epoch": 2.958139534883721, | |
| "grad_norm": 1.3437986373901367, | |
| "learning_rate": 1.006599637669943e-06, | |
| "loss": 0.0414, | |
| "mean_token_accuracy": 0.9876566529273987, | |
| "step": 636 | |
| }, | |
| { | |
| "epoch": 2.9627906976744187, | |
| "grad_norm": 1.0954073667526245, | |
| "learning_rate": 1.0053459548548582e-06, | |
| "loss": 0.0305, | |
| "mean_token_accuracy": 0.9911620020866394, | |
| "step": 637 | |
| }, | |
| { | |
| "epoch": 2.967441860465116, | |
| "grad_norm": 1.5746396780014038, | |
| "learning_rate": 1.004224139902105e-06, | |
| "loss": 0.0437, | |
| "mean_token_accuracy": 0.9854601621627808, | |
| "step": 638 | |
| }, | |
| { | |
| "epoch": 2.972093023255814, | |
| "grad_norm": 1.400350570678711, | |
| "learning_rate": 1.0032342257244139e-06, | |
| "loss": 0.0383, | |
| "mean_token_accuracy": 0.9862048029899597, | |
| "step": 639 | |
| }, | |
| { | |
| "epoch": 2.9767441860465116, | |
| "grad_norm": 1.3652901649475098, | |
| "learning_rate": 1.0023762413647023e-06, | |
| "loss": 0.039, | |
| "mean_token_accuracy": 0.9866381883621216, | |
| "step": 640 | |
| }, | |
| { | |
| "epoch": 2.9813953488372094, | |
| "grad_norm": 1.742617130279541, | |
| "learning_rate": 1.0016502119952224e-06, | |
| "loss": 0.0574, | |
| "mean_token_accuracy": 0.9840995669364929, | |
| "step": 641 | |
| }, | |
| { | |
| "epoch": 2.986046511627907, | |
| "grad_norm": 1.3435075283050537, | |
| "learning_rate": 1.0010561589168217e-06, | |
| "loss": 0.0363, | |
| "mean_token_accuracy": 0.9854980111122131, | |
| "step": 642 | |
| }, | |
| { | |
| "epoch": 2.9906976744186045, | |
| "grad_norm": 1.7960363626480103, | |
| "learning_rate": 1.0005940995583183e-06, | |
| "loss": 0.0452, | |
| "mean_token_accuracy": 0.9852866530418396, | |
| "step": 643 | |
| }, | |
| { | |
| "epoch": 2.9953488372093022, | |
| "grad_norm": 1.5572556257247925, | |
| "learning_rate": 1.0002640474759911e-06, | |
| "loss": 0.0327, | |
| "mean_token_accuracy": 0.9882596731185913, | |
| "step": 644 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "grad_norm": 0.6895026564598083, | |
| "learning_rate": 1.0000660123531788e-06, | |
| "loss": 0.0115, | |
| "mean_token_accuracy": 0.997201144695282, | |
| "step": 645 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "step": 645, | |
| "total_flos": 6.064391158811853e+17, | |
| "train_loss": 0.013678103204556676, | |
| "train_runtime": 808.3613, | |
| "train_samples_per_second": 25.426, | |
| "train_steps_per_second": 0.798 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 645, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 6.064391158811853e+17, | |
| "train_batch_size": 4, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |