Instructions to use infinitylogesh/vlm-workshop-qwen3.5-0.8b-sdft with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use infinitylogesh/vlm-workshop-qwen3.5-0.8b-sdft with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("Qwen/Qwen3.5-0.8B") model = PeftModel.from_pretrained(base_model, "infinitylogesh/vlm-workshop-qwen3.5-0.8b-sdft") - Transformers
How to use infinitylogesh/vlm-workshop-qwen3.5-0.8b-sdft with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="infinitylogesh/vlm-workshop-qwen3.5-0.8b-sdft") messages = [ {"role": "user", "content": "Who are you?"}, ] pipe(messages)# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("infinitylogesh/vlm-workshop-qwen3.5-0.8b-sdft", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use infinitylogesh/vlm-workshop-qwen3.5-0.8b-sdft with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "infinitylogesh/vlm-workshop-qwen3.5-0.8b-sdft" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "infinitylogesh/vlm-workshop-qwen3.5-0.8b-sdft", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker
docker model run hf.co/infinitylogesh/vlm-workshop-qwen3.5-0.8b-sdft
- SGLang
How to use infinitylogesh/vlm-workshop-qwen3.5-0.8b-sdft with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "infinitylogesh/vlm-workshop-qwen3.5-0.8b-sdft" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "infinitylogesh/vlm-workshop-qwen3.5-0.8b-sdft", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "infinitylogesh/vlm-workshop-qwen3.5-0.8b-sdft" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "infinitylogesh/vlm-workshop-qwen3.5-0.8b-sdft", "messages": [ { "role": "user", "content": "What is the capital of France?" } ] }' - Docker Model Runner
How to use infinitylogesh/vlm-workshop-qwen3.5-0.8b-sdft with Docker Model Runner:
docker model run hf.co/infinitylogesh/vlm-workshop-qwen3.5-0.8b-sdft
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 3.2, | |
| "eval_steps": 500, | |
| "global_step": 400, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.008, | |
| "grad_norm": 0.09337692707777023, | |
| "learning_rate": 2e-05, | |
| "loss": 0.015294969081878662, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 0.016, | |
| "grad_norm": 0.07111852616071701, | |
| "learning_rate": 2e-05, | |
| "loss": 0.007340883836150169, | |
| "step": 2 | |
| }, | |
| { | |
| "epoch": 0.024, | |
| "grad_norm": 0.07195291668176651, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0077208466827869415, | |
| "step": 3 | |
| }, | |
| { | |
| "epoch": 0.032, | |
| "grad_norm": 0.09681837260723114, | |
| "learning_rate": 2e-05, | |
| "loss": 0.008473804220557213, | |
| "step": 4 | |
| }, | |
| { | |
| "epoch": 0.04, | |
| "grad_norm": 0.06043309345841408, | |
| "learning_rate": 2e-05, | |
| "loss": 0.006642022170126438, | |
| "step": 5 | |
| }, | |
| { | |
| "epoch": 0.048, | |
| "grad_norm": 0.05604363605380058, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003878322197124362, | |
| "step": 6 | |
| }, | |
| { | |
| "epoch": 0.056, | |
| "grad_norm": 0.06847543269395828, | |
| "learning_rate": 2e-05, | |
| "loss": 0.011454813182353973, | |
| "step": 7 | |
| }, | |
| { | |
| "epoch": 0.064, | |
| "grad_norm": 0.05413937568664551, | |
| "learning_rate": 2e-05, | |
| "loss": 0.005098872818052769, | |
| "step": 8 | |
| }, | |
| { | |
| "epoch": 0.072, | |
| "grad_norm": 0.04113985598087311, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0072427294217050076, | |
| "step": 9 | |
| }, | |
| { | |
| "epoch": 0.08, | |
| "grad_norm": 0.06007072329521179, | |
| "learning_rate": 2e-05, | |
| "loss": 0.005184551235288382, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.088, | |
| "grad_norm": 0.05269957333803177, | |
| "learning_rate": 2e-05, | |
| "loss": 0.006402506493031979, | |
| "step": 11 | |
| }, | |
| { | |
| "epoch": 0.096, | |
| "grad_norm": 0.07171762734651566, | |
| "learning_rate": 2e-05, | |
| "loss": 0.006807660683989525, | |
| "step": 12 | |
| }, | |
| { | |
| "epoch": 0.104, | |
| "grad_norm": 0.04405634105205536, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0049944375641644, | |
| "step": 13 | |
| }, | |
| { | |
| "epoch": 0.112, | |
| "grad_norm": 0.04304119199514389, | |
| "learning_rate": 2e-05, | |
| "loss": 0.005410908255726099, | |
| "step": 14 | |
| }, | |
| { | |
| "epoch": 0.12, | |
| "grad_norm": 0.057690370827913284, | |
| "learning_rate": 2e-05, | |
| "loss": 0.007783032953739166, | |
| "step": 15 | |
| }, | |
| { | |
| "epoch": 0.128, | |
| "grad_norm": 0.04541298747062683, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004243949428200722, | |
| "step": 16 | |
| }, | |
| { | |
| "epoch": 0.136, | |
| "grad_norm": 0.06319569051265717, | |
| "learning_rate": 2e-05, | |
| "loss": 0.005336169619113207, | |
| "step": 17 | |
| }, | |
| { | |
| "epoch": 0.144, | |
| "grad_norm": 0.03583596274256706, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004895349964499474, | |
| "step": 18 | |
| }, | |
| { | |
| "epoch": 0.152, | |
| "grad_norm": 0.05986885726451874, | |
| "learning_rate": 2e-05, | |
| "loss": 0.006950004491955042, | |
| "step": 19 | |
| }, | |
| { | |
| "epoch": 0.16, | |
| "grad_norm": 0.08991007506847382, | |
| "learning_rate": 2e-05, | |
| "loss": 0.00810159184038639, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.168, | |
| "grad_norm": 0.05890341475605965, | |
| "learning_rate": 2e-05, | |
| "loss": 0.006250896491110325, | |
| "step": 21 | |
| }, | |
| { | |
| "epoch": 0.176, | |
| "grad_norm": 0.04574795812368393, | |
| "learning_rate": 2e-05, | |
| "loss": 0.005519284401088953, | |
| "step": 22 | |
| }, | |
| { | |
| "epoch": 0.184, | |
| "grad_norm": 0.05631595849990845, | |
| "learning_rate": 2e-05, | |
| "loss": 0.00560405757278204, | |
| "step": 23 | |
| }, | |
| { | |
| "epoch": 0.192, | |
| "grad_norm": 0.06935696303844452, | |
| "learning_rate": 2e-05, | |
| "loss": 0.00864097848534584, | |
| "step": 24 | |
| }, | |
| { | |
| "epoch": 0.2, | |
| "grad_norm": 0.04360036551952362, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003752000629901886, | |
| "step": 25 | |
| }, | |
| { | |
| "epoch": 0.208, | |
| "grad_norm": 0.05469367280602455, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0067576696164906025, | |
| "step": 26 | |
| }, | |
| { | |
| "epoch": 0.216, | |
| "grad_norm": 0.06384038180112839, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004895553924143314, | |
| "step": 27 | |
| }, | |
| { | |
| "epoch": 0.224, | |
| "grad_norm": 0.06384114921092987, | |
| "learning_rate": 2e-05, | |
| "loss": 0.005900057964026928, | |
| "step": 28 | |
| }, | |
| { | |
| "epoch": 0.232, | |
| "grad_norm": 0.0655912533402443, | |
| "learning_rate": 2e-05, | |
| "loss": 0.005855287425220013, | |
| "step": 29 | |
| }, | |
| { | |
| "epoch": 0.24, | |
| "grad_norm": 0.04619958996772766, | |
| "learning_rate": 2e-05, | |
| "loss": 0.005466114729642868, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.248, | |
| "grad_norm": 0.04525391384959221, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004368640948086977, | |
| "step": 31 | |
| }, | |
| { | |
| "epoch": 0.256, | |
| "grad_norm": 0.04429985210299492, | |
| "learning_rate": 2e-05, | |
| "loss": 0.005769067443907261, | |
| "step": 32 | |
| }, | |
| { | |
| "epoch": 0.264, | |
| "grad_norm": 0.03835798799991608, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004946814849972725, | |
| "step": 33 | |
| }, | |
| { | |
| "epoch": 0.272, | |
| "grad_norm": 0.06351771950721741, | |
| "learning_rate": 2e-05, | |
| "loss": 0.005820239428430796, | |
| "step": 34 | |
| }, | |
| { | |
| "epoch": 0.28, | |
| "grad_norm": 0.05175631865859032, | |
| "learning_rate": 2e-05, | |
| "loss": 0.007221951149404049, | |
| "step": 35 | |
| }, | |
| { | |
| "epoch": 0.288, | |
| "grad_norm": 0.031039636582136154, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0024754288606345654, | |
| "step": 36 | |
| }, | |
| { | |
| "epoch": 0.296, | |
| "grad_norm": 0.04708324000239372, | |
| "learning_rate": 2e-05, | |
| "loss": 0.002840370638296008, | |
| "step": 37 | |
| }, | |
| { | |
| "epoch": 0.304, | |
| "grad_norm": 0.06475556641817093, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0077974689193069935, | |
| "step": 38 | |
| }, | |
| { | |
| "epoch": 0.312, | |
| "grad_norm": 0.048895902931690216, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0040883091278374195, | |
| "step": 39 | |
| }, | |
| { | |
| "epoch": 0.32, | |
| "grad_norm": 0.058496665209531784, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004431126173585653, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.328, | |
| "grad_norm": 0.0752127543091774, | |
| "learning_rate": 2e-05, | |
| "loss": 0.009588265791535378, | |
| "step": 41 | |
| }, | |
| { | |
| "epoch": 0.336, | |
| "grad_norm": 0.029396817088127136, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004547424148768187, | |
| "step": 42 | |
| }, | |
| { | |
| "epoch": 0.344, | |
| "grad_norm": 0.10113711655139923, | |
| "learning_rate": 2e-05, | |
| "loss": 0.00836176797747612, | |
| "step": 43 | |
| }, | |
| { | |
| "epoch": 0.352, | |
| "grad_norm": 0.04212963953614235, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004907882306724787, | |
| "step": 44 | |
| }, | |
| { | |
| "epoch": 0.36, | |
| "grad_norm": 0.02902965061366558, | |
| "learning_rate": 2e-05, | |
| "loss": 0.002945390995591879, | |
| "step": 45 | |
| }, | |
| { | |
| "epoch": 0.368, | |
| "grad_norm": 0.05033962428569794, | |
| "learning_rate": 2e-05, | |
| "loss": 0.005018638446927071, | |
| "step": 46 | |
| }, | |
| { | |
| "epoch": 0.376, | |
| "grad_norm": 0.034906402230262756, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0026375213637948036, | |
| "step": 47 | |
| }, | |
| { | |
| "epoch": 0.384, | |
| "grad_norm": 0.03871266171336174, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004687938839197159, | |
| "step": 48 | |
| }, | |
| { | |
| "epoch": 0.392, | |
| "grad_norm": 0.040328506380319595, | |
| "learning_rate": 2e-05, | |
| "loss": 0.006280779838562012, | |
| "step": 49 | |
| }, | |
| { | |
| "epoch": 0.4, | |
| "grad_norm": 0.04712209478020668, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0031323714647442102, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.408, | |
| "grad_norm": 0.045797791332006454, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004443546291440725, | |
| "step": 51 | |
| }, | |
| { | |
| "epoch": 0.416, | |
| "grad_norm": 0.06185959652066231, | |
| "learning_rate": 2e-05, | |
| "loss": 0.008573911152780056, | |
| "step": 52 | |
| }, | |
| { | |
| "epoch": 0.424, | |
| "grad_norm": 0.059398140758275986, | |
| "learning_rate": 2e-05, | |
| "loss": 0.00942009873688221, | |
| "step": 53 | |
| }, | |
| { | |
| "epoch": 0.432, | |
| "grad_norm": 0.07633177191019058, | |
| "learning_rate": 2e-05, | |
| "loss": 0.009616912342607975, | |
| "step": 54 | |
| }, | |
| { | |
| "epoch": 0.44, | |
| "grad_norm": 0.053814005106687546, | |
| "learning_rate": 2e-05, | |
| "loss": 0.007603101897984743, | |
| "step": 55 | |
| }, | |
| { | |
| "epoch": 0.448, | |
| "grad_norm": 0.05707194656133652, | |
| "learning_rate": 2e-05, | |
| "loss": 0.005355853587388992, | |
| "step": 56 | |
| }, | |
| { | |
| "epoch": 0.456, | |
| "grad_norm": 0.04392722621560097, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003092748112976551, | |
| "step": 57 | |
| }, | |
| { | |
| "epoch": 0.464, | |
| "grad_norm": 0.027375129982829094, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003245085943490267, | |
| "step": 58 | |
| }, | |
| { | |
| "epoch": 0.472, | |
| "grad_norm": 0.05855637416243553, | |
| "learning_rate": 2e-05, | |
| "loss": 0.006621942389756441, | |
| "step": 59 | |
| }, | |
| { | |
| "epoch": 0.48, | |
| "grad_norm": 0.040302883833646774, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004884965717792511, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.488, | |
| "grad_norm": 0.038790635764598846, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0041805170476436615, | |
| "step": 61 | |
| }, | |
| { | |
| "epoch": 0.496, | |
| "grad_norm": 0.059503670781850815, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0071491943672299385, | |
| "step": 62 | |
| }, | |
| { | |
| "epoch": 0.504, | |
| "grad_norm": 0.059957440942525864, | |
| "learning_rate": 2e-05, | |
| "loss": 0.006595572456717491, | |
| "step": 63 | |
| }, | |
| { | |
| "epoch": 0.512, | |
| "grad_norm": 0.05570148676633835, | |
| "learning_rate": 2e-05, | |
| "loss": 0.007463263813406229, | |
| "step": 64 | |
| }, | |
| { | |
| "epoch": 0.52, | |
| "grad_norm": 0.056187067180871964, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004543005023151636, | |
| "step": 65 | |
| }, | |
| { | |
| "epoch": 0.528, | |
| "grad_norm": 0.04404418170452118, | |
| "learning_rate": 2e-05, | |
| "loss": 0.006366059184074402, | |
| "step": 66 | |
| }, | |
| { | |
| "epoch": 0.536, | |
| "grad_norm": 0.049447719007730484, | |
| "learning_rate": 2e-05, | |
| "loss": 0.006581606809049845, | |
| "step": 67 | |
| }, | |
| { | |
| "epoch": 0.544, | |
| "grad_norm": 0.03419354185461998, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0035948362201452255, | |
| "step": 68 | |
| }, | |
| { | |
| "epoch": 0.552, | |
| "grad_norm": 0.05780700221657753, | |
| "learning_rate": 2e-05, | |
| "loss": 0.005125825759023428, | |
| "step": 69 | |
| }, | |
| { | |
| "epoch": 0.56, | |
| "grad_norm": 0.06544717401266098, | |
| "learning_rate": 2e-05, | |
| "loss": 0.006060135085135698, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.568, | |
| "grad_norm": 0.04413054138422012, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003213978838175535, | |
| "step": 71 | |
| }, | |
| { | |
| "epoch": 0.576, | |
| "grad_norm": 0.039240192621946335, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004292209167033434, | |
| "step": 72 | |
| }, | |
| { | |
| "epoch": 0.584, | |
| "grad_norm": 0.060329239815473557, | |
| "learning_rate": 2e-05, | |
| "loss": 0.006161934696137905, | |
| "step": 73 | |
| }, | |
| { | |
| "epoch": 0.592, | |
| "grad_norm": 0.06489120423793793, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0032440992072224617, | |
| "step": 74 | |
| }, | |
| { | |
| "epoch": 0.6, | |
| "grad_norm": 0.04400647059082985, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004546411335468292, | |
| "step": 75 | |
| }, | |
| { | |
| "epoch": 0.608, | |
| "grad_norm": 0.046490587294101715, | |
| "learning_rate": 2e-05, | |
| "loss": 0.00506614800542593, | |
| "step": 76 | |
| }, | |
| { | |
| "epoch": 0.616, | |
| "grad_norm": 0.03474031388759613, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003143966430798173, | |
| "step": 77 | |
| }, | |
| { | |
| "epoch": 0.624, | |
| "grad_norm": 0.04975699633359909, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004066984634846449, | |
| "step": 78 | |
| }, | |
| { | |
| "epoch": 0.632, | |
| "grad_norm": 0.06441677361726761, | |
| "learning_rate": 2e-05, | |
| "loss": 0.007056248374283314, | |
| "step": 79 | |
| }, | |
| { | |
| "epoch": 0.64, | |
| "grad_norm": 0.05794770270586014, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0037886211648583412, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.648, | |
| "grad_norm": 0.06725575029850006, | |
| "learning_rate": 2e-05, | |
| "loss": 0.005529267713427544, | |
| "step": 81 | |
| }, | |
| { | |
| "epoch": 0.656, | |
| "grad_norm": 0.05235245078802109, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0031472702976316214, | |
| "step": 82 | |
| }, | |
| { | |
| "epoch": 0.664, | |
| "grad_norm": 0.0473208874464035, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004731162916868925, | |
| "step": 83 | |
| }, | |
| { | |
| "epoch": 0.672, | |
| "grad_norm": 0.05135403573513031, | |
| "learning_rate": 2e-05, | |
| "loss": 0.005146307405084372, | |
| "step": 84 | |
| }, | |
| { | |
| "epoch": 0.68, | |
| "grad_norm": 0.04229608178138733, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004758044611662626, | |
| "step": 85 | |
| }, | |
| { | |
| "epoch": 0.688, | |
| "grad_norm": 0.04035644605755806, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0043296488001942635, | |
| "step": 86 | |
| }, | |
| { | |
| "epoch": 0.696, | |
| "grad_norm": 0.060147274285554886, | |
| "learning_rate": 2e-05, | |
| "loss": 0.008551320061087608, | |
| "step": 87 | |
| }, | |
| { | |
| "epoch": 0.704, | |
| "grad_norm": 0.0395248718559742, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0024903551675379276, | |
| "step": 88 | |
| }, | |
| { | |
| "epoch": 0.712, | |
| "grad_norm": 0.071822389960289, | |
| "learning_rate": 2e-05, | |
| "loss": 0.008494703099131584, | |
| "step": 89 | |
| }, | |
| { | |
| "epoch": 0.72, | |
| "grad_norm": 0.058960266411304474, | |
| "learning_rate": 2e-05, | |
| "loss": 0.006603310350328684, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.728, | |
| "grad_norm": 0.05052534490823746, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0058289458975195885, | |
| "step": 91 | |
| }, | |
| { | |
| "epoch": 0.736, | |
| "grad_norm": 0.049510154873132706, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003644926007837057, | |
| "step": 92 | |
| }, | |
| { | |
| "epoch": 0.744, | |
| "grad_norm": 0.0739966556429863, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0028007840737700462, | |
| "step": 93 | |
| }, | |
| { | |
| "epoch": 0.752, | |
| "grad_norm": 0.07646612823009491, | |
| "learning_rate": 2e-05, | |
| "loss": 0.010534452274441719, | |
| "step": 94 | |
| }, | |
| { | |
| "epoch": 0.76, | |
| "grad_norm": 0.05939766764640808, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004194422625005245, | |
| "step": 95 | |
| }, | |
| { | |
| "epoch": 0.768, | |
| "grad_norm": 0.049664683640003204, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003597400849685073, | |
| "step": 96 | |
| }, | |
| { | |
| "epoch": 0.776, | |
| "grad_norm": 0.13988253474235535, | |
| "learning_rate": 2e-05, | |
| "loss": 0.006600011605769396, | |
| "step": 97 | |
| }, | |
| { | |
| "epoch": 0.784, | |
| "grad_norm": 0.06141381338238716, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004176464397460222, | |
| "step": 98 | |
| }, | |
| { | |
| "epoch": 0.792, | |
| "grad_norm": 0.040125612169504166, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0029954789206385612, | |
| "step": 99 | |
| }, | |
| { | |
| "epoch": 0.8, | |
| "grad_norm": 0.05379870533943176, | |
| "learning_rate": 2e-05, | |
| "loss": 0.005120614543557167, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.808, | |
| "grad_norm": 0.04878966137766838, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0049518863670527935, | |
| "step": 101 | |
| }, | |
| { | |
| "epoch": 0.816, | |
| "grad_norm": 0.0832071602344513, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003636852605268359, | |
| "step": 102 | |
| }, | |
| { | |
| "epoch": 0.824, | |
| "grad_norm": 0.1109263077378273, | |
| "learning_rate": 2e-05, | |
| "loss": 0.011921115219593048, | |
| "step": 103 | |
| }, | |
| { | |
| "epoch": 0.832, | |
| "grad_norm": 0.037266287952661514, | |
| "learning_rate": 2e-05, | |
| "loss": 0.002762642689049244, | |
| "step": 104 | |
| }, | |
| { | |
| "epoch": 0.84, | |
| "grad_norm": 0.044354166835546494, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004988430067896843, | |
| "step": 105 | |
| }, | |
| { | |
| "epoch": 0.848, | |
| "grad_norm": 0.03570897877216339, | |
| "learning_rate": 2e-05, | |
| "loss": 0.002259196015074849, | |
| "step": 106 | |
| }, | |
| { | |
| "epoch": 0.856, | |
| "grad_norm": 0.059259530156850815, | |
| "learning_rate": 2e-05, | |
| "loss": 0.006721946410834789, | |
| "step": 107 | |
| }, | |
| { | |
| "epoch": 0.864, | |
| "grad_norm": 0.05184999480843544, | |
| "learning_rate": 2e-05, | |
| "loss": 0.005531419534236193, | |
| "step": 108 | |
| }, | |
| { | |
| "epoch": 0.872, | |
| "grad_norm": 0.08037418127059937, | |
| "learning_rate": 2e-05, | |
| "loss": 0.006799847353249788, | |
| "step": 109 | |
| }, | |
| { | |
| "epoch": 0.88, | |
| "grad_norm": 0.039056453853845596, | |
| "learning_rate": 2e-05, | |
| "loss": 0.00481954962015152, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 0.888, | |
| "grad_norm": 0.05626671388745308, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0032779546454548836, | |
| "step": 111 | |
| }, | |
| { | |
| "epoch": 0.896, | |
| "grad_norm": 0.05177405849099159, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004294276237487793, | |
| "step": 112 | |
| }, | |
| { | |
| "epoch": 0.904, | |
| "grad_norm": 0.029522892087697983, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0030598388984799385, | |
| "step": 113 | |
| }, | |
| { | |
| "epoch": 0.912, | |
| "grad_norm": 0.05130866542458534, | |
| "learning_rate": 2e-05, | |
| "loss": 0.005800556857138872, | |
| "step": 114 | |
| }, | |
| { | |
| "epoch": 0.92, | |
| "grad_norm": 0.021749891340732574, | |
| "learning_rate": 2e-05, | |
| "loss": 0.001492157345637679, | |
| "step": 115 | |
| }, | |
| { | |
| "epoch": 0.928, | |
| "grad_norm": 0.0728369727730751, | |
| "learning_rate": 2e-05, | |
| "loss": 0.008168019354343414, | |
| "step": 116 | |
| }, | |
| { | |
| "epoch": 0.936, | |
| "grad_norm": 0.051655277609825134, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004517991095781326, | |
| "step": 117 | |
| }, | |
| { | |
| "epoch": 0.944, | |
| "grad_norm": 0.028527911752462387, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004356182646006346, | |
| "step": 118 | |
| }, | |
| { | |
| "epoch": 0.952, | |
| "grad_norm": 0.04092099890112877, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0035778400488197803, | |
| "step": 119 | |
| }, | |
| { | |
| "epoch": 0.96, | |
| "grad_norm": 0.06751365959644318, | |
| "learning_rate": 2e-05, | |
| "loss": 0.006765933241695166, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 0.968, | |
| "grad_norm": 0.06141749769449234, | |
| "learning_rate": 2e-05, | |
| "loss": 0.010381967760622501, | |
| "step": 121 | |
| }, | |
| { | |
| "epoch": 0.976, | |
| "grad_norm": 0.0584125854074955, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0059956214390695095, | |
| "step": 122 | |
| }, | |
| { | |
| "epoch": 0.984, | |
| "grad_norm": 0.06699343770742416, | |
| "learning_rate": 2e-05, | |
| "loss": 0.006007581949234009, | |
| "step": 123 | |
| }, | |
| { | |
| "epoch": 0.992, | |
| "grad_norm": 0.04457642510533333, | |
| "learning_rate": 2e-05, | |
| "loss": 0.00433978158980608, | |
| "step": 124 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 0.0724361315369606, | |
| "learning_rate": 2e-05, | |
| "loss": 0.009294194169342518, | |
| "step": 125 | |
| }, | |
| { | |
| "epoch": 1.008, | |
| "grad_norm": 0.041911620646715164, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0031240973621606827, | |
| "step": 126 | |
| }, | |
| { | |
| "epoch": 1.016, | |
| "grad_norm": 0.03944513201713562, | |
| "learning_rate": 2e-05, | |
| "loss": 0.005666844546794891, | |
| "step": 127 | |
| }, | |
| { | |
| "epoch": 1.024, | |
| "grad_norm": 0.024236207827925682, | |
| "learning_rate": 2e-05, | |
| "loss": 0.002599143423140049, | |
| "step": 128 | |
| }, | |
| { | |
| "epoch": 1.032, | |
| "grad_norm": 0.02648847922682762, | |
| "learning_rate": 2e-05, | |
| "loss": 0.002489139325916767, | |
| "step": 129 | |
| }, | |
| { | |
| "epoch": 1.04, | |
| "grad_norm": 0.03522297367453575, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0031560207717120647, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 1.048, | |
| "grad_norm": 0.03963733837008476, | |
| "learning_rate": 2e-05, | |
| "loss": 0.002944512525573373, | |
| "step": 131 | |
| }, | |
| { | |
| "epoch": 1.056, | |
| "grad_norm": 0.043245717883110046, | |
| "learning_rate": 2e-05, | |
| "loss": 0.005929629784077406, | |
| "step": 132 | |
| }, | |
| { | |
| "epoch": 1.064, | |
| "grad_norm": 0.04024028778076172, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0028088355902582407, | |
| "step": 133 | |
| }, | |
| { | |
| "epoch": 1.072, | |
| "grad_norm": 0.03739921376109123, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0025795348919928074, | |
| "step": 134 | |
| }, | |
| { | |
| "epoch": 1.08, | |
| "grad_norm": 0.053612496703863144, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0051528215408325195, | |
| "step": 135 | |
| }, | |
| { | |
| "epoch": 1.088, | |
| "grad_norm": 0.03874121978878975, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0029356672894209623, | |
| "step": 136 | |
| }, | |
| { | |
| "epoch": 1.096, | |
| "grad_norm": 0.04209478199481964, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004753364250063896, | |
| "step": 137 | |
| }, | |
| { | |
| "epoch": 1.104, | |
| "grad_norm": 0.032321907579898834, | |
| "learning_rate": 2e-05, | |
| "loss": 0.002570532029494643, | |
| "step": 138 | |
| }, | |
| { | |
| "epoch": 1.112, | |
| "grad_norm": 0.03770575299859047, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0032067985739558935, | |
| "step": 139 | |
| }, | |
| { | |
| "epoch": 1.12, | |
| "grad_norm": 0.042145032435655594, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004715348593890667, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 1.1280000000000001, | |
| "grad_norm": 0.04259483888745308, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0040532853454351425, | |
| "step": 141 | |
| }, | |
| { | |
| "epoch": 1.1360000000000001, | |
| "grad_norm": 0.04432355985045433, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004878481850028038, | |
| "step": 142 | |
| }, | |
| { | |
| "epoch": 1.144, | |
| "grad_norm": 0.04144922271370888, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0035966027062386274, | |
| "step": 143 | |
| }, | |
| { | |
| "epoch": 1.152, | |
| "grad_norm": 0.034188415855169296, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0035179737024009228, | |
| "step": 144 | |
| }, | |
| { | |
| "epoch": 1.16, | |
| "grad_norm": 0.04314472898840904, | |
| "learning_rate": 2e-05, | |
| "loss": 0.00275869807228446, | |
| "step": 145 | |
| }, | |
| { | |
| "epoch": 1.168, | |
| "grad_norm": 0.03345927596092224, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004454055335372686, | |
| "step": 146 | |
| }, | |
| { | |
| "epoch": 1.176, | |
| "grad_norm": 0.032709989696741104, | |
| "learning_rate": 2e-05, | |
| "loss": 0.002561516361311078, | |
| "step": 147 | |
| }, | |
| { | |
| "epoch": 1.184, | |
| "grad_norm": 0.037629563361406326, | |
| "learning_rate": 2e-05, | |
| "loss": 0.002726494800299406, | |
| "step": 148 | |
| }, | |
| { | |
| "epoch": 1.192, | |
| "grad_norm": 0.03565853834152222, | |
| "learning_rate": 2e-05, | |
| "loss": 0.005714224185794592, | |
| "step": 149 | |
| }, | |
| { | |
| "epoch": 1.2, | |
| "grad_norm": 0.04101553559303284, | |
| "learning_rate": 2e-05, | |
| "loss": 0.00477135693654418, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 1.208, | |
| "grad_norm": 0.02103736251592636, | |
| "learning_rate": 2e-05, | |
| "loss": 0.00214054505340755, | |
| "step": 151 | |
| }, | |
| { | |
| "epoch": 1.216, | |
| "grad_norm": 0.038353558629751205, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0023091635666787624, | |
| "step": 152 | |
| }, | |
| { | |
| "epoch": 1.224, | |
| "grad_norm": 0.03039981611073017, | |
| "learning_rate": 2e-05, | |
| "loss": 0.002429583575576544, | |
| "step": 153 | |
| }, | |
| { | |
| "epoch": 1.232, | |
| "grad_norm": 0.038060858845710754, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0024876513052731752, | |
| "step": 154 | |
| }, | |
| { | |
| "epoch": 1.24, | |
| "grad_norm": 0.10335491597652435, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0025280544068664312, | |
| "step": 155 | |
| }, | |
| { | |
| "epoch": 1.248, | |
| "grad_norm": 0.040877990424633026, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004313280805945396, | |
| "step": 156 | |
| }, | |
| { | |
| "epoch": 1.256, | |
| "grad_norm": 0.05562249571084976, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0048119621351361275, | |
| "step": 157 | |
| }, | |
| { | |
| "epoch": 1.264, | |
| "grad_norm": 0.05108984187245369, | |
| "learning_rate": 2e-05, | |
| "loss": 0.00518863694742322, | |
| "step": 158 | |
| }, | |
| { | |
| "epoch": 1.272, | |
| "grad_norm": 0.05357106775045395, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0024496042169630527, | |
| "step": 159 | |
| }, | |
| { | |
| "epoch": 1.28, | |
| "grad_norm": 0.037901945412158966, | |
| "learning_rate": 2e-05, | |
| "loss": 0.002475207205861807, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 1.288, | |
| "grad_norm": 0.0420001782476902, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0058222366496920586, | |
| "step": 161 | |
| }, | |
| { | |
| "epoch": 1.296, | |
| "grad_norm": 0.05443611368536949, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0052161430940032005, | |
| "step": 162 | |
| }, | |
| { | |
| "epoch": 1.304, | |
| "grad_norm": 0.05211922898888588, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004603986628353596, | |
| "step": 163 | |
| }, | |
| { | |
| "epoch": 1.312, | |
| "grad_norm": 0.04726783558726311, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004252967424690723, | |
| "step": 164 | |
| }, | |
| { | |
| "epoch": 1.32, | |
| "grad_norm": 0.07070634514093399, | |
| "learning_rate": 2e-05, | |
| "loss": 0.006596374791115522, | |
| "step": 165 | |
| }, | |
| { | |
| "epoch": 1.328, | |
| "grad_norm": 0.05988767370581627, | |
| "learning_rate": 2e-05, | |
| "loss": 0.006062244065105915, | |
| "step": 166 | |
| }, | |
| { | |
| "epoch": 1.336, | |
| "grad_norm": 0.06943166255950928, | |
| "learning_rate": 2e-05, | |
| "loss": 0.007745644543319941, | |
| "step": 167 | |
| }, | |
| { | |
| "epoch": 1.3439999999999999, | |
| "grad_norm": 0.03787314146757126, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003922807518392801, | |
| "step": 168 | |
| }, | |
| { | |
| "epoch": 1.3519999999999999, | |
| "grad_norm": 0.02878367155790329, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0019241905538365245, | |
| "step": 169 | |
| }, | |
| { | |
| "epoch": 1.3599999999999999, | |
| "grad_norm": 0.05218566954135895, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0058232140727341175, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 1.3679999999999999, | |
| "grad_norm": 0.06744556874036789, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004936105106025934, | |
| "step": 171 | |
| }, | |
| { | |
| "epoch": 1.376, | |
| "grad_norm": 0.04349220544099808, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003136698855087161, | |
| "step": 172 | |
| }, | |
| { | |
| "epoch": 1.384, | |
| "grad_norm": 0.046757787466049194, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004662223160266876, | |
| "step": 173 | |
| }, | |
| { | |
| "epoch": 1.392, | |
| "grad_norm": 0.03483404964208603, | |
| "learning_rate": 2e-05, | |
| "loss": 0.007330790627747774, | |
| "step": 174 | |
| }, | |
| { | |
| "epoch": 1.4, | |
| "grad_norm": 0.050741445273160934, | |
| "learning_rate": 2e-05, | |
| "loss": 0.005321471951901913, | |
| "step": 175 | |
| }, | |
| { | |
| "epoch": 1.408, | |
| "grad_norm": 0.06053789332509041, | |
| "learning_rate": 2e-05, | |
| "loss": 0.007614850997924805, | |
| "step": 176 | |
| }, | |
| { | |
| "epoch": 1.416, | |
| "grad_norm": 0.045350395143032074, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003982958849519491, | |
| "step": 177 | |
| }, | |
| { | |
| "epoch": 1.424, | |
| "grad_norm": 0.04105447977781296, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0032091487664729357, | |
| "step": 178 | |
| }, | |
| { | |
| "epoch": 1.432, | |
| "grad_norm": 0.03485438972711563, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0034181310329586267, | |
| "step": 179 | |
| }, | |
| { | |
| "epoch": 1.44, | |
| "grad_norm": 0.0427364781498909, | |
| "learning_rate": 2e-05, | |
| "loss": 0.005363878328353167, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 1.448, | |
| "grad_norm": 0.031005240976810455, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003898187540471554, | |
| "step": 181 | |
| }, | |
| { | |
| "epoch": 1.456, | |
| "grad_norm": 0.030742423608899117, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0026354389265179634, | |
| "step": 182 | |
| }, | |
| { | |
| "epoch": 1.464, | |
| "grad_norm": 0.04213688522577286, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003235624171793461, | |
| "step": 183 | |
| }, | |
| { | |
| "epoch": 1.472, | |
| "grad_norm": 0.06017177179455757, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004921246785670519, | |
| "step": 184 | |
| }, | |
| { | |
| "epoch": 1.48, | |
| "grad_norm": 0.05274427682161331, | |
| "learning_rate": 2e-05, | |
| "loss": 0.006431959569454193, | |
| "step": 185 | |
| }, | |
| { | |
| "epoch": 1.488, | |
| "grad_norm": 0.03465743735432625, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0017982947174459696, | |
| "step": 186 | |
| }, | |
| { | |
| "epoch": 1.496, | |
| "grad_norm": 0.031407665461301804, | |
| "learning_rate": 2e-05, | |
| "loss": 0.002308888593688607, | |
| "step": 187 | |
| }, | |
| { | |
| "epoch": 1.504, | |
| "grad_norm": 0.04751557856798172, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0022526727989315987, | |
| "step": 188 | |
| }, | |
| { | |
| "epoch": 1.512, | |
| "grad_norm": 0.03473098948597908, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0023300114553421736, | |
| "step": 189 | |
| }, | |
| { | |
| "epoch": 1.52, | |
| "grad_norm": 0.02745967172086239, | |
| "learning_rate": 2e-05, | |
| "loss": 0.002407602034509182, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 1.528, | |
| "grad_norm": 0.05958602949976921, | |
| "learning_rate": 2e-05, | |
| "loss": 0.007107679732143879, | |
| "step": 191 | |
| }, | |
| { | |
| "epoch": 1.536, | |
| "grad_norm": 0.05794493481516838, | |
| "learning_rate": 2e-05, | |
| "loss": 0.006767779588699341, | |
| "step": 192 | |
| }, | |
| { | |
| "epoch": 1.544, | |
| "grad_norm": 0.037513379007577896, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003455360187217593, | |
| "step": 193 | |
| }, | |
| { | |
| "epoch": 1.552, | |
| "grad_norm": 0.03977490961551666, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004349147900938988, | |
| "step": 194 | |
| }, | |
| { | |
| "epoch": 1.56, | |
| "grad_norm": 0.03297000005841255, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004090302158147097, | |
| "step": 195 | |
| }, | |
| { | |
| "epoch": 1.568, | |
| "grad_norm": 0.03089851886034012, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0032683194149285555, | |
| "step": 196 | |
| }, | |
| { | |
| "epoch": 1.576, | |
| "grad_norm": 0.03224420174956322, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0024244794622063637, | |
| "step": 197 | |
| }, | |
| { | |
| "epoch": 1.584, | |
| "grad_norm": 0.030442802235484123, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0014301001792773604, | |
| "step": 198 | |
| }, | |
| { | |
| "epoch": 1.592, | |
| "grad_norm": 0.05126398056745529, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0027298659551888704, | |
| "step": 199 | |
| }, | |
| { | |
| "epoch": 1.6, | |
| "grad_norm": 0.05423342436552048, | |
| "learning_rate": 2e-05, | |
| "loss": 0.006995318457484245, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 1.608, | |
| "grad_norm": 0.02536446414887905, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0029984633438289165, | |
| "step": 201 | |
| }, | |
| { | |
| "epoch": 1.616, | |
| "grad_norm": 0.03072509542107582, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0033400985412299633, | |
| "step": 202 | |
| }, | |
| { | |
| "epoch": 1.624, | |
| "grad_norm": 0.055368877947330475, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004085185006260872, | |
| "step": 203 | |
| }, | |
| { | |
| "epoch": 1.6320000000000001, | |
| "grad_norm": 0.03939943388104439, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003322000615298748, | |
| "step": 204 | |
| }, | |
| { | |
| "epoch": 1.6400000000000001, | |
| "grad_norm": 0.044486552476882935, | |
| "learning_rate": 2e-05, | |
| "loss": 0.002586575224995613, | |
| "step": 205 | |
| }, | |
| { | |
| "epoch": 1.6480000000000001, | |
| "grad_norm": 0.05059683322906494, | |
| "learning_rate": 2e-05, | |
| "loss": 0.010476172901690006, | |
| "step": 206 | |
| }, | |
| { | |
| "epoch": 1.6560000000000001, | |
| "grad_norm": 0.04618003964424133, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004687571432441473, | |
| "step": 207 | |
| }, | |
| { | |
| "epoch": 1.6640000000000001, | |
| "grad_norm": 0.03308900445699692, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004028619267046452, | |
| "step": 208 | |
| }, | |
| { | |
| "epoch": 1.6720000000000002, | |
| "grad_norm": 0.038209252059459686, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0027929157949984074, | |
| "step": 209 | |
| }, | |
| { | |
| "epoch": 1.6800000000000002, | |
| "grad_norm": 0.034491200000047684, | |
| "learning_rate": 2e-05, | |
| "loss": 0.001778338453732431, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 1.688, | |
| "grad_norm": 0.07821262627840042, | |
| "learning_rate": 2e-05, | |
| "loss": 0.005375068634748459, | |
| "step": 211 | |
| }, | |
| { | |
| "epoch": 1.696, | |
| "grad_norm": 0.04657049477100372, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003136474872007966, | |
| "step": 212 | |
| }, | |
| { | |
| "epoch": 1.704, | |
| "grad_norm": 0.05357731506228447, | |
| "learning_rate": 2e-05, | |
| "loss": 0.006239030975848436, | |
| "step": 213 | |
| }, | |
| { | |
| "epoch": 1.712, | |
| "grad_norm": 0.04918161407113075, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004385227337479591, | |
| "step": 214 | |
| }, | |
| { | |
| "epoch": 1.72, | |
| "grad_norm": 0.04051123186945915, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0024626629892736673, | |
| "step": 215 | |
| }, | |
| { | |
| "epoch": 1.728, | |
| "grad_norm": 0.034734904766082764, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0024731624871492386, | |
| "step": 216 | |
| }, | |
| { | |
| "epoch": 1.736, | |
| "grad_norm": 0.06079041212797165, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004821632523089647, | |
| "step": 217 | |
| }, | |
| { | |
| "epoch": 1.744, | |
| "grad_norm": 0.04052048176527023, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003583197481930256, | |
| "step": 218 | |
| }, | |
| { | |
| "epoch": 1.752, | |
| "grad_norm": 0.03803209960460663, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0032860925421118736, | |
| "step": 219 | |
| }, | |
| { | |
| "epoch": 1.76, | |
| "grad_norm": 0.03718697279691696, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0028506568633019924, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 1.768, | |
| "grad_norm": 0.020328527316451073, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0030127556528896093, | |
| "step": 221 | |
| }, | |
| { | |
| "epoch": 1.776, | |
| "grad_norm": 0.03647777810692787, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0029757029842585325, | |
| "step": 222 | |
| }, | |
| { | |
| "epoch": 1.784, | |
| "grad_norm": 0.03103819489479065, | |
| "learning_rate": 2e-05, | |
| "loss": 0.002474813023582101, | |
| "step": 223 | |
| }, | |
| { | |
| "epoch": 1.792, | |
| "grad_norm": 0.031560298055410385, | |
| "learning_rate": 2e-05, | |
| "loss": 0.002314931945875287, | |
| "step": 224 | |
| }, | |
| { | |
| "epoch": 1.8, | |
| "grad_norm": 0.03549206256866455, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0032754004932940006, | |
| "step": 225 | |
| }, | |
| { | |
| "epoch": 1.808, | |
| "grad_norm": 0.03429936245083809, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003921601455658674, | |
| "step": 226 | |
| }, | |
| { | |
| "epoch": 1.8159999999999998, | |
| "grad_norm": 0.06855639815330505, | |
| "learning_rate": 2e-05, | |
| "loss": 0.006101913750171661, | |
| "step": 227 | |
| }, | |
| { | |
| "epoch": 1.8239999999999998, | |
| "grad_norm": 0.08064403384923935, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004588215611875057, | |
| "step": 228 | |
| }, | |
| { | |
| "epoch": 1.8319999999999999, | |
| "grad_norm": 0.03363880142569542, | |
| "learning_rate": 2e-05, | |
| "loss": 0.001759383245371282, | |
| "step": 229 | |
| }, | |
| { | |
| "epoch": 1.8399999999999999, | |
| "grad_norm": 0.04351300746202469, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0032918578945100307, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 1.8479999999999999, | |
| "grad_norm": 0.024159353226423264, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0019000337924808264, | |
| "step": 231 | |
| }, | |
| { | |
| "epoch": 1.8559999999999999, | |
| "grad_norm": 0.04056349769234657, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003138928906992078, | |
| "step": 232 | |
| }, | |
| { | |
| "epoch": 1.8639999999999999, | |
| "grad_norm": 0.026023566722869873, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0033341734670102596, | |
| "step": 233 | |
| }, | |
| { | |
| "epoch": 1.8719999999999999, | |
| "grad_norm": 0.06581102311611176, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0065653664059937, | |
| "step": 234 | |
| }, | |
| { | |
| "epoch": 1.88, | |
| "grad_norm": 0.04903842508792877, | |
| "learning_rate": 2e-05, | |
| "loss": 0.005071278661489487, | |
| "step": 235 | |
| }, | |
| { | |
| "epoch": 1.888, | |
| "grad_norm": 0.09484432637691498, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0026917962823063135, | |
| "step": 236 | |
| }, | |
| { | |
| "epoch": 1.896, | |
| "grad_norm": 0.029802817851305008, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0020737922750413418, | |
| "step": 237 | |
| }, | |
| { | |
| "epoch": 1.904, | |
| "grad_norm": 0.030020302161574364, | |
| "learning_rate": 2e-05, | |
| "loss": 0.001601328724063933, | |
| "step": 238 | |
| }, | |
| { | |
| "epoch": 1.912, | |
| "grad_norm": 0.023855257779359818, | |
| "learning_rate": 2e-05, | |
| "loss": 0.002171756699681282, | |
| "step": 239 | |
| }, | |
| { | |
| "epoch": 1.92, | |
| "grad_norm": 0.04743681848049164, | |
| "learning_rate": 2e-05, | |
| "loss": 0.005675522144883871, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 1.928, | |
| "grad_norm": 0.05006203055381775, | |
| "learning_rate": 2e-05, | |
| "loss": 0.005861939862370491, | |
| "step": 241 | |
| }, | |
| { | |
| "epoch": 1.936, | |
| "grad_norm": 0.04128265008330345, | |
| "learning_rate": 2e-05, | |
| "loss": 0.005003426223993301, | |
| "step": 242 | |
| }, | |
| { | |
| "epoch": 1.944, | |
| "grad_norm": 0.06207670643925667, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004483950790017843, | |
| "step": 243 | |
| }, | |
| { | |
| "epoch": 1.952, | |
| "grad_norm": 0.07824505865573883, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004859112203121185, | |
| "step": 244 | |
| }, | |
| { | |
| "epoch": 1.96, | |
| "grad_norm": 0.04579395800828934, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004692354239523411, | |
| "step": 245 | |
| }, | |
| { | |
| "epoch": 1.968, | |
| "grad_norm": 0.04180062189698219, | |
| "learning_rate": 2e-05, | |
| "loss": 0.00455811619758606, | |
| "step": 246 | |
| }, | |
| { | |
| "epoch": 1.976, | |
| "grad_norm": 0.03964953497052193, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0028610117733478546, | |
| "step": 247 | |
| }, | |
| { | |
| "epoch": 1.984, | |
| "grad_norm": 0.03513772413134575, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0025510897394269705, | |
| "step": 248 | |
| }, | |
| { | |
| "epoch": 1.992, | |
| "grad_norm": 0.030972128733992577, | |
| "learning_rate": 2e-05, | |
| "loss": 0.00266153528355062, | |
| "step": 249 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "grad_norm": 0.06495940685272217, | |
| "learning_rate": 2e-05, | |
| "loss": 0.005316338501870632, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 2.008, | |
| "grad_norm": 0.03911746293306351, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003454022342339158, | |
| "step": 251 | |
| }, | |
| { | |
| "epoch": 2.016, | |
| "grad_norm": 0.03907843679189682, | |
| "learning_rate": 2e-05, | |
| "loss": 0.002617109566926956, | |
| "step": 252 | |
| }, | |
| { | |
| "epoch": 2.024, | |
| "grad_norm": 0.0325784757733345, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003027692437171936, | |
| "step": 253 | |
| }, | |
| { | |
| "epoch": 2.032, | |
| "grad_norm": 0.04280916228890419, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003725123591721058, | |
| "step": 254 | |
| }, | |
| { | |
| "epoch": 2.04, | |
| "grad_norm": 0.03285227715969086, | |
| "learning_rate": 2e-05, | |
| "loss": 0.002418406307697296, | |
| "step": 255 | |
| }, | |
| { | |
| "epoch": 2.048, | |
| "grad_norm": 0.04505843669176102, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0030923697631806135, | |
| "step": 256 | |
| }, | |
| { | |
| "epoch": 2.056, | |
| "grad_norm": 0.02693861722946167, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0029823114164173603, | |
| "step": 257 | |
| }, | |
| { | |
| "epoch": 2.064, | |
| "grad_norm": 0.03501451015472412, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0022289499174803495, | |
| "step": 258 | |
| }, | |
| { | |
| "epoch": 2.072, | |
| "grad_norm": 0.04407954588532448, | |
| "learning_rate": 2e-05, | |
| "loss": 0.005173118785023689, | |
| "step": 259 | |
| }, | |
| { | |
| "epoch": 2.08, | |
| "grad_norm": 0.03353921324014664, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003529382636770606, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 2.088, | |
| "grad_norm": 0.03029395453631878, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0025696109514683485, | |
| "step": 261 | |
| }, | |
| { | |
| "epoch": 2.096, | |
| "grad_norm": 0.043411292135715485, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0032275894191116095, | |
| "step": 262 | |
| }, | |
| { | |
| "epoch": 2.104, | |
| "grad_norm": 0.025156555697321892, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0019941977225244045, | |
| "step": 263 | |
| }, | |
| { | |
| "epoch": 2.112, | |
| "grad_norm": 0.05474105849862099, | |
| "learning_rate": 2e-05, | |
| "loss": 0.006130381021648645, | |
| "step": 264 | |
| }, | |
| { | |
| "epoch": 2.12, | |
| "grad_norm": 0.026152821257710457, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0037242607213556767, | |
| "step": 265 | |
| }, | |
| { | |
| "epoch": 2.128, | |
| "grad_norm": 0.04658479988574982, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0027500735595822334, | |
| "step": 266 | |
| }, | |
| { | |
| "epoch": 2.136, | |
| "grad_norm": 0.04310692846775055, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0021111357491463423, | |
| "step": 267 | |
| }, | |
| { | |
| "epoch": 2.144, | |
| "grad_norm": 0.03860605135560036, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004491395782679319, | |
| "step": 268 | |
| }, | |
| { | |
| "epoch": 2.152, | |
| "grad_norm": 0.019513150677084923, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0019580726511776447, | |
| "step": 269 | |
| }, | |
| { | |
| "epoch": 2.16, | |
| "grad_norm": 0.03170303627848625, | |
| "learning_rate": 2e-05, | |
| "loss": 0.001965203322470188, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 2.168, | |
| "grad_norm": 0.02094845101237297, | |
| "learning_rate": 2e-05, | |
| "loss": 0.001287441118620336, | |
| "step": 271 | |
| }, | |
| { | |
| "epoch": 2.176, | |
| "grad_norm": 0.03304935246706009, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0032492834143340588, | |
| "step": 272 | |
| }, | |
| { | |
| "epoch": 2.184, | |
| "grad_norm": 0.03120725229382515, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0029026831034570932, | |
| "step": 273 | |
| }, | |
| { | |
| "epoch": 2.192, | |
| "grad_norm": 0.03816477581858635, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0024198577739298344, | |
| "step": 274 | |
| }, | |
| { | |
| "epoch": 2.2, | |
| "grad_norm": 0.039687663316726685, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0031529159750789404, | |
| "step": 275 | |
| }, | |
| { | |
| "epoch": 2.208, | |
| "grad_norm": 0.026106711477041245, | |
| "learning_rate": 2e-05, | |
| "loss": 0.002224068157374859, | |
| "step": 276 | |
| }, | |
| { | |
| "epoch": 2.216, | |
| "grad_norm": 0.027437372133135796, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0014647672651335597, | |
| "step": 277 | |
| }, | |
| { | |
| "epoch": 2.224, | |
| "grad_norm": 0.05910545587539673, | |
| "learning_rate": 2e-05, | |
| "loss": 0.00243214494548738, | |
| "step": 278 | |
| }, | |
| { | |
| "epoch": 2.232, | |
| "grad_norm": 0.02404620312154293, | |
| "learning_rate": 2e-05, | |
| "loss": 0.00222192844375968, | |
| "step": 279 | |
| }, | |
| { | |
| "epoch": 2.24, | |
| "grad_norm": 0.03369680047035217, | |
| "learning_rate": 2e-05, | |
| "loss": 0.001881018397398293, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 2.248, | |
| "grad_norm": 0.039129581302404404, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0031921733170747757, | |
| "step": 281 | |
| }, | |
| { | |
| "epoch": 2.2560000000000002, | |
| "grad_norm": 0.026752755045890808, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0027538840658962727, | |
| "step": 282 | |
| }, | |
| { | |
| "epoch": 2.2640000000000002, | |
| "grad_norm": 0.07003916054964066, | |
| "learning_rate": 2e-05, | |
| "loss": 0.005947021301835775, | |
| "step": 283 | |
| }, | |
| { | |
| "epoch": 2.2720000000000002, | |
| "grad_norm": 0.031368181109428406, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0035742626059800386, | |
| "step": 284 | |
| }, | |
| { | |
| "epoch": 2.2800000000000002, | |
| "grad_norm": 0.027074171230196953, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0021643084473907948, | |
| "step": 285 | |
| }, | |
| { | |
| "epoch": 2.288, | |
| "grad_norm": 0.023025641217827797, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0017899582162499428, | |
| "step": 286 | |
| }, | |
| { | |
| "epoch": 2.296, | |
| "grad_norm": 0.03725794330239296, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0034590037539601326, | |
| "step": 287 | |
| }, | |
| { | |
| "epoch": 2.304, | |
| "grad_norm": 0.04669518023729324, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003809502115473151, | |
| "step": 288 | |
| }, | |
| { | |
| "epoch": 2.312, | |
| "grad_norm": 0.031050648540258408, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003041312098503113, | |
| "step": 289 | |
| }, | |
| { | |
| "epoch": 2.32, | |
| "grad_norm": 0.03626548871397972, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0024002999998629093, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 2.328, | |
| "grad_norm": 0.06315096467733383, | |
| "learning_rate": 2e-05, | |
| "loss": 0.006624164525419474, | |
| "step": 291 | |
| }, | |
| { | |
| "epoch": 2.336, | |
| "grad_norm": 0.04203896224498749, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0019566724076867104, | |
| "step": 292 | |
| }, | |
| { | |
| "epoch": 2.344, | |
| "grad_norm": 0.04634423181414604, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0032502529211342335, | |
| "step": 293 | |
| }, | |
| { | |
| "epoch": 2.352, | |
| "grad_norm": 0.04237474128603935, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0031427519861608744, | |
| "step": 294 | |
| }, | |
| { | |
| "epoch": 2.36, | |
| "grad_norm": 0.04034377261996269, | |
| "learning_rate": 2e-05, | |
| "loss": 0.00422636279836297, | |
| "step": 295 | |
| }, | |
| { | |
| "epoch": 2.368, | |
| "grad_norm": 0.044460564851760864, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0028524911031126976, | |
| "step": 296 | |
| }, | |
| { | |
| "epoch": 2.376, | |
| "grad_norm": 0.0697890892624855, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0036988966166973114, | |
| "step": 297 | |
| }, | |
| { | |
| "epoch": 2.384, | |
| "grad_norm": 0.04324623942375183, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0037890365347266197, | |
| "step": 298 | |
| }, | |
| { | |
| "epoch": 2.392, | |
| "grad_norm": 0.02138633094727993, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0021952460519969463, | |
| "step": 299 | |
| }, | |
| { | |
| "epoch": 2.4, | |
| "grad_norm": 0.03607005998492241, | |
| "learning_rate": 2e-05, | |
| "loss": 0.002349622081965208, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 2.408, | |
| "grad_norm": 0.039072196930646896, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0035770011600106955, | |
| "step": 301 | |
| }, | |
| { | |
| "epoch": 2.416, | |
| "grad_norm": 0.02861890196800232, | |
| "learning_rate": 2e-05, | |
| "loss": 0.002283460693433881, | |
| "step": 302 | |
| }, | |
| { | |
| "epoch": 2.424, | |
| "grad_norm": 0.035563308745622635, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0026536290533840656, | |
| "step": 303 | |
| }, | |
| { | |
| "epoch": 2.432, | |
| "grad_norm": 0.03916006535291672, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003950632177293301, | |
| "step": 304 | |
| }, | |
| { | |
| "epoch": 2.44, | |
| "grad_norm": 0.039335884153842926, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003372431267052889, | |
| "step": 305 | |
| }, | |
| { | |
| "epoch": 2.448, | |
| "grad_norm": 0.045527540147304535, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0030923227313905954, | |
| "step": 306 | |
| }, | |
| { | |
| "epoch": 2.456, | |
| "grad_norm": 0.04456671327352524, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004458888433873653, | |
| "step": 307 | |
| }, | |
| { | |
| "epoch": 2.464, | |
| "grad_norm": 0.03560574725270271, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003171511460095644, | |
| "step": 308 | |
| }, | |
| { | |
| "epoch": 2.472, | |
| "grad_norm": 0.036603160202503204, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0028585128020495176, | |
| "step": 309 | |
| }, | |
| { | |
| "epoch": 2.48, | |
| "grad_norm": 0.03335639089345932, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0023816449102014303, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 2.488, | |
| "grad_norm": 0.030154302716255188, | |
| "learning_rate": 2e-05, | |
| "loss": 0.00486906711012125, | |
| "step": 311 | |
| }, | |
| { | |
| "epoch": 2.496, | |
| "grad_norm": 0.040795303881168365, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003139256499707699, | |
| "step": 312 | |
| }, | |
| { | |
| "epoch": 2.504, | |
| "grad_norm": 0.04953761771321297, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0039007822051644325, | |
| "step": 313 | |
| }, | |
| { | |
| "epoch": 2.512, | |
| "grad_norm": 0.12026029080152512, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0038295963313430548, | |
| "step": 314 | |
| }, | |
| { | |
| "epoch": 2.52, | |
| "grad_norm": 0.057940348982810974, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0033367923460900784, | |
| "step": 315 | |
| }, | |
| { | |
| "epoch": 2.528, | |
| "grad_norm": 0.028937026858329773, | |
| "learning_rate": 2e-05, | |
| "loss": 0.001545312232337892, | |
| "step": 316 | |
| }, | |
| { | |
| "epoch": 2.536, | |
| "grad_norm": 0.03167141228914261, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0028309039771556854, | |
| "step": 317 | |
| }, | |
| { | |
| "epoch": 2.544, | |
| "grad_norm": 0.04004928842186928, | |
| "learning_rate": 2e-05, | |
| "loss": 0.002698655240237713, | |
| "step": 318 | |
| }, | |
| { | |
| "epoch": 2.552, | |
| "grad_norm": 0.02045566588640213, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0012601229827851057, | |
| "step": 319 | |
| }, | |
| { | |
| "epoch": 2.56, | |
| "grad_norm": 0.03342553600668907, | |
| "learning_rate": 2e-05, | |
| "loss": 0.001859499723650515, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 2.568, | |
| "grad_norm": 0.025396211072802544, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0020996080711483955, | |
| "step": 321 | |
| }, | |
| { | |
| "epoch": 2.576, | |
| "grad_norm": 0.03771315887570381, | |
| "learning_rate": 2e-05, | |
| "loss": 0.005717152263969183, | |
| "step": 322 | |
| }, | |
| { | |
| "epoch": 2.584, | |
| "grad_norm": 0.02477932535111904, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0024716444313526154, | |
| "step": 323 | |
| }, | |
| { | |
| "epoch": 2.592, | |
| "grad_norm": 0.031247377395629883, | |
| "learning_rate": 2e-05, | |
| "loss": 0.00390324997715652, | |
| "step": 324 | |
| }, | |
| { | |
| "epoch": 2.6, | |
| "grad_norm": 0.04134252667427063, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003920188173651695, | |
| "step": 325 | |
| }, | |
| { | |
| "epoch": 2.608, | |
| "grad_norm": 0.02774622291326523, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0022154548205435276, | |
| "step": 326 | |
| }, | |
| { | |
| "epoch": 2.616, | |
| "grad_norm": 0.03957367688417435, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0023058855440467596, | |
| "step": 327 | |
| }, | |
| { | |
| "epoch": 2.624, | |
| "grad_norm": 0.04483708739280701, | |
| "learning_rate": 2e-05, | |
| "loss": 0.002552008954808116, | |
| "step": 328 | |
| }, | |
| { | |
| "epoch": 2.632, | |
| "grad_norm": 0.02093776874244213, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0027019393164664507, | |
| "step": 329 | |
| }, | |
| { | |
| "epoch": 2.64, | |
| "grad_norm": 0.06742503494024277, | |
| "learning_rate": 2e-05, | |
| "loss": 0.008755444549024105, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 2.648, | |
| "grad_norm": 0.038483329117298126, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0028858440928161144, | |
| "step": 331 | |
| }, | |
| { | |
| "epoch": 2.656, | |
| "grad_norm": 0.0329829640686512, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0024300175718963146, | |
| "step": 332 | |
| }, | |
| { | |
| "epoch": 2.664, | |
| "grad_norm": 0.051471542567014694, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003998158499598503, | |
| "step": 333 | |
| }, | |
| { | |
| "epoch": 2.672, | |
| "grad_norm": 0.04422187805175781, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004651157651096582, | |
| "step": 334 | |
| }, | |
| { | |
| "epoch": 2.68, | |
| "grad_norm": 0.02528465911746025, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0021933559328317642, | |
| "step": 335 | |
| }, | |
| { | |
| "epoch": 2.6879999999999997, | |
| "grad_norm": 0.030596323311328888, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003947809804230928, | |
| "step": 336 | |
| }, | |
| { | |
| "epoch": 2.6959999999999997, | |
| "grad_norm": 0.04210244491696358, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003154753241688013, | |
| "step": 337 | |
| }, | |
| { | |
| "epoch": 2.7039999999999997, | |
| "grad_norm": 0.06121843308210373, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0029088810551911592, | |
| "step": 338 | |
| }, | |
| { | |
| "epoch": 2.7119999999999997, | |
| "grad_norm": 0.03322814777493477, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0026830481365323067, | |
| "step": 339 | |
| }, | |
| { | |
| "epoch": 2.7199999999999998, | |
| "grad_norm": 0.03890882432460785, | |
| "learning_rate": 2e-05, | |
| "loss": 0.002993557136505842, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 2.7279999999999998, | |
| "grad_norm": 0.03936028108000755, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0023103575222194195, | |
| "step": 341 | |
| }, | |
| { | |
| "epoch": 2.7359999999999998, | |
| "grad_norm": 0.03645415976643562, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0036545468028634787, | |
| "step": 342 | |
| }, | |
| { | |
| "epoch": 2.7439999999999998, | |
| "grad_norm": 0.04062900319695473, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0036479239352047443, | |
| "step": 343 | |
| }, | |
| { | |
| "epoch": 2.752, | |
| "grad_norm": 0.049033768475055695, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0034971858840435743, | |
| "step": 344 | |
| }, | |
| { | |
| "epoch": 2.76, | |
| "grad_norm": 0.03926759585738182, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0031690222676843405, | |
| "step": 345 | |
| }, | |
| { | |
| "epoch": 2.768, | |
| "grad_norm": 0.06413634121417999, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004980374127626419, | |
| "step": 346 | |
| }, | |
| { | |
| "epoch": 2.776, | |
| "grad_norm": 0.04801516979932785, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0037698009982705116, | |
| "step": 347 | |
| }, | |
| { | |
| "epoch": 2.784, | |
| "grad_norm": 0.03702208027243614, | |
| "learning_rate": 2e-05, | |
| "loss": 0.001877334201708436, | |
| "step": 348 | |
| }, | |
| { | |
| "epoch": 2.792, | |
| "grad_norm": 0.03120242804288864, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0022658274974673986, | |
| "step": 349 | |
| }, | |
| { | |
| "epoch": 2.8, | |
| "grad_norm": 0.048766590654850006, | |
| "learning_rate": 2e-05, | |
| "loss": 0.00202578236348927, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 2.808, | |
| "grad_norm": 0.029100535437464714, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004179732408374548, | |
| "step": 351 | |
| }, | |
| { | |
| "epoch": 2.816, | |
| "grad_norm": 0.04512881860136986, | |
| "learning_rate": 2e-05, | |
| "loss": 0.002607448725029826, | |
| "step": 352 | |
| }, | |
| { | |
| "epoch": 2.824, | |
| "grad_norm": 0.07799641042947769, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004347057081758976, | |
| "step": 353 | |
| }, | |
| { | |
| "epoch": 2.832, | |
| "grad_norm": 0.04792260378599167, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003629413666203618, | |
| "step": 354 | |
| }, | |
| { | |
| "epoch": 2.84, | |
| "grad_norm": 0.11515104025602341, | |
| "learning_rate": 2e-05, | |
| "loss": 0.006446151994168758, | |
| "step": 355 | |
| }, | |
| { | |
| "epoch": 2.848, | |
| "grad_norm": 0.023408330976963043, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0017018368234857917, | |
| "step": 356 | |
| }, | |
| { | |
| "epoch": 2.856, | |
| "grad_norm": 0.03008626215159893, | |
| "learning_rate": 2e-05, | |
| "loss": 0.002287666779011488, | |
| "step": 357 | |
| }, | |
| { | |
| "epoch": 2.864, | |
| "grad_norm": 0.03706612437963486, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0028982325457036495, | |
| "step": 358 | |
| }, | |
| { | |
| "epoch": 2.872, | |
| "grad_norm": 0.020318036898970604, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0018703520763665438, | |
| "step": 359 | |
| }, | |
| { | |
| "epoch": 2.88, | |
| "grad_norm": 0.06123220548033714, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0029717511497437954, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 2.888, | |
| "grad_norm": 0.055422086268663406, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004031006712466478, | |
| "step": 361 | |
| }, | |
| { | |
| "epoch": 2.896, | |
| "grad_norm": 0.036786146461963654, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003937885165214539, | |
| "step": 362 | |
| }, | |
| { | |
| "epoch": 2.904, | |
| "grad_norm": 0.038341671228408813, | |
| "learning_rate": 2e-05, | |
| "loss": 0.002436596667394042, | |
| "step": 363 | |
| }, | |
| { | |
| "epoch": 2.912, | |
| "grad_norm": 0.03609547019004822, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004547444172203541, | |
| "step": 364 | |
| }, | |
| { | |
| "epoch": 2.92, | |
| "grad_norm": 0.06485926359891891, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003946429584175348, | |
| "step": 365 | |
| }, | |
| { | |
| "epoch": 2.928, | |
| "grad_norm": 0.04949840530753136, | |
| "learning_rate": 2e-05, | |
| "loss": 0.00502239353954792, | |
| "step": 366 | |
| }, | |
| { | |
| "epoch": 2.936, | |
| "grad_norm": 0.0354098416864872, | |
| "learning_rate": 2e-05, | |
| "loss": 0.002601196290925145, | |
| "step": 367 | |
| }, | |
| { | |
| "epoch": 2.944, | |
| "grad_norm": 0.025988208130002022, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0036114591639488935, | |
| "step": 368 | |
| }, | |
| { | |
| "epoch": 2.952, | |
| "grad_norm": 0.034603431820869446, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0026605837047100067, | |
| "step": 369 | |
| }, | |
| { | |
| "epoch": 2.96, | |
| "grad_norm": 0.045072562992572784, | |
| "learning_rate": 2e-05, | |
| "loss": 0.002992109628394246, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 2.968, | |
| "grad_norm": 0.07029342651367188, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004379983991384506, | |
| "step": 371 | |
| }, | |
| { | |
| "epoch": 2.976, | |
| "grad_norm": 0.013431387022137642, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0030165393836796284, | |
| "step": 372 | |
| }, | |
| { | |
| "epoch": 2.984, | |
| "grad_norm": 0.046111706644296646, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0029378868639469147, | |
| "step": 373 | |
| }, | |
| { | |
| "epoch": 2.992, | |
| "grad_norm": 0.05583514645695686, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0040816557593643665, | |
| "step": 374 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "grad_norm": 0.03255736827850342, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0035074178595095873, | |
| "step": 375 | |
| }, | |
| { | |
| "epoch": 3.008, | |
| "grad_norm": 0.03124692291021347, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0031269516330212355, | |
| "step": 376 | |
| }, | |
| { | |
| "epoch": 3.016, | |
| "grad_norm": 0.05301191285252571, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004872915334999561, | |
| "step": 377 | |
| }, | |
| { | |
| "epoch": 3.024, | |
| "grad_norm": 0.037463486194610596, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0030003672000020742, | |
| "step": 378 | |
| }, | |
| { | |
| "epoch": 3.032, | |
| "grad_norm": 0.03362922742962837, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0018557708244770765, | |
| "step": 379 | |
| }, | |
| { | |
| "epoch": 3.04, | |
| "grad_norm": 0.042213547974824905, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0038657563272863626, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 3.048, | |
| "grad_norm": 0.020529089495539665, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0015072536189109087, | |
| "step": 381 | |
| }, | |
| { | |
| "epoch": 3.056, | |
| "grad_norm": 0.07512009888887405, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004759274888783693, | |
| "step": 382 | |
| }, | |
| { | |
| "epoch": 3.064, | |
| "grad_norm": 0.03783705085515976, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0032726821955293417, | |
| "step": 383 | |
| }, | |
| { | |
| "epoch": 3.072, | |
| "grad_norm": 0.04495864734053612, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003068119753152132, | |
| "step": 384 | |
| }, | |
| { | |
| "epoch": 3.08, | |
| "grad_norm": 0.03879435732960701, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0027257727924734354, | |
| "step": 385 | |
| }, | |
| { | |
| "epoch": 3.088, | |
| "grad_norm": 0.049851685762405396, | |
| "learning_rate": 2e-05, | |
| "loss": 0.004501521587371826, | |
| "step": 386 | |
| }, | |
| { | |
| "epoch": 3.096, | |
| "grad_norm": 0.037314675748348236, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0031016827560961246, | |
| "step": 387 | |
| }, | |
| { | |
| "epoch": 3.104, | |
| "grad_norm": 0.032761648297309875, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0029233950190246105, | |
| "step": 388 | |
| }, | |
| { | |
| "epoch": 3.112, | |
| "grad_norm": 0.0324791744351387, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0026512390468269587, | |
| "step": 389 | |
| }, | |
| { | |
| "epoch": 3.12, | |
| "grad_norm": 0.03452916815876961, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003484592540189624, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 3.128, | |
| "grad_norm": 0.04120925813913345, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0027602710761129856, | |
| "step": 391 | |
| }, | |
| { | |
| "epoch": 3.136, | |
| "grad_norm": 0.03730145841836929, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003531615249812603, | |
| "step": 392 | |
| }, | |
| { | |
| "epoch": 3.144, | |
| "grad_norm": 0.03210754320025444, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0023888859432190657, | |
| "step": 393 | |
| }, | |
| { | |
| "epoch": 3.152, | |
| "grad_norm": 0.036783989518880844, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0027839350514113903, | |
| "step": 394 | |
| }, | |
| { | |
| "epoch": 3.16, | |
| "grad_norm": 0.03480631858110428, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0027098648715764284, | |
| "step": 395 | |
| }, | |
| { | |
| "epoch": 3.168, | |
| "grad_norm": 0.03560803085565567, | |
| "learning_rate": 2e-05, | |
| "loss": 0.003286743303760886, | |
| "step": 396 | |
| }, | |
| { | |
| "epoch": 3.176, | |
| "grad_norm": 0.02866840735077858, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0024349656887352467, | |
| "step": 397 | |
| }, | |
| { | |
| "epoch": 3.184, | |
| "grad_norm": 0.025658991187810898, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0043978262692689896, | |
| "step": 398 | |
| }, | |
| { | |
| "epoch": 3.192, | |
| "grad_norm": 0.030603215098381042, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0023162788711488247, | |
| "step": 399 | |
| }, | |
| { | |
| "epoch": 3.2, | |
| "grad_norm": 0.05031350627541542, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0037095744628459215, | |
| "step": 400 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 400, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 4, | |
| "save_steps": 200, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 0.0, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |