Instructions to use CALDISS-AAU/DA-BERT_Old_News_V3 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use CALDISS-AAU/DA-BERT_Old_News_V3 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("fill-mask", model="CALDISS-AAU/DA-BERT_Old_News_V3")# pip install -U transformers accelerate # Load model directly from transformers import AutoTokenizer, AutoModelForMaskedLM tokenizer = AutoTokenizer.from_pretrained("CALDISS-AAU/DA-BERT_Old_News_V3") model = AutoModelForMaskedLM.from_pretrained("CALDISS-AAU/DA-BERT_Old_News_V3", device_map="auto") - Notebooks
- Google Colab
- Kaggle
Download trainer_state.json from CALDISS-AAU/DA-BERT_Old_News_V3: direct link, hf CLI and curl.
- Browser
- Download file 95.1 kB
-
https://huggingface.co/CALDISS-AAU/DA-BERT_Old_News_V3/resolve/4ee1d0adc4713b6ca089da767a2e5bbf07b3a9aa/trainer_state.json
- Command line
-
hf download hf://CALDISS-AAU/DA-BERT_Old_News_V3@4ee1d0adc4713b6ca089da767a2e5bbf07b3a9aa/trainer_state.json
-
curl -L -o trainer_state.json https://huggingface.co/CALDISS-AAU/DA-BERT_Old_News_V3/resolve/4ee1d0adc4713b6ca089da767a2e5bbf07b3a9aa/trainer_state.json
95.1 kB
| { | |
| "best_global_step": 119500, | |
| "best_metric": 2.1594982147216797, | |
| "best_model_checkpoint": "/work/Ccp-OldNewsBERT_2024/modelling/V3/models/ON-BERT-v3/checkpoint-114000", | |
| "epoch": 10.518034798615068, | |
| "eval_steps": 500, | |
| "global_step": 120000, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.04384138188035687, | |
| "grad_norm": 2.0762226581573486, | |
| "learning_rate": 7.261835184102864e-06, | |
| "loss": 7.284, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.04384138188035687, | |
| "eval_loss": 6.594050407409668, | |
| "eval_runtime": 1189.5449, | |
| "eval_samples_per_second": 767.907, | |
| "eval_steps_per_second": 6.0, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.08768276376071374, | |
| "grad_norm": 2.374856948852539, | |
| "learning_rate": 1.456750438340152e-05, | |
| "loss": 6.3875, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.08768276376071374, | |
| "eval_loss": 6.055078983306885, | |
| "eval_runtime": 1120.4784, | |
| "eval_samples_per_second": 815.241, | |
| "eval_steps_per_second": 6.37, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.1315241456410706, | |
| "grad_norm": 2.779784679412842, | |
| "learning_rate": 2.1873173582700177e-05, | |
| "loss": 5.9379, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 0.1315241456410706, | |
| "eval_loss": 5.654895782470703, | |
| "eval_runtime": 1119.543, | |
| "eval_samples_per_second": 815.922, | |
| "eval_steps_per_second": 6.375, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 0.17536552752142748, | |
| "grad_norm": 2.636847734451294, | |
| "learning_rate": 2.9178842781998832e-05, | |
| "loss": 5.5704, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 0.17536552752142748, | |
| "eval_loss": 5.318906784057617, | |
| "eval_runtime": 1119.4192, | |
| "eval_samples_per_second": 816.012, | |
| "eval_steps_per_second": 6.376, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 0.21920690940178433, | |
| "grad_norm": 2.580691337585449, | |
| "learning_rate": 3.6484511981297484e-05, | |
| "loss": 5.2707, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 0.21920690940178433, | |
| "eval_loss": 5.011192798614502, | |
| "eval_runtime": 1119.4613, | |
| "eval_samples_per_second": 815.982, | |
| "eval_steps_per_second": 6.375, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 0.2630482912821412, | |
| "grad_norm": 2.647657632827759, | |
| "learning_rate": 4.3790181180596146e-05, | |
| "loss": 4.9931, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 0.2630482912821412, | |
| "eval_loss": 4.747901439666748, | |
| "eval_runtime": 1119.0922, | |
| "eval_samples_per_second": 816.251, | |
| "eval_steps_per_second": 6.377, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 0.3068896731624981, | |
| "grad_norm": 2.7811145782470703, | |
| "learning_rate": 4.9999758434773725e-05, | |
| "loss": 4.7425, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 0.3068896731624981, | |
| "eval_loss": 4.489400386810303, | |
| "eval_runtime": 1118.9351, | |
| "eval_samples_per_second": 816.365, | |
| "eval_steps_per_second": 6.378, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 0.35073105504285496, | |
| "grad_norm": 3.108778238296509, | |
| "learning_rate": 4.9985802653912495e-05, | |
| "loss": 4.5162, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 0.35073105504285496, | |
| "eval_loss": 4.267147541046143, | |
| "eval_runtime": 1118.9526, | |
| "eval_samples_per_second": 816.353, | |
| "eval_steps_per_second": 6.378, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 0.3945724369232118, | |
| "grad_norm": 2.7255427837371826, | |
| "learning_rate": 4.99503881039902e-05, | |
| "loss": 4.3143, | |
| "step": 4500 | |
| }, | |
| { | |
| "epoch": 0.3945724369232118, | |
| "eval_loss": 4.085505485534668, | |
| "eval_runtime": 1118.7877, | |
| "eval_samples_per_second": 816.473, | |
| "eval_steps_per_second": 6.379, | |
| "step": 4500 | |
| }, | |
| { | |
| "epoch": 0.43841381880356867, | |
| "grad_norm": 2.7449190616607666, | |
| "learning_rate": 4.9893545200385473e-05, | |
| "loss": 4.1497, | |
| "step": 5000 | |
| }, | |
| { | |
| "epoch": 0.43841381880356867, | |
| "eval_loss": 3.9280543327331543, | |
| "eval_runtime": 1118.8813, | |
| "eval_samples_per_second": 816.405, | |
| "eval_steps_per_second": 6.379, | |
| "step": 5000 | |
| }, | |
| { | |
| "epoch": 0.4822552006839256, | |
| "grad_norm": 2.4749231338500977, | |
| "learning_rate": 4.98153227619719e-05, | |
| "loss": 4.0239, | |
| "step": 5500 | |
| }, | |
| { | |
| "epoch": 0.4822552006839256, | |
| "eval_loss": 3.8047330379486084, | |
| "eval_runtime": 1118.3431, | |
| "eval_samples_per_second": 816.798, | |
| "eval_steps_per_second": 6.382, | |
| "step": 5500 | |
| }, | |
| { | |
| "epoch": 0.5260965825642824, | |
| "grad_norm": 2.549381971359253, | |
| "learning_rate": 4.9715787969190494e-05, | |
| "loss": 3.8983, | |
| "step": 6000 | |
| }, | |
| { | |
| "epoch": 0.5260965825642824, | |
| "eval_loss": 3.7011477947235107, | |
| "eval_runtime": 1118.3893, | |
| "eval_samples_per_second": 816.764, | |
| "eval_steps_per_second": 6.381, | |
| "step": 6000 | |
| }, | |
| { | |
| "epoch": 0.5699379644446393, | |
| "grad_norm": 2.57206392288208, | |
| "learning_rate": 4.9595026306352545e-05, | |
| "loss": 3.7955, | |
| "step": 6500 | |
| }, | |
| { | |
| "epoch": 0.5699379644446393, | |
| "eval_loss": 3.610187292098999, | |
| "eval_runtime": 1121.1876, | |
| "eval_samples_per_second": 814.725, | |
| "eval_steps_per_second": 6.366, | |
| "step": 6500 | |
| }, | |
| { | |
| "epoch": 0.6137793463249962, | |
| "grad_norm": 2.4346706867218018, | |
| "learning_rate": 4.9453141488222386e-05, | |
| "loss": 3.7212, | |
| "step": 7000 | |
| }, | |
| { | |
| "epoch": 0.6137793463249962, | |
| "eval_loss": 3.527937650680542, | |
| "eval_runtime": 1118.9709, | |
| "eval_samples_per_second": 816.339, | |
| "eval_steps_per_second": 6.378, | |
| "step": 7000 | |
| }, | |
| { | |
| "epoch": 0.657620728205353, | |
| "grad_norm": 2.7278873920440674, | |
| "learning_rate": 4.9290255370943214e-05, | |
| "loss": 3.6375, | |
| "step": 7500 | |
| }, | |
| { | |
| "epoch": 0.657620728205353, | |
| "eval_loss": 3.4597597122192383, | |
| "eval_runtime": 1118.6558, | |
| "eval_samples_per_second": 816.569, | |
| "eval_steps_per_second": 6.38, | |
| "step": 7500 | |
| }, | |
| { | |
| "epoch": 0.7014621100857099, | |
| "grad_norm": 2.576530933380127, | |
| "learning_rate": 4.9106507847382264e-05, | |
| "loss": 3.5737, | |
| "step": 8000 | |
| }, | |
| { | |
| "epoch": 0.7014621100857099, | |
| "eval_loss": 3.3990399837493896, | |
| "eval_runtime": 1117.9215, | |
| "eval_samples_per_second": 817.106, | |
| "eval_steps_per_second": 6.384, | |
| "step": 8000 | |
| }, | |
| { | |
| "epoch": 0.7453034919660668, | |
| "grad_norm": 2.8216257095336914, | |
| "learning_rate": 4.890205672698551e-05, | |
| "loss": 3.5174, | |
| "step": 8500 | |
| }, | |
| { | |
| "epoch": 0.7453034919660668, | |
| "eval_loss": 3.3402609825134277, | |
| "eval_runtime": 1118.1279, | |
| "eval_samples_per_second": 816.955, | |
| "eval_steps_per_second": 6.383, | |
| "step": 8500 | |
| }, | |
| { | |
| "epoch": 0.7891448738464236, | |
| "grad_norm": 2.7017734050750732, | |
| "learning_rate": 4.867707760024478e-05, | |
| "loss": 3.4576, | |
| "step": 9000 | |
| }, | |
| { | |
| "epoch": 0.7891448738464236, | |
| "eval_loss": 3.289719343185425, | |
| "eval_runtime": 1118.6616, | |
| "eval_samples_per_second": 816.565, | |
| "eval_steps_per_second": 6.38, | |
| "step": 9000 | |
| }, | |
| { | |
| "epoch": 0.8329862557267805, | |
| "grad_norm": 2.7902138233184814, | |
| "learning_rate": 4.8431763687893906e-05, | |
| "loss": 3.4069, | |
| "step": 9500 | |
| }, | |
| { | |
| "epoch": 0.8329862557267805, | |
| "eval_loss": 3.2430062294006348, | |
| "eval_runtime": 1118.3313, | |
| "eval_samples_per_second": 816.806, | |
| "eval_steps_per_second": 6.382, | |
| "step": 9500 | |
| }, | |
| { | |
| "epoch": 0.8768276376071373, | |
| "grad_norm": 2.3764052391052246, | |
| "learning_rate": 4.816632567496333e-05, | |
| "loss": 3.3561, | |
| "step": 10000 | |
| }, | |
| { | |
| "epoch": 0.8768276376071373, | |
| "eval_loss": 3.2007126808166504, | |
| "eval_runtime": 1118.051, | |
| "eval_samples_per_second": 817.011, | |
| "eval_steps_per_second": 6.383, | |
| "step": 10000 | |
| }, | |
| { | |
| "epoch": 0.9206690194874942, | |
| "grad_norm": 2.8324801921844482, | |
| "learning_rate": 4.788158189440955e-05, | |
| "loss": 3.3162, | |
| "step": 10500 | |
| }, | |
| { | |
| "epoch": 0.9206690194874942, | |
| "eval_loss": 3.1551382541656494, | |
| "eval_runtime": 1118.4175, | |
| "eval_samples_per_second": 816.743, | |
| "eval_steps_per_second": 6.381, | |
| "step": 10500 | |
| }, | |
| { | |
| "epoch": 0.9645104013678512, | |
| "grad_norm": 2.599917411804199, | |
| "learning_rate": 4.757663571936409e-05, | |
| "loss": 3.2779, | |
| "step": 11000 | |
| }, | |
| { | |
| "epoch": 0.9645104013678512, | |
| "eval_loss": 3.1158318519592285, | |
| "eval_runtime": 1117.751, | |
| "eval_samples_per_second": 817.23, | |
| "eval_steps_per_second": 6.385, | |
| "step": 11000 | |
| }, | |
| { | |
| "epoch": 1.0084175453210285, | |
| "grad_norm": 2.661496162414551, | |
| "learning_rate": 4.7252299860553496e-05, | |
| "loss": 3.2427, | |
| "step": 11500 | |
| }, | |
| { | |
| "epoch": 1.0084175453210285, | |
| "eval_loss": 3.0812768936157227, | |
| "eval_runtime": 1118.2372, | |
| "eval_samples_per_second": 816.875, | |
| "eval_steps_per_second": 6.382, | |
| "step": 11500 | |
| }, | |
| { | |
| "epoch": 1.0522589272013854, | |
| "grad_norm": 2.5920369625091553, | |
| "learning_rate": 4.690885287009749e-05, | |
| "loss": 3.2009, | |
| "step": 12000 | |
| }, | |
| { | |
| "epoch": 1.0522589272013854, | |
| "eval_loss": 3.045903444290161, | |
| "eval_runtime": 1117.9755, | |
| "eval_samples_per_second": 817.066, | |
| "eval_steps_per_second": 6.384, | |
| "step": 12000 | |
| }, | |
| { | |
| "epoch": 1.0961003090817423, | |
| "grad_norm": 2.541583299636841, | |
| "learning_rate": 4.654733281420752e-05, | |
| "loss": 3.1746, | |
| "step": 12500 | |
| }, | |
| { | |
| "epoch": 1.0961003090817423, | |
| "eval_loss": 3.0118284225463867, | |
| "eval_runtime": 1119.6853, | |
| "eval_samples_per_second": 815.818, | |
| "eval_steps_per_second": 6.374, | |
| "step": 12500 | |
| }, | |
| { | |
| "epoch": 1.1399416909620992, | |
| "grad_norm": 2.3801028728485107, | |
| "learning_rate": 4.6166601305962655e-05, | |
| "loss": 3.1391, | |
| "step": 13000 | |
| }, | |
| { | |
| "epoch": 1.1399416909620992, | |
| "eval_loss": 2.9807887077331543, | |
| "eval_runtime": 1117.6385, | |
| "eval_samples_per_second": 817.313, | |
| "eval_steps_per_second": 6.386, | |
| "step": 13000 | |
| }, | |
| { | |
| "epoch": 1.183783072842456, | |
| "grad_norm": 2.356208562850952, | |
| "learning_rate": 4.576769110578126e-05, | |
| "loss": 3.1054, | |
| "step": 13500 | |
| }, | |
| { | |
| "epoch": 1.183783072842456, | |
| "eval_loss": 2.9562630653381348, | |
| "eval_runtime": 1117.9985, | |
| "eval_samples_per_second": 817.049, | |
| "eval_steps_per_second": 6.384, | |
| "step": 13500 | |
| }, | |
| { | |
| "epoch": 1.2276244547228128, | |
| "grad_norm": 2.4931366443634033, | |
| "learning_rate": 4.535094481309793e-05, | |
| "loss": 3.082, | |
| "step": 14000 | |
| }, | |
| { | |
| "epoch": 1.2276244547228128, | |
| "eval_loss": 2.927985429763794, | |
| "eval_runtime": 1118.2717, | |
| "eval_samples_per_second": 816.85, | |
| "eval_steps_per_second": 6.382, | |
| "step": 14000 | |
| }, | |
| { | |
| "epoch": 1.2714658366031697, | |
| "grad_norm": 2.264676094055176, | |
| "learning_rate": 4.4917605992417254e-05, | |
| "loss": 3.0559, | |
| "step": 14500 | |
| }, | |
| { | |
| "epoch": 1.2714658366031697, | |
| "eval_loss": 2.9001705646514893, | |
| "eval_runtime": 1118.531, | |
| "eval_samples_per_second": 816.66, | |
| "eval_steps_per_second": 6.381, | |
| "step": 14500 | |
| }, | |
| { | |
| "epoch": 1.3153072184835266, | |
| "grad_norm": 2.7281758785247803, | |
| "learning_rate": 4.4467229515780716e-05, | |
| "loss": 3.0363, | |
| "step": 15000 | |
| }, | |
| { | |
| "epoch": 1.3153072184835266, | |
| "eval_loss": 2.877182960510254, | |
| "eval_runtime": 1118.2684, | |
| "eval_samples_per_second": 816.852, | |
| "eval_steps_per_second": 6.382, | |
| "step": 15000 | |
| }, | |
| { | |
| "epoch": 1.3591486003638835, | |
| "grad_norm": 2.4086153507232666, | |
| "learning_rate": 4.3999248254794173e-05, | |
| "loss": 3.0034, | |
| "step": 15500 | |
| }, | |
| { | |
| "epoch": 1.3591486003638835, | |
| "eval_loss": 2.858940839767456, | |
| "eval_runtime": 1118.6587, | |
| "eval_samples_per_second": 816.567, | |
| "eval_steps_per_second": 6.38, | |
| "step": 15500 | |
| }, | |
| { | |
| "epoch": 1.4029899822442404, | |
| "grad_norm": 2.3999428749084473, | |
| "learning_rate": 4.351494970809619e-05, | |
| "loss": 2.9863, | |
| "step": 16000 | |
| }, | |
| { | |
| "epoch": 1.4029899822442404, | |
| "eval_loss": 2.829259157180786, | |
| "eval_runtime": 1118.2831, | |
| "eval_samples_per_second": 816.841, | |
| "eval_steps_per_second": 6.382, | |
| "step": 16000 | |
| }, | |
| { | |
| "epoch": 1.4468313641245971, | |
| "grad_norm": 2.684216022491455, | |
| "learning_rate": 4.301474980992007e-05, | |
| "loss": 2.9554, | |
| "step": 16500 | |
| }, | |
| { | |
| "epoch": 1.4468313641245971, | |
| "eval_loss": 2.811227560043335, | |
| "eval_runtime": 1118.6502, | |
| "eval_samples_per_second": 816.573, | |
| "eval_steps_per_second": 6.38, | |
| "step": 16500 | |
| }, | |
| { | |
| "epoch": 1.490672746004954, | |
| "grad_norm": 2.5561940670013428, | |
| "learning_rate": 4.2499078151191824e-05, | |
| "loss": 2.9428, | |
| "step": 17000 | |
| }, | |
| { | |
| "epoch": 1.490672746004954, | |
| "eval_loss": 2.789614200592041, | |
| "eval_runtime": 1118.5002, | |
| "eval_samples_per_second": 816.683, | |
| "eval_steps_per_second": 6.381, | |
| "step": 17000 | |
| }, | |
| { | |
| "epoch": 1.534514127885311, | |
| "grad_norm": 2.4294307231903076, | |
| "learning_rate": 4.196837761058097e-05, | |
| "loss": 2.9133, | |
| "step": 17500 | |
| }, | |
| { | |
| "epoch": 1.534514127885311, | |
| "eval_loss": 2.7667744159698486, | |
| "eval_runtime": 1119.3799, | |
| "eval_samples_per_second": 816.041, | |
| "eval_steps_per_second": 6.376, | |
| "step": 17500 | |
| }, | |
| { | |
| "epoch": 1.5783555097656679, | |
| "grad_norm": 2.2849645614624023, | |
| "learning_rate": 4.142310397413924e-05, | |
| "loss": 2.9016, | |
| "step": 18000 | |
| }, | |
| { | |
| "epoch": 1.5783555097656679, | |
| "eval_loss": 2.747105836868286, | |
| "eval_runtime": 1118.1926, | |
| "eval_samples_per_second": 816.908, | |
| "eval_steps_per_second": 6.383, | |
| "step": 18000 | |
| }, | |
| { | |
| "epoch": 1.6221968916460248, | |
| "grad_norm": 2.693436622619629, | |
| "learning_rate": 4.086372554385406e-05, | |
| "loss": 2.8805, | |
| "step": 18500 | |
| }, | |
| { | |
| "epoch": 1.6221968916460248, | |
| "eval_loss": 2.7286176681518555, | |
| "eval_runtime": 1118.2866, | |
| "eval_samples_per_second": 816.839, | |
| "eval_steps_per_second": 6.382, | |
| "step": 18500 | |
| }, | |
| { | |
| "epoch": 1.6660382735263815, | |
| "grad_norm": 2.6212801933288574, | |
| "learning_rate": 4.029188201301087e-05, | |
| "loss": 2.8591, | |
| "step": 19000 | |
| }, | |
| { | |
| "epoch": 1.6660382735263815, | |
| "eval_loss": 2.7152278423309326, | |
| "eval_runtime": 1497.2315, | |
| "eval_samples_per_second": 610.099, | |
| "eval_steps_per_second": 4.767, | |
| "step": 19000 | |
| }, | |
| { | |
| "epoch": 1.7098796554067386, | |
| "grad_norm": 2.575929880142212, | |
| "learning_rate": 3.9705772709182955e-05, | |
| "loss": 2.8453, | |
| "step": 19500 | |
| }, | |
| { | |
| "epoch": 1.7098796554067386, | |
| "eval_loss": 2.700686454772949, | |
| "eval_runtime": 2157.4613, | |
| "eval_samples_per_second": 423.396, | |
| "eval_steps_per_second": 3.308, | |
| "step": 19500 | |
| }, | |
| { | |
| "epoch": 1.7537210372870953, | |
| "grad_norm": 2.335934638977051, | |
| "learning_rate": 3.910703352170464e-05, | |
| "loss": 2.837, | |
| "step": 20000 | |
| }, | |
| { | |
| "epoch": 1.7537210372870953, | |
| "eval_loss": 2.6829771995544434, | |
| "eval_runtime": 2034.4811, | |
| "eval_samples_per_second": 448.989, | |
| "eval_steps_per_second": 3.508, | |
| "step": 20000 | |
| }, | |
| { | |
| "epoch": 1.7975624191674522, | |
| "grad_norm": 2.378584146499634, | |
| "learning_rate": 3.8496178670836514e-05, | |
| "loss": 2.8044, | |
| "step": 20500 | |
| }, | |
| { | |
| "epoch": 1.7975624191674522, | |
| "eval_loss": 2.6625845432281494, | |
| "eval_runtime": 1120.1353, | |
| "eval_samples_per_second": 815.491, | |
| "eval_steps_per_second": 6.372, | |
| "step": 20500 | |
| }, | |
| { | |
| "epoch": 1.841403801047809, | |
| "grad_norm": 2.4612674713134766, | |
| "learning_rate": 3.787498888816347e-05, | |
| "loss": 2.8002, | |
| "step": 21000 | |
| }, | |
| { | |
| "epoch": 1.841403801047809, | |
| "eval_loss": 2.6464881896972656, | |
| "eval_runtime": 1126.8521, | |
| "eval_samples_per_second": 810.63, | |
| "eval_steps_per_second": 6.334, | |
| "step": 21000 | |
| }, | |
| { | |
| "epoch": 1.8852451829281658, | |
| "grad_norm": 2.6136703491210938, | |
| "learning_rate": 3.724150811533548e-05, | |
| "loss": 2.7825, | |
| "step": 21500 | |
| }, | |
| { | |
| "epoch": 1.8852451829281658, | |
| "eval_loss": 2.6333353519439697, | |
| "eval_runtime": 1263.6812, | |
| "eval_samples_per_second": 722.856, | |
| "eval_steps_per_second": 5.648, | |
| "step": 21500 | |
| }, | |
| { | |
| "epoch": 1.929086564808523, | |
| "grad_norm": 2.4944891929626465, | |
| "learning_rate": 3.6597513864143615e-05, | |
| "loss": 2.7675, | |
| "step": 22000 | |
| }, | |
| { | |
| "epoch": 1.929086564808523, | |
| "eval_loss": 2.617983818054199, | |
| "eval_runtime": 1248.4456, | |
| "eval_samples_per_second": 731.678, | |
| "eval_steps_per_second": 5.717, | |
| "step": 22000 | |
| }, | |
| { | |
| "epoch": 1.9729279466888796, | |
| "grad_norm": 2.3364956378936768, | |
| "learning_rate": 3.5943559221639114e-05, | |
| "loss": 2.7505, | |
| "step": 22500 | |
| }, | |
| { | |
| "epoch": 1.9729279466888796, | |
| "eval_loss": 2.6033763885498047, | |
| "eval_runtime": 1217.4556, | |
| "eval_samples_per_second": 750.303, | |
| "eval_steps_per_second": 5.862, | |
| "step": 22500 | |
| }, | |
| { | |
| "epoch": 2.016835090642057, | |
| "grad_norm": 2.4662578105926514, | |
| "learning_rate": 3.5281541538602945e-05, | |
| "loss": 2.7397, | |
| "step": 23000 | |
| }, | |
| { | |
| "epoch": 2.016835090642057, | |
| "eval_loss": 2.5903615951538086, | |
| "eval_runtime": 1253.7584, | |
| "eval_samples_per_second": 728.577, | |
| "eval_steps_per_second": 5.692, | |
| "step": 23000 | |
| }, | |
| { | |
| "epoch": 2.060676472522414, | |
| "grad_norm": 2.368075370788574, | |
| "learning_rate": 3.460937619411428e-05, | |
| "loss": 2.7161, | |
| "step": 23500 | |
| }, | |
| { | |
| "epoch": 2.060676472522414, | |
| "eval_loss": 2.579867362976074, | |
| "eval_runtime": 1116.1318, | |
| "eval_samples_per_second": 818.416, | |
| "eval_steps_per_second": 6.394, | |
| "step": 23500 | |
| }, | |
| { | |
| "epoch": 2.1045178544027707, | |
| "grad_norm": 2.3490450382232666, | |
| "learning_rate": 3.392895794747047e-05, | |
| "loss": 2.7133, | |
| "step": 24000 | |
| }, | |
| { | |
| "epoch": 2.1045178544027707, | |
| "eval_loss": 2.566068649291992, | |
| "eval_runtime": 1187.4579, | |
| "eval_samples_per_second": 769.257, | |
| "eval_steps_per_second": 6.01, | |
| "step": 24000 | |
| }, | |
| { | |
| "epoch": 2.1483592362831274, | |
| "grad_norm": 2.431868076324463, | |
| "learning_rate": 3.324087116805208e-05, | |
| "loss": 2.7004, | |
| "step": 24500 | |
| }, | |
| { | |
| "epoch": 2.1483592362831274, | |
| "eval_loss": 2.5521492958068848, | |
| "eval_runtime": 1214.5781, | |
| "eval_samples_per_second": 752.08, | |
| "eval_steps_per_second": 5.876, | |
| "step": 24500 | |
| }, | |
| { | |
| "epoch": 2.1922006181634845, | |
| "grad_norm": 2.526017665863037, | |
| "learning_rate": 3.254710380753827e-05, | |
| "loss": 2.685, | |
| "step": 25000 | |
| }, | |
| { | |
| "epoch": 2.1922006181634845, | |
| "eval_loss": 2.5438075065612793, | |
| "eval_runtime": 1165.0991, | |
| "eval_samples_per_second": 784.019, | |
| "eval_steps_per_second": 6.126, | |
| "step": 25000 | |
| }, | |
| { | |
| "epoch": 2.2360420000438412, | |
| "grad_norm": 2.22011661529541, | |
| "learning_rate": 3.184547126876346e-05, | |
| "loss": 2.6741, | |
| "step": 25500 | |
| }, | |
| { | |
| "epoch": 2.2360420000438412, | |
| "eval_loss": 2.5303306579589844, | |
| "eval_runtime": 1121.7956, | |
| "eval_samples_per_second": 814.284, | |
| "eval_steps_per_second": 6.362, | |
| "step": 25500 | |
| }, | |
| { | |
| "epoch": 2.2798833819241984, | |
| "grad_norm": 2.376256227493286, | |
| "learning_rate": 3.113795957577035e-05, | |
| "loss": 2.6677, | |
| "step": 26000 | |
| }, | |
| { | |
| "epoch": 2.2798833819241984, | |
| "eval_loss": 2.5202553272247314, | |
| "eval_runtime": 1164.241, | |
| "eval_samples_per_second": 784.597, | |
| "eval_steps_per_second": 6.13, | |
| "step": 26000 | |
| }, | |
| { | |
| "epoch": 2.323724763804555, | |
| "grad_norm": 2.520549774169922, | |
| "learning_rate": 3.0425176366834078e-05, | |
| "loss": 2.6527, | |
| "step": 26500 | |
| }, | |
| { | |
| "epoch": 2.323724763804555, | |
| "eval_loss": 2.5118391513824463, | |
| "eval_runtime": 1117.8696, | |
| "eval_samples_per_second": 817.144, | |
| "eval_steps_per_second": 6.384, | |
| "step": 26500 | |
| }, | |
| { | |
| "epoch": 2.367566145684912, | |
| "grad_norm": 2.346203088760376, | |
| "learning_rate": 2.9709172933827506e-05, | |
| "loss": 2.6446, | |
| "step": 27000 | |
| }, | |
| { | |
| "epoch": 2.367566145684912, | |
| "eval_loss": 2.500302314758301, | |
| "eval_runtime": 1118.1231, | |
| "eval_samples_per_second": 816.958, | |
| "eval_steps_per_second": 6.383, | |
| "step": 27000 | |
| }, | |
| { | |
| "epoch": 2.411407527565269, | |
| "grad_norm": 2.496829032897949, | |
| "learning_rate": 2.8989141242188162e-05, | |
| "loss": 2.6341, | |
| "step": 27500 | |
| }, | |
| { | |
| "epoch": 2.411407527565269, | |
| "eval_loss": 2.489889621734619, | |
| "eval_runtime": 1122.3441, | |
| "eval_samples_per_second": 813.886, | |
| "eval_steps_per_second": 6.359, | |
| "step": 27500 | |
| }, | |
| { | |
| "epoch": 2.4552489094456256, | |
| "grad_norm": 2.41103458404541, | |
| "learning_rate": 2.8264244412463785e-05, | |
| "loss": 2.6232, | |
| "step": 28000 | |
| }, | |
| { | |
| "epoch": 2.4552489094456256, | |
| "eval_loss": 2.4814670085906982, | |
| "eval_runtime": 1125.6467, | |
| "eval_samples_per_second": 811.498, | |
| "eval_steps_per_second": 6.34, | |
| "step": 28000 | |
| }, | |
| { | |
| "epoch": 2.4990902913259827, | |
| "grad_norm": 2.389714002609253, | |
| "learning_rate": 2.7536544123992213e-05, | |
| "loss": 2.613, | |
| "step": 28500 | |
| }, | |
| { | |
| "epoch": 2.4990902913259827, | |
| "eval_loss": 2.4698662757873535, | |
| "eval_runtime": 1121.0461, | |
| "eval_samples_per_second": 814.828, | |
| "eval_steps_per_second": 6.366, | |
| "step": 28500 | |
| }, | |
| { | |
| "epoch": 2.5429316732063394, | |
| "grad_norm": 2.2877752780914307, | |
| "learning_rate": 2.6806665353791482e-05, | |
| "loss": 2.6081, | |
| "step": 29000 | |
| }, | |
| { | |
| "epoch": 2.5429316732063394, | |
| "eval_loss": 2.464000940322876, | |
| "eval_runtime": 1125.4557, | |
| "eval_samples_per_second": 811.636, | |
| "eval_steps_per_second": 6.341, | |
| "step": 29000 | |
| }, | |
| { | |
| "epoch": 2.586773055086696, | |
| "grad_norm": 2.5879504680633545, | |
| "learning_rate": 2.607523494984359e-05, | |
| "loss": 2.6025, | |
| "step": 29500 | |
| }, | |
| { | |
| "epoch": 2.586773055086696, | |
| "eval_loss": 2.455082654953003, | |
| "eval_runtime": 1121.345, | |
| "eval_samples_per_second": 814.611, | |
| "eval_steps_per_second": 6.365, | |
| "step": 29500 | |
| }, | |
| { | |
| "epoch": 2.630614436967053, | |
| "grad_norm": 2.5052356719970703, | |
| "learning_rate": 2.534288109273333e-05, | |
| "loss": 2.5919, | |
| "step": 30000 | |
| }, | |
| { | |
| "epoch": 2.630614436967053, | |
| "eval_loss": 2.4449410438537598, | |
| "eval_runtime": 1123.293, | |
| "eval_samples_per_second": 813.198, | |
| "eval_steps_per_second": 6.354, | |
| "step": 30000 | |
| }, | |
| { | |
| "epoch": 2.67445581884741, | |
| "grad_norm": 2.4013631343841553, | |
| "learning_rate": 2.4610232756142613e-05, | |
| "loss": 2.5741, | |
| "step": 30500 | |
| }, | |
| { | |
| "epoch": 2.67445581884741, | |
| "eval_loss": 2.4410789012908936, | |
| "eval_runtime": 1120.3934, | |
| "eval_samples_per_second": 815.303, | |
| "eval_steps_per_second": 6.37, | |
| "step": 30500 | |
| }, | |
| { | |
| "epoch": 2.718297200727767, | |
| "grad_norm": 2.4138541221618652, | |
| "learning_rate": 2.3877919166663655e-05, | |
| "loss": 2.5773, | |
| "step": 31000 | |
| }, | |
| { | |
| "epoch": 2.718297200727767, | |
| "eval_loss": 2.431831121444702, | |
| "eval_runtime": 1118.5097, | |
| "eval_samples_per_second": 816.676, | |
| "eval_steps_per_second": 6.381, | |
| "step": 31000 | |
| }, | |
| { | |
| "epoch": 2.7621385826081237, | |
| "grad_norm": 2.482076644897461, | |
| "learning_rate": 2.3148030583765422e-05, | |
| "loss": 2.5637, | |
| "step": 31500 | |
| }, | |
| { | |
| "epoch": 2.7621385826081237, | |
| "eval_loss": 2.4250364303588867, | |
| "eval_runtime": 1118.5592, | |
| "eval_samples_per_second": 816.64, | |
| "eval_steps_per_second": 6.381, | |
| "step": 31500 | |
| }, | |
| { | |
| "epoch": 2.805979964488481, | |
| "grad_norm": 2.3182899951934814, | |
| "learning_rate": 2.2418268668523143e-05, | |
| "loss": 2.5642, | |
| "step": 32000 | |
| }, | |
| { | |
| "epoch": 2.805979964488481, | |
| "eval_loss": 2.4183554649353027, | |
| "eval_runtime": 1118.5188, | |
| "eval_samples_per_second": 816.669, | |
| "eval_steps_per_second": 6.381, | |
| "step": 32000 | |
| }, | |
| { | |
| "epoch": 2.8498213463688375, | |
| "grad_norm": 2.3466103076934814, | |
| "learning_rate": 2.169072404352314e-05, | |
| "loss": 2.5513, | |
| "step": 32500 | |
| }, | |
| { | |
| "epoch": 2.8498213463688375, | |
| "eval_loss": 2.4129860401153564, | |
| "eval_runtime": 1118.2998, | |
| "eval_samples_per_second": 816.829, | |
| "eval_steps_per_second": 6.382, | |
| "step": 32500 | |
| }, | |
| { | |
| "epoch": 2.8936627282491942, | |
| "grad_norm": 2.474790096282959, | |
| "learning_rate": 2.096602155209367e-05, | |
| "loss": 2.5473, | |
| "step": 33000 | |
| }, | |
| { | |
| "epoch": 2.8936627282491942, | |
| "eval_loss": 2.404020309448242, | |
| "eval_runtime": 1117.9989, | |
| "eval_samples_per_second": 817.049, | |
| "eval_steps_per_second": 6.384, | |
| "step": 33000 | |
| }, | |
| { | |
| "epoch": 2.9375041101295514, | |
| "grad_norm": 2.6245903968811035, | |
| "learning_rate": 2.024622220267145e-05, | |
| "loss": 2.5466, | |
| "step": 33500 | |
| }, | |
| { | |
| "epoch": 2.9375041101295514, | |
| "eval_loss": 2.397976875305176, | |
| "eval_runtime": 1117.8697, | |
| "eval_samples_per_second": 817.144, | |
| "eval_steps_per_second": 6.384, | |
| "step": 33500 | |
| }, | |
| { | |
| "epoch": 2.981345492009908, | |
| "grad_norm": 2.452371120452881, | |
| "learning_rate": 1.9529059426219034e-05, | |
| "loss": 2.5425, | |
| "step": 34000 | |
| }, | |
| { | |
| "epoch": 2.981345492009908, | |
| "eval_loss": 2.3942997455596924, | |
| "eval_runtime": 1117.9055, | |
| "eval_samples_per_second": 817.117, | |
| "eval_steps_per_second": 6.384, | |
| "step": 34000 | |
| }, | |
| { | |
| "epoch": 3.0252526359630854, | |
| "grad_norm": 2.3234288692474365, | |
| "learning_rate": 1.8816595304116282e-05, | |
| "loss": 2.5303, | |
| "step": 34500 | |
| }, | |
| { | |
| "epoch": 3.0252526359630854, | |
| "eval_loss": 2.386817216873169, | |
| "eval_runtime": 1117.5393, | |
| "eval_samples_per_second": 817.385, | |
| "eval_steps_per_second": 6.386, | |
| "step": 34500 | |
| }, | |
| { | |
| "epoch": 3.0690940178434425, | |
| "grad_norm": 2.3618667125701904, | |
| "learning_rate": 1.8109441727975086e-05, | |
| "loss": 2.5211, | |
| "step": 35000 | |
| }, | |
| { | |
| "epoch": 3.0690940178434425, | |
| "eval_loss": 2.3825838565826416, | |
| "eval_runtime": 1117.688, | |
| "eval_samples_per_second": 817.276, | |
| "eval_steps_per_second": 6.386, | |
| "step": 35000 | |
| }, | |
| { | |
| "epoch": 3.112935399723799, | |
| "grad_norm": 2.662584066390991, | |
| "learning_rate": 1.7409602192670955e-05, | |
| "loss": 2.5119, | |
| "step": 35500 | |
| }, | |
| { | |
| "epoch": 3.112935399723799, | |
| "eval_loss": 2.3771533966064453, | |
| "eval_runtime": 1117.3971, | |
| "eval_samples_per_second": 817.489, | |
| "eval_steps_per_second": 6.387, | |
| "step": 35500 | |
| }, | |
| { | |
| "epoch": 3.1567767816041563, | |
| "grad_norm": 2.3066375255584717, | |
| "learning_rate": 1.6714872980427282e-05, | |
| "loss": 2.5066, | |
| "step": 36000 | |
| }, | |
| { | |
| "epoch": 3.1567767816041563, | |
| "eval_loss": 2.370797872543335, | |
| "eval_runtime": 1117.258, | |
| "eval_samples_per_second": 817.591, | |
| "eval_steps_per_second": 6.388, | |
| "step": 36000 | |
| }, | |
| { | |
| "epoch": 3.200618163484513, | |
| "grad_norm": 2.282196283340454, | |
| "learning_rate": 1.6027259354175276e-05, | |
| "loss": 2.5097, | |
| "step": 36500 | |
| }, | |
| { | |
| "epoch": 3.200618163484513, | |
| "eval_loss": 2.3679802417755127, | |
| "eval_runtime": 1117.3536, | |
| "eval_samples_per_second": 817.521, | |
| "eval_steps_per_second": 6.387, | |
| "step": 36500 | |
| }, | |
| { | |
| "epoch": 3.2444595453648697, | |
| "grad_norm": 2.28078556060791, | |
| "learning_rate": 1.5348703597951843e-05, | |
| "loss": 2.5014, | |
| "step": 37000 | |
| }, | |
| { | |
| "epoch": 3.2444595453648697, | |
| "eval_loss": 2.359700918197632, | |
| "eval_runtime": 1117.1139, | |
| "eval_samples_per_second": 817.696, | |
| "eval_steps_per_second": 6.389, | |
| "step": 37000 | |
| }, | |
| { | |
| "epoch": 3.288300927245227, | |
| "grad_norm": 2.3221096992492676, | |
| "learning_rate": 1.4677069014261374e-05, | |
| "loss": 2.4898, | |
| "step": 37500 | |
| }, | |
| { | |
| "epoch": 3.288300927245227, | |
| "eval_loss": 2.3578717708587646, | |
| "eval_runtime": 1117.2315, | |
| "eval_samples_per_second": 817.61, | |
| "eval_steps_per_second": 6.388, | |
| "step": 37500 | |
| }, | |
| { | |
| "epoch": 3.3321423091255835, | |
| "grad_norm": 2.2953991889953613, | |
| "learning_rate": 1.4014300161046912e-05, | |
| "loss": 2.4948, | |
| "step": 38000 | |
| }, | |
| { | |
| "epoch": 3.3321423091255835, | |
| "eval_loss": 2.353087902069092, | |
| "eval_runtime": 1117.3717, | |
| "eval_samples_per_second": 817.508, | |
| "eval_steps_per_second": 6.387, | |
| "step": 38000 | |
| }, | |
| { | |
| "epoch": 3.3759836910059406, | |
| "grad_norm": 2.307751178741455, | |
| "learning_rate": 1.3360966249710593e-05, | |
| "loss": 2.4833, | |
| "step": 38500 | |
| }, | |
| { | |
| "epoch": 3.3759836910059406, | |
| "eval_loss": 2.349313497543335, | |
| "eval_runtime": 1117.4288, | |
| "eval_samples_per_second": 817.466, | |
| "eval_steps_per_second": 6.387, | |
| "step": 38500 | |
| }, | |
| { | |
| "epoch": 3.4198250728862973, | |
| "grad_norm": 2.3358969688415527, | |
| "learning_rate": 1.2717628388563296e-05, | |
| "loss": 2.4851, | |
| "step": 39000 | |
| }, | |
| { | |
| "epoch": 3.4198250728862973, | |
| "eval_loss": 2.3457424640655518, | |
| "eval_runtime": 1117.3864, | |
| "eval_samples_per_second": 817.497, | |
| "eval_steps_per_second": 6.387, | |
| "step": 39000 | |
| }, | |
| { | |
| "epoch": 3.4636664547666545, | |
| "grad_norm": 2.6708974838256836, | |
| "learning_rate": 1.2084839100923225e-05, | |
| "loss": 2.4832, | |
| "step": 39500 | |
| }, | |
| { | |
| "epoch": 3.4636664547666545, | |
| "eval_loss": 2.341883420944214, | |
| "eval_runtime": 1117.3341, | |
| "eval_samples_per_second": 817.535, | |
| "eval_steps_per_second": 6.388, | |
| "step": 39500 | |
| }, | |
| { | |
| "epoch": 3.507507836647011, | |
| "grad_norm": 2.3781583309173584, | |
| "learning_rate": 1.1463141850587639e-05, | |
| "loss": 2.4728, | |
| "step": 40000 | |
| }, | |
| { | |
| "epoch": 3.507507836647011, | |
| "eval_loss": 2.338205575942993, | |
| "eval_runtime": 1117.3056, | |
| "eval_samples_per_second": 817.556, | |
| "eval_steps_per_second": 6.388, | |
| "step": 40000 | |
| }, | |
| { | |
| "epoch": 3.551349218527368, | |
| "grad_norm": 2.3650519847869873, | |
| "learning_rate": 1.0853070575085217e-05, | |
| "loss": 2.4747, | |
| "step": 40500 | |
| }, | |
| { | |
| "epoch": 3.551349218527368, | |
| "eval_loss": 2.3338863849639893, | |
| "eval_runtime": 1117.5211, | |
| "eval_samples_per_second": 817.398, | |
| "eval_steps_per_second": 6.386, | |
| "step": 40500 | |
| }, | |
| { | |
| "epoch": 3.595190600407725, | |
| "grad_norm": 2.5673470497131348, | |
| "learning_rate": 1.0256332601077586e-05, | |
| "loss": 2.4674, | |
| "step": 41000 | |
| }, | |
| { | |
| "epoch": 3.595190600407725, | |
| "eval_loss": 2.3310675621032715, | |
| "eval_runtime": 1117.5975, | |
| "eval_samples_per_second": 817.343, | |
| "eval_steps_per_second": 6.386, | |
| "step": 41000 | |
| }, | |
| { | |
| "epoch": 3.6390319822880817, | |
| "grad_norm": 2.27545428276062, | |
| "learning_rate": 9.671048866272692e-06, | |
| "loss": 2.4676, | |
| "step": 41500 | |
| }, | |
| { | |
| "epoch": 3.6390319822880817, | |
| "eval_loss": 2.328411102294922, | |
| "eval_runtime": 1117.445, | |
| "eval_samples_per_second": 817.454, | |
| "eval_steps_per_second": 6.387, | |
| "step": 41500 | |
| }, | |
| { | |
| "epoch": 3.6828733641684384, | |
| "grad_norm": 2.398531436920166, | |
| "learning_rate": 9.098930224736293e-06, | |
| "loss": 2.4607, | |
| "step": 42000 | |
| }, | |
| { | |
| "epoch": 3.6828733641684384, | |
| "eval_loss": 2.3261964321136475, | |
| "eval_runtime": 1117.1492, | |
| "eval_samples_per_second": 817.671, | |
| "eval_steps_per_second": 6.389, | |
| "step": 42000 | |
| }, | |
| { | |
| "epoch": 3.7267147460487955, | |
| "grad_norm": 2.2593164443969727, | |
| "learning_rate": 8.540468033979468e-06, | |
| "loss": 2.4617, | |
| "step": 42500 | |
| }, | |
| { | |
| "epoch": 3.7267147460487955, | |
| "eval_loss": 2.3223798274993896, | |
| "eval_runtime": 1117.5341, | |
| "eval_samples_per_second": 817.389, | |
| "eval_steps_per_second": 6.386, | |
| "step": 42500 | |
| }, | |
| { | |
| "epoch": 3.770556127929152, | |
| "grad_norm": 2.4137706756591797, | |
| "learning_rate": 7.99721615445626e-06, | |
| "loss": 2.4589, | |
| "step": 43000 | |
| }, | |
| { | |
| "epoch": 3.770556127929152, | |
| "eval_loss": 2.3220419883728027, | |
| "eval_runtime": 1117.5679, | |
| "eval_samples_per_second": 817.364, | |
| "eval_steps_per_second": 6.386, | |
| "step": 43000 | |
| }, | |
| { | |
| "epoch": 3.8143975098095093, | |
| "grad_norm": 2.372236728668213, | |
| "learning_rate": 7.467463945707431e-06, | |
| "loss": 2.4587, | |
| "step": 43500 | |
| }, | |
| { | |
| "epoch": 3.8143975098095093, | |
| "eval_loss": 2.319883346557617, | |
| "eval_runtime": 1117.7624, | |
| "eval_samples_per_second": 817.222, | |
| "eval_steps_per_second": 6.385, | |
| "step": 43500 | |
| }, | |
| { | |
| "epoch": 3.858238891689866, | |
| "grad_norm": 2.357147693634033, | |
| "learning_rate": 6.952769353776245e-06, | |
| "loss": 2.4535, | |
| "step": 44000 | |
| }, | |
| { | |
| "epoch": 3.858238891689866, | |
| "eval_loss": 2.317007303237915, | |
| "eval_runtime": 1133.7123, | |
| "eval_samples_per_second": 805.725, | |
| "eval_steps_per_second": 6.295, | |
| "step": 44000 | |
| }, | |
| { | |
| "epoch": 3.902080273570223, | |
| "grad_norm": 2.783552408218384, | |
| "learning_rate": 6.454557052188573e-06, | |
| "loss": 2.449, | |
| "step": 44500 | |
| }, | |
| { | |
| "epoch": 3.902080273570223, | |
| "eval_loss": 2.31400728225708, | |
| "eval_runtime": 1167.9518, | |
| "eval_samples_per_second": 782.104, | |
| "eval_steps_per_second": 6.111, | |
| "step": 44500 | |
| }, | |
| { | |
| "epoch": 3.94592165545058, | |
| "grad_norm": 2.172205924987793, | |
| "learning_rate": 5.9712582251657486e-06, | |
| "loss": 2.4505, | |
| "step": 45000 | |
| }, | |
| { | |
| "epoch": 3.94592165545058, | |
| "eval_loss": 2.311835289001465, | |
| "eval_runtime": 1177.0705, | |
| "eval_samples_per_second": 776.045, | |
| "eval_steps_per_second": 6.063, | |
| "step": 45000 | |
| }, | |
| { | |
| "epoch": 3.9897630373309365, | |
| "grad_norm": 2.5776069164276123, | |
| "learning_rate": 5.504302014024623e-06, | |
| "loss": 2.4516, | |
| "step": 45500 | |
| }, | |
| { | |
| "epoch": 3.9897630373309365, | |
| "eval_loss": 2.3110923767089844, | |
| "eval_runtime": 1155.3005, | |
| "eval_samples_per_second": 790.669, | |
| "eval_steps_per_second": 6.178, | |
| "step": 45500 | |
| }, | |
| { | |
| "epoch": 4.033670181284114, | |
| "grad_norm": 2.3275997638702393, | |
| "learning_rate": 5.0540894587331774e-06, | |
| "loss": 2.4486, | |
| "step": 46000 | |
| }, | |
| { | |
| "epoch": 4.033670181284114, | |
| "eval_loss": 2.308993339538574, | |
| "eval_runtime": 1153.9106, | |
| "eval_samples_per_second": 791.621, | |
| "eval_steps_per_second": 6.185, | |
| "step": 46000 | |
| }, | |
| { | |
| "epoch": 4.077511563164471, | |
| "grad_norm": 2.5999953746795654, | |
| "learning_rate": 4.621007219163281e-06, | |
| "loss": 2.4475, | |
| "step": 46500 | |
| }, | |
| { | |
| "epoch": 4.077511563164471, | |
| "eval_loss": 2.3080523014068604, | |
| "eval_runtime": 1127.4548, | |
| "eval_samples_per_second": 810.197, | |
| "eval_steps_per_second": 6.33, | |
| "step": 46500 | |
| }, | |
| { | |
| "epoch": 4.121352945044828, | |
| "grad_norm": 2.5732951164245605, | |
| "learning_rate": 4.205427243012275e-06, | |
| "loss": 2.4422, | |
| "step": 47000 | |
| }, | |
| { | |
| "epoch": 4.121352945044828, | |
| "eval_loss": 2.3062963485717773, | |
| "eval_runtime": 1172.9589, | |
| "eval_samples_per_second": 778.766, | |
| "eval_steps_per_second": 6.085, | |
| "step": 47000 | |
| }, | |
| { | |
| "epoch": 4.165194326925184, | |
| "grad_norm": 2.5187389850616455, | |
| "learning_rate": 3.807706446359982e-06, | |
| "loss": 2.4356, | |
| "step": 47500 | |
| }, | |
| { | |
| "epoch": 4.165194326925184, | |
| "eval_loss": 2.303138017654419, | |
| "eval_runtime": 1168.5041, | |
| "eval_samples_per_second": 781.735, | |
| "eval_steps_per_second": 6.108, | |
| "step": 47500 | |
| }, | |
| { | |
| "epoch": 4.2090357088055415, | |
| "grad_norm": 2.493955373764038, | |
| "learning_rate": 3.4281864071354503e-06, | |
| "loss": 2.4373, | |
| "step": 48000 | |
| }, | |
| { | |
| "epoch": 4.2090357088055415, | |
| "eval_loss": 2.3037543296813965, | |
| "eval_runtime": 1141.8833, | |
| "eval_samples_per_second": 799.959, | |
| "eval_steps_per_second": 6.25, | |
| "step": 48000 | |
| }, | |
| { | |
| "epoch": 4.252877090685899, | |
| "grad_norm": 2.4855451583862305, | |
| "learning_rate": 3.067896360030392e-06, | |
| "loss": 2.438, | |
| "step": 48500 | |
| }, | |
| { | |
| "epoch": 4.252877090685899, | |
| "eval_loss": 2.302539348602295, | |
| "eval_runtime": 1132.8756, | |
| "eval_samples_per_second": 806.32, | |
| "eval_steps_per_second": 6.3, | |
| "step": 48500 | |
| }, | |
| { | |
| "epoch": 4.296718472566255, | |
| "grad_norm": 2.443387985229492, | |
| "learning_rate": 2.725701791286309e-06, | |
| "loss": 2.4302, | |
| "step": 49000 | |
| }, | |
| { | |
| "epoch": 4.296718472566255, | |
| "eval_loss": 2.301379919052124, | |
| "eval_runtime": 1147.1315, | |
| "eval_samples_per_second": 796.299, | |
| "eval_steps_per_second": 6.222, | |
| "step": 49000 | |
| }, | |
| { | |
| "epoch": 4.340559854446612, | |
| "grad_norm": 2.50595760345459, | |
| "learning_rate": 2.402637247215794e-06, | |
| "loss": 2.4363, | |
| "step": 49500 | |
| }, | |
| { | |
| "epoch": 4.340559854446612, | |
| "eval_loss": 2.3001203536987305, | |
| "eval_runtime": 1118.4945, | |
| "eval_samples_per_second": 816.687, | |
| "eval_steps_per_second": 6.381, | |
| "step": 49500 | |
| }, | |
| { | |
| "epoch": 4.384401236326969, | |
| "grad_norm": 2.498288869857788, | |
| "learning_rate": 2.098980188084537e-06, | |
| "loss": 2.4362, | |
| "step": 50000 | |
| }, | |
| { | |
| "epoch": 4.384401236326969, | |
| "eval_loss": 2.2997913360595703, | |
| "eval_runtime": 1114.6443, | |
| "eval_samples_per_second": 819.508, | |
| "eval_steps_per_second": 6.403, | |
| "step": 50000 | |
| }, | |
| { | |
| "epoch": 4.428242618207326, | |
| "grad_norm": 2.488811492919922, | |
| "learning_rate": 1.815539589939294e-06, | |
| "loss": 2.4307, | |
| "step": 50500 | |
| }, | |
| { | |
| "epoch": 4.428242618207326, | |
| "eval_loss": 2.2987558841705322, | |
| "eval_runtime": 1153.656, | |
| "eval_samples_per_second": 791.796, | |
| "eval_steps_per_second": 6.186, | |
| "step": 50500 | |
| }, | |
| { | |
| "epoch": 4.4720840000876825, | |
| "grad_norm": 2.4829695224761963, | |
| "learning_rate": 1.5514229294897542e-06, | |
| "loss": 2.4326, | |
| "step": 51000 | |
| }, | |
| { | |
| "epoch": 4.4720840000876825, | |
| "eval_loss": 2.296705484390259, | |
| "eval_runtime": 1118.7574, | |
| "eval_samples_per_second": 816.495, | |
| "eval_steps_per_second": 6.379, | |
| "step": 51000 | |
| }, | |
| { | |
| "epoch": 4.51592538196804, | |
| "grad_norm": 2.530369997024536, | |
| "learning_rate": 1.3074448096000807e-06, | |
| "loss": 2.435, | |
| "step": 51500 | |
| }, | |
| { | |
| "epoch": 4.51592538196804, | |
| "eval_loss": 2.2978501319885254, | |
| "eval_runtime": 1118.919, | |
| "eval_samples_per_second": 816.377, | |
| "eval_steps_per_second": 6.378, | |
| "step": 51500 | |
| }, | |
| { | |
| "epoch": 4.559766763848397, | |
| "grad_norm": 2.667680025100708, | |
| "learning_rate": 1.0838147680707346e-06, | |
| "loss": 2.4202, | |
| "step": 52000 | |
| }, | |
| { | |
| "epoch": 4.559766763848397, | |
| "eval_loss": 2.2962234020233154, | |
| "eval_runtime": 1118.9523, | |
| "eval_samples_per_second": 816.353, | |
| "eval_steps_per_second": 6.378, | |
| "step": 52000 | |
| }, | |
| { | |
| "epoch": 4.603608145728753, | |
| "grad_norm": 2.1807284355163574, | |
| "learning_rate": 8.811104288462684e-07, | |
| "loss": 2.4286, | |
| "step": 52500 | |
| }, | |
| { | |
| "epoch": 4.603608145728753, | |
| "eval_loss": 2.2967143058776855, | |
| "eval_runtime": 1118.8196, | |
| "eval_samples_per_second": 816.45, | |
| "eval_steps_per_second": 6.379, | |
| "step": 52500 | |
| }, | |
| { | |
| "epoch": 4.64744952760911, | |
| "grad_norm": 2.2673935890197754, | |
| "learning_rate": 6.986934982419146e-07, | |
| "loss": 2.4311, | |
| "step": 53000 | |
| }, | |
| { | |
| "epoch": 4.64744952760911, | |
| "eval_loss": 2.2961032390594482, | |
| "eval_runtime": 1118.4446, | |
| "eval_samples_per_second": 816.724, | |
| "eval_steps_per_second": 6.381, | |
| "step": 53000 | |
| }, | |
| { | |
| "epoch": 4.691290909489467, | |
| "grad_norm": 2.2549829483032227, | |
| "learning_rate": 5.371474650558512e-07, | |
| "loss": 2.4288, | |
| "step": 53500 | |
| }, | |
| { | |
| "epoch": 4.691290909489467, | |
| "eval_loss": 2.295196294784546, | |
| "eval_runtime": 1119.1152, | |
| "eval_samples_per_second": 816.234, | |
| "eval_steps_per_second": 6.377, | |
| "step": 53500 | |
| }, | |
| { | |
| "epoch": 4.735132291369824, | |
| "grad_norm": 2.3956711292266846, | |
| "learning_rate": 3.9661107123952765e-07, | |
| "loss": 2.4284, | |
| "step": 54000 | |
| }, | |
| { | |
| "epoch": 4.735132291369824, | |
| "eval_loss": 2.2958788871765137, | |
| "eval_runtime": 1118.6134, | |
| "eval_samples_per_second": 816.6, | |
| "eval_steps_per_second": 6.38, | |
| "step": 54000 | |
| }, | |
| { | |
| "epoch": 4.778973673250181, | |
| "grad_norm": 2.3948519229888916, | |
| "learning_rate": 2.774226677005054e-07, | |
| "loss": 2.43, | |
| "step": 54500 | |
| }, | |
| { | |
| "epoch": 4.778973673250181, | |
| "eval_loss": 2.29548716545105, | |
| "eval_runtime": 1118.792, | |
| "eval_samples_per_second": 816.47, | |
| "eval_steps_per_second": 6.379, | |
| "step": 54500 | |
| }, | |
| { | |
| "epoch": 4.822815055130538, | |
| "grad_norm": 2.336251735687256, | |
| "learning_rate": 1.7920694325616606e-07, | |
| "loss": 2.4354, | |
| "step": 55000 | |
| }, | |
| { | |
| "epoch": 4.822815055130538, | |
| "eval_loss": 2.295090436935425, | |
| "eval_runtime": 1118.5403, | |
| "eval_samples_per_second": 816.654, | |
| "eval_steps_per_second": 6.381, | |
| "step": 55000 | |
| }, | |
| { | |
| "epoch": 4.866656437010895, | |
| "grad_norm": 2.2819674015045166, | |
| "learning_rate": 1.0230827127936937e-07, | |
| "loss": 2.4268, | |
| "step": 55500 | |
| }, | |
| { | |
| "epoch": 4.866656437010895, | |
| "eval_loss": 2.295917272567749, | |
| "eval_runtime": 1118.759, | |
| "eval_samples_per_second": 816.494, | |
| "eval_steps_per_second": 6.379, | |
| "step": 55500 | |
| }, | |
| { | |
| "epoch": 4.910497818891251, | |
| "grad_norm": 2.349515438079834, | |
| "learning_rate": 4.679269530955821e-08, | |
| "loss": 2.4295, | |
| "step": 56000 | |
| }, | |
| { | |
| "epoch": 4.910497818891251, | |
| "eval_loss": 2.294180154800415, | |
| "eval_runtime": 1119.0255, | |
| "eval_samples_per_second": 816.3, | |
| "eval_steps_per_second": 6.378, | |
| "step": 56000 | |
| }, | |
| { | |
| "epoch": 4.954339200771608, | |
| "grad_norm": 2.2763524055480957, | |
| "learning_rate": 1.2754653424379426e-08, | |
| "loss": 2.4314, | |
| "step": 56500 | |
| }, | |
| { | |
| "epoch": 4.954339200771608, | |
| "eval_loss": 2.294581651687622, | |
| "eval_runtime": 1119.2098, | |
| "eval_samples_per_second": 816.165, | |
| "eval_steps_per_second": 6.377, | |
| "step": 56500 | |
| }, | |
| { | |
| "epoch": 4.998180582651965, | |
| "grad_norm": 2.5564186573028564, | |
| "learning_rate": 8.696357109150288e-11, | |
| "loss": 2.4295, | |
| "step": 57000 | |
| }, | |
| { | |
| "epoch": 4.998180582651965, | |
| "eval_loss": 2.2953152656555176, | |
| "eval_runtime": 1118.6887, | |
| "eval_samples_per_second": 816.545, | |
| "eval_steps_per_second": 6.38, | |
| "step": 57000 | |
| }, | |
| { | |
| "epoch": 5.0403208134285835, | |
| "grad_norm": 2.4840376377105713, | |
| "learning_rate": 2.0621818195184993e-05, | |
| "loss": 2.448, | |
| "step": 57500 | |
| }, | |
| { | |
| "epoch": 5.0403208134285835, | |
| "eval_loss": 2.295259952545166, | |
| "eval_runtime": 1254.4497, | |
| "eval_samples_per_second": 727.251, | |
| "eval_steps_per_second": 5.682, | |
| "step": 57500 | |
| }, | |
| { | |
| "epoch": 5.08414778454661, | |
| "grad_norm": 2.2857511043548584, | |
| "learning_rate": 2.020548401681933e-05, | |
| "loss": 2.4462, | |
| "step": 58000 | |
| }, | |
| { | |
| "epoch": 5.08414778454661, | |
| "eval_loss": 2.2957704067230225, | |
| "eval_runtime": 1112.6636, | |
| "eval_samples_per_second": 819.924, | |
| "eval_steps_per_second": 6.406, | |
| "step": 58000 | |
| }, | |
| { | |
| "epoch": 5.127974755664636, | |
| "grad_norm": 2.297426223754883, | |
| "learning_rate": 1.9791354300727253e-05, | |
| "loss": 2.4469, | |
| "step": 58500 | |
| }, | |
| { | |
| "epoch": 5.127974755664636, | |
| "eval_loss": 2.2939374446868896, | |
| "eval_runtime": 1112.6399, | |
| "eval_samples_per_second": 819.942, | |
| "eval_steps_per_second": 6.406, | |
| "step": 58500 | |
| }, | |
| { | |
| "epoch": 5.171801726782662, | |
| "grad_norm": 2.495027542114258, | |
| "learning_rate": 1.9378713462572584e-05, | |
| "loss": 2.4436, | |
| "step": 59000 | |
| }, | |
| { | |
| "epoch": 5.171801726782662, | |
| "eval_loss": 2.290992498397827, | |
| "eval_runtime": 1112.5602, | |
| "eval_samples_per_second": 820.001, | |
| "eval_steps_per_second": 6.407, | |
| "step": 59000 | |
| }, | |
| { | |
| "epoch": 5.215628697900688, | |
| "grad_norm": 2.5433051586151123, | |
| "learning_rate": 1.8966857431306628e-05, | |
| "loss": 2.4324, | |
| "step": 59500 | |
| }, | |
| { | |
| "epoch": 5.215628697900688, | |
| "eval_loss": 2.285850763320923, | |
| "eval_runtime": 1112.0589, | |
| "eval_samples_per_second": 820.37, | |
| "eval_steps_per_second": 6.41, | |
| "step": 59500 | |
| }, | |
| { | |
| "epoch": 5.259455669018714, | |
| "grad_norm": 2.5419158935546875, | |
| "learning_rate": 1.855673287709892e-05, | |
| "loss": 2.4231, | |
| "step": 60000 | |
| }, | |
| { | |
| "epoch": 5.259455669018714, | |
| "eval_loss": 2.2814688682556152, | |
| "eval_runtime": 1112.6767, | |
| "eval_samples_per_second": 819.915, | |
| "eval_steps_per_second": 6.406, | |
| "step": 60000 | |
| }, | |
| { | |
| "epoch": 5.30328264013674, | |
| "grad_norm": 2.5950675010681152, | |
| "learning_rate": 1.814845750332687e-05, | |
| "loss": 2.431, | |
| "step": 60500 | |
| }, | |
| { | |
| "epoch": 5.30328264013674, | |
| "eval_loss": 2.2797560691833496, | |
| "eval_runtime": 1113.0425, | |
| "eval_samples_per_second": 819.645, | |
| "eval_steps_per_second": 6.404, | |
| "step": 60500 | |
| }, | |
| { | |
| "epoch": 5.3471096112547665, | |
| "grad_norm": 2.439197063446045, | |
| "learning_rate": 1.774214848266375e-05, | |
| "loss": 2.4205, | |
| "step": 61000 | |
| }, | |
| { | |
| "epoch": 5.3471096112547665, | |
| "eval_loss": 2.2719454765319824, | |
| "eval_runtime": 1114.2544, | |
| "eval_samples_per_second": 818.754, | |
| "eval_steps_per_second": 6.397, | |
| "step": 61000 | |
| }, | |
| { | |
| "epoch": 5.390936582372793, | |
| "grad_norm": 2.4935576915740967, | |
| "learning_rate": 1.73379224234509e-05, | |
| "loss": 2.4216, | |
| "step": 61500 | |
| }, | |
| { | |
| "epoch": 5.390936582372793, | |
| "eval_loss": 2.2704086303710938, | |
| "eval_runtime": 1113.9901, | |
| "eval_samples_per_second": 818.948, | |
| "eval_steps_per_second": 6.399, | |
| "step": 61500 | |
| }, | |
| { | |
| "epoch": 5.434763553490818, | |
| "grad_norm": 2.526001453399658, | |
| "learning_rate": 1.6935895336231698e-05, | |
| "loss": 2.4118, | |
| "step": 62000 | |
| }, | |
| { | |
| "epoch": 5.434763553490818, | |
| "eval_loss": 2.2659912109375, | |
| "eval_runtime": 1113.1948, | |
| "eval_samples_per_second": 819.533, | |
| "eval_steps_per_second": 6.403, | |
| "step": 62000 | |
| }, | |
| { | |
| "epoch": 5.478590524608844, | |
| "grad_norm": 2.588696241378784, | |
| "learning_rate": 1.653618260045733e-05, | |
| "loss": 2.4104, | |
| "step": 62500 | |
| }, | |
| { | |
| "epoch": 5.478590524608844, | |
| "eval_loss": 2.262714147567749, | |
| "eval_runtime": 1113.2419, | |
| "eval_samples_per_second": 819.498, | |
| "eval_steps_per_second": 6.403, | |
| "step": 62500 | |
| }, | |
| { | |
| "epoch": 5.52241749572687, | |
| "grad_norm": 2.5436880588531494, | |
| "learning_rate": 1.6139690998599525e-05, | |
| "loss": 2.4048, | |
| "step": 63000 | |
| }, | |
| { | |
| "epoch": 5.52241749572687, | |
| "eval_loss": 2.261882781982422, | |
| "eval_runtime": 1112.8347, | |
| "eval_samples_per_second": 819.798, | |
| "eval_steps_per_second": 6.405, | |
| "step": 63000 | |
| }, | |
| { | |
| "epoch": 5.566244466844896, | |
| "grad_norm": 2.3459692001342773, | |
| "learning_rate": 1.574494521484366e-05, | |
| "loss": 2.4042, | |
| "step": 63500 | |
| }, | |
| { | |
| "epoch": 5.566244466844896, | |
| "eval_loss": 2.2557597160339355, | |
| "eval_runtime": 1115.0241, | |
| "eval_samples_per_second": 818.189, | |
| "eval_steps_per_second": 6.393, | |
| "step": 63500 | |
| }, | |
| { | |
| "epoch": 5.610071437962922, | |
| "grad_norm": 2.5149025917053223, | |
| "learning_rate": 1.5352855578336255e-05, | |
| "loss": 2.3984, | |
| "step": 64000 | |
| }, | |
| { | |
| "epoch": 5.610071437962922, | |
| "eval_loss": 2.2534825801849365, | |
| "eval_runtime": 1117.6575, | |
| "eval_samples_per_second": 816.261, | |
| "eval_steps_per_second": 6.378, | |
| "step": 64000 | |
| }, | |
| { | |
| "epoch": 5.6538984090809485, | |
| "grad_norm": 2.2918002605438232, | |
| "learning_rate": 1.4963534616537533e-05, | |
| "loss": 2.3954, | |
| "step": 64500 | |
| }, | |
| { | |
| "epoch": 5.6538984090809485, | |
| "eval_loss": 2.248565673828125, | |
| "eval_runtime": 1117.9311, | |
| "eval_samples_per_second": 816.061, | |
| "eval_steps_per_second": 6.376, | |
| "step": 64500 | |
| }, | |
| { | |
| "epoch": 5.697725380198975, | |
| "grad_norm": 2.298626661300659, | |
| "learning_rate": 1.4577863994919117e-05, | |
| "loss": 2.3967, | |
| "step": 65000 | |
| }, | |
| { | |
| "epoch": 5.697725380198975, | |
| "eval_loss": 2.2449169158935547, | |
| "eval_runtime": 1118.1203, | |
| "eval_samples_per_second": 815.923, | |
| "eval_steps_per_second": 6.375, | |
| "step": 65000 | |
| }, | |
| { | |
| "epoch": 5.741552351317001, | |
| "grad_norm": 2.3184773921966553, | |
| "learning_rate": 1.4194408661730513e-05, | |
| "loss": 2.3911, | |
| "step": 65500 | |
| }, | |
| { | |
| "epoch": 5.741552351317001, | |
| "eval_loss": 2.2438881397247314, | |
| "eval_runtime": 1118.3575, | |
| "eval_samples_per_second": 815.75, | |
| "eval_steps_per_second": 6.374, | |
| "step": 65500 | |
| }, | |
| { | |
| "epoch": 5.785379322435027, | |
| "grad_norm": 2.4109182357788086, | |
| "learning_rate": 1.3814054470822247e-05, | |
| "loss": 2.3809, | |
| "step": 66000 | |
| }, | |
| { | |
| "epoch": 5.785379322435027, | |
| "eval_loss": 2.240081310272217, | |
| "eval_runtime": 1118.1546, | |
| "eval_samples_per_second": 815.898, | |
| "eval_steps_per_second": 6.375, | |
| "step": 66000 | |
| }, | |
| { | |
| "epoch": 5.829206293553052, | |
| "grad_norm": 2.3846776485443115, | |
| "learning_rate": 1.3436910581649448e-05, | |
| "loss": 2.3793, | |
| "step": 66500 | |
| }, | |
| { | |
| "epoch": 5.829206293553052, | |
| "eval_loss": 2.239961862564087, | |
| "eval_runtime": 1118.5503, | |
| "eval_samples_per_second": 815.609, | |
| "eval_steps_per_second": 6.373, | |
| "step": 66500 | |
| }, | |
| { | |
| "epoch": 5.873033264671078, | |
| "grad_norm": 2.4958534240722656, | |
| "learning_rate": 1.3063829499654062e-05, | |
| "loss": 2.3779, | |
| "step": 67000 | |
| }, | |
| { | |
| "epoch": 5.873033264671078, | |
| "eval_loss": 2.2330241203308105, | |
| "eval_runtime": 1117.0041, | |
| "eval_samples_per_second": 816.738, | |
| "eval_steps_per_second": 6.381, | |
| "step": 67000 | |
| }, | |
| { | |
| "epoch": 5.9168602357891045, | |
| "grad_norm": 2.727729320526123, | |
| "learning_rate": 1.2693423017827839e-05, | |
| "loss": 2.3819, | |
| "step": 67500 | |
| }, | |
| { | |
| "epoch": 5.9168602357891045, | |
| "eval_loss": 2.230943441390991, | |
| "eval_runtime": 1118.424, | |
| "eval_samples_per_second": 815.701, | |
| "eval_steps_per_second": 6.373, | |
| "step": 67500 | |
| }, | |
| { | |
| "epoch": 5.960687206907131, | |
| "grad_norm": 2.575376272201538, | |
| "learning_rate": 1.232654845248921e-05, | |
| "loss": 2.381, | |
| "step": 68000 | |
| }, | |
| { | |
| "epoch": 5.960687206907131, | |
| "eval_loss": 2.230390787124634, | |
| "eval_runtime": 1118.1235, | |
| "eval_samples_per_second": 815.921, | |
| "eval_steps_per_second": 6.375, | |
| "step": 68000 | |
| }, | |
| { | |
| "epoch": 6.004470351054039, | |
| "grad_norm": 2.529177665710449, | |
| "learning_rate": 1.196331109451862e-05, | |
| "loss": 2.3686, | |
| "step": 68500 | |
| }, | |
| { | |
| "epoch": 6.004470351054039, | |
| "eval_loss": 2.2275359630584717, | |
| "eval_runtime": 1118.6647, | |
| "eval_samples_per_second": 815.526, | |
| "eval_steps_per_second": 6.372, | |
| "step": 68500 | |
| }, | |
| { | |
| "epoch": 6.048297322172065, | |
| "grad_norm": 2.376052141189575, | |
| "learning_rate": 1.1604530380017059e-05, | |
| "loss": 2.3651, | |
| "step": 69000 | |
| }, | |
| { | |
| "epoch": 6.048297322172065, | |
| "eval_loss": 2.2251877784729004, | |
| "eval_runtime": 1118.8605, | |
| "eval_samples_per_second": 815.383, | |
| "eval_steps_per_second": 6.371, | |
| "step": 69000 | |
| }, | |
| { | |
| "epoch": 6.092124293290091, | |
| "grad_norm": 2.479585886001587, | |
| "learning_rate": 1.1248871312582082e-05, | |
| "loss": 2.3636, | |
| "step": 69500 | |
| }, | |
| { | |
| "epoch": 6.092124293290091, | |
| "eval_loss": 2.221175193786621, | |
| "eval_runtime": 1119.5075, | |
| "eval_samples_per_second": 814.912, | |
| "eval_steps_per_second": 6.367, | |
| "step": 69500 | |
| }, | |
| { | |
| "epoch": 6.135951264408117, | |
| "grad_norm": 2.534466505050659, | |
| "learning_rate": 1.0897158739627577e-05, | |
| "loss": 2.3651, | |
| "step": 70000 | |
| }, | |
| { | |
| "epoch": 6.135951264408117, | |
| "eval_loss": 2.2180685997009277, | |
| "eval_runtime": 1118.9839, | |
| "eval_samples_per_second": 815.293, | |
| "eval_steps_per_second": 6.37, | |
| "step": 70000 | |
| }, | |
| { | |
| "epoch": 6.179778235526142, | |
| "grad_norm": 2.6526997089385986, | |
| "learning_rate": 1.0549493600629845e-05, | |
| "loss": 2.3652, | |
| "step": 70500 | |
| }, | |
| { | |
| "epoch": 6.179778235526142, | |
| "eval_loss": 2.220241069793701, | |
| "eval_runtime": 1117.2188, | |
| "eval_samples_per_second": 816.581, | |
| "eval_steps_per_second": 6.38, | |
| "step": 70500 | |
| }, | |
| { | |
| "epoch": 6.2236052066441685, | |
| "grad_norm": 2.5207266807556152, | |
| "learning_rate": 1.0206658504682815e-05, | |
| "loss": 2.355, | |
| "step": 71000 | |
| }, | |
| { | |
| "epoch": 6.2236052066441685, | |
| "eval_loss": 2.2159178256988525, | |
| "eval_runtime": 1117.5581, | |
| "eval_samples_per_second": 816.333, | |
| "eval_steps_per_second": 6.378, | |
| "step": 71000 | |
| }, | |
| { | |
| "epoch": 6.267432177762195, | |
| "grad_norm": 2.5469133853912354, | |
| "learning_rate": 9.867377787846862e-06, | |
| "loss": 2.3543, | |
| "step": 71500 | |
| }, | |
| { | |
| "epoch": 6.267432177762195, | |
| "eval_loss": 2.2127163410186768, | |
| "eval_runtime": 1117.1967, | |
| "eval_samples_per_second": 816.598, | |
| "eval_steps_per_second": 6.38, | |
| "step": 71500 | |
| }, | |
| { | |
| "epoch": 6.311259148880221, | |
| "grad_norm": 2.4534058570861816, | |
| "learning_rate": 9.532440046150856e-06, | |
| "loss": 2.351, | |
| "step": 72000 | |
| }, | |
| { | |
| "epoch": 6.311259148880221, | |
| "eval_loss": 2.2119340896606445, | |
| "eval_runtime": 1117.6266, | |
| "eval_samples_per_second": 816.283, | |
| "eval_steps_per_second": 6.378, | |
| "step": 72000 | |
| }, | |
| { | |
| "epoch": 6.355086119998247, | |
| "grad_norm": 2.4497475624084473, | |
| "learning_rate": 9.201941404791417e-06, | |
| "loss": 2.3451, | |
| "step": 72500 | |
| }, | |
| { | |
| "epoch": 6.355086119998247, | |
| "eval_loss": 2.2094504833221436, | |
| "eval_runtime": 1119.5542, | |
| "eval_samples_per_second": 814.878, | |
| "eval_steps_per_second": 6.367, | |
| "step": 72500 | |
| }, | |
| { | |
| "epoch": 6.398913091116273, | |
| "grad_norm": 2.3042914867401123, | |
| "learning_rate": 8.876624057066015e-06, | |
| "loss": 2.3469, | |
| "step": 73000 | |
| }, | |
| { | |
| "epoch": 6.398913091116273, | |
| "eval_loss": 2.2069456577301025, | |
| "eval_runtime": 1118.0622, | |
| "eval_samples_per_second": 815.965, | |
| "eval_steps_per_second": 6.375, | |
| "step": 73000 | |
| }, | |
| { | |
| "epoch": 6.442740062234299, | |
| "grad_norm": 2.4782769680023193, | |
| "learning_rate": 8.555277521275629e-06, | |
| "loss": 2.3522, | |
| "step": 73500 | |
| }, | |
| { | |
| "epoch": 6.442740062234299, | |
| "eval_loss": 2.205556631088257, | |
| "eval_runtime": 1112.4728, | |
| "eval_samples_per_second": 820.065, | |
| "eval_steps_per_second": 6.407, | |
| "step": 73500 | |
| }, | |
| { | |
| "epoch": 6.486567033352325, | |
| "grad_norm": 2.408228874206543, | |
| "learning_rate": 8.23865052582049e-06, | |
| "loss": 2.3458, | |
| "step": 74000 | |
| }, | |
| { | |
| "epoch": 6.486567033352325, | |
| "eval_loss": 2.203964948654175, | |
| "eval_runtime": 1112.4771, | |
| "eval_samples_per_second": 820.062, | |
| "eval_steps_per_second": 6.407, | |
| "step": 74000 | |
| }, | |
| { | |
| "epoch": 6.530394004470351, | |
| "grad_norm": 2.472689390182495, | |
| "learning_rate": 7.926833940818856e-06, | |
| "loss": 2.3436, | |
| "step": 74500 | |
| }, | |
| { | |
| "epoch": 6.530394004470351, | |
| "eval_loss": 2.2009198665618896, | |
| "eval_runtime": 1112.7482, | |
| "eval_samples_per_second": 819.862, | |
| "eval_steps_per_second": 6.406, | |
| "step": 74500 | |
| }, | |
| { | |
| "epoch": 6.574220975588377, | |
| "grad_norm": 2.4618117809295654, | |
| "learning_rate": 7.6205261403159065e-06, | |
| "loss": 2.3424, | |
| "step": 75000 | |
| }, | |
| { | |
| "epoch": 6.574220975588377, | |
| "eval_loss": 2.2018818855285645, | |
| "eval_runtime": 1113.2997, | |
| "eval_samples_per_second": 819.456, | |
| "eval_steps_per_second": 6.403, | |
| "step": 75000 | |
| }, | |
| { | |
| "epoch": 6.618047946706403, | |
| "grad_norm": 2.51564621925354, | |
| "learning_rate": 7.318587375726538e-06, | |
| "loss": 2.343, | |
| "step": 75500 | |
| }, | |
| { | |
| "epoch": 6.618047946706403, | |
| "eval_loss": 2.196281909942627, | |
| "eval_runtime": 1113.37, | |
| "eval_samples_per_second": 819.404, | |
| "eval_steps_per_second": 6.402, | |
| "step": 75500 | |
| }, | |
| { | |
| "epoch": 6.661874917824429, | |
| "grad_norm": 2.3265905380249023, | |
| "learning_rate": 7.021723074398725e-06, | |
| "loss": 2.3383, | |
| "step": 76000 | |
| }, | |
| { | |
| "epoch": 6.661874917824429, | |
| "eval_loss": 2.197392225265503, | |
| "eval_runtime": 1113.4662, | |
| "eval_samples_per_second": 819.333, | |
| "eval_steps_per_second": 6.402, | |
| "step": 76000 | |
| }, | |
| { | |
| "epoch": 6.705701888942455, | |
| "grad_norm": 2.500836133956909, | |
| "learning_rate": 6.730018434671659e-06, | |
| "loss": 2.3442, | |
| "step": 76500 | |
| }, | |
| { | |
| "epoch": 6.705701888942455, | |
| "eval_loss": 2.1948647499084473, | |
| "eval_runtime": 1114.1466, | |
| "eval_samples_per_second": 818.833, | |
| "eval_steps_per_second": 6.398, | |
| "step": 76500 | |
| }, | |
| { | |
| "epoch": 6.749528860060481, | |
| "grad_norm": 2.4531776905059814, | |
| "learning_rate": 6.444124808823204e-06, | |
| "loss": 2.3343, | |
| "step": 77000 | |
| }, | |
| { | |
| "epoch": 6.749528860060481, | |
| "eval_loss": 2.1950042247772217, | |
| "eval_runtime": 1114.1483, | |
| "eval_samples_per_second": 818.832, | |
| "eval_steps_per_second": 6.398, | |
| "step": 77000 | |
| }, | |
| { | |
| "epoch": 6.793355831178507, | |
| "grad_norm": 2.488192081451416, | |
| "learning_rate": 6.162978407896589e-06, | |
| "loss": 2.3428, | |
| "step": 77500 | |
| }, | |
| { | |
| "epoch": 6.793355831178507, | |
| "eval_loss": 2.191720962524414, | |
| "eval_runtime": 1114.2187, | |
| "eval_samples_per_second": 818.78, | |
| "eval_steps_per_second": 6.397, | |
| "step": 77500 | |
| }, | |
| { | |
| "epoch": 6.8371828022965335, | |
| "grad_norm": 2.629721164703369, | |
| "learning_rate": 5.887238123328259e-06, | |
| "loss": 2.335, | |
| "step": 78000 | |
| }, | |
| { | |
| "epoch": 6.8371828022965335, | |
| "eval_loss": 2.190831184387207, | |
| "eval_runtime": 1114.1658, | |
| "eval_samples_per_second": 818.819, | |
| "eval_steps_per_second": 6.398, | |
| "step": 78000 | |
| }, | |
| { | |
| "epoch": 6.88100977341456, | |
| "grad_norm": 2.388756513595581, | |
| "learning_rate": 5.616983090986713e-06, | |
| "loss": 2.3394, | |
| "step": 78500 | |
| }, | |
| { | |
| "epoch": 6.88100977341456, | |
| "eval_loss": 2.1897459030151367, | |
| "eval_runtime": 1113.866, | |
| "eval_samples_per_second": 819.039, | |
| "eval_steps_per_second": 6.399, | |
| "step": 78500 | |
| }, | |
| { | |
| "epoch": 6.924836744532586, | |
| "grad_norm": 2.546407461166382, | |
| "learning_rate": 5.352814654493821e-06, | |
| "loss": 2.3341, | |
| "step": 79000 | |
| }, | |
| { | |
| "epoch": 6.924836744532586, | |
| "eval_loss": 2.1880617141723633, | |
| "eval_runtime": 1114.3622, | |
| "eval_samples_per_second": 818.675, | |
| "eval_steps_per_second": 6.396, | |
| "step": 79000 | |
| }, | |
| { | |
| "epoch": 6.968663715650611, | |
| "grad_norm": 2.6898553371429443, | |
| "learning_rate": 5.093749862709529e-06, | |
| "loss": 2.3397, | |
| "step": 79500 | |
| }, | |
| { | |
| "epoch": 6.968663715650611, | |
| "eval_loss": 2.1861698627471924, | |
| "eval_runtime": 1113.9872, | |
| "eval_samples_per_second": 818.95, | |
| "eval_steps_per_second": 6.399, | |
| "step": 79500 | |
| }, | |
| { | |
| "epoch": 7.012446859797519, | |
| "grad_norm": 2.592198610305786, | |
| "learning_rate": 4.840398049698097e-06, | |
| "loss": 2.3213, | |
| "step": 80000 | |
| }, | |
| { | |
| "epoch": 7.012446859797519, | |
| "eval_loss": 2.1867756843566895, | |
| "eval_runtime": 1114.245, | |
| "eval_samples_per_second": 818.761, | |
| "eval_steps_per_second": 6.397, | |
| "step": 80000 | |
| }, | |
| { | |
| "epoch": 7.056273830915545, | |
| "grad_norm": 2.305933713912964, | |
| "learning_rate": 4.592831925966015e-06, | |
| "loss": 2.3311, | |
| "step": 80500 | |
| }, | |
| { | |
| "epoch": 7.056273830915545, | |
| "eval_loss": 2.1855616569519043, | |
| "eval_runtime": 1114.1605, | |
| "eval_samples_per_second": 818.823, | |
| "eval_steps_per_second": 6.398, | |
| "step": 80500 | |
| }, | |
| { | |
| "epoch": 7.100100802033571, | |
| "grad_norm": 2.3767688274383545, | |
| "learning_rate": 4.351600068913997e-06, | |
| "loss": 2.3216, | |
| "step": 81000 | |
| }, | |
| { | |
| "epoch": 7.100100802033571, | |
| "eval_loss": 2.18585205078125, | |
| "eval_runtime": 1114.2108, | |
| "eval_samples_per_second": 818.786, | |
| "eval_steps_per_second": 6.397, | |
| "step": 81000 | |
| }, | |
| { | |
| "epoch": 7.1439277731515975, | |
| "grad_norm": 2.4296772480010986, | |
| "learning_rate": 4.115804872711229e-06, | |
| "loss": 2.3258, | |
| "step": 81500 | |
| }, | |
| { | |
| "epoch": 7.1439277731515975, | |
| "eval_loss": 2.1833810806274414, | |
| "eval_runtime": 1114.2167, | |
| "eval_samples_per_second": 818.781, | |
| "eval_steps_per_second": 6.397, | |
| "step": 81500 | |
| }, | |
| { | |
| "epoch": 7.187754744269624, | |
| "grad_norm": 2.158872127532959, | |
| "learning_rate": 3.886003319842971e-06, | |
| "loss": 2.3257, | |
| "step": 82000 | |
| }, | |
| { | |
| "epoch": 7.187754744269624, | |
| "eval_loss": 2.1819121837615967, | |
| "eval_runtime": 1115.9623, | |
| "eval_samples_per_second": 817.501, | |
| "eval_steps_per_second": 6.387, | |
| "step": 82000 | |
| }, | |
| { | |
| "epoch": 7.23158171538765, | |
| "grad_norm": 2.458834648132324, | |
| "learning_rate": 3.6622613620271253e-06, | |
| "loss": 2.3199, | |
| "step": 82500 | |
| }, | |
| { | |
| "epoch": 7.23158171538765, | |
| "eval_loss": 2.183306932449341, | |
| "eval_runtime": 1114.8267, | |
| "eval_samples_per_second": 818.333, | |
| "eval_steps_per_second": 6.394, | |
| "step": 82500 | |
| }, | |
| { | |
| "epoch": 7.275408686505676, | |
| "grad_norm": 2.311922788619995, | |
| "learning_rate": 3.444643211912821e-06, | |
| "loss": 2.3251, | |
| "step": 83000 | |
| }, | |
| { | |
| "epoch": 7.275408686505676, | |
| "eval_loss": 2.1810803413391113, | |
| "eval_runtime": 1114.2828, | |
| "eval_samples_per_second": 818.733, | |
| "eval_steps_per_second": 6.397, | |
| "step": 83000 | |
| }, | |
| { | |
| "epoch": 7.319235657623702, | |
| "grad_norm": 2.43715238571167, | |
| "learning_rate": 3.233627973906725e-06, | |
| "loss": 2.3247, | |
| "step": 83500 | |
| }, | |
| { | |
| "epoch": 7.319235657623702, | |
| "eval_loss": 2.178840160369873, | |
| "eval_runtime": 1114.5518, | |
| "eval_samples_per_second": 818.535, | |
| "eval_steps_per_second": 6.395, | |
| "step": 83500 | |
| }, | |
| { | |
| "epoch": 7.363062628741727, | |
| "grad_norm": 2.3885252475738525, | |
| "learning_rate": 3.028430475974181e-06, | |
| "loss": 2.3207, | |
| "step": 84000 | |
| }, | |
| { | |
| "epoch": 7.363062628741727, | |
| "eval_loss": 2.1783220767974854, | |
| "eval_runtime": 1117.3767, | |
| "eval_samples_per_second": 816.466, | |
| "eval_steps_per_second": 6.379, | |
| "step": 84000 | |
| }, | |
| { | |
| "epoch": 7.4068895998597535, | |
| "grad_norm": 2.357344388961792, | |
| "learning_rate": 2.829538691545261e-06, | |
| "loss": 2.3156, | |
| "step": 84500 | |
| }, | |
| { | |
| "epoch": 7.4068895998597535, | |
| "eval_loss": 2.1777966022491455, | |
| "eval_runtime": 1123.0806, | |
| "eval_samples_per_second": 812.319, | |
| "eval_steps_per_second": 6.347, | |
| "step": 84500 | |
| }, | |
| { | |
| "epoch": 7.45071657097778, | |
| "grad_norm": 2.44062876701355, | |
| "learning_rate": 2.6370097014129153e-06, | |
| "loss": 2.3172, | |
| "step": 85000 | |
| }, | |
| { | |
| "epoch": 7.45071657097778, | |
| "eval_loss": 2.1768882274627686, | |
| "eval_runtime": 1117.6985, | |
| "eval_samples_per_second": 816.231, | |
| "eval_steps_per_second": 6.377, | |
| "step": 85000 | |
| }, | |
| { | |
| "epoch": 7.494543542095806, | |
| "grad_norm": 2.4813036918640137, | |
| "learning_rate": 2.4512645411442605e-06, | |
| "loss": 2.3209, | |
| "step": 85500 | |
| }, | |
| { | |
| "epoch": 7.494543542095806, | |
| "eval_loss": 2.1777381896972656, | |
| "eval_runtime": 1118.4824, | |
| "eval_samples_per_second": 815.659, | |
| "eval_steps_per_second": 6.373, | |
| "step": 85500 | |
| }, | |
| { | |
| "epoch": 7.538370513213832, | |
| "grad_norm": 2.700749635696411, | |
| "learning_rate": 2.271612066787826e-06, | |
| "loss": 2.3106, | |
| "step": 86000 | |
| }, | |
| { | |
| "epoch": 7.538370513213832, | |
| "eval_loss": 2.1763668060302734, | |
| "eval_runtime": 1117.7333, | |
| "eval_samples_per_second": 816.205, | |
| "eval_steps_per_second": 6.377, | |
| "step": 86000 | |
| }, | |
| { | |
| "epoch": 7.582197484331858, | |
| "grad_norm": 2.373656749725342, | |
| "learning_rate": 2.0984825084456316e-06, | |
| "loss": 2.3174, | |
| "step": 86500 | |
| }, | |
| { | |
| "epoch": 7.582197484331858, | |
| "eval_loss": 2.1764698028564453, | |
| "eval_runtime": 1117.9749, | |
| "eval_samples_per_second": 816.029, | |
| "eval_steps_per_second": 6.376, | |
| "step": 86500 | |
| }, | |
| { | |
| "epoch": 7.626024455449884, | |
| "grad_norm": 2.449230194091797, | |
| "learning_rate": 1.931925553300576e-06, | |
| "loss": 2.313, | |
| "step": 87000 | |
| }, | |
| { | |
| "epoch": 7.626024455449884, | |
| "eval_loss": 2.17521595954895, | |
| "eval_runtime": 1117.4736, | |
| "eval_samples_per_second": 816.395, | |
| "eval_steps_per_second": 6.379, | |
| "step": 87000 | |
| }, | |
| { | |
| "epoch": 7.669851426567909, | |
| "grad_norm": 2.364248275756836, | |
| "learning_rate": 1.7723022373487774e-06, | |
| "loss": 2.314, | |
| "step": 87500 | |
| }, | |
| { | |
| "epoch": 7.669851426567909, | |
| "eval_loss": 2.1753010749816895, | |
| "eval_runtime": 1118.1437, | |
| "eval_samples_per_second": 815.906, | |
| "eval_steps_per_second": 6.375, | |
| "step": 87500 | |
| }, | |
| { | |
| "epoch": 7.7136783976859356, | |
| "grad_norm": 2.205310344696045, | |
| "learning_rate": 1.6190186140821656e-06, | |
| "loss": 2.3185, | |
| "step": 88000 | |
| }, | |
| { | |
| "epoch": 7.7136783976859356, | |
| "eval_loss": 2.174024820327759, | |
| "eval_runtime": 1118.3337, | |
| "eval_samples_per_second": 815.767, | |
| "eval_steps_per_second": 6.374, | |
| "step": 88000 | |
| }, | |
| { | |
| "epoch": 7.757505368803962, | |
| "grad_norm": 2.3702187538146973, | |
| "learning_rate": 1.472445197380079e-06, | |
| "loss": 2.3143, | |
| "step": 88500 | |
| }, | |
| { | |
| "epoch": 7.757505368803962, | |
| "eval_loss": 2.1744604110717773, | |
| "eval_runtime": 1118.5051, | |
| "eval_samples_per_second": 815.642, | |
| "eval_steps_per_second": 6.373, | |
| "step": 88500 | |
| }, | |
| { | |
| "epoch": 7.801332339921988, | |
| "grad_norm": 2.457601547241211, | |
| "learning_rate": 1.3326240529662303e-06, | |
| "loss": 2.3138, | |
| "step": 89000 | |
| }, | |
| { | |
| "epoch": 7.801332339921988, | |
| "eval_loss": 2.1727075576782227, | |
| "eval_runtime": 1118.3695, | |
| "eval_samples_per_second": 815.741, | |
| "eval_steps_per_second": 6.374, | |
| "step": 89000 | |
| }, | |
| { | |
| "epoch": 7.845159311040014, | |
| "grad_norm": 2.4939231872558594, | |
| "learning_rate": 1.1998545616726697e-06, | |
| "loss": 2.3193, | |
| "step": 89500 | |
| }, | |
| { | |
| "epoch": 7.845159311040014, | |
| "eval_loss": 2.172689437866211, | |
| "eval_runtime": 1118.2879, | |
| "eval_samples_per_second": 815.801, | |
| "eval_steps_per_second": 6.374, | |
| "step": 89500 | |
| }, | |
| { | |
| "epoch": 7.88898628215804, | |
| "grad_norm": 2.6024014949798584, | |
| "learning_rate": 1.0736426980792303e-06, | |
| "loss": 2.3165, | |
| "step": 90000 | |
| }, | |
| { | |
| "epoch": 7.88898628215804, | |
| "eval_loss": 2.172903537750244, | |
| "eval_runtime": 1118.4656, | |
| "eval_samples_per_second": 815.671, | |
| "eval_steps_per_second": 6.373, | |
| "step": 90000 | |
| }, | |
| { | |
| "epoch": 7.932813253276066, | |
| "grad_norm": 2.3985230922698975, | |
| "learning_rate": 9.54297560787079e-07, | |
| "loss": 2.3182, | |
| "step": 90500 | |
| }, | |
| { | |
| "epoch": 7.932813253276066, | |
| "eval_loss": 2.1716508865356445, | |
| "eval_runtime": 1118.3555, | |
| "eval_samples_per_second": 815.751, | |
| "eval_steps_per_second": 6.374, | |
| "step": 90500 | |
| }, | |
| { | |
| "epoch": 7.976640224394092, | |
| "grad_norm": 2.4502456188201904, | |
| "learning_rate": 8.418534011610524e-07, | |
| "loss": 2.3178, | |
| "step": 91000 | |
| }, | |
| { | |
| "epoch": 7.976640224394092, | |
| "eval_loss": 2.172135829925537, | |
| "eval_runtime": 1118.3622, | |
| "eval_samples_per_second": 815.746, | |
| "eval_steps_per_second": 6.374, | |
| "step": 91000 | |
| }, | |
| { | |
| "epoch": 8.020423368541, | |
| "grad_norm": 2.4215595722198486, | |
| "learning_rate": 7.365465720065356e-07, | |
| "loss": 2.3127, | |
| "step": 91500 | |
| }, | |
| { | |
| "epoch": 8.020423368541, | |
| "eval_loss": 2.1727616786956787, | |
| "eval_runtime": 1115.4247, | |
| "eval_samples_per_second": 817.895, | |
| "eval_steps_per_second": 6.39, | |
| "step": 91500 | |
| }, | |
| { | |
| "epoch": 8.064250339659026, | |
| "grad_norm": 2.358971357345581, | |
| "learning_rate": 6.379852344303245e-07, | |
| "loss": 2.3145, | |
| "step": 92000 | |
| }, | |
| { | |
| "epoch": 8.064250339659026, | |
| "eval_loss": 2.1719257831573486, | |
| "eval_runtime": 1114.9532, | |
| "eval_samples_per_second": 818.241, | |
| "eval_steps_per_second": 6.393, | |
| "step": 92000 | |
| }, | |
| { | |
| "epoch": 8.108077310777052, | |
| "grad_norm": 2.3747315406799316, | |
| "learning_rate": 5.46415654330279e-07, | |
| "loss": 2.3069, | |
| "step": 92500 | |
| }, | |
| { | |
| "epoch": 8.108077310777052, | |
| "eval_loss": 2.171802043914795, | |
| "eval_runtime": 1115.5499, | |
| "eval_samples_per_second": 817.803, | |
| "eval_steps_per_second": 6.39, | |
| "step": 92500 | |
| }, | |
| { | |
| "epoch": 8.151904281895078, | |
| "grad_norm": 2.4205031394958496, | |
| "learning_rate": 4.6186411164680645e-07, | |
| "loss": 2.3099, | |
| "step": 93000 | |
| }, | |
| { | |
| "epoch": 8.151904281895078, | |
| "eval_loss": 2.172088146209717, | |
| "eval_runtime": 1115.2118, | |
| "eval_samples_per_second": 818.051, | |
| "eval_steps_per_second": 6.392, | |
| "step": 93000 | |
| }, | |
| { | |
| "epoch": 8.195731253013104, | |
| "grad_norm": 2.3196699619293213, | |
| "learning_rate": 3.84502847321927e-07, | |
| "loss": 2.311, | |
| "step": 93500 | |
| }, | |
| { | |
| "epoch": 8.195731253013104, | |
| "eval_loss": 2.171304941177368, | |
| "eval_runtime": 1115.3282, | |
| "eval_samples_per_second": 817.965, | |
| "eval_steps_per_second": 6.391, | |
| "step": 93500 | |
| }, | |
| { | |
| "epoch": 8.23955822413113, | |
| "grad_norm": 2.2472469806671143, | |
| "learning_rate": 3.1404400583445736e-07, | |
| "loss": 2.3143, | |
| "step": 94000 | |
| }, | |
| { | |
| "epoch": 8.23955822413113, | |
| "eval_loss": 2.1706063747406006, | |
| "eval_runtime": 1114.8722, | |
| "eval_samples_per_second": 818.3, | |
| "eval_steps_per_second": 6.394, | |
| "step": 94000 | |
| }, | |
| { | |
| "epoch": 8.283385195249156, | |
| "grad_norm": 2.6286418437957764, | |
| "learning_rate": 2.5066989108405715e-07, | |
| "loss": 2.3162, | |
| "step": 94500 | |
| }, | |
| { | |
| "epoch": 8.283385195249156, | |
| "eval_loss": 2.1710445880889893, | |
| "eval_runtime": 1116.0067, | |
| "eval_samples_per_second": 817.468, | |
| "eval_steps_per_second": 6.387, | |
| "step": 94500 | |
| }, | |
| { | |
| "epoch": 8.327212166367183, | |
| "grad_norm": 2.4226999282836914, | |
| "learning_rate": 1.943986910754897e-07, | |
| "loss": 2.3085, | |
| "step": 95000 | |
| }, | |
| { | |
| "epoch": 8.327212166367183, | |
| "eval_loss": 2.1697933673858643, | |
| "eval_runtime": 1115.2712, | |
| "eval_samples_per_second": 818.007, | |
| "eval_steps_per_second": 6.391, | |
| "step": 95000 | |
| }, | |
| { | |
| "epoch": 8.371039137485209, | |
| "grad_norm": 2.3095433712005615, | |
| "learning_rate": 1.453377450467558e-07, | |
| "loss": 2.3091, | |
| "step": 95500 | |
| }, | |
| { | |
| "epoch": 8.371039137485209, | |
| "eval_loss": 2.170691728591919, | |
| "eval_runtime": 1115.2973, | |
| "eval_samples_per_second": 817.988, | |
| "eval_steps_per_second": 6.391, | |
| "step": 95500 | |
| }, | |
| { | |
| "epoch": 8.414866108603235, | |
| "grad_norm": 2.637993335723877, | |
| "learning_rate": 1.0330450086001587e-07, | |
| "loss": 2.3062, | |
| "step": 96000 | |
| }, | |
| { | |
| "epoch": 8.414866108603235, | |
| "eval_loss": 2.170945882797241, | |
| "eval_runtime": 1114.8255, | |
| "eval_samples_per_second": 818.334, | |
| "eval_steps_per_second": 6.394, | |
| "step": 96000 | |
| }, | |
| { | |
| "epoch": 8.458693079721261, | |
| "grad_norm": 2.3570830821990967, | |
| "learning_rate": 6.841646443063732e-08, | |
| "loss": 2.3159, | |
| "step": 96500 | |
| }, | |
| { | |
| "epoch": 8.458693079721261, | |
| "eval_loss": 2.171571969985962, | |
| "eval_runtime": 1115.0312, | |
| "eval_samples_per_second": 818.183, | |
| "eval_steps_per_second": 6.393, | |
| "step": 96500 | |
| }, | |
| { | |
| "epoch": 8.502520050839287, | |
| "grad_norm": 2.5434176921844482, | |
| "learning_rate": 4.068364842349792e-08, | |
| "loss": 2.3096, | |
| "step": 97000 | |
| }, | |
| { | |
| "epoch": 8.502520050839287, | |
| "eval_loss": 2.171351194381714, | |
| "eval_runtime": 1115.2049, | |
| "eval_samples_per_second": 818.056, | |
| "eval_steps_per_second": 6.392, | |
| "step": 97000 | |
| }, | |
| { | |
| "epoch": 8.546347021957313, | |
| "grad_norm": 2.5126280784606934, | |
| "learning_rate": 2.0147998149930293e-08, | |
| "loss": 2.3079, | |
| "step": 97500 | |
| }, | |
| { | |
| "epoch": 8.546347021957313, | |
| "eval_loss": 2.171030282974243, | |
| "eval_runtime": 1115.7419, | |
| "eval_samples_per_second": 817.662, | |
| "eval_steps_per_second": 6.389, | |
| "step": 97500 | |
| }, | |
| { | |
| "epoch": 8.59017399307534, | |
| "grad_norm": 2.4063174724578857, | |
| "learning_rate": 6.733101979849999e-09, | |
| "loss": 2.3082, | |
| "step": 98000 | |
| }, | |
| { | |
| "epoch": 8.59017399307534, | |
| "eval_loss": 2.1707358360290527, | |
| "eval_runtime": 1114.2074, | |
| "eval_samples_per_second": 818.788, | |
| "eval_steps_per_second": 6.397, | |
| "step": 98000 | |
| }, | |
| { | |
| "epoch": 8.634000964193365, | |
| "grad_norm": 2.511075735092163, | |
| "learning_rate": 4.91129000629309e-10, | |
| "loss": 2.3096, | |
| "step": 98500 | |
| }, | |
| { | |
| "epoch": 8.634000964193365, | |
| "eval_loss": 2.1694393157958984, | |
| "eval_runtime": 1114.2428, | |
| "eval_samples_per_second": 818.762, | |
| "eval_steps_per_second": 6.397, | |
| "step": 98500 | |
| }, | |
| { | |
| "epoch": 8.677389665600211, | |
| "grad_norm": 2.3884670734405518, | |
| "learning_rate": 4.173116663065885e-06, | |
| "loss": 2.3037, | |
| "step": 99000 | |
| }, | |
| { | |
| "epoch": 8.677389665600211, | |
| "eval_loss": 2.1731722354888916, | |
| "eval_runtime": 1110.3507, | |
| "eval_samples_per_second": 821.632, | |
| "eval_steps_per_second": 6.42, | |
| "step": 99000 | |
| }, | |
| { | |
| "epoch": 8.721216636718236, | |
| "grad_norm": 2.4506683349609375, | |
| "learning_rate": 3.982943694698685e-06, | |
| "loss": 2.3118, | |
| "step": 99500 | |
| }, | |
| { | |
| "epoch": 8.721216636718236, | |
| "eval_loss": 2.1729063987731934, | |
| "eval_runtime": 1118.1795, | |
| "eval_samples_per_second": 815.88, | |
| "eval_steps_per_second": 6.375, | |
| "step": 99500 | |
| }, | |
| { | |
| "epoch": 8.765043607836262, | |
| "grad_norm": 2.4486277103424072, | |
| "learning_rate": 3.7964611189707232e-06, | |
| "loss": 2.3173, | |
| "step": 100000 | |
| }, | |
| { | |
| "epoch": 8.765043607836262, | |
| "eval_loss": 2.1726784706115723, | |
| "eval_runtime": 1115.9142, | |
| "eval_samples_per_second": 817.536, | |
| "eval_steps_per_second": 6.388, | |
| "step": 100000 | |
| }, | |
| { | |
| "epoch": 8.808870578954288, | |
| "grad_norm": 2.706360101699829, | |
| "learning_rate": 3.6140902571372566e-06, | |
| "loss": 2.3151, | |
| "step": 100500 | |
| }, | |
| { | |
| "epoch": 8.808870578954288, | |
| "eval_loss": 2.1703412532806396, | |
| "eval_runtime": 1115.5437, | |
| "eval_samples_per_second": 817.807, | |
| "eval_steps_per_second": 6.39, | |
| "step": 100500 | |
| }, | |
| { | |
| "epoch": 8.852697550072314, | |
| "grad_norm": 2.563002824783325, | |
| "learning_rate": 3.4358664738989826e-06, | |
| "loss": 2.3156, | |
| "step": 101000 | |
| }, | |
| { | |
| "epoch": 8.852697550072314, | |
| "eval_loss": 2.1706130504608154, | |
| "eval_runtime": 1116.8512, | |
| "eval_samples_per_second": 816.85, | |
| "eval_steps_per_second": 6.382, | |
| "step": 101000 | |
| }, | |
| { | |
| "epoch": 8.89652452119034, | |
| "grad_norm": 2.505505084991455, | |
| "learning_rate": 3.2621682182145314e-06, | |
| "loss": 2.3138, | |
| "step": 101500 | |
| }, | |
| { | |
| "epoch": 8.89652452119034, | |
| "eval_loss": 2.1691839694976807, | |
| "eval_runtime": 1115.2901, | |
| "eval_samples_per_second": 817.993, | |
| "eval_steps_per_second": 6.391, | |
| "step": 101500 | |
| }, | |
| { | |
| "epoch": 8.940351492308366, | |
| "grad_norm": 2.6076018810272217, | |
| "learning_rate": 3.092332998903416e-06, | |
| "loss": 2.3075, | |
| "step": 102000 | |
| }, | |
| { | |
| "epoch": 8.940351492308366, | |
| "eval_loss": 2.1688640117645264, | |
| "eval_runtime": 1116.0259, | |
| "eval_samples_per_second": 817.454, | |
| "eval_steps_per_second": 6.387, | |
| "step": 102000 | |
| }, | |
| { | |
| "epoch": 8.984178463426392, | |
| "grad_norm": 2.394963502883911, | |
| "learning_rate": 2.92674603547588e-06, | |
| "loss": 2.3094, | |
| "step": 102500 | |
| }, | |
| { | |
| "epoch": 8.984178463426392, | |
| "eval_loss": 2.167738914489746, | |
| "eval_runtime": 1117.6939, | |
| "eval_samples_per_second": 816.234, | |
| "eval_steps_per_second": 6.377, | |
| "step": 102500 | |
| }, | |
| { | |
| "epoch": 9.027961607573301, | |
| "grad_norm": 2.570017099380493, | |
| "learning_rate": 2.765439437959516e-06, | |
| "loss": 2.3093, | |
| "step": 103000 | |
| }, | |
| { | |
| "epoch": 9.027961607573301, | |
| "eval_loss": 2.167351007461548, | |
| "eval_runtime": 1115.1044, | |
| "eval_samples_per_second": 818.13, | |
| "eval_steps_per_second": 6.392, | |
| "step": 103000 | |
| }, | |
| { | |
| "epoch": 9.071788578691327, | |
| "grad_norm": 2.3768527507781982, | |
| "learning_rate": 2.6087541528544814e-06, | |
| "loss": 2.3085, | |
| "step": 103500 | |
| }, | |
| { | |
| "epoch": 9.071788578691327, | |
| "eval_loss": 2.1665375232696533, | |
| "eval_runtime": 1115.0572, | |
| "eval_samples_per_second": 818.164, | |
| "eval_steps_per_second": 6.392, | |
| "step": 103500 | |
| }, | |
| { | |
| "epoch": 9.115615549809352, | |
| "grad_norm": 2.432450294494629, | |
| "learning_rate": 2.456092577040997e-06, | |
| "loss": 2.3129, | |
| "step": 104000 | |
| }, | |
| { | |
| "epoch": 9.115615549809352, | |
| "eval_loss": 2.166337490081787, | |
| "eval_runtime": 1114.9098, | |
| "eval_samples_per_second": 818.272, | |
| "eval_steps_per_second": 6.393, | |
| "step": 104000 | |
| }, | |
| { | |
| "epoch": 9.159442520927378, | |
| "grad_norm": 2.5620574951171875, | |
| "learning_rate": 2.307802634562267e-06, | |
| "loss": 2.301, | |
| "step": 104500 | |
| }, | |
| { | |
| "epoch": 9.159442520927378, | |
| "eval_loss": 2.164973258972168, | |
| "eval_runtime": 1114.9958, | |
| "eval_samples_per_second": 818.209, | |
| "eval_steps_per_second": 6.393, | |
| "step": 104500 | |
| }, | |
| { | |
| "epoch": 9.203269492045404, | |
| "grad_norm": 2.387254238128662, | |
| "learning_rate": 2.163913081269864e-06, | |
| "loss": 2.305, | |
| "step": 105000 | |
| }, | |
| { | |
| "epoch": 9.203269492045404, | |
| "eval_loss": 2.1658222675323486, | |
| "eval_runtime": 1114.9499, | |
| "eval_samples_per_second": 818.243, | |
| "eval_steps_per_second": 6.393, | |
| "step": 105000 | |
| }, | |
| { | |
| "epoch": 9.24709646316343, | |
| "grad_norm": 2.389944553375244, | |
| "learning_rate": 2.0247263046770465e-06, | |
| "loss": 2.304, | |
| "step": 105500 | |
| }, | |
| { | |
| "epoch": 9.24709646316343, | |
| "eval_loss": 2.1642627716064453, | |
| "eval_runtime": 1115.1438, | |
| "eval_samples_per_second": 818.101, | |
| "eval_steps_per_second": 6.392, | |
| "step": 105500 | |
| }, | |
| { | |
| "epoch": 9.290923434281456, | |
| "grad_norm": 2.293623924255371, | |
| "learning_rate": 1.8897114415833084e-06, | |
| "loss": 2.3042, | |
| "step": 106000 | |
| }, | |
| { | |
| "epoch": 9.290923434281456, | |
| "eval_loss": 2.1653385162353516, | |
| "eval_runtime": 1115.2546, | |
| "eval_samples_per_second": 818.019, | |
| "eval_steps_per_second": 6.391, | |
| "step": 106000 | |
| }, | |
| { | |
| "epoch": 9.334750405399483, | |
| "grad_norm": 2.4690089225769043, | |
| "learning_rate": 1.7594346197419676e-06, | |
| "loss": 2.3025, | |
| "step": 106500 | |
| }, | |
| { | |
| "epoch": 9.334750405399483, | |
| "eval_loss": 2.1647329330444336, | |
| "eval_runtime": 1114.9105, | |
| "eval_samples_per_second": 818.272, | |
| "eval_steps_per_second": 6.393, | |
| "step": 106500 | |
| }, | |
| { | |
| "epoch": 9.378577376517509, | |
| "grad_norm": 2.4114248752593994, | |
| "learning_rate": 1.6333989588294241e-06, | |
| "loss": 2.3024, | |
| "step": 107000 | |
| }, | |
| { | |
| "epoch": 9.378577376517509, | |
| "eval_loss": 2.16414737701416, | |
| "eval_runtime": 1116.7856, | |
| "eval_samples_per_second": 816.898, | |
| "eval_steps_per_second": 6.383, | |
| "step": 107000 | |
| }, | |
| { | |
| "epoch": 9.422404347635535, | |
| "grad_norm": 2.6006863117218018, | |
| "learning_rate": 1.5118944650351159e-06, | |
| "loss": 2.3087, | |
| "step": 107500 | |
| }, | |
| { | |
| "epoch": 9.422404347635535, | |
| "eval_loss": 2.1635189056396484, | |
| "eval_runtime": 1114.9278, | |
| "eval_samples_per_second": 818.259, | |
| "eval_steps_per_second": 6.393, | |
| "step": 107500 | |
| }, | |
| { | |
| "epoch": 9.466231318753561, | |
| "grad_norm": 2.226339340209961, | |
| "learning_rate": 1.3949447000728782e-06, | |
| "loss": 2.3026, | |
| "step": 108000 | |
| }, | |
| { | |
| "epoch": 9.466231318753561, | |
| "eval_loss": 2.1628293991088867, | |
| "eval_runtime": 1115.569, | |
| "eval_samples_per_second": 817.789, | |
| "eval_steps_per_second": 6.39, | |
| "step": 108000 | |
| }, | |
| { | |
| "epoch": 9.510058289871587, | |
| "grad_norm": 2.69002628326416, | |
| "learning_rate": 1.2825723424199298e-06, | |
| "loss": 2.2984, | |
| "step": 108500 | |
| }, | |
| { | |
| "epoch": 9.510058289871587, | |
| "eval_loss": 2.163651466369629, | |
| "eval_runtime": 1115.1272, | |
| "eval_samples_per_second": 818.113, | |
| "eval_steps_per_second": 6.392, | |
| "step": 108500 | |
| }, | |
| { | |
| "epoch": 9.553885260989613, | |
| "grad_norm": 2.3326609134674072, | |
| "learning_rate": 1.1750101251986112e-06, | |
| "loss": 2.3027, | |
| "step": 109000 | |
| }, | |
| { | |
| "epoch": 9.553885260989613, | |
| "eval_loss": 2.163642168045044, | |
| "eval_runtime": 1114.6312, | |
| "eval_samples_per_second": 818.477, | |
| "eval_steps_per_second": 6.395, | |
| "step": 109000 | |
| }, | |
| { | |
| "epoch": 9.59771223210764, | |
| "grad_norm": 2.569121837615967, | |
| "learning_rate": 1.0718478023763245e-06, | |
| "loss": 2.3049, | |
| "step": 109500 | |
| }, | |
| { | |
| "epoch": 9.59771223210764, | |
| "eval_loss": 2.1620688438415527, | |
| "eval_runtime": 1114.7646, | |
| "eval_samples_per_second": 818.379, | |
| "eval_steps_per_second": 6.394, | |
| "step": 109500 | |
| }, | |
| { | |
| "epoch": 9.641539203225665, | |
| "grad_norm": 2.3418686389923096, | |
| "learning_rate": 9.733255406500857e-07, | |
| "loss": 2.3032, | |
| "step": 110000 | |
| }, | |
| { | |
| "epoch": 9.641539203225665, | |
| "eval_loss": 2.1615049839019775, | |
| "eval_runtime": 1114.9932, | |
| "eval_samples_per_second": 818.211, | |
| "eval_steps_per_second": 6.393, | |
| "step": 110000 | |
| }, | |
| { | |
| "epoch": 9.685366174343692, | |
| "grad_norm": 2.477689504623413, | |
| "learning_rate": 8.794624451020555e-07, | |
| "loss": 2.3032, | |
| "step": 110500 | |
| }, | |
| { | |
| "epoch": 9.685366174343692, | |
| "eval_loss": 2.161015510559082, | |
| "eval_runtime": 1116.4235, | |
| "eval_samples_per_second": 817.163, | |
| "eval_steps_per_second": 6.385, | |
| "step": 110500 | |
| }, | |
| { | |
| "epoch": 9.729193145461718, | |
| "grad_norm": 2.637300729751587, | |
| "learning_rate": 7.90276717325672e-07, | |
| "loss": 2.3049, | |
| "step": 111000 | |
| }, | |
| { | |
| "epoch": 9.729193145461718, | |
| "eval_loss": 2.162550210952759, | |
| "eval_runtime": 1114.8952, | |
| "eval_samples_per_second": 818.283, | |
| "eval_steps_per_second": 6.393, | |
| "step": 111000 | |
| }, | |
| { | |
| "epoch": 9.773020116579744, | |
| "grad_norm": 2.375706672668457, | |
| "learning_rate": 7.057856518960599e-07, | |
| "loss": 2.3014, | |
| "step": 111500 | |
| }, | |
| { | |
| "epoch": 9.773020116579744, | |
| "eval_loss": 2.161914587020874, | |
| "eval_runtime": 1116.0493, | |
| "eval_samples_per_second": 817.437, | |
| "eval_steps_per_second": 6.387, | |
| "step": 111500 | |
| }, | |
| { | |
| "epoch": 9.81684708769777, | |
| "grad_norm": 2.4037861824035645, | |
| "learning_rate": 6.261604809943755e-07, | |
| "loss": 2.3023, | |
| "step": 112000 | |
| }, | |
| { | |
| "epoch": 9.81684708769777, | |
| "eval_loss": 2.1608428955078125, | |
| "eval_runtime": 1116.2862, | |
| "eval_samples_per_second": 817.264, | |
| "eval_steps_per_second": 6.385, | |
| "step": 112000 | |
| }, | |
| { | |
| "epoch": 9.860674058815796, | |
| "grad_norm": 2.493039846420288, | |
| "learning_rate": 5.510975114530553e-07, | |
| "loss": 2.3028, | |
| "step": 112500 | |
| }, | |
| { | |
| "epoch": 9.860674058815796, | |
| "eval_loss": 2.160830497741699, | |
| "eval_runtime": 1116.2069, | |
| "eval_samples_per_second": 817.322, | |
| "eval_steps_per_second": 6.386, | |
| "step": 112500 | |
| }, | |
| { | |
| "epoch": 9.90450102993382, | |
| "grad_norm": 2.5063636302948, | |
| "learning_rate": 4.807755850286977e-07, | |
| "loss": 2.3019, | |
| "step": 113000 | |
| }, | |
| { | |
| "epoch": 9.90450102993382, | |
| "eval_loss": 2.1616785526275635, | |
| "eval_runtime": 1116.3136, | |
| "eval_samples_per_second": 817.243, | |
| "eval_steps_per_second": 6.385, | |
| "step": 113000 | |
| }, | |
| { | |
| "epoch": 9.948328001051847, | |
| "grad_norm": 2.589062213897705, | |
| "learning_rate": 4.1520833829600813e-07, | |
| "loss": 2.301, | |
| "step": 113500 | |
| }, | |
| { | |
| "epoch": 9.948328001051847, | |
| "eval_loss": 2.160351276397705, | |
| "eval_runtime": 1116.7915, | |
| "eval_samples_per_second": 816.894, | |
| "eval_steps_per_second": 6.383, | |
| "step": 113500 | |
| }, | |
| { | |
| "epoch": 9.992154972169873, | |
| "grad_norm": 2.4170777797698975, | |
| "learning_rate": 3.544084858193325e-07, | |
| "loss": 2.3032, | |
| "step": 114000 | |
| }, | |
| { | |
| "epoch": 9.992154972169873, | |
| "eval_loss": 2.159677743911743, | |
| "eval_runtime": 1116.6266, | |
| "eval_samples_per_second": 817.014, | |
| "eval_steps_per_second": 6.384, | |
| "step": 114000 | |
| }, | |
| { | |
| "epoch": 10.035938116316782, | |
| "grad_norm": 2.528834819793701, | |
| "learning_rate": 2.9838781768708193e-07, | |
| "loss": 2.2945, | |
| "step": 114500 | |
| }, | |
| { | |
| "epoch": 10.035938116316782, | |
| "eval_loss": 2.161219835281372, | |
| "eval_runtime": 1116.9968, | |
| "eval_samples_per_second": 816.744, | |
| "eval_steps_per_second": 6.381, | |
| "step": 114500 | |
| }, | |
| { | |
| "epoch": 10.079765087434808, | |
| "grad_norm": 2.3111424446105957, | |
| "learning_rate": 2.4715719722546714e-07, | |
| "loss": 2.2963, | |
| "step": 115000 | |
| }, | |
| { | |
| "epoch": 10.079765087434808, | |
| "eval_loss": 2.160301923751831, | |
| "eval_runtime": 1117.2058, | |
| "eval_samples_per_second": 816.591, | |
| "eval_steps_per_second": 6.38, | |
| "step": 115000 | |
| }, | |
| { | |
| "epoch": 10.123592058552834, | |
| "grad_norm": 2.635735034942627, | |
| "learning_rate": 2.0072655889189772e-07, | |
| "loss": 2.2986, | |
| "step": 115500 | |
| }, | |
| { | |
| "epoch": 10.123592058552834, | |
| "eval_loss": 2.1600496768951416, | |
| "eval_runtime": 1119.355, | |
| "eval_samples_per_second": 815.023, | |
| "eval_steps_per_second": 6.368, | |
| "step": 115500 | |
| }, | |
| { | |
| "epoch": 10.16741902967086, | |
| "grad_norm": 2.228825807571411, | |
| "learning_rate": 1.5918334476575646e-07, | |
| "loss": 2.2922, | |
| "step": 116000 | |
| }, | |
| { | |
| "epoch": 10.16741902967086, | |
| "eval_loss": 2.1609036922454834, | |
| "eval_runtime": 1158.2359, | |
| "eval_samples_per_second": 787.663, | |
| "eval_steps_per_second": 6.154, | |
| "step": 116000 | |
| }, | |
| { | |
| "epoch": 10.211246000788886, | |
| "grad_norm": 2.534865140914917, | |
| "learning_rate": 1.2236910758539055e-07, | |
| "loss": 2.3035, | |
| "step": 116500 | |
| }, | |
| { | |
| "epoch": 10.211246000788886, | |
| "eval_loss": 2.1614086627960205, | |
| "eval_runtime": 1211.6086, | |
| "eval_samples_per_second": 752.966, | |
| "eval_steps_per_second": 5.883, | |
| "step": 116500 | |
| }, | |
| { | |
| "epoch": 10.25507297190691, | |
| "grad_norm": 2.4144797325134277, | |
| "learning_rate": 9.043821229186567e-08, | |
| "loss": 2.302, | |
| "step": 117000 | |
| }, | |
| { | |
| "epoch": 10.25507297190691, | |
| "eval_loss": 2.15974760055542, | |
| "eval_runtime": 1113.7288, | |
| "eval_samples_per_second": 819.14, | |
| "eval_steps_per_second": 6.4, | |
| "step": 117000 | |
| }, | |
| { | |
| "epoch": 10.298899943024937, | |
| "grad_norm": 2.239013433456421, | |
| "learning_rate": 6.32688733414294e-08, | |
| "loss": 2.3009, | |
| "step": 117500 | |
| }, | |
| { | |
| "epoch": 10.298899943024937, | |
| "eval_loss": 2.160125494003296, | |
| "eval_runtime": 2061.4838, | |
| "eval_samples_per_second": 442.545, | |
| "eval_steps_per_second": 3.458, | |
| "step": 117500 | |
| }, | |
| { | |
| "epoch": 10.342726914142963, | |
| "grad_norm": 2.6488566398620605, | |
| "learning_rate": 4.093517548052761e-08, | |
| "loss": 2.2942, | |
| "step": 118000 | |
| }, | |
| { | |
| "epoch": 10.342726914142963, | |
| "eval_loss": 2.160935163497925, | |
| "eval_runtime": 1218.013, | |
| "eval_samples_per_second": 749.007, | |
| "eval_steps_per_second": 5.852, | |
| "step": 118000 | |
| }, | |
| { | |
| "epoch": 10.386553885260989, | |
| "grad_norm": 2.3960371017456055, | |
| "learning_rate": 2.3441449579411632e-08, | |
| "loss": 2.3022, | |
| "step": 118500 | |
| }, | |
| { | |
| "epoch": 10.386553885260989, | |
| "eval_loss": 2.1597461700439453, | |
| "eval_runtime": 1294.5854, | |
| "eval_samples_per_second": 704.704, | |
| "eval_steps_per_second": 5.506, | |
| "step": 118500 | |
| }, | |
| { | |
| "epoch": 10.430380856379015, | |
| "grad_norm": 2.5293331146240234, | |
| "learning_rate": 1.0791087958400558e-08, | |
| "loss": 2.2948, | |
| "step": 119000 | |
| }, | |
| { | |
| "epoch": 10.430380856379015, | |
| "eval_loss": 2.159837245941162, | |
| "eval_runtime": 1253.9955, | |
| "eval_samples_per_second": 727.515, | |
| "eval_steps_per_second": 5.684, | |
| "step": 119000 | |
| }, | |
| { | |
| "epoch": 10.474207827497041, | |
| "grad_norm": 2.4509096145629883, | |
| "learning_rate": 2.9865437300630185e-09, | |
| "loss": 2.3045, | |
| "step": 119500 | |
| }, | |
| { | |
| "epoch": 10.474207827497041, | |
| "eval_loss": 2.1594982147216797, | |
| "eval_runtime": 1207.0311, | |
| "eval_samples_per_second": 755.821, | |
| "eval_steps_per_second": 5.905, | |
| "step": 119500 | |
| }, | |
| { | |
| "epoch": 10.518034798615068, | |
| "grad_norm": 2.336444616317749, | |
| "learning_rate": 2.933032350604936e-11, | |
| "loss": 2.2978, | |
| "step": 120000 | |
| }, | |
| { | |
| "epoch": 10.518034798615068, | |
| "eval_loss": 2.161297559738159, | |
| "eval_runtime": 1191.92, | |
| "eval_samples_per_second": 765.404, | |
| "eval_steps_per_second": 5.98, | |
| "step": 120000 | |
| } | |
| ], | |
| "logging_steps": 500, | |
| "max_steps": 120000, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 11, | |
| "save_steps": 3000, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 7.295615807101338e+18, | |
| "train_batch_size": 16, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |