| { |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 18.56268127618434, |
| "eval_steps": 100, |
| "global_step": 7200, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.12890750886239125, |
| "grad_norm": 5.428058115945689, |
| "learning_rate": 0.0001, |
| "loss": 3.7217, |
| "step": 50 |
| }, |
| { |
| "epoch": 0.2578150177247825, |
| "grad_norm": 3.6736343068699004, |
| "learning_rate": 9.999743504733682e-05, |
| "loss": 2.6957, |
| "step": 100 |
| }, |
| { |
| "epoch": 0.2578150177247825, |
| "eval_loss": 2.472891092300415, |
| "eval_runtime": 13.3767, |
| "eval_samples_per_second": 74.757, |
| "eval_steps_per_second": 2.392, |
| "step": 100 |
| }, |
| { |
| "epoch": 0.3867225265871737, |
| "grad_norm": 3.9566460988411976, |
| "learning_rate": 9.998974045516476e-05, |
| "loss": 2.3982, |
| "step": 150 |
| }, |
| { |
| "epoch": 0.515630035449565, |
| "grad_norm": 1.91000275173515, |
| "learning_rate": 9.997691702090861e-05, |
| "loss": 2.188, |
| "step": 200 |
| }, |
| { |
| "epoch": 0.515630035449565, |
| "eval_loss": 2.072312593460083, |
| "eval_runtime": 13.1385, |
| "eval_samples_per_second": 76.112, |
| "eval_steps_per_second": 2.436, |
| "step": 200 |
| }, |
| { |
| "epoch": 0.6445375443119562, |
| "grad_norm": 3.7326458687273494, |
| "learning_rate": 9.9958966073518e-05, |
| "loss": 2.058, |
| "step": 250 |
| }, |
| { |
| "epoch": 0.7734450531743474, |
| "grad_norm": 1.1877292780347308, |
| "learning_rate": 9.993588947332947e-05, |
| "loss": 2.0499, |
| "step": 300 |
| }, |
| { |
| "epoch": 0.7734450531743474, |
| "eval_loss": 1.9889113903045654, |
| "eval_runtime": 13.0859, |
| "eval_samples_per_second": 76.418, |
| "eval_steps_per_second": 2.445, |
| "step": 300 |
| }, |
| { |
| "epoch": 0.9023525620367386, |
| "grad_norm": 2.896903582467451, |
| "learning_rate": 9.990768961187381e-05, |
| "loss": 1.9975, |
| "step": 350 |
| }, |
| { |
| "epoch": 1.03126007089913, |
| "grad_norm": 1.1169559646807505, |
| "learning_rate": 9.98743694116282e-05, |
| "loss": 1.9593, |
| "step": 400 |
| }, |
| { |
| "epoch": 1.03126007089913, |
| "eval_loss": 1.9284899234771729, |
| "eval_runtime": 13.1076, |
| "eval_samples_per_second": 76.292, |
| "eval_steps_per_second": 2.441, |
| "step": 400 |
| }, |
| { |
| "epoch": 1.1601675797615212, |
| "grad_norm": 0.9849310297267434, |
| "learning_rate": 9.983593232571328e-05, |
| "loss": 1.9186, |
| "step": 450 |
| }, |
| { |
| "epoch": 1.2890750886239124, |
| "grad_norm": 0.9560509903560709, |
| "learning_rate": 9.979238233753537e-05, |
| "loss": 1.921, |
| "step": 500 |
| }, |
| { |
| "epoch": 1.2890750886239124, |
| "eval_loss": 1.899874210357666, |
| "eval_runtime": 13.1392, |
| "eval_samples_per_second": 76.108, |
| "eval_steps_per_second": 2.435, |
| "step": 500 |
| }, |
| { |
| "epoch": 1.4179825974863036, |
| "grad_norm": 1.3741796182310861, |
| "learning_rate": 9.974372396037357e-05, |
| "loss": 1.9246, |
| "step": 550 |
| }, |
| { |
| "epoch": 1.5468901063486948, |
| "grad_norm": 1.718108772048462, |
| "learning_rate": 9.96899622369121e-05, |
| "loss": 1.8882, |
| "step": 600 |
| }, |
| { |
| "epoch": 1.5468901063486948, |
| "eval_loss": 1.8836181163787842, |
| "eval_runtime": 13.1533, |
| "eval_samples_per_second": 76.026, |
| "eval_steps_per_second": 2.433, |
| "step": 600 |
| }, |
| { |
| "epoch": 1.675797615211086, |
| "grad_norm": 1.3793562879868584, |
| "learning_rate": 9.963110273871768e-05, |
| "loss": 1.8823, |
| "step": 650 |
| }, |
| { |
| "epoch": 1.8047051240734773, |
| "grad_norm": 1.7941360700066475, |
| "learning_rate": 9.956715156566203e-05, |
| "loss": 1.8786, |
| "step": 700 |
| }, |
| { |
| "epoch": 1.8047051240734773, |
| "eval_loss": 1.874005913734436, |
| "eval_runtime": 13.1279, |
| "eval_samples_per_second": 76.174, |
| "eval_steps_per_second": 2.438, |
| "step": 700 |
| }, |
| { |
| "epoch": 1.9336126329358685, |
| "grad_norm": 1.2268118375629977, |
| "learning_rate": 9.94981153452899e-05, |
| "loss": 1.8764, |
| "step": 750 |
| }, |
| { |
| "epoch": 2.06252014179826, |
| "grad_norm": 0.8694323872512157, |
| "learning_rate": 9.94240012321321e-05, |
| "loss": 1.8327, |
| "step": 800 |
| }, |
| { |
| "epoch": 2.06252014179826, |
| "eval_loss": 1.8573421239852905, |
| "eval_runtime": 13.1123, |
| "eval_samples_per_second": 76.264, |
| "eval_steps_per_second": 2.44, |
| "step": 800 |
| }, |
| { |
| "epoch": 2.191427650660651, |
| "grad_norm": 1.6779131964119156, |
| "learning_rate": 9.934481690696406e-05, |
| "loss": 1.7937, |
| "step": 850 |
| }, |
| { |
| "epoch": 2.3203351595230424, |
| "grad_norm": 1.2570407836555852, |
| "learning_rate": 9.92605705760098e-05, |
| "loss": 1.8047, |
| "step": 900 |
| }, |
| { |
| "epoch": 2.3203351595230424, |
| "eval_loss": 1.8506410121917725, |
| "eval_runtime": 13.1515, |
| "eval_samples_per_second": 76.037, |
| "eval_steps_per_second": 2.433, |
| "step": 900 |
| }, |
| { |
| "epoch": 2.4492426683854336, |
| "grad_norm": 0.9012297719032618, |
| "learning_rate": 9.917127097009165e-05, |
| "loss": 1.8028, |
| "step": 950 |
| }, |
| { |
| "epoch": 2.578150177247825, |
| "grad_norm": 2.071809054799254, |
| "learning_rate": 9.907692734372522e-05, |
| "loss": 1.8001, |
| "step": 1000 |
| }, |
| { |
| "epoch": 2.578150177247825, |
| "eval_loss": 1.8604120016098022, |
| "eval_runtime": 13.1616, |
| "eval_samples_per_second": 75.978, |
| "eval_steps_per_second": 2.431, |
| "step": 1000 |
| }, |
| { |
| "epoch": 2.707057686110216, |
| "grad_norm": 1.8799616432709254, |
| "learning_rate": 9.897754947416042e-05, |
| "loss": 1.8009, |
| "step": 1050 |
| }, |
| { |
| "epoch": 2.8359651949726072, |
| "grad_norm": 0.9523078941745302, |
| "learning_rate": 9.887314766036823e-05, |
| "loss": 1.8016, |
| "step": 1100 |
| }, |
| { |
| "epoch": 2.8359651949726072, |
| "eval_loss": 1.8416086435317993, |
| "eval_runtime": 13.1272, |
| "eval_samples_per_second": 76.178, |
| "eval_steps_per_second": 2.438, |
| "step": 1100 |
| }, |
| { |
| "epoch": 2.9648727038349985, |
| "grad_norm": 0.7548354411956247, |
| "learning_rate": 9.87637327219733e-05, |
| "loss": 1.7941, |
| "step": 1150 |
| }, |
| { |
| "epoch": 3.0937802126973897, |
| "grad_norm": 1.603556668939176, |
| "learning_rate": 9.86493159981327e-05, |
| "loss": 1.7221, |
| "step": 1200 |
| }, |
| { |
| "epoch": 3.0937802126973897, |
| "eval_loss": 1.8572254180908203, |
| "eval_runtime": 13.1348, |
| "eval_samples_per_second": 76.134, |
| "eval_steps_per_second": 2.436, |
| "step": 1200 |
| }, |
| { |
| "epoch": 3.222687721559781, |
| "grad_norm": 1.1914026184365651, |
| "learning_rate": 9.85299093463608e-05, |
| "loss": 1.6919, |
| "step": 1250 |
| }, |
| { |
| "epoch": 3.351595230422172, |
| "grad_norm": 1.108713427331391, |
| "learning_rate": 9.840552514130043e-05, |
| "loss": 1.6979, |
| "step": 1300 |
| }, |
| { |
| "epoch": 3.351595230422172, |
| "eval_loss": 1.8494083881378174, |
| "eval_runtime": 13.1546, |
| "eval_samples_per_second": 76.019, |
| "eval_steps_per_second": 2.433, |
| "step": 1300 |
| }, |
| { |
| "epoch": 3.4805027392845633, |
| "grad_norm": 1.188923474560524, |
| "learning_rate": 9.827617627344035e-05, |
| "loss": 1.7012, |
| "step": 1350 |
| }, |
| { |
| "epoch": 3.6094102481469545, |
| "grad_norm": 1.1069030836862073, |
| "learning_rate": 9.814187614777952e-05, |
| "loss": 1.7117, |
| "step": 1400 |
| }, |
| { |
| "epoch": 3.6094102481469545, |
| "eval_loss": 1.8396939039230347, |
| "eval_runtime": 13.1058, |
| "eval_samples_per_second": 76.302, |
| "eval_steps_per_second": 2.442, |
| "step": 1400 |
| }, |
| { |
| "epoch": 3.7383177570093458, |
| "grad_norm": 1.4927257455688545, |
| "learning_rate": 9.800263868243771e-05, |
| "loss": 1.7115, |
| "step": 1450 |
| }, |
| { |
| "epoch": 3.867225265871737, |
| "grad_norm": 0.9082276480595701, |
| "learning_rate": 9.785847830721322e-05, |
| "loss": 1.7181, |
| "step": 1500 |
| }, |
| { |
| "epoch": 3.867225265871737, |
| "eval_loss": 1.8317677974700928, |
| "eval_runtime": 13.1459, |
| "eval_samples_per_second": 76.069, |
| "eval_steps_per_second": 2.434, |
| "step": 1500 |
| }, |
| { |
| "epoch": 3.996132774734128, |
| "grad_norm": 1.38818621871337, |
| "learning_rate": 9.770940996208739e-05, |
| "loss": 1.7195, |
| "step": 1550 |
| }, |
| { |
| "epoch": 4.12504028359652, |
| "grad_norm": 1.1154867829165278, |
| "learning_rate": 9.755544909567632e-05, |
| "loss": 1.5548, |
| "step": 1600 |
| }, |
| { |
| "epoch": 4.12504028359652, |
| "eval_loss": 1.8801182508468628, |
| "eval_runtime": 13.1664, |
| "eval_samples_per_second": 75.951, |
| "eval_steps_per_second": 2.43, |
| "step": 1600 |
| }, |
| { |
| "epoch": 4.253947792458911, |
| "grad_norm": 1.741656038399529, |
| "learning_rate": 9.73966116636299e-05, |
| "loss": 1.5498, |
| "step": 1650 |
| }, |
| { |
| "epoch": 4.382855301321302, |
| "grad_norm": 0.9507921869813947, |
| "learning_rate": 9.723291412697821e-05, |
| "loss": 1.5728, |
| "step": 1700 |
| }, |
| { |
| "epoch": 4.382855301321302, |
| "eval_loss": 1.8739728927612305, |
| "eval_runtime": 13.1362, |
| "eval_samples_per_second": 76.126, |
| "eval_steps_per_second": 2.436, |
| "step": 1700 |
| }, |
| { |
| "epoch": 4.5117628101836935, |
| "grad_norm": 1.1876157181384903, |
| "learning_rate": 9.706437345042558e-05, |
| "loss": 1.5896, |
| "step": 1750 |
| }, |
| { |
| "epoch": 4.640670319046085, |
| "grad_norm": 1.365051813978068, |
| "learning_rate": 9.689100710059251e-05, |
| "loss": 1.5998, |
| "step": 1800 |
| }, |
| { |
| "epoch": 4.640670319046085, |
| "eval_loss": 1.8598759174346924, |
| "eval_runtime": 13.1287, |
| "eval_samples_per_second": 76.169, |
| "eval_steps_per_second": 2.437, |
| "step": 1800 |
| }, |
| { |
| "epoch": 4.769577827908476, |
| "grad_norm": 1.3205776295240563, |
| "learning_rate": 9.67128330442055e-05, |
| "loss": 1.5974, |
| "step": 1850 |
| }, |
| { |
| "epoch": 4.898485336770867, |
| "grad_norm": 1.4453793304970697, |
| "learning_rate": 9.652986974623506e-05, |
| "loss": 1.6127, |
| "step": 1900 |
| }, |
| { |
| "epoch": 4.898485336770867, |
| "eval_loss": 1.8465975522994995, |
| "eval_runtime": 13.1264, |
| "eval_samples_per_second": 76.182, |
| "eval_steps_per_second": 2.438, |
| "step": 1900 |
| }, |
| { |
| "epoch": 5.027392845633258, |
| "grad_norm": 2.3043609697161633, |
| "learning_rate": 9.634213616798214e-05, |
| "loss": 1.5733, |
| "step": 1950 |
| }, |
| { |
| "epoch": 5.15630035449565, |
| "grad_norm": 1.1111652873863385, |
| "learning_rate": 9.614965176511308e-05, |
| "loss": 1.3923, |
| "step": 2000 |
| }, |
| { |
| "epoch": 5.15630035449565, |
| "eval_loss": 1.9901988506317139, |
| "eval_runtime": 13.1434, |
| "eval_samples_per_second": 76.084, |
| "eval_steps_per_second": 2.435, |
| "step": 2000 |
| }, |
| { |
| "epoch": 5.285207863358041, |
| "grad_norm": 1.8996098810923527, |
| "learning_rate": 9.595243648564326e-05, |
| "loss": 1.3904, |
| "step": 2050 |
| }, |
| { |
| "epoch": 5.414115372220432, |
| "grad_norm": 0.8248818797353966, |
| "learning_rate": 9.575051076786994e-05, |
| "loss": 1.413, |
| "step": 2100 |
| }, |
| { |
| "epoch": 5.414115372220432, |
| "eval_loss": 1.941409945487976, |
| "eval_runtime": 13.1615, |
| "eval_samples_per_second": 75.979, |
| "eval_steps_per_second": 2.431, |
| "step": 2100 |
| }, |
| { |
| "epoch": 5.543022881082823, |
| "grad_norm": 1.3796008879183341, |
| "learning_rate": 9.554389553825404e-05, |
| "loss": 1.4426, |
| "step": 2150 |
| }, |
| { |
| "epoch": 5.6719303899452145, |
| "grad_norm": 1.2370414797788207, |
| "learning_rate": 9.533261220925143e-05, |
| "loss": 1.4441, |
| "step": 2200 |
| }, |
| { |
| "epoch": 5.6719303899452145, |
| "eval_loss": 1.9324249029159546, |
| "eval_runtime": 13.1482, |
| "eval_samples_per_second": 76.056, |
| "eval_steps_per_second": 2.434, |
| "step": 2200 |
| }, |
| { |
| "epoch": 5.800837898807606, |
| "grad_norm": 0.7933476727900988, |
| "learning_rate": 9.511668267709395e-05, |
| "loss": 1.4578, |
| "step": 2250 |
| }, |
| { |
| "epoch": 5.929745407669997, |
| "grad_norm": 0.9922228439520735, |
| "learning_rate": 9.48961293195201e-05, |
| "loss": 1.4729, |
| "step": 2300 |
| }, |
| { |
| "epoch": 5.929745407669997, |
| "eval_loss": 1.9070981740951538, |
| "eval_runtime": 13.1414, |
| "eval_samples_per_second": 76.095, |
| "eval_steps_per_second": 2.435, |
| "step": 2300 |
| }, |
| { |
| "epoch": 6.058652916532388, |
| "grad_norm": 1.133228933331563, |
| "learning_rate": 9.467097499345605e-05, |
| "loss": 1.3338, |
| "step": 2350 |
| }, |
| { |
| "epoch": 6.187560425394779, |
| "grad_norm": 1.1388176086742452, |
| "learning_rate": 9.444124303264675e-05, |
| "loss": 1.1768, |
| "step": 2400 |
| }, |
| { |
| "epoch": 6.187560425394779, |
| "eval_loss": 2.123551607131958, |
| "eval_runtime": 13.1885, |
| "eval_samples_per_second": 75.824, |
| "eval_steps_per_second": 2.426, |
| "step": 2400 |
| }, |
| { |
| "epoch": 6.316467934257171, |
| "grad_norm": 1.0540569425798711, |
| "learning_rate": 9.420695724523785e-05, |
| "loss": 1.1952, |
| "step": 2450 |
| }, |
| { |
| "epoch": 6.445375443119562, |
| "grad_norm": 1.0205037806931825, |
| "learning_rate": 9.396814191130831e-05, |
| "loss": 1.2409, |
| "step": 2500 |
| }, |
| { |
| "epoch": 6.445375443119562, |
| "eval_loss": 2.0799171924591064, |
| "eval_runtime": 13.1885, |
| "eval_samples_per_second": 75.824, |
| "eval_steps_per_second": 2.426, |
| "step": 2500 |
| }, |
| { |
| "epoch": 6.574282951981953, |
| "grad_norm": 1.3287277537295186, |
| "learning_rate": 9.37248217803542e-05, |
| "loss": 1.2484, |
| "step": 2550 |
| }, |
| { |
| "epoch": 6.703190460844344, |
| "grad_norm": 1.7324707650665503, |
| "learning_rate": 9.347702206872368e-05, |
| "loss": 1.2794, |
| "step": 2600 |
| }, |
| { |
| "epoch": 6.703190460844344, |
| "eval_loss": 2.066530227661133, |
| "eval_runtime": 13.1457, |
| "eval_samples_per_second": 76.07, |
| "eval_steps_per_second": 2.434, |
| "step": 2600 |
| }, |
| { |
| "epoch": 6.832097969706735, |
| "grad_norm": 0.7821269122995969, |
| "learning_rate": 9.322476845700381e-05, |
| "loss": 1.2872, |
| "step": 2650 |
| }, |
| { |
| "epoch": 6.961005478569127, |
| "grad_norm": 1.0321720718594696, |
| "learning_rate": 9.296808708735924e-05, |
| "loss": 1.2975, |
| "step": 2700 |
| }, |
| { |
| "epoch": 6.961005478569127, |
| "eval_loss": 2.028914213180542, |
| "eval_runtime": 13.188, |
| "eval_samples_per_second": 75.827, |
| "eval_steps_per_second": 2.426, |
| "step": 2700 |
| }, |
| { |
| "epoch": 7.089912987431518, |
| "grad_norm": 0.8079357741453, |
| "learning_rate": 9.270700456082274e-05, |
| "loss": 1.0552, |
| "step": 2750 |
| }, |
| { |
| "epoch": 7.218820496293909, |
| "grad_norm": 1.2220177415199573, |
| "learning_rate": 9.244154793453865e-05, |
| "loss": 0.9573, |
| "step": 2800 |
| }, |
| { |
| "epoch": 7.218820496293909, |
| "eval_loss": 2.30826473236084, |
| "eval_runtime": 13.14, |
| "eval_samples_per_second": 76.103, |
| "eval_steps_per_second": 2.435, |
| "step": 2800 |
| }, |
| { |
| "epoch": 7.3477280051563, |
| "grad_norm": 1.0187532250301208, |
| "learning_rate": 9.217174471895868e-05, |
| "loss": 0.9933, |
| "step": 2850 |
| }, |
| { |
| "epoch": 7.4766355140186915, |
| "grad_norm": 1.1142206529537857, |
| "learning_rate": 9.189762287499101e-05, |
| "loss": 1.0244, |
| "step": 2900 |
| }, |
| { |
| "epoch": 7.4766355140186915, |
| "eval_loss": 2.2640790939331055, |
| "eval_runtime": 13.1456, |
| "eval_samples_per_second": 76.071, |
| "eval_steps_per_second": 2.434, |
| "step": 2900 |
| }, |
| { |
| "epoch": 7.605543022881083, |
| "grad_norm": 0.922470837605761, |
| "learning_rate": 9.16192108111024e-05, |
| "loss": 1.0455, |
| "step": 2950 |
| }, |
| { |
| "epoch": 7.734450531743474, |
| "grad_norm": 1.4488181883296236, |
| "learning_rate": 9.133653738037431e-05, |
| "loss": 1.066, |
| "step": 3000 |
| }, |
| { |
| "epoch": 7.734450531743474, |
| "eval_loss": 2.224378824234009, |
| "eval_runtime": 13.1557, |
| "eval_samples_per_second": 76.013, |
| "eval_steps_per_second": 2.432, |
| "step": 3000 |
| }, |
| { |
| "epoch": 7.863358040605865, |
| "grad_norm": 1.284431896370195, |
| "learning_rate": 9.104963187751253e-05, |
| "loss": 1.0771, |
| "step": 3050 |
| }, |
| { |
| "epoch": 7.992265549468256, |
| "grad_norm": 1.3116181988612625, |
| "learning_rate": 9.075852403581133e-05, |
| "loss": 1.1098, |
| "step": 3100 |
| }, |
| { |
| "epoch": 7.992265549468256, |
| "eval_loss": 2.198763608932495, |
| "eval_runtime": 13.1699, |
| "eval_samples_per_second": 75.931, |
| "eval_steps_per_second": 2.43, |
| "step": 3100 |
| }, |
| { |
| "epoch": 8.121173058330648, |
| "grad_norm": 1.185925605822691, |
| "learning_rate": 9.046324402407213e-05, |
| "loss": 0.733, |
| "step": 3150 |
| }, |
| { |
| "epoch": 8.25008056719304, |
| "grad_norm": 2.353999238623636, |
| "learning_rate": 9.016382244347679e-05, |
| "loss": 0.7603, |
| "step": 3200 |
| }, |
| { |
| "epoch": 8.25008056719304, |
| "eval_loss": 2.5014915466308594, |
| "eval_runtime": 13.1569, |
| "eval_samples_per_second": 76.006, |
| "eval_steps_per_second": 2.432, |
| "step": 3200 |
| }, |
| { |
| "epoch": 8.37898807605543, |
| "grad_norm": 1.3793811731790488, |
| "learning_rate": 8.98602903244165e-05, |
| "loss": 0.7843, |
| "step": 3250 |
| }, |
| { |
| "epoch": 8.507895584917822, |
| "grad_norm": 1.0500789470659453, |
| "learning_rate": 8.955267912327574e-05, |
| "loss": 0.8025, |
| "step": 3300 |
| }, |
| { |
| "epoch": 8.507895584917822, |
| "eval_loss": 2.4928858280181885, |
| "eval_runtime": 13.1471, |
| "eval_samples_per_second": 76.062, |
| "eval_steps_per_second": 2.434, |
| "step": 3300 |
| }, |
| { |
| "epoch": 8.636803093780212, |
| "grad_norm": 1.0687481728737136, |
| "learning_rate": 8.924102071917248e-05, |
| "loss": 0.8292, |
| "step": 3350 |
| }, |
| { |
| "epoch": 8.765710602642605, |
| "grad_norm": 0.8890330524205967, |
| "learning_rate": 8.89253474106544e-05, |
| "loss": 0.8554, |
| "step": 3400 |
| }, |
| { |
| "epoch": 8.765710602642605, |
| "eval_loss": 2.4535696506500244, |
| "eval_runtime": 13.1668, |
| "eval_samples_per_second": 75.949, |
| "eval_steps_per_second": 2.43, |
| "step": 3400 |
| }, |
| { |
| "epoch": 8.894618111504995, |
| "grad_norm": 1.1314521221393643, |
| "learning_rate": 8.860569191235147e-05, |
| "loss": 0.8804, |
| "step": 3450 |
| }, |
| { |
| "epoch": 9.023525620367387, |
| "grad_norm": 1.1316860727966558, |
| "learning_rate": 8.828208735158577e-05, |
| "loss": 0.8251, |
| "step": 3500 |
| }, |
| { |
| "epoch": 9.023525620367387, |
| "eval_loss": 2.771848440170288, |
| "eval_runtime": 13.1585, |
| "eval_samples_per_second": 75.996, |
| "eval_steps_per_second": 2.432, |
| "step": 3500 |
| }, |
| { |
| "epoch": 9.152433129229777, |
| "grad_norm": 2.2363185101646765, |
| "learning_rate": 8.795456726493838e-05, |
| "loss": 0.5115, |
| "step": 3550 |
| }, |
| { |
| "epoch": 9.28134063809217, |
| "grad_norm": 1.1689864457962205, |
| "learning_rate": 8.762316559477361e-05, |
| "loss": 0.5483, |
| "step": 3600 |
| }, |
| { |
| "epoch": 9.28134063809217, |
| "eval_loss": 2.738429307937622, |
| "eval_runtime": 13.1693, |
| "eval_samples_per_second": 75.934, |
| "eval_steps_per_second": 2.43, |
| "step": 3600 |
| }, |
| { |
| "epoch": 9.41024814695456, |
| "grad_norm": 1.1593603230103788, |
| "learning_rate": 8.728791668572168e-05, |
| "loss": 0.581, |
| "step": 3650 |
| }, |
| { |
| "epoch": 9.539155655816952, |
| "grad_norm": 1.4682987033608552, |
| "learning_rate": 8.694885528111918e-05, |
| "loss": 0.6167, |
| "step": 3700 |
| }, |
| { |
| "epoch": 9.539155655816952, |
| "eval_loss": 2.702000379562378, |
| "eval_runtime": 13.1618, |
| "eval_samples_per_second": 75.978, |
| "eval_steps_per_second": 2.431, |
| "step": 3700 |
| }, |
| { |
| "epoch": 9.668063164679342, |
| "grad_norm": 1.3807999009672582, |
| "learning_rate": 8.66060165194087e-05, |
| "loss": 0.6364, |
| "step": 3750 |
| }, |
| { |
| "epoch": 9.796970673541734, |
| "grad_norm": 1.6910628067329174, |
| "learning_rate": 8.625943593049708e-05, |
| "loss": 0.664, |
| "step": 3800 |
| }, |
| { |
| "epoch": 9.796970673541734, |
| "eval_loss": 2.6746528148651123, |
| "eval_runtime": 13.1207, |
| "eval_samples_per_second": 76.216, |
| "eval_steps_per_second": 2.439, |
| "step": 3800 |
| }, |
| { |
| "epoch": 9.925878182404125, |
| "grad_norm": 1.2810221531255845, |
| "learning_rate": 8.590914943207338e-05, |
| "loss": 0.6808, |
| "step": 3850 |
| }, |
| { |
| "epoch": 10.054785691266517, |
| "grad_norm": 0.894817953292936, |
| "learning_rate": 8.555519332588658e-05, |
| "loss": 0.5501, |
| "step": 3900 |
| }, |
| { |
| "epoch": 10.054785691266517, |
| "eval_loss": 2.9522013664245605, |
| "eval_runtime": 13.1696, |
| "eval_samples_per_second": 75.933, |
| "eval_steps_per_second": 2.43, |
| "step": 3900 |
| }, |
| { |
| "epoch": 10.183693200128907, |
| "grad_norm": 0.7673858183230434, |
| "learning_rate": 8.519760429398344e-05, |
| "loss": 0.3676, |
| "step": 3950 |
| }, |
| { |
| "epoch": 10.3126007089913, |
| "grad_norm": 0.9258575274469117, |
| "learning_rate": 8.4836419394907e-05, |
| "loss": 0.3948, |
| "step": 4000 |
| }, |
| { |
| "epoch": 10.3126007089913, |
| "eval_loss": 2.939727544784546, |
| "eval_runtime": 13.261, |
| "eval_samples_per_second": 75.409, |
| "eval_steps_per_second": 2.413, |
| "step": 4000 |
| }, |
| { |
| "epoch": 10.44150821785369, |
| "grad_norm": 0.9837761849309598, |
| "learning_rate": 8.447167605985595e-05, |
| "loss": 0.424, |
| "step": 4050 |
| }, |
| { |
| "epoch": 10.570415726716082, |
| "grad_norm": 1.1827846876344605, |
| "learning_rate": 8.410341208880562e-05, |
| "loss": 0.4493, |
| "step": 4100 |
| }, |
| { |
| "epoch": 10.570415726716082, |
| "eval_loss": 2.9346396923065186, |
| "eval_runtime": 13.1851, |
| "eval_samples_per_second": 75.843, |
| "eval_steps_per_second": 2.427, |
| "step": 4100 |
| }, |
| { |
| "epoch": 10.699323235578472, |
| "grad_norm": 1.41364563812005, |
| "learning_rate": 8.373166564659048e-05, |
| "loss": 0.4724, |
| "step": 4150 |
| }, |
| { |
| "epoch": 10.828230744440864, |
| "grad_norm": 1.341861709508504, |
| "learning_rate": 8.335647525894898e-05, |
| "loss": 0.4991, |
| "step": 4200 |
| }, |
| { |
| "epoch": 10.828230744440864, |
| "eval_loss": 2.8969509601593018, |
| "eval_runtime": 13.153, |
| "eval_samples_per_second": 76.028, |
| "eval_steps_per_second": 2.433, |
| "step": 4200 |
| }, |
| { |
| "epoch": 10.957138253303254, |
| "grad_norm": 0.8732212524533925, |
| "learning_rate": 8.297787980853102e-05, |
| "loss": 0.514, |
| "step": 4250 |
| }, |
| { |
| "epoch": 11.086045762165647, |
| "grad_norm": 0.9580077889491428, |
| "learning_rate": 8.259591853086822e-05, |
| "loss": 0.3342, |
| "step": 4300 |
| }, |
| { |
| "epoch": 11.086045762165647, |
| "eval_loss": 3.12947940826416, |
| "eval_runtime": 13.164, |
| "eval_samples_per_second": 75.964, |
| "eval_steps_per_second": 2.431, |
| "step": 4300 |
| }, |
| { |
| "epoch": 11.214953271028037, |
| "grad_norm": 1.0158413995480675, |
| "learning_rate": 8.221063101030793e-05, |
| "loss": 0.2608, |
| "step": 4350 |
| }, |
| { |
| "epoch": 11.343860779890429, |
| "grad_norm": 1.066799301262293, |
| "learning_rate": 8.182205717591083e-05, |
| "loss": 0.2868, |
| "step": 4400 |
| }, |
| { |
| "epoch": 11.343860779890429, |
| "eval_loss": 3.152151107788086, |
| "eval_runtime": 13.1308, |
| "eval_samples_per_second": 76.157, |
| "eval_steps_per_second": 2.437, |
| "step": 4400 |
| }, |
| { |
| "epoch": 11.47276828875282, |
| "grad_norm": 1.7853526972041276, |
| "learning_rate": 8.143023729731294e-05, |
| "loss": 0.3088, |
| "step": 4450 |
| }, |
| { |
| "epoch": 11.601675797615211, |
| "grad_norm": 0.8686004168533566, |
| "learning_rate": 8.103521198055229e-05, |
| "loss": 0.3307, |
| "step": 4500 |
| }, |
| { |
| "epoch": 11.601675797615211, |
| "eval_loss": 3.140380382537842, |
| "eval_runtime": 13.1601, |
| "eval_samples_per_second": 75.987, |
| "eval_steps_per_second": 2.432, |
| "step": 4500 |
| }, |
| { |
| "epoch": 11.730583306477602, |
| "grad_norm": 1.1842485940651084, |
| "learning_rate": 8.063702216386072e-05, |
| "loss": 0.3505, |
| "step": 4550 |
| }, |
| { |
| "epoch": 11.859490815339994, |
| "grad_norm": 1.139988677136263, |
| "learning_rate": 8.02357091134213e-05, |
| "loss": 0.3798, |
| "step": 4600 |
| }, |
| { |
| "epoch": 11.859490815339994, |
| "eval_loss": 3.1152422428131104, |
| "eval_runtime": 13.1658, |
| "eval_samples_per_second": 75.954, |
| "eval_steps_per_second": 2.431, |
| "step": 4600 |
| }, |
| { |
| "epoch": 11.988398324202384, |
| "grad_norm": 1.1317453381475029, |
| "learning_rate": 7.983131441909169e-05, |
| "loss": 0.383, |
| "step": 4650 |
| }, |
| { |
| "epoch": 12.117305833064776, |
| "grad_norm": 0.8577623285954574, |
| "learning_rate": 7.942387999009405e-05, |
| "loss": 0.1955, |
| "step": 4700 |
| }, |
| { |
| "epoch": 12.117305833064776, |
| "eval_loss": 3.292053699493408, |
| "eval_runtime": 13.1656, |
| "eval_samples_per_second": 75.955, |
| "eval_steps_per_second": 2.431, |
| "step": 4700 |
| }, |
| { |
| "epoch": 12.246213341927167, |
| "grad_norm": 0.792139936919041, |
| "learning_rate": 7.901344805067176e-05, |
| "loss": 0.2018, |
| "step": 4750 |
| }, |
| { |
| "epoch": 12.375120850789559, |
| "grad_norm": 1.1197587931587643, |
| "learning_rate": 7.860006113571356e-05, |
| "loss": 0.2149, |
| "step": 4800 |
| }, |
| { |
| "epoch": 12.375120850789559, |
| "eval_loss": 3.300734519958496, |
| "eval_runtime": 13.2004, |
| "eval_samples_per_second": 75.755, |
| "eval_steps_per_second": 2.424, |
| "step": 4800 |
| }, |
| { |
| "epoch": 12.504028359651949, |
| "grad_norm": 0.9715029062397967, |
| "learning_rate": 7.818376208634544e-05, |
| "loss": 0.2326, |
| "step": 4850 |
| }, |
| { |
| "epoch": 12.632935868514341, |
| "grad_norm": 0.9363158756959897, |
| "learning_rate": 7.776459404549084e-05, |
| "loss": 0.2492, |
| "step": 4900 |
| }, |
| { |
| "epoch": 12.632935868514341, |
| "eval_loss": 3.3016297817230225, |
| "eval_runtime": 13.1894, |
| "eval_samples_per_second": 75.819, |
| "eval_steps_per_second": 2.426, |
| "step": 4900 |
| }, |
| { |
| "epoch": 12.761843377376731, |
| "grad_norm": 0.8911732251342259, |
| "learning_rate": 7.734260045339957e-05, |
| "loss": 0.2662, |
| "step": 4950 |
| }, |
| { |
| "epoch": 12.890750886239124, |
| "grad_norm": 1.0150499184539068, |
| "learning_rate": 7.69178250431459e-05, |
| "loss": 0.2797, |
| "step": 5000 |
| }, |
| { |
| "epoch": 12.890750886239124, |
| "eval_loss": 3.2908613681793213, |
| "eval_runtime": 13.193, |
| "eval_samples_per_second": 75.798, |
| "eval_steps_per_second": 2.426, |
| "step": 5000 |
| }, |
| { |
| "epoch": 13.019658395101514, |
| "grad_norm": 0.9560026596743003, |
| "learning_rate": 7.649031183609627e-05, |
| "loss": 0.27, |
| "step": 5050 |
| }, |
| { |
| "epoch": 13.148565903963906, |
| "grad_norm": 0.7460724556430167, |
| "learning_rate": 7.606010513734722e-05, |
| "loss": 0.1396, |
| "step": 5100 |
| }, |
| { |
| "epoch": 13.148565903963906, |
| "eval_loss": 3.4375460147857666, |
| "eval_runtime": 13.1426, |
| "eval_samples_per_second": 76.088, |
| "eval_steps_per_second": 2.435, |
| "step": 5100 |
| }, |
| { |
| "epoch": 13.277473412826296, |
| "grad_norm": 1.2891823937464943, |
| "learning_rate": 7.562724953113382e-05, |
| "loss": 0.1548, |
| "step": 5150 |
| }, |
| { |
| "epoch": 13.406380921688688, |
| "grad_norm": 0.8052288266291375, |
| "learning_rate": 7.519178987620915e-05, |
| "loss": 0.1697, |
| "step": 5200 |
| }, |
| { |
| "epoch": 13.406380921688688, |
| "eval_loss": 3.4272212982177734, |
| "eval_runtime": 13.1636, |
| "eval_samples_per_second": 75.967, |
| "eval_steps_per_second": 2.431, |
| "step": 5200 |
| }, |
| { |
| "epoch": 13.535288430551079, |
| "grad_norm": 0.7626827120967569, |
| "learning_rate": 7.475377130119553e-05, |
| "loss": 0.1836, |
| "step": 5250 |
| }, |
| { |
| "epoch": 13.66419593941347, |
| "grad_norm": 0.7817292246891677, |
| "learning_rate": 7.431323919990754e-05, |
| "loss": 0.1948, |
| "step": 5300 |
| }, |
| { |
| "epoch": 13.66419593941347, |
| "eval_loss": 3.4388325214385986, |
| "eval_runtime": 13.1888, |
| "eval_samples_per_second": 75.822, |
| "eval_steps_per_second": 2.426, |
| "step": 5300 |
| }, |
| { |
| "epoch": 13.793103448275861, |
| "grad_norm": 0.7362472448079689, |
| "learning_rate": 7.387023922664762e-05, |
| "loss": 0.2081, |
| "step": 5350 |
| }, |
| { |
| "epoch": 13.922010957138253, |
| "grad_norm": 0.7773529994490974, |
| "learning_rate": 7.342481729147485e-05, |
| "loss": 0.2165, |
| "step": 5400 |
| }, |
| { |
| "epoch": 13.922010957138253, |
| "eval_loss": 3.435514450073242, |
| "eval_runtime": 13.2029, |
| "eval_samples_per_second": 75.741, |
| "eval_steps_per_second": 2.424, |
| "step": 5400 |
| }, |
| { |
| "epoch": 14.050918466000645, |
| "grad_norm": 1.3925624599380586, |
| "learning_rate": 7.297701955544692e-05, |
| "loss": 0.1793, |
| "step": 5450 |
| }, |
| { |
| "epoch": 14.179825974863036, |
| "grad_norm": 0.6045993909446667, |
| "learning_rate": 7.252689242583643e-05, |
| "loss": 0.1302, |
| "step": 5500 |
| }, |
| { |
| "epoch": 14.179825974863036, |
| "eval_loss": 3.5325989723205566, |
| "eval_runtime": 13.2171, |
| "eval_samples_per_second": 75.659, |
| "eval_steps_per_second": 2.421, |
| "step": 5500 |
| }, |
| { |
| "epoch": 14.308733483725428, |
| "grad_norm": 0.6099737603899711, |
| "learning_rate": 7.20744825513213e-05, |
| "loss": 0.1265, |
| "step": 5550 |
| }, |
| { |
| "epoch": 14.437640992587818, |
| "grad_norm": 0.6596680228597308, |
| "learning_rate": 7.161983681715056e-05, |
| "loss": 0.138, |
| "step": 5600 |
| }, |
| { |
| "epoch": 14.437640992587818, |
| "eval_loss": 3.557699680328369, |
| "eval_runtime": 13.1774, |
| "eval_samples_per_second": 75.888, |
| "eval_steps_per_second": 2.428, |
| "step": 5600 |
| }, |
| { |
| "epoch": 14.56654850145021, |
| "grad_norm": 0.6445903882034174, |
| "learning_rate": 7.116300234028528e-05, |
| "loss": 0.1486, |
| "step": 5650 |
| }, |
| { |
| "epoch": 14.6954560103126, |
| "grad_norm": 0.6448511072922888, |
| "learning_rate": 7.070402646451566e-05, |
| "loss": 0.1569, |
| "step": 5700 |
| }, |
| { |
| "epoch": 14.6954560103126, |
| "eval_loss": 3.5597221851348877, |
| "eval_runtime": 13.1454, |
| "eval_samples_per_second": 76.072, |
| "eval_steps_per_second": 2.434, |
| "step": 5700 |
| }, |
| { |
| "epoch": 14.824363519174993, |
| "grad_norm": 0.623499885141096, |
| "learning_rate": 7.024295675555465e-05, |
| "loss": 0.1675, |
| "step": 5750 |
| }, |
| { |
| "epoch": 14.953271028037383, |
| "grad_norm": 0.6601246140904097, |
| "learning_rate": 6.977984099610842e-05, |
| "loss": 0.1757, |
| "step": 5800 |
| }, |
| { |
| "epoch": 14.953271028037383, |
| "eval_loss": 3.555185556411743, |
| "eval_runtime": 13.1511, |
| "eval_samples_per_second": 76.039, |
| "eval_steps_per_second": 2.433, |
| "step": 5800 |
| }, |
| { |
| "epoch": 15.082178536899775, |
| "grad_norm": 0.5535844816659106, |
| "learning_rate": 6.931472718092446e-05, |
| "loss": 0.1223, |
| "step": 5850 |
| }, |
| { |
| "epoch": 15.211086045762165, |
| "grad_norm": 0.4901789372000881, |
| "learning_rate": 6.88476635118177e-05, |
| "loss": 0.0964, |
| "step": 5900 |
| }, |
| { |
| "epoch": 15.211086045762165, |
| "eval_loss": 3.6443583965301514, |
| "eval_runtime": 13.1441, |
| "eval_samples_per_second": 76.08, |
| "eval_steps_per_second": 2.435, |
| "step": 5900 |
| }, |
| { |
| "epoch": 15.339993554624558, |
| "grad_norm": 0.8805753683037839, |
| "learning_rate": 6.837869839267507e-05, |
| "loss": 0.107, |
| "step": 5950 |
| }, |
| { |
| "epoch": 15.468901063486948, |
| "grad_norm": 0.6115833032151868, |
| "learning_rate": 6.790788042443924e-05, |
| "loss": 0.1157, |
| "step": 6000 |
| }, |
| { |
| "epoch": 15.468901063486948, |
| "eval_loss": 3.6541991233825684, |
| "eval_runtime": 13.1423, |
| "eval_samples_per_second": 76.09, |
| "eval_steps_per_second": 2.435, |
| "step": 6000 |
| }, |
| { |
| "epoch": 15.59780857234934, |
| "grad_norm": 0.5710489600928594, |
| "learning_rate": 6.743525840007191e-05, |
| "loss": 0.1228, |
| "step": 6050 |
| }, |
| { |
| "epoch": 15.72671608121173, |
| "grad_norm": 0.689652930712509, |
| "learning_rate": 6.69608812994971e-05, |
| "loss": 0.1293, |
| "step": 6100 |
| }, |
| { |
| "epoch": 15.72671608121173, |
| "eval_loss": 3.656620979309082, |
| "eval_runtime": 13.1483, |
| "eval_samples_per_second": 76.055, |
| "eval_steps_per_second": 2.434, |
| "step": 6100 |
| }, |
| { |
| "epoch": 15.855623590074122, |
| "grad_norm": 0.5914349974251379, |
| "learning_rate": 6.648479828452522e-05, |
| "loss": 0.135, |
| "step": 6150 |
| }, |
| { |
| "epoch": 15.984531098936513, |
| "grad_norm": 0.6189439108834661, |
| "learning_rate": 6.600705869375817e-05, |
| "loss": 0.1419, |
| "step": 6200 |
| }, |
| { |
| "epoch": 15.984531098936513, |
| "eval_loss": 3.671614170074463, |
| "eval_runtime": 13.1443, |
| "eval_samples_per_second": 76.078, |
| "eval_steps_per_second": 2.435, |
| "step": 6200 |
| }, |
| { |
| "epoch": 16.113438607798905, |
| "grad_norm": 0.4321088458532425, |
| "learning_rate": 6.55277120374762e-05, |
| "loss": 0.0842, |
| "step": 6250 |
| }, |
| { |
| "epoch": 16.242346116661295, |
| "grad_norm": 0.5785562511316525, |
| "learning_rate": 6.504680799250689e-05, |
| "loss": 0.0872, |
| "step": 6300 |
| }, |
| { |
| "epoch": 16.242346116661295, |
| "eval_loss": 3.7362146377563477, |
| "eval_runtime": 13.1708, |
| "eval_samples_per_second": 75.925, |
| "eval_steps_per_second": 2.43, |
| "step": 6300 |
| }, |
| { |
| "epoch": 16.371253625523686, |
| "grad_norm": 0.45371653083862784, |
| "learning_rate": 6.45643963970769e-05, |
| "loss": 0.0899, |
| "step": 6350 |
| }, |
| { |
| "epoch": 16.50016113438608, |
| "grad_norm": 0.5412656335319528, |
| "learning_rate": 6.408052724564714e-05, |
| "loss": 0.0954, |
| "step": 6400 |
| }, |
| { |
| "epoch": 16.50016113438608, |
| "eval_loss": 3.7513670921325684, |
| "eval_runtime": 13.1547, |
| "eval_samples_per_second": 76.018, |
| "eval_steps_per_second": 2.433, |
| "step": 6400 |
| }, |
| { |
| "epoch": 16.62906864324847, |
| "grad_norm": 0.6489716287488846, |
| "learning_rate": 6.359525068373147e-05, |
| "loss": 0.1021, |
| "step": 6450 |
| }, |
| { |
| "epoch": 16.75797615211086, |
| "grad_norm": 0.51515711941371, |
| "learning_rate": 6.310861700270001e-05, |
| "loss": 0.1074, |
| "step": 6500 |
| }, |
| { |
| "epoch": 16.75797615211086, |
| "eval_loss": 3.7568299770355225, |
| "eval_runtime": 13.1646, |
| "eval_samples_per_second": 75.961, |
| "eval_steps_per_second": 2.431, |
| "step": 6500 |
| }, |
| { |
| "epoch": 16.88688366097325, |
| "grad_norm": 0.5784472468074615, |
| "learning_rate": 6.262067663456714e-05, |
| "loss": 0.1119, |
| "step": 6550 |
| }, |
| { |
| "epoch": 17.015791169835644, |
| "grad_norm": 0.36703765035846453, |
| "learning_rate": 6.2131480146765e-05, |
| "loss": 0.1089, |
| "step": 6600 |
| }, |
| { |
| "epoch": 17.015791169835644, |
| "eval_loss": 3.8403706550598145, |
| "eval_runtime": 13.14, |
| "eval_samples_per_second": 76.103, |
| "eval_steps_per_second": 2.435, |
| "step": 6600 |
| }, |
| { |
| "epoch": 17.144698678698035, |
| "grad_norm": 0.473234963059124, |
| "learning_rate": 6.164107823690311e-05, |
| "loss": 0.0653, |
| "step": 6650 |
| }, |
| { |
| "epoch": 17.273606187560425, |
| "grad_norm": 0.4495142121889821, |
| "learning_rate": 6.11495217275142e-05, |
| "loss": 0.071, |
| "step": 6700 |
| }, |
| { |
| "epoch": 17.273606187560425, |
| "eval_loss": 3.830505609512329, |
| "eval_runtime": 13.1641, |
| "eval_samples_per_second": 75.964, |
| "eval_steps_per_second": 2.431, |
| "step": 6700 |
| }, |
| { |
| "epoch": 17.402513696422815, |
| "grad_norm": 0.47554094680025083, |
| "learning_rate": 6.065686156078723e-05, |
| "loss": 0.0758, |
| "step": 6750 |
| }, |
| { |
| "epoch": 17.53142120528521, |
| "grad_norm": 0.44446520713729815, |
| "learning_rate": 6.0163148793288135e-05, |
| "loss": 0.0803, |
| "step": 6800 |
| }, |
| { |
| "epoch": 17.53142120528521, |
| "eval_loss": 3.8333582878112793, |
| "eval_runtime": 13.3574, |
| "eval_samples_per_second": 74.865, |
| "eval_steps_per_second": 2.396, |
| "step": 6800 |
| }, |
| { |
| "epoch": 17.6603287141476, |
| "grad_norm": 0.5076778674223996, |
| "learning_rate": 5.966843459066858e-05, |
| "loss": 0.0847, |
| "step": 6850 |
| }, |
| { |
| "epoch": 17.78923622300999, |
| "grad_norm": 0.49074606040336083, |
| "learning_rate": 5.917277022236333e-05, |
| "loss": 0.0882, |
| "step": 6900 |
| }, |
| { |
| "epoch": 17.78923622300999, |
| "eval_loss": 3.840571403503418, |
| "eval_runtime": 13.1466, |
| "eval_samples_per_second": 76.065, |
| "eval_steps_per_second": 2.434, |
| "step": 6900 |
| }, |
| { |
| "epoch": 17.91814373187238, |
| "grad_norm": 0.5550690055495523, |
| "learning_rate": 5.86762070562771e-05, |
| "loss": 0.0927, |
| "step": 6950 |
| }, |
| { |
| "epoch": 18.047051240734774, |
| "grad_norm": 0.37606709531546206, |
| "learning_rate": 5.817879655346103e-05, |
| "loss": 0.0805, |
| "step": 7000 |
| }, |
| { |
| "epoch": 18.047051240734774, |
| "eval_loss": 3.8941986560821533, |
| "eval_runtime": 13.1572, |
| "eval_samples_per_second": 76.004, |
| "eval_steps_per_second": 2.432, |
| "step": 7000 |
| }, |
| { |
| "epoch": 18.175958749597164, |
| "grad_norm": 0.48969762050004223, |
| "learning_rate": 5.7680590262779535e-05, |
| "loss": 0.0561, |
| "step": 7050 |
| }, |
| { |
| "epoch": 18.304866258459555, |
| "grad_norm": 0.43070776806915745, |
| "learning_rate": 5.718163981556802e-05, |
| "loss": 0.061, |
| "step": 7100 |
| }, |
| { |
| "epoch": 18.304866258459555, |
| "eval_loss": 3.9117181301116943, |
| "eval_runtime": 13.1597, |
| "eval_samples_per_second": 75.99, |
| "eval_steps_per_second": 2.432, |
| "step": 7100 |
| }, |
| { |
| "epoch": 18.433773767321945, |
| "grad_norm": 0.42717221620170337, |
| "learning_rate": 5.6681996920282174e-05, |
| "loss": 0.0649, |
| "step": 7150 |
| }, |
| { |
| "epoch": 18.56268127618434, |
| "grad_norm": 0.5194058540782253, |
| "learning_rate": 5.6181713357139184e-05, |
| "loss": 0.0682, |
| "step": 7200 |
| }, |
| { |
| "epoch": 18.56268127618434, |
| "eval_loss": 3.901904821395874, |
| "eval_runtime": 13.1719, |
| "eval_samples_per_second": 75.919, |
| "eval_steps_per_second": 2.429, |
| "step": 7200 |
| } |
| ], |
| "logging_steps": 50, |
| "max_steps": 15480, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 40, |
| "save_steps": 800, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": false |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 6402735570157568.0, |
| "train_batch_size": 4, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|