{ "best_metric": 1.9069808721542358, "best_model_checkpoint": "miner_id_24/checkpoint-100", "epoch": 0.11590843233845262, "eval_steps": 50, "global_step": 100, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0011590843233845263, "grad_norm": 0.5617161989212036, "learning_rate": 7e-06, "loss": 2.0317, "step": 1 }, { "epoch": 0.0011590843233845263, "eval_loss": 2.8248138427734375, "eval_runtime": 101.3167, "eval_samples_per_second": 14.341, "eval_steps_per_second": 3.593, "step": 1 }, { "epoch": 0.0023181686467690526, "grad_norm": 0.8308987617492676, "learning_rate": 1.4e-05, "loss": 1.8377, "step": 2 }, { "epoch": 0.0034772529701535787, "grad_norm": 0.7668841481208801, "learning_rate": 2.1e-05, "loss": 2.1166, "step": 3 }, { "epoch": 0.004636337293538105, "grad_norm": 0.7772699594497681, "learning_rate": 2.8e-05, "loss": 2.3383, "step": 4 }, { "epoch": 0.005795421616922631, "grad_norm": 0.8564109206199646, "learning_rate": 3.5e-05, "loss": 2.247, "step": 5 }, { "epoch": 0.006954505940307157, "grad_norm": 0.9142338037490845, "learning_rate": 4.2e-05, "loss": 2.0694, "step": 6 }, { "epoch": 0.008113590263691683, "grad_norm": 0.9802976846694946, "learning_rate": 4.899999999999999e-05, "loss": 2.1744, "step": 7 }, { "epoch": 0.00927267458707621, "grad_norm": 0.9551035761833191, "learning_rate": 5.6e-05, "loss": 1.9839, "step": 8 }, { "epoch": 0.010431758910460736, "grad_norm": 1.0417977571487427, "learning_rate": 6.3e-05, "loss": 2.0927, "step": 9 }, { "epoch": 0.011590843233845263, "grad_norm": 0.8984870910644531, "learning_rate": 7e-05, "loss": 1.8616, "step": 10 }, { "epoch": 0.012749927557229788, "grad_norm": 0.8334612846374512, "learning_rate": 6.999521567473641e-05, "loss": 1.9348, "step": 11 }, { "epoch": 0.013909011880614315, "grad_norm": 1.0292818546295166, "learning_rate": 6.998086400693241e-05, "loss": 2.0118, "step": 12 }, { "epoch": 0.015068096203998842, "grad_norm": 0.9132320880889893, "learning_rate": 6.995694892019065e-05, "loss": 1.7204, "step": 13 }, { "epoch": 0.016227180527383367, "grad_norm": 0.9421163201332092, "learning_rate": 6.99234769526571e-05, "loss": 1.9112, "step": 14 }, { "epoch": 0.017386264850767892, "grad_norm": 1.0101693868637085, "learning_rate": 6.988045725523343e-05, "loss": 1.6642, "step": 15 }, { "epoch": 0.01854534917415242, "grad_norm": 1.0200189352035522, "learning_rate": 6.982790158907539e-05, "loss": 1.8958, "step": 16 }, { "epoch": 0.019704433497536946, "grad_norm": 1.120744228363037, "learning_rate": 6.976582432237733e-05, "loss": 1.8165, "step": 17 }, { "epoch": 0.02086351782092147, "grad_norm": 1.001584529876709, "learning_rate": 6.969424242644413e-05, "loss": 1.8139, "step": 18 }, { "epoch": 0.022022602144306, "grad_norm": 0.9849500060081482, "learning_rate": 6.961317547105138e-05, "loss": 1.7734, "step": 19 }, { "epoch": 0.023181686467690525, "grad_norm": 0.9495387673377991, "learning_rate": 6.952264561909527e-05, "loss": 1.5883, "step": 20 }, { "epoch": 0.02434077079107505, "grad_norm": 1.0540260076522827, "learning_rate": 6.942267762053337e-05, "loss": 1.8574, "step": 21 }, { "epoch": 0.025499855114459576, "grad_norm": 0.9781659841537476, "learning_rate": 6.931329880561832e-05, "loss": 1.6139, "step": 22 }, { "epoch": 0.026658939437844104, "grad_norm": 0.9468351602554321, "learning_rate": 6.919453907742597e-05, "loss": 1.7195, "step": 23 }, { "epoch": 0.02781802376122863, "grad_norm": 1.0345453023910522, "learning_rate": 6.90664309036802e-05, "loss": 1.9237, "step": 24 }, { "epoch": 0.028977108084613155, "grad_norm": 1.0196911096572876, "learning_rate": 6.892900930787656e-05, "loss": 1.8853, "step": 25 }, { "epoch": 0.030136192407997683, "grad_norm": 1.1035205125808716, "learning_rate": 6.87823118597072e-05, "loss": 1.7198, "step": 26 }, { "epoch": 0.03129527673138221, "grad_norm": 1.0238853693008423, "learning_rate": 6.862637866478969e-05, "loss": 1.8854, "step": 27 }, { "epoch": 0.032454361054766734, "grad_norm": 1.1377280950546265, "learning_rate": 6.846125235370252e-05, "loss": 2.0783, "step": 28 }, { "epoch": 0.03361344537815126, "grad_norm": 1.3032432794570923, "learning_rate": 6.828697807033038e-05, "loss": 2.0572, "step": 29 }, { "epoch": 0.034772529701535784, "grad_norm": 1.033238172531128, "learning_rate": 6.81036034595222e-05, "loss": 1.7329, "step": 30 }, { "epoch": 0.035931614024920316, "grad_norm": 1.0275241136550903, "learning_rate": 6.791117865406564e-05, "loss": 1.682, "step": 31 }, { "epoch": 0.03709069834830484, "grad_norm": 1.0417641401290894, "learning_rate": 6.770975626098112e-05, "loss": 1.9175, "step": 32 }, { "epoch": 0.03824978267168937, "grad_norm": 1.2844064235687256, "learning_rate": 6.749939134713974e-05, "loss": 2.0107, "step": 33 }, { "epoch": 0.03940886699507389, "grad_norm": 1.2008929252624512, "learning_rate": 6.728014142420846e-05, "loss": 1.9569, "step": 34 }, { "epoch": 0.04056795131845842, "grad_norm": 1.2086220979690552, "learning_rate": 6.7052066432927e-05, "loss": 2.0818, "step": 35 }, { "epoch": 0.04172703564184294, "grad_norm": 1.1457483768463135, "learning_rate": 6.681522872672069e-05, "loss": 2.002, "step": 36 }, { "epoch": 0.04288611996522747, "grad_norm": 1.1261320114135742, "learning_rate": 6.656969305465356e-05, "loss": 1.7857, "step": 37 }, { "epoch": 0.044045204288612, "grad_norm": 1.1614913940429688, "learning_rate": 6.631552654372672e-05, "loss": 1.9917, "step": 38 }, { "epoch": 0.045204288611996525, "grad_norm": 1.1968772411346436, "learning_rate": 6.60527986805264e-05, "loss": 1.9252, "step": 39 }, { "epoch": 0.04636337293538105, "grad_norm": 1.3660227060317993, "learning_rate": 6.578158129222711e-05, "loss": 2.0329, "step": 40 }, { "epoch": 0.047522457258765576, "grad_norm": 1.332165241241455, "learning_rate": 6.550194852695469e-05, "loss": 2.1746, "step": 41 }, { "epoch": 0.0486815415821501, "grad_norm": 1.243107557296753, "learning_rate": 6.521397683351509e-05, "loss": 2.0625, "step": 42 }, { "epoch": 0.049840625905534626, "grad_norm": 1.33090341091156, "learning_rate": 6.491774494049386e-05, "loss": 2.2343, "step": 43 }, { "epoch": 0.05099971022891915, "grad_norm": 1.3284821510314941, "learning_rate": 6.461333383473272e-05, "loss": 1.9925, "step": 44 }, { "epoch": 0.05215879455230368, "grad_norm": 1.4600505828857422, "learning_rate": 6.430082673918849e-05, "loss": 1.8349, "step": 45 }, { "epoch": 0.05331787887568821, "grad_norm": 1.3876497745513916, "learning_rate": 6.398030909018069e-05, "loss": 1.8771, "step": 46 }, { "epoch": 0.054476963199072734, "grad_norm": 1.5812242031097412, "learning_rate": 6.365186851403423e-05, "loss": 2.1935, "step": 47 }, { "epoch": 0.05563604752245726, "grad_norm": 1.8776988983154297, "learning_rate": 6.331559480312315e-05, "loss": 2.2423, "step": 48 }, { "epoch": 0.056795131845841784, "grad_norm": 1.9295244216918945, "learning_rate": 6.297157989132236e-05, "loss": 2.339, "step": 49 }, { "epoch": 0.05795421616922631, "grad_norm": 3.2445361614227295, "learning_rate": 6.261991782887377e-05, "loss": 2.8354, "step": 50 }, { "epoch": 0.05795421616922631, "eval_loss": 2.070936918258667, "eval_runtime": 103.0085, "eval_samples_per_second": 14.106, "eval_steps_per_second": 3.534, "step": 50 }, { "epoch": 0.059113300492610835, "grad_norm": 2.1962857246398926, "learning_rate": 6.226070475667393e-05, "loss": 1.749, "step": 51 }, { "epoch": 0.06027238481599537, "grad_norm": 2.2130725383758545, "learning_rate": 6.189403887999006e-05, "loss": 1.6955, "step": 52 }, { "epoch": 0.06143146913937989, "grad_norm": 1.676161766052246, "learning_rate": 6.152002044161171e-05, "loss": 1.8295, "step": 53 }, { "epoch": 0.06259055346276442, "grad_norm": 1.1914523839950562, "learning_rate": 6.113875169444539e-05, "loss": 1.869, "step": 54 }, { "epoch": 0.06374963778614894, "grad_norm": 0.9858117699623108, "learning_rate": 6.0750336873559605e-05, "loss": 1.9403, "step": 55 }, { "epoch": 0.06490872210953347, "grad_norm": 0.93446284532547, "learning_rate": 6.035488216768811e-05, "loss": 1.7909, "step": 56 }, { "epoch": 0.066067806432918, "grad_norm": 0.7381186485290527, "learning_rate": 5.9952495690198894e-05, "loss": 1.5857, "step": 57 }, { "epoch": 0.06722689075630252, "grad_norm": 0.8235486149787903, "learning_rate": 5.954328744953709e-05, "loss": 1.7983, "step": 58 }, { "epoch": 0.06838597507968705, "grad_norm": 0.7572500109672546, "learning_rate": 5.91273693191498e-05, "loss": 1.6261, "step": 59 }, { "epoch": 0.06954505940307157, "grad_norm": 0.9166513085365295, "learning_rate": 5.870485500690094e-05, "loss": 1.8126, "step": 60 }, { "epoch": 0.0707041437264561, "grad_norm": 0.887972354888916, "learning_rate": 5.827586002398468e-05, "loss": 1.6087, "step": 61 }, { "epoch": 0.07186322804984063, "grad_norm": 0.817246675491333, "learning_rate": 5.784050165334589e-05, "loss": 1.8542, "step": 62 }, { "epoch": 0.07302231237322515, "grad_norm": 1.115594506263733, "learning_rate": 5.739889891761608e-05, "loss": 1.5087, "step": 63 }, { "epoch": 0.07418139669660968, "grad_norm": 0.8168441653251648, "learning_rate": 5.6951172546573794e-05, "loss": 1.6609, "step": 64 }, { "epoch": 0.0753404810199942, "grad_norm": 0.9525291919708252, "learning_rate": 5.6497444944138376e-05, "loss": 1.9454, "step": 65 }, { "epoch": 0.07649956534337873, "grad_norm": 0.943900465965271, "learning_rate": 5.603784015490587e-05, "loss": 1.6792, "step": 66 }, { "epoch": 0.07765864966676325, "grad_norm": 0.9026935696601868, "learning_rate": 5.557248383023655e-05, "loss": 1.7305, "step": 67 }, { "epoch": 0.07881773399014778, "grad_norm": 0.9322032332420349, "learning_rate": 5.510150319390302e-05, "loss": 1.7397, "step": 68 }, { "epoch": 0.07997681831353232, "grad_norm": 0.8686115145683289, "learning_rate": 5.4625027007308546e-05, "loss": 1.7237, "step": 69 }, { "epoch": 0.08113590263691683, "grad_norm": 0.9351975321769714, "learning_rate": 5.414318553428494e-05, "loss": 1.8886, "step": 70 }, { "epoch": 0.08229498696030137, "grad_norm": 0.974967360496521, "learning_rate": 5.3656110505479776e-05, "loss": 1.9276, "step": 71 }, { "epoch": 0.08345407128368589, "grad_norm": 0.9757768511772156, "learning_rate": 5.316393508234253e-05, "loss": 1.9968, "step": 72 }, { "epoch": 0.08461315560707042, "grad_norm": 1.1062190532684326, "learning_rate": 5.266679382071953e-05, "loss": 1.5988, "step": 73 }, { "epoch": 0.08577223993045494, "grad_norm": 0.9316264390945435, "learning_rate": 5.216482263406778e-05, "loss": 1.9706, "step": 74 }, { "epoch": 0.08693132425383947, "grad_norm": 0.9845229983329773, "learning_rate": 5.1658158756297576e-05, "loss": 1.8155, "step": 75 }, { "epoch": 0.088090408577224, "grad_norm": 1.0393840074539185, "learning_rate": 5.114694070425407e-05, "loss": 1.9335, "step": 76 }, { "epoch": 0.08924949290060852, "grad_norm": 1.023858666419983, "learning_rate": 5.063130823984823e-05, "loss": 1.9187, "step": 77 }, { "epoch": 0.09040857722399305, "grad_norm": 0.8370853066444397, "learning_rate": 5.011140233184724e-05, "loss": 1.7654, "step": 78 }, { "epoch": 0.09156766154737757, "grad_norm": 1.108378529548645, "learning_rate": 4.958736511733516e-05, "loss": 1.7187, "step": 79 }, { "epoch": 0.0927267458707621, "grad_norm": 1.0803954601287842, "learning_rate": 4.905933986285393e-05, "loss": 1.8403, "step": 80 }, { "epoch": 0.09388583019414662, "grad_norm": 0.8947066068649292, "learning_rate": 4.8527470925235824e-05, "loss": 1.888, "step": 81 }, { "epoch": 0.09504491451753115, "grad_norm": 1.0540757179260254, "learning_rate": 4.799190371213772e-05, "loss": 1.8883, "step": 82 }, { "epoch": 0.09620399884091568, "grad_norm": 0.9781203866004944, "learning_rate": 4.745278464228808e-05, "loss": 1.8643, "step": 83 }, { "epoch": 0.0973630831643002, "grad_norm": 0.9711923599243164, "learning_rate": 4.69102611054575e-05, "loss": 1.8855, "step": 84 }, { "epoch": 0.09852216748768473, "grad_norm": 1.0181244611740112, "learning_rate": 4.6364481422163926e-05, "loss": 1.9491, "step": 85 }, { "epoch": 0.09968125181106925, "grad_norm": 1.0562760829925537, "learning_rate": 4.581559480312316e-05, "loss": 1.7729, "step": 86 }, { "epoch": 0.10084033613445378, "grad_norm": 1.028149127960205, "learning_rate": 4.526375130845627e-05, "loss": 1.8674, "step": 87 }, { "epoch": 0.1019994204578383, "grad_norm": 1.125438928604126, "learning_rate": 4.4709101806664554e-05, "loss": 2.0341, "step": 88 }, { "epoch": 0.10315850478122283, "grad_norm": 1.123214602470398, "learning_rate": 4.4151797933383685e-05, "loss": 2.117, "step": 89 }, { "epoch": 0.10431758910460737, "grad_norm": 1.0544837713241577, "learning_rate": 4.359199204992797e-05, "loss": 1.9251, "step": 90 }, { "epoch": 0.10547667342799188, "grad_norm": 1.189324140548706, "learning_rate": 4.30298372016363e-05, "loss": 2.0538, "step": 91 }, { "epoch": 0.10663575775137642, "grad_norm": 1.275004506111145, "learning_rate": 4.246548707603114e-05, "loss": 1.9864, "step": 92 }, { "epoch": 0.10779484207476094, "grad_norm": 1.2068434953689575, "learning_rate": 4.1899095960801805e-05, "loss": 1.9636, "step": 93 }, { "epoch": 0.10895392639814547, "grad_norm": 1.2466081380844116, "learning_rate": 4.133081870162385e-05, "loss": 2.1275, "step": 94 }, { "epoch": 0.11011301072152999, "grad_norm": 1.2089381217956543, "learning_rate": 4.076081065982569e-05, "loss": 2.2161, "step": 95 }, { "epoch": 0.11127209504491452, "grad_norm": 1.4395438432693481, "learning_rate": 4.018922766991447e-05, "loss": 2.0683, "step": 96 }, { "epoch": 0.11243117936829905, "grad_norm": 1.6649994850158691, "learning_rate": 3.961622599697241e-05, "loss": 2.2035, "step": 97 }, { "epoch": 0.11359026369168357, "grad_norm": 1.4525130987167358, "learning_rate": 3.9041962293935516e-05, "loss": 2.411, "step": 98 }, { "epoch": 0.1147493480150681, "grad_norm": 1.8260668516159058, "learning_rate": 3.84665935587662e-05, "loss": 2.367, "step": 99 }, { "epoch": 0.11590843233845262, "grad_norm": 3.302351951599121, "learning_rate": 3.7890277091531636e-05, "loss": 3.2636, "step": 100 }, { "epoch": 0.11590843233845262, "eval_loss": 1.9069808721542358, "eval_runtime": 102.9577, "eval_samples_per_second": 14.113, "eval_steps_per_second": 3.535, "step": 100 } ], "logging_steps": 1, "max_steps": 200, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 50, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 4, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 0 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.42188868534272e+17, "train_batch_size": 8, "trial_name": null, "trial_params": null }