cimol's picture
Training in progress, step 200, checkpoint
6d8e859 verified
Raw History Blame Contribute Delete
36.9 kB
{
"best_metric": 0.9832578301429749,
"best_model_checkpoint": "miner_id_24/checkpoint-200",
"epoch": 0.015401794309037002,
"eval_steps": 50,
"global_step": 200,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 7.700897154518502e-05,
"grad_norm": 1.8970366716384888,
"learning_rate": 7e-06,
"loss": 0.8107,
"step": 1
},
{
"epoch": 7.700897154518502e-05,
"eval_loss": 1.603941559791565,
"eval_runtime": 844.3836,
"eval_samples_per_second": 25.902,
"eval_steps_per_second": 6.476,
"step": 1
},
{
"epoch": 0.00015401794309037004,
"grad_norm": 2.7837564945220947,
"learning_rate": 1.4e-05,
"loss": 1.2198,
"step": 2
},
{
"epoch": 0.00023102691463555504,
"grad_norm": 3.092777729034424,
"learning_rate": 2.1e-05,
"loss": 1.302,
"step": 3
},
{
"epoch": 0.0003080358861807401,
"grad_norm": 3.1793932914733887,
"learning_rate": 2.8e-05,
"loss": 1.3824,
"step": 4
},
{
"epoch": 0.0003850448577259251,
"grad_norm": 2.5381124019622803,
"learning_rate": 3.5e-05,
"loss": 1.3184,
"step": 5
},
{
"epoch": 0.0004620538292711101,
"grad_norm": 1.6639097929000854,
"learning_rate": 4.2e-05,
"loss": 0.9797,
"step": 6
},
{
"epoch": 0.0005390628008162951,
"grad_norm": 1.49283766746521,
"learning_rate": 4.899999999999999e-05,
"loss": 0.9926,
"step": 7
},
{
"epoch": 0.0006160717723614802,
"grad_norm": 1.2911243438720703,
"learning_rate": 5.6e-05,
"loss": 0.9673,
"step": 8
},
{
"epoch": 0.0006930807439066651,
"grad_norm": 1.0811328887939453,
"learning_rate": 6.3e-05,
"loss": 1.0625,
"step": 9
},
{
"epoch": 0.0007700897154518502,
"grad_norm": 1.1771808862686157,
"learning_rate": 7e-05,
"loss": 0.9455,
"step": 10
},
{
"epoch": 0.0008470986869970351,
"grad_norm": 1.1715754270553589,
"learning_rate": 6.999521567473641e-05,
"loss": 0.9732,
"step": 11
},
{
"epoch": 0.0009241076585422202,
"grad_norm": 1.0655852556228638,
"learning_rate": 6.998086400693241e-05,
"loss": 1.0272,
"step": 12
},
{
"epoch": 0.0010011166300874052,
"grad_norm": 1.2130272388458252,
"learning_rate": 6.995694892019065e-05,
"loss": 0.9886,
"step": 13
},
{
"epoch": 0.0010781256016325902,
"grad_norm": 0.9644531607627869,
"learning_rate": 6.99234769526571e-05,
"loss": 1.0628,
"step": 14
},
{
"epoch": 0.0011551345731777751,
"grad_norm": 0.9874843955039978,
"learning_rate": 6.988045725523343e-05,
"loss": 0.9652,
"step": 15
},
{
"epoch": 0.0012321435447229603,
"grad_norm": 0.887622594833374,
"learning_rate": 6.982790158907539e-05,
"loss": 0.8977,
"step": 16
},
{
"epoch": 0.0013091525162681453,
"grad_norm": 1.0247609615325928,
"learning_rate": 6.976582432237733e-05,
"loss": 1.0614,
"step": 17
},
{
"epoch": 0.0013861614878133302,
"grad_norm": 0.8926209211349487,
"learning_rate": 6.969424242644413e-05,
"loss": 0.9281,
"step": 18
},
{
"epoch": 0.0014631704593585152,
"grad_norm": 0.9736675024032593,
"learning_rate": 6.961317547105138e-05,
"loss": 1.0557,
"step": 19
},
{
"epoch": 0.0015401794309037003,
"grad_norm": 0.9907094836235046,
"learning_rate": 6.952264561909527e-05,
"loss": 1.0623,
"step": 20
},
{
"epoch": 0.0016171884024488853,
"grad_norm": 0.9420015811920166,
"learning_rate": 6.942267762053337e-05,
"loss": 0.9555,
"step": 21
},
{
"epoch": 0.0016941973739940702,
"grad_norm": 0.9477255344390869,
"learning_rate": 6.931329880561832e-05,
"loss": 0.9083,
"step": 22
},
{
"epoch": 0.0017712063455392554,
"grad_norm": 1.0044710636138916,
"learning_rate": 6.919453907742597e-05,
"loss": 1.1097,
"step": 23
},
{
"epoch": 0.0018482153170844404,
"grad_norm": 1.058323621749878,
"learning_rate": 6.90664309036802e-05,
"loss": 1.1576,
"step": 24
},
{
"epoch": 0.0019252242886296253,
"grad_norm": 1.0781478881835938,
"learning_rate": 6.892900930787656e-05,
"loss": 1.0734,
"step": 25
},
{
"epoch": 0.0020022332601748105,
"grad_norm": 0.9603778719902039,
"learning_rate": 6.87823118597072e-05,
"loss": 0.9945,
"step": 26
},
{
"epoch": 0.0020792422317199954,
"grad_norm": 1.0233170986175537,
"learning_rate": 6.862637866478969e-05,
"loss": 1.0557,
"step": 27
},
{
"epoch": 0.0021562512032651804,
"grad_norm": 1.1913679838180542,
"learning_rate": 6.846125235370252e-05,
"loss": 1.1243,
"step": 28
},
{
"epoch": 0.0022332601748103653,
"grad_norm": 1.0753092765808105,
"learning_rate": 6.828697807033038e-05,
"loss": 1.2218,
"step": 29
},
{
"epoch": 0.0023102691463555503,
"grad_norm": 1.134995937347412,
"learning_rate": 6.81036034595222e-05,
"loss": 1.2743,
"step": 30
},
{
"epoch": 0.0023872781179007352,
"grad_norm": 1.2747467756271362,
"learning_rate": 6.791117865406564e-05,
"loss": 1.4711,
"step": 31
},
{
"epoch": 0.0024642870894459206,
"grad_norm": 1.3587024211883545,
"learning_rate": 6.770975626098112e-05,
"loss": 1.4346,
"step": 32
},
{
"epoch": 0.0025412960609911056,
"grad_norm": 1.485734224319458,
"learning_rate": 6.749939134713974e-05,
"loss": 1.2971,
"step": 33
},
{
"epoch": 0.0026183050325362905,
"grad_norm": 1.4099006652832031,
"learning_rate": 6.728014142420846e-05,
"loss": 1.2941,
"step": 34
},
{
"epoch": 0.0026953140040814755,
"grad_norm": 1.4036692380905151,
"learning_rate": 6.7052066432927e-05,
"loss": 1.3239,
"step": 35
},
{
"epoch": 0.0027723229756266604,
"grad_norm": 1.4389519691467285,
"learning_rate": 6.681522872672069e-05,
"loss": 1.3555,
"step": 36
},
{
"epoch": 0.0028493319471718454,
"grad_norm": 1.5032252073287964,
"learning_rate": 6.656969305465356e-05,
"loss": 1.4509,
"step": 37
},
{
"epoch": 0.0029263409187170303,
"grad_norm": 1.5099583864212036,
"learning_rate": 6.631552654372672e-05,
"loss": 1.3057,
"step": 38
},
{
"epoch": 0.0030033498902622157,
"grad_norm": 1.5861775875091553,
"learning_rate": 6.60527986805264e-05,
"loss": 1.2474,
"step": 39
},
{
"epoch": 0.0030803588618074007,
"grad_norm": 1.465627908706665,
"learning_rate": 6.578158129222711e-05,
"loss": 1.1795,
"step": 40
},
{
"epoch": 0.0031573678333525856,
"grad_norm": 1.4940845966339111,
"learning_rate": 6.550194852695469e-05,
"loss": 1.1043,
"step": 41
},
{
"epoch": 0.0032343768048977706,
"grad_norm": 1.6645580530166626,
"learning_rate": 6.521397683351509e-05,
"loss": 1.2097,
"step": 42
},
{
"epoch": 0.0033113857764429555,
"grad_norm": 1.7047836780548096,
"learning_rate": 6.491774494049386e-05,
"loss": 1.1764,
"step": 43
},
{
"epoch": 0.0033883947479881405,
"grad_norm": 1.7463964223861694,
"learning_rate": 6.461333383473272e-05,
"loss": 1.1972,
"step": 44
},
{
"epoch": 0.0034654037195333254,
"grad_norm": 1.8505029678344727,
"learning_rate": 6.430082673918849e-05,
"loss": 1.1955,
"step": 45
},
{
"epoch": 0.003542412691078511,
"grad_norm": 2.208298921585083,
"learning_rate": 6.398030909018069e-05,
"loss": 1.2783,
"step": 46
},
{
"epoch": 0.0036194216626236958,
"grad_norm": 2.1390464305877686,
"learning_rate": 6.365186851403423e-05,
"loss": 1.2488,
"step": 47
},
{
"epoch": 0.0036964306341688807,
"grad_norm": 2.516023874282837,
"learning_rate": 6.331559480312315e-05,
"loss": 1.2666,
"step": 48
},
{
"epoch": 0.0037734396057140657,
"grad_norm": 2.705584764480591,
"learning_rate": 6.297157989132236e-05,
"loss": 1.1743,
"step": 49
},
{
"epoch": 0.0038504485772592506,
"grad_norm": 3.8397316932678223,
"learning_rate": 6.261991782887377e-05,
"loss": 0.974,
"step": 50
},
{
"epoch": 0.0038504485772592506,
"eval_loss": 1.1016550064086914,
"eval_runtime": 849.689,
"eval_samples_per_second": 25.74,
"eval_steps_per_second": 6.435,
"step": 50
},
{
"epoch": 0.003927457548804436,
"grad_norm": 0.8057467937469482,
"learning_rate": 6.226070475667393e-05,
"loss": 0.6987,
"step": 51
},
{
"epoch": 0.004004466520349621,
"grad_norm": 0.9255357384681702,
"learning_rate": 6.189403887999006e-05,
"loss": 0.7462,
"step": 52
},
{
"epoch": 0.0040814754918948055,
"grad_norm": 1.2753374576568604,
"learning_rate": 6.152002044161171e-05,
"loss": 1.073,
"step": 53
},
{
"epoch": 0.004158484463439991,
"grad_norm": 0.8313521146774292,
"learning_rate": 6.113875169444539e-05,
"loss": 0.8174,
"step": 54
},
{
"epoch": 0.004235493434985175,
"grad_norm": 0.7349550127983093,
"learning_rate": 6.0750336873559605e-05,
"loss": 0.7324,
"step": 55
},
{
"epoch": 0.004312502406530361,
"grad_norm": 0.7651317715644836,
"learning_rate": 6.035488216768811e-05,
"loss": 0.7832,
"step": 56
},
{
"epoch": 0.004389511378075546,
"grad_norm": 0.7619487643241882,
"learning_rate": 5.9952495690198894e-05,
"loss": 0.8808,
"step": 57
},
{
"epoch": 0.004466520349620731,
"grad_norm": 0.650001049041748,
"learning_rate": 5.954328744953709e-05,
"loss": 0.7383,
"step": 58
},
{
"epoch": 0.004543529321165916,
"grad_norm": 0.7676343321800232,
"learning_rate": 5.91273693191498e-05,
"loss": 0.818,
"step": 59
},
{
"epoch": 0.004620538292711101,
"grad_norm": 0.7854016423225403,
"learning_rate": 5.870485500690094e-05,
"loss": 0.7568,
"step": 60
},
{
"epoch": 0.004697547264256286,
"grad_norm": 0.7838364243507385,
"learning_rate": 5.827586002398468e-05,
"loss": 0.855,
"step": 61
},
{
"epoch": 0.0047745562358014705,
"grad_norm": 0.7832164168357849,
"learning_rate": 5.784050165334589e-05,
"loss": 0.8511,
"step": 62
},
{
"epoch": 0.004851565207346656,
"grad_norm": 0.8185941576957703,
"learning_rate": 5.739889891761608e-05,
"loss": 0.8786,
"step": 63
},
{
"epoch": 0.004928574178891841,
"grad_norm": 0.7806155681610107,
"learning_rate": 5.6951172546573794e-05,
"loss": 0.8636,
"step": 64
},
{
"epoch": 0.005005583150437026,
"grad_norm": 0.8430364727973938,
"learning_rate": 5.6497444944138376e-05,
"loss": 0.8814,
"step": 65
},
{
"epoch": 0.005082592121982211,
"grad_norm": 0.7783248424530029,
"learning_rate": 5.603784015490587e-05,
"loss": 0.7728,
"step": 66
},
{
"epoch": 0.005159601093527396,
"grad_norm": 0.9018055200576782,
"learning_rate": 5.557248383023655e-05,
"loss": 0.9196,
"step": 67
},
{
"epoch": 0.005236610065072581,
"grad_norm": 0.7902474999427795,
"learning_rate": 5.510150319390302e-05,
"loss": 0.8653,
"step": 68
},
{
"epoch": 0.005313619036617766,
"grad_norm": 0.9198923110961914,
"learning_rate": 5.4625027007308546e-05,
"loss": 0.933,
"step": 69
},
{
"epoch": 0.005390628008162951,
"grad_norm": 0.8455578684806824,
"learning_rate": 5.414318553428494e-05,
"loss": 0.9384,
"step": 70
},
{
"epoch": 0.005467636979708136,
"grad_norm": 0.9272430539131165,
"learning_rate": 5.3656110505479776e-05,
"loss": 0.9889,
"step": 71
},
{
"epoch": 0.005544645951253321,
"grad_norm": 0.8100258708000183,
"learning_rate": 5.316393508234253e-05,
"loss": 0.9286,
"step": 72
},
{
"epoch": 0.005621654922798506,
"grad_norm": 0.9197900295257568,
"learning_rate": 5.266679382071953e-05,
"loss": 0.9884,
"step": 73
},
{
"epoch": 0.005698663894343691,
"grad_norm": 0.963314414024353,
"learning_rate": 5.216482263406778e-05,
"loss": 0.9356,
"step": 74
},
{
"epoch": 0.005775672865888876,
"grad_norm": 0.9361957311630249,
"learning_rate": 5.1658158756297576e-05,
"loss": 1.0434,
"step": 75
},
{
"epoch": 0.005852681837434061,
"grad_norm": 1.0076184272766113,
"learning_rate": 5.114694070425407e-05,
"loss": 1.0363,
"step": 76
},
{
"epoch": 0.005929690808979246,
"grad_norm": 0.9824795126914978,
"learning_rate": 5.063130823984823e-05,
"loss": 0.9545,
"step": 77
},
{
"epoch": 0.0060066997805244314,
"grad_norm": 1.093180537223816,
"learning_rate": 5.011140233184724e-05,
"loss": 1.1371,
"step": 78
},
{
"epoch": 0.006083708752069616,
"grad_norm": 1.108821988105774,
"learning_rate": 4.958736511733516e-05,
"loss": 1.1152,
"step": 79
},
{
"epoch": 0.006160717723614801,
"grad_norm": 1.167564034461975,
"learning_rate": 4.905933986285393e-05,
"loss": 1.3036,
"step": 80
},
{
"epoch": 0.006237726695159986,
"grad_norm": 1.169791579246521,
"learning_rate": 4.8527470925235824e-05,
"loss": 1.3008,
"step": 81
},
{
"epoch": 0.006314735666705171,
"grad_norm": 1.238440990447998,
"learning_rate": 4.799190371213772e-05,
"loss": 1.3018,
"step": 82
},
{
"epoch": 0.006391744638250356,
"grad_norm": 1.2798845767974854,
"learning_rate": 4.745278464228808e-05,
"loss": 1.325,
"step": 83
},
{
"epoch": 0.006468753609795541,
"grad_norm": 1.2485350370407104,
"learning_rate": 4.69102611054575e-05,
"loss": 1.2403,
"step": 84
},
{
"epoch": 0.0065457625813407265,
"grad_norm": 1.3679078817367554,
"learning_rate": 4.6364481422163926e-05,
"loss": 1.2971,
"step": 85
},
{
"epoch": 0.006622771552885911,
"grad_norm": 1.4008992910385132,
"learning_rate": 4.581559480312316e-05,
"loss": 1.2184,
"step": 86
},
{
"epoch": 0.0066997805244310964,
"grad_norm": 1.3539499044418335,
"learning_rate": 4.526375130845627e-05,
"loss": 1.109,
"step": 87
},
{
"epoch": 0.006776789495976281,
"grad_norm": 1.4504971504211426,
"learning_rate": 4.4709101806664554e-05,
"loss": 1.1855,
"step": 88
},
{
"epoch": 0.006853798467521466,
"grad_norm": 1.5348631143569946,
"learning_rate": 4.4151797933383685e-05,
"loss": 1.1484,
"step": 89
},
{
"epoch": 0.006930807439066651,
"grad_norm": 1.4527966976165771,
"learning_rate": 4.359199204992797e-05,
"loss": 1.1442,
"step": 90
},
{
"epoch": 0.007007816410611836,
"grad_norm": 1.5797408819198608,
"learning_rate": 4.30298372016363e-05,
"loss": 1.1574,
"step": 91
},
{
"epoch": 0.007084825382157022,
"grad_norm": 1.6132049560546875,
"learning_rate": 4.246548707603114e-05,
"loss": 1.1719,
"step": 92
},
{
"epoch": 0.007161834353702206,
"grad_norm": 1.579073429107666,
"learning_rate": 4.1899095960801805e-05,
"loss": 1.1875,
"step": 93
},
{
"epoch": 0.0072388433252473915,
"grad_norm": 1.8216954469680786,
"learning_rate": 4.133081870162385e-05,
"loss": 1.1405,
"step": 94
},
{
"epoch": 0.007315852296792576,
"grad_norm": 1.7299689054489136,
"learning_rate": 4.076081065982569e-05,
"loss": 1.1056,
"step": 95
},
{
"epoch": 0.0073928612683377614,
"grad_norm": 1.8903682231903076,
"learning_rate": 4.018922766991447e-05,
"loss": 1.1549,
"step": 96
},
{
"epoch": 0.007469870239882946,
"grad_norm": 1.942421317100525,
"learning_rate": 3.961622599697241e-05,
"loss": 1.2044,
"step": 97
},
{
"epoch": 0.007546879211428131,
"grad_norm": 2.168710470199585,
"learning_rate": 3.9041962293935516e-05,
"loss": 1.2094,
"step": 98
},
{
"epoch": 0.007623888182973317,
"grad_norm": 2.435220718383789,
"learning_rate": 3.84665935587662e-05,
"loss": 1.1325,
"step": 99
},
{
"epoch": 0.007700897154518501,
"grad_norm": 3.049816608428955,
"learning_rate": 3.7890277091531636e-05,
"loss": 0.9724,
"step": 100
},
{
"epoch": 0.007700897154518501,
"eval_loss": 1.021877646446228,
"eval_runtime": 849.5256,
"eval_samples_per_second": 25.745,
"eval_steps_per_second": 6.437,
"step": 100
},
{
"epoch": 0.007777906126063687,
"grad_norm": 0.6269429922103882,
"learning_rate": 3.7313170451399475e-05,
"loss": 0.64,
"step": 101
},
{
"epoch": 0.007854915097608871,
"grad_norm": 0.8250545859336853,
"learning_rate": 3.673543141356278e-05,
"loss": 0.847,
"step": 102
},
{
"epoch": 0.007931924069154056,
"grad_norm": 0.8081998229026794,
"learning_rate": 3.6157217926105783e-05,
"loss": 0.8148,
"step": 103
},
{
"epoch": 0.008008933040699242,
"grad_norm": 0.7385756373405457,
"learning_rate": 3.557868806682255e-05,
"loss": 0.6817,
"step": 104
},
{
"epoch": 0.008085942012244426,
"grad_norm": 0.7062004208564758,
"learning_rate": 3.5e-05,
"loss": 0.6806,
"step": 105
},
{
"epoch": 0.008162950983789611,
"grad_norm": 0.7016987204551697,
"learning_rate": 3.442131193317745e-05,
"loss": 0.7777,
"step": 106
},
{
"epoch": 0.008239959955334797,
"grad_norm": 0.6682083010673523,
"learning_rate": 3.384278207389421e-05,
"loss": 0.6737,
"step": 107
},
{
"epoch": 0.008316968926879982,
"grad_norm": 0.7276062369346619,
"learning_rate": 3.3264568586437216e-05,
"loss": 0.8416,
"step": 108
},
{
"epoch": 0.008393977898425166,
"grad_norm": 0.763378918170929,
"learning_rate": 3.268682954860052e-05,
"loss": 0.8446,
"step": 109
},
{
"epoch": 0.00847098686997035,
"grad_norm": 0.6761339902877808,
"learning_rate": 3.210972290846837e-05,
"loss": 0.7728,
"step": 110
},
{
"epoch": 0.008547995841515537,
"grad_norm": 0.7818235754966736,
"learning_rate": 3.15334064412338e-05,
"loss": 0.8598,
"step": 111
},
{
"epoch": 0.008625004813060722,
"grad_norm": 0.7958978414535522,
"learning_rate": 3.0958037706064485e-05,
"loss": 0.7948,
"step": 112
},
{
"epoch": 0.008702013784605906,
"grad_norm": 0.7697209715843201,
"learning_rate": 3.038377400302758e-05,
"loss": 0.7613,
"step": 113
},
{
"epoch": 0.008779022756151092,
"grad_norm": 0.7587650418281555,
"learning_rate": 2.9810772330085524e-05,
"loss": 0.7683,
"step": 114
},
{
"epoch": 0.008856031727696277,
"grad_norm": 0.879778265953064,
"learning_rate": 2.9239189340174306e-05,
"loss": 0.8788,
"step": 115
},
{
"epoch": 0.008933040699241461,
"grad_norm": 0.7700604796409607,
"learning_rate": 2.8669181298376163e-05,
"loss": 0.7829,
"step": 116
},
{
"epoch": 0.009010049670786646,
"grad_norm": 0.8565403819084167,
"learning_rate": 2.8100904039198193e-05,
"loss": 0.8699,
"step": 117
},
{
"epoch": 0.009087058642331832,
"grad_norm": 0.8874226212501526,
"learning_rate": 2.7534512923968863e-05,
"loss": 0.8858,
"step": 118
},
{
"epoch": 0.009164067613877017,
"grad_norm": 0.8677376508712769,
"learning_rate": 2.6970162798363695e-05,
"loss": 0.9841,
"step": 119
},
{
"epoch": 0.009241076585422201,
"grad_norm": 0.9221559762954712,
"learning_rate": 2.640800795007203e-05,
"loss": 0.9674,
"step": 120
},
{
"epoch": 0.009318085556967387,
"grad_norm": 0.9063008427619934,
"learning_rate": 2.5848202066616305e-05,
"loss": 0.905,
"step": 121
},
{
"epoch": 0.009395094528512572,
"grad_norm": 0.8666952848434448,
"learning_rate": 2.5290898193335446e-05,
"loss": 0.863,
"step": 122
},
{
"epoch": 0.009472103500057756,
"grad_norm": 0.9033343195915222,
"learning_rate": 2.4736248691543736e-05,
"loss": 0.8763,
"step": 123
},
{
"epoch": 0.009549112471602941,
"grad_norm": 0.9079000949859619,
"learning_rate": 2.4184405196876842e-05,
"loss": 1.0479,
"step": 124
},
{
"epoch": 0.009626121443148127,
"grad_norm": 1.02191960811615,
"learning_rate": 2.363551857783608e-05,
"loss": 0.9697,
"step": 125
},
{
"epoch": 0.009703130414693312,
"grad_norm": 0.9727286696434021,
"learning_rate": 2.308973889454249e-05,
"loss": 0.9756,
"step": 126
},
{
"epoch": 0.009780139386238496,
"grad_norm": 1.0556830167770386,
"learning_rate": 2.2547215357711918e-05,
"loss": 0.9513,
"step": 127
},
{
"epoch": 0.009857148357783682,
"grad_norm": 1.140964150428772,
"learning_rate": 2.2008096287862266e-05,
"loss": 0.9786,
"step": 128
},
{
"epoch": 0.009934157329328867,
"grad_norm": 1.1108282804489136,
"learning_rate": 2.1472529074764177e-05,
"loss": 1.156,
"step": 129
},
{
"epoch": 0.010011166300874052,
"grad_norm": 1.1995575428009033,
"learning_rate": 2.0940660137146074e-05,
"loss": 1.3082,
"step": 130
},
{
"epoch": 0.010088175272419236,
"grad_norm": 1.2283718585968018,
"learning_rate": 2.041263488266484e-05,
"loss": 1.2607,
"step": 131
},
{
"epoch": 0.010165184243964422,
"grad_norm": 1.3214588165283203,
"learning_rate": 1.988859766815275e-05,
"loss": 1.366,
"step": 132
},
{
"epoch": 0.010242193215509607,
"grad_norm": 1.266268253326416,
"learning_rate": 1.9368691760151773e-05,
"loss": 1.2922,
"step": 133
},
{
"epoch": 0.010319202187054791,
"grad_norm": 1.330242395401001,
"learning_rate": 1.885305929574593e-05,
"loss": 1.2814,
"step": 134
},
{
"epoch": 0.010396211158599978,
"grad_norm": 1.3576722145080566,
"learning_rate": 1.8341841243702424e-05,
"loss": 1.2609,
"step": 135
},
{
"epoch": 0.010473220130145162,
"grad_norm": 1.4859892129898071,
"learning_rate": 1.7835177365932225e-05,
"loss": 1.2597,
"step": 136
},
{
"epoch": 0.010550229101690347,
"grad_norm": 1.3510634899139404,
"learning_rate": 1.7333206179280478e-05,
"loss": 1.1941,
"step": 137
},
{
"epoch": 0.010627238073235531,
"grad_norm": 1.4723690748214722,
"learning_rate": 1.6836064917657478e-05,
"loss": 1.1697,
"step": 138
},
{
"epoch": 0.010704247044780717,
"grad_norm": 1.5553869009017944,
"learning_rate": 1.6343889494520224e-05,
"loss": 1.3415,
"step": 139
},
{
"epoch": 0.010781256016325902,
"grad_norm": 1.6149593591690063,
"learning_rate": 1.5856814465715064e-05,
"loss": 1.176,
"step": 140
},
{
"epoch": 0.010858264987871086,
"grad_norm": 1.5468590259552002,
"learning_rate": 1.5374972992691458e-05,
"loss": 1.1791,
"step": 141
},
{
"epoch": 0.010935273959416273,
"grad_norm": 1.5676560401916504,
"learning_rate": 1.4898496806096974e-05,
"loss": 1.1619,
"step": 142
},
{
"epoch": 0.011012282930961457,
"grad_norm": 1.6609135866165161,
"learning_rate": 1.4427516169763444e-05,
"loss": 1.1721,
"step": 143
},
{
"epoch": 0.011089291902506642,
"grad_norm": 1.7773945331573486,
"learning_rate": 1.396215984509412e-05,
"loss": 1.1659,
"step": 144
},
{
"epoch": 0.011166300874051826,
"grad_norm": 1.6555438041687012,
"learning_rate": 1.3502555055861625e-05,
"loss": 1.1051,
"step": 145
},
{
"epoch": 0.011243309845597012,
"grad_norm": 2.021911382675171,
"learning_rate": 1.3048827453426203e-05,
"loss": 1.06,
"step": 146
},
{
"epoch": 0.011320318817142197,
"grad_norm": 2.1173946857452393,
"learning_rate": 1.2601101082383917e-05,
"loss": 1.0929,
"step": 147
},
{
"epoch": 0.011397327788687382,
"grad_norm": 2.111060619354248,
"learning_rate": 1.2159498346654094e-05,
"loss": 1.0685,
"step": 148
},
{
"epoch": 0.011474336760232568,
"grad_norm": 2.7557051181793213,
"learning_rate": 1.1724139976015306e-05,
"loss": 1.2004,
"step": 149
},
{
"epoch": 0.011551345731777752,
"grad_norm": 3.0773377418518066,
"learning_rate": 1.1295144993099068e-05,
"loss": 0.894,
"step": 150
},
{
"epoch": 0.011551345731777752,
"eval_loss": 0.989094078540802,
"eval_runtime": 848.5025,
"eval_samples_per_second": 25.776,
"eval_steps_per_second": 6.444,
"step": 150
},
{
"epoch": 0.011628354703322937,
"grad_norm": 0.49048227071762085,
"learning_rate": 1.0872630680850196e-05,
"loss": 0.5683,
"step": 151
},
{
"epoch": 0.011705363674868121,
"grad_norm": 0.6810614466667175,
"learning_rate": 1.0456712550462898e-05,
"loss": 0.7572,
"step": 152
},
{
"epoch": 0.011782372646413308,
"grad_norm": 0.7518895268440247,
"learning_rate": 1.0047504309801104e-05,
"loss": 0.7942,
"step": 153
},
{
"epoch": 0.011859381617958492,
"grad_norm": 0.8100650310516357,
"learning_rate": 9.645117832311886e-06,
"loss": 0.8327,
"step": 154
},
{
"epoch": 0.011936390589503677,
"grad_norm": 0.8092503547668457,
"learning_rate": 9.249663126440394e-06,
"loss": 0.829,
"step": 155
},
{
"epoch": 0.012013399561048863,
"grad_norm": 0.6432150602340698,
"learning_rate": 8.861248305554624e-06,
"loss": 0.6496,
"step": 156
},
{
"epoch": 0.012090408532594047,
"grad_norm": 0.5999425649642944,
"learning_rate": 8.47997955838829e-06,
"loss": 0.5903,
"step": 157
},
{
"epoch": 0.012167417504139232,
"grad_norm": 0.7111806869506836,
"learning_rate": 8.10596112000994e-06,
"loss": 0.7107,
"step": 158
},
{
"epoch": 0.012244426475684416,
"grad_norm": 0.7115854620933533,
"learning_rate": 7.739295243326067e-06,
"loss": 0.7083,
"step": 159
},
{
"epoch": 0.012321435447229603,
"grad_norm": 0.6803847551345825,
"learning_rate": 7.380082171126228e-06,
"loss": 0.7334,
"step": 160
},
{
"epoch": 0.012398444418774787,
"grad_norm": 0.7553372979164124,
"learning_rate": 7.028420108677635e-06,
"loss": 0.7847,
"step": 161
},
{
"epoch": 0.012475453390319972,
"grad_norm": 0.7494491934776306,
"learning_rate": 6.684405196876842e-06,
"loss": 0.8008,
"step": 162
},
{
"epoch": 0.012552462361865158,
"grad_norm": 0.8308342695236206,
"learning_rate": 6.3481314859657675e-06,
"loss": 0.8929,
"step": 163
},
{
"epoch": 0.012629471333410342,
"grad_norm": 0.7959633469581604,
"learning_rate": 6.019690909819298e-06,
"loss": 0.9435,
"step": 164
},
{
"epoch": 0.012706480304955527,
"grad_norm": 0.7931632995605469,
"learning_rate": 5.6991732608115e-06,
"loss": 0.8936,
"step": 165
},
{
"epoch": 0.012783489276500712,
"grad_norm": 0.8373035192489624,
"learning_rate": 5.386666165267256e-06,
"loss": 0.8984,
"step": 166
},
{
"epoch": 0.012860498248045898,
"grad_norm": 0.8174297213554382,
"learning_rate": 5.08225505950613e-06,
"loss": 0.9191,
"step": 167
},
{
"epoch": 0.012937507219591082,
"grad_norm": 0.8664717078208923,
"learning_rate": 4.786023166484913e-06,
"loss": 0.9423,
"step": 168
},
{
"epoch": 0.013014516191136267,
"grad_norm": 0.8544601798057556,
"learning_rate": 4.498051473045291e-06,
"loss": 0.8387,
"step": 169
},
{
"epoch": 0.013091525162681453,
"grad_norm": 0.8214935660362244,
"learning_rate": 4.218418707772886e-06,
"loss": 0.8581,
"step": 170
},
{
"epoch": 0.013168534134226638,
"grad_norm": 0.8594068288803101,
"learning_rate": 3.947201319473587e-06,
"loss": 0.8652,
"step": 171
},
{
"epoch": 0.013245543105771822,
"grad_norm": 0.883743405342102,
"learning_rate": 3.684473456273278e-06,
"loss": 0.9762,
"step": 172
},
{
"epoch": 0.013322552077317007,
"grad_norm": 0.8632309436798096,
"learning_rate": 3.4303069453464383e-06,
"loss": 0.9785,
"step": 173
},
{
"epoch": 0.013399561048862193,
"grad_norm": 0.9207712411880493,
"learning_rate": 3.184771273279312e-06,
"loss": 0.9446,
"step": 174
},
{
"epoch": 0.013476570020407377,
"grad_norm": 1.1362985372543335,
"learning_rate": 2.947933567072987e-06,
"loss": 1.0367,
"step": 175
},
{
"epoch": 0.013553578991952562,
"grad_norm": 1.0557373762130737,
"learning_rate": 2.719858575791534e-06,
"loss": 1.0773,
"step": 176
},
{
"epoch": 0.013630587963497748,
"grad_norm": 1.030173420906067,
"learning_rate": 2.500608652860256e-06,
"loss": 1.0026,
"step": 177
},
{
"epoch": 0.013707596935042933,
"grad_norm": 1.1021617650985718,
"learning_rate": 2.2902437390188737e-06,
"loss": 1.0793,
"step": 178
},
{
"epoch": 0.013784605906588117,
"grad_norm": 1.0124552249908447,
"learning_rate": 2.0888213459343587e-06,
"loss": 1.1299,
"step": 179
},
{
"epoch": 0.013861614878133302,
"grad_norm": 1.2554916143417358,
"learning_rate": 1.8963965404777875e-06,
"loss": 1.1183,
"step": 180
},
{
"epoch": 0.013938623849678488,
"grad_norm": 1.148569107055664,
"learning_rate": 1.7130219296696263e-06,
"loss": 1.229,
"step": 181
},
{
"epoch": 0.014015632821223672,
"grad_norm": 1.1936874389648438,
"learning_rate": 1.5387476462974824e-06,
"loss": 1.2108,
"step": 182
},
{
"epoch": 0.014092641792768857,
"grad_norm": 1.2075494527816772,
"learning_rate": 1.3736213352103147e-06,
"loss": 1.2433,
"step": 183
},
{
"epoch": 0.014169650764314043,
"grad_norm": 1.2774829864501953,
"learning_rate": 1.2176881402928002e-06,
"loss": 1.2738,
"step": 184
},
{
"epoch": 0.014246659735859228,
"grad_norm": 1.2447525262832642,
"learning_rate": 1.0709906921234367e-06,
"loss": 1.1435,
"step": 185
},
{
"epoch": 0.014323668707404412,
"grad_norm": 1.3485177755355835,
"learning_rate": 9.33569096319799e-07,
"loss": 1.1858,
"step": 186
},
{
"epoch": 0.014400677678949597,
"grad_norm": 1.4245103597640991,
"learning_rate": 8.054609225740255e-07,
"loss": 1.1984,
"step": 187
},
{
"epoch": 0.014477686650494783,
"grad_norm": 1.3392527103424072,
"learning_rate": 6.867011943816724e-07,
"loss": 1.1286,
"step": 188
},
{
"epoch": 0.014554695622039968,
"grad_norm": 1.5184451341629028,
"learning_rate": 5.77322379466617e-07,
"loss": 1.1872,
"step": 189
},
{
"epoch": 0.014631704593585152,
"grad_norm": 1.5353091955184937,
"learning_rate": 4.773543809047186e-07,
"loss": 1.2407,
"step": 190
},
{
"epoch": 0.014708713565130338,
"grad_norm": 1.5289061069488525,
"learning_rate": 3.868245289486027e-07,
"loss": 1.149,
"step": 191
},
{
"epoch": 0.014785722536675523,
"grad_norm": 1.5167860984802246,
"learning_rate": 3.0575757355586817e-07,
"loss": 1.0424,
"step": 192
},
{
"epoch": 0.014862731508220707,
"grad_norm": 1.6470500230789185,
"learning_rate": 2.3417567762266497e-07,
"loss": 1.1479,
"step": 193
},
{
"epoch": 0.014939740479765892,
"grad_norm": 1.915789246559143,
"learning_rate": 1.7209841092460043e-07,
"loss": 1.1813,
"step": 194
},
{
"epoch": 0.015016749451311078,
"grad_norm": 1.8250898122787476,
"learning_rate": 1.1954274476655534e-07,
"loss": 1.2852,
"step": 195
},
{
"epoch": 0.015093758422856263,
"grad_norm": 1.7232822179794312,
"learning_rate": 7.652304734289127e-08,
"loss": 1.012,
"step": 196
},
{
"epoch": 0.015170767394401447,
"grad_norm": 1.8250606060028076,
"learning_rate": 4.30510798093342e-08,
"loss": 1.1473,
"step": 197
},
{
"epoch": 0.015247776365946633,
"grad_norm": 2.0770554542541504,
"learning_rate": 1.9135993067588284e-08,
"loss": 1.09,
"step": 198
},
{
"epoch": 0.015324785337491818,
"grad_norm": 2.2757625579833984,
"learning_rate": 4.784325263584854e-09,
"loss": 1.1364,
"step": 199
},
{
"epoch": 0.015401794309037002,
"grad_norm": 2.7049641609191895,
"learning_rate": 0.0,
"loss": 0.8939,
"step": 200
},
{
"epoch": 0.015401794309037002,
"eval_loss": 0.9832578301429749,
"eval_runtime": 848.8014,
"eval_samples_per_second": 25.767,
"eval_steps_per_second": 6.442,
"step": 200
}
],
"logging_steps": 1,
"max_steps": 200,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 50,
"stateful_callbacks": {
"EarlyStoppingCallback": {
"args": {
"early_stopping_patience": 4,
"early_stopping_threshold": 0.0
},
"attributes": {
"early_stopping_patience_counter": 0
}
},
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 8.972467927882138e+16,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}