jeqcho's picture
Upload seed2/checkpoint-375
ee5d340 verified
Raw
History Blame Contribute Delete
65.7 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.4681318681318682,
"eval_steps": 500,
"global_step": 375,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.006593406593406593,
"grad_norm": 1.195170283317566,
"learning_rate": 0.0,
"loss": 1.0821,
"step": 1
},
{
"epoch": 0.013186813186813187,
"grad_norm": 1.0331945419311523,
"learning_rate": 9.56e-05,
"loss": 1.0763,
"step": 2
},
{
"epoch": 0.01978021978021978,
"grad_norm": 1.1415084600448608,
"learning_rate": 0.0001912,
"loss": 1.0495,
"step": 3
},
{
"epoch": 0.026373626373626374,
"grad_norm": 1.063579797744751,
"learning_rate": 0.0002868,
"loss": 0.956,
"step": 4
},
{
"epoch": 0.03296703296703297,
"grad_norm": 0.6625626087188721,
"learning_rate": 0.0003824,
"loss": 0.8477,
"step": 5
},
{
"epoch": 0.03956043956043956,
"grad_norm": 0.6782878637313843,
"learning_rate": 0.000478,
"loss": 1.0343,
"step": 6
},
{
"epoch": 0.046153846153846156,
"grad_norm": 0.6161335110664368,
"learning_rate": 0.00047694013303769406,
"loss": 0.9727,
"step": 7
},
{
"epoch": 0.05274725274725275,
"grad_norm": 0.41984498500823975,
"learning_rate": 0.00047588026607538804,
"loss": 0.8698,
"step": 8
},
{
"epoch": 0.05934065934065934,
"grad_norm": 0.3116914927959442,
"learning_rate": 0.0004748203991130821,
"loss": 0.8446,
"step": 9
},
{
"epoch": 0.06593406593406594,
"grad_norm": 0.29025012254714966,
"learning_rate": 0.00047376053215077607,
"loss": 0.7877,
"step": 10
},
{
"epoch": 0.07252747252747253,
"grad_norm": 0.39959046244621277,
"learning_rate": 0.00047270066518847006,
"loss": 0.8688,
"step": 11
},
{
"epoch": 0.07912087912087912,
"grad_norm": 0.5689778923988342,
"learning_rate": 0.0004716407982261641,
"loss": 0.8847,
"step": 12
},
{
"epoch": 0.08571428571428572,
"grad_norm": 0.40798476338386536,
"learning_rate": 0.00047058093126385814,
"loss": 0.7254,
"step": 13
},
{
"epoch": 0.09230769230769231,
"grad_norm": 0.6968982219696045,
"learning_rate": 0.0004695210643015521,
"loss": 0.8179,
"step": 14
},
{
"epoch": 0.0989010989010989,
"grad_norm": 0.5194700360298157,
"learning_rate": 0.00046846119733924617,
"loss": 0.7156,
"step": 15
},
{
"epoch": 0.1054945054945055,
"grad_norm": 0.43927809596061707,
"learning_rate": 0.00046740133037694015,
"loss": 0.8273,
"step": 16
},
{
"epoch": 0.11208791208791209,
"grad_norm": 0.3979283571243286,
"learning_rate": 0.00046634146341463414,
"loss": 0.7288,
"step": 17
},
{
"epoch": 0.11868131868131868,
"grad_norm": 0.4314859211444855,
"learning_rate": 0.0004652815964523282,
"loss": 0.7677,
"step": 18
},
{
"epoch": 0.12527472527472527,
"grad_norm": 0.3548160791397095,
"learning_rate": 0.0004642217294900222,
"loss": 0.6472,
"step": 19
},
{
"epoch": 0.13186813186813187,
"grad_norm": 0.38769328594207764,
"learning_rate": 0.0004631618625277162,
"loss": 0.6578,
"step": 20
},
{
"epoch": 0.13846153846153847,
"grad_norm": 0.3017254173755646,
"learning_rate": 0.00046210199556541025,
"loss": 0.7163,
"step": 21
},
{
"epoch": 0.14505494505494507,
"grad_norm": 0.33315712213516235,
"learning_rate": 0.00046104212860310423,
"loss": 0.6951,
"step": 22
},
{
"epoch": 0.15164835164835164,
"grad_norm": 0.3334329426288605,
"learning_rate": 0.0004599822616407982,
"loss": 0.7464,
"step": 23
},
{
"epoch": 0.15824175824175823,
"grad_norm": 0.301981121301651,
"learning_rate": 0.00045892239467849226,
"loss": 0.667,
"step": 24
},
{
"epoch": 0.16483516483516483,
"grad_norm": 0.3768517076969147,
"learning_rate": 0.0004578625277161863,
"loss": 0.6719,
"step": 25
},
{
"epoch": 0.17142857142857143,
"grad_norm": 0.3810518980026245,
"learning_rate": 0.0004568026607538803,
"loss": 0.7687,
"step": 26
},
{
"epoch": 0.17802197802197803,
"grad_norm": 0.4689561128616333,
"learning_rate": 0.00045574279379157433,
"loss": 0.7114,
"step": 27
},
{
"epoch": 0.18461538461538463,
"grad_norm": 0.3895481824874878,
"learning_rate": 0.00045468292682926826,
"loss": 0.7328,
"step": 28
},
{
"epoch": 0.1912087912087912,
"grad_norm": 0.44972071051597595,
"learning_rate": 0.0004536230598669623,
"loss": 0.708,
"step": 29
},
{
"epoch": 0.1978021978021978,
"grad_norm": 0.39502742886543274,
"learning_rate": 0.00045256319290465634,
"loss": 0.7672,
"step": 30
},
{
"epoch": 0.2043956043956044,
"grad_norm": 0.5479147434234619,
"learning_rate": 0.00045150332594235033,
"loss": 0.7583,
"step": 31
},
{
"epoch": 0.210989010989011,
"grad_norm": 0.33382317423820496,
"learning_rate": 0.00045044345898004437,
"loss": 0.7369,
"step": 32
},
{
"epoch": 0.2175824175824176,
"grad_norm": 0.49583446979522705,
"learning_rate": 0.0004493835920177384,
"loss": 0.8174,
"step": 33
},
{
"epoch": 0.22417582417582418,
"grad_norm": 0.3855836093425751,
"learning_rate": 0.00044832372505543234,
"loss": 0.7935,
"step": 34
},
{
"epoch": 0.23076923076923078,
"grad_norm": 0.45332643389701843,
"learning_rate": 0.0004472638580931264,
"loss": 0.7593,
"step": 35
},
{
"epoch": 0.23736263736263735,
"grad_norm": 0.3067397475242615,
"learning_rate": 0.0004462039911308204,
"loss": 0.6878,
"step": 36
},
{
"epoch": 0.24395604395604395,
"grad_norm": 0.3372962474822998,
"learning_rate": 0.0004451441241685144,
"loss": 0.7705,
"step": 37
},
{
"epoch": 0.25054945054945055,
"grad_norm": 0.40445494651794434,
"learning_rate": 0.00044408425720620845,
"loss": 0.7849,
"step": 38
},
{
"epoch": 0.2571428571428571,
"grad_norm": 0.3279916048049927,
"learning_rate": 0.0004430243902439025,
"loss": 0.715,
"step": 39
},
{
"epoch": 0.26373626373626374,
"grad_norm": 0.31464719772338867,
"learning_rate": 0.0004419645232815964,
"loss": 0.7322,
"step": 40
},
{
"epoch": 0.2703296703296703,
"grad_norm": 0.27914178371429443,
"learning_rate": 0.00044090465631929047,
"loss": 0.6922,
"step": 41
},
{
"epoch": 0.27692307692307694,
"grad_norm": 0.27055102586746216,
"learning_rate": 0.0004398447893569845,
"loss": 0.7071,
"step": 42
},
{
"epoch": 0.2835164835164835,
"grad_norm": 0.30358147621154785,
"learning_rate": 0.0004387849223946785,
"loss": 0.7257,
"step": 43
},
{
"epoch": 0.29010989010989013,
"grad_norm": 0.3098717927932739,
"learning_rate": 0.00043772505543237253,
"loss": 0.6871,
"step": 44
},
{
"epoch": 0.2967032967032967,
"grad_norm": 0.32566770911216736,
"learning_rate": 0.0004366651884700666,
"loss": 0.7264,
"step": 45
},
{
"epoch": 0.3032967032967033,
"grad_norm": 0.3617362082004547,
"learning_rate": 0.0004356053215077605,
"loss": 0.6902,
"step": 46
},
{
"epoch": 0.3098901098901099,
"grad_norm": 0.43403375148773193,
"learning_rate": 0.00043454545454545455,
"loss": 0.7037,
"step": 47
},
{
"epoch": 0.31648351648351647,
"grad_norm": 0.33475279808044434,
"learning_rate": 0.0004334855875831486,
"loss": 0.7261,
"step": 48
},
{
"epoch": 0.3230769230769231,
"grad_norm": 0.34020453691482544,
"learning_rate": 0.0004324257206208426,
"loss": 0.6361,
"step": 49
},
{
"epoch": 0.32967032967032966,
"grad_norm": 0.29145631194114685,
"learning_rate": 0.0004313658536585366,
"loss": 0.6797,
"step": 50
},
{
"epoch": 0.3362637362637363,
"grad_norm": 0.35258740186691284,
"learning_rate": 0.00043030598669623066,
"loss": 0.6811,
"step": 51
},
{
"epoch": 0.34285714285714286,
"grad_norm": 0.31551578640937805,
"learning_rate": 0.0004292461197339246,
"loss": 0.6662,
"step": 52
},
{
"epoch": 0.34945054945054943,
"grad_norm": 0.40033137798309326,
"learning_rate": 0.00042818625277161863,
"loss": 0.7066,
"step": 53
},
{
"epoch": 0.35604395604395606,
"grad_norm": 0.34928882122039795,
"learning_rate": 0.00042712638580931267,
"loss": 0.6704,
"step": 54
},
{
"epoch": 0.3626373626373626,
"grad_norm": 0.3890458345413208,
"learning_rate": 0.00042606651884700666,
"loss": 0.7074,
"step": 55
},
{
"epoch": 0.36923076923076925,
"grad_norm": 0.34585464000701904,
"learning_rate": 0.0004250066518847007,
"loss": 0.7147,
"step": 56
},
{
"epoch": 0.3758241758241758,
"grad_norm": 0.2896708548069,
"learning_rate": 0.00042394678492239474,
"loss": 0.7679,
"step": 57
},
{
"epoch": 0.3824175824175824,
"grad_norm": 0.3353179395198822,
"learning_rate": 0.00042288691796008867,
"loss": 0.6415,
"step": 58
},
{
"epoch": 0.389010989010989,
"grad_norm": 0.32367175817489624,
"learning_rate": 0.0004218270509977827,
"loss": 0.7697,
"step": 59
},
{
"epoch": 0.3956043956043956,
"grad_norm": 0.32652848958969116,
"learning_rate": 0.00042076718403547675,
"loss": 0.6835,
"step": 60
},
{
"epoch": 0.4021978021978022,
"grad_norm": 0.2857896089553833,
"learning_rate": 0.00041970731707317074,
"loss": 0.7343,
"step": 61
},
{
"epoch": 0.4087912087912088,
"grad_norm": 0.35556867718696594,
"learning_rate": 0.0004186474501108648,
"loss": 0.6726,
"step": 62
},
{
"epoch": 0.4153846153846154,
"grad_norm": 0.3160596191883087,
"learning_rate": 0.0004175875831485588,
"loss": 0.7143,
"step": 63
},
{
"epoch": 0.421978021978022,
"grad_norm": 0.3572760224342346,
"learning_rate": 0.00041652771618625275,
"loss": 0.7587,
"step": 64
},
{
"epoch": 0.42857142857142855,
"grad_norm": 0.2954725921154022,
"learning_rate": 0.0004154678492239468,
"loss": 0.6812,
"step": 65
},
{
"epoch": 0.4351648351648352,
"grad_norm": 0.3745565116405487,
"learning_rate": 0.00041440798226164083,
"loss": 0.7258,
"step": 66
},
{
"epoch": 0.44175824175824174,
"grad_norm": 0.3284990191459656,
"learning_rate": 0.0004133481152993348,
"loss": 0.7153,
"step": 67
},
{
"epoch": 0.44835164835164837,
"grad_norm": 0.30010706186294556,
"learning_rate": 0.00041228824833702886,
"loss": 0.6984,
"step": 68
},
{
"epoch": 0.45494505494505494,
"grad_norm": 0.2915664613246918,
"learning_rate": 0.00041122838137472285,
"loss": 0.7052,
"step": 69
},
{
"epoch": 0.46153846153846156,
"grad_norm": 0.29902124404907227,
"learning_rate": 0.00041016851441241683,
"loss": 0.6934,
"step": 70
},
{
"epoch": 0.46813186813186813,
"grad_norm": 0.3071542978286743,
"learning_rate": 0.00040910864745011087,
"loss": 0.708,
"step": 71
},
{
"epoch": 0.4747252747252747,
"grad_norm": 0.27577969431877136,
"learning_rate": 0.00040804878048780486,
"loss": 0.7428,
"step": 72
},
{
"epoch": 0.48131868131868133,
"grad_norm": 0.2982359826564789,
"learning_rate": 0.0004069889135254989,
"loss": 0.7779,
"step": 73
},
{
"epoch": 0.4879120879120879,
"grad_norm": 0.30666181445121765,
"learning_rate": 0.00040592904656319294,
"loss": 0.7067,
"step": 74
},
{
"epoch": 0.4945054945054945,
"grad_norm": 0.2994212508201599,
"learning_rate": 0.0004048691796008869,
"loss": 0.6904,
"step": 75
},
{
"epoch": 0.5010989010989011,
"grad_norm": 0.2912769317626953,
"learning_rate": 0.00040380931263858097,
"loss": 0.7374,
"step": 76
},
{
"epoch": 0.5076923076923077,
"grad_norm": 0.26267528533935547,
"learning_rate": 0.00040274944567627495,
"loss": 0.7415,
"step": 77
},
{
"epoch": 0.5142857142857142,
"grad_norm": 0.3228910565376282,
"learning_rate": 0.00040168957871396894,
"loss": 0.6345,
"step": 78
},
{
"epoch": 0.5208791208791209,
"grad_norm": 0.3353758752346039,
"learning_rate": 0.000400629711751663,
"loss": 0.6988,
"step": 79
},
{
"epoch": 0.5274725274725275,
"grad_norm": 0.34910428524017334,
"learning_rate": 0.000399569844789357,
"loss": 0.6955,
"step": 80
},
{
"epoch": 0.5340659340659341,
"grad_norm": 0.35183653235435486,
"learning_rate": 0.000398509977827051,
"loss": 0.668,
"step": 81
},
{
"epoch": 0.5406593406593406,
"grad_norm": 0.2986193001270294,
"learning_rate": 0.00039745011086474505,
"loss": 0.7467,
"step": 82
},
{
"epoch": 0.5472527472527473,
"grad_norm": 0.3669707775115967,
"learning_rate": 0.00039639024390243904,
"loss": 0.7143,
"step": 83
},
{
"epoch": 0.5538461538461539,
"grad_norm": 0.3397374749183655,
"learning_rate": 0.000395330376940133,
"loss": 0.6948,
"step": 84
},
{
"epoch": 0.5604395604395604,
"grad_norm": 0.36349624395370483,
"learning_rate": 0.00039427050997782706,
"loss": 0.6381,
"step": 85
},
{
"epoch": 0.567032967032967,
"grad_norm": 0.3161599934101105,
"learning_rate": 0.0003932106430155211,
"loss": 0.7035,
"step": 86
},
{
"epoch": 0.5736263736263736,
"grad_norm": 0.34338268637657166,
"learning_rate": 0.0003921507760532151,
"loss": 0.6079,
"step": 87
},
{
"epoch": 0.5802197802197803,
"grad_norm": 0.3725844621658325,
"learning_rate": 0.00039109090909090913,
"loss": 0.6842,
"step": 88
},
{
"epoch": 0.5868131868131868,
"grad_norm": 0.3499543368816376,
"learning_rate": 0.0003900310421286031,
"loss": 0.6663,
"step": 89
},
{
"epoch": 0.5934065934065934,
"grad_norm": 0.27967825531959534,
"learning_rate": 0.0003889711751662971,
"loss": 0.7043,
"step": 90
},
{
"epoch": 0.6,
"grad_norm": 0.42830947041511536,
"learning_rate": 0.00038791130820399114,
"loss": 0.6066,
"step": 91
},
{
"epoch": 0.6065934065934065,
"grad_norm": 0.2985455095767975,
"learning_rate": 0.0003868514412416852,
"loss": 0.7876,
"step": 92
},
{
"epoch": 0.6131868131868132,
"grad_norm": 0.31391894817352295,
"learning_rate": 0.00038579157427937917,
"loss": 0.7133,
"step": 93
},
{
"epoch": 0.6197802197802198,
"grad_norm": 0.3369094133377075,
"learning_rate": 0.0003847317073170732,
"loss": 0.6965,
"step": 94
},
{
"epoch": 0.6263736263736264,
"grad_norm": 0.35192903876304626,
"learning_rate": 0.0003836718403547672,
"loss": 0.738,
"step": 95
},
{
"epoch": 0.6329670329670329,
"grad_norm": 0.30551454424858093,
"learning_rate": 0.0003826119733924612,
"loss": 0.6792,
"step": 96
},
{
"epoch": 0.6395604395604395,
"grad_norm": 0.2987115681171417,
"learning_rate": 0.0003815521064301552,
"loss": 0.684,
"step": 97
},
{
"epoch": 0.6461538461538462,
"grad_norm": 0.2904681861400604,
"learning_rate": 0.00038049223946784927,
"loss": 0.7354,
"step": 98
},
{
"epoch": 0.6527472527472528,
"grad_norm": 0.3646203279495239,
"learning_rate": 0.00037943237250554325,
"loss": 0.7511,
"step": 99
},
{
"epoch": 0.6593406593406593,
"grad_norm": 0.27354785799980164,
"learning_rate": 0.0003783725055432373,
"loss": 0.6868,
"step": 100
},
{
"epoch": 0.6659340659340659,
"grad_norm": 0.3103290796279907,
"learning_rate": 0.0003773126385809313,
"loss": 0.6935,
"step": 101
},
{
"epoch": 0.6725274725274726,
"grad_norm": 0.33116936683654785,
"learning_rate": 0.00037625277161862527,
"loss": 0.7088,
"step": 102
},
{
"epoch": 0.6791208791208792,
"grad_norm": 0.31001362204551697,
"learning_rate": 0.0003751929046563193,
"loss": 0.7556,
"step": 103
},
{
"epoch": 0.6857142857142857,
"grad_norm": 0.34533751010894775,
"learning_rate": 0.00037413303769401335,
"loss": 0.6535,
"step": 104
},
{
"epoch": 0.6923076923076923,
"grad_norm": 0.3335258364677429,
"learning_rate": 0.00037307317073170733,
"loss": 0.7302,
"step": 105
},
{
"epoch": 0.6989010989010989,
"grad_norm": 0.2870931923389435,
"learning_rate": 0.0003720133037694014,
"loss": 0.6758,
"step": 106
},
{
"epoch": 0.7054945054945055,
"grad_norm": 0.3254625201225281,
"learning_rate": 0.00037095343680709536,
"loss": 0.7593,
"step": 107
},
{
"epoch": 0.7120879120879121,
"grad_norm": 0.30663806200027466,
"learning_rate": 0.00036989356984478935,
"loss": 0.7143,
"step": 108
},
{
"epoch": 0.7186813186813187,
"grad_norm": 0.2793548107147217,
"learning_rate": 0.0003688337028824834,
"loss": 0.7234,
"step": 109
},
{
"epoch": 0.7252747252747253,
"grad_norm": 0.31374335289001465,
"learning_rate": 0.0003677738359201774,
"loss": 0.7025,
"step": 110
},
{
"epoch": 0.7318681318681318,
"grad_norm": 0.3022034764289856,
"learning_rate": 0.0003667139689578714,
"loss": 0.6732,
"step": 111
},
{
"epoch": 0.7384615384615385,
"grad_norm": 0.3161036968231201,
"learning_rate": 0.00036565410199556546,
"loss": 0.7136,
"step": 112
},
{
"epoch": 0.7450549450549451,
"grad_norm": 0.30554062128067017,
"learning_rate": 0.0003645942350332594,
"loss": 0.6756,
"step": 113
},
{
"epoch": 0.7516483516483516,
"grad_norm": 0.29600027203559875,
"learning_rate": 0.00036353436807095343,
"loss": 0.7567,
"step": 114
},
{
"epoch": 0.7582417582417582,
"grad_norm": 0.29495969414711,
"learning_rate": 0.00036247450110864747,
"loss": 0.6993,
"step": 115
},
{
"epoch": 0.7648351648351648,
"grad_norm": 0.36187559366226196,
"learning_rate": 0.00036141463414634146,
"loss": 0.7093,
"step": 116
},
{
"epoch": 0.7714285714285715,
"grad_norm": 0.2875276505947113,
"learning_rate": 0.0003603547671840355,
"loss": 0.6432,
"step": 117
},
{
"epoch": 0.778021978021978,
"grad_norm": 0.3426610827445984,
"learning_rate": 0.00035929490022172954,
"loss": 0.6835,
"step": 118
},
{
"epoch": 0.7846153846153846,
"grad_norm": 0.3620908558368683,
"learning_rate": 0.00035823503325942347,
"loss": 0.756,
"step": 119
},
{
"epoch": 0.7912087912087912,
"grad_norm": 0.2915194630622864,
"learning_rate": 0.0003571751662971175,
"loss": 0.6883,
"step": 120
},
{
"epoch": 0.7978021978021979,
"grad_norm": 0.32311534881591797,
"learning_rate": 0.00035611529933481155,
"loss": 0.727,
"step": 121
},
{
"epoch": 0.8043956043956044,
"grad_norm": 0.3259125053882599,
"learning_rate": 0.00035505543237250554,
"loss": 0.6523,
"step": 122
},
{
"epoch": 0.810989010989011,
"grad_norm": 0.33542436361312866,
"learning_rate": 0.0003539955654101996,
"loss": 0.6245,
"step": 123
},
{
"epoch": 0.8175824175824176,
"grad_norm": 0.4077654480934143,
"learning_rate": 0.0003529356984478936,
"loss": 0.7295,
"step": 124
},
{
"epoch": 0.8241758241758241,
"grad_norm": 0.35173124074935913,
"learning_rate": 0.00035187583148558755,
"loss": 0.7189,
"step": 125
},
{
"epoch": 0.8307692307692308,
"grad_norm": 0.3285554349422455,
"learning_rate": 0.0003508159645232816,
"loss": 0.7179,
"step": 126
},
{
"epoch": 0.8373626373626374,
"grad_norm": 0.3704049289226532,
"learning_rate": 0.00034975609756097563,
"loss": 0.7213,
"step": 127
},
{
"epoch": 0.843956043956044,
"grad_norm": 0.30321356654167175,
"learning_rate": 0.0003486962305986696,
"loss": 0.701,
"step": 128
},
{
"epoch": 0.8505494505494505,
"grad_norm": 0.25718748569488525,
"learning_rate": 0.00034763636363636366,
"loss": 0.7196,
"step": 129
},
{
"epoch": 0.8571428571428571,
"grad_norm": 0.38271740078926086,
"learning_rate": 0.0003465764966740577,
"loss": 0.7567,
"step": 130
},
{
"epoch": 0.8637362637362638,
"grad_norm": 0.3291567862033844,
"learning_rate": 0.00034551662971175163,
"loss": 0.7078,
"step": 131
},
{
"epoch": 0.8703296703296703,
"grad_norm": 0.3053141236305237,
"learning_rate": 0.00034445676274944567,
"loss": 0.6136,
"step": 132
},
{
"epoch": 0.8769230769230769,
"grad_norm": 0.300508052110672,
"learning_rate": 0.0003433968957871397,
"loss": 0.7905,
"step": 133
},
{
"epoch": 0.8835164835164835,
"grad_norm": 0.3538469970226288,
"learning_rate": 0.0003423370288248337,
"loss": 0.6981,
"step": 134
},
{
"epoch": 0.8901098901098901,
"grad_norm": 0.285239040851593,
"learning_rate": 0.00034127716186252774,
"loss": 0.7405,
"step": 135
},
{
"epoch": 0.8967032967032967,
"grad_norm": 0.39319372177124023,
"learning_rate": 0.0003402172949002218,
"loss": 0.7222,
"step": 136
},
{
"epoch": 0.9032967032967033,
"grad_norm": 0.381517231464386,
"learning_rate": 0.00033915742793791577,
"loss": 0.712,
"step": 137
},
{
"epoch": 0.9098901098901099,
"grad_norm": 0.3278730511665344,
"learning_rate": 0.00033809756097560975,
"loss": 0.6998,
"step": 138
},
{
"epoch": 0.9164835164835164,
"grad_norm": 0.3165235221385956,
"learning_rate": 0.0003370376940133038,
"loss": 0.7314,
"step": 139
},
{
"epoch": 0.9230769230769231,
"grad_norm": 0.34131768345832825,
"learning_rate": 0.0003359778270509978,
"loss": 0.696,
"step": 140
},
{
"epoch": 0.9296703296703297,
"grad_norm": 0.3008774518966675,
"learning_rate": 0.0003349179600886918,
"loss": 0.6536,
"step": 141
},
{
"epoch": 0.9362637362637363,
"grad_norm": 0.3007766306400299,
"learning_rate": 0.00033385809312638586,
"loss": 0.6952,
"step": 142
},
{
"epoch": 0.9428571428571428,
"grad_norm": 0.3253723680973053,
"learning_rate": 0.00033279822616407985,
"loss": 0.7443,
"step": 143
},
{
"epoch": 0.9494505494505494,
"grad_norm": 0.31287214159965515,
"learning_rate": 0.00033173835920177384,
"loss": 0.7231,
"step": 144
},
{
"epoch": 0.9560439560439561,
"grad_norm": 0.31145626306533813,
"learning_rate": 0.0003306784922394679,
"loss": 0.6726,
"step": 145
},
{
"epoch": 0.9626373626373627,
"grad_norm": 0.3471812307834625,
"learning_rate": 0.00032961862527716186,
"loss": 0.685,
"step": 146
},
{
"epoch": 0.9692307692307692,
"grad_norm": 0.33790674805641174,
"learning_rate": 0.0003285587583148559,
"loss": 0.6287,
"step": 147
},
{
"epoch": 0.9758241758241758,
"grad_norm": 0.29381513595581055,
"learning_rate": 0.00032749889135254994,
"loss": 0.7269,
"step": 148
},
{
"epoch": 0.9824175824175824,
"grad_norm": 0.33163395524024963,
"learning_rate": 0.00032643902439024393,
"loss": 0.6688,
"step": 149
},
{
"epoch": 0.989010989010989,
"grad_norm": 0.28233274817466736,
"learning_rate": 0.0003253791574279379,
"loss": 0.7459,
"step": 150
},
{
"epoch": 0.9956043956043956,
"grad_norm": 0.2697957456111908,
"learning_rate": 0.0003243192904656319,
"loss": 0.7204,
"step": 151
},
{
"epoch": 1.0,
"grad_norm": 0.3910374939441681,
"learning_rate": 0.00032325942350332594,
"loss": 0.7153,
"step": 152
},
{
"epoch": 1.0065934065934066,
"grad_norm": 0.31035199761390686,
"learning_rate": 0.00032219955654102,
"loss": 0.6372,
"step": 153
},
{
"epoch": 1.0131868131868131,
"grad_norm": 0.35336118936538696,
"learning_rate": 0.00032113968957871397,
"loss": 0.6743,
"step": 154
},
{
"epoch": 1.0197802197802197,
"grad_norm": 0.34364980459213257,
"learning_rate": 0.000320079822616408,
"loss": 0.6599,
"step": 155
},
{
"epoch": 1.0263736263736263,
"grad_norm": 0.43252575397491455,
"learning_rate": 0.000319019955654102,
"loss": 0.7043,
"step": 156
},
{
"epoch": 1.032967032967033,
"grad_norm": 0.3506278991699219,
"learning_rate": 0.000317960088691796,
"loss": 0.6128,
"step": 157
},
{
"epoch": 1.0395604395604396,
"grad_norm": 0.2789537012577057,
"learning_rate": 0.00031690022172949,
"loss": 0.5281,
"step": 158
},
{
"epoch": 1.0461538461538462,
"grad_norm": 0.35527005791664124,
"learning_rate": 0.00031584035476718407,
"loss": 0.6422,
"step": 159
},
{
"epoch": 1.0527472527472528,
"grad_norm": 0.31511110067367554,
"learning_rate": 0.00031478048780487805,
"loss": 0.5686,
"step": 160
},
{
"epoch": 1.0593406593406594,
"grad_norm": 0.3340548574924469,
"learning_rate": 0.0003137206208425721,
"loss": 0.6509,
"step": 161
},
{
"epoch": 1.065934065934066,
"grad_norm": 0.32808569073677063,
"learning_rate": 0.0003126607538802661,
"loss": 0.6608,
"step": 162
},
{
"epoch": 1.0725274725274725,
"grad_norm": 0.33119022846221924,
"learning_rate": 0.00031160088691796007,
"loss": 0.6298,
"step": 163
},
{
"epoch": 1.079120879120879,
"grad_norm": 0.3775770664215088,
"learning_rate": 0.0003105410199556541,
"loss": 0.656,
"step": 164
},
{
"epoch": 1.0857142857142856,
"grad_norm": 0.30977287888526917,
"learning_rate": 0.00030948115299334815,
"loss": 0.6113,
"step": 165
},
{
"epoch": 1.0923076923076924,
"grad_norm": 0.37175706028938293,
"learning_rate": 0.00030842128603104213,
"loss": 0.7013,
"step": 166
},
{
"epoch": 1.098901098901099,
"grad_norm": 0.351672887802124,
"learning_rate": 0.0003073614190687362,
"loss": 0.6631,
"step": 167
},
{
"epoch": 1.1054945054945056,
"grad_norm": 0.359859436750412,
"learning_rate": 0.00030630155210643016,
"loss": 0.6584,
"step": 168
},
{
"epoch": 1.1120879120879121,
"grad_norm": 0.4018190801143646,
"learning_rate": 0.00030524168514412415,
"loss": 0.6357,
"step": 169
},
{
"epoch": 1.1186813186813187,
"grad_norm": 0.30350229144096375,
"learning_rate": 0.0003041818181818182,
"loss": 0.6667,
"step": 170
},
{
"epoch": 1.1252747252747253,
"grad_norm": 0.35754507780075073,
"learning_rate": 0.00030312195121951223,
"loss": 0.6565,
"step": 171
},
{
"epoch": 1.1318681318681318,
"grad_norm": 0.399149090051651,
"learning_rate": 0.0003020620842572062,
"loss": 0.6746,
"step": 172
},
{
"epoch": 1.1384615384615384,
"grad_norm": 0.3958664834499359,
"learning_rate": 0.00030100221729490026,
"loss": 0.6506,
"step": 173
},
{
"epoch": 1.145054945054945,
"grad_norm": 0.32290762662887573,
"learning_rate": 0.00029994235033259424,
"loss": 0.6816,
"step": 174
},
{
"epoch": 1.1516483516483516,
"grad_norm": 0.48313409090042114,
"learning_rate": 0.00029888248337028823,
"loss": 0.6262,
"step": 175
},
{
"epoch": 1.1582417582417581,
"grad_norm": 0.35737237334251404,
"learning_rate": 0.00029782261640798227,
"loss": 0.654,
"step": 176
},
{
"epoch": 1.164835164835165,
"grad_norm": 0.3466680943965912,
"learning_rate": 0.0002967627494456763,
"loss": 0.6356,
"step": 177
},
{
"epoch": 1.1714285714285715,
"grad_norm": 0.39362478256225586,
"learning_rate": 0.0002957028824833703,
"loss": 0.6485,
"step": 178
},
{
"epoch": 1.178021978021978,
"grad_norm": 0.402873158454895,
"learning_rate": 0.00029464301552106434,
"loss": 0.6457,
"step": 179
},
{
"epoch": 1.1846153846153846,
"grad_norm": 0.3372310996055603,
"learning_rate": 0.0002935831485587583,
"loss": 0.6354,
"step": 180
},
{
"epoch": 1.1912087912087912,
"grad_norm": 0.3874308168888092,
"learning_rate": 0.0002925232815964523,
"loss": 0.7243,
"step": 181
},
{
"epoch": 1.1978021978021978,
"grad_norm": 0.4037889838218689,
"learning_rate": 0.00029146341463414635,
"loss": 0.6482,
"step": 182
},
{
"epoch": 1.2043956043956043,
"grad_norm": 0.37217509746551514,
"learning_rate": 0.0002904035476718404,
"loss": 0.7087,
"step": 183
},
{
"epoch": 1.210989010989011,
"grad_norm": 0.3493293821811676,
"learning_rate": 0.0002893436807095344,
"loss": 0.6694,
"step": 184
},
{
"epoch": 1.2175824175824177,
"grad_norm": 0.4025772213935852,
"learning_rate": 0.0002882838137472284,
"loss": 0.6237,
"step": 185
},
{
"epoch": 1.2241758241758243,
"grad_norm": 0.34033340215682983,
"learning_rate": 0.0002872239467849224,
"loss": 0.5906,
"step": 186
},
{
"epoch": 1.2307692307692308,
"grad_norm": 0.36151084303855896,
"learning_rate": 0.0002861640798226164,
"loss": 0.6349,
"step": 187
},
{
"epoch": 1.2373626373626374,
"grad_norm": 0.36955204606056213,
"learning_rate": 0.00028510421286031043,
"loss": 0.673,
"step": 188
},
{
"epoch": 1.243956043956044,
"grad_norm": 0.3759375810623169,
"learning_rate": 0.0002840443458980045,
"loss": 0.6669,
"step": 189
},
{
"epoch": 1.2505494505494505,
"grad_norm": 0.3453136086463928,
"learning_rate": 0.00028298447893569846,
"loss": 0.6001,
"step": 190
},
{
"epoch": 1.2571428571428571,
"grad_norm": 0.39012014865875244,
"learning_rate": 0.0002819246119733925,
"loss": 0.6824,
"step": 191
},
{
"epoch": 1.2637362637362637,
"grad_norm": 0.35880038142204285,
"learning_rate": 0.00028086474501108643,
"loss": 0.6539,
"step": 192
},
{
"epoch": 1.2703296703296703,
"grad_norm": 0.4133313000202179,
"learning_rate": 0.0002798048780487805,
"loss": 0.6706,
"step": 193
},
{
"epoch": 1.2769230769230768,
"grad_norm": 0.39098864793777466,
"learning_rate": 0.0002787450110864745,
"loss": 0.5938,
"step": 194
},
{
"epoch": 1.2835164835164834,
"grad_norm": 0.32598677277565,
"learning_rate": 0.0002776851441241685,
"loss": 0.7272,
"step": 195
},
{
"epoch": 1.2901098901098902,
"grad_norm": 0.3618911802768707,
"learning_rate": 0.00027662527716186254,
"loss": 0.676,
"step": 196
},
{
"epoch": 1.2967032967032968,
"grad_norm": 0.37141621112823486,
"learning_rate": 0.0002755654101995566,
"loss": 0.626,
"step": 197
},
{
"epoch": 1.3032967032967033,
"grad_norm": 0.3062952160835266,
"learning_rate": 0.0002745055432372505,
"loss": 0.5656,
"step": 198
},
{
"epoch": 1.30989010989011,
"grad_norm": 0.37736329436302185,
"learning_rate": 0.00027344567627494455,
"loss": 0.7134,
"step": 199
},
{
"epoch": 1.3164835164835165,
"grad_norm": 0.3816686272621155,
"learning_rate": 0.0002723858093126386,
"loss": 0.6379,
"step": 200
},
{
"epoch": 1.323076923076923,
"grad_norm": 0.3832955062389374,
"learning_rate": 0.0002713259423503326,
"loss": 0.6502,
"step": 201
},
{
"epoch": 1.3296703296703296,
"grad_norm": 0.33459657430648804,
"learning_rate": 0.0002702660753880266,
"loss": 0.659,
"step": 202
},
{
"epoch": 1.3362637362637364,
"grad_norm": 0.42061227560043335,
"learning_rate": 0.00026920620842572066,
"loss": 0.6586,
"step": 203
},
{
"epoch": 1.342857142857143,
"grad_norm": 0.3629121780395508,
"learning_rate": 0.00026814634146341465,
"loss": 0.5816,
"step": 204
},
{
"epoch": 1.3494505494505495,
"grad_norm": 0.3140220642089844,
"learning_rate": 0.00026708647450110864,
"loss": 0.6568,
"step": 205
},
{
"epoch": 1.3560439560439561,
"grad_norm": 0.36066094040870667,
"learning_rate": 0.0002660266075388027,
"loss": 0.6666,
"step": 206
},
{
"epoch": 1.3626373626373627,
"grad_norm": 0.3712823987007141,
"learning_rate": 0.00026496674057649666,
"loss": 0.6371,
"step": 207
},
{
"epoch": 1.3692307692307693,
"grad_norm": 0.4108193516731262,
"learning_rate": 0.0002639068736141907,
"loss": 0.6652,
"step": 208
},
{
"epoch": 1.3758241758241758,
"grad_norm": 0.3651275932788849,
"learning_rate": 0.00026284700665188474,
"loss": 0.6161,
"step": 209
},
{
"epoch": 1.3824175824175824,
"grad_norm": 0.3415852189064026,
"learning_rate": 0.00026178713968957873,
"loss": 0.6737,
"step": 210
},
{
"epoch": 1.389010989010989,
"grad_norm": 0.4050087034702301,
"learning_rate": 0.0002607272727272727,
"loss": 0.5946,
"step": 211
},
{
"epoch": 1.3956043956043955,
"grad_norm": 0.3588634431362152,
"learning_rate": 0.00025966740576496676,
"loss": 0.6445,
"step": 212
},
{
"epoch": 1.402197802197802,
"grad_norm": 0.35990527272224426,
"learning_rate": 0.00025860753880266074,
"loss": 0.6944,
"step": 213
},
{
"epoch": 1.4087912087912087,
"grad_norm": 0.3686452805995941,
"learning_rate": 0.0002575476718403548,
"loss": 0.6887,
"step": 214
},
{
"epoch": 1.4153846153846155,
"grad_norm": 0.3962976932525635,
"learning_rate": 0.0002564878048780488,
"loss": 0.6894,
"step": 215
},
{
"epoch": 1.421978021978022,
"grad_norm": 0.3887828588485718,
"learning_rate": 0.0002554279379157428,
"loss": 0.6455,
"step": 216
},
{
"epoch": 1.4285714285714286,
"grad_norm": 0.3367188274860382,
"learning_rate": 0.0002543680709534368,
"loss": 0.5887,
"step": 217
},
{
"epoch": 1.4351648351648352,
"grad_norm": 0.35716238617897034,
"learning_rate": 0.00025330820399113084,
"loss": 0.6222,
"step": 218
},
{
"epoch": 1.4417582417582417,
"grad_norm": 0.36131733655929565,
"learning_rate": 0.0002522483370288248,
"loss": 0.6142,
"step": 219
},
{
"epoch": 1.4483516483516483,
"grad_norm": 0.40967121720314026,
"learning_rate": 0.00025118847006651887,
"loss": 0.6257,
"step": 220
},
{
"epoch": 1.4549450549450549,
"grad_norm": 0.35617414116859436,
"learning_rate": 0.0002501286031042129,
"loss": 0.6287,
"step": 221
},
{
"epoch": 1.4615384615384617,
"grad_norm": 0.3525332808494568,
"learning_rate": 0.0002490687361419069,
"loss": 0.6664,
"step": 222
},
{
"epoch": 1.4681318681318682,
"grad_norm": 0.39492669701576233,
"learning_rate": 0.0002480088691796009,
"loss": 0.6249,
"step": 223
},
{
"epoch": 1.4747252747252748,
"grad_norm": 0.35548609495162964,
"learning_rate": 0.0002469490022172949,
"loss": 0.5817,
"step": 224
},
{
"epoch": 1.4813186813186814,
"grad_norm": 0.38659876585006714,
"learning_rate": 0.0002458891352549889,
"loss": 0.6588,
"step": 225
},
{
"epoch": 1.487912087912088,
"grad_norm": 0.3900056779384613,
"learning_rate": 0.00024482926829268295,
"loss": 0.6637,
"step": 226
},
{
"epoch": 1.4945054945054945,
"grad_norm": 0.4056378901004791,
"learning_rate": 0.00024376940133037696,
"loss": 0.5983,
"step": 227
},
{
"epoch": 1.501098901098901,
"grad_norm": 0.3593887984752655,
"learning_rate": 0.00024270953436807097,
"loss": 0.6192,
"step": 228
},
{
"epoch": 1.5076923076923077,
"grad_norm": 0.3599669933319092,
"learning_rate": 0.00024164966740576496,
"loss": 0.5867,
"step": 229
},
{
"epoch": 1.5142857142857142,
"grad_norm": 0.3734591007232666,
"learning_rate": 0.00024058980044345897,
"loss": 0.6821,
"step": 230
},
{
"epoch": 1.5208791208791208,
"grad_norm": 0.3447280824184418,
"learning_rate": 0.000239529933481153,
"loss": 0.6375,
"step": 231
},
{
"epoch": 1.5274725274725274,
"grad_norm": 0.36874809861183167,
"learning_rate": 0.00023847006651884703,
"loss": 0.6779,
"step": 232
},
{
"epoch": 1.534065934065934,
"grad_norm": 0.38847875595092773,
"learning_rate": 0.00023741019955654104,
"loss": 0.6667,
"step": 233
},
{
"epoch": 1.5406593406593405,
"grad_norm": 0.39220407605171204,
"learning_rate": 0.00023635033259423503,
"loss": 0.6733,
"step": 234
},
{
"epoch": 1.5472527472527473,
"grad_norm": 0.44259729981422424,
"learning_rate": 0.00023529046563192907,
"loss": 0.6365,
"step": 235
},
{
"epoch": 1.5538461538461539,
"grad_norm": 0.37200653553009033,
"learning_rate": 0.00023423059866962308,
"loss": 0.6352,
"step": 236
},
{
"epoch": 1.5604395604395604,
"grad_norm": 0.3853394389152527,
"learning_rate": 0.00023317073170731707,
"loss": 0.6432,
"step": 237
},
{
"epoch": 1.567032967032967,
"grad_norm": 0.37795448303222656,
"learning_rate": 0.0002321108647450111,
"loss": 0.5782,
"step": 238
},
{
"epoch": 1.5736263736263736,
"grad_norm": 0.3939788043498993,
"learning_rate": 0.00023105099778270512,
"loss": 0.6513,
"step": 239
},
{
"epoch": 1.5802197802197804,
"grad_norm": 0.37062007188796997,
"learning_rate": 0.0002299911308203991,
"loss": 0.6167,
"step": 240
},
{
"epoch": 1.586813186813187,
"grad_norm": 0.3661113679409027,
"learning_rate": 0.00022893126385809315,
"loss": 0.6161,
"step": 241
},
{
"epoch": 1.5934065934065935,
"grad_norm": 0.3689832091331482,
"learning_rate": 0.00022787139689578716,
"loss": 0.6776,
"step": 242
},
{
"epoch": 1.6,
"grad_norm": 0.3579269349575043,
"learning_rate": 0.00022681152993348115,
"loss": 0.6498,
"step": 243
},
{
"epoch": 1.6065934065934067,
"grad_norm": 0.3285681903362274,
"learning_rate": 0.00022575166297117516,
"loss": 0.6519,
"step": 244
},
{
"epoch": 1.6131868131868132,
"grad_norm": 0.34521231055259705,
"learning_rate": 0.0002246917960088692,
"loss": 0.6447,
"step": 245
},
{
"epoch": 1.6197802197802198,
"grad_norm": 0.3420107066631317,
"learning_rate": 0.0002236319290465632,
"loss": 0.6388,
"step": 246
},
{
"epoch": 1.6263736263736264,
"grad_norm": 0.35361817479133606,
"learning_rate": 0.0002225720620842572,
"loss": 0.6077,
"step": 247
},
{
"epoch": 1.632967032967033,
"grad_norm": 0.38164547085762024,
"learning_rate": 0.00022151219512195125,
"loss": 0.5999,
"step": 248
},
{
"epoch": 1.6395604395604395,
"grad_norm": 0.3841310441493988,
"learning_rate": 0.00022045232815964523,
"loss": 0.6645,
"step": 249
},
{
"epoch": 1.646153846153846,
"grad_norm": 0.36244288086891174,
"learning_rate": 0.00021939246119733925,
"loss": 0.6422,
"step": 250
},
{
"epoch": 1.6527472527472526,
"grad_norm": 0.35995614528656006,
"learning_rate": 0.0002183325942350333,
"loss": 0.6243,
"step": 251
},
{
"epoch": 1.6593406593406592,
"grad_norm": 0.3498387336730957,
"learning_rate": 0.00021727272727272727,
"loss": 0.7294,
"step": 252
},
{
"epoch": 1.6659340659340658,
"grad_norm": 0.3545849919319153,
"learning_rate": 0.0002162128603104213,
"loss": 0.6,
"step": 253
},
{
"epoch": 1.6725274725274726,
"grad_norm": 0.3808715045452118,
"learning_rate": 0.00021515299334811533,
"loss": 0.6017,
"step": 254
},
{
"epoch": 1.6791208791208792,
"grad_norm": 0.3720131814479828,
"learning_rate": 0.00021409312638580931,
"loss": 0.698,
"step": 255
},
{
"epoch": 1.6857142857142857,
"grad_norm": 0.365560382604599,
"learning_rate": 0.00021303325942350333,
"loss": 0.6549,
"step": 256
},
{
"epoch": 1.6923076923076923,
"grad_norm": 0.3739791810512543,
"learning_rate": 0.00021197339246119737,
"loss": 0.6619,
"step": 257
},
{
"epoch": 1.6989010989010989,
"grad_norm": 0.3811318278312683,
"learning_rate": 0.00021091352549889135,
"loss": 0.6728,
"step": 258
},
{
"epoch": 1.7054945054945057,
"grad_norm": 0.37915971875190735,
"learning_rate": 0.00020985365853658537,
"loss": 0.6009,
"step": 259
},
{
"epoch": 1.7120879120879122,
"grad_norm": 0.43078261613845825,
"learning_rate": 0.0002087937915742794,
"loss": 0.5865,
"step": 260
},
{
"epoch": 1.7186813186813188,
"grad_norm": 0.39934995770454407,
"learning_rate": 0.0002077339246119734,
"loss": 0.5964,
"step": 261
},
{
"epoch": 1.7252747252747254,
"grad_norm": 0.3778096139431,
"learning_rate": 0.0002066740576496674,
"loss": 0.7449,
"step": 262
},
{
"epoch": 1.731868131868132,
"grad_norm": 0.37463709712028503,
"learning_rate": 0.00020561419068736142,
"loss": 0.5972,
"step": 263
},
{
"epoch": 1.7384615384615385,
"grad_norm": 0.41654863953590393,
"learning_rate": 0.00020455432372505544,
"loss": 0.5918,
"step": 264
},
{
"epoch": 1.745054945054945,
"grad_norm": 0.3658749759197235,
"learning_rate": 0.00020349445676274945,
"loss": 0.58,
"step": 265
},
{
"epoch": 1.7516483516483516,
"grad_norm": 0.3733176290988922,
"learning_rate": 0.00020243458980044346,
"loss": 0.744,
"step": 266
},
{
"epoch": 1.7582417582417582,
"grad_norm": 0.38651400804519653,
"learning_rate": 0.00020137472283813748,
"loss": 0.6206,
"step": 267
},
{
"epoch": 1.7648351648351648,
"grad_norm": 0.377961665391922,
"learning_rate": 0.0002003148558758315,
"loss": 0.7244,
"step": 268
},
{
"epoch": 1.7714285714285714,
"grad_norm": 0.3353257477283478,
"learning_rate": 0.0001992549889135255,
"loss": 0.6618,
"step": 269
},
{
"epoch": 1.778021978021978,
"grad_norm": 0.3616909384727478,
"learning_rate": 0.00019819512195121952,
"loss": 0.6544,
"step": 270
},
{
"epoch": 1.7846153846153845,
"grad_norm": 0.35055965185165405,
"learning_rate": 0.00019713525498891353,
"loss": 0.62,
"step": 271
},
{
"epoch": 1.791208791208791,
"grad_norm": 0.3660716414451599,
"learning_rate": 0.00019607538802660754,
"loss": 0.6236,
"step": 272
},
{
"epoch": 1.7978021978021979,
"grad_norm": 0.37623634934425354,
"learning_rate": 0.00019501552106430156,
"loss": 0.6487,
"step": 273
},
{
"epoch": 1.8043956043956044,
"grad_norm": 0.3791641592979431,
"learning_rate": 0.00019395565410199557,
"loss": 0.6505,
"step": 274
},
{
"epoch": 1.810989010989011,
"grad_norm": 0.4153837263584137,
"learning_rate": 0.00019289578713968959,
"loss": 0.6357,
"step": 275
},
{
"epoch": 1.8175824175824176,
"grad_norm": 0.3974490165710449,
"learning_rate": 0.0001918359201773836,
"loss": 0.635,
"step": 276
},
{
"epoch": 1.8241758241758241,
"grad_norm": 0.41546180844306946,
"learning_rate": 0.0001907760532150776,
"loss": 0.5926,
"step": 277
},
{
"epoch": 1.830769230769231,
"grad_norm": 0.36638110876083374,
"learning_rate": 0.00018971618625277163,
"loss": 0.6514,
"step": 278
},
{
"epoch": 1.8373626373626375,
"grad_norm": 0.3790123462677002,
"learning_rate": 0.00018865631929046564,
"loss": 0.6576,
"step": 279
},
{
"epoch": 1.843956043956044,
"grad_norm": 0.374115526676178,
"learning_rate": 0.00018759645232815965,
"loss": 0.6328,
"step": 280
},
{
"epoch": 1.8505494505494506,
"grad_norm": 0.36899662017822266,
"learning_rate": 0.00018653658536585367,
"loss": 0.6007,
"step": 281
},
{
"epoch": 1.8571428571428572,
"grad_norm": 0.36647939682006836,
"learning_rate": 0.00018547671840354768,
"loss": 0.6552,
"step": 282
},
{
"epoch": 1.8637362637362638,
"grad_norm": 0.37169116735458374,
"learning_rate": 0.0001844168514412417,
"loss": 0.591,
"step": 283
},
{
"epoch": 1.8703296703296703,
"grad_norm": 0.40471574664115906,
"learning_rate": 0.0001833569844789357,
"loss": 0.6495,
"step": 284
},
{
"epoch": 1.876923076923077,
"grad_norm": 0.3741428852081299,
"learning_rate": 0.0001822971175166297,
"loss": 0.599,
"step": 285
},
{
"epoch": 1.8835164835164835,
"grad_norm": 0.3474360406398773,
"learning_rate": 0.00018123725055432373,
"loss": 0.6384,
"step": 286
},
{
"epoch": 1.89010989010989,
"grad_norm": 0.3605997562408447,
"learning_rate": 0.00018017738359201775,
"loss": 0.6477,
"step": 287
},
{
"epoch": 1.8967032967032966,
"grad_norm": 0.34898510575294495,
"learning_rate": 0.00017911751662971173,
"loss": 0.6447,
"step": 288
},
{
"epoch": 1.9032967032967032,
"grad_norm": 0.39736175537109375,
"learning_rate": 0.00017805764966740578,
"loss": 0.7392,
"step": 289
},
{
"epoch": 1.9098901098901098,
"grad_norm": 0.3412422239780426,
"learning_rate": 0.0001769977827050998,
"loss": 0.6967,
"step": 290
},
{
"epoch": 1.9164835164835163,
"grad_norm": 0.35411298274993896,
"learning_rate": 0.00017593791574279378,
"loss": 0.701,
"step": 291
},
{
"epoch": 1.9230769230769231,
"grad_norm": 0.3787080645561218,
"learning_rate": 0.00017487804878048782,
"loss": 0.5901,
"step": 292
},
{
"epoch": 1.9296703296703297,
"grad_norm": 0.4306442439556122,
"learning_rate": 0.00017381818181818183,
"loss": 0.652,
"step": 293
},
{
"epoch": 1.9362637362637363,
"grad_norm": 0.43030846118927,
"learning_rate": 0.00017275831485587582,
"loss": 0.7147,
"step": 294
},
{
"epoch": 1.9428571428571428,
"grad_norm": 0.3750913739204407,
"learning_rate": 0.00017169844789356986,
"loss": 0.6517,
"step": 295
},
{
"epoch": 1.9494505494505494,
"grad_norm": 0.3687937557697296,
"learning_rate": 0.00017063858093126387,
"loss": 0.6481,
"step": 296
},
{
"epoch": 1.9560439560439562,
"grad_norm": 0.37245458364486694,
"learning_rate": 0.00016957871396895788,
"loss": 0.703,
"step": 297
},
{
"epoch": 1.9626373626373628,
"grad_norm": 0.35127994418144226,
"learning_rate": 0.0001685188470066519,
"loss": 0.6116,
"step": 298
},
{
"epoch": 1.9692307692307693,
"grad_norm": 0.3911903500556946,
"learning_rate": 0.0001674589800443459,
"loss": 0.6367,
"step": 299
},
{
"epoch": 1.975824175824176,
"grad_norm": 0.3940306305885315,
"learning_rate": 0.00016639911308203992,
"loss": 0.6765,
"step": 300
},
{
"epoch": 1.9824175824175825,
"grad_norm": 0.40002891421318054,
"learning_rate": 0.00016533924611973394,
"loss": 0.6013,
"step": 301
},
{
"epoch": 1.989010989010989,
"grad_norm": 0.42048192024230957,
"learning_rate": 0.00016427937915742795,
"loss": 0.6515,
"step": 302
},
{
"epoch": 1.9956043956043956,
"grad_norm": 0.3791607618331909,
"learning_rate": 0.00016321951219512197,
"loss": 0.5838,
"step": 303
},
{
"epoch": 2.0,
"grad_norm": 0.5695094466209412,
"learning_rate": 0.00016215964523281595,
"loss": 0.6227,
"step": 304
},
{
"epoch": 2.0065934065934066,
"grad_norm": 0.3927454948425293,
"learning_rate": 0.00016109977827051,
"loss": 0.5797,
"step": 305
},
{
"epoch": 2.013186813186813,
"grad_norm": 0.37926599383354187,
"learning_rate": 0.000160039911308204,
"loss": 0.5397,
"step": 306
},
{
"epoch": 2.0197802197802197,
"grad_norm": 0.3964325189590454,
"learning_rate": 0.000158980044345898,
"loss": 0.5796,
"step": 307
},
{
"epoch": 2.0263736263736263,
"grad_norm": 0.38841575384140015,
"learning_rate": 0.00015792017738359203,
"loss": 0.4925,
"step": 308
},
{
"epoch": 2.032967032967033,
"grad_norm": 0.410722941160202,
"learning_rate": 0.00015686031042128605,
"loss": 0.5662,
"step": 309
},
{
"epoch": 2.0395604395604394,
"grad_norm": 0.45456835627555847,
"learning_rate": 0.00015580044345898003,
"loss": 0.591,
"step": 310
},
{
"epoch": 2.046153846153846,
"grad_norm": 0.42649292945861816,
"learning_rate": 0.00015474057649667407,
"loss": 0.5464,
"step": 311
},
{
"epoch": 2.0527472527472526,
"grad_norm": 0.4023902714252472,
"learning_rate": 0.0001536807095343681,
"loss": 0.5437,
"step": 312
},
{
"epoch": 2.059340659340659,
"grad_norm": 0.3795386850833893,
"learning_rate": 0.00015262084257206207,
"loss": 0.4971,
"step": 313
},
{
"epoch": 2.065934065934066,
"grad_norm": 0.40091997385025024,
"learning_rate": 0.00015156097560975611,
"loss": 0.5157,
"step": 314
},
{
"epoch": 2.0725274725274727,
"grad_norm": 0.3627980649471283,
"learning_rate": 0.00015050110864745013,
"loss": 0.501,
"step": 315
},
{
"epoch": 2.0791208791208793,
"grad_norm": 0.41095221042633057,
"learning_rate": 0.00014944124168514411,
"loss": 0.5733,
"step": 316
},
{
"epoch": 2.085714285714286,
"grad_norm": 0.46346715092658997,
"learning_rate": 0.00014838137472283816,
"loss": 0.5563,
"step": 317
},
{
"epoch": 2.0923076923076924,
"grad_norm": 0.4056820571422577,
"learning_rate": 0.00014732150776053217,
"loss": 0.5715,
"step": 318
},
{
"epoch": 2.098901098901099,
"grad_norm": 0.4651278257369995,
"learning_rate": 0.00014626164079822616,
"loss": 0.4923,
"step": 319
},
{
"epoch": 2.1054945054945056,
"grad_norm": 0.4463025629520416,
"learning_rate": 0.0001452017738359202,
"loss": 0.5858,
"step": 320
},
{
"epoch": 2.112087912087912,
"grad_norm": 0.44867852330207825,
"learning_rate": 0.0001441419068736142,
"loss": 0.558,
"step": 321
},
{
"epoch": 2.1186813186813187,
"grad_norm": 0.41333332657814026,
"learning_rate": 0.0001430820399113082,
"loss": 0.5505,
"step": 322
},
{
"epoch": 2.1252747252747253,
"grad_norm": 0.4120679795742035,
"learning_rate": 0.00014202217294900224,
"loss": 0.5335,
"step": 323
},
{
"epoch": 2.131868131868132,
"grad_norm": 0.4014519453048706,
"learning_rate": 0.00014096230598669625,
"loss": 0.522,
"step": 324
},
{
"epoch": 2.1384615384615384,
"grad_norm": 0.4796731472015381,
"learning_rate": 0.00013990243902439024,
"loss": 0.5727,
"step": 325
},
{
"epoch": 2.145054945054945,
"grad_norm": 0.44720908999443054,
"learning_rate": 0.00013884257206208425,
"loss": 0.5739,
"step": 326
},
{
"epoch": 2.1516483516483516,
"grad_norm": 0.49437999725341797,
"learning_rate": 0.0001377827050997783,
"loss": 0.567,
"step": 327
},
{
"epoch": 2.158241758241758,
"grad_norm": 0.45990318059921265,
"learning_rate": 0.00013672283813747228,
"loss": 0.5099,
"step": 328
},
{
"epoch": 2.1648351648351647,
"grad_norm": 0.48705539107322693,
"learning_rate": 0.0001356629711751663,
"loss": 0.5058,
"step": 329
},
{
"epoch": 2.1714285714285713,
"grad_norm": 0.42516469955444336,
"learning_rate": 0.00013460310421286033,
"loss": 0.5034,
"step": 330
},
{
"epoch": 2.178021978021978,
"grad_norm": 0.4437274932861328,
"learning_rate": 0.00013354323725055432,
"loss": 0.538,
"step": 331
},
{
"epoch": 2.184615384615385,
"grad_norm": 0.48122531175613403,
"learning_rate": 0.00013248337028824833,
"loss": 0.5472,
"step": 332
},
{
"epoch": 2.1912087912087914,
"grad_norm": 0.5141119956970215,
"learning_rate": 0.00013142350332594237,
"loss": 0.5172,
"step": 333
},
{
"epoch": 2.197802197802198,
"grad_norm": 0.48253554105758667,
"learning_rate": 0.00013036363636363636,
"loss": 0.5747,
"step": 334
},
{
"epoch": 2.2043956043956046,
"grad_norm": 0.5002180337905884,
"learning_rate": 0.00012930376940133037,
"loss": 0.5413,
"step": 335
},
{
"epoch": 2.210989010989011,
"grad_norm": 0.5182358622550964,
"learning_rate": 0.0001282439024390244,
"loss": 0.5553,
"step": 336
},
{
"epoch": 2.2175824175824177,
"grad_norm": 0.49602043628692627,
"learning_rate": 0.0001271840354767184,
"loss": 0.5302,
"step": 337
},
{
"epoch": 2.2241758241758243,
"grad_norm": 0.4516575038433075,
"learning_rate": 0.0001261241685144124,
"loss": 0.5145,
"step": 338
},
{
"epoch": 2.230769230769231,
"grad_norm": 0.5268491506576538,
"learning_rate": 0.00012506430155210645,
"loss": 0.6026,
"step": 339
},
{
"epoch": 2.2373626373626374,
"grad_norm": 0.5656492710113525,
"learning_rate": 0.00012400443458980044,
"loss": 0.6146,
"step": 340
},
{
"epoch": 2.243956043956044,
"grad_norm": 0.4348342716693878,
"learning_rate": 0.00012294456762749445,
"loss": 0.5895,
"step": 341
},
{
"epoch": 2.2505494505494505,
"grad_norm": 0.4370437562465668,
"learning_rate": 0.00012188470066518848,
"loss": 0.5207,
"step": 342
},
{
"epoch": 2.257142857142857,
"grad_norm": 0.49735766649246216,
"learning_rate": 0.00012082483370288248,
"loss": 0.5473,
"step": 343
},
{
"epoch": 2.2637362637362637,
"grad_norm": 0.45202648639678955,
"learning_rate": 0.0001197649667405765,
"loss": 0.5432,
"step": 344
},
{
"epoch": 2.2703296703296703,
"grad_norm": 0.44890251755714417,
"learning_rate": 0.00011870509977827052,
"loss": 0.498,
"step": 345
},
{
"epoch": 2.276923076923077,
"grad_norm": 0.4461687207221985,
"learning_rate": 0.00011764523281596453,
"loss": 0.4767,
"step": 346
},
{
"epoch": 2.2835164835164834,
"grad_norm": 0.48121407628059387,
"learning_rate": 0.00011658536585365853,
"loss": 0.5976,
"step": 347
},
{
"epoch": 2.29010989010989,
"grad_norm": 0.4563685953617096,
"learning_rate": 0.00011552549889135256,
"loss": 0.5828,
"step": 348
},
{
"epoch": 2.2967032967032965,
"grad_norm": 0.5286670327186584,
"learning_rate": 0.00011446563192904658,
"loss": 0.5899,
"step": 349
},
{
"epoch": 2.303296703296703,
"grad_norm": 0.49744054675102234,
"learning_rate": 0.00011340576496674058,
"loss": 0.5124,
"step": 350
},
{
"epoch": 2.3098901098901097,
"grad_norm": 0.46971404552459717,
"learning_rate": 0.0001123458980044346,
"loss": 0.5052,
"step": 351
},
{
"epoch": 2.3164835164835162,
"grad_norm": 0.44935399293899536,
"learning_rate": 0.0001112860310421286,
"loss": 0.5604,
"step": 352
},
{
"epoch": 2.3230769230769233,
"grad_norm": 0.4866276681423187,
"learning_rate": 0.00011022616407982262,
"loss": 0.53,
"step": 353
},
{
"epoch": 2.32967032967033,
"grad_norm": 0.4510449171066284,
"learning_rate": 0.00010916629711751664,
"loss": 0.535,
"step": 354
},
{
"epoch": 2.3362637362637364,
"grad_norm": 0.5384944081306458,
"learning_rate": 0.00010810643015521064,
"loss": 0.5308,
"step": 355
},
{
"epoch": 2.342857142857143,
"grad_norm": 0.5352367162704468,
"learning_rate": 0.00010704656319290466,
"loss": 0.5214,
"step": 356
},
{
"epoch": 2.3494505494505495,
"grad_norm": 0.4872523248195648,
"learning_rate": 0.00010598669623059868,
"loss": 0.5396,
"step": 357
},
{
"epoch": 2.356043956043956,
"grad_norm": 0.4921906888484955,
"learning_rate": 0.00010492682926829268,
"loss": 0.5246,
"step": 358
},
{
"epoch": 2.3626373626373627,
"grad_norm": 0.5419618487358093,
"learning_rate": 0.0001038669623059867,
"loss": 0.5967,
"step": 359
},
{
"epoch": 2.3692307692307693,
"grad_norm": 0.5435441136360168,
"learning_rate": 0.00010280709534368071,
"loss": 0.5464,
"step": 360
},
{
"epoch": 2.375824175824176,
"grad_norm": 0.5189798474311829,
"learning_rate": 0.00010174722838137472,
"loss": 0.5533,
"step": 361
},
{
"epoch": 2.3824175824175824,
"grad_norm": 0.5280422568321228,
"learning_rate": 0.00010068736141906874,
"loss": 0.536,
"step": 362
},
{
"epoch": 2.389010989010989,
"grad_norm": 0.5015032887458801,
"learning_rate": 9.962749445676275e-05,
"loss": 0.5259,
"step": 363
},
{
"epoch": 2.3956043956043955,
"grad_norm": 0.4896168112754822,
"learning_rate": 9.856762749445677e-05,
"loss": 0.546,
"step": 364
},
{
"epoch": 2.402197802197802,
"grad_norm": 0.5274070501327515,
"learning_rate": 9.750776053215078e-05,
"loss": 0.5342,
"step": 365
},
{
"epoch": 2.4087912087912087,
"grad_norm": 0.47004714608192444,
"learning_rate": 9.644789356984479e-05,
"loss": 0.5574,
"step": 366
},
{
"epoch": 2.4153846153846152,
"grad_norm": 0.4602804481983185,
"learning_rate": 9.53880266075388e-05,
"loss": 0.5335,
"step": 367
},
{
"epoch": 2.421978021978022,
"grad_norm": 0.5090558528900146,
"learning_rate": 9.432815964523282e-05,
"loss": 0.5146,
"step": 368
},
{
"epoch": 2.4285714285714284,
"grad_norm": 0.46477729082107544,
"learning_rate": 9.326829268292683e-05,
"loss": 0.5094,
"step": 369
},
{
"epoch": 2.4351648351648354,
"grad_norm": 0.4689581096172333,
"learning_rate": 9.220842572062085e-05,
"loss": 0.4868,
"step": 370
},
{
"epoch": 2.441758241758242,
"grad_norm": 0.5514542460441589,
"learning_rate": 9.114855875831485e-05,
"loss": 0.5778,
"step": 371
},
{
"epoch": 2.4483516483516485,
"grad_norm": 0.538215696811676,
"learning_rate": 9.008869179600887e-05,
"loss": 0.5387,
"step": 372
},
{
"epoch": 2.454945054945055,
"grad_norm": 0.5533526539802551,
"learning_rate": 8.902882483370289e-05,
"loss": 0.5511,
"step": 373
},
{
"epoch": 2.4615384615384617,
"grad_norm": 0.5638222098350525,
"learning_rate": 8.796895787139689e-05,
"loss": 0.5237,
"step": 374
},
{
"epoch": 2.4681318681318682,
"grad_norm": 0.5352548360824585,
"learning_rate": 8.690909090909091e-05,
"loss": 0.537,
"step": 375
}
],
"logging_steps": 1,
"max_steps": 456,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 15,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.716463320435118e+17,
"train_batch_size": 22,
"trial_name": null,
"trial_params": null
}