qwen36-27b-cyber-v2 / checkpoint-1800 /trainer_state.json
Asilarkness's picture
Training in progress, step 1800, checkpoint
2e19e94 verified
Raw
History Blame Contribute Delete
71.3 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.8716681835912103,
"eval_steps": 100,
"global_step": 1800,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.005200884150305552,
"grad_norm": 4.82585334777832,
"learning_rate": 5.6140350877192985e-06,
"loss": 0.7676299571990967,
"step": 5
},
{
"epoch": 0.010401768300611104,
"grad_norm": 3.292309522628784,
"learning_rate": 1.263157894736842e-05,
"loss": 0.631245470046997,
"step": 10
},
{
"epoch": 0.015602652450916656,
"grad_norm": 3.0301995277404785,
"learning_rate": 1.9649122807017544e-05,
"loss": 0.6749040126800537,
"step": 15
},
{
"epoch": 0.02080353660122221,
"grad_norm": 2.853067398071289,
"learning_rate": 2.6666666666666667e-05,
"loss": 0.7889204978942871,
"step": 20
},
{
"epoch": 0.02600442075152776,
"grad_norm": 2.4595491886138916,
"learning_rate": 3.368421052631579e-05,
"loss": 0.8261689186096192,
"step": 25
},
{
"epoch": 0.031205304901833313,
"grad_norm": 3.285839319229126,
"learning_rate": 4.070175438596492e-05,
"loss": 0.8855669021606445,
"step": 30
},
{
"epoch": 0.03640618905213886,
"grad_norm": 2.9381635189056396,
"learning_rate": 4.771929824561404e-05,
"loss": 0.8640634536743164,
"step": 35
},
{
"epoch": 0.04160707320244442,
"grad_norm": 2.142974376678467,
"learning_rate": 5.4736842105263165e-05,
"loss": 0.8938538551330566,
"step": 40
},
{
"epoch": 0.046807957352749965,
"grad_norm": 3.4374115467071533,
"learning_rate": 6.175438596491228e-05,
"loss": 0.9762144088745117,
"step": 45
},
{
"epoch": 0.05200884150305552,
"grad_norm": 2.2888057231903076,
"learning_rate": 6.87719298245614e-05,
"loss": 1.0100465774536134,
"step": 50
},
{
"epoch": 0.05720972565336107,
"grad_norm": 2.101193428039551,
"learning_rate": 7.578947368421052e-05,
"loss": 1.0064237594604493,
"step": 55
},
{
"epoch": 0.062410609803666625,
"grad_norm": 2.3019754886627197,
"learning_rate": 7.999977348305978e-05,
"loss": 1.0382986068725586,
"step": 60
},
{
"epoch": 0.06761149395397217,
"grad_norm": 2.0822298526763916,
"learning_rate": 7.999722519694521e-05,
"loss": 1.1403823852539063,
"step": 65
},
{
"epoch": 0.07281237810427772,
"grad_norm": 2.109672784805298,
"learning_rate": 7.999184565952555e-05,
"loss": 1.0954228401184083,
"step": 70
},
{
"epoch": 0.07801326225458328,
"grad_norm": 1.9484328031539917,
"learning_rate": 7.998363525159777e-05,
"loss": 1.125577735900879,
"step": 75
},
{
"epoch": 0.08321414640488883,
"grad_norm": 2.0304486751556396,
"learning_rate": 7.997259455434539e-05,
"loss": 1.078431987762451,
"step": 80
},
{
"epoch": 0.08841503055519438,
"grad_norm": 1.8764644861221313,
"learning_rate": 7.995872434929734e-05,
"loss": 1.0825774192810058,
"step": 85
},
{
"epoch": 0.09361591470549993,
"grad_norm": 2.521047353744507,
"learning_rate": 7.994202561827263e-05,
"loss": 1.0628202438354493,
"step": 90
},
{
"epoch": 0.0988167988558055,
"grad_norm": 1.7737245559692383,
"learning_rate": 7.992249954331088e-05,
"loss": 1.0672310829162597,
"step": 95
},
{
"epoch": 0.10401768300611104,
"grad_norm": 2.0016262531280518,
"learning_rate": 7.990014750658856e-05,
"loss": 1.0844260215759278,
"step": 100
},
{
"epoch": 0.10401768300611104,
"eval_loss": 1.090377688407898,
"eval_runtime": 131.495,
"eval_samples_per_second": 1.947,
"eval_steps_per_second": 1.947,
"step": 100
},
{
"epoch": 0.10921856715641659,
"grad_norm": 2.2041330337524414,
"learning_rate": 7.987497109032128e-05,
"loss": 1.095380973815918,
"step": 105
},
{
"epoch": 0.11441945130672214,
"grad_norm": 1.7770912647247314,
"learning_rate": 7.98469720766517e-05,
"loss": 1.076313304901123,
"step": 110
},
{
"epoch": 0.11962033545702769,
"grad_norm": 2.0055956840515137,
"learning_rate": 7.98161524475234e-05,
"loss": 1.069803810119629,
"step": 115
},
{
"epoch": 0.12482121960733325,
"grad_norm": 1.9808892011642456,
"learning_rate": 7.978251438454063e-05,
"loss": 1.062901496887207,
"step": 120
},
{
"epoch": 0.13002210375763879,
"grad_norm": 1.7519869804382324,
"learning_rate": 7.974606026881378e-05,
"loss": 1.03425931930542,
"step": 125
},
{
"epoch": 0.13522298790794435,
"grad_norm": 1.8879916667938232,
"learning_rate": 7.970679268079092e-05,
"loss": 1.085061264038086,
"step": 130
},
{
"epoch": 0.1404238720582499,
"grad_norm": 1.855212926864624,
"learning_rate": 7.966471440007514e-05,
"loss": 1.0653216361999511,
"step": 135
},
{
"epoch": 0.14562475620855544,
"grad_norm": 1.9829131364822388,
"learning_rate": 7.961982840522773e-05,
"loss": 1.0679091453552245,
"step": 140
},
{
"epoch": 0.150825640358861,
"grad_norm": 1.8631235361099243,
"learning_rate": 7.957213787355738e-05,
"loss": 1.0336699485778809,
"step": 145
},
{
"epoch": 0.15602652450916657,
"grad_norm": 1.7199710607528687,
"learning_rate": 7.95216461808953e-05,
"loss": 1.085853385925293,
"step": 150
},
{
"epoch": 0.1612274086594721,
"grad_norm": 1.8429338932037354,
"learning_rate": 7.946835690135617e-05,
"loss": 1.039409065246582,
"step": 155
},
{
"epoch": 0.16642829280977767,
"grad_norm": 1.9319918155670166,
"learning_rate": 7.941227380708522e-05,
"loss": 1.0467087745666503,
"step": 160
},
{
"epoch": 0.1716291769600832,
"grad_norm": 2.0441744327545166,
"learning_rate": 7.93534008679912e-05,
"loss": 1.0675994873046875,
"step": 165
},
{
"epoch": 0.17683006111038876,
"grad_norm": 1.847270131111145,
"learning_rate": 7.929174225146534e-05,
"loss": 1.0682602882385255,
"step": 170
},
{
"epoch": 0.18203094526069433,
"grad_norm": 1.8770182132720947,
"learning_rate": 7.922730232208637e-05,
"loss": 1.0655933380126954,
"step": 175
},
{
"epoch": 0.18723182941099986,
"grad_norm": 1.9199661016464233,
"learning_rate": 7.916008564131158e-05,
"loss": 1.0514616012573241,
"step": 180
},
{
"epoch": 0.19243271356130542,
"grad_norm": 1.7040131092071533,
"learning_rate": 7.909009696715391e-05,
"loss": 1.0357669830322265,
"step": 185
},
{
"epoch": 0.197633597711611,
"grad_norm": 1.7878484725952148,
"learning_rate": 7.901734125384515e-05,
"loss": 1.034726905822754,
"step": 190
},
{
"epoch": 0.20283448186191652,
"grad_norm": 1.7647621631622314,
"learning_rate": 7.89418236514853e-05,
"loss": 1.0258402824401855,
"step": 195
},
{
"epoch": 0.20803536601222208,
"grad_norm": 1.7211089134216309,
"learning_rate": 7.886354950567789e-05,
"loss": 1.0237075805664062,
"step": 200
},
{
"epoch": 0.20803536601222208,
"eval_loss": 1.0211308002471924,
"eval_runtime": 130.7508,
"eval_samples_per_second": 1.958,
"eval_steps_per_second": 1.958,
"step": 200
},
{
"epoch": 0.21323625016252762,
"grad_norm": 1.9167125225067139,
"learning_rate": 7.878252435715178e-05,
"loss": 1.0424039840698243,
"step": 205
},
{
"epoch": 0.21843713431283318,
"grad_norm": 1.6589795351028442,
"learning_rate": 7.869875394136873e-05,
"loss": 0.985629940032959,
"step": 210
},
{
"epoch": 0.22363801846313874,
"grad_norm": 1.7960469722747803,
"learning_rate": 7.861224418811757e-05,
"loss": 1.0503170013427734,
"step": 215
},
{
"epoch": 0.22883890261344428,
"grad_norm": 1.876910924911499,
"learning_rate": 7.852300122109443e-05,
"loss": 1.0263469696044922,
"step": 220
},
{
"epoch": 0.23403978676374984,
"grad_norm": 1.7034902572631836,
"learning_rate": 7.843103135746916e-05,
"loss": 1.0396705627441407,
"step": 225
},
{
"epoch": 0.23924067091405538,
"grad_norm": 1.7886664867401123,
"learning_rate": 7.833634110743832e-05,
"loss": 1.0125335693359374,
"step": 230
},
{
"epoch": 0.24444155506436094,
"grad_norm": 1.7878754138946533,
"learning_rate": 7.823893717376422e-05,
"loss": 0.9978487968444825,
"step": 235
},
{
"epoch": 0.2496424392146665,
"grad_norm": 1.6163357496261597,
"learning_rate": 7.813882645130049e-05,
"loss": 1.0093013763427734,
"step": 240
},
{
"epoch": 0.25484332336497206,
"grad_norm": 1.7179474830627441,
"learning_rate": 7.80360160265041e-05,
"loss": 0.9946321487426758,
"step": 245
},
{
"epoch": 0.26004420751527757,
"grad_norm": 1.828262209892273,
"learning_rate": 7.793051317693359e-05,
"loss": 1.0461179733276367,
"step": 250
},
{
"epoch": 0.26524509166558313,
"grad_norm": 1.837222933769226,
"learning_rate": 7.782232537073406e-05,
"loss": 1.0099411964416505,
"step": 255
},
{
"epoch": 0.2704459758158887,
"grad_norm": 1.9459391832351685,
"learning_rate": 7.771146026610844e-05,
"loss": 0.9811776161193848,
"step": 260
},
{
"epoch": 0.27564685996619426,
"grad_norm": 1.8060634136199951,
"learning_rate": 7.759792571077545e-05,
"loss": 0.9858491897583008,
"step": 265
},
{
"epoch": 0.2808477441164998,
"grad_norm": 1.8257906436920166,
"learning_rate": 7.748172974141401e-05,
"loss": 1.0260663032531738,
"step": 270
},
{
"epoch": 0.2860486282668054,
"grad_norm": 1.7271229028701782,
"learning_rate": 7.736288058309448e-05,
"loss": 1.0253376007080077,
"step": 275
},
{
"epoch": 0.2912495124171109,
"grad_norm": 1.6389424800872803,
"learning_rate": 7.724138664869628e-05,
"loss": 0.9872174263000488,
"step": 280
},
{
"epoch": 0.29645039656741645,
"grad_norm": 1.7230466604232788,
"learning_rate": 7.711725653831255e-05,
"loss": 1.0354929924011231,
"step": 285
},
{
"epoch": 0.301651280717722,
"grad_norm": 1.7749247550964355,
"learning_rate": 7.699049903864125e-05,
"loss": 0.9916903495788574,
"step": 290
},
{
"epoch": 0.3068521648680276,
"grad_norm": 1.7340270280838013,
"learning_rate": 7.68611231223632e-05,
"loss": 1.0025782585144043,
"step": 295
},
{
"epoch": 0.31205304901833314,
"grad_norm": 1.5753134489059448,
"learning_rate": 7.672913794750699e-05,
"loss": 0.9782845497131347,
"step": 300
},
{
"epoch": 0.31205304901833314,
"eval_loss": 1.01508629322052,
"eval_runtime": 130.89,
"eval_samples_per_second": 1.956,
"eval_steps_per_second": 1.956,
"step": 300
},
{
"epoch": 0.31725393316863865,
"grad_norm": 1.6529031991958618,
"learning_rate": 7.659455285680071e-05,
"loss": 0.9918001174926758,
"step": 305
},
{
"epoch": 0.3224548173189442,
"grad_norm": 1.6655994653701782,
"learning_rate": 7.645737737701054e-05,
"loss": 0.9847027778625488,
"step": 310
},
{
"epoch": 0.32765570146924977,
"grad_norm": 1.7864056825637817,
"learning_rate": 7.631762121826653e-05,
"loss": 0.9591518402099609,
"step": 315
},
{
"epoch": 0.33285658561955533,
"grad_norm": 1.7958587408065796,
"learning_rate": 7.617529427337507e-05,
"loss": 0.9712434768676758,
"step": 320
},
{
"epoch": 0.3380574697698609,
"grad_norm": 1.7462350130081177,
"learning_rate": 7.603040661711879e-05,
"loss": 1.0182976722717285,
"step": 325
},
{
"epoch": 0.3432583539201664,
"grad_norm": 1.73703932762146,
"learning_rate": 7.588296850554326e-05,
"loss": 0.978699779510498,
"step": 330
},
{
"epoch": 0.34845923807047197,
"grad_norm": 1.781213402748108,
"learning_rate": 7.573299037523115e-05,
"loss": 1.0263344764709472,
"step": 335
},
{
"epoch": 0.35366012222077753,
"grad_norm": 1.7940926551818848,
"learning_rate": 7.558048284256334e-05,
"loss": 1.039241409301758,
"step": 340
},
{
"epoch": 0.3588610063710831,
"grad_norm": 1.725530982017517,
"learning_rate": 7.542545670296747e-05,
"loss": 0.9716745376586914,
"step": 345
},
{
"epoch": 0.36406189052138865,
"grad_norm": 1.665209174156189,
"learning_rate": 7.526792293015382e-05,
"loss": 0.9396204948425293,
"step": 350
},
{
"epoch": 0.36926277467169416,
"grad_norm": 1.8031824827194214,
"learning_rate": 7.51078926753384e-05,
"loss": 0.9682992935180664,
"step": 355
},
{
"epoch": 0.3744636588219997,
"grad_norm": 1.7742233276367188,
"learning_rate": 7.494537726645375e-05,
"loss": 0.9833150863647461,
"step": 360
},
{
"epoch": 0.3796645429723053,
"grad_norm": 1.7864766120910645,
"learning_rate": 7.478038820734698e-05,
"loss": 0.9690051078796387,
"step": 365
},
{
"epoch": 0.38486542712261085,
"grad_norm": 1.7735403776168823,
"learning_rate": 7.461293717696549e-05,
"loss": 0.9864785194396972,
"step": 370
},
{
"epoch": 0.3900663112729164,
"grad_norm": 1.6049963235855103,
"learning_rate": 7.444303602853024e-05,
"loss": 0.9804511070251465,
"step": 375
},
{
"epoch": 0.395267195423222,
"grad_norm": 1.6558054685592651,
"learning_rate": 7.427069678869672e-05,
"loss": 0.9362913131713867,
"step": 380
},
{
"epoch": 0.4004680795735275,
"grad_norm": 1.6555157899856567,
"learning_rate": 7.409593165670364e-05,
"loss": 0.948128604888916,
"step": 385
},
{
"epoch": 0.40566896372383304,
"grad_norm": 1.812888741493225,
"learning_rate": 7.391875300350937e-05,
"loss": 0.9553811073303222,
"step": 390
},
{
"epoch": 0.4108698478741386,
"grad_norm": 1.6602718830108643,
"learning_rate": 7.373917337091626e-05,
"loss": 0.940127944946289,
"step": 395
},
{
"epoch": 0.41607073202444417,
"grad_norm": 1.7474323511123657,
"learning_rate": 7.355720547068288e-05,
"loss": 0.9683933258056641,
"step": 400
},
{
"epoch": 0.41607073202444417,
"eval_loss": 0.9856516122817993,
"eval_runtime": 130.2348,
"eval_samples_per_second": 1.966,
"eval_steps_per_second": 1.966,
"step": 400
},
{
"epoch": 0.42127161617474973,
"grad_norm": 1.7211471796035767,
"learning_rate": 7.337286218362413e-05,
"loss": 0.9713785171508789,
"step": 405
},
{
"epoch": 0.42647250032505524,
"grad_norm": 1.839705467224121,
"learning_rate": 7.31861565586995e-05,
"loss": 0.9828580856323242,
"step": 410
},
{
"epoch": 0.4316733844753608,
"grad_norm": 1.6094111204147339,
"learning_rate": 7.299710181208943e-05,
"loss": 0.9652169227600098,
"step": 415
},
{
"epoch": 0.43687426862566636,
"grad_norm": 1.8238450288772583,
"learning_rate": 7.280571132625971e-05,
"loss": 0.9175550460815429,
"step": 420
},
{
"epoch": 0.4420751527759719,
"grad_norm": 1.7738935947418213,
"learning_rate": 7.261199864901423e-05,
"loss": 0.959293270111084,
"step": 425
},
{
"epoch": 0.4472760369262775,
"grad_norm": 1.7823359966278076,
"learning_rate": 7.241597749253593e-05,
"loss": 0.9460945129394531,
"step": 430
},
{
"epoch": 0.452476921076583,
"grad_norm": 1.852073073387146,
"learning_rate": 7.221766173241629e-05,
"loss": 0.9572076797485352,
"step": 435
},
{
"epoch": 0.45767780522688856,
"grad_norm": 1.7884498834609985,
"learning_rate": 7.201706540667293e-05,
"loss": 0.980253028869629,
"step": 440
},
{
"epoch": 0.4628786893771941,
"grad_norm": 1.6045715808868408,
"learning_rate": 7.181420271475616e-05,
"loss": 0.9448029518127441,
"step": 445
},
{
"epoch": 0.4680795735274997,
"grad_norm": 1.703908920288086,
"learning_rate": 7.160908801654358e-05,
"loss": 0.9464167594909668,
"step": 450
},
{
"epoch": 0.47328045767780524,
"grad_norm": 1.5748329162597656,
"learning_rate": 7.14017358313239e-05,
"loss": 0.9481819152832032,
"step": 455
},
{
"epoch": 0.47848134182811075,
"grad_norm": 1.62021803855896,
"learning_rate": 7.11921608367689e-05,
"loss": 0.9535123825073242,
"step": 460
},
{
"epoch": 0.4836822259784163,
"grad_norm": 1.6786726713180542,
"learning_rate": 7.09803778678946e-05,
"loss": 0.9362807273864746,
"step": 465
},
{
"epoch": 0.4888831101287219,
"grad_norm": 1.602408528327942,
"learning_rate": 7.076640191601113e-05,
"loss": 0.9352068901062012,
"step": 470
},
{
"epoch": 0.49408399427902744,
"grad_norm": 1.710305094718933,
"learning_rate": 7.055024812766153e-05,
"loss": 0.9479847908020019,
"step": 475
},
{
"epoch": 0.499284878429333,
"grad_norm": 1.7393652200698853,
"learning_rate": 7.03319318035496e-05,
"loss": 0.9210905075073242,
"step": 480
},
{
"epoch": 0.5044857625796385,
"grad_norm": 1.6267069578170776,
"learning_rate": 7.011146839745681e-05,
"loss": 0.935267448425293,
"step": 485
},
{
"epoch": 0.5096866467299441,
"grad_norm": 1.5649526119232178,
"learning_rate": 6.98888735151484e-05,
"loss": 0.950043773651123,
"step": 490
},
{
"epoch": 0.5148875308802496,
"grad_norm": 1.7210514545440674,
"learning_rate": 6.966416291326867e-05,
"loss": 0.9338683128356934,
"step": 495
},
{
"epoch": 0.5200884150305551,
"grad_norm": 1.7836523056030273,
"learning_rate": 6.943735249822567e-05,
"loss": 0.9206833839416504,
"step": 500
},
{
"epoch": 0.5200884150305551,
"eval_loss": 0.9551063776016235,
"eval_runtime": 130.2472,
"eval_samples_per_second": 1.965,
"eval_steps_per_second": 1.965,
"step": 500
},
{
"epoch": 0.5252892991808608,
"grad_norm": 1.6640737056732178,
"learning_rate": 6.920845832506523e-05,
"loss": 0.9343124389648437,
"step": 505
},
{
"epoch": 0.5304901833311663,
"grad_norm": 1.5780658721923828,
"learning_rate": 6.897749659633448e-05,
"loss": 0.9712604522705078,
"step": 510
},
{
"epoch": 0.5356910674814719,
"grad_norm": 1.6826986074447632,
"learning_rate": 6.874448366093497e-05,
"loss": 0.9570392608642578,
"step": 515
},
{
"epoch": 0.5408919516317774,
"grad_norm": 1.6517504453659058,
"learning_rate": 6.850943601296529e-05,
"loss": 0.9325905799865722,
"step": 520
},
{
"epoch": 0.546092835782083,
"grad_norm": 1.8107248544692993,
"learning_rate": 6.827237029055364e-05,
"loss": 0.9377958297729492,
"step": 525
},
{
"epoch": 0.5512937199323885,
"grad_norm": 1.6924495697021484,
"learning_rate": 6.803330327468006e-05,
"loss": 0.9227448463439941,
"step": 530
},
{
"epoch": 0.556494604082694,
"grad_norm": 1.6941320896148682,
"learning_rate": 6.779225188798846e-05,
"loss": 0.9221724510192871,
"step": 535
},
{
"epoch": 0.5616954882329996,
"grad_norm": 1.605466604232788,
"learning_rate": 6.754923319358883e-05,
"loss": 0.9474879264831543,
"step": 540
},
{
"epoch": 0.5668963723833051,
"grad_norm": 1.6994117498397827,
"learning_rate": 6.730426439384939e-05,
"loss": 0.9544130325317383,
"step": 545
},
{
"epoch": 0.5720972565336108,
"grad_norm": 1.6269444227218628,
"learning_rate": 6.705736282917892e-05,
"loss": 0.8944686889648438,
"step": 550
},
{
"epoch": 0.5772981406839163,
"grad_norm": 1.7221931219100952,
"learning_rate": 6.680854597679924e-05,
"loss": 0.9075075149536133,
"step": 555
},
{
"epoch": 0.5824990248342218,
"grad_norm": 1.7379156351089478,
"learning_rate": 6.655783144950809e-05,
"loss": 0.9554330825805664,
"step": 560
},
{
"epoch": 0.5876999089845274,
"grad_norm": 1.7438715696334839,
"learning_rate": 6.63052369944324e-05,
"loss": 0.9195778846740723,
"step": 565
},
{
"epoch": 0.5929007931348329,
"grad_norm": 1.6393606662750244,
"learning_rate": 6.605078049177205e-05,
"loss": 0.915708065032959,
"step": 570
},
{
"epoch": 0.5981016772851385,
"grad_norm": 1.7054882049560547,
"learning_rate": 6.579447995353416e-05,
"loss": 0.9384199142456054,
"step": 575
},
{
"epoch": 0.603302561435444,
"grad_norm": 1.5726091861724854,
"learning_rate": 6.553635352225812e-05,
"loss": 0.9182180404663086,
"step": 580
},
{
"epoch": 0.6085034455857495,
"grad_norm": 1.827543020248413,
"learning_rate": 6.52764194697313e-05,
"loss": 0.9172782897949219,
"step": 585
},
{
"epoch": 0.6137043297360552,
"grad_norm": 1.541303038597107,
"learning_rate": 6.501469619569579e-05,
"loss": 0.9366864204406739,
"step": 590
},
{
"epoch": 0.6189052138863607,
"grad_norm": 1.6896532773971558,
"learning_rate": 6.475120222654573e-05,
"loss": 0.91693115234375,
"step": 595
},
{
"epoch": 0.6241060980366663,
"grad_norm": 1.8263614177703857,
"learning_rate": 6.448595621401615e-05,
"loss": 0.9207332611083985,
"step": 600
},
{
"epoch": 0.6241060980366663,
"eval_loss": 0.9301373958587646,
"eval_runtime": 129.9867,
"eval_samples_per_second": 1.969,
"eval_steps_per_second": 1.969,
"step": 600
},
{
"epoch": 0.6293069821869718,
"grad_norm": 2.5737788677215576,
"learning_rate": 6.421897693386245e-05,
"loss": 1.8008251190185547,
"step": 605
},
{
"epoch": 0.6345078663372773,
"grad_norm": 2.3786563873291016,
"learning_rate": 6.395028328453154e-05,
"loss": 1.0148398399353027,
"step": 610
},
{
"epoch": 0.6397087504875829,
"grad_norm": 2.1619725227355957,
"learning_rate": 6.367989428582395e-05,
"loss": 0.9035258293151855,
"step": 615
},
{
"epoch": 0.6449096346378884,
"grad_norm": 1.8177882432937622,
"learning_rate": 6.340782907754754e-05,
"loss": 0.9431497573852539,
"step": 620
},
{
"epoch": 0.650110518788194,
"grad_norm": 2.0389435291290283,
"learning_rate": 6.313410691816269e-05,
"loss": 0.9617778778076171,
"step": 625
},
{
"epoch": 0.6553114029384995,
"grad_norm": 1.8454713821411133,
"learning_rate": 6.285874718341898e-05,
"loss": 0.9618912696838379,
"step": 630
},
{
"epoch": 0.660512287088805,
"grad_norm": 1.9317169189453125,
"learning_rate": 6.25817693649838e-05,
"loss": 1.020989227294922,
"step": 635
},
{
"epoch": 0.6657131712391107,
"grad_norm": 2.249952554702759,
"learning_rate": 6.230319306906246e-05,
"loss": 1.0368837356567382,
"step": 640
},
{
"epoch": 0.6709140553894162,
"grad_norm": 1.8525416851043701,
"learning_rate": 6.202303801501045e-05,
"loss": 0.9958114624023438,
"step": 645
},
{
"epoch": 0.6761149395397218,
"grad_norm": 1.99785578250885,
"learning_rate": 6.174132403393749e-05,
"loss": 1.0103933334350585,
"step": 650
},
{
"epoch": 0.6813158236900273,
"grad_norm": 2.1036858558654785,
"learning_rate": 6.145807106730384e-05,
"loss": 1.009110927581787,
"step": 655
},
{
"epoch": 0.6865167078403328,
"grad_norm": 1.8276114463806152,
"learning_rate": 6.11732991655087e-05,
"loss": 1.0265812873840332,
"step": 660
},
{
"epoch": 0.6917175919906384,
"grad_norm": 1.8524454832077026,
"learning_rate": 6.088702848647087e-05,
"loss": 1.0076023101806642,
"step": 665
},
{
"epoch": 0.6969184761409439,
"grad_norm": 2.044529914855957,
"learning_rate": 6.059927929420191e-05,
"loss": 1.0623496055603028,
"step": 670
},
{
"epoch": 0.7021193602912496,
"grad_norm": 1.9014661312103271,
"learning_rate": 6.031007195737173e-05,
"loss": 1.0505518913269043,
"step": 675
},
{
"epoch": 0.7073202444415551,
"grad_norm": 1.7579931020736694,
"learning_rate": 6.0019426947866685e-05,
"loss": 1.0260109901428223,
"step": 680
},
{
"epoch": 0.7125211285918606,
"grad_norm": 1.9789166450500488,
"learning_rate": 5.972736483934053e-05,
"loss": 1.0057721138000488,
"step": 685
},
{
"epoch": 0.7177220127421662,
"grad_norm": 1.7603486776351929,
"learning_rate": 5.943390630575808e-05,
"loss": 0.9560928344726562,
"step": 690
},
{
"epoch": 0.7229228968924717,
"grad_norm": 1.723509669303894,
"learning_rate": 5.9139072119931735e-05,
"loss": 1.0287532806396484,
"step": 695
},
{
"epoch": 0.7281237810427773,
"grad_norm": 1.880836844444275,
"learning_rate": 5.884288315205113e-05,
"loss": 1.0159936904907227,
"step": 700
},
{
"epoch": 0.7281237810427773,
"eval_loss": 1.0172600746154785,
"eval_runtime": 130.5328,
"eval_samples_per_second": 1.961,
"eval_steps_per_second": 1.961,
"step": 700
},
{
"epoch": 0.7333246651930828,
"grad_norm": 1.7332347631454468,
"learning_rate": 5.8545360368205704e-05,
"loss": 0.9914582252502442,
"step": 705
},
{
"epoch": 0.7385255493433883,
"grad_norm": 1.6425188779830933,
"learning_rate": 5.824652482890067e-05,
"loss": 0.9969341278076171,
"step": 710
},
{
"epoch": 0.7437264334936939,
"grad_norm": 1.868652105331421,
"learning_rate": 5.794639768756625e-05,
"loss": 0.9733437538146973,
"step": 715
},
{
"epoch": 0.7489273176439994,
"grad_norm": 1.7285988330841064,
"learning_rate": 5.764500018906019e-05,
"loss": 0.992225170135498,
"step": 720
},
{
"epoch": 0.7541282017943051,
"grad_norm": 1.7920562028884888,
"learning_rate": 5.734235366816398e-05,
"loss": 0.9502806663513184,
"step": 725
},
{
"epoch": 0.7593290859446106,
"grad_norm": 1.7255525588989258,
"learning_rate": 5.703847954807273e-05,
"loss": 0.9720046997070313,
"step": 730
},
{
"epoch": 0.7645299700949162,
"grad_norm": 1.8702120780944824,
"learning_rate": 5.673339933887854e-05,
"loss": 1.0045533180236816,
"step": 735
},
{
"epoch": 0.7697308542452217,
"grad_norm": 1.7282917499542236,
"learning_rate": 5.642713463604804e-05,
"loss": 0.998747444152832,
"step": 740
},
{
"epoch": 0.7749317383955272,
"grad_norm": 1.6850981712341309,
"learning_rate": 5.6119707118893566e-05,
"loss": 0.9491232872009278,
"step": 745
},
{
"epoch": 0.7801326225458328,
"grad_norm": 1.8323360681533813,
"learning_rate": 5.581113854903873e-05,
"loss": 0.9483734130859375,
"step": 750
},
{
"epoch": 0.7853335066961383,
"grad_norm": 1.7287927865982056,
"learning_rate": 5.5501450768877895e-05,
"loss": 0.9630053520202637,
"step": 755
},
{
"epoch": 0.790534390846444,
"grad_norm": 1.8735415935516357,
"learning_rate": 5.519066570003006e-05,
"loss": 0.9625276565551758,
"step": 760
},
{
"epoch": 0.7957352749967495,
"grad_norm": 1.7333344221115112,
"learning_rate": 5.4878805341787106e-05,
"loss": 0.956482982635498,
"step": 765
},
{
"epoch": 0.800936159147055,
"grad_norm": 1.7283087968826294,
"learning_rate": 5.456589176955656e-05,
"loss": 0.9767995834350586,
"step": 770
},
{
"epoch": 0.8061370432973606,
"grad_norm": 1.6415756940841675,
"learning_rate": 5.4251947133298954e-05,
"loss": 0.9446447372436524,
"step": 775
},
{
"epoch": 0.8113379274476661,
"grad_norm": 1.6519927978515625,
"learning_rate": 5.393699365595995e-05,
"loss": 0.9424878120422363,
"step": 780
},
{
"epoch": 0.8165388115979717,
"grad_norm": 1.647696852684021,
"learning_rate": 5.3621053631897175e-05,
"loss": 0.9464174270629883,
"step": 785
},
{
"epoch": 0.8217396957482772,
"grad_norm": 1.8417209386825562,
"learning_rate": 5.330414942530217e-05,
"loss": 0.9534976959228516,
"step": 790
},
{
"epoch": 0.8269405798985827,
"grad_norm": 1.8787815570831299,
"learning_rate": 5.298630346861732e-05,
"loss": 0.902367115020752,
"step": 795
},
{
"epoch": 0.8321414640488883,
"grad_norm": 1.68453848361969,
"learning_rate": 5.266753826094787e-05,
"loss": 0.9392575263977051,
"step": 800
},
{
"epoch": 0.8321414640488883,
"eval_loss": 0.9664498567581177,
"eval_runtime": 129.775,
"eval_samples_per_second": 1.973,
"eval_steps_per_second": 1.973,
"step": 800
},
{
"epoch": 0.8373423481991938,
"grad_norm": 1.501584529876709,
"learning_rate": 5.234787636646932e-05,
"loss": 0.9557664871215821,
"step": 805
},
{
"epoch": 0.8425432323494995,
"grad_norm": 1.5360844135284424,
"learning_rate": 5.202734041283029e-05,
"loss": 0.9075163841247559,
"step": 810
},
{
"epoch": 0.847744116499805,
"grad_norm": 1.65811288356781,
"learning_rate": 5.1705953089550675e-05,
"loss": 0.9179675102233886,
"step": 815
},
{
"epoch": 0.8529450006501105,
"grad_norm": 1.61856210231781,
"learning_rate": 5.138373714641558e-05,
"loss": 0.9237114906311035,
"step": 820
},
{
"epoch": 0.8581458848004161,
"grad_norm": 1.7458878755569458,
"learning_rate": 5.1060715391864965e-05,
"loss": 0.8636340141296387,
"step": 825
},
{
"epoch": 0.8633467689507216,
"grad_norm": 1.6920363903045654,
"learning_rate": 5.073691069137912e-05,
"loss": 0.9312037467956543,
"step": 830
},
{
"epoch": 0.8685476531010272,
"grad_norm": 1.714153528213501,
"learning_rate": 5.041234596586009e-05,
"loss": 0.9352224349975586,
"step": 835
},
{
"epoch": 0.8737485372513327,
"grad_norm": 1.6470508575439453,
"learning_rate": 5.0087044190009206e-05,
"loss": 0.8943827629089356,
"step": 840
},
{
"epoch": 0.8789494214016382,
"grad_norm": 1.622175693511963,
"learning_rate": 4.9761028390700754e-05,
"loss": 0.9128511428833008,
"step": 845
},
{
"epoch": 0.8841503055519438,
"grad_norm": 1.6196850538253784,
"learning_rate": 4.9434321645352084e-05,
"loss": 0.9311873435974121,
"step": 850
},
{
"epoch": 0.8893511897022494,
"grad_norm": 1.7249358892440796,
"learning_rate": 4.9106947080289925e-05,
"loss": 0.9176848411560059,
"step": 855
},
{
"epoch": 0.894552073852555,
"grad_norm": 1.6511820554733276,
"learning_rate": 4.8778927869113445e-05,
"loss": 0.9112163543701172,
"step": 860
},
{
"epoch": 0.8997529580028605,
"grad_norm": 1.5577549934387207,
"learning_rate": 4.845028723105389e-05,
"loss": 0.8965622901916503,
"step": 865
},
{
"epoch": 0.904953842153166,
"grad_norm": 1.6360331773757935,
"learning_rate": 4.812104842933087e-05,
"loss": 0.913609504699707,
"step": 870
},
{
"epoch": 0.9101547263034716,
"grad_norm": 1.451485276222229,
"learning_rate": 4.779123476950581e-05,
"loss": 0.8944340705871582,
"step": 875
},
{
"epoch": 0.9153556104537771,
"grad_norm": 1.5654209852218628,
"learning_rate": 4.746086959783209e-05,
"loss": 0.8596482276916504,
"step": 880
},
{
"epoch": 0.9205564946040827,
"grad_norm": 1.5695706605911255,
"learning_rate": 4.712997629960253e-05,
"loss": 0.8860456466674804,
"step": 885
},
{
"epoch": 0.9257573787543882,
"grad_norm": 1.7602401971817017,
"learning_rate": 4.679857829749404e-05,
"loss": 0.8744911193847656,
"step": 890
},
{
"epoch": 0.9309582629046937,
"grad_norm": 1.6938329935073853,
"learning_rate": 4.6466699049909584e-05,
"loss": 0.9156827926635742,
"step": 895
},
{
"epoch": 0.9361591470549994,
"grad_norm": 1.4965558052062988,
"learning_rate": 4.6134362049317625e-05,
"loss": 0.9088706016540528,
"step": 900
},
{
"epoch": 0.9361591470549994,
"eval_loss": 0.9005925059318542,
"eval_runtime": 129.9874,
"eval_samples_per_second": 1.969,
"eval_steps_per_second": 1.969,
"step": 900
},
{
"epoch": 0.9413600312053049,
"grad_norm": 1.5755003690719604,
"learning_rate": 4.58015908205893e-05,
"loss": 0.8684419631958008,
"step": 905
},
{
"epoch": 0.9465609153556105,
"grad_norm": 1.5753810405731201,
"learning_rate": 4.5468408919333025e-05,
"loss": 0.8938017845153808,
"step": 910
},
{
"epoch": 0.951761799505916,
"grad_norm": 1.5218995809555054,
"learning_rate": 4.513483993022719e-05,
"loss": 0.851717185974121,
"step": 915
},
{
"epoch": 0.9569626836562215,
"grad_norm": 1.6325594186782837,
"learning_rate": 4.4800907465350664e-05,
"loss": 0.8885617256164551,
"step": 920
},
{
"epoch": 0.9621635678065271,
"grad_norm": 1.4952536821365356,
"learning_rate": 4.446663516251138e-05,
"loss": 0.8511702537536621,
"step": 925
},
{
"epoch": 0.9673644519568326,
"grad_norm": 1.5268827676773071,
"learning_rate": 4.413204668357312e-05,
"loss": 0.8577158927917481,
"step": 930
},
{
"epoch": 0.9725653361071382,
"grad_norm": 1.4323556423187256,
"learning_rate": 4.379716571278054e-05,
"loss": 0.8342367172241211,
"step": 935
},
{
"epoch": 0.9777662202574438,
"grad_norm": 1.5065745115280151,
"learning_rate": 4.3462015955082665e-05,
"loss": 0.894658374786377,
"step": 940
},
{
"epoch": 0.9829671044077494,
"grad_norm": 1.4767268896102905,
"learning_rate": 4.3126621134455e-05,
"loss": 0.8451394081115723,
"step": 945
},
{
"epoch": 0.9881679885580549,
"grad_norm": 1.5763777494430542,
"learning_rate": 4.279100499222004e-05,
"loss": 0.8588390350341797,
"step": 950
},
{
"epoch": 0.9933688727083604,
"grad_norm": 1.5762237310409546,
"learning_rate": 4.2455191285366845e-05,
"loss": 0.8754203796386719,
"step": 955
},
{
"epoch": 0.998569756858666,
"grad_norm": 1.5145306587219238,
"learning_rate": 4.2119203784869304e-05,
"loss": 0.8561000823974609,
"step": 960
},
{
"epoch": 1.0031205304901833,
"grad_norm": 1.470058798789978,
"learning_rate": 4.178306627400347e-05,
"loss": 0.7531153202056885,
"step": 965
},
{
"epoch": 1.0083214146404889,
"grad_norm": 1.6469708681106567,
"learning_rate": 4.144680254666413e-05,
"loss": 0.7166049003601074,
"step": 970
},
{
"epoch": 1.0135222987907944,
"grad_norm": 1.5783348083496094,
"learning_rate": 4.1110436405680376e-05,
"loss": 0.6519159317016602,
"step": 975
},
{
"epoch": 1.0187231829411,
"grad_norm": 1.494524598121643,
"learning_rate": 4.0773991661130806e-05,
"loss": 0.6752121925354004,
"step": 980
},
{
"epoch": 1.0239240670914056,
"grad_norm": 1.523681640625,
"learning_rate": 4.043749212865811e-05,
"loss": 0.6791035175323487,
"step": 985
},
{
"epoch": 1.029124951241711,
"grad_norm": 1.4255659580230713,
"learning_rate": 4.010096162778309e-05,
"loss": 0.7047647476196289,
"step": 990
},
{
"epoch": 1.0343258353920166,
"grad_norm": 1.512510061264038,
"learning_rate": 3.97644239802188e-05,
"loss": 0.6946704387664795,
"step": 995
},
{
"epoch": 1.0395267195423221,
"grad_norm": 1.4743566513061523,
"learning_rate": 3.942790300818415e-05,
"loss": 0.676310396194458,
"step": 1000
},
{
"epoch": 1.0395267195423221,
"eval_loss": 0.8658661246299744,
"eval_runtime": 130.1356,
"eval_samples_per_second": 1.967,
"eval_steps_per_second": 1.967,
"step": 1000
},
{
"epoch": 1.0447276036926278,
"grad_norm": 1.5579502582550049,
"learning_rate": 3.90914225327176e-05,
"loss": 0.6901298522949219,
"step": 1005
},
{
"epoch": 1.0499284878429334,
"grad_norm": 1.5494235754013062,
"learning_rate": 3.875500637199108e-05,
"loss": 0.6718050003051758,
"step": 1010
},
{
"epoch": 1.0551293719932389,
"grad_norm": 1.5289891958236694,
"learning_rate": 3.8418678339623876e-05,
"loss": 0.6892761707305908,
"step": 1015
},
{
"epoch": 1.0603302561435444,
"grad_norm": 1.4304561614990234,
"learning_rate": 3.8082462242997025e-05,
"loss": 0.6954478263854981,
"step": 1020
},
{
"epoch": 1.0655311402938499,
"grad_norm": 1.4161802530288696,
"learning_rate": 3.774638188156808e-05,
"loss": 0.6717328548431396,
"step": 1025
},
{
"epoch": 1.0707320244441556,
"grad_norm": 1.438629150390625,
"learning_rate": 3.741046104518636e-05,
"loss": 0.6766324043273926,
"step": 1030
},
{
"epoch": 1.0759329085944611,
"grad_norm": 1.5406919717788696,
"learning_rate": 3.707472351240907e-05,
"loss": 0.7088249206542969,
"step": 1035
},
{
"epoch": 1.0811337927447666,
"grad_norm": 1.3865864276885986,
"learning_rate": 3.6739193048818e-05,
"loss": 0.6776373386383057,
"step": 1040
},
{
"epoch": 1.0863346768950721,
"grad_norm": 1.5101228952407837,
"learning_rate": 3.640389340533736e-05,
"loss": 0.660363245010376,
"step": 1045
},
{
"epoch": 1.0915355610453776,
"grad_norm": 1.4708372354507446,
"learning_rate": 3.6068848316552415e-05,
"loss": 0.6472445487976074,
"step": 1050
},
{
"epoch": 1.0967364451956834,
"grad_norm": 1.5044161081314087,
"learning_rate": 3.573408149902955e-05,
"loss": 0.7127279758453369,
"step": 1055
},
{
"epoch": 1.1019373293459889,
"grad_norm": 1.4291512966156006,
"learning_rate": 3.53996166496373e-05,
"loss": 0.6595888614654541,
"step": 1060
},
{
"epoch": 1.1071382134962944,
"grad_norm": 1.5285484790802002,
"learning_rate": 3.506547744386911e-05,
"loss": 0.6698886394500733,
"step": 1065
},
{
"epoch": 1.1123390976465999,
"grad_norm": 1.3300918340682983,
"learning_rate": 3.473168753416728e-05,
"loss": 0.6541372776031494,
"step": 1070
},
{
"epoch": 1.1175399817969054,
"grad_norm": 1.329465389251709,
"learning_rate": 3.439827054824881e-05,
"loss": 0.6664098739624024,
"step": 1075
},
{
"epoch": 1.1227408659472111,
"grad_norm": 1.3707212209701538,
"learning_rate": 3.406525008743285e-05,
"loss": 0.6693881034851075,
"step": 1080
},
{
"epoch": 1.1279417500975166,
"grad_norm": 1.474888563156128,
"learning_rate": 3.373264972497002e-05,
"loss": 0.6865148067474365,
"step": 1085
},
{
"epoch": 1.1331426342478221,
"grad_norm": 1.370944857597351,
"learning_rate": 3.3400493004373815e-05,
"loss": 0.6525755405426026,
"step": 1090
},
{
"epoch": 1.1383435183981276,
"grad_norm": 1.5666426420211792,
"learning_rate": 3.306880343775396e-05,
"loss": 0.6941968917846679,
"step": 1095
},
{
"epoch": 1.1435444025484331,
"grad_norm": 1.3775230646133423,
"learning_rate": 3.273760450415218e-05,
"loss": 0.6021693706512451,
"step": 1100
},
{
"epoch": 1.1435444025484331,
"eval_loss": 0.8314206600189209,
"eval_runtime": 130.5631,
"eval_samples_per_second": 1.961,
"eval_steps_per_second": 1.961,
"step": 1100
},
{
"epoch": 1.1487452866987389,
"grad_norm": 1.4845924377441406,
"learning_rate": 3.240691964788012e-05,
"loss": 0.6344992160797119,
"step": 1105
},
{
"epoch": 1.1539461708490444,
"grad_norm": 1.515212059020996,
"learning_rate": 3.207677227685989e-05,
"loss": 0.6564799785614014,
"step": 1110
},
{
"epoch": 1.15914705499935,
"grad_norm": 1.382857084274292,
"learning_rate": 3.1747185760966985e-05,
"loss": 0.6568068981170654,
"step": 1115
},
{
"epoch": 1.1643479391496554,
"grad_norm": 1.4786866903305054,
"learning_rate": 3.141818343037621e-05,
"loss": 0.6519091129302979,
"step": 1120
},
{
"epoch": 1.169548823299961,
"grad_norm": 1.5029971599578857,
"learning_rate": 3.108978857391002e-05,
"loss": 0.6406647682189941,
"step": 1125
},
{
"epoch": 1.1747497074502666,
"grad_norm": 1.4615740776062012,
"learning_rate": 3.076202443739014e-05,
"loss": 0.6860923290252685,
"step": 1130
},
{
"epoch": 1.1799505916005721,
"grad_norm": 1.4388511180877686,
"learning_rate": 3.0434914221992032e-05,
"loss": 0.6385154724121094,
"step": 1135
},
{
"epoch": 1.1851514757508776,
"grad_norm": 1.4187670946121216,
"learning_rate": 3.0108481082602517e-05,
"loss": 0.6268198013305664,
"step": 1140
},
{
"epoch": 1.1903523599011832,
"grad_norm": 1.5264593362808228,
"learning_rate": 2.9782748126180885e-05,
"loss": 0.6531328678131103,
"step": 1145
},
{
"epoch": 1.1955532440514887,
"grad_norm": 1.4612548351287842,
"learning_rate": 2.945773841012303e-05,
"loss": 0.669494915008545,
"step": 1150
},
{
"epoch": 1.2007541282017944,
"grad_norm": 1.267225742340088,
"learning_rate": 2.913347494062949e-05,
"loss": 0.6084520816802979,
"step": 1155
},
{
"epoch": 1.2059550123521,
"grad_norm": 1.449588418006897,
"learning_rate": 2.8809980671076803e-05,
"loss": 0.6461035728454589,
"step": 1160
},
{
"epoch": 1.2111558965024054,
"grad_norm": 1.3878182172775269,
"learning_rate": 2.848727850039281e-05,
"loss": 0.6444483280181885,
"step": 1165
},
{
"epoch": 1.216356780652711,
"grad_norm": 1.510225772857666,
"learning_rate": 2.8165391271435667e-05,
"loss": 0.6362089157104492,
"step": 1170
},
{
"epoch": 1.2215576648030164,
"grad_norm": 1.3843779563903809,
"learning_rate": 2.7844341769376888e-05,
"loss": 0.6338253974914551,
"step": 1175
},
{
"epoch": 1.2267585489533221,
"grad_norm": 1.414486289024353,
"learning_rate": 2.752415272008853e-05,
"loss": 0.6381827354431152,
"step": 1180
},
{
"epoch": 1.2319594331036277,
"grad_norm": 1.3414344787597656,
"learning_rate": 2.720484678853445e-05,
"loss": 0.6552750587463378,
"step": 1185
},
{
"epoch": 1.2371603172539332,
"grad_norm": 1.470218539237976,
"learning_rate": 2.6886446577165987e-05,
"loss": 0.6548665523529053,
"step": 1190
},
{
"epoch": 1.2423612014042387,
"grad_norm": 1.4118874073028564,
"learning_rate": 2.656897462432193e-05,
"loss": 0.6231658935546875,
"step": 1195
},
{
"epoch": 1.2475620855545442,
"grad_norm": 1.407113790512085,
"learning_rate": 2.6252453402633284e-05,
"loss": 0.5831446647644043,
"step": 1200
},
{
"epoch": 1.2475620855545442,
"eval_loss": 0.7889392971992493,
"eval_runtime": 130.1098,
"eval_samples_per_second": 1.968,
"eval_steps_per_second": 1.968,
"step": 1200
},
{
"epoch": 1.25276296970485,
"grad_norm": 1.5195738077163696,
"learning_rate": 2.593690531743231e-05,
"loss": 0.6311056613922119,
"step": 1205
},
{
"epoch": 1.2579638538551554,
"grad_norm": 1.4188272953033447,
"learning_rate": 2.5622352705166725e-05,
"loss": 0.6084880352020263,
"step": 1210
},
{
"epoch": 1.263164738005461,
"grad_norm": 1.3883174657821655,
"learning_rate": 2.5308817831818447e-05,
"loss": 0.6124576568603516,
"step": 1215
},
{
"epoch": 1.2683656221557664,
"grad_norm": 1.4531702995300293,
"learning_rate": 2.4996322891327576e-05,
"loss": 0.6091352462768554,
"step": 1220
},
{
"epoch": 1.273566506306072,
"grad_norm": 1.4332900047302246,
"learning_rate": 2.46848900040213e-05,
"loss": 0.6466999053955078,
"step": 1225
},
{
"epoch": 1.2787673904563777,
"grad_norm": 1.4958285093307495,
"learning_rate": 2.437454121504809e-05,
"loss": 0.616027545928955,
"step": 1230
},
{
"epoch": 1.2839682746066832,
"grad_norm": 1.4578135013580322,
"learning_rate": 2.406529849281726e-05,
"loss": 0.6332333087921143,
"step": 1235
},
{
"epoch": 1.2891691587569887,
"grad_norm": 1.4748591184616089,
"learning_rate": 2.375718372744384e-05,
"loss": 0.6314262866973877,
"step": 1240
},
{
"epoch": 1.2943700429072942,
"grad_norm": 1.4996991157531738,
"learning_rate": 2.3450218729199108e-05,
"loss": 0.6231923580169678,
"step": 1245
},
{
"epoch": 1.2995709270575997,
"grad_norm": 1.4916212558746338,
"learning_rate": 2.314442522696669e-05,
"loss": 0.6058928966522217,
"step": 1250
},
{
"epoch": 1.3047718112079054,
"grad_norm": 1.3732458353042603,
"learning_rate": 2.283982486670449e-05,
"loss": 0.5989131450653076,
"step": 1255
},
{
"epoch": 1.309972695358211,
"grad_norm": 1.3525115251541138,
"learning_rate": 2.2536439209912393e-05,
"loss": 0.6314842700958252,
"step": 1260
},
{
"epoch": 1.3151735795085164,
"grad_norm": 1.4011585712432861,
"learning_rate": 2.2234289732106102e-05,
"loss": 0.6161143779754639,
"step": 1265
},
{
"epoch": 1.320374463658822,
"grad_norm": 1.2732415199279785,
"learning_rate": 2.193339782129685e-05,
"loss": 0.5840548515319824,
"step": 1270
},
{
"epoch": 1.3255753478091274,
"grad_norm": 1.5150249004364014,
"learning_rate": 2.1633784776477585e-05,
"loss": 0.625645112991333,
"step": 1275
},
{
"epoch": 1.3307762319594332,
"grad_norm": 1.4052765369415283,
"learning_rate": 2.1335471806115117e-05,
"loss": 0.599894666671753,
"step": 1280
},
{
"epoch": 1.3359771161097387,
"grad_norm": 1.4317781925201416,
"learning_rate": 2.1038480026648945e-05,
"loss": 0.584019947052002,
"step": 1285
},
{
"epoch": 1.3411780002600442,
"grad_norm": 1.4249917268753052,
"learning_rate": 2.074283046099654e-05,
"loss": 0.6218175411224365,
"step": 1290
},
{
"epoch": 1.3463788844103497,
"grad_norm": 1.450347661972046,
"learning_rate": 2.044854403706509e-05,
"loss": 0.6018783569335937,
"step": 1295
},
{
"epoch": 1.3515797685606552,
"grad_norm": 1.3482204675674438,
"learning_rate": 2.0155641586270286e-05,
"loss": 0.5710643291473388,
"step": 1300
},
{
"epoch": 1.3515797685606552,
"eval_loss": 0.7516965270042419,
"eval_runtime": 129.9408,
"eval_samples_per_second": 1.97,
"eval_steps_per_second": 1.97,
"step": 1300
},
{
"epoch": 1.356780652710961,
"grad_norm": 1.4780831336975098,
"learning_rate": 1.9864143842061504e-05,
"loss": 0.6006845951080322,
"step": 1305
},
{
"epoch": 1.3619815368612664,
"grad_norm": 1.6098695993423462,
"learning_rate": 1.9574071438454388e-05,
"loss": 0.5974199295043945,
"step": 1310
},
{
"epoch": 1.367182421011572,
"grad_norm": 1.4274905920028687,
"learning_rate": 1.9285444908570064e-05,
"loss": 0.5996578216552735,
"step": 1315
},
{
"epoch": 1.3723833051618775,
"grad_norm": 1.4278326034545898,
"learning_rate": 1.8998284683181824e-05,
"loss": 0.6217168807983399,
"step": 1320
},
{
"epoch": 1.377584189312183,
"grad_norm": 1.3714914321899414,
"learning_rate": 1.871261108926882e-05,
"loss": 0.6057654857635498,
"step": 1325
},
{
"epoch": 1.3827850734624887,
"grad_norm": 1.468660831451416,
"learning_rate": 1.842844434857724e-05,
"loss": 0.6053857803344727,
"step": 1330
},
{
"epoch": 1.3879859576127942,
"grad_norm": 1.3222684860229492,
"learning_rate": 1.814580457618885e-05,
"loss": 0.5948523044586181,
"step": 1335
},
{
"epoch": 1.3931868417630997,
"grad_norm": 1.3946906328201294,
"learning_rate": 1.7864711779097122e-05,
"loss": 0.5642759323120117,
"step": 1340
},
{
"epoch": 1.3983877259134052,
"grad_norm": 1.404165506362915,
"learning_rate": 1.7585185854791076e-05,
"loss": 0.5775787353515625,
"step": 1345
},
{
"epoch": 1.4035886100637107,
"grad_norm": 1.370401382446289,
"learning_rate": 1.7307246589846767e-05,
"loss": 0.5661319732666016,
"step": 1350
},
{
"epoch": 1.4087894942140164,
"grad_norm": 1.3934425115585327,
"learning_rate": 1.7030913658526675e-05,
"loss": 0.5760215282440185,
"step": 1355
},
{
"epoch": 1.413990378364322,
"grad_norm": 1.389297366142273,
"learning_rate": 1.6756206621387e-05,
"loss": 0.5774462699890137,
"step": 1360
},
{
"epoch": 1.4191912625146275,
"grad_norm": 1.511326789855957,
"learning_rate": 1.6483144923893135e-05,
"loss": 0.585289192199707,
"step": 1365
},
{
"epoch": 1.424392146664933,
"grad_norm": 1.4418237209320068,
"learning_rate": 1.62117478950431e-05,
"loss": 0.5913166999816895,
"step": 1370
},
{
"epoch": 1.4295930308152385,
"grad_norm": 1.46451997756958,
"learning_rate": 1.5942034745999383e-05,
"loss": 0.5850035667419433,
"step": 1375
},
{
"epoch": 1.4347939149655442,
"grad_norm": 1.308406114578247,
"learning_rate": 1.5674024568729036e-05,
"loss": 0.5444441795349121,
"step": 1380
},
{
"epoch": 1.4399947991158497,
"grad_norm": 1.340357780456543,
"learning_rate": 1.5407736334652214e-05,
"loss": 0.5663641929626465,
"step": 1385
},
{
"epoch": 1.4451956832661552,
"grad_norm": 1.3704862594604492,
"learning_rate": 1.5143188893299266e-05,
"loss": 0.579612398147583,
"step": 1390
},
{
"epoch": 1.4503965674164607,
"grad_norm": 1.418916940689087,
"learning_rate": 1.4880400970976428e-05,
"loss": 0.5483696460723877,
"step": 1395
},
{
"epoch": 1.4555974515667662,
"grad_norm": 1.4289562702178955,
"learning_rate": 1.461939116944032e-05,
"loss": 0.5578598976135254,
"step": 1400
},
{
"epoch": 1.4555974515667662,
"eval_loss": 0.7209516763687134,
"eval_runtime": 129.7511,
"eval_samples_per_second": 1.973,
"eval_steps_per_second": 1.973,
"step": 1400
},
{
"epoch": 1.460798335717072,
"grad_norm": 1.397242546081543,
"learning_rate": 1.4360177964581156e-05,
"loss": 0.5415009498596192,
"step": 1405
},
{
"epoch": 1.4659992198673775,
"grad_norm": 1.3476572036743164,
"learning_rate": 1.4102779705114907e-05,
"loss": 0.5409503936767578,
"step": 1410
},
{
"epoch": 1.471200104017683,
"grad_norm": 1.4320838451385498,
"learning_rate": 1.3847214611284439e-05,
"loss": 0.5809547424316406,
"step": 1415
},
{
"epoch": 1.4764009881679885,
"grad_norm": 1.4180504083633423,
"learning_rate": 1.3593500773569854e-05,
"loss": 0.5446939945220948,
"step": 1420
},
{
"epoch": 1.481601872318294,
"grad_norm": 1.4159796237945557,
"learning_rate": 1.334165615140783e-05,
"loss": 0.5414989471435547,
"step": 1425
},
{
"epoch": 1.4868027564685997,
"grad_norm": 1.3080824613571167,
"learning_rate": 1.3091698571920422e-05,
"loss": 0.5712019443511963,
"step": 1430
},
{
"epoch": 1.4920036406189052,
"grad_norm": 1.2765617370605469,
"learning_rate": 1.284364572865311e-05,
"loss": 0.5223927974700928,
"step": 1435
},
{
"epoch": 1.4972045247692107,
"grad_norm": 1.459304928779602,
"learning_rate": 1.2597515180322368e-05,
"loss": 0.5872461318969726,
"step": 1440
},
{
"epoch": 1.5024054089195165,
"grad_norm": 1.3618521690368652,
"learning_rate": 1.23533243495727e-05,
"loss": 0.5361846446990967,
"step": 1445
},
{
"epoch": 1.5076062930698217,
"grad_norm": 1.3767704963684082,
"learning_rate": 1.2111090521743374e-05,
"loss": 0.5445142269134522,
"step": 1450
},
{
"epoch": 1.5128071772201275,
"grad_norm": 1.2690768241882324,
"learning_rate": 1.1870830843644917e-05,
"loss": 0.5451547622680664,
"step": 1455
},
{
"epoch": 1.518008061370433,
"grad_norm": 1.356768012046814,
"learning_rate": 1.1632562322345292e-05,
"loss": 0.5559448719024658,
"step": 1460
},
{
"epoch": 1.5232089455207385,
"grad_norm": 1.4047377109527588,
"learning_rate": 1.1396301823966054e-05,
"loss": 0.5453744888305664,
"step": 1465
},
{
"epoch": 1.5284098296710442,
"grad_norm": 1.4262696504592896,
"learning_rate": 1.1162066072488434e-05,
"loss": 0.5406304359436035,
"step": 1470
},
{
"epoch": 1.5336107138213495,
"grad_norm": 1.4099568128585815,
"learning_rate": 1.0929871648569591e-05,
"loss": 0.5617681980133057,
"step": 1475
},
{
"epoch": 1.5388115979716552,
"grad_norm": 1.317654013633728,
"learning_rate": 1.0699734988368817e-05,
"loss": 0.5236352443695068,
"step": 1480
},
{
"epoch": 1.5440124821219607,
"grad_norm": 1.3843480348587036,
"learning_rate": 1.0471672382384185e-05,
"loss": 0.5739215850830078,
"step": 1485
},
{
"epoch": 1.5492133662722662,
"grad_norm": 1.4144139289855957,
"learning_rate": 1.0245699974299356e-05,
"loss": 0.5243452548980713,
"step": 1490
},
{
"epoch": 1.554414250422572,
"grad_norm": 1.4148069620132446,
"learning_rate": 1.002183375984085e-05,
"loss": 0.5655048847198486,
"step": 1495
},
{
"epoch": 1.5596151345728773,
"grad_norm": 1.4749091863632202,
"learning_rate": 9.800089585645733e-06,
"loss": 0.5409163951873779,
"step": 1500
},
{
"epoch": 1.5596151345728773,
"eval_loss": 0.6939327120780945,
"eval_runtime": 129.7422,
"eval_samples_per_second": 1.973,
"eval_steps_per_second": 1.973,
"step": 1500
},
{
"epoch": 1.564816018723183,
"grad_norm": 1.397222876548767,
"learning_rate": 9.58048314813992e-06,
"loss": 0.5466369152069092,
"step": 1505
},
{
"epoch": 1.5700169028734885,
"grad_norm": 1.4299346208572388,
"learning_rate": 9.363029992427112e-06,
"loss": 0.5456615447998047,
"step": 1510
},
{
"epoch": 1.575217787023794,
"grad_norm": 1.4388434886932373,
"learning_rate": 9.147745511188363e-06,
"loss": 0.5131537914276123,
"step": 1515
},
{
"epoch": 1.5804186711740997,
"grad_norm": 1.3658560514450073,
"learning_rate": 8.934644943592551e-06,
"loss": 0.5328524112701416,
"step": 1520
},
{
"epoch": 1.585619555324405,
"grad_norm": 1.4248464107513428,
"learning_rate": 8.723743374217566e-06,
"loss": 0.5406161785125733,
"step": 1525
},
{
"epoch": 1.5908204394747107,
"grad_norm": 1.2822633981704712,
"learning_rate": 8.51505573198264e-06,
"loss": 0.5242678642272949,
"step": 1530
},
{
"epoch": 1.5960213236250163,
"grad_norm": 1.3976045846939087,
"learning_rate": 8.308596789091492e-06,
"loss": 0.5548820495605469,
"step": 1535
},
{
"epoch": 1.6012222077753218,
"grad_norm": 1.3557575941085815,
"learning_rate": 8.104381159986717e-06,
"loss": 0.5298625946044921,
"step": 1540
},
{
"epoch": 1.6064230919256275,
"grad_norm": 1.343584656715393,
"learning_rate": 7.902423300315271e-06,
"loss": 0.5180022239685058,
"step": 1545
},
{
"epoch": 1.6116239760759328,
"grad_norm": 1.4940485954284668,
"learning_rate": 7.70273750590521e-06,
"loss": 0.5428160667419434,
"step": 1550
},
{
"epoch": 1.6168248602262385,
"grad_norm": 1.3675767183303833,
"learning_rate": 7.5053379117537136e-06,
"loss": 0.516777229309082,
"step": 1555
},
{
"epoch": 1.622025744376544,
"grad_norm": 1.4647380113601685,
"learning_rate": 7.310238491026567e-06,
"loss": 0.5383810043334961,
"step": 1560
},
{
"epoch": 1.6272266285268495,
"grad_norm": 1.482635736465454,
"learning_rate": 7.117453054069039e-06,
"loss": 0.5144073009490967,
"step": 1565
},
{
"epoch": 1.6324275126771552,
"grad_norm": 1.5026439428329468,
"learning_rate": 6.926995247428285e-06,
"loss": 0.5365920066833496,
"step": 1570
},
{
"epoch": 1.6376283968274605,
"grad_norm": 1.4037001132965088,
"learning_rate": 6.7388785528874e-06,
"loss": 0.539414644241333,
"step": 1575
},
{
"epoch": 1.6428292809777663,
"grad_norm": 1.3790786266326904,
"learning_rate": 6.553116286511012e-06,
"loss": 0.5314173221588134,
"step": 1580
},
{
"epoch": 1.6480301651280718,
"grad_norm": 1.3834137916564941,
"learning_rate": 6.369721597702802e-06,
"loss": 0.5361592292785644,
"step": 1585
},
{
"epoch": 1.6532310492783773,
"grad_norm": 1.3719836473464966,
"learning_rate": 6.188707468274597e-06,
"loss": 0.5356816291809082,
"step": 1590
},
{
"epoch": 1.658431933428683,
"grad_norm": 1.5612096786499023,
"learning_rate": 6.010086711527519e-06,
"loss": 0.522746467590332,
"step": 1595
},
{
"epoch": 1.6636328175789883,
"grad_norm": 1.3957282304763794,
"learning_rate": 5.833871971344947e-06,
"loss": 0.5154781341552734,
"step": 1600
},
{
"epoch": 1.6636328175789883,
"eval_loss": 0.6775081157684326,
"eval_runtime": 129.5251,
"eval_samples_per_second": 1.976,
"eval_steps_per_second": 1.976,
"step": 1600
},
{
"epoch": 1.668833701729294,
"grad_norm": 1.3207283020019531,
"learning_rate": 5.6600757212975065e-06,
"loss": 0.5063146591186524,
"step": 1605
},
{
"epoch": 1.6740345858795995,
"grad_norm": 1.4711432456970215,
"learning_rate": 5.4887102637600995e-06,
"loss": 0.5405515193939209,
"step": 1610
},
{
"epoch": 1.679235470029905,
"grad_norm": 1.4866151809692383,
"learning_rate": 5.319787729041084e-06,
"loss": 0.5130389213562012,
"step": 1615
},
{
"epoch": 1.6844363541802108,
"grad_norm": 1.3158960342407227,
"learning_rate": 5.153320074523618e-06,
"loss": 0.5351908206939697,
"step": 1620
},
{
"epoch": 1.689637238330516,
"grad_norm": 1.3680565357208252,
"learning_rate": 4.9893190838192415e-06,
"loss": 0.4998152256011963,
"step": 1625
},
{
"epoch": 1.6948381224808218,
"grad_norm": 1.4631091356277466,
"learning_rate": 4.827796365933752e-06,
"loss": 0.5004712104797363,
"step": 1630
},
{
"epoch": 1.7000390066311273,
"grad_norm": 1.3971714973449707,
"learning_rate": 4.668763354445425e-06,
"loss": 0.5030968666076661,
"step": 1635
},
{
"epoch": 1.7052398907814328,
"grad_norm": 1.2639859914779663,
"learning_rate": 4.5122313066957355e-06,
"loss": 0.5040280818939209,
"step": 1640
},
{
"epoch": 1.7104407749317385,
"grad_norm": 1.3765854835510254,
"learning_rate": 4.358211302992414e-06,
"loss": 0.503818941116333,
"step": 1645
},
{
"epoch": 1.7156416590820438,
"grad_norm": 1.3985488414764404,
"learning_rate": 4.206714245825207e-06,
"loss": 0.5131355285644531,
"step": 1650
},
{
"epoch": 1.7208425432323495,
"grad_norm": 1.3251243829727173,
"learning_rate": 4.057750859094029e-06,
"loss": 0.5185832500457763,
"step": 1655
},
{
"epoch": 1.726043427382655,
"grad_norm": 1.3081040382385254,
"learning_rate": 3.911331687349957e-06,
"loss": 0.5041447639465332,
"step": 1660
},
{
"epoch": 1.7312443115329605,
"grad_norm": 1.2962945699691772,
"learning_rate": 3.7674670950487337e-06,
"loss": 0.49753355979919434,
"step": 1665
},
{
"epoch": 1.7364451956832663,
"grad_norm": 1.4440361261367798,
"learning_rate": 3.626167265817162e-06,
"loss": 0.5241962432861328,
"step": 1670
},
{
"epoch": 1.7416460798335716,
"grad_norm": 1.3910887241363525,
"learning_rate": 3.487442201732245e-06,
"loss": 0.5163005352020263,
"step": 1675
},
{
"epoch": 1.7468469639838773,
"grad_norm": 1.4579485654830933,
"learning_rate": 3.3513017226131537e-06,
"loss": 0.5024435520172119,
"step": 1680
},
{
"epoch": 1.7520478481341828,
"grad_norm": 1.3572936058044434,
"learning_rate": 3.217755465326127e-06,
"loss": 0.5091588020324707,
"step": 1685
},
{
"epoch": 1.7572487322844883,
"grad_norm": 1.3362730741500854,
"learning_rate": 3.0868128831023123e-06,
"loss": 0.4787764549255371,
"step": 1690
},
{
"epoch": 1.762449616434794,
"grad_norm": 1.5451667308807373,
"learning_rate": 2.9584832448686216e-06,
"loss": 0.5192002773284912,
"step": 1695
},
{
"epoch": 1.7676505005850993,
"grad_norm": 1.3013676404953003,
"learning_rate": 2.832775634591589e-06,
"loss": 0.4944888114929199,
"step": 1700
},
{
"epoch": 1.7676505005850993,
"eval_loss": 0.6653155088424683,
"eval_runtime": 129.5395,
"eval_samples_per_second": 1.976,
"eval_steps_per_second": 1.976,
"step": 1700
},
{
"epoch": 1.772851384735405,
"grad_norm": 1.4618582725524902,
"learning_rate": 2.709698950634412e-06,
"loss": 0.5045624732971191,
"step": 1705
},
{
"epoch": 1.7780522688857106,
"grad_norm": 1.4680557250976562,
"learning_rate": 2.5892619051269873e-06,
"loss": 0.5313224792480469,
"step": 1710
},
{
"epoch": 1.783253153036016,
"grad_norm": 1.441771149635315,
"learning_rate": 2.471473023349269e-06,
"loss": 0.5317369937896729,
"step": 1715
},
{
"epoch": 1.7884540371863218,
"grad_norm": 1.377977728843689,
"learning_rate": 2.356340643127797e-06,
"loss": 0.49757208824157717,
"step": 1720
},
{
"epoch": 1.793654921336627,
"grad_norm": 1.376712679862976,
"learning_rate": 2.243872914245442e-06,
"loss": 0.5022801399230957,
"step": 1725
},
{
"epoch": 1.7988558054869328,
"grad_norm": 1.5128220319747925,
"learning_rate": 2.1340777978646045e-06,
"loss": 0.5198845863342285,
"step": 1730
},
{
"epoch": 1.8040566896372383,
"grad_norm": 1.3930203914642334,
"learning_rate": 2.026963065963572e-06,
"loss": 0.502904748916626,
"step": 1735
},
{
"epoch": 1.8092575737875438,
"grad_norm": 1.3942198753356934,
"learning_rate": 1.9225363007864483e-06,
"loss": 0.48986196517944336,
"step": 1740
},
{
"epoch": 1.8144584579378495,
"grad_norm": 1.238763689994812,
"learning_rate": 1.8208048943063872e-06,
"loss": 0.48829169273376466,
"step": 1745
},
{
"epoch": 1.8196593420881548,
"grad_norm": 1.3654608726501465,
"learning_rate": 1.7217760477023659e-06,
"loss": 0.5089236259460449,
"step": 1750
},
{
"epoch": 1.8248602262384606,
"grad_norm": 1.3893874883651733,
"learning_rate": 1.6254567708494517e-06,
"loss": 0.5198930740356446,
"step": 1755
},
{
"epoch": 1.830061110388766,
"grad_norm": 1.4330559968948364,
"learning_rate": 1.531853881822567e-06,
"loss": 0.5197700500488281,
"step": 1760
},
{
"epoch": 1.8352619945390716,
"grad_norm": 1.4249515533447266,
"learning_rate": 1.4409740064138844e-06,
"loss": 0.502013874053955,
"step": 1765
},
{
"epoch": 1.8404628786893773,
"grad_norm": 1.3588781356811523,
"learning_rate": 1.3528235776638111e-06,
"loss": 0.48603029251098634,
"step": 1770
},
{
"epoch": 1.8456637628396826,
"grad_norm": 1.3336181640625,
"learning_rate": 1.2674088354056148e-06,
"loss": 0.5047059059143066,
"step": 1775
},
{
"epoch": 1.8508646469899883,
"grad_norm": 1.3933433294296265,
"learning_rate": 1.1847358258237329e-06,
"loss": 0.5210882663726807,
"step": 1780
},
{
"epoch": 1.8560655311402938,
"grad_norm": 1.4772483110427856,
"learning_rate": 1.104810401025791e-06,
"loss": 0.512470006942749,
"step": 1785
},
{
"epoch": 1.8612664152905993,
"grad_norm": 1.2868046760559082,
"learning_rate": 1.0276382186283285e-06,
"loss": 0.4919888973236084,
"step": 1790
},
{
"epoch": 1.866467299440905,
"grad_norm": 1.4422026872634888,
"learning_rate": 9.532247413563555e-07,
"loss": 0.5298680782318115,
"step": 1795
},
{
"epoch": 1.8716681835912103,
"grad_norm": 1.4196135997772217,
"learning_rate": 8.815752366566399e-07,
"loss": 0.5006773948669434,
"step": 1800
},
{
"epoch": 1.8716681835912103,
"eval_loss": 0.6575887203216553,
"eval_runtime": 130.8561,
"eval_samples_per_second": 1.956,
"eval_steps_per_second": 1.956,
"step": 1800
}
],
"logging_steps": 5,
"max_steps": 1924,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 4.897885910540295e+18,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}