{ "best_global_step": 550, "best_metric": 0.14384840428829193, "best_model_checkpoint": "FLICC-Qwen3.5-9B/checkpoint-550", "epoch": 3.0, "eval_steps": 25, "global_step": 606, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.024783147459727387, "grad_norm": 1.2578336000442505, "learning_rate": 8e-05, "loss": 2.1545221328735353, "step": 5 }, { "epoch": 0.04956629491945477, "grad_norm": 0.38908010721206665, "learning_rate": 0.00018, "loss": 1.7079069137573242, "step": 10 }, { "epoch": 0.07434944237918216, "grad_norm": 0.7322022914886475, "learning_rate": 0.0001999777729859618, "loss": 1.16412296295166, "step": 15 }, { "epoch": 0.09913258983890955, "grad_norm": 0.47556403279304504, "learning_rate": 0.0001998874926755492, "loss": 0.521942138671875, "step": 20 }, { "epoch": 0.12391573729863693, "grad_norm": 0.25855234265327454, "learning_rate": 0.00019972783253900808, "loss": 0.22866697311401368, "step": 25 }, { "epoch": 0.12391573729863693, "eval_loss": 0.20142747461795807, "eval_runtime": 31.7965, "eval_samples_per_second": 5.567, "eval_steps_per_second": 1.415, "step": 25 }, { "epoch": 0.14869888475836432, "grad_norm": 0.11888384819030762, "learning_rate": 0.00019949890347303046, "loss": 0.20155599117279052, "step": 30 }, { "epoch": 0.1734820322180917, "grad_norm": 0.10729903727769852, "learning_rate": 0.0001992008644871016, "loss": 0.18807698488235475, "step": 35 }, { "epoch": 0.1982651796778191, "grad_norm": 0.09704501926898956, "learning_rate": 0.0001988339225930552, "loss": 0.20087261199951173, "step": 40 }, { "epoch": 0.22304832713754646, "grad_norm": 0.0895816907286644, "learning_rate": 0.00019839833266128724, "loss": 0.17901148796081542, "step": 45 }, { "epoch": 0.24783147459727387, "grad_norm": 0.0991889014840126, "learning_rate": 0.00019789439724372806, "loss": 0.18655662536621093, "step": 50 }, { "epoch": 0.24783147459727387, "eval_loss": 0.16927684843540192, "eval_runtime": 20.0824, "eval_samples_per_second": 8.814, "eval_steps_per_second": 2.241, "step": 50 }, { "epoch": 0.27261462205700127, "grad_norm": 0.08669876307249069, "learning_rate": 0.00019732246636369605, "loss": 0.15882112979888915, "step": 55 }, { "epoch": 0.29739776951672864, "grad_norm": 0.08936048299074173, "learning_rate": 0.00019668293727277846, "loss": 0.17748851776123048, "step": 60 }, { "epoch": 0.322180916976456, "grad_norm": 0.08769766986370087, "learning_rate": 0.0001959762541749086, "loss": 0.15775216817855836, "step": 65 }, { "epoch": 0.3469640644361834, "grad_norm": 0.08859147131443024, "learning_rate": 0.0001952029079178307, "loss": 0.1502579927444458, "step": 70 }, { "epoch": 0.37174721189591076, "grad_norm": 0.08570419251918793, "learning_rate": 0.00019436343565216711, "loss": 0.1632941722869873, "step": 75 }, { "epoch": 0.37174721189591076, "eval_loss": 0.16099171340465546, "eval_runtime": 20.0803, "eval_samples_per_second": 8.815, "eval_steps_per_second": 2.241, "step": 75 }, { "epoch": 0.3965303593556382, "grad_norm": 0.08874429017305374, "learning_rate": 0.00019345842045832428, "loss": 0.16088367700576783, "step": 80 }, { "epoch": 0.42131350681536556, "grad_norm": 0.08653293550014496, "learning_rate": 0.000192488490941497, "loss": 0.17103042602539062, "step": 85 }, { "epoch": 0.44609665427509293, "grad_norm": 0.08580342680215836, "learning_rate": 0.00019145432079505206, "loss": 0.16303534507751466, "step": 90 }, { "epoch": 0.4708798017348203, "grad_norm": 0.0754188671708107, "learning_rate": 0.00019035662833259432, "loss": 0.15218052864074708, "step": 95 }, { "epoch": 0.49566294919454773, "grad_norm": 0.08795224130153656, "learning_rate": 0.0001891961759890408, "loss": 0.1582047462463379, "step": 100 }, { "epoch": 0.49566294919454773, "eval_loss": 0.15668612718582153, "eval_runtime": 20.0959, "eval_samples_per_second": 8.808, "eval_steps_per_second": 2.239, "step": 100 }, { "epoch": 0.5204460966542751, "grad_norm": 0.09747637063264847, "learning_rate": 0.00018797376979104872, "loss": 0.16718448400497438, "step": 105 }, { "epoch": 0.5452292441140025, "grad_norm": 0.08587726950645447, "learning_rate": 0.00018669025879716595, "loss": 0.1570422887802124, "step": 110 }, { "epoch": 0.5700123915737298, "grad_norm": 0.09190164506435394, "learning_rate": 0.00018534653450809197, "loss": 0.16039479970932008, "step": 115 }, { "epoch": 0.5947955390334573, "grad_norm": 0.07859804481267929, "learning_rate": 0.00018394353024745965, "loss": 0.15238577127456665, "step": 120 }, { "epoch": 0.6195786864931846, "grad_norm": 0.08068633079528809, "learning_rate": 0.00018248222051356754, "loss": 0.1629793167114258, "step": 125 }, { "epoch": 0.6195786864931846, "eval_loss": 0.15419375896453857, "eval_runtime": 20.0972, "eval_samples_per_second": 8.807, "eval_steps_per_second": 2.239, "step": 125 }, { "epoch": 0.644361833952912, "grad_norm": 0.08668871223926544, "learning_rate": 0.00018096362030251313, "loss": 0.15735886096954346, "step": 130 }, { "epoch": 0.6691449814126395, "grad_norm": 0.08392980694770813, "learning_rate": 0.0001793887844031972, "loss": 0.14937043190002441, "step": 135 }, { "epoch": 0.6939281288723668, "grad_norm": 0.08616995811462402, "learning_rate": 0.0001777588066646889, "loss": 0.14931262731552125, "step": 140 }, { "epoch": 0.7187112763320942, "grad_norm": 0.07857120037078857, "learning_rate": 0.00017607481923646016, "loss": 0.16323717832565307, "step": 145 }, { "epoch": 0.7434944237918215, "grad_norm": 0.08874683827161789, "learning_rate": 0.00017433799178201786, "loss": 0.16156336069107055, "step": 150 }, { "epoch": 0.7434944237918215, "eval_loss": 0.15226973593235016, "eval_runtime": 20.0835, "eval_samples_per_second": 8.813, "eval_steps_per_second": 2.241, "step": 150 }, { "epoch": 0.7682775712515489, "grad_norm": 0.08852466195821762, "learning_rate": 0.00017254953066647913, "loss": 0.15643792152404784, "step": 155 }, { "epoch": 0.7930607187112764, "grad_norm": 0.08484289050102234, "learning_rate": 0.00017071067811865476, "loss": 0.15839605331420897, "step": 160 }, { "epoch": 0.8178438661710037, "grad_norm": 0.08800984919071198, "learning_rate": 0.00016882271136822206, "loss": 0.1647958755493164, "step": 165 }, { "epoch": 0.8426270136307311, "grad_norm": 0.08345294743776321, "learning_rate": 0.0001668869417585873, "loss": 0.1509941339492798, "step": 170 }, { "epoch": 0.8674101610904585, "grad_norm": 0.07677271962165833, "learning_rate": 0.00016490471383605288, "loss": 0.1612541437149048, "step": 175 }, { "epoch": 0.8674101610904585, "eval_loss": 0.15066702663898468, "eval_runtime": 20.0686, "eval_samples_per_second": 8.82, "eval_steps_per_second": 2.242, "step": 175 }, { "epoch": 0.8921933085501859, "grad_norm": 0.08086061477661133, "learning_rate": 0.000162877404415923, "loss": 0.1522205352783203, "step": 180 }, { "epoch": 0.9169764560099133, "grad_norm": 0.082602858543396, "learning_rate": 0.00016080642162619565, "loss": 0.15029544830322267, "step": 185 }, { "epoch": 0.9417596034696406, "grad_norm": 0.07821306586265564, "learning_rate": 0.00015869320392950526, "loss": 0.14748865365982056, "step": 190 }, { "epoch": 0.966542750929368, "grad_norm": 0.08585070073604584, "learning_rate": 0.00015653921912399589, "loss": 0.14947665929794313, "step": 195 }, { "epoch": 0.9913258983890955, "grad_norm": 0.08411425352096558, "learning_rate": 0.00015434596332381852, "loss": 0.15700777769088745, "step": 200 }, { "epoch": 0.9913258983890955, "eval_loss": 0.1492398977279663, "eval_runtime": 20.0816, "eval_samples_per_second": 8.814, "eval_steps_per_second": 2.241, "step": 200 }, { "epoch": 1.0148698884758365, "grad_norm": 0.07653596252202988, "learning_rate": 0.00015211495991996027, "loss": 0.16517894268035888, "step": 205 }, { "epoch": 1.0396530359355638, "grad_norm": 0.07493323087692261, "learning_rate": 0.00014984775852212807, "loss": 0.14664943218231202, "step": 210 }, { "epoch": 1.0644361833952911, "grad_norm": 0.07914339751005173, "learning_rate": 0.00014754593388242117, "loss": 0.14977338314056396, "step": 215 }, { "epoch": 1.0892193308550187, "grad_norm": 0.09382504969835281, "learning_rate": 0.00014521108480154032, "loss": 0.14892799854278566, "step": 220 }, { "epoch": 1.114002478314746, "grad_norm": 0.08522579073905945, "learning_rate": 0.0001428448330182931, "loss": 0.13943066596984863, "step": 225 }, { "epoch": 1.114002478314746, "eval_loss": 0.1489669382572174, "eval_runtime": 20.0756, "eval_samples_per_second": 8.817, "eval_steps_per_second": 2.242, "step": 225 }, { "epoch": 1.1387856257744733, "grad_norm": 0.10055539757013321, "learning_rate": 0.00014044882208316713, "loss": 0.15772825479507446, "step": 230 }, { "epoch": 1.1635687732342008, "grad_norm": 0.08639902621507645, "learning_rate": 0.00013802471621675338, "loss": 0.13583142757415773, "step": 235 }, { "epoch": 1.1883519206939281, "grad_norm": 0.0846349224448204, "learning_rate": 0.000135574199153812, "loss": 0.13156899213790893, "step": 240 }, { "epoch": 1.2131350681536555, "grad_norm": 0.08887381851673126, "learning_rate": 0.00013309897297378455, "loss": 0.14310439825057983, "step": 245 }, { "epoch": 1.2379182156133828, "grad_norm": 0.08967562019824982, "learning_rate": 0.00013060075691856407, "loss": 0.15425143241882325, "step": 250 }, { "epoch": 1.2379182156133828, "eval_loss": 0.14815586805343628, "eval_runtime": 20.0845, "eval_samples_per_second": 8.813, "eval_steps_per_second": 2.241, "step": 250 }, { "epoch": 1.2627013630731103, "grad_norm": 0.08670926094055176, "learning_rate": 0.00012808128619834461, "loss": 0.14042346477508544, "step": 255 }, { "epoch": 1.2874845105328376, "grad_norm": 0.08620833605527878, "learning_rate": 0.00012554231078637927, "loss": 0.13709003925323487, "step": 260 }, { "epoch": 1.3122676579925652, "grad_norm": 0.09469753503799438, "learning_rate": 0.00012298559420348437, "loss": 0.14326269626617433, "step": 265 }, { "epoch": 1.3370508054522925, "grad_norm": 0.08458584547042847, "learning_rate": 0.00012041291229313372, "loss": 0.14271541833877563, "step": 270 }, { "epoch": 1.3618339529120198, "grad_norm": 0.0880797877907753, "learning_rate": 0.0001178260519879937, "loss": 0.14334834814071656, "step": 275 }, { "epoch": 1.3618339529120198, "eval_loss": 0.14733587205410004, "eval_runtime": 20.0759, "eval_samples_per_second": 8.817, "eval_steps_per_second": 2.241, "step": 275 }, { "epoch": 1.3866171003717471, "grad_norm": 0.09421440213918686, "learning_rate": 0.00011522681006875613, "loss": 0.15932092666625977, "step": 280 }, { "epoch": 1.4114002478314747, "grad_norm": 0.08234652131795883, "learning_rate": 0.00011261699191613066, "loss": 0.14943004846572877, "step": 285 }, { "epoch": 1.436183395291202, "grad_norm": 0.08222948759794235, "learning_rate": 0.0001099984102568643, "loss": 0.12942731380462646, "step": 290 }, { "epoch": 1.4609665427509293, "grad_norm": 0.09792573750019073, "learning_rate": 0.00010737288390465792, "loss": 0.14982467889785767, "step": 295 }, { "epoch": 1.4857496902106568, "grad_norm": 0.09035824984312057, "learning_rate": 0.00010474223649685517, "loss": 0.1518421769142151, "step": 300 }, { "epoch": 1.4857496902106568, "eval_loss": 0.14639338850975037, "eval_runtime": 20.0833, "eval_samples_per_second": 8.813, "eval_steps_per_second": 2.241, "step": 300 }, { "epoch": 1.5105328376703842, "grad_norm": 0.0854591578245163, "learning_rate": 0.00010210829522778111, "loss": 0.1377027750015259, "step": 305 }, { "epoch": 1.5353159851301115, "grad_norm": 0.10446186363697052, "learning_rate": 9.947288957961e-05, "loss": 0.14845360517501832, "step": 310 }, { "epoch": 1.5600991325898388, "grad_norm": 0.09128095954656601, "learning_rate": 9.683785005164411e-05, "loss": 0.14711700677871703, "step": 315 }, { "epoch": 1.5848822800495663, "grad_norm": 0.09243518859148026, "learning_rate": 9.420500688888609e-05, "loss": 0.13097442388534547, "step": 320 }, { "epoch": 1.6096654275092936, "grad_norm": 0.0917942151427269, "learning_rate": 9.157618881078772e-05, "loss": 0.14905989170074463, "step": 325 }, { "epoch": 1.6096654275092936, "eval_loss": 0.14630599319934845, "eval_runtime": 20.0838, "eval_samples_per_second": 8.813, "eval_steps_per_second": 2.241, "step": 325 }, { "epoch": 1.6344485749690212, "grad_norm": 0.09442687779664993, "learning_rate": 8.895322174105881e-05, "loss": 0.13518500328063965, "step": 330 }, { "epoch": 1.6592317224287485, "grad_norm": 0.09125228226184845, "learning_rate": 8.633792753941733e-05, "loss": 0.14012304544448853, "step": 335 }, { "epoch": 1.6840148698884758, "grad_norm": 0.0936419740319252, "learning_rate": 8.373212273616282e-05, "loss": 0.14055389165878296, "step": 340 }, { "epoch": 1.7087980173482031, "grad_norm": 0.08522295951843262, "learning_rate": 8.113761727045105e-05, "loss": 0.14256774187088012, "step": 345 }, { "epoch": 1.7335811648079305, "grad_norm": 0.09176695346832275, "learning_rate": 7.855621323314736e-05, "loss": 0.13572851419448853, "step": 350 }, { "epoch": 1.7335811648079305, "eval_loss": 0.1453624814748764, "eval_runtime": 20.065, "eval_samples_per_second": 8.821, "eval_steps_per_second": 2.243, "step": 350 }, { "epoch": 1.758364312267658, "grad_norm": 0.09987305104732513, "learning_rate": 7.598970361513051e-05, "loss": 0.14147673845291137, "step": 355 }, { "epoch": 1.7831474597273855, "grad_norm": 0.09593646973371506, "learning_rate": 7.343987106191785e-05, "loss": 0.14583654403686525, "step": 360 }, { "epoch": 1.8079306071871128, "grad_norm": 0.08658026158809662, "learning_rate": 7.090848663547574e-05, "loss": 0.1391659379005432, "step": 365 }, { "epoch": 1.8327137546468402, "grad_norm": 0.08900578320026398, "learning_rate": 6.839730858407603e-05, "loss": 0.1330711841583252, "step": 370 }, { "epoch": 1.8574969021065675, "grad_norm": 0.0947270616889, "learning_rate": 6.590808112105232e-05, "loss": 0.14469583034515382, "step": 375 }, { "epoch": 1.8574969021065675, "eval_loss": 0.1443570852279663, "eval_runtime": 20.0669, "eval_samples_per_second": 8.82, "eval_steps_per_second": 2.242, "step": 375 }, { "epoch": 1.8822800495662948, "grad_norm": 0.0893881618976593, "learning_rate": 6.344253321330476e-05, "loss": 0.13211302757263182, "step": 380 }, { "epoch": 1.9070631970260223, "grad_norm": 0.09638750553131104, "learning_rate": 6.100237738039484e-05, "loss": 0.14780888557434083, "step": 385 }, { "epoch": 1.9318463444857497, "grad_norm": 0.09466356039047241, "learning_rate": 5.858930850506388e-05, "loss": 0.1425341010093689, "step": 390 }, { "epoch": 1.9566294919454772, "grad_norm": 0.09821353852748871, "learning_rate": 5.620500265600206e-05, "loss": 0.14998058080673218, "step": 395 }, { "epoch": 1.9814126394052045, "grad_norm": 0.09322469681501389, "learning_rate": 5.385111592368486e-05, "loss": 0.14387768507003784, "step": 400 }, { "epoch": 1.9814126394052045, "eval_loss": 0.1438552290201187, "eval_runtime": 20.1578, "eval_samples_per_second": 8.781, "eval_steps_per_second": 2.232, "step": 400 }, { "epoch": 2.0049566294919456, "grad_norm": 0.09768665581941605, "learning_rate": 5.152928327008635e-05, "loss": 0.15004920959472656, "step": 405 }, { "epoch": 2.029739776951673, "grad_norm": 0.09443743526935577, "learning_rate": 4.924111739306788e-05, "loss": 0.13336663246154784, "step": 410 }, { "epoch": 2.0545229244114003, "grad_norm": 0.09068778902292252, "learning_rate": 4.698820760623064e-05, "loss": 0.13002735376358032, "step": 415 }, { "epoch": 2.0793060718711276, "grad_norm": 0.09333285689353943, "learning_rate": 4.477211873501085e-05, "loss": 0.12572606801986694, "step": 420 }, { "epoch": 2.104089219330855, "grad_norm": 0.09789580851793289, "learning_rate": 4.2594390029783534e-05, "loss": 0.13599283695220948, "step": 425 }, { "epoch": 2.104089219330855, "eval_loss": 0.14471149444580078, "eval_runtime": 20.1059, "eval_samples_per_second": 8.803, "eval_steps_per_second": 2.238, "step": 425 }, { "epoch": 2.1288723667905822, "grad_norm": 0.1010223925113678, "learning_rate": 4.045653409673078e-05, "loss": 0.12323858737945556, "step": 430 }, { "epoch": 2.15365551425031, "grad_norm": 0.10947588086128235, "learning_rate": 3.836003584721577e-05, "loss": 0.13344532251358032, "step": 435 }, { "epoch": 2.1784386617100373, "grad_norm": 0.10182736814022064, "learning_rate": 3.630635146639384e-05, "loss": 0.12730480432510377, "step": 440 }, { "epoch": 2.2032218091697646, "grad_norm": 0.10020897537469864, "learning_rate": 3.429690740177549e-05, "loss": 0.11858847141265869, "step": 445 }, { "epoch": 2.228004956629492, "grad_norm": 0.10753881931304932, "learning_rate": 3.233309937244513e-05, "loss": 0.11974374055862427, "step": 450 }, { "epoch": 2.228004956629492, "eval_loss": 0.14466847479343414, "eval_runtime": 20.1014, "eval_samples_per_second": 8.805, "eval_steps_per_second": 2.239, "step": 450 }, { "epoch": 2.2527881040892193, "grad_norm": 0.09645484387874603, "learning_rate": 3.041629139962283e-05, "loss": 0.12982945442199706, "step": 455 }, { "epoch": 2.2775712515489466, "grad_norm": 0.10199300944805145, "learning_rate": 2.8547814859242727e-05, "loss": 0.13981986045837402, "step": 460 }, { "epoch": 2.3023543990086743, "grad_norm": 0.10710015147924423, "learning_rate": 2.672896755720654e-05, "loss": 0.14547840356826783, "step": 465 }, { "epoch": 2.3271375464684017, "grad_norm": 0.09909404069185257, "learning_rate": 2.496101282795369e-05, "loss": 0.12706974744796753, "step": 470 }, { "epoch": 2.351920693928129, "grad_norm": 0.10963651537895203, "learning_rate": 2.324517865697501e-05, "loss": 0.14960445165634156, "step": 475 }, { "epoch": 2.351920693928129, "eval_loss": 0.14430110156536102, "eval_runtime": 20.1279, "eval_samples_per_second": 8.794, "eval_steps_per_second": 2.236, "step": 475 }, { "epoch": 2.3767038413878563, "grad_norm": 0.10664132982492447, "learning_rate": 2.1582656827878844e-05, "loss": 0.12047649621963501, "step": 480 }, { "epoch": 2.4014869888475836, "grad_norm": 0.10346455127000809, "learning_rate": 1.99746020946023e-05, "loss": 0.12301702499389648, "step": 485 }, { "epoch": 2.426270136307311, "grad_norm": 0.10490775853395462, "learning_rate": 1.8422131379342668e-05, "loss": 0.13336237668991088, "step": 490 }, { "epoch": 2.4510532837670382, "grad_norm": 0.11114446818828583, "learning_rate": 1.6926322996765897e-05, "loss": 0.1356014370918274, "step": 495 }, { "epoch": 2.4758364312267656, "grad_norm": 0.10340475291013718, "learning_rate": 1.5488215905031034e-05, "loss": 0.12613558769226074, "step": 500 }, { "epoch": 2.4758364312267656, "eval_loss": 0.14409051835536957, "eval_runtime": 20.1071, "eval_samples_per_second": 8.803, "eval_steps_per_second": 2.238, "step": 500 }, { "epoch": 2.5006195786864933, "grad_norm": 0.10658421367406845, "learning_rate": 1.4108808984151023e-05, "loss": 0.14121589660644532, "step": 505 }, { "epoch": 2.5254027261462206, "grad_norm": 0.11168505251407623, "learning_rate": 1.278906034219094e-05, "loss": 0.12991907596588134, "step": 510 }, { "epoch": 2.550185873605948, "grad_norm": 0.11109943687915802, "learning_rate": 1.152988664978556e-05, "loss": 0.14196932315826416, "step": 515 }, { "epoch": 2.5749690210656753, "grad_norm": 0.11461146175861359, "learning_rate": 1.0332162503438381e-05, "loss": 0.1336436986923218, "step": 520 }, { "epoch": 2.5997521685254026, "grad_norm": 0.1116466075181961, "learning_rate": 9.196719818044886e-06, "loss": 0.13213711977005005, "step": 525 }, { "epoch": 2.5997521685254026, "eval_loss": 0.14412295818328857, "eval_runtime": 20.1059, "eval_samples_per_second": 8.803, "eval_steps_per_second": 2.238, "step": 525 }, { "epoch": 2.6245353159851303, "grad_norm": 0.10819047689437866, "learning_rate": 8.124347249061115e-06, "loss": 0.1222877025604248, "step": 530 }, { "epoch": 2.6493184634448577, "grad_norm": 0.109853096306324, "learning_rate": 7.115789644719728e-06, "loss": 0.12941099405288697, "step": 535 }, { "epoch": 2.674101610904585, "grad_norm": 0.11083053052425385, "learning_rate": 6.1717475286734e-06, "loss": 0.11817164421081543, "step": 540 }, { "epoch": 2.6988847583643123, "grad_norm": 0.11062867194414139, "learning_rate": 5.2928766134254345e-06, "loss": 0.1254756212234497, "step": 545 }, { "epoch": 2.7236679058240396, "grad_norm": 0.11206871271133423, "learning_rate": 4.479787344885078e-06, "loss": 0.12366704940795899, "step": 550 }, { "epoch": 2.7236679058240396, "eval_loss": 0.14384840428829193, "eval_runtime": 20.1395, "eval_samples_per_second": 8.789, "eval_steps_per_second": 2.234, "step": 550 }, { "epoch": 2.748451053283767, "grad_norm": 0.11186806112527847, "learning_rate": 3.7330444783642338e-06, "loss": 0.13718799352645875, "step": 555 }, { "epoch": 2.7732342007434942, "grad_norm": 0.10549531131982803, "learning_rate": 3.053166686309783e-06, "loss": 0.13304147720336915, "step": 560 }, { "epoch": 2.7980173482032216, "grad_norm": 0.10434003919363022, "learning_rate": 2.440626198044327e-06, "loss": 0.11780736446380616, "step": 565 }, { "epoch": 2.8228004956629493, "grad_norm": 0.10914986580610275, "learning_rate": 1.895848471765227e-06, "loss": 0.12229269742965698, "step": 570 }, { "epoch": 2.8475836431226766, "grad_norm": 0.11424117535352707, "learning_rate": 1.4192118990299707e-06, "loss": 0.12974271774291993, "step": 575 }, { "epoch": 2.8475836431226766, "eval_loss": 0.1438693404197693, "eval_runtime": 20.2164, "eval_samples_per_second": 8.755, "eval_steps_per_second": 2.226, "step": 575 }, { "epoch": 2.872366790582404, "grad_norm": 0.10830768942832947, "learning_rate": 1.0110475419330967e-06, "loss": 0.12486574649810792, "step": 580 }, { "epoch": 2.8971499380421313, "grad_norm": 0.11147851496934891, "learning_rate": 6.716389031571568e-07, "loss": 0.12139828205108642, "step": 585 }, { "epoch": 2.9219330855018586, "grad_norm": 0.09997480362653732, "learning_rate": 4.0122172905753266e-07, "loss": 0.11921333074569702, "step": 590 }, { "epoch": 2.9467162329615864, "grad_norm": 0.10038603842258453, "learning_rate": 1.9998384591773944e-07, "loss": 0.12386640310287475, "step": 595 }, { "epoch": 2.9714993804213137, "grad_norm": 0.10965593159198761, "learning_rate": 6.806502948918381e-08, "loss": 0.11748340129852294, "step": 600 }, { "epoch": 2.9714993804213137, "eval_loss": 0.14387772977352142, "eval_runtime": 20.189, "eval_samples_per_second": 8.767, "eval_steps_per_second": 2.229, "step": 600 }, { "epoch": 2.996282527881041, "grad_norm": 0.10880747437477112, "learning_rate": 5.5569079056794206e-09, "loss": 0.13690497875213622, "step": 605 }, { "epoch": 3.0, "eval_loss": 0.14386552572250366, "eval_runtime": 20.1823, "eval_samples_per_second": 8.77, "eval_steps_per_second": 2.23, "step": 606 } ], "logging_steps": 5, "max_steps": 606, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 50, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 4.13889241360176e+17, "train_batch_size": 1, "trial_name": null, "trial_params": null }