{ "base": "unsloth/gpt-oss-20b-unsloth-bnb-4bit", "epochs": 2.0, "lr": 0.0002, "rank": 16, "n_train": 1201, "n_val": 48, "train_seconds": 5385, "train_loss": 0.05007273310314346, "eval": { "eval_loss": 0.035037748515605927, "eval_runtime": 110.0544, "eval_samples_per_second": 0.436, "eval_steps_per_second": 0.218, "epoch": 2.0 }, "log_history": [ { "loss": 0.23318450450897216, "grad_norm": 1.5675679445266724, "learning_rate": 5e-05, "epoch": 0.033277870216306155, "step": 5 }, { "loss": 0.09800589680671692, "grad_norm": 1.0014837980270386, "learning_rate": 0.00011250000000000001, "epoch": 0.06655574043261231, "step": 10 }, { "loss": 0.06956685185432435, "grad_norm": 0.5591109395027161, "learning_rate": 0.000175, "epoch": 0.09983361064891846, "step": 15 }, { "loss": 0.06257834434509277, "grad_norm": 0.43907880783081055, "learning_rate": 0.00019994570736865406, "epoch": 0.13311148086522462, "step": 20 }, { "loss": 0.05633952021598816, "grad_norm": 0.6507183313369751, "learning_rate": 0.00019961413253717213, "epoch": 0.16638935108153077, "step": 25 }, { "loss": 0.05565650463104248, "grad_norm": 0.46881163120269775, "learning_rate": 0.0001989821441880933, "epoch": 0.19966722129783693, "step": 30 }, { "loss": 0.06170967221260071, "grad_norm": 0.3107876181602478, "learning_rate": 0.0001980516482542224, "epoch": 0.23294509151414308, "step": 35 }, { "loss": 0.06616556644439697, "grad_norm": 0.3977068066596985, "learning_rate": 0.00019682545089919784, "epoch": 0.26622296173044924, "step": 40 }, { "loss": 0.05503295063972473, "grad_norm": 0.3961268961429596, "learning_rate": 0.00019530725005474195, "epoch": 0.2995008319467554, "step": 45 }, { "loss": 0.04668510556221008, "grad_norm": 0.5407523512840271, "learning_rate": 0.0001935016242685415, "epoch": 0.33277870216306155, "step": 50 }, { "loss": 0.06434003710746765, "grad_norm": 0.3896896541118622, "learning_rate": 0.0001914140188963917, "epoch": 0.36605657237936773, "step": 55 }, { "loss": 0.05060199499130249, "grad_norm": 0.47498011589050293, "learning_rate": 0.00018905072968024425, "epoch": 0.39933444259567386, "step": 60 }, { "loss": 0.05920557975769043, "grad_norm": 0.5028626918792725, "learning_rate": 0.00018641888376168484, "epoch": 0.43261231281198004, "step": 65 }, { "loss": 0.05897412300109863, "grad_norm": 0.27249830961227417, "learning_rate": 0.00018352641818809848, "epoch": 0.46589018302828616, "step": 70 }, { "loss": 0.060563582181930545, "grad_norm": 0.2820088267326355, "learning_rate": 0.00018038205597634393, "epoch": 0.49916805324459235, "step": 75 }, { "eval_loss": 0.04855774715542793, "eval_runtime": 109.1031, "eval_samples_per_second": 0.44, "eval_steps_per_second": 0.22, "epoch": 0.49916805324459235, "step": 75 }, { "loss": 0.053474980592727664, "grad_norm": 0.26608899235725403, "learning_rate": 0.00017699527980612304, "epoch": 0.5324459234608985, "step": 80 }, { "loss": 0.05269782543182373, "grad_norm": 0.47424036264419556, "learning_rate": 0.00017337630342238042, "epoch": 0.5657237936772047, "step": 85 }, { "loss": 0.04431299567222595, "grad_norm": 0.2915017902851105, "learning_rate": 0.00016953604083297665, "epoch": 0.5990016638935108, "step": 90 }, { "loss": 0.059468144178390504, "grad_norm": 0.44232964515686035, "learning_rate": 0.00016548607339452853, "epoch": 0.632279534109817, "step": 95 }, { "loss": 0.04879138767719269, "grad_norm": 0.3917384743690491, "learning_rate": 0.0001612386148856771, "epoch": 0.6655574043261231, "step": 100 }, { "loss": 0.053298580646514895, "grad_norm": 0.34147557616233826, "learning_rate": 0.00015680647467311557, "epoch": 0.6988352745424293, "step": 105 }, { "loss": 0.06263553500175476, "grad_norm": 0.3751288950443268, "learning_rate": 0.00015220301908145905, "epoch": 0.7321131447587355, "step": 110 }, { "loss": 0.046320125460624695, "grad_norm": 0.2635810971260071, "learning_rate": 0.00014744213108345604, "epoch": 0.7653910149750416, "step": 115 }, { "loss": 0.05368142127990723, "grad_norm": 0.5102227330207825, "learning_rate": 0.0001425381684321075, "epoch": 0.7986688851913477, "step": 120 }, { "loss": 0.04990728497505188, "grad_norm": 0.28165382146835327, "learning_rate": 0.0001375059203609562, "epoch": 0.831946755407654, "step": 125 }, { "loss": 0.047086745500564575, "grad_norm": 0.3740539848804474, "learning_rate": 0.00013236056298312958, "epoch": 0.8652246256239601, "step": 130 }, { "loss": 0.05073004364967346, "grad_norm": 0.24512438476085663, "learning_rate": 0.00012711761352364172, "epoch": 0.8985024958402662, "step": 135 }, { "loss": 0.04626903533935547, "grad_norm": 0.23963695764541626, "learning_rate": 0.00012179288352297984, "epoch": 0.9317803660565723, "step": 140 }, { "loss": 0.0459677129983902, "grad_norm": 0.2949606478214264, "learning_rate": 0.00011640243115310218, "epoch": 0.9650582362728786, "step": 145 }, { "loss": 0.056029146909713744, "grad_norm": 0.16958178579807281, "learning_rate": 0.00011096251278965172, "epoch": 0.9983361064891847, "step": 150 }, { "eval_loss": 0.03915443643927574, "eval_runtime": 106.7046, "eval_samples_per_second": 0.45, "eval_steps_per_second": 0.225, "epoch": 0.9983361064891847, "step": 150 }, { "loss": 0.04040303230285645, "grad_norm": 0.18060733377933502, "learning_rate": 0.00010548953398643275, "epoch": 1.026622296173045, "step": 155 }, { "loss": 0.04127705693244934, "grad_norm": 0.22245723009109497, "learning_rate": 0.0001, "epoch": 1.059900166389351, "step": 160 }, { "loss": 0.04128023087978363, "grad_norm": 0.20679683983325958, "learning_rate": 9.451046601356725e-05, "epoch": 1.0931780366056572, "step": 165 }, { "loss": 0.04075656235218048, "grad_norm": 0.2824983298778534, "learning_rate": 8.903748721034827e-05, "epoch": 1.1264559068219633, "step": 170 }, { "loss": 0.032700645923614505, "grad_norm": 0.1779838353395462, "learning_rate": 8.359756884689784e-05, "epoch": 1.1597337770382696, "step": 175 }, { "loss": 0.0488627552986145, "grad_norm": 0.41342025995254517, "learning_rate": 7.820711647702017e-05, "epoch": 1.1930116472545758, "step": 180 }, { "loss": 0.039889439940452576, "grad_norm": 0.17202401161193848, "learning_rate": 7.28823864763583e-05, "epoch": 1.2262895174708819, "step": 185 }, { "loss": 0.04121506214141846, "grad_norm": 0.2019381821155548, "learning_rate": 6.763943701687045e-05, "epoch": 1.259567387687188, "step": 190 }, { "loss": 0.03708588480949402, "grad_norm": 0.18151353299617767, "learning_rate": 6.249407963904382e-05, "epoch": 1.2928452579034941, "step": 195 }, { "loss": 0.03387935757637024, "grad_norm": 0.16017630696296692, "learning_rate": 5.746183156789252e-05, "epoch": 1.3261231281198003, "step": 200 }, { "loss": 0.03551802933216095, "grad_norm": 0.160872682929039, "learning_rate": 5.2557868916543994e-05, "epoch": 1.3594009983361066, "step": 205 }, { "loss": 0.03997071981430054, "grad_norm": 0.25131309032440186, "learning_rate": 4.779698091854098e-05, "epoch": 1.3926788685524127, "step": 210 }, { "loss": 0.04206432700157166, "grad_norm": 0.18861962854862213, "learning_rate": 4.3193525326884435e-05, "epoch": 1.4259567387687189, "step": 215 }, { "loss": 0.03841230273246765, "grad_norm": 0.2180393636226654, "learning_rate": 3.87613851143229e-05, "epoch": 1.459234608985025, "step": 220 }, { "loss": 0.03855002522468567, "grad_norm": 0.285129189491272, "learning_rate": 3.45139266054715e-05, "epoch": 1.4925124792013311, "step": 225 }, { "eval_loss": 0.036705683916807175, "eval_runtime": 107.4042, "eval_samples_per_second": 0.447, "eval_steps_per_second": 0.223, "epoch": 1.4925124792013311, "step": 225 }, { "loss": 0.04107905328273773, "grad_norm": 0.3099617660045624, "learning_rate": 3.0463959167023336e-05, "epoch": 1.5257903494176372, "step": 230 }, { "loss": 0.034897661209106444, "grad_norm": 0.18056237697601318, "learning_rate": 2.6623696577619627e-05, "epoch": 1.5590682196339434, "step": 235 }, { "loss": 0.040480229258537295, "grad_norm": 0.16304191946983337, "learning_rate": 2.3004720193876973e-05, "epoch": 1.5923460898502495, "step": 240 }, { "loss": 0.041963180899620055, "grad_norm": 0.20544564723968506, "learning_rate": 1.961794402365611e-05, "epoch": 1.6256239600665556, "step": 245 }, { "loss": 0.04076297581195831, "grad_norm": 0.1998342126607895, "learning_rate": 1.647358181190153e-05, "epoch": 1.6589018302828618, "step": 250 }, { "loss": 0.03765386044979095, "grad_norm": 0.29265111684799194, "learning_rate": 1.3581116238315195e-05, "epoch": 1.692179700499168, "step": 255 }, { "loss": 0.03905968368053436, "grad_norm": 0.3158849775791168, "learning_rate": 1.0949270319755766e-05, "epoch": 1.7254575707154742, "step": 260 }, { "loss": 0.03416600227355957, "grad_norm": 0.20490851998329163, "learning_rate": 8.585981103608342e-06, "epoch": 1.7587354409317804, "step": 265 }, { "loss": 0.03573819100856781, "grad_norm": 0.14396147429943085, "learning_rate": 6.498375731458528e-06, "epoch": 1.7920133111480865, "step": 270 }, { "loss": 0.0350035548210144, "grad_norm": 0.2610838711261749, "learning_rate": 4.692749945258057e-06, "epoch": 1.8252911813643928, "step": 275 }, { "loss": 0.02864158749580383, "grad_norm": 0.1647801697254181, "learning_rate": 3.1745491008021598e-06, "epoch": 1.858569051580699, "step": 280 }, { "loss": 0.03647815883159637, "grad_norm": 0.19215065240859985, "learning_rate": 1.9483517457776436e-06, "epoch": 1.891846921797005, "step": 285 }, { "loss": 0.037104851007461546, "grad_norm": 0.18784989416599274, "learning_rate": 1.0178558119067315e-06, "epoch": 1.9251247920133112, "step": 290 }, { "loss": 0.03571946620941162, "grad_norm": 0.16310757398605347, "learning_rate": 3.8586746282788244e-07, "epoch": 1.9584026622296173, "step": 295 }, { "loss": 0.03239317238330841, "grad_norm": 0.12636224925518036, "learning_rate": 5.4292631345942424e-08, "epoch": 1.9916805324459235, "step": 300 }, { "eval_loss": 0.03523457422852516, "eval_runtime": 107.1762, "eval_samples_per_second": 0.448, "eval_steps_per_second": 0.224, "epoch": 1.9916805324459235, "step": 300 }, { "eval_loss": 0.03514386713504791, "eval_runtime": 108.323, "eval_samples_per_second": 0.443, "eval_steps_per_second": 0.222, "epoch": 2.0, "step": 302 }, { "train_runtime": 5377.3211, "train_samples_per_second": 0.447, "train_steps_per_second": 0.056, "total_flos": 4.1742372787113254e+17, "train_loss": 0.05007273310314346, "epoch": 2.0, "step": 302 }, { "eval_loss": 0.035037748515605927, "eval_runtime": 110.0544, "eval_samples_per_second": 0.436, "eval_steps_per_second": 0.218, "epoch": 2.0, "step": 302 } ] }