{ "best_global_step": 570, "best_metric": 0.2172553390264511, "best_model_checkpoint": "/home/longtail/data/outputs/qwen25-coder-7b-verireason-no-reasoning-co-ratio1.0-epoch3-exaone-matched/checkpoint-570", "epoch": 3.0, "eval_steps": 100, "global_step": 570, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 0.210302734375, "epoch": 0.026420079260237782, "grad_norm": 0.2272326648235321, "learning_rate": 2.1052631578947366e-06, "loss": 0.38262381553649905, "mean_token_accuracy": 0.9088647723197937, "num_tokens": 15331.0, "step": 5 }, { "entropy": 0.214697265625, "epoch": 0.052840158520475564, "grad_norm": 0.24048204720020294, "learning_rate": 4.736842105263158e-06, "loss": 0.36759538650512696, "mean_token_accuracy": 0.9038324475288391, "num_tokens": 31218.0, "step": 10 }, { "entropy": 0.265625, "epoch": 0.07926023778071334, "grad_norm": 0.2194337695837021, "learning_rate": 7.3684210526315784e-06, "loss": 0.44762325286865234, "mean_token_accuracy": 0.897509315609932, "num_tokens": 46827.0, "step": 15 }, { "entropy": 0.25048828125, "epoch": 0.10568031704095113, "grad_norm": 0.2488376647233963, "learning_rate": 9.999999999999999e-06, "loss": 0.41580977439880373, "mean_token_accuracy": 0.9002776592969894, "num_tokens": 61381.0, "step": 20 }, { "entropy": 0.2287353515625, "epoch": 0.13210039630118892, "grad_norm": 0.28977280855178833, "learning_rate": 1.263157894736842e-05, "loss": 0.42945280075073244, "mean_token_accuracy": 0.8985304534435272, "num_tokens": 77061.0, "step": 25 }, { "entropy": 0.2453125, "epoch": 0.15852047556142668, "grad_norm": 0.2707628011703491, "learning_rate": 1.5263157894736842e-05, "loss": 0.40612149238586426, "mean_token_accuracy": 0.9037269622087478, "num_tokens": 91074.0, "step": 30 }, { "entropy": 0.227783203125, "epoch": 0.18494055482166447, "grad_norm": 0.22182075679302216, "learning_rate": 1.7894736842105264e-05, "loss": 0.34377403259277345, "mean_token_accuracy": 0.908874437212944, "num_tokens": 106214.0, "step": 35 }, { "entropy": 0.2180419921875, "epoch": 0.21136063408190225, "grad_norm": 0.24515125155448914, "learning_rate": 2.0526315789473685e-05, "loss": 0.27584066390991213, "mean_token_accuracy": 0.9267852157354355, "num_tokens": 120134.0, "step": 40 }, { "entropy": 0.30302734375, "epoch": 0.23778071334214002, "grad_norm": 0.36891454458236694, "learning_rate": 2.3157894736842103e-05, "loss": 0.35630002021789553, "mean_token_accuracy": 0.9039895206689834, "num_tokens": 134060.0, "step": 45 }, { "entropy": 0.264599609375, "epoch": 0.26420079260237783, "grad_norm": 0.21175123751163483, "learning_rate": 2.578947368421053e-05, "loss": 0.2749725341796875, "mean_token_accuracy": 0.9225947976112365, "num_tokens": 149458.0, "step": 50 }, { "entropy": 0.264453125, "epoch": 0.2906208718626156, "grad_norm": 0.3016625940799713, "learning_rate": 2.8421052631578946e-05, "loss": 0.2754631042480469, "mean_token_accuracy": 0.9233797520399094, "num_tokens": 163845.0, "step": 55 }, { "entropy": 0.2982421875, "epoch": 0.31704095112285335, "grad_norm": 0.2732570469379425, "learning_rate": 2.999887492664158e-05, "loss": 0.3260418653488159, "mean_token_accuracy": 0.9141247242689132, "num_tokens": 179412.0, "step": 60 }, { "entropy": 0.2699951171875, "epoch": 0.34346103038309117, "grad_norm": 0.3051692545413971, "learning_rate": 2.9986219789520436e-05, "loss": 0.2863668441772461, "mean_token_accuracy": 0.9155579835176468, "num_tokens": 193314.0, "step": 65 }, { "entropy": 0.241455078125, "epoch": 0.36988110964332893, "grad_norm": 0.23183029890060425, "learning_rate": 2.9959515077322413e-05, "loss": 0.2552649736404419, "mean_token_accuracy": 0.9229518651962281, "num_tokens": 208409.0, "step": 70 }, { "entropy": 0.2355712890625, "epoch": 0.3963011889035667, "grad_norm": 0.23595623672008514, "learning_rate": 2.9918785825704544e-05, "loss": 0.2474513530731201, "mean_token_accuracy": 0.9276347905397415, "num_tokens": 223599.0, "step": 75 }, { "entropy": 0.249169921875, "epoch": 0.4227212681638045, "grad_norm": 0.3135967254638672, "learning_rate": 2.9864070218323984e-05, "loss": 0.2542789697647095, "mean_token_accuracy": 0.9266749203205109, "num_tokens": 238278.0, "step": 80 }, { "entropy": 0.2227783203125, "epoch": 0.44914134742404227, "grad_norm": 0.27829885482788086, "learning_rate": 2.9795419551040836e-05, "loss": 0.21763288974761963, "mean_token_accuracy": 0.9401752114295959, "num_tokens": 252548.0, "step": 85 }, { "entropy": 0.2646728515625, "epoch": 0.47556142668428003, "grad_norm": 0.2549667954444885, "learning_rate": 2.9712898183828297e-05, "loss": 0.2652446269989014, "mean_token_accuracy": 0.9231121420860291, "num_tokens": 267931.0, "step": 90 }, { "entropy": 0.2947021484375, "epoch": 0.5019815059445178, "grad_norm": 0.2779158651828766, "learning_rate": 2.9616583480435235e-05, "loss": 0.28800928592681885, "mean_token_accuracy": 0.9192559570074081, "num_tokens": 282065.0, "step": 95 }, { "entropy": 0.2372802734375, "epoch": 0.5284015852047557, "grad_norm": 0.25696665048599243, "learning_rate": 2.950656573585766e-05, "loss": 0.25461769104003906, "mean_token_accuracy": 0.9287555605173111, "num_tokens": 297844.0, "step": 100 }, { "epoch": 0.5284015852047557, "eval_entropy": 0.26014083059210524, "eval_loss": 0.25216802954673767, "eval_mean_token_accuracy": 0.9233670849549143, "eval_num_tokens": 297844.0, "eval_runtime": 4.7366, "eval_samples_per_second": 39.902, "eval_steps_per_second": 20.056, "step": 100 }, { "entropy": 0.212158203125, "epoch": 0.5548216644649934, "grad_norm": 0.3313332200050354, "learning_rate": 2.9382948091687255e-05, "loss": 0.21078295707702638, "mean_token_accuracy": 0.9359580397605896, "num_tokens": 311548.0, "step": 105 }, { "entropy": 0.2112060546875, "epoch": 0.5812417437252312, "grad_norm": 0.250174880027771, "learning_rate": 2.9245846439416132e-05, "loss": 0.2149496078491211, "mean_token_accuracy": 0.9396522492170334, "num_tokens": 326762.0, "step": 110 }, { "entropy": 0.233544921875, "epoch": 0.607661822985469, "grad_norm": 0.31775665283203125, "learning_rate": 2.9095389311788626e-05, "loss": 0.258730411529541, "mean_token_accuracy": 0.9234512418508529, "num_tokens": 342499.0, "step": 115 }, { "entropy": 0.229541015625, "epoch": 0.6340819022457067, "grad_norm": 0.32010215520858765, "learning_rate": 2.8931717762301893e-05, "loss": 0.23711071014404297, "mean_token_accuracy": 0.9289378106594086, "num_tokens": 355651.0, "step": 120 }, { "entropy": 0.1684326171875, "epoch": 0.6605019815059445, "grad_norm": 0.2775934338569641, "learning_rate": 2.8754985232968315e-05, "loss": 0.14103322029113768, "mean_token_accuracy": 0.9497533321380616, "num_tokens": 369599.0, "step": 125 }, { "entropy": 0.2874755859375, "epoch": 0.6869220607661823, "grad_norm": 0.3574838638305664, "learning_rate": 2.8565357410463664e-05, "loss": 0.35373797416687014, "mean_token_accuracy": 0.910257437825203, "num_tokens": 386714.0, "step": 130 }, { "entropy": 0.2102783203125, "epoch": 0.71334214002642, "grad_norm": 0.3869127929210663, "learning_rate": 2.8363012070795927e-05, "loss": 0.20922679901123048, "mean_token_accuracy": 0.9394314408302307, "num_tokens": 399622.0, "step": 135 }, { "entropy": 0.22381591796875, "epoch": 0.7397622192866579, "grad_norm": 0.3797408640384674, "learning_rate": 2.8148138912640355e-05, "loss": 0.2222966432571411, "mean_token_accuracy": 0.9335697323083878, "num_tokens": 415317.0, "step": 140 }, { "entropy": 0.2136474609375, "epoch": 0.7661822985468957, "grad_norm": 0.331587553024292, "learning_rate": 2.792093937949704e-05, "loss": 0.23508837223052978, "mean_token_accuracy": 0.9313608318567276, "num_tokens": 429274.0, "step": 145 }, { "entropy": 0.19384765625, "epoch": 0.7926023778071334, "grad_norm": 0.2861741781234741, "learning_rate": 2.7681626470837708e-05, "loss": 0.2089618682861328, "mean_token_accuracy": 0.93760344684124, "num_tokens": 445079.0, "step": 150 }, { "entropy": 0.2195068359375, "epoch": 0.8190224570673712, "grad_norm": 0.31503307819366455, "learning_rate": 2.7430424542418798e-05, "loss": 0.26315999031066895, "mean_token_accuracy": 0.9285398453474045, "num_tokens": 459855.0, "step": 155 }, { "entropy": 0.211865234375, "epoch": 0.845442536327609, "grad_norm": 0.3392992615699768, "learning_rate": 2.7167569095948032e-05, "loss": 0.22536911964416503, "mean_token_accuracy": 0.9318837016820908, "num_tokens": 473254.0, "step": 160 }, { "entropy": 0.199951171875, "epoch": 0.8718626155878467, "grad_norm": 0.34515535831451416, "learning_rate": 2.6893306558301674e-05, "loss": 0.22186641693115233, "mean_token_accuracy": 0.9428424179553986, "num_tokens": 487870.0, "step": 165 }, { "entropy": 0.275048828125, "epoch": 0.8982826948480845, "grad_norm": 0.3238794505596161, "learning_rate": 2.660789405049939e-05, "loss": 0.2929158449172974, "mean_token_accuracy": 0.917644801735878, "num_tokens": 502746.0, "step": 170 }, { "entropy": 0.318017578125, "epoch": 0.9247027741083224, "grad_norm": 0.3478052318096161, "learning_rate": 2.6311599146653446e-05, "loss": 0.33602657318115237, "mean_token_accuracy": 0.9080141842365265, "num_tokens": 517990.0, "step": 175 }, { "entropy": 0.2086669921875, "epoch": 0.9511228533685601, "grad_norm": 0.25240081548690796, "learning_rate": 2.600469962311804e-05, "loss": 0.23073394298553468, "mean_token_accuracy": 0.9393861293792725, "num_tokens": 532382.0, "step": 180 }, { "entropy": 0.2622802734375, "epoch": 0.9775429326287979, "grad_norm": 0.44267305731773376, "learning_rate": 2.5687483198074123e-05, "loss": 0.26755404472351074, "mean_token_accuracy": 0.9224933117628098, "num_tokens": 547708.0, "step": 185 }, { "entropy": 0.20502068014705882, "epoch": 1.0, "grad_norm": 0.8547039031982422, "learning_rate": 2.5360247261793666e-05, "loss": 0.21282377243041992, "mean_token_accuracy": 0.935039313400493, "num_tokens": 560030.0, "step": 190 }, { "entropy": 0.19251708984375, "epoch": 1.0264200792602378, "grad_norm": 0.31648746132850647, "learning_rate": 2.502329859783646e-05, "loss": 0.194023060798645, "mean_token_accuracy": 0.9428818017244339, "num_tokens": 575211.0, "step": 195 }, { "entropy": 0.24560546875, "epoch": 1.0528401585204756, "grad_norm": 0.40644362568855286, "learning_rate": 2.46769530954406e-05, "loss": 0.2631294012069702, "mean_token_accuracy": 0.9278771877288818, "num_tokens": 590045.0, "step": 200 }, { "epoch": 1.0528401585204756, "eval_entropy": 0.2268117804276316, "eval_loss": 0.23400349915027618, "eval_mean_token_accuracy": 0.9259416059443825, "eval_num_tokens": 590045.0, "eval_runtime": 4.7111, "eval_samples_per_second": 40.118, "eval_steps_per_second": 20.165, "step": 200 }, { "entropy": 0.22978515625, "epoch": 1.0792602377807134, "grad_norm": 0.4463113248348236, "learning_rate": 2.4321535453376472e-05, "loss": 0.24853811264038086, "mean_token_accuracy": 0.9308895230293274, "num_tokens": 605344.0, "step": 205 }, { "entropy": 0.221337890625, "epoch": 1.105680317040951, "grad_norm": 0.4098075032234192, "learning_rate": 2.3957378875541795e-05, "loss": 0.24046854972839354, "mean_token_accuracy": 0.9350315988063812, "num_tokens": 620661.0, "step": 210 }, { "entropy": 0.2391845703125, "epoch": 1.1321003963011889, "grad_norm": 0.3997504711151123, "learning_rate": 2.3584824758583077e-05, "loss": 0.24855997562408447, "mean_token_accuracy": 0.9297777205705643, "num_tokens": 636157.0, "step": 215 }, { "entropy": 0.2037841796875, "epoch": 1.1585204755614267, "grad_norm": 0.3310227692127228, "learning_rate": 2.320422237183641e-05, "loss": 0.1977330446243286, "mean_token_accuracy": 0.9382714837789535, "num_tokens": 651029.0, "step": 220 }, { "entropy": 0.182568359375, "epoch": 1.1849405548216645, "grad_norm": 0.31502988934516907, "learning_rate": 2.28159285298876e-05, "loss": 0.17885322570800782, "mean_token_accuracy": 0.9421977251768112, "num_tokens": 666993.0, "step": 225 }, { "entropy": 0.228564453125, "epoch": 1.2113606340819023, "grad_norm": 0.4962048828601837, "learning_rate": 2.242030725805864e-05, "loss": 0.2582087516784668, "mean_token_accuracy": 0.9375840485095978, "num_tokens": 683273.0, "step": 230 }, { "entropy": 0.21556396484375, "epoch": 1.23778071334214, "grad_norm": 0.34862184524536133, "learning_rate": 2.201772945113412e-05, "loss": 0.2517971992492676, "mean_token_accuracy": 0.9303504943847656, "num_tokens": 698334.0, "step": 235 }, { "entropy": 0.211962890625, "epoch": 1.2642007926023777, "grad_norm": 0.33244001865386963, "learning_rate": 2.16085725256475e-05, "loss": 0.22715094089508056, "mean_token_accuracy": 0.936177110671997, "num_tokens": 714090.0, "step": 240 }, { "entropy": 0.1701171875, "epoch": 1.2906208718626155, "grad_norm": 0.4048219919204712, "learning_rate": 2.1193220066053276e-05, "loss": 0.16675148010253907, "mean_token_accuracy": 0.9470200836658478, "num_tokens": 728351.0, "step": 245 }, { "entropy": 0.14979248046875, "epoch": 1.3170409511228534, "grad_norm": 0.369083434343338, "learning_rate": 2.0772061465116688e-05, "loss": 0.14205996990203856, "mean_token_accuracy": 0.9517278134822845, "num_tokens": 741598.0, "step": 250 }, { "entropy": 0.205712890625, "epoch": 1.3434610303830912, "grad_norm": 0.39064091444015503, "learning_rate": 2.0345491558858175e-05, "loss": 0.19915249347686767, "mean_token_accuracy": 0.9415161877870559, "num_tokens": 756707.0, "step": 255 }, { "entropy": 0.20458984375, "epoch": 1.369881109643329, "grad_norm": 0.41757169365882874, "learning_rate": 1.9913910256394766e-05, "loss": 0.21049420833587645, "mean_token_accuracy": 0.9382226914167404, "num_tokens": 772153.0, "step": 260 }, { "entropy": 0.1894775390625, "epoch": 1.3963011889035668, "grad_norm": 0.5959511995315552, "learning_rate": 1.9477722165025422e-05, "loss": 0.20970487594604492, "mean_token_accuracy": 0.9384240061044693, "num_tokens": 785641.0, "step": 265 }, { "entropy": 0.2056396484375, "epoch": 1.4227212681638046, "grad_norm": 0.4974619448184967, "learning_rate": 1.9037336210911868e-05, "loss": 0.21267409324645997, "mean_token_accuracy": 0.9356545269489288, "num_tokens": 801277.0, "step": 270 }, { "entropy": 0.1760009765625, "epoch": 1.4491413474240422, "grad_norm": 0.5783056616783142, "learning_rate": 1.8593165255710483e-05, "loss": 0.18950119018554687, "mean_token_accuracy": 0.9396244764328003, "num_tokens": 815204.0, "step": 275 }, { "entropy": 0.2078857421875, "epoch": 1.47556142668428, "grad_norm": 0.4639170169830322, "learning_rate": 1.8145625709514654e-05, "loss": 0.23868813514709472, "mean_token_accuracy": 0.9355578929185867, "num_tokens": 830311.0, "step": 280 }, { "entropy": 0.205615234375, "epoch": 1.5019815059445178, "grad_norm": 0.5348495244979858, "learning_rate": 1.7695137140470484e-05, "loss": 0.21911923885345458, "mean_token_accuracy": 0.9332752346992492, "num_tokens": 845164.0, "step": 285 }, { "entropy": 0.20986328125, "epoch": 1.5284015852047557, "grad_norm": 0.38183921575546265, "learning_rate": 1.724212188143182e-05, "loss": 0.21561951637268068, "mean_token_accuracy": 0.9330598264932632, "num_tokens": 859545.0, "step": 290 }, { "entropy": 0.1962890625, "epoch": 1.5548216644649933, "grad_norm": 0.45823004841804504, "learning_rate": 1.6787004634023356e-05, "loss": 0.20297410488128662, "mean_token_accuracy": 0.9378657519817353, "num_tokens": 873695.0, "step": 295 }, { "entropy": 0.1971923828125, "epoch": 1.581241743725231, "grad_norm": 0.48585113883018494, "learning_rate": 1.6330212070483076e-05, "loss": 0.19309521913528443, "mean_token_accuracy": 0.9413891911506653, "num_tokens": 889312.0, "step": 300 }, { "epoch": 1.581241743725231, "eval_entropy": 0.2150930304276316, "eval_loss": 0.22393172979354858, "eval_mean_token_accuracy": 0.9294123360985204, "eval_num_tokens": 889312.0, "eval_runtime": 4.6991, "eval_samples_per_second": 40.221, "eval_steps_per_second": 20.217, "step": 300 }, { "entropy": 0.1765625, "epoch": 1.607661822985469, "grad_norm": 0.5171866416931152, "learning_rate": 1.587217243365714e-05, "loss": 0.18057866096496583, "mean_token_accuracy": 0.9421164453029632, "num_tokens": 903271.0, "step": 305 }, { "entropy": 0.15986328125, "epoch": 1.6340819022457067, "grad_norm": 0.5997929573059082, "learning_rate": 1.5413315135522434e-05, "loss": 0.15566400289535523, "mean_token_accuracy": 0.9444721043109894, "num_tokens": 915512.0, "step": 310 }, { "entropy": 0.1656494140625, "epoch": 1.6605019815059445, "grad_norm": 0.6050997972488403, "learning_rate": 1.4954070354612982e-05, "loss": 0.1810092568397522, "mean_token_accuracy": 0.9434872210025788, "num_tokens": 929316.0, "step": 315 }, { "entropy": 0.2291015625, "epoch": 1.6869220607661823, "grad_norm": 0.47083452343940735, "learning_rate": 1.4494868632727769e-05, "loss": 0.26879181861877444, "mean_token_accuracy": 0.9259828954935074, "num_tokens": 944991.0, "step": 320 }, { "entropy": 0.25474853515625, "epoch": 1.7133421400264202, "grad_norm": 0.578498899936676, "learning_rate": 1.403614047129795e-05, "loss": 0.2804116725921631, "mean_token_accuracy": 0.9253529846668244, "num_tokens": 961086.0, "step": 325 }, { "entropy": 0.188720703125, "epoch": 1.739762219286658, "grad_norm": 0.5830754041671753, "learning_rate": 1.3578315927791948e-05, "loss": 0.2004934310913086, "mean_token_accuracy": 0.9403171420097352, "num_tokens": 974874.0, "step": 330 }, { "entropy": 0.2357177734375, "epoch": 1.7661822985468958, "grad_norm": 0.4751978814601898, "learning_rate": 1.3121824212536742e-05, "loss": 0.24819355010986327, "mean_token_accuracy": 0.9310738503932953, "num_tokens": 989482.0, "step": 335 }, { "entropy": 0.2209228515625, "epoch": 1.7926023778071334, "grad_norm": 0.5777033567428589, "learning_rate": 1.2667093286333357e-05, "loss": 0.23880820274353026, "mean_token_accuracy": 0.9315720736980438, "num_tokens": 1005284.0, "step": 340 }, { "entropy": 0.22216796875, "epoch": 1.8190224570673712, "grad_norm": 0.5043455958366394, "learning_rate": 1.2214549459243775e-05, "loss": 0.2275393486022949, "mean_token_accuracy": 0.9350559681653976, "num_tokens": 1020967.0, "step": 345 }, { "entropy": 0.1806640625, "epoch": 1.845442536327609, "grad_norm": 0.4179781675338745, "learning_rate": 1.1764616990925452e-05, "loss": 0.1624812126159668, "mean_token_accuracy": 0.9455937176942826, "num_tokens": 1035449.0, "step": 350 }, { "entropy": 0.21103515625, "epoch": 1.8718626155878466, "grad_norm": 0.4346652925014496, "learning_rate": 1.1317717692888014e-05, "loss": 0.22333147525787353, "mean_token_accuracy": 0.9315652191638947, "num_tokens": 1051018.0, "step": 355 }, { "entropy": 0.1916748046875, "epoch": 1.8982826948480844, "grad_norm": 0.5184327960014343, "learning_rate": 1.0874270533045177e-05, "loss": 0.19307322502136232, "mean_token_accuracy": 0.9433722555637359, "num_tokens": 1064913.0, "step": 360 }, { "entropy": 0.18074951171875, "epoch": 1.9247027741083222, "grad_norm": 0.6973323225975037, "learning_rate": 1.043469124293246e-05, "loss": 0.18255283832550048, "mean_token_accuracy": 0.9395459204912185, "num_tokens": 1080655.0, "step": 365 }, { "entropy": 0.1902587890625, "epoch": 1.95112285336856, "grad_norm": 0.5347604155540466, "learning_rate": 9.999391927959071e-06, "loss": 0.2131338119506836, "mean_token_accuracy": 0.9324799060821534, "num_tokens": 1093614.0, "step": 370 }, { "entropy": 0.203662109375, "epoch": 1.9775429326287979, "grad_norm": 0.5682111978530884, "learning_rate": 9.568780681059207e-06, "loss": 0.21848342418670655, "mean_token_accuracy": 0.932270273566246, "num_tokens": 1107999.0, "step": 375 }, { "entropy": 0.17408662683823528, "epoch": 2.0, "grad_norm": 1.124240517616272, "learning_rate": 9.143261200105145e-06, "loss": 0.2077638626098633, "mean_token_accuracy": 0.9436776988646564, "num_tokens": 1120060.0, "step": 380 }, { "entropy": 0.2104248046875, "epoch": 2.026420079260238, "grad_norm": 0.5043058395385742, "learning_rate": 8.72323240944058e-06, "loss": 0.20539186000823975, "mean_token_accuracy": 0.9394132256507873, "num_tokens": 1134276.0, "step": 385 }, { "entropy": 0.178759765625, "epoch": 2.0528401585204756, "grad_norm": 0.5097795128822327, "learning_rate": 8.309088085889304e-06, "loss": 0.16731362342834472, "mean_token_accuracy": 0.9490650534629822, "num_tokens": 1148618.0, "step": 390 }, { "entropy": 0.24921875, "epoch": 2.0792602377807134, "grad_norm": 0.5066947340965271, "learning_rate": 7.901216489589477e-06, "loss": 0.23654639720916748, "mean_token_accuracy": 0.9348665356636048, "num_tokens": 1163557.0, "step": 395 }, { "entropy": 0.18203125, "epoch": 2.1056803170409513, "grad_norm": 0.5836538672447205, "learning_rate": 7.500000000000004e-06, "loss": 0.13899633884429932, "mean_token_accuracy": 0.9545765340328216, "num_tokens": 1176678.0, "step": 400 }, { "epoch": 2.1056803170409513, "eval_entropy": 0.20543791118421054, "eval_loss": 0.21899865567684174, "eval_mean_token_accuracy": 0.931007537088896, "eval_num_tokens": 1176678.0, "eval_runtime": 4.7063, "eval_samples_per_second": 40.159, "eval_steps_per_second": 20.186, "step": 400 }, { "entropy": 0.17667236328125, "epoch": 2.132100396301189, "grad_norm": 0.5883168578147888, "learning_rate": 7.105814757419883e-06, "loss": 0.16830549240112305, "mean_token_accuracy": 0.9500027000904083, "num_tokens": 1192300.0, "step": 405 }, { "entropy": 0.1467529296875, "epoch": 2.158520475561427, "grad_norm": 0.36971086263656616, "learning_rate": 6.719030310356854e-06, "loss": 0.14136677980422974, "mean_token_accuracy": 0.9549454599618912, "num_tokens": 1206433.0, "step": 410 }, { "entropy": 0.195703125, "epoch": 2.1849405548216643, "grad_norm": 0.5005773901939392, "learning_rate": 6.340009269075807e-06, "loss": 0.19400241374969482, "mean_token_accuracy": 0.9394445419311523, "num_tokens": 1221815.0, "step": 415 }, { "entropy": 0.1435791015625, "epoch": 2.211360634081902, "grad_norm": 0.44894537329673767, "learning_rate": 5.969106965651805e-06, "loss": 0.13873835802078247, "mean_token_accuracy": 0.9550708144903183, "num_tokens": 1237748.0, "step": 420 }, { "entropy": 0.2187744140625, "epoch": 2.23778071334214, "grad_norm": 0.5867881178855896, "learning_rate": 5.6066711208464115e-06, "loss": 0.22510697841644287, "mean_token_accuracy": 0.9315517574548722, "num_tokens": 1252360.0, "step": 425 }, { "entropy": 0.235498046875, "epoch": 2.2642007926023777, "grad_norm": 0.605404257774353, "learning_rate": 5.253041518119608e-06, "loss": 0.24080452919006348, "mean_token_accuracy": 0.9283825039863587, "num_tokens": 1268082.0, "step": 430 }, { "entropy": 0.15987548828125, "epoch": 2.2906208718626155, "grad_norm": 0.5086158514022827, "learning_rate": 4.908549685082943e-06, "loss": 0.1456709623336792, "mean_token_accuracy": 0.9460086256265641, "num_tokens": 1283428.0, "step": 435 }, { "entropy": 0.1646484375, "epoch": 2.3170409511228534, "grad_norm": 0.5739629864692688, "learning_rate": 4.573518582692519e-06, "loss": 0.1556909441947937, "mean_token_accuracy": 0.9473109751939773, "num_tokens": 1299298.0, "step": 440 }, { "entropy": 0.16197509765625, "epoch": 2.343461030383091, "grad_norm": 0.5335649251937866, "learning_rate": 4.248262302473233e-06, "loss": 0.16208385229110717, "mean_token_accuracy": 0.9521175414323807, "num_tokens": 1314206.0, "step": 445 }, { "entropy": 0.177294921875, "epoch": 2.369881109643329, "grad_norm": 0.6850025057792664, "learning_rate": 3.933085772058094e-06, "loss": 0.19847280979156495, "mean_token_accuracy": 0.9465788096189499, "num_tokens": 1328448.0, "step": 450 }, { "entropy": 0.2244384765625, "epoch": 2.396301188903567, "grad_norm": 0.6370927691459656, "learning_rate": 3.628284469318688e-06, "loss": 0.23741717338562013, "mean_token_accuracy": 0.9319147199392319, "num_tokens": 1343514.0, "step": 455 }, { "entropy": 0.15863037109375, "epoch": 2.4227212681638046, "grad_norm": 0.6529363989830017, "learning_rate": 3.3341441453547932e-06, "loss": 0.16858468055725098, "mean_token_accuracy": 0.9459336966276168, "num_tokens": 1357222.0, "step": 460 }, { "entropy": 0.20355224609375, "epoch": 2.4491413474240424, "grad_norm": 0.4986702501773834, "learning_rate": 3.050940556602836e-06, "loss": 0.22168829441070556, "mean_token_accuracy": 0.9359017014503479, "num_tokens": 1372978.0, "step": 465 }, { "entropy": 0.217138671875, "epoch": 2.47556142668428, "grad_norm": 0.7848091125488281, "learning_rate": 2.778939206314343e-06, "loss": 0.23623857498168946, "mean_token_accuracy": 0.9339287459850312, "num_tokens": 1388009.0, "step": 470 }, { "entropy": 0.2067138671875, "epoch": 2.501981505944518, "grad_norm": 0.6232095956802368, "learning_rate": 2.51839509564675e-06, "loss": 0.20749149322509766, "mean_token_accuracy": 0.9373960226774216, "num_tokens": 1403597.0, "step": 475 }, { "entropy": 0.1603271484375, "epoch": 2.5284015852047554, "grad_norm": 0.5246099829673767, "learning_rate": 2.2695524845999143e-06, "loss": 0.18473849296569825, "mean_token_accuracy": 0.9495263069868087, "num_tokens": 1418083.0, "step": 480 }, { "entropy": 0.1822998046875, "epoch": 2.5548216644649933, "grad_norm": 0.5171620845794678, "learning_rate": 2.0326446630224656e-06, "loss": 0.19002891778945924, "mean_token_accuracy": 0.9404330343008042, "num_tokens": 1433006.0, "step": 485 }, { "entropy": 0.198486328125, "epoch": 2.581241743725231, "grad_norm": 0.6369736790657043, "learning_rate": 1.8078937319026655e-06, "loss": 0.20044972896575927, "mean_token_accuracy": 0.9355429112911224, "num_tokens": 1447394.0, "step": 490 }, { "entropy": 0.16258544921875, "epoch": 2.607661822985469, "grad_norm": 0.48347020149230957, "learning_rate": 1.5955103951488177e-06, "loss": 0.1729520797729492, "mean_token_accuracy": 0.9477747470140457, "num_tokens": 1462124.0, "step": 495 }, { "entropy": 0.144384765625, "epoch": 2.6340819022457067, "grad_norm": 0.5637415051460266, "learning_rate": 1.3956937620544408e-06, "loss": 0.15064214468002318, "mean_token_accuracy": 0.9508807033300399, "num_tokens": 1476343.0, "step": 500 }, { "epoch": 2.6340819022457067, "eval_entropy": 0.18974609375, "eval_loss": 0.21745847165584564, "eval_mean_token_accuracy": 0.9320169153966402, "eval_num_tokens": 1476343.0, "eval_runtime": 4.7158, "eval_samples_per_second": 40.078, "eval_steps_per_second": 20.145, "step": 500 }, { "entropy": 0.1888671875, "epoch": 2.6605019815059445, "grad_norm": 0.6523160934448242, "learning_rate": 1.2086311606333845e-06, "loss": 0.18436098098754883, "mean_token_accuracy": 0.9459800988435745, "num_tokens": 1490632.0, "step": 505 }, { "entropy": 0.17581787109375, "epoch": 2.6869220607661823, "grad_norm": 0.5741255879402161, "learning_rate": 1.0344979619998874e-06, "loss": 0.17965226173400878, "mean_token_accuracy": 0.9434189975261689, "num_tokens": 1505385.0, "step": 510 }, { "entropy": 0.1491943359375, "epoch": 2.71334214002642, "grad_norm": 0.6013323068618774, "learning_rate": 8.734574159582343e-07, "loss": 0.14173706769943237, "mean_token_accuracy": 0.9502143740653992, "num_tokens": 1520285.0, "step": 515 }, { "entropy": 0.14251708984375, "epoch": 2.739762219286658, "grad_norm": 0.4806106686592102, "learning_rate": 7.256604979561238e-07, "loss": 0.15166788101196288, "mean_token_accuracy": 0.9553648352622985, "num_tokens": 1535153.0, "step": 520 }, { "entropy": 0.1333984375, "epoch": 2.766182298546896, "grad_norm": 0.49979710578918457, "learning_rate": 5.912457675452465e-07, "loss": 0.12939850091934205, "mean_token_accuracy": 0.9568995028734207, "num_tokens": 1549952.0, "step": 525 }, { "entropy": 0.16025390625, "epoch": 2.7926023778071336, "grad_norm": 0.6719100475311279, "learning_rate": 4.703392384817656e-07, "loss": 0.16313141584396362, "mean_token_accuracy": 0.9468693345785141, "num_tokens": 1563426.0, "step": 530 }, { "entropy": 0.22427978515625, "epoch": 2.819022457067371, "grad_norm": 0.5740999579429626, "learning_rate": 3.630542605884657e-07, "loss": 0.23523077964782715, "mean_token_accuracy": 0.9297642588615418, "num_tokens": 1580594.0, "step": 535 }, { "entropy": 0.15897216796875, "epoch": 2.8454425363276092, "grad_norm": 0.6617240905761719, "learning_rate": 2.694914134893428e-07, "loss": 0.17223806381225587, "mean_token_accuracy": 0.9480368942022324, "num_tokens": 1594450.0, "step": 540 }, { "entropy": 0.17318115234375, "epoch": 2.8718626155878466, "grad_norm": 0.5243069529533386, "learning_rate": 1.8973841231624323e-07, "loss": 0.20006287097930908, "mean_token_accuracy": 0.9483350962400436, "num_tokens": 1609571.0, "step": 545 }, { "entropy": 0.1625244140625, "epoch": 2.8982826948480844, "grad_norm": 0.7395583987236023, "learning_rate": 1.2387002547596615e-07, "loss": 0.18141778707504272, "mean_token_accuracy": 0.941899985074997, "num_tokens": 1623621.0, "step": 550 }, { "entropy": 0.2183837890625, "epoch": 2.9247027741083222, "grad_norm": 0.5586023926734924, "learning_rate": 7.194800455490591e-08, "loss": 0.2549168825149536, "mean_token_accuracy": 0.928812712430954, "num_tokens": 1638889.0, "step": 555 }, { "entropy": 0.1492431640625, "epoch": 2.95112285336856, "grad_norm": 0.5419667959213257, "learning_rate": 3.40210264269758e-08, "loss": 0.14560272693634033, "mean_token_accuracy": 0.9526803165674209, "num_tokens": 1654140.0, "step": 560 }, { "entropy": 0.13837890625, "epoch": 2.977542932628798, "grad_norm": 0.5562270283699036, "learning_rate": 1.0124647619045302e-08, "loss": 0.13998043537139893, "mean_token_accuracy": 0.958392658829689, "num_tokens": 1668045.0, "step": 565 }, { "entropy": 0.19031479779411764, "epoch": 3.0, "grad_norm": 1.064183235168457, "learning_rate": 2.812709767163746e-10, "loss": 0.17594786882400512, "mean_token_accuracy": 0.9378625014249016, "num_tokens": 1680090.0, "step": 570 }, { "epoch": 3.0, "eval_entropy": 0.188671875, "eval_loss": 0.2172553390264511, "eval_mean_token_accuracy": 0.9322408381261323, "eval_num_tokens": 1680090.0, "eval_runtime": 4.7022, "eval_samples_per_second": 40.194, "eval_steps_per_second": 20.203, "step": 570 }, { "epoch": 3.0, "step": 570, "total_flos": 7.171819552165069e+16, "train_loss": 0.22585551466858178, "train_runtime": 751.1949, "train_samples_per_second": 6.042, "train_steps_per_second": 0.759 } ], "logging_steps": 5, "max_steps": 570, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 7.171819552165069e+16, "train_batch_size": 1, "trial_name": null, "trial_params": null }