{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 4.0, "eval_steps": 5, "global_step": 72, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.05555555555555555, "grad_norm": 5.283575057983398, "learning_rate": 0.0, "loss": 2.367, "step": 1 }, { "epoch": 0.05555555555555555, "eval_loss": 3.829460859298706, "eval_runtime": 4.378, "eval_samples_per_second": 51.394, "eval_steps_per_second": 17.131, "step": 1 }, { "epoch": 0.1111111111111111, "grad_norm": 4.849005699157715, "learning_rate": 2e-05, "loss": 2.0856, "step": 2 }, { "epoch": 0.16666666666666666, "grad_norm": 4.854206562042236, "learning_rate": 4e-05, "loss": 2.0361, "step": 3 }, { "epoch": 0.2222222222222222, "grad_norm": 3.646277666091919, "learning_rate": 6e-05, "loss": 1.9353, "step": 4 }, { "epoch": 0.2777777777777778, "grad_norm": 2.636997699737549, "learning_rate": 8e-05, "loss": 1.5523, "step": 5 }, { "epoch": 0.2777777777777778, "eval_loss": 2.0394411087036133, "eval_runtime": 4.4306, "eval_samples_per_second": 50.784, "eval_steps_per_second": 16.928, "step": 5 }, { "epoch": 0.3333333333333333, "grad_norm": 2.822960376739502, "learning_rate": 0.0001, "loss": 1.1471, "step": 6 }, { "epoch": 0.3888888888888889, "grad_norm": 3.2218048572540283, "learning_rate": 0.00012, "loss": 0.7826, "step": 7 }, { "epoch": 0.4444444444444444, "grad_norm": 2.1202049255371094, "learning_rate": 0.00014, "loss": 0.4402, "step": 8 }, { "epoch": 0.5, "grad_norm": 5.287557601928711, "learning_rate": 0.00016, "loss": 0.4659, "step": 9 }, { "epoch": 0.5555555555555556, "grad_norm": 1.2889245748519897, "learning_rate": 0.00018, "loss": 0.3407, "step": 10 }, { "epoch": 0.5555555555555556, "eval_loss": 1.2009233236312866, "eval_runtime": 4.4308, "eval_samples_per_second": 50.781, "eval_steps_per_second": 16.927, "step": 10 }, { "epoch": 0.6111111111111112, "grad_norm": 0.6914752721786499, "learning_rate": 0.0002, "loss": 0.2716, "step": 11 }, { "epoch": 0.6666666666666666, "grad_norm": 1.010902762413025, "learning_rate": 0.00019987165071710527, "loss": 0.2239, "step": 12 }, { "epoch": 0.7222222222222222, "grad_norm": 0.5965589284896851, "learning_rate": 0.00019948693233918952, "loss": 0.2037, "step": 13 }, { "epoch": 0.7777777777777778, "grad_norm": 0.7514087557792664, "learning_rate": 0.00019884683243281116, "loss": 0.241, "step": 14 }, { "epoch": 0.8333333333333334, "grad_norm": 0.3119024634361267, "learning_rate": 0.00019795299412524945, "loss": 0.1686, "step": 15 }, { "epoch": 0.8333333333333334, "eval_loss": 1.0128521919250488, "eval_runtime": 4.4341, "eval_samples_per_second": 50.744, "eval_steps_per_second": 16.915, "step": 15 }, { "epoch": 0.8888888888888888, "grad_norm": 0.727888286113739, "learning_rate": 0.00019680771188662044, "loss": 0.1748, "step": 16 }, { "epoch": 0.9444444444444444, "grad_norm": 0.32004445791244507, "learning_rate": 0.00019541392564000488, "loss": 0.1383, "step": 17 }, { "epoch": 1.0, "grad_norm": 0.3259457051753998, "learning_rate": 0.00019377521321470805, "loss": 0.1288, "step": 18 }, { "epoch": 1.0555555555555556, "grad_norm": 0.3080686926841736, "learning_rate": 0.00019189578116202307, "loss": 0.1145, "step": 19 }, { "epoch": 1.1111111111111112, "grad_norm": 0.4244043529033661, "learning_rate": 0.00018978045395707418, "loss": 0.1512, "step": 20 }, { "epoch": 1.1111111111111112, "eval_loss": 1.1556396484375, "eval_runtime": 4.4392, "eval_samples_per_second": 50.685, "eval_steps_per_second": 16.895, "step": 20 }, { "epoch": 1.1666666666666667, "grad_norm": 0.3573606610298157, "learning_rate": 0.00018743466161445823, "loss": 0.1075, "step": 21 }, { "epoch": 1.2222222222222223, "grad_norm": 0.8563918471336365, "learning_rate": 0.00018486442574947511, "loss": 0.1301, "step": 22 }, { "epoch": 1.2777777777777777, "grad_norm": 0.387724369764328, "learning_rate": 0.00018207634412072764, "loss": 0.1264, "step": 23 }, { "epoch": 1.3333333333333333, "grad_norm": 0.4080502390861511, "learning_rate": 0.00017907757369376985, "loss": 0.1209, "step": 24 }, { "epoch": 1.3888888888888888, "grad_norm": 0.3518580198287964, "learning_rate": 0.0001758758122692791, "loss": 0.1278, "step": 25 }, { "epoch": 1.3888888888888888, "eval_loss": 0.7397511005401611, "eval_runtime": 4.4247, "eval_samples_per_second": 50.851, "eval_steps_per_second": 16.95, "step": 25 }, { "epoch": 1.4444444444444444, "grad_norm": 0.1988414078950882, "learning_rate": 0.000172479278722912, "loss": 0.0998, "step": 26 }, { "epoch": 1.5, "grad_norm": 0.33381035923957825, "learning_rate": 0.00016889669190756868, "loss": 0.128, "step": 27 }, { "epoch": 1.5555555555555556, "grad_norm": 0.21273471415042877, "learning_rate": 0.00016513724827222227, "loss": 0.0824, "step": 28 }, { "epoch": 1.6111111111111112, "grad_norm": 0.26343834400177, "learning_rate": 0.0001612105982547663, "loss": 0.1177, "step": 29 }, { "epoch": 1.6666666666666665, "grad_norm": 0.1714707314968109, "learning_rate": 0.00015712682150947923, "loss": 0.0805, "step": 30 }, { "epoch": 1.6666666666666665, "eval_loss": 0.6418749690055847, "eval_runtime": 4.4192, "eval_samples_per_second": 50.914, "eval_steps_per_second": 16.971, "step": 30 }, { "epoch": 1.7222222222222223, "grad_norm": 0.22125771641731262, "learning_rate": 0.00015289640103269625, "loss": 0.0894, "step": 31 }, { "epoch": 1.7777777777777777, "grad_norm": 0.24318796396255493, "learning_rate": 0.00014853019625310813, "loss": 0.0872, "step": 32 }, { "epoch": 1.8333333333333335, "grad_norm": 0.2300858497619629, "learning_rate": 0.00014403941515576344, "loss": 0.0632, "step": 33 }, { "epoch": 1.8888888888888888, "grad_norm": 0.20156258344650269, "learning_rate": 0.00013943558551133186, "loss": 0.0367, "step": 34 }, { "epoch": 1.9444444444444444, "grad_norm": 0.28669273853302, "learning_rate": 0.00013473052528448201, "loss": 0.0691, "step": 35 }, { "epoch": 1.9444444444444444, "eval_loss": 0.6279710531234741, "eval_runtime": 4.428, "eval_samples_per_second": 50.813, "eval_steps_per_second": 16.938, "step": 35 }, { "epoch": 2.0, "grad_norm": 0.2706594467163086, "learning_rate": 0.00012993631229733582, "loss": 0.0698, "step": 36 }, { "epoch": 2.0555555555555554, "grad_norm": 0.1888062208890915, "learning_rate": 0.00012506525322587207, "loss": 0.0479, "step": 37 }, { "epoch": 2.111111111111111, "grad_norm": 0.1502252072095871, "learning_rate": 0.00012012985200886602, "loss": 0.0446, "step": 38 }, { "epoch": 2.1666666666666665, "grad_norm": 0.1221298798918724, "learning_rate": 0.00011514277775045768, "loss": 0.0359, "step": 39 }, { "epoch": 2.2222222222222223, "grad_norm": 0.1640322506427765, "learning_rate": 0.00011011683219874323, "loss": 0.0532, "step": 40 }, { "epoch": 2.2222222222222223, "eval_loss": 0.6401044726371765, "eval_runtime": 4.4435, "eval_samples_per_second": 50.636, "eval_steps_per_second": 16.879, "step": 40 }, { "epoch": 2.2777777777777777, "grad_norm": 0.14193332195281982, "learning_rate": 0.00010506491688387127, "loss": 0.057, "step": 41 }, { "epoch": 2.3333333333333335, "grad_norm": 0.2185075283050537, "learning_rate": 0.0001, "loss": 0.0665, "step": 42 }, { "epoch": 2.388888888888889, "grad_norm": 0.10428009927272797, "learning_rate": 9.493508311612874e-05, "loss": 0.0227, "step": 43 }, { "epoch": 2.4444444444444446, "grad_norm": 0.13296478986740112, "learning_rate": 8.98831678012568e-05, "loss": 0.0446, "step": 44 }, { "epoch": 2.5, "grad_norm": 0.2428351491689682, "learning_rate": 8.485722224954237e-05, "loss": 0.0401, "step": 45 }, { "epoch": 2.5, "eval_loss": 0.6121364235877991, "eval_runtime": 4.4316, "eval_samples_per_second": 50.772, "eval_steps_per_second": 16.924, "step": 45 }, { "epoch": 2.5555555555555554, "grad_norm": 0.11428028345108032, "learning_rate": 7.987014799113397e-05, "loss": 0.0571, "step": 46 }, { "epoch": 2.611111111111111, "grad_norm": 0.16103307902812958, "learning_rate": 7.493474677412794e-05, "loss": 0.06, "step": 47 }, { "epoch": 2.6666666666666665, "grad_norm": 0.15212145447731018, "learning_rate": 7.006368770266421e-05, "loss": 0.0565, "step": 48 }, { "epoch": 2.7222222222222223, "grad_norm": 0.13669654726982117, "learning_rate": 6.526947471551798e-05, "loss": 0.0528, "step": 49 }, { "epoch": 2.7777777777777777, "grad_norm": 0.14751426875591278, "learning_rate": 6.0564414488668165e-05, "loss": 0.0367, "step": 50 }, { "epoch": 2.7777777777777777, "eval_loss": 0.6128059029579163, "eval_runtime": 4.4242, "eval_samples_per_second": 50.857, "eval_steps_per_second": 16.952, "step": 50 }, { "epoch": 2.8333333333333335, "grad_norm": 0.1321621984243393, "learning_rate": 5.596058484423656e-05, "loss": 0.0515, "step": 51 }, { "epoch": 2.888888888888889, "grad_norm": 0.12428299337625504, "learning_rate": 5.146980374689192e-05, "loss": 0.0323, "step": 52 }, { "epoch": 2.9444444444444446, "grad_norm": 0.12496347725391388, "learning_rate": 4.710359896730379e-05, "loss": 0.0477, "step": 53 }, { "epoch": 3.0, "grad_norm": 0.13071990013122559, "learning_rate": 4.287317849052075e-05, "loss": 0.0476, "step": 54 }, { "epoch": 3.0555555555555554, "grad_norm": 0.14479975402355194, "learning_rate": 3.878940174523371e-05, "loss": 0.064, "step": 55 }, { "epoch": 3.0555555555555554, "eval_loss": 0.6650803685188293, "eval_runtime": 4.4195, "eval_samples_per_second": 50.911, "eval_steps_per_second": 16.97, "step": 55 }, { "epoch": 3.111111111111111, "grad_norm": 0.10720603168010712, "learning_rate": 3.4862751727777797e-05, "loss": 0.0342, "step": 56 }, { "epoch": 3.1666666666666665, "grad_norm": 0.11034850031137466, "learning_rate": 3.110330809243134e-05, "loss": 0.0427, "step": 57 }, { "epoch": 3.2222222222222223, "grad_norm": 0.10966861248016357, "learning_rate": 2.7520721277088024e-05, "loss": 0.0391, "step": 58 }, { "epoch": 3.2777777777777777, "grad_norm": 0.15885663032531738, "learning_rate": 2.4124187730720917e-05, "loss": 0.0418, "step": 59 }, { "epoch": 3.3333333333333335, "grad_norm": 0.11797765642404556, "learning_rate": 2.092242630623016e-05, "loss": 0.0315, "step": 60 }, { "epoch": 3.3333333333333335, "eval_loss": 0.67604660987854, "eval_runtime": 4.4237, "eval_samples_per_second": 50.863, "eval_steps_per_second": 16.954, "step": 60 }, { "epoch": 3.388888888888889, "grad_norm": 0.0905529335141182, "learning_rate": 1.7923655879272393e-05, "loss": 0.0273, "step": 61 }, { "epoch": 3.4444444444444446, "grad_norm": 0.16150006651878357, "learning_rate": 1.5135574250524897e-05, "loss": 0.0388, "step": 62 }, { "epoch": 3.5, "grad_norm": 0.11532038450241089, "learning_rate": 1.2565338385541792e-05, "loss": 0.0448, "step": 63 }, { "epoch": 3.5555555555555554, "grad_norm": 0.11461252719163895, "learning_rate": 1.0219546042925843e-05, "loss": 0.0355, "step": 64 }, { "epoch": 3.611111111111111, "grad_norm": 0.15628494322299957, "learning_rate": 8.10421883797694e-06, "loss": 0.0526, "step": 65 }, { "epoch": 3.611111111111111, "eval_loss": 0.6782650947570801, "eval_runtime": 4.4202, "eval_samples_per_second": 50.903, "eval_steps_per_second": 16.968, "step": 65 }, { "epoch": 3.6666666666666665, "grad_norm": 0.11209984123706818, "learning_rate": 6.22478678529197e-06, "loss": 0.0396, "step": 66 }, { "epoch": 3.7222222222222223, "grad_norm": 0.09433431923389435, "learning_rate": 4.586074359995119e-06, "loss": 0.0363, "step": 67 }, { "epoch": 3.7777777777777777, "grad_norm": 0.17248067259788513, "learning_rate": 3.1922881133795825e-06, "loss": 0.0469, "step": 68 }, { "epoch": 3.8333333333333335, "grad_norm": 0.1422806680202484, "learning_rate": 2.0470058747505516e-06, "loss": 0.0437, "step": 69 }, { "epoch": 3.888888888888889, "grad_norm": 0.13716408610343933, "learning_rate": 1.1531675671888619e-06, "loss": 0.0412, "step": 70 }, { "epoch": 3.888888888888889, "eval_loss": 0.6792881488800049, "eval_runtime": 4.4297, "eval_samples_per_second": 50.794, "eval_steps_per_second": 16.931, "step": 70 }, { "epoch": 3.9444444444444446, "grad_norm": 0.14409439265727997, "learning_rate": 5.130676608104845e-07, "loss": 0.0449, "step": 71 }, { "epoch": 4.0, "grad_norm": 0.13294203579425812, "learning_rate": 1.2834928289472416e-07, "loss": 0.0353, "step": 72 } ], "logging_steps": 1, "max_steps": 72, "num_input_tokens_seen": 0, "num_train_epochs": 4, "save_steps": 18, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 7.533795369340109e+16, "train_batch_size": 1, "trial_name": null, "trial_params": null }