{ "best_metric": 1.4608114957809448, "best_model_checkpoint": "miner_id_24/checkpoint-200", "epoch": 0.011878600700837441, "eval_steps": 50, "global_step": 200, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 5.939300350418721e-05, "eval_loss": 1.8331416845321655, "eval_runtime": 430.6344, "eval_samples_per_second": 12.347, "eval_steps_per_second": 3.088, "step": 1 }, { "epoch": 0.0005939300350418721, "grad_norm": 2.968214273452759, "learning_rate": 5.095e-06, "loss": 1.5987, "step": 10 }, { "epoch": 0.0011878600700837441, "grad_norm": 2.5024313926696777, "learning_rate": 1.019e-05, "loss": 1.5744, "step": 20 }, { "epoch": 0.0017817901051256162, "grad_norm": 2.9678239822387695, "learning_rate": 9.623888888888889e-06, "loss": 1.572, "step": 30 }, { "epoch": 0.0023757201401674883, "grad_norm": 4.353546142578125, "learning_rate": 9.057777777777777e-06, "loss": 1.5805, "step": 40 }, { "epoch": 0.0029696501752093604, "grad_norm": 10.799284934997559, "learning_rate": 8.491666666666667e-06, "loss": 1.7313, "step": 50 }, { "epoch": 0.0029696501752093604, "eval_loss": 1.5447496175765991, "eval_runtime": 433.6896, "eval_samples_per_second": 12.26, "eval_steps_per_second": 3.067, "step": 50 }, { "epoch": 0.0035635802102512324, "grad_norm": 1.9188200235366821, "learning_rate": 7.925555555555557e-06, "loss": 1.4851, "step": 60 }, { "epoch": 0.004157510245293104, "grad_norm": 2.6333954334259033, "learning_rate": 7.359444444444445e-06, "loss": 1.4511, "step": 70 }, { "epoch": 0.004751440280334977, "grad_norm": 3.505038261413574, "learning_rate": 6.793333333333333e-06, "loss": 1.467, "step": 80 }, { "epoch": 0.005345370315376848, "grad_norm": 4.344202995300293, "learning_rate": 6.227222222222223e-06, "loss": 1.502, "step": 90 }, { "epoch": 0.005939300350418721, "grad_norm": 11.995814323425293, "learning_rate": 5.661111111111112e-06, "loss": 1.6424, "step": 100 }, { "epoch": 0.005939300350418721, "eval_loss": 1.4858251810073853, "eval_runtime": 434.3077, "eval_samples_per_second": 12.242, "eval_steps_per_second": 3.062, "step": 100 }, { "epoch": 0.006533230385460592, "grad_norm": 2.0615479946136475, "learning_rate": 5.095e-06, "loss": 1.4343, "step": 110 }, { "epoch": 0.007127160420502465, "grad_norm": 2.4463698863983154, "learning_rate": 4.5288888888888885e-06, "loss": 1.4471, "step": 120 }, { "epoch": 0.0077210904555443365, "grad_norm": 3.745335578918457, "learning_rate": 3.9627777777777784e-06, "loss": 1.4454, "step": 130 }, { "epoch": 0.008315020490586208, "grad_norm": 4.0279221534729, "learning_rate": 3.3966666666666666e-06, "loss": 1.4979, "step": 140 }, { "epoch": 0.008908950525628082, "grad_norm": 6.417429447174072, "learning_rate": 2.830555555555556e-06, "loss": 1.4139, "step": 150 }, { "epoch": 0.008908950525628082, "eval_loss": 1.4660513401031494, "eval_runtime": 433.0753, "eval_samples_per_second": 12.277, "eval_steps_per_second": 3.071, "step": 150 }, { "epoch": 0.009502880560669953, "grad_norm": 2.0533039569854736, "learning_rate": 2.2644444444444443e-06, "loss": 1.4115, "step": 160 }, { "epoch": 0.010096810595711825, "grad_norm": 2.7204930782318115, "learning_rate": 1.6983333333333333e-06, "loss": 1.4418, "step": 170 }, { "epoch": 0.010690740630753696, "grad_norm": 3.4697649478912354, "learning_rate": 1.1322222222222221e-06, "loss": 1.4363, "step": 180 }, { "epoch": 0.01128467066579557, "grad_norm": 4.115236282348633, "learning_rate": 5.661111111111111e-07, "loss": 1.4766, "step": 190 }, { "epoch": 0.011878600700837441, "grad_norm": 8.668231010437012, "learning_rate": 0.0, "loss": 1.6002, "step": 200 }, { "epoch": 0.011878600700837441, "eval_loss": 1.4608114957809448, "eval_runtime": 433.8437, "eval_samples_per_second": 12.256, "eval_steps_per_second": 3.066, "step": 200 } ], "logging_steps": 10, "max_steps": 200, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 50, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 3, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 0 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 5.834834505105408e+16, "train_batch_size": 6, "trial_name": null, "trial_params": null }