{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 100, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 0.707854887843132, "epoch": 0.1, "grad_norm": 1.4789700508117676, "learning_rate": 4.5e-05, "loss": 2.083025360107422, "mean_token_accuracy": 0.6964636638760566, "num_tokens": 23374.0, "step": 10 }, { "entropy": 0.9212535813450813, "epoch": 0.2, "grad_norm": 0.6974025368690491, "learning_rate": 4.972369676503672e-05, "loss": 1.153501033782959, "mean_token_accuracy": 0.7658602714538574, "num_tokens": 47056.0, "step": 20 }, { "entropy": 0.6718886934220791, "epoch": 0.3, "grad_norm": 0.5641660094261169, "learning_rate": 4.877641290737884e-05, "loss": 0.6673425674438477, "mean_token_accuracy": 0.8570197850465775, "num_tokens": 70332.0, "step": 30 }, { "entropy": 0.5051603138446807, "epoch": 0.4, "grad_norm": 0.4287518858909607, "learning_rate": 4.71805704860903e-05, "loss": 0.49802455902099607, "mean_token_accuracy": 0.887857261300087, "num_tokens": 93950.0, "step": 40 }, { "entropy": 0.48869766741991044, "epoch": 0.5, "grad_norm": 0.38886094093322754, "learning_rate": 4.497969992237312e-05, "loss": 0.48790874481201174, "mean_token_accuracy": 0.8859360262751579, "num_tokens": 117707.0, "step": 50 }, { "entropy": 0.4417721003293991, "epoch": 0.6, "grad_norm": 0.3435150384902954, "learning_rate": 4.223383522796415e-05, "loss": 0.4268824100494385, "mean_token_accuracy": 0.8983871400356293, "num_tokens": 141268.0, "step": 60 }, { "entropy": 0.4217384122312069, "epoch": 0.7, "grad_norm": 0.42083045840263367, "learning_rate": 3.901787643379182e-05, "loss": 0.41396050453186034, "mean_token_accuracy": 0.8986505523324013, "num_tokens": 164883.0, "step": 70 }, { "entropy": 0.4161409936845303, "epoch": 0.8, "grad_norm": 0.3508182168006897, "learning_rate": 3.5419546512382266e-05, "loss": 0.41231813430786135, "mean_token_accuracy": 0.8985344961285591, "num_tokens": 187904.0, "step": 80 }, { "entropy": 0.4316503643989563, "epoch": 0.9, "grad_norm": 0.3890114724636078, "learning_rate": 3.1536998523845494e-05, "loss": 0.4260415554046631, "mean_token_accuracy": 0.8960150480270386, "num_tokens": 211682.0, "step": 90 }, { "entropy": 0.424409294128418, "epoch": 1.0, "grad_norm": 0.34862327575683594, "learning_rate": 2.7476138256261575e-05, "loss": 0.40468835830688477, "mean_token_accuracy": 0.9002996236085892, "num_tokens": 235287.0, "step": 100 } ], "logging_steps": 10, "max_steps": 200, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.074610195117056e+16, "train_batch_size": 1, "trial_name": null, "trial_params": null }