nabin2004's picture
Upload folder using huggingface_hub
c571699 verified
Raw
History Blame
3.61 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 100,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 0.707854887843132,
"epoch": 0.1,
"grad_norm": 1.4789700508117676,
"learning_rate": 4.5e-05,
"loss": 2.083025360107422,
"mean_token_accuracy": 0.6964636638760566,
"num_tokens": 23374.0,
"step": 10
},
{
"entropy": 0.9212535813450813,
"epoch": 0.2,
"grad_norm": 0.6974025368690491,
"learning_rate": 4.972369676503672e-05,
"loss": 1.153501033782959,
"mean_token_accuracy": 0.7658602714538574,
"num_tokens": 47056.0,
"step": 20
},
{
"entropy": 0.6718886934220791,
"epoch": 0.3,
"grad_norm": 0.5641660094261169,
"learning_rate": 4.877641290737884e-05,
"loss": 0.6673425674438477,
"mean_token_accuracy": 0.8570197850465775,
"num_tokens": 70332.0,
"step": 30
},
{
"entropy": 0.5051603138446807,
"epoch": 0.4,
"grad_norm": 0.4287518858909607,
"learning_rate": 4.71805704860903e-05,
"loss": 0.49802455902099607,
"mean_token_accuracy": 0.887857261300087,
"num_tokens": 93950.0,
"step": 40
},
{
"entropy": 0.48869766741991044,
"epoch": 0.5,
"grad_norm": 0.38886094093322754,
"learning_rate": 4.497969992237312e-05,
"loss": 0.48790874481201174,
"mean_token_accuracy": 0.8859360262751579,
"num_tokens": 117707.0,
"step": 50
},
{
"entropy": 0.4417721003293991,
"epoch": 0.6,
"grad_norm": 0.3435150384902954,
"learning_rate": 4.223383522796415e-05,
"loss": 0.4268824100494385,
"mean_token_accuracy": 0.8983871400356293,
"num_tokens": 141268.0,
"step": 60
},
{
"entropy": 0.4217384122312069,
"epoch": 0.7,
"grad_norm": 0.42083045840263367,
"learning_rate": 3.901787643379182e-05,
"loss": 0.41396050453186034,
"mean_token_accuracy": 0.8986505523324013,
"num_tokens": 164883.0,
"step": 70
},
{
"entropy": 0.4161409936845303,
"epoch": 0.8,
"grad_norm": 0.3508182168006897,
"learning_rate": 3.5419546512382266e-05,
"loss": 0.41231813430786135,
"mean_token_accuracy": 0.8985344961285591,
"num_tokens": 187904.0,
"step": 80
},
{
"entropy": 0.4316503643989563,
"epoch": 0.9,
"grad_norm": 0.3890114724636078,
"learning_rate": 3.1536998523845494e-05,
"loss": 0.4260415554046631,
"mean_token_accuracy": 0.8960150480270386,
"num_tokens": 211682.0,
"step": 90
},
{
"entropy": 0.424409294128418,
"epoch": 1.0,
"grad_norm": 0.34862327575683594,
"learning_rate": 2.7476138256261575e-05,
"loss": 0.40468835830688477,
"mean_token_accuracy": 0.9002996236085892,
"num_tokens": 235287.0,
"step": 100
}
],
"logging_steps": 10,
"max_steps": 200,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.074610195117056e+16,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}