{ "best_global_step": 581, "best_metric": 0.7325842696629213, "best_model_checkpoint": "checkpoints/camonet/checkpoint-581", "epoch": 7.0, "eval_steps": 500, "global_step": 581, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.24096385542168675, "grad_norm": 111.35398864746094, "learning_rate": 1.417910447761194e-05, "loss": 4.043815612792969, "step": 20 }, { "epoch": 0.4819277108433735, "grad_norm": 71.05435943603516, "learning_rate": 2.91044776119403e-05, "loss": 3.5163707733154297, "step": 40 }, { "epoch": 0.7228915662650602, "grad_norm": 60.80617141723633, "learning_rate": 4.402985074626866e-05, "loss": 3.0165132522583007, "step": 60 }, { "epoch": 0.963855421686747, "grad_norm": 64.55865478515625, "learning_rate": 4.9950171333287335e-05, "loss": 2.4458030700683593, "step": 80 }, { "epoch": 1.0, "eval_loss": 2.536519765853882, "eval_runtime": 6.8652, "eval_samples_per_second": 64.82, "eval_steps_per_second": 2.039, "eval_top1": 0.3325842696629214, "eval_top3": 0.5438202247191011, "step": 83 }, { "epoch": 1.2048192771084336, "grad_norm": 60.52080535888672, "learning_rate": 4.964638184169378e-05, "loss": 2.153371238708496, "step": 100 }, { "epoch": 1.4457831325301205, "grad_norm": 70.68125915527344, "learning_rate": 4.906984324751821e-05, "loss": 1.828770637512207, "step": 120 }, { "epoch": 1.6867469879518073, "grad_norm": 60.982425689697266, "learning_rate": 4.822693581319326e-05, "loss": 1.7083017349243164, "step": 140 }, { "epoch": 1.927710843373494, "grad_norm": 58.39655303955078, "learning_rate": 4.712698757103414e-05, "loss": 1.712203025817871, "step": 160 }, { "epoch": 2.0, "eval_loss": 1.7305916547775269, "eval_runtime": 7.5482, "eval_samples_per_second": 58.954, "eval_steps_per_second": 1.855, "eval_top1": 0.5415730337078651, "eval_top3": 0.7146067415730337, "step": 166 }, { "epoch": 2.1686746987951806, "grad_norm": 60.08979415893555, "learning_rate": 4.5782171094600005e-05, "loss": 1.3887232780456542, "step": 180 }, { "epoch": 2.4096385542168672, "grad_norm": 64.29576873779297, "learning_rate": 4.420736879094927e-05, "loss": 1.3437091827392578, "step": 200 }, { "epoch": 2.6506024096385543, "grad_norm": 62.950355529785156, "learning_rate": 4.242000820453141e-05, "loss": 1.139847469329834, "step": 220 }, { "epoch": 2.891566265060241, "grad_norm": 43.11043167114258, "learning_rate": 4.043986915532434e-05, "loss": 1.2316542625427247, "step": 240 }, { "epoch": 3.0, "eval_loss": 1.4789479970932007, "eval_runtime": 7.5421, "eval_samples_per_second": 59.002, "eval_steps_per_second": 1.856, "eval_top1": 0.6269662921348315, "eval_top3": 0.7842696629213484, "step": 249 }, { "epoch": 3.1325301204819276, "grad_norm": 66.58777618408203, "learning_rate": 3.828886484552254e-05, "loss": 1.033012580871582, "step": 260 }, { "epoch": 3.3734939759036147, "grad_norm": 53.87052536010742, "learning_rate": 3.5990799357157864e-05, "loss": 0.8578171730041504, "step": 280 }, { "epoch": 3.6144578313253013, "grad_norm": 72.20587921142578, "learning_rate": 3.357110422430506e-05, "loss": 0.8009697914123535, "step": 300 }, { "epoch": 3.855421686746988, "grad_norm": 47.637420654296875, "learning_rate": 3.105655699509458e-05, "loss": 0.8424944877624512, "step": 320 }, { "epoch": 4.0, "eval_loss": 1.3673882484436035, "eval_runtime": 8.6387, "eval_samples_per_second": 51.512, "eval_steps_per_second": 1.621, "eval_top1": 0.6202247191011236, "eval_top3": 0.8112359550561797, "step": 332 }, { "epoch": 4.096385542168675, "grad_norm": 44.70951461791992, "learning_rate": 2.8474984898065406e-05, "loss": 0.7181183815002441, "step": 340 }, { "epoch": 4.337349397590361, "grad_norm": 40.632354736328125, "learning_rate": 2.5854956892233006e-05, "loss": 0.6570661544799805, "step": 360 }, { "epoch": 4.578313253012048, "grad_norm": 41.45029067993164, "learning_rate": 2.32254675087996e-05, "loss": 0.5137750148773194, "step": 380 }, { "epoch": 4.8192771084337345, "grad_norm": 53.68215560913086, "learning_rate": 2.061561598327112e-05, "loss": 0.5405148029327392, "step": 400 }, { "epoch": 5.0, "eval_loss": 1.1706817150115967, "eval_runtime": 8.8354, "eval_samples_per_second": 50.365, "eval_steps_per_second": 1.585, "eval_top1": 0.6831460674157304, "eval_top3": 0.849438202247191, "step": 415 }, { "epoch": 5.0602409638554215, "grad_norm": 75.12175750732422, "learning_rate": 1.8054284228864366e-05, "loss": 0.49901180267333983, "step": 420 }, { "epoch": 5.301204819277109, "grad_norm": 18.631591796875, "learning_rate": 1.55698172149106e-05, "loss": 0.29165282249450686, "step": 440 }, { "epoch": 5.542168674698795, "grad_norm": 10.731932640075684, "learning_rate": 1.3189709287346813e-05, "loss": 0.3043174982070923, "step": 460 }, { "epoch": 5.783132530120482, "grad_norm": 47.11884689331055, "learning_rate": 1.0940299902627938e-05, "loss": 0.41364297866821287, "step": 480 }, { "epoch": 6.0, "eval_loss": 1.1097288131713867, "eval_runtime": 8.2234, "eval_samples_per_second": 54.114, "eval_steps_per_second": 1.702, "eval_top1": 0.7258426966292135, "eval_top3": 0.8674157303370786, "step": 498 }, { "epoch": 6.024096385542169, "grad_norm": 20.367740631103516, "learning_rate": 8.846482142219752e-06, "loss": 0.34232077598571775, "step": 500 }, { "epoch": 6.265060240963855, "grad_norm": 29.076051712036133, "learning_rate": 6.931427233395696e-06, "loss": 0.18118011951446533, "step": 520 }, { "epoch": 6.506024096385542, "grad_norm": 21.859106063842773, "learning_rate": 5.21632812492738e-06, "loss": 0.204935622215271, "step": 540 }, { "epoch": 6.746987951807229, "grad_norm": 24.722841262817383, "learning_rate": 3.7201649553876366e-06, "loss": 0.21130716800689697, "step": 560 }, { "epoch": 6.9879518072289155, "grad_norm": 27.248981475830078, "learning_rate": 2.4594950095101513e-06, "loss": 0.2202404260635376, "step": 580 }, { "epoch": 7.0, "eval_loss": 1.105672001838684, "eval_runtime": 8.1718, "eval_samples_per_second": 54.455, "eval_steps_per_second": 1.713, "eval_top1": 0.7325842696629213, "eval_top3": 0.8741573033707866, "step": 581 } ], "logging_steps": 20, "max_steps": 664, "num_input_tokens_seen": 0, "num_train_epochs": 8, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 4.8058967165239296e+17, "train_batch_size": 32, "trial_name": null, "trial_params": null }