{ "best_global_step": 625, "best_metric": 0.6392784657268284, "best_model_checkpoint": "/home/rngo/code/liquidai-hackathon/train/checkpoints/v2_no_coords/checkpoint-625", "epoch": 5.0, "eval_steps": 100, "global_step": 625, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.08032128514056225, "grad_norm": 7.125, "learning_rate": 5.625e-06, "loss": 0.23156580924987794, "step": 10 }, { "epoch": 0.1606425702811245, "grad_norm": 2.671875, "learning_rate": 1.1875e-05, "loss": 0.10550506114959717, "step": 20 }, { "epoch": 0.24096385542168675, "grad_norm": 6.03125, "learning_rate": 1.8125e-05, "loss": 0.07342656850814819, "step": 30 }, { "epoch": 0.321285140562249, "grad_norm": 4.5, "learning_rate": 1.9993124462265045e-05, "loss": 0.05777645707130432, "step": 40 }, { "epoch": 0.40160642570281124, "grad_norm": 7.96875, "learning_rate": 1.995947111744728e-05, "loss": 0.05417297482490539, "step": 50 }, { "epoch": 0.4819277108433735, "grad_norm": 1.71875, "learning_rate": 1.9897871425050598e-05, "loss": 0.05731180906295776, "step": 60 }, { "epoch": 0.5622489959839357, "grad_norm": 2.46875, "learning_rate": 1.980849823425486e-05, "loss": 0.04996185302734375, "step": 70 }, { "epoch": 0.642570281124498, "grad_norm": 1.2109375, "learning_rate": 1.969160232687616e-05, "loss": 0.059390270709991456, "step": 80 }, { "epoch": 0.7228915662650602, "grad_norm": 6.6875, "learning_rate": 1.9547511713671264e-05, "loss": 0.04534949958324432, "step": 90 }, { "epoch": 0.8032128514056225, "grad_norm": 3.8125, "learning_rate": 1.9376630713937043e-05, "loss": 0.05621292591094971, "step": 100 }, { "epoch": 0.8835341365461847, "grad_norm": 1.96875, "learning_rate": 1.9179438820987645e-05, "loss": 0.05151752233505249, "step": 110 }, { "epoch": 0.963855421686747, "grad_norm": 2.28125, "learning_rate": 1.895648935669278e-05, "loss": 0.04378549158573151, "step": 120 }, { "epoch": 1.0, "eval_accuracy": 0.6263157894736842, "eval_loss": 0.04093950241804123, "eval_macro_f1": 0.48621561390776613, "eval_parse_fail_rate": 0.3736842105263158, "eval_runtime": 7.4217, "eval_samples_per_second": 102.402, "eval_steps_per_second": 6.467, "step": 125 }, { "epoch": 1.0401606425702812, "grad_norm": 5.21875, "learning_rate": 1.8708407918852608e-05, "loss": 0.04595450460910797, "step": 130 }, { "epoch": 1.1204819277108433, "grad_norm": 2.5625, "learning_rate": 1.8435890625765776e-05, "loss": 0.03442436754703522, "step": 140 }, { "epoch": 1.2008032128514057, "grad_norm": 3.65625, "learning_rate": 1.8139702162916485e-05, "loss": 0.0374337911605835, "step": 150 }, { "epoch": 1.2811244979919678, "grad_norm": 4.3125, "learning_rate": 1.782067363726153e-05, "loss": 0.034351897239685056, "step": 160 }, { "epoch": 1.3614457831325302, "grad_norm": 1.9609375, "learning_rate": 1.7479700245138184e-05, "loss": 0.030325621366500854, "step": 170 }, { "epoch": 1.4417670682730923, "grad_norm": 3.234375, "learning_rate": 1.7117738760336846e-05, "loss": 0.03940878212451935, "step": 180 }, { "epoch": 1.5220883534136547, "grad_norm": 2.84375, "learning_rate": 1.6735804849386914e-05, "loss": 0.031922188401222226, "step": 190 }, { "epoch": 1.6024096385542168, "grad_norm": 1.5078125, "learning_rate": 1.6334970221589182e-05, "loss": 0.0363187164068222, "step": 200 }, { "epoch": 1.6827309236947792, "grad_norm": 2.734375, "learning_rate": 1.5916359621791847e-05, "loss": 0.02404191195964813, "step": 210 }, { "epoch": 1.7630522088353415, "grad_norm": 4.53125, "learning_rate": 1.5481147674348366e-05, "loss": 0.03141278922557831, "step": 220 }, { "epoch": 1.8433734939759037, "grad_norm": 2.265625, "learning_rate": 1.5030555587113091e-05, "loss": 0.03363974094390869, "step": 230 }, { "epoch": 1.9236947791164658, "grad_norm": 1.2734375, "learning_rate": 1.4565847724723225e-05, "loss": 0.02886805832386017, "step": 240 }, { "epoch": 2.0, "grad_norm": 2.234375, "learning_rate": 1.4088328060782573e-05, "loss": 0.031261670589447024, "step": 250 }, { "epoch": 2.0, "eval_accuracy": 0.7657894736842106, "eval_loss": 0.026152363047003746, "eval_macro_f1": 0.6361528064663962, "eval_parse_fail_rate": 0.23421052631578948, "eval_runtime": 7.4084, "eval_samples_per_second": 102.587, "eval_steps_per_second": 6.479, "step": 250 }, { "epoch": 2.0803212851405624, "grad_norm": 7.375, "learning_rate": 1.3599336518902228e-05, "loss": 0.027535757422447203, "step": 260 }, { "epoch": 2.1606425702811247, "grad_norm": 1.7578125, "learning_rate": 1.3100245212865279e-05, "loss": 0.017315882444381713, "step": 270 }, { "epoch": 2.2409638554216866, "grad_norm": 2.140625, "learning_rate": 1.259245459646567e-05, "loss": 0.02335720956325531, "step": 280 }, { "epoch": 2.321285140562249, "grad_norm": 2.265625, "learning_rate": 1.2077389533824789e-05, "loss": 0.016771413385868073, "step": 290 }, { "epoch": 2.4016064257028114, "grad_norm": 2.46875, "learning_rate": 1.1556495301212485e-05, "loss": 0.016400144994258882, "step": 300 }, { "epoch": 2.4819277108433733, "grad_norm": 1.7734375, "learning_rate": 1.1031233531591471e-05, "loss": 0.019619688391685486, "step": 310 }, { "epoch": 2.5622489959839356, "grad_norm": 0.89453125, "learning_rate": 1.0503078113264715e-05, "loss": 0.016282124817371367, "step": 320 }, { "epoch": 2.642570281124498, "grad_norm": 9.625, "learning_rate": 9.973511054134259e-06, "loss": 0.023008912801742554, "step": 330 }, { "epoch": 2.7228915662650603, "grad_norm": 1.6796875, "learning_rate": 9.444018323176399e-06, "loss": 0.019158574938774108, "step": 340 }, { "epoch": 2.8032128514056227, "grad_norm": 4.15625, "learning_rate": 8.916085680802038e-06, "loss": 0.01898370832204819, "step": 350 }, { "epoch": 2.8835341365461846, "grad_norm": 2.328125, "learning_rate": 8.391194509802294e-06, "loss": 0.021644172072410584, "step": 360 }, { "epoch": 2.963855421686747, "grad_norm": 3.03125, "learning_rate": 7.870817658577743e-06, "loss": 0.02495715022087097, "step": 370 }, { "epoch": 3.0, "eval_accuracy": 0.8355263157894737, "eval_loss": 0.02834087610244751, "eval_macro_f1": 0.6384880909700965, "eval_parse_fail_rate": 0.16447368421052633, "eval_runtime": 7.4445, "eval_samples_per_second": 102.089, "eval_steps_per_second": 6.448, "step": 375 }, { "epoch": 3.040160642570281, "grad_norm": 5.15625, "learning_rate": 7.356415308315201e-06, "loss": 0.010920841991901398, "step": 380 }, { "epoch": 3.1204819277108435, "grad_norm": 5.5625, "learning_rate": 6.849430875708818e-06, "loss": 0.0173117995262146, "step": 390 }, { "epoch": 3.2008032128514055, "grad_norm": 0.92578125, "learning_rate": 6.3512869627224535e-06, "loss": 0.011250025033950806, "step": 400 }, { "epoch": 3.281124497991968, "grad_norm": 2.859375, "learning_rate": 5.8633813647583505e-06, "loss": 0.008569899946451187, "step": 410 }, { "epoch": 3.36144578313253, "grad_norm": 11.1875, "learning_rate": 5.38708314843315e-06, "loss": 0.016421397030353547, "step": 420 }, { "epoch": 3.4417670682730925, "grad_norm": 5.5, "learning_rate": 4.923728809967156e-06, "loss": 0.02297772616147995, "step": 430 }, { "epoch": 3.522088353413655, "grad_norm": 4.3125, "learning_rate": 4.474618524966313e-06, "loss": 0.008117502182722091, "step": 440 }, { "epoch": 3.602409638554217, "grad_norm": 5.0625, "learning_rate": 4.04101250012009e-06, "loss": 0.015187962353229523, "step": 450 }, { "epoch": 3.682730923694779, "grad_norm": 0.74609375, "learning_rate": 3.624127437052484e-06, "loss": 0.010340742766857147, "step": 460 }, { "epoch": 3.7630522088353415, "grad_norm": 6.0625, "learning_rate": 3.2251331182484868e-06, "loss": 0.019126126170158388, "step": 470 }, { "epoch": 3.8433734939759034, "grad_norm": 5.8125, "learning_rate": 2.845149124636014e-06, "loss": 0.012674199044704437, "step": 480 }, { "epoch": 3.923694779116466, "grad_norm": 2.78125, "learning_rate": 2.485241694033793e-06, "loss": 0.011451072990894318, "step": 490 }, { "epoch": 4.0, "grad_norm": 3.28125, "learning_rate": 2.1464207292803696e-06, "loss": 0.007020576298236847, "step": 500 }, { "epoch": 4.0, "eval_accuracy": 0.8355263157894737, "eval_loss": 0.03696506470441818, "eval_macro_f1": 0.633622550289217, "eval_parse_fail_rate": 0.16447368421052633, "eval_runtime": 7.4674, "eval_samples_per_second": 101.776, "eval_steps_per_second": 6.428, "step": 500 }, { "epoch": 4.080321285140562, "grad_norm": 3.890625, "learning_rate": 1.8296369644394562e-06, "loss": 0.009500738978385926, "step": 510 }, { "epoch": 4.160642570281125, "grad_norm": 5.03125, "learning_rate": 1.535779297033344e-06, "loss": 0.004759049043059349, "step": 520 }, { "epoch": 4.240963855421687, "grad_norm": 4.40625, "learning_rate": 1.2656722937900534e-06, "loss": 0.005586640909314156, "step": 530 }, { "epoch": 4.321285140562249, "grad_norm": 5.28125, "learning_rate": 1.020073876903147e-06, "loss": 0.006852471828460693, "step": 540 }, { "epoch": 4.401606425702811, "grad_norm": 3.765625, "learning_rate": 7.996731972966287e-07, "loss": 0.006881513446569443, "step": 550 }, { "epoch": 4.481927710843373, "grad_norm": 0.921875, "learning_rate": 6.050887008624817e-07, "loss": 0.012200018018484115, "step": 560 }, { "epoch": 4.562248995983936, "grad_norm": 1.359375, "learning_rate": 4.3686639309705183e-07, "loss": 0.011706339567899704, "step": 570 }, { "epoch": 4.642570281124498, "grad_norm": 3.328125, "learning_rate": 2.9547830700569545e-07, "loss": 0.00998671054840088, "step": 580 }, { "epoch": 4.72289156626506, "grad_norm": 1.125, "learning_rate": 1.8132117857477593e-07, "loss": 0.01855793744325638, "step": 590 }, { "epoch": 4.803212851405623, "grad_norm": 4.875, "learning_rate": 9.471533352762962e-08, "loss": 0.006045354157686233, "step": 600 }, { "epoch": 4.883534136546185, "grad_norm": 7.78125, "learning_rate": 3.59037884882818e-08, "loss": 0.013950885832309723, "step": 610 }, { "epoch": 4.9638554216867465, "grad_norm": 4.09375, "learning_rate": 5.051569075056328e-09, "loss": 0.006919116526842117, "step": 620 }, { "epoch": 5.0, "eval_accuracy": 0.85, "eval_loss": 0.03865349292755127, "eval_macro_f1": 0.6392784657268284, "eval_parse_fail_rate": 0.15, "eval_runtime": 7.6875, "eval_samples_per_second": 98.862, "eval_steps_per_second": 6.244, "step": 625 }, { "epoch": 5.0, "step": 625, "total_flos": 1.2910681058328576e+16, "train_loss": 0.02993413337469101, "train_runtime": 499.7178, "train_samples_per_second": 39.752, "train_steps_per_second": 1.251 } ], "logging_steps": 10, "max_steps": 625, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.2910681058328576e+16, "train_batch_size": 16, "trial_name": null, "trial_params": null }