{ "best_global_step": 5000, "best_metric": 0.9768723268723268, "best_model_checkpoint": "models/mmbert32k/feedback-detector_lora/checkpoint-5000", "epoch": 4.468275245755138, "eval_steps": 500, "global_step": 5000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.08936550491510277, "grad_norm": 20.91827964782715, "learning_rate": 5.303571428571429e-06, "loss": 2.3772, "step": 100 }, { "epoch": 0.17873100983020554, "grad_norm": 13.255019187927246, "learning_rate": 1.0660714285714287e-05, "loss": 1.4536, "step": 200 }, { "epoch": 0.2680965147453083, "grad_norm": 6.325151443481445, "learning_rate": 1.601785714285714e-05, "loss": 0.7688, "step": 300 }, { "epoch": 0.3574620196604111, "grad_norm": 14.112616539001465, "learning_rate": 2.1375e-05, "loss": 0.417, "step": 400 }, { "epoch": 0.44682752457551383, "grad_norm": 7.2552032470703125, "learning_rate": 2.673214285714286e-05, "loss": 0.312, "step": 500 }, { "epoch": 0.44682752457551383, "eval_accuracy": 0.9366834170854271, "eval_f1_NEED_CLARIFICATION": 0.9595141700404858, "eval_f1_SAT": 0.9993297587131368, "eval_f1_WANT_DIFFERENT": 0.8411037107516651, "eval_f1_WRONG_ANSWER": 0.8215417106652587, "eval_f1_macro": 0.9053723375426366, "eval_f1_weighted": 0.9366285248867929, "eval_loss": 0.16554784774780273, "eval_runtime": 6.6327, "eval_samples_per_second": 450.046, "eval_steps_per_second": 14.172, "step": 500 }, { "epoch": 0.5361930294906166, "grad_norm": 12.230180740356445, "learning_rate": 2.976762661370407e-05, "loss": 0.2387, "step": 600 }, { "epoch": 0.6255585344057194, "grad_norm": 0.957978367805481, "learning_rate": 2.9171797418073483e-05, "loss": 0.2194, "step": 700 }, { "epoch": 0.7149240393208222, "grad_norm": 17.851573944091797, "learning_rate": 2.85759682224429e-05, "loss": 0.2051, "step": 800 }, { "epoch": 0.8042895442359249, "grad_norm": 6.15651798248291, "learning_rate": 2.7980139026812316e-05, "loss": 0.1754, "step": 900 }, { "epoch": 0.8936550491510277, "grad_norm": 16.395740509033203, "learning_rate": 2.738430983118173e-05, "loss": 0.1795, "step": 1000 }, { "epoch": 0.8936550491510277, "eval_accuracy": 0.9571189279731993, "eval_f1_NEED_CLARIFICATION": 0.9839034205231388, "eval_f1_SAT": 1.0, "eval_f1_WANT_DIFFERENT": 0.8676307007786429, "eval_f1_WRONG_ANSWER": 0.8894977168949771, "eval_f1_macro": 0.9352579595491897, "eval_f1_weighted": 0.9567952614479014, "eval_loss": 0.12704455852508545, "eval_runtime": 4.9266, "eval_samples_per_second": 605.9, "eval_steps_per_second": 19.08, "step": 1000 }, { "epoch": 0.9830205540661304, "grad_norm": 1.0810153484344482, "learning_rate": 2.6788480635551143e-05, "loss": 0.1464, "step": 1100 }, { "epoch": 1.0723860589812333, "grad_norm": 1.037031888961792, "learning_rate": 2.6192651439920558e-05, "loss": 0.0986, "step": 1200 }, { "epoch": 1.161751563896336, "grad_norm": 13.27597427368164, "learning_rate": 2.5596822244289973e-05, "loss": 0.1327, "step": 1300 }, { "epoch": 1.2511170688114388, "grad_norm": 10.263288497924805, "learning_rate": 2.5000993048659384e-05, "loss": 0.1431, "step": 1400 }, { "epoch": 1.3404825737265416, "grad_norm": 17.2136173248291, "learning_rate": 2.44051638530288e-05, "loss": 0.0957, "step": 1500 }, { "epoch": 1.3404825737265416, "eval_accuracy": 0.9768844221105528, "eval_f1_NEED_CLARIFICATION": 0.9940119760479041, "eval_f1_SAT": 0.999664767013074, "eval_f1_WANT_DIFFERENT": 0.9278996865203761, "eval_f1_WRONG_ANSWER": 0.9396887159533074, "eval_f1_macro": 0.9653162863836654, "eval_f1_weighted": 0.9767427658694287, "eval_loss": 0.07943707704544067, "eval_runtime": 4.9017, "eval_samples_per_second": 608.967, "eval_steps_per_second": 19.177, "step": 1500 }, { "epoch": 1.4298480786416443, "grad_norm": 2.8994057178497314, "learning_rate": 2.3809334657398214e-05, "loss": 0.0967, "step": 1600 }, { "epoch": 1.519213583556747, "grad_norm": 1.162245750427246, "learning_rate": 2.3213505461767625e-05, "loss": 0.1492, "step": 1700 }, { "epoch": 1.6085790884718498, "grad_norm": 13.979327201843262, "learning_rate": 2.261767626613704e-05, "loss": 0.1293, "step": 1800 }, { "epoch": 1.6979445933869526, "grad_norm": 10.116354942321777, "learning_rate": 2.2021847070506455e-05, "loss": 0.0858, "step": 1900 }, { "epoch": 1.7873100983020556, "grad_norm": 7.858895778656006, "learning_rate": 2.142601787487587e-05, "loss": 0.0978, "step": 2000 }, { "epoch": 1.7873100983020556, "eval_accuracy": 0.9752093802345059, "eval_f1_NEED_CLARIFICATION": 0.994994994994995, "eval_f1_SAT": 1.0, "eval_f1_WANT_DIFFERENT": 0.9229144667370645, "eval_f1_WRONG_ANSWER": 0.9328214971209213, "eval_f1_macro": 0.9626827397132453, "eval_f1_weighted": 0.9750968232860249, "eval_loss": 0.08431631326675415, "eval_runtime": 4.8873, "eval_samples_per_second": 610.767, "eval_steps_per_second": 19.234, "step": 2000 }, { "epoch": 1.876675603217158, "grad_norm": 0.5830298662185669, "learning_rate": 2.083018867924528e-05, "loss": 0.0922, "step": 2100 }, { "epoch": 1.966041108132261, "grad_norm": 0.5619744062423706, "learning_rate": 2.0234359483614696e-05, "loss": 0.1096, "step": 2200 }, { "epoch": 2.0554066130473636, "grad_norm": 0.08848729729652405, "learning_rate": 1.9638530287984115e-05, "loss": 0.0675, "step": 2300 }, { "epoch": 2.1447721179624666, "grad_norm": 0.039530836045742035, "learning_rate": 1.9042701092353526e-05, "loss": 0.0792, "step": 2400 }, { "epoch": 2.234137622877569, "grad_norm": 1.8711425065994263, "learning_rate": 1.844687189672294e-05, "loss": 0.0729, "step": 2500 }, { "epoch": 2.234137622877569, "eval_accuracy": 0.9785594639865997, "eval_f1_NEED_CLARIFICATION": 0.9949849548645938, "eval_f1_SAT": 1.0, "eval_f1_WANT_DIFFERENT": 0.9351464435146444, "eval_f1_WRONG_ANSWER": 0.9410628019323671, "eval_f1_macro": 0.9677985500779014, "eval_f1_weighted": 0.9785107912077653, "eval_loss": 0.08227432519197464, "eval_runtime": 4.9766, "eval_samples_per_second": 599.811, "eval_steps_per_second": 18.889, "step": 2500 }, { "epoch": 2.323503127792672, "grad_norm": 5.597414970397949, "learning_rate": 1.7851042701092356e-05, "loss": 0.0764, "step": 2600 }, { "epoch": 2.4128686327077746, "grad_norm": 12.755281448364258, "learning_rate": 1.7255213505461767e-05, "loss": 0.0803, "step": 2700 }, { "epoch": 2.5022341376228776, "grad_norm": 8.895140647888184, "learning_rate": 1.6659384309831182e-05, "loss": 0.0724, "step": 2800 }, { "epoch": 2.5915996425379806, "grad_norm": 1.5834654569625854, "learning_rate": 1.6063555114200597e-05, "loss": 0.0575, "step": 2900 }, { "epoch": 2.680965147453083, "grad_norm": 0.673122227191925, "learning_rate": 1.5467725918570012e-05, "loss": 0.0631, "step": 3000 }, { "epoch": 2.680965147453083, "eval_accuracy": 0.9825795644891122, "eval_f1_NEED_CLARIFICATION": 0.996996996996997, "eval_f1_SAT": 1.0, "eval_f1_WANT_DIFFERENT": 0.9477911646586346, "eval_f1_WRONG_ANSWER": 0.9506545820745217, "eval_f1_macro": 0.9738606859325383, "eval_f1_weighted": 0.9825562768434225, "eval_loss": 0.06965455412864685, "eval_runtime": 4.8413, "eval_samples_per_second": 616.566, "eval_steps_per_second": 19.416, "step": 3000 }, { "epoch": 2.7703306523681857, "grad_norm": 0.04906867444515228, "learning_rate": 1.4871896722939424e-05, "loss": 0.0582, "step": 3100 }, { "epoch": 2.8596961572832886, "grad_norm": 2.8738303184509277, "learning_rate": 1.4276067527308838e-05, "loss": 0.0716, "step": 3200 }, { "epoch": 2.9490616621983916, "grad_norm": 0.9897614121437073, "learning_rate": 1.3680238331678252e-05, "loss": 0.0701, "step": 3300 }, { "epoch": 3.038427167113494, "grad_norm": 0.36938703060150146, "learning_rate": 1.3084409136047666e-05, "loss": 0.0467, "step": 3400 }, { "epoch": 3.127792672028597, "grad_norm": 3.860152244567871, "learning_rate": 1.2488579940417081e-05, "loss": 0.0429, "step": 3500 }, { "epoch": 3.127792672028597, "eval_accuracy": 0.9802345058626466, "eval_f1_NEED_CLARIFICATION": 0.9939879759519038, "eval_f1_SAT": 1.0, "eval_f1_WANT_DIFFERENT": 0.940809968847352, "eval_f1_WRONG_ANSWER": 0.9464459591041869, "eval_f1_macro": 0.9703109759758607, "eval_f1_weighted": 0.9801874251738407, "eval_loss": 0.07702852040529251, "eval_runtime": 4.8634, "eval_samples_per_second": 613.763, "eval_steps_per_second": 19.328, "step": 3500 }, { "epoch": 3.2171581769436997, "grad_norm": 11.94687557220459, "learning_rate": 1.1892750744786495e-05, "loss": 0.0414, "step": 3600 }, { "epoch": 3.3065236818588026, "grad_norm": 0.9737893342971802, "learning_rate": 1.129692154915591e-05, "loss": 0.0396, "step": 3700 }, { "epoch": 3.395889186773905, "grad_norm": 2.069952964782715, "learning_rate": 1.0701092353525323e-05, "loss": 0.0575, "step": 3800 }, { "epoch": 3.485254691689008, "grad_norm": 4.099809169769287, "learning_rate": 1.0105263157894738e-05, "loss": 0.0466, "step": 3900 }, { "epoch": 3.5746201966041107, "grad_norm": 3.0518603324890137, "learning_rate": 9.50943396226415e-06, "loss": 0.0534, "step": 4000 }, { "epoch": 3.5746201966041107, "eval_accuracy": 0.9839195979899498, "eval_f1_NEED_CLARIFICATION": 0.996, "eval_f1_SAT": 1.0, "eval_f1_WANT_DIFFERENT": 0.9512195121951219, "eval_f1_WRONG_ANSWER": 0.9561752988047809, "eval_f1_macro": 0.9758487027499757, "eval_f1_weighted": 0.9838829533929485, "eval_loss": 0.06795033067464828, "eval_runtime": 4.9963, "eval_samples_per_second": 597.44, "eval_steps_per_second": 18.814, "step": 4000 }, { "epoch": 3.6639857015192137, "grad_norm": 0.4241458475589752, "learning_rate": 8.913604766633564e-06, "loss": 0.058, "step": 4100 }, { "epoch": 3.753351206434316, "grad_norm": 0.6920946836471558, "learning_rate": 8.31777557100298e-06, "loss": 0.0426, "step": 4200 }, { "epoch": 3.842716711349419, "grad_norm": 1.3809353113174438, "learning_rate": 7.721946375372394e-06, "loss": 0.0344, "step": 4300 }, { "epoch": 3.932082216264522, "grad_norm": 8.121597290039062, "learning_rate": 7.126117179741808e-06, "loss": 0.0524, "step": 4400 }, { "epoch": 4.021447721179625, "grad_norm": 14.424481391906738, "learning_rate": 6.530287984111222e-06, "loss": 0.0166, "step": 4500 }, { "epoch": 4.021447721179625, "eval_accuracy": 0.9825795644891122, "eval_f1_NEED_CLARIFICATION": 0.9959919839679359, "eval_f1_SAT": 1.0, "eval_f1_WANT_DIFFERENT": 0.947906026557712, "eval_f1_WRONG_ANSWER": 0.9515331355093967, "eval_f1_macro": 0.9738577865087612, "eval_f1_weighted": 0.9825543419515753, "eval_loss": 0.0710817500948906, "eval_runtime": 4.9399, "eval_samples_per_second": 604.261, "eval_steps_per_second": 19.029, "step": 4500 }, { "epoch": 4.110813226094727, "grad_norm": 1.4233607053756714, "learning_rate": 5.934458788480636e-06, "loss": 0.0212, "step": 4600 }, { "epoch": 4.200178731009831, "grad_norm": 0.012283151037991047, "learning_rate": 5.33862959285005e-06, "loss": 0.0275, "step": 4700 }, { "epoch": 4.289544235924933, "grad_norm": 0.15345770120620728, "learning_rate": 4.742800397219464e-06, "loss": 0.0365, "step": 4800 }, { "epoch": 4.378909740840036, "grad_norm": 3.415753126144409, "learning_rate": 4.146971201588878e-06, "loss": 0.0224, "step": 4900 }, { "epoch": 4.468275245755138, "grad_norm": 0.09987159073352814, "learning_rate": 3.551142005958292e-06, "loss": 0.0219, "step": 5000 }, { "epoch": 4.468275245755138, "eval_accuracy": 0.9845896147403685, "eval_f1_NEED_CLARIFICATION": 0.996996996996997, "eval_f1_SAT": 1.0, "eval_f1_WANT_DIFFERENT": 0.9535353535353536, "eval_f1_WRONG_ANSWER": 0.9569569569569569, "eval_f1_macro": 0.9768723268723268, "eval_f1_weighted": 0.9845660553198242, "eval_loss": 0.06945836544036865, "eval_runtime": 4.8765, "eval_samples_per_second": 612.114, "eval_steps_per_second": 19.276, "step": 5000 } ], "logging_steps": 100, "max_steps": 5595, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 500, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 3, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 0 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2.766592691483443e+16, "train_batch_size": 16, "trial_name": null, "trial_params": null }