Text Classification
PEFT
Safetensors
Transformers
feedback-detection
user-satisfaction
lora
modernbert
mmbert
32k-context
Eval Results (legacy)
Instructions to use llm-semantic-router/mmbert32k-feedback-detector-lora with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use llm-semantic-router/mmbert32k-feedback-detector-lora with PEFT:
from peft import PeftModel from transformers import AutoModelForSequenceClassification base_model = AutoModelForSequenceClassification.from_pretrained("llm-semantic-router/mmbert-32k-yarn") model = PeftModel.from_pretrained(base_model, "llm-semantic-router/mmbert32k-feedback-detector-lora") - Transformers
How to use llm-semantic-router/mmbert32k-feedback-detector-lora with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-classification", model="llm-semantic-router/mmbert32k-feedback-detector-lora")# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("llm-semantic-router/mmbert32k-feedback-detector-lora", device_map="auto") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": 5000, | |
| "best_metric": 0.9768723268723268, | |
| "best_model_checkpoint": "models/mmbert32k/feedback-detector_lora/checkpoint-5000", | |
| "epoch": 4.468275245755138, | |
| "eval_steps": 500, | |
| "global_step": 5000, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.08936550491510277, | |
| "grad_norm": 20.91827964782715, | |
| "learning_rate": 5.303571428571429e-06, | |
| "loss": 2.3772, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.17873100983020554, | |
| "grad_norm": 13.255019187927246, | |
| "learning_rate": 1.0660714285714287e-05, | |
| "loss": 1.4536, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.2680965147453083, | |
| "grad_norm": 6.325151443481445, | |
| "learning_rate": 1.601785714285714e-05, | |
| "loss": 0.7688, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.3574620196604111, | |
| "grad_norm": 14.112616539001465, | |
| "learning_rate": 2.1375e-05, | |
| "loss": 0.417, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.44682752457551383, | |
| "grad_norm": 7.2552032470703125, | |
| "learning_rate": 2.673214285714286e-05, | |
| "loss": 0.312, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.44682752457551383, | |
| "eval_accuracy": 0.9366834170854271, | |
| "eval_f1_NEED_CLARIFICATION": 0.9595141700404858, | |
| "eval_f1_SAT": 0.9993297587131368, | |
| "eval_f1_WANT_DIFFERENT": 0.8411037107516651, | |
| "eval_f1_WRONG_ANSWER": 0.8215417106652587, | |
| "eval_f1_macro": 0.9053723375426366, | |
| "eval_f1_weighted": 0.9366285248867929, | |
| "eval_loss": 0.16554784774780273, | |
| "eval_runtime": 6.6327, | |
| "eval_samples_per_second": 450.046, | |
| "eval_steps_per_second": 14.172, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.5361930294906166, | |
| "grad_norm": 12.230180740356445, | |
| "learning_rate": 2.976762661370407e-05, | |
| "loss": 0.2387, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.6255585344057194, | |
| "grad_norm": 0.957978367805481, | |
| "learning_rate": 2.9171797418073483e-05, | |
| "loss": 0.2194, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 0.7149240393208222, | |
| "grad_norm": 17.851573944091797, | |
| "learning_rate": 2.85759682224429e-05, | |
| "loss": 0.2051, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.8042895442359249, | |
| "grad_norm": 6.15651798248291, | |
| "learning_rate": 2.7980139026812316e-05, | |
| "loss": 0.1754, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 0.8936550491510277, | |
| "grad_norm": 16.395740509033203, | |
| "learning_rate": 2.738430983118173e-05, | |
| "loss": 0.1795, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.8936550491510277, | |
| "eval_accuracy": 0.9571189279731993, | |
| "eval_f1_NEED_CLARIFICATION": 0.9839034205231388, | |
| "eval_f1_SAT": 1.0, | |
| "eval_f1_WANT_DIFFERENT": 0.8676307007786429, | |
| "eval_f1_WRONG_ANSWER": 0.8894977168949771, | |
| "eval_f1_macro": 0.9352579595491897, | |
| "eval_f1_weighted": 0.9567952614479014, | |
| "eval_loss": 0.12704455852508545, | |
| "eval_runtime": 4.9266, | |
| "eval_samples_per_second": 605.9, | |
| "eval_steps_per_second": 19.08, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.9830205540661304, | |
| "grad_norm": 1.0810153484344482, | |
| "learning_rate": 2.6788480635551143e-05, | |
| "loss": 0.1464, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 1.0723860589812333, | |
| "grad_norm": 1.037031888961792, | |
| "learning_rate": 2.6192651439920558e-05, | |
| "loss": 0.0986, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 1.161751563896336, | |
| "grad_norm": 13.27597427368164, | |
| "learning_rate": 2.5596822244289973e-05, | |
| "loss": 0.1327, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 1.2511170688114388, | |
| "grad_norm": 10.263288497924805, | |
| "learning_rate": 2.5000993048659384e-05, | |
| "loss": 0.1431, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 1.3404825737265416, | |
| "grad_norm": 17.2136173248291, | |
| "learning_rate": 2.44051638530288e-05, | |
| "loss": 0.0957, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 1.3404825737265416, | |
| "eval_accuracy": 0.9768844221105528, | |
| "eval_f1_NEED_CLARIFICATION": 0.9940119760479041, | |
| "eval_f1_SAT": 0.999664767013074, | |
| "eval_f1_WANT_DIFFERENT": 0.9278996865203761, | |
| "eval_f1_WRONG_ANSWER": 0.9396887159533074, | |
| "eval_f1_macro": 0.9653162863836654, | |
| "eval_f1_weighted": 0.9767427658694287, | |
| "eval_loss": 0.07943707704544067, | |
| "eval_runtime": 4.9017, | |
| "eval_samples_per_second": 608.967, | |
| "eval_steps_per_second": 19.177, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 1.4298480786416443, | |
| "grad_norm": 2.8994057178497314, | |
| "learning_rate": 2.3809334657398214e-05, | |
| "loss": 0.0967, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 1.519213583556747, | |
| "grad_norm": 1.162245750427246, | |
| "learning_rate": 2.3213505461767625e-05, | |
| "loss": 0.1492, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 1.6085790884718498, | |
| "grad_norm": 13.979327201843262, | |
| "learning_rate": 2.261767626613704e-05, | |
| "loss": 0.1293, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 1.6979445933869526, | |
| "grad_norm": 10.116354942321777, | |
| "learning_rate": 2.2021847070506455e-05, | |
| "loss": 0.0858, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 1.7873100983020556, | |
| "grad_norm": 7.858895778656006, | |
| "learning_rate": 2.142601787487587e-05, | |
| "loss": 0.0978, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 1.7873100983020556, | |
| "eval_accuracy": 0.9752093802345059, | |
| "eval_f1_NEED_CLARIFICATION": 0.994994994994995, | |
| "eval_f1_SAT": 1.0, | |
| "eval_f1_WANT_DIFFERENT": 0.9229144667370645, | |
| "eval_f1_WRONG_ANSWER": 0.9328214971209213, | |
| "eval_f1_macro": 0.9626827397132453, | |
| "eval_f1_weighted": 0.9750968232860249, | |
| "eval_loss": 0.08431631326675415, | |
| "eval_runtime": 4.8873, | |
| "eval_samples_per_second": 610.767, | |
| "eval_steps_per_second": 19.234, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 1.876675603217158, | |
| "grad_norm": 0.5830298662185669, | |
| "learning_rate": 2.083018867924528e-05, | |
| "loss": 0.0922, | |
| "step": 2100 | |
| }, | |
| { | |
| "epoch": 1.966041108132261, | |
| "grad_norm": 0.5619744062423706, | |
| "learning_rate": 2.0234359483614696e-05, | |
| "loss": 0.1096, | |
| "step": 2200 | |
| }, | |
| { | |
| "epoch": 2.0554066130473636, | |
| "grad_norm": 0.08848729729652405, | |
| "learning_rate": 1.9638530287984115e-05, | |
| "loss": 0.0675, | |
| "step": 2300 | |
| }, | |
| { | |
| "epoch": 2.1447721179624666, | |
| "grad_norm": 0.039530836045742035, | |
| "learning_rate": 1.9042701092353526e-05, | |
| "loss": 0.0792, | |
| "step": 2400 | |
| }, | |
| { | |
| "epoch": 2.234137622877569, | |
| "grad_norm": 1.8711425065994263, | |
| "learning_rate": 1.844687189672294e-05, | |
| "loss": 0.0729, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 2.234137622877569, | |
| "eval_accuracy": 0.9785594639865997, | |
| "eval_f1_NEED_CLARIFICATION": 0.9949849548645938, | |
| "eval_f1_SAT": 1.0, | |
| "eval_f1_WANT_DIFFERENT": 0.9351464435146444, | |
| "eval_f1_WRONG_ANSWER": 0.9410628019323671, | |
| "eval_f1_macro": 0.9677985500779014, | |
| "eval_f1_weighted": 0.9785107912077653, | |
| "eval_loss": 0.08227432519197464, | |
| "eval_runtime": 4.9766, | |
| "eval_samples_per_second": 599.811, | |
| "eval_steps_per_second": 18.889, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 2.323503127792672, | |
| "grad_norm": 5.597414970397949, | |
| "learning_rate": 1.7851042701092356e-05, | |
| "loss": 0.0764, | |
| "step": 2600 | |
| }, | |
| { | |
| "epoch": 2.4128686327077746, | |
| "grad_norm": 12.755281448364258, | |
| "learning_rate": 1.7255213505461767e-05, | |
| "loss": 0.0803, | |
| "step": 2700 | |
| }, | |
| { | |
| "epoch": 2.5022341376228776, | |
| "grad_norm": 8.895140647888184, | |
| "learning_rate": 1.6659384309831182e-05, | |
| "loss": 0.0724, | |
| "step": 2800 | |
| }, | |
| { | |
| "epoch": 2.5915996425379806, | |
| "grad_norm": 1.5834654569625854, | |
| "learning_rate": 1.6063555114200597e-05, | |
| "loss": 0.0575, | |
| "step": 2900 | |
| }, | |
| { | |
| "epoch": 2.680965147453083, | |
| "grad_norm": 0.673122227191925, | |
| "learning_rate": 1.5467725918570012e-05, | |
| "loss": 0.0631, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 2.680965147453083, | |
| "eval_accuracy": 0.9825795644891122, | |
| "eval_f1_NEED_CLARIFICATION": 0.996996996996997, | |
| "eval_f1_SAT": 1.0, | |
| "eval_f1_WANT_DIFFERENT": 0.9477911646586346, | |
| "eval_f1_WRONG_ANSWER": 0.9506545820745217, | |
| "eval_f1_macro": 0.9738606859325383, | |
| "eval_f1_weighted": 0.9825562768434225, | |
| "eval_loss": 0.06965455412864685, | |
| "eval_runtime": 4.8413, | |
| "eval_samples_per_second": 616.566, | |
| "eval_steps_per_second": 19.416, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 2.7703306523681857, | |
| "grad_norm": 0.04906867444515228, | |
| "learning_rate": 1.4871896722939424e-05, | |
| "loss": 0.0582, | |
| "step": 3100 | |
| }, | |
| { | |
| "epoch": 2.8596961572832886, | |
| "grad_norm": 2.8738303184509277, | |
| "learning_rate": 1.4276067527308838e-05, | |
| "loss": 0.0716, | |
| "step": 3200 | |
| }, | |
| { | |
| "epoch": 2.9490616621983916, | |
| "grad_norm": 0.9897614121437073, | |
| "learning_rate": 1.3680238331678252e-05, | |
| "loss": 0.0701, | |
| "step": 3300 | |
| }, | |
| { | |
| "epoch": 3.038427167113494, | |
| "grad_norm": 0.36938703060150146, | |
| "learning_rate": 1.3084409136047666e-05, | |
| "loss": 0.0467, | |
| "step": 3400 | |
| }, | |
| { | |
| "epoch": 3.127792672028597, | |
| "grad_norm": 3.860152244567871, | |
| "learning_rate": 1.2488579940417081e-05, | |
| "loss": 0.0429, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 3.127792672028597, | |
| "eval_accuracy": 0.9802345058626466, | |
| "eval_f1_NEED_CLARIFICATION": 0.9939879759519038, | |
| "eval_f1_SAT": 1.0, | |
| "eval_f1_WANT_DIFFERENT": 0.940809968847352, | |
| "eval_f1_WRONG_ANSWER": 0.9464459591041869, | |
| "eval_f1_macro": 0.9703109759758607, | |
| "eval_f1_weighted": 0.9801874251738407, | |
| "eval_loss": 0.07702852040529251, | |
| "eval_runtime": 4.8634, | |
| "eval_samples_per_second": 613.763, | |
| "eval_steps_per_second": 19.328, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 3.2171581769436997, | |
| "grad_norm": 11.94687557220459, | |
| "learning_rate": 1.1892750744786495e-05, | |
| "loss": 0.0414, | |
| "step": 3600 | |
| }, | |
| { | |
| "epoch": 3.3065236818588026, | |
| "grad_norm": 0.9737893342971802, | |
| "learning_rate": 1.129692154915591e-05, | |
| "loss": 0.0396, | |
| "step": 3700 | |
| }, | |
| { | |
| "epoch": 3.395889186773905, | |
| "grad_norm": 2.069952964782715, | |
| "learning_rate": 1.0701092353525323e-05, | |
| "loss": 0.0575, | |
| "step": 3800 | |
| }, | |
| { | |
| "epoch": 3.485254691689008, | |
| "grad_norm": 4.099809169769287, | |
| "learning_rate": 1.0105263157894738e-05, | |
| "loss": 0.0466, | |
| "step": 3900 | |
| }, | |
| { | |
| "epoch": 3.5746201966041107, | |
| "grad_norm": 3.0518603324890137, | |
| "learning_rate": 9.50943396226415e-06, | |
| "loss": 0.0534, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 3.5746201966041107, | |
| "eval_accuracy": 0.9839195979899498, | |
| "eval_f1_NEED_CLARIFICATION": 0.996, | |
| "eval_f1_SAT": 1.0, | |
| "eval_f1_WANT_DIFFERENT": 0.9512195121951219, | |
| "eval_f1_WRONG_ANSWER": 0.9561752988047809, | |
| "eval_f1_macro": 0.9758487027499757, | |
| "eval_f1_weighted": 0.9838829533929485, | |
| "eval_loss": 0.06795033067464828, | |
| "eval_runtime": 4.9963, | |
| "eval_samples_per_second": 597.44, | |
| "eval_steps_per_second": 18.814, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 3.6639857015192137, | |
| "grad_norm": 0.4241458475589752, | |
| "learning_rate": 8.913604766633564e-06, | |
| "loss": 0.058, | |
| "step": 4100 | |
| }, | |
| { | |
| "epoch": 3.753351206434316, | |
| "grad_norm": 0.6920946836471558, | |
| "learning_rate": 8.31777557100298e-06, | |
| "loss": 0.0426, | |
| "step": 4200 | |
| }, | |
| { | |
| "epoch": 3.842716711349419, | |
| "grad_norm": 1.3809353113174438, | |
| "learning_rate": 7.721946375372394e-06, | |
| "loss": 0.0344, | |
| "step": 4300 | |
| }, | |
| { | |
| "epoch": 3.932082216264522, | |
| "grad_norm": 8.121597290039062, | |
| "learning_rate": 7.126117179741808e-06, | |
| "loss": 0.0524, | |
| "step": 4400 | |
| }, | |
| { | |
| "epoch": 4.021447721179625, | |
| "grad_norm": 14.424481391906738, | |
| "learning_rate": 6.530287984111222e-06, | |
| "loss": 0.0166, | |
| "step": 4500 | |
| }, | |
| { | |
| "epoch": 4.021447721179625, | |
| "eval_accuracy": 0.9825795644891122, | |
| "eval_f1_NEED_CLARIFICATION": 0.9959919839679359, | |
| "eval_f1_SAT": 1.0, | |
| "eval_f1_WANT_DIFFERENT": 0.947906026557712, | |
| "eval_f1_WRONG_ANSWER": 0.9515331355093967, | |
| "eval_f1_macro": 0.9738577865087612, | |
| "eval_f1_weighted": 0.9825543419515753, | |
| "eval_loss": 0.0710817500948906, | |
| "eval_runtime": 4.9399, | |
| "eval_samples_per_second": 604.261, | |
| "eval_steps_per_second": 19.029, | |
| "step": 4500 | |
| }, | |
| { | |
| "epoch": 4.110813226094727, | |
| "grad_norm": 1.4233607053756714, | |
| "learning_rate": 5.934458788480636e-06, | |
| "loss": 0.0212, | |
| "step": 4600 | |
| }, | |
| { | |
| "epoch": 4.200178731009831, | |
| "grad_norm": 0.012283151037991047, | |
| "learning_rate": 5.33862959285005e-06, | |
| "loss": 0.0275, | |
| "step": 4700 | |
| }, | |
| { | |
| "epoch": 4.289544235924933, | |
| "grad_norm": 0.15345770120620728, | |
| "learning_rate": 4.742800397219464e-06, | |
| "loss": 0.0365, | |
| "step": 4800 | |
| }, | |
| { | |
| "epoch": 4.378909740840036, | |
| "grad_norm": 3.415753126144409, | |
| "learning_rate": 4.146971201588878e-06, | |
| "loss": 0.0224, | |
| "step": 4900 | |
| }, | |
| { | |
| "epoch": 4.468275245755138, | |
| "grad_norm": 0.09987159073352814, | |
| "learning_rate": 3.551142005958292e-06, | |
| "loss": 0.0219, | |
| "step": 5000 | |
| }, | |
| { | |
| "epoch": 4.468275245755138, | |
| "eval_accuracy": 0.9845896147403685, | |
| "eval_f1_NEED_CLARIFICATION": 0.996996996996997, | |
| "eval_f1_SAT": 1.0, | |
| "eval_f1_WANT_DIFFERENT": 0.9535353535353536, | |
| "eval_f1_WRONG_ANSWER": 0.9569569569569569, | |
| "eval_f1_macro": 0.9768723268723268, | |
| "eval_f1_weighted": 0.9845660553198242, | |
| "eval_loss": 0.06945836544036865, | |
| "eval_runtime": 4.8765, | |
| "eval_samples_per_second": 612.114, | |
| "eval_steps_per_second": 19.276, | |
| "step": 5000 | |
| } | |
| ], | |
| "logging_steps": 100, | |
| "max_steps": 5595, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 5, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "EarlyStoppingCallback": { | |
| "args": { | |
| "early_stopping_patience": 3, | |
| "early_stopping_threshold": 0.0 | |
| }, | |
| "attributes": { | |
| "early_stopping_patience_counter": 0 | |
| } | |
| }, | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 2.766592691483443e+16, | |
| "train_batch_size": 16, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |