Instructions to use C3DS/FLICC-Qwen3.5-9B-lora with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use C3DS/FLICC-Qwen3.5-9B-lora with Transformers:
# pip install -U transformers accelerate # Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("C3DS/FLICC-Qwen3.5-9B-lora", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- Unsloth Desktop
Download last-checkpoint/trainer_state.json from C3DS/FLICC-Qwen3.5-9B-lora: direct link, hf CLI and curl.
- Browser
- Download file 28.7 kB
-
https://huggingface.co/C3DS/FLICC-Qwen3.5-9B-lora/resolve/main/last-checkpoint/trainer_state.json
- Command line
-
hf download hf://C3DS/FLICC-Qwen3.5-9B-lora/last-checkpoint/trainer_state.json
-
curl -L -o trainer_state.json https://huggingface.co/C3DS/FLICC-Qwen3.5-9B-lora/resolve/main/last-checkpoint/trainer_state.json
28.7 kB
| { | |
| "best_global_step": 550, | |
| "best_metric": 0.14384840428829193, | |
| "best_model_checkpoint": "FLICC-Qwen3.5-9B/checkpoint-550", | |
| "epoch": 3.0, | |
| "eval_steps": 25, | |
| "global_step": 606, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.024783147459727387, | |
| "grad_norm": 1.2578336000442505, | |
| "learning_rate": 8e-05, | |
| "loss": 2.1545221328735353, | |
| "step": 5 | |
| }, | |
| { | |
| "epoch": 0.04956629491945477, | |
| "grad_norm": 0.38908010721206665, | |
| "learning_rate": 0.00018, | |
| "loss": 1.7079069137573242, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.07434944237918216, | |
| "grad_norm": 0.7322022914886475, | |
| "learning_rate": 0.0001999777729859618, | |
| "loss": 1.16412296295166, | |
| "step": 15 | |
| }, | |
| { | |
| "epoch": 0.09913258983890955, | |
| "grad_norm": 0.47556403279304504, | |
| "learning_rate": 0.0001998874926755492, | |
| "loss": 0.521942138671875, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.12391573729863693, | |
| "grad_norm": 0.25855234265327454, | |
| "learning_rate": 0.00019972783253900808, | |
| "loss": 0.22866697311401368, | |
| "step": 25 | |
| }, | |
| { | |
| "epoch": 0.12391573729863693, | |
| "eval_loss": 0.20142747461795807, | |
| "eval_runtime": 31.7965, | |
| "eval_samples_per_second": 5.567, | |
| "eval_steps_per_second": 1.415, | |
| "step": 25 | |
| }, | |
| { | |
| "epoch": 0.14869888475836432, | |
| "grad_norm": 0.11888384819030762, | |
| "learning_rate": 0.00019949890347303046, | |
| "loss": 0.20155599117279052, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.1734820322180917, | |
| "grad_norm": 0.10729903727769852, | |
| "learning_rate": 0.0001992008644871016, | |
| "loss": 0.18807698488235475, | |
| "step": 35 | |
| }, | |
| { | |
| "epoch": 0.1982651796778191, | |
| "grad_norm": 0.09704501926898956, | |
| "learning_rate": 0.0001988339225930552, | |
| "loss": 0.20087261199951173, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.22304832713754646, | |
| "grad_norm": 0.0895816907286644, | |
| "learning_rate": 0.00019839833266128724, | |
| "loss": 0.17901148796081542, | |
| "step": 45 | |
| }, | |
| { | |
| "epoch": 0.24783147459727387, | |
| "grad_norm": 0.0991889014840126, | |
| "learning_rate": 0.00019789439724372806, | |
| "loss": 0.18655662536621093, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.24783147459727387, | |
| "eval_loss": 0.16927684843540192, | |
| "eval_runtime": 20.0824, | |
| "eval_samples_per_second": 8.814, | |
| "eval_steps_per_second": 2.241, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.27261462205700127, | |
| "grad_norm": 0.08669876307249069, | |
| "learning_rate": 0.00019732246636369605, | |
| "loss": 0.15882112979888915, | |
| "step": 55 | |
| }, | |
| { | |
| "epoch": 0.29739776951672864, | |
| "grad_norm": 0.08936048299074173, | |
| "learning_rate": 0.00019668293727277846, | |
| "loss": 0.17748851776123048, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.322180916976456, | |
| "grad_norm": 0.08769766986370087, | |
| "learning_rate": 0.0001959762541749086, | |
| "loss": 0.15775216817855836, | |
| "step": 65 | |
| }, | |
| { | |
| "epoch": 0.3469640644361834, | |
| "grad_norm": 0.08859147131443024, | |
| "learning_rate": 0.0001952029079178307, | |
| "loss": 0.1502579927444458, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.37174721189591076, | |
| "grad_norm": 0.08570419251918793, | |
| "learning_rate": 0.00019436343565216711, | |
| "loss": 0.1632941722869873, | |
| "step": 75 | |
| }, | |
| { | |
| "epoch": 0.37174721189591076, | |
| "eval_loss": 0.16099171340465546, | |
| "eval_runtime": 20.0803, | |
| "eval_samples_per_second": 8.815, | |
| "eval_steps_per_second": 2.241, | |
| "step": 75 | |
| }, | |
| { | |
| "epoch": 0.3965303593556382, | |
| "grad_norm": 0.08874429017305374, | |
| "learning_rate": 0.00019345842045832428, | |
| "loss": 0.16088367700576783, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.42131350681536556, | |
| "grad_norm": 0.08653293550014496, | |
| "learning_rate": 0.000192488490941497, | |
| "loss": 0.17103042602539062, | |
| "step": 85 | |
| }, | |
| { | |
| "epoch": 0.44609665427509293, | |
| "grad_norm": 0.08580342680215836, | |
| "learning_rate": 0.00019145432079505206, | |
| "loss": 0.16303534507751466, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.4708798017348203, | |
| "grad_norm": 0.0754188671708107, | |
| "learning_rate": 0.00019035662833259432, | |
| "loss": 0.15218052864074708, | |
| "step": 95 | |
| }, | |
| { | |
| "epoch": 0.49566294919454773, | |
| "grad_norm": 0.08795224130153656, | |
| "learning_rate": 0.0001891961759890408, | |
| "loss": 0.1582047462463379, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.49566294919454773, | |
| "eval_loss": 0.15668612718582153, | |
| "eval_runtime": 20.0959, | |
| "eval_samples_per_second": 8.808, | |
| "eval_steps_per_second": 2.239, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.5204460966542751, | |
| "grad_norm": 0.09747637063264847, | |
| "learning_rate": 0.00018797376979104872, | |
| "loss": 0.16718448400497438, | |
| "step": 105 | |
| }, | |
| { | |
| "epoch": 0.5452292441140025, | |
| "grad_norm": 0.08587726950645447, | |
| "learning_rate": 0.00018669025879716595, | |
| "loss": 0.1570422887802124, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 0.5700123915737298, | |
| "grad_norm": 0.09190164506435394, | |
| "learning_rate": 0.00018534653450809197, | |
| "loss": 0.16039479970932008, | |
| "step": 115 | |
| }, | |
| { | |
| "epoch": 0.5947955390334573, | |
| "grad_norm": 0.07859804481267929, | |
| "learning_rate": 0.00018394353024745965, | |
| "loss": 0.15238577127456665, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 0.6195786864931846, | |
| "grad_norm": 0.08068633079528809, | |
| "learning_rate": 0.00018248222051356754, | |
| "loss": 0.1629793167114258, | |
| "step": 125 | |
| }, | |
| { | |
| "epoch": 0.6195786864931846, | |
| "eval_loss": 0.15419375896453857, | |
| "eval_runtime": 20.0972, | |
| "eval_samples_per_second": 8.807, | |
| "eval_steps_per_second": 2.239, | |
| "step": 125 | |
| }, | |
| { | |
| "epoch": 0.644361833952912, | |
| "grad_norm": 0.08668871223926544, | |
| "learning_rate": 0.00018096362030251313, | |
| "loss": 0.15735886096954346, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 0.6691449814126395, | |
| "grad_norm": 0.08392980694770813, | |
| "learning_rate": 0.0001793887844031972, | |
| "loss": 0.14937043190002441, | |
| "step": 135 | |
| }, | |
| { | |
| "epoch": 0.6939281288723668, | |
| "grad_norm": 0.08616995811462402, | |
| "learning_rate": 0.0001777588066646889, | |
| "loss": 0.14931262731552125, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 0.7187112763320942, | |
| "grad_norm": 0.07857120037078857, | |
| "learning_rate": 0.00017607481923646016, | |
| "loss": 0.16323717832565307, | |
| "step": 145 | |
| }, | |
| { | |
| "epoch": 0.7434944237918215, | |
| "grad_norm": 0.08874683827161789, | |
| "learning_rate": 0.00017433799178201786, | |
| "loss": 0.16156336069107055, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.7434944237918215, | |
| "eval_loss": 0.15226973593235016, | |
| "eval_runtime": 20.0835, | |
| "eval_samples_per_second": 8.813, | |
| "eval_steps_per_second": 2.241, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.7682775712515489, | |
| "grad_norm": 0.08852466195821762, | |
| "learning_rate": 0.00017254953066647913, | |
| "loss": 0.15643792152404784, | |
| "step": 155 | |
| }, | |
| { | |
| "epoch": 0.7930607187112764, | |
| "grad_norm": 0.08484289050102234, | |
| "learning_rate": 0.00017071067811865476, | |
| "loss": 0.15839605331420897, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 0.8178438661710037, | |
| "grad_norm": 0.08800984919071198, | |
| "learning_rate": 0.00016882271136822206, | |
| "loss": 0.1647958755493164, | |
| "step": 165 | |
| }, | |
| { | |
| "epoch": 0.8426270136307311, | |
| "grad_norm": 0.08345294743776321, | |
| "learning_rate": 0.0001668869417585873, | |
| "loss": 0.1509941339492798, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 0.8674101610904585, | |
| "grad_norm": 0.07677271962165833, | |
| "learning_rate": 0.00016490471383605288, | |
| "loss": 0.1612541437149048, | |
| "step": 175 | |
| }, | |
| { | |
| "epoch": 0.8674101610904585, | |
| "eval_loss": 0.15066702663898468, | |
| "eval_runtime": 20.0686, | |
| "eval_samples_per_second": 8.82, | |
| "eval_steps_per_second": 2.242, | |
| "step": 175 | |
| }, | |
| { | |
| "epoch": 0.8921933085501859, | |
| "grad_norm": 0.08086061477661133, | |
| "learning_rate": 0.000162877404415923, | |
| "loss": 0.1522205352783203, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 0.9169764560099133, | |
| "grad_norm": 0.082602858543396, | |
| "learning_rate": 0.00016080642162619565, | |
| "loss": 0.15029544830322267, | |
| "step": 185 | |
| }, | |
| { | |
| "epoch": 0.9417596034696406, | |
| "grad_norm": 0.07821306586265564, | |
| "learning_rate": 0.00015869320392950526, | |
| "loss": 0.14748865365982056, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 0.966542750929368, | |
| "grad_norm": 0.08585070073604584, | |
| "learning_rate": 0.00015653921912399589, | |
| "loss": 0.14947665929794313, | |
| "step": 195 | |
| }, | |
| { | |
| "epoch": 0.9913258983890955, | |
| "grad_norm": 0.08411425352096558, | |
| "learning_rate": 0.00015434596332381852, | |
| "loss": 0.15700777769088745, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.9913258983890955, | |
| "eval_loss": 0.1492398977279663, | |
| "eval_runtime": 20.0816, | |
| "eval_samples_per_second": 8.814, | |
| "eval_steps_per_second": 2.241, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 1.0148698884758365, | |
| "grad_norm": 0.07653596252202988, | |
| "learning_rate": 0.00015211495991996027, | |
| "loss": 0.16517894268035888, | |
| "step": 205 | |
| }, | |
| { | |
| "epoch": 1.0396530359355638, | |
| "grad_norm": 0.07493323087692261, | |
| "learning_rate": 0.00014984775852212807, | |
| "loss": 0.14664943218231202, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 1.0644361833952911, | |
| "grad_norm": 0.07914339751005173, | |
| "learning_rate": 0.00014754593388242117, | |
| "loss": 0.14977338314056396, | |
| "step": 215 | |
| }, | |
| { | |
| "epoch": 1.0892193308550187, | |
| "grad_norm": 0.09382504969835281, | |
| "learning_rate": 0.00014521108480154032, | |
| "loss": 0.14892799854278566, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 1.114002478314746, | |
| "grad_norm": 0.08522579073905945, | |
| "learning_rate": 0.0001428448330182931, | |
| "loss": 0.13943066596984863, | |
| "step": 225 | |
| }, | |
| { | |
| "epoch": 1.114002478314746, | |
| "eval_loss": 0.1489669382572174, | |
| "eval_runtime": 20.0756, | |
| "eval_samples_per_second": 8.817, | |
| "eval_steps_per_second": 2.242, | |
| "step": 225 | |
| }, | |
| { | |
| "epoch": 1.1387856257744733, | |
| "grad_norm": 0.10055539757013321, | |
| "learning_rate": 0.00014044882208316713, | |
| "loss": 0.15772825479507446, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 1.1635687732342008, | |
| "grad_norm": 0.08639902621507645, | |
| "learning_rate": 0.00013802471621675338, | |
| "loss": 0.13583142757415773, | |
| "step": 235 | |
| }, | |
| { | |
| "epoch": 1.1883519206939281, | |
| "grad_norm": 0.0846349224448204, | |
| "learning_rate": 0.000135574199153812, | |
| "loss": 0.13156899213790893, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 1.2131350681536555, | |
| "grad_norm": 0.08887381851673126, | |
| "learning_rate": 0.00013309897297378455, | |
| "loss": 0.14310439825057983, | |
| "step": 245 | |
| }, | |
| { | |
| "epoch": 1.2379182156133828, | |
| "grad_norm": 0.08967562019824982, | |
| "learning_rate": 0.00013060075691856407, | |
| "loss": 0.15425143241882325, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 1.2379182156133828, | |
| "eval_loss": 0.14815586805343628, | |
| "eval_runtime": 20.0845, | |
| "eval_samples_per_second": 8.813, | |
| "eval_steps_per_second": 2.241, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 1.2627013630731103, | |
| "grad_norm": 0.08670926094055176, | |
| "learning_rate": 0.00012808128619834461, | |
| "loss": 0.14042346477508544, | |
| "step": 255 | |
| }, | |
| { | |
| "epoch": 1.2874845105328376, | |
| "grad_norm": 0.08620833605527878, | |
| "learning_rate": 0.00012554231078637927, | |
| "loss": 0.13709003925323487, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 1.3122676579925652, | |
| "grad_norm": 0.09469753503799438, | |
| "learning_rate": 0.00012298559420348437, | |
| "loss": 0.14326269626617433, | |
| "step": 265 | |
| }, | |
| { | |
| "epoch": 1.3370508054522925, | |
| "grad_norm": 0.08458584547042847, | |
| "learning_rate": 0.00012041291229313372, | |
| "loss": 0.14271541833877563, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 1.3618339529120198, | |
| "grad_norm": 0.0880797877907753, | |
| "learning_rate": 0.0001178260519879937, | |
| "loss": 0.14334834814071656, | |
| "step": 275 | |
| }, | |
| { | |
| "epoch": 1.3618339529120198, | |
| "eval_loss": 0.14733587205410004, | |
| "eval_runtime": 20.0759, | |
| "eval_samples_per_second": 8.817, | |
| "eval_steps_per_second": 2.241, | |
| "step": 275 | |
| }, | |
| { | |
| "epoch": 1.3866171003717471, | |
| "grad_norm": 0.09421440213918686, | |
| "learning_rate": 0.00011522681006875613, | |
| "loss": 0.15932092666625977, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 1.4114002478314747, | |
| "grad_norm": 0.08234652131795883, | |
| "learning_rate": 0.00011261699191613066, | |
| "loss": 0.14943004846572877, | |
| "step": 285 | |
| }, | |
| { | |
| "epoch": 1.436183395291202, | |
| "grad_norm": 0.08222948759794235, | |
| "learning_rate": 0.0001099984102568643, | |
| "loss": 0.12942731380462646, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 1.4609665427509293, | |
| "grad_norm": 0.09792573750019073, | |
| "learning_rate": 0.00010737288390465792, | |
| "loss": 0.14982467889785767, | |
| "step": 295 | |
| }, | |
| { | |
| "epoch": 1.4857496902106568, | |
| "grad_norm": 0.09035824984312057, | |
| "learning_rate": 0.00010474223649685517, | |
| "loss": 0.1518421769142151, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 1.4857496902106568, | |
| "eval_loss": 0.14639338850975037, | |
| "eval_runtime": 20.0833, | |
| "eval_samples_per_second": 8.813, | |
| "eval_steps_per_second": 2.241, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 1.5105328376703842, | |
| "grad_norm": 0.0854591578245163, | |
| "learning_rate": 0.00010210829522778111, | |
| "loss": 0.1377027750015259, | |
| "step": 305 | |
| }, | |
| { | |
| "epoch": 1.5353159851301115, | |
| "grad_norm": 0.10446186363697052, | |
| "learning_rate": 9.947288957961e-05, | |
| "loss": 0.14845360517501832, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 1.5600991325898388, | |
| "grad_norm": 0.09128095954656601, | |
| "learning_rate": 9.683785005164411e-05, | |
| "loss": 0.14711700677871703, | |
| "step": 315 | |
| }, | |
| { | |
| "epoch": 1.5848822800495663, | |
| "grad_norm": 0.09243518859148026, | |
| "learning_rate": 9.420500688888609e-05, | |
| "loss": 0.13097442388534547, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 1.6096654275092936, | |
| "grad_norm": 0.0917942151427269, | |
| "learning_rate": 9.157618881078772e-05, | |
| "loss": 0.14905989170074463, | |
| "step": 325 | |
| }, | |
| { | |
| "epoch": 1.6096654275092936, | |
| "eval_loss": 0.14630599319934845, | |
| "eval_runtime": 20.0838, | |
| "eval_samples_per_second": 8.813, | |
| "eval_steps_per_second": 2.241, | |
| "step": 325 | |
| }, | |
| { | |
| "epoch": 1.6344485749690212, | |
| "grad_norm": 0.09442687779664993, | |
| "learning_rate": 8.895322174105881e-05, | |
| "loss": 0.13518500328063965, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 1.6592317224287485, | |
| "grad_norm": 0.09125228226184845, | |
| "learning_rate": 8.633792753941733e-05, | |
| "loss": 0.14012304544448853, | |
| "step": 335 | |
| }, | |
| { | |
| "epoch": 1.6840148698884758, | |
| "grad_norm": 0.0936419740319252, | |
| "learning_rate": 8.373212273616282e-05, | |
| "loss": 0.14055389165878296, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 1.7087980173482031, | |
| "grad_norm": 0.08522295951843262, | |
| "learning_rate": 8.113761727045105e-05, | |
| "loss": 0.14256774187088012, | |
| "step": 345 | |
| }, | |
| { | |
| "epoch": 1.7335811648079305, | |
| "grad_norm": 0.09176695346832275, | |
| "learning_rate": 7.855621323314736e-05, | |
| "loss": 0.13572851419448853, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 1.7335811648079305, | |
| "eval_loss": 0.1453624814748764, | |
| "eval_runtime": 20.065, | |
| "eval_samples_per_second": 8.821, | |
| "eval_steps_per_second": 2.243, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 1.758364312267658, | |
| "grad_norm": 0.09987305104732513, | |
| "learning_rate": 7.598970361513051e-05, | |
| "loss": 0.14147673845291137, | |
| "step": 355 | |
| }, | |
| { | |
| "epoch": 1.7831474597273855, | |
| "grad_norm": 0.09593646973371506, | |
| "learning_rate": 7.343987106191785e-05, | |
| "loss": 0.14583654403686525, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 1.8079306071871128, | |
| "grad_norm": 0.08658026158809662, | |
| "learning_rate": 7.090848663547574e-05, | |
| "loss": 0.1391659379005432, | |
| "step": 365 | |
| }, | |
| { | |
| "epoch": 1.8327137546468402, | |
| "grad_norm": 0.08900578320026398, | |
| "learning_rate": 6.839730858407603e-05, | |
| "loss": 0.1330711841583252, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 1.8574969021065675, | |
| "grad_norm": 0.0947270616889, | |
| "learning_rate": 6.590808112105232e-05, | |
| "loss": 0.14469583034515382, | |
| "step": 375 | |
| }, | |
| { | |
| "epoch": 1.8574969021065675, | |
| "eval_loss": 0.1443570852279663, | |
| "eval_runtime": 20.0669, | |
| "eval_samples_per_second": 8.82, | |
| "eval_steps_per_second": 2.242, | |
| "step": 375 | |
| }, | |
| { | |
| "epoch": 1.8822800495662948, | |
| "grad_norm": 0.0893881618976593, | |
| "learning_rate": 6.344253321330476e-05, | |
| "loss": 0.13211302757263182, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 1.9070631970260223, | |
| "grad_norm": 0.09638750553131104, | |
| "learning_rate": 6.100237738039484e-05, | |
| "loss": 0.14780888557434083, | |
| "step": 385 | |
| }, | |
| { | |
| "epoch": 1.9318463444857497, | |
| "grad_norm": 0.09466356039047241, | |
| "learning_rate": 5.858930850506388e-05, | |
| "loss": 0.1425341010093689, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 1.9566294919454772, | |
| "grad_norm": 0.09821353852748871, | |
| "learning_rate": 5.620500265600206e-05, | |
| "loss": 0.14998058080673218, | |
| "step": 395 | |
| }, | |
| { | |
| "epoch": 1.9814126394052045, | |
| "grad_norm": 0.09322469681501389, | |
| "learning_rate": 5.385111592368486e-05, | |
| "loss": 0.14387768507003784, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 1.9814126394052045, | |
| "eval_loss": 0.1438552290201187, | |
| "eval_runtime": 20.1578, | |
| "eval_samples_per_second": 8.781, | |
| "eval_steps_per_second": 2.232, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 2.0049566294919456, | |
| "grad_norm": 0.09768665581941605, | |
| "learning_rate": 5.152928327008635e-05, | |
| "loss": 0.15004920959472656, | |
| "step": 405 | |
| }, | |
| { | |
| "epoch": 2.029739776951673, | |
| "grad_norm": 0.09443743526935577, | |
| "learning_rate": 4.924111739306788e-05, | |
| "loss": 0.13336663246154784, | |
| "step": 410 | |
| }, | |
| { | |
| "epoch": 2.0545229244114003, | |
| "grad_norm": 0.09068778902292252, | |
| "learning_rate": 4.698820760623064e-05, | |
| "loss": 0.13002735376358032, | |
| "step": 415 | |
| }, | |
| { | |
| "epoch": 2.0793060718711276, | |
| "grad_norm": 0.09333285689353943, | |
| "learning_rate": 4.477211873501085e-05, | |
| "loss": 0.12572606801986694, | |
| "step": 420 | |
| }, | |
| { | |
| "epoch": 2.104089219330855, | |
| "grad_norm": 0.09789580851793289, | |
| "learning_rate": 4.2594390029783534e-05, | |
| "loss": 0.13599283695220948, | |
| "step": 425 | |
| }, | |
| { | |
| "epoch": 2.104089219330855, | |
| "eval_loss": 0.14471149444580078, | |
| "eval_runtime": 20.1059, | |
| "eval_samples_per_second": 8.803, | |
| "eval_steps_per_second": 2.238, | |
| "step": 425 | |
| }, | |
| { | |
| "epoch": 2.1288723667905822, | |
| "grad_norm": 0.1010223925113678, | |
| "learning_rate": 4.045653409673078e-05, | |
| "loss": 0.12323858737945556, | |
| "step": 430 | |
| }, | |
| { | |
| "epoch": 2.15365551425031, | |
| "grad_norm": 0.10947588086128235, | |
| "learning_rate": 3.836003584721577e-05, | |
| "loss": 0.13344532251358032, | |
| "step": 435 | |
| }, | |
| { | |
| "epoch": 2.1784386617100373, | |
| "grad_norm": 0.10182736814022064, | |
| "learning_rate": 3.630635146639384e-05, | |
| "loss": 0.12730480432510377, | |
| "step": 440 | |
| }, | |
| { | |
| "epoch": 2.2032218091697646, | |
| "grad_norm": 0.10020897537469864, | |
| "learning_rate": 3.429690740177549e-05, | |
| "loss": 0.11858847141265869, | |
| "step": 445 | |
| }, | |
| { | |
| "epoch": 2.228004956629492, | |
| "grad_norm": 0.10753881931304932, | |
| "learning_rate": 3.233309937244513e-05, | |
| "loss": 0.11974374055862427, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 2.228004956629492, | |
| "eval_loss": 0.14466847479343414, | |
| "eval_runtime": 20.1014, | |
| "eval_samples_per_second": 8.805, | |
| "eval_steps_per_second": 2.239, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 2.2527881040892193, | |
| "grad_norm": 0.09645484387874603, | |
| "learning_rate": 3.041629139962283e-05, | |
| "loss": 0.12982945442199706, | |
| "step": 455 | |
| }, | |
| { | |
| "epoch": 2.2775712515489466, | |
| "grad_norm": 0.10199300944805145, | |
| "learning_rate": 2.8547814859242727e-05, | |
| "loss": 0.13981986045837402, | |
| "step": 460 | |
| }, | |
| { | |
| "epoch": 2.3023543990086743, | |
| "grad_norm": 0.10710015147924423, | |
| "learning_rate": 2.672896755720654e-05, | |
| "loss": 0.14547840356826783, | |
| "step": 465 | |
| }, | |
| { | |
| "epoch": 2.3271375464684017, | |
| "grad_norm": 0.09909404069185257, | |
| "learning_rate": 2.496101282795369e-05, | |
| "loss": 0.12706974744796753, | |
| "step": 470 | |
| }, | |
| { | |
| "epoch": 2.351920693928129, | |
| "grad_norm": 0.10963651537895203, | |
| "learning_rate": 2.324517865697501e-05, | |
| "loss": 0.14960445165634156, | |
| "step": 475 | |
| }, | |
| { | |
| "epoch": 2.351920693928129, | |
| "eval_loss": 0.14430110156536102, | |
| "eval_runtime": 20.1279, | |
| "eval_samples_per_second": 8.794, | |
| "eval_steps_per_second": 2.236, | |
| "step": 475 | |
| }, | |
| { | |
| "epoch": 2.3767038413878563, | |
| "grad_norm": 0.10664132982492447, | |
| "learning_rate": 2.1582656827878844e-05, | |
| "loss": 0.12047649621963501, | |
| "step": 480 | |
| }, | |
| { | |
| "epoch": 2.4014869888475836, | |
| "grad_norm": 0.10346455127000809, | |
| "learning_rate": 1.99746020946023e-05, | |
| "loss": 0.12301702499389648, | |
| "step": 485 | |
| }, | |
| { | |
| "epoch": 2.426270136307311, | |
| "grad_norm": 0.10490775853395462, | |
| "learning_rate": 1.8422131379342668e-05, | |
| "loss": 0.13336237668991088, | |
| "step": 490 | |
| }, | |
| { | |
| "epoch": 2.4510532837670382, | |
| "grad_norm": 0.11114446818828583, | |
| "learning_rate": 1.6926322996765897e-05, | |
| "loss": 0.1356014370918274, | |
| "step": 495 | |
| }, | |
| { | |
| "epoch": 2.4758364312267656, | |
| "grad_norm": 0.10340475291013718, | |
| "learning_rate": 1.5488215905031034e-05, | |
| "loss": 0.12613558769226074, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 2.4758364312267656, | |
| "eval_loss": 0.14409051835536957, | |
| "eval_runtime": 20.1071, | |
| "eval_samples_per_second": 8.803, | |
| "eval_steps_per_second": 2.238, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 2.5006195786864933, | |
| "grad_norm": 0.10658421367406845, | |
| "learning_rate": 1.4108808984151023e-05, | |
| "loss": 0.14121589660644532, | |
| "step": 505 | |
| }, | |
| { | |
| "epoch": 2.5254027261462206, | |
| "grad_norm": 0.11168505251407623, | |
| "learning_rate": 1.278906034219094e-05, | |
| "loss": 0.12991907596588134, | |
| "step": 510 | |
| }, | |
| { | |
| "epoch": 2.550185873605948, | |
| "grad_norm": 0.11109943687915802, | |
| "learning_rate": 1.152988664978556e-05, | |
| "loss": 0.14196932315826416, | |
| "step": 515 | |
| }, | |
| { | |
| "epoch": 2.5749690210656753, | |
| "grad_norm": 0.11461146175861359, | |
| "learning_rate": 1.0332162503438381e-05, | |
| "loss": 0.1336436986923218, | |
| "step": 520 | |
| }, | |
| { | |
| "epoch": 2.5997521685254026, | |
| "grad_norm": 0.1116466075181961, | |
| "learning_rate": 9.196719818044886e-06, | |
| "loss": 0.13213711977005005, | |
| "step": 525 | |
| }, | |
| { | |
| "epoch": 2.5997521685254026, | |
| "eval_loss": 0.14412295818328857, | |
| "eval_runtime": 20.1059, | |
| "eval_samples_per_second": 8.803, | |
| "eval_steps_per_second": 2.238, | |
| "step": 525 | |
| }, | |
| { | |
| "epoch": 2.6245353159851303, | |
| "grad_norm": 0.10819047689437866, | |
| "learning_rate": 8.124347249061115e-06, | |
| "loss": 0.1222877025604248, | |
| "step": 530 | |
| }, | |
| { | |
| "epoch": 2.6493184634448577, | |
| "grad_norm": 0.109853096306324, | |
| "learning_rate": 7.115789644719728e-06, | |
| "loss": 0.12941099405288697, | |
| "step": 535 | |
| }, | |
| { | |
| "epoch": 2.674101610904585, | |
| "grad_norm": 0.11083053052425385, | |
| "learning_rate": 6.1717475286734e-06, | |
| "loss": 0.11817164421081543, | |
| "step": 540 | |
| }, | |
| { | |
| "epoch": 2.6988847583643123, | |
| "grad_norm": 0.11062867194414139, | |
| "learning_rate": 5.2928766134254345e-06, | |
| "loss": 0.1254756212234497, | |
| "step": 545 | |
| }, | |
| { | |
| "epoch": 2.7236679058240396, | |
| "grad_norm": 0.11206871271133423, | |
| "learning_rate": 4.479787344885078e-06, | |
| "loss": 0.12366704940795899, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 2.7236679058240396, | |
| "eval_loss": 0.14384840428829193, | |
| "eval_runtime": 20.1395, | |
| "eval_samples_per_second": 8.789, | |
| "eval_steps_per_second": 2.234, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 2.748451053283767, | |
| "grad_norm": 0.11186806112527847, | |
| "learning_rate": 3.7330444783642338e-06, | |
| "loss": 0.13718799352645875, | |
| "step": 555 | |
| }, | |
| { | |
| "epoch": 2.7732342007434942, | |
| "grad_norm": 0.10549531131982803, | |
| "learning_rate": 3.053166686309783e-06, | |
| "loss": 0.13304147720336915, | |
| "step": 560 | |
| }, | |
| { | |
| "epoch": 2.7980173482032216, | |
| "grad_norm": 0.10434003919363022, | |
| "learning_rate": 2.440626198044327e-06, | |
| "loss": 0.11780736446380616, | |
| "step": 565 | |
| }, | |
| { | |
| "epoch": 2.8228004956629493, | |
| "grad_norm": 0.10914986580610275, | |
| "learning_rate": 1.895848471765227e-06, | |
| "loss": 0.12229269742965698, | |
| "step": 570 | |
| }, | |
| { | |
| "epoch": 2.8475836431226766, | |
| "grad_norm": 0.11424117535352707, | |
| "learning_rate": 1.4192118990299707e-06, | |
| "loss": 0.12974271774291993, | |
| "step": 575 | |
| }, | |
| { | |
| "epoch": 2.8475836431226766, | |
| "eval_loss": 0.1438693404197693, | |
| "eval_runtime": 20.2164, | |
| "eval_samples_per_second": 8.755, | |
| "eval_steps_per_second": 2.226, | |
| "step": 575 | |
| }, | |
| { | |
| "epoch": 2.872366790582404, | |
| "grad_norm": 0.10830768942832947, | |
| "learning_rate": 1.0110475419330967e-06, | |
| "loss": 0.12486574649810792, | |
| "step": 580 | |
| }, | |
| { | |
| "epoch": 2.8971499380421313, | |
| "grad_norm": 0.11147851496934891, | |
| "learning_rate": 6.716389031571568e-07, | |
| "loss": 0.12139828205108642, | |
| "step": 585 | |
| }, | |
| { | |
| "epoch": 2.9219330855018586, | |
| "grad_norm": 0.09997480362653732, | |
| "learning_rate": 4.0122172905753266e-07, | |
| "loss": 0.11921333074569702, | |
| "step": 590 | |
| }, | |
| { | |
| "epoch": 2.9467162329615864, | |
| "grad_norm": 0.10038603842258453, | |
| "learning_rate": 1.9998384591773944e-07, | |
| "loss": 0.12386640310287475, | |
| "step": 595 | |
| }, | |
| { | |
| "epoch": 2.9714993804213137, | |
| "grad_norm": 0.10965593159198761, | |
| "learning_rate": 6.806502948918381e-08, | |
| "loss": 0.11748340129852294, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 2.9714993804213137, | |
| "eval_loss": 0.14387772977352142, | |
| "eval_runtime": 20.189, | |
| "eval_samples_per_second": 8.767, | |
| "eval_steps_per_second": 2.229, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 2.996282527881041, | |
| "grad_norm": 0.10880747437477112, | |
| "learning_rate": 5.5569079056794206e-09, | |
| "loss": 0.13690497875213622, | |
| "step": 605 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "eval_loss": 0.14386552572250366, | |
| "eval_runtime": 20.1823, | |
| "eval_samples_per_second": 8.77, | |
| "eval_steps_per_second": 2.23, | |
| "step": 606 | |
| } | |
| ], | |
| "logging_steps": 5, | |
| "max_steps": 606, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 50, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 4.13889241360176e+17, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |