Instructions to use alexiaassis/Modelo-Treinado-Gemma3-12b-T5 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use alexiaassis/Modelo-Treinado-Gemma3-12b-T5 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("unsloth/gemma-3-12b-it-unsloth-bnb-4bit") model = PeftModel.from_pretrained(base_model, "alexiaassis/Modelo-Treinado-Gemma3-12b-T5") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- Unsloth Desktop
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 7.0, | |
| "eval_steps": 500, | |
| "global_step": 819, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.0861141011840689, | |
| "grad_norm": 21.438983917236328, | |
| "learning_rate": 6.749999999999999e-06, | |
| "loss": 5.3584, | |
| "num_input_tokens_seen": 106432, | |
| "step": 10, | |
| "train_runtime": 108.6693, | |
| "train_tokens_per_second": 979.412 | |
| }, | |
| { | |
| "epoch": 0.1722282023681378, | |
| "grad_norm": 8.519647598266602, | |
| "learning_rate": 1.4249999999999999e-05, | |
| "loss": 4.8538, | |
| "num_input_tokens_seen": 213216, | |
| "step": 20, | |
| "train_runtime": 186.9434, | |
| "train_tokens_per_second": 1140.538 | |
| }, | |
| { | |
| "epoch": 0.25834230355220666, | |
| "grad_norm": 18.737985610961914, | |
| "learning_rate": 2.1749999999999997e-05, | |
| "loss": 3.6236, | |
| "num_input_tokens_seen": 319264, | |
| "step": 30, | |
| "train_runtime": 265.2215, | |
| "train_tokens_per_second": 1203.763 | |
| }, | |
| { | |
| "epoch": 0.3444564047362756, | |
| "grad_norm": 4.311729431152344, | |
| "learning_rate": 2.925e-05, | |
| "loss": 2.4654, | |
| "num_input_tokens_seen": 426464, | |
| "step": 40, | |
| "train_runtime": 343.9109, | |
| "train_tokens_per_second": 1240.042 | |
| }, | |
| { | |
| "epoch": 0.43057050592034446, | |
| "grad_norm": 2.5902934074401855, | |
| "learning_rate": 3.675e-05, | |
| "loss": 2.0086, | |
| "num_input_tokens_seen": 532576, | |
| "step": 50, | |
| "train_runtime": 421.9835, | |
| "train_tokens_per_second": 1262.078 | |
| }, | |
| { | |
| "epoch": 0.5166846071044133, | |
| "grad_norm": 3.0768535137176514, | |
| "learning_rate": 4.424999999999999e-05, | |
| "loss": 1.878, | |
| "num_input_tokens_seen": 639584, | |
| "step": 60, | |
| "train_runtime": 500.5067, | |
| "train_tokens_per_second": 1277.873 | |
| }, | |
| { | |
| "epoch": 0.6027987082884823, | |
| "grad_norm": 2.4493396282196045, | |
| "learning_rate": 5.174999999999999e-05, | |
| "loss": 1.8546, | |
| "num_input_tokens_seen": 747360, | |
| "step": 70, | |
| "train_runtime": 579.1392, | |
| "train_tokens_per_second": 1290.467 | |
| }, | |
| { | |
| "epoch": 0.6889128094725512, | |
| "grad_norm": 2.146406650543213, | |
| "learning_rate": 5.925e-05, | |
| "loss": 1.8364, | |
| "num_input_tokens_seen": 854304, | |
| "step": 80, | |
| "train_runtime": 657.8931, | |
| "train_tokens_per_second": 1298.545 | |
| }, | |
| { | |
| "epoch": 0.77502691065662, | |
| "grad_norm": 2.2075250148773193, | |
| "learning_rate": 6.675e-05, | |
| "loss": 1.8027, | |
| "num_input_tokens_seen": 962816, | |
| "step": 90, | |
| "train_runtime": 737.8649, | |
| "train_tokens_per_second": 1304.868 | |
| }, | |
| { | |
| "epoch": 0.8611410118406889, | |
| "grad_norm": 0.9837085008621216, | |
| "learning_rate": 7.424999999999999e-05, | |
| "loss": 1.7782, | |
| "num_input_tokens_seen": 1070240, | |
| "step": 100, | |
| "train_runtime": 817.3738, | |
| "train_tokens_per_second": 1309.364 | |
| }, | |
| { | |
| "epoch": 0.9472551130247578, | |
| "grad_norm": 3.0224859714508057, | |
| "learning_rate": 8.175e-05, | |
| "loss": 1.7681, | |
| "num_input_tokens_seen": 1175840, | |
| "step": 110, | |
| "train_runtime": 895.639, | |
| "train_tokens_per_second": 1312.85 | |
| }, | |
| { | |
| "epoch": 1.0258342303552206, | |
| "grad_norm": 1.015479326248169, | |
| "learning_rate": 8.924999999999999e-05, | |
| "loss": 1.5944, | |
| "num_input_tokens_seen": 1273184, | |
| "step": 120, | |
| "train_runtime": 967.2081, | |
| "train_tokens_per_second": 1316.35 | |
| }, | |
| { | |
| "epoch": 1.1119483315392895, | |
| "grad_norm": 1.2177729606628418, | |
| "learning_rate": 9.675e-05, | |
| "loss": 1.7489, | |
| "num_input_tokens_seen": 1380480, | |
| "step": 130, | |
| "train_runtime": 1045.876, | |
| "train_tokens_per_second": 1319.927 | |
| }, | |
| { | |
| "epoch": 1.1980624327233584, | |
| "grad_norm": 1.6441470384597778, | |
| "learning_rate": 0.00010424999999999999, | |
| "loss": 1.7265, | |
| "num_input_tokens_seen": 1487520, | |
| "step": 140, | |
| "train_runtime": 1124.3621, | |
| "train_tokens_per_second": 1322.99 | |
| }, | |
| { | |
| "epoch": 1.2841765339074274, | |
| "grad_norm": 1.1657848358154297, | |
| "learning_rate": 0.00011174999999999999, | |
| "loss": 1.7386, | |
| "num_input_tokens_seen": 1593472, | |
| "step": 150, | |
| "train_runtime": 1202.4025, | |
| "train_tokens_per_second": 1325.24 | |
| }, | |
| { | |
| "epoch": 1.3702906350914963, | |
| "grad_norm": 1.1126108169555664, | |
| "learning_rate": 0.00011925, | |
| "loss": 1.7229, | |
| "num_input_tokens_seen": 1700288, | |
| "step": 160, | |
| "train_runtime": 1280.6844, | |
| "train_tokens_per_second": 1327.64 | |
| }, | |
| { | |
| "epoch": 1.456404736275565, | |
| "grad_norm": 1.3799711465835571, | |
| "learning_rate": 0.00012675, | |
| "loss": 1.7513, | |
| "num_input_tokens_seen": 1807488, | |
| "step": 170, | |
| "train_runtime": 1359.2569, | |
| "train_tokens_per_second": 1329.762 | |
| }, | |
| { | |
| "epoch": 1.542518837459634, | |
| "grad_norm": 1.2127066850662231, | |
| "learning_rate": 0.00013424999999999998, | |
| "loss": 1.7105, | |
| "num_input_tokens_seen": 1914272, | |
| "step": 180, | |
| "train_runtime": 1437.7985, | |
| "train_tokens_per_second": 1331.391 | |
| }, | |
| { | |
| "epoch": 1.6286329386437028, | |
| "grad_norm": 1.4629660844802856, | |
| "learning_rate": 0.00014174999999999998, | |
| "loss": 1.7081, | |
| "num_input_tokens_seen": 2019584, | |
| "step": 190, | |
| "train_runtime": 1515.7685, | |
| "train_tokens_per_second": 1332.383 | |
| }, | |
| { | |
| "epoch": 1.7147470398277718, | |
| "grad_norm": 0.9486769437789917, | |
| "learning_rate": 0.00014925, | |
| "loss": 1.7133, | |
| "num_input_tokens_seen": 2126016, | |
| "step": 200, | |
| "train_runtime": 1593.9754, | |
| "train_tokens_per_second": 1333.782 | |
| }, | |
| { | |
| "epoch": 1.8008611410118407, | |
| "grad_norm": 1.6725178956985474, | |
| "learning_rate": 0.00014992177254124345, | |
| "loss": 1.7217, | |
| "num_input_tokens_seen": 2233824, | |
| "step": 210, | |
| "train_runtime": 1672.6238, | |
| "train_tokens_per_second": 1335.521 | |
| }, | |
| { | |
| "epoch": 1.8869752421959096, | |
| "grad_norm": 1.5028326511383057, | |
| "learning_rate": 0.00014965156613602355, | |
| "loss": 1.7094, | |
| "num_input_tokens_seen": 2341536, | |
| "step": 220, | |
| "train_runtime": 1751.4804, | |
| "train_tokens_per_second": 1336.89 | |
| }, | |
| { | |
| "epoch": 1.9730893433799785, | |
| "grad_norm": 1.0816280841827393, | |
| "learning_rate": 0.0001491891107057639, | |
| "loss": 1.7178, | |
| "num_input_tokens_seen": 2447072, | |
| "step": 230, | |
| "train_runtime": 1829.8444, | |
| "train_tokens_per_second": 1337.312 | |
| }, | |
| { | |
| "epoch": 2.051668460710441, | |
| "grad_norm": 0.8403604030609131, | |
| "learning_rate": 0.00014853559720478995, | |
| "loss": 1.5203, | |
| "num_input_tokens_seen": 2544928, | |
| "step": 240, | |
| "train_runtime": 1901.5872, | |
| "train_tokens_per_second": 1338.318 | |
| }, | |
| { | |
| "epoch": 2.13778256189451, | |
| "grad_norm": 0.805606484413147, | |
| "learning_rate": 0.00014769270861632517, | |
| "loss": 1.684, | |
| "num_input_tokens_seen": 2652064, | |
| "step": 250, | |
| "train_runtime": 1980.3904, | |
| "train_tokens_per_second": 1339.162 | |
| }, | |
| { | |
| "epoch": 2.223896663078579, | |
| "grad_norm": 0.7405467629432678, | |
| "learning_rate": 0.00014666261561833036, | |
| "loss": 1.6749, | |
| "num_input_tokens_seen": 2759904, | |
| "step": 260, | |
| "train_runtime": 2065.3272, | |
| "train_tokens_per_second": 1336.304 | |
| }, | |
| { | |
| "epoch": 2.310010764262648, | |
| "grad_norm": 0.8861342668533325, | |
| "learning_rate": 0.00014544797099339018, | |
| "loss": 1.6585, | |
| "num_input_tokens_seen": 2865952, | |
| "step": 270, | |
| "train_runtime": 2143.4821, | |
| "train_tokens_per_second": 1337.054 | |
| }, | |
| { | |
| "epoch": 2.396124865446717, | |
| "grad_norm": 1.0403251647949219, | |
| "learning_rate": 0.0001440519027970432, | |
| "loss": 1.6736, | |
| "num_input_tokens_seen": 2972928, | |
| "step": 280, | |
| "train_runtime": 2222.3903, | |
| "train_tokens_per_second": 1337.716 | |
| }, | |
| { | |
| "epoch": 2.482238966630786, | |
| "grad_norm": 2.1221981048583984, | |
| "learning_rate": 0.0001424780063021488, | |
| "loss": 1.6969, | |
| "num_input_tokens_seen": 3080512, | |
| "step": 290, | |
| "train_runtime": 2301.0804, | |
| "train_tokens_per_second": 1338.724 | |
| }, | |
| { | |
| "epoch": 2.5683530678148547, | |
| "grad_norm": 0.7471824884414673, | |
| "learning_rate": 0.00014073033474003643, | |
| "loss": 1.6699, | |
| "num_input_tokens_seen": 3187712, | |
| "step": 300, | |
| "train_runtime": 2379.4634, | |
| "train_tokens_per_second": 1339.677 | |
| }, | |
| { | |
| "epoch": 2.6544671689989237, | |
| "grad_norm": 0.7120847702026367, | |
| "learning_rate": 0.00013881338886228165, | |
| "loss": 1.6843, | |
| "num_input_tokens_seen": 3293920, | |
| "step": 310, | |
| "train_runtime": 2457.8176, | |
| "train_tokens_per_second": 1340.181 | |
| }, | |
| { | |
| "epoch": 2.7405812701829926, | |
| "grad_norm": 0.7970668077468872, | |
| "learning_rate": 0.00013673210534999016, | |
| "loss": 1.6693, | |
| "num_input_tokens_seen": 3400960, | |
| "step": 320, | |
| "train_runtime": 2536.9062, | |
| "train_tokens_per_second": 1340.594 | |
| }, | |
| { | |
| "epoch": 2.8266953713670615, | |
| "grad_norm": 0.6767310500144958, | |
| "learning_rate": 0.0001344918441004391, | |
| "loss": 1.6793, | |
| "num_input_tokens_seen": 3508032, | |
| "step": 330, | |
| "train_runtime": 2615.7057, | |
| "train_tokens_per_second": 1341.142 | |
| }, | |
| { | |
| "epoch": 2.91280947255113, | |
| "grad_norm": 0.9333407282829285, | |
| "learning_rate": 0.00013209837442381653, | |
| "loss": 1.6769, | |
| "num_input_tokens_seen": 3614176, | |
| "step": 340, | |
| "train_runtime": 2694.0699, | |
| "train_tokens_per_second": 1341.53 | |
| }, | |
| { | |
| "epoch": 2.9989235737351994, | |
| "grad_norm": 0.6378505229949951, | |
| "learning_rate": 0.0001295578601856059, | |
| "loss": 1.6701, | |
| "num_input_tokens_seen": 3721088, | |
| "step": 350, | |
| "train_runtime": 2772.4192, | |
| "train_tokens_per_second": 1342.181 | |
| }, | |
| { | |
| "epoch": 3.077502691065662, | |
| "grad_norm": 0.7191705107688904, | |
| "learning_rate": 0.0001268768439328786, | |
| "loss": 1.4983, | |
| "num_input_tokens_seen": 3819168, | |
| "step": 360, | |
| "train_runtime": 2844.1855, | |
| "train_tokens_per_second": 1342.798 | |
| }, | |
| { | |
| "epoch": 3.163616792249731, | |
| "grad_norm": 0.8273401856422424, | |
| "learning_rate": 0.0001240622300453734, | |
| "loss": 1.6384, | |
| "num_input_tokens_seen": 3925184, | |
| "step": 370, | |
| "train_runtime": 2922.2231, | |
| "train_tokens_per_second": 1343.218 | |
| }, | |
| { | |
| "epoch": 3.2497308934338, | |
| "grad_norm": 1.5716602802276611, | |
| "learning_rate": 0.00012112126695475425, | |
| "loss": 1.6345, | |
| "num_input_tokens_seen": 4032864, | |
| "step": 380, | |
| "train_runtime": 3000.8862, | |
| "train_tokens_per_second": 1343.891 | |
| }, | |
| { | |
| "epoch": 3.3358449946178688, | |
| "grad_norm": 0.6344667077064514, | |
| "learning_rate": 0.00011806152847783581, | |
| "loss": 1.6347, | |
| "num_input_tokens_seen": 4140288, | |
| "step": 390, | |
| "train_runtime": 3079.5638, | |
| "train_tokens_per_second": 1344.44 | |
| }, | |
| { | |
| "epoch": 3.4219590958019377, | |
| "grad_norm": 0.45537635684013367, | |
| "learning_rate": 0.0001148908943118504, | |
| "loss": 1.621, | |
| "num_input_tokens_seen": 4247264, | |
| "step": 400, | |
| "train_runtime": 3158.1824, | |
| "train_tokens_per_second": 1344.844 | |
| }, | |
| { | |
| "epoch": 3.5080731969860066, | |
| "grad_norm": 0.9383829832077026, | |
| "learning_rate": 0.00011161752974198511, | |
| "loss": 1.64, | |
| "num_input_tokens_seen": 4354272, | |
| "step": 410, | |
| "train_runtime": 3236.6237, | |
| "train_tokens_per_second": 1345.313 | |
| }, | |
| { | |
| "epoch": 3.594187298170075, | |
| "grad_norm": 0.704737663269043, | |
| "learning_rate": 0.00010824986461344928, | |
| "loss": 1.6314, | |
| "num_input_tokens_seen": 4462208, | |
| "step": 420, | |
| "train_runtime": 3315.3543, | |
| "train_tokens_per_second": 1345.922 | |
| }, | |
| { | |
| "epoch": 3.6803013993541445, | |
| "grad_norm": 0.6594169735908508, | |
| "learning_rate": 0.00010479657162222409, | |
| "loss": 1.6498, | |
| "num_input_tokens_seen": 4569632, | |
| "step": 430, | |
| "train_runtime": 3393.6946, | |
| "train_tokens_per_second": 1346.507 | |
| }, | |
| { | |
| "epoch": 3.766415500538213, | |
| "grad_norm": 0.6667532324790955, | |
| "learning_rate": 0.00010126654398040281, | |
| "loss": 1.633, | |
| "num_input_tokens_seen": 4676736, | |
| "step": 440, | |
| "train_runtime": 3472.7969, | |
| "train_tokens_per_second": 1346.677 | |
| }, | |
| { | |
| "epoch": 3.852529601722282, | |
| "grad_norm": 0.6092108488082886, | |
| "learning_rate": 9.766887251363892e-05, | |
| "loss": 1.6256, | |
| "num_input_tokens_seen": 4783264, | |
| "step": 450, | |
| "train_runtime": 3551.4865, | |
| "train_tokens_per_second": 1346.834 | |
| }, | |
| { | |
| "epoch": 3.938643702906351, | |
| "grad_norm": 0.9420148730278015, | |
| "learning_rate": 9.401282224968333e-05, | |
| "loss": 1.6179, | |
| "num_input_tokens_seen": 4890112, | |
| "step": 460, | |
| "train_runtime": 3630.0806, | |
| "train_tokens_per_second": 1347.108 | |
| }, | |
| { | |
| "epoch": 4.017222820236814, | |
| "grad_norm": 0.6568248867988586, | |
| "learning_rate": 9.030780855830153e-05, | |
| "loss": 1.4804, | |
| "num_input_tokens_seen": 4987136, | |
| "step": 470, | |
| "train_runtime": 3701.7389, | |
| "train_tokens_per_second": 1347.241 | |
| }, | |
| { | |
| "epoch": 4.103336921420882, | |
| "grad_norm": 0.46975892782211304, | |
| "learning_rate": 8.65633729040172e-05, | |
| "loss": 1.5986, | |
| "num_input_tokens_seen": 5092896, | |
| "step": 480, | |
| "train_runtime": 3780.0642, | |
| "train_tokens_per_second": 1347.304 | |
| }, | |
| { | |
| "epoch": 4.189451022604952, | |
| "grad_norm": 0.17200271785259247, | |
| "learning_rate": 8.278915827412616e-05, | |
| "loss": 1.603, | |
| "num_input_tokens_seen": 5200416, | |
| "step": 490, | |
| "train_runtime": 3859.043, | |
| "train_tokens_per_second": 1347.592 | |
| }, | |
| { | |
| "epoch": 4.27556512378902, | |
| "grad_norm": 1.3012012243270874, | |
| "learning_rate": 7.899488434526004e-05, | |
| "loss": 1.5983, | |
| "num_input_tokens_seen": 5306976, | |
| "step": 500, | |
| "train_runtime": 3937.2348, | |
| "train_tokens_per_second": 1347.894 | |
| }, | |
| { | |
| "epoch": 4.36167922497309, | |
| "grad_norm": 0.780907392501831, | |
| "learning_rate": 7.51903224524532e-05, | |
| "loss": 1.5965, | |
| "num_input_tokens_seen": 5414464, | |
| "step": 510, | |
| "train_runtime": 4022.017, | |
| "train_tokens_per_second": 1346.206 | |
| }, | |
| { | |
| "epoch": 4.447793326157158, | |
| "grad_norm": 0.6589680910110474, | |
| "learning_rate": 7.138527042517471e-05, | |
| "loss": 1.603, | |
| "num_input_tokens_seen": 5520224, | |
| "step": 520, | |
| "train_runtime": 4100.3341, | |
| "train_tokens_per_second": 1346.286 | |
| }, | |
| { | |
| "epoch": 4.533907427341227, | |
| "grad_norm": 0.5304105877876282, | |
| "learning_rate": 6.758952735512931e-05, | |
| "loss": 1.6065, | |
| "num_input_tokens_seen": 5628224, | |
| "step": 530, | |
| "train_runtime": 4179.0731, | |
| "train_tokens_per_second": 1346.764 | |
| }, | |
| { | |
| "epoch": 4.620021528525296, | |
| "grad_norm": 0.2885695695877075, | |
| "learning_rate": 6.381286836080796e-05, | |
| "loss": 1.6024, | |
| "num_input_tokens_seen": 5734816, | |
| "step": 540, | |
| "train_runtime": 4257.2922, | |
| "train_tokens_per_second": 1347.057 | |
| }, | |
| { | |
| "epoch": 4.706135629709365, | |
| "grad_norm": 0.3303077816963196, | |
| "learning_rate": 6.006501941377631e-05, | |
| "loss": 1.597, | |
| "num_input_tokens_seen": 5842240, | |
| "step": 550, | |
| "train_runtime": 4336.3619, | |
| "train_tokens_per_second": 1347.268 | |
| }, | |
| { | |
| "epoch": 4.792249730893434, | |
| "grad_norm": 0.4729728102684021, | |
| "learning_rate": 5.635563229153013e-05, | |
| "loss": 1.6005, | |
| "num_input_tokens_seen": 5950688, | |
| "step": 560, | |
| "train_runtime": 4415.38, | |
| "train_tokens_per_second": 1347.718 | |
| }, | |
| { | |
| "epoch": 4.878363832077502, | |
| "grad_norm": 0.6590526103973389, | |
| "learning_rate": 5.2694259721422185e-05, | |
| "loss": 1.6081, | |
| "num_input_tokens_seen": 6056416, | |
| "step": 570, | |
| "train_runtime": 4493.6142, | |
| "train_tokens_per_second": 1347.783 | |
| }, | |
| { | |
| "epoch": 4.964477933261572, | |
| "grad_norm": 0.5510996580123901, | |
| "learning_rate": 4.90903307796707e-05, | |
| "loss": 1.6024, | |
| "num_input_tokens_seen": 6163968, | |
| "step": 580, | |
| "train_runtime": 4572.3588, | |
| "train_tokens_per_second": 1348.094 | |
| }, | |
| { | |
| "epoch": 5.043057050592035, | |
| "grad_norm": 0.4095686376094818, | |
| "learning_rate": 4.555312660880527e-05, | |
| "loss": 1.4538, | |
| "num_input_tokens_seen": 6262560, | |
| "step": 590, | |
| "train_runtime": 4644.1546, | |
| "train_tokens_per_second": 1348.482 | |
| }, | |
| { | |
| "epoch": 5.129171151776103, | |
| "grad_norm": 0.17324793338775635, | |
| "learning_rate": 4.209175651608374e-05, | |
| "loss": 1.586, | |
| "num_input_tokens_seen": 6369280, | |
| "step": 600, | |
| "train_runtime": 4722.7601, | |
| "train_tokens_per_second": 1348.635 | |
| }, | |
| { | |
| "epoch": 5.2152852529601725, | |
| "grad_norm": 0.6640817523002625, | |
| "learning_rate": 3.871513451443412e-05, | |
| "loss": 1.5876, | |
| "num_input_tokens_seen": 6475072, | |
| "step": 610, | |
| "train_runtime": 4800.8785, | |
| "train_tokens_per_second": 1348.726 | |
| }, | |
| { | |
| "epoch": 5.301399354144241, | |
| "grad_norm": 0.17123615741729736, | |
| "learning_rate": 3.5431956366334576e-05, | |
| "loss": 1.587, | |
| "num_input_tokens_seen": 6582240, | |
| "step": 620, | |
| "train_runtime": 4879.5207, | |
| "train_tokens_per_second": 1348.952 | |
| }, | |
| { | |
| "epoch": 5.38751345532831, | |
| "grad_norm": 0.051739007234573364, | |
| "learning_rate": 3.225067718975078e-05, | |
| "loss": 1.5812, | |
| "num_input_tokens_seen": 6690496, | |
| "step": 630, | |
| "train_runtime": 4959.3413, | |
| "train_tokens_per_second": 1349.069 | |
| }, | |
| { | |
| "epoch": 5.473627556512379, | |
| "grad_norm": 0.889016330242157, | |
| "learning_rate": 2.917948968380125e-05, | |
| "loss": 1.5828, | |
| "num_input_tokens_seen": 6797088, | |
| "step": 640, | |
| "train_runtime": 5037.9025, | |
| "train_tokens_per_second": 1349.19 | |
| }, | |
| { | |
| "epoch": 5.559741657696447, | |
| "grad_norm": 0.20981049537658691, | |
| "learning_rate": 2.622630303022586e-05, | |
| "loss": 1.5837, | |
| "num_input_tokens_seen": 6904160, | |
| "step": 650, | |
| "train_runtime": 5116.2831, | |
| "train_tokens_per_second": 1349.448 | |
| }, | |
| { | |
| "epoch": 5.645855758880517, | |
| "grad_norm": 0.4966135621070862, | |
| "learning_rate": 2.3398722524992193e-05, | |
| "loss": 1.5806, | |
| "num_input_tokens_seen": 7011264, | |
| "step": 660, | |
| "train_runtime": 5194.5897, | |
| "train_tokens_per_second": 1349.724 | |
| }, | |
| { | |
| "epoch": 5.731969860064585, | |
| "grad_norm": 0.0645381435751915, | |
| "learning_rate": 2.0704029992494413e-05, | |
| "loss": 1.5831, | |
| "num_input_tokens_seen": 7117600, | |
| "step": 670, | |
| "train_runtime": 5272.7715, | |
| "train_tokens_per_second": 1349.878 | |
| }, | |
| { | |
| "epoch": 5.818083961248655, | |
| "grad_norm": 0.03474411740899086, | |
| "learning_rate": 1.8149165032783373e-05, | |
| "loss": 1.5842, | |
| "num_input_tokens_seen": 7223968, | |
| "step": 680, | |
| "train_runtime": 5351.0243, | |
| "train_tokens_per_second": 1350.016 | |
| }, | |
| { | |
| "epoch": 5.904198062432723, | |
| "grad_norm": 0.1602916270494461, | |
| "learning_rate": 1.574070715012184e-05, | |
| "loss": 1.5803, | |
| "num_input_tokens_seen": 7330624, | |
| "step": 690, | |
| "train_runtime": 5429.4442, | |
| "train_tokens_per_second": 1350.161 | |
| }, | |
| { | |
| "epoch": 5.990312163616792, | |
| "grad_norm": 0.6672658920288086, | |
| "learning_rate": 1.3484858808888777e-05, | |
| "loss": 1.5828, | |
| "num_input_tokens_seen": 7437664, | |
| "step": 700, | |
| "train_runtime": 5507.9983, | |
| "train_tokens_per_second": 1350.339 | |
| }, | |
| { | |
| "epoch": 6.0688912809472555, | |
| "grad_norm": 0.053765423595905304, | |
| "learning_rate": 1.1387429460468603e-05, | |
| "loss": 1.4417, | |
| "num_input_tokens_seen": 7535744, | |
| "step": 710, | |
| "train_runtime": 5579.9255, | |
| "train_tokens_per_second": 1350.51 | |
| }, | |
| { | |
| "epoch": 6.155005382131324, | |
| "grad_norm": 0.029805637896060944, | |
| "learning_rate": 9.453820582260826e-06, | |
| "loss": 1.5799, | |
| "num_input_tokens_seen": 7642368, | |
| "step": 720, | |
| "train_runtime": 5657.9716, | |
| "train_tokens_per_second": 1350.726 | |
| }, | |
| { | |
| "epoch": 6.2411194833153925, | |
| "grad_norm": 0.04558693990111351, | |
| "learning_rate": 7.689011767338823e-06, | |
| "loss": 1.5799, | |
| "num_input_tokens_seen": 7748992, | |
| "step": 730, | |
| "train_runtime": 5736.181, | |
| "train_tokens_per_second": 1350.897 | |
| }, | |
| { | |
| "epoch": 6.327233584499462, | |
| "grad_norm": 0.03208324313163757, | |
| "learning_rate": 6.097547900580538e-06, | |
| "loss": 1.5796, | |
| "num_input_tokens_seen": 7856928, | |
| "step": 740, | |
| "train_runtime": 5814.8518, | |
| "train_tokens_per_second": 1351.183 | |
| }, | |
| { | |
| "epoch": 6.41334768568353, | |
| "grad_norm": 0.03971538320183754, | |
| "learning_rate": 4.68352745429686e-06, | |
| "loss": 1.5801, | |
| "num_input_tokens_seen": 7964064, | |
| "step": 750, | |
| "train_runtime": 5893.167, | |
| "train_tokens_per_second": 1351.406 | |
| }, | |
| { | |
| "epoch": 6.4994617868676, | |
| "grad_norm": 0.040640704333782196, | |
| "learning_rate": 3.4505919334990527e-06, | |
| "loss": 1.58, | |
| "num_input_tokens_seen": 8071904, | |
| "step": 760, | |
| "train_runtime": 5977.9765, | |
| "train_tokens_per_second": 1350.274 | |
| }, | |
| { | |
| "epoch": 6.585575888051668, | |
| "grad_norm": 0.05071580782532692, | |
| "learning_rate": 2.4019164979872273e-06, | |
| "loss": 1.5798, | |
| "num_input_tokens_seen": 8178656, | |
| "step": 770, | |
| "train_runtime": 6056.5962, | |
| "train_tokens_per_second": 1350.372 | |
| }, | |
| { | |
| "epoch": 6.6716899892357375, | |
| "grad_norm": 0.29936906695365906, | |
| "learning_rate": 1.5402017854103444e-06, | |
| "loss": 1.5801, | |
| "num_input_tokens_seen": 8285216, | |
| "step": 780, | |
| "train_runtime": 6135.5634, | |
| "train_tokens_per_second": 1350.359 | |
| }, | |
| { | |
| "epoch": 6.757804090419806, | |
| "grad_norm": 0.035232119262218475, | |
| "learning_rate": 8.676669563557781e-07, | |
| "loss": 1.5798, | |
| "num_input_tokens_seen": 8391648, | |
| "step": 790, | |
| "train_runtime": 6213.6545, | |
| "train_tokens_per_second": 1350.517 | |
| }, | |
| { | |
| "epoch": 6.843918191603875, | |
| "grad_norm": 0.04186419025063515, | |
| "learning_rate": 3.860439793793524e-07, | |
| "loss": 1.5829, | |
| "num_input_tokens_seen": 8499040, | |
| "step": 800, | |
| "train_runtime": 6291.9668, | |
| "train_tokens_per_second": 1350.776 | |
| }, | |
| { | |
| "epoch": 6.930032292787944, | |
| "grad_norm": 0.03829411789774895, | |
| "learning_rate": 9.657317069348691e-08, | |
| "loss": 1.5797, | |
| "num_input_tokens_seen": 8605728, | |
| "step": 810, | |
| "train_runtime": 6370.5124, | |
| "train_tokens_per_second": 1350.869 | |
| }, | |
| { | |
| "epoch": 7.0, | |
| "num_input_tokens_seen": 8693056, | |
| "step": 819, | |
| "total_flos": 5.846147771112346e+17, | |
| "train_loss": 1.7591052678332952, | |
| "train_runtime": 6440.7845, | |
| "train_samples_per_second": 4.039, | |
| "train_steps_per_second": 0.127 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 819, | |
| "num_input_tokens_seen": 8693056, | |
| "num_train_epochs": 7, | |
| "save_steps": 250, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 5.846147771112346e+17, | |
| "train_batch_size": 4, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |