Instructions to use fats-fme/927ae2d2-3cd2-4120-b464-724bcc47d45b with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use fats-fme/927ae2d2-3cd2-4120-b464-724bcc47d45b with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("OpenBuddy/openbuddy-llama2-13b-v8.1-fp16") model = PeftModel.from_pretrained(base_model, "fats-fme/927ae2d2-3cd2-4120-b464-724bcc47d45b") - Notebooks
- Google Colab
- Kaggle
Download last-checkpoint/trainer_state.json from fats-fme/927ae2d2-3cd2-4120-b464-724bcc47d45b: direct link, hf CLI and curl.
- Browser
- Download file 48.5 kB
-
https://huggingface.co/fats-fme/927ae2d2-3cd2-4120-b464-724bcc47d45b/resolve/main/last-checkpoint/trainer_state.json
- Command line
-
hf download hf://fats-fme/927ae2d2-3cd2-4120-b464-724bcc47d45b/last-checkpoint/trainer_state.json
-
curl -L -o trainer_state.json https://huggingface.co/fats-fme/927ae2d2-3cd2-4120-b464-724bcc47d45b/resolve/main/last-checkpoint/trainer_state.json
48.5 kB
Invalid JSON:Unexpected token 'N', ..."ad_norm": NaN,
"... is not valid JSON
| { | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 0.09214627841557059, | |
| "eval_steps": 76, | |
| "global_step": 303, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.0003041131300843914, | |
| "grad_norm": NaN, | |
| "learning_rate": 4.000000000000001e-06, | |
| "loss": 0.0, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 0.0003041131300843914, | |
| "eval_loss": NaN, | |
| "eval_runtime": 1407.213, | |
| "eval_samples_per_second": 3.935, | |
| "eval_steps_per_second": 0.984, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 0.0006082262601687828, | |
| "grad_norm": NaN, | |
| "learning_rate": 8.000000000000001e-06, | |
| "loss": 0.0, | |
| "step": 2 | |
| }, | |
| { | |
| "epoch": 0.0009123393902531741, | |
| "grad_norm": NaN, | |
| "learning_rate": 1.2e-05, | |
| "loss": 0.0, | |
| "step": 3 | |
| }, | |
| { | |
| "epoch": 0.0012164525203375656, | |
| "grad_norm": NaN, | |
| "learning_rate": 1.6000000000000003e-05, | |
| "loss": 0.0, | |
| "step": 4 | |
| }, | |
| { | |
| "epoch": 0.001520565650421957, | |
| "grad_norm": NaN, | |
| "learning_rate": 2e-05, | |
| "loss": 0.0, | |
| "step": 5 | |
| }, | |
| { | |
| "epoch": 0.0018246787805063483, | |
| "grad_norm": NaN, | |
| "learning_rate": 2.4e-05, | |
| "loss": 0.0, | |
| "step": 6 | |
| }, | |
| { | |
| "epoch": 0.0021287919105907396, | |
| "grad_norm": NaN, | |
| "learning_rate": 2.8000000000000003e-05, | |
| "loss": 0.0, | |
| "step": 7 | |
| }, | |
| { | |
| "epoch": 0.002432905040675131, | |
| "grad_norm": NaN, | |
| "learning_rate": 3.2000000000000005e-05, | |
| "loss": 0.0, | |
| "step": 8 | |
| }, | |
| { | |
| "epoch": 0.0027370181707595228, | |
| "grad_norm": NaN, | |
| "learning_rate": 3.6e-05, | |
| "loss": 0.0, | |
| "step": 9 | |
| }, | |
| { | |
| "epoch": 0.003041131300843914, | |
| "grad_norm": NaN, | |
| "learning_rate": 4e-05, | |
| "loss": 0.0, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.0033452444309283054, | |
| "grad_norm": NaN, | |
| "learning_rate": 4.4000000000000006e-05, | |
| "loss": 0.0, | |
| "step": 11 | |
| }, | |
| { | |
| "epoch": 0.0036493575610126966, | |
| "grad_norm": NaN, | |
| "learning_rate": 4.8e-05, | |
| "loss": 0.0, | |
| "step": 12 | |
| }, | |
| { | |
| "epoch": 0.003953470691097088, | |
| "grad_norm": NaN, | |
| "learning_rate": 5.2000000000000004e-05, | |
| "loss": 0.0, | |
| "step": 13 | |
| }, | |
| { | |
| "epoch": 0.004257583821181479, | |
| "grad_norm": NaN, | |
| "learning_rate": 5.6000000000000006e-05, | |
| "loss": 0.0, | |
| "step": 14 | |
| }, | |
| { | |
| "epoch": 0.004561696951265871, | |
| "grad_norm": NaN, | |
| "learning_rate": 6e-05, | |
| "loss": 0.0, | |
| "step": 15 | |
| }, | |
| { | |
| "epoch": 0.004865810081350262, | |
| "grad_norm": NaN, | |
| "learning_rate": 6.400000000000001e-05, | |
| "loss": 0.0, | |
| "step": 16 | |
| }, | |
| { | |
| "epoch": 0.0051699232114346535, | |
| "grad_norm": NaN, | |
| "learning_rate": 6.800000000000001e-05, | |
| "loss": 0.0, | |
| "step": 17 | |
| }, | |
| { | |
| "epoch": 0.0054740363415190455, | |
| "grad_norm": NaN, | |
| "learning_rate": 7.2e-05, | |
| "loss": 0.0, | |
| "step": 18 | |
| }, | |
| { | |
| "epoch": 0.005778149471603437, | |
| "grad_norm": NaN, | |
| "learning_rate": 7.6e-05, | |
| "loss": 0.0, | |
| "step": 19 | |
| }, | |
| { | |
| "epoch": 0.006082262601687828, | |
| "grad_norm": NaN, | |
| "learning_rate": 8e-05, | |
| "loss": 0.0, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.006386375731772219, | |
| "grad_norm": NaN, | |
| "learning_rate": 8.4e-05, | |
| "loss": 0.0, | |
| "step": 21 | |
| }, | |
| { | |
| "epoch": 0.006690488861856611, | |
| "grad_norm": NaN, | |
| "learning_rate": 8.800000000000001e-05, | |
| "loss": 0.0, | |
| "step": 22 | |
| }, | |
| { | |
| "epoch": 0.006994601991941002, | |
| "grad_norm": NaN, | |
| "learning_rate": 9.200000000000001e-05, | |
| "loss": 0.0, | |
| "step": 23 | |
| }, | |
| { | |
| "epoch": 0.007298715122025393, | |
| "grad_norm": NaN, | |
| "learning_rate": 9.6e-05, | |
| "loss": 0.0, | |
| "step": 24 | |
| }, | |
| { | |
| "epoch": 0.007602828252109785, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0001, | |
| "loss": 0.0, | |
| "step": 25 | |
| }, | |
| { | |
| "epoch": 0.007906941382194176, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00010400000000000001, | |
| "loss": 0.0, | |
| "step": 26 | |
| }, | |
| { | |
| "epoch": 0.008211054512278567, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00010800000000000001, | |
| "loss": 0.0, | |
| "step": 27 | |
| }, | |
| { | |
| "epoch": 0.008515167642362959, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00011200000000000001, | |
| "loss": 0.0, | |
| "step": 28 | |
| }, | |
| { | |
| "epoch": 0.00881928077244735, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.000116, | |
| "loss": 0.0, | |
| "step": 29 | |
| }, | |
| { | |
| "epoch": 0.009123393902531743, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00012, | |
| "loss": 0.0, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.009427507032616134, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.000124, | |
| "loss": 0.0, | |
| "step": 31 | |
| }, | |
| { | |
| "epoch": 0.009731620162700525, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00012800000000000002, | |
| "loss": 0.0, | |
| "step": 32 | |
| }, | |
| { | |
| "epoch": 0.010035733292784916, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.000132, | |
| "loss": 0.0, | |
| "step": 33 | |
| }, | |
| { | |
| "epoch": 0.010339846422869307, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00013600000000000003, | |
| "loss": 0.0, | |
| "step": 34 | |
| }, | |
| { | |
| "epoch": 0.010643959552953698, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00014, | |
| "loss": 0.0, | |
| "step": 35 | |
| }, | |
| { | |
| "epoch": 0.010948072683038091, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.000144, | |
| "loss": 0.0, | |
| "step": 36 | |
| }, | |
| { | |
| "epoch": 0.011252185813122482, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.000148, | |
| "loss": 0.0, | |
| "step": 37 | |
| }, | |
| { | |
| "epoch": 0.011556298943206873, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.000152, | |
| "loss": 0.0, | |
| "step": 38 | |
| }, | |
| { | |
| "epoch": 0.011860412073291264, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00015600000000000002, | |
| "loss": 0.0, | |
| "step": 39 | |
| }, | |
| { | |
| "epoch": 0.012164525203375656, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00016, | |
| "loss": 0.0, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.012468638333460047, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.000164, | |
| "loss": 0.0, | |
| "step": 41 | |
| }, | |
| { | |
| "epoch": 0.012772751463544438, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.000168, | |
| "loss": 0.0, | |
| "step": 42 | |
| }, | |
| { | |
| "epoch": 0.01307686459362883, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.000172, | |
| "loss": 0.0, | |
| "step": 43 | |
| }, | |
| { | |
| "epoch": 0.013380977723713222, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00017600000000000002, | |
| "loss": 0.0, | |
| "step": 44 | |
| }, | |
| { | |
| "epoch": 0.013685090853797613, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00018, | |
| "loss": 0.0, | |
| "step": 45 | |
| }, | |
| { | |
| "epoch": 0.013989203983882004, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00018400000000000003, | |
| "loss": 0.0, | |
| "step": 46 | |
| }, | |
| { | |
| "epoch": 0.014293317113966395, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.000188, | |
| "loss": 0.0, | |
| "step": 47 | |
| }, | |
| { | |
| "epoch": 0.014597430244050786, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.000192, | |
| "loss": 0.0, | |
| "step": 48 | |
| }, | |
| { | |
| "epoch": 0.014901543374135177, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.000196, | |
| "loss": 0.0, | |
| "step": 49 | |
| }, | |
| { | |
| "epoch": 0.01520565650421957, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0002, | |
| "loss": 0.0, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.015509769634303961, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0001999922905547776, | |
| "loss": 0.0, | |
| "step": 51 | |
| }, | |
| { | |
| "epoch": 0.015813882764388353, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0001999691634078213, | |
| "loss": 0.0, | |
| "step": 52 | |
| }, | |
| { | |
| "epoch": 0.016117995894472745, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00019993062212508053, | |
| "loss": 0.0, | |
| "step": 53 | |
| }, | |
| { | |
| "epoch": 0.016422109024557135, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0001998766726491935, | |
| "loss": 0.0, | |
| "step": 54 | |
| }, | |
| { | |
| "epoch": 0.016726222154641528, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00019980732329857076, | |
| "loss": 0.0, | |
| "step": 55 | |
| }, | |
| { | |
| "epoch": 0.017030335284725917, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0001997225847661127, | |
| "loss": 0.0, | |
| "step": 56 | |
| }, | |
| { | |
| "epoch": 0.01733444841481031, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00019962247011756081, | |
| "loss": 0.0, | |
| "step": 57 | |
| }, | |
| { | |
| "epoch": 0.0176385615448947, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00019950699478948309, | |
| "loss": 0.0, | |
| "step": 58 | |
| }, | |
| { | |
| "epoch": 0.017942674674979092, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00019937617658689384, | |
| "loss": 0.0, | |
| "step": 59 | |
| }, | |
| { | |
| "epoch": 0.018246787805063485, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00019923003568050844, | |
| "loss": 0.0, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.018550900935147874, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00019906859460363307, | |
| "loss": 0.0, | |
| "step": 61 | |
| }, | |
| { | |
| "epoch": 0.018855014065232267, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0001988918782486906, | |
| "loss": 0.0, | |
| "step": 62 | |
| }, | |
| { | |
| "epoch": 0.019159127195316657, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0001986999138633821, | |
| "loss": 0.0, | |
| "step": 63 | |
| }, | |
| { | |
| "epoch": 0.01946324032540105, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00019849273104648592, | |
| "loss": 0.0, | |
| "step": 64 | |
| }, | |
| { | |
| "epoch": 0.01976735345548544, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00019827036174329353, | |
| "loss": 0.0, | |
| "step": 65 | |
| }, | |
| { | |
| "epoch": 0.020071466585569832, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00019803284024068427, | |
| "loss": 0.0, | |
| "step": 66 | |
| }, | |
| { | |
| "epoch": 0.020375579715654225, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0001977802031618383, | |
| "loss": 0.0, | |
| "step": 67 | |
| }, | |
| { | |
| "epoch": 0.020679692845738614, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00019751248946059014, | |
| "loss": 0.0, | |
| "step": 68 | |
| }, | |
| { | |
| "epoch": 0.020983805975823007, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00019722974041542203, | |
| "loss": 0.0, | |
| "step": 69 | |
| }, | |
| { | |
| "epoch": 0.021287919105907396, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0001969319996230995, | |
| "loss": 0.0, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.02159203223599179, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0001966193129919491, | |
| "loss": 0.0, | |
| "step": 71 | |
| }, | |
| { | |
| "epoch": 0.021896145366076182, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00019629172873477995, | |
| "loss": 0.0, | |
| "step": 72 | |
| }, | |
| { | |
| "epoch": 0.02220025849616057, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00019594929736144976, | |
| "loss": 0.0, | |
| "step": 73 | |
| }, | |
| { | |
| "epoch": 0.022504371626244964, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00019559207167107684, | |
| "loss": 0.0, | |
| "step": 74 | |
| }, | |
| { | |
| "epoch": 0.022808484756329354, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.000195220106743899, | |
| "loss": 0.0, | |
| "step": 75 | |
| }, | |
| { | |
| "epoch": 0.023112597886413747, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00019483345993278093, | |
| "loss": 0.0, | |
| "step": 76 | |
| }, | |
| { | |
| "epoch": 0.023112597886413747, | |
| "eval_loss": NaN, | |
| "eval_runtime": 1405.4791, | |
| "eval_samples_per_second": 3.94, | |
| "eval_steps_per_second": 0.985, | |
| "step": 76 | |
| }, | |
| { | |
| "epoch": 0.023416711016498136, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0001944321908543708, | |
| "loss": 0.0, | |
| "step": 77 | |
| }, | |
| { | |
| "epoch": 0.02372082414658253, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00019401636137990816, | |
| "loss": 0.0, | |
| "step": 78 | |
| }, | |
| { | |
| "epoch": 0.02402493727666692, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00019358603562568416, | |
| "loss": 0.0, | |
| "step": 79 | |
| }, | |
| { | |
| "epoch": 0.02432905040675131, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0001931412799431554, | |
| "loss": 0.0, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.024633163536835704, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0001926821629087133, | |
| "loss": 0.0, | |
| "step": 81 | |
| }, | |
| { | |
| "epoch": 0.024937276666920093, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00019220875531311045, | |
| "loss": 0.0, | |
| "step": 82 | |
| }, | |
| { | |
| "epoch": 0.025241389797004486, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00019172113015054532, | |
| "loss": 0.0, | |
| "step": 83 | |
| }, | |
| { | |
| "epoch": 0.025545502927088876, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00019121936260740752, | |
| "loss": 0.0, | |
| "step": 84 | |
| }, | |
| { | |
| "epoch": 0.02584961605717327, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00019070353005068484, | |
| "loss": 0.0, | |
| "step": 85 | |
| }, | |
| { | |
| "epoch": 0.02615372918725766, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00019017371201603407, | |
| "loss": 0.0, | |
| "step": 86 | |
| }, | |
| { | |
| "epoch": 0.02645784231734205, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00018962999019551754, | |
| "loss": 0.0, | |
| "step": 87 | |
| }, | |
| { | |
| "epoch": 0.026761955447426444, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00018907244842500704, | |
| "loss": 0.0, | |
| "step": 88 | |
| }, | |
| { | |
| "epoch": 0.027066068577510833, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00018850117267125738, | |
| "loss": 0.0, | |
| "step": 89 | |
| }, | |
| { | |
| "epoch": 0.027370181707595226, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00018791625101865117, | |
| "loss": 0.0, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.027674294837679615, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0001873177736556172, | |
| "loss": 0.0, | |
| "step": 91 | |
| }, | |
| { | |
| "epoch": 0.027978407967764008, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00018670583286072443, | |
| "loss": 0.0, | |
| "step": 92 | |
| }, | |
| { | |
| "epoch": 0.0282825210978484, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0001860805229884536, | |
| "loss": 0.0, | |
| "step": 93 | |
| }, | |
| { | |
| "epoch": 0.02858663422793279, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00018544194045464886, | |
| "loss": 0.0, | |
| "step": 94 | |
| }, | |
| { | |
| "epoch": 0.028890747358017183, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0001847901837216515, | |
| "loss": 0.0, | |
| "step": 95 | |
| }, | |
| { | |
| "epoch": 0.029194860488101573, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00018412535328311814, | |
| "loss": 0.0, | |
| "step": 96 | |
| }, | |
| { | |
| "epoch": 0.029498973618185965, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0001834475516485257, | |
| "loss": 0.0, | |
| "step": 97 | |
| }, | |
| { | |
| "epoch": 0.029803086748270355, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00018275688332736577, | |
| "loss": 0.0, | |
| "step": 98 | |
| }, | |
| { | |
| "epoch": 0.030107199878354748, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00018205345481302998, | |
| "loss": 0.0, | |
| "step": 99 | |
| }, | |
| { | |
| "epoch": 0.03041131300843914, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00018133737456639044, | |
| "loss": 0.0, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.03071542613852353, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0001806087529990758, | |
| "loss": 0.0, | |
| "step": 101 | |
| }, | |
| { | |
| "epoch": 0.031019539268607923, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0001798677024564473, | |
| "loss": 0.0, | |
| "step": 102 | |
| }, | |
| { | |
| "epoch": 0.031323652398692316, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00017911433720027624, | |
| "loss": 0.0, | |
| "step": 103 | |
| }, | |
| { | |
| "epoch": 0.031627765528776705, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00017834877339112612, | |
| "loss": 0.0, | |
| "step": 104 | |
| }, | |
| { | |
| "epoch": 0.031931878658861094, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.000177571129070442, | |
| "loss": 0.0, | |
| "step": 105 | |
| }, | |
| { | |
| "epoch": 0.03223599178894549, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00017678152414234968, | |
| "loss": 0.0, | |
| "step": 106 | |
| }, | |
| { | |
| "epoch": 0.03254010491902988, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.000175980080355168, | |
| "loss": 0.0, | |
| "step": 107 | |
| }, | |
| { | |
| "epoch": 0.03284421804911427, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00017516692128263648, | |
| "loss": 0.0, | |
| "step": 108 | |
| }, | |
| { | |
| "epoch": 0.03314833117919866, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00017434217230486164, | |
| "loss": 0.0, | |
| "step": 109 | |
| }, | |
| { | |
| "epoch": 0.033452444309283055, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00017350596058898483, | |
| "loss": 0.0, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 0.033756557439367445, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0001726584150695744, | |
| "loss": 0.0, | |
| "step": 111 | |
| }, | |
| { | |
| "epoch": 0.034060670569451834, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00017179966642874543, | |
| "loss": 0.0, | |
| "step": 112 | |
| }, | |
| { | |
| "epoch": 0.03436478369953623, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0001709298470760101, | |
| "loss": 0.0, | |
| "step": 113 | |
| }, | |
| { | |
| "epoch": 0.03466889682962062, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00017004909112786144, | |
| "loss": 0.0, | |
| "step": 114 | |
| }, | |
| { | |
| "epoch": 0.03497300995970501, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00016915753438709417, | |
| "loss": 0.0, | |
| "step": 115 | |
| }, | |
| { | |
| "epoch": 0.0352771230897894, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00016825531432186543, | |
| "loss": 0.0, | |
| "step": 116 | |
| }, | |
| { | |
| "epoch": 0.035581236219873795, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00016734257004449862, | |
| "loss": 0.0, | |
| "step": 117 | |
| }, | |
| { | |
| "epoch": 0.035885349349958184, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00016641944229003395, | |
| "loss": 0.0, | |
| "step": 118 | |
| }, | |
| { | |
| "epoch": 0.036189462480042574, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00016548607339452853, | |
| "loss": 0.0, | |
| "step": 119 | |
| }, | |
| { | |
| "epoch": 0.03649357561012697, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00016454260727310978, | |
| "loss": 0.0, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 0.03679768874021136, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00016358918939778536, | |
| "loss": 0.0, | |
| "step": 121 | |
| }, | |
| { | |
| "epoch": 0.03710180187029575, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00016262596677501297, | |
| "loss": 0.0, | |
| "step": 122 | |
| }, | |
| { | |
| "epoch": 0.03740591500038014, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0001616530879230335, | |
| "loss": 0.0, | |
| "step": 123 | |
| }, | |
| { | |
| "epoch": 0.037710028130464535, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00016067070284897137, | |
| "loss": 0.0, | |
| "step": 124 | |
| }, | |
| { | |
| "epoch": 0.038014141260548924, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00015967896302570485, | |
| "loss": 0.0, | |
| "step": 125 | |
| }, | |
| { | |
| "epoch": 0.03831825439063331, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0001586780213685108, | |
| "loss": 0.0, | |
| "step": 126 | |
| }, | |
| { | |
| "epoch": 0.03862236752071771, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00015766803221148673, | |
| "loss": 0.0, | |
| "step": 127 | |
| }, | |
| { | |
| "epoch": 0.0389264806508021, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0001566491512837543, | |
| "loss": 0.0, | |
| "step": 128 | |
| }, | |
| { | |
| "epoch": 0.03923059378088649, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00015562153568544752, | |
| "loss": 0.0, | |
| "step": 129 | |
| }, | |
| { | |
| "epoch": 0.03953470691097088, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00015458534386348966, | |
| "loss": 0.0, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 0.039838820041055274, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0001535407355871626, | |
| "loss": 0.0, | |
| "step": 131 | |
| }, | |
| { | |
| "epoch": 0.040142933171139664, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00015248787192347196, | |
| "loss": 0.0, | |
| "step": 132 | |
| }, | |
| { | |
| "epoch": 0.04044704630122405, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00015142691521231267, | |
| "loss": 0.0, | |
| "step": 133 | |
| }, | |
| { | |
| "epoch": 0.04075115943130845, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00015035802904143762, | |
| "loss": 0.0, | |
| "step": 134 | |
| }, | |
| { | |
| "epoch": 0.04105527256139284, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00014928137822123452, | |
| "loss": 0.0, | |
| "step": 135 | |
| }, | |
| { | |
| "epoch": 0.04135938569147723, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0001481971287593138, | |
| "loss": 0.0, | |
| "step": 136 | |
| }, | |
| { | |
| "epoch": 0.04166349882156162, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00014710544783491208, | |
| "loss": 0.0, | |
| "step": 137 | |
| }, | |
| { | |
| "epoch": 0.041967611951646014, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00014600650377311522, | |
| "loss": 0.0, | |
| "step": 138 | |
| }, | |
| { | |
| "epoch": 0.0422717250817304, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00014490046601890405, | |
| "loss": 0.0, | |
| "step": 139 | |
| }, | |
| { | |
| "epoch": 0.04257583821181479, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00014378750511102826, | |
| "loss": 0.0, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 0.04287995134189919, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00014266779265571087, | |
| "loss": 0.0, | |
| "step": 141 | |
| }, | |
| { | |
| "epoch": 0.04318406447198358, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00014154150130018866, | |
| "loss": 0.0, | |
| "step": 142 | |
| }, | |
| { | |
| "epoch": 0.04348817760206797, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00014040880470609187, | |
| "loss": 0.0, | |
| "step": 143 | |
| }, | |
| { | |
| "epoch": 0.043792290732152364, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00013926987752266735, | |
| "loss": 0.0, | |
| "step": 144 | |
| }, | |
| { | |
| "epoch": 0.044096403862236754, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00013812489535984981, | |
| "loss": 0.0, | |
| "step": 145 | |
| }, | |
| { | |
| "epoch": 0.04440051699232114, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00013697403476118454, | |
| "loss": 0.0, | |
| "step": 146 | |
| }, | |
| { | |
| "epoch": 0.04470463012240553, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0001358174731766064, | |
| "loss": 0.0, | |
| "step": 147 | |
| }, | |
| { | |
| "epoch": 0.04500874325248993, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00013465538893507907, | |
| "loss": 0.0, | |
| "step": 148 | |
| }, | |
| { | |
| "epoch": 0.04531285638257432, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00013348796121709862, | |
| "loss": 0.0, | |
| "step": 149 | |
| }, | |
| { | |
| "epoch": 0.04561696951265871, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00013231537002706594, | |
| "loss": 0.0, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.045921082642743104, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0001311377961655319, | |
| "loss": 0.0, | |
| "step": 151 | |
| }, | |
| { | |
| "epoch": 0.04622519577282749, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00012995542120132017, | |
| "loss": 0.0, | |
| "step": 152 | |
| }, | |
| { | |
| "epoch": 0.04622519577282749, | |
| "eval_loss": NaN, | |
| "eval_runtime": 1407.6583, | |
| "eval_samples_per_second": 3.934, | |
| "eval_steps_per_second": 0.984, | |
| "step": 152 | |
| }, | |
| { | |
| "epoch": 0.04652930890291188, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00012876842744353112, | |
| "loss": 0.0, | |
| "step": 153 | |
| }, | |
| { | |
| "epoch": 0.04683342203299627, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00012757699791343186, | |
| "loss": 0.0, | |
| "step": 154 | |
| }, | |
| { | |
| "epoch": 0.04713753516308067, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0001263813163162364, | |
| "loss": 0.0, | |
| "step": 155 | |
| }, | |
| { | |
| "epoch": 0.04744164829316506, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00012518156701278019, | |
| "loss": 0.0, | |
| "step": 156 | |
| }, | |
| { | |
| "epoch": 0.04774576142324945, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00012397793499109404, | |
| "loss": 0.0, | |
| "step": 157 | |
| }, | |
| { | |
| "epoch": 0.04804987455333384, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00012277060583788064, | |
| "loss": 0.0, | |
| "step": 158 | |
| }, | |
| { | |
| "epoch": 0.04835398768341823, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00012155976570989949, | |
| "loss": 0.0, | |
| "step": 159 | |
| }, | |
| { | |
| "epoch": 0.04865810081350262, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0001203456013052634, | |
| "loss": 0.0, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 0.04896221394358701, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00011912829983465168, | |
| "loss": 0.0, | |
| "step": 161 | |
| }, | |
| { | |
| "epoch": 0.04926632707367141, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00011790804899244452, | |
| "loss": 0.0, | |
| "step": 162 | |
| }, | |
| { | |
| "epoch": 0.0495704402037558, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00011668503692778239, | |
| "loss": 0.0, | |
| "step": 163 | |
| }, | |
| { | |
| "epoch": 0.04987455333384019, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0001154594522155557, | |
| "loss": 0.0, | |
| "step": 164 | |
| }, | |
| { | |
| "epoch": 0.05017866646392458, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00011423148382732853, | |
| "loss": 0.0, | |
| "step": 165 | |
| }, | |
| { | |
| "epoch": 0.05048277959400897, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00011300132110220134, | |
| "loss": 0.0, | |
| "step": 166 | |
| }, | |
| { | |
| "epoch": 0.05078689272409336, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00011176915371761702, | |
| "loss": 0.0, | |
| "step": 167 | |
| }, | |
| { | |
| "epoch": 0.05109100585417775, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00011053517166011471, | |
| "loss": 0.0, | |
| "step": 168 | |
| }, | |
| { | |
| "epoch": 0.05139511898426215, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00010929956519603594, | |
| "loss": 0.0, | |
| "step": 169 | |
| }, | |
| { | |
| "epoch": 0.05169923211434654, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0001080625248421878, | |
| "loss": 0.0, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 0.052003345244430926, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0001068242413364671, | |
| "loss": 0.0, | |
| "step": 171 | |
| }, | |
| { | |
| "epoch": 0.05230745837451532, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00010558490560845107, | |
| "loss": 0.0, | |
| "step": 172 | |
| }, | |
| { | |
| "epoch": 0.05261157150459971, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00010434470874995781, | |
| "loss": 0.0, | |
| "step": 173 | |
| }, | |
| { | |
| "epoch": 0.0529156846346841, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00010310384198558225, | |
| "loss": 0.0, | |
| "step": 174 | |
| }, | |
| { | |
| "epoch": 0.05321979776476849, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00010186249664321139, | |
| "loss": 0.0, | |
| "step": 175 | |
| }, | |
| { | |
| "epoch": 0.05352391089485289, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.00010062086412452352, | |
| "loss": 0.0, | |
| "step": 176 | |
| }, | |
| { | |
| "epoch": 0.05382802402493728, | |
| "grad_norm": NaN, | |
| "learning_rate": 9.93791358754765e-05, | |
| "loss": 0.0, | |
| "step": 177 | |
| }, | |
| { | |
| "epoch": 0.054132137155021666, | |
| "grad_norm": NaN, | |
| "learning_rate": 9.813750335678866e-05, | |
| "loss": 0.0, | |
| "step": 178 | |
| }, | |
| { | |
| "epoch": 0.05443625028510606, | |
| "grad_norm": NaN, | |
| "learning_rate": 9.689615801441774e-05, | |
| "loss": 0.0, | |
| "step": 179 | |
| }, | |
| { | |
| "epoch": 0.05474036341519045, | |
| "grad_norm": NaN, | |
| "learning_rate": 9.56552912500422e-05, | |
| "loss": 0.0, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 0.05504447654527484, | |
| "grad_norm": NaN, | |
| "learning_rate": 9.441509439154895e-05, | |
| "loss": 0.0, | |
| "step": 181 | |
| }, | |
| { | |
| "epoch": 0.05534858967535923, | |
| "grad_norm": NaN, | |
| "learning_rate": 9.317575866353292e-05, | |
| "loss": 0.0, | |
| "step": 182 | |
| }, | |
| { | |
| "epoch": 0.05565270280544363, | |
| "grad_norm": NaN, | |
| "learning_rate": 9.193747515781224e-05, | |
| "loss": 0.0, | |
| "step": 183 | |
| }, | |
| { | |
| "epoch": 0.055956815935528016, | |
| "grad_norm": NaN, | |
| "learning_rate": 9.070043480396404e-05, | |
| "loss": 0.0, | |
| "step": 184 | |
| }, | |
| { | |
| "epoch": 0.056260929065612406, | |
| "grad_norm": NaN, | |
| "learning_rate": 8.94648283398853e-05, | |
| "loss": 0.0, | |
| "step": 185 | |
| }, | |
| { | |
| "epoch": 0.0565650421956968, | |
| "grad_norm": NaN, | |
| "learning_rate": 8.823084628238298e-05, | |
| "loss": 0.0, | |
| "step": 186 | |
| }, | |
| { | |
| "epoch": 0.05686915532578119, | |
| "grad_norm": NaN, | |
| "learning_rate": 8.699867889779868e-05, | |
| "loss": 0.0, | |
| "step": 187 | |
| }, | |
| { | |
| "epoch": 0.05717326845586558, | |
| "grad_norm": NaN, | |
| "learning_rate": 8.57685161726715e-05, | |
| "loss": 0.0, | |
| "step": 188 | |
| }, | |
| { | |
| "epoch": 0.05747738158594997, | |
| "grad_norm": NaN, | |
| "learning_rate": 8.454054778444431e-05, | |
| "loss": 0.0, | |
| "step": 189 | |
| }, | |
| { | |
| "epoch": 0.057781494716034366, | |
| "grad_norm": NaN, | |
| "learning_rate": 8.331496307221762e-05, | |
| "loss": 0.0, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 0.058085607846118756, | |
| "grad_norm": NaN, | |
| "learning_rate": 8.209195100755551e-05, | |
| "loss": 0.0, | |
| "step": 191 | |
| }, | |
| { | |
| "epoch": 0.058389720976203145, | |
| "grad_norm": NaN, | |
| "learning_rate": 8.087170016534835e-05, | |
| "loss": 0.0, | |
| "step": 192 | |
| }, | |
| { | |
| "epoch": 0.05869383410628754, | |
| "grad_norm": NaN, | |
| "learning_rate": 7.965439869473664e-05, | |
| "loss": 0.0, | |
| "step": 193 | |
| }, | |
| { | |
| "epoch": 0.05899794723637193, | |
| "grad_norm": NaN, | |
| "learning_rate": 7.84402342901005e-05, | |
| "loss": 0.0, | |
| "step": 194 | |
| }, | |
| { | |
| "epoch": 0.05930206036645632, | |
| "grad_norm": NaN, | |
| "learning_rate": 7.722939416211937e-05, | |
| "loss": 0.0, | |
| "step": 195 | |
| }, | |
| { | |
| "epoch": 0.05960617349654071, | |
| "grad_norm": NaN, | |
| "learning_rate": 7.6022065008906e-05, | |
| "loss": 0.0, | |
| "step": 196 | |
| }, | |
| { | |
| "epoch": 0.059910286626625106, | |
| "grad_norm": NaN, | |
| "learning_rate": 7.481843298721982e-05, | |
| "loss": 0.0, | |
| "step": 197 | |
| }, | |
| { | |
| "epoch": 0.060214399756709495, | |
| "grad_norm": NaN, | |
| "learning_rate": 7.361868368376364e-05, | |
| "loss": 0.0, | |
| "step": 198 | |
| }, | |
| { | |
| "epoch": 0.060518512886793885, | |
| "grad_norm": NaN, | |
| "learning_rate": 7.242300208656814e-05, | |
| "loss": 0.0, | |
| "step": 199 | |
| }, | |
| { | |
| "epoch": 0.06082262601687828, | |
| "grad_norm": NaN, | |
| "learning_rate": 7.123157255646888e-05, | |
| "loss": 0.0, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.06112673914696267, | |
| "grad_norm": NaN, | |
| "learning_rate": 7.004457879867986e-05, | |
| "loss": 0.0, | |
| "step": 201 | |
| }, | |
| { | |
| "epoch": 0.06143085227704706, | |
| "grad_norm": NaN, | |
| "learning_rate": 6.886220383446814e-05, | |
| "loss": 0.0, | |
| "step": 202 | |
| }, | |
| { | |
| "epoch": 0.061734965407131456, | |
| "grad_norm": NaN, | |
| "learning_rate": 6.768462997293413e-05, | |
| "loss": 0.0, | |
| "step": 203 | |
| }, | |
| { | |
| "epoch": 0.062039078537215846, | |
| "grad_norm": NaN, | |
| "learning_rate": 6.651203878290139e-05, | |
| "loss": 0.0, | |
| "step": 204 | |
| }, | |
| { | |
| "epoch": 0.062343191667300235, | |
| "grad_norm": NaN, | |
| "learning_rate": 6.534461106492093e-05, | |
| "loss": 0.0, | |
| "step": 205 | |
| }, | |
| { | |
| "epoch": 0.06264730479738463, | |
| "grad_norm": NaN, | |
| "learning_rate": 6.418252682339361e-05, | |
| "loss": 0.0, | |
| "step": 206 | |
| }, | |
| { | |
| "epoch": 0.06295141792746901, | |
| "grad_norm": NaN, | |
| "learning_rate": 6.30259652388155e-05, | |
| "loss": 0.0, | |
| "step": 207 | |
| }, | |
| { | |
| "epoch": 0.06325553105755341, | |
| "grad_norm": NaN, | |
| "learning_rate": 6.187510464015022e-05, | |
| "loss": 0.0, | |
| "step": 208 | |
| }, | |
| { | |
| "epoch": 0.0635596441876378, | |
| "grad_norm": NaN, | |
| "learning_rate": 6.0730122477332675e-05, | |
| "loss": 0.0, | |
| "step": 209 | |
| }, | |
| { | |
| "epoch": 0.06386375731772219, | |
| "grad_norm": NaN, | |
| "learning_rate": 5.9591195293908174e-05, | |
| "loss": 0.0, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 0.06416787044780659, | |
| "grad_norm": NaN, | |
| "learning_rate": 5.845849869981137e-05, | |
| "loss": 0.0, | |
| "step": 211 | |
| }, | |
| { | |
| "epoch": 0.06447198357789098, | |
| "grad_norm": NaN, | |
| "learning_rate": 5.733220734428919e-05, | |
| "loss": 0.0, | |
| "step": 212 | |
| }, | |
| { | |
| "epoch": 0.06477609670797536, | |
| "grad_norm": NaN, | |
| "learning_rate": 5.621249488897176e-05, | |
| "loss": 0.0, | |
| "step": 213 | |
| }, | |
| { | |
| "epoch": 0.06508020983805976, | |
| "grad_norm": NaN, | |
| "learning_rate": 5.509953398109594e-05, | |
| "loss": 0.0, | |
| "step": 214 | |
| }, | |
| { | |
| "epoch": 0.06538432296814414, | |
| "grad_norm": NaN, | |
| "learning_rate": 5.399349622688479e-05, | |
| "loss": 0.0, | |
| "step": 215 | |
| }, | |
| { | |
| "epoch": 0.06568843609822854, | |
| "grad_norm": NaN, | |
| "learning_rate": 5.2894552165087916e-05, | |
| "loss": 0.0, | |
| "step": 216 | |
| }, | |
| { | |
| "epoch": 0.06599254922831294, | |
| "grad_norm": NaN, | |
| "learning_rate": 5.1802871240686234e-05, | |
| "loss": 0.0, | |
| "step": 217 | |
| }, | |
| { | |
| "epoch": 0.06629666235839732, | |
| "grad_norm": NaN, | |
| "learning_rate": 5.0718621778765476e-05, | |
| "loss": 0.0, | |
| "step": 218 | |
| }, | |
| { | |
| "epoch": 0.06660077548848171, | |
| "grad_norm": NaN, | |
| "learning_rate": 4.9641970958562366e-05, | |
| "loss": 0.0, | |
| "step": 219 | |
| }, | |
| { | |
| "epoch": 0.06690488861856611, | |
| "grad_norm": NaN, | |
| "learning_rate": 4.8573084787687326e-05, | |
| "loss": 0.0, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 0.0672090017486505, | |
| "grad_norm": NaN, | |
| "learning_rate": 4.751212807652806e-05, | |
| "loss": 0.0, | |
| "step": 221 | |
| }, | |
| { | |
| "epoch": 0.06751311487873489, | |
| "grad_norm": NaN, | |
| "learning_rate": 4.6459264412837454e-05, | |
| "loss": 0.0, | |
| "step": 222 | |
| }, | |
| { | |
| "epoch": 0.06781722800881929, | |
| "grad_norm": NaN, | |
| "learning_rate": 4.5414656136510334e-05, | |
| "loss": 0.0, | |
| "step": 223 | |
| }, | |
| { | |
| "epoch": 0.06812134113890367, | |
| "grad_norm": NaN, | |
| "learning_rate": 4.437846431455249e-05, | |
| "loss": 0.0, | |
| "step": 224 | |
| }, | |
| { | |
| "epoch": 0.06842545426898806, | |
| "grad_norm": NaN, | |
| "learning_rate": 4.335084871624572e-05, | |
| "loss": 0.0, | |
| "step": 225 | |
| }, | |
| { | |
| "epoch": 0.06872956739907246, | |
| "grad_norm": NaN, | |
| "learning_rate": 4.2331967788513295e-05, | |
| "loss": 0.0, | |
| "step": 226 | |
| }, | |
| { | |
| "epoch": 0.06903368052915684, | |
| "grad_norm": NaN, | |
| "learning_rate": 4.132197863148925e-05, | |
| "loss": 0.0, | |
| "step": 227 | |
| }, | |
| { | |
| "epoch": 0.06933779365924124, | |
| "grad_norm": NaN, | |
| "learning_rate": 4.0321036974295156e-05, | |
| "loss": 0.0, | |
| "step": 228 | |
| }, | |
| { | |
| "epoch": 0.06933779365924124, | |
| "eval_loss": NaN, | |
| "eval_runtime": 1405.1275, | |
| "eval_samples_per_second": 3.941, | |
| "eval_steps_per_second": 0.986, | |
| "step": 228 | |
| }, | |
| { | |
| "epoch": 0.06964190678932564, | |
| "grad_norm": NaN, | |
| "learning_rate": 3.932929715102863e-05, | |
| "loss": 0.0, | |
| "step": 229 | |
| }, | |
| { | |
| "epoch": 0.06994601991941002, | |
| "grad_norm": NaN, | |
| "learning_rate": 3.834691207696649e-05, | |
| "loss": 0.0, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 0.07025013304949441, | |
| "grad_norm": NaN, | |
| "learning_rate": 3.7374033224987084e-05, | |
| "loss": 0.0, | |
| "step": 231 | |
| }, | |
| { | |
| "epoch": 0.0705542461795788, | |
| "grad_norm": NaN, | |
| "learning_rate": 3.6410810602214684e-05, | |
| "loss": 0.0, | |
| "step": 232 | |
| }, | |
| { | |
| "epoch": 0.0708583593096632, | |
| "grad_norm": NaN, | |
| "learning_rate": 3.5457392726890236e-05, | |
| "loss": 0.0, | |
| "step": 233 | |
| }, | |
| { | |
| "epoch": 0.07116247243974759, | |
| "grad_norm": NaN, | |
| "learning_rate": 3.45139266054715e-05, | |
| "loss": 0.0, | |
| "step": 234 | |
| }, | |
| { | |
| "epoch": 0.07146658556983197, | |
| "grad_norm": NaN, | |
| "learning_rate": 3.3580557709966066e-05, | |
| "loss": 0.0, | |
| "step": 235 | |
| }, | |
| { | |
| "epoch": 0.07177069869991637, | |
| "grad_norm": NaN, | |
| "learning_rate": 3.2657429955501394e-05, | |
| "loss": 0.0, | |
| "step": 236 | |
| }, | |
| { | |
| "epoch": 0.07207481183000077, | |
| "grad_norm": NaN, | |
| "learning_rate": 3.174468567813461e-05, | |
| "loss": 0.0, | |
| "step": 237 | |
| }, | |
| { | |
| "epoch": 0.07237892496008515, | |
| "grad_norm": NaN, | |
| "learning_rate": 3.0842465612905837e-05, | |
| "loss": 0.0, | |
| "step": 238 | |
| }, | |
| { | |
| "epoch": 0.07268303809016954, | |
| "grad_norm": NaN, | |
| "learning_rate": 2.9950908872138584e-05, | |
| "loss": 0.0, | |
| "step": 239 | |
| }, | |
| { | |
| "epoch": 0.07298715122025394, | |
| "grad_norm": NaN, | |
| "learning_rate": 2.9070152923989946e-05, | |
| "loss": 0.0, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 0.07329126435033832, | |
| "grad_norm": NaN, | |
| "learning_rate": 2.82003335712546e-05, | |
| "loss": 0.0, | |
| "step": 241 | |
| }, | |
| { | |
| "epoch": 0.07359537748042272, | |
| "grad_norm": NaN, | |
| "learning_rate": 2.7341584930425657e-05, | |
| "loss": 0.0, | |
| "step": 242 | |
| }, | |
| { | |
| "epoch": 0.07389949061050712, | |
| "grad_norm": NaN, | |
| "learning_rate": 2.6494039411015193e-05, | |
| "loss": 0.0, | |
| "step": 243 | |
| }, | |
| { | |
| "epoch": 0.0742036037405915, | |
| "grad_norm": NaN, | |
| "learning_rate": 2.5657827695138372e-05, | |
| "loss": 0.0, | |
| "step": 244 | |
| }, | |
| { | |
| "epoch": 0.0745077168706759, | |
| "grad_norm": NaN, | |
| "learning_rate": 2.4833078717363544e-05, | |
| "loss": 0.0, | |
| "step": 245 | |
| }, | |
| { | |
| "epoch": 0.07481183000076028, | |
| "grad_norm": NaN, | |
| "learning_rate": 2.4019919644832023e-05, | |
| "loss": 0.0, | |
| "step": 246 | |
| }, | |
| { | |
| "epoch": 0.07511594313084467, | |
| "grad_norm": NaN, | |
| "learning_rate": 2.3218475857650346e-05, | |
| "loss": 0.0, | |
| "step": 247 | |
| }, | |
| { | |
| "epoch": 0.07542005626092907, | |
| "grad_norm": NaN, | |
| "learning_rate": 2.242887092955801e-05, | |
| "loss": 0.0, | |
| "step": 248 | |
| }, | |
| { | |
| "epoch": 0.07572416939101345, | |
| "grad_norm": NaN, | |
| "learning_rate": 2.1651226608873877e-05, | |
| "loss": 0.0, | |
| "step": 249 | |
| }, | |
| { | |
| "epoch": 0.07602828252109785, | |
| "grad_norm": NaN, | |
| "learning_rate": 2.0885662799723804e-05, | |
| "loss": 0.0, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.07633239565118224, | |
| "grad_norm": NaN, | |
| "learning_rate": 2.0132297543552757e-05, | |
| "loss": 0.0, | |
| "step": 251 | |
| }, | |
| { | |
| "epoch": 0.07663650878126663, | |
| "grad_norm": NaN, | |
| "learning_rate": 1.939124700092423e-05, | |
| "loss": 0.0, | |
| "step": 252 | |
| }, | |
| { | |
| "epoch": 0.07694062191135102, | |
| "grad_norm": NaN, | |
| "learning_rate": 1.866262543360958e-05, | |
| "loss": 0.0, | |
| "step": 253 | |
| }, | |
| { | |
| "epoch": 0.07724473504143542, | |
| "grad_norm": NaN, | |
| "learning_rate": 1.7946545186970022e-05, | |
| "loss": 0.0, | |
| "step": 254 | |
| }, | |
| { | |
| "epoch": 0.0775488481715198, | |
| "grad_norm": NaN, | |
| "learning_rate": 1.7243116672634262e-05, | |
| "loss": 0.0, | |
| "step": 255 | |
| }, | |
| { | |
| "epoch": 0.0778529613016042, | |
| "grad_norm": NaN, | |
| "learning_rate": 1.6552448351474304e-05, | |
| "loss": 0.0, | |
| "step": 256 | |
| }, | |
| { | |
| "epoch": 0.0781570744316886, | |
| "grad_norm": NaN, | |
| "learning_rate": 1.587464671688187e-05, | |
| "loss": 0.0, | |
| "step": 257 | |
| }, | |
| { | |
| "epoch": 0.07846118756177298, | |
| "grad_norm": NaN, | |
| "learning_rate": 1.520981627834851e-05, | |
| "loss": 0.0, | |
| "step": 258 | |
| }, | |
| { | |
| "epoch": 0.07876530069185737, | |
| "grad_norm": NaN, | |
| "learning_rate": 1.4558059545351143e-05, | |
| "loss": 0.0, | |
| "step": 259 | |
| }, | |
| { | |
| "epoch": 0.07906941382194176, | |
| "grad_norm": NaN, | |
| "learning_rate": 1.3919477011546423e-05, | |
| "loss": 0.0, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 0.07937352695202615, | |
| "grad_norm": NaN, | |
| "learning_rate": 1.3294167139275593e-05, | |
| "loss": 0.0, | |
| "step": 261 | |
| }, | |
| { | |
| "epoch": 0.07967764008211055, | |
| "grad_norm": NaN, | |
| "learning_rate": 1.2682226344382796e-05, | |
| "loss": 0.0, | |
| "step": 262 | |
| }, | |
| { | |
| "epoch": 0.07998175321219493, | |
| "grad_norm": NaN, | |
| "learning_rate": 1.208374898134883e-05, | |
| "loss": 0.0, | |
| "step": 263 | |
| }, | |
| { | |
| "epoch": 0.08028586634227933, | |
| "grad_norm": NaN, | |
| "learning_rate": 1.1498827328742623e-05, | |
| "loss": 0.0, | |
| "step": 264 | |
| }, | |
| { | |
| "epoch": 0.08058997947236372, | |
| "grad_norm": NaN, | |
| "learning_rate": 1.0927551574992967e-05, | |
| "loss": 0.0, | |
| "step": 265 | |
| }, | |
| { | |
| "epoch": 0.0808940926024481, | |
| "grad_norm": NaN, | |
| "learning_rate": 1.0370009804482483e-05, | |
| "loss": 0.0, | |
| "step": 266 | |
| }, | |
| { | |
| "epoch": 0.0811982057325325, | |
| "grad_norm": NaN, | |
| "learning_rate": 9.82628798396592e-06, | |
| "loss": 0.0, | |
| "step": 267 | |
| }, | |
| { | |
| "epoch": 0.0815023188626169, | |
| "grad_norm": NaN, | |
| "learning_rate": 9.296469949315156e-06, | |
| "loss": 0.0, | |
| "step": 268 | |
| }, | |
| { | |
| "epoch": 0.08180643199270128, | |
| "grad_norm": NaN, | |
| "learning_rate": 8.780637392592495e-06, | |
| "loss": 0.0, | |
| "step": 269 | |
| }, | |
| { | |
| "epoch": 0.08211054512278568, | |
| "grad_norm": NaN, | |
| "learning_rate": 8.278869849454718e-06, | |
| "loss": 0.0, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 0.08241465825287007, | |
| "grad_norm": NaN, | |
| "learning_rate": 7.791244686889588e-06, | |
| "loss": 0.0, | |
| "step": 271 | |
| }, | |
| { | |
| "epoch": 0.08271877138295446, | |
| "grad_norm": NaN, | |
| "learning_rate": 7.317837091286706e-06, | |
| "loss": 0.0, | |
| "step": 272 | |
| }, | |
| { | |
| "epoch": 0.08302288451303885, | |
| "grad_norm": NaN, | |
| "learning_rate": 6.858720056844614e-06, | |
| "loss": 0.0, | |
| "step": 273 | |
| }, | |
| { | |
| "epoch": 0.08332699764312324, | |
| "grad_norm": NaN, | |
| "learning_rate": 6.413964374315851e-06, | |
| "loss": 0.0, | |
| "step": 274 | |
| }, | |
| { | |
| "epoch": 0.08363111077320763, | |
| "grad_norm": NaN, | |
| "learning_rate": 5.983638620091858e-06, | |
| "loss": 0.0, | |
| "step": 275 | |
| }, | |
| { | |
| "epoch": 0.08393522390329203, | |
| "grad_norm": NaN, | |
| "learning_rate": 5.567809145629244e-06, | |
| "loss": 0.0, | |
| "step": 276 | |
| }, | |
| { | |
| "epoch": 0.08423933703337641, | |
| "grad_norm": NaN, | |
| "learning_rate": 5.1665400672190725e-06, | |
| "loss": 0.0, | |
| "step": 277 | |
| }, | |
| { | |
| "epoch": 0.0845434501634608, | |
| "grad_norm": NaN, | |
| "learning_rate": 4.7798932561009865e-06, | |
| "loss": 0.0, | |
| "step": 278 | |
| }, | |
| { | |
| "epoch": 0.0848475632935452, | |
| "grad_norm": NaN, | |
| "learning_rate": 4.407928328923194e-06, | |
| "loss": 0.0, | |
| "step": 279 | |
| }, | |
| { | |
| "epoch": 0.08515167642362959, | |
| "grad_norm": NaN, | |
| "learning_rate": 4.050702638550275e-06, | |
| "loss": 0.0, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 0.08545578955371398, | |
| "grad_norm": NaN, | |
| "learning_rate": 3.7082712652200867e-06, | |
| "loss": 0.0, | |
| "step": 281 | |
| }, | |
| { | |
| "epoch": 0.08575990268379838, | |
| "grad_norm": NaN, | |
| "learning_rate": 3.380687008050909e-06, | |
| "loss": 0.0, | |
| "step": 282 | |
| }, | |
| { | |
| "epoch": 0.08606401581388276, | |
| "grad_norm": NaN, | |
| "learning_rate": 3.068000376900515e-06, | |
| "loss": 0.0, | |
| "step": 283 | |
| }, | |
| { | |
| "epoch": 0.08636812894396716, | |
| "grad_norm": NaN, | |
| "learning_rate": 2.770259584577972e-06, | |
| "loss": 0.0, | |
| "step": 284 | |
| }, | |
| { | |
| "epoch": 0.08667224207405155, | |
| "grad_norm": NaN, | |
| "learning_rate": 2.4875105394098654e-06, | |
| "loss": 0.0, | |
| "step": 285 | |
| }, | |
| { | |
| "epoch": 0.08697635520413594, | |
| "grad_norm": NaN, | |
| "learning_rate": 2.219796838161681e-06, | |
| "loss": 0.0, | |
| "step": 286 | |
| }, | |
| { | |
| "epoch": 0.08728046833422033, | |
| "grad_norm": NaN, | |
| "learning_rate": 1.967159759315751e-06, | |
| "loss": 0.0, | |
| "step": 287 | |
| }, | |
| { | |
| "epoch": 0.08758458146430473, | |
| "grad_norm": NaN, | |
| "learning_rate": 1.7296382567064672e-06, | |
| "loss": 0.0, | |
| "step": 288 | |
| }, | |
| { | |
| "epoch": 0.08788869459438911, | |
| "grad_norm": NaN, | |
| "learning_rate": 1.5072689535141072e-06, | |
| "loss": 0.0, | |
| "step": 289 | |
| }, | |
| { | |
| "epoch": 0.08819280772447351, | |
| "grad_norm": NaN, | |
| "learning_rate": 1.3000861366179062e-06, | |
| "loss": 0.0, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 0.08849692085455789, | |
| "grad_norm": NaN, | |
| "learning_rate": 1.1081217513094212e-06, | |
| "loss": 0.0, | |
| "step": 291 | |
| }, | |
| { | |
| "epoch": 0.08880103398464229, | |
| "grad_norm": NaN, | |
| "learning_rate": 9.314053963669245e-07, | |
| "loss": 0.0, | |
| "step": 292 | |
| }, | |
| { | |
| "epoch": 0.08910514711472668, | |
| "grad_norm": NaN, | |
| "learning_rate": 7.699643194915784e-07, | |
| "loss": 0.0, | |
| "step": 293 | |
| }, | |
| { | |
| "epoch": 0.08940926024481106, | |
| "grad_norm": NaN, | |
| "learning_rate": 6.238234131061616e-07, | |
| "loss": 0.0, | |
| "step": 294 | |
| }, | |
| { | |
| "epoch": 0.08971337337489546, | |
| "grad_norm": NaN, | |
| "learning_rate": 4.93005210516928e-07, | |
| "loss": 0.0, | |
| "step": 295 | |
| }, | |
| { | |
| "epoch": 0.09001748650497986, | |
| "grad_norm": NaN, | |
| "learning_rate": 3.775298824391982e-07, | |
| "loss": 0.0, | |
| "step": 296 | |
| }, | |
| { | |
| "epoch": 0.09032159963506424, | |
| "grad_norm": NaN, | |
| "learning_rate": 2.774152338873126e-07, | |
| "loss": 0.0, | |
| "step": 297 | |
| }, | |
| { | |
| "epoch": 0.09062571276514864, | |
| "grad_norm": NaN, | |
| "learning_rate": 1.9267670142926187e-07, | |
| "loss": 0.0, | |
| "step": 298 | |
| }, | |
| { | |
| "epoch": 0.09092982589523303, | |
| "grad_norm": NaN, | |
| "learning_rate": 1.2332735080651248e-07, | |
| "loss": 0.0, | |
| "step": 299 | |
| }, | |
| { | |
| "epoch": 0.09123393902531741, | |
| "grad_norm": NaN, | |
| "learning_rate": 6.9377874919474e-08, | |
| "loss": 0.0, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.09153805215540181, | |
| "grad_norm": NaN, | |
| "learning_rate": 3.0836592178717926e-08, | |
| "loss": 0.0, | |
| "step": 301 | |
| }, | |
| { | |
| "epoch": 0.09184216528548621, | |
| "grad_norm": NaN, | |
| "learning_rate": 7.709445222403577e-09, | |
| "loss": 0.0, | |
| "step": 302 | |
| }, | |
| { | |
| "epoch": 0.09214627841557059, | |
| "grad_norm": NaN, | |
| "learning_rate": 0.0, | |
| "loss": 0.0, | |
| "step": 303 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 303, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 1, | |
| "save_steps": 76, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 2.06572946950665e+18, | |
| "train_batch_size": 2, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |