Instructions to use issdandavis/tongue-table-lora-brick2-hf-v1 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use issdandavis/tongue-table-lora-brick2-hf-v1 with Transformers:
# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("issdandavis/tongue-table-lora-brick2-hf-v1", device_map="auto") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 10.17094017094017, | |
| "eval_steps": 25, | |
| "global_step": 600, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.08547008547008547, | |
| "grad_norm": 32.45793533325195, | |
| "learning_rate": 5e-06, | |
| "loss": 4.3981, | |
| "step": 5 | |
| }, | |
| { | |
| "epoch": 0.17094017094017094, | |
| "grad_norm": 19.99646759033203, | |
| "learning_rate": 1e-05, | |
| "loss": 3.809, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.2564102564102564, | |
| "grad_norm": 10.912039756774902, | |
| "learning_rate": 1.5000000000000002e-05, | |
| "loss": 2.9424, | |
| "step": 15 | |
| }, | |
| { | |
| "epoch": 0.3418803418803419, | |
| "grad_norm": 6.190257549285889, | |
| "learning_rate": 2e-05, | |
| "loss": 2.2027, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.42735042735042733, | |
| "grad_norm": 4.5474066734313965, | |
| "learning_rate": 1.9996332862232843e-05, | |
| "loss": 1.6336, | |
| "step": 25 | |
| }, | |
| { | |
| "epoch": 0.42735042735042733, | |
| "eval_loss": 1.4425157308578491, | |
| "eval_runtime": 2.8029, | |
| "eval_samples_per_second": 37.105, | |
| "eval_steps_per_second": 9.276, | |
| "step": 25 | |
| }, | |
| { | |
| "epoch": 0.5128205128205128, | |
| "grad_norm": 3.2563352584838867, | |
| "learning_rate": 1.998533413851124e-05, | |
| "loss": 1.2988, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.5982905982905983, | |
| "grad_norm": 2.3913843631744385, | |
| "learning_rate": 1.996701189560223e-05, | |
| "loss": 1.0025, | |
| "step": 35 | |
| }, | |
| { | |
| "epoch": 0.6837606837606838, | |
| "grad_norm": 1.783568263053894, | |
| "learning_rate": 1.9941379571543597e-05, | |
| "loss": 0.8304, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.7692307692307693, | |
| "grad_norm": 1.4403300285339355, | |
| "learning_rate": 1.990845596578807e-05, | |
| "loss": 0.7449, | |
| "step": 45 | |
| }, | |
| { | |
| "epoch": 0.8547008547008547, | |
| "grad_norm": 1.1698269844055176, | |
| "learning_rate": 1.9868265225415263e-05, | |
| "loss": 0.6516, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.8547008547008547, | |
| "eval_loss": 0.624435305595398, | |
| "eval_runtime": 2.8155, | |
| "eval_samples_per_second": 36.938, | |
| "eval_steps_per_second": 9.235, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.9401709401709402, | |
| "grad_norm": 1.210651159286499, | |
| "learning_rate": 1.982083682742156e-05, | |
| "loss": 0.5538, | |
| "step": 55 | |
| }, | |
| { | |
| "epoch": 1.017094017094017, | |
| "grad_norm": 1.0749378204345703, | |
| "learning_rate": 1.976620555710087e-05, | |
| "loss": 0.5287, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 1.1025641025641026, | |
| "grad_norm": 0.9600836634635925, | |
| "learning_rate": 1.9704411482532116e-05, | |
| "loss": 0.4221, | |
| "step": 65 | |
| }, | |
| { | |
| "epoch": 1.188034188034188, | |
| "grad_norm": 0.8946885466575623, | |
| "learning_rate": 1.963549992519223e-05, | |
| "loss": 0.4017, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 1.2735042735042734, | |
| "grad_norm": 1.0423543453216553, | |
| "learning_rate": 1.955952142671612e-05, | |
| "loss": 0.3492, | |
| "step": 75 | |
| }, | |
| { | |
| "epoch": 1.2735042735042734, | |
| "eval_loss": 0.3717593550682068, | |
| "eval_runtime": 2.8255, | |
| "eval_samples_per_second": 36.808, | |
| "eval_steps_per_second": 9.202, | |
| "step": 75 | |
| }, | |
| { | |
| "epoch": 1.358974358974359, | |
| "grad_norm": 1.1442183256149292, | |
| "learning_rate": 1.9476531711828027e-05, | |
| "loss": 0.3272, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 1.4444444444444444, | |
| "grad_norm": 1.044005036354065, | |
| "learning_rate": 1.9386591647471508e-05, | |
| "loss": 0.3404, | |
| "step": 85 | |
| }, | |
| { | |
| "epoch": 1.5299145299145298, | |
| "grad_norm": 0.9060975909233093, | |
| "learning_rate": 1.9289767198167918e-05, | |
| "loss": 0.2949, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 1.6153846153846154, | |
| "grad_norm": 0.8754892349243164, | |
| "learning_rate": 1.918612937763622e-05, | |
| "loss": 0.2891, | |
| "step": 95 | |
| }, | |
| { | |
| "epoch": 1.7008547008547008, | |
| "grad_norm": 0.800922155380249, | |
| "learning_rate": 1.9075754196709574e-05, | |
| "loss": 0.2856, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 1.7008547008547008, | |
| "eval_loss": 0.2841126620769501, | |
| "eval_runtime": 2.8509, | |
| "eval_samples_per_second": 36.48, | |
| "eval_steps_per_second": 9.12, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 1.7863247863247862, | |
| "grad_norm": 0.5995078086853027, | |
| "learning_rate": 1.8958722607586883e-05, | |
| "loss": 0.2723, | |
| "step": 105 | |
| }, | |
| { | |
| "epoch": 1.8717948717948718, | |
| "grad_norm": 0.853714108467102, | |
| "learning_rate": 1.883512044446023e-05, | |
| "loss": 0.2603, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 1.9572649572649574, | |
| "grad_norm": 0.7114328145980835, | |
| "learning_rate": 1.8705038360561724e-05, | |
| "loss": 0.242, | |
| "step": 115 | |
| }, | |
| { | |
| "epoch": 2.034188034188034, | |
| "grad_norm": 0.6991967558860779, | |
| "learning_rate": 1.8568571761675893e-05, | |
| "loss": 0.2516, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 2.1196581196581197, | |
| "grad_norm": 0.6714396476745605, | |
| "learning_rate": 1.8425820736166492e-05, | |
| "loss": 0.2498, | |
| "step": 125 | |
| }, | |
| { | |
| "epoch": 2.1196581196581197, | |
| "eval_loss": 0.24386820197105408, | |
| "eval_runtime": 2.863, | |
| "eval_samples_per_second": 36.325, | |
| "eval_steps_per_second": 9.081, | |
| "step": 125 | |
| }, | |
| { | |
| "epoch": 2.2051282051282053, | |
| "grad_norm": 0.8048965930938721, | |
| "learning_rate": 1.827688998156891e-05, | |
| "loss": 0.2227, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 2.2905982905982905, | |
| "grad_norm": 0.6397609710693359, | |
| "learning_rate": 1.8121888727802113e-05, | |
| "loss": 0.2229, | |
| "step": 135 | |
| }, | |
| { | |
| "epoch": 2.376068376068376, | |
| "grad_norm": 0.7434533834457397, | |
| "learning_rate": 1.796093065705644e-05, | |
| "loss": 0.2352, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 2.4615384615384617, | |
| "grad_norm": 0.8520599603652954, | |
| "learning_rate": 1.7794133820415916e-05, | |
| "loss": 0.2134, | |
| "step": 145 | |
| }, | |
| { | |
| "epoch": 2.547008547008547, | |
| "grad_norm": 0.6550760269165039, | |
| "learning_rate": 1.7621620551276366e-05, | |
| "loss": 0.2088, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 2.547008547008547, | |
| "eval_loss": 0.22272011637687683, | |
| "eval_runtime": 2.8848, | |
| "eval_samples_per_second": 36.051, | |
| "eval_steps_per_second": 9.013, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 2.6324786324786325, | |
| "grad_norm": 0.6515322923660278, | |
| "learning_rate": 1.7443517375622706e-05, | |
| "loss": 0.2042, | |
| "step": 155 | |
| }, | |
| { | |
| "epoch": 2.717948717948718, | |
| "grad_norm": 0.7250323295593262, | |
| "learning_rate": 1.725995491923131e-05, | |
| "loss": 0.1992, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 2.8034188034188032, | |
| "grad_norm": 0.6800098419189453, | |
| "learning_rate": 1.7071067811865477e-05, | |
| "loss": 0.1989, | |
| "step": 165 | |
| }, | |
| { | |
| "epoch": 2.888888888888889, | |
| "grad_norm": 0.6262602806091309, | |
| "learning_rate": 1.6876994588534234e-05, | |
| "loss": 0.181, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 2.9743589743589745, | |
| "grad_norm": 0.6131544709205627, | |
| "learning_rate": 1.6677877587886956e-05, | |
| "loss": 0.1943, | |
| "step": 175 | |
| }, | |
| { | |
| "epoch": 2.9743589743589745, | |
| "eval_loss": 0.21058152616024017, | |
| "eval_runtime": 2.8948, | |
| "eval_samples_per_second": 35.926, | |
| "eval_steps_per_second": 8.982, | |
| "step": 175 | |
| }, | |
| { | |
| "epoch": 3.051282051282051, | |
| "grad_norm": 0.8641460537910461, | |
| "learning_rate": 1.647386284781828e-05, | |
| "loss": 0.2097, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 3.1367521367521367, | |
| "grad_norm": 0.6487774848937988, | |
| "learning_rate": 1.6265099998359868e-05, | |
| "loss": 0.1946, | |
| "step": 185 | |
| }, | |
| { | |
| "epoch": 3.2222222222222223, | |
| "grad_norm": 0.46343570947647095, | |
| "learning_rate": 1.6051742151937655e-05, | |
| "loss": 0.1822, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 3.3076923076923075, | |
| "grad_norm": 0.6039112210273743, | |
| "learning_rate": 1.5833945791074943e-05, | |
| "loss": 0.1835, | |
| "step": 195 | |
| }, | |
| { | |
| "epoch": 3.393162393162393, | |
| "grad_norm": 0.6336061954498291, | |
| "learning_rate": 1.5611870653623826e-05, | |
| "loss": 0.1809, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 3.393162393162393, | |
| "eval_loss": 0.19848760962486267, | |
| "eval_runtime": 2.9181, | |
| "eval_samples_per_second": 35.639, | |
| "eval_steps_per_second": 8.91, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 3.4786324786324787, | |
| "grad_norm": 0.5978764891624451, | |
| "learning_rate": 1.5385679615609045e-05, | |
| "loss": 0.1861, | |
| "step": 205 | |
| }, | |
| { | |
| "epoch": 3.564102564102564, | |
| "grad_norm": 0.6086897253990173, | |
| "learning_rate": 1.515553857177022e-05, | |
| "loss": 0.1848, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 3.6495726495726495, | |
| "grad_norm": 0.6077982783317566, | |
| "learning_rate": 1.4921616313890073e-05, | |
| "loss": 0.1705, | |
| "step": 215 | |
| }, | |
| { | |
| "epoch": 3.735042735042735, | |
| "grad_norm": 0.5378933548927307, | |
| "learning_rate": 1.4684084406997903e-05, | |
| "loss": 0.1905, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 3.8205128205128203, | |
| "grad_norm": 0.6793361306190491, | |
| "learning_rate": 1.4443117063539039e-05, | |
| "loss": 0.1801, | |
| "step": 225 | |
| }, | |
| { | |
| "epoch": 3.8205128205128203, | |
| "eval_loss": 0.19124998152256012, | |
| "eval_runtime": 2.947, | |
| "eval_samples_per_second": 35.29, | |
| "eval_steps_per_second": 8.823, | |
| "step": 225 | |
| }, | |
| { | |
| "epoch": 3.905982905982906, | |
| "grad_norm": 0.6194397807121277, | |
| "learning_rate": 1.4198891015602648e-05, | |
| "loss": 0.1766, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 3.9914529914529915, | |
| "grad_norm": 0.5509461760520935, | |
| "learning_rate": 1.3951585385301557e-05, | |
| "loss": 0.1882, | |
| "step": 235 | |
| }, | |
| { | |
| "epoch": 4.068376068376068, | |
| "grad_norm": 0.7895352840423584, | |
| "learning_rate": 1.3701381553399147e-05, | |
| "loss": 0.1846, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 4.153846153846154, | |
| "grad_norm": 0.6293951272964478, | |
| "learning_rate": 1.3448463026279706e-05, | |
| "loss": 0.1788, | |
| "step": 245 | |
| }, | |
| { | |
| "epoch": 4.239316239316239, | |
| "grad_norm": 0.5566557049751282, | |
| "learning_rate": 1.31930153013598e-05, | |
| "loss": 0.159, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 4.239316239316239, | |
| "eval_loss": 0.1850532740354538, | |
| "eval_runtime": 2.9696, | |
| "eval_samples_per_second": 35.021, | |
| "eval_steps_per_second": 8.755, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 4.3247863247863245, | |
| "grad_norm": 0.5719231367111206, | |
| "learning_rate": 1.2935225731039349e-05, | |
| "loss": 0.1846, | |
| "step": 255 | |
| }, | |
| { | |
| "epoch": 4.410256410256411, | |
| "grad_norm": 0.5705691576004028, | |
| "learning_rate": 1.2675283385292212e-05, | |
| "loss": 0.1711, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 4.495726495726496, | |
| "grad_norm": 0.6631448268890381, | |
| "learning_rate": 1.2413378912997058e-05, | |
| "loss": 0.1633, | |
| "step": 265 | |
| }, | |
| { | |
| "epoch": 4.581196581196581, | |
| "grad_norm": 0.4862598478794098, | |
| "learning_rate": 1.2149704402110243e-05, | |
| "loss": 0.167, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 4.666666666666667, | |
| "grad_norm": 0.5664910674095154, | |
| "learning_rate": 1.1884453238783185e-05, | |
| "loss": 0.1703, | |
| "step": 275 | |
| }, | |
| { | |
| "epoch": 4.666666666666667, | |
| "eval_loss": 0.1804552972316742, | |
| "eval_runtime": 2.9573, | |
| "eval_samples_per_second": 35.168, | |
| "eval_steps_per_second": 8.792, | |
| "step": 275 | |
| }, | |
| { | |
| "epoch": 4.752136752136752, | |
| "grad_norm": 0.5878341197967529, | |
| "learning_rate": 1.161781996552765e-05, | |
| "loss": 0.1742, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 4.837606837606837, | |
| "grad_norm": 0.6206562519073486, | |
| "learning_rate": 1.1350000138532902e-05, | |
| "loss": 0.171, | |
| "step": 285 | |
| }, | |
| { | |
| "epoch": 4.923076923076923, | |
| "grad_norm": 0.48724639415740967, | |
| "learning_rate": 1.1081190184239418e-05, | |
| "loss": 0.1621, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 5.0, | |
| "grad_norm": 0.9257501363754272, | |
| "learning_rate": 1.0811587255274313e-05, | |
| "loss": 0.1698, | |
| "step": 295 | |
| }, | |
| { | |
| "epoch": 5.085470085470085, | |
| "grad_norm": 0.5715455412864685, | |
| "learning_rate": 1.0541389085854177e-05, | |
| "loss": 0.1696, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 5.085470085470085, | |
| "eval_loss": 0.1769082248210907, | |
| "eval_runtime": 2.9677, | |
| "eval_samples_per_second": 35.043, | |
| "eval_steps_per_second": 8.761, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 5.170940170940171, | |
| "grad_norm": 0.4863035976886749, | |
| "learning_rate": 1.0270793846761347e-05, | |
| "loss": 0.158, | |
| "step": 305 | |
| }, | |
| { | |
| "epoch": 5.256410256410256, | |
| "grad_norm": 0.39815396070480347, | |
| "learning_rate": 1e-05, | |
| "loss": 0.1557, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 5.3418803418803416, | |
| "grad_norm": 0.560039222240448, | |
| "learning_rate": 9.729206153238658e-06, | |
| "loss": 0.1731, | |
| "step": 315 | |
| }, | |
| { | |
| "epoch": 5.427350427350428, | |
| "grad_norm": 0.4191257953643799, | |
| "learning_rate": 9.458610914145826e-06, | |
| "loss": 0.1565, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 5.512820512820513, | |
| "grad_norm": 0.7958483099937439, | |
| "learning_rate": 9.18841274472569e-06, | |
| "loss": 0.1673, | |
| "step": 325 | |
| }, | |
| { | |
| "epoch": 5.512820512820513, | |
| "eval_loss": 0.1737748235464096, | |
| "eval_runtime": 2.9693, | |
| "eval_samples_per_second": 35.025, | |
| "eval_steps_per_second": 8.756, | |
| "step": 325 | |
| }, | |
| { | |
| "epoch": 5.598290598290598, | |
| "grad_norm": 0.46690189838409424, | |
| "learning_rate": 8.918809815760585e-06, | |
| "loss": 0.1623, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 5.683760683760684, | |
| "grad_norm": 0.553860068321228, | |
| "learning_rate": 8.6499998614671e-06, | |
| "loss": 0.1592, | |
| "step": 335 | |
| }, | |
| { | |
| "epoch": 5.769230769230769, | |
| "grad_norm": 0.38637080788612366, | |
| "learning_rate": 8.382180034472353e-06, | |
| "loss": 0.1571, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 5.854700854700854, | |
| "grad_norm": 0.5259572267532349, | |
| "learning_rate": 8.115546761216822e-06, | |
| "loss": 0.1703, | |
| "step": 345 | |
| }, | |
| { | |
| "epoch": 5.94017094017094, | |
| "grad_norm": 0.5691083073616028, | |
| "learning_rate": 7.85029559788976e-06, | |
| "loss": 0.1644, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 5.94017094017094, | |
| "eval_loss": 0.1712963730096817, | |
| "eval_runtime": 2.9593, | |
| "eval_samples_per_second": 35.144, | |
| "eval_steps_per_second": 8.786, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 6.017094017094017, | |
| "grad_norm": 0.5517910122871399, | |
| "learning_rate": 7.586621087002945e-06, | |
| "loss": 0.1697, | |
| "step": 355 | |
| }, | |
| { | |
| "epoch": 6.102564102564102, | |
| "grad_norm": 0.49558934569358826, | |
| "learning_rate": 7.324716614707794e-06, | |
| "loss": 0.1576, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 6.188034188034188, | |
| "grad_norm": 0.5838133096694946, | |
| "learning_rate": 7.064774268960654e-06, | |
| "loss": 0.1658, | |
| "step": 365 | |
| }, | |
| { | |
| "epoch": 6.273504273504273, | |
| "grad_norm": 0.48898056149482727, | |
| "learning_rate": 6.806984698640202e-06, | |
| "loss": 0.1635, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 6.358974358974359, | |
| "grad_norm": 0.5615982413291931, | |
| "learning_rate": 6.551536973720298e-06, | |
| "loss": 0.1524, | |
| "step": 375 | |
| }, | |
| { | |
| "epoch": 6.358974358974359, | |
| "eval_loss": 0.17055413126945496, | |
| "eval_runtime": 2.9555, | |
| "eval_samples_per_second": 35.188, | |
| "eval_steps_per_second": 8.797, | |
| "step": 375 | |
| }, | |
| { | |
| "epoch": 6.444444444444445, | |
| "grad_norm": 0.4189331829547882, | |
| "learning_rate": 6.298618446600856e-06, | |
| "loss": 0.1621, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 6.52991452991453, | |
| "grad_norm": 0.6043363809585571, | |
| "learning_rate": 6.0484146146984475e-06, | |
| "loss": 0.1656, | |
| "step": 385 | |
| }, | |
| { | |
| "epoch": 6.615384615384615, | |
| "grad_norm": 0.5410465598106384, | |
| "learning_rate": 5.801108984397355e-06, | |
| "loss": 0.1716, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 6.700854700854701, | |
| "grad_norm": 0.49519532918930054, | |
| "learning_rate": 5.556882936460966e-06, | |
| "loss": 0.1632, | |
| "step": 395 | |
| }, | |
| { | |
| "epoch": 6.786324786324786, | |
| "grad_norm": 0.5701279640197754, | |
| "learning_rate": 5.3159155930021e-06, | |
| "loss": 0.1546, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 6.786324786324786, | |
| "eval_loss": 0.16907724738121033, | |
| "eval_runtime": 2.9509, | |
| "eval_samples_per_second": 35.244, | |
| "eval_steps_per_second": 8.811, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 6.871794871794872, | |
| "grad_norm": 0.6066329479217529, | |
| "learning_rate": 5.078383686109927e-06, | |
| "loss": 0.1508, | |
| "step": 405 | |
| }, | |
| { | |
| "epoch": 6.957264957264957, | |
| "grad_norm": 0.43724945187568665, | |
| "learning_rate": 4.844461428229782e-06, | |
| "loss": 0.1596, | |
| "step": 410 | |
| }, | |
| { | |
| "epoch": 7.034188034188034, | |
| "grad_norm": 0.3817615509033203, | |
| "learning_rate": 4.614320384390959e-06, | |
| "loss": 0.1442, | |
| "step": 415 | |
| }, | |
| { | |
| "epoch": 7.119658119658119, | |
| "grad_norm": 0.4554646611213684, | |
| "learning_rate": 4.388129346376177e-06, | |
| "loss": 0.1582, | |
| "step": 420 | |
| }, | |
| { | |
| "epoch": 7.205128205128205, | |
| "grad_norm": 0.4925171136856079, | |
| "learning_rate": 4.16605420892506e-06, | |
| "loss": 0.1592, | |
| "step": 425 | |
| }, | |
| { | |
| "epoch": 7.205128205128205, | |
| "eval_loss": 0.16841334104537964, | |
| "eval_runtime": 2.9605, | |
| "eval_samples_per_second": 35.13, | |
| "eval_steps_per_second": 8.782, | |
| "step": 425 | |
| }, | |
| { | |
| "epoch": 7.2905982905982905, | |
| "grad_norm": 0.5007475018501282, | |
| "learning_rate": 3.948257848062351e-06, | |
| "loss": 0.1621, | |
| "step": 430 | |
| }, | |
| { | |
| "epoch": 7.3760683760683765, | |
| "grad_norm": 0.5269553065299988, | |
| "learning_rate": 3.734900001640135e-06, | |
| "loss": 0.148, | |
| "step": 435 | |
| }, | |
| { | |
| "epoch": 7.461538461538462, | |
| "grad_norm": 0.5234923362731934, | |
| "learning_rate": 3.5261371521817247e-06, | |
| "loss": 0.1606, | |
| "step": 440 | |
| }, | |
| { | |
| "epoch": 7.547008547008547, | |
| "grad_norm": 0.4035094976425171, | |
| "learning_rate": 3.322122412113047e-06, | |
| "loss": 0.1556, | |
| "step": 445 | |
| }, | |
| { | |
| "epoch": 7.632478632478632, | |
| "grad_norm": 0.45483818650245667, | |
| "learning_rate": 3.123005411465766e-06, | |
| "loss": 0.1598, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 7.632478632478632, | |
| "eval_loss": 0.16744433343410492, | |
| "eval_runtime": 2.9512, | |
| "eval_samples_per_second": 35.24, | |
| "eval_steps_per_second": 8.81, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 7.717948717948718, | |
| "grad_norm": 0.45279672741889954, | |
| "learning_rate": 2.9289321881345257e-06, | |
| "loss": 0.1495, | |
| "step": 455 | |
| }, | |
| { | |
| "epoch": 7.803418803418803, | |
| "grad_norm": 0.5406824946403503, | |
| "learning_rate": 2.740045080768694e-06, | |
| "loss": 0.1601, | |
| "step": 460 | |
| }, | |
| { | |
| "epoch": 7.888888888888889, | |
| "grad_norm": 0.5257072448730469, | |
| "learning_rate": 2.5564826243772965e-06, | |
| "loss": 0.1593, | |
| "step": 465 | |
| }, | |
| { | |
| "epoch": 7.9743589743589745, | |
| "grad_norm": 0.5503476858139038, | |
| "learning_rate": 2.3783794487236367e-06, | |
| "loss": 0.16, | |
| "step": 470 | |
| }, | |
| { | |
| "epoch": 8.051282051282051, | |
| "grad_norm": 0.5466392040252686, | |
| "learning_rate": 2.205866179584084e-06, | |
| "loss": 0.1615, | |
| "step": 475 | |
| }, | |
| { | |
| "epoch": 8.051282051282051, | |
| "eval_loss": 0.16703671216964722, | |
| "eval_runtime": 2.9533, | |
| "eval_samples_per_second": 35.215, | |
| "eval_steps_per_second": 8.804, | |
| "step": 475 | |
| }, | |
| { | |
| "epoch": 8.136752136752136, | |
| "grad_norm": 0.5129823088645935, | |
| "learning_rate": 2.0390693429435626e-06, | |
| "loss": 0.1584, | |
| "step": 480 | |
| }, | |
| { | |
| "epoch": 8.222222222222221, | |
| "grad_norm": 0.6289273500442505, | |
| "learning_rate": 1.87811127219789e-06, | |
| "loss": 0.1592, | |
| "step": 485 | |
| }, | |
| { | |
| "epoch": 8.307692307692308, | |
| "grad_norm": 0.44773322343826294, | |
| "learning_rate": 1.7231100184310955e-06, | |
| "loss": 0.152, | |
| "step": 490 | |
| }, | |
| { | |
| "epoch": 8.393162393162394, | |
| "grad_norm": 0.44763079285621643, | |
| "learning_rate": 1.5741792638335096e-06, | |
| "loss": 0.159, | |
| "step": 495 | |
| }, | |
| { | |
| "epoch": 8.478632478632479, | |
| "grad_norm": 0.5403873920440674, | |
| "learning_rate": 1.4314282383241097e-06, | |
| "loss": 0.1471, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 8.478632478632479, | |
| "eval_loss": 0.16682063043117523, | |
| "eval_runtime": 2.9444, | |
| "eval_samples_per_second": 35.321, | |
| "eval_steps_per_second": 8.83, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 8.564102564102564, | |
| "grad_norm": 0.4975205361843109, | |
| "learning_rate": 1.2949616394382802e-06, | |
| "loss": 0.1546, | |
| "step": 505 | |
| }, | |
| { | |
| "epoch": 8.649572649572649, | |
| "grad_norm": 0.4314480721950531, | |
| "learning_rate": 1.1648795555397719e-06, | |
| "loss": 0.1495, | |
| "step": 510 | |
| }, | |
| { | |
| "epoch": 8.735042735042736, | |
| "grad_norm": 0.4307732880115509, | |
| "learning_rate": 1.0412773924131202e-06, | |
| "loss": 0.1516, | |
| "step": 515 | |
| }, | |
| { | |
| "epoch": 8.820512820512821, | |
| "grad_norm": 0.7880775332450867, | |
| "learning_rate": 9.242458032904311e-07, | |
| "loss": 0.1691, | |
| "step": 520 | |
| }, | |
| { | |
| "epoch": 8.905982905982906, | |
| "grad_norm": 0.3903237283229828, | |
| "learning_rate": 8.138706223637827e-07, | |
| "loss": 0.1564, | |
| "step": 525 | |
| }, | |
| { | |
| "epoch": 8.905982905982906, | |
| "eval_loss": 0.16660818457603455, | |
| "eval_runtime": 2.9675, | |
| "eval_samples_per_second": 35.047, | |
| "eval_steps_per_second": 8.762, | |
| "step": 525 | |
| }, | |
| { | |
| "epoch": 8.991452991452991, | |
| "grad_norm": 0.5438657999038696, | |
| "learning_rate": 7.102328018320859e-07, | |
| "loss": 0.1605, | |
| "step": 530 | |
| }, | |
| { | |
| "epoch": 9.068376068376068, | |
| "grad_norm": 0.3905521333217621, | |
| "learning_rate": 6.13408352528495e-07, | |
| "loss": 0.1579, | |
| "step": 535 | |
| }, | |
| { | |
| "epoch": 9.153846153846153, | |
| "grad_norm": 0.5689241886138916, | |
| "learning_rate": 5.234682881719766e-07, | |
| "loss": 0.1571, | |
| "step": 540 | |
| }, | |
| { | |
| "epoch": 9.239316239316238, | |
| "grad_norm": 0.5273411273956299, | |
| "learning_rate": 4.4047857328388457e-07, | |
| "loss": 0.151, | |
| "step": 545 | |
| }, | |
| { | |
| "epoch": 9.324786324786325, | |
| "grad_norm": 0.6550098061561584, | |
| "learning_rate": 3.645000748077709e-07, | |
| "loss": 0.1557, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 9.324786324786325, | |
| "eval_loss": 0.16643913090229034, | |
| "eval_runtime": 2.9714, | |
| "eval_samples_per_second": 35.001, | |
| "eval_steps_per_second": 8.75, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 9.41025641025641, | |
| "grad_norm": 0.5939171314239502, | |
| "learning_rate": 2.955885174678852e-07, | |
| "loss": 0.1542, | |
| "step": 555 | |
| }, | |
| { | |
| "epoch": 9.495726495726496, | |
| "grad_norm": 0.448629230260849, | |
| "learning_rate": 2.3379444289913344e-07, | |
| "loss": 0.1614, | |
| "step": 560 | |
| }, | |
| { | |
| "epoch": 9.581196581196581, | |
| "grad_norm": 0.47190573811531067, | |
| "learning_rate": 1.791631725784404e-07, | |
| "loss": 0.1453, | |
| "step": 565 | |
| }, | |
| { | |
| "epoch": 9.666666666666666, | |
| "grad_norm": 0.519051730632782, | |
| "learning_rate": 1.317347745847386e-07, | |
| "loss": 0.1565, | |
| "step": 570 | |
| }, | |
| { | |
| "epoch": 9.752136752136753, | |
| "grad_norm": 0.46918535232543945, | |
| "learning_rate": 9.154403421193226e-08, | |
| "loss": 0.164, | |
| "step": 575 | |
| }, | |
| { | |
| "epoch": 9.752136752136753, | |
| "eval_loss": 0.16634653508663177, | |
| "eval_runtime": 2.9178, | |
| "eval_samples_per_second": 35.643, | |
| "eval_steps_per_second": 8.911, | |
| "step": 575 | |
| }, | |
| { | |
| "epoch": 9.837606837606838, | |
| "grad_norm": 0.3677942752838135, | |
| "learning_rate": 5.862042845640403e-08, | |
| "loss": 0.159, | |
| "step": 580 | |
| }, | |
| { | |
| "epoch": 9.923076923076923, | |
| "grad_norm": 0.5101422667503357, | |
| "learning_rate": 3.2988104397773115e-08, | |
| "loss": 0.1554, | |
| "step": 585 | |
| }, | |
| { | |
| "epoch": 10.0, | |
| "grad_norm": 0.49817174673080444, | |
| "learning_rate": 1.4665861488761813e-08, | |
| "loss": 0.1596, | |
| "step": 590 | |
| }, | |
| { | |
| "epoch": 10.085470085470085, | |
| "grad_norm": 0.3656047582626343, | |
| "learning_rate": 3.6671377671604337e-09, | |
| "loss": 0.1528, | |
| "step": 595 | |
| }, | |
| { | |
| "epoch": 10.17094017094017, | |
| "grad_norm": 0.5075839161872864, | |
| "learning_rate": 0.0, | |
| "loss": 0.1591, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 10.17094017094017, | |
| "eval_loss": 0.1664964258670807, | |
| "eval_runtime": 2.9425, | |
| "eval_samples_per_second": 35.345, | |
| "eval_steps_per_second": 8.836, | |
| "step": 600 | |
| } | |
| ], | |
| "logging_steps": 5, | |
| "max_steps": 600, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 11, | |
| "save_steps": 25, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 9098325346882560.0, | |
| "train_batch_size": 4, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |