{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.013714285714285714, "eval_steps": 500, "global_step": 600, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.00022857142857142857, "grad_norm": 0.2346513569355011, "learning_rate": 9e-06, "loss": 3.8879, "step": 10 }, { "epoch": 0.00045714285714285713, "grad_norm": 0.22248627245426178, "learning_rate": 1.9e-05, "loss": 3.9183, "step": 20 }, { "epoch": 0.0006857142857142857, "grad_norm": 0.20896980166435242, "learning_rate": 2.9e-05, "loss": 3.8078, "step": 30 }, { "epoch": 0.0009142857142857143, "grad_norm": 0.23850908875465393, "learning_rate": 3.9000000000000006e-05, "loss": 3.9322, "step": 40 }, { "epoch": 0.001142857142857143, "grad_norm": 0.20449857413768768, "learning_rate": 4.9e-05, "loss": 3.7764, "step": 50 }, { "epoch": 0.0013714285714285714, "grad_norm": 0.2402871549129486, "learning_rate": 4.9181818181818183e-05, "loss": 3.779, "step": 60 }, { "epoch": 0.0016, "grad_norm": 0.24396637082099915, "learning_rate": 4.827272727272727e-05, "loss": 3.778, "step": 70 }, { "epoch": 0.0018285714285714285, "grad_norm": 0.218296080827713, "learning_rate": 4.736363636363637e-05, "loss": 3.6985, "step": 80 }, { "epoch": 0.002057142857142857, "grad_norm": 0.2191750556230545, "learning_rate": 4.6454545454545456e-05, "loss": 3.7632, "step": 90 }, { "epoch": 0.002285714285714286, "grad_norm": 0.2369811236858368, "learning_rate": 4.5545454545454544e-05, "loss": 3.7226, "step": 100 }, { "epoch": 0.002514285714285714, "grad_norm": 0.2669982612133026, "learning_rate": 4.463636363636364e-05, "loss": 3.7047, "step": 110 }, { "epoch": 0.002742857142857143, "grad_norm": 0.2281678467988968, "learning_rate": 4.372727272727273e-05, "loss": 3.6731, "step": 120 }, { "epoch": 0.0029714285714285715, "grad_norm": 0.2538886070251465, "learning_rate": 4.281818181818182e-05, "loss": 3.6279, "step": 130 }, { "epoch": 0.0032, "grad_norm": 0.2365216612815857, "learning_rate": 4.190909090909091e-05, "loss": 3.6114, "step": 140 }, { "epoch": 0.0034285714285714284, "grad_norm": 0.2829030156135559, "learning_rate": 4.1e-05, "loss": 3.6339, "step": 150 }, { "epoch": 0.003657142857142857, "grad_norm": 0.28002238273620605, "learning_rate": 4.009090909090909e-05, "loss": 3.6, "step": 160 }, { "epoch": 0.0038857142857142857, "grad_norm": 0.28344056010246277, "learning_rate": 3.9181818181818184e-05, "loss": 3.6351, "step": 170 }, { "epoch": 0.004114285714285714, "grad_norm": 0.25062933564186096, "learning_rate": 3.827272727272728e-05, "loss": 3.6556, "step": 180 }, { "epoch": 0.004342857142857143, "grad_norm": 0.2557496130466461, "learning_rate": 3.736363636363637e-05, "loss": 3.6196, "step": 190 }, { "epoch": 0.004571428571428572, "grad_norm": 0.26178061962127686, "learning_rate": 3.645454545454546e-05, "loss": 3.6541, "step": 200 }, { "epoch": 0.0048, "grad_norm": 0.24720928072929382, "learning_rate": 3.5545454545454545e-05, "loss": 3.6015, "step": 210 }, { "epoch": 0.005028571428571428, "grad_norm": 0.24621886014938354, "learning_rate": 3.463636363636364e-05, "loss": 3.5792, "step": 220 }, { "epoch": 0.005257142857142857, "grad_norm": 0.2460050880908966, "learning_rate": 3.372727272727273e-05, "loss": 3.6046, "step": 230 }, { "epoch": 0.005485714285714286, "grad_norm": 0.3001673221588135, "learning_rate": 3.281818181818182e-05, "loss": 3.5625, "step": 240 }, { "epoch": 0.005714285714285714, "grad_norm": 0.2713945209980011, "learning_rate": 3.190909090909091e-05, "loss": 3.6734, "step": 250 }, { "epoch": 0.005942857142857143, "grad_norm": 0.30158859491348267, "learning_rate": 3.1e-05, "loss": 3.6523, "step": 260 }, { "epoch": 0.006171428571428572, "grad_norm": 0.25476905703544617, "learning_rate": 3.0090909090909093e-05, "loss": 3.554, "step": 270 }, { "epoch": 0.0064, "grad_norm": 0.247573122382164, "learning_rate": 2.9181818181818182e-05, "loss": 3.6185, "step": 280 }, { "epoch": 0.006628571428571429, "grad_norm": 0.28666672110557556, "learning_rate": 2.8272727272727274e-05, "loss": 3.5647, "step": 290 }, { "epoch": 0.006857142857142857, "grad_norm": 0.2672288417816162, "learning_rate": 2.7363636363636362e-05, "loss": 3.6464, "step": 300 }, { "epoch": 0.0070857142857142855, "grad_norm": 0.27534735202789307, "learning_rate": 2.6454545454545454e-05, "loss": 3.5813, "step": 310 }, { "epoch": 0.007314285714285714, "grad_norm": 0.24681590497493744, "learning_rate": 2.5545454545454546e-05, "loss": 3.6038, "step": 320 }, { "epoch": 0.007542857142857143, "grad_norm": 0.2686510682106018, "learning_rate": 2.4636363636363638e-05, "loss": 3.5755, "step": 330 }, { "epoch": 0.0077714285714285715, "grad_norm": 0.27035024762153625, "learning_rate": 2.372727272727273e-05, "loss": 3.5517, "step": 340 }, { "epoch": 0.008, "grad_norm": 0.28498750925064087, "learning_rate": 2.281818181818182e-05, "loss": 3.6397, "step": 350 }, { "epoch": 0.008228571428571429, "grad_norm": 0.2775673568248749, "learning_rate": 2.190909090909091e-05, "loss": 3.6033, "step": 360 }, { "epoch": 0.008457142857142858, "grad_norm": 0.29988932609558105, "learning_rate": 2.1e-05, "loss": 3.5917, "step": 370 }, { "epoch": 0.008685714285714286, "grad_norm": 0.25248634815216064, "learning_rate": 2.009090909090909e-05, "loss": 3.6374, "step": 380 }, { "epoch": 0.008914285714285715, "grad_norm": 0.2702570855617523, "learning_rate": 1.9181818181818183e-05, "loss": 3.5725, "step": 390 }, { "epoch": 0.009142857142857144, "grad_norm": 0.29647764563560486, "learning_rate": 1.8272727272727275e-05, "loss": 3.5781, "step": 400 }, { "epoch": 0.009371428571428572, "grad_norm": 0.2612384259700775, "learning_rate": 1.7363636363636366e-05, "loss": 3.5935, "step": 410 }, { "epoch": 0.0096, "grad_norm": 0.24550645053386688, "learning_rate": 1.6454545454545455e-05, "loss": 3.5511, "step": 420 }, { "epoch": 0.009828571428571428, "grad_norm": 0.3067398965358734, "learning_rate": 1.5545454545454547e-05, "loss": 3.6077, "step": 430 }, { "epoch": 0.010057142857142857, "grad_norm": 0.2859310507774353, "learning_rate": 1.4636363636363637e-05, "loss": 3.5567, "step": 440 }, { "epoch": 0.010285714285714285, "grad_norm": 0.34277746081352234, "learning_rate": 1.3727272727272727e-05, "loss": 3.5546, "step": 450 }, { "epoch": 0.010514285714285714, "grad_norm": 0.31543368101119995, "learning_rate": 1.2818181818181818e-05, "loss": 3.5976, "step": 460 }, { "epoch": 0.010742857142857143, "grad_norm": 0.2583160698413849, "learning_rate": 1.190909090909091e-05, "loss": 3.566, "step": 470 }, { "epoch": 0.010971428571428571, "grad_norm": 0.2528459131717682, "learning_rate": 1.1000000000000001e-05, "loss": 3.667, "step": 480 }, { "epoch": 0.0112, "grad_norm": 0.26343825459480286, "learning_rate": 1.0090909090909092e-05, "loss": 3.5792, "step": 490 }, { "epoch": 0.011428571428571429, "grad_norm": 0.26427048444747925, "learning_rate": 9.181818181818182e-06, "loss": 3.5028, "step": 500 }, { "epoch": 0.011657142857142857, "grad_norm": 0.3029393255710602, "learning_rate": 8.272727272727274e-06, "loss": 3.6024, "step": 510 }, { "epoch": 0.011885714285714286, "grad_norm": 0.2847612500190735, "learning_rate": 7.363636363636364e-06, "loss": 3.5887, "step": 520 }, { "epoch": 0.012114285714285715, "grad_norm": 0.2795548439025879, "learning_rate": 6.454545454545455e-06, "loss": 3.5564, "step": 530 }, { "epoch": 0.012342857142857143, "grad_norm": 0.2452515810728073, "learning_rate": 5.545454545454546e-06, "loss": 3.5679, "step": 540 }, { "epoch": 0.012571428571428572, "grad_norm": 0.27698689699172974, "learning_rate": 4.636363636363636e-06, "loss": 3.6436, "step": 550 }, { "epoch": 0.0128, "grad_norm": 0.286603718996048, "learning_rate": 3.727272727272727e-06, "loss": 3.5336, "step": 560 }, { "epoch": 0.01302857142857143, "grad_norm": 0.2752152681350708, "learning_rate": 2.8181818181818185e-06, "loss": 3.5525, "step": 570 }, { "epoch": 0.013257142857142858, "grad_norm": 0.28077051043510437, "learning_rate": 1.9090909090909095e-06, "loss": 3.6844, "step": 580 }, { "epoch": 0.013485714285714285, "grad_norm": 0.31142348051071167, "learning_rate": 1.0000000000000002e-06, "loss": 3.557, "step": 590 }, { "epoch": 0.013714285714285714, "grad_norm": 0.29399439692497253, "learning_rate": 9.090909090909091e-08, "loss": 3.5452, "step": 600 } ], "logging_steps": 10, "max_steps": 600, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 300, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2571449548492800.0, "train_batch_size": 4, "trial_name": null, "trial_params": null }