JinNian0072's picture
Upload folder using huggingface_hub
7b97b32 verified
Raw History Blame Contribute Delete
13.2 kB
{
"best_global_step": 229,
"best_metric": 0.3871820569038391,
"best_model_checkpoint": "lora_qwen7b_python_ab_v1/checkpoint-229",
"epoch": 3.0,
"eval_steps": 500,
"global_step": 687,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.043835616438356165,
"grad_norm": 0.38687002658843994,
"learning_rate": 3.913043478260869e-06,
"loss": 1.0194,
"step": 10
},
{
"epoch": 0.08767123287671233,
"grad_norm": 0.46047139167785645,
"learning_rate": 8.260869565217392e-06,
"loss": 1.0168,
"step": 20
},
{
"epoch": 0.13150684931506848,
"grad_norm": 0.9523305296897888,
"learning_rate": 1.2608695652173912e-05,
"loss": 0.931,
"step": 30
},
{
"epoch": 0.17534246575342466,
"grad_norm": 0.5194224119186401,
"learning_rate": 1.6956521739130433e-05,
"loss": 0.8556,
"step": 40
},
{
"epoch": 0.2191780821917808,
"grad_norm": 0.6766444444656372,
"learning_rate": 2.1304347826086958e-05,
"loss": 0.6603,
"step": 50
},
{
"epoch": 0.26301369863013696,
"grad_norm": 0.3464139699935913,
"learning_rate": 2.565217391304348e-05,
"loss": 0.5166,
"step": 60
},
{
"epoch": 0.30684931506849317,
"grad_norm": 0.2768701910972595,
"learning_rate": 3e-05,
"loss": 0.4596,
"step": 70
},
{
"epoch": 0.3506849315068493,
"grad_norm": 0.1779787391424179,
"learning_rate": 2.9514563106796115e-05,
"loss": 0.4121,
"step": 80
},
{
"epoch": 0.39452054794520547,
"grad_norm": 0.18716883659362793,
"learning_rate": 2.9029126213592237e-05,
"loss": 0.3962,
"step": 90
},
{
"epoch": 0.4383561643835616,
"grad_norm": 0.16104164719581604,
"learning_rate": 2.854368932038835e-05,
"loss": 0.367,
"step": 100
},
{
"epoch": 0.4821917808219178,
"grad_norm": 0.15184655785560608,
"learning_rate": 2.8058252427184466e-05,
"loss": 0.355,
"step": 110
},
{
"epoch": 0.5260273972602739,
"grad_norm": 0.14750339090824127,
"learning_rate": 2.757281553398058e-05,
"loss": 0.3417,
"step": 120
},
{
"epoch": 0.5698630136986301,
"grad_norm": 0.1846708357334137,
"learning_rate": 2.7087378640776702e-05,
"loss": 0.3327,
"step": 130
},
{
"epoch": 0.6136986301369863,
"grad_norm": 0.18890278041362762,
"learning_rate": 2.6601941747572816e-05,
"loss": 0.3282,
"step": 140
},
{
"epoch": 0.6575342465753424,
"grad_norm": 0.2321624755859375,
"learning_rate": 2.611650485436893e-05,
"loss": 0.3235,
"step": 150
},
{
"epoch": 0.7013698630136986,
"grad_norm": 0.20538988709449768,
"learning_rate": 2.563106796116505e-05,
"loss": 0.3125,
"step": 160
},
{
"epoch": 0.7452054794520548,
"grad_norm": 0.2320716381072998,
"learning_rate": 2.5145631067961167e-05,
"loss": 0.3107,
"step": 170
},
{
"epoch": 0.7890410958904109,
"grad_norm": 0.24439719319343567,
"learning_rate": 2.466019417475728e-05,
"loss": 0.2904,
"step": 180
},
{
"epoch": 0.8328767123287671,
"grad_norm": 0.24646572768688202,
"learning_rate": 2.41747572815534e-05,
"loss": 0.2879,
"step": 190
},
{
"epoch": 0.8767123287671232,
"grad_norm": 0.27469298243522644,
"learning_rate": 2.3689320388349514e-05,
"loss": 0.2917,
"step": 200
},
{
"epoch": 0.9205479452054794,
"grad_norm": 0.3135608434677124,
"learning_rate": 2.3203883495145632e-05,
"loss": 0.266,
"step": 210
},
{
"epoch": 0.9643835616438357,
"grad_norm": 0.31775224208831787,
"learning_rate": 2.2718446601941746e-05,
"loss": 0.255,
"step": 220
},
{
"epoch": 1.0,
"eval_loss": 0.3871820569038391,
"eval_runtime": 77.3712,
"eval_samples_per_second": 15.949,
"eval_steps_per_second": 7.975,
"step": 229
},
{
"epoch": 1.0043835616438357,
"grad_norm": 0.3090009391307831,
"learning_rate": 2.2233009708737864e-05,
"loss": 0.2568,
"step": 230
},
{
"epoch": 1.0482191780821917,
"grad_norm": 0.3228119909763336,
"learning_rate": 2.1747572815533982e-05,
"loss": 0.2369,
"step": 240
},
{
"epoch": 1.0920547945205479,
"grad_norm": 0.4035201370716095,
"learning_rate": 2.1262135922330097e-05,
"loss": 0.2175,
"step": 250
},
{
"epoch": 1.135890410958904,
"grad_norm": 0.3466794192790985,
"learning_rate": 2.0776699029126215e-05,
"loss": 0.2308,
"step": 260
},
{
"epoch": 1.1797260273972603,
"grad_norm": 0.3883700966835022,
"learning_rate": 2.029126213592233e-05,
"loss": 0.2235,
"step": 270
},
{
"epoch": 1.2235616438356165,
"grad_norm": 0.3835398256778717,
"learning_rate": 1.9805825242718447e-05,
"loss": 0.2121,
"step": 280
},
{
"epoch": 1.2673972602739725,
"grad_norm": 0.3837865889072418,
"learning_rate": 1.9320388349514565e-05,
"loss": 0.2124,
"step": 290
},
{
"epoch": 1.3112328767123287,
"grad_norm": 0.3975505828857422,
"learning_rate": 1.883495145631068e-05,
"loss": 0.1805,
"step": 300
},
{
"epoch": 1.355068493150685,
"grad_norm": 0.5245018005371094,
"learning_rate": 1.8349514563106795e-05,
"loss": 0.1922,
"step": 310
},
{
"epoch": 1.398904109589041,
"grad_norm": 0.5155487656593323,
"learning_rate": 1.7864077669902913e-05,
"loss": 0.1862,
"step": 320
},
{
"epoch": 1.4427397260273973,
"grad_norm": 0.47153836488723755,
"learning_rate": 1.737864077669903e-05,
"loss": 0.1988,
"step": 330
},
{
"epoch": 1.4865753424657533,
"grad_norm": 0.5374466180801392,
"learning_rate": 1.6893203883495145e-05,
"loss": 0.1808,
"step": 340
},
{
"epoch": 1.5304109589041097,
"grad_norm": 0.6311222910881042,
"learning_rate": 1.6407766990291263e-05,
"loss": 0.1769,
"step": 350
},
{
"epoch": 1.5742465753424657,
"grad_norm": 0.45171788334846497,
"learning_rate": 1.592233009708738e-05,
"loss": 0.1851,
"step": 360
},
{
"epoch": 1.618082191780822,
"grad_norm": 0.6755343675613403,
"learning_rate": 1.5436893203883496e-05,
"loss": 0.1651,
"step": 370
},
{
"epoch": 1.6619178082191781,
"grad_norm": 0.5747941136360168,
"learning_rate": 1.4951456310679612e-05,
"loss": 0.1752,
"step": 380
},
{
"epoch": 1.705753424657534,
"grad_norm": 0.5249078869819641,
"learning_rate": 1.4466019417475728e-05,
"loss": 0.163,
"step": 390
},
{
"epoch": 1.7495890410958905,
"grad_norm": 0.6157597303390503,
"learning_rate": 1.3980582524271846e-05,
"loss": 0.1721,
"step": 400
},
{
"epoch": 1.7934246575342465,
"grad_norm": 0.5300430059432983,
"learning_rate": 1.349514563106796e-05,
"loss": 0.1611,
"step": 410
},
{
"epoch": 1.8372602739726027,
"grad_norm": 0.6655022501945496,
"learning_rate": 1.3009708737864079e-05,
"loss": 0.1669,
"step": 420
},
{
"epoch": 1.881095890410959,
"grad_norm": 0.6132180690765381,
"learning_rate": 1.2524271844660193e-05,
"loss": 0.1687,
"step": 430
},
{
"epoch": 1.924931506849315,
"grad_norm": 0.47309410572052,
"learning_rate": 1.2038834951456311e-05,
"loss": 0.1583,
"step": 440
},
{
"epoch": 1.9687671232876713,
"grad_norm": 0.647148072719574,
"learning_rate": 1.1553398058252427e-05,
"loss": 0.161,
"step": 450
},
{
"epoch": 2.0,
"eval_loss": 0.421628475189209,
"eval_runtime": 49.8056,
"eval_samples_per_second": 24.776,
"eval_steps_per_second": 12.388,
"step": 458
},
{
"epoch": 2.0087671232876714,
"grad_norm": 0.5745662450790405,
"learning_rate": 1.1067961165048544e-05,
"loss": 0.1393,
"step": 460
},
{
"epoch": 2.0526027397260274,
"grad_norm": 0.3223569393157959,
"learning_rate": 1.058252427184466e-05,
"loss": 0.148,
"step": 470
},
{
"epoch": 2.0964383561643833,
"grad_norm": 0.48584961891174316,
"learning_rate": 1.0097087378640776e-05,
"loss": 0.1291,
"step": 480
},
{
"epoch": 2.1402739726027398,
"grad_norm": 0.48411062359809875,
"learning_rate": 9.611650485436894e-06,
"loss": 0.1398,
"step": 490
},
{
"epoch": 2.1841095890410958,
"grad_norm": 0.4757746458053589,
"learning_rate": 9.12621359223301e-06,
"loss": 0.1497,
"step": 500
},
{
"epoch": 2.227945205479452,
"grad_norm": 0.5401110649108887,
"learning_rate": 8.640776699029127e-06,
"loss": 0.1413,
"step": 510
},
{
"epoch": 2.271780821917808,
"grad_norm": 0.584707498550415,
"learning_rate": 8.155339805825243e-06,
"loss": 0.1442,
"step": 520
},
{
"epoch": 2.315616438356164,
"grad_norm": 0.3924754858016968,
"learning_rate": 7.66990291262136e-06,
"loss": 0.1336,
"step": 530
},
{
"epoch": 2.3594520547945206,
"grad_norm": 0.7305352091789246,
"learning_rate": 7.1844660194174755e-06,
"loss": 0.1313,
"step": 540
},
{
"epoch": 2.4032876712328766,
"grad_norm": 0.40309375524520874,
"learning_rate": 6.699029126213593e-06,
"loss": 0.1253,
"step": 550
},
{
"epoch": 2.447123287671233,
"grad_norm": 0.4579068720340729,
"learning_rate": 6.213592233009709e-06,
"loss": 0.1268,
"step": 560
},
{
"epoch": 2.490958904109589,
"grad_norm": 0.3836471140384674,
"learning_rate": 5.728155339805826e-06,
"loss": 0.1306,
"step": 570
},
{
"epoch": 2.534794520547945,
"grad_norm": 0.4680565297603607,
"learning_rate": 5.242718446601942e-06,
"loss": 0.1444,
"step": 580
},
{
"epoch": 2.5786301369863014,
"grad_norm": 0.5456928610801697,
"learning_rate": 4.7572815533980585e-06,
"loss": 0.1554,
"step": 590
},
{
"epoch": 2.6224657534246574,
"grad_norm": 0.4823114275932312,
"learning_rate": 4.271844660194175e-06,
"loss": 0.1371,
"step": 600
},
{
"epoch": 2.666301369863014,
"grad_norm": 0.6588716506958008,
"learning_rate": 3.7864077669902915e-06,
"loss": 0.1251,
"step": 610
},
{
"epoch": 2.71013698630137,
"grad_norm": 0.39495226740837097,
"learning_rate": 3.3009708737864078e-06,
"loss": 0.1368,
"step": 620
},
{
"epoch": 2.7539726027397258,
"grad_norm": 0.6559995412826538,
"learning_rate": 2.815533980582524e-06,
"loss": 0.1292,
"step": 630
},
{
"epoch": 2.797808219178082,
"grad_norm": 0.4756312668323517,
"learning_rate": 2.3300970873786407e-06,
"loss": 0.1252,
"step": 640
},
{
"epoch": 2.8416438356164386,
"grad_norm": 0.5348303318023682,
"learning_rate": 1.8446601941747572e-06,
"loss": 0.1165,
"step": 650
},
{
"epoch": 2.8854794520547946,
"grad_norm": 0.2880028188228607,
"learning_rate": 1.359223300970874e-06,
"loss": 0.1412,
"step": 660
},
{
"epoch": 2.9293150684931506,
"grad_norm": 0.5411520004272461,
"learning_rate": 8.737864077669904e-07,
"loss": 0.1376,
"step": 670
},
{
"epoch": 2.9731506849315066,
"grad_norm": 0.4965899586677551,
"learning_rate": 3.883495145631068e-07,
"loss": 0.1335,
"step": 680
},
{
"epoch": 3.0,
"eval_loss": 0.43176329135894775,
"eval_runtime": 144.0381,
"eval_samples_per_second": 8.567,
"eval_steps_per_second": 4.284,
"step": 687
}
],
"logging_steps": 10,
"max_steps": 687,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 4.290963516451369e+17,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}