{ "model_name": "Qwen/Qwen2.5-1.5B-Instruct", "resolved_model": "/home/yuxu/.cache/huggingface/hub/models--Qwen--Qwen2.5-1.5B-Instruct/snapshots/989aa7980e4cf806f80c7fef2b1adb7bc71aa306", "num_train_records": 3185, "num_validation_records_available": 0, "training_config": { "lora_rank": 16, "lora_alpha": 32, "learning_rate": 1e-05, "num_epochs": 2, "per_device_batch_size": 1, "per_device_eval_batch_size": 1, "gradient_accumulation_steps": 16, "beta": 0.1, "max_length": 512, "max_prompt_length": 384, "seed": 23, "save_steps": 250, "save_total_limit": 2, "resume_from_checkpoint": null, "precision_dtype": "torch.bfloat16", "bf16": true, "fp16": false, "tokenizer_add_bos_token": false }, "global_step": 400, "best_metric": null, "best_model_checkpoint": null, "train_metrics": { "train_runtime": 1813.4186, "train_samples_per_second": 3.513, "train_steps_per_second": 0.221, "total_flos": 4.273969110335078e+16, "train_loss": 0.319741350710392 }, "log_history": [ { "loss": 0.6879361629486084, "grad_norm": 0.12927789986133575, "learning_rate": 9.775e-06, "entropy": 0.7238542183768004, "num_tokens": 133173.0, "logits/chosen": -1.146062603401417, "logits/rejected": -1.0187220300441313, "mean_token_accuracy": 0.7585210186429322, "rewards/chosen": -0.0004721033974419697, "rewards/rejected": -0.011359559491393157, "rewards/accuracies": 0.5625, "rewards/margins": 0.010887456058117095, "logps/chosen": -46.327425229549405, "logps/rejected": -50.92502672672272, "epoch": 0.05023547880690738, "step": 10 }, { "loss": 0.6625864028930664, "grad_norm": 0.11413183808326721, "learning_rate": 9.525000000000001e-06, "entropy": 0.6860455798683688, "num_tokens": 265994.0, "logits/chosen": -1.1916538561330636, "logits/rejected": -0.9670820369302364, "mean_token_accuracy": 0.7585749719291925, "rewards/chosen": -0.016211788955331485, "rewards/rejected": -0.07945394674534327, "rewards/accuracies": 0.8625, "rewards/margins": 0.06324215737113263, "logps/chosen": -43.77689106464386, "logps/rejected": -49.65113867521286, "epoch": 0.10047095761381476, "step": 20 }, { "loss": 0.6345312595367432, "grad_norm": 0.12154310941696167, "learning_rate": 9.275e-06, "entropy": 0.7577564699575305, "num_tokens": 398864.0, "logits/chosen": -1.0621936190131371, "logits/rejected": -0.9763517834123263, "mean_token_accuracy": 0.7529850212391466, "rewards/chosen": -0.0641788170538348, "rewards/rejected": -0.18850186462105967, "rewards/accuracies": 0.8875, "rewards/margins": 0.12432304790127091, "logps/chosen": -49.59377843141556, "logps/rejected": -50.904494774341586, "epoch": 0.15070643642072212, "step": 30 }, { "loss": 0.5790808200836182, "grad_norm": 0.13508011400699615, "learning_rate": 9.025e-06, "entropy": 0.6849358166800812, "num_tokens": 531067.0, "logits/chosen": -1.2783358150590212, "logits/rejected": -1.0276385839127442, "mean_token_accuracy": 0.753383123036474, "rewards/chosen": -0.10663150681066327, "rewards/rejected": -0.3641926831449382, "rewards/accuracies": 0.9125, "rewards/margins": 0.257561175711453, "logps/chosen": -42.915665328502655, "logps/rejected": -52.03206089735031, "epoch": 0.20094191522762953, "step": 40 }, { "loss": 0.5318746566772461, "grad_norm": 0.13924022018909454, "learning_rate": 8.775e-06, "entropy": 0.7194130836986006, "num_tokens": 663484.0, "logits/chosen": -1.2473112105347606, "logits/rejected": -1.0526341909494097, "mean_token_accuracy": 0.7373185195028782, "rewards/chosen": -0.20653431888349588, "rewards/rejected": -0.5940572436142247, "rewards/accuracies": 0.90625, "rewards/margins": 0.387522924807854, "logps/chosen": -51.673768520355225, "logps/rejected": -53.815905523300174, "epoch": 0.25117739403453687, "step": 50 }, { "loss": 0.47343716621398924, "grad_norm": 0.1294322907924652, "learning_rate": 8.525e-06, "entropy": 0.7558604473248124, "num_tokens": 797675.0, "logits/chosen": -1.2157617863736025, "logits/rejected": -1.0140623466282492, "mean_token_accuracy": 0.7363574495539069, "rewards/chosen": -0.4119062727026176, "rewards/rejected": -1.017275849240832, "rewards/accuracies": 0.85, "rewards/margins": 0.6053695753216743, "logps/chosen": -56.62858397960663, "logps/rejected": -67.12472332715988, "epoch": 0.30141287284144425, "step": 60 }, { "loss": 0.43245368003845214, "grad_norm": 0.10232773423194885, "learning_rate": 8.275000000000001e-06, "entropy": 0.6619846842018887, "num_tokens": 930468.0, "logits/chosen": -1.5668154831894332, "logits/rejected": -1.1488416285743313, "mean_token_accuracy": 0.7529529741033911, "rewards/chosen": -0.5053344737039879, "rewards/rejected": -1.2791207884438336, "rewards/accuracies": 0.89375, "rewards/margins": 0.7737863110378385, "logps/chosen": -50.237997150421144, "logps/rejected": -61.791341233253476, "epoch": 0.3516483516483517, "step": 70 }, { "loss": 0.4014140605926514, "grad_norm": 0.11083566397428513, "learning_rate": 8.025e-06, "entropy": 0.6560566204134375, "num_tokens": 1063187.0, "logits/chosen": -1.4831890425352365, "logits/rejected": -1.1981890553491819, "mean_token_accuracy": 0.7564736861735583, "rewards/chosen": -0.8018593294720631, "rewards/rejected": -1.7599274738691748, "rewards/accuracies": 0.8875, "rewards/margins": 0.9580681428313256, "logps/chosen": -53.13977292776108, "logps/rejected": -67.6187126159668, "epoch": 0.40188383045525905, "step": 80 }, { "loss": 0.40877017974853513, "grad_norm": 0.12146656960248947, "learning_rate": 7.775000000000001e-06, "entropy": 0.7024386456258072, "num_tokens": 1196371.0, "logits/chosen": -1.5291034588869432, "logits/rejected": -1.215330689168182, "mean_token_accuracy": 0.7136658679693937, "rewards/chosen": -0.9504312781646149, "rewards/rejected": -1.9283913068939, "rewards/accuracies": 0.84375, "rewards/margins": 0.9779600235633552, "logps/chosen": -57.99721165895462, "logps/rejected": -68.28913284540177, "epoch": 0.4521193092621664, "step": 90 }, { "loss": 0.3608833074569702, "grad_norm": 0.11686406284570694, "learning_rate": 7.525e-06, "entropy": 0.6348699952475727, "num_tokens": 1329589.0, "logits/chosen": -1.7572149530606118, "logits/rejected": -1.3100404978476194, "mean_token_accuracy": 0.7428247408941389, "rewards/chosen": -1.1053433443012182, "rewards/rejected": -2.373575969412923, "rewards/accuracies": 0.86875, "rewards/margins": 1.2682326186448336, "logps/chosen": -55.729820132255554, "logps/rejected": -75.16047838926315, "epoch": 0.5023547880690737, "step": 100 }, { "loss": 0.33710997104644774, "grad_norm": 0.0942755714058876, "learning_rate": 7.275000000000001e-06, "entropy": 0.7292928833747283, "num_tokens": 1463533.0, "logits/chosen": -1.593181280695259, "logits/rejected": -1.363713934212247, "mean_token_accuracy": 0.6922290598042309, "rewards/chosen": -1.344864820325165, "rewards/rejected": -2.8116725638508795, "rewards/accuracies": 0.86875, "rewards/margins": 1.4668077420443297, "logps/chosen": -70.8679468870163, "logps/rejected": -77.38087712526321, "epoch": 0.5525902668759811, "step": 110 }, { "loss": 0.29937708377838135, "grad_norm": 0.1575644165277481, "learning_rate": 7.0250000000000005e-06, "entropy": 0.6809630849980749, "num_tokens": 1596584.0, "logits/chosen": -1.8546852706555126, "logits/rejected": -1.433928393711771, "mean_token_accuracy": 0.7235849054530263, "rewards/chosen": -1.4075983058020938, "rewards/rejected": -3.042885997146368, "rewards/accuracies": 0.875, "rewards/margins": 1.635287693142891, "logps/chosen": -64.33061331510544, "logps/rejected": -80.31118298768997, "epoch": 0.6028257456828885, "step": 120 }, { "loss": 0.31172795295715333, "grad_norm": 0.17319342494010925, "learning_rate": 6.775e-06, "entropy": 0.5976914913044311, "num_tokens": 1729147.0, "logits/chosen": -2.1128051725468993, "logits/rejected": -1.606758844847453, "mean_token_accuracy": 0.732736836746335, "rewards/chosen": -1.6491475495626218, "rewards/rejected": -3.4100383829325436, "rewards/accuracies": 0.86875, "rewards/margins": 1.760890830680728, "logps/chosen": -58.31117360591888, "logps/rejected": -83.210178565979, "epoch": 0.6530612244897959, "step": 130 }, { "loss": 0.23239784240722655, "grad_norm": 0.14601217210292816, "learning_rate": 6.525e-06, "entropy": 0.5687336616385437, "num_tokens": 1861390.0, "logits/chosen": -2.2702216826518473, "logits/rejected": -1.7040157720101548, "mean_token_accuracy": 0.7325862098485232, "rewards/chosen": -1.5928331214934588, "rewards/rejected": -3.720242958329618, "rewards/accuracies": 0.925, "rewards/margins": 2.127409836649895, "logps/chosen": -59.091740131378174, "logps/rejected": -86.36878335475922, "epoch": 0.7032967032967034, "step": 140 }, { "loss": 0.3572559118270874, "grad_norm": 0.3152352273464203, "learning_rate": 6.275e-06, "entropy": 0.6251555088441819, "num_tokens": 1994759.0, "logits/chosen": -2.1103526455799373, "logits/rejected": -1.6262347411772589, "mean_token_accuracy": 0.7041967859491706, "rewards/chosen": -2.0252377653028817, "rewards/rejected": -3.9634122479707004, "rewards/accuracies": 0.8125, "rewards/margins": 1.938174483180046, "logps/chosen": -69.24349672794342, "logps/rejected": -89.6405319571495, "epoch": 0.7535321821036107, "step": 150 }, { "loss": 0.29773588180541993, "grad_norm": 0.11801732331514359, "learning_rate": 6.025000000000001e-06, "entropy": 0.5814196466322755, "num_tokens": 2127569.0, "logits/chosen": -2.2078191413490367, "logits/rejected": -1.772276712937473, "mean_token_accuracy": 0.7261217636987567, "rewards/chosen": -1.845996680133976, "rewards/rejected": -3.9732000183314087, "rewards/accuracies": 0.88125, "rewards/margins": 2.1272033397108316, "logps/chosen": -60.42890399694443, "logps/rejected": -88.35059734582902, "epoch": 0.8037676609105181, "step": 160 }, { "loss": 0.3147859811782837, "grad_norm": 0.19054384529590607, "learning_rate": 5.775000000000001e-06, "entropy": 0.5550016971159494, "num_tokens": 2259538.0, "logits/chosen": -2.2226712226567615, "logits/rejected": -1.7103338798452985, "mean_token_accuracy": 0.7236912011168897, "rewards/chosen": -1.8620295539672953, "rewards/rejected": -3.9446876720525323, "rewards/accuracies": 0.875, "rewards/margins": 2.082658117450774, "logps/chosen": -60.38762339353561, "logps/rejected": -86.45722150802612, "epoch": 0.8540031397174255, "step": 170 }, { "loss": 0.26698215007781984, "grad_norm": 0.20462822914123535, "learning_rate": 5.5250000000000005e-06, "entropy": 0.5873516632360406, "num_tokens": 2392788.0, "logits/chosen": -2.200430116437656, "logits/rejected": -1.686358465613465, "mean_token_accuracy": 0.7312925306148828, "rewards/chosen": -1.8471820858074353, "rewards/rejected": -4.134644733928144, "rewards/accuracies": 0.90625, "rewards/margins": 2.2874626416712998, "logps/chosen": -67.07501709461212, "logps/rejected": -90.55823189020157, "epoch": 0.9042386185243328, "step": 180 }, { "loss": 0.29135124683380126, "grad_norm": 0.2081480622291565, "learning_rate": 5.275e-06, "entropy": 0.6327768423390807, "num_tokens": 2525806.0, "logits/chosen": -2.1183909942968273, "logits/rejected": -1.6604947298176118, "mean_token_accuracy": 0.7223707212135195, "rewards/chosen": -1.990922315546777, "rewards/rejected": -4.324287709966302, "rewards/accuracies": 0.88125, "rewards/margins": 2.3333653941750527, "logps/chosen": -65.02611857652664, "logps/rejected": -94.39640235900879, "epoch": 0.9544740973312402, "step": 190 }, { "loss": 0.20572924613952637, "grad_norm": 0.041941046714782715, "learning_rate": 5.025e-06, "entropy": 0.6143530573053607, "num_tokens": 2646778.0, "logits/chosen": -2.245679558146918, "logits/rejected": -1.7530482697090224, "mean_token_accuracy": 0.7188411283081976, "rewards/chosen": -1.8538258657565918, "rewards/rejected": -4.177631206348025, "rewards/accuracies": 0.9517241379310345, "rewards/margins": 2.323805326839973, "logps/chosen": -71.2792390494511, "logps/rejected": -93.94744490261735, "epoch": 1.0, "step": 200 }, { "loss": 0.2857442617416382, "grad_norm": 0.23553285002708435, "learning_rate": 4.775e-06, "entropy": 0.6180979636978009, "num_tokens": 2780083.0, "logits/chosen": -2.1517222491444423, "logits/rejected": -1.689133828259454, "mean_token_accuracy": 0.714800597820431, "rewards/chosen": -1.9120060737943276, "rewards/rejected": -4.31830961406231, "rewards/accuracies": 0.88125, "rewards/margins": 2.4063035316765307, "logps/chosen": -66.28036950826645, "logps/rejected": -94.54050970077515, "epoch": 1.0502354788069075, "step": 210 }, { "loss": 0.2766362428665161, "grad_norm": 0.13189849257469177, "learning_rate": 4.525000000000001e-06, "entropy": 0.5789550712972413, "num_tokens": 2912776.0, "logits/chosen": -2.2221763658521354, "logits/rejected": -1.8088073486279135, "mean_token_accuracy": 0.702889884263277, "rewards/chosen": -2.028189473343082, "rewards/rejected": -4.469269242510199, "rewards/accuracies": 0.9, "rewards/margins": 2.441079764440656, "logps/chosen": -68.24256819486618, "logps/rejected": -93.22903311252594, "epoch": 1.1004709576138147, "step": 220 }, { "loss": 0.23496012687683104, "grad_norm": 0.16644468903541565, "learning_rate": 4.2750000000000006e-06, "entropy": 0.6224936663464178, "num_tokens": 3045027.0, "logits/chosen": -2.2752903237136666, "logits/rejected": -1.828178568048641, "mean_token_accuracy": 0.7226041538640857, "rewards/chosen": -1.6455641043721698, "rewards/rejected": -4.188303476758302, "rewards/accuracies": 0.9375, "rewards/margins": 2.5427393635734914, "logps/chosen": -60.20379667282104, "logps/rejected": -90.21792734861374, "epoch": 1.1507064364207222, "step": 230 }, { "loss": 0.2808445930480957, "grad_norm": 0.09790638834238052, "learning_rate": 4.0250000000000004e-06, "entropy": 0.5942935416060209, "num_tokens": 3177864.0, "logits/chosen": -2.214374285970609, "logits/rejected": -1.8060159189218403, "mean_token_accuracy": 0.7139855422079563, "rewards/chosen": -2.000263449997874, "rewards/rejected": -4.494492660462856, "rewards/accuracies": 0.9, "rewards/margins": 2.4942292030900717, "logps/chosen": -69.0344575881958, "logps/rejected": -93.05890698432923, "epoch": 1.2009419152276295, "step": 240 }, { "loss": 0.25449390411376954, "grad_norm": 0.17598335444927216, "learning_rate": 3.7750000000000003e-06, "entropy": 0.5563830604893155, "num_tokens": 3310570.0, "logits/chosen": -2.2972811777009783, "logits/rejected": -1.754799142074242, "mean_token_accuracy": 0.7307825996540487, "rewards/chosen": -1.9164773738128134, "rewards/rejected": -4.344262810796499, "rewards/accuracies": 0.91875, "rewards/margins": 2.4277854330837725, "logps/chosen": -61.214583086967465, "logps/rejected": -93.06631556749343, "epoch": 1.2511773940345368, "step": 250 }, { "loss": 0.27786455154418943, "grad_norm": 0.1756027787923813, "learning_rate": 3.525e-06, "entropy": 0.5661056426994037, "num_tokens": 3442438.0, "logits/chosen": -2.5175315810167995, "logits/rejected": -1.8650052276314373, "mean_token_accuracy": 0.7323311068117618, "rewards/chosen": -1.8365062187588592, "rewards/rejected": -4.31380502525717, "rewards/accuracies": 0.8625, "rewards/margins": 2.477298800647259, "logps/chosen": -57.022434735298155, "logps/rejected": -90.70113701820374, "epoch": 1.3014128728414442, "step": 260 }, { "loss": 0.2577932834625244, "grad_norm": 0.14034058153629303, "learning_rate": 3.2750000000000004e-06, "entropy": 0.6073265807557618, "num_tokens": 3575226.0, "logits/chosen": -2.2594465032187006, "logits/rejected": -1.7765446609764617, "mean_token_accuracy": 0.7151923848316073, "rewards/chosen": -1.9952404338589986, "rewards/rejected": -4.631151005625725, "rewards/accuracies": 0.9, "rewards/margins": 2.6359105587005613, "logps/chosen": -67.12786877155304, "logps/rejected": -95.03323251008987, "epoch": 1.3516483516483517, "step": 270 }, { "loss": 0.21479206085205077, "grad_norm": 0.10951383411884308, "learning_rate": 3.0250000000000003e-06, "entropy": 0.6018841085169697, "num_tokens": 3708764.0, "logits/chosen": -2.243756769139375, "logits/rejected": -1.7989005406911804, "mean_token_accuracy": 0.7319518951699138, "rewards/chosen": -1.9763077390380204, "rewards/rejected": -4.580601327866316, "rewards/accuracies": 0.9375, "rewards/margins": 2.604293593764305, "logps/chosen": -72.82697976827622, "logps/rejected": -95.6654203414917, "epoch": 1.401883830455259, "step": 280 }, { "loss": 0.19978868961334229, "grad_norm": 0.12875650823116302, "learning_rate": 2.7750000000000005e-06, "entropy": 0.5728646263669361, "num_tokens": 3841726.0, "logits/chosen": -2.302518112452634, "logits/rejected": -1.7999884628019587, "mean_token_accuracy": 0.732748724706471, "rewards/chosen": -1.644546703551896, "rewards/rejected": -4.253936622291803, "rewards/accuracies": 0.93125, "rewards/margins": 2.609389916434884, "logps/chosen": -64.7274160027504, "logps/rejected": -91.63744213581086, "epoch": 1.4521193092621665, "step": 290 }, { "loss": 0.21072747707366943, "grad_norm": 0.15346817672252655, "learning_rate": 2.5250000000000004e-06, "entropy": 0.6227463940042071, "num_tokens": 3974757.0, "logits/chosen": -2.3202292949270666, "logits/rejected": -1.810300136026595, "mean_token_accuracy": 0.7209348091855645, "rewards/chosen": -1.8770130988094025, "rewards/rejected": -4.628510889038443, "rewards/accuracies": 0.9125, "rewards/margins": 2.7514977760612966, "logps/chosen": -66.55460149049759, "logps/rejected": -96.25276688337325, "epoch": 1.5023547880690737, "step": 300 }, { "loss": 0.24212229251861572, "grad_norm": 0.14563411474227905, "learning_rate": 2.2750000000000002e-06, "entropy": 0.6426583907450549, "num_tokens": 4108097.0, "logits/chosen": -2.1412530541832013, "logits/rejected": -1.707519908513277, "mean_token_accuracy": 0.7177659312263132, "rewards/chosen": -1.9065700521459803, "rewards/rejected": -4.4909347772598265, "rewards/accuracies": 0.8875, "rewards/margins": 2.5843647211790084, "logps/chosen": -69.72430115938187, "logps/rejected": -95.48887784481049, "epoch": 1.5525902668759812, "step": 310 }, { "loss": 0.19411479234695433, "grad_norm": 0.1968318521976471, "learning_rate": 2.025e-06, "entropy": 0.5997851558611729, "num_tokens": 4241179.0, "logits/chosen": -2.2931372817864033, "logits/rejected": -1.7238778202981138, "mean_token_accuracy": 0.7393074102699757, "rewards/chosen": -1.8204080973075178, "rewards/rejected": -4.589377174526453, "rewards/accuracies": 0.9375, "rewards/margins": 2.7689690768718718, "logps/chosen": -61.95731256008148, "logps/rejected": -95.79004850387574, "epoch": 1.6028257456828885, "step": 320 }, { "loss": 0.21300046443939208, "grad_norm": 0.11447055637836456, "learning_rate": 1.7750000000000002e-06, "entropy": 0.6302400455082534, "num_tokens": 4374257.0, "logits/chosen": -2.2229450797023427, "logits/rejected": -1.6436738107543292, "mean_token_accuracy": 0.7091528498567641, "rewards/chosen": -2.150306658889167, "rewards/rejected": -4.807979169487953, "rewards/accuracies": 0.9125, "rewards/margins": 2.657672505825758, "logps/chosen": -68.53050030469895, "logps/rejected": -100.12936317920685, "epoch": 1.6530612244897958, "step": 330 }, { "loss": 0.2172943115234375, "grad_norm": 0.1635117083787918, "learning_rate": 1.525e-06, "entropy": 0.6467468961549457, "num_tokens": 4507987.0, "logits/chosen": -2.2064014070428026, "logits/rejected": -1.7057011786116063, "mean_token_accuracy": 0.7165117233991622, "rewards/chosen": -2.1934592965582853, "rewards/rejected": -4.818236185610294, "rewards/accuracies": 0.925, "rewards/margins": 2.6247768945991994, "logps/chosen": -73.86743304729461, "logps/rejected": -101.03748378753662, "epoch": 1.7032967032967035, "step": 340 }, { "loss": 0.26818394660949707, "grad_norm": 0.123164601624012, "learning_rate": 1.275e-06, "entropy": 0.5891388589632698, "num_tokens": 4640958.0, "logits/chosen": -2.363556832379082, "logits/rejected": -1.8429459234023988, "mean_token_accuracy": 0.715521557442844, "rewards/chosen": -2.0598808659851784, "rewards/rejected": -4.751493100821972, "rewards/accuracies": 0.875, "rewards/margins": 2.6916122317314146, "logps/chosen": -67.02860740423202, "logps/rejected": -96.21911665201188, "epoch": 1.7535321821036107, "step": 350 }, { "loss": 0.18771926164627076, "grad_norm": 0.13061368465423584, "learning_rate": 1.025e-06, "entropy": 0.5919548532285261, "num_tokens": 4773470.0, "logits/chosen": -2.415461791211174, "logits/rejected": -1.8003034703908902, "mean_token_accuracy": 0.725237843580544, "rewards/chosen": -2.0471138450375292, "rewards/rejected": -4.90867663770914, "rewards/accuracies": 0.9125, "rewards/margins": 2.8615628074854613, "logps/chosen": -66.5765053987503, "logps/rejected": -99.08628534078598, "epoch": 1.803767660910518, "step": 360 }, { "loss": 0.23480985164642335, "grad_norm": 0.20367136597633362, "learning_rate": 7.750000000000001e-07, "entropy": 0.5845601043401984, "num_tokens": 4906203.0, "logits/chosen": -2.4155132830968427, "logits/rejected": -1.8468861054124575, "mean_token_accuracy": 0.7147720739245415, "rewards/chosen": -2.1215642829018178, "rewards/rejected": -4.7560473963618275, "rewards/accuracies": 0.91875, "rewards/margins": 2.6344831112772225, "logps/chosen": -65.74300843477249, "logps/rejected": -96.77698543071747, "epoch": 1.8540031397174255, "step": 370 }, { "loss": 0.24985699653625487, "grad_norm": 0.13552139699459076, "learning_rate": 5.250000000000001e-07, "entropy": 0.5985304056946916, "num_tokens": 5039208.0, "logits/chosen": -2.175418165369165, "logits/rejected": -1.7445601113261318, "mean_token_accuracy": 0.7238242877647281, "rewards/chosen": -2.157696347660385, "rewards/rejected": -4.755275358445942, "rewards/accuracies": 0.9, "rewards/margins": 2.5975790090858935, "logps/chosen": -69.17709134817123, "logps/rejected": -95.39654148817063, "epoch": 1.904238618524333, "step": 380 }, { "loss": 0.20456924438476562, "grad_norm": 0.24302978813648224, "learning_rate": 2.75e-07, "entropy": 0.6462689645239152, "num_tokens": 5173272.0, "logits/chosen": -2.2007907790614545, "logits/rejected": -1.7723546397961116, "mean_token_accuracy": 0.702822900004685, "rewards/chosen": -2.0144475300621707, "rewards/rejected": -4.926444486901164, "rewards/accuracies": 0.94375, "rewards/margins": 2.9119969444349407, "logps/chosen": -70.39699934720993, "logps/rejected": -102.62485527992249, "epoch": 1.9544740973312402, "step": 390 }, { "loss": 0.19691671133041383, "grad_norm": 0.08462437242269516, "learning_rate": 2.5000000000000002e-08, "entropy": 0.5700758936236902, "num_tokens": 5293556.0, "logits/chosen": -2.3988179600885378, "logits/rejected": -1.9308654901908002, "mean_token_accuracy": 0.7132708571080504, "rewards/chosen": -2.060984511917521, "rewards/rejected": -4.996241534167322, "rewards/accuracies": 0.9241379310344827, "rewards/margins": 2.935257004869395, "logps/chosen": -64.78274021806388, "logps/rejected": -101.13663249837941, "epoch": 2.0, "step": 400 }, { "train_runtime": 1813.4186, "train_samples_per_second": 3.513, "train_steps_per_second": 0.221, "total_flos": 4.273969110335078e+16, "train_loss": 0.319741350710392, "epoch": 2.0, "step": 400 } ], "validation_monitor_size": 0, "validation_monitor_selection": "fixed_seed_random_without_replacement", "validation_monitor_seed": 23, "validation_monitor_indices": [], "early_stopping_patience": null }