| { |
| "model_name": "Qwen/Qwen2.5-1.5B-Instruct", |
| "resolved_model": "/home/yuxu/.cache/huggingface/hub/models--Qwen--Qwen2.5-1.5B-Instruct/snapshots/989aa7980e4cf806f80c7fef2b1adb7bc71aa306", |
| "num_train_records": 10000, |
| "num_validation_records_available": 0, |
| "training_config": { |
| "lora_rank": 16, |
| "lora_alpha": 32, |
| "learning_rate": 1e-05, |
| "num_epochs": 2, |
| "per_device_batch_size": 1, |
| "per_device_eval_batch_size": 1, |
| "gradient_accumulation_steps": 16, |
| "beta": 0.1, |
| "max_length": 512, |
| "max_prompt_length": 384, |
| "seed": 22, |
| "save_steps": 250, |
| "save_total_limit": 2, |
| "resume_from_checkpoint": null, |
| "precision_dtype": "torch.bfloat16", |
| "bf16": true, |
| "fp16": false, |
| "tokenizer_add_bos_token": false |
| }, |
| "global_step": 1250, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "train_metrics": { |
| "train_runtime": 5977.8981, |
| "train_samples_per_second": 3.346, |
| "train_steps_per_second": 0.209, |
| "total_flos": 1.3612284112597402e+17, |
| "train_loss": 0.45482119541168214 |
| }, |
| "log_history": [ |
| { |
| "loss": 0.689018440246582, |
| "grad_norm": 0.10905654728412628, |
| "learning_rate": 9.928e-06, |
| "entropy": 0.8563553406624124, |
| "num_tokens": 134743.0, |
| "logits/chosen": -0.9788623969289567, |
| "logits/rejected": -0.963421240675876, |
| "mean_token_accuracy": 0.7335915770381689, |
| "rewards/chosen": 0.003118900115805445, |
| "rewards/rejected": -0.005566338380720026, |
| "rewards/accuracies": 0.53125, |
| "rewards/margins": 0.0086852383617952, |
| "logps/chosen": -53.44429122209549, |
| "logps/rejected": -58.05595805644989, |
| "epoch": 0.016, |
| "step": 10 |
| }, |
| { |
| "loss": 0.6828490734100342, |
| "grad_norm": 0.11294842511415482, |
| "learning_rate": 9.848000000000001e-06, |
| "entropy": 0.8075154377147555, |
| "num_tokens": 269598.0, |
| "logits/chosen": -0.9147015579312413, |
| "logits/rejected": -0.9080481267141745, |
| "mean_token_accuracy": 0.7330205589532852, |
| "rewards/chosen": -0.009720915841876376, |
| "rewards/rejected": -0.031031110812728004, |
| "rewards/accuracies": 0.675, |
| "rewards/margins": 0.02131019511289196, |
| "logps/chosen": -55.76358859539032, |
| "logps/rejected": -53.03535443544388, |
| "epoch": 0.032, |
| "step": 20 |
| }, |
| { |
| "loss": 0.6677823066711426, |
| "grad_norm": 0.11828389763832092, |
| "learning_rate": 9.768e-06, |
| "entropy": 0.8278283050749451, |
| "num_tokens": 404333.0, |
| "logits/chosen": -1.0811326675861692, |
| "logits/rejected": -0.9070872471899184, |
| "mean_token_accuracy": 0.7307771431282163, |
| "rewards/chosen": -0.03384106803678151, |
| "rewards/rejected": -0.08754932412921335, |
| "rewards/accuracies": 0.725, |
| "rewards/margins": 0.05370825613208581, |
| "logps/chosen": -50.51493817567825, |
| "logps/rejected": -61.200947272777555, |
| "epoch": 0.048, |
| "step": 30 |
| }, |
| { |
| "loss": 0.6462172985076904, |
| "grad_norm": 0.11367130279541016, |
| "learning_rate": 9.688000000000001e-06, |
| "entropy": 0.823192946088966, |
| "num_tokens": 538701.0, |
| "logits/chosen": -1.0191294171017014, |
| "logits/rejected": -0.9379523297738434, |
| "mean_token_accuracy": 0.7370131656527519, |
| "rewards/chosen": -0.07439912984327748, |
| "rewards/rejected": -0.17708719812508206, |
| "rewards/accuracies": 0.76875, |
| "rewards/margins": 0.10268806891690474, |
| "logps/chosen": -50.990779775381085, |
| "logps/rejected": -52.61567587852478, |
| "epoch": 0.064, |
| "step": 40 |
| }, |
| { |
| "loss": 0.6121170997619629, |
| "grad_norm": 0.12841418385505676, |
| "learning_rate": 9.608e-06, |
| "entropy": 0.8364603637135588, |
| "num_tokens": 673524.0, |
| "logits/chosen": -0.9610722555180565, |
| "logits/rejected": -0.8514297521784684, |
| "mean_token_accuracy": 0.7061145938932896, |
| "rewards/chosen": -0.14487820940848906, |
| "rewards/rejected": -0.332736360195122, |
| "rewards/accuracies": 0.78125, |
| "rewards/margins": 0.1878581509925425, |
| "logps/chosen": -58.89807789325714, |
| "logps/rejected": -60.78576712608337, |
| "epoch": 0.08, |
| "step": 50 |
| }, |
| { |
| "loss": 0.5916354179382324, |
| "grad_norm": 0.11347971856594086, |
| "learning_rate": 9.528000000000001e-06, |
| "entropy": 0.8045067954575643, |
| "num_tokens": 808013.0, |
| "logits/chosen": -1.0201351325489214, |
| "logits/rejected": -0.8894283035358745, |
| "mean_token_accuracy": 0.7225402432493866, |
| "rewards/chosen": -0.24984656272717984, |
| "rewards/rejected": -0.504135195492563, |
| "rewards/accuracies": 0.78125, |
| "rewards/margins": 0.25428863214328884, |
| "logps/chosen": -52.76062165498733, |
| "logps/rejected": -61.86190390586853, |
| "epoch": 0.096, |
| "step": 60 |
| }, |
| { |
| "loss": 0.576406192779541, |
| "grad_norm": 0.13050724565982819, |
| "learning_rate": 9.448e-06, |
| "entropy": 0.8006839740090073, |
| "num_tokens": 942494.0, |
| "logits/chosen": -1.0778371811063052, |
| "logits/rejected": -0.9411381606196525, |
| "mean_token_accuracy": 0.713543506525457, |
| "rewards/chosen": -0.38982224147985106, |
| "rewards/rejected": -0.7144045860972256, |
| "rewards/accuracies": 0.76875, |
| "rewards/margins": 0.32458234429359434, |
| "logps/chosen": -60.53339612483978, |
| "logps/rejected": -60.80531245470047, |
| "epoch": 0.112, |
| "step": 70 |
| }, |
| { |
| "loss": 0.5392527103424072, |
| "grad_norm": 0.10742519050836563, |
| "learning_rate": 9.368e-06, |
| "entropy": 0.8088806970277801, |
| "num_tokens": 1076339.0, |
| "logits/chosen": -1.1278537035014409, |
| "logits/rejected": -0.8774969710621068, |
| "mean_token_accuracy": 0.7182694263756275, |
| "rewards/chosen": -0.5486542367416405, |
| "rewards/rejected": -0.9956708228681237, |
| "rewards/accuracies": 0.76875, |
| "rewards/margins": 0.4470165837556124, |
| "logps/chosen": -52.11761736869812, |
| "logps/rejected": -67.0722449183464, |
| "epoch": 0.128, |
| "step": 80 |
| }, |
| { |
| "loss": 0.5608308792114258, |
| "grad_norm": 0.15674173831939697, |
| "learning_rate": 9.288e-06, |
| "entropy": 0.768392307573231, |
| "num_tokens": 1210662.0, |
| "logits/chosen": -1.1788602806606145, |
| "logits/rejected": -1.03331966826322, |
| "mean_token_accuracy": 0.7145220551639795, |
| "rewards/chosen": -0.720596243354521, |
| "rewards/rejected": -1.1825086012715473, |
| "rewards/accuracies": 0.74375, |
| "rewards/margins": 0.46191235817968845, |
| "logps/chosen": -60.48848968744278, |
| "logps/rejected": -64.15390303134919, |
| "epoch": 0.144, |
| "step": 90 |
| }, |
| { |
| "loss": 0.555051851272583, |
| "grad_norm": 0.13351617753505707, |
| "learning_rate": 9.208e-06, |
| "entropy": 0.7862678854435217, |
| "num_tokens": 1345120.0, |
| "logits/chosen": -1.168248595800457, |
| "logits/rejected": -1.0325365206859007, |
| "mean_token_accuracy": 0.708121376670897, |
| "rewards/chosen": -0.8649011284462176, |
| "rewards/rejected": -1.4063857643632218, |
| "rewards/accuracies": 0.6875, |
| "rewards/margins": 0.5414846379309892, |
| "logps/chosen": -61.20340501070022, |
| "logps/rejected": -66.58065437078476, |
| "epoch": 0.16, |
| "step": 100 |
| }, |
| { |
| "loss": 0.5074045658111572, |
| "grad_norm": 0.21781982481479645, |
| "learning_rate": 9.128e-06, |
| "entropy": 0.7356140260322718, |
| "num_tokens": 1479281.0, |
| "logits/chosen": -1.3261684939964402, |
| "logits/rejected": -1.1306528941057346, |
| "mean_token_accuracy": 0.7123186649754644, |
| "rewards/chosen": -0.9123384133912623, |
| "rewards/rejected": -1.6054315031506121, |
| "rewards/accuracies": 0.76875, |
| "rewards/margins": 0.6930930894799531, |
| "logps/chosen": -59.55553774833679, |
| "logps/rejected": -72.37696163654327, |
| "epoch": 0.176, |
| "step": 110 |
| }, |
| { |
| "loss": 0.5216456413269043, |
| "grad_norm": 0.19241169095039368, |
| "learning_rate": 9.048e-06, |
| "entropy": 0.7655054951086641, |
| "num_tokens": 1613851.0, |
| "logits/chosen": -1.3025066533169531, |
| "logits/rejected": -1.143896303288123, |
| "mean_token_accuracy": 0.7036409357562661, |
| "rewards/chosen": -1.0751173802796985, |
| "rewards/rejected": -1.776869938801974, |
| "rewards/accuracies": 0.75, |
| "rewards/margins": 0.7017525571398437, |
| "logps/chosen": -66.2069799900055, |
| "logps/rejected": -74.56398607492447, |
| "epoch": 0.192, |
| "step": 120 |
| }, |
| { |
| "loss": 0.5168225765228271, |
| "grad_norm": 0.08994148671627045, |
| "learning_rate": 8.968000000000001e-06, |
| "entropy": 0.7540512274950742, |
| "num_tokens": 1748368.0, |
| "logits/chosen": -1.391650497545763, |
| "logits/rejected": -1.1460448347696492, |
| "mean_token_accuracy": 0.7162771710194648, |
| "rewards/chosen": -1.0096850864356384, |
| "rewards/rejected": -1.827320344489999, |
| "rewards/accuracies": 0.76875, |
| "rewards/margins": 0.817635256703943, |
| "logps/chosen": -61.82568025588989, |
| "logps/rejected": -76.9469052195549, |
| "epoch": 0.208, |
| "step": 130 |
| }, |
| { |
| "loss": 0.46869478225708006, |
| "grad_norm": 0.13741639256477356, |
| "learning_rate": 8.888e-06, |
| "entropy": 0.7924248128314503, |
| "num_tokens": 1883496.0, |
| "logits/chosen": -1.3249019191600873, |
| "logits/rejected": -1.1026000772151963, |
| "mean_token_accuracy": 0.7087388038635254, |
| "rewards/chosen": -1.0496459440822945, |
| "rewards/rejected": -2.055653589125723, |
| "rewards/accuracies": 0.81875, |
| "rewards/margins": 1.0060076432302594, |
| "logps/chosen": -64.32736076116562, |
| "logps/rejected": -81.53705527782441, |
| "epoch": 0.224, |
| "step": 140 |
| }, |
| { |
| "loss": 0.49356565475463865, |
| "grad_norm": 0.13059070706367493, |
| "learning_rate": 8.808000000000001e-06, |
| "entropy": 0.7655621751298896, |
| "num_tokens": 2017285.0, |
| "logits/chosen": -1.5351193051368675, |
| "logits/rejected": -1.235119241285585, |
| "mean_token_accuracy": 0.7035089529119432, |
| "rewards/chosen": -1.090340746268339, |
| "rewards/rejected": -1.9519310850591864, |
| "rewards/accuracies": 0.75625, |
| "rewards/margins": 0.8615903402678668, |
| "logps/chosen": -58.17775413990021, |
| "logps/rejected": -74.25504211187362, |
| "epoch": 0.24, |
| "step": 150 |
| }, |
| { |
| "loss": 0.5369758605957031, |
| "grad_norm": 0.13786712288856506, |
| "learning_rate": 8.728e-06, |
| "entropy": 0.6862338791484944, |
| "num_tokens": 2150045.0, |
| "logits/chosen": -1.4912660164800315, |
| "logits/rejected": -1.333143902399643, |
| "mean_token_accuracy": 0.701057541090995, |
| "rewards/chosen": -1.1116661975334865, |
| "rewards/rejected": -1.7480126170441508, |
| "rewards/accuracies": 0.775, |
| "rewards/margins": 0.6363464183639735, |
| "logps/chosen": -59.09992996454239, |
| "logps/rejected": -60.96899574995041, |
| "epoch": 0.256, |
| "step": 160 |
| }, |
| { |
| "loss": 0.5533265113830567, |
| "grad_norm": 0.18535780906677246, |
| "learning_rate": 8.648000000000001e-06, |
| "entropy": 0.7963132435863371, |
| "num_tokens": 2284628.0, |
| "logits/chosen": -1.4200859032965045, |
| "logits/rejected": -1.1475656571055712, |
| "mean_token_accuracy": 0.6968366431072355, |
| "rewards/chosen": -1.2623908873065375, |
| "rewards/rejected": -1.9762427852023392, |
| "rewards/accuracies": 0.70625, |
| "rewards/margins": 0.7138518976047635, |
| "logps/chosen": -65.92677880525589, |
| "logps/rejected": -75.31166982650757, |
| "epoch": 0.272, |
| "step": 170 |
| }, |
| { |
| "loss": 0.48800249099731446, |
| "grad_norm": 0.17086467146873474, |
| "learning_rate": 8.568e-06, |
| "entropy": 0.7096531906281598, |
| "num_tokens": 2418154.0, |
| "logits/chosen": -1.4284564529605592, |
| "logits/rejected": -1.1960109995497337, |
| "mean_token_accuracy": 0.7045122615993022, |
| "rewards/chosen": -1.080190175800817, |
| "rewards/rejected": -1.9707384748850019, |
| "rewards/accuracies": 0.71875, |
| "rewards/margins": 0.8905482929199934, |
| "logps/chosen": -59.75125551223755, |
| "logps/rejected": -70.24758154153824, |
| "epoch": 0.288, |
| "step": 180 |
| }, |
| { |
| "loss": 0.46792116165161135, |
| "grad_norm": 0.16177140176296234, |
| "learning_rate": 8.488e-06, |
| "entropy": 0.7515300859929994, |
| "num_tokens": 2551816.0, |
| "logits/chosen": -1.2414827391616068, |
| "logits/rejected": -1.0802036758082083, |
| "mean_token_accuracy": 0.7072636014781892, |
| "rewards/chosen": -1.0667701240134193, |
| "rewards/rejected": -1.9473204111913218, |
| "rewards/accuracies": 0.8375, |
| "rewards/margins": 0.8805502850795165, |
| "logps/chosen": -65.70144573450088, |
| "logps/rejected": -68.4914104104042, |
| "epoch": 0.304, |
| "step": 190 |
| }, |
| { |
| "loss": 0.5006054878234864, |
| "grad_norm": 0.16638650000095367, |
| "learning_rate": 8.408e-06, |
| "entropy": 0.8327071964275092, |
| "num_tokens": 2686525.0, |
| "logits/chosen": -1.2503270258894088, |
| "logits/rejected": -0.995497852108113, |
| "mean_token_accuracy": 0.6908243351615966, |
| "rewards/chosen": -1.1853100352571346, |
| "rewards/rejected": -2.0631397599121555, |
| "rewards/accuracies": 0.76875, |
| "rewards/margins": 0.8778297245502472, |
| "logps/chosen": -65.22179394960403, |
| "logps/rejected": -76.10799474716187, |
| "epoch": 0.32, |
| "step": 200 |
| }, |
| { |
| "loss": 0.452646541595459, |
| "grad_norm": 0.26452815532684326, |
| "learning_rate": 8.328e-06, |
| "entropy": 0.8430000780150294, |
| "num_tokens": 2821412.0, |
| "logits/chosen": -1.1790006368335502, |
| "logits/rejected": -0.8779570491578651, |
| "mean_token_accuracy": 0.6723773072008044, |
| "rewards/chosen": -1.1888155334367183, |
| "rewards/rejected": -2.2633378646452913, |
| "rewards/accuracies": 0.7375, |
| "rewards/margins": 1.074522328004241, |
| "logps/chosen": -64.86716014146805, |
| "logps/rejected": -79.61585273742676, |
| "epoch": 0.336, |
| "step": 210 |
| }, |
| { |
| "loss": 0.5181353569030762, |
| "grad_norm": 0.11742082983255386, |
| "learning_rate": 8.248e-06, |
| "entropy": 0.8045017344535154, |
| "num_tokens": 2956627.0, |
| "logits/chosen": -1.2154215871610907, |
| "logits/rejected": -0.939022998277143, |
| "mean_token_accuracy": 0.6996388690546155, |
| "rewards/chosen": -1.1623295453668105, |
| "rewards/rejected": -2.163627782184631, |
| "rewards/accuracies": 0.775, |
| "rewards/margins": 1.00129823833704, |
| "logps/chosen": -62.80202409029007, |
| "logps/rejected": -81.0254952788353, |
| "epoch": 0.352, |
| "step": 220 |
| }, |
| { |
| "loss": 0.4743824481964111, |
| "grad_norm": 0.16635876893997192, |
| "learning_rate": 8.168e-06, |
| "entropy": 0.7914588764862855, |
| "num_tokens": 3090619.0, |
| "logits/chosen": -1.1884228506656345, |
| "logits/rejected": -0.9203135491484804, |
| "mean_token_accuracy": 0.6981304872781038, |
| "rewards/chosen": -1.0808302243589423, |
| "rewards/rejected": -2.0085678519913928, |
| "rewards/accuracies": 0.78125, |
| "rewards/margins": 0.9277376340702176, |
| "logps/chosen": -60.4386828660965, |
| "logps/rejected": -72.10626875162124, |
| "epoch": 0.368, |
| "step": 230 |
| }, |
| { |
| "loss": 0.48973665237426756, |
| "grad_norm": 0.1960846185684204, |
| "learning_rate": 8.088e-06, |
| "entropy": 0.8449207143319655, |
| "num_tokens": 3225094.0, |
| "logits/chosen": -1.1508734381084937, |
| "logits/rejected": -0.9685642621415461, |
| "mean_token_accuracy": 0.6950183667242527, |
| "rewards/chosen": -1.2113628653900377, |
| "rewards/rejected": -2.089532778749708, |
| "rewards/accuracies": 0.8, |
| "rewards/margins": 0.8781699133105576, |
| "logps/chosen": -68.62453348636627, |
| "logps/rejected": -75.98600549697876, |
| "epoch": 0.384, |
| "step": 240 |
| }, |
| { |
| "loss": 0.5802257061004639, |
| "grad_norm": 0.11632820218801498, |
| "learning_rate": 8.008e-06, |
| "entropy": 0.7761064321442973, |
| "num_tokens": 3360182.0, |
| "logits/chosen": -1.2831330545177115, |
| "logits/rejected": -1.0997321391861137, |
| "mean_token_accuracy": 0.6970741396769882, |
| "rewards/chosen": -1.1727734387372037, |
| "rewards/rejected": -1.8903911848203279, |
| "rewards/accuracies": 0.70625, |
| "rewards/margins": 0.7176177425310015, |
| "logps/chosen": -66.26374975442886, |
| "logps/rejected": -72.10199882984162, |
| "epoch": 0.4, |
| "step": 250 |
| }, |
| { |
| "loss": 0.43405885696411134, |
| "grad_norm": 0.14540572464466095, |
| "learning_rate": 7.928e-06, |
| "entropy": 0.7629542504204437, |
| "num_tokens": 3494544.0, |
| "logits/chosen": -1.3185474115706086, |
| "logits/rejected": -1.0363903950282343, |
| "mean_token_accuracy": 0.69958227686584, |
| "rewards/chosen": -0.9348558198704268, |
| "rewards/rejected": -1.9087367365602403, |
| "rewards/accuracies": 0.8125, |
| "rewards/margins": 0.9738809239119292, |
| "logps/chosen": -61.2034912109375, |
| "logps/rejected": -71.80750354528428, |
| "epoch": 0.416, |
| "step": 260 |
| }, |
| { |
| "loss": 0.44985151290893555, |
| "grad_norm": 0.14902211725711823, |
| "learning_rate": 7.848000000000002e-06, |
| "entropy": 0.8110592220822582, |
| "num_tokens": 3628021.0, |
| "logits/chosen": -1.2687084794247518, |
| "logits/rejected": -0.9412073643616663, |
| "mean_token_accuracy": 0.6967338371090591, |
| "rewards/chosen": -1.0113929210696369, |
| "rewards/rejected": -1.9841588545590638, |
| "rewards/accuracies": 0.8, |
| "rewards/margins": 0.9727659282274544, |
| "logps/chosen": -58.82498153448105, |
| "logps/rejected": -72.50857379436493, |
| "epoch": 0.432, |
| "step": 270 |
| }, |
| { |
| "loss": 0.47422361373901367, |
| "grad_norm": 0.14587490260601044, |
| "learning_rate": 7.768e-06, |
| "entropy": 0.8527051686949563, |
| "num_tokens": 3762769.0, |
| "logits/chosen": -1.2181775523388327, |
| "logits/rejected": -0.8992369459063199, |
| "mean_token_accuracy": 0.7088230043649674, |
| "rewards/chosen": -1.1207619122928008, |
| "rewards/rejected": -2.148672613617964, |
| "rewards/accuracies": 0.78125, |
| "rewards/margins": 1.0279107017442584, |
| "logps/chosen": -61.72244974374771, |
| "logps/rejected": -78.88542218208313, |
| "epoch": 0.448, |
| "step": 280 |
| }, |
| { |
| "loss": 0.5027151107788086, |
| "grad_norm": 0.09337582439184189, |
| "learning_rate": 7.688000000000002e-06, |
| "entropy": 0.7852856576413615, |
| "num_tokens": 3896554.0, |
| "logits/chosen": -1.3354775567844146, |
| "logits/rejected": -1.1184485921419505, |
| "mean_token_accuracy": 0.6952060368843377, |
| "rewards/chosen": -1.1932822762464639, |
| "rewards/rejected": -2.0500318385427816, |
| "rewards/accuracies": 0.75, |
| "rewards/margins": 0.8567495625931769, |
| "logps/chosen": -66.44852304458618, |
| "logps/rejected": -70.7834144949913, |
| "epoch": 0.464, |
| "step": 290 |
| }, |
| { |
| "loss": 0.44806575775146484, |
| "grad_norm": 0.1337847113609314, |
| "learning_rate": 7.608000000000001e-06, |
| "entropy": 0.7422546729561873, |
| "num_tokens": 4030330.0, |
| "logits/chosen": -1.4700220277909535, |
| "logits/rejected": -1.1814784580674191, |
| "mean_token_accuracy": 0.7079419396817684, |
| "rewards/chosen": -1.1185172388635691, |
| "rewards/rejected": -2.27528806256596, |
| "rewards/accuracies": 0.83125, |
| "rewards/margins": 1.1567708211019636, |
| "logps/chosen": -63.6253160238266, |
| "logps/rejected": -74.7424528837204, |
| "epoch": 0.48, |
| "step": 300 |
| }, |
| { |
| "loss": 0.45131826400756836, |
| "grad_norm": 0.16172009706497192, |
| "learning_rate": 7.528000000000001e-06, |
| "entropy": 0.7010916481667664, |
| "num_tokens": 4163071.0, |
| "logits/chosen": -1.5153129547936302, |
| "logits/rejected": -1.209580647062671, |
| "mean_token_accuracy": 0.720912242680788, |
| "rewards/chosen": -1.1323760432947894, |
| "rewards/rejected": -2.123044349125121, |
| "rewards/accuracies": 0.825, |
| "rewards/margins": 0.9906683029606939, |
| "logps/chosen": -61.3173499584198, |
| "logps/rejected": -70.07959650754928, |
| "epoch": 0.496, |
| "step": 310 |
| }, |
| { |
| "loss": 0.4254595756530762, |
| "grad_norm": 0.11975234746932983, |
| "learning_rate": 7.4480000000000005e-06, |
| "entropy": 0.7769533811253495, |
| "num_tokens": 4297650.0, |
| "logits/chosen": -1.3886568818841, |
| "logits/rejected": -1.13002503495388, |
| "mean_token_accuracy": 0.7051799762062728, |
| "rewards/chosen": -0.9357022894022521, |
| "rewards/rejected": -1.983945999154821, |
| "rewards/accuracies": 0.8625, |
| "rewards/margins": 1.048243713984266, |
| "logps/chosen": -68.33114951848984, |
| "logps/rejected": -71.30756684541703, |
| "epoch": 0.512, |
| "step": 320 |
| }, |
| { |
| "loss": 0.41445064544677734, |
| "grad_norm": 0.2776741087436676, |
| "learning_rate": 7.3680000000000004e-06, |
| "entropy": 0.7489449862972833, |
| "num_tokens": 4431577.0, |
| "logits/chosen": -1.6288736615844654, |
| "logits/rejected": -1.2485594975833538, |
| "mean_token_accuracy": 0.6974780206568539, |
| "rewards/chosen": -0.9473370073334081, |
| "rewards/rejected": -2.106761427427409, |
| "rewards/accuracies": 0.84375, |
| "rewards/margins": 1.1594244167208672, |
| "logps/chosen": -62.647765040397644, |
| "logps/rejected": -75.1746208190918, |
| "epoch": 0.528, |
| "step": 330 |
| }, |
| { |
| "loss": 0.4307701587677002, |
| "grad_norm": 0.13814318180084229, |
| "learning_rate": 7.288e-06, |
| "entropy": 0.6795995138236322, |
| "num_tokens": 4565362.0, |
| "logits/chosen": -1.7014978124379496, |
| "logits/rejected": -1.360194546265395, |
| "mean_token_accuracy": 0.7122661659494043, |
| "rewards/chosen": -1.1425236859824508, |
| "rewards/rejected": -2.3793784040724857, |
| "rewards/accuracies": 0.8125, |
| "rewards/margins": 1.236854719556868, |
| "logps/chosen": -61.26923282146454, |
| "logps/rejected": -76.55938069820404, |
| "epoch": 0.544, |
| "step": 340 |
| }, |
| { |
| "loss": 0.5171660423278809, |
| "grad_norm": 0.2421128898859024, |
| "learning_rate": 7.208e-06, |
| "entropy": 0.736682211542211, |
| "num_tokens": 4699278.0, |
| "logits/chosen": -1.5375196977562884, |
| "logits/rejected": -1.2775026091481378, |
| "mean_token_accuracy": 0.7100502958521246, |
| "rewards/chosen": -1.234824466597638, |
| "rewards/rejected": -2.2794134604977443, |
| "rewards/accuracies": 0.78125, |
| "rewards/margins": 1.0445889961905777, |
| "logps/chosen": -61.170579481124875, |
| "logps/rejected": -73.94075057506561, |
| "epoch": 0.56, |
| "step": 350 |
| }, |
| { |
| "loss": 0.4048302173614502, |
| "grad_norm": 0.13529057800769806, |
| "learning_rate": 7.128e-06, |
| "entropy": 0.7252036946330918, |
| "num_tokens": 4834112.0, |
| "logits/chosen": -1.5076449032651227, |
| "logits/rejected": -1.3696309019049226, |
| "mean_token_accuracy": 0.7079439009539783, |
| "rewards/chosen": -1.1786035622935742, |
| "rewards/rejected": -2.421615838177968, |
| "rewards/accuracies": 0.825, |
| "rewards/margins": 1.2430122738704086, |
| "logps/chosen": -75.25101128816604, |
| "logps/rejected": -73.58783400058746, |
| "epoch": 0.576, |
| "step": 360 |
| }, |
| { |
| "loss": 0.4977682113647461, |
| "grad_norm": 0.1781209260225296, |
| "learning_rate": 7.048e-06, |
| "entropy": 0.8224106237757951, |
| "num_tokens": 4968874.0, |
| "logits/chosen": -1.3960146295474423, |
| "logits/rejected": -1.1073445296913083, |
| "mean_token_accuracy": 0.708382755331695, |
| "rewards/chosen": -1.115643077727873, |
| "rewards/rejected": -2.070754229882732, |
| "rewards/accuracies": 0.74375, |
| "rewards/margins": 0.955111154448241, |
| "logps/chosen": -61.408040976524354, |
| "logps/rejected": -78.4707190990448, |
| "epoch": 0.592, |
| "step": 370 |
| }, |
| { |
| "loss": 0.4448493480682373, |
| "grad_norm": 0.1303374469280243, |
| "learning_rate": 6.968e-06, |
| "entropy": 0.7095136601157719, |
| "num_tokens": 5102712.0, |
| "logits/chosen": -1.550997072455129, |
| "logits/rejected": -1.2904333606869343, |
| "mean_token_accuracy": 0.69968516016379, |
| "rewards/chosen": -0.9111583859747043, |
| "rewards/rejected": -2.052812862768769, |
| "rewards/accuracies": 0.80625, |
| "rewards/margins": 1.141654483322054, |
| "logps/chosen": -59.56483067274094, |
| "logps/rejected": -70.73611218929291, |
| "epoch": 0.608, |
| "step": 380 |
| }, |
| { |
| "loss": 0.618243932723999, |
| "grad_norm": 0.23218761384487152, |
| "learning_rate": 6.888e-06, |
| "entropy": 0.7683811950089876, |
| "num_tokens": 5236746.0, |
| "logits/chosen": -1.4908055362391708, |
| "logits/rejected": -1.2139118427508149, |
| "mean_token_accuracy": 0.7114272927865386, |
| "rewards/chosen": -1.168174527026713, |
| "rewards/rejected": -1.9601395897567273, |
| "rewards/accuracies": 0.71875, |
| "rewards/margins": 0.7919650661759079, |
| "logps/chosen": -63.611954271793365, |
| "logps/rejected": -72.28059177398681, |
| "epoch": 0.624, |
| "step": 390 |
| }, |
| { |
| "loss": 0.5224360942840576, |
| "grad_norm": 0.16070543229579926, |
| "learning_rate": 6.808e-06, |
| "entropy": 0.8030928350694012, |
| "num_tokens": 5371265.0, |
| "logits/chosen": -1.3533366529032598, |
| "logits/rejected": -1.0578829997757886, |
| "mean_token_accuracy": 0.7191924162209034, |
| "rewards/chosen": -0.8509922233264661, |
| "rewards/rejected": -1.6920959531096742, |
| "rewards/accuracies": 0.7625, |
| "rewards/margins": 0.8411037294892594, |
| "logps/chosen": -61.14945147037506, |
| "logps/rejected": -68.67226406335831, |
| "epoch": 0.64, |
| "step": 400 |
| }, |
| { |
| "loss": 0.41513900756835936, |
| "grad_norm": 0.19860734045505524, |
| "learning_rate": 6.728e-06, |
| "entropy": 0.7868119461927563, |
| "num_tokens": 5505311.0, |
| "logits/chosen": -1.2997119180538206, |
| "logits/rejected": -1.0947122079972385, |
| "mean_token_accuracy": 0.7141418108716607, |
| "rewards/chosen": -0.5277955924670096, |
| "rewards/rejected": -1.6158742993546185, |
| "rewards/accuracies": 0.85625, |
| "rewards/margins": 1.0880787078291179, |
| "logps/chosen": -58.874490237236024, |
| "logps/rejected": -69.12621879577637, |
| "epoch": 0.656, |
| "step": 410 |
| }, |
| { |
| "loss": 0.4617919921875, |
| "grad_norm": 0.1614799201488495, |
| "learning_rate": 6.648e-06, |
| "entropy": 0.8407431220111903, |
| "num_tokens": 5639727.0, |
| "logits/chosen": -1.2453079399296676, |
| "logits/rejected": -0.9694453760606313, |
| "mean_token_accuracy": 0.6953371344134212, |
| "rewards/chosen": -0.6480406609189231, |
| "rewards/rejected": -1.6581713807128835, |
| "rewards/accuracies": 0.80625, |
| "rewards/margins": 1.0101307133561932, |
| "logps/chosen": -58.330216348171234, |
| "logps/rejected": -75.3308912873268, |
| "epoch": 0.672, |
| "step": 420 |
| }, |
| { |
| "loss": 0.44162707328796386, |
| "grad_norm": 0.15507620573043823, |
| "learning_rate": 6.568000000000001e-06, |
| "entropy": 0.7857385093288031, |
| "num_tokens": 5775347.0, |
| "logits/chosen": -1.4506047377437405, |
| "logits/rejected": -1.1385212073298612, |
| "mean_token_accuracy": 0.7148427126929164, |
| "rewards/chosen": -0.9052540952921845, |
| "rewards/rejected": -1.9813320814282633, |
| "rewards/accuracies": 0.8, |
| "rewards/margins": 1.0760779848322273, |
| "logps/chosen": -70.78476246595383, |
| "logps/rejected": -75.07093167304993, |
| "epoch": 0.688, |
| "step": 430 |
| }, |
| { |
| "loss": 0.45162124633789064, |
| "grad_norm": 0.23057712614536285, |
| "learning_rate": 6.488000000000001e-06, |
| "entropy": 0.7095841458125506, |
| "num_tokens": 5908570.0, |
| "logits/chosen": -1.522052635312034, |
| "logits/rejected": -1.1914354851620277, |
| "mean_token_accuracy": 0.7254255541600287, |
| "rewards/chosen": -1.0367633419460618, |
| "rewards/rejected": -2.0772957720793785, |
| "rewards/accuracies": 0.8, |
| "rewards/margins": 1.0405324320308864, |
| "logps/chosen": -56.933732664585115, |
| "logps/rejected": -71.38762845993043, |
| "epoch": 0.704, |
| "step": 440 |
| }, |
| { |
| "loss": 0.5143694877624512, |
| "grad_norm": 0.1373089849948883, |
| "learning_rate": 6.408000000000001e-06, |
| "entropy": 0.7877030725649092, |
| "num_tokens": 6042989.0, |
| "logits/chosen": -1.3941457694145336, |
| "logits/rejected": -1.1642616028929327, |
| "mean_token_accuracy": 0.7271975075826049, |
| "rewards/chosen": -1.1276259648264386, |
| "rewards/rejected": -2.2803055624710398, |
| "rewards/accuracies": 0.775, |
| "rewards/margins": 1.1526795887388288, |
| "logps/chosen": -62.81108283996582, |
| "logps/rejected": -78.13692320585251, |
| "epoch": 0.72, |
| "step": 450 |
| }, |
| { |
| "loss": 0.4237183094024658, |
| "grad_norm": 0.13749825954437256, |
| "learning_rate": 6.328000000000001e-06, |
| "entropy": 0.7828766799415462, |
| "num_tokens": 6177897.0, |
| "logits/chosen": -1.3374319642690895, |
| "logits/rejected": -1.1246487231005464, |
| "mean_token_accuracy": 0.7126569332554936, |
| "rewards/chosen": -0.9298112412194314, |
| "rewards/rejected": -2.1673050606746984, |
| "rewards/accuracies": 0.81875, |
| "rewards/margins": 1.2374938178574666, |
| "logps/chosen": -63.089643478393555, |
| "logps/rejected": -75.59077807664872, |
| "epoch": 0.736, |
| "step": 460 |
| }, |
| { |
| "loss": 0.4884624004364014, |
| "grad_norm": 0.1415245234966278, |
| "learning_rate": 6.248000000000001e-06, |
| "entropy": 0.8562492666591425, |
| "num_tokens": 6312714.0, |
| "logits/chosen": -1.126100791332234, |
| "logits/rejected": -0.8647624546845234, |
| "mean_token_accuracy": 0.6987247484736144, |
| "rewards/chosen": -0.808612387260655, |
| "rewards/rejected": -1.6612209561048075, |
| "rewards/accuracies": 0.80625, |
| "rewards/margins": 0.8526085724122823, |
| "logps/chosen": -67.91057009696961, |
| "logps/rejected": -70.94221692085266, |
| "epoch": 0.752, |
| "step": 470 |
| }, |
| { |
| "loss": 0.44064011573791506, |
| "grad_norm": 0.20672255754470825, |
| "learning_rate": 6.168000000000001e-06, |
| "entropy": 0.7785831509012496, |
| "num_tokens": 6446811.0, |
| "logits/chosen": -1.3451005530773972, |
| "logits/rejected": -1.0701528376820553, |
| "mean_token_accuracy": 0.7139140725135803, |
| "rewards/chosen": -0.8083824556204491, |
| "rewards/rejected": -1.8517554196994752, |
| "rewards/accuracies": 0.81875, |
| "rewards/margins": 1.0433729680255055, |
| "logps/chosen": -58.11244525909424, |
| "logps/rejected": -70.4776518702507, |
| "epoch": 0.768, |
| "step": 480 |
| }, |
| { |
| "loss": 0.4577657222747803, |
| "grad_norm": 0.20929287374019623, |
| "learning_rate": 6.088000000000001e-06, |
| "entropy": 0.8531491419766098, |
| "num_tokens": 6581587.0, |
| "logits/chosen": -1.2832854161235994, |
| "logits/rejected": -1.1052666904723358, |
| "mean_token_accuracy": 0.7067524623125792, |
| "rewards/chosen": -0.9194631451624445, |
| "rewards/rejected": -1.912933972803876, |
| "rewards/accuracies": 0.7875, |
| "rewards/margins": 0.9934708263725043, |
| "logps/chosen": -62.308107471466066, |
| "logps/rejected": -74.89246033430099, |
| "epoch": 0.784, |
| "step": 490 |
| }, |
| { |
| "loss": 0.4375007629394531, |
| "grad_norm": 0.20060019195079803, |
| "learning_rate": 6.008000000000001e-06, |
| "entropy": 0.7929941387919826, |
| "num_tokens": 6716289.0, |
| "logits/chosen": -1.3354546779997054, |
| "logits/rejected": -1.0329545787740195, |
| "mean_token_accuracy": 0.7229124492034316, |
| "rewards/chosen": -1.0229379917611368, |
| "rewards/rejected": -2.1298453632509338, |
| "rewards/accuracies": 0.8, |
| "rewards/margins": 1.1069073686376214, |
| "logps/chosen": -63.658102416992186, |
| "logps/rejected": -75.60895298719406, |
| "epoch": 0.8, |
| "step": 500 |
| }, |
| { |
| "loss": 0.44527058601379393, |
| "grad_norm": 0.16677559912204742, |
| "learning_rate": 5.928000000000001e-06, |
| "entropy": 0.8354968667088543, |
| "num_tokens": 6850716.0, |
| "logits/chosen": -1.4591034667577056, |
| "logits/rejected": -1.0641008106016938, |
| "mean_token_accuracy": 0.705034868977964, |
| "rewards/chosen": -0.8949406793020899, |
| "rewards/rejected": -2.185808292112779, |
| "rewards/accuracies": 0.81875, |
| "rewards/margins": 1.2908676087856292, |
| "logps/chosen": -58.768228101730344, |
| "logps/rejected": -78.82726471424102, |
| "epoch": 0.816, |
| "step": 510 |
| }, |
| { |
| "loss": 0.3973827600479126, |
| "grad_norm": 0.15284304320812225, |
| "learning_rate": 5.848000000000001e-06, |
| "entropy": 0.8099856940709287, |
| "num_tokens": 6984942.0, |
| "logits/chosen": -1.3746344108751551, |
| "logits/rejected": -0.9748087908165729, |
| "mean_token_accuracy": 0.7168531034141779, |
| "rewards/chosen": -0.8542922898486722, |
| "rewards/rejected": -2.102445878717117, |
| "rewards/accuracies": 0.85625, |
| "rewards/margins": 1.2481535905040801, |
| "logps/chosen": -63.956273436546326, |
| "logps/rejected": -74.7093752503395, |
| "epoch": 0.832, |
| "step": 520 |
| }, |
| { |
| "loss": 0.39521021842956544, |
| "grad_norm": 0.19803296029567719, |
| "learning_rate": 5.7680000000000005e-06, |
| "entropy": 0.819463662133785, |
| "num_tokens": 7118390.0, |
| "logits/chosen": -1.4278405835062675, |
| "logits/rejected": -1.1354102461541689, |
| "mean_token_accuracy": 0.7017366614192724, |
| "rewards/chosen": -0.8539736664190286, |
| "rewards/rejected": -2.189559509139508, |
| "rewards/accuracies": 0.81875, |
| "rewards/margins": 1.3355858475901186, |
| "logps/chosen": -59.81350688934326, |
| "logps/rejected": -72.4623057961464, |
| "epoch": 0.848, |
| "step": 530 |
| }, |
| { |
| "loss": 0.4910752773284912, |
| "grad_norm": 0.17725913226604462, |
| "learning_rate": 5.6880000000000004e-06, |
| "entropy": 0.8000208166384255, |
| "num_tokens": 7252607.0, |
| "logits/chosen": -1.4821630663306287, |
| "logits/rejected": -1.1388486199317076, |
| "mean_token_accuracy": 0.7186640851199627, |
| "rewards/chosen": -1.0058101782691664, |
| "rewards/rejected": -2.2602031591522973, |
| "rewards/accuracies": 0.78125, |
| "rewards/margins": 1.2543929865583778, |
| "logps/chosen": -59.514958798885345, |
| "logps/rejected": -78.18541886806489, |
| "epoch": 0.864, |
| "step": 540 |
| }, |
| { |
| "loss": 0.4494024276733398, |
| "grad_norm": 0.18910986185073853, |
| "learning_rate": 5.608e-06, |
| "entropy": 0.7143417345014313, |
| "num_tokens": 7386208.0, |
| "logits/chosen": -1.621721678971833, |
| "logits/rejected": -1.4079677960636496, |
| "mean_token_accuracy": 0.6997427928261459, |
| "rewards/chosen": -1.0504559374399833, |
| "rewards/rejected": -2.317046788427979, |
| "rewards/accuracies": 0.7875, |
| "rewards/margins": 1.2665908511728048, |
| "logps/chosen": -59.609275901317595, |
| "logps/rejected": -73.99389593601227, |
| "epoch": 0.88, |
| "step": 550 |
| }, |
| { |
| "loss": 0.3651487588882446, |
| "grad_norm": 0.14056329429149628, |
| "learning_rate": 5.528e-06, |
| "entropy": 0.814640334653086, |
| "num_tokens": 7521519.0, |
| "logits/chosen": -1.6321557376252653, |
| "logits/rejected": -1.287688344637761, |
| "mean_token_accuracy": 0.7133785426616669, |
| "rewards/chosen": -0.9613554299203543, |
| "rewards/rejected": -2.597287955011416, |
| "rewards/accuracies": 0.83125, |
| "rewards/margins": 1.6359325245954097, |
| "logps/chosen": -64.85036475658417, |
| "logps/rejected": -87.75885683298111, |
| "epoch": 0.896, |
| "step": 560 |
| }, |
| { |
| "loss": 0.47167210578918456, |
| "grad_norm": 0.15875674784183502, |
| "learning_rate": 5.448e-06, |
| "entropy": 0.8689434929285198, |
| "num_tokens": 7656864.0, |
| "logits/chosen": -1.484541877747767, |
| "logits/rejected": -1.210293212753148, |
| "mean_token_accuracy": 0.6996884623542428, |
| "rewards/chosen": -1.097544879911584, |
| "rewards/rejected": -2.3577645811019465, |
| "rewards/accuracies": 0.78125, |
| "rewards/margins": 1.260219706967473, |
| "logps/chosen": -71.07291498184205, |
| "logps/rejected": -80.84261965751648, |
| "epoch": 0.912, |
| "step": 570 |
| }, |
| { |
| "loss": 0.4431413173675537, |
| "grad_norm": 0.08832120895385742, |
| "learning_rate": 5.368000000000001e-06, |
| "entropy": 0.8448504954460077, |
| "num_tokens": 7792899.0, |
| "logits/chosen": -1.3894132053730714, |
| "logits/rejected": -1.1916056589936446, |
| "mean_token_accuracy": 0.6817449929192663, |
| "rewards/chosen": -1.1424140176386572, |
| "rewards/rejected": -2.407927218545228, |
| "rewards/accuracies": 0.8375, |
| "rewards/margins": 1.2655131912790238, |
| "logps/chosen": -75.6745502948761, |
| "logps/rejected": -80.21998720169067, |
| "epoch": 0.928, |
| "step": 580 |
| }, |
| { |
| "loss": 0.4135700225830078, |
| "grad_norm": 0.2704945206642151, |
| "learning_rate": 5.288000000000001e-06, |
| "entropy": 0.7824862065215712, |
| "num_tokens": 7926779.0, |
| "logits/chosen": -1.6528558851348272, |
| "logits/rejected": -1.292456634430272, |
| "mean_token_accuracy": 0.705788871459663, |
| "rewards/chosen": -0.8465097412496106, |
| "rewards/rejected": -2.368203252152307, |
| "rewards/accuracies": 0.825, |
| "rewards/margins": 1.5216935152653606, |
| "logps/chosen": -60.099838173389436, |
| "logps/rejected": -76.38954356908798, |
| "epoch": 0.944, |
| "step": 590 |
| }, |
| { |
| "loss": 0.44308009147644045, |
| "grad_norm": 0.24440231919288635, |
| "learning_rate": 5.208000000000001e-06, |
| "entropy": 0.6905676309019327, |
| "num_tokens": 8060079.0, |
| "logits/chosen": -1.726859618494725, |
| "logits/rejected": -1.3902765776081965, |
| "mean_token_accuracy": 0.7324171539396047, |
| "rewards/chosen": -0.8706245078108623, |
| "rewards/rejected": -2.1242041391320527, |
| "rewards/accuracies": 0.84375, |
| "rewards/margins": 1.253579631447792, |
| "logps/chosen": -54.19212522506714, |
| "logps/rejected": -68.28248654603958, |
| "epoch": 0.96, |
| "step": 600 |
| }, |
| { |
| "loss": 0.4900795936584473, |
| "grad_norm": 0.1992669254541397, |
| "learning_rate": 5.128000000000001e-06, |
| "entropy": 0.7946285988775343, |
| "num_tokens": 8194850.0, |
| "logits/chosen": -1.432810063268619, |
| "logits/rejected": -1.1435234217692902, |
| "mean_token_accuracy": 0.7105734800919891, |
| "rewards/chosen": -0.8311952710559126, |
| "rewards/rejected": -1.92433615202317, |
| "rewards/accuracies": 0.80625, |
| "rewards/margins": 1.0931408811360597, |
| "logps/chosen": -59.344405829906464, |
| "logps/rejected": -72.60044294595718, |
| "epoch": 0.976, |
| "step": 610 |
| }, |
| { |
| "loss": 0.4234670639038086, |
| "grad_norm": 0.26938584446907043, |
| "learning_rate": 5.048000000000001e-06, |
| "entropy": 0.846720263955649, |
| "num_tokens": 8329816.0, |
| "logits/chosen": -1.482459889192245, |
| "logits/rejected": -1.2096144698576996, |
| "mean_token_accuracy": 0.7066002277657389, |
| "rewards/chosen": -0.7947340043901931, |
| "rewards/rejected": -2.0874571030028166, |
| "rewards/accuracies": 0.81875, |
| "rewards/margins": 1.292723097000271, |
| "logps/chosen": -61.47416917085648, |
| "logps/rejected": -79.54253326654434, |
| "epoch": 0.992, |
| "step": 620 |
| }, |
| { |
| "loss": 0.42821288108825684, |
| "grad_norm": 0.20475246012210846, |
| "learning_rate": 4.9680000000000005e-06, |
| "entropy": 0.8765991456399206, |
| "num_tokens": 8464146.0, |
| "logits/chosen": -1.3660770117134349, |
| "logits/rejected": -1.1283678471483534, |
| "mean_token_accuracy": 0.6944115529768169, |
| "rewards/chosen": -0.758866243439843, |
| "rewards/rejected": -1.9606408149003982, |
| "rewards/accuracies": 0.8, |
| "rewards/margins": 1.2017745693214237, |
| "logps/chosen": -59.6711128950119, |
| "logps/rejected": -75.17260210514068, |
| "epoch": 1.008, |
| "step": 630 |
| }, |
| { |
| "loss": 0.4121402740478516, |
| "grad_norm": 0.19181285798549652, |
| "learning_rate": 4.8880000000000005e-06, |
| "entropy": 0.8112090851645917, |
| "num_tokens": 8598165.0, |
| "logits/chosen": -1.6396478070003788, |
| "logits/rejected": -1.201064509639671, |
| "mean_token_accuracy": 0.7071607926860451, |
| "rewards/chosen": -0.8190987646230496, |
| "rewards/rejected": -2.1065064918162535, |
| "rewards/accuracies": 0.85, |
| "rewards/margins": 1.2874077258165926, |
| "logps/chosen": -58.56870514154434, |
| "logps/rejected": -75.47631640434265, |
| "epoch": 1.024, |
| "step": 640 |
| }, |
| { |
| "loss": 0.3832432746887207, |
| "grad_norm": 0.16693222522735596, |
| "learning_rate": 4.808e-06, |
| "entropy": 0.8202884538564831, |
| "num_tokens": 8733182.0, |
| "logits/chosen": -1.4093097295310522, |
| "logits/rejected": -1.0764184005015662, |
| "mean_token_accuracy": 0.7213250549510122, |
| "rewards/chosen": -0.8947586458227306, |
| "rewards/rejected": -2.217220963910222, |
| "rewards/accuracies": 0.85, |
| "rewards/margins": 1.3224623166024685, |
| "logps/chosen": -63.64674232006073, |
| "logps/rejected": -79.54431369304658, |
| "epoch": 1.04, |
| "step": 650 |
| }, |
| { |
| "loss": 0.467090368270874, |
| "grad_norm": 0.2820304334163666, |
| "learning_rate": 4.728e-06, |
| "entropy": 0.8175160668091849, |
| "num_tokens": 8866532.0, |
| "logits/chosen": -1.4113409272988666, |
| "logits/rejected": -1.0253050648283575, |
| "mean_token_accuracy": 0.7056375283747911, |
| "rewards/chosen": -1.1019376051408472, |
| "rewards/rejected": -2.4279107422335073, |
| "rewards/accuracies": 0.83125, |
| "rewards/margins": 1.3259731331840157, |
| "logps/chosen": -62.17448818683624, |
| "logps/rejected": -77.10730903148651, |
| "epoch": 1.056, |
| "step": 660 |
| }, |
| { |
| "loss": 0.4856276512145996, |
| "grad_norm": 0.1508263647556305, |
| "learning_rate": 4.648e-06, |
| "entropy": 0.8777147593849804, |
| "num_tokens": 9002058.0, |
| "logits/chosen": -1.237333422062607, |
| "logits/rejected": -0.9867713449001874, |
| "mean_token_accuracy": 0.6980989784002304, |
| "rewards/chosen": -1.102817886834964, |
| "rewards/rejected": -2.2164312085602433, |
| "rewards/accuracies": 0.7875, |
| "rewards/margins": 1.113613315252587, |
| "logps/chosen": -72.5415987610817, |
| "logps/rejected": -79.59271297454833, |
| "epoch": 1.072, |
| "step": 670 |
| }, |
| { |
| "loss": 0.40852723121643064, |
| "grad_norm": 0.1356440633535385, |
| "learning_rate": 4.568e-06, |
| "entropy": 0.8335771631682292, |
| "num_tokens": 9136559.0, |
| "logits/chosen": -1.4357955653994279, |
| "logits/rejected": -1.0632368045892524, |
| "mean_token_accuracy": 0.7067163791507483, |
| "rewards/chosen": -0.8871819378109649, |
| "rewards/rejected": -2.2391563730299824, |
| "rewards/accuracies": 0.8, |
| "rewards/margins": 1.3519744293764233, |
| "logps/chosen": -65.51536420583724, |
| "logps/rejected": -74.92358832359314, |
| "epoch": 1.088, |
| "step": 680 |
| }, |
| { |
| "loss": 0.42632465362548827, |
| "grad_norm": 0.2446223795413971, |
| "learning_rate": 4.488e-06, |
| "entropy": 0.7106906755536329, |
| "num_tokens": 9269437.0, |
| "logits/chosen": -1.7027034766334481, |
| "logits/rejected": -1.3692697426790565, |
| "mean_token_accuracy": 0.7298609726130962, |
| "rewards/chosen": -0.9662762339459732, |
| "rewards/rejected": -2.2450467050541194, |
| "rewards/accuracies": 0.825, |
| "rewards/margins": 1.2787704736925662, |
| "logps/chosen": -57.37728985548019, |
| "logps/rejected": -68.59222289323807, |
| "epoch": 1.104, |
| "step": 690 |
| }, |
| { |
| "loss": 0.35138611793518065, |
| "grad_norm": 0.12836965918540955, |
| "learning_rate": 4.408000000000001e-06, |
| "entropy": 0.8666601853678003, |
| "num_tokens": 9404559.0, |
| "logits/chosen": -1.3400690205304637, |
| "logits/rejected": -1.0684046347991027, |
| "mean_token_accuracy": 0.6958472795784474, |
| "rewards/chosen": -0.7967793260220788, |
| "rewards/rejected": -2.3613458889187315, |
| "rewards/accuracies": 0.84375, |
| "rewards/margins": 1.5645665610209107, |
| "logps/chosen": -66.0351133108139, |
| "logps/rejected": -81.51442708969117, |
| "epoch": 1.12, |
| "step": 700 |
| }, |
| { |
| "loss": 0.4332468032836914, |
| "grad_norm": 0.20934900641441345, |
| "learning_rate": 4.328000000000001e-06, |
| "entropy": 0.854771285172319, |
| "num_tokens": 9539800.0, |
| "logits/chosen": -1.3352951022130157, |
| "logits/rejected": -0.9464862926160796, |
| "mean_token_accuracy": 0.6998173886910081, |
| "rewards/chosen": -0.8727404756122269, |
| "rewards/rejected": -2.1966246593976395, |
| "rewards/accuracies": 0.85, |
| "rewards/margins": 1.3238841853104533, |
| "logps/chosen": -61.889275419712064, |
| "logps/rejected": -78.38478618860245, |
| "epoch": 1.1360000000000001, |
| "step": 710 |
| }, |
| { |
| "loss": 0.4375255584716797, |
| "grad_norm": 0.14867250621318817, |
| "learning_rate": 4.248000000000001e-06, |
| "entropy": 0.7838106972893002, |
| "num_tokens": 9673582.0, |
| "logits/chosen": -1.6430084008837227, |
| "logits/rejected": -1.178061142015777, |
| "mean_token_accuracy": 0.7228047780692577, |
| "rewards/chosen": -0.8893449913855875, |
| "rewards/rejected": -2.1319361824076624, |
| "rewards/accuracies": 0.78125, |
| "rewards/margins": 1.2425911880563945, |
| "logps/chosen": -53.7250174164772, |
| "logps/rejected": -75.55973731279373, |
| "epoch": 1.152, |
| "step": 720 |
| }, |
| { |
| "loss": 0.4083255767822266, |
| "grad_norm": 0.15854252874851227, |
| "learning_rate": 4.168000000000001e-06, |
| "entropy": 0.8028846303815953, |
| "num_tokens": 9807723.0, |
| "logits/chosen": -1.5796788729741613, |
| "logits/rejected": -1.2279314483195203, |
| "mean_token_accuracy": 0.7037102231755853, |
| "rewards/chosen": -0.8733749952283688, |
| "rewards/rejected": -2.346686244173907, |
| "rewards/accuracies": 0.79375, |
| "rewards/margins": 1.47331124804914, |
| "logps/chosen": -57.2558536529541, |
| "logps/rejected": -78.73293989896774, |
| "epoch": 1.168, |
| "step": 730 |
| }, |
| { |
| "loss": 0.40847029685974123, |
| "grad_norm": 0.2271832525730133, |
| "learning_rate": 4.0880000000000005e-06, |
| "entropy": 0.7124190992151853, |
| "num_tokens": 9940521.0, |
| "logits/chosen": -1.7263337940860637, |
| "logits/rejected": -1.2993630722529041, |
| "mean_token_accuracy": 0.7212265940383077, |
| "rewards/chosen": -0.749589913454838, |
| "rewards/rejected": -2.0937022533995333, |
| "rewards/accuracies": 0.81875, |
| "rewards/margins": 1.3441123379394413, |
| "logps/chosen": -54.285783529281616, |
| "logps/rejected": -67.44227703809739, |
| "epoch": 1.184, |
| "step": 740 |
| }, |
| { |
| "loss": 0.4263965129852295, |
| "grad_norm": 0.16508913040161133, |
| "learning_rate": 4.008e-06, |
| "entropy": 0.8771127343410626, |
| "num_tokens": 10075349.0, |
| "logits/chosen": -1.3213851460192345, |
| "logits/rejected": -1.057589043568979, |
| "mean_token_accuracy": 0.6872733032330871, |
| "rewards/chosen": -0.9163320093342918, |
| "rewards/rejected": -2.138802810528432, |
| "rewards/accuracies": 0.80625, |
| "rewards/margins": 1.2224708050955087, |
| "logps/chosen": -65.35894116163254, |
| "logps/rejected": -74.31111829280853, |
| "epoch": 1.2, |
| "step": 750 |
| }, |
| { |
| "loss": 0.3466779708862305, |
| "grad_norm": 0.14594385027885437, |
| "learning_rate": 3.928e-06, |
| "entropy": 0.8973389053368009, |
| "num_tokens": 10210309.0, |
| "logits/chosen": -1.429195333570735, |
| "logits/rejected": -1.0293746532892192, |
| "mean_token_accuracy": 0.6843982387334109, |
| "rewards/chosen": -0.790108532004524, |
| "rewards/rejected": -2.4523484482313505, |
| "rewards/accuracies": 0.88125, |
| "rewards/margins": 1.6622399202547968, |
| "logps/chosen": -64.03692282438278, |
| "logps/rejected": -83.50145937204361, |
| "epoch": 1.216, |
| "step": 760 |
| }, |
| { |
| "loss": 0.3902191400527954, |
| "grad_norm": 0.21555303037166595, |
| "learning_rate": 3.848e-06, |
| "entropy": 0.8176256978302263, |
| "num_tokens": 10344571.0, |
| "logits/chosen": -1.571296518421704, |
| "logits/rejected": -1.1463247268095662, |
| "mean_token_accuracy": 0.7237087743356824, |
| "rewards/chosen": -0.9857207721681334, |
| "rewards/rejected": -2.467484907130711, |
| "rewards/accuracies": 0.85, |
| "rewards/margins": 1.4817641287110745, |
| "logps/chosen": -55.41268019676208, |
| "logps/rejected": -83.52744359970093, |
| "epoch": 1.232, |
| "step": 770 |
| }, |
| { |
| "loss": 0.4406851291656494, |
| "grad_norm": 0.21594573557376862, |
| "learning_rate": 3.7680000000000006e-06, |
| "entropy": 0.7303940998070175, |
| "num_tokens": 10478286.0, |
| "logits/chosen": -1.8663801540109504, |
| "logits/rejected": -1.4280047600468566, |
| "mean_token_accuracy": 0.7173186991363764, |
| "rewards/chosen": -1.1608861902008356, |
| "rewards/rejected": -2.671035580892203, |
| "rewards/accuracies": 0.79375, |
| "rewards/margins": 1.51014938436565, |
| "logps/chosen": -60.46502422094345, |
| "logps/rejected": -77.58741216659546, |
| "epoch": 1.248, |
| "step": 780 |
| }, |
| { |
| "loss": 0.4125234127044678, |
| "grad_norm": 0.2962269186973572, |
| "learning_rate": 3.6880000000000005e-06, |
| "entropy": 0.8331925821723416, |
| "num_tokens": 10612286.0, |
| "logits/chosen": -1.5659800443469807, |
| "logits/rejected": -1.2150587345047403, |
| "mean_token_accuracy": 0.7073991242796183, |
| "rewards/chosen": -1.1026862843311391, |
| "rewards/rejected": -2.5605769436224364, |
| "rewards/accuracies": 0.78125, |
| "rewards/margins": 1.4578906406648457, |
| "logps/chosen": -62.54402623176575, |
| "logps/rejected": -79.81341508626937, |
| "epoch": 1.264, |
| "step": 790 |
| }, |
| { |
| "loss": 0.49402365684509275, |
| "grad_norm": 0.155300110578537, |
| "learning_rate": 3.6080000000000004e-06, |
| "entropy": 0.7988151058845687, |
| "num_tokens": 10747462.0, |
| "logits/chosen": -1.605360317746176, |
| "logits/rejected": -1.2881572925592417, |
| "mean_token_accuracy": 0.7002569252625108, |
| "rewards/chosen": -1.0135203968995483, |
| "rewards/rejected": -2.2969876725808716, |
| "rewards/accuracies": 0.79375, |
| "rewards/margins": 1.2834672711789608, |
| "logps/chosen": -67.37470293045044, |
| "logps/rejected": -79.85493696928025, |
| "epoch": 1.28, |
| "step": 800 |
| }, |
| { |
| "loss": 0.4200831413269043, |
| "grad_norm": 0.14519786834716797, |
| "learning_rate": 3.5280000000000004e-06, |
| "entropy": 0.8120490956622234, |
| "num_tokens": 10882594.0, |
| "logits/chosen": -1.5574423493502165, |
| "logits/rejected": -1.3764162162150948, |
| "mean_token_accuracy": 0.702505898848176, |
| "rewards/chosen": -0.979388279729028, |
| "rewards/rejected": -2.461002457328141, |
| "rewards/accuracies": 0.8, |
| "rewards/margins": 1.4816141836112364, |
| "logps/chosen": -66.68434045314788, |
| "logps/rejected": -83.09649764299392, |
| "epoch": 1.296, |
| "step": 810 |
| }, |
| { |
| "loss": 0.4704907894134521, |
| "grad_norm": 0.22803907096385956, |
| "learning_rate": 3.4480000000000003e-06, |
| "entropy": 0.8039654018590227, |
| "num_tokens": 11016931.0, |
| "logits/chosen": -1.5012306281869234, |
| "logits/rejected": -1.2876392053232184, |
| "mean_token_accuracy": 0.7034664511680603, |
| "rewards/chosen": -1.1309354332945076, |
| "rewards/rejected": -2.3758349375304535, |
| "rewards/accuracies": 0.76875, |
| "rewards/margins": 1.2448995084967465, |
| "logps/chosen": -67.47772282361984, |
| "logps/rejected": -78.3834860920906, |
| "epoch": 1.312, |
| "step": 820 |
| }, |
| { |
| "loss": 0.46920132637023926, |
| "grad_norm": 0.2387949824333191, |
| "learning_rate": 3.368e-06, |
| "entropy": 0.732459101951099, |
| "num_tokens": 11150609.0, |
| "logits/chosen": -1.7111103661903264, |
| "logits/rejected": -1.3267267526306643, |
| "mean_token_accuracy": 0.7098248641937971, |
| "rewards/chosen": -0.9866411694383714, |
| "rewards/rejected": -2.3024006365798413, |
| "rewards/accuracies": 0.8, |
| "rewards/margins": 1.3157594701158815, |
| "logps/chosen": -60.04266767501831, |
| "logps/rejected": -73.96700737476348, |
| "epoch": 1.328, |
| "step": 830 |
| }, |
| { |
| "loss": 0.3219926357269287, |
| "grad_norm": 0.13847558200359344, |
| "learning_rate": 3.288e-06, |
| "entropy": 0.7705854054656811, |
| "num_tokens": 11284845.0, |
| "logits/chosen": -1.7253091998162051, |
| "logits/rejected": -1.305342065365432, |
| "mean_token_accuracy": 0.7240345129743219, |
| "rewards/chosen": -0.9102539952356892, |
| "rewards/rejected": -2.657541433814913, |
| "rewards/accuracies": 0.875, |
| "rewards/margins": 1.7472874362953008, |
| "logps/chosen": -56.32816154956818, |
| "logps/rejected": -82.49419674873351, |
| "epoch": 1.3439999999999999, |
| "step": 840 |
| }, |
| { |
| "loss": 0.39888598918914797, |
| "grad_norm": 0.22760330140590668, |
| "learning_rate": 3.208e-06, |
| "entropy": 0.6883504351309966, |
| "num_tokens": 11418114.0, |
| "logits/chosen": -1.8767877806339819, |
| "logits/rejected": -1.502016394931313, |
| "mean_token_accuracy": 0.7253359684720635, |
| "rewards/chosen": -0.836689239833504, |
| "rewards/rejected": -2.3422608138527723, |
| "rewards/accuracies": 0.80625, |
| "rewards/margins": 1.5055715713184328, |
| "logps/chosen": -53.072984755039215, |
| "logps/rejected": -72.80904539823533, |
| "epoch": 1.3599999999999999, |
| "step": 850 |
| }, |
| { |
| "loss": 0.40503392219543455, |
| "grad_norm": 0.18328320980072021, |
| "learning_rate": 3.1280000000000004e-06, |
| "entropy": 0.7598929285246413, |
| "num_tokens": 11552146.0, |
| "logits/chosen": -1.644595842548687, |
| "logits/rejected": -1.378459610872036, |
| "mean_token_accuracy": 0.7259372064843774, |
| "rewards/chosen": -0.9007043580990285, |
| "rewards/rejected": -2.372628803132102, |
| "rewards/accuracies": 0.8, |
| "rewards/margins": 1.4719244507141411, |
| "logps/chosen": -55.648898458480836, |
| "logps/rejected": -78.23955315351486, |
| "epoch": 1.376, |
| "step": 860 |
| }, |
| { |
| "loss": 0.3458548545837402, |
| "grad_norm": 0.25410881638526917, |
| "learning_rate": 3.0480000000000003e-06, |
| "entropy": 0.7665736552706222, |
| "num_tokens": 11686051.0, |
| "logits/chosen": -1.578677616557072, |
| "logits/rejected": -1.3612439345571947, |
| "mean_token_accuracy": 0.713687221519649, |
| "rewards/chosen": -0.9132042807443213, |
| "rewards/rejected": -2.5326640743296593, |
| "rewards/accuracies": 0.875, |
| "rewards/margins": 1.6194597949273883, |
| "logps/chosen": -62.23388094902039, |
| "logps/rejected": -74.41176266670227, |
| "epoch": 1.392, |
| "step": 870 |
| }, |
| { |
| "loss": 0.45064554214477537, |
| "grad_norm": 0.31622838973999023, |
| "learning_rate": 2.9680000000000002e-06, |
| "entropy": 0.8155602383427322, |
| "num_tokens": 11820419.0, |
| "logits/chosen": -1.5256738113106172, |
| "logits/rejected": -1.2444007046615775, |
| "mean_token_accuracy": 0.7064365288242698, |
| "rewards/chosen": -0.8790285978000612, |
| "rewards/rejected": -2.279954434429237, |
| "rewards/accuracies": 0.81875, |
| "rewards/margins": 1.400925842532888, |
| "logps/chosen": -61.98214646577835, |
| "logps/rejected": -77.71078071594238, |
| "epoch": 1.408, |
| "step": 880 |
| }, |
| { |
| "loss": 0.3549015045166016, |
| "grad_norm": 0.11679533123970032, |
| "learning_rate": 2.888e-06, |
| "entropy": 0.8460370196611621, |
| "num_tokens": 11954898.0, |
| "logits/chosen": -1.501683007594535, |
| "logits/rejected": -1.153882464001247, |
| "mean_token_accuracy": 0.7017565036192537, |
| "rewards/chosen": -0.9793404275318608, |
| "rewards/rejected": -2.5882866755331633, |
| "rewards/accuracies": 0.89375, |
| "rewards/margins": 1.6089462437666953, |
| "logps/chosen": -62.671991884708405, |
| "logps/rejected": -85.92449575662613, |
| "epoch": 1.424, |
| "step": 890 |
| }, |
| { |
| "loss": 0.32079691886901857, |
| "grad_norm": 0.17164677381515503, |
| "learning_rate": 2.808e-06, |
| "entropy": 0.7836568029015325, |
| "num_tokens": 12089403.0, |
| "logits/chosen": -1.5902203304330556, |
| "logits/rejected": -1.348343018569439, |
| "mean_token_accuracy": 0.7099103134125471, |
| "rewards/chosen": -0.906367156367196, |
| "rewards/rejected": -2.5413650372705887, |
| "rewards/accuracies": 0.88125, |
| "rewards/margins": 1.634997878689319, |
| "logps/chosen": -65.62818305492401, |
| "logps/rejected": -79.59799456596375, |
| "epoch": 1.44, |
| "step": 900 |
| }, |
| { |
| "loss": 0.3879056215286255, |
| "grad_norm": 0.15152597427368164, |
| "learning_rate": 2.728e-06, |
| "entropy": 0.7635506895370782, |
| "num_tokens": 12223715.0, |
| "logits/chosen": -1.808664480653039, |
| "logits/rejected": -1.4436211706139415, |
| "mean_token_accuracy": 0.716391022503376, |
| "rewards/chosen": -1.0626204300948303, |
| "rewards/rejected": -2.617245429044124, |
| "rewards/accuracies": 0.8125, |
| "rewards/margins": 1.5546250022249297, |
| "logps/chosen": -59.04966660737991, |
| "logps/rejected": -79.71140024662017, |
| "epoch": 1.456, |
| "step": 910 |
| }, |
| { |
| "loss": 0.5003737926483154, |
| "grad_norm": 0.23257283866405487, |
| "learning_rate": 2.648e-06, |
| "entropy": 0.7805526316573378, |
| "num_tokens": 12357865.0, |
| "logits/chosen": -1.7092802822631128, |
| "logits/rejected": -1.3571210243590142, |
| "mean_token_accuracy": 0.7101537603884935, |
| "rewards/chosen": -1.1259239912003978, |
| "rewards/rejected": -2.455858718138188, |
| "rewards/accuracies": 0.7875, |
| "rewards/margins": 1.3299347181804477, |
| "logps/chosen": -62.12466698884964, |
| "logps/rejected": -79.51555901765823, |
| "epoch": 1.472, |
| "step": 920 |
| }, |
| { |
| "loss": 0.4326589107513428, |
| "grad_norm": 0.22872693836688995, |
| "learning_rate": 2.568e-06, |
| "entropy": 0.7554121573979501, |
| "num_tokens": 12492128.0, |
| "logits/chosen": -1.6719579694003723, |
| "logits/rejected": -1.3663122032286132, |
| "mean_token_accuracy": 0.6942645735107362, |
| "rewards/chosen": -1.0867409846643568, |
| "rewards/rejected": -2.5454429023200644, |
| "rewards/accuracies": 0.79375, |
| "rewards/margins": 1.4587019056081771, |
| "logps/chosen": -63.67592179775238, |
| "logps/rejected": -80.17804374694825, |
| "epoch": 1.488, |
| "step": 930 |
| }, |
| { |
| "loss": 0.4602513790130615, |
| "grad_norm": 0.23694008588790894, |
| "learning_rate": 2.488e-06, |
| "entropy": 0.7785145582747646, |
| "num_tokens": 12626077.0, |
| "logits/chosen": -1.5935042309292489, |
| "logits/rejected": -1.3624577984140387, |
| "mean_token_accuracy": 0.6916681522503495, |
| "rewards/chosen": -1.1778735827072524, |
| "rewards/rejected": -2.502696030540392, |
| "rewards/accuracies": 0.8125, |
| "rewards/margins": 1.3248224433511495, |
| "logps/chosen": -63.580693411827085, |
| "logps/rejected": -74.72070835828781, |
| "epoch": 1.504, |
| "step": 940 |
| }, |
| { |
| "loss": 0.4067554473876953, |
| "grad_norm": 0.14756956696510315, |
| "learning_rate": 2.408e-06, |
| "entropy": 0.8026386831275886, |
| "num_tokens": 12760098.0, |
| "logits/chosen": -1.5458875154452285, |
| "logits/rejected": -1.2564218268845326, |
| "mean_token_accuracy": 0.7152364812791348, |
| "rewards/chosen": -1.2055871986289275, |
| "rewards/rejected": -2.6404173804068707, |
| "rewards/accuracies": 0.85, |
| "rewards/margins": 1.4348301694728434, |
| "logps/chosen": -66.13761007785797, |
| "logps/rejected": -80.10225908756256, |
| "epoch": 1.52, |
| "step": 950 |
| }, |
| { |
| "loss": 0.42372560501098633, |
| "grad_norm": 0.14788998663425446, |
| "learning_rate": 2.3280000000000004e-06, |
| "entropy": 0.8012942865549121, |
| "num_tokens": 12894652.0, |
| "logits/chosen": -1.635073784869764, |
| "logits/rejected": -1.3146647893445076, |
| "mean_token_accuracy": 0.7114136775955557, |
| "rewards/chosen": -1.1332746736516128, |
| "rewards/rejected": -2.6066967224120163, |
| "rewards/accuracies": 0.775, |
| "rewards/margins": 1.4734220502898097, |
| "logps/chosen": -63.05048147439957, |
| "logps/rejected": -82.07224049568177, |
| "epoch": 1.536, |
| "step": 960 |
| }, |
| { |
| "loss": 0.412662935256958, |
| "grad_norm": 0.14732256531715393, |
| "learning_rate": 2.2480000000000003e-06, |
| "entropy": 0.8334445571847027, |
| "num_tokens": 13030162.0, |
| "logits/chosen": -1.6011668878902328, |
| "logits/rejected": -1.2587357097834815, |
| "mean_token_accuracy": 0.702854485437274, |
| "rewards/chosen": -1.0372710642812308, |
| "rewards/rejected": -2.6535557047463953, |
| "rewards/accuracies": 0.8375, |
| "rewards/margins": 1.6162846368737518, |
| "logps/chosen": -65.74512588381768, |
| "logps/rejected": -88.88693373203277, |
| "epoch": 1.552, |
| "step": 970 |
| }, |
| { |
| "loss": 0.3407352209091187, |
| "grad_norm": 0.2886792719364166, |
| "learning_rate": 2.1680000000000002e-06, |
| "entropy": 0.8762669585994445, |
| "num_tokens": 13165409.0, |
| "logits/chosen": -1.383209431558544, |
| "logits/rejected": -1.0744050889575703, |
| "mean_token_accuracy": 0.6733901240862906, |
| "rewards/chosen": -1.008211946907977, |
| "rewards/rejected": -2.624329062405741, |
| "rewards/accuracies": 0.86875, |
| "rewards/margins": 1.6161171085201205, |
| "logps/chosen": -69.2023845911026, |
| "logps/rejected": -83.00953713655471, |
| "epoch": 1.568, |
| "step": 980 |
| }, |
| { |
| "loss": 0.4386160850524902, |
| "grad_norm": 0.2656986713409424, |
| "learning_rate": 2.088e-06, |
| "entropy": 0.8209956398721261, |
| "num_tokens": 13299607.0, |
| "logits/chosen": -1.4395911330145508, |
| "logits/rejected": -1.2677628081064927, |
| "mean_token_accuracy": 0.6904863499104976, |
| "rewards/chosen": -1.0870793154346756, |
| "rewards/rejected": -2.4575889983447268, |
| "rewards/accuracies": 0.78125, |
| "rewards/margins": 1.3705096821766347, |
| "logps/chosen": -65.42525545358657, |
| "logps/rejected": -74.03723225593566, |
| "epoch": 1.584, |
| "step": 990 |
| }, |
| { |
| "loss": 0.35819923877716064, |
| "grad_norm": 0.35382354259490967, |
| "learning_rate": 2.008e-06, |
| "entropy": 0.7399830836133333, |
| "num_tokens": 13434502.0, |
| "logits/chosen": -1.6976982361606354, |
| "logits/rejected": -1.3072192337860213, |
| "mean_token_accuracy": 0.7421066265553236, |
| "rewards/chosen": -1.0984582830686123, |
| "rewards/rejected": -2.7966011623386295, |
| "rewards/accuracies": 0.875, |
| "rewards/margins": 1.6981428703293204, |
| "logps/chosen": -62.93297493457794, |
| "logps/rejected": -82.4026222705841, |
| "epoch": 1.6, |
| "step": 1000 |
| }, |
| { |
| "loss": 0.4160293102264404, |
| "grad_norm": 0.11767679452896118, |
| "learning_rate": 1.928e-06, |
| "entropy": 0.7990678637885139, |
| "num_tokens": 13568600.0, |
| "logits/chosen": -1.5975146089430179, |
| "logits/rejected": -1.2924786059115378, |
| "mean_token_accuracy": 0.7110372580587864, |
| "rewards/chosen": -0.9529279105423484, |
| "rewards/rejected": -2.457513489993289, |
| "rewards/accuracies": 0.83125, |
| "rewards/margins": 1.504585579968989, |
| "logps/chosen": -63.974093568325046, |
| "logps/rejected": -74.71904839277268, |
| "epoch": 1.616, |
| "step": 1010 |
| }, |
| { |
| "loss": 0.3250428199768066, |
| "grad_norm": 0.12981919944286346, |
| "learning_rate": 1.8480000000000001e-06, |
| "entropy": 0.7811902783811092, |
| "num_tokens": 13702787.0, |
| "logits/chosen": -1.587494817410056, |
| "logits/rejected": -1.1941186838362041, |
| "mean_token_accuracy": 0.7234507920220494, |
| "rewards/chosen": -0.8217556012241403, |
| "rewards/rejected": -2.597050206689164, |
| "rewards/accuracies": 0.86875, |
| "rewards/margins": 1.7752946069464088, |
| "logps/chosen": -61.340254080295566, |
| "logps/rejected": -79.60141725540161, |
| "epoch": 1.6320000000000001, |
| "step": 1020 |
| }, |
| { |
| "loss": 0.4002103805541992, |
| "grad_norm": 0.2534341812133789, |
| "learning_rate": 1.7680000000000003e-06, |
| "entropy": 0.8721957165267668, |
| "num_tokens": 13837799.0, |
| "logits/chosen": -1.4787466162956828, |
| "logits/rejected": -1.1347675946257396, |
| "mean_token_accuracy": 0.7160949306562543, |
| "rewards/chosen": -0.9889563272474333, |
| "rewards/rejected": -2.5054163753055034, |
| "rewards/accuracies": 0.81875, |
| "rewards/margins": 1.5164600439369678, |
| "logps/chosen": -69.03193366527557, |
| "logps/rejected": -80.24655103683472, |
| "epoch": 1.6480000000000001, |
| "step": 1030 |
| }, |
| { |
| "loss": 0.4034124374389648, |
| "grad_norm": 0.23815952241420746, |
| "learning_rate": 1.6880000000000002e-06, |
| "entropy": 0.7898992500049644, |
| "num_tokens": 13972529.0, |
| "logits/chosen": -1.6163878058701155, |
| "logits/rejected": -1.2316415786069164, |
| "mean_token_accuracy": 0.7335911913774907, |
| "rewards/chosen": -0.9068507085920828, |
| "rewards/rejected": -2.4930222455412148, |
| "rewards/accuracies": 0.84375, |
| "rewards/margins": 1.5861715397797524, |
| "logps/chosen": -62.6472428560257, |
| "logps/rejected": -78.13663581609725, |
| "epoch": 1.6640000000000001, |
| "step": 1040 |
| }, |
| { |
| "loss": 0.4241136074066162, |
| "grad_norm": 0.1419256180524826, |
| "learning_rate": 1.608e-06, |
| "entropy": 0.9256169050706375, |
| "num_tokens": 14107336.0, |
| "logits/chosen": -1.2789081893064282, |
| "logits/rejected": -1.098782251423331, |
| "mean_token_accuracy": 0.696486575063318, |
| "rewards/chosen": -0.8607778700679773, |
| "rewards/rejected": -2.315709656581748, |
| "rewards/accuracies": 0.8125, |
| "rewards/margins": 1.454931782837957, |
| "logps/chosen": -74.47855192422867, |
| "logps/rejected": -76.75005420446396, |
| "epoch": 1.6800000000000002, |
| "step": 1050 |
| }, |
| { |
| "loss": 0.48003559112548827, |
| "grad_norm": 0.14790725708007812, |
| "learning_rate": 1.528e-06, |
| "entropy": 0.7936980344704352, |
| "num_tokens": 14241540.0, |
| "logits/chosen": -1.5867842467297604, |
| "logits/rejected": -1.1837827649291766, |
| "mean_token_accuracy": 0.7259030997753143, |
| "rewards/chosen": -0.8804566722927121, |
| "rewards/rejected": -2.2063653921242805, |
| "rewards/accuracies": 0.79375, |
| "rewards/margins": 1.3259087240789085, |
| "logps/chosen": -58.475341248512265, |
| "logps/rejected": -74.59980441331864, |
| "epoch": 1.696, |
| "step": 1060 |
| }, |
| { |
| "loss": 0.3922820329666138, |
| "grad_norm": 0.1496279537677765, |
| "learning_rate": 1.4480000000000002e-06, |
| "entropy": 0.8726246880483813, |
| "num_tokens": 14376121.0, |
| "logits/chosen": -1.4914376459842063, |
| "logits/rejected": -1.1848033257275015, |
| "mean_token_accuracy": 0.7143584050238132, |
| "rewards/chosen": -0.9215551663655788, |
| "rewards/rejected": -2.562272682785988, |
| "rewards/accuracies": 0.84375, |
| "rewards/margins": 1.6407175094820559, |
| "logps/chosen": -67.5427442073822, |
| "logps/rejected": -79.30532623529434, |
| "epoch": 1.712, |
| "step": 1070 |
| }, |
| { |
| "loss": 0.44224209785461427, |
| "grad_norm": 0.2878839075565338, |
| "learning_rate": 1.368e-06, |
| "entropy": 0.7888671966618859, |
| "num_tokens": 14510553.0, |
| "logits/chosen": -1.6546901899116329, |
| "logits/rejected": -1.3682432627615229, |
| "mean_token_accuracy": 0.6996359150856734, |
| "rewards/chosen": -0.8950480898056412, |
| "rewards/rejected": -2.3655205052462405, |
| "rewards/accuracies": 0.80625, |
| "rewards/margins": 1.4704724150244146, |
| "logps/chosen": -63.91799589395523, |
| "logps/rejected": -74.64101424217225, |
| "epoch": 1.728, |
| "step": 1080 |
| }, |
| { |
| "loss": 0.3927299499511719, |
| "grad_norm": 0.1370965987443924, |
| "learning_rate": 1.288e-06, |
| "entropy": 0.8091648026223993, |
| "num_tokens": 14644507.0, |
| "logits/chosen": -1.687283619747059, |
| "logits/rejected": -1.3548523346162953, |
| "mean_token_accuracy": 0.7228656150400639, |
| "rewards/chosen": -0.7743405980079843, |
| "rewards/rejected": -2.3230774260126053, |
| "rewards/accuracies": 0.7875, |
| "rewards/margins": 1.5487368311733007, |
| "logps/chosen": -56.80163584947586, |
| "logps/rejected": -80.1871037721634, |
| "epoch": 1.744, |
| "step": 1090 |
| }, |
| { |
| "loss": 0.36075007915496826, |
| "grad_norm": 0.12493802607059479, |
| "learning_rate": 1.2080000000000001e-06, |
| "entropy": 0.8516323209594703, |
| "num_tokens": 14779558.0, |
| "logits/chosen": -1.5479666328178479, |
| "logits/rejected": -1.1764522167627494, |
| "mean_token_accuracy": 0.7081021483056247, |
| "rewards/chosen": -0.8559462582834385, |
| "rewards/rejected": -2.430596137570683, |
| "rewards/accuracies": 0.84375, |
| "rewards/margins": 1.5746498768217863, |
| "logps/chosen": -63.79940243959427, |
| "logps/rejected": -79.56198363304138, |
| "epoch": 1.76, |
| "step": 1100 |
| }, |
| { |
| "loss": 0.49372134208679197, |
| "grad_norm": 0.24344250559806824, |
| "learning_rate": 1.128e-06, |
| "entropy": 0.8455155969480984, |
| "num_tokens": 14914286.0, |
| "logits/chosen": -1.498396463441885, |
| "logits/rejected": -1.1425197974463714, |
| "mean_token_accuracy": 0.7100071370601654, |
| "rewards/chosen": -0.8169066427948565, |
| "rewards/rejected": -2.166107503604144, |
| "rewards/accuracies": 0.76875, |
| "rewards/margins": 1.3492008646018803, |
| "logps/chosen": -61.403113543987274, |
| "logps/rejected": -75.34919095039368, |
| "epoch": 1.776, |
| "step": 1110 |
| }, |
| { |
| "loss": 0.4005413055419922, |
| "grad_norm": 0.20426344871520996, |
| "learning_rate": 1.0480000000000002e-06, |
| "entropy": 0.8211736791708972, |
| "num_tokens": 15048840.0, |
| "logits/chosen": -1.582013316231499, |
| "logits/rejected": -1.3164341995727113, |
| "mean_token_accuracy": 0.7223803894594312, |
| "rewards/chosen": -0.6959973029966932, |
| "rewards/rejected": -2.1918047105107687, |
| "rewards/accuracies": 0.84375, |
| "rewards/margins": 1.4958074030466377, |
| "logps/chosen": -59.653766822814944, |
| "logps/rejected": -75.93207306861878, |
| "epoch": 1.792, |
| "step": 1120 |
| }, |
| { |
| "loss": 0.5007998466491699, |
| "grad_norm": 0.1154891774058342, |
| "learning_rate": 9.68e-07, |
| "entropy": 0.8647114810533821, |
| "num_tokens": 15184276.0, |
| "logits/chosen": -1.356775653423806, |
| "logits/rejected": -1.1500322818720279, |
| "mean_token_accuracy": 0.7039438035339117, |
| "rewards/chosen": -0.8606041681859097, |
| "rewards/rejected": -2.0742746030678973, |
| "rewards/accuracies": 0.7375, |
| "rewards/margins": 1.2136704298667609, |
| "logps/chosen": -64.9673285484314, |
| "logps/rejected": -80.83175637722016, |
| "epoch": 1.808, |
| "step": 1130 |
| }, |
| { |
| "loss": 0.4986130714416504, |
| "grad_norm": 0.6216063499450684, |
| "learning_rate": 8.880000000000001e-07, |
| "entropy": 0.774267910355411, |
| "num_tokens": 15317721.0, |
| "logits/chosen": -1.4605975439966772, |
| "logits/rejected": -1.3212052490062418, |
| "mean_token_accuracy": 0.7165707518346608, |
| "rewards/chosen": -0.8740379733324517, |
| "rewards/rejected": -1.9363951487233861, |
| "rewards/accuracies": 0.76875, |
| "rewards/margins": 1.0623571707867085, |
| "logps/chosen": -58.174967527389526, |
| "logps/rejected": -67.10608189105987, |
| "epoch": 1.8239999999999998, |
| "step": 1140 |
| }, |
| { |
| "loss": 0.39597718715667723, |
| "grad_norm": 0.1611914187669754, |
| "learning_rate": 8.08e-07, |
| "entropy": 0.8271302699897205, |
| "num_tokens": 15452553.0, |
| "logits/chosen": -1.50679093223041, |
| "logits/rejected": -1.147970850967657, |
| "mean_token_accuracy": 0.7078391901217401, |
| "rewards/chosen": -0.8506218325230293, |
| "rewards/rejected": -2.2930383594852173, |
| "rewards/accuracies": 0.8375, |
| "rewards/margins": 1.4424165301956235, |
| "logps/chosen": -60.48249053955078, |
| "logps/rejected": -79.1380724787712, |
| "epoch": 1.8399999999999999, |
| "step": 1150 |
| }, |
| { |
| "loss": 0.3954659700393677, |
| "grad_norm": 0.19070428609848022, |
| "learning_rate": 7.280000000000001e-07, |
| "entropy": 0.7992117294867057, |
| "num_tokens": 15586655.0, |
| "logits/chosen": -1.6674989181953035, |
| "logits/rejected": -1.2958623246252912, |
| "mean_token_accuracy": 0.7274953337386251, |
| "rewards/chosen": -0.897261195579631, |
| "rewards/rejected": -2.37544046624098, |
| "rewards/accuracies": 0.8, |
| "rewards/margins": 1.4781792684458197, |
| "logps/chosen": -55.330790144205096, |
| "logps/rejected": -79.54153176546097, |
| "epoch": 1.8559999999999999, |
| "step": 1160 |
| }, |
| { |
| "loss": 0.5150039196014404, |
| "grad_norm": 0.2727234959602356, |
| "learning_rate": 6.48e-07, |
| "entropy": 0.7774595006601885, |
| "num_tokens": 15720172.0, |
| "logits/chosen": -1.673701828468026, |
| "logits/rejected": -1.2861514487494707, |
| "mean_token_accuracy": 0.7126229584217072, |
| "rewards/chosen": -0.9092265904924716, |
| "rewards/rejected": -2.033220373163931, |
| "rewards/accuracies": 0.71875, |
| "rewards/margins": 1.1239937825594097, |
| "logps/chosen": -54.55541696548462, |
| "logps/rejected": -76.10742880105973, |
| "epoch": 1.8719999999999999, |
| "step": 1170 |
| }, |
| { |
| "loss": 0.4881202220916748, |
| "grad_norm": 0.21918685734272003, |
| "learning_rate": 5.680000000000001e-07, |
| "entropy": 0.7866302890935912, |
| "num_tokens": 15853755.0, |
| "logits/chosen": -1.4762931082547661, |
| "logits/rejected": -1.2942548537923684, |
| "mean_token_accuracy": 0.7225816631689668, |
| "rewards/chosen": -0.9264017570319993, |
| "rewards/rejected": -1.9995961244334466, |
| "rewards/accuracies": 0.7875, |
| "rewards/margins": 1.0731943636201322, |
| "logps/chosen": -60.705457758903506, |
| "logps/rejected": -66.6190501689911, |
| "epoch": 1.888, |
| "step": 1180 |
| }, |
| { |
| "loss": 0.45177521705627444, |
| "grad_norm": 0.23347221314907074, |
| "learning_rate": 4.88e-07, |
| "entropy": 0.8309914332116023, |
| "num_tokens": 15988701.0, |
| "logits/chosen": -1.4661994627051458, |
| "logits/rejected": -1.2287666153016743, |
| "mean_token_accuracy": 0.7092148935422301, |
| "rewards/chosen": -0.8807039022503886, |
| "rewards/rejected": -2.185251401356072, |
| "rewards/accuracies": 0.80625, |
| "rewards/margins": 1.304547501122579, |
| "logps/chosen": -62.431247127056125, |
| "logps/rejected": -74.59568692445755, |
| "epoch": 1.904, |
| "step": 1190 |
| }, |
| { |
| "loss": 0.44033398628234866, |
| "grad_norm": 0.13558809459209442, |
| "learning_rate": 4.0800000000000005e-07, |
| "entropy": 0.8481319433776662, |
| "num_tokens": 16123227.0, |
| "logits/chosen": -1.4890639792428868, |
| "logits/rejected": -1.1712801983612529, |
| "mean_token_accuracy": 0.7045220224186778, |
| "rewards/chosen": -0.8116515700123272, |
| "rewards/rejected": -2.0684703564504163, |
| "rewards/accuracies": 0.83125, |
| "rewards/margins": 1.2568187874741852, |
| "logps/chosen": -63.18868860006332, |
| "logps/rejected": -74.17321823835373, |
| "epoch": 1.92, |
| "step": 1200 |
| }, |
| { |
| "loss": 0.4489591598510742, |
| "grad_norm": 0.2724771499633789, |
| "learning_rate": 3.280000000000001e-07, |
| "entropy": 0.8390395241905935, |
| "num_tokens": 16257799.0, |
| "logits/chosen": -1.3757150913324974, |
| "logits/rejected": -1.180797201944608, |
| "mean_token_accuracy": 0.6906995047815144, |
| "rewards/chosen": -0.8883007764234208, |
| "rewards/rejected": -2.3104404117213564, |
| "rewards/accuracies": 0.8125, |
| "rewards/margins": 1.422139625577256, |
| "logps/chosen": -64.57728606462479, |
| "logps/rejected": -76.76991089582444, |
| "epoch": 1.936, |
| "step": 1210 |
| }, |
| { |
| "loss": 0.3736592769622803, |
| "grad_norm": 0.23324978351593018, |
| "learning_rate": 2.48e-07, |
| "entropy": 0.7958670913358219, |
| "num_tokens": 16392755.0, |
| "logits/chosen": -1.5214667053964295, |
| "logits/rejected": -1.1308945168158175, |
| "mean_token_accuracy": 0.7339793419465422, |
| "rewards/chosen": -0.8573693673475645, |
| "rewards/rejected": -2.422400009748526, |
| "rewards/accuracies": 0.84375, |
| "rewards/margins": 1.565030633006245, |
| "logps/chosen": -62.808938360214235, |
| "logps/rejected": -81.37407802343368, |
| "epoch": 1.952, |
| "step": 1220 |
| }, |
| { |
| "loss": 0.33856496810913084, |
| "grad_norm": 0.2365734577178955, |
| "learning_rate": 1.68e-07, |
| "entropy": 0.7709657683037221, |
| "num_tokens": 16526347.0, |
| "logits/chosen": -1.5951650245485083, |
| "logits/rejected": -1.2316822978483537, |
| "mean_token_accuracy": 0.7203758641146123, |
| "rewards/chosen": -0.7306884591787821, |
| "rewards/rejected": -2.310912328850827, |
| "rewards/accuracies": 0.8625, |
| "rewards/margins": 1.5802238748408854, |
| "logps/chosen": -53.69367561340332, |
| "logps/rejected": -75.45296376943588, |
| "epoch": 1.968, |
| "step": 1230 |
| }, |
| { |
| "loss": 0.47231736183166506, |
| "grad_norm": 0.1407570242881775, |
| "learning_rate": 8.800000000000001e-08, |
| "entropy": 0.9006856581720057, |
| "num_tokens": 16660816.0, |
| "logits/chosen": -1.4061471100194554, |
| "logits/rejected": -1.0629769642593176, |
| "mean_token_accuracy": 0.697626062296331, |
| "rewards/chosen": -0.7163842913665576, |
| "rewards/rejected": -1.9068784552206126, |
| "rewards/accuracies": 0.8, |
| "rewards/margins": 1.1904941664426587, |
| "logps/chosen": -60.04284707307816, |
| "logps/rejected": -76.30784704685212, |
| "epoch": 1.984, |
| "step": 1240 |
| }, |
| { |
| "loss": 0.4329345226287842, |
| "grad_norm": 0.20022091269493103, |
| "learning_rate": 8e-09, |
| "entropy": 0.7137106273818062, |
| "num_tokens": 16794078.0, |
| "logits/chosen": -1.7487986939590061, |
| "logits/rejected": -1.4640005781460887, |
| "mean_token_accuracy": 0.7085168479010463, |
| "rewards/chosen": -0.7161212222184986, |
| "rewards/rejected": -2.086236947233556, |
| "rewards/accuracies": 0.80625, |
| "rewards/margins": 1.3701157211326063, |
| "logps/chosen": -54.929140663146974, |
| "logps/rejected": -69.96422597169877, |
| "epoch": 2.0, |
| "step": 1250 |
| }, |
| { |
| "train_runtime": 5977.8981, |
| "train_samples_per_second": 3.346, |
| "train_steps_per_second": 0.209, |
| "total_flos": 1.3612284112597402e+17, |
| "train_loss": 0.45482119541168214, |
| "epoch": 2.0, |
| "step": 1250 |
| } |
| ], |
| "validation_monitor_size": 0, |
| "validation_monitor_selection": "fixed_seed_random_without_replacement", |
| "validation_monitor_seed": 22, |
| "validation_monitor_indices": [], |
| "early_stopping_patience": null |
| } |
|
|