{ "best_metric": 0.12918958067893982, "best_model_checkpoint": "/mnt/nvme5n1p1/trained_grpo_distill_14b_rl_70_s2/v3-20250329-085905/checkpoint-60", "epoch": 5.333333333333333, "eval_steps": 12, "global_step": 64, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "clip_ratio": 0.0, "completion_length": 6548.83203125, "epoch": 0.08333333333333333, "grad_norm": 0.16348209977149963, "kl": 0.0, "learning_rate": 1.6666666666666667e-05, "loss": 0.1545702964067459, "memory(GiB)": 179.28, "response_clip_ratio": 0.021484375, "reward": 0.4017895758152008, "reward_std": 0.1705751232802868, "rewards/CosineReward": 0.401789553463459, "rewards/RepetitionPenalty": 0.0, "step": 1, "train_speed(iter/s)": 0.000246 }, { "clip_ratio": 0.0, "epoch": 0.16666666666666666, "grad_norm": 0.16384358704090118, "kl": 0.0, "learning_rate": 3.3333333333333335e-05, "loss": 0.1545702964067459, "memory(GiB)": 179.28, "step": 2, "train_speed(iter/s)": 0.000475 }, { "clip_ratio": 1.915595930768177e-05, "completion_length": 5978.07421875, "epoch": 0.25, "grad_norm": 0.1866307407617569, "kl": -4.8041343688964844e-05, "learning_rate": 5e-05, "loss": 0.17502783238887787, "memory(GiB)": 179.38, "response_clip_ratio": 0.025390625, "reward": 0.448335699737072, "reward_std": 0.1687266193330288, "rewards/CosineReward": 0.44833918660879135, "rewards/RepetitionPenalty": -3.4611266528372653e-06, "step": 3, "train_speed(iter/s)": 0.000362 }, { "clip_ratio": 1.5297786603696295e-05, "epoch": 0.3333333333333333, "grad_norm": 0.2006995677947998, "kl": -9.1552734375e-05, "learning_rate": 6.666666666666667e-05, "loss": 0.17240501940250397, "memory(GiB)": 179.38, "step": 4, "train_speed(iter/s)": 0.000475 }, { "clip_ratio": 2.016552230088564e-05, "completion_length": 6285.865234375, "epoch": 0.4166666666666667, "grad_norm": 0.20385593175888062, "kl": 0.0004992485046386719, "learning_rate": 8.333333333333334e-05, "loss": 0.14679813385009766, "memory(GiB)": 179.38, "response_clip_ratio": 0.017578125, "reward": 0.42602989077568054, "reward_std": 0.1678701862692833, "rewards/CosineReward": 0.4260316267609596, "rewards/RepetitionPenalty": -1.698611413303297e-06, "step": 5, "train_speed(iter/s)": 0.0004 }, { "clip_ratio": 0.0007764646143186837, "epoch": 0.5, "grad_norm": 0.23919148743152618, "kl": 0.007171630859375, "learning_rate": 0.0001, "loss": 0.131611168384552, "memory(GiB)": 179.38, "step": 6, "train_speed(iter/s)": 0.000475 }, { "clip_ratio": 1.895943137242284e-05, "completion_length": 6621.03125, "epoch": 0.5833333333333334, "grad_norm": 0.4720582664012909, "kl": 0.053955078125, "learning_rate": 9.991540791356342e-05, "loss": 0.1904054880142212, "memory(GiB)": 179.38, "response_clip_ratio": 0.044921875, "reward": 0.335109181702137, "reward_std": 0.22131388261914253, "rewards/CosineReward": 0.33511025086045265, "rewards/RepetitionPenalty": -1.070246014478471e-06, "step": 7, "train_speed(iter/s)": 0.000418 }, { "clip_ratio": 0.225050151348114, "epoch": 0.6666666666666666, "grad_norm": 0.46980902552604675, "kl": 0.29248046875, "learning_rate": 9.966191788709716e-05, "loss": 0.1821543574333191, "memory(GiB)": 179.38, "step": 8, "train_speed(iter/s)": 0.000474 }, { "clip_ratio": 2.0333556221885374e-05, "completion_length": 8788.978515625, "epoch": 0.75, "grad_norm": 0.3960864245891571, "kl": 0.5654296875, "learning_rate": 9.924038765061042e-05, "loss": 0.20740336179733276, "memory(GiB)": 179.38, "response_clip_ratio": 0.228515625, "reward": 0.013692136853933334, "reward_std": 0.1656954512000084, "rewards/CosineReward": 0.013692137086763978, "rewards/RepetitionPenalty": 0.0, "step": 9, "train_speed(iter/s)": 0.000428 }, { "clip_ratio": 0.1824856847524643, "epoch": 0.8333333333333334, "grad_norm": 0.9183385968208313, "kl": 1.3125, "learning_rate": 9.865224352899119e-05, "loss": 0.2214578539133072, "memory(GiB)": 179.38, "step": 10, "train_speed(iter/s)": 0.000472 }, { "clip_ratio": 2.737712384259794e-05, "completion_length": 9197.515625, "epoch": 1.0833333333333333, "grad_norm": 0.2475370317697525, "kl": 1.103515625, "learning_rate": 9.789947561577445e-05, "loss": 0.23000311851501465, "memory(GiB)": 179.38, "response_clip_ratio": 0.234375, "reward": -0.06951781921088696, "reward_std": 0.12206118181347847, "rewards/CosineReward": -0.0695177037268877, "rewards/RepetitionPenalty": -1.186342473147306e-07, "step": 11, "train_speed(iter/s)": 0.000434 }, { "epoch": 1.1666666666666667, "grad_norm": 0.1477218121290207, "learning_rate": 9.698463103929542e-05, "loss": 0.22107946872711182, "memory(GiB)": 179.38, "step": 12, "train_speed(iter/s)": 0.000471 }, { "epoch": 1.1666666666666667, "eval_clip_ratio": 6.940209914318984e-06, "eval_completion_length": 7809.857421875, "eval_kl": 1.671875, "eval_loss": 0.3713299632072449, "eval_response_clip_ratio": 0.1428571492433548, "eval_reward": -0.0776652991771698, "eval_reward_std": 0.145624041557312, "eval_rewards/CosineReward": -0.0776652991771698, "eval_rewards/RepetitionPenalty": 0.0, "eval_runtime": 1004.5261, "eval_samples_per_second": 0.007, "eval_steps_per_second": 0.001, "step": 12 }, { "clip_ratio": 0.00031743975137032976, "completion_length": 9958.951171875, "epoch": 1.25, "grad_norm": 0.07723930478096008, "kl": 1.4765625, "learning_rate": 9.591080534401371e-05, "loss": 0.2206912338733673, "memory(GiB)": 179.38, "response_clip_ratio": 0.306640625, "reward": -0.12240881286561489, "reward_std": 0.09696152806282043, "rewards/CosineReward": -0.12240881659090519, "rewards/RepetitionPenalty": 0.0, "step": 13, "train_speed(iter/s)": 0.000424 }, { "clip_ratio": 0.021007591392844915, "epoch": 1.3333333333333333, "grad_norm": 0.43600356578826904, "kl": 2.18359375, "learning_rate": 9.468163201617062e-05, "loss": 0.22104433178901672, "memory(GiB)": 179.38, "step": 14, "train_speed(iter/s)": 0.000454 }, { "clip_ratio": 2.5281403395638335e-05, "completion_length": 9398.857421875, "epoch": 1.4166666666666667, "grad_norm": 0.07701874524354935, "kl": 2.037109375, "learning_rate": 9.330127018922194e-05, "loss": 0.2514866590499878, "memory(GiB)": 179.4, "response_clip_ratio": 0.208984375, "reward": -0.10524190217256546, "reward_std": 0.10260850936174393, "rewards/CosineReward": -0.10524190030992031, "rewards/RepetitionPenalty": 0.0, "step": 15, "train_speed(iter/s)": 0.000429 }, { "clip_ratio": 0.00025034481586772017, "epoch": 1.5, "grad_norm": 0.10210710018873215, "kl": 2.09765625, "learning_rate": 9.177439057064683e-05, "loss": 0.24714505672454834, "memory(GiB)": 179.4, "step": 16, "train_speed(iter/s)": 0.000456 }, { "clip_ratio": 2.9667284252354875e-05, "completion_length": 8656.3203125, "epoch": 1.5833333333333335, "grad_norm": 0.08796831965446472, "kl": 1.98828125, "learning_rate": 9.01061596377522e-05, "loss": 0.25992023944854736, "memory(GiB)": 179.4, "response_clip_ratio": 0.1328125, "reward": -0.03171869460493326, "reward_std": 0.12617995031177998, "rewards/CosineReward": -0.03171719750389457, "rewards/RepetitionPenalty": -1.4950109061828698e-06, "step": 17, "train_speed(iter/s)": 0.000434 }, { "clip_ratio": 0.0004736699193017557, "epoch": 1.6666666666666665, "grad_norm": 0.1108626052737236, "kl": 2.15625, "learning_rate": 8.83022221559489e-05, "loss": 0.253756582736969, "memory(GiB)": 179.4, "step": 18, "train_speed(iter/s)": 0.000457 }, { "clip_ratio": 4.969747396899038e-05, "completion_length": 7443.119140625, "epoch": 1.75, "grad_norm": 0.30806148052215576, "kl": 1.869140625, "learning_rate": 8.636868207865244e-05, "loss": 0.314345121383667, "memory(GiB)": 179.4, "response_clip_ratio": 0.08203125, "reward": 0.0504761952906847, "reward_std": 0.17868713662028313, "rewards/CosineReward": 0.0504761952906847, "rewards/RepetitionPenalty": 0.0, "step": 19, "train_speed(iter/s)": 0.000437 }, { "clip_ratio": 0.015013973927125335, "epoch": 1.8333333333333335, "grad_norm": 0.3818390369415283, "kl": 2.44140625, "learning_rate": 8.43120818934367e-05, "loss": 0.3075486719608307, "memory(GiB)": 179.4, "step": 20, "train_speed(iter/s)": 0.000459 }, { "clip_ratio": 2.5532435302011436e-05, "completion_length": 7361.61328125, "epoch": 2.0833333333333335, "grad_norm": 0.13797414302825928, "kl": 2.1328125, "learning_rate": 8.213938048432697e-05, "loss": 0.30982470512390137, "memory(GiB)": 179.4, "response_clip_ratio": 0.06640625, "reward": 0.012603676528669894, "reward_std": 0.17831061780452728, "rewards/CosineReward": 0.012603679089806974, "rewards/RepetitionPenalty": 0.0, "step": 21, "train_speed(iter/s)": 0.00044 }, { "clip_ratio": 0.0004507543271756731, "epoch": 2.1666666666666665, "grad_norm": 0.09445751458406448, "kl": 2.38671875, "learning_rate": 7.985792958513931e-05, "loss": 0.3029288649559021, "memory(GiB)": 179.4, "step": 22, "train_speed(iter/s)": 0.000459 }, { "clip_ratio": 3.390027268324047e-05, "completion_length": 7274.9921875, "epoch": 2.25, "grad_norm": 0.08438517153263092, "kl": 2.24609375, "learning_rate": 7.74754489035403e-05, "loss": 0.3122837543487549, "memory(GiB)": 179.4, "response_clip_ratio": 0.107421875, "reward": 0.04000083077698946, "reward_std": 0.15720339491963387, "rewards/CosineReward": 0.04000122472643852, "rewards/RepetitionPenalty": -3.942521118460718e-07, "step": 23, "train_speed(iter/s)": 0.000442 }, { "epoch": 2.3333333333333335, "grad_norm": 0.22712770104408264, "learning_rate": 7.500000000000001e-05, "loss": 0.309527724981308, "memory(GiB)": 179.4, "step": 24, "train_speed(iter/s)": 0.00046 }, { "epoch": 2.3333333333333335, "eval_clip_ratio": 2.6606481696944684e-05, "eval_completion_length": 8159.00048828125, "eval_kl": 2.890625, "eval_loss": 0.06887147575616837, "eval_response_clip_ratio": 0.0, "eval_reward": 0.03657619655132294, "eval_reward_std": 0.1121237576007843, "eval_rewards/CosineReward": 0.036576349288225174, "eval_rewards/RepetitionPenalty": -1.5924378260478989e-07, "eval_runtime": 1000.6856, "eval_samples_per_second": 0.007, "eval_steps_per_second": 0.001, "step": 24 }, { "clip_ratio": 0.0004242509678533679, "completion_length": 7330.619140625, "epoch": 2.4166666666666665, "grad_norm": 0.08223269134759903, "kl": 2.5, "learning_rate": 7.243995901002312e-05, "loss": 0.32226651906967163, "memory(GiB)": 179.4, "response_clip_ratio": 0.126953125, "reward": 0.04721994558349252, "reward_std": 0.17519527859985828, "rewards/CosineReward": 0.047220606822520494, "rewards/RepetitionPenalty": -6.611797402911179e-07, "step": 25, "train_speed(iter/s)": 0.000436 }, { "clip_ratio": 0.00010130415648745839, "epoch": 2.5, "grad_norm": 0.05986466631293297, "kl": 2.40234375, "learning_rate": 6.980398830195785e-05, "loss": 0.3173108994960785, "memory(GiB)": 179.4, "step": 26, "train_speed(iter/s)": 0.000452 }, { "clip_ratio": 1.904529290186474e-05, "completion_length": 7148.123046875, "epoch": 2.5833333333333335, "grad_norm": 0.08117522299289703, "kl": 2.267578125, "learning_rate": 6.710100716628344e-05, "loss": 0.29803627729415894, "memory(GiB)": 179.4, "response_clip_ratio": 0.05859375, "reward": 0.08058818010613322, "reward_std": 0.2084643319249153, "rewards/CosineReward": 0.08058824483305216, "rewards/RepetitionPenalty": -6.841068511675985e-08, "step": 27, "train_speed(iter/s)": 0.000438 }, { "clip_ratio": 2.8319021566858282e-05, "epoch": 2.6666666666666665, "grad_norm": 0.06843555718660355, "kl": 2.30859375, "learning_rate": 6.434016163555452e-05, "loss": 0.2943669557571411, "memory(GiB)": 179.4, "step": 28, "train_speed(iter/s)": 0.000453 }, { "clip_ratio": 2.377905320827267e-05, "completion_length": 7043.7734375, "epoch": 2.75, "grad_norm": 0.11224047094583511, "kl": 2.30859375, "learning_rate": 6.153079353712201e-05, "loss": 0.3068138062953949, "memory(GiB)": 179.4, "response_clip_ratio": 0.064453125, "reward": 0.10104330768808722, "reward_std": 0.1795201115310192, "rewards/CosineReward": 0.10104331048205495, "rewards/RepetitionPenalty": 0.0, "step": 29, "train_speed(iter/s)": 0.00044 }, { "clip_ratio": 2.678473651940294e-05, "epoch": 2.8333333333333335, "grad_norm": 0.06063569337129593, "kl": 2.48046875, "learning_rate": 5.868240888334653e-05, "loss": 0.3044006824493408, "memory(GiB)": 179.4, "step": 30, "train_speed(iter/s)": 0.000454 }, { "clip_ratio": 2.3957579742273083e-05, "completion_length": 6917.470703125, "epoch": 3.0833333333333335, "grad_norm": 0.06954994052648544, "kl": 2.52734375, "learning_rate": 5.5804645706261514e-05, "loss": 0.32018184661865234, "memory(GiB)": 179.4, "response_clip_ratio": 0.064453125, "reward": 0.11851745843887329, "reward_std": 0.1883859969675541, "rewards/CosineReward": 0.11851745285093784, "rewards/RepetitionPenalty": 0.0, "step": 31, "train_speed(iter/s)": 0.000442 }, { "clip_ratio": 3.0191856694727903e-05, "epoch": 3.1666666666666665, "grad_norm": 0.085055872797966, "kl": 2.671875, "learning_rate": 5.290724144552379e-05, "loss": 0.3171422779560089, "memory(GiB)": 179.4, "step": 32, "train_speed(iter/s)": 0.000455 }, { "clip_ratio": 4.0645980789122405e-05, "completion_length": 7217.87109375, "epoch": 3.25, "grad_norm": 0.2751259207725525, "kl": 3.17578125, "learning_rate": 5e-05, "loss": 0.33012571930885315, "memory(GiB)": 179.4, "response_clip_ratio": 0.06640625, "reward": 0.07358059100806713, "reward_std": 0.19997451454401016, "rewards/CosineReward": 0.0735808894969523, "rewards/RepetitionPenalty": -2.9900871822974295e-07, "step": 33, "train_speed(iter/s)": 0.000443 }, { "clip_ratio": 0.001576803915668279, "epoch": 3.3333333333333335, "grad_norm": 0.13159900903701782, "kl": 2.92578125, "learning_rate": 4.709275855447621e-05, "loss": 0.32636967301368713, "memory(GiB)": 179.4, "step": 34, "train_speed(iter/s)": 0.000455 }, { "clip_ratio": 1.7762126390152844e-05, "completion_length": 7016.671875, "epoch": 3.4166666666666665, "grad_norm": 0.12239609658718109, "kl": 2.349609375, "learning_rate": 4.4195354293738484e-05, "loss": 0.30155760049819946, "memory(GiB)": 179.4, "response_clip_ratio": 0.044921875, "reward": 0.1327731590718031, "reward_std": 0.19624915346503258, "rewards/CosineReward": 0.13277401961386204, "rewards/RepetitionPenalty": -8.578282404414495e-07, "step": 35, "train_speed(iter/s)": 0.000444 }, { "epoch": 3.5, "grad_norm": 0.17297780513763428, "learning_rate": 4.131759111665349e-05, "loss": 0.3010379672050476, "memory(GiB)": 179.4, "step": 36, "train_speed(iter/s)": 0.000456 }, { "epoch": 3.5, "eval_clip_ratio": 3.553860733518377e-05, "eval_completion_length": 9360.572265625, "eval_kl": 3.46875, "eval_loss": 0.3076005280017853, "eval_response_clip_ratio": 0.1428571492433548, "eval_reward": 0.12024763226509094, "eval_reward_std": 0.15955841541290283, "eval_rewards/CosineReward": 0.12024761736392975, "eval_rewards/RepetitionPenalty": 0.0, "eval_runtime": 1031.1183, "eval_samples_per_second": 0.007, "eval_steps_per_second": 0.001, "step": 36 }, { "clip_ratio": 6.486204142674978e-05, "completion_length": 7391.548828125, "epoch": 3.5833333333333335, "grad_norm": 0.0696391686797142, "kl": 2.4580078125, "learning_rate": 3.846920646287799e-05, "loss": 0.2980685234069824, "memory(GiB)": 179.4, "response_clip_ratio": 0.056640625, "reward": 0.09776598494499922, "reward_std": 0.17968057096004486, "rewards/CosineReward": 0.09776598028838634, "rewards/RepetitionPenalty": 0.0, "step": 37, "train_speed(iter/s)": 0.00044 }, { "clip_ratio": 4.5505223170039244e-05, "epoch": 3.6666666666666665, "grad_norm": 0.075725257396698, "kl": 2.65625, "learning_rate": 3.5659838364445505e-05, "loss": 0.2973749041557312, "memory(GiB)": 179.4, "step": 38, "train_speed(iter/s)": 0.000451 }, { "clip_ratio": 2.7227523332840065e-05, "completion_length": 6970.59765625, "epoch": 3.75, "grad_norm": 0.13103771209716797, "kl": 2.58203125, "learning_rate": 3.289899283371657e-05, "loss": 0.3383063077926636, "memory(GiB)": 179.4, "response_clip_ratio": 0.0546875, "reward": 0.1579855252057314, "reward_std": 0.2061951532959938, "rewards/CosineReward": 0.15798552427440882, "rewards/RepetitionPenalty": 0.0, "step": 39, "train_speed(iter/s)": 0.000441 }, { "clip_ratio": 1.819473186515097e-05, "epoch": 3.8333333333333335, "grad_norm": 0.10087469220161438, "kl": 2.63671875, "learning_rate": 3.019601169804216e-05, "loss": 0.33682429790496826, "memory(GiB)": 179.4, "step": 40, "train_speed(iter/s)": 0.000452 }, { "clip_ratio": 1.6942344245762797e-05, "completion_length": 7164.43359375, "epoch": 4.083333333333333, "grad_norm": 0.05288735032081604, "kl": 2.9453125, "learning_rate": 2.7560040989976892e-05, "loss": 0.34364235401153564, "memory(GiB)": 179.4, "response_clip_ratio": 0.07421875, "reward": 0.14892909117043018, "reward_std": 0.20389077439904213, "rewards/CosineReward": 0.14893037267029285, "rewards/RepetitionPenalty": -1.2906025403935928e-06, "step": 41, "train_speed(iter/s)": 0.000442 }, { "clip_ratio": 1.7799320403355523e-05, "epoch": 4.166666666666667, "grad_norm": 0.09818096458911896, "kl": 3.0234375, "learning_rate": 2.500000000000001e-05, "loss": 0.3433087170124054, "memory(GiB)": 179.4, "step": 42, "train_speed(iter/s)": 0.000452 }, { "clip_ratio": 1.8298997474630596e-05, "completion_length": 7555.46875, "epoch": 4.25, "grad_norm": 0.1601419597864151, "kl": 3.34765625, "learning_rate": 2.25245510964597e-05, "loss": 0.3731963634490967, "memory(GiB)": 179.4, "response_clip_ratio": 0.091796875, "reward": 0.08685891143977642, "reward_std": 0.19358530268073082, "rewards/CosineReward": 0.08685892261564732, "rewards/RepetitionPenalty": 0.0, "step": 43, "train_speed(iter/s)": 0.000443 }, { "clip_ratio": 3.215434617231949e-05, "epoch": 4.333333333333333, "grad_norm": 0.13790880143642426, "kl": 3.265625, "learning_rate": 2.0142070414860704e-05, "loss": 0.37288910150527954, "memory(GiB)": 179.4, "step": 44, "train_speed(iter/s)": 0.000453 }, { "clip_ratio": 2.2478410755866207e-05, "completion_length": 7659.50390625, "epoch": 4.416666666666667, "grad_norm": 0.0921853631734848, "kl": 3.125, "learning_rate": 1.7860619515673033e-05, "loss": 0.35845914483070374, "memory(GiB)": 179.4, "response_clip_ratio": 0.09765625, "reward": 0.09167561889626086, "reward_std": 0.2029484249651432, "rewards/CosineReward": 0.09167627710849047, "rewards/RepetitionPenalty": -6.579870728273818e-07, "step": 45, "train_speed(iter/s)": 0.000444 }, { "clip_ratio": 5.8838513723458163e-05, "epoch": 4.5, "grad_norm": 0.029620319604873657, "kl": 2.9921875, "learning_rate": 1.5687918106563326e-05, "loss": 0.35755494236946106, "memory(GiB)": 179.4, "step": 46, "train_speed(iter/s)": 0.000453 }, { "clip_ratio": 2.0101413156226045e-05, "completion_length": 6990.130859375, "epoch": 4.583333333333333, "grad_norm": 0.15807992219924927, "kl": 2.53515625, "learning_rate": 1.3631317921347563e-05, "loss": 0.33309173583984375, "memory(GiB)": 179.4, "response_clip_ratio": 0.072265625, "reward": 0.184091467410326, "reward_std": 0.20932698994874954, "rewards/CosineReward": 0.1840914599597454, "rewards/RepetitionPenalty": 0.0, "step": 47, "train_speed(iter/s)": 0.000445 }, { "epoch": 4.666666666666667, "grad_norm": 0.1702960878610611, "learning_rate": 1.1697777844051105e-05, "loss": 0.33316949009895325, "memory(GiB)": 179.4, "step": 48, "train_speed(iter/s)": 0.000454 }, { "epoch": 4.666666666666667, "eval_clip_ratio": 4.276269828551449e-05, "eval_completion_length": 8430.1435546875, "eval_kl": 4.125, "eval_loss": 0.32876482605934143, "eval_response_clip_ratio": 0.2857142984867096, "eval_reward": 0.12817195057868958, "eval_reward_std": 0.15863054990768433, "eval_rewards/CosineReward": 0.12817198038101196, "eval_rewards/RepetitionPenalty": 0.0, "eval_runtime": 1017.141, "eval_samples_per_second": 0.007, "eval_steps_per_second": 0.001, "step": 48 }, { "clip_ratio": 1.9754471395572182e-05, "completion_length": 7249.76171875, "epoch": 4.083333333333333, "grad_norm": 0.10699855536222458, "kl": 2.52734375, "learning_rate": 7.373001848738202e-05, "loss": 0.3186631202697754, "memory(GiB)": 185.16, "response_clip_ratio": 0.0859375, "reward": 0.1530955620110035, "reward_std": 0.20569872111082077, "rewards/CosineReward": 0.15309555269777775, "rewards/RepetitionPenalty": 0.0, "step": 49, "train_speed(iter/s)": 0.011979 }, { "clip_ratio": 2.3660143597226124e-05, "epoch": 4.166666666666667, "grad_norm": 0.08193350583314896, "kl": 2.57421875, "learning_rate": 7.243995901002312e-05, "loss": 0.31817346811294556, "memory(GiB)": 185.16, "step": 50, "train_speed(iter/s)": 0.011806 }, { "clip_ratio": 2.211639503002516e-05, "completion_length": 7120.9375, "epoch": 4.25, "grad_norm": 0.14047524333000183, "kl": 3.2421875, "learning_rate": 7.113091308703498e-05, "loss": 0.3653872609138489, "memory(GiB)": 185.16, "response_clip_ratio": 0.1171875, "reward": 0.19764085859060287, "reward_std": 0.21886689960956573, "rewards/CosineReward": 0.1976415440440178, "rewards/RepetitionPenalty": -6.893382078487775e-07, "step": 51, "train_speed(iter/s)": 0.006107 }, { "clip_ratio": 2.842958019755315e-05, "epoch": 4.333333333333333, "grad_norm": 0.23579397797584534, "kl": 3.4140625, "learning_rate": 6.980398830195785e-05, "loss": 0.3644198775291443, "memory(GiB)": 185.16, "step": 52, "train_speed(iter/s)": 0.006121 }, { "clip_ratio": 1.6588395283179125e-05, "completion_length": 7284.76171875, "epoch": 4.416666666666667, "grad_norm": 0.04071468114852905, "kl": 3.10546875, "learning_rate": 6.846030736563422e-05, "loss": 0.36724069714546204, "memory(GiB)": 184.19, "response_clip_ratio": 0.15625, "reward": 0.17882150784134865, "reward_std": 0.17632417008280754, "rewards/CosineReward": 0.17882288992404938, "rewards/RepetitionPenalty": -1.3854046585493052e-06, "step": 53, "train_speed(iter/s)": 0.013032 }, { "clip_ratio": 0.0018294498731847852, "epoch": 4.5, "grad_norm": 0.16932378709316254, "kl": 2.8046875, "learning_rate": 6.710100716628344e-05, "loss": 0.3665623068809509, "memory(GiB)": 184.19, "step": 54, "train_speed(iter/s)": 0.012823 }, { "clip_ratio": 2.780710246952367e-05, "completion_length": 7508.099609375, "epoch": 4.583333333333333, "grad_norm": 0.04224909096956253, "kl": 3.03125, "learning_rate": 6.572723780758069e-05, "loss": 0.3535935878753662, "memory(GiB)": 184.19, "response_clip_ratio": 0.162109375, "reward": 0.17994043603539467, "reward_std": 0.185169517993927, "rewards/CosineReward": 0.17994044721126556, "rewards/RepetitionPenalty": 0.0, "step": 55, "train_speed(iter/s)": 0.006615 }, { "clip_ratio": 2.5482849196123425e-05, "epoch": 4.666666666666667, "grad_norm": 0.03600788488984108, "kl": 3.06640625, "learning_rate": 6.434016163555452e-05, "loss": 0.35127803683280945, "memory(GiB)": 184.19, "step": 56, "train_speed(iter/s)": 0.006618 }, { "clip_ratio": 2.373553729739797e-05, "completion_length": 7532.986328125, "epoch": 4.75, "grad_norm": 0.04710998013615608, "kl": 3.15625, "learning_rate": 6.294095225512603e-05, "loss": 0.3812779188156128, "memory(GiB)": 184.19, "response_clip_ratio": 0.150390625, "reward": 0.15369250997900963, "reward_std": 0.2217605523765087, "rewards/CosineReward": 0.15369419567286968, "rewards/RepetitionPenalty": -1.679204729043704e-06, "step": 57, "train_speed(iter/s)": 0.004522 }, { "clip_ratio": 2.0617421569113503e-05, "epoch": 4.833333333333333, "grad_norm": 0.030528903007507324, "kl": 3.23046875, "learning_rate": 6.153079353712201e-05, "loss": 0.3794715702533722, "memory(GiB)": 184.19, "step": 58, "train_speed(iter/s)": 0.004546 }, { "clip_ratio": 2.46459949266864e-05, "completion_length": 7458.419921875, "epoch": 5.083333333333333, "grad_norm": 0.050327010452747345, "kl": 3.34765625, "learning_rate": 6.0110878616601904e-05, "loss": 0.3843703269958496, "memory(GiB)": 184.19, "response_clip_ratio": 0.181640625, "reward": 0.18363566510379314, "reward_std": 0.18902317062020302, "rewards/CosineReward": 0.18363658897578716, "rewards/RepetitionPenalty": -9.101235036723665e-07, "step": 59, "train_speed(iter/s)": 0.003495 }, { "epoch": 5.166666666666667, "grad_norm": 0.036718469113111496, "learning_rate": 5.868240888334653e-05, "loss": 0.3826245665550232, "memory(GiB)": 184.19, "step": 60, "train_speed(iter/s)": 0.003524 }, { "epoch": 5.166666666666667, "eval_clip_ratio": 2.5763809389900416e-05, "eval_completion_length": 9660.857421875, "eval_kl": 4.59375, "eval_loss": 0.2822325825691223, "eval_response_clip_ratio": 0.2857142984867096, "eval_reward": 0.12918958067893982, "eval_reward_std": 0.11928828805685043, "eval_rewards/CosineReward": 0.12918956577777863, "eval_rewards/RepetitionPenalty": 0.0, "eval_runtime": 1017.4637, "eval_samples_per_second": 0.007, "eval_steps_per_second": 0.001, "step": 60 }, { "clip_ratio": 2.5235839984816266e-05, "completion_length": 8022.767578125, "epoch": 5.083333333333333, "grad_norm": 0.13297545909881592, "kl": 3.62109375, "learning_rate": 5.724659296536233e-05, "loss": 0.39252200722694397, "memory(GiB)": 149.46, "response_clip_ratio": 0.21875, "reward": 0.1098299864679575, "reward_std": 0.22277764976024628, "rewards/CosineReward": 0.10983069613575935, "rewards/RepetitionPenalty": -7.085875495249638e-07, "step": 61, "train_speed(iter/s)": 0.014869 }, { "clip_ratio": 0.00028464425849961117, "epoch": 5.166666666666667, "grad_norm": 0.050255097448825836, "kl": 3.34375, "learning_rate": 5.5804645706261514e-05, "loss": 0.39131754636764526, "memory(GiB)": 149.46, "step": 62, "train_speed(iter/s)": 0.0146 }, { "clip_ratio": 2.5200109121215064e-05, "completion_length": 7439.900390625, "epoch": 5.25, "grad_norm": 0.24896182119846344, "kl": 2.83984375, "learning_rate": 5.435778713738292e-05, "loss": 0.3810032308101654, "memory(GiB)": 149.57, "response_clip_ratio": 0.177734375, "reward": 0.21993902325630188, "reward_std": 0.23494866862893105, "rewards/CosineReward": 0.2199418805539608, "rewards/RepetitionPenalty": -2.850357986972085e-06, "step": 63, "train_speed(iter/s)": 0.007539 }, { "clip_ratio": 2.4266442324005766e-05, "epoch": 5.333333333333333, "grad_norm": 0.08133991807699203, "kl": 3.1015625, "learning_rate": 5.290724144552379e-05, "loss": 0.3777579069137573, "memory(GiB)": 149.57, "step": 64, "train_speed(iter/s)": 0.007528 } ], "logging_steps": 1, "max_steps": 120, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 4, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 4, "trial_name": null, "trial_params": null }