r1-14b-s2-ckpts-v2 / logging.jsonl
radna's picture
Upload folder using huggingface_hub
726c2ff verified
Raw
History Blame Contribute Delete
2.43 kB
{"loss": 0.31866312, "grad_norm": 0.10699856, "learning_rate": 7.373e-05, "memory(GiB)": 185.16, "train_speed(iter/s)": 0.011979, "completion_length": 7249.76171875, "response_clip_ratio": 0.0859375, "rewards/CosineReward": 0.15309555, "rewards/RepetitionPenalty": 0.0, "reward": 0.15309556, "reward_std": 0.20569872, "kl": 2.52734375, "clip_ratio": 1.975e-05, "epoch": 4.08333333, "global_step/max_steps": "49/120", "percentage": "40.83%", "elapsed_time": "1h 8m 5s", "remaining_time": "1h 38m 39s"}
{"loss": 0.31817347, "grad_norm": 0.08193351, "learning_rate": 7.244e-05, "memory(GiB)": 185.16, "train_speed(iter/s)": 0.011806, "kl": 2.57421875, "clip_ratio": 2.366e-05, "epoch": 4.16666667, "global_step/max_steps": "50/120", "percentage": "41.67%", "elapsed_time": "1h 10m 29s", "remaining_time": "1h 38m 41s"}
{"loss": 0.36538726, "grad_norm": 0.14047524, "learning_rate": 7.113e-05, "memory(GiB)": 185.16, "train_speed(iter/s)": 0.006107, "completion_length": 7120.9375, "response_clip_ratio": 0.1171875, "rewards/CosineReward": 0.19764154, "rewards/RepetitionPenalty": -6.9e-07, "reward": 0.19764086, "reward_std": 0.2188669, "kl": 3.2421875, "clip_ratio": 2.212e-05, "epoch": 4.25, "global_step/max_steps": "51/120", "percentage": "42.50%", "elapsed_time": "2h 19m 5s", "remaining_time": "3h 8m 10s"}
{"loss": 0.36441988, "grad_norm": 0.23579398, "learning_rate": 6.98e-05, "memory(GiB)": 185.16, "train_speed(iter/s)": 0.006121, "kl": 3.4140625, "clip_ratio": 2.843e-05, "epoch": 4.33333333, "global_step/max_steps": "52/120", "percentage": "43.33%", "elapsed_time": "2h 21m 29s", "remaining_time": "3h 5m 1s"}
{"loss": 0.3672407, "grad_norm": 0.04071468, "learning_rate": 6.846e-05, "memory(GiB)": 185.16, "train_speed(iter/s)": 0.004209, "completion_length": 7284.76171875, "response_clip_ratio": 0.15625, "rewards/CosineReward": 0.17882289, "rewards/RepetitionPenalty": -1.39e-06, "reward": 0.17882151, "reward_std": 0.17632417, "kl": 3.10546875, "clip_ratio": 1.659e-05, "epoch": 4.41666667, "global_step/max_steps": "53/120", "percentage": "44.17%", "elapsed_time": "3h 29m 45s", "remaining_time": "4h 25m 10s"}
{"loss": 0.36656231, "grad_norm": 0.16932379, "learning_rate": 6.71e-05, "memory(GiB)": 185.16, "train_speed(iter/s)": 0.004241, "kl": 2.8046875, "clip_ratio": 0.00182945, "epoch": 4.5, "global_step/max_steps": "54/120", "percentage": "45.00%", "elapsed_time": "3h 32m 8s", "remaining_time": "4h 19m 16s"}