opensysone / source /results /20260917-expanded-data /pilot-training.jsonl
andyshu's picture
Back up verified OpenSysOne training snapshot and pinned source
1a0a7fb verified
Raw History Blame
2.09 kB
{"step": 1, "loss": 0.416946159908548, "gradient_norm": 12.527731895446777, "seconds": 9.445288436021656, "decisions": 4, "branches": 12, "actual_branch_tokens": 1574, "padded_branch_tokens": 1574, "peak_cuda_allocated_bytes": 16437236224, "lr_factor": 0.01}
{"step": 2, "loss": 0.09532644314447225, "gradient_norm": 1.2328044176101685, "seconds": 7.676480213005561, "decisions": 4, "branches": 11, "actual_branch_tokens": 1169, "padded_branch_tokens": 1169, "peak_cuda_allocated_bytes": 16461464576, "lr_factor": 0.02}
{"step": 3, "loss": 0.0004234284187987214, "gradient_norm": 0.016526522114872932, "seconds": 9.242596477008192, "decisions": 4, "branches": 12, "actual_branch_tokens": 1466, "padded_branch_tokens": 1466, "peak_cuda_allocated_bytes": 16554684416, "lr_factor": 0.03}
{"step": 4, "loss": 0.11758882516733138, "gradient_norm": 3.6847429275512695, "seconds": 7.296140730992192, "decisions": 4, "branches": 10, "actual_branch_tokens": 1195, "padded_branch_tokens": 1195, "peak_cuda_allocated_bytes": 16554684416, "lr_factor": 0.04}
{"step": 5, "loss": 0.9406266607529687, "gradient_norm": 9.126194953918457, "seconds": 10.345403071987676, "decisions": 4, "branches": 15, "actual_branch_tokens": 1334, "padded_branch_tokens": 1334, "peak_cuda_allocated_bytes": 16554684416, "lr_factor": 0.05}
{"step": 6, "loss": 0.0021555372222792357, "gradient_norm": 0.0608845092356205, "seconds": 8.560206371999811, "decisions": 4, "branches": 12, "actual_branch_tokens": 1364, "padded_branch_tokens": 1364, "peak_cuda_allocated_bytes": 16554684416, "lr_factor": 0.06}
{"step": 7, "loss": 0.048110493924468756, "gradient_norm": 2.3050715923309326, "seconds": 9.30568274500547, "decisions": 4, "branches": 12, "actual_branch_tokens": 1586, "padded_branch_tokens": 1586, "peak_cuda_allocated_bytes": 16554684416, "lr_factor": 0.07}
{"step": 8, "loss": 0.9532360391283419, "gradient_norm": 6.199516773223877, "seconds": 6.406761735997861, "decisions": 4, "branches": 9, "actual_branch_tokens": 896, "padded_branch_tokens": 896, "peak_cuda_allocated_bytes": 16554684416, "lr_factor": 0.08}