{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.3995405283923488, "eval_steps": 500, "global_step": 2000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0001997702641961744, "grad_norm": 8.875, "learning_rate": 0.0, "loss": 1.4044, "memory/device_reserved (GiB)": 86.98, "memory/max_active (GiB)": 76.6, "memory/max_allocated (GiB)": 76.6, "step": 1, "tokens_per_second_per_gpu": 12080.3, "total_tokens": 88833 }, { "epoch": 0.0003995405283923488, "grad_norm": 8.625, "learning_rate": 2.0000000000000002e-07, "loss": 1.407, "memory/device_reserved (GiB)": 101.86, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 2, "tokens_per_second_per_gpu": 19147.53, "total_tokens": 180993 }, { "epoch": 0.0005993107925885232, "grad_norm": 9.1875, "learning_rate": 4.0000000000000003e-07, "loss": 1.4311, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 3, "tokens_per_second_per_gpu": 18223.2, "total_tokens": 268993 }, { "epoch": 0.0007990810567846976, "grad_norm": 8.0, "learning_rate": 6.000000000000001e-07, "loss": 1.3511, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 4, "tokens_per_second_per_gpu": 18306.2, "total_tokens": 359437 }, { "epoch": 0.000998851320980872, "grad_norm": 8.625, "learning_rate": 8.000000000000001e-07, "loss": 1.4297, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 5, "tokens_per_second_per_gpu": 20326.18, "total_tokens": 456114 }, { "epoch": 0.0011986215851770463, "grad_norm": 8.625, "learning_rate": 1.0000000000000002e-06, "loss": 1.4184, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 6, "tokens_per_second_per_gpu": 18521.54, "total_tokens": 545509 }, { "epoch": 0.0013983918493732208, "grad_norm": 7.8125, "learning_rate": 1.2000000000000002e-06, "loss": 1.3454, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 7, "tokens_per_second_per_gpu": 18747.26, "total_tokens": 639166 }, { "epoch": 0.0015981621135693952, "grad_norm": 8.6875, "learning_rate": 1.4000000000000001e-06, "loss": 1.4629, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 8, "tokens_per_second_per_gpu": 19943.66, "total_tokens": 734740 }, { "epoch": 0.0017979323777655696, "grad_norm": 8.5625, "learning_rate": 1.6000000000000001e-06, "loss": 1.4124, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 9, "tokens_per_second_per_gpu": 18252.37, "total_tokens": 822714 }, { "epoch": 0.001997702641961744, "grad_norm": 8.25, "learning_rate": 1.8000000000000001e-06, "loss": 1.3985, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 10, "tokens_per_second_per_gpu": 17564.17, "total_tokens": 908386 }, { "epoch": 0.0021974729061579185, "grad_norm": 8.0625, "learning_rate": 2.0000000000000003e-06, "loss": 1.3653, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 11, "tokens_per_second_per_gpu": 18947.2, "total_tokens": 1001224 }, { "epoch": 0.0023972431703540927, "grad_norm": 8.25, "learning_rate": 2.2e-06, "loss": 1.3525, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 12, "tokens_per_second_per_gpu": 15991.21, "total_tokens": 1078798 }, { "epoch": 0.0025970134345502673, "grad_norm": 8.0, "learning_rate": 2.4000000000000003e-06, "loss": 1.3854, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 13, "tokens_per_second_per_gpu": 19282.61, "total_tokens": 1172554 }, { "epoch": 0.0027967836987464415, "grad_norm": 7.03125, "learning_rate": 2.6e-06, "loss": 1.3296, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 14, "tokens_per_second_per_gpu": 19141.05, "total_tokens": 1266344 }, { "epoch": 0.002996553962942616, "grad_norm": 7.28125, "learning_rate": 2.8000000000000003e-06, "loss": 1.3306, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 15, "tokens_per_second_per_gpu": 17741.01, "total_tokens": 1353101 }, { "epoch": 0.0031963242271387904, "grad_norm": 6.9375, "learning_rate": 3e-06, "loss": 1.3057, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 16, "tokens_per_second_per_gpu": 17461.64, "total_tokens": 1439123 }, { "epoch": 0.0033960944913349646, "grad_norm": 6.625, "learning_rate": 3.2000000000000003e-06, "loss": 1.3333, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 17, "tokens_per_second_per_gpu": 18994.25, "total_tokens": 1531013 }, { "epoch": 0.0035958647555311392, "grad_norm": 6.65625, "learning_rate": 3.4000000000000005e-06, "loss": 1.3206, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 18, "tokens_per_second_per_gpu": 17491.17, "total_tokens": 1615560 }, { "epoch": 0.0037956350197273134, "grad_norm": 6.09375, "learning_rate": 3.6000000000000003e-06, "loss": 1.2949, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 19, "tokens_per_second_per_gpu": 17298.22, "total_tokens": 1700965 }, { "epoch": 0.003995405283923488, "grad_norm": 6.0, "learning_rate": 3.8000000000000005e-06, "loss": 1.3137, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 20, "tokens_per_second_per_gpu": 19409.75, "total_tokens": 1794883 }, { "epoch": 0.004195175548119662, "grad_norm": 5.4375, "learning_rate": 4.000000000000001e-06, "loss": 1.2392, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 21, "tokens_per_second_per_gpu": 18253.96, "total_tokens": 1884703 }, { "epoch": 0.004394945812315837, "grad_norm": 4.90625, "learning_rate": 4.2000000000000004e-06, "loss": 1.2102, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 22, "tokens_per_second_per_gpu": 18032.95, "total_tokens": 1973886 }, { "epoch": 0.0045947160765120116, "grad_norm": 4.71875, "learning_rate": 4.4e-06, "loss": 1.2464, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 23, "tokens_per_second_per_gpu": 18600.94, "total_tokens": 2064097 }, { "epoch": 0.004794486340708185, "grad_norm": 4.28125, "learning_rate": 4.600000000000001e-06, "loss": 1.2229, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 24, "tokens_per_second_per_gpu": 18997.25, "total_tokens": 2156067 }, { "epoch": 0.00499425660490436, "grad_norm": 4.0625, "learning_rate": 4.800000000000001e-06, "loss": 1.1683, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 25, "tokens_per_second_per_gpu": 18823.82, "total_tokens": 2246949 }, { "epoch": 0.005194026869100535, "grad_norm": 3.859375, "learning_rate": 5e-06, "loss": 1.2146, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 26, "tokens_per_second_per_gpu": 20230.9, "total_tokens": 2343942 }, { "epoch": 0.005393797133296708, "grad_norm": 3.328125, "learning_rate": 5.2e-06, "loss": 1.1309, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 27, "tokens_per_second_per_gpu": 18797.19, "total_tokens": 2435894 }, { "epoch": 0.005593567397492883, "grad_norm": 3.4375, "learning_rate": 5.400000000000001e-06, "loss": 1.0593, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 28, "tokens_per_second_per_gpu": 17280.36, "total_tokens": 2521341 }, { "epoch": 0.005793337661689058, "grad_norm": 3.234375, "learning_rate": 5.600000000000001e-06, "loss": 1.0656, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 29, "tokens_per_second_per_gpu": 16782.87, "total_tokens": 2603702 }, { "epoch": 0.005993107925885232, "grad_norm": 2.5625, "learning_rate": 5.8e-06, "loss": 1.0975, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 30, "tokens_per_second_per_gpu": 19317.94, "total_tokens": 2698698 }, { "epoch": 0.006192878190081406, "grad_norm": 2.359375, "learning_rate": 6e-06, "loss": 1.0129, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 31, "tokens_per_second_per_gpu": 17596.21, "total_tokens": 2786649 }, { "epoch": 0.006392648454277581, "grad_norm": 2.34375, "learning_rate": 6.200000000000001e-06, "loss": 1.0431, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 32, "tokens_per_second_per_gpu": 17675.83, "total_tokens": 2872421 }, { "epoch": 0.006592418718473755, "grad_norm": 1.9765625, "learning_rate": 6.4000000000000006e-06, "loss": 0.9933, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 33, "tokens_per_second_per_gpu": 17434.75, "total_tokens": 2958573 }, { "epoch": 0.006792188982669929, "grad_norm": 1.75, "learning_rate": 6.600000000000001e-06, "loss": 0.9853, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 34, "tokens_per_second_per_gpu": 18139.99, "total_tokens": 3048323 }, { "epoch": 0.006991959246866104, "grad_norm": 1.65625, "learning_rate": 6.800000000000001e-06, "loss": 0.9892, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 35, "tokens_per_second_per_gpu": 19104.98, "total_tokens": 3141049 }, { "epoch": 0.0071917295110622784, "grad_norm": 1.5390625, "learning_rate": 7e-06, "loss": 1.0487, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 36, "tokens_per_second_per_gpu": 19222.43, "total_tokens": 3232249 }, { "epoch": 0.007391499775258453, "grad_norm": 1.4140625, "learning_rate": 7.2000000000000005e-06, "loss": 1.0083, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 37, "tokens_per_second_per_gpu": 18372.25, "total_tokens": 3321456 }, { "epoch": 0.007591270039454627, "grad_norm": 1.4375, "learning_rate": 7.4e-06, "loss": 0.9817, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 38, "tokens_per_second_per_gpu": 18347.2, "total_tokens": 3411507 }, { "epoch": 0.0077910403036508015, "grad_norm": 1.296875, "learning_rate": 7.600000000000001e-06, "loss": 0.9812, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 39, "tokens_per_second_per_gpu": 19981.65, "total_tokens": 3507274 }, { "epoch": 0.007990810567846975, "grad_norm": 1.203125, "learning_rate": 7.800000000000002e-06, "loss": 0.9041, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 40, "tokens_per_second_per_gpu": 17566.12, "total_tokens": 3594794 }, { "epoch": 0.00819058083204315, "grad_norm": 1.1796875, "learning_rate": 8.000000000000001e-06, "loss": 0.9809, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 41, "tokens_per_second_per_gpu": 19390.88, "total_tokens": 3687994 }, { "epoch": 0.008390351096239325, "grad_norm": 1.0625, "learning_rate": 8.2e-06, "loss": 0.8908, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 42, "tokens_per_second_per_gpu": 18208.34, "total_tokens": 3777101 }, { "epoch": 0.008590121360435498, "grad_norm": 1.078125, "learning_rate": 8.400000000000001e-06, "loss": 0.8831, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 43, "tokens_per_second_per_gpu": 18401.34, "total_tokens": 3866806 }, { "epoch": 0.008789891624631674, "grad_norm": 1.015625, "learning_rate": 8.6e-06, "loss": 0.8951, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 44, "tokens_per_second_per_gpu": 18568.36, "total_tokens": 3957260 }, { "epoch": 0.008989661888827848, "grad_norm": 0.9765625, "learning_rate": 8.8e-06, "loss": 0.9264, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 45, "tokens_per_second_per_gpu": 20672.2, "total_tokens": 4056792 }, { "epoch": 0.009189432153024023, "grad_norm": 1.0078125, "learning_rate": 9e-06, "loss": 0.8714, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 46, "tokens_per_second_per_gpu": 17404.11, "total_tokens": 4142165 }, { "epoch": 0.009389202417220197, "grad_norm": 0.9453125, "learning_rate": 9.200000000000002e-06, "loss": 0.9091, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 47, "tokens_per_second_per_gpu": 19389.02, "total_tokens": 4236108 }, { "epoch": 0.00958897268141637, "grad_norm": 0.921875, "learning_rate": 9.4e-06, "loss": 0.868, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 48, "tokens_per_second_per_gpu": 18098.57, "total_tokens": 4323994 }, { "epoch": 0.009788742945612546, "grad_norm": 0.89453125, "learning_rate": 9.600000000000001e-06, "loss": 0.8818, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 49, "tokens_per_second_per_gpu": 18228.99, "total_tokens": 4412792 }, { "epoch": 0.00998851320980872, "grad_norm": 0.9140625, "learning_rate": 9.800000000000001e-06, "loss": 0.8499, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 50, "tokens_per_second_per_gpu": 18242.39, "total_tokens": 4501083 }, { "epoch": 0.010188283474004894, "grad_norm": 0.8828125, "learning_rate": 1e-05, "loss": 0.8366, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 51, "tokens_per_second_per_gpu": 18626.18, "total_tokens": 4593306 }, { "epoch": 0.01038805373820107, "grad_norm": 0.86328125, "learning_rate": 1.02e-05, "loss": 0.8403, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 52, "tokens_per_second_per_gpu": 18781.03, "total_tokens": 4687235 }, { "epoch": 0.010587824002397243, "grad_norm": 0.85546875, "learning_rate": 1.04e-05, "loss": 0.8384, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 53, "tokens_per_second_per_gpu": 17929.45, "total_tokens": 4775601 }, { "epoch": 0.010787594266593417, "grad_norm": 0.8359375, "learning_rate": 1.0600000000000002e-05, "loss": 0.8393, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 54, "tokens_per_second_per_gpu": 19513.24, "total_tokens": 4869394 }, { "epoch": 0.010987364530789592, "grad_norm": 0.86328125, "learning_rate": 1.0800000000000002e-05, "loss": 0.8511, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 55, "tokens_per_second_per_gpu": 19830.01, "total_tokens": 4967591 }, { "epoch": 0.011187134794985766, "grad_norm": 0.8125, "learning_rate": 1.1000000000000001e-05, "loss": 0.7989, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 56, "tokens_per_second_per_gpu": 19199.44, "total_tokens": 5061747 }, { "epoch": 0.011386905059181942, "grad_norm": 0.8046875, "learning_rate": 1.1200000000000001e-05, "loss": 0.7682, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 57, "tokens_per_second_per_gpu": 17734.06, "total_tokens": 5149611 }, { "epoch": 0.011586675323378115, "grad_norm": 0.83203125, "learning_rate": 1.14e-05, "loss": 0.7711, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 58, "tokens_per_second_per_gpu": 18234.8, "total_tokens": 5238688 }, { "epoch": 0.011786445587574289, "grad_norm": 0.80859375, "learning_rate": 1.16e-05, "loss": 0.7814, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 59, "tokens_per_second_per_gpu": 18792.26, "total_tokens": 5330605 }, { "epoch": 0.011986215851770465, "grad_norm": 0.79296875, "learning_rate": 1.18e-05, "loss": 0.8027, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 60, "tokens_per_second_per_gpu": 19697.85, "total_tokens": 5427929 }, { "epoch": 0.012185986115966638, "grad_norm": 0.7421875, "learning_rate": 1.2e-05, "loss": 0.7635, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 61, "tokens_per_second_per_gpu": 19182.0, "total_tokens": 5523093 }, { "epoch": 0.012385756380162812, "grad_norm": 0.80078125, "learning_rate": 1.22e-05, "loss": 0.7506, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 62, "tokens_per_second_per_gpu": 16852.6, "total_tokens": 5606507 }, { "epoch": 0.012585526644358988, "grad_norm": 0.796875, "learning_rate": 1.2400000000000002e-05, "loss": 0.759, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 63, "tokens_per_second_per_gpu": 18976.55, "total_tokens": 5699726 }, { "epoch": 0.012785296908555161, "grad_norm": 0.96875, "learning_rate": 1.2600000000000001e-05, "loss": 0.7482, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 64, "tokens_per_second_per_gpu": 16754.37, "total_tokens": 5780971 }, { "epoch": 0.012985067172751335, "grad_norm": 0.78515625, "learning_rate": 1.2800000000000001e-05, "loss": 0.7236, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 65, "tokens_per_second_per_gpu": 16821.88, "total_tokens": 5864343 }, { "epoch": 0.01318483743694751, "grad_norm": 0.796875, "learning_rate": 1.3000000000000001e-05, "loss": 0.7203, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 66, "tokens_per_second_per_gpu": 17414.68, "total_tokens": 5950850 }, { "epoch": 0.013384607701143685, "grad_norm": 0.78515625, "learning_rate": 1.3200000000000002e-05, "loss": 0.7425, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 67, "tokens_per_second_per_gpu": 17312.44, "total_tokens": 6036301 }, { "epoch": 0.013584377965339858, "grad_norm": 0.75, "learning_rate": 1.3400000000000002e-05, "loss": 0.7071, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 68, "tokens_per_second_per_gpu": 18182.24, "total_tokens": 6126732 }, { "epoch": 0.013784148229536034, "grad_norm": 0.78515625, "learning_rate": 1.3600000000000002e-05, "loss": 0.6961, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 69, "tokens_per_second_per_gpu": 17064.71, "total_tokens": 6210299 }, { "epoch": 0.013983918493732208, "grad_norm": 0.76171875, "learning_rate": 1.38e-05, "loss": 0.739, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 70, "tokens_per_second_per_gpu": 19599.41, "total_tokens": 6305011 }, { "epoch": 0.014183688757928383, "grad_norm": 0.7578125, "learning_rate": 1.4e-05, "loss": 0.7451, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 71, "tokens_per_second_per_gpu": 17564.68, "total_tokens": 6392193 }, { "epoch": 0.014383459022124557, "grad_norm": 0.77734375, "learning_rate": 1.4200000000000001e-05, "loss": 0.7211, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 72, "tokens_per_second_per_gpu": 17038.95, "total_tokens": 6478117 }, { "epoch": 0.01458322928632073, "grad_norm": 0.7109375, "learning_rate": 1.4400000000000001e-05, "loss": 0.736, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 73, "tokens_per_second_per_gpu": 19603.37, "total_tokens": 6573453 }, { "epoch": 0.014782999550516906, "grad_norm": 0.74609375, "learning_rate": 1.46e-05, "loss": 0.7468, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 74, "tokens_per_second_per_gpu": 19574.77, "total_tokens": 6669304 }, { "epoch": 0.01498276981471308, "grad_norm": 0.73828125, "learning_rate": 1.48e-05, "loss": 0.7226, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 75, "tokens_per_second_per_gpu": 18206.4, "total_tokens": 6758301 }, { "epoch": 0.015182540078909254, "grad_norm": 0.74609375, "learning_rate": 1.5000000000000002e-05, "loss": 0.7005, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 76, "tokens_per_second_per_gpu": 17624.09, "total_tokens": 6845361 }, { "epoch": 0.01538231034310543, "grad_norm": 0.7890625, "learning_rate": 1.5200000000000002e-05, "loss": 0.7132, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 77, "tokens_per_second_per_gpu": 19094.66, "total_tokens": 6939316 }, { "epoch": 0.015582080607301603, "grad_norm": 0.71484375, "learning_rate": 1.54e-05, "loss": 0.7367, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 78, "tokens_per_second_per_gpu": 20579.31, "total_tokens": 7039667 }, { "epoch": 0.015781850871497777, "grad_norm": 0.75390625, "learning_rate": 1.5600000000000003e-05, "loss": 0.7241, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 79, "tokens_per_second_per_gpu": 18615.85, "total_tokens": 7130105 }, { "epoch": 0.01598162113569395, "grad_norm": 0.765625, "learning_rate": 1.58e-05, "loss": 0.7146, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 80, "tokens_per_second_per_gpu": 18876.03, "total_tokens": 7221634 }, { "epoch": 0.016181391399890128, "grad_norm": 0.73828125, "learning_rate": 1.6000000000000003e-05, "loss": 0.687, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 81, "tokens_per_second_per_gpu": 18742.21, "total_tokens": 7314475 }, { "epoch": 0.0163811616640863, "grad_norm": 0.734375, "learning_rate": 1.62e-05, "loss": 0.6846, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 82, "tokens_per_second_per_gpu": 18625.5, "total_tokens": 7404915 }, { "epoch": 0.016580931928282475, "grad_norm": 0.71484375, "learning_rate": 1.64e-05, "loss": 0.6552, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 83, "tokens_per_second_per_gpu": 19646.24, "total_tokens": 7500716 }, { "epoch": 0.01678070219247865, "grad_norm": 0.75, "learning_rate": 1.66e-05, "loss": 0.6898, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 84, "tokens_per_second_per_gpu": 18157.99, "total_tokens": 7591257 }, { "epoch": 0.016980472456674823, "grad_norm": 0.7890625, "learning_rate": 1.6800000000000002e-05, "loss": 0.6556, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 85, "tokens_per_second_per_gpu": 16299.95, "total_tokens": 7671631 }, { "epoch": 0.017180242720870997, "grad_norm": 0.734375, "learning_rate": 1.7e-05, "loss": 0.7308, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 86, "tokens_per_second_per_gpu": 19570.82, "total_tokens": 7766388 }, { "epoch": 0.017380012985067174, "grad_norm": 0.73828125, "learning_rate": 1.72e-05, "loss": 0.6462, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 87, "tokens_per_second_per_gpu": 18751.13, "total_tokens": 7858610 }, { "epoch": 0.017579783249263348, "grad_norm": 0.79296875, "learning_rate": 1.7400000000000003e-05, "loss": 0.707, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 88, "tokens_per_second_per_gpu": 19935.79, "total_tokens": 7953990 }, { "epoch": 0.01777955351345952, "grad_norm": 0.7734375, "learning_rate": 1.76e-05, "loss": 0.6655, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 89, "tokens_per_second_per_gpu": 17805.17, "total_tokens": 8041953 }, { "epoch": 0.017979323777655695, "grad_norm": 0.75390625, "learning_rate": 1.7800000000000002e-05, "loss": 0.7043, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 90, "tokens_per_second_per_gpu": 18686.85, "total_tokens": 8133623 }, { "epoch": 0.01817909404185187, "grad_norm": 0.7109375, "learning_rate": 1.8e-05, "loss": 0.6558, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 91, "tokens_per_second_per_gpu": 19017.24, "total_tokens": 8225616 }, { "epoch": 0.018378864306048046, "grad_norm": 0.76171875, "learning_rate": 1.8200000000000002e-05, "loss": 0.6747, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 92, "tokens_per_second_per_gpu": 19018.61, "total_tokens": 8317907 }, { "epoch": 0.01857863457024422, "grad_norm": 0.8125, "learning_rate": 1.8400000000000003e-05, "loss": 0.6396, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 93, "tokens_per_second_per_gpu": 16652.39, "total_tokens": 8400755 }, { "epoch": 0.018778404834440394, "grad_norm": 0.7265625, "learning_rate": 1.86e-05, "loss": 0.6564, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 94, "tokens_per_second_per_gpu": 20544.06, "total_tokens": 8498995 }, { "epoch": 0.018978175098636568, "grad_norm": 0.73828125, "learning_rate": 1.88e-05, "loss": 0.6344, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 95, "tokens_per_second_per_gpu": 18474.09, "total_tokens": 8588703 }, { "epoch": 0.01917794536283274, "grad_norm": 0.80078125, "learning_rate": 1.9e-05, "loss": 0.6396, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 96, "tokens_per_second_per_gpu": 17247.57, "total_tokens": 8672973 }, { "epoch": 0.019377715627028915, "grad_norm": 0.76953125, "learning_rate": 1.9200000000000003e-05, "loss": 0.6338, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 97, "tokens_per_second_per_gpu": 18226.98, "total_tokens": 8760894 }, { "epoch": 0.019577485891225092, "grad_norm": 0.73828125, "learning_rate": 1.94e-05, "loss": 0.593, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 98, "tokens_per_second_per_gpu": 17647.57, "total_tokens": 8848209 }, { "epoch": 0.019777256155421266, "grad_norm": 0.7578125, "learning_rate": 1.9600000000000002e-05, "loss": 0.6413, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 99, "tokens_per_second_per_gpu": 17897.86, "total_tokens": 8935716 }, { "epoch": 0.01997702641961744, "grad_norm": 0.7421875, "learning_rate": 1.98e-05, "loss": 0.6586, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 100, "tokens_per_second_per_gpu": 17561.44, "total_tokens": 9022769 }, { "epoch": 0.020176796683813614, "grad_norm": 0.734375, "learning_rate": 2e-05, "loss": 0.6223, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 101, "tokens_per_second_per_gpu": 19191.06, "total_tokens": 9117162 }, { "epoch": 0.020376566948009787, "grad_norm": 0.76171875, "learning_rate": 1.9999986330190926e-05, "loss": 0.6677, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 102, "tokens_per_second_per_gpu": 18980.93, "total_tokens": 9209783 }, { "epoch": 0.020576337212205965, "grad_norm": 0.828125, "learning_rate": 1.9999945320801072e-05, "loss": 0.6169, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 103, "tokens_per_second_per_gpu": 17383.64, "total_tokens": 9294875 }, { "epoch": 0.02077610747640214, "grad_norm": 0.74609375, "learning_rate": 1.9999876971942557e-05, "loss": 0.6845, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 104, "tokens_per_second_per_gpu": 19237.07, "total_tokens": 9388693 }, { "epoch": 0.020975877740598312, "grad_norm": 0.77734375, "learning_rate": 1.9999781283802247e-05, "loss": 0.5892, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 105, "tokens_per_second_per_gpu": 18754.06, "total_tokens": 9479728 }, { "epoch": 0.021175648004794486, "grad_norm": 0.7265625, "learning_rate": 1.9999658256641746e-05, "loss": 0.6118, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 106, "tokens_per_second_per_gpu": 19826.12, "total_tokens": 9575808 }, { "epoch": 0.02137541826899066, "grad_norm": 0.77734375, "learning_rate": 1.9999507890797408e-05, "loss": 0.6137, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 107, "tokens_per_second_per_gpu": 17785.72, "total_tokens": 9662301 }, { "epoch": 0.021575188533186834, "grad_norm": 0.7578125, "learning_rate": 1.999933018668033e-05, "loss": 0.6548, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 108, "tokens_per_second_per_gpu": 18852.68, "total_tokens": 9754531 }, { "epoch": 0.02177495879738301, "grad_norm": 0.80078125, "learning_rate": 1.999912514477634e-05, "loss": 0.5825, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 109, "tokens_per_second_per_gpu": 16761.61, "total_tokens": 9836019 }, { "epoch": 0.021974729061579185, "grad_norm": 0.77734375, "learning_rate": 1.9998892765646024e-05, "loss": 0.583, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 110, "tokens_per_second_per_gpu": 17573.08, "total_tokens": 9922022 }, { "epoch": 0.02217449932577536, "grad_norm": 0.75390625, "learning_rate": 1.9998633049924693e-05, "loss": 0.5982, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 111, "tokens_per_second_per_gpu": 17187.69, "total_tokens": 10006500 }, { "epoch": 0.022374269589971532, "grad_norm": 0.73828125, "learning_rate": 1.9998345998322397e-05, "loss": 0.6243, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 112, "tokens_per_second_per_gpu": 19734.71, "total_tokens": 10101597 }, { "epoch": 0.022574039854167706, "grad_norm": 0.81640625, "learning_rate": 1.999803161162393e-05, "loss": 0.5827, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 113, "tokens_per_second_per_gpu": 18512.19, "total_tokens": 10191595 }, { "epoch": 0.022773810118363883, "grad_norm": 0.73046875, "learning_rate": 1.999768989068881e-05, "loss": 0.6023, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 114, "tokens_per_second_per_gpu": 19205.86, "total_tokens": 10286847 }, { "epoch": 0.022973580382560057, "grad_norm": 0.78515625, "learning_rate": 1.999732083645129e-05, "loss": 0.5982, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 115, "tokens_per_second_per_gpu": 20817.88, "total_tokens": 10385941 }, { "epoch": 0.02317335064675623, "grad_norm": 0.7578125, "learning_rate": 1.999692444992035e-05, "loss": 0.58, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 116, "tokens_per_second_per_gpu": 17677.18, "total_tokens": 10475782 }, { "epoch": 0.023373120910952404, "grad_norm": 0.76171875, "learning_rate": 1.9996500732179695e-05, "loss": 0.6219, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 117, "tokens_per_second_per_gpu": 18722.8, "total_tokens": 10567203 }, { "epoch": 0.023572891175148578, "grad_norm": 0.77734375, "learning_rate": 1.999604968438775e-05, "loss": 0.6274, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 118, "tokens_per_second_per_gpu": 19547.27, "total_tokens": 10662969 }, { "epoch": 0.023772661439344752, "grad_norm": 0.80078125, "learning_rate": 1.999557130777767e-05, "loss": 0.6301, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 119, "tokens_per_second_per_gpu": 18747.21, "total_tokens": 10756150 }, { "epoch": 0.02397243170354093, "grad_norm": 0.75390625, "learning_rate": 1.9995065603657317e-05, "loss": 0.5914, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 120, "tokens_per_second_per_gpu": 17661.72, "total_tokens": 10844152 }, { "epoch": 0.024172201967737103, "grad_norm": 0.7890625, "learning_rate": 1.999453257340926e-05, "loss": 0.5804, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 121, "tokens_per_second_per_gpu": 16813.53, "total_tokens": 10927577 }, { "epoch": 0.024371972231933277, "grad_norm": 0.83984375, "learning_rate": 1.9993972218490792e-05, "loss": 0.5867, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 122, "tokens_per_second_per_gpu": 18331.11, "total_tokens": 11017683 }, { "epoch": 0.02457174249612945, "grad_norm": 0.78125, "learning_rate": 1.9993384540433892e-05, "loss": 0.5744, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 123, "tokens_per_second_per_gpu": 17821.87, "total_tokens": 11106561 }, { "epoch": 0.024771512760325624, "grad_norm": 0.78515625, "learning_rate": 1.999276954084526e-05, "loss": 0.5982, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 124, "tokens_per_second_per_gpu": 17769.5, "total_tokens": 11194195 }, { "epoch": 0.0249712830245218, "grad_norm": 0.8359375, "learning_rate": 1.9992127221406276e-05, "loss": 0.5615, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 125, "tokens_per_second_per_gpu": 18496.38, "total_tokens": 11283289 }, { "epoch": 0.025171053288717975, "grad_norm": 0.77734375, "learning_rate": 1.999145758387301e-05, "loss": 0.586, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 126, "tokens_per_second_per_gpu": 17185.75, "total_tokens": 11367142 }, { "epoch": 0.02537082355291415, "grad_norm": 0.76953125, "learning_rate": 1.9990760630076238e-05, "loss": 0.5811, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 127, "tokens_per_second_per_gpu": 17957.32, "total_tokens": 11455512 }, { "epoch": 0.025570593817110323, "grad_norm": 0.8046875, "learning_rate": 1.9990036361921402e-05, "loss": 0.5343, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 128, "tokens_per_second_per_gpu": 17543.18, "total_tokens": 11541449 }, { "epoch": 0.025770364081306497, "grad_norm": 0.8046875, "learning_rate": 1.9989284781388617e-05, "loss": 0.5921, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 129, "tokens_per_second_per_gpu": 19047.51, "total_tokens": 11635059 }, { "epoch": 0.02597013434550267, "grad_norm": 0.796875, "learning_rate": 1.998850589053268e-05, "loss": 0.57, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 130, "tokens_per_second_per_gpu": 17215.1, "total_tokens": 11719610 }, { "epoch": 0.026169904609698848, "grad_norm": 0.7265625, "learning_rate": 1.998769969148305e-05, "loss": 0.5655, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 131, "tokens_per_second_per_gpu": 19427.08, "total_tokens": 11814476 }, { "epoch": 0.02636967487389502, "grad_norm": 0.75, "learning_rate": 1.998686618644384e-05, "loss": 0.5963, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 132, "tokens_per_second_per_gpu": 20717.45, "total_tokens": 11915303 }, { "epoch": 0.026569445138091195, "grad_norm": 0.78515625, "learning_rate": 1.9986005377693826e-05, "loss": 0.5657, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 133, "tokens_per_second_per_gpu": 17670.14, "total_tokens": 12001866 }, { "epoch": 0.02676921540228737, "grad_norm": 0.80859375, "learning_rate": 1.9985117267586425e-05, "loss": 0.5564, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 134, "tokens_per_second_per_gpu": 16572.72, "total_tokens": 12084140 }, { "epoch": 0.026968985666483543, "grad_norm": 0.73828125, "learning_rate": 1.9984201858549695e-05, "loss": 0.5899, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 135, "tokens_per_second_per_gpu": 20121.57, "total_tokens": 12181918 }, { "epoch": 0.027168755930679717, "grad_norm": 0.7734375, "learning_rate": 1.9983259153086328e-05, "loss": 0.6035, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 136, "tokens_per_second_per_gpu": 19107.52, "total_tokens": 12274774 }, { "epoch": 0.027368526194875894, "grad_norm": 0.765625, "learning_rate": 1.9982289153773648e-05, "loss": 0.6114, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 137, "tokens_per_second_per_gpu": 19383.78, "total_tokens": 12369086 }, { "epoch": 0.027568296459072068, "grad_norm": 0.7578125, "learning_rate": 1.9981291863263593e-05, "loss": 0.5384, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 138, "tokens_per_second_per_gpu": 18735.75, "total_tokens": 12459681 }, { "epoch": 0.02776806672326824, "grad_norm": 0.703125, "learning_rate": 1.9980267284282718e-05, "loss": 0.5689, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 139, "tokens_per_second_per_gpu": 18553.72, "total_tokens": 12550215 }, { "epoch": 0.027967836987464415, "grad_norm": 0.73828125, "learning_rate": 1.997921541963218e-05, "loss": 0.5829, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 140, "tokens_per_second_per_gpu": 20713.08, "total_tokens": 12650418 }, { "epoch": 0.02816760725166059, "grad_norm": 0.7421875, "learning_rate": 1.9978136272187745e-05, "loss": 0.5724, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 141, "tokens_per_second_per_gpu": 19243.32, "total_tokens": 12744486 }, { "epoch": 0.028367377515856766, "grad_norm": 0.79296875, "learning_rate": 1.9977029844899757e-05, "loss": 0.6022, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 142, "tokens_per_second_per_gpu": 20122.13, "total_tokens": 12842353 }, { "epoch": 0.02856714778005294, "grad_norm": 0.76171875, "learning_rate": 1.9975896140793144e-05, "loss": 0.537, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 143, "tokens_per_second_per_gpu": 18211.8, "total_tokens": 12930372 }, { "epoch": 0.028766918044249114, "grad_norm": 0.7578125, "learning_rate": 1.997473516296741e-05, "loss": 0.5558, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 144, "tokens_per_second_per_gpu": 18313.62, "total_tokens": 13021241 }, { "epoch": 0.028966688308445288, "grad_norm": 0.78125, "learning_rate": 1.9973546914596622e-05, "loss": 0.5592, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 145, "tokens_per_second_per_gpu": 17905.13, "total_tokens": 13109482 }, { "epoch": 0.02916645857264146, "grad_norm": 0.76171875, "learning_rate": 1.997233139892941e-05, "loss": 0.5805, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 146, "tokens_per_second_per_gpu": 18622.61, "total_tokens": 13201391 }, { "epoch": 0.029366228836837635, "grad_norm": 1.15625, "learning_rate": 1.997108861928895e-05, "loss": 0.5857, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 147, "tokens_per_second_per_gpu": 18686.08, "total_tokens": 13293892 }, { "epoch": 0.029565999101033812, "grad_norm": 0.75, "learning_rate": 1.9969818579072945e-05, "loss": 0.5786, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 148, "tokens_per_second_per_gpu": 20557.26, "total_tokens": 13393443 }, { "epoch": 0.029765769365229986, "grad_norm": 0.76953125, "learning_rate": 1.9968521281753642e-05, "loss": 0.5749, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 149, "tokens_per_second_per_gpu": 19278.4, "total_tokens": 13486462 }, { "epoch": 0.02996553962942616, "grad_norm": 0.75, "learning_rate": 1.9967196730877805e-05, "loss": 0.5692, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 150, "tokens_per_second_per_gpu": 18959.54, "total_tokens": 13579070 }, { "epoch": 0.030165309893622334, "grad_norm": 0.76171875, "learning_rate": 1.99658449300667e-05, "loss": 0.559, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 151, "tokens_per_second_per_gpu": 18694.89, "total_tokens": 13670237 }, { "epoch": 0.030365080157818507, "grad_norm": 0.76953125, "learning_rate": 1.99644658830161e-05, "loss": 0.5599, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 152, "tokens_per_second_per_gpu": 18732.63, "total_tokens": 13762208 }, { "epoch": 0.030564850422014685, "grad_norm": 0.71875, "learning_rate": 1.996305959349627e-05, "loss": 0.5453, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 153, "tokens_per_second_per_gpu": 18334.7, "total_tokens": 13852296 }, { "epoch": 0.03076462068621086, "grad_norm": 0.76953125, "learning_rate": 1.996162606535195e-05, "loss": 0.5419, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 154, "tokens_per_second_per_gpu": 18688.64, "total_tokens": 13944542 }, { "epoch": 0.030964390950407032, "grad_norm": 0.73828125, "learning_rate": 1.996016530250235e-05, "loss": 0.512, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 155, "tokens_per_second_per_gpu": 18537.35, "total_tokens": 14036025 }, { "epoch": 0.031164161214603206, "grad_norm": 0.765625, "learning_rate": 1.995867730894114e-05, "loss": 0.5891, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 156, "tokens_per_second_per_gpu": 19367.41, "total_tokens": 14129766 }, { "epoch": 0.03136393147879938, "grad_norm": 0.734375, "learning_rate": 1.995716208873644e-05, "loss": 0.5023, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 157, "tokens_per_second_per_gpu": 17986.75, "total_tokens": 14218809 }, { "epoch": 0.031563701742995554, "grad_norm": 0.80859375, "learning_rate": 1.99556196460308e-05, "loss": 0.5582, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 158, "tokens_per_second_per_gpu": 18289.61, "total_tokens": 14308512 }, { "epoch": 0.03176347200719173, "grad_norm": 0.73828125, "learning_rate": 1.9954049985041208e-05, "loss": 0.5602, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 159, "tokens_per_second_per_gpu": 19095.73, "total_tokens": 14402261 }, { "epoch": 0.0319632422713879, "grad_norm": 0.79296875, "learning_rate": 1.9952453110059044e-05, "loss": 0.53, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 160, "tokens_per_second_per_gpu": 17428.99, "total_tokens": 14488127 }, { "epoch": 0.032163012535584075, "grad_norm": 0.78125, "learning_rate": 1.9950829025450116e-05, "loss": 0.5618, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 161, "tokens_per_second_per_gpu": 18766.0, "total_tokens": 14579841 }, { "epoch": 0.032362782799780256, "grad_norm": 0.79296875, "learning_rate": 1.9949177735654602e-05, "loss": 0.541, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 162, "tokens_per_second_per_gpu": 17468.83, "total_tokens": 14665490 }, { "epoch": 0.03256255306397643, "grad_norm": 0.953125, "learning_rate": 1.994749924518707e-05, "loss": 0.5562, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 163, "tokens_per_second_per_gpu": 17050.48, "total_tokens": 14750657 }, { "epoch": 0.0327623233281726, "grad_norm": 0.734375, "learning_rate": 1.994579355863644e-05, "loss": 0.5622, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 164, "tokens_per_second_per_gpu": 19576.0, "total_tokens": 14843795 }, { "epoch": 0.03296209359236878, "grad_norm": 0.75390625, "learning_rate": 1.9944060680666e-05, "loss": 0.5341, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 165, "tokens_per_second_per_gpu": 18987.33, "total_tokens": 14935021 }, { "epoch": 0.03316186385656495, "grad_norm": 0.7578125, "learning_rate": 1.9942300616013378e-05, "loss": 0.5778, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 166, "tokens_per_second_per_gpu": 19928.3, "total_tokens": 15031594 }, { "epoch": 0.033361634120761124, "grad_norm": 0.72265625, "learning_rate": 1.9940513369490516e-05, "loss": 0.516, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 167, "tokens_per_second_per_gpu": 17935.25, "total_tokens": 15120321 }, { "epoch": 0.0335614043849573, "grad_norm": 0.87890625, "learning_rate": 1.9938698945983676e-05, "loss": 0.5185, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 168, "tokens_per_second_per_gpu": 17234.01, "total_tokens": 15204132 }, { "epoch": 0.03376117464915347, "grad_norm": 0.76953125, "learning_rate": 1.993685735045343e-05, "loss": 0.5386, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 169, "tokens_per_second_per_gpu": 17444.21, "total_tokens": 15290200 }, { "epoch": 0.033960944913349646, "grad_norm": 0.7421875, "learning_rate": 1.9934988587934624e-05, "loss": 0.5248, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 170, "tokens_per_second_per_gpu": 18833.13, "total_tokens": 15383316 }, { "epoch": 0.03416071517754582, "grad_norm": 0.74609375, "learning_rate": 1.9933092663536384e-05, "loss": 0.4718, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 171, "tokens_per_second_per_gpu": 17169.59, "total_tokens": 15468208 }, { "epoch": 0.03436048544174199, "grad_norm": 0.77734375, "learning_rate": 1.9931169582442096e-05, "loss": 0.5478, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 172, "tokens_per_second_per_gpu": 19532.52, "total_tokens": 15564114 }, { "epoch": 0.034560255705938174, "grad_norm": 0.71484375, "learning_rate": 1.9929219349909393e-05, "loss": 0.5404, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 173, "tokens_per_second_per_gpu": 19204.82, "total_tokens": 15657417 }, { "epoch": 0.03476002597013435, "grad_norm": 0.73828125, "learning_rate": 1.992724197127013e-05, "loss": 0.5047, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 174, "tokens_per_second_per_gpu": 18003.06, "total_tokens": 15745533 }, { "epoch": 0.03495979623433052, "grad_norm": 0.76171875, "learning_rate": 1.9925237451930392e-05, "loss": 0.5294, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 175, "tokens_per_second_per_gpu": 18119.65, "total_tokens": 15835918 }, { "epoch": 0.035159566498526695, "grad_norm": 0.79296875, "learning_rate": 1.992320579737045e-05, "loss": 0.5178, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 176, "tokens_per_second_per_gpu": 18794.6, "total_tokens": 15927874 }, { "epoch": 0.03535933676272287, "grad_norm": 0.70703125, "learning_rate": 1.9921147013144782e-05, "loss": 0.531, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 177, "tokens_per_second_per_gpu": 19276.65, "total_tokens": 16023301 }, { "epoch": 0.03555910702691904, "grad_norm": 0.78125, "learning_rate": 1.9919061104882012e-05, "loss": 0.5326, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 178, "tokens_per_second_per_gpu": 16154.49, "total_tokens": 16102167 }, { "epoch": 0.03575887729111522, "grad_norm": 0.75390625, "learning_rate": 1.991694807828494e-05, "loss": 0.5307, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 179, "tokens_per_second_per_gpu": 19095.35, "total_tokens": 16194773 }, { "epoch": 0.03595864755531139, "grad_norm": 0.76953125, "learning_rate": 1.99148079391305e-05, "loss": 0.5018, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 180, "tokens_per_second_per_gpu": 18667.88, "total_tokens": 16286759 }, { "epoch": 0.036158417819507564, "grad_norm": 0.7578125, "learning_rate": 1.9912640693269754e-05, "loss": 0.5255, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 181, "tokens_per_second_per_gpu": 18595.09, "total_tokens": 16378176 }, { "epoch": 0.03635818808370374, "grad_norm": 0.71875, "learning_rate": 1.991044634662786e-05, "loss": 0.5391, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 182, "tokens_per_second_per_gpu": 19169.52, "total_tokens": 16472899 }, { "epoch": 0.03655795834789991, "grad_norm": 0.7421875, "learning_rate": 1.990822490520409e-05, "loss": 0.5133, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 183, "tokens_per_second_per_gpu": 17061.43, "total_tokens": 16556259 }, { "epoch": 0.03675772861209609, "grad_norm": 0.76953125, "learning_rate": 1.9905976375071773e-05, "loss": 0.5079, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 184, "tokens_per_second_per_gpu": 18900.1, "total_tokens": 16649863 }, { "epoch": 0.036957498876292266, "grad_norm": 0.78515625, "learning_rate": 1.9903700762378303e-05, "loss": 0.5118, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 185, "tokens_per_second_per_gpu": 17944.8, "total_tokens": 16738176 }, { "epoch": 0.03715726914048844, "grad_norm": 0.73046875, "learning_rate": 1.990139807334512e-05, "loss": 0.5161, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 186, "tokens_per_second_per_gpu": 19093.54, "total_tokens": 16830975 }, { "epoch": 0.037357039404684614, "grad_norm": 0.75390625, "learning_rate": 1.989906831426769e-05, "loss": 0.4813, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 187, "tokens_per_second_per_gpu": 16983.73, "total_tokens": 16915897 }, { "epoch": 0.03755680966888079, "grad_norm": 0.82421875, "learning_rate": 1.989671149151548e-05, "loss": 0.4745, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 188, "tokens_per_second_per_gpu": 16127.77, "total_tokens": 16995210 }, { "epoch": 0.03775657993307696, "grad_norm": 0.79296875, "learning_rate": 1.989432761153196e-05, "loss": 0.5425, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 189, "tokens_per_second_per_gpu": 19580.59, "total_tokens": 17089299 }, { "epoch": 0.037956350197273135, "grad_norm": 0.74609375, "learning_rate": 1.9891916680834565e-05, "loss": 0.5239, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 190, "tokens_per_second_per_gpu": 19684.82, "total_tokens": 17183281 }, { "epoch": 0.03815612046146931, "grad_norm": 0.75, "learning_rate": 1.9889478706014687e-05, "loss": 0.5077, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 191, "tokens_per_second_per_gpu": 18583.5, "total_tokens": 17273403 }, { "epoch": 0.03835589072566548, "grad_norm": 0.80078125, "learning_rate": 1.9887013693737653e-05, "loss": 0.518, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 192, "tokens_per_second_per_gpu": 16473.81, "total_tokens": 17353898 }, { "epoch": 0.038555660989861656, "grad_norm": 0.734375, "learning_rate": 1.9884521650742718e-05, "loss": 0.5316, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 193, "tokens_per_second_per_gpu": 20766.07, "total_tokens": 17454159 }, { "epoch": 0.03875543125405783, "grad_norm": 0.8125, "learning_rate": 1.9882002583843025e-05, "loss": 0.5092, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 194, "tokens_per_second_per_gpu": 18137.45, "total_tokens": 17542740 }, { "epoch": 0.03895520151825401, "grad_norm": 0.80078125, "learning_rate": 1.9879456499925616e-05, "loss": 0.5313, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 195, "tokens_per_second_per_gpu": 17163.27, "total_tokens": 17626349 }, { "epoch": 0.039154971782450185, "grad_norm": 0.74609375, "learning_rate": 1.9876883405951378e-05, "loss": 0.5259, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 196, "tokens_per_second_per_gpu": 18303.77, "total_tokens": 17715930 }, { "epoch": 0.03935474204664636, "grad_norm": 0.77734375, "learning_rate": 1.9874283308955058e-05, "loss": 0.545, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 197, "tokens_per_second_per_gpu": 18807.98, "total_tokens": 17807788 }, { "epoch": 0.03955451231084253, "grad_norm": 0.78125, "learning_rate": 1.987165621604522e-05, "loss": 0.5163, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 198, "tokens_per_second_per_gpu": 17359.32, "total_tokens": 17892790 }, { "epoch": 0.039754282575038706, "grad_norm": 0.7890625, "learning_rate": 1.9869002134404235e-05, "loss": 0.5076, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 199, "tokens_per_second_per_gpu": 17503.69, "total_tokens": 17977266 }, { "epoch": 0.03995405283923488, "grad_norm": 0.79296875, "learning_rate": 1.9866321071288262e-05, "loss": 0.5306, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 200, "tokens_per_second_per_gpu": 18864.02, "total_tokens": 18068913 }, { "epoch": 0.040153823103431054, "grad_norm": 0.75, "learning_rate": 1.9863613034027224e-05, "loss": 0.5142, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 201, "tokens_per_second_per_gpu": 17886.53, "total_tokens": 18155666 }, { "epoch": 0.04035359336762723, "grad_norm": 0.734375, "learning_rate": 1.9860878030024792e-05, "loss": 0.4774, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 202, "tokens_per_second_per_gpu": 18049.28, "total_tokens": 18244991 }, { "epoch": 0.0405533636318234, "grad_norm": 0.73828125, "learning_rate": 1.9858116066758362e-05, "loss": 0.5113, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 203, "tokens_per_second_per_gpu": 18297.54, "total_tokens": 18334899 }, { "epoch": 0.040753133896019575, "grad_norm": 0.765625, "learning_rate": 1.985532715177904e-05, "loss": 0.5054, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 204, "tokens_per_second_per_gpu": 18687.22, "total_tokens": 18426521 }, { "epoch": 0.04095290416021575, "grad_norm": 0.7578125, "learning_rate": 1.985251129271161e-05, "loss": 0.5321, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 205, "tokens_per_second_per_gpu": 19813.2, "total_tokens": 18523782 }, { "epoch": 0.04115267442441193, "grad_norm": 0.7734375, "learning_rate": 1.984966849725452e-05, "loss": 0.5167, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 206, "tokens_per_second_per_gpu": 18315.05, "total_tokens": 18613362 }, { "epoch": 0.0413524446886081, "grad_norm": 0.7265625, "learning_rate": 1.9846798773179866e-05, "loss": 0.505, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 207, "tokens_per_second_per_gpu": 18236.78, "total_tokens": 18703756 }, { "epoch": 0.04155221495280428, "grad_norm": 0.76953125, "learning_rate": 1.984390212833337e-05, "loss": 0.4877, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 208, "tokens_per_second_per_gpu": 16810.04, "total_tokens": 18786807 }, { "epoch": 0.04175198521700045, "grad_norm": 0.75390625, "learning_rate": 1.9840978570634338e-05, "loss": 0.5121, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 209, "tokens_per_second_per_gpu": 18951.32, "total_tokens": 18878778 }, { "epoch": 0.041951755481196625, "grad_norm": 0.7109375, "learning_rate": 1.9838028108075673e-05, "loss": 0.5328, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 210, "tokens_per_second_per_gpu": 19385.0, "total_tokens": 18972299 }, { "epoch": 0.0421515257453928, "grad_norm": 0.734375, "learning_rate": 1.9835050748723826e-05, "loss": 0.5102, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 211, "tokens_per_second_per_gpu": 19441.08, "total_tokens": 19066992 }, { "epoch": 0.04235129600958897, "grad_norm": 0.73828125, "learning_rate": 1.9832046500718782e-05, "loss": 0.5337, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 212, "tokens_per_second_per_gpu": 19633.32, "total_tokens": 19161635 }, { "epoch": 0.042551066273785146, "grad_norm": 0.75390625, "learning_rate": 1.982901537227404e-05, "loss": 0.5345, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 213, "tokens_per_second_per_gpu": 19816.74, "total_tokens": 19257403 }, { "epoch": 0.04275083653798132, "grad_norm": 0.8046875, "learning_rate": 1.982595737167659e-05, "loss": 0.4904, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 214, "tokens_per_second_per_gpu": 17158.18, "total_tokens": 19340967 }, { "epoch": 0.04295060680217749, "grad_norm": 0.76171875, "learning_rate": 1.982287250728689e-05, "loss": 0.5192, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 215, "tokens_per_second_per_gpu": 19970.95, "total_tokens": 19437852 }, { "epoch": 0.04315037706637367, "grad_norm": 0.71875, "learning_rate": 1.981976078753884e-05, "loss": 0.5115, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 216, "tokens_per_second_per_gpu": 18294.72, "total_tokens": 19529326 }, { "epoch": 0.04335014733056985, "grad_norm": 0.7734375, "learning_rate": 1.9816622220939762e-05, "loss": 0.5465, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 217, "tokens_per_second_per_gpu": 18747.69, "total_tokens": 19621920 }, { "epoch": 0.04354991759476602, "grad_norm": 0.7734375, "learning_rate": 1.981345681607038e-05, "loss": 0.465, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 218, "tokens_per_second_per_gpu": 17541.5, "total_tokens": 19709675 }, { "epoch": 0.043749687858962195, "grad_norm": 0.765625, "learning_rate": 1.981026458158479e-05, "loss": 0.475, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 219, "tokens_per_second_per_gpu": 17165.51, "total_tokens": 19794275 }, { "epoch": 0.04394945812315837, "grad_norm": 0.72265625, "learning_rate": 1.9807045526210435e-05, "loss": 0.498, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 220, "tokens_per_second_per_gpu": 18983.04, "total_tokens": 19887636 }, { "epoch": 0.04414922838735454, "grad_norm": 0.78125, "learning_rate": 1.9803799658748096e-05, "loss": 0.488, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 221, "tokens_per_second_per_gpu": 17399.45, "total_tokens": 19972837 }, { "epoch": 0.04434899865155072, "grad_norm": 0.8125, "learning_rate": 1.9800526988071843e-05, "loss": 0.476, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 222, "tokens_per_second_per_gpu": 17239.56, "total_tokens": 20059232 }, { "epoch": 0.04454876891574689, "grad_norm": 0.76171875, "learning_rate": 1.979722752312904e-05, "loss": 0.5296, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 223, "tokens_per_second_per_gpu": 18827.38, "total_tokens": 20150727 }, { "epoch": 0.044748539179943064, "grad_norm": 0.7734375, "learning_rate": 1.9793901272940294e-05, "loss": 0.5141, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 224, "tokens_per_second_per_gpu": 18795.23, "total_tokens": 20241670 }, { "epoch": 0.04494830944413924, "grad_norm": 0.6875, "learning_rate": 1.9790548246599447e-05, "loss": 0.4856, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 225, "tokens_per_second_per_gpu": 19141.01, "total_tokens": 20335291 }, { "epoch": 0.04514807970833541, "grad_norm": 0.7421875, "learning_rate": 1.9787168453273546e-05, "loss": 0.5215, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 226, "tokens_per_second_per_gpu": 19759.82, "total_tokens": 20430693 }, { "epoch": 0.045347849972531586, "grad_norm": 0.92578125, "learning_rate": 1.9783761902202814e-05, "loss": 0.4853, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 227, "tokens_per_second_per_gpu": 19021.35, "total_tokens": 20523444 }, { "epoch": 0.045547620236727766, "grad_norm": 0.73046875, "learning_rate": 1.9780328602700636e-05, "loss": 0.4735, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 228, "tokens_per_second_per_gpu": 18011.42, "total_tokens": 20611507 }, { "epoch": 0.04574739050092394, "grad_norm": 0.70703125, "learning_rate": 1.9776868564153517e-05, "loss": 0.4907, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 229, "tokens_per_second_per_gpu": 18742.74, "total_tokens": 20702133 }, { "epoch": 0.045947160765120114, "grad_norm": 0.828125, "learning_rate": 1.9773381796021073e-05, "loss": 0.4906, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 230, "tokens_per_second_per_gpu": 18136.86, "total_tokens": 20790822 }, { "epoch": 0.04614693102931629, "grad_norm": 0.734375, "learning_rate": 1.9769868307835996e-05, "loss": 0.4978, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 231, "tokens_per_second_per_gpu": 19228.87, "total_tokens": 20883986 }, { "epoch": 0.04634670129351246, "grad_norm": 0.81640625, "learning_rate": 1.9766328109204025e-05, "loss": 0.5066, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 232, "tokens_per_second_per_gpu": 19023.95, "total_tokens": 20975561 }, { "epoch": 0.046546471557708635, "grad_norm": 0.75390625, "learning_rate": 1.976276120980393e-05, "loss": 0.4852, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 233, "tokens_per_second_per_gpu": 18056.42, "total_tokens": 21064452 }, { "epoch": 0.04674624182190481, "grad_norm": 0.74609375, "learning_rate": 1.9759167619387474e-05, "loss": 0.4973, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 234, "tokens_per_second_per_gpu": 18686.51, "total_tokens": 21154512 }, { "epoch": 0.04694601208610098, "grad_norm": 0.73828125, "learning_rate": 1.9755547347779405e-05, "loss": 0.4683, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 235, "tokens_per_second_per_gpu": 17307.81, "total_tokens": 21240442 }, { "epoch": 0.047145782350297157, "grad_norm": 0.7734375, "learning_rate": 1.97519004048774e-05, "loss": 0.5236, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 236, "tokens_per_second_per_gpu": 19634.84, "total_tokens": 21334376 }, { "epoch": 0.04734555261449333, "grad_norm": 0.73828125, "learning_rate": 1.9748226800652062e-05, "loss": 0.4865, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 237, "tokens_per_second_per_gpu": 19229.6, "total_tokens": 21428429 }, { "epoch": 0.047545322878689504, "grad_norm": 0.8046875, "learning_rate": 1.9744526545146886e-05, "loss": 0.458, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 238, "tokens_per_second_per_gpu": 17981.99, "total_tokens": 21516053 }, { "epoch": 0.047745093142885685, "grad_norm": 0.74609375, "learning_rate": 1.9740799648478233e-05, "loss": 0.5112, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 239, "tokens_per_second_per_gpu": 18306.99, "total_tokens": 21606119 }, { "epoch": 0.04794486340708186, "grad_norm": 0.73828125, "learning_rate": 1.973704612083529e-05, "loss": 0.4657, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 240, "tokens_per_second_per_gpu": 17214.23, "total_tokens": 21690429 }, { "epoch": 0.04814463367127803, "grad_norm": 0.7421875, "learning_rate": 1.973326597248006e-05, "loss": 0.5272, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 241, "tokens_per_second_per_gpu": 19522.27, "total_tokens": 21784804 }, { "epoch": 0.048344403935474206, "grad_norm": 0.75, "learning_rate": 1.9729459213747327e-05, "loss": 0.4966, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 242, "tokens_per_second_per_gpu": 20243.38, "total_tokens": 21880113 }, { "epoch": 0.04854417419967038, "grad_norm": 0.75390625, "learning_rate": 1.972562585504462e-05, "loss": 0.4884, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 243, "tokens_per_second_per_gpu": 18001.03, "total_tokens": 21967561 }, { "epoch": 0.048743944463866554, "grad_norm": 0.765625, "learning_rate": 1.97217659068522e-05, "loss": 0.5018, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 244, "tokens_per_second_per_gpu": 18874.06, "total_tokens": 22058505 }, { "epoch": 0.04894371472806273, "grad_norm": 0.7734375, "learning_rate": 1.9717879379723012e-05, "loss": 0.5038, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 245, "tokens_per_second_per_gpu": 19849.72, "total_tokens": 22153686 }, { "epoch": 0.0491434849922589, "grad_norm": 0.75, "learning_rate": 1.9713966284282677e-05, "loss": 0.5032, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 246, "tokens_per_second_per_gpu": 17735.37, "total_tokens": 22240331 }, { "epoch": 0.049343255256455075, "grad_norm": 0.74609375, "learning_rate": 1.971002663122945e-05, "loss": 0.4723, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 247, "tokens_per_second_per_gpu": 18622.38, "total_tokens": 22332531 }, { "epoch": 0.04954302552065125, "grad_norm": 0.80859375, "learning_rate": 1.970606043133419e-05, "loss": 0.5114, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 248, "tokens_per_second_per_gpu": 18968.68, "total_tokens": 22424618 }, { "epoch": 0.04974279578484742, "grad_norm": 0.74609375, "learning_rate": 1.9702067695440333e-05, "loss": 0.4947, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 249, "tokens_per_second_per_gpu": 18936.57, "total_tokens": 22516368 }, { "epoch": 0.0499425660490436, "grad_norm": 0.78125, "learning_rate": 1.969804843446387e-05, "loss": 0.4674, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 250, "tokens_per_second_per_gpu": 16634.25, "total_tokens": 22598669 }, { "epoch": 0.05014233631323978, "grad_norm": 0.72265625, "learning_rate": 1.9694002659393306e-05, "loss": 0.4766, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 251, "tokens_per_second_per_gpu": 19637.52, "total_tokens": 22694880 }, { "epoch": 0.05034210657743595, "grad_norm": 0.7578125, "learning_rate": 1.9689930381289636e-05, "loss": 0.4639, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 252, "tokens_per_second_per_gpu": 17429.5, "total_tokens": 22780599 }, { "epoch": 0.050541876841632125, "grad_norm": 0.7421875, "learning_rate": 1.9685831611286312e-05, "loss": 0.4883, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 253, "tokens_per_second_per_gpu": 19660.74, "total_tokens": 22875342 }, { "epoch": 0.0507416471058283, "grad_norm": 0.77734375, "learning_rate": 1.9681706360589218e-05, "loss": 0.4952, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 254, "tokens_per_second_per_gpu": 18098.56, "total_tokens": 22963103 }, { "epoch": 0.05094141737002447, "grad_norm": 0.78125, "learning_rate": 1.9677554640476625e-05, "loss": 0.4999, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 255, "tokens_per_second_per_gpu": 18945.16, "total_tokens": 23055166 }, { "epoch": 0.051141187634220646, "grad_norm": 0.76171875, "learning_rate": 1.9673376462299186e-05, "loss": 0.4749, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 256, "tokens_per_second_per_gpu": 17030.26, "total_tokens": 23138552 }, { "epoch": 0.05134095789841682, "grad_norm": 0.7578125, "learning_rate": 1.966917183747987e-05, "loss": 0.5124, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 257, "tokens_per_second_per_gpu": 19023.64, "total_tokens": 23231758 }, { "epoch": 0.05154072816261299, "grad_norm": 0.7578125, "learning_rate": 1.9664940777513973e-05, "loss": 0.5046, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 258, "tokens_per_second_per_gpu": 20036.35, "total_tokens": 23327833 }, { "epoch": 0.05174049842680917, "grad_norm": 0.71875, "learning_rate": 1.9660683293969042e-05, "loss": 0.4855, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 259, "tokens_per_second_per_gpu": 19402.85, "total_tokens": 23420039 }, { "epoch": 0.05194026869100534, "grad_norm": 0.8046875, "learning_rate": 1.965639939848488e-05, "loss": 0.4981, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 260, "tokens_per_second_per_gpu": 18497.03, "total_tokens": 23509432 }, { "epoch": 0.05214003895520152, "grad_norm": 0.76953125, "learning_rate": 1.9652089102773487e-05, "loss": 0.5133, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 261, "tokens_per_second_per_gpu": 18415.12, "total_tokens": 23598540 }, { "epoch": 0.052339809219397695, "grad_norm": 0.77734375, "learning_rate": 1.9647752418619055e-05, "loss": 0.4729, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 262, "tokens_per_second_per_gpu": 18349.6, "total_tokens": 23686989 }, { "epoch": 0.05253957948359387, "grad_norm": 0.76171875, "learning_rate": 1.9643389357877907e-05, "loss": 0.4796, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 263, "tokens_per_second_per_gpu": 18309.69, "total_tokens": 23776963 }, { "epoch": 0.05273934974779004, "grad_norm": 0.80078125, "learning_rate": 1.9638999932478487e-05, "loss": 0.5012, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 264, "tokens_per_second_per_gpu": 18802.69, "total_tokens": 23869316 }, { "epoch": 0.05293912001198622, "grad_norm": 0.75390625, "learning_rate": 1.9634584154421316e-05, "loss": 0.4562, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 265, "tokens_per_second_per_gpu": 17157.57, "total_tokens": 23954773 }, { "epoch": 0.05313889027618239, "grad_norm": 0.76171875, "learning_rate": 1.963014203577896e-05, "loss": 0.4774, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 266, "tokens_per_second_per_gpu": 18691.75, "total_tokens": 24045859 }, { "epoch": 0.053338660540378564, "grad_norm": 0.75390625, "learning_rate": 1.962567358869601e-05, "loss": 0.4978, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 267, "tokens_per_second_per_gpu": 19469.37, "total_tokens": 24139870 }, { "epoch": 0.05353843080457474, "grad_norm": 0.75390625, "learning_rate": 1.962117882538902e-05, "loss": 0.5154, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 268, "tokens_per_second_per_gpu": 20145.18, "total_tokens": 24236114 }, { "epoch": 0.05373820106877091, "grad_norm": 0.72265625, "learning_rate": 1.9616657758146503e-05, "loss": 0.4689, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 269, "tokens_per_second_per_gpu": 18774.71, "total_tokens": 24327150 }, { "epoch": 0.053937971332967086, "grad_norm": 0.7421875, "learning_rate": 1.961211039932889e-05, "loss": 0.423, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 270, "tokens_per_second_per_gpu": 17083.67, "total_tokens": 24410190 }, { "epoch": 0.05413774159716326, "grad_norm": 0.79296875, "learning_rate": 1.9607536761368484e-05, "loss": 0.4979, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 271, "tokens_per_second_per_gpu": 19270.86, "total_tokens": 24502320 }, { "epoch": 0.05433751186135943, "grad_norm": 2.65625, "learning_rate": 1.9602936856769432e-05, "loss": 0.4812, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 272, "tokens_per_second_per_gpu": 17507.88, "total_tokens": 24587955 }, { "epoch": 0.054537282125555614, "grad_norm": 0.76953125, "learning_rate": 1.95983106981077e-05, "loss": 0.4809, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 273, "tokens_per_second_per_gpu": 19901.39, "total_tokens": 24684174 }, { "epoch": 0.05473705238975179, "grad_norm": 0.734375, "learning_rate": 1.9593658298031033e-05, "loss": 0.4715, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 274, "tokens_per_second_per_gpu": 18903.68, "total_tokens": 24777474 }, { "epoch": 0.05493682265394796, "grad_norm": 0.734375, "learning_rate": 1.9588979669258913e-05, "loss": 0.4942, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 275, "tokens_per_second_per_gpu": 20187.45, "total_tokens": 24876158 }, { "epoch": 0.055136592918144135, "grad_norm": 0.73046875, "learning_rate": 1.958427482458253e-05, "loss": 0.483, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 276, "tokens_per_second_per_gpu": 19364.38, "total_tokens": 24970279 }, { "epoch": 0.05533636318234031, "grad_norm": 0.7109375, "learning_rate": 1.957954377686475e-05, "loss": 0.456, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 277, "tokens_per_second_per_gpu": 18886.2, "total_tokens": 25062533 }, { "epoch": 0.05553613344653648, "grad_norm": 0.7578125, "learning_rate": 1.9574786539040078e-05, "loss": 0.4631, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 278, "tokens_per_second_per_gpu": 17547.39, "total_tokens": 25147946 }, { "epoch": 0.05573590371073266, "grad_norm": 0.73046875, "learning_rate": 1.9570003124114622e-05, "loss": 0.4726, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 279, "tokens_per_second_per_gpu": 19175.27, "total_tokens": 25242866 }, { "epoch": 0.05593567397492883, "grad_norm": 0.75390625, "learning_rate": 1.9565193545166052e-05, "loss": 0.4513, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 280, "tokens_per_second_per_gpu": 17616.94, "total_tokens": 25327149 }, { "epoch": 0.056135444239125004, "grad_norm": 0.7265625, "learning_rate": 1.9560357815343577e-05, "loss": 0.4831, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 281, "tokens_per_second_per_gpu": 18642.59, "total_tokens": 25417750 }, { "epoch": 0.05633521450332118, "grad_norm": 2.4375, "learning_rate": 1.95554959478679e-05, "loss": 0.4508, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 282, "tokens_per_second_per_gpu": 17213.13, "total_tokens": 25501577 }, { "epoch": 0.05653498476751735, "grad_norm": 0.734375, "learning_rate": 1.955060795603117e-05, "loss": 0.4924, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 283, "tokens_per_second_per_gpu": 19673.0, "total_tokens": 25596861 }, { "epoch": 0.05673475503171353, "grad_norm": 0.7734375, "learning_rate": 1.9545693853196985e-05, "loss": 0.4942, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 284, "tokens_per_second_per_gpu": 18701.89, "total_tokens": 25687800 }, { "epoch": 0.056934525295909706, "grad_norm": 0.75390625, "learning_rate": 1.95407536528003e-05, "loss": 0.4707, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 285, "tokens_per_second_per_gpu": 17044.8, "total_tokens": 25772206 }, { "epoch": 0.05713429556010588, "grad_norm": 0.734375, "learning_rate": 1.9535787368347444e-05, "loss": 0.474, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 286, "tokens_per_second_per_gpu": 18799.26, "total_tokens": 25863849 }, { "epoch": 0.057334065824302054, "grad_norm": 0.7421875, "learning_rate": 1.9530795013416046e-05, "loss": 0.4657, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 287, "tokens_per_second_per_gpu": 18549.96, "total_tokens": 25954200 }, { "epoch": 0.05753383608849823, "grad_norm": 0.7734375, "learning_rate": 1.9525776601655014e-05, "loss": 0.5117, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 288, "tokens_per_second_per_gpu": 19832.19, "total_tokens": 26048948 }, { "epoch": 0.0577336063526944, "grad_norm": 0.70703125, "learning_rate": 1.9520732146784493e-05, "loss": 0.4838, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 289, "tokens_per_second_per_gpu": 20344.69, "total_tokens": 26147269 }, { "epoch": 0.057933376616890575, "grad_norm": 0.73828125, "learning_rate": 1.951566166259583e-05, "loss": 0.4858, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 290, "tokens_per_second_per_gpu": 19096.01, "total_tokens": 26241318 }, { "epoch": 0.05813314688108675, "grad_norm": 0.74609375, "learning_rate": 1.9510565162951538e-05, "loss": 0.5071, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 291, "tokens_per_second_per_gpu": 20222.41, "total_tokens": 26339613 }, { "epoch": 0.05833291714528292, "grad_norm": 0.7578125, "learning_rate": 1.950544266178525e-05, "loss": 0.4787, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 292, "tokens_per_second_per_gpu": 18311.94, "total_tokens": 26427549 }, { "epoch": 0.058532687409479096, "grad_norm": 0.75, "learning_rate": 1.9500294173101687e-05, "loss": 0.4364, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 293, "tokens_per_second_per_gpu": 18195.69, "total_tokens": 26514808 }, { "epoch": 0.05873245767367527, "grad_norm": 0.76953125, "learning_rate": 1.9495119710976628e-05, "loss": 0.4819, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 294, "tokens_per_second_per_gpu": 19433.08, "total_tokens": 26607406 }, { "epoch": 0.05893222793787145, "grad_norm": 0.734375, "learning_rate": 1.9489919289556844e-05, "loss": 0.4871, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 295, "tokens_per_second_per_gpu": 19459.06, "total_tokens": 26701540 }, { "epoch": 0.059131998202067625, "grad_norm": 0.7578125, "learning_rate": 1.9484692923060095e-05, "loss": 0.485, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 296, "tokens_per_second_per_gpu": 17767.29, "total_tokens": 26787153 }, { "epoch": 0.0593317684662638, "grad_norm": 0.734375, "learning_rate": 1.947944062577507e-05, "loss": 0.4922, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 297, "tokens_per_second_per_gpu": 19618.74, "total_tokens": 26881583 }, { "epoch": 0.05953153873045997, "grad_norm": 0.79296875, "learning_rate": 1.9474162412061342e-05, "loss": 0.4757, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 298, "tokens_per_second_per_gpu": 17193.1, "total_tokens": 26964699 }, { "epoch": 0.059731308994656146, "grad_norm": 0.796875, "learning_rate": 1.946885829634935e-05, "loss": 0.4934, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 299, "tokens_per_second_per_gpu": 17980.09, "total_tokens": 27053346 }, { "epoch": 0.05993107925885232, "grad_norm": 0.72265625, "learning_rate": 1.9463528293140347e-05, "loss": 0.4447, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 300, "tokens_per_second_per_gpu": 18676.8, "total_tokens": 27142719 }, { "epoch": 0.060130849523048494, "grad_norm": 0.8828125, "learning_rate": 1.9458172417006347e-05, "loss": 0.4637, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 301, "tokens_per_second_per_gpu": 18315.56, "total_tokens": 27233327 }, { "epoch": 0.06033061978724467, "grad_norm": 0.765625, "learning_rate": 1.9452790682590124e-05, "loss": 0.4507, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 302, "tokens_per_second_per_gpu": 18332.18, "total_tokens": 27321255 }, { "epoch": 0.06053039005144084, "grad_norm": 0.7734375, "learning_rate": 1.9447383104605126e-05, "loss": 0.4937, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 303, "tokens_per_second_per_gpu": 19486.97, "total_tokens": 27415583 }, { "epoch": 0.060730160315637015, "grad_norm": 0.7109375, "learning_rate": 1.9441949697835468e-05, "loss": 0.4647, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 304, "tokens_per_second_per_gpu": 19012.74, "total_tokens": 27506679 }, { "epoch": 0.06092993057983319, "grad_norm": 0.7890625, "learning_rate": 1.9436490477135877e-05, "loss": 0.4387, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 305, "tokens_per_second_per_gpu": 17254.66, "total_tokens": 27591645 }, { "epoch": 0.06112970084402937, "grad_norm": 0.76953125, "learning_rate": 1.9431005457431654e-05, "loss": 0.4757, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 306, "tokens_per_second_per_gpu": 19644.92, "total_tokens": 27685299 }, { "epoch": 0.06132947110822554, "grad_norm": 0.73046875, "learning_rate": 1.9425494653718632e-05, "loss": 0.4487, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 307, "tokens_per_second_per_gpu": 18733.86, "total_tokens": 27776771 }, { "epoch": 0.06152924137242172, "grad_norm": 0.73828125, "learning_rate": 1.9419958081063136e-05, "loss": 0.4754, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 308, "tokens_per_second_per_gpu": 19040.6, "total_tokens": 27868858 }, { "epoch": 0.06172901163661789, "grad_norm": 0.76171875, "learning_rate": 1.941439575460195e-05, "loss": 0.4712, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 309, "tokens_per_second_per_gpu": 17499.37, "total_tokens": 27955552 }, { "epoch": 0.061928781900814064, "grad_norm": 0.8046875, "learning_rate": 1.9408807689542257e-05, "loss": 0.4162, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 310, "tokens_per_second_per_gpu": 17170.67, "total_tokens": 28039699 }, { "epoch": 0.06212855216501024, "grad_norm": 0.7734375, "learning_rate": 1.9403193901161614e-05, "loss": 0.4781, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 311, "tokens_per_second_per_gpu": 18837.09, "total_tokens": 28130081 }, { "epoch": 0.06232832242920641, "grad_norm": 0.74609375, "learning_rate": 1.9397554404807904e-05, "loss": 0.5044, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 312, "tokens_per_second_per_gpu": 19388.56, "total_tokens": 28225060 }, { "epoch": 0.06252809269340259, "grad_norm": 0.78125, "learning_rate": 1.93918892158993e-05, "loss": 0.4719, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 313, "tokens_per_second_per_gpu": 18540.31, "total_tokens": 28318026 }, { "epoch": 0.06272786295759876, "grad_norm": 0.78125, "learning_rate": 1.9386198349924207e-05, "loss": 0.4547, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 314, "tokens_per_second_per_gpu": 18516.75, "total_tokens": 28407964 }, { "epoch": 0.06292763322179494, "grad_norm": 0.8203125, "learning_rate": 1.9380481822441236e-05, "loss": 0.4402, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 315, "tokens_per_second_per_gpu": 16812.28, "total_tokens": 28490050 }, { "epoch": 0.06312740348599111, "grad_norm": 0.734375, "learning_rate": 1.9374739649079155e-05, "loss": 0.477, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 316, "tokens_per_second_per_gpu": 19232.85, "total_tokens": 28583112 }, { "epoch": 0.06332717375018729, "grad_norm": 0.734375, "learning_rate": 1.9368971845536844e-05, "loss": 0.4835, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 317, "tokens_per_second_per_gpu": 18448.3, "total_tokens": 28672763 }, { "epoch": 0.06352694401438345, "grad_norm": 0.75390625, "learning_rate": 1.9363178427583266e-05, "loss": 0.4733, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 318, "tokens_per_second_per_gpu": 19372.33, "total_tokens": 28766632 }, { "epoch": 0.06372671427857964, "grad_norm": 0.7734375, "learning_rate": 1.9357359411057398e-05, "loss": 0.4881, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 319, "tokens_per_second_per_gpu": 19192.57, "total_tokens": 28859019 }, { "epoch": 0.0639264845427758, "grad_norm": 0.7890625, "learning_rate": 1.935151481186821e-05, "loss": 0.4587, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 320, "tokens_per_second_per_gpu": 19354.2, "total_tokens": 28952689 }, { "epoch": 0.06412625480697198, "grad_norm": 0.8046875, "learning_rate": 1.934564464599461e-05, "loss": 0.422, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 321, "tokens_per_second_per_gpu": 15869.5, "total_tokens": 29030761 }, { "epoch": 0.06432602507116815, "grad_norm": 0.734375, "learning_rate": 1.933974892948541e-05, "loss": 0.459, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 322, "tokens_per_second_per_gpu": 18816.63, "total_tokens": 29120675 }, { "epoch": 0.06452579533536433, "grad_norm": 0.8046875, "learning_rate": 1.9333827678459277e-05, "loss": 0.461, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 323, "tokens_per_second_per_gpu": 17414.46, "total_tokens": 29205333 }, { "epoch": 0.06472556559956051, "grad_norm": 0.76953125, "learning_rate": 1.9327880909104684e-05, "loss": 0.4593, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 324, "tokens_per_second_per_gpu": 18172.44, "total_tokens": 29294375 }, { "epoch": 0.06492533586375668, "grad_norm": 0.921875, "learning_rate": 1.9321908637679868e-05, "loss": 0.4502, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 325, "tokens_per_second_per_gpu": 19942.95, "total_tokens": 29390943 }, { "epoch": 0.06512510612795286, "grad_norm": 0.78515625, "learning_rate": 1.9315910880512792e-05, "loss": 0.4997, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 326, "tokens_per_second_per_gpu": 20051.53, "total_tokens": 29487963 }, { "epoch": 0.06532487639214903, "grad_norm": 0.74609375, "learning_rate": 1.9309887654001095e-05, "loss": 0.4768, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 327, "tokens_per_second_per_gpu": 21222.39, "total_tokens": 29589170 }, { "epoch": 0.0655246466563452, "grad_norm": 0.7109375, "learning_rate": 1.930383897461205e-05, "loss": 0.4843, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 328, "tokens_per_second_per_gpu": 18406.81, "total_tokens": 29680577 }, { "epoch": 0.06572441692054137, "grad_norm": 0.76953125, "learning_rate": 1.9297764858882516e-05, "loss": 0.468, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 329, "tokens_per_second_per_gpu": 18344.59, "total_tokens": 29769698 }, { "epoch": 0.06592418718473755, "grad_norm": 0.75, "learning_rate": 1.9291665323418888e-05, "loss": 0.4523, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 330, "tokens_per_second_per_gpu": 17961.3, "total_tokens": 29857378 }, { "epoch": 0.06612395744893372, "grad_norm": 0.7578125, "learning_rate": 1.9285540384897073e-05, "loss": 0.4355, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 331, "tokens_per_second_per_gpu": 18410.31, "total_tokens": 29946306 }, { "epoch": 0.0663237277131299, "grad_norm": 0.75390625, "learning_rate": 1.9279390060062408e-05, "loss": 0.4553, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 332, "tokens_per_second_per_gpu": 18853.23, "total_tokens": 30038267 }, { "epoch": 0.06652349797732607, "grad_norm": 0.75390625, "learning_rate": 1.9273214365729655e-05, "loss": 0.4574, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 333, "tokens_per_second_per_gpu": 18255.06, "total_tokens": 30127625 }, { "epoch": 0.06672326824152225, "grad_norm": 0.765625, "learning_rate": 1.9267013318782922e-05, "loss": 0.4485, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 334, "tokens_per_second_per_gpu": 18637.62, "total_tokens": 30218601 }, { "epoch": 0.06692303850571843, "grad_norm": 0.75390625, "learning_rate": 1.9260786936175635e-05, "loss": 0.4535, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 335, "tokens_per_second_per_gpu": 18318.21, "total_tokens": 30308631 }, { "epoch": 0.0671228087699146, "grad_norm": 0.7265625, "learning_rate": 1.9254535234930486e-05, "loss": 0.465, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 336, "tokens_per_second_per_gpu": 19810.49, "total_tokens": 30403625 }, { "epoch": 0.06732257903411078, "grad_norm": 0.765625, "learning_rate": 1.924825823213939e-05, "loss": 0.4568, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 337, "tokens_per_second_per_gpu": 19597.81, "total_tokens": 30498641 }, { "epoch": 0.06752234929830694, "grad_norm": 0.828125, "learning_rate": 1.924195594496343e-05, "loss": 0.427, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 338, "tokens_per_second_per_gpu": 16110.94, "total_tokens": 30578470 }, { "epoch": 0.06772211956250312, "grad_norm": 0.828125, "learning_rate": 1.923562839063282e-05, "loss": 0.4548, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 339, "tokens_per_second_per_gpu": 17550.34, "total_tokens": 30665187 }, { "epoch": 0.06792188982669929, "grad_norm": 0.72265625, "learning_rate": 1.9229275586446853e-05, "loss": 0.4607, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 340, "tokens_per_second_per_gpu": 18631.78, "total_tokens": 30755522 }, { "epoch": 0.06812166009089547, "grad_norm": 0.765625, "learning_rate": 1.922289754977385e-05, "loss": 0.4647, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 341, "tokens_per_second_per_gpu": 18218.75, "total_tokens": 30844380 }, { "epoch": 0.06832143035509164, "grad_norm": 0.75390625, "learning_rate": 1.921649429805112e-05, "loss": 0.4631, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 342, "tokens_per_second_per_gpu": 19155.47, "total_tokens": 30937699 }, { "epoch": 0.06852120061928782, "grad_norm": 0.71875, "learning_rate": 1.9210065848784915e-05, "loss": 0.4902, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 343, "tokens_per_second_per_gpu": 19912.91, "total_tokens": 31034575 }, { "epoch": 0.06872097088348399, "grad_norm": 0.72265625, "learning_rate": 1.9203612219550357e-05, "loss": 0.454, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 344, "tokens_per_second_per_gpu": 19822.08, "total_tokens": 31132179 }, { "epoch": 0.06892074114768017, "grad_norm": 0.75390625, "learning_rate": 1.9197133427991437e-05, "loss": 0.4589, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 345, "tokens_per_second_per_gpu": 17394.12, "total_tokens": 31217511 }, { "epoch": 0.06912051141187635, "grad_norm": 0.74609375, "learning_rate": 1.919062949182091e-05, "loss": 0.4694, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 346, "tokens_per_second_per_gpu": 18809.77, "total_tokens": 31310363 }, { "epoch": 0.06932028167607251, "grad_norm": 0.7109375, "learning_rate": 1.9184100428820304e-05, "loss": 0.4512, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 347, "tokens_per_second_per_gpu": 20546.18, "total_tokens": 31408105 }, { "epoch": 0.0695200519402687, "grad_norm": 0.765625, "learning_rate": 1.9177546256839814e-05, "loss": 0.4194, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 348, "tokens_per_second_per_gpu": 16080.37, "total_tokens": 31486678 }, { "epoch": 0.06971982220446486, "grad_norm": 0.84375, "learning_rate": 1.9170966993798302e-05, "loss": 0.4689, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 349, "tokens_per_second_per_gpu": 18876.88, "total_tokens": 31578085 }, { "epoch": 0.06991959246866104, "grad_norm": 0.82421875, "learning_rate": 1.9164362657683223e-05, "loss": 0.474, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 350, "tokens_per_second_per_gpu": 19889.06, "total_tokens": 31672429 }, { "epoch": 0.07011936273285721, "grad_norm": 0.74609375, "learning_rate": 1.9157733266550577e-05, "loss": 0.4612, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 351, "tokens_per_second_per_gpu": 18279.43, "total_tokens": 31762205 }, { "epoch": 0.07031913299705339, "grad_norm": 0.71875, "learning_rate": 1.9151078838524867e-05, "loss": 0.412, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 352, "tokens_per_second_per_gpu": 17851.38, "total_tokens": 31849565 }, { "epoch": 0.07051890326124956, "grad_norm": 0.76171875, "learning_rate": 1.9144399391799043e-05, "loss": 0.4253, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 353, "tokens_per_second_per_gpu": 16907.45, "total_tokens": 31931257 }, { "epoch": 0.07071867352544574, "grad_norm": 0.7578125, "learning_rate": 1.9137694944634465e-05, "loss": 0.4292, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 354, "tokens_per_second_per_gpu": 18580.92, "total_tokens": 32020676 }, { "epoch": 0.0709184437896419, "grad_norm": 0.74609375, "learning_rate": 1.913096551536083e-05, "loss": 0.4686, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 355, "tokens_per_second_per_gpu": 17811.59, "total_tokens": 32107600 }, { "epoch": 0.07111821405383809, "grad_norm": 0.765625, "learning_rate": 1.9124211122376138e-05, "loss": 0.4543, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 356, "tokens_per_second_per_gpu": 19592.69, "total_tokens": 32202315 }, { "epoch": 0.07131798431803427, "grad_norm": 0.7421875, "learning_rate": 1.911743178414665e-05, "loss": 0.4185, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 357, "tokens_per_second_per_gpu": 17200.24, "total_tokens": 32286805 }, { "epoch": 0.07151775458223043, "grad_norm": 0.7578125, "learning_rate": 1.9110627519206806e-05, "loss": 0.4673, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 358, "tokens_per_second_per_gpu": 19107.01, "total_tokens": 32379697 }, { "epoch": 0.07171752484642661, "grad_norm": 0.765625, "learning_rate": 1.9103798346159214e-05, "loss": 0.4562, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 359, "tokens_per_second_per_gpu": 18615.54, "total_tokens": 32470376 }, { "epoch": 0.07191729511062278, "grad_norm": 0.7578125, "learning_rate": 1.9096944283674574e-05, "loss": 0.4343, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 360, "tokens_per_second_per_gpu": 17594.15, "total_tokens": 32557117 }, { "epoch": 0.07211706537481896, "grad_norm": 0.7890625, "learning_rate": 1.909006535049163e-05, "loss": 0.463, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 361, "tokens_per_second_per_gpu": 17704.48, "total_tokens": 32642986 }, { "epoch": 0.07231683563901513, "grad_norm": 0.734375, "learning_rate": 1.9083161565417115e-05, "loss": 0.4111, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 362, "tokens_per_second_per_gpu": 17251.99, "total_tokens": 32726348 }, { "epoch": 0.07251660590321131, "grad_norm": 0.74609375, "learning_rate": 1.9076232947325724e-05, "loss": 0.4851, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 363, "tokens_per_second_per_gpu": 19515.12, "total_tokens": 32821377 }, { "epoch": 0.07271637616740748, "grad_norm": 0.73828125, "learning_rate": 1.9069279515160027e-05, "loss": 0.4564, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 364, "tokens_per_second_per_gpu": 18735.82, "total_tokens": 32912104 }, { "epoch": 0.07291614643160366, "grad_norm": 0.78125, "learning_rate": 1.9062301287930448e-05, "loss": 0.4724, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 365, "tokens_per_second_per_gpu": 18227.05, "total_tokens": 33002672 }, { "epoch": 0.07311591669579982, "grad_norm": 0.7578125, "learning_rate": 1.9055298284715192e-05, "loss": 0.4315, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 366, "tokens_per_second_per_gpu": 18151.94, "total_tokens": 33092420 }, { "epoch": 0.073315686959996, "grad_norm": 0.765625, "learning_rate": 1.9048270524660197e-05, "loss": 0.4147, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 367, "tokens_per_second_per_gpu": 17551.9, "total_tokens": 33178233 }, { "epoch": 0.07351545722419218, "grad_norm": 0.78125, "learning_rate": 1.9041218026979096e-05, "loss": 0.4409, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 368, "tokens_per_second_per_gpu": 18533.84, "total_tokens": 33268228 }, { "epoch": 0.07371522748838835, "grad_norm": 0.77734375, "learning_rate": 1.903414081095315e-05, "loss": 0.4448, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 369, "tokens_per_second_per_gpu": 18382.29, "total_tokens": 33357686 }, { "epoch": 0.07391499775258453, "grad_norm": 0.7578125, "learning_rate": 1.902703889593119e-05, "loss": 0.4547, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 370, "tokens_per_second_per_gpu": 20030.89, "total_tokens": 33452722 }, { "epoch": 0.0741147680167807, "grad_norm": 0.77734375, "learning_rate": 1.9019912301329593e-05, "loss": 0.4662, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 371, "tokens_per_second_per_gpu": 18866.38, "total_tokens": 33543831 }, { "epoch": 0.07431453828097688, "grad_norm": 0.7578125, "learning_rate": 1.901276104663218e-05, "loss": 0.4559, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 372, "tokens_per_second_per_gpu": 18398.79, "total_tokens": 33633472 }, { "epoch": 0.07451430854517305, "grad_norm": 0.703125, "learning_rate": 1.9005585151390224e-05, "loss": 0.4437, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 373, "tokens_per_second_per_gpu": 19233.21, "total_tokens": 33726158 }, { "epoch": 0.07471407880936923, "grad_norm": 0.7265625, "learning_rate": 1.8998384635222337e-05, "loss": 0.4612, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 374, "tokens_per_second_per_gpu": 19099.25, "total_tokens": 33819103 }, { "epoch": 0.0749138490735654, "grad_norm": 0.71875, "learning_rate": 1.8991159517814463e-05, "loss": 0.4493, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 375, "tokens_per_second_per_gpu": 19527.58, "total_tokens": 33913338 }, { "epoch": 0.07511361933776158, "grad_norm": 0.6953125, "learning_rate": 1.898390981891979e-05, "loss": 0.4354, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 376, "tokens_per_second_per_gpu": 19007.22, "total_tokens": 34005425 }, { "epoch": 0.07531338960195774, "grad_norm": 0.765625, "learning_rate": 1.897663555835872e-05, "loss": 0.4728, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 377, "tokens_per_second_per_gpu": 19804.74, "total_tokens": 34101132 }, { "epoch": 0.07551315986615392, "grad_norm": 0.76171875, "learning_rate": 1.8969336756018813e-05, "loss": 0.4598, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 378, "tokens_per_second_per_gpu": 17862.48, "total_tokens": 34187810 }, { "epoch": 0.0757129301303501, "grad_norm": 0.7109375, "learning_rate": 1.8962013431854705e-05, "loss": 0.468, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 379, "tokens_per_second_per_gpu": 18205.99, "total_tokens": 34278318 }, { "epoch": 0.07591270039454627, "grad_norm": 0.7109375, "learning_rate": 1.8954665605888086e-05, "loss": 0.4753, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 380, "tokens_per_second_per_gpu": 19804.36, "total_tokens": 34376644 }, { "epoch": 0.07611247065874245, "grad_norm": 0.74609375, "learning_rate": 1.8947293298207637e-05, "loss": 0.4226, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 381, "tokens_per_second_per_gpu": 16601.79, "total_tokens": 34458692 }, { "epoch": 0.07631224092293862, "grad_norm": 0.75, "learning_rate": 1.893989652896896e-05, "loss": 0.4754, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 382, "tokens_per_second_per_gpu": 19552.66, "total_tokens": 34553520 }, { "epoch": 0.0765120111871348, "grad_norm": 0.73828125, "learning_rate": 1.8932475318394542e-05, "loss": 0.4443, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 383, "tokens_per_second_per_gpu": 18296.67, "total_tokens": 34640570 }, { "epoch": 0.07671178145133097, "grad_norm": 0.7109375, "learning_rate": 1.8925029686773692e-05, "loss": 0.4478, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 384, "tokens_per_second_per_gpu": 19332.33, "total_tokens": 34734118 }, { "epoch": 0.07691155171552715, "grad_norm": 0.7265625, "learning_rate": 1.8917559654462474e-05, "loss": 0.4662, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 385, "tokens_per_second_per_gpu": 19702.06, "total_tokens": 34830220 }, { "epoch": 0.07711132197972331, "grad_norm": 0.7734375, "learning_rate": 1.891006524188368e-05, "loss": 0.4422, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 386, "tokens_per_second_per_gpu": 18099.29, "total_tokens": 34919409 }, { "epoch": 0.0773110922439195, "grad_norm": 0.7109375, "learning_rate": 1.8902546469526744e-05, "loss": 0.4603, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 387, "tokens_per_second_per_gpu": 20118.12, "total_tokens": 35015775 }, { "epoch": 0.07751086250811566, "grad_norm": 0.7265625, "learning_rate": 1.8895003357947707e-05, "loss": 0.4307, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 388, "tokens_per_second_per_gpu": 18431.61, "total_tokens": 35106349 }, { "epoch": 0.07771063277231184, "grad_norm": 0.7578125, "learning_rate": 1.8887435927769137e-05, "loss": 0.445, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 389, "tokens_per_second_per_gpu": 19391.85, "total_tokens": 35200487 }, { "epoch": 0.07791040303650802, "grad_norm": 0.859375, "learning_rate": 1.887984419968011e-05, "loss": 0.4551, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 390, "tokens_per_second_per_gpu": 19486.47, "total_tokens": 35294028 }, { "epoch": 0.07811017330070419, "grad_norm": 0.7109375, "learning_rate": 1.887222819443612e-05, "loss": 0.4177, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 391, "tokens_per_second_per_gpu": 18114.1, "total_tokens": 35381758 }, { "epoch": 0.07830994356490037, "grad_norm": 0.73046875, "learning_rate": 1.8864587932859028e-05, "loss": 0.4316, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 392, "tokens_per_second_per_gpu": 18680.53, "total_tokens": 35473265 }, { "epoch": 0.07850971382909654, "grad_norm": 0.8046875, "learning_rate": 1.8856923435837024e-05, "loss": 0.4708, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 393, "tokens_per_second_per_gpu": 19966.88, "total_tokens": 35569885 }, { "epoch": 0.07870948409329272, "grad_norm": 0.72265625, "learning_rate": 1.8849234724324543e-05, "loss": 0.4401, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 394, "tokens_per_second_per_gpu": 20041.17, "total_tokens": 35664805 }, { "epoch": 0.07890925435748888, "grad_norm": 0.7578125, "learning_rate": 1.8841521819342237e-05, "loss": 0.452, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 395, "tokens_per_second_per_gpu": 17064.04, "total_tokens": 35749944 }, { "epoch": 0.07910902462168506, "grad_norm": 0.7421875, "learning_rate": 1.883378474197689e-05, "loss": 0.465, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 396, "tokens_per_second_per_gpu": 18294.82, "total_tokens": 35839936 }, { "epoch": 0.07930879488588123, "grad_norm": 0.74609375, "learning_rate": 1.8826023513381372e-05, "loss": 0.4426, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 397, "tokens_per_second_per_gpu": 18614.5, "total_tokens": 35930456 }, { "epoch": 0.07950856515007741, "grad_norm": 0.72265625, "learning_rate": 1.881823815477459e-05, "loss": 0.4324, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 398, "tokens_per_second_per_gpu": 18927.0, "total_tokens": 36022487 }, { "epoch": 0.07970833541427358, "grad_norm": 0.7578125, "learning_rate": 1.8810428687441415e-05, "loss": 0.4436, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 399, "tokens_per_second_per_gpu": 18255.88, "total_tokens": 36110406 }, { "epoch": 0.07990810567846976, "grad_norm": 0.77734375, "learning_rate": 1.8802595132732636e-05, "loss": 0.4409, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 400, "tokens_per_second_per_gpu": 18284.79, "total_tokens": 36199208 }, { "epoch": 0.08010787594266594, "grad_norm": 0.75390625, "learning_rate": 1.879473751206489e-05, "loss": 0.4484, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 401, "tokens_per_second_per_gpu": 17659.79, "total_tokens": 36285159 }, { "epoch": 0.08030764620686211, "grad_norm": 0.74609375, "learning_rate": 1.8786855846920615e-05, "loss": 0.4661, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 402, "tokens_per_second_per_gpu": 18452.81, "total_tokens": 36375461 }, { "epoch": 0.08050741647105829, "grad_norm": 0.73828125, "learning_rate": 1.8778950158847976e-05, "loss": 0.4797, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 403, "tokens_per_second_per_gpu": 20207.15, "total_tokens": 36473161 }, { "epoch": 0.08070718673525445, "grad_norm": 0.765625, "learning_rate": 1.877102046946083e-05, "loss": 0.4557, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 404, "tokens_per_second_per_gpu": 19675.68, "total_tokens": 36568183 }, { "epoch": 0.08090695699945064, "grad_norm": 0.73828125, "learning_rate": 1.8763066800438638e-05, "loss": 0.4212, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 405, "tokens_per_second_per_gpu": 18655.17, "total_tokens": 36657416 }, { "epoch": 0.0811067272636468, "grad_norm": 0.78125, "learning_rate": 1.875508917352643e-05, "loss": 0.427, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 406, "tokens_per_second_per_gpu": 17290.24, "total_tokens": 36742759 }, { "epoch": 0.08130649752784298, "grad_norm": 0.78125, "learning_rate": 1.8747087610534735e-05, "loss": 0.4312, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 407, "tokens_per_second_per_gpu": 18862.53, "total_tokens": 36833543 }, { "epoch": 0.08150626779203915, "grad_norm": 0.734375, "learning_rate": 1.8739062133339518e-05, "loss": 0.4153, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 408, "tokens_per_second_per_gpu": 17516.1, "total_tokens": 36920264 }, { "epoch": 0.08170603805623533, "grad_norm": 0.734375, "learning_rate": 1.8731012763882132e-05, "loss": 0.4716, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 409, "tokens_per_second_per_gpu": 19903.17, "total_tokens": 37017512 }, { "epoch": 0.0819058083204315, "grad_norm": 0.7421875, "learning_rate": 1.8722939524169243e-05, "loss": 0.4455, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 410, "tokens_per_second_per_gpu": 19227.69, "total_tokens": 37111193 }, { "epoch": 0.08210557858462768, "grad_norm": 0.71875, "learning_rate": 1.8714842436272774e-05, "loss": 0.4673, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 411, "tokens_per_second_per_gpu": 19660.48, "total_tokens": 37206493 }, { "epoch": 0.08230534884882386, "grad_norm": 0.79296875, "learning_rate": 1.8706721522329862e-05, "loss": 0.4779, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 412, "tokens_per_second_per_gpu": 18964.49, "total_tokens": 37297746 }, { "epoch": 0.08250511911302003, "grad_norm": 0.7578125, "learning_rate": 1.8698576804542775e-05, "loss": 0.464, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 413, "tokens_per_second_per_gpu": 19165.29, "total_tokens": 37391906 }, { "epoch": 0.0827048893772162, "grad_norm": 0.8125, "learning_rate": 1.8690408305178858e-05, "loss": 0.4684, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 414, "tokens_per_second_per_gpu": 18010.82, "total_tokens": 37479544 }, { "epoch": 0.08290465964141237, "grad_norm": 0.80859375, "learning_rate": 1.8682216046570477e-05, "loss": 0.4237, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 415, "tokens_per_second_per_gpu": 17127.05, "total_tokens": 37562434 }, { "epoch": 0.08310442990560855, "grad_norm": 0.77734375, "learning_rate": 1.8674000051114953e-05, "loss": 0.4299, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 416, "tokens_per_second_per_gpu": 16720.61, "total_tokens": 37643783 }, { "epoch": 0.08330420016980472, "grad_norm": 0.73828125, "learning_rate": 1.8665760341274505e-05, "loss": 0.4354, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 417, "tokens_per_second_per_gpu": 19094.44, "total_tokens": 37735797 }, { "epoch": 0.0835039704340009, "grad_norm": 0.76953125, "learning_rate": 1.8657496939576187e-05, "loss": 0.4823, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 418, "tokens_per_second_per_gpu": 19280.76, "total_tokens": 37830582 }, { "epoch": 0.08370374069819707, "grad_norm": 0.78515625, "learning_rate": 1.8649209868611822e-05, "loss": 0.4612, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 419, "tokens_per_second_per_gpu": 18970.03, "total_tokens": 37922986 }, { "epoch": 0.08390351096239325, "grad_norm": 0.76171875, "learning_rate": 1.8640899151037945e-05, "loss": 0.4475, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 420, "tokens_per_second_per_gpu": 17995.41, "total_tokens": 38009445 }, { "epoch": 0.08410328122658942, "grad_norm": 0.765625, "learning_rate": 1.863256480957574e-05, "loss": 0.4439, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 421, "tokens_per_second_per_gpu": 18779.83, "total_tokens": 38099722 }, { "epoch": 0.0843030514907856, "grad_norm": 0.75390625, "learning_rate": 1.8624206867010982e-05, "loss": 0.4248, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 422, "tokens_per_second_per_gpu": 18780.03, "total_tokens": 38191632 }, { "epoch": 0.08450282175498178, "grad_norm": 0.82421875, "learning_rate": 1.861582534619396e-05, "loss": 0.413, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 423, "tokens_per_second_per_gpu": 16246.02, "total_tokens": 38270618 }, { "epoch": 0.08470259201917794, "grad_norm": 0.7265625, "learning_rate": 1.860742027003944e-05, "loss": 0.473, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 424, "tokens_per_second_per_gpu": 20166.67, "total_tokens": 38369114 }, { "epoch": 0.08490236228337412, "grad_norm": 0.77734375, "learning_rate": 1.859899166152657e-05, "loss": 0.4308, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 425, "tokens_per_second_per_gpu": 18619.51, "total_tokens": 38458330 }, { "epoch": 0.08510213254757029, "grad_norm": 0.703125, "learning_rate": 1.8590539543698852e-05, "loss": 0.4296, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 426, "tokens_per_second_per_gpu": 19298.7, "total_tokens": 38552471 }, { "epoch": 0.08530190281176647, "grad_norm": 0.71484375, "learning_rate": 1.8582063939664052e-05, "loss": 0.4113, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 427, "tokens_per_second_per_gpu": 18452.13, "total_tokens": 38643445 }, { "epoch": 0.08550167307596264, "grad_norm": 0.74609375, "learning_rate": 1.8573564872594144e-05, "loss": 0.4254, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 428, "tokens_per_second_per_gpu": 17340.45, "total_tokens": 38728057 }, { "epoch": 0.08570144334015882, "grad_norm": 0.74609375, "learning_rate": 1.856504236572526e-05, "loss": 0.4204, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 429, "tokens_per_second_per_gpu": 17795.4, "total_tokens": 38813479 }, { "epoch": 0.08590121360435499, "grad_norm": 0.73046875, "learning_rate": 1.8556496442357597e-05, "loss": 0.4538, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 430, "tokens_per_second_per_gpu": 19618.3, "total_tokens": 38907760 }, { "epoch": 0.08610098386855117, "grad_norm": 0.75, "learning_rate": 1.854792712585539e-05, "loss": 0.4244, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 431, "tokens_per_second_per_gpu": 17058.12, "total_tokens": 38991339 }, { "epoch": 0.08630075413274733, "grad_norm": 0.6953125, "learning_rate": 1.8539334439646827e-05, "loss": 0.4427, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 432, "tokens_per_second_per_gpu": 19729.06, "total_tokens": 39087467 }, { "epoch": 0.08650052439694352, "grad_norm": 0.71875, "learning_rate": 1.8530718407223976e-05, "loss": 0.4127, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 433, "tokens_per_second_per_gpu": 17743.01, "total_tokens": 39173576 }, { "epoch": 0.0867002946611397, "grad_norm": 0.734375, "learning_rate": 1.8522079052142748e-05, "loss": 0.4602, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 434, "tokens_per_second_per_gpu": 19902.58, "total_tokens": 39269152 }, { "epoch": 0.08690006492533586, "grad_norm": 0.765625, "learning_rate": 1.8513416398022803e-05, "loss": 0.4357, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 435, "tokens_per_second_per_gpu": 18467.01, "total_tokens": 39358741 }, { "epoch": 0.08709983518953204, "grad_norm": 0.72265625, "learning_rate": 1.8504730468547508e-05, "loss": 0.4114, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 436, "tokens_per_second_per_gpu": 18141.44, "total_tokens": 39446971 }, { "epoch": 0.08729960545372821, "grad_norm": 0.73828125, "learning_rate": 1.849602128746387e-05, "loss": 0.4206, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 437, "tokens_per_second_per_gpu": 17413.95, "total_tokens": 39531879 }, { "epoch": 0.08749937571792439, "grad_norm": 1.0078125, "learning_rate": 1.8487288878582447e-05, "loss": 0.4582, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 438, "tokens_per_second_per_gpu": 18633.87, "total_tokens": 39622256 }, { "epoch": 0.08769914598212056, "grad_norm": 0.76171875, "learning_rate": 1.847853326577732e-05, "loss": 0.4334, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 439, "tokens_per_second_per_gpu": 19427.5, "total_tokens": 39715924 }, { "epoch": 0.08789891624631674, "grad_norm": 0.7578125, "learning_rate": 1.8469754472985994e-05, "loss": 0.4522, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 440, "tokens_per_second_per_gpu": 19013.41, "total_tokens": 39808110 }, { "epoch": 0.0880986865105129, "grad_norm": 0.76171875, "learning_rate": 1.8460952524209355e-05, "loss": 0.4244, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 441, "tokens_per_second_per_gpu": 17656.86, "total_tokens": 39894219 }, { "epoch": 0.08829845677470909, "grad_norm": 0.7265625, "learning_rate": 1.8452127443511597e-05, "loss": 0.4425, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 442, "tokens_per_second_per_gpu": 19419.62, "total_tokens": 39987487 }, { "epoch": 0.08849822703890525, "grad_norm": 0.73046875, "learning_rate": 1.8443279255020153e-05, "loss": 0.4111, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 443, "tokens_per_second_per_gpu": 18191.33, "total_tokens": 40076790 }, { "epoch": 0.08869799730310143, "grad_norm": 0.78515625, "learning_rate": 1.843440798292563e-05, "loss": 0.4381, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 444, "tokens_per_second_per_gpu": 18053.51, "total_tokens": 40165096 }, { "epoch": 0.08889776756729761, "grad_norm": 0.7578125, "learning_rate": 1.8425513651481748e-05, "loss": 0.436, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 445, "tokens_per_second_per_gpu": 18134.32, "total_tokens": 40253574 }, { "epoch": 0.08909753783149378, "grad_norm": 0.73046875, "learning_rate": 1.8416596285005274e-05, "loss": 0.4302, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 446, "tokens_per_second_per_gpu": 18820.79, "total_tokens": 40345374 }, { "epoch": 0.08929730809568996, "grad_norm": 0.734375, "learning_rate": 1.8407655907875937e-05, "loss": 0.4524, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 447, "tokens_per_second_per_gpu": 19454.97, "total_tokens": 40440395 }, { "epoch": 0.08949707835988613, "grad_norm": 0.73046875, "learning_rate": 1.83986925445364e-05, "loss": 0.4427, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 448, "tokens_per_second_per_gpu": 18717.61, "total_tokens": 40531712 }, { "epoch": 0.08969684862408231, "grad_norm": 0.73828125, "learning_rate": 1.8389706219492147e-05, "loss": 0.45, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 449, "tokens_per_second_per_gpu": 16469.27, "total_tokens": 40613429 }, { "epoch": 0.08989661888827848, "grad_norm": 0.77734375, "learning_rate": 1.8380696957311447e-05, "loss": 0.4321, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 450, "tokens_per_second_per_gpu": 20118.31, "total_tokens": 40709871 }, { "epoch": 0.09009638915247466, "grad_norm": 0.74609375, "learning_rate": 1.8371664782625287e-05, "loss": 0.435, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 451, "tokens_per_second_per_gpu": 18795.55, "total_tokens": 40801044 }, { "epoch": 0.09029615941667082, "grad_norm": 0.765625, "learning_rate": 1.836260972012728e-05, "loss": 0.4262, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 452, "tokens_per_second_per_gpu": 17295.97, "total_tokens": 40885158 }, { "epoch": 0.090495929680867, "grad_norm": 0.734375, "learning_rate": 1.8353531794573623e-05, "loss": 0.4382, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 453, "tokens_per_second_per_gpu": 20211.93, "total_tokens": 40982884 }, { "epoch": 0.09069569994506317, "grad_norm": 0.76171875, "learning_rate": 1.8344431030783022e-05, "loss": 0.4107, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 454, "tokens_per_second_per_gpu": 16817.32, "total_tokens": 41066086 }, { "epoch": 0.09089547020925935, "grad_norm": 0.73046875, "learning_rate": 1.833530745363661e-05, "loss": 0.4355, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 455, "tokens_per_second_per_gpu": 20488.34, "total_tokens": 41163509 }, { "epoch": 0.09109524047345553, "grad_norm": 0.7421875, "learning_rate": 1.8326161088077905e-05, "loss": 0.4373, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 456, "tokens_per_second_per_gpu": 19447.56, "total_tokens": 41256862 }, { "epoch": 0.0912950107376517, "grad_norm": 0.734375, "learning_rate": 1.831699195911272e-05, "loss": 0.4723, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 457, "tokens_per_second_per_gpu": 21039.01, "total_tokens": 41358382 }, { "epoch": 0.09149478100184788, "grad_norm": 0.8203125, "learning_rate": 1.83078000918091e-05, "loss": 0.4292, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 458, "tokens_per_second_per_gpu": 17886.12, "total_tokens": 41443914 }, { "epoch": 0.09169455126604405, "grad_norm": 0.75390625, "learning_rate": 1.8298585511297263e-05, "loss": 0.4135, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 459, "tokens_per_second_per_gpu": 17094.61, "total_tokens": 41527017 }, { "epoch": 0.09189432153024023, "grad_norm": 0.78125, "learning_rate": 1.8289348242769515e-05, "loss": 0.4425, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 460, "tokens_per_second_per_gpu": 17886.63, "total_tokens": 41612776 }, { "epoch": 0.0920940917944364, "grad_norm": 0.7421875, "learning_rate": 1.8280088311480203e-05, "loss": 0.4329, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 461, "tokens_per_second_per_gpu": 18907.74, "total_tokens": 41703850 }, { "epoch": 0.09229386205863258, "grad_norm": 0.90234375, "learning_rate": 1.827080574274562e-05, "loss": 0.4469, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 462, "tokens_per_second_per_gpu": 19312.24, "total_tokens": 41798183 }, { "epoch": 0.09249363232282874, "grad_norm": 0.75390625, "learning_rate": 1.8261500561943956e-05, "loss": 0.457, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 463, "tokens_per_second_per_gpu": 19838.61, "total_tokens": 41894753 }, { "epoch": 0.09269340258702492, "grad_norm": 0.70703125, "learning_rate": 1.8252172794515225e-05, "loss": 0.4346, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 464, "tokens_per_second_per_gpu": 19350.23, "total_tokens": 41987824 }, { "epoch": 0.09289317285122109, "grad_norm": 0.76171875, "learning_rate": 1.8242822465961177e-05, "loss": 0.4994, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 465, "tokens_per_second_per_gpu": 19006.01, "total_tokens": 42080690 }, { "epoch": 0.09309294311541727, "grad_norm": 0.76171875, "learning_rate": 1.823344960184526e-05, "loss": 0.4338, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 466, "tokens_per_second_per_gpu": 18520.14, "total_tokens": 42171026 }, { "epoch": 0.09329271337961345, "grad_norm": 0.73046875, "learning_rate": 1.8224054227792524e-05, "loss": 0.4538, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 467, "tokens_per_second_per_gpu": 19873.91, "total_tokens": 42267921 }, { "epoch": 0.09349248364380962, "grad_norm": 0.7265625, "learning_rate": 1.8214636369489563e-05, "loss": 0.439, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 468, "tokens_per_second_per_gpu": 19250.81, "total_tokens": 42361852 }, { "epoch": 0.0936922539080058, "grad_norm": 0.73828125, "learning_rate": 1.8205196052684445e-05, "loss": 0.4435, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 469, "tokens_per_second_per_gpu": 18492.74, "total_tokens": 42451040 }, { "epoch": 0.09389202417220197, "grad_norm": 0.75, "learning_rate": 1.8195733303186634e-05, "loss": 0.4455, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 470, "tokens_per_second_per_gpu": 19483.91, "total_tokens": 42544756 }, { "epoch": 0.09409179443639815, "grad_norm": 0.73046875, "learning_rate": 1.8186248146866928e-05, "loss": 0.4459, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 471, "tokens_per_second_per_gpu": 17517.93, "total_tokens": 42631711 }, { "epoch": 0.09429156470059431, "grad_norm": 0.765625, "learning_rate": 1.8176740609657372e-05, "loss": 0.4017, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 472, "tokens_per_second_per_gpu": 17535.57, "total_tokens": 42716862 }, { "epoch": 0.0944913349647905, "grad_norm": 0.75390625, "learning_rate": 1.8167210717551224e-05, "loss": 0.4251, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 473, "tokens_per_second_per_gpu": 18574.09, "total_tokens": 42806582 }, { "epoch": 0.09469110522898666, "grad_norm": 0.7578125, "learning_rate": 1.8157658496602836e-05, "loss": 0.4265, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 474, "tokens_per_second_per_gpu": 18001.53, "total_tokens": 42895962 }, { "epoch": 0.09489087549318284, "grad_norm": 0.7421875, "learning_rate": 1.8148083972927617e-05, "loss": 0.4355, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 475, "tokens_per_second_per_gpu": 18252.98, "total_tokens": 42985294 }, { "epoch": 0.09509064575737901, "grad_norm": 0.70703125, "learning_rate": 1.813848717270195e-05, "loss": 0.4578, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 476, "tokens_per_second_per_gpu": 19131.12, "total_tokens": 43080342 }, { "epoch": 0.09529041602157519, "grad_norm": 0.71484375, "learning_rate": 1.8128868122163125e-05, "loss": 0.4309, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 477, "tokens_per_second_per_gpu": 18866.88, "total_tokens": 43172457 }, { "epoch": 0.09549018628577137, "grad_norm": 0.734375, "learning_rate": 1.8119226847609247e-05, "loss": 0.4366, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 478, "tokens_per_second_per_gpu": 18565.81, "total_tokens": 43262874 }, { "epoch": 0.09568995654996754, "grad_norm": 0.73828125, "learning_rate": 1.81095633753992e-05, "loss": 0.4647, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 479, "tokens_per_second_per_gpu": 20001.33, "total_tokens": 43358319 }, { "epoch": 0.09588972681416372, "grad_norm": 0.73828125, "learning_rate": 1.809987773195255e-05, "loss": 0.4295, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 480, "tokens_per_second_per_gpu": 18694.77, "total_tokens": 43448494 }, { "epoch": 0.09608949707835988, "grad_norm": 0.73046875, "learning_rate": 1.8090169943749477e-05, "loss": 0.4476, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 481, "tokens_per_second_per_gpu": 19830.05, "total_tokens": 43543709 }, { "epoch": 0.09628926734255606, "grad_norm": 0.7578125, "learning_rate": 1.8080440037330697e-05, "loss": 0.4222, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 482, "tokens_per_second_per_gpu": 16667.19, "total_tokens": 43626251 }, { "epoch": 0.09648903760675223, "grad_norm": 0.78515625, "learning_rate": 1.8070688039297403e-05, "loss": 0.4291, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 483, "tokens_per_second_per_gpu": 16229.13, "total_tokens": 43705183 }, { "epoch": 0.09668880787094841, "grad_norm": 0.71484375, "learning_rate": 1.8060913976311192e-05, "loss": 0.4281, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 484, "tokens_per_second_per_gpu": 19905.31, "total_tokens": 43801144 }, { "epoch": 0.09688857813514458, "grad_norm": 0.75390625, "learning_rate": 1.8051117875093974e-05, "loss": 0.3972, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 485, "tokens_per_second_per_gpu": 16992.2, "total_tokens": 43883917 }, { "epoch": 0.09708834839934076, "grad_norm": 0.80078125, "learning_rate": 1.804129976242792e-05, "loss": 0.4097, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 486, "tokens_per_second_per_gpu": 17065.92, "total_tokens": 43967262 }, { "epoch": 0.09728811866353693, "grad_norm": 0.76171875, "learning_rate": 1.8031459665155363e-05, "loss": 0.4215, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 487, "tokens_per_second_per_gpu": 18389.08, "total_tokens": 44056001 }, { "epoch": 0.09748788892773311, "grad_norm": 0.703125, "learning_rate": 1.802159761017877e-05, "loss": 0.4318, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 488, "tokens_per_second_per_gpu": 18725.55, "total_tokens": 44145662 }, { "epoch": 0.09768765919192929, "grad_norm": 0.73046875, "learning_rate": 1.8011713624460608e-05, "loss": 0.452, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 489, "tokens_per_second_per_gpu": 19144.41, "total_tokens": 44239031 }, { "epoch": 0.09788742945612545, "grad_norm": 0.71484375, "learning_rate": 1.800180773502333e-05, "loss": 0.4275, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 490, "tokens_per_second_per_gpu": 18449.64, "total_tokens": 44330574 }, { "epoch": 0.09808719972032164, "grad_norm": 0.71484375, "learning_rate": 1.7991879968949248e-05, "loss": 0.436, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 491, "tokens_per_second_per_gpu": 19979.05, "total_tokens": 44425601 }, { "epoch": 0.0982869699845178, "grad_norm": 0.734375, "learning_rate": 1.7981930353380502e-05, "loss": 0.4176, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 492, "tokens_per_second_per_gpu": 17901.35, "total_tokens": 44512930 }, { "epoch": 0.09848674024871398, "grad_norm": 0.703125, "learning_rate": 1.797195891551896e-05, "loss": 0.3952, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 493, "tokens_per_second_per_gpu": 17940.68, "total_tokens": 44599621 }, { "epoch": 0.09868651051291015, "grad_norm": 0.734375, "learning_rate": 1.796196568262615e-05, "loss": 0.4404, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 494, "tokens_per_second_per_gpu": 19264.65, "total_tokens": 44692261 }, { "epoch": 0.09888628077710633, "grad_norm": 0.7890625, "learning_rate": 1.795195068202319e-05, "loss": 0.4278, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 495, "tokens_per_second_per_gpu": 18076.99, "total_tokens": 44779354 }, { "epoch": 0.0990860510413025, "grad_norm": 0.734375, "learning_rate": 1.7941913941090712e-05, "loss": 0.4252, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 496, "tokens_per_second_per_gpu": 18602.28, "total_tokens": 44869736 }, { "epoch": 0.09928582130549868, "grad_norm": 0.75390625, "learning_rate": 1.793185548726878e-05, "loss": 0.4518, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 497, "tokens_per_second_per_gpu": 19099.19, "total_tokens": 44963646 }, { "epoch": 0.09948559156969485, "grad_norm": 0.71484375, "learning_rate": 1.7921775348056822e-05, "loss": 0.3845, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 498, "tokens_per_second_per_gpu": 16508.16, "total_tokens": 45046570 }, { "epoch": 0.09968536183389103, "grad_norm": 0.7578125, "learning_rate": 1.7911673551013553e-05, "loss": 0.4534, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 499, "tokens_per_second_per_gpu": 17870.7, "total_tokens": 45134425 }, { "epoch": 0.0998851320980872, "grad_norm": 0.70703125, "learning_rate": 1.7901550123756906e-05, "loss": 0.4493, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 500, "tokens_per_second_per_gpu": 20954.15, "total_tokens": 45235592 }, { "epoch": 0.10008490236228337, "grad_norm": 0.7265625, "learning_rate": 1.789140509396394e-05, "loss": 0.4356, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 501, "tokens_per_second_per_gpu": 19823.72, "total_tokens": 45330454 }, { "epoch": 0.10028467262647955, "grad_norm": 0.74609375, "learning_rate": 1.7881238489370776e-05, "loss": 0.4051, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 502, "tokens_per_second_per_gpu": 16256.05, "total_tokens": 45410084 }, { "epoch": 0.10048444289067572, "grad_norm": 0.7421875, "learning_rate": 1.7871050337772527e-05, "loss": 0.4139, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 503, "tokens_per_second_per_gpu": 17571.93, "total_tokens": 45495898 }, { "epoch": 0.1006842131548719, "grad_norm": 0.77734375, "learning_rate": 1.7860840667023212e-05, "loss": 0.4386, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 504, "tokens_per_second_per_gpu": 18145.54, "total_tokens": 45584602 }, { "epoch": 0.10088398341906807, "grad_norm": 0.72265625, "learning_rate": 1.785060950503568e-05, "loss": 0.4369, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 505, "tokens_per_second_per_gpu": 19255.48, "total_tokens": 45678219 }, { "epoch": 0.10108375368326425, "grad_norm": 0.7734375, "learning_rate": 1.784035687978153e-05, "loss": 0.4553, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 506, "tokens_per_second_per_gpu": 18722.62, "total_tokens": 45769353 }, { "epoch": 0.10128352394746042, "grad_norm": 0.76953125, "learning_rate": 1.783008281929106e-05, "loss": 0.4323, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 507, "tokens_per_second_per_gpu": 16529.92, "total_tokens": 45850767 }, { "epoch": 0.1014832942116566, "grad_norm": 0.703125, "learning_rate": 1.781978735165315e-05, "loss": 0.4323, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 508, "tokens_per_second_per_gpu": 19527.25, "total_tokens": 45946331 }, { "epoch": 0.10168306447585276, "grad_norm": 0.72265625, "learning_rate": 1.780947050501522e-05, "loss": 0.4659, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 509, "tokens_per_second_per_gpu": 20632.55, "total_tokens": 46046042 }, { "epoch": 0.10188283474004894, "grad_norm": 0.75390625, "learning_rate": 1.7799132307583133e-05, "loss": 0.4157, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 510, "tokens_per_second_per_gpu": 16872.18, "total_tokens": 46129723 }, { "epoch": 0.10208260500424512, "grad_norm": 0.7578125, "learning_rate": 1.7788772787621126e-05, "loss": 0.4221, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 511, "tokens_per_second_per_gpu": 18010.53, "total_tokens": 46216901 }, { "epoch": 0.10228237526844129, "grad_norm": 0.71484375, "learning_rate": 1.7778391973451728e-05, "loss": 0.4209, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 512, "tokens_per_second_per_gpu": 18648.54, "total_tokens": 46307009 }, { "epoch": 0.10248214553263747, "grad_norm": 1.7109375, "learning_rate": 1.7767989893455696e-05, "loss": 0.4432, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 513, "tokens_per_second_per_gpu": 18950.16, "total_tokens": 46398522 }, { "epoch": 0.10268191579683364, "grad_norm": 0.73828125, "learning_rate": 1.7757566576071916e-05, "loss": 0.4334, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 514, "tokens_per_second_per_gpu": 19348.56, "total_tokens": 46492828 }, { "epoch": 0.10288168606102982, "grad_norm": 0.71484375, "learning_rate": 1.7747122049797336e-05, "loss": 0.4048, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 515, "tokens_per_second_per_gpu": 17455.66, "total_tokens": 46579099 }, { "epoch": 0.10308145632522599, "grad_norm": 0.7265625, "learning_rate": 1.7736656343186897e-05, "loss": 0.4151, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 516, "tokens_per_second_per_gpu": 17575.15, "total_tokens": 46665463 }, { "epoch": 0.10328122658942217, "grad_norm": 0.77734375, "learning_rate": 1.7726169484853438e-05, "loss": 0.4156, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 517, "tokens_per_second_per_gpu": 18758.96, "total_tokens": 46756408 }, { "epoch": 0.10348099685361833, "grad_norm": 0.74609375, "learning_rate": 1.771566150346763e-05, "loss": 0.4435, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 518, "tokens_per_second_per_gpu": 20156.35, "total_tokens": 46853073 }, { "epoch": 0.10368076711781452, "grad_norm": 0.7109375, "learning_rate": 1.7705132427757895e-05, "loss": 0.4284, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 519, "tokens_per_second_per_gpu": 18743.09, "total_tokens": 46943243 }, { "epoch": 0.10388053738201068, "grad_norm": 0.765625, "learning_rate": 1.769458228651032e-05, "loss": 0.454, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 520, "tokens_per_second_per_gpu": 19357.57, "total_tokens": 47037608 }, { "epoch": 0.10408030764620686, "grad_norm": 0.71875, "learning_rate": 1.7684011108568593e-05, "loss": 0.4596, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 521, "tokens_per_second_per_gpu": 19707.94, "total_tokens": 47133207 }, { "epoch": 0.10428007791040304, "grad_norm": 0.71484375, "learning_rate": 1.7673418922833904e-05, "loss": 0.3896, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 522, "tokens_per_second_per_gpu": 17268.67, "total_tokens": 47217287 }, { "epoch": 0.10447984817459921, "grad_norm": 0.7109375, "learning_rate": 1.7662805758264894e-05, "loss": 0.4405, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 523, "tokens_per_second_per_gpu": 19096.68, "total_tokens": 47309169 }, { "epoch": 0.10467961843879539, "grad_norm": 0.76171875, "learning_rate": 1.765217164387754e-05, "loss": 0.4458, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 524, "tokens_per_second_per_gpu": 17501.19, "total_tokens": 47395117 }, { "epoch": 0.10487938870299156, "grad_norm": 0.73828125, "learning_rate": 1.7641516608745114e-05, "loss": 0.4464, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 525, "tokens_per_second_per_gpu": 19754.87, "total_tokens": 47490847 }, { "epoch": 0.10507915896718774, "grad_norm": 0.74609375, "learning_rate": 1.7630840681998068e-05, "loss": 0.4174, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 526, "tokens_per_second_per_gpu": 18140.82, "total_tokens": 47578584 }, { "epoch": 0.1052789292313839, "grad_norm": 0.7421875, "learning_rate": 1.7620143892823977e-05, "loss": 0.4207, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 527, "tokens_per_second_per_gpu": 19673.73, "total_tokens": 47673035 }, { "epoch": 0.10547869949558009, "grad_norm": 0.7265625, "learning_rate": 1.760942627046746e-05, "loss": 0.4639, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 528, "tokens_per_second_per_gpu": 19598.92, "total_tokens": 47767630 }, { "epoch": 0.10567846975977625, "grad_norm": 0.7890625, "learning_rate": 1.759868784423009e-05, "loss": 0.4778, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 529, "tokens_per_second_per_gpu": 19124.24, "total_tokens": 47860342 }, { "epoch": 0.10587824002397243, "grad_norm": 0.71875, "learning_rate": 1.75879286434703e-05, "loss": 0.4439, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 530, "tokens_per_second_per_gpu": 19128.86, "total_tokens": 47954112 }, { "epoch": 0.1060780102881686, "grad_norm": 0.74609375, "learning_rate": 1.757714869760335e-05, "loss": 0.4363, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 531, "tokens_per_second_per_gpu": 19947.27, "total_tokens": 48049547 }, { "epoch": 0.10627778055236478, "grad_norm": 0.7421875, "learning_rate": 1.7566348036101187e-05, "loss": 0.4241, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 532, "tokens_per_second_per_gpu": 17903.34, "total_tokens": 48137012 }, { "epoch": 0.10647755081656095, "grad_norm": 0.76953125, "learning_rate": 1.7555526688492418e-05, "loss": 0.432, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 533, "tokens_per_second_per_gpu": 18471.9, "total_tokens": 48225714 }, { "epoch": 0.10667732108075713, "grad_norm": 0.73046875, "learning_rate": 1.754468468436219e-05, "loss": 0.4292, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 534, "tokens_per_second_per_gpu": 18817.76, "total_tokens": 48317958 }, { "epoch": 0.10687709134495331, "grad_norm": 0.7265625, "learning_rate": 1.7533822053352127e-05, "loss": 0.4392, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 535, "tokens_per_second_per_gpu": 18995.79, "total_tokens": 48412348 }, { "epoch": 0.10707686160914948, "grad_norm": 0.8125, "learning_rate": 1.752293882516025e-05, "loss": 0.4481, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 536, "tokens_per_second_per_gpu": 18493.25, "total_tokens": 48503315 }, { "epoch": 0.10727663187334566, "grad_norm": 0.7890625, "learning_rate": 1.7512035029540887e-05, "loss": 0.4392, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 537, "tokens_per_second_per_gpu": 19339.67, "total_tokens": 48595844 }, { "epoch": 0.10747640213754182, "grad_norm": 0.765625, "learning_rate": 1.7501110696304598e-05, "loss": 0.4231, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 538, "tokens_per_second_per_gpu": 17774.79, "total_tokens": 48683322 }, { "epoch": 0.107676172401738, "grad_norm": 0.74609375, "learning_rate": 1.7490165855318097e-05, "loss": 0.4386, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 539, "tokens_per_second_per_gpu": 18413.71, "total_tokens": 48771978 }, { "epoch": 0.10787594266593417, "grad_norm": 0.73046875, "learning_rate": 1.7479200536504154e-05, "loss": 0.4344, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 540, "tokens_per_second_per_gpu": 19174.59, "total_tokens": 48864380 }, { "epoch": 0.10807571293013035, "grad_norm": 0.734375, "learning_rate": 1.7468214769841542e-05, "loss": 0.4261, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 541, "tokens_per_second_per_gpu": 17981.58, "total_tokens": 48951920 }, { "epoch": 0.10827548319432652, "grad_norm": 0.7109375, "learning_rate": 1.745720858536492e-05, "loss": 0.4286, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 542, "tokens_per_second_per_gpu": 21228.67, "total_tokens": 49052227 }, { "epoch": 0.1084752534585227, "grad_norm": 0.7265625, "learning_rate": 1.744618201316478e-05, "loss": 0.4177, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 543, "tokens_per_second_per_gpu": 18268.34, "total_tokens": 49141076 }, { "epoch": 0.10867502372271887, "grad_norm": 0.71875, "learning_rate": 1.7435135083387345e-05, "loss": 0.4183, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 544, "tokens_per_second_per_gpu": 19859.62, "total_tokens": 49236552 }, { "epoch": 0.10887479398691505, "grad_norm": 0.7421875, "learning_rate": 1.74240678262345e-05, "loss": 0.4072, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 545, "tokens_per_second_per_gpu": 16798.94, "total_tokens": 49318484 }, { "epoch": 0.10907456425111123, "grad_norm": 0.72265625, "learning_rate": 1.7412980271963712e-05, "loss": 0.4066, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 546, "tokens_per_second_per_gpu": 18028.2, "total_tokens": 49405995 }, { "epoch": 0.1092743345153074, "grad_norm": 0.7421875, "learning_rate": 1.7401872450887917e-05, "loss": 0.4114, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 547, "tokens_per_second_per_gpu": 17745.18, "total_tokens": 49492712 }, { "epoch": 0.10947410477950358, "grad_norm": 0.69921875, "learning_rate": 1.7390744393375487e-05, "loss": 0.4299, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 548, "tokens_per_second_per_gpu": 19041.54, "total_tokens": 49584858 }, { "epoch": 0.10967387504369974, "grad_norm": 0.7421875, "learning_rate": 1.7379596129850098e-05, "loss": 0.4268, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 549, "tokens_per_second_per_gpu": 18171.39, "total_tokens": 49673057 }, { "epoch": 0.10987364530789592, "grad_norm": 0.7265625, "learning_rate": 1.7368427690790678e-05, "loss": 0.4586, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 550, "tokens_per_second_per_gpu": 20115.43, "total_tokens": 49769670 }, { "epoch": 0.11007341557209209, "grad_norm": 0.73046875, "learning_rate": 1.735723910673132e-05, "loss": 0.4574, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 551, "tokens_per_second_per_gpu": 18498.67, "total_tokens": 49860822 }, { "epoch": 0.11027318583628827, "grad_norm": 0.73828125, "learning_rate": 1.734603040826117e-05, "loss": 0.4702, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 552, "tokens_per_second_per_gpu": 19673.75, "total_tokens": 49956172 }, { "epoch": 0.11047295610048444, "grad_norm": 0.7109375, "learning_rate": 1.73348016260244e-05, "loss": 0.4261, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 553, "tokens_per_second_per_gpu": 18328.15, "total_tokens": 50045486 }, { "epoch": 0.11067272636468062, "grad_norm": 0.7265625, "learning_rate": 1.732355279072006e-05, "loss": 0.4369, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 554, "tokens_per_second_per_gpu": 19403.07, "total_tokens": 50140476 }, { "epoch": 0.11087249662887678, "grad_norm": 0.7421875, "learning_rate": 1.731228393310204e-05, "loss": 0.4345, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 555, "tokens_per_second_per_gpu": 18145.14, "total_tokens": 50229063 }, { "epoch": 0.11107226689307297, "grad_norm": 0.75390625, "learning_rate": 1.7300995083978965e-05, "loss": 0.4233, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 556, "tokens_per_second_per_gpu": 19543.7, "total_tokens": 50325174 }, { "epoch": 0.11127203715726915, "grad_norm": 0.734375, "learning_rate": 1.7289686274214116e-05, "loss": 0.4647, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 557, "tokens_per_second_per_gpu": 19453.43, "total_tokens": 50419450 }, { "epoch": 0.11147180742146531, "grad_norm": 0.734375, "learning_rate": 1.7278357534725353e-05, "loss": 0.4489, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 558, "tokens_per_second_per_gpu": 18381.71, "total_tokens": 50509585 }, { "epoch": 0.1116715776856615, "grad_norm": 0.71875, "learning_rate": 1.726700889648501e-05, "loss": 0.4384, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 559, "tokens_per_second_per_gpu": 18326.12, "total_tokens": 50599489 }, { "epoch": 0.11187134794985766, "grad_norm": 0.7421875, "learning_rate": 1.7255640390519838e-05, "loss": 0.4121, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 560, "tokens_per_second_per_gpu": 19128.87, "total_tokens": 50691212 }, { "epoch": 0.11207111821405384, "grad_norm": 0.72265625, "learning_rate": 1.7244252047910893e-05, "loss": 0.4207, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 561, "tokens_per_second_per_gpu": 19322.25, "total_tokens": 50782508 }, { "epoch": 0.11227088847825001, "grad_norm": 0.7265625, "learning_rate": 1.7232843899793467e-05, "loss": 0.4452, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 562, "tokens_per_second_per_gpu": 18491.12, "total_tokens": 50873515 }, { "epoch": 0.11247065874244619, "grad_norm": 0.76171875, "learning_rate": 1.7221415977357008e-05, "loss": 0.402, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 563, "tokens_per_second_per_gpu": 18048.61, "total_tokens": 50960179 }, { "epoch": 0.11267042900664236, "grad_norm": 0.734375, "learning_rate": 1.7209968311845014e-05, "loss": 0.4211, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 564, "tokens_per_second_per_gpu": 17469.75, "total_tokens": 51045625 }, { "epoch": 0.11287019927083854, "grad_norm": 0.73046875, "learning_rate": 1.7198500934554966e-05, "loss": 0.4371, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 565, "tokens_per_second_per_gpu": 18457.88, "total_tokens": 51136316 }, { "epoch": 0.1130699695350347, "grad_norm": 0.73046875, "learning_rate": 1.718701387683824e-05, "loss": 0.4197, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 566, "tokens_per_second_per_gpu": 18260.89, "total_tokens": 51225028 }, { "epoch": 0.11326973979923088, "grad_norm": 0.73046875, "learning_rate": 1.717550717010001e-05, "loss": 0.4542, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 567, "tokens_per_second_per_gpu": 19723.45, "total_tokens": 51321212 }, { "epoch": 0.11346951006342706, "grad_norm": 0.76171875, "learning_rate": 1.716398084579917e-05, "loss": 0.4476, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 568, "tokens_per_second_per_gpu": 20293.65, "total_tokens": 51419538 }, { "epoch": 0.11366928032762323, "grad_norm": 0.7734375, "learning_rate": 1.7152434935448257e-05, "loss": 0.4248, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 569, "tokens_per_second_per_gpu": 18630.76, "total_tokens": 51509706 }, { "epoch": 0.11386905059181941, "grad_norm": 0.78125, "learning_rate": 1.7140869470613344e-05, "loss": 0.3914, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 570, "tokens_per_second_per_gpu": 18011.95, "total_tokens": 51597312 }, { "epoch": 0.11406882085601558, "grad_norm": 0.75, "learning_rate": 1.7129284482913973e-05, "loss": 0.4325, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 571, "tokens_per_second_per_gpu": 18087.39, "total_tokens": 51685967 }, { "epoch": 0.11426859112021176, "grad_norm": 0.7578125, "learning_rate": 1.7117680004023057e-05, "loss": 0.4227, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 572, "tokens_per_second_per_gpu": 18524.42, "total_tokens": 51775943 }, { "epoch": 0.11446836138440793, "grad_norm": 0.8203125, "learning_rate": 1.7106056065666793e-05, "loss": 0.3863, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 573, "tokens_per_second_per_gpu": 17047.41, "total_tokens": 51858944 }, { "epoch": 0.11466813164860411, "grad_norm": 0.74609375, "learning_rate": 1.7094412699624596e-05, "loss": 0.4321, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 574, "tokens_per_second_per_gpu": 18822.2, "total_tokens": 51950874 }, { "epoch": 0.11486790191280027, "grad_norm": 0.71875, "learning_rate": 1.7082749937728972e-05, "loss": 0.3655, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 575, "tokens_per_second_per_gpu": 16560.32, "total_tokens": 52033041 }, { "epoch": 0.11506767217699646, "grad_norm": 0.75, "learning_rate": 1.7071067811865477e-05, "loss": 0.4396, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 576, "tokens_per_second_per_gpu": 19659.22, "total_tokens": 52128535 }, { "epoch": 0.11526744244119262, "grad_norm": 0.73046875, "learning_rate": 1.705936635397259e-05, "loss": 0.4133, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 577, "tokens_per_second_per_gpu": 18921.22, "total_tokens": 52220909 }, { "epoch": 0.1154672127053888, "grad_norm": 0.7578125, "learning_rate": 1.7047645596041654e-05, "loss": 0.4056, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 578, "tokens_per_second_per_gpu": 18352.47, "total_tokens": 52309231 }, { "epoch": 0.11566698296958498, "grad_norm": 0.73046875, "learning_rate": 1.703590557011677e-05, "loss": 0.4158, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 579, "tokens_per_second_per_gpu": 17747.56, "total_tokens": 52397148 }, { "epoch": 0.11586675323378115, "grad_norm": 0.73046875, "learning_rate": 1.7024146308294725e-05, "loss": 0.4037, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 580, "tokens_per_second_per_gpu": 18640.89, "total_tokens": 52486907 }, { "epoch": 0.11606652349797733, "grad_norm": 0.7578125, "learning_rate": 1.7012367842724887e-05, "loss": 0.4263, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 581, "tokens_per_second_per_gpu": 18632.36, "total_tokens": 52577320 }, { "epoch": 0.1162662937621735, "grad_norm": 0.7265625, "learning_rate": 1.7000570205609136e-05, "loss": 0.4649, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 582, "tokens_per_second_per_gpu": 20136.77, "total_tokens": 52675774 }, { "epoch": 0.11646606402636968, "grad_norm": 0.78125, "learning_rate": 1.6988753429201756e-05, "loss": 0.4318, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 583, "tokens_per_second_per_gpu": 18917.05, "total_tokens": 52767207 }, { "epoch": 0.11666583429056585, "grad_norm": 0.6953125, "learning_rate": 1.697691754580937e-05, "loss": 0.4013, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 584, "tokens_per_second_per_gpu": 19631.44, "total_tokens": 52861508 }, { "epoch": 0.11686560455476203, "grad_norm": 0.75390625, "learning_rate": 1.6965062587790823e-05, "loss": 0.4279, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 585, "tokens_per_second_per_gpu": 18810.94, "total_tokens": 52953106 }, { "epoch": 0.11706537481895819, "grad_norm": 0.73046875, "learning_rate": 1.6953188587557122e-05, "loss": 0.3971, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 586, "tokens_per_second_per_gpu": 18937.38, "total_tokens": 53044807 }, { "epoch": 0.11726514508315437, "grad_norm": 0.7265625, "learning_rate": 1.694129557757133e-05, "loss": 0.4318, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 587, "tokens_per_second_per_gpu": 19397.72, "total_tokens": 53138442 }, { "epoch": 0.11746491534735054, "grad_norm": 0.828125, "learning_rate": 1.692938359034848e-05, "loss": 0.4212, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 588, "tokens_per_second_per_gpu": 19004.26, "total_tokens": 53230066 }, { "epoch": 0.11766468561154672, "grad_norm": 0.72265625, "learning_rate": 1.6917452658455496e-05, "loss": 0.4189, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 589, "tokens_per_second_per_gpu": 18368.64, "total_tokens": 53319867 }, { "epoch": 0.1178644558757429, "grad_norm": 0.79296875, "learning_rate": 1.6905502814511085e-05, "loss": 0.411, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 590, "tokens_per_second_per_gpu": 18572.14, "total_tokens": 53409036 }, { "epoch": 0.11806422613993907, "grad_norm": 0.76171875, "learning_rate": 1.6893534091185658e-05, "loss": 0.4013, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 591, "tokens_per_second_per_gpu": 16608.35, "total_tokens": 53492102 }, { "epoch": 0.11826399640413525, "grad_norm": 0.73828125, "learning_rate": 1.6881546521201263e-05, "loss": 0.4393, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 592, "tokens_per_second_per_gpu": 18689.0, "total_tokens": 53583749 }, { "epoch": 0.11846376666833142, "grad_norm": 0.67578125, "learning_rate": 1.6869540137331445e-05, "loss": 0.3976, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 593, "tokens_per_second_per_gpu": 19054.5, "total_tokens": 53675554 }, { "epoch": 0.1186635369325276, "grad_norm": 0.7265625, "learning_rate": 1.6857514972401207e-05, "loss": 0.4211, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 594, "tokens_per_second_per_gpu": 17957.39, "total_tokens": 53763981 }, { "epoch": 0.11886330719672376, "grad_norm": 0.7421875, "learning_rate": 1.684547105928689e-05, "loss": 0.4283, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 595, "tokens_per_second_per_gpu": 19763.61, "total_tokens": 53857905 }, { "epoch": 0.11906307746091994, "grad_norm": 0.7890625, "learning_rate": 1.6833408430916085e-05, "loss": 0.4443, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 596, "tokens_per_second_per_gpu": 18629.89, "total_tokens": 53948173 }, { "epoch": 0.11926284772511611, "grad_norm": 0.82421875, "learning_rate": 1.6821327120267567e-05, "loss": 0.3953, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 597, "tokens_per_second_per_gpu": 18030.77, "total_tokens": 54035722 }, { "epoch": 0.11946261798931229, "grad_norm": 0.75390625, "learning_rate": 1.6809227160371173e-05, "loss": 0.4155, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 598, "tokens_per_second_per_gpu": 18332.31, "total_tokens": 54125075 }, { "epoch": 0.11966238825350846, "grad_norm": 0.73828125, "learning_rate": 1.6797108584307732e-05, "loss": 0.4282, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 599, "tokens_per_second_per_gpu": 18725.17, "total_tokens": 54216789 }, { "epoch": 0.11986215851770464, "grad_norm": 0.74609375, "learning_rate": 1.6784971425208967e-05, "loss": 0.4155, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 600, "tokens_per_second_per_gpu": 19050.18, "total_tokens": 54308457 }, { "epoch": 0.12006192878190082, "grad_norm": 0.734375, "learning_rate": 1.6772815716257414e-05, "loss": 0.4383, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 601, "tokens_per_second_per_gpu": 19978.95, "total_tokens": 54404146 }, { "epoch": 0.12026169904609699, "grad_norm": 0.71484375, "learning_rate": 1.6760641490686307e-05, "loss": 0.4168, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 602, "tokens_per_second_per_gpu": 18336.05, "total_tokens": 54492769 }, { "epoch": 0.12046146931029317, "grad_norm": 0.7265625, "learning_rate": 1.674844878177952e-05, "loss": 0.4361, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 603, "tokens_per_second_per_gpu": 17825.42, "total_tokens": 54578931 }, { "epoch": 0.12066123957448933, "grad_norm": 0.73828125, "learning_rate": 1.6736237622871453e-05, "loss": 0.3924, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 604, "tokens_per_second_per_gpu": 18955.06, "total_tokens": 54670975 }, { "epoch": 0.12086100983868552, "grad_norm": 0.75390625, "learning_rate": 1.6724008047346946e-05, "loss": 0.4424, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 605, "tokens_per_second_per_gpu": 20463.94, "total_tokens": 54769448 }, { "epoch": 0.12106078010288168, "grad_norm": 0.734375, "learning_rate": 1.6711760088641197e-05, "loss": 0.4181, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 606, "tokens_per_second_per_gpu": 18074.29, "total_tokens": 54857374 }, { "epoch": 0.12126055036707786, "grad_norm": 0.76953125, "learning_rate": 1.6699493780239652e-05, "loss": 0.3921, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 607, "tokens_per_second_per_gpu": 17476.64, "total_tokens": 54941484 }, { "epoch": 0.12146032063127403, "grad_norm": 0.72265625, "learning_rate": 1.668720915567793e-05, "loss": 0.4167, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 608, "tokens_per_second_per_gpu": 18693.55, "total_tokens": 55031605 }, { "epoch": 0.12166009089547021, "grad_norm": 0.703125, "learning_rate": 1.667490624854173e-05, "loss": 0.4179, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 609, "tokens_per_second_per_gpu": 19435.61, "total_tokens": 55126467 }, { "epoch": 0.12185986115966638, "grad_norm": 0.75390625, "learning_rate": 1.6662585092466722e-05, "loss": 0.4446, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 610, "tokens_per_second_per_gpu": 19336.36, "total_tokens": 55221792 }, { "epoch": 0.12205963142386256, "grad_norm": 0.7734375, "learning_rate": 1.6650245721138483e-05, "loss": 0.3856, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 611, "tokens_per_second_per_gpu": 17603.44, "total_tokens": 55306263 }, { "epoch": 0.12225940168805874, "grad_norm": 0.7890625, "learning_rate": 1.6637888168292385e-05, "loss": 0.4077, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 612, "tokens_per_second_per_gpu": 17045.76, "total_tokens": 55389836 }, { "epoch": 0.1224591719522549, "grad_norm": 0.76171875, "learning_rate": 1.66255124677135e-05, "loss": 0.4541, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 613, "tokens_per_second_per_gpu": 19028.96, "total_tokens": 55480911 }, { "epoch": 0.12265894221645109, "grad_norm": 0.7421875, "learning_rate": 1.661311865323652e-05, "loss": 0.4276, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 614, "tokens_per_second_per_gpu": 17680.77, "total_tokens": 55569379 }, { "epoch": 0.12285871248064725, "grad_norm": 0.70703125, "learning_rate": 1.6600706758745668e-05, "loss": 0.4168, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 615, "tokens_per_second_per_gpu": 19284.2, "total_tokens": 55664022 }, { "epoch": 0.12305848274484343, "grad_norm": 0.77734375, "learning_rate": 1.658827681817458e-05, "loss": 0.394, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 616, "tokens_per_second_per_gpu": 17585.49, "total_tokens": 55748330 }, { "epoch": 0.1232582530090396, "grad_norm": 0.69140625, "learning_rate": 1.6575828865506246e-05, "loss": 0.3929, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 617, "tokens_per_second_per_gpu": 19970.52, "total_tokens": 55844646 }, { "epoch": 0.12345802327323578, "grad_norm": 0.734375, "learning_rate": 1.6563362934772893e-05, "loss": 0.407, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 618, "tokens_per_second_per_gpu": 19372.72, "total_tokens": 55936545 }, { "epoch": 0.12365779353743195, "grad_norm": 0.78125, "learning_rate": 1.6550879060055897e-05, "loss": 0.41, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 619, "tokens_per_second_per_gpu": 18239.41, "total_tokens": 56025406 }, { "epoch": 0.12385756380162813, "grad_norm": 0.71875, "learning_rate": 1.6538377275485694e-05, "loss": 0.3884, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 620, "tokens_per_second_per_gpu": 18631.65, "total_tokens": 56115754 }, { "epoch": 0.1240573340658243, "grad_norm": 0.76171875, "learning_rate": 1.6525857615241686e-05, "loss": 0.4134, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 621, "tokens_per_second_per_gpu": 17913.83, "total_tokens": 56201788 }, { "epoch": 0.12425710433002048, "grad_norm": 0.703125, "learning_rate": 1.651332011355215e-05, "loss": 0.3989, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 622, "tokens_per_second_per_gpu": 17630.83, "total_tokens": 56287872 }, { "epoch": 0.12445687459421666, "grad_norm": 0.74609375, "learning_rate": 1.6500764804694132e-05, "loss": 0.4194, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 623, "tokens_per_second_per_gpu": 18342.33, "total_tokens": 56375507 }, { "epoch": 0.12465664485841282, "grad_norm": 0.77734375, "learning_rate": 1.6488191722993372e-05, "loss": 0.4335, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 624, "tokens_per_second_per_gpu": 19737.66, "total_tokens": 56469658 }, { "epoch": 0.124856415122609, "grad_norm": 0.75390625, "learning_rate": 1.647560090282419e-05, "loss": 0.4351, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 625, "tokens_per_second_per_gpu": 20651.74, "total_tokens": 56568267 }, { "epoch": 0.12505618538680519, "grad_norm": 0.74609375, "learning_rate": 1.646299237860941e-05, "loss": 0.4103, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 626, "tokens_per_second_per_gpu": 17901.29, "total_tokens": 56656162 }, { "epoch": 0.12525595565100134, "grad_norm": 0.734375, "learning_rate": 1.6450366184820256e-05, "loss": 0.3995, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 627, "tokens_per_second_per_gpu": 17940.05, "total_tokens": 56743224 }, { "epoch": 0.12545572591519752, "grad_norm": 0.77734375, "learning_rate": 1.643772235597626e-05, "loss": 0.4126, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 628, "tokens_per_second_per_gpu": 16794.15, "total_tokens": 56827009 }, { "epoch": 0.1256554961793937, "grad_norm": 0.7734375, "learning_rate": 1.6425060926645168e-05, "loss": 0.4113, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 629, "tokens_per_second_per_gpu": 16540.0, "total_tokens": 56908490 }, { "epoch": 0.12585526644358988, "grad_norm": 0.75390625, "learning_rate": 1.6412381931442837e-05, "loss": 0.4285, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 630, "tokens_per_second_per_gpu": 18976.58, "total_tokens": 57000459 }, { "epoch": 0.12605503670778603, "grad_norm": 0.75390625, "learning_rate": 1.6399685405033168e-05, "loss": 0.3882, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 631, "tokens_per_second_per_gpu": 16066.22, "total_tokens": 57079643 }, { "epoch": 0.12625480697198221, "grad_norm": 0.78125, "learning_rate": 1.638697138212797e-05, "loss": 0.4453, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 632, "tokens_per_second_per_gpu": 17823.37, "total_tokens": 57165509 }, { "epoch": 0.1264545772361784, "grad_norm": 0.72265625, "learning_rate": 1.63742398974869e-05, "loss": 0.3934, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 633, "tokens_per_second_per_gpu": 18692.4, "total_tokens": 57254995 }, { "epoch": 0.12665434750037458, "grad_norm": 0.76171875, "learning_rate": 1.636149098591735e-05, "loss": 0.4272, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 634, "tokens_per_second_per_gpu": 18637.34, "total_tokens": 57345992 }, { "epoch": 0.12685411776457076, "grad_norm": 0.7578125, "learning_rate": 1.6348724682274353e-05, "loss": 0.4164, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 635, "tokens_per_second_per_gpu": 17927.81, "total_tokens": 57432589 }, { "epoch": 0.1270538880287669, "grad_norm": 1.515625, "learning_rate": 1.6335941021460507e-05, "loss": 0.4283, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 636, "tokens_per_second_per_gpu": 20299.65, "total_tokens": 57528763 }, { "epoch": 0.1272536582929631, "grad_norm": 0.75, "learning_rate": 1.6323140038425842e-05, "loss": 0.4168, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 637, "tokens_per_second_per_gpu": 17966.28, "total_tokens": 57616257 }, { "epoch": 0.12745342855715927, "grad_norm": 0.75, "learning_rate": 1.6310321768167762e-05, "loss": 0.4012, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 638, "tokens_per_second_per_gpu": 18348.37, "total_tokens": 57706247 }, { "epoch": 0.12765319882135545, "grad_norm": 0.74609375, "learning_rate": 1.6297486245730925e-05, "loss": 0.4284, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 639, "tokens_per_second_per_gpu": 19993.45, "total_tokens": 57804046 }, { "epoch": 0.1278529690855516, "grad_norm": 0.72265625, "learning_rate": 1.628463350620716e-05, "loss": 0.4143, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 640, "tokens_per_second_per_gpu": 19186.34, "total_tokens": 57898635 }, { "epoch": 0.12805273934974779, "grad_norm": 0.73046875, "learning_rate": 1.6271763584735373e-05, "loss": 0.3977, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 641, "tokens_per_second_per_gpu": 18204.39, "total_tokens": 57986857 }, { "epoch": 0.12825250961394397, "grad_norm": 0.72265625, "learning_rate": 1.6258876516501425e-05, "loss": 0.4371, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 642, "tokens_per_second_per_gpu": 18272.56, "total_tokens": 58076622 }, { "epoch": 0.12845227987814015, "grad_norm": 0.7578125, "learning_rate": 1.624597233673808e-05, "loss": 0.4161, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 643, "tokens_per_second_per_gpu": 18755.32, "total_tokens": 58167171 }, { "epoch": 0.1286520501423363, "grad_norm": 0.734375, "learning_rate": 1.6233051080724867e-05, "loss": 0.4346, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 644, "tokens_per_second_per_gpu": 19100.14, "total_tokens": 58259729 }, { "epoch": 0.12885182040653248, "grad_norm": 0.7265625, "learning_rate": 1.622011278378801e-05, "loss": 0.3946, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 645, "tokens_per_second_per_gpu": 17022.07, "total_tokens": 58343279 }, { "epoch": 0.12905159067072866, "grad_norm": 0.71875, "learning_rate": 1.6207157481300315e-05, "loss": 0.4439, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 646, "tokens_per_second_per_gpu": 20252.07, "total_tokens": 58441703 }, { "epoch": 0.12925136093492484, "grad_norm": 0.68359375, "learning_rate": 1.6194185208681085e-05, "loss": 0.4225, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 647, "tokens_per_second_per_gpu": 19395.34, "total_tokens": 58536021 }, { "epoch": 0.12945113119912102, "grad_norm": 0.75390625, "learning_rate": 1.6181196001396018e-05, "loss": 0.3982, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 648, "tokens_per_second_per_gpu": 19012.75, "total_tokens": 58631069 }, { "epoch": 0.12965090146331718, "grad_norm": 0.734375, "learning_rate": 1.616818989495711e-05, "loss": 0.4239, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 649, "tokens_per_second_per_gpu": 18620.83, "total_tokens": 58721451 }, { "epoch": 0.12985067172751336, "grad_norm": 0.77734375, "learning_rate": 1.6155166924922564e-05, "loss": 0.4379, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 650, "tokens_per_second_per_gpu": 17125.95, "total_tokens": 58804920 }, { "epoch": 0.13005044199170954, "grad_norm": 0.71875, "learning_rate": 1.6142127126896682e-05, "loss": 0.3768, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 651, "tokens_per_second_per_gpu": 17325.54, "total_tokens": 58889456 }, { "epoch": 0.13025021225590572, "grad_norm": 0.72265625, "learning_rate": 1.6129070536529767e-05, "loss": 0.4328, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 652, "tokens_per_second_per_gpu": 19978.5, "total_tokens": 58985417 }, { "epoch": 0.13044998252010187, "grad_norm": 0.72265625, "learning_rate": 1.6115997189518043e-05, "loss": 0.4278, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 653, "tokens_per_second_per_gpu": 19023.71, "total_tokens": 59077468 }, { "epoch": 0.13064975278429805, "grad_norm": 0.73046875, "learning_rate": 1.6102907121603543e-05, "loss": 0.4102, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 654, "tokens_per_second_per_gpu": 19426.91, "total_tokens": 59170550 }, { "epoch": 0.13084952304849423, "grad_norm": 0.76171875, "learning_rate": 1.6089800368574013e-05, "loss": 0.3938, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 655, "tokens_per_second_per_gpu": 17258.68, "total_tokens": 59254027 }, { "epoch": 0.1310492933126904, "grad_norm": 0.6875, "learning_rate": 1.6076676966262815e-05, "loss": 0.4, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 656, "tokens_per_second_per_gpu": 19151.96, "total_tokens": 59346943 }, { "epoch": 0.1312490635768866, "grad_norm": 0.71484375, "learning_rate": 1.6063536950548825e-05, "loss": 0.4214, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 657, "tokens_per_second_per_gpu": 18349.07, "total_tokens": 59436313 }, { "epoch": 0.13144883384108275, "grad_norm": 0.7109375, "learning_rate": 1.605038035735635e-05, "loss": 0.3821, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 658, "tokens_per_second_per_gpu": 18059.7, "total_tokens": 59524242 }, { "epoch": 0.13164860410527893, "grad_norm": 0.7421875, "learning_rate": 1.603720722265501e-05, "loss": 0.3879, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 659, "tokens_per_second_per_gpu": 17108.29, "total_tokens": 59608030 }, { "epoch": 0.1318483743694751, "grad_norm": 0.69921875, "learning_rate": 1.6024017582459652e-05, "loss": 0.3811, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 660, "tokens_per_second_per_gpu": 18275.32, "total_tokens": 59698185 }, { "epoch": 0.1320481446336713, "grad_norm": 0.734375, "learning_rate": 1.6010811472830253e-05, "loss": 0.4284, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 661, "tokens_per_second_per_gpu": 19399.98, "total_tokens": 59795206 }, { "epoch": 0.13224791489786744, "grad_norm": 0.77734375, "learning_rate": 1.599758892987181e-05, "loss": 0.4305, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 662, "tokens_per_second_per_gpu": 18335.21, "total_tokens": 59884050 }, { "epoch": 0.13244768516206362, "grad_norm": 0.77734375, "learning_rate": 1.5984349989734248e-05, "loss": 0.4308, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 663, "tokens_per_second_per_gpu": 18098.79, "total_tokens": 59972177 }, { "epoch": 0.1326474554262598, "grad_norm": 0.69921875, "learning_rate": 1.597109468861232e-05, "loss": 0.4303, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 664, "tokens_per_second_per_gpu": 20199.6, "total_tokens": 60068363 }, { "epoch": 0.13284722569045598, "grad_norm": 0.734375, "learning_rate": 1.595782306274553e-05, "loss": 0.4096, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 665, "tokens_per_second_per_gpu": 19504.7, "total_tokens": 60161759 }, { "epoch": 0.13304699595465214, "grad_norm": 0.7578125, "learning_rate": 1.5944535148417982e-05, "loss": 0.4375, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 666, "tokens_per_second_per_gpu": 17908.53, "total_tokens": 60249738 }, { "epoch": 0.13324676621884832, "grad_norm": 0.7265625, "learning_rate": 1.593123098195833e-05, "loss": 0.4157, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 667, "tokens_per_second_per_gpu": 18390.82, "total_tokens": 60340366 }, { "epoch": 0.1334465364830445, "grad_norm": 0.71875, "learning_rate": 1.5917910599739652e-05, "loss": 0.4103, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 668, "tokens_per_second_per_gpu": 19253.91, "total_tokens": 60433878 }, { "epoch": 0.13364630674724068, "grad_norm": 0.7109375, "learning_rate": 1.5904574038179372e-05, "loss": 0.3731, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 669, "tokens_per_second_per_gpu": 17344.39, "total_tokens": 60518267 }, { "epoch": 0.13384607701143686, "grad_norm": 0.734375, "learning_rate": 1.589122133373914e-05, "loss": 0.4341, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 670, "tokens_per_second_per_gpu": 18995.93, "total_tokens": 60609328 }, { "epoch": 0.134045847275633, "grad_norm": 0.7109375, "learning_rate": 1.5877852522924733e-05, "loss": 0.4287, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 671, "tokens_per_second_per_gpu": 20150.98, "total_tokens": 60705702 }, { "epoch": 0.1342456175398292, "grad_norm": 0.72265625, "learning_rate": 1.5864467642285975e-05, "loss": 0.3911, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 672, "tokens_per_second_per_gpu": 17710.31, "total_tokens": 60792023 }, { "epoch": 0.13444538780402537, "grad_norm": 0.7265625, "learning_rate": 1.5851066728416617e-05, "loss": 0.4251, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 673, "tokens_per_second_per_gpu": 17758.73, "total_tokens": 60878414 }, { "epoch": 0.13464515806822155, "grad_norm": 0.71875, "learning_rate": 1.5837649817954245e-05, "loss": 0.434, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 674, "tokens_per_second_per_gpu": 19413.63, "total_tokens": 60973398 }, { "epoch": 0.1348449283324177, "grad_norm": 0.734375, "learning_rate": 1.5824216947580183e-05, "loss": 0.417, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 675, "tokens_per_second_per_gpu": 19103.04, "total_tokens": 61066544 }, { "epoch": 0.1350446985966139, "grad_norm": 0.72265625, "learning_rate": 1.5810768154019386e-05, "loss": 0.4069, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 676, "tokens_per_second_per_gpu": 17525.7, "total_tokens": 61152603 }, { "epoch": 0.13524446886081007, "grad_norm": 0.73046875, "learning_rate": 1.5797303474040332e-05, "loss": 0.3929, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 677, "tokens_per_second_per_gpu": 18197.61, "total_tokens": 61239706 }, { "epoch": 0.13544423912500625, "grad_norm": 0.703125, "learning_rate": 1.5783822944454956e-05, "loss": 0.4025, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 678, "tokens_per_second_per_gpu": 18032.7, "total_tokens": 61327276 }, { "epoch": 0.13564400938920243, "grad_norm": 0.6953125, "learning_rate": 1.5770326602118502e-05, "loss": 0.3862, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 679, "tokens_per_second_per_gpu": 19761.85, "total_tokens": 61421794 }, { "epoch": 0.13584377965339858, "grad_norm": 0.73046875, "learning_rate": 1.575681448392946e-05, "loss": 0.4047, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 680, "tokens_per_second_per_gpu": 18602.66, "total_tokens": 61510623 }, { "epoch": 0.13604354991759476, "grad_norm": 0.71875, "learning_rate": 1.5743286626829437e-05, "loss": 0.3856, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 681, "tokens_per_second_per_gpu": 18295.5, "total_tokens": 61598103 }, { "epoch": 0.13624332018179094, "grad_norm": 0.74609375, "learning_rate": 1.5729743067803087e-05, "loss": 0.4152, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 682, "tokens_per_second_per_gpu": 18194.68, "total_tokens": 61687100 }, { "epoch": 0.13644309044598713, "grad_norm": 0.78125, "learning_rate": 1.5716183843877977e-05, "loss": 0.427, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 683, "tokens_per_second_per_gpu": 19216.2, "total_tokens": 61780032 }, { "epoch": 0.13664286071018328, "grad_norm": 0.73828125, "learning_rate": 1.570260899212451e-05, "loss": 0.392, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 684, "tokens_per_second_per_gpu": 16768.42, "total_tokens": 61861936 }, { "epoch": 0.13684263097437946, "grad_norm": 0.7421875, "learning_rate": 1.5689018549655815e-05, "loss": 0.4265, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 685, "tokens_per_second_per_gpu": 18192.79, "total_tokens": 61949633 }, { "epoch": 0.13704240123857564, "grad_norm": 0.70703125, "learning_rate": 1.5675412553627638e-05, "loss": 0.4133, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 686, "tokens_per_second_per_gpu": 18813.16, "total_tokens": 62039839 }, { "epoch": 0.13724217150277182, "grad_norm": 0.7109375, "learning_rate": 1.5661791041238258e-05, "loss": 0.4299, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 687, "tokens_per_second_per_gpu": 18138.4, "total_tokens": 62129166 }, { "epoch": 0.13744194176696797, "grad_norm": 0.7265625, "learning_rate": 1.564815404972836e-05, "loss": 0.4056, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 688, "tokens_per_second_per_gpu": 18738.97, "total_tokens": 62219379 }, { "epoch": 0.13764171203116415, "grad_norm": 0.734375, "learning_rate": 1.5634501616380967e-05, "loss": 0.4235, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 689, "tokens_per_second_per_gpu": 19840.34, "total_tokens": 62313571 }, { "epoch": 0.13784148229536033, "grad_norm": 0.68359375, "learning_rate": 1.5620833778521306e-05, "loss": 0.4322, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 690, "tokens_per_second_per_gpu": 19067.92, "total_tokens": 62407824 }, { "epoch": 0.13804125255955652, "grad_norm": 0.72265625, "learning_rate": 1.560715057351673e-05, "loss": 0.4154, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 691, "tokens_per_second_per_gpu": 18330.62, "total_tokens": 62497397 }, { "epoch": 0.1382410228237527, "grad_norm": 0.72265625, "learning_rate": 1.559345203877659e-05, "loss": 0.4342, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 692, "tokens_per_second_per_gpu": 19840.16, "total_tokens": 62591760 }, { "epoch": 0.13844079308794885, "grad_norm": 0.70703125, "learning_rate": 1.5579738211752165e-05, "loss": 0.4138, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 693, "tokens_per_second_per_gpu": 19649.55, "total_tokens": 62687740 }, { "epoch": 0.13864056335214503, "grad_norm": 0.7421875, "learning_rate": 1.556600912993653e-05, "loss": 0.3846, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 694, "tokens_per_second_per_gpu": 16997.87, "total_tokens": 62772123 }, { "epoch": 0.1388403336163412, "grad_norm": 0.6640625, "learning_rate": 1.555226483086447e-05, "loss": 0.397, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 695, "tokens_per_second_per_gpu": 19686.68, "total_tokens": 62867604 }, { "epoch": 0.1390401038805374, "grad_norm": 0.76953125, "learning_rate": 1.5538505352112373e-05, "loss": 0.399, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 696, "tokens_per_second_per_gpu": 18106.54, "total_tokens": 62954608 }, { "epoch": 0.13923987414473354, "grad_norm": 0.7109375, "learning_rate": 1.5524730731298136e-05, "loss": 0.4113, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 697, "tokens_per_second_per_gpu": 19038.97, "total_tokens": 63047777 }, { "epoch": 0.13943964440892972, "grad_norm": 0.75, "learning_rate": 1.5510941006081032e-05, "loss": 0.4086, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 698, "tokens_per_second_per_gpu": 18104.8, "total_tokens": 63136462 }, { "epoch": 0.1396394146731259, "grad_norm": 0.7265625, "learning_rate": 1.5497136214161662e-05, "loss": 0.405, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 699, "tokens_per_second_per_gpu": 19762.47, "total_tokens": 63230823 }, { "epoch": 0.1398391849373221, "grad_norm": 0.7421875, "learning_rate": 1.5483316393281783e-05, "loss": 0.3783, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 700, "tokens_per_second_per_gpu": 16495.37, "total_tokens": 63312285 }, { "epoch": 0.14003895520151827, "grad_norm": 0.76171875, "learning_rate": 1.5469481581224274e-05, "loss": 0.4032, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 701, "tokens_per_second_per_gpu": 17035.72, "total_tokens": 63398601 }, { "epoch": 0.14023872546571442, "grad_norm": 0.75390625, "learning_rate": 1.5455631815812963e-05, "loss": 0.4096, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 702, "tokens_per_second_per_gpu": 18635.21, "total_tokens": 63489118 }, { "epoch": 0.1404384957299106, "grad_norm": 0.70703125, "learning_rate": 1.5441767134912597e-05, "loss": 0.3929, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 703, "tokens_per_second_per_gpu": 18430.94, "total_tokens": 63579418 }, { "epoch": 0.14063826599410678, "grad_norm": 0.69140625, "learning_rate": 1.5427887576428675e-05, "loss": 0.4046, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 704, "tokens_per_second_per_gpu": 20181.61, "total_tokens": 63674757 }, { "epoch": 0.14083803625830296, "grad_norm": 0.703125, "learning_rate": 1.541399317830738e-05, "loss": 0.3964, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 705, "tokens_per_second_per_gpu": 18134.12, "total_tokens": 63763070 }, { "epoch": 0.14103780652249912, "grad_norm": 0.73046875, "learning_rate": 1.5400083978535475e-05, "loss": 0.4118, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 706, "tokens_per_second_per_gpu": 17151.66, "total_tokens": 63846725 }, { "epoch": 0.1412375767866953, "grad_norm": 0.7109375, "learning_rate": 1.5386160015140168e-05, "loss": 0.4316, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 707, "tokens_per_second_per_gpu": 21282.39, "total_tokens": 63948936 }, { "epoch": 0.14143734705089148, "grad_norm": 0.70703125, "learning_rate": 1.5372221326189053e-05, "loss": 0.4142, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 708, "tokens_per_second_per_gpu": 19206.89, "total_tokens": 64043009 }, { "epoch": 0.14163711731508766, "grad_norm": 0.76953125, "learning_rate": 1.5358267949789968e-05, "loss": 0.4384, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 709, "tokens_per_second_per_gpu": 18361.88, "total_tokens": 64133090 }, { "epoch": 0.1418368875792838, "grad_norm": 0.75390625, "learning_rate": 1.5344299924090915e-05, "loss": 0.4014, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 710, "tokens_per_second_per_gpu": 17963.13, "total_tokens": 64221128 }, { "epoch": 0.14203665784348, "grad_norm": 0.75, "learning_rate": 1.533031728727994e-05, "loss": 0.403, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 711, "tokens_per_second_per_gpu": 17556.13, "total_tokens": 64307391 }, { "epoch": 0.14223642810767617, "grad_norm": 0.70703125, "learning_rate": 1.531632007758504e-05, "loss": 0.4047, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 712, "tokens_per_second_per_gpu": 18307.71, "total_tokens": 64394972 }, { "epoch": 0.14243619837187235, "grad_norm": 0.73046875, "learning_rate": 1.530230833327405e-05, "loss": 0.4226, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 713, "tokens_per_second_per_gpu": 19951.17, "total_tokens": 64492602 }, { "epoch": 0.14263596863606853, "grad_norm": 0.77734375, "learning_rate": 1.5288282092654544e-05, "loss": 0.4248, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 714, "tokens_per_second_per_gpu": 18022.97, "total_tokens": 64585867 }, { "epoch": 0.14283573890026469, "grad_norm": 0.75390625, "learning_rate": 1.5274241394073733e-05, "loss": 0.4144, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 715, "tokens_per_second_per_gpu": 17461.39, "total_tokens": 64671629 }, { "epoch": 0.14303550916446087, "grad_norm": 0.73046875, "learning_rate": 1.526018627591834e-05, "loss": 0.4371, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 716, "tokens_per_second_per_gpu": 19083.25, "total_tokens": 64764108 }, { "epoch": 0.14323527942865705, "grad_norm": 0.73046875, "learning_rate": 1.524611677661454e-05, "loss": 0.4086, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 717, "tokens_per_second_per_gpu": 19781.64, "total_tokens": 64856750 }, { "epoch": 0.14343504969285323, "grad_norm": 0.7109375, "learning_rate": 1.5232032934627782e-05, "loss": 0.4021, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 718, "tokens_per_second_per_gpu": 19598.18, "total_tokens": 64950507 }, { "epoch": 0.14363481995704938, "grad_norm": 0.734375, "learning_rate": 1.5217934788462774e-05, "loss": 0.4336, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 719, "tokens_per_second_per_gpu": 19218.41, "total_tokens": 65045166 }, { "epoch": 0.14383459022124556, "grad_norm": 0.71875, "learning_rate": 1.52038223766633e-05, "loss": 0.3953, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 720, "tokens_per_second_per_gpu": 17756.11, "total_tokens": 65131775 }, { "epoch": 0.14403436048544174, "grad_norm": 0.75, "learning_rate": 1.5189695737812153e-05, "loss": 0.4097, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 721, "tokens_per_second_per_gpu": 17452.86, "total_tokens": 65218568 }, { "epoch": 0.14423413074963792, "grad_norm": 0.7265625, "learning_rate": 1.517555491053103e-05, "loss": 0.4093, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 722, "tokens_per_second_per_gpu": 18136.26, "total_tokens": 65307950 }, { "epoch": 0.1444339010138341, "grad_norm": 0.7578125, "learning_rate": 1.5161399933480402e-05, "loss": 0.4266, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 723, "tokens_per_second_per_gpu": 20351.88, "total_tokens": 65405357 }, { "epoch": 0.14463367127803026, "grad_norm": 0.765625, "learning_rate": 1.5147230845359452e-05, "loss": 0.4118, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 724, "tokens_per_second_per_gpu": 19001.43, "total_tokens": 65497035 }, { "epoch": 0.14483344154222644, "grad_norm": 0.73828125, "learning_rate": 1.5133047684905916e-05, "loss": 0.4257, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 725, "tokens_per_second_per_gpu": 18535.47, "total_tokens": 65586798 }, { "epoch": 0.14503321180642262, "grad_norm": 0.6953125, "learning_rate": 1.5118850490896012e-05, "loss": 0.3922, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 726, "tokens_per_second_per_gpu": 18034.29, "total_tokens": 65674473 }, { "epoch": 0.1452329820706188, "grad_norm": 0.7265625, "learning_rate": 1.5104639302144327e-05, "loss": 0.3893, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 727, "tokens_per_second_per_gpu": 17444.1, "total_tokens": 65761733 }, { "epoch": 0.14543275233481495, "grad_norm": 0.75390625, "learning_rate": 1.5090414157503715e-05, "loss": 0.4164, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 728, "tokens_per_second_per_gpu": 19187.32, "total_tokens": 65853962 }, { "epoch": 0.14563252259901113, "grad_norm": 0.828125, "learning_rate": 1.5076175095865171e-05, "loss": 0.3947, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 729, "tokens_per_second_per_gpu": 17580.51, "total_tokens": 65941149 }, { "epoch": 0.1458322928632073, "grad_norm": 1.0078125, "learning_rate": 1.5061922156157746e-05, "loss": 0.4175, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 730, "tokens_per_second_per_gpu": 19552.0, "total_tokens": 66036020 }, { "epoch": 0.1460320631274035, "grad_norm": 0.7265625, "learning_rate": 1.504765537734844e-05, "loss": 0.4191, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 731, "tokens_per_second_per_gpu": 18254.87, "total_tokens": 66125954 }, { "epoch": 0.14623183339159965, "grad_norm": 0.7421875, "learning_rate": 1.5033374798442073e-05, "loss": 0.4093, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 732, "tokens_per_second_per_gpu": 19050.48, "total_tokens": 66217971 }, { "epoch": 0.14643160365579583, "grad_norm": 0.70703125, "learning_rate": 1.5019080458481203e-05, "loss": 0.4027, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 733, "tokens_per_second_per_gpu": 18384.52, "total_tokens": 66306927 }, { "epoch": 0.146631373919992, "grad_norm": 0.72265625, "learning_rate": 1.500477239654602e-05, "loss": 0.3998, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 734, "tokens_per_second_per_gpu": 18471.3, "total_tokens": 66397700 }, { "epoch": 0.1468311441841882, "grad_norm": 0.765625, "learning_rate": 1.4990450651754207e-05, "loss": 0.4031, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 735, "tokens_per_second_per_gpu": 18698.62, "total_tokens": 66488687 }, { "epoch": 0.14703091444838437, "grad_norm": 0.71875, "learning_rate": 1.4976115263260876e-05, "loss": 0.4107, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 736, "tokens_per_second_per_gpu": 17900.52, "total_tokens": 66575085 }, { "epoch": 0.14723068471258052, "grad_norm": 0.7265625, "learning_rate": 1.4961766270258422e-05, "loss": 0.416, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 737, "tokens_per_second_per_gpu": 19667.78, "total_tokens": 66671092 }, { "epoch": 0.1474304549767767, "grad_norm": 0.6953125, "learning_rate": 1.4947403711976454e-05, "loss": 0.3956, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 738, "tokens_per_second_per_gpu": 18753.41, "total_tokens": 66763031 }, { "epoch": 0.14763022524097288, "grad_norm": 0.734375, "learning_rate": 1.4933027627681651e-05, "loss": 0.4106, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 739, "tokens_per_second_per_gpu": 17687.35, "total_tokens": 66850509 }, { "epoch": 0.14782999550516907, "grad_norm": 0.72265625, "learning_rate": 1.4918638056677682e-05, "loss": 0.3978, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 740, "tokens_per_second_per_gpu": 18592.92, "total_tokens": 66939624 }, { "epoch": 0.14802976576936522, "grad_norm": 0.7265625, "learning_rate": 1.4904235038305084e-05, "loss": 0.3863, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 741, "tokens_per_second_per_gpu": 18128.12, "total_tokens": 67028949 }, { "epoch": 0.1482295360335614, "grad_norm": 0.71484375, "learning_rate": 1.4889818611941155e-05, "loss": 0.391, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 742, "tokens_per_second_per_gpu": 18547.97, "total_tokens": 67118034 }, { "epoch": 0.14842930629775758, "grad_norm": 0.71875, "learning_rate": 1.4875388816999865e-05, "loss": 0.4335, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 743, "tokens_per_second_per_gpu": 19957.63, "total_tokens": 67214522 }, { "epoch": 0.14862907656195376, "grad_norm": 0.703125, "learning_rate": 1.4860945692931711e-05, "loss": 0.4479, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 744, "tokens_per_second_per_gpu": 21290.19, "total_tokens": 67317210 }, { "epoch": 0.14882884682614994, "grad_norm": 0.73828125, "learning_rate": 1.4846489279223653e-05, "loss": 0.4127, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 745, "tokens_per_second_per_gpu": 20076.44, "total_tokens": 67413774 }, { "epoch": 0.1490286170903461, "grad_norm": 0.734375, "learning_rate": 1.4832019615398962e-05, "loss": 0.4192, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 746, "tokens_per_second_per_gpu": 18669.7, "total_tokens": 67503611 }, { "epoch": 0.14922838735454227, "grad_norm": 0.734375, "learning_rate": 1.4817536741017153e-05, "loss": 0.4095, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 747, "tokens_per_second_per_gpu": 18790.31, "total_tokens": 67594814 }, { "epoch": 0.14942815761873846, "grad_norm": 0.74609375, "learning_rate": 1.4803040695673853e-05, "loss": 0.403, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 748, "tokens_per_second_per_gpu": 18127.84, "total_tokens": 67682834 }, { "epoch": 0.14962792788293464, "grad_norm": 0.70703125, "learning_rate": 1.4788531519000696e-05, "loss": 0.4103, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 749, "tokens_per_second_per_gpu": 19080.1, "total_tokens": 67777324 }, { "epoch": 0.1498276981471308, "grad_norm": 0.73046875, "learning_rate": 1.4774009250665215e-05, "loss": 0.3951, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 750, "tokens_per_second_per_gpu": 18124.7, "total_tokens": 67865009 }, { "epoch": 0.15002746841132697, "grad_norm": 0.71484375, "learning_rate": 1.4759473930370738e-05, "loss": 0.3719, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 751, "tokens_per_second_per_gpu": 18021.56, "total_tokens": 67951896 }, { "epoch": 0.15022723867552315, "grad_norm": 0.76953125, "learning_rate": 1.4744925597856275e-05, "loss": 0.4179, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 752, "tokens_per_second_per_gpu": 19125.94, "total_tokens": 68044325 }, { "epoch": 0.15042700893971933, "grad_norm": 1.234375, "learning_rate": 1.473036429289641e-05, "loss": 0.4065, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 753, "tokens_per_second_per_gpu": 17658.82, "total_tokens": 68131313 }, { "epoch": 0.15062677920391548, "grad_norm": 0.6796875, "learning_rate": 1.4715790055301197e-05, "loss": 0.3991, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 754, "tokens_per_second_per_gpu": 18758.23, "total_tokens": 68223358 }, { "epoch": 0.15082654946811166, "grad_norm": 0.70703125, "learning_rate": 1.470120292491605e-05, "loss": 0.4057, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 755, "tokens_per_second_per_gpu": 18887.03, "total_tokens": 68315774 }, { "epoch": 0.15102631973230785, "grad_norm": 0.73046875, "learning_rate": 1.4686602941621618e-05, "loss": 0.4309, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 756, "tokens_per_second_per_gpu": 18813.38, "total_tokens": 68408483 }, { "epoch": 0.15122608999650403, "grad_norm": 0.74609375, "learning_rate": 1.4671990145333697e-05, "loss": 0.4138, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 757, "tokens_per_second_per_gpu": 19178.73, "total_tokens": 68500626 }, { "epoch": 0.1514258602607002, "grad_norm": 0.73046875, "learning_rate": 1.4657364576003122e-05, "loss": 0.4332, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 758, "tokens_per_second_per_gpu": 20069.12, "total_tokens": 68597376 }, { "epoch": 0.15162563052489636, "grad_norm": 0.6953125, "learning_rate": 1.4642726273615639e-05, "loss": 0.4094, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 759, "tokens_per_second_per_gpu": 19709.21, "total_tokens": 68693357 }, { "epoch": 0.15182540078909254, "grad_norm": 0.73046875, "learning_rate": 1.4628075278191803e-05, "loss": 0.3775, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 760, "tokens_per_second_per_gpu": 18881.67, "total_tokens": 68784373 }, { "epoch": 0.15202517105328872, "grad_norm": 0.71875, "learning_rate": 1.461341162978688e-05, "loss": 0.4037, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 761, "tokens_per_second_per_gpu": 19512.36, "total_tokens": 68878259 }, { "epoch": 0.1522249413174849, "grad_norm": 0.703125, "learning_rate": 1.4598735368490724e-05, "loss": 0.4031, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 762, "tokens_per_second_per_gpu": 18543.7, "total_tokens": 68969015 }, { "epoch": 0.15242471158168105, "grad_norm": 0.73828125, "learning_rate": 1.4584046534427671e-05, "loss": 0.4177, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 763, "tokens_per_second_per_gpu": 19872.04, "total_tokens": 69064981 }, { "epoch": 0.15262448184587724, "grad_norm": 0.70703125, "learning_rate": 1.4569345167756436e-05, "loss": 0.3766, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 764, "tokens_per_second_per_gpu": 19820.31, "total_tokens": 69159264 }, { "epoch": 0.15282425211007342, "grad_norm": 0.7265625, "learning_rate": 1.4554631308669993e-05, "loss": 0.4174, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 765, "tokens_per_second_per_gpu": 18717.15, "total_tokens": 69250255 }, { "epoch": 0.1530240223742696, "grad_norm": 0.72265625, "learning_rate": 1.4539904997395468e-05, "loss": 0.4243, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 766, "tokens_per_second_per_gpu": 18449.54, "total_tokens": 69340492 }, { "epoch": 0.15322379263846578, "grad_norm": 0.72265625, "learning_rate": 1.4525166274194038e-05, "loss": 0.3994, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 767, "tokens_per_second_per_gpu": 18817.48, "total_tokens": 69432208 }, { "epoch": 0.15342356290266193, "grad_norm": 0.75, "learning_rate": 1.4510415179360806e-05, "loss": 0.4092, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 768, "tokens_per_second_per_gpu": 20049.64, "total_tokens": 69526596 }, { "epoch": 0.1536233331668581, "grad_norm": 0.7265625, "learning_rate": 1.4495651753224706e-05, "loss": 0.4116, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 769, "tokens_per_second_per_gpu": 18881.29, "total_tokens": 69618365 }, { "epoch": 0.1538231034310543, "grad_norm": 0.94921875, "learning_rate": 1.4480876036148376e-05, "loss": 0.3978, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 770, "tokens_per_second_per_gpu": 17494.47, "total_tokens": 69704830 }, { "epoch": 0.15402287369525047, "grad_norm": 0.73046875, "learning_rate": 1.4466088068528068e-05, "loss": 0.382, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 771, "tokens_per_second_per_gpu": 17981.93, "total_tokens": 69791923 }, { "epoch": 0.15422264395944663, "grad_norm": 0.734375, "learning_rate": 1.4451287890793513e-05, "loss": 0.3767, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 772, "tokens_per_second_per_gpu": 17240.16, "total_tokens": 69876481 }, { "epoch": 0.1544224142236428, "grad_norm": 0.7421875, "learning_rate": 1.4436475543407843e-05, "loss": 0.3546, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 773, "tokens_per_second_per_gpu": 16311.66, "total_tokens": 69956304 }, { "epoch": 0.154622184487839, "grad_norm": 0.72265625, "learning_rate": 1.442165106686744e-05, "loss": 0.3696, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 774, "tokens_per_second_per_gpu": 17204.56, "total_tokens": 70040793 }, { "epoch": 0.15482195475203517, "grad_norm": 0.7109375, "learning_rate": 1.4406814501701857e-05, "loss": 0.4134, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 775, "tokens_per_second_per_gpu": 19595.8, "total_tokens": 70135484 }, { "epoch": 0.15502172501623132, "grad_norm": 0.72265625, "learning_rate": 1.4391965888473705e-05, "loss": 0.4025, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 776, "tokens_per_second_per_gpu": 18026.09, "total_tokens": 70222031 }, { "epoch": 0.1552214952804275, "grad_norm": 0.74609375, "learning_rate": 1.437710526777852e-05, "loss": 0.4156, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 777, "tokens_per_second_per_gpu": 17875.3, "total_tokens": 70309380 }, { "epoch": 0.15542126554462368, "grad_norm": 0.7109375, "learning_rate": 1.4362232680244673e-05, "loss": 0.4247, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 778, "tokens_per_second_per_gpu": 19930.61, "total_tokens": 70405027 }, { "epoch": 0.15562103580881986, "grad_norm": 0.7265625, "learning_rate": 1.4347348166533247e-05, "loss": 0.382, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 779, "tokens_per_second_per_gpu": 16906.7, "total_tokens": 70487894 }, { "epoch": 0.15582080607301604, "grad_norm": 0.7109375, "learning_rate": 1.4332451767337938e-05, "loss": 0.3945, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 780, "tokens_per_second_per_gpu": 18908.87, "total_tokens": 70581219 }, { "epoch": 0.1560205763372122, "grad_norm": 0.69921875, "learning_rate": 1.4317543523384928e-05, "loss": 0.3983, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 781, "tokens_per_second_per_gpu": 18887.4, "total_tokens": 70672818 }, { "epoch": 0.15622034660140838, "grad_norm": 0.71484375, "learning_rate": 1.4302623475432796e-05, "loss": 0.4119, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 782, "tokens_per_second_per_gpu": 18781.83, "total_tokens": 70765435 }, { "epoch": 0.15642011686560456, "grad_norm": 0.70703125, "learning_rate": 1.4287691664272376e-05, "loss": 0.4188, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 783, "tokens_per_second_per_gpu": 19098.14, "total_tokens": 70857603 }, { "epoch": 0.15661988712980074, "grad_norm": 0.69140625, "learning_rate": 1.4272748130726668e-05, "loss": 0.4131, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 784, "tokens_per_second_per_gpu": 20484.07, "total_tokens": 70956504 }, { "epoch": 0.1568196573939969, "grad_norm": 0.73828125, "learning_rate": 1.4257792915650728e-05, "loss": 0.4094, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 785, "tokens_per_second_per_gpu": 18581.53, "total_tokens": 71047793 }, { "epoch": 0.15701942765819307, "grad_norm": 0.71484375, "learning_rate": 1.4242826059931538e-05, "loss": 0.4035, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 786, "tokens_per_second_per_gpu": 18390.76, "total_tokens": 71139202 }, { "epoch": 0.15721919792238925, "grad_norm": 0.70703125, "learning_rate": 1.4227847604487914e-05, "loss": 0.3971, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 787, "tokens_per_second_per_gpu": 19153.89, "total_tokens": 71234605 }, { "epoch": 0.15741896818658543, "grad_norm": 0.7421875, "learning_rate": 1.421285759027038e-05, "loss": 0.3874, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 788, "tokens_per_second_per_gpu": 17594.8, "total_tokens": 71319881 }, { "epoch": 0.15761873845078161, "grad_norm": 0.74609375, "learning_rate": 1.4197856058261059e-05, "loss": 0.4054, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 789, "tokens_per_second_per_gpu": 18613.77, "total_tokens": 71409255 }, { "epoch": 0.15781850871497777, "grad_norm": 0.72265625, "learning_rate": 1.418284304947357e-05, "loss": 0.4037, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 790, "tokens_per_second_per_gpu": 19729.46, "total_tokens": 71504587 }, { "epoch": 0.15801827897917395, "grad_norm": 0.75390625, "learning_rate": 1.4167818604952906e-05, "loss": 0.4139, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 791, "tokens_per_second_per_gpu": 19373.38, "total_tokens": 71597794 }, { "epoch": 0.15821804924337013, "grad_norm": 0.7109375, "learning_rate": 1.4152782765775323e-05, "loss": 0.4174, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 792, "tokens_per_second_per_gpu": 19513.79, "total_tokens": 71691867 }, { "epoch": 0.1584178195075663, "grad_norm": 0.6875, "learning_rate": 1.4137735573048232e-05, "loss": 0.3924, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 793, "tokens_per_second_per_gpu": 18886.19, "total_tokens": 71783013 }, { "epoch": 0.15861758977176246, "grad_norm": 0.73046875, "learning_rate": 1.4122677067910084e-05, "loss": 0.382, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 794, "tokens_per_second_per_gpu": 17154.79, "total_tokens": 71868014 }, { "epoch": 0.15881736003595864, "grad_norm": 0.703125, "learning_rate": 1.4107607291530256e-05, "loss": 0.4132, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 795, "tokens_per_second_per_gpu": 19139.28, "total_tokens": 71960997 }, { "epoch": 0.15901713030015482, "grad_norm": 0.71875, "learning_rate": 1.409252628510894e-05, "loss": 0.415, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 796, "tokens_per_second_per_gpu": 20153.84, "total_tokens": 72055575 }, { "epoch": 0.159216900564351, "grad_norm": 0.69140625, "learning_rate": 1.4077434089877038e-05, "loss": 0.4194, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 797, "tokens_per_second_per_gpu": 19157.46, "total_tokens": 72148403 }, { "epoch": 0.15941667082854716, "grad_norm": 0.76953125, "learning_rate": 1.4062330747096027e-05, "loss": 0.3871, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 798, "tokens_per_second_per_gpu": 17693.91, "total_tokens": 72234799 }, { "epoch": 0.15961644109274334, "grad_norm": 0.734375, "learning_rate": 1.4047216298057872e-05, "loss": 0.4043, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 799, "tokens_per_second_per_gpu": 19362.47, "total_tokens": 72327402 }, { "epoch": 0.15981621135693952, "grad_norm": 0.69921875, "learning_rate": 1.4032090784084904e-05, "loss": 0.388, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 800, "tokens_per_second_per_gpu": 17615.52, "total_tokens": 72412746 }, { "epoch": 0.1600159816211357, "grad_norm": 0.8046875, "learning_rate": 1.4016954246529697e-05, "loss": 0.4186, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 801, "tokens_per_second_per_gpu": 19399.97, "total_tokens": 72505018 }, { "epoch": 0.16021575188533188, "grad_norm": 0.734375, "learning_rate": 1.4001806726774965e-05, "loss": 0.4244, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 802, "tokens_per_second_per_gpu": 19294.81, "total_tokens": 72597803 }, { "epoch": 0.16041552214952803, "grad_norm": 0.76953125, "learning_rate": 1.3986648266233452e-05, "loss": 0.4059, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 803, "tokens_per_second_per_gpu": 17424.39, "total_tokens": 72682758 }, { "epoch": 0.16061529241372421, "grad_norm": 0.69140625, "learning_rate": 1.3971478906347806e-05, "loss": 0.4037, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 804, "tokens_per_second_per_gpu": 19246.74, "total_tokens": 72775864 }, { "epoch": 0.1608150626779204, "grad_norm": 0.703125, "learning_rate": 1.3956298688590484e-05, "loss": 0.4064, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 805, "tokens_per_second_per_gpu": 19326.97, "total_tokens": 72869428 }, { "epoch": 0.16101483294211658, "grad_norm": 0.73046875, "learning_rate": 1.3941107654463619e-05, "loss": 0.4049, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 806, "tokens_per_second_per_gpu": 18374.03, "total_tokens": 72958650 }, { "epoch": 0.16121460320631273, "grad_norm": 0.7265625, "learning_rate": 1.3925905845498915e-05, "loss": 0.3675, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 807, "tokens_per_second_per_gpu": 16446.66, "total_tokens": 73039252 }, { "epoch": 0.1614143734705089, "grad_norm": 0.7109375, "learning_rate": 1.391069330325754e-05, "loss": 0.3988, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 808, "tokens_per_second_per_gpu": 19260.52, "total_tokens": 73131381 }, { "epoch": 0.1616141437347051, "grad_norm": 0.75, "learning_rate": 1.3895470069330003e-05, "loss": 0.3953, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 809, "tokens_per_second_per_gpu": 18152.97, "total_tokens": 73218753 }, { "epoch": 0.16181391399890127, "grad_norm": 0.70703125, "learning_rate": 1.3880236185336045e-05, "loss": 0.4229, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 810, "tokens_per_second_per_gpu": 19837.21, "total_tokens": 73314552 }, { "epoch": 0.16201368426309745, "grad_norm": 0.69140625, "learning_rate": 1.3864991692924524e-05, "loss": 0.394, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 811, "tokens_per_second_per_gpu": 19061.41, "total_tokens": 73406319 }, { "epoch": 0.1622134545272936, "grad_norm": 0.7265625, "learning_rate": 1.3849736633773298e-05, "loss": 0.4083, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 812, "tokens_per_second_per_gpu": 17800.21, "total_tokens": 73492995 }, { "epoch": 0.16241322479148979, "grad_norm": 0.71875, "learning_rate": 1.3834471049589117e-05, "loss": 0.4311, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 813, "tokens_per_second_per_gpu": 19443.04, "total_tokens": 73587630 }, { "epoch": 0.16261299505568597, "grad_norm": 0.6796875, "learning_rate": 1.3819194982107504e-05, "loss": 0.4103, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 814, "tokens_per_second_per_gpu": 19018.78, "total_tokens": 73679946 }, { "epoch": 0.16281276531988215, "grad_norm": 0.703125, "learning_rate": 1.3803908473092648e-05, "loss": 0.387, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 815, "tokens_per_second_per_gpu": 18616.66, "total_tokens": 73771386 }, { "epoch": 0.1630125355840783, "grad_norm": 0.73046875, "learning_rate": 1.3788611564337277e-05, "loss": 0.3658, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 816, "tokens_per_second_per_gpu": 17425.78, "total_tokens": 73856683 }, { "epoch": 0.16321230584827448, "grad_norm": 0.71484375, "learning_rate": 1.377330429766256e-05, "loss": 0.3999, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 817, "tokens_per_second_per_gpu": 18915.38, "total_tokens": 73947866 }, { "epoch": 0.16341207611247066, "grad_norm": 0.72265625, "learning_rate": 1.3757986714917972e-05, "loss": 0.4228, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 818, "tokens_per_second_per_gpu": 19902.29, "total_tokens": 74045338 }, { "epoch": 0.16361184637666684, "grad_norm": 0.7265625, "learning_rate": 1.3742658857981204e-05, "loss": 0.3802, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 819, "tokens_per_second_per_gpu": 17318.45, "total_tokens": 74131628 }, { "epoch": 0.163811616640863, "grad_norm": 0.70703125, "learning_rate": 1.3727320768758034e-05, "loss": 0.4009, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 820, "tokens_per_second_per_gpu": 19620.18, "total_tokens": 74227333 }, { "epoch": 0.16401138690505918, "grad_norm": 0.75390625, "learning_rate": 1.3711972489182208e-05, "loss": 0.4251, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 821, "tokens_per_second_per_gpu": 19102.11, "total_tokens": 74320671 }, { "epoch": 0.16421115716925536, "grad_norm": 0.72265625, "learning_rate": 1.369661406121534e-05, "loss": 0.4261, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 822, "tokens_per_second_per_gpu": 20819.39, "total_tokens": 74422276 }, { "epoch": 0.16441092743345154, "grad_norm": 0.78125, "learning_rate": 1.3681245526846782e-05, "loss": 0.3969, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 823, "tokens_per_second_per_gpu": 16941.14, "total_tokens": 74505838 }, { "epoch": 0.16461069769764772, "grad_norm": 0.71484375, "learning_rate": 1.366586692809352e-05, "loss": 0.4089, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 824, "tokens_per_second_per_gpu": 19639.77, "total_tokens": 74601857 }, { "epoch": 0.16481046796184387, "grad_norm": 0.70703125, "learning_rate": 1.3650478307000059e-05, "loss": 0.3714, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 825, "tokens_per_second_per_gpu": 18843.08, "total_tokens": 74694909 }, { "epoch": 0.16501023822604005, "grad_norm": 0.70703125, "learning_rate": 1.3635079705638298e-05, "loss": 0.419, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 826, "tokens_per_second_per_gpu": 20056.2, "total_tokens": 74789972 }, { "epoch": 0.16521000849023623, "grad_norm": 0.77734375, "learning_rate": 1.3619671166107432e-05, "loss": 0.4109, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 827, "tokens_per_second_per_gpu": 18545.78, "total_tokens": 74878591 }, { "epoch": 0.1654097787544324, "grad_norm": 0.72265625, "learning_rate": 1.3604252730533811e-05, "loss": 0.4191, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 828, "tokens_per_second_per_gpu": 20231.62, "total_tokens": 74977017 }, { "epoch": 0.16560954901862857, "grad_norm": 0.75, "learning_rate": 1.3588824441070852e-05, "loss": 0.3969, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 829, "tokens_per_second_per_gpu": 17170.54, "total_tokens": 75060237 }, { "epoch": 0.16580931928282475, "grad_norm": 0.7421875, "learning_rate": 1.357338633989891e-05, "loss": 0.41, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 830, "tokens_per_second_per_gpu": 17069.44, "total_tokens": 75145101 }, { "epoch": 0.16600908954702093, "grad_norm": 0.71875, "learning_rate": 1.3557938469225167e-05, "loss": 0.3541, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 831, "tokens_per_second_per_gpu": 17756.49, "total_tokens": 75230884 }, { "epoch": 0.1662088598112171, "grad_norm": 0.7265625, "learning_rate": 1.3542480871283507e-05, "loss": 0.3886, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 832, "tokens_per_second_per_gpu": 17613.29, "total_tokens": 75316999 }, { "epoch": 0.1664086300754133, "grad_norm": 0.7265625, "learning_rate": 1.3527013588334415e-05, "loss": 0.4038, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 833, "tokens_per_second_per_gpu": 18083.9, "total_tokens": 75404964 }, { "epoch": 0.16660840033960944, "grad_norm": 0.7421875, "learning_rate": 1.3511536662664848e-05, "loss": 0.367, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 834, "tokens_per_second_per_gpu": 16966.15, "total_tokens": 75487943 }, { "epoch": 0.16680817060380562, "grad_norm": 0.7109375, "learning_rate": 1.3496050136588135e-05, "loss": 0.3984, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 835, "tokens_per_second_per_gpu": 19142.12, "total_tokens": 75579927 }, { "epoch": 0.1670079408680018, "grad_norm": 0.71484375, "learning_rate": 1.3480554052443847e-05, "loss": 0.4332, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 836, "tokens_per_second_per_gpu": 20051.07, "total_tokens": 75676493 }, { "epoch": 0.16720771113219798, "grad_norm": 0.75, "learning_rate": 1.3465048452597682e-05, "loss": 0.3941, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 837, "tokens_per_second_per_gpu": 17728.62, "total_tokens": 75763213 }, { "epoch": 0.16740748139639414, "grad_norm": 0.69921875, "learning_rate": 1.3449533379441359e-05, "loss": 0.3786, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 838, "tokens_per_second_per_gpu": 17830.31, "total_tokens": 75850458 }, { "epoch": 0.16760725166059032, "grad_norm": 0.7109375, "learning_rate": 1.3434008875392499e-05, "loss": 0.4006, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 839, "tokens_per_second_per_gpu": 19398.51, "total_tokens": 75943349 }, { "epoch": 0.1678070219247865, "grad_norm": 0.71875, "learning_rate": 1.3418474982894499e-05, "loss": 0.396, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 840, "tokens_per_second_per_gpu": 19824.11, "total_tokens": 76038986 }, { "epoch": 0.16800679218898268, "grad_norm": 0.71875, "learning_rate": 1.3402931744416432e-05, "loss": 0.4134, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 841, "tokens_per_second_per_gpu": 18810.02, "total_tokens": 76131286 }, { "epoch": 0.16820656245317883, "grad_norm": 0.71875, "learning_rate": 1.3387379202452917e-05, "loss": 0.4062, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 842, "tokens_per_second_per_gpu": 17814.92, "total_tokens": 76217454 }, { "epoch": 0.168406332717375, "grad_norm": 0.73046875, "learning_rate": 1.3371817399524006e-05, "loss": 0.4217, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 843, "tokens_per_second_per_gpu": 19823.49, "total_tokens": 76313247 }, { "epoch": 0.1686061029815712, "grad_norm": 0.7421875, "learning_rate": 1.335624637817508e-05, "loss": 0.4191, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 844, "tokens_per_second_per_gpu": 18905.75, "total_tokens": 76404392 }, { "epoch": 0.16880587324576737, "grad_norm": 0.69921875, "learning_rate": 1.3340666180976713e-05, "loss": 0.4107, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 845, "tokens_per_second_per_gpu": 18967.16, "total_tokens": 76496804 }, { "epoch": 0.16900564350996355, "grad_norm": 0.7109375, "learning_rate": 1.332507685052457e-05, "loss": 0.3806, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 846, "tokens_per_second_per_gpu": 18652.04, "total_tokens": 76586333 }, { "epoch": 0.1692054137741597, "grad_norm": 0.6953125, "learning_rate": 1.3309478429439284e-05, "loss": 0.3932, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 847, "tokens_per_second_per_gpu": 18553.12, "total_tokens": 76677666 }, { "epoch": 0.1694051840383559, "grad_norm": 0.703125, "learning_rate": 1.3293870960366346e-05, "loss": 0.4266, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 848, "tokens_per_second_per_gpu": 19293.28, "total_tokens": 76771218 }, { "epoch": 0.16960495430255207, "grad_norm": 0.703125, "learning_rate": 1.3278254485975977e-05, "loss": 0.3749, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 849, "tokens_per_second_per_gpu": 17919.49, "total_tokens": 76858192 }, { "epoch": 0.16980472456674825, "grad_norm": 0.7109375, "learning_rate": 1.3262629048963028e-05, "loss": 0.3523, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 850, "tokens_per_second_per_gpu": 16521.09, "total_tokens": 76939904 }, { "epoch": 0.1700044948309444, "grad_norm": 0.703125, "learning_rate": 1.3246994692046837e-05, "loss": 0.4331, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 851, "tokens_per_second_per_gpu": 19812.69, "total_tokens": 77037029 }, { "epoch": 0.17020426509514058, "grad_norm": 0.7265625, "learning_rate": 1.3231351457971144e-05, "loss": 0.4245, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 852, "tokens_per_second_per_gpu": 18224.33, "total_tokens": 77125915 }, { "epoch": 0.17040403535933676, "grad_norm": 0.71875, "learning_rate": 1.3215699389503956e-05, "loss": 0.4209, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 853, "tokens_per_second_per_gpu": 20420.07, "total_tokens": 77224596 }, { "epoch": 0.17060380562353294, "grad_norm": 0.6875, "learning_rate": 1.3200038529437427e-05, "loss": 0.3941, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 854, "tokens_per_second_per_gpu": 19820.4, "total_tokens": 77319374 }, { "epoch": 0.1708035758877291, "grad_norm": 0.88671875, "learning_rate": 1.3184368920587756e-05, "loss": 0.4054, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 855, "tokens_per_second_per_gpu": 17420.69, "total_tokens": 77404714 }, { "epoch": 0.17100334615192528, "grad_norm": 0.71484375, "learning_rate": 1.3168690605795044e-05, "loss": 0.3642, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 856, "tokens_per_second_per_gpu": 17099.79, "total_tokens": 77488316 }, { "epoch": 0.17120311641612146, "grad_norm": 0.73046875, "learning_rate": 1.3153003627923217e-05, "loss": 0.3801, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 857, "tokens_per_second_per_gpu": 17318.5, "total_tokens": 77572844 }, { "epoch": 0.17140288668031764, "grad_norm": 0.7421875, "learning_rate": 1.3137308029859865e-05, "loss": 0.4204, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 858, "tokens_per_second_per_gpu": 17546.26, "total_tokens": 77659126 }, { "epoch": 0.17160265694451382, "grad_norm": 0.69140625, "learning_rate": 1.3121603854516161e-05, "loss": 0.4019, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 859, "tokens_per_second_per_gpu": 20465.95, "total_tokens": 77757675 }, { "epoch": 0.17180242720870997, "grad_norm": 0.7734375, "learning_rate": 1.3105891144826715e-05, "loss": 0.4053, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 860, "tokens_per_second_per_gpu": 19316.12, "total_tokens": 77850143 }, { "epoch": 0.17200219747290615, "grad_norm": 0.6953125, "learning_rate": 1.3090169943749475e-05, "loss": 0.4276, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 861, "tokens_per_second_per_gpu": 20067.05, "total_tokens": 77947230 }, { "epoch": 0.17220196773710233, "grad_norm": 0.6796875, "learning_rate": 1.307444029426561e-05, "loss": 0.4187, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 862, "tokens_per_second_per_gpu": 19840.97, "total_tokens": 78044061 }, { "epoch": 0.17240173800129852, "grad_norm": 0.703125, "learning_rate": 1.3058702239379374e-05, "loss": 0.4013, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 863, "tokens_per_second_per_gpu": 18307.64, "total_tokens": 78133509 }, { "epoch": 0.17260150826549467, "grad_norm": 0.7578125, "learning_rate": 1.3042955822118017e-05, "loss": 0.4127, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 864, "tokens_per_second_per_gpu": 19223.76, "total_tokens": 78227629 }, { "epoch": 0.17280127852969085, "grad_norm": 0.73828125, "learning_rate": 1.3027201085531633e-05, "loss": 0.3908, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 865, "tokens_per_second_per_gpu": 16993.07, "total_tokens": 78310174 }, { "epoch": 0.17300104879388703, "grad_norm": 0.71875, "learning_rate": 1.3011438072693077e-05, "loss": 0.3855, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 866, "tokens_per_second_per_gpu": 17928.59, "total_tokens": 78396553 }, { "epoch": 0.1732008190580832, "grad_norm": 0.7109375, "learning_rate": 1.299566682669782e-05, "loss": 0.414, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 867, "tokens_per_second_per_gpu": 18484.71, "total_tokens": 78486226 }, { "epoch": 0.1734005893222794, "grad_norm": 0.75, "learning_rate": 1.2979887390663847e-05, "loss": 0.4227, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 868, "tokens_per_second_per_gpu": 18619.89, "total_tokens": 78574993 }, { "epoch": 0.17360035958647554, "grad_norm": 0.71875, "learning_rate": 1.2964099807731539e-05, "loss": 0.402, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 869, "tokens_per_second_per_gpu": 19102.41, "total_tokens": 78666803 }, { "epoch": 0.17380012985067173, "grad_norm": 0.69140625, "learning_rate": 1.2948304121063538e-05, "loss": 0.4142, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 870, "tokens_per_second_per_gpu": 18422.96, "total_tokens": 78758685 }, { "epoch": 0.1739999001148679, "grad_norm": 0.71875, "learning_rate": 1.293250037384465e-05, "loss": 0.4169, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 871, "tokens_per_second_per_gpu": 20494.28, "total_tokens": 78857115 }, { "epoch": 0.1741996703790641, "grad_norm": 0.71484375, "learning_rate": 1.2916688609281716e-05, "loss": 0.393, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 872, "tokens_per_second_per_gpu": 17586.25, "total_tokens": 78942992 }, { "epoch": 0.17439944064326024, "grad_norm": 0.72265625, "learning_rate": 1.2900868870603502e-05, "loss": 0.3793, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 873, "tokens_per_second_per_gpu": 19465.81, "total_tokens": 79036354 }, { "epoch": 0.17459921090745642, "grad_norm": 0.71484375, "learning_rate": 1.2885041201060561e-05, "loss": 0.4034, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 874, "tokens_per_second_per_gpu": 18836.59, "total_tokens": 79128309 }, { "epoch": 0.1747989811716526, "grad_norm": 0.75390625, "learning_rate": 1.2869205643925142e-05, "loss": 0.3552, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 875, "tokens_per_second_per_gpu": 17401.03, "total_tokens": 79213267 }, { "epoch": 0.17499875143584878, "grad_norm": 0.73828125, "learning_rate": 1.2853362242491054e-05, "loss": 0.395, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 876, "tokens_per_second_per_gpu": 19512.3, "total_tokens": 79309216 }, { "epoch": 0.17519852170004493, "grad_norm": 0.7109375, "learning_rate": 1.283751104007355e-05, "loss": 0.4174, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 877, "tokens_per_second_per_gpu": 18733.26, "total_tokens": 79401034 }, { "epoch": 0.17539829196424112, "grad_norm": 0.703125, "learning_rate": 1.2821652080009214e-05, "loss": 0.3985, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 878, "tokens_per_second_per_gpu": 18683.47, "total_tokens": 79492767 }, { "epoch": 0.1755980622284373, "grad_norm": 0.69140625, "learning_rate": 1.2805785405655833e-05, "loss": 0.4188, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 879, "tokens_per_second_per_gpu": 20618.76, "total_tokens": 79591144 }, { "epoch": 0.17579783249263348, "grad_norm": 0.6875, "learning_rate": 1.2789911060392295e-05, "loss": 0.4249, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 880, "tokens_per_second_per_gpu": 19942.79, "total_tokens": 79688527 }, { "epoch": 0.17599760275682966, "grad_norm": 0.66796875, "learning_rate": 1.2774029087618448e-05, "loss": 0.3708, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 881, "tokens_per_second_per_gpu": 19451.97, "total_tokens": 79781260 }, { "epoch": 0.1761973730210258, "grad_norm": 0.7421875, "learning_rate": 1.2758139530755001e-05, "loss": 0.3903, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 882, "tokens_per_second_per_gpu": 17468.81, "total_tokens": 79866556 }, { "epoch": 0.176397143285222, "grad_norm": 0.72265625, "learning_rate": 1.2742242433243396e-05, "loss": 0.3913, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 883, "tokens_per_second_per_gpu": 18931.14, "total_tokens": 79957402 }, { "epoch": 0.17659691354941817, "grad_norm": 0.71484375, "learning_rate": 1.2726337838545692e-05, "loss": 0.4235, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 884, "tokens_per_second_per_gpu": 19037.58, "total_tokens": 80050617 }, { "epoch": 0.17679668381361435, "grad_norm": 0.6953125, "learning_rate": 1.2710425790144445e-05, "loss": 0.3834, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 885, "tokens_per_second_per_gpu": 19262.57, "total_tokens": 80144396 }, { "epoch": 0.1769964540778105, "grad_norm": 0.6875, "learning_rate": 1.269450633154258e-05, "loss": 0.4, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 886, "tokens_per_second_per_gpu": 19249.77, "total_tokens": 80237536 }, { "epoch": 0.1771962243420067, "grad_norm": 0.6875, "learning_rate": 1.2678579506263299e-05, "loss": 0.411, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 887, "tokens_per_second_per_gpu": 19888.1, "total_tokens": 80333367 }, { "epoch": 0.17739599460620287, "grad_norm": 0.73828125, "learning_rate": 1.2662645357849925e-05, "loss": 0.4196, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 888, "tokens_per_second_per_gpu": 18535.2, "total_tokens": 80423213 }, { "epoch": 0.17759576487039905, "grad_norm": 0.69921875, "learning_rate": 1.2646703929865817e-05, "loss": 0.4046, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 889, "tokens_per_second_per_gpu": 18541.02, "total_tokens": 80513631 }, { "epoch": 0.17779553513459523, "grad_norm": 0.765625, "learning_rate": 1.263075526589423e-05, "loss": 0.4172, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 890, "tokens_per_second_per_gpu": 19513.87, "total_tokens": 80608753 }, { "epoch": 0.17799530539879138, "grad_norm": 0.7109375, "learning_rate": 1.26147994095382e-05, "loss": 0.4019, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 891, "tokens_per_second_per_gpu": 18937.46, "total_tokens": 80700013 }, { "epoch": 0.17819507566298756, "grad_norm": 0.6953125, "learning_rate": 1.259883640442043e-05, "loss": 0.3735, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 892, "tokens_per_second_per_gpu": 18523.64, "total_tokens": 80789519 }, { "epoch": 0.17839484592718374, "grad_norm": 0.75, "learning_rate": 1.2582866294183167e-05, "loss": 0.395, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 893, "tokens_per_second_per_gpu": 17665.29, "total_tokens": 80875392 }, { "epoch": 0.17859461619137992, "grad_norm": 0.72265625, "learning_rate": 1.2566889122488084e-05, "loss": 0.3964, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 894, "tokens_per_second_per_gpu": 18933.66, "total_tokens": 80966297 }, { "epoch": 0.17879438645557608, "grad_norm": 0.7421875, "learning_rate": 1.2550904933016152e-05, "loss": 0.4371, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 895, "tokens_per_second_per_gpu": 18528.44, "total_tokens": 81055932 }, { "epoch": 0.17899415671977226, "grad_norm": 0.69921875, "learning_rate": 1.253491376946754e-05, "loss": 0.3954, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 896, "tokens_per_second_per_gpu": 18946.36, "total_tokens": 81148170 }, { "epoch": 0.17919392698396844, "grad_norm": 0.73046875, "learning_rate": 1.2518915675561482e-05, "loss": 0.4227, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 897, "tokens_per_second_per_gpu": 18129.08, "total_tokens": 81236741 }, { "epoch": 0.17939369724816462, "grad_norm": 0.75, "learning_rate": 1.2502910695036149e-05, "loss": 0.3981, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 898, "tokens_per_second_per_gpu": 19690.78, "total_tokens": 81331709 }, { "epoch": 0.17959346751236077, "grad_norm": 0.7421875, "learning_rate": 1.2486898871648552e-05, "loss": 0.3942, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 899, "tokens_per_second_per_gpu": 17869.38, "total_tokens": 81419062 }, { "epoch": 0.17979323777655695, "grad_norm": 0.6953125, "learning_rate": 1.2470880249174397e-05, "loss": 0.3924, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 900, "tokens_per_second_per_gpu": 18631.18, "total_tokens": 81509870 }, { "epoch": 0.17999300804075313, "grad_norm": 0.72265625, "learning_rate": 1.2454854871407993e-05, "loss": 0.3977, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 901, "tokens_per_second_per_gpu": 17449.88, "total_tokens": 81595445 }, { "epoch": 0.1801927783049493, "grad_norm": 0.7421875, "learning_rate": 1.243882278216211e-05, "loss": 0.4041, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 902, "tokens_per_second_per_gpu": 17040.71, "total_tokens": 81679164 }, { "epoch": 0.1803925485691455, "grad_norm": 0.71484375, "learning_rate": 1.2422784025267864e-05, "loss": 0.4175, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 903, "tokens_per_second_per_gpu": 19366.81, "total_tokens": 81773383 }, { "epoch": 0.18059231883334165, "grad_norm": 0.734375, "learning_rate": 1.2406738644574612e-05, "loss": 0.3796, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 904, "tokens_per_second_per_gpu": 17882.63, "total_tokens": 81860225 }, { "epoch": 0.18079208909753783, "grad_norm": 0.8046875, "learning_rate": 1.2390686683949799e-05, "loss": 0.4329, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 905, "tokens_per_second_per_gpu": 20437.31, "total_tokens": 81958816 }, { "epoch": 0.180991859361734, "grad_norm": 0.69140625, "learning_rate": 1.2374628187278888e-05, "loss": 0.4192, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 906, "tokens_per_second_per_gpu": 20000.29, "total_tokens": 82055912 }, { "epoch": 0.1811916296259302, "grad_norm": 0.72265625, "learning_rate": 1.2358563198465184e-05, "loss": 0.4131, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 907, "tokens_per_second_per_gpu": 18809.01, "total_tokens": 82148094 }, { "epoch": 0.18139139989012634, "grad_norm": 0.7265625, "learning_rate": 1.2342491761429761e-05, "loss": 0.3944, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 908, "tokens_per_second_per_gpu": 19103.14, "total_tokens": 82239179 }, { "epoch": 0.18159117015432252, "grad_norm": 0.765625, "learning_rate": 1.2326413920111304e-05, "loss": 0.4229, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 909, "tokens_per_second_per_gpu": 17635.79, "total_tokens": 82324190 }, { "epoch": 0.1817909404185187, "grad_norm": 0.70703125, "learning_rate": 1.2310329718466023e-05, "loss": 0.3683, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 910, "tokens_per_second_per_gpu": 17463.19, "total_tokens": 82410364 }, { "epoch": 0.18199071068271488, "grad_norm": 0.84375, "learning_rate": 1.2294239200467516e-05, "loss": 0.3972, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 911, "tokens_per_second_per_gpu": 17629.18, "total_tokens": 82495282 }, { "epoch": 0.18219048094691107, "grad_norm": 0.79296875, "learning_rate": 1.227814241010664e-05, "loss": 0.411, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 912, "tokens_per_second_per_gpu": 19568.4, "total_tokens": 82590557 }, { "epoch": 0.18239025121110722, "grad_norm": 0.7421875, "learning_rate": 1.2262039391391405e-05, "loss": 0.3838, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 913, "tokens_per_second_per_gpu": 18253.42, "total_tokens": 82679828 }, { "epoch": 0.1825900214753034, "grad_norm": 0.6796875, "learning_rate": 1.2245930188346849e-05, "loss": 0.3897, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 914, "tokens_per_second_per_gpu": 19783.82, "total_tokens": 82775006 }, { "epoch": 0.18278979173949958, "grad_norm": 0.73828125, "learning_rate": 1.2229814845014918e-05, "loss": 0.3992, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 915, "tokens_per_second_per_gpu": 18843.07, "total_tokens": 82866827 }, { "epoch": 0.18298956200369576, "grad_norm": 0.7265625, "learning_rate": 1.2213693405454345e-05, "loss": 0.3885, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 916, "tokens_per_second_per_gpu": 18476.11, "total_tokens": 82956412 }, { "epoch": 0.1831893322678919, "grad_norm": 0.6875, "learning_rate": 1.2197565913740531e-05, "loss": 0.4029, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 917, "tokens_per_second_per_gpu": 20133.4, "total_tokens": 83053357 }, { "epoch": 0.1833891025320881, "grad_norm": 0.70703125, "learning_rate": 1.2181432413965428e-05, "loss": 0.4074, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 918, "tokens_per_second_per_gpu": 19008.57, "total_tokens": 83145828 }, { "epoch": 0.18358887279628427, "grad_norm": 0.7109375, "learning_rate": 1.21652929502374e-05, "loss": 0.3892, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 919, "tokens_per_second_per_gpu": 18318.51, "total_tokens": 83237582 }, { "epoch": 0.18378864306048046, "grad_norm": 0.703125, "learning_rate": 1.2149147566681126e-05, "loss": 0.3894, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 920, "tokens_per_second_per_gpu": 18402.88, "total_tokens": 83327880 }, { "epoch": 0.1839884133246766, "grad_norm": 0.74609375, "learning_rate": 1.213299630743747e-05, "loss": 0.3927, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 921, "tokens_per_second_per_gpu": 17722.88, "total_tokens": 83413938 }, { "epoch": 0.1841881835888728, "grad_norm": 0.69921875, "learning_rate": 1.2116839216663358e-05, "loss": 0.3736, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 922, "tokens_per_second_per_gpu": 17571.24, "total_tokens": 83498806 }, { "epoch": 0.18438795385306897, "grad_norm": 0.74609375, "learning_rate": 1.2100676338531661e-05, "loss": 0.3243, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 923, "tokens_per_second_per_gpu": 16528.71, "total_tokens": 83579748 }, { "epoch": 0.18458772411726515, "grad_norm": 0.7265625, "learning_rate": 1.2084507717231064e-05, "loss": 0.4018, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 924, "tokens_per_second_per_gpu": 18692.64, "total_tokens": 83669186 }, { "epoch": 0.18478749438146133, "grad_norm": 0.6875, "learning_rate": 1.2068333396965968e-05, "loss": 0.4086, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 925, "tokens_per_second_per_gpu": 19772.04, "total_tokens": 83766147 }, { "epoch": 0.18498726464565748, "grad_norm": 0.7890625, "learning_rate": 1.2052153421956343e-05, "loss": 0.3631, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 926, "tokens_per_second_per_gpu": 16380.97, "total_tokens": 83846857 }, { "epoch": 0.18518703490985366, "grad_norm": 0.68359375, "learning_rate": 1.2035967836437625e-05, "loss": 0.394, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 927, "tokens_per_second_per_gpu": 19617.09, "total_tokens": 83942259 }, { "epoch": 0.18538680517404985, "grad_norm": 0.71484375, "learning_rate": 1.2019776684660584e-05, "loss": 0.3914, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 928, "tokens_per_second_per_gpu": 18234.87, "total_tokens": 84030777 }, { "epoch": 0.18558657543824603, "grad_norm": 0.69140625, "learning_rate": 1.2003580010891214e-05, "loss": 0.3767, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 929, "tokens_per_second_per_gpu": 19702.87, "total_tokens": 84125441 }, { "epoch": 0.18578634570244218, "grad_norm": 0.73046875, "learning_rate": 1.1987377859410598e-05, "loss": 0.4139, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 930, "tokens_per_second_per_gpu": 19260.11, "total_tokens": 84218470 }, { "epoch": 0.18598611596663836, "grad_norm": 0.69921875, "learning_rate": 1.1971170274514802e-05, "loss": 0.4095, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 931, "tokens_per_second_per_gpu": 18758.45, "total_tokens": 84309542 }, { "epoch": 0.18618588623083454, "grad_norm": 0.74609375, "learning_rate": 1.1954957300514749e-05, "loss": 0.3616, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 932, "tokens_per_second_per_gpu": 18230.28, "total_tokens": 84397975 }, { "epoch": 0.18638565649503072, "grad_norm": 0.71875, "learning_rate": 1.1938738981736084e-05, "loss": 0.3759, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 933, "tokens_per_second_per_gpu": 16823.95, "total_tokens": 84482034 }, { "epoch": 0.1865854267592269, "grad_norm": 0.71484375, "learning_rate": 1.1922515362519072e-05, "loss": 0.4269, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 934, "tokens_per_second_per_gpu": 19616.77, "total_tokens": 84577531 }, { "epoch": 0.18678519702342306, "grad_norm": 0.71875, "learning_rate": 1.190628648721847e-05, "loss": 0.4134, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 935, "tokens_per_second_per_gpu": 19327.23, "total_tokens": 84671640 }, { "epoch": 0.18698496728761924, "grad_norm": 0.7265625, "learning_rate": 1.1890052400203405e-05, "loss": 0.3818, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 936, "tokens_per_second_per_gpu": 18336.55, "total_tokens": 84762093 }, { "epoch": 0.18718473755181542, "grad_norm": 0.72265625, "learning_rate": 1.187381314585725e-05, "loss": 0.3846, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 937, "tokens_per_second_per_gpu": 17349.88, "total_tokens": 84847100 }, { "epoch": 0.1873845078160116, "grad_norm": 0.71484375, "learning_rate": 1.18575687685775e-05, "loss": 0.4267, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 938, "tokens_per_second_per_gpu": 19632.75, "total_tokens": 84942636 }, { "epoch": 0.18758427808020775, "grad_norm": 0.8515625, "learning_rate": 1.1841319312775672e-05, "loss": 0.3865, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 939, "tokens_per_second_per_gpu": 18202.15, "total_tokens": 85030618 }, { "epoch": 0.18778404834440393, "grad_norm": 0.74609375, "learning_rate": 1.1825064822877153e-05, "loss": 0.3993, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 940, "tokens_per_second_per_gpu": 18634.73, "total_tokens": 85119900 }, { "epoch": 0.1879838186086001, "grad_norm": 0.7109375, "learning_rate": 1.1808805343321102e-05, "loss": 0.4124, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 941, "tokens_per_second_per_gpu": 18874.95, "total_tokens": 85213060 }, { "epoch": 0.1881835888727963, "grad_norm": 0.73046875, "learning_rate": 1.1792540918560306e-05, "loss": 0.3954, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 942, "tokens_per_second_per_gpu": 19553.29, "total_tokens": 85305904 }, { "epoch": 0.18838335913699245, "grad_norm": 0.703125, "learning_rate": 1.1776271593061089e-05, "loss": 0.3822, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 943, "tokens_per_second_per_gpu": 17796.17, "total_tokens": 85393428 }, { "epoch": 0.18858312940118863, "grad_norm": 0.7265625, "learning_rate": 1.175999741130316e-05, "loss": 0.4062, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 944, "tokens_per_second_per_gpu": 19272.23, "total_tokens": 85487333 }, { "epoch": 0.1887828996653848, "grad_norm": 0.7890625, "learning_rate": 1.1743718417779518e-05, "loss": 0.4148, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 945, "tokens_per_second_per_gpu": 17654.04, "total_tokens": 85573877 }, { "epoch": 0.188982669929581, "grad_norm": 0.93359375, "learning_rate": 1.1727434656996306e-05, "loss": 0.4059, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 946, "tokens_per_second_per_gpu": 16167.46, "total_tokens": 85653244 }, { "epoch": 0.18918244019377717, "grad_norm": 0.7265625, "learning_rate": 1.1711146173472701e-05, "loss": 0.3841, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 947, "tokens_per_second_per_gpu": 17160.96, "total_tokens": 85737664 }, { "epoch": 0.18938221045797332, "grad_norm": 0.7109375, "learning_rate": 1.1694853011740798e-05, "loss": 0.4002, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 948, "tokens_per_second_per_gpu": 18003.84, "total_tokens": 85826385 }, { "epoch": 0.1895819807221695, "grad_norm": 0.71875, "learning_rate": 1.1678555216345478e-05, "loss": 0.4103, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 949, "tokens_per_second_per_gpu": 18904.47, "total_tokens": 85917435 }, { "epoch": 0.18978175098636568, "grad_norm": 0.7265625, "learning_rate": 1.1662252831844297e-05, "loss": 0.3949, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 950, "tokens_per_second_per_gpu": 17467.6, "total_tokens": 86003587 }, { "epoch": 0.18998152125056186, "grad_norm": 0.74609375, "learning_rate": 1.164594590280734e-05, "loss": 0.385, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 951, "tokens_per_second_per_gpu": 18069.86, "total_tokens": 86089759 }, { "epoch": 0.19018129151475802, "grad_norm": 0.7578125, "learning_rate": 1.1629634473817138e-05, "loss": 0.4092, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 952, "tokens_per_second_per_gpu": 18179.22, "total_tokens": 86176895 }, { "epoch": 0.1903810617789542, "grad_norm": 0.703125, "learning_rate": 1.1613318589468512e-05, "loss": 0.3973, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 953, "tokens_per_second_per_gpu": 18815.26, "total_tokens": 86267471 }, { "epoch": 0.19058083204315038, "grad_norm": 0.69921875, "learning_rate": 1.1596998294368466e-05, "loss": 0.4107, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 954, "tokens_per_second_per_gpu": 18447.65, "total_tokens": 86357293 }, { "epoch": 0.19078060230734656, "grad_norm": 0.703125, "learning_rate": 1.1580673633136066e-05, "loss": 0.4116, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 955, "tokens_per_second_per_gpu": 18928.85, "total_tokens": 86449856 }, { "epoch": 0.19098037257154274, "grad_norm": 0.76953125, "learning_rate": 1.156434465040231e-05, "loss": 0.3921, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 956, "tokens_per_second_per_gpu": 16280.78, "total_tokens": 86529787 }, { "epoch": 0.1911801428357389, "grad_norm": 0.71484375, "learning_rate": 1.1548011390810016e-05, "loss": 0.3961, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 957, "tokens_per_second_per_gpu": 18740.65, "total_tokens": 86620727 }, { "epoch": 0.19137991309993507, "grad_norm": 0.74609375, "learning_rate": 1.1531673899013687e-05, "loss": 0.3728, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 958, "tokens_per_second_per_gpu": 17575.86, "total_tokens": 86706361 }, { "epoch": 0.19157968336413125, "grad_norm": 0.77734375, "learning_rate": 1.1515332219679405e-05, "loss": 0.4056, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 959, "tokens_per_second_per_gpu": 18083.34, "total_tokens": 86794610 }, { "epoch": 0.19177945362832743, "grad_norm": 0.703125, "learning_rate": 1.14989863974847e-05, "loss": 0.3579, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 960, "tokens_per_second_per_gpu": 18168.32, "total_tokens": 86883555 }, { "epoch": 0.1919792238925236, "grad_norm": 0.6796875, "learning_rate": 1.148263647711842e-05, "loss": 0.4199, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 961, "tokens_per_second_per_gpu": 20845.0, "total_tokens": 86984653 }, { "epoch": 0.19217899415671977, "grad_norm": 0.71484375, "learning_rate": 1.1466282503280631e-05, "loss": 0.4115, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 962, "tokens_per_second_per_gpu": 17959.79, "total_tokens": 87073323 }, { "epoch": 0.19237876442091595, "grad_norm": 0.69140625, "learning_rate": 1.144992452068246e-05, "loss": 0.3591, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 963, "tokens_per_second_per_gpu": 18675.13, "total_tokens": 87162272 }, { "epoch": 0.19257853468511213, "grad_norm": 0.75, "learning_rate": 1.143356257404602e-05, "loss": 0.3758, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 964, "tokens_per_second_per_gpu": 16151.03, "total_tokens": 87240906 }, { "epoch": 0.19277830494930828, "grad_norm": 0.72265625, "learning_rate": 1.1417196708104244e-05, "loss": 0.4082, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 965, "tokens_per_second_per_gpu": 18104.97, "total_tokens": 87329796 }, { "epoch": 0.19297807521350446, "grad_norm": 0.69140625, "learning_rate": 1.140082696760078e-05, "loss": 0.4001, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 966, "tokens_per_second_per_gpu": 19046.66, "total_tokens": 87420762 }, { "epoch": 0.19317784547770064, "grad_norm": 0.75390625, "learning_rate": 1.1384453397289876e-05, "loss": 0.377, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 967, "tokens_per_second_per_gpu": 16669.73, "total_tokens": 87502383 }, { "epoch": 0.19337761574189682, "grad_norm": 0.7421875, "learning_rate": 1.1368076041936252e-05, "loss": 0.4414, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 968, "tokens_per_second_per_gpu": 17951.44, "total_tokens": 87590529 }, { "epoch": 0.193577386006093, "grad_norm": 1.0625, "learning_rate": 1.135169494631497e-05, "loss": 0.4154, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 969, "tokens_per_second_per_gpu": 20549.85, "total_tokens": 87689021 }, { "epoch": 0.19377715627028916, "grad_norm": 0.71484375, "learning_rate": 1.1335310155211319e-05, "loss": 0.4113, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 970, "tokens_per_second_per_gpu": 17162.8, "total_tokens": 87773754 }, { "epoch": 0.19397692653448534, "grad_norm": 0.68359375, "learning_rate": 1.1318921713420691e-05, "loss": 0.3807, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 971, "tokens_per_second_per_gpu": 18189.88, "total_tokens": 87863789 }, { "epoch": 0.19417669679868152, "grad_norm": 0.90234375, "learning_rate": 1.130252966574846e-05, "loss": 0.3965, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 972, "tokens_per_second_per_gpu": 17876.18, "total_tokens": 87951641 }, { "epoch": 0.1943764670628777, "grad_norm": 0.73828125, "learning_rate": 1.1286134057009862e-05, "loss": 0.3734, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 973, "tokens_per_second_per_gpu": 17120.89, "total_tokens": 88035416 }, { "epoch": 0.19457623732707385, "grad_norm": 0.7265625, "learning_rate": 1.1269734932029864e-05, "loss": 0.3685, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 974, "tokens_per_second_per_gpu": 18006.71, "total_tokens": 88122870 }, { "epoch": 0.19477600759127003, "grad_norm": 0.765625, "learning_rate": 1.1253332335643043e-05, "loss": 0.4098, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 975, "tokens_per_second_per_gpu": 20212.25, "total_tokens": 88219310 }, { "epoch": 0.19497577785546621, "grad_norm": 0.70703125, "learning_rate": 1.123692631269348e-05, "loss": 0.4019, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 976, "tokens_per_second_per_gpu": 19672.81, "total_tokens": 88314420 }, { "epoch": 0.1951755481196624, "grad_norm": 0.70703125, "learning_rate": 1.1220516908034602e-05, "loss": 0.3999, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 977, "tokens_per_second_per_gpu": 18643.12, "total_tokens": 88404130 }, { "epoch": 0.19537531838385858, "grad_norm": 0.72265625, "learning_rate": 1.1204104166529111e-05, "loss": 0.4035, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 978, "tokens_per_second_per_gpu": 18680.25, "total_tokens": 88495075 }, { "epoch": 0.19557508864805473, "grad_norm": 0.68359375, "learning_rate": 1.1187688133048801e-05, "loss": 0.3932, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 979, "tokens_per_second_per_gpu": 19726.0, "total_tokens": 88591258 }, { "epoch": 0.1957748589122509, "grad_norm": 0.703125, "learning_rate": 1.1171268852474492e-05, "loss": 0.3681, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 980, "tokens_per_second_per_gpu": 18835.37, "total_tokens": 88681207 }, { "epoch": 0.1959746291764471, "grad_norm": 0.734375, "learning_rate": 1.1154846369695864e-05, "loss": 0.357, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 981, "tokens_per_second_per_gpu": 16827.74, "total_tokens": 88762038 }, { "epoch": 0.19617439944064327, "grad_norm": 0.6953125, "learning_rate": 1.1138420729611355e-05, "loss": 0.4254, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 982, "tokens_per_second_per_gpu": 20578.94, "total_tokens": 88861435 }, { "epoch": 0.19637416970483942, "grad_norm": 0.72265625, "learning_rate": 1.1121991977128046e-05, "loss": 0.3835, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 983, "tokens_per_second_per_gpu": 18728.24, "total_tokens": 88952834 }, { "epoch": 0.1965739399690356, "grad_norm": 0.71484375, "learning_rate": 1.1105560157161512e-05, "loss": 0.4052, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 984, "tokens_per_second_per_gpu": 18298.9, "total_tokens": 89041916 }, { "epoch": 0.19677371023323179, "grad_norm": 0.703125, "learning_rate": 1.1089125314635727e-05, "loss": 0.3745, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 985, "tokens_per_second_per_gpu": 17811.69, "total_tokens": 89129190 }, { "epoch": 0.19697348049742797, "grad_norm": 0.6875, "learning_rate": 1.107268749448292e-05, "loss": 0.4282, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 986, "tokens_per_second_per_gpu": 18311.77, "total_tokens": 89219784 }, { "epoch": 0.19717325076162412, "grad_norm": 0.72265625, "learning_rate": 1.105624674164346e-05, "loss": 0.3502, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 987, "tokens_per_second_per_gpu": 16318.44, "total_tokens": 89299389 }, { "epoch": 0.1973730210258203, "grad_norm": 0.69140625, "learning_rate": 1.1039803101065742e-05, "loss": 0.4236, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 988, "tokens_per_second_per_gpu": 19177.83, "total_tokens": 89394282 }, { "epoch": 0.19757279129001648, "grad_norm": 0.703125, "learning_rate": 1.1023356617706051e-05, "loss": 0.3799, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 989, "tokens_per_second_per_gpu": 17666.48, "total_tokens": 89481121 }, { "epoch": 0.19777256155421266, "grad_norm": 0.69921875, "learning_rate": 1.1006907336528445e-05, "loss": 0.4273, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 990, "tokens_per_second_per_gpu": 19956.34, "total_tokens": 89579295 }, { "epoch": 0.19797233181840884, "grad_norm": 0.70703125, "learning_rate": 1.099045530250463e-05, "loss": 0.3903, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 991, "tokens_per_second_per_gpu": 18717.0, "total_tokens": 89670527 }, { "epoch": 0.198172102082605, "grad_norm": 0.70703125, "learning_rate": 1.0974000560613835e-05, "loss": 0.3695, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 992, "tokens_per_second_per_gpu": 17274.06, "total_tokens": 89755091 }, { "epoch": 0.19837187234680118, "grad_norm": 0.76171875, "learning_rate": 1.0957543155842703e-05, "loss": 0.406, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 993, "tokens_per_second_per_gpu": 19089.87, "total_tokens": 89847083 }, { "epoch": 0.19857164261099736, "grad_norm": 0.734375, "learning_rate": 1.0941083133185146e-05, "loss": 0.3911, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 994, "tokens_per_second_per_gpu": 18325.98, "total_tokens": 89936182 }, { "epoch": 0.19877141287519354, "grad_norm": 0.69140625, "learning_rate": 1.0924620537642237e-05, "loss": 0.3752, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 995, "tokens_per_second_per_gpu": 17054.16, "total_tokens": 90019450 }, { "epoch": 0.1989711831393897, "grad_norm": 0.703125, "learning_rate": 1.0908155414222083e-05, "loss": 0.3961, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 996, "tokens_per_second_per_gpu": 18727.13, "total_tokens": 90111654 }, { "epoch": 0.19917095340358587, "grad_norm": 0.67578125, "learning_rate": 1.0891687807939707e-05, "loss": 0.4198, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 997, "tokens_per_second_per_gpu": 20649.65, "total_tokens": 90211988 }, { "epoch": 0.19937072366778205, "grad_norm": 0.734375, "learning_rate": 1.0875217763816912e-05, "loss": 0.4017, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 998, "tokens_per_second_per_gpu": 17460.07, "total_tokens": 90296186 }, { "epoch": 0.19957049393197823, "grad_norm": 0.70703125, "learning_rate": 1.0858745326882172e-05, "loss": 0.3975, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 999, "tokens_per_second_per_gpu": 17897.31, "total_tokens": 90381957 }, { "epoch": 0.1997702641961744, "grad_norm": 0.72265625, "learning_rate": 1.0842270542170498e-05, "loss": 0.399, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1000, "tokens_per_second_per_gpu": 18230.47, "total_tokens": 90470651 }, { "epoch": 0.19997003446037057, "grad_norm": 0.7109375, "learning_rate": 1.0825793454723325e-05, "loss": 0.3959, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1001, "tokens_per_second_per_gpu": 18074.57, "total_tokens": 90558554 }, { "epoch": 0.20016980472456675, "grad_norm": 0.6875, "learning_rate": 1.0809314109588377e-05, "loss": 0.3946, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1002, "tokens_per_second_per_gpu": 18104.11, "total_tokens": 90648152 }, { "epoch": 0.20036957498876293, "grad_norm": 0.69140625, "learning_rate": 1.0792832551819558e-05, "loss": 0.3691, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1003, "tokens_per_second_per_gpu": 18560.73, "total_tokens": 90737134 }, { "epoch": 0.2005693452529591, "grad_norm": 0.75390625, "learning_rate": 1.0776348826476821e-05, "loss": 0.3871, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1004, "tokens_per_second_per_gpu": 17565.51, "total_tokens": 90822641 }, { "epoch": 0.20076911551715526, "grad_norm": 0.6875, "learning_rate": 1.0759862978626032e-05, "loss": 0.4007, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1005, "tokens_per_second_per_gpu": 19407.65, "total_tokens": 90916574 }, { "epoch": 0.20096888578135144, "grad_norm": 0.734375, "learning_rate": 1.0743375053338879e-05, "loss": 0.3939, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1006, "tokens_per_second_per_gpu": 17394.7, "total_tokens": 91002117 }, { "epoch": 0.20116865604554762, "grad_norm": 0.66796875, "learning_rate": 1.0726885095692712e-05, "loss": 0.3636, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1007, "tokens_per_second_per_gpu": 18508.72, "total_tokens": 91092712 }, { "epoch": 0.2013684263097438, "grad_norm": 0.69140625, "learning_rate": 1.0710393150770451e-05, "loss": 0.3685, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1008, "tokens_per_second_per_gpu": 17918.64, "total_tokens": 91180316 }, { "epoch": 0.20156819657393996, "grad_norm": 0.68359375, "learning_rate": 1.0693899263660442e-05, "loss": 0.3661, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1009, "tokens_per_second_per_gpu": 18697.9, "total_tokens": 91270551 }, { "epoch": 0.20176796683813614, "grad_norm": 0.71875, "learning_rate": 1.067740347945634e-05, "loss": 0.4155, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1010, "tokens_per_second_per_gpu": 18625.56, "total_tokens": 91361937 }, { "epoch": 0.20196773710233232, "grad_norm": 0.75, "learning_rate": 1.0660905843256995e-05, "loss": 0.4007, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1011, "tokens_per_second_per_gpu": 16921.78, "total_tokens": 91444694 }, { "epoch": 0.2021675073665285, "grad_norm": 0.69921875, "learning_rate": 1.0644406400166309e-05, "loss": 0.401, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1012, "tokens_per_second_per_gpu": 17571.29, "total_tokens": 91531387 }, { "epoch": 0.20236727763072468, "grad_norm": 0.69921875, "learning_rate": 1.0627905195293135e-05, "loss": 0.3991, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1013, "tokens_per_second_per_gpu": 18640.23, "total_tokens": 91621991 }, { "epoch": 0.20256704789492083, "grad_norm": 0.69921875, "learning_rate": 1.0611402273751132e-05, "loss": 0.4144, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1014, "tokens_per_second_per_gpu": 19603.33, "total_tokens": 91717974 }, { "epoch": 0.202766818159117, "grad_norm": 0.76171875, "learning_rate": 1.0594897680658657e-05, "loss": 0.4054, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1015, "tokens_per_second_per_gpu": 17163.2, "total_tokens": 91801185 }, { "epoch": 0.2029665884233132, "grad_norm": 0.69140625, "learning_rate": 1.0578391461138642e-05, "loss": 0.3843, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1016, "tokens_per_second_per_gpu": 17988.85, "total_tokens": 91888162 }, { "epoch": 0.20316635868750937, "grad_norm": 0.734375, "learning_rate": 1.0561883660318456e-05, "loss": 0.3988, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1017, "tokens_per_second_per_gpu": 18320.37, "total_tokens": 91976772 }, { "epoch": 0.20336612895170553, "grad_norm": 0.6953125, "learning_rate": 1.05453743233298e-05, "loss": 0.3787, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1018, "tokens_per_second_per_gpu": 17901.83, "total_tokens": 92064833 }, { "epoch": 0.2035658992159017, "grad_norm": 0.71875, "learning_rate": 1.0528863495308568e-05, "loss": 0.4144, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1019, "tokens_per_second_per_gpu": 18246.59, "total_tokens": 92154796 }, { "epoch": 0.2037656694800979, "grad_norm": 0.6796875, "learning_rate": 1.0512351221394731e-05, "loss": 0.4285, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1020, "tokens_per_second_per_gpu": 20700.7, "total_tokens": 92254218 }, { "epoch": 0.20396543974429407, "grad_norm": 0.7265625, "learning_rate": 1.0495837546732224e-05, "loss": 0.4065, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1021, "tokens_per_second_per_gpu": 18245.59, "total_tokens": 92342256 }, { "epoch": 0.20416521000849025, "grad_norm": 0.7890625, "learning_rate": 1.0479322516468797e-05, "loss": 0.3697, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1022, "tokens_per_second_per_gpu": 19118.07, "total_tokens": 92433442 }, { "epoch": 0.2043649802726864, "grad_norm": 0.703125, "learning_rate": 1.046280617575591e-05, "loss": 0.3714, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1023, "tokens_per_second_per_gpu": 17398.92, "total_tokens": 92518307 }, { "epoch": 0.20456475053688258, "grad_norm": 0.71484375, "learning_rate": 1.0446288569748613e-05, "loss": 0.3769, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1024, "tokens_per_second_per_gpu": 18349.46, "total_tokens": 92607584 }, { "epoch": 0.20476452080107876, "grad_norm": 0.6953125, "learning_rate": 1.0429769743605406e-05, "loss": 0.3876, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1025, "tokens_per_second_per_gpu": 20057.71, "total_tokens": 92703084 }, { "epoch": 0.20496429106527495, "grad_norm": 0.703125, "learning_rate": 1.0413249742488132e-05, "loss": 0.3905, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1026, "tokens_per_second_per_gpu": 18196.56, "total_tokens": 92792601 }, { "epoch": 0.2051640613294711, "grad_norm": 0.69921875, "learning_rate": 1.0396728611561843e-05, "loss": 0.4001, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1027, "tokens_per_second_per_gpu": 18999.72, "total_tokens": 92883973 }, { "epoch": 0.20536383159366728, "grad_norm": 0.69140625, "learning_rate": 1.0380206395994678e-05, "loss": 0.415, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1028, "tokens_per_second_per_gpu": 19480.11, "total_tokens": 92978048 }, { "epoch": 0.20556360185786346, "grad_norm": 0.7109375, "learning_rate": 1.0363683140957745e-05, "loss": 0.3553, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1029, "tokens_per_second_per_gpu": 17704.89, "total_tokens": 93064018 }, { "epoch": 0.20576337212205964, "grad_norm": 0.71484375, "learning_rate": 1.0347158891624992e-05, "loss": 0.3875, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1030, "tokens_per_second_per_gpu": 18009.41, "total_tokens": 93152140 }, { "epoch": 0.2059631423862558, "grad_norm": 0.72265625, "learning_rate": 1.0330633693173083e-05, "loss": 0.3997, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1031, "tokens_per_second_per_gpu": 19032.06, "total_tokens": 93243696 }, { "epoch": 0.20616291265045197, "grad_norm": 0.7109375, "learning_rate": 1.0314107590781284e-05, "loss": 0.4207, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1032, "tokens_per_second_per_gpu": 18946.76, "total_tokens": 93336333 }, { "epoch": 0.20636268291464815, "grad_norm": 0.703125, "learning_rate": 1.0297580629631324e-05, "loss": 0.3653, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1033, "tokens_per_second_per_gpu": 17510.01, "total_tokens": 93422905 }, { "epoch": 0.20656245317884434, "grad_norm": 0.7109375, "learning_rate": 1.028105285490729e-05, "loss": 0.3941, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1034, "tokens_per_second_per_gpu": 18879.67, "total_tokens": 93515411 }, { "epoch": 0.20676222344304052, "grad_norm": 0.6953125, "learning_rate": 1.0264524311795478e-05, "loss": 0.3486, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1035, "tokens_per_second_per_gpu": 17345.78, "total_tokens": 93599856 }, { "epoch": 0.20696199370723667, "grad_norm": 0.7109375, "learning_rate": 1.0247995045484303e-05, "loss": 0.3757, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1036, "tokens_per_second_per_gpu": 19024.6, "total_tokens": 93692209 }, { "epoch": 0.20716176397143285, "grad_norm": 0.7265625, "learning_rate": 1.023146510116414e-05, "loss": 0.331, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1037, "tokens_per_second_per_gpu": 16516.62, "total_tokens": 93773040 }, { "epoch": 0.20736153423562903, "grad_norm": 0.69921875, "learning_rate": 1.0214934524027228e-05, "loss": 0.3984, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1038, "tokens_per_second_per_gpu": 17856.72, "total_tokens": 93862439 }, { "epoch": 0.2075613044998252, "grad_norm": 0.71875, "learning_rate": 1.0198403359267538e-05, "loss": 0.3788, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1039, "tokens_per_second_per_gpu": 17475.52, "total_tokens": 93947322 }, { "epoch": 0.20776107476402136, "grad_norm": 0.7109375, "learning_rate": 1.0181871652080637e-05, "loss": 0.3922, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1040, "tokens_per_second_per_gpu": 18438.53, "total_tokens": 94037175 }, { "epoch": 0.20796084502821754, "grad_norm": 0.75, "learning_rate": 1.0165339447663586e-05, "loss": 0.3667, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1041, "tokens_per_second_per_gpu": 16152.35, "total_tokens": 94116974 }, { "epoch": 0.20816061529241373, "grad_norm": 0.67578125, "learning_rate": 1.0148806791214797e-05, "loss": 0.4227, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1042, "tokens_per_second_per_gpu": 19688.46, "total_tokens": 94213598 }, { "epoch": 0.2083603855566099, "grad_norm": 0.75, "learning_rate": 1.0132273727933925e-05, "loss": 0.3778, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1043, "tokens_per_second_per_gpu": 17944.31, "total_tokens": 94299622 }, { "epoch": 0.2085601558208061, "grad_norm": 0.71484375, "learning_rate": 1.0115740303021729e-05, "loss": 0.3698, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1044, "tokens_per_second_per_gpu": 16853.93, "total_tokens": 94383327 }, { "epoch": 0.20875992608500224, "grad_norm": 0.71875, "learning_rate": 1.0099206561679964e-05, "loss": 0.4182, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1045, "tokens_per_second_per_gpu": 19831.73, "total_tokens": 94479250 }, { "epoch": 0.20895969634919842, "grad_norm": 0.703125, "learning_rate": 1.008267254911125e-05, "loss": 0.3814, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1046, "tokens_per_second_per_gpu": 18356.56, "total_tokens": 94569867 }, { "epoch": 0.2091594666133946, "grad_norm": 0.72265625, "learning_rate": 1.0066138310518942e-05, "loss": 0.3834, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1047, "tokens_per_second_per_gpu": 17942.2, "total_tokens": 94657608 }, { "epoch": 0.20935923687759078, "grad_norm": 0.73046875, "learning_rate": 1.004960389110702e-05, "loss": 0.3875, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1048, "tokens_per_second_per_gpu": 18893.29, "total_tokens": 94750674 }, { "epoch": 0.20955900714178693, "grad_norm": 0.7421875, "learning_rate": 1.0033069336079952e-05, "loss": 0.4055, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1049, "tokens_per_second_per_gpu": 18537.76, "total_tokens": 94840916 }, { "epoch": 0.20975877740598312, "grad_norm": 0.72265625, "learning_rate": 1.0016534690642584e-05, "loss": 0.4051, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1050, "tokens_per_second_per_gpu": 19769.48, "total_tokens": 94935168 }, { "epoch": 0.2099585476701793, "grad_norm": 0.71875, "learning_rate": 1e-05, "loss": 0.3913, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1051, "tokens_per_second_per_gpu": 17659.43, "total_tokens": 95022986 }, { "epoch": 0.21015831793437548, "grad_norm": 0.7265625, "learning_rate": 9.983465309357418e-06, "loss": 0.4118, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1052, "tokens_per_second_per_gpu": 20009.33, "total_tokens": 95118583 }, { "epoch": 0.21035808819857163, "grad_norm": 0.68359375, "learning_rate": 9.96693066392005e-06, "loss": 0.3836, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1053, "tokens_per_second_per_gpu": 18146.46, "total_tokens": 95208033 }, { "epoch": 0.2105578584627678, "grad_norm": 0.73046875, "learning_rate": 9.950396108892983e-06, "loss": 0.4072, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1054, "tokens_per_second_per_gpu": 17937.71, "total_tokens": 95295564 }, { "epoch": 0.210757628726964, "grad_norm": 0.67578125, "learning_rate": 9.93386168948106e-06, "loss": 0.3876, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1055, "tokens_per_second_per_gpu": 18486.6, "total_tokens": 95387109 }, { "epoch": 0.21095739899116017, "grad_norm": 0.703125, "learning_rate": 9.917327450888751e-06, "loss": 0.4071, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1056, "tokens_per_second_per_gpu": 19378.84, "total_tokens": 95481580 }, { "epoch": 0.21115716925535635, "grad_norm": 0.69921875, "learning_rate": 9.900793438320037e-06, "loss": 0.3927, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1057, "tokens_per_second_per_gpu": 19796.93, "total_tokens": 95575732 }, { "epoch": 0.2113569395195525, "grad_norm": 0.69921875, "learning_rate": 9.884259696978275e-06, "loss": 0.4291, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1058, "tokens_per_second_per_gpu": 19887.8, "total_tokens": 95672127 }, { "epoch": 0.2115567097837487, "grad_norm": 0.67578125, "learning_rate": 9.86772627206608e-06, "loss": 0.4002, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1059, "tokens_per_second_per_gpu": 20185.02, "total_tokens": 95770067 }, { "epoch": 0.21175648004794487, "grad_norm": 0.6953125, "learning_rate": 9.851193208785206e-06, "loss": 0.402, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1060, "tokens_per_second_per_gpu": 19302.24, "total_tokens": 95864370 }, { "epoch": 0.21195625031214105, "grad_norm": 0.74609375, "learning_rate": 9.834660552336415e-06, "loss": 0.3948, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1061, "tokens_per_second_per_gpu": 16927.69, "total_tokens": 95946988 }, { "epoch": 0.2121560205763372, "grad_norm": 0.66796875, "learning_rate": 9.818128347919364e-06, "loss": 0.3784, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1062, "tokens_per_second_per_gpu": 18958.29, "total_tokens": 96037932 }, { "epoch": 0.21235579084053338, "grad_norm": 0.72265625, "learning_rate": 9.801596640732466e-06, "loss": 0.3702, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1063, "tokens_per_second_per_gpu": 17024.17, "total_tokens": 96121588 }, { "epoch": 0.21255556110472956, "grad_norm": 0.703125, "learning_rate": 9.785065475972773e-06, "loss": 0.3673, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1064, "tokens_per_second_per_gpu": 18230.72, "total_tokens": 96209846 }, { "epoch": 0.21275533136892574, "grad_norm": 0.75390625, "learning_rate": 9.768534898835864e-06, "loss": 0.4095, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1065, "tokens_per_second_per_gpu": 17544.93, "total_tokens": 96295921 }, { "epoch": 0.2129551016331219, "grad_norm": 0.67578125, "learning_rate": 9.7520049545157e-06, "loss": 0.377, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1066, "tokens_per_second_per_gpu": 19406.71, "total_tokens": 96388618 }, { "epoch": 0.21315487189731808, "grad_norm": 0.6953125, "learning_rate": 9.735475688204522e-06, "loss": 0.3818, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1067, "tokens_per_second_per_gpu": 17758.0, "total_tokens": 96475205 }, { "epoch": 0.21335464216151426, "grad_norm": 0.7265625, "learning_rate": 9.718947145092715e-06, "loss": 0.4002, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1068, "tokens_per_second_per_gpu": 19417.58, "total_tokens": 96568837 }, { "epoch": 0.21355441242571044, "grad_norm": 0.69140625, "learning_rate": 9.702419370368677e-06, "loss": 0.4303, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1069, "tokens_per_second_per_gpu": 19831.87, "total_tokens": 96666297 }, { "epoch": 0.21375418268990662, "grad_norm": 0.69921875, "learning_rate": 9.685892409218718e-06, "loss": 0.4011, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1070, "tokens_per_second_per_gpu": 20150.63, "total_tokens": 96763636 }, { "epoch": 0.21395395295410277, "grad_norm": 0.7109375, "learning_rate": 9.669366306826919e-06, "loss": 0.3979, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1071, "tokens_per_second_per_gpu": 18417.03, "total_tokens": 96853284 }, { "epoch": 0.21415372321829895, "grad_norm": 0.70703125, "learning_rate": 9.652841108375013e-06, "loss": 0.409, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1072, "tokens_per_second_per_gpu": 17849.87, "total_tokens": 96940631 }, { "epoch": 0.21435349348249513, "grad_norm": 0.73046875, "learning_rate": 9.636316859042258e-06, "loss": 0.3889, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1073, "tokens_per_second_per_gpu": 18006.54, "total_tokens": 97026019 }, { "epoch": 0.21455326374669131, "grad_norm": 0.73046875, "learning_rate": 9.619793604005323e-06, "loss": 0.371, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1074, "tokens_per_second_per_gpu": 16441.5, "total_tokens": 97106779 }, { "epoch": 0.21475303401088747, "grad_norm": 0.7109375, "learning_rate": 9.603271388438158e-06, "loss": 0.3765, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1075, "tokens_per_second_per_gpu": 17702.57, "total_tokens": 97192869 }, { "epoch": 0.21495280427508365, "grad_norm": 0.7265625, "learning_rate": 9.586750257511868e-06, "loss": 0.3881, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1076, "tokens_per_second_per_gpu": 18859.46, "total_tokens": 97284370 }, { "epoch": 0.21515257453927983, "grad_norm": 0.72265625, "learning_rate": 9.570230256394595e-06, "loss": 0.3907, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1077, "tokens_per_second_per_gpu": 18552.45, "total_tokens": 97374206 }, { "epoch": 0.215352344803476, "grad_norm": 0.70703125, "learning_rate": 9.553711430251388e-06, "loss": 0.3892, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1078, "tokens_per_second_per_gpu": 17409.27, "total_tokens": 97458582 }, { "epoch": 0.2155521150676722, "grad_norm": 0.7265625, "learning_rate": 9.537193824244092e-06, "loss": 0.4015, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1079, "tokens_per_second_per_gpu": 18327.67, "total_tokens": 97547689 }, { "epoch": 0.21575188533186834, "grad_norm": 0.7109375, "learning_rate": 9.520677483531205e-06, "loss": 0.4031, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1080, "tokens_per_second_per_gpu": 17948.36, "total_tokens": 97635849 }, { "epoch": 0.21595165559606452, "grad_norm": 0.71875, "learning_rate": 9.504162453267776e-06, "loss": 0.3814, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1081, "tokens_per_second_per_gpu": 18263.95, "total_tokens": 97723821 }, { "epoch": 0.2161514258602607, "grad_norm": 0.71875, "learning_rate": 9.48764877860527e-06, "loss": 0.3946, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1082, "tokens_per_second_per_gpu": 18333.99, "total_tokens": 97813140 }, { "epoch": 0.21635119612445688, "grad_norm": 0.70703125, "learning_rate": 9.471136504691436e-06, "loss": 0.4313, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1083, "tokens_per_second_per_gpu": 19770.12, "total_tokens": 97910797 }, { "epoch": 0.21655096638865304, "grad_norm": 0.69140625, "learning_rate": 9.454625676670203e-06, "loss": 0.3804, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1084, "tokens_per_second_per_gpu": 18576.25, "total_tokens": 98000656 }, { "epoch": 0.21675073665284922, "grad_norm": 0.734375, "learning_rate": 9.438116339681546e-06, "loss": 0.3896, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1085, "tokens_per_second_per_gpu": 17426.85, "total_tokens": 98084953 }, { "epoch": 0.2169505069170454, "grad_norm": 0.734375, "learning_rate": 9.421608538861361e-06, "loss": 0.3777, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1086, "tokens_per_second_per_gpu": 16854.8, "total_tokens": 98167221 }, { "epoch": 0.21715027718124158, "grad_norm": 0.6875, "learning_rate": 9.405102319341345e-06, "loss": 0.3989, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1087, "tokens_per_second_per_gpu": 19054.55, "total_tokens": 98260818 }, { "epoch": 0.21735004744543773, "grad_norm": 0.6953125, "learning_rate": 9.38859772624887e-06, "loss": 0.3748, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1088, "tokens_per_second_per_gpu": 17754.42, "total_tokens": 98348546 }, { "epoch": 0.2175498177096339, "grad_norm": 0.71875, "learning_rate": 9.372094804706867e-06, "loss": 0.3978, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1089, "tokens_per_second_per_gpu": 17325.76, "total_tokens": 98434081 }, { "epoch": 0.2177495879738301, "grad_norm": 0.71484375, "learning_rate": 9.35559359983369e-06, "loss": 0.3863, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1090, "tokens_per_second_per_gpu": 17480.14, "total_tokens": 98520574 }, { "epoch": 0.21794935823802628, "grad_norm": 0.72265625, "learning_rate": 9.339094156743007e-06, "loss": 0.3949, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1091, "tokens_per_second_per_gpu": 18101.03, "total_tokens": 98609082 }, { "epoch": 0.21814912850222246, "grad_norm": 0.7109375, "learning_rate": 9.322596520543661e-06, "loss": 0.3653, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1092, "tokens_per_second_per_gpu": 17431.66, "total_tokens": 98694341 }, { "epoch": 0.2183488987664186, "grad_norm": 0.7109375, "learning_rate": 9.30610073633956e-06, "loss": 0.3844, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1093, "tokens_per_second_per_gpu": 16673.14, "total_tokens": 98777179 }, { "epoch": 0.2185486690306148, "grad_norm": 0.72265625, "learning_rate": 9.28960684922955e-06, "loss": 0.391, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1094, "tokens_per_second_per_gpu": 17625.56, "total_tokens": 98863310 }, { "epoch": 0.21874843929481097, "grad_norm": 0.7109375, "learning_rate": 9.27311490430729e-06, "loss": 0.4195, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1095, "tokens_per_second_per_gpu": 18974.54, "total_tokens": 98956051 }, { "epoch": 0.21894820955900715, "grad_norm": 0.7265625, "learning_rate": 9.256624946661126e-06, "loss": 0.3909, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1096, "tokens_per_second_per_gpu": 17036.78, "total_tokens": 99040690 }, { "epoch": 0.2191479798232033, "grad_norm": 0.72265625, "learning_rate": 9.24013702137397e-06, "loss": 0.3918, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1097, "tokens_per_second_per_gpu": 17987.39, "total_tokens": 99128200 }, { "epoch": 0.21934775008739948, "grad_norm": 0.6875, "learning_rate": 9.223651173523182e-06, "loss": 0.3883, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1098, "tokens_per_second_per_gpu": 18964.45, "total_tokens": 99220247 }, { "epoch": 0.21954752035159567, "grad_norm": 0.71875, "learning_rate": 9.20716744818044e-06, "loss": 0.4054, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1099, "tokens_per_second_per_gpu": 17644.81, "total_tokens": 99307358 }, { "epoch": 0.21974729061579185, "grad_norm": 0.703125, "learning_rate": 9.190685890411628e-06, "loss": 0.3947, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1100, "tokens_per_second_per_gpu": 17331.11, "total_tokens": 99392906 }, { "epoch": 0.21994706087998803, "grad_norm": 0.68359375, "learning_rate": 9.174206545276678e-06, "loss": 0.3935, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1101, "tokens_per_second_per_gpu": 20228.18, "total_tokens": 99491279 }, { "epoch": 0.22014683114418418, "grad_norm": 0.69140625, "learning_rate": 9.157729457829504e-06, "loss": 0.4115, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1102, "tokens_per_second_per_gpu": 18808.58, "total_tokens": 99583026 }, { "epoch": 0.22034660140838036, "grad_norm": 0.6953125, "learning_rate": 9.14125467311783e-06, "loss": 0.4082, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1103, "tokens_per_second_per_gpu": 18921.2, "total_tokens": 99675362 }, { "epoch": 0.22054637167257654, "grad_norm": 0.69921875, "learning_rate": 9.124782236183088e-06, "loss": 0.3736, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1104, "tokens_per_second_per_gpu": 17196.27, "total_tokens": 99760953 }, { "epoch": 0.22074614193677272, "grad_norm": 0.70703125, "learning_rate": 9.108312192060298e-06, "loss": 0.3702, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1105, "tokens_per_second_per_gpu": 17348.98, "total_tokens": 99846349 }, { "epoch": 0.22094591220096887, "grad_norm": 0.70703125, "learning_rate": 9.091844585777919e-06, "loss": 0.3705, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1106, "tokens_per_second_per_gpu": 17986.4, "total_tokens": 99934128 }, { "epoch": 0.22114568246516506, "grad_norm": 0.71484375, "learning_rate": 9.075379462357766e-06, "loss": 0.392, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1107, "tokens_per_second_per_gpu": 18271.73, "total_tokens": 100023228 }, { "epoch": 0.22134545272936124, "grad_norm": 0.703125, "learning_rate": 9.058916866814857e-06, "loss": 0.3786, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1108, "tokens_per_second_per_gpu": 17790.65, "total_tokens": 100110144 }, { "epoch": 0.22154522299355742, "grad_norm": 0.70703125, "learning_rate": 9.042456844157299e-06, "loss": 0.4013, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1109, "tokens_per_second_per_gpu": 19390.42, "total_tokens": 100204722 }, { "epoch": 0.22174499325775357, "grad_norm": 0.7109375, "learning_rate": 9.02599943938617e-06, "loss": 0.3913, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1110, "tokens_per_second_per_gpu": 17881.35, "total_tokens": 100290834 }, { "epoch": 0.22194476352194975, "grad_norm": 0.67578125, "learning_rate": 9.009544697495373e-06, "loss": 0.3884, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1111, "tokens_per_second_per_gpu": 18800.82, "total_tokens": 100382427 }, { "epoch": 0.22214453378614593, "grad_norm": 0.6953125, "learning_rate": 8.993092663471556e-06, "loss": 0.4091, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1112, "tokens_per_second_per_gpu": 19143.26, "total_tokens": 100474811 }, { "epoch": 0.2223443040503421, "grad_norm": 0.7109375, "learning_rate": 8.97664338229395e-06, "loss": 0.3766, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1113, "tokens_per_second_per_gpu": 17509.86, "total_tokens": 100560312 }, { "epoch": 0.2225440743145383, "grad_norm": 0.703125, "learning_rate": 8.960196898934264e-06, "loss": 0.3862, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1114, "tokens_per_second_per_gpu": 18398.87, "total_tokens": 100650076 }, { "epoch": 0.22274384457873445, "grad_norm": 0.703125, "learning_rate": 8.943753258356545e-06, "loss": 0.3934, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1115, "tokens_per_second_per_gpu": 19218.1, "total_tokens": 100743434 }, { "epoch": 0.22294361484293063, "grad_norm": 0.75, "learning_rate": 8.927312505517086e-06, "loss": 0.4079, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1116, "tokens_per_second_per_gpu": 17061.85, "total_tokens": 100827601 }, { "epoch": 0.2231433851071268, "grad_norm": 0.71875, "learning_rate": 8.910874685364275e-06, "loss": 0.4163, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1117, "tokens_per_second_per_gpu": 18235.66, "total_tokens": 100917285 }, { "epoch": 0.223343155371323, "grad_norm": 0.7109375, "learning_rate": 8.894439842838488e-06, "loss": 0.3852, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1118, "tokens_per_second_per_gpu": 19736.9, "total_tokens": 101012860 }, { "epoch": 0.22354292563551914, "grad_norm": 0.6953125, "learning_rate": 8.878008022871959e-06, "loss": 0.3997, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1119, "tokens_per_second_per_gpu": 19240.95, "total_tokens": 101105085 }, { "epoch": 0.22374269589971532, "grad_norm": 0.69140625, "learning_rate": 8.861579270388649e-06, "loss": 0.3885, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1120, "tokens_per_second_per_gpu": 19035.66, "total_tokens": 101196877 }, { "epoch": 0.2239424661639115, "grad_norm": 0.68359375, "learning_rate": 8.84515363030414e-06, "loss": 0.3971, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1121, "tokens_per_second_per_gpu": 19703.72, "total_tokens": 101292121 }, { "epoch": 0.22414223642810768, "grad_norm": 0.70703125, "learning_rate": 8.82873114752551e-06, "loss": 0.4025, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1122, "tokens_per_second_per_gpu": 19115.02, "total_tokens": 101385037 }, { "epoch": 0.22434200669230386, "grad_norm": 0.73828125, "learning_rate": 8.812311866951198e-06, "loss": 0.3986, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1123, "tokens_per_second_per_gpu": 18567.64, "total_tokens": 101475485 }, { "epoch": 0.22454177695650002, "grad_norm": 0.73828125, "learning_rate": 8.795895833470896e-06, "loss": 0.3971, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1124, "tokens_per_second_per_gpu": 17526.61, "total_tokens": 101561556 }, { "epoch": 0.2247415472206962, "grad_norm": 0.69140625, "learning_rate": 8.7794830919654e-06, "loss": 0.3755, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1125, "tokens_per_second_per_gpu": 17544.39, "total_tokens": 101646227 }, { "epoch": 0.22494131748489238, "grad_norm": 0.71875, "learning_rate": 8.763073687306523e-06, "loss": 0.3753, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1126, "tokens_per_second_per_gpu": 17443.86, "total_tokens": 101730566 }, { "epoch": 0.22514108774908856, "grad_norm": 0.6484375, "learning_rate": 8.746667664356957e-06, "loss": 0.3895, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1127, "tokens_per_second_per_gpu": 20284.63, "total_tokens": 101829376 }, { "epoch": 0.2253408580132847, "grad_norm": 0.72265625, "learning_rate": 8.730265067970141e-06, "loss": 0.4012, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1128, "tokens_per_second_per_gpu": 17934.13, "total_tokens": 101915973 }, { "epoch": 0.2255406282774809, "grad_norm": 0.72265625, "learning_rate": 8.713865942990143e-06, "loss": 0.3799, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1129, "tokens_per_second_per_gpu": 18096.17, "total_tokens": 102002753 }, { "epoch": 0.22574039854167707, "grad_norm": 0.6796875, "learning_rate": 8.697470334251543e-06, "loss": 0.4147, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1130, "tokens_per_second_per_gpu": 19923.33, "total_tokens": 102101681 }, { "epoch": 0.22594016880587325, "grad_norm": 0.703125, "learning_rate": 8.68107828657931e-06, "loss": 0.39, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1131, "tokens_per_second_per_gpu": 18940.99, "total_tokens": 102192949 }, { "epoch": 0.2261399390700694, "grad_norm": 0.703125, "learning_rate": 8.664689844788683e-06, "loss": 0.3879, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1132, "tokens_per_second_per_gpu": 18221.03, "total_tokens": 102281099 }, { "epoch": 0.2263397093342656, "grad_norm": 0.734375, "learning_rate": 8.648305053685035e-06, "loss": 0.4054, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1133, "tokens_per_second_per_gpu": 18738.94, "total_tokens": 102372985 }, { "epoch": 0.22653947959846177, "grad_norm": 0.70703125, "learning_rate": 8.63192395806375e-06, "loss": 0.3836, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1134, "tokens_per_second_per_gpu": 18112.34, "total_tokens": 102460764 }, { "epoch": 0.22673924986265795, "grad_norm": 0.7109375, "learning_rate": 8.615546602710126e-06, "loss": 0.3877, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1135, "tokens_per_second_per_gpu": 18461.2, "total_tokens": 102551054 }, { "epoch": 0.22693902012685413, "grad_norm": 0.69921875, "learning_rate": 8.599173032399222e-06, "loss": 0.3783, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1136, "tokens_per_second_per_gpu": 19077.81, "total_tokens": 102643670 }, { "epoch": 0.22713879039105028, "grad_norm": 0.7265625, "learning_rate": 8.582803291895758e-06, "loss": 0.4016, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1137, "tokens_per_second_per_gpu": 18748.06, "total_tokens": 102734551 }, { "epoch": 0.22733856065524646, "grad_norm": 0.6796875, "learning_rate": 8.566437425953985e-06, "loss": 0.4045, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1138, "tokens_per_second_per_gpu": 20453.92, "total_tokens": 102831918 }, { "epoch": 0.22753833091944264, "grad_norm": 0.703125, "learning_rate": 8.550075479317542e-06, "loss": 0.3572, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1139, "tokens_per_second_per_gpu": 18047.68, "total_tokens": 102919126 }, { "epoch": 0.22773810118363882, "grad_norm": 0.703125, "learning_rate": 8.533717496719374e-06, "loss": 0.4047, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1140, "tokens_per_second_per_gpu": 18741.08, "total_tokens": 103009565 }, { "epoch": 0.22793787144783498, "grad_norm": 0.71484375, "learning_rate": 8.51736352288158e-06, "loss": 0.3809, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1141, "tokens_per_second_per_gpu": 18028.84, "total_tokens": 103098075 }, { "epoch": 0.22813764171203116, "grad_norm": 0.6953125, "learning_rate": 8.501013602515306e-06, "loss": 0.3864, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1142, "tokens_per_second_per_gpu": 18799.61, "total_tokens": 103187920 }, { "epoch": 0.22833741197622734, "grad_norm": 0.6953125, "learning_rate": 8.484667780320598e-06, "loss": 0.4124, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1143, "tokens_per_second_per_gpu": 19375.74, "total_tokens": 103280265 }, { "epoch": 0.22853718224042352, "grad_norm": 0.71875, "learning_rate": 8.468326100986317e-06, "loss": 0.3729, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1144, "tokens_per_second_per_gpu": 16514.46, "total_tokens": 103360167 }, { "epoch": 0.2287369525046197, "grad_norm": 0.6796875, "learning_rate": 8.451988609189987e-06, "loss": 0.412, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1145, "tokens_per_second_per_gpu": 18640.91, "total_tokens": 103451681 }, { "epoch": 0.22893672276881585, "grad_norm": 0.703125, "learning_rate": 8.43565534959769e-06, "loss": 0.4356, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1146, "tokens_per_second_per_gpu": 20238.9, "total_tokens": 103551291 }, { "epoch": 0.22913649303301203, "grad_norm": 0.72265625, "learning_rate": 8.419326366863937e-06, "loss": 0.3953, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1147, "tokens_per_second_per_gpu": 17661.07, "total_tokens": 103639039 }, { "epoch": 0.22933626329720821, "grad_norm": 0.71875, "learning_rate": 8.403001705631537e-06, "loss": 0.3963, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1148, "tokens_per_second_per_gpu": 17550.27, "total_tokens": 103724138 }, { "epoch": 0.2295360335614044, "grad_norm": 0.7109375, "learning_rate": 8.386681410531493e-06, "loss": 0.3628, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1149, "tokens_per_second_per_gpu": 17430.12, "total_tokens": 103808723 }, { "epoch": 0.22973580382560055, "grad_norm": 0.8671875, "learning_rate": 8.370365526182862e-06, "loss": 0.4117, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1150, "tokens_per_second_per_gpu": 20409.51, "total_tokens": 103908291 }, { "epoch": 0.22993557408979673, "grad_norm": 0.703125, "learning_rate": 8.35405409719266e-06, "loss": 0.4023, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1151, "tokens_per_second_per_gpu": 19120.72, "total_tokens": 104001012 }, { "epoch": 0.2301353443539929, "grad_norm": 0.69140625, "learning_rate": 8.33774716815571e-06, "loss": 0.4014, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1152, "tokens_per_second_per_gpu": 19263.81, "total_tokens": 104095058 }, { "epoch": 0.2303351146181891, "grad_norm": 0.6953125, "learning_rate": 8.321444783654524e-06, "loss": 0.3635, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1153, "tokens_per_second_per_gpu": 16905.23, "total_tokens": 104177634 }, { "epoch": 0.23053488488238524, "grad_norm": 0.703125, "learning_rate": 8.305146988259205e-06, "loss": 0.4173, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1154, "tokens_per_second_per_gpu": 19048.38, "total_tokens": 104270924 }, { "epoch": 0.23073465514658142, "grad_norm": 0.6953125, "learning_rate": 8.2888538265273e-06, "loss": 0.4076, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1155, "tokens_per_second_per_gpu": 19528.34, "total_tokens": 104365404 }, { "epoch": 0.2309344254107776, "grad_norm": 0.68359375, "learning_rate": 8.2725653430037e-06, "loss": 0.4036, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1156, "tokens_per_second_per_gpu": 19002.06, "total_tokens": 104457855 }, { "epoch": 0.23113419567497379, "grad_norm": 0.7265625, "learning_rate": 8.256281582220486e-06, "loss": 0.347, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1157, "tokens_per_second_per_gpu": 17901.24, "total_tokens": 104544361 }, { "epoch": 0.23133396593916997, "grad_norm": 0.72265625, "learning_rate": 8.24000258869684e-06, "loss": 0.4159, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1158, "tokens_per_second_per_gpu": 18436.85, "total_tokens": 104634271 }, { "epoch": 0.23153373620336612, "grad_norm": 0.69140625, "learning_rate": 8.223728406938914e-06, "loss": 0.3897, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1159, "tokens_per_second_per_gpu": 18112.75, "total_tokens": 104721928 }, { "epoch": 0.2317335064675623, "grad_norm": 0.71875, "learning_rate": 8.207459081439696e-06, "loss": 0.4009, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1160, "tokens_per_second_per_gpu": 18299.69, "total_tokens": 104811313 }, { "epoch": 0.23193327673175848, "grad_norm": 0.69140625, "learning_rate": 8.191194656678905e-06, "loss": 0.4066, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1161, "tokens_per_second_per_gpu": 20114.35, "total_tokens": 104907141 }, { "epoch": 0.23213304699595466, "grad_norm": 0.68359375, "learning_rate": 8.174935177122849e-06, "loss": 0.3904, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1162, "tokens_per_second_per_gpu": 20408.41, "total_tokens": 105003038 }, { "epoch": 0.23233281726015081, "grad_norm": 0.66796875, "learning_rate": 8.15868068722433e-06, "loss": 0.3733, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1163, "tokens_per_second_per_gpu": 19129.23, "total_tokens": 105095449 }, { "epoch": 0.232532587524347, "grad_norm": 0.671875, "learning_rate": 8.142431231422501e-06, "loss": 0.4111, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1164, "tokens_per_second_per_gpu": 20050.85, "total_tokens": 105190152 }, { "epoch": 0.23273235778854318, "grad_norm": 0.70703125, "learning_rate": 8.126186854142752e-06, "loss": 0.3933, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1165, "tokens_per_second_per_gpu": 18672.92, "total_tokens": 105281121 }, { "epoch": 0.23293212805273936, "grad_norm": 0.71484375, "learning_rate": 8.109947599796599e-06, "loss": 0.3683, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1166, "tokens_per_second_per_gpu": 17956.3, "total_tokens": 105370006 }, { "epoch": 0.23313189831693554, "grad_norm": 0.71484375, "learning_rate": 8.093713512781534e-06, "loss": 0.3977, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1167, "tokens_per_second_per_gpu": 20267.27, "total_tokens": 105467234 }, { "epoch": 0.2333316685811317, "grad_norm": 0.70703125, "learning_rate": 8.077484637480931e-06, "loss": 0.3916, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1168, "tokens_per_second_per_gpu": 17620.06, "total_tokens": 105553540 }, { "epoch": 0.23353143884532787, "grad_norm": 0.703125, "learning_rate": 8.06126101826392e-06, "loss": 0.3871, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1169, "tokens_per_second_per_gpu": 18146.43, "total_tokens": 105641165 }, { "epoch": 0.23373120910952405, "grad_norm": 0.70703125, "learning_rate": 8.045042699485256e-06, "loss": 0.4022, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1170, "tokens_per_second_per_gpu": 19304.39, "total_tokens": 105735040 }, { "epoch": 0.23393097937372023, "grad_norm": 0.703125, "learning_rate": 8.0288297254852e-06, "loss": 0.3759, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1171, "tokens_per_second_per_gpu": 18391.33, "total_tokens": 105823946 }, { "epoch": 0.23413074963791639, "grad_norm": 0.67578125, "learning_rate": 8.012622140589404e-06, "loss": 0.4022, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1172, "tokens_per_second_per_gpu": 20336.86, "total_tokens": 105922580 }, { "epoch": 0.23433051990211257, "grad_norm": 0.70703125, "learning_rate": 7.99641998910879e-06, "loss": 0.3956, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1173, "tokens_per_second_per_gpu": 18151.07, "total_tokens": 106011176 }, { "epoch": 0.23453029016630875, "grad_norm": 0.66796875, "learning_rate": 7.980223315339417e-06, "loss": 0.3918, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1174, "tokens_per_second_per_gpu": 19303.37, "total_tokens": 106105858 }, { "epoch": 0.23473006043050493, "grad_norm": 0.6796875, "learning_rate": 7.964032163562378e-06, "loss": 0.3718, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1175, "tokens_per_second_per_gpu": 19381.32, "total_tokens": 106199337 }, { "epoch": 0.23492983069470108, "grad_norm": 0.69140625, "learning_rate": 7.947846578043658e-06, "loss": 0.3981, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1176, "tokens_per_second_per_gpu": 19639.57, "total_tokens": 106294402 }, { "epoch": 0.23512960095889726, "grad_norm": 0.6875, "learning_rate": 7.931666603034034e-06, "loss": 0.3957, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1177, "tokens_per_second_per_gpu": 20065.09, "total_tokens": 106392906 }, { "epoch": 0.23532937122309344, "grad_norm": 0.71484375, "learning_rate": 7.915492282768938e-06, "loss": 0.3882, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1178, "tokens_per_second_per_gpu": 18202.86, "total_tokens": 106482193 }, { "epoch": 0.23552914148728962, "grad_norm": 0.671875, "learning_rate": 7.899323661468344e-06, "loss": 0.3724, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1179, "tokens_per_second_per_gpu": 19131.03, "total_tokens": 106573917 }, { "epoch": 0.2357289117514858, "grad_norm": 0.73046875, "learning_rate": 7.883160783336646e-06, "loss": 0.4081, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1180, "tokens_per_second_per_gpu": 18864.02, "total_tokens": 106664948 }, { "epoch": 0.23592868201568196, "grad_norm": 0.72265625, "learning_rate": 7.867003692562533e-06, "loss": 0.414, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1181, "tokens_per_second_per_gpu": 19868.13, "total_tokens": 106759967 }, { "epoch": 0.23612845227987814, "grad_norm": 0.74609375, "learning_rate": 7.850852433318878e-06, "loss": 0.412, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1182, "tokens_per_second_per_gpu": 18770.39, "total_tokens": 106850537 }, { "epoch": 0.23632822254407432, "grad_norm": 0.72265625, "learning_rate": 7.834707049762605e-06, "loss": 0.4111, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1183, "tokens_per_second_per_gpu": 19135.95, "total_tokens": 106943800 }, { "epoch": 0.2365279928082705, "grad_norm": 0.68359375, "learning_rate": 7.818567586034578e-06, "loss": 0.3813, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1184, "tokens_per_second_per_gpu": 18829.63, "total_tokens": 107034808 }, { "epoch": 0.23672776307246665, "grad_norm": 0.6953125, "learning_rate": 7.80243408625947e-06, "loss": 0.3578, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1185, "tokens_per_second_per_gpu": 17574.33, "total_tokens": 107120202 }, { "epoch": 0.23692753333666283, "grad_norm": 0.68359375, "learning_rate": 7.786306594545658e-06, "loss": 0.3729, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1186, "tokens_per_second_per_gpu": 18770.82, "total_tokens": 107210986 }, { "epoch": 0.237127303600859, "grad_norm": 0.69921875, "learning_rate": 7.770185154985086e-06, "loss": 0.3982, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1187, "tokens_per_second_per_gpu": 19098.06, "total_tokens": 107304319 }, { "epoch": 0.2373270738650552, "grad_norm": 0.6875, "learning_rate": 7.754069811653155e-06, "loss": 0.4184, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1188, "tokens_per_second_per_gpu": 19785.62, "total_tokens": 107400868 }, { "epoch": 0.23752684412925137, "grad_norm": 0.6953125, "learning_rate": 7.7379606086086e-06, "loss": 0.3886, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1189, "tokens_per_second_per_gpu": 19425.63, "total_tokens": 107494589 }, { "epoch": 0.23772661439344753, "grad_norm": 0.76171875, "learning_rate": 7.721857589893364e-06, "loss": 0.3819, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1190, "tokens_per_second_per_gpu": 16689.33, "total_tokens": 107574318 }, { "epoch": 0.2379263846576437, "grad_norm": 0.703125, "learning_rate": 7.705760799532485e-06, "loss": 0.4013, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1191, "tokens_per_second_per_gpu": 19068.76, "total_tokens": 107668067 }, { "epoch": 0.2381261549218399, "grad_norm": 0.6796875, "learning_rate": 7.689670281533977e-06, "loss": 0.4173, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1192, "tokens_per_second_per_gpu": 19890.07, "total_tokens": 107765359 }, { "epoch": 0.23832592518603607, "grad_norm": 0.82421875, "learning_rate": 7.673586079888699e-06, "loss": 0.4272, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1193, "tokens_per_second_per_gpu": 19470.72, "total_tokens": 107863000 }, { "epoch": 0.23852569545023222, "grad_norm": 0.69921875, "learning_rate": 7.657508238570246e-06, "loss": 0.3861, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1194, "tokens_per_second_per_gpu": 18600.43, "total_tokens": 107951854 }, { "epoch": 0.2387254657144284, "grad_norm": 0.6796875, "learning_rate": 7.641436801534818e-06, "loss": 0.3938, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1195, "tokens_per_second_per_gpu": 19095.78, "total_tokens": 108043788 }, { "epoch": 0.23892523597862458, "grad_norm": 0.69921875, "learning_rate": 7.625371812721115e-06, "loss": 0.4162, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1196, "tokens_per_second_per_gpu": 19071.54, "total_tokens": 108135892 }, { "epoch": 0.23912500624282076, "grad_norm": 0.69921875, "learning_rate": 7.6093133160502e-06, "loss": 0.3753, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1197, "tokens_per_second_per_gpu": 18878.3, "total_tokens": 108227514 }, { "epoch": 0.23932477650701692, "grad_norm": 0.70703125, "learning_rate": 7.593261355425394e-06, "loss": 0.4081, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1198, "tokens_per_second_per_gpu": 18961.11, "total_tokens": 108318907 }, { "epoch": 0.2395245467712131, "grad_norm": 0.69140625, "learning_rate": 7.577215974732139e-06, "loss": 0.3778, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1199, "tokens_per_second_per_gpu": 18768.7, "total_tokens": 108409143 }, { "epoch": 0.23972431703540928, "grad_norm": 0.703125, "learning_rate": 7.561177217837894e-06, "loss": 0.3662, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1200, "tokens_per_second_per_gpu": 17107.45, "total_tokens": 108493364 }, { "epoch": 0.23992408729960546, "grad_norm": 0.7109375, "learning_rate": 7.545145128592009e-06, "loss": 0.4365, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1201, "tokens_per_second_per_gpu": 21286.65, "total_tokens": 108596282 }, { "epoch": 0.24012385756380164, "grad_norm": 0.69140625, "learning_rate": 7.529119750825605e-06, "loss": 0.3956, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1202, "tokens_per_second_per_gpu": 18692.71, "total_tokens": 108687457 }, { "epoch": 0.2403236278279978, "grad_norm": 0.6875, "learning_rate": 7.513101128351454e-06, "loss": 0.424, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1203, "tokens_per_second_per_gpu": 20395.69, "total_tokens": 108787283 }, { "epoch": 0.24052339809219397, "grad_norm": 0.765625, "learning_rate": 7.497089304963854e-06, "loss": 0.3596, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1204, "tokens_per_second_per_gpu": 17494.5, "total_tokens": 108872135 }, { "epoch": 0.24072316835639015, "grad_norm": 0.703125, "learning_rate": 7.481084324438521e-06, "loss": 0.3767, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1205, "tokens_per_second_per_gpu": 18619.9, "total_tokens": 108961991 }, { "epoch": 0.24092293862058634, "grad_norm": 0.72265625, "learning_rate": 7.46508623053246e-06, "loss": 0.361, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1206, "tokens_per_second_per_gpu": 16248.62, "total_tokens": 109041614 }, { "epoch": 0.2411227088847825, "grad_norm": 0.69921875, "learning_rate": 7.449095066983849e-06, "loss": 0.39, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1207, "tokens_per_second_per_gpu": 17369.18, "total_tokens": 109126708 }, { "epoch": 0.24132247914897867, "grad_norm": 0.6796875, "learning_rate": 7.433110877511922e-06, "loss": 0.402, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1208, "tokens_per_second_per_gpu": 19928.53, "total_tokens": 109221677 }, { "epoch": 0.24152224941317485, "grad_norm": 0.703125, "learning_rate": 7.4171337058168365e-06, "loss": 0.4046, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1209, "tokens_per_second_per_gpu": 19613.27, "total_tokens": 109314917 }, { "epoch": 0.24172201967737103, "grad_norm": 0.703125, "learning_rate": 7.401163595579573e-06, "loss": 0.3759, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1210, "tokens_per_second_per_gpu": 17718.94, "total_tokens": 109401603 }, { "epoch": 0.2419217899415672, "grad_norm": 0.70703125, "learning_rate": 7.385200590461803e-06, "loss": 0.3802, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1211, "tokens_per_second_per_gpu": 18518.37, "total_tokens": 109490692 }, { "epoch": 0.24212156020576336, "grad_norm": 0.68359375, "learning_rate": 7.369244734105774e-06, "loss": 0.3741, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1212, "tokens_per_second_per_gpu": 19250.22, "total_tokens": 109584568 }, { "epoch": 0.24232133046995954, "grad_norm": 0.7109375, "learning_rate": 7.353296070134186e-06, "loss": 0.3891, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1213, "tokens_per_second_per_gpu": 17940.75, "total_tokens": 109671116 }, { "epoch": 0.24252110073415573, "grad_norm": 0.7265625, "learning_rate": 7.337354642150077e-06, "loss": 0.4079, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1214, "tokens_per_second_per_gpu": 18044.95, "total_tokens": 109758332 }, { "epoch": 0.2427208709983519, "grad_norm": 0.703125, "learning_rate": 7.321420493736705e-06, "loss": 0.3862, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1215, "tokens_per_second_per_gpu": 17451.4, "total_tokens": 109844087 }, { "epoch": 0.24292064126254806, "grad_norm": 0.734375, "learning_rate": 7.305493668457421e-06, "loss": 0.4097, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1216, "tokens_per_second_per_gpu": 18805.29, "total_tokens": 109935034 }, { "epoch": 0.24312041152674424, "grad_norm": 0.6953125, "learning_rate": 7.28957420985556e-06, "loss": 0.4265, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1217, "tokens_per_second_per_gpu": 20162.91, "total_tokens": 110032467 }, { "epoch": 0.24332018179094042, "grad_norm": 0.70703125, "learning_rate": 7.273662161454309e-06, "loss": 0.3766, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1218, "tokens_per_second_per_gpu": 17662.02, "total_tokens": 110119229 }, { "epoch": 0.2435199520551366, "grad_norm": 0.71484375, "learning_rate": 7.257757566756604e-06, "loss": 0.3946, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1219, "tokens_per_second_per_gpu": 19600.59, "total_tokens": 110212922 }, { "epoch": 0.24371972231933275, "grad_norm": 0.6796875, "learning_rate": 7.2418604692450015e-06, "loss": 0.3864, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1220, "tokens_per_second_per_gpu": 19016.35, "total_tokens": 110305855 }, { "epoch": 0.24391949258352894, "grad_norm": 0.69921875, "learning_rate": 7.225970912381557e-06, "loss": 0.3688, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1221, "tokens_per_second_per_gpu": 19042.34, "total_tokens": 110396493 }, { "epoch": 0.24411926284772512, "grad_norm": 0.7109375, "learning_rate": 7.210088939607709e-06, "loss": 0.3824, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1222, "tokens_per_second_per_gpu": 17895.91, "total_tokens": 110482877 }, { "epoch": 0.2443190331119213, "grad_norm": 0.69140625, "learning_rate": 7.194214594344169e-06, "loss": 0.3861, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1223, "tokens_per_second_per_gpu": 18743.81, "total_tokens": 110573554 }, { "epoch": 0.24451880337611748, "grad_norm": 0.703125, "learning_rate": 7.178347919990789e-06, "loss": 0.41, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1224, "tokens_per_second_per_gpu": 20547.15, "total_tokens": 110671589 }, { "epoch": 0.24471857364031363, "grad_norm": 0.7109375, "learning_rate": 7.16248895992645e-06, "loss": 0.3967, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1225, "tokens_per_second_per_gpu": 18389.82, "total_tokens": 110759989 }, { "epoch": 0.2449183439045098, "grad_norm": 0.7265625, "learning_rate": 7.14663775750895e-06, "loss": 0.4033, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1226, "tokens_per_second_per_gpu": 18281.25, "total_tokens": 110848432 }, { "epoch": 0.245118114168706, "grad_norm": 0.734375, "learning_rate": 7.13079435607486e-06, "loss": 0.3875, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1227, "tokens_per_second_per_gpu": 17482.03, "total_tokens": 110934887 }, { "epoch": 0.24531788443290217, "grad_norm": 0.70703125, "learning_rate": 7.114958798939442e-06, "loss": 0.3713, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1228, "tokens_per_second_per_gpu": 18082.61, "total_tokens": 111022368 }, { "epoch": 0.24551765469709833, "grad_norm": 0.73046875, "learning_rate": 7.099131129396501e-06, "loss": 0.3935, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1229, "tokens_per_second_per_gpu": 19165.69, "total_tokens": 111115185 }, { "epoch": 0.2457174249612945, "grad_norm": 0.7578125, "learning_rate": 7.083311390718285e-06, "loss": 0.3772, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1230, "tokens_per_second_per_gpu": 18137.93, "total_tokens": 111203180 }, { "epoch": 0.2459171952254907, "grad_norm": 0.70703125, "learning_rate": 7.067499626155354e-06, "loss": 0.4229, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1231, "tokens_per_second_per_gpu": 17916.08, "total_tokens": 111291869 }, { "epoch": 0.24611696548968687, "grad_norm": 0.9765625, "learning_rate": 7.051695878936466e-06, "loss": 0.3994, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1232, "tokens_per_second_per_gpu": 19510.59, "total_tokens": 111385951 }, { "epoch": 0.24631673575388305, "grad_norm": 0.71875, "learning_rate": 7.035900192268464e-06, "loss": 0.3787, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1233, "tokens_per_second_per_gpu": 18351.92, "total_tokens": 111475919 }, { "epoch": 0.2465165060180792, "grad_norm": 0.7265625, "learning_rate": 7.020112609336154e-06, "loss": 0.3712, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1234, "tokens_per_second_per_gpu": 16980.35, "total_tokens": 111559112 }, { "epoch": 0.24671627628227538, "grad_norm": 0.671875, "learning_rate": 7.004333173302185e-06, "loss": 0.3772, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1235, "tokens_per_second_per_gpu": 19252.3, "total_tokens": 111651015 }, { "epoch": 0.24691604654647156, "grad_norm": 0.6875, "learning_rate": 6.988561927306927e-06, "loss": 0.3381, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1236, "tokens_per_second_per_gpu": 18152.71, "total_tokens": 111737884 }, { "epoch": 0.24711581681066774, "grad_norm": 0.6953125, "learning_rate": 6.972798914468369e-06, "loss": 0.3926, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1237, "tokens_per_second_per_gpu": 19928.84, "total_tokens": 111832427 }, { "epoch": 0.2473155870748639, "grad_norm": 0.6953125, "learning_rate": 6.957044177881987e-06, "loss": 0.3846, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1238, "tokens_per_second_per_gpu": 17172.32, "total_tokens": 111916911 }, { "epoch": 0.24751535733906008, "grad_norm": 0.6640625, "learning_rate": 6.941297760620626e-06, "loss": 0.367, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1239, "tokens_per_second_per_gpu": 18569.71, "total_tokens": 112006780 }, { "epoch": 0.24771512760325626, "grad_norm": 0.71875, "learning_rate": 6.925559705734394e-06, "loss": 0.3858, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1240, "tokens_per_second_per_gpu": 16981.85, "total_tokens": 112089096 }, { "epoch": 0.24791489786745244, "grad_norm": 0.703125, "learning_rate": 6.909830056250527e-06, "loss": 0.4001, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1241, "tokens_per_second_per_gpu": 18736.28, "total_tokens": 112180651 }, { "epoch": 0.2481146681316486, "grad_norm": 0.6640625, "learning_rate": 6.89410885517329e-06, "loss": 0.3822, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1242, "tokens_per_second_per_gpu": 19295.7, "total_tokens": 112274126 }, { "epoch": 0.24831443839584477, "grad_norm": 0.69140625, "learning_rate": 6.878396145483841e-06, "loss": 0.394, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1243, "tokens_per_second_per_gpu": 18566.05, "total_tokens": 112363650 }, { "epoch": 0.24851420866004095, "grad_norm": 0.71484375, "learning_rate": 6.8626919701401355e-06, "loss": 0.3841, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1244, "tokens_per_second_per_gpu": 17699.93, "total_tokens": 112449866 }, { "epoch": 0.24871397892423713, "grad_norm": 0.7109375, "learning_rate": 6.846996372076786e-06, "loss": 0.398, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1245, "tokens_per_second_per_gpu": 17828.4, "total_tokens": 112537180 }, { "epoch": 0.24891374918843331, "grad_norm": 0.72265625, "learning_rate": 6.831309394204957e-06, "loss": 0.3701, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1246, "tokens_per_second_per_gpu": 19282.7, "total_tokens": 112630540 }, { "epoch": 0.24911351945262947, "grad_norm": 0.71484375, "learning_rate": 6.815631079412249e-06, "loss": 0.3998, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1247, "tokens_per_second_per_gpu": 18574.48, "total_tokens": 112720645 }, { "epoch": 0.24931328971682565, "grad_norm": 0.7265625, "learning_rate": 6.7999614705625725e-06, "loss": 0.4219, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1248, "tokens_per_second_per_gpu": 18929.62, "total_tokens": 112812550 }, { "epoch": 0.24951305998102183, "grad_norm": 0.71875, "learning_rate": 6.784300610496049e-06, "loss": 0.3833, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1249, "tokens_per_second_per_gpu": 17577.33, "total_tokens": 112897935 }, { "epoch": 0.249712830245218, "grad_norm": 0.69921875, "learning_rate": 6.7686485420288576e-06, "loss": 0.3867, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1250, "tokens_per_second_per_gpu": 17590.09, "total_tokens": 112985083 }, { "epoch": 0.24991260050941416, "grad_norm": 0.703125, "learning_rate": 6.7530053079531664e-06, "loss": 0.4061, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1251, "tokens_per_second_per_gpu": 19854.98, "total_tokens": 113082133 }, { "epoch": 0.25011237077361037, "grad_norm": 0.69921875, "learning_rate": 6.737370951036977e-06, "loss": 0.3768, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1252, "tokens_per_second_per_gpu": 18214.03, "total_tokens": 113170026 }, { "epoch": 0.2503121410378065, "grad_norm": 0.73046875, "learning_rate": 6.721745514024023e-06, "loss": 0.3742, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1253, "tokens_per_second_per_gpu": 16418.72, "total_tokens": 113250058 }, { "epoch": 0.2505119113020027, "grad_norm": 0.69921875, "learning_rate": 6.706129039633659e-06, "loss": 0.3608, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1254, "tokens_per_second_per_gpu": 16345.27, "total_tokens": 113330448 }, { "epoch": 0.2507116815661989, "grad_norm": 0.71875, "learning_rate": 6.690521570560717e-06, "loss": 0.3714, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1255, "tokens_per_second_per_gpu": 17268.78, "total_tokens": 113415162 }, { "epoch": 0.25091145183039504, "grad_norm": 0.71484375, "learning_rate": 6.674923149475433e-06, "loss": 0.3637, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1256, "tokens_per_second_per_gpu": 17429.94, "total_tokens": 113500583 }, { "epoch": 0.25111122209459125, "grad_norm": 0.703125, "learning_rate": 6.659333819023291e-06, "loss": 0.3589, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1257, "tokens_per_second_per_gpu": 16233.32, "total_tokens": 113581358 }, { "epoch": 0.2513109923587874, "grad_norm": 0.6875, "learning_rate": 6.643753621824922e-06, "loss": 0.3973, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1258, "tokens_per_second_per_gpu": 18648.99, "total_tokens": 113671097 }, { "epoch": 0.25151076262298355, "grad_norm": 0.73828125, "learning_rate": 6.6281826004759985e-06, "loss": 0.3867, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1259, "tokens_per_second_per_gpu": 18413.35, "total_tokens": 113760506 }, { "epoch": 0.25171053288717976, "grad_norm": 0.68359375, "learning_rate": 6.612620797547087e-06, "loss": 0.4056, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1260, "tokens_per_second_per_gpu": 19081.08, "total_tokens": 113854296 }, { "epoch": 0.2519103031513759, "grad_norm": 0.71484375, "learning_rate": 6.59706825558357e-06, "loss": 0.3985, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1261, "tokens_per_second_per_gpu": 18889.58, "total_tokens": 113946914 }, { "epoch": 0.25211007341557207, "grad_norm": 0.6875, "learning_rate": 6.581525017105501e-06, "loss": 0.3941, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1262, "tokens_per_second_per_gpu": 18912.26, "total_tokens": 114040193 }, { "epoch": 0.2523098436797683, "grad_norm": 0.69140625, "learning_rate": 6.565991124607507e-06, "loss": 0.3927, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1263, "tokens_per_second_per_gpu": 19241.07, "total_tokens": 114135089 }, { "epoch": 0.25250961394396443, "grad_norm": 0.72265625, "learning_rate": 6.5504666205586435e-06, "loss": 0.4025, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1264, "tokens_per_second_per_gpu": 19304.85, "total_tokens": 114228875 }, { "epoch": 0.25270938420816064, "grad_norm": 0.703125, "learning_rate": 6.534951547402322e-06, "loss": 0.3997, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1265, "tokens_per_second_per_gpu": 18129.42, "total_tokens": 114318557 }, { "epoch": 0.2529091544723568, "grad_norm": 0.70703125, "learning_rate": 6.519445947556156e-06, "loss": 0.3441, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1266, "tokens_per_second_per_gpu": 16667.84, "total_tokens": 114401302 }, { "epoch": 0.25310892473655294, "grad_norm": 0.6875, "learning_rate": 6.503949863411866e-06, "loss": 0.3903, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1267, "tokens_per_second_per_gpu": 18248.85, "total_tokens": 114490536 }, { "epoch": 0.25330869500074915, "grad_norm": 0.70703125, "learning_rate": 6.488463337335157e-06, "loss": 0.4116, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1268, "tokens_per_second_per_gpu": 18794.03, "total_tokens": 114581847 }, { "epoch": 0.2535084652649453, "grad_norm": 0.72265625, "learning_rate": 6.47298641166559e-06, "loss": 0.3858, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1269, "tokens_per_second_per_gpu": 19215.58, "total_tokens": 114673842 }, { "epoch": 0.2537082355291415, "grad_norm": 0.75, "learning_rate": 6.457519128716496e-06, "loss": 0.3823, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1270, "tokens_per_second_per_gpu": 17354.04, "total_tokens": 114758170 }, { "epoch": 0.25390800579333767, "grad_norm": 0.703125, "learning_rate": 6.442061530774835e-06, "loss": 0.3752, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1271, "tokens_per_second_per_gpu": 17665.72, "total_tokens": 114845808 }, { "epoch": 0.2541077760575338, "grad_norm": 0.6953125, "learning_rate": 6.426613660101091e-06, "loss": 0.4068, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1272, "tokens_per_second_per_gpu": 19916.63, "total_tokens": 114942637 }, { "epoch": 0.25430754632173, "grad_norm": 0.69140625, "learning_rate": 6.411175558929152e-06, "loss": 0.3627, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1273, "tokens_per_second_per_gpu": 17604.44, "total_tokens": 115028235 }, { "epoch": 0.2545073165859262, "grad_norm": 0.69140625, "learning_rate": 6.395747269466192e-06, "loss": 0.3962, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1274, "tokens_per_second_per_gpu": 19419.41, "total_tokens": 115122237 }, { "epoch": 0.25470708685012233, "grad_norm": 0.68359375, "learning_rate": 6.380328833892571e-06, "loss": 0.4064, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1275, "tokens_per_second_per_gpu": 19899.88, "total_tokens": 115217764 }, { "epoch": 0.25490685711431854, "grad_norm": 0.7109375, "learning_rate": 6.364920294361701e-06, "loss": 0.402, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1276, "tokens_per_second_per_gpu": 18779.39, "total_tokens": 115307896 }, { "epoch": 0.2551066273785147, "grad_norm": 0.66015625, "learning_rate": 6.349521692999945e-06, "loss": 0.433, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1277, "tokens_per_second_per_gpu": 20683.78, "total_tokens": 115408992 }, { "epoch": 0.2553063976427109, "grad_norm": 0.73046875, "learning_rate": 6.334133071906483e-06, "loss": 0.3775, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1278, "tokens_per_second_per_gpu": 18086.95, "total_tokens": 115496350 }, { "epoch": 0.25550616790690706, "grad_norm": 0.66796875, "learning_rate": 6.318754473153221e-06, "loss": 0.4037, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1279, "tokens_per_second_per_gpu": 20052.02, "total_tokens": 115593135 }, { "epoch": 0.2557059381711032, "grad_norm": 0.69140625, "learning_rate": 6.303385938784663e-06, "loss": 0.3617, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1280, "tokens_per_second_per_gpu": 18744.21, "total_tokens": 115683030 }, { "epoch": 0.2559057084352994, "grad_norm": 0.69921875, "learning_rate": 6.2880275108177915e-06, "loss": 0.351, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1281, "tokens_per_second_per_gpu": 17847.54, "total_tokens": 115768458 }, { "epoch": 0.25610547869949557, "grad_norm": 0.6875, "learning_rate": 6.27267923124197e-06, "loss": 0.3945, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1282, "tokens_per_second_per_gpu": 19498.51, "total_tokens": 115862515 }, { "epoch": 0.2563052489636918, "grad_norm": 0.69921875, "learning_rate": 6.257341142018798e-06, "loss": 0.4019, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1283, "tokens_per_second_per_gpu": 17969.33, "total_tokens": 115951239 }, { "epoch": 0.25650501922788793, "grad_norm": 0.69921875, "learning_rate": 6.2420132850820296e-06, "loss": 0.3722, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1284, "tokens_per_second_per_gpu": 17824.52, "total_tokens": 116037883 }, { "epoch": 0.2567047894920841, "grad_norm": 0.69921875, "learning_rate": 6.2266957023374434e-06, "loss": 0.3746, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1285, "tokens_per_second_per_gpu": 17943.15, "total_tokens": 116125963 }, { "epoch": 0.2569045597562803, "grad_norm": 0.70703125, "learning_rate": 6.211388435662722e-06, "loss": 0.3343, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1286, "tokens_per_second_per_gpu": 16099.92, "total_tokens": 116205104 }, { "epoch": 0.25710433002047645, "grad_norm": 0.73046875, "learning_rate": 6.196091526907355e-06, "loss": 0.3606, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1287, "tokens_per_second_per_gpu": 18009.09, "total_tokens": 116293479 }, { "epoch": 0.2573041002846726, "grad_norm": 0.7109375, "learning_rate": 6.180805017892498e-06, "loss": 0.3877, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1288, "tokens_per_second_per_gpu": 18010.49, "total_tokens": 116380791 }, { "epoch": 0.2575038705488688, "grad_norm": 0.71484375, "learning_rate": 6.165528950410884e-06, "loss": 0.3761, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1289, "tokens_per_second_per_gpu": 18194.29, "total_tokens": 116468964 }, { "epoch": 0.25770364081306496, "grad_norm": 0.7421875, "learning_rate": 6.150263366226703e-06, "loss": 0.3826, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1290, "tokens_per_second_per_gpu": 18175.01, "total_tokens": 116558495 }, { "epoch": 0.25790341107726117, "grad_norm": 0.7265625, "learning_rate": 6.13500830707548e-06, "loss": 0.3855, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1291, "tokens_per_second_per_gpu": 18177.76, "total_tokens": 116645941 }, { "epoch": 0.2581031813414573, "grad_norm": 0.70703125, "learning_rate": 6.119763814663958e-06, "loss": 0.4093, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1292, "tokens_per_second_per_gpu": 19877.8, "total_tokens": 116742668 }, { "epoch": 0.2583029516056535, "grad_norm": 0.84765625, "learning_rate": 6.10452993067e-06, "loss": 0.3914, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1293, "tokens_per_second_per_gpu": 17741.56, "total_tokens": 116829781 }, { "epoch": 0.2585027218698497, "grad_norm": 0.72265625, "learning_rate": 6.089306696742461e-06, "loss": 0.3604, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1294, "tokens_per_second_per_gpu": 16687.46, "total_tokens": 116912032 }, { "epoch": 0.25870249213404584, "grad_norm": 0.6796875, "learning_rate": 6.074094154501087e-06, "loss": 0.3958, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1295, "tokens_per_second_per_gpu": 18968.03, "total_tokens": 117005879 }, { "epoch": 0.25890226239824204, "grad_norm": 0.69921875, "learning_rate": 6.058892345536387e-06, "loss": 0.3802, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1296, "tokens_per_second_per_gpu": 18862.33, "total_tokens": 117096015 }, { "epoch": 0.2591020326624382, "grad_norm": 0.73828125, "learning_rate": 6.04370131140952e-06, "loss": 0.3873, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1297, "tokens_per_second_per_gpu": 17132.99, "total_tokens": 117178620 }, { "epoch": 0.25930180292663435, "grad_norm": 0.71484375, "learning_rate": 6.028521093652195e-06, "loss": 0.3895, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1298, "tokens_per_second_per_gpu": 17725.99, "total_tokens": 117265087 }, { "epoch": 0.25950157319083056, "grad_norm": 0.71484375, "learning_rate": 6.0133517337665504e-06, "loss": 0.3914, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1299, "tokens_per_second_per_gpu": 19134.83, "total_tokens": 117357820 }, { "epoch": 0.2597013434550267, "grad_norm": 0.70703125, "learning_rate": 5.9981932732250356e-06, "loss": 0.3994, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1300, "tokens_per_second_per_gpu": 18771.97, "total_tokens": 117447478 }, { "epoch": 0.2599011137192229, "grad_norm": 0.76953125, "learning_rate": 5.983045753470308e-06, "loss": 0.4067, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1301, "tokens_per_second_per_gpu": 17762.5, "total_tokens": 117533432 }, { "epoch": 0.2601008839834191, "grad_norm": 0.734375, "learning_rate": 5.9679092159151e-06, "loss": 0.3915, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1302, "tokens_per_second_per_gpu": 18233.51, "total_tokens": 117621623 }, { "epoch": 0.2603006542476152, "grad_norm": 0.68359375, "learning_rate": 5.952783701942129e-06, "loss": 0.3783, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1303, "tokens_per_second_per_gpu": 18227.46, "total_tokens": 117709425 }, { "epoch": 0.26050042451181143, "grad_norm": 0.68359375, "learning_rate": 5.937669252903974e-06, "loss": 0.3883, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1304, "tokens_per_second_per_gpu": 19646.77, "total_tokens": 117804473 }, { "epoch": 0.2607001947760076, "grad_norm": 0.70703125, "learning_rate": 5.922565910122967e-06, "loss": 0.38, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1305, "tokens_per_second_per_gpu": 16877.95, "total_tokens": 117887466 }, { "epoch": 0.26089996504020374, "grad_norm": 0.73046875, "learning_rate": 5.907473714891061e-06, "loss": 0.4219, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1306, "tokens_per_second_per_gpu": 18898.72, "total_tokens": 117978170 }, { "epoch": 0.26109973530439995, "grad_norm": 0.69140625, "learning_rate": 5.8923927084697475e-06, "loss": 0.3961, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1307, "tokens_per_second_per_gpu": 20106.52, "total_tokens": 118076065 }, { "epoch": 0.2612995055685961, "grad_norm": 0.7109375, "learning_rate": 5.8773229320899195e-06, "loss": 0.393, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1308, "tokens_per_second_per_gpu": 19582.05, "total_tokens": 118172348 }, { "epoch": 0.2614992758327923, "grad_norm": 0.671875, "learning_rate": 5.862264426951768e-06, "loss": 0.3812, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1309, "tokens_per_second_per_gpu": 19150.68, "total_tokens": 118265305 }, { "epoch": 0.26169904609698846, "grad_norm": 0.69140625, "learning_rate": 5.8472172342246816e-06, "loss": 0.3673, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1310, "tokens_per_second_per_gpu": 18842.93, "total_tokens": 118355964 }, { "epoch": 0.2618988163611846, "grad_norm": 0.69140625, "learning_rate": 5.832181395047099e-06, "loss": 0.406, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1311, "tokens_per_second_per_gpu": 18911.14, "total_tokens": 118449186 }, { "epoch": 0.2620985866253808, "grad_norm": 0.69921875, "learning_rate": 5.817156950526432e-06, "loss": 0.4171, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1312, "tokens_per_second_per_gpu": 19351.3, "total_tokens": 118543212 }, { "epoch": 0.262298356889577, "grad_norm": 0.9140625, "learning_rate": 5.802143941738945e-06, "loss": 0.3672, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1313, "tokens_per_second_per_gpu": 16411.29, "total_tokens": 118624224 }, { "epoch": 0.2624981271537732, "grad_norm": 0.68359375, "learning_rate": 5.787142409729622e-06, "loss": 0.3484, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1314, "tokens_per_second_per_gpu": 17817.59, "total_tokens": 118711617 }, { "epoch": 0.26269789741796934, "grad_norm": 0.69140625, "learning_rate": 5.772152395512087e-06, "loss": 0.4104, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1315, "tokens_per_second_per_gpu": 19718.17, "total_tokens": 118807975 }, { "epoch": 0.2628976676821655, "grad_norm": 0.7109375, "learning_rate": 5.7571739400684644e-06, "loss": 0.389, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1316, "tokens_per_second_per_gpu": 17271.73, "total_tokens": 118893305 }, { "epoch": 0.2630974379463617, "grad_norm": 0.73046875, "learning_rate": 5.742207084349274e-06, "loss": 0.413, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1317, "tokens_per_second_per_gpu": 19147.18, "total_tokens": 118984629 }, { "epoch": 0.26329720821055785, "grad_norm": 0.7265625, "learning_rate": 5.727251869273333e-06, "loss": 0.3945, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1318, "tokens_per_second_per_gpu": 18631.17, "total_tokens": 119074071 }, { "epoch": 0.263496978474754, "grad_norm": 0.890625, "learning_rate": 5.712308335727629e-06, "loss": 0.4164, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1319, "tokens_per_second_per_gpu": 19038.23, "total_tokens": 119166518 }, { "epoch": 0.2636967487389502, "grad_norm": 0.6953125, "learning_rate": 5.697376524567205e-06, "loss": 0.3802, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1320, "tokens_per_second_per_gpu": 19218.23, "total_tokens": 119259660 }, { "epoch": 0.26389651900314637, "grad_norm": 0.703125, "learning_rate": 5.6824564766150724e-06, "loss": 0.4048, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1321, "tokens_per_second_per_gpu": 19931.25, "total_tokens": 119356240 }, { "epoch": 0.2640962892673426, "grad_norm": 0.69140625, "learning_rate": 5.667548232662064e-06, "loss": 0.3817, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1322, "tokens_per_second_per_gpu": 18917.51, "total_tokens": 119447583 }, { "epoch": 0.26429605953153873, "grad_norm": 0.80078125, "learning_rate": 5.652651833466756e-06, "loss": 0.3874, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1323, "tokens_per_second_per_gpu": 18881.23, "total_tokens": 119538571 }, { "epoch": 0.2644958297957349, "grad_norm": 0.67578125, "learning_rate": 5.6377673197553325e-06, "loss": 0.4082, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1324, "tokens_per_second_per_gpu": 21832.87, "total_tokens": 119640688 }, { "epoch": 0.2646956000599311, "grad_norm": 0.69921875, "learning_rate": 5.622894732221482e-06, "loss": 0.4107, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1325, "tokens_per_second_per_gpu": 19426.6, "total_tokens": 119734584 }, { "epoch": 0.26489537032412724, "grad_norm": 0.74609375, "learning_rate": 5.608034111526298e-06, "loss": 0.4027, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1326, "tokens_per_second_per_gpu": 16721.44, "total_tokens": 119817576 }, { "epoch": 0.26509514058832345, "grad_norm": 1.125, "learning_rate": 5.593185498298142e-06, "loss": 0.3735, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1327, "tokens_per_second_per_gpu": 17244.51, "total_tokens": 119903014 }, { "epoch": 0.2652949108525196, "grad_norm": 0.70703125, "learning_rate": 5.578348933132565e-06, "loss": 0.3986, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1328, "tokens_per_second_per_gpu": 19647.68, "total_tokens": 119998929 }, { "epoch": 0.26549468111671576, "grad_norm": 0.66015625, "learning_rate": 5.563524456592163e-06, "loss": 0.3641, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1329, "tokens_per_second_per_gpu": 18918.07, "total_tokens": 120091778 }, { "epoch": 0.26569445138091197, "grad_norm": 0.71484375, "learning_rate": 5.548712109206487e-06, "loss": 0.4187, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1330, "tokens_per_second_per_gpu": 17785.66, "total_tokens": 120178716 }, { "epoch": 0.2658942216451081, "grad_norm": 0.6953125, "learning_rate": 5.533911931471936e-06, "loss": 0.4114, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1331, "tokens_per_second_per_gpu": 19826.45, "total_tokens": 120274199 }, { "epoch": 0.2660939919093043, "grad_norm": 0.7109375, "learning_rate": 5.519123963851624e-06, "loss": 0.3688, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1332, "tokens_per_second_per_gpu": 17147.48, "total_tokens": 120358231 }, { "epoch": 0.2662937621735005, "grad_norm": 0.79296875, "learning_rate": 5.504348246775299e-06, "loss": 0.3911, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1333, "tokens_per_second_per_gpu": 16940.83, "total_tokens": 120441501 }, { "epoch": 0.26649353243769663, "grad_norm": 0.71875, "learning_rate": 5.489584820639195e-06, "loss": 0.4059, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1334, "tokens_per_second_per_gpu": 20087.4, "total_tokens": 120537188 }, { "epoch": 0.26669330270189284, "grad_norm": 0.71484375, "learning_rate": 5.474833725805963e-06, "loss": 0.4201, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1335, "tokens_per_second_per_gpu": 19940.46, "total_tokens": 120633116 }, { "epoch": 0.266893072966089, "grad_norm": 0.70703125, "learning_rate": 5.460095002604533e-06, "loss": 0.3863, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1336, "tokens_per_second_per_gpu": 18205.32, "total_tokens": 120721963 }, { "epoch": 0.26709284323028515, "grad_norm": 0.703125, "learning_rate": 5.445368691330008e-06, "loss": 0.3783, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1337, "tokens_per_second_per_gpu": 18753.57, "total_tokens": 120812184 }, { "epoch": 0.26729261349448136, "grad_norm": 0.69921875, "learning_rate": 5.430654832243569e-06, "loss": 0.4005, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1338, "tokens_per_second_per_gpu": 18829.77, "total_tokens": 120904580 }, { "epoch": 0.2674923837586775, "grad_norm": 0.67578125, "learning_rate": 5.415953465572332e-06, "loss": 0.4107, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1339, "tokens_per_second_per_gpu": 18986.72, "total_tokens": 120998163 }, { "epoch": 0.2676921540228737, "grad_norm": 0.7265625, "learning_rate": 5.401264631509277e-06, "loss": 0.3903, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1340, "tokens_per_second_per_gpu": 18122.03, "total_tokens": 121085672 }, { "epoch": 0.26789192428706987, "grad_norm": 0.6875, "learning_rate": 5.386588370213124e-06, "loss": 0.3952, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1341, "tokens_per_second_per_gpu": 19134.91, "total_tokens": 121178501 }, { "epoch": 0.268091694551266, "grad_norm": 0.6953125, "learning_rate": 5.371924721808197e-06, "loss": 0.3807, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1342, "tokens_per_second_per_gpu": 17726.59, "total_tokens": 121265734 }, { "epoch": 0.26829146481546223, "grad_norm": 0.7109375, "learning_rate": 5.357273726384368e-06, "loss": 0.3973, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1343, "tokens_per_second_per_gpu": 18075.41, "total_tokens": 121355604 }, { "epoch": 0.2684912350796584, "grad_norm": 0.70703125, "learning_rate": 5.3426354239968804e-06, "loss": 0.3884, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1344, "tokens_per_second_per_gpu": 18534.98, "total_tokens": 121444650 }, { "epoch": 0.2686910053438546, "grad_norm": 0.671875, "learning_rate": 5.328009854666303e-06, "loss": 0.41, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1345, "tokens_per_second_per_gpu": 19401.52, "total_tokens": 121540030 }, { "epoch": 0.26889077560805075, "grad_norm": 0.69140625, "learning_rate": 5.3133970583783865e-06, "loss": 0.3798, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1346, "tokens_per_second_per_gpu": 18638.39, "total_tokens": 121630152 }, { "epoch": 0.2690905458722469, "grad_norm": 0.67578125, "learning_rate": 5.298797075083956e-06, "loss": 0.3903, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1347, "tokens_per_second_per_gpu": 19034.84, "total_tokens": 121722697 }, { "epoch": 0.2692903161364431, "grad_norm": 0.69921875, "learning_rate": 5.284209944698806e-06, "loss": 0.3927, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1348, "tokens_per_second_per_gpu": 18661.79, "total_tokens": 121813698 }, { "epoch": 0.26949008640063926, "grad_norm": 0.68359375, "learning_rate": 5.269635707103593e-06, "loss": 0.382, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1349, "tokens_per_second_per_gpu": 19107.35, "total_tokens": 121906171 }, { "epoch": 0.2696898566648354, "grad_norm": 0.73046875, "learning_rate": 5.255074402143727e-06, "loss": 0.3678, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1350, "tokens_per_second_per_gpu": 17265.48, "total_tokens": 121988745 }, { "epoch": 0.2698896269290316, "grad_norm": 0.734375, "learning_rate": 5.240526069629265e-06, "loss": 0.415, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1351, "tokens_per_second_per_gpu": 18116.8, "total_tokens": 122077407 }, { "epoch": 0.2700893971932278, "grad_norm": 0.7109375, "learning_rate": 5.225990749334789e-06, "loss": 0.4169, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1352, "tokens_per_second_per_gpu": 19678.35, "total_tokens": 122171397 }, { "epoch": 0.270289167457424, "grad_norm": 0.6796875, "learning_rate": 5.211468480999304e-06, "loss": 0.3877, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1353, "tokens_per_second_per_gpu": 19511.7, "total_tokens": 122264431 }, { "epoch": 0.27048893772162014, "grad_norm": 0.703125, "learning_rate": 5.196959304326148e-06, "loss": 0.3766, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1354, "tokens_per_second_per_gpu": 18269.22, "total_tokens": 122353625 }, { "epoch": 0.2706887079858163, "grad_norm": 0.66015625, "learning_rate": 5.1824632589828465e-06, "loss": 0.3965, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1355, "tokens_per_second_per_gpu": 19653.79, "total_tokens": 122449636 }, { "epoch": 0.2708884782500125, "grad_norm": 0.66796875, "learning_rate": 5.167980384601041e-06, "loss": 0.3673, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1356, "tokens_per_second_per_gpu": 19063.39, "total_tokens": 122542012 }, { "epoch": 0.27108824851420865, "grad_norm": 0.6875, "learning_rate": 5.153510720776354e-06, "loss": 0.3701, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1357, "tokens_per_second_per_gpu": 18042.69, "total_tokens": 122630637 }, { "epoch": 0.27128801877840486, "grad_norm": 0.6796875, "learning_rate": 5.139054307068289e-06, "loss": 0.3818, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1358, "tokens_per_second_per_gpu": 18587.56, "total_tokens": 122719900 }, { "epoch": 0.271487789042601, "grad_norm": 0.68359375, "learning_rate": 5.124611183000138e-06, "loss": 0.4045, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1359, "tokens_per_second_per_gpu": 19336.16, "total_tokens": 122813379 }, { "epoch": 0.27168755930679717, "grad_norm": 0.6796875, "learning_rate": 5.110181388058842e-06, "loss": 0.397, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1360, "tokens_per_second_per_gpu": 18154.89, "total_tokens": 122903189 }, { "epoch": 0.2718873295709934, "grad_norm": 0.6953125, "learning_rate": 5.095764961694923e-06, "loss": 0.404, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1361, "tokens_per_second_per_gpu": 19857.56, "total_tokens": 122997997 }, { "epoch": 0.2720870998351895, "grad_norm": 0.71875, "learning_rate": 5.081361943322323e-06, "loss": 0.4021, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1362, "tokens_per_second_per_gpu": 18675.68, "total_tokens": 123087275 }, { "epoch": 0.2722868700993857, "grad_norm": 0.69921875, "learning_rate": 5.066972372318351e-06, "loss": 0.4049, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1363, "tokens_per_second_per_gpu": 19753.94, "total_tokens": 123182430 }, { "epoch": 0.2724866403635819, "grad_norm": 0.71875, "learning_rate": 5.05259628802355e-06, "loss": 0.3977, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1364, "tokens_per_second_per_gpu": 19594.57, "total_tokens": 123276116 }, { "epoch": 0.27268641062777804, "grad_norm": 0.71875, "learning_rate": 5.0382337297415775e-06, "loss": 0.3814, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1365, "tokens_per_second_per_gpu": 17457.59, "total_tokens": 123361602 }, { "epoch": 0.27288618089197425, "grad_norm": 0.69140625, "learning_rate": 5.023884736739132e-06, "loss": 0.4148, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1366, "tokens_per_second_per_gpu": 20752.28, "total_tokens": 123462700 }, { "epoch": 0.2730859511561704, "grad_norm": 0.69140625, "learning_rate": 5.009549348245795e-06, "loss": 0.3652, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1367, "tokens_per_second_per_gpu": 18368.91, "total_tokens": 123552335 }, { "epoch": 0.27328572142036656, "grad_norm": 0.703125, "learning_rate": 4.995227603453981e-06, "loss": 0.4037, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1368, "tokens_per_second_per_gpu": 19694.15, "total_tokens": 123649437 }, { "epoch": 0.27348549168456276, "grad_norm": 0.68359375, "learning_rate": 4.980919541518796e-06, "loss": 0.3839, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1369, "tokens_per_second_per_gpu": 18358.73, "total_tokens": 123738004 }, { "epoch": 0.2736852619487589, "grad_norm": 0.79296875, "learning_rate": 4.966625201557931e-06, "loss": 0.3929, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1370, "tokens_per_second_per_gpu": 18521.59, "total_tokens": 123826748 }, { "epoch": 0.2738850322129551, "grad_norm": 0.66796875, "learning_rate": 4.952344622651566e-06, "loss": 0.3986, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1371, "tokens_per_second_per_gpu": 20131.26, "total_tokens": 123924212 }, { "epoch": 0.2740848024771513, "grad_norm": 0.703125, "learning_rate": 4.938077843842255e-06, "loss": 0.386, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1372, "tokens_per_second_per_gpu": 18573.69, "total_tokens": 124014803 }, { "epoch": 0.27428457274134743, "grad_norm": 0.703125, "learning_rate": 4.92382490413483e-06, "loss": 0.4007, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1373, "tokens_per_second_per_gpu": 18730.23, "total_tokens": 124105869 }, { "epoch": 0.27448434300554364, "grad_norm": 0.68359375, "learning_rate": 4.909585842496287e-06, "loss": 0.3951, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1374, "tokens_per_second_per_gpu": 18379.51, "total_tokens": 124195579 }, { "epoch": 0.2746841132697398, "grad_norm": 0.6796875, "learning_rate": 4.895360697855674e-06, "loss": 0.4074, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1375, "tokens_per_second_per_gpu": 20722.7, "total_tokens": 124294207 }, { "epoch": 0.27488388353393595, "grad_norm": 1.2734375, "learning_rate": 4.881149509103993e-06, "loss": 0.3768, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1376, "tokens_per_second_per_gpu": 18565.29, "total_tokens": 124384357 }, { "epoch": 0.27508365379813216, "grad_norm": 0.703125, "learning_rate": 4.866952315094088e-06, "loss": 0.4031, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1377, "tokens_per_second_per_gpu": 18532.94, "total_tokens": 124474654 }, { "epoch": 0.2752834240623283, "grad_norm": 0.65625, "learning_rate": 4.8527691546405476e-06, "loss": 0.3814, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1378, "tokens_per_second_per_gpu": 20103.55, "total_tokens": 124572253 }, { "epoch": 0.2754831943265245, "grad_norm": 0.7265625, "learning_rate": 4.838600066519597e-06, "loss": 0.4048, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1379, "tokens_per_second_per_gpu": 18313.21, "total_tokens": 124660458 }, { "epoch": 0.27568296459072067, "grad_norm": 0.6875, "learning_rate": 4.824445089468975e-06, "loss": 0.3941, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1380, "tokens_per_second_per_gpu": 19452.76, "total_tokens": 124753952 }, { "epoch": 0.2758827348549168, "grad_norm": 0.7265625, "learning_rate": 4.8103042621878515e-06, "loss": 0.4041, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1381, "tokens_per_second_per_gpu": 17613.42, "total_tokens": 124839133 }, { "epoch": 0.27608250511911303, "grad_norm": 0.71484375, "learning_rate": 4.796177623336703e-06, "loss": 0.3625, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1382, "tokens_per_second_per_gpu": 17420.6, "total_tokens": 124925247 }, { "epoch": 0.2762822753833092, "grad_norm": 0.7265625, "learning_rate": 4.782065211537226e-06, "loss": 0.4069, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1383, "tokens_per_second_per_gpu": 17978.9, "total_tokens": 125012633 }, { "epoch": 0.2764820456475054, "grad_norm": 0.671875, "learning_rate": 4.767967065372221e-06, "loss": 0.3891, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1384, "tokens_per_second_per_gpu": 19551.34, "total_tokens": 125106747 }, { "epoch": 0.27668181591170155, "grad_norm": 0.6875, "learning_rate": 4.753883223385467e-06, "loss": 0.3795, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1385, "tokens_per_second_per_gpu": 18918.63, "total_tokens": 125199758 }, { "epoch": 0.2768815861758977, "grad_norm": 0.83203125, "learning_rate": 4.739813724081661e-06, "loss": 0.3835, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1386, "tokens_per_second_per_gpu": 17941.04, "total_tokens": 125288801 }, { "epoch": 0.2770813564400939, "grad_norm": 0.734375, "learning_rate": 4.7257586059262706e-06, "loss": 0.3688, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1387, "tokens_per_second_per_gpu": 17431.64, "total_tokens": 125371986 }, { "epoch": 0.27728112670429006, "grad_norm": 0.71875, "learning_rate": 4.711717907345456e-06, "loss": 0.397, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1388, "tokens_per_second_per_gpu": 17940.81, "total_tokens": 125459050 }, { "epoch": 0.27748089696848627, "grad_norm": 0.7421875, "learning_rate": 4.6976916667259555e-06, "loss": 0.3953, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1389, "tokens_per_second_per_gpu": 17379.37, "total_tokens": 125543606 }, { "epoch": 0.2776806672326824, "grad_norm": 0.73828125, "learning_rate": 4.683679922414964e-06, "loss": 0.3974, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1390, "tokens_per_second_per_gpu": 18168.0, "total_tokens": 125633859 }, { "epoch": 0.2778804374968786, "grad_norm": 0.68359375, "learning_rate": 4.669682712720065e-06, "loss": 0.37, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1391, "tokens_per_second_per_gpu": 18605.72, "total_tokens": 125722934 }, { "epoch": 0.2780802077610748, "grad_norm": 0.67578125, "learning_rate": 4.655700075909088e-06, "loss": 0.376, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1392, "tokens_per_second_per_gpu": 18636.4, "total_tokens": 125812949 }, { "epoch": 0.27827997802527094, "grad_norm": 0.83203125, "learning_rate": 4.641732050210032e-06, "loss": 0.3969, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1393, "tokens_per_second_per_gpu": 17748.12, "total_tokens": 125898420 }, { "epoch": 0.2784797482894671, "grad_norm": 0.7578125, "learning_rate": 4.627778673810953e-06, "loss": 0.3979, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1394, "tokens_per_second_per_gpu": 18975.71, "total_tokens": 125990881 }, { "epoch": 0.2786795185536633, "grad_norm": 0.67578125, "learning_rate": 4.613839984859835e-06, "loss": 0.382, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1395, "tokens_per_second_per_gpu": 19263.09, "total_tokens": 126084476 }, { "epoch": 0.27887928881785945, "grad_norm": 0.67578125, "learning_rate": 4.599916021464531e-06, "loss": 0.383, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1396, "tokens_per_second_per_gpu": 18611.76, "total_tokens": 126175413 }, { "epoch": 0.27907905908205566, "grad_norm": 0.671875, "learning_rate": 4.58600682169262e-06, "loss": 0.3647, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1397, "tokens_per_second_per_gpu": 19172.74, "total_tokens": 126267781 }, { "epoch": 0.2792788293462518, "grad_norm": 0.765625, "learning_rate": 4.57211242357133e-06, "loss": 0.3831, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1398, "tokens_per_second_per_gpu": 18356.83, "total_tokens": 126356685 }, { "epoch": 0.27947859961044796, "grad_norm": 0.671875, "learning_rate": 4.5582328650874095e-06, "loss": 0.3931, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1399, "tokens_per_second_per_gpu": 19440.05, "total_tokens": 126451008 }, { "epoch": 0.2796783698746442, "grad_norm": 0.70703125, "learning_rate": 4.544368184187039e-06, "loss": 0.3969, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1400, "tokens_per_second_per_gpu": 19308.54, "total_tokens": 126544466 }, { "epoch": 0.2798781401388403, "grad_norm": 0.7109375, "learning_rate": 4.530518418775734e-06, "loss": 0.397, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1401, "tokens_per_second_per_gpu": 18941.97, "total_tokens": 126637418 }, { "epoch": 0.28007791040303653, "grad_norm": 0.7109375, "learning_rate": 4.5166836067182165e-06, "loss": 0.4058, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1402, "tokens_per_second_per_gpu": 18751.79, "total_tokens": 126727180 }, { "epoch": 0.2802776806672327, "grad_norm": 0.68359375, "learning_rate": 4.5028637858383415e-06, "loss": 0.3881, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1403, "tokens_per_second_per_gpu": 19138.5, "total_tokens": 126819503 }, { "epoch": 0.28047745093142884, "grad_norm": 0.7109375, "learning_rate": 4.489058993918969e-06, "loss": 0.3809, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1404, "tokens_per_second_per_gpu": 18800.62, "total_tokens": 126910706 }, { "epoch": 0.28067722119562505, "grad_norm": 0.69921875, "learning_rate": 4.4752692687018685e-06, "loss": 0.3765, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1405, "tokens_per_second_per_gpu": 17012.49, "total_tokens": 126995494 }, { "epoch": 0.2808769914598212, "grad_norm": 0.69140625, "learning_rate": 4.4614946478876305e-06, "loss": 0.3616, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1406, "tokens_per_second_per_gpu": 18025.85, "total_tokens": 127081971 }, { "epoch": 0.28107676172401735, "grad_norm": 0.8671875, "learning_rate": 4.447735169135533e-06, "loss": 0.348, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1407, "tokens_per_second_per_gpu": 14323.13, "total_tokens": 127142882 }, { "epoch": 0.28127653198821356, "grad_norm": 0.703125, "learning_rate": 4.4339908700634745e-06, "loss": 0.3777, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1408, "tokens_per_second_per_gpu": 18633.82, "total_tokens": 127233089 }, { "epoch": 0.2814763022524097, "grad_norm": 0.65625, "learning_rate": 4.420261788247841e-06, "loss": 0.4009, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1409, "tokens_per_second_per_gpu": 20113.93, "total_tokens": 127331256 }, { "epoch": 0.2816760725166059, "grad_norm": 0.703125, "learning_rate": 4.406547961223412e-06, "loss": 0.3942, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1410, "tokens_per_second_per_gpu": 19161.11, "total_tokens": 127424788 }, { "epoch": 0.2818758427808021, "grad_norm": 0.7421875, "learning_rate": 4.392849426483275e-06, "loss": 0.3855, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1411, "tokens_per_second_per_gpu": 18427.49, "total_tokens": 127514304 }, { "epoch": 0.28207561304499823, "grad_norm": 0.703125, "learning_rate": 4.379166221478697e-06, "loss": 0.3714, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1412, "tokens_per_second_per_gpu": 17337.1, "total_tokens": 127598340 }, { "epoch": 0.28227538330919444, "grad_norm": 0.69921875, "learning_rate": 4.365498383619036e-06, "loss": 0.3961, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1413, "tokens_per_second_per_gpu": 19649.49, "total_tokens": 127691899 }, { "epoch": 0.2824751535733906, "grad_norm": 0.6875, "learning_rate": 4.351845950271644e-06, "loss": 0.3619, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1414, "tokens_per_second_per_gpu": 17911.18, "total_tokens": 127780361 }, { "epoch": 0.2826749238375868, "grad_norm": 0.74609375, "learning_rate": 4.338208958761747e-06, "loss": 0.3971, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1415, "tokens_per_second_per_gpu": 19765.14, "total_tokens": 127875562 }, { "epoch": 0.28287469410178295, "grad_norm": 0.7109375, "learning_rate": 4.324587446372365e-06, "loss": 0.4142, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1416, "tokens_per_second_per_gpu": 19470.33, "total_tokens": 127973346 }, { "epoch": 0.2830744643659791, "grad_norm": 1.109375, "learning_rate": 4.3109814503441894e-06, "loss": 0.3923, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1417, "tokens_per_second_per_gpu": 18539.71, "total_tokens": 128064288 }, { "epoch": 0.2832742346301753, "grad_norm": 0.6796875, "learning_rate": 4.29739100787549e-06, "loss": 0.379, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1418, "tokens_per_second_per_gpu": 18771.45, "total_tokens": 128155606 }, { "epoch": 0.28347400489437147, "grad_norm": 0.66015625, "learning_rate": 4.2838161561220245e-06, "loss": 0.384, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1419, "tokens_per_second_per_gpu": 19927.89, "total_tokens": 128251165 }, { "epoch": 0.2836737751585676, "grad_norm": 0.71484375, "learning_rate": 4.2702569321969145e-06, "loss": 0.4054, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1420, "tokens_per_second_per_gpu": 17690.37, "total_tokens": 128337239 }, { "epoch": 0.28387354542276383, "grad_norm": 0.69921875, "learning_rate": 4.256713373170565e-06, "loss": 0.4059, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1421, "tokens_per_second_per_gpu": 17651.57, "total_tokens": 128425232 }, { "epoch": 0.28407331568696, "grad_norm": 0.6640625, "learning_rate": 4.243185516070546e-06, "loss": 0.3731, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1422, "tokens_per_second_per_gpu": 18743.0, "total_tokens": 128517262 }, { "epoch": 0.2842730859511562, "grad_norm": 0.6875, "learning_rate": 4.2296733978815e-06, "loss": 0.3859, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1423, "tokens_per_second_per_gpu": 18624.61, "total_tokens": 128607507 }, { "epoch": 0.28447285621535234, "grad_norm": 0.70703125, "learning_rate": 4.216177055545048e-06, "loss": 0.3882, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1424, "tokens_per_second_per_gpu": 18121.26, "total_tokens": 128694458 }, { "epoch": 0.2846726264795485, "grad_norm": 0.6875, "learning_rate": 4.202696525959667e-06, "loss": 0.3972, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1425, "tokens_per_second_per_gpu": 19403.15, "total_tokens": 128789214 }, { "epoch": 0.2848723967437447, "grad_norm": 0.67578125, "learning_rate": 4.189231845980618e-06, "loss": 0.389, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1426, "tokens_per_second_per_gpu": 19473.97, "total_tokens": 128884477 }, { "epoch": 0.28507216700794086, "grad_norm": 0.921875, "learning_rate": 4.17578305241982e-06, "loss": 0.3959, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1427, "tokens_per_second_per_gpu": 18567.36, "total_tokens": 128975462 }, { "epoch": 0.28527193727213707, "grad_norm": 0.6796875, "learning_rate": 4.162350182045754e-06, "loss": 0.4201, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1428, "tokens_per_second_per_gpu": 19497.87, "total_tokens": 129071677 }, { "epoch": 0.2854717075363332, "grad_norm": 0.6875, "learning_rate": 4.148933271583385e-06, "loss": 0.4187, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1429, "tokens_per_second_per_gpu": 19837.66, "total_tokens": 129168300 }, { "epoch": 0.28567147780052937, "grad_norm": 0.6875, "learning_rate": 4.135532357714026e-06, "loss": 0.4032, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1430, "tokens_per_second_per_gpu": 19524.23, "total_tokens": 129262577 }, { "epoch": 0.2858712480647256, "grad_norm": 0.734375, "learning_rate": 4.12214747707527e-06, "loss": 0.405, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1431, "tokens_per_second_per_gpu": 18541.21, "total_tokens": 129353142 }, { "epoch": 0.28607101832892173, "grad_norm": 0.74609375, "learning_rate": 4.1087786662608665e-06, "loss": 0.3828, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1432, "tokens_per_second_per_gpu": 18235.11, "total_tokens": 129442944 }, { "epoch": 0.28627078859311794, "grad_norm": 0.703125, "learning_rate": 4.0954259618206295e-06, "loss": 0.384, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1433, "tokens_per_second_per_gpu": 18311.72, "total_tokens": 129530253 }, { "epoch": 0.2864705588573141, "grad_norm": 0.69921875, "learning_rate": 4.082089400260351e-06, "loss": 0.4169, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1434, "tokens_per_second_per_gpu": 19976.04, "total_tokens": 129628194 }, { "epoch": 0.28667032912151025, "grad_norm": 0.70703125, "learning_rate": 4.068769018041674e-06, "loss": 0.3484, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1435, "tokens_per_second_per_gpu": 17668.69, "total_tokens": 129714746 }, { "epoch": 0.28687009938570646, "grad_norm": 2.40625, "learning_rate": 4.055464851582022e-06, "loss": 0.3714, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1436, "tokens_per_second_per_gpu": 17712.9, "total_tokens": 129801264 }, { "epoch": 0.2870698696499026, "grad_norm": 0.66796875, "learning_rate": 4.042176937254474e-06, "loss": 0.3656, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1437, "tokens_per_second_per_gpu": 19358.28, "total_tokens": 129893848 }, { "epoch": 0.28726963991409876, "grad_norm": 0.69140625, "learning_rate": 4.028905311387678e-06, "loss": 0.3823, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1438, "tokens_per_second_per_gpu": 18424.07, "total_tokens": 129983766 }, { "epoch": 0.28746941017829497, "grad_norm": 0.7109375, "learning_rate": 4.015650010265757e-06, "loss": 0.4036, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1439, "tokens_per_second_per_gpu": 19189.88, "total_tokens": 130078550 }, { "epoch": 0.2876691804424911, "grad_norm": 0.69140625, "learning_rate": 4.002411070128197e-06, "loss": 0.3831, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1440, "tokens_per_second_per_gpu": 19457.11, "total_tokens": 130171761 }, { "epoch": 0.28786895070668733, "grad_norm": 0.68359375, "learning_rate": 3.989188527169749e-06, "loss": 0.3733, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1441, "tokens_per_second_per_gpu": 18332.14, "total_tokens": 130261670 }, { "epoch": 0.2880687209708835, "grad_norm": 0.67578125, "learning_rate": 3.975982417540351e-06, "loss": 0.3967, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1442, "tokens_per_second_per_gpu": 19395.36, "total_tokens": 130356933 }, { "epoch": 0.28826849123507964, "grad_norm": 0.703125, "learning_rate": 3.962792777344992e-06, "loss": 0.4166, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1443, "tokens_per_second_per_gpu": 19715.86, "total_tokens": 130451974 }, { "epoch": 0.28846826149927585, "grad_norm": 0.71875, "learning_rate": 3.949619642643654e-06, "loss": 0.3658, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1444, "tokens_per_second_per_gpu": 17741.46, "total_tokens": 130537231 }, { "epoch": 0.288668031763472, "grad_norm": 0.70703125, "learning_rate": 3.936463049451179e-06, "loss": 0.3935, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1445, "tokens_per_second_per_gpu": 18135.77, "total_tokens": 130625976 }, { "epoch": 0.2888678020276682, "grad_norm": 0.75, "learning_rate": 3.923323033737188e-06, "loss": 0.3989, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1446, "tokens_per_second_per_gpu": 17355.43, "total_tokens": 130710202 }, { "epoch": 0.28906757229186436, "grad_norm": 0.67578125, "learning_rate": 3.910199631425989e-06, "loss": 0.4015, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1447, "tokens_per_second_per_gpu": 19922.2, "total_tokens": 130806481 }, { "epoch": 0.2892673425560605, "grad_norm": 0.70703125, "learning_rate": 3.8970928783964564e-06, "loss": 0.3727, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1448, "tokens_per_second_per_gpu": 17955.31, "total_tokens": 130894818 }, { "epoch": 0.2894671128202567, "grad_norm": 0.69140625, "learning_rate": 3.884002810481959e-06, "loss": 0.3939, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1449, "tokens_per_second_per_gpu": 18930.44, "total_tokens": 130987186 }, { "epoch": 0.2896668830844529, "grad_norm": 0.72265625, "learning_rate": 3.8709294634702374e-06, "loss": 0.3668, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1450, "tokens_per_second_per_gpu": 18512.27, "total_tokens": 131076323 }, { "epoch": 0.28986665334864903, "grad_norm": 0.671875, "learning_rate": 3.857872873103322e-06, "loss": 0.4123, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1451, "tokens_per_second_per_gpu": 21145.98, "total_tokens": 131176049 }, { "epoch": 0.29006642361284524, "grad_norm": 0.71484375, "learning_rate": 3.844833075077439e-06, "loss": 0.3874, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1452, "tokens_per_second_per_gpu": 17997.39, "total_tokens": 131263858 }, { "epoch": 0.2902661938770414, "grad_norm": 0.7109375, "learning_rate": 3.83181010504289e-06, "loss": 0.4014, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1453, "tokens_per_second_per_gpu": 18723.94, "total_tokens": 131355975 }, { "epoch": 0.2904659641412376, "grad_norm": 0.67578125, "learning_rate": 3.818803998603986e-06, "loss": 0.398, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1454, "tokens_per_second_per_gpu": 19256.88, "total_tokens": 131448172 }, { "epoch": 0.29066573440543375, "grad_norm": 0.68359375, "learning_rate": 3.8058147913189215e-06, "loss": 0.3995, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1455, "tokens_per_second_per_gpu": 19194.29, "total_tokens": 131541078 }, { "epoch": 0.2908655046696299, "grad_norm": 0.7109375, "learning_rate": 3.792842518699689e-06, "loss": 0.3889, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1456, "tokens_per_second_per_gpu": 18729.96, "total_tokens": 131631665 }, { "epoch": 0.2910652749338261, "grad_norm": 0.6953125, "learning_rate": 3.7798872162119948e-06, "loss": 0.3822, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1457, "tokens_per_second_per_gpu": 19966.53, "total_tokens": 131728032 }, { "epoch": 0.29126504519802227, "grad_norm": 0.7109375, "learning_rate": 3.766948919275133e-06, "loss": 0.4083, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1458, "tokens_per_second_per_gpu": 18477.96, "total_tokens": 131817725 }, { "epoch": 0.2914648154622185, "grad_norm": 0.703125, "learning_rate": 3.754027663261922e-06, "loss": 0.3967, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1459, "tokens_per_second_per_gpu": 18728.85, "total_tokens": 131909633 }, { "epoch": 0.2916645857264146, "grad_norm": 0.6953125, "learning_rate": 3.7411234834985765e-06, "loss": 0.4064, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1460, "tokens_per_second_per_gpu": 20081.13, "total_tokens": 132005823 }, { "epoch": 0.2918643559906108, "grad_norm": 0.73046875, "learning_rate": 3.72823641526463e-06, "loss": 0.3763, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1461, "tokens_per_second_per_gpu": 17846.93, "total_tokens": 132092188 }, { "epoch": 0.292064126254807, "grad_norm": 0.71875, "learning_rate": 3.71536649379284e-06, "loss": 0.3482, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1462, "tokens_per_second_per_gpu": 16008.09, "total_tokens": 132170931 }, { "epoch": 0.29226389651900314, "grad_norm": 0.6640625, "learning_rate": 3.702513754269076e-06, "loss": 0.3703, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1463, "tokens_per_second_per_gpu": 19378.37, "total_tokens": 132263704 }, { "epoch": 0.2924636667831993, "grad_norm": 0.68359375, "learning_rate": 3.689678231832241e-06, "loss": 0.4033, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1464, "tokens_per_second_per_gpu": 19784.41, "total_tokens": 132360429 }, { "epoch": 0.2926634370473955, "grad_norm": 0.67578125, "learning_rate": 3.676859961574162e-06, "loss": 0.4059, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1465, "tokens_per_second_per_gpu": 18995.97, "total_tokens": 132453469 }, { "epoch": 0.29286320731159166, "grad_norm": 0.69921875, "learning_rate": 3.6640589785394955e-06, "loss": 0.3781, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1466, "tokens_per_second_per_gpu": 17099.59, "total_tokens": 132540960 }, { "epoch": 0.29306297757578786, "grad_norm": 0.70703125, "learning_rate": 3.651275317725648e-06, "loss": 0.4289, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1467, "tokens_per_second_per_gpu": 17481.25, "total_tokens": 132627839 }, { "epoch": 0.293262747839984, "grad_norm": 0.66015625, "learning_rate": 3.6385090140826563e-06, "loss": 0.3533, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1468, "tokens_per_second_per_gpu": 17308.87, "total_tokens": 132713065 }, { "epoch": 0.29346251810418017, "grad_norm": 0.6953125, "learning_rate": 3.625760102513103e-06, "loss": 0.3949, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1469, "tokens_per_second_per_gpu": 18908.88, "total_tokens": 132804477 }, { "epoch": 0.2936622883683764, "grad_norm": 0.6875, "learning_rate": 3.6130286178720343e-06, "loss": 0.3813, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1470, "tokens_per_second_per_gpu": 17692.89, "total_tokens": 132890341 }, { "epoch": 0.29386205863257253, "grad_norm": 0.72265625, "learning_rate": 3.6003145949668338e-06, "loss": 0.3604, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1471, "tokens_per_second_per_gpu": 17893.18, "total_tokens": 132977129 }, { "epoch": 0.29406182889676874, "grad_norm": 0.74609375, "learning_rate": 3.587618068557164e-06, "loss": 0.3924, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1472, "tokens_per_second_per_gpu": 19870.57, "total_tokens": 133071377 }, { "epoch": 0.2942615991609649, "grad_norm": 0.703125, "learning_rate": 3.5749390733548382e-06, "loss": 0.3856, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1473, "tokens_per_second_per_gpu": 17613.33, "total_tokens": 133158434 }, { "epoch": 0.29446136942516105, "grad_norm": 0.6640625, "learning_rate": 3.5622776440237415e-06, "loss": 0.3787, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1474, "tokens_per_second_per_gpu": 18793.13, "total_tokens": 133250180 }, { "epoch": 0.29466113968935725, "grad_norm": 0.734375, "learning_rate": 3.549633815179746e-06, "loss": 0.3863, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1475, "tokens_per_second_per_gpu": 18166.37, "total_tokens": 133338475 }, { "epoch": 0.2948609099535534, "grad_norm": 0.7109375, "learning_rate": 3.5370076213905904e-06, "loss": 0.3738, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1476, "tokens_per_second_per_gpu": 18060.3, "total_tokens": 133426511 }, { "epoch": 0.29506068021774956, "grad_norm": 0.6875, "learning_rate": 3.5243990971758124e-06, "loss": 0.4039, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1477, "tokens_per_second_per_gpu": 19324.8, "total_tokens": 133517993 }, { "epoch": 0.29526045048194577, "grad_norm": 0.6875, "learning_rate": 3.511808277006632e-06, "loss": 0.3943, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1478, "tokens_per_second_per_gpu": 20295.24, "total_tokens": 133615005 }, { "epoch": 0.2954602207461419, "grad_norm": 0.67578125, "learning_rate": 3.499235195305868e-06, "loss": 0.3823, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1479, "tokens_per_second_per_gpu": 19079.48, "total_tokens": 133706554 }, { "epoch": 0.29565999101033813, "grad_norm": 0.70703125, "learning_rate": 3.4866798864478523e-06, "loss": 0.3941, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1480, "tokens_per_second_per_gpu": 18548.92, "total_tokens": 133797045 }, { "epoch": 0.2958597612745343, "grad_norm": 0.70703125, "learning_rate": 3.4741423847583134e-06, "loss": 0.4091, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1481, "tokens_per_second_per_gpu": 19705.9, "total_tokens": 133892521 }, { "epoch": 0.29605953153873044, "grad_norm": 0.6796875, "learning_rate": 3.4616227245143085e-06, "loss": 0.4089, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1482, "tokens_per_second_per_gpu": 19258.45, "total_tokens": 133988061 }, { "epoch": 0.29625930180292664, "grad_norm": 0.70703125, "learning_rate": 3.449120939944107e-06, "loss": 0.3804, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1483, "tokens_per_second_per_gpu": 18549.44, "total_tokens": 134077661 }, { "epoch": 0.2964590720671228, "grad_norm": 0.69921875, "learning_rate": 3.4366370652271085e-06, "loss": 0.3861, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1484, "tokens_per_second_per_gpu": 18200.15, "total_tokens": 134165438 }, { "epoch": 0.296658842331319, "grad_norm": 0.734375, "learning_rate": 3.4241711344937557e-06, "loss": 0.3949, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1485, "tokens_per_second_per_gpu": 17455.84, "total_tokens": 134249113 }, { "epoch": 0.29685861259551516, "grad_norm": 0.70703125, "learning_rate": 3.4117231818254205e-06, "loss": 0.4043, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1486, "tokens_per_second_per_gpu": 19586.54, "total_tokens": 134343639 }, { "epoch": 0.2970583828597113, "grad_norm": 0.70703125, "learning_rate": 3.3992932412543358e-06, "loss": 0.3661, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1487, "tokens_per_second_per_gpu": 17665.2, "total_tokens": 134429419 }, { "epoch": 0.2972581531239075, "grad_norm": 0.6953125, "learning_rate": 3.3868813467634833e-06, "loss": 0.3745, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1488, "tokens_per_second_per_gpu": 18761.96, "total_tokens": 134519407 }, { "epoch": 0.2974579233881037, "grad_norm": 0.71484375, "learning_rate": 3.3744875322865035e-06, "loss": 0.3937, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1489, "tokens_per_second_per_gpu": 18478.1, "total_tokens": 134607856 }, { "epoch": 0.2976576936522999, "grad_norm": 0.7109375, "learning_rate": 3.3621118317076183e-06, "loss": 0.3662, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1490, "tokens_per_second_per_gpu": 17467.75, "total_tokens": 134693997 }, { "epoch": 0.29785746391649603, "grad_norm": 0.734375, "learning_rate": 3.349754278861517e-06, "loss": 0.3908, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1491, "tokens_per_second_per_gpu": 18889.1, "total_tokens": 134785313 }, { "epoch": 0.2980572341806922, "grad_norm": 0.69140625, "learning_rate": 3.3374149075332796e-06, "loss": 0.3574, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1492, "tokens_per_second_per_gpu": 17230.46, "total_tokens": 134870872 }, { "epoch": 0.2982570044448884, "grad_norm": 0.69921875, "learning_rate": 3.3250937514582758e-06, "loss": 0.3885, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1493, "tokens_per_second_per_gpu": 19147.28, "total_tokens": 134963315 }, { "epoch": 0.29845677470908455, "grad_norm": 0.6796875, "learning_rate": 3.3127908443220713e-06, "loss": 0.3753, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1494, "tokens_per_second_per_gpu": 18954.57, "total_tokens": 135055241 }, { "epoch": 0.2986565449732807, "grad_norm": 0.67578125, "learning_rate": 3.300506219760351e-06, "loss": 0.3734, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1495, "tokens_per_second_per_gpu": 19479.05, "total_tokens": 135148246 }, { "epoch": 0.2988563152374769, "grad_norm": 0.66796875, "learning_rate": 3.288239911358807e-06, "loss": 0.4045, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1496, "tokens_per_second_per_gpu": 19928.26, "total_tokens": 135245192 }, { "epoch": 0.29905608550167306, "grad_norm": 0.71484375, "learning_rate": 3.2759919526530536e-06, "loss": 0.3879, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1497, "tokens_per_second_per_gpu": 18567.43, "total_tokens": 135333959 }, { "epoch": 0.29925585576586927, "grad_norm": 0.69921875, "learning_rate": 3.2637623771285497e-06, "loss": 0.4042, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1498, "tokens_per_second_per_gpu": 19251.96, "total_tokens": 135426819 }, { "epoch": 0.2994556260300654, "grad_norm": 0.703125, "learning_rate": 3.25155121822048e-06, "loss": 0.3934, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1499, "tokens_per_second_per_gpu": 19094.29, "total_tokens": 135519758 }, { "epoch": 0.2996553962942616, "grad_norm": 0.69921875, "learning_rate": 3.239358509313695e-06, "loss": 0.3495, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1500, "tokens_per_second_per_gpu": 16922.41, "total_tokens": 135602419 }, { "epoch": 0.2998551665584578, "grad_norm": 0.71875, "learning_rate": 3.2271842837425917e-06, "loss": 0.4059, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1501, "tokens_per_second_per_gpu": 18537.64, "total_tokens": 135692127 }, { "epoch": 0.30005493682265394, "grad_norm": 0.72265625, "learning_rate": 3.2150285747910324e-06, "loss": 0.3929, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1502, "tokens_per_second_per_gpu": 18553.1, "total_tokens": 135780712 }, { "epoch": 0.30025470708685015, "grad_norm": 0.6796875, "learning_rate": 3.202891415692271e-06, "loss": 0.398, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1503, "tokens_per_second_per_gpu": 20021.2, "total_tokens": 135876043 }, { "epoch": 0.3004544773510463, "grad_norm": 0.6796875, "learning_rate": 3.1907728396288274e-06, "loss": 0.3958, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1504, "tokens_per_second_per_gpu": 19481.24, "total_tokens": 135971102 }, { "epoch": 0.30065424761524245, "grad_norm": 0.6953125, "learning_rate": 3.178672879732435e-06, "loss": 0.4049, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1505, "tokens_per_second_per_gpu": 20180.52, "total_tokens": 136068160 }, { "epoch": 0.30085401787943866, "grad_norm": 0.86328125, "learning_rate": 3.1665915690839165e-06, "loss": 0.3947, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1506, "tokens_per_second_per_gpu": 17880.79, "total_tokens": 136156155 }, { "epoch": 0.3010537881436348, "grad_norm": 0.71484375, "learning_rate": 3.1545289407131128e-06, "loss": 0.3753, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1507, "tokens_per_second_per_gpu": 18948.1, "total_tokens": 136247217 }, { "epoch": 0.30125355840783097, "grad_norm": 0.68359375, "learning_rate": 3.142485027598795e-06, "loss": 0.4585, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1508, "tokens_per_second_per_gpu": 20277.99, "total_tokens": 136347251 }, { "epoch": 0.3014533286720272, "grad_norm": 0.765625, "learning_rate": 3.1304598626685544e-06, "loss": 0.3855, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1509, "tokens_per_second_per_gpu": 18913.61, "total_tokens": 136439897 }, { "epoch": 0.30165309893622333, "grad_norm": 0.71875, "learning_rate": 3.118453478798743e-06, "loss": 0.3774, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1510, "tokens_per_second_per_gpu": 19360.82, "total_tokens": 136531630 }, { "epoch": 0.30185286920041954, "grad_norm": 0.72265625, "learning_rate": 3.1064659088143424e-06, "loss": 0.3973, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1511, "tokens_per_second_per_gpu": 17489.87, "total_tokens": 136616904 }, { "epoch": 0.3020526394646157, "grad_norm": 0.6796875, "learning_rate": 3.0944971854889193e-06, "loss": 0.3906, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1512, "tokens_per_second_per_gpu": 18873.03, "total_tokens": 136708975 }, { "epoch": 0.30225240972881184, "grad_norm": 0.6875, "learning_rate": 3.0825473415445073e-06, "loss": 0.3848, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1513, "tokens_per_second_per_gpu": 18507.27, "total_tokens": 136799015 }, { "epoch": 0.30245217999300805, "grad_norm": 0.703125, "learning_rate": 3.070616409651519e-06, "loss": 0.4031, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1514, "tokens_per_second_per_gpu": 19145.43, "total_tokens": 136891726 }, { "epoch": 0.3026519502572042, "grad_norm": 0.703125, "learning_rate": 3.0587044224286743e-06, "loss": 0.3996, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1515, "tokens_per_second_per_gpu": 19188.98, "total_tokens": 136984179 }, { "epoch": 0.3028517205214004, "grad_norm": 0.66796875, "learning_rate": 3.0468114124428806e-06, "loss": 0.3823, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1516, "tokens_per_second_per_gpu": 19160.09, "total_tokens": 137077706 }, { "epoch": 0.30305149078559657, "grad_norm": 0.6875, "learning_rate": 3.034937412209178e-06, "loss": 0.3972, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1517, "tokens_per_second_per_gpu": 19402.11, "total_tokens": 137170732 }, { "epoch": 0.3032512610497927, "grad_norm": 0.6953125, "learning_rate": 3.0230824541906332e-06, "loss": 0.394, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1518, "tokens_per_second_per_gpu": 17984.95, "total_tokens": 137259145 }, { "epoch": 0.30345103131398893, "grad_norm": 0.69140625, "learning_rate": 3.011246570798242e-06, "loss": 0.3822, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1519, "tokens_per_second_per_gpu": 18756.1, "total_tokens": 137349634 }, { "epoch": 0.3036508015781851, "grad_norm": 0.67578125, "learning_rate": 2.999429794390869e-06, "loss": 0.407, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1520, "tokens_per_second_per_gpu": 19076.15, "total_tokens": 137442677 }, { "epoch": 0.30385057184238123, "grad_norm": 0.68359375, "learning_rate": 2.9876321572751143e-06, "loss": 0.4026, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1521, "tokens_per_second_per_gpu": 19973.37, "total_tokens": 137539907 }, { "epoch": 0.30405034210657744, "grad_norm": 0.6640625, "learning_rate": 2.975853691705276e-06, "loss": 0.3836, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1522, "tokens_per_second_per_gpu": 19210.9, "total_tokens": 137634561 }, { "epoch": 0.3042501123707736, "grad_norm": 0.6875, "learning_rate": 2.9640944298832306e-06, "loss": 0.4125, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1523, "tokens_per_second_per_gpu": 19510.26, "total_tokens": 137729399 }, { "epoch": 0.3044498826349698, "grad_norm": 0.6796875, "learning_rate": 2.9523544039583498e-06, "loss": 0.3915, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1524, "tokens_per_second_per_gpu": 18728.47, "total_tokens": 137820836 }, { "epoch": 0.30464965289916596, "grad_norm": 0.65625, "learning_rate": 2.9406336460274144e-06, "loss": 0.3984, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1525, "tokens_per_second_per_gpu": 21072.21, "total_tokens": 137921558 }, { "epoch": 0.3048494231633621, "grad_norm": 0.671875, "learning_rate": 2.9289321881345257e-06, "loss": 0.3887, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1526, "tokens_per_second_per_gpu": 19246.88, "total_tokens": 138014984 }, { "epoch": 0.3050491934275583, "grad_norm": 0.69921875, "learning_rate": 2.9172500622710263e-06, "loss": 0.399, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1527, "tokens_per_second_per_gpu": 18430.83, "total_tokens": 138103759 }, { "epoch": 0.30524896369175447, "grad_norm": 0.6796875, "learning_rate": 2.9055873003754066e-06, "loss": 0.3801, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1528, "tokens_per_second_per_gpu": 19260.75, "total_tokens": 138196449 }, { "epoch": 0.3054487339559507, "grad_norm": 0.71484375, "learning_rate": 2.8939439343332086e-06, "loss": 0.3902, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1529, "tokens_per_second_per_gpu": 19601.42, "total_tokens": 138291022 }, { "epoch": 0.30564850422014683, "grad_norm": 0.67578125, "learning_rate": 2.882319995976949e-06, "loss": 0.3692, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1530, "tokens_per_second_per_gpu": 18268.63, "total_tokens": 138381719 }, { "epoch": 0.305848274484343, "grad_norm": 0.74609375, "learning_rate": 2.8707155170860303e-06, "loss": 0.3575, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1531, "tokens_per_second_per_gpu": 16508.19, "total_tokens": 138462581 }, { "epoch": 0.3060480447485392, "grad_norm": 0.73046875, "learning_rate": 2.8591305293866557e-06, "loss": 0.3737, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1532, "tokens_per_second_per_gpu": 17865.94, "total_tokens": 138548928 }, { "epoch": 0.30624781501273535, "grad_norm": 0.6953125, "learning_rate": 2.847565064551747e-06, "loss": 0.4348, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1533, "tokens_per_second_per_gpu": 19426.46, "total_tokens": 138643802 }, { "epoch": 0.30644758527693156, "grad_norm": 0.66015625, "learning_rate": 2.836019154200831e-06, "loss": 0.4136, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1534, "tokens_per_second_per_gpu": 20288.14, "total_tokens": 138742019 }, { "epoch": 0.3066473555411277, "grad_norm": 0.71875, "learning_rate": 2.824492829899994e-06, "loss": 0.4025, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1535, "tokens_per_second_per_gpu": 18276.13, "total_tokens": 138831467 }, { "epoch": 0.30684712580532386, "grad_norm": 0.7421875, "learning_rate": 2.812986123161762e-06, "loss": 0.3624, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1536, "tokens_per_second_per_gpu": 16720.45, "total_tokens": 138913526 }, { "epoch": 0.30704689606952007, "grad_norm": 0.73828125, "learning_rate": 2.8014990654450325e-06, "loss": 0.4174, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1537, "tokens_per_second_per_gpu": 20445.83, "total_tokens": 139012082 }, { "epoch": 0.3072466663337162, "grad_norm": 0.6875, "learning_rate": 2.7900316881549915e-06, "loss": 0.4162, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1538, "tokens_per_second_per_gpu": 19879.27, "total_tokens": 139107725 }, { "epoch": 0.3074464365979124, "grad_norm": 0.7109375, "learning_rate": 2.778584022642996e-06, "loss": 0.3922, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1539, "tokens_per_second_per_gpu": 18367.97, "total_tokens": 139196701 }, { "epoch": 0.3076462068621086, "grad_norm": 0.68359375, "learning_rate": 2.7671561002065362e-06, "loss": 0.3905, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1540, "tokens_per_second_per_gpu": 18823.51, "total_tokens": 139288867 }, { "epoch": 0.30784597712630474, "grad_norm": 0.69921875, "learning_rate": 2.7557479520891104e-06, "loss": 0.3753, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1541, "tokens_per_second_per_gpu": 18908.75, "total_tokens": 139380776 }, { "epoch": 0.30804574739050095, "grad_norm": 0.6796875, "learning_rate": 2.744359609480163e-06, "loss": 0.4171, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1542, "tokens_per_second_per_gpu": 20557.38, "total_tokens": 139479162 }, { "epoch": 0.3082455176546971, "grad_norm": 0.69921875, "learning_rate": 2.7329911035149934e-06, "loss": 0.3876, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1543, "tokens_per_second_per_gpu": 19160.03, "total_tokens": 139572435 }, { "epoch": 0.30844528791889325, "grad_norm": 0.69921875, "learning_rate": 2.7216424652746497e-06, "loss": 0.3858, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1544, "tokens_per_second_per_gpu": 20244.91, "total_tokens": 139670265 }, { "epoch": 0.30864505818308946, "grad_norm": 0.70703125, "learning_rate": 2.7103137257858867e-06, "loss": 0.3778, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1545, "tokens_per_second_per_gpu": 17473.45, "total_tokens": 139754875 }, { "epoch": 0.3088448284472856, "grad_norm": 0.703125, "learning_rate": 2.6990049160210386e-06, "loss": 0.3903, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1546, "tokens_per_second_per_gpu": 18139.58, "total_tokens": 139845250 }, { "epoch": 0.3090445987114818, "grad_norm": 0.67578125, "learning_rate": 2.687716066897964e-06, "loss": 0.3964, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1547, "tokens_per_second_per_gpu": 20999.02, "total_tokens": 139945371 }, { "epoch": 0.309244368975678, "grad_norm": 0.703125, "learning_rate": 2.6764472092799443e-06, "loss": 0.4041, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1548, "tokens_per_second_per_gpu": 19340.37, "total_tokens": 140038653 }, { "epoch": 0.3094441392398741, "grad_norm": 0.72265625, "learning_rate": 2.6651983739756026e-06, "loss": 0.4164, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1549, "tokens_per_second_per_gpu": 18111.62, "total_tokens": 140127203 }, { "epoch": 0.30964390950407034, "grad_norm": 0.72265625, "learning_rate": 2.65396959173883e-06, "loss": 0.3871, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1550, "tokens_per_second_per_gpu": 18267.73, "total_tokens": 140215425 }, { "epoch": 0.3098436797682665, "grad_norm": 0.703125, "learning_rate": 2.642760893268684e-06, "loss": 0.405, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1551, "tokens_per_second_per_gpu": 19054.35, "total_tokens": 140309155 }, { "epoch": 0.31004345003246264, "grad_norm": 0.69921875, "learning_rate": 2.6315723092093228e-06, "loss": 0.3785, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1552, "tokens_per_second_per_gpu": 18335.88, "total_tokens": 140398574 }, { "epoch": 0.31024322029665885, "grad_norm": 0.671875, "learning_rate": 2.6204038701499056e-06, "loss": 0.3578, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1553, "tokens_per_second_per_gpu": 18526.48, "total_tokens": 140488511 }, { "epoch": 0.310442990560855, "grad_norm": 0.69921875, "learning_rate": 2.6092556066245155e-06, "loss": 0.4035, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1554, "tokens_per_second_per_gpu": 18539.61, "total_tokens": 140578598 }, { "epoch": 0.3106427608250512, "grad_norm": 0.703125, "learning_rate": 2.5981275491120837e-06, "loss": 0.3912, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1555, "tokens_per_second_per_gpu": 18309.56, "total_tokens": 140666812 }, { "epoch": 0.31084253108924736, "grad_norm": 0.703125, "learning_rate": 2.587019728036292e-06, "loss": 0.3897, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1556, "tokens_per_second_per_gpu": 18125.62, "total_tokens": 140754359 }, { "epoch": 0.3110423013534435, "grad_norm": 0.703125, "learning_rate": 2.5759321737655017e-06, "loss": 0.3951, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1557, "tokens_per_second_per_gpu": 17888.97, "total_tokens": 140842168 }, { "epoch": 0.3112420716176397, "grad_norm": 0.70703125, "learning_rate": 2.5648649166126606e-06, "loss": 0.414, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1558, "tokens_per_second_per_gpu": 20266.24, "total_tokens": 140938393 }, { "epoch": 0.3114418418818359, "grad_norm": 0.70703125, "learning_rate": 2.553817986835225e-06, "loss": 0.4189, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1559, "tokens_per_second_per_gpu": 19366.71, "total_tokens": 141031986 }, { "epoch": 0.3116416121460321, "grad_norm": 0.71875, "learning_rate": 2.542791414635085e-06, "loss": 0.4256, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1560, "tokens_per_second_per_gpu": 18493.21, "total_tokens": 141123011 }, { "epoch": 0.31184138241022824, "grad_norm": 0.68359375, "learning_rate": 2.5317852301584642e-06, "loss": 0.3527, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1561, "tokens_per_second_per_gpu": 16779.27, "total_tokens": 141205346 }, { "epoch": 0.3120411526744244, "grad_norm": 0.7265625, "learning_rate": 2.5207994634958475e-06, "loss": 0.3782, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1562, "tokens_per_second_per_gpu": 17089.51, "total_tokens": 141288880 }, { "epoch": 0.3122409229386206, "grad_norm": 0.703125, "learning_rate": 2.5098341446819097e-06, "loss": 0.4041, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1563, "tokens_per_second_per_gpu": 19572.67, "total_tokens": 141382462 }, { "epoch": 0.31244069320281675, "grad_norm": 0.7109375, "learning_rate": 2.4988893036954045e-06, "loss": 0.43, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1564, "tokens_per_second_per_gpu": 18559.75, "total_tokens": 141474840 }, { "epoch": 0.3126404634670129, "grad_norm": 0.78515625, "learning_rate": 2.487964970459118e-06, "loss": 0.3931, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1565, "tokens_per_second_per_gpu": 19481.73, "total_tokens": 141569422 }, { "epoch": 0.3128402337312091, "grad_norm": 0.7265625, "learning_rate": 2.4770611748397556e-06, "loss": 0.4108, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1566, "tokens_per_second_per_gpu": 19141.6, "total_tokens": 141661891 }, { "epoch": 0.31304000399540527, "grad_norm": 0.7109375, "learning_rate": 2.466177946647874e-06, "loss": 0.4082, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1567, "tokens_per_second_per_gpu": 18225.69, "total_tokens": 141750440 }, { "epoch": 0.3132397742596015, "grad_norm": 0.703125, "learning_rate": 2.455315315637813e-06, "loss": 0.3761, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1568, "tokens_per_second_per_gpu": 17953.77, "total_tokens": 141838209 }, { "epoch": 0.31343954452379763, "grad_norm": 0.6875, "learning_rate": 2.4444733115075823e-06, "loss": 0.3804, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1569, "tokens_per_second_per_gpu": 18650.74, "total_tokens": 141926856 }, { "epoch": 0.3136393147879938, "grad_norm": 0.6875, "learning_rate": 2.4336519638988134e-06, "loss": 0.3824, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1570, "tokens_per_second_per_gpu": 18437.98, "total_tokens": 142017624 }, { "epoch": 0.31383908505219, "grad_norm": 0.703125, "learning_rate": 2.422851302396655e-06, "loss": 0.4179, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1571, "tokens_per_second_per_gpu": 18764.53, "total_tokens": 142111047 }, { "epoch": 0.31403885531638615, "grad_norm": 0.69921875, "learning_rate": 2.4120713565297005e-06, "loss": 0.3778, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1572, "tokens_per_second_per_gpu": 18021.75, "total_tokens": 142199954 }, { "epoch": 0.31423862558058235, "grad_norm": 0.7265625, "learning_rate": 2.401312155769916e-06, "loss": 0.4151, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1573, "tokens_per_second_per_gpu": 18289.06, "total_tokens": 142290017 }, { "epoch": 0.3144383958447785, "grad_norm": 0.69140625, "learning_rate": 2.3905737295325393e-06, "loss": 0.4106, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1574, "tokens_per_second_per_gpu": 19549.09, "total_tokens": 142385213 }, { "epoch": 0.31463816610897466, "grad_norm": 0.70703125, "learning_rate": 2.379856107176024e-06, "loss": 0.373, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1575, "tokens_per_second_per_gpu": 18253.4, "total_tokens": 142474813 }, { "epoch": 0.31483793637317087, "grad_norm": 0.75, "learning_rate": 2.369159318001937e-06, "loss": 0.3953, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1576, "tokens_per_second_per_gpu": 17093.29, "total_tokens": 142559100 }, { "epoch": 0.315037706637367, "grad_norm": 0.72265625, "learning_rate": 2.3584833912548887e-06, "loss": 0.3919, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1577, "tokens_per_second_per_gpu": 17893.79, "total_tokens": 142647568 }, { "epoch": 0.31523747690156323, "grad_norm": 0.7265625, "learning_rate": 2.347828356122461e-06, "loss": 0.4104, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1578, "tokens_per_second_per_gpu": 18264.98, "total_tokens": 142737277 }, { "epoch": 0.3154372471657594, "grad_norm": 0.6953125, "learning_rate": 2.3371942417351077e-06, "loss": 0.3615, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1579, "tokens_per_second_per_gpu": 17502.97, "total_tokens": 142823193 }, { "epoch": 0.31563701742995554, "grad_norm": 0.69140625, "learning_rate": 2.326581077166097e-06, "loss": 0.38, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1580, "tokens_per_second_per_gpu": 18222.04, "total_tokens": 142912448 }, { "epoch": 0.31583678769415174, "grad_norm": 0.72265625, "learning_rate": 2.315988891431412e-06, "loss": 0.3846, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1581, "tokens_per_second_per_gpu": 16963.97, "total_tokens": 142995277 }, { "epoch": 0.3160365579583479, "grad_norm": 0.703125, "learning_rate": 2.3054177134896818e-06, "loss": 0.3872, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1582, "tokens_per_second_per_gpu": 18669.98, "total_tokens": 143085204 }, { "epoch": 0.31623632822254405, "grad_norm": 0.69140625, "learning_rate": 2.2948675722421086e-06, "loss": 0.414, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1583, "tokens_per_second_per_gpu": 19789.18, "total_tokens": 143180597 }, { "epoch": 0.31643609848674026, "grad_norm": 0.6875, "learning_rate": 2.284338496532371e-06, "loss": 0.4315, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1584, "tokens_per_second_per_gpu": 20248.4, "total_tokens": 143278575 }, { "epoch": 0.3166358687509364, "grad_norm": 0.6875, "learning_rate": 2.2738305151465646e-06, "loss": 0.4001, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1585, "tokens_per_second_per_gpu": 20898.31, "total_tokens": 143378114 }, { "epoch": 0.3168356390151326, "grad_norm": 0.6875, "learning_rate": 2.263343656813107e-06, "loss": 0.3872, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1586, "tokens_per_second_per_gpu": 18112.86, "total_tokens": 143467141 }, { "epoch": 0.3170354092793288, "grad_norm": 0.70703125, "learning_rate": 2.2528779502026652e-06, "loss": 0.3797, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1587, "tokens_per_second_per_gpu": 17228.63, "total_tokens": 143552497 }, { "epoch": 0.3172351795435249, "grad_norm": 0.71875, "learning_rate": 2.2424334239280878e-06, "loss": 0.379, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1588, "tokens_per_second_per_gpu": 16746.53, "total_tokens": 143633858 }, { "epoch": 0.31743494980772113, "grad_norm": 0.68359375, "learning_rate": 2.2320101065443055e-06, "loss": 0.3632, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1589, "tokens_per_second_per_gpu": 18268.92, "total_tokens": 143723254 }, { "epoch": 0.3176347200719173, "grad_norm": 0.6875, "learning_rate": 2.221608026548271e-06, "loss": 0.3862, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1590, "tokens_per_second_per_gpu": 17943.36, "total_tokens": 143810674 }, { "epoch": 0.3178344903361135, "grad_norm": 0.68359375, "learning_rate": 2.211227212378877e-06, "loss": 0.3986, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1591, "tokens_per_second_per_gpu": 19253.62, "total_tokens": 143904474 }, { "epoch": 0.31803426060030965, "grad_norm": 0.6953125, "learning_rate": 2.200867692416868e-06, "loss": 0.3798, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1592, "tokens_per_second_per_gpu": 19630.64, "total_tokens": 143998823 }, { "epoch": 0.3182340308645058, "grad_norm": 0.703125, "learning_rate": 2.190529494984782e-06, "loss": 0.4111, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1593, "tokens_per_second_per_gpu": 18908.0, "total_tokens": 144089248 }, { "epoch": 0.318433801128702, "grad_norm": 0.72265625, "learning_rate": 2.1802126483468524e-06, "loss": 0.3626, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1594, "tokens_per_second_per_gpu": 17124.94, "total_tokens": 144173784 }, { "epoch": 0.31863357139289816, "grad_norm": 0.70703125, "learning_rate": 2.1699171807089414e-06, "loss": 0.3901, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1595, "tokens_per_second_per_gpu": 18495.25, "total_tokens": 144264180 }, { "epoch": 0.3188333416570943, "grad_norm": 0.6875, "learning_rate": 2.1596431202184707e-06, "loss": 0.373, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1596, "tokens_per_second_per_gpu": 18304.96, "total_tokens": 144352792 }, { "epoch": 0.3190331119212905, "grad_norm": 0.7109375, "learning_rate": 2.149390494964323e-06, "loss": 0.3805, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1597, "tokens_per_second_per_gpu": 17258.31, "total_tokens": 144438114 }, { "epoch": 0.3192328821854867, "grad_norm": 0.703125, "learning_rate": 2.13915933297679e-06, "loss": 0.4124, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1598, "tokens_per_second_per_gpu": 17860.1, "total_tokens": 144525865 }, { "epoch": 0.3194326524496829, "grad_norm": 0.7109375, "learning_rate": 2.1289496622274754e-06, "loss": 0.4213, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1599, "tokens_per_second_per_gpu": 20151.82, "total_tokens": 144623582 }, { "epoch": 0.31963242271387904, "grad_norm": 0.6953125, "learning_rate": 2.118761510629226e-06, "loss": 0.3879, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1600, "tokens_per_second_per_gpu": 18334.73, "total_tokens": 144715347 }, { "epoch": 0.3198321929780752, "grad_norm": 0.6953125, "learning_rate": 2.1085949060360654e-06, "loss": 0.3938, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1601, "tokens_per_second_per_gpu": 17869.12, "total_tokens": 144803581 }, { "epoch": 0.3200319632422714, "grad_norm": 0.70703125, "learning_rate": 2.098449876243096e-06, "loss": 0.3999, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1602, "tokens_per_second_per_gpu": 18626.82, "total_tokens": 144891945 }, { "epoch": 0.32023173350646755, "grad_norm": 0.69921875, "learning_rate": 2.0883264489864476e-06, "loss": 0.3709, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1603, "tokens_per_second_per_gpu": 18331.31, "total_tokens": 144982137 }, { "epoch": 0.32043150377066376, "grad_norm": 0.68359375, "learning_rate": 2.0782246519431814e-06, "loss": 0.3766, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1604, "tokens_per_second_per_gpu": 18995.37, "total_tokens": 145073765 }, { "epoch": 0.3206312740348599, "grad_norm": 0.6953125, "learning_rate": 2.0681445127312218e-06, "loss": 0.3941, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1605, "tokens_per_second_per_gpu": 19947.68, "total_tokens": 145169628 }, { "epoch": 0.32083104429905607, "grad_norm": 0.75, "learning_rate": 2.0580860589092897e-06, "loss": 0.3934, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1606, "tokens_per_second_per_gpu": 18072.75, "total_tokens": 145258519 }, { "epoch": 0.3210308145632523, "grad_norm": 0.6796875, "learning_rate": 2.048049317976809e-06, "loss": 0.3665, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1607, "tokens_per_second_per_gpu": 18500.97, "total_tokens": 145347839 }, { "epoch": 0.32123058482744843, "grad_norm": 0.6953125, "learning_rate": 2.0380343173738516e-06, "loss": 0.3923, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1608, "tokens_per_second_per_gpu": 17981.28, "total_tokens": 145435172 }, { "epoch": 0.3214303550916446, "grad_norm": 0.71875, "learning_rate": 2.0280410844810426e-06, "loss": 0.3861, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1609, "tokens_per_second_per_gpu": 18268.66, "total_tokens": 145522918 }, { "epoch": 0.3216301253558408, "grad_norm": 0.67578125, "learning_rate": 2.0180696466194983e-06, "loss": 0.3862, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1610, "tokens_per_second_per_gpu": 19167.41, "total_tokens": 145616842 }, { "epoch": 0.32182989562003694, "grad_norm": 0.66796875, "learning_rate": 2.008120031050753e-06, "loss": 0.3908, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1611, "tokens_per_second_per_gpu": 19826.63, "total_tokens": 145713609 }, { "epoch": 0.32202966588423315, "grad_norm": 0.6953125, "learning_rate": 1.9981922649766714e-06, "loss": 0.3891, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1612, "tokens_per_second_per_gpu": 18328.84, "total_tokens": 145803028 }, { "epoch": 0.3222294361484293, "grad_norm": 0.6953125, "learning_rate": 1.988286375539391e-06, "loss": 0.3699, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1613, "tokens_per_second_per_gpu": 17380.07, "total_tokens": 145887152 }, { "epoch": 0.32242920641262546, "grad_norm": 0.703125, "learning_rate": 1.9784023898212345e-06, "loss": 0.3852, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1614, "tokens_per_second_per_gpu": 17520.97, "total_tokens": 145973979 }, { "epoch": 0.32262897667682167, "grad_norm": 0.67578125, "learning_rate": 1.9685403348446374e-06, "loss": 0.3852, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1615, "tokens_per_second_per_gpu": 19894.5, "total_tokens": 146068539 }, { "epoch": 0.3228287469410178, "grad_norm": 0.69140625, "learning_rate": 1.9587002375720864e-06, "loss": 0.3983, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1616, "tokens_per_second_per_gpu": 18632.93, "total_tokens": 146158554 }, { "epoch": 0.323028517205214, "grad_norm": 0.68359375, "learning_rate": 1.9488821249060297e-06, "loss": 0.4049, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1617, "tokens_per_second_per_gpu": 20180.48, "total_tokens": 146257392 }, { "epoch": 0.3232282874694102, "grad_norm": 0.68359375, "learning_rate": 1.9390860236888097e-06, "loss": 0.3871, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1618, "tokens_per_second_per_gpu": 19450.69, "total_tokens": 146351651 }, { "epoch": 0.32342805773360633, "grad_norm": 0.72265625, "learning_rate": 1.929311960702599e-06, "loss": 0.3538, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1619, "tokens_per_second_per_gpu": 16636.56, "total_tokens": 146432535 }, { "epoch": 0.32362782799780254, "grad_norm": 0.6875, "learning_rate": 1.919559962669305e-06, "loss": 0.383, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1620, "tokens_per_second_per_gpu": 18936.58, "total_tokens": 146523772 }, { "epoch": 0.3238275982619987, "grad_norm": 0.67578125, "learning_rate": 1.9098300562505266e-06, "loss": 0.3633, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1621, "tokens_per_second_per_gpu": 18781.49, "total_tokens": 146613922 }, { "epoch": 0.3240273685261949, "grad_norm": 0.6796875, "learning_rate": 1.9001222680474518e-06, "loss": 0.3594, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1622, "tokens_per_second_per_gpu": 18358.0, "total_tokens": 146702596 }, { "epoch": 0.32422713879039106, "grad_norm": 0.66015625, "learning_rate": 1.8904366246007998e-06, "loss": 0.3862, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1623, "tokens_per_second_per_gpu": 19695.55, "total_tokens": 146797094 }, { "epoch": 0.3244269090545872, "grad_norm": 0.69140625, "learning_rate": 1.8807731523907556e-06, "loss": 0.3721, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1624, "tokens_per_second_per_gpu": 19420.69, "total_tokens": 146890646 }, { "epoch": 0.3246266793187834, "grad_norm": 0.6875, "learning_rate": 1.8711318778368792e-06, "loss": 0.368, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1625, "tokens_per_second_per_gpu": 17930.38, "total_tokens": 146978138 }, { "epoch": 0.32482644958297957, "grad_norm": 0.7265625, "learning_rate": 1.861512827298051e-06, "loss": 0.372, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1626, "tokens_per_second_per_gpu": 16742.25, "total_tokens": 147061039 }, { "epoch": 0.3250262198471757, "grad_norm": 0.703125, "learning_rate": 1.8519160270723858e-06, "loss": 0.3815, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1627, "tokens_per_second_per_gpu": 18219.94, "total_tokens": 147150304 }, { "epoch": 0.32522599011137193, "grad_norm": 0.66015625, "learning_rate": 1.842341503397166e-06, "loss": 0.3899, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1628, "tokens_per_second_per_gpu": 19011.34, "total_tokens": 147243511 }, { "epoch": 0.3254257603755681, "grad_norm": 0.68359375, "learning_rate": 1.8327892824487792e-06, "loss": 0.3889, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1629, "tokens_per_second_per_gpu": 19984.49, "total_tokens": 147340316 }, { "epoch": 0.3256255306397643, "grad_norm": 0.7109375, "learning_rate": 1.8232593903426266e-06, "loss": 0.3646, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1630, "tokens_per_second_per_gpu": 17001.06, "total_tokens": 147422885 }, { "epoch": 0.32582530090396045, "grad_norm": 0.703125, "learning_rate": 1.8137518531330768e-06, "loss": 0.4033, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1631, "tokens_per_second_per_gpu": 17677.62, "total_tokens": 147511035 }, { "epoch": 0.3260250711681566, "grad_norm": 0.6953125, "learning_rate": 1.8042666968133682e-06, "loss": 0.4136, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1632, "tokens_per_second_per_gpu": 19583.75, "total_tokens": 147607663 }, { "epoch": 0.3262248414323528, "grad_norm": 0.72265625, "learning_rate": 1.7948039473155553e-06, "loss": 0.3904, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1633, "tokens_per_second_per_gpu": 18411.9, "total_tokens": 147695949 }, { "epoch": 0.32642461169654896, "grad_norm": 0.69140625, "learning_rate": 1.7853636305104382e-06, "loss": 0.4158, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1634, "tokens_per_second_per_gpu": 19631.79, "total_tokens": 147791520 }, { "epoch": 0.32662438196074517, "grad_norm": 0.69140625, "learning_rate": 1.775945772207477e-06, "loss": 0.3898, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1635, "tokens_per_second_per_gpu": 19083.48, "total_tokens": 147884487 }, { "epoch": 0.3268241522249413, "grad_norm": 0.72265625, "learning_rate": 1.7665503981547428e-06, "loss": 0.3819, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1636, "tokens_per_second_per_gpu": 16528.8, "total_tokens": 147964945 }, { "epoch": 0.3270239224891375, "grad_norm": 0.6796875, "learning_rate": 1.7571775340388275e-06, "loss": 0.3964, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1637, "tokens_per_second_per_gpu": 19215.74, "total_tokens": 148057986 }, { "epoch": 0.3272236927533337, "grad_norm": 0.71484375, "learning_rate": 1.747827205484779e-06, "loss": 0.368, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1638, "tokens_per_second_per_gpu": 17707.63, "total_tokens": 148142960 }, { "epoch": 0.32742346301752984, "grad_norm": 0.73046875, "learning_rate": 1.738499438056045e-06, "loss": 0.3777, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1639, "tokens_per_second_per_gpu": 19589.95, "total_tokens": 148237313 }, { "epoch": 0.327623233281726, "grad_norm": 0.703125, "learning_rate": 1.7291942572543806e-06, "loss": 0.3966, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1640, "tokens_per_second_per_gpu": 18921.21, "total_tokens": 148329331 }, { "epoch": 0.3278230035459222, "grad_norm": 0.6875, "learning_rate": 1.7199116885197996e-06, "loss": 0.3849, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1641, "tokens_per_second_per_gpu": 17975.13, "total_tokens": 148416877 }, { "epoch": 0.32802277381011835, "grad_norm": 0.68359375, "learning_rate": 1.7106517572304883e-06, "loss": 0.3969, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1642, "tokens_per_second_per_gpu": 20087.22, "total_tokens": 148511698 }, { "epoch": 0.32822254407431456, "grad_norm": 0.7578125, "learning_rate": 1.7014144887027406e-06, "loss": 0.392, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1643, "tokens_per_second_per_gpu": 17811.09, "total_tokens": 148597916 }, { "epoch": 0.3284223143385107, "grad_norm": 0.7109375, "learning_rate": 1.6921999081909036e-06, "loss": 0.3905, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1644, "tokens_per_second_per_gpu": 18708.08, "total_tokens": 148689442 }, { "epoch": 0.32862208460270687, "grad_norm": 0.66796875, "learning_rate": 1.6830080408872852e-06, "loss": 0.3806, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1645, "tokens_per_second_per_gpu": 18524.28, "total_tokens": 148779943 }, { "epoch": 0.3288218548669031, "grad_norm": 0.69921875, "learning_rate": 1.6738389119220966e-06, "loss": 0.363, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1646, "tokens_per_second_per_gpu": 16978.68, "total_tokens": 148863738 }, { "epoch": 0.3290216251310992, "grad_norm": 0.796875, "learning_rate": 1.6646925463633924e-06, "loss": 0.3978, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1647, "tokens_per_second_per_gpu": 17607.11, "total_tokens": 148948698 }, { "epoch": 0.32922139539529544, "grad_norm": 0.67578125, "learning_rate": 1.6555689692169796e-06, "loss": 0.3785, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1648, "tokens_per_second_per_gpu": 19360.72, "total_tokens": 149041397 }, { "epoch": 0.3294211656594916, "grad_norm": 0.69140625, "learning_rate": 1.646468205426377e-06, "loss": 0.3959, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1649, "tokens_per_second_per_gpu": 17589.48, "total_tokens": 149128023 }, { "epoch": 0.32962093592368774, "grad_norm": 0.71484375, "learning_rate": 1.6373902798727226e-06, "loss": 0.3905, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1650, "tokens_per_second_per_gpu": 18586.35, "total_tokens": 149217805 }, { "epoch": 0.32982070618788395, "grad_norm": 0.71875, "learning_rate": 1.6283352173747148e-06, "loss": 0.3865, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1651, "tokens_per_second_per_gpu": 17859.64, "total_tokens": 149304184 }, { "epoch": 0.3300204764520801, "grad_norm": 0.6875, "learning_rate": 1.6193030426885526e-06, "loss": 0.3762, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1652, "tokens_per_second_per_gpu": 17911.29, "total_tokens": 149390620 }, { "epoch": 0.33022024671627626, "grad_norm": 0.71484375, "learning_rate": 1.6102937805078544e-06, "loss": 0.4095, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1653, "tokens_per_second_per_gpu": 17974.76, "total_tokens": 149479060 }, { "epoch": 0.33042001698047246, "grad_norm": 0.69921875, "learning_rate": 1.6013074554636022e-06, "loss": 0.3992, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1654, "tokens_per_second_per_gpu": 18478.31, "total_tokens": 149571004 }, { "epoch": 0.3306197872446686, "grad_norm": 0.703125, "learning_rate": 1.5923440921240641e-06, "loss": 0.4134, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1655, "tokens_per_second_per_gpu": 18843.85, "total_tokens": 149662833 }, { "epoch": 0.3308195575088648, "grad_norm": 0.70703125, "learning_rate": 1.5834037149947291e-06, "loss": 0.3707, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1656, "tokens_per_second_per_gpu": 18793.67, "total_tokens": 149753241 }, { "epoch": 0.331019327773061, "grad_norm": 0.6796875, "learning_rate": 1.5744863485182537e-06, "loss": 0.4107, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1657, "tokens_per_second_per_gpu": 20075.44, "total_tokens": 149850899 }, { "epoch": 0.33121909803725713, "grad_norm": 0.6796875, "learning_rate": 1.565592017074371e-06, "loss": 0.3774, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1658, "tokens_per_second_per_gpu": 19497.93, "total_tokens": 149944729 }, { "epoch": 0.33141886830145334, "grad_norm": 0.68359375, "learning_rate": 1.5567207449798517e-06, "loss": 0.375, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1659, "tokens_per_second_per_gpu": 17721.8, "total_tokens": 150030587 }, { "epoch": 0.3316186385656495, "grad_norm": 0.68359375, "learning_rate": 1.5478725564884045e-06, "loss": 0.3826, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1660, "tokens_per_second_per_gpu": 19535.99, "total_tokens": 150123851 }, { "epoch": 0.3318184088298457, "grad_norm": 0.72265625, "learning_rate": 1.5390474757906449e-06, "loss": 0.4064, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1661, "tokens_per_second_per_gpu": 18044.22, "total_tokens": 150212524 }, { "epoch": 0.33201817909404185, "grad_norm": 0.69921875, "learning_rate": 1.5302455270140083e-06, "loss": 0.3854, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1662, "tokens_per_second_per_gpu": 18197.76, "total_tokens": 150301347 }, { "epoch": 0.332217949358238, "grad_norm": 0.69140625, "learning_rate": 1.5214667342226818e-06, "loss": 0.3819, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1663, "tokens_per_second_per_gpu": 19625.1, "total_tokens": 150396463 }, { "epoch": 0.3324177196224342, "grad_norm": 0.6953125, "learning_rate": 1.512711121417556e-06, "loss": 0.3736, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1664, "tokens_per_second_per_gpu": 17708.52, "total_tokens": 150482430 }, { "epoch": 0.33261748988663037, "grad_norm": 0.7109375, "learning_rate": 1.5039787125361327e-06, "loss": 0.3712, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1665, "tokens_per_second_per_gpu": 17792.81, "total_tokens": 150568925 }, { "epoch": 0.3328172601508266, "grad_norm": 0.71484375, "learning_rate": 1.4952695314524912e-06, "loss": 0.3801, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1666, "tokens_per_second_per_gpu": 17591.18, "total_tokens": 150654913 }, { "epoch": 0.33301703041502273, "grad_norm": 0.69921875, "learning_rate": 1.4865836019771995e-06, "loss": 0.4013, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1667, "tokens_per_second_per_gpu": 19254.33, "total_tokens": 150748758 }, { "epoch": 0.3332168006792189, "grad_norm": 0.6953125, "learning_rate": 1.4779209478572542e-06, "loss": 0.4, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1668, "tokens_per_second_per_gpu": 18785.99, "total_tokens": 150840413 }, { "epoch": 0.3334165709434151, "grad_norm": 0.6953125, "learning_rate": 1.4692815927760274e-06, "loss": 0.4156, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1669, "tokens_per_second_per_gpu": 19268.93, "total_tokens": 150933925 }, { "epoch": 0.33361634120761124, "grad_norm": 0.69921875, "learning_rate": 1.4606655603531762e-06, "loss": 0.3911, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1670, "tokens_per_second_per_gpu": 19271.79, "total_tokens": 151027259 }, { "epoch": 0.3338161114718074, "grad_norm": 0.7109375, "learning_rate": 1.4520728741446087e-06, "loss": 0.395, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1671, "tokens_per_second_per_gpu": 17822.44, "total_tokens": 151114502 }, { "epoch": 0.3340158817360036, "grad_norm": 0.6953125, "learning_rate": 1.443503557642405e-06, "loss": 0.3984, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1672, "tokens_per_second_per_gpu": 19658.97, "total_tokens": 151208127 }, { "epoch": 0.33421565200019976, "grad_norm": 0.71484375, "learning_rate": 1.4349576342747462e-06, "loss": 0.3749, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1673, "tokens_per_second_per_gpu": 18752.49, "total_tokens": 151298861 }, { "epoch": 0.33441542226439597, "grad_norm": 0.6875, "learning_rate": 1.4264351274058584e-06, "loss": 0.3837, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1674, "tokens_per_second_per_gpu": 19209.23, "total_tokens": 151391333 }, { "epoch": 0.3346151925285921, "grad_norm": 0.6875, "learning_rate": 1.4179360603359504e-06, "loss": 0.3964, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1675, "tokens_per_second_per_gpu": 18073.46, "total_tokens": 151480396 }, { "epoch": 0.3348149627927883, "grad_norm": 0.7734375, "learning_rate": 1.409460456301147e-06, "loss": 0.3812, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1676, "tokens_per_second_per_gpu": 17736.34, "total_tokens": 151567181 }, { "epoch": 0.3350147330569845, "grad_norm": 0.68359375, "learning_rate": 1.4010083384734308e-06, "loss": 0.4103, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1677, "tokens_per_second_per_gpu": 19971.63, "total_tokens": 151663119 }, { "epoch": 0.33521450332118063, "grad_norm": 0.6875, "learning_rate": 1.3925797299605649e-06, "loss": 0.3579, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1678, "tokens_per_second_per_gpu": 17777.51, "total_tokens": 151749338 }, { "epoch": 0.33541427358537684, "grad_norm": 0.68359375, "learning_rate": 1.384174653806044e-06, "loss": 0.4029, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1679, "tokens_per_second_per_gpu": 19720.3, "total_tokens": 151844990 }, { "epoch": 0.335614043849573, "grad_norm": 0.67578125, "learning_rate": 1.3757931329890218e-06, "loss": 0.3988, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1680, "tokens_per_second_per_gpu": 19147.6, "total_tokens": 151939228 }, { "epoch": 0.33581381411376915, "grad_norm": 0.6796875, "learning_rate": 1.367435190424261e-06, "loss": 0.4015, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1681, "tokens_per_second_per_gpu": 19511.21, "total_tokens": 152033999 }, { "epoch": 0.33601358437796536, "grad_norm": 0.7109375, "learning_rate": 1.3591008489620572e-06, "loss": 0.3896, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1682, "tokens_per_second_per_gpu": 17518.25, "total_tokens": 152119881 }, { "epoch": 0.3362133546421615, "grad_norm": 0.69921875, "learning_rate": 1.350790131388181e-06, "loss": 0.4066, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1683, "tokens_per_second_per_gpu": 19492.49, "total_tokens": 152214663 }, { "epoch": 0.33641312490635766, "grad_norm": 0.71484375, "learning_rate": 1.3425030604238154e-06, "loss": 0.402, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1684, "tokens_per_second_per_gpu": 18423.59, "total_tokens": 152304764 }, { "epoch": 0.33661289517055387, "grad_norm": 0.6875, "learning_rate": 1.3342396587254957e-06, "loss": 0.3637, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1685, "tokens_per_second_per_gpu": 18990.3, "total_tokens": 152397203 }, { "epoch": 0.33681266543475, "grad_norm": 0.68359375, "learning_rate": 1.3259999488850473e-06, "loss": 0.4035, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1686, "tokens_per_second_per_gpu": 18257.77, "total_tokens": 152486314 }, { "epoch": 0.33701243569894623, "grad_norm": 0.66796875, "learning_rate": 1.317783953429528e-06, "loss": 0.3878, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1687, "tokens_per_second_per_gpu": 19580.09, "total_tokens": 152580882 }, { "epoch": 0.3372122059631424, "grad_norm": 0.69140625, "learning_rate": 1.3095916948211452e-06, "loss": 0.3874, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1688, "tokens_per_second_per_gpu": 18631.6, "total_tokens": 152672292 }, { "epoch": 0.33741197622733854, "grad_norm": 0.7421875, "learning_rate": 1.3014231954572287e-06, "loss": 0.394, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1689, "tokens_per_second_per_gpu": 17134.37, "total_tokens": 152757034 }, { "epoch": 0.33761174649153475, "grad_norm": 0.703125, "learning_rate": 1.293278477670139e-06, "loss": 0.3784, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1690, "tokens_per_second_per_gpu": 19050.79, "total_tokens": 152848856 }, { "epoch": 0.3378115167557309, "grad_norm": 0.6875, "learning_rate": 1.2851575637272262e-06, "loss": 0.3472, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1691, "tokens_per_second_per_gpu": 17419.65, "total_tokens": 152933101 }, { "epoch": 0.3380112870199271, "grad_norm": 0.69140625, "learning_rate": 1.2770604758307637e-06, "loss": 0.3866, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1692, "tokens_per_second_per_gpu": 18183.51, "total_tokens": 153021486 }, { "epoch": 0.33821105728412326, "grad_norm": 0.77734375, "learning_rate": 1.26898723611787e-06, "loss": 0.4122, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1693, "tokens_per_second_per_gpu": 19101.09, "total_tokens": 153114184 }, { "epoch": 0.3384108275483194, "grad_norm": 0.72265625, "learning_rate": 1.2609378666604833e-06, "loss": 0.3906, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1694, "tokens_per_second_per_gpu": 18186.36, "total_tokens": 153202571 }, { "epoch": 0.3386105978125156, "grad_norm": 0.6953125, "learning_rate": 1.2529123894652661e-06, "loss": 0.3362, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1695, "tokens_per_second_per_gpu": 17036.92, "total_tokens": 153286443 }, { "epoch": 0.3388103680767118, "grad_norm": 0.69140625, "learning_rate": 1.2449108264735721e-06, "loss": 0.3708, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1696, "tokens_per_second_per_gpu": 18482.26, "total_tokens": 153375287 }, { "epoch": 0.33901013834090793, "grad_norm": 0.6796875, "learning_rate": 1.2369331995613664e-06, "loss": 0.3974, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1697, "tokens_per_second_per_gpu": 19223.82, "total_tokens": 153468172 }, { "epoch": 0.33920990860510414, "grad_norm": 0.68359375, "learning_rate": 1.2289795305391728e-06, "loss": 0.3836, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1698, "tokens_per_second_per_gpu": 19867.48, "total_tokens": 153563523 }, { "epoch": 0.3394096788693003, "grad_norm": 0.6875, "learning_rate": 1.2210498411520256e-06, "loss": 0.3726, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1699, "tokens_per_second_per_gpu": 18136.32, "total_tokens": 153654053 }, { "epoch": 0.3396094491334965, "grad_norm": 0.6875, "learning_rate": 1.2131441530793863e-06, "loss": 0.3874, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1700, "tokens_per_second_per_gpu": 18286.83, "total_tokens": 153744463 }, { "epoch": 0.33980921939769265, "grad_norm": 0.71484375, "learning_rate": 1.2052624879351105e-06, "loss": 0.3862, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1701, "tokens_per_second_per_gpu": 17692.24, "total_tokens": 153831648 }, { "epoch": 0.3400089896618888, "grad_norm": 0.6875, "learning_rate": 1.1974048672673655e-06, "loss": 0.3821, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1702, "tokens_per_second_per_gpu": 19374.94, "total_tokens": 153924311 }, { "epoch": 0.340208759926085, "grad_norm": 0.66796875, "learning_rate": 1.1895713125585851e-06, "loss": 0.4041, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1703, "tokens_per_second_per_gpu": 19480.87, "total_tokens": 154019640 }, { "epoch": 0.34040853019028117, "grad_norm": 0.6953125, "learning_rate": 1.181761845225411e-06, "loss": 0.3949, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1704, "tokens_per_second_per_gpu": 19874.9, "total_tokens": 154113008 }, { "epoch": 0.3406083004544774, "grad_norm": 0.66015625, "learning_rate": 1.1739764866186309e-06, "loss": 0.3931, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1705, "tokens_per_second_per_gpu": 19514.75, "total_tokens": 154207148 }, { "epoch": 0.34080807071867353, "grad_norm": 0.67578125, "learning_rate": 1.1662152580231145e-06, "loss": 0.3558, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1706, "tokens_per_second_per_gpu": 18304.75, "total_tokens": 154295110 }, { "epoch": 0.3410078409828697, "grad_norm": 0.734375, "learning_rate": 1.158478180657766e-06, "loss": 0.3928, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1707, "tokens_per_second_per_gpu": 16992.1, "total_tokens": 154378032 }, { "epoch": 0.3412076112470659, "grad_norm": 0.70703125, "learning_rate": 1.1507652756754573e-06, "loss": 0.388, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1708, "tokens_per_second_per_gpu": 18419.96, "total_tokens": 154468893 }, { "epoch": 0.34140738151126204, "grad_norm": 0.73828125, "learning_rate": 1.143076564162977e-06, "loss": 0.374, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1709, "tokens_per_second_per_gpu": 16587.19, "total_tokens": 154550189 }, { "epoch": 0.3416071517754582, "grad_norm": 0.703125, "learning_rate": 1.135412067140974e-06, "loss": 0.4009, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1710, "tokens_per_second_per_gpu": 18614.65, "total_tokens": 154642228 }, { "epoch": 0.3418069220396544, "grad_norm": 0.70703125, "learning_rate": 1.127771805563882e-06, "loss": 0.3753, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1711, "tokens_per_second_per_gpu": 17894.95, "total_tokens": 154729251 }, { "epoch": 0.34200669230385056, "grad_norm": 0.7265625, "learning_rate": 1.120155800319891e-06, "loss": 0.3629, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1712, "tokens_per_second_per_gpu": 15909.49, "total_tokens": 154807996 }, { "epoch": 0.34220646256804677, "grad_norm": 0.6953125, "learning_rate": 1.112564072230863e-06, "loss": 0.3772, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1713, "tokens_per_second_per_gpu": 17899.38, "total_tokens": 154895414 }, { "epoch": 0.3424062328322429, "grad_norm": 0.7265625, "learning_rate": 1.1049966420522961e-06, "loss": 0.3745, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1714, "tokens_per_second_per_gpu": 17323.67, "total_tokens": 154980925 }, { "epoch": 0.34260600309643907, "grad_norm": 0.66796875, "learning_rate": 1.0974535304732581e-06, "loss": 0.3742, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1715, "tokens_per_second_per_gpu": 18622.09, "total_tokens": 155071967 }, { "epoch": 0.3428057733606353, "grad_norm": 0.6875, "learning_rate": 1.0899347581163222e-06, "loss": 0.3863, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1716, "tokens_per_second_per_gpu": 19394.71, "total_tokens": 155165374 }, { "epoch": 0.34300554362483143, "grad_norm": 0.70703125, "learning_rate": 1.0824403455375287e-06, "loss": 0.3965, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1717, "tokens_per_second_per_gpu": 18893.11, "total_tokens": 155257635 }, { "epoch": 0.34320531388902764, "grad_norm": 0.70703125, "learning_rate": 1.0749703132263122e-06, "loss": 0.3916, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1718, "tokens_per_second_per_gpu": 18913.91, "total_tokens": 155350176 }, { "epoch": 0.3434050841532238, "grad_norm": 0.69140625, "learning_rate": 1.0675246816054585e-06, "loss": 0.3697, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1719, "tokens_per_second_per_gpu": 18772.2, "total_tokens": 155441453 }, { "epoch": 0.34360485441741995, "grad_norm": 0.6796875, "learning_rate": 1.0601034710310431e-06, "loss": 0.4382, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1720, "tokens_per_second_per_gpu": 19958.29, "total_tokens": 155539891 }, { "epoch": 0.34380462468161616, "grad_norm": 0.7109375, "learning_rate": 1.0527067017923654e-06, "loss": 0.3871, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1721, "tokens_per_second_per_gpu": 17940.29, "total_tokens": 155627594 }, { "epoch": 0.3440043949458123, "grad_norm": 0.6796875, "learning_rate": 1.0453343941119153e-06, "loss": 0.3966, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1722, "tokens_per_second_per_gpu": 18538.19, "total_tokens": 155717068 }, { "epoch": 0.3442041652100085, "grad_norm": 0.67578125, "learning_rate": 1.037986568145297e-06, "loss": 0.3898, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1723, "tokens_per_second_per_gpu": 19389.16, "total_tokens": 155810626 }, { "epoch": 0.34440393547420467, "grad_norm": 0.6953125, "learning_rate": 1.0306632439811893e-06, "loss": 0.385, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1724, "tokens_per_second_per_gpu": 18775.98, "total_tokens": 155901764 }, { "epoch": 0.3446037057384008, "grad_norm": 0.69921875, "learning_rate": 1.0233644416412792e-06, "loss": 0.3764, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1725, "tokens_per_second_per_gpu": 17815.37, "total_tokens": 155988666 }, { "epoch": 0.34480347600259703, "grad_norm": 0.70703125, "learning_rate": 1.0160901810802114e-06, "loss": 0.3825, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1726, "tokens_per_second_per_gpu": 17254.65, "total_tokens": 156073261 }, { "epoch": 0.3450032462667932, "grad_norm": 0.703125, "learning_rate": 1.0088404821855414e-06, "loss": 0.3796, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1727, "tokens_per_second_per_gpu": 17234.51, "total_tokens": 156157089 }, { "epoch": 0.34520301653098934, "grad_norm": 0.69921875, "learning_rate": 1.0016153647776638e-06, "loss": 0.3875, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1728, "tokens_per_second_per_gpu": 18063.24, "total_tokens": 156244786 }, { "epoch": 0.34540278679518555, "grad_norm": 0.69921875, "learning_rate": 9.944148486097793e-07, "loss": 0.3699, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1729, "tokens_per_second_per_gpu": 17793.76, "total_tokens": 156332687 }, { "epoch": 0.3456025570593817, "grad_norm": 0.65625, "learning_rate": 9.872389533678207e-07, "loss": 0.3885, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1730, "tokens_per_second_per_gpu": 20503.93, "total_tokens": 156430470 }, { "epoch": 0.3458023273235779, "grad_norm": 0.703125, "learning_rate": 9.800876986704111e-07, "loss": 0.3646, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1731, "tokens_per_second_per_gpu": 16442.28, "total_tokens": 156511832 }, { "epoch": 0.34600209758777406, "grad_norm": 0.69140625, "learning_rate": 9.729611040688102e-07, "loss": 0.4045, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1732, "tokens_per_second_per_gpu": 19834.46, "total_tokens": 156607137 }, { "epoch": 0.3462018678519702, "grad_norm": 0.71484375, "learning_rate": 9.658591890468515e-07, "loss": 0.4021, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1733, "tokens_per_second_per_gpu": 18456.88, "total_tokens": 156697010 }, { "epoch": 0.3464016381161664, "grad_norm": 0.68359375, "learning_rate": 9.587819730209047e-07, "loss": 0.3814, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1734, "tokens_per_second_per_gpu": 17971.9, "total_tokens": 156785270 }, { "epoch": 0.3466014083803626, "grad_norm": 0.69921875, "learning_rate": 9.517294753398066e-07, "loss": 0.3641, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1735, "tokens_per_second_per_gpu": 18041.68, "total_tokens": 156872402 }, { "epoch": 0.3468011786445588, "grad_norm": 0.6953125, "learning_rate": 9.447017152848126e-07, "loss": 0.3953, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1736, "tokens_per_second_per_gpu": 18629.22, "total_tokens": 156963175 }, { "epoch": 0.34700094890875494, "grad_norm": 0.703125, "learning_rate": 9.376987120695547e-07, "loss": 0.3753, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1737, "tokens_per_second_per_gpu": 17348.91, "total_tokens": 157048649 }, { "epoch": 0.3472007191729511, "grad_norm": 0.69140625, "learning_rate": 9.307204848399754e-07, "loss": 0.401, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1738, "tokens_per_second_per_gpu": 20144.21, "total_tokens": 157146345 }, { "epoch": 0.3474004894371473, "grad_norm": 0.71484375, "learning_rate": 9.237670526742793e-07, "loss": 0.3531, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1739, "tokens_per_second_per_gpu": 16542.15, "total_tokens": 157226886 }, { "epoch": 0.34760025970134345, "grad_norm": 0.66796875, "learning_rate": 9.168384345828885e-07, "loss": 0.3654, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1740, "tokens_per_second_per_gpu": 18553.7, "total_tokens": 157318358 }, { "epoch": 0.3478000299655396, "grad_norm": 0.67578125, "learning_rate": 9.09934649508375e-07, "loss": 0.3473, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1741, "tokens_per_second_per_gpu": 17743.0, "total_tokens": 157404764 }, { "epoch": 0.3479998002297358, "grad_norm": 0.71875, "learning_rate": 9.030557163254283e-07, "loss": 0.3765, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1742, "tokens_per_second_per_gpu": 16504.68, "total_tokens": 157486823 }, { "epoch": 0.34819957049393196, "grad_norm": 0.67578125, "learning_rate": 8.96201653840788e-07, "loss": 0.4042, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1743, "tokens_per_second_per_gpu": 19282.34, "total_tokens": 157580449 }, { "epoch": 0.3483993407581282, "grad_norm": 0.72265625, "learning_rate": 8.893724807931969e-07, "loss": 0.3915, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1744, "tokens_per_second_per_gpu": 19005.51, "total_tokens": 157672173 }, { "epoch": 0.3485991110223243, "grad_norm": 0.6875, "learning_rate": 8.825682158533555e-07, "loss": 0.369, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1745, "tokens_per_second_per_gpu": 17255.47, "total_tokens": 157757135 }, { "epoch": 0.3487988812865205, "grad_norm": 0.6875, "learning_rate": 8.757888776238621e-07, "loss": 0.3869, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1746, "tokens_per_second_per_gpu": 19348.89, "total_tokens": 157851655 }, { "epoch": 0.3489986515507167, "grad_norm": 0.69140625, "learning_rate": 8.69034484639173e-07, "loss": 0.4288, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1747, "tokens_per_second_per_gpu": 19563.45, "total_tokens": 157946738 }, { "epoch": 0.34919842181491284, "grad_norm": 0.6875, "learning_rate": 8.623050553655365e-07, "loss": 0.4002, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1748, "tokens_per_second_per_gpu": 18132.08, "total_tokens": 158034825 }, { "epoch": 0.34939819207910905, "grad_norm": 0.6796875, "learning_rate": 8.55600608200956e-07, "loss": 0.3969, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1749, "tokens_per_second_per_gpu": 19761.92, "total_tokens": 158131017 }, { "epoch": 0.3495979623433052, "grad_norm": 0.6953125, "learning_rate": 8.489211614751359e-07, "loss": 0.3819, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1750, "tokens_per_second_per_gpu": 17712.83, "total_tokens": 158218501 }, { "epoch": 0.34979773260750135, "grad_norm": 0.69140625, "learning_rate": 8.42266733449425e-07, "loss": 0.413, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1751, "tokens_per_second_per_gpu": 20591.96, "total_tokens": 158317208 }, { "epoch": 0.34999750287169756, "grad_norm": 0.72265625, "learning_rate": 8.356373423167807e-07, "loss": 0.3678, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1752, "tokens_per_second_per_gpu": 18860.99, "total_tokens": 158408983 }, { "epoch": 0.3501972731358937, "grad_norm": 0.69921875, "learning_rate": 8.290330062017015e-07, "loss": 0.3915, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1753, "tokens_per_second_per_gpu": 18468.1, "total_tokens": 158499292 }, { "epoch": 0.35039704340008987, "grad_norm": 0.69140625, "learning_rate": 8.224537431601886e-07, "loss": 0.4129, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1754, "tokens_per_second_per_gpu": 19755.88, "total_tokens": 158594035 }, { "epoch": 0.3505968136642861, "grad_norm": 0.72265625, "learning_rate": 8.158995711797002e-07, "loss": 0.3863, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1755, "tokens_per_second_per_gpu": 17225.56, "total_tokens": 158678109 }, { "epoch": 0.35079658392848223, "grad_norm": 0.69921875, "learning_rate": 8.093705081790892e-07, "loss": 0.3943, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1756, "tokens_per_second_per_gpu": 17955.52, "total_tokens": 158764744 }, { "epoch": 0.35099635419267844, "grad_norm": 0.6953125, "learning_rate": 8.02866572008566e-07, "loss": 0.4288, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1757, "tokens_per_second_per_gpu": 19918.67, "total_tokens": 158860575 }, { "epoch": 0.3511961244568746, "grad_norm": 0.671875, "learning_rate": 7.963877804496445e-07, "loss": 0.3766, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1758, "tokens_per_second_per_gpu": 19521.95, "total_tokens": 158953334 }, { "epoch": 0.35139589472107075, "grad_norm": 0.6875, "learning_rate": 7.899341512150894e-07, "loss": 0.3586, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1759, "tokens_per_second_per_gpu": 17728.66, "total_tokens": 159039572 }, { "epoch": 0.35159566498526695, "grad_norm": 0.7265625, "learning_rate": 7.835057019488823e-07, "loss": 0.4038, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1760, "tokens_per_second_per_gpu": 19524.09, "total_tokens": 159132884 }, { "epoch": 0.3517954352494631, "grad_norm": 0.69140625, "learning_rate": 7.771024502261526e-07, "loss": 0.3857, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1761, "tokens_per_second_per_gpu": 19028.98, "total_tokens": 159226327 }, { "epoch": 0.3519952055136593, "grad_norm": 0.671875, "learning_rate": 7.7072441355315e-07, "loss": 0.3894, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1762, "tokens_per_second_per_gpu": 19448.27, "total_tokens": 159321164 }, { "epoch": 0.35219497577785547, "grad_norm": 0.68359375, "learning_rate": 7.643716093671827e-07, "loss": 0.3811, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1763, "tokens_per_second_per_gpu": 20145.74, "total_tokens": 159417370 }, { "epoch": 0.3523947460420516, "grad_norm": 0.6953125, "learning_rate": 7.580440550365709e-07, "loss": 0.3862, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1764, "tokens_per_second_per_gpu": 18418.03, "total_tokens": 159508237 }, { "epoch": 0.35259451630624783, "grad_norm": 0.6953125, "learning_rate": 7.517417678606121e-07, "loss": 0.3995, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1765, "tokens_per_second_per_gpu": 19766.01, "total_tokens": 159603135 }, { "epoch": 0.352794286570444, "grad_norm": 0.69921875, "learning_rate": 7.454647650695157e-07, "loss": 0.3657, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1766, "tokens_per_second_per_gpu": 17870.97, "total_tokens": 159689732 }, { "epoch": 0.3529940568346402, "grad_norm": 0.69140625, "learning_rate": 7.392130638243667e-07, "loss": 0.4001, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1767, "tokens_per_second_per_gpu": 19498.96, "total_tokens": 159784001 }, { "epoch": 0.35319382709883634, "grad_norm": 0.68359375, "learning_rate": 7.329866812170805e-07, "loss": 0.4026, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1768, "tokens_per_second_per_gpu": 19301.26, "total_tokens": 159877302 }, { "epoch": 0.3533935973630325, "grad_norm": 0.6953125, "learning_rate": 7.267856342703461e-07, "loss": 0.3829, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1769, "tokens_per_second_per_gpu": 17857.62, "total_tokens": 159963556 }, { "epoch": 0.3535933676272287, "grad_norm": 0.6875, "learning_rate": 7.206099399375921e-07, "loss": 0.4068, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1770, "tokens_per_second_per_gpu": 17644.76, "total_tokens": 160051249 }, { "epoch": 0.35379313789142486, "grad_norm": 0.7109375, "learning_rate": 7.144596151029304e-07, "loss": 0.398, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1771, "tokens_per_second_per_gpu": 18406.51, "total_tokens": 160140948 }, { "epoch": 0.353992908155621, "grad_norm": 0.6875, "learning_rate": 7.083346765811117e-07, "loss": 0.4133, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1772, "tokens_per_second_per_gpu": 20019.71, "total_tokens": 160238392 }, { "epoch": 0.3541926784198172, "grad_norm": 0.671875, "learning_rate": 7.022351411174866e-07, "loss": 0.3991, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1773, "tokens_per_second_per_gpu": 19219.42, "total_tokens": 160332463 }, { "epoch": 0.3543924486840134, "grad_norm": 0.69140625, "learning_rate": 6.961610253879503e-07, "loss": 0.3576, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1774, "tokens_per_second_per_gpu": 17251.64, "total_tokens": 160417905 }, { "epoch": 0.3545922189482096, "grad_norm": 0.6796875, "learning_rate": 6.901123459989068e-07, "loss": 0.4105, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1775, "tokens_per_second_per_gpu": 20819.61, "total_tokens": 160517581 }, { "epoch": 0.35479198921240573, "grad_norm": 0.7421875, "learning_rate": 6.840891194872112e-07, "loss": 0.4044, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1776, "tokens_per_second_per_gpu": 18153.09, "total_tokens": 160605102 }, { "epoch": 0.3549917594766019, "grad_norm": 0.6953125, "learning_rate": 6.780913623201346e-07, "loss": 0.3836, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1777, "tokens_per_second_per_gpu": 18048.27, "total_tokens": 160694063 }, { "epoch": 0.3551915297407981, "grad_norm": 0.69921875, "learning_rate": 6.72119090895319e-07, "loss": 0.3787, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1778, "tokens_per_second_per_gpu": 18091.42, "total_tokens": 160781168 }, { "epoch": 0.35539130000499425, "grad_norm": 0.703125, "learning_rate": 6.661723215407223e-07, "loss": 0.371, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1779, "tokens_per_second_per_gpu": 18160.46, "total_tokens": 160870327 }, { "epoch": 0.35559107026919046, "grad_norm": 0.703125, "learning_rate": 6.602510705145893e-07, "loss": 0.3589, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1780, "tokens_per_second_per_gpu": 17178.27, "total_tokens": 160954404 }, { "epoch": 0.3557908405333866, "grad_norm": 0.6953125, "learning_rate": 6.543553540053926e-07, "loss": 0.4092, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1781, "tokens_per_second_per_gpu": 19472.52, "total_tokens": 161047370 }, { "epoch": 0.35599061079758276, "grad_norm": 0.6796875, "learning_rate": 6.484851881317933e-07, "loss": 0.409, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1782, "tokens_per_second_per_gpu": 19781.79, "total_tokens": 161142310 }, { "epoch": 0.35619038106177897, "grad_norm": 0.6875, "learning_rate": 6.426405889426046e-07, "loss": 0.3925, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1783, "tokens_per_second_per_gpu": 20283.7, "total_tokens": 161239555 }, { "epoch": 0.3563901513259751, "grad_norm": 0.6875, "learning_rate": 6.368215724167337e-07, "loss": 0.4201, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1784, "tokens_per_second_per_gpu": 20387.32, "total_tokens": 161338295 }, { "epoch": 0.3565899215901713, "grad_norm": 0.7109375, "learning_rate": 6.310281544631547e-07, "loss": 0.4021, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1785, "tokens_per_second_per_gpu": 19789.66, "total_tokens": 161434835 }, { "epoch": 0.3567896918543675, "grad_norm": 0.734375, "learning_rate": 6.252603509208466e-07, "loss": 0.4031, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1786, "tokens_per_second_per_gpu": 19592.64, "total_tokens": 161528129 }, { "epoch": 0.35698946211856364, "grad_norm": 0.734375, "learning_rate": 6.195181775587655e-07, "loss": 0.3734, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1787, "tokens_per_second_per_gpu": 16783.28, "total_tokens": 161610746 }, { "epoch": 0.35718923238275985, "grad_norm": 0.7109375, "learning_rate": 6.138016500757948e-07, "loss": 0.3697, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1788, "tokens_per_second_per_gpu": 18655.36, "total_tokens": 161701657 }, { "epoch": 0.357389002646956, "grad_norm": 0.6796875, "learning_rate": 6.081107841007006e-07, "loss": 0.3982, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1789, "tokens_per_second_per_gpu": 18852.02, "total_tokens": 161794146 }, { "epoch": 0.35758877291115215, "grad_norm": 0.69921875, "learning_rate": 6.024455951920949e-07, "loss": 0.3972, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1790, "tokens_per_second_per_gpu": 19723.46, "total_tokens": 161887838 }, { "epoch": 0.35778854317534836, "grad_norm": 0.6640625, "learning_rate": 5.968060988383884e-07, "loss": 0.3651, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1791, "tokens_per_second_per_gpu": 19001.15, "total_tokens": 161979691 }, { "epoch": 0.3579883134395445, "grad_norm": 0.71875, "learning_rate": 5.911923104577455e-07, "loss": 0.3824, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1792, "tokens_per_second_per_gpu": 17818.18, "total_tokens": 162068210 }, { "epoch": 0.3581880837037407, "grad_norm": 0.69140625, "learning_rate": 5.856042453980526e-07, "loss": 0.4157, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1793, "tokens_per_second_per_gpu": 19191.03, "total_tokens": 162160936 }, { "epoch": 0.3583878539679369, "grad_norm": 0.6953125, "learning_rate": 5.800419189368655e-07, "loss": 0.3776, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1794, "tokens_per_second_per_gpu": 18042.46, "total_tokens": 162248710 }, { "epoch": 0.35858762423213303, "grad_norm": 0.6875, "learning_rate": 5.745053462813699e-07, "loss": 0.3834, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1795, "tokens_per_second_per_gpu": 17770.84, "total_tokens": 162336939 }, { "epoch": 0.35878739449632924, "grad_norm": 0.69140625, "learning_rate": 5.689945425683474e-07, "loss": 0.4056, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1796, "tokens_per_second_per_gpu": 17450.28, "total_tokens": 162424365 }, { "epoch": 0.3589871647605254, "grad_norm": 0.6953125, "learning_rate": 5.63509522864123e-07, "loss": 0.398, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1797, "tokens_per_second_per_gpu": 18272.99, "total_tokens": 162513885 }, { "epoch": 0.35918693502472154, "grad_norm": 0.69921875, "learning_rate": 5.580503021645323e-07, "loss": 0.3897, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1798, "tokens_per_second_per_gpu": 18187.29, "total_tokens": 162603284 }, { "epoch": 0.35938670528891775, "grad_norm": 0.71875, "learning_rate": 5.526168953948752e-07, "loss": 0.3886, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1799, "tokens_per_second_per_gpu": 17438.39, "total_tokens": 162688355 }, { "epoch": 0.3595864755531139, "grad_norm": 0.703125, "learning_rate": 5.47209317409878e-07, "loss": 0.3887, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1800, "tokens_per_second_per_gpu": 18507.47, "total_tokens": 162777055 }, { "epoch": 0.3597862458173101, "grad_norm": 0.6953125, "learning_rate": 5.418275829936537e-07, "loss": 0.387, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1801, "tokens_per_second_per_gpu": 18334.22, "total_tokens": 162865312 }, { "epoch": 0.35998601608150627, "grad_norm": 0.68359375, "learning_rate": 5.36471706859657e-07, "loss": 0.4149, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1802, "tokens_per_second_per_gpu": 19449.28, "total_tokens": 162960680 }, { "epoch": 0.3601857863457024, "grad_norm": 0.72265625, "learning_rate": 5.311417036506516e-07, "loss": 0.3531, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1803, "tokens_per_second_per_gpu": 16983.69, "total_tokens": 163043382 }, { "epoch": 0.3603855566098986, "grad_norm": 0.6953125, "learning_rate": 5.258375879386601e-07, "loss": 0.4252, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1804, "tokens_per_second_per_gpu": 18338.64, "total_tokens": 163133373 }, { "epoch": 0.3605853268740948, "grad_norm": 0.67578125, "learning_rate": 5.205593742249326e-07, "loss": 0.4073, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1805, "tokens_per_second_per_gpu": 19802.62, "total_tokens": 163228212 }, { "epoch": 0.360785097138291, "grad_norm": 0.6796875, "learning_rate": 5.15307076939906e-07, "loss": 0.3947, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1806, "tokens_per_second_per_gpu": 19347.48, "total_tokens": 163322776 }, { "epoch": 0.36098486740248714, "grad_norm": 0.703125, "learning_rate": 5.100807104431571e-07, "loss": 0.3987, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1807, "tokens_per_second_per_gpu": 18475.25, "total_tokens": 163414315 }, { "epoch": 0.3611846376666833, "grad_norm": 0.70703125, "learning_rate": 5.048802890233773e-07, "loss": 0.3735, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1808, "tokens_per_second_per_gpu": 17771.92, "total_tokens": 163500361 }, { "epoch": 0.3613844079308795, "grad_norm": 0.78125, "learning_rate": 4.997058268983135e-07, "loss": 0.3604, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1809, "tokens_per_second_per_gpu": 17612.31, "total_tokens": 163585477 }, { "epoch": 0.36158417819507566, "grad_norm": 0.71484375, "learning_rate": 4.945573382147517e-07, "loss": 0.3737, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1810, "tokens_per_second_per_gpu": 17610.41, "total_tokens": 163671372 }, { "epoch": 0.36178394845927186, "grad_norm": 0.69140625, "learning_rate": 4.894348370484648e-07, "loss": 0.3945, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1811, "tokens_per_second_per_gpu": 19305.75, "total_tokens": 163765056 }, { "epoch": 0.361983718723468, "grad_norm": 0.72265625, "learning_rate": 4.84338337404171e-07, "loss": 0.3804, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1812, "tokens_per_second_per_gpu": 16962.26, "total_tokens": 163848646 }, { "epoch": 0.36218348898766417, "grad_norm": 0.67578125, "learning_rate": 4.792678532155115e-07, "loss": 0.3943, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1813, "tokens_per_second_per_gpu": 20623.75, "total_tokens": 163947383 }, { "epoch": 0.3623832592518604, "grad_norm": 0.69140625, "learning_rate": 4.7422339834499065e-07, "loss": 0.394, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1814, "tokens_per_second_per_gpu": 19299.6, "total_tokens": 164040140 }, { "epoch": 0.36258302951605653, "grad_norm": 0.74609375, "learning_rate": 4.692049865839565e-07, "loss": 0.3825, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1815, "tokens_per_second_per_gpu": 17185.35, "total_tokens": 164125318 }, { "epoch": 0.3627827997802527, "grad_norm": 0.77734375, "learning_rate": 4.642126316525586e-07, "loss": 0.3838, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1816, "tokens_per_second_per_gpu": 19100.18, "total_tokens": 164218546 }, { "epoch": 0.3629825700444489, "grad_norm": 1.15625, "learning_rate": 4.592463471997022e-07, "loss": 0.3805, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1817, "tokens_per_second_per_gpu": 19193.72, "total_tokens": 164312483 }, { "epoch": 0.36318234030864505, "grad_norm": 0.68359375, "learning_rate": 4.543061468030208e-07, "loss": 0.3912, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1818, "tokens_per_second_per_gpu": 19092.09, "total_tokens": 164405281 }, { "epoch": 0.36338211057284125, "grad_norm": 0.8828125, "learning_rate": 4.493920439688315e-07, "loss": 0.4037, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1819, "tokens_per_second_per_gpu": 18613.69, "total_tokens": 164497214 }, { "epoch": 0.3635818808370374, "grad_norm": 0.67578125, "learning_rate": 4.4450405213210424e-07, "loss": 0.403, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1820, "tokens_per_second_per_gpu": 19233.73, "total_tokens": 164590864 }, { "epoch": 0.36378165110123356, "grad_norm": 0.70703125, "learning_rate": 4.396421846564236e-07, "loss": 0.4055, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1821, "tokens_per_second_per_gpu": 17606.8, "total_tokens": 164676535 }, { "epoch": 0.36398142136542977, "grad_norm": 0.70703125, "learning_rate": 4.348064548339492e-07, "loss": 0.3881, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1822, "tokens_per_second_per_gpu": 17523.76, "total_tokens": 164762648 }, { "epoch": 0.3641811916296259, "grad_norm": 0.70703125, "learning_rate": 4.299968758853812e-07, "loss": 0.3937, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1823, "tokens_per_second_per_gpu": 19013.26, "total_tokens": 164852796 }, { "epoch": 0.36438096189382213, "grad_norm": 0.69921875, "learning_rate": 4.2521346095992453e-07, "loss": 0.3879, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1824, "tokens_per_second_per_gpu": 19271.76, "total_tokens": 164945648 }, { "epoch": 0.3645807321580183, "grad_norm": 0.671875, "learning_rate": 4.204562231352516e-07, "loss": 0.3823, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1825, "tokens_per_second_per_gpu": 18717.6, "total_tokens": 165036825 }, { "epoch": 0.36478050242221444, "grad_norm": 0.67578125, "learning_rate": 4.1572517541747294e-07, "loss": 0.4179, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1826, "tokens_per_second_per_gpu": 19761.39, "total_tokens": 165132620 }, { "epoch": 0.36498027268641065, "grad_norm": 0.68359375, "learning_rate": 4.1102033074108984e-07, "loss": 0.3821, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1827, "tokens_per_second_per_gpu": 18292.4, "total_tokens": 165222233 }, { "epoch": 0.3651800429506068, "grad_norm": 1.1015625, "learning_rate": 4.0634170196896747e-07, "loss": 0.3889, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1828, "tokens_per_second_per_gpu": 18870.24, "total_tokens": 165313280 }, { "epoch": 0.36537981321480295, "grad_norm": 0.72265625, "learning_rate": 4.016893018922996e-07, "loss": 0.3822, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1829, "tokens_per_second_per_gpu": 17095.19, "total_tokens": 165397519 }, { "epoch": 0.36557958347899916, "grad_norm": 0.6875, "learning_rate": 3.9706314323056936e-07, "loss": 0.4112, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1830, "tokens_per_second_per_gpu": 19884.26, "total_tokens": 165494727 }, { "epoch": 0.3657793537431953, "grad_norm": 0.6953125, "learning_rate": 3.924632386315186e-07, "loss": 0.3724, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1831, "tokens_per_second_per_gpu": 17566.26, "total_tokens": 165580361 }, { "epoch": 0.3659791240073915, "grad_norm": 0.67578125, "learning_rate": 3.878896006711108e-07, "loss": 0.3939, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1832, "tokens_per_second_per_gpu": 20417.86, "total_tokens": 165678569 }, { "epoch": 0.3661788942715877, "grad_norm": 0.6875, "learning_rate": 3.83342241853496e-07, "loss": 0.3738, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1833, "tokens_per_second_per_gpu": 19691.62, "total_tokens": 165771878 }, { "epoch": 0.3663786645357838, "grad_norm": 0.69921875, "learning_rate": 3.788211746109827e-07, "loss": 0.3819, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1834, "tokens_per_second_per_gpu": 18441.73, "total_tokens": 165862064 }, { "epoch": 0.36657843479998004, "grad_norm": 0.69140625, "learning_rate": 3.743264113039924e-07, "loss": 0.3856, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1835, "tokens_per_second_per_gpu": 19244.65, "total_tokens": 165953703 }, { "epoch": 0.3667782050641762, "grad_norm": 0.71875, "learning_rate": 3.698579642210398e-07, "loss": 0.3896, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1836, "tokens_per_second_per_gpu": 16853.5, "total_tokens": 166036374 }, { "epoch": 0.3669779753283724, "grad_norm": 0.703125, "learning_rate": 3.6541584557868604e-07, "loss": 0.3879, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1837, "tokens_per_second_per_gpu": 17244.25, "total_tokens": 166121095 }, { "epoch": 0.36717774559256855, "grad_norm": 0.69140625, "learning_rate": 3.6100006752151416e-07, "loss": 0.3726, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1838, "tokens_per_second_per_gpu": 18064.37, "total_tokens": 166208228 }, { "epoch": 0.3673775158567647, "grad_norm": 0.73046875, "learning_rate": 3.5661064212209494e-07, "loss": 0.3708, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1839, "tokens_per_second_per_gpu": 17875.47, "total_tokens": 166293652 }, { "epoch": 0.3675772861209609, "grad_norm": 0.6875, "learning_rate": 3.522475813809467e-07, "loss": 0.3842, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1840, "tokens_per_second_per_gpu": 18272.44, "total_tokens": 166382002 }, { "epoch": 0.36777705638515706, "grad_norm": 0.7109375, "learning_rate": 3.4791089722651437e-07, "loss": 0.3763, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1841, "tokens_per_second_per_gpu": 17658.02, "total_tokens": 166467236 }, { "epoch": 0.3679768266493532, "grad_norm": 0.703125, "learning_rate": 3.4360060151512276e-07, "loss": 0.414, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1842, "tokens_per_second_per_gpu": 18595.62, "total_tokens": 166557327 }, { "epoch": 0.3681765969135494, "grad_norm": 0.6953125, "learning_rate": 3.393167060309588e-07, "loss": 0.396, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1843, "tokens_per_second_per_gpu": 18781.74, "total_tokens": 166647867 }, { "epoch": 0.3683763671777456, "grad_norm": 0.68359375, "learning_rate": 3.3505922248602827e-07, "loss": 0.3741, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1844, "tokens_per_second_per_gpu": 18527.38, "total_tokens": 166737081 }, { "epoch": 0.3685761374419418, "grad_norm": 0.69921875, "learning_rate": 3.3082816252012927e-07, "loss": 0.3988, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1845, "tokens_per_second_per_gpu": 19061.56, "total_tokens": 166830586 }, { "epoch": 0.36877590770613794, "grad_norm": 0.67578125, "learning_rate": 3.2662353770081755e-07, "loss": 0.3869, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1846, "tokens_per_second_per_gpu": 18702.31, "total_tokens": 166921050 }, { "epoch": 0.3689756779703341, "grad_norm": 0.6875, "learning_rate": 3.2244535952337565e-07, "loss": 0.378, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1847, "tokens_per_second_per_gpu": 18008.17, "total_tokens": 167009206 }, { "epoch": 0.3691754482345303, "grad_norm": 0.6953125, "learning_rate": 3.182936394107838e-07, "loss": 0.3939, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1848, "tokens_per_second_per_gpu": 17846.08, "total_tokens": 167097605 }, { "epoch": 0.36937521849872645, "grad_norm": 0.74609375, "learning_rate": 3.1416838871368925e-07, "loss": 0.3988, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1849, "tokens_per_second_per_gpu": 19220.86, "total_tokens": 167189502 }, { "epoch": 0.36957498876292266, "grad_norm": 0.69921875, "learning_rate": 3.100696187103658e-07, "loss": 0.3888, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1850, "tokens_per_second_per_gpu": 18462.9, "total_tokens": 167279472 }, { "epoch": 0.3697747590271188, "grad_norm": 0.7265625, "learning_rate": 3.059973406066963e-07, "loss": 0.3788, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1851, "tokens_per_second_per_gpu": 17996.23, "total_tokens": 167365049 }, { "epoch": 0.36997452929131497, "grad_norm": 0.69140625, "learning_rate": 3.019515655361327e-07, "loss": 0.366, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1852, "tokens_per_second_per_gpu": 18288.2, "total_tokens": 167455299 }, { "epoch": 0.3701742995555112, "grad_norm": 0.7265625, "learning_rate": 2.9793230455966936e-07, "loss": 0.3645, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1853, "tokens_per_second_per_gpu": 17064.63, "total_tokens": 167538682 }, { "epoch": 0.37037406981970733, "grad_norm": 0.6796875, "learning_rate": 2.9393956866581307e-07, "loss": 0.4124, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1854, "tokens_per_second_per_gpu": 19711.44, "total_tokens": 167632724 }, { "epoch": 0.37057384008390354, "grad_norm": 0.6875, "learning_rate": 2.8997336877055194e-07, "loss": 0.3775, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1855, "tokens_per_second_per_gpu": 18169.54, "total_tokens": 167721916 }, { "epoch": 0.3707736103480997, "grad_norm": 0.96875, "learning_rate": 2.860337157173243e-07, "loss": 0.353, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1856, "tokens_per_second_per_gpu": 17571.96, "total_tokens": 167807716 }, { "epoch": 0.37097338061229584, "grad_norm": 0.703125, "learning_rate": 2.8212062027698995e-07, "loss": 0.3951, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1857, "tokens_per_second_per_gpu": 18691.87, "total_tokens": 167898020 }, { "epoch": 0.37117315087649205, "grad_norm": 0.71875, "learning_rate": 2.7823409314780227e-07, "loss": 0.3884, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1858, "tokens_per_second_per_gpu": 17830.49, "total_tokens": 167984993 }, { "epoch": 0.3713729211406882, "grad_norm": 0.73828125, "learning_rate": 2.7437414495538274e-07, "loss": 0.3941, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1859, "tokens_per_second_per_gpu": 17475.73, "total_tokens": 168069733 }, { "epoch": 0.37157269140488436, "grad_norm": 0.69921875, "learning_rate": 2.705407862526765e-07, "loss": 0.3821, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1860, "tokens_per_second_per_gpu": 18949.63, "total_tokens": 168161284 }, { "epoch": 0.37177246166908057, "grad_norm": 0.7109375, "learning_rate": 2.667340275199426e-07, "loss": 0.3951, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1861, "tokens_per_second_per_gpu": 18918.42, "total_tokens": 168252961 }, { "epoch": 0.3719722319332767, "grad_norm": 0.68359375, "learning_rate": 2.629538791647124e-07, "loss": 0.3812, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1862, "tokens_per_second_per_gpu": 18700.83, "total_tokens": 168344305 }, { "epoch": 0.37217200219747293, "grad_norm": 0.70703125, "learning_rate": 2.592003515217689e-07, "loss": 0.4034, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1863, "tokens_per_second_per_gpu": 19936.93, "total_tokens": 168439380 }, { "epoch": 0.3723717724616691, "grad_norm": 0.72265625, "learning_rate": 2.554734548531157e-07, "loss": 0.366, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1864, "tokens_per_second_per_gpu": 19093.61, "total_tokens": 168530332 }, { "epoch": 0.37257154272586523, "grad_norm": 0.70703125, "learning_rate": 2.5177319934793995e-07, "loss": 0.3854, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1865, "tokens_per_second_per_gpu": 18667.83, "total_tokens": 168621641 }, { "epoch": 0.37277131299006144, "grad_norm": 0.765625, "learning_rate": 2.4809959512260285e-07, "loss": 0.3917, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1866, "tokens_per_second_per_gpu": 20269.71, "total_tokens": 168719533 }, { "epoch": 0.3729710832542576, "grad_norm": 0.71875, "learning_rate": 2.44452652220597e-07, "loss": 0.3901, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1867, "tokens_per_second_per_gpu": 17002.57, "total_tokens": 168803623 }, { "epoch": 0.3731708535184538, "grad_norm": 0.69921875, "learning_rate": 2.4083238061252565e-07, "loss": 0.3979, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1868, "tokens_per_second_per_gpu": 19566.6, "total_tokens": 168899298 }, { "epoch": 0.37337062378264996, "grad_norm": 0.6953125, "learning_rate": 2.3723879019607376e-07, "loss": 0.3948, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1869, "tokens_per_second_per_gpu": 19707.12, "total_tokens": 168993711 }, { "epoch": 0.3735703940468461, "grad_norm": 0.7109375, "learning_rate": 2.3367189079597785e-07, "loss": 0.3665, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1870, "tokens_per_second_per_gpu": 17127.74, "total_tokens": 169077908 }, { "epoch": 0.3737701643110423, "grad_norm": 0.67578125, "learning_rate": 2.3013169216400732e-07, "loss": 0.3933, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1871, "tokens_per_second_per_gpu": 18675.53, "total_tokens": 169169803 }, { "epoch": 0.37396993457523847, "grad_norm": 0.734375, "learning_rate": 2.2661820397892886e-07, "loss": 0.3865, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1872, "tokens_per_second_per_gpu": 16803.35, "total_tokens": 169252424 }, { "epoch": 0.3741697048394346, "grad_norm": 0.72265625, "learning_rate": 2.2313143584648423e-07, "loss": 0.36, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1873, "tokens_per_second_per_gpu": 16908.41, "total_tokens": 169334667 }, { "epoch": 0.37436947510363083, "grad_norm": 0.7265625, "learning_rate": 2.1967139729936693e-07, "loss": 0.3882, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1874, "tokens_per_second_per_gpu": 17549.44, "total_tokens": 169421469 }, { "epoch": 0.374569245367827, "grad_norm": 0.73046875, "learning_rate": 2.1623809779718674e-07, "loss": 0.4237, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1875, "tokens_per_second_per_gpu": 19728.92, "total_tokens": 169516357 }, { "epoch": 0.3747690156320232, "grad_norm": 0.70703125, "learning_rate": 2.1283154672645522e-07, "loss": 0.4213, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1876, "tokens_per_second_per_gpu": 20000.03, "total_tokens": 169612851 }, { "epoch": 0.37496878589621935, "grad_norm": 0.6796875, "learning_rate": 2.0945175340055356e-07, "loss": 0.4039, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1877, "tokens_per_second_per_gpu": 18733.09, "total_tokens": 169705405 }, { "epoch": 0.3751685561604155, "grad_norm": 0.70703125, "learning_rate": 2.0609872705970702e-07, "loss": 0.3849, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1878, "tokens_per_second_per_gpu": 17949.86, "total_tokens": 169792538 }, { "epoch": 0.3753683264246117, "grad_norm": 0.703125, "learning_rate": 2.0277247687096157e-07, "loss": 0.3847, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1879, "tokens_per_second_per_gpu": 18073.29, "total_tokens": 169880309 }, { "epoch": 0.37556809668880786, "grad_norm": 0.69921875, "learning_rate": 1.9947301192815738e-07, "loss": 0.4042, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1880, "tokens_per_second_per_gpu": 18850.28, "total_tokens": 169971380 }, { "epoch": 0.37576786695300407, "grad_norm": 0.7109375, "learning_rate": 1.9620034125190645e-07, "loss": 0.4137, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1881, "tokens_per_second_per_gpu": 19652.37, "total_tokens": 170066071 }, { "epoch": 0.3759676372172002, "grad_norm": 0.69921875, "learning_rate": 1.9295447378956612e-07, "loss": 0.3954, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1882, "tokens_per_second_per_gpu": 19500.74, "total_tokens": 170159968 }, { "epoch": 0.3761674074813964, "grad_norm": 0.6875, "learning_rate": 1.8973541841521336e-07, "loss": 0.4036, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1883, "tokens_per_second_per_gpu": 19564.16, "total_tokens": 170256041 }, { "epoch": 0.3763671777455926, "grad_norm": 0.69921875, "learning_rate": 1.865431839296228e-07, "loss": 0.4103, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1884, "tokens_per_second_per_gpu": 18370.84, "total_tokens": 170346381 }, { "epoch": 0.37656694800978874, "grad_norm": 0.6875, "learning_rate": 1.833777790602398e-07, "loss": 0.4068, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1885, "tokens_per_second_per_gpu": 19355.84, "total_tokens": 170439406 }, { "epoch": 0.3767667182739849, "grad_norm": 0.72265625, "learning_rate": 1.8023921246116405e-07, "loss": 0.3941, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1886, "tokens_per_second_per_gpu": 19559.63, "total_tokens": 170532326 }, { "epoch": 0.3769664885381811, "grad_norm": 0.67578125, "learning_rate": 1.7712749271311392e-07, "loss": 0.409, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1887, "tokens_per_second_per_gpu": 19033.39, "total_tokens": 170624845 }, { "epoch": 0.37716625880237725, "grad_norm": 0.7109375, "learning_rate": 1.7404262832341313e-07, "loss": 0.4308, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1888, "tokens_per_second_per_gpu": 20036.71, "total_tokens": 170722265 }, { "epoch": 0.37736602906657346, "grad_norm": 0.70703125, "learning_rate": 1.7098462772596302e-07, "loss": 0.3767, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1889, "tokens_per_second_per_gpu": 18043.31, "total_tokens": 170809788 }, { "epoch": 0.3775657993307696, "grad_norm": 0.69140625, "learning_rate": 1.679534992812215e-07, "loss": 0.4263, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1890, "tokens_per_second_per_gpu": 19260.37, "total_tokens": 170905377 }, { "epoch": 0.37776556959496577, "grad_norm": 0.70703125, "learning_rate": 1.6494925127617632e-07, "loss": 0.3692, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1891, "tokens_per_second_per_gpu": 16946.28, "total_tokens": 170989714 }, { "epoch": 0.377965339859162, "grad_norm": 0.69140625, "learning_rate": 1.619718919243285e-07, "loss": 0.3958, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1892, "tokens_per_second_per_gpu": 19612.03, "total_tokens": 171084441 }, { "epoch": 0.37816511012335813, "grad_norm": 0.703125, "learning_rate": 1.5902142936566333e-07, "loss": 0.3933, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1893, "tokens_per_second_per_gpu": 18842.93, "total_tokens": 171175227 }, { "epoch": 0.37836488038755434, "grad_norm": 0.72265625, "learning_rate": 1.5609787166663392e-07, "loss": 0.3563, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1894, "tokens_per_second_per_gpu": 16580.86, "total_tokens": 171257029 }, { "epoch": 0.3785646506517505, "grad_norm": 0.69140625, "learning_rate": 1.5320122682013438e-07, "loss": 0.3578, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1895, "tokens_per_second_per_gpu": 19243.43, "total_tokens": 171348305 }, { "epoch": 0.37876442091594664, "grad_norm": 0.703125, "learning_rate": 1.5033150274548325e-07, "loss": 0.3761, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1896, "tokens_per_second_per_gpu": 17106.5, "total_tokens": 171430765 }, { "epoch": 0.37896419118014285, "grad_norm": 0.671875, "learning_rate": 1.474887072883935e-07, "loss": 0.3792, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1897, "tokens_per_second_per_gpu": 19254.11, "total_tokens": 171524178 }, { "epoch": 0.379163961444339, "grad_norm": 0.703125, "learning_rate": 1.446728482209603e-07, "loss": 0.3566, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1898, "tokens_per_second_per_gpu": 17517.2, "total_tokens": 171609983 }, { "epoch": 0.37936373170853516, "grad_norm": 0.6953125, "learning_rate": 1.4188393324163663e-07, "loss": 0.4065, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1899, "tokens_per_second_per_gpu": 18327.44, "total_tokens": 171700246 }, { "epoch": 0.37956350197273137, "grad_norm": 0.6953125, "learning_rate": 1.3912196997520776e-07, "loss": 0.3991, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1900, "tokens_per_second_per_gpu": 18633.18, "total_tokens": 171791308 }, { "epoch": 0.3797632722369275, "grad_norm": 0.7109375, "learning_rate": 1.3638696597277678e-07, "loss": 0.3828, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1901, "tokens_per_second_per_gpu": 17639.71, "total_tokens": 171876402 }, { "epoch": 0.3799630425011237, "grad_norm": 0.7109375, "learning_rate": 1.3367892871173904e-07, "loss": 0.3778, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1902, "tokens_per_second_per_gpu": 18263.68, "total_tokens": 171965799 }, { "epoch": 0.3801628127653199, "grad_norm": 0.70703125, "learning_rate": 1.3099786559576555e-07, "loss": 0.3785, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1903, "tokens_per_second_per_gpu": 17456.44, "total_tokens": 172052045 }, { "epoch": 0.38036258302951603, "grad_norm": 0.71875, "learning_rate": 1.2834378395478187e-07, "loss": 0.4053, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1904, "tokens_per_second_per_gpu": 18229.79, "total_tokens": 172140477 }, { "epoch": 0.38056235329371224, "grad_norm": 0.71875, "learning_rate": 1.2571669104494254e-07, "loss": 0.4104, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1905, "tokens_per_second_per_gpu": 18608.79, "total_tokens": 172230666 }, { "epoch": 0.3807621235579084, "grad_norm": 0.7109375, "learning_rate": 1.231165940486234e-07, "loss": 0.387, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1906, "tokens_per_second_per_gpu": 20217.9, "total_tokens": 172326516 }, { "epoch": 0.3809618938221046, "grad_norm": 0.69921875, "learning_rate": 1.2054350007438708e-07, "loss": 0.3875, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1907, "tokens_per_second_per_gpu": 19060.55, "total_tokens": 172419319 }, { "epoch": 0.38116166408630076, "grad_norm": 0.6796875, "learning_rate": 1.1799741615697524e-07, "loss": 0.3791, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1908, "tokens_per_second_per_gpu": 19059.85, "total_tokens": 172511773 }, { "epoch": 0.3813614343504969, "grad_norm": 0.6875, "learning_rate": 1.154783492572853e-07, "loss": 0.3988, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1909, "tokens_per_second_per_gpu": 18478.34, "total_tokens": 172601910 }, { "epoch": 0.3815612046146931, "grad_norm": 0.6953125, "learning_rate": 1.129863062623482e-07, "loss": 0.398, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1910, "tokens_per_second_per_gpu": 18894.66, "total_tokens": 172693505 }, { "epoch": 0.38176097487888927, "grad_norm": 0.77734375, "learning_rate": 1.1052129398531508e-07, "loss": 0.3409, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1911, "tokens_per_second_per_gpu": 17697.06, "total_tokens": 172779692 }, { "epoch": 0.3819607451430855, "grad_norm": 0.66796875, "learning_rate": 1.0808331916543624e-07, "loss": 0.3709, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1912, "tokens_per_second_per_gpu": 18560.17, "total_tokens": 172870944 }, { "epoch": 0.38216051540728163, "grad_norm": 0.74609375, "learning_rate": 1.0567238846803995e-07, "loss": 0.3821, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1913, "tokens_per_second_per_gpu": 18447.18, "total_tokens": 172961402 }, { "epoch": 0.3823602856714778, "grad_norm": 0.70703125, "learning_rate": 1.0328850848452032e-07, "loss": 0.398, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1914, "tokens_per_second_per_gpu": 19778.66, "total_tokens": 173055926 }, { "epoch": 0.382560055935674, "grad_norm": 0.6953125, "learning_rate": 1.0093168573231393e-07, "loss": 0.3913, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1915, "tokens_per_second_per_gpu": 19386.32, "total_tokens": 173149934 }, { "epoch": 0.38275982619987015, "grad_norm": 0.68359375, "learning_rate": 9.86019266548821e-08, "loss": 0.3809, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1916, "tokens_per_second_per_gpu": 19058.32, "total_tokens": 173239878 }, { "epoch": 0.3829595964640663, "grad_norm": 0.71875, "learning_rate": 9.629923762170091e-08, "loss": 0.3744, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1917, "tokens_per_second_per_gpu": 17145.76, "total_tokens": 173322215 }, { "epoch": 0.3831593667282625, "grad_norm": 0.703125, "learning_rate": 9.402362492823002e-08, "loss": 0.4034, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1918, "tokens_per_second_per_gpu": 18822.7, "total_tokens": 173413622 }, { "epoch": 0.38335913699245866, "grad_norm": 0.71484375, "learning_rate": 9.177509479591174e-08, "loss": 0.3621, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1919, "tokens_per_second_per_gpu": 17323.23, "total_tokens": 173497442 }, { "epoch": 0.38355890725665487, "grad_norm": 1.0390625, "learning_rate": 8.955365337213861e-08, "loss": 0.3902, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1920, "tokens_per_second_per_gpu": 18815.5, "total_tokens": 173587201 }, { "epoch": 0.383758677520851, "grad_norm": 0.703125, "learning_rate": 8.735930673024806e-08, "loss": 0.3648, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1921, "tokens_per_second_per_gpu": 17384.47, "total_tokens": 173671964 }, { "epoch": 0.3839584477850472, "grad_norm": 0.70703125, "learning_rate": 8.519206086950005e-08, "loss": 0.3693, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1922, "tokens_per_second_per_gpu": 17286.21, "total_tokens": 173755944 }, { "epoch": 0.3841582180492434, "grad_norm": 0.69921875, "learning_rate": 8.305192171506049e-08, "loss": 0.3746, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1923, "tokens_per_second_per_gpu": 17744.39, "total_tokens": 173843045 }, { "epoch": 0.38435798831343954, "grad_norm": 0.70703125, "learning_rate": 8.093889511799014e-08, "loss": 0.3661, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1924, "tokens_per_second_per_gpu": 17706.98, "total_tokens": 173929193 }, { "epoch": 0.38455775857763574, "grad_norm": 0.7109375, "learning_rate": 7.885298685522235e-08, "loss": 0.3744, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1925, "tokens_per_second_per_gpu": 19261.13, "total_tokens": 174020664 }, { "epoch": 0.3847575288418319, "grad_norm": 0.703125, "learning_rate": 7.679420262954984e-08, "loss": 0.432, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1926, "tokens_per_second_per_gpu": 19388.32, "total_tokens": 174116243 }, { "epoch": 0.38495729910602805, "grad_norm": 0.70703125, "learning_rate": 7.476254806961014e-08, "loss": 0.3705, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1927, "tokens_per_second_per_gpu": 17298.88, "total_tokens": 174201040 }, { "epoch": 0.38515706937022426, "grad_norm": 0.6875, "learning_rate": 7.275802872987015e-08, "loss": 0.382, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1928, "tokens_per_second_per_gpu": 18849.0, "total_tokens": 174293279 }, { "epoch": 0.3853568396344204, "grad_norm": 0.70703125, "learning_rate": 7.078065009060941e-08, "loss": 0.3939, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1929, "tokens_per_second_per_gpu": 18604.87, "total_tokens": 174382017 }, { "epoch": 0.38555660989861656, "grad_norm": 0.7109375, "learning_rate": 6.883041755790576e-08, "loss": 0.3973, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1930, "tokens_per_second_per_gpu": 17621.06, "total_tokens": 174468551 }, { "epoch": 0.3857563801628128, "grad_norm": 0.6796875, "learning_rate": 6.690733646361858e-08, "loss": 0.4156, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1931, "tokens_per_second_per_gpu": 19937.41, "total_tokens": 174563904 }, { "epoch": 0.3859561504270089, "grad_norm": 0.69140625, "learning_rate": 6.501141206537887e-08, "loss": 0.4124, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1932, "tokens_per_second_per_gpu": 19000.45, "total_tokens": 174656483 }, { "epoch": 0.38615592069120513, "grad_norm": 0.69140625, "learning_rate": 6.314264954657257e-08, "loss": 0.3784, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1933, "tokens_per_second_per_gpu": 19343.2, "total_tokens": 174747367 }, { "epoch": 0.3863556909554013, "grad_norm": 0.66015625, "learning_rate": 6.130105401632502e-08, "loss": 0.3805, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1934, "tokens_per_second_per_gpu": 19624.99, "total_tokens": 174842325 }, { "epoch": 0.38655546121959744, "grad_norm": 0.6875, "learning_rate": 5.948663050948767e-08, "loss": 0.4169, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1935, "tokens_per_second_per_gpu": 19656.08, "total_tokens": 174937517 }, { "epoch": 0.38675523148379365, "grad_norm": 0.66796875, "learning_rate": 5.769938398662356e-08, "loss": 0.413, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1936, "tokens_per_second_per_gpu": 19463.42, "total_tokens": 175034821 }, { "epoch": 0.3869550017479898, "grad_norm": 0.6796875, "learning_rate": 5.5939319333998546e-08, "loss": 0.407, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1937, "tokens_per_second_per_gpu": 20243.23, "total_tokens": 175133339 }, { "epoch": 0.387154772012186, "grad_norm": 0.69921875, "learning_rate": 5.420644136356123e-08, "loss": 0.354, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1938, "tokens_per_second_per_gpu": 16834.51, "total_tokens": 175216404 }, { "epoch": 0.38735454227638216, "grad_norm": 0.71875, "learning_rate": 5.250075481293526e-08, "loss": 0.4174, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1939, "tokens_per_second_per_gpu": 19235.25, "total_tokens": 175309444 }, { "epoch": 0.3875543125405783, "grad_norm": 0.67578125, "learning_rate": 5.0822264345400384e-08, "loss": 0.4168, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1940, "tokens_per_second_per_gpu": 19734.06, "total_tokens": 175405964 }, { "epoch": 0.3877540828047745, "grad_norm": 0.69140625, "learning_rate": 4.9170974549885844e-08, "loss": 0.3843, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1941, "tokens_per_second_per_gpu": 17482.66, "total_tokens": 175493821 }, { "epoch": 0.3879538530689707, "grad_norm": 0.6796875, "learning_rate": 4.754688994095591e-08, "loss": 0.4108, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1942, "tokens_per_second_per_gpu": 19405.5, "total_tokens": 175588089 }, { "epoch": 0.38815362333316683, "grad_norm": 0.69140625, "learning_rate": 4.595001495879547e-08, "loss": 0.3833, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1943, "tokens_per_second_per_gpu": 18914.48, "total_tokens": 175680265 }, { "epoch": 0.38835339359736304, "grad_norm": 0.68359375, "learning_rate": 4.438035396920004e-08, "loss": 0.421, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1944, "tokens_per_second_per_gpu": 20027.02, "total_tokens": 175778526 }, { "epoch": 0.3885531638615592, "grad_norm": 0.6953125, "learning_rate": 4.2837911263562406e-08, "loss": 0.4024, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1945, "tokens_per_second_per_gpu": 17875.83, "total_tokens": 175865471 }, { "epoch": 0.3887529341257554, "grad_norm": 0.73046875, "learning_rate": 4.132269105886155e-08, "loss": 0.3812, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1946, "tokens_per_second_per_gpu": 18687.4, "total_tokens": 175955683 }, { "epoch": 0.38895270438995155, "grad_norm": 0.7109375, "learning_rate": 3.9834697497652673e-08, "loss": 0.4053, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1947, "tokens_per_second_per_gpu": 20347.16, "total_tokens": 176053816 }, { "epoch": 0.3891524746541477, "grad_norm": 0.69140625, "learning_rate": 3.837393464805273e-08, "loss": 0.4113, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1948, "tokens_per_second_per_gpu": 19446.14, "total_tokens": 176146995 }, { "epoch": 0.3893522449183439, "grad_norm": 0.6796875, "learning_rate": 3.694040650373154e-08, "loss": 0.3742, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1949, "tokens_per_second_per_gpu": 17895.97, "total_tokens": 176236147 }, { "epoch": 0.38955201518254007, "grad_norm": 0.68359375, "learning_rate": 3.553411698390075e-08, "loss": 0.3739, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1950, "tokens_per_second_per_gpu": 18088.06, "total_tokens": 176323960 }, { "epoch": 0.3897517854467363, "grad_norm": 0.67578125, "learning_rate": 3.4155069933301535e-08, "loss": 0.4084, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1951, "tokens_per_second_per_gpu": 20068.42, "total_tokens": 176419545 }, { "epoch": 0.38995155571093243, "grad_norm": 0.67578125, "learning_rate": 3.280326912219689e-08, "loss": 0.3705, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1952, "tokens_per_second_per_gpu": 17995.41, "total_tokens": 176506865 }, { "epoch": 0.3901513259751286, "grad_norm": 0.71484375, "learning_rate": 3.147871824635717e-08, "loss": 0.3911, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1953, "tokens_per_second_per_gpu": 18445.65, "total_tokens": 176597052 }, { "epoch": 0.3903510962393248, "grad_norm": 0.70703125, "learning_rate": 3.018142092705567e-08, "loss": 0.398, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1954, "tokens_per_second_per_gpu": 18372.97, "total_tokens": 176686310 }, { "epoch": 0.39055086650352094, "grad_norm": 0.68359375, "learning_rate": 2.8911380711051928e-08, "loss": 0.3939, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1955, "tokens_per_second_per_gpu": 19616.24, "total_tokens": 176780756 }, { "epoch": 0.39075063676771715, "grad_norm": 0.6796875, "learning_rate": 2.766860107058844e-08, "loss": 0.3944, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1956, "tokens_per_second_per_gpu": 18291.31, "total_tokens": 176870763 }, { "epoch": 0.3909504070319133, "grad_norm": 1.6015625, "learning_rate": 2.645308540337843e-08, "loss": 0.4371, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1957, "tokens_per_second_per_gpu": 19597.81, "total_tokens": 176969066 }, { "epoch": 0.39115017729610946, "grad_norm": 0.6796875, "learning_rate": 2.5264837032592527e-08, "loss": 0.4118, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1958, "tokens_per_second_per_gpu": 20354.89, "total_tokens": 177068584 }, { "epoch": 0.39134994756030567, "grad_norm": 0.6640625, "learning_rate": 2.4103859206857648e-08, "loss": 0.4098, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1959, "tokens_per_second_per_gpu": 21004.39, "total_tokens": 177169220 }, { "epoch": 0.3915497178245018, "grad_norm": 0.69921875, "learning_rate": 2.2970155100244807e-08, "loss": 0.3934, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1960, "tokens_per_second_per_gpu": 17898.7, "total_tokens": 177256362 }, { "epoch": 0.391749488088698, "grad_norm": 0.6953125, "learning_rate": 2.1863727812254653e-08, "loss": 0.4051, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1961, "tokens_per_second_per_gpu": 19132.09, "total_tokens": 177348530 }, { "epoch": 0.3919492583528942, "grad_norm": 1.65625, "learning_rate": 2.0784580367818607e-08, "loss": 0.4137, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1962, "tokens_per_second_per_gpu": 19480.33, "total_tokens": 177443192 }, { "epoch": 0.39214902861709033, "grad_norm": 0.734375, "learning_rate": 1.973271571728441e-08, "loss": 0.4071, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1963, "tokens_per_second_per_gpu": 17717.86, "total_tokens": 177530512 }, { "epoch": 0.39234879888128654, "grad_norm": 0.6875, "learning_rate": 1.8708136736409476e-08, "loss": 0.3954, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1964, "tokens_per_second_per_gpu": 18266.5, "total_tokens": 177618854 }, { "epoch": 0.3925485691454827, "grad_norm": 0.68359375, "learning_rate": 1.7710846226355327e-08, "loss": 0.3887, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1965, "tokens_per_second_per_gpu": 19366.23, "total_tokens": 177713212 }, { "epoch": 0.39274833940967885, "grad_norm": 0.6875, "learning_rate": 1.674084691367428e-08, "loss": 0.3998, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1966, "tokens_per_second_per_gpu": 19924.87, "total_tokens": 177809546 }, { "epoch": 0.39294810967387506, "grad_norm": 0.67578125, "learning_rate": 1.5798141450307225e-08, "loss": 0.3863, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1967, "tokens_per_second_per_gpu": 19727.84, "total_tokens": 177904440 }, { "epoch": 0.3931478799380712, "grad_norm": 0.66796875, "learning_rate": 1.4882732413576961e-08, "loss": 0.4184, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1968, "tokens_per_second_per_gpu": 20051.46, "total_tokens": 178002939 }, { "epoch": 0.3933476502022674, "grad_norm": 0.7109375, "learning_rate": 1.3994622306173766e-08, "loss": 0.3973, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1969, "tokens_per_second_per_gpu": 19307.12, "total_tokens": 178095882 }, { "epoch": 0.39354742046646357, "grad_norm": 0.6953125, "learning_rate": 1.3133813556159835e-08, "loss": 0.399, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1970, "tokens_per_second_per_gpu": 18636.67, "total_tokens": 178186265 }, { "epoch": 0.3937471907306597, "grad_norm": 0.671875, "learning_rate": 1.230030851695263e-08, "loss": 0.4102, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1971, "tokens_per_second_per_gpu": 19970.75, "total_tokens": 178284066 }, { "epoch": 0.39394696099485593, "grad_norm": 0.6875, "learning_rate": 1.1494109467321545e-08, "loss": 0.3929, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1972, "tokens_per_second_per_gpu": 18080.21, "total_tokens": 178373059 }, { "epoch": 0.3941467312590521, "grad_norm": 0.6484375, "learning_rate": 1.0715218611384582e-08, "loss": 0.3487, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1973, "tokens_per_second_per_gpu": 18107.46, "total_tokens": 178462577 }, { "epoch": 0.39434650152324824, "grad_norm": 0.70703125, "learning_rate": 9.963638078600567e-09, "loss": 0.3908, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1974, "tokens_per_second_per_gpu": 18851.74, "total_tokens": 178552907 }, { "epoch": 0.39454627178744445, "grad_norm": 0.6953125, "learning_rate": 9.23936992376251e-09, "loss": 0.4106, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1975, "tokens_per_second_per_gpu": 18813.45, "total_tokens": 178647475 }, { "epoch": 0.3947460420516406, "grad_norm": 0.69140625, "learning_rate": 8.542416126989805e-09, "loss": 0.39, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1976, "tokens_per_second_per_gpu": 18072.03, "total_tokens": 178734580 }, { "epoch": 0.3949458123158368, "grad_norm": 0.66796875, "learning_rate": 7.872778593728258e-09, "loss": 0.3751, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1977, "tokens_per_second_per_gpu": 17771.57, "total_tokens": 178822026 }, { "epoch": 0.39514558258003296, "grad_norm": 0.6796875, "learning_rate": 7.230459154742298e-09, "loss": 0.3885, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1978, "tokens_per_second_per_gpu": 19663.45, "total_tokens": 178916775 }, { "epoch": 0.3953453528442291, "grad_norm": 0.67578125, "learning_rate": 6.615459566108318e-09, "loss": 0.38, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1979, "tokens_per_second_per_gpu": 18458.06, "total_tokens": 179008067 }, { "epoch": 0.3955451231084253, "grad_norm": 0.71875, "learning_rate": 6.02778150921024e-09, "loss": 0.376, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1980, "tokens_per_second_per_gpu": 17789.7, "total_tokens": 179094215 }, { "epoch": 0.3957448933726215, "grad_norm": 0.69140625, "learning_rate": 5.467426590739511e-09, "loss": 0.4055, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1981, "tokens_per_second_per_gpu": 18779.17, "total_tokens": 179186628 }, { "epoch": 0.3959446636368177, "grad_norm": 0.72265625, "learning_rate": 4.9343963426840006e-09, "loss": 0.3634, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1982, "tokens_per_second_per_gpu": 16630.51, "total_tokens": 179268560 }, { "epoch": 0.39614443390101384, "grad_norm": 0.69140625, "learning_rate": 4.428692222329112e-09, "loss": 0.3858, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1983, "tokens_per_second_per_gpu": 17749.38, "total_tokens": 179354760 }, { "epoch": 0.39634420416521, "grad_norm": 0.69140625, "learning_rate": 3.950315612248901e-09, "loss": 0.396, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1984, "tokens_per_second_per_gpu": 19222.54, "total_tokens": 179448168 }, { "epoch": 0.3965439744294062, "grad_norm": 0.70703125, "learning_rate": 3.499267820307184e-09, "loss": 0.3989, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1985, "tokens_per_second_per_gpu": 18562.21, "total_tokens": 179537487 }, { "epoch": 0.39674374469360235, "grad_norm": 0.7109375, "learning_rate": 3.0755500796531e-09, "loss": 0.3889, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1986, "tokens_per_second_per_gpu": 19360.04, "total_tokens": 179631266 }, { "epoch": 0.3969435149577985, "grad_norm": 0.703125, "learning_rate": 2.679163548712227e-09, "loss": 0.4044, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1987, "tokens_per_second_per_gpu": 18921.43, "total_tokens": 179723006 }, { "epoch": 0.3971432852219947, "grad_norm": 0.703125, "learning_rate": 2.3101093111921323e-09, "loss": 0.3852, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1988, "tokens_per_second_per_gpu": 17377.98, "total_tokens": 179808368 }, { "epoch": 0.39734305548619087, "grad_norm": 0.73828125, "learning_rate": 1.9683883760723834e-09, "loss": 0.3744, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1989, "tokens_per_second_per_gpu": 16488.2, "total_tokens": 179890457 }, { "epoch": 0.3975428257503871, "grad_norm": 0.75390625, "learning_rate": 1.6540016776045442e-09, "loss": 0.3863, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1990, "tokens_per_second_per_gpu": 19005.78, "total_tokens": 179982811 }, { "epoch": 0.3977425960145832, "grad_norm": 0.6875, "learning_rate": 1.3669500753099586e-09, "loss": 0.3486, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1991, "tokens_per_second_per_gpu": 18440.46, "total_tokens": 180071820 }, { "epoch": 0.3979423662787794, "grad_norm": 0.734375, "learning_rate": 1.1072343539775266e-09, "loss": 0.3857, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1992, "tokens_per_second_per_gpu": 17896.25, "total_tokens": 180158607 }, { "epoch": 0.3981421365429756, "grad_norm": 0.6875, "learning_rate": 8.748552236603758e-10, "loss": 0.3956, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1993, "tokens_per_second_per_gpu": 18176.41, "total_tokens": 180247388 }, { "epoch": 0.39834190680717174, "grad_norm": 0.67578125, "learning_rate": 6.698133196725298e-10, "loss": 0.4143, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1994, "tokens_per_second_per_gpu": 20961.08, "total_tokens": 180348547 }, { "epoch": 0.39854167707136795, "grad_norm": 0.70703125, "learning_rate": 4.921092025911289e-10, "loss": 0.386, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1995, "tokens_per_second_per_gpu": 18703.8, "total_tokens": 180439985 }, { "epoch": 0.3987414473355641, "grad_norm": 0.70703125, "learning_rate": 3.4174335825420955e-10, "loss": 0.3569, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1996, "tokens_per_second_per_gpu": 17405.72, "total_tokens": 180523703 }, { "epoch": 0.39894121759976026, "grad_norm": 0.7265625, "learning_rate": 2.1871619775404308e-10, "loss": 0.3989, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1997, "tokens_per_second_per_gpu": 18004.88, "total_tokens": 180611805 }, { "epoch": 0.39914098786395646, "grad_norm": 0.6796875, "learning_rate": 1.2302805744268674e-10, "loss": 0.4109, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1998, "tokens_per_second_per_gpu": 19842.41, "total_tokens": 180708918 }, { "epoch": 0.3993407581281526, "grad_norm": 0.7109375, "learning_rate": 5.467919892865326e-11, "loss": 0.3736, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 1999, "tokens_per_second_per_gpu": 18293.3, "total_tokens": 180797281 }, { "epoch": 0.3995405283923488, "grad_norm": 0.69921875, "learning_rate": 1.366980907580029e-11, "loss": 0.3977, "memory/device_reserved (GiB)": 101.87, "memory/max_active (GiB)": 91.58, "memory/max_allocated (GiB)": 91.58, "step": 2000, "tokens_per_second_per_gpu": 17910.55, "total_tokens": 180885523 } ], "logging_steps": 1, "max_steps": 2000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 5.714305740189991e+18, "train_batch_size": 8, "trial_name": null, "trial_params": null }