Download last-checkpoint/trainer_state.json from error577/f5db44ad-d379-454a-b09a-52fffe7eff1b: direct link, hf CLI and curl.
- Browser
- Download file 283 kB
-
https://huggingface.co/error577/f5db44ad-d379-454a-b09a-52fffe7eff1b/resolve/87fb642b8c3ec375150b5da0ffe38619b2f4a583/last-checkpoint/trainer_state.json
- Command line
-
hf download hf://error577/f5db44ad-d379-454a-b09a-52fffe7eff1b@87fb642b8c3ec375150b5da0ffe38619b2f4a583/last-checkpoint/trainer_state.json
-
curl -L -o trainer_state.json https://huggingface.co/error577/f5db44ad-d379-454a-b09a-52fffe7eff1b/resolve/87fb642b8c3ec375150b5da0ffe38619b2f4a583/last-checkpoint/trainer_state.json
283 kB
| { | |
| "best_global_step": 1600, | |
| "best_metric": 0.0074059851467609406, | |
| "best_model_checkpoint": "miner_id_24/checkpoint-1600", | |
| "epoch": 0.3352364988738149, | |
| "eval_steps": 200, | |
| "global_step": 1600, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.0002095228117961343, | |
| "grad_norm": 6.6040472984313965, | |
| "learning_rate": 2.0000000000000003e-06, | |
| "loss": 12.5068, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 0.0002095228117961343, | |
| "eval_loss": 12.532599449157715, | |
| "eval_runtime": 89.0598, | |
| "eval_samples_per_second": 8.623, | |
| "eval_steps_per_second": 4.312, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 0.0004190456235922686, | |
| "grad_norm": 10.516180038452148, | |
| "learning_rate": 4.000000000000001e-06, | |
| "loss": 12.4956, | |
| "step": 2 | |
| }, | |
| { | |
| "epoch": 0.0006285684353884029, | |
| "grad_norm": 5.9784955978393555, | |
| "learning_rate": 6e-06, | |
| "loss": 12.4652, | |
| "step": 3 | |
| }, | |
| { | |
| "epoch": 0.0008380912471845372, | |
| "grad_norm": 4.773026943206787, | |
| "learning_rate": 8.000000000000001e-06, | |
| "loss": 12.5635, | |
| "step": 4 | |
| }, | |
| { | |
| "epoch": 0.0010476140589806716, | |
| "grad_norm": 4.345443248748779, | |
| "learning_rate": 1e-05, | |
| "loss": 12.4502, | |
| "step": 5 | |
| }, | |
| { | |
| "epoch": 0.0012571368707768058, | |
| "grad_norm": 7.477049350738525, | |
| "learning_rate": 1.2e-05, | |
| "loss": 12.5031, | |
| "step": 6 | |
| }, | |
| { | |
| "epoch": 0.0014666596825729402, | |
| "grad_norm": 6.29019832611084, | |
| "learning_rate": 1.4000000000000001e-05, | |
| "loss": 12.5355, | |
| "step": 7 | |
| }, | |
| { | |
| "epoch": 0.0016761824943690743, | |
| "grad_norm": 7.278188228607178, | |
| "learning_rate": 1.6000000000000003e-05, | |
| "loss": 12.382, | |
| "step": 8 | |
| }, | |
| { | |
| "epoch": 0.0018857053061652087, | |
| "grad_norm": 11.482406616210938, | |
| "learning_rate": 1.8e-05, | |
| "loss": 12.224, | |
| "step": 9 | |
| }, | |
| { | |
| "epoch": 0.002095228117961343, | |
| "grad_norm": 76.79756927490234, | |
| "learning_rate": 2e-05, | |
| "loss": 12.1469, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.0023047509297574775, | |
| "grad_norm": 3.686225414276123, | |
| "learning_rate": 2.2000000000000003e-05, | |
| "loss": 12.0783, | |
| "step": 11 | |
| }, | |
| { | |
| "epoch": 0.0025142737415536115, | |
| "grad_norm": 6.081927299499512, | |
| "learning_rate": 2.4e-05, | |
| "loss": 11.9893, | |
| "step": 12 | |
| }, | |
| { | |
| "epoch": 0.002723796553349746, | |
| "grad_norm": 3.427201747894287, | |
| "learning_rate": 2.6000000000000002e-05, | |
| "loss": 11.9078, | |
| "step": 13 | |
| }, | |
| { | |
| "epoch": 0.0029333193651458803, | |
| "grad_norm": 16.03325080871582, | |
| "learning_rate": 2.8000000000000003e-05, | |
| "loss": 11.8939, | |
| "step": 14 | |
| }, | |
| { | |
| "epoch": 0.0031428421769420147, | |
| "grad_norm": 4.581820487976074, | |
| "learning_rate": 3e-05, | |
| "loss": 11.8592, | |
| "step": 15 | |
| }, | |
| { | |
| "epoch": 0.0033523649887381487, | |
| "grad_norm": 6.6432342529296875, | |
| "learning_rate": 3.2000000000000005e-05, | |
| "loss": 11.8373, | |
| "step": 16 | |
| }, | |
| { | |
| "epoch": 0.003561887800534283, | |
| "grad_norm": 61.577571868896484, | |
| "learning_rate": 3.4000000000000007e-05, | |
| "loss": 11.7898, | |
| "step": 17 | |
| }, | |
| { | |
| "epoch": 0.0037714106123304175, | |
| "grad_norm": 9.466367721557617, | |
| "learning_rate": 3.6e-05, | |
| "loss": 11.7693, | |
| "step": 18 | |
| }, | |
| { | |
| "epoch": 0.0039809334241265515, | |
| "grad_norm": 1.1112542152404785, | |
| "learning_rate": 3.8e-05, | |
| "loss": 11.7571, | |
| "step": 19 | |
| }, | |
| { | |
| "epoch": 0.004190456235922686, | |
| "grad_norm": 1.6447243690490723, | |
| "learning_rate": 4e-05, | |
| "loss": 11.7253, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.00439997904771882, | |
| "grad_norm": 14.649271965026855, | |
| "learning_rate": 4.2e-05, | |
| "loss": 11.7103, | |
| "step": 21 | |
| }, | |
| { | |
| "epoch": 0.004609501859514955, | |
| "grad_norm": 1.7011709213256836, | |
| "learning_rate": 4.4000000000000006e-05, | |
| "loss": 11.6808, | |
| "step": 22 | |
| }, | |
| { | |
| "epoch": 0.004819024671311089, | |
| "grad_norm": 3.6001105308532715, | |
| "learning_rate": 4.600000000000001e-05, | |
| "loss": 11.631, | |
| "step": 23 | |
| }, | |
| { | |
| "epoch": 0.005028547483107223, | |
| "grad_norm": 12.185075759887695, | |
| "learning_rate": 4.8e-05, | |
| "loss": 11.5698, | |
| "step": 24 | |
| }, | |
| { | |
| "epoch": 0.005238070294903358, | |
| "grad_norm": 5.6634955406188965, | |
| "learning_rate": 5e-05, | |
| "loss": 11.4747, | |
| "step": 25 | |
| }, | |
| { | |
| "epoch": 0.005447593106699492, | |
| "grad_norm": 3.705836057662964, | |
| "learning_rate": 5.2000000000000004e-05, | |
| "loss": 11.5002, | |
| "step": 26 | |
| }, | |
| { | |
| "epoch": 0.005657115918495626, | |
| "grad_norm": 66.66976928710938, | |
| "learning_rate": 5.4000000000000005e-05, | |
| "loss": 11.3843, | |
| "step": 27 | |
| }, | |
| { | |
| "epoch": 0.005866638730291761, | |
| "grad_norm": 4.706162452697754, | |
| "learning_rate": 5.6000000000000006e-05, | |
| "loss": 11.209, | |
| "step": 28 | |
| }, | |
| { | |
| "epoch": 0.006076161542087895, | |
| "grad_norm": 4.608543872833252, | |
| "learning_rate": 5.8e-05, | |
| "loss": 11.0922, | |
| "step": 29 | |
| }, | |
| { | |
| "epoch": 0.0062856843538840294, | |
| "grad_norm": 21.13187599182129, | |
| "learning_rate": 6e-05, | |
| "loss": 10.78, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.006495207165680163, | |
| "grad_norm": 5.859175682067871, | |
| "learning_rate": 6.2e-05, | |
| "loss": 10.3626, | |
| "step": 31 | |
| }, | |
| { | |
| "epoch": 0.006704729977476297, | |
| "grad_norm": 10.68819808959961, | |
| "learning_rate": 6.400000000000001e-05, | |
| "loss": 10.3803, | |
| "step": 32 | |
| }, | |
| { | |
| "epoch": 0.006914252789272432, | |
| "grad_norm": 4.8769941329956055, | |
| "learning_rate": 6.6e-05, | |
| "loss": 10.0995, | |
| "step": 33 | |
| }, | |
| { | |
| "epoch": 0.007123775601068566, | |
| "grad_norm": 6.648291110992432, | |
| "learning_rate": 6.800000000000001e-05, | |
| "loss": 9.928, | |
| "step": 34 | |
| }, | |
| { | |
| "epoch": 0.007333298412864701, | |
| "grad_norm": 50.16209411621094, | |
| "learning_rate": 7e-05, | |
| "loss": 9.8941, | |
| "step": 35 | |
| }, | |
| { | |
| "epoch": 0.007542821224660835, | |
| "grad_norm": 6.54470682144165, | |
| "learning_rate": 7.2e-05, | |
| "loss": 9.8453, | |
| "step": 36 | |
| }, | |
| { | |
| "epoch": 0.007752344036456969, | |
| "grad_norm": 8.670441627502441, | |
| "learning_rate": 7.4e-05, | |
| "loss": 9.5793, | |
| "step": 37 | |
| }, | |
| { | |
| "epoch": 0.007961866848253103, | |
| "grad_norm": 123.02629852294922, | |
| "learning_rate": 7.6e-05, | |
| "loss": 9.3425, | |
| "step": 38 | |
| }, | |
| { | |
| "epoch": 0.008171389660049239, | |
| "grad_norm": 14.480856895446777, | |
| "learning_rate": 7.800000000000001e-05, | |
| "loss": 9.3416, | |
| "step": 39 | |
| }, | |
| { | |
| "epoch": 0.008380912471845373, | |
| "grad_norm": 21.085674285888672, | |
| "learning_rate": 8e-05, | |
| "loss": 9.0526, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.008590435283641507, | |
| "grad_norm": 19.711458206176758, | |
| "learning_rate": 8.2e-05, | |
| "loss": 9.0394, | |
| "step": 41 | |
| }, | |
| { | |
| "epoch": 0.00879995809543764, | |
| "grad_norm": 4.5215630531311035, | |
| "learning_rate": 8.4e-05, | |
| "loss": 8.7826, | |
| "step": 42 | |
| }, | |
| { | |
| "epoch": 0.009009480907233774, | |
| "grad_norm": 21.183956146240234, | |
| "learning_rate": 8.6e-05, | |
| "loss": 8.6163, | |
| "step": 43 | |
| }, | |
| { | |
| "epoch": 0.00921900371902991, | |
| "grad_norm": 39.6319465637207, | |
| "learning_rate": 8.800000000000001e-05, | |
| "loss": 8.6326, | |
| "step": 44 | |
| }, | |
| { | |
| "epoch": 0.009428526530826044, | |
| "grad_norm": 13.957026481628418, | |
| "learning_rate": 9e-05, | |
| "loss": 8.8564, | |
| "step": 45 | |
| }, | |
| { | |
| "epoch": 0.009638049342622178, | |
| "grad_norm": 35.4068489074707, | |
| "learning_rate": 9.200000000000001e-05, | |
| "loss": 8.5426, | |
| "step": 46 | |
| }, | |
| { | |
| "epoch": 0.009847572154418312, | |
| "grad_norm": 8.321797370910645, | |
| "learning_rate": 9.4e-05, | |
| "loss": 8.4767, | |
| "step": 47 | |
| }, | |
| { | |
| "epoch": 0.010057094966214446, | |
| "grad_norm": 49.62624740600586, | |
| "learning_rate": 9.6e-05, | |
| "loss": 8.2416, | |
| "step": 48 | |
| }, | |
| { | |
| "epoch": 0.010266617778010582, | |
| "grad_norm": 62.95499038696289, | |
| "learning_rate": 9.8e-05, | |
| "loss": 7.942, | |
| "step": 49 | |
| }, | |
| { | |
| "epoch": 0.010476140589806716, | |
| "grad_norm": 38.04218292236328, | |
| "learning_rate": 0.0001, | |
| "loss": 7.7725, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.01068566340160285, | |
| "grad_norm": 12.888092994689941, | |
| "learning_rate": 0.00010200000000000001, | |
| "loss": 8.1733, | |
| "step": 51 | |
| }, | |
| { | |
| "epoch": 0.010895186213398984, | |
| "grad_norm": 8.064024925231934, | |
| "learning_rate": 0.00010400000000000001, | |
| "loss": 7.6733, | |
| "step": 52 | |
| }, | |
| { | |
| "epoch": 0.011104709025195118, | |
| "grad_norm": 37.64444351196289, | |
| "learning_rate": 0.00010600000000000002, | |
| "loss": 6.8757, | |
| "step": 53 | |
| }, | |
| { | |
| "epoch": 0.011314231836991252, | |
| "grad_norm": 12.460424423217773, | |
| "learning_rate": 0.00010800000000000001, | |
| "loss": 6.8061, | |
| "step": 54 | |
| }, | |
| { | |
| "epoch": 0.011523754648787387, | |
| "grad_norm": 4.761670112609863, | |
| "learning_rate": 0.00011000000000000002, | |
| "loss": 6.3257, | |
| "step": 55 | |
| }, | |
| { | |
| "epoch": 0.011733277460583521, | |
| "grad_norm": 10.131464958190918, | |
| "learning_rate": 0.00011200000000000001, | |
| "loss": 6.1174, | |
| "step": 56 | |
| }, | |
| { | |
| "epoch": 0.011942800272379655, | |
| "grad_norm": 4.439296722412109, | |
| "learning_rate": 0.00011399999999999999, | |
| "loss": 6.1032, | |
| "step": 57 | |
| }, | |
| { | |
| "epoch": 0.01215232308417579, | |
| "grad_norm": 102.8046875, | |
| "learning_rate": 0.000116, | |
| "loss": 5.5948, | |
| "step": 58 | |
| }, | |
| { | |
| "epoch": 0.012361845895971923, | |
| "grad_norm": 9.46191692352295, | |
| "learning_rate": 0.000118, | |
| "loss": 5.7645, | |
| "step": 59 | |
| }, | |
| { | |
| "epoch": 0.012571368707768059, | |
| "grad_norm": 10.870979309082031, | |
| "learning_rate": 0.00012, | |
| "loss": 5.0875, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.012780891519564193, | |
| "grad_norm": 23.203157424926758, | |
| "learning_rate": 0.000122, | |
| "loss": 5.6791, | |
| "step": 61 | |
| }, | |
| { | |
| "epoch": 0.012990414331360327, | |
| "grad_norm": 4.249388217926025, | |
| "learning_rate": 0.000124, | |
| "loss": 5.1933, | |
| "step": 62 | |
| }, | |
| { | |
| "epoch": 0.01319993714315646, | |
| "grad_norm": 19.030372619628906, | |
| "learning_rate": 0.000126, | |
| "loss": 4.7766, | |
| "step": 63 | |
| }, | |
| { | |
| "epoch": 0.013409459954952595, | |
| "grad_norm": 4.8991217613220215, | |
| "learning_rate": 0.00012800000000000002, | |
| "loss": 3.941, | |
| "step": 64 | |
| }, | |
| { | |
| "epoch": 0.01361898276674873, | |
| "grad_norm": 6.8061933517456055, | |
| "learning_rate": 0.00013000000000000002, | |
| "loss": 3.8998, | |
| "step": 65 | |
| }, | |
| { | |
| "epoch": 0.013828505578544864, | |
| "grad_norm": 4.572474002838135, | |
| "learning_rate": 0.000132, | |
| "loss": 3.7389, | |
| "step": 66 | |
| }, | |
| { | |
| "epoch": 0.014038028390340998, | |
| "grad_norm": 5.179816246032715, | |
| "learning_rate": 0.000134, | |
| "loss": 3.5838, | |
| "step": 67 | |
| }, | |
| { | |
| "epoch": 0.014247551202137132, | |
| "grad_norm": 4.74563455581665, | |
| "learning_rate": 0.00013600000000000003, | |
| "loss": 3.4106, | |
| "step": 68 | |
| }, | |
| { | |
| "epoch": 0.014457074013933266, | |
| "grad_norm": 3.925071954727173, | |
| "learning_rate": 0.000138, | |
| "loss": 3.4364, | |
| "step": 69 | |
| }, | |
| { | |
| "epoch": 0.014666596825729402, | |
| "grad_norm": 3.9857025146484375, | |
| "learning_rate": 0.00014, | |
| "loss": 2.8864, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.014876119637525536, | |
| "grad_norm": 3.004260778427124, | |
| "learning_rate": 0.000142, | |
| "loss": 3.3081, | |
| "step": 71 | |
| }, | |
| { | |
| "epoch": 0.01508564244932167, | |
| "grad_norm": 3.27565598487854, | |
| "learning_rate": 0.000144, | |
| "loss": 3.302, | |
| "step": 72 | |
| }, | |
| { | |
| "epoch": 0.015295165261117804, | |
| "grad_norm": 3.430575132369995, | |
| "learning_rate": 0.000146, | |
| "loss": 2.8037, | |
| "step": 73 | |
| }, | |
| { | |
| "epoch": 0.015504688072913938, | |
| "grad_norm": 3.178133964538574, | |
| "learning_rate": 0.000148, | |
| "loss": 2.5663, | |
| "step": 74 | |
| }, | |
| { | |
| "epoch": 0.015714210884710072, | |
| "grad_norm": 2.6925830841064453, | |
| "learning_rate": 0.00015000000000000001, | |
| "loss": 2.0117, | |
| "step": 75 | |
| }, | |
| { | |
| "epoch": 0.015923733696506206, | |
| "grad_norm": 3.363239049911499, | |
| "learning_rate": 0.000152, | |
| "loss": 2.235, | |
| "step": 76 | |
| }, | |
| { | |
| "epoch": 0.01613325650830234, | |
| "grad_norm": 3.3394203186035156, | |
| "learning_rate": 0.000154, | |
| "loss": 1.8811, | |
| "step": 77 | |
| }, | |
| { | |
| "epoch": 0.016342779320098477, | |
| "grad_norm": 2.964437484741211, | |
| "learning_rate": 0.00015600000000000002, | |
| "loss": 2.1085, | |
| "step": 78 | |
| }, | |
| { | |
| "epoch": 0.01655230213189461, | |
| "grad_norm": 5.256375789642334, | |
| "learning_rate": 0.00015800000000000002, | |
| "loss": 2.2984, | |
| "step": 79 | |
| }, | |
| { | |
| "epoch": 0.016761824943690745, | |
| "grad_norm": 4.152324199676514, | |
| "learning_rate": 0.00016, | |
| "loss": 1.754, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.01697134775548688, | |
| "grad_norm": 2.9110007286071777, | |
| "learning_rate": 0.000162, | |
| "loss": 1.9343, | |
| "step": 81 | |
| }, | |
| { | |
| "epoch": 0.017180870567283013, | |
| "grad_norm": 3.011155605316162, | |
| "learning_rate": 0.000164, | |
| "loss": 1.7661, | |
| "step": 82 | |
| }, | |
| { | |
| "epoch": 0.017390393379079147, | |
| "grad_norm": 2.766448736190796, | |
| "learning_rate": 0.000166, | |
| "loss": 1.6191, | |
| "step": 83 | |
| }, | |
| { | |
| "epoch": 0.01759991619087528, | |
| "grad_norm": 2.8244659900665283, | |
| "learning_rate": 0.000168, | |
| "loss": 1.2594, | |
| "step": 84 | |
| }, | |
| { | |
| "epoch": 0.017809439002671415, | |
| "grad_norm": 3.7324302196502686, | |
| "learning_rate": 0.00017, | |
| "loss": 1.9778, | |
| "step": 85 | |
| }, | |
| { | |
| "epoch": 0.01801896181446755, | |
| "grad_norm": 4.044966220855713, | |
| "learning_rate": 0.000172, | |
| "loss": 1.8828, | |
| "step": 86 | |
| }, | |
| { | |
| "epoch": 0.018228484626263683, | |
| "grad_norm": 3.119807481765747, | |
| "learning_rate": 0.000174, | |
| "loss": 1.5972, | |
| "step": 87 | |
| }, | |
| { | |
| "epoch": 0.01843800743805982, | |
| "grad_norm": 2.9005658626556396, | |
| "learning_rate": 0.00017600000000000002, | |
| "loss": 1.2696, | |
| "step": 88 | |
| }, | |
| { | |
| "epoch": 0.018647530249855954, | |
| "grad_norm": 2.5967376232147217, | |
| "learning_rate": 0.00017800000000000002, | |
| "loss": 1.7584, | |
| "step": 89 | |
| }, | |
| { | |
| "epoch": 0.01885705306165209, | |
| "grad_norm": 2.364287853240967, | |
| "learning_rate": 0.00018, | |
| "loss": 1.2882, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.019066575873448222, | |
| "grad_norm": 3.401552438735962, | |
| "learning_rate": 0.000182, | |
| "loss": 1.184, | |
| "step": 91 | |
| }, | |
| { | |
| "epoch": 0.019276098685244356, | |
| "grad_norm": 3.9743735790252686, | |
| "learning_rate": 0.00018400000000000003, | |
| "loss": 1.431, | |
| "step": 92 | |
| }, | |
| { | |
| "epoch": 0.01948562149704049, | |
| "grad_norm": 3.0031299591064453, | |
| "learning_rate": 0.00018600000000000002, | |
| "loss": 1.2836, | |
| "step": 93 | |
| }, | |
| { | |
| "epoch": 0.019695144308836624, | |
| "grad_norm": 7.433412551879883, | |
| "learning_rate": 0.000188, | |
| "loss": 1.0807, | |
| "step": 94 | |
| }, | |
| { | |
| "epoch": 0.019904667120632758, | |
| "grad_norm": 2.799851417541504, | |
| "learning_rate": 0.00019, | |
| "loss": 1.1394, | |
| "step": 95 | |
| }, | |
| { | |
| "epoch": 0.020114189932428892, | |
| "grad_norm": 2.473200798034668, | |
| "learning_rate": 0.000192, | |
| "loss": 1.1627, | |
| "step": 96 | |
| }, | |
| { | |
| "epoch": 0.020323712744225026, | |
| "grad_norm": 2.2027812004089355, | |
| "learning_rate": 0.000194, | |
| "loss": 0.9715, | |
| "step": 97 | |
| }, | |
| { | |
| "epoch": 0.020533235556021164, | |
| "grad_norm": 32.15480041503906, | |
| "learning_rate": 0.000196, | |
| "loss": 1.1629, | |
| "step": 98 | |
| }, | |
| { | |
| "epoch": 0.020742758367817297, | |
| "grad_norm": 3.503061532974243, | |
| "learning_rate": 0.00019800000000000002, | |
| "loss": 0.8654, | |
| "step": 99 | |
| }, | |
| { | |
| "epoch": 0.02095228117961343, | |
| "grad_norm": 2.616403102874756, | |
| "learning_rate": 0.0002, | |
| "loss": 0.916, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.021161803991409565, | |
| "grad_norm": 2.435654640197754, | |
| "learning_rate": 0.00019999999755817286, | |
| "loss": 1.0219, | |
| "step": 101 | |
| }, | |
| { | |
| "epoch": 0.0213713268032057, | |
| "grad_norm": 2.061518430709839, | |
| "learning_rate": 0.00019999999023269155, | |
| "loss": 0.8254, | |
| "step": 102 | |
| }, | |
| { | |
| "epoch": 0.021580849615001833, | |
| "grad_norm": 3.721984386444092, | |
| "learning_rate": 0.00019999997802355637, | |
| "loss": 0.7386, | |
| "step": 103 | |
| }, | |
| { | |
| "epoch": 0.021790372426797967, | |
| "grad_norm": 2.62754225730896, | |
| "learning_rate": 0.00019999996093076797, | |
| "loss": 0.8236, | |
| "step": 104 | |
| }, | |
| { | |
| "epoch": 0.0219998952385941, | |
| "grad_norm": 2.1241190433502197, | |
| "learning_rate": 0.0001999999389543272, | |
| "loss": 1.2671, | |
| "step": 105 | |
| }, | |
| { | |
| "epoch": 0.022209418050390235, | |
| "grad_norm": 1.9771560430526733, | |
| "learning_rate": 0.0001999999120942351, | |
| "loss": 0.9647, | |
| "step": 106 | |
| }, | |
| { | |
| "epoch": 0.02241894086218637, | |
| "grad_norm": 2.057161331176758, | |
| "learning_rate": 0.000199999880350493, | |
| "loss": 0.6585, | |
| "step": 107 | |
| }, | |
| { | |
| "epoch": 0.022628463673982503, | |
| "grad_norm": 1.6255578994750977, | |
| "learning_rate": 0.00019999984372310242, | |
| "loss": 0.5253, | |
| "step": 108 | |
| }, | |
| { | |
| "epoch": 0.02283798648577864, | |
| "grad_norm": 2.0477192401885986, | |
| "learning_rate": 0.0001999998022120652, | |
| "loss": 0.5285, | |
| "step": 109 | |
| }, | |
| { | |
| "epoch": 0.023047509297574775, | |
| "grad_norm": 2.287067413330078, | |
| "learning_rate": 0.0001999997558173833, | |
| "loss": 0.8685, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 0.02325703210937091, | |
| "grad_norm": 1.9694267511367798, | |
| "learning_rate": 0.00019999970453905906, | |
| "loss": 0.7955, | |
| "step": 111 | |
| }, | |
| { | |
| "epoch": 0.023466554921167043, | |
| "grad_norm": 1.9603341817855835, | |
| "learning_rate": 0.00019999964837709493, | |
| "loss": 0.6248, | |
| "step": 112 | |
| }, | |
| { | |
| "epoch": 0.023676077732963176, | |
| "grad_norm": 6.513728618621826, | |
| "learning_rate": 0.00019999958733149366, | |
| "loss": 1.0181, | |
| "step": 113 | |
| }, | |
| { | |
| "epoch": 0.02388560054475931, | |
| "grad_norm": 3.4034464359283447, | |
| "learning_rate": 0.00019999952140225825, | |
| "loss": 0.6049, | |
| "step": 114 | |
| }, | |
| { | |
| "epoch": 0.024095123356555444, | |
| "grad_norm": 1.8157330751419067, | |
| "learning_rate": 0.00019999945058939194, | |
| "loss": 0.3287, | |
| "step": 115 | |
| }, | |
| { | |
| "epoch": 0.02430464616835158, | |
| "grad_norm": 1.7763786315917969, | |
| "learning_rate": 0.00019999937489289816, | |
| "loss": 0.6354, | |
| "step": 116 | |
| }, | |
| { | |
| "epoch": 0.024514168980147712, | |
| "grad_norm": 2.1037404537200928, | |
| "learning_rate": 0.00019999929431278055, | |
| "loss": 0.5555, | |
| "step": 117 | |
| }, | |
| { | |
| "epoch": 0.024723691791943846, | |
| "grad_norm": 1.833885908126831, | |
| "learning_rate": 0.00019999920884904314, | |
| "loss": 0.9263, | |
| "step": 118 | |
| }, | |
| { | |
| "epoch": 0.024933214603739984, | |
| "grad_norm": 1.3898894786834717, | |
| "learning_rate": 0.00019999911850169006, | |
| "loss": 0.4843, | |
| "step": 119 | |
| }, | |
| { | |
| "epoch": 0.025142737415536118, | |
| "grad_norm": 1.4807199239730835, | |
| "learning_rate": 0.00019999902327072573, | |
| "loss": 0.4379, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 0.02535226022733225, | |
| "grad_norm": 2.069584608078003, | |
| "learning_rate": 0.0001999989231561548, | |
| "loss": 0.5131, | |
| "step": 121 | |
| }, | |
| { | |
| "epoch": 0.025561783039128386, | |
| "grad_norm": 1.5789371728897095, | |
| "learning_rate": 0.00019999881815798215, | |
| "loss": 0.5341, | |
| "step": 122 | |
| }, | |
| { | |
| "epoch": 0.02577130585092452, | |
| "grad_norm": 3.203845500946045, | |
| "learning_rate": 0.0001999987082762129, | |
| "loss": 0.3562, | |
| "step": 123 | |
| }, | |
| { | |
| "epoch": 0.025980828662720654, | |
| "grad_norm": 2.1900198459625244, | |
| "learning_rate": 0.00019999859351085245, | |
| "loss": 0.5325, | |
| "step": 124 | |
| }, | |
| { | |
| "epoch": 0.026190351474516788, | |
| "grad_norm": 1.3382114171981812, | |
| "learning_rate": 0.00019999847386190642, | |
| "loss": 0.345, | |
| "step": 125 | |
| }, | |
| { | |
| "epoch": 0.02639987428631292, | |
| "grad_norm": 5.412052631378174, | |
| "learning_rate": 0.00019999834932938059, | |
| "loss": 0.3673, | |
| "step": 126 | |
| }, | |
| { | |
| "epoch": 0.026609397098109056, | |
| "grad_norm": 1.5586938858032227, | |
| "learning_rate": 0.00019999821991328106, | |
| "loss": 0.4643, | |
| "step": 127 | |
| }, | |
| { | |
| "epoch": 0.02681891990990519, | |
| "grad_norm": 1.665566086769104, | |
| "learning_rate": 0.00019999808561361418, | |
| "loss": 0.5068, | |
| "step": 128 | |
| }, | |
| { | |
| "epoch": 0.027028442721701327, | |
| "grad_norm": 1.1209849119186401, | |
| "learning_rate": 0.00019999794643038647, | |
| "loss": 0.2948, | |
| "step": 129 | |
| }, | |
| { | |
| "epoch": 0.02723796553349746, | |
| "grad_norm": 1.27447509765625, | |
| "learning_rate": 0.00019999780236360475, | |
| "loss": 0.3542, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 0.027447488345293595, | |
| "grad_norm": 1.072536587715149, | |
| "learning_rate": 0.00019999765341327609, | |
| "loss": 0.276, | |
| "step": 131 | |
| }, | |
| { | |
| "epoch": 0.02765701115708973, | |
| "grad_norm": 1.3301913738250732, | |
| "learning_rate": 0.0001999974995794077, | |
| "loss": 0.3438, | |
| "step": 132 | |
| }, | |
| { | |
| "epoch": 0.027866533968885863, | |
| "grad_norm": 1.4693162441253662, | |
| "learning_rate": 0.0001999973408620071, | |
| "loss": 0.4075, | |
| "step": 133 | |
| }, | |
| { | |
| "epoch": 0.028076056780681997, | |
| "grad_norm": 0.9863178133964539, | |
| "learning_rate": 0.0001999971772610821, | |
| "loss": 0.1655, | |
| "step": 134 | |
| }, | |
| { | |
| "epoch": 0.02828557959247813, | |
| "grad_norm": 1.4921284914016724, | |
| "learning_rate": 0.00019999700877664062, | |
| "loss": 0.4577, | |
| "step": 135 | |
| }, | |
| { | |
| "epoch": 0.028495102404274265, | |
| "grad_norm": 2.7712841033935547, | |
| "learning_rate": 0.00019999683540869093, | |
| "loss": 1.004, | |
| "step": 136 | |
| }, | |
| { | |
| "epoch": 0.0287046252160704, | |
| "grad_norm": 2.392787218093872, | |
| "learning_rate": 0.0001999966571572415, | |
| "loss": 0.3403, | |
| "step": 137 | |
| }, | |
| { | |
| "epoch": 0.028914148027866533, | |
| "grad_norm": 1.188810110092163, | |
| "learning_rate": 0.00019999647402230099, | |
| "loss": 0.349, | |
| "step": 138 | |
| }, | |
| { | |
| "epoch": 0.029123670839662667, | |
| "grad_norm": 1.2173994779586792, | |
| "learning_rate": 0.00019999628600387843, | |
| "loss": 0.4411, | |
| "step": 139 | |
| }, | |
| { | |
| "epoch": 0.029333193651458804, | |
| "grad_norm": 0.8118991851806641, | |
| "learning_rate": 0.0001999960931019829, | |
| "loss": 0.1753, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 0.029542716463254938, | |
| "grad_norm": 2.2631447315216064, | |
| "learning_rate": 0.00019999589531662388, | |
| "loss": 0.5814, | |
| "step": 141 | |
| }, | |
| { | |
| "epoch": 0.029752239275051072, | |
| "grad_norm": 1.0578008890151978, | |
| "learning_rate": 0.00019999569264781103, | |
| "loss": 0.2053, | |
| "step": 142 | |
| }, | |
| { | |
| "epoch": 0.029961762086847206, | |
| "grad_norm": 1.2986905574798584, | |
| "learning_rate": 0.0001999954850955542, | |
| "loss": 0.3395, | |
| "step": 143 | |
| }, | |
| { | |
| "epoch": 0.03017128489864334, | |
| "grad_norm": 0.8881211280822754, | |
| "learning_rate": 0.00019999527265986358, | |
| "loss": 0.2499, | |
| "step": 144 | |
| }, | |
| { | |
| "epoch": 0.030380807710439474, | |
| "grad_norm": 0.6569392085075378, | |
| "learning_rate": 0.00019999505534074955, | |
| "loss": 0.0921, | |
| "step": 145 | |
| }, | |
| { | |
| "epoch": 0.030590330522235608, | |
| "grad_norm": 2.994436264038086, | |
| "learning_rate": 0.00019999483313822266, | |
| "loss": 0.2138, | |
| "step": 146 | |
| }, | |
| { | |
| "epoch": 0.030799853334031742, | |
| "grad_norm": 0.7886744141578674, | |
| "learning_rate": 0.00019999460605229382, | |
| "loss": 0.1777, | |
| "step": 147 | |
| }, | |
| { | |
| "epoch": 0.031009376145827876, | |
| "grad_norm": 1.0376852750778198, | |
| "learning_rate": 0.0001999943740829741, | |
| "loss": 0.3462, | |
| "step": 148 | |
| }, | |
| { | |
| "epoch": 0.03121889895762401, | |
| "grad_norm": 2.2212657928466797, | |
| "learning_rate": 0.00019999413723027483, | |
| "loss": 0.3019, | |
| "step": 149 | |
| }, | |
| { | |
| "epoch": 0.031428421769420144, | |
| "grad_norm": 0.9935262799263, | |
| "learning_rate": 0.00019999389549420758, | |
| "loss": 0.3099, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.03163794458121628, | |
| "grad_norm": 1.0019413232803345, | |
| "learning_rate": 0.00019999364887478413, | |
| "loss": 0.3573, | |
| "step": 151 | |
| }, | |
| { | |
| "epoch": 0.03184746739301241, | |
| "grad_norm": 0.8304846882820129, | |
| "learning_rate": 0.00019999339737201657, | |
| "loss": 0.2236, | |
| "step": 152 | |
| }, | |
| { | |
| "epoch": 0.032056990204808546, | |
| "grad_norm": 0.864344596862793, | |
| "learning_rate": 0.00019999314098591712, | |
| "loss": 0.2807, | |
| "step": 153 | |
| }, | |
| { | |
| "epoch": 0.03226651301660468, | |
| "grad_norm": 0.7545657157897949, | |
| "learning_rate": 0.0001999928797164984, | |
| "loss": 0.2469, | |
| "step": 154 | |
| }, | |
| { | |
| "epoch": 0.03247603582840082, | |
| "grad_norm": 0.8980641961097717, | |
| "learning_rate": 0.00019999261356377308, | |
| "loss": 0.2295, | |
| "step": 155 | |
| }, | |
| { | |
| "epoch": 0.032685558640196954, | |
| "grad_norm": 1.1351686716079712, | |
| "learning_rate": 0.00019999234252775417, | |
| "loss": 0.2729, | |
| "step": 156 | |
| }, | |
| { | |
| "epoch": 0.03289508145199309, | |
| "grad_norm": 0.8582344055175781, | |
| "learning_rate": 0.00019999206660845494, | |
| "loss": 0.092, | |
| "step": 157 | |
| }, | |
| { | |
| "epoch": 0.03310460426378922, | |
| "grad_norm": 0.9123420715332031, | |
| "learning_rate": 0.00019999178580588884, | |
| "loss": 0.3193, | |
| "step": 158 | |
| }, | |
| { | |
| "epoch": 0.033314127075585356, | |
| "grad_norm": 0.7440950274467468, | |
| "learning_rate": 0.00019999150012006957, | |
| "loss": 0.1619, | |
| "step": 159 | |
| }, | |
| { | |
| "epoch": 0.03352364988738149, | |
| "grad_norm": 0.9979766607284546, | |
| "learning_rate": 0.00019999120955101115, | |
| "loss": 0.4078, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 0.033733172699177624, | |
| "grad_norm": 0.8199712038040161, | |
| "learning_rate": 0.0001999909140987277, | |
| "loss": 0.2446, | |
| "step": 161 | |
| }, | |
| { | |
| "epoch": 0.03394269551097376, | |
| "grad_norm": 0.7930268049240112, | |
| "learning_rate": 0.00019999061376323364, | |
| "loss": 0.1743, | |
| "step": 162 | |
| }, | |
| { | |
| "epoch": 0.03415221832276989, | |
| "grad_norm": 0.8929171562194824, | |
| "learning_rate": 0.00019999030854454372, | |
| "loss": 0.2667, | |
| "step": 163 | |
| }, | |
| { | |
| "epoch": 0.034361741134566026, | |
| "grad_norm": 0.7461153864860535, | |
| "learning_rate": 0.00019998999844267278, | |
| "loss": 0.2506, | |
| "step": 164 | |
| }, | |
| { | |
| "epoch": 0.03457126394636216, | |
| "grad_norm": 0.8262781500816345, | |
| "learning_rate": 0.00019998968345763597, | |
| "loss": 0.1328, | |
| "step": 165 | |
| }, | |
| { | |
| "epoch": 0.034780786758158294, | |
| "grad_norm": 86.18844604492188, | |
| "learning_rate": 0.0001999893635894487, | |
| "loss": 0.1376, | |
| "step": 166 | |
| }, | |
| { | |
| "epoch": 0.03499030956995443, | |
| "grad_norm": 1.760168194770813, | |
| "learning_rate": 0.00019998903883812656, | |
| "loss": 0.3097, | |
| "step": 167 | |
| }, | |
| { | |
| "epoch": 0.03519983238175056, | |
| "grad_norm": 0.7841578125953674, | |
| "learning_rate": 0.00019998870920368545, | |
| "loss": 0.1192, | |
| "step": 168 | |
| }, | |
| { | |
| "epoch": 0.035409355193546696, | |
| "grad_norm": 1.00667405128479, | |
| "learning_rate": 0.00019998837468614142, | |
| "loss": 0.2442, | |
| "step": 169 | |
| }, | |
| { | |
| "epoch": 0.03561887800534283, | |
| "grad_norm": 0.703844428062439, | |
| "learning_rate": 0.0001999880352855108, | |
| "loss": 0.0965, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 0.035828400817138964, | |
| "grad_norm": 0.7780567407608032, | |
| "learning_rate": 0.00019998769100181024, | |
| "loss": 0.2322, | |
| "step": 171 | |
| }, | |
| { | |
| "epoch": 0.0360379236289351, | |
| "grad_norm": 1.236464023590088, | |
| "learning_rate": 0.00019998734183505649, | |
| "loss": 0.4349, | |
| "step": 172 | |
| }, | |
| { | |
| "epoch": 0.03624744644073123, | |
| "grad_norm": 0.555381715297699, | |
| "learning_rate": 0.00019998698778526662, | |
| "loss": 0.1172, | |
| "step": 173 | |
| }, | |
| { | |
| "epoch": 0.036456969252527366, | |
| "grad_norm": 10.66753101348877, | |
| "learning_rate": 0.0001999866288524579, | |
| "loss": 0.1629, | |
| "step": 174 | |
| }, | |
| { | |
| "epoch": 0.0366664920643235, | |
| "grad_norm": 0.7637689113616943, | |
| "learning_rate": 0.00019998626503664793, | |
| "loss": 0.1148, | |
| "step": 175 | |
| }, | |
| { | |
| "epoch": 0.03687601487611964, | |
| "grad_norm": 1.3090569972991943, | |
| "learning_rate": 0.00019998589633785438, | |
| "loss": 0.2716, | |
| "step": 176 | |
| }, | |
| { | |
| "epoch": 0.037085537687915775, | |
| "grad_norm": 0.7185351848602295, | |
| "learning_rate": 0.00019998552275609532, | |
| "loss": 0.2852, | |
| "step": 177 | |
| }, | |
| { | |
| "epoch": 0.03729506049971191, | |
| "grad_norm": 0.5750662684440613, | |
| "learning_rate": 0.00019998514429138897, | |
| "loss": 0.1041, | |
| "step": 178 | |
| }, | |
| { | |
| "epoch": 0.03750458331150804, | |
| "grad_norm": 0.8854494094848633, | |
| "learning_rate": 0.0001999847609437538, | |
| "loss": 0.1748, | |
| "step": 179 | |
| }, | |
| { | |
| "epoch": 0.03771410612330418, | |
| "grad_norm": 0.4940667450428009, | |
| "learning_rate": 0.0001999843727132086, | |
| "loss": 0.0824, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 0.03792362893510031, | |
| "grad_norm": 0.423206090927124, | |
| "learning_rate": 0.00019998397959977227, | |
| "loss": 0.0339, | |
| "step": 181 | |
| }, | |
| { | |
| "epoch": 0.038133151746896445, | |
| "grad_norm": 0.6689960956573486, | |
| "learning_rate": 0.000199983581603464, | |
| "loss": 0.0825, | |
| "step": 182 | |
| }, | |
| { | |
| "epoch": 0.03834267455869258, | |
| "grad_norm": 1.6195799112319946, | |
| "learning_rate": 0.00019998317872430325, | |
| "loss": 0.4116, | |
| "step": 183 | |
| }, | |
| { | |
| "epoch": 0.03855219737048871, | |
| "grad_norm": 0.6361613869667053, | |
| "learning_rate": 0.0001999827709623097, | |
| "loss": 0.1088, | |
| "step": 184 | |
| }, | |
| { | |
| "epoch": 0.038761720182284846, | |
| "grad_norm": 0.46394994854927063, | |
| "learning_rate": 0.00019998235831750324, | |
| "loss": 0.0392, | |
| "step": 185 | |
| }, | |
| { | |
| "epoch": 0.03897124299408098, | |
| "grad_norm": 2.3084888458251953, | |
| "learning_rate": 0.00019998194078990405, | |
| "loss": 0.1127, | |
| "step": 186 | |
| }, | |
| { | |
| "epoch": 0.039180765805877114, | |
| "grad_norm": 1.0078133344650269, | |
| "learning_rate": 0.0001999815183795325, | |
| "loss": 0.2206, | |
| "step": 187 | |
| }, | |
| { | |
| "epoch": 0.03939028861767325, | |
| "grad_norm": 9.654485702514648, | |
| "learning_rate": 0.00019998109108640923, | |
| "loss": 0.0456, | |
| "step": 188 | |
| }, | |
| { | |
| "epoch": 0.03959981142946938, | |
| "grad_norm": 1.100779414176941, | |
| "learning_rate": 0.0001999806589105551, | |
| "loss": 0.0901, | |
| "step": 189 | |
| }, | |
| { | |
| "epoch": 0.039809334241265516, | |
| "grad_norm": 0.7839688062667847, | |
| "learning_rate": 0.00019998022185199122, | |
| "loss": 0.1717, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 0.04001885705306165, | |
| "grad_norm": 0.7395772933959961, | |
| "learning_rate": 0.00019997977991073897, | |
| "loss": 0.1766, | |
| "step": 191 | |
| }, | |
| { | |
| "epoch": 0.040228379864857784, | |
| "grad_norm": 0.8579478859901428, | |
| "learning_rate": 0.00019997933308681988, | |
| "loss": 0.2444, | |
| "step": 192 | |
| }, | |
| { | |
| "epoch": 0.04043790267665392, | |
| "grad_norm": 0.7338067293167114, | |
| "learning_rate": 0.00019997888138025577, | |
| "loss": 0.0912, | |
| "step": 193 | |
| }, | |
| { | |
| "epoch": 0.04064742548845005, | |
| "grad_norm": 0.5419819951057434, | |
| "learning_rate": 0.0001999784247910687, | |
| "loss": 0.14, | |
| "step": 194 | |
| }, | |
| { | |
| "epoch": 0.040856948300246186, | |
| "grad_norm": 0.6646466255187988, | |
| "learning_rate": 0.00019997796331928103, | |
| "loss": 0.2105, | |
| "step": 195 | |
| }, | |
| { | |
| "epoch": 0.04106647111204233, | |
| "grad_norm": 0.6302490830421448, | |
| "learning_rate": 0.00019997749696491524, | |
| "loss": 0.1134, | |
| "step": 196 | |
| }, | |
| { | |
| "epoch": 0.04127599392383846, | |
| "grad_norm": 0.4890528619289398, | |
| "learning_rate": 0.00019997702572799412, | |
| "loss": 0.1081, | |
| "step": 197 | |
| }, | |
| { | |
| "epoch": 0.041485516735634595, | |
| "grad_norm": 0.8870651125907898, | |
| "learning_rate": 0.00019997654960854066, | |
| "loss": 0.4391, | |
| "step": 198 | |
| }, | |
| { | |
| "epoch": 0.04169503954743073, | |
| "grad_norm": 0.36530014872550964, | |
| "learning_rate": 0.00019997606860657817, | |
| "loss": 0.0521, | |
| "step": 199 | |
| }, | |
| { | |
| "epoch": 0.04190456235922686, | |
| "grad_norm": 0.543272078037262, | |
| "learning_rate": 0.0001999755827221301, | |
| "loss": 0.0804, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.04190456235922686, | |
| "eval_loss": 0.10344672948122025, | |
| "eval_runtime": 89.1847, | |
| "eval_samples_per_second": 8.611, | |
| "eval_steps_per_second": 4.306, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.042114085171023, | |
| "grad_norm": 0.5941206812858582, | |
| "learning_rate": 0.00019997509195522015, | |
| "loss": 0.1788, | |
| "step": 201 | |
| }, | |
| { | |
| "epoch": 0.04232360798281913, | |
| "grad_norm": 0.6516295075416565, | |
| "learning_rate": 0.00019997459630587234, | |
| "loss": 0.1104, | |
| "step": 202 | |
| }, | |
| { | |
| "epoch": 0.042533130794615265, | |
| "grad_norm": 0.5159923434257507, | |
| "learning_rate": 0.00019997409577411087, | |
| "loss": 0.065, | |
| "step": 203 | |
| }, | |
| { | |
| "epoch": 0.0427426536064114, | |
| "grad_norm": 0.26800480484962463, | |
| "learning_rate": 0.00019997359035996018, | |
| "loss": 0.0315, | |
| "step": 204 | |
| }, | |
| { | |
| "epoch": 0.04295217641820753, | |
| "grad_norm": 0.490592896938324, | |
| "learning_rate": 0.0001999730800634449, | |
| "loss": 0.0737, | |
| "step": 205 | |
| }, | |
| { | |
| "epoch": 0.04316169923000367, | |
| "grad_norm": 0.6091493964195251, | |
| "learning_rate": 0.00019997256488459003, | |
| "loss": 0.1075, | |
| "step": 206 | |
| }, | |
| { | |
| "epoch": 0.0433712220417998, | |
| "grad_norm": 0.6991119980812073, | |
| "learning_rate": 0.00019997204482342067, | |
| "loss": 0.1717, | |
| "step": 207 | |
| }, | |
| { | |
| "epoch": 0.043580744853595935, | |
| "grad_norm": 0.7354519963264465, | |
| "learning_rate": 0.00019997151987996228, | |
| "loss": 0.1065, | |
| "step": 208 | |
| }, | |
| { | |
| "epoch": 0.04379026766539207, | |
| "grad_norm": 0.5201641917228699, | |
| "learning_rate": 0.00019997099005424044, | |
| "loss": 0.0715, | |
| "step": 209 | |
| }, | |
| { | |
| "epoch": 0.0439997904771882, | |
| "grad_norm": 0.8263329267501831, | |
| "learning_rate": 0.00019997045534628102, | |
| "loss": 0.0924, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 0.04420931328898434, | |
| "grad_norm": 0.566967785358429, | |
| "learning_rate": 0.00019996991575611017, | |
| "loss": 0.0791, | |
| "step": 211 | |
| }, | |
| { | |
| "epoch": 0.04441883610078047, | |
| "grad_norm": 0.5574502348899841, | |
| "learning_rate": 0.00019996937128375427, | |
| "loss": 0.1083, | |
| "step": 212 | |
| }, | |
| { | |
| "epoch": 0.044628358912576604, | |
| "grad_norm": 0.6977449059486389, | |
| "learning_rate": 0.00019996882192923983, | |
| "loss": 0.1085, | |
| "step": 213 | |
| }, | |
| { | |
| "epoch": 0.04483788172437274, | |
| "grad_norm": 0.633960485458374, | |
| "learning_rate": 0.00019996826769259373, | |
| "loss": 0.0676, | |
| "step": 214 | |
| }, | |
| { | |
| "epoch": 0.04504740453616887, | |
| "grad_norm": 0.5775350332260132, | |
| "learning_rate": 0.000199967708573843, | |
| "loss": 0.0677, | |
| "step": 215 | |
| }, | |
| { | |
| "epoch": 0.045256927347965006, | |
| "grad_norm": 0.4216829836368561, | |
| "learning_rate": 0.000199967144573015, | |
| "loss": 0.0267, | |
| "step": 216 | |
| }, | |
| { | |
| "epoch": 0.04546645015976115, | |
| "grad_norm": 137.67056274414062, | |
| "learning_rate": 0.0001999665756901372, | |
| "loss": 0.1274, | |
| "step": 217 | |
| }, | |
| { | |
| "epoch": 0.04567597297155728, | |
| "grad_norm": 0.4533352553844452, | |
| "learning_rate": 0.0001999660019252375, | |
| "loss": 0.036, | |
| "step": 218 | |
| }, | |
| { | |
| "epoch": 0.045885495783353415, | |
| "grad_norm": 0.6027405858039856, | |
| "learning_rate": 0.0001999654232783438, | |
| "loss": 0.0529, | |
| "step": 219 | |
| }, | |
| { | |
| "epoch": 0.04609501859514955, | |
| "grad_norm": 11.28525161743164, | |
| "learning_rate": 0.0001999648397494844, | |
| "loss": 0.1955, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 0.04630454140694568, | |
| "grad_norm": 0.8258134722709656, | |
| "learning_rate": 0.0001999642513386878, | |
| "loss": 0.0888, | |
| "step": 221 | |
| }, | |
| { | |
| "epoch": 0.04651406421874182, | |
| "grad_norm": 1.017187237739563, | |
| "learning_rate": 0.00019996365804598277, | |
| "loss": 0.3099, | |
| "step": 222 | |
| }, | |
| { | |
| "epoch": 0.04672358703053795, | |
| "grad_norm": 0.6367133259773254, | |
| "learning_rate": 0.00019996305987139823, | |
| "loss": 0.1296, | |
| "step": 223 | |
| }, | |
| { | |
| "epoch": 0.046933109842334085, | |
| "grad_norm": 7.626189231872559, | |
| "learning_rate": 0.00019996245681496344, | |
| "loss": 0.0709, | |
| "step": 224 | |
| }, | |
| { | |
| "epoch": 0.04714263265413022, | |
| "grad_norm": 0.47820284962654114, | |
| "learning_rate": 0.00019996184887670782, | |
| "loss": 0.1181, | |
| "step": 225 | |
| }, | |
| { | |
| "epoch": 0.04735215546592635, | |
| "grad_norm": 0.6066839694976807, | |
| "learning_rate": 0.00019996123605666103, | |
| "loss": 0.1149, | |
| "step": 226 | |
| }, | |
| { | |
| "epoch": 0.04756167827772249, | |
| "grad_norm": 2.130101442337036, | |
| "learning_rate": 0.00019996061835485308, | |
| "loss": 0.1298, | |
| "step": 227 | |
| }, | |
| { | |
| "epoch": 0.04777120108951862, | |
| "grad_norm": 0.5670686960220337, | |
| "learning_rate": 0.00019995999577131408, | |
| "loss": 0.2267, | |
| "step": 228 | |
| }, | |
| { | |
| "epoch": 0.047980723901314755, | |
| "grad_norm": 0.7000769972801208, | |
| "learning_rate": 0.00019995936830607446, | |
| "loss": 0.1806, | |
| "step": 229 | |
| }, | |
| { | |
| "epoch": 0.04819024671311089, | |
| "grad_norm": 0.7342044711112976, | |
| "learning_rate": 0.0001999587359591648, | |
| "loss": 0.0655, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 0.04839976952490702, | |
| "grad_norm": 0.5491848587989807, | |
| "learning_rate": 0.00019995809873061608, | |
| "loss": 0.1275, | |
| "step": 231 | |
| }, | |
| { | |
| "epoch": 0.04860929233670316, | |
| "grad_norm": 0.3583279848098755, | |
| "learning_rate": 0.00019995745662045936, | |
| "loss": 0.0391, | |
| "step": 232 | |
| }, | |
| { | |
| "epoch": 0.04881881514849929, | |
| "grad_norm": 2.7566843032836914, | |
| "learning_rate": 0.000199956809628726, | |
| "loss": 0.0951, | |
| "step": 233 | |
| }, | |
| { | |
| "epoch": 0.049028337960295425, | |
| "grad_norm": 2.23818039894104, | |
| "learning_rate": 0.00019995615775544762, | |
| "loss": 0.2119, | |
| "step": 234 | |
| }, | |
| { | |
| "epoch": 0.04923786077209156, | |
| "grad_norm": 0.6462116837501526, | |
| "learning_rate": 0.00019995550100065606, | |
| "loss": 0.1219, | |
| "step": 235 | |
| }, | |
| { | |
| "epoch": 0.04944738358388769, | |
| "grad_norm": 0.8119645118713379, | |
| "learning_rate": 0.00019995483936438335, | |
| "loss": 0.2064, | |
| "step": 236 | |
| }, | |
| { | |
| "epoch": 0.04965690639568383, | |
| "grad_norm": 0.4794083535671234, | |
| "learning_rate": 0.00019995417284666183, | |
| "loss": 0.0229, | |
| "step": 237 | |
| }, | |
| { | |
| "epoch": 0.04986642920747997, | |
| "grad_norm": 0.6471462845802307, | |
| "learning_rate": 0.00019995350144752405, | |
| "loss": 0.1775, | |
| "step": 238 | |
| }, | |
| { | |
| "epoch": 0.0500759520192761, | |
| "grad_norm": 0.5981686115264893, | |
| "learning_rate": 0.00019995282516700277, | |
| "loss": 0.0767, | |
| "step": 239 | |
| }, | |
| { | |
| "epoch": 0.050285474831072235, | |
| "grad_norm": 0.3105001449584961, | |
| "learning_rate": 0.00019995214400513107, | |
| "loss": 0.0408, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 0.05049499764286837, | |
| "grad_norm": 1.2822221517562866, | |
| "learning_rate": 0.00019995145796194218, | |
| "loss": 0.045, | |
| "step": 241 | |
| }, | |
| { | |
| "epoch": 0.0507045204546645, | |
| "grad_norm": 0.561123251914978, | |
| "learning_rate": 0.00019995076703746965, | |
| "loss": 0.1002, | |
| "step": 242 | |
| }, | |
| { | |
| "epoch": 0.05091404326646064, | |
| "grad_norm": 0.33375391364097595, | |
| "learning_rate": 0.00019995007123174715, | |
| "loss": 0.0283, | |
| "step": 243 | |
| }, | |
| { | |
| "epoch": 0.05112356607825677, | |
| "grad_norm": 0.34149792790412903, | |
| "learning_rate": 0.00019994937054480872, | |
| "loss": 0.0484, | |
| "step": 244 | |
| }, | |
| { | |
| "epoch": 0.051333088890052905, | |
| "grad_norm": 0.6636136770248413, | |
| "learning_rate": 0.00019994866497668855, | |
| "loss": 0.1882, | |
| "step": 245 | |
| }, | |
| { | |
| "epoch": 0.05154261170184904, | |
| "grad_norm": 5.894417762756348, | |
| "learning_rate": 0.00019994795452742107, | |
| "loss": 0.1755, | |
| "step": 246 | |
| }, | |
| { | |
| "epoch": 0.05175213451364517, | |
| "grad_norm": 0.34999197721481323, | |
| "learning_rate": 0.00019994723919704104, | |
| "loss": 0.0353, | |
| "step": 247 | |
| }, | |
| { | |
| "epoch": 0.05196165732544131, | |
| "grad_norm": 0.750867486000061, | |
| "learning_rate": 0.00019994651898558338, | |
| "loss": 0.1368, | |
| "step": 248 | |
| }, | |
| { | |
| "epoch": 0.05217118013723744, | |
| "grad_norm": 0.35057973861694336, | |
| "learning_rate": 0.0001999457938930832, | |
| "loss": 0.0414, | |
| "step": 249 | |
| }, | |
| { | |
| "epoch": 0.052380702949033575, | |
| "grad_norm": 0.6619654893875122, | |
| "learning_rate": 0.000199945063919576, | |
| "loss": 0.0132, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.05259022576082971, | |
| "grad_norm": 0.6549753546714783, | |
| "learning_rate": 0.00019994432906509738, | |
| "loss": 0.1807, | |
| "step": 251 | |
| }, | |
| { | |
| "epoch": 0.05279974857262584, | |
| "grad_norm": 0.567844808101654, | |
| "learning_rate": 0.00019994358932968323, | |
| "loss": 0.0272, | |
| "step": 252 | |
| }, | |
| { | |
| "epoch": 0.05300927138442198, | |
| "grad_norm": 0.49006056785583496, | |
| "learning_rate": 0.00019994284471336966, | |
| "loss": 0.0698, | |
| "step": 253 | |
| }, | |
| { | |
| "epoch": 0.05321879419621811, | |
| "grad_norm": 0.655574381351471, | |
| "learning_rate": 0.00019994209521619305, | |
| "loss": 0.1171, | |
| "step": 254 | |
| }, | |
| { | |
| "epoch": 0.053428317008014245, | |
| "grad_norm": 0.36629414558410645, | |
| "learning_rate": 0.00019994134083819006, | |
| "loss": 0.0883, | |
| "step": 255 | |
| }, | |
| { | |
| "epoch": 0.05363783981981038, | |
| "grad_norm": 0.5820656418800354, | |
| "learning_rate": 0.00019994058157939745, | |
| "loss": 0.0661, | |
| "step": 256 | |
| }, | |
| { | |
| "epoch": 0.05384736263160651, | |
| "grad_norm": 0.5091819763183594, | |
| "learning_rate": 0.0001999398174398523, | |
| "loss": 0.0839, | |
| "step": 257 | |
| }, | |
| { | |
| "epoch": 0.054056885443402654, | |
| "grad_norm": 0.2602584660053253, | |
| "learning_rate": 0.00019993904841959198, | |
| "loss": 0.024, | |
| "step": 258 | |
| }, | |
| { | |
| "epoch": 0.05426640825519879, | |
| "grad_norm": 0.5362564921379089, | |
| "learning_rate": 0.00019993827451865405, | |
| "loss": 0.0908, | |
| "step": 259 | |
| }, | |
| { | |
| "epoch": 0.05447593106699492, | |
| "grad_norm": 0.5144950747489929, | |
| "learning_rate": 0.00019993749573707622, | |
| "loss": 0.0897, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 0.054685453878791056, | |
| "grad_norm": 0.4115906357765198, | |
| "learning_rate": 0.00019993671207489664, | |
| "loss": 0.0795, | |
| "step": 261 | |
| }, | |
| { | |
| "epoch": 0.05489497669058719, | |
| "grad_norm": 0.286371111869812, | |
| "learning_rate": 0.0001999359235321535, | |
| "loss": 0.0123, | |
| "step": 262 | |
| }, | |
| { | |
| "epoch": 0.055104499502383324, | |
| "grad_norm": 0.46544694900512695, | |
| "learning_rate": 0.00019993513010888532, | |
| "loss": 0.076, | |
| "step": 263 | |
| }, | |
| { | |
| "epoch": 0.05531402231417946, | |
| "grad_norm": 1.89289128780365, | |
| "learning_rate": 0.00019993433180513087, | |
| "loss": 0.1722, | |
| "step": 264 | |
| }, | |
| { | |
| "epoch": 0.05552354512597559, | |
| "grad_norm": 0.37900757789611816, | |
| "learning_rate": 0.0001999335286209291, | |
| "loss": 0.0712, | |
| "step": 265 | |
| }, | |
| { | |
| "epoch": 0.055733067937771726, | |
| "grad_norm": 0.5412926077842712, | |
| "learning_rate": 0.00019993272055631928, | |
| "loss": 0.1188, | |
| "step": 266 | |
| }, | |
| { | |
| "epoch": 0.05594259074956786, | |
| "grad_norm": 0.37314048409461975, | |
| "learning_rate": 0.00019993190761134088, | |
| "loss": 0.0592, | |
| "step": 267 | |
| }, | |
| { | |
| "epoch": 0.056152113561363994, | |
| "grad_norm": 0.3859734535217285, | |
| "learning_rate": 0.00019993108978603354, | |
| "loss": 0.0591, | |
| "step": 268 | |
| }, | |
| { | |
| "epoch": 0.05636163637316013, | |
| "grad_norm": 0.7167041301727295, | |
| "learning_rate": 0.00019993026708043724, | |
| "loss": 0.1676, | |
| "step": 269 | |
| }, | |
| { | |
| "epoch": 0.05657115918495626, | |
| "grad_norm": 0.557241678237915, | |
| "learning_rate": 0.00019992943949459217, | |
| "loss": 0.106, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 0.056780681996752395, | |
| "grad_norm": 0.5354751944541931, | |
| "learning_rate": 0.00019992860702853872, | |
| "loss": 0.0828, | |
| "step": 271 | |
| }, | |
| { | |
| "epoch": 0.05699020480854853, | |
| "grad_norm": 0.6553617119789124, | |
| "learning_rate": 0.00019992776968231755, | |
| "loss": 0.0578, | |
| "step": 272 | |
| }, | |
| { | |
| "epoch": 0.05719972762034466, | |
| "grad_norm": 0.45751243829727173, | |
| "learning_rate": 0.00019992692745596956, | |
| "loss": 0.0476, | |
| "step": 273 | |
| }, | |
| { | |
| "epoch": 0.0574092504321408, | |
| "grad_norm": 0.5948287844657898, | |
| "learning_rate": 0.00019992608034953587, | |
| "loss": 0.077, | |
| "step": 274 | |
| }, | |
| { | |
| "epoch": 0.05761877324393693, | |
| "grad_norm": 0.4865845739841461, | |
| "learning_rate": 0.0001999252283630579, | |
| "loss": 0.0771, | |
| "step": 275 | |
| }, | |
| { | |
| "epoch": 0.057828296055733065, | |
| "grad_norm": 0.5067867636680603, | |
| "learning_rate": 0.00019992437149657719, | |
| "loss": 0.1177, | |
| "step": 276 | |
| }, | |
| { | |
| "epoch": 0.0580378188675292, | |
| "grad_norm": 1.10435152053833, | |
| "learning_rate": 0.00019992350975013562, | |
| "loss": 0.1476, | |
| "step": 277 | |
| }, | |
| { | |
| "epoch": 0.05824734167932533, | |
| "grad_norm": 0.40550732612609863, | |
| "learning_rate": 0.00019992264312377524, | |
| "loss": 0.0382, | |
| "step": 278 | |
| }, | |
| { | |
| "epoch": 0.058456864491121474, | |
| "grad_norm": 0.23179441690444946, | |
| "learning_rate": 0.00019992177161753843, | |
| "loss": 0.0308, | |
| "step": 279 | |
| }, | |
| { | |
| "epoch": 0.05866638730291761, | |
| "grad_norm": 0.37846237421035767, | |
| "learning_rate": 0.00019992089523146768, | |
| "loss": 0.0857, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 0.05887591011471374, | |
| "grad_norm": 0.3958498239517212, | |
| "learning_rate": 0.00019992001396560588, | |
| "loss": 0.0874, | |
| "step": 281 | |
| }, | |
| { | |
| "epoch": 0.059085432926509876, | |
| "grad_norm": 5.02588415145874, | |
| "learning_rate": 0.000199919127819996, | |
| "loss": 0.1182, | |
| "step": 282 | |
| }, | |
| { | |
| "epoch": 0.05929495573830601, | |
| "grad_norm": 0.32736262679100037, | |
| "learning_rate": 0.00019991823679468132, | |
| "loss": 0.0429, | |
| "step": 283 | |
| }, | |
| { | |
| "epoch": 0.059504478550102144, | |
| "grad_norm": 0.43987375497817993, | |
| "learning_rate": 0.00019991734088970538, | |
| "loss": 0.0614, | |
| "step": 284 | |
| }, | |
| { | |
| "epoch": 0.05971400136189828, | |
| "grad_norm": 0.5660803318023682, | |
| "learning_rate": 0.00019991644010511196, | |
| "loss": 0.1227, | |
| "step": 285 | |
| }, | |
| { | |
| "epoch": 0.05992352417369441, | |
| "grad_norm": 1.1450581550598145, | |
| "learning_rate": 0.000199915534440945, | |
| "loss": 0.0406, | |
| "step": 286 | |
| }, | |
| { | |
| "epoch": 0.060133046985490546, | |
| "grad_norm": 0.27143630385398865, | |
| "learning_rate": 0.00019991462389724873, | |
| "loss": 0.029, | |
| "step": 287 | |
| }, | |
| { | |
| "epoch": 0.06034256979728668, | |
| "grad_norm": 0.3402729332447052, | |
| "learning_rate": 0.00019991370847406763, | |
| "loss": 0.064, | |
| "step": 288 | |
| }, | |
| { | |
| "epoch": 0.060552092609082814, | |
| "grad_norm": 0.39539551734924316, | |
| "learning_rate": 0.0001999127881714464, | |
| "loss": 0.0554, | |
| "step": 289 | |
| }, | |
| { | |
| "epoch": 0.06076161542087895, | |
| "grad_norm": 0.26591384410858154, | |
| "learning_rate": 0.00019991186298943002, | |
| "loss": 0.0314, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 0.06097113823267508, | |
| "grad_norm": 0.3784986138343811, | |
| "learning_rate": 0.00019991093292806363, | |
| "loss": 0.1253, | |
| "step": 291 | |
| }, | |
| { | |
| "epoch": 0.061180661044471216, | |
| "grad_norm": 0.4088621437549591, | |
| "learning_rate": 0.00019990999798739266, | |
| "loss": 0.0606, | |
| "step": 292 | |
| }, | |
| { | |
| "epoch": 0.06139018385626735, | |
| "grad_norm": 0.4378616213798523, | |
| "learning_rate": 0.0001999090581674628, | |
| "loss": 0.0108, | |
| "step": 293 | |
| }, | |
| { | |
| "epoch": 0.061599706668063484, | |
| "grad_norm": 0.43905991315841675, | |
| "learning_rate": 0.0001999081134683199, | |
| "loss": 0.0577, | |
| "step": 294 | |
| }, | |
| { | |
| "epoch": 0.06180922947985962, | |
| "grad_norm": 0.2687093913555145, | |
| "learning_rate": 0.0001999071638900101, | |
| "loss": 0.0123, | |
| "step": 295 | |
| }, | |
| { | |
| "epoch": 0.06201875229165575, | |
| "grad_norm": 0.3932202458381653, | |
| "learning_rate": 0.00019990620943257983, | |
| "loss": 0.0295, | |
| "step": 296 | |
| }, | |
| { | |
| "epoch": 0.062228275103451886, | |
| "grad_norm": 0.4472673833370209, | |
| "learning_rate": 0.00019990525009607566, | |
| "loss": 0.0741, | |
| "step": 297 | |
| }, | |
| { | |
| "epoch": 0.06243779791524802, | |
| "grad_norm": 0.40663135051727295, | |
| "learning_rate": 0.00019990428588054443, | |
| "loss": 0.0779, | |
| "step": 298 | |
| }, | |
| { | |
| "epoch": 0.06264732072704415, | |
| "grad_norm": 0.3737165927886963, | |
| "learning_rate": 0.00019990331678603328, | |
| "loss": 0.0292, | |
| "step": 299 | |
| }, | |
| { | |
| "epoch": 0.06285684353884029, | |
| "grad_norm": 0.5894246697425842, | |
| "learning_rate": 0.00019990234281258947, | |
| "loss": 0.0945, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.06306636635063642, | |
| "grad_norm": 0.5821501016616821, | |
| "learning_rate": 0.0001999013639602606, | |
| "loss": 0.1296, | |
| "step": 301 | |
| }, | |
| { | |
| "epoch": 0.06327588916243256, | |
| "grad_norm": 0.30660367012023926, | |
| "learning_rate": 0.00019990038022909447, | |
| "loss": 0.0321, | |
| "step": 302 | |
| }, | |
| { | |
| "epoch": 0.06348541197422869, | |
| "grad_norm": 0.42192137241363525, | |
| "learning_rate": 0.00019989939161913913, | |
| "loss": 0.0532, | |
| "step": 303 | |
| }, | |
| { | |
| "epoch": 0.06369493478602482, | |
| "grad_norm": 0.5271754264831543, | |
| "learning_rate": 0.00019989839813044287, | |
| "loss": 0.0716, | |
| "step": 304 | |
| }, | |
| { | |
| "epoch": 0.06390445759782096, | |
| "grad_norm": 0.20992733538150787, | |
| "learning_rate": 0.00019989739976305416, | |
| "loss": 0.0104, | |
| "step": 305 | |
| }, | |
| { | |
| "epoch": 0.06411398040961709, | |
| "grad_norm": 0.245597243309021, | |
| "learning_rate": 0.0001998963965170218, | |
| "loss": 0.0175, | |
| "step": 306 | |
| }, | |
| { | |
| "epoch": 0.06432350322141323, | |
| "grad_norm": 0.4208592176437378, | |
| "learning_rate": 0.0001998953883923948, | |
| "loss": 0.0774, | |
| "step": 307 | |
| }, | |
| { | |
| "epoch": 0.06453302603320936, | |
| "grad_norm": 0.4989780783653259, | |
| "learning_rate": 0.00019989437538922236, | |
| "loss": 0.0687, | |
| "step": 308 | |
| }, | |
| { | |
| "epoch": 0.0647425488450055, | |
| "grad_norm": 0.4769832193851471, | |
| "learning_rate": 0.00019989335750755395, | |
| "loss": 0.091, | |
| "step": 309 | |
| }, | |
| { | |
| "epoch": 0.06495207165680164, | |
| "grad_norm": 0.3996768891811371, | |
| "learning_rate": 0.00019989233474743926, | |
| "loss": 0.039, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 0.06516159446859777, | |
| "grad_norm": 3.7684757709503174, | |
| "learning_rate": 0.0001998913071089283, | |
| "loss": 0.0485, | |
| "step": 311 | |
| }, | |
| { | |
| "epoch": 0.06537111728039391, | |
| "grad_norm": 7.5791425704956055, | |
| "learning_rate": 0.0001998902745920712, | |
| "loss": 0.0234, | |
| "step": 312 | |
| }, | |
| { | |
| "epoch": 0.06558064009219004, | |
| "grad_norm": 0.3686707019805908, | |
| "learning_rate": 0.00019988923719691846, | |
| "loss": 0.0449, | |
| "step": 313 | |
| }, | |
| { | |
| "epoch": 0.06579016290398618, | |
| "grad_norm": 0.2311185598373413, | |
| "learning_rate": 0.00019988819492352064, | |
| "loss": 0.0242, | |
| "step": 314 | |
| }, | |
| { | |
| "epoch": 0.06599968571578231, | |
| "grad_norm": 0.27226027846336365, | |
| "learning_rate": 0.00019988714777192872, | |
| "loss": 0.0281, | |
| "step": 315 | |
| }, | |
| { | |
| "epoch": 0.06620920852757844, | |
| "grad_norm": 0.7749564051628113, | |
| "learning_rate": 0.0001998860957421938, | |
| "loss": 0.1284, | |
| "step": 316 | |
| }, | |
| { | |
| "epoch": 0.06641873133937458, | |
| "grad_norm": 0.4700535237789154, | |
| "learning_rate": 0.00019988503883436727, | |
| "loss": 0.0723, | |
| "step": 317 | |
| }, | |
| { | |
| "epoch": 0.06662825415117071, | |
| "grad_norm": 1.5472089052200317, | |
| "learning_rate": 0.00019988397704850074, | |
| "loss": 0.041, | |
| "step": 318 | |
| }, | |
| { | |
| "epoch": 0.06683777696296685, | |
| "grad_norm": 0.99204421043396, | |
| "learning_rate": 0.00019988291038464605, | |
| "loss": 0.0464, | |
| "step": 319 | |
| }, | |
| { | |
| "epoch": 0.06704729977476298, | |
| "grad_norm": 0.43524572253227234, | |
| "learning_rate": 0.00019988183884285535, | |
| "loss": 0.0346, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 0.06725682258655911, | |
| "grad_norm": 0.539294421672821, | |
| "learning_rate": 0.00019988076242318092, | |
| "loss": 0.1489, | |
| "step": 321 | |
| }, | |
| { | |
| "epoch": 0.06746634539835525, | |
| "grad_norm": 0.3940819203853607, | |
| "learning_rate": 0.0001998796811256753, | |
| "loss": 0.0618, | |
| "step": 322 | |
| }, | |
| { | |
| "epoch": 0.06767586821015138, | |
| "grad_norm": 0.1761884242296219, | |
| "learning_rate": 0.0001998785949503914, | |
| "loss": 0.0109, | |
| "step": 323 | |
| }, | |
| { | |
| "epoch": 0.06788539102194752, | |
| "grad_norm": 0.4405103027820587, | |
| "learning_rate": 0.00019987750389738215, | |
| "loss": 0.0874, | |
| "step": 324 | |
| }, | |
| { | |
| "epoch": 0.06809491383374365, | |
| "grad_norm": 0.34329459071159363, | |
| "learning_rate": 0.0001998764079667009, | |
| "loss": 0.0229, | |
| "step": 325 | |
| }, | |
| { | |
| "epoch": 0.06830443664553978, | |
| "grad_norm": 0.26604002714157104, | |
| "learning_rate": 0.0001998753071584012, | |
| "loss": 0.0187, | |
| "step": 326 | |
| }, | |
| { | |
| "epoch": 0.06851395945733592, | |
| "grad_norm": 0.762101411819458, | |
| "learning_rate": 0.0001998742014725367, | |
| "loss": 0.1381, | |
| "step": 327 | |
| }, | |
| { | |
| "epoch": 0.06872348226913205, | |
| "grad_norm": 0.4048270881175995, | |
| "learning_rate": 0.0001998730909091615, | |
| "loss": 0.0635, | |
| "step": 328 | |
| }, | |
| { | |
| "epoch": 0.06893300508092819, | |
| "grad_norm": 0.2603943645954132, | |
| "learning_rate": 0.0001998719754683298, | |
| "loss": 0.0073, | |
| "step": 329 | |
| }, | |
| { | |
| "epoch": 0.06914252789272432, | |
| "grad_norm": 0.36697712540626526, | |
| "learning_rate": 0.00019987085515009605, | |
| "loss": 0.0498, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 0.06935205070452045, | |
| "grad_norm": 0.3427172601222992, | |
| "learning_rate": 0.000199869729954515, | |
| "loss": 0.051, | |
| "step": 331 | |
| }, | |
| { | |
| "epoch": 0.06956157351631659, | |
| "grad_norm": 0.5265083909034729, | |
| "learning_rate": 0.00019986859988164159, | |
| "loss": 0.1354, | |
| "step": 332 | |
| }, | |
| { | |
| "epoch": 0.06977109632811272, | |
| "grad_norm": 0.24376115202903748, | |
| "learning_rate": 0.000199867464931531, | |
| "loss": 0.0258, | |
| "step": 333 | |
| }, | |
| { | |
| "epoch": 0.06998061913990886, | |
| "grad_norm": 0.39624571800231934, | |
| "learning_rate": 0.00019986632510423866, | |
| "loss": 0.0468, | |
| "step": 334 | |
| }, | |
| { | |
| "epoch": 0.07019014195170499, | |
| "grad_norm": 0.3155399560928345, | |
| "learning_rate": 0.00019986518039982024, | |
| "loss": 0.0426, | |
| "step": 335 | |
| }, | |
| { | |
| "epoch": 0.07039966476350112, | |
| "grad_norm": 0.3613176643848419, | |
| "learning_rate": 0.00019986403081833167, | |
| "loss": 0.0499, | |
| "step": 336 | |
| }, | |
| { | |
| "epoch": 0.07060918757529726, | |
| "grad_norm": 0.37132036685943604, | |
| "learning_rate": 0.000199862876359829, | |
| "loss": 0.0516, | |
| "step": 337 | |
| }, | |
| { | |
| "epoch": 0.07081871038709339, | |
| "grad_norm": 0.15536396205425262, | |
| "learning_rate": 0.00019986171702436874, | |
| "loss": 0.0114, | |
| "step": 338 | |
| }, | |
| { | |
| "epoch": 0.07102823319888953, | |
| "grad_norm": 0.3651553690433502, | |
| "learning_rate": 0.0001998605528120074, | |
| "loss": 0.0383, | |
| "step": 339 | |
| }, | |
| { | |
| "epoch": 0.07123775601068566, | |
| "grad_norm": 0.795184850692749, | |
| "learning_rate": 0.00019985938372280192, | |
| "loss": 0.0248, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 0.0714472788224818, | |
| "grad_norm": 0.28453385829925537, | |
| "learning_rate": 0.0001998582097568093, | |
| "loss": 0.0101, | |
| "step": 341 | |
| }, | |
| { | |
| "epoch": 0.07165680163427793, | |
| "grad_norm": 0.4126911461353302, | |
| "learning_rate": 0.00019985703091408694, | |
| "loss": 0.0156, | |
| "step": 342 | |
| }, | |
| { | |
| "epoch": 0.07186632444607406, | |
| "grad_norm": 0.3952067792415619, | |
| "learning_rate": 0.00019985584719469241, | |
| "loss": 0.0614, | |
| "step": 343 | |
| }, | |
| { | |
| "epoch": 0.0720758472578702, | |
| "grad_norm": 0.3046548664569855, | |
| "learning_rate": 0.0001998546585986835, | |
| "loss": 0.0098, | |
| "step": 344 | |
| }, | |
| { | |
| "epoch": 0.07228537006966633, | |
| "grad_norm": 0.46837934851646423, | |
| "learning_rate": 0.00019985346512611826, | |
| "loss": 0.1381, | |
| "step": 345 | |
| }, | |
| { | |
| "epoch": 0.07249489288146246, | |
| "grad_norm": 0.3552689552307129, | |
| "learning_rate": 0.00019985226677705497, | |
| "loss": 0.0574, | |
| "step": 346 | |
| }, | |
| { | |
| "epoch": 0.0727044156932586, | |
| "grad_norm": 0.39785584807395935, | |
| "learning_rate": 0.00019985106355155214, | |
| "loss": 0.1023, | |
| "step": 347 | |
| }, | |
| { | |
| "epoch": 0.07291393850505473, | |
| "grad_norm": 0.4071919322013855, | |
| "learning_rate": 0.00019984985544966856, | |
| "loss": 0.0505, | |
| "step": 348 | |
| }, | |
| { | |
| "epoch": 0.07312346131685087, | |
| "grad_norm": 0.4632468521595001, | |
| "learning_rate": 0.0001998486424714632, | |
| "loss": 0.0877, | |
| "step": 349 | |
| }, | |
| { | |
| "epoch": 0.073332984128647, | |
| "grad_norm": 0.49063947796821594, | |
| "learning_rate": 0.00019984742461699536, | |
| "loss": 0.1152, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 0.07354250694044315, | |
| "grad_norm": 0.3042297959327698, | |
| "learning_rate": 0.00019984620188632447, | |
| "loss": 0.0318, | |
| "step": 351 | |
| }, | |
| { | |
| "epoch": 0.07375202975223928, | |
| "grad_norm": 0.15186455845832825, | |
| "learning_rate": 0.00019984497427951022, | |
| "loss": 0.019, | |
| "step": 352 | |
| }, | |
| { | |
| "epoch": 0.07396155256403542, | |
| "grad_norm": 0.4884166121482849, | |
| "learning_rate": 0.00019984374179661264, | |
| "loss": 0.0994, | |
| "step": 353 | |
| }, | |
| { | |
| "epoch": 0.07417107537583155, | |
| "grad_norm": 0.5241116881370544, | |
| "learning_rate": 0.0001998425044376918, | |
| "loss": 0.083, | |
| "step": 354 | |
| }, | |
| { | |
| "epoch": 0.07438059818762768, | |
| "grad_norm": 0.3421548306941986, | |
| "learning_rate": 0.00019984126220280824, | |
| "loss": 0.0552, | |
| "step": 355 | |
| }, | |
| { | |
| "epoch": 0.07459012099942382, | |
| "grad_norm": 0.5838769674301147, | |
| "learning_rate": 0.00019984001509202256, | |
| "loss": 0.115, | |
| "step": 356 | |
| }, | |
| { | |
| "epoch": 0.07479964381121995, | |
| "grad_norm": 0.27096959948539734, | |
| "learning_rate": 0.0001998387631053957, | |
| "loss": 0.0133, | |
| "step": 357 | |
| }, | |
| { | |
| "epoch": 0.07500916662301609, | |
| "grad_norm": 0.22428373992443085, | |
| "learning_rate": 0.0001998375062429888, | |
| "loss": 0.0149, | |
| "step": 358 | |
| }, | |
| { | |
| "epoch": 0.07521868943481222, | |
| "grad_norm": 0.4558626115322113, | |
| "learning_rate": 0.0001998362445048632, | |
| "loss": 0.1142, | |
| "step": 359 | |
| }, | |
| { | |
| "epoch": 0.07542821224660835, | |
| "grad_norm": 0.17673128843307495, | |
| "learning_rate": 0.00019983497789108058, | |
| "loss": 0.023, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 0.07563773505840449, | |
| "grad_norm": 0.2917342185974121, | |
| "learning_rate": 0.00019983370640170277, | |
| "loss": 0.0132, | |
| "step": 361 | |
| }, | |
| { | |
| "epoch": 0.07584725787020062, | |
| "grad_norm": 0.5691831707954407, | |
| "learning_rate": 0.00019983243003679184, | |
| "loss": 0.117, | |
| "step": 362 | |
| }, | |
| { | |
| "epoch": 0.07605678068199676, | |
| "grad_norm": 0.3779132068157196, | |
| "learning_rate": 0.00019983114879641018, | |
| "loss": 0.0424, | |
| "step": 363 | |
| }, | |
| { | |
| "epoch": 0.07626630349379289, | |
| "grad_norm": 0.1933259516954422, | |
| "learning_rate": 0.0001998298626806203, | |
| "loss": 0.0068, | |
| "step": 364 | |
| }, | |
| { | |
| "epoch": 0.07647582630558902, | |
| "grad_norm": 0.3409664034843445, | |
| "learning_rate": 0.00019982857168948504, | |
| "loss": 0.0299, | |
| "step": 365 | |
| }, | |
| { | |
| "epoch": 0.07668534911738516, | |
| "grad_norm": 0.21561767160892487, | |
| "learning_rate": 0.00019982727582306743, | |
| "loss": 0.014, | |
| "step": 366 | |
| }, | |
| { | |
| "epoch": 0.07689487192918129, | |
| "grad_norm": 0.5830832123756409, | |
| "learning_rate": 0.00019982597508143082, | |
| "loss": 0.0851, | |
| "step": 367 | |
| }, | |
| { | |
| "epoch": 0.07710439474097742, | |
| "grad_norm": 0.33271265029907227, | |
| "learning_rate": 0.00019982466946463862, | |
| "loss": 0.0806, | |
| "step": 368 | |
| }, | |
| { | |
| "epoch": 0.07731391755277356, | |
| "grad_norm": 0.3000403642654419, | |
| "learning_rate": 0.00019982335897275472, | |
| "loss": 0.0338, | |
| "step": 369 | |
| }, | |
| { | |
| "epoch": 0.07752344036456969, | |
| "grad_norm": 0.686974823474884, | |
| "learning_rate": 0.00019982204360584303, | |
| "loss": 0.082, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 0.07773296317636583, | |
| "grad_norm": 0.22148525714874268, | |
| "learning_rate": 0.00019982072336396779, | |
| "loss": 0.0049, | |
| "step": 371 | |
| }, | |
| { | |
| "epoch": 0.07794248598816196, | |
| "grad_norm": 0.35142630338668823, | |
| "learning_rate": 0.0001998193982471935, | |
| "loss": 0.0228, | |
| "step": 372 | |
| }, | |
| { | |
| "epoch": 0.0781520087999581, | |
| "grad_norm": 0.42207226157188416, | |
| "learning_rate": 0.0001998180682555849, | |
| "loss": 0.0082, | |
| "step": 373 | |
| }, | |
| { | |
| "epoch": 0.07836153161175423, | |
| "grad_norm": 0.15880601108074188, | |
| "learning_rate": 0.00019981673338920693, | |
| "loss": 0.0209, | |
| "step": 374 | |
| }, | |
| { | |
| "epoch": 0.07857105442355036, | |
| "grad_norm": 0.24623283743858337, | |
| "learning_rate": 0.00019981539364812473, | |
| "loss": 0.0443, | |
| "step": 375 | |
| }, | |
| { | |
| "epoch": 0.0787805772353465, | |
| "grad_norm": 0.467542439699173, | |
| "learning_rate": 0.00019981404903240377, | |
| "loss": 0.0494, | |
| "step": 376 | |
| }, | |
| { | |
| "epoch": 0.07899010004714263, | |
| "grad_norm": 0.3720758855342865, | |
| "learning_rate": 0.00019981269954210974, | |
| "loss": 0.0221, | |
| "step": 377 | |
| }, | |
| { | |
| "epoch": 0.07919962285893876, | |
| "grad_norm": 0.3619315028190613, | |
| "learning_rate": 0.0001998113451773085, | |
| "loss": 0.0585, | |
| "step": 378 | |
| }, | |
| { | |
| "epoch": 0.0794091456707349, | |
| "grad_norm": 0.26087716221809387, | |
| "learning_rate": 0.00019980998593806617, | |
| "loss": 0.0153, | |
| "step": 379 | |
| }, | |
| { | |
| "epoch": 0.07961866848253103, | |
| "grad_norm": 0.4933098256587982, | |
| "learning_rate": 0.0001998086218244492, | |
| "loss": 0.0653, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 0.07982819129432717, | |
| "grad_norm": 0.27362197637557983, | |
| "learning_rate": 0.00019980725283652418, | |
| "loss": 0.0094, | |
| "step": 381 | |
| }, | |
| { | |
| "epoch": 0.0800377141061233, | |
| "grad_norm": 0.39937883615493774, | |
| "learning_rate": 0.00019980587897435795, | |
| "loss": 0.0496, | |
| "step": 382 | |
| }, | |
| { | |
| "epoch": 0.08024723691791943, | |
| "grad_norm": 0.22025969624519348, | |
| "learning_rate": 0.00019980450023801763, | |
| "loss": 0.0184, | |
| "step": 383 | |
| }, | |
| { | |
| "epoch": 0.08045675972971557, | |
| "grad_norm": 5.886214733123779, | |
| "learning_rate": 0.00019980311662757055, | |
| "loss": 0.0031, | |
| "step": 384 | |
| }, | |
| { | |
| "epoch": 0.0806662825415117, | |
| "grad_norm": 0.43273064494132996, | |
| "learning_rate": 0.00019980172814308426, | |
| "loss": 0.0363, | |
| "step": 385 | |
| }, | |
| { | |
| "epoch": 0.08087580535330784, | |
| "grad_norm": 0.23640966415405273, | |
| "learning_rate": 0.0001998003347846266, | |
| "loss": 0.0313, | |
| "step": 386 | |
| }, | |
| { | |
| "epoch": 0.08108532816510397, | |
| "grad_norm": 0.31189092993736267, | |
| "learning_rate": 0.0001997989365522656, | |
| "loss": 0.0372, | |
| "step": 387 | |
| }, | |
| { | |
| "epoch": 0.0812948509769001, | |
| "grad_norm": 0.5833081007003784, | |
| "learning_rate": 0.00019979753344606947, | |
| "loss": 0.125, | |
| "step": 388 | |
| }, | |
| { | |
| "epoch": 0.08150437378869624, | |
| "grad_norm": 0.2126295268535614, | |
| "learning_rate": 0.00019979612546610687, | |
| "loss": 0.0166, | |
| "step": 389 | |
| }, | |
| { | |
| "epoch": 0.08171389660049237, | |
| "grad_norm": 0.4186943471431732, | |
| "learning_rate": 0.0001997947126124465, | |
| "loss": 0.0833, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 0.0819234194122885, | |
| "grad_norm": 0.143530935049057, | |
| "learning_rate": 0.0001997932948851573, | |
| "loss": 0.013, | |
| "step": 391 | |
| }, | |
| { | |
| "epoch": 0.08213294222408465, | |
| "grad_norm": 0.31951332092285156, | |
| "learning_rate": 0.0001997918722843086, | |
| "loss": 0.0214, | |
| "step": 392 | |
| }, | |
| { | |
| "epoch": 0.08234246503588079, | |
| "grad_norm": 0.32597488164901733, | |
| "learning_rate": 0.00019979044480996985, | |
| "loss": 0.0501, | |
| "step": 393 | |
| }, | |
| { | |
| "epoch": 0.08255198784767692, | |
| "grad_norm": 0.2582109868526459, | |
| "learning_rate": 0.00019978901246221073, | |
| "loss": 0.0358, | |
| "step": 394 | |
| }, | |
| { | |
| "epoch": 0.08276151065947306, | |
| "grad_norm": 0.5526602864265442, | |
| "learning_rate": 0.00019978757524110124, | |
| "loss": 0.0851, | |
| "step": 395 | |
| }, | |
| { | |
| "epoch": 0.08297103347126919, | |
| "grad_norm": 0.26851099729537964, | |
| "learning_rate": 0.0001997861331467115, | |
| "loss": 0.0301, | |
| "step": 396 | |
| }, | |
| { | |
| "epoch": 0.08318055628306532, | |
| "grad_norm": 0.3494580388069153, | |
| "learning_rate": 0.00019978468617911198, | |
| "loss": 0.0483, | |
| "step": 397 | |
| }, | |
| { | |
| "epoch": 0.08339007909486146, | |
| "grad_norm": 0.062350254505872726, | |
| "learning_rate": 0.0001997832343383734, | |
| "loss": 0.0026, | |
| "step": 398 | |
| }, | |
| { | |
| "epoch": 0.08359960190665759, | |
| "grad_norm": 0.28618085384368896, | |
| "learning_rate": 0.00019978177762456652, | |
| "loss": 0.0472, | |
| "step": 399 | |
| }, | |
| { | |
| "epoch": 0.08380912471845373, | |
| "grad_norm": 0.4362439513206482, | |
| "learning_rate": 0.00019978031603776263, | |
| "loss": 0.0664, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.08380912471845373, | |
| "eval_loss": 0.03672989457845688, | |
| "eval_runtime": 89.1437, | |
| "eval_samples_per_second": 8.615, | |
| "eval_steps_per_second": 4.308, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.08401864753024986, | |
| "grad_norm": 0.264435350894928, | |
| "learning_rate": 0.000199778849578033, | |
| "loss": 0.0699, | |
| "step": 401 | |
| }, | |
| { | |
| "epoch": 0.084228170342046, | |
| "grad_norm": 0.27643996477127075, | |
| "learning_rate": 0.00019977737824544928, | |
| "loss": 0.0324, | |
| "step": 402 | |
| }, | |
| { | |
| "epoch": 0.08443769315384213, | |
| "grad_norm": 0.22616292536258698, | |
| "learning_rate": 0.00019977590204008338, | |
| "loss": 0.0119, | |
| "step": 403 | |
| }, | |
| { | |
| "epoch": 0.08464721596563826, | |
| "grad_norm": 0.3187446594238281, | |
| "learning_rate": 0.00019977442096200733, | |
| "loss": 0.0118, | |
| "step": 404 | |
| }, | |
| { | |
| "epoch": 0.0848567387774344, | |
| "grad_norm": 0.42286938428878784, | |
| "learning_rate": 0.00019977293501129349, | |
| "loss": 0.0548, | |
| "step": 405 | |
| }, | |
| { | |
| "epoch": 0.08506626158923053, | |
| "grad_norm": 0.3166376054286957, | |
| "learning_rate": 0.0001997714441880144, | |
| "loss": 0.0521, | |
| "step": 406 | |
| }, | |
| { | |
| "epoch": 0.08527578440102666, | |
| "grad_norm": 17.92824935913086, | |
| "learning_rate": 0.0001997699484922429, | |
| "loss": 0.0271, | |
| "step": 407 | |
| }, | |
| { | |
| "epoch": 0.0854853072128228, | |
| "grad_norm": 0.4461129307746887, | |
| "learning_rate": 0.00019976844792405198, | |
| "loss": 0.0275, | |
| "step": 408 | |
| }, | |
| { | |
| "epoch": 0.08569483002461893, | |
| "grad_norm": 0.27550551295280457, | |
| "learning_rate": 0.000199766942483515, | |
| "loss": 0.048, | |
| "step": 409 | |
| }, | |
| { | |
| "epoch": 0.08590435283641507, | |
| "grad_norm": 0.24863511323928833, | |
| "learning_rate": 0.00019976543217070541, | |
| "loss": 0.0251, | |
| "step": 410 | |
| }, | |
| { | |
| "epoch": 0.0861138756482112, | |
| "grad_norm": 0.16819795966148376, | |
| "learning_rate": 0.00019976391698569703, | |
| "loss": 0.0053, | |
| "step": 411 | |
| }, | |
| { | |
| "epoch": 0.08632339846000733, | |
| "grad_norm": 0.4115440547466278, | |
| "learning_rate": 0.00019976239692856383, | |
| "loss": 0.0581, | |
| "step": 412 | |
| }, | |
| { | |
| "epoch": 0.08653292127180347, | |
| "grad_norm": 0.26209789514541626, | |
| "learning_rate": 0.00019976087199938004, | |
| "loss": 0.0267, | |
| "step": 413 | |
| }, | |
| { | |
| "epoch": 0.0867424440835996, | |
| "grad_norm": 0.2739785313606262, | |
| "learning_rate": 0.0001997593421982201, | |
| "loss": 0.042, | |
| "step": 414 | |
| }, | |
| { | |
| "epoch": 0.08695196689539574, | |
| "grad_norm": 0.343146413564682, | |
| "learning_rate": 0.0001997578075251588, | |
| "loss": 0.0505, | |
| "step": 415 | |
| }, | |
| { | |
| "epoch": 0.08716148970719187, | |
| "grad_norm": 0.4430124759674072, | |
| "learning_rate": 0.000199756267980271, | |
| "loss": 0.0837, | |
| "step": 416 | |
| }, | |
| { | |
| "epoch": 0.087371012518988, | |
| "grad_norm": 0.2285781353712082, | |
| "learning_rate": 0.00019975472356363193, | |
| "loss": 0.0207, | |
| "step": 417 | |
| }, | |
| { | |
| "epoch": 0.08758053533078414, | |
| "grad_norm": 0.4867056608200073, | |
| "learning_rate": 0.00019975317427531705, | |
| "loss": 0.068, | |
| "step": 418 | |
| }, | |
| { | |
| "epoch": 0.08779005814258027, | |
| "grad_norm": 0.2114226073026657, | |
| "learning_rate": 0.00019975162011540197, | |
| "loss": 0.0037, | |
| "step": 419 | |
| }, | |
| { | |
| "epoch": 0.0879995809543764, | |
| "grad_norm": 0.3507726788520813, | |
| "learning_rate": 0.00019975006108396257, | |
| "loss": 0.0473, | |
| "step": 420 | |
| }, | |
| { | |
| "epoch": 0.08820910376617254, | |
| "grad_norm": 0.346073716878891, | |
| "learning_rate": 0.00019974849718107506, | |
| "loss": 0.0297, | |
| "step": 421 | |
| }, | |
| { | |
| "epoch": 0.08841862657796867, | |
| "grad_norm": 0.1917935311794281, | |
| "learning_rate": 0.00019974692840681578, | |
| "loss": 0.0312, | |
| "step": 422 | |
| }, | |
| { | |
| "epoch": 0.08862814938976481, | |
| "grad_norm": 0.2887978255748749, | |
| "learning_rate": 0.0001997453547612613, | |
| "loss": 0.0281, | |
| "step": 423 | |
| }, | |
| { | |
| "epoch": 0.08883767220156094, | |
| "grad_norm": 0.268467515707016, | |
| "learning_rate": 0.00019974377624448853, | |
| "loss": 0.024, | |
| "step": 424 | |
| }, | |
| { | |
| "epoch": 0.08904719501335707, | |
| "grad_norm": 0.24345600605010986, | |
| "learning_rate": 0.00019974219285657453, | |
| "loss": 0.0136, | |
| "step": 425 | |
| }, | |
| { | |
| "epoch": 0.08925671782515321, | |
| "grad_norm": 0.3125511705875397, | |
| "learning_rate": 0.0001997406045975967, | |
| "loss": 0.0234, | |
| "step": 426 | |
| }, | |
| { | |
| "epoch": 0.08946624063694934, | |
| "grad_norm": 0.13774999976158142, | |
| "learning_rate": 0.00019973901146763247, | |
| "loss": 0.0119, | |
| "step": 427 | |
| }, | |
| { | |
| "epoch": 0.08967576344874548, | |
| "grad_norm": 0.3603483736515045, | |
| "learning_rate": 0.00019973741346675973, | |
| "loss": 0.0682, | |
| "step": 428 | |
| }, | |
| { | |
| "epoch": 0.08988528626054161, | |
| "grad_norm": 0.3651808500289917, | |
| "learning_rate": 0.00019973581059505656, | |
| "loss": 0.0447, | |
| "step": 429 | |
| }, | |
| { | |
| "epoch": 0.09009480907233774, | |
| "grad_norm": 0.4079362154006958, | |
| "learning_rate": 0.0001997342028526011, | |
| "loss": 0.0625, | |
| "step": 430 | |
| }, | |
| { | |
| "epoch": 0.09030433188413388, | |
| "grad_norm": 0.2838890254497528, | |
| "learning_rate": 0.000199732590239472, | |
| "loss": 0.056, | |
| "step": 431 | |
| }, | |
| { | |
| "epoch": 0.09051385469593001, | |
| "grad_norm": 0.5139966011047363, | |
| "learning_rate": 0.00019973097275574798, | |
| "loss": 0.1074, | |
| "step": 432 | |
| }, | |
| { | |
| "epoch": 0.09072337750772616, | |
| "grad_norm": 0.04335456341505051, | |
| "learning_rate": 0.000199729350401508, | |
| "loss": 0.001, | |
| "step": 433 | |
| }, | |
| { | |
| "epoch": 0.0909329003195223, | |
| "grad_norm": 0.22099369764328003, | |
| "learning_rate": 0.0001997277231768313, | |
| "loss": 0.0229, | |
| "step": 434 | |
| }, | |
| { | |
| "epoch": 0.09114242313131843, | |
| "grad_norm": 0.32649365067481995, | |
| "learning_rate": 0.00019972609108179738, | |
| "loss": 0.0403, | |
| "step": 435 | |
| }, | |
| { | |
| "epoch": 0.09135194594311456, | |
| "grad_norm": 0.09762894362211227, | |
| "learning_rate": 0.00019972445411648593, | |
| "loss": 0.0063, | |
| "step": 436 | |
| }, | |
| { | |
| "epoch": 0.0915614687549107, | |
| "grad_norm": 0.45374247431755066, | |
| "learning_rate": 0.00019972281228097685, | |
| "loss": 0.073, | |
| "step": 437 | |
| }, | |
| { | |
| "epoch": 0.09177099156670683, | |
| "grad_norm": 0.5042026042938232, | |
| "learning_rate": 0.0001997211655753504, | |
| "loss": 0.0784, | |
| "step": 438 | |
| }, | |
| { | |
| "epoch": 0.09198051437850296, | |
| "grad_norm": 0.2711179852485657, | |
| "learning_rate": 0.00019971951399968695, | |
| "loss": 0.0391, | |
| "step": 439 | |
| }, | |
| { | |
| "epoch": 0.0921900371902991, | |
| "grad_norm": 0.3778410851955414, | |
| "learning_rate": 0.00019971785755406712, | |
| "loss": 0.0598, | |
| "step": 440 | |
| }, | |
| { | |
| "epoch": 0.09239956000209523, | |
| "grad_norm": 0.2895963191986084, | |
| "learning_rate": 0.0001997161962385719, | |
| "loss": 0.0362, | |
| "step": 441 | |
| }, | |
| { | |
| "epoch": 0.09260908281389137, | |
| "grad_norm": 0.2975994944572449, | |
| "learning_rate": 0.00019971453005328233, | |
| "loss": 0.0398, | |
| "step": 442 | |
| }, | |
| { | |
| "epoch": 0.0928186056256875, | |
| "grad_norm": 0.3291097581386566, | |
| "learning_rate": 0.00019971285899827987, | |
| "loss": 0.0506, | |
| "step": 443 | |
| }, | |
| { | |
| "epoch": 0.09302812843748363, | |
| "grad_norm": 0.20877154171466827, | |
| "learning_rate": 0.00019971118307364605, | |
| "loss": 0.0232, | |
| "step": 444 | |
| }, | |
| { | |
| "epoch": 0.09323765124927977, | |
| "grad_norm": 0.2314630150794983, | |
| "learning_rate": 0.00019970950227946274, | |
| "loss": 0.0342, | |
| "step": 445 | |
| }, | |
| { | |
| "epoch": 0.0934471740610759, | |
| "grad_norm": 0.30340278148651123, | |
| "learning_rate": 0.00019970781661581208, | |
| "loss": 0.0384, | |
| "step": 446 | |
| }, | |
| { | |
| "epoch": 0.09365669687287204, | |
| "grad_norm": 0.17421570420265198, | |
| "learning_rate": 0.00019970612608277631, | |
| "loss": 0.0079, | |
| "step": 447 | |
| }, | |
| { | |
| "epoch": 0.09386621968466817, | |
| "grad_norm": 0.1339452713727951, | |
| "learning_rate": 0.00019970443068043805, | |
| "loss": 0.0036, | |
| "step": 448 | |
| }, | |
| { | |
| "epoch": 0.0940757424964643, | |
| "grad_norm": 0.10046014189720154, | |
| "learning_rate": 0.00019970273040888003, | |
| "loss": 0.0022, | |
| "step": 449 | |
| }, | |
| { | |
| "epoch": 0.09428526530826044, | |
| "grad_norm": 0.21752049028873444, | |
| "learning_rate": 0.00019970102526818538, | |
| "loss": 0.0028, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 0.09449478812005657, | |
| "grad_norm": 0.38837727904319763, | |
| "learning_rate": 0.00019969931525843726, | |
| "loss": 0.0535, | |
| "step": 451 | |
| }, | |
| { | |
| "epoch": 0.0947043109318527, | |
| "grad_norm": 0.15972809493541718, | |
| "learning_rate": 0.00019969760037971928, | |
| "loss": 0.0041, | |
| "step": 452 | |
| }, | |
| { | |
| "epoch": 0.09491383374364884, | |
| "grad_norm": 0.08293309062719345, | |
| "learning_rate": 0.00019969588063211514, | |
| "loss": 0.0013, | |
| "step": 453 | |
| }, | |
| { | |
| "epoch": 0.09512335655544497, | |
| "grad_norm": 0.3711838722229004, | |
| "learning_rate": 0.00019969415601570883, | |
| "loss": 0.0566, | |
| "step": 454 | |
| }, | |
| { | |
| "epoch": 0.09533287936724111, | |
| "grad_norm": 0.21283899247646332, | |
| "learning_rate": 0.00019969242653058463, | |
| "loss": 0.0134, | |
| "step": 455 | |
| }, | |
| { | |
| "epoch": 0.09554240217903724, | |
| "grad_norm": 0.4132600724697113, | |
| "learning_rate": 0.0001996906921768269, | |
| "loss": 0.0615, | |
| "step": 456 | |
| }, | |
| { | |
| "epoch": 0.09575192499083338, | |
| "grad_norm": 0.37747833132743835, | |
| "learning_rate": 0.00019968895295452042, | |
| "loss": 0.0832, | |
| "step": 457 | |
| }, | |
| { | |
| "epoch": 0.09596144780262951, | |
| "grad_norm": 0.23868821561336517, | |
| "learning_rate": 0.00019968720886375007, | |
| "loss": 0.0133, | |
| "step": 458 | |
| }, | |
| { | |
| "epoch": 0.09617097061442564, | |
| "grad_norm": 0.23426426947116852, | |
| "learning_rate": 0.0001996854599046011, | |
| "loss": 0.0075, | |
| "step": 459 | |
| }, | |
| { | |
| "epoch": 0.09638049342622178, | |
| "grad_norm": 0.5458897352218628, | |
| "learning_rate": 0.00019968370607715885, | |
| "loss": 0.151, | |
| "step": 460 | |
| }, | |
| { | |
| "epoch": 0.09659001623801791, | |
| "grad_norm": 0.12708933651447296, | |
| "learning_rate": 0.00019968194738150902, | |
| "loss": 0.0037, | |
| "step": 461 | |
| }, | |
| { | |
| "epoch": 0.09679953904981405, | |
| "grad_norm": 0.19058242440223694, | |
| "learning_rate": 0.00019968018381773744, | |
| "loss": 0.0158, | |
| "step": 462 | |
| }, | |
| { | |
| "epoch": 0.09700906186161018, | |
| "grad_norm": 0.42510750889778137, | |
| "learning_rate": 0.0001996784153859303, | |
| "loss": 0.0818, | |
| "step": 463 | |
| }, | |
| { | |
| "epoch": 0.09721858467340631, | |
| "grad_norm": 0.17952972650527954, | |
| "learning_rate": 0.00019967664208617395, | |
| "loss": 0.004, | |
| "step": 464 | |
| }, | |
| { | |
| "epoch": 0.09742810748520245, | |
| "grad_norm": 0.255454421043396, | |
| "learning_rate": 0.00019967486391855497, | |
| "loss": 0.0224, | |
| "step": 465 | |
| }, | |
| { | |
| "epoch": 0.09763763029699858, | |
| "grad_norm": 0.07083744555711746, | |
| "learning_rate": 0.0001996730808831602, | |
| "loss": 0.001, | |
| "step": 466 | |
| }, | |
| { | |
| "epoch": 0.09784715310879472, | |
| "grad_norm": 0.1643357276916504, | |
| "learning_rate": 0.00019967129298007676, | |
| "loss": 0.0042, | |
| "step": 467 | |
| }, | |
| { | |
| "epoch": 0.09805667592059085, | |
| "grad_norm": 0.3091591000556946, | |
| "learning_rate": 0.0001996695002093919, | |
| "loss": 0.0279, | |
| "step": 468 | |
| }, | |
| { | |
| "epoch": 0.09826619873238698, | |
| "grad_norm": 0.1364019513130188, | |
| "learning_rate": 0.00019966770257119322, | |
| "loss": 0.0031, | |
| "step": 469 | |
| }, | |
| { | |
| "epoch": 0.09847572154418312, | |
| "grad_norm": 0.12853386998176575, | |
| "learning_rate": 0.00019966590006556848, | |
| "loss": 0.0032, | |
| "step": 470 | |
| }, | |
| { | |
| "epoch": 0.09868524435597925, | |
| "grad_norm": 0.39151233434677124, | |
| "learning_rate": 0.00019966409269260577, | |
| "loss": 0.0614, | |
| "step": 471 | |
| }, | |
| { | |
| "epoch": 0.09889476716777539, | |
| "grad_norm": 0.013196398504078388, | |
| "learning_rate": 0.00019966228045239327, | |
| "loss": 0.0002, | |
| "step": 472 | |
| }, | |
| { | |
| "epoch": 0.09910428997957152, | |
| "grad_norm": 0.1299104243516922, | |
| "learning_rate": 0.00019966046334501952, | |
| "loss": 0.0029, | |
| "step": 473 | |
| }, | |
| { | |
| "epoch": 0.09931381279136765, | |
| "grad_norm": 0.4250582456588745, | |
| "learning_rate": 0.0001996586413705733, | |
| "loss": 0.0176, | |
| "step": 474 | |
| }, | |
| { | |
| "epoch": 0.0995233356031638, | |
| "grad_norm": 0.1893891841173172, | |
| "learning_rate": 0.0001996568145291435, | |
| "loss": 0.0283, | |
| "step": 475 | |
| }, | |
| { | |
| "epoch": 0.09973285841495994, | |
| "grad_norm": 0.4147910475730896, | |
| "learning_rate": 0.00019965498282081945, | |
| "loss": 0.048, | |
| "step": 476 | |
| }, | |
| { | |
| "epoch": 0.09994238122675607, | |
| "grad_norm": 0.28522536158561707, | |
| "learning_rate": 0.0001996531462456905, | |
| "loss": 0.0333, | |
| "step": 477 | |
| }, | |
| { | |
| "epoch": 0.1001519040385522, | |
| "grad_norm": 0.3188202977180481, | |
| "learning_rate": 0.0001996513048038464, | |
| "loss": 0.0127, | |
| "step": 478 | |
| }, | |
| { | |
| "epoch": 0.10036142685034834, | |
| "grad_norm": 0.44609835743904114, | |
| "learning_rate": 0.00019964945849537707, | |
| "loss": 0.0579, | |
| "step": 479 | |
| }, | |
| { | |
| "epoch": 0.10057094966214447, | |
| "grad_norm": 0.21903985738754272, | |
| "learning_rate": 0.00019964760732037266, | |
| "loss": 0.0105, | |
| "step": 480 | |
| }, | |
| { | |
| "epoch": 0.1007804724739406, | |
| "grad_norm": 0.4808081388473511, | |
| "learning_rate": 0.00019964575127892362, | |
| "loss": 0.0644, | |
| "step": 481 | |
| }, | |
| { | |
| "epoch": 0.10098999528573674, | |
| "grad_norm": 0.32994869351387024, | |
| "learning_rate": 0.00019964389037112055, | |
| "loss": 0.0401, | |
| "step": 482 | |
| }, | |
| { | |
| "epoch": 0.10119951809753287, | |
| "grad_norm": 0.32692381739616394, | |
| "learning_rate": 0.00019964202459705433, | |
| "loss": 0.0316, | |
| "step": 483 | |
| }, | |
| { | |
| "epoch": 0.101409040909329, | |
| "grad_norm": 0.24021996557712555, | |
| "learning_rate": 0.0001996401539568161, | |
| "loss": 0.0122, | |
| "step": 484 | |
| }, | |
| { | |
| "epoch": 0.10161856372112514, | |
| "grad_norm": 0.4242231845855713, | |
| "learning_rate": 0.00019963827845049717, | |
| "loss": 0.0038, | |
| "step": 485 | |
| }, | |
| { | |
| "epoch": 0.10182808653292127, | |
| "grad_norm": 0.028105545789003372, | |
| "learning_rate": 0.00019963639807818922, | |
| "loss": 0.0005, | |
| "step": 486 | |
| }, | |
| { | |
| "epoch": 0.10203760934471741, | |
| "grad_norm": 0.45947086811065674, | |
| "learning_rate": 0.000199634512839984, | |
| "loss": 0.0611, | |
| "step": 487 | |
| }, | |
| { | |
| "epoch": 0.10224713215651354, | |
| "grad_norm": 0.14129653573036194, | |
| "learning_rate": 0.00019963262273597362, | |
| "loss": 0.0093, | |
| "step": 488 | |
| }, | |
| { | |
| "epoch": 0.10245665496830968, | |
| "grad_norm": 0.2705402970314026, | |
| "learning_rate": 0.00019963072776625035, | |
| "loss": 0.0236, | |
| "step": 489 | |
| }, | |
| { | |
| "epoch": 0.10266617778010581, | |
| "grad_norm": 0.24441330134868622, | |
| "learning_rate": 0.0001996288279309068, | |
| "loss": 0.0318, | |
| "step": 490 | |
| }, | |
| { | |
| "epoch": 0.10287570059190194, | |
| "grad_norm": 0.2647246718406677, | |
| "learning_rate": 0.0001996269232300357, | |
| "loss": 0.0095, | |
| "step": 491 | |
| }, | |
| { | |
| "epoch": 0.10308522340369808, | |
| "grad_norm": 0.06135563924908638, | |
| "learning_rate": 0.00019962501366373005, | |
| "loss": 0.0012, | |
| "step": 492 | |
| }, | |
| { | |
| "epoch": 0.10329474621549421, | |
| "grad_norm": 0.4516589045524597, | |
| "learning_rate": 0.00019962309923208315, | |
| "loss": 0.0518, | |
| "step": 493 | |
| }, | |
| { | |
| "epoch": 0.10350426902729035, | |
| "grad_norm": 0.18813203275203705, | |
| "learning_rate": 0.0001996211799351885, | |
| "loss": 0.0054, | |
| "step": 494 | |
| }, | |
| { | |
| "epoch": 0.10371379183908648, | |
| "grad_norm": 0.48847323656082153, | |
| "learning_rate": 0.00019961925577313978, | |
| "loss": 0.0173, | |
| "step": 495 | |
| }, | |
| { | |
| "epoch": 0.10392331465088261, | |
| "grad_norm": 0.012579197995364666, | |
| "learning_rate": 0.000199617326746031, | |
| "loss": 0.0002, | |
| "step": 496 | |
| }, | |
| { | |
| "epoch": 0.10413283746267875, | |
| "grad_norm": 0.6042206287384033, | |
| "learning_rate": 0.00019961539285395636, | |
| "loss": 0.0135, | |
| "step": 497 | |
| }, | |
| { | |
| "epoch": 0.10434236027447488, | |
| "grad_norm": 0.05990588292479515, | |
| "learning_rate": 0.00019961345409701028, | |
| "loss": 0.001, | |
| "step": 498 | |
| }, | |
| { | |
| "epoch": 0.10455188308627102, | |
| "grad_norm": 0.41477465629577637, | |
| "learning_rate": 0.0001996115104752875, | |
| "loss": 0.0703, | |
| "step": 499 | |
| }, | |
| { | |
| "epoch": 0.10476140589806715, | |
| "grad_norm": 0.06293825805187225, | |
| "learning_rate": 0.00019960956198888287, | |
| "loss": 0.001, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.10497092870986328, | |
| "grad_norm": 0.36649006605148315, | |
| "learning_rate": 0.0001996076086378916, | |
| "loss": 0.0534, | |
| "step": 501 | |
| }, | |
| { | |
| "epoch": 0.10518045152165942, | |
| "grad_norm": 0.29327359795570374, | |
| "learning_rate": 0.00019960565042240907, | |
| "loss": 0.022, | |
| "step": 502 | |
| }, | |
| { | |
| "epoch": 0.10538997433345555, | |
| "grad_norm": 0.3998446762561798, | |
| "learning_rate": 0.0001996036873425309, | |
| "loss": 0.0819, | |
| "step": 503 | |
| }, | |
| { | |
| "epoch": 0.10559949714525169, | |
| "grad_norm": 0.43492838740348816, | |
| "learning_rate": 0.00019960171939835297, | |
| "loss": 0.0237, | |
| "step": 504 | |
| }, | |
| { | |
| "epoch": 0.10580901995704782, | |
| "grad_norm": 0.3007138967514038, | |
| "learning_rate": 0.00019959974658997142, | |
| "loss": 0.015, | |
| "step": 505 | |
| }, | |
| { | |
| "epoch": 0.10601854276884395, | |
| "grad_norm": 0.10651643574237823, | |
| "learning_rate": 0.0001995977689174825, | |
| "loss": 0.0054, | |
| "step": 506 | |
| }, | |
| { | |
| "epoch": 0.10622806558064009, | |
| "grad_norm": 0.3926455080509186, | |
| "learning_rate": 0.00019959578638098288, | |
| "loss": 0.0468, | |
| "step": 507 | |
| }, | |
| { | |
| "epoch": 0.10643758839243622, | |
| "grad_norm": 0.4921119511127472, | |
| "learning_rate": 0.00019959379898056937, | |
| "loss": 0.0352, | |
| "step": 508 | |
| }, | |
| { | |
| "epoch": 0.10664711120423236, | |
| "grad_norm": 0.15699435770511627, | |
| "learning_rate": 0.000199591806716339, | |
| "loss": 0.0058, | |
| "step": 509 | |
| }, | |
| { | |
| "epoch": 0.10685663401602849, | |
| "grad_norm": 0.1476970762014389, | |
| "learning_rate": 0.00019958980958838907, | |
| "loss": 0.0176, | |
| "step": 510 | |
| }, | |
| { | |
| "epoch": 0.10706615682782462, | |
| "grad_norm": 0.24107927083969116, | |
| "learning_rate": 0.00019958780759681712, | |
| "loss": 0.015, | |
| "step": 511 | |
| }, | |
| { | |
| "epoch": 0.10727567963962076, | |
| "grad_norm": 0.27523073554039, | |
| "learning_rate": 0.00019958580074172093, | |
| "loss": 0.0332, | |
| "step": 512 | |
| }, | |
| { | |
| "epoch": 0.10748520245141689, | |
| "grad_norm": 0.32143285870552063, | |
| "learning_rate": 0.0001995837890231985, | |
| "loss": 0.0221, | |
| "step": 513 | |
| }, | |
| { | |
| "epoch": 0.10769472526321303, | |
| "grad_norm": 0.12730306386947632, | |
| "learning_rate": 0.00019958177244134805, | |
| "loss": 0.0035, | |
| "step": 514 | |
| }, | |
| { | |
| "epoch": 0.10790424807500916, | |
| "grad_norm": 0.09283745288848877, | |
| "learning_rate": 0.00019957975099626812, | |
| "loss": 0.0067, | |
| "step": 515 | |
| }, | |
| { | |
| "epoch": 0.10811377088680531, | |
| "grad_norm": 0.20224162936210632, | |
| "learning_rate": 0.00019957772468805738, | |
| "loss": 0.0178, | |
| "step": 516 | |
| }, | |
| { | |
| "epoch": 0.10832329369860144, | |
| "grad_norm": 0.5251257419586182, | |
| "learning_rate": 0.0001995756935168148, | |
| "loss": 0.1334, | |
| "step": 517 | |
| }, | |
| { | |
| "epoch": 0.10853281651039758, | |
| "grad_norm": 0.21088866889476776, | |
| "learning_rate": 0.00019957365748263958, | |
| "loss": 0.0055, | |
| "step": 518 | |
| }, | |
| { | |
| "epoch": 0.10874233932219371, | |
| "grad_norm": 0.22367249429225922, | |
| "learning_rate": 0.00019957161658563116, | |
| "loss": 0.0097, | |
| "step": 519 | |
| }, | |
| { | |
| "epoch": 0.10895186213398984, | |
| "grad_norm": 0.2710024118423462, | |
| "learning_rate": 0.00019956957082588924, | |
| "loss": 0.0435, | |
| "step": 520 | |
| }, | |
| { | |
| "epoch": 0.10916138494578598, | |
| "grad_norm": 0.021475620567798615, | |
| "learning_rate": 0.00019956752020351367, | |
| "loss": 0.0004, | |
| "step": 521 | |
| }, | |
| { | |
| "epoch": 0.10937090775758211, | |
| "grad_norm": 0.2687474489212036, | |
| "learning_rate": 0.00019956546471860457, | |
| "loss": 0.0292, | |
| "step": 522 | |
| }, | |
| { | |
| "epoch": 0.10958043056937825, | |
| "grad_norm": 0.21540652215480804, | |
| "learning_rate": 0.00019956340437126243, | |
| "loss": 0.0088, | |
| "step": 523 | |
| }, | |
| { | |
| "epoch": 0.10978995338117438, | |
| "grad_norm": 0.009567869827151299, | |
| "learning_rate": 0.00019956133916158777, | |
| "loss": 0.0002, | |
| "step": 524 | |
| }, | |
| { | |
| "epoch": 0.10999947619297051, | |
| "grad_norm": 0.1552845984697342, | |
| "learning_rate": 0.00019955926908968148, | |
| "loss": 0.0216, | |
| "step": 525 | |
| }, | |
| { | |
| "epoch": 0.11020899900476665, | |
| "grad_norm": 0.21615681052207947, | |
| "learning_rate": 0.0001995571941556447, | |
| "loss": 0.025, | |
| "step": 526 | |
| }, | |
| { | |
| "epoch": 0.11041852181656278, | |
| "grad_norm": 0.08468720316886902, | |
| "learning_rate": 0.0001995551143595787, | |
| "loss": 0.0012, | |
| "step": 527 | |
| }, | |
| { | |
| "epoch": 0.11062804462835892, | |
| "grad_norm": 0.4749722480773926, | |
| "learning_rate": 0.00019955302970158507, | |
| "loss": 0.0218, | |
| "step": 528 | |
| }, | |
| { | |
| "epoch": 0.11083756744015505, | |
| "grad_norm": 0.2639084458351135, | |
| "learning_rate": 0.00019955094018176564, | |
| "loss": 0.0293, | |
| "step": 529 | |
| }, | |
| { | |
| "epoch": 0.11104709025195118, | |
| "grad_norm": 0.01069062389433384, | |
| "learning_rate": 0.00019954884580022244, | |
| "loss": 0.0003, | |
| "step": 530 | |
| }, | |
| { | |
| "epoch": 0.11125661306374732, | |
| "grad_norm": 0.2846812903881073, | |
| "learning_rate": 0.00019954674655705773, | |
| "loss": 0.0147, | |
| "step": 531 | |
| }, | |
| { | |
| "epoch": 0.11146613587554345, | |
| "grad_norm": 0.21964187920093536, | |
| "learning_rate": 0.00019954464245237408, | |
| "loss": 0.0174, | |
| "step": 532 | |
| }, | |
| { | |
| "epoch": 0.11167565868733959, | |
| "grad_norm": 0.19246606528759003, | |
| "learning_rate": 0.00019954253348627418, | |
| "loss": 0.0037, | |
| "step": 533 | |
| }, | |
| { | |
| "epoch": 0.11188518149913572, | |
| "grad_norm": 0.20292885601520538, | |
| "learning_rate": 0.0001995404196588611, | |
| "loss": 0.0133, | |
| "step": 534 | |
| }, | |
| { | |
| "epoch": 0.11209470431093185, | |
| "grad_norm": 0.11336927860975266, | |
| "learning_rate": 0.000199538300970238, | |
| "loss": 0.0019, | |
| "step": 535 | |
| }, | |
| { | |
| "epoch": 0.11230422712272799, | |
| "grad_norm": 0.32474613189697266, | |
| "learning_rate": 0.0001995361774205084, | |
| "loss": 0.034, | |
| "step": 536 | |
| }, | |
| { | |
| "epoch": 0.11251374993452412, | |
| "grad_norm": 0.21186456084251404, | |
| "learning_rate": 0.000199534049009776, | |
| "loss": 0.0139, | |
| "step": 537 | |
| }, | |
| { | |
| "epoch": 0.11272327274632025, | |
| "grad_norm": 0.33177071809768677, | |
| "learning_rate": 0.0001995319157381447, | |
| "loss": 0.0333, | |
| "step": 538 | |
| }, | |
| { | |
| "epoch": 0.11293279555811639, | |
| "grad_norm": 0.4328499734401703, | |
| "learning_rate": 0.00019952977760571874, | |
| "loss": 0.0529, | |
| "step": 539 | |
| }, | |
| { | |
| "epoch": 0.11314231836991252, | |
| "grad_norm": 0.2981981933116913, | |
| "learning_rate": 0.00019952763461260253, | |
| "loss": 0.0319, | |
| "step": 540 | |
| }, | |
| { | |
| "epoch": 0.11335184118170866, | |
| "grad_norm": 0.15183664858341217, | |
| "learning_rate": 0.0001995254867589007, | |
| "loss": 0.0021, | |
| "step": 541 | |
| }, | |
| { | |
| "epoch": 0.11356136399350479, | |
| "grad_norm": 0.42127111554145813, | |
| "learning_rate": 0.00019952333404471814, | |
| "loss": 0.0519, | |
| "step": 542 | |
| }, | |
| { | |
| "epoch": 0.11377088680530092, | |
| "grad_norm": 0.3105916976928711, | |
| "learning_rate": 0.00019952117647015997, | |
| "loss": 0.0263, | |
| "step": 543 | |
| }, | |
| { | |
| "epoch": 0.11398040961709706, | |
| "grad_norm": 0.39538949728012085, | |
| "learning_rate": 0.00019951901403533165, | |
| "loss": 0.0662, | |
| "step": 544 | |
| }, | |
| { | |
| "epoch": 0.11418993242889319, | |
| "grad_norm": 0.09913661330938339, | |
| "learning_rate": 0.00019951684674033868, | |
| "loss": 0.0017, | |
| "step": 545 | |
| }, | |
| { | |
| "epoch": 0.11439945524068933, | |
| "grad_norm": 0.11607985198497772, | |
| "learning_rate": 0.00019951467458528694, | |
| "loss": 0.0046, | |
| "step": 546 | |
| }, | |
| { | |
| "epoch": 0.11460897805248546, | |
| "grad_norm": 0.018681658431887627, | |
| "learning_rate": 0.00019951249757028255, | |
| "loss": 0.0002, | |
| "step": 547 | |
| }, | |
| { | |
| "epoch": 0.1148185008642816, | |
| "grad_norm": 0.250102162361145, | |
| "learning_rate": 0.00019951031569543176, | |
| "loss": 0.0149, | |
| "step": 548 | |
| }, | |
| { | |
| "epoch": 0.11502802367607773, | |
| "grad_norm": 0.08178752660751343, | |
| "learning_rate": 0.00019950812896084115, | |
| "loss": 0.0015, | |
| "step": 549 | |
| }, | |
| { | |
| "epoch": 0.11523754648787386, | |
| "grad_norm": 0.12305411696434021, | |
| "learning_rate": 0.00019950593736661753, | |
| "loss": 0.0101, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 0.11544706929967, | |
| "grad_norm": 0.2741960287094116, | |
| "learning_rate": 0.00019950374091286794, | |
| "loss": 0.0319, | |
| "step": 551 | |
| }, | |
| { | |
| "epoch": 0.11565659211146613, | |
| "grad_norm": 0.18848703801631927, | |
| "learning_rate": 0.0001995015395996996, | |
| "loss": 0.0123, | |
| "step": 552 | |
| }, | |
| { | |
| "epoch": 0.11586611492326226, | |
| "grad_norm": 0.04150771722197533, | |
| "learning_rate": 0.00019949933342722006, | |
| "loss": 0.0007, | |
| "step": 553 | |
| }, | |
| { | |
| "epoch": 0.1160756377350584, | |
| "grad_norm": 0.4060817062854767, | |
| "learning_rate": 0.00019949712239553702, | |
| "loss": 0.0568, | |
| "step": 554 | |
| }, | |
| { | |
| "epoch": 0.11628516054685453, | |
| "grad_norm": 0.2881668210029602, | |
| "learning_rate": 0.00019949490650475848, | |
| "loss": 0.0156, | |
| "step": 555 | |
| }, | |
| { | |
| "epoch": 0.11649468335865067, | |
| "grad_norm": 0.23062264919281006, | |
| "learning_rate": 0.0001994926857549927, | |
| "loss": 0.0144, | |
| "step": 556 | |
| }, | |
| { | |
| "epoch": 0.11670420617044681, | |
| "grad_norm": 0.43525660037994385, | |
| "learning_rate": 0.00019949046014634806, | |
| "loss": 0.0678, | |
| "step": 557 | |
| }, | |
| { | |
| "epoch": 0.11691372898224295, | |
| "grad_norm": 0.5896109938621521, | |
| "learning_rate": 0.0001994882296789333, | |
| "loss": 0.0418, | |
| "step": 558 | |
| }, | |
| { | |
| "epoch": 0.11712325179403908, | |
| "grad_norm": 0.37245413661003113, | |
| "learning_rate": 0.0001994859943528573, | |
| "loss": 0.0527, | |
| "step": 559 | |
| }, | |
| { | |
| "epoch": 0.11733277460583522, | |
| "grad_norm": 0.18692028522491455, | |
| "learning_rate": 0.00019948375416822928, | |
| "loss": 0.0029, | |
| "step": 560 | |
| }, | |
| { | |
| "epoch": 0.11754229741763135, | |
| "grad_norm": 0.15593203902244568, | |
| "learning_rate": 0.00019948150912515864, | |
| "loss": 0.0068, | |
| "step": 561 | |
| }, | |
| { | |
| "epoch": 0.11775182022942748, | |
| "grad_norm": 0.18825027346611023, | |
| "learning_rate": 0.00019947925922375498, | |
| "loss": 0.0112, | |
| "step": 562 | |
| }, | |
| { | |
| "epoch": 0.11796134304122362, | |
| "grad_norm": 0.2613517940044403, | |
| "learning_rate": 0.0001994770044641282, | |
| "loss": 0.0226, | |
| "step": 563 | |
| }, | |
| { | |
| "epoch": 0.11817086585301975, | |
| "grad_norm": 0.27340763807296753, | |
| "learning_rate": 0.00019947474484638842, | |
| "loss": 0.0384, | |
| "step": 564 | |
| }, | |
| { | |
| "epoch": 0.11838038866481589, | |
| "grad_norm": 0.16672497987747192, | |
| "learning_rate": 0.00019947248037064595, | |
| "loss": 0.022, | |
| "step": 565 | |
| }, | |
| { | |
| "epoch": 0.11858991147661202, | |
| "grad_norm": 0.35599300265312195, | |
| "learning_rate": 0.00019947021103701145, | |
| "loss": 0.0811, | |
| "step": 566 | |
| }, | |
| { | |
| "epoch": 0.11879943428840815, | |
| "grad_norm": 0.26652926206588745, | |
| "learning_rate": 0.0001994679368455957, | |
| "loss": 0.0316, | |
| "step": 567 | |
| }, | |
| { | |
| "epoch": 0.11900895710020429, | |
| "grad_norm": 0.4590820074081421, | |
| "learning_rate": 0.00019946565779650977, | |
| "loss": 0.0976, | |
| "step": 568 | |
| }, | |
| { | |
| "epoch": 0.11921847991200042, | |
| "grad_norm": 0.2231590449810028, | |
| "learning_rate": 0.00019946337388986496, | |
| "loss": 0.0525, | |
| "step": 569 | |
| }, | |
| { | |
| "epoch": 0.11942800272379656, | |
| "grad_norm": 0.2221345603466034, | |
| "learning_rate": 0.0001994610851257728, | |
| "loss": 0.0087, | |
| "step": 570 | |
| }, | |
| { | |
| "epoch": 0.11963752553559269, | |
| "grad_norm": 0.25754231214523315, | |
| "learning_rate": 0.00019945879150434513, | |
| "loss": 0.0286, | |
| "step": 571 | |
| }, | |
| { | |
| "epoch": 0.11984704834738882, | |
| "grad_norm": 0.24685294926166534, | |
| "learning_rate": 0.00019945649302569387, | |
| "loss": 0.0473, | |
| "step": 572 | |
| }, | |
| { | |
| "epoch": 0.12005657115918496, | |
| "grad_norm": 0.2519691586494446, | |
| "learning_rate": 0.0001994541896899313, | |
| "loss": 0.0497, | |
| "step": 573 | |
| }, | |
| { | |
| "epoch": 0.12026609397098109, | |
| "grad_norm": 0.1403161734342575, | |
| "learning_rate": 0.00019945188149716995, | |
| "loss": 0.0114, | |
| "step": 574 | |
| }, | |
| { | |
| "epoch": 0.12047561678277723, | |
| "grad_norm": 0.2621317505836487, | |
| "learning_rate": 0.00019944956844752249, | |
| "loss": 0.0507, | |
| "step": 575 | |
| }, | |
| { | |
| "epoch": 0.12068513959457336, | |
| "grad_norm": 0.21445804834365845, | |
| "learning_rate": 0.00019944725054110192, | |
| "loss": 0.0143, | |
| "step": 576 | |
| }, | |
| { | |
| "epoch": 0.1208946624063695, | |
| "grad_norm": 0.14356960356235504, | |
| "learning_rate": 0.00019944492777802138, | |
| "loss": 0.0041, | |
| "step": 577 | |
| }, | |
| { | |
| "epoch": 0.12110418521816563, | |
| "grad_norm": 0.17768289148807526, | |
| "learning_rate": 0.0001994426001583944, | |
| "loss": 0.0113, | |
| "step": 578 | |
| }, | |
| { | |
| "epoch": 0.12131370802996176, | |
| "grad_norm": 0.08187161386013031, | |
| "learning_rate": 0.00019944026768233458, | |
| "loss": 0.001, | |
| "step": 579 | |
| }, | |
| { | |
| "epoch": 0.1215232308417579, | |
| "grad_norm": 0.16168196499347687, | |
| "learning_rate": 0.00019943793034995583, | |
| "loss": 0.0049, | |
| "step": 580 | |
| }, | |
| { | |
| "epoch": 0.12173275365355403, | |
| "grad_norm": 0.7370941042900085, | |
| "learning_rate": 0.00019943558816137237, | |
| "loss": 0.0387, | |
| "step": 581 | |
| }, | |
| { | |
| "epoch": 0.12194227646535016, | |
| "grad_norm": 0.01981206052005291, | |
| "learning_rate": 0.00019943324111669847, | |
| "loss": 0.0006, | |
| "step": 582 | |
| }, | |
| { | |
| "epoch": 0.1221517992771463, | |
| "grad_norm": 0.3816307485103607, | |
| "learning_rate": 0.00019943088921604884, | |
| "loss": 0.0461, | |
| "step": 583 | |
| }, | |
| { | |
| "epoch": 0.12236132208894243, | |
| "grad_norm": 0.3173670768737793, | |
| "learning_rate": 0.00019942853245953832, | |
| "loss": 0.0471, | |
| "step": 584 | |
| }, | |
| { | |
| "epoch": 0.12257084490073857, | |
| "grad_norm": 0.006391249131411314, | |
| "learning_rate": 0.00019942617084728198, | |
| "loss": 0.0001, | |
| "step": 585 | |
| }, | |
| { | |
| "epoch": 0.1227803677125347, | |
| "grad_norm": 0.07457860559225082, | |
| "learning_rate": 0.00019942380437939518, | |
| "loss": 0.0007, | |
| "step": 586 | |
| }, | |
| { | |
| "epoch": 0.12298989052433083, | |
| "grad_norm": 0.12297150492668152, | |
| "learning_rate": 0.00019942143305599346, | |
| "loss": 0.0016, | |
| "step": 587 | |
| }, | |
| { | |
| "epoch": 0.12319941333612697, | |
| "grad_norm": 0.28252649307250977, | |
| "learning_rate": 0.00019941905687719268, | |
| "loss": 0.0339, | |
| "step": 588 | |
| }, | |
| { | |
| "epoch": 0.1234089361479231, | |
| "grad_norm": 0.29715150594711304, | |
| "learning_rate": 0.00019941667584310883, | |
| "loss": 0.0297, | |
| "step": 589 | |
| }, | |
| { | |
| "epoch": 0.12361845895971924, | |
| "grad_norm": 0.09914545714855194, | |
| "learning_rate": 0.00019941428995385823, | |
| "loss": 0.0057, | |
| "step": 590 | |
| }, | |
| { | |
| "epoch": 0.12382798177151537, | |
| "grad_norm": 0.26020947098731995, | |
| "learning_rate": 0.00019941189920955735, | |
| "loss": 0.0249, | |
| "step": 591 | |
| }, | |
| { | |
| "epoch": 0.1240375045833115, | |
| "grad_norm": 0.32188501954078674, | |
| "learning_rate": 0.00019940950361032301, | |
| "loss": 0.0487, | |
| "step": 592 | |
| }, | |
| { | |
| "epoch": 0.12424702739510764, | |
| "grad_norm": 0.18735957145690918, | |
| "learning_rate": 0.00019940710315627218, | |
| "loss": 0.012, | |
| "step": 593 | |
| }, | |
| { | |
| "epoch": 0.12445655020690377, | |
| "grad_norm": 0.38900870084762573, | |
| "learning_rate": 0.00019940469784752207, | |
| "loss": 0.0914, | |
| "step": 594 | |
| }, | |
| { | |
| "epoch": 0.1246660730186999, | |
| "grad_norm": 0.6044458150863647, | |
| "learning_rate": 0.00019940228768419016, | |
| "loss": 0.0383, | |
| "step": 595 | |
| }, | |
| { | |
| "epoch": 0.12487559583049604, | |
| "grad_norm": 0.1374080628156662, | |
| "learning_rate": 0.00019939987266639412, | |
| "loss": 0.002, | |
| "step": 596 | |
| }, | |
| { | |
| "epoch": 0.1250851186422922, | |
| "grad_norm": 0.2042607069015503, | |
| "learning_rate": 0.00019939745279425196, | |
| "loss": 0.004, | |
| "step": 597 | |
| }, | |
| { | |
| "epoch": 0.1252946414540883, | |
| "grad_norm": 0.2692388594150543, | |
| "learning_rate": 0.00019939502806788178, | |
| "loss": 0.0081, | |
| "step": 598 | |
| }, | |
| { | |
| "epoch": 0.12550416426588445, | |
| "grad_norm": 0.3025107681751251, | |
| "learning_rate": 0.0001993925984874021, | |
| "loss": 0.032, | |
| "step": 599 | |
| }, | |
| { | |
| "epoch": 0.12571368707768057, | |
| "grad_norm": 0.5294435024261475, | |
| "learning_rate": 0.00019939016405293148, | |
| "loss": 0.0305, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.12571368707768057, | |
| "eval_loss": 0.016291819512844086, | |
| "eval_runtime": 89.0596, | |
| "eval_samples_per_second": 8.623, | |
| "eval_steps_per_second": 4.312, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.12592320988947672, | |
| "grad_norm": 0.07965458184480667, | |
| "learning_rate": 0.00019938772476458882, | |
| "loss": 0.0013, | |
| "step": 601 | |
| }, | |
| { | |
| "epoch": 0.12613273270127284, | |
| "grad_norm": 0.161927729845047, | |
| "learning_rate": 0.00019938528062249326, | |
| "loss": 0.0051, | |
| "step": 602 | |
| }, | |
| { | |
| "epoch": 0.126342255513069, | |
| "grad_norm": 0.2723260819911957, | |
| "learning_rate": 0.00019938283162676418, | |
| "loss": 0.0124, | |
| "step": 603 | |
| }, | |
| { | |
| "epoch": 0.1265517783248651, | |
| "grad_norm": 0.33464378118515015, | |
| "learning_rate": 0.00019938037777752116, | |
| "loss": 0.0118, | |
| "step": 604 | |
| }, | |
| { | |
| "epoch": 0.12676130113666126, | |
| "grad_norm": 0.21107061207294464, | |
| "learning_rate": 0.00019937791907488408, | |
| "loss": 0.0127, | |
| "step": 605 | |
| }, | |
| { | |
| "epoch": 0.12697082394845738, | |
| "grad_norm": 0.3803098499774933, | |
| "learning_rate": 0.00019937545551897295, | |
| "loss": 0.0138, | |
| "step": 606 | |
| }, | |
| { | |
| "epoch": 0.12718034676025353, | |
| "grad_norm": 0.2563781440258026, | |
| "learning_rate": 0.0001993729871099081, | |
| "loss": 0.0048, | |
| "step": 607 | |
| }, | |
| { | |
| "epoch": 0.12738986957204965, | |
| "grad_norm": 0.15731534361839294, | |
| "learning_rate": 0.00019937051384781012, | |
| "loss": 0.0014, | |
| "step": 608 | |
| }, | |
| { | |
| "epoch": 0.1275993923838458, | |
| "grad_norm": 0.07711096107959747, | |
| "learning_rate": 0.00019936803573279975, | |
| "loss": 0.0013, | |
| "step": 609 | |
| }, | |
| { | |
| "epoch": 0.12780891519564191, | |
| "grad_norm": 0.07940837740898132, | |
| "learning_rate": 0.00019936555276499804, | |
| "loss": 0.0011, | |
| "step": 610 | |
| }, | |
| { | |
| "epoch": 0.12801843800743806, | |
| "grad_norm": 0.26590949296951294, | |
| "learning_rate": 0.00019936306494452625, | |
| "loss": 0.0189, | |
| "step": 611 | |
| }, | |
| { | |
| "epoch": 0.12822796081923418, | |
| "grad_norm": 0.3016117811203003, | |
| "learning_rate": 0.00019936057227150583, | |
| "loss": 0.0182, | |
| "step": 612 | |
| }, | |
| { | |
| "epoch": 0.12843748363103033, | |
| "grad_norm": 0.2093367725610733, | |
| "learning_rate": 0.00019935807474605856, | |
| "loss": 0.0143, | |
| "step": 613 | |
| }, | |
| { | |
| "epoch": 0.12864700644282645, | |
| "grad_norm": 0.22494176030158997, | |
| "learning_rate": 0.0001993555723683064, | |
| "loss": 0.0178, | |
| "step": 614 | |
| }, | |
| { | |
| "epoch": 0.1288565292546226, | |
| "grad_norm": 0.1732041835784912, | |
| "learning_rate": 0.00019935306513837157, | |
| "loss": 0.014, | |
| "step": 615 | |
| }, | |
| { | |
| "epoch": 0.12906605206641872, | |
| "grad_norm": 0.04634670913219452, | |
| "learning_rate": 0.0001993505530563765, | |
| "loss": 0.0004, | |
| "step": 616 | |
| }, | |
| { | |
| "epoch": 0.12927557487821487, | |
| "grad_norm": 0.24240362644195557, | |
| "learning_rate": 0.00019934803612244387, | |
| "loss": 0.0055, | |
| "step": 617 | |
| }, | |
| { | |
| "epoch": 0.129485097690011, | |
| "grad_norm": 0.3496238887310028, | |
| "learning_rate": 0.0001993455143366966, | |
| "loss": 0.0463, | |
| "step": 618 | |
| }, | |
| { | |
| "epoch": 0.12969462050180713, | |
| "grad_norm": 0.3036729097366333, | |
| "learning_rate": 0.0001993429876992578, | |
| "loss": 0.028, | |
| "step": 619 | |
| }, | |
| { | |
| "epoch": 0.12990414331360328, | |
| "grad_norm": 0.19408352673053741, | |
| "learning_rate": 0.00019934045621025097, | |
| "loss": 0.0051, | |
| "step": 620 | |
| }, | |
| { | |
| "epoch": 0.1301136661253994, | |
| "grad_norm": 0.4805002808570862, | |
| "learning_rate": 0.00019933791986979964, | |
| "loss": 0.0933, | |
| "step": 621 | |
| }, | |
| { | |
| "epoch": 0.13032318893719555, | |
| "grad_norm": 0.06430470943450928, | |
| "learning_rate": 0.00019933537867802774, | |
| "loss": 0.0002, | |
| "step": 622 | |
| }, | |
| { | |
| "epoch": 0.13053271174899167, | |
| "grad_norm": 0.23753847181797028, | |
| "learning_rate": 0.00019933283263505932, | |
| "loss": 0.023, | |
| "step": 623 | |
| }, | |
| { | |
| "epoch": 0.13074223456078782, | |
| "grad_norm": 0.07812167704105377, | |
| "learning_rate": 0.00019933028174101876, | |
| "loss": 0.0008, | |
| "step": 624 | |
| }, | |
| { | |
| "epoch": 0.13095175737258394, | |
| "grad_norm": 0.4537438750267029, | |
| "learning_rate": 0.0001993277259960306, | |
| "loss": 0.0196, | |
| "step": 625 | |
| }, | |
| { | |
| "epoch": 0.13116128018438009, | |
| "grad_norm": 0.11305277794599533, | |
| "learning_rate": 0.00019932516540021973, | |
| "loss": 0.0136, | |
| "step": 626 | |
| }, | |
| { | |
| "epoch": 0.1313708029961762, | |
| "grad_norm": 0.13304772973060608, | |
| "learning_rate": 0.00019932259995371113, | |
| "loss": 0.0013, | |
| "step": 627 | |
| }, | |
| { | |
| "epoch": 0.13158032580797235, | |
| "grad_norm": 0.1756788194179535, | |
| "learning_rate": 0.00019932002965663008, | |
| "loss": 0.0033, | |
| "step": 628 | |
| }, | |
| { | |
| "epoch": 0.13178984861976847, | |
| "grad_norm": 0.11411143094301224, | |
| "learning_rate": 0.00019931745450910216, | |
| "loss": 0.0011, | |
| "step": 629 | |
| }, | |
| { | |
| "epoch": 0.13199937143156462, | |
| "grad_norm": 0.21732713282108307, | |
| "learning_rate": 0.00019931487451125307, | |
| "loss": 0.0138, | |
| "step": 630 | |
| }, | |
| { | |
| "epoch": 0.13220889424336074, | |
| "grad_norm": 0.011272534728050232, | |
| "learning_rate": 0.00019931228966320883, | |
| "loss": 0.0001, | |
| "step": 631 | |
| }, | |
| { | |
| "epoch": 0.1324184170551569, | |
| "grad_norm": 0.2807530462741852, | |
| "learning_rate": 0.00019930969996509573, | |
| "loss": 0.0142, | |
| "step": 632 | |
| }, | |
| { | |
| "epoch": 0.132627939866953, | |
| "grad_norm": 0.24529138207435608, | |
| "learning_rate": 0.00019930710541704016, | |
| "loss": 0.0096, | |
| "step": 633 | |
| }, | |
| { | |
| "epoch": 0.13283746267874916, | |
| "grad_norm": 0.2031984180212021, | |
| "learning_rate": 0.00019930450601916887, | |
| "loss": 0.0169, | |
| "step": 634 | |
| }, | |
| { | |
| "epoch": 0.13304698549054528, | |
| "grad_norm": 0.06990045309066772, | |
| "learning_rate": 0.0001993019017716088, | |
| "loss": 0.0008, | |
| "step": 635 | |
| }, | |
| { | |
| "epoch": 0.13325650830234143, | |
| "grad_norm": 0.3571747839450836, | |
| "learning_rate": 0.00019929929267448713, | |
| "loss": 0.0603, | |
| "step": 636 | |
| }, | |
| { | |
| "epoch": 0.13346603111413755, | |
| "grad_norm": 0.28505340218544006, | |
| "learning_rate": 0.0001992966787279313, | |
| "loss": 0.0057, | |
| "step": 637 | |
| }, | |
| { | |
| "epoch": 0.1336755539259337, | |
| "grad_norm": 0.5852503776550293, | |
| "learning_rate": 0.00019929405993206894, | |
| "loss": 0.0892, | |
| "step": 638 | |
| }, | |
| { | |
| "epoch": 0.1338850767377298, | |
| "grad_norm": 0.11871087551116943, | |
| "learning_rate": 0.00019929143628702795, | |
| "loss": 0.0019, | |
| "step": 639 | |
| }, | |
| { | |
| "epoch": 0.13409459954952596, | |
| "grad_norm": 0.09931576997041702, | |
| "learning_rate": 0.00019928880779293646, | |
| "loss": 0.0015, | |
| "step": 640 | |
| }, | |
| { | |
| "epoch": 0.13430412236132208, | |
| "grad_norm": 0.08426062762737274, | |
| "learning_rate": 0.0001992861744499228, | |
| "loss": 0.0086, | |
| "step": 641 | |
| }, | |
| { | |
| "epoch": 0.13451364517311823, | |
| "grad_norm": 0.20797474682331085, | |
| "learning_rate": 0.00019928353625811565, | |
| "loss": 0.0136, | |
| "step": 642 | |
| }, | |
| { | |
| "epoch": 0.13472316798491435, | |
| "grad_norm": 0.1903754323720932, | |
| "learning_rate": 0.00019928089321764384, | |
| "loss": 0.0294, | |
| "step": 643 | |
| }, | |
| { | |
| "epoch": 0.1349326907967105, | |
| "grad_norm": 0.19812871515750885, | |
| "learning_rate": 0.00019927824532863636, | |
| "loss": 0.0296, | |
| "step": 644 | |
| }, | |
| { | |
| "epoch": 0.13514221360850662, | |
| "grad_norm": 0.3847843408584595, | |
| "learning_rate": 0.00019927559259122263, | |
| "loss": 0.0503, | |
| "step": 645 | |
| }, | |
| { | |
| "epoch": 0.13535173642030277, | |
| "grad_norm": 0.2451527714729309, | |
| "learning_rate": 0.00019927293500553213, | |
| "loss": 0.0196, | |
| "step": 646 | |
| }, | |
| { | |
| "epoch": 0.13556125923209889, | |
| "grad_norm": 0.4702102243900299, | |
| "learning_rate": 0.00019927027257169466, | |
| "loss": 0.0913, | |
| "step": 647 | |
| }, | |
| { | |
| "epoch": 0.13577078204389503, | |
| "grad_norm": 0.10364199429750443, | |
| "learning_rate": 0.00019926760528984026, | |
| "loss": 0.002, | |
| "step": 648 | |
| }, | |
| { | |
| "epoch": 0.13598030485569115, | |
| "grad_norm": 0.19361010193824768, | |
| "learning_rate": 0.00019926493316009918, | |
| "loss": 0.0167, | |
| "step": 649 | |
| }, | |
| { | |
| "epoch": 0.1361898276674873, | |
| "grad_norm": 0.11378200352191925, | |
| "learning_rate": 0.00019926225618260195, | |
| "loss": 0.017, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 0.13639935047928342, | |
| "grad_norm": 0.25813087821006775, | |
| "learning_rate": 0.00019925957435747925, | |
| "loss": 0.0089, | |
| "step": 651 | |
| }, | |
| { | |
| "epoch": 0.13660887329107957, | |
| "grad_norm": 13.186869621276855, | |
| "learning_rate": 0.0001992568876848621, | |
| "loss": 0.0159, | |
| "step": 652 | |
| }, | |
| { | |
| "epoch": 0.1368183961028757, | |
| "grad_norm": 0.28748589754104614, | |
| "learning_rate": 0.00019925419616488165, | |
| "loss": 0.0278, | |
| "step": 653 | |
| }, | |
| { | |
| "epoch": 0.13702791891467184, | |
| "grad_norm": 0.21648818254470825, | |
| "learning_rate": 0.00019925149979766938, | |
| "loss": 0.0133, | |
| "step": 654 | |
| }, | |
| { | |
| "epoch": 0.13723744172646796, | |
| "grad_norm": 0.08441877365112305, | |
| "learning_rate": 0.00019924879858335698, | |
| "loss": 0.0149, | |
| "step": 655 | |
| }, | |
| { | |
| "epoch": 0.1374469645382641, | |
| "grad_norm": 0.15462300181388855, | |
| "learning_rate": 0.00019924609252207638, | |
| "loss": 0.0065, | |
| "step": 656 | |
| }, | |
| { | |
| "epoch": 0.13765648735006022, | |
| "grad_norm": 0.2789871394634247, | |
| "learning_rate": 0.00019924338161395971, | |
| "loss": 0.018, | |
| "step": 657 | |
| }, | |
| { | |
| "epoch": 0.13786601016185637, | |
| "grad_norm": 0.019855428487062454, | |
| "learning_rate": 0.00019924066585913933, | |
| "loss": 0.0003, | |
| "step": 658 | |
| }, | |
| { | |
| "epoch": 0.1380755329736525, | |
| "grad_norm": 0.2729547619819641, | |
| "learning_rate": 0.00019923794525774792, | |
| "loss": 0.0315, | |
| "step": 659 | |
| }, | |
| { | |
| "epoch": 0.13828505578544864, | |
| "grad_norm": 0.18892449140548706, | |
| "learning_rate": 0.00019923521980991834, | |
| "loss": 0.0203, | |
| "step": 660 | |
| }, | |
| { | |
| "epoch": 0.1384945785972448, | |
| "grad_norm": 0.02755853161215782, | |
| "learning_rate": 0.00019923248951578368, | |
| "loss": 0.0003, | |
| "step": 661 | |
| }, | |
| { | |
| "epoch": 0.1387041014090409, | |
| "grad_norm": 0.016459867358207703, | |
| "learning_rate": 0.00019922975437547727, | |
| "loss": 0.0003, | |
| "step": 662 | |
| }, | |
| { | |
| "epoch": 0.13891362422083706, | |
| "grad_norm": 0.29161739349365234, | |
| "learning_rate": 0.0001992270143891327, | |
| "loss": 0.021, | |
| "step": 663 | |
| }, | |
| { | |
| "epoch": 0.13912314703263318, | |
| "grad_norm": 0.38459256291389465, | |
| "learning_rate": 0.00019922426955688375, | |
| "loss": 0.013, | |
| "step": 664 | |
| }, | |
| { | |
| "epoch": 0.13933266984442932, | |
| "grad_norm": 0.30727267265319824, | |
| "learning_rate": 0.0001992215198788645, | |
| "loss": 0.0163, | |
| "step": 665 | |
| }, | |
| { | |
| "epoch": 0.13954219265622544, | |
| "grad_norm": 0.4134649336338043, | |
| "learning_rate": 0.00019921876535520925, | |
| "loss": 0.029, | |
| "step": 666 | |
| }, | |
| { | |
| "epoch": 0.1397517154680216, | |
| "grad_norm": 0.08295508474111557, | |
| "learning_rate": 0.00019921600598605247, | |
| "loss": 0.0013, | |
| "step": 667 | |
| }, | |
| { | |
| "epoch": 0.1399612382798177, | |
| "grad_norm": 3.298372983932495, | |
| "learning_rate": 0.000199213241771529, | |
| "loss": 0.019, | |
| "step": 668 | |
| }, | |
| { | |
| "epoch": 0.14017076109161386, | |
| "grad_norm": 0.2583758234977722, | |
| "learning_rate": 0.0001992104727117737, | |
| "loss": 0.0384, | |
| "step": 669 | |
| }, | |
| { | |
| "epoch": 0.14038028390340998, | |
| "grad_norm": 0.14796248078346252, | |
| "learning_rate": 0.00019920769880692193, | |
| "loss": 0.0035, | |
| "step": 670 | |
| }, | |
| { | |
| "epoch": 0.14058980671520613, | |
| "grad_norm": 0.006577362772077322, | |
| "learning_rate": 0.0001992049200571091, | |
| "loss": 0.0002, | |
| "step": 671 | |
| }, | |
| { | |
| "epoch": 0.14079932952700225, | |
| "grad_norm": 0.3680857717990875, | |
| "learning_rate": 0.00019920213646247093, | |
| "loss": 0.0824, | |
| "step": 672 | |
| }, | |
| { | |
| "epoch": 0.1410088523387984, | |
| "grad_norm": 0.07552894949913025, | |
| "learning_rate": 0.00019919934802314335, | |
| "loss": 0.0008, | |
| "step": 673 | |
| }, | |
| { | |
| "epoch": 0.14121837515059452, | |
| "grad_norm": 0.19062870740890503, | |
| "learning_rate": 0.00019919655473926256, | |
| "loss": 0.0081, | |
| "step": 674 | |
| }, | |
| { | |
| "epoch": 0.14142789796239066, | |
| "grad_norm": 0.3882509171962738, | |
| "learning_rate": 0.00019919375661096492, | |
| "loss": 0.0785, | |
| "step": 675 | |
| }, | |
| { | |
| "epoch": 0.14163742077418678, | |
| "grad_norm": 0.22886379063129425, | |
| "learning_rate": 0.00019919095363838714, | |
| "loss": 0.0291, | |
| "step": 676 | |
| }, | |
| { | |
| "epoch": 0.14184694358598293, | |
| "grad_norm": 0.5058407783508301, | |
| "learning_rate": 0.0001991881458216661, | |
| "loss": 0.0812, | |
| "step": 677 | |
| }, | |
| { | |
| "epoch": 0.14205646639777905, | |
| "grad_norm": 0.19598716497421265, | |
| "learning_rate": 0.00019918533316093888, | |
| "loss": 0.0166, | |
| "step": 678 | |
| }, | |
| { | |
| "epoch": 0.1422659892095752, | |
| "grad_norm": 0.3560320734977722, | |
| "learning_rate": 0.0001991825156563429, | |
| "loss": 0.0452, | |
| "step": 679 | |
| }, | |
| { | |
| "epoch": 0.14247551202137132, | |
| "grad_norm": 0.23111455142498016, | |
| "learning_rate": 0.0001991796933080157, | |
| "loss": 0.0225, | |
| "step": 680 | |
| }, | |
| { | |
| "epoch": 0.14268503483316747, | |
| "grad_norm": 0.18612909317016602, | |
| "learning_rate": 0.00019917686611609515, | |
| "loss": 0.005, | |
| "step": 681 | |
| }, | |
| { | |
| "epoch": 0.1428945576449636, | |
| "grad_norm": 0.31149572134017944, | |
| "learning_rate": 0.00019917403408071933, | |
| "loss": 0.0557, | |
| "step": 682 | |
| }, | |
| { | |
| "epoch": 0.14310408045675974, | |
| "grad_norm": 0.43545660376548767, | |
| "learning_rate": 0.00019917119720202649, | |
| "loss": 0.0246, | |
| "step": 683 | |
| }, | |
| { | |
| "epoch": 0.14331360326855586, | |
| "grad_norm": 0.20558680593967438, | |
| "learning_rate": 0.00019916835548015524, | |
| "loss": 0.0144, | |
| "step": 684 | |
| }, | |
| { | |
| "epoch": 0.143523126080352, | |
| "grad_norm": 0.19289907813072205, | |
| "learning_rate": 0.00019916550891524435, | |
| "loss": 0.004, | |
| "step": 685 | |
| }, | |
| { | |
| "epoch": 0.14373264889214812, | |
| "grad_norm": 0.2448616772890091, | |
| "learning_rate": 0.0001991626575074328, | |
| "loss": 0.0114, | |
| "step": 686 | |
| }, | |
| { | |
| "epoch": 0.14394217170394427, | |
| "grad_norm": 0.1556064635515213, | |
| "learning_rate": 0.00019915980125685985, | |
| "loss": 0.0031, | |
| "step": 687 | |
| }, | |
| { | |
| "epoch": 0.1441516945157404, | |
| "grad_norm": 0.17058494687080383, | |
| "learning_rate": 0.000199156940163665, | |
| "loss": 0.008, | |
| "step": 688 | |
| }, | |
| { | |
| "epoch": 0.14436121732753654, | |
| "grad_norm": 0.32099649310112, | |
| "learning_rate": 0.00019915407422798798, | |
| "loss": 0.0548, | |
| "step": 689 | |
| }, | |
| { | |
| "epoch": 0.14457074013933266, | |
| "grad_norm": 0.11824580281972885, | |
| "learning_rate": 0.00019915120344996876, | |
| "loss": 0.0019, | |
| "step": 690 | |
| }, | |
| { | |
| "epoch": 0.1447802629511288, | |
| "grad_norm": 0.13612987101078033, | |
| "learning_rate": 0.00019914832782974752, | |
| "loss": 0.0076, | |
| "step": 691 | |
| }, | |
| { | |
| "epoch": 0.14498978576292493, | |
| "grad_norm": 0.3279030919075012, | |
| "learning_rate": 0.0001991454473674647, | |
| "loss": 0.0282, | |
| "step": 692 | |
| }, | |
| { | |
| "epoch": 0.14519930857472108, | |
| "grad_norm": 0.22970880568027496, | |
| "learning_rate": 0.00019914256206326098, | |
| "loss": 0.0157, | |
| "step": 693 | |
| }, | |
| { | |
| "epoch": 0.1454088313865172, | |
| "grad_norm": 0.01073368638753891, | |
| "learning_rate": 0.00019913967191727725, | |
| "loss": 0.0002, | |
| "step": 694 | |
| }, | |
| { | |
| "epoch": 0.14561835419831334, | |
| "grad_norm": 0.20023581385612488, | |
| "learning_rate": 0.00019913677692965468, | |
| "loss": 0.0091, | |
| "step": 695 | |
| }, | |
| { | |
| "epoch": 0.14582787701010946, | |
| "grad_norm": 0.08236939460039139, | |
| "learning_rate": 0.00019913387710053466, | |
| "loss": 0.0008, | |
| "step": 696 | |
| }, | |
| { | |
| "epoch": 0.1460373998219056, | |
| "grad_norm": 0.17614483833312988, | |
| "learning_rate": 0.00019913097243005876, | |
| "loss": 0.0149, | |
| "step": 697 | |
| }, | |
| { | |
| "epoch": 0.14624692263370173, | |
| "grad_norm": 0.4621315598487854, | |
| "learning_rate": 0.00019912806291836886, | |
| "loss": 0.0858, | |
| "step": 698 | |
| }, | |
| { | |
| "epoch": 0.14645644544549788, | |
| "grad_norm": 4.610383987426758, | |
| "learning_rate": 0.00019912514856560706, | |
| "loss": 0.0345, | |
| "step": 699 | |
| }, | |
| { | |
| "epoch": 0.146665968257294, | |
| "grad_norm": 0.02050645463168621, | |
| "learning_rate": 0.00019912222937191568, | |
| "loss": 0.0003, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 0.14687549106909015, | |
| "grad_norm": 0.10539437085390091, | |
| "learning_rate": 0.0001991193053374373, | |
| "loss": 0.0012, | |
| "step": 701 | |
| }, | |
| { | |
| "epoch": 0.1470850138808863, | |
| "grad_norm": 0.2869635820388794, | |
| "learning_rate": 0.00019911637646231466, | |
| "loss": 0.0303, | |
| "step": 702 | |
| }, | |
| { | |
| "epoch": 0.14729453669268242, | |
| "grad_norm": 0.29913896322250366, | |
| "learning_rate": 0.00019911344274669085, | |
| "loss": 0.0083, | |
| "step": 703 | |
| }, | |
| { | |
| "epoch": 0.14750405950447856, | |
| "grad_norm": 0.21330636739730835, | |
| "learning_rate": 0.00019911050419070913, | |
| "loss": 0.0246, | |
| "step": 704 | |
| }, | |
| { | |
| "epoch": 0.14771358231627468, | |
| "grad_norm": 0.010840353555977345, | |
| "learning_rate": 0.00019910756079451303, | |
| "loss": 0.0002, | |
| "step": 705 | |
| }, | |
| { | |
| "epoch": 0.14792310512807083, | |
| "grad_norm": 0.31384751200675964, | |
| "learning_rate": 0.00019910461255824626, | |
| "loss": 0.0356, | |
| "step": 706 | |
| }, | |
| { | |
| "epoch": 0.14813262793986695, | |
| "grad_norm": 0.20688189566135406, | |
| "learning_rate": 0.00019910165948205282, | |
| "loss": 0.022, | |
| "step": 707 | |
| }, | |
| { | |
| "epoch": 0.1483421507516631, | |
| "grad_norm": 0.37733882665634155, | |
| "learning_rate": 0.00019909870156607692, | |
| "loss": 0.0762, | |
| "step": 708 | |
| }, | |
| { | |
| "epoch": 0.14855167356345922, | |
| "grad_norm": 0.3063774108886719, | |
| "learning_rate": 0.000199095738810463, | |
| "loss": 0.0408, | |
| "step": 709 | |
| }, | |
| { | |
| "epoch": 0.14876119637525537, | |
| "grad_norm": 0.38248753547668457, | |
| "learning_rate": 0.0001990927712153558, | |
| "loss": 0.0192, | |
| "step": 710 | |
| }, | |
| { | |
| "epoch": 0.1489707191870515, | |
| "grad_norm": 0.1782226413488388, | |
| "learning_rate": 0.00019908979878090018, | |
| "loss": 0.0052, | |
| "step": 711 | |
| }, | |
| { | |
| "epoch": 0.14918024199884763, | |
| "grad_norm": 0.34892570972442627, | |
| "learning_rate": 0.00019908682150724137, | |
| "loss": 0.0729, | |
| "step": 712 | |
| }, | |
| { | |
| "epoch": 0.14938976481064375, | |
| "grad_norm": 0.266937792301178, | |
| "learning_rate": 0.00019908383939452472, | |
| "loss": 0.0168, | |
| "step": 713 | |
| }, | |
| { | |
| "epoch": 0.1495992876224399, | |
| "grad_norm": 0.06860234588384628, | |
| "learning_rate": 0.0001990808524428959, | |
| "loss": 0.0009, | |
| "step": 714 | |
| }, | |
| { | |
| "epoch": 0.14980881043423602, | |
| "grad_norm": 0.029732417315244675, | |
| "learning_rate": 0.00019907786065250077, | |
| "loss": 0.0005, | |
| "step": 715 | |
| }, | |
| { | |
| "epoch": 0.15001833324603217, | |
| "grad_norm": 0.36950287222862244, | |
| "learning_rate": 0.00019907486402348542, | |
| "loss": 0.0457, | |
| "step": 716 | |
| }, | |
| { | |
| "epoch": 0.1502278560578283, | |
| "grad_norm": 0.29846426844596863, | |
| "learning_rate": 0.00019907186255599624, | |
| "loss": 0.0389, | |
| "step": 717 | |
| }, | |
| { | |
| "epoch": 0.15043737886962444, | |
| "grad_norm": 0.25788208842277527, | |
| "learning_rate": 0.00019906885625017978, | |
| "loss": 0.0322, | |
| "step": 718 | |
| }, | |
| { | |
| "epoch": 0.15064690168142056, | |
| "grad_norm": 1.249671459197998, | |
| "learning_rate": 0.00019906584510618282, | |
| "loss": 0.0354, | |
| "step": 719 | |
| }, | |
| { | |
| "epoch": 0.1508564244932167, | |
| "grad_norm": 0.02440783567726612, | |
| "learning_rate": 0.00019906282912415249, | |
| "loss": 0.0005, | |
| "step": 720 | |
| }, | |
| { | |
| "epoch": 0.15106594730501283, | |
| "grad_norm": 0.22200000286102295, | |
| "learning_rate": 0.000199059808304236, | |
| "loss": 0.0232, | |
| "step": 721 | |
| }, | |
| { | |
| "epoch": 0.15127547011680897, | |
| "grad_norm": 0.3790658116340637, | |
| "learning_rate": 0.00019905678264658095, | |
| "loss": 0.0429, | |
| "step": 722 | |
| }, | |
| { | |
| "epoch": 0.1514849929286051, | |
| "grad_norm": 0.19107124209403992, | |
| "learning_rate": 0.0001990537521513351, | |
| "loss": 0.0303, | |
| "step": 723 | |
| }, | |
| { | |
| "epoch": 0.15169451574040124, | |
| "grad_norm": 0.1712956577539444, | |
| "learning_rate": 0.0001990507168186464, | |
| "loss": 0.0097, | |
| "step": 724 | |
| }, | |
| { | |
| "epoch": 0.15190403855219736, | |
| "grad_norm": 0.17346502840518951, | |
| "learning_rate": 0.00019904767664866312, | |
| "loss": 0.0111, | |
| "step": 725 | |
| }, | |
| { | |
| "epoch": 0.1521135613639935, | |
| "grad_norm": 0.19370456039905548, | |
| "learning_rate": 0.00019904463164153367, | |
| "loss": 0.0049, | |
| "step": 726 | |
| }, | |
| { | |
| "epoch": 0.15232308417578963, | |
| "grad_norm": 0.02195919305086136, | |
| "learning_rate": 0.00019904158179740686, | |
| "loss": 0.0007, | |
| "step": 727 | |
| }, | |
| { | |
| "epoch": 0.15253260698758578, | |
| "grad_norm": 0.39460641145706177, | |
| "learning_rate": 0.00019903852711643157, | |
| "loss": 0.0444, | |
| "step": 728 | |
| }, | |
| { | |
| "epoch": 0.1527421297993819, | |
| "grad_norm": 0.1139521673321724, | |
| "learning_rate": 0.00019903546759875696, | |
| "loss": 0.0103, | |
| "step": 729 | |
| }, | |
| { | |
| "epoch": 0.15295165261117805, | |
| "grad_norm": 0.07739255577325821, | |
| "learning_rate": 0.0001990324032445325, | |
| "loss": 0.0053, | |
| "step": 730 | |
| }, | |
| { | |
| "epoch": 0.15316117542297417, | |
| "grad_norm": 0.3823677599430084, | |
| "learning_rate": 0.00019902933405390783, | |
| "loss": 0.04, | |
| "step": 731 | |
| }, | |
| { | |
| "epoch": 0.15337069823477031, | |
| "grad_norm": 0.24092869460582733, | |
| "learning_rate": 0.00019902626002703283, | |
| "loss": 0.0482, | |
| "step": 732 | |
| }, | |
| { | |
| "epoch": 0.15358022104656643, | |
| "grad_norm": 0.027126243337988853, | |
| "learning_rate": 0.00019902318116405757, | |
| "loss": 0.0008, | |
| "step": 733 | |
| }, | |
| { | |
| "epoch": 0.15378974385836258, | |
| "grad_norm": 0.12171046435832977, | |
| "learning_rate": 0.00019902009746513254, | |
| "loss": 0.0058, | |
| "step": 734 | |
| }, | |
| { | |
| "epoch": 0.1539992666701587, | |
| "grad_norm": 0.10180404037237167, | |
| "learning_rate": 0.0001990170089304082, | |
| "loss": 0.0046, | |
| "step": 735 | |
| }, | |
| { | |
| "epoch": 0.15420878948195485, | |
| "grad_norm": 0.26162436604499817, | |
| "learning_rate": 0.00019901391556003545, | |
| "loss": 0.0375, | |
| "step": 736 | |
| }, | |
| { | |
| "epoch": 0.15441831229375097, | |
| "grad_norm": 0.19409051537513733, | |
| "learning_rate": 0.00019901081735416537, | |
| "loss": 0.0063, | |
| "step": 737 | |
| }, | |
| { | |
| "epoch": 0.15462783510554712, | |
| "grad_norm": 0.17046910524368286, | |
| "learning_rate": 0.00019900771431294927, | |
| "loss": 0.0151, | |
| "step": 738 | |
| }, | |
| { | |
| "epoch": 0.15483735791734324, | |
| "grad_norm": 0.16491179168224335, | |
| "learning_rate": 0.00019900460643653865, | |
| "loss": 0.0228, | |
| "step": 739 | |
| }, | |
| { | |
| "epoch": 0.15504688072913939, | |
| "grad_norm": 0.4564284384250641, | |
| "learning_rate": 0.00019900149372508528, | |
| "loss": 0.0516, | |
| "step": 740 | |
| }, | |
| { | |
| "epoch": 0.1552564035409355, | |
| "grad_norm": 0.2507207989692688, | |
| "learning_rate": 0.00019899837617874124, | |
| "loss": 0.0186, | |
| "step": 741 | |
| }, | |
| { | |
| "epoch": 0.15546592635273165, | |
| "grad_norm": 0.18009963631629944, | |
| "learning_rate": 0.00019899525379765877, | |
| "loss": 0.0056, | |
| "step": 742 | |
| }, | |
| { | |
| "epoch": 0.1556754491645278, | |
| "grad_norm": 0.2279609739780426, | |
| "learning_rate": 0.0001989921265819903, | |
| "loss": 0.0183, | |
| "step": 743 | |
| }, | |
| { | |
| "epoch": 0.15588497197632392, | |
| "grad_norm": 0.1303996741771698, | |
| "learning_rate": 0.00019898899453188855, | |
| "loss": 0.0041, | |
| "step": 744 | |
| }, | |
| { | |
| "epoch": 0.15609449478812007, | |
| "grad_norm": 0.2132912129163742, | |
| "learning_rate": 0.00019898585764750655, | |
| "loss": 0.0169, | |
| "step": 745 | |
| }, | |
| { | |
| "epoch": 0.1563040175999162, | |
| "grad_norm": 0.01601547561585903, | |
| "learning_rate": 0.00019898271592899743, | |
| "loss": 0.0003, | |
| "step": 746 | |
| }, | |
| { | |
| "epoch": 0.15651354041171234, | |
| "grad_norm": 0.09785155951976776, | |
| "learning_rate": 0.00019897956937651467, | |
| "loss": 0.0018, | |
| "step": 747 | |
| }, | |
| { | |
| "epoch": 0.15672306322350846, | |
| "grad_norm": 1.353312611579895, | |
| "learning_rate": 0.0001989764179902119, | |
| "loss": 0.0169, | |
| "step": 748 | |
| }, | |
| { | |
| "epoch": 0.1569325860353046, | |
| "grad_norm": 0.2503106892108917, | |
| "learning_rate": 0.00019897326177024304, | |
| "loss": 0.0186, | |
| "step": 749 | |
| }, | |
| { | |
| "epoch": 0.15714210884710073, | |
| "grad_norm": 0.23809774219989777, | |
| "learning_rate": 0.00019897010071676222, | |
| "loss": 0.0317, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 0.15735163165889687, | |
| "grad_norm": 0.332171767950058, | |
| "learning_rate": 0.0001989669348299238, | |
| "loss": 0.0446, | |
| "step": 751 | |
| }, | |
| { | |
| "epoch": 0.157561154470693, | |
| "grad_norm": 0.21880975365638733, | |
| "learning_rate": 0.00019896376410988244, | |
| "loss": 0.0172, | |
| "step": 752 | |
| }, | |
| { | |
| "epoch": 0.15777067728248914, | |
| "grad_norm": 0.056077443063259125, | |
| "learning_rate": 0.00019896058855679293, | |
| "loss": 0.0008, | |
| "step": 753 | |
| }, | |
| { | |
| "epoch": 0.15798020009428526, | |
| "grad_norm": 0.38360893726348877, | |
| "learning_rate": 0.00019895740817081042, | |
| "loss": 0.0377, | |
| "step": 754 | |
| }, | |
| { | |
| "epoch": 0.1581897229060814, | |
| "grad_norm": 0.2242017686367035, | |
| "learning_rate": 0.00019895422295209016, | |
| "loss": 0.0023, | |
| "step": 755 | |
| }, | |
| { | |
| "epoch": 0.15839924571787753, | |
| "grad_norm": 0.4162478744983673, | |
| "learning_rate": 0.00019895103290078773, | |
| "loss": 0.0054, | |
| "step": 756 | |
| }, | |
| { | |
| "epoch": 0.15860876852967368, | |
| "grad_norm": 0.12590032815933228, | |
| "learning_rate": 0.00019894783801705895, | |
| "loss": 0.007, | |
| "step": 757 | |
| }, | |
| { | |
| "epoch": 0.1588182913414698, | |
| "grad_norm": 0.10577323287725449, | |
| "learning_rate": 0.0001989446383010598, | |
| "loss": 0.0109, | |
| "step": 758 | |
| }, | |
| { | |
| "epoch": 0.15902781415326595, | |
| "grad_norm": 0.1796669065952301, | |
| "learning_rate": 0.00019894143375294657, | |
| "loss": 0.0109, | |
| "step": 759 | |
| }, | |
| { | |
| "epoch": 0.15923733696506207, | |
| "grad_norm": 0.19568434357643127, | |
| "learning_rate": 0.00019893822437287576, | |
| "loss": 0.0059, | |
| "step": 760 | |
| }, | |
| { | |
| "epoch": 0.1594468597768582, | |
| "grad_norm": 0.22991542518138885, | |
| "learning_rate": 0.00019893501016100408, | |
| "loss": 0.0173, | |
| "step": 761 | |
| }, | |
| { | |
| "epoch": 0.15965638258865433, | |
| "grad_norm": 0.19536703824996948, | |
| "learning_rate": 0.00019893179111748856, | |
| "loss": 0.022, | |
| "step": 762 | |
| }, | |
| { | |
| "epoch": 0.15986590540045048, | |
| "grad_norm": 0.18410378694534302, | |
| "learning_rate": 0.00019892856724248634, | |
| "loss": 0.016, | |
| "step": 763 | |
| }, | |
| { | |
| "epoch": 0.1600754282122466, | |
| "grad_norm": 0.0290357768535614, | |
| "learning_rate": 0.00019892533853615492, | |
| "loss": 0.0002, | |
| "step": 764 | |
| }, | |
| { | |
| "epoch": 0.16028495102404275, | |
| "grad_norm": 0.23183897137641907, | |
| "learning_rate": 0.00019892210499865192, | |
| "loss": 0.0047, | |
| "step": 765 | |
| }, | |
| { | |
| "epoch": 0.16049447383583887, | |
| "grad_norm": 0.2753854990005493, | |
| "learning_rate": 0.00019891886663013527, | |
| "loss": 0.0173, | |
| "step": 766 | |
| }, | |
| { | |
| "epoch": 0.16070399664763502, | |
| "grad_norm": 0.11987002938985825, | |
| "learning_rate": 0.00019891562343076315, | |
| "loss": 0.0028, | |
| "step": 767 | |
| }, | |
| { | |
| "epoch": 0.16091351945943114, | |
| "grad_norm": 0.15542055666446686, | |
| "learning_rate": 0.00019891237540069394, | |
| "loss": 0.0242, | |
| "step": 768 | |
| }, | |
| { | |
| "epoch": 0.16112304227122728, | |
| "grad_norm": 0.2240624576807022, | |
| "learning_rate": 0.00019890912254008628, | |
| "loss": 0.0149, | |
| "step": 769 | |
| }, | |
| { | |
| "epoch": 0.1613325650830234, | |
| "grad_norm": 0.14880992472171783, | |
| "learning_rate": 0.00019890586484909895, | |
| "loss": 0.0105, | |
| "step": 770 | |
| }, | |
| { | |
| "epoch": 0.16154208789481955, | |
| "grad_norm": 0.18625305593013763, | |
| "learning_rate": 0.00019890260232789114, | |
| "loss": 0.0144, | |
| "step": 771 | |
| }, | |
| { | |
| "epoch": 0.16175161070661567, | |
| "grad_norm": 0.03506407141685486, | |
| "learning_rate": 0.00019889933497662206, | |
| "loss": 0.0004, | |
| "step": 772 | |
| }, | |
| { | |
| "epoch": 0.16196113351841182, | |
| "grad_norm": 0.2667176127433777, | |
| "learning_rate": 0.00019889606279545143, | |
| "loss": 0.0252, | |
| "step": 773 | |
| }, | |
| { | |
| "epoch": 0.16217065633020794, | |
| "grad_norm": 0.32680612802505493, | |
| "learning_rate": 0.00019889278578453896, | |
| "loss": 0.0284, | |
| "step": 774 | |
| }, | |
| { | |
| "epoch": 0.1623801791420041, | |
| "grad_norm": 3.199450731277466, | |
| "learning_rate": 0.0001988895039440447, | |
| "loss": 0.0165, | |
| "step": 775 | |
| }, | |
| { | |
| "epoch": 0.1625897019538002, | |
| "grad_norm": 0.04759670048952103, | |
| "learning_rate": 0.00019888621727412892, | |
| "loss": 0.0006, | |
| "step": 776 | |
| }, | |
| { | |
| "epoch": 0.16279922476559636, | |
| "grad_norm": 0.21335595846176147, | |
| "learning_rate": 0.00019888292577495214, | |
| "loss": 0.0064, | |
| "step": 777 | |
| }, | |
| { | |
| "epoch": 0.16300874757739248, | |
| "grad_norm": 0.01456568855792284, | |
| "learning_rate": 0.0001988796294466751, | |
| "loss": 0.0003, | |
| "step": 778 | |
| }, | |
| { | |
| "epoch": 0.16321827038918862, | |
| "grad_norm": 0.12444102019071579, | |
| "learning_rate": 0.00019887632828945878, | |
| "loss": 0.0105, | |
| "step": 779 | |
| }, | |
| { | |
| "epoch": 0.16342779320098474, | |
| "grad_norm": 0.3305560350418091, | |
| "learning_rate": 0.0001988730223034644, | |
| "loss": 0.0722, | |
| "step": 780 | |
| }, | |
| { | |
| "epoch": 0.1636373160127809, | |
| "grad_norm": 0.2740437686443329, | |
| "learning_rate": 0.00019886971148885344, | |
| "loss": 0.0282, | |
| "step": 781 | |
| }, | |
| { | |
| "epoch": 0.163846838824577, | |
| "grad_norm": 0.34872737526893616, | |
| "learning_rate": 0.00019886639584578753, | |
| "loss": 0.0281, | |
| "step": 782 | |
| }, | |
| { | |
| "epoch": 0.16405636163637316, | |
| "grad_norm": 0.03285228833556175, | |
| "learning_rate": 0.00019886307537442865, | |
| "loss": 0.0003, | |
| "step": 783 | |
| }, | |
| { | |
| "epoch": 0.1642658844481693, | |
| "grad_norm": 0.15017957985401154, | |
| "learning_rate": 0.00019885975007493892, | |
| "loss": 0.004, | |
| "step": 784 | |
| }, | |
| { | |
| "epoch": 0.16447540725996543, | |
| "grad_norm": 0.14671967923641205, | |
| "learning_rate": 0.00019885641994748076, | |
| "loss": 0.0045, | |
| "step": 785 | |
| }, | |
| { | |
| "epoch": 0.16468493007176158, | |
| "grad_norm": 0.009040172211825848, | |
| "learning_rate": 0.0001988530849922168, | |
| "loss": 0.0002, | |
| "step": 786 | |
| }, | |
| { | |
| "epoch": 0.1648944528835577, | |
| "grad_norm": 0.1735561639070511, | |
| "learning_rate": 0.0001988497452093099, | |
| "loss": 0.0139, | |
| "step": 787 | |
| }, | |
| { | |
| "epoch": 0.16510397569535384, | |
| "grad_norm": 0.1698157787322998, | |
| "learning_rate": 0.00019884640059892315, | |
| "loss": 0.0077, | |
| "step": 788 | |
| }, | |
| { | |
| "epoch": 0.16531349850714996, | |
| "grad_norm": 0.0034829252399504185, | |
| "learning_rate": 0.0001988430511612199, | |
| "loss": 0.0001, | |
| "step": 789 | |
| }, | |
| { | |
| "epoch": 0.1655230213189461, | |
| "grad_norm": 0.01388998981565237, | |
| "learning_rate": 0.00019883969689636378, | |
| "loss": 0.0001, | |
| "step": 790 | |
| }, | |
| { | |
| "epoch": 0.16573254413074223, | |
| "grad_norm": 0.19312739372253418, | |
| "learning_rate": 0.00019883633780451852, | |
| "loss": 0.0028, | |
| "step": 791 | |
| }, | |
| { | |
| "epoch": 0.16594206694253838, | |
| "grad_norm": 0.31580138206481934, | |
| "learning_rate": 0.00019883297388584818, | |
| "loss": 0.0243, | |
| "step": 792 | |
| }, | |
| { | |
| "epoch": 0.1661515897543345, | |
| "grad_norm": 0.017013167962431908, | |
| "learning_rate": 0.00019882960514051707, | |
| "loss": 0.0002, | |
| "step": 793 | |
| }, | |
| { | |
| "epoch": 0.16636111256613065, | |
| "grad_norm": 0.34026068449020386, | |
| "learning_rate": 0.0001988262315686897, | |
| "loss": 0.0391, | |
| "step": 794 | |
| }, | |
| { | |
| "epoch": 0.16657063537792677, | |
| "grad_norm": 0.2697843313217163, | |
| "learning_rate": 0.00019882285317053083, | |
| "loss": 0.0469, | |
| "step": 795 | |
| }, | |
| { | |
| "epoch": 0.16678015818972292, | |
| "grad_norm": 0.28238460421562195, | |
| "learning_rate": 0.0001988194699462054, | |
| "loss": 0.0299, | |
| "step": 796 | |
| }, | |
| { | |
| "epoch": 0.16698968100151904, | |
| "grad_norm": 0.18721148371696472, | |
| "learning_rate": 0.00019881608189587874, | |
| "loss": 0.0051, | |
| "step": 797 | |
| }, | |
| { | |
| "epoch": 0.16719920381331518, | |
| "grad_norm": 0.37057632207870483, | |
| "learning_rate": 0.0001988126890197162, | |
| "loss": 0.0385, | |
| "step": 798 | |
| }, | |
| { | |
| "epoch": 0.1674087266251113, | |
| "grad_norm": 0.15513499081134796, | |
| "learning_rate": 0.00019880929131788354, | |
| "loss": 0.002, | |
| "step": 799 | |
| }, | |
| { | |
| "epoch": 0.16761824943690745, | |
| "grad_norm": 0.16879650950431824, | |
| "learning_rate": 0.00019880588879054667, | |
| "loss": 0.0015, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.16761824943690745, | |
| "eval_loss": 0.019750364124774933, | |
| "eval_runtime": 89.1527, | |
| "eval_samples_per_second": 8.614, | |
| "eval_steps_per_second": 4.307, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.16782777224870357, | |
| "grad_norm": 0.024027680978178978, | |
| "learning_rate": 0.00019880248143787176, | |
| "loss": 0.0003, | |
| "step": 801 | |
| }, | |
| { | |
| "epoch": 0.16803729506049972, | |
| "grad_norm": 0.5421876907348633, | |
| "learning_rate": 0.00019879906926002522, | |
| "loss": 0.0324, | |
| "step": 802 | |
| }, | |
| { | |
| "epoch": 0.16824681787229584, | |
| "grad_norm": 0.16251395642757416, | |
| "learning_rate": 0.00019879565225717366, | |
| "loss": 0.003, | |
| "step": 803 | |
| }, | |
| { | |
| "epoch": 0.168456340684092, | |
| "grad_norm": 0.1223423108458519, | |
| "learning_rate": 0.00019879223042948402, | |
| "loss": 0.0101, | |
| "step": 804 | |
| }, | |
| { | |
| "epoch": 0.1686658634958881, | |
| "grad_norm": 0.21323543787002563, | |
| "learning_rate": 0.00019878880377712337, | |
| "loss": 0.0149, | |
| "step": 805 | |
| }, | |
| { | |
| "epoch": 0.16887538630768426, | |
| "grad_norm": 0.2671852707862854, | |
| "learning_rate": 0.00019878537230025902, | |
| "loss": 0.0441, | |
| "step": 806 | |
| }, | |
| { | |
| "epoch": 0.16908490911948038, | |
| "grad_norm": 0.46291500329971313, | |
| "learning_rate": 0.0001987819359990586, | |
| "loss": 0.026, | |
| "step": 807 | |
| }, | |
| { | |
| "epoch": 0.16929443193127652, | |
| "grad_norm": 0.011554433964192867, | |
| "learning_rate": 0.00019877849487368992, | |
| "loss": 0.0002, | |
| "step": 808 | |
| }, | |
| { | |
| "epoch": 0.16950395474307264, | |
| "grad_norm": 0.16879846155643463, | |
| "learning_rate": 0.00019877504892432102, | |
| "loss": 0.0032, | |
| "step": 809 | |
| }, | |
| { | |
| "epoch": 0.1697134775548688, | |
| "grad_norm": 0.13901455700397491, | |
| "learning_rate": 0.0001987715981511202, | |
| "loss": 0.0015, | |
| "step": 810 | |
| }, | |
| { | |
| "epoch": 0.1699230003666649, | |
| "grad_norm": 0.17090804874897003, | |
| "learning_rate": 0.000198768142554256, | |
| "loss": 0.0182, | |
| "step": 811 | |
| }, | |
| { | |
| "epoch": 0.17013252317846106, | |
| "grad_norm": 0.2233785092830658, | |
| "learning_rate": 0.0001987646821338971, | |
| "loss": 0.0218, | |
| "step": 812 | |
| }, | |
| { | |
| "epoch": 0.17034204599025718, | |
| "grad_norm": 0.05967244133353233, | |
| "learning_rate": 0.00019876121689021257, | |
| "loss": 0.0007, | |
| "step": 813 | |
| }, | |
| { | |
| "epoch": 0.17055156880205333, | |
| "grad_norm": 0.16300848126411438, | |
| "learning_rate": 0.00019875774682337163, | |
| "loss": 0.0034, | |
| "step": 814 | |
| }, | |
| { | |
| "epoch": 0.17076109161384945, | |
| "grad_norm": 0.11895183473825455, | |
| "learning_rate": 0.00019875427193354373, | |
| "loss": 0.0016, | |
| "step": 815 | |
| }, | |
| { | |
| "epoch": 0.1709706144256456, | |
| "grad_norm": 0.17483823001384735, | |
| "learning_rate": 0.00019875079222089862, | |
| "loss": 0.0046, | |
| "step": 816 | |
| }, | |
| { | |
| "epoch": 0.17118013723744172, | |
| "grad_norm": 0.16585186123847961, | |
| "learning_rate": 0.00019874730768560617, | |
| "loss": 0.0069, | |
| "step": 817 | |
| }, | |
| { | |
| "epoch": 0.17138966004923786, | |
| "grad_norm": 0.017436591908335686, | |
| "learning_rate": 0.0001987438183278366, | |
| "loss": 0.0002, | |
| "step": 818 | |
| }, | |
| { | |
| "epoch": 0.17159918286103398, | |
| "grad_norm": 0.004752448294311762, | |
| "learning_rate": 0.00019874032414776027, | |
| "loss": 0.0001, | |
| "step": 819 | |
| }, | |
| { | |
| "epoch": 0.17180870567283013, | |
| "grad_norm": 0.1625145524740219, | |
| "learning_rate": 0.00019873682514554787, | |
| "loss": 0.0122, | |
| "step": 820 | |
| }, | |
| { | |
| "epoch": 0.17201822848462625, | |
| "grad_norm": 0.16962960362434387, | |
| "learning_rate": 0.00019873332132137026, | |
| "loss": 0.0187, | |
| "step": 821 | |
| }, | |
| { | |
| "epoch": 0.1722277512964224, | |
| "grad_norm": 0.20390696823596954, | |
| "learning_rate": 0.00019872981267539858, | |
| "loss": 0.0171, | |
| "step": 822 | |
| }, | |
| { | |
| "epoch": 0.17243727410821852, | |
| "grad_norm": 0.36607325077056885, | |
| "learning_rate": 0.0001987262992078041, | |
| "loss": 0.0434, | |
| "step": 823 | |
| }, | |
| { | |
| "epoch": 0.17264679692001467, | |
| "grad_norm": 0.24736827611923218, | |
| "learning_rate": 0.00019872278091875848, | |
| "loss": 0.0229, | |
| "step": 824 | |
| }, | |
| { | |
| "epoch": 0.17285631973181081, | |
| "grad_norm": 0.09645625203847885, | |
| "learning_rate": 0.00019871925780843354, | |
| "loss": 0.0014, | |
| "step": 825 | |
| }, | |
| { | |
| "epoch": 0.17306584254360693, | |
| "grad_norm": 0.17568598687648773, | |
| "learning_rate": 0.0001987157298770013, | |
| "loss": 0.0157, | |
| "step": 826 | |
| }, | |
| { | |
| "epoch": 0.17327536535540308, | |
| "grad_norm": 0.11099965870380402, | |
| "learning_rate": 0.00019871219712463408, | |
| "loss": 0.0009, | |
| "step": 827 | |
| }, | |
| { | |
| "epoch": 0.1734848881671992, | |
| "grad_norm": 0.2161271870136261, | |
| "learning_rate": 0.00019870865955150442, | |
| "loss": 0.0186, | |
| "step": 828 | |
| }, | |
| { | |
| "epoch": 0.17369441097899535, | |
| "grad_norm": 0.3481244742870331, | |
| "learning_rate": 0.00019870511715778505, | |
| "loss": 0.0241, | |
| "step": 829 | |
| }, | |
| { | |
| "epoch": 0.17390393379079147, | |
| "grad_norm": 0.30809855461120605, | |
| "learning_rate": 0.000198701569943649, | |
| "loss": 0.0445, | |
| "step": 830 | |
| }, | |
| { | |
| "epoch": 0.17411345660258762, | |
| "grad_norm": 0.07733512669801712, | |
| "learning_rate": 0.00019869801790926945, | |
| "loss": 0.0008, | |
| "step": 831 | |
| }, | |
| { | |
| "epoch": 0.17432297941438374, | |
| "grad_norm": 0.207721546292305, | |
| "learning_rate": 0.0001986944610548199, | |
| "loss": 0.0131, | |
| "step": 832 | |
| }, | |
| { | |
| "epoch": 0.1745325022261799, | |
| "grad_norm": 0.20278921723365784, | |
| "learning_rate": 0.0001986908993804741, | |
| "loss": 0.0237, | |
| "step": 833 | |
| }, | |
| { | |
| "epoch": 0.174742025037976, | |
| "grad_norm": 0.28272855281829834, | |
| "learning_rate": 0.00019868733288640588, | |
| "loss": 0.0262, | |
| "step": 834 | |
| }, | |
| { | |
| "epoch": 0.17495154784977215, | |
| "grad_norm": 0.35000142455101013, | |
| "learning_rate": 0.00019868376157278954, | |
| "loss": 0.0208, | |
| "step": 835 | |
| }, | |
| { | |
| "epoch": 0.17516107066156827, | |
| "grad_norm": 0.2046387940645218, | |
| "learning_rate": 0.0001986801854397994, | |
| "loss": 0.0075, | |
| "step": 836 | |
| }, | |
| { | |
| "epoch": 0.17537059347336442, | |
| "grad_norm": 0.0028248566668480635, | |
| "learning_rate": 0.00019867660448761017, | |
| "loss": 0.0001, | |
| "step": 837 | |
| }, | |
| { | |
| "epoch": 0.17558011628516054, | |
| "grad_norm": 0.26853737235069275, | |
| "learning_rate": 0.00019867301871639666, | |
| "loss": 0.0161, | |
| "step": 838 | |
| }, | |
| { | |
| "epoch": 0.1757896390969567, | |
| "grad_norm": 0.18713527917861938, | |
| "learning_rate": 0.00019866942812633406, | |
| "loss": 0.0167, | |
| "step": 839 | |
| }, | |
| { | |
| "epoch": 0.1759991619087528, | |
| "grad_norm": 0.12379568815231323, | |
| "learning_rate": 0.0001986658327175977, | |
| "loss": 0.0114, | |
| "step": 840 | |
| }, | |
| { | |
| "epoch": 0.17620868472054896, | |
| "grad_norm": 0.04250200465321541, | |
| "learning_rate": 0.00019866223249036312, | |
| "loss": 0.0008, | |
| "step": 841 | |
| }, | |
| { | |
| "epoch": 0.17641820753234508, | |
| "grad_norm": 0.1923532485961914, | |
| "learning_rate": 0.0001986586274448062, | |
| "loss": 0.0127, | |
| "step": 842 | |
| }, | |
| { | |
| "epoch": 0.17662773034414123, | |
| "grad_norm": 0.1902576982975006, | |
| "learning_rate": 0.00019865501758110297, | |
| "loss": 0.0052, | |
| "step": 843 | |
| }, | |
| { | |
| "epoch": 0.17683725315593735, | |
| "grad_norm": 0.27607104182243347, | |
| "learning_rate": 0.00019865140289942974, | |
| "loss": 0.0629, | |
| "step": 844 | |
| }, | |
| { | |
| "epoch": 0.1770467759677335, | |
| "grad_norm": 0.286934494972229, | |
| "learning_rate": 0.00019864778339996302, | |
| "loss": 0.0253, | |
| "step": 845 | |
| }, | |
| { | |
| "epoch": 0.17725629877952961, | |
| "grad_norm": 0.19526824355125427, | |
| "learning_rate": 0.00019864415908287956, | |
| "loss": 0.0053, | |
| "step": 846 | |
| }, | |
| { | |
| "epoch": 0.17746582159132576, | |
| "grad_norm": 0.21397161483764648, | |
| "learning_rate": 0.00019864052994835642, | |
| "loss": 0.0219, | |
| "step": 847 | |
| }, | |
| { | |
| "epoch": 0.17767534440312188, | |
| "grad_norm": 0.2589309811592102, | |
| "learning_rate": 0.00019863689599657077, | |
| "loss": 0.0239, | |
| "step": 848 | |
| }, | |
| { | |
| "epoch": 0.17788486721491803, | |
| "grad_norm": 4.077011585235596, | |
| "learning_rate": 0.0001986332572277001, | |
| "loss": 0.0057, | |
| "step": 849 | |
| }, | |
| { | |
| "epoch": 0.17809439002671415, | |
| "grad_norm": 0.3254491090774536, | |
| "learning_rate": 0.00019862961364192216, | |
| "loss": 0.0259, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 0.1783039128385103, | |
| "grad_norm": 0.00824171956628561, | |
| "learning_rate": 0.0001986259652394148, | |
| "loss": 0.0001, | |
| "step": 851 | |
| }, | |
| { | |
| "epoch": 0.17851343565030642, | |
| "grad_norm": 0.1307021528482437, | |
| "learning_rate": 0.0001986223120203563, | |
| "loss": 0.0033, | |
| "step": 852 | |
| }, | |
| { | |
| "epoch": 0.17872295846210257, | |
| "grad_norm": 0.040325507521629333, | |
| "learning_rate": 0.00019861865398492499, | |
| "loss": 0.0005, | |
| "step": 853 | |
| }, | |
| { | |
| "epoch": 0.17893248127389869, | |
| "grad_norm": 0.2458508163690567, | |
| "learning_rate": 0.00019861499113329954, | |
| "loss": 0.0339, | |
| "step": 854 | |
| }, | |
| { | |
| "epoch": 0.17914200408569483, | |
| "grad_norm": 0.4500856101512909, | |
| "learning_rate": 0.00019861132346565884, | |
| "loss": 0.0344, | |
| "step": 855 | |
| }, | |
| { | |
| "epoch": 0.17935152689749095, | |
| "grad_norm": 0.09408875554800034, | |
| "learning_rate": 0.000198607650982182, | |
| "loss": 0.0028, | |
| "step": 856 | |
| }, | |
| { | |
| "epoch": 0.1795610497092871, | |
| "grad_norm": 0.00868634507060051, | |
| "learning_rate": 0.00019860397368304838, | |
| "loss": 0.0001, | |
| "step": 857 | |
| }, | |
| { | |
| "epoch": 0.17977057252108322, | |
| "grad_norm": 0.042256616055965424, | |
| "learning_rate": 0.00019860029156843753, | |
| "loss": 0.0006, | |
| "step": 858 | |
| }, | |
| { | |
| "epoch": 0.17998009533287937, | |
| "grad_norm": 0.1415722370147705, | |
| "learning_rate": 0.00019859660463852932, | |
| "loss": 0.0025, | |
| "step": 859 | |
| }, | |
| { | |
| "epoch": 0.1801896181446755, | |
| "grad_norm": 0.26225030422210693, | |
| "learning_rate": 0.0001985929128935038, | |
| "loss": 0.0264, | |
| "step": 860 | |
| }, | |
| { | |
| "epoch": 0.18039914095647164, | |
| "grad_norm": 0.4579645097255707, | |
| "learning_rate": 0.00019858921633354122, | |
| "loss": 0.0695, | |
| "step": 861 | |
| }, | |
| { | |
| "epoch": 0.18060866376826776, | |
| "grad_norm": 0.10728690028190613, | |
| "learning_rate": 0.00019858551495882215, | |
| "loss": 0.0097, | |
| "step": 862 | |
| }, | |
| { | |
| "epoch": 0.1808181865800639, | |
| "grad_norm": 0.01471271738409996, | |
| "learning_rate": 0.0001985818087695273, | |
| "loss": 0.0002, | |
| "step": 863 | |
| }, | |
| { | |
| "epoch": 0.18102770939186003, | |
| "grad_norm": 0.107490174472332, | |
| "learning_rate": 0.00019857809776583775, | |
| "loss": 0.0113, | |
| "step": 864 | |
| }, | |
| { | |
| "epoch": 0.18123723220365617, | |
| "grad_norm": 0.13018178939819336, | |
| "learning_rate": 0.0001985743819479347, | |
| "loss": 0.0014, | |
| "step": 865 | |
| }, | |
| { | |
| "epoch": 0.18144675501545232, | |
| "grad_norm": 0.3460003137588501, | |
| "learning_rate": 0.00019857066131599957, | |
| "loss": 0.0389, | |
| "step": 866 | |
| }, | |
| { | |
| "epoch": 0.18165627782724844, | |
| "grad_norm": 0.3483485281467438, | |
| "learning_rate": 0.0001985669358702141, | |
| "loss": 0.0466, | |
| "step": 867 | |
| }, | |
| { | |
| "epoch": 0.1818658006390446, | |
| "grad_norm": 0.13328337669372559, | |
| "learning_rate": 0.00019856320561076026, | |
| "loss": 0.001, | |
| "step": 868 | |
| }, | |
| { | |
| "epoch": 0.1820753234508407, | |
| "grad_norm": 0.24165037274360657, | |
| "learning_rate": 0.00019855947053782017, | |
| "loss": 0.0193, | |
| "step": 869 | |
| }, | |
| { | |
| "epoch": 0.18228484626263686, | |
| "grad_norm": 0.036382876336574554, | |
| "learning_rate": 0.00019855573065157621, | |
| "loss": 0.0004, | |
| "step": 870 | |
| }, | |
| { | |
| "epoch": 0.18249436907443298, | |
| "grad_norm": 0.234747052192688, | |
| "learning_rate": 0.00019855198595221114, | |
| "loss": 0.012, | |
| "step": 871 | |
| }, | |
| { | |
| "epoch": 0.18270389188622913, | |
| "grad_norm": 0.19845280051231384, | |
| "learning_rate": 0.00019854823643990774, | |
| "loss": 0.0138, | |
| "step": 872 | |
| }, | |
| { | |
| "epoch": 0.18291341469802525, | |
| "grad_norm": 0.05412408709526062, | |
| "learning_rate": 0.00019854448211484917, | |
| "loss": 0.0006, | |
| "step": 873 | |
| }, | |
| { | |
| "epoch": 0.1831229375098214, | |
| "grad_norm": 0.15850593149662018, | |
| "learning_rate": 0.00019854072297721876, | |
| "loss": 0.012, | |
| "step": 874 | |
| }, | |
| { | |
| "epoch": 0.1833324603216175, | |
| "grad_norm": 0.535932183265686, | |
| "learning_rate": 0.00019853695902720007, | |
| "loss": 0.041, | |
| "step": 875 | |
| }, | |
| { | |
| "epoch": 0.18354198313341366, | |
| "grad_norm": 0.4136875569820404, | |
| "learning_rate": 0.00019853319026497696, | |
| "loss": 0.0517, | |
| "step": 876 | |
| }, | |
| { | |
| "epoch": 0.18375150594520978, | |
| "grad_norm": 0.1701594591140747, | |
| "learning_rate": 0.00019852941669073343, | |
| "loss": 0.0016, | |
| "step": 877 | |
| }, | |
| { | |
| "epoch": 0.18396102875700593, | |
| "grad_norm": 0.3235994875431061, | |
| "learning_rate": 0.00019852563830465383, | |
| "loss": 0.013, | |
| "step": 878 | |
| }, | |
| { | |
| "epoch": 0.18417055156880205, | |
| "grad_norm": 0.13185402750968933, | |
| "learning_rate": 0.00019852185510692264, | |
| "loss": 0.0011, | |
| "step": 879 | |
| }, | |
| { | |
| "epoch": 0.1843800743805982, | |
| "grad_norm": 0.4098699986934662, | |
| "learning_rate": 0.0001985180670977247, | |
| "loss": 0.015, | |
| "step": 880 | |
| }, | |
| { | |
| "epoch": 0.18458959719239432, | |
| "grad_norm": 0.048046402633190155, | |
| "learning_rate": 0.00019851427427724488, | |
| "loss": 0.0004, | |
| "step": 881 | |
| }, | |
| { | |
| "epoch": 0.18479912000419046, | |
| "grad_norm": 0.3164336383342743, | |
| "learning_rate": 0.00019851047664566846, | |
| "loss": 0.0679, | |
| "step": 882 | |
| }, | |
| { | |
| "epoch": 0.18500864281598658, | |
| "grad_norm": 0.41321858763694763, | |
| "learning_rate": 0.00019850667420318093, | |
| "loss": 0.0139, | |
| "step": 883 | |
| }, | |
| { | |
| "epoch": 0.18521816562778273, | |
| "grad_norm": 0.07493787258863449, | |
| "learning_rate": 0.00019850286694996796, | |
| "loss": 0.0162, | |
| "step": 884 | |
| }, | |
| { | |
| "epoch": 0.18542768843957885, | |
| "grad_norm": 0.08418352156877518, | |
| "learning_rate": 0.0001984990548862155, | |
| "loss": 0.001, | |
| "step": 885 | |
| }, | |
| { | |
| "epoch": 0.185637211251375, | |
| "grad_norm": 0.19334886968135834, | |
| "learning_rate": 0.00019849523801210973, | |
| "loss": 0.0291, | |
| "step": 886 | |
| }, | |
| { | |
| "epoch": 0.18584673406317112, | |
| "grad_norm": 0.05708039924502373, | |
| "learning_rate": 0.000198491416327837, | |
| "loss": 0.0006, | |
| "step": 887 | |
| }, | |
| { | |
| "epoch": 0.18605625687496727, | |
| "grad_norm": 0.1267891228199005, | |
| "learning_rate": 0.00019848758983358398, | |
| "loss": 0.0124, | |
| "step": 888 | |
| }, | |
| { | |
| "epoch": 0.1862657796867634, | |
| "grad_norm": 0.3097265362739563, | |
| "learning_rate": 0.00019848375852953755, | |
| "loss": 0.02, | |
| "step": 889 | |
| }, | |
| { | |
| "epoch": 0.18647530249855954, | |
| "grad_norm": 0.19478236138820648, | |
| "learning_rate": 0.00019847992241588483, | |
| "loss": 0.0292, | |
| "step": 890 | |
| }, | |
| { | |
| "epoch": 0.18668482531035566, | |
| "grad_norm": 0.13891831040382385, | |
| "learning_rate": 0.0001984760814928131, | |
| "loss": 0.0112, | |
| "step": 891 | |
| }, | |
| { | |
| "epoch": 0.1868943481221518, | |
| "grad_norm": 0.09047941863536835, | |
| "learning_rate": 0.00019847223576050998, | |
| "loss": 0.0055, | |
| "step": 892 | |
| }, | |
| { | |
| "epoch": 0.18710387093394792, | |
| "grad_norm": 0.42029663920402527, | |
| "learning_rate": 0.00019846838521916333, | |
| "loss": 0.0313, | |
| "step": 893 | |
| }, | |
| { | |
| "epoch": 0.18731339374574407, | |
| "grad_norm": 0.15446271002292633, | |
| "learning_rate": 0.00019846452986896113, | |
| "loss": 0.0016, | |
| "step": 894 | |
| }, | |
| { | |
| "epoch": 0.1875229165575402, | |
| "grad_norm": 0.21927279233932495, | |
| "learning_rate": 0.00019846066971009168, | |
| "loss": 0.0187, | |
| "step": 895 | |
| }, | |
| { | |
| "epoch": 0.18773243936933634, | |
| "grad_norm": 0.20879912376403809, | |
| "learning_rate": 0.00019845680474274348, | |
| "loss": 0.0158, | |
| "step": 896 | |
| }, | |
| { | |
| "epoch": 0.18794196218113246, | |
| "grad_norm": 0.13854913413524628, | |
| "learning_rate": 0.00019845293496710534, | |
| "loss": 0.011, | |
| "step": 897 | |
| }, | |
| { | |
| "epoch": 0.1881514849929286, | |
| "grad_norm": 0.16847798228263855, | |
| "learning_rate": 0.00019844906038336615, | |
| "loss": 0.0111, | |
| "step": 898 | |
| }, | |
| { | |
| "epoch": 0.18836100780472473, | |
| "grad_norm": 0.07531256973743439, | |
| "learning_rate": 0.00019844518099171524, | |
| "loss": 0.0009, | |
| "step": 899 | |
| }, | |
| { | |
| "epoch": 0.18857053061652088, | |
| "grad_norm": 0.10310601443052292, | |
| "learning_rate": 0.000198441296792342, | |
| "loss": 0.0027, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 0.188780053428317, | |
| "grad_norm": 0.2742733955383301, | |
| "learning_rate": 0.00019843740778543613, | |
| "loss": 0.0088, | |
| "step": 901 | |
| }, | |
| { | |
| "epoch": 0.18898957624011314, | |
| "grad_norm": 0.06786957383155823, | |
| "learning_rate": 0.00019843351397118755, | |
| "loss": 0.0009, | |
| "step": 902 | |
| }, | |
| { | |
| "epoch": 0.18919909905190926, | |
| "grad_norm": 0.208217591047287, | |
| "learning_rate": 0.00019842961534978645, | |
| "loss": 0.0268, | |
| "step": 903 | |
| }, | |
| { | |
| "epoch": 0.1894086218637054, | |
| "grad_norm": 0.028746692463755608, | |
| "learning_rate": 0.0001984257119214232, | |
| "loss": 0.0004, | |
| "step": 904 | |
| }, | |
| { | |
| "epoch": 0.18961814467550153, | |
| "grad_norm": 0.27264735102653503, | |
| "learning_rate": 0.00019842180368628842, | |
| "loss": 0.0179, | |
| "step": 905 | |
| }, | |
| { | |
| "epoch": 0.18982766748729768, | |
| "grad_norm": 0.023868918418884277, | |
| "learning_rate": 0.00019841789064457298, | |
| "loss": 0.0003, | |
| "step": 906 | |
| }, | |
| { | |
| "epoch": 0.1900371902990938, | |
| "grad_norm": 0.030625615268945694, | |
| "learning_rate": 0.000198413972796468, | |
| "loss": 0.0004, | |
| "step": 907 | |
| }, | |
| { | |
| "epoch": 0.19024671311088995, | |
| "grad_norm": 0.12535369396209717, | |
| "learning_rate": 0.00019841005014216485, | |
| "loss": 0.0052, | |
| "step": 908 | |
| }, | |
| { | |
| "epoch": 0.1904562359226861, | |
| "grad_norm": 0.08116110414266586, | |
| "learning_rate": 0.000198406122681855, | |
| "loss": 0.0003, | |
| "step": 909 | |
| }, | |
| { | |
| "epoch": 0.19066575873448222, | |
| "grad_norm": 0.22774437069892883, | |
| "learning_rate": 0.00019840219041573033, | |
| "loss": 0.0151, | |
| "step": 910 | |
| }, | |
| { | |
| "epoch": 0.19087528154627836, | |
| "grad_norm": 0.22736741602420807, | |
| "learning_rate": 0.00019839825334398286, | |
| "loss": 0.0197, | |
| "step": 911 | |
| }, | |
| { | |
| "epoch": 0.19108480435807448, | |
| "grad_norm": 0.012811636552214622, | |
| "learning_rate": 0.00019839431146680486, | |
| "loss": 0.0002, | |
| "step": 912 | |
| }, | |
| { | |
| "epoch": 0.19129432716987063, | |
| "grad_norm": 0.23712413012981415, | |
| "learning_rate": 0.00019839036478438882, | |
| "loss": 0.0169, | |
| "step": 913 | |
| }, | |
| { | |
| "epoch": 0.19150384998166675, | |
| "grad_norm": 0.08614616841077805, | |
| "learning_rate": 0.0001983864132969275, | |
| "loss": 0.0013, | |
| "step": 914 | |
| }, | |
| { | |
| "epoch": 0.1917133727934629, | |
| "grad_norm": 0.23105621337890625, | |
| "learning_rate": 0.00019838245700461385, | |
| "loss": 0.0118, | |
| "step": 915 | |
| }, | |
| { | |
| "epoch": 0.19192289560525902, | |
| "grad_norm": 0.14425182342529297, | |
| "learning_rate": 0.00019837849590764115, | |
| "loss": 0.0145, | |
| "step": 916 | |
| }, | |
| { | |
| "epoch": 0.19213241841705517, | |
| "grad_norm": 0.24712929129600525, | |
| "learning_rate": 0.0001983745300062028, | |
| "loss": 0.0194, | |
| "step": 917 | |
| }, | |
| { | |
| "epoch": 0.1923419412288513, | |
| "grad_norm": 0.32611796259880066, | |
| "learning_rate": 0.00019837055930049243, | |
| "loss": 0.0407, | |
| "step": 918 | |
| }, | |
| { | |
| "epoch": 0.19255146404064744, | |
| "grad_norm": 0.22980710864067078, | |
| "learning_rate": 0.00019836658379070407, | |
| "loss": 0.0424, | |
| "step": 919 | |
| }, | |
| { | |
| "epoch": 0.19276098685244356, | |
| "grad_norm": 0.35468605160713196, | |
| "learning_rate": 0.0001983626034770318, | |
| "loss": 0.019, | |
| "step": 920 | |
| }, | |
| { | |
| "epoch": 0.1929705096642397, | |
| "grad_norm": 0.006418622564524412, | |
| "learning_rate": 0.00019835861835967001, | |
| "loss": 0.0001, | |
| "step": 921 | |
| }, | |
| { | |
| "epoch": 0.19318003247603582, | |
| "grad_norm": 0.34932658076286316, | |
| "learning_rate": 0.0001983546284388133, | |
| "loss": 0.084, | |
| "step": 922 | |
| }, | |
| { | |
| "epoch": 0.19338955528783197, | |
| "grad_norm": 0.034760601818561554, | |
| "learning_rate": 0.00019835063371465657, | |
| "loss": 0.0004, | |
| "step": 923 | |
| }, | |
| { | |
| "epoch": 0.1935990780996281, | |
| "grad_norm": 0.2593575716018677, | |
| "learning_rate": 0.0001983466341873949, | |
| "loss": 0.0178, | |
| "step": 924 | |
| }, | |
| { | |
| "epoch": 0.19380860091142424, | |
| "grad_norm": 0.05930793285369873, | |
| "learning_rate": 0.00019834262985722357, | |
| "loss": 0.0013, | |
| "step": 925 | |
| }, | |
| { | |
| "epoch": 0.19401812372322036, | |
| "grad_norm": 0.17973913252353668, | |
| "learning_rate": 0.00019833862072433816, | |
| "loss": 0.0159, | |
| "step": 926 | |
| }, | |
| { | |
| "epoch": 0.1942276465350165, | |
| "grad_norm": 1.3181376457214355, | |
| "learning_rate": 0.0001983346067889345, | |
| "loss": 0.0079, | |
| "step": 927 | |
| }, | |
| { | |
| "epoch": 0.19443716934681263, | |
| "grad_norm": 0.01102768536657095, | |
| "learning_rate": 0.00019833058805120856, | |
| "loss": 0.0001, | |
| "step": 928 | |
| }, | |
| { | |
| "epoch": 0.19464669215860878, | |
| "grad_norm": 0.3218340575695038, | |
| "learning_rate": 0.00019832656451135666, | |
| "loss": 0.0682, | |
| "step": 929 | |
| }, | |
| { | |
| "epoch": 0.1948562149704049, | |
| "grad_norm": 0.029258154332637787, | |
| "learning_rate": 0.00019832253616957523, | |
| "loss": 0.0005, | |
| "step": 930 | |
| }, | |
| { | |
| "epoch": 0.19506573778220104, | |
| "grad_norm": 0.029073555022478104, | |
| "learning_rate": 0.00019831850302606103, | |
| "loss": 0.0003, | |
| "step": 931 | |
| }, | |
| { | |
| "epoch": 0.19527526059399716, | |
| "grad_norm": 0.2904273271560669, | |
| "learning_rate": 0.00019831446508101103, | |
| "loss": 0.0159, | |
| "step": 932 | |
| }, | |
| { | |
| "epoch": 0.1954847834057933, | |
| "grad_norm": 0.1123453825712204, | |
| "learning_rate": 0.00019831042233462245, | |
| "loss": 0.0049, | |
| "step": 933 | |
| }, | |
| { | |
| "epoch": 0.19569430621758943, | |
| "grad_norm": 0.11524815112352371, | |
| "learning_rate": 0.00019830637478709267, | |
| "loss": 0.0157, | |
| "step": 934 | |
| }, | |
| { | |
| "epoch": 0.19590382902938558, | |
| "grad_norm": 0.23699933290481567, | |
| "learning_rate": 0.00019830232243861942, | |
| "loss": 0.0071, | |
| "step": 935 | |
| }, | |
| { | |
| "epoch": 0.1961133518411817, | |
| "grad_norm": 0.1821090430021286, | |
| "learning_rate": 0.00019829826528940057, | |
| "loss": 0.0137, | |
| "step": 936 | |
| }, | |
| { | |
| "epoch": 0.19632287465297785, | |
| "grad_norm": 0.35947421193122864, | |
| "learning_rate": 0.00019829420333963426, | |
| "loss": 0.0265, | |
| "step": 937 | |
| }, | |
| { | |
| "epoch": 0.19653239746477397, | |
| "grad_norm": 0.22742979228496552, | |
| "learning_rate": 0.00019829013658951883, | |
| "loss": 0.017, | |
| "step": 938 | |
| }, | |
| { | |
| "epoch": 0.19674192027657011, | |
| "grad_norm": 0.06752747297286987, | |
| "learning_rate": 0.00019828606503925292, | |
| "loss": 0.0013, | |
| "step": 939 | |
| }, | |
| { | |
| "epoch": 0.19695144308836623, | |
| "grad_norm": 0.03469230234622955, | |
| "learning_rate": 0.0001982819886890354, | |
| "loss": 0.0003, | |
| "step": 940 | |
| }, | |
| { | |
| "epoch": 0.19716096590016238, | |
| "grad_norm": 0.19584067165851593, | |
| "learning_rate": 0.0001982779075390653, | |
| "loss": 0.0072, | |
| "step": 941 | |
| }, | |
| { | |
| "epoch": 0.1973704887119585, | |
| "grad_norm": 0.08708450198173523, | |
| "learning_rate": 0.00019827382158954193, | |
| "loss": 0.0091, | |
| "step": 942 | |
| }, | |
| { | |
| "epoch": 0.19758001152375465, | |
| "grad_norm": 0.22899965941905975, | |
| "learning_rate": 0.00019826973084066484, | |
| "loss": 0.0155, | |
| "step": 943 | |
| }, | |
| { | |
| "epoch": 0.19778953433555077, | |
| "grad_norm": 0.2735210061073303, | |
| "learning_rate": 0.00019826563529263383, | |
| "loss": 0.0062, | |
| "step": 944 | |
| }, | |
| { | |
| "epoch": 0.19799905714734692, | |
| "grad_norm": 0.13284745812416077, | |
| "learning_rate": 0.00019826153494564887, | |
| "loss": 0.0024, | |
| "step": 945 | |
| }, | |
| { | |
| "epoch": 0.19820857995914304, | |
| "grad_norm": 0.24890956282615662, | |
| "learning_rate": 0.00019825742979991026, | |
| "loss": 0.027, | |
| "step": 946 | |
| }, | |
| { | |
| "epoch": 0.1984181027709392, | |
| "grad_norm": 0.2778416574001312, | |
| "learning_rate": 0.00019825331985561846, | |
| "loss": 0.0321, | |
| "step": 947 | |
| }, | |
| { | |
| "epoch": 0.1986276255827353, | |
| "grad_norm": 0.17397484183311462, | |
| "learning_rate": 0.00019824920511297416, | |
| "loss": 0.0154, | |
| "step": 948 | |
| }, | |
| { | |
| "epoch": 0.19883714839453145, | |
| "grad_norm": 0.08111430704593658, | |
| "learning_rate": 0.0001982450855721783, | |
| "loss": 0.0011, | |
| "step": 949 | |
| }, | |
| { | |
| "epoch": 0.1990466712063276, | |
| "grad_norm": 0.11453194171190262, | |
| "learning_rate": 0.00019824096123343212, | |
| "loss": 0.0059, | |
| "step": 950 | |
| }, | |
| { | |
| "epoch": 0.19925619401812372, | |
| "grad_norm": 0.17547598481178284, | |
| "learning_rate": 0.00019823683209693705, | |
| "loss": 0.0062, | |
| "step": 951 | |
| }, | |
| { | |
| "epoch": 0.19946571682991987, | |
| "grad_norm": 0.02609160542488098, | |
| "learning_rate": 0.00019823269816289464, | |
| "loss": 0.0002, | |
| "step": 952 | |
| }, | |
| { | |
| "epoch": 0.199675239641716, | |
| "grad_norm": 0.41189810633659363, | |
| "learning_rate": 0.00019822855943150687, | |
| "loss": 0.091, | |
| "step": 953 | |
| }, | |
| { | |
| "epoch": 0.19988476245351214, | |
| "grad_norm": 0.1962253600358963, | |
| "learning_rate": 0.00019822441590297581, | |
| "loss": 0.0239, | |
| "step": 954 | |
| }, | |
| { | |
| "epoch": 0.20009428526530826, | |
| "grad_norm": 0.0019026676891371608, | |
| "learning_rate": 0.00019822026757750386, | |
| "loss": 0.0, | |
| "step": 955 | |
| }, | |
| { | |
| "epoch": 0.2003038080771044, | |
| "grad_norm": 0.29771414399147034, | |
| "learning_rate": 0.0001982161144552936, | |
| "loss": 0.0503, | |
| "step": 956 | |
| }, | |
| { | |
| "epoch": 0.20051333088890053, | |
| "grad_norm": 0.12233370542526245, | |
| "learning_rate": 0.00019821195653654784, | |
| "loss": 0.0018, | |
| "step": 957 | |
| }, | |
| { | |
| "epoch": 0.20072285370069667, | |
| "grad_norm": 0.022733421996235847, | |
| "learning_rate": 0.0001982077938214696, | |
| "loss": 0.0002, | |
| "step": 958 | |
| }, | |
| { | |
| "epoch": 0.2009323765124928, | |
| "grad_norm": 0.30897054076194763, | |
| "learning_rate": 0.00019820362631026224, | |
| "loss": 0.0256, | |
| "step": 959 | |
| }, | |
| { | |
| "epoch": 0.20114189932428894, | |
| "grad_norm": 0.16434000432491302, | |
| "learning_rate": 0.00019819945400312926, | |
| "loss": 0.0209, | |
| "step": 960 | |
| }, | |
| { | |
| "epoch": 0.20135142213608506, | |
| "grad_norm": 0.14610372483730316, | |
| "learning_rate": 0.0001981952769002744, | |
| "loss": 0.0011, | |
| "step": 961 | |
| }, | |
| { | |
| "epoch": 0.2015609449478812, | |
| "grad_norm": 0.27273574471473694, | |
| "learning_rate": 0.0001981910950019017, | |
| "loss": 0.0284, | |
| "step": 962 | |
| }, | |
| { | |
| "epoch": 0.20177046775967733, | |
| "grad_norm": 0.1361648440361023, | |
| "learning_rate": 0.0001981869083082154, | |
| "loss": 0.0065, | |
| "step": 963 | |
| }, | |
| { | |
| "epoch": 0.20197999057147348, | |
| "grad_norm": 0.1183745265007019, | |
| "learning_rate": 0.00019818271681941986, | |
| "loss": 0.0034, | |
| "step": 964 | |
| }, | |
| { | |
| "epoch": 0.2021895133832696, | |
| "grad_norm": 0.2849377989768982, | |
| "learning_rate": 0.0001981785205357199, | |
| "loss": 0.0119, | |
| "step": 965 | |
| }, | |
| { | |
| "epoch": 0.20239903619506575, | |
| "grad_norm": 0.013914634473621845, | |
| "learning_rate": 0.00019817431945732034, | |
| "loss": 0.0001, | |
| "step": 966 | |
| }, | |
| { | |
| "epoch": 0.20260855900686187, | |
| "grad_norm": 0.17100666463375092, | |
| "learning_rate": 0.00019817011358442646, | |
| "loss": 0.0134, | |
| "step": 967 | |
| }, | |
| { | |
| "epoch": 0.202818081818658, | |
| "grad_norm": 0.3089207112789154, | |
| "learning_rate": 0.00019816590291724356, | |
| "loss": 0.0347, | |
| "step": 968 | |
| }, | |
| { | |
| "epoch": 0.20302760463045413, | |
| "grad_norm": 0.08947692811489105, | |
| "learning_rate": 0.00019816168745597735, | |
| "loss": 0.0006, | |
| "step": 969 | |
| }, | |
| { | |
| "epoch": 0.20323712744225028, | |
| "grad_norm": 0.3102778196334839, | |
| "learning_rate": 0.00019815746720083365, | |
| "loss": 0.0385, | |
| "step": 970 | |
| }, | |
| { | |
| "epoch": 0.2034466502540464, | |
| "grad_norm": 0.3651212751865387, | |
| "learning_rate": 0.0001981532421520186, | |
| "loss": 0.0431, | |
| "step": 971 | |
| }, | |
| { | |
| "epoch": 0.20365617306584255, | |
| "grad_norm": 0.14294616878032684, | |
| "learning_rate": 0.0001981490123097385, | |
| "loss": 0.0048, | |
| "step": 972 | |
| }, | |
| { | |
| "epoch": 0.20386569587763867, | |
| "grad_norm": 0.2009478658437729, | |
| "learning_rate": 0.00019814477767419994, | |
| "loss": 0.0031, | |
| "step": 973 | |
| }, | |
| { | |
| "epoch": 0.20407521868943482, | |
| "grad_norm": 0.19270165264606476, | |
| "learning_rate": 0.00019814053824560975, | |
| "loss": 0.0074, | |
| "step": 974 | |
| }, | |
| { | |
| "epoch": 0.20428474150123094, | |
| "grad_norm": 0.006634276360273361, | |
| "learning_rate": 0.00019813629402417492, | |
| "loss": 0.0001, | |
| "step": 975 | |
| }, | |
| { | |
| "epoch": 0.20449426431302709, | |
| "grad_norm": 0.17981410026550293, | |
| "learning_rate": 0.00019813204501010275, | |
| "loss": 0.0054, | |
| "step": 976 | |
| }, | |
| { | |
| "epoch": 0.2047037871248232, | |
| "grad_norm": 0.03605171665549278, | |
| "learning_rate": 0.00019812779120360072, | |
| "loss": 0.0004, | |
| "step": 977 | |
| }, | |
| { | |
| "epoch": 0.20491330993661935, | |
| "grad_norm": 0.09814287722110748, | |
| "learning_rate": 0.00019812353260487662, | |
| "loss": 0.0005, | |
| "step": 978 | |
| }, | |
| { | |
| "epoch": 0.20512283274841547, | |
| "grad_norm": 0.41026777029037476, | |
| "learning_rate": 0.0001981192692141384, | |
| "loss": 0.0149, | |
| "step": 979 | |
| }, | |
| { | |
| "epoch": 0.20533235556021162, | |
| "grad_norm": 0.2844783067703247, | |
| "learning_rate": 0.00019811500103159428, | |
| "loss": 0.039, | |
| "step": 980 | |
| }, | |
| { | |
| "epoch": 0.20554187837200774, | |
| "grad_norm": 0.03213176503777504, | |
| "learning_rate": 0.00019811072805745266, | |
| "loss": 0.0003, | |
| "step": 981 | |
| }, | |
| { | |
| "epoch": 0.2057514011838039, | |
| "grad_norm": 0.012578954920172691, | |
| "learning_rate": 0.00019810645029192227, | |
| "loss": 0.0002, | |
| "step": 982 | |
| }, | |
| { | |
| "epoch": 0.2059609239956, | |
| "grad_norm": 0.18747162818908691, | |
| "learning_rate": 0.000198102167735212, | |
| "loss": 0.0018, | |
| "step": 983 | |
| }, | |
| { | |
| "epoch": 0.20617044680739616, | |
| "grad_norm": 0.20987571775913239, | |
| "learning_rate": 0.000198097880387531, | |
| "loss": 0.0023, | |
| "step": 984 | |
| }, | |
| { | |
| "epoch": 0.20637996961919228, | |
| "grad_norm": 0.16509518027305603, | |
| "learning_rate": 0.00019809358824908862, | |
| "loss": 0.0026, | |
| "step": 985 | |
| }, | |
| { | |
| "epoch": 0.20658949243098843, | |
| "grad_norm": 0.12439261376857758, | |
| "learning_rate": 0.0001980892913200945, | |
| "loss": 0.0133, | |
| "step": 986 | |
| }, | |
| { | |
| "epoch": 0.20679901524278455, | |
| "grad_norm": 0.2837631404399872, | |
| "learning_rate": 0.0001980849896007585, | |
| "loss": 0.0058, | |
| "step": 987 | |
| }, | |
| { | |
| "epoch": 0.2070085380545807, | |
| "grad_norm": 0.22140386700630188, | |
| "learning_rate": 0.0001980806830912907, | |
| "loss": 0.0194, | |
| "step": 988 | |
| }, | |
| { | |
| "epoch": 0.2072180608663768, | |
| "grad_norm": 0.19810140132904053, | |
| "learning_rate": 0.00019807637179190138, | |
| "loss": 0.0074, | |
| "step": 989 | |
| }, | |
| { | |
| "epoch": 0.20742758367817296, | |
| "grad_norm": 0.1639014035463333, | |
| "learning_rate": 0.0001980720557028011, | |
| "loss": 0.0039, | |
| "step": 990 | |
| }, | |
| { | |
| "epoch": 0.2076371064899691, | |
| "grad_norm": 0.2784484624862671, | |
| "learning_rate": 0.00019806773482420066, | |
| "loss": 0.0019, | |
| "step": 991 | |
| }, | |
| { | |
| "epoch": 0.20784662930176523, | |
| "grad_norm": 0.060419704765081406, | |
| "learning_rate": 0.00019806340915631108, | |
| "loss": 0.0006, | |
| "step": 992 | |
| }, | |
| { | |
| "epoch": 0.20805615211356138, | |
| "grad_norm": 0.048128314316272736, | |
| "learning_rate": 0.00019805907869934361, | |
| "loss": 0.0005, | |
| "step": 993 | |
| }, | |
| { | |
| "epoch": 0.2082656749253575, | |
| "grad_norm": 0.005089947488158941, | |
| "learning_rate": 0.0001980547434535097, | |
| "loss": 0.0001, | |
| "step": 994 | |
| }, | |
| { | |
| "epoch": 0.20847519773715364, | |
| "grad_norm": 0.430545836687088, | |
| "learning_rate": 0.0001980504034190211, | |
| "loss": 0.0808, | |
| "step": 995 | |
| }, | |
| { | |
| "epoch": 0.20868472054894976, | |
| "grad_norm": 0.023343857377767563, | |
| "learning_rate": 0.00019804605859608977, | |
| "loss": 0.0004, | |
| "step": 996 | |
| }, | |
| { | |
| "epoch": 0.2088942433607459, | |
| "grad_norm": 0.2382965236902237, | |
| "learning_rate": 0.00019804170898492788, | |
| "loss": 0.0454, | |
| "step": 997 | |
| }, | |
| { | |
| "epoch": 0.20910376617254203, | |
| "grad_norm": 0.12488018721342087, | |
| "learning_rate": 0.00019803735458574784, | |
| "loss": 0.0089, | |
| "step": 998 | |
| }, | |
| { | |
| "epoch": 0.20931328898433818, | |
| "grad_norm": 0.005318134557455778, | |
| "learning_rate": 0.00019803299539876233, | |
| "loss": 0.0001, | |
| "step": 999 | |
| }, | |
| { | |
| "epoch": 0.2095228117961343, | |
| "grad_norm": 0.1782492995262146, | |
| "learning_rate": 0.0001980286314241842, | |
| "loss": 0.0178, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.2095228117961343, | |
| "eval_loss": 0.015503130853176117, | |
| "eval_runtime": 89.0527, | |
| "eval_samples_per_second": 8.624, | |
| "eval_steps_per_second": 4.312, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.20973233460793045, | |
| "grad_norm": 0.24667583405971527, | |
| "learning_rate": 0.00019802426266222662, | |
| "loss": 0.024, | |
| "step": 1001 | |
| }, | |
| { | |
| "epoch": 0.20994185741972657, | |
| "grad_norm": 0.0044623855501413345, | |
| "learning_rate": 0.0001980198891131029, | |
| "loss": 0.0001, | |
| "step": 1002 | |
| }, | |
| { | |
| "epoch": 0.21015138023152272, | |
| "grad_norm": 0.2540886402130127, | |
| "learning_rate": 0.00019801551077702664, | |
| "loss": 0.0351, | |
| "step": 1003 | |
| }, | |
| { | |
| "epoch": 0.21036090304331884, | |
| "grad_norm": 0.014486823230981827, | |
| "learning_rate": 0.00019801112765421172, | |
| "loss": 0.0001, | |
| "step": 1004 | |
| }, | |
| { | |
| "epoch": 0.21057042585511498, | |
| "grad_norm": 0.19617009162902832, | |
| "learning_rate": 0.0001980067397448721, | |
| "loss": 0.011, | |
| "step": 1005 | |
| }, | |
| { | |
| "epoch": 0.2107799486669111, | |
| "grad_norm": 0.16247636079788208, | |
| "learning_rate": 0.00019800234704922214, | |
| "loss": 0.0134, | |
| "step": 1006 | |
| }, | |
| { | |
| "epoch": 0.21098947147870725, | |
| "grad_norm": 0.06774534285068512, | |
| "learning_rate": 0.00019799794956747635, | |
| "loss": 0.0008, | |
| "step": 1007 | |
| }, | |
| { | |
| "epoch": 0.21119899429050337, | |
| "grad_norm": 0.1491418480873108, | |
| "learning_rate": 0.00019799354729984947, | |
| "loss": 0.0085, | |
| "step": 1008 | |
| }, | |
| { | |
| "epoch": 0.21140851710229952, | |
| "grad_norm": 0.18873615562915802, | |
| "learning_rate": 0.00019798914024655648, | |
| "loss": 0.011, | |
| "step": 1009 | |
| }, | |
| { | |
| "epoch": 0.21161803991409564, | |
| "grad_norm": 0.17292487621307373, | |
| "learning_rate": 0.00019798472840781267, | |
| "loss": 0.0201, | |
| "step": 1010 | |
| }, | |
| { | |
| "epoch": 0.2118275627258918, | |
| "grad_norm": 0.24127565324306488, | |
| "learning_rate": 0.00019798031178383342, | |
| "loss": 0.0448, | |
| "step": 1011 | |
| }, | |
| { | |
| "epoch": 0.2120370855376879, | |
| "grad_norm": 0.026395272463560104, | |
| "learning_rate": 0.0001979758903748345, | |
| "loss": 0.0006, | |
| "step": 1012 | |
| }, | |
| { | |
| "epoch": 0.21224660834948406, | |
| "grad_norm": 0.2279701977968216, | |
| "learning_rate": 0.00019797146418103174, | |
| "loss": 0.0087, | |
| "step": 1013 | |
| }, | |
| { | |
| "epoch": 0.21245613116128018, | |
| "grad_norm": 0.18590952455997467, | |
| "learning_rate": 0.0001979670332026414, | |
| "loss": 0.0011, | |
| "step": 1014 | |
| }, | |
| { | |
| "epoch": 0.21266565397307632, | |
| "grad_norm": 0.2261616587638855, | |
| "learning_rate": 0.0001979625974398798, | |
| "loss": 0.0333, | |
| "step": 1015 | |
| }, | |
| { | |
| "epoch": 0.21287517678487244, | |
| "grad_norm": 0.22065399587154388, | |
| "learning_rate": 0.00019795815689296363, | |
| "loss": 0.0042, | |
| "step": 1016 | |
| }, | |
| { | |
| "epoch": 0.2130846995966686, | |
| "grad_norm": 0.24057383835315704, | |
| "learning_rate": 0.0001979537115621097, | |
| "loss": 0.0184, | |
| "step": 1017 | |
| }, | |
| { | |
| "epoch": 0.2132942224084647, | |
| "grad_norm": 0.19768278300762177, | |
| "learning_rate": 0.00019794926144753511, | |
| "loss": 0.0179, | |
| "step": 1018 | |
| }, | |
| { | |
| "epoch": 0.21350374522026086, | |
| "grad_norm": 0.18621546030044556, | |
| "learning_rate": 0.00019794480654945721, | |
| "loss": 0.0066, | |
| "step": 1019 | |
| }, | |
| { | |
| "epoch": 0.21371326803205698, | |
| "grad_norm": 0.13579484820365906, | |
| "learning_rate": 0.00019794034686809354, | |
| "loss": 0.0081, | |
| "step": 1020 | |
| }, | |
| { | |
| "epoch": 0.21392279084385313, | |
| "grad_norm": 0.08393269777297974, | |
| "learning_rate": 0.00019793588240366193, | |
| "loss": 0.001, | |
| "step": 1021 | |
| }, | |
| { | |
| "epoch": 0.21413231365564925, | |
| "grad_norm": 0.12567999958992004, | |
| "learning_rate": 0.00019793141315638038, | |
| "loss": 0.008, | |
| "step": 1022 | |
| }, | |
| { | |
| "epoch": 0.2143418364674454, | |
| "grad_norm": 0.3008198142051697, | |
| "learning_rate": 0.00019792693912646715, | |
| "loss": 0.0248, | |
| "step": 1023 | |
| }, | |
| { | |
| "epoch": 0.21455135927924152, | |
| "grad_norm": 0.3744416832923889, | |
| "learning_rate": 0.00019792246031414073, | |
| "loss": 0.025, | |
| "step": 1024 | |
| }, | |
| { | |
| "epoch": 0.21476088209103766, | |
| "grad_norm": 0.3006001114845276, | |
| "learning_rate": 0.00019791797671961988, | |
| "loss": 0.0275, | |
| "step": 1025 | |
| }, | |
| { | |
| "epoch": 0.21497040490283378, | |
| "grad_norm": 0.12467708438634872, | |
| "learning_rate": 0.00019791348834312356, | |
| "loss": 0.0128, | |
| "step": 1026 | |
| }, | |
| { | |
| "epoch": 0.21517992771462993, | |
| "grad_norm": 0.17428621649742126, | |
| "learning_rate": 0.00019790899518487096, | |
| "loss": 0.0269, | |
| "step": 1027 | |
| }, | |
| { | |
| "epoch": 0.21538945052642605, | |
| "grad_norm": 0.20888212323188782, | |
| "learning_rate": 0.00019790449724508148, | |
| "loss": 0.0226, | |
| "step": 1028 | |
| }, | |
| { | |
| "epoch": 0.2155989733382222, | |
| "grad_norm": 0.1774069368839264, | |
| "learning_rate": 0.00019789999452397483, | |
| "loss": 0.0029, | |
| "step": 1029 | |
| }, | |
| { | |
| "epoch": 0.21580849615001832, | |
| "grad_norm": 0.17364779114723206, | |
| "learning_rate": 0.00019789548702177088, | |
| "loss": 0.0065, | |
| "step": 1030 | |
| }, | |
| { | |
| "epoch": 0.21601801896181447, | |
| "grad_norm": 0.0968272015452385, | |
| "learning_rate": 0.00019789097473868976, | |
| "loss": 0.0008, | |
| "step": 1031 | |
| }, | |
| { | |
| "epoch": 0.21622754177361062, | |
| "grad_norm": 0.2362106889486313, | |
| "learning_rate": 0.00019788645767495185, | |
| "loss": 0.0329, | |
| "step": 1032 | |
| }, | |
| { | |
| "epoch": 0.21643706458540674, | |
| "grad_norm": 0.11848565191030502, | |
| "learning_rate": 0.0001978819358307777, | |
| "loss": 0.0126, | |
| "step": 1033 | |
| }, | |
| { | |
| "epoch": 0.21664658739720288, | |
| "grad_norm": 0.24092267453670502, | |
| "learning_rate": 0.00019787740920638823, | |
| "loss": 0.0094, | |
| "step": 1034 | |
| }, | |
| { | |
| "epoch": 0.216856110208999, | |
| "grad_norm": 0.030452342703938484, | |
| "learning_rate": 0.00019787287780200443, | |
| "loss": 0.0086, | |
| "step": 1035 | |
| }, | |
| { | |
| "epoch": 0.21706563302079515, | |
| "grad_norm": 0.21786944568157196, | |
| "learning_rate": 0.00019786834161784764, | |
| "loss": 0.0353, | |
| "step": 1036 | |
| }, | |
| { | |
| "epoch": 0.21727515583259127, | |
| "grad_norm": 0.14589764177799225, | |
| "learning_rate": 0.0001978638006541394, | |
| "loss": 0.0027, | |
| "step": 1037 | |
| }, | |
| { | |
| "epoch": 0.21748467864438742, | |
| "grad_norm": 0.22719940543174744, | |
| "learning_rate": 0.0001978592549111014, | |
| "loss": 0.0278, | |
| "step": 1038 | |
| }, | |
| { | |
| "epoch": 0.21769420145618354, | |
| "grad_norm": 0.2133379429578781, | |
| "learning_rate": 0.00019785470438895569, | |
| "loss": 0.0163, | |
| "step": 1039 | |
| }, | |
| { | |
| "epoch": 0.2179037242679797, | |
| "grad_norm": 0.025479169562458992, | |
| "learning_rate": 0.00019785014908792453, | |
| "loss": 0.0002, | |
| "step": 1040 | |
| }, | |
| { | |
| "epoch": 0.2181132470797758, | |
| "grad_norm": 0.2815213203430176, | |
| "learning_rate": 0.00019784558900823033, | |
| "loss": 0.0176, | |
| "step": 1041 | |
| }, | |
| { | |
| "epoch": 0.21832276989157196, | |
| "grad_norm": 0.018222063779830933, | |
| "learning_rate": 0.00019784102415009583, | |
| "loss": 0.0003, | |
| "step": 1042 | |
| }, | |
| { | |
| "epoch": 0.21853229270336808, | |
| "grad_norm": 0.12288132309913635, | |
| "learning_rate": 0.00019783645451374392, | |
| "loss": 0.0143, | |
| "step": 1043 | |
| }, | |
| { | |
| "epoch": 0.21874181551516422, | |
| "grad_norm": 0.2956022620201111, | |
| "learning_rate": 0.0001978318800993978, | |
| "loss": 0.0416, | |
| "step": 1044 | |
| }, | |
| { | |
| "epoch": 0.21895133832696034, | |
| "grad_norm": 0.024944905191659927, | |
| "learning_rate": 0.0001978273009072809, | |
| "loss": 0.0003, | |
| "step": 1045 | |
| }, | |
| { | |
| "epoch": 0.2191608611387565, | |
| "grad_norm": 0.17367038130760193, | |
| "learning_rate": 0.00019782271693761678, | |
| "loss": 0.0176, | |
| "step": 1046 | |
| }, | |
| { | |
| "epoch": 0.2193703839505526, | |
| "grad_norm": 0.05597973242402077, | |
| "learning_rate": 0.00019781812819062933, | |
| "loss": 0.0083, | |
| "step": 1047 | |
| }, | |
| { | |
| "epoch": 0.21957990676234876, | |
| "grad_norm": 0.12071727216243744, | |
| "learning_rate": 0.00019781353466654267, | |
| "loss": 0.0023, | |
| "step": 1048 | |
| }, | |
| { | |
| "epoch": 0.21978942957414488, | |
| "grad_norm": 0.08094103634357452, | |
| "learning_rate": 0.00019780893636558107, | |
| "loss": 0.001, | |
| "step": 1049 | |
| }, | |
| { | |
| "epoch": 0.21999895238594103, | |
| "grad_norm": 0.2887085974216461, | |
| "learning_rate": 0.00019780433328796918, | |
| "loss": 0.0249, | |
| "step": 1050 | |
| }, | |
| { | |
| "epoch": 0.22020847519773715, | |
| "grad_norm": 0.10958587378263474, | |
| "learning_rate": 0.0001977997254339318, | |
| "loss": 0.0075, | |
| "step": 1051 | |
| }, | |
| { | |
| "epoch": 0.2204179980095333, | |
| "grad_norm": 0.027714794501662254, | |
| "learning_rate": 0.00019779511280369386, | |
| "loss": 0.0003, | |
| "step": 1052 | |
| }, | |
| { | |
| "epoch": 0.22062752082132941, | |
| "grad_norm": 0.11167047172784805, | |
| "learning_rate": 0.0001977904953974807, | |
| "loss": 0.009, | |
| "step": 1053 | |
| }, | |
| { | |
| "epoch": 0.22083704363312556, | |
| "grad_norm": 0.0651421770453453, | |
| "learning_rate": 0.00019778587321551782, | |
| "loss": 0.0009, | |
| "step": 1054 | |
| }, | |
| { | |
| "epoch": 0.22104656644492168, | |
| "grad_norm": 0.021489938721060753, | |
| "learning_rate": 0.00019778124625803093, | |
| "loss": 0.0002, | |
| "step": 1055 | |
| }, | |
| { | |
| "epoch": 0.22125608925671783, | |
| "grad_norm": 0.22498519718647003, | |
| "learning_rate": 0.000197776614525246, | |
| "loss": 0.023, | |
| "step": 1056 | |
| }, | |
| { | |
| "epoch": 0.22146561206851395, | |
| "grad_norm": 0.1699984073638916, | |
| "learning_rate": 0.00019777197801738923, | |
| "loss": 0.0209, | |
| "step": 1057 | |
| }, | |
| { | |
| "epoch": 0.2216751348803101, | |
| "grad_norm": 0.09820838272571564, | |
| "learning_rate": 0.00019776733673468707, | |
| "loss": 0.0044, | |
| "step": 1058 | |
| }, | |
| { | |
| "epoch": 0.22188465769210622, | |
| "grad_norm": 0.01764521189033985, | |
| "learning_rate": 0.00019776269067736614, | |
| "loss": 0.0003, | |
| "step": 1059 | |
| }, | |
| { | |
| "epoch": 0.22209418050390237, | |
| "grad_norm": 0.1787995547056198, | |
| "learning_rate": 0.00019775803984565336, | |
| "loss": 0.0134, | |
| "step": 1060 | |
| }, | |
| { | |
| "epoch": 0.2223037033156985, | |
| "grad_norm": 0.10098960250616074, | |
| "learning_rate": 0.00019775338423977585, | |
| "loss": 0.0006, | |
| "step": 1061 | |
| }, | |
| { | |
| "epoch": 0.22251322612749463, | |
| "grad_norm": 0.40593600273132324, | |
| "learning_rate": 0.00019774872385996102, | |
| "loss": 0.0599, | |
| "step": 1062 | |
| }, | |
| { | |
| "epoch": 0.22272274893929075, | |
| "grad_norm": 0.27995312213897705, | |
| "learning_rate": 0.0001977440587064364, | |
| "loss": 0.0427, | |
| "step": 1063 | |
| }, | |
| { | |
| "epoch": 0.2229322717510869, | |
| "grad_norm": 0.317348450422287, | |
| "learning_rate": 0.00019773938877942987, | |
| "loss": 0.0325, | |
| "step": 1064 | |
| }, | |
| { | |
| "epoch": 0.22314179456288302, | |
| "grad_norm": 0.3249301016330719, | |
| "learning_rate": 0.0001977347140791695, | |
| "loss": 0.0173, | |
| "step": 1065 | |
| }, | |
| { | |
| "epoch": 0.22335131737467917, | |
| "grad_norm": 0.16467350721359253, | |
| "learning_rate": 0.0001977300346058835, | |
| "loss": 0.0184, | |
| "step": 1066 | |
| }, | |
| { | |
| "epoch": 0.2235608401864753, | |
| "grad_norm": 0.16043822467327118, | |
| "learning_rate": 0.00019772535035980052, | |
| "loss": 0.0012, | |
| "step": 1067 | |
| }, | |
| { | |
| "epoch": 0.22377036299827144, | |
| "grad_norm": 0.16195471584796906, | |
| "learning_rate": 0.0001977206613411492, | |
| "loss": 0.0099, | |
| "step": 1068 | |
| }, | |
| { | |
| "epoch": 0.22397988581006756, | |
| "grad_norm": 0.01258161198347807, | |
| "learning_rate": 0.00019771596755015867, | |
| "loss": 0.0002, | |
| "step": 1069 | |
| }, | |
| { | |
| "epoch": 0.2241894086218637, | |
| "grad_norm": 0.0009052444947883487, | |
| "learning_rate": 0.00019771126898705804, | |
| "loss": 0.0, | |
| "step": 1070 | |
| }, | |
| { | |
| "epoch": 0.22439893143365983, | |
| "grad_norm": 0.09450815618038177, | |
| "learning_rate": 0.00019770656565207685, | |
| "loss": 0.0018, | |
| "step": 1071 | |
| }, | |
| { | |
| "epoch": 0.22460845424545597, | |
| "grad_norm": 0.2263779193162918, | |
| "learning_rate": 0.00019770185754544475, | |
| "loss": 0.0388, | |
| "step": 1072 | |
| }, | |
| { | |
| "epoch": 0.22481797705725212, | |
| "grad_norm": 0.0903795063495636, | |
| "learning_rate": 0.0001976971446673917, | |
| "loss": 0.0123, | |
| "step": 1073 | |
| }, | |
| { | |
| "epoch": 0.22502749986904824, | |
| "grad_norm": 0.002591166878119111, | |
| "learning_rate": 0.0001976924270181478, | |
| "loss": 0.0001, | |
| "step": 1074 | |
| }, | |
| { | |
| "epoch": 0.2252370226808444, | |
| "grad_norm": 0.17566534876823425, | |
| "learning_rate": 0.00019768770459794351, | |
| "loss": 0.0189, | |
| "step": 1075 | |
| }, | |
| { | |
| "epoch": 0.2254465454926405, | |
| "grad_norm": 0.1893072873353958, | |
| "learning_rate": 0.00019768297740700944, | |
| "loss": 0.002, | |
| "step": 1076 | |
| }, | |
| { | |
| "epoch": 0.22565606830443666, | |
| "grad_norm": 0.40008923411369324, | |
| "learning_rate": 0.00019767824544557642, | |
| "loss": 0.0479, | |
| "step": 1077 | |
| }, | |
| { | |
| "epoch": 0.22586559111623278, | |
| "grad_norm": 0.0161714069545269, | |
| "learning_rate": 0.00019767350871387557, | |
| "loss": 0.0002, | |
| "step": 1078 | |
| }, | |
| { | |
| "epoch": 0.22607511392802893, | |
| "grad_norm": 0.2905687391757965, | |
| "learning_rate": 0.00019766876721213824, | |
| "loss": 0.0301, | |
| "step": 1079 | |
| }, | |
| { | |
| "epoch": 0.22628463673982505, | |
| "grad_norm": 0.1825425624847412, | |
| "learning_rate": 0.0001976640209405959, | |
| "loss": 0.0258, | |
| "step": 1080 | |
| }, | |
| { | |
| "epoch": 0.2264941595516212, | |
| "grad_norm": 0.2943969964981079, | |
| "learning_rate": 0.00019765926989948044, | |
| "loss": 0.0253, | |
| "step": 1081 | |
| }, | |
| { | |
| "epoch": 0.2267036823634173, | |
| "grad_norm": 0.03229305148124695, | |
| "learning_rate": 0.00019765451408902383, | |
| "loss": 0.0004, | |
| "step": 1082 | |
| }, | |
| { | |
| "epoch": 0.22691320517521346, | |
| "grad_norm": 0.07214413583278656, | |
| "learning_rate": 0.00019764975350945838, | |
| "loss": 0.0026, | |
| "step": 1083 | |
| }, | |
| { | |
| "epoch": 0.22712272798700958, | |
| "grad_norm": 0.18299317359924316, | |
| "learning_rate": 0.00019764498816101652, | |
| "loss": 0.0153, | |
| "step": 1084 | |
| }, | |
| { | |
| "epoch": 0.22733225079880573, | |
| "grad_norm": 0.28171518445014954, | |
| "learning_rate": 0.00019764021804393099, | |
| "loss": 0.0329, | |
| "step": 1085 | |
| }, | |
| { | |
| "epoch": 0.22754177361060185, | |
| "grad_norm": 0.18641382455825806, | |
| "learning_rate": 0.00019763544315843474, | |
| "loss": 0.0147, | |
| "step": 1086 | |
| }, | |
| { | |
| "epoch": 0.227751296422398, | |
| "grad_norm": 0.16016316413879395, | |
| "learning_rate": 0.00019763066350476097, | |
| "loss": 0.004, | |
| "step": 1087 | |
| }, | |
| { | |
| "epoch": 0.22796081923419412, | |
| "grad_norm": 0.15008705854415894, | |
| "learning_rate": 0.0001976258790831431, | |
| "loss": 0.0235, | |
| "step": 1088 | |
| }, | |
| { | |
| "epoch": 0.22817034204599027, | |
| "grad_norm": 0.24476243555545807, | |
| "learning_rate": 0.00019762108989381481, | |
| "loss": 0.0299, | |
| "step": 1089 | |
| }, | |
| { | |
| "epoch": 0.22837986485778639, | |
| "grad_norm": 0.027294384315609932, | |
| "learning_rate": 0.00019761629593701, | |
| "loss": 0.0003, | |
| "step": 1090 | |
| }, | |
| { | |
| "epoch": 0.22858938766958253, | |
| "grad_norm": 0.20721612870693207, | |
| "learning_rate": 0.00019761149721296269, | |
| "loss": 0.0046, | |
| "step": 1091 | |
| }, | |
| { | |
| "epoch": 0.22879891048137865, | |
| "grad_norm": 0.34984588623046875, | |
| "learning_rate": 0.0001976066937219073, | |
| "loss": 0.0551, | |
| "step": 1092 | |
| }, | |
| { | |
| "epoch": 0.2290084332931748, | |
| "grad_norm": 0.08879242092370987, | |
| "learning_rate": 0.00019760188546407844, | |
| "loss": 0.0005, | |
| "step": 1093 | |
| }, | |
| { | |
| "epoch": 0.22921795610497092, | |
| "grad_norm": 0.08779024332761765, | |
| "learning_rate": 0.00019759707243971087, | |
| "loss": 0.0009, | |
| "step": 1094 | |
| }, | |
| { | |
| "epoch": 0.22942747891676707, | |
| "grad_norm": 0.22871573269367218, | |
| "learning_rate": 0.00019759225464903972, | |
| "loss": 0.0155, | |
| "step": 1095 | |
| }, | |
| { | |
| "epoch": 0.2296370017285632, | |
| "grad_norm": 0.005597609095275402, | |
| "learning_rate": 0.00019758743209230022, | |
| "loss": 0.0001, | |
| "step": 1096 | |
| }, | |
| { | |
| "epoch": 0.22984652454035934, | |
| "grad_norm": 0.180862158536911, | |
| "learning_rate": 0.0001975826047697279, | |
| "loss": 0.0159, | |
| "step": 1097 | |
| }, | |
| { | |
| "epoch": 0.23005604735215546, | |
| "grad_norm": 0.011714598163962364, | |
| "learning_rate": 0.00019757777268155846, | |
| "loss": 0.0001, | |
| "step": 1098 | |
| }, | |
| { | |
| "epoch": 0.2302655701639516, | |
| "grad_norm": 0.16202227771282196, | |
| "learning_rate": 0.00019757293582802794, | |
| "loss": 0.0225, | |
| "step": 1099 | |
| }, | |
| { | |
| "epoch": 0.23047509297574773, | |
| "grad_norm": 0.030815673992037773, | |
| "learning_rate": 0.00019756809420937255, | |
| "loss": 0.0002, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 0.23068461578754387, | |
| "grad_norm": 0.1840132772922516, | |
| "learning_rate": 0.00019756324782582873, | |
| "loss": 0.0099, | |
| "step": 1101 | |
| }, | |
| { | |
| "epoch": 0.23089413859934, | |
| "grad_norm": 0.16079594194889069, | |
| "learning_rate": 0.00019755839667763317, | |
| "loss": 0.006, | |
| "step": 1102 | |
| }, | |
| { | |
| "epoch": 0.23110366141113614, | |
| "grad_norm": 0.30695217847824097, | |
| "learning_rate": 0.00019755354076502276, | |
| "loss": 0.0175, | |
| "step": 1103 | |
| }, | |
| { | |
| "epoch": 0.23131318422293226, | |
| "grad_norm": 0.011515875346958637, | |
| "learning_rate": 0.00019754868008823467, | |
| "loss": 0.0001, | |
| "step": 1104 | |
| }, | |
| { | |
| "epoch": 0.2315227070347284, | |
| "grad_norm": 0.14559753239154816, | |
| "learning_rate": 0.00019754381464750628, | |
| "loss": 0.0078, | |
| "step": 1105 | |
| }, | |
| { | |
| "epoch": 0.23173222984652453, | |
| "grad_norm": 0.007846977561712265, | |
| "learning_rate": 0.00019753894444307516, | |
| "loss": 0.0001, | |
| "step": 1106 | |
| }, | |
| { | |
| "epoch": 0.23194175265832068, | |
| "grad_norm": 0.03170756250619888, | |
| "learning_rate": 0.00019753406947517924, | |
| "loss": 0.0003, | |
| "step": 1107 | |
| }, | |
| { | |
| "epoch": 0.2321512754701168, | |
| "grad_norm": 0.0651014968752861, | |
| "learning_rate": 0.00019752918974405648, | |
| "loss": 0.0031, | |
| "step": 1108 | |
| }, | |
| { | |
| "epoch": 0.23236079828191294, | |
| "grad_norm": 0.26344966888427734, | |
| "learning_rate": 0.00019752430524994528, | |
| "loss": 0.0232, | |
| "step": 1109 | |
| }, | |
| { | |
| "epoch": 0.23257032109370906, | |
| "grad_norm": 0.2215491235256195, | |
| "learning_rate": 0.0001975194159930841, | |
| "loss": 0.002, | |
| "step": 1110 | |
| }, | |
| { | |
| "epoch": 0.2327798439055052, | |
| "grad_norm": 0.00715980026870966, | |
| "learning_rate": 0.00019751452197371182, | |
| "loss": 0.0001, | |
| "step": 1111 | |
| }, | |
| { | |
| "epoch": 0.23298936671730133, | |
| "grad_norm": 0.01364982221275568, | |
| "learning_rate": 0.0001975096231920674, | |
| "loss": 0.0002, | |
| "step": 1112 | |
| }, | |
| { | |
| "epoch": 0.23319888952909748, | |
| "grad_norm": 0.17877884209156036, | |
| "learning_rate": 0.00019750471964839005, | |
| "loss": 0.0027, | |
| "step": 1113 | |
| }, | |
| { | |
| "epoch": 0.23340841234089363, | |
| "grad_norm": 0.31934672594070435, | |
| "learning_rate": 0.0001974998113429193, | |
| "loss": 0.0443, | |
| "step": 1114 | |
| }, | |
| { | |
| "epoch": 0.23361793515268975, | |
| "grad_norm": 0.41927701234817505, | |
| "learning_rate": 0.00019749489827589477, | |
| "loss": 0.0651, | |
| "step": 1115 | |
| }, | |
| { | |
| "epoch": 0.2338274579644859, | |
| "grad_norm": 0.004164255689829588, | |
| "learning_rate": 0.00019748998044755647, | |
| "loss": 0.0001, | |
| "step": 1116 | |
| }, | |
| { | |
| "epoch": 0.23403698077628202, | |
| "grad_norm": 0.003149515949189663, | |
| "learning_rate": 0.00019748505785814456, | |
| "loss": 0.0001, | |
| "step": 1117 | |
| }, | |
| { | |
| "epoch": 0.23424650358807816, | |
| "grad_norm": 0.22820650041103363, | |
| "learning_rate": 0.0001974801305078994, | |
| "loss": 0.0291, | |
| "step": 1118 | |
| }, | |
| { | |
| "epoch": 0.23445602639987428, | |
| "grad_norm": 0.06346362829208374, | |
| "learning_rate": 0.00019747519839706165, | |
| "loss": 0.0006, | |
| "step": 1119 | |
| }, | |
| { | |
| "epoch": 0.23466554921167043, | |
| "grad_norm": 0.17930179834365845, | |
| "learning_rate": 0.0001974702615258722, | |
| "loss": 0.0085, | |
| "step": 1120 | |
| }, | |
| { | |
| "epoch": 0.23487507202346655, | |
| "grad_norm": 0.03995645418763161, | |
| "learning_rate": 0.00019746531989457214, | |
| "loss": 0.0004, | |
| "step": 1121 | |
| }, | |
| { | |
| "epoch": 0.2350845948352627, | |
| "grad_norm": 0.16451582312583923, | |
| "learning_rate": 0.00019746037350340276, | |
| "loss": 0.0111, | |
| "step": 1122 | |
| }, | |
| { | |
| "epoch": 0.23529411764705882, | |
| "grad_norm": 0.1479364037513733, | |
| "learning_rate": 0.0001974554223526057, | |
| "loss": 0.0243, | |
| "step": 1123 | |
| }, | |
| { | |
| "epoch": 0.23550364045885497, | |
| "grad_norm": 0.04975096508860588, | |
| "learning_rate": 0.00019745046644242267, | |
| "loss": 0.0005, | |
| "step": 1124 | |
| }, | |
| { | |
| "epoch": 0.2357131632706511, | |
| "grad_norm": 0.10589946806430817, | |
| "learning_rate": 0.00019744550577309575, | |
| "loss": 0.0018, | |
| "step": 1125 | |
| }, | |
| { | |
| "epoch": 0.23592268608244724, | |
| "grad_norm": 0.07141809910535812, | |
| "learning_rate": 0.00019744054034486722, | |
| "loss": 0.0009, | |
| "step": 1126 | |
| }, | |
| { | |
| "epoch": 0.23613220889424336, | |
| "grad_norm": 0.11263751983642578, | |
| "learning_rate": 0.00019743557015797954, | |
| "loss": 0.0129, | |
| "step": 1127 | |
| }, | |
| { | |
| "epoch": 0.2363417317060395, | |
| "grad_norm": 0.16582761704921722, | |
| "learning_rate": 0.0001974305952126754, | |
| "loss": 0.013, | |
| "step": 1128 | |
| }, | |
| { | |
| "epoch": 0.23655125451783562, | |
| "grad_norm": 0.19919754564762115, | |
| "learning_rate": 0.0001974256155091979, | |
| "loss": 0.0019, | |
| "step": 1129 | |
| }, | |
| { | |
| "epoch": 0.23676077732963177, | |
| "grad_norm": 0.052698615938425064, | |
| "learning_rate": 0.00019742063104779008, | |
| "loss": 0.0023, | |
| "step": 1130 | |
| }, | |
| { | |
| "epoch": 0.2369703001414279, | |
| "grad_norm": 0.14383988082408905, | |
| "learning_rate": 0.00019741564182869544, | |
| "loss": 0.0095, | |
| "step": 1131 | |
| }, | |
| { | |
| "epoch": 0.23717982295322404, | |
| "grad_norm": 0.34627342224121094, | |
| "learning_rate": 0.00019741064785215758, | |
| "loss": 0.0533, | |
| "step": 1132 | |
| }, | |
| { | |
| "epoch": 0.23738934576502016, | |
| "grad_norm": 0.3608137369155884, | |
| "learning_rate": 0.00019740564911842044, | |
| "loss": 0.0742, | |
| "step": 1133 | |
| }, | |
| { | |
| "epoch": 0.2375988685768163, | |
| "grad_norm": 0.3834199905395508, | |
| "learning_rate": 0.00019740064562772815, | |
| "loss": 0.0685, | |
| "step": 1134 | |
| }, | |
| { | |
| "epoch": 0.23780839138861243, | |
| "grad_norm": 0.19751276075839996, | |
| "learning_rate": 0.00019739563738032504, | |
| "loss": 0.0296, | |
| "step": 1135 | |
| }, | |
| { | |
| "epoch": 0.23801791420040858, | |
| "grad_norm": 0.2406461536884308, | |
| "learning_rate": 0.00019739062437645568, | |
| "loss": 0.032, | |
| "step": 1136 | |
| }, | |
| { | |
| "epoch": 0.2382274370122047, | |
| "grad_norm": 0.036680351942777634, | |
| "learning_rate": 0.00019738560661636492, | |
| "loss": 0.0006, | |
| "step": 1137 | |
| }, | |
| { | |
| "epoch": 0.23843695982400084, | |
| "grad_norm": 0.12333112210035324, | |
| "learning_rate": 0.00019738058410029776, | |
| "loss": 0.027, | |
| "step": 1138 | |
| }, | |
| { | |
| "epoch": 0.23864648263579696, | |
| "grad_norm": 0.12504327297210693, | |
| "learning_rate": 0.00019737555682849956, | |
| "loss": 0.0077, | |
| "step": 1139 | |
| }, | |
| { | |
| "epoch": 0.2388560054475931, | |
| "grad_norm": 0.26424646377563477, | |
| "learning_rate": 0.00019737052480121577, | |
| "loss": 0.0243, | |
| "step": 1140 | |
| }, | |
| { | |
| "epoch": 0.23906552825938923, | |
| "grad_norm": 0.05994394049048424, | |
| "learning_rate": 0.00019736548801869215, | |
| "loss": 0.0008, | |
| "step": 1141 | |
| }, | |
| { | |
| "epoch": 0.23927505107118538, | |
| "grad_norm": 0.15409626066684723, | |
| "learning_rate": 0.0001973604464811747, | |
| "loss": 0.0101, | |
| "step": 1142 | |
| }, | |
| { | |
| "epoch": 0.2394845738829815, | |
| "grad_norm": 0.011877711862325668, | |
| "learning_rate": 0.0001973554001889096, | |
| "loss": 0.0002, | |
| "step": 1143 | |
| }, | |
| { | |
| "epoch": 0.23969409669477765, | |
| "grad_norm": 0.14174003899097443, | |
| "learning_rate": 0.0001973503491421433, | |
| "loss": 0.0019, | |
| "step": 1144 | |
| }, | |
| { | |
| "epoch": 0.23990361950657377, | |
| "grad_norm": 0.13701941072940826, | |
| "learning_rate": 0.00019734529334112253, | |
| "loss": 0.014, | |
| "step": 1145 | |
| }, | |
| { | |
| "epoch": 0.24011314231836992, | |
| "grad_norm": 0.19319787621498108, | |
| "learning_rate": 0.00019734023278609412, | |
| "loss": 0.0064, | |
| "step": 1146 | |
| }, | |
| { | |
| "epoch": 0.24032266513016604, | |
| "grad_norm": 0.09388478845357895, | |
| "learning_rate": 0.00019733516747730528, | |
| "loss": 0.0058, | |
| "step": 1147 | |
| }, | |
| { | |
| "epoch": 0.24053218794196218, | |
| "grad_norm": 0.00462870579212904, | |
| "learning_rate": 0.0001973300974150033, | |
| "loss": 0.0001, | |
| "step": 1148 | |
| }, | |
| { | |
| "epoch": 0.2407417107537583, | |
| "grad_norm": 0.21105362474918365, | |
| "learning_rate": 0.00019732502259943587, | |
| "loss": 0.0435, | |
| "step": 1149 | |
| }, | |
| { | |
| "epoch": 0.24095123356555445, | |
| "grad_norm": 0.21553511917591095, | |
| "learning_rate": 0.00019731994303085075, | |
| "loss": 0.0065, | |
| "step": 1150 | |
| }, | |
| { | |
| "epoch": 0.24116075637735057, | |
| "grad_norm": 0.1303602159023285, | |
| "learning_rate": 0.00019731485870949606, | |
| "loss": 0.0086, | |
| "step": 1151 | |
| }, | |
| { | |
| "epoch": 0.24137027918914672, | |
| "grad_norm": 0.009067162871360779, | |
| "learning_rate": 0.00019730976963562008, | |
| "loss": 0.0001, | |
| "step": 1152 | |
| }, | |
| { | |
| "epoch": 0.24157980200094284, | |
| "grad_norm": 0.30989691615104675, | |
| "learning_rate": 0.00019730467580947138, | |
| "loss": 0.0328, | |
| "step": 1153 | |
| }, | |
| { | |
| "epoch": 0.241789324812739, | |
| "grad_norm": 0.05775981396436691, | |
| "learning_rate": 0.00019729957723129866, | |
| "loss": 0.0005, | |
| "step": 1154 | |
| }, | |
| { | |
| "epoch": 0.24199884762453513, | |
| "grad_norm": 0.14925909042358398, | |
| "learning_rate": 0.00019729447390135098, | |
| "loss": 0.0147, | |
| "step": 1155 | |
| }, | |
| { | |
| "epoch": 0.24220837043633126, | |
| "grad_norm": 0.1444745808839798, | |
| "learning_rate": 0.00019728936581987752, | |
| "loss": 0.0148, | |
| "step": 1156 | |
| }, | |
| { | |
| "epoch": 0.2424178932481274, | |
| "grad_norm": 0.004791347309947014, | |
| "learning_rate": 0.00019728425298712776, | |
| "loss": 0.0001, | |
| "step": 1157 | |
| }, | |
| { | |
| "epoch": 0.24262741605992352, | |
| "grad_norm": 0.12054464221000671, | |
| "learning_rate": 0.00019727913540335142, | |
| "loss": 0.0099, | |
| "step": 1158 | |
| }, | |
| { | |
| "epoch": 0.24283693887171967, | |
| "grad_norm": 0.02685241401195526, | |
| "learning_rate": 0.00019727401306879837, | |
| "loss": 0.0002, | |
| "step": 1159 | |
| }, | |
| { | |
| "epoch": 0.2430464616835158, | |
| "grad_norm": 0.1325118988752365, | |
| "learning_rate": 0.00019726888598371883, | |
| "loss": 0.0129, | |
| "step": 1160 | |
| }, | |
| { | |
| "epoch": 0.24325598449531194, | |
| "grad_norm": 0.010920906439423561, | |
| "learning_rate": 0.0001972637541483631, | |
| "loss": 0.0001, | |
| "step": 1161 | |
| }, | |
| { | |
| "epoch": 0.24346550730710806, | |
| "grad_norm": 0.1611892580986023, | |
| "learning_rate": 0.00019725861756298191, | |
| "loss": 0.0025, | |
| "step": 1162 | |
| }, | |
| { | |
| "epoch": 0.2436750301189042, | |
| "grad_norm": 0.0020086602307856083, | |
| "learning_rate": 0.00019725347622782604, | |
| "loss": 0.0, | |
| "step": 1163 | |
| }, | |
| { | |
| "epoch": 0.24388455293070033, | |
| "grad_norm": 0.20563958585262299, | |
| "learning_rate": 0.00019724833014314662, | |
| "loss": 0.009, | |
| "step": 1164 | |
| }, | |
| { | |
| "epoch": 0.24409407574249647, | |
| "grad_norm": 0.21522867679595947, | |
| "learning_rate": 0.0001972431793091949, | |
| "loss": 0.0177, | |
| "step": 1165 | |
| }, | |
| { | |
| "epoch": 0.2443035985542926, | |
| "grad_norm": 0.25818154215812683, | |
| "learning_rate": 0.00019723802372622248, | |
| "loss": 0.0223, | |
| "step": 1166 | |
| }, | |
| { | |
| "epoch": 0.24451312136608874, | |
| "grad_norm": 0.2856491208076477, | |
| "learning_rate": 0.00019723286339448114, | |
| "loss": 0.0353, | |
| "step": 1167 | |
| }, | |
| { | |
| "epoch": 0.24472264417788486, | |
| "grad_norm": 0.12360674142837524, | |
| "learning_rate": 0.0001972276983142229, | |
| "loss": 0.0035, | |
| "step": 1168 | |
| }, | |
| { | |
| "epoch": 0.244932166989681, | |
| "grad_norm": 0.07090656459331512, | |
| "learning_rate": 0.0001972225284857, | |
| "loss": 0.0007, | |
| "step": 1169 | |
| }, | |
| { | |
| "epoch": 0.24514168980147713, | |
| "grad_norm": 0.23631127178668976, | |
| "learning_rate": 0.00019721735390916485, | |
| "loss": 0.0039, | |
| "step": 1170 | |
| }, | |
| { | |
| "epoch": 0.24535121261327328, | |
| "grad_norm": 0.005582223180681467, | |
| "learning_rate": 0.00019721217458487024, | |
| "loss": 0.0001, | |
| "step": 1171 | |
| }, | |
| { | |
| "epoch": 0.2455607354250694, | |
| "grad_norm": 0.11760203540325165, | |
| "learning_rate": 0.0001972069905130691, | |
| "loss": 0.0187, | |
| "step": 1172 | |
| }, | |
| { | |
| "epoch": 0.24577025823686555, | |
| "grad_norm": 0.0623784065246582, | |
| "learning_rate": 0.00019720180169401457, | |
| "loss": 0.0026, | |
| "step": 1173 | |
| }, | |
| { | |
| "epoch": 0.24597978104866167, | |
| "grad_norm": 0.06554267555475235, | |
| "learning_rate": 0.00019719660812796006, | |
| "loss": 0.0008, | |
| "step": 1174 | |
| }, | |
| { | |
| "epoch": 0.24618930386045781, | |
| "grad_norm": 0.15499131381511688, | |
| "learning_rate": 0.00019719140981515923, | |
| "loss": 0.0155, | |
| "step": 1175 | |
| }, | |
| { | |
| "epoch": 0.24639882667225393, | |
| "grad_norm": 0.36670204997062683, | |
| "learning_rate": 0.00019718620675586592, | |
| "loss": 0.0826, | |
| "step": 1176 | |
| }, | |
| { | |
| "epoch": 0.24660834948405008, | |
| "grad_norm": 0.09148335456848145, | |
| "learning_rate": 0.00019718099895033427, | |
| "loss": 0.0008, | |
| "step": 1177 | |
| }, | |
| { | |
| "epoch": 0.2468178722958462, | |
| "grad_norm": 0.0192439965903759, | |
| "learning_rate": 0.00019717578639881858, | |
| "loss": 0.0003, | |
| "step": 1178 | |
| }, | |
| { | |
| "epoch": 0.24702739510764235, | |
| "grad_norm": 0.17157042026519775, | |
| "learning_rate": 0.0001971705691015734, | |
| "loss": 0.0329, | |
| "step": 1179 | |
| }, | |
| { | |
| "epoch": 0.24723691791943847, | |
| "grad_norm": 0.26223111152648926, | |
| "learning_rate": 0.00019716534705885354, | |
| "loss": 0.0499, | |
| "step": 1180 | |
| }, | |
| { | |
| "epoch": 0.24744644073123462, | |
| "grad_norm": 0.07771110534667969, | |
| "learning_rate": 0.00019716012027091404, | |
| "loss": 0.001, | |
| "step": 1181 | |
| }, | |
| { | |
| "epoch": 0.24765596354303074, | |
| "grad_norm": 0.16626375913619995, | |
| "learning_rate": 0.00019715488873801014, | |
| "loss": 0.0301, | |
| "step": 1182 | |
| }, | |
| { | |
| "epoch": 0.24786548635482689, | |
| "grad_norm": 0.3291771113872528, | |
| "learning_rate": 0.00019714965246039735, | |
| "loss": 0.0383, | |
| "step": 1183 | |
| }, | |
| { | |
| "epoch": 0.248075009166623, | |
| "grad_norm": 0.1012611836194992, | |
| "learning_rate": 0.00019714441143833138, | |
| "loss": 0.003, | |
| "step": 1184 | |
| }, | |
| { | |
| "epoch": 0.24828453197841915, | |
| "grad_norm": 0.03600292280316353, | |
| "learning_rate": 0.00019713916567206817, | |
| "loss": 0.0003, | |
| "step": 1185 | |
| }, | |
| { | |
| "epoch": 0.24849405479021527, | |
| "grad_norm": 0.14185172319412231, | |
| "learning_rate": 0.00019713391516186393, | |
| "loss": 0.0117, | |
| "step": 1186 | |
| }, | |
| { | |
| "epoch": 0.24870357760201142, | |
| "grad_norm": 0.17416037619113922, | |
| "learning_rate": 0.00019712865990797505, | |
| "loss": 0.028, | |
| "step": 1187 | |
| }, | |
| { | |
| "epoch": 0.24891310041380754, | |
| "grad_norm": 0.2895718216896057, | |
| "learning_rate": 0.00019712339991065817, | |
| "loss": 0.0307, | |
| "step": 1188 | |
| }, | |
| { | |
| "epoch": 0.2491226232256037, | |
| "grad_norm": 0.09385382384061813, | |
| "learning_rate": 0.00019711813517017026, | |
| "loss": 0.0074, | |
| "step": 1189 | |
| }, | |
| { | |
| "epoch": 0.2493321460373998, | |
| "grad_norm": 0.1465684324502945, | |
| "learning_rate": 0.00019711286568676833, | |
| "loss": 0.0107, | |
| "step": 1190 | |
| }, | |
| { | |
| "epoch": 0.24954166884919596, | |
| "grad_norm": 0.019048716872930527, | |
| "learning_rate": 0.00019710759146070972, | |
| "loss": 0.0005, | |
| "step": 1191 | |
| }, | |
| { | |
| "epoch": 0.24975119166099208, | |
| "grad_norm": 0.10628386586904526, | |
| "learning_rate": 0.00019710231249225207, | |
| "loss": 0.0018, | |
| "step": 1192 | |
| }, | |
| { | |
| "epoch": 0.24996071447278823, | |
| "grad_norm": 0.0259134192019701, | |
| "learning_rate": 0.0001970970287816532, | |
| "loss": 0.0095, | |
| "step": 1193 | |
| }, | |
| { | |
| "epoch": 0.2501702372845844, | |
| "grad_norm": 0.07972554117441177, | |
| "learning_rate": 0.00019709174032917103, | |
| "loss": 0.0011, | |
| "step": 1194 | |
| }, | |
| { | |
| "epoch": 0.25037976009638047, | |
| "grad_norm": 0.006588938180357218, | |
| "learning_rate": 0.00019708644713506396, | |
| "loss": 0.0001, | |
| "step": 1195 | |
| }, | |
| { | |
| "epoch": 0.2505892829081766, | |
| "grad_norm": 0.2775128483772278, | |
| "learning_rate": 0.00019708114919959045, | |
| "loss": 0.0128, | |
| "step": 1196 | |
| }, | |
| { | |
| "epoch": 0.25079880571997276, | |
| "grad_norm": 0.004361490719020367, | |
| "learning_rate": 0.0001970758465230092, | |
| "loss": 0.0001, | |
| "step": 1197 | |
| }, | |
| { | |
| "epoch": 0.2510083285317689, | |
| "grad_norm": 0.11160224676132202, | |
| "learning_rate": 0.00019707053910557917, | |
| "loss": 0.0017, | |
| "step": 1198 | |
| }, | |
| { | |
| "epoch": 0.25121785134356506, | |
| "grad_norm": 0.013135232962667942, | |
| "learning_rate": 0.0001970652269475596, | |
| "loss": 0.0001, | |
| "step": 1199 | |
| }, | |
| { | |
| "epoch": 0.25142737415536115, | |
| "grad_norm": 0.2182655930519104, | |
| "learning_rate": 0.00019705991004920993, | |
| "loss": 0.0159, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 0.25142737415536115, | |
| "eval_loss": 0.01089566946029663, | |
| "eval_runtime": 89.1143, | |
| "eval_samples_per_second": 8.618, | |
| "eval_steps_per_second": 4.309, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 0.2516368969671573, | |
| "grad_norm": 0.24273119866847992, | |
| "learning_rate": 0.00019705458841078974, | |
| "loss": 0.0178, | |
| "step": 1201 | |
| }, | |
| { | |
| "epoch": 0.25184641977895345, | |
| "grad_norm": 0.036558933556079865, | |
| "learning_rate": 0.00019704926203255898, | |
| "loss": 0.0029, | |
| "step": 1202 | |
| }, | |
| { | |
| "epoch": 0.2520559425907496, | |
| "grad_norm": 0.005220042075961828, | |
| "learning_rate": 0.0001970439309147778, | |
| "loss": 0.0001, | |
| "step": 1203 | |
| }, | |
| { | |
| "epoch": 0.2522654654025457, | |
| "grad_norm": 0.1721489429473877, | |
| "learning_rate": 0.00019703859505770644, | |
| "loss": 0.0113, | |
| "step": 1204 | |
| }, | |
| { | |
| "epoch": 0.25247498821434183, | |
| "grad_norm": 0.18657046556472778, | |
| "learning_rate": 0.00019703325446160564, | |
| "loss": 0.0133, | |
| "step": 1205 | |
| }, | |
| { | |
| "epoch": 0.252684511026138, | |
| "grad_norm": 0.15162359178066254, | |
| "learning_rate": 0.0001970279091267361, | |
| "loss": 0.0045, | |
| "step": 1206 | |
| }, | |
| { | |
| "epoch": 0.25289403383793413, | |
| "grad_norm": 0.16691045463085175, | |
| "learning_rate": 0.0001970225590533589, | |
| "loss": 0.0052, | |
| "step": 1207 | |
| }, | |
| { | |
| "epoch": 0.2531035566497302, | |
| "grad_norm": 0.17631007730960846, | |
| "learning_rate": 0.0001970172042417353, | |
| "loss": 0.0079, | |
| "step": 1208 | |
| }, | |
| { | |
| "epoch": 0.25331307946152637, | |
| "grad_norm": 0.23643368482589722, | |
| "learning_rate": 0.00019701184469212685, | |
| "loss": 0.0239, | |
| "step": 1209 | |
| }, | |
| { | |
| "epoch": 0.2535226022733225, | |
| "grad_norm": 0.18658863008022308, | |
| "learning_rate": 0.00019700648040479527, | |
| "loss": 0.0333, | |
| "step": 1210 | |
| }, | |
| { | |
| "epoch": 0.25373212508511866, | |
| "grad_norm": 0.17524613440036774, | |
| "learning_rate": 0.00019700111138000256, | |
| "loss": 0.0039, | |
| "step": 1211 | |
| }, | |
| { | |
| "epoch": 0.25394164789691476, | |
| "grad_norm": 0.0618131160736084, | |
| "learning_rate": 0.00019699573761801085, | |
| "loss": 0.009, | |
| "step": 1212 | |
| }, | |
| { | |
| "epoch": 0.2541511707087109, | |
| "grad_norm": 0.3288923501968384, | |
| "learning_rate": 0.00019699035911908267, | |
| "loss": 0.0353, | |
| "step": 1213 | |
| }, | |
| { | |
| "epoch": 0.25436069352050705, | |
| "grad_norm": 0.1573517769575119, | |
| "learning_rate": 0.00019698497588348067, | |
| "loss": 0.013, | |
| "step": 1214 | |
| }, | |
| { | |
| "epoch": 0.2545702163323032, | |
| "grad_norm": 0.1708369106054306, | |
| "learning_rate": 0.00019697958791146768, | |
| "loss": 0.0132, | |
| "step": 1215 | |
| }, | |
| { | |
| "epoch": 0.2547797391440993, | |
| "grad_norm": 0.25349169969558716, | |
| "learning_rate": 0.00019697419520330688, | |
| "loss": 0.0068, | |
| "step": 1216 | |
| }, | |
| { | |
| "epoch": 0.25498926195589544, | |
| "grad_norm": 0.12924553453922272, | |
| "learning_rate": 0.00019696879775926162, | |
| "loss": 0.0084, | |
| "step": 1217 | |
| }, | |
| { | |
| "epoch": 0.2551987847676916, | |
| "grad_norm": 0.12420932948589325, | |
| "learning_rate": 0.00019696339557959548, | |
| "loss": 0.001, | |
| "step": 1218 | |
| }, | |
| { | |
| "epoch": 0.25540830757948774, | |
| "grad_norm": 0.05618319287896156, | |
| "learning_rate": 0.00019695798866457235, | |
| "loss": 0.0004, | |
| "step": 1219 | |
| }, | |
| { | |
| "epoch": 0.25561783039128383, | |
| "grad_norm": 0.06126785650849342, | |
| "learning_rate": 0.0001969525770144562, | |
| "loss": 0.001, | |
| "step": 1220 | |
| }, | |
| { | |
| "epoch": 0.25582735320308, | |
| "grad_norm": 0.10019136220216751, | |
| "learning_rate": 0.00019694716062951137, | |
| "loss": 0.0021, | |
| "step": 1221 | |
| }, | |
| { | |
| "epoch": 0.2560368760148761, | |
| "grad_norm": 0.021487459540367126, | |
| "learning_rate": 0.00019694173951000234, | |
| "loss": 0.0002, | |
| "step": 1222 | |
| }, | |
| { | |
| "epoch": 0.2562463988266723, | |
| "grad_norm": 0.13679708540439606, | |
| "learning_rate": 0.00019693631365619389, | |
| "loss": 0.0114, | |
| "step": 1223 | |
| }, | |
| { | |
| "epoch": 0.25645592163846836, | |
| "grad_norm": 0.001410324708558619, | |
| "learning_rate": 0.000196930883068351, | |
| "loss": 0.0, | |
| "step": 1224 | |
| }, | |
| { | |
| "epoch": 0.2566654444502645, | |
| "grad_norm": 0.0035328457597643137, | |
| "learning_rate": 0.00019692544774673886, | |
| "loss": 0.0001, | |
| "step": 1225 | |
| }, | |
| { | |
| "epoch": 0.25687496726206066, | |
| "grad_norm": 0.3505251705646515, | |
| "learning_rate": 0.00019692000769162292, | |
| "loss": 0.0147, | |
| "step": 1226 | |
| }, | |
| { | |
| "epoch": 0.2570844900738568, | |
| "grad_norm": 0.14239129424095154, | |
| "learning_rate": 0.00019691456290326883, | |
| "loss": 0.0117, | |
| "step": 1227 | |
| }, | |
| { | |
| "epoch": 0.2572940128856529, | |
| "grad_norm": 0.30475863814353943, | |
| "learning_rate": 0.00019690911338194256, | |
| "loss": 0.0572, | |
| "step": 1228 | |
| }, | |
| { | |
| "epoch": 0.25750353569744905, | |
| "grad_norm": 0.1941041797399521, | |
| "learning_rate": 0.0001969036591279102, | |
| "loss": 0.0134, | |
| "step": 1229 | |
| }, | |
| { | |
| "epoch": 0.2577130585092452, | |
| "grad_norm": 0.019271748140454292, | |
| "learning_rate": 0.00019689820014143813, | |
| "loss": 0.0001, | |
| "step": 1230 | |
| }, | |
| { | |
| "epoch": 0.25792258132104134, | |
| "grad_norm": 0.11813981086015701, | |
| "learning_rate": 0.00019689273642279292, | |
| "loss": 0.0023, | |
| "step": 1231 | |
| }, | |
| { | |
| "epoch": 0.25813210413283744, | |
| "grad_norm": 0.057555362582206726, | |
| "learning_rate": 0.00019688726797224143, | |
| "loss": 0.0008, | |
| "step": 1232 | |
| }, | |
| { | |
| "epoch": 0.2583416269446336, | |
| "grad_norm": 0.24133259057998657, | |
| "learning_rate": 0.00019688179479005068, | |
| "loss": 0.0049, | |
| "step": 1233 | |
| }, | |
| { | |
| "epoch": 0.25855114975642973, | |
| "grad_norm": 0.24271616339683533, | |
| "learning_rate": 0.00019687631687648804, | |
| "loss": 0.0231, | |
| "step": 1234 | |
| }, | |
| { | |
| "epoch": 0.2587606725682259, | |
| "grad_norm": 0.15305756032466888, | |
| "learning_rate": 0.00019687083423182094, | |
| "loss": 0.0102, | |
| "step": 1235 | |
| }, | |
| { | |
| "epoch": 0.258970195380022, | |
| "grad_norm": 0.04598066210746765, | |
| "learning_rate": 0.00019686534685631722, | |
| "loss": 0.0007, | |
| "step": 1236 | |
| }, | |
| { | |
| "epoch": 0.2591797181918181, | |
| "grad_norm": 0.015225352719426155, | |
| "learning_rate": 0.0001968598547502448, | |
| "loss": 0.0002, | |
| "step": 1237 | |
| }, | |
| { | |
| "epoch": 0.25938924100361427, | |
| "grad_norm": 0.18596412241458893, | |
| "learning_rate": 0.0001968543579138719, | |
| "loss": 0.0282, | |
| "step": 1238 | |
| }, | |
| { | |
| "epoch": 0.2595987638154104, | |
| "grad_norm": 0.004785776603966951, | |
| "learning_rate": 0.000196848856347467, | |
| "loss": 0.0001, | |
| "step": 1239 | |
| }, | |
| { | |
| "epoch": 0.25980828662720656, | |
| "grad_norm": 0.1279231756925583, | |
| "learning_rate": 0.00019684335005129878, | |
| "loss": 0.0023, | |
| "step": 1240 | |
| }, | |
| { | |
| "epoch": 0.26001780943900266, | |
| "grad_norm": 0.2739182114601135, | |
| "learning_rate": 0.00019683783902563608, | |
| "loss": 0.0029, | |
| "step": 1241 | |
| }, | |
| { | |
| "epoch": 0.2602273322507988, | |
| "grad_norm": 0.15039706230163574, | |
| "learning_rate": 0.00019683232327074812, | |
| "loss": 0.0053, | |
| "step": 1242 | |
| }, | |
| { | |
| "epoch": 0.26043685506259495, | |
| "grad_norm": 0.0031035866122692823, | |
| "learning_rate": 0.00019682680278690424, | |
| "loss": 0.0, | |
| "step": 1243 | |
| }, | |
| { | |
| "epoch": 0.2606463778743911, | |
| "grad_norm": 0.11631850898265839, | |
| "learning_rate": 0.00019682127757437404, | |
| "loss": 0.0024, | |
| "step": 1244 | |
| }, | |
| { | |
| "epoch": 0.2608559006861872, | |
| "grad_norm": 0.005499638617038727, | |
| "learning_rate": 0.00019681574763342737, | |
| "loss": 0.0001, | |
| "step": 1245 | |
| }, | |
| { | |
| "epoch": 0.26106542349798334, | |
| "grad_norm": 0.24378150701522827, | |
| "learning_rate": 0.00019681021296433425, | |
| "loss": 0.0046, | |
| "step": 1246 | |
| }, | |
| { | |
| "epoch": 0.2612749463097795, | |
| "grad_norm": 0.22416795790195465, | |
| "learning_rate": 0.00019680467356736502, | |
| "loss": 0.0242, | |
| "step": 1247 | |
| }, | |
| { | |
| "epoch": 0.26148446912157564, | |
| "grad_norm": 0.31286659836769104, | |
| "learning_rate": 0.00019679912944279014, | |
| "loss": 0.0414, | |
| "step": 1248 | |
| }, | |
| { | |
| "epoch": 0.26169399193337173, | |
| "grad_norm": 0.22582346200942993, | |
| "learning_rate": 0.00019679358059088045, | |
| "loss": 0.013, | |
| "step": 1249 | |
| }, | |
| { | |
| "epoch": 0.2619035147451679, | |
| "grad_norm": 0.10074607282876968, | |
| "learning_rate": 0.0001967880270119069, | |
| "loss": 0.0037, | |
| "step": 1250 | |
| }, | |
| { | |
| "epoch": 0.262113037556964, | |
| "grad_norm": 0.20810967683792114, | |
| "learning_rate": 0.00019678246870614069, | |
| "loss": 0.004, | |
| "step": 1251 | |
| }, | |
| { | |
| "epoch": 0.26232256036876017, | |
| "grad_norm": 0.18476144969463348, | |
| "learning_rate": 0.00019677690567385328, | |
| "loss": 0.0212, | |
| "step": 1252 | |
| }, | |
| { | |
| "epoch": 0.26253208318055626, | |
| "grad_norm": 0.3872232735157013, | |
| "learning_rate": 0.00019677133791531638, | |
| "loss": 0.067, | |
| "step": 1253 | |
| }, | |
| { | |
| "epoch": 0.2627416059923524, | |
| "grad_norm": 0.28218770027160645, | |
| "learning_rate": 0.00019676576543080186, | |
| "loss": 0.0365, | |
| "step": 1254 | |
| }, | |
| { | |
| "epoch": 0.26295112880414856, | |
| "grad_norm": 0.2109004259109497, | |
| "learning_rate": 0.0001967601882205819, | |
| "loss": 0.0353, | |
| "step": 1255 | |
| }, | |
| { | |
| "epoch": 0.2631606516159447, | |
| "grad_norm": 0.11097536981105804, | |
| "learning_rate": 0.00019675460628492878, | |
| "loss": 0.0016, | |
| "step": 1256 | |
| }, | |
| { | |
| "epoch": 0.2633701744277408, | |
| "grad_norm": 0.2835911810398102, | |
| "learning_rate": 0.0001967490196241152, | |
| "loss": 0.0228, | |
| "step": 1257 | |
| }, | |
| { | |
| "epoch": 0.26357969723953695, | |
| "grad_norm": 0.03125814348459244, | |
| "learning_rate": 0.00019674342823841398, | |
| "loss": 0.0005, | |
| "step": 1258 | |
| }, | |
| { | |
| "epoch": 0.2637892200513331, | |
| "grad_norm": 0.2683068811893463, | |
| "learning_rate": 0.00019673783212809814, | |
| "loss": 0.0115, | |
| "step": 1259 | |
| }, | |
| { | |
| "epoch": 0.26399874286312924, | |
| "grad_norm": 0.06683268398046494, | |
| "learning_rate": 0.00019673223129344102, | |
| "loss": 0.0011, | |
| "step": 1260 | |
| }, | |
| { | |
| "epoch": 0.26420826567492534, | |
| "grad_norm": 0.15417706966400146, | |
| "learning_rate": 0.00019672662573471614, | |
| "loss": 0.0055, | |
| "step": 1261 | |
| }, | |
| { | |
| "epoch": 0.2644177884867215, | |
| "grad_norm": 0.22664068639278412, | |
| "learning_rate": 0.0001967210154521972, | |
| "loss": 0.0324, | |
| "step": 1262 | |
| }, | |
| { | |
| "epoch": 0.26462731129851763, | |
| "grad_norm": 0.15802893042564392, | |
| "learning_rate": 0.00019671540044615825, | |
| "loss": 0.0013, | |
| "step": 1263 | |
| }, | |
| { | |
| "epoch": 0.2648368341103138, | |
| "grad_norm": 0.20269808173179626, | |
| "learning_rate": 0.0001967097807168735, | |
| "loss": 0.0179, | |
| "step": 1264 | |
| }, | |
| { | |
| "epoch": 0.26504635692210987, | |
| "grad_norm": 0.20458929240703583, | |
| "learning_rate": 0.00019670415626461737, | |
| "loss": 0.0248, | |
| "step": 1265 | |
| }, | |
| { | |
| "epoch": 0.265255879733906, | |
| "grad_norm": 0.05246388539671898, | |
| "learning_rate": 0.00019669852708966454, | |
| "loss": 0.0006, | |
| "step": 1266 | |
| }, | |
| { | |
| "epoch": 0.26546540254570217, | |
| "grad_norm": 0.02725144289433956, | |
| "learning_rate": 0.00019669289319228995, | |
| "loss": 0.0004, | |
| "step": 1267 | |
| }, | |
| { | |
| "epoch": 0.2656749253574983, | |
| "grad_norm": 0.07908505201339722, | |
| "learning_rate": 0.0001966872545727687, | |
| "loss": 0.001, | |
| "step": 1268 | |
| }, | |
| { | |
| "epoch": 0.2658844481692944, | |
| "grad_norm": 0.26351892948150635, | |
| "learning_rate": 0.0001966816112313762, | |
| "loss": 0.0317, | |
| "step": 1269 | |
| }, | |
| { | |
| "epoch": 0.26609397098109056, | |
| "grad_norm": 0.09313903748989105, | |
| "learning_rate": 0.00019667596316838803, | |
| "loss": 0.0014, | |
| "step": 1270 | |
| }, | |
| { | |
| "epoch": 0.2663034937928867, | |
| "grad_norm": 0.1861148625612259, | |
| "learning_rate": 0.00019667031038408004, | |
| "loss": 0.0376, | |
| "step": 1271 | |
| }, | |
| { | |
| "epoch": 0.26651301660468285, | |
| "grad_norm": 0.12870298326015472, | |
| "learning_rate": 0.00019666465287872825, | |
| "loss": 0.0155, | |
| "step": 1272 | |
| }, | |
| { | |
| "epoch": 0.26672253941647894, | |
| "grad_norm": 0.3237362205982208, | |
| "learning_rate": 0.00019665899065260902, | |
| "loss": 0.0644, | |
| "step": 1273 | |
| }, | |
| { | |
| "epoch": 0.2669320622282751, | |
| "grad_norm": 0.19791316986083984, | |
| "learning_rate": 0.0001966533237059988, | |
| "loss": 0.0144, | |
| "step": 1274 | |
| }, | |
| { | |
| "epoch": 0.26714158504007124, | |
| "grad_norm": 0.08102938532829285, | |
| "learning_rate": 0.0001966476520391744, | |
| "loss": 0.0004, | |
| "step": 1275 | |
| }, | |
| { | |
| "epoch": 0.2673511078518674, | |
| "grad_norm": 0.2837512493133545, | |
| "learning_rate": 0.00019664197565241279, | |
| "loss": 0.0317, | |
| "step": 1276 | |
| }, | |
| { | |
| "epoch": 0.2675606306636635, | |
| "grad_norm": 0.09621527045965195, | |
| "learning_rate": 0.00019663629454599115, | |
| "loss": 0.0019, | |
| "step": 1277 | |
| }, | |
| { | |
| "epoch": 0.2677701534754596, | |
| "grad_norm": 0.2916226387023926, | |
| "learning_rate": 0.00019663060872018696, | |
| "loss": 0.0294, | |
| "step": 1278 | |
| }, | |
| { | |
| "epoch": 0.2679796762872558, | |
| "grad_norm": 0.07113649696111679, | |
| "learning_rate": 0.0001966249181752779, | |
| "loss": 0.0049, | |
| "step": 1279 | |
| }, | |
| { | |
| "epoch": 0.2681891990990519, | |
| "grad_norm": 0.027167638763785362, | |
| "learning_rate": 0.00019661922291154188, | |
| "loss": 0.0005, | |
| "step": 1280 | |
| }, | |
| { | |
| "epoch": 0.26839872191084807, | |
| "grad_norm": 0.033556949347257614, | |
| "learning_rate": 0.00019661352292925702, | |
| "loss": 0.0002, | |
| "step": 1281 | |
| }, | |
| { | |
| "epoch": 0.26860824472264416, | |
| "grad_norm": 0.15087144076824188, | |
| "learning_rate": 0.00019660781822870165, | |
| "loss": 0.0019, | |
| "step": 1282 | |
| }, | |
| { | |
| "epoch": 0.2688177675344403, | |
| "grad_norm": 0.1311134546995163, | |
| "learning_rate": 0.00019660210881015448, | |
| "loss": 0.003, | |
| "step": 1283 | |
| }, | |
| { | |
| "epoch": 0.26902729034623646, | |
| "grad_norm": 0.10054054856300354, | |
| "learning_rate": 0.00019659639467389423, | |
| "loss": 0.0084, | |
| "step": 1284 | |
| }, | |
| { | |
| "epoch": 0.2692368131580326, | |
| "grad_norm": 0.11179205030202866, | |
| "learning_rate": 0.0001965906758202, | |
| "loss": 0.0014, | |
| "step": 1285 | |
| }, | |
| { | |
| "epoch": 0.2694463359698287, | |
| "grad_norm": 0.11406797170639038, | |
| "learning_rate": 0.00019658495224935107, | |
| "loss": 0.0036, | |
| "step": 1286 | |
| }, | |
| { | |
| "epoch": 0.26965585878162485, | |
| "grad_norm": 0.16709235310554504, | |
| "learning_rate": 0.00019657922396162697, | |
| "loss": 0.0183, | |
| "step": 1287 | |
| }, | |
| { | |
| "epoch": 0.269865381593421, | |
| "grad_norm": 0.02597794309258461, | |
| "learning_rate": 0.00019657349095730743, | |
| "loss": 0.0002, | |
| "step": 1288 | |
| }, | |
| { | |
| "epoch": 0.27007490440521714, | |
| "grad_norm": 0.10171519219875336, | |
| "learning_rate": 0.00019656775323667247, | |
| "loss": 0.0044, | |
| "step": 1289 | |
| }, | |
| { | |
| "epoch": 0.27028442721701323, | |
| "grad_norm": 0.293571799993515, | |
| "learning_rate": 0.00019656201080000228, | |
| "loss": 0.0385, | |
| "step": 1290 | |
| }, | |
| { | |
| "epoch": 0.2704939500288094, | |
| "grad_norm": 0.005718114785850048, | |
| "learning_rate": 0.00019655626364757726, | |
| "loss": 0.0001, | |
| "step": 1291 | |
| }, | |
| { | |
| "epoch": 0.27070347284060553, | |
| "grad_norm": 0.03530212864279747, | |
| "learning_rate": 0.00019655051177967813, | |
| "loss": 0.0005, | |
| "step": 1292 | |
| }, | |
| { | |
| "epoch": 0.2709129956524017, | |
| "grad_norm": 0.31564685702323914, | |
| "learning_rate": 0.0001965447551965858, | |
| "loss": 0.0443, | |
| "step": 1293 | |
| }, | |
| { | |
| "epoch": 0.27112251846419777, | |
| "grad_norm": 0.05824049189686775, | |
| "learning_rate": 0.00019653899389858136, | |
| "loss": 0.0004, | |
| "step": 1294 | |
| }, | |
| { | |
| "epoch": 0.2713320412759939, | |
| "grad_norm": 0.06219063326716423, | |
| "learning_rate": 0.00019653322788594618, | |
| "loss": 0.0005, | |
| "step": 1295 | |
| }, | |
| { | |
| "epoch": 0.27154156408779007, | |
| "grad_norm": 0.0012616126332432032, | |
| "learning_rate": 0.0001965274571589619, | |
| "loss": 0.0, | |
| "step": 1296 | |
| }, | |
| { | |
| "epoch": 0.2717510868995862, | |
| "grad_norm": 0.10456488281488419, | |
| "learning_rate": 0.00019652168171791027, | |
| "loss": 0.0123, | |
| "step": 1297 | |
| }, | |
| { | |
| "epoch": 0.2719606097113823, | |
| "grad_norm": 0.027907853946089745, | |
| "learning_rate": 0.0001965159015630734, | |
| "loss": 0.0004, | |
| "step": 1298 | |
| }, | |
| { | |
| "epoch": 0.27217013252317845, | |
| "grad_norm": 0.1813032478094101, | |
| "learning_rate": 0.00019651011669473355, | |
| "loss": 0.0189, | |
| "step": 1299 | |
| }, | |
| { | |
| "epoch": 0.2723796553349746, | |
| "grad_norm": 0.1199437752366066, | |
| "learning_rate": 0.00019650432711317323, | |
| "loss": 0.002, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 0.27258917814677075, | |
| "grad_norm": 0.009131750091910362, | |
| "learning_rate": 0.0001964985328186752, | |
| "loss": 0.0002, | |
| "step": 1301 | |
| }, | |
| { | |
| "epoch": 0.27279870095856684, | |
| "grad_norm": 0.13628257811069489, | |
| "learning_rate": 0.0001964927338115224, | |
| "loss": 0.0211, | |
| "step": 1302 | |
| }, | |
| { | |
| "epoch": 0.273008223770363, | |
| "grad_norm": 0.16198435425758362, | |
| "learning_rate": 0.00019648693009199808, | |
| "loss": 0.0293, | |
| "step": 1303 | |
| }, | |
| { | |
| "epoch": 0.27321774658215914, | |
| "grad_norm": 0.09153685718774796, | |
| "learning_rate": 0.0001964811216603856, | |
| "loss": 0.0123, | |
| "step": 1304 | |
| }, | |
| { | |
| "epoch": 0.2734272693939553, | |
| "grad_norm": 0.13093078136444092, | |
| "learning_rate": 0.00019647530851696875, | |
| "loss": 0.0074, | |
| "step": 1305 | |
| }, | |
| { | |
| "epoch": 0.2736367922057514, | |
| "grad_norm": 0.02477131597697735, | |
| "learning_rate": 0.00019646949066203127, | |
| "loss": 0.0004, | |
| "step": 1306 | |
| }, | |
| { | |
| "epoch": 0.2738463150175475, | |
| "grad_norm": 0.17570193111896515, | |
| "learning_rate": 0.00019646366809585738, | |
| "loss": 0.0128, | |
| "step": 1307 | |
| }, | |
| { | |
| "epoch": 0.2740558378293437, | |
| "grad_norm": 0.03512417525053024, | |
| "learning_rate": 0.00019645784081873143, | |
| "loss": 0.0017, | |
| "step": 1308 | |
| }, | |
| { | |
| "epoch": 0.2742653606411398, | |
| "grad_norm": 0.03261154517531395, | |
| "learning_rate": 0.00019645200883093797, | |
| "loss": 0.0004, | |
| "step": 1309 | |
| }, | |
| { | |
| "epoch": 0.2744748834529359, | |
| "grad_norm": 0.200796976685524, | |
| "learning_rate": 0.00019644617213276187, | |
| "loss": 0.0433, | |
| "step": 1310 | |
| }, | |
| { | |
| "epoch": 0.27468440626473206, | |
| "grad_norm": 0.18961785733699799, | |
| "learning_rate": 0.00019644033072448812, | |
| "loss": 0.0051, | |
| "step": 1311 | |
| }, | |
| { | |
| "epoch": 0.2748939290765282, | |
| "grad_norm": 0.0028431613463908434, | |
| "learning_rate": 0.000196434484606402, | |
| "loss": 0.0001, | |
| "step": 1312 | |
| }, | |
| { | |
| "epoch": 0.27510345188832436, | |
| "grad_norm": 0.0011763208312913775, | |
| "learning_rate": 0.000196428633778789, | |
| "loss": 0.0, | |
| "step": 1313 | |
| }, | |
| { | |
| "epoch": 0.27531297470012045, | |
| "grad_norm": 0.28432533144950867, | |
| "learning_rate": 0.00019642277824193492, | |
| "loss": 0.0259, | |
| "step": 1314 | |
| }, | |
| { | |
| "epoch": 0.2755224975119166, | |
| "grad_norm": 0.09515893459320068, | |
| "learning_rate": 0.00019641691799612566, | |
| "loss": 0.0082, | |
| "step": 1315 | |
| }, | |
| { | |
| "epoch": 0.27573202032371275, | |
| "grad_norm": 0.16080771386623383, | |
| "learning_rate": 0.00019641105304164742, | |
| "loss": 0.0087, | |
| "step": 1316 | |
| }, | |
| { | |
| "epoch": 0.2759415431355089, | |
| "grad_norm": 0.14703740179538727, | |
| "learning_rate": 0.00019640518337878668, | |
| "loss": 0.0037, | |
| "step": 1317 | |
| }, | |
| { | |
| "epoch": 0.276151065947305, | |
| "grad_norm": 0.21766169369220734, | |
| "learning_rate": 0.00019639930900783003, | |
| "loss": 0.0155, | |
| "step": 1318 | |
| }, | |
| { | |
| "epoch": 0.27636058875910113, | |
| "grad_norm": 0.12979577481746674, | |
| "learning_rate": 0.0001963934299290644, | |
| "loss": 0.0168, | |
| "step": 1319 | |
| }, | |
| { | |
| "epoch": 0.2765701115708973, | |
| "grad_norm": 0.20718175172805786, | |
| "learning_rate": 0.00019638754614277685, | |
| "loss": 0.0152, | |
| "step": 1320 | |
| }, | |
| { | |
| "epoch": 0.27677963438269343, | |
| "grad_norm": 0.19059571623802185, | |
| "learning_rate": 0.00019638165764925477, | |
| "loss": 0.0206, | |
| "step": 1321 | |
| }, | |
| { | |
| "epoch": 0.2769891571944896, | |
| "grad_norm": 0.07117602229118347, | |
| "learning_rate": 0.00019637576444878573, | |
| "loss": 0.0007, | |
| "step": 1322 | |
| }, | |
| { | |
| "epoch": 0.27719868000628567, | |
| "grad_norm": 0.014720194973051548, | |
| "learning_rate": 0.00019636986654165752, | |
| "loss": 0.0002, | |
| "step": 1323 | |
| }, | |
| { | |
| "epoch": 0.2774082028180818, | |
| "grad_norm": 0.08522726595401764, | |
| "learning_rate": 0.0001963639639281582, | |
| "loss": 0.0023, | |
| "step": 1324 | |
| }, | |
| { | |
| "epoch": 0.27761772562987796, | |
| "grad_norm": 0.24886921048164368, | |
| "learning_rate": 0.00019635805660857595, | |
| "loss": 0.0334, | |
| "step": 1325 | |
| }, | |
| { | |
| "epoch": 0.2778272484416741, | |
| "grad_norm": 0.10195689648389816, | |
| "learning_rate": 0.00019635214458319937, | |
| "loss": 0.0209, | |
| "step": 1326 | |
| }, | |
| { | |
| "epoch": 0.2780367712534702, | |
| "grad_norm": 0.13332587480545044, | |
| "learning_rate": 0.00019634622785231717, | |
| "loss": 0.0012, | |
| "step": 1327 | |
| }, | |
| { | |
| "epoch": 0.27824629406526635, | |
| "grad_norm": 0.19609646499156952, | |
| "learning_rate": 0.0001963403064162182, | |
| "loss": 0.0038, | |
| "step": 1328 | |
| }, | |
| { | |
| "epoch": 0.2784558168770625, | |
| "grad_norm": 0.23733653128147125, | |
| "learning_rate": 0.00019633438027519176, | |
| "loss": 0.007, | |
| "step": 1329 | |
| }, | |
| { | |
| "epoch": 0.27866533968885865, | |
| "grad_norm": 0.10206770151853561, | |
| "learning_rate": 0.00019632844942952719, | |
| "loss": 0.0131, | |
| "step": 1330 | |
| }, | |
| { | |
| "epoch": 0.27887486250065474, | |
| "grad_norm": 0.080831378698349, | |
| "learning_rate": 0.00019632251387951413, | |
| "loss": 0.0032, | |
| "step": 1331 | |
| }, | |
| { | |
| "epoch": 0.2790843853124509, | |
| "grad_norm": 0.14923220872879028, | |
| "learning_rate": 0.0001963165736254425, | |
| "loss": 0.0066, | |
| "step": 1332 | |
| }, | |
| { | |
| "epoch": 0.27929390812424704, | |
| "grad_norm": 0.12396574765443802, | |
| "learning_rate": 0.0001963106286676024, | |
| "loss": 0.0093, | |
| "step": 1333 | |
| }, | |
| { | |
| "epoch": 0.2795034309360432, | |
| "grad_norm": 0.19563056528568268, | |
| "learning_rate": 0.00019630467900628412, | |
| "loss": 0.0277, | |
| "step": 1334 | |
| }, | |
| { | |
| "epoch": 0.2797129537478393, | |
| "grad_norm": 0.038371458649635315, | |
| "learning_rate": 0.00019629872464177825, | |
| "loss": 0.0004, | |
| "step": 1335 | |
| }, | |
| { | |
| "epoch": 0.2799224765596354, | |
| "grad_norm": 0.26363372802734375, | |
| "learning_rate": 0.00019629276557437558, | |
| "loss": 0.0464, | |
| "step": 1336 | |
| }, | |
| { | |
| "epoch": 0.2801319993714316, | |
| "grad_norm": 0.03453537076711655, | |
| "learning_rate": 0.0001962868018043671, | |
| "loss": 0.0005, | |
| "step": 1337 | |
| }, | |
| { | |
| "epoch": 0.2803415221832277, | |
| "grad_norm": 0.0300081018358469, | |
| "learning_rate": 0.0001962808333320441, | |
| "loss": 0.0004, | |
| "step": 1338 | |
| }, | |
| { | |
| "epoch": 0.2805510449950238, | |
| "grad_norm": 0.13338404893875122, | |
| "learning_rate": 0.00019627486015769802, | |
| "loss": 0.0076, | |
| "step": 1339 | |
| }, | |
| { | |
| "epoch": 0.28076056780681996, | |
| "grad_norm": 0.1329384744167328, | |
| "learning_rate": 0.0001962688822816206, | |
| "loss": 0.0009, | |
| "step": 1340 | |
| }, | |
| { | |
| "epoch": 0.2809700906186161, | |
| "grad_norm": 0.18859624862670898, | |
| "learning_rate": 0.00019626289970410378, | |
| "loss": 0.0167, | |
| "step": 1341 | |
| }, | |
| { | |
| "epoch": 0.28117961343041226, | |
| "grad_norm": 0.13575711846351624, | |
| "learning_rate": 0.00019625691242543971, | |
| "loss": 0.019, | |
| "step": 1342 | |
| }, | |
| { | |
| "epoch": 0.28138913624220835, | |
| "grad_norm": 0.010435916483402252, | |
| "learning_rate": 0.00019625092044592082, | |
| "loss": 0.0001, | |
| "step": 1343 | |
| }, | |
| { | |
| "epoch": 0.2815986590540045, | |
| "grad_norm": 0.1329658329486847, | |
| "learning_rate": 0.00019624492376583966, | |
| "loss": 0.0081, | |
| "step": 1344 | |
| }, | |
| { | |
| "epoch": 0.28180818186580064, | |
| "grad_norm": 0.09858644008636475, | |
| "learning_rate": 0.00019623892238548917, | |
| "loss": 0.0025, | |
| "step": 1345 | |
| }, | |
| { | |
| "epoch": 0.2820177046775968, | |
| "grad_norm": 0.3315856456756592, | |
| "learning_rate": 0.00019623291630516243, | |
| "loss": 0.0332, | |
| "step": 1346 | |
| }, | |
| { | |
| "epoch": 0.2822272274893929, | |
| "grad_norm": 0.11820532381534576, | |
| "learning_rate": 0.0001962269055251527, | |
| "loss": 0.0014, | |
| "step": 1347 | |
| }, | |
| { | |
| "epoch": 0.28243675030118903, | |
| "grad_norm": 0.17505581676959991, | |
| "learning_rate": 0.00019622089004575356, | |
| "loss": 0.0208, | |
| "step": 1348 | |
| }, | |
| { | |
| "epoch": 0.2826462731129852, | |
| "grad_norm": 0.0583079494535923, | |
| "learning_rate": 0.00019621486986725882, | |
| "loss": 0.0005, | |
| "step": 1349 | |
| }, | |
| { | |
| "epoch": 0.28285579592478133, | |
| "grad_norm": 0.1627739816904068, | |
| "learning_rate": 0.0001962088449899624, | |
| "loss": 0.0179, | |
| "step": 1350 | |
| }, | |
| { | |
| "epoch": 0.2830653187365774, | |
| "grad_norm": 0.22073708474636078, | |
| "learning_rate": 0.00019620281541415862, | |
| "loss": 0.0338, | |
| "step": 1351 | |
| }, | |
| { | |
| "epoch": 0.28327484154837357, | |
| "grad_norm": 0.02409421280026436, | |
| "learning_rate": 0.0001961967811401419, | |
| "loss": 0.0002, | |
| "step": 1352 | |
| }, | |
| { | |
| "epoch": 0.2834843643601697, | |
| "grad_norm": 0.09562385827302933, | |
| "learning_rate": 0.0001961907421682069, | |
| "loss": 0.0016, | |
| "step": 1353 | |
| }, | |
| { | |
| "epoch": 0.28369388717196586, | |
| "grad_norm": 0.07804533839225769, | |
| "learning_rate": 0.00019618469849864864, | |
| "loss": 0.0008, | |
| "step": 1354 | |
| }, | |
| { | |
| "epoch": 0.28390340998376196, | |
| "grad_norm": 0.23339737951755524, | |
| "learning_rate": 0.00019617865013176218, | |
| "loss": 0.0061, | |
| "step": 1355 | |
| }, | |
| { | |
| "epoch": 0.2841129327955581, | |
| "grad_norm": 0.12158526480197906, | |
| "learning_rate": 0.00019617259706784297, | |
| "loss": 0.0032, | |
| "step": 1356 | |
| }, | |
| { | |
| "epoch": 0.28432245560735425, | |
| "grad_norm": 0.056320130825042725, | |
| "learning_rate": 0.00019616653930718653, | |
| "loss": 0.0011, | |
| "step": 1357 | |
| }, | |
| { | |
| "epoch": 0.2845319784191504, | |
| "grad_norm": 0.1585444062948227, | |
| "learning_rate": 0.0001961604768500888, | |
| "loss": 0.0091, | |
| "step": 1358 | |
| }, | |
| { | |
| "epoch": 0.2847415012309465, | |
| "grad_norm": 0.11987308412790298, | |
| "learning_rate": 0.0001961544096968458, | |
| "loss": 0.0052, | |
| "step": 1359 | |
| }, | |
| { | |
| "epoch": 0.28495102404274264, | |
| "grad_norm": 0.3789823353290558, | |
| "learning_rate": 0.00019614833784775383, | |
| "loss": 0.0714, | |
| "step": 1360 | |
| }, | |
| { | |
| "epoch": 0.2851605468545388, | |
| "grad_norm": 0.2178063690662384, | |
| "learning_rate": 0.00019614226130310942, | |
| "loss": 0.015, | |
| "step": 1361 | |
| }, | |
| { | |
| "epoch": 0.28537006966633494, | |
| "grad_norm": 0.17697137594223022, | |
| "learning_rate": 0.00019613618006320932, | |
| "loss": 0.026, | |
| "step": 1362 | |
| }, | |
| { | |
| "epoch": 0.2855795924781311, | |
| "grad_norm": 0.1952069103717804, | |
| "learning_rate": 0.00019613009412835055, | |
| "loss": 0.0192, | |
| "step": 1363 | |
| }, | |
| { | |
| "epoch": 0.2857891152899272, | |
| "grad_norm": 0.24872924387454987, | |
| "learning_rate": 0.00019612400349883032, | |
| "loss": 0.023, | |
| "step": 1364 | |
| }, | |
| { | |
| "epoch": 0.2859986381017233, | |
| "grad_norm": 0.0086398059502244, | |
| "learning_rate": 0.00019611790817494602, | |
| "loss": 0.0001, | |
| "step": 1365 | |
| }, | |
| { | |
| "epoch": 0.28620816091351947, | |
| "grad_norm": 0.3663384020328522, | |
| "learning_rate": 0.00019611180815699538, | |
| "loss": 0.039, | |
| "step": 1366 | |
| }, | |
| { | |
| "epoch": 0.2864176837253156, | |
| "grad_norm": 0.03998996317386627, | |
| "learning_rate": 0.00019610570344527628, | |
| "loss": 0.0005, | |
| "step": 1367 | |
| }, | |
| { | |
| "epoch": 0.2866272065371117, | |
| "grad_norm": 0.04309941083192825, | |
| "learning_rate": 0.00019609959404008685, | |
| "loss": 0.0005, | |
| "step": 1368 | |
| }, | |
| { | |
| "epoch": 0.28683672934890786, | |
| "grad_norm": 0.0018193083815276623, | |
| "learning_rate": 0.00019609347994172546, | |
| "loss": 0.0, | |
| "step": 1369 | |
| }, | |
| { | |
| "epoch": 0.287046252160704, | |
| "grad_norm": 0.2627018690109253, | |
| "learning_rate": 0.0001960873611504907, | |
| "loss": 0.0188, | |
| "step": 1370 | |
| }, | |
| { | |
| "epoch": 0.28725577497250016, | |
| "grad_norm": 0.08187177032232285, | |
| "learning_rate": 0.00019608123766668144, | |
| "loss": 0.0025, | |
| "step": 1371 | |
| }, | |
| { | |
| "epoch": 0.28746529778429625, | |
| "grad_norm": 0.015533563680946827, | |
| "learning_rate": 0.00019607510949059664, | |
| "loss": 0.0002, | |
| "step": 1372 | |
| }, | |
| { | |
| "epoch": 0.2876748205960924, | |
| "grad_norm": 0.001533325994387269, | |
| "learning_rate": 0.00019606897662253564, | |
| "loss": 0.0, | |
| "step": 1373 | |
| }, | |
| { | |
| "epoch": 0.28788434340788854, | |
| "grad_norm": 0.014341753907501698, | |
| "learning_rate": 0.00019606283906279791, | |
| "loss": 0.0002, | |
| "step": 1374 | |
| }, | |
| { | |
| "epoch": 0.2880938662196847, | |
| "grad_norm": 0.01508825272321701, | |
| "learning_rate": 0.00019605669681168323, | |
| "loss": 0.0002, | |
| "step": 1375 | |
| }, | |
| { | |
| "epoch": 0.2883033890314808, | |
| "grad_norm": 0.11747533828020096, | |
| "learning_rate": 0.00019605054986949157, | |
| "loss": 0.001, | |
| "step": 1376 | |
| }, | |
| { | |
| "epoch": 0.28851291184327693, | |
| "grad_norm": 0.14469660818576813, | |
| "learning_rate": 0.00019604439823652306, | |
| "loss": 0.0178, | |
| "step": 1377 | |
| }, | |
| { | |
| "epoch": 0.2887224346550731, | |
| "grad_norm": 0.10356391221284866, | |
| "learning_rate": 0.00019603824191307816, | |
| "loss": 0.0014, | |
| "step": 1378 | |
| }, | |
| { | |
| "epoch": 0.2889319574668692, | |
| "grad_norm": 0.0018149783136323094, | |
| "learning_rate": 0.00019603208089945755, | |
| "loss": 0.0, | |
| "step": 1379 | |
| }, | |
| { | |
| "epoch": 0.2891414802786653, | |
| "grad_norm": 0.06800977885723114, | |
| "learning_rate": 0.00019602591519596207, | |
| "loss": 0.0007, | |
| "step": 1380 | |
| }, | |
| { | |
| "epoch": 0.28935100309046147, | |
| "grad_norm": 0.05669765546917915, | |
| "learning_rate": 0.00019601974480289286, | |
| "loss": 0.0043, | |
| "step": 1381 | |
| }, | |
| { | |
| "epoch": 0.2895605259022576, | |
| "grad_norm": 0.1664445847272873, | |
| "learning_rate": 0.00019601356972055126, | |
| "loss": 0.0083, | |
| "step": 1382 | |
| }, | |
| { | |
| "epoch": 0.28977004871405376, | |
| "grad_norm": 0.2715985178947449, | |
| "learning_rate": 0.00019600738994923883, | |
| "loss": 0.0166, | |
| "step": 1383 | |
| }, | |
| { | |
| "epoch": 0.28997957152584986, | |
| "grad_norm": 0.011416422203183174, | |
| "learning_rate": 0.00019600120548925735, | |
| "loss": 0.0001, | |
| "step": 1384 | |
| }, | |
| { | |
| "epoch": 0.290189094337646, | |
| "grad_norm": 0.11940954625606537, | |
| "learning_rate": 0.0001959950163409089, | |
| "loss": 0.0051, | |
| "step": 1385 | |
| }, | |
| { | |
| "epoch": 0.29039861714944215, | |
| "grad_norm": 0.20202504098415375, | |
| "learning_rate": 0.00019598882250449569, | |
| "loss": 0.0281, | |
| "step": 1386 | |
| }, | |
| { | |
| "epoch": 0.2906081399612383, | |
| "grad_norm": 0.2038898915052414, | |
| "learning_rate": 0.00019598262398032022, | |
| "loss": 0.0102, | |
| "step": 1387 | |
| }, | |
| { | |
| "epoch": 0.2908176627730344, | |
| "grad_norm": 0.0836292952299118, | |
| "learning_rate": 0.00019597642076868522, | |
| "loss": 0.0012, | |
| "step": 1388 | |
| }, | |
| { | |
| "epoch": 0.29102718558483054, | |
| "grad_norm": 0.2007703334093094, | |
| "learning_rate": 0.00019597021286989362, | |
| "loss": 0.0381, | |
| "step": 1389 | |
| }, | |
| { | |
| "epoch": 0.2912367083966267, | |
| "grad_norm": 0.04771614074707031, | |
| "learning_rate": 0.00019596400028424856, | |
| "loss": 0.0024, | |
| "step": 1390 | |
| }, | |
| { | |
| "epoch": 0.29144623120842283, | |
| "grad_norm": 0.16608139872550964, | |
| "learning_rate": 0.0001959577830120535, | |
| "loss": 0.0029, | |
| "step": 1391 | |
| }, | |
| { | |
| "epoch": 0.2916557540202189, | |
| "grad_norm": 0.06598784774541855, | |
| "learning_rate": 0.000195951561053612, | |
| "loss": 0.0006, | |
| "step": 1392 | |
| }, | |
| { | |
| "epoch": 0.2918652768320151, | |
| "grad_norm": 0.001551535096950829, | |
| "learning_rate": 0.00019594533440922803, | |
| "loss": 0.0, | |
| "step": 1393 | |
| }, | |
| { | |
| "epoch": 0.2920747996438112, | |
| "grad_norm": 0.005216945894062519, | |
| "learning_rate": 0.00019593910307920555, | |
| "loss": 0.0001, | |
| "step": 1394 | |
| }, | |
| { | |
| "epoch": 0.29228432245560737, | |
| "grad_norm": 0.21973158419132233, | |
| "learning_rate": 0.00019593286706384898, | |
| "loss": 0.0147, | |
| "step": 1395 | |
| }, | |
| { | |
| "epoch": 0.29249384526740346, | |
| "grad_norm": 0.24168424308300018, | |
| "learning_rate": 0.0001959266263634628, | |
| "loss": 0.0376, | |
| "step": 1396 | |
| }, | |
| { | |
| "epoch": 0.2927033680791996, | |
| "grad_norm": 0.03945903480052948, | |
| "learning_rate": 0.0001959203809783518, | |
| "loss": 0.0003, | |
| "step": 1397 | |
| }, | |
| { | |
| "epoch": 0.29291289089099576, | |
| "grad_norm": 0.006036645267158747, | |
| "learning_rate": 0.00019591413090882097, | |
| "loss": 0.0001, | |
| "step": 1398 | |
| }, | |
| { | |
| "epoch": 0.2931224137027919, | |
| "grad_norm": 0.16238859295845032, | |
| "learning_rate": 0.00019590787615517558, | |
| "loss": 0.0151, | |
| "step": 1399 | |
| }, | |
| { | |
| "epoch": 0.293331936514588, | |
| "grad_norm": 0.024547500535845757, | |
| "learning_rate": 0.0001959016167177211, | |
| "loss": 0.0, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 0.293331936514588, | |
| "eval_loss": 0.009350336156785488, | |
| "eval_runtime": 89.0528, | |
| "eval_samples_per_second": 8.624, | |
| "eval_steps_per_second": 4.312, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 0.29354145932638415, | |
| "grad_norm": 0.1304274946451187, | |
| "learning_rate": 0.00019589535259676314, | |
| "loss": 0.0031, | |
| "step": 1401 | |
| }, | |
| { | |
| "epoch": 0.2937509821381803, | |
| "grad_norm": 0.14638224244117737, | |
| "learning_rate": 0.0001958890837926077, | |
| "loss": 0.0062, | |
| "step": 1402 | |
| }, | |
| { | |
| "epoch": 0.29396050494997644, | |
| "grad_norm": 0.19852378964424133, | |
| "learning_rate": 0.0001958828103055609, | |
| "loss": 0.0349, | |
| "step": 1403 | |
| }, | |
| { | |
| "epoch": 0.2941700277617726, | |
| "grad_norm": 0.1417485922574997, | |
| "learning_rate": 0.0001958765321359291, | |
| "loss": 0.0071, | |
| "step": 1404 | |
| }, | |
| { | |
| "epoch": 0.2943795505735687, | |
| "grad_norm": 0.08396097272634506, | |
| "learning_rate": 0.0001958702492840189, | |
| "loss": 0.0027, | |
| "step": 1405 | |
| }, | |
| { | |
| "epoch": 0.29458907338536483, | |
| "grad_norm": 0.005264434032142162, | |
| "learning_rate": 0.00019586396175013714, | |
| "loss": 0.0001, | |
| "step": 1406 | |
| }, | |
| { | |
| "epoch": 0.294798596197161, | |
| "grad_norm": 0.005200863350182772, | |
| "learning_rate": 0.00019585766953459093, | |
| "loss": 0.0001, | |
| "step": 1407 | |
| }, | |
| { | |
| "epoch": 0.2950081190089571, | |
| "grad_norm": 0.08635362237691879, | |
| "learning_rate": 0.00019585137263768748, | |
| "loss": 0.0092, | |
| "step": 1408 | |
| }, | |
| { | |
| "epoch": 0.2952176418207532, | |
| "grad_norm": 0.030663859099149704, | |
| "learning_rate": 0.00019584507105973437, | |
| "loss": 0.0004, | |
| "step": 1409 | |
| }, | |
| { | |
| "epoch": 0.29542716463254937, | |
| "grad_norm": 0.2146034836769104, | |
| "learning_rate": 0.0001958387648010393, | |
| "loss": 0.0028, | |
| "step": 1410 | |
| }, | |
| { | |
| "epoch": 0.2956366874443455, | |
| "grad_norm": 0.008759552612900734, | |
| "learning_rate": 0.0001958324538619103, | |
| "loss": 0.0001, | |
| "step": 1411 | |
| }, | |
| { | |
| "epoch": 0.29584621025614166, | |
| "grad_norm": 0.29600149393081665, | |
| "learning_rate": 0.00019582613824265551, | |
| "loss": 0.0148, | |
| "step": 1412 | |
| }, | |
| { | |
| "epoch": 0.29605573306793775, | |
| "grad_norm": 0.14502890408039093, | |
| "learning_rate": 0.00019581981794358343, | |
| "loss": 0.0051, | |
| "step": 1413 | |
| }, | |
| { | |
| "epoch": 0.2962652558797339, | |
| "grad_norm": 0.16055640578269958, | |
| "learning_rate": 0.00019581349296500267, | |
| "loss": 0.0112, | |
| "step": 1414 | |
| }, | |
| { | |
| "epoch": 0.29647477869153005, | |
| "grad_norm": 0.0015173458959907293, | |
| "learning_rate": 0.00019580716330722215, | |
| "loss": 0.0, | |
| "step": 1415 | |
| }, | |
| { | |
| "epoch": 0.2966843015033262, | |
| "grad_norm": 0.204542875289917, | |
| "learning_rate": 0.000195800828970551, | |
| "loss": 0.0219, | |
| "step": 1416 | |
| }, | |
| { | |
| "epoch": 0.2968938243151223, | |
| "grad_norm": 0.039979007095098495, | |
| "learning_rate": 0.0001957944899552985, | |
| "loss": 0.0004, | |
| "step": 1417 | |
| }, | |
| { | |
| "epoch": 0.29710334712691844, | |
| "grad_norm": 0.011981209740042686, | |
| "learning_rate": 0.00019578814626177427, | |
| "loss": 0.0002, | |
| "step": 1418 | |
| }, | |
| { | |
| "epoch": 0.2973128699387146, | |
| "grad_norm": 0.12856760621070862, | |
| "learning_rate": 0.00019578179789028814, | |
| "loss": 0.0028, | |
| "step": 1419 | |
| }, | |
| { | |
| "epoch": 0.29752239275051073, | |
| "grad_norm": 0.2889501452445984, | |
| "learning_rate": 0.00019577544484115014, | |
| "loss": 0.0528, | |
| "step": 1420 | |
| }, | |
| { | |
| "epoch": 0.2977319155623068, | |
| "grad_norm": 0.10836676508188248, | |
| "learning_rate": 0.00019576908711467045, | |
| "loss": 0.0012, | |
| "step": 1421 | |
| }, | |
| { | |
| "epoch": 0.297941438374103, | |
| "grad_norm": 0.0011059404350817204, | |
| "learning_rate": 0.00019576272471115967, | |
| "loss": 0.0, | |
| "step": 1422 | |
| }, | |
| { | |
| "epoch": 0.2981509611858991, | |
| "grad_norm": 0.09822409600019455, | |
| "learning_rate": 0.00019575635763092843, | |
| "loss": 0.0021, | |
| "step": 1423 | |
| }, | |
| { | |
| "epoch": 0.29836048399769527, | |
| "grad_norm": 0.1385686993598938, | |
| "learning_rate": 0.00019574998587428772, | |
| "loss": 0.0184, | |
| "step": 1424 | |
| }, | |
| { | |
| "epoch": 0.29857000680949136, | |
| "grad_norm": 0.01703231781721115, | |
| "learning_rate": 0.00019574360944154873, | |
| "loss": 0.0002, | |
| "step": 1425 | |
| }, | |
| { | |
| "epoch": 0.2987795296212875, | |
| "grad_norm": 0.192989781498909, | |
| "learning_rate": 0.00019573722833302282, | |
| "loss": 0.025, | |
| "step": 1426 | |
| }, | |
| { | |
| "epoch": 0.29898905243308366, | |
| "grad_norm": 0.15308697521686554, | |
| "learning_rate": 0.00019573084254902162, | |
| "loss": 0.014, | |
| "step": 1427 | |
| }, | |
| { | |
| "epoch": 0.2991985752448798, | |
| "grad_norm": 0.017074331641197205, | |
| "learning_rate": 0.00019572445208985704, | |
| "loss": 0.0002, | |
| "step": 1428 | |
| }, | |
| { | |
| "epoch": 0.2994080980566759, | |
| "grad_norm": 0.12004858255386353, | |
| "learning_rate": 0.00019571805695584114, | |
| "loss": 0.0045, | |
| "step": 1429 | |
| }, | |
| { | |
| "epoch": 0.29961762086847205, | |
| "grad_norm": 0.13323943316936493, | |
| "learning_rate": 0.0001957116571472862, | |
| "loss": 0.0019, | |
| "step": 1430 | |
| }, | |
| { | |
| "epoch": 0.2998271436802682, | |
| "grad_norm": 0.2345772534608841, | |
| "learning_rate": 0.00019570525266450486, | |
| "loss": 0.0306, | |
| "step": 1431 | |
| }, | |
| { | |
| "epoch": 0.30003666649206434, | |
| "grad_norm": 0.1890985071659088, | |
| "learning_rate": 0.00019569884350780975, | |
| "loss": 0.0197, | |
| "step": 1432 | |
| }, | |
| { | |
| "epoch": 0.30024618930386043, | |
| "grad_norm": 0.0014320454793050885, | |
| "learning_rate": 0.00019569242967751402, | |
| "loss": 0.0, | |
| "step": 1433 | |
| }, | |
| { | |
| "epoch": 0.3004557121156566, | |
| "grad_norm": 0.10571502149105072, | |
| "learning_rate": 0.0001956860111739308, | |
| "loss": 0.0114, | |
| "step": 1434 | |
| }, | |
| { | |
| "epoch": 0.30066523492745273, | |
| "grad_norm": 0.08180177211761475, | |
| "learning_rate": 0.0001956795879973736, | |
| "loss": 0.0013, | |
| "step": 1435 | |
| }, | |
| { | |
| "epoch": 0.3008747577392489, | |
| "grad_norm": 0.0072664557956159115, | |
| "learning_rate": 0.00019567316014815607, | |
| "loss": 0.0001, | |
| "step": 1436 | |
| }, | |
| { | |
| "epoch": 0.30108428055104497, | |
| "grad_norm": 0.13646478950977325, | |
| "learning_rate": 0.00019566672762659214, | |
| "loss": 0.0027, | |
| "step": 1437 | |
| }, | |
| { | |
| "epoch": 0.3012938033628411, | |
| "grad_norm": 0.0891512855887413, | |
| "learning_rate": 0.00019566029043299594, | |
| "loss": 0.0023, | |
| "step": 1438 | |
| }, | |
| { | |
| "epoch": 0.30150332617463727, | |
| "grad_norm": 0.08809952437877655, | |
| "learning_rate": 0.00019565384856768187, | |
| "loss": 0.002, | |
| "step": 1439 | |
| }, | |
| { | |
| "epoch": 0.3017128489864334, | |
| "grad_norm": 0.10799501836299896, | |
| "learning_rate": 0.0001956474020309645, | |
| "loss": 0.0227, | |
| "step": 1440 | |
| }, | |
| { | |
| "epoch": 0.3019223717982295, | |
| "grad_norm": 0.007641882169991732, | |
| "learning_rate": 0.00019564095082315864, | |
| "loss": 0.0001, | |
| "step": 1441 | |
| }, | |
| { | |
| "epoch": 0.30213189461002565, | |
| "grad_norm": 0.3086688816547394, | |
| "learning_rate": 0.0001956344949445794, | |
| "loss": 0.0412, | |
| "step": 1442 | |
| }, | |
| { | |
| "epoch": 0.3023414174218218, | |
| "grad_norm": 26.637779235839844, | |
| "learning_rate": 0.00019562803439554207, | |
| "loss": 0.0136, | |
| "step": 1443 | |
| }, | |
| { | |
| "epoch": 0.30255094023361795, | |
| "grad_norm": 0.1183343455195427, | |
| "learning_rate": 0.0001956215691763621, | |
| "loss": 0.0037, | |
| "step": 1444 | |
| }, | |
| { | |
| "epoch": 0.3027604630454141, | |
| "grad_norm": 0.0019468015525490046, | |
| "learning_rate": 0.00019561509928735525, | |
| "loss": 0.0, | |
| "step": 1445 | |
| }, | |
| { | |
| "epoch": 0.3029699858572102, | |
| "grad_norm": 0.02043256163597107, | |
| "learning_rate": 0.00019560862472883748, | |
| "loss": 0.0002, | |
| "step": 1446 | |
| }, | |
| { | |
| "epoch": 0.30317950866900634, | |
| "grad_norm": 0.07333844900131226, | |
| "learning_rate": 0.000195602145501125, | |
| "loss": 0.0087, | |
| "step": 1447 | |
| }, | |
| { | |
| "epoch": 0.3033890314808025, | |
| "grad_norm": 0.27351680397987366, | |
| "learning_rate": 0.0001955956616045342, | |
| "loss": 0.0139, | |
| "step": 1448 | |
| }, | |
| { | |
| "epoch": 0.30359855429259863, | |
| "grad_norm": 0.11866743117570877, | |
| "learning_rate": 0.0001955891730393818, | |
| "loss": 0.0069, | |
| "step": 1449 | |
| }, | |
| { | |
| "epoch": 0.3038080771043947, | |
| "grad_norm": 0.16603772342205048, | |
| "learning_rate": 0.00019558267980598464, | |
| "loss": 0.0185, | |
| "step": 1450 | |
| }, | |
| { | |
| "epoch": 0.3040175999161909, | |
| "grad_norm": 0.17106042802333832, | |
| "learning_rate": 0.0001955761819046598, | |
| "loss": 0.0068, | |
| "step": 1451 | |
| }, | |
| { | |
| "epoch": 0.304227122727987, | |
| "grad_norm": 0.13401584327220917, | |
| "learning_rate": 0.00019556967933572465, | |
| "loss": 0.0081, | |
| "step": 1452 | |
| }, | |
| { | |
| "epoch": 0.30443664553978317, | |
| "grad_norm": 0.2146846204996109, | |
| "learning_rate": 0.00019556317209949676, | |
| "loss": 0.0317, | |
| "step": 1453 | |
| }, | |
| { | |
| "epoch": 0.30464616835157926, | |
| "grad_norm": 0.18583877384662628, | |
| "learning_rate": 0.0001955566601962939, | |
| "loss": 0.0255, | |
| "step": 1454 | |
| }, | |
| { | |
| "epoch": 0.3048556911633754, | |
| "grad_norm": 0.0639459639787674, | |
| "learning_rate": 0.00019555014362643408, | |
| "loss": 0.0006, | |
| "step": 1455 | |
| }, | |
| { | |
| "epoch": 0.30506521397517156, | |
| "grad_norm": 0.07844740152359009, | |
| "learning_rate": 0.00019554362239023555, | |
| "loss": 0.0004, | |
| "step": 1456 | |
| }, | |
| { | |
| "epoch": 0.3052747367869677, | |
| "grad_norm": 0.04650677740573883, | |
| "learning_rate": 0.00019553709648801682, | |
| "loss": 0.0005, | |
| "step": 1457 | |
| }, | |
| { | |
| "epoch": 0.3054842595987638, | |
| "grad_norm": 0.22158075869083405, | |
| "learning_rate": 0.00019553056592009656, | |
| "loss": 0.026, | |
| "step": 1458 | |
| }, | |
| { | |
| "epoch": 0.30569378241055994, | |
| "grad_norm": 0.0060492088086903095, | |
| "learning_rate": 0.00019552403068679372, | |
| "loss": 0.0001, | |
| "step": 1459 | |
| }, | |
| { | |
| "epoch": 0.3059033052223561, | |
| "grad_norm": 0.07878894358873367, | |
| "learning_rate": 0.00019551749078842743, | |
| "loss": 0.0009, | |
| "step": 1460 | |
| }, | |
| { | |
| "epoch": 0.30611282803415224, | |
| "grad_norm": 0.06819705665111542, | |
| "learning_rate": 0.0001955109462253171, | |
| "loss": 0.0109, | |
| "step": 1461 | |
| }, | |
| { | |
| "epoch": 0.30632235084594833, | |
| "grad_norm": 0.06026251241564751, | |
| "learning_rate": 0.00019550439699778232, | |
| "loss": 0.0007, | |
| "step": 1462 | |
| }, | |
| { | |
| "epoch": 0.3065318736577445, | |
| "grad_norm": 0.6910133361816406, | |
| "learning_rate": 0.000195497843106143, | |
| "loss": 0.03, | |
| "step": 1463 | |
| }, | |
| { | |
| "epoch": 0.30674139646954063, | |
| "grad_norm": 0.0064484793692827225, | |
| "learning_rate": 0.0001954912845507191, | |
| "loss": 0.0001, | |
| "step": 1464 | |
| }, | |
| { | |
| "epoch": 0.3069509192813368, | |
| "grad_norm": 0.38042137026786804, | |
| "learning_rate": 0.000195484721331831, | |
| "loss": 0.0715, | |
| "step": 1465 | |
| }, | |
| { | |
| "epoch": 0.30716044209313287, | |
| "grad_norm": 0.07180149853229523, | |
| "learning_rate": 0.0001954781534497992, | |
| "loss": 0.0074, | |
| "step": 1466 | |
| }, | |
| { | |
| "epoch": 0.307369964904929, | |
| "grad_norm": 0.12332933396100998, | |
| "learning_rate": 0.0001954715809049444, | |
| "loss": 0.0123, | |
| "step": 1467 | |
| }, | |
| { | |
| "epoch": 0.30757948771672516, | |
| "grad_norm": 0.12823301553726196, | |
| "learning_rate": 0.0001954650036975877, | |
| "loss": 0.0067, | |
| "step": 1468 | |
| }, | |
| { | |
| "epoch": 0.3077890105285213, | |
| "grad_norm": 0.12684230506420135, | |
| "learning_rate": 0.00019545842182805024, | |
| "loss": 0.0029, | |
| "step": 1469 | |
| }, | |
| { | |
| "epoch": 0.3079985333403174, | |
| "grad_norm": 0.29130974411964417, | |
| "learning_rate": 0.0001954518352966534, | |
| "loss": 0.0129, | |
| "step": 1470 | |
| }, | |
| { | |
| "epoch": 0.30820805615211355, | |
| "grad_norm": 0.029337555170059204, | |
| "learning_rate": 0.00019544524410371894, | |
| "loss": 0.0002, | |
| "step": 1471 | |
| }, | |
| { | |
| "epoch": 0.3084175789639097, | |
| "grad_norm": 0.3716062307357788, | |
| "learning_rate": 0.0001954386482495687, | |
| "loss": 0.0503, | |
| "step": 1472 | |
| }, | |
| { | |
| "epoch": 0.30862710177570585, | |
| "grad_norm": 0.15721499919891357, | |
| "learning_rate": 0.00019543204773452482, | |
| "loss": 0.0231, | |
| "step": 1473 | |
| }, | |
| { | |
| "epoch": 0.30883662458750194, | |
| "grad_norm": 0.1504199206829071, | |
| "learning_rate": 0.00019542544255890962, | |
| "loss": 0.0046, | |
| "step": 1474 | |
| }, | |
| { | |
| "epoch": 0.3090461473992981, | |
| "grad_norm": 0.18560700118541718, | |
| "learning_rate": 0.00019541883272304573, | |
| "loss": 0.0251, | |
| "step": 1475 | |
| }, | |
| { | |
| "epoch": 0.30925567021109424, | |
| "grad_norm": 0.22650940716266632, | |
| "learning_rate": 0.00019541221822725585, | |
| "loss": 0.0067, | |
| "step": 1476 | |
| }, | |
| { | |
| "epoch": 0.3094651930228904, | |
| "grad_norm": 0.17605389654636383, | |
| "learning_rate": 0.0001954055990718631, | |
| "loss": 0.0119, | |
| "step": 1477 | |
| }, | |
| { | |
| "epoch": 0.3096747158346865, | |
| "grad_norm": 0.010634154081344604, | |
| "learning_rate": 0.00019539897525719073, | |
| "loss": 0.0001, | |
| "step": 1478 | |
| }, | |
| { | |
| "epoch": 0.3098842386464826, | |
| "grad_norm": 0.17018188536167145, | |
| "learning_rate": 0.00019539234678356217, | |
| "loss": 0.0182, | |
| "step": 1479 | |
| }, | |
| { | |
| "epoch": 0.31009376145827877, | |
| "grad_norm": 0.009977507404983044, | |
| "learning_rate": 0.00019538571365130118, | |
| "loss": 0.0001, | |
| "step": 1480 | |
| }, | |
| { | |
| "epoch": 0.3103032842700749, | |
| "grad_norm": 0.018772488459944725, | |
| "learning_rate": 0.00019537907586073168, | |
| "loss": 0.0003, | |
| "step": 1481 | |
| }, | |
| { | |
| "epoch": 0.310512807081871, | |
| "grad_norm": 0.32882487773895264, | |
| "learning_rate": 0.0001953724334121778, | |
| "loss": 0.008, | |
| "step": 1482 | |
| }, | |
| { | |
| "epoch": 0.31072232989366716, | |
| "grad_norm": 0.17600393295288086, | |
| "learning_rate": 0.00019536578630596405, | |
| "loss": 0.008, | |
| "step": 1483 | |
| }, | |
| { | |
| "epoch": 0.3109318527054633, | |
| "grad_norm": 0.18962863087654114, | |
| "learning_rate": 0.00019535913454241493, | |
| "loss": 0.0134, | |
| "step": 1484 | |
| }, | |
| { | |
| "epoch": 0.31114137551725946, | |
| "grad_norm": 0.0949021726846695, | |
| "learning_rate": 0.00019535247812185532, | |
| "loss": 0.011, | |
| "step": 1485 | |
| }, | |
| { | |
| "epoch": 0.3113508983290556, | |
| "grad_norm": 0.0024588159285485744, | |
| "learning_rate": 0.00019534581704461033, | |
| "loss": 0.0, | |
| "step": 1486 | |
| }, | |
| { | |
| "epoch": 0.3115604211408517, | |
| "grad_norm": 0.22583766281604767, | |
| "learning_rate": 0.00019533915131100525, | |
| "loss": 0.0037, | |
| "step": 1487 | |
| }, | |
| { | |
| "epoch": 0.31176994395264784, | |
| "grad_norm": 0.13111519813537598, | |
| "learning_rate": 0.0001953324809213656, | |
| "loss": 0.0106, | |
| "step": 1488 | |
| }, | |
| { | |
| "epoch": 0.311979466764444, | |
| "grad_norm": 0.1254248470067978, | |
| "learning_rate": 0.00019532580587601714, | |
| "loss": 0.0156, | |
| "step": 1489 | |
| }, | |
| { | |
| "epoch": 0.31218898957624014, | |
| "grad_norm": 0.2393532544374466, | |
| "learning_rate": 0.00019531912617528585, | |
| "loss": 0.0111, | |
| "step": 1490 | |
| }, | |
| { | |
| "epoch": 0.31239851238803623, | |
| "grad_norm": 0.12270370125770569, | |
| "learning_rate": 0.00019531244181949796, | |
| "loss": 0.0076, | |
| "step": 1491 | |
| }, | |
| { | |
| "epoch": 0.3126080351998324, | |
| "grad_norm": 0.2543415129184723, | |
| "learning_rate": 0.00019530575280897992, | |
| "loss": 0.0179, | |
| "step": 1492 | |
| }, | |
| { | |
| "epoch": 0.3128175580116285, | |
| "grad_norm": 0.1431514471769333, | |
| "learning_rate": 0.00019529905914405837, | |
| "loss": 0.0011, | |
| "step": 1493 | |
| }, | |
| { | |
| "epoch": 0.3130270808234247, | |
| "grad_norm": 0.20022700726985931, | |
| "learning_rate": 0.00019529236082506022, | |
| "loss": 0.0294, | |
| "step": 1494 | |
| }, | |
| { | |
| "epoch": 0.31323660363522077, | |
| "grad_norm": 0.0343584343791008, | |
| "learning_rate": 0.00019528565785231262, | |
| "loss": 0.0005, | |
| "step": 1495 | |
| }, | |
| { | |
| "epoch": 0.3134461264470169, | |
| "grad_norm": 0.0010648473398759961, | |
| "learning_rate": 0.00019527895022614287, | |
| "loss": 0.0, | |
| "step": 1496 | |
| }, | |
| { | |
| "epoch": 0.31365564925881306, | |
| "grad_norm": 0.20229478180408478, | |
| "learning_rate": 0.00019527223794687853, | |
| "loss": 0.0246, | |
| "step": 1497 | |
| }, | |
| { | |
| "epoch": 0.3138651720706092, | |
| "grad_norm": 0.014464381150901318, | |
| "learning_rate": 0.0001952655210148475, | |
| "loss": 0.0001, | |
| "step": 1498 | |
| }, | |
| { | |
| "epoch": 0.3140746948824053, | |
| "grad_norm": 0.1936783790588379, | |
| "learning_rate": 0.00019525879943037774, | |
| "loss": 0.0045, | |
| "step": 1499 | |
| }, | |
| { | |
| "epoch": 0.31428421769420145, | |
| "grad_norm": 0.012530984356999397, | |
| "learning_rate": 0.0001952520731937975, | |
| "loss": 0.0001, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 0.3144937405059976, | |
| "grad_norm": 0.1337125450372696, | |
| "learning_rate": 0.00019524534230543533, | |
| "loss": 0.0089, | |
| "step": 1501 | |
| }, | |
| { | |
| "epoch": 0.31470326331779375, | |
| "grad_norm": 0.22295622527599335, | |
| "learning_rate": 0.00019523860676561988, | |
| "loss": 0.0114, | |
| "step": 1502 | |
| }, | |
| { | |
| "epoch": 0.31491278612958984, | |
| "grad_norm": 0.0035251390654593706, | |
| "learning_rate": 0.0001952318665746801, | |
| "loss": 0.0, | |
| "step": 1503 | |
| }, | |
| { | |
| "epoch": 0.315122308941386, | |
| "grad_norm": 0.004611232317984104, | |
| "learning_rate": 0.0001952251217329452, | |
| "loss": 0.0001, | |
| "step": 1504 | |
| }, | |
| { | |
| "epoch": 0.31533183175318213, | |
| "grad_norm": 0.002356649376451969, | |
| "learning_rate": 0.00019521837224074454, | |
| "loss": 0.0, | |
| "step": 1505 | |
| }, | |
| { | |
| "epoch": 0.3155413545649783, | |
| "grad_norm": 0.027044709771871567, | |
| "learning_rate": 0.00019521161809840773, | |
| "loss": 0.0002, | |
| "step": 1506 | |
| }, | |
| { | |
| "epoch": 0.3157508773767744, | |
| "grad_norm": 0.07268866151571274, | |
| "learning_rate": 0.00019520485930626464, | |
| "loss": 0.0004, | |
| "step": 1507 | |
| }, | |
| { | |
| "epoch": 0.3159604001885705, | |
| "grad_norm": 0.010898386128246784, | |
| "learning_rate": 0.00019519809586464537, | |
| "loss": 0.0001, | |
| "step": 1508 | |
| }, | |
| { | |
| "epoch": 0.31616992300036667, | |
| "grad_norm": 0.03874179720878601, | |
| "learning_rate": 0.00019519132777388016, | |
| "loss": 0.0006, | |
| "step": 1509 | |
| }, | |
| { | |
| "epoch": 0.3163794458121628, | |
| "grad_norm": 0.005732359830290079, | |
| "learning_rate": 0.0001951845550342996, | |
| "loss": 0.0, | |
| "step": 1510 | |
| }, | |
| { | |
| "epoch": 0.3165889686239589, | |
| "grad_norm": 0.2763909697532654, | |
| "learning_rate": 0.00019517777764623443, | |
| "loss": 0.0179, | |
| "step": 1511 | |
| }, | |
| { | |
| "epoch": 0.31679849143575506, | |
| "grad_norm": 0.05047501623630524, | |
| "learning_rate": 0.00019517099561001562, | |
| "loss": 0.0005, | |
| "step": 1512 | |
| }, | |
| { | |
| "epoch": 0.3170080142475512, | |
| "grad_norm": 0.0008512980421073735, | |
| "learning_rate": 0.00019516420892597437, | |
| "loss": 0.0, | |
| "step": 1513 | |
| }, | |
| { | |
| "epoch": 0.31721753705934735, | |
| "grad_norm": 0.13507002592086792, | |
| "learning_rate": 0.00019515741759444218, | |
| "loss": 0.0166, | |
| "step": 1514 | |
| }, | |
| { | |
| "epoch": 0.31742705987114345, | |
| "grad_norm": 0.18085655570030212, | |
| "learning_rate": 0.00019515062161575063, | |
| "loss": 0.0019, | |
| "step": 1515 | |
| }, | |
| { | |
| "epoch": 0.3176365826829396, | |
| "grad_norm": 0.06925208121538162, | |
| "learning_rate": 0.00019514382099023166, | |
| "loss": 0.0008, | |
| "step": 1516 | |
| }, | |
| { | |
| "epoch": 0.31784610549473574, | |
| "grad_norm": 0.17617951333522797, | |
| "learning_rate": 0.00019513701571821738, | |
| "loss": 0.0075, | |
| "step": 1517 | |
| }, | |
| { | |
| "epoch": 0.3180556283065319, | |
| "grad_norm": 0.27964097261428833, | |
| "learning_rate": 0.00019513020580004016, | |
| "loss": 0.0222, | |
| "step": 1518 | |
| }, | |
| { | |
| "epoch": 0.318265151118328, | |
| "grad_norm": 0.10818011313676834, | |
| "learning_rate": 0.00019512339123603257, | |
| "loss": 0.0009, | |
| "step": 1519 | |
| }, | |
| { | |
| "epoch": 0.31847467393012413, | |
| "grad_norm": 0.2028188854455948, | |
| "learning_rate": 0.00019511657202652736, | |
| "loss": 0.0187, | |
| "step": 1520 | |
| }, | |
| { | |
| "epoch": 0.3186841967419203, | |
| "grad_norm": 0.15811379253864288, | |
| "learning_rate": 0.0001951097481718576, | |
| "loss": 0.0138, | |
| "step": 1521 | |
| }, | |
| { | |
| "epoch": 0.3188937195537164, | |
| "grad_norm": 0.18826134502887726, | |
| "learning_rate": 0.00019510291967235653, | |
| "loss": 0.0339, | |
| "step": 1522 | |
| }, | |
| { | |
| "epoch": 0.3191032423655125, | |
| "grad_norm": 0.0027802777476608753, | |
| "learning_rate": 0.00019509608652835763, | |
| "loss": 0.0001, | |
| "step": 1523 | |
| }, | |
| { | |
| "epoch": 0.31931276517730867, | |
| "grad_norm": 0.027045130729675293, | |
| "learning_rate": 0.0001950892487401946, | |
| "loss": 0.0018, | |
| "step": 1524 | |
| }, | |
| { | |
| "epoch": 0.3195222879891048, | |
| "grad_norm": 0.05583294481039047, | |
| "learning_rate": 0.00019508240630820137, | |
| "loss": 0.0008, | |
| "step": 1525 | |
| }, | |
| { | |
| "epoch": 0.31973181080090096, | |
| "grad_norm": 0.04633820801973343, | |
| "learning_rate": 0.00019507555923271218, | |
| "loss": 0.0004, | |
| "step": 1526 | |
| }, | |
| { | |
| "epoch": 0.3199413336126971, | |
| "grad_norm": 0.23768991231918335, | |
| "learning_rate": 0.0001950687075140613, | |
| "loss": 0.0131, | |
| "step": 1527 | |
| }, | |
| { | |
| "epoch": 0.3201508564244932, | |
| "grad_norm": 0.24667467176914215, | |
| "learning_rate": 0.00019506185115258343, | |
| "loss": 0.0397, | |
| "step": 1528 | |
| }, | |
| { | |
| "epoch": 0.32036037923628935, | |
| "grad_norm": 0.04483865574002266, | |
| "learning_rate": 0.00019505499014861333, | |
| "loss": 0.0005, | |
| "step": 1529 | |
| }, | |
| { | |
| "epoch": 0.3205699020480855, | |
| "grad_norm": 0.030646564438939095, | |
| "learning_rate": 0.00019504812450248614, | |
| "loss": 0.0005, | |
| "step": 1530 | |
| }, | |
| { | |
| "epoch": 0.32077942485988165, | |
| "grad_norm": 0.04976831376552582, | |
| "learning_rate": 0.0001950412542145371, | |
| "loss": 0.0006, | |
| "step": 1531 | |
| }, | |
| { | |
| "epoch": 0.32098894767167774, | |
| "grad_norm": 0.1266006976366043, | |
| "learning_rate": 0.0001950343792851018, | |
| "loss": 0.0027, | |
| "step": 1532 | |
| }, | |
| { | |
| "epoch": 0.3211984704834739, | |
| "grad_norm": 0.07971259206533432, | |
| "learning_rate": 0.00019502749971451596, | |
| "loss": 0.0013, | |
| "step": 1533 | |
| }, | |
| { | |
| "epoch": 0.32140799329527003, | |
| "grad_norm": 0.002387990476563573, | |
| "learning_rate": 0.0001950206155031155, | |
| "loss": 0.0, | |
| "step": 1534 | |
| }, | |
| { | |
| "epoch": 0.3216175161070662, | |
| "grad_norm": 0.00598552543669939, | |
| "learning_rate": 0.00019501372665123667, | |
| "loss": 0.0, | |
| "step": 1535 | |
| }, | |
| { | |
| "epoch": 0.3218270389188623, | |
| "grad_norm": 0.018055522814393044, | |
| "learning_rate": 0.00019500683315921592, | |
| "loss": 0.0002, | |
| "step": 1536 | |
| }, | |
| { | |
| "epoch": 0.3220365617306584, | |
| "grad_norm": 0.29587745666503906, | |
| "learning_rate": 0.00019499993502738986, | |
| "loss": 0.0266, | |
| "step": 1537 | |
| }, | |
| { | |
| "epoch": 0.32224608454245457, | |
| "grad_norm": 0.33568182587623596, | |
| "learning_rate": 0.00019499303225609539, | |
| "loss": 0.0128, | |
| "step": 1538 | |
| }, | |
| { | |
| "epoch": 0.3224556073542507, | |
| "grad_norm": 0.020032409578561783, | |
| "learning_rate": 0.0001949861248456696, | |
| "loss": 0.0002, | |
| "step": 1539 | |
| }, | |
| { | |
| "epoch": 0.3226651301660468, | |
| "grad_norm": 0.006906419992446899, | |
| "learning_rate": 0.00019497921279644986, | |
| "loss": 0.0001, | |
| "step": 1540 | |
| }, | |
| { | |
| "epoch": 0.32287465297784296, | |
| "grad_norm": 0.01124792080372572, | |
| "learning_rate": 0.0001949722961087737, | |
| "loss": 0.0001, | |
| "step": 1541 | |
| }, | |
| { | |
| "epoch": 0.3230841757896391, | |
| "grad_norm": 0.011126923374831676, | |
| "learning_rate": 0.0001949653747829789, | |
| "loss": 0.0001, | |
| "step": 1542 | |
| }, | |
| { | |
| "epoch": 0.32329369860143525, | |
| "grad_norm": 0.0007546422421000898, | |
| "learning_rate": 0.0001949584488194035, | |
| "loss": 0.0, | |
| "step": 1543 | |
| }, | |
| { | |
| "epoch": 0.32350322141323135, | |
| "grad_norm": 0.12543243169784546, | |
| "learning_rate": 0.00019495151821838572, | |
| "loss": 0.0123, | |
| "step": 1544 | |
| }, | |
| { | |
| "epoch": 0.3237127442250275, | |
| "grad_norm": 0.014699449762701988, | |
| "learning_rate": 0.0001949445829802641, | |
| "loss": 0.0002, | |
| "step": 1545 | |
| }, | |
| { | |
| "epoch": 0.32392226703682364, | |
| "grad_norm": 0.0024809150490909815, | |
| "learning_rate": 0.0001949376431053772, | |
| "loss": 0.0, | |
| "step": 1546 | |
| }, | |
| { | |
| "epoch": 0.3241317898486198, | |
| "grad_norm": 0.22279804944992065, | |
| "learning_rate": 0.000194930698594064, | |
| "loss": 0.0312, | |
| "step": 1547 | |
| }, | |
| { | |
| "epoch": 0.3243413126604159, | |
| "grad_norm": 0.11176104843616486, | |
| "learning_rate": 0.00019492374944666367, | |
| "loss": 0.015, | |
| "step": 1548 | |
| }, | |
| { | |
| "epoch": 0.32455083547221203, | |
| "grad_norm": 0.09751889854669571, | |
| "learning_rate": 0.0001949167956635156, | |
| "loss": 0.0007, | |
| "step": 1549 | |
| }, | |
| { | |
| "epoch": 0.3247603582840082, | |
| "grad_norm": 0.15919186174869537, | |
| "learning_rate": 0.00019490983724495932, | |
| "loss": 0.0017, | |
| "step": 1550 | |
| }, | |
| { | |
| "epoch": 0.3249698810958043, | |
| "grad_norm": 0.13658560812473297, | |
| "learning_rate": 0.00019490287419133472, | |
| "loss": 0.0022, | |
| "step": 1551 | |
| }, | |
| { | |
| "epoch": 0.3251794039076004, | |
| "grad_norm": 0.21580643951892853, | |
| "learning_rate": 0.0001948959065029818, | |
| "loss": 0.0233, | |
| "step": 1552 | |
| }, | |
| { | |
| "epoch": 0.32538892671939657, | |
| "grad_norm": 0.009592859074473381, | |
| "learning_rate": 0.00019488893418024086, | |
| "loss": 0.0001, | |
| "step": 1553 | |
| }, | |
| { | |
| "epoch": 0.3255984495311927, | |
| "grad_norm": 0.2529331147670746, | |
| "learning_rate": 0.0001948819572234524, | |
| "loss": 0.0189, | |
| "step": 1554 | |
| }, | |
| { | |
| "epoch": 0.32580797234298886, | |
| "grad_norm": 0.009520837105810642, | |
| "learning_rate": 0.00019487497563295717, | |
| "loss": 0.0001, | |
| "step": 1555 | |
| }, | |
| { | |
| "epoch": 0.32601749515478495, | |
| "grad_norm": 0.0009123004856519401, | |
| "learning_rate": 0.00019486798940909612, | |
| "loss": 0.0, | |
| "step": 1556 | |
| }, | |
| { | |
| "epoch": 0.3262270179665811, | |
| "grad_norm": 0.33604323863983154, | |
| "learning_rate": 0.00019486099855221042, | |
| "loss": 0.0302, | |
| "step": 1557 | |
| }, | |
| { | |
| "epoch": 0.32643654077837725, | |
| "grad_norm": 0.20807093381881714, | |
| "learning_rate": 0.00019485400306264148, | |
| "loss": 0.0235, | |
| "step": 1558 | |
| }, | |
| { | |
| "epoch": 0.3266460635901734, | |
| "grad_norm": 0.012143682688474655, | |
| "learning_rate": 0.0001948470029407309, | |
| "loss": 0.0001, | |
| "step": 1559 | |
| }, | |
| { | |
| "epoch": 0.3268555864019695, | |
| "grad_norm": 0.04122312366962433, | |
| "learning_rate": 0.00019483999818682062, | |
| "loss": 0.0006, | |
| "step": 1560 | |
| }, | |
| { | |
| "epoch": 0.32706510921376564, | |
| "grad_norm": 0.20180264115333557, | |
| "learning_rate": 0.0001948329888012527, | |
| "loss": 0.036, | |
| "step": 1561 | |
| }, | |
| { | |
| "epoch": 0.3272746320255618, | |
| "grad_norm": 0.17562663555145264, | |
| "learning_rate": 0.00019482597478436944, | |
| "loss": 0.0174, | |
| "step": 1562 | |
| }, | |
| { | |
| "epoch": 0.32748415483735793, | |
| "grad_norm": 0.01567312516272068, | |
| "learning_rate": 0.00019481895613651337, | |
| "loss": 0.0003, | |
| "step": 1563 | |
| }, | |
| { | |
| "epoch": 0.327693677649154, | |
| "grad_norm": 0.0051555633544921875, | |
| "learning_rate": 0.00019481193285802726, | |
| "loss": 0.0001, | |
| "step": 1564 | |
| }, | |
| { | |
| "epoch": 0.3279032004609502, | |
| "grad_norm": 0.052859075367450714, | |
| "learning_rate": 0.00019480490494925412, | |
| "loss": 0.0005, | |
| "step": 1565 | |
| }, | |
| { | |
| "epoch": 0.3281127232727463, | |
| "grad_norm": 0.17717738449573517, | |
| "learning_rate": 0.00019479787241053717, | |
| "loss": 0.0222, | |
| "step": 1566 | |
| }, | |
| { | |
| "epoch": 0.32832224608454247, | |
| "grad_norm": 0.17727364599704742, | |
| "learning_rate": 0.0001947908352422198, | |
| "loss": 0.0135, | |
| "step": 1567 | |
| }, | |
| { | |
| "epoch": 0.3285317688963386, | |
| "grad_norm": 0.07884063571691513, | |
| "learning_rate": 0.00019478379344464578, | |
| "loss": 0.0013, | |
| "step": 1568 | |
| }, | |
| { | |
| "epoch": 0.3287412917081347, | |
| "grad_norm": 0.056564390659332275, | |
| "learning_rate": 0.00019477674701815897, | |
| "loss": 0.001, | |
| "step": 1569 | |
| }, | |
| { | |
| "epoch": 0.32895081451993086, | |
| "grad_norm": 0.0061117722652852535, | |
| "learning_rate": 0.00019476969596310344, | |
| "loss": 0.0001, | |
| "step": 1570 | |
| }, | |
| { | |
| "epoch": 0.329160337331727, | |
| "grad_norm": 0.16239264607429504, | |
| "learning_rate": 0.0001947626402798236, | |
| "loss": 0.0027, | |
| "step": 1571 | |
| }, | |
| { | |
| "epoch": 0.32936986014352315, | |
| "grad_norm": 0.24103544652462006, | |
| "learning_rate": 0.00019475557996866396, | |
| "loss": 0.0426, | |
| "step": 1572 | |
| }, | |
| { | |
| "epoch": 0.32957938295531924, | |
| "grad_norm": 0.24487897753715515, | |
| "learning_rate": 0.0001947485150299694, | |
| "loss": 0.0215, | |
| "step": 1573 | |
| }, | |
| { | |
| "epoch": 0.3297889057671154, | |
| "grad_norm": 0.19202744960784912, | |
| "learning_rate": 0.0001947414454640849, | |
| "loss": 0.0027, | |
| "step": 1574 | |
| }, | |
| { | |
| "epoch": 0.32999842857891154, | |
| "grad_norm": 0.07547135651111603, | |
| "learning_rate": 0.0001947343712713557, | |
| "loss": 0.0106, | |
| "step": 1575 | |
| }, | |
| { | |
| "epoch": 0.3302079513907077, | |
| "grad_norm": 0.07378017157316208, | |
| "learning_rate": 0.00019472729245212736, | |
| "loss": 0.0053, | |
| "step": 1576 | |
| }, | |
| { | |
| "epoch": 0.3304174742025038, | |
| "grad_norm": 0.048381540924310684, | |
| "learning_rate": 0.00019472020900674548, | |
| "loss": 0.0007, | |
| "step": 1577 | |
| }, | |
| { | |
| "epoch": 0.33062699701429993, | |
| "grad_norm": 0.09767217189073563, | |
| "learning_rate": 0.00019471312093555606, | |
| "loss": 0.0067, | |
| "step": 1578 | |
| }, | |
| { | |
| "epoch": 0.3308365198260961, | |
| "grad_norm": 0.0035071636084467173, | |
| "learning_rate": 0.00019470602823890522, | |
| "loss": 0.0001, | |
| "step": 1579 | |
| }, | |
| { | |
| "epoch": 0.3310460426378922, | |
| "grad_norm": 0.17983557283878326, | |
| "learning_rate": 0.00019469893091713937, | |
| "loss": 0.0138, | |
| "step": 1580 | |
| }, | |
| { | |
| "epoch": 0.3312555654496883, | |
| "grad_norm": 0.20754225552082062, | |
| "learning_rate": 0.0001946918289706051, | |
| "loss": 0.0089, | |
| "step": 1581 | |
| }, | |
| { | |
| "epoch": 0.33146508826148446, | |
| "grad_norm": 0.09018977731466293, | |
| "learning_rate": 0.00019468472239964925, | |
| "loss": 0.0017, | |
| "step": 1582 | |
| }, | |
| { | |
| "epoch": 0.3316746110732806, | |
| "grad_norm": 0.003919263835996389, | |
| "learning_rate": 0.0001946776112046189, | |
| "loss": 0.0001, | |
| "step": 1583 | |
| }, | |
| { | |
| "epoch": 0.33188413388507676, | |
| "grad_norm": 0.009066829457879066, | |
| "learning_rate": 0.0001946704953858613, | |
| "loss": 0.0001, | |
| "step": 1584 | |
| }, | |
| { | |
| "epoch": 0.33209365669687285, | |
| "grad_norm": 0.05145661532878876, | |
| "learning_rate": 0.00019466337494372397, | |
| "loss": 0.0006, | |
| "step": 1585 | |
| }, | |
| { | |
| "epoch": 0.332303179508669, | |
| "grad_norm": 0.017742574214935303, | |
| "learning_rate": 0.0001946562498785547, | |
| "loss": 0.0002, | |
| "step": 1586 | |
| }, | |
| { | |
| "epoch": 0.33251270232046515, | |
| "grad_norm": 0.05322175845503807, | |
| "learning_rate": 0.00019464912019070136, | |
| "loss": 0.0005, | |
| "step": 1587 | |
| }, | |
| { | |
| "epoch": 0.3327222251322613, | |
| "grad_norm": 0.24456927180290222, | |
| "learning_rate": 0.00019464198588051225, | |
| "loss": 0.0292, | |
| "step": 1588 | |
| }, | |
| { | |
| "epoch": 0.3329317479440574, | |
| "grad_norm": 0.23175880312919617, | |
| "learning_rate": 0.00019463484694833566, | |
| "loss": 0.0208, | |
| "step": 1589 | |
| }, | |
| { | |
| "epoch": 0.33314127075585354, | |
| "grad_norm": 0.14457044005393982, | |
| "learning_rate": 0.00019462770339452031, | |
| "loss": 0.004, | |
| "step": 1590 | |
| }, | |
| { | |
| "epoch": 0.3333507935676497, | |
| "grad_norm": 0.11340788006782532, | |
| "learning_rate": 0.0001946205552194151, | |
| "loss": 0.0142, | |
| "step": 1591 | |
| }, | |
| { | |
| "epoch": 0.33356031637944583, | |
| "grad_norm": 0.06547866761684418, | |
| "learning_rate": 0.00019461340242336902, | |
| "loss": 0.001, | |
| "step": 1592 | |
| }, | |
| { | |
| "epoch": 0.3337698391912419, | |
| "grad_norm": 0.3663977384567261, | |
| "learning_rate": 0.00019460624500673146, | |
| "loss": 0.0423, | |
| "step": 1593 | |
| }, | |
| { | |
| "epoch": 0.33397936200303807, | |
| "grad_norm": 0.0014640424633398652, | |
| "learning_rate": 0.00019459908296985193, | |
| "loss": 0.0, | |
| "step": 1594 | |
| }, | |
| { | |
| "epoch": 0.3341888848148342, | |
| "grad_norm": 0.014392894692718983, | |
| "learning_rate": 0.00019459191631308027, | |
| "loss": 0.0003, | |
| "step": 1595 | |
| }, | |
| { | |
| "epoch": 0.33439840762663037, | |
| "grad_norm": 0.10644684731960297, | |
| "learning_rate": 0.0001945847450367664, | |
| "loss": 0.0048, | |
| "step": 1596 | |
| }, | |
| { | |
| "epoch": 0.33460793043842646, | |
| "grad_norm": 0.028983639553189278, | |
| "learning_rate": 0.00019457756914126052, | |
| "loss": 0.0119, | |
| "step": 1597 | |
| }, | |
| { | |
| "epoch": 0.3348174532502226, | |
| "grad_norm": 0.027979666367173195, | |
| "learning_rate": 0.00019457038862691315, | |
| "loss": 0.0002, | |
| "step": 1598 | |
| }, | |
| { | |
| "epoch": 0.33502697606201876, | |
| "grad_norm": 0.21817360818386078, | |
| "learning_rate": 0.00019456320349407492, | |
| "loss": 0.0402, | |
| "step": 1599 | |
| }, | |
| { | |
| "epoch": 0.3352364988738149, | |
| "grad_norm": 0.0055143400095403194, | |
| "learning_rate": 0.00019455601374309672, | |
| "loss": 0.0001, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 0.3352364988738149, | |
| "eval_loss": 0.0074059851467609406, | |
| "eval_runtime": 89.0563, | |
| "eval_samples_per_second": 8.624, | |
| "eval_steps_per_second": 4.312, | |
| "step": 1600 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 14316, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 200, | |
| "stateful_callbacks": { | |
| "EarlyStoppingCallback": { | |
| "args": { | |
| "early_stopping_patience": 3, | |
| "early_stopping_threshold": 0.0 | |
| }, | |
| "attributes": { | |
| "early_stopping_patience_counter": 0 | |
| } | |
| }, | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 5.087044627857408e+17, | |
| "train_batch_size": 2, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |