{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 199, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.0732421875, "epoch": 0.005044136191677175, "grad_norm": 3.729904548791402, "learning_rate": 0.0, "loss": 1.5705682039260864, "mean_token_accuracy": 0.5984444469213486, "num_tokens": 397809.0, "step": 1 }, { "entropy": 1.140625, "epoch": 0.025220680958385876, "grad_norm": 3.537819920462687, "learning_rate": 1.295370924755994e-05, "loss": 1.569430947303772, "mean_token_accuracy": 0.5931065641343594, "num_tokens": 1792332.0, "step": 5 }, { "entropy": 1.28984375, "epoch": 0.05044136191677175, "grad_norm": 1.9953551967058947, "learning_rate": 1.853256816058254e-05, "loss": 1.4315099716186523, "mean_token_accuracy": 0.6139604687690735, "num_tokens": 3573398.0, "step": 10 }, { "entropy": 1.2671875, "epoch": 0.07566204287515763, "grad_norm": 2.0123345607376537, "learning_rate": 1.989637305699482e-05, "loss": 1.303097915649414, "mean_token_accuracy": 0.6386384278535843, "num_tokens": 5352795.0, "step": 15 }, { "entropy": 1.34296875, "epoch": 0.1008827238335435, "grad_norm": 2.3429686709929016, "learning_rate": 1.9637305699481867e-05, "loss": 1.2593023300170898, "mean_token_accuracy": 0.646000188589096, "num_tokens": 7129865.0, "step": 20 }, { "entropy": 1.2890625, "epoch": 0.12610340479192939, "grad_norm": 2.093171715611346, "learning_rate": 1.9378238341968913e-05, "loss": 1.25695743560791, "mean_token_accuracy": 0.6471466660499573, "num_tokens": 8868732.0, "step": 25 }, { "entropy": 1.315234375, "epoch": 0.15132408575031525, "grad_norm": 1.5214039865876905, "learning_rate": 1.9119170984455958e-05, "loss": 1.2165451049804688, "mean_token_accuracy": 0.6549518913030624, "num_tokens": 10737138.0, "step": 30 }, { "entropy": 1.282421875, "epoch": 0.17654476670870115, "grad_norm": 1.7720335086338008, "learning_rate": 1.8860103626943007e-05, "loss": 1.1993481636047363, "mean_token_accuracy": 0.657388761639595, "num_tokens": 12626963.0, "step": 35 }, { "entropy": 1.2640625, "epoch": 0.201765447667087, "grad_norm": 1.8352721153566052, "learning_rate": 1.8601036269430053e-05, "loss": 1.1846282958984375, "mean_token_accuracy": 0.6627674549818039, "num_tokens": 14433262.0, "step": 40 }, { "entropy": 1.251953125, "epoch": 0.22698612862547288, "grad_norm": 1.8067651099435984, "learning_rate": 1.83419689119171e-05, "loss": 1.1756595611572265, "mean_token_accuracy": 0.6638763636350632, "num_tokens": 16326390.0, "step": 45 }, { "entropy": 1.273046875, "epoch": 0.25220680958385877, "grad_norm": 3.465628169730638, "learning_rate": 1.8082901554404147e-05, "loss": 1.1847558975219727, "mean_token_accuracy": 0.6604940384626389, "num_tokens": 18279034.0, "step": 50 }, { "entropy": 1.25625, "epoch": 0.27742749054224464, "grad_norm": 1.4054861856544547, "learning_rate": 1.7823834196891192e-05, "loss": 1.1652128219604492, "mean_token_accuracy": 0.6664551287889481, "num_tokens": 20208031.0, "step": 55 }, { "entropy": 1.266796875, "epoch": 0.3026481715006305, "grad_norm": 3.4183832212008456, "learning_rate": 1.756476683937824e-05, "loss": 1.1770149230957032, "mean_token_accuracy": 0.6627189248800278, "num_tokens": 21908532.0, "step": 60 }, { "entropy": 1.26484375, "epoch": 0.32786885245901637, "grad_norm": 3.1555109653499964, "learning_rate": 1.7305699481865287e-05, "loss": 1.1431950569152831, "mean_token_accuracy": 0.6696279108524322, "num_tokens": 23700105.0, "step": 65 }, { "entropy": 1.242578125, "epoch": 0.3530895334174023, "grad_norm": 2.3839995394597286, "learning_rate": 1.7046632124352332e-05, "loss": 1.1668883323669434, "mean_token_accuracy": 0.6657638341188431, "num_tokens": 25603944.0, "step": 70 }, { "entropy": 1.24921875, "epoch": 0.37831021437578816, "grad_norm": 1.8426925035490107, "learning_rate": 1.6787564766839378e-05, "loss": 1.13353271484375, "mean_token_accuracy": 0.6711880832910537, "num_tokens": 27318273.0, "step": 75 }, { "entropy": 1.26171875, "epoch": 0.403530895334174, "grad_norm": 1.9994154023171613, "learning_rate": 1.6528497409326427e-05, "loss": 1.1364672660827637, "mean_token_accuracy": 0.672755679488182, "num_tokens": 29158308.0, "step": 80 }, { "entropy": 1.249609375, "epoch": 0.4287515762925599, "grad_norm": 2.9275771398624597, "learning_rate": 1.6269430051813472e-05, "loss": 1.121041488647461, "mean_token_accuracy": 0.6760148137807847, "num_tokens": 30941822.0, "step": 85 }, { "entropy": 1.25390625, "epoch": 0.45397225725094575, "grad_norm": 1.5615516079216, "learning_rate": 1.6010362694300518e-05, "loss": 1.1162029266357423, "mean_token_accuracy": 0.6768355071544647, "num_tokens": 32787654.0, "step": 90 }, { "entropy": 1.254296875, "epoch": 0.4791929382093317, "grad_norm": 2.8170519799515197, "learning_rate": 1.5751295336787566e-05, "loss": 1.1182659149169922, "mean_token_accuracy": 0.6761424988508224, "num_tokens": 34644366.0, "step": 95 }, { "entropy": 1.238671875, "epoch": 0.5044136191677175, "grad_norm": 2.805028653265598, "learning_rate": 1.5492227979274612e-05, "loss": 1.1245113372802735, "mean_token_accuracy": 0.6737537115812302, "num_tokens": 36483579.0, "step": 100 }, { "entropy": 1.226953125, "epoch": 0.5296343001261034, "grad_norm": 1.438265666554789, "learning_rate": 1.523316062176166e-05, "loss": 1.1135278701782227, "mean_token_accuracy": 0.6800242573022842, "num_tokens": 38534892.0, "step": 105 }, { "entropy": 1.240625, "epoch": 0.5548549810844893, "grad_norm": 6.154593405469548, "learning_rate": 1.4974093264248706e-05, "loss": 1.127542495727539, "mean_token_accuracy": 0.6712189227342605, "num_tokens": 40255595.0, "step": 110 }, { "entropy": 1.221875, "epoch": 0.5800756620428752, "grad_norm": 1.712858492865262, "learning_rate": 1.4715025906735752e-05, "loss": 1.0767477989196776, "mean_token_accuracy": 0.6854143172502518, "num_tokens": 42143795.0, "step": 115 }, { "entropy": 1.228125, "epoch": 0.605296343001261, "grad_norm": 1.7954082649002236, "learning_rate": 1.4455958549222799e-05, "loss": 1.1128243446350097, "mean_token_accuracy": 0.6780534535646439, "num_tokens": 44010920.0, "step": 120 }, { "entropy": 1.25, "epoch": 0.6305170239596469, "grad_norm": 2.557128723303994, "learning_rate": 1.4196891191709844e-05, "loss": 1.1001087188720704, "mean_token_accuracy": 0.6781179249286652, "num_tokens": 45633080.0, "step": 125 }, { "entropy": 1.233984375, "epoch": 0.6557377049180327, "grad_norm": 1.6132918279446875, "learning_rate": 1.3937823834196893e-05, "loss": 1.0829249382019044, "mean_token_accuracy": 0.6852418035268784, "num_tokens": 47264233.0, "step": 130 }, { "entropy": 1.2265625, "epoch": 0.6809583858764187, "grad_norm": 1.35683478183202, "learning_rate": 1.3678756476683939e-05, "loss": 1.0771641731262207, "mean_token_accuracy": 0.6857132732868194, "num_tokens": 49137662.0, "step": 135 }, { "entropy": 1.2171875, "epoch": 0.7061790668348046, "grad_norm": 1.5570774063045756, "learning_rate": 1.3419689119170986e-05, "loss": 1.0707455635070802, "mean_token_accuracy": 0.6857165455818176, "num_tokens": 50943509.0, "step": 140 }, { "entropy": 1.248828125, "epoch": 0.7313997477931904, "grad_norm": 2.8786377018075457, "learning_rate": 1.3160621761658033e-05, "loss": 1.082810401916504, "mean_token_accuracy": 0.6832135945558548, "num_tokens": 52697400.0, "step": 145 }, { "entropy": 1.212109375, "epoch": 0.7566204287515763, "grad_norm": 1.4838869261745697, "learning_rate": 1.2901554404145079e-05, "loss": 1.055869960784912, "mean_token_accuracy": 0.6903243094682694, "num_tokens": 54550790.0, "step": 150 }, { "entropy": 1.2265625, "epoch": 0.7818411097099621, "grad_norm": 1.322651287548672, "learning_rate": 1.2642487046632126e-05, "loss": 1.0742380142211914, "mean_token_accuracy": 0.6852674335241318, "num_tokens": 56273458.0, "step": 155 }, { "entropy": 1.2453125, "epoch": 0.807061790668348, "grad_norm": 8.55404246200832, "learning_rate": 1.2383419689119171e-05, "loss": 1.0786266326904297, "mean_token_accuracy": 0.6855500996112823, "num_tokens": 58121056.0, "step": 160 }, { "entropy": 1.203125, "epoch": 0.832282471626734, "grad_norm": 2.0497153186806325, "learning_rate": 1.212435233160622e-05, "loss": 1.0652950286865235, "mean_token_accuracy": 0.6877057552337646, "num_tokens": 60048538.0, "step": 165 }, { "entropy": 1.208203125, "epoch": 0.8575031525851198, "grad_norm": 1.2643588159534247, "learning_rate": 1.1865284974093266e-05, "loss": 1.0611819267272948, "mean_token_accuracy": 0.6904475122690201, "num_tokens": 61835940.0, "step": 170 }, { "entropy": 1.2171875, "epoch": 0.8827238335435057, "grad_norm": 1.204921091847234, "learning_rate": 1.1606217616580311e-05, "loss": 1.0413402557373046, "mean_token_accuracy": 0.6954286068677902, "num_tokens": 63573308.0, "step": 175 }, { "entropy": 1.20078125, "epoch": 0.9079445145018915, "grad_norm": 1.387043880574625, "learning_rate": 1.1347150259067358e-05, "loss": 1.049238681793213, "mean_token_accuracy": 0.6919074177742004, "num_tokens": 65497008.0, "step": 180 }, { "entropy": 1.206640625, "epoch": 0.9331651954602774, "grad_norm": 1.279478089664614, "learning_rate": 1.1088082901554404e-05, "loss": 1.0584297180175781, "mean_token_accuracy": 0.6892471343278885, "num_tokens": 67254338.0, "step": 185 }, { "entropy": 1.2171875, "epoch": 0.9583858764186634, "grad_norm": 1.5719174306561159, "learning_rate": 1.0829015544041453e-05, "loss": 1.0455381393432617, "mean_token_accuracy": 0.6926654905080796, "num_tokens": 69176523.0, "step": 190 }, { "entropy": 1.209375, "epoch": 0.9836065573770492, "grad_norm": 1.4906711673793527, "learning_rate": 1.0569948186528498e-05, "loss": 1.0241477966308594, "mean_token_accuracy": 0.6976693719625473, "num_tokens": 71048975.0, "step": 195 }, { "epoch": 1.0, "eval_entropy": 1.2234002976190477, "eval_loss": 1.0335501432418823, "eval_mean_token_accuracy": 0.6941843855948675, "eval_num_tokens": 72109037.0, "eval_runtime": 533.6615, "eval_samples_per_second": 0.624, "eval_steps_per_second": 0.079, "step": 199 } ], "logging_steps": 5, "max_steps": 398, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 940923320795136.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }