Instructions to use Jongbin-kr/llama-3.1-8b-instruct_lbox-criminal-property_ffn-only with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use Jongbin-kr/llama-3.1-8b-instruct_lbox-criminal-property_ffn-only with Transformers:
# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("Jongbin-kr/llama-3.1-8b-instruct_lbox-criminal-property_ffn-only", device_map="auto") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": 3500, | |
| "best_metric": 0.08556525409221649, | |
| "best_model_checkpoint": "/data6/jongbinwon/evolving_MoE/checkpoints/sft_llama31_8b_lbox_criminal_property_ffn_only_5ep/checkpoint-3500", | |
| "epoch": 5.0, | |
| "eval_steps": 100, | |
| "global_step": 5770, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "entropy": 2.0094634652137757, | |
| "epoch": 0.00866738894907909, | |
| "grad_norm": 6.016944408416748, | |
| "learning_rate": 1.0344827586206898e-06, | |
| "loss": 1.9924282073974608, | |
| "mean_token_accuracy": 0.6058960895985365, | |
| "num_tokens": 62341.0, | |
| "step": 10 | |
| }, | |
| { | |
| "entropy": 2.074240231513977, | |
| "epoch": 0.01733477789815818, | |
| "grad_norm": 22.0172119140625, | |
| "learning_rate": 2.1839080459770117e-06, | |
| "loss": 1.9484416961669921, | |
| "mean_token_accuracy": 0.6000785790383816, | |
| "num_tokens": 123672.0, | |
| "step": 20 | |
| }, | |
| { | |
| "entropy": 2.1732099413871766, | |
| "epoch": 0.02600216684723727, | |
| "grad_norm": 6.0356831550598145, | |
| "learning_rate": 3.3333333333333333e-06, | |
| "loss": 1.966094970703125, | |
| "mean_token_accuracy": 0.5903577983379364, | |
| "num_tokens": 178475.0, | |
| "step": 30 | |
| }, | |
| { | |
| "entropy": 2.03062362074852, | |
| "epoch": 0.03466955579631636, | |
| "grad_norm": 7.640094757080078, | |
| "learning_rate": 4.482758620689656e-06, | |
| "loss": 1.8349821090698242, | |
| "mean_token_accuracy": 0.6228681385517121, | |
| "num_tokens": 243079.0, | |
| "step": 40 | |
| }, | |
| { | |
| "entropy": 2.0886535823345183, | |
| "epoch": 0.04333694474539545, | |
| "grad_norm": 4.04999303817749, | |
| "learning_rate": 5.6321839080459775e-06, | |
| "loss": 1.382587718963623, | |
| "mean_token_accuracy": 0.6765289187431336, | |
| "num_tokens": 307598.0, | |
| "step": 50 | |
| }, | |
| { | |
| "entropy": 2.036424469947815, | |
| "epoch": 0.05200433369447454, | |
| "grad_norm": 5.690767288208008, | |
| "learning_rate": 6.781609195402299e-06, | |
| "loss": 1.2014636039733886, | |
| "mean_token_accuracy": 0.7360026895999908, | |
| "num_tokens": 370530.0, | |
| "step": 60 | |
| }, | |
| { | |
| "entropy": 2.0666846364736555, | |
| "epoch": 0.06067172264355363, | |
| "grad_norm": 6.074404716491699, | |
| "learning_rate": 7.93103448275862e-06, | |
| "loss": 0.9479114532470703, | |
| "mean_token_accuracy": 0.8202387556433678, | |
| "num_tokens": 438053.0, | |
| "step": 70 | |
| }, | |
| { | |
| "entropy": 2.1196643888950346, | |
| "epoch": 0.06933911159263272, | |
| "grad_norm": 3.3794610500335693, | |
| "learning_rate": 9.080459770114942e-06, | |
| "loss": 0.7980506896972657, | |
| "mean_token_accuracy": 0.8331406563520432, | |
| "num_tokens": 495572.0, | |
| "step": 80 | |
| }, | |
| { | |
| "entropy": 2.0099371910095214, | |
| "epoch": 0.0780065005417118, | |
| "grad_norm": 4.104278087615967, | |
| "learning_rate": 1.0229885057471264e-05, | |
| "loss": 0.8544118881225586, | |
| "mean_token_accuracy": 0.793623823672533, | |
| "num_tokens": 562327.0, | |
| "step": 90 | |
| }, | |
| { | |
| "entropy": 2.111247554421425, | |
| "epoch": 0.0866738894907909, | |
| "grad_norm": 3.811084270477295, | |
| "learning_rate": 1.1379310344827587e-05, | |
| "loss": 0.5899581909179688, | |
| "mean_token_accuracy": 0.8357160598039627, | |
| "num_tokens": 622741.0, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.0866738894907909, | |
| "eval_entropy": 2.0146469435288537, | |
| "eval_loss": 0.639670729637146, | |
| "eval_mean_token_accuracy": 0.8453463265551856, | |
| "eval_num_tokens": 622741.0, | |
| "eval_runtime": 327.692, | |
| "eval_samples_per_second": 4.907, | |
| "eval_steps_per_second": 0.613, | |
| "step": 100 | |
| }, | |
| { | |
| "entropy": 2.1024232476949694, | |
| "epoch": 0.09534127843986999, | |
| "grad_norm": 3.4410061836242676, | |
| "learning_rate": 1.2528735632183907e-05, | |
| "loss": 0.5648527145385742, | |
| "mean_token_accuracy": 0.8602957978844643, | |
| "num_tokens": 686988.0, | |
| "step": 110 | |
| }, | |
| { | |
| "entropy": 2.0769773036241532, | |
| "epoch": 0.10400866738894908, | |
| "grad_norm": 4.00484561920166, | |
| "learning_rate": 1.367816091954023e-05, | |
| "loss": 0.6145552158355713, | |
| "mean_token_accuracy": 0.846926499903202, | |
| "num_tokens": 742631.0, | |
| "step": 120 | |
| }, | |
| { | |
| "entropy": 2.0740666419267653, | |
| "epoch": 0.11267605633802817, | |
| "grad_norm": 3.5441555976867676, | |
| "learning_rate": 1.4827586206896554e-05, | |
| "loss": 0.4216147422790527, | |
| "mean_token_accuracy": 0.8855735391378403, | |
| "num_tokens": 800445.0, | |
| "step": 130 | |
| }, | |
| { | |
| "entropy": 2.086614066362381, | |
| "epoch": 0.12134344528710726, | |
| "grad_norm": 3.0210344791412354, | |
| "learning_rate": 1.5977011494252876e-05, | |
| "loss": 0.3674225568771362, | |
| "mean_token_accuracy": 0.9093644827604294, | |
| "num_tokens": 864344.0, | |
| "step": 140 | |
| }, | |
| { | |
| "entropy": 2.082952803373337, | |
| "epoch": 0.13001083423618634, | |
| "grad_norm": 4.145540237426758, | |
| "learning_rate": 1.7126436781609197e-05, | |
| "loss": 0.40997681617736814, | |
| "mean_token_accuracy": 0.9000683546066284, | |
| "num_tokens": 922914.0, | |
| "step": 150 | |
| }, | |
| { | |
| "entropy": 1.9609296470880508, | |
| "epoch": 0.13867822318526543, | |
| "grad_norm": 4.342889308929443, | |
| "learning_rate": 1.827586206896552e-05, | |
| "loss": 0.47150702476501466, | |
| "mean_token_accuracy": 0.8880565464496613, | |
| "num_tokens": 992986.0, | |
| "step": 160 | |
| }, | |
| { | |
| "entropy": 2.02143072783947, | |
| "epoch": 0.14734561213434452, | |
| "grad_norm": 4.358700752258301, | |
| "learning_rate": 1.942528735632184e-05, | |
| "loss": 0.3823310136795044, | |
| "mean_token_accuracy": 0.8964826211333274, | |
| "num_tokens": 1056343.0, | |
| "step": 170 | |
| }, | |
| { | |
| "entropy": 2.1072087794542314, | |
| "epoch": 0.1560130010834236, | |
| "grad_norm": 8.081436157226562, | |
| "learning_rate": 1.999996060382467e-05, | |
| "loss": 0.3178143262863159, | |
| "mean_token_accuracy": 0.8876261033117772, | |
| "num_tokens": 1110020.0, | |
| "step": 180 | |
| }, | |
| { | |
| "entropy": 1.9597682043910027, | |
| "epoch": 0.1646803900325027, | |
| "grad_norm": 3.436814308166504, | |
| "learning_rate": 1.9999645436284486e-05, | |
| "loss": 0.3373431921005249, | |
| "mean_token_accuracy": 0.9190717935562134, | |
| "num_tokens": 1175893.0, | |
| "step": 190 | |
| }, | |
| { | |
| "entropy": 2.045034462213516, | |
| "epoch": 0.1733477789815818, | |
| "grad_norm": 5.531442642211914, | |
| "learning_rate": 1.999901511113721e-05, | |
| "loss": 0.48609213829040526, | |
| "mean_token_accuracy": 0.8734037652611732, | |
| "num_tokens": 1233459.0, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.1733477789815818, | |
| "eval_entropy": 1.9307460037629995, | |
| "eval_loss": 0.31969207525253296, | |
| "eval_mean_token_accuracy": 0.9156260101949397, | |
| "eval_num_tokens": 1233459.0, | |
| "eval_runtime": 327.7812, | |
| "eval_samples_per_second": 4.906, | |
| "eval_steps_per_second": 0.613, | |
| "step": 200 | |
| }, | |
| { | |
| "entropy": 1.9456486970186233, | |
| "epoch": 0.1820151679306609, | |
| "grad_norm": 3.714157819747925, | |
| "learning_rate": 1.999806964824873e-05, | |
| "loss": 0.27378363609313966, | |
| "mean_token_accuracy": 0.898275463283062, | |
| "num_tokens": 1310194.0, | |
| "step": 210 | |
| }, | |
| { | |
| "entropy": 1.9946164965629578, | |
| "epoch": 0.19068255687973998, | |
| "grad_norm": 5.428526878356934, | |
| "learning_rate": 1.999680907741708e-05, | |
| "loss": 0.18908169269561767, | |
| "mean_token_accuracy": 0.9540401995182037, | |
| "num_tokens": 1372396.0, | |
| "step": 220 | |
| }, | |
| { | |
| "entropy": 1.9999880447983742, | |
| "epoch": 0.19934994582881907, | |
| "grad_norm": 5.249075889587402, | |
| "learning_rate": 1.999523343837152e-05, | |
| "loss": 0.2796680212020874, | |
| "mean_token_accuracy": 0.9432714268565178, | |
| "num_tokens": 1431522.0, | |
| "step": 230 | |
| }, | |
| { | |
| "entropy": 1.9591780692338943, | |
| "epoch": 0.20801733477789816, | |
| "grad_norm": 5.265084743499756, | |
| "learning_rate": 1.999334278077127e-05, | |
| "loss": 0.3002108097076416, | |
| "mean_token_accuracy": 0.9193895891308784, | |
| "num_tokens": 1493107.0, | |
| "step": 240 | |
| }, | |
| { | |
| "entropy": 2.0249179124832155, | |
| "epoch": 0.21668472372697725, | |
| "grad_norm": 3.4058895111083984, | |
| "learning_rate": 1.999113716420396e-05, | |
| "loss": 0.3556444406509399, | |
| "mean_token_accuracy": 0.9207730159163475, | |
| "num_tokens": 1550661.0, | |
| "step": 250 | |
| }, | |
| { | |
| "entropy": 1.8855496376752854, | |
| "epoch": 0.22535211267605634, | |
| "grad_norm": 4.0377936363220215, | |
| "learning_rate": 1.9988616658183734e-05, | |
| "loss": 0.19759812355041503, | |
| "mean_token_accuracy": 0.948055523633957, | |
| "num_tokens": 1626343.0, | |
| "step": 260 | |
| }, | |
| { | |
| "entropy": 1.8737920612096786, | |
| "epoch": 0.23401950162513543, | |
| "grad_norm": 2.6314523220062256, | |
| "learning_rate": 1.9985781342149078e-05, | |
| "loss": 0.28745641708374026, | |
| "mean_token_accuracy": 0.9337396785616875, | |
| "num_tokens": 1696414.0, | |
| "step": 270 | |
| }, | |
| { | |
| "entropy": 1.9150809600949288, | |
| "epoch": 0.24268689057421453, | |
| "grad_norm": 5.922034740447998, | |
| "learning_rate": 1.9982631305460297e-05, | |
| "loss": 0.28877570629119875, | |
| "mean_token_accuracy": 0.9260302111506462, | |
| "num_tokens": 1761679.0, | |
| "step": 280 | |
| }, | |
| { | |
| "entropy": 1.92972229719162, | |
| "epoch": 0.2513542795232936, | |
| "grad_norm": 5.307780742645264, | |
| "learning_rate": 1.9979166647396718e-05, | |
| "loss": 0.20345923900604249, | |
| "mean_token_accuracy": 0.9439164400100708, | |
| "num_tokens": 1828184.0, | |
| "step": 290 | |
| }, | |
| { | |
| "entropy": 1.950343307852745, | |
| "epoch": 0.2600216684723727, | |
| "grad_norm": 4.971693992614746, | |
| "learning_rate": 1.9975387477153547e-05, | |
| "loss": 0.33291172981262207, | |
| "mean_token_accuracy": 0.9112795010209084, | |
| "num_tokens": 1894019.0, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.2600216684723727, | |
| "eval_entropy": 1.9190048121694308, | |
| "eval_loss": 0.2512859106063843, | |
| "eval_mean_token_accuracy": 0.9369790637077977, | |
| "eval_num_tokens": 1894019.0, | |
| "eval_runtime": 327.5455, | |
| "eval_samples_per_second": 4.909, | |
| "eval_steps_per_second": 0.614, | |
| "step": 300 | |
| }, | |
| { | |
| "entropy": 2.010765317082405, | |
| "epoch": 0.26868905742145177, | |
| "grad_norm": 8.496099472045898, | |
| "learning_rate": 1.997129391383843e-05, | |
| "loss": 0.3033193826675415, | |
| "mean_token_accuracy": 0.9163187935948371, | |
| "num_tokens": 1946992.0, | |
| "step": 310 | |
| }, | |
| { | |
| "entropy": 1.9858351945877075, | |
| "epoch": 0.27735644637053086, | |
| "grad_norm": 3.4120125770568848, | |
| "learning_rate": 1.9966886086467704e-05, | |
| "loss": 0.29690701961517335, | |
| "mean_token_accuracy": 0.9126337721943856, | |
| "num_tokens": 2011691.0, | |
| "step": 320 | |
| }, | |
| { | |
| "entropy": 1.8983549684286118, | |
| "epoch": 0.28602383531960995, | |
| "grad_norm": 1.436771035194397, | |
| "learning_rate": 1.9962164133962325e-05, | |
| "loss": 0.30121750831604005, | |
| "mean_token_accuracy": 0.9224563807249069, | |
| "num_tokens": 2083706.0, | |
| "step": 330 | |
| }, | |
| { | |
| "entropy": 1.9841466784477233, | |
| "epoch": 0.29469122426868904, | |
| "grad_norm": 5.781894683837891, | |
| "learning_rate": 1.9957128205143498e-05, | |
| "loss": 0.2556509017944336, | |
| "mean_token_accuracy": 0.9394641578197479, | |
| "num_tokens": 2148674.0, | |
| "step": 340 | |
| }, | |
| { | |
| "entropy": 1.9055085510015488, | |
| "epoch": 0.30335861321776814, | |
| "grad_norm": 6.032225608825684, | |
| "learning_rate": 1.9951778458727976e-05, | |
| "loss": 0.27752203941345216, | |
| "mean_token_accuracy": 0.9140971004962921, | |
| "num_tokens": 2215772.0, | |
| "step": 350 | |
| }, | |
| { | |
| "entropy": 2.04987233877182, | |
| "epoch": 0.3120260021668472, | |
| "grad_norm": 2.553159475326538, | |
| "learning_rate": 1.9946115063323068e-05, | |
| "loss": 0.19900113344192505, | |
| "mean_token_accuracy": 0.9388249479234219, | |
| "num_tokens": 2266191.0, | |
| "step": 360 | |
| }, | |
| { | |
| "entropy": 2.009141910076141, | |
| "epoch": 0.3206933911159263, | |
| "grad_norm": 1.9444561004638672, | |
| "learning_rate": 1.9940138197421316e-05, | |
| "loss": 0.17729513645172118, | |
| "mean_token_accuracy": 0.9602704092860221, | |
| "num_tokens": 2325355.0, | |
| "step": 370 | |
| }, | |
| { | |
| "entropy": 2.004271525144577, | |
| "epoch": 0.3293607800650054, | |
| "grad_norm": 8.431859970092773, | |
| "learning_rate": 1.9933848049394872e-05, | |
| "loss": 0.14624375104904175, | |
| "mean_token_accuracy": 0.9545927375555039, | |
| "num_tokens": 2383835.0, | |
| "step": 380 | |
| }, | |
| { | |
| "entropy": 1.9636184632778169, | |
| "epoch": 0.3380281690140845, | |
| "grad_norm": 3.6653892993927, | |
| "learning_rate": 1.9927244817489568e-05, | |
| "loss": 0.19174840450286865, | |
| "mean_token_accuracy": 0.945315583050251, | |
| "num_tokens": 2453604.0, | |
| "step": 390 | |
| }, | |
| { | |
| "entropy": 1.9832717061042786, | |
| "epoch": 0.3466955579631636, | |
| "grad_norm": 4.508843421936035, | |
| "learning_rate": 1.9920328709818658e-05, | |
| "loss": 0.22036411762237548, | |
| "mean_token_accuracy": 0.946815638244152, | |
| "num_tokens": 2511426.0, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.3466955579631636, | |
| "eval_entropy": 1.8908554446044845, | |
| "eval_loss": 0.21776656806468964, | |
| "eval_mean_token_accuracy": 0.9417561876833143, | |
| "eval_num_tokens": 2511426.0, | |
| "eval_runtime": 327.8022, | |
| "eval_samples_per_second": 4.905, | |
| "eval_steps_per_second": 0.613, | |
| "step": 400 | |
| }, | |
| { | |
| "entropy": 1.9166859805583953, | |
| "epoch": 0.3553629469122427, | |
| "grad_norm": 4.482876300811768, | |
| "learning_rate": 1.9913099944356265e-05, | |
| "loss": 0.21862165927886962, | |
| "mean_token_accuracy": 0.9501018598675728, | |
| "num_tokens": 2576843.0, | |
| "step": 410 | |
| }, | |
| { | |
| "entropy": 1.981603667140007, | |
| "epoch": 0.3640303358613218, | |
| "grad_norm": 2.7158615589141846, | |
| "learning_rate": 1.9905558748930513e-05, | |
| "loss": 0.20267672538757325, | |
| "mean_token_accuracy": 0.9586101487278939, | |
| "num_tokens": 2633215.0, | |
| "step": 420 | |
| }, | |
| { | |
| "entropy": 1.979082790017128, | |
| "epoch": 0.37269772481040087, | |
| "grad_norm": 1.2694976329803467, | |
| "learning_rate": 1.9897705361216334e-05, | |
| "loss": 0.1717057228088379, | |
| "mean_token_accuracy": 0.9619395598769188, | |
| "num_tokens": 2704383.0, | |
| "step": 430 | |
| }, | |
| { | |
| "entropy": 1.9977828115224838, | |
| "epoch": 0.38136511375947996, | |
| "grad_norm": 3.3041579723358154, | |
| "learning_rate": 1.9889540028728e-05, | |
| "loss": 0.2565366268157959, | |
| "mean_token_accuracy": 0.9440258383750916, | |
| "num_tokens": 2762147.0, | |
| "step": 440 | |
| }, | |
| { | |
| "entropy": 1.985519140958786, | |
| "epoch": 0.39003250270855905, | |
| "grad_norm": 3.923245668411255, | |
| "learning_rate": 1.9881063008811288e-05, | |
| "loss": 0.15962369441986085, | |
| "mean_token_accuracy": 0.9452512726187706, | |
| "num_tokens": 2827820.0, | |
| "step": 450 | |
| }, | |
| { | |
| "entropy": 1.9977640628814697, | |
| "epoch": 0.39869989165763814, | |
| "grad_norm": 5.337918758392334, | |
| "learning_rate": 1.987227456863541e-05, | |
| "loss": 0.19878954887390138, | |
| "mean_token_accuracy": 0.9549267739057541, | |
| "num_tokens": 2894148.0, | |
| "step": 460 | |
| }, | |
| { | |
| "entropy": 1.981362435221672, | |
| "epoch": 0.40736728060671723, | |
| "grad_norm": 4.396739482879639, | |
| "learning_rate": 1.9863174985184565e-05, | |
| "loss": 0.2123692512512207, | |
| "mean_token_accuracy": 0.9419563382863998, | |
| "num_tokens": 2949819.0, | |
| "step": 470 | |
| }, | |
| { | |
| "entropy": 2.053285387158394, | |
| "epoch": 0.4160346695557963, | |
| "grad_norm": 1.743699073791504, | |
| "learning_rate": 1.9853764545249217e-05, | |
| "loss": 0.1345153570175171, | |
| "mean_token_accuracy": 0.9553116604685783, | |
| "num_tokens": 3002255.0, | |
| "step": 480 | |
| }, | |
| { | |
| "entropy": 2.015228086709976, | |
| "epoch": 0.4247020585048754, | |
| "grad_norm": 9.911247253417969, | |
| "learning_rate": 1.984404354541705e-05, | |
| "loss": 0.2177375078201294, | |
| "mean_token_accuracy": 0.9537948787212371, | |
| "num_tokens": 3066922.0, | |
| "step": 490 | |
| }, | |
| { | |
| "entropy": 1.9184562861919403, | |
| "epoch": 0.4333694474539545, | |
| "grad_norm": 6.476995468139648, | |
| "learning_rate": 1.9834012292063634e-05, | |
| "loss": 0.13998514413833618, | |
| "mean_token_accuracy": 0.9385814905166626, | |
| "num_tokens": 3135056.0, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.4333694474539545, | |
| "eval_entropy": 1.91096430453495, | |
| "eval_loss": 0.18260541558265686, | |
| "eval_mean_token_accuracy": 0.9541504039100154, | |
| "eval_num_tokens": 3135056.0, | |
| "eval_runtime": 327.4029, | |
| "eval_samples_per_second": 4.911, | |
| "eval_steps_per_second": 0.614, | |
| "step": 500 | |
| }, | |
| { | |
| "entropy": 1.986215516924858, | |
| "epoch": 0.4420368364030336, | |
| "grad_norm": 1.8353534936904907, | |
| "learning_rate": 1.982367110134276e-05, | |
| "loss": 0.2266139030456543, | |
| "mean_token_accuracy": 0.939882904291153, | |
| "num_tokens": 3196646.0, | |
| "step": 510 | |
| }, | |
| { | |
| "entropy": 2.0170169204473494, | |
| "epoch": 0.4507042253521127, | |
| "grad_norm": 5.655337810516357, | |
| "learning_rate": 1.9813020299176475e-05, | |
| "loss": 0.23389663696289062, | |
| "mean_token_accuracy": 0.9509230718016625, | |
| "num_tokens": 3258975.0, | |
| "step": 520 | |
| }, | |
| { | |
| "entropy": 2.0502737373113633, | |
| "epoch": 0.4593716143011918, | |
| "grad_norm": 4.397721290588379, | |
| "learning_rate": 1.9802060221244815e-05, | |
| "loss": 0.1621358275413513, | |
| "mean_token_accuracy": 0.9493934914469719, | |
| "num_tokens": 3323770.0, | |
| "step": 530 | |
| }, | |
| { | |
| "entropy": 1.936602184176445, | |
| "epoch": 0.46803900325027087, | |
| "grad_norm": 4.689565181732178, | |
| "learning_rate": 1.979079121297522e-05, | |
| "loss": 0.21635038852691652, | |
| "mean_token_accuracy": 0.9611420571804047, | |
| "num_tokens": 3392275.0, | |
| "step": 540 | |
| }, | |
| { | |
| "entropy": 2.060832369327545, | |
| "epoch": 0.47670639219934996, | |
| "grad_norm": 2.461576461791992, | |
| "learning_rate": 1.977921362953165e-05, | |
| "loss": 0.2094656467437744, | |
| "mean_token_accuracy": 0.9389677405357361, | |
| "num_tokens": 3449649.0, | |
| "step": 550 | |
| }, | |
| { | |
| "entropy": 1.976703155040741, | |
| "epoch": 0.48537378114842905, | |
| "grad_norm": 3.079184055328369, | |
| "learning_rate": 1.9767327835803388e-05, | |
| "loss": 0.13856724500656128, | |
| "mean_token_accuracy": 0.9628144934773445, | |
| "num_tokens": 3519095.0, | |
| "step": 560 | |
| }, | |
| { | |
| "entropy": 2.0048892587423324, | |
| "epoch": 0.49404117009750814, | |
| "grad_norm": 2.5651493072509766, | |
| "learning_rate": 1.9755134206393557e-05, | |
| "loss": 0.2005464792251587, | |
| "mean_token_accuracy": 0.9645502358675003, | |
| "num_tokens": 3577729.0, | |
| "step": 570 | |
| }, | |
| { | |
| "entropy": 2.048991507291794, | |
| "epoch": 0.5027085590465872, | |
| "grad_norm": 6.429996967315674, | |
| "learning_rate": 1.974263312560728e-05, | |
| "loss": 0.11518661975860596, | |
| "mean_token_accuracy": 0.9612075328826905, | |
| "num_tokens": 3641823.0, | |
| "step": 580 | |
| }, | |
| { | |
| "entropy": 2.0796742677688598, | |
| "epoch": 0.5113759479956663, | |
| "grad_norm": 3.4637815952301025, | |
| "learning_rate": 1.972982498743961e-05, | |
| "loss": 0.13005509376525878, | |
| "mean_token_accuracy": 0.9748484209179878, | |
| "num_tokens": 3698090.0, | |
| "step": 590 | |
| }, | |
| { | |
| "entropy": 2.018010488152504, | |
| "epoch": 0.5200433369447454, | |
| "grad_norm": 5.774364948272705, | |
| "learning_rate": 1.9716710195563063e-05, | |
| "loss": 0.11385848522186279, | |
| "mean_token_accuracy": 0.9651767894625664, | |
| "num_tokens": 3766932.0, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.5200433369447454, | |
| "eval_entropy": 1.949031797214527, | |
| "eval_loss": 0.1759590059518814, | |
| "eval_mean_token_accuracy": 0.9537636631756873, | |
| "eval_num_tokens": 3766932.0, | |
| "eval_runtime": 327.6397, | |
| "eval_samples_per_second": 4.908, | |
| "eval_steps_per_second": 0.613, | |
| "step": 600 | |
| }, | |
| { | |
| "entropy": 1.9692809194326402, | |
| "epoch": 0.5287107258938245, | |
| "grad_norm": 3.4839439392089844, | |
| "learning_rate": 1.9703289163314947e-05, | |
| "loss": 0.21931560039520265, | |
| "mean_token_accuracy": 0.9536899715662003, | |
| "num_tokens": 3836323.0, | |
| "step": 610 | |
| }, | |
| { | |
| "entropy": 2.049798659980297, | |
| "epoch": 0.5373781148429035, | |
| "grad_norm": 6.157666206359863, | |
| "learning_rate": 1.9689562313684295e-05, | |
| "loss": 0.1124419093132019, | |
| "mean_token_accuracy": 0.9672878786921502, | |
| "num_tokens": 3894701.0, | |
| "step": 620 | |
| }, | |
| { | |
| "entropy": 2.0254536986351015, | |
| "epoch": 0.5460455037919827, | |
| "grad_norm": 3.196044683456421, | |
| "learning_rate": 1.9675530079298554e-05, | |
| "loss": 0.09724722504615783, | |
| "mean_token_accuracy": 0.969377551972866, | |
| "num_tokens": 3952827.0, | |
| "step": 630 | |
| }, | |
| { | |
| "entropy": 2.0226389855146407, | |
| "epoch": 0.5547128927410617, | |
| "grad_norm": 4.191121578216553, | |
| "learning_rate": 1.9661192902409948e-05, | |
| "loss": 0.2217186450958252, | |
| "mean_token_accuracy": 0.9471737131476402, | |
| "num_tokens": 4009523.0, | |
| "step": 640 | |
| }, | |
| { | |
| "entropy": 2.0257292181253432, | |
| "epoch": 0.5633802816901409, | |
| "grad_norm": 2.6429009437561035, | |
| "learning_rate": 1.9646551234881537e-05, | |
| "loss": 0.1354218006134033, | |
| "mean_token_accuracy": 0.9583623319864273, | |
| "num_tokens": 4070329.0, | |
| "step": 650 | |
| }, | |
| { | |
| "entropy": 2.041917896270752, | |
| "epoch": 0.5720476706392199, | |
| "grad_norm": 3.2023017406463623, | |
| "learning_rate": 1.9631605538172968e-05, | |
| "loss": 0.199608314037323, | |
| "mean_token_accuracy": 0.9503273338079452, | |
| "num_tokens": 4132785.0, | |
| "step": 660 | |
| }, | |
| { | |
| "entropy": 1.9533647626638413, | |
| "epoch": 0.580715059588299, | |
| "grad_norm": 3.7158589363098145, | |
| "learning_rate": 1.961635628332595e-05, | |
| "loss": 0.19348444938659667, | |
| "mean_token_accuracy": 0.9558726295828819, | |
| "num_tokens": 4199572.0, | |
| "step": 670 | |
| }, | |
| { | |
| "entropy": 2.073412099480629, | |
| "epoch": 0.5893824485373781, | |
| "grad_norm": 2.194398880004883, | |
| "learning_rate": 1.9600803950949384e-05, | |
| "loss": 0.1255653142929077, | |
| "mean_token_accuracy": 0.9656689003109932, | |
| "num_tokens": 4261539.0, | |
| "step": 680 | |
| }, | |
| { | |
| "entropy": 2.062476450204849, | |
| "epoch": 0.5980498374864572, | |
| "grad_norm": 0.843501627445221, | |
| "learning_rate": 1.9584949031204237e-05, | |
| "loss": 0.13029239177703858, | |
| "mean_token_accuracy": 0.9725566118955612, | |
| "num_tokens": 4325121.0, | |
| "step": 690 | |
| }, | |
| { | |
| "entropy": 2.0155109763145447, | |
| "epoch": 0.6067172264355363, | |
| "grad_norm": 2.171780586242676, | |
| "learning_rate": 1.9568792023788083e-05, | |
| "loss": 0.18113304376602174, | |
| "mean_token_accuracy": 0.958047965168953, | |
| "num_tokens": 4383768.0, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 0.6067172264355363, | |
| "eval_entropy": 1.9391062811239441, | |
| "eval_loss": 0.16046689450740814, | |
| "eval_mean_token_accuracy": 0.9575774969153144, | |
| "eval_num_tokens": 4383768.0, | |
| "eval_runtime": 327.4353, | |
| "eval_samples_per_second": 4.911, | |
| "eval_steps_per_second": 0.614, | |
| "step": 700 | |
| }, | |
| { | |
| "entropy": 1.9273906409740449, | |
| "epoch": 0.6153846153846154, | |
| "grad_norm": 4.4711174964904785, | |
| "learning_rate": 1.9552333437919357e-05, | |
| "loss": 0.1300251603126526, | |
| "mean_token_accuracy": 0.9623189747333527, | |
| "num_tokens": 4456736.0, | |
| "step": 710 | |
| }, | |
| { | |
| "entropy": 2.024830573797226, | |
| "epoch": 0.6240520043336945, | |
| "grad_norm": 4.07381534576416, | |
| "learning_rate": 1.9535573792321306e-05, | |
| "loss": 0.1988328814506531, | |
| "mean_token_accuracy": 0.9514750733971595, | |
| "num_tokens": 4518424.0, | |
| "step": 720 | |
| }, | |
| { | |
| "entropy": 2.0818196892738343, | |
| "epoch": 0.6327193932827736, | |
| "grad_norm": 1.8826876878738403, | |
| "learning_rate": 1.951851361520564e-05, | |
| "loss": 0.14210430383682252, | |
| "mean_token_accuracy": 0.9593353673815728, | |
| "num_tokens": 4577017.0, | |
| "step": 730 | |
| }, | |
| { | |
| "entropy": 2.029034098982811, | |
| "epoch": 0.6413867822318526, | |
| "grad_norm": 2.0174059867858887, | |
| "learning_rate": 1.9501153444255876e-05, | |
| "loss": 0.0932635486125946, | |
| "mean_token_accuracy": 0.9816406950354576, | |
| "num_tokens": 4640462.0, | |
| "step": 740 | |
| }, | |
| { | |
| "entropy": 2.059244655072689, | |
| "epoch": 0.6500541711809318, | |
| "grad_norm": 2.1351184844970703, | |
| "learning_rate": 1.9483493826610415e-05, | |
| "loss": 0.12800567150115966, | |
| "mean_token_accuracy": 0.9660168752074242, | |
| "num_tokens": 4705340.0, | |
| "step": 750 | |
| }, | |
| { | |
| "entropy": 2.0459042131900786, | |
| "epoch": 0.6587215601300108, | |
| "grad_norm": 5.086484909057617, | |
| "learning_rate": 1.946553531884527e-05, | |
| "loss": 0.23081181049346924, | |
| "mean_token_accuracy": 0.9424590915441513, | |
| "num_tokens": 4765177.0, | |
| "step": 760 | |
| }, | |
| { | |
| "entropy": 2.0461316615343095, | |
| "epoch": 0.66738894907909, | |
| "grad_norm": 3.3382718563079834, | |
| "learning_rate": 1.9447278486956544e-05, | |
| "loss": 0.14905912876129152, | |
| "mean_token_accuracy": 0.9569886341691017, | |
| "num_tokens": 4834296.0, | |
| "step": 770 | |
| }, | |
| { | |
| "entropy": 2.1199437886476518, | |
| "epoch": 0.676056338028169, | |
| "grad_norm": 2.4870541095733643, | |
| "learning_rate": 1.9428723906342586e-05, | |
| "loss": 0.15288684368133545, | |
| "mean_token_accuracy": 0.9573053807020188, | |
| "num_tokens": 4889171.0, | |
| "step": 780 | |
| }, | |
| { | |
| "entropy": 2.0783461153507234, | |
| "epoch": 0.6847237269772481, | |
| "grad_norm": 0.9525867700576782, | |
| "learning_rate": 1.9409872161785846e-05, | |
| "loss": 0.10859833955764771, | |
| "mean_token_accuracy": 0.9734508141875267, | |
| "num_tokens": 4947751.0, | |
| "step": 790 | |
| }, | |
| { | |
| "entropy": 1.9960304468870163, | |
| "epoch": 0.6933911159263272, | |
| "grad_norm": 1.0429903268814087, | |
| "learning_rate": 1.939072384743447e-05, | |
| "loss": 0.17450170516967772, | |
| "mean_token_accuracy": 0.9435808345675468, | |
| "num_tokens": 5014246.0, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.6933911159263272, | |
| "eval_entropy": 1.9779095216770077, | |
| "eval_loss": 0.16052106022834778, | |
| "eval_mean_token_accuracy": 0.9521936910662485, | |
| "eval_num_tokens": 5014246.0, | |
| "eval_runtime": 327.7358, | |
| "eval_samples_per_second": 4.906, | |
| "eval_steps_per_second": 0.613, | |
| "step": 800 | |
| }, | |
| { | |
| "entropy": 2.094706800580025, | |
| "epoch": 0.7020585048754063, | |
| "grad_norm": 2.773972272872925, | |
| "learning_rate": 1.9371279566783546e-05, | |
| "loss": 0.16905949115753174, | |
| "mean_token_accuracy": 0.9590677320957184, | |
| "num_tokens": 5067941.0, | |
| "step": 810 | |
| }, | |
| { | |
| "entropy": 2.0422832757234572, | |
| "epoch": 0.7107258938244854, | |
| "grad_norm": 0.8871009349822998, | |
| "learning_rate": 1.9351539932656095e-05, | |
| "loss": 0.14554331302642823, | |
| "mean_token_accuracy": 0.9639958038926124, | |
| "num_tokens": 5121736.0, | |
| "step": 820 | |
| }, | |
| { | |
| "entropy": 2.066793379187584, | |
| "epoch": 0.7193932827735645, | |
| "grad_norm": 1.235823392868042, | |
| "learning_rate": 1.9331505567183765e-05, | |
| "loss": 0.1522287368774414, | |
| "mean_token_accuracy": 0.9607374981045723, | |
| "num_tokens": 5186693.0, | |
| "step": 830 | |
| }, | |
| { | |
| "entropy": 2.0238248884677885, | |
| "epoch": 0.7280606717226435, | |
| "grad_norm": 1.0951995849609375, | |
| "learning_rate": 1.9311177101787203e-05, | |
| "loss": 0.18216453790664672, | |
| "mean_token_accuracy": 0.9582652196288108, | |
| "num_tokens": 5245808.0, | |
| "step": 840 | |
| }, | |
| { | |
| "entropy": 2.0323809564113615, | |
| "epoch": 0.7367280606717227, | |
| "grad_norm": 4.650373935699463, | |
| "learning_rate": 1.929055517715619e-05, | |
| "loss": 0.1563056468963623, | |
| "mean_token_accuracy": 0.9584650948643685, | |
| "num_tokens": 5310692.0, | |
| "step": 850 | |
| }, | |
| { | |
| "entropy": 2.0072476893663405, | |
| "epoch": 0.7453954496208017, | |
| "grad_norm": 3.282588481903076, | |
| "learning_rate": 1.9269640443229406e-05, | |
| "loss": 0.1251569867134094, | |
| "mean_token_accuracy": 0.9650194570422173, | |
| "num_tokens": 5368216.0, | |
| "step": 860 | |
| }, | |
| { | |
| "entropy": 2.0677698493003844, | |
| "epoch": 0.7540628385698809, | |
| "grad_norm": 3.888256072998047, | |
| "learning_rate": 1.9248433559173974e-05, | |
| "loss": 0.14851419925689696, | |
| "mean_token_accuracy": 0.9558604061603546, | |
| "num_tokens": 5425337.0, | |
| "step": 870 | |
| }, | |
| { | |
| "entropy": 2.028371325135231, | |
| "epoch": 0.7627302275189599, | |
| "grad_norm": 4.474874496459961, | |
| "learning_rate": 1.9226935193364672e-05, | |
| "loss": 0.09598046541213989, | |
| "mean_token_accuracy": 0.9639655843377113, | |
| "num_tokens": 5493667.0, | |
| "step": 880 | |
| }, | |
| { | |
| "entropy": 2.077066546678543, | |
| "epoch": 0.771397616468039, | |
| "grad_norm": 4.779897689819336, | |
| "learning_rate": 1.920514602336288e-05, | |
| "loss": 0.1583351492881775, | |
| "mean_token_accuracy": 0.969876304268837, | |
| "num_tokens": 5554367.0, | |
| "step": 890 | |
| }, | |
| { | |
| "entropy": 2.10542468726635, | |
| "epoch": 0.7800650054171181, | |
| "grad_norm": 5.164394855499268, | |
| "learning_rate": 1.918306673589521e-05, | |
| "loss": 0.1434742331504822, | |
| "mean_token_accuracy": 0.9704080358147621, | |
| "num_tokens": 5611752.0, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 0.7800650054171181, | |
| "eval_entropy": 1.9566984473176263, | |
| "eval_loss": 0.1484634131193161, | |
| "eval_mean_token_accuracy": 0.9622589533601827, | |
| "eval_num_tokens": 5611752.0, | |
| "eval_runtime": 327.9589, | |
| "eval_samples_per_second": 4.903, | |
| "eval_steps_per_second": 0.613, | |
| "step": 900 | |
| }, | |
| { | |
| "entropy": 2.017557808756828, | |
| "epoch": 0.7887323943661971, | |
| "grad_norm": 0.5321738123893738, | |
| "learning_rate": 1.916069802683188e-05, | |
| "loss": 0.14997100830078125, | |
| "mean_token_accuracy": 0.9603116348385811, | |
| "num_tokens": 5672084.0, | |
| "step": 910 | |
| }, | |
| { | |
| "entropy": 2.0164162307977676, | |
| "epoch": 0.7973997833152763, | |
| "grad_norm": 5.9305009841918945, | |
| "learning_rate": 1.913804060116477e-05, | |
| "loss": 0.1742601990699768, | |
| "mean_token_accuracy": 0.9420990094542503, | |
| "num_tokens": 5742156.0, | |
| "step": 920 | |
| }, | |
| { | |
| "entropy": 2.0990718007087708, | |
| "epoch": 0.8060671722643553, | |
| "grad_norm": 2.7394776344299316, | |
| "learning_rate": 1.91150951729852e-05, | |
| "loss": 0.10954513549804687, | |
| "mean_token_accuracy": 0.9662265390157699, | |
| "num_tokens": 5795887.0, | |
| "step": 930 | |
| }, | |
| { | |
| "entropy": 2.0060137644410134, | |
| "epoch": 0.8147345612134345, | |
| "grad_norm": 6.107972621917725, | |
| "learning_rate": 1.9091862465461435e-05, | |
| "loss": 0.15947246551513672, | |
| "mean_token_accuracy": 0.9661846026778221, | |
| "num_tokens": 5863543.0, | |
| "step": 940 | |
| }, | |
| { | |
| "entropy": 2.028472700715065, | |
| "epoch": 0.8234019501625135, | |
| "grad_norm": 3.5397908687591553, | |
| "learning_rate": 1.9068343210815895e-05, | |
| "loss": 0.11814491748809815, | |
| "mean_token_accuracy": 0.9662217140197754, | |
| "num_tokens": 5920612.0, | |
| "step": 950 | |
| }, | |
| { | |
| "entropy": 1.9094608053565025, | |
| "epoch": 0.8320693391115926, | |
| "grad_norm": 2.9836032390594482, | |
| "learning_rate": 1.9044538150302054e-05, | |
| "loss": 0.0739125669002533, | |
| "mean_token_accuracy": 0.9773468017578125, | |
| "num_tokens": 5992314.0, | |
| "step": 960 | |
| }, | |
| { | |
| "entropy": 2.031349629163742, | |
| "epoch": 0.8407367280606717, | |
| "grad_norm": 1.5363432168960571, | |
| "learning_rate": 1.902044803418111e-05, | |
| "loss": 0.10442560911178589, | |
| "mean_token_accuracy": 0.9752393007278443, | |
| "num_tokens": 6057639.0, | |
| "step": 970 | |
| }, | |
| { | |
| "entropy": 2.052021104097366, | |
| "epoch": 0.8494041170097508, | |
| "grad_norm": 1.9379785060882568, | |
| "learning_rate": 1.8996073621698316e-05, | |
| "loss": 0.13370474576950073, | |
| "mean_token_accuracy": 0.9722858428955078, | |
| "num_tokens": 6125691.0, | |
| "step": 980 | |
| }, | |
| { | |
| "entropy": 2.0630032390356066, | |
| "epoch": 0.8580715059588299, | |
| "grad_norm": 2.8717305660247803, | |
| "learning_rate": 1.8971415681059064e-05, | |
| "loss": 0.08845771551132202, | |
| "mean_token_accuracy": 0.9745254084467888, | |
| "num_tokens": 6180422.0, | |
| "step": 990 | |
| }, | |
| { | |
| "entropy": 1.9643850460648538, | |
| "epoch": 0.866738894907909, | |
| "grad_norm": 2.609376907348633, | |
| "learning_rate": 1.8946474989404662e-05, | |
| "loss": 0.11373393535614014, | |
| "mean_token_accuracy": 0.9662645876407623, | |
| "num_tokens": 6252953.0, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.866738894907909, | |
| "eval_entropy": 1.9493645275410134, | |
| "eval_loss": 0.1559806615114212, | |
| "eval_mean_token_accuracy": 0.9615354849331414, | |
| "eval_num_tokens": 6252953.0, | |
| "eval_runtime": 327.6765, | |
| "eval_samples_per_second": 4.907, | |
| "eval_steps_per_second": 0.613, | |
| "step": 1000 | |
| }, | |
| { | |
| "entropy": 1.9920239925384522, | |
| "epoch": 0.875406283856988, | |
| "grad_norm": 2.1242737770080566, | |
| "learning_rate": 1.892125233278785e-05, | |
| "loss": 0.24173307418823242, | |
| "mean_token_accuracy": 0.9527133107185364, | |
| "num_tokens": 6315662.0, | |
| "step": 1010 | |
| }, | |
| { | |
| "entropy": 2.032253223657608, | |
| "epoch": 0.8840736728060672, | |
| "grad_norm": 2.7001326084136963, | |
| "learning_rate": 1.8895748506148028e-05, | |
| "loss": 0.1353329300880432, | |
| "mean_token_accuracy": 0.967973954975605, | |
| "num_tokens": 6386699.0, | |
| "step": 1020 | |
| }, | |
| { | |
| "entropy": 2.0086484402418137, | |
| "epoch": 0.8927410617551462, | |
| "grad_norm": 1.1297107934951782, | |
| "learning_rate": 1.886996431328619e-05, | |
| "loss": 0.07529502511024475, | |
| "mean_token_accuracy": 0.9724522307515144, | |
| "num_tokens": 6446533.0, | |
| "step": 1030 | |
| }, | |
| { | |
| "entropy": 2.0415013134479523, | |
| "epoch": 0.9014084507042254, | |
| "grad_norm": 5.55093240737915, | |
| "learning_rate": 1.8843900566839606e-05, | |
| "loss": 0.08251296877861022, | |
| "mean_token_accuracy": 0.9786079153418541, | |
| "num_tokens": 6513718.0, | |
| "step": 1040 | |
| }, | |
| { | |
| "entropy": 1.9764947205781938, | |
| "epoch": 0.9100758396533044, | |
| "grad_norm": 1.4542205333709717, | |
| "learning_rate": 1.881755808825619e-05, | |
| "loss": 0.09182056784629822, | |
| "mean_token_accuracy": 0.9683352947235108, | |
| "num_tokens": 6589309.0, | |
| "step": 1050 | |
| }, | |
| { | |
| "entropy": 2.1108569860458375, | |
| "epoch": 0.9187432286023836, | |
| "grad_norm": 1.6818881034851074, | |
| "learning_rate": 1.879093770776864e-05, | |
| "loss": 0.10508890151977539, | |
| "mean_token_accuracy": 0.9706028968095779, | |
| "num_tokens": 6645154.0, | |
| "step": 1060 | |
| }, | |
| { | |
| "entropy": 2.0166300892829896, | |
| "epoch": 0.9274106175514626, | |
| "grad_norm": 1.3823227882385254, | |
| "learning_rate": 1.8764040264368234e-05, | |
| "loss": 0.09460273385047913, | |
| "mean_token_accuracy": 0.9628641813993454, | |
| "num_tokens": 6713987.0, | |
| "step": 1070 | |
| }, | |
| { | |
| "entropy": 2.1063819110393522, | |
| "epoch": 0.9360780065005417, | |
| "grad_norm": 6.772284507751465, | |
| "learning_rate": 1.8736866605778432e-05, | |
| "loss": 0.12469170093536378, | |
| "mean_token_accuracy": 0.9483507961034775, | |
| "num_tokens": 6772582.0, | |
| "step": 1080 | |
| }, | |
| { | |
| "entropy": 2.0919911056756972, | |
| "epoch": 0.9447453954496208, | |
| "grad_norm": 1.6543307304382324, | |
| "learning_rate": 1.870941758842811e-05, | |
| "loss": 0.09687562584877014, | |
| "mean_token_accuracy": 0.97865249812603, | |
| "num_tokens": 6830797.0, | |
| "step": 1090 | |
| }, | |
| { | |
| "entropy": 2.098991483449936, | |
| "epoch": 0.9534127843986999, | |
| "grad_norm": 2.7293362617492676, | |
| "learning_rate": 1.8681694077424613e-05, | |
| "loss": 0.08977670073509217, | |
| "mean_token_accuracy": 0.9780241951346398, | |
| "num_tokens": 6892230.0, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 0.9534127843986999, | |
| "eval_entropy": 2.0070505842047544, | |
| "eval_loss": 0.14140334725379944, | |
| "eval_mean_token_accuracy": 0.9657606870973882, | |
| "eval_num_tokens": 6892230.0, | |
| "eval_runtime": 327.6001, | |
| "eval_samples_per_second": 4.908, | |
| "eval_steps_per_second": 0.614, | |
| "step": 1100 | |
| }, | |
| { | |
| "entropy": 2.031548282504082, | |
| "epoch": 0.962080173347779, | |
| "grad_norm": 4.61448335647583, | |
| "learning_rate": 1.8653696946526453e-05, | |
| "loss": 0.21447787284851075, | |
| "mean_token_accuracy": 0.9273400843143463, | |
| "num_tokens": 6961253.0, | |
| "step": 1110 | |
| }, | |
| { | |
| "entropy": 2.145294892787933, | |
| "epoch": 0.9707475622968581, | |
| "grad_norm": 3.039484739303589, | |
| "learning_rate": 1.8625427078115798e-05, | |
| "loss": 0.0884899377822876, | |
| "mean_token_accuracy": 0.9799038738012313, | |
| "num_tokens": 7017065.0, | |
| "step": 1120 | |
| }, | |
| { | |
| "entropy": 2.107818600535393, | |
| "epoch": 0.9794149512459371, | |
| "grad_norm": 0.6422417759895325, | |
| "learning_rate": 1.8596885363170645e-05, | |
| "loss": 0.13402427434921266, | |
| "mean_token_accuracy": 0.9699044972658157, | |
| "num_tokens": 7075829.0, | |
| "step": 1130 | |
| }, | |
| { | |
| "entropy": 2.059667307138443, | |
| "epoch": 0.9880823401950163, | |
| "grad_norm": 2.9093730449676514, | |
| "learning_rate": 1.8568072701236747e-05, | |
| "loss": 0.16023958921432496, | |
| "mean_token_accuracy": 0.9600200474262237, | |
| "num_tokens": 7137365.0, | |
| "step": 1140 | |
| }, | |
| { | |
| "entropy": 2.160347416996956, | |
| "epoch": 0.9967497291440953, | |
| "grad_norm": 3.1662862300872803, | |
| "learning_rate": 1.8538990000399263e-05, | |
| "loss": 0.22539846897125243, | |
| "mean_token_accuracy": 0.9572510078549386, | |
| "num_tokens": 7196582.0, | |
| "step": 1150 | |
| }, | |
| { | |
| "entropy": 2.0696292229187794, | |
| "epoch": 1.0052004333694475, | |
| "grad_norm": 2.288025140762329, | |
| "learning_rate": 1.850963817725413e-05, | |
| "loss": 0.11503632068634033, | |
| "mean_token_accuracy": 0.9689550736011603, | |
| "num_tokens": 7256906.0, | |
| "step": 1160 | |
| }, | |
| { | |
| "entropy": 2.1042013496160505, | |
| "epoch": 1.0138678223185265, | |
| "grad_norm": 3.8589515686035156, | |
| "learning_rate": 1.8480018156879184e-05, | |
| "loss": 0.09237539768218994, | |
| "mean_token_accuracy": 0.9765888974070549, | |
| "num_tokens": 7314179.0, | |
| "step": 1170 | |
| }, | |
| { | |
| "entropy": 2.0591933131217957, | |
| "epoch": 1.0225352112676056, | |
| "grad_norm": 3.412147045135498, | |
| "learning_rate": 1.8450130872804995e-05, | |
| "loss": 0.0972133755683899, | |
| "mean_token_accuracy": 0.9700871393084526, | |
| "num_tokens": 7377659.0, | |
| "step": 1180 | |
| }, | |
| { | |
| "entropy": 2.0358568876981735, | |
| "epoch": 1.0312026002166848, | |
| "grad_norm": 1.8209773302078247, | |
| "learning_rate": 1.8419977266985466e-05, | |
| "loss": 0.10635190010070801, | |
| "mean_token_accuracy": 0.9710655510425568, | |
| "num_tokens": 7448951.0, | |
| "step": 1190 | |
| }, | |
| { | |
| "entropy": 2.139003211259842, | |
| "epoch": 1.039869989165764, | |
| "grad_norm": 0.22012463212013245, | |
| "learning_rate": 1.83895582897681e-05, | |
| "loss": 0.07087588906288148, | |
| "mean_token_accuracy": 0.9820687800645829, | |
| "num_tokens": 7507884.0, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 1.039869989165764, | |
| "eval_entropy": 1.998491422453923, | |
| "eval_loss": 0.11934716999530792, | |
| "eval_mean_token_accuracy": 0.9696379659780815, | |
| "eval_num_tokens": 7507884.0, | |
| "eval_runtime": 327.528, | |
| "eval_samples_per_second": 4.91, | |
| "eval_steps_per_second": 0.614, | |
| "step": 1200 | |
| }, | |
| { | |
| "entropy": 2.047052562236786, | |
| "epoch": 1.0485373781148428, | |
| "grad_norm": 2.6051576137542725, | |
| "learning_rate": 1.8358874899864114e-05, | |
| "loss": 0.08912789225578308, | |
| "mean_token_accuracy": 0.9771837398409844, | |
| "num_tokens": 7568084.0, | |
| "step": 1210 | |
| }, | |
| { | |
| "entropy": 2.047335183620453, | |
| "epoch": 1.057204767063922, | |
| "grad_norm": 3.3506662845611572, | |
| "learning_rate": 1.8327928064318157e-05, | |
| "loss": 0.0860203206539154, | |
| "mean_token_accuracy": 0.9751673907041549, | |
| "num_tokens": 7627314.0, | |
| "step": 1220 | |
| }, | |
| { | |
| "entropy": 2.1224594831466677, | |
| "epoch": 1.0658721560130011, | |
| "grad_norm": 4.894758224487305, | |
| "learning_rate": 1.8296718758477882e-05, | |
| "loss": 0.05694900751113892, | |
| "mean_token_accuracy": 0.971023240685463, | |
| "num_tokens": 7687861.0, | |
| "step": 1230 | |
| }, | |
| { | |
| "entropy": 1.9626843601465225, | |
| "epoch": 1.0745395449620803, | |
| "grad_norm": 2.579737901687622, | |
| "learning_rate": 1.826524796596318e-05, | |
| "loss": 0.10832076072692871, | |
| "mean_token_accuracy": 0.9784040197730064, | |
| "num_tokens": 7760668.0, | |
| "step": 1240 | |
| }, | |
| { | |
| "entropy": 1.968853595852852, | |
| "epoch": 1.0832069339111592, | |
| "grad_norm": 2.3511769771575928, | |
| "learning_rate": 1.823351667863518e-05, | |
| "loss": 0.15547066926956177, | |
| "mean_token_accuracy": 0.9642201095819474, | |
| "num_tokens": 7827206.0, | |
| "step": 1250 | |
| }, | |
| { | |
| "entropy": 2.056541362404823, | |
| "epoch": 1.0918743228602383, | |
| "grad_norm": 2.1804311275482178, | |
| "learning_rate": 1.8201525896565e-05, | |
| "loss": 0.10602462291717529, | |
| "mean_token_accuracy": 0.9716919779777526, | |
| "num_tokens": 7885020.0, | |
| "step": 1260 | |
| }, | |
| { | |
| "entropy": 1.9817122548818589, | |
| "epoch": 1.1005417118093175, | |
| "grad_norm": 0.2855832576751709, | |
| "learning_rate": 1.8169276628002228e-05, | |
| "loss": 0.1441387414932251, | |
| "mean_token_accuracy": 0.9583184272050858, | |
| "num_tokens": 7954015.0, | |
| "step": 1270 | |
| }, | |
| { | |
| "entropy": 2.0565784901380537, | |
| "epoch": 1.1092091007583966, | |
| "grad_norm": 4.35746955871582, | |
| "learning_rate": 1.8136769889343128e-05, | |
| "loss": 0.1163863182067871, | |
| "mean_token_accuracy": 0.9769072517752647, | |
| "num_tokens": 8017014.0, | |
| "step": 1280 | |
| }, | |
| { | |
| "entropy": 2.069455534219742, | |
| "epoch": 1.1178764897074756, | |
| "grad_norm": 3.1686489582061768, | |
| "learning_rate": 1.810400670509862e-05, | |
| "loss": 0.04684387743473053, | |
| "mean_token_accuracy": 0.9839098215103149, | |
| "num_tokens": 8073602.0, | |
| "step": 1290 | |
| }, | |
| { | |
| "entropy": 1.991150015592575, | |
| "epoch": 1.1265438786565547, | |
| "grad_norm": 5.245935440063477, | |
| "learning_rate": 1.8070988107861996e-05, | |
| "loss": 0.12618616819381714, | |
| "mean_token_accuracy": 0.9685941189527512, | |
| "num_tokens": 8136794.0, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 1.1265438786565547, | |
| "eval_entropy": 1.9715949030064825, | |
| "eval_loss": 0.12539811432361603, | |
| "eval_mean_token_accuracy": 0.964166374645423, | |
| "eval_num_tokens": 8136794.0, | |
| "eval_runtime": 327.6705, | |
| "eval_samples_per_second": 4.907, | |
| "eval_steps_per_second": 0.613, | |
| "step": 1300 | |
| }, | |
| { | |
| "entropy": 2.136713647842407, | |
| "epoch": 1.1352112676056338, | |
| "grad_norm": 2.6332850456237793, | |
| "learning_rate": 1.8037715138276356e-05, | |
| "loss": 0.08332991600036621, | |
| "mean_token_accuracy": 0.9834440797567368, | |
| "num_tokens": 8186732.0, | |
| "step": 1310 | |
| }, | |
| { | |
| "entropy": 2.0103059858083725, | |
| "epoch": 1.1438786565547128, | |
| "grad_norm": 2.718291997909546, | |
| "learning_rate": 1.8004188845001837e-05, | |
| "loss": 0.08337950706481934, | |
| "mean_token_accuracy": 0.9742418512701988, | |
| "num_tokens": 8251092.0, | |
| "step": 1320 | |
| }, | |
| { | |
| "entropy": 1.9932494521141053, | |
| "epoch": 1.152546045503792, | |
| "grad_norm": 3.646721601486206, | |
| "learning_rate": 1.797041028468254e-05, | |
| "loss": 0.15116094350814818, | |
| "mean_token_accuracy": 0.9642645418643951, | |
| "num_tokens": 8314924.0, | |
| "step": 1330 | |
| }, | |
| { | |
| "entropy": 2.081474080681801, | |
| "epoch": 1.161213434452871, | |
| "grad_norm": 0.9599646925926208, | |
| "learning_rate": 1.7936380521913227e-05, | |
| "loss": 0.04085415005683899, | |
| "mean_token_accuracy": 0.9839913368225097, | |
| "num_tokens": 8370143.0, | |
| "step": 1340 | |
| }, | |
| { | |
| "entropy": 1.983850082755089, | |
| "epoch": 1.1698808234019502, | |
| "grad_norm": 1.3555337190628052, | |
| "learning_rate": 1.7902100629205793e-05, | |
| "loss": 0.08805139660835266, | |
| "mean_token_accuracy": 0.9821525901556015, | |
| "num_tokens": 8440802.0, | |
| "step": 1350 | |
| }, | |
| { | |
| "entropy": 2.0713098883628844, | |
| "epoch": 1.1785482123510294, | |
| "grad_norm": 3.1760222911834717, | |
| "learning_rate": 1.7867571686955435e-05, | |
| "loss": 0.11011135578155518, | |
| "mean_token_accuracy": 0.9650946885347367, | |
| "num_tokens": 8503577.0, | |
| "step": 1360 | |
| }, | |
| { | |
| "entropy": 2.00400799959898, | |
| "epoch": 1.1872156013001083, | |
| "grad_norm": 1.7475781440734863, | |
| "learning_rate": 1.7832794783406627e-05, | |
| "loss": 0.09046050310134887, | |
| "mean_token_accuracy": 0.9751720637083053, | |
| "num_tokens": 8564681.0, | |
| "step": 1370 | |
| }, | |
| { | |
| "entropy": 2.052886575460434, | |
| "epoch": 1.1958829902491874, | |
| "grad_norm": 1.0036333799362183, | |
| "learning_rate": 1.7797771014618798e-05, | |
| "loss": 0.11622474193572999, | |
| "mean_token_accuracy": 0.9750452309846878, | |
| "num_tokens": 8626076.0, | |
| "step": 1380 | |
| }, | |
| { | |
| "entropy": 2.0878810614347456, | |
| "epoch": 1.2045503791982666, | |
| "grad_norm": 4.102039813995361, | |
| "learning_rate": 1.77625014844318e-05, | |
| "loss": 0.10430421829223632, | |
| "mean_token_accuracy": 0.9714325606822968, | |
| "num_tokens": 8684962.0, | |
| "step": 1390 | |
| }, | |
| { | |
| "entropy": 2.0384886085987093, | |
| "epoch": 1.2132177681473455, | |
| "grad_norm": 1.0469868183135986, | |
| "learning_rate": 1.7726987304431125e-05, | |
| "loss": 0.05419512987136841, | |
| "mean_token_accuracy": 0.982357631623745, | |
| "num_tokens": 8748790.0, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 1.2132177681473455, | |
| "eval_entropy": 1.9552279841247482, | |
| "eval_loss": 0.12215632200241089, | |
| "eval_mean_token_accuracy": 0.9683096506702367, | |
| "eval_num_tokens": 8748790.0, | |
| "eval_runtime": 327.5547, | |
| "eval_samples_per_second": 4.909, | |
| "eval_steps_per_second": 0.614, | |
| "step": 1400 | |
| }, | |
| { | |
| "entropy": 1.953641840815544, | |
| "epoch": 1.2218851570964246, | |
| "grad_norm": 0.5614034533500671, | |
| "learning_rate": 1.7691229593912855e-05, | |
| "loss": 0.05820891261100769, | |
| "mean_token_accuracy": 0.9764899387955666, | |
| "num_tokens": 8814421.0, | |
| "step": 1410 | |
| }, | |
| { | |
| "entropy": 2.0551287651062013, | |
| "epoch": 1.2305525460455038, | |
| "grad_norm": 2.177788734436035, | |
| "learning_rate": 1.7655229479848396e-05, | |
| "loss": 0.07185115218162537, | |
| "mean_token_accuracy": 0.9787142857909202, | |
| "num_tokens": 8868678.0, | |
| "step": 1420 | |
| }, | |
| { | |
| "entropy": 1.9916139125823975, | |
| "epoch": 1.239219934994583, | |
| "grad_norm": 2.7501561641693115, | |
| "learning_rate": 1.7618988096848957e-05, | |
| "loss": 0.0644925594329834, | |
| "mean_token_accuracy": 0.9745761170983315, | |
| "num_tokens": 8938006.0, | |
| "step": 1430 | |
| }, | |
| { | |
| "entropy": 1.9660134196281434, | |
| "epoch": 1.247887323943662, | |
| "grad_norm": 0.21380360424518585, | |
| "learning_rate": 1.7582506587129794e-05, | |
| "loss": 0.10330332517623901, | |
| "mean_token_accuracy": 0.9776182726025582, | |
| "num_tokens": 9008588.0, | |
| "step": 1440 | |
| }, | |
| { | |
| "entropy": 2.0498579114675524, | |
| "epoch": 1.256554712892741, | |
| "grad_norm": 0.8262104392051697, | |
| "learning_rate": 1.7545786100474197e-05, | |
| "loss": 0.07196399569511414, | |
| "mean_token_accuracy": 0.976461161673069, | |
| "num_tokens": 9071525.0, | |
| "step": 1450 | |
| }, | |
| { | |
| "entropy": 2.0368919670581818, | |
| "epoch": 1.2652221018418202, | |
| "grad_norm": 4.542933940887451, | |
| "learning_rate": 1.7508827794197283e-05, | |
| "loss": 0.1121648907661438, | |
| "mean_token_accuracy": 0.9739218279719353, | |
| "num_tokens": 9128401.0, | |
| "step": 1460 | |
| }, | |
| { | |
| "entropy": 2.028754585981369, | |
| "epoch": 1.2738894907908993, | |
| "grad_norm": 3.789047956466675, | |
| "learning_rate": 1.747163283310948e-05, | |
| "loss": 0.07412697076797485, | |
| "mean_token_accuracy": 0.9807208150625228, | |
| "num_tokens": 9197272.0, | |
| "step": 1470 | |
| }, | |
| { | |
| "entropy": 2.0691492050886153, | |
| "epoch": 1.2825568797399782, | |
| "grad_norm": 4.7594380378723145, | |
| "learning_rate": 1.7434202389479846e-05, | |
| "loss": 0.0705658733844757, | |
| "mean_token_accuracy": 0.9594802007079124, | |
| "num_tokens": 9257267.0, | |
| "step": 1480 | |
| }, | |
| { | |
| "entropy": 2.082161045074463, | |
| "epoch": 1.2912242686890574, | |
| "grad_norm": 2.5111472606658936, | |
| "learning_rate": 1.739653764299912e-05, | |
| "loss": 0.09044097065925598, | |
| "mean_token_accuracy": 0.9694541215896606, | |
| "num_tokens": 9319539.0, | |
| "step": 1490 | |
| }, | |
| { | |
| "entropy": 2.0065703094005585, | |
| "epoch": 1.2998916576381365, | |
| "grad_norm": 2.8309035301208496, | |
| "learning_rate": 1.7358639780742523e-05, | |
| "loss": 0.07192415595054627, | |
| "mean_token_accuracy": 0.9744586929678917, | |
| "num_tokens": 9374879.0, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 1.2998916576381365, | |
| "eval_entropy": 1.9755405430770039, | |
| "eval_loss": 0.11345293372869492, | |
| "eval_mean_token_accuracy": 0.9704583070764494, | |
| "eval_num_tokens": 9374879.0, | |
| "eval_runtime": 327.3007, | |
| "eval_samples_per_second": 4.913, | |
| "eval_steps_per_second": 0.614, | |
| "step": 1500 | |
| }, | |
| { | |
| "entropy": 2.0670559823513033, | |
| "epoch": 1.3085590465872157, | |
| "grad_norm": 0.36768296360969543, | |
| "learning_rate": 1.732050999713236e-05, | |
| "loss": 0.07674946188926697, | |
| "mean_token_accuracy": 0.9863375291228295, | |
| "num_tokens": 9434504.0, | |
| "step": 1510 | |
| }, | |
| { | |
| "entropy": 2.001679763197899, | |
| "epoch": 1.3172264355362948, | |
| "grad_norm": 1.7141518592834473, | |
| "learning_rate": 1.728214949390038e-05, | |
| "loss": 0.07157499194145203, | |
| "mean_token_accuracy": 0.9796392112970352, | |
| "num_tokens": 9491287.0, | |
| "step": 1520 | |
| }, | |
| { | |
| "entropy": 2.0744961857795716, | |
| "epoch": 1.3258938244853737, | |
| "grad_norm": 2.1506600379943848, | |
| "learning_rate": 1.7243559480049895e-05, | |
| "loss": 0.1661256194114685, | |
| "mean_token_accuracy": 0.9499395877122879, | |
| "num_tokens": 9547172.0, | |
| "step": 1530 | |
| }, | |
| { | |
| "entropy": 2.0488713175058364, | |
| "epoch": 1.3345612134344529, | |
| "grad_norm": 1.0758910179138184, | |
| "learning_rate": 1.7204741171817662e-05, | |
| "loss": 0.13161916732788087, | |
| "mean_token_accuracy": 0.9632299363613128, | |
| "num_tokens": 9609537.0, | |
| "step": 1540 | |
| }, | |
| { | |
| "entropy": 2.0280631333589554, | |
| "epoch": 1.343228602383532, | |
| "grad_norm": 7.010381698608398, | |
| "learning_rate": 1.716569579263558e-05, | |
| "loss": 0.12925589084625244, | |
| "mean_token_accuracy": 0.9689023286104202, | |
| "num_tokens": 9664019.0, | |
| "step": 1550 | |
| }, | |
| { | |
| "entropy": 2.079831117391586, | |
| "epoch": 1.351895991332611, | |
| "grad_norm": 4.380460262298584, | |
| "learning_rate": 1.7126424573092106e-05, | |
| "loss": 0.1093141794204712, | |
| "mean_token_accuracy": 0.9770100638270378, | |
| "num_tokens": 9724394.0, | |
| "step": 1560 | |
| }, | |
| { | |
| "entropy": 2.0715120315551756, | |
| "epoch": 1.36056338028169, | |
| "grad_norm": 1.3284443616867065, | |
| "learning_rate": 1.7086928750893475e-05, | |
| "loss": 0.061691224575042725, | |
| "mean_token_accuracy": 0.9804880693554878, | |
| "num_tokens": 9785387.0, | |
| "step": 1570 | |
| }, | |
| { | |
| "entropy": 2.0884166300296783, | |
| "epoch": 1.3692307692307693, | |
| "grad_norm": 5.367604732513428, | |
| "learning_rate": 1.7047209570824715e-05, | |
| "loss": 0.11438063383102418, | |
| "mean_token_accuracy": 0.9706978917121887, | |
| "num_tokens": 9851203.0, | |
| "step": 1580 | |
| }, | |
| { | |
| "entropy": 2.0226283043622972, | |
| "epoch": 1.3778981581798484, | |
| "grad_norm": 3.4851460456848145, | |
| "learning_rate": 1.7007268284710384e-05, | |
| "loss": 0.07323808670043945, | |
| "mean_token_accuracy": 0.9414705485105515, | |
| "num_tokens": 9917487.0, | |
| "step": 1590 | |
| }, | |
| { | |
| "entropy": 2.0937221944332123, | |
| "epoch": 1.3865655471289275, | |
| "grad_norm": 3.1039235591888428, | |
| "learning_rate": 1.6967106151375127e-05, | |
| "loss": 0.08786031603813171, | |
| "mean_token_accuracy": 0.9706021770834923, | |
| "num_tokens": 9975291.0, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 1.3865655471289275, | |
| "eval_entropy": 1.9869690884405107, | |
| "eval_loss": 0.10875136405229568, | |
| "eval_mean_token_accuracy": 0.9710013614365117, | |
| "eval_num_tokens": 9975291.0, | |
| "eval_runtime": 327.3446, | |
| "eval_samples_per_second": 4.912, | |
| "eval_steps_per_second": 0.614, | |
| "step": 1600 | |
| }, | |
| { | |
| "entropy": 2.1072473585605622, | |
| "epoch": 1.3952329360780065, | |
| "grad_norm": 0.9677545428276062, | |
| "learning_rate": 1.692672443660401e-05, | |
| "loss": 0.055405884981155396, | |
| "mean_token_accuracy": 0.9801833376288414, | |
| "num_tokens": 10027147.0, | |
| "step": 1610 | |
| }, | |
| { | |
| "entropy": 2.044584667682648, | |
| "epoch": 1.4039003250270856, | |
| "grad_norm": 0.11175656318664551, | |
| "learning_rate": 1.6886124413102613e-05, | |
| "loss": 0.07465912699699402, | |
| "mean_token_accuracy": 0.9422569587826729, | |
| "num_tokens": 10092663.0, | |
| "step": 1620 | |
| }, | |
| { | |
| "entropy": 2.1110137164592744, | |
| "epoch": 1.4125677139761648, | |
| "grad_norm": 2.970170259475708, | |
| "learning_rate": 1.684530736045694e-05, | |
| "loss": 0.0848125159740448, | |
| "mean_token_accuracy": 0.9740940272808075, | |
| "num_tokens": 10154170.0, | |
| "step": 1630 | |
| }, | |
| { | |
| "entropy": 1.990675364434719, | |
| "epoch": 1.4212351029252437, | |
| "grad_norm": 0.8938102126121521, | |
| "learning_rate": 1.680427456509306e-05, | |
| "loss": 0.04920684993267059, | |
| "mean_token_accuracy": 0.9847660586237907, | |
| "num_tokens": 10227250.0, | |
| "step": 1640 | |
| }, | |
| { | |
| "entropy": 1.9731363147497176, | |
| "epoch": 1.4299024918743228, | |
| "grad_norm": 1.0118954181671143, | |
| "learning_rate": 1.676302732023659e-05, | |
| "loss": 0.13038522005081177, | |
| "mean_token_accuracy": 0.9758126527070999, | |
| "num_tokens": 10292153.0, | |
| "step": 1650 | |
| }, | |
| { | |
| "entropy": 2.043409901857376, | |
| "epoch": 1.438569880823402, | |
| "grad_norm": 1.6107861995697021, | |
| "learning_rate": 1.672156692587192e-05, | |
| "loss": 0.11529507637023925, | |
| "mean_token_accuracy": 0.9792997568845749, | |
| "num_tokens": 10348745.0, | |
| "step": 1660 | |
| }, | |
| { | |
| "entropy": 1.9989187628030778, | |
| "epoch": 1.4472372697724811, | |
| "grad_norm": 3.2114312648773193, | |
| "learning_rate": 1.667989468870125e-05, | |
| "loss": 0.06816362738609313, | |
| "mean_token_accuracy": 0.9801637664437294, | |
| "num_tokens": 10413882.0, | |
| "step": 1670 | |
| }, | |
| { | |
| "entropy": 2.130072697997093, | |
| "epoch": 1.45590465872156, | |
| "grad_norm": 2.18566632270813, | |
| "learning_rate": 1.6638011922103396e-05, | |
| "loss": 0.051083773374557495, | |
| "mean_token_accuracy": 0.9857296943664551, | |
| "num_tokens": 10463260.0, | |
| "step": 1680 | |
| }, | |
| { | |
| "entropy": 1.926492241024971, | |
| "epoch": 1.4645720476706392, | |
| "grad_norm": 3.8177168369293213, | |
| "learning_rate": 1.659591994609242e-05, | |
| "loss": 0.09213488101959229, | |
| "mean_token_accuracy": 0.9710013046860695, | |
| "num_tokens": 10540571.0, | |
| "step": 1690 | |
| }, | |
| { | |
| "entropy": 2.016107204556465, | |
| "epoch": 1.4732394366197183, | |
| "grad_norm": 2.7653048038482666, | |
| "learning_rate": 1.6553620087275996e-05, | |
| "loss": 0.09522730708122254, | |
| "mean_token_accuracy": 0.9786510393023491, | |
| "num_tokens": 10606926.0, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 1.4732394366197183, | |
| "eval_entropy": 1.9856633511348742, | |
| "eval_loss": 0.10925532877445221, | |
| "eval_mean_token_accuracy": 0.9715426552354993, | |
| "eval_num_tokens": 10606926.0, | |
| "eval_runtime": 327.2982, | |
| "eval_samples_per_second": 4.913, | |
| "eval_steps_per_second": 0.614, | |
| "step": 1700 | |
| }, | |
| { | |
| "entropy": 2.0318871945142747, | |
| "epoch": 1.4819068255687973, | |
| "grad_norm": 2.5777456760406494, | |
| "learning_rate": 1.6511113678813628e-05, | |
| "loss": 0.09499718546867371, | |
| "mean_token_accuracy": 0.9737421438097954, | |
| "num_tokens": 10669193.0, | |
| "step": 1710 | |
| }, | |
| { | |
| "entropy": 2.0573316484689714, | |
| "epoch": 1.4905742145178764, | |
| "grad_norm": 2.01214337348938, | |
| "learning_rate": 1.6468402060374603e-05, | |
| "loss": 0.06001516580581665, | |
| "mean_token_accuracy": 0.9805633515119553, | |
| "num_tokens": 10726268.0, | |
| "step": 1720 | |
| }, | |
| { | |
| "entropy": 2.0403822153806686, | |
| "epoch": 1.4992416034669556, | |
| "grad_norm": 2.346749782562256, | |
| "learning_rate": 1.6425486578095808e-05, | |
| "loss": 0.07113800644874572, | |
| "mean_token_accuracy": 0.9750549405813217, | |
| "num_tokens": 10790790.0, | |
| "step": 1730 | |
| }, | |
| { | |
| "entropy": 2.0111173152923585, | |
| "epoch": 1.5079089924160347, | |
| "grad_norm": 1.508115291595459, | |
| "learning_rate": 1.6382368584539263e-05, | |
| "loss": 0.08907117843627929, | |
| "mean_token_accuracy": 0.9684910327196121, | |
| "num_tokens": 10856645.0, | |
| "step": 1740 | |
| }, | |
| { | |
| "entropy": 2.0451995551586153, | |
| "epoch": 1.5165763813651139, | |
| "grad_norm": 1.8610405921936035, | |
| "learning_rate": 1.6339049438649518e-05, | |
| "loss": 0.04824534356594086, | |
| "mean_token_accuracy": 0.9889178365468979, | |
| "num_tokens": 10920009.0, | |
| "step": 1750 | |
| }, | |
| { | |
| "entropy": 2.0435550212860107, | |
| "epoch": 1.525243770314193, | |
| "grad_norm": 4.985892295837402, | |
| "learning_rate": 1.629553050571082e-05, | |
| "loss": 0.15718719959259034, | |
| "mean_token_accuracy": 0.9681286260485649, | |
| "num_tokens": 10981763.0, | |
| "step": 1760 | |
| }, | |
| { | |
| "entropy": 2.008193162083626, | |
| "epoch": 1.533911159263272, | |
| "grad_norm": 5.671135425567627, | |
| "learning_rate": 1.6251813157304082e-05, | |
| "loss": 0.03475911319255829, | |
| "mean_token_accuracy": 0.9917748674750329, | |
| "num_tokens": 11043295.0, | |
| "step": 1770 | |
| }, | |
| { | |
| "entropy": 1.9626969277858735, | |
| "epoch": 1.542578548212351, | |
| "grad_norm": 2.032866954803467, | |
| "learning_rate": 1.6207898771263637e-05, | |
| "loss": 0.08077131509780884, | |
| "mean_token_accuracy": 0.9529249399900437, | |
| "num_tokens": 11118730.0, | |
| "step": 1780 | |
| }, | |
| { | |
| "entropy": 1.9946265429258347, | |
| "epoch": 1.55124593716143, | |
| "grad_norm": 1.789146065711975, | |
| "learning_rate": 1.6163788731633846e-05, | |
| "loss": 0.04848654270172119, | |
| "mean_token_accuracy": 0.9804087817668915, | |
| "num_tokens": 11178215.0, | |
| "step": 1790 | |
| }, | |
| { | |
| "entropy": 2.029254746437073, | |
| "epoch": 1.5599133261105091, | |
| "grad_norm": 4.151276111602783, | |
| "learning_rate": 1.6119484428625458e-05, | |
| "loss": 0.0900123655796051, | |
| "mean_token_accuracy": 0.9751652166247368, | |
| "num_tokens": 11233012.0, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 1.5599133261105091, | |
| "eval_entropy": 1.9374866355117875, | |
| "eval_loss": 0.1022234857082367, | |
| "eval_mean_token_accuracy": 0.9733626513338801, | |
| "eval_num_tokens": 11233012.0, | |
| "eval_runtime": 327.2254, | |
| "eval_samples_per_second": 4.914, | |
| "eval_steps_per_second": 0.614, | |
| "step": 1800 | |
| }, | |
| { | |
| "entropy": 1.946454071998596, | |
| "epoch": 1.5685807150595883, | |
| "grad_norm": 3.786501884460449, | |
| "learning_rate": 1.6074987258571785e-05, | |
| "loss": 0.07075926065444946, | |
| "mean_token_accuracy": 0.9727453231811524, | |
| "num_tokens": 11305803.0, | |
| "step": 1810 | |
| }, | |
| { | |
| "entropy": 2.043697011470795, | |
| "epoch": 1.5772481040086674, | |
| "grad_norm": 2.9145822525024414, | |
| "learning_rate": 1.6030298623884725e-05, | |
| "loss": 0.10216034650802612, | |
| "mean_token_accuracy": 0.9663027971982956, | |
| "num_tokens": 11369379.0, | |
| "step": 1820 | |
| }, | |
| { | |
| "entropy": 2.047376683354378, | |
| "epoch": 1.5859154929577466, | |
| "grad_norm": 4.711336135864258, | |
| "learning_rate": 1.598541993301053e-05, | |
| "loss": 0.09091570377349853, | |
| "mean_token_accuracy": 0.9761122927069664, | |
| "num_tokens": 11428198.0, | |
| "step": 1830 | |
| }, | |
| { | |
| "entropy": 2.036109083890915, | |
| "epoch": 1.5945828819068257, | |
| "grad_norm": 1.2843303680419922, | |
| "learning_rate": 1.594035260038543e-05, | |
| "loss": 0.10113109350204467, | |
| "mean_token_accuracy": 0.9779675856232644, | |
| "num_tokens": 11482298.0, | |
| "step": 1840 | |
| }, | |
| { | |
| "entropy": 2.017902082204819, | |
| "epoch": 1.6032502708559047, | |
| "grad_norm": 0.7417038083076477, | |
| "learning_rate": 1.5895098046391057e-05, | |
| "loss": 0.05627822279930115, | |
| "mean_token_accuracy": 0.9855908393859864, | |
| "num_tokens": 11540418.0, | |
| "step": 1850 | |
| }, | |
| { | |
| "entropy": 2.0214678078889845, | |
| "epoch": 1.6119176598049836, | |
| "grad_norm": 3.1506597995758057, | |
| "learning_rate": 1.5849657697309683e-05, | |
| "loss": 0.10502588748931885, | |
| "mean_token_accuracy": 0.9502844616770745, | |
| "num_tokens": 11607357.0, | |
| "step": 1860 | |
| }, | |
| { | |
| "entropy": 2.0340816736221314, | |
| "epoch": 1.6205850487540627, | |
| "grad_norm": 1.0242708921432495, | |
| "learning_rate": 1.5804032985279252e-05, | |
| "loss": 0.08334928750991821, | |
| "mean_token_accuracy": 0.9770424932241439, | |
| "num_tokens": 11663906.0, | |
| "step": 1870 | |
| }, | |
| { | |
| "entropy": 2.0508361369371415, | |
| "epoch": 1.6292524377031419, | |
| "grad_norm": 1.4971176385879517, | |
| "learning_rate": 1.575822534824825e-05, | |
| "loss": 0.09026987552642822, | |
| "mean_token_accuracy": 0.9807920411229134, | |
| "num_tokens": 11726502.0, | |
| "step": 1880 | |
| }, | |
| { | |
| "entropy": 2.1219515979290007, | |
| "epoch": 1.637919826652221, | |
| "grad_norm": 1.5746535062789917, | |
| "learning_rate": 1.5712236229930397e-05, | |
| "loss": 0.04556220769882202, | |
| "mean_token_accuracy": 0.9804752409458161, | |
| "num_tokens": 11779127.0, | |
| "step": 1890 | |
| }, | |
| { | |
| "entropy": 2.0381762087345123, | |
| "epoch": 1.6465872156013002, | |
| "grad_norm": 0.9404705762863159, | |
| "learning_rate": 1.5666067079759135e-05, | |
| "loss": 0.07731429934501648, | |
| "mean_token_accuracy": 0.9713137298822403, | |
| "num_tokens": 11847516.0, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 1.6465872156013002, | |
| "eval_entropy": 1.963913416388023, | |
| "eval_loss": 0.10304063558578491, | |
| "eval_mean_token_accuracy": 0.9715078390059779, | |
| "eval_num_tokens": 11847516.0, | |
| "eval_runtime": 327.2028, | |
| "eval_samples_per_second": 4.914, | |
| "eval_steps_per_second": 0.614, | |
| "step": 1900 | |
| }, | |
| { | |
| "entropy": 2.063380944728851, | |
| "epoch": 1.6552546045503793, | |
| "grad_norm": 0.5977736115455627, | |
| "learning_rate": 1.5619719352841943e-05, | |
| "loss": 0.052711588144302365, | |
| "mean_token_accuracy": 0.9829199954867363, | |
| "num_tokens": 11910897.0, | |
| "step": 1910 | |
| }, | |
| { | |
| "entropy": 2.004588797688484, | |
| "epoch": 1.6639219934994582, | |
| "grad_norm": 4.725104331970215, | |
| "learning_rate": 1.5573194509914487e-05, | |
| "loss": 0.09926276803016662, | |
| "mean_token_accuracy": 0.974181592464447, | |
| "num_tokens": 11970477.0, | |
| "step": 1920 | |
| }, | |
| { | |
| "entropy": 1.9811932653188706, | |
| "epoch": 1.6725893824485374, | |
| "grad_norm": 2.943774938583374, | |
| "learning_rate": 1.552649401729457e-05, | |
| "loss": 0.10009403228759765, | |
| "mean_token_accuracy": 0.976198148727417, | |
| "num_tokens": 12037070.0, | |
| "step": 1930 | |
| }, | |
| { | |
| "entropy": 2.004721650481224, | |
| "epoch": 1.6812567713976163, | |
| "grad_norm": 2.643268346786499, | |
| "learning_rate": 1.547961934683593e-05, | |
| "loss": 0.07603888511657715, | |
| "mean_token_accuracy": 0.9785078406333924, | |
| "num_tokens": 12105290.0, | |
| "step": 1940 | |
| }, | |
| { | |
| "entropy": 2.0851855903863905, | |
| "epoch": 1.6899241603466955, | |
| "grad_norm": 7.968814373016357, | |
| "learning_rate": 1.543257197588185e-05, | |
| "loss": 0.06787392497062683, | |
| "mean_token_accuracy": 0.9741996258497239, | |
| "num_tokens": 12162023.0, | |
| "step": 1950 | |
| }, | |
| { | |
| "entropy": 2.070946404337883, | |
| "epoch": 1.6985915492957746, | |
| "grad_norm": 2.098217010498047, | |
| "learning_rate": 1.5385353387218582e-05, | |
| "loss": 0.09096076488494872, | |
| "mean_token_accuracy": 0.9812888115644455, | |
| "num_tokens": 12215829.0, | |
| "step": 1960 | |
| }, | |
| { | |
| "entropy": 1.9490791618824006, | |
| "epoch": 1.7072589382448538, | |
| "grad_norm": 1.2963298559188843, | |
| "learning_rate": 1.533796506902864e-05, | |
| "loss": 0.06780060529708862, | |
| "mean_token_accuracy": 0.9537896811962128, | |
| "num_tokens": 12288764.0, | |
| "step": 1970 | |
| }, | |
| { | |
| "entropy": 2.0761090010404586, | |
| "epoch": 1.715926327193933, | |
| "grad_norm": 2.5760719776153564, | |
| "learning_rate": 1.529040851484387e-05, | |
| "loss": 0.08884007334709168, | |
| "mean_token_accuracy": 0.975817295908928, | |
| "num_tokens": 12346057.0, | |
| "step": 1980 | |
| }, | |
| { | |
| "entropy": 2.0713831394910813, | |
| "epoch": 1.724593716143012, | |
| "grad_norm": 0.34983646869659424, | |
| "learning_rate": 1.5242685223498403e-05, | |
| "loss": 0.057441574335098264, | |
| "mean_token_accuracy": 0.9883616760373115, | |
| "num_tokens": 12404753.0, | |
| "step": 1990 | |
| }, | |
| { | |
| "entropy": 2.030237454175949, | |
| "epoch": 1.733261105092091, | |
| "grad_norm": 2.676185131072998, | |
| "learning_rate": 1.5194796699081394e-05, | |
| "loss": 0.05204044580459595, | |
| "mean_token_accuracy": 0.9582399621605873, | |
| "num_tokens": 12475078.0, | |
| "step": 2000 | |
| }, | |
| { | |
| "epoch": 1.733261105092091, | |
| "eval_entropy": 1.9605983175448518, | |
| "eval_loss": 0.09823993593454361, | |
| "eval_mean_token_accuracy": 0.9746547498513217, | |
| "eval_num_tokens": 12475078.0, | |
| "eval_runtime": 327.1063, | |
| "eval_samples_per_second": 4.916, | |
| "eval_steps_per_second": 0.614, | |
| "step": 2000 | |
| }, | |
| { | |
| "entropy": 2.0148254886269568, | |
| "epoch": 1.7419284940411701, | |
| "grad_norm": 3.1089882850646973, | |
| "learning_rate": 1.5146744450889635e-05, | |
| "loss": 0.06166669726371765, | |
| "mean_token_accuracy": 0.9789237439632416, | |
| "num_tokens": 12540081.0, | |
| "step": 2010 | |
| }, | |
| { | |
| "entropy": 2.031914421916008, | |
| "epoch": 1.750595882990249, | |
| "grad_norm": 0.7440986633300781, | |
| "learning_rate": 1.5098529993379973e-05, | |
| "loss": 0.027508893609046937, | |
| "mean_token_accuracy": 0.9933552041649818, | |
| "num_tokens": 12602793.0, | |
| "step": 2020 | |
| }, | |
| { | |
| "entropy": 2.0226054787635803, | |
| "epoch": 1.7592632719393282, | |
| "grad_norm": 2.497187376022339, | |
| "learning_rate": 1.5050154846121605e-05, | |
| "loss": 0.058700060844421385, | |
| "mean_token_accuracy": 0.9858224302530288, | |
| "num_tokens": 12660572.0, | |
| "step": 2030 | |
| }, | |
| { | |
| "entropy": 2.0026369482278823, | |
| "epoch": 1.7679306608884073, | |
| "grad_norm": 1.8420461416244507, | |
| "learning_rate": 1.500162053374814e-05, | |
| "loss": 0.10361694097518921, | |
| "mean_token_accuracy": 0.9768809288740158, | |
| "num_tokens": 12726774.0, | |
| "step": 2040 | |
| }, | |
| { | |
| "entropy": 1.9514106661081314, | |
| "epoch": 1.7765980498374865, | |
| "grad_norm": 1.7856649160385132, | |
| "learning_rate": 1.49529285859096e-05, | |
| "loss": 0.0996538519859314, | |
| "mean_token_accuracy": 0.9810873970389367, | |
| "num_tokens": 12792642.0, | |
| "step": 2050 | |
| }, | |
| { | |
| "entropy": 1.9771569460630416, | |
| "epoch": 1.7852654387865656, | |
| "grad_norm": 6.652771472930908, | |
| "learning_rate": 1.4904080537224167e-05, | |
| "loss": 0.08169901967048646, | |
| "mean_token_accuracy": 0.9733238250017167, | |
| "num_tokens": 12855661.0, | |
| "step": 2060 | |
| }, | |
| { | |
| "entropy": 2.0079775601625443, | |
| "epoch": 1.7939328277356448, | |
| "grad_norm": 0.9024977684020996, | |
| "learning_rate": 1.4855077927229844e-05, | |
| "loss": 0.07566041350364686, | |
| "mean_token_accuracy": 0.9776167094707489, | |
| "num_tokens": 12922735.0, | |
| "step": 2070 | |
| }, | |
| { | |
| "entropy": 2.0247191548347474, | |
| "epoch": 1.8026002166847237, | |
| "grad_norm": 2.8540401458740234, | |
| "learning_rate": 1.480592230033592e-05, | |
| "loss": 0.05470334887504578, | |
| "mean_token_accuracy": 0.9820770204067231, | |
| "num_tokens": 12991183.0, | |
| "step": 2080 | |
| }, | |
| { | |
| "entropy": 1.9862486839294433, | |
| "epoch": 1.8112676056338028, | |
| "grad_norm": 1.2073887586593628, | |
| "learning_rate": 1.4756615205774298e-05, | |
| "loss": 0.05954342484474182, | |
| "mean_token_accuracy": 0.9859064787626266, | |
| "num_tokens": 13057025.0, | |
| "step": 2090 | |
| }, | |
| { | |
| "entropy": 2.0485371172428133, | |
| "epoch": 1.8199349945828818, | |
| "grad_norm": 2.339723825454712, | |
| "learning_rate": 1.4707158197550672e-05, | |
| "loss": 0.09820868968963622, | |
| "mean_token_accuracy": 0.9744172319769859, | |
| "num_tokens": 13117982.0, | |
| "step": 2100 | |
| }, | |
| { | |
| "epoch": 1.8199349945828818, | |
| "eval_entropy": 1.9775383715605854, | |
| "eval_loss": 0.09860693663358688, | |
| "eval_mean_token_accuracy": 0.9749452092161226, | |
| "eval_num_tokens": 13117982.0, | |
| "eval_runtime": 326.8903, | |
| "eval_samples_per_second": 4.919, | |
| "eval_steps_per_second": 0.615, | |
| "step": 2100 | |
| }, | |
| { | |
| "entropy": 2.0403252631425857, | |
| "epoch": 1.828602383531961, | |
| "grad_norm": 1.2614986896514893, | |
| "learning_rate": 1.4657552834395548e-05, | |
| "loss": 0.041930514574050906, | |
| "mean_token_accuracy": 0.9876840353012085, | |
| "num_tokens": 13182491.0, | |
| "step": 2110 | |
| }, | |
| { | |
| "entropy": 2.0170107007026674, | |
| "epoch": 1.83726977248104, | |
| "grad_norm": 2.0214993953704834, | |
| "learning_rate": 1.460780067971511e-05, | |
| "loss": 0.057864248752593994, | |
| "mean_token_accuracy": 0.9776172533631324, | |
| "num_tokens": 13249716.0, | |
| "step": 2120 | |
| }, | |
| { | |
| "entropy": 2.079446019232273, | |
| "epoch": 1.8459371614301192, | |
| "grad_norm": 3.712702751159668, | |
| "learning_rate": 1.4557903301541959e-05, | |
| "loss": 0.09157460927963257, | |
| "mean_token_accuracy": 0.9703296691179275, | |
| "num_tokens": 13303975.0, | |
| "step": 2130 | |
| }, | |
| { | |
| "entropy": 2.059545102715492, | |
| "epoch": 1.8546045503791984, | |
| "grad_norm": 4.248321056365967, | |
| "learning_rate": 1.4507862272485683e-05, | |
| "loss": 0.0807805061340332, | |
| "mean_token_accuracy": 0.9754011020064354, | |
| "num_tokens": 13367842.0, | |
| "step": 2140 | |
| }, | |
| { | |
| "entropy": 2.082644584774971, | |
| "epoch": 1.8632719393282775, | |
| "grad_norm": 2.45220947265625, | |
| "learning_rate": 1.4457679169683298e-05, | |
| "loss": 0.08419224619865417, | |
| "mean_token_accuracy": 0.9753760308027267, | |
| "num_tokens": 13423576.0, | |
| "step": 2150 | |
| }, | |
| { | |
| "entropy": 2.034376582503319, | |
| "epoch": 1.8719393282773564, | |
| "grad_norm": 1.8660109043121338, | |
| "learning_rate": 1.4407355574749545e-05, | |
| "loss": 0.033074367046356204, | |
| "mean_token_accuracy": 0.9912351056933403, | |
| "num_tokens": 13493594.0, | |
| "step": 2160 | |
| }, | |
| { | |
| "entropy": 2.034354430437088, | |
| "epoch": 1.8806067172264356, | |
| "grad_norm": 0.5296902060508728, | |
| "learning_rate": 1.4356893073727032e-05, | |
| "loss": 0.05761660933494568, | |
| "mean_token_accuracy": 0.9903651595115661, | |
| "num_tokens": 13554020.0, | |
| "step": 2170 | |
| }, | |
| { | |
| "entropy": 2.0224443942308428, | |
| "epoch": 1.8892741061755145, | |
| "grad_norm": 0.6507072448730469, | |
| "learning_rate": 1.430629325703626e-05, | |
| "loss": 0.04348507225513458, | |
| "mean_token_accuracy": 0.9905618682503701, | |
| "num_tokens": 13629040.0, | |
| "step": 2180 | |
| }, | |
| { | |
| "entropy": 2.132373425364494, | |
| "epoch": 1.8979414951245936, | |
| "grad_norm": 3.952540159225464, | |
| "learning_rate": 1.4255557719425484e-05, | |
| "loss": 0.06843092441558837, | |
| "mean_token_accuracy": 0.9867907360196113, | |
| "num_tokens": 13687505.0, | |
| "step": 2190 | |
| }, | |
| { | |
| "entropy": 2.068184557557106, | |
| "epoch": 1.9066088840736728, | |
| "grad_norm": 1.1742056608200073, | |
| "learning_rate": 1.4204688059920466e-05, | |
| "loss": 0.03711756467819214, | |
| "mean_token_accuracy": 0.9907965555787086, | |
| "num_tokens": 13747230.0, | |
| "step": 2200 | |
| }, | |
| { | |
| "epoch": 1.9066088840736728, | |
| "eval_entropy": 1.9698931809088485, | |
| "eval_loss": 0.09713288396596909, | |
| "eval_mean_token_accuracy": 0.9762651187863516, | |
| "eval_num_tokens": 13747230.0, | |
| "eval_runtime": 326.9491, | |
| "eval_samples_per_second": 4.918, | |
| "eval_steps_per_second": 0.615, | |
| "step": 2200 | |
| }, | |
| { | |
| "entropy": 2.0157451212406157, | |
| "epoch": 1.915276273022752, | |
| "grad_norm": 2.843444347381592, | |
| "learning_rate": 1.4153685881774065e-05, | |
| "loss": 0.06452680230140687, | |
| "mean_token_accuracy": 0.9809629857540131, | |
| "num_tokens": 13809551.0, | |
| "step": 2210 | |
| }, | |
| { | |
| "entropy": 2.0150688737630844, | |
| "epoch": 1.923943661971831, | |
| "grad_norm": 1.5688871145248413, | |
| "learning_rate": 1.410255279241572e-05, | |
| "loss": 0.06514147520065308, | |
| "mean_token_accuracy": 0.9764496192336083, | |
| "num_tokens": 13871049.0, | |
| "step": 2220 | |
| }, | |
| { | |
| "entropy": 2.05910687148571, | |
| "epoch": 1.9326110509209102, | |
| "grad_norm": 2.9402899742126465, | |
| "learning_rate": 1.4051290403400772e-05, | |
| "loss": 0.07682484984397889, | |
| "mean_token_accuracy": 0.9753732204437255, | |
| "num_tokens": 13937668.0, | |
| "step": 2230 | |
| }, | |
| { | |
| "entropy": 2.0290389508008957, | |
| "epoch": 1.9412784398699892, | |
| "grad_norm": 0.7047325372695923, | |
| "learning_rate": 1.39999003303597e-05, | |
| "loss": 0.09054968953132629, | |
| "mean_token_accuracy": 0.9820921018719673, | |
| "num_tokens": 14007185.0, | |
| "step": 2240 | |
| }, | |
| { | |
| "entropy": 2.0927363365888594, | |
| "epoch": 1.9499458288190683, | |
| "grad_norm": 1.0138620138168335, | |
| "learning_rate": 1.3948384192947173e-05, | |
| "loss": 0.047953012585639956, | |
| "mean_token_accuracy": 0.9867767512798309, | |
| "num_tokens": 14067263.0, | |
| "step": 2250 | |
| }, | |
| { | |
| "entropy": 2.1822646766901017, | |
| "epoch": 1.9586132177681472, | |
| "grad_norm": 4.334517955780029, | |
| "learning_rate": 1.3896743614791016e-05, | |
| "loss": 0.10968102216720581, | |
| "mean_token_accuracy": 0.9781262248754501, | |
| "num_tokens": 14123634.0, | |
| "step": 2260 | |
| }, | |
| { | |
| "entropy": 2.044449067115784, | |
| "epoch": 1.9672806067172264, | |
| "grad_norm": 2.7011852264404297, | |
| "learning_rate": 1.384498022344104e-05, | |
| "loss": 0.07374554872512817, | |
| "mean_token_accuracy": 0.9758610785007477, | |
| "num_tokens": 14197541.0, | |
| "step": 2270 | |
| }, | |
| { | |
| "entropy": 2.0185159176588057, | |
| "epoch": 1.9759479956663055, | |
| "grad_norm": 1.0546622276306152, | |
| "learning_rate": 1.3793095650317748e-05, | |
| "loss": 0.08815826773643494, | |
| "mean_token_accuracy": 0.9640801548957825, | |
| "num_tokens": 14262081.0, | |
| "step": 2280 | |
| }, | |
| { | |
| "entropy": 2.065139350295067, | |
| "epoch": 1.9846153846153847, | |
| "grad_norm": 3.3348946571350098, | |
| "learning_rate": 1.3741091530660908e-05, | |
| "loss": 0.11671607494354248, | |
| "mean_token_accuracy": 0.9726112186908722, | |
| "num_tokens": 14320462.0, | |
| "step": 2290 | |
| }, | |
| { | |
| "entropy": 2.0409906804561615, | |
| "epoch": 1.9932827735644638, | |
| "grad_norm": 2.707357168197632, | |
| "learning_rate": 1.3688969503478023e-05, | |
| "loss": 0.0402547687292099, | |
| "mean_token_accuracy": 0.9851001650094986, | |
| "num_tokens": 14385759.0, | |
| "step": 2300 | |
| }, | |
| { | |
| "epoch": 1.9932827735644638, | |
| "eval_entropy": 1.9840727985201783, | |
| "eval_loss": 0.09598784148693085, | |
| "eval_mean_token_accuracy": 0.9754515447426791, | |
| "eval_num_tokens": 14385759.0, | |
| "eval_runtime": 327.2061, | |
| "eval_samples_per_second": 4.914, | |
| "eval_steps_per_second": 0.614, | |
| "step": 2300 | |
| }, | |
| { | |
| "entropy": 2.040311214251396, | |
| "epoch": 2.001733477789816, | |
| "grad_norm": 0.23833799362182617, | |
| "learning_rate": 1.363673121149268e-05, | |
| "loss": 0.05946453809738159, | |
| "mean_token_accuracy": 0.9876417364829626, | |
| "num_tokens": 14447731.0, | |
| "step": 2310 | |
| }, | |
| { | |
| "entropy": 2.1271281450986863, | |
| "epoch": 2.010400866738895, | |
| "grad_norm": 0.5396865010261536, | |
| "learning_rate": 1.3584378301092755e-05, | |
| "loss": 0.0464493989944458, | |
| "mean_token_accuracy": 0.9894088357686996, | |
| "num_tokens": 14502292.0, | |
| "step": 2320 | |
| }, | |
| { | |
| "entropy": 2.043173521757126, | |
| "epoch": 2.019068255687974, | |
| "grad_norm": 2.565701484680176, | |
| "learning_rate": 1.3531912422278556e-05, | |
| "loss": 0.05969124436378479, | |
| "mean_token_accuracy": 0.98280628323555, | |
| "num_tokens": 14564518.0, | |
| "step": 2330 | |
| }, | |
| { | |
| "entropy": 2.0714380711317064, | |
| "epoch": 2.027735644637053, | |
| "grad_norm": 0.9354483485221863, | |
| "learning_rate": 1.347933522861079e-05, | |
| "loss": 0.03992786407470703, | |
| "mean_token_accuracy": 0.9823066785931587, | |
| "num_tokens": 14627721.0, | |
| "step": 2340 | |
| }, | |
| { | |
| "entropy": 2.019579991698265, | |
| "epoch": 2.036403033586132, | |
| "grad_norm": 1.2636523246765137, | |
| "learning_rate": 1.3426648377158468e-05, | |
| "loss": 0.029606398940086365, | |
| "mean_token_accuracy": 0.9911484852433204, | |
| "num_tokens": 14693612.0, | |
| "step": 2350 | |
| }, | |
| { | |
| "entropy": 1.9572718054056168, | |
| "epoch": 2.045070422535211, | |
| "grad_norm": 0.8804156184196472, | |
| "learning_rate": 1.3373853528446665e-05, | |
| "loss": 0.05862312912940979, | |
| "mean_token_accuracy": 0.9830553591251373, | |
| "num_tokens": 14763334.0, | |
| "step": 2360 | |
| }, | |
| { | |
| "entropy": 2.078517937660217, | |
| "epoch": 2.0537378114842904, | |
| "grad_norm": 3.8558311462402344, | |
| "learning_rate": 1.33209523464042e-05, | |
| "loss": 0.035841697454452516, | |
| "mean_token_accuracy": 0.9903575092554092, | |
| "num_tokens": 14828861.0, | |
| "step": 2370 | |
| }, | |
| { | |
| "entropy": 2.01448016166687, | |
| "epoch": 2.0624052004333695, | |
| "grad_norm": 1.981359601020813, | |
| "learning_rate": 1.3267946498311182e-05, | |
| "loss": 0.09111757278442383, | |
| "mean_token_accuracy": 0.9801735639572143, | |
| "num_tokens": 14889109.0, | |
| "step": 2380 | |
| }, | |
| { | |
| "entropy": 2.0431691616773606, | |
| "epoch": 2.0710725893824486, | |
| "grad_norm": 2.930243730545044, | |
| "learning_rate": 1.3214837654746469e-05, | |
| "loss": 0.03293420076370239, | |
| "mean_token_accuracy": 0.987665319442749, | |
| "num_tokens": 14953334.0, | |
| "step": 2390 | |
| }, | |
| { | |
| "entropy": 2.0081345975399016, | |
| "epoch": 2.079739978331528, | |
| "grad_norm": 1.702090859413147, | |
| "learning_rate": 1.3161627489535011e-05, | |
| "loss": 0.04024830460548401, | |
| "mean_token_accuracy": 0.9895202398300171, | |
| "num_tokens": 15018476.0, | |
| "step": 2400 | |
| }, | |
| { | |
| "epoch": 2.079739978331528, | |
| "eval_entropy": 1.946521015902657, | |
| "eval_loss": 0.09423359483480453, | |
| "eval_mean_token_accuracy": 0.9767867083573223, | |
| "eval_num_tokens": 15018476.0, | |
| "eval_runtime": 327.2195, | |
| "eval_samples_per_second": 4.914, | |
| "eval_steps_per_second": 0.614, | |
| "step": 2400 | |
| }, | |
| { | |
| "entropy": 2.0467382192611696, | |
| "epoch": 2.088407367280607, | |
| "grad_norm": 0.7274250388145447, | |
| "learning_rate": 1.3108317679695106e-05, | |
| "loss": 0.05358461737632751, | |
| "mean_token_accuracy": 0.9765512838959693, | |
| "num_tokens": 15072387.0, | |
| "step": 2410 | |
| }, | |
| { | |
| "entropy": 2.027843546867371, | |
| "epoch": 2.0970747562296856, | |
| "grad_norm": 0.24272002279758453, | |
| "learning_rate": 1.3054909905385537e-05, | |
| "loss": 0.06842284202575684, | |
| "mean_token_accuracy": 0.9816409394145011, | |
| "num_tokens": 15127558.0, | |
| "step": 2420 | |
| }, | |
| { | |
| "entropy": 1.9965551286935805, | |
| "epoch": 2.105742145178765, | |
| "grad_norm": 0.11100158095359802, | |
| "learning_rate": 1.300140584985262e-05, | |
| "loss": 0.03788530230522156, | |
| "mean_token_accuracy": 0.9869873493909835, | |
| "num_tokens": 15194555.0, | |
| "step": 2430 | |
| }, | |
| { | |
| "entropy": 2.0039819896221163, | |
| "epoch": 2.114409534127844, | |
| "grad_norm": 5.010103702545166, | |
| "learning_rate": 1.2947807199377155e-05, | |
| "loss": 0.061254572868347165, | |
| "mean_token_accuracy": 0.9877008363604546, | |
| "num_tokens": 15259864.0, | |
| "step": 2440 | |
| }, | |
| { | |
| "entropy": 2.015304672718048, | |
| "epoch": 2.123076923076923, | |
| "grad_norm": 3.253303050994873, | |
| "learning_rate": 1.2894115643221279e-05, | |
| "loss": 0.04881041347980499, | |
| "mean_token_accuracy": 0.9881685748696327, | |
| "num_tokens": 15320656.0, | |
| "step": 2450 | |
| }, | |
| { | |
| "entropy": 1.986794075369835, | |
| "epoch": 2.1317443120260022, | |
| "grad_norm": 0.5272015333175659, | |
| "learning_rate": 1.2840332873575232e-05, | |
| "loss": 0.03953333795070648, | |
| "mean_token_accuracy": 0.9862592309713364, | |
| "num_tokens": 15390635.0, | |
| "step": 2460 | |
| }, | |
| { | |
| "entropy": 2.047020471096039, | |
| "epoch": 2.1404117009750814, | |
| "grad_norm": 0.8474643230438232, | |
| "learning_rate": 1.2786460585504006e-05, | |
| "loss": 0.051943039894104, | |
| "mean_token_accuracy": 0.9837918564677238, | |
| "num_tokens": 15447303.0, | |
| "step": 2470 | |
| }, | |
| { | |
| "entropy": 2.080169880390167, | |
| "epoch": 2.1490790899241605, | |
| "grad_norm": 1.2162392139434814, | |
| "learning_rate": 1.2732500476893948e-05, | |
| "loss": 0.031473752856254575, | |
| "mean_token_accuracy": 0.9859877333045006, | |
| "num_tokens": 15503176.0, | |
| "step": 2480 | |
| }, | |
| { | |
| "entropy": 1.9437969148159027, | |
| "epoch": 2.1577464788732392, | |
| "grad_norm": 1.1037133932113647, | |
| "learning_rate": 1.2678454248399222e-05, | |
| "loss": 0.03166500329971313, | |
| "mean_token_accuracy": 0.9836494714021683, | |
| "num_tokens": 15574501.0, | |
| "step": 2490 | |
| }, | |
| { | |
| "entropy": 2.107138791680336, | |
| "epoch": 2.1664138678223184, | |
| "grad_norm": 2.0166468620300293, | |
| "learning_rate": 1.2624323603388231e-05, | |
| "loss": 0.064914870262146, | |
| "mean_token_accuracy": 0.9847393244504928, | |
| "num_tokens": 15625012.0, | |
| "step": 2500 | |
| }, | |
| { | |
| "epoch": 2.1664138678223184, | |
| "eval_entropy": 1.9424105657273858, | |
| "eval_loss": 0.09450376033782959, | |
| "eval_mean_token_accuracy": 0.9763566433493771, | |
| "eval_num_tokens": 15625012.0, | |
| "eval_runtime": 327.0207, | |
| "eval_samples_per_second": 4.917, | |
| "eval_steps_per_second": 0.615, | |
| "step": 2500 | |
| }, | |
| { | |
| "entropy": 1.9914342880249023, | |
| "epoch": 2.1750812567713975, | |
| "grad_norm": 1.1817911863327026, | |
| "learning_rate": 1.2570110247889919e-05, | |
| "loss": 0.05024116635322571, | |
| "mean_token_accuracy": 0.9868739485740662, | |
| "num_tokens": 15685301.0, | |
| "step": 2510 | |
| }, | |
| { | |
| "entropy": 2.065652829408646, | |
| "epoch": 2.1837486457204767, | |
| "grad_norm": 0.5138121247291565, | |
| "learning_rate": 1.2515815890540011e-05, | |
| "loss": 0.030631223320961, | |
| "mean_token_accuracy": 0.9903474941849708, | |
| "num_tokens": 15745027.0, | |
| "step": 2520 | |
| }, | |
| { | |
| "entropy": 1.9828102201223374, | |
| "epoch": 2.192416034669556, | |
| "grad_norm": 2.7374660968780518, | |
| "learning_rate": 1.2461442242527145e-05, | |
| "loss": 0.042875179648399354, | |
| "mean_token_accuracy": 0.9895638823509216, | |
| "num_tokens": 15804338.0, | |
| "step": 2530 | |
| }, | |
| { | |
| "entropy": 2.0349514096975327, | |
| "epoch": 2.201083423618635, | |
| "grad_norm": 1.7734557390213013, | |
| "learning_rate": 1.240699101753897e-05, | |
| "loss": 0.05402381420135498, | |
| "mean_token_accuracy": 0.9609145388007164, | |
| "num_tokens": 15867336.0, | |
| "step": 2540 | |
| }, | |
| { | |
| "entropy": 2.009895694255829, | |
| "epoch": 2.209750812567714, | |
| "grad_norm": 3.836571455001831, | |
| "learning_rate": 1.2352463931708105e-05, | |
| "loss": 0.05817890763282776, | |
| "mean_token_accuracy": 0.9803715214133263, | |
| "num_tokens": 15931728.0, | |
| "step": 2550 | |
| }, | |
| { | |
| "entropy": 2.06903837621212, | |
| "epoch": 2.2184182015167933, | |
| "grad_norm": 0.9334287047386169, | |
| "learning_rate": 1.2297862703558079e-05, | |
| "loss": 0.05199915170669556, | |
| "mean_token_accuracy": 0.9837120354175568, | |
| "num_tokens": 15995013.0, | |
| "step": 2560 | |
| }, | |
| { | |
| "entropy": 2.104375296831131, | |
| "epoch": 2.227085590465872, | |
| "grad_norm": 1.416616678237915, | |
| "learning_rate": 1.2243189053949141e-05, | |
| "loss": 0.03283692300319672, | |
| "mean_token_accuracy": 0.9894999250769615, | |
| "num_tokens": 16052916.0, | |
| "step": 2570 | |
| }, | |
| { | |
| "entropy": 2.0618636339902876, | |
| "epoch": 2.235752979414951, | |
| "grad_norm": 0.17304587364196777, | |
| "learning_rate": 1.2188444706024047e-05, | |
| "loss": 0.03944204151630402, | |
| "mean_token_accuracy": 0.9891385614871979, | |
| "num_tokens": 16106829.0, | |
| "step": 2580 | |
| }, | |
| { | |
| "entropy": 1.968971461057663, | |
| "epoch": 2.2444203683640302, | |
| "grad_norm": 1.0604981184005737, | |
| "learning_rate": 1.2133631385153743e-05, | |
| "loss": 0.03233407437801361, | |
| "mean_token_accuracy": 0.9909744769334793, | |
| "num_tokens": 16174485.0, | |
| "step": 2590 | |
| }, | |
| { | |
| "entropy": 2.0065663278102877, | |
| "epoch": 2.2530877573131094, | |
| "grad_norm": 1.3104647397994995, | |
| "learning_rate": 1.2078750818882987e-05, | |
| "loss": 0.08497329354286194, | |
| "mean_token_accuracy": 0.9758600533008576, | |
| "num_tokens": 16236830.0, | |
| "step": 2600 | |
| }, | |
| { | |
| "epoch": 2.2530877573131094, | |
| "eval_entropy": 1.966503743508562, | |
| "eval_loss": 0.0974222719669342, | |
| "eval_mean_token_accuracy": 0.9753037845317404, | |
| "eval_num_tokens": 16236830.0, | |
| "eval_runtime": 327.0094, | |
| "eval_samples_per_second": 4.917, | |
| "eval_steps_per_second": 0.615, | |
| "step": 2600 | |
| }, | |
| { | |
| "entropy": 2.03442302942276, | |
| "epoch": 2.2617551462621885, | |
| "grad_norm": 1.5553882122039795, | |
| "learning_rate": 1.2023804736875902e-05, | |
| "loss": 0.0502473771572113, | |
| "mean_token_accuracy": 0.9867029458284378, | |
| "num_tokens": 16297830.0, | |
| "step": 2610 | |
| }, | |
| { | |
| "entropy": 2.0630034118890763, | |
| "epoch": 2.2704225352112677, | |
| "grad_norm": 1.4778331518173218, | |
| "learning_rate": 1.1968794870861456e-05, | |
| "loss": 0.03913445472717285, | |
| "mean_token_accuracy": 0.9862898513674736, | |
| "num_tokens": 16357326.0, | |
| "step": 2620 | |
| }, | |
| { | |
| "entropy": 1.9924042463302611, | |
| "epoch": 2.279089924160347, | |
| "grad_norm": 3.9587581157684326, | |
| "learning_rate": 1.1913722954578899e-05, | |
| "loss": 0.05349403023719788, | |
| "mean_token_accuracy": 0.9834675654768944, | |
| "num_tokens": 16429506.0, | |
| "step": 2630 | |
| }, | |
| { | |
| "entropy": 2.021091330051422, | |
| "epoch": 2.2877573131094255, | |
| "grad_norm": 0.6672972440719604, | |
| "learning_rate": 1.1858590723723105e-05, | |
| "loss": 0.07556374669075012, | |
| "mean_token_accuracy": 0.9789584875106812, | |
| "num_tokens": 16494120.0, | |
| "step": 2640 | |
| }, | |
| { | |
| "entropy": 2.001381501555443, | |
| "epoch": 2.2964247020585047, | |
| "grad_norm": 2.1601645946502686, | |
| "learning_rate": 1.1803399915889879e-05, | |
| "loss": 0.02168504297733307, | |
| "mean_token_accuracy": 0.9941964268684387, | |
| "num_tokens": 16552584.0, | |
| "step": 2650 | |
| }, | |
| { | |
| "entropy": 1.969146479666233, | |
| "epoch": 2.305092091007584, | |
| "grad_norm": 1.3330966234207153, | |
| "learning_rate": 1.174815227052119e-05, | |
| "loss": 0.07724554538726806, | |
| "mean_token_accuracy": 0.9825429797172547, | |
| "num_tokens": 16619463.0, | |
| "step": 2660 | |
| }, | |
| { | |
| "entropy": 2.022412383556366, | |
| "epoch": 2.313759479956663, | |
| "grad_norm": 0.49082720279693604, | |
| "learning_rate": 1.1692849528850347e-05, | |
| "loss": 0.0698297381401062, | |
| "mean_token_accuracy": 0.9825235098600388, | |
| "num_tokens": 16676884.0, | |
| "step": 2670 | |
| }, | |
| { | |
| "entropy": 1.9466478317975997, | |
| "epoch": 2.322426868905742, | |
| "grad_norm": 1.1853913068771362, | |
| "learning_rate": 1.163749343384712e-05, | |
| "loss": 0.07198914289474487, | |
| "mean_token_accuracy": 0.9782518684864044, | |
| "num_tokens": 16738824.0, | |
| "step": 2680 | |
| }, | |
| { | |
| "entropy": 2.0615739434957505, | |
| "epoch": 2.3310942578548213, | |
| "grad_norm": 2.7772486209869385, | |
| "learning_rate": 1.1582085730162813e-05, | |
| "loss": 0.05143954157829285, | |
| "mean_token_accuracy": 0.987485408782959, | |
| "num_tokens": 16792247.0, | |
| "step": 2690 | |
| }, | |
| { | |
| "entropy": 1.9806438446044923, | |
| "epoch": 2.3397616468039004, | |
| "grad_norm": 4.884121417999268, | |
| "learning_rate": 1.1526628164075273e-05, | |
| "loss": 0.08477678298950195, | |
| "mean_token_accuracy": 0.9575665161013603, | |
| "num_tokens": 16857938.0, | |
| "step": 2700 | |
| }, | |
| { | |
| "epoch": 2.3397616468039004, | |
| "eval_entropy": 1.9306559194972859, | |
| "eval_loss": 0.0928974524140358, | |
| "eval_mean_token_accuracy": 0.9761734486219302, | |
| "eval_num_tokens": 16857938.0, | |
| "eval_runtime": 327.2258, | |
| "eval_samples_per_second": 4.914, | |
| "eval_steps_per_second": 0.614, | |
| "step": 2700 | |
| }, | |
| { | |
| "entropy": 2.044921043515205, | |
| "epoch": 2.3484290357529796, | |
| "grad_norm": 0.7897859811782837, | |
| "learning_rate": 1.1471122483433856e-05, | |
| "loss": 0.04415179193019867, | |
| "mean_token_accuracy": 0.9867105528712272, | |
| "num_tokens": 16918909.0, | |
| "step": 2710 | |
| }, | |
| { | |
| "entropy": 1.9723411783576013, | |
| "epoch": 2.3570964247020587, | |
| "grad_norm": 1.2908411026000977, | |
| "learning_rate": 1.1415570437604335e-05, | |
| "loss": 0.06363893747329712, | |
| "mean_token_accuracy": 0.9832093894481659, | |
| "num_tokens": 16978352.0, | |
| "step": 2720 | |
| }, | |
| { | |
| "entropy": 2.022680976986885, | |
| "epoch": 2.3657638136511374, | |
| "grad_norm": 0.7468595504760742, | |
| "learning_rate": 1.1359973777413774e-05, | |
| "loss": 0.03693146705627441, | |
| "mean_token_accuracy": 0.9875386908650399, | |
| "num_tokens": 17035505.0, | |
| "step": 2730 | |
| }, | |
| { | |
| "entropy": 1.8950548261404037, | |
| "epoch": 2.3744312026002166, | |
| "grad_norm": 2.981616258621216, | |
| "learning_rate": 1.1304334255095337e-05, | |
| "loss": 0.09151351451873779, | |
| "mean_token_accuracy": 0.9821941837668419, | |
| "num_tokens": 17110174.0, | |
| "step": 2740 | |
| }, | |
| { | |
| "entropy": 1.9415518552064897, | |
| "epoch": 2.3830985915492957, | |
| "grad_norm": 2.130307197570801, | |
| "learning_rate": 1.1248653624233073e-05, | |
| "loss": 0.07621107697486877, | |
| "mean_token_accuracy": 0.975463455915451, | |
| "num_tokens": 17177359.0, | |
| "step": 2750 | |
| }, | |
| { | |
| "entropy": 1.9728293806314467, | |
| "epoch": 2.391765980498375, | |
| "grad_norm": 1.8035576343536377, | |
| "learning_rate": 1.119293363970664e-05, | |
| "loss": 0.05236530900001526, | |
| "mean_token_accuracy": 0.9870255410671234, | |
| "num_tokens": 17245792.0, | |
| "step": 2760 | |
| }, | |
| { | |
| "entropy": 2.0360106259584425, | |
| "epoch": 2.400433369447454, | |
| "grad_norm": 0.6293774247169495, | |
| "learning_rate": 1.1137176057636008e-05, | |
| "loss": 0.05267359614372254, | |
| "mean_token_accuracy": 0.9824561506509781, | |
| "num_tokens": 17306938.0, | |
| "step": 2770 | |
| }, | |
| { | |
| "entropy": 1.9547817423939704, | |
| "epoch": 2.409100758396533, | |
| "grad_norm": 1.1461045742034912, | |
| "learning_rate": 1.1081382635326091e-05, | |
| "loss": 0.07106815576553345, | |
| "mean_token_accuracy": 0.9856281742453575, | |
| "num_tokens": 17384890.0, | |
| "step": 2780 | |
| }, | |
| { | |
| "entropy": 2.0299994975328444, | |
| "epoch": 2.4177681473456123, | |
| "grad_norm": 3.276568651199341, | |
| "learning_rate": 1.1025555131211387e-05, | |
| "loss": 0.05880398154258728, | |
| "mean_token_accuracy": 0.9834137126803398, | |
| "num_tokens": 17453317.0, | |
| "step": 2790 | |
| }, | |
| { | |
| "entropy": 2.0245982825756075, | |
| "epoch": 2.426435536294691, | |
| "grad_norm": 1.0511301755905151, | |
| "learning_rate": 1.0969695304800544e-05, | |
| "loss": 0.08915462493896484, | |
| "mean_token_accuracy": 0.9808729231357575, | |
| "num_tokens": 17512361.0, | |
| "step": 2800 | |
| }, | |
| { | |
| "epoch": 2.426435536294691, | |
| "eval_entropy": 1.9572540764784931, | |
| "eval_loss": 0.09015624970197678, | |
| "eval_mean_token_accuracy": 0.9780560441278107, | |
| "eval_num_tokens": 17512361.0, | |
| "eval_runtime": 327.3427, | |
| "eval_samples_per_second": 4.912, | |
| "eval_steps_per_second": 0.614, | |
| "step": 2800 | |
| }, | |
| { | |
| "entropy": 1.9997735738754272, | |
| "epoch": 2.43510292524377, | |
| "grad_norm": 0.9744513034820557, | |
| "learning_rate": 1.0913804916620905e-05, | |
| "loss": 0.02331102341413498, | |
| "mean_token_accuracy": 0.9919474333524704, | |
| "num_tokens": 17577516.0, | |
| "step": 2810 | |
| }, | |
| { | |
| "entropy": 2.014119616150856, | |
| "epoch": 2.4437703141928493, | |
| "grad_norm": 0.9193094372749329, | |
| "learning_rate": 1.0857885728163027e-05, | |
| "loss": 0.0236177533864975, | |
| "mean_token_accuracy": 0.9911881402134896, | |
| "num_tokens": 17638548.0, | |
| "step": 2820 | |
| }, | |
| { | |
| "entropy": 1.960026879608631, | |
| "epoch": 2.4524377031419284, | |
| "grad_norm": 0.23110997676849365, | |
| "learning_rate": 1.0801939501825157e-05, | |
| "loss": 0.04339863955974579, | |
| "mean_token_accuracy": 0.98226348310709, | |
| "num_tokens": 17705192.0, | |
| "step": 2830 | |
| }, | |
| { | |
| "entropy": 1.996291145682335, | |
| "epoch": 2.4611050920910076, | |
| "grad_norm": 5.163341045379639, | |
| "learning_rate": 1.07459680008577e-05, | |
| "loss": 0.04148267507553101, | |
| "mean_token_accuracy": 0.9853608950972557, | |
| "num_tokens": 17769801.0, | |
| "step": 2840 | |
| }, | |
| { | |
| "entropy": 2.0213477462530136, | |
| "epoch": 2.4697724810400867, | |
| "grad_norm": 2.1272523403167725, | |
| "learning_rate": 1.068997298930763e-05, | |
| "loss": 0.034024789929389954, | |
| "mean_token_accuracy": 0.9842083305120468, | |
| "num_tokens": 17831542.0, | |
| "step": 2850 | |
| }, | |
| { | |
| "entropy": 1.9997887834906578, | |
| "epoch": 2.478439869989166, | |
| "grad_norm": 1.8577139377593994, | |
| "learning_rate": 1.0633956231962908e-05, | |
| "loss": 0.030756032466888426, | |
| "mean_token_accuracy": 0.9878269597887993, | |
| "num_tokens": 17897817.0, | |
| "step": 2860 | |
| }, | |
| { | |
| "entropy": 1.9450352013111114, | |
| "epoch": 2.487107258938245, | |
| "grad_norm": 1.6481013298034668, | |
| "learning_rate": 1.0577919494296848e-05, | |
| "loss": 0.04975041747093201, | |
| "mean_token_accuracy": 0.9855062261223793, | |
| "num_tokens": 17961050.0, | |
| "step": 2870 | |
| }, | |
| { | |
| "entropy": 2.0519244849681852, | |
| "epoch": 2.495774647887324, | |
| "grad_norm": 1.7673394680023193, | |
| "learning_rate": 1.052186454241249e-05, | |
| "loss": 0.06363226175308227, | |
| "mean_token_accuracy": 0.9759257227182389, | |
| "num_tokens": 18017683.0, | |
| "step": 2880 | |
| }, | |
| { | |
| "entropy": 1.9854577094316483, | |
| "epoch": 2.504442036836403, | |
| "grad_norm": 0.9915326833724976, | |
| "learning_rate": 1.0465793142986917e-05, | |
| "loss": 0.03945471942424774, | |
| "mean_token_accuracy": 0.9838297843933106, | |
| "num_tokens": 18086623.0, | |
| "step": 2890 | |
| }, | |
| { | |
| "entropy": 1.9744661718606948, | |
| "epoch": 2.513109425785482, | |
| "grad_norm": 0.19898076355457306, | |
| "learning_rate": 1.0409707063215602e-05, | |
| "loss": 0.04994584023952484, | |
| "mean_token_accuracy": 0.9840056359767914, | |
| "num_tokens": 18161992.0, | |
| "step": 2900 | |
| }, | |
| { | |
| "epoch": 2.513109425785482, | |
| "eval_entropy": 1.9463663801031919, | |
| "eval_loss": 0.09015114605426788, | |
| "eval_mean_token_accuracy": 0.9790049482933918, | |
| "eval_num_tokens": 18161992.0, | |
| "eval_runtime": 327.033, | |
| "eval_samples_per_second": 4.917, | |
| "eval_steps_per_second": 0.615, | |
| "step": 2900 | |
| }, | |
| { | |
| "entropy": 2.0072739005088804, | |
| "epoch": 2.521776814734561, | |
| "grad_norm": 0.6039919853210449, | |
| "learning_rate": 1.035360807075668e-05, | |
| "loss": 0.06279324889183044, | |
| "mean_token_accuracy": 0.9817322447896004, | |
| "num_tokens": 18218359.0, | |
| "step": 2910 | |
| }, | |
| { | |
| "entropy": 1.979375532269478, | |
| "epoch": 2.5304442036836403, | |
| "grad_norm": 2.242131233215332, | |
| "learning_rate": 1.0297497933675271e-05, | |
| "loss": 0.037703675031661985, | |
| "mean_token_accuracy": 0.9891891330480576, | |
| "num_tokens": 18276604.0, | |
| "step": 2920 | |
| }, | |
| { | |
| "entropy": 2.0151320695877075, | |
| "epoch": 2.5391115926327195, | |
| "grad_norm": 4.291823863983154, | |
| "learning_rate": 1.0241378420387727e-05, | |
| "loss": 0.0672419011592865, | |
| "mean_token_accuracy": 0.9796803876757622, | |
| "num_tokens": 18336643.0, | |
| "step": 2930 | |
| }, | |
| { | |
| "entropy": 1.9576003134250641, | |
| "epoch": 2.5477789815817986, | |
| "grad_norm": 1.9827468395233154, | |
| "learning_rate": 1.0185251299605909e-05, | |
| "loss": 0.03502065539360046, | |
| "mean_token_accuracy": 0.9894511729478837, | |
| "num_tokens": 18395903.0, | |
| "step": 2940 | |
| }, | |
| { | |
| "entropy": 2.021180757880211, | |
| "epoch": 2.5564463705308773, | |
| "grad_norm": 7.404480934143066, | |
| "learning_rate": 1.012911834028145e-05, | |
| "loss": 0.04811771810054779, | |
| "mean_token_accuracy": 0.9804063439369202, | |
| "num_tokens": 18459847.0, | |
| "step": 2950 | |
| }, | |
| { | |
| "entropy": 1.9120722502470016, | |
| "epoch": 2.5651137594799565, | |
| "grad_norm": 0.9321104884147644, | |
| "learning_rate": 1.0072981311549988e-05, | |
| "loss": 0.05938450694084167, | |
| "mean_token_accuracy": 0.9737172573804855, | |
| "num_tokens": 18525932.0, | |
| "step": 2960 | |
| }, | |
| { | |
| "entropy": 2.0345918387174606, | |
| "epoch": 2.5737811484290356, | |
| "grad_norm": 0.08143553882837296, | |
| "learning_rate": 1.001684198267542e-05, | |
| "loss": 0.05566604137420654, | |
| "mean_token_accuracy": 0.9803778171539307, | |
| "num_tokens": 18589606.0, | |
| "step": 2970 | |
| }, | |
| { | |
| "entropy": 2.053544855117798, | |
| "epoch": 2.5824485373781148, | |
| "grad_norm": 1.1658939123153687, | |
| "learning_rate": 9.960702122994139e-06, | |
| "loss": 0.0482805073261261, | |
| "mean_token_accuracy": 0.9861093074083328, | |
| "num_tokens": 18644042.0, | |
| "step": 2980 | |
| }, | |
| { | |
| "entropy": 2.0836474686861037, | |
| "epoch": 2.591115926327194, | |
| "grad_norm": 1.5134586095809937, | |
| "learning_rate": 9.904563501859256e-06, | |
| "loss": 0.055090302228927614, | |
| "mean_token_accuracy": 0.9857477128505707, | |
| "num_tokens": 18702039.0, | |
| "step": 2990 | |
| }, | |
| { | |
| "entropy": 2.0128067165613173, | |
| "epoch": 2.599783315276273, | |
| "grad_norm": 1.14212965965271, | |
| "learning_rate": 9.848427888584863e-06, | |
| "loss": 0.041364666819572446, | |
| "mean_token_accuracy": 0.9833357527852058, | |
| "num_tokens": 18764358.0, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 2.599783315276273, | |
| "eval_entropy": 1.9795061646409295, | |
| "eval_loss": 0.09064625948667526, | |
| "eval_mean_token_accuracy": 0.9773970151422036, | |
| "eval_num_tokens": 18764358.0, | |
| "eval_runtime": 327.3559, | |
| "eval_samples_per_second": 4.912, | |
| "eval_steps_per_second": 0.614, | |
| "step": 3000 | |
| }, | |
| { | |
| "entropy": 2.159276154637337, | |
| "epoch": 2.608450704225352, | |
| "grad_norm": 2.7326016426086426, | |
| "learning_rate": 9.792297052390238e-06, | |
| "loss": 0.04406266808509827, | |
| "mean_token_accuracy": 0.987121856212616, | |
| "num_tokens": 18818455.0, | |
| "step": 3010 | |
| }, | |
| { | |
| "entropy": 1.968066468834877, | |
| "epoch": 2.6171180931744313, | |
| "grad_norm": 2.7995221614837646, | |
| "learning_rate": 9.736172762344113e-06, | |
| "loss": 0.09104043841362, | |
| "mean_token_accuracy": 0.980485713481903, | |
| "num_tokens": 18884842.0, | |
| "step": 3020 | |
| }, | |
| { | |
| "entropy": 1.99553040266037, | |
| "epoch": 2.6257854821235105, | |
| "grad_norm": 6.235974311828613, | |
| "learning_rate": 9.680056787308898e-06, | |
| "loss": 0.06288103461265564, | |
| "mean_token_accuracy": 0.9678011432290077, | |
| "num_tokens": 18959860.0, | |
| "step": 3030 | |
| }, | |
| { | |
| "entropy": 1.9894109219312668, | |
| "epoch": 2.6344528710725896, | |
| "grad_norm": 0.333478718996048, | |
| "learning_rate": 9.623950895884944e-06, | |
| "loss": 0.08161028027534485, | |
| "mean_token_accuracy": 0.9892241954803467, | |
| "num_tokens": 19027017.0, | |
| "step": 3040 | |
| }, | |
| { | |
| "entropy": 2.04710274040699, | |
| "epoch": 2.6431202600216683, | |
| "grad_norm": 0.5233101844787598, | |
| "learning_rate": 9.567856856354792e-06, | |
| "loss": 0.04426893293857574, | |
| "mean_token_accuracy": 0.9886008054018021, | |
| "num_tokens": 19086891.0, | |
| "step": 3050 | |
| }, | |
| { | |
| "entropy": 2.028855699300766, | |
| "epoch": 2.6517876489707475, | |
| "grad_norm": 1.3492603302001953, | |
| "learning_rate": 9.511776436627456e-06, | |
| "loss": 0.026917535066604614, | |
| "mean_token_accuracy": 0.9916170611977577, | |
| "num_tokens": 19145104.0, | |
| "step": 3060 | |
| }, | |
| { | |
| "entropy": 1.9948274880647658, | |
| "epoch": 2.6604550379198266, | |
| "grad_norm": 2.2153990268707275, | |
| "learning_rate": 9.455711404182696e-06, | |
| "loss": 0.08325918912887573, | |
| "mean_token_accuracy": 0.9756117567420006, | |
| "num_tokens": 19206436.0, | |
| "step": 3070 | |
| }, | |
| { | |
| "entropy": 2.049996706843376, | |
| "epoch": 2.6691224268689058, | |
| "grad_norm": 4.233671188354492, | |
| "learning_rate": 9.399663526015305e-06, | |
| "loss": 0.08945580720901489, | |
| "mean_token_accuracy": 0.9773588702082634, | |
| "num_tokens": 19261677.0, | |
| "step": 3080 | |
| }, | |
| { | |
| "entropy": 2.012954831123352, | |
| "epoch": 2.677789815817985, | |
| "grad_norm": 0.9330930709838867, | |
| "learning_rate": 9.343634568579436e-06, | |
| "loss": 0.06627085208892822, | |
| "mean_token_accuracy": 0.9879173919558525, | |
| "num_tokens": 19322808.0, | |
| "step": 3090 | |
| }, | |
| { | |
| "entropy": 2.0294546335935593, | |
| "epoch": 2.686457204767064, | |
| "grad_norm": 1.6425728797912598, | |
| "learning_rate": 9.287626297732908e-06, | |
| "loss": 0.047486874461174014, | |
| "mean_token_accuracy": 0.9868068620562553, | |
| "num_tokens": 19387957.0, | |
| "step": 3100 | |
| }, | |
| { | |
| "epoch": 2.686457204767064, | |
| "eval_entropy": 1.9502243705056792, | |
| "eval_loss": 0.08599194884300232, | |
| "eval_mean_token_accuracy": 0.9787541123765024, | |
| "eval_num_tokens": 19387957.0, | |
| "eval_runtime": 327.3899, | |
| "eval_samples_per_second": 4.912, | |
| "eval_steps_per_second": 0.614, | |
| "step": 3100 | |
| }, | |
| { | |
| "entropy": 2.0488913506269455, | |
| "epoch": 2.6951245937161428, | |
| "grad_norm": 0.2572486698627472, | |
| "learning_rate": 9.231640478681579e-06, | |
| "loss": 0.038655102252960205, | |
| "mean_token_accuracy": 0.9838706344366074, | |
| "num_tokens": 19442029.0, | |
| "step": 3110 | |
| }, | |
| { | |
| "entropy": 1.996284967660904, | |
| "epoch": 2.703791982665222, | |
| "grad_norm": 0.7005351185798645, | |
| "learning_rate": 9.175678875923682e-06, | |
| "loss": 0.06046753525733948, | |
| "mean_token_accuracy": 0.9802204161882401, | |
| "num_tokens": 19500346.0, | |
| "step": 3120 | |
| }, | |
| { | |
| "entropy": 1.991689708828926, | |
| "epoch": 2.712459371614301, | |
| "grad_norm": 1.0894055366516113, | |
| "learning_rate": 9.119743253194238e-06, | |
| "loss": 0.06283498406410218, | |
| "mean_token_accuracy": 0.9823062658309937, | |
| "num_tokens": 19567406.0, | |
| "step": 3130 | |
| }, | |
| { | |
| "entropy": 2.0570632964372635, | |
| "epoch": 2.72112676056338, | |
| "grad_norm": 2.256519079208374, | |
| "learning_rate": 9.063835373409454e-06, | |
| "loss": 0.10143665075302125, | |
| "mean_token_accuracy": 0.9756506696343422, | |
| "num_tokens": 19626834.0, | |
| "step": 3140 | |
| }, | |
| { | |
| "entropy": 2.0224888235330583, | |
| "epoch": 2.7297941495124594, | |
| "grad_norm": 0.9661228060722351, | |
| "learning_rate": 9.007956998611162e-06, | |
| "loss": 0.023985360562801362, | |
| "mean_token_accuracy": 0.9860787034034729, | |
| "num_tokens": 19684060.0, | |
| "step": 3150 | |
| }, | |
| { | |
| "entropy": 2.0702203780412676, | |
| "epoch": 2.7384615384615385, | |
| "grad_norm": 1.2157535552978516, | |
| "learning_rate": 8.9521098899113e-06, | |
| "loss": 0.045061749219894406, | |
| "mean_token_accuracy": 0.9835543319582939, | |
| "num_tokens": 19744862.0, | |
| "step": 3160 | |
| }, | |
| { | |
| "entropy": 1.9608687520027162, | |
| "epoch": 2.7471289274106176, | |
| "grad_norm": 1.2761811017990112, | |
| "learning_rate": 8.896295807436382e-06, | |
| "loss": 0.02903972864151001, | |
| "mean_token_accuracy": 0.9851373538374901, | |
| "num_tokens": 19814847.0, | |
| "step": 3170 | |
| }, | |
| { | |
| "entropy": 1.9704955458641051, | |
| "epoch": 2.755796316359697, | |
| "grad_norm": 3.0626580715179443, | |
| "learning_rate": 8.840516510272056e-06, | |
| "loss": 0.03995053470134735, | |
| "mean_token_accuracy": 0.9888360872864723, | |
| "num_tokens": 19873814.0, | |
| "step": 3180 | |
| }, | |
| { | |
| "entropy": 2.0080684244632723, | |
| "epoch": 2.764463705308776, | |
| "grad_norm": 2.2461702823638916, | |
| "learning_rate": 8.784773756407629e-06, | |
| "loss": 0.03145716786384582, | |
| "mean_token_accuracy": 0.9925667092204093, | |
| "num_tokens": 19931686.0, | |
| "step": 3190 | |
| }, | |
| { | |
| "entropy": 1.9973454266786574, | |
| "epoch": 2.773131094257855, | |
| "grad_norm": 1.4155596494674683, | |
| "learning_rate": 8.729069302680686e-06, | |
| "loss": 0.03232878148555755, | |
| "mean_token_accuracy": 0.9891820922493935, | |
| "num_tokens": 19993913.0, | |
| "step": 3200 | |
| }, | |
| { | |
| "epoch": 2.773131094257855, | |
| "eval_entropy": 1.9362546573230877, | |
| "eval_loss": 0.08918900042772293, | |
| "eval_mean_token_accuracy": 0.9781833460081869, | |
| "eval_num_tokens": 19993913.0, | |
| "eval_runtime": 327.2187, | |
| "eval_samples_per_second": 4.914, | |
| "eval_steps_per_second": 0.614, | |
| "step": 3200 | |
| }, | |
| { | |
| "entropy": 2.0571909993886948, | |
| "epoch": 2.781798483206934, | |
| "grad_norm": 1.3820114135742188, | |
| "learning_rate": 8.67340490472171e-06, | |
| "loss": 0.0422855019569397, | |
| "mean_token_accuracy": 0.9904089197516441, | |
| "num_tokens": 20051573.0, | |
| "step": 3210 | |
| }, | |
| { | |
| "entropy": 1.9552978485822679, | |
| "epoch": 2.790465872156013, | |
| "grad_norm": 2.360881805419922, | |
| "learning_rate": 8.61778231689875e-06, | |
| "loss": 0.06589213013648987, | |
| "mean_token_accuracy": 0.9763843730092049, | |
| "num_tokens": 20110195.0, | |
| "step": 3220 | |
| }, | |
| { | |
| "entropy": 1.997276645898819, | |
| "epoch": 2.799133261105092, | |
| "grad_norm": 0.7178909778594971, | |
| "learning_rate": 8.56220329226213e-06, | |
| "loss": 0.026553085446357726, | |
| "mean_token_accuracy": 0.9915577113628388, | |
| "num_tokens": 20171207.0, | |
| "step": 3230 | |
| }, | |
| { | |
| "entropy": 1.97244333922863, | |
| "epoch": 2.8078006500541712, | |
| "grad_norm": 0.8178501725196838, | |
| "learning_rate": 8.506669582489199e-06, | |
| "loss": 0.06264678239822388, | |
| "mean_token_accuracy": 0.9804031074047088, | |
| "num_tokens": 20240761.0, | |
| "step": 3240 | |
| }, | |
| { | |
| "entropy": 1.9891822725534438, | |
| "epoch": 2.8164680390032504, | |
| "grad_norm": 0.20255060493946075, | |
| "learning_rate": 8.451182937829125e-06, | |
| "loss": 0.035097137093544006, | |
| "mean_token_accuracy": 0.9935684517025948, | |
| "num_tokens": 20300987.0, | |
| "step": 3250 | |
| }, | |
| { | |
| "entropy": 2.0133452355861663, | |
| "epoch": 2.8251354279523295, | |
| "grad_norm": 4.924685955047607, | |
| "learning_rate": 8.395745107047729e-06, | |
| "loss": 0.07078658938407897, | |
| "mean_token_accuracy": 0.9835556149482727, | |
| "num_tokens": 20366208.0, | |
| "step": 3260 | |
| }, | |
| { | |
| "entropy": 1.996243155002594, | |
| "epoch": 2.8338028169014082, | |
| "grad_norm": 0.5406718850135803, | |
| "learning_rate": 8.340357837372363e-06, | |
| "loss": 0.08820904493331909, | |
| "mean_token_accuracy": 0.9786410570144654, | |
| "num_tokens": 20433132.0, | |
| "step": 3270 | |
| }, | |
| { | |
| "entropy": 2.0637154281139374, | |
| "epoch": 2.8424702058504874, | |
| "grad_norm": 3.8165504932403564, | |
| "learning_rate": 8.28502287443687e-06, | |
| "loss": 0.0430131733417511, | |
| "mean_token_accuracy": 0.9918735235929489, | |
| "num_tokens": 20496310.0, | |
| "step": 3280 | |
| }, | |
| { | |
| "entropy": 2.0202389895915984, | |
| "epoch": 2.8511375947995665, | |
| "grad_norm": 1.5813179016113281, | |
| "learning_rate": 8.229741962226525e-06, | |
| "loss": 0.05116449594497681, | |
| "mean_token_accuracy": 0.9833520889282227, | |
| "num_tokens": 20565223.0, | |
| "step": 3290 | |
| }, | |
| { | |
| "entropy": 2.062763836979866, | |
| "epoch": 2.8598049837486457, | |
| "grad_norm": 0.22883164882659912, | |
| "learning_rate": 8.174516843023112e-06, | |
| "loss": 0.03045716881752014, | |
| "mean_token_accuracy": 0.9860931158065795, | |
| "num_tokens": 20625610.0, | |
| "step": 3300 | |
| }, | |
| { | |
| "epoch": 2.8598049837486457, | |
| "eval_entropy": 1.938993199547725, | |
| "eval_loss": 0.08659692853689194, | |
| "eval_mean_token_accuracy": 0.9792619125166936, | |
| "eval_num_tokens": 20625610.0, | |
| "eval_runtime": 326.8748, | |
| "eval_samples_per_second": 4.919, | |
| "eval_steps_per_second": 0.615, | |
| "step": 3300 | |
| }, | |
| { | |
| "entropy": 1.9526330173015594, | |
| "epoch": 2.868472372697725, | |
| "grad_norm": 0.17043910920619965, | |
| "learning_rate": 8.119349257349981e-06, | |
| "loss": 0.03852111101150513, | |
| "mean_token_accuracy": 0.9923890814185142, | |
| "num_tokens": 20689418.0, | |
| "step": 3310 | |
| }, | |
| { | |
| "entropy": 2.0270158767700197, | |
| "epoch": 2.877139761646804, | |
| "grad_norm": 0.4257623851299286, | |
| "learning_rate": 8.064240943917214e-06, | |
| "loss": 0.04855137765407562, | |
| "mean_token_accuracy": 0.9914126366376876, | |
| "num_tokens": 20751477.0, | |
| "step": 3320 | |
| }, | |
| { | |
| "entropy": 1.987108725309372, | |
| "epoch": 2.885807150595883, | |
| "grad_norm": 1.6425321102142334, | |
| "learning_rate": 8.009193639566805e-06, | |
| "loss": 0.06597901582717895, | |
| "mean_token_accuracy": 0.973939710855484, | |
| "num_tokens": 20817645.0, | |
| "step": 3330 | |
| }, | |
| { | |
| "entropy": 2.027906683087349, | |
| "epoch": 2.8944745395449623, | |
| "grad_norm": 1.789011001586914, | |
| "learning_rate": 7.954209079217945e-06, | |
| "loss": 0.04323897361755371, | |
| "mean_token_accuracy": 0.9864452615380287, | |
| "num_tokens": 20879146.0, | |
| "step": 3340 | |
| }, | |
| { | |
| "entropy": 1.9812477678060532, | |
| "epoch": 2.9031419284940414, | |
| "grad_norm": 3.5340230464935303, | |
| "learning_rate": 7.899288995812322e-06, | |
| "loss": 0.0406141608953476, | |
| "mean_token_accuracy": 0.987187135219574, | |
| "num_tokens": 20941057.0, | |
| "step": 3350 | |
| }, | |
| { | |
| "entropy": 2.024034297466278, | |
| "epoch": 2.91180931744312, | |
| "grad_norm": 0.21585479378700256, | |
| "learning_rate": 7.84443512025952e-06, | |
| "loss": 0.04108258783817291, | |
| "mean_token_accuracy": 0.9911881193518639, | |
| "num_tokens": 20999998.0, | |
| "step": 3360 | |
| }, | |
| { | |
| "entropy": 1.9965860784053802, | |
| "epoch": 2.9204767063921993, | |
| "grad_norm": 2.0004289150238037, | |
| "learning_rate": 7.789649181382444e-06, | |
| "loss": 0.040653344988822934, | |
| "mean_token_accuracy": 0.9891650825738907, | |
| "num_tokens": 21068454.0, | |
| "step": 3370 | |
| }, | |
| { | |
| "entropy": 1.9830640345811843, | |
| "epoch": 2.9291440953412784, | |
| "grad_norm": 3.6005094051361084, | |
| "learning_rate": 7.734932905862862e-06, | |
| "loss": 0.07591732740402221, | |
| "mean_token_accuracy": 0.984532107412815, | |
| "num_tokens": 21143837.0, | |
| "step": 3380 | |
| }, | |
| { | |
| "entropy": 2.04206445813179, | |
| "epoch": 2.9378114842903575, | |
| "grad_norm": 1.8786780834197998, | |
| "learning_rate": 7.68028801818696e-06, | |
| "loss": 0.03788648545742035, | |
| "mean_token_accuracy": 0.9878558471798897, | |
| "num_tokens": 21202925.0, | |
| "step": 3390 | |
| }, | |
| { | |
| "entropy": 1.9883090794086455, | |
| "epoch": 2.9464788732394367, | |
| "grad_norm": 2.9170005321502686, | |
| "learning_rate": 7.6257162405910115e-06, | |
| "loss": 0.04177981615066528, | |
| "mean_token_accuracy": 0.9603466898202896, | |
| "num_tokens": 21262453.0, | |
| "step": 3400 | |
| }, | |
| { | |
| "epoch": 2.9464788732394367, | |
| "eval_entropy": 1.9480238630997009, | |
| "eval_loss": 0.08786118775606155, | |
| "eval_mean_token_accuracy": 0.9783913027587815, | |
| "eval_num_tokens": 21262453.0, | |
| "eval_runtime": 327.0291, | |
| "eval_samples_per_second": 4.917, | |
| "eval_steps_per_second": 0.615, | |
| "step": 3400 | |
| }, | |
| { | |
| "entropy": 2.00368013381958, | |
| "epoch": 2.955146262188516, | |
| "grad_norm": 1.690090298652649, | |
| "learning_rate": 7.571219293007075e-06, | |
| "loss": 0.07676026225090027, | |
| "mean_token_accuracy": 0.9722154304385185, | |
| "num_tokens": 21325040.0, | |
| "step": 3410 | |
| }, | |
| { | |
| "entropy": 2.0232281416654585, | |
| "epoch": 2.9638136511375945, | |
| "grad_norm": 0.692124605178833, | |
| "learning_rate": 7.516798893008817e-06, | |
| "loss": 0.025483831763267517, | |
| "mean_token_accuracy": 0.993908728659153, | |
| "num_tokens": 21385939.0, | |
| "step": 3420 | |
| }, | |
| { | |
| "entropy": 1.9855226576328278, | |
| "epoch": 2.9724810400866737, | |
| "grad_norm": 5.5677385330200195, | |
| "learning_rate": 7.4624567557573525e-06, | |
| "loss": 0.03866112232208252, | |
| "mean_token_accuracy": 0.9897015273571015, | |
| "num_tokens": 21449342.0, | |
| "step": 3430 | |
| }, | |
| { | |
| "entropy": 1.9878569096326828, | |
| "epoch": 2.981148429035753, | |
| "grad_norm": 1.0295473337173462, | |
| "learning_rate": 7.4081945939472e-06, | |
| "loss": 0.02325758934020996, | |
| "mean_token_accuracy": 0.9918417349457741, | |
| "num_tokens": 21517498.0, | |
| "step": 3440 | |
| }, | |
| { | |
| "entropy": 2.040255609154701, | |
| "epoch": 2.989815817984832, | |
| "grad_norm": 0.6241699457168579, | |
| "learning_rate": 7.354014117752305e-06, | |
| "loss": 0.05443716049194336, | |
| "mean_token_accuracy": 0.9862660676240921, | |
| "num_tokens": 21575243.0, | |
| "step": 3450 | |
| }, | |
| { | |
| "entropy": 1.9827607095241546, | |
| "epoch": 2.998483206933911, | |
| "grad_norm": 3.2460570335388184, | |
| "learning_rate": 7.299917034772134e-06, | |
| "loss": 0.03632343113422394, | |
| "mean_token_accuracy": 0.9861762166023255, | |
| "num_tokens": 21642048.0, | |
| "step": 3460 | |
| }, | |
| { | |
| "entropy": 1.9609574262912457, | |
| "epoch": 3.0069339111592632, | |
| "grad_norm": 0.3964233100414276, | |
| "learning_rate": 7.245905049977863e-06, | |
| "loss": 0.023949359357357026, | |
| "mean_token_accuracy": 0.9889839383272024, | |
| "num_tokens": 21703419.0, | |
| "step": 3470 | |
| }, | |
| { | |
| "entropy": 2.0167145997285845, | |
| "epoch": 3.0156013001083424, | |
| "grad_norm": 0.2081003487110138, | |
| "learning_rate": 7.191979865658633e-06, | |
| "loss": 0.029495981335639954, | |
| "mean_token_accuracy": 0.9923539698123932, | |
| "num_tokens": 21767451.0, | |
| "step": 3480 | |
| }, | |
| { | |
| "entropy": 1.9336788192391396, | |
| "epoch": 3.0242686890574215, | |
| "grad_norm": 1.2492883205413818, | |
| "learning_rate": 7.138143181367918e-06, | |
| "loss": 0.018693357706069946, | |
| "mean_token_accuracy": 0.9953667461872101, | |
| "num_tokens": 21842309.0, | |
| "step": 3490 | |
| }, | |
| { | |
| "entropy": 2.0128078699111938, | |
| "epoch": 3.0329360780065007, | |
| "grad_norm": 0.08379145711660385, | |
| "learning_rate": 7.084396693869928e-06, | |
| "loss": 0.022161170840263367, | |
| "mean_token_accuracy": 0.9914363294839859, | |
| "num_tokens": 21904561.0, | |
| "step": 3500 | |
| }, | |
| { | |
| "epoch": 3.0329360780065007, | |
| "eval_entropy": 1.9438044924048048, | |
| "eval_loss": 0.08556525409221649, | |
| "eval_mean_token_accuracy": 0.9790331549312344, | |
| "eval_num_tokens": 21904561.0, | |
| "eval_runtime": 327.0968, | |
| "eval_samples_per_second": 4.916, | |
| "eval_steps_per_second": 0.614, | |
| "step": 3500 | |
| }, | |
| { | |
| "entropy": 1.927895051240921, | |
| "epoch": 3.04160346695558, | |
| "grad_norm": 1.0014227628707886, | |
| "learning_rate": 7.0307420970861695e-06, | |
| "loss": 0.022809083759784698, | |
| "mean_token_accuracy": 0.9900833815336227, | |
| "num_tokens": 21972321.0, | |
| "step": 3510 | |
| }, | |
| { | |
| "entropy": 2.0294132977724075, | |
| "epoch": 3.0502708559046585, | |
| "grad_norm": 0.8297566771507263, | |
| "learning_rate": 6.977181082042033e-06, | |
| "loss": 0.024722158908843994, | |
| "mean_token_accuracy": 0.9913588181138039, | |
| "num_tokens": 22037170.0, | |
| "step": 3520 | |
| }, | |
| { | |
| "entropy": 2.1015698224306107, | |
| "epoch": 3.0589382448537377, | |
| "grad_norm": 1.5314658880233765, | |
| "learning_rate": 6.923715336813499e-06, | |
| "loss": 0.03659733235836029, | |
| "mean_token_accuracy": 0.9872351065278053, | |
| "num_tokens": 22083744.0, | |
| "step": 3530 | |
| }, | |
| { | |
| "entropy": 2.0339041739702224, | |
| "epoch": 3.067605633802817, | |
| "grad_norm": 0.24609343707561493, | |
| "learning_rate": 6.870346546473954e-06, | |
| "loss": 0.03324902355670929, | |
| "mean_token_accuracy": 0.9886126175522805, | |
| "num_tokens": 22141305.0, | |
| "step": 3540 | |
| }, | |
| { | |
| "entropy": 2.025708928704262, | |
| "epoch": 3.076273022751896, | |
| "grad_norm": 3.1685736179351807, | |
| "learning_rate": 6.817076393041055e-06, | |
| "loss": 0.039118051528930664, | |
| "mean_token_accuracy": 0.9934563606977462, | |
| "num_tokens": 22201940.0, | |
| "step": 3550 | |
| }, | |
| { | |
| "entropy": 1.9974781066179275, | |
| "epoch": 3.084940411700975, | |
| "grad_norm": 1.9486182928085327, | |
| "learning_rate": 6.763906555423745e-06, | |
| "loss": 0.026187896728515625, | |
| "mean_token_accuracy": 0.9913025006651879, | |
| "num_tokens": 22261753.0, | |
| "step": 3560 | |
| }, | |
| { | |
| "entropy": 2.0584082931280134, | |
| "epoch": 3.0936078006500543, | |
| "grad_norm": 0.07571403682231903, | |
| "learning_rate": 6.710838709369315e-06, | |
| "loss": 0.04056554138660431, | |
| "mean_token_accuracy": 0.9884672403335572, | |
| "num_tokens": 22319850.0, | |
| "step": 3570 | |
| }, | |
| { | |
| "entropy": 2.0791433185338972, | |
| "epoch": 3.1022751895991334, | |
| "grad_norm": 2.689072847366333, | |
| "learning_rate": 6.6578745274106075e-06, | |
| "loss": 0.03821301460266113, | |
| "mean_token_accuracy": 0.9874335438013077, | |
| "num_tokens": 22377009.0, | |
| "step": 3580 | |
| }, | |
| { | |
| "entropy": 2.050138959288597, | |
| "epoch": 3.1109425785482125, | |
| "grad_norm": 0.6456999182701111, | |
| "learning_rate": 6.6050156788132895e-06, | |
| "loss": 0.014178495109081268, | |
| "mean_token_accuracy": 0.9958937197923661, | |
| "num_tokens": 22441093.0, | |
| "step": 3590 | |
| }, | |
| { | |
| "entropy": 2.0015585333108903, | |
| "epoch": 3.1196099674972912, | |
| "grad_norm": 0.9528690576553345, | |
| "learning_rate": 6.552263829523258e-06, | |
| "loss": 0.040335527062416075, | |
| "mean_token_accuracy": 0.9911141216754913, | |
| "num_tokens": 22505491.0, | |
| "step": 3600 | |
| }, | |
| { | |
| "epoch": 3.1196099674972912, | |
| "eval_entropy": 1.941706338925148, | |
| "eval_loss": 0.08653046935796738, | |
| "eval_mean_token_accuracy": 0.9788935940657089, | |
| "eval_num_tokens": 22505491.0, | |
| "eval_runtime": 327.1481, | |
| "eval_samples_per_second": 4.915, | |
| "eval_steps_per_second": 0.614, | |
| "step": 3600 | |
| }, | |
| { | |
| "entropy": 2.0061341017484664, | |
| "epoch": 3.1282773564463704, | |
| "grad_norm": 0.17698237299919128, | |
| "learning_rate": 6.499620642114117e-06, | |
| "loss": 0.022867996990680695, | |
| "mean_token_accuracy": 0.9916748866438866, | |
| "num_tokens": 22571460.0, | |
| "step": 3610 | |
| }, | |
| { | |
| "entropy": 1.9561231464147568, | |
| "epoch": 3.1369447453954495, | |
| "grad_norm": 2.200025796890259, | |
| "learning_rate": 6.4470877757347925e-06, | |
| "loss": 0.025290462374687194, | |
| "mean_token_accuracy": 0.9868748232722282, | |
| "num_tokens": 22633373.0, | |
| "step": 3620 | |
| }, | |
| { | |
| "entropy": 1.9883778482675551, | |
| "epoch": 3.1456121343445287, | |
| "grad_norm": 1.4036747217178345, | |
| "learning_rate": 6.394666886057234e-06, | |
| "loss": 0.03302829265594483, | |
| "mean_token_accuracy": 0.9855715438723565, | |
| "num_tokens": 22699790.0, | |
| "step": 3630 | |
| }, | |
| { | |
| "entropy": 2.028902477025986, | |
| "epoch": 3.154279523293608, | |
| "grad_norm": 2.978290557861328, | |
| "learning_rate": 6.34235962522424e-06, | |
| "loss": 0.04505385160446167, | |
| "mean_token_accuracy": 0.9882813230156898, | |
| "num_tokens": 22760617.0, | |
| "step": 3640 | |
| }, | |
| { | |
| "entropy": 1.9538985759019851, | |
| "epoch": 3.162946912242687, | |
| "grad_norm": 2.2208809852600098, | |
| "learning_rate": 6.290167641797373e-06, | |
| "loss": 0.027484691143035887, | |
| "mean_token_accuracy": 0.9884011939167976, | |
| "num_tokens": 22828652.0, | |
| "step": 3650 | |
| }, | |
| { | |
| "entropy": 1.9391920119524002, | |
| "epoch": 3.171614301191766, | |
| "grad_norm": 2.3642702102661133, | |
| "learning_rate": 6.23809258070502e-06, | |
| "loss": 0.08644394278526306, | |
| "mean_token_accuracy": 0.9805887296795845, | |
| "num_tokens": 22897137.0, | |
| "step": 3660 | |
| }, | |
| { | |
| "entropy": 2.052844101190567, | |
| "epoch": 3.1802816901408453, | |
| "grad_norm": 0.271776020526886, | |
| "learning_rate": 6.186136083190534e-06, | |
| "loss": 0.026084551215171815, | |
| "mean_token_accuracy": 0.9889581605792046, | |
| "num_tokens": 22961566.0, | |
| "step": 3670 | |
| }, | |
| { | |
| "entropy": 1.9666710525751114, | |
| "epoch": 3.188949079089924, | |
| "grad_norm": 2.292097806930542, | |
| "learning_rate": 6.134299786760523e-06, | |
| "loss": 0.029993349313735963, | |
| "mean_token_accuracy": 0.9866111233830452, | |
| "num_tokens": 23032145.0, | |
| "step": 3680 | |
| }, | |
| { | |
| "entropy": 1.9898767739534378, | |
| "epoch": 3.197616468039003, | |
| "grad_norm": 0.5140994191169739, | |
| "learning_rate": 6.082585325133222e-06, | |
| "loss": 0.01786961853504181, | |
| "mean_token_accuracy": 0.9936378210783005, | |
| "num_tokens": 23096505.0, | |
| "step": 3690 | |
| }, | |
| { | |
| "entropy": 2.0351445108652113, | |
| "epoch": 3.2062838569880823, | |
| "grad_norm": 2.1874489784240723, | |
| "learning_rate": 6.030994328187023e-06, | |
| "loss": 0.015171639621257782, | |
| "mean_token_accuracy": 0.9934789076447487, | |
| "num_tokens": 23159233.0, | |
| "step": 3700 | |
| }, | |
| { | |
| "epoch": 3.2062838569880823, | |
| "eval_entropy": 1.9617518720342153, | |
| "eval_loss": 0.08715828508138657, | |
| "eval_mean_token_accuracy": 0.9805069438260586, | |
| "eval_num_tokens": 23159233.0, | |
| "eval_runtime": 326.8014, | |
| "eval_samples_per_second": 4.92, | |
| "eval_steps_per_second": 0.615, | |
| "step": 3700 | |
| }, | |
| { | |
| "entropy": 2.0274400532245638, | |
| "epoch": 3.2149512459371614, | |
| "grad_norm": 0.12795260548591614, | |
| "learning_rate": 5.979528421909089e-06, | |
| "loss": 0.03491283059120178, | |
| "mean_token_accuracy": 0.9888436004519463, | |
| "num_tokens": 23219168.0, | |
| "step": 3710 | |
| }, | |
| { | |
| "entropy": 2.0637706756591796, | |
| "epoch": 3.2236186348862406, | |
| "grad_norm": 2.057122230529785, | |
| "learning_rate": 5.928189228344121e-06, | |
| "loss": 0.02740119695663452, | |
| "mean_token_accuracy": 0.992508827149868, | |
| "num_tokens": 23280186.0, | |
| "step": 3720 | |
| }, | |
| { | |
| "entropy": 2.0003860145807266, | |
| "epoch": 3.2322860238353197, | |
| "grad_norm": 2.19740891456604, | |
| "learning_rate": 5.876978365543227e-06, | |
| "loss": 0.03788390457630157, | |
| "mean_token_accuracy": 0.9878378629684448, | |
| "num_tokens": 23344128.0, | |
| "step": 3730 | |
| }, | |
| { | |
| "entropy": 2.001324808597565, | |
| "epoch": 3.240953412784399, | |
| "grad_norm": 1.5126818418502808, | |
| "learning_rate": 5.825897447512929e-06, | |
| "loss": 0.026940053701400755, | |
| "mean_token_accuracy": 0.9857806503772736, | |
| "num_tokens": 23403909.0, | |
| "step": 3740 | |
| }, | |
| { | |
| "entropy": 1.9464641511440277, | |
| "epoch": 3.249620801733478, | |
| "grad_norm": 3.0997378826141357, | |
| "learning_rate": 5.7749480841643065e-06, | |
| "loss": 0.043919849395751956, | |
| "mean_token_accuracy": 0.9916449174284935, | |
| "num_tokens": 23476336.0, | |
| "step": 3750 | |
| }, | |
| { | |
| "entropy": 1.9618077039718629, | |
| "epoch": 3.2582881906825567, | |
| "grad_norm": 0.05529231205582619, | |
| "learning_rate": 5.7241318812622294e-06, | |
| "loss": 0.03365751802921295, | |
| "mean_token_accuracy": 0.9872692510485649, | |
| "num_tokens": 23547474.0, | |
| "step": 3760 | |
| }, | |
| { | |
| "entropy": 2.021110999584198, | |
| "epoch": 3.266955579631636, | |
| "grad_norm": 0.5656824111938477, | |
| "learning_rate": 5.673450440374771e-06, | |
| "loss": 0.027200946211814882, | |
| "mean_token_accuracy": 0.9951310992240906, | |
| "num_tokens": 23607028.0, | |
| "step": 3770 | |
| }, | |
| { | |
| "entropy": 2.020348605513573, | |
| "epoch": 3.275622968580715, | |
| "grad_norm": 0.7680350542068481, | |
| "learning_rate": 5.622905358822745e-06, | |
| "loss": 0.02666248381137848, | |
| "mean_token_accuracy": 0.9923866346478463, | |
| "num_tokens": 23669610.0, | |
| "step": 3780 | |
| }, | |
| { | |
| "entropy": 2.0156673580408095, | |
| "epoch": 3.284290357529794, | |
| "grad_norm": 1.909304141998291, | |
| "learning_rate": 5.5724982296293165e-06, | |
| "loss": 0.04042408764362335, | |
| "mean_token_accuracy": 0.9617922022938729, | |
| "num_tokens": 23729250.0, | |
| "step": 3790 | |
| }, | |
| { | |
| "entropy": 2.045342218875885, | |
| "epoch": 3.2929577464788733, | |
| "grad_norm": 4.081718921661377, | |
| "learning_rate": 5.522230641469839e-06, | |
| "loss": 0.06637139916419983, | |
| "mean_token_accuracy": 0.9821502983570098, | |
| "num_tokens": 23787630.0, | |
| "step": 3800 | |
| }, | |
| { | |
| "epoch": 3.2929577464788733, | |
| "eval_entropy": 1.9523134711963028, | |
| "eval_loss": 0.0881609246134758, | |
| "eval_mean_token_accuracy": 0.9801165203549969, | |
| "eval_num_tokens": 23787630.0, | |
| "eval_runtime": 326.5268, | |
| "eval_samples_per_second": 4.925, | |
| "eval_steps_per_second": 0.616, | |
| "step": 3800 | |
| }, | |
| { | |
| "entropy": 1.9851083979010582, | |
| "epoch": 3.3016251354279524, | |
| "grad_norm": 1.2768914699554443, | |
| "learning_rate": 5.4721041786217664e-06, | |
| "loss": 0.01877579987049103, | |
| "mean_token_accuracy": 0.9903293594717979, | |
| "num_tokens": 23849358.0, | |
| "step": 3810 | |
| }, | |
| { | |
| "entropy": 1.992839914560318, | |
| "epoch": 3.3102925243770316, | |
| "grad_norm": 0.9319987297058105, | |
| "learning_rate": 5.4221204209147245e-06, | |
| "loss": 0.02209160178899765, | |
| "mean_token_accuracy": 0.9930718123912812, | |
| "num_tokens": 23917856.0, | |
| "step": 3820 | |
| }, | |
| { | |
| "entropy": 2.0340360194444655, | |
| "epoch": 3.3189599133261103, | |
| "grad_norm": 0.6358506083488464, | |
| "learning_rate": 5.37228094368071e-06, | |
| "loss": 0.027576690912246703, | |
| "mean_token_accuracy": 0.9949217200279236, | |
| "num_tokens": 23980446.0, | |
| "step": 3830 | |
| }, | |
| { | |
| "entropy": 2.010609117150307, | |
| "epoch": 3.3276273022751894, | |
| "grad_norm": 0.470706045627594, | |
| "learning_rate": 5.322587317704457e-06, | |
| "loss": 0.04823949933052063, | |
| "mean_token_accuracy": 0.9822644203901291, | |
| "num_tokens": 24039428.0, | |
| "step": 3840 | |
| }, | |
| { | |
| "entropy": 2.0939511328935625, | |
| "epoch": 3.3362946912242686, | |
| "grad_norm": 0.6235988736152649, | |
| "learning_rate": 5.273041109173924e-06, | |
| "loss": 0.02635287344455719, | |
| "mean_token_accuracy": 0.9920800253748894, | |
| "num_tokens": 24090921.0, | |
| "step": 3850 | |
| }, | |
| { | |
| "entropy": 2.059076651930809, | |
| "epoch": 3.3449620801733477, | |
| "grad_norm": 0.25911229848861694, | |
| "learning_rate": 5.223643879630934e-06, | |
| "loss": 0.046140000224113464, | |
| "mean_token_accuracy": 0.9801433801651, | |
| "num_tokens": 24151706.0, | |
| "step": 3860 | |
| }, | |
| { | |
| "entropy": 2.00682270526886, | |
| "epoch": 3.353629469122427, | |
| "grad_norm": 1.7312122583389282, | |
| "learning_rate": 5.174397185921945e-06, | |
| "loss": 0.02391643971204758, | |
| "mean_token_accuracy": 0.9928232997655868, | |
| "num_tokens": 24211495.0, | |
| "step": 3870 | |
| }, | |
| { | |
| "entropy": 2.070136883854866, | |
| "epoch": 3.362296858071506, | |
| "grad_norm": 0.5971741676330566, | |
| "learning_rate": 5.1253025801490044e-06, | |
| "loss": 0.03489409387111664, | |
| "mean_token_accuracy": 0.9879992380738258, | |
| "num_tokens": 24271202.0, | |
| "step": 3880 | |
| }, | |
| { | |
| "entropy": 2.0464351683855058, | |
| "epoch": 3.370964247020585, | |
| "grad_norm": 0.03958556801080704, | |
| "learning_rate": 5.076361609620829e-06, | |
| "loss": 0.027960905432701112, | |
| "mean_token_accuracy": 0.9936666667461396, | |
| "num_tokens": 24329539.0, | |
| "step": 3890 | |
| }, | |
| { | |
| "entropy": 1.9829755246639251, | |
| "epoch": 3.3796316359696643, | |
| "grad_norm": 4.082634925842285, | |
| "learning_rate": 5.027575816804016e-06, | |
| "loss": 0.030048039555549622, | |
| "mean_token_accuracy": 0.981467804312706, | |
| "num_tokens": 24395139.0, | |
| "step": 3900 | |
| }, | |
| { | |
| "epoch": 3.3796316359696643, | |
| "eval_entropy": 1.9591931365615693, | |
| "eval_loss": 0.08941441029310226, | |
| "eval_mean_token_accuracy": 0.9792530948842936, | |
| "eval_num_tokens": 24395139.0, | |
| "eval_runtime": 327.1897, | |
| "eval_samples_per_second": 4.915, | |
| "eval_steps_per_second": 0.614, | |
| "step": 3900 | |
| }, | |
| { | |
| "entropy": 2.0075402826070787, | |
| "epoch": 3.3882990249187435, | |
| "grad_norm": 0.6755623817443848, | |
| "learning_rate": 4.978946739274459e-06, | |
| "loss": 0.03598732650279999, | |
| "mean_token_accuracy": 0.9913191378116608, | |
| "num_tokens": 24454872.0, | |
| "step": 3910 | |
| }, | |
| { | |
| "entropy": 1.9580432906746865, | |
| "epoch": 3.396966413867822, | |
| "grad_norm": 1.2158863544464111, | |
| "learning_rate": 4.930475909668872e-06, | |
| "loss": 0.026130232214927673, | |
| "mean_token_accuracy": 0.9921944439411163, | |
| "num_tokens": 24521370.0, | |
| "step": 3920 | |
| }, | |
| { | |
| "entropy": 2.0222324401140215, | |
| "epoch": 3.4056338028169013, | |
| "grad_norm": 0.8751219511032104, | |
| "learning_rate": 4.882164855636487e-06, | |
| "loss": 0.02552185356616974, | |
| "mean_token_accuracy": 0.9933805853128433, | |
| "num_tokens": 24576883.0, | |
| "step": 3930 | |
| }, | |
| { | |
| "entropy": 2.0704391270875933, | |
| "epoch": 3.4143011917659805, | |
| "grad_norm": 2.4434635639190674, | |
| "learning_rate": 4.834015099790906e-06, | |
| "loss": 0.028062695264816286, | |
| "mean_token_accuracy": 0.9894948095083237, | |
| "num_tokens": 24633751.0, | |
| "step": 3940 | |
| }, | |
| { | |
| "entropy": 1.970983825623989, | |
| "epoch": 3.4229685807150596, | |
| "grad_norm": 0.634064793586731, | |
| "learning_rate": 4.786028159662117e-06, | |
| "loss": 0.04279245436191559, | |
| "mean_token_accuracy": 0.9896366760134697, | |
| "num_tokens": 24701133.0, | |
| "step": 3950 | |
| }, | |
| { | |
| "entropy": 2.004913279414177, | |
| "epoch": 3.4316359696641388, | |
| "grad_norm": 0.3501166105270386, | |
| "learning_rate": 4.738205547648672e-06, | |
| "loss": 0.042440015077590945, | |
| "mean_token_accuracy": 0.9844118610024453, | |
| "num_tokens": 24762905.0, | |
| "step": 3960 | |
| }, | |
| { | |
| "entropy": 2.072259470820427, | |
| "epoch": 3.440303358613218, | |
| "grad_norm": 3.5003762245178223, | |
| "learning_rate": 4.6905487709700085e-06, | |
| "loss": 0.047236514091491696, | |
| "mean_token_accuracy": 0.9868312641978264, | |
| "num_tokens": 24818283.0, | |
| "step": 3970 | |
| }, | |
| { | |
| "entropy": 2.02927243411541, | |
| "epoch": 3.448970747562297, | |
| "grad_norm": 1.2803966999053955, | |
| "learning_rate": 4.643059331618944e-06, | |
| "loss": 0.0166587769985199, | |
| "mean_token_accuracy": 0.9939999803900719, | |
| "num_tokens": 24878209.0, | |
| "step": 3980 | |
| }, | |
| { | |
| "entropy": 2.0472301214933397, | |
| "epoch": 3.4576381365113757, | |
| "grad_norm": 4.2303385734558105, | |
| "learning_rate": 4.59573872631436e-06, | |
| "loss": 0.01939603090286255, | |
| "mean_token_accuracy": 0.9944044515490532, | |
| "num_tokens": 24938597.0, | |
| "step": 3990 | |
| }, | |
| { | |
| "entropy": 1.9953694552183152, | |
| "epoch": 3.466305525460455, | |
| "grad_norm": 0.3093803822994232, | |
| "learning_rate": 4.548588446454008e-06, | |
| "loss": 0.037383252382278444, | |
| "mean_token_accuracy": 0.9848104313015937, | |
| "num_tokens": 25006002.0, | |
| "step": 4000 | |
| }, | |
| { | |
| "epoch": 3.466305525460455, | |
| "eval_entropy": 1.9465392015466643, | |
| "eval_loss": 0.08806028217077255, | |
| "eval_mean_token_accuracy": 0.9801172311626264, | |
| "eval_num_tokens": 25006002.0, | |
| "eval_runtime": 326.7668, | |
| "eval_samples_per_second": 4.921, | |
| "eval_steps_per_second": 0.615, | |
| "step": 4000 | |
| }, | |
| { | |
| "entropy": 2.0333161488175393, | |
| "epoch": 3.474972914409534, | |
| "grad_norm": 2.100350856781006, | |
| "learning_rate": 4.501609978067516e-06, | |
| "loss": 0.026050877571105958, | |
| "mean_token_accuracy": 0.9908463016152382, | |
| "num_tokens": 25066917.0, | |
| "step": 4010 | |
| }, | |
| { | |
| "entropy": 2.017795702815056, | |
| "epoch": 3.483640303358613, | |
| "grad_norm": 1.7681386470794678, | |
| "learning_rate": 4.454804801769546e-06, | |
| "loss": 0.020292817056179045, | |
| "mean_token_accuracy": 0.9933481246232987, | |
| "num_tokens": 25137437.0, | |
| "step": 4020 | |
| }, | |
| { | |
| "entropy": 1.9617122411727905, | |
| "epoch": 3.4923076923076923, | |
| "grad_norm": 1.2674654722213745, | |
| "learning_rate": 4.408174392713138e-06, | |
| "loss": 0.02206308990716934, | |
| "mean_token_accuracy": 0.9935388684272766, | |
| "num_tokens": 25210243.0, | |
| "step": 4030 | |
| }, | |
| { | |
| "entropy": 2.023272916674614, | |
| "epoch": 3.5009750812567715, | |
| "grad_norm": 2.1518187522888184, | |
| "learning_rate": 4.361720220543215e-06, | |
| "loss": 0.021042007207870483, | |
| "mean_token_accuracy": 0.9917860701680183, | |
| "num_tokens": 25269681.0, | |
| "step": 4040 | |
| }, | |
| { | |
| "entropy": 1.9716553181409835, | |
| "epoch": 3.5096424702058506, | |
| "grad_norm": 1.2463315725326538, | |
| "learning_rate": 4.315443749350268e-06, | |
| "loss": 0.03910002112388611, | |
| "mean_token_accuracy": 0.9899544030427933, | |
| "num_tokens": 25334274.0, | |
| "step": 4050 | |
| }, | |
| { | |
| "entropy": 2.015067180991173, | |
| "epoch": 3.5183098591549298, | |
| "grad_norm": 0.2211289405822754, | |
| "learning_rate": 4.269346437624192e-06, | |
| "loss": 0.03428694009780884, | |
| "mean_token_accuracy": 0.9854496344923973, | |
| "num_tokens": 25397672.0, | |
| "step": 4060 | |
| }, | |
| { | |
| "entropy": 2.032247778773308, | |
| "epoch": 3.526977248104009, | |
| "grad_norm": 1.6791901588439941, | |
| "learning_rate": 4.223429738208351e-06, | |
| "loss": 0.01901150345802307, | |
| "mean_token_accuracy": 0.9931851238012314, | |
| "num_tokens": 25460938.0, | |
| "step": 4070 | |
| }, | |
| { | |
| "entropy": 1.9478510588407516, | |
| "epoch": 3.5356446370530876, | |
| "grad_norm": 0.3655602037906647, | |
| "learning_rate": 4.177695098253766e-06, | |
| "loss": 0.016408833861351012, | |
| "mean_token_accuracy": 0.9949289828538894, | |
| "num_tokens": 25531511.0, | |
| "step": 4080 | |
| }, | |
| { | |
| "entropy": 2.017333817481995, | |
| "epoch": 3.5443120260021668, | |
| "grad_norm": 2.554927349090576, | |
| "learning_rate": 4.132143959173517e-06, | |
| "loss": 0.033222931623458865, | |
| "mean_token_accuracy": 0.9914083287119866, | |
| "num_tokens": 25596302.0, | |
| "step": 4090 | |
| }, | |
| { | |
| "entropy": 1.9841288179159164, | |
| "epoch": 3.552979414951246, | |
| "grad_norm": 8.13968563079834, | |
| "learning_rate": 4.086777756597299e-06, | |
| "loss": 0.039189353585243225, | |
| "mean_token_accuracy": 0.9884973883628845, | |
| "num_tokens": 25659371.0, | |
| "step": 4100 | |
| }, | |
| { | |
| "epoch": 3.552979414951246, | |
| "eval_entropy": 1.9524362116903808, | |
| "eval_loss": 0.08749101310968399, | |
| "eval_mean_token_accuracy": 0.9797243757627496, | |
| "eval_num_tokens": 25659371.0, | |
| "eval_runtime": 326.6545, | |
| "eval_samples_per_second": 4.923, | |
| "eval_steps_per_second": 0.615, | |
| "step": 4100 | |
| }, | |
| { | |
| "entropy": 2.0628657907247545, | |
| "epoch": 3.561646803900325, | |
| "grad_norm": 0.14109309017658234, | |
| "learning_rate": 4.0415979203261946e-06, | |
| "loss": 0.0225689560174942, | |
| "mean_token_accuracy": 0.9902002736926079, | |
| "num_tokens": 25718185.0, | |
| "step": 4110 | |
| }, | |
| { | |
| "entropy": 2.007545919716358, | |
| "epoch": 3.570314192849404, | |
| "grad_norm": 0.3464651107788086, | |
| "learning_rate": 3.9966058742876e-06, | |
| "loss": 0.02009371221065521, | |
| "mean_token_accuracy": 0.9955977171659469, | |
| "num_tokens": 25780142.0, | |
| "step": 4120 | |
| }, | |
| { | |
| "entropy": 2.0243140310049057, | |
| "epoch": 3.5789815817984834, | |
| "grad_norm": 2.1290290355682373, | |
| "learning_rate": 3.95180303649035e-06, | |
| "loss": 0.02304726988077164, | |
| "mean_token_accuracy": 0.9939990416169167, | |
| "num_tokens": 25839881.0, | |
| "step": 4130 | |
| }, | |
| { | |
| "entropy": 2.0234414398670197, | |
| "epoch": 3.587648970747562, | |
| "grad_norm": 0.014731453731656075, | |
| "learning_rate": 3.907190818980026e-06, | |
| "loss": 0.050000560283660886, | |
| "mean_token_accuracy": 0.9866971537470818, | |
| "num_tokens": 25902869.0, | |
| "step": 4140 | |
| }, | |
| { | |
| "entropy": 2.0233711034059523, | |
| "epoch": 3.596316359696641, | |
| "grad_norm": 3.3977596759796143, | |
| "learning_rate": 3.862770627794453e-06, | |
| "loss": 0.0322685718536377, | |
| "mean_token_accuracy": 0.9900472685694695, | |
| "num_tokens": 25965513.0, | |
| "step": 4150 | |
| }, | |
| { | |
| "entropy": 2.0063869461417196, | |
| "epoch": 3.6049837486457204, | |
| "grad_norm": 2.6405301094055176, | |
| "learning_rate": 3.818543862919387e-06, | |
| "loss": 0.014192065596580506, | |
| "mean_token_accuracy": 0.9960492521524429, | |
| "num_tokens": 26023436.0, | |
| "step": 4160 | |
| }, | |
| { | |
| "entropy": 2.035813573002815, | |
| "epoch": 3.6136511375947995, | |
| "grad_norm": 0.14692693948745728, | |
| "learning_rate": 3.7745119182443845e-06, | |
| "loss": 0.013922086358070374, | |
| "mean_token_accuracy": 0.9962173581123352, | |
| "num_tokens": 26085809.0, | |
| "step": 4170 | |
| }, | |
| { | |
| "entropy": 1.9604667097330093, | |
| "epoch": 3.6223185265438786, | |
| "grad_norm": 2.886298418045044, | |
| "learning_rate": 3.730676181518883e-06, | |
| "loss": 0.02352510243654251, | |
| "mean_token_accuracy": 0.9951101526618004, | |
| "num_tokens": 26154928.0, | |
| "step": 4180 | |
| }, | |
| { | |
| "entropy": 2.037091489136219, | |
| "epoch": 3.630985915492958, | |
| "grad_norm": 0.3143669366836548, | |
| "learning_rate": 3.687038034308459e-06, | |
| "loss": 0.025397229194641113, | |
| "mean_token_accuracy": 0.9937299221754075, | |
| "num_tokens": 26209579.0, | |
| "step": 4190 | |
| }, | |
| { | |
| "entropy": 1.8821268051862716, | |
| "epoch": 3.639653304442037, | |
| "grad_norm": 2.5476582050323486, | |
| "learning_rate": 3.6435988519512844e-06, | |
| "loss": 0.018459653854370116, | |
| "mean_token_accuracy": 0.9935011580586434, | |
| "num_tokens": 26284212.0, | |
| "step": 4200 | |
| }, | |
| { | |
| "epoch": 3.639653304442037, | |
| "eval_entropy": 1.9587232580232383, | |
| "eval_loss": 0.08999490737915039, | |
| "eval_mean_token_accuracy": 0.9799567007306796, | |
| "eval_num_tokens": 26284212.0, | |
| "eval_runtime": 326.9787, | |
| "eval_samples_per_second": 4.918, | |
| "eval_steps_per_second": 0.615, | |
| "step": 4200 | |
| }, | |
| { | |
| "entropy": 2.0751129180192946, | |
| "epoch": 3.648320693391116, | |
| "grad_norm": 0.25621309876441956, | |
| "learning_rate": 3.600360003514772e-06, | |
| "loss": 0.05827196836471558, | |
| "mean_token_accuracy": 0.978828464448452, | |
| "num_tokens": 26344861.0, | |
| "step": 4210 | |
| }, | |
| { | |
| "entropy": 2.016257882118225, | |
| "epoch": 3.6569880823401952, | |
| "grad_norm": 0.23999305069446564, | |
| "learning_rate": 3.5573228517524437e-06, | |
| "loss": 0.01675285995006561, | |
| "mean_token_accuracy": 0.9950248003005981, | |
| "num_tokens": 26412096.0, | |
| "step": 4220 | |
| }, | |
| { | |
| "entropy": 2.011643001437187, | |
| "epoch": 3.6656554712892744, | |
| "grad_norm": 1.2057989835739136, | |
| "learning_rate": 3.5144887530609683e-06, | |
| "loss": 0.022135333716869356, | |
| "mean_token_accuracy": 0.9908907547593117, | |
| "num_tokens": 26473508.0, | |
| "step": 4230 | |
| }, | |
| { | |
| "entropy": 2.0545772433280947, | |
| "epoch": 3.674322860238353, | |
| "grad_norm": 1.1900558471679688, | |
| "learning_rate": 3.471859057437421e-06, | |
| "loss": 0.0230675607919693, | |
| "mean_token_accuracy": 0.9927938759326935, | |
| "num_tokens": 26536200.0, | |
| "step": 4240 | |
| }, | |
| { | |
| "entropy": 2.0200571775436402, | |
| "epoch": 3.6829902491874322, | |
| "grad_norm": 0.5839977860450745, | |
| "learning_rate": 3.4294351084367184e-06, | |
| "loss": 0.03541991114616394, | |
| "mean_token_accuracy": 0.9827380672097206, | |
| "num_tokens": 26593855.0, | |
| "step": 4250 | |
| }, | |
| { | |
| "entropy": 2.008121719956398, | |
| "epoch": 3.6916576381365114, | |
| "grad_norm": 4.034195423126221, | |
| "learning_rate": 3.3872182431292968e-06, | |
| "loss": 0.04164910316467285, | |
| "mean_token_accuracy": 0.98883635699749, | |
| "num_tokens": 26657227.0, | |
| "step": 4260 | |
| }, | |
| { | |
| "entropy": 2.045969045162201, | |
| "epoch": 3.7003250270855905, | |
| "grad_norm": 2.9138400554656982, | |
| "learning_rate": 3.3452097920589587e-06, | |
| "loss": 0.01186869889497757, | |
| "mean_token_accuracy": 0.995833332836628, | |
| "num_tokens": 26714896.0, | |
| "step": 4270 | |
| }, | |
| { | |
| "entropy": 2.0022309213876723, | |
| "epoch": 3.7089924160346697, | |
| "grad_norm": 2.3397390842437744, | |
| "learning_rate": 3.3034110792009353e-06, | |
| "loss": 0.033094662427902224, | |
| "mean_token_accuracy": 0.9868162363767624, | |
| "num_tokens": 26782122.0, | |
| "step": 4280 | |
| }, | |
| { | |
| "entropy": 1.970974361896515, | |
| "epoch": 3.7176598049837484, | |
| "grad_norm": 0.0644071027636528, | |
| "learning_rate": 3.2618234219201704e-06, | |
| "loss": 0.02641391158103943, | |
| "mean_token_accuracy": 0.9948458999395371, | |
| "num_tokens": 26853663.0, | |
| "step": 4290 | |
| }, | |
| { | |
| "entropy": 2.073245695233345, | |
| "epoch": 3.7263271939328275, | |
| "grad_norm": 0.4545290470123291, | |
| "learning_rate": 3.220448130929793e-06, | |
| "loss": 0.03868321180343628, | |
| "mean_token_accuracy": 0.9880670920014382, | |
| "num_tokens": 26907980.0, | |
| "step": 4300 | |
| }, | |
| { | |
| "epoch": 3.7263271939328275, | |
| "eval_entropy": 1.9598178709324319, | |
| "eval_loss": 0.08660746365785599, | |
| "eval_mean_token_accuracy": 0.9800613602595543, | |
| "eval_num_tokens": 26907980.0, | |
| "eval_runtime": 326.8085, | |
| "eval_samples_per_second": 4.92, | |
| "eval_steps_per_second": 0.615, | |
| "step": 4300 | |
| }, | |
| { | |
| "entropy": 2.106029862165451, | |
| "epoch": 3.7349945828819067, | |
| "grad_norm": 5.831691741943359, | |
| "learning_rate": 3.1792865102498105e-06, | |
| "loss": 0.043834912776947024, | |
| "mean_token_accuracy": 0.9932289361953736, | |
| "num_tokens": 26971535.0, | |
| "step": 4310 | |
| }, | |
| { | |
| "entropy": 2.001392534375191, | |
| "epoch": 3.743661971830986, | |
| "grad_norm": 1.1307673454284668, | |
| "learning_rate": 3.1383398571660017e-06, | |
| "loss": 0.015590465068817139, | |
| "mean_token_accuracy": 0.9919345244765282, | |
| "num_tokens": 27040212.0, | |
| "step": 4320 | |
| }, | |
| { | |
| "entropy": 2.0088124960660934, | |
| "epoch": 3.752329360780065, | |
| "grad_norm": 1.474653959274292, | |
| "learning_rate": 3.0976094621890485e-06, | |
| "loss": 0.0228209063410759, | |
| "mean_token_accuracy": 0.9975250825285912, | |
| "num_tokens": 27103701.0, | |
| "step": 4330 | |
| }, | |
| { | |
| "entropy": 2.0691784262657165, | |
| "epoch": 3.760996749729144, | |
| "grad_norm": 0.13686347007751465, | |
| "learning_rate": 3.0570966090138467e-06, | |
| "loss": 0.03443102836608887, | |
| "mean_token_accuracy": 0.991241104900837, | |
| "num_tokens": 27166073.0, | |
| "step": 4340 | |
| }, | |
| { | |
| "entropy": 2.037180745601654, | |
| "epoch": 3.7696641386782233, | |
| "grad_norm": 0.07159221917390823, | |
| "learning_rate": 3.0168025744790576e-06, | |
| "loss": 0.036087846755981444, | |
| "mean_token_accuracy": 0.9858055546879768, | |
| "num_tokens": 27227475.0, | |
| "step": 4350 | |
| }, | |
| { | |
| "entropy": 2.0310893684625624, | |
| "epoch": 3.7783315276273024, | |
| "grad_norm": 0.6335000991821289, | |
| "learning_rate": 2.9767286285268535e-06, | |
| "loss": 0.06315004825592041, | |
| "mean_token_accuracy": 0.9883092626929283, | |
| "num_tokens": 27292889.0, | |
| "step": 4360 | |
| }, | |
| { | |
| "entropy": 2.092084974050522, | |
| "epoch": 3.7869989165763815, | |
| "grad_norm": 1.302903413772583, | |
| "learning_rate": 2.9368760341629097e-06, | |
| "loss": 0.02792898118495941, | |
| "mean_token_accuracy": 0.9912491559982299, | |
| "num_tokens": 27348266.0, | |
| "step": 4370 | |
| }, | |
| { | |
| "entropy": 2.060304436087608, | |
| "epoch": 3.7956663055254607, | |
| "grad_norm": 0.4250950515270233, | |
| "learning_rate": 2.897246047416589e-06, | |
| "loss": 0.028717631101608278, | |
| "mean_token_accuracy": 0.996091590821743, | |
| "num_tokens": 27405982.0, | |
| "step": 4380 | |
| }, | |
| { | |
| "entropy": 2.083743101358414, | |
| "epoch": 3.8043336944745394, | |
| "grad_norm": 3.3967700004577637, | |
| "learning_rate": 2.8578399173013572e-06, | |
| "loss": 0.08340678811073303, | |
| "mean_token_accuracy": 0.9754736825823784, | |
| "num_tokens": 27463260.0, | |
| "step": 4390 | |
| }, | |
| { | |
| "entropy": 1.9716408044099807, | |
| "epoch": 3.8130010834236185, | |
| "grad_norm": 0.5757962465286255, | |
| "learning_rate": 2.818658885775414e-06, | |
| "loss": 0.013928134739398957, | |
| "mean_token_accuracy": 0.9954588785767555, | |
| "num_tokens": 27528099.0, | |
| "step": 4400 | |
| }, | |
| { | |
| "epoch": 3.8130010834236185, | |
| "eval_entropy": 1.9703540167405238, | |
| "eval_loss": 0.08586890250444412, | |
| "eval_mean_token_accuracy": 0.9799414511343733, | |
| "eval_num_tokens": 27528099.0, | |
| "eval_runtime": 326.7346, | |
| "eval_samples_per_second": 4.921, | |
| "eval_steps_per_second": 0.615, | |
| "step": 4400 | |
| }, | |
| { | |
| "entropy": 1.9763288021087646, | |
| "epoch": 3.8216684723726977, | |
| "grad_norm": 0.44175952672958374, | |
| "learning_rate": 2.7797041877025565e-06, | |
| "loss": 0.028418776392936707, | |
| "mean_token_accuracy": 0.989984379708767, | |
| "num_tokens": 27596380.0, | |
| "step": 4410 | |
| }, | |
| { | |
| "entropy": 2.0026954263448715, | |
| "epoch": 3.830335861321777, | |
| "grad_norm": 0.5693495869636536, | |
| "learning_rate": 2.7409770508132605e-06, | |
| "loss": 0.043587663769721986, | |
| "mean_token_accuracy": 0.9874644920229911, | |
| "num_tokens": 27656613.0, | |
| "step": 4420 | |
| }, | |
| { | |
| "entropy": 1.9414435267448424, | |
| "epoch": 3.839003250270856, | |
| "grad_norm": 4.053891658782959, | |
| "learning_rate": 2.7024786956659854e-06, | |
| "loss": 0.025079956650733946, | |
| "mean_token_accuracy": 0.9922862559556961, | |
| "num_tokens": 27726620.0, | |
| "step": 4430 | |
| }, | |
| { | |
| "entropy": 2.0779118567705153, | |
| "epoch": 3.847670639219935, | |
| "grad_norm": 0.06513004004955292, | |
| "learning_rate": 2.6642103356086933e-06, | |
| "loss": 0.022648689150810242, | |
| "mean_token_accuracy": 0.9921250343322754, | |
| "num_tokens": 27782546.0, | |
| "step": 4440 | |
| }, | |
| { | |
| "entropy": 2.052326163649559, | |
| "epoch": 3.856338028169014, | |
| "grad_norm": 2.3468716144561768, | |
| "learning_rate": 2.6261731767406296e-06, | |
| "loss": 0.041925692558288576, | |
| "mean_token_accuracy": 0.9881504774093628, | |
| "num_tokens": 27846707.0, | |
| "step": 4450 | |
| }, | |
| { | |
| "entropy": 1.968158569931984, | |
| "epoch": 3.865005417118093, | |
| "grad_norm": 0.15953290462493896, | |
| "learning_rate": 2.588368417874296e-06, | |
| "loss": 0.01032664328813553, | |
| "mean_token_accuracy": 0.9981753632426262, | |
| "num_tokens": 27915351.0, | |
| "step": 4460 | |
| }, | |
| { | |
| "entropy": 2.071339601278305, | |
| "epoch": 3.873672806067172, | |
| "grad_norm": 0.064334936439991, | |
| "learning_rate": 2.5507972504976774e-06, | |
| "loss": 0.05382372140884399, | |
| "mean_token_accuracy": 0.9884915590286255, | |
| "num_tokens": 27974044.0, | |
| "step": 4470 | |
| }, | |
| { | |
| "entropy": 2.0488192796707154, | |
| "epoch": 3.8823401950162513, | |
| "grad_norm": 0.23742307722568512, | |
| "learning_rate": 2.5134608587366695e-06, | |
| "loss": 0.030007198452949524, | |
| "mean_token_accuracy": 0.9883778721094132, | |
| "num_tokens": 28041557.0, | |
| "step": 4480 | |
| }, | |
| { | |
| "entropy": 2.0650737464427946, | |
| "epoch": 3.8910075839653304, | |
| "grad_norm": 0.2596496343612671, | |
| "learning_rate": 2.4763604193177913e-06, | |
| "loss": 0.023527370393276216, | |
| "mean_token_accuracy": 0.9875, | |
| "num_tokens": 28100710.0, | |
| "step": 4490 | |
| }, | |
| { | |
| "entropy": 2.0444571018218993, | |
| "epoch": 3.8996749729144096, | |
| "grad_norm": 0.31552854180336, | |
| "learning_rate": 2.4394971015310732e-06, | |
| "loss": 0.021546658873558045, | |
| "mean_token_accuracy": 0.993670429289341, | |
| "num_tokens": 28158419.0, | |
| "step": 4500 | |
| }, | |
| { | |
| "epoch": 3.8996749729144096, | |
| "eval_entropy": 1.9708711134260566, | |
| "eval_loss": 0.0864068791270256, | |
| "eval_mean_token_accuracy": 0.9796283820375281, | |
| "eval_num_tokens": 28158419.0, | |
| "eval_runtime": 326.9161, | |
| "eval_samples_per_second": 4.919, | |
| "eval_steps_per_second": 0.615, | |
| "step": 4500 | |
| }, | |
| { | |
| "entropy": 2.087741878628731, | |
| "epoch": 3.9083423618634887, | |
| "grad_norm": 0.23832260072231293, | |
| "learning_rate": 2.4028720671932047e-06, | |
| "loss": 0.054845225811004636, | |
| "mean_token_accuracy": 0.9857747331261635, | |
| "num_tokens": 28213762.0, | |
| "step": 4510 | |
| }, | |
| { | |
| "entropy": 2.0132829934358596, | |
| "epoch": 3.917009750812568, | |
| "grad_norm": 0.25584664940834045, | |
| "learning_rate": 2.366486470610936e-06, | |
| "loss": 0.01848226636648178, | |
| "mean_token_accuracy": 0.9928658232092857, | |
| "num_tokens": 28278471.0, | |
| "step": 4520 | |
| }, | |
| { | |
| "entropy": 2.045706260204315, | |
| "epoch": 3.925677139761647, | |
| "grad_norm": 2.5656206607818604, | |
| "learning_rate": 2.3303414585446805e-06, | |
| "loss": 0.022681842744350433, | |
| "mean_token_accuracy": 0.9910395190119743, | |
| "num_tokens": 28338647.0, | |
| "step": 4530 | |
| }, | |
| { | |
| "entropy": 1.99814330637455, | |
| "epoch": 3.934344528710726, | |
| "grad_norm": 0.9603461623191833, | |
| "learning_rate": 2.294438170172384e-06, | |
| "loss": 0.02413419634103775, | |
| "mean_token_accuracy": 0.9891596958041191, | |
| "num_tokens": 28410160.0, | |
| "step": 4540 | |
| }, | |
| { | |
| "entropy": 2.0732466995716097, | |
| "epoch": 3.943011917659805, | |
| "grad_norm": 1.4361649751663208, | |
| "learning_rate": 2.2587777370536056e-06, | |
| "loss": 0.037426996231079104, | |
| "mean_token_accuracy": 0.991052907705307, | |
| "num_tokens": 28467664.0, | |
| "step": 4550 | |
| }, | |
| { | |
| "entropy": 2.0532098948955535, | |
| "epoch": 3.951679306608884, | |
| "grad_norm": 2.0590333938598633, | |
| "learning_rate": 2.223361283093878e-06, | |
| "loss": 0.031706079840660095, | |
| "mean_token_accuracy": 0.9870526701211929, | |
| "num_tokens": 28527408.0, | |
| "step": 4560 | |
| }, | |
| { | |
| "entropy": 2.017728653550148, | |
| "epoch": 3.960346695557963, | |
| "grad_norm": 0.10862936824560165, | |
| "learning_rate": 2.188189924509262e-06, | |
| "loss": 0.02106429487466812, | |
| "mean_token_accuracy": 0.98840461820364, | |
| "num_tokens": 28587046.0, | |
| "step": 4570 | |
| }, | |
| { | |
| "entropy": 2.0349554061889648, | |
| "epoch": 3.9690140845070423, | |
| "grad_norm": 2.5669116973876953, | |
| "learning_rate": 2.153264769791188e-06, | |
| "loss": 0.04130597114562988, | |
| "mean_token_accuracy": 0.981039223074913, | |
| "num_tokens": 28646182.0, | |
| "step": 4580 | |
| }, | |
| { | |
| "entropy": 1.9828863322734833, | |
| "epoch": 3.9776814734561214, | |
| "grad_norm": 1.4713232517242432, | |
| "learning_rate": 2.1185869196714947e-06, | |
| "loss": 0.025165802240371703, | |
| "mean_token_accuracy": 0.9947456598281861, | |
| "num_tokens": 28714463.0, | |
| "step": 4590 | |
| }, | |
| { | |
| "entropy": 2.072134110331535, | |
| "epoch": 3.9863488624052006, | |
| "grad_norm": 2.247790575027466, | |
| "learning_rate": 2.084157467087765e-06, | |
| "loss": 0.021596594154834746, | |
| "mean_token_accuracy": 0.993795844912529, | |
| "num_tokens": 28775790.0, | |
| "step": 4600 | |
| }, | |
| { | |
| "epoch": 3.9863488624052006, | |
| "eval_entropy": 1.9691801563424258, | |
| "eval_loss": 0.08587238192558289, | |
| "eval_mean_token_accuracy": 0.9797982505304896, | |
| "eval_num_tokens": 28775790.0, | |
| "eval_runtime": 326.9013, | |
| "eval_samples_per_second": 4.919, | |
| "eval_steps_per_second": 0.615, | |
| "step": 4600 | |
| }, | |
| { | |
| "entropy": 2.0738868415355682, | |
| "epoch": 3.9950162513542793, | |
| "grad_norm": 0.9110870361328125, | |
| "learning_rate": 2.049977497148863e-06, | |
| "loss": 0.03904995024204254, | |
| "mean_token_accuracy": 0.985892140865326, | |
| "num_tokens": 28837387.0, | |
| "step": 4610 | |
| }, | |
| { | |
| "entropy": 2.030005083634303, | |
| "epoch": 4.003466955579632, | |
| "grad_norm": 0.24106350541114807, | |
| "learning_rate": 2.0160480871007316e-06, | |
| "loss": 0.01345173418521881, | |
| "mean_token_accuracy": 0.9953376727226453, | |
| "num_tokens": 28894661.0, | |
| "step": 4620 | |
| }, | |
| { | |
| "entropy": 2.007124736905098, | |
| "epoch": 4.012134344528711, | |
| "grad_norm": 0.5830142498016357, | |
| "learning_rate": 1.9823703062924584e-06, | |
| "loss": 0.006817830353975296, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 28962127.0, | |
| "step": 4630 | |
| }, | |
| { | |
| "entropy": 2.0393721789121626, | |
| "epoch": 4.02080173347779, | |
| "grad_norm": 0.5709890723228455, | |
| "learning_rate": 1.948945216142558e-06, | |
| "loss": 0.029663556814193727, | |
| "mean_token_accuracy": 0.9864947348833084, | |
| "num_tokens": 29027460.0, | |
| "step": 4640 | |
| }, | |
| { | |
| "entropy": 1.9643317103385924, | |
| "epoch": 4.029469122426869, | |
| "grad_norm": 1.7358582019805908, | |
| "learning_rate": 1.9157738701055283e-06, | |
| "loss": 0.008620598912239074, | |
| "mean_token_accuracy": 0.9963573709130287, | |
| "num_tokens": 29094613.0, | |
| "step": 4650 | |
| }, | |
| { | |
| "entropy": 2.0889448076486588, | |
| "epoch": 4.038136511375948, | |
| "grad_norm": 0.604278564453125, | |
| "learning_rate": 1.882857313638634e-06, | |
| "loss": 0.03244847357273102, | |
| "mean_token_accuracy": 0.9926116779446602, | |
| "num_tokens": 29150702.0, | |
| "step": 4660 | |
| }, | |
| { | |
| "entropy": 2.0580625355243685, | |
| "epoch": 4.046803900325027, | |
| "grad_norm": 1.5685875415802002, | |
| "learning_rate": 1.8501965841689807e-06, | |
| "loss": 0.0101649709045887, | |
| "mean_token_accuracy": 0.9972690224647522, | |
| "num_tokens": 29210797.0, | |
| "step": 4670 | |
| }, | |
| { | |
| "entropy": 1.9661096304655075, | |
| "epoch": 4.055471289274106, | |
| "grad_norm": 1.1568413972854614, | |
| "learning_rate": 1.8177927110607995e-06, | |
| "loss": 0.018484874069690703, | |
| "mean_token_accuracy": 0.9930728524923325, | |
| "num_tokens": 29278613.0, | |
| "step": 4680 | |
| }, | |
| { | |
| "entropy": 2.0536277323961256, | |
| "epoch": 4.064138678223185, | |
| "grad_norm": 0.721993088722229, | |
| "learning_rate": 1.7856467155830137e-06, | |
| "loss": 0.01394631266593933, | |
| "mean_token_accuracy": 0.9933244362473488, | |
| "num_tokens": 29338705.0, | |
| "step": 4690 | |
| }, | |
| { | |
| "entropy": 2.0374705642461777, | |
| "epoch": 4.072806067172264, | |
| "grad_norm": 0.7892134785652161, | |
| "learning_rate": 1.7537596108770417e-06, | |
| "loss": 0.03956481218338013, | |
| "mean_token_accuracy": 0.9904462099075317, | |
| "num_tokens": 29398735.0, | |
| "step": 4700 | |
| }, | |
| { | |
| "epoch": 4.072806067172264, | |
| "eval_entropy": 1.9702677424274273, | |
| "eval_loss": 0.08744855970144272, | |
| "eval_mean_token_accuracy": 0.9802299376150861, | |
| "eval_num_tokens": 29398735.0, | |
| "eval_runtime": 326.9756, | |
| "eval_samples_per_second": 4.918, | |
| "eval_steps_per_second": 0.615, | |
| "step": 4700 | |
| }, | |
| { | |
| "entropy": 2.099683851003647, | |
| "epoch": 4.081473456121343, | |
| "grad_norm": 0.41404569149017334, | |
| "learning_rate": 1.722132401924882e-06, | |
| "loss": 0.008110367506742478, | |
| "mean_token_accuracy": 0.9981684982776642, | |
| "num_tokens": 29454416.0, | |
| "step": 4710 | |
| }, | |
| { | |
| "entropy": 2.0630714267492296, | |
| "epoch": 4.090140845070422, | |
| "grad_norm": 0.45244091749191284, | |
| "learning_rate": 1.6907660855174256e-06, | |
| "loss": 0.022814184427261353, | |
| "mean_token_accuracy": 0.9923579677939415, | |
| "num_tokens": 29516425.0, | |
| "step": 4720 | |
| }, | |
| { | |
| "entropy": 2.1098799794912337, | |
| "epoch": 4.098808234019502, | |
| "grad_norm": 0.8225563168525696, | |
| "learning_rate": 1.6596616502230479e-06, | |
| "loss": 0.02271169424057007, | |
| "mean_token_accuracy": 0.9904859319329262, | |
| "num_tokens": 29570595.0, | |
| "step": 4730 | |
| }, | |
| { | |
| "entropy": 2.017019960284233, | |
| "epoch": 4.107475622968581, | |
| "grad_norm": 3.7492403984069824, | |
| "learning_rate": 1.6288200763564422e-06, | |
| "loss": 0.03186882734298706, | |
| "mean_token_accuracy": 0.9883370444178581, | |
| "num_tokens": 29636384.0, | |
| "step": 4740 | |
| }, | |
| { | |
| "entropy": 2.1209054619073866, | |
| "epoch": 4.11614301191766, | |
| "grad_norm": 0.7058954834938049, | |
| "learning_rate": 1.5982423359477383e-06, | |
| "loss": 0.020897382497787477, | |
| "mean_token_accuracy": 0.9931535944342613, | |
| "num_tokens": 29687984.0, | |
| "step": 4750 | |
| }, | |
| { | |
| "entropy": 2.0571787297725677, | |
| "epoch": 4.124810400866739, | |
| "grad_norm": 0.6924902200698853, | |
| "learning_rate": 1.5679293927118545e-06, | |
| "loss": 0.01724575012922287, | |
| "mean_token_accuracy": 0.9941381692886353, | |
| "num_tokens": 29752451.0, | |
| "step": 4760 | |
| }, | |
| { | |
| "entropy": 2.066095697879791, | |
| "epoch": 4.133477789815818, | |
| "grad_norm": 0.8853573799133301, | |
| "learning_rate": 1.5378822020181339e-06, | |
| "loss": 0.019921644032001494, | |
| "mean_token_accuracy": 0.9936603635549546, | |
| "num_tokens": 29816586.0, | |
| "step": 4770 | |
| }, | |
| { | |
| "entropy": 2.036505189538002, | |
| "epoch": 4.142145178764897, | |
| "grad_norm": 0.7433391213417053, | |
| "learning_rate": 1.5081017108602203e-06, | |
| "loss": 0.009318779408931731, | |
| "mean_token_accuracy": 0.9980769231915474, | |
| "num_tokens": 29886863.0, | |
| "step": 4780 | |
| }, | |
| { | |
| "entropy": 2.023917606472969, | |
| "epoch": 4.150812567713976, | |
| "grad_norm": 0.5994493961334229, | |
| "learning_rate": 1.4785888578262265e-06, | |
| "loss": 0.014561480283737183, | |
| "mean_token_accuracy": 0.9964600846171379, | |
| "num_tokens": 29944175.0, | |
| "step": 4790 | |
| }, | |
| { | |
| "entropy": 2.0322933435440063, | |
| "epoch": 4.159479956663056, | |
| "grad_norm": 1.3376491069793701, | |
| "learning_rate": 1.449344573069149e-06, | |
| "loss": 0.018283985555171967, | |
| "mean_token_accuracy": 0.9946957662701607, | |
| "num_tokens": 30009144.0, | |
| "step": 4800 | |
| }, | |
| { | |
| "epoch": 4.159479956663056, | |
| "eval_entropy": 1.9736577497785956, | |
| "eval_loss": 0.08808128535747528, | |
| "eval_mean_token_accuracy": 0.9802062247523028, | |
| "eval_num_tokens": 30009144.0, | |
| "eval_runtime": 326.8502, | |
| "eval_samples_per_second": 4.92, | |
| "eval_steps_per_second": 0.615, | |
| "step": 4800 | |
| }, | |
| { | |
| "entropy": 2.0404345244169235, | |
| "epoch": 4.168147345612135, | |
| "grad_norm": 2.575533628463745, | |
| "learning_rate": 1.4203697782775484e-06, | |
| "loss": 0.01365792155265808, | |
| "mean_token_accuracy": 0.9939484119415283, | |
| "num_tokens": 30077467.0, | |
| "step": 4810 | |
| }, | |
| { | |
| "entropy": 2.024330788850784, | |
| "epoch": 4.176814734561214, | |
| "grad_norm": 0.26384237408638, | |
| "learning_rate": 1.391665386646498e-06, | |
| "loss": 0.021796645224094392, | |
| "mean_token_accuracy": 0.9972478061914444, | |
| "num_tokens": 30141247.0, | |
| "step": 4820 | |
| }, | |
| { | |
| "entropy": 2.062552109360695, | |
| "epoch": 4.185482123510292, | |
| "grad_norm": 3.534402370452881, | |
| "learning_rate": 1.3632323028488149e-06, | |
| "loss": 0.015387092530727387, | |
| "mean_token_accuracy": 0.9924221619963646, | |
| "num_tokens": 30197279.0, | |
| "step": 4830 | |
| }, | |
| { | |
| "entropy": 1.9646895557641983, | |
| "epoch": 4.194149512459371, | |
| "grad_norm": 1.8417781591415405, | |
| "learning_rate": 1.3350714230065386e-06, | |
| "loss": 0.02345104664564133, | |
| "mean_token_accuracy": 0.9931765854358673, | |
| "num_tokens": 30269676.0, | |
| "step": 4840 | |
| }, | |
| { | |
| "entropy": 1.98412424325943, | |
| "epoch": 4.20281690140845, | |
| "grad_norm": 3.6741926670074463, | |
| "learning_rate": 1.3071836346626865e-06, | |
| "loss": 0.03531681299209595, | |
| "mean_token_accuracy": 0.9901143789291382, | |
| "num_tokens": 30330336.0, | |
| "step": 4850 | |
| }, | |
| { | |
| "entropy": 2.0338327258825304, | |
| "epoch": 4.21148429035753, | |
| "grad_norm": 0.12444645166397095, | |
| "learning_rate": 1.2795698167532888e-06, | |
| "loss": 0.00578281432390213, | |
| "mean_token_accuracy": 0.9981522962450982, | |
| "num_tokens": 30395578.0, | |
| "step": 4860 | |
| }, | |
| { | |
| "entropy": 2.014167508482933, | |
| "epoch": 4.220151679306609, | |
| "grad_norm": 2.159712076187134, | |
| "learning_rate": 1.2522308395796789e-06, | |
| "loss": 0.017886465787887572, | |
| "mean_token_accuracy": 0.9974074080586434, | |
| "num_tokens": 30459507.0, | |
| "step": 4870 | |
| }, | |
| { | |
| "entropy": 2.115958270430565, | |
| "epoch": 4.228819068255688, | |
| "grad_norm": 2.1067309379577637, | |
| "learning_rate": 1.2251675647810724e-06, | |
| "loss": 0.01809442341327667, | |
| "mean_token_accuracy": 0.9926080524921417, | |
| "num_tokens": 30513568.0, | |
| "step": 4880 | |
| }, | |
| { | |
| "entropy": 2.0274746090173723, | |
| "epoch": 4.237486457204767, | |
| "grad_norm": 1.9293690919876099, | |
| "learning_rate": 1.1983808453074009e-06, | |
| "loss": 0.011695823818445205, | |
| "mean_token_accuracy": 0.9947041690349578, | |
| "num_tokens": 30582049.0, | |
| "step": 4890 | |
| }, | |
| { | |
| "entropy": 2.0403768837451937, | |
| "epoch": 4.246153846153846, | |
| "grad_norm": 0.4305020570755005, | |
| "learning_rate": 1.1718715253924417e-06, | |
| "loss": 0.011889181286096572, | |
| "mean_token_accuracy": 0.9974476903676986, | |
| "num_tokens": 30646717.0, | |
| "step": 4900 | |
| }, | |
| { | |
| "epoch": 4.246153846153846, | |
| "eval_entropy": 1.9705782998260575, | |
| "eval_loss": 0.08883950114250183, | |
| "eval_mean_token_accuracy": 0.97969317287948, | |
| "eval_num_tokens": 30646717.0, | |
| "eval_runtime": 326.98, | |
| "eval_samples_per_second": 4.918, | |
| "eval_steps_per_second": 0.615, | |
| "step": 4900 | |
| }, | |
| { | |
| "entropy": 2.0958633810281753, | |
| "epoch": 4.254821235102925, | |
| "grad_norm": 1.2778172492980957, | |
| "learning_rate": 1.1456404405271993e-06, | |
| "loss": 0.014013904333114623, | |
| "mean_token_accuracy": 0.9959134608507156, | |
| "num_tokens": 30701308.0, | |
| "step": 4910 | |
| }, | |
| { | |
| "entropy": 2.013311989605427, | |
| "epoch": 4.2634886240520045, | |
| "grad_norm": 2.811065196990967, | |
| "learning_rate": 1.1196884174335842e-06, | |
| "loss": 0.01911211907863617, | |
| "mean_token_accuracy": 0.99190693795681, | |
| "num_tokens": 30754634.0, | |
| "step": 4920 | |
| }, | |
| { | |
| "entropy": 2.0537849366664886, | |
| "epoch": 4.272156013001084, | |
| "grad_norm": 0.43671995401382446, | |
| "learning_rate": 1.094016274038341e-06, | |
| "loss": 0.009578761458396912, | |
| "mean_token_accuracy": 0.9973684206604958, | |
| "num_tokens": 30811429.0, | |
| "step": 4930 | |
| }, | |
| { | |
| "entropy": 2.042087969183922, | |
| "epoch": 4.280823401950163, | |
| "grad_norm": 0.10949576646089554, | |
| "learning_rate": 1.0686248194472882e-06, | |
| "loss": 0.018562574684619904, | |
| "mean_token_accuracy": 0.9698333323001862, | |
| "num_tokens": 30876505.0, | |
| "step": 4940 | |
| }, | |
| { | |
| "entropy": 2.132018208503723, | |
| "epoch": 4.289490790899242, | |
| "grad_norm": 0.870583713054657, | |
| "learning_rate": 1.043514853919807e-06, | |
| "loss": 0.008388452231884003, | |
| "mean_token_accuracy": 0.998571427166462, | |
| "num_tokens": 30935265.0, | |
| "step": 4950 | |
| }, | |
| { | |
| "entropy": 1.9139719784259797, | |
| "epoch": 4.298158179848321, | |
| "grad_norm": 0.1519097238779068, | |
| "learning_rate": 1.018687168843625e-06, | |
| "loss": 0.0245489701628685, | |
| "mean_token_accuracy": 0.9940625011920929, | |
| "num_tokens": 31004294.0, | |
| "step": 4960 | |
| }, | |
| { | |
| "entropy": 1.9107709616422652, | |
| "epoch": 4.3068255687974, | |
| "grad_norm": 4.961195468902588, | |
| "learning_rate": 9.941425467098641e-07, | |
| "loss": 0.00963737890124321, | |
| "mean_token_accuracy": 0.9982142850756646, | |
| "num_tokens": 31076072.0, | |
| "step": 4970 | |
| }, | |
| { | |
| "entropy": 2.084628200531006, | |
| "epoch": 4.3154929577464785, | |
| "grad_norm": 1.608235478401184, | |
| "learning_rate": 9.698817610883915e-07, | |
| "loss": 0.018618135154247283, | |
| "mean_token_accuracy": 0.9952801674604416, | |
| "num_tokens": 31134655.0, | |
| "step": 4980 | |
| }, | |
| { | |
| "entropy": 2.039292076230049, | |
| "epoch": 4.324160346695558, | |
| "grad_norm": 1.2228981256484985, | |
| "learning_rate": 9.459055766034342e-07, | |
| "loss": 0.026717761158943178, | |
| "mean_token_accuracy": 0.9923743084073067, | |
| "num_tokens": 31198217.0, | |
| "step": 4990 | |
| }, | |
| { | |
| "entropy": 2.0533795297145843, | |
| "epoch": 4.332827735644637, | |
| "grad_norm": 0.4585072100162506, | |
| "learning_rate": 9.222147489094746e-07, | |
| "loss": 0.013927005231380463, | |
| "mean_token_accuracy": 0.994015522301197, | |
| "num_tokens": 31259134.0, | |
| "step": 5000 | |
| }, | |
| { | |
| "epoch": 4.332827735644637, | |
| "eval_entropy": 1.9728771590474825, | |
| "eval_loss": 0.08881022036075592, | |
| "eval_mean_token_accuracy": 0.9795496161304303, | |
| "eval_num_tokens": 31259134.0, | |
| "eval_runtime": 327.0558, | |
| "eval_samples_per_second": 4.917, | |
| "eval_steps_per_second": 0.615, | |
| "step": 5000 | |
| }, | |
| { | |
| "entropy": 2.0826673805713654, | |
| "epoch": 4.341495124593716, | |
| "grad_norm": 1.3024990558624268, | |
| "learning_rate": 8.988100246674447e-07, | |
| "loss": 0.02505913972854614, | |
| "mean_token_accuracy": 0.990269535779953, | |
| "num_tokens": 31319291.0, | |
| "step": 5010 | |
| }, | |
| { | |
| "entropy": 1.9910820811986922, | |
| "epoch": 4.350162513542795, | |
| "grad_norm": 0.28213417530059814, | |
| "learning_rate": 8.756921415211872e-07, | |
| "loss": 0.03284958600997925, | |
| "mean_token_accuracy": 0.9892865911126136, | |
| "num_tokens": 31389570.0, | |
| "step": 5020 | |
| }, | |
| { | |
| "entropy": 1.9260858178138733, | |
| "epoch": 4.358829902491874, | |
| "grad_norm": 1.6689592599868774, | |
| "learning_rate": 8.528618280742118e-07, | |
| "loss": 0.022429963946342467, | |
| "mean_token_accuracy": 0.9873416185379028, | |
| "num_tokens": 31456570.0, | |
| "step": 5030 | |
| }, | |
| { | |
| "entropy": 2.075908821821213, | |
| "epoch": 4.367497291440953, | |
| "grad_norm": 0.5058390498161316, | |
| "learning_rate": 8.303198038667216e-07, | |
| "loss": 0.03578021228313446, | |
| "mean_token_accuracy": 0.9861092865467072, | |
| "num_tokens": 31512591.0, | |
| "step": 5040 | |
| }, | |
| { | |
| "entropy": 2.0401781380176542, | |
| "epoch": 4.3761646803900325, | |
| "grad_norm": 2.0004308223724365, | |
| "learning_rate": 8.080667793529495e-07, | |
| "loss": 0.035635894536972045, | |
| "mean_token_accuracy": 0.9919731870293618, | |
| "num_tokens": 31572815.0, | |
| "step": 5050 | |
| }, | |
| { | |
| "entropy": 2.062747171521187, | |
| "epoch": 4.384832069339112, | |
| "grad_norm": 1.3225598335266113, | |
| "learning_rate": 7.861034558787594e-07, | |
| "loss": 0.010875914245843887, | |
| "mean_token_accuracy": 0.9954330354928971, | |
| "num_tokens": 31636449.0, | |
| "step": 5060 | |
| }, | |
| { | |
| "entropy": 2.0818180203437806, | |
| "epoch": 4.393499458288191, | |
| "grad_norm": 0.27941176295280457, | |
| "learning_rate": 7.644305256595419e-07, | |
| "loss": 0.012188396602869033, | |
| "mean_token_accuracy": 0.9975026711821556, | |
| "num_tokens": 31699355.0, | |
| "step": 5070 | |
| }, | |
| { | |
| "entropy": 2.0237564265728, | |
| "epoch": 4.40216684723727, | |
| "grad_norm": 0.18985368311405182, | |
| "learning_rate": 7.430486717583962e-07, | |
| "loss": 0.010058794915676118, | |
| "mean_token_accuracy": 0.99608004540205, | |
| "num_tokens": 31764950.0, | |
| "step": 5080 | |
| }, | |
| { | |
| "entropy": 2.0428464114665985, | |
| "epoch": 4.410834236186349, | |
| "grad_norm": 1.510493278503418, | |
| "learning_rate": 7.21958568064608e-07, | |
| "loss": 0.012500947713851929, | |
| "mean_token_accuracy": 0.9923106044530868, | |
| "num_tokens": 31823167.0, | |
| "step": 5090 | |
| }, | |
| { | |
| "entropy": 2.0478352516889573, | |
| "epoch": 4.419501625135428, | |
| "grad_norm": 0.569312572479248, | |
| "learning_rate": 7.011608792724068e-07, | |
| "loss": 0.01235663816332817, | |
| "mean_token_accuracy": 0.9952962964773178, | |
| "num_tokens": 31883856.0, | |
| "step": 5100 | |
| }, | |
| { | |
| "epoch": 4.419501625135428, | |
| "eval_entropy": 1.9781580647425865, | |
| "eval_loss": 0.08919015526771545, | |
| "eval_mean_token_accuracy": 0.9796797802199179, | |
| "eval_num_tokens": 31883856.0, | |
| "eval_runtime": 326.8313, | |
| "eval_samples_per_second": 4.92, | |
| "eval_steps_per_second": 0.615, | |
| "step": 5100 | |
| }, | |
| { | |
| "entropy": 2.108269548416138, | |
| "epoch": 4.428169014084507, | |
| "grad_norm": 0.07893358916044235, | |
| "learning_rate": 6.806562608600186e-07, | |
| "loss": 0.004451769217848778, | |
| "mean_token_accuracy": 1.0, | |
| "num_tokens": 31938054.0, | |
| "step": 5110 | |
| }, | |
| { | |
| "entropy": 2.075284495949745, | |
| "epoch": 4.4368364030335865, | |
| "grad_norm": 3.848189115524292, | |
| "learning_rate": 6.604453590690007e-07, | |
| "loss": 0.03046499490737915, | |
| "mean_token_accuracy": 0.9956063643097878, | |
| "num_tokens": 31995451.0, | |
| "step": 5120 | |
| }, | |
| { | |
| "entropy": 1.964671802520752, | |
| "epoch": 4.445503791982665, | |
| "grad_norm": 2.6819865703582764, | |
| "learning_rate": 6.405288108838836e-07, | |
| "loss": 0.03677540421485901, | |
| "mean_token_accuracy": 0.981814344227314, | |
| "num_tokens": 32064564.0, | |
| "step": 5130 | |
| }, | |
| { | |
| "entropy": 2.0767350763082506, | |
| "epoch": 4.454171180931744, | |
| "grad_norm": 0.2573661208152771, | |
| "learning_rate": 6.209072440120912e-07, | |
| "loss": 0.01814277321100235, | |
| "mean_token_accuracy": 0.9919444441795349, | |
| "num_tokens": 32126879.0, | |
| "step": 5140 | |
| }, | |
| { | |
| "entropy": 2.0255597680807114, | |
| "epoch": 4.462838569880823, | |
| "grad_norm": 0.5254562497138977, | |
| "learning_rate": 6.015812768641582e-07, | |
| "loss": 0.009591031819581985, | |
| "mean_token_accuracy": 0.9972966268658638, | |
| "num_tokens": 32191835.0, | |
| "step": 5150 | |
| }, | |
| { | |
| "entropy": 2.0272518664598467, | |
| "epoch": 4.471505958829902, | |
| "grad_norm": 1.8054099082946777, | |
| "learning_rate": 5.825515185342323e-07, | |
| "loss": 0.012653954327106476, | |
| "mean_token_accuracy": 0.9968452379107475, | |
| "num_tokens": 32260376.0, | |
| "step": 5160 | |
| }, | |
| { | |
| "entropy": 2.058269131183624, | |
| "epoch": 4.480173347778981, | |
| "grad_norm": 0.6068629026412964, | |
| "learning_rate": 5.638185687808917e-07, | |
| "loss": 0.009308335930109024, | |
| "mean_token_accuracy": 0.9960426911711693, | |
| "num_tokens": 32318458.0, | |
| "step": 5170 | |
| }, | |
| { | |
| "entropy": 2.1178119242191316, | |
| "epoch": 4.4888407367280605, | |
| "grad_norm": 0.09419647604227066, | |
| "learning_rate": 5.453830180082309e-07, | |
| "loss": 0.009917216002941131, | |
| "mean_token_accuracy": 0.9953914135694504, | |
| "num_tokens": 32373717.0, | |
| "step": 5180 | |
| }, | |
| { | |
| "entropy": 2.053645688295364, | |
| "epoch": 4.49750812567714, | |
| "grad_norm": 0.396065890789032, | |
| "learning_rate": 5.27245447247261e-07, | |
| "loss": 0.01238245666027069, | |
| "mean_token_accuracy": 0.9962280064821243, | |
| "num_tokens": 32426237.0, | |
| "step": 5190 | |
| }, | |
| { | |
| "entropy": 2.058378967642784, | |
| "epoch": 4.506175514626219, | |
| "grad_norm": 0.24088667333126068, | |
| "learning_rate": 5.094064281375832e-07, | |
| "loss": 0.008150581270456314, | |
| "mean_token_accuracy": 0.9978787884116173, | |
| "num_tokens": 32486772.0, | |
| "step": 5200 | |
| }, | |
| { | |
| "epoch": 4.506175514626219, | |
| "eval_entropy": 1.9773344519126475, | |
| "eval_loss": 0.08962774276733398, | |
| "eval_mean_token_accuracy": 0.980161461960617, | |
| "eval_num_tokens": 32486772.0, | |
| "eval_runtime": 327.0625, | |
| "eval_samples_per_second": 4.916, | |
| "eval_steps_per_second": 0.615, | |
| "step": 5200 | |
| }, | |
| { | |
| "entropy": 2.000825381278992, | |
| "epoch": 4.514842903575298, | |
| "grad_norm": 0.13512328267097473, | |
| "learning_rate": 4.918665229093955e-07, | |
| "loss": 0.009017366915941238, | |
| "mean_token_accuracy": 0.9954687505960464, | |
| "num_tokens": 32555123.0, | |
| "step": 5210 | |
| }, | |
| { | |
| "entropy": 2.0178422331809998, | |
| "epoch": 4.523510292524377, | |
| "grad_norm": 1.763617753982544, | |
| "learning_rate": 4.746262843657545e-07, | |
| "loss": 0.015950243175029754, | |
| "mean_token_accuracy": 0.991420355439186, | |
| "num_tokens": 32617425.0, | |
| "step": 5220 | |
| }, | |
| { | |
| "entropy": 2.0761267840862274, | |
| "epoch": 4.532177681473456, | |
| "grad_norm": 0.4732784926891327, | |
| "learning_rate": 4.5768625586515515e-07, | |
| "loss": 0.013394179940223693, | |
| "mean_token_accuracy": 0.9954727560281753, | |
| "num_tokens": 32671383.0, | |
| "step": 5230 | |
| }, | |
| { | |
| "entropy": 2.1209077060222628, | |
| "epoch": 4.540845070422535, | |
| "grad_norm": 0.24119587242603302, | |
| "learning_rate": 4.4104697130441297e-07, | |
| "loss": 0.006799912452697754, | |
| "mean_token_accuracy": 0.9964460790157318, | |
| "num_tokens": 32721566.0, | |
| "step": 5240 | |
| }, | |
| { | |
| "entropy": 2.023488113284111, | |
| "epoch": 4.5495124593716145, | |
| "grad_norm": 0.9742321968078613, | |
| "learning_rate": 4.247089551018335e-07, | |
| "loss": 0.008217556774616242, | |
| "mean_token_accuracy": 0.9959012061357498, | |
| "num_tokens": 32785235.0, | |
| "step": 5250 | |
| }, | |
| { | |
| "entropy": 2.0245584696531296, | |
| "epoch": 4.558179848320694, | |
| "grad_norm": 0.7126546502113342, | |
| "learning_rate": 4.08672722180683e-07, | |
| "loss": 0.013321210443973542, | |
| "mean_token_accuracy": 0.9972473606467247, | |
| "num_tokens": 32850508.0, | |
| "step": 5260 | |
| }, | |
| { | |
| "entropy": 2.0293969064950943, | |
| "epoch": 4.566847237269773, | |
| "grad_norm": 0.19109396636486053, | |
| "learning_rate": 3.9293877795296033e-07, | |
| "loss": 0.024787485599517822, | |
| "mean_token_accuracy": 0.9899170100688934, | |
| "num_tokens": 32917953.0, | |
| "step": 5270 | |
| }, | |
| { | |
| "entropy": 2.0705538392066956, | |
| "epoch": 4.575514626218851, | |
| "grad_norm": 2.082110643386841, | |
| "learning_rate": 3.775076183034687e-07, | |
| "loss": 0.025293442606925964, | |
| "mean_token_accuracy": 0.9883344322443008, | |
| "num_tokens": 32980280.0, | |
| "step": 5280 | |
| }, | |
| { | |
| "entropy": 1.97212675511837, | |
| "epoch": 4.584182015167931, | |
| "grad_norm": 3.7733571529388428, | |
| "learning_rate": 3.623797295741882e-07, | |
| "loss": 0.026531627774238585, | |
| "mean_token_accuracy": 0.9859025999903679, | |
| "num_tokens": 33052310.0, | |
| "step": 5290 | |
| }, | |
| { | |
| "entropy": 2.1174137502908708, | |
| "epoch": 4.592849404117009, | |
| "grad_norm": 4.527464389801025, | |
| "learning_rate": 3.4755558854894454e-07, | |
| "loss": 0.05131498575210571, | |
| "mean_token_accuracy": 0.9909847050905227, | |
| "num_tokens": 33105153.0, | |
| "step": 5300 | |
| }, | |
| { | |
| "epoch": 4.592849404117009, | |
| "eval_entropy": 1.9771031633538394, | |
| "eval_loss": 0.08935187011957169, | |
| "eval_mean_token_accuracy": 0.9799883635482978, | |
| "eval_num_tokens": 33105153.0, | |
| "eval_runtime": 327.1357, | |
| "eval_samples_per_second": 4.915, | |
| "eval_steps_per_second": 0.614, | |
| "step": 5300 | |
| }, | |
| { | |
| "entropy": 2.0754479676485063, | |
| "epoch": 4.6015167930660885, | |
| "grad_norm": 0.21639882028102875, | |
| "learning_rate": 3.330356624383846e-07, | |
| "loss": 0.018829087913036346, | |
| "mean_token_accuracy": 0.9952528193593025, | |
| "num_tokens": 33163772.0, | |
| "step": 5310 | |
| }, | |
| { | |
| "entropy": 2.0545038670301436, | |
| "epoch": 4.610184182015168, | |
| "grad_norm": 0.3632142245769501, | |
| "learning_rate": 3.1882040886525023e-07, | |
| "loss": 0.020865590870380403, | |
| "mean_token_accuracy": 0.9914917916059494, | |
| "num_tokens": 33226699.0, | |
| "step": 5320 | |
| }, | |
| { | |
| "entropy": 2.0661454617977144, | |
| "epoch": 4.618851570964247, | |
| "grad_norm": 1.8460487127304077, | |
| "learning_rate": 3.049102758499567e-07, | |
| "loss": 0.019039011001586913, | |
| "mean_token_accuracy": 0.9947229847311974, | |
| "num_tokens": 33285047.0, | |
| "step": 5330 | |
| }, | |
| { | |
| "entropy": 2.0611626476049425, | |
| "epoch": 4.627518959913326, | |
| "grad_norm": 2.2364659309387207, | |
| "learning_rate": 2.9130570179647376e-07, | |
| "loss": 0.010900366306304931, | |
| "mean_token_accuracy": 0.995740094780922, | |
| "num_tokens": 33349369.0, | |
| "step": 5340 | |
| }, | |
| { | |
| "entropy": 2.0093062967061996, | |
| "epoch": 4.636186348862405, | |
| "grad_norm": 0.7252208590507507, | |
| "learning_rate": 2.7800711547850247e-07, | |
| "loss": 0.02175909876823425, | |
| "mean_token_accuracy": 0.9925066068768501, | |
| "num_tokens": 33419661.0, | |
| "step": 5350 | |
| }, | |
| { | |
| "entropy": 1.9689721822738648, | |
| "epoch": 4.644853737811484, | |
| "grad_norm": 0.11739201098680496, | |
| "learning_rate": 2.6501493602596683e-07, | |
| "loss": 0.01585783213376999, | |
| "mean_token_accuracy": 0.9941969141364098, | |
| "num_tokens": 33495787.0, | |
| "step": 5360 | |
| }, | |
| { | |
| "entropy": 1.9787477880716324, | |
| "epoch": 4.653521126760563, | |
| "grad_norm": 0.03642086684703827, | |
| "learning_rate": 2.5232957291180806e-07, | |
| "loss": 0.029417428374290466, | |
| "mean_token_accuracy": 0.9918199837207794, | |
| "num_tokens": 33563931.0, | |
| "step": 5370 | |
| }, | |
| { | |
| "entropy": 2.0737911581993105, | |
| "epoch": 4.6621885157096425, | |
| "grad_norm": 2.774217128753662, | |
| "learning_rate": 2.3995142593906563e-07, | |
| "loss": 0.014542682468891144, | |
| "mean_token_accuracy": 0.9953180745244026, | |
| "num_tokens": 33624815.0, | |
| "step": 5380 | |
| }, | |
| { | |
| "entropy": 2.0131901890039443, | |
| "epoch": 4.670855904658722, | |
| "grad_norm": 0.3904068171977997, | |
| "learning_rate": 2.2788088522829212e-07, | |
| "loss": 0.03030272722244263, | |
| "mean_token_accuracy": 0.9904125809669495, | |
| "num_tokens": 33689523.0, | |
| "step": 5390 | |
| }, | |
| { | |
| "entropy": 2.0369192749261855, | |
| "epoch": 4.679523293607801, | |
| "grad_norm": 0.18654713034629822, | |
| "learning_rate": 2.1611833120524838e-07, | |
| "loss": 0.010971380770206452, | |
| "mean_token_accuracy": 0.9960916191339493, | |
| "num_tokens": 33750941.0, | |
| "step": 5400 | |
| }, | |
| { | |
| "epoch": 4.679523293607801, | |
| "eval_entropy": 1.9789310124383044, | |
| "eval_loss": 0.08923472464084625, | |
| "eval_mean_token_accuracy": 0.9801432926263383, | |
| "eval_num_tokens": 33750941.0, | |
| "eval_runtime": 327.0832, | |
| "eval_samples_per_second": 4.916, | |
| "eval_steps_per_second": 0.615, | |
| "step": 5400 | |
| }, | |
| { | |
| "entropy": 2.0042553037405013, | |
| "epoch": 4.68819068255688, | |
| "grad_norm": 1.2499020099639893, | |
| "learning_rate": 2.0466413458891776e-07, | |
| "loss": 0.025074890255928038, | |
| "mean_token_accuracy": 0.9954362437129021, | |
| "num_tokens": 33809791.0, | |
| "step": 5410 | |
| }, | |
| { | |
| "entropy": 2.063493809103966, | |
| "epoch": 4.696858071505959, | |
| "grad_norm": 2.250760793685913, | |
| "learning_rate": 1.935186563798186e-07, | |
| "loss": 0.03190418183803558, | |
| "mean_token_accuracy": 0.9925678476691246, | |
| "num_tokens": 33875921.0, | |
| "step": 5420 | |
| }, | |
| { | |
| "entropy": 2.0530943751335142, | |
| "epoch": 4.705525460455038, | |
| "grad_norm": 1.5710461139678955, | |
| "learning_rate": 1.8268224784862899e-07, | |
| "loss": 0.012784861028194427, | |
| "mean_token_accuracy": 0.9956602081656456, | |
| "num_tokens": 33931632.0, | |
| "step": 5430 | |
| }, | |
| { | |
| "entropy": 2.046228414773941, | |
| "epoch": 4.714192849404117, | |
| "grad_norm": 5.684391021728516, | |
| "learning_rate": 1.7215525052511673e-07, | |
| "loss": 0.019351273775100708, | |
| "mean_token_accuracy": 0.9934533283114433, | |
| "num_tokens": 33994984.0, | |
| "step": 5440 | |
| }, | |
| { | |
| "entropy": 2.046843534708023, | |
| "epoch": 4.722860238353196, | |
| "grad_norm": 3.8622937202453613, | |
| "learning_rate": 1.6193799618737683e-07, | |
| "loss": 0.04347184896469116, | |
| "mean_token_accuracy": 0.9886655271053314, | |
| "num_tokens": 34061747.0, | |
| "step": 5450 | |
| }, | |
| { | |
| "entropy": 2.092145395278931, | |
| "epoch": 4.731527627302275, | |
| "grad_norm": 2.73188853263855, | |
| "learning_rate": 1.520308068513665e-07, | |
| "loss": 0.015788179636001588, | |
| "mean_token_accuracy": 0.9970826536417008, | |
| "num_tokens": 34118985.0, | |
| "step": 5460 | |
| }, | |
| { | |
| "entropy": 2.035344365239143, | |
| "epoch": 4.740195016251354, | |
| "grad_norm": 0.2667732536792755, | |
| "learning_rate": 1.4243399476076557e-07, | |
| "loss": 0.014378026127815247, | |
| "mean_token_accuracy": 0.9969669118523597, | |
| "num_tokens": 34179366.0, | |
| "step": 5470 | |
| }, | |
| { | |
| "entropy": 2.0383077263832092, | |
| "epoch": 4.748862405200433, | |
| "grad_norm": 0.49197614192962646, | |
| "learning_rate": 1.3314786237713319e-07, | |
| "loss": 0.008524678647518158, | |
| "mean_token_accuracy": 0.9985294118523598, | |
| "num_tokens": 34242470.0, | |
| "step": 5480 | |
| }, | |
| { | |
| "entropy": 2.0843881905078887, | |
| "epoch": 4.757529794149512, | |
| "grad_norm": 3.67633056640625, | |
| "learning_rate": 1.2417270237037316e-07, | |
| "loss": 0.02358439564704895, | |
| "mean_token_accuracy": 0.988163261115551, | |
| "num_tokens": 34305279.0, | |
| "step": 5490 | |
| }, | |
| { | |
| "entropy": 2.0624629646539687, | |
| "epoch": 4.766197183098591, | |
| "grad_norm": 3.794203281402588, | |
| "learning_rate": 1.1550879760950707e-07, | |
| "loss": 0.009884495288133621, | |
| "mean_token_accuracy": 0.9988950893282891, | |
| "num_tokens": 34366114.0, | |
| "step": 5500 | |
| }, | |
| { | |
| "epoch": 4.766197183098591, | |
| "eval_entropy": 1.9788880733708245, | |
| "eval_loss": 0.08953475207090378, | |
| "eval_mean_token_accuracy": 0.979842825908566, | |
| "eval_num_tokens": 34366114.0, | |
| "eval_runtime": 327.0695, | |
| "eval_samples_per_second": 4.916, | |
| "eval_steps_per_second": 0.615, | |
| "step": 5500 | |
| }, | |
| { | |
| "entropy": 2.026938486099243, | |
| "epoch": 4.774864572047671, | |
| "grad_norm": 0.09174291789531708, | |
| "learning_rate": 1.0715642115376679e-07, | |
| "loss": 0.012465564161539077, | |
| "mean_token_accuracy": 0.998863635957241, | |
| "num_tokens": 34430371.0, | |
| "step": 5510 | |
| }, | |
| { | |
| "entropy": 1.887784132361412, | |
| "epoch": 4.78353196099675, | |
| "grad_norm": 0.5684153437614441, | |
| "learning_rate": 9.91158362439848e-08, | |
| "loss": 0.01685968190431595, | |
| "mean_token_accuracy": 0.9935922354459763, | |
| "num_tokens": 34515259.0, | |
| "step": 5520 | |
| }, | |
| { | |
| "entropy": 2.019374093413353, | |
| "epoch": 4.792199349945829, | |
| "grad_norm": 1.921454668045044, | |
| "learning_rate": 9.138729629429633e-08, | |
| "loss": 0.013727284967899323, | |
| "mean_token_accuracy": 0.9937152773141861, | |
| "num_tokens": 34579448.0, | |
| "step": 5530 | |
| }, | |
| { | |
| "entropy": 2.061140888929367, | |
| "epoch": 4.800866738894908, | |
| "grad_norm": 1.1379508972167969, | |
| "learning_rate": 8.397104488415242e-08, | |
| "loss": 0.018110451102256776, | |
| "mean_token_accuracy": 0.9920138880610466, | |
| "num_tokens": 34643503.0, | |
| "step": 5540 | |
| }, | |
| { | |
| "entropy": 2.116260740160942, | |
| "epoch": 4.809534127843987, | |
| "grad_norm": 0.09666794538497925, | |
| "learning_rate": 7.686731575064499e-08, | |
| "loss": 0.013026180863380431, | |
| "mean_token_accuracy": 0.9928571432828903, | |
| "num_tokens": 34699740.0, | |
| "step": 5550 | |
| }, | |
| { | |
| "entropy": 2.0289686411619186, | |
| "epoch": 4.818201516793066, | |
| "grad_norm": 2.967052936553955, | |
| "learning_rate": 7.007633278114156e-08, | |
| "loss": 0.01802207827568054, | |
| "mean_token_accuracy": 0.9932675451040268, | |
| "num_tokens": 34756188.0, | |
| "step": 5560 | |
| }, | |
| { | |
| "entropy": 2.008377233147621, | |
| "epoch": 4.826868905742145, | |
| "grad_norm": 0.5545211434364319, | |
| "learning_rate": 6.359831000622319e-08, | |
| "loss": 0.0315314382314682, | |
| "mean_token_accuracy": 0.988946282863617, | |
| "num_tokens": 34822503.0, | |
| "step": 5570 | |
| }, | |
| { | |
| "entropy": 2.0508563309907912, | |
| "epoch": 4.835536294691225, | |
| "grad_norm": 1.5701384544372559, | |
| "learning_rate": 5.7433451592946446e-08, | |
| "loss": 0.033820077776908875, | |
| "mean_token_accuracy": 0.9926100254058838, | |
| "num_tokens": 34883060.0, | |
| "step": 5580 | |
| }, | |
| { | |
| "entropy": 2.0419242858886717, | |
| "epoch": 4.844203683640304, | |
| "grad_norm": 0.8245704770088196, | |
| "learning_rate": 5.158195183840087e-08, | |
| "loss": 0.023655834794044494, | |
| "mean_token_accuracy": 0.992795518040657, | |
| "num_tokens": 34943194.0, | |
| "step": 5590 | |
| }, | |
| { | |
| "entropy": 2.0416525810956956, | |
| "epoch": 4.852871072589382, | |
| "grad_norm": 1.4492483139038086, | |
| "learning_rate": 4.604399516359381e-08, | |
| "loss": 0.009996517747640609, | |
| "mean_token_accuracy": 0.9690203845500946, | |
| "num_tokens": 35013087.0, | |
| "step": 5600 | |
| }, | |
| { | |
| "epoch": 4.852871072589382, | |
| "eval_entropy": 1.9783549949304382, | |
| "eval_loss": 0.08902545273303986, | |
| "eval_mean_token_accuracy": 0.9801809992363204, | |
| "eval_num_tokens": 35013087.0, | |
| "eval_runtime": 327.0775, | |
| "eval_samples_per_second": 4.916, | |
| "eval_steps_per_second": 0.615, | |
| "step": 5600 | |
| }, | |
| { | |
| "entropy": 2.08369864821434, | |
| "epoch": 4.861538461538462, | |
| "grad_norm": 0.2037355750799179, | |
| "learning_rate": 4.081975610762845e-08, | |
| "loss": 0.020190438628196715, | |
| "mean_token_accuracy": 0.9926752656698227, | |
| "num_tokens": 35072258.0, | |
| "step": 5610 | |
| }, | |
| { | |
| "entropy": 1.9933051258325576, | |
| "epoch": 4.87020585048754, | |
| "grad_norm": 2.471435546875, | |
| "learning_rate": 3.5909399322213714e-08, | |
| "loss": 0.028650698065757752, | |
| "mean_token_accuracy": 0.9927345782518386, | |
| "num_tokens": 35136204.0, | |
| "step": 5620 | |
| }, | |
| { | |
| "entropy": 2.0149646639823913, | |
| "epoch": 4.878873239436619, | |
| "grad_norm": 0.14566990733146667, | |
| "learning_rate": 3.13130795664629e-08, | |
| "loss": 0.01882893741130829, | |
| "mean_token_accuracy": 0.9957239225506782, | |
| "num_tokens": 35210309.0, | |
| "step": 5630 | |
| }, | |
| { | |
| "entropy": 1.9940237611532212, | |
| "epoch": 4.887540628385699, | |
| "grad_norm": 1.4961596727371216, | |
| "learning_rate": 2.703094170202869e-08, | |
| "loss": 0.017515945434570312, | |
| "mean_token_accuracy": 0.9969444438815117, | |
| "num_tokens": 35282211.0, | |
| "step": 5640 | |
| }, | |
| { | |
| "entropy": 2.069670316576958, | |
| "epoch": 4.896208017334778, | |
| "grad_norm": 3.451641321182251, | |
| "learning_rate": 2.3063120688527895e-08, | |
| "loss": 0.009432430565357208, | |
| "mean_token_accuracy": 0.9956648290157318, | |
| "num_tokens": 35338685.0, | |
| "step": 5650 | |
| }, | |
| { | |
| "entropy": 2.030204784870148, | |
| "epoch": 4.904875406283857, | |
| "grad_norm": 0.47753724455833435, | |
| "learning_rate": 1.9409741579290432e-08, | |
| "loss": 0.018620912730693818, | |
| "mean_token_accuracy": 0.9965626150369644, | |
| "num_tokens": 35397783.0, | |
| "step": 5660 | |
| }, | |
| { | |
| "entropy": 2.029239335656166, | |
| "epoch": 4.913542795232936, | |
| "grad_norm": 0.3373558223247528, | |
| "learning_rate": 1.6070919517422457e-08, | |
| "loss": 0.02926117479801178, | |
| "mean_token_accuracy": 0.994283078610897, | |
| "num_tokens": 35460222.0, | |
| "step": 5670 | |
| }, | |
| { | |
| "entropy": 2.0445204973220825, | |
| "epoch": 4.922210184182015, | |
| "grad_norm": 3.4179787635803223, | |
| "learning_rate": 1.304675973217151e-08, | |
| "loss": 0.013791508972644806, | |
| "mean_token_accuracy": 0.9986397057771683, | |
| "num_tokens": 35512901.0, | |
| "step": 5680 | |
| }, | |
| { | |
| "entropy": 1.979167452454567, | |
| "epoch": 4.930877573131094, | |
| "grad_norm": 1.5083386898040771, | |
| "learning_rate": 1.0337357535612491e-08, | |
| "loss": 0.01376536637544632, | |
| "mean_token_accuracy": 0.9958539381623268, | |
| "num_tokens": 35583228.0, | |
| "step": 5690 | |
| }, | |
| { | |
| "entropy": 1.9492487490177155, | |
| "epoch": 4.9395449620801735, | |
| "grad_norm": 0.5227612853050232, | |
| "learning_rate": 7.942798319645618e-09, | |
| "loss": 0.026930561661720274, | |
| "mean_token_accuracy": 0.9896025002002716, | |
| "num_tokens": 35651933.0, | |
| "step": 5700 | |
| }, | |
| { | |
| "epoch": 4.9395449620801735, | |
| "eval_entropy": 1.978533458353868, | |
| "eval_loss": 0.08922462910413742, | |
| "eval_mean_token_accuracy": 0.9799270276999592, | |
| "eval_num_tokens": 35651933.0, | |
| "eval_runtime": 326.7094, | |
| "eval_samples_per_second": 4.922, | |
| "eval_steps_per_second": 0.615, | |
| "step": 5700 | |
| }, | |
| { | |
| "entropy": 2.0769087851047514, | |
| "epoch": 4.948212351029253, | |
| "grad_norm": 1.7579526901245117, | |
| "learning_rate": 5.863157553301912e-09, | |
| "loss": 0.04630476236343384, | |
| "mean_token_accuracy": 0.9901736095547676, | |
| "num_tokens": 35702827.0, | |
| "step": 5710 | |
| }, | |
| { | |
| "entropy": 2.0126946330070496, | |
| "epoch": 4.956879739978332, | |
| "grad_norm": 0.29572439193725586, | |
| "learning_rate": 4.098500780364001e-09, | |
| "loss": 0.024674685299396516, | |
| "mean_token_accuracy": 0.9920352548360825, | |
| "num_tokens": 35765963.0, | |
| "step": 5720 | |
| }, | |
| { | |
| "entropy": 2.093992868065834, | |
| "epoch": 4.965547128927411, | |
| "grad_norm": 2.5199387073516846, | |
| "learning_rate": 2.6488836173077513e-09, | |
| "loss": 0.018880957365036012, | |
| "mean_token_accuracy": 0.997487536072731, | |
| "num_tokens": 35827800.0, | |
| "step": 5730 | |
| }, | |
| { | |
| "entropy": 2.0499730825424196, | |
| "epoch": 4.97421451787649, | |
| "grad_norm": 2.6069576740264893, | |
| "learning_rate": 1.5143517515381345e-09, | |
| "loss": 0.030907681584358214, | |
| "mean_token_accuracy": 0.9882355168461799, | |
| "num_tokens": 35889316.0, | |
| "step": 5740 | |
| }, | |
| { | |
| "entropy": 2.03939069211483, | |
| "epoch": 4.982881906825568, | |
| "grad_norm": 1.0308866500854492, | |
| "learning_rate": 6.949409399581442e-10, | |
| "loss": 0.018008121848106386, | |
| "mean_token_accuracy": 0.9932060182094574, | |
| "num_tokens": 35955227.0, | |
| "step": 5750 | |
| }, | |
| { | |
| "entropy": 1.945585885643959, | |
| "epoch": 4.991549295774648, | |
| "grad_norm": 2.1488585472106934, | |
| "learning_rate": 1.9067700783970133e-10, | |
| "loss": 0.013979943096637725, | |
| "mean_token_accuracy": 0.9966666668653488, | |
| "num_tokens": 36027714.0, | |
| "step": 5760 | |
| }, | |
| { | |
| "entropy": 2.070587479151212, | |
| "epoch": 5.0, | |
| "grad_norm": 0.31686675548553467, | |
| "learning_rate": 1.5758480065297676e-12, | |
| "loss": 0.019185705482959746, | |
| "mean_token_accuracy": 0.992816442098373, | |
| "num_tokens": 36090205.0, | |
| "step": 5770 | |
| }, | |
| { | |
| "epoch": 5.0, | |
| "eval_entropy": 1.9783666353320601, | |
| "eval_loss": 0.08960430324077606, | |
| "eval_mean_token_accuracy": 0.9804033803109505, | |
| "eval_num_tokens": 36090205.0, | |
| "eval_runtime": 326.8442, | |
| "eval_samples_per_second": 4.92, | |
| "eval_steps_per_second": 0.615, | |
| "step": 5770 | |
| }, | |
| { | |
| "epoch": 5.0, | |
| "step": 5770, | |
| "total_flos": 2.2732684905831875e+18, | |
| "train_loss": 0.09643875142201085, | |
| "train_runtime": 36470.303, | |
| "train_samples_per_second": 1.265, | |
| "train_steps_per_second": 0.158 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 5770, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 5, | |
| "save_steps": 100, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 2.2732684905831875e+18, | |
| "train_batch_size": 2, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |