[INFO|2025-07-07 09:01:24] tokenization_utils_base.py:2023 >> loading file tokenizer.model from cache at /root/.cache/huggingface/hub/models--pavan-naik--gemma-3-1b-it-exp-init/snapshots/4d7b06baf42c393043b1005e9d26086e1ace64b4/tokenizer.model [INFO|2025-07-07 09:01:24] tokenization_utils_base.py:2023 >> loading file tokenizer.json from cache at /root/.cache/huggingface/hub/models--pavan-naik--gemma-3-1b-it-exp-init/snapshots/4d7b06baf42c393043b1005e9d26086e1ace64b4/tokenizer.json [INFO|2025-07-07 09:01:24] tokenization_utils_base.py:2023 >> loading file added_tokens.json from cache at None [INFO|2025-07-07 09:01:24] tokenization_utils_base.py:2023 >> loading file special_tokens_map.json from cache at /root/.cache/huggingface/hub/models--pavan-naik--gemma-3-1b-it-exp-init/snapshots/4d7b06baf42c393043b1005e9d26086e1ace64b4/special_tokens_map.json [INFO|2025-07-07 09:01:24] tokenization_utils_base.py:2023 >> loading file tokenizer_config.json from cache at /root/.cache/huggingface/hub/models--pavan-naik--gemma-3-1b-it-exp-init/snapshots/4d7b06baf42c393043b1005e9d26086e1ace64b4/tokenizer_config.json [INFO|2025-07-07 09:01:24] tokenization_utils_base.py:2023 >> loading file chat_template.jinja from cache at None [INFO|2025-07-07 09:01:27] configuration_utils.py:698 >> loading configuration file config.json from cache at /root/.cache/huggingface/hub/models--pavan-naik--gemma-3-1b-it-exp-init/snapshots/4d7b06baf42c393043b1005e9d26086e1ace64b4/config.json [INFO|2025-07-07 09:01:27] configuration_utils.py:770 >> Model config Gemma3TextConfig { "architectures": [ "Gemma3ForCausalLM" ], "attention_bias": false, "attention_dropout": 0.0, "attn_logit_softcapping": null, "bos_token_id": 2, "cache_implementation": "hybrid", "eos_token_id": [ 1, 106 ], "final_logit_softcapping": null, "head_dim": 256, "hidden_activation": "gelu_pytorch_tanh", "hidden_size": 1152, "initializer_range": 0.02, "intermediate_size": 6912, "layer_types": [ "sliding_attention", "sliding_attention", "sliding_attention", "sliding_attention", "sliding_attention", "full_attention", "sliding_attention", "sliding_attention", "sliding_attention", "sliding_attention", "sliding_attention", "full_attention", "sliding_attention", "sliding_attention", "sliding_attention", "sliding_attention", "sliding_attention", "full_attention", "sliding_attention", "sliding_attention", "sliding_attention", "sliding_attention", "sliding_attention", "full_attention", "sliding_attention", "sliding_attention" ], "max_position_embeddings": 32768, "model_type": "gemma3_text", "num_attention_heads": 4, "num_hidden_layers": 26, "num_key_value_heads": 1, "pad_token_id": 0, "query_pre_attn_scalar": 256, "rms_norm_eps": 1e-06, "rope_local_base_freq": 10000, "rope_scaling": null, "rope_theta": 1000000, "sliding_window": 512, "sliding_window_pattern": 6, "torch_dtype": "bfloat16", "transformers_version": "4.52.4", "use_cache": true, "vocab_size": 316220 } [INFO|2025-07-07 09:01:27] tokenization_utils_base.py:2023 >> loading file tokenizer.model from cache at /root/.cache/huggingface/hub/models--pavan-naik--gemma-3-1b-it-exp-init/snapshots/4d7b06baf42c393043b1005e9d26086e1ace64b4/tokenizer.model [INFO|2025-07-07 09:01:27] tokenization_utils_base.py:2023 >> loading file tokenizer.json from cache at /root/.cache/huggingface/hub/models--pavan-naik--gemma-3-1b-it-exp-init/snapshots/4d7b06baf42c393043b1005e9d26086e1ace64b4/tokenizer.json [INFO|2025-07-07 09:01:27] tokenization_utils_base.py:2023 >> loading file added_tokens.json from cache at None [INFO|2025-07-07 09:01:27] tokenization_utils_base.py:2023 >> loading file special_tokens_map.json from cache at /root/.cache/huggingface/hub/models--pavan-naik--gemma-3-1b-it-exp-init/snapshots/4d7b06baf42c393043b1005e9d26086e1ace64b4/special_tokens_map.json [INFO|2025-07-07 09:01:27] tokenization_utils_base.py:2023 >> loading file tokenizer_config.json from cache at /root/.cache/huggingface/hub/models--pavan-naik--gemma-3-1b-it-exp-init/snapshots/4d7b06baf42c393043b1005e9d26086e1ace64b4/tokenizer_config.json [INFO|2025-07-07 09:01:27] tokenization_utils_base.py:2023 >> loading file chat_template.jinja from cache at None [INFO|2025-07-07 09:01:29] logging.py:143 >> Add , to stop words. [INFO|2025-07-07 09:01:29] logging.py:143 >> Loading dataset pavan-naik/dataset_mt_pt... [INFO|2025-07-07 09:01:42] logging.py:143 >> Loading dataset pavan-naik/dataset_mt_ft... [INFO|2025-07-07 09:01:45] logging.py:143 >> Loading dataset pavan-naik/dataset_mt_ft... [INFO|2025-07-07 09:01:48] logging.py:143 >> Loading dataset pavan-naik/dataset_mt_ft... [INFO|2025-07-07 09:01:50] logging.py:143 >> Loading dataset pavan-naik/dataset_mt_ft... [INFO|2025-07-07 09:02:53] configuration_utils.py:698 >> loading configuration file config.json from cache at /root/.cache/huggingface/hub/models--pavan-naik--gemma-3-1b-it-exp-init/snapshots/4d7b06baf42c393043b1005e9d26086e1ace64b4/config.json [INFO|2025-07-07 09:02:53] configuration_utils.py:770 >> Model config Gemma3TextConfig { "architectures": [ "Gemma3ForCausalLM" ], "attention_bias": false, "attention_dropout": 0.0, "attn_logit_softcapping": null, "bos_token_id": 2, "cache_implementation": "hybrid", "eos_token_id": [ 1, 106 ], "final_logit_softcapping": null, "head_dim": 256, "hidden_activation": "gelu_pytorch_tanh", "hidden_size": 1152, "initializer_range": 0.02, "intermediate_size": 6912, "layer_types": [ "sliding_attention", "sliding_attention", "sliding_attention", "sliding_attention", "sliding_attention", "full_attention", "sliding_attention", "sliding_attention", "sliding_attention", "sliding_attention", "sliding_attention", "full_attention", "sliding_attention", "sliding_attention", "sliding_attention", "sliding_attention", "sliding_attention", "full_attention", "sliding_attention", "sliding_attention", "sliding_attention", "sliding_attention", "sliding_attention", "full_attention", "sliding_attention", "sliding_attention" ], "max_position_embeddings": 32768, "model_type": "gemma3_text", "num_attention_heads": 4, "num_hidden_layers": 26, "num_key_value_heads": 1, "pad_token_id": 0, "query_pre_attn_scalar": 256, "rms_norm_eps": 1e-06, "rope_local_base_freq": 10000, "rope_scaling": null, "rope_theta": 1000000, "sliding_window": 512, "sliding_window_pattern": 6, "torch_dtype": "bfloat16", "transformers_version": "4.52.4", "use_cache": true, "vocab_size": 316220 } [INFO|2025-07-07 09:02:53] logging.py:143 >> KV cache is disabled during training. [INFO|2025-07-07 09:03:01] modeling_utils.py:1151 >> loading weights file model.safetensors from cache at /root/.cache/huggingface/hub/models--pavan-naik--gemma-3-1b-it-exp-init/snapshots/4d7b06baf42c393043b1005e9d26086e1ace64b4/model.safetensors [INFO|2025-07-07 09:03:01] modeling_utils.py:2241 >> Instantiating Gemma3ForCausalLM model under default dtype torch.bfloat16. [WARNING|2025-07-07 09:03:01] configuration_utils.py:839 >> The following generation flags are not valid and may be ignored: ['cache_implementation']. [INFO|2025-07-07 09:03:01] configuration_utils.py:840 >> - `cache_implementation`: You have set `use_cache` to `False`, but cache_implementation is set to hybrid. cache_implementation will have no effect. If you're using a pretrained model, note that some of these attributes may be set through the model's `generation_config.json` file. [WARNING|2025-07-07 09:03:01] configuration_utils.py:839 >> The following generation flags are not valid and may be ignored: ['cache_implementation']. [INFO|2025-07-07 09:03:01] configuration_utils.py:840 >> - `cache_implementation`: You have set `use_cache` to `False`, but cache_implementation is set to hybrid. cache_implementation will have no effect. If you're using a pretrained model, note that some of these attributes may be set through the model's `generation_config.json` file. [INFO|2025-07-07 09:03:01] configuration_utils.py:1135 >> Generate config GenerationConfig { "bos_token_id": 2, "cache_implementation": "hybrid", "eos_token_id": [ 1, 106 ], "pad_token_id": 0, "use_cache": false } [INFO|2025-07-07 09:03:03] modeling_utils.py:5131 >> All model checkpoint weights were used when initializing Gemma3ForCausalLM. [INFO|2025-07-07 09:03:03] modeling_utils.py:5139 >> All the weights of Gemma3ForCausalLM were initialized from the model checkpoint at pavan-naik/gemma-3-1b-it-exp-init. If your task is similar to the task the model of the checkpoint was trained on, you can already use Gemma3ForCausalLM for predictions without further training. [INFO|2025-07-07 09:03:03] configuration_utils.py:1090 >> loading configuration file generation_config.json from cache at /root/.cache/huggingface/hub/models--pavan-naik--gemma-3-1b-it-exp-init/snapshots/4d7b06baf42c393043b1005e9d26086e1ace64b4/generation_config.json [INFO|2025-07-07 09:03:03] configuration_utils.py:1135 >> Generate config GenerationConfig { "bos_token_id": 2, "cache_implementation": "hybrid", "do_sample": true, "eos_token_id": [ 1, 106 ], "pad_token_id": 0, "top_k": 64, "top_p": 0.95 } [INFO|2025-07-07 09:03:03] logging.py:143 >> Gradient checkpointing enabled. [INFO|2025-07-07 09:03:03] logging.py:143 >> Using FlashAttention-2 for faster training and inference. [INFO|2025-07-07 09:03:03] logging.py:143 >> Upcasting trainable params to float32. [INFO|2025-07-07 09:03:03] logging.py:143 >> Fine-tuning method: Full [INFO|2025-07-07 09:03:03] logging.py:143 >> trainable params: 1,062,181,504 || all params: 1,062,181,504 || trainable%: 100.0000 [INFO|2025-07-07 09:03:03] trainer.py:756 >> Using auto half precision backend [INFO|2025-07-07 09:03:03] trainer.py:2409 >> ***** Running training ***** [INFO|2025-07-07 09:03:03] trainer.py:2410 >> Num examples = 37,425 [INFO|2025-07-07 09:03:03] trainer.py:2411 >> Num Epochs = 3 [INFO|2025-07-07 09:03:03] trainer.py:2412 >> Instantaneous batch size per device = 2 [INFO|2025-07-07 09:03:03] trainer.py:2415 >> Total train batch size (w. parallel, distributed & accumulation) = 16 [INFO|2025-07-07 09:03:03] trainer.py:2416 >> Gradient Accumulation steps = 8 [INFO|2025-07-07 09:03:03] trainer.py:2417 >> Total optimization steps = 7,020 [INFO|2025-07-07 09:03:03] trainer.py:2418 >> Number of trainable parameters = 1,062,181,504 [WARNING|2025-07-07 09:03:04] logging.py:328 >> It is strongly recommended to train Gemma3 models with the `eager` attention implementation instead of `flash_attention_2`. Use `eager` with `AutoModelForCausalLM.from_pretrained('', attn_implementation='eager')`. [WARNING|2025-07-07 09:03:04] logging.py:328 >> The input hidden states seems to be silently casted in float32, this might be related to the fact you have upcasted embedding or layer norm layers in float32. We will cast back the input in torch.bfloat16. [INFO|2025-07-07 09:03:43] logging.py:143 >> {'loss': 4.9381, 'learning_rate': 5.0000e-05, 'epoch': 0.00, 'throughput': 8186.17} [INFO|2025-07-07 09:04:22] logging.py:143 >> {'loss': 3.8819, 'learning_rate': 4.9999e-05, 'epoch': 0.01, 'throughput': 8361.79} [INFO|2025-07-07 09:05:00] logging.py:143 >> {'loss': 3.5405, 'learning_rate': 4.9998e-05, 'epoch': 0.01, 'throughput': 8426.86} [INFO|2025-07-07 09:05:38] logging.py:143 >> {'loss': 3.3836, 'learning_rate': 4.9996e-05, 'epoch': 0.02, 'throughput': 8460.93} [INFO|2025-07-07 09:06:16] logging.py:143 >> {'loss': 3.2566, 'learning_rate': 4.9994e-05, 'epoch': 0.02, 'throughput': 8480.81} [INFO|2025-07-07 09:06:55] logging.py:143 >> {'loss': 3.1111, 'learning_rate': 4.9991e-05, 'epoch': 0.03, 'throughput': 8496.22} [INFO|2025-07-07 09:07:33] logging.py:143 >> {'loss': 3.1209, 'learning_rate': 4.9988e-05, 'epoch': 0.03, 'throughput': 8506.62} [INFO|2025-07-07 09:08:11] logging.py:143 >> {'loss': 2.9762, 'learning_rate': 4.9984e-05, 'epoch': 0.03, 'throughput': 8513.52} [INFO|2025-07-07 09:08:49] logging.py:143 >> {'loss': 3.0640, 'learning_rate': 4.9980e-05, 'epoch': 0.04, 'throughput': 8519.99} [INFO|2025-07-07 09:09:27] logging.py:143 >> {'loss': 2.9331, 'learning_rate': 4.9975e-05, 'epoch': 0.04, 'throughput': 8525.14} [INFO|2025-07-07 09:10:06] logging.py:143 >> {'loss': 2.8377, 'learning_rate': 4.9970e-05, 'epoch': 0.05, 'throughput': 8528.62} [INFO|2025-07-07 09:10:44] logging.py:143 >> {'loss': 2.8364, 'learning_rate': 4.9965e-05, 'epoch': 0.05, 'throughput': 8532.30} [INFO|2025-07-07 09:11:22] logging.py:143 >> {'loss': 2.8559, 'learning_rate': 4.9958e-05, 'epoch': 0.06, 'throughput': 8534.95} [INFO|2025-07-07 09:12:00] logging.py:143 >> {'loss': 2.8052, 'learning_rate': 4.9952e-05, 'epoch': 0.06, 'throughput': 8538.47} [INFO|2025-07-07 09:12:39] logging.py:143 >> {'loss': 2.7576, 'learning_rate': 4.9944e-05, 'epoch': 0.06, 'throughput': 8540.33} [INFO|2025-07-07 09:13:17] logging.py:143 >> {'loss': 2.7844, 'learning_rate': 4.9937e-05, 'epoch': 0.07, 'throughput': 8542.49} [INFO|2025-07-07 09:13:55] logging.py:143 >> {'loss': 2.7195, 'learning_rate': 4.9929e-05, 'epoch': 0.07, 'throughput': 8544.56} [INFO|2025-07-07 09:14:33] logging.py:143 >> {'loss': 2.7487, 'learning_rate': 4.9920e-05, 'epoch': 0.08, 'throughput': 8545.70} [INFO|2025-07-07 09:15:11] logging.py:143 >> {'loss': 2.6517, 'learning_rate': 4.9911e-05, 'epoch': 0.08, 'throughput': 8547.30} [INFO|2025-07-07 09:15:50] logging.py:143 >> {'loss': 2.6831, 'learning_rate': 4.9901e-05, 'epoch': 0.09, 'throughput': 8548.96} [INFO|2025-07-07 09:16:28] logging.py:143 >> {'loss': 2.6750, 'learning_rate': 4.9891e-05, 'epoch': 0.09, 'throughput': 8549.93} [INFO|2025-07-07 09:17:06] logging.py:143 >> {'loss': 2.5979, 'learning_rate': 4.9880e-05, 'epoch': 0.09, 'throughput': 8550.62} [INFO|2025-07-07 09:17:44] logging.py:143 >> {'loss': 2.6091, 'learning_rate': 4.9869e-05, 'epoch': 0.10, 'throughput': 8551.95} [INFO|2025-07-07 09:18:22] logging.py:143 >> {'loss': 2.6102, 'learning_rate': 4.9857e-05, 'epoch': 0.10, 'throughput': 8552.73} [INFO|2025-07-07 09:19:01] logging.py:143 >> {'loss': 2.5860, 'learning_rate': 4.9845e-05, 'epoch': 0.11, 'throughput': 8553.54} [INFO|2025-07-07 09:19:39] logging.py:143 >> {'loss': 2.6111, 'learning_rate': 4.9832e-05, 'epoch': 0.11, 'throughput': 8554.03} [INFO|2025-07-07 09:20:17] logging.py:143 >> {'loss': 2.5680, 'learning_rate': 4.9819e-05, 'epoch': 0.12, 'throughput': 8554.79} [INFO|2025-07-07 09:20:55] logging.py:143 >> {'loss': 2.5989, 'learning_rate': 4.9805e-05, 'epoch': 0.12, 'throughput': 8556.11} [INFO|2025-07-07 09:21:33] logging.py:143 >> {'loss': 2.4962, 'learning_rate': 4.9791e-05, 'epoch': 0.12, 'throughput': 8557.00} [INFO|2025-07-07 09:22:11] logging.py:143 >> {'loss': 2.4715, 'learning_rate': 4.9777e-05, 'epoch': 0.13, 'throughput': 8557.76} [INFO|2025-07-07 09:22:50] logging.py:143 >> {'loss': 2.5320, 'learning_rate': 4.9761e-05, 'epoch': 0.13, 'throughput': 8558.53} [INFO|2025-07-07 09:23:28] logging.py:143 >> {'loss': 2.4768, 'learning_rate': 4.9746e-05, 'epoch': 0.14, 'throughput': 8559.06} [INFO|2025-07-07 09:24:06] logging.py:143 >> {'loss': 2.5623, 'learning_rate': 4.9730e-05, 'epoch': 0.14, 'throughput': 8559.39} [INFO|2025-07-07 09:24:44] logging.py:143 >> {'loss': 2.5221, 'learning_rate': 4.9713e-05, 'epoch': 0.15, 'throughput': 8559.68} [INFO|2025-07-07 09:25:22] logging.py:143 >> {'loss': 2.5476, 'learning_rate': 4.9696e-05, 'epoch': 0.15, 'throughput': 8559.92} [INFO|2025-07-07 09:26:01] logging.py:143 >> {'loss': 2.5744, 'learning_rate': 4.9678e-05, 'epoch': 0.15, 'throughput': 8560.71} [INFO|2025-07-07 09:26:39] logging.py:143 >> {'loss': 2.4634, 'learning_rate': 4.9660e-05, 'epoch': 0.16, 'throughput': 8560.90} [INFO|2025-07-07 09:27:17] logging.py:143 >> {'loss': 2.4537, 'learning_rate': 4.9641e-05, 'epoch': 0.16, 'throughput': 8561.24} [INFO|2025-07-07 09:27:55] logging.py:143 >> {'loss': 2.4139, 'learning_rate': 4.9622e-05, 'epoch': 0.17, 'throughput': 8561.64} [INFO|2025-07-07 09:28:33] logging.py:143 >> {'loss': 2.4443, 'learning_rate': 4.9603e-05, 'epoch': 0.17, 'throughput': 8561.60} [INFO|2025-07-07 09:29:12] logging.py:143 >> {'loss': 2.4186, 'learning_rate': 4.9582e-05, 'epoch': 0.18, 'throughput': 8561.62} [INFO|2025-07-07 09:29:50] logging.py:143 >> {'loss': 2.3016, 'learning_rate': 4.9562e-05, 'epoch': 0.18, 'throughput': 8562.10} [INFO|2025-07-07 09:30:28] logging.py:143 >> {'loss': 2.3719, 'learning_rate': 4.9541e-05, 'epoch': 0.18, 'throughput': 8561.97} [INFO|2025-07-07 09:31:06] logging.py:143 >> {'loss': 2.4790, 'learning_rate': 4.9519e-05, 'epoch': 0.19, 'throughput': 8562.17} [INFO|2025-07-07 09:31:45] logging.py:143 >> {'loss': 2.3988, 'learning_rate': 4.9497e-05, 'epoch': 0.19, 'throughput': 8562.53} [INFO|2025-07-07 09:32:23] logging.py:143 >> {'loss': 2.3885, 'learning_rate': 4.9474e-05, 'epoch': 0.20, 'throughput': 8561.09} [INFO|2025-07-07 09:33:01] logging.py:143 >> {'loss': 2.2970, 'learning_rate': 4.9451e-05, 'epoch': 0.20, 'throughput': 8561.51} [INFO|2025-07-07 09:33:39] logging.py:143 >> {'loss': 2.3227, 'learning_rate': 4.9428e-05, 'epoch': 0.21, 'throughput': 8561.74} [INFO|2025-07-07 09:34:18] logging.py:143 >> {'loss': 2.4198, 'learning_rate': 4.9404e-05, 'epoch': 0.21, 'throughput': 8561.84} [INFO|2025-07-07 09:34:56] logging.py:143 >> {'loss': 2.3376, 'learning_rate': 4.9379e-05, 'epoch': 0.21, 'throughput': 8562.11} [INFO|2025-07-07 09:35:34] logging.py:143 >> {'loss': 2.2503, 'learning_rate': 4.9354e-05, 'epoch': 0.22, 'throughput': 8562.24} [INFO|2025-07-07 09:36:12] logging.py:143 >> {'loss': 2.3890, 'learning_rate': 4.9329e-05, 'epoch': 0.22, 'throughput': 8562.35} [INFO|2025-07-07 09:36:51] logging.py:143 >> {'loss': 2.2387, 'learning_rate': 4.9303e-05, 'epoch': 0.23, 'throughput': 8562.61} [INFO|2025-07-07 09:37:29] logging.py:143 >> {'loss': 2.2643, 'learning_rate': 4.9276e-05, 'epoch': 0.23, 'throughput': 8562.57} [INFO|2025-07-07 09:38:07] logging.py:143 >> {'loss': 2.2828, 'learning_rate': 4.9249e-05, 'epoch': 0.24, 'throughput': 8562.66} [INFO|2025-07-07 09:38:45] logging.py:143 >> {'loss': 2.2765, 'learning_rate': 4.9222e-05, 'epoch': 0.24, 'throughput': 8562.99} [INFO|2025-07-07 09:39:23] logging.py:143 >> {'loss': 2.3353, 'learning_rate': 4.9194e-05, 'epoch': 0.24, 'throughput': 8563.25} [INFO|2025-07-07 09:40:02] logging.py:143 >> {'loss': 2.2820, 'learning_rate': 4.9165e-05, 'epoch': 0.25, 'throughput': 8563.63} [INFO|2025-07-07 09:40:40] logging.py:143 >> {'loss': 2.2684, 'learning_rate': 4.9137e-05, 'epoch': 0.25, 'throughput': 8563.81} [INFO|2025-07-07 09:41:18] logging.py:143 >> {'loss': 2.2090, 'learning_rate': 4.9107e-05, 'epoch': 0.26, 'throughput': 8563.90} [INFO|2025-07-07 09:41:56] logging.py:143 >> {'loss': 2.2076, 'learning_rate': 4.9077e-05, 'epoch': 0.26, 'throughput': 8564.00} [INFO|2025-07-07 09:42:34] logging.py:143 >> {'loss': 2.3104, 'learning_rate': 4.9047e-05, 'epoch': 0.27, 'throughput': 8563.91} [INFO|2025-07-07 09:43:13] logging.py:143 >> {'loss': 2.2274, 'learning_rate': 4.9016e-05, 'epoch': 0.27, 'throughput': 8563.76} [INFO|2025-07-07 09:43:51] logging.py:143 >> {'loss': 2.2542, 'learning_rate': 4.8985e-05, 'epoch': 0.27, 'throughput': 8563.84} [INFO|2025-07-07 09:44:29] logging.py:143 >> {'loss': 2.1658, 'learning_rate': 4.8953e-05, 'epoch': 0.28, 'throughput': 8563.68} [INFO|2025-07-07 09:45:08] logging.py:143 >> {'loss': 2.3806, 'learning_rate': 4.8921e-05, 'epoch': 0.28, 'throughput': 8563.44} [INFO|2025-07-07 09:45:46] logging.py:143 >> {'loss': 2.3020, 'learning_rate': 4.8888e-05, 'epoch': 0.29, 'throughput': 8563.38} [INFO|2025-07-07 09:46:24] logging.py:143 >> {'loss': 2.3072, 'learning_rate': 4.8855e-05, 'epoch': 0.29, 'throughput': 8563.47} [INFO|2025-07-07 09:47:02] logging.py:143 >> {'loss': 2.2678, 'learning_rate': 4.8821e-05, 'epoch': 0.29, 'throughput': 8563.65} [INFO|2025-07-07 09:47:40] logging.py:143 >> {'loss': 2.2598, 'learning_rate': 4.8787e-05, 'epoch': 0.30, 'throughput': 8563.91} [INFO|2025-07-07 09:48:19] logging.py:143 >> {'loss': 2.1845, 'learning_rate': 4.8752e-05, 'epoch': 0.30, 'throughput': 8564.04} [INFO|2025-07-07 09:48:57] logging.py:143 >> {'loss': 2.1312, 'learning_rate': 4.8717e-05, 'epoch': 0.31, 'throughput': 8564.17} [INFO|2025-07-07 09:49:35] logging.py:143 >> {'loss': 2.2494, 'learning_rate': 4.8681e-05, 'epoch': 0.31, 'throughput': 8564.17} [INFO|2025-07-07 09:50:13] logging.py:143 >> {'loss': 2.1997, 'learning_rate': 4.8645e-05, 'epoch': 0.32, 'throughput': 8564.18} [INFO|2025-07-07 09:50:51] logging.py:143 >> {'loss': 2.2374, 'learning_rate': 4.8609e-05, 'epoch': 0.32, 'throughput': 8564.34} [INFO|2025-07-07 09:51:30] logging.py:143 >> {'loss': 2.2097, 'learning_rate': 4.8572e-05, 'epoch': 0.32, 'throughput': 8564.44} [INFO|2025-07-07 09:52:08] logging.py:143 >> {'loss': 2.1710, 'learning_rate': 4.8534e-05, 'epoch': 0.33, 'throughput': 8564.56} [INFO|2025-07-07 09:52:46] logging.py:143 >> {'loss': 2.1233, 'learning_rate': 4.8496e-05, 'epoch': 0.33, 'throughput': 8564.68} [INFO|2025-07-07 09:53:24] logging.py:143 >> {'loss': 2.1613, 'learning_rate': 4.8458e-05, 'epoch': 0.34, 'throughput': 8564.76} [INFO|2025-07-07 09:54:03] logging.py:143 >> {'loss': 2.1486, 'learning_rate': 4.8419e-05, 'epoch': 0.34, 'throughput': 8564.82} [INFO|2025-07-07 09:54:41] logging.py:143 >> {'loss': 2.2034, 'learning_rate': 4.8379e-05, 'epoch': 0.35, 'throughput': 8564.86} [INFO|2025-07-07 09:55:19] logging.py:143 >> {'loss': 2.1292, 'learning_rate': 4.8340e-05, 'epoch': 0.35, 'throughput': 8564.86} [INFO|2025-07-07 09:55:57] logging.py:143 >> {'loss': 2.1516, 'learning_rate': 4.8299e-05, 'epoch': 0.35, 'throughput': 8564.90} [INFO|2025-07-07 09:56:35] logging.py:143 >> {'loss': 2.1836, 'learning_rate': 4.8258e-05, 'epoch': 0.36, 'throughput': 8564.96} [INFO|2025-07-07 09:57:14] logging.py:143 >> {'loss': 2.1780, 'learning_rate': 4.8217e-05, 'epoch': 0.36, 'throughput': 8565.04} [INFO|2025-07-07 09:57:52] logging.py:143 >> {'loss': 2.1324, 'learning_rate': 4.8175e-05, 'epoch': 0.37, 'throughput': 8565.22} [INFO|2025-07-07 09:58:30] logging.py:143 >> {'loss': 2.1315, 'learning_rate': 4.8133e-05, 'epoch': 0.37, 'throughput': 8565.25} [INFO|2025-07-07 09:59:08] logging.py:143 >> {'loss': 2.1455, 'learning_rate': 4.8091e-05, 'epoch': 0.38, 'throughput': 8565.25} [INFO|2025-07-07 09:59:47] logging.py:143 >> {'loss': 2.1994, 'learning_rate': 4.8047e-05, 'epoch': 0.38, 'throughput': 8565.18} [INFO|2025-07-07 10:00:25] logging.py:143 >> {'loss': 2.1893, 'learning_rate': 4.8004e-05, 'epoch': 0.38, 'throughput': 8565.06} [INFO|2025-07-07 10:01:03] logging.py:143 >> {'loss': 2.1630, 'learning_rate': 4.7960e-05, 'epoch': 0.39, 'throughput': 8564.82} [INFO|2025-07-07 10:01:41] logging.py:143 >> {'loss': 2.1594, 'learning_rate': 4.7915e-05, 'epoch': 0.39, 'throughput': 8564.75} [INFO|2025-07-07 10:02:20] logging.py:143 >> {'loss': 2.1345, 'learning_rate': 4.7870e-05, 'epoch': 0.40, 'throughput': 8563.84} [INFO|2025-07-07 10:02:58] logging.py:143 >> {'loss': 2.1742, 'learning_rate': 4.7825e-05, 'epoch': 0.40, 'throughput': 8563.75} [INFO|2025-07-07 10:03:37] logging.py:143 >> {'loss': 2.1453, 'learning_rate': 4.7779e-05, 'epoch': 0.41, 'throughput': 8563.76} [INFO|2025-07-07 10:04:15] logging.py:143 >> {'loss': 2.1402, 'learning_rate': 4.7733e-05, 'epoch': 0.41, 'throughput': 8563.71} [INFO|2025-07-07 10:04:53] logging.py:143 >> {'loss': 2.1032, 'learning_rate': 4.7686e-05, 'epoch': 0.41, 'throughput': 8563.82} [INFO|2025-07-07 10:05:31] logging.py:143 >> {'loss': 2.0836, 'learning_rate': 4.7639e-05, 'epoch': 0.42, 'throughput': 8563.80} [INFO|2025-07-07 10:06:10] logging.py:143 >> {'loss': 2.1488, 'learning_rate': 4.7591e-05, 'epoch': 0.42, 'throughput': 8563.86} [INFO|2025-07-07 10:06:48] logging.py:143 >> {'loss': 2.0922, 'learning_rate': 4.7543e-05, 'epoch': 0.43, 'throughput': 8563.98} [INFO|2025-07-07 10:07:26] logging.py:143 >> {'loss': 1.9991, 'learning_rate': 4.7494e-05, 'epoch': 0.43, 'throughput': 8564.04} [INFO|2025-07-07 10:08:04] logging.py:143 >> {'loss': 2.1745, 'learning_rate': 4.7445e-05, 'epoch': 0.44, 'throughput': 8564.05} [INFO|2025-07-07 10:08:42] logging.py:143 >> {'loss': 2.0342, 'learning_rate': 4.7396e-05, 'epoch': 0.44, 'throughput': 8564.16} [INFO|2025-07-07 10:09:21] logging.py:143 >> {'loss': 2.1176, 'learning_rate': 4.7346e-05, 'epoch': 0.44, 'throughput': 8564.21} [INFO|2025-07-07 10:09:59] logging.py:143 >> {'loss': 2.1399, 'learning_rate': 4.7295e-05, 'epoch': 0.45, 'throughput': 8564.32} [INFO|2025-07-07 10:10:37] logging.py:143 >> {'loss': 2.1457, 'learning_rate': 4.7245e-05, 'epoch': 0.45, 'throughput': 8564.39} [INFO|2025-07-07 10:11:15] logging.py:143 >> {'loss': 2.0530, 'learning_rate': 4.7193e-05, 'epoch': 0.46, 'throughput': 8564.55} [INFO|2025-07-07 10:11:53] logging.py:143 >> {'loss': 2.0208, 'learning_rate': 4.7142e-05, 'epoch': 0.46, 'throughput': 8564.67} [INFO|2025-07-07 10:12:32] logging.py:143 >> {'loss': 2.0069, 'learning_rate': 4.7089e-05, 'epoch': 0.47, 'throughput': 8564.68} [INFO|2025-07-07 10:13:10] logging.py:143 >> {'loss': 2.0212, 'learning_rate': 4.7037e-05, 'epoch': 0.47, 'throughput': 8564.72} [INFO|2025-07-07 10:13:48] logging.py:143 >> {'loss': 2.0986, 'learning_rate': 4.6984e-05, 'epoch': 0.47, 'throughput': 8564.85} [INFO|2025-07-07 10:14:26] logging.py:143 >> {'loss': 2.0622, 'learning_rate': 4.6930e-05, 'epoch': 0.48, 'throughput': 8564.85} [INFO|2025-07-07 10:15:05] logging.py:143 >> {'loss': 2.0935, 'learning_rate': 4.6876e-05, 'epoch': 0.48, 'throughput': 8564.69} [INFO|2025-07-07 10:15:43] logging.py:143 >> {'loss': 2.0940, 'learning_rate': 4.6822e-05, 'epoch': 0.49, 'throughput': 8564.54} [INFO|2025-07-07 10:16:21] logging.py:143 >> {'loss': 2.1030, 'learning_rate': 4.6767e-05, 'epoch': 0.49, 'throughput': 8564.46} [INFO|2025-07-07 10:16:59] logging.py:143 >> {'loss': 2.0973, 'learning_rate': 4.6712e-05, 'epoch': 0.50, 'throughput': 8564.40} [INFO|2025-07-07 10:17:38] logging.py:143 >> {'loss': 2.0108, 'learning_rate': 4.6656e-05, 'epoch': 0.50, 'throughput': 8564.23} [INFO|2025-07-07 10:18:16] logging.py:143 >> {'loss': 2.1596, 'learning_rate': 4.6600e-05, 'epoch': 0.50, 'throughput': 8564.14} [INFO|2025-07-07 10:18:54] logging.py:143 >> {'loss': 2.0153, 'learning_rate': 4.6544e-05, 'epoch': 0.51, 'throughput': 8564.17} [INFO|2025-07-07 10:19:32] logging.py:143 >> {'loss': 1.9805, 'learning_rate': 4.6487e-05, 'epoch': 0.51, 'throughput': 8564.12} [INFO|2025-07-07 10:20:11] logging.py:143 >> {'loss': 2.0650, 'learning_rate': 4.6429e-05, 'epoch': 0.52, 'throughput': 8564.05} [INFO|2025-07-07 10:20:49] logging.py:143 >> {'loss': 2.0452, 'learning_rate': 4.6371e-05, 'epoch': 0.52, 'throughput': 8564.03} [INFO|2025-07-07 10:21:27] logging.py:143 >> {'loss': 2.0896, 'learning_rate': 4.6313e-05, 'epoch': 0.53, 'throughput': 8564.14} [INFO|2025-07-07 10:22:05] logging.py:143 >> {'loss': 2.0438, 'learning_rate': 4.6254e-05, 'epoch': 0.53, 'throughput': 8564.23} [INFO|2025-07-07 10:22:44] logging.py:143 >> {'loss': 2.1078, 'learning_rate': 4.6195e-05, 'epoch': 0.53, 'throughput': 8564.42} [INFO|2025-07-07 10:23:22] logging.py:143 >> {'loss': 2.0166, 'learning_rate': 4.6136e-05, 'epoch': 0.54, 'throughput': 8564.45} [INFO|2025-07-07 10:24:00] logging.py:143 >> {'loss': 2.0937, 'learning_rate': 4.6076e-05, 'epoch': 0.54, 'throughput': 8564.59} [INFO|2025-07-07 10:24:38] logging.py:143 >> {'loss': 2.0232, 'learning_rate': 4.6015e-05, 'epoch': 0.55, 'throughput': 8564.64} [INFO|2025-07-07 10:25:16] logging.py:143 >> {'loss': 2.0566, 'learning_rate': 4.5955e-05, 'epoch': 0.55, 'throughput': 8564.77} [INFO|2025-07-07 10:25:54] logging.py:143 >> {'loss': 2.0634, 'learning_rate': 4.5893e-05, 'epoch': 0.56, 'throughput': 8565.01} [INFO|2025-07-07 10:26:33] logging.py:143 >> {'loss': 1.9745, 'learning_rate': 4.5832e-05, 'epoch': 0.56, 'throughput': 8565.18} [INFO|2025-07-07 10:27:11] logging.py:143 >> {'loss': 1.9960, 'learning_rate': 4.5770e-05, 'epoch': 0.56, 'throughput': 8565.34} [INFO|2025-07-07 10:27:49] logging.py:143 >> {'loss': 2.0044, 'learning_rate': 4.5707e-05, 'epoch': 0.57, 'throughput': 8565.46} [INFO|2025-07-07 10:28:27] logging.py:143 >> {'loss': 2.0258, 'learning_rate': 4.5644e-05, 'epoch': 0.57, 'throughput': 8565.57} [INFO|2025-07-07 10:29:05] logging.py:143 >> {'loss': 2.0917, 'learning_rate': 4.5581e-05, 'epoch': 0.58, 'throughput': 8565.70} [INFO|2025-07-07 10:29:43] logging.py:143 >> {'loss': 2.0203, 'learning_rate': 4.5517e-05, 'epoch': 0.58, 'throughput': 8565.85} [INFO|2025-07-07 10:30:22] logging.py:143 >> {'loss': 1.9672, 'learning_rate': 4.5453e-05, 'epoch': 0.59, 'throughput': 8565.93} [INFO|2025-07-07 10:31:00] logging.py:143 >> {'loss': 2.0579, 'learning_rate': 4.5389e-05, 'epoch': 0.59, 'throughput': 8565.97} [INFO|2025-07-07 10:31:38] logging.py:143 >> {'loss': 1.9721, 'learning_rate': 4.5324e-05, 'epoch': 0.59, 'throughput': 8566.06} [INFO|2025-07-07 10:32:16] logging.py:143 >> {'loss': 1.9970, 'learning_rate': 4.5258e-05, 'epoch': 0.60, 'throughput': 8565.51} [INFO|2025-07-07 10:32:55] logging.py:143 >> {'loss': 2.0123, 'learning_rate': 4.5192e-05, 'epoch': 0.60, 'throughput': 8565.58} [INFO|2025-07-07 10:33:33] logging.py:143 >> {'loss': 2.0283, 'learning_rate': 4.5126e-05, 'epoch': 0.61, 'throughput': 8565.61} [INFO|2025-07-07 10:34:11] logging.py:143 >> {'loss': 2.0609, 'learning_rate': 4.5060e-05, 'epoch': 0.61, 'throughput': 8565.66} [INFO|2025-07-07 10:34:49] logging.py:143 >> {'loss': 1.9732, 'learning_rate': 4.4993e-05, 'epoch': 0.62, 'throughput': 8565.76} [INFO|2025-07-07 10:35:27] logging.py:143 >> {'loss': 1.9985, 'learning_rate': 4.4925e-05, 'epoch': 0.62, 'throughput': 8565.80} [INFO|2025-07-07 10:36:06] logging.py:143 >> {'loss': 1.9763, 'learning_rate': 4.4858e-05, 'epoch': 0.62, 'throughput': 8565.74} [INFO|2025-07-07 10:36:44] logging.py:143 >> {'loss': 2.0714, 'learning_rate': 4.4789e-05, 'epoch': 0.63, 'throughput': 8565.81} [INFO|2025-07-07 10:37:22] logging.py:143 >> {'loss': 1.9672, 'learning_rate': 4.4721e-05, 'epoch': 0.63, 'throughput': 8565.88} [INFO|2025-07-07 10:38:00] logging.py:143 >> {'loss': 2.0066, 'learning_rate': 4.4652e-05, 'epoch': 0.64, 'throughput': 8566.02} [INFO|2025-07-07 10:38:39] logging.py:143 >> {'loss': 2.0231, 'learning_rate': 4.4583e-05, 'epoch': 0.64, 'throughput': 8565.96} [INFO|2025-07-07 10:39:17] logging.py:143 >> {'loss': 1.9314, 'learning_rate': 4.4513e-05, 'epoch': 0.65, 'throughput': 8565.92} [INFO|2025-07-07 10:39:55] logging.py:143 >> {'loss': 2.0482, 'learning_rate': 4.4443e-05, 'epoch': 0.65, 'throughput': 8566.02} [INFO|2025-07-07 10:40:33] logging.py:143 >> {'loss': 1.9966, 'learning_rate': 4.4372e-05, 'epoch': 0.65, 'throughput': 8566.07} [INFO|2025-07-07 10:41:11] logging.py:143 >> {'loss': 1.9621, 'learning_rate': 4.4301e-05, 'epoch': 0.66, 'throughput': 8566.14} [INFO|2025-07-07 10:41:50] logging.py:143 >> {'loss': 2.0807, 'learning_rate': 4.4230e-05, 'epoch': 0.66, 'throughput': 8566.25} [INFO|2025-07-07 10:42:28] logging.py:143 >> {'loss': 2.0054, 'learning_rate': 4.4158e-05, 'epoch': 0.67, 'throughput': 8566.25} [INFO|2025-07-07 10:43:06] logging.py:143 >> {'loss': 1.9171, 'learning_rate': 4.4086e-05, 'epoch': 0.67, 'throughput': 8566.29} [INFO|2025-07-07 10:43:44] logging.py:143 >> {'loss': 1.9762, 'learning_rate': 4.4014e-05, 'epoch': 0.68, 'throughput': 8566.38} [INFO|2025-07-07 10:44:22] logging.py:143 >> {'loss': 1.9897, 'learning_rate': 4.3941e-05, 'epoch': 0.68, 'throughput': 8566.42} [INFO|2025-07-07 10:45:01] logging.py:143 >> {'loss': 1.9334, 'learning_rate': 4.3868e-05, 'epoch': 0.68, 'throughput': 8566.48} [INFO|2025-07-07 10:45:39] logging.py:143 >> {'loss': 1.9742, 'learning_rate': 4.3794e-05, 'epoch': 0.69, 'throughput': 8566.51} [INFO|2025-07-07 10:46:17] logging.py:143 >> {'loss': 2.0216, 'learning_rate': 4.3720e-05, 'epoch': 0.69, 'throughput': 8566.53} [INFO|2025-07-07 10:46:55] logging.py:143 >> {'loss': 1.9699, 'learning_rate': 4.3646e-05, 'epoch': 0.70, 'throughput': 8566.59} [INFO|2025-07-07 10:47:33] logging.py:143 >> {'loss': 1.8862, 'learning_rate': 4.3571e-05, 'epoch': 0.70, 'throughput': 8566.65} [INFO|2025-07-07 10:48:12] logging.py:143 >> {'loss': 1.8930, 'learning_rate': 4.3496e-05, 'epoch': 0.71, 'throughput': 8566.66} [INFO|2025-07-07 10:48:50] logging.py:143 >> {'loss': 1.9916, 'learning_rate': 4.3421e-05, 'epoch': 0.71, 'throughput': 8566.76} [INFO|2025-07-07 10:49:28] logging.py:143 >> {'loss': 1.9914, 'learning_rate': 4.3345e-05, 'epoch': 0.71, 'throughput': 8566.78} [INFO|2025-07-07 10:50:06] logging.py:143 >> {'loss': 1.9965, 'learning_rate': 4.3269e-05, 'epoch': 0.72, 'throughput': 8566.84} [INFO|2025-07-07 10:50:44] logging.py:143 >> {'loss': 1.9283, 'learning_rate': 4.3192e-05, 'epoch': 0.72, 'throughput': 8566.92} [INFO|2025-07-07 10:51:22] logging.py:143 >> {'loss': 1.9059, 'learning_rate': 4.3115e-05, 'epoch': 0.73, 'throughput': 8566.98} [INFO|2025-07-07 10:52:01] logging.py:143 >> {'loss': 1.9928, 'learning_rate': 4.3038e-05, 'epoch': 0.73, 'throughput': 8566.99} [INFO|2025-07-07 10:52:39] logging.py:143 >> {'loss': 1.9344, 'learning_rate': 4.2960e-05, 'epoch': 0.74, 'throughput': 8567.01} [INFO|2025-07-07 10:53:17] logging.py:143 >> {'loss': 1.9762, 'learning_rate': 4.2882e-05, 'epoch': 0.74, 'throughput': 8567.00} [INFO|2025-07-07 10:53:55] logging.py:143 >> {'loss': 1.9124, 'learning_rate': 4.2804e-05, 'epoch': 0.74, 'throughput': 8567.06} [INFO|2025-07-07 10:54:34] logging.py:143 >> {'loss': 1.9209, 'learning_rate': 4.2725e-05, 'epoch': 0.75, 'throughput': 8567.07} [INFO|2025-07-07 10:55:12] logging.py:143 >> {'loss': 1.8574, 'learning_rate': 4.2646e-05, 'epoch': 0.75, 'throughput': 8567.14} [INFO|2025-07-07 10:55:50] logging.py:143 >> {'loss': 1.9827, 'learning_rate': 4.2567e-05, 'epoch': 0.76, 'throughput': 8567.24} [INFO|2025-07-07 10:56:28] logging.py:143 >> {'loss': 1.9040, 'learning_rate': 4.2487e-05, 'epoch': 0.76, 'throughput': 8567.32} [INFO|2025-07-07 10:57:06] logging.py:143 >> {'loss': 1.9355, 'learning_rate': 4.2407e-05, 'epoch': 0.77, 'throughput': 8567.39} [INFO|2025-07-07 10:57:44] logging.py:143 >> {'loss': 1.9286, 'learning_rate': 4.2326e-05, 'epoch': 0.77, 'throughput': 8567.43} [INFO|2025-07-07 10:58:23] logging.py:143 >> {'loss': 1.8837, 'learning_rate': 4.2245e-05, 'epoch': 0.77, 'throughput': 8567.48} [INFO|2025-07-07 10:59:01] logging.py:143 >> {'loss': 1.9146, 'learning_rate': 4.2164e-05, 'epoch': 0.78, 'throughput': 8567.60} [INFO|2025-07-07 10:59:39] logging.py:143 >> {'loss': 1.9716, 'learning_rate': 4.2083e-05, 'epoch': 0.78, 'throughput': 8567.62} [INFO|2025-07-07 11:00:17] logging.py:143 >> {'loss': 1.8861, 'learning_rate': 4.2001e-05, 'epoch': 0.79, 'throughput': 8567.58} [INFO|2025-07-07 11:00:55] logging.py:143 >> {'loss': 1.8940, 'learning_rate': 4.1919e-05, 'epoch': 0.79, 'throughput': 8567.54} [INFO|2025-07-07 11:01:34] logging.py:143 >> {'loss': 1.8972, 'learning_rate': 4.1836e-05, 'epoch': 0.80, 'throughput': 8567.49} [INFO|2025-07-07 11:02:12] logging.py:143 >> {'loss': 1.9065, 'learning_rate': 4.1753e-05, 'epoch': 0.80, 'throughput': 8567.05} [INFO|2025-07-07 11:02:51] logging.py:143 >> {'loss': 1.9212, 'learning_rate': 4.1670e-05, 'epoch': 0.80, 'throughput': 8567.05} [INFO|2025-07-07 11:03:29] logging.py:143 >> {'loss': 1.8971, 'learning_rate': 4.1586e-05, 'epoch': 0.81, 'throughput': 8567.02} [INFO|2025-07-07 11:04:07] logging.py:143 >> {'loss': 1.9933, 'learning_rate': 4.1503e-05, 'epoch': 0.81, 'throughput': 8567.01} [INFO|2025-07-07 11:04:45] logging.py:143 >> {'loss': 2.0008, 'learning_rate': 4.1418e-05, 'epoch': 0.82, 'throughput': 8567.02} [INFO|2025-07-07 11:05:24] logging.py:143 >> {'loss': 1.8917, 'learning_rate': 4.1334e-05, 'epoch': 0.82, 'throughput': 8567.01} [INFO|2025-07-07 11:06:02] logging.py:143 >> {'loss': 1.9964, 'learning_rate': 4.1249e-05, 'epoch': 0.83, 'throughput': 8566.99} [INFO|2025-07-07 11:06:40] logging.py:143 >> {'loss': 1.8707, 'learning_rate': 4.1164e-05, 'epoch': 0.83, 'throughput': 8566.98} [INFO|2025-07-07 11:07:18] logging.py:143 >> {'loss': 1.8983, 'learning_rate': 4.1078e-05, 'epoch': 0.83, 'throughput': 8567.00} [INFO|2025-07-07 11:07:56] logging.py:143 >> {'loss': 1.8836, 'learning_rate': 4.0992e-05, 'epoch': 0.84, 'throughput': 8567.02} [INFO|2025-07-07 11:08:35] logging.py:143 >> {'loss': 1.9885, 'learning_rate': 4.0906e-05, 'epoch': 0.84, 'throughput': 8566.95} [INFO|2025-07-07 11:09:13] logging.py:143 >> {'loss': 1.9093, 'learning_rate': 4.0820e-05, 'epoch': 0.85, 'throughput': 8566.99} [INFO|2025-07-07 11:09:51] logging.py:143 >> {'loss': 1.8501, 'learning_rate': 4.0733e-05, 'epoch': 0.85, 'throughput': 8567.04} [INFO|2025-07-07 11:10:29] logging.py:143 >> {'loss': 1.9367, 'learning_rate': 4.0646e-05, 'epoch': 0.86, 'throughput': 8567.07} [INFO|2025-07-07 11:10:29] trainer.py:3993 >> Saving model checkpoint to saves/Gemma-3-1B-Instruct/full/train_2025-07-07-08-57-22/checkpoint-2000 [INFO|2025-07-07 11:10:29] configuration_utils.py:424 >> Configuration saved in saves/Gemma-3-1B-Instruct/full/train_2025-07-07-08-57-22/checkpoint-2000/config.json [INFO|2025-07-07 11:10:29] configuration_utils.py:904 >> Configuration saved in saves/Gemma-3-1B-Instruct/full/train_2025-07-07-08-57-22/checkpoint-2000/generation_config.json [INFO|2025-07-07 11:10:45] modeling_utils.py:3725 >> Model weights saved in saves/Gemma-3-1B-Instruct/full/train_2025-07-07-08-57-22/checkpoint-2000/model.safetensors [INFO|2025-07-07 11:10:45] tokenization_utils_base.py:2356 >> chat template saved in saves/Gemma-3-1B-Instruct/full/train_2025-07-07-08-57-22/checkpoint-2000/chat_template.jinja [INFO|2025-07-07 11:10:45] tokenization_utils_base.py:2525 >> tokenizer config file saved in saves/Gemma-3-1B-Instruct/full/train_2025-07-07-08-57-22/checkpoint-2000/tokenizer_config.json [INFO|2025-07-07 11:10:45] tokenization_utils_base.py:2534 >> Special tokens file saved in saves/Gemma-3-1B-Instruct/full/train_2025-07-07-08-57-22/checkpoint-2000/special_tokens_map.json [INFO|2025-07-07 11:11:53] logging.py:143 >> {'loss': 1.9343, 'learning_rate': 4.0558e-05, 'epoch': 0.86, 'throughput': 8516.28} [INFO|2025-07-07 11:12:32] logging.py:143 >> {'loss': 1.9520, 'learning_rate': 4.0471e-05, 'epoch': 0.86, 'throughput': 8516.51} [INFO|2025-07-07 11:13:10] logging.py:143 >> {'loss': 1.8882, 'learning_rate': 4.0383e-05, 'epoch': 0.87, 'throughput': 8516.74} [INFO|2025-07-07 11:13:48] logging.py:143 >> {'loss': 1.9366, 'learning_rate': 4.0294e-05, 'epoch': 0.87, 'throughput': 8516.99} [INFO|2025-07-07 11:14:26] logging.py:143 >> {'loss': 1.9869, 'learning_rate': 4.0206e-05, 'epoch': 0.88, 'throughput': 8517.21} [INFO|2025-07-07 11:15:05] logging.py:143 >> {'loss': 1.8388, 'learning_rate': 4.0117e-05, 'epoch': 0.88, 'throughput': 8517.50} [INFO|2025-07-07 11:15:43] logging.py:143 >> {'loss': 1.9101, 'learning_rate': 4.0027e-05, 'epoch': 0.88, 'throughput': 8517.83} [INFO|2025-07-07 11:16:21] logging.py:143 >> {'loss': 1.8857, 'learning_rate': 3.9938e-05, 'epoch': 0.89, 'throughput': 8518.10} [INFO|2025-07-07 11:16:59] logging.py:143 >> {'loss': 1.9829, 'learning_rate': 3.9848e-05, 'epoch': 0.89, 'throughput': 8518.31} [INFO|2025-07-07 11:17:37] logging.py:143 >> {'loss': 1.9241, 'learning_rate': 3.9758e-05, 'epoch': 0.90, 'throughput': 8518.58} [INFO|2025-07-07 11:18:16] logging.py:143 >> {'loss': 1.9966, 'learning_rate': 3.9667e-05, 'epoch': 0.90, 'throughput': 8518.79} [INFO|2025-07-07 11:18:54] logging.py:143 >> {'loss': 1.8729, 'learning_rate': 3.9577e-05, 'epoch': 0.91, 'throughput': 8519.07} [INFO|2025-07-07 11:19:32] logging.py:143 >> {'loss': 1.8414, 'learning_rate': 3.9486e-05, 'epoch': 0.91, 'throughput': 8519.24} [INFO|2025-07-07 11:20:10] logging.py:143 >> {'loss': 1.9118, 'learning_rate': 3.9394e-05, 'epoch': 0.91, 'throughput': 8519.48} [INFO|2025-07-07 11:20:48] logging.py:143 >> {'loss': 1.9212, 'learning_rate': 3.9303e-05, 'epoch': 0.92, 'throughput': 8519.74} [INFO|2025-07-07 11:21:27] logging.py:143 >> {'loss': 1.8810, 'learning_rate': 3.9211e-05, 'epoch': 0.92, 'throughput': 8519.96} [INFO|2025-07-07 11:22:05] logging.py:143 >> {'loss': 1.8364, 'learning_rate': 3.9119e-05, 'epoch': 0.93, 'throughput': 8520.18} [INFO|2025-07-07 11:22:43] logging.py:143 >> {'loss': 1.9005, 'learning_rate': 3.9026e-05, 'epoch': 0.93, 'throughput': 8520.45} [INFO|2025-07-07 11:23:21] logging.py:143 >> {'loss': 1.9016, 'learning_rate': 3.8933e-05, 'epoch': 0.94, 'throughput': 8520.70} [INFO|2025-07-07 11:23:59] logging.py:143 >> {'loss': 1.7929, 'learning_rate': 3.8840e-05, 'epoch': 0.94, 'throughput': 8520.93} [INFO|2025-07-07 11:24:38] logging.py:143 >> {'loss': 1.8478, 'learning_rate': 3.8747e-05, 'epoch': 0.94, 'throughput': 8521.15} [INFO|2025-07-07 11:25:16] logging.py:143 >> {'loss': 1.9313, 'learning_rate': 3.8653e-05, 'epoch': 0.95, 'throughput': 8521.28} [INFO|2025-07-07 11:25:54] logging.py:143 >> {'loss': 1.8808, 'learning_rate': 3.8560e-05, 'epoch': 0.95, 'throughput': 8521.40} [INFO|2025-07-07 11:26:33] logging.py:143 >> {'loss': 1.8283, 'learning_rate': 3.8465e-05, 'epoch': 0.96, 'throughput': 8521.51} [INFO|2025-07-07 11:27:11] logging.py:143 >> {'loss': 1.8969, 'learning_rate': 3.8371e-05, 'epoch': 0.96, 'throughput': 8521.68} [INFO|2025-07-07 11:27:49] logging.py:143 >> {'loss': 1.8505, 'learning_rate': 3.8276e-05, 'epoch': 0.97, 'throughput': 8521.85} [INFO|2025-07-07 11:28:27] logging.py:143 >> {'loss': 1.8296, 'learning_rate': 3.8182e-05, 'epoch': 0.97, 'throughput': 8522.00} [INFO|2025-07-07 11:29:06] logging.py:143 >> {'loss': 1.7768, 'learning_rate': 3.8086e-05, 'epoch': 0.97, 'throughput': 8522.13} [INFO|2025-07-07 11:29:44] logging.py:143 >> {'loss': 1.9136, 'learning_rate': 3.7991e-05, 'epoch': 0.98, 'throughput': 8522.25} [INFO|2025-07-07 11:30:22] logging.py:143 >> {'loss': 1.9643, 'learning_rate': 3.7895e-05, 'epoch': 0.98, 'throughput': 8522.38} [INFO|2025-07-07 11:31:01] logging.py:143 >> {'loss': 1.8207, 'learning_rate': 3.7799e-05, 'epoch': 0.99, 'throughput': 8522.26} [INFO|2025-07-07 11:31:39] logging.py:143 >> {'loss': 1.8989, 'learning_rate': 3.7703e-05, 'epoch': 0.99, 'throughput': 8522.40} [INFO|2025-07-07 11:32:17] logging.py:143 >> {'loss': 2.0221, 'learning_rate': 3.7606e-05, 'epoch': 1.00, 'throughput': 8522.56} [INFO|2025-07-07 11:32:52] logging.py:143 >> {'loss': 1.7993, 'learning_rate': 3.7510e-05, 'epoch': 1.00, 'throughput': 8522.56} [INFO|2025-07-07 11:33:31] logging.py:143 >> {'loss': 1.6796, 'learning_rate': 3.7413e-05, 'epoch': 1.00, 'throughput': 8522.73} [INFO|2025-07-07 11:34:09] logging.py:143 >> {'loss': 1.5931, 'learning_rate': 3.7315e-05, 'epoch': 1.01, 'throughput': 8522.91} [INFO|2025-07-07 11:34:47] logging.py:143 >> {'loss': 1.7630, 'learning_rate': 3.7218e-05, 'epoch': 1.01, 'throughput': 8523.09} [INFO|2025-07-07 11:35:25] logging.py:143 >> {'loss': 1.6514, 'learning_rate': 3.7120e-05, 'epoch': 1.02, 'throughput': 8523.23} [INFO|2025-07-07 11:36:04] logging.py:143 >> {'loss': 1.6115, 'learning_rate': 3.7022e-05, 'epoch': 1.02, 'throughput': 8523.39} [INFO|2025-07-07 11:36:42] logging.py:143 >> {'loss': 1.6294, 'learning_rate': 3.6924e-05, 'epoch': 1.03, 'throughput': 8523.57} [INFO|2025-07-07 11:37:20] logging.py:143 >> {'loss': 1.6493, 'learning_rate': 3.6826e-05, 'epoch': 1.03, 'throughput': 8523.76} [INFO|2025-07-07 11:37:58] logging.py:143 >> {'loss': 1.5879, 'learning_rate': 3.6727e-05, 'epoch': 1.03, 'throughput': 8523.94} [INFO|2025-07-07 11:38:36] logging.py:143 >> {'loss': 1.6893, 'learning_rate': 3.6628e-05, 'epoch': 1.04, 'throughput': 8524.13} [INFO|2025-07-07 11:39:15] logging.py:143 >> {'loss': 1.6329, 'learning_rate': 3.6529e-05, 'epoch': 1.04, 'throughput': 8524.33} [INFO|2025-07-07 11:39:53] logging.py:143 >> {'loss': 1.7239, 'learning_rate': 3.6429e-05, 'epoch': 1.05, 'throughput': 8524.55} [INFO|2025-07-07 11:40:31] logging.py:143 >> {'loss': 1.6661, 'learning_rate': 3.6330e-05, 'epoch': 1.05, 'throughput': 8524.75} [INFO|2025-07-07 11:41:09] logging.py:143 >> {'loss': 1.6387, 'learning_rate': 3.6230e-05, 'epoch': 1.06, 'throughput': 8524.94} [INFO|2025-07-07 11:41:47] logging.py:143 >> {'loss': 1.5653, 'learning_rate': 3.6130e-05, 'epoch': 1.06, 'throughput': 8525.18} [INFO|2025-07-07 11:42:26] logging.py:143 >> {'loss': 1.6470, 'learning_rate': 3.6030e-05, 'epoch': 1.06, 'throughput': 8525.38} [INFO|2025-07-07 11:43:04] logging.py:143 >> {'loss': 1.5554, 'learning_rate': 3.5929e-05, 'epoch': 1.07, 'throughput': 8525.56} [INFO|2025-07-07 11:43:42] logging.py:143 >> {'loss': 1.7072, 'learning_rate': 3.5828e-05, 'epoch': 1.07, 'throughput': 8525.79} [INFO|2025-07-07 11:44:20] logging.py:143 >> {'loss': 1.5954, 'learning_rate': 3.5727e-05, 'epoch': 1.08, 'throughput': 8526.00} [INFO|2025-07-07 11:44:58] logging.py:143 >> {'loss': 1.6498, 'learning_rate': 3.5626e-05, 'epoch': 1.08, 'throughput': 8526.18} [INFO|2025-07-07 11:45:37] logging.py:143 >> {'loss': 1.6389, 'learning_rate': 3.5525e-05, 'epoch': 1.09, 'throughput': 8526.35} [INFO|2025-07-07 11:46:15] logging.py:143 >> {'loss': 1.6112, 'learning_rate': 3.5423e-05, 'epoch': 1.09, 'throughput': 8526.52} [INFO|2025-07-07 11:46:53] logging.py:143 >> {'loss': 1.5462, 'learning_rate': 3.5321e-05, 'epoch': 1.09, 'throughput': 8526.71} [INFO|2025-07-07 11:47:31] logging.py:143 >> {'loss': 1.6637, 'learning_rate': 3.5219e-05, 'epoch': 1.10, 'throughput': 8526.86} [INFO|2025-07-07 11:48:09] logging.py:143 >> {'loss': 1.6536, 'learning_rate': 3.5117e-05, 'epoch': 1.10, 'throughput': 8526.99} [INFO|2025-07-07 11:48:48] logging.py:143 >> {'loss': 1.6743, 'learning_rate': 3.5015e-05, 'epoch': 1.11, 'throughput': 8527.17} [INFO|2025-07-07 11:49:26] logging.py:143 >> {'loss': 1.6266, 'learning_rate': 3.4912e-05, 'epoch': 1.11, 'throughput': 8527.32} [INFO|2025-07-07 11:50:04] logging.py:143 >> {'loss': 1.7093, 'learning_rate': 3.4809e-05, 'epoch': 1.12, 'throughput': 8527.46} [INFO|2025-07-07 11:50:42] logging.py:143 >> {'loss': 1.6272, 'learning_rate': 3.4706e-05, 'epoch': 1.12, 'throughput': 8527.63} [INFO|2025-07-07 11:51:21] logging.py:143 >> {'loss': 1.5702, 'learning_rate': 3.4603e-05, 'epoch': 1.12, 'throughput': 8527.73} [INFO|2025-07-07 11:51:59] logging.py:143 >> {'loss': 1.5323, 'learning_rate': 3.4500e-05, 'epoch': 1.13, 'throughput': 8527.84} [INFO|2025-07-07 11:52:37] logging.py:143 >> {'loss': 1.5701, 'learning_rate': 3.4396e-05, 'epoch': 1.13, 'throughput': 8527.93} [INFO|2025-07-07 11:53:15] logging.py:143 >> {'loss': 1.6444, 'learning_rate': 3.4293e-05, 'epoch': 1.14, 'throughput': 8528.04} [INFO|2025-07-07 11:53:54] logging.py:143 >> {'loss': 1.6947, 'learning_rate': 3.4189e-05, 'epoch': 1.14, 'throughput': 8528.17} [INFO|2025-07-07 11:54:32] logging.py:143 >> {'loss': 1.5955, 'learning_rate': 3.4084e-05, 'epoch': 1.15, 'throughput': 8528.31} [INFO|2025-07-07 11:55:10] logging.py:143 >> {'loss': 1.6629, 'learning_rate': 3.3980e-05, 'epoch': 1.15, 'throughput': 8528.41} [INFO|2025-07-07 11:55:48] logging.py:143 >> {'loss': 1.6213, 'learning_rate': 3.3876e-05, 'epoch': 1.15, 'throughput': 8528.56} [INFO|2025-07-07 11:56:27] logging.py:143 >> {'loss': 1.5606, 'learning_rate': 3.3771e-05, 'epoch': 1.16, 'throughput': 8528.68} [INFO|2025-07-07 11:57:05] logging.py:143 >> {'loss': 1.6001, 'learning_rate': 3.3666e-05, 'epoch': 1.16, 'throughput': 8528.81} [INFO|2025-07-07 11:57:43] logging.py:143 >> {'loss': 1.6653, 'learning_rate': 3.3561e-05, 'epoch': 1.17, 'throughput': 8528.97} [INFO|2025-07-07 11:58:21] logging.py:143 >> {'loss': 1.6288, 'learning_rate': 3.3456e-05, 'epoch': 1.17, 'throughput': 8529.10} [INFO|2025-07-07 11:59:00] logging.py:143 >> {'loss': 1.6330, 'learning_rate': 3.3350e-05, 'epoch': 1.18, 'throughput': 8529.23} [INFO|2025-07-07 11:59:38] logging.py:143 >> {'loss': 1.6441, 'learning_rate': 3.3245e-05, 'epoch': 1.18, 'throughput': 8529.34} [INFO|2025-07-07 12:00:16] logging.py:143 >> {'loss': 1.6033, 'learning_rate': 3.3139e-05, 'epoch': 1.18, 'throughput': 8529.43} [INFO|2025-07-07 12:00:55] logging.py:143 >> {'loss': 1.7265, 'learning_rate': 3.3033e-05, 'epoch': 1.19, 'throughput': 8529.28} [INFO|2025-07-07 12:01:33] logging.py:143 >> {'loss': 1.6399, 'learning_rate': 3.2927e-05, 'epoch': 1.19, 'throughput': 8529.39} [INFO|2025-07-07 12:02:11] logging.py:143 >> {'loss': 1.6641, 'learning_rate': 3.2821e-05, 'epoch': 1.20, 'throughput': 8529.54} [INFO|2025-07-07 12:02:49] logging.py:143 >> {'loss': 1.7191, 'learning_rate': 3.2715e-05, 'epoch': 1.20, 'throughput': 8529.69} [INFO|2025-07-07 12:03:28] logging.py:143 >> {'loss': 1.6326, 'learning_rate': 3.2608e-05, 'epoch': 1.21, 'throughput': 8529.84} [INFO|2025-07-07 12:04:06] logging.py:143 >> {'loss': 1.7098, 'learning_rate': 3.2502e-05, 'epoch': 1.21, 'throughput': 8529.98} [INFO|2025-07-07 12:04:44] logging.py:143 >> {'loss': 1.6263, 'learning_rate': 3.2395e-05, 'epoch': 1.21, 'throughput': 8530.15} [INFO|2025-07-07 12:05:22] logging.py:143 >> {'loss': 1.6229, 'learning_rate': 3.2288e-05, 'epoch': 1.22, 'throughput': 8530.29} [INFO|2025-07-07 12:06:00] logging.py:143 >> {'loss': 1.6859, 'learning_rate': 3.2181e-05, 'epoch': 1.22, 'throughput': 8530.44} [INFO|2025-07-07 12:06:39] logging.py:143 >> {'loss': 1.5423, 'learning_rate': 3.2074e-05, 'epoch': 1.23, 'throughput': 8530.59} [INFO|2025-07-07 12:07:17] logging.py:143 >> {'loss': 1.7712, 'learning_rate': 3.1966e-05, 'epoch': 1.23, 'throughput': 8530.73} [INFO|2025-07-07 12:07:55] logging.py:143 >> {'loss': 1.6240, 'learning_rate': 3.1859e-05, 'epoch': 1.24, 'throughput': 8530.87} [INFO|2025-07-07 12:08:33] logging.py:143 >> {'loss': 1.6205, 'learning_rate': 3.1751e-05, 'epoch': 1.24, 'throughput': 8531.01} [INFO|2025-07-07 12:09:11] logging.py:143 >> {'loss': 1.6146, 'learning_rate': 3.1643e-05, 'epoch': 1.24, 'throughput': 8531.16} [INFO|2025-07-07 12:09:50] logging.py:143 >> {'loss': 1.6064, 'learning_rate': 3.1535e-05, 'epoch': 1.25, 'throughput': 8531.24} [INFO|2025-07-07 12:10:28] logging.py:143 >> {'loss': 1.6113, 'learning_rate': 3.1427e-05, 'epoch': 1.25, 'throughput': 8531.28} [INFO|2025-07-07 12:11:06] logging.py:143 >> {'loss': 1.6448, 'learning_rate': 3.1319e-05, 'epoch': 1.26, 'throughput': 8531.36} [INFO|2025-07-07 12:11:45] logging.py:143 >> {'loss': 1.7223, 'learning_rate': 3.1211e-05, 'epoch': 1.26, 'throughput': 8531.48} [INFO|2025-07-07 12:12:23] logging.py:143 >> {'loss': 1.5952, 'learning_rate': 3.1102e-05, 'epoch': 1.27, 'throughput': 8531.50} [INFO|2025-07-07 12:13:01] logging.py:143 >> {'loss': 1.5912, 'learning_rate': 3.0994e-05, 'epoch': 1.27, 'throughput': 8531.54} [INFO|2025-07-07 12:13:40] logging.py:143 >> {'loss': 1.5575, 'learning_rate': 3.0885e-05, 'epoch': 1.27, 'throughput': 8531.59} [INFO|2025-07-07 12:14:18] logging.py:143 >> {'loss': 1.5740, 'learning_rate': 3.0776e-05, 'epoch': 1.28, 'throughput': 8531.68} [INFO|2025-07-07 12:14:56] logging.py:143 >> {'loss': 1.6329, 'learning_rate': 3.0667e-05, 'epoch': 1.28, 'throughput': 8531.79} [INFO|2025-07-07 12:15:34] logging.py:143 >> {'loss': 1.6752, 'learning_rate': 3.0558e-05, 'epoch': 1.29, 'throughput': 8531.88} [INFO|2025-07-07 12:16:13] logging.py:143 >> {'loss': 1.6692, 'learning_rate': 3.0449e-05, 'epoch': 1.29, 'throughput': 8532.00} [INFO|2025-07-07 12:16:51] logging.py:143 >> {'loss': 1.6156, 'learning_rate': 3.0340e-05, 'epoch': 1.29, 'throughput': 8532.13} [INFO|2025-07-07 12:17:29] logging.py:143 >> {'loss': 1.5708, 'learning_rate': 3.0231e-05, 'epoch': 1.30, 'throughput': 8532.23} [INFO|2025-07-07 12:18:07] logging.py:143 >> {'loss': 1.6368, 'learning_rate': 3.0121e-05, 'epoch': 1.30, 'throughput': 8532.37} [INFO|2025-07-07 12:18:46] logging.py:143 >> {'loss': 1.6676, 'learning_rate': 3.0012e-05, 'epoch': 1.31, 'throughput': 8532.50} [INFO|2025-07-07 12:19:24] logging.py:143 >> {'loss': 1.6463, 'learning_rate': 2.9902e-05, 'epoch': 1.31, 'throughput': 8532.63} [INFO|2025-07-07 12:20:02] logging.py:143 >> {'loss': 1.5310, 'learning_rate': 2.9792e-05, 'epoch': 1.32, 'throughput': 8532.74} [INFO|2025-07-07 12:20:40] logging.py:143 >> {'loss': 1.5984, 'learning_rate': 2.9682e-05, 'epoch': 1.32, 'throughput': 8532.87} [INFO|2025-07-07 12:21:18] logging.py:143 >> {'loss': 1.6443, 'learning_rate': 2.9572e-05, 'epoch': 1.32, 'throughput': 8532.99} [INFO|2025-07-07 12:21:57] logging.py:143 >> {'loss': 1.5234, 'learning_rate': 2.9462e-05, 'epoch': 1.33, 'throughput': 8533.10} [INFO|2025-07-07 12:22:35] logging.py:143 >> {'loss': 1.5560, 'learning_rate': 2.9352e-05, 'epoch': 1.33, 'throughput': 8533.19} [INFO|2025-07-07 12:23:13] logging.py:143 >> {'loss': 1.6366, 'learning_rate': 2.9242e-05, 'epoch': 1.34, 'throughput': 8533.29} [INFO|2025-07-07 12:23:51] logging.py:143 >> {'loss': 1.5785, 'learning_rate': 2.9132e-05, 'epoch': 1.34, 'throughput': 8533.44} [INFO|2025-07-07 12:24:29] logging.py:143 >> {'loss': 1.5801, 'learning_rate': 2.9021e-05, 'epoch': 1.35, 'throughput': 8533.56} [INFO|2025-07-07 12:25:08] logging.py:143 >> {'loss': 1.6702, 'learning_rate': 2.8911e-05, 'epoch': 1.35, 'throughput': 8533.64} [INFO|2025-07-07 12:25:46] logging.py:143 >> {'loss': 1.6637, 'learning_rate': 2.8800e-05, 'epoch': 1.35, 'throughput': 8533.72} [INFO|2025-07-07 12:26:24] logging.py:143 >> {'loss': 1.6180, 'learning_rate': 2.8690e-05, 'epoch': 1.36, 'throughput': 8533.76} [INFO|2025-07-07 12:27:03] logging.py:143 >> {'loss': 1.5868, 'learning_rate': 2.8579e-05, 'epoch': 1.36, 'throughput': 8533.81} [INFO|2025-07-07 12:27:41] logging.py:143 >> {'loss': 1.5611, 'learning_rate': 2.8468e-05, 'epoch': 1.37, 'throughput': 8533.89} [INFO|2025-07-07 12:28:19] logging.py:143 >> {'loss': 1.5877, 'learning_rate': 2.8357e-05, 'epoch': 1.37, 'throughput': 8533.96} [INFO|2025-07-07 12:28:57] logging.py:143 >> {'loss': 1.5710, 'learning_rate': 2.8247e-05, 'epoch': 1.38, 'throughput': 8534.02} [INFO|2025-07-07 12:29:36] logging.py:143 >> {'loss': 1.5938, 'learning_rate': 2.8136e-05, 'epoch': 1.38, 'throughput': 8534.07} [INFO|2025-07-07 12:30:14] logging.py:143 >> {'loss': 1.5695, 'learning_rate': 2.8025e-05, 'epoch': 1.38, 'throughput': 8534.17} [INFO|2025-07-07 12:30:53] logging.py:143 >> {'loss': 1.6037, 'learning_rate': 2.7913e-05, 'epoch': 1.39, 'throughput': 8534.00} [INFO|2025-07-07 12:31:31] logging.py:143 >> {'loss': 1.5927, 'learning_rate': 2.7802e-05, 'epoch': 1.39, 'throughput': 8534.10} [INFO|2025-07-07 12:32:09] logging.py:143 >> {'loss': 1.6181, 'learning_rate': 2.7691e-05, 'epoch': 1.40, 'throughput': 8534.20} [INFO|2025-07-07 12:32:47] logging.py:143 >> {'loss': 1.6075, 'learning_rate': 2.7580e-05, 'epoch': 1.40, 'throughput': 8534.32} [INFO|2025-07-07 12:33:26] logging.py:143 >> {'loss': 1.5530, 'learning_rate': 2.7469e-05, 'epoch': 1.41, 'throughput': 8534.44} [INFO|2025-07-07 12:34:04] logging.py:143 >> {'loss': 1.6365, 'learning_rate': 2.7357e-05, 'epoch': 1.41, 'throughput': 8534.54} [INFO|2025-07-07 12:34:42] logging.py:143 >> {'loss': 1.6599, 'learning_rate': 2.7246e-05, 'epoch': 1.41, 'throughput': 8534.63} [INFO|2025-07-07 12:35:20] logging.py:143 >> {'loss': 1.6992, 'learning_rate': 2.7134e-05, 'epoch': 1.42, 'throughput': 8534.72} [INFO|2025-07-07 12:35:58] logging.py:143 >> {'loss': 1.6284, 'learning_rate': 2.7023e-05, 'epoch': 1.42, 'throughput': 8534.84} [INFO|2025-07-07 12:36:37] logging.py:143 >> {'loss': 1.5942, 'learning_rate': 2.6911e-05, 'epoch': 1.43, 'throughput': 8534.94} [INFO|2025-07-07 12:37:15] logging.py:143 >> {'loss': 1.5559, 'learning_rate': 2.6800e-05, 'epoch': 1.43, 'throughput': 8535.01} [INFO|2025-07-07 12:37:53] logging.py:143 >> {'loss': 1.5937, 'learning_rate': 2.6688e-05, 'epoch': 1.44, 'throughput': 8535.14} [INFO|2025-07-07 12:38:31] logging.py:143 >> {'loss': 1.5363, 'learning_rate': 2.6576e-05, 'epoch': 1.44, 'throughput': 8535.24} [INFO|2025-07-07 12:39:09] logging.py:143 >> {'loss': 1.5837, 'learning_rate': 2.6465e-05, 'epoch': 1.44, 'throughput': 8535.36} [INFO|2025-07-07 12:39:48] logging.py:143 >> {'loss': 1.5429, 'learning_rate': 2.6353e-05, 'epoch': 1.45, 'throughput': 8535.50} [INFO|2025-07-07 12:40:26] logging.py:143 >> {'loss': 1.7060, 'learning_rate': 2.6241e-05, 'epoch': 1.45, 'throughput': 8535.63} [INFO|2025-07-07 12:41:04] logging.py:143 >> {'loss': 1.6731, 'learning_rate': 2.6130e-05, 'epoch': 1.46, 'throughput': 8535.76} [INFO|2025-07-07 12:41:42] logging.py:143 >> {'loss': 1.6010, 'learning_rate': 2.6018e-05, 'epoch': 1.46, 'throughput': 8535.89} [INFO|2025-07-07 12:42:20] logging.py:143 >> {'loss': 1.6314, 'learning_rate': 2.5906e-05, 'epoch': 1.47, 'throughput': 8536.03} [INFO|2025-07-07 12:42:59] logging.py:143 >> {'loss': 1.6674, 'learning_rate': 2.5794e-05, 'epoch': 1.47, 'throughput': 8536.15} [INFO|2025-07-07 12:43:37] logging.py:143 >> {'loss': 1.6280, 'learning_rate': 2.5682e-05, 'epoch': 1.47, 'throughput': 8536.24} [INFO|2025-07-07 12:44:15] logging.py:143 >> {'loss': 1.6356, 'learning_rate': 2.5571e-05, 'epoch': 1.48, 'throughput': 8536.35} [INFO|2025-07-07 12:44:53] logging.py:143 >> {'loss': 1.7092, 'learning_rate': 2.5459e-05, 'epoch': 1.48, 'throughput': 8536.44} [INFO|2025-07-07 12:45:31] logging.py:143 >> {'loss': 1.6341, 'learning_rate': 2.5347e-05, 'epoch': 1.49, 'throughput': 8536.53} [INFO|2025-07-07 12:46:10] logging.py:143 >> {'loss': 1.5787, 'learning_rate': 2.5235e-05, 'epoch': 1.49, 'throughput': 8536.66} [INFO|2025-07-07 12:46:48] logging.py:143 >> {'loss': 1.6370, 'learning_rate': 2.5123e-05, 'epoch': 1.50, 'throughput': 8536.79} [INFO|2025-07-07 12:47:26] logging.py:143 >> {'loss': 1.6007, 'learning_rate': 2.5011e-05, 'epoch': 1.50, 'throughput': 8536.91} [INFO|2025-07-07 12:48:04] logging.py:143 >> {'loss': 1.5654, 'learning_rate': 2.4899e-05, 'epoch': 1.50, 'throughput': 8537.01} [INFO|2025-07-07 12:48:42] logging.py:143 >> {'loss': 1.6941, 'learning_rate': 2.4787e-05, 'epoch': 1.51, 'throughput': 8537.10} [INFO|2025-07-07 12:49:21] logging.py:143 >> {'loss': 1.5714, 'learning_rate': 2.4676e-05, 'epoch': 1.51, 'throughput': 8537.18} [INFO|2025-07-07 12:49:59] logging.py:143 >> {'loss': 1.6446, 'learning_rate': 2.4564e-05, 'epoch': 1.52, 'throughput': 8537.28} [INFO|2025-07-07 12:50:37] logging.py:143 >> {'loss': 1.6360, 'learning_rate': 2.4452e-05, 'epoch': 1.52, 'throughput': 8537.37} [INFO|2025-07-07 12:51:15] logging.py:143 >> {'loss': 1.6350, 'learning_rate': 2.4340e-05, 'epoch': 1.53, 'throughput': 8537.47} [INFO|2025-07-07 12:51:53] logging.py:143 >> {'loss': 1.5780, 'learning_rate': 2.4228e-05, 'epoch': 1.53, 'throughput': 8537.60} [INFO|2025-07-07 12:52:32] logging.py:143 >> {'loss': 1.6080, 'learning_rate': 2.4116e-05, 'epoch': 1.53, 'throughput': 8537.68} [INFO|2025-07-07 12:53:10] logging.py:143 >> {'loss': 1.6197, 'learning_rate': 2.4005e-05, 'epoch': 1.54, 'throughput': 8537.77} [INFO|2025-07-07 12:53:48] logging.py:143 >> {'loss': 1.6021, 'learning_rate': 2.3893e-05, 'epoch': 1.54, 'throughput': 8537.88} [INFO|2025-07-07 12:54:26] logging.py:143 >> {'loss': 1.5949, 'learning_rate': 2.3781e-05, 'epoch': 1.55, 'throughput': 8537.95} [INFO|2025-07-07 12:55:04] logging.py:143 >> {'loss': 1.6097, 'learning_rate': 2.3669e-05, 'epoch': 1.55, 'throughput': 8538.03} [INFO|2025-07-07 12:55:43] logging.py:143 >> {'loss': 1.5927, 'learning_rate': 2.3558e-05, 'epoch': 1.56, 'throughput': 8538.13} [INFO|2025-07-07 12:56:21] logging.py:143 >> {'loss': 1.5837, 'learning_rate': 2.3446e-05, 'epoch': 1.56, 'throughput': 8538.22} [INFO|2025-07-07 12:56:59] logging.py:143 >> {'loss': 1.6520, 'learning_rate': 2.3334e-05, 'epoch': 1.56, 'throughput': 8538.32} [INFO|2025-07-07 12:57:37] logging.py:143 >> {'loss': 1.5715, 'learning_rate': 2.3223e-05, 'epoch': 1.57, 'throughput': 8538.41} [INFO|2025-07-07 12:58:15] logging.py:143 >> {'loss': 1.7054, 'learning_rate': 2.3111e-05, 'epoch': 1.57, 'throughput': 8538.48} [INFO|2025-07-07 12:58:54] logging.py:143 >> {'loss': 1.6230, 'learning_rate': 2.2999e-05, 'epoch': 1.58, 'throughput': 8538.59} [INFO|2025-07-07 12:59:32] logging.py:143 >> {'loss': 1.6506, 'learning_rate': 2.2888e-05, 'epoch': 1.58, 'throughput': 8538.64} [INFO|2025-07-07 13:00:10] logging.py:143 >> {'loss': 1.5539, 'learning_rate': 2.2777e-05, 'epoch': 1.59, 'throughput': 8538.69} [INFO|2025-07-07 13:00:49] logging.py:143 >> {'loss': 1.5322, 'learning_rate': 2.2665e-05, 'epoch': 1.59, 'throughput': 8538.56} [INFO|2025-07-07 13:01:27] logging.py:143 >> {'loss': 1.5448, 'learning_rate': 2.2554e-05, 'epoch': 1.59, 'throughput': 8538.61} [INFO|2025-07-07 13:02:05] logging.py:143 >> {'loss': 1.5545, 'learning_rate': 2.2442e-05, 'epoch': 1.60, 'throughput': 8538.71} [INFO|2025-07-07 13:02:43] logging.py:143 >> {'loss': 1.6077, 'learning_rate': 2.2331e-05, 'epoch': 1.60, 'throughput': 8538.79} [INFO|2025-07-07 13:03:22] logging.py:143 >> {'loss': 1.5820, 'learning_rate': 2.2220e-05, 'epoch': 1.61, 'throughput': 8538.85} [INFO|2025-07-07 13:04:00] logging.py:143 >> {'loss': 1.5711, 'learning_rate': 2.2109e-05, 'epoch': 1.61, 'throughput': 8538.90} [INFO|2025-07-07 13:04:38] logging.py:143 >> {'loss': 1.5763, 'learning_rate': 2.1998e-05, 'epoch': 1.62, 'throughput': 8538.98} [INFO|2025-07-07 13:05:16] logging.py:143 >> {'loss': 1.5341, 'learning_rate': 2.1887e-05, 'epoch': 1.62, 'throughput': 8539.05} [INFO|2025-07-07 13:05:55] logging.py:143 >> {'loss': 1.5736, 'learning_rate': 2.1776e-05, 'epoch': 1.62, 'throughput': 8539.11} [INFO|2025-07-07 13:06:33] logging.py:143 >> {'loss': 1.5212, 'learning_rate': 2.1665e-05, 'epoch': 1.63, 'throughput': 8539.11} [INFO|2025-07-07 13:07:11] logging.py:143 >> {'loss': 1.6465, 'learning_rate': 2.1554e-05, 'epoch': 1.63, 'throughput': 8539.14} [INFO|2025-07-07 13:07:50] logging.py:143 >> {'loss': 1.5629, 'learning_rate': 2.1443e-05, 'epoch': 1.64, 'throughput': 8539.20} [INFO|2025-07-07 13:08:28] logging.py:143 >> {'loss': 1.4830, 'learning_rate': 2.1332e-05, 'epoch': 1.64, 'throughput': 8539.27} [INFO|2025-07-07 13:09:06] logging.py:143 >> {'loss': 1.6005, 'learning_rate': 2.1222e-05, 'epoch': 1.65, 'throughput': 8539.34} [INFO|2025-07-07 13:09:44] logging.py:143 >> {'loss': 1.5675, 'learning_rate': 2.1111e-05, 'epoch': 1.65, 'throughput': 8539.42} [INFO|2025-07-07 13:10:23] logging.py:143 >> {'loss': 1.5808, 'learning_rate': 2.1001e-05, 'epoch': 1.65, 'throughput': 8539.50} [INFO|2025-07-07 13:11:01] logging.py:143 >> {'loss': 1.5709, 'learning_rate': 2.0890e-05, 'epoch': 1.66, 'throughput': 8539.59} [INFO|2025-07-07 13:11:39] logging.py:143 >> {'loss': 1.6216, 'learning_rate': 2.0780e-05, 'epoch': 1.66, 'throughput': 8539.67} [INFO|2025-07-07 13:12:17] logging.py:143 >> {'loss': 1.4930, 'learning_rate': 2.0670e-05, 'epoch': 1.67, 'throughput': 8539.74} [INFO|2025-07-07 13:12:55] logging.py:143 >> {'loss': 1.5973, 'learning_rate': 2.0560e-05, 'epoch': 1.67, 'throughput': 8539.83} [INFO|2025-07-07 13:13:34] logging.py:143 >> {'loss': 1.5330, 'learning_rate': 2.0450e-05, 'epoch': 1.68, 'throughput': 8539.91} [INFO|2025-07-07 13:14:12] logging.py:143 >> {'loss': 1.5478, 'learning_rate': 2.0340e-05, 'epoch': 1.68, 'throughput': 8539.97} [INFO|2025-07-07 13:14:50] logging.py:143 >> {'loss': 1.5823, 'learning_rate': 2.0230e-05, 'epoch': 1.68, 'throughput': 8540.04} [INFO|2025-07-07 13:15:28] logging.py:143 >> {'loss': 1.6302, 'learning_rate': 2.0120e-05, 'epoch': 1.69, 'throughput': 8540.11} [INFO|2025-07-07 13:16:07] logging.py:143 >> {'loss': 1.6384, 'learning_rate': 2.0010e-05, 'epoch': 1.69, 'throughput': 8540.18} [INFO|2025-07-07 13:16:45] logging.py:143 >> {'loss': 1.4991, 'learning_rate': 1.9901e-05, 'epoch': 1.70, 'throughput': 8540.27} [INFO|2025-07-07 13:17:23] logging.py:143 >> {'loss': 1.5900, 'learning_rate': 1.9791e-05, 'epoch': 1.70, 'throughput': 8540.34} [INFO|2025-07-07 13:18:01] logging.py:143 >> {'loss': 1.5295, 'learning_rate': 1.9682e-05, 'epoch': 1.71, 'throughput': 8540.44} [INFO|2025-07-07 13:18:39] logging.py:143 >> {'loss': 1.6440, 'learning_rate': 1.9573e-05, 'epoch': 1.71, 'throughput': 8540.54} [INFO|2025-07-07 13:18:39] trainer.py:3993 >> Saving model checkpoint to saves/Gemma-3-1B-Instruct/full/train_2025-07-07-08-57-22/checkpoint-4000 [INFO|2025-07-07 13:18:39] configuration_utils.py:424 >> Configuration saved in saves/Gemma-3-1B-Instruct/full/train_2025-07-07-08-57-22/checkpoint-4000/config.json [INFO|2025-07-07 13:18:39] configuration_utils.py:904 >> Configuration saved in saves/Gemma-3-1B-Instruct/full/train_2025-07-07-08-57-22/checkpoint-4000/generation_config.json [INFO|2025-07-07 13:18:57] modeling_utils.py:3725 >> Model weights saved in saves/Gemma-3-1B-Instruct/full/train_2025-07-07-08-57-22/checkpoint-4000/model.safetensors [INFO|2025-07-07 13:18:57] tokenization_utils_base.py:2356 >> chat template saved in saves/Gemma-3-1B-Instruct/full/train_2025-07-07-08-57-22/checkpoint-4000/chat_template.jinja [INFO|2025-07-07 13:18:57] tokenization_utils_base.py:2525 >> tokenizer config file saved in saves/Gemma-3-1B-Instruct/full/train_2025-07-07-08-57-22/checkpoint-4000/tokenizer_config.json [INFO|2025-07-07 13:18:57] tokenization_utils_base.py:2534 >> Special tokens file saved in saves/Gemma-3-1B-Instruct/full/train_2025-07-07-08-57-22/checkpoint-4000/special_tokens_map.json [INFO|2025-07-07 13:20:03] logging.py:143 >> {'loss': 1.5135, 'learning_rate': 1.9463e-05, 'epoch': 1.71, 'throughput': 8515.32} [INFO|2025-07-07 13:20:41] logging.py:143 >> {'loss': 1.5392, 'learning_rate': 1.9354e-05, 'epoch': 1.72, 'throughput': 8515.47} [INFO|2025-07-07 13:21:20] logging.py:143 >> {'loss': 1.5683, 'learning_rate': 1.9245e-05, 'epoch': 1.72, 'throughput': 8515.60} [INFO|2025-07-07 13:21:58] logging.py:143 >> {'loss': 1.5555, 'learning_rate': 1.9137e-05, 'epoch': 1.73, 'throughput': 8515.76} [INFO|2025-07-07 13:22:36] logging.py:143 >> {'loss': 1.5848, 'learning_rate': 1.9028e-05, 'epoch': 1.73, 'throughput': 8515.89} [INFO|2025-07-07 13:23:14] logging.py:143 >> {'loss': 1.6274, 'learning_rate': 1.8919e-05, 'epoch': 1.74, 'throughput': 8516.04} [INFO|2025-07-07 13:23:52] logging.py:143 >> {'loss': 1.5148, 'learning_rate': 1.8811e-05, 'epoch': 1.74, 'throughput': 8516.17} [INFO|2025-07-07 13:24:31] logging.py:143 >> {'loss': 1.5671, 'learning_rate': 1.8703e-05, 'epoch': 1.74, 'throughput': 8516.32} [INFO|2025-07-07 13:25:09] logging.py:143 >> {'loss': 1.5215, 'learning_rate': 1.8594e-05, 'epoch': 1.75, 'throughput': 8516.47} [INFO|2025-07-07 13:25:47] logging.py:143 >> {'loss': 1.5073, 'learning_rate': 1.8486e-05, 'epoch': 1.75, 'throughput': 8516.61} [INFO|2025-07-07 13:26:25] logging.py:143 >> {'loss': 1.5289, 'learning_rate': 1.8378e-05, 'epoch': 1.76, 'throughput': 8516.73} [INFO|2025-07-07 13:27:03] logging.py:143 >> {'loss': 1.5831, 'learning_rate': 1.8271e-05, 'epoch': 1.76, 'throughput': 8516.89} [INFO|2025-07-07 13:27:41] logging.py:143 >> {'loss': 1.5763, 'learning_rate': 1.8163e-05, 'epoch': 1.77, 'throughput': 8517.06} [INFO|2025-07-07 13:28:20] logging.py:143 >> {'loss': 1.5471, 'learning_rate': 1.8055e-05, 'epoch': 1.77, 'throughput': 8517.23} [INFO|2025-07-07 13:28:58] logging.py:143 >> {'loss': 1.5840, 'learning_rate': 1.7948e-05, 'epoch': 1.77, 'throughput': 8517.39} [INFO|2025-07-07 13:29:36] logging.py:143 >> {'loss': 1.6575, 'learning_rate': 1.7841e-05, 'epoch': 1.78, 'throughput': 8517.55} [INFO|2025-07-07 13:30:15] logging.py:143 >> {'loss': 1.4992, 'learning_rate': 1.7734e-05, 'epoch': 1.78, 'throughput': 8517.43} [INFO|2025-07-07 13:30:53] logging.py:143 >> {'loss': 1.6159, 'learning_rate': 1.7627e-05, 'epoch': 1.79, 'throughput': 8517.52} [INFO|2025-07-07 13:31:31] logging.py:143 >> {'loss': 1.6153, 'learning_rate': 1.7520e-05, 'epoch': 1.79, 'throughput': 8517.62} [INFO|2025-07-07 13:32:09] logging.py:143 >> {'loss': 1.5824, 'learning_rate': 1.7413e-05, 'epoch': 1.80, 'throughput': 8517.69} [INFO|2025-07-07 13:32:48] logging.py:143 >> {'loss': 1.5522, 'learning_rate': 1.7307e-05, 'epoch': 1.80, 'throughput': 8517.79} [INFO|2025-07-07 13:33:26] logging.py:143 >> {'loss': 1.5514, 'learning_rate': 1.7200e-05, 'epoch': 1.80, 'throughput': 8517.87} [INFO|2025-07-07 13:34:04] logging.py:143 >> {'loss': 1.5531, 'learning_rate': 1.7094e-05, 'epoch': 1.81, 'throughput': 8517.94} [INFO|2025-07-07 13:34:43] logging.py:143 >> {'loss': 1.5751, 'learning_rate': 1.6988e-05, 'epoch': 1.81, 'throughput': 8518.06} [INFO|2025-07-07 13:35:21] logging.py:143 >> {'loss': 1.5927, 'learning_rate': 1.6882e-05, 'epoch': 1.82, 'throughput': 8518.18} [INFO|2025-07-07 13:35:59] logging.py:143 >> {'loss': 1.6136, 'learning_rate': 1.6776e-05, 'epoch': 1.82, 'throughput': 8518.30} [INFO|2025-07-07 13:36:37] logging.py:143 >> {'loss': 1.5031, 'learning_rate': 1.6671e-05, 'epoch': 1.83, 'throughput': 8518.40} [INFO|2025-07-07 13:37:15] logging.py:143 >> {'loss': 1.5264, 'learning_rate': 1.6565e-05, 'epoch': 1.83, 'throughput': 8518.52} [INFO|2025-07-07 13:37:54] logging.py:143 >> {'loss': 1.6342, 'learning_rate': 1.6460e-05, 'epoch': 1.83, 'throughput': 8518.63} [INFO|2025-07-07 13:38:32] logging.py:143 >> {'loss': 1.6177, 'learning_rate': 1.6355e-05, 'epoch': 1.84, 'throughput': 8518.74} [INFO|2025-07-07 13:39:10] logging.py:143 >> {'loss': 1.5898, 'learning_rate': 1.6250e-05, 'epoch': 1.84, 'throughput': 8518.83} [INFO|2025-07-07 13:39:48] logging.py:143 >> {'loss': 1.6041, 'learning_rate': 1.6145e-05, 'epoch': 1.85, 'throughput': 8518.96} [INFO|2025-07-07 13:40:27] logging.py:143 >> {'loss': 1.5991, 'learning_rate': 1.6041e-05, 'epoch': 1.85, 'throughput': 8519.06} [INFO|2025-07-07 13:41:05] logging.py:143 >> {'loss': 1.5417, 'learning_rate': 1.5936e-05, 'epoch': 1.86, 'throughput': 8519.17} [INFO|2025-07-07 13:41:43] logging.py:143 >> {'loss': 1.5537, 'learning_rate': 1.5832e-05, 'epoch': 1.86, 'throughput': 8519.28} [INFO|2025-07-07 13:42:21] logging.py:143 >> {'loss': 1.5361, 'learning_rate': 1.5728e-05, 'epoch': 1.86, 'throughput': 8519.37} [INFO|2025-07-07 13:43:00] logging.py:143 >> {'loss': 1.5861, 'learning_rate': 1.5624e-05, 'epoch': 1.87, 'throughput': 8519.49} [INFO|2025-07-07 13:43:38] logging.py:143 >> {'loss': 1.6347, 'learning_rate': 1.5521e-05, 'epoch': 1.87, 'throughput': 8519.60} [INFO|2025-07-07 13:44:16] logging.py:143 >> {'loss': 1.5594, 'learning_rate': 1.5417e-05, 'epoch': 1.88, 'throughput': 8519.71} [INFO|2025-07-07 13:44:54] logging.py:143 >> {'loss': 1.5847, 'learning_rate': 1.5314e-05, 'epoch': 1.88, 'throughput': 8519.79} [INFO|2025-07-07 13:45:33] logging.py:143 >> {'loss': 1.5299, 'learning_rate': 1.5211e-05, 'epoch': 1.88, 'throughput': 8519.85} [INFO|2025-07-07 13:46:11] logging.py:143 >> {'loss': 1.5613, 'learning_rate': 1.5108e-05, 'epoch': 1.89, 'throughput': 8519.89} [INFO|2025-07-07 13:46:49] logging.py:143 >> {'loss': 1.5935, 'learning_rate': 1.5006e-05, 'epoch': 1.89, 'throughput': 8519.98} [INFO|2025-07-07 13:47:28] logging.py:143 >> {'loss': 1.6233, 'learning_rate': 1.4903e-05, 'epoch': 1.90, 'throughput': 8520.05} [INFO|2025-07-07 13:48:06] logging.py:143 >> {'loss': 1.5027, 'learning_rate': 1.4801e-05, 'epoch': 1.90, 'throughput': 8520.10} [INFO|2025-07-07 13:48:44] logging.py:143 >> {'loss': 1.5293, 'learning_rate': 1.4699e-05, 'epoch': 1.91, 'throughput': 8520.20} [INFO|2025-07-07 13:49:22] logging.py:143 >> {'loss': 1.4946, 'learning_rate': 1.4597e-05, 'epoch': 1.91, 'throughput': 8520.30} [INFO|2025-07-07 13:50:01] logging.py:143 >> {'loss': 1.5672, 'learning_rate': 1.4495e-05, 'epoch': 1.91, 'throughput': 8520.40} [INFO|2025-07-07 13:50:39] logging.py:143 >> {'loss': 1.5564, 'learning_rate': 1.4394e-05, 'epoch': 1.92, 'throughput': 8520.50} [INFO|2025-07-07 13:51:17] logging.py:143 >> {'loss': 1.5657, 'learning_rate': 1.4293e-05, 'epoch': 1.92, 'throughput': 8520.61} [INFO|2025-07-07 13:51:55] logging.py:143 >> {'loss': 1.6767, 'learning_rate': 1.4192e-05, 'epoch': 1.93, 'throughput': 8520.72} [INFO|2025-07-07 13:52:34] logging.py:143 >> {'loss': 1.5509, 'learning_rate': 1.4091e-05, 'epoch': 1.93, 'throughput': 8520.81} [INFO|2025-07-07 13:53:12] logging.py:143 >> {'loss': 1.5423, 'learning_rate': 1.3990e-05, 'epoch': 1.94, 'throughput': 8520.91} [INFO|2025-07-07 13:53:50] logging.py:143 >> {'loss': 1.5575, 'learning_rate': 1.3890e-05, 'epoch': 1.94, 'throughput': 8521.02} [INFO|2025-07-07 13:54:28] logging.py:143 >> {'loss': 1.5069, 'learning_rate': 1.3790e-05, 'epoch': 1.94, 'throughput': 8521.12} [INFO|2025-07-07 13:55:06] logging.py:143 >> {'loss': 1.5348, 'learning_rate': 1.3690e-05, 'epoch': 1.95, 'throughput': 8521.23} [INFO|2025-07-07 13:55:45] logging.py:143 >> {'loss': 1.6245, 'learning_rate': 1.3590e-05, 'epoch': 1.95, 'throughput': 8521.33} [INFO|2025-07-07 13:56:23] logging.py:143 >> {'loss': 1.5959, 'learning_rate': 1.3491e-05, 'epoch': 1.96, 'throughput': 8521.44} [INFO|2025-07-07 13:57:01] logging.py:143 >> {'loss': 1.6003, 'learning_rate': 1.3392e-05, 'epoch': 1.96, 'throughput': 8521.54} [INFO|2025-07-07 13:57:39] logging.py:143 >> {'loss': 1.6006, 'learning_rate': 1.3293e-05, 'epoch': 1.97, 'throughput': 8521.65} [INFO|2025-07-07 13:58:17] logging.py:143 >> {'loss': 1.5332, 'learning_rate': 1.3194e-05, 'epoch': 1.97, 'throughput': 8521.78} [INFO|2025-07-07 13:58:56] logging.py:143 >> {'loss': 1.5348, 'learning_rate': 1.3096e-05, 'epoch': 1.97, 'throughput': 8521.94} [INFO|2025-07-07 13:59:34] logging.py:143 >> {'loss': 1.5326, 'learning_rate': 1.2997e-05, 'epoch': 1.98, 'throughput': 8522.07} [INFO|2025-07-07 14:00:12] logging.py:143 >> {'loss': 1.5550, 'learning_rate': 1.2899e-05, 'epoch': 1.98, 'throughput': 8522.04} [INFO|2025-07-07 14:00:50] logging.py:143 >> {'loss': 1.5599, 'learning_rate': 1.2802e-05, 'epoch': 1.99, 'throughput': 8522.16} [INFO|2025-07-07 14:01:29] logging.py:143 >> {'loss': 1.5205, 'learning_rate': 1.2704e-05, 'epoch': 1.99, 'throughput': 8522.27} [INFO|2025-07-07 14:02:07] logging.py:143 >> {'loss': 1.5495, 'learning_rate': 1.2607e-05, 'epoch': 2.00, 'throughput': 8522.37} [INFO|2025-07-07 14:02:42] logging.py:143 >> {'loss': 1.4677, 'learning_rate': 1.2510e-05, 'epoch': 2.00, 'throughput': 8522.40} [INFO|2025-07-07 14:03:20] logging.py:143 >> {'loss': 1.3191, 'learning_rate': 1.2413e-05, 'epoch': 2.00, 'throughput': 8522.49} [INFO|2025-07-07 14:03:58] logging.py:143 >> {'loss': 1.2790, 'learning_rate': 1.2316e-05, 'epoch': 2.01, 'throughput': 8522.60} [INFO|2025-07-07 14:04:36] logging.py:143 >> {'loss': 1.2868, 'learning_rate': 1.2220e-05, 'epoch': 2.01, 'throughput': 8522.68} [INFO|2025-07-07 14:05:14] logging.py:143 >> {'loss': 1.2610, 'learning_rate': 1.2124e-05, 'epoch': 2.02, 'throughput': 8522.78} [INFO|2025-07-07 14:05:53] logging.py:143 >> {'loss': 1.3159, 'learning_rate': 1.2028e-05, 'epoch': 2.02, 'throughput': 8522.86} [INFO|2025-07-07 14:06:31] logging.py:143 >> {'loss': 1.2725, 'learning_rate': 1.1933e-05, 'epoch': 2.03, 'throughput': 8522.96} [INFO|2025-07-07 14:07:09] logging.py:143 >> {'loss': 1.3343, 'learning_rate': 1.1838e-05, 'epoch': 2.03, 'throughput': 8523.04} [INFO|2025-07-07 14:07:47] logging.py:143 >> {'loss': 1.3016, 'learning_rate': 1.1743e-05, 'epoch': 2.03, 'throughput': 8523.16} [INFO|2025-07-07 14:08:26] logging.py:143 >> {'loss': 1.2966, 'learning_rate': 1.1648e-05, 'epoch': 2.04, 'throughput': 8523.29} [INFO|2025-07-07 14:09:04] logging.py:143 >> {'loss': 1.2723, 'learning_rate': 1.1553e-05, 'epoch': 2.04, 'throughput': 8523.39} [INFO|2025-07-07 14:09:42] logging.py:143 >> {'loss': 1.3130, 'learning_rate': 1.1459e-05, 'epoch': 2.05, 'throughput': 8523.49} [INFO|2025-07-07 14:10:20] logging.py:143 >> {'loss': 1.2936, 'learning_rate': 1.1365e-05, 'epoch': 2.05, 'throughput': 8523.59} [INFO|2025-07-07 14:10:58] logging.py:143 >> {'loss': 1.2467, 'learning_rate': 1.1272e-05, 'epoch': 2.06, 'throughput': 8523.69} [INFO|2025-07-07 14:11:37] logging.py:143 >> {'loss': 1.2472, 'learning_rate': 1.1178e-05, 'epoch': 2.06, 'throughput': 8523.78} [INFO|2025-07-07 14:12:15] logging.py:143 >> {'loss': 1.3524, 'learning_rate': 1.1085e-05, 'epoch': 2.06, 'throughput': 8523.87} [INFO|2025-07-07 14:12:53] logging.py:143 >> {'loss': 1.3944, 'learning_rate': 1.0992e-05, 'epoch': 2.07, 'throughput': 8523.97} [INFO|2025-07-07 14:13:31] logging.py:143 >> {'loss': 1.2569, 'learning_rate': 1.0900e-05, 'epoch': 2.07, 'throughput': 8524.02} [INFO|2025-07-07 14:14:10] logging.py:143 >> {'loss': 1.2907, 'learning_rate': 1.0808e-05, 'epoch': 2.08, 'throughput': 8524.09} [INFO|2025-07-07 14:14:48] logging.py:143 >> {'loss': 1.2508, 'learning_rate': 1.0716e-05, 'epoch': 2.08, 'throughput': 8524.20} [INFO|2025-07-07 14:15:26] logging.py:143 >> {'loss': 1.3341, 'learning_rate': 1.0624e-05, 'epoch': 2.09, 'throughput': 8524.25} [INFO|2025-07-07 14:16:04] logging.py:143 >> {'loss': 1.2481, 'learning_rate': 1.0533e-05, 'epoch': 2.09, 'throughput': 8524.34} [INFO|2025-07-07 14:16:42] logging.py:143 >> {'loss': 1.3535, 'learning_rate': 1.0441e-05, 'epoch': 2.09, 'throughput': 8524.46} [INFO|2025-07-07 14:17:21] logging.py:143 >> {'loss': 1.3108, 'learning_rate': 1.0351e-05, 'epoch': 2.10, 'throughput': 8524.55} [INFO|2025-07-07 14:17:59] logging.py:143 >> {'loss': 1.3974, 'learning_rate': 1.0260e-05, 'epoch': 2.10, 'throughput': 8524.65} [INFO|2025-07-07 14:18:37] logging.py:143 >> {'loss': 1.3651, 'learning_rate': 1.0170e-05, 'epoch': 2.11, 'throughput': 8524.75} [INFO|2025-07-07 14:19:15] logging.py:143 >> {'loss': 1.3018, 'learning_rate': 1.0080e-05, 'epoch': 2.11, 'throughput': 8524.83} [INFO|2025-07-07 14:19:54] logging.py:143 >> {'loss': 1.2495, 'learning_rate': 9.9904e-06, 'epoch': 2.12, 'throughput': 8524.93} [INFO|2025-07-07 14:20:32] logging.py:143 >> {'loss': 1.2693, 'learning_rate': 9.9011e-06, 'epoch': 2.12, 'throughput': 8525.03} [INFO|2025-07-07 14:21:10] logging.py:143 >> {'loss': 1.3347, 'learning_rate': 9.8120e-06, 'epoch': 2.12, 'throughput': 8525.10} [INFO|2025-07-07 14:21:48] logging.py:143 >> {'loss': 1.2253, 'learning_rate': 9.7233e-06, 'epoch': 2.13, 'throughput': 8525.19} [INFO|2025-07-07 14:22:26] logging.py:143 >> {'loss': 1.2311, 'learning_rate': 9.6349e-06, 'epoch': 2.13, 'throughput': 8525.29} [INFO|2025-07-07 14:23:05] logging.py:143 >> {'loss': 1.3237, 'learning_rate': 9.5468e-06, 'epoch': 2.14, 'throughput': 8525.38} [INFO|2025-07-07 14:23:43] logging.py:143 >> {'loss': 1.3546, 'learning_rate': 9.4590e-06, 'epoch': 2.14, 'throughput': 8525.47} [INFO|2025-07-07 14:24:21] logging.py:143 >> {'loss': 1.3148, 'learning_rate': 9.3716e-06, 'epoch': 2.15, 'throughput': 8525.54} [INFO|2025-07-07 14:24:59] logging.py:143 >> {'loss': 1.2107, 'learning_rate': 9.2844e-06, 'epoch': 2.15, 'throughput': 8525.61} [INFO|2025-07-07 14:25:38] logging.py:143 >> {'loss': 1.2356, 'learning_rate': 9.1975e-06, 'epoch': 2.15, 'throughput': 8525.67} [INFO|2025-07-07 14:26:16] logging.py:143 >> {'loss': 1.3176, 'learning_rate': 9.1110e-06, 'epoch': 2.16, 'throughput': 8525.75} [INFO|2025-07-07 14:26:54] logging.py:143 >> {'loss': 1.3326, 'learning_rate': 9.0248e-06, 'epoch': 2.16, 'throughput': 8525.84} [INFO|2025-07-07 14:27:32] logging.py:143 >> {'loss': 1.2754, 'learning_rate': 8.9389e-06, 'epoch': 2.17, 'throughput': 8525.94} [INFO|2025-07-07 14:28:11] logging.py:143 >> {'loss': 1.2422, 'learning_rate': 8.8533e-06, 'epoch': 2.17, 'throughput': 8526.02} [INFO|2025-07-07 14:28:49] logging.py:143 >> {'loss': 1.2296, 'learning_rate': 8.7681e-06, 'epoch': 2.18, 'throughput': 8526.13} [INFO|2025-07-07 14:29:27] logging.py:143 >> {'loss': 1.2566, 'learning_rate': 8.6831e-06, 'epoch': 2.18, 'throughput': 8526.24} [INFO|2025-07-07 14:30:05] logging.py:143 >> {'loss': 1.2702, 'learning_rate': 8.5985e-06, 'epoch': 2.18, 'throughput': 8526.18} [INFO|2025-07-07 14:30:44] logging.py:143 >> {'loss': 1.3331, 'learning_rate': 8.5143e-06, 'epoch': 2.19, 'throughput': 8526.26} [INFO|2025-07-07 14:31:22] logging.py:143 >> {'loss': 1.3256, 'learning_rate': 8.4303e-06, 'epoch': 2.19, 'throughput': 8526.34} [INFO|2025-07-07 14:32:00] logging.py:143 >> {'loss': 1.3068, 'learning_rate': 8.3467e-06, 'epoch': 2.20, 'throughput': 8526.43} [INFO|2025-07-07 14:32:38] logging.py:143 >> {'loss': 1.3969, 'learning_rate': 8.2634e-06, 'epoch': 2.20, 'throughput': 8526.51} [INFO|2025-07-07 14:33:16] logging.py:143 >> {'loss': 1.2597, 'learning_rate': 8.1805e-06, 'epoch': 2.21, 'throughput': 8526.60} [INFO|2025-07-07 14:33:55] logging.py:143 >> {'loss': 1.3258, 'learning_rate': 8.0979e-06, 'epoch': 2.21, 'throughput': 8526.69} [INFO|2025-07-07 14:34:33] logging.py:143 >> {'loss': 1.2468, 'learning_rate': 8.0156e-06, 'epoch': 2.21, 'throughput': 8526.78} [INFO|2025-07-07 14:35:11] logging.py:143 >> {'loss': 1.2832, 'learning_rate': 7.9337e-06, 'epoch': 2.22, 'throughput': 8526.88} [INFO|2025-07-07 14:35:49] logging.py:143 >> {'loss': 1.3099, 'learning_rate': 7.8521e-06, 'epoch': 2.22, 'throughput': 8526.97} [INFO|2025-07-07 14:36:28] logging.py:143 >> {'loss': 1.2514, 'learning_rate': 7.7709e-06, 'epoch': 2.23, 'throughput': 8527.03} [INFO|2025-07-07 14:37:06] logging.py:143 >> {'loss': 1.3590, 'learning_rate': 7.6900e-06, 'epoch': 2.23, 'throughput': 8527.11} [INFO|2025-07-07 14:37:44] logging.py:143 >> {'loss': 1.3118, 'learning_rate': 7.6094e-06, 'epoch': 2.24, 'throughput': 8527.20} [INFO|2025-07-07 14:38:22] logging.py:143 >> {'loss': 1.3736, 'learning_rate': 7.5292e-06, 'epoch': 2.24, 'throughput': 8527.26} [INFO|2025-07-07 14:39:00] logging.py:143 >> {'loss': 1.2362, 'learning_rate': 7.4494e-06, 'epoch': 2.24, 'throughput': 8527.32} [INFO|2025-07-07 14:39:39] logging.py:143 >> {'loss': 1.3090, 'learning_rate': 7.3699e-06, 'epoch': 2.25, 'throughput': 8527.39} [INFO|2025-07-07 14:40:17] logging.py:143 >> {'loss': 1.2006, 'learning_rate': 7.2907e-06, 'epoch': 2.25, 'throughput': 8527.49} [INFO|2025-07-07 14:40:55] logging.py:143 >> {'loss': 1.2181, 'learning_rate': 7.2119e-06, 'epoch': 2.26, 'throughput': 8527.60} [INFO|2025-07-07 14:41:33] logging.py:143 >> {'loss': 1.3061, 'learning_rate': 7.1335e-06, 'epoch': 2.26, 'throughput': 8527.69} [INFO|2025-07-07 14:42:11] logging.py:143 >> {'loss': 1.2021, 'learning_rate': 7.0554e-06, 'epoch': 2.27, 'throughput': 8527.79} [INFO|2025-07-07 14:42:50] logging.py:143 >> {'loss': 1.2962, 'learning_rate': 6.9777e-06, 'epoch': 2.27, 'throughput': 8527.89} [INFO|2025-07-07 14:43:28] logging.py:143 >> {'loss': 1.3134, 'learning_rate': 6.9003e-06, 'epoch': 2.27, 'throughput': 8527.98} [INFO|2025-07-07 14:44:06] logging.py:143 >> {'loss': 1.2916, 'learning_rate': 6.8233e-06, 'epoch': 2.28, 'throughput': 8528.08} [INFO|2025-07-07 14:44:44] logging.py:143 >> {'loss': 1.2931, 'learning_rate': 6.7467e-06, 'epoch': 2.28, 'throughput': 8528.18} [INFO|2025-07-07 14:45:22] logging.py:143 >> {'loss': 1.2956, 'learning_rate': 6.6704e-06, 'epoch': 2.29, 'throughput': 8528.27} [INFO|2025-07-07 14:46:00] logging.py:143 >> {'loss': 1.2605, 'learning_rate': 6.5945e-06, 'epoch': 2.29, 'throughput': 8528.36} [INFO|2025-07-07 14:46:39] logging.py:143 >> {'loss': 1.3711, 'learning_rate': 6.5190e-06, 'epoch': 2.29, 'throughput': 8528.46} [INFO|2025-07-07 14:47:17] logging.py:143 >> {'loss': 1.2623, 'learning_rate': 6.4439e-06, 'epoch': 2.30, 'throughput': 8528.55} [INFO|2025-07-07 14:47:55] logging.py:143 >> {'loss': 1.2411, 'learning_rate': 6.3691e-06, 'epoch': 2.30, 'throughput': 8528.66} [INFO|2025-07-07 14:48:33] logging.py:143 >> {'loss': 1.3174, 'learning_rate': 6.2947e-06, 'epoch': 2.31, 'throughput': 8528.76} [INFO|2025-07-07 14:49:11] logging.py:143 >> {'loss': 1.2363, 'learning_rate': 6.2206e-06, 'epoch': 2.31, 'throughput': 8528.85} [INFO|2025-07-07 14:49:49] logging.py:143 >> {'loss': 1.3052, 'learning_rate': 6.1469e-06, 'epoch': 2.32, 'throughput': 8528.95} [INFO|2025-07-07 14:50:28] logging.py:143 >> {'loss': 1.2887, 'learning_rate': 6.0737e-06, 'epoch': 2.32, 'throughput': 8529.05} [INFO|2025-07-07 14:51:06] logging.py:143 >> {'loss': 1.3453, 'learning_rate': 6.0008e-06, 'epoch': 2.32, 'throughput': 8529.14} [INFO|2025-07-07 14:51:44] logging.py:143 >> {'loss': 1.3151, 'learning_rate': 5.9282e-06, 'epoch': 2.33, 'throughput': 8529.24} [INFO|2025-07-07 14:52:22] logging.py:143 >> {'loss': 1.2960, 'learning_rate': 5.8561e-06, 'epoch': 2.33, 'throughput': 8529.34} [INFO|2025-07-07 14:53:00] logging.py:143 >> {'loss': 1.3364, 'learning_rate': 5.7843e-06, 'epoch': 2.34, 'throughput': 8529.44} [INFO|2025-07-07 14:53:38] logging.py:143 >> {'loss': 1.2018, 'learning_rate': 5.7129e-06, 'epoch': 2.34, 'throughput': 8529.51} [INFO|2025-07-07 14:54:17] logging.py:143 >> {'loss': 1.2608, 'learning_rate': 5.6420e-06, 'epoch': 2.35, 'throughput': 8529.59} [INFO|2025-07-07 14:54:55] logging.py:143 >> {'loss': 1.2628, 'learning_rate': 5.5714e-06, 'epoch': 2.35, 'throughput': 8529.67} [INFO|2025-07-07 14:55:33] logging.py:143 >> {'loss': 1.2440, 'learning_rate': 5.5011e-06, 'epoch': 2.35, 'throughput': 8529.73} [INFO|2025-07-07 14:56:11] logging.py:143 >> {'loss': 1.2223, 'learning_rate': 5.4313e-06, 'epoch': 2.36, 'throughput': 8529.80} [INFO|2025-07-07 14:56:49] logging.py:143 >> {'loss': 1.2970, 'learning_rate': 5.3619e-06, 'epoch': 2.36, 'throughput': 8529.90} [INFO|2025-07-07 14:57:28] logging.py:143 >> {'loss': 1.2684, 'learning_rate': 5.2928e-06, 'epoch': 2.37, 'throughput': 8529.99} [INFO|2025-07-07 14:58:06] logging.py:143 >> {'loss': 1.3189, 'learning_rate': 5.2242e-06, 'epoch': 2.37, 'throughput': 8530.06} [INFO|2025-07-07 14:58:44] logging.py:143 >> {'loss': 1.2590, 'learning_rate': 5.1560e-06, 'epoch': 2.38, 'throughput': 8530.15} [INFO|2025-07-07 14:59:23] logging.py:143 >> {'loss': 1.3125, 'learning_rate': 5.0881e-06, 'epoch': 2.38, 'throughput': 8530.09} [INFO|2025-07-07 15:00:01] logging.py:143 >> {'loss': 1.3202, 'learning_rate': 5.0207e-06, 'epoch': 2.38, 'throughput': 8530.15} [INFO|2025-07-07 15:00:39] logging.py:143 >> {'loss': 1.1852, 'learning_rate': 4.9536e-06, 'epoch': 2.39, 'throughput': 8530.23} [INFO|2025-07-07 15:01:17] logging.py:143 >> {'loss': 1.2548, 'learning_rate': 4.8870e-06, 'epoch': 2.39, 'throughput': 8530.31} [INFO|2025-07-07 15:01:55] logging.py:143 >> {'loss': 1.3178, 'learning_rate': 4.8207e-06, 'epoch': 2.40, 'throughput': 8530.41} [INFO|2025-07-07 15:02:34] logging.py:143 >> {'loss': 1.3020, 'learning_rate': 4.7549e-06, 'epoch': 2.40, 'throughput': 8530.49} [INFO|2025-07-07 15:03:12] logging.py:143 >> {'loss': 1.2208, 'learning_rate': 4.6894e-06, 'epoch': 2.41, 'throughput': 8530.59} [INFO|2025-07-07 15:03:50] logging.py:143 >> {'loss': 1.2986, 'learning_rate': 4.6244e-06, 'epoch': 2.41, 'throughput': 8530.66} [INFO|2025-07-07 15:04:28] logging.py:143 >> {'loss': 1.3736, 'learning_rate': 4.5598e-06, 'epoch': 2.41, 'throughput': 8530.74} [INFO|2025-07-07 15:05:06] logging.py:143 >> {'loss': 1.3540, 'learning_rate': 4.4956e-06, 'epoch': 2.42, 'throughput': 8530.82} [INFO|2025-07-07 15:05:44] logging.py:143 >> {'loss': 1.2648, 'learning_rate': 4.4318e-06, 'epoch': 2.42, 'throughput': 8530.90} [INFO|2025-07-07 15:06:23] logging.py:143 >> {'loss': 1.2791, 'learning_rate': 4.3684e-06, 'epoch': 2.43, 'throughput': 8530.97} [INFO|2025-07-07 15:07:01] logging.py:143 >> {'loss': 1.2881, 'learning_rate': 4.3054e-06, 'epoch': 2.43, 'throughput': 8531.04} [INFO|2025-07-07 15:07:39] logging.py:143 >> {'loss': 1.2743, 'learning_rate': 4.2428e-06, 'epoch': 2.44, 'throughput': 8531.09} [INFO|2025-07-07 15:08:17] logging.py:143 >> {'loss': 1.2977, 'learning_rate': 4.1807e-06, 'epoch': 2.44, 'throughput': 8531.17} [INFO|2025-07-07 15:08:56] logging.py:143 >> {'loss': 1.2550, 'learning_rate': 4.1190e-06, 'epoch': 2.44, 'throughput': 8531.26} [INFO|2025-07-07 15:09:34] logging.py:143 >> {'loss': 1.2700, 'learning_rate': 4.0576e-06, 'epoch': 2.45, 'throughput': 8531.32} [INFO|2025-07-07 15:10:12] logging.py:143 >> {'loss': 1.3071, 'learning_rate': 3.9968e-06, 'epoch': 2.45, 'throughput': 8531.40} [INFO|2025-07-07 15:10:50] logging.py:143 >> {'loss': 1.2634, 'learning_rate': 3.9363e-06, 'epoch': 2.46, 'throughput': 8531.48} [INFO|2025-07-07 15:11:28] logging.py:143 >> {'loss': 1.3066, 'learning_rate': 3.8762e-06, 'epoch': 2.46, 'throughput': 8531.53} [INFO|2025-07-07 15:12:07] logging.py:143 >> {'loss': 1.2509, 'learning_rate': 3.8166e-06, 'epoch': 2.47, 'throughput': 8531.60} [INFO|2025-07-07 15:12:45] logging.py:143 >> {'loss': 1.3029, 'learning_rate': 3.7574e-06, 'epoch': 2.47, 'throughput': 8531.69} [INFO|2025-07-07 15:13:23] logging.py:143 >> {'loss': 1.2862, 'learning_rate': 3.6986e-06, 'epoch': 2.47, 'throughput': 8531.76} [INFO|2025-07-07 15:14:01] logging.py:143 >> {'loss': 1.1917, 'learning_rate': 3.6403e-06, 'epoch': 2.48, 'throughput': 8531.79} [INFO|2025-07-07 15:14:40] logging.py:143 >> {'loss': 1.3230, 'learning_rate': 3.5824e-06, 'epoch': 2.48, 'throughput': 8531.81} [INFO|2025-07-07 15:15:18] logging.py:143 >> {'loss': 1.2163, 'learning_rate': 3.5249e-06, 'epoch': 2.49, 'throughput': 8531.84} [INFO|2025-07-07 15:15:56] logging.py:143 >> {'loss': 1.2773, 'learning_rate': 3.4678e-06, 'epoch': 2.49, 'throughput': 8531.92} [INFO|2025-07-07 15:16:34] logging.py:143 >> {'loss': 1.3207, 'learning_rate': 3.4112e-06, 'epoch': 2.50, 'throughput': 8531.99} [INFO|2025-07-07 15:17:13] logging.py:143 >> {'loss': 1.3038, 'learning_rate': 3.3550e-06, 'epoch': 2.50, 'throughput': 8532.06} [INFO|2025-07-07 15:17:51] logging.py:143 >> {'loss': 1.2407, 'learning_rate': 3.2992e-06, 'epoch': 2.50, 'throughput': 8532.11} [INFO|2025-07-07 15:18:29] logging.py:143 >> {'loss': 1.2952, 'learning_rate': 3.2439e-06, 'epoch': 2.51, 'throughput': 8532.16} [INFO|2025-07-07 15:19:07] logging.py:143 >> {'loss': 1.2554, 'learning_rate': 3.1890e-06, 'epoch': 2.51, 'throughput': 8532.22} [INFO|2025-07-07 15:19:45] logging.py:143 >> {'loss': 1.3263, 'learning_rate': 3.1345e-06, 'epoch': 2.52, 'throughput': 8532.29} [INFO|2025-07-07 15:20:24] logging.py:143 >> {'loss': 1.3721, 'learning_rate': 3.0805e-06, 'epoch': 2.52, 'throughput': 8532.35} [INFO|2025-07-07 15:21:02] logging.py:143 >> {'loss': 1.3668, 'learning_rate': 3.0269e-06, 'epoch': 2.53, 'throughput': 8532.41} [INFO|2025-07-07 15:21:40] logging.py:143 >> {'loss': 1.2310, 'learning_rate': 2.9738e-06, 'epoch': 2.53, 'throughput': 8532.49} [INFO|2025-07-07 15:22:18] logging.py:143 >> {'loss': 1.3326, 'learning_rate': 2.9211e-06, 'epoch': 2.53, 'throughput': 8532.56} [INFO|2025-07-07 15:22:57] logging.py:143 >> {'loss': 1.2574, 'learning_rate': 2.8688e-06, 'epoch': 2.54, 'throughput': 8532.61} [INFO|2025-07-07 15:23:35] logging.py:143 >> {'loss': 1.2296, 'learning_rate': 2.8170e-06, 'epoch': 2.54, 'throughput': 8532.66} [INFO|2025-07-07 15:24:13] logging.py:143 >> {'loss': 1.2793, 'learning_rate': 2.7656e-06, 'epoch': 2.55, 'throughput': 8532.72} [INFO|2025-07-07 15:24:51] logging.py:143 >> {'loss': 1.3006, 'learning_rate': 2.7147e-06, 'epoch': 2.55, 'throughput': 8532.79} [INFO|2025-07-07 15:25:29] logging.py:143 >> {'loss': 1.2870, 'learning_rate': 2.6642e-06, 'epoch': 2.56, 'throughput': 8532.85} [INFO|2025-07-07 15:26:08] logging.py:143 >> {'loss': 1.2718, 'learning_rate': 2.6142e-06, 'epoch': 2.56, 'throughput': 8532.92} [INFO|2025-07-07 15:26:46] logging.py:143 >> {'loss': 1.2814, 'learning_rate': 2.5646e-06, 'epoch': 2.56, 'throughput': 8532.96} [INFO|2025-07-07 15:26:46] trainer.py:3993 >> Saving model checkpoint to saves/Gemma-3-1B-Instruct/full/train_2025-07-07-08-57-22/checkpoint-6000 [INFO|2025-07-07 15:26:46] configuration_utils.py:424 >> Configuration saved in saves/Gemma-3-1B-Instruct/full/train_2025-07-07-08-57-22/checkpoint-6000/config.json [INFO|2025-07-07 15:26:46] configuration_utils.py:904 >> Configuration saved in saves/Gemma-3-1B-Instruct/full/train_2025-07-07-08-57-22/checkpoint-6000/generation_config.json [INFO|2025-07-07 15:27:01] modeling_utils.py:3725 >> Model weights saved in saves/Gemma-3-1B-Instruct/full/train_2025-07-07-08-57-22/checkpoint-6000/model.safetensors [INFO|2025-07-07 15:27:01] tokenization_utils_base.py:2356 >> chat template saved in saves/Gemma-3-1B-Instruct/full/train_2025-07-07-08-57-22/checkpoint-6000/chat_template.jinja [INFO|2025-07-07 15:27:01] tokenization_utils_base.py:2525 >> tokenizer config file saved in saves/Gemma-3-1B-Instruct/full/train_2025-07-07-08-57-22/checkpoint-6000/tokenizer_config.json [INFO|2025-07-07 15:27:01] tokenization_utils_base.py:2534 >> Special tokens file saved in saves/Gemma-3-1B-Instruct/full/train_2025-07-07-08-57-22/checkpoint-6000/special_tokens_map.json [INFO|2025-07-07 15:28:07] logging.py:143 >> {'loss': 1.2665, 'learning_rate': 2.5155e-06, 'epoch': 2.57, 'throughput': 8517.19} [INFO|2025-07-07 15:28:45] logging.py:143 >> {'loss': 1.2276, 'learning_rate': 2.4668e-06, 'epoch': 2.57, 'throughput': 8517.24} [INFO|2025-07-07 15:29:24] logging.py:143 >> {'loss': 1.3025, 'learning_rate': 2.4185e-06, 'epoch': 2.58, 'throughput': 8517.32} [INFO|2025-07-07 15:30:02] logging.py:143 >> {'loss': 1.3325, 'learning_rate': 2.3708e-06, 'epoch': 2.58, 'throughput': 8517.29} [INFO|2025-07-07 15:30:40] logging.py:143 >> {'loss': 1.2376, 'learning_rate': 2.3234e-06, 'epoch': 2.59, 'throughput': 8517.35} [INFO|2025-07-07 15:31:19] logging.py:143 >> {'loss': 1.2667, 'learning_rate': 2.2766e-06, 'epoch': 2.59, 'throughput': 8517.43} [INFO|2025-07-07 15:31:57] logging.py:143 >> {'loss': 1.2651, 'learning_rate': 2.2301e-06, 'epoch': 2.59, 'throughput': 8517.51} [INFO|2025-07-07 15:32:35] logging.py:143 >> {'loss': 1.2318, 'learning_rate': 2.1842e-06, 'epoch': 2.60, 'throughput': 8517.59} [INFO|2025-07-07 15:33:13] logging.py:143 >> {'loss': 1.2567, 'learning_rate': 2.1387e-06, 'epoch': 2.60, 'throughput': 8517.67} [INFO|2025-07-07 15:33:51] logging.py:143 >> {'loss': 1.3297, 'learning_rate': 2.0936e-06, 'epoch': 2.61, 'throughput': 8517.77} [INFO|2025-07-07 15:34:30] logging.py:143 >> {'loss': 1.2867, 'learning_rate': 2.0490e-06, 'epoch': 2.61, 'throughput': 8517.86} [INFO|2025-07-07 15:35:08] logging.py:143 >> {'loss': 1.2355, 'learning_rate': 2.0049e-06, 'epoch': 2.62, 'throughput': 8517.94} [INFO|2025-07-07 15:35:46] logging.py:143 >> {'loss': 1.2208, 'learning_rate': 1.9612e-06, 'epoch': 2.62, 'throughput': 8518.02} [INFO|2025-07-07 15:36:24] logging.py:143 >> {'loss': 1.3057, 'learning_rate': 1.9180e-06, 'epoch': 2.62, 'throughput': 8518.11} [INFO|2025-07-07 15:37:02] logging.py:143 >> {'loss': 1.2662, 'learning_rate': 1.8753e-06, 'epoch': 2.63, 'throughput': 8518.22} [INFO|2025-07-07 15:37:41] logging.py:143 >> {'loss': 1.2647, 'learning_rate': 1.8330e-06, 'epoch': 2.63, 'throughput': 8518.33} [INFO|2025-07-07 15:38:19] logging.py:143 >> {'loss': 1.2703, 'learning_rate': 1.7912e-06, 'epoch': 2.64, 'throughput': 8518.41} [INFO|2025-07-07 15:38:57] logging.py:143 >> {'loss': 1.3118, 'learning_rate': 1.7498e-06, 'epoch': 2.64, 'throughput': 8518.49} [INFO|2025-07-07 15:39:35] logging.py:143 >> {'loss': 1.2913, 'learning_rate': 1.7089e-06, 'epoch': 2.65, 'throughput': 8518.56} [INFO|2025-07-07 15:40:13] logging.py:143 >> {'loss': 1.1900, 'learning_rate': 1.6685e-06, 'epoch': 2.65, 'throughput': 8518.65} [INFO|2025-07-07 15:40:52] logging.py:143 >> {'loss': 1.2940, 'learning_rate': 1.6286e-06, 'epoch': 2.65, 'throughput': 8518.77} [INFO|2025-07-07 15:41:30] logging.py:143 >> {'loss': 1.3120, 'learning_rate': 1.5891e-06, 'epoch': 2.66, 'throughput': 8518.85} [INFO|2025-07-07 15:42:08] logging.py:143 >> {'loss': 1.3186, 'learning_rate': 1.5501e-06, 'epoch': 2.66, 'throughput': 8518.93} [INFO|2025-07-07 15:42:46] logging.py:143 >> {'loss': 1.2143, 'learning_rate': 1.5115e-06, 'epoch': 2.67, 'throughput': 8519.02} [INFO|2025-07-07 15:43:24] logging.py:143 >> {'loss': 1.2972, 'learning_rate': 1.4734e-06, 'epoch': 2.67, 'throughput': 8519.10} [INFO|2025-07-07 15:44:03] logging.py:143 >> {'loss': 1.3174, 'learning_rate': 1.4358e-06, 'epoch': 2.68, 'throughput': 8519.17} [INFO|2025-07-07 15:44:41] logging.py:143 >> {'loss': 1.1827, 'learning_rate': 1.3987e-06, 'epoch': 2.68, 'throughput': 8519.27} [INFO|2025-07-07 15:45:19] logging.py:143 >> {'loss': 1.2175, 'learning_rate': 1.3620e-06, 'epoch': 2.68, 'throughput': 8519.33} [INFO|2025-07-07 15:45:57] logging.py:143 >> {'loss': 1.2698, 'learning_rate': 1.3258e-06, 'epoch': 2.69, 'throughput': 8519.41} [INFO|2025-07-07 15:46:36] logging.py:143 >> {'loss': 1.2895, 'learning_rate': 1.2901e-06, 'epoch': 2.69, 'throughput': 8519.48} [INFO|2025-07-07 15:47:14] logging.py:143 >> {'loss': 1.2516, 'learning_rate': 1.2549e-06, 'epoch': 2.70, 'throughput': 8519.55} [INFO|2025-07-07 15:47:52] logging.py:143 >> {'loss': 1.2263, 'learning_rate': 1.2201e-06, 'epoch': 2.70, 'throughput': 8519.64} [INFO|2025-07-07 15:48:30] logging.py:143 >> {'loss': 1.3005, 'learning_rate': 1.1858e-06, 'epoch': 2.71, 'throughput': 8519.70} [INFO|2025-07-07 15:49:09] logging.py:143 >> {'loss': 1.2975, 'learning_rate': 1.1520e-06, 'epoch': 2.71, 'throughput': 8519.76} [INFO|2025-07-07 15:49:47] logging.py:143 >> {'loss': 1.2857, 'learning_rate': 1.1187e-06, 'epoch': 2.71, 'throughput': 8519.84} [INFO|2025-07-07 15:50:25] logging.py:143 >> {'loss': 1.2716, 'learning_rate': 1.0858e-06, 'epoch': 2.72, 'throughput': 8519.89} [INFO|2025-07-07 15:51:03] logging.py:143 >> {'loss': 1.2668, 'learning_rate': 1.0535e-06, 'epoch': 2.72, 'throughput': 8519.97} [INFO|2025-07-07 15:51:42] logging.py:143 >> {'loss': 1.2912, 'learning_rate': 1.0216e-06, 'epoch': 2.73, 'throughput': 8520.05} [INFO|2025-07-07 15:52:20] logging.py:143 >> {'loss': 1.2769, 'learning_rate': 9.9016e-07, 'epoch': 2.73, 'throughput': 8520.10} [INFO|2025-07-07 15:52:58] logging.py:143 >> {'loss': 1.2742, 'learning_rate': 9.5923e-07, 'epoch': 2.74, 'throughput': 8520.16} [INFO|2025-07-07 15:53:36] logging.py:143 >> {'loss': 1.3451, 'learning_rate': 9.2877e-07, 'epoch': 2.74, 'throughput': 8520.20} [INFO|2025-07-07 15:54:15] logging.py:143 >> {'loss': 1.2782, 'learning_rate': 8.9880e-07, 'epoch': 2.74, 'throughput': 8520.25} [INFO|2025-07-07 15:54:53] logging.py:143 >> {'loss': 1.1623, 'learning_rate': 8.6932e-07, 'epoch': 2.75, 'throughput': 8520.31} [INFO|2025-07-07 15:55:31] logging.py:143 >> {'loss': 1.3126, 'learning_rate': 8.4031e-07, 'epoch': 2.75, 'throughput': 8520.37} [INFO|2025-07-07 15:56:10] logging.py:143 >> {'loss': 1.2593, 'learning_rate': 8.1179e-07, 'epoch': 2.76, 'throughput': 8520.43} [INFO|2025-07-07 15:56:48] logging.py:143 >> {'loss': 1.2660, 'learning_rate': 7.8375e-07, 'epoch': 2.76, 'throughput': 8520.50} [INFO|2025-07-07 15:57:26] logging.py:143 >> {'loss': 1.2866, 'learning_rate': 7.5620e-07, 'epoch': 2.77, 'throughput': 8520.55} [INFO|2025-07-07 15:58:04] logging.py:143 >> {'loss': 1.2724, 'learning_rate': 7.2913e-07, 'epoch': 2.77, 'throughput': 8520.61} [INFO|2025-07-07 15:58:43] logging.py:143 >> {'loss': 1.2631, 'learning_rate': 7.0255e-07, 'epoch': 2.77, 'throughput': 8520.68} [INFO|2025-07-07 15:59:21] logging.py:143 >> {'loss': 1.2285, 'learning_rate': 6.7646e-07, 'epoch': 2.78, 'throughput': 8520.75} [INFO|2025-07-07 15:59:59] logging.py:143 >> {'loss': 1.2997, 'learning_rate': 6.5085e-07, 'epoch': 2.78, 'throughput': 8520.69} [INFO|2025-07-07 16:00:38] logging.py:143 >> {'loss': 1.3066, 'learning_rate': 6.2574e-07, 'epoch': 2.79, 'throughput': 8520.76} [INFO|2025-07-07 16:01:16] logging.py:143 >> {'loss': 1.2485, 'learning_rate': 6.0111e-07, 'epoch': 2.79, 'throughput': 8520.83} [INFO|2025-07-07 16:01:54] logging.py:143 >> {'loss': 1.2889, 'learning_rate': 5.7696e-07, 'epoch': 2.80, 'throughput': 8520.92} [INFO|2025-07-07 16:02:32] logging.py:143 >> {'loss': 1.2330, 'learning_rate': 5.5331e-07, 'epoch': 2.80, 'throughput': 8520.99} [INFO|2025-07-07 16:03:10] logging.py:143 >> {'loss': 1.3372, 'learning_rate': 5.3015e-07, 'epoch': 2.80, 'throughput': 8521.06} [INFO|2025-07-07 16:03:49] logging.py:143 >> {'loss': 1.3094, 'learning_rate': 5.0747e-07, 'epoch': 2.81, 'throughput': 8521.12} [INFO|2025-07-07 16:04:27] logging.py:143 >> {'loss': 1.2771, 'learning_rate': 4.8529e-07, 'epoch': 2.81, 'throughput': 8521.20} [INFO|2025-07-07 16:05:05] logging.py:143 >> {'loss': 1.3135, 'learning_rate': 4.6360e-07, 'epoch': 2.82, 'throughput': 8521.28} [INFO|2025-07-07 16:05:43] logging.py:143 >> {'loss': 1.3005, 'learning_rate': 4.4240e-07, 'epoch': 2.82, 'throughput': 8521.37} [INFO|2025-07-07 16:06:22] logging.py:143 >> {'loss': 1.2675, 'learning_rate': 4.2169e-07, 'epoch': 2.83, 'throughput': 8521.44} [INFO|2025-07-07 16:07:00] logging.py:143 >> {'loss': 1.2558, 'learning_rate': 4.0147e-07, 'epoch': 2.83, 'throughput': 8521.52} [INFO|2025-07-07 16:07:38] logging.py:143 >> {'loss': 1.2147, 'learning_rate': 3.8175e-07, 'epoch': 2.83, 'throughput': 8521.59} [INFO|2025-07-07 16:08:16] logging.py:143 >> {'loss': 1.2625, 'learning_rate': 3.6252e-07, 'epoch': 2.84, 'throughput': 8521.67} [INFO|2025-07-07 16:08:54] logging.py:143 >> {'loss': 1.2822, 'learning_rate': 3.4378e-07, 'epoch': 2.84, 'throughput': 8521.74} [INFO|2025-07-07 16:09:33] logging.py:143 >> {'loss': 1.3711, 'learning_rate': 3.2554e-07, 'epoch': 2.85, 'throughput': 8521.81} [INFO|2025-07-07 16:10:11] logging.py:143 >> {'loss': 1.3431, 'learning_rate': 3.0779e-07, 'epoch': 2.85, 'throughput': 8521.88} [INFO|2025-07-07 16:10:49] logging.py:143 >> {'loss': 1.2762, 'learning_rate': 2.9054e-07, 'epoch': 2.86, 'throughput': 8521.95} [INFO|2025-07-07 16:11:27] logging.py:143 >> {'loss': 1.3462, 'learning_rate': 2.7378e-07, 'epoch': 2.86, 'throughput': 8522.02} [INFO|2025-07-07 16:12:05] logging.py:143 >> {'loss': 1.2703, 'learning_rate': 2.5751e-07, 'epoch': 2.86, 'throughput': 8522.10} [INFO|2025-07-07 16:12:44] logging.py:143 >> {'loss': 1.2326, 'learning_rate': 2.4174e-07, 'epoch': 2.87, 'throughput': 8522.18} [INFO|2025-07-07 16:13:22] logging.py:143 >> {'loss': 1.3361, 'learning_rate': 2.2647e-07, 'epoch': 2.87, 'throughput': 8522.24} [INFO|2025-07-07 16:14:00] logging.py:143 >> {'loss': 1.3436, 'learning_rate': 2.1169e-07, 'epoch': 2.88, 'throughput': 8522.29} [INFO|2025-07-07 16:14:38] logging.py:143 >> {'loss': 1.2468, 'learning_rate': 1.9741e-07, 'epoch': 2.88, 'throughput': 8522.32} [INFO|2025-07-07 16:15:17] logging.py:143 >> {'loss': 1.2435, 'learning_rate': 1.8363e-07, 'epoch': 2.88, 'throughput': 8522.36} [INFO|2025-07-07 16:15:55] logging.py:143 >> {'loss': 1.3043, 'learning_rate': 1.7034e-07, 'epoch': 2.89, 'throughput': 8522.41} [INFO|2025-07-07 16:16:33] logging.py:143 >> {'loss': 1.1589, 'learning_rate': 1.5755e-07, 'epoch': 2.89, 'throughput': 8522.46} [INFO|2025-07-07 16:17:12] logging.py:143 >> {'loss': 1.3461, 'learning_rate': 1.4526e-07, 'epoch': 2.90, 'throughput': 8522.52} [INFO|2025-07-07 16:17:50] logging.py:143 >> {'loss': 1.2056, 'learning_rate': 1.3347e-07, 'epoch': 2.90, 'throughput': 8522.59} [INFO|2025-07-07 16:18:28] logging.py:143 >> {'loss': 1.2781, 'learning_rate': 1.2217e-07, 'epoch': 2.91, 'throughput': 8522.66} [INFO|2025-07-07 16:19:06] logging.py:143 >> {'loss': 1.2247, 'learning_rate': 1.1137e-07, 'epoch': 2.91, 'throughput': 8522.72} [INFO|2025-07-07 16:19:45] logging.py:143 >> {'loss': 1.3014, 'learning_rate': 1.0107e-07, 'epoch': 2.91, 'throughput': 8522.78} [INFO|2025-07-07 16:20:23] logging.py:143 >> {'loss': 1.3198, 'learning_rate': 9.1272e-08, 'epoch': 2.92, 'throughput': 8522.86} [INFO|2025-07-07 16:21:01] logging.py:143 >> {'loss': 1.1802, 'learning_rate': 8.1970e-08, 'epoch': 2.92, 'throughput': 8522.95} [INFO|2025-07-07 16:21:39] logging.py:143 >> {'loss': 1.2681, 'learning_rate': 7.3167e-08, 'epoch': 2.93, 'throughput': 8523.03} [INFO|2025-07-07 16:22:17] logging.py:143 >> {'loss': 1.2732, 'learning_rate': 6.4863e-08, 'epoch': 2.93, 'throughput': 8523.11} [INFO|2025-07-07 16:22:55] logging.py:143 >> {'loss': 1.2269, 'learning_rate': 5.7059e-08, 'epoch': 2.94, 'throughput': 8523.20} [INFO|2025-07-07 16:23:34] logging.py:143 >> {'loss': 1.2477, 'learning_rate': 4.9754e-08, 'epoch': 2.94, 'throughput': 8523.25} [INFO|2025-07-07 16:24:12] logging.py:143 >> {'loss': 1.2823, 'learning_rate': 4.2949e-08, 'epoch': 2.94, 'throughput': 8523.31} [INFO|2025-07-07 16:24:50] logging.py:143 >> {'loss': 1.3038, 'learning_rate': 3.6644e-08, 'epoch': 2.95, 'throughput': 8523.38} [INFO|2025-07-07 16:25:28] logging.py:143 >> {'loss': 1.3545, 'learning_rate': 3.0838e-08, 'epoch': 2.95, 'throughput': 8523.46} [INFO|2025-07-07 16:26:06] logging.py:143 >> {'loss': 1.3159, 'learning_rate': 2.5533e-08, 'epoch': 2.96, 'throughput': 8523.54} [INFO|2025-07-07 16:26:45] logging.py:143 >> {'loss': 1.2563, 'learning_rate': 2.0728e-08, 'epoch': 2.96, 'throughput': 8523.61} [INFO|2025-07-07 16:27:23] logging.py:143 >> {'loss': 1.3157, 'learning_rate': 1.6423e-08, 'epoch': 2.97, 'throughput': 8523.69} [INFO|2025-07-07 16:28:01] logging.py:143 >> {'loss': 1.2197, 'learning_rate': 1.2619e-08, 'epoch': 2.97, 'throughput': 8523.76} [INFO|2025-07-07 16:28:39] logging.py:143 >> {'loss': 1.1497, 'learning_rate': 9.3147e-09, 'epoch': 2.97, 'throughput': 8523.82} [INFO|2025-07-07 16:29:18] logging.py:143 >> {'loss': 1.2737, 'learning_rate': 6.5111e-09, 'epoch': 2.98, 'throughput': 8523.88} [INFO|2025-07-07 16:29:56] logging.py:143 >> {'loss': 1.1757, 'learning_rate': 4.2081e-09, 'epoch': 2.98, 'throughput': 8523.86} [INFO|2025-07-07 16:30:34] logging.py:143 >> {'loss': 1.3677, 'learning_rate': 2.4058e-09, 'epoch': 2.99, 'throughput': 8523.94} [INFO|2025-07-07 16:31:12] logging.py:143 >> {'loss': 1.3492, 'learning_rate': 1.1040e-09, 'epoch': 2.99, 'throughput': 8524.00} [INFO|2025-07-07 16:31:51] logging.py:143 >> {'loss': 1.2597, 'learning_rate': 3.0291e-10, 'epoch': 3.00, 'throughput': 8524.08} [INFO|2025-07-07 16:32:25] logging.py:143 >> {'loss': 1.3635, 'learning_rate': 2.5034e-12, 'epoch': 3.00, 'throughput': 8524.08} [INFO|2025-07-07 16:32:25] trainer.py:3993 >> Saving model checkpoint to saves/Gemma-3-1B-Instruct/full/train_2025-07-07-08-57-22/checkpoint-7020 [INFO|2025-07-07 16:32:25] configuration_utils.py:424 >> Configuration saved in saves/Gemma-3-1B-Instruct/full/train_2025-07-07-08-57-22/checkpoint-7020/config.json [INFO|2025-07-07 16:32:25] configuration_utils.py:904 >> Configuration saved in saves/Gemma-3-1B-Instruct/full/train_2025-07-07-08-57-22/checkpoint-7020/generation_config.json [INFO|2025-07-07 16:32:39] modeling_utils.py:3725 >> Model weights saved in saves/Gemma-3-1B-Instruct/full/train_2025-07-07-08-57-22/checkpoint-7020/model.safetensors [INFO|2025-07-07 16:32:39] tokenization_utils_base.py:2356 >> chat template saved in saves/Gemma-3-1B-Instruct/full/train_2025-07-07-08-57-22/checkpoint-7020/chat_template.jinja [INFO|2025-07-07 16:32:39] tokenization_utils_base.py:2525 >> tokenizer config file saved in saves/Gemma-3-1B-Instruct/full/train_2025-07-07-08-57-22/checkpoint-7020/tokenizer_config.json [INFO|2025-07-07 16:32:39] tokenization_utils_base.py:2534 >> Special tokens file saved in saves/Gemma-3-1B-Instruct/full/train_2025-07-07-08-57-22/checkpoint-7020/special_tokens_map.json [INFO|2025-07-07 16:33:09] trainer.py:2676 >> Training completed. Do not forget to share your model on huggingface.co/models =) [INFO|2025-07-07 16:33:09] trainer.py:3993 >> Saving model checkpoint to saves/Gemma-3-1B-Instruct/full/train_2025-07-07-08-57-22 [INFO|2025-07-07 16:33:09] configuration_utils.py:424 >> Configuration saved in saves/Gemma-3-1B-Instruct/full/train_2025-07-07-08-57-22/config.json [INFO|2025-07-07 16:33:09] configuration_utils.py:904 >> Configuration saved in saves/Gemma-3-1B-Instruct/full/train_2025-07-07-08-57-22/generation_config.json [INFO|2025-07-07 16:33:23] modeling_utils.py:3725 >> Model weights saved in saves/Gemma-3-1B-Instruct/full/train_2025-07-07-08-57-22/model.safetensors [INFO|2025-07-07 16:33:23] tokenization_utils_base.py:2356 >> chat template saved in saves/Gemma-3-1B-Instruct/full/train_2025-07-07-08-57-22/chat_template.jinja [INFO|2025-07-07 16:33:23] tokenization_utils_base.py:2525 >> tokenizer config file saved in saves/Gemma-3-1B-Instruct/full/train_2025-07-07-08-57-22/tokenizer_config.json [INFO|2025-07-07 16:33:23] tokenization_utils_base.py:2534 >> Special tokens file saved in saves/Gemma-3-1B-Instruct/full/train_2025-07-07-08-57-22/special_tokens_map.json [WARNING|2025-07-07 16:33:24] logging.py:148 >> No metric eval_loss to plot. [INFO|2025-07-07 16:33:24] modelcard.py:450 >> Dropping the following result as it does not have all the necessary fields: {'task': {'name': 'Causal Language Modeling', 'type': 'text-generation'}}