{ "run_name": "llama32-1B-sst2-int8-lora-seed42", "model_size": "1B", "model_id": "meta-llama/Llama-3.2-1B", "task": "sst2", "glue_config": "sst2", "n_classes": 2, "bitwidth": "int8", "seed": 42, "lora_init_source": "shared:lora_init_1B_seed42.pt:128tensors", "trainable_params": 3407872, "total_params": 1239222272, "train": { "steps": 936, "epochs": 2.992, "train_runtime_sec": 2875.6240453720093, "train_loss": 0.12485106690571858, "n_train_examples": 20000, "n_train_tokens_per_epoch": 720480, "throughput_samples_per_sec": 20.809396171347814, "throughput_tokens_per_sec": 749.6376876766336 }, "peak_gpu_mem_gib": { "allocated": 2.9748597145080566, "reserved": 6.1640625 }, "validation": { "accuracy": 0.964, "macro_f1": 0.963456080299173, "loss": 0.1228773279953748, "n": 1000, "n_classes": 2, "majority_baseline": 0.56, "pred_dist": { "A": 438, "B": 562 }, "true_dist": { "A": 440, "B": 560 } }, "test": { "accuracy": 0.9541284403669725, "macro_f1": 0.954104296932567, "loss": 0.15973422233305803, "n": 872, "n_classes": 2, "majority_baseline": 0.5091743119266054, "pred_dist": { "A": 424, "B": 448 }, "true_dist": { "A": 428, "B": 444 } }, "hyperparams": { "num_train_epochs": 3, "learning_rate": 0.0002, "max_length": 256, "per_device_train_batch_size": 4, "per_device_eval_batch_size": 8, "gradient_accumulation_steps": 16, "warmup_ratio": 0.03, "lr_scheduler_type": "cosine", "gradient_checkpointing": true }, "lora": { "r": 16, "alpha": 32, "dropout": 0.0, "bias": "none", "target_modules": [ "q_proj", "k_proj", "v_proj", "o_proj" ] }, "env": { "torch": "2.4.1+cu121", "cuda": "12.1", "gpu": "NVIDIA GeForce RTX 4090", "slurm_job": "1930325", "node": "node40" }, "debug_caps": { "max_train": null, "max_eval": null, "max_steps": -1 } }