Instructions to use Incomple/Llama-3.1-8B-Instruct_sft_sg_values_p005_OA_silver with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use Incomple/Llama-3.1-8B-Instruct_sft_sg_values_p005_OA_silver with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("meta-llama/Llama-3.1-8B-Instruct") model = PeftModel.from_pretrained(base_model, "Incomple/Llama-3.1-8B-Instruct_sft_sg_values_p005_OA_silver") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 0.9996440014239943, | |
| "eval_steps": 250, | |
| "global_step": 1404, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.05055179779280883, | |
| "grad_norm": 0.6696942448616028, | |
| "learning_rate": 5.0354609929078e-07, | |
| "loss": 0.436, | |
| "step": 71 | |
| }, | |
| { | |
| "epoch": 0.10110359558561766, | |
| "grad_norm": 1.0538969039916992, | |
| "learning_rate": 9.992082343626285e-07, | |
| "loss": 0.4702, | |
| "step": 142 | |
| }, | |
| { | |
| "epoch": 0.15165539337842648, | |
| "grad_norm": 4.0300822257995605, | |
| "learning_rate": 9.429928741092636e-07, | |
| "loss": 0.3861, | |
| "step": 213 | |
| }, | |
| { | |
| "epoch": 0.17799928800284798, | |
| "eval_loss": 0.33530548214912415, | |
| "eval_runtime": 28.7859, | |
| "eval_samples_per_second": 17.37, | |
| "eval_steps_per_second": 8.685, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.2022071911712353, | |
| "grad_norm": 1.1703342199325562, | |
| "learning_rate": 8.867775138558986e-07, | |
| "loss": 0.3824, | |
| "step": 284 | |
| }, | |
| { | |
| "epoch": 0.25275898896404414, | |
| "grad_norm": 1.0430041551589966, | |
| "learning_rate": 8.305621536025336e-07, | |
| "loss": 0.3494, | |
| "step": 355 | |
| }, | |
| { | |
| "epoch": 0.30331078675685297, | |
| "grad_norm": 1.1387194395065308, | |
| "learning_rate": 7.743467933491686e-07, | |
| "loss": 0.3172, | |
| "step": 426 | |
| }, | |
| { | |
| "epoch": 0.3538625845496618, | |
| "grad_norm": 1.7634204626083374, | |
| "learning_rate": 7.181314330958036e-07, | |
| "loss": 0.3075, | |
| "step": 497 | |
| }, | |
| { | |
| "epoch": 0.35599857600569595, | |
| "eval_loss": 0.21360304951667786, | |
| "eval_runtime": 28.7874, | |
| "eval_samples_per_second": 17.369, | |
| "eval_steps_per_second": 8.684, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.4044143823424706, | |
| "grad_norm": 2.539411783218384, | |
| "learning_rate": 6.619160728424386e-07, | |
| "loss": 0.2562, | |
| "step": 568 | |
| }, | |
| { | |
| "epoch": 0.45496618013527945, | |
| "grad_norm": 1.2169667482376099, | |
| "learning_rate": 6.057007125890736e-07, | |
| "loss": 0.2832, | |
| "step": 639 | |
| }, | |
| { | |
| "epoch": 0.5055179779280883, | |
| "grad_norm": 1.549967646598816, | |
| "learning_rate": 5.494853523357086e-07, | |
| "loss": 0.2606, | |
| "step": 710 | |
| }, | |
| { | |
| "epoch": 0.533997864008544, | |
| "eval_loss": 0.1820104718208313, | |
| "eval_runtime": 28.7804, | |
| "eval_samples_per_second": 17.373, | |
| "eval_steps_per_second": 8.686, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 0.5560697757208971, | |
| "grad_norm": 1.2805540561676025, | |
| "learning_rate": 4.932699920823436e-07, | |
| "loss": 0.2443, | |
| "step": 781 | |
| }, | |
| { | |
| "epoch": 0.6066215735137059, | |
| "grad_norm": 2.841620683670044, | |
| "learning_rate": 4.3705463182897863e-07, | |
| "loss": 0.2421, | |
| "step": 852 | |
| }, | |
| { | |
| "epoch": 0.6571733713065148, | |
| "grad_norm": 1.1338871717453003, | |
| "learning_rate": 3.808392715756136e-07, | |
| "loss": 0.2301, | |
| "step": 923 | |
| }, | |
| { | |
| "epoch": 0.7077251690993236, | |
| "grad_norm": 2.319748878479004, | |
| "learning_rate": 3.246239113222486e-07, | |
| "loss": 0.2404, | |
| "step": 994 | |
| }, | |
| { | |
| "epoch": 0.7119971520113919, | |
| "eval_loss": 0.16689015924930573, | |
| "eval_runtime": 28.7832, | |
| "eval_samples_per_second": 17.371, | |
| "eval_steps_per_second": 8.686, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 0.7582769668921324, | |
| "grad_norm": 1.218746542930603, | |
| "learning_rate": 2.684085510688836e-07, | |
| "loss": 0.2535, | |
| "step": 1065 | |
| }, | |
| { | |
| "epoch": 0.8088287646849412, | |
| "grad_norm": 3.11279296875, | |
| "learning_rate": 2.1219319081551858e-07, | |
| "loss": 0.2323, | |
| "step": 1136 | |
| }, | |
| { | |
| "epoch": 0.8593805624777501, | |
| "grad_norm": 2.013932704925537, | |
| "learning_rate": 1.559778305621536e-07, | |
| "loss": 0.257, | |
| "step": 1207 | |
| }, | |
| { | |
| "epoch": 0.8899964400142399, | |
| "eval_loss": 0.16124244034290314, | |
| "eval_runtime": 28.7354, | |
| "eval_samples_per_second": 17.4, | |
| "eval_steps_per_second": 8.7, | |
| "step": 1250 | |
| }, | |
| { | |
| "epoch": 0.9099323602705589, | |
| "grad_norm": 1.400206446647644, | |
| "learning_rate": 9.976247030878859e-08, | |
| "loss": 0.2368, | |
| "step": 1278 | |
| }, | |
| { | |
| "epoch": 0.9604841580633677, | |
| "grad_norm": 3.216315984725952, | |
| "learning_rate": 4.35471100554236e-08, | |
| "loss": 0.217, | |
| "step": 1349 | |
| }, | |
| { | |
| "epoch": 0.9996440014239943, | |
| "step": 1404, | |
| "total_flos": 1.0823852276239565e+17, | |
| "train_loss": 0.2917507768016935, | |
| "train_runtime": 2474.252, | |
| "train_samples_per_second": 4.541, | |
| "train_steps_per_second": 0.567 | |
| } | |
| ], | |
| "logging_steps": 71, | |
| "max_steps": 1404, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 1, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.0823852276239565e+17, | |
| "train_batch_size": 2, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |