Instructions to use dimasik87/b2cb65a8-cef7-4a04-8365-2e4f31288630 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use dimasik87/b2cb65a8-cef7-4a04-8365-2e4f31288630 with PEFT:
from peft import PeftModel from transformers import AutoModelForCausalLM base_model = AutoModelForCausalLM.from_pretrained("UCLA-AGI/Gemma-2-9B-It-SPPO-Iter2") model = PeftModel.from_pretrained(base_model, "dimasik87/b2cb65a8-cef7-4a04-8365-2e4f31288630") - Notebooks
- Google Colab
- Kaggle
Download last-checkpoint/trainer_state.json from dimasik87/b2cb65a8-cef7-4a04-8365-2e4f31288630: direct link, hf CLI and curl.
- Browser
- Download file 4.22 kB
-
https://huggingface.co/dimasik87/b2cb65a8-cef7-4a04-8365-2e4f31288630/resolve/main/last-checkpoint/trainer_state.json
- Command line
-
hf download hf://dimasik87/b2cb65a8-cef7-4a04-8365-2e4f31288630/last-checkpoint/trainer_state.json
-
curl -L -o trainer_state.json https://huggingface.co/dimasik87/b2cb65a8-cef7-4a04-8365-2e4f31288630/resolve/main/last-checkpoint/trainer_state.json
4.22 kB
| { | |
| "best_metric": 2.6063930988311768, | |
| "best_model_checkpoint": "miner_id_24/checkpoint-30", | |
| "epoch": 0.00975371860521824, | |
| "eval_steps": 5, | |
| "global_step": 30, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.0003251239535072746, | |
| "eval_loss": 3.9193971157073975, | |
| "eval_runtime": 228.562, | |
| "eval_samples_per_second": 11.336, | |
| "eval_steps_per_second": 2.835, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 0.000975371860521824, | |
| "grad_norm": 1.5996079444885254, | |
| "learning_rate": 0.00012, | |
| "loss": 2.557, | |
| "step": 3 | |
| }, | |
| { | |
| "epoch": 0.0016256197675363732, | |
| "eval_loss": 3.553191900253296, | |
| "eval_runtime": 228.5198, | |
| "eval_samples_per_second": 11.338, | |
| "eval_steps_per_second": 2.836, | |
| "step": 5 | |
| }, | |
| { | |
| "epoch": 0.001950743721043648, | |
| "grad_norm": 2.073932647705078, | |
| "learning_rate": 0.0001992114701314478, | |
| "loss": 2.4685, | |
| "step": 6 | |
| }, | |
| { | |
| "epoch": 0.002926115581565472, | |
| "grad_norm": 1.3495839834213257, | |
| "learning_rate": 0.00018763066800438636, | |
| "loss": 2.2953, | |
| "step": 9 | |
| }, | |
| { | |
| "epoch": 0.0032512395350727465, | |
| "eval_loss": 3.028703212738037, | |
| "eval_runtime": 228.8022, | |
| "eval_samples_per_second": 11.324, | |
| "eval_steps_per_second": 2.832, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.003901487442087296, | |
| "grad_norm": 1.0149577856063843, | |
| "learning_rate": 0.000163742398974869, | |
| "loss": 2.2831, | |
| "step": 12 | |
| }, | |
| { | |
| "epoch": 0.00487685930260912, | |
| "grad_norm": 1.0780360698699951, | |
| "learning_rate": 0.00013090169943749476, | |
| "loss": 2.2027, | |
| "step": 15 | |
| }, | |
| { | |
| "epoch": 0.00487685930260912, | |
| "eval_loss": 2.7850940227508545, | |
| "eval_runtime": 228.566, | |
| "eval_samples_per_second": 11.336, | |
| "eval_steps_per_second": 2.835, | |
| "step": 15 | |
| }, | |
| { | |
| "epoch": 0.005852231163130944, | |
| "grad_norm": 1.1503500938415527, | |
| "learning_rate": 9.372094804706867e-05, | |
| "loss": 2.3607, | |
| "step": 18 | |
| }, | |
| { | |
| "epoch": 0.006502479070145493, | |
| "eval_loss": 2.664445400238037, | |
| "eval_runtime": 229.157, | |
| "eval_samples_per_second": 11.307, | |
| "eval_steps_per_second": 2.828, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.006827603023652768, | |
| "grad_norm": 1.208409309387207, | |
| "learning_rate": 5.7422070843492734e-05, | |
| "loss": 2.3119, | |
| "step": 21 | |
| }, | |
| { | |
| "epoch": 0.007802974884174592, | |
| "grad_norm": 1.367969274520874, | |
| "learning_rate": 2.7103137257858868e-05, | |
| "loss": 2.3106, | |
| "step": 24 | |
| }, | |
| { | |
| "epoch": 0.008128098837681867, | |
| "eval_loss": 2.616642951965332, | |
| "eval_runtime": 228.6629, | |
| "eval_samples_per_second": 11.331, | |
| "eval_steps_per_second": 2.834, | |
| "step": 25 | |
| }, | |
| { | |
| "epoch": 0.008778346744696415, | |
| "grad_norm": 1.717703104019165, | |
| "learning_rate": 7.022351411174866e-06, | |
| "loss": 2.3972, | |
| "step": 27 | |
| }, | |
| { | |
| "epoch": 0.00975371860521824, | |
| "grad_norm": 1.9316027164459229, | |
| "learning_rate": 0.0, | |
| "loss": 2.2749, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.00975371860521824, | |
| "eval_loss": 2.6063930988311768, | |
| "eval_runtime": 228.8831, | |
| "eval_samples_per_second": 11.32, | |
| "eval_steps_per_second": 2.831, | |
| "step": 30 | |
| } | |
| ], | |
| "logging_steps": 3, | |
| "max_steps": 30, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 1, | |
| "save_steps": 10, | |
| "stateful_callbacks": { | |
| "EarlyStoppingCallback": { | |
| "args": { | |
| "early_stopping_patience": 1, | |
| "early_stopping_threshold": 0.0 | |
| }, | |
| "attributes": { | |
| "early_stopping_patience_counter": 0 | |
| } | |
| }, | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 2.470837626077184e+16, | |
| "train_batch_size": 4, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |