Text Generation
Transformers
PyTorch
TensorBoard
English
hypernetwork
lora
doc-to-lora
perceiver
context-distillation
mistral
ministral
Instructions to use neopolita/doc-to-lora-ministral-3b-2512 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use neopolita/doc-to-lora-ministral-3b-2512 with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("text-generation", model="neopolita/doc-to-lora-ministral-3b-2512")# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("neopolita/doc-to-lora-ministral-3b-2512", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use neopolita/doc-to-lora-ministral-3b-2512 with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "neopolita/doc-to-lora-ministral-3b-2512" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "neopolita/doc-to-lora-ministral-3b-2512", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker
docker model run hf.co/neopolita/doc-to-lora-ministral-3b-2512
- SGLang
How to use neopolita/doc-to-lora-ministral-3b-2512 with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "neopolita/doc-to-lora-ministral-3b-2512" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "neopolita/doc-to-lora-ministral-3b-2512", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "neopolita/doc-to-lora-ministral-3b-2512" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "neopolita/doc-to-lora-ministral-3b-2512", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }' - Docker Model Runner
How to use neopolita/doc-to-lora-ministral-3b-2512 with Docker Model Runner:
docker model run hf.co/neopolita/doc-to-lora-ministral-3b-2512
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 8.163850486431132, | |
| "eval_steps": 1000, | |
| "global_step": 2000, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0, | |
| "gen_lora_l1_norm": 0.0009450324578210711, | |
| "kl_loss": 1.9670246839523315, | |
| "step": 0 | |
| }, | |
| { | |
| "epoch": 0, | |
| "gen_lora_l1_norm": 0.0008100018021650612, | |
| "kl_loss": 1.4670418500900269, | |
| "step": 0 | |
| }, | |
| { | |
| "epoch": 0, | |
| "gen_lora_l1_norm": 0.0006749311578460038, | |
| "kl_loss": 1.3484277725219727, | |
| "step": 0 | |
| }, | |
| { | |
| "epoch": 0, | |
| "gen_lora_l1_norm": 0.000944959232583642, | |
| "kl_loss": 1.4987092018127441, | |
| "step": 0 | |
| }, | |
| { | |
| "epoch": 0, | |
| "gen_lora_l1_norm": 0.0006748694577254355, | |
| "kl_loss": 1.4152668714523315, | |
| "step": 0 | |
| }, | |
| { | |
| "epoch": 0, | |
| "gen_lora_l1_norm": 0.0012147949310019612, | |
| "kl_loss": 2.2377562522888184, | |
| "step": 0 | |
| }, | |
| { | |
| "epoch": 0, | |
| "gen_lora_l1_norm": 0.001215127413161099, | |
| "kl_loss": 2.319751501083374, | |
| "step": 0 | |
| }, | |
| { | |
| "epoch": 0, | |
| "gen_lora_l1_norm": 0.0009449576027691364, | |
| "kl_loss": 1.9499444961547852, | |
| "step": 0 | |
| }, | |
| { | |
| "epoch": 0.00409626216077829, | |
| "grad_norm": 5.8849639892578125, | |
| "learning_rate": 0.0, | |
| "loss": 1.6322, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 0.00409626216077829, | |
| "gen_lora_l1_norm": 0.0006627951515838504, | |
| "kl_loss": 0.882428765296936, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 0.00409626216077829, | |
| "gen_lora_l1_norm": 0.0010608765296638012, | |
| "kl_loss": 1.6865953207015991, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 0.00409626216077829, | |
| "gen_lora_l1_norm": 0.0010608312441036105, | |
| "kl_loss": 2.0317649841308594, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 0.00409626216077829, | |
| "gen_lora_l1_norm": 0.0006628527189604938, | |
| "kl_loss": 1.4127317667007446, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 0.00409626216077829, | |
| "gen_lora_l1_norm": 0.0007955919136293232, | |
| "kl_loss": 1.2892097234725952, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 0.00409626216077829, | |
| "gen_lora_l1_norm": 0.0011936043156310916, | |
| "kl_loss": 2.073559045791626, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 0.00409626216077829, | |
| "gen_lora_l1_norm": 0.0011929516913369298, | |
| "kl_loss": 2.040735960006714, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 0.00409626216077829, | |
| "gen_lora_l1_norm": 0.000795479747466743, | |
| "kl_loss": 1.4581172466278076, | |
| "step": 1 | |
| }, | |
| { | |
| "epoch": 0.409626216077829, | |
| "grad_norm": 1.5062122344970703, | |
| "learning_rate": 3.96e-05, | |
| "loss": 1.3549, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.409626216077829, | |
| "gen_lora_l1_norm": 0.0024223378859460354, | |
| "kl_loss": 1.1542384624481201, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.409626216077829, | |
| "gen_lora_l1_norm": 0.003727049333974719, | |
| "kl_loss": 1.4517877101898193, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.409626216077829, | |
| "gen_lora_l1_norm": 0.0023780318442732096, | |
| "kl_loss": 1.0488699674606323, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.409626216077829, | |
| "gen_lora_l1_norm": 0.002320361090824008, | |
| "kl_loss": 0.9093623161315918, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.409626216077829, | |
| "gen_lora_l1_norm": 0.0022675672080367804, | |
| "kl_loss": 1.0960808992385864, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.409626216077829, | |
| "gen_lora_l1_norm": 0.003854497103020549, | |
| "kl_loss": 1.54759681224823, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.409626216077829, | |
| "gen_lora_l1_norm": 0.0023134942166507244, | |
| "kl_loss": 1.0374772548675537, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.409626216077829, | |
| "gen_lora_l1_norm": 0.002758321352303028, | |
| "kl_loss": 1.3237308263778687, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.819252432155658, | |
| "grad_norm": 0.8856369256973267, | |
| "learning_rate": 3.993659497980699e-05, | |
| "loss": 1.1874, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.819252432155658, | |
| "gen_lora_l1_norm": 0.003160437336191535, | |
| "kl_loss": 1.0348540544509888, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.819252432155658, | |
| "gen_lora_l1_norm": 0.005650285631418228, | |
| "kl_loss": 1.4363867044448853, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.819252432155658, | |
| "gen_lora_l1_norm": 0.0029608134645968676, | |
| "kl_loss": 1.00709867477417, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.819252432155658, | |
| "gen_lora_l1_norm": 0.0032552958000451326, | |
| "kl_loss": 0.9060482978820801, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.819252432155658, | |
| "gen_lora_l1_norm": 0.003243665909394622, | |
| "kl_loss": 1.1517314910888672, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.819252432155658, | |
| "gen_lora_l1_norm": 0.0019695493392646313, | |
| "kl_loss": 0.7201811671257019, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.819252432155658, | |
| "gen_lora_l1_norm": 0.00634480407461524, | |
| "kl_loss": 1.8689466714859009, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.819252432155658, | |
| "gen_lora_l1_norm": 0.003726382739841938, | |
| "kl_loss": 1.060623288154602, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 1.2252944188428059, | |
| "grad_norm": 0.9404332637786865, | |
| "learning_rate": 3.974422423272462e-05, | |
| "loss": 1.1436, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 1.2252944188428059, | |
| "gen_lora_l1_norm": 0.0036873684730380774, | |
| "kl_loss": 0.8932405710220337, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 1.2252944188428059, | |
| "gen_lora_l1_norm": 0.0060583981685340405, | |
| "kl_loss": 1.7955601215362549, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 1.2252944188428059, | |
| "gen_lora_l1_norm": 0.0036672591231763363, | |
| "kl_loss": 0.9144486784934998, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 1.2252944188428059, | |
| "gen_lora_l1_norm": 0.0036556844133883715, | |
| "kl_loss": 1.1638795137405396, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 1.2252944188428059, | |
| "gen_lora_l1_norm": 0.0037340312264859676, | |
| "kl_loss": 1.0955017805099487, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 1.2252944188428059, | |
| "gen_lora_l1_norm": 0.0036459672264754772, | |
| "kl_loss": 1.0169063806533813, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 1.2252944188428059, | |
| "gen_lora_l1_norm": 0.00370018114335835, | |
| "kl_loss": 0.9743473529815674, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 1.2252944188428059, | |
| "gen_lora_l1_norm": 0.006841503549367189, | |
| "kl_loss": 1.3890433311462402, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 1.6349206349206349, | |
| "grad_norm": 0.9483956694602966, | |
| "learning_rate": 3.942412888419724e-05, | |
| "loss": 1.1035, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 1.6349206349206349, | |
| "gen_lora_l1_norm": 0.004309813026338816, | |
| "kl_loss": 0.96443772315979, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 1.6349206349206349, | |
| "gen_lora_l1_norm": 0.006539575755596161, | |
| "kl_loss": 1.54787278175354, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 1.6349206349206349, | |
| "gen_lora_l1_norm": 0.004349768161773682, | |
| "kl_loss": 1.1423686742782593, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 1.6349206349206349, | |
| "gen_lora_l1_norm": 0.005183862056583166, | |
| "kl_loss": 1.3069700002670288, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 1.6349206349206349, | |
| "gen_lora_l1_norm": 0.004366028122603893, | |
| "kl_loss": 0.9700032472610474, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 1.6349206349206349, | |
| "gen_lora_l1_norm": 0.004371432587504387, | |
| "kl_loss": 0.8293535113334656, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 1.6349206349206349, | |
| "gen_lora_l1_norm": 0.0036595307756215334, | |
| "kl_loss": 1.2910619974136353, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 1.6349206349206349, | |
| "gen_lora_l1_norm": 0.004372357856482267, | |
| "kl_loss": 0.9109727740287781, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 2.040962621607783, | |
| "grad_norm": 0.913838803768158, | |
| "learning_rate": 3.8978384875390766e-05, | |
| "loss": 1.0673, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 2.040962621607783, | |
| "gen_lora_l1_norm": 0.00400135712698102, | |
| "kl_loss": 0.7898850440979004, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 2.040962621607783, | |
| "gen_lora_l1_norm": 0.00573880085721612, | |
| "kl_loss": 1.0935029983520508, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 2.040962621607783, | |
| "gen_lora_l1_norm": 0.004075320437550545, | |
| "kl_loss": 0.7592037916183472, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 2.040962621607783, | |
| "gen_lora_l1_norm": 0.007495749741792679, | |
| "kl_loss": 1.3880740404129028, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 2.040962621607783, | |
| "gen_lora_l1_norm": 0.0047694905661046505, | |
| "kl_loss": 0.9538154602050781, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 2.040962621607783, | |
| "gen_lora_l1_norm": 0.004024278372526169, | |
| "kl_loss": 1.0414124727249146, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 2.040962621607783, | |
| "gen_lora_l1_norm": 0.005740255583077669, | |
| "kl_loss": 1.3348419666290283, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 2.040962621607783, | |
| "gen_lora_l1_norm": 0.004882144276052713, | |
| "kl_loss": 1.056125283241272, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 2.4505888376856118, | |
| "grad_norm": 0.9659350514411926, | |
| "learning_rate": 3.840988302724834e-05, | |
| "loss": 1.0139, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 2.4505888376856118, | |
| "gen_lora_l1_norm": 0.005276651121675968, | |
| "kl_loss": 1.2098764181137085, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 2.4505888376856118, | |
| "gen_lora_l1_norm": 0.005354944616556168, | |
| "kl_loss": 1.2536226511001587, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 2.4505888376856118, | |
| "gen_lora_l1_norm": 0.006087795365601778, | |
| "kl_loss": 1.4725929498672485, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 2.4505888376856118, | |
| "gen_lora_l1_norm": 0.004386508837342262, | |
| "kl_loss": 0.6955914497375488, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 2.4505888376856118, | |
| "gen_lora_l1_norm": 0.006141394842416048, | |
| "kl_loss": 1.1263651847839355, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 2.4505888376856118, | |
| "gen_lora_l1_norm": 0.0034647039137780666, | |
| "kl_loss": 0.9702500700950623, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 2.4505888376856118, | |
| "gen_lora_l1_norm": 0.005230437032878399, | |
| "kl_loss": 1.1107494831085205, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 2.4505888376856118, | |
| "gen_lora_l1_norm": 0.0052700042724609375, | |
| "kl_loss": 0.9291554689407349, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 2.860215053763441, | |
| "grad_norm": 0.8220306038856506, | |
| "learning_rate": 3.772231029240728e-05, | |
| "loss": 1.0036, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 2.860215053763441, | |
| "gen_lora_l1_norm": 0.006512848194688559, | |
| "kl_loss": 1.1565109491348267, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 2.860215053763441, | |
| "gen_lora_l1_norm": 0.00398235023021698, | |
| "kl_loss": 0.7244017124176025, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 2.860215053763441, | |
| "gen_lora_l1_norm": 0.003980782348662615, | |
| "kl_loss": 0.7359597086906433, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 2.860215053763441, | |
| "gen_lora_l1_norm": 0.006494825705885887, | |
| "kl_loss": 1.1472868919372559, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 2.860215053763441, | |
| "gen_lora_l1_norm": 0.004660531412810087, | |
| "kl_loss": 0.7635590434074402, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 2.860215053763441, | |
| "gen_lora_l1_norm": 0.005749559495598078, | |
| "kl_loss": 0.9587411880493164, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 2.860215053763441, | |
| "gen_lora_l1_norm": 0.0039028008468449116, | |
| "kl_loss": 0.5627914071083069, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 2.860215053763441, | |
| "gen_lora_l1_norm": 0.007235225290060043, | |
| "kl_loss": 1.289211630821228, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 3.266257040450589, | |
| "grad_norm": 0.9872245788574219, | |
| "learning_rate": 3.692012584389641e-05, | |
| "loss": 0.9615, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 3.266257040450589, | |
| "gen_lora_l1_norm": 0.005679607857018709, | |
| "kl_loss": 0.8019008040428162, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 3.266257040450589, | |
| "gen_lora_l1_norm": 0.00867470819503069, | |
| "kl_loss": 1.5495558977127075, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 3.266257040450589, | |
| "gen_lora_l1_norm": 0.00566524313762784, | |
| "kl_loss": 0.9215335249900818, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 3.266257040450589, | |
| "gen_lora_l1_norm": 0.005784123670309782, | |
| "kl_loss": 1.0987138748168945, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 3.266257040450589, | |
| "gen_lora_l1_norm": 0.004819593392312527, | |
| "kl_loss": 0.9064775705337524, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 3.266257040450589, | |
| "gen_lora_l1_norm": 0.004847296047955751, | |
| "kl_loss": 0.8540226221084595, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 3.266257040450589, | |
| "gen_lora_l1_norm": 0.0028415124397724867, | |
| "kl_loss": 0.5352403521537781, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 3.266257040450589, | |
| "gen_lora_l1_norm": 0.005715073551982641, | |
| "kl_loss": 0.9670476317405701, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 3.675883256528418, | |
| "grad_norm": 0.8288973569869995, | |
| "learning_rate": 3.600853215568783e-05, | |
| "loss": 0.943, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 3.675883256528418, | |
| "gen_lora_l1_norm": 0.005058944225311279, | |
| "kl_loss": 0.8599977493286133, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 3.675883256528418, | |
| "gen_lora_l1_norm": 0.003312613582238555, | |
| "kl_loss": 0.5305082201957703, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 3.675883256528418, | |
| "gen_lora_l1_norm": 0.004963682033121586, | |
| "kl_loss": 0.8053346872329712, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 3.675883256528418, | |
| "gen_lora_l1_norm": 0.008336002007126808, | |
| "kl_loss": 1.3062776327133179, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 3.675883256528418, | |
| "gen_lora_l1_norm": 0.003407533746212721, | |
| "kl_loss": 0.5421016812324524, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 3.675883256528418, | |
| "gen_lora_l1_norm": 0.005902859847992659, | |
| "kl_loss": 0.8554947376251221, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 3.675883256528418, | |
| "gen_lora_l1_norm": 0.006641158368438482, | |
| "kl_loss": 1.0285379886627197, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 3.675883256528418, | |
| "gen_lora_l1_norm": 0.006653614342212677, | |
| "kl_loss": 1.1064549684524536, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 4.081925243215566, | |
| "grad_norm": 0.8488938212394714, | |
| "learning_rate": 3.4993441262656855e-05, | |
| "loss": 0.9306, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 4.081925243215566, | |
| "gen_lora_l1_norm": 0.0063158622942864895, | |
| "kl_loss": 1.0323044061660767, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 4.081925243215566, | |
| "gen_lora_l1_norm": 0.005288965534418821, | |
| "kl_loss": 0.9123396277427673, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 4.081925243215566, | |
| "gen_lora_l1_norm": 0.007021934259682894, | |
| "kl_loss": 1.2289979457855225, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 4.081925243215566, | |
| "gen_lora_l1_norm": 0.004434657283127308, | |
| "kl_loss": 0.6297166347503662, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 4.081925243215566, | |
| "gen_lora_l1_norm": 0.0062640998512506485, | |
| "kl_loss": 0.87335205078125, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 4.081925243215566, | |
| "gen_lora_l1_norm": 0.006173320114612579, | |
| "kl_loss": 1.0595030784606934, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 4.081925243215566, | |
| "gen_lora_l1_norm": 0.004389672074466944, | |
| "kl_loss": 0.9129109978675842, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 4.081925243215566, | |
| "gen_lora_l1_norm": 0.005336695350706577, | |
| "kl_loss": 0.8544352650642395, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 4.491551459293395, | |
| "grad_norm": 1.0402995347976685, | |
| "learning_rate": 3.388143641876722e-05, | |
| "loss": 0.893, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 4.491551459293395, | |
| "gen_lora_l1_norm": 0.005088108591735363, | |
| "kl_loss": 0.7836450934410095, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 4.491551459293395, | |
| "gen_lora_l1_norm": 0.0058727264404296875, | |
| "kl_loss": 1.112564206123352, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 4.491551459293395, | |
| "gen_lora_l1_norm": 0.005110675003379583, | |
| "kl_loss": 0.8472089171409607, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 4.491551459293395, | |
| "gen_lora_l1_norm": 0.00756491906940937, | |
| "kl_loss": 1.2870409488677979, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 4.491551459293395, | |
| "gen_lora_l1_norm": 0.005813497118651867, | |
| "kl_loss": 0.8126645088195801, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 4.491551459293395, | |
| "gen_lora_l1_norm": 0.005063503514975309, | |
| "kl_loss": 0.7830013632774353, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 4.491551459293395, | |
| "gen_lora_l1_norm": 0.005011106375604868, | |
| "kl_loss": 0.6727309823036194, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 4.491551459293395, | |
| "gen_lora_l1_norm": 0.005923309829086065, | |
| "kl_loss": 0.9664289951324463, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 4.9011776753712235, | |
| "grad_norm": 0.739378809928894, | |
| "learning_rate": 3.2679729402142936e-05, | |
| "loss": 0.8903, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 4.9011776753712235, | |
| "gen_lora_l1_norm": 0.006895941682159901, | |
| "kl_loss": 1.0187008380889893, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 4.9011776753712235, | |
| "gen_lora_l1_norm": 0.004825454670935869, | |
| "kl_loss": 0.9115042090415955, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 4.9011776753712235, | |
| "gen_lora_l1_norm": 0.005780168808996677, | |
| "kl_loss": 0.842981219291687, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 4.9011776753712235, | |
| "gen_lora_l1_norm": 0.004841691814363003, | |
| "kl_loss": 0.8760895133018494, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 4.9011776753712235, | |
| "gen_lora_l1_norm": 0.006873840931802988, | |
| "kl_loss": 0.814231812953949, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 4.9011776753712235, | |
| "gen_lora_l1_norm": 0.005846262443810701, | |
| "kl_loss": 0.9176366925239563, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 4.9011776753712235, | |
| "gen_lora_l1_norm": 0.005770170129835606, | |
| "kl_loss": 0.8854969143867493, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 4.9011776753712235, | |
| "gen_lora_l1_norm": 0.00489039858803153, | |
| "kl_loss": 0.7039180397987366, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 5.307219662058372, | |
| "grad_norm": 0.7784672379493713, | |
| "learning_rate": 3.1396113743919735e-05, | |
| "loss": 0.8648, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 5.307219662058372, | |
| "gen_lora_l1_norm": 0.0047719781287014484, | |
| "kl_loss": 0.7648003101348877, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 5.307219662058372, | |
| "gen_lora_l1_norm": 0.003766432171687484, | |
| "kl_loss": 0.6126774549484253, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 5.307219662058372, | |
| "gen_lora_l1_norm": 0.004756519105285406, | |
| "kl_loss": 0.8055700063705444, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 5.307219662058372, | |
| "gen_lora_l1_norm": 0.005722552537918091, | |
| "kl_loss": 0.8756625056266785, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 5.307219662058372, | |
| "gen_lora_l1_norm": 0.0077483635395765305, | |
| "kl_loss": 1.2190642356872559, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 5.307219662058372, | |
| "gen_lora_l1_norm": 0.006770019419491291, | |
| "kl_loss": 0.859339714050293, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 5.307219662058372, | |
| "gen_lora_l1_norm": 0.006663700565695763, | |
| "kl_loss": 0.8178507685661316, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 5.307219662058372, | |
| "gen_lora_l1_norm": 0.00652681989595294, | |
| "kl_loss": 0.9895569682121277, | |
| "step": 1300 | |
| }, | |
| { | |
| "epoch": 5.7168458781362, | |
| "grad_norm": 0.7924196124076843, | |
| "learning_rate": 3.0038914184205054e-05, | |
| "loss": 0.8527, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 5.7168458781362, | |
| "gen_lora_l1_norm": 0.006386639550328255, | |
| "kl_loss": 0.8087752461433411, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 5.7168458781362, | |
| "gen_lora_l1_norm": 0.007356449496001005, | |
| "kl_loss": 1.0484181642532349, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 5.7168458781362, | |
| "gen_lora_l1_norm": 0.005254456773400307, | |
| "kl_loss": 0.7177881002426147, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 5.7168458781362, | |
| "gen_lora_l1_norm": 0.005261494778096676, | |
| "kl_loss": 0.831645667552948, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 5.7168458781362, | |
| "gen_lora_l1_norm": 0.005473623983561993, | |
| "kl_loss": 0.7959176301956177, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 5.7168458781362, | |
| "gen_lora_l1_norm": 0.0036497025284916162, | |
| "kl_loss": 0.6150949597358704, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 5.7168458781362, | |
| "gen_lora_l1_norm": 0.0064110904932022095, | |
| "kl_loss": 1.0256494283676147, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 5.7168458781362, | |
| "gen_lora_l1_norm": 0.007067318074405193, | |
| "kl_loss": 0.955165445804596, | |
| "step": 1400 | |
| }, | |
| { | |
| "epoch": 6.1228878648233485, | |
| "grad_norm": 0.6397759914398193, | |
| "learning_rate": 2.8616932682943988e-05, | |
| "loss": 0.852, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 6.1228878648233485, | |
| "gen_lora_l1_norm": 0.008255833759903908, | |
| "kl_loss": 0.8871062994003296, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 6.1228878648233485, | |
| "gen_lora_l1_norm": 0.0046221106313169, | |
| "kl_loss": 0.7383583188056946, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 6.1228878648233485, | |
| "gen_lora_l1_norm": 0.005553186405450106, | |
| "kl_loss": 0.8419104814529419, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 6.1228878648233485, | |
| "gen_lora_l1_norm": 0.005321306176483631, | |
| "kl_loss": 0.7598411440849304, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 6.1228878648233485, | |
| "gen_lora_l1_norm": 0.00269288825802505, | |
| "kl_loss": 0.6028131246566772, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 6.1228878648233485, | |
| "gen_lora_l1_norm": 0.0055070980452001095, | |
| "kl_loss": 0.8083575367927551, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 6.1228878648233485, | |
| "gen_lora_l1_norm": 0.008899664506316185, | |
| "kl_loss": 1.1943026781082153, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 6.1228878648233485, | |
| "gen_lora_l1_norm": 0.005438453052192926, | |
| "kl_loss": 0.7275933027267456, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 6.532514080901178, | |
| "grad_norm": 0.7557854652404785, | |
| "learning_rate": 2.7139391335831408e-05, | |
| "loss": 0.8264, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 6.532514080901178, | |
| "gen_lora_l1_norm": 0.007023604586720467, | |
| "kl_loss": 0.9664676785469055, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 6.532514080901178, | |
| "gen_lora_l1_norm": 0.00719774654135108, | |
| "kl_loss": 0.9780440330505371, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 6.532514080901178, | |
| "gen_lora_l1_norm": 0.004927169531583786, | |
| "kl_loss": 0.798747181892395, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 6.532514080901178, | |
| "gen_lora_l1_norm": 0.004025702830404043, | |
| "kl_loss": 0.52028489112854, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 6.532514080901178, | |
| "gen_lora_l1_norm": 0.005031155422329903, | |
| "kl_loss": 0.5931271314620972, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 6.532514080901178, | |
| "gen_lora_l1_norm": 0.007145529147237539, | |
| "kl_loss": 1.088820457458496, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 6.532514080901178, | |
| "gen_lora_l1_norm": 0.005066295620054007, | |
| "kl_loss": 0.7168907523155212, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 6.532514080901178, | |
| "gen_lora_l1_norm": 0.006241162307560444, | |
| "kl_loss": 0.862785816192627, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 6.942140296979007, | |
| "grad_norm": 0.8364638090133667, | |
| "learning_rate": 2.5615872565482628e-05, | |
| "loss": 0.8265, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 6.942140296979007, | |
| "gen_lora_l1_norm": 0.006142236292362213, | |
| "kl_loss": 0.7840186357498169, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 6.942140296979007, | |
| "gen_lora_l1_norm": 0.005300813354551792, | |
| "kl_loss": 0.7324821949005127, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 6.942140296979007, | |
| "gen_lora_l1_norm": 0.005334603134542704, | |
| "kl_loss": 0.5814743638038635, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 6.942140296979007, | |
| "gen_lora_l1_norm": 0.0044036125764250755, | |
| "kl_loss": 0.5474105477333069, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 6.942140296979007, | |
| "gen_lora_l1_norm": 0.006294688675552607, | |
| "kl_loss": 0.9389643669128418, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 6.942140296979007, | |
| "gen_lora_l1_norm": 0.007115781307220459, | |
| "kl_loss": 1.0902011394500732, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 6.942140296979007, | |
| "gen_lora_l1_norm": 0.008024205453693867, | |
| "kl_loss": 0.9837476015090942, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 6.942140296979007, | |
| "gen_lora_l1_norm": 0.0043613845482468605, | |
| "kl_loss": 0.4897172749042511, | |
| "step": 1700 | |
| }, | |
| { | |
| "epoch": 7.348182283666155, | |
| "grad_norm": 0.8403913378715515, | |
| "learning_rate": 2.4056256975745616e-05, | |
| "loss": 0.8077, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 7.348182283666155, | |
| "gen_lora_l1_norm": 0.0063985614106059074, | |
| "kl_loss": 0.8808446526527405, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 7.348182283666155, | |
| "gen_lora_l1_norm": 0.005525672342628241, | |
| "kl_loss": 0.39164769649505615, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 7.348182283666155, | |
| "gen_lora_l1_norm": 0.005369570571929216, | |
| "kl_loss": 0.8665382862091064, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 7.348182283666155, | |
| "gen_lora_l1_norm": 0.0043634455651044846, | |
| "kl_loss": 0.6645538210868835, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 7.348182283666155, | |
| "gen_lora_l1_norm": 0.005280856043100357, | |
| "kl_loss": 0.7877609133720398, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 7.348182283666155, | |
| "gen_lora_l1_norm": 0.006480993703007698, | |
| "kl_loss": 0.9564159512519836, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 7.348182283666155, | |
| "gen_lora_l1_norm": 0.007332190405577421, | |
| "kl_loss": 1.0270859003067017, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 7.348182283666155, | |
| "gen_lora_l1_norm": 0.005611190106719732, | |
| "kl_loss": 0.6227574944496155, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 7.757808499743984, | |
| "grad_norm": 0.8394021987915039, | |
| "learning_rate": 2.2470659272193576e-05, | |
| "loss": 0.8058, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 7.757808499743984, | |
| "gen_lora_l1_norm": 0.005510126240551472, | |
| "kl_loss": 0.5301260352134705, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 7.757808499743984, | |
| "gen_lora_l1_norm": 0.007134293671697378, | |
| "kl_loss": 0.9012577533721924, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 7.757808499743984, | |
| "gen_lora_l1_norm": 0.00519017456099391, | |
| "kl_loss": 0.8041582703590393, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 7.757808499743984, | |
| "gen_lora_l1_norm": 0.0068168723955750465, | |
| "kl_loss": 1.039772868156433, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 7.757808499743984, | |
| "gen_lora_l1_norm": 0.004526233766227961, | |
| "kl_loss": 0.5446096658706665, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 7.757808499743984, | |
| "gen_lora_l1_norm": 0.006199303548783064, | |
| "kl_loss": 0.7743979096412659, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 7.757808499743984, | |
| "gen_lora_l1_norm": 0.00528148515149951, | |
| "kl_loss": 0.7872158885002136, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 7.757808499743984, | |
| "gen_lora_l1_norm": 0.005385056138038635, | |
| "kl_loss": 0.8253178000450134, | |
| "step": 1900 | |
| }, | |
| { | |
| "epoch": 8.163850486431132, | |
| "grad_norm": 0.5366804003715515, | |
| "learning_rate": 2.0869362664377956e-05, | |
| "loss": 0.7993, | |
| "step": 2000 | |
| } | |
| ], | |
| "logging_steps": 100, | |
| "max_steps": 4000, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 17, | |
| "save_steps": 250, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 0.0, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |