Image-Text-to-Text
Transformers
Safetensors
qwen3_5
education
k-12
tutoring
curriculum-grounding
multimodal
instruction-tuning
llama-factory
full
conversational
Instructions to use lhpku20010120/Omni-Edu-27B with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use lhpku20010120/Omni-Edu-27B with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("image-text-to-text", model="lhpku20010120/Omni-Edu-27B") messages = [ { "role": "user", "content": [ {"type": "image", "url": "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/p-blog/candy.JPG"}, {"type": "text", "text": "What animal is on the candy?"} ] }, ] pipe(text=messages)# pip install -U transformers accelerate # Load model directly from transformers import AutoProcessor, AutoModelForMultimodalLM processor = AutoProcessor.from_pretrained("lhpku20010120/Omni-Edu-27B") model = AutoModelForMultimodalLM.from_pretrained("lhpku20010120/Omni-Edu-27B", device_map="auto") messages = [ { "role": "user", "content": [ {"type": "image", "url": "https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/p-blog/candy.JPG"}, {"type": "text", "text": "What animal is on the candy?"} ] }, ] inputs = processor.apply_chat_template( messages, add_generation_prompt=True, tokenize=True, return_dict=True, return_tensors="pt", ).to(model.device) outputs = model.generate(**inputs, max_new_tokens=256) print(processor.decode(outputs[0][inputs["input_ids"].shape[-1]:])) - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use lhpku20010120/Omni-Edu-27B with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "lhpku20010120/Omni-Edu-27B" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "lhpku20010120/Omni-Edu-27B", "messages": [ { "role": "user", "content": [ { "type": "text", "text": "Describe this image in one sentence." }, { "type": "image_url", "image_url": { "url": "https://cdn.britannica.com/61/93061-050-99147DCE/Statue-of-Liberty-Island-New-York-Bay.jpg" } } ] } ] }'Use Docker
docker model run hf.co/lhpku20010120/Omni-Edu-27B
- SGLang
How to use lhpku20010120/Omni-Edu-27B with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "lhpku20010120/Omni-Edu-27B" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "lhpku20010120/Omni-Edu-27B", "messages": [ { "role": "user", "content": [ { "type": "text", "text": "Describe this image in one sentence." }, { "type": "image_url", "image_url": { "url": "https://cdn.britannica.com/61/93061-050-99147DCE/Statue-of-Liberty-Island-New-York-Bay.jpg" } } ] } ] }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "lhpku20010120/Omni-Edu-27B" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/chat/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "lhpku20010120/Omni-Edu-27B", "messages": [ { "role": "user", "content": [ { "type": "text", "text": "Describe this image in one sentence." }, { "type": "image_url", "image_url": { "url": "https://cdn.britannica.com/61/93061-050-99147DCE/Statue-of-Liberty-Island-New-York-Bay.jpg" } } ] } ] }' - Docker Model Runner
How to use lhpku20010120/Omni-Edu-27B with Docker Model Runner:
docker model run hf.co/lhpku20010120/Omni-Edu-27B
Download trainer_state.json from lhpku20010120/Omni-Edu-27B: direct link, hf CLI and curl.
- Browser
- Download file 22.7 kB
-
https://huggingface.co/lhpku20010120/Omni-Edu-27B/resolve/main/trainer_state.json
- Command line
-
hf download hf://lhpku20010120/Omni-Edu-27B/trainer_state.json
-
curl -L -o trainer_state.json https://huggingface.co/lhpku20010120/Omni-Edu-27B/resolve/main/trainer_state.json
22.7 kB
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 3.0, | |
| "eval_steps": 500, | |
| "global_step": 1173, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.02560819462227913, | |
| "grad_norm": 153.27353844409606, | |
| "learning_rate": 3.813559322033899e-07, | |
| "loss": 3.8572372436523437, | |
| "step": 10 | |
| }, | |
| { | |
| "epoch": 0.05121638924455826, | |
| "grad_norm": 62.84922969850834, | |
| "learning_rate": 8.050847457627118e-07, | |
| "loss": 2.2734893798828124, | |
| "step": 20 | |
| }, | |
| { | |
| "epoch": 0.07682458386683738, | |
| "grad_norm": 3.769755503119313, | |
| "learning_rate": 1.228813559322034e-06, | |
| "loss": 1.0895769119262695, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.10243277848911651, | |
| "grad_norm": 3.768827465389587, | |
| "learning_rate": 1.652542372881356e-06, | |
| "loss": 0.8416604995727539, | |
| "step": 40 | |
| }, | |
| { | |
| "epoch": 0.12804097311139565, | |
| "grad_norm": 2.969249061223776, | |
| "learning_rate": 2.076271186440678e-06, | |
| "loss": 0.8005556106567383, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.15364916773367476, | |
| "grad_norm": 2.7063121167829647, | |
| "learning_rate": 2.5e-06, | |
| "loss": 0.7322915077209473, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.1792573623559539, | |
| "grad_norm": 2.688546185338879, | |
| "learning_rate": 2.9237288135593224e-06, | |
| "loss": 0.7061005592346191, | |
| "step": 70 | |
| }, | |
| { | |
| "epoch": 0.20486555697823303, | |
| "grad_norm": 2.3050951641216195, | |
| "learning_rate": 3.347457627118644e-06, | |
| "loss": 0.6749155521392822, | |
| "step": 80 | |
| }, | |
| { | |
| "epoch": 0.23047375160051217, | |
| "grad_norm": 2.397583668512051, | |
| "learning_rate": 3.7711864406779664e-06, | |
| "loss": 0.6868059635162354, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.2560819462227913, | |
| "grad_norm": 2.1188614813401947, | |
| "learning_rate": 4.1949152542372886e-06, | |
| "loss": 0.6494926452636719, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.28169014084507044, | |
| "grad_norm": 1.9182639067325302, | |
| "learning_rate": 4.618644067796611e-06, | |
| "loss": 0.6528633117675782, | |
| "step": 110 | |
| }, | |
| { | |
| "epoch": 0.3072983354673495, | |
| "grad_norm": 2.3510511774564984, | |
| "learning_rate": 4.999988915795796e-06, | |
| "loss": 0.6406693935394288, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 0.33290653008962867, | |
| "grad_norm": 1.7556549500773726, | |
| "learning_rate": 4.998658930215192e-06, | |
| "loss": 0.6446515083312988, | |
| "step": 130 | |
| }, | |
| { | |
| "epoch": 0.3585147247119078, | |
| "grad_norm": 1.9426400389564613, | |
| "learning_rate": 4.995113455052006e-06, | |
| "loss": 0.6290643692016602, | |
| "step": 140 | |
| }, | |
| { | |
| "epoch": 0.38412291933418696, | |
| "grad_norm": 1.7703216191172428, | |
| "learning_rate": 4.989355633977907e-06, | |
| "loss": 0.6318723201751709, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.40973111395646605, | |
| "grad_norm": 2.016415622632667, | |
| "learning_rate": 4.98139057228856e-06, | |
| "loss": 0.6556029319763184, | |
| "step": 160 | |
| }, | |
| { | |
| "epoch": 0.4353393085787452, | |
| "grad_norm": 1.5699072387850665, | |
| "learning_rate": 4.971225332376911e-06, | |
| "loss": 0.63431396484375, | |
| "step": 170 | |
| }, | |
| { | |
| "epoch": 0.46094750320102434, | |
| "grad_norm": 2.239251081154673, | |
| "learning_rate": 4.958868927471157e-06, | |
| "loss": 0.6408280849456787, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 0.48655569782330343, | |
| "grad_norm": 2.0878104001839146, | |
| "learning_rate": 4.9443323136429785e-06, | |
| "loss": 0.6308846950531006, | |
| "step": 190 | |
| }, | |
| { | |
| "epoch": 0.5121638924455826, | |
| "grad_norm": 2.2472375041536004, | |
| "learning_rate": 4.927628380093106e-06, | |
| "loss": 0.615133810043335, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.5377720870678617, | |
| "grad_norm": 2.004422315809482, | |
| "learning_rate": 4.908771937722826e-06, | |
| "loss": 0.6189337253570557, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 0.5633802816901409, | |
| "grad_norm": 1.6889300859400525, | |
| "learning_rate": 4.887779706001584e-06, | |
| "loss": 0.6117790699005127, | |
| "step": 220 | |
| }, | |
| { | |
| "epoch": 0.58898847631242, | |
| "grad_norm": 1.9793492599080436, | |
| "learning_rate": 4.864670298142303e-06, | |
| "loss": 0.6184802055358887, | |
| "step": 230 | |
| }, | |
| { | |
| "epoch": 0.614596670934699, | |
| "grad_norm": 2.5379805741664474, | |
| "learning_rate": 4.839464204597583e-06, | |
| "loss": 0.6326601028442382, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 0.6402048655569782, | |
| "grad_norm": 1.9814471712083004, | |
| "learning_rate": 4.812183774891399e-06, | |
| "loss": 0.6044825553894043, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.6658130601792573, | |
| "grad_norm": 1.8113978894906593, | |
| "learning_rate": 4.782853197802417e-06, | |
| "loss": 0.5929990768432617, | |
| "step": 260 | |
| }, | |
| { | |
| "epoch": 0.6914212548015365, | |
| "grad_norm": 3.1268021252532368, | |
| "learning_rate": 4.751498479916491e-06, | |
| "loss": 0.6360932350158691, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 0.7170294494238156, | |
| "grad_norm": 1.9250603910066866, | |
| "learning_rate": 4.718147422567369e-06, | |
| "loss": 0.6308783531188965, | |
| "step": 280 | |
| }, | |
| { | |
| "epoch": 0.7426376440460948, | |
| "grad_norm": 5.456601410435929, | |
| "learning_rate": 4.682829597186042e-06, | |
| "loss": 0.603580093383789, | |
| "step": 290 | |
| }, | |
| { | |
| "epoch": 0.7682458386683739, | |
| "grad_norm": 2.635604582868932, | |
| "learning_rate": 4.645576319080602e-06, | |
| "loss": 0.5843267917633057, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.793854033290653, | |
| "grad_norm": 1.637348960037048, | |
| "learning_rate": 4.6064206196698455e-06, | |
| "loss": 0.6101377010345459, | |
| "step": 310 | |
| }, | |
| { | |
| "epoch": 0.8194622279129321, | |
| "grad_norm": 1.9754353692781474, | |
| "learning_rate": 4.565397217195265e-06, | |
| "loss": 0.6075271606445313, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 0.8450704225352113, | |
| "grad_norm": 1.9177531304969357, | |
| "learning_rate": 4.522542485937369e-06, | |
| "loss": 0.5996335029602051, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 0.8706786171574904, | |
| "grad_norm": 1.6323748268838112, | |
| "learning_rate": 4.477894423963649e-06, | |
| "loss": 0.6118486404418946, | |
| "step": 340 | |
| }, | |
| { | |
| "epoch": 0.8962868117797695, | |
| "grad_norm": 3.2851900535885825, | |
| "learning_rate": 4.431492619436773e-06, | |
| "loss": 0.5790205478668213, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 0.9218950064020487, | |
| "grad_norm": 1.3826502268499234, | |
| "learning_rate": 4.383378215512897e-06, | |
| "loss": 0.5924504280090332, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 0.9475032010243278, | |
| "grad_norm": 1.7371358238499215, | |
| "learning_rate": 4.3335938738611975e-06, | |
| "loss": 0.5803703308105469, | |
| "step": 370 | |
| }, | |
| { | |
| "epoch": 0.9731113956466069, | |
| "grad_norm": 1.6403188302203746, | |
| "learning_rate": 4.282183736836986e-06, | |
| "loss": 0.5972010612487793, | |
| "step": 380 | |
| }, | |
| { | |
| "epoch": 0.998719590268886, | |
| "grad_norm": 1.7967294815797543, | |
| "learning_rate": 4.2291933883419475e-06, | |
| "loss": 0.58817458152771, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 1.0230473751600513, | |
| "grad_norm": 1.2748852269941406, | |
| "learning_rate": 4.174669813406193e-06, | |
| "loss": 0.45647602081298827, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 1.0486555697823303, | |
| "grad_norm": 1.7376323194697032, | |
| "learning_rate": 4.1186613565279676e-06, | |
| "loss": 0.4439413547515869, | |
| "step": 410 | |
| }, | |
| { | |
| "epoch": 1.0742637644046096, | |
| "grad_norm": 128.16545373945706, | |
| "learning_rate": 4.061217678807974e-06, | |
| "loss": 0.4280103206634521, | |
| "step": 420 | |
| }, | |
| { | |
| "epoch": 1.0998719590268886, | |
| "grad_norm": 2.4950762574929937, | |
| "learning_rate": 4.002389713916284e-06, | |
| "loss": 0.40707979202270506, | |
| "step": 430 | |
| }, | |
| { | |
| "epoch": 1.1254801536491676, | |
| "grad_norm": 1.8159106917780825, | |
| "learning_rate": 3.942229622930907e-06, | |
| "loss": 0.427966833114624, | |
| "step": 440 | |
| }, | |
| { | |
| "epoch": 1.151088348271447, | |
| "grad_norm": 1.3816936430810876, | |
| "learning_rate": 3.880790748088056e-06, | |
| "loss": 0.41638803482055664, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 1.176696542893726, | |
| "grad_norm": 2.094197479970244, | |
| "learning_rate": 3.8181275654851016e-06, | |
| "loss": 0.43572521209716797, | |
| "step": 460 | |
| }, | |
| { | |
| "epoch": 1.2023047375160052, | |
| "grad_norm": 1.9555639459737928, | |
| "learning_rate": 3.7542956367781734e-06, | |
| "loss": 0.41444945335388184, | |
| "step": 470 | |
| }, | |
| { | |
| "epoch": 1.2279129321382842, | |
| "grad_norm": 1.4337283127736087, | |
| "learning_rate": 3.689351559917227e-06, | |
| "loss": 0.4294303894042969, | |
| "step": 480 | |
| }, | |
| { | |
| "epoch": 1.2535211267605635, | |
| "grad_norm": 2.0361282406298375, | |
| "learning_rate": 3.6233529189622536e-06, | |
| "loss": 0.43240156173706057, | |
| "step": 490 | |
| }, | |
| { | |
| "epoch": 1.2791293213828425, | |
| "grad_norm": 1.9209819867622855, | |
| "learning_rate": 3.556358233025138e-06, | |
| "loss": 0.44815425872802733, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 1.3047375160051216, | |
| "grad_norm": 1.6712515877306602, | |
| "learning_rate": 3.4884269043824342e-06, | |
| "loss": 0.405930233001709, | |
| "step": 510 | |
| }, | |
| { | |
| "epoch": 1.3303457106274008, | |
| "grad_norm": 1.800941360824222, | |
| "learning_rate": 3.4196191658050555e-06, | |
| "loss": 0.4227952480316162, | |
| "step": 520 | |
| }, | |
| { | |
| "epoch": 1.3559539052496798, | |
| "grad_norm": 1.9542602926208692, | |
| "learning_rate": 3.349996027151601e-06, | |
| "loss": 0.4322650909423828, | |
| "step": 530 | |
| }, | |
| { | |
| "epoch": 1.381562099871959, | |
| "grad_norm": 1.7001469373500844, | |
| "learning_rate": 3.2796192212726524e-06, | |
| "loss": 0.4273072242736816, | |
| "step": 540 | |
| }, | |
| { | |
| "epoch": 1.4071702944942381, | |
| "grad_norm": 1.3602788345502808, | |
| "learning_rate": 3.2085511492740175e-06, | |
| "loss": 0.40812954902648924, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 1.4327784891165174, | |
| "grad_norm": 1.4585378495150405, | |
| "learning_rate": 3.1368548251874487e-06, | |
| "loss": 0.4072610855102539, | |
| "step": 560 | |
| }, | |
| { | |
| "epoch": 1.4583866837387964, | |
| "grad_norm": 1.3520475551677658, | |
| "learning_rate": 3.0645938200978987e-06, | |
| "loss": 0.4169639587402344, | |
| "step": 570 | |
| }, | |
| { | |
| "epoch": 1.4839948783610755, | |
| "grad_norm": 1.4508414002019714, | |
| "learning_rate": 2.991832205776856e-06, | |
| "loss": 0.43181633949279785, | |
| "step": 580 | |
| }, | |
| { | |
| "epoch": 1.5096030729833547, | |
| "grad_norm": 1.921667585803632, | |
| "learning_rate": 2.918634497871731e-06, | |
| "loss": 0.4225574493408203, | |
| "step": 590 | |
| }, | |
| { | |
| "epoch": 1.5352112676056338, | |
| "grad_norm": 1.4671405664975743, | |
| "learning_rate": 2.845065598701673e-06, | |
| "loss": 0.418547534942627, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 1.5608194622279128, | |
| "grad_norm": 1.4188762778752215, | |
| "learning_rate": 2.771190739710534e-06, | |
| "loss": 0.42908563613891604, | |
| "step": 610 | |
| }, | |
| { | |
| "epoch": 1.586427656850192, | |
| "grad_norm": 1.5624143403752313, | |
| "learning_rate": 2.69707542362801e-06, | |
| "loss": 0.419779109954834, | |
| "step": 620 | |
| }, | |
| { | |
| "epoch": 1.6120358514724713, | |
| "grad_norm": 1.3837172303234964, | |
| "learning_rate": 2.62278536639024e-06, | |
| "loss": 0.42682695388793945, | |
| "step": 630 | |
| }, | |
| { | |
| "epoch": 1.6376440460947503, | |
| "grad_norm": 1.8146171083481704, | |
| "learning_rate": 2.5483864388713608e-06, | |
| "loss": 0.40843868255615234, | |
| "step": 640 | |
| }, | |
| { | |
| "epoch": 1.6632522407170294, | |
| "grad_norm": 1.4700850995507602, | |
| "learning_rate": 2.4739446084776785e-06, | |
| "loss": 0.40427021980285643, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 1.6888604353393086, | |
| "grad_norm": 1.8147479971773997, | |
| "learning_rate": 2.3995258806562556e-06, | |
| "loss": 0.4081674098968506, | |
| "step": 660 | |
| }, | |
| { | |
| "epoch": 1.7144686299615877, | |
| "grad_norm": 1.704890035046186, | |
| "learning_rate": 2.3251962403697635e-06, | |
| "loss": 0.415826416015625, | |
| "step": 670 | |
| }, | |
| { | |
| "epoch": 1.7400768245838667, | |
| "grad_norm": 1.4295801530597483, | |
| "learning_rate": 2.251021593589496e-06, | |
| "loss": 0.42801637649536134, | |
| "step": 680 | |
| }, | |
| { | |
| "epoch": 1.765685019206146, | |
| "grad_norm": 1.3198378159803181, | |
| "learning_rate": 2.1770677088584315e-06, | |
| "loss": 0.4132532119750977, | |
| "step": 690 | |
| }, | |
| { | |
| "epoch": 1.7912932138284252, | |
| "grad_norm": 1.5820027588268746, | |
| "learning_rate": 2.1034001589761343e-06, | |
| "loss": 0.4029811382293701, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 1.8169014084507042, | |
| "grad_norm": 1.7963065436983081, | |
| "learning_rate": 2.0300842628572284e-06, | |
| "loss": 0.40697240829467773, | |
| "step": 710 | |
| }, | |
| { | |
| "epoch": 1.8425096030729833, | |
| "grad_norm": 2.0217685766751656, | |
| "learning_rate": 1.95718502761498e-06, | |
| "loss": 0.43702383041381837, | |
| "step": 720 | |
| }, | |
| { | |
| "epoch": 1.8681177976952625, | |
| "grad_norm": 1.467298226039554, | |
| "learning_rate": 1.8847670909213433e-06, | |
| "loss": 0.3957404136657715, | |
| "step": 730 | |
| }, | |
| { | |
| "epoch": 1.8937259923175416, | |
| "grad_norm": 1.7444761947382206, | |
| "learning_rate": 1.8128946636945827e-06, | |
| "loss": 0.42693262100219725, | |
| "step": 740 | |
| }, | |
| { | |
| "epoch": 1.9193341869398206, | |
| "grad_norm": 1.4400491686375012, | |
| "learning_rate": 1.7416314731652808e-06, | |
| "loss": 0.40868291854858396, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 1.9449423815620999, | |
| "grad_norm": 1.5745758477465968, | |
| "learning_rate": 1.6710407063712247e-06, | |
| "loss": 0.42135066986083985, | |
| "step": 760 | |
| }, | |
| { | |
| "epoch": 1.9705505761843791, | |
| "grad_norm": 1.4583913680279406, | |
| "learning_rate": 1.6011849541312597e-06, | |
| "loss": 0.42116374969482423, | |
| "step": 770 | |
| }, | |
| { | |
| "epoch": 1.9961587708066582, | |
| "grad_norm": 1.5372722755239894, | |
| "learning_rate": 1.5321261555477989e-06, | |
| "loss": 0.4099825382232666, | |
| "step": 780 | |
| }, | |
| { | |
| "epoch": 2.0204865556978233, | |
| "grad_norm": 1.173579694705156, | |
| "learning_rate": 1.4639255430871852e-06, | |
| "loss": 0.3110218048095703, | |
| "step": 790 | |
| }, | |
| { | |
| "epoch": 2.0460947503201026, | |
| "grad_norm": 1.9850921331690523, | |
| "learning_rate": 1.3966435882866118e-06, | |
| "loss": 0.2804063558578491, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 2.0717029449423814, | |
| "grad_norm": 1.2774083068020414, | |
| "learning_rate": 1.3303399481357354e-06, | |
| "loss": 0.26394855976104736, | |
| "step": 810 | |
| }, | |
| { | |
| "epoch": 2.0973111395646606, | |
| "grad_norm": 1.4091561199201226, | |
| "learning_rate": 1.2650734121805263e-06, | |
| "loss": 0.26277709007263184, | |
| "step": 820 | |
| }, | |
| { | |
| "epoch": 2.12291933418694, | |
| "grad_norm": 1.5244923052097017, | |
| "learning_rate": 1.2009018503962547e-06, | |
| "loss": 0.2693954944610596, | |
| "step": 830 | |
| }, | |
| { | |
| "epoch": 2.148527528809219, | |
| "grad_norm": 1.566063938545027, | |
| "learning_rate": 1.1378821618758347e-06, | |
| "loss": 0.2556907176971436, | |
| "step": 840 | |
| }, | |
| { | |
| "epoch": 2.174135723431498, | |
| "grad_norm": 1.3413902411262708, | |
| "learning_rate": 1.0760702243790213e-06, | |
| "loss": 0.26467223167419435, | |
| "step": 850 | |
| }, | |
| { | |
| "epoch": 2.1997439180537772, | |
| "grad_norm": 1.3701564304583917, | |
| "learning_rate": 1.0155208447871988e-06, | |
| "loss": 0.2915048360824585, | |
| "step": 860 | |
| }, | |
| { | |
| "epoch": 2.2253521126760565, | |
| "grad_norm": 1.285282293186625, | |
| "learning_rate": 9.562877105076776e-07, | |
| "loss": 0.26865172386169434, | |
| "step": 870 | |
| }, | |
| { | |
| "epoch": 2.2509603072983353, | |
| "grad_norm": 1.3232832338180234, | |
| "learning_rate": 8.98423341870604e-07, | |
| "loss": 0.25586528778076173, | |
| "step": 880 | |
| }, | |
| { | |
| "epoch": 2.2765685019206146, | |
| "grad_norm": 1.729162792877991, | |
| "learning_rate": 8.419790455606836e-07, | |
| "loss": 0.25625970363616946, | |
| "step": 890 | |
| }, | |
| { | |
| "epoch": 2.302176696542894, | |
| "grad_norm": 1.2142111531455695, | |
| "learning_rate": 7.87004869125006e-07, | |
| "loss": 0.2555440902709961, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 2.327784891165173, | |
| "grad_norm": 1.6644945599214742, | |
| "learning_rate": 7.335495565973131e-07, | |
| "loss": 0.25954551696777345, | |
| "step": 910 | |
| }, | |
| { | |
| "epoch": 2.353393085787452, | |
| "grad_norm": 1.777987853634216, | |
| "learning_rate": 6.816605052780556e-07, | |
| "loss": 0.263485050201416, | |
| "step": 920 | |
| }, | |
| { | |
| "epoch": 2.379001280409731, | |
| "grad_norm": 1.248870947291848, | |
| "learning_rate": 6.313837237085577e-07, | |
| "loss": 0.2622115135192871, | |
| "step": 930 | |
| }, | |
| { | |
| "epoch": 2.4046094750320104, | |
| "grad_norm": 1.4827455338456255, | |
| "learning_rate": 5.827637908765593e-07, | |
| "loss": 0.2656660556793213, | |
| "step": 940 | |
| }, | |
| { | |
| "epoch": 2.430217669654289, | |
| "grad_norm": 1.3646405560360901, | |
| "learning_rate": 5.358438166892954e-07, | |
| "loss": 0.2752659320831299, | |
| "step": 950 | |
| }, | |
| { | |
| "epoch": 2.4558258642765685, | |
| "grad_norm": 1.4238020101045017, | |
| "learning_rate": 4.906654037491743e-07, | |
| "loss": 0.26270647048950196, | |
| "step": 960 | |
| }, | |
| { | |
| "epoch": 2.4814340588988477, | |
| "grad_norm": 1.5260519316724546, | |
| "learning_rate": 4.4726861046593545e-07, | |
| "loss": 0.25939154624938965, | |
| "step": 970 | |
| }, | |
| { | |
| "epoch": 2.507042253521127, | |
| "grad_norm": 1.6173109382738884, | |
| "learning_rate": 4.056919155380012e-07, | |
| "loss": 0.24803729057312013, | |
| "step": 980 | |
| }, | |
| { | |
| "epoch": 2.532650448143406, | |
| "grad_norm": 1.8148781008066097, | |
| "learning_rate": 3.6597218383451345e-07, | |
| "loss": 0.2752032518386841, | |
| "step": 990 | |
| }, | |
| { | |
| "epoch": 2.558258642765685, | |
| "grad_norm": 1.8628502260268487, | |
| "learning_rate": 3.281446337083039e-07, | |
| "loss": 0.2631263494491577, | |
| "step": 1000 | |
| }, | |
| { | |
| "epoch": 2.5838668373879643, | |
| "grad_norm": 1.1435963697391183, | |
| "learning_rate": 2.9224280576878763e-07, | |
| "loss": 0.26247210502624513, | |
| "step": 1010 | |
| }, | |
| { | |
| "epoch": 2.609475032010243, | |
| "grad_norm": 1.9509332740805303, | |
| "learning_rate": 2.582985331424598e-07, | |
| "loss": 0.2643585205078125, | |
| "step": 1020 | |
| }, | |
| { | |
| "epoch": 2.6350832266325224, | |
| "grad_norm": 1.5904515189022093, | |
| "learning_rate": 2.2634191324737404e-07, | |
| "loss": 0.26303515434265134, | |
| "step": 1030 | |
| }, | |
| { | |
| "epoch": 2.6606914212548016, | |
| "grad_norm": 1.3261214225853823, | |
| "learning_rate": 1.9640128110661543e-07, | |
| "loss": 0.2749610424041748, | |
| "step": 1040 | |
| }, | |
| { | |
| "epoch": 2.686299615877081, | |
| "grad_norm": 1.495889175623159, | |
| "learning_rate": 1.6850318422444805e-07, | |
| "loss": 0.2622413635253906, | |
| "step": 1050 | |
| }, | |
| { | |
| "epoch": 2.7119078104993597, | |
| "grad_norm": 1.6516426608653414, | |
| "learning_rate": 1.4267235904739856e-07, | |
| "loss": 0.2718184232711792, | |
| "step": 1060 | |
| }, | |
| { | |
| "epoch": 2.737516005121639, | |
| "grad_norm": 1.290344433955146, | |
| "learning_rate": 1.1893170903115592e-07, | |
| "loss": 0.2675800800323486, | |
| "step": 1070 | |
| }, | |
| { | |
| "epoch": 2.763124199743918, | |
| "grad_norm": 1.2342435708595192, | |
| "learning_rate": 9.730228433272982e-08, | |
| "loss": 0.27097086906433104, | |
| "step": 1080 | |
| }, | |
| { | |
| "epoch": 2.788732394366197, | |
| "grad_norm": 1.8795545401525064, | |
| "learning_rate": 7.780326314587722e-08, | |
| "loss": 0.2591713905334473, | |
| "step": 1090 | |
| }, | |
| { | |
| "epoch": 2.8143405889884763, | |
| "grad_norm": 1.4002746914320383, | |
| "learning_rate": 6.045193469634558e-08, | |
| "loss": 0.2686860799789429, | |
| "step": 1100 | |
| }, | |
| { | |
| "epoch": 2.8399487836107555, | |
| "grad_norm": 1.421889664318597, | |
| "learning_rate": 4.526368391200881e-08, | |
| "loss": 0.26590893268585203, | |
| "step": 1110 | |
| }, | |
| { | |
| "epoch": 2.865556978233035, | |
| "grad_norm": 1.3630144335918553, | |
| "learning_rate": 3.225197778149225e-08, | |
| "loss": 0.27231292724609374, | |
| "step": 1120 | |
| }, | |
| { | |
| "epoch": 2.8911651728553136, | |
| "grad_norm": 2.4428236421892233, | |
| "learning_rate": 2.1428353413376346e-08, | |
| "loss": 0.2678102970123291, | |
| "step": 1130 | |
| }, | |
| { | |
| "epoch": 2.916773367477593, | |
| "grad_norm": 2.9866361225125138, | |
| "learning_rate": 1.2802407806572215e-08, | |
| "loss": 0.26076421737670896, | |
| "step": 1140 | |
| }, | |
| { | |
| "epoch": 2.942381562099872, | |
| "grad_norm": 1.3463810104092713, | |
| "learning_rate": 6.381789340937361e-09, | |
| "loss": 0.2603736162185669, | |
| "step": 1150 | |
| }, | |
| { | |
| "epoch": 2.967989756722151, | |
| "grad_norm": 1.5282382163608847, | |
| "learning_rate": 2.172190995674284e-09, | |
| "loss": 0.26784801483154297, | |
| "step": 1160 | |
| }, | |
| { | |
| "epoch": 2.99359795134443, | |
| "grad_norm": 1.3701388641937626, | |
| "learning_rate": 1.7734530152940798e-10, | |
| "loss": 0.26529083251953123, | |
| "step": 1170 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "step": 1173, | |
| "total_flos": 2298630685327360.0, | |
| "train_loss": 0.4866108725646166, | |
| "train_runtime": 83589.2896, | |
| "train_samples_per_second": 1.794, | |
| "train_steps_per_second": 0.014 | |
| } | |
| ], | |
| "logging_steps": 10, | |
| "max_steps": 1173, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 3, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 2298630685327360.0, | |
| "train_batch_size": 1, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |