Instructions to use AXERA-TECH/Qwen3.5-4B-AX650-GPTQ-Int4-C512-P30k-CTX32k with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use AXERA-TECH/Qwen3.5-4B-AX650-GPTQ-Int4-C512-P30k-CTX32k with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("image-text-to-text", model="AXERA-TECH/Qwen3.5-4B-AX650-GPTQ-Int4-C512-P30k-CTX32k")# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("AXERA-TECH/Qwen3.5-4B-AX650-GPTQ-Int4-C512-P30k-CTX32k", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- vLLM
How to use AXERA-TECH/Qwen3.5-4B-AX650-GPTQ-Int4-C512-P30k-CTX32k with vLLM:
Install from pip and serve model
# Install vLLM from pip: pip install vllm # Start the vLLM server: vllm serve "AXERA-TECH/Qwen3.5-4B-AX650-GPTQ-Int4-C512-P30k-CTX32k" # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:8000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "AXERA-TECH/Qwen3.5-4B-AX650-GPTQ-Int4-C512-P30k-CTX32k", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker
docker model run hf.co/AXERA-TECH/Qwen3.5-4B-AX650-GPTQ-Int4-C512-P30k-CTX32k
- SGLang
How to use AXERA-TECH/Qwen3.5-4B-AX650-GPTQ-Int4-C512-P30k-CTX32k with SGLang:
Install from pip and serve model
# Install SGLang from pip: pip install sglang # Start the SGLang server: python3 -m sglang.launch_server \ --model-path "AXERA-TECH/Qwen3.5-4B-AX650-GPTQ-Int4-C512-P30k-CTX32k" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "AXERA-TECH/Qwen3.5-4B-AX650-GPTQ-Int4-C512-P30k-CTX32k", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }'Use Docker images
docker run --gpus all \ --shm-size 32g \ -p 30000:30000 \ -v ~/.cache/huggingface:/root/.cache/huggingface \ --env "HF_TOKEN=<secret>" \ --ipc=host \ lmsysorg/sglang:latest \ python3 -m sglang.launch_server \ --model-path "AXERA-TECH/Qwen3.5-4B-AX650-GPTQ-Int4-C512-P30k-CTX32k" \ --host 0.0.0.0 \ --port 30000 # Call the server using curl (OpenAI-compatible API): curl -X POST "http://localhost:30000/v1/completions" \ -H "Content-Type: application/json" \ --data '{ "model": "AXERA-TECH/Qwen3.5-4B-AX650-GPTQ-Int4-C512-P30k-CTX32k", "prompt": "Once upon a time,", "max_tokens": 512, "temperature": 0.5 }' - Docker Model Runner
How to use AXERA-TECH/Qwen3.5-4B-AX650-GPTQ-Int4-C512-P30k-CTX32k with Docker Model Runner:
docker model run hf.co/AXERA-TECH/Qwen3.5-4B-AX650-GPTQ-Int4-C512-P30k-CTX32k
lihongjie commited on
Commit ·
4222f23
1
Parent(s): b54a120
update
Browse files- .gitattributes +36 -0
- README.md +320 -0
- config.json +29 -0
- model.embed_tokens.weight.bfloat16.bin +3 -0
- post_config.json +14 -0
- qwen3_5_text_p512_l0_together.axmodel +3 -0
- qwen3_5_text_p512_l10_together.axmodel +3 -0
- qwen3_5_text_p512_l11_together.axmodel +3 -0
- qwen3_5_text_p512_l12_together.axmodel +3 -0
- qwen3_5_text_p512_l13_together.axmodel +3 -0
- qwen3_5_text_p512_l14_together.axmodel +3 -0
- qwen3_5_text_p512_l15_together.axmodel +3 -0
- qwen3_5_text_p512_l16_together.axmodel +3 -0
- qwen3_5_text_p512_l17_together.axmodel +3 -0
- qwen3_5_text_p512_l18_together.axmodel +3 -0
- qwen3_5_text_p512_l19_together.axmodel +3 -0
- qwen3_5_text_p512_l1_together.axmodel +3 -0
- qwen3_5_text_p512_l20_together.axmodel +3 -0
- qwen3_5_text_p512_l21_together.axmodel +3 -0
- qwen3_5_text_p512_l22_together.axmodel +3 -0
- qwen3_5_text_p512_l23_together.axmodel +3 -0
- qwen3_5_text_p512_l24_together.axmodel +3 -0
- qwen3_5_text_p512_l25_together.axmodel +3 -0
- qwen3_5_text_p512_l26_together.axmodel +3 -0
- qwen3_5_text_p512_l27_together.axmodel +3 -0
- qwen3_5_text_p512_l28_together.axmodel +3 -0
- qwen3_5_text_p512_l29_together.axmodel +3 -0
- qwen3_5_text_p512_l2_together.axmodel +3 -0
- qwen3_5_text_p512_l30_together.axmodel +3 -0
- qwen3_5_text_p512_l31_together.axmodel +3 -0
- qwen3_5_text_p512_l3_together.axmodel +3 -0
- qwen3_5_text_p512_l4_together.axmodel +3 -0
- qwen3_5_text_p512_l5_together.axmodel +3 -0
- qwen3_5_text_p512_l6_together.axmodel +3 -0
- qwen3_5_text_p512_l7_together.axmodel +3 -0
- qwen3_5_text_p512_l8_together.axmodel +3 -0
- qwen3_5_text_p512_l9_together.axmodel +3 -0
- qwen3_5_text_post.axmodel +3 -0
- qwen3_5_tokenizer.txt +3 -0
- qwen3_5_vision.axmodel +3 -0
.gitattributes
CHANGED
|
@@ -33,3 +33,39 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
|
|
| 33 |
*.zip filter=lfs diff=lfs merge=lfs -text
|
| 34 |
*.zst filter=lfs diff=lfs merge=lfs -text
|
| 35 |
*tfevents* filter=lfs diff=lfs merge=lfs -text
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 33 |
*.zip filter=lfs diff=lfs merge=lfs -text
|
| 34 |
*.zst filter=lfs diff=lfs merge=lfs -text
|
| 35 |
*tfevents* filter=lfs diff=lfs merge=lfs -text
|
| 36 |
+
qwen3_5_text_p512_l1_together.axmodel filter=lfs diff=lfs merge=lfs -text
|
| 37 |
+
qwen3_5_text_p512_l7_together.axmodel filter=lfs diff=lfs merge=lfs -text
|
| 38 |
+
qwen3_5_text_p512_l23_together.axmodel filter=lfs diff=lfs merge=lfs -text
|
| 39 |
+
qwen3_5_text_p512_l26_together.axmodel filter=lfs diff=lfs merge=lfs -text
|
| 40 |
+
qwen3_5_text_p512_l28_together.axmodel filter=lfs diff=lfs merge=lfs -text
|
| 41 |
+
qwen3_5_text_p512_l5_together.axmodel filter=lfs diff=lfs merge=lfs -text
|
| 42 |
+
qwen3_5_text_p512_l8_together.axmodel filter=lfs diff=lfs merge=lfs -text
|
| 43 |
+
qwen3_5_vision.axmodel filter=lfs diff=lfs merge=lfs -text
|
| 44 |
+
qwen3_5_text_p512_l10_together.axmodel filter=lfs diff=lfs merge=lfs -text
|
| 45 |
+
qwen3_5_text_p512_l20_together.axmodel filter=lfs diff=lfs merge=lfs -text
|
| 46 |
+
qwen3_5_text_p512_l0_together.axmodel filter=lfs diff=lfs merge=lfs -text
|
| 47 |
+
qwen3_5_text_p512_l21_together.axmodel filter=lfs diff=lfs merge=lfs -text
|
| 48 |
+
qwen3_5_text_p512_l22_together.axmodel filter=lfs diff=lfs merge=lfs -text
|
| 49 |
+
qwen3_5_text_p512_l24_together.axmodel filter=lfs diff=lfs merge=lfs -text
|
| 50 |
+
qwen3_5_text_post.axmodel filter=lfs diff=lfs merge=lfs -text
|
| 51 |
+
qwen3_5_text_p512_l15_together.axmodel filter=lfs diff=lfs merge=lfs -text
|
| 52 |
+
qwen3_5_text_p512_l18_together.axmodel filter=lfs diff=lfs merge=lfs -text
|
| 53 |
+
qwen3_5_text_p512_l31_together.axmodel filter=lfs diff=lfs merge=lfs -text
|
| 54 |
+
qwen3_5_text_p512_l14_together.axmodel filter=lfs diff=lfs merge=lfs -text
|
| 55 |
+
qwen3_5_text_p512_l16_together.axmodel filter=lfs diff=lfs merge=lfs -text
|
| 56 |
+
qwen3_5_text_p512_l27_together.axmodel filter=lfs diff=lfs merge=lfs -text
|
| 57 |
+
qwen3_5_text_p512_l3_together.axmodel filter=lfs diff=lfs merge=lfs -text
|
| 58 |
+
qwen3_5_text_p512_l6_together.axmodel filter=lfs diff=lfs merge=lfs -text
|
| 59 |
+
qwen3_5_text_p512_l11_together.axmodel filter=lfs diff=lfs merge=lfs -text
|
| 60 |
+
qwen3_5_text_p512_l13_together.axmodel filter=lfs diff=lfs merge=lfs -text
|
| 61 |
+
qwen3_5_text_p512_l25_together.axmodel filter=lfs diff=lfs merge=lfs -text
|
| 62 |
+
qwen3_5_text_p512_l29_together.axmodel filter=lfs diff=lfs merge=lfs -text
|
| 63 |
+
qwen3_5_text_p512_l2_together.axmodel filter=lfs diff=lfs merge=lfs -text
|
| 64 |
+
qwen3_5_text_p512_l9_together.axmodel filter=lfs diff=lfs merge=lfs -text
|
| 65 |
+
qwen3_5_text_p512_l12_together.axmodel filter=lfs diff=lfs merge=lfs -text
|
| 66 |
+
qwen3_5_text_p512_l17_together.axmodel filter=lfs diff=lfs merge=lfs -text
|
| 67 |
+
qwen3_5_text_p512_l4_together.axmodel filter=lfs diff=lfs merge=lfs -text
|
| 68 |
+
qwen3_5_text_p512_l19_together.axmodel filter=lfs diff=lfs merge=lfs -text
|
| 69 |
+
qwen3_5_text_p512_l30_together.axmodel filter=lfs diff=lfs merge=lfs -text
|
| 70 |
+
model.embed_tokens.weight.bfloat16.bin filter=lfs diff=lfs merge=lfs -text
|
| 71 |
+
qwen3_5_tokenizer.txt filter=lfs diff=lfs merge=lfs -text
|
README.md
CHANGED
|
@@ -1,3 +1,323 @@
|
|
| 1 |
---
|
| 2 |
license: mit
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 3 |
---
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
---
|
| 2 |
license: mit
|
| 3 |
+
language:
|
| 4 |
+
- en
|
| 5 |
+
- zh
|
| 6 |
+
base_model:
|
| 7 |
+
- Qwen/Qwen3.5-4B
|
| 8 |
+
pipeline_tag: image-text-to-text
|
| 9 |
+
library_name: transformers
|
| 10 |
+
tags:
|
| 11 |
+
- Qwen3.5
|
| 12 |
+
- Qwen3.5-4B
|
| 13 |
+
- VLM
|
| 14 |
+
- GPTQ
|
| 15 |
+
- Int4
|
| 16 |
---
|
| 17 |
+
|
| 18 |
+
# Qwen3.5-4B
|
| 19 |
+
|
| 20 |
+
This version of Qwen3.5-4B has been converted to run on the Axera NPU using **w4a16** quantization.
|
| 21 |
+
|
| 22 |
+
Compatible with Pulsar2 version: 5.0
|
| 23 |
+
|
| 24 |
+
## Convert tools links:
|
| 25 |
+
|
| 26 |
+
For those who are interested in model conversion, you can try to export axmodel through the original repo :
|
| 27 |
+
|
| 28 |
+
- https://huggingface.co/Qwen/Qwen3.5-4B
|
| 29 |
+
|
| 30 |
+
[Pulsar2 Link, How to Convert LLM from Huggingface to axmodel](https://pulsar2-docs.readthedocs.io/en/latest/appendix/build_llm.html)
|
| 31 |
+
|
| 32 |
+
[AXera NPU HOST LLM Runtime](https://github.com/AXERA-TECH/ax-llm.git)
|
| 33 |
+
|
| 34 |
+
|
| 35 |
+
## Support Platform
|
| 36 |
+
|
| 37 |
+
- AX650
|
| 38 |
+
- AX650N DEMO Board
|
| 39 |
+
- [M4N-Dock(爱芯派Pro)](https://wiki.sipeed.com/hardware/zh/maixIV/m4ndock/m4ndock.html)
|
| 40 |
+
- [M.2 Accelerator card](https://docs.m5stack.com/zh_CN/ai_hardware/LLM-8850_Card)
|
| 41 |
+
|
| 42 |
+
**Image Process**
|
| 43 |
+
|Chips| input size | image num | ttft(168 tokens) | w4a16 | CMM | Flash |
|
| 44 |
+
|--|--|--|--|--|--|--|
|
| 45 |
+
|AX650| 384*384 | 1 | 845 ms | 5.7 tokens/sec| 4.91GiB | 5.59GiB |
|
| 46 |
+
|
| 47 |
+
**Video Process**
|
| 48 |
+
|Chips| input size | image num | ttft(600 tokens) | w4a16 | CMM | Flash |
|
| 49 |
+
|--|--|--|--|--|--|--|
|
| 50 |
+
|AX650| 384*384 | 8 | 2111 ms | 5.7 tokens/sec| 4.91GiB | 5.59GiB |
|
| 51 |
+
|
| 52 |
+
|
| 53 |
+
|
| 54 |
+
The DDR capacity refers to the CMM memory that needs to be consumed. Ensure that the CMM memory allocation on the development board is greater than this value.
|
| 55 |
+
|
| 56 |
+
## How to use
|
| 57 |
+
|
| 58 |
+
## 安装 axllm
|
| 59 |
+
方式一:克隆仓库后执行安装脚本:
|
| 60 |
+
|
| 61 |
+
```shell
|
| 62 |
+
git clone -b axllm https://github.com/AXERA-TECH/ax-llm.git
|
| 63 |
+
cd ax-llm
|
| 64 |
+
./install.sh
|
| 65 |
+
```
|
| 66 |
+
|
| 67 |
+
方式二:一行命令安装(默认分支 `axllm`):
|
| 68 |
+
|
| 69 |
+
```shell
|
| 70 |
+
curl -fsSL https://raw.githubusercontent.com/AXERA-TECH/ax-llm/axllm/install.sh | bash
|
| 71 |
+
```
|
| 72 |
+
|
| 73 |
+
方式三:下载Github Actions CI 导出的可执行程序(适合没有编译环境的用户):
|
| 74 |
+
|
| 75 |
+
如果没有编译环境,请到:
|
| 76 |
+
`https://github.com/AXERA-TECH/ax-llm/actions?query=branch%3Aaxllm`
|
| 77 |
+
下载 **最新 CI 导出的可执行程序**(`axllm`),然后:
|
| 78 |
+
|
| 79 |
+
```shell
|
| 80 |
+
chmod +x axllm
|
| 81 |
+
sudo mv axllm /usr/bin/axllm
|
| 82 |
+
```
|
| 83 |
+
|
| 84 |
+
## 模型下载(Hugging Face)
|
| 85 |
+
先创建模型目录并进入,然后下载到该目录:
|
| 86 |
+
|
| 87 |
+
```shell
|
| 88 |
+
mkdir -p AXERA-TECH/Qwen3.5-4B-AX650-GPTQ-Int4-C256-P10K-CTX12K
|
| 89 |
+
cd AXERA-TECH/Qwen3.5-4B-AX650-GPTQ-Int4-C256-P10K-CTX12K
|
| 90 |
+
hf download AXERA-TECH/Qwen3.5-4B-AX650-GPTQ-Int4-C256-P10K-CTX12K --local-dir .
|
| 91 |
+
|
| 92 |
+
# structure of the downloaded files
|
| 93 |
+
tree -L 3
|
| 94 |
+
`-- AXERA-TECH
|
| 95 |
+
`-- Qwen3.5-4B-AX650-GPTQ-Int4-C256-P10K-CTX12K
|
| 96 |
+
|-- qwen3_5_vision.axmodel
|
| 97 |
+
|-- README.md
|
| 98 |
+
|-- config.json
|
| 99 |
+
|-- image.png
|
| 100 |
+
|-- model.embed_tokens.weight.bfloat16.bin
|
| 101 |
+
|-- post_config.json
|
| 102 |
+
|-- qwen3_5_tokenizer.txt
|
| 103 |
+
|-- qwen3_5_text_p128_l0_together.axmodel
|
| 104 |
+
...
|
| 105 |
+
|-- qwen3_5_text_p128_l23_together.axmodel
|
| 106 |
+
|-- qwen3_5_text_post.axmodel
|
| 107 |
+
`-- vision_cache
|
| 108 |
+
|
| 109 |
+
3 directories, 39 files
|
| 110 |
+
```
|
| 111 |
+
|
| 112 |
+
## Inference with AX650 Host, such as M4N-Dock(爱芯派Pro) or AX650N DEMO Board
|
| 113 |
+
|
| 114 |
+
### 运行(CLI)
|
| 115 |
+
|
| 116 |
+
```shell
|
| 117 |
+
root@ax650 ~/yongqiang/lhj/Qwen3_5.AXERA/ax-llm # axllm run Qwen3.5-4B-AX650-GPTQ-Int4-C256-P10K-CTX12K/
|
| 118 |
+
11:40:21.412 INF Init:218 | LLM init start
|
| 119 |
+
11:40:21.412 INF Init:226 | mixed attention enabled: full_attention_interval=4 ref_full_layer_idx=3
|
| 120 |
+
tokenizer_type = 3
|
| 121 |
+
96% | ############################## | 26 / 27 [3.78s<3.93s, 6.87 count/s] init post axmodel ok,remain_cmm(5589 MB)
|
| 122 |
+
11:40:25.195 INF Init:368 | max_token_len : 2047
|
| 123 |
+
11:40:25.195 INF Init:371 | kv_cache_size : 512, kv_cache_num: 2047
|
| 124 |
+
11:40:25.195 INF Init:374 | prefill_token_num : 128
|
| 125 |
+
11:40:25.195 INF Init:379 | grp: 1, prefill_max_kv_cache_num : 1
|
| 126 |
+
11:40:25.195 INF Init:379 | grp: 2, prefill_max_kv_cache_num : 128
|
| 127 |
+
11:40:25.195 INF Init:379 | grp: 3, prefill_max_kv_cache_num : 256
|
| 128 |
+
11:40:25.195 INF Init:379 | grp: 4, prefill_max_kv_cache_num : 384
|
| 129 |
+
11:40:25.195 INF Init:379 | grp: 5, prefill_max_kv_cache_num : 512
|
| 130 |
+
11:40:25.195 INF Init:379 | grp: 6, prefill_max_kv_cache_num : 768
|
| 131 |
+
11:40:25.195 INF Init:379 | grp: 7, prefill_max_kv_cache_num : 1024
|
| 132 |
+
11:40:25.195 INF Init:379 | grp: 8, prefill_max_kv_cache_num : 1152
|
| 133 |
+
11:40:25.195 INF Init:384 | prefill_max_token_num : 1152
|
| 134 |
+
11:40:25.195 INF Init:27 | LLaMaEmbedSelector use mmap
|
| 135 |
+
100% | ################################ | 27 / 27 [3.79s<3.79s, 7.13 count/s] embed_selector init ok
|
| 136 |
+
11:40:25.478 INF Init:643 | Qwen-VL token ids: vision_start=248053 image_pad=248056 video_pad=248057
|
| 137 |
+
11:40:25.478 INF Init:668 | VisionModule init ok: type=Qwen3VL, tokens_per_block=144, embed_size=2048, out_dtype=fp32
|
| 138 |
+
11:40:25.478 WRN Init:677 | Vision preprocess backend: SimpleCV (OpenCV not found at build time; minor differences vs OpenCV are possible)
|
| 139 |
+
11:40:25.480 INF load_config:282 | load config:
|
| 140 |
+
11:40:25.480 INF load_config:282 | {
|
| 141 |
+
11:40:25.480 INF load_config:282 | "enable_repetition_penalty": false,
|
| 142 |
+
11:40:25.480 INF load_config:282 | "enable_temperature": false,
|
| 143 |
+
11:40:25.480 INF load_config:282 | "enable_top_k_sampling": true,
|
| 144 |
+
11:40:25.480 INF load_config:282 | "enable_top_p_sampling": false,
|
| 145 |
+
11:40:25.480 INF load_config:282 | "penalty_window": 20,
|
| 146 |
+
11:40:25.480 INF load_config:282 | "repetition_penalty": 1.2,
|
| 147 |
+
11:40:25.480 INF load_config:282 | "temperature": 0.9,
|
| 148 |
+
11:40:25.480 INF load_config:282 | "top_k": 10,
|
| 149 |
+
11:40:25.480 INF load_config:282 | "top_p": 0.8
|
| 150 |
+
11:40:25.480 INF load_config:282 | }
|
| 151 |
+
11:40:25.480 INF Init:448 | LLM init ok
|
| 152 |
+
Commands:
|
| 153 |
+
/q, /exit 退出
|
| 154 |
+
/reset 重置 kvcache
|
| 155 |
+
/dd 删除一轮对话
|
| 156 |
+
/pp 打印历史对话
|
| 157 |
+
Ctrl+C: 停止当前生成
|
| 158 |
+
VLM enabled: after each prompt, input image path (empty = text-only). Use "video:<frames_dir>" for video.
|
| 159 |
+
----------------------------------------
|
| 160 |
+
prompt >> 描述视频内容
|
| 161 |
+
media >> video:assets/football.mp4:1.5
|
| 162 |
+
17:54:19.424 INF extract_video_frames_ffmpeg:299 | Extracting raw video container to frames: assets/football.mp4 -> /tmp/axllm_video_frames/video_77305085315876_0 fps=1.4985014985014984
|
| 163 |
+
17:54:40.848 INF collect_video_frame_paths:379 | Video fps sampling: path=assets/football.mp4 fps=1.5 duration=60.060s target_frames=90 selected=90
|
| 164 |
+
17:55:01.670 INF SetKVCache:2543 | decode_grpid:3 prefill_grpid:6 history_cap:0 total_cap:256 symbolic_cap:1 precompute_len:0 input_num_token:6504 prefer_symbolic_group:0
|
| 165 |
+
17:55:01.670 INF SetKVCache:2565 | current prefill_max_token_num:10496
|
| 166 |
+
17:55:02.375 INF SetKVCache:2581 | first run
|
| 167 |
+
17:55:02.481 INF Run:2738 | input token num : 6504, prefill_split_num : 26
|
| 168 |
+
17:55:02.481 INF Run:2818 | prefill chunk p=0 history_len=0 grpid=6 kv_cache_num=0 input_tokens=256
|
| 169 |
+
17:55:03.405 INF Run:2818 | prefill chunk p=1 history_len=256 grpid=8 kv_cache_num=512 input_tokens=256
|
| 170 |
+
17:55:04.400 INF Run:2818 | prefill chunk p=2 history_len=512 grpid=9 kv_cache_num=768 input_tokens=256
|
| 171 |
+
17:55:05.385 INF Run:2818 | prefill chunk p=3 history_len=768 grpid=10 kv_cache_num=1024 input_tokens=256
|
| 172 |
+
17:55:06.362 INF Run:2818 | prefill chunk p=4 history_len=1024 grpid=11 kv_cache_num=1280 input_tokens=256
|
| 173 |
+
17:55:07.365 INF Run:2818 | prefill chunk p=5 history_len=1280 grpid=12 kv_cache_num=1536 input_tokens=256
|
| 174 |
+
17:55:08.399 INF Run:2818 | prefill chunk p=6 history_len=1536 grpid=13 kv_cache_num=1792 input_tokens=256
|
| 175 |
+
17:55:09.466 INF Run:2818 | prefill chunk p=7 history_len=1792 grpid=14 kv_cache_num=2048 input_tokens=256
|
| 176 |
+
17:55:10.592 INF Run:2818 | prefill chunk p=8 history_len=2048 grpid=15 kv_cache_num=2304 input_tokens=256
|
| 177 |
+
17:55:11.649 INF Run:2818 | prefill chunk p=9 history_len=2304 grpid=16 kv_cache_num=2560 input_tokens=256
|
| 178 |
+
17:55:12.724 INF Run:2818 | prefill chunk p=10 history_len=2560 grpid=17 kv_cache_num=2816 input_tokens=256
|
| 179 |
+
17:55:13.798 INF Run:2818 | prefill chunk p=11 history_len=2816 grpid=18 kv_cache_num=3072 input_tokens=256
|
| 180 |
+
17:55:14.886 INF Run:2818 | prefill chunk p=12 history_len=3072 grpid=19 kv_cache_num=3328 input_tokens=256
|
| 181 |
+
17:55:15.985 INF Run:2818 | prefill chunk p=13 history_len=3328 grpid=20 kv_cache_num=3584 input_tokens=256
|
| 182 |
+
17:55:17.091 INF Run:2818 | prefill chunk p=14 history_len=3584 grpid=21 kv_cache_num=3840 input_tokens=256
|
| 183 |
+
17:55:18.232 INF Run:2818 | prefill chunk p=15 history_len=3840 grpid=22 kv_cache_num=4096 input_tokens=256
|
| 184 |
+
17:55:19.386 INF Run:2818 | prefill chunk p=16 history_len=4096 grpid=23 kv_cache_num=4352 input_tokens=256
|
| 185 |
+
17:55:20.613 INF Run:2818 | prefill chunk p=17 history_len=4352 grpid=24 kv_cache_num=4608 input_tokens=256
|
| 186 |
+
17:55:21.853 INF Run:2818 | prefill chunk p=18 history_len=4608 grpid=25 kv_cache_num=4864 input_tokens=256
|
| 187 |
+
17:55:23.114 INF Run:2818 | prefill chunk p=19 history_len=4864 grpid=26 kv_cache_num=5120 input_tokens=256
|
| 188 |
+
17:55:24.395 INF Run:2818 | prefill chunk p=20 history_len=5120 grpid=27 kv_cache_num=5376 input_tokens=256
|
| 189 |
+
17:55:25.681 INF Run:2818 | prefill chunk p=21 history_len=5376 grpid=28 kv_cache_num=5632 input_tokens=256
|
| 190 |
+
17:55:26.995 INF Run:2818 | prefill chunk p=22 history_len=5632 grpid=29 kv_cache_num=5888 input_tokens=256
|
| 191 |
+
17:55:28.322 INF Run:2818 | prefill chunk p=23 history_len=5888 grpid=30 kv_cache_num=6144 input_tokens=256
|
| 192 |
+
17:55:29.667 INF Run:2818 | prefill chunk p=24 history_len=6144 grpid=31 kv_cache_num=6400 input_tokens=256
|
| 193 |
+
17:55:31.043 INF Run:2818 | prefill chunk p=25 history_len=6400 grpid=32 kv_cache_num=6656 input_tokens=104
|
| 194 |
+
17:55:32.459 INF Run:3045 | ttft: 29978.45 ms
|
| 195 |
+
<think>17:55:32.459 INF Run:3076 | VLM decode positions: rope_start=6372 dense_kv_start=6504
|
| 196 |
+
|
| 197 |
+
|
| 198 |
+
</think>
|
| 199 |
+
|
| 200 |
+
这段视频是一个关于足球比赛的直播或录像,具体是2019年1月30日巴塞罗那队与塞维利亚队的比赛。视频展示了比赛中的精彩瞬间和进球。
|
| 201 |
+
|
| 202 |
+
- **比赛场景**:视频展示了一场足球比赛的片段,场地为标准的足球场,有清晰的白色线条标记。
|
| 203 |
+
- **球员和队服**:
|
| 204 |
+
- 巴塞罗那队穿着蓝色和红色条纹的球衣,号码为10的球员是路易斯·苏亚雷斯(Luis Suárez)。
|
| 205 |
+
- 塞维利亚队穿着白色球衣。
|
| 206 |
+
- **比赛动作**:
|
| 207 |
+
- 在多个片段中,可以看到球员们在场上积极跑动和传球。
|
| 208 |
+
- 一个关键片段显示,巴塞罗那队在进攻中成功突破防守,最终由苏亚雷斯打入一球。
|
| 209 |
+
- 进球后,苏亚雷斯与队友庆祝,场面充满激情。
|
| 210 |
+
- **观众和氛围**:
|
| 211 |
+
- 观众席上坐满了观众,他们热情地为比赛加油。
|
| 212 |
+
- 场边的广告牌上可以看到“Nike”和“Estrella Damm”等品牌标识。
|
| 213 |
+
- **直播者**:
|
| 214 |
+
- 在视频的右上角,有一个直播者正在观看和评论比赛。他穿着巴塞罗那队的球衣,表情丰富,时而惊讶,时而兴奋,显然对比赛非常投入。
|
| 215 |
+
- **技术细节**:
|
| 216 |
+
- 视频底部有“FBS00MPS10"的水印,以及播放进度条,显示视频正在播放中。
|
| 217 |
+
- 视频标题为“Barcelona vs Sevilla 6-1 All Goals & Extended Highlights 30/01/2019 HD",表明这是该场比赛的完整进球和扩展集锦。
|
| 218 |
+
|
| 219 |
+
这段视频通过多个镜头展示了比赛的紧张和精彩,以及球迷和直播者对比赛的热情。
|
| 220 |
+
|
| 221 |
+
17:56:46.246 NTC Run:3445 | hit eos,decode avg 5.24 token/s
|
| 222 |
+
17:56:46.246 INF GetKVCache:2496 | precompute_len:6892, remaining:3604 (tracked)
|
| 223 |
+
```
|
| 224 |
+
|
| 225 |
+
### 启动服务(OpenAI 兼容)
|
| 226 |
+
|
| 227 |
+
```shell
|
| 228 |
+
root@ax650:~# axllm serve AXERA-TECH/Qwen3.5-4B-AX650-GPTQ-Int4-C256-P10K-CTX12K
|
| 229 |
+
[I][ Init][ 138]: LLM init start
|
| 230 |
+
tokenizer_type = 1
|
| 231 |
+
96% | ███████████████████████████████ | 30 / 31 [4.63s<4.79s, 6.47 count/s] init post axmodel ok,remain_cmm(9563 MB)
|
| 232 |
+
[I][ Init][ 199]: max_token_len : 2047
|
| 233 |
+
[I][ Init][ 202]: kv_cache_size : 1024, kv_cache_num: 2047
|
| 234 |
+
[I][ Init][ 205]: prefill_token_num : 128
|
| 235 |
+
[I][ Init][ 209]: grp: 1, prefill_max_kv_cache_num : 1
|
| 236 |
+
[I][ Init][ 209]: grp: 2, prefill_max_kv_cache_num : 128
|
| 237 |
+
[I][ Init][ 209]: grp: 3, prefill_max_kv_cache_num : 256
|
| 238 |
+
[I][ Init][ 209]: grp: 4, prefill_max_kv_cache_num : 384
|
| 239 |
+
[I][ Init][ 209]: grp: 5, prefill_max_kv_cache_num : 512
|
| 240 |
+
[I][ Init][ 209]: grp: 6, prefill_max_kv_cache_num : 640
|
| 241 |
+
[I][ Init][ 209]: grp: 7, prefill_max_kv_cache_num : 768
|
| 242 |
+
[I][ Init][ 209]: grp: 8, prefill_max_kv_cache_num : 896
|
| 243 |
+
[I][ Init][ 209]: grp: 9, prefill_max_kv_cache_num : 1024
|
| 244 |
+
[I][ Init][ 209]: grp: 10, prefill_max_kv_cache_num : 1152
|
| 245 |
+
[I][ Init][ 214]: prefill_max_token_num : 1152
|
| 246 |
+
[I][ Init][ 27]: LLaMaEmbedSelector use mmap
|
| 247 |
+
100% | ████████████████████████████████ | 31 / 31 [4.64s<4.64s, 6.69 count/s] embed_selector init ok
|
| 248 |
+
[W][ Init][ 457]: Qwen-VL vision size override: cfg=448x448 bytes=1204224, model_input_bytes=884736 -> 384x384 (square).
|
| 249 |
+
[I][ Init][ 641]: Qwen-VL token ids: vision_start=151652 image_pad=151655 video_pad=151656
|
| 250 |
+
[I][ Init][ 666]: VisionModule init ok: type=Qwen3VL, tokens_per_block=144, embed_size=2048, out_dtype=fp32
|
| 251 |
+
[I][ Init][ 672]: VisionModule deepstack enabled: layers=3
|
| 252 |
+
[I][ load_config][ 282]: load config:
|
| 253 |
+
{
|
| 254 |
+
"enable_repetition_penalty": false,
|
| 255 |
+
"enable_temperature": false,
|
| 256 |
+
"enable_top_k_sampling": false,
|
| 257 |
+
"enable_top_p_sampling": false,
|
| 258 |
+
"penalty_window": 20,
|
| 259 |
+
"repetition_penalty": 1.2,
|
| 260 |
+
"temperature": 0.9,
|
| 261 |
+
"top_k": 10,
|
| 262 |
+
"top_p": 0.8
|
| 263 |
+
}
|
| 264 |
+
|
| 265 |
+
[I][ Init][ 272]: LLM init ok
|
| 266 |
+
Starting server on port 8000 with model 'AXERA-TECH/Qwen3.5-4B-AX650-GPTQ-Int4-C256-P10K-CTX12K'...
|
| 267 |
+
OpenAI API Server starting on http://0.0.0.0:8000
|
| 268 |
+
Max concurrency: 1
|
| 269 |
+
Models: AXERA-TECH/Qwen3.5-4B-AX650-GPTQ-Int4-C256-P10K-CTX12K
|
| 270 |
+
```
|
| 271 |
+
|
| 272 |
+
### OpenAI 调用示例
|
| 273 |
+
|
| 274 |
+
```python
|
| 275 |
+
from openai import OpenAI
|
| 276 |
+
|
| 277 |
+
API_URL = "http://127.0.0.1:8000/v1"
|
| 278 |
+
MODEL = "AXERA-TECH/Qwen3.5-4B-AX650-GPTQ-Int4-C256-P10K-CTX12K"
|
| 279 |
+
|
| 280 |
+
messages = [
|
| 281 |
+
{"role": "system", "content": [{"type": "text", "text": "you are a helpful assistant."}]},
|
| 282 |
+
{"role": "user", "content": "hello"},
|
| 283 |
+
]
|
| 284 |
+
|
| 285 |
+
client = OpenAI(api_key="not-needed", base_url=API_URL)
|
| 286 |
+
completion = client.chat.completions.create(
|
| 287 |
+
model=MODEL,
|
| 288 |
+
messages=messages,
|
| 289 |
+
)
|
| 290 |
+
|
| 291 |
+
print(completion.choices[0].message.content)
|
| 292 |
+
```
|
| 293 |
+
|
| 294 |
+
|
| 295 |
+
### OpenAI 流式调用示例
|
| 296 |
+
|
| 297 |
+
```python
|
| 298 |
+
from openai import OpenAI
|
| 299 |
+
|
| 300 |
+
API_URL = "http://127.0.0.1:8000/v1"
|
| 301 |
+
MODEL = "AXERA-TECH/Qwen3.5-4B-AX650-GPTQ-Int4-C256-P10K-CTX12K"
|
| 302 |
+
|
| 303 |
+
messages = [
|
| 304 |
+
{"role": "system", "content": [{"type": "text", "text": "you are a helpful assistant."}]},
|
| 305 |
+
{"role": "user", "content": "hello"},
|
| 306 |
+
]
|
| 307 |
+
|
| 308 |
+
client = OpenAI(api_key="not-needed", base_url=API_URL)
|
| 309 |
+
stream = client.chat.completions.create(
|
| 310 |
+
model=MODEL,
|
| 311 |
+
messages=messages,
|
| 312 |
+
stream=True,
|
| 313 |
+
)
|
| 314 |
+
|
| 315 |
+
print("assistant:")
|
| 316 |
+
for ev in stream:
|
| 317 |
+
delta = getattr(ev.choices[0], "delta", None)
|
| 318 |
+
if delta and getattr(delta, "content", None):
|
| 319 |
+
print(delta.content, end="", flush=True)
|
| 320 |
+
print("
|
| 321 |
+
")
|
| 322 |
+
```
|
| 323 |
+
|
config.json
ADDED
|
@@ -0,0 +1,29 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"system_prompt": "you are a helpful assistant.",
|
| 3 |
+
"model_name": "AXERA-TECH/Qwen3.5-4B-AX650-GPTQ-Int4-C512-P30k-CTX32k",
|
| 4 |
+
"url_tokenizer_model": "qwen3_5_tokenizer.txt",
|
| 5 |
+
"tokenizer_type": "Qwen3_5VL",
|
| 6 |
+
"post_config_path": "post_config.json",
|
| 7 |
+
"template_filename_axmodel": "qwen3_5_text_p512_l%d_together.axmodel",
|
| 8 |
+
"axmodel_num": 32,
|
| 9 |
+
"full_attention_interval": 4,
|
| 10 |
+
"filename_post_axmodel": "qwen3_5_text_post.axmodel",
|
| 11 |
+
"filename_tokens_embed": "model.embed_tokens.weight.bfloat16.bin",
|
| 12 |
+
"tokens_embed_num": 248320,
|
| 13 |
+
"tokens_embed_size": 2560,
|
| 14 |
+
"b_use_mmap_load_embed": true,
|
| 15 |
+
"b_use_mmap_load_layer": true,
|
| 16 |
+
"vlm_type": "Qwen3VL",
|
| 17 |
+
"filename_image_encoder_axmodel": "qwen3_5_vision.axmodel",
|
| 18 |
+
"vision_patch_size": 16,
|
| 19 |
+
"vision_width": 384,
|
| 20 |
+
"vision_height": 384,
|
| 21 |
+
"vision_temporal_patch_size": 2,
|
| 22 |
+
"vision_spatial_merge_size": 2,
|
| 23 |
+
"vision_fps": 1,
|
| 24 |
+
"vision_tokens_per_second": 1,
|
| 25 |
+
"vision_cache_dir": "vision_cache",
|
| 26 |
+
"devices": [
|
| 27 |
+
0
|
| 28 |
+
]
|
| 29 |
+
}
|
model.embed_tokens.weight.bfloat16.bin
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:2a68153b498532801ab605bb03fe617c57b3e6a3ba019301fb70ada0c864a2f7
|
| 3 |
+
size 1271398400
|
post_config.json
ADDED
|
@@ -0,0 +1,14 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"enable_temperature" : false,
|
| 3 |
+
"temperature" : 0.7,
|
| 4 |
+
|
| 5 |
+
"enable_repetition_penalty" : false,
|
| 6 |
+
"repetition_penalty" : 1.0,
|
| 7 |
+
"penalty_window" : 20,
|
| 8 |
+
|
| 9 |
+
"enable_top_p_sampling" : false,
|
| 10 |
+
"top_p" : 0.8,
|
| 11 |
+
|
| 12 |
+
"enable_top_k_sampling" : false,
|
| 13 |
+
"top_k" : 20
|
| 14 |
+
}
|
qwen3_5_text_p512_l0_together.axmodel
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:da1535dee113db715c53629631c4339f224d1b50f2526577a829c28f61f047e1
|
| 3 |
+
size 134403009
|
qwen3_5_text_p512_l10_together.axmodel
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:37c98517f4a845bdc2ccf74eef1e066e03296daaf2941875b5eb9b54c7ad89ca
|
| 3 |
+
size 119852337
|
qwen3_5_text_p512_l11_together.axmodel
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:d792509a2f2f5ed585873ce5f5aac670a1a80b60bc95dd4d4d9fa20cf3b76679
|
| 3 |
+
size 845348115
|
qwen3_5_text_p512_l12_together.axmodel
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:ae2e582e1b62d60424642e42729c788a120dd340600e805a76929da8d62460dc
|
| 3 |
+
size 119852349
|
qwen3_5_text_p512_l13_together.axmodel
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:9c9ad1887affdf0a354c1950917bac63b563d2eb5e59b9a2ee4b2806a2e2e71a
|
| 3 |
+
size 119852349
|
qwen3_5_text_p512_l14_together.axmodel
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:0e6fdf9a2f26596ed97ac9b69b871b56b589d593c64a7422243a3d5a898b13bc
|
| 3 |
+
size 119852349
|
qwen3_5_text_p512_l15_together.axmodel
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:dfdcae75ad416d214c56d7d3ef4f7223e2a11d85468c48b1bac4c49a706d5fdf
|
| 3 |
+
size 845348211
|
qwen3_5_text_p512_l16_together.axmodel
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:3edfa24b857e5a8fe19ca14f71a9526041188232781a96131fe3887e7ebd04f0
|
| 3 |
+
size 119852349
|
qwen3_5_text_p512_l17_together.axmodel
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:eb79ff6b30aba4799308e36200a56adb6a9d76d8e5c6d0ac14966d6392aab8ed
|
| 3 |
+
size 119852349
|
qwen3_5_text_p512_l18_together.axmodel
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:57afa37197218b1ee000d25dfcce2a4efefc34218169abc236204b3feb52018e
|
| 3 |
+
size 119852349
|
qwen3_5_text_p512_l19_together.axmodel
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:5b3daff656143551fdfe42fc839d21f0b79ec677db7d2af518df521fa5e05786
|
| 3 |
+
size 845348115
|
qwen3_5_text_p512_l1_together.axmodel
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:0d295b3055d07b1a32e74d9fcc63d26584b80b2b7c306b1af38e2867be7bca90
|
| 3 |
+
size 134402849
|
qwen3_5_text_p512_l20_together.axmodel
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:40e03c029d9d3b1b8cbe15630b58d07c55a4c24f924fe8130333a29fabac08e3
|
| 3 |
+
size 119852349
|
qwen3_5_text_p512_l21_together.axmodel
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:e04e2bf5cc569bba728d4387a8e3b5ba45cf62707841518e41b48d1e85bb834d
|
| 3 |
+
size 119852349
|
qwen3_5_text_p512_l22_together.axmodel
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:7769ddb2730d309ccefe667a5724864f358973b932a67d1904fee60c24c158f7
|
| 3 |
+
size 119852349
|
qwen3_5_text_p512_l23_together.axmodel
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:78b1ab8a22b80c4f04c2a7b761edbdde85654e9077449bb4b2e14b5c581ac098
|
| 3 |
+
size 845348115
|
qwen3_5_text_p512_l24_together.axmodel
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:5fa531925cf55f375f6690f7820f6c752c56b521df7828540595c694f3d50715
|
| 3 |
+
size 119852349
|
qwen3_5_text_p512_l25_together.axmodel
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:5e1d22c767f849866dfeab6d0462408930554db775a69022ac9def5d63c5addb
|
| 3 |
+
size 119852349
|
qwen3_5_text_p512_l26_together.axmodel
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:cd1406ca5a045533d0301b0f85e36c4243cff3b0b5897a6eed9f713909b1ffc0
|
| 3 |
+
size 119852349
|
qwen3_5_text_p512_l27_together.axmodel
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:039a64fe6a9a7bdbc8ca55b86b34db56d9705f3e25c1145b25fdf097da58a890
|
| 3 |
+
size 845348395
|
qwen3_5_text_p512_l28_together.axmodel
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:dd3d02b599f39a6b71fb3fd5d64d84fe65c7c63b659bf85f271814f29f7b503d
|
| 3 |
+
size 119852349
|
qwen3_5_text_p512_l29_together.axmodel
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:64a86161a1de3ecd3bcb4f8ca6a99c8f9791bcf9380c9c1feb40eb8bc39b684e
|
| 3 |
+
size 119852349
|
qwen3_5_text_p512_l2_together.axmodel
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:e85fb0be6a9086b5f2f9c4b56832a451fb5c37ecc31d7efb08de4720650456f8
|
| 3 |
+
size 134402849
|
qwen3_5_text_p512_l30_together.axmodel
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:5ff069aed0074eae23312dbdd7360f77302e3c613ffe8f0db12e5cba2f16e64c
|
| 3 |
+
size 119852349
|
qwen3_5_text_p512_l31_together.axmodel
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:36bad2c1f31654228022e93473b1291617cf8f0d1a906fb123dddb53eff0beba
|
| 3 |
+
size 845348115
|
qwen3_5_text_p512_l3_together.axmodel
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:351588714c10c4b76f40e106e3ad276e1969139ad1a4fb9686884e4665bd3868
|
| 3 |
+
size 845348315
|
qwen3_5_text_p512_l4_together.axmodel
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:0b8d34b873e8c52be909df995f963e0e8ffb5d3ce330b417a9a7e8da6eb8e904
|
| 3 |
+
size 119852321
|
qwen3_5_text_p512_l5_together.axmodel
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:2e740cd348e419ccefd76337098b066607059937d9950192a1096e40b3cbac97
|
| 3 |
+
size 119852321
|
qwen3_5_text_p512_l6_together.axmodel
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:62e17c7ea7be0323ec383ea5010f078f03adfe7ba5d5c9e64644854d44c77f9c
|
| 3 |
+
size 119852321
|
qwen3_5_text_p512_l7_together.axmodel
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:cd8eb429723447b8d1710313685c0a9dfcdf5b4e2db004c0b54a075cca0b2c3a
|
| 3 |
+
size 845348315
|
qwen3_5_text_p512_l8_together.axmodel
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:a099abcb1c25bbb97392b5c339a3bcabdab6c3158a19f43bfccd89eb4f67a7c2
|
| 3 |
+
size 119852321
|
qwen3_5_text_p512_l9_together.axmodel
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:bc5e46f2fb309667ece29ed533804fd12205a80a7d9b5471588d0f21ada28abd
|
| 3 |
+
size 119852321
|
qwen3_5_text_post.axmodel
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:99299be8d6d03eff0dc6f3eda3ffc2a5bad9431c22777956dfa21f21a1924851
|
| 3 |
+
size 693922612
|
qwen3_5_tokenizer.txt
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:7e75de1f279a10b65bd9dc1a5207205cb8993823861c4c42bbbd74e48e1c23a4
|
| 3 |
+
size 6465727
|
qwen3_5_vision.axmodel
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
version https://git-lfs.github.com/spec/v1
|
| 2 |
+
oid sha256:efbed451722825d69a3e74127dbeabfca159982794f5f7ee1bec8966d0b093ce
|
| 3 |
+
size 373149243
|