lihongjie commited on
Commit
4222f23
·
1 Parent(s): b54a120
Files changed (40) hide show
  1. .gitattributes +36 -0
  2. README.md +320 -0
  3. config.json +29 -0
  4. model.embed_tokens.weight.bfloat16.bin +3 -0
  5. post_config.json +14 -0
  6. qwen3_5_text_p512_l0_together.axmodel +3 -0
  7. qwen3_5_text_p512_l10_together.axmodel +3 -0
  8. qwen3_5_text_p512_l11_together.axmodel +3 -0
  9. qwen3_5_text_p512_l12_together.axmodel +3 -0
  10. qwen3_5_text_p512_l13_together.axmodel +3 -0
  11. qwen3_5_text_p512_l14_together.axmodel +3 -0
  12. qwen3_5_text_p512_l15_together.axmodel +3 -0
  13. qwen3_5_text_p512_l16_together.axmodel +3 -0
  14. qwen3_5_text_p512_l17_together.axmodel +3 -0
  15. qwen3_5_text_p512_l18_together.axmodel +3 -0
  16. qwen3_5_text_p512_l19_together.axmodel +3 -0
  17. qwen3_5_text_p512_l1_together.axmodel +3 -0
  18. qwen3_5_text_p512_l20_together.axmodel +3 -0
  19. qwen3_5_text_p512_l21_together.axmodel +3 -0
  20. qwen3_5_text_p512_l22_together.axmodel +3 -0
  21. qwen3_5_text_p512_l23_together.axmodel +3 -0
  22. qwen3_5_text_p512_l24_together.axmodel +3 -0
  23. qwen3_5_text_p512_l25_together.axmodel +3 -0
  24. qwen3_5_text_p512_l26_together.axmodel +3 -0
  25. qwen3_5_text_p512_l27_together.axmodel +3 -0
  26. qwen3_5_text_p512_l28_together.axmodel +3 -0
  27. qwen3_5_text_p512_l29_together.axmodel +3 -0
  28. qwen3_5_text_p512_l2_together.axmodel +3 -0
  29. qwen3_5_text_p512_l30_together.axmodel +3 -0
  30. qwen3_5_text_p512_l31_together.axmodel +3 -0
  31. qwen3_5_text_p512_l3_together.axmodel +3 -0
  32. qwen3_5_text_p512_l4_together.axmodel +3 -0
  33. qwen3_5_text_p512_l5_together.axmodel +3 -0
  34. qwen3_5_text_p512_l6_together.axmodel +3 -0
  35. qwen3_5_text_p512_l7_together.axmodel +3 -0
  36. qwen3_5_text_p512_l8_together.axmodel +3 -0
  37. qwen3_5_text_p512_l9_together.axmodel +3 -0
  38. qwen3_5_text_post.axmodel +3 -0
  39. qwen3_5_tokenizer.txt +3 -0
  40. qwen3_5_vision.axmodel +3 -0
.gitattributes CHANGED
@@ -33,3 +33,39 @@ saved_model/**/* filter=lfs diff=lfs merge=lfs -text
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
33
  *.zip filter=lfs diff=lfs merge=lfs -text
34
  *.zst filter=lfs diff=lfs merge=lfs -text
35
  *tfevents* filter=lfs diff=lfs merge=lfs -text
36
+ qwen3_5_text_p512_l1_together.axmodel filter=lfs diff=lfs merge=lfs -text
37
+ qwen3_5_text_p512_l7_together.axmodel filter=lfs diff=lfs merge=lfs -text
38
+ qwen3_5_text_p512_l23_together.axmodel filter=lfs diff=lfs merge=lfs -text
39
+ qwen3_5_text_p512_l26_together.axmodel filter=lfs diff=lfs merge=lfs -text
40
+ qwen3_5_text_p512_l28_together.axmodel filter=lfs diff=lfs merge=lfs -text
41
+ qwen3_5_text_p512_l5_together.axmodel filter=lfs diff=lfs merge=lfs -text
42
+ qwen3_5_text_p512_l8_together.axmodel filter=lfs diff=lfs merge=lfs -text
43
+ qwen3_5_vision.axmodel filter=lfs diff=lfs merge=lfs -text
44
+ qwen3_5_text_p512_l10_together.axmodel filter=lfs diff=lfs merge=lfs -text
45
+ qwen3_5_text_p512_l20_together.axmodel filter=lfs diff=lfs merge=lfs -text
46
+ qwen3_5_text_p512_l0_together.axmodel filter=lfs diff=lfs merge=lfs -text
47
+ qwen3_5_text_p512_l21_together.axmodel filter=lfs diff=lfs merge=lfs -text
48
+ qwen3_5_text_p512_l22_together.axmodel filter=lfs diff=lfs merge=lfs -text
49
+ qwen3_5_text_p512_l24_together.axmodel filter=lfs diff=lfs merge=lfs -text
50
+ qwen3_5_text_post.axmodel filter=lfs diff=lfs merge=lfs -text
51
+ qwen3_5_text_p512_l15_together.axmodel filter=lfs diff=lfs merge=lfs -text
52
+ qwen3_5_text_p512_l18_together.axmodel filter=lfs diff=lfs merge=lfs -text
53
+ qwen3_5_text_p512_l31_together.axmodel filter=lfs diff=lfs merge=lfs -text
54
+ qwen3_5_text_p512_l14_together.axmodel filter=lfs diff=lfs merge=lfs -text
55
+ qwen3_5_text_p512_l16_together.axmodel filter=lfs diff=lfs merge=lfs -text
56
+ qwen3_5_text_p512_l27_together.axmodel filter=lfs diff=lfs merge=lfs -text
57
+ qwen3_5_text_p512_l3_together.axmodel filter=lfs diff=lfs merge=lfs -text
58
+ qwen3_5_text_p512_l6_together.axmodel filter=lfs diff=lfs merge=lfs -text
59
+ qwen3_5_text_p512_l11_together.axmodel filter=lfs diff=lfs merge=lfs -text
60
+ qwen3_5_text_p512_l13_together.axmodel filter=lfs diff=lfs merge=lfs -text
61
+ qwen3_5_text_p512_l25_together.axmodel filter=lfs diff=lfs merge=lfs -text
62
+ qwen3_5_text_p512_l29_together.axmodel filter=lfs diff=lfs merge=lfs -text
63
+ qwen3_5_text_p512_l2_together.axmodel filter=lfs diff=lfs merge=lfs -text
64
+ qwen3_5_text_p512_l9_together.axmodel filter=lfs diff=lfs merge=lfs -text
65
+ qwen3_5_text_p512_l12_together.axmodel filter=lfs diff=lfs merge=lfs -text
66
+ qwen3_5_text_p512_l17_together.axmodel filter=lfs diff=lfs merge=lfs -text
67
+ qwen3_5_text_p512_l4_together.axmodel filter=lfs diff=lfs merge=lfs -text
68
+ qwen3_5_text_p512_l19_together.axmodel filter=lfs diff=lfs merge=lfs -text
69
+ qwen3_5_text_p512_l30_together.axmodel filter=lfs diff=lfs merge=lfs -text
70
+ model.embed_tokens.weight.bfloat16.bin filter=lfs diff=lfs merge=lfs -text
71
+ qwen3_5_tokenizer.txt filter=lfs diff=lfs merge=lfs -text
README.md CHANGED
@@ -1,3 +1,323 @@
1
  ---
2
  license: mit
 
 
 
 
 
 
 
 
 
 
 
 
 
3
  ---
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
  ---
2
  license: mit
3
+ language:
4
+ - en
5
+ - zh
6
+ base_model:
7
+ - Qwen/Qwen3.5-4B
8
+ pipeline_tag: image-text-to-text
9
+ library_name: transformers
10
+ tags:
11
+ - Qwen3.5
12
+ - Qwen3.5-4B
13
+ - VLM
14
+ - GPTQ
15
+ - Int4
16
  ---
17
+
18
+ # Qwen3.5-4B
19
+
20
+ This version of Qwen3.5-4B has been converted to run on the Axera NPU using **w4a16** quantization.
21
+
22
+ Compatible with Pulsar2 version: 5.0
23
+
24
+ ## Convert tools links:
25
+
26
+ For those who are interested in model conversion, you can try to export axmodel through the original repo :
27
+
28
+ - https://huggingface.co/Qwen/Qwen3.5-4B
29
+
30
+ [Pulsar2 Link, How to Convert LLM from Huggingface to axmodel](https://pulsar2-docs.readthedocs.io/en/latest/appendix/build_llm.html)
31
+
32
+ [AXera NPU HOST LLM Runtime](https://github.com/AXERA-TECH/ax-llm.git)
33
+
34
+
35
+ ## Support Platform
36
+
37
+ - AX650
38
+ - AX650N DEMO Board
39
+ - [M4N-Dock(爱芯派Pro)](https://wiki.sipeed.com/hardware/zh/maixIV/m4ndock/m4ndock.html)
40
+ - [M.2 Accelerator card](https://docs.m5stack.com/zh_CN/ai_hardware/LLM-8850_Card)
41
+
42
+ **Image Process**
43
+ |Chips| input size | image num | ttft(168 tokens) | w4a16 | CMM | Flash |
44
+ |--|--|--|--|--|--|--|
45
+ |AX650| 384*384 | 1 | 845 ms | 5.7 tokens/sec| 4.91GiB | 5.59GiB |
46
+
47
+ **Video Process**
48
+ |Chips| input size | image num | ttft(600 tokens) | w4a16 | CMM | Flash |
49
+ |--|--|--|--|--|--|--|
50
+ |AX650| 384*384 | 8 | 2111 ms | 5.7 tokens/sec| 4.91GiB | 5.59GiB |
51
+
52
+
53
+
54
+ The DDR capacity refers to the CMM memory that needs to be consumed. Ensure that the CMM memory allocation on the development board is greater than this value.
55
+
56
+ ## How to use
57
+
58
+ ## 安装 axllm
59
+ 方式一:克隆仓库后执行安装脚本:
60
+
61
+ ```shell
62
+ git clone -b axllm https://github.com/AXERA-TECH/ax-llm.git
63
+ cd ax-llm
64
+ ./install.sh
65
+ ```
66
+
67
+ 方式二:一行命令安装(默认分支 `axllm`):
68
+
69
+ ```shell
70
+ curl -fsSL https://raw.githubusercontent.com/AXERA-TECH/ax-llm/axllm/install.sh | bash
71
+ ```
72
+
73
+ 方式三:下载Github Actions CI 导出的可执行程序(适合没有编译环境的用户):
74
+
75
+ 如果没有编译环境,请到:
76
+ `https://github.com/AXERA-TECH/ax-llm/actions?query=branch%3Aaxllm`
77
+ 下载 **最新 CI 导出的可执行程序**(`axllm`),然后:
78
+
79
+ ```shell
80
+ chmod +x axllm
81
+ sudo mv axllm /usr/bin/axllm
82
+ ```
83
+
84
+ ## 模型下载(Hugging Face)
85
+ 先创建模型目录并进入,然后下载到该目录:
86
+
87
+ ```shell
88
+ mkdir -p AXERA-TECH/Qwen3.5-4B-AX650-GPTQ-Int4-C256-P10K-CTX12K
89
+ cd AXERA-TECH/Qwen3.5-4B-AX650-GPTQ-Int4-C256-P10K-CTX12K
90
+ hf download AXERA-TECH/Qwen3.5-4B-AX650-GPTQ-Int4-C256-P10K-CTX12K --local-dir .
91
+
92
+ # structure of the downloaded files
93
+ tree -L 3
94
+ `-- AXERA-TECH
95
+ `-- Qwen3.5-4B-AX650-GPTQ-Int4-C256-P10K-CTX12K
96
+ |-- qwen3_5_vision.axmodel
97
+ |-- README.md
98
+ |-- config.json
99
+ |-- image.png
100
+ |-- model.embed_tokens.weight.bfloat16.bin
101
+ |-- post_config.json
102
+ |-- qwen3_5_tokenizer.txt
103
+ |-- qwen3_5_text_p128_l0_together.axmodel
104
+ ...
105
+ |-- qwen3_5_text_p128_l23_together.axmodel
106
+ |-- qwen3_5_text_post.axmodel
107
+ `-- vision_cache
108
+
109
+ 3 directories, 39 files
110
+ ```
111
+
112
+ ## Inference with AX650 Host, such as M4N-Dock(爱芯派Pro) or AX650N DEMO Board
113
+
114
+ ### 运行(CLI)
115
+
116
+ ```shell
117
+ root@ax650 ~/yongqiang/lhj/Qwen3_5.AXERA/ax-llm # axllm run Qwen3.5-4B-AX650-GPTQ-Int4-C256-P10K-CTX12K/
118
+ 11:40:21.412 INF Init:218 | LLM init start
119
+ 11:40:21.412 INF Init:226 | mixed attention enabled: full_attention_interval=4 ref_full_layer_idx=3
120
+ tokenizer_type = 3
121
+ 96% | ############################## | 26 / 27 [3.78s<3.93s, 6.87 count/s] init post axmodel ok,remain_cmm(5589 MB)
122
+ 11:40:25.195 INF Init:368 | max_token_len : 2047
123
+ 11:40:25.195 INF Init:371 | kv_cache_size : 512, kv_cache_num: 2047
124
+ 11:40:25.195 INF Init:374 | prefill_token_num : 128
125
+ 11:40:25.195 INF Init:379 | grp: 1, prefill_max_kv_cache_num : 1
126
+ 11:40:25.195 INF Init:379 | grp: 2, prefill_max_kv_cache_num : 128
127
+ 11:40:25.195 INF Init:379 | grp: 3, prefill_max_kv_cache_num : 256
128
+ 11:40:25.195 INF Init:379 | grp: 4, prefill_max_kv_cache_num : 384
129
+ 11:40:25.195 INF Init:379 | grp: 5, prefill_max_kv_cache_num : 512
130
+ 11:40:25.195 INF Init:379 | grp: 6, prefill_max_kv_cache_num : 768
131
+ 11:40:25.195 INF Init:379 | grp: 7, prefill_max_kv_cache_num : 1024
132
+ 11:40:25.195 INF Init:379 | grp: 8, prefill_max_kv_cache_num : 1152
133
+ 11:40:25.195 INF Init:384 | prefill_max_token_num : 1152
134
+ 11:40:25.195 INF Init:27 | LLaMaEmbedSelector use mmap
135
+ 100% | ################################ | 27 / 27 [3.79s<3.79s, 7.13 count/s] embed_selector init ok
136
+ 11:40:25.478 INF Init:643 | Qwen-VL token ids: vision_start=248053 image_pad=248056 video_pad=248057
137
+ 11:40:25.478 INF Init:668 | VisionModule init ok: type=Qwen3VL, tokens_per_block=144, embed_size=2048, out_dtype=fp32
138
+ 11:40:25.478 WRN Init:677 | Vision preprocess backend: SimpleCV (OpenCV not found at build time; minor differences vs OpenCV are possible)
139
+ 11:40:25.480 INF load_config:282 | load config:
140
+ 11:40:25.480 INF load_config:282 | {
141
+ 11:40:25.480 INF load_config:282 | "enable_repetition_penalty": false,
142
+ 11:40:25.480 INF load_config:282 | "enable_temperature": false,
143
+ 11:40:25.480 INF load_config:282 | "enable_top_k_sampling": true,
144
+ 11:40:25.480 INF load_config:282 | "enable_top_p_sampling": false,
145
+ 11:40:25.480 INF load_config:282 | "penalty_window": 20,
146
+ 11:40:25.480 INF load_config:282 | "repetition_penalty": 1.2,
147
+ 11:40:25.480 INF load_config:282 | "temperature": 0.9,
148
+ 11:40:25.480 INF load_config:282 | "top_k": 10,
149
+ 11:40:25.480 INF load_config:282 | "top_p": 0.8
150
+ 11:40:25.480 INF load_config:282 | }
151
+ 11:40:25.480 INF Init:448 | LLM init ok
152
+ Commands:
153
+ /q, /exit 退出
154
+ /reset 重置 kvcache
155
+ /dd 删除一轮对话
156
+ /pp 打印历史对话
157
+ Ctrl+C: 停止当前生成
158
+ VLM enabled: after each prompt, input image path (empty = text-only). Use "video:<frames_dir>" for video.
159
+ ----------------------------------------
160
+ prompt >> 描述视频内容
161
+ media >> video:assets/football.mp4:1.5
162
+ 17:54:19.424 INF extract_video_frames_ffmpeg:299 | Extracting raw video container to frames: assets/football.mp4 -> /tmp/axllm_video_frames/video_77305085315876_0 fps=1.4985014985014984
163
+ 17:54:40.848 INF collect_video_frame_paths:379 | Video fps sampling: path=assets/football.mp4 fps=1.5 duration=60.060s target_frames=90 selected=90
164
+ 17:55:01.670 INF SetKVCache:2543 | decode_grpid:3 prefill_grpid:6 history_cap:0 total_cap:256 symbolic_cap:1 precompute_len:0 input_num_token:6504 prefer_symbolic_group:0
165
+ 17:55:01.670 INF SetKVCache:2565 | current prefill_max_token_num:10496
166
+ 17:55:02.375 INF SetKVCache:2581 | first run
167
+ 17:55:02.481 INF Run:2738 | input token num : 6504, prefill_split_num : 26
168
+ 17:55:02.481 INF Run:2818 | prefill chunk p=0 history_len=0 grpid=6 kv_cache_num=0 input_tokens=256
169
+ 17:55:03.405 INF Run:2818 | prefill chunk p=1 history_len=256 grpid=8 kv_cache_num=512 input_tokens=256
170
+ 17:55:04.400 INF Run:2818 | prefill chunk p=2 history_len=512 grpid=9 kv_cache_num=768 input_tokens=256
171
+ 17:55:05.385 INF Run:2818 | prefill chunk p=3 history_len=768 grpid=10 kv_cache_num=1024 input_tokens=256
172
+ 17:55:06.362 INF Run:2818 | prefill chunk p=4 history_len=1024 grpid=11 kv_cache_num=1280 input_tokens=256
173
+ 17:55:07.365 INF Run:2818 | prefill chunk p=5 history_len=1280 grpid=12 kv_cache_num=1536 input_tokens=256
174
+ 17:55:08.399 INF Run:2818 | prefill chunk p=6 history_len=1536 grpid=13 kv_cache_num=1792 input_tokens=256
175
+ 17:55:09.466 INF Run:2818 | prefill chunk p=7 history_len=1792 grpid=14 kv_cache_num=2048 input_tokens=256
176
+ 17:55:10.592 INF Run:2818 | prefill chunk p=8 history_len=2048 grpid=15 kv_cache_num=2304 input_tokens=256
177
+ 17:55:11.649 INF Run:2818 | prefill chunk p=9 history_len=2304 grpid=16 kv_cache_num=2560 input_tokens=256
178
+ 17:55:12.724 INF Run:2818 | prefill chunk p=10 history_len=2560 grpid=17 kv_cache_num=2816 input_tokens=256
179
+ 17:55:13.798 INF Run:2818 | prefill chunk p=11 history_len=2816 grpid=18 kv_cache_num=3072 input_tokens=256
180
+ 17:55:14.886 INF Run:2818 | prefill chunk p=12 history_len=3072 grpid=19 kv_cache_num=3328 input_tokens=256
181
+ 17:55:15.985 INF Run:2818 | prefill chunk p=13 history_len=3328 grpid=20 kv_cache_num=3584 input_tokens=256
182
+ 17:55:17.091 INF Run:2818 | prefill chunk p=14 history_len=3584 grpid=21 kv_cache_num=3840 input_tokens=256
183
+ 17:55:18.232 INF Run:2818 | prefill chunk p=15 history_len=3840 grpid=22 kv_cache_num=4096 input_tokens=256
184
+ 17:55:19.386 INF Run:2818 | prefill chunk p=16 history_len=4096 grpid=23 kv_cache_num=4352 input_tokens=256
185
+ 17:55:20.613 INF Run:2818 | prefill chunk p=17 history_len=4352 grpid=24 kv_cache_num=4608 input_tokens=256
186
+ 17:55:21.853 INF Run:2818 | prefill chunk p=18 history_len=4608 grpid=25 kv_cache_num=4864 input_tokens=256
187
+ 17:55:23.114 INF Run:2818 | prefill chunk p=19 history_len=4864 grpid=26 kv_cache_num=5120 input_tokens=256
188
+ 17:55:24.395 INF Run:2818 | prefill chunk p=20 history_len=5120 grpid=27 kv_cache_num=5376 input_tokens=256
189
+ 17:55:25.681 INF Run:2818 | prefill chunk p=21 history_len=5376 grpid=28 kv_cache_num=5632 input_tokens=256
190
+ 17:55:26.995 INF Run:2818 | prefill chunk p=22 history_len=5632 grpid=29 kv_cache_num=5888 input_tokens=256
191
+ 17:55:28.322 INF Run:2818 | prefill chunk p=23 history_len=5888 grpid=30 kv_cache_num=6144 input_tokens=256
192
+ 17:55:29.667 INF Run:2818 | prefill chunk p=24 history_len=6144 grpid=31 kv_cache_num=6400 input_tokens=256
193
+ 17:55:31.043 INF Run:2818 | prefill chunk p=25 history_len=6400 grpid=32 kv_cache_num=6656 input_tokens=104
194
+ 17:55:32.459 INF Run:3045 | ttft: 29978.45 ms
195
+ <think>17:55:32.459 INF Run:3076 | VLM decode positions: rope_start=6372 dense_kv_start=6504
196
+
197
+
198
+ </think>
199
+
200
+ 这段视频是一个关于足球比赛的直播或录像,具体是2019年1月30日巴塞罗那队与塞维利亚队的比赛。视频展示了比赛中的精彩瞬间和进球。
201
+
202
+ - **比赛场景**:视频展示了一场足球比赛的片段,场地为标准的足球场,有清晰的白色线条标记。
203
+ - **球员和队服**:
204
+ - 巴塞罗那队穿着蓝色和红色条纹的球衣,号码为10的球员是路易斯·苏亚雷斯(Luis Suárez)。
205
+ - 塞维利亚队穿着白色球衣。
206
+ - **比赛动作**:
207
+ - 在多个片段中,可以看到球员们在场上积极跑动和传球。
208
+ - 一个关键片段显示,巴塞罗那队在进攻中成功突破防守,最终由苏亚雷斯打入一球。
209
+ - 进球后,苏亚雷斯与队友庆祝,场面充满激情。
210
+ - **观众和氛围**:
211
+ - 观众席上坐满了观众,他们热情地为比赛加油。
212
+ - 场边的广告牌上可以看到“Nike”和“Estrella Damm”等品牌标识。
213
+ - **直播者**:
214
+ - 在视频的右上角,有一个直播者正在观看和评论比赛。他穿着巴塞罗那队的球衣,表情丰富,时而惊讶,时而兴奋,显然对比赛非常投入。
215
+ - **技术细节**:
216
+ - 视频底部有“FBS00MPS10"的水印,以及播放进度条,显示视频正在播放中。
217
+ - 视频标题为“Barcelona vs Sevilla 6-1 All Goals & Extended Highlights 30/01/2019 HD",表明这是该场比赛的完整进球和扩展集锦。
218
+
219
+ 这段视频通过多个镜头展示了比赛的紧张和精彩,以及球迷和直播者对比赛的热情。
220
+
221
+ 17:56:46.246 NTC Run:3445 | hit eos,decode avg 5.24 token/s
222
+ 17:56:46.246 INF GetKVCache:2496 | precompute_len:6892, remaining:3604 (tracked)
223
+ ```
224
+
225
+ ### 启动服务(OpenAI 兼容)
226
+
227
+ ```shell
228
+ root@ax650:~# axllm serve AXERA-TECH/Qwen3.5-4B-AX650-GPTQ-Int4-C256-P10K-CTX12K
229
+ [I][ Init][ 138]: LLM init start
230
+ tokenizer_type = 1
231
+ 96% | ███████████████████████████████ | 30 / 31 [4.63s<4.79s, 6.47 count/s] init post axmodel ok,remain_cmm(9563 MB)
232
+ [I][ Init][ 199]: max_token_len : 2047
233
+ [I][ Init][ 202]: kv_cache_size : 1024, kv_cache_num: 2047
234
+ [I][ Init][ 205]: prefill_token_num : 128
235
+ [I][ Init][ 209]: grp: 1, prefill_max_kv_cache_num : 1
236
+ [I][ Init][ 209]: grp: 2, prefill_max_kv_cache_num : 128
237
+ [I][ Init][ 209]: grp: 3, prefill_max_kv_cache_num : 256
238
+ [I][ Init][ 209]: grp: 4, prefill_max_kv_cache_num : 384
239
+ [I][ Init][ 209]: grp: 5, prefill_max_kv_cache_num : 512
240
+ [I][ Init][ 209]: grp: 6, prefill_max_kv_cache_num : 640
241
+ [I][ Init][ 209]: grp: 7, prefill_max_kv_cache_num : 768
242
+ [I][ Init][ 209]: grp: 8, prefill_max_kv_cache_num : 896
243
+ [I][ Init][ 209]: grp: 9, prefill_max_kv_cache_num : 1024
244
+ [I][ Init][ 209]: grp: 10, prefill_max_kv_cache_num : 1152
245
+ [I][ Init][ 214]: prefill_max_token_num : 1152
246
+ [I][ Init][ 27]: LLaMaEmbedSelector use mmap
247
+ 100% | ████████████████████████████████ | 31 / 31 [4.64s<4.64s, 6.69 count/s] embed_selector init ok
248
+ [W][ Init][ 457]: Qwen-VL vision size override: cfg=448x448 bytes=1204224, model_input_bytes=884736 -> 384x384 (square).
249
+ [I][ Init][ 641]: Qwen-VL token ids: vision_start=151652 image_pad=151655 video_pad=151656
250
+ [I][ Init][ 666]: VisionModule init ok: type=Qwen3VL, tokens_per_block=144, embed_size=2048, out_dtype=fp32
251
+ [I][ Init][ 672]: VisionModule deepstack enabled: layers=3
252
+ [I][ load_config][ 282]: load config:
253
+ {
254
+ "enable_repetition_penalty": false,
255
+ "enable_temperature": false,
256
+ "enable_top_k_sampling": false,
257
+ "enable_top_p_sampling": false,
258
+ "penalty_window": 20,
259
+ "repetition_penalty": 1.2,
260
+ "temperature": 0.9,
261
+ "top_k": 10,
262
+ "top_p": 0.8
263
+ }
264
+
265
+ [I][ Init][ 272]: LLM init ok
266
+ Starting server on port 8000 with model 'AXERA-TECH/Qwen3.5-4B-AX650-GPTQ-Int4-C256-P10K-CTX12K'...
267
+ OpenAI API Server starting on http://0.0.0.0:8000
268
+ Max concurrency: 1
269
+ Models: AXERA-TECH/Qwen3.5-4B-AX650-GPTQ-Int4-C256-P10K-CTX12K
270
+ ```
271
+
272
+ ### OpenAI 调用示例
273
+
274
+ ```python
275
+ from openai import OpenAI
276
+
277
+ API_URL = "http://127.0.0.1:8000/v1"
278
+ MODEL = "AXERA-TECH/Qwen3.5-4B-AX650-GPTQ-Int4-C256-P10K-CTX12K"
279
+
280
+ messages = [
281
+ {"role": "system", "content": [{"type": "text", "text": "you are a helpful assistant."}]},
282
+ {"role": "user", "content": "hello"},
283
+ ]
284
+
285
+ client = OpenAI(api_key="not-needed", base_url=API_URL)
286
+ completion = client.chat.completions.create(
287
+ model=MODEL,
288
+ messages=messages,
289
+ )
290
+
291
+ print(completion.choices[0].message.content)
292
+ ```
293
+
294
+
295
+ ### OpenAI 流式调用示例
296
+
297
+ ```python
298
+ from openai import OpenAI
299
+
300
+ API_URL = "http://127.0.0.1:8000/v1"
301
+ MODEL = "AXERA-TECH/Qwen3.5-4B-AX650-GPTQ-Int4-C256-P10K-CTX12K"
302
+
303
+ messages = [
304
+ {"role": "system", "content": [{"type": "text", "text": "you are a helpful assistant."}]},
305
+ {"role": "user", "content": "hello"},
306
+ ]
307
+
308
+ client = OpenAI(api_key="not-needed", base_url=API_URL)
309
+ stream = client.chat.completions.create(
310
+ model=MODEL,
311
+ messages=messages,
312
+ stream=True,
313
+ )
314
+
315
+ print("assistant:")
316
+ for ev in stream:
317
+ delta = getattr(ev.choices[0], "delta", None)
318
+ if delta and getattr(delta, "content", None):
319
+ print(delta.content, end="", flush=True)
320
+ print("
321
+ ")
322
+ ```
323
+
config.json ADDED
@@ -0,0 +1,29 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "system_prompt": "you are a helpful assistant.",
3
+ "model_name": "AXERA-TECH/Qwen3.5-4B-AX650-GPTQ-Int4-C512-P30k-CTX32k",
4
+ "url_tokenizer_model": "qwen3_5_tokenizer.txt",
5
+ "tokenizer_type": "Qwen3_5VL",
6
+ "post_config_path": "post_config.json",
7
+ "template_filename_axmodel": "qwen3_5_text_p512_l%d_together.axmodel",
8
+ "axmodel_num": 32,
9
+ "full_attention_interval": 4,
10
+ "filename_post_axmodel": "qwen3_5_text_post.axmodel",
11
+ "filename_tokens_embed": "model.embed_tokens.weight.bfloat16.bin",
12
+ "tokens_embed_num": 248320,
13
+ "tokens_embed_size": 2560,
14
+ "b_use_mmap_load_embed": true,
15
+ "b_use_mmap_load_layer": true,
16
+ "vlm_type": "Qwen3VL",
17
+ "filename_image_encoder_axmodel": "qwen3_5_vision.axmodel",
18
+ "vision_patch_size": 16,
19
+ "vision_width": 384,
20
+ "vision_height": 384,
21
+ "vision_temporal_patch_size": 2,
22
+ "vision_spatial_merge_size": 2,
23
+ "vision_fps": 1,
24
+ "vision_tokens_per_second": 1,
25
+ "vision_cache_dir": "vision_cache",
26
+ "devices": [
27
+ 0
28
+ ]
29
+ }
model.embed_tokens.weight.bfloat16.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2a68153b498532801ab605bb03fe617c57b3e6a3ba019301fb70ada0c864a2f7
3
+ size 1271398400
post_config.json ADDED
@@ -0,0 +1,14 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "enable_temperature" : false,
3
+ "temperature" : 0.7,
4
+
5
+ "enable_repetition_penalty" : false,
6
+ "repetition_penalty" : 1.0,
7
+ "penalty_window" : 20,
8
+
9
+ "enable_top_p_sampling" : false,
10
+ "top_p" : 0.8,
11
+
12
+ "enable_top_k_sampling" : false,
13
+ "top_k" : 20
14
+ }
qwen3_5_text_p512_l0_together.axmodel ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:da1535dee113db715c53629631c4339f224d1b50f2526577a829c28f61f047e1
3
+ size 134403009
qwen3_5_text_p512_l10_together.axmodel ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:37c98517f4a845bdc2ccf74eef1e066e03296daaf2941875b5eb9b54c7ad89ca
3
+ size 119852337
qwen3_5_text_p512_l11_together.axmodel ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d792509a2f2f5ed585873ce5f5aac670a1a80b60bc95dd4d4d9fa20cf3b76679
3
+ size 845348115
qwen3_5_text_p512_l12_together.axmodel ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ae2e582e1b62d60424642e42729c788a120dd340600e805a76929da8d62460dc
3
+ size 119852349
qwen3_5_text_p512_l13_together.axmodel ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9c9ad1887affdf0a354c1950917bac63b563d2eb5e59b9a2ee4b2806a2e2e71a
3
+ size 119852349
qwen3_5_text_p512_l14_together.axmodel ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0e6fdf9a2f26596ed97ac9b69b871b56b589d593c64a7422243a3d5a898b13bc
3
+ size 119852349
qwen3_5_text_p512_l15_together.axmodel ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:dfdcae75ad416d214c56d7d3ef4f7223e2a11d85468c48b1bac4c49a706d5fdf
3
+ size 845348211
qwen3_5_text_p512_l16_together.axmodel ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3edfa24b857e5a8fe19ca14f71a9526041188232781a96131fe3887e7ebd04f0
3
+ size 119852349
qwen3_5_text_p512_l17_together.axmodel ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:eb79ff6b30aba4799308e36200a56adb6a9d76d8e5c6d0ac14966d6392aab8ed
3
+ size 119852349
qwen3_5_text_p512_l18_together.axmodel ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:57afa37197218b1ee000d25dfcce2a4efefc34218169abc236204b3feb52018e
3
+ size 119852349
qwen3_5_text_p512_l19_together.axmodel ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5b3daff656143551fdfe42fc839d21f0b79ec677db7d2af518df521fa5e05786
3
+ size 845348115
qwen3_5_text_p512_l1_together.axmodel ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0d295b3055d07b1a32e74d9fcc63d26584b80b2b7c306b1af38e2867be7bca90
3
+ size 134402849
qwen3_5_text_p512_l20_together.axmodel ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:40e03c029d9d3b1b8cbe15630b58d07c55a4c24f924fe8130333a29fabac08e3
3
+ size 119852349
qwen3_5_text_p512_l21_together.axmodel ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e04e2bf5cc569bba728d4387a8e3b5ba45cf62707841518e41b48d1e85bb834d
3
+ size 119852349
qwen3_5_text_p512_l22_together.axmodel ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7769ddb2730d309ccefe667a5724864f358973b932a67d1904fee60c24c158f7
3
+ size 119852349
qwen3_5_text_p512_l23_together.axmodel ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:78b1ab8a22b80c4f04c2a7b761edbdde85654e9077449bb4b2e14b5c581ac098
3
+ size 845348115
qwen3_5_text_p512_l24_together.axmodel ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5fa531925cf55f375f6690f7820f6c752c56b521df7828540595c694f3d50715
3
+ size 119852349
qwen3_5_text_p512_l25_together.axmodel ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5e1d22c767f849866dfeab6d0462408930554db775a69022ac9def5d63c5addb
3
+ size 119852349
qwen3_5_text_p512_l26_together.axmodel ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:cd1406ca5a045533d0301b0f85e36c4243cff3b0b5897a6eed9f713909b1ffc0
3
+ size 119852349
qwen3_5_text_p512_l27_together.axmodel ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:039a64fe6a9a7bdbc8ca55b86b34db56d9705f3e25c1145b25fdf097da58a890
3
+ size 845348395
qwen3_5_text_p512_l28_together.axmodel ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:dd3d02b599f39a6b71fb3fd5d64d84fe65c7c63b659bf85f271814f29f7b503d
3
+ size 119852349
qwen3_5_text_p512_l29_together.axmodel ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:64a86161a1de3ecd3bcb4f8ca6a99c8f9791bcf9380c9c1feb40eb8bc39b684e
3
+ size 119852349
qwen3_5_text_p512_l2_together.axmodel ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e85fb0be6a9086b5f2f9c4b56832a451fb5c37ecc31d7efb08de4720650456f8
3
+ size 134402849
qwen3_5_text_p512_l30_together.axmodel ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5ff069aed0074eae23312dbdd7360f77302e3c613ffe8f0db12e5cba2f16e64c
3
+ size 119852349
qwen3_5_text_p512_l31_together.axmodel ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:36bad2c1f31654228022e93473b1291617cf8f0d1a906fb123dddb53eff0beba
3
+ size 845348115
qwen3_5_text_p512_l3_together.axmodel ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:351588714c10c4b76f40e106e3ad276e1969139ad1a4fb9686884e4665bd3868
3
+ size 845348315
qwen3_5_text_p512_l4_together.axmodel ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0b8d34b873e8c52be909df995f963e0e8ffb5d3ce330b417a9a7e8da6eb8e904
3
+ size 119852321
qwen3_5_text_p512_l5_together.axmodel ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2e740cd348e419ccefd76337098b066607059937d9950192a1096e40b3cbac97
3
+ size 119852321
qwen3_5_text_p512_l6_together.axmodel ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:62e17c7ea7be0323ec383ea5010f078f03adfe7ba5d5c9e64644854d44c77f9c
3
+ size 119852321
qwen3_5_text_p512_l7_together.axmodel ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:cd8eb429723447b8d1710313685c0a9dfcdf5b4e2db004c0b54a075cca0b2c3a
3
+ size 845348315
qwen3_5_text_p512_l8_together.axmodel ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a099abcb1c25bbb97392b5c339a3bcabdab6c3158a19f43bfccd89eb4f67a7c2
3
+ size 119852321
qwen3_5_text_p512_l9_together.axmodel ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:bc5e46f2fb309667ece29ed533804fd12205a80a7d9b5471588d0f21ada28abd
3
+ size 119852321
qwen3_5_text_post.axmodel ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:99299be8d6d03eff0dc6f3eda3ffc2a5bad9431c22777956dfa21f21a1924851
3
+ size 693922612
qwen3_5_tokenizer.txt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7e75de1f279a10b65bd9dc1a5207205cb8993823861c4c42bbbd74e48e1c23a4
3
+ size 6465727
qwen3_5_vision.axmodel ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:efbed451722825d69a3e74127dbeabfca159982794f5f7ee1bec8966d0b093ce
3
+ size 373149243