| export FMHA_VERSION=V2 # 如使用旧版本Attn,设置 FMHA_VERSION=OFF | |
| export KV_CACHE_DTYPE=DEFAULT # 如使用KVCache Int8,设置 KV_CACHE_DTYPE=INT8 | |
| model_path=ModelPath # 转换后模型所处文件夹路径 (1-gpu-fp16.bin等文件所在目录) | |
| data_type=fp16 # 权重保存精度 | |
| memopt_mode=0 # MEMOPT模式: 0/1 | |
| quant_type="int8" # 量化精度: int4/int8 | |
| max_output_length=256 | |
| warmups=1 | |
| avgnums=1 | |
| python batch_demo.py --model-path $model_path\ | |
| --tokenizer-path $model_path\ | |
| --data-type $data_type\ | |
| --memopt_mode $memopt_mode\ | |
| --quant-type ${quant_type}\ | |
| --max-output-length $max_output_length\ | |
| --warmups $warmups\ | |
| --avgnums $avgnums |