carsonhxsu
# This is a combination of 22 commits.
8453337
Raw
History Blame Contribute Delete
796 Bytes
export FMHA_VERSION=V2 # 如使用旧版本Attn,设置 FMHA_VERSION=OFF
export KV_CACHE_DTYPE=DEFAULT # 如使用KVCache Int8,设置 KV_CACHE_DTYPE=INT8
model_path=ModelPath # 转换后模型所处文件夹路径 (1-gpu-fp16.bin等文件所在目录)
data_type=fp16 # 权重保存精度
memopt_mode=0 # MEMOPT模式: 0/1
quant_type="int8" # 量化精度: int4/int8
max_output_length=256
warmups=1
avgnums=1
python batch_demo.py --model-path $model_path\
--tokenizer-path $model_path\
--data-type $data_type\
--memopt_mode $memopt_mode\
--quant-type ${quant_type}\
--max-output-length $max_output_length\
--warmups $warmups\
--avgnums $avgnums