Qwen3-32B 베이스모델을 파인튜닝 후 양자화 시 사용가능 여부 질문

#1
by goniii - opened

Qwen에서 제공하는 Qwen3-32B 베이스 모델을 파인튜닝 하고 unsloth로 FP8 양자화 시킨 모델을 NPU 환경에서 바로 사용가능한가요?

FuriosaAI org

안녕하세요? 동일한 커널 컴파일이 요구되도록 quantization config를 맞춰주시면 추가 컴파일 없이 바로 사용 가능합니다.

FuriosaAI org

한 가지 정정하겠습니다. 현재 릴리즈된 furiosa-ai/Qwen3-32B-FP8 모델은 FXB 대신 기존 방식인 artifact로 되어 있어서 제가 위에서 말씀 드린 것 처럼 바로 되지는 않겠네요. 혼란드려 죄송합니다.

향후 릴리즈될 2026.4 에서 furiosa-ai/Qwen3-32B-FP8 도 위에서 답변 드린 것 처럼 쓸 수 있는 fxb (https://developer.furiosa.ai/latest/en/furiosa_llm/fxb.html) 라는 새로운 포맷으로 변경됩니다. 이 변경이 적용되면 위에서 답변 드린 것 처럼 사용할 수 있습니다. 2026.4 릴리즈는 8월 중순 경으로 예상되나 그전에 베타 릴리즈도 있을 예정이니 업데이트 드리겠습니다.

답변 감사합니다.

혹시 릴리즈 전에 파인튜닝 후 양자화 하여 모델을 서빙하고 싶다면 furiosa-llm을 이용하면 양자화 가능할까요? 혹시 관련하여 가이드 및 샘플 코드를 확인할 수 있는 곳이 있을까요?

양자화는 unsloth로 https://huggingface.co/furiosa-ai/Qwen3-32B-FP8/blob/main/config.json#L88-L96 처럼 되도록 동일하게 맞춰주시면 됩니다.
컴파일은 https://developer.furiosa.ai/latest/en/furiosa_llm/model-preparation.html#converting-a-model-to-a-model-artifact 설명대로 하시면 됩니다.

하지만, Artifact를 통한 컴파일은 시간이 훨씬 오래 걸리고 fine-tune 하여 weights가 업데이트 되면 다시 컴파일해야 하는 문제가 있습니다.
따라서, FXB를 사용한 방법을 권장드리고 싶지만 당장 제공이 안되어 송구하네요. https://pypi.org/project/furiosa-llm/2026.4.0b7/#history 에서 보시는 것 처럼 2026.4 b7까지 외부에 공개되어 있는데요. b8 부터 이 모델에 대한 FXB가 제공되고 있습니다. 이 릴리즈가 준비되는대로 이 글에 한번 더 업데이트 드리도록 하겠습니다. 약 1-2주 정도 걸릴 것 같습니다.

Sign up or log in to comment