Qwen3-32B 베이스모델을 파인튜닝 후 양자화 시 사용가능 여부 질문
Qwen에서 제공하는 Qwen3-32B 베이스 모델을 파인튜닝 하고 unsloth로 FP8 양자화 시킨 모델을 NPU 환경에서 바로 사용가능한가요?
안녕하세요? 동일한 커널 컴파일이 요구되도록 quantization config를 맞춰주시면 추가 컴파일 없이 바로 사용 가능합니다.
한 가지 정정하겠습니다. 현재 릴리즈된 furiosa-ai/Qwen3-32B-FP8 모델은 FXB 대신 기존 방식인 artifact로 되어 있어서 제가 위에서 말씀 드린 것 처럼 바로 되지는 않겠네요. 혼란드려 죄송합니다.
향후 릴리즈될 2026.4 에서 furiosa-ai/Qwen3-32B-FP8 도 위에서 답변 드린 것 처럼 쓸 수 있는 fxb (https://developer.furiosa.ai/latest/en/furiosa_llm/fxb.html) 라는 새로운 포맷으로 변경됩니다. 이 변경이 적용되면 위에서 답변 드린 것 처럼 사용할 수 있습니다. 2026.4 릴리즈는 8월 중순 경으로 예상되나 그전에 베타 릴리즈도 있을 예정이니 업데이트 드리겠습니다.
답변 감사합니다.
혹시 릴리즈 전에 파인튜닝 후 양자화 하여 모델을 서빙하고 싶다면 furiosa-llm을 이용하면 양자화 가능할까요? 혹시 관련하여 가이드 및 샘플 코드를 확인할 수 있는 곳이 있을까요?
양자화는 unsloth로 https://huggingface.co/furiosa-ai/Qwen3-32B-FP8/blob/main/config.json#L88-L96 처럼 되도록 동일하게 맞춰주시면 됩니다.
컴파일은 https://developer.furiosa.ai/latest/en/furiosa_llm/model-preparation.html#converting-a-model-to-a-model-artifact 설명대로 하시면 됩니다.
하지만, Artifact를 통한 컴파일은 시간이 훨씬 오래 걸리고 fine-tune 하여 weights가 업데이트 되면 다시 컴파일해야 하는 문제가 있습니다.
따라서, FXB를 사용한 방법을 권장드리고 싶지만 당장 제공이 안되어 송구하네요. https://pypi.org/project/furiosa-llm/2026.4.0b7/#history 에서 보시는 것 처럼 2026.4 b7까지 외부에 공개되어 있는데요. b8 부터 이 모델에 대한 FXB가 제공되고 있습니다. 이 릴리즈가 준비되는대로 이 글에 한번 더 업데이트 드리도록 하겠습니다. 약 1-2주 정도 걸릴 것 같습니다.