Instructions to use bluejude10/Smoothie-Qwen3-8B-KR-Self-Driving-Legal-v3 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- llama.cpp
How to use bluejude10/Smoothie-Qwen3-8B-KR-Self-Driving-Legal-v3 with llama.cpp:
Install (macOS, Linux)
curl -LsSf https://llama.app/install.sh | sh # Start a local OpenAI-compatible server with a web UI: llama serve -hf bluejude10/Smoothie-Qwen3-8B-KR-Self-Driving-Legal-v3:Q4_K_M # Run inference directly in the terminal: llama cli -hf bluejude10/Smoothie-Qwen3-8B-KR-Self-Driving-Legal-v3:Q4_K_M
Install from WinGet (Windows)
winget install llama.cpp # Start a local OpenAI-compatible server with a web UI: llama serve -hf bluejude10/Smoothie-Qwen3-8B-KR-Self-Driving-Legal-v3:Q4_K_M # Run inference directly in the terminal: llama cli -hf bluejude10/Smoothie-Qwen3-8B-KR-Self-Driving-Legal-v3:Q4_K_M
Use pre-built binary
# Download pre-built binary from: # https://github.com/ggerganov/llama.cpp/releases # Start a local OpenAI-compatible server with a web UI: ./llama-server -hf bluejude10/Smoothie-Qwen3-8B-KR-Self-Driving-Legal-v3:Q4_K_M # Run inference directly in the terminal: ./llama-cli -hf bluejude10/Smoothie-Qwen3-8B-KR-Self-Driving-Legal-v3:Q4_K_M
Build from source code
git clone https://github.com/ggerganov/llama.cpp.git cd llama.cpp cmake -B build cmake --build build -j --target llama-server llama-cli # Start a local OpenAI-compatible server with a web UI: ./build/bin/llama-server -hf bluejude10/Smoothie-Qwen3-8B-KR-Self-Driving-Legal-v3:Q4_K_M # Run inference directly in the terminal: ./build/bin/llama-cli -hf bluejude10/Smoothie-Qwen3-8B-KR-Self-Driving-Legal-v3:Q4_K_M
Use Docker
docker model run hf.co/bluejude10/Smoothie-Qwen3-8B-KR-Self-Driving-Legal-v3:Q4_K_M
- LM Studio
- Jan
- Ollama
How to use bluejude10/Smoothie-Qwen3-8B-KR-Self-Driving-Legal-v3 with Ollama:
ollama run hf.co/bluejude10/Smoothie-Qwen3-8B-KR-Self-Driving-Legal-v3:Q4_K_M
- Unsloth Desktop
- Pi
How to use bluejude10/Smoothie-Qwen3-8B-KR-Self-Driving-Legal-v3 with Pi:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf bluejude10/Smoothie-Qwen3-8B-KR-Self-Driving-Legal-v3:Q4_K_M
Configure the model in Pi
# Install Pi: npm install -g @earendil-works/pi-coding-agent # Add to ~/.pi/agent/models.json: { "providers": { "llama-cpp": { "baseUrl": "http://localhost:8080/v1", "api": "openai-completions", "apiKey": "none", "models": [ { "id": "bluejude10/Smoothie-Qwen3-8B-KR-Self-Driving-Legal-v3:Q4_K_M" } ] } } }Run Pi
# Start Pi in your project directory: pi
- Docker Model Runner
How to use bluejude10/Smoothie-Qwen3-8B-KR-Self-Driving-Legal-v3 with Docker Model Runner:
docker model run hf.co/bluejude10/Smoothie-Qwen3-8B-KR-Self-Driving-Legal-v3:Q4_K_M
- Lemonade
How to use bluejude10/Smoothie-Qwen3-8B-KR-Self-Driving-Legal-v3 with Lemonade:
Pull the model
# Download Lemonade from https://lemonade-server.ai/ lemonade pull bluejude10/Smoothie-Qwen3-8B-KR-Self-Driving-Legal-v3:Q4_K_M
Run and chat with the model
lemonade run user.Smoothie-Qwen3-8B-KR-Self-Driving-Legal-v3-Q4_K_M
List all available models
lemonade list
- Hermes Agent
How to use bluejude10/Smoothie-Qwen3-8B-KR-Self-Driving-Legal-v3 with Hermes Agent:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf bluejude10/Smoothie-Qwen3-8B-KR-Self-Driving-Legal-v3:Q4_K_M
Configure Hermes
# Install Hermes: curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash hermes setup # Point Hermes at the local server: hermes config set model.provider custom hermes config set model.base_url http://127.0.0.1:8080/v1 hermes config set model.default bluejude10/Smoothie-Qwen3-8B-KR-Self-Driving-Legal-v3:Q4_K_M
Run Hermes
hermes
- Atomic Chat
- OpenClaw
How to use bluejude10/Smoothie-Qwen3-8B-KR-Self-Driving-Legal-v3 with OpenClaw:
Start the llama.cpp server
# Install llama.cpp: brew install llama.cpp # Start a local OpenAI-compatible server: llama serve -hf bluejude10/Smoothie-Qwen3-8B-KR-Self-Driving-Legal-v3:Q4_K_M
Configure OpenClaw
# Install OpenClaw: npm install -g openclaw@latest # Register the local server and set it as the default model: openclaw onboard --non-interactive --mode local \ --auth-choice custom-api-key \ --custom-base-url http://127.0.0.1:8080/v1 \ --custom-model-id "bluejude10/Smoothie-Qwen3-8B-KR-Self-Driving-Legal-v3:Q4_K_M" \ --custom-provider-id llama-cpp \ --custom-compatibility openai \ --custom-text-input \ --accept-risk \ --skip-health
Run OpenClaw
openclaw agent --local --agent main --message "Hello from Hugging Face"
Smoothie-Qwen3-8B-KR-Self-Driving-Legal v3
자율주행법령 도메인 파인튜닝 + RAG 실험 최종 결과 보고서
본 문서는 2026-02-24 재검토를 통해 초기 README의 중대한 오류를 수정한 최종판입니다.
⚠️ 정정(Errata) 공지
기존 업로드된 v3 README에는 평가 결과 라벨 매핑 오류가 포함되어 있었습니다.
- 원본 README 주장: FT 모델 86.7%, 순정 모델 40.7% (FT 압도적 우위)
- 실제 평가 결과: FT 모델 43%, 순정 모델 90% (FT 열위)
내부 로그 및 다수의 독립 분석 문서와의 교차 검증 결과, 초기 README 작성 시 LLM 채점 과정에서 두 모델의 응답을 역순으로 입력하여 결과 레이블이 뒤바뀐 것으로 판단됩니다. 이로 인해 도출된 모든 결론(FT 우위, 물리적 AI 활용 가능성 등)은 신뢰할 수 없으며, 본 문서에서 전면 수정합니다.
0. 실험 요약 (Abstract)
본 연구는 대한민국 자율주행자동차 관련 법령에 특화한 8B 경량 언어모델의 파인튜닝이, 동일 도메인 RAG(Retrieval-Augmented Generation) 파이프라인에서 더 큰 순정 모델을 능가할 수 있는지를 검증하는 것을 목적으로 하였다.
Smoothie-Qwen3-8B를 베이스로 QLoRA 파인튜닝을 수행하였으며(750개 QnA 데이터셋, 3~5 에포크), 동일 RAG 조건 하에 4개 모델(FT-8B Q4, FT-8B Q8/CoT, Non-FT 8B, Non-FT 14B)을 15개 오답 유도형 질문으로 평가하였다.
핵심 결과:
- 주 가설 기각: 파인튜닝된 8B 모델(43~60%)이 순정 8B/14B 모델(90%)에 비해 현저히 낮은 성능을 보였다.
- 부수적 발견: RAG 벡터DB 구성 시 원문 법령 텍스트에 더하여 도메인 QnA 데이터셋을 함께 임베딩하면 응답 품질이 향상된다는 점을 실험적으로 확인하였다.
- 방법론적 교훈: RAG 기반 시스템에서의 파인튜닝은 모델이 검색된 문맥 대신 내부 학습 패턴을 우선하는 부작용을 유발할 수 있다.
1. 연구 동기 및 가설
1.1 연구 배경
물리적 AI(Physical AI) 및 자율주행 분야에서는 추론 성능과 하드웨어 제약 사이의 트레이드오프가 실제 배포의 핵심 문제다. 14B 이상의 대형 모델은 12GB 이상의 VRAM을 요구하여 엣지 디바이스나 일반 소비자 GPU(RTX 3080 Ti 12GB 수준)에서도 운용 여유가 매우 제한적이다.
반면 8B 모델은 4~8GB VRAM으로 작동 가능하여 경량화의 이점이 크다. 그러나 원시 8B 모델은 도메인 특화 법령 해석에서 14B 대비 성능 열위가 예상된다.
연구 질문: "도메인 특화 파인튜닝을 통해 8B 모델이 순정 14B 모델과 동등하거나 더 나은 성능을 달성할 수 있는가?"
1.2 연구 가설
가설 H1: 자율주행 법령 도메인으로 QLoRA 파인튜닝된 Qwen3-8B 모델은, 동일 도메인 RAG 파이프라인에서 순정 Qwen3-14B 모델보다 법령 해석 정확도가 높거나 동등할 것이다.
1.3 가설의 실용적 함의
본 가설이 참이라면, 고가 GPU 없이도 전문 도메인 LLM을 구성할 수 있어 하드웨어 노후화 문제를 지연시키는 실용적 전략이 될 수 있다. 그러나 본 실험 결과, 이 가설은 현재 실험 조건 하에서 기각되었다.
2. 실험 설계
2.1 모델 버전 발전 이력
본 모델(v3)에 이르기까지 아래의 개선 과정을 거쳤다.
| 버전 | 주요 변경 | 문제점 |
|---|---|---|
| v1 | 최초 파인튜닝 (기본 Alpaca 형식) | <think> 완전 비어있음, 문맥 소실, 법령 편향 고착 |
| v2 | 시스템 프롬프트 강화 + [출처:] 태그 삽입 |
시스템 프롬프트가 3,750회 반복 주입되어 편향 악화 |
| v3 | DTRO(Direct To Response) 스타일 변환 (강제 프롬프트·힌트 태그 제거) | <think> 여전히 비어있음, 멀티턴 대화 불가 |
v3의 데이터셋 구조 변환 (핵심 개선):
// v2 (문제)
{
"instruction": "당신은 자율주행자동차법 전문가입니다...(시스템 프롬프트 750×5=3,750회 주입)",
"input": "자율주행자동차란? [출처: 자동차관리법 제2조]",
"output": "단답형 답변"
}
// v3 (개선: DTRO Style)
{
"instruction": "자율주행자동차란 무엇인가요?",
"output": "자율주행자동차란..."
}
v3는 데이터 구조 편향(시스템 프롬프트 강제 주입, 출처 힌트)은 해소했으나, Chain-of-Thought 추론 학습 데이터가 없어 <think> 복원에는 실패했다.
2.2 데이터셋 구성
| 항목 | 내용 |
|---|---|
| 데이터 규모 | 750개 QnA 쌍 |
| 도메인 | 대한민국 자율주행자동차 관련 법령 (자동차관리법, 여객자동차법, 자율주행자동차법 시행규칙 등) |
| 구성 방식 | 법령 원문에서 추출한 오답 유도형 질문 30건 + 일반 법령 설명형 720건 |
| 포맷 | DTRO Style (순수 질문 → 정확한 답변, 추론 과정 없음) |
| 출처 태그 | 제거 (v2의 복사 편향 방지) |
한계: 질문 프레이밍이 단일 패턴(긍정 방향 다수)으로 편향되어, 부정 방향 질문에 대한 일반화 능력을 학습하지 못함.
2.3 파인튜닝 설정 (QLoRA)
| 항목 | v3 (일반 QnA) | v5/CoT (후속 실험) |
|---|---|---|
| 베이스 모델 | dnotitia/Smoothie-Qwen3-8B | dnotitia/Smoothie-Qwen3-8B |
| 어댑터 | QLoRA (r=16, alpha=32) | QLoRA (동일) |
| 에포크 | 5 | 3 |
| 학습률 | 2e-4 | 2e-4 |
| 배치 크기 | 4 (gradient_accumulation=4) | 4 |
| VRAM | RTX 3080 Ti 12GB | 동일 |
| CoT 여부 | ✗ (단순 Q→A) | ✅ (<think>...</think> 포함) |
| 양자화 | Q4_K_M | Q8_0 |
2.4 RAG 파이프라인 구성
모든 평가에 동일한 RAG 환경을 사용하였다.
[RAG 아키텍처]
입력 질문
│
▼
BGE-M3 임베딩 (multilingual, 고품질 한국어 지원)
│
▼
Qdrant 벡터 DB 검색 (MMR + 재순위화)
│
┌──────────────────────────────────────┐
│ 벡터 DB 구성 내용 │
│ ① 법령 원문 TXT (청크 단위 임베딩) │
│ ② QnA 데이터셋 JSON (Q+A 쌍 임베딩) │ ← 부수적 긍정 발견
└──────────────────────────────────────┘
│
▼
상위 컨텍스트 추출
│
▼
[평가 대상 모델 4종] → 응답 생성
중요 설계 선택: 벡터 DB에 법령 원문뿐 아니라 QnA 데이터셋 자체도 임베딩했다. 이는 후술하는 부수적 발견의 핵심 요소이다.
2.5 평가 방법론
| 항목 | 내용 |
|---|---|
| 평가 질문 | 15개 오답 유도형 함정 질문 (NotebookLM 생성) |
| 질문 특성 | 법령 세부 조건을 뒤집거나, 유사 개념을 혼용하여 오답을 유도하도록 설계 |
| 채점 기준 | ✅ 정답(결론+근거 정확), ⚠️ 부분 정답(방향 맞으나 오류 포함), ❌ 오답(결론 오류) |
| 독립 평가자 | Claude Opus 4.6 (Thinking 모드), GPT-5.2-High |
| 가중 점수 | ✅=2점, ⚠️=1점, ❌=0점 (만점 30점) |
| 유사도 분류 | 훈련 데이터와 테스트 질문 간 의미 유사도를 4단계 분류 |
3. 실험 결과
3.1 정량 결과 (6개 모델 종합 최종판)
후속 실험에서 Gemma3n E4B(할 4B급) 및 DTRO 8B(전력설비 도메인 FT) 2개 모델을 추가 비교하였다.
| 순위 | 모델 | ✅ 정답 | ⚠️ 부분 | ❌ 오답 | 가중점(/30) | 정답률 |
|---|---|---|---|---|---|---|
| 1 | Non-FT 14B | 13 | 1 | 1 | 27 | 90% |
| 1 | Non-FT 8B | 13 | 1 | 1 | 27 | 90% |
| 3 | Gemma3n E4B | 13 | 0 | 2 | 26 | 87% |
| 4 | DTRO 8B (전력설비 FT) | 11 | 2 | 2 | 24 | 80% |
| 5 | FT-8B (Q8/CoT, v5) | 6 | 6 | 3 | 18 | 60% |
| 6 | FT-8B (Q4, v3) | 4 | 5 | 6 | 13 | 43% |
정답률 시각화:
Non-FT 14B ████████████████████████████████████████████████ 90%
Non-FT 8B ████████████████████████████████████████████████ 90%
Gemma3n E4B ██████████████████████████████████████████████░░ 87% ← 4B급!
DTRO 8B ██████████████████████████████████████████░░░░░░ 80%
FT-8B (Q8) █████████████████████████████░░░░░░░░░░░░░░░░░░░ 60%
FT-8B (Q4) █████████████████████░░░░░░░░░░░░░░░░░░░░░░░░░░░ 43%
결론: 가설 H1 기각. 파인튜닝된 8B 모델(4360%)이 Non-FT 모델(90%) 대비 **3047%p 낙은 성능**을 보였다. 또한 Gemma3n E4B가 ~4B 파라미터로 87%를 달성하며, RAG 환경에서 모델 크기보다 RAG 품질이 핑심 변수임이 확인되었다.
3.2 문항별 판정 (4개 모델 비교)
| Q# | 주제 | 유사도 | FT-8B(Q4) | FT-8B(Q8/CoT) | Non-FT 8B | Non-FT 14B |
|---|---|---|---|---|---|---|
| Q1 | 레벨3 비상/위험최소화 | 🔴높음 | ❌ | ⚠️ | ✅ | ⚠️ |
| Q2 | CSMS 인증 갱신 | 🟡중간 | ⚠️ | ⚠️ | ✅ | ✅ |
| Q3 | 유상운송 허가 | 🔴높음 | ❌ | ❌ | ⚠️ | ✅ |
| Q4 | 안전구간 정밀지도 | 🟢낮음 | ⚠️ | ✅ | ✅ | ✅ |
| Q5 | 윤리 딜레마 | 🟡중간 | ✅ | ⚠️* | ✅ | ✅ |
| Q6 | 임시운행 무인전환 | 🟢낮음 | ⚠️ | ⚠️ | ✅ | ✅ |
| Q7 | 레벨4 운전석 이탈 | 🟡중~높 | ❌ | ✅ | ✅ | ✅ |
| Q8 | 손해배상 1차 책임 | 🟡중간 | ⚠️ | ✅ | ❌ | ❌ |
| Q9 | DSSAD 제출 거부 | 🔴높음 | ⚠️ | ✅ | ✅ | ✅ |
| Q10 | 오버라이드 전환 | 🟢낮음 | ✅ | ⚠️ | ✅ | ✅ |
| Q11 | 시범지구 직권 해제 | 🔴🔴매우높음 | ❌ | ❌ | ✅ | ✅ |
| Q12 | 경미 사고 보고 | 🟢낮음 | ✅ | ❌ | ✅ | ✅ |
| Q13 | C-ITS 단절 대응 | 🟡중~높 | ✅ | ✅ | ✅ | ✅ |
| Q14 | 상호 변경 신고 | 🟢낮음 | ❌ | ⚠️ | ✅ | ✅ |
| Q15 | 성능인증 vs 적합성 | 🔴🔴매우높음 | ⚠️ | ✅ | ✅ | ✅ |
*Q5 (FT-8B Q8/CoT): 내용은 정확하나 "참고문서 1"이 89회 이상 반복되는 생성 루프 발생
3.3 유사도별 성능 분석
파인튜닝 모델에서 발견된 가장 충격적인 패턴은 **"훈련 데이터와 유사한 질문일수록 오히려 정답률이 낮다"**는 역설이다.
FT-8B (Q4) – 유사도별 정답률:
🔴🔴 매우 높음 (Q11, Q15): 0/2 ············· 0% (← 기대: 가장 높아야 함)
🔴 높음 (Q1, Q3, Q9): 0/3 ············ 0%
🟡 중간 (Q2,Q5,Q7,Q8,Q13): 3.5/5 ············ 70%
🟢 낮음 (Q4,Q6,Q10,Q12,Q14): 3/5 ············ 60%
Non-FT 8B – 유사도별 정답률:
🔴🔴 매우 높음: 2/2 ············· 100%
🔴 높음: 2.5/3 ············· 83%
🟡 중간: 4/5 ············· 80%
🟢 낮음: 5/5 ············· 100%
이 역전 현상은 파인튜닝 모델이 법령의 내용이 아닌 답변의 표면적 패턴을 학습했음을 강력히 시사한다.
3.4 파인튜닝 모델의 5가지 실패 패턴
① 템플릿 과적합 (Template Overfitting) — 가장 치명적
모델이 질문의 논리적 방향을 이해하지 않고, "아닙니다 + 설명"이라는 형식 자체를 암기하였다.
[훈련 데이터]
Q: "반드시 시·도지사의 신청이 있어야만 합니까?"
A: "아닙니다. (...) 직권으로 해제할 수 있습니다." ← 올바른 부정
[테스트 질문: 방향 반전]
Q: "직권으로 해제할 수 있습니까?"
[FT-8B 답변]
A: "아닙니다. (...) 직권으로 해제할 수 있습니다."
↑ 결론(부정)과 설명(긍정)이 모순 → 패턴만 재생
② 핵심 용어 혼동 (Concept Confusion)
정답: "위험최소화운행(Risk Minimal Maneuver)"
FT-8B: "비상운행(감속 또는 정지)" ← 전혀 다른 개념 혼용
→ 훈련 과정에서 두 개념이 동일 맥락으로 과다 노출되어 구분 능력 손실
③ 긍정/부정 응답 불일치 (Affirmation Inconsistency)
Q: "적합성 승인이 면제됩니까?"
FT-8B: "네, (...) 적합성 승인을 받아야 합니다."
↑ "네"(면제됨)와 "받아야"(면제 안 됨)가 동시 출력
→ 학습 데이터의 긍정/부정 패턴이 뒤섞여 혼용
④ 핵심 조건 탈락 (Critical Condition Omission)
훈련 데이터: "시·도지사 허가 + 국토교통부장관 협의(필수)"
FT-8B: "시·도지사 허가만으로 가능" ← 핵심 단서 누락
Non-FT 14B: RAG 문맥에서 두 조건을 모두 정확히 추출
⑤ RAG 문맥 무시 (Context Bypass)
[동일 RAG 컨텍스트 제공 상황]
Non-FT 8B: RAG 내용 정확히 참조 → ✅
Non-FT 14B: RAG 내용 정확히 참조 → ✅
FT-8B: 내부 학습 패턴 우선, RAG 컨텍스트 무시 → ❌
→ 파인튜닝으로 내장된 편향이 RAG의 효과를 약화시킴
3.5 CoT 파인튜닝(v5 Q8)이 가져온 변화
CoT 방식의 후속 파인튜닝(v5, Q8 양자화)은 +17%p 개선을 달성했으나 새로운 문제를 도입했다.
개선된 사항:
- 긍정/부정 응답 불일치: 3건 → 1건 (67% 감소)
- 레벨 개념 혼동 (Q7) 해소: ❌ → ✅
- Q8(손해배상) — 4개 모델 중 유일하게 정답: Non-FT 8B/14B도 오답인 고난도 법적 해석 질문에서 CoT 학습의 이점을 발휘
새로 발생한 문제:
| 문제 유형 | 설명 | 사례 |
|---|---|---|
| 반복 루프 | CoT long-form 생성 중 종료 토큰 인식 실패로 "참고문서 1"이 89회 반복 | Q5 |
| 교차 오염 | "임시운행" 키워드로 다른 훈련 데이터(소프트웨어 변경 신고) 내용을 잘못 매칭 | Q12 |
CoT의 유사도별 양면성:
유사도 높은 질문: +34~50%p 개선 (학습된 reasoning chain 직접 활용)
유사도 낮은 질문: -10%p 악화 (교차 오염으로 오히려 새 오류 발생)
4. 부수적 긍정 발견: QnA 임베딩의 RAG 성능 향상
4.1 발견 내용
본 실험에서 RAG 벡터 DB를 구성할 때 ①법령 원문 TXT와 함께 ②파인튜닝에 사용한 QnA 데이터셋(750쌍)을 동시에 임베딩하였다. 이 구성 하에서 Non-FT 모델들이 90%라는 높은 정답률을 달성하였으며, QnA 임베딩이 응답 품질 향상에 기여한 것으로 판단된다.
QnA 데이터셋의 임베딩은 다음과 같은 이점을 제공한다:
| 이점 | 설명 |
|---|---|
| 질문-답변 쌍 직접 검색 | 유사 질문에 대한 정답 패턴을 RAG 컨텍스트로 직접 제공 |
| 법령 원문 보완 | 원문 자체는 조문 형식이라 RAG 청크가 질문에 직접 대응하기 어려운 경우, QnA가 의미적 연결 역할 |
| 개념 경계 명시 | "비상운행 vs 위험최소화운행" 같은 유사 개념 구분을 명시적으로 서술한 QnA가 검색됨으로써 오답 유도 방지 |
4.2 실용적 함의
파인튜닝보다 비용 대비 효과가 높은 대안:
[파인튜닝 접근] [QnA 임베딩 접근]
GPU 학습 (수 시간) QnA 생성 (수십 분)
모델 가중치 변형 모델 가중치 보존
RAG 무시 경향 도입 RAG 활용 극대화
업데이트 시 재학습 필요 데이터 추가로 즉시 업데이트
→ 43~60% 성능 → 90% 성능 (Non-FT + QnA RAG)
권고: 도메인 특화 응답 성능 개선이 목표라면, 파인튜닝에 앞서 고품질 QnA 데이터셋을 RAG 벡터 DB에 함께 임베딩하는 방식을 우선 검토할 것을 권장한다.
5. 종합 모델 비교 매트릭스
| 평가 축 | FT-8B(Q4) | FT-8B(Q8/CoT) | Non-FT 8B | Non-FT 14B |
|---|---|---|---|---|
| 정답률 | 43% | 60% | 90% | 90% |
| 개념 구분 능력 | ❌ 혼동 빈발 | ⚠️ 부분 개선 | ✅ 양호 | ✅ 양호 |
| 긍정/부정 일관성 | ❌ 3건 모순 | ⚠️ 1건 모순 | ✅ 일관 | ✅ 일관 |
| RAG 문맥 활용 | ❌ 무시 경향 | ⚠️ 부분 활용 | ✅ 충분 | ✅ 충분 |
| 생성 안정성 | ⚠️ 간헐적 | ❌ 반복 루프 | ✅ 안정 | ✅ 안정 |
| 고난도 법적 해석 | ⚠️ | ✅ Q8 유일 정답 | ❌ | ❌ |
| VRAM 요구량 | ~6 GB | ~8 GB | ~6 GB | ~12 GB |
6. 고찰 (Discussion)
6.1 왜 파인튜닝이 순정 모델보다 나빴는가
RAG 기반 시스템에서의 파인튜닝 역효과:
| 기대 효과 | 실제 결과 |
|---|---|
| 도메인 지식 내재화 | RAG가 이미 고품질 컨텍스트 제공 → 파인튜닝 지식이 중복·충돌 |
| 일관된 출력 형식 | 특정 "아닙니다 + 설명" 패턴으로 과적합 → 형식 고정, 내용 오류 |
| 전문가 수준 추론 | 일부 개선(+17%p CoT), 그러나 일반화 능력 동시 손실 |
| RAG 문서 정확 활용 | 학습된 패턴이 우선되어 오히려 RAG 활용 감소 |
근본 원인: 750개의 QnA가 5에포크 반복 학습되면서 특정 질문-응답 패턴에 과적합이 발생했다. 모델은 질문의 논리적 구조를 이해하기보다 "이런 키워드가 나오면 → 이런 패턴으로 응답"이라는 연관 매핑을 학습한 것으로 보인다.
6.2 순정 8B와 14B가 동일한 이유
비파인튜닝 8B와 14B가 동일한 90%를 기록했다는 점은, 현재 RAG 파이프라인의 품질이 충분히 높아서 모델 크기 차이가 응답 품질에 큰 영향을 주지 않는 임계점에 도달했음을 시사한다. BGE-M3의 높은 임베딩 품질과 MMR 기반 다양성 검색이 이 결과에 기여한 것으로 해석된다.
6.3 CoT 파인튜닝의 잠재적 가치와 한계
CoT 데이터(v5)는 긍정적 신호를 보였다(Q8 단독 우위). 그러나 소규모 모델(8B)에서 CoT를 적용할 때의 고유한 위험이 확인되었다: EOS(종료) 토큰 확률이 낮아져 반복 루프가 발생하며, reasoning chain이 표면적 키워드에 의존하여 교차 오염이 일어난다. 충분한 데이터(3,000개 이상)와 다양한 프레이밍, 그리고 반복 억제 패턴의 학습 없이는 유효한 개선으로 이어지기 어렵다.
6.4 방법론적 오류의 영향과 재발 방지
초기 비교 실험에서 두 모델의 응답을 LLM 채점 시 역순으로 입력하는 오류가 발생했다. 이로 인해 실제로는 열위인 FT 모델이 우위로 채점되었으며, FT 모델 우위라는 잘못된 결론이 공표되었다. 향후 실험에서는 아래를 의무화한다:
- 모델 태그를 응답 로그에 기계적으로 기록
- 채점 전 모델-응답 매핑 이중 검증
- 동일 질문셋/동일 컨텍스트/동일 파라미터 유지
- 원본 응답·채점 원문 아카이브 보관
7. 결론
7.1 가설 검증 결과
가설 H1 기각: 현재 실험 조건에서 QLoRA 파인튜닝된 8B 모델은 순정 14B 모델을 능가하지 못한다.
최선 결과(FT-8B Q8/CoT) 기준으로도 **Non-FT 8B/14B 대비 30%p 낮은 성능(60% vs 90%)**이 측정되었으며, 생성 안정성 면에서도 열위를 보였다. 현재의 실험 설계(소규모 단순 QnA 데이터셋 + 다수 에포크)로는 RAG 기반 시스템에서 파인튜닝을 통한 경량화 전략이 유효하지 않음이 확인되었다.
7.2 유효한 발견 요약
| 구분 | 발견 내용 |
|---|---|
| 주요 부정적 발견 | RAG 기반 시스템에서 소규모 QLoRA 파인튜닝은 모델의 RAG 활용 능력을 저하시킬 수 있다 |
| 주요 긍정적 발견 | 도메인 QnA 데이터셋을 RAG 벡터 DB에 함께 임베딩하면 응답 품질이 향상된다 |
| 제한적 FT 가치 | CoT 파인튜닝은 고난도 법적 해석 질문에서 순정 모델이 틀린 경우 더 정확할 수 있다 |
| 방법론 교훈 | 소규모 데이터셋 + 다수 에포크의 파인튜닝은 질문 프레이밍 변화에 취약한 과적합을 유발한다 |
7.3 실용적 권고
정확성 우선 시나리오 (법령 해석, 자문 등):
1순위: Non-FT 8B + 도메인 QnA 임베딩 RAG (90%, ~6 GB VRAM, 비용 최저)
2순위: Non-FT 14B + 도메인 QnA 임베딩 RAG (90%, ~12 GB VRAM, 답변 상세함)
비권장: FT-8B Q8/CoT (60%, 생성 불안정)
⚠️ 본 모델(v3)을 자율주행 시스템의 실제 판단 로직, 법률 자문, 또는 안전 크리티컬 용도로 사용하는 것은 권고하지 않는다. 본 실험은 연구·학습 목적의 탐색적 실험이며 배포 준비된 시스템이 아니다.
7.4 향후 연구 방향
현재 가설이 기각되었더라도 아래의 조건 하에서는 재검증 가치가 있다:
| 우선순위 | 개선 방향 | 근거 |
|---|---|---|
| 1 | RAG-Aware 파인튜닝: 학습 데이터에 RAG 검색 결과를 컨텍스트로 포함 | FT가 RAG를 무시하는 근본 원인 해소 |
| 2 | 질문 프레이밍 다양화: 동일 질문을 긍정형/부정형/조건형으로 3배수 생성 | 템플릿 과적합 방지 |
| 3 | 에포크 축소 + 학습률 감소 (5→2에포크, 2e-4→5e-5) | 과적합 억제 |
| 4 | 데이터셋 규모 확대 (750→3,000+개) | 일반화 능력 향상 |
| 5 | 반복 억제 학습 데이터 포함 | CoT의 반복 루프 방지 |
8. 알려진 한계
| 한계 | 설명 |
|---|---|
| 평가 규모 | 15개 질문으로 평가 — 통계적 유의성 확보를 위해 100개 이상의 다양한 질문셋 필요 |
| 단일 도메인 | 자율주행 법령으로 한정 — 타 도메인에의 일반화 불가 |
| 하드웨어 제약 | 단일 RTX 3080 Ti 12GB에서 실험 — 더 큰 배치/학습률 탐색 제한 |
| RAG 설계 분리 불가 | QnA 임베딩 효과를 파인튜닝 효과와 완전히 분리한 대조 실험 미수행 |
| 단일 베이스 모델 | dnotitia/Smoothie-Qwen3-8B만 사용 — 타 8B 모델로의 일반화 불명 |
| 채점자 의존 | LLM 채점에 의존 — 인간 전문가(법률가) 교차 채점 미수행 |
모델 정보
| 항목 | 내용 |
|---|---|
| 베이스 모델 | dnotitia/Smoothie-Qwen3-8B |
| 파인튜닝 방법 | QLoRA (r=16, alpha=32, 5 에포크) |
| 학습 데이터 | 자율주행자동차 관련 법령 QnA 750쌍 (DTRO 스타일) |
| 언어 | 한국어 |
| 라이선스 | Apache 2.0 |
| 실험 목적 | 연구·탐색적 실험 (배포용 아님) |
🔗 관련 리소스
| 리소스 | 링크 |
|---|---|
| 실험용 RAG 챗봇 (GitHub) | Legal_RAG_Chatbot_Qdrant_BGE — Qdrant DB 사전 구축 포함, 즉시 실행 가능 |
| 학습 데이터셋 v3 (DTRO) | HuggingFace Datasets |
| 학습 데이터셋 v5 (CoT) | HuggingFace Datasets |
본 보고서는 2026-02-24 재검토 기준으로 작성되었으며, 초기 README(2026-02-21)의 결과 레이블 오류를 포함한 모든 오류를 전면 수정한 최종판입니다.
- Downloads last month
- 33
docker model run hf.co/bluejude10/Smoothie-Qwen3-8B-KR-Self-Driving-Legal-v3:Q4_K_M