Add independent Ko-FaithBench evaluation (0.780 standard / 0.521 hard) — honest update
Browse files
README.md
CHANGED
|
@@ -36,6 +36,17 @@ RAG 파이프라인의 출력 게이트, LLM 납품 인수검증, 생성 콘텐
|
|
| 36 |
- v1 대비 핵심 개선: 문장형 데이터만으로 학습하면 span형 입력에서 판별이 붕괴(포맷 shortcut)하는 문제를
|
| 37 |
다포맷(문장형+span형) 학습으로 해결했습니다.
|
| 38 |
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 39 |
## 정직한 한계 (읽고 쓰세요)
|
| 40 |
|
| 41 |
1. **negative(환각) 샘플이 LLM 생성 + 룰 변형(숫자/개체 치환, 타문서 이식)으로 만들어졌습니다.**
|
|
|
|
| 36 |
- v1 대비 핵심 개선: 문장형 데이터만으로 학습하면 span형 입력에서 판별이 붕괴(포맷 shortcut)하는 문제를
|
| 37 |
다포맷(문장형+span형) 학습으로 해결했습니다.
|
| 38 |
|
| 39 |
+
## 🔴 Ko-FaithBench 독립 실측 (2026-07-05 추가 — 반드시 읽으세요)
|
| 40 |
+
|
| 41 |
+
공개 후 저희가 직접 만든 독립 벤치마크 [Ko-FaithBench](https://huggingface.co/datasets/jismsy/ko-faithbench)(본 모델 학습데이터와 무관, LLM 생성 환각)에서 재측정한 결과입니다:
|
| 42 |
+
|
| 43 |
+
| 셋 | acc | AUROC | 해석 |
|
| 44 |
+
|---|---|---|---|
|
| 45 |
+
| Standard (982) | **0.780** | 0.851 | 아래 '성능'의 룰 기반 OOD 0.966은 **과대평가**였습니다 (같은 룰 패밀리 전이) |
|
| 46 |
+
| Hard (380) | **0.521** | 0.542 | **chance 수준.** 환각 recall 0.958 + 충실 오탐 0.916 = 고난도 구간에서 본 모델은 사실검증이 아니라 문체 휴리스틱(재구성·단정 문체→환각 판정)으로 동작합니다 |
|
| 47 |
+
|
| 48 |
+
참고로 같은 Standard 셋에서 프런티어 LLM(DeepSeek-V4-Flash zero-shot)은 0.991입니다. 본 모델의 실용 범위는 "온프렘·무료·대량처리가 필요한 경우의 0.6B 경량 스크리너"이며, 고난도·고위험 판별에는 사용하지 마십시오. v3에서 LLM 생성 환각을 학습에 반영할 예정입니다.
|
| 49 |
+
|
| 50 |
## 정직한 한계 (읽고 쓰세요)
|
| 51 |
|
| 52 |
1. **negative(환각) 샘플이 LLM 생성 + 룰 변형(숫자/개체 치환, 타문서 이식)으로 만들어졌습니다.**
|