batisay-ko-turbo 1.1 출시 — 실사용 통화 일반화 회복
안녕하세요. 한국어 음성인식(STT) 모델 batisay-ko-turbo의 1.1 업데이트를 공유합니다. Whisper-large-v3-turbo(809M) 기반 파인튜닝 모델입니다.
v1.1 핵심: 실통화 일반화 회복
이전 1.0은 상담통화 도메인에 과적합되어, 정작 실사용 통화(다양한 화자·환경·길이)에서는 일반화가 무너졌습니다. 실통화 CER이 28.9%로 무료 base(19.11%)보다도 나빴습니다.
1.1은 이 문제를 정조준해 해결했습니다.
- 실통화 CER이 MLX fp16 14.85% / ggml q5_0 17.1% 로, 무료 base(19.11%)를 추월했습니다.
- 3사이클에 걸쳐 일관되게 하락했습니다: 16.3% → 14.9% → 14.85%.
- 51분 long-form 구간 CER은 31.1% → 19.4% 로 크게 안정화됐습니다.
- 멀티도메인 성능은 1.0과 동급으로 유지했습니다 (회복을 위해 다른 도메인을 희생하지 않음).
벤치마크
실통화 (2~51분 실제 통화 5건, CER)
| 모델 | 포맷 | 실통화 CER |
|---|---|---|
| batisay-ko-turbo 1.1 | MLX fp16 | 14.85% |
| batisay-ko-turbo 1.1 | ggml q5_0 | 17.1% |
| batisay-ko-base (무료) | — | 19.11% |
| batisay-ko-turbo 1.0 (이전) | — | 28.9% |
멀티도메인 (도메인별 N=500, GPU transformers, CER)
| 도메인 | CER |
|---|---|
| 일반 clean | 6.99% |
| 상담통화 | 5.67% |
| 회의 | 8.90% |
| 일상대화 | 3.00% |
다운로드 / 사용법
저장소: huggingface.co/batiai/batisay-ko-turbo — ggml과 safetensors/MLX를 단일 repo에 통합했습니다 (구 -GGUF repo는 리다이렉트).
포맷:
ggml q5_0(548M) — whisper.cpp 권장ggml q8_0(834M) — 고품질ggml q4_0(453M) — 경량f32/safetensors— MLX·transformers
whisper.cpp (ggml q5_0)
# 모델 다운로드
huggingface-cli download batiai/batisay-ko-turbo \
ggml-q5_0.bin --local-dir .
# 추론
./main -m ggml-q5_0.bin -l ko -f call.wav
긴 통화(long-form) 안정 옵션 권장: condition_off, temperature fallback, compression threshold 2.4, logprob threshold -1.0, no_speech off.
MLX (safetensors)
import mlx_whisper
result = mlx_whisper.transcribe(
"call.wav",
path_or_hf_repo="batiai/batisay-ko-turbo",
)
print(result["text"])
transformers 런타임도 safetensors로 동일하게 사용할 수 있습니다.
라이선스
BatiAI Community v2 (gated=auto — 폼 작성 즉시 다운로드). 매출 10억 미만·외부 판매 없음 = 무료, 외부 SaaS·매출 10억+ = 협의(support@bati.ai).
무료 대안
상업 조건에 걸리거나 게이팅 없이 쓰고 싶다면 batisay-ko-base (Apache 2.0)를 권장합니다. 실통화 CER 19.11%로, turbo 1.1보다는 높지만 충분히 실용적인 무료 base 모델입니다.
BatiFlow(Apple Silicon 온디바이스 한국어 STT 앱, flow.bati.ai)에서는 turbo 1.1이 통화 기본 모델로 자동 적용됩니다. 피드백·이슈 환영합니다.