batisay-ko-turbo 1.1 출시 — 실사용 통화 일반화 회복

#1
by hero775 - opened
BatiAI org

안녕하세요. 한국어 음성인식(STT) 모델 batisay-ko-turbo의 1.1 업데이트를 공유합니다. Whisper-large-v3-turbo(809M) 기반 파인튜닝 모델입니다.

v1.1 핵심: 실통화 일반화 회복

이전 1.0은 상담통화 도메인에 과적합되어, 정작 실사용 통화(다양한 화자·환경·길이)에서는 일반화가 무너졌습니다. 실통화 CER이 28.9%로 무료 base(19.11%)보다도 나빴습니다.

1.1은 이 문제를 정조준해 해결했습니다.

  • 실통화 CER이 MLX fp16 14.85% / ggml q5_0 17.1% 로, 무료 base(19.11%)를 추월했습니다.
  • 3사이클에 걸쳐 일관되게 하락했습니다: 16.3% → 14.9% → 14.85%.
  • 51분 long-form 구간 CER은 31.1% → 19.4% 로 크게 안정화됐습니다.
  • 멀티도메인 성능은 1.0과 동급으로 유지했습니다 (회복을 위해 다른 도메인을 희생하지 않음).

벤치마크

실통화 (2~51분 실제 통화 5건, CER)

모델 포맷 실통화 CER
batisay-ko-turbo 1.1 MLX fp16 14.85%
batisay-ko-turbo 1.1 ggml q5_0 17.1%
batisay-ko-base (무료) — 19.11%
batisay-ko-turbo 1.0 (이전) — 28.9%

멀티도메인 (도메인별 N=500, GPU transformers, CER)

도메인 CER
일반 clean 6.99%
상담통화 5.67%
회의 8.90%
일상대화 3.00%

다운로드 / 사용법

저장소: huggingface.co/batiai/batisay-ko-turbo — ggml과 safetensors/MLX를 단일 repo에 통합했습니다 (구 -GGUF repo는 리다이렉트).

포맷:

  • ggml q5_0 (548M) — whisper.cpp 권장
  • ggml q8_0 (834M) — 고품질
  • ggml q4_0 (453M) — 경량
  • f32 / safetensors — MLX·transformers

whisper.cpp (ggml q5_0)

# 모델 다운로드
huggingface-cli download batiai/batisay-ko-turbo \
    ggml-q5_0.bin --local-dir .

# 추론
./main -m ggml-q5_0.bin -l ko -f call.wav

긴 통화(long-form) 안정 옵션 권장: condition_off, temperature fallback, compression threshold 2.4, logprob threshold -1.0, no_speech off.

MLX (safetensors)

import mlx_whisper

result = mlx_whisper.transcribe(
    "call.wav",
    path_or_hf_repo="batiai/batisay-ko-turbo",
)
print(result["text"])

transformers 런타임도 safetensors로 동일하게 사용할 수 있습니다.

라이선스

BatiAI Community v2 (gated=auto — 폼 작성 즉시 다운로드). 매출 10억 미만·외부 판매 없음 = 무료, 외부 SaaS·매출 10억+ = 협의(support@bati.ai).

무료 대안

상업 조건에 걸리거나 게이팅 없이 쓰고 싶다면 batisay-ko-base (Apache 2.0)를 권장합니다. 실통화 CER 19.11%로, turbo 1.1보다는 높지만 충분히 실용적인 무료 base 모델입니다.


BatiFlow(Apple Silicon 온디바이스 한국어 STT 앱, flow.bati.ai)에서는 turbo 1.1이 통화 기본 모델로 자동 적용됩니다. 피드백·이슈 환영합니다.

Sign up or log in to comment