Ąžuolas — faster-whisper pavidalas
Tai akisviete/azuolas-whisper-lt
modelis, paverstas į CTranslate2 pavidalą, kad veiktų su faster-whisper.
Svoriai tie patys; saugykloje — dvi kvantizacijos:
- float16 — šaknyje (
model.bin, 2,9 GB); - int8_float16 — aplapte
int8_float16/(model.bin, 1,5 GB, −48 %), tikslumas beveik nekinta (žr. „Rezultatai“ žemiau).
Visas aprašymas, rezultatai ir įspėjimai — pagrindinėje saugykloje: https://huggingface.co/akisviete/azuolas-whisper-lt
float16 (šaknis)
from faster_whisper import WhisperModel
m = WhisperModel("akisviete/azuolas-whisper-lt-ct2", device="cuda",
compute_type="float16")
segs, _ = m.transcribe("irasas.wav", language="lt", beam_size=5,
vad_filter=True, condition_on_previous_text=False)
for s in segs:
print(f"[{s.start:6.2f} -> {s.end:6.2f}] {s.text}")
int8_float16 (aplanas int8_float16/)
faster-whisper pats atsiunčia tik šaknies failus, todėl int8 aplanką
atsisiunčiate atskirai ir rodote į vietinį kelią:
huggingface-cli download akisviete/azuolas-whisper-lt-ct2 \
--include "int8_float16/*" --local-dir ./azuolas-ct2
from faster_whisper import WhisperModel
m = WhisperModel("./azuolas-ct2/int8_float16", device="cuda",
compute_type="int8_float16")
# toliau taip pat, kaip float16 variante
Trys dalykai, kuriuos verta žinoti prieš naudojant (galioja abiem pavidalams):
vad_filter=Trueyra ne pasirinkimas, o būtinybė. Modelis prigalvoja tekstą per tylą — tylaus šnypštimo įraše prirašo apie 947 simbolius sklandaus lietuviško teksto. Su VAD — 0 simbolių.- Ilgus įrašus karpykite patys, dalimis iki 22 sekundžių, kirpimo vietas imdami iš Silero VAD — tarpų tarp kalbos sričių viduriuose. Išmatuota su 57 minučių įrašu, kad tai apie 4 punktais geriau nei paieška pagal garso lygį; paaiškinimas pagrindinėje kortelėje.
- Įrašytos 10
alignment_headsporų — oficialus OpenAI rinkinyslarge-v3modeliui. Be jųfaster-whisperpats pasirenka 320 porų iš paskutinės dekoderio pusės; išmatuota, kad tada nulinės trukmės žodžių padvigubėja (42 → 70).
Modelis rašo mažosiomis raidėmis ir be skyrybos ženklų.
Rezultatai
| rinkinys | WER % | WER % be skaitmenų |
|---|---|---|
| FLEURS LT (985 įrašai) | 9,05 | 4,68 |
| Common Voice 26.0 LT (5 877 įrašai) | 4,60 | — |
Kvantizacijos palyginimas (2026-09-27, pilni FLEURS LT ir CV 26.0 LT rinkiniai,
faster-whisper 1.2.1 + CTranslate2 4.8.1, CUDA, tyliosios dekodavimas):
| pavidalas | FLEURS WER % | CV26 WER % | model.bin |
|---|---|---|---|
| float16 | 9,03 | 4,57 | 2,9 GB |
| int8_float16 | 9,11 | 4,57 | 1,5 GB |
int8 praranda tik ~0,08 WER punkto (FLEURS), CV26 — 0,00, už ~48 % mažesnę failą. Galingoje GPU int8 net ~10 % lėtesnis, tad pasirinkimas — tai atminties taupymas, ne greitis.
Palyginimai su kitais lietuviškais modeliais, tikro 57 minučių įrašo bandymas ir mokymo aprašymas — pagrindinėje kortelėje.
Licencija ir šaltiniai
Metodas: Fine-tuning Whisper on Low-Resource Languages for Real-World Applications, arXiv:2412.15726 (FHNW / i4Ds).
CC BY 4.0. Mokyta su LIEPA-3 garsynu (Vilniaus universitetas / raštija.lt,
CC BY 4.0) openai/whisper-large-v3 pagrindu. Pilnas šaltinių sąrašas —
pagrindinėje saugykloje.
Kontaktai
Dėl klausimų ir pasiūlymų rašykite akisviete@gmail.com.
- Downloads last month
- 96