You need to agree to share your contact information to access this model
This repository is publicly accessible, but you have to accept the conditions to access its files and content.
Бұл репозиторийге қолжетімділік өтінім бойынша беріледі. Өзіңіз туралы және деректерді қалай қолданатыңыз туралы жазыңыз — өтінімді TilQazyna командасы қарайды. · Доступ к репозиторию выдаётся по заявке. Расскажите о себе и о том, как собираетесь использовать данные — заявку рассматривает команда TilQazyna. · Access to this repository is granted on request. Tell us who you are and how you plan to use the material; the TilQazyna team reviews each application.
Log in or Sign Up to review the conditions and access this model content.
kazakh-terms-bilstm-crf
Қазақша терминдерді морфемаларға бөлу жүйесі · Система морфемной сегментации казахских терминов · Kazakh term segmentation system
Қазақша
kazakh-terms-bilstm-crf — қазақша терминдерді талдау мен морфемаларға бөлуге арналған көлемі 51.6 МБ модельдік жүйе. Репозиторий нейрондық модельдерді, ережелерді, тіл анықтауды және FastAPI интерфейсін бір өңдеу тізбегіне жинайды.
Құрылымы
189 файл termin_dev/ бумасында орналасқан. Жүйе орысшадан қазақшаға аударатын жергілікті Seq2Seq моделін, таңбалық BiLSTM сегментаторын, DistilBERT морфема сегментаторын, fastText тіл анықтауын және жұрнақтарды кері талдау ережелерін қолданады. JSON талдауы үшін OpenAI API кілті қажет.
Жүйе терминді аудару, сегменттеу және ережемен тексеру сатыларын бір API арқылы байланыстырады.
| Артефакт | Міндеті |
|---|---|
termin_dev/main.py |
FastAPI қызметі және /convert/ маршруты |
termin_dev/get_fix_by_model.py |
BiLSTM, ережелер және қосымша өңдеу |
termin_dev/lang_id.py |
Тілді анықтау |
termin_dev/export_50k.py |
Пакеттік өңдеу |
termin_dev/converter_model/ |
Жергілікті Seq2Seq салмақтары |
termin_dev/morpho_fix_new.pth |
Морфемалық сегментация салмақтары |
Қалай жүктеуге болады
from pathlib import Path
from huggingface_hub import snapshot_download
repo_dir = Path(snapshot_download(
repo_id="TilQazyna/kazakh-terms-bilstm-crf",
))
service_dir = repo_dir / "termin_dev"
print(service_dir / "main.py")
print(service_dir / "converter_model")
Код мақұлданған репозиторий көшірмесін Hugging Face кэшіне жүктеп, API мен жергілікті модель орналасқан жолдарды көрсетеді. Қызметті іске қосатын орта репозиторийдегі модель салмақтары мен OpenAI API кілтін беруі керек.
Қолжетімділік
Карточка мен файлдар тізімі баршаға ашық. Артефактілерді жүктеу үшін «Request access» формасы толтырылады, ал рұқсатты TilQazyna командасы береді.
Байланысты репозиторийлер
Оқыту деректері kazakh-terms-8k және kazakh-terms-50k жинақтарынан алынған. Бір бағыттағы модельдер: kaz-termin-bilstm және kazakh-terms-gpt.
Русский
kazakh-terms-bilstm-crf — модельная система объёмом 51.6 МБ для анализа и морфемной сегментации казахских терминов. Репозиторий объединяет нейронные модели, правила, определение языка и интерфейс FastAPI в одном конвейере обработки.
Устройство
В каталоге termin_dev/ хранятся 189 файлов. Система использует локальную Seq2Seq-модель перевода с русского на казахский, посимвольный сегментатор BiLSTM, сегментатор морфем на DistilBERT, определение языка fastText и правила обратного разбора суффиксов. Для анализа с выдачей JSON нужен ключ OpenAI API.
| Артефакт | Назначение |
|---|---|
termin_dev/main.py |
Сервис FastAPI и маршрут /convert/ |
termin_dev/get_fix_by_model.py |
BiLSTM, правила и дополнительная обработка |
termin_dev/lang_id.py |
Определение языка |
termin_dev/export_50k.py |
Пакетная обработка |
termin_dev/converter_model/ |
Веса локальной Seq2Seq-модели |
termin_dev/morpho_fix_new.pth |
Веса морфемного сегментатора |
Как загрузить
from pathlib import Path
from huggingface_hub import snapshot_download
repo_dir = Path(snapshot_download(
repo_id="TilQazyna/kazakh-terms-bilstm-crf",
))
service_dir = repo_dir / "termin_dev"
print(service_dir / "main.py")
print(service_dir / "converter_model")
Скрипт скачивает одобренную копию репозитория в кеш Hugging Face и выводит пути к API и локальной модели. Среде запуска понадобятся опубликованные веса и ключ OpenAI API.
Доступ
Карточка и перечень файлов видны без скачивания. Чтобы получить артефакты, нужно отправить форму «Request access» и дождаться решения команды TilQazyna.
Связанные репозитории
Для обучения использованы kazakh-terms-8k и kazakh-terms-50k. Близкие по назначению модели: kaz-termin-bilstm и kazakh-terms-gpt.
English
kazakh-terms-bilstm-crf is a 51.6 MB model system for analyzing and segmenting Kazakh terms into morphemes. The repository combines neural models, linguistic rules, language identification, and a FastAPI interface in one processing pipeline.
Components
The termin_dev/ directory contains 189 files. The system uses a local Russian-to-Kazakh Seq2Seq model, a character-level BiLSTM segmenter, a DistilBERT morpheme segmenter, fastText language identification, and rules for reverse suffix analysis. Its JSON analysis path also requires an OpenAI API key.
| Artifact | Purpose |
|---|---|
termin_dev/main.py |
FastAPI service and /convert/ route |
termin_dev/get_fix_by_model.py |
BiLSTM, rules, and auxiliary processing |
termin_dev/lang_id.py |
Language identification |
termin_dev/export_50k.py |
Batch processing |
termin_dev/converter_model/ |
Local Seq2Seq model weights |
termin_dev/morpho_fix_new.pth |
Morpheme segmentation weights |
Loading the artifacts
from pathlib import Path
from huggingface_hub import snapshot_download
repo_dir = Path(snapshot_download(
repo_id="TilQazyna/kazakh-terms-bilstm-crf",
))
service_dir = repo_dir / "termin_dev"
print(service_dir / "main.py")
print(service_dir / "converter_model")
The script downloads the approved repository snapshot into the Hugging Face cache and prints the API and local-model paths. A runtime must provide the published model weights and an OpenAI API key for the corresponding analysis path.
Access
Everyone can inspect the card and file listing. Artifact downloads require an approved submission through the “Request access” form, reviewed by the TilQazyna team.
Related repositories
Training data comes from kazakh-terms-8k and kazakh-terms-50k. Related models are kaz-termin-bilstm and kazakh-terms-gpt.
Лицензия · License: apache-2.0 · TilQazyna