You need to agree to share your contact information to access this model

This repository is publicly accessible, but you have to accept the conditions to access its files and content.

Бұл репозиторийге қолжетімділік өтінім бойынша беріледі. Өзіңіз туралы және деректерді қалай қолданатыңыз туралы жазыңыз — өтінімді TilQazyna командасы қарайды. · Доступ к репозиторию выдаётся по заявке. Расскажите о себе и о том, как собираетесь использовать данные — заявку рассматривает команда TilQazyna. · Access to this repository is granted on request. Tell us who you are and how you plan to use the material; the TilQazyna team reviews each application.

Log in or Sign Up to review the conditions and access this model content.

Til-kk-0.5B-256k-gec-exp085

Қазақша сөйлемдерді түзететін GEC моделі · GEC-модель для исправления казахских предложений · GEC model for correcting Kazakh sentences

Қазақша · Русский · English


Қазақша

Til-kk-0.5B-256k-gec-exp085 — қазақша сөйлемдердегі грамматикалық және орфографиялық қателерді түзететін 1.72 ГБ GEC моделі. Ол 846M параметрлі Til-kk-0.5B-256k-exp080 моделінен fine-tune жасалған және кірісті => бөлгіші бар causal LM пішімінде өңдейді.

Құрылымы

Сипаттама Мәні
Архитектура DeepseekV3ForCausalLM
Параметр саны 846M
Жасырын қабат өлшемі 1280
Қабат саны 24
Attention head саны 10
Сөздік 256000
Контекст 4096 токен
Аралық қабат өлшемі 5120

Бағалау нәтижелері

Тест exact match chrF keep correct
test100 85.0 95.9 100.0
test100_v2 82.0 94.9 91.7
test100_v3 71.0 92.1 75.0
Орташа exact match 79.3

Әр тест жинағында 100 мысал бар. Модель sentence-level GEC үшін оқытылған; hard санатындағы нәтиже 24 мысалдың 9–17-сі аралығында қалған.

Оқыту қоспасында ережелік синтетика, адам белгілеген жұптар, дұрыс сөйлемдер және күрделі мысалдар қолданылған.

Қалай іске қосады

import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "TilQazyna/Til-kk-0.5B-256k-gec-exp085"
tok = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
    model_id, torch_dtype=torch.bfloat16
).eval()

sentence = "мен кітап оқыдым керек"
ids = tok(sentence + " => ", return_tensors="pt").input_ids
output = model.generate(
    ids, max_new_tokens=96, do_sample=False,
    eos_token_id=tok.eos_token_id, pad_token_id=1
)
text = tok.decode(output[0], skip_special_tokens=True)
print(text.split(" => ", 1)[-1].strip())

Модель түзетілген сөйлемді бөлгіштен кейін жалғастырады. Ол чатқа немесе ұзын құжатты тұтас өңдеуге оқытылмаған.

Қолжетімділік

Репозиторий карточкасы мен файлдар тізімі ашық. model.safetensors пен tokenizer файлдарын жүктеу үшін «Request access» батырмасы арқылы өтінім беріледі; оны TilQazyna командасы қарайды.

Байланысты репозиторийлер

Негізгі модель — Til-kk-0.5B-256k-exp080. Fine-tune үшін Til-GEC корпусы қолданылған.


Русский

Til-kk-0.5B-256k-gec-exp085 — GEC-модель объёмом 1.72 ГБ для исправления грамматики и орфографии в казахских предложениях. Её дообучили из модели Til-kk-0.5B-256k-exp080 с 846M параметров; вход и исправление разделяются строкой => в формате causal LM.

Устройство

Характеристика Значение
Архитектура DeepseekV3ForCausalLM
Параметров 846M
Размер скрытого слоя 1280
Слоёв 24
Attention heads 10
Словарь 256000
Контекст 4096 токенов
Размер промежуточного слоя 5120

Результаты оценки

Тест exact match chrF keep correct
test100 85.0 95.9 100.0
test100_v2 82.0 94.9 91.7
test100_v3 71.0 92.1 75.0
Средний exact match 79.3

В каждом тестовом наборе по 100 примеров. Модель обучена для sentence-level GEC; в категории hard она исправила от 9 до 17 из 24 примеров.

Как запустить

import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "TilQazyna/Til-kk-0.5B-256k-gec-exp085"
tok = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
    model_id, torch_dtype=torch.bfloat16
).eval()

sentence = "мен кітап оқыдым керек"
ids = tok(sentence + " => ", return_tensors="pt").input_ids
output = model.generate(
    ids, max_new_tokens=96, do_sample=False,
    eos_token_id=tok.eos_token_id, pad_token_id=1
)
text = tok.decode(output[0], skip_special_tokens=True)
print(text.split(" => ", 1)[-1].strip())

Модель продолжает вход исправленным предложением после разделителя. Она обучена на отдельных предложениях, без режима чата и обработки длинного документа целиком.

Доступ

Карточка и список содержимого доступны всем. Файл model.safetensors и tokenizer можно скачать после одобрения заявки «Request access» командой TilQazyna.

Связанные репозитории

Базовая модель — Til-kk-0.5B-256k-exp080. Для fine-tune использован корпус Til-GEC.


English

Til-kk-0.5B-256k-gec-exp085 is a 1.72 GB GEC model for correcting grammar and spelling in Kazakh sentences. It was fine-tuned from the 846M-parameter Til-kk-0.5B-256k-exp080, using a causal LM format that separates input and correction with =>.

Architecture

Property Value
Architecture DeepseekV3ForCausalLM
Parameters 846M
Hidden size 1280
Hidden layers 24
Attention heads 10
Vocabulary 256000
Context length 4096 tokens
Intermediate size 5120

Evaluation results

Test exact match chrF keep correct
test100 85.0 95.9 100.0
test100_v2 82.0 94.9 91.7
test100_v3 71.0 92.1 75.0
Average exact match 79.3

Each test set contains 100 items. The model targets sentence-level GEC; performance on the hard bucket ranged from 9 to 17 corrected items out of 24.

How to run

import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "TilQazyna/Til-kk-0.5B-256k-gec-exp085"
tok = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
    model_id, torch_dtype=torch.bfloat16
).eval()

sentence = "мен кітап оқыдым керек"
ids = tok(sentence + " => ", return_tensors="pt").input_ids
output = model.generate(
    ids, max_new_tokens=96, do_sample=False,
    eos_token_id=tok.eos_token_id, pad_token_id=1
)
text = tok.decode(output[0], skip_special_tokens=True)
print(text.split(" => ", 1)[-1].strip())

The model completes the prompt with a corrected sentence after the separator. It was trained for individual sentences, without a chat mode or whole-document workflow.

Access

The card and file listing are visible to everyone. Downloading model.safetensors and tokenizer files requires approval of the “Request access” form by the TilQazyna team.

Related repositories

The base model is Til-kk-0.5B-256k-exp080. Fine-tuning used the Til-GEC corpus.


Лицензия · License: apache-2.0 · TilQazyna

Downloads last month
120
Safetensors
Model size
0.8B params
Tensor type
BF16
·
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Collections including TilQazyna/Til-kk-0.5B-256k-gec-exp085