Token Classification
Stanza
ONNX
Chagatai
sentence-boundary-detection
sentence-segmentation
charlm
bilstm
low-resource-nlp
historical-linguistics
chagatai
turkic
Eval Results (legacy)
Instructions to use chagatai-project/chagatai-sentence-segmentation with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Stanza
How to use chagatai-project/chagatai-sentence-segmentation with Stanza:
import stanza stanza.download("chagatai-sentence-segmentation") nlp = stanza.Pipeline("chagatai-sentence-segmentation") - Notebooks
- Google Colab
- Kaggle
Release Chagatai SBD SOTA ONNX models (Tri-Hybrid, BiCharLM, INT8, Standalone) with benchmarks
9b8d91c verified Download vocab.json from chagatai-project/chagatai-sentence-segmentation: direct link, hf CLI and curl.
- Browser
- Download file 2.46 kB
-
https://huggingface.co/chagatai-project/chagatai-sentence-segmentation/resolve/main/vocab.json
- Command line
-
hf download hf://chagatai-project/chagatai-sentence-segmentation/vocab.json
-
curl -L -o vocab.json https://huggingface.co/chagatai-project/chagatai-sentence-segmentation/resolve/main/vocab.json
2.46 kB
| { | |
| "unit2id": { | |
| "<PAD>": 0, | |
| "<UNK>": 1, | |
| " ": 2, | |
| "ا": 3, | |
| "ن": 4, | |
| "ی": 5, | |
| "ى": 6, | |
| "ل": 7, | |
| "ر": 8, | |
| "و": 9, | |
| "د": 10, | |
| "ت": 11, | |
| "ب": 12, | |
| "م": 13, | |
| "ق": 14, | |
| "ە": 15, | |
| "ي": 16, | |
| "س": 17, | |
| "ه": 18, | |
| "ك": 19, | |
| "ش": 20, | |
| "ۇ": 21, | |
| "ک": 22, | |
| "ئ": 23, | |
| "گ": 24, | |
| "ز": 25, | |
| "ې": 26, | |
| "غ": 27, | |
| "چ": 28, | |
| "پ": 29, | |
| "خ": 30, | |
| "ۉ": 31, | |
| "ڭ": 32, | |
| "ۈ": 33, | |
| "ج": 34, | |
| "ۋ": 35, | |
| "آ": 36, | |
| "ھ": 37, | |
| "ف": 38, | |
| "ع": 39, | |
| "ۆ": 40, | |
| "ح": 41, | |
| "ط": 42, | |
| "ص": 43, | |
| "ض": 44, | |
| "ـ": 45, | |
| "ذ": 46, | |
| "1": 47, | |
| "0": 48, | |
| "2": 49, | |
| "ظ": 50, | |
| "ث": 51, | |
| "9": 52, | |
| "3": 53, | |
| "۱": 54, | |
| "5": 55, | |
| "۹": 56, | |
| "أ": 57, | |
| "6": 58, | |
| "4": 59, | |
| "۰": 60, | |
| "8": 61, | |
| "ة": 62, | |
| "7": 63, | |
| "ء": 64, | |
| "۲": 65, | |
| "ژ": 66, | |
| "۵": 67, | |
| "۳": 68, | |
| "۸": 69, | |
| "۴": 70, | |
| "۷": 71, | |
| "ہ": 72, | |
| "۶": 73, | |
| "ؤ": 74, | |
| "إ": 75, | |
| "ڈ": 76, | |
| "ٹ": 77, | |
| "١": 78, | |
| "ۀ": 79 | |
| }, | |
| "id2unit": { | |
| "0": "<PAD>", | |
| "1": "<UNK>", | |
| "2": " ", | |
| "3": "ا", | |
| "4": "ن", | |
| "5": "ی", | |
| "6": "ى", | |
| "7": "ل", | |
| "8": "ر", | |
| "9": "و", | |
| "10": "د", | |
| "11": "ت", | |
| "12": "ب", | |
| "13": "م", | |
| "14": "ق", | |
| "15": "ە", | |
| "16": "ي", | |
| "17": "س", | |
| "18": "ه", | |
| "19": "ك", | |
| "20": "ش", | |
| "21": "ۇ", | |
| "22": "ک", | |
| "23": "ئ", | |
| "24": "گ", | |
| "25": "ز", | |
| "26": "ې", | |
| "27": "غ", | |
| "28": "چ", | |
| "29": "پ", | |
| "30": "خ", | |
| "31": "ۉ", | |
| "32": "ڭ", | |
| "33": "ۈ", | |
| "34": "ج", | |
| "35": "ۋ", | |
| "36": "آ", | |
| "37": "ھ", | |
| "38": "ف", | |
| "39": "ع", | |
| "40": "ۆ", | |
| "41": "ح", | |
| "42": "ط", | |
| "43": "ص", | |
| "44": "ض", | |
| "45": "ـ", | |
| "46": "ذ", | |
| "47": "1", | |
| "48": "0", | |
| "49": "2", | |
| "50": "ظ", | |
| "51": "ث", | |
| "52": "9", | |
| "53": "3", | |
| "54": "۱", | |
| "55": "5", | |
| "56": "۹", | |
| "57": "أ", | |
| "58": "6", | |
| "59": "4", | |
| "60": "۰", | |
| "61": "8", | |
| "62": "ة", | |
| "63": "7", | |
| "64": "ء", | |
| "65": "۲", | |
| "66": "ژ", | |
| "67": "۵", | |
| "68": "۳", | |
| "69": "۸", | |
| "70": "۴", | |
| "71": "۷", | |
| "72": "ہ", | |
| "73": "۶", | |
| "74": "ؤ", | |
| "75": "إ", | |
| "76": "ڈ", | |
| "77": "ٹ", | |
| "78": "١", | |
| "79": "ۀ" | |
| }, | |
| "pad_id": 0, | |
| "unk_id": 1, | |
| "vocab_size": 80 | |
| } |