--- language: - vi pipeline_tag: text-generation library_name: pytorch license: apache-2.0 tags: - vietnamese - causal-lm - decoder-only - from-scratch --- # Luna Zero 110M Luna Zero là mô hình ngôn ngữ decoder-only tiếng Việt khoảng 110M tham số, **train hoàn toàn từ số 0**; không fine-tune và không nạp trọng số pretrained của mô hình khác. Source code: https://github.com/plastma65/luna-zero-vi ## Kiến trúc - 12 Transformer block, d_model 768, 12 attention head. - Context tối đa 1024 token. - Byte-level BPE 32.000 token, NFC ở data layer, không có UNK. - Input embedding và LM head dùng chung trọng số. - Kiến trúc custom PyTorch, không tương thích trực tiếp với `transformers.AutoModel`. ## Train Mục tiêu train là 2.200.000.000 token. Bản phát hành này dùng checkpoint step 33.569, được khóa trước final eval. ## Final eval Human-authored held-out: 100 document / 17.580 token, NLL **3.2195**, perplexity **25.016**. Exact document overlap với raw train corpus bằng **0** sau khi quét 2.414.008 document. Final generation: 30 mẫu, distinct-2 mean **0.948**, distinct-4 mean **0.994**, 4-gram lặp tối đa **3**. Các metric này mô tả repetition, **không phải** điểm factuality, coherence hay chất lượng nội dung. ## Eval protocol - Human final corpus được tạo sau khi train hoàn tất. - Corpus được fingerprint và khóa trước khi tính NLL/PPL. - Final generation prompt suite và sampling được khóa trước khi chạy. - Output final không được dùng để tune lại sampling hoặc chọn checkpoint. - Exact contamination guard không loại được near-duplicate hoặc paraphrase. Xem `stage4_report.json`, `STAGE4_REPORT.md` và `generation_final.json` để có provenance chi tiết. ## Giới hạn Model ở quy mô này có thể viết tiếng Việt khá trôi nhưng thường bịa dữ kiện, mất mạch ngữ nghĩa và không nên dùng như nguồn thông tin đáng tin cậy. Model không được thiết kế cho toán học đáng tin cậy, instruction following phức tạp, hay các tác vụ cần factuality cao. ## Sampling mặc định ```json { "so_token": 120, "temperature": 0.9, "top_k": null, "top_p": 0.92, "phat_lap": 1.05 } ``` ## Load Package chứa trọng số inference-only `model.safetensors`, tokenizer và config. Đây không phải model `transformers.AutoModel` / `AutoModelForCausalLM`. Dùng source code Luna Zero để dựng `LunaZeroGPT`, nạp `model.safetensors`, và dùng tokenizer đi kèm. Package phát hành đã được kiểm theo vòng: ```text local export -> Hugging Face upload -> download sạch -> CPU load + forward PASS ``` ## License Luna Zero 110M được phát hành theo **Apache License 2.0**. Giấy phép này áp dụng cho phần được phát hành bởi dự án Luna Zero; nó không thay thế điều khoản hoặc giấy phép của các dataset nguồn được dùng trong quá trình huấn luyện.