File size: 3,085 Bytes
861e078
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
---
language:
- vi
pipeline_tag: text-generation
library_name: pytorch
license: apache-2.0
tags:
- vietnamese
- causal-lm
- decoder-only
- from-scratch
---

# Luna Zero 110M

Luna Zero là mô hình ngôn ngữ decoder-only tiếng Việt khoảng 110M tham số, **train hoàn
toàn từ số 0**; không fine-tune và không nạp trọng số pretrained của mô hình khác.

Source code: https://github.com/plastma65/luna-zero-vi

## Kiến trúc

- 12 Transformer block, d_model 768, 12 attention head.
- Context tối đa 1024 token.
- Byte-level BPE 32.000 token, NFC ở data layer, không có UNK.
- Input embedding và LM head dùng chung trọng số.
- Kiến trúc custom PyTorch, không tương thích trực tiếp với `transformers.AutoModel`.

## Train

Mục tiêu train là 2.200.000.000 token. Bản phát hành này dùng checkpoint
step 33.569, được khóa trước final eval.

## Final eval

Human-authored held-out: 100 document / 17.580 token,
NLL **3.2195**, perplexity **25.016**.

Exact document overlap với raw train corpus bằng **0** sau khi quét
2.414.008 document.

Final generation: 30 mẫu, distinct-2 mean **0.948**,
distinct-4 mean **0.994**, 4-gram lặp tối đa **3**.

Các metric này mô tả repetition, **không phải** điểm factuality, coherence
hay chất lượng nội dung.

## Eval protocol

- Human final corpus được tạo sau khi train hoàn tất.
- Corpus được fingerprint và khóa trước khi tính NLL/PPL.
- Final generation prompt suite và sampling được khóa trước khi chạy.
- Output final không được dùng để tune lại sampling hoặc chọn checkpoint.
- Exact contamination guard không loại được near-duplicate hoặc paraphrase.

Xem `stage4_report.json`, `STAGE4_REPORT.md` và `generation_final.json` để có provenance
chi tiết.

## Giới hạn

Model ở quy mô này có thể viết tiếng Việt khá trôi nhưng thường bịa dữ kiện, mất mạch
ngữ nghĩa và không nên dùng như nguồn thông tin đáng tin cậy.

Model không được thiết kế cho toán học đáng tin cậy, instruction following phức tạp,
hay các tác vụ cần factuality cao.

## Sampling mặc định

```json
{
  "so_token": 120,
  "temperature": 0.9,
  "top_k": null,
  "top_p": 0.92,
  "phat_lap": 1.05
}
```

## Load

Package chứa trọng số inference-only `model.safetensors`, tokenizer và config.

Đây không phải model `transformers.AutoModel` / `AutoModelForCausalLM`.
Dùng source code Luna Zero để dựng `LunaZeroGPT`, nạp `model.safetensors`,
và dùng tokenizer đi kèm.

Package phát hành đã được kiểm theo vòng:

```text
local export -> Hugging Face upload -> download sạch -> CPU load + forward PASS
```

## License

Luna Zero 110M được phát hành theo **Apache License 2.0**.

Giấy phép này áp dụng cho phần được phát hành bởi dự án Luna Zero; nó không thay thế
điều khoản hoặc giấy phép của các dataset nguồn được dùng trong quá trình huấn luyện.