N8Programs commited on
Commit
7fcca91
·
verified ·
1 Parent(s): 6a2f157

Add files using upload-large-folder tool

Browse files
Files changed (50) hide show
  1. README.md +58 -0
  2. step-0002000/tokenizer_config.json +9 -0
  3. step-0003000/config.json +36 -0
  4. step-0003000/generation_config.json +5 -0
  5. step-0003000/tokenizer.json +0 -0
  6. step-0003000/tokenizer_config.json +9 -0
  7. step-0005000/config.json +36 -0
  8. step-0005000/generation_config.json +5 -0
  9. step-0005000/tokenizer.json +0 -0
  10. step-0005000/tokenizer_config.json +9 -0
  11. step-0007000/config.json +36 -0
  12. step-0007000/generation_config.json +5 -0
  13. step-0007000/tokenizer.json +0 -0
  14. step-0007000/tokenizer_config.json +9 -0
  15. step-0008000/config.json +36 -0
  16. step-0008000/generation_config.json +5 -0
  17. step-0008000/tokenizer.json +0 -0
  18. step-0008000/tokenizer_config.json +9 -0
  19. step-0010000/config.json +36 -0
  20. step-0010000/generation_config.json +5 -0
  21. step-0010000/tokenizer.json +0 -0
  22. step-0010000/tokenizer_config.json +9 -0
  23. step-0011000/config.json +36 -0
  24. step-0011000/generation_config.json +5 -0
  25. step-0011000/tokenizer.json +0 -0
  26. step-0011000/tokenizer_config.json +9 -0
  27. step-0013000/config.json +36 -0
  28. step-0013000/generation_config.json +5 -0
  29. step-0013000/tokenizer.json +0 -0
  30. step-0013000/tokenizer_config.json +9 -0
  31. step-0015000/config.json +36 -0
  32. step-0015000/generation_config.json +5 -0
  33. step-0015000/tokenizer.json +0 -0
  34. step-0015000/tokenizer_config.json +9 -0
  35. step-0017000/config.json +36 -0
  36. step-0017000/generation_config.json +5 -0
  37. step-0017000/tokenizer.json +0 -0
  38. step-0017000/tokenizer_config.json +9 -0
  39. step-0018000/config.json +36 -0
  40. step-0018000/generation_config.json +5 -0
  41. step-0018000/tokenizer.json +0 -0
  42. step-0018000/tokenizer_config.json +9 -0
  43. step-0020000/config.json +36 -0
  44. step-0020000/generation_config.json +5 -0
  45. step-0020000/tokenizer.json +0 -0
  46. step-0020000/tokenizer_config.json +9 -0
  47. step-0024000/config.json +36 -0
  48. step-0024000/generation_config.json +5 -0
  49. step-0024000/tokenizer.json +0 -0
  50. step-0024000/tokenizer_config.json +9 -0
README.md ADDED
@@ -0,0 +1,58 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ ---
2
+ library_name: transformers
3
+ language:
4
+ - en
5
+ tags:
6
+ - spark-gpt
7
+ - qwen3-moe
8
+ - from-scratch
9
+ - stories
10
+ - checkpoints
11
+ ---
12
+
13
+ # Lil Bard historical checkpoints
14
+
15
+ This repository contains 25 loadable Transformers checkpoints from the
16
+ pretraining run for [`N8Programs/lil-bard`](https://huggingface.co/N8Programs/lil-bard).
17
+ The final step-25,485 model is kept in that separate repository so ordinary
18
+ users do not download the full checkpoint history.
19
+
20
+ Checkpoints span step 1,000 through step 25,000 in increments of 1,000. Each
21
+ subfolder contains a complete `Qwen3MoeForCausalLM` export and tokenizer.
22
+
23
+ ## Loading a checkpoint
24
+
25
+ ```python
26
+ import torch
27
+ from transformers import AutoModelForCausalLM, AutoTokenizer
28
+
29
+ repo_id = "N8Programs/lil-bard-checkpts"
30
+ subfolder = "step-00010000"
31
+
32
+ tokenizer = AutoTokenizer.from_pretrained(repo_id, subfolder=subfolder)
33
+ model = AutoModelForCausalLM.from_pretrained(
34
+ repo_id,
35
+ subfolder=subfolder,
36
+ dtype=torch.bfloat16,
37
+ device_map="auto",
38
+ )
39
+ ```
40
+
41
+ Available subfolders are `step-00001000`, `step-00002000`, ..., through
42
+ `step-00025000`.
43
+
44
+ ## Run summary
45
+
46
+ Lil Bard is a 172,052,992-parameter English story MoE with 58,806,784 active
47
+ parameters per token, 8 experts with top-2 routing, and an 8,192-entry
48
+ whole-document byte-level BPE tokenizer. It was pretrained from scratch for
49
+ 2,492,032,616 real loss tokens on two NVIDIA GB10 systems.
50
+
51
+ The final model, architecture and data details, evaluations, usage example,
52
+ and limitations are documented in the
53
+ [`N8Programs/lil-bard` model card](https://huggingface.co/N8Programs/lil-bard).
54
+ The complete training trace is available in the
55
+ [`lil_bard_moe_8x2_full` W&B run](https://wandb.ai/n8programs/sparkgpt/runs/mxk8gln1).
56
+
57
+ Only model exports are included here. The larger optimizer/scheduler resume
58
+ checkpoints are not uploaded.
step-0002000/tokenizer_config.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "tokenizer_class": "PreTrainedTokenizerFast",
3
+ "bos_token": "<|beginoftext|>",
4
+ "eos_token": "<|endoftext|>",
5
+ "pad_token": "<|pad|>",
6
+ "model_max_length": 32768,
7
+ "clean_up_tokenization_spaces": false,
8
+ "unk_token": "<|unk|>"
9
+ }
step-0003000/config.json ADDED
@@ -0,0 +1,36 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "Qwen3MoeForCausalLM"
4
+ ],
5
+ "model_type": "qwen3_moe",
6
+ "vocab_size": 8192,
7
+ "hidden_size": 512,
8
+ "num_hidden_layers": 16,
9
+ "intermediate_size": 1536,
10
+ "num_attention_heads": 4,
11
+ "num_key_value_heads": 2,
12
+ "head_dim": 128,
13
+ "hidden_act": "silu",
14
+ "rms_norm_eps": 1e-06,
15
+ "max_position_embeddings": 32768,
16
+ "rope_theta": 1000000.0,
17
+ "rope_scaling": null,
18
+ "attention_bias": false,
19
+ "attention_dropout": 0.0,
20
+ "tie_word_embeddings": false,
21
+ "use_cache": true,
22
+ "bos_token_id": 8190,
23
+ "eos_token_id": 0,
24
+ "pad_token_id": 8191,
25
+ "torch_dtype": "float32",
26
+ "decoder_sparse_step": 1,
27
+ "moe_intermediate_size": 768,
28
+ "num_experts": 8,
29
+ "num_experts_per_tok": 2,
30
+ "norm_topk_prob": true,
31
+ "output_router_logits": false,
32
+ "router_aux_loss_coef": 0.001,
33
+ "mlp_only_layers": [],
34
+ "use_sliding_window": false,
35
+ "sliding_window": null
36
+ }
step-0003000/generation_config.json ADDED
@@ -0,0 +1,5 @@
 
 
 
 
 
 
1
+ {
2
+ "bos_token_id": 8190,
3
+ "eos_token_id": 0,
4
+ "pad_token_id": 8191
5
+ }
step-0003000/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
step-0003000/tokenizer_config.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "tokenizer_class": "PreTrainedTokenizerFast",
3
+ "bos_token": "<|beginoftext|>",
4
+ "eos_token": "<|endoftext|>",
5
+ "pad_token": "<|pad|>",
6
+ "model_max_length": 32768,
7
+ "clean_up_tokenization_spaces": false,
8
+ "unk_token": "<|unk|>"
9
+ }
step-0005000/config.json ADDED
@@ -0,0 +1,36 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "Qwen3MoeForCausalLM"
4
+ ],
5
+ "model_type": "qwen3_moe",
6
+ "vocab_size": 8192,
7
+ "hidden_size": 512,
8
+ "num_hidden_layers": 16,
9
+ "intermediate_size": 1536,
10
+ "num_attention_heads": 4,
11
+ "num_key_value_heads": 2,
12
+ "head_dim": 128,
13
+ "hidden_act": "silu",
14
+ "rms_norm_eps": 1e-06,
15
+ "max_position_embeddings": 32768,
16
+ "rope_theta": 1000000.0,
17
+ "rope_scaling": null,
18
+ "attention_bias": false,
19
+ "attention_dropout": 0.0,
20
+ "tie_word_embeddings": false,
21
+ "use_cache": true,
22
+ "bos_token_id": 8190,
23
+ "eos_token_id": 0,
24
+ "pad_token_id": 8191,
25
+ "torch_dtype": "float32",
26
+ "decoder_sparse_step": 1,
27
+ "moe_intermediate_size": 768,
28
+ "num_experts": 8,
29
+ "num_experts_per_tok": 2,
30
+ "norm_topk_prob": true,
31
+ "output_router_logits": false,
32
+ "router_aux_loss_coef": 0.001,
33
+ "mlp_only_layers": [],
34
+ "use_sliding_window": false,
35
+ "sliding_window": null
36
+ }
step-0005000/generation_config.json ADDED
@@ -0,0 +1,5 @@
 
 
 
 
 
 
1
+ {
2
+ "bos_token_id": 8190,
3
+ "eos_token_id": 0,
4
+ "pad_token_id": 8191
5
+ }
step-0005000/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
step-0005000/tokenizer_config.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "tokenizer_class": "PreTrainedTokenizerFast",
3
+ "bos_token": "<|beginoftext|>",
4
+ "eos_token": "<|endoftext|>",
5
+ "pad_token": "<|pad|>",
6
+ "model_max_length": 32768,
7
+ "clean_up_tokenization_spaces": false,
8
+ "unk_token": "<|unk|>"
9
+ }
step-0007000/config.json ADDED
@@ -0,0 +1,36 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "Qwen3MoeForCausalLM"
4
+ ],
5
+ "model_type": "qwen3_moe",
6
+ "vocab_size": 8192,
7
+ "hidden_size": 512,
8
+ "num_hidden_layers": 16,
9
+ "intermediate_size": 1536,
10
+ "num_attention_heads": 4,
11
+ "num_key_value_heads": 2,
12
+ "head_dim": 128,
13
+ "hidden_act": "silu",
14
+ "rms_norm_eps": 1e-06,
15
+ "max_position_embeddings": 32768,
16
+ "rope_theta": 1000000.0,
17
+ "rope_scaling": null,
18
+ "attention_bias": false,
19
+ "attention_dropout": 0.0,
20
+ "tie_word_embeddings": false,
21
+ "use_cache": true,
22
+ "bos_token_id": 8190,
23
+ "eos_token_id": 0,
24
+ "pad_token_id": 8191,
25
+ "torch_dtype": "float32",
26
+ "decoder_sparse_step": 1,
27
+ "moe_intermediate_size": 768,
28
+ "num_experts": 8,
29
+ "num_experts_per_tok": 2,
30
+ "norm_topk_prob": true,
31
+ "output_router_logits": false,
32
+ "router_aux_loss_coef": 0.001,
33
+ "mlp_only_layers": [],
34
+ "use_sliding_window": false,
35
+ "sliding_window": null
36
+ }
step-0007000/generation_config.json ADDED
@@ -0,0 +1,5 @@
 
 
 
 
 
 
1
+ {
2
+ "bos_token_id": 8190,
3
+ "eos_token_id": 0,
4
+ "pad_token_id": 8191
5
+ }
step-0007000/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
step-0007000/tokenizer_config.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "tokenizer_class": "PreTrainedTokenizerFast",
3
+ "bos_token": "<|beginoftext|>",
4
+ "eos_token": "<|endoftext|>",
5
+ "pad_token": "<|pad|>",
6
+ "model_max_length": 32768,
7
+ "clean_up_tokenization_spaces": false,
8
+ "unk_token": "<|unk|>"
9
+ }
step-0008000/config.json ADDED
@@ -0,0 +1,36 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "Qwen3MoeForCausalLM"
4
+ ],
5
+ "model_type": "qwen3_moe",
6
+ "vocab_size": 8192,
7
+ "hidden_size": 512,
8
+ "num_hidden_layers": 16,
9
+ "intermediate_size": 1536,
10
+ "num_attention_heads": 4,
11
+ "num_key_value_heads": 2,
12
+ "head_dim": 128,
13
+ "hidden_act": "silu",
14
+ "rms_norm_eps": 1e-06,
15
+ "max_position_embeddings": 32768,
16
+ "rope_theta": 1000000.0,
17
+ "rope_scaling": null,
18
+ "attention_bias": false,
19
+ "attention_dropout": 0.0,
20
+ "tie_word_embeddings": false,
21
+ "use_cache": true,
22
+ "bos_token_id": 8190,
23
+ "eos_token_id": 0,
24
+ "pad_token_id": 8191,
25
+ "torch_dtype": "float32",
26
+ "decoder_sparse_step": 1,
27
+ "moe_intermediate_size": 768,
28
+ "num_experts": 8,
29
+ "num_experts_per_tok": 2,
30
+ "norm_topk_prob": true,
31
+ "output_router_logits": false,
32
+ "router_aux_loss_coef": 0.001,
33
+ "mlp_only_layers": [],
34
+ "use_sliding_window": false,
35
+ "sliding_window": null
36
+ }
step-0008000/generation_config.json ADDED
@@ -0,0 +1,5 @@
 
 
 
 
 
 
1
+ {
2
+ "bos_token_id": 8190,
3
+ "eos_token_id": 0,
4
+ "pad_token_id": 8191
5
+ }
step-0008000/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
step-0008000/tokenizer_config.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "tokenizer_class": "PreTrainedTokenizerFast",
3
+ "bos_token": "<|beginoftext|>",
4
+ "eos_token": "<|endoftext|>",
5
+ "pad_token": "<|pad|>",
6
+ "model_max_length": 32768,
7
+ "clean_up_tokenization_spaces": false,
8
+ "unk_token": "<|unk|>"
9
+ }
step-0010000/config.json ADDED
@@ -0,0 +1,36 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "Qwen3MoeForCausalLM"
4
+ ],
5
+ "model_type": "qwen3_moe",
6
+ "vocab_size": 8192,
7
+ "hidden_size": 512,
8
+ "num_hidden_layers": 16,
9
+ "intermediate_size": 1536,
10
+ "num_attention_heads": 4,
11
+ "num_key_value_heads": 2,
12
+ "head_dim": 128,
13
+ "hidden_act": "silu",
14
+ "rms_norm_eps": 1e-06,
15
+ "max_position_embeddings": 32768,
16
+ "rope_theta": 1000000.0,
17
+ "rope_scaling": null,
18
+ "attention_bias": false,
19
+ "attention_dropout": 0.0,
20
+ "tie_word_embeddings": false,
21
+ "use_cache": true,
22
+ "bos_token_id": 8190,
23
+ "eos_token_id": 0,
24
+ "pad_token_id": 8191,
25
+ "torch_dtype": "float32",
26
+ "decoder_sparse_step": 1,
27
+ "moe_intermediate_size": 768,
28
+ "num_experts": 8,
29
+ "num_experts_per_tok": 2,
30
+ "norm_topk_prob": true,
31
+ "output_router_logits": false,
32
+ "router_aux_loss_coef": 0.001,
33
+ "mlp_only_layers": [],
34
+ "use_sliding_window": false,
35
+ "sliding_window": null
36
+ }
step-0010000/generation_config.json ADDED
@@ -0,0 +1,5 @@
 
 
 
 
 
 
1
+ {
2
+ "bos_token_id": 8190,
3
+ "eos_token_id": 0,
4
+ "pad_token_id": 8191
5
+ }
step-0010000/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
step-0010000/tokenizer_config.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "tokenizer_class": "PreTrainedTokenizerFast",
3
+ "bos_token": "<|beginoftext|>",
4
+ "eos_token": "<|endoftext|>",
5
+ "pad_token": "<|pad|>",
6
+ "model_max_length": 32768,
7
+ "clean_up_tokenization_spaces": false,
8
+ "unk_token": "<|unk|>"
9
+ }
step-0011000/config.json ADDED
@@ -0,0 +1,36 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "Qwen3MoeForCausalLM"
4
+ ],
5
+ "model_type": "qwen3_moe",
6
+ "vocab_size": 8192,
7
+ "hidden_size": 512,
8
+ "num_hidden_layers": 16,
9
+ "intermediate_size": 1536,
10
+ "num_attention_heads": 4,
11
+ "num_key_value_heads": 2,
12
+ "head_dim": 128,
13
+ "hidden_act": "silu",
14
+ "rms_norm_eps": 1e-06,
15
+ "max_position_embeddings": 32768,
16
+ "rope_theta": 1000000.0,
17
+ "rope_scaling": null,
18
+ "attention_bias": false,
19
+ "attention_dropout": 0.0,
20
+ "tie_word_embeddings": false,
21
+ "use_cache": true,
22
+ "bos_token_id": 8190,
23
+ "eos_token_id": 0,
24
+ "pad_token_id": 8191,
25
+ "torch_dtype": "float32",
26
+ "decoder_sparse_step": 1,
27
+ "moe_intermediate_size": 768,
28
+ "num_experts": 8,
29
+ "num_experts_per_tok": 2,
30
+ "norm_topk_prob": true,
31
+ "output_router_logits": false,
32
+ "router_aux_loss_coef": 0.001,
33
+ "mlp_only_layers": [],
34
+ "use_sliding_window": false,
35
+ "sliding_window": null
36
+ }
step-0011000/generation_config.json ADDED
@@ -0,0 +1,5 @@
 
 
 
 
 
 
1
+ {
2
+ "bos_token_id": 8190,
3
+ "eos_token_id": 0,
4
+ "pad_token_id": 8191
5
+ }
step-0011000/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
step-0011000/tokenizer_config.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "tokenizer_class": "PreTrainedTokenizerFast",
3
+ "bos_token": "<|beginoftext|>",
4
+ "eos_token": "<|endoftext|>",
5
+ "pad_token": "<|pad|>",
6
+ "model_max_length": 32768,
7
+ "clean_up_tokenization_spaces": false,
8
+ "unk_token": "<|unk|>"
9
+ }
step-0013000/config.json ADDED
@@ -0,0 +1,36 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "Qwen3MoeForCausalLM"
4
+ ],
5
+ "model_type": "qwen3_moe",
6
+ "vocab_size": 8192,
7
+ "hidden_size": 512,
8
+ "num_hidden_layers": 16,
9
+ "intermediate_size": 1536,
10
+ "num_attention_heads": 4,
11
+ "num_key_value_heads": 2,
12
+ "head_dim": 128,
13
+ "hidden_act": "silu",
14
+ "rms_norm_eps": 1e-06,
15
+ "max_position_embeddings": 32768,
16
+ "rope_theta": 1000000.0,
17
+ "rope_scaling": null,
18
+ "attention_bias": false,
19
+ "attention_dropout": 0.0,
20
+ "tie_word_embeddings": false,
21
+ "use_cache": true,
22
+ "bos_token_id": 8190,
23
+ "eos_token_id": 0,
24
+ "pad_token_id": 8191,
25
+ "torch_dtype": "float32",
26
+ "decoder_sparse_step": 1,
27
+ "moe_intermediate_size": 768,
28
+ "num_experts": 8,
29
+ "num_experts_per_tok": 2,
30
+ "norm_topk_prob": true,
31
+ "output_router_logits": false,
32
+ "router_aux_loss_coef": 0.001,
33
+ "mlp_only_layers": [],
34
+ "use_sliding_window": false,
35
+ "sliding_window": null
36
+ }
step-0013000/generation_config.json ADDED
@@ -0,0 +1,5 @@
 
 
 
 
 
 
1
+ {
2
+ "bos_token_id": 8190,
3
+ "eos_token_id": 0,
4
+ "pad_token_id": 8191
5
+ }
step-0013000/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
step-0013000/tokenizer_config.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "tokenizer_class": "PreTrainedTokenizerFast",
3
+ "bos_token": "<|beginoftext|>",
4
+ "eos_token": "<|endoftext|>",
5
+ "pad_token": "<|pad|>",
6
+ "model_max_length": 32768,
7
+ "clean_up_tokenization_spaces": false,
8
+ "unk_token": "<|unk|>"
9
+ }
step-0015000/config.json ADDED
@@ -0,0 +1,36 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "Qwen3MoeForCausalLM"
4
+ ],
5
+ "model_type": "qwen3_moe",
6
+ "vocab_size": 8192,
7
+ "hidden_size": 512,
8
+ "num_hidden_layers": 16,
9
+ "intermediate_size": 1536,
10
+ "num_attention_heads": 4,
11
+ "num_key_value_heads": 2,
12
+ "head_dim": 128,
13
+ "hidden_act": "silu",
14
+ "rms_norm_eps": 1e-06,
15
+ "max_position_embeddings": 32768,
16
+ "rope_theta": 1000000.0,
17
+ "rope_scaling": null,
18
+ "attention_bias": false,
19
+ "attention_dropout": 0.0,
20
+ "tie_word_embeddings": false,
21
+ "use_cache": true,
22
+ "bos_token_id": 8190,
23
+ "eos_token_id": 0,
24
+ "pad_token_id": 8191,
25
+ "torch_dtype": "float32",
26
+ "decoder_sparse_step": 1,
27
+ "moe_intermediate_size": 768,
28
+ "num_experts": 8,
29
+ "num_experts_per_tok": 2,
30
+ "norm_topk_prob": true,
31
+ "output_router_logits": false,
32
+ "router_aux_loss_coef": 0.001,
33
+ "mlp_only_layers": [],
34
+ "use_sliding_window": false,
35
+ "sliding_window": null
36
+ }
step-0015000/generation_config.json ADDED
@@ -0,0 +1,5 @@
 
 
 
 
 
 
1
+ {
2
+ "bos_token_id": 8190,
3
+ "eos_token_id": 0,
4
+ "pad_token_id": 8191
5
+ }
step-0015000/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
step-0015000/tokenizer_config.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "tokenizer_class": "PreTrainedTokenizerFast",
3
+ "bos_token": "<|beginoftext|>",
4
+ "eos_token": "<|endoftext|>",
5
+ "pad_token": "<|pad|>",
6
+ "model_max_length": 32768,
7
+ "clean_up_tokenization_spaces": false,
8
+ "unk_token": "<|unk|>"
9
+ }
step-0017000/config.json ADDED
@@ -0,0 +1,36 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "Qwen3MoeForCausalLM"
4
+ ],
5
+ "model_type": "qwen3_moe",
6
+ "vocab_size": 8192,
7
+ "hidden_size": 512,
8
+ "num_hidden_layers": 16,
9
+ "intermediate_size": 1536,
10
+ "num_attention_heads": 4,
11
+ "num_key_value_heads": 2,
12
+ "head_dim": 128,
13
+ "hidden_act": "silu",
14
+ "rms_norm_eps": 1e-06,
15
+ "max_position_embeddings": 32768,
16
+ "rope_theta": 1000000.0,
17
+ "rope_scaling": null,
18
+ "attention_bias": false,
19
+ "attention_dropout": 0.0,
20
+ "tie_word_embeddings": false,
21
+ "use_cache": true,
22
+ "bos_token_id": 8190,
23
+ "eos_token_id": 0,
24
+ "pad_token_id": 8191,
25
+ "torch_dtype": "float32",
26
+ "decoder_sparse_step": 1,
27
+ "moe_intermediate_size": 768,
28
+ "num_experts": 8,
29
+ "num_experts_per_tok": 2,
30
+ "norm_topk_prob": true,
31
+ "output_router_logits": false,
32
+ "router_aux_loss_coef": 0.001,
33
+ "mlp_only_layers": [],
34
+ "use_sliding_window": false,
35
+ "sliding_window": null
36
+ }
step-0017000/generation_config.json ADDED
@@ -0,0 +1,5 @@
 
 
 
 
 
 
1
+ {
2
+ "bos_token_id": 8190,
3
+ "eos_token_id": 0,
4
+ "pad_token_id": 8191
5
+ }
step-0017000/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
step-0017000/tokenizer_config.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "tokenizer_class": "PreTrainedTokenizerFast",
3
+ "bos_token": "<|beginoftext|>",
4
+ "eos_token": "<|endoftext|>",
5
+ "pad_token": "<|pad|>",
6
+ "model_max_length": 32768,
7
+ "clean_up_tokenization_spaces": false,
8
+ "unk_token": "<|unk|>"
9
+ }
step-0018000/config.json ADDED
@@ -0,0 +1,36 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "Qwen3MoeForCausalLM"
4
+ ],
5
+ "model_type": "qwen3_moe",
6
+ "vocab_size": 8192,
7
+ "hidden_size": 512,
8
+ "num_hidden_layers": 16,
9
+ "intermediate_size": 1536,
10
+ "num_attention_heads": 4,
11
+ "num_key_value_heads": 2,
12
+ "head_dim": 128,
13
+ "hidden_act": "silu",
14
+ "rms_norm_eps": 1e-06,
15
+ "max_position_embeddings": 32768,
16
+ "rope_theta": 1000000.0,
17
+ "rope_scaling": null,
18
+ "attention_bias": false,
19
+ "attention_dropout": 0.0,
20
+ "tie_word_embeddings": false,
21
+ "use_cache": true,
22
+ "bos_token_id": 8190,
23
+ "eos_token_id": 0,
24
+ "pad_token_id": 8191,
25
+ "torch_dtype": "float32",
26
+ "decoder_sparse_step": 1,
27
+ "moe_intermediate_size": 768,
28
+ "num_experts": 8,
29
+ "num_experts_per_tok": 2,
30
+ "norm_topk_prob": true,
31
+ "output_router_logits": false,
32
+ "router_aux_loss_coef": 0.001,
33
+ "mlp_only_layers": [],
34
+ "use_sliding_window": false,
35
+ "sliding_window": null
36
+ }
step-0018000/generation_config.json ADDED
@@ -0,0 +1,5 @@
 
 
 
 
 
 
1
+ {
2
+ "bos_token_id": 8190,
3
+ "eos_token_id": 0,
4
+ "pad_token_id": 8191
5
+ }
step-0018000/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
step-0018000/tokenizer_config.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "tokenizer_class": "PreTrainedTokenizerFast",
3
+ "bos_token": "<|beginoftext|>",
4
+ "eos_token": "<|endoftext|>",
5
+ "pad_token": "<|pad|>",
6
+ "model_max_length": 32768,
7
+ "clean_up_tokenization_spaces": false,
8
+ "unk_token": "<|unk|>"
9
+ }
step-0020000/config.json ADDED
@@ -0,0 +1,36 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "Qwen3MoeForCausalLM"
4
+ ],
5
+ "model_type": "qwen3_moe",
6
+ "vocab_size": 8192,
7
+ "hidden_size": 512,
8
+ "num_hidden_layers": 16,
9
+ "intermediate_size": 1536,
10
+ "num_attention_heads": 4,
11
+ "num_key_value_heads": 2,
12
+ "head_dim": 128,
13
+ "hidden_act": "silu",
14
+ "rms_norm_eps": 1e-06,
15
+ "max_position_embeddings": 32768,
16
+ "rope_theta": 1000000.0,
17
+ "rope_scaling": null,
18
+ "attention_bias": false,
19
+ "attention_dropout": 0.0,
20
+ "tie_word_embeddings": false,
21
+ "use_cache": true,
22
+ "bos_token_id": 8190,
23
+ "eos_token_id": 0,
24
+ "pad_token_id": 8191,
25
+ "torch_dtype": "float32",
26
+ "decoder_sparse_step": 1,
27
+ "moe_intermediate_size": 768,
28
+ "num_experts": 8,
29
+ "num_experts_per_tok": 2,
30
+ "norm_topk_prob": true,
31
+ "output_router_logits": false,
32
+ "router_aux_loss_coef": 0.001,
33
+ "mlp_only_layers": [],
34
+ "use_sliding_window": false,
35
+ "sliding_window": null
36
+ }
step-0020000/generation_config.json ADDED
@@ -0,0 +1,5 @@
 
 
 
 
 
 
1
+ {
2
+ "bos_token_id": 8190,
3
+ "eos_token_id": 0,
4
+ "pad_token_id": 8191
5
+ }
step-0020000/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
step-0020000/tokenizer_config.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "tokenizer_class": "PreTrainedTokenizerFast",
3
+ "bos_token": "<|beginoftext|>",
4
+ "eos_token": "<|endoftext|>",
5
+ "pad_token": "<|pad|>",
6
+ "model_max_length": 32768,
7
+ "clean_up_tokenization_spaces": false,
8
+ "unk_token": "<|unk|>"
9
+ }
step-0024000/config.json ADDED
@@ -0,0 +1,36 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "architectures": [
3
+ "Qwen3MoeForCausalLM"
4
+ ],
5
+ "model_type": "qwen3_moe",
6
+ "vocab_size": 8192,
7
+ "hidden_size": 512,
8
+ "num_hidden_layers": 16,
9
+ "intermediate_size": 1536,
10
+ "num_attention_heads": 4,
11
+ "num_key_value_heads": 2,
12
+ "head_dim": 128,
13
+ "hidden_act": "silu",
14
+ "rms_norm_eps": 1e-06,
15
+ "max_position_embeddings": 32768,
16
+ "rope_theta": 1000000.0,
17
+ "rope_scaling": null,
18
+ "attention_bias": false,
19
+ "attention_dropout": 0.0,
20
+ "tie_word_embeddings": false,
21
+ "use_cache": true,
22
+ "bos_token_id": 8190,
23
+ "eos_token_id": 0,
24
+ "pad_token_id": 8191,
25
+ "torch_dtype": "float32",
26
+ "decoder_sparse_step": 1,
27
+ "moe_intermediate_size": 768,
28
+ "num_experts": 8,
29
+ "num_experts_per_tok": 2,
30
+ "norm_topk_prob": true,
31
+ "output_router_logits": false,
32
+ "router_aux_loss_coef": 0.001,
33
+ "mlp_only_layers": [],
34
+ "use_sliding_window": false,
35
+ "sliding_window": null
36
+ }
step-0024000/generation_config.json ADDED
@@ -0,0 +1,5 @@
 
 
 
 
 
 
1
+ {
2
+ "bos_token_id": 8190,
3
+ "eos_token_id": 0,
4
+ "pad_token_id": 8191
5
+ }
step-0024000/tokenizer.json ADDED
The diff for this file is too large to render. See raw diff
 
step-0024000/tokenizer_config.json ADDED
@@ -0,0 +1,9 @@
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "tokenizer_class": "PreTrainedTokenizerFast",
3
+ "bos_token": "<|beginoftext|>",
4
+ "eos_token": "<|endoftext|>",
5
+ "pad_token": "<|pad|>",
6
+ "model_max_length": 32768,
7
+ "clean_up_tokenization_spaces": false,
8
+ "unk_token": "<|unk|>"
9
+ }