{ "architectures": ["GPT"], "vocab_size": 8192, "n_layer": 6, "n_head": 8, "n_embd": 256, "n_inner": 1024, "n_positions": 512, "tie_word_embeddings": true, "bias": false, "norm": "rmsnorm", "activation": "gelu", "torch_dtype": "bfloat16", "model_type": "gpt2", "transformers_version": "4.40.0" }