{ "_local_rope_theta_note": "local_rope_theta is DEPRECATED/unused: acoustic decoder now uses a learned slot-position embedding, not RoPE.", "_reserved_tokens_note": "ids 13..42 are reserved/preserve slots (random-init), inserted right after emotion_4 (12); unk and phoneme vocab shifted +30.", "architectures": [ "VieNeuV3TurboForTTS" ], "attention_dropout": 0.0, "audio_pad_token_id": 1024, "audio_ref_slot_token_id": 7, "audio_sample_rate": 48000, "audio_tokenizer_pretrained_name_or_path": "OpenMOSS-Team/MOSS-Audio-Tokenizer-Nano", "audio_vocab_size": 1024, "bos_token_id": 1, "dtype": "float32", "emotion_0_token_id": 8, "emotion_1_token_id": 9, "emotion_2_token_id": 10, "emotion_3_token_id": 11, "emotion_4_token_id": 12, "eos_token_id": 2, "head_dim": 64, "hidden_size": 768, "intermediate_size": 3072, "local_intermediate_size": 2048, "local_num_attention_heads": 8, "local_num_hidden_layers": 2, "local_rope_theta": 10000.0, "max_position_embeddings": 1024, "model_type": "vieneu_v3_turbo", "n_vq": 16, "num_attention_heads": 12, "num_hidden_layers": 12, "num_key_value_heads": 4, "num_reserved_tokens": 30, "pad_token_id": 0, "reserved_token_start": 13, "rms_norm_eps": 1e-06, "rope_theta": 10000.0, "speech_generation_end_token_id": 6, "speech_generation_start_token_id": 5, "text_prompt_end_token_id": 4, "text_prompt_start_token_id": 3, "text_vocab_size": 419, "tie_word_embeddings": false, "transformers_version": "4.56.0", "unk_token_id": 43 }