⚠️ Luna-Protocol-1.5B-Discord-Dialogues-200k-base — EXPÉRIMENTAL / INSTABLE

Ce modèle n'est pas recommandé pour un usage en production. Il fait partie d'une série d'expérimentations sur la variante base (non-Instruct) de Qwen2.5-1.5B. Voir Luna-Protocol-1.5B-Discord-Dialogues (basé sur Qwen2.5-1.5B-Instruct) pour une version plus stable.

Hypothèse testée

Contrairement au fine-tune initial (basé sur Qwen2.5-1.5B-Instruct), cette variante part du modèle base (unsloth/Qwen2.5-1.5B-bnb-4bit, non aligné assistant/RLHF), sur l'hypothèse qu'un modèle moins "formaté" en ton assistant laisserait le style Discord s'imprimer plus fortement, avec moins de dépendance au few-shot priming.

Ce qui a été fait

  • Méthode : QLoRA (4-bit), r=16, lora_alpha=16, modules cibles standards (q/k/v/o_proj, gate/up/down_proj)
  • Dataset : ~200 000 exemples de Discord-Dialogues (mookiezi), filtrés 8–512 tokens
  • Chat template : un modèle base n'a ni chat_template ni comportement de fin de conversation (EOS) définis nativement. Un template ChatML minimal a été configuré manuellement (<|im_start|>role\n...content...<|im_end|>), avec <|im_end|> réutilisé comme EOS et pad token.
  • Rôle assistant : conservé tel quel (assistant) dans cette v1 — voir 200k-base-v2 pour la correction apportée.

❌ Problème connu : génération instable / non-terminaison

En pratique, ce modèle ne s'arrête pas de générer de façon fiable — la génération continue au-delà d'une réponse cohérente, en boucle ou en dérivant, même avec <|im_end|> configuré comme EOS.

Cause probable : un modèle base n'a jamais appris, lors de son pré-entraînement, à reconnaître la fin d'un tour de conversation — ce comportement fait normalement partie de la phase d'instruction-tuning/RLHF, absente ici. Le fine-tuning sur 200k exemples (LoRA, 1.5 epoch) ne semble pas suffisant pour faire émerger ce comportement de zéro, contrairement à un modèle Instruct qui l'a déjà bien ancré avant même le fine-tuning.

Statut

Ce repo est conservé à titre de trace expérimentale. Le développement s'est poursuivi sur 200k-base-v2 (correction du rôle assistantluna), puis abandonné au profit d'un retour sur base Instruct suite à la persistance du problème.

Crédits

Downloads last month
62
GGUF
Model size
2B params
Architecture
qwen2
Hardware compatibility
Log In to add your hardware

2-bit

3-bit

4-bit

5-bit

6-bit

8-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for fox3000foxy/Luna-Protocol-1.5B-Discord-Dialogues-200k-base

Adapter
(6)
this model

Dataset used to train fox3000foxy/Luna-Protocol-1.5B-Discord-Dialogues-200k-base

Collection including fox3000foxy/Luna-Protocol-1.5B-Discord-Dialogues-200k-base