File size: 3,330 Bytes
cc47d18
 
390087d
 
 
 
 
 
abbf276
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
---
library_name: transformers
tags:
- Pretrained
license: other
language:
- fr
pipeline_tag: text-generation
---
# 🐺 Lorias-v1 : French Language Model From Scratch

![Lorias](http://www.image-heberg.fr/files/17691653652758488912.webp)

Bienvenue dans le dépôt officiel de **Lorias-v1**, un modèle de langage (LLM) de **1 milliard de paramètres**, entièrement conçu et pré-entraîné pour la langue française par **Clémence (Finisha)**.

## 📌 Présentation du Projet

Lorias-v1 représente une étape majeure dans la création de modèles souverains et spécialisés. Contrairement à de nombreux modèles qui se contentent d'un affinage (fine-tuning), Lorias-v1 a été bâti **"from scratch"**, avec une architecture optimisée et un **tokenizer propriétaire** spécifiquement entraîné sur des corpus francophones.

* **Développeuse :** Clémence (Finisha)
* **Taille :** 1 Milliard de paramètres
* **Langue :** Français 🇫🇷
* **Statut :** Base Model (Pre-trained)

---

## 🚀 Caractéristiques Techniques

### 🏗️ Architecture & Tokenisation

* **Architecture :** Transformer decoder-only optimisé.
* **Tokenizer :** Custom French Tokenizer, conçu pour capturer les nuances morphologiques de la langue française et réduire la segmentation abusive des mots complexes.
* **Vocabulaire :** Optimisé pour maximiser l'efficacité du contexte en français.

### 🧠 Capacités Actuelles

Le modèle est actuellement en phase de **post-pré-entraînement**. Ses performances se concentrent sur :

* **Maîtrise Syntaxique :** Une excellente compréhension de la structure des phrases et de la grammaire française.
* **Fluidité :** Capacité à générer des séquences de mots cohérentes sur le plan structurel.
* **Connecteurs Logiques :** Utilisation de charnières linguistiques pour lier les concepts.

> **Note importante :** En tant que modèle de base non affiné, Lorias-v1 se concentre sur la structure. La cohérence sémantique profonde et la spécialisation aux instructions seront apportées lors des prochaines phases de **Fine-tuning (SFT)**.

---

## 📊 Performances & Comportement

Actuellement, Lorias-v1 montre une propension à générer des listes terminologiques reliées par des connecteurs inattendus. Ce comportement est typique d'un modèle de 1B qui a parfaitement assimilé la **forme** de la langue avant d'en stabiliser le **fond**.

| Aspect | Statut |
| --- | --- |
| **Syntaxe** | ✅ Excellent |
| **Orthographe** | ✅ Maîtrisé |
| **Sémantique** | 🔄 En cours (via futur Fine-tuning) |
| **Logique métier** | 📅 Prévu pour v1.1 |

---

## 🛠️ Utilisation (Roadmap)

1. **Phase 1 (Actuelle) :** Exploration de la structure linguistique et complétion de texte.
2. **Phase 2 (Prochainement) :** Fine-tuning supervisé (Instruct) pour aligner les réponses aux intentions des utilisateurs.
3. **Phase 3 :** Optimisation de la sémantique et réduction des hallucinations structurelles.

---

## 🤝 Contribuer & Contact

Le projet Lorias est en constante évolution. Si vous souhaitez échanger sur l'architecture ou les données d'entraînement :

* **Développeuse :** Clémence (Finisha)
* **Objectif :** Créer un écosystème de modèles performants et accessibles pour la communauté francophone.

---

**Fait avec ❤️ par Clémence.**