Pourquoi les réseaux de neurones ne multiplient pas : des perceptrons au SwiGLU
Les réseaux de neurones, malgré leur succès dans la génération de texte et d'images, ne réalisent pas fondamentalement la multiplication des données d'entrée. Dans un perceptron, les entrées subissent une combinaison linéaire : elles sont pondérées et additionnées. La formule d'un neurone de base est : $$h = \sigma(\sum w_i x_i + b)$$, où il n'y a pas de produit de deux variables $x_1 \cdot x_2$.
Pour une tâche comme le calcul du coût (prix × quantité), le réseau approxime le résultat en mémorisant des motifs mais ne calcule pas directement la multiplication. L'ajout de couches cachées préserve le principe : à chaque étape, seules des sommes de signaux pondérés sont impliquées.
Dans la première couche :
$$h_1^{(1)} = x_1 w_{11}^{(1)} + x_2 w_{12}^{(1)}$$
$$h_2^{(1)} = x_1 w_{21}^{(1)} + x_2 w_{22}^{(1)}$$
Dans la deuxième couche :
$$h_1^{(2)} = h_1^{(1)} w_{11}^{(2)} + h_2^{(1)} w_{12}^{(2)}$$
La substitution montre : $x_1$ et $x_2$ restent dans des sommes, leur produit n'apparaît pas. Les poids se multiplient entre les couches, mais pas les entrées.
Contournements : carrés et précalculs
Les ingénieurs ajoutent des valeurs pré-multipliées ($x_1 x_2$) ou des carrés à l'entrée pour simuler la multiplication. Une formule scolaire permet d'exprimer le produit :
$$x y = \frac{1}{2} \left( (x+y)^2 - x^2 - y^2 \right)$$
Cela réduit la multiplication à l'addition, la soustraction et la mise au carré. Une activation hypothétique $f(z) = z^2$ pourrait aider, mais les fonctions ReLU, Sigmoid et Tanh standard ne fournissent pas la non-linéarité du carré.
La pratique montre : de tels contournements fonctionnent pour des démonstrations, mais dans des tâches réelles avec de nombreuses entrées, ils nécessitent de connaître à l'avance les combinaisons nécessaires.
- Précalculs : Fournir $x_1 x_2$ comme entrée.
- Carrés : Utiliser $(x+y)^2$, $x^2$, $y^2$.
- Limitations : Ne s'adapte pas à grande échelle, compromet la propriété d'approximateur universel.
Percée des Transformers : le rôle des variantes GLU
L'architecture Transformer (2017) a introduit l'attention, mais une étape clé a été le remplacement des activations par des Unités Linéaires à Porte (GLU) en 2020 (Noam Shazeer, "GLU Variants Improve Transformer"). ReGLU, GEGLU et SwiGLU surpassent ReLU en convergence.
| Activation | Erreur |
|-----------|--------|
| ReLU | 2,45 |
| ReGLU | 2,32 |
| GEGLU | 2,25 |
| SwiGLU | 2,24 |
SwiGLU est préféré pour sa vitesse. La formule :
$$\text{SwiGLU}(x) = \text{Swish}(x W + b) \odot (x V + c)$$
Ici $\odot$ est la multiplication élément par élément de deux projections. Cela introduit des dépendances quadratiques, permettant de modéliser $x_1 x_2$ sans contournements. SwiGLU est utilisé dans les blocs FFN des LLM modernes.
Mécanisme :
- L'entrée $x$ est projetée en deux chemins : $xW + b$ et $xV + c$.
- Le premier passe par Swish ($\text{Swish}(z) = z \sigma(\beta z)$).
- Multiplication élément par élément.
Implications pratiques pour les modèles
SwiGLU améliore l'entraînement mais ne fait pas de l'IA un calculateur précis. Les modèles génératifs sont probabilistes : "2×2=4" est un jeton probable, pas une déduction. Pour des calculs complexes, les LLM délèguent à du code Python dans un bac à sable.
- Avantages des GLU : Meilleure convergence, modélisation des non-linéarités.
- Inconvénients : Le réseau ne trouve pas toujours automatiquement les poids nécessaires.
- Nécessite de grandes quantités de données.
- La nature probabiliste persiste.
Les intégrations futures (WebAssembly dans Transformer) permettront d'exécuter du code natif dans le modèle.
Points clés à retenir
- Les perceptrons classiques additionnent mais ne multiplient pas les entrées.
- GLU (SwiGLU) introduit la multiplication élément par élément des projections pour des dépendances quadratiques.
- Les unités à portes remplacent ReLU dans les transformers modernes, réduisant l'erreur de 5 à 10 %.
- Pour des calculs précis, les LLM utilisent des outils externes.
— Editorial Team
Aucun commentaire pour le moment.