Aller au contenu principal
Zubnet AIApprendreWiki › SLM
Fondamentaux

SLM

Aussi appelé : Small Language Model, Petit modèle de langage
Un modèle de langage conçu pour l'efficacité, allant typiquement d'environ 100 millions à 15 milliards de paramètres. Les petits modèles de langage sont assez petits pour s'exécuter sur du matériel grand public comme un portable, un téléphone ou un seul GPU plutôt que sur une grappe de centre de données, troquant une part d'étendue et de puissance de raisonnement contre un coût faible, une latence faible et la capacité de fonctionner hors ligne et sur l'appareil.

Pourquoi c’est important

Les petits modèles de langage, c'est ainsi que l'IA s'intègre dans des produits qui ne peuvent pas se permettre une facture d'API par requête, un aller-retour infonuagique ou l'envoi des données d'utilisateurs à un tiers. Pour des travaux étroits et bien définis — classification, extraction, courts résumés, appel de fonctions — un petit modèle ajusté finement égale souvent un modèle de pointe à une fraction du coût et de la latence. Ils s'exécutent aussi là où sont les données, ce qui compte pour la confidentialité, la conformité et l'usage hors ligne.

En profondeur

L'étiquette couvre une cible mouvante, mais en pratique elle désigne des modèles d'environ 0,1 à 15 milliards de paramètres — tout ce que vous pouvez servir sur une station de travail, un téléphone ou un seul GPU modeste plutôt que sur une baie d'accélérateurs. Ce qui a fait des petits modèles de langage une catégorie digne d'un nom, c'est le virage qui a traversé 2024 et 2025, parfois résumé par « small is the new big » : au lieu de seulement monter en échelle, les laboratoires ont commencé à déverser des efforts pour rendre les petits modèles disproportionnellement capables. La série Phi de Microsoft, Gemma de Google, les plus petites tailles de Qwen d'Alibaba et les Ministral 3B et 8B de Mistral ont montré qu'un modèle au centième de la taille d'un grand modèle de langage de pointe pouvait quand même prendre en charge une part surprenante des charges de travail quotidiennes. Il en résulte un écosystème à deux paliers : des modèles géants pour les problèmes difficiles et ouverts, et de petits modèles pour tout le reste.

Comment les petits modèles sont devenus si capables

Trois techniques expliquent l'essentiel du bond. La première, c'est la qualité des données : la lignée Phi a démontré qu'un entraînement sur du matériel fortement filtré, de style manuel scolaire, enseigne plus par token à un petit modèle qu'un moissonnage web brut, et une bonne part de ce matériel est maintenant des données synthétiques rédigées par de plus gros modèles. La deuxième, c'est la distillation, où les sorties d'un gros modèle enseignant — et parfois ses distributions de probabilité complètes — deviennent les cibles d'entraînement, permettant à l'élève d'absorber un comportement qu'il ne pourrait jamais apprendre du texte seul. La troisième, c'est la même pile de post-entraînement que sur les modèles de pointe — ajustement par instructions et optimisation par préférences — qui est comparativement peu coûteuse à petite échelle mais améliore radicalement la sensation d'utilisabilité du modèle. Mises ensemble, ces techniques font qu'un modèle de 3 milliards bien entraîné surpasse aujourd'hui des modèles généralistes plusieurs fois plus gros d'il y a seulement quelques années.

La pile d'efficacité

Le nombre brut de paramètres n'est que la moitié de l'histoire; l'autre moitié, c'est l'outillage qui rend les petits modèles peu coûteux à exécuter. La quantification comprime les poids de la virgule flottante 16 bits vers une précision 8 bits ou même 4 bits avec une perte de qualité modeste, si bien qu'un modèle de 7 à 8 milliards rétrécit d'environ 16 Go de mémoire à quelque 4 ou 5 Go, et qu'un modèle de 3 milliards entre dans environ 2 Go. Des formats comme GGUF et des environnements d'exécution comme llama.cpp et Ollama ont transformé ça en une expérience à une seule commande sur des processeurs ordinaires, sans GPU requis. La même pile tourne sur des téléphones et des ordinateurs monocartes, et c'est ce qui rend les assistants sur appareil — y compris les petits modèles locaux derrière des fonctions comme Apple Intelligence — praticables plutôt que théoriques.

Là où les petits modèles gagnent leur vie

Le meilleur argument de production pour les petits modèles de langage, c'est le travail étroit à gros volume. Classification, extraction d'entités, routage, modération, résumé court et analyse structurée sont des tâches où un modèle de 1 à 8 milliards ajusté finement égale régulièrement un modèle de pointe sollicité par prompt, à un coût par requête qui peut être inférieur de plusieurs ordres de grandeur et avec des temps de réponse bien plus vifs. Une architecture courante est la cascade : un petit modèle traite les 80 à 90 % de trafic facile et n'escalade que les requêtes difficiles ou ambiguës vers un gros modèle, si bien que le modèle coûteux ne voit qu'une fraction de la charge.

Le second argument, c'est le placement : exécuter le modèle là où vivent les données. L'inférence sur appareil veut dire que les données de l'utilisateur ne quittent jamais le téléphone ou le réseau de l'entreprise, ce qui simplifie les revues de confidentialité et la conformité, et les fonctions continuent de marcher sans aucune connectivité. C'est le pari central de l'IA en périphérie : de l'intelligence intégrée dans l'appareil plutôt que louée à un centre de données. Un petit modèle ajusté finement est aussi un actif que l'équipe possède en propre — des poids sur disque, aucun changement de version silencieux, aucune facture par token qui grossit avec le succès.

Petit ne veut pas dire limité

L'idée fausse répandue, qui va dans les deux sens, c'est que la taille du modèle détermine son utilité. D'un côté, les petits modèles de langage modernes battent des modèles vedettes d'il y a seulement quelques années sur les bancs d'essai standards, donc les écarter comme des jouets est simplement dépassé. De l'autre, les limites sont réelles : un modèle de 3 milliards retient bien moins de connaissances du monde qu'un de 400 milliards, il est plus faible en raisonnement à plusieurs étapes et en suivi nuancé d'instructions, et il hallucine volontiers quand on le pousse au-delà de ce qu'il sait réellement. La règle pratique, c'est l'adéquation, pas la taille : si la tâche est étroite et que vous pouvez ajuster finement ou contraindre la sortie, un petit modèle de langage est habituellement le bon outil; si la tâche est ouverte et lourde en connaissances, il ne l'est pas.

← Tous les termes
ESC