SLM
Pourquoi c’est important
En profondeur
L'étiquette couvre une cible mouvante, mais en pratique elle désigne des modèles d'environ 0,1 à 15 milliards de paramètres — tout ce que vous pouvez servir sur une station de travail, un téléphone ou un seul GPU modeste plutôt que sur une baie d'accélérateurs. Ce qui a fait des petits modèles de langage une catégorie digne d'un nom, c'est le virage qui a traversé 2024 et 2025, parfois résumé par « small is the new big » : au lieu de seulement monter en échelle, les laboratoires ont commencé à déverser des efforts pour rendre les petits modèles disproportionnellement capables. La série Phi de Microsoft, Gemma de Google, les plus petites tailles de Qwen d'Alibaba et les Ministral 3B et 8B de Mistral ont montré qu'un modèle au centième de la taille d'un grand modèle de langage de pointe pouvait quand même prendre en charge une part surprenante des charges de travail quotidiennes. Il en résulte un écosystème à deux paliers : des modèles géants pour les problèmes difficiles et ouverts, et de petits modèles pour tout le reste.
Comment les petits modèles sont devenus si capables
Trois techniques expliquent l'essentiel du bond. La première, c'est la qualité des données : la lignée Phi a démontré qu'un entraînement sur du matériel fortement filtré, de style manuel scolaire, enseigne plus par token à un petit modèle qu'un moissonnage web brut, et une bonne part de ce matériel est maintenant des données synthétiques rédigées par de plus gros modèles. La deuxième, c'est la distillation, où les sorties d'un gros modèle enseignant — et parfois ses distributions de probabilité complètes — deviennent les cibles d'entraînement, permettant à l'élève d'absorber un comportement qu'il ne pourrait jamais apprendre du texte seul. La troisième, c'est la même pile de post-entraînement que sur les modèles de pointe — ajustement par instructions et optimisation par préférences — qui est comparativement peu coûteuse à petite échelle mais améliore radicalement la sensation d'utilisabilité du modèle. Mises ensemble, ces techniques font qu'un modèle de 3 milliards bien entraîné surpasse aujourd'hui des modèles généralistes plusieurs fois plus gros d'il y a seulement quelques années.
La pile d'efficacité
Le nombre brut de paramètres n'est que la moitié de l'histoire; l'autre moitié, c'est l'outillage qui rend les petits modèles peu coûteux à exécuter. La quantification comprime les poids de la virgule flottante 16 bits vers une précision 8 bits ou même 4 bits avec une perte de qualité modeste, si bien qu'un modèle de 7 à 8 milliards rétrécit d'environ 16 Go de mémoire à quelque 4 ou 5 Go, et qu'un modèle de 3 milliards entre dans environ 2 Go. Des formats comme GGUF et des environnements d'exécution comme llama.cpp et Ollama ont transformé ça en une expérience à une seule commande sur des processeurs ordinaires, sans GPU requis. La même pile tourne sur des téléphones et des ordinateurs monocartes, et c'est ce qui rend les assistants sur appareil — y compris les petits modèles locaux derrière des fonctions comme Apple Intelligence — praticables plutôt que théoriques.
Là où les petits modèles gagnent leur vie
Le meilleur argument de production pour les petits modèles de langage, c'est le travail étroit à gros volume. Classification, extraction d'entités, routage, modération, résumé court et analyse structurée sont des tâches où un modèle de 1 à 8 milliards ajusté finement égale régulièrement un modèle de pointe sollicité par prompt, à un coût par requête qui peut être inférieur de plusieurs ordres de grandeur et avec des temps de réponse bien plus vifs. Une architecture courante est la cascade : un petit modèle traite les 80 à 90 % de trafic facile et n'escalade que les requêtes difficiles ou ambiguës vers un gros modèle, si bien que le modèle coûteux ne voit qu'une fraction de la charge.
Le second argument, c'est le placement : exécuter le modèle là où vivent les données. L'inférence sur appareil veut dire que les données de l'utilisateur ne quittent jamais le téléphone ou le réseau de l'entreprise, ce qui simplifie les revues de confidentialité et la conformité, et les fonctions continuent de marcher sans aucune connectivité. C'est le pari central de l'IA en périphérie : de l'intelligence intégrée dans l'appareil plutôt que louée à un centre de données. Un petit modèle ajusté finement est aussi un actif que l'équipe possède en propre — des poids sur disque, aucun changement de version silencieux, aucune facture par token qui grossit avec le succès.
Petit ne veut pas dire limité
L'idée fausse répandue, qui va dans les deux sens, c'est que la taille du modèle détermine son utilité. D'un côté, les petits modèles de langage modernes battent des modèles vedettes d'il y a seulement quelques années sur les bancs d'essai standards, donc les écarter comme des jouets est simplement dépassé. De l'autre, les limites sont réelles : un modèle de 3 milliards retient bien moins de connaissances du monde qu'un de 400 milliards, il est plus faible en raisonnement à plusieurs étapes et en suivi nuancé d'instructions, et il hallucine volontiers quand on le pousse au-delà de ce qu'il sait réellement. La règle pratique, c'est l'adéquation, pas la taille : si la tâche est étroite et que vous pouvez ajuster finement ou contraindre la sortie, un petit modèle de langage est habituellement le bon outil; si la tâche est ouverte et lourde en connaissances, il ne l'est pas.